Unidad 1.
Fundamentos de
Inteligencia Artificial.
Introducción a los LLM
Todos los derechos reservados ®
Introducción a los LLM (Grandes Modelos de Lenguaje)
Qué son los LLM´s
Los grandes modelos de lenguaje (Large Language Model, LLM) son un tipo de
inteligencia artificial diseñado para procesar, entender y generar texto natural.
Estos modelos han transformado el panorama de la inteligencia artificial,
encontrando aplicaciones en traducción automática, generación de contenido,
asistencia en investigación y muchas otras áreas. Ejemplos destacados de LLM
incluyen GPT (Generative Pre-trained Transformer), desarrollado por OpenAI, y BERT
(Bidirectional Encoder Representations from Transformers), desarrollado por
Google, o los modelos Granite, lanzados por IBM.
Los LLM se basan en redes neuronales profundas, especialmente en arquitecturas
de transformadores introducidas por Vaswani et al. (2017) de Google, en su
influyente artículo "Attention Is All You Need". Este enfoque marcó un cambio
fundamental en la forma de procesar el lenguaje natural, al reemplazar
arquitecturas anteriores como las redes neuronales recurrentes (RNN) y las redes
de memoria a largo plazo (LSTM). Los transformadores utilizan un mecanismo
llamado "self-attention" o autoatención, que permite al modelo asignar pesos
diferentes a las palabras o tokens dentro de una secuencia dependiendo de su
relevancia para el contexto.
Por ejemplo, al procesar una frase como "El gato que estaba en el tejado saltó al
suelo", el mecanismo de atención permite al modelo identificar que "gato" está
relacionado directamente con "saltó". Esta capacidad de analizar relaciones entre
palabras, incluso si están separadas por otras, es esencial para comprender el
significado profundo del texto.
El uso de transformadores también permite un procesamiento paralelo mucho más
eficiente en comparación con las RNN, que procesaban las palabras de manera
secuencial. Esto mejora significativamente la velocidad y escalabilidad del
entrenamiento, permitiendo el uso de enormes conjuntos de datos textuales. Estas
redes funcionan identificando patrones y relaciones en estos datos masivos, como
reglas gramaticales, asociaciones semánticas y estructuras sintácticas. Como
resultado, los LLM pueden realizar tareas relacionadas con el lenguaje con un nivel
de precisión sin precedentes, desde la traducción de textos hasta la generación de
texto coherente.
Según IBM, los LLM son una categoría de “modelos fundamentales” entrenados con
grandes volúmenes de datos para ofrecer capacidades esenciales que permiten
abordar múltiples casos prácticos y aplicaciones, además de resolver una amplia
variedad de tareas. Esto supone una ventaja frente al enfoque de desarrollar y
entrenar modelos específicos para cada caso, un método que resulta costoso,
2
demanda una infraestructura considerable, limita las sinergias y, en algunos casos,
puede derivar en un rendimiento menos eficiente. Esto es posible gracias a los
miles de millones de parámetros que les permiten identificar patrones complejos
en el lenguaje y llevar a cabo una amplia gama de tareas lingüísticas. Los LLM están
transformando numerosos campos, desde chatbots y asistentes virtuales hasta la
generación de contenido, el apoyo a la investigación y la traducción de idiomas.
Cómo funciona un LLM
Para guiar nuestra explicación, utilizaremos un enfoque inspirado en Transformer
Explainer, una herramienta descrita por Cho et al. (2024) que facilita la
comprensión de estos conceptos desde una perspectiva clara y estructurada. Te
animo a que visites la página y puedas interaccionar él.
Gráfico 1. Transformer explainer. Fuente: Cho et al. (2024)
Accede: [Link]
Tokenización y preprocesamiento. El texto de entrada se divide en fragmentos más
pequeños llamados tokens. Dependiendo del modelo, los tokens pueden ser
palabras completas, subpalabras o caracteres. Por ejemplo, la palabra
"inteligencia" podría tokenizarse como ["inte", "ligencia"].
Este proceso asegura que el modelo pueda manejar idiomas complejos, palabras
compuestas y errores tipográficos, permitiendo un análisis más detallado del texto.
Vamos a ver un ejemplo con el “tokenizer de OpenAI” En nuestro caso, el texto
“bienvenidos a esta microcredencial” ha quedado representada en 8 tokens.
Puedes visitar el “tokenizer” y probar con tus propios textos.
3
Imagen 1. Tokenizer de OpenAI. Fuente: [Link]
Imagen 2. Ejemplo de tokens con GPT-4o Tokenizer de OpenAI. Fuente:
[Link]
Entradas y embeddings. Cada token generado se convierte en una representación
matemática llamada “embedding”. Este embedding captura el significado
contextual de las palabras, lo que permite al modelo comprender su semántica,
incluso en casos de ambigüedad.
Por ejemplo, la palabra "banco" podría interpretarse como una institución
financiera o un asiento, dependiendo del contexto de la frase. Los embeddings son
generados por capas de redes neuronales que transforman las palabras en vectores
de alta dimensión. Estas representaciones facilitan el cálculo de relaciones
semánticas y sintácticas entre los tokens. En nuestro caso, el texto “bienvenidos a
4
esta microcredencial” ha quedado representada en estos Token IDs: [53562, 1066,
5965, 261, 6476, 10499, 20295, 15704], tal como puedes ver en la imagen 3.
Imagen 3. Ejemplo de embedding con GPT-4o Tokenizer de OpenAI. Fuente:
[Link]
Atención (Attention). Los modelos de transformadores utilizan un mecanismo de
atención para identificar las palabras más relevantes dentro de un contexto.
La atención en los LLM es una forma de medir cuánta importancia tiene cada
palabra (o token) en una secuencia respecto a las demás. En lugar de procesar
todas las palabras de manera uniforme, el mecanismo de atención permite al
modelo identificar que palabras tienen mayor relevancia en un contexto específico.
La base de los mecanismos de atención es el “Scaled Dot-Product Attention”, que
funciona mediante tres elementos clave:
• Queries (Q): Representan el vector de consulta (lo que estamos buscando).
• Keys (K): Representan las características de las palabras de la secuencia
(posibles referencias).
• Values (V): Contienen la información que se devuelve al modelo si una clave
coincide con la consulta.
Cada palabra en una secuencia se representa como un vector que puede actuar
como Q, K y V. El proceso de atención se realiza en estos pasos principales:
Cálculo de similitud entre Query y Keys: Para cada token, se calcula una puntuación
que mide cómo de relevantes son las otras palabras respecto al token actual. Esto
se hace con el producto punto entre los vectores de la consulta (Q) y las claves (K).
5
El resultado se escala dividiéndolo por la raíz cuadrada de la dimensión de los
vectores para evitar valores extremos.
1) Aplicación de softmax: Los puntajes se normalizan usando una función
softmax, lo que convierte estos valores en probabilidades que suman 1. Esto
permite identificar qué palabras recibirán más "atención".
2) Ponderación por los valores: Cada token en la secuencia final se calcula
como una combinación ponderada de los valores (V) según las
probabilidades obtenidas.
Capas de Transformador. El núcleo del modelo son las capas de transformador, que
constan de dos subcomponentes principales, la auto atención (self-attention) y las
redes neuronales completamente conectadas.
Estas capas trabajan juntas para analizar el contexto y las relaciones entre los
tokens, permitiendo que el modelo entienda tanto significados literales como
abstractos, como la ironía o las figuras retóricas. Cuantas más capas tenga el
modelo, mayor será su capacidad para procesar el lenguaje de forma profunda y
precisa.
Normalización y feedforward. Cada capa de transformador incluye pasos de
normalización que mantienen la estabilidad numérica y evitan errores durante los
cálculos. También integra capas feedforward que refinan las representaciones de
los datos. Estas operaciones permiten que el modelo genere predicciones más
consistentes y coherentes al optimizar las representaciones en cada capa.
Salida y Decodificación. Una vez que las entradas han pasado por todas las capas
del modelo, se genera una distribución de probabilidad sobre las posibles palabras
siguientes. Por ejemplo, si se proporciona la frase "La capital de Francia es", el
modelo asignará una alta probabilidad a "París". La decodificación puede realizarse
mediante técnicas como el muestreo de temperatura o la búsqueda de haz (beam
search), que mejoran la fluidez y coherencia del texto generado.
Cómo se entrenan los LLM
Entrenar un LLM es un proceso intensivo que requiere enormes cantidades de datos
y potencia computacional. A continuación, se describe el proceso en detalle:
• Recolección de datos. Los datos provienen de libros, artículos, sitios web y otros
recursos textuales públicos. Por ejemplo, OpenAI entrenó modelos como GPT-
3 utilizando una combinación de datos públicos y fuentes especializadas,
asegurándose de que incluyeran una amplia variedad de lenguajes y estilos.
• Preprocesamiento de datos. El texto se limpia para eliminar ruido (como errores
tipográficos o caracteres extraños), se tokeniza (dividiéndolo en palabras o
símbolos) y se convierte en embeddings para ser interpretado por el modelo.
6
• Entrenamiento inicial: El modelo aprende a predecir la siguiente palabra o
completar frases, basándose en el contexto. Por ejemplo, si el modelo ve la frase
"La capital de Francia es", debería predecir "París" como la palabra siguiente.
• Ajuste fino (Fine-tuning): Posteriormente, se entrena el modelo en datos
específicos para tareas concretas, mejorando su rendimiento en aplicaciones
particulares. Por ejemplo, un modelo ajustado para atención al cliente podría
entrenarse con transcripciones de chat de soporte técnico.
• Evaluación y refinamiento: Se mide la precisión del modelo y se realizan ajustes
para minimizar errores como sesgos o respuestas incoherentes. Por ejemplo,
OpenAI ha implementado técnicas de retroalimentación humana (RLHF,
Reinforcement Learning with Human Feedback) para mejorar las respuestas de
ChatGPT.
Riesgos principales asociados con los LLM
Aunque los LLM son herramientas poderosas, presentan riesgos importantes que
deben considerarse y mitigarse adecuadamente:
• Sesgos en las respuestas. Los modelos pueden reflejar y amplificar los sesgos
presentes en los datos de entrenamiento. Por ejemplo, un modelo entrenado en
datos con predominio de autores masculinos podría subrepresentar
perspectivas femeninas (Bolukbasi et al., 2016)
• Desinformación. Los LLM pueden generar información falsa o engañosa. La
desinformación en este contexto se refiere a la generación de contenido falso,
incorrecto o engañoso que parece ser verdadero. Esto puede incluir datos
inventados, interpretaciones erróneas de información o propagación de
narrativas falsas o sesgadas. La desinformación puede provenir de un
entrenamiento basado en datos imperfectos, de la ausencia de razonamiento
"crítico", de sesgos hacia la fluidez por parte de los modelos o la dependencia
del contexto del usuario. No solemos referir a ellas como “alucinaciones” del
modelo. IBM explica que la alucinación en IA es “un fenómeno en el que un
modelo de lenguaje de gran tamaño (LLM), a menudo un chatbot de IA
generativa o una herramienta de computer vision, percibe patrones u objetos
que son inexistentes o imperceptibles para los observadores humanos, creando
outputs que no tienen sentido o son completamente inexactos. En el caso de la
IA, estas interpretaciones erróneas se producen debido a varios factores, como
el sobreajuste, el sesgo/inexactitud de los datos de entrenamiento y la alta
complejidad del modelo.”
• Uso malintencionado. Los LLM pueden ser utilizados para crear spam, estafas,
desinformación masiva o incluso discursos de odio.
7
• Privacidad. Existe el riesgo de que los modelos expongan información sensible
presente en los datos de entrenamiento. Por ejemplo, investigadores han
demostrado que ciertos LLM pueden memorizar y revelar números de tarjetas
de crédito que estaban presentes en sus datos de entrenamiento (Yao, 2024)
• Dependencia excesiva. Las organizaciones y las personas podrían depender
demasiado de los LLM, descuidando el juicio humano y las comprobaciones
críticas. Esto puede llevar a decisiones erróneas en ámbitos críticos como la
medicina o el derecho.
Referencias
Bolukbasi, T., Chang, K. W., Zou, J. Y., Saligrama, V., & Kalai, A. T. (2016). Man is to
computer programmer as woman is to homemaker? debiasing word embeddings.
Advances in neural information processing systems, 29.
Cho, A., Kim, G. C., Karpekov, A., Helbling, A., Wang, Z. J., Lee, S., ... & Chau, D. H.
(2024). Transformer Explainer: Interactive Learning of Text-Generative Models.
arXiv preprint arXiv:2408.04619.
Vaswani, A. (2017). Attention is all you need. Advances in Neural Information
Processing Systems.
Yao, Y., Duan, J., Xu, K., Cai, Y., Sun, Z., & Zhang, Y. (2024). A survey on large language
model (llm) security and privacy: The good, the bad, and the ugly. High-Confidence
Computing, 100211.