Introducción a los
modelos grandes de
lenguaje | LLM
Análisis y estudio de los diferentes modelos
© Sothis. All Rights Reserved.
Contenido
1. Introducción
2. Marco histórico
3. Arquitectura de LLMs
4. Técnicas de pre-training y fine-tuning
5. Atributos, carácteristicas y parámetros de LLMs
6. Análisis de LLMs
© Sothis. All Rights Reserved. 2
1. Introducción
¿Qué es un LLM?
Los grandes modelos lingüísticos (LLM) son un tipo de modelos de aprendizaje profundo diseñados específicamente para comprender,
generar y manipular el lenguaje humano cuya arquitectura interna está basada en técnicas de deep learning (NN). Estos modelos han
alcanzado un rendimiento puntero en diversas tareas de procesamiento del lenguaje natural (NLP) y han tenido un gran impacto en el
campo de la inteligencia artificial.
¿Qué tareas pueden desarrollar?
Como tareas principales a destacar:
• Respuestas a preguntas
• Generación de texto
• Resumen de texto
• Traducción
• Escritura creativa
• Análisis de sentimiento
• …
© Sothis. All Rights Reserved. 3
2. Marco histórico
Los grandes modelos lingüísticos (LLM) se han desarrollado a lo largo de los años como resultado de los
avances en el procesamiento del lenguaje natural (NLP), el aprendizaje automático y los recursos
informáticos.
Modelos de redes “Attention is All You
Uno de los primeros Need”, con este lema, se
neuronales (RNN) que
chatbots, asentando las introdujo la arquitectura
aparecieron como
bases de los futuros transformer (mecanismos
alternativa a los
sistemas de IA de auto-atención)
modelos estadísticos
Transformers
LSTM (1997-2014)
(Actualidad)
Eliza (1964-1966) SLM (1980-2000) NLM (2003-2013)
Modelos estadísticos
A raíz de solucionar el
capaces de predecir la
problema del gradiente
probabilidad de una
de fuga de las RNN,
palabra basándose en
aparecieron las LSTM
las precedentes
© Sothis. All Rights Reserved. 4
3. Arquitectura de LLMs
Los grandes modelos lingüísticos (LLM) se basan principalmente en la arquitectura Transformer, que se ha convertido en la base de
varios modelos de procesamiento del lenguaje natural (NLP) de última generación.
¿En que consiste la arquitectura Transformer?
La arquitectura transformadora es una innovadora arquitectura de red neuronal diseñada para tareas de procesamiento del lenguaje
natural (NLP). La arquitectura se basa en el mecanismo de autoatención para procesar y generar secuencias, lo que la hace muy eficiente
y escalable en comparación con las redes neuronales recurrentes (RNN) tradicionales y los modelos de memoria a largo plazo (LSTM).
¿Qué es el mecanismo de autoatención?
El mecanismo de autoatención es un componente clave de la
arquitectura del transformador que permite al modelo ponderar
la importancia de cada token (ítem) con respecto a otros en una
secuencia. Permite al modelo captar dependencias y relaciones
de largo alcance entre los tokens sin depender de capas
recurrentes o convolucionales. Este mecanismo es especialmente
adecuado para tareas de procesamiento del lenguaje natural, ya
que ayuda al modelo a comprender el contexto y la estructura de
la secuencia de entrada.
© Sothis. All Rights Reserved. 5
4. Técnicas de pre-training y fine-tuning
Los grandes modelos lingüísticos (LLM) suelen entrenarse mediante un proceso de dos pasos: preentrenamiento y ajuste. Este método
permite que los modelos aprendan capacidades generales de comprensión lingüística durante el preentrenamiento y se adapten a
tareas específicas durante el ajuste.
¿En que consiste el pre-training?
En la fase de preentrenamiento, el LLM se entrena en un conjunto de datos no supervisados a gran escala, como una colección de
páginas web o libros. El objetivo es aprender características, representaciones y patrones lingüísticos generales a partir de estos datos.
Dos tareas comunes de preentrenamiento son:
• Modelado del lenguaje enmascarado (MLM): En esta tarea, se enmascara aleatoriamente un determinado porcentaje de los tokens
de entrada, y el modelo se entrena para predecir los tokens enmascarados basándose en el contexto.
• Modelado causal del lenguaje (CLM): También conocido como modelado autorregresivo del lenguaje, consiste en entrenar el
Modelado
modelo para predecir de lenguaje
el siguiente token de la secuencia a partir de los tokens anteriores.
enmascarado Modelado autorregresivo del lenguaje
© Sothis. All Rights Reserved. 6
4. Técnicas de pre-training y fine-tuning
¿En que consiste el fine-tuning?
Tras la fase de pre-training, el LLM se perfecciona en un conjunto de datos etiquetados más pequeño y específico de la tarea/dominio.
Todo ello mediante técnicas de aprendizaje supervisado para adaptar el modelo a la tarea objetivo. El ajuste puede realizarse mediante
uno de los siguientes métodos: enfoque basado en características, ajuste fino de todo el modelo y adaptadores.
Otro método de fine-tuning a destacar es el RLHF, que consiste en el perfeccionamiento de los LLM mediante el aprendizaje por refuerzo
a partir de la retroalimentación humana. Este enfoque permite al modelo aprender de las preferencias humanas, mejorando su
rendimiento en tareas o dominios específicos. Proceso Fine-tuning
RLHF
© Sothis. All Rights Reserved. 7
5. Atributos, características y parámetros de LLMs
- Parámetros: aquellos valores que se ajustan durante el
entrenamiento. A mayor cantidad de parámetros, mayor
capacidad de aprendizaje del modelo.
- Tokens entrenados: unidades mínimas de información que
el modelo utiliza para su entrenamiento.
- Arquitectura: existen diferentes tipos basándonos en la
arquitectura del modelo, como pueden ser transformer,
RNN, etc.
- Dominio: conjunto de ámbitos o temas con los cuales ha
sido entrenado el modelo.
- Funciones: para qué se utiliza ese modelo (generación
texto, traducción, ...).
- Corpus y datasets de entrenamiento: número de
palabras/datos que componen la base de entrenamiento del
modelo además de su procedencia (Q&A, webscraping,
libros, …).
- Open source: si se puede utilizar utilizar su código fuente
sin ningún tipo de coste.
© Sothis. All Rights Reserved. 8
6. Análisis de LLMs
Clasificación según parámetros del modelo (actualizado Marzo-2023)
Link:
[Link]
© Sothis. All Rights Reserved. 9
6. Análisis de LLMs
Clasificación de las organizaciones y de los tipos de training datasets
Link: [Link]
© Sothis. All Rights Reserved. 10
6. Análisis de LLMs
Modelos más actuales: principales atributos
Organization Model Name Parameters Tokens Architecture Type Public
RedPajama Incite 3B, 7B 800B, 1000B Transformer General Yes
ConceptoFMind PaLM 1B - Transformer General Yes
BigCode StarCoder 15.5B 1000B Transformer Code No
Openlm-research OpenLLaMA 7B 200B Transformer General Yes
MosaicML MPT 1B, 7B 1000B Transformer General Yes
Stability AI StableLM 3B, 7B, 15B, 30B, 65B 1500B Transformer General Yes
NVIDIA GPT-2B-001 2B 1100B Transformer General Yes
GeoV GeoV 9B 70B Transformer General Yes
Cerebras Cerebras-GPT 1.3B, 2.7B, 6.7B, 13B 1.47M Transformer General Yes
Anthropic Claude - - Transformer General No
OpenAI GPT-4 1000B 20.000B Transformer General Yes
Together GPT-JT-Moderation 6B - Transformer Moderation Yes
Together GPT-NeoXT-Chat-Base 20B 43M Transformer Instruction Yes
AI21 Jurassic-2 7.5B, 17B, 178B - Transformer General No
Meta LLaMA 7B, 13B, 33B, 65B 1000B Transformer General Yes
BlinkDL RWKV 1B, 3B, 7B, 14B 15G RNN General Yes
EleutherAI Pythia 1B, 1.4B, 2.8B, 6.9B, 12B 300B Transformer General Yes
BigCode Santacoder 1.1B 236B Transformer Code Yes
Stanford BioMedLM 2.7B 300B Transformer Academic (Bio) Yes
Databricks Dolly 2.0 12B 300B Transformer General Yes
LAION OpenFlamingo 9B 1000B Transformer General Yes
Berkeley Koala13-B 13B - Transformer General Yes
Google - DeepMind Med-PaLM 2 540B - Transformer Medical No
Stanford Alpaca 7B 1000B Transformer Instruction Yes
BloombergGPT Bloomberg 50B 569B Transformer Financial Yes
Link:
[Link]
© Sothis. All Rights Reserved. 11
6. Análisis de LLMs
Evaluación y clasificación
El paquete LM-eval, publicado por EleutherAI, una comunidad de investigadores que trabajan para hacer posible la investigación de la
IA de código abierto, ofrece uno de estos frameworks para la evaluación LLM.
A continuación algunos datasets para evaluar LLM:
LAMBADA Predicción de la ultima palabra basándose en el contexto global.
HellaSwag Evalúa la comprensión de la causalidad y el sentido común en el lenguaje natural.
CoQA Se mide la capacidad de las máquinas para comprender un fragmento de texto y responder a una serie de preguntas
interconectadas que aparecen en una conversación.
WinoGrande Se evalúa la capacidad del modelo para entender el contexto de la oración mediante la elección de un pronombre
ambiguo.
PIQA Se evalúa la capacidad de los modelos para inferir el conocimiento y el sentido común a diferentes situaciones expuestas
mediante la respuesta a preguntas.
© Sothis. All Rights Reserved. 12
6. Análisis de LLMs
Modelos más actuales: evaluación y clasificación
Model Organization LAMBADA(ppl) LAMBADA (acc) HellaSwa (acc_norm) WinoGrande (acc) PIQA (acc) CoQA (f1) AVG
llama_65B_q4 Meta AI 2.76 78.50% 83.90% 76.60% 81.40% 83.20% 80.70%
llama_30B_q8 Meta AI 2.853 77.70% 82.70% 76.30% 80.30% 80.40% 79.50%
llama_30B_q4 Meta AI 2.877 77.50% 82.40% 75.70% 80.20% 80.20% 79.20%
text-davinci-003 OpenAI 3.0489 70.75% 83.33% 75.53% 83.19% 75.89% 77.74%
llama_13B_q8 Meta AI 3.178 76.50% 79.10% 73.20% 79.10% 77.10% 77.00%
llama_13B_q4 Meta AI 3.13 77.10% 78.60% 72.20% 78.30% 77.80% 76.80%
flan_t5_xxl_q8 Google AI 3.049 77.80% 72.10% 75.10% 77.80% 73.10% 75.20%
llama_7B Meta AI 3.463 73.60% 76.20% 70.40% 78.10% 75.40% 74.70%
llama_7B_q8 Meta AI 3.453 73.70% 76.10% 70.20% 78.00% 75.50% 74.70%
llama_7B_q4 Meta AI 3.549 73.20% 75.50% 70.40% 78.00% 74.70% 74.40%
flan_t5_xxl_q4 Google AI 3.01 77.70% 71.50% 73.40% 77.60% 71.80% 74.40%
opt_66B_q4 Meta AI 3.308 73.40% 74.40% 68.40% 78.50% 75.00% 73.90%
opt_30B_q8 Meta AI 3.628 71.60% 72.30% 68.20% 77.70% 71.40% 72.30%
gptneox_20B_q8 EleutherAI 3.659 72.60% 71.30% 65.80% 77.30% 72.90% 72.00%
gptneox_20B EleutherAI 3.657 72.60% 71.40% 65.50% 77.50% 73.30% 72.00%
fairseq_gpt_13B_bf4 Meta AI 3.646 71.20% 72.50% 67.60% 77.40% 70.60% 71.90%
fairseq_gpt_13B Meta AI 3.567 71.90% 72.70% 67.50% 77.60% 70.10% 71.90%
fairseq_gpt_13B_bf8 Meta AI 3.565 71.80% 72.70% 67.20% 77.70% 70.00% 71.90%
opt_30B_q4 Meta AI 3.656 71.50% 72.10% 68.00% 77.40% 69.90% 71.80%
gptneox_20B_q4 EleutherAI 3.711 72.00% 69.30% 64.80% 76.70% 70.80% 70.70%
© Sothis. All Rights Reserved. 13
© Sothis. All Rights Reserved.