Fondements des Transformers et LLMs
Fondements des Transformers et LLMs
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 1 / 28
Sommaire
3 Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 2 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance
Un modèle de langage est une distribution de probabilité définie sur les séquences de mots (w1 , w2 , . . . , wT ), avec wt appartenant à
un vocabulaire fini V .
Objectif : apprendre la distribution conjointe
P(w1 , w2 , . . . , wT )
à partir d’un corpus de textes, afin de modéliser les régularités syntaxiques, sémantiques ou pragmatiques de la langue.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 3 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance
Un modèle de langage est une distribution de probabilité définie sur les séquences de mots (w1 , w2 , . . . , wT ), avec wt appartenant à
un vocabulaire fini V .
Objectif : apprendre la distribution conjointe
P(w1 , w2 , . . . , wT )
à partir d’un corpus de textes, afin de modéliser les régularités syntaxiques, sémantiques ou pragmatiques de la langue.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 3 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance
Un modèle de langage est une distribution de probabilité définie sur les séquences de mots (w1 , w2 , . . . , wT ), avec wt appartenant à
un vocabulaire fini V .
Objectif : apprendre la distribution conjointe
P(w1 , w2 , . . . , wT )
à partir d’un corpus de textes, afin de modéliser les régularités syntaxiques, sémantiques ou pragmatiques de la langue.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 3 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance
count(je) = 2, count(suis) = 2
2 1
P(suis | je) = = 1, P(content | suis) =
2 2
Les modèles neuronaux généralisent ce mécanisme en apprenant les probabilités via des paramètres optimisés.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 4 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance
count(je) = 2, count(suis) = 2
2 1
P(suis | je) = = 1, P(content | suis) =
2 2
Les modèles neuronaux généralisent ce mécanisme en apprenant les probabilités via des paramètres optimisés.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 4 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance
count(je) = 2, count(suis) = 2
2 1
P(suis | je) = = 1, P(content | suis) =
2 2
Les modèles neuronaux généralisent ce mécanisme en apprenant les probabilités via des paramètres optimisés.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 4 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance
count(je) = 2, count(suis) = 2
2 1
P(suis | je) = = 1, P(content | suis) =
2 2
Les modèles neuronaux généralisent ce mécanisme en apprenant les probabilités via des paramètres optimisés.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 4 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance
T
L (θ) = ∏ Pθ (wt | w1 , . . . , wt−1 )
t=1
T
J (θ) = − ∑ log Pθ (wt | w1 , . . . , wt−1 )
t=1
Cette fonction est utilisée dans les algorithmes d’apprentissage (descente de gradient stochastique).
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 5 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance
T
L (θ) = ∏ Pθ (wt | w1 , . . . , wt−1 )
t=1
T
J (θ) = − ∑ log Pθ (wt | w1 , . . . , wt−1 )
t=1
Cette fonction est utilisée dans les algorithmes d’apprentissage (descente de gradient stochastique).
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 5 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance
T
L (θ) = ∏ Pθ (wt | w1 , . . . , wt−1 )
t=1
T
J (θ) = − ∑ log Pθ (wt | w1 , . . . , wt−1 )
t=1
Cette fonction est utilisée dans les algorithmes d’apprentissage (descente de gradient stochastique).
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 5 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance
Résumé visuel
w1 w2 w3 ... wT-1
NN NN NN NN
Figure – Architecture d’un modèle de langage probabiliste basé sur réseau neuronal.
Les probabilités sont estimées par un réseau neuronal (RNN, Transformer, etc.)
L’entraînement se fait par maximisation de la vraisemblance
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 6 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance
Problème de la Tokenisation
Dans les LLMs, le texte est converti en unités élémentaires : les tokens.
Un token peut être un mot, une syllabe, un caractère ou une sous-unité morphologique.
Objectifs :
▶ Réduire la taille du vocabulaire.
▶ Gérer les mots inconnus ou rares (Out-of-Vocabulary ).
▶ Maximiser la réutilisabilité statistique des morceaux.
Problème : Comment découper un texte efficacement tout en gardant une expressivité linguistique et une efficacité computationnelle ?
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 7 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance
Problème de la Tokenisation
Dans les LLMs, le texte est converti en unités élémentaires : les tokens.
Un token peut être un mot, une syllabe, un caractère ou une sous-unité morphologique.
Objectifs :
▶ Réduire la taille du vocabulaire.
▶ Gérer les mots inconnus ou rares (Out-of-Vocabulary ).
▶ Maximiser la réutilisabilité statistique des morceaux.
Problème : Comment découper un texte efficacement tout en gardant une expressivité linguistique et une efficacité computationnelle ?
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 7 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 8 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 8 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)
Méthode initialement conçue pour la compression de texte (Gage, 1994), adaptée au traitement automatique des langues par
Sennrich et al. (2016).
But : apprendre un vocabulaire de sous-mots (subwords) à partir d’un corpus en découpant ou fusionnant les mots selon des motifs
statistiques.
Idée clé : fusionner les paires de symboles les plus fréquentes dans le corpus pour construire des unités plus longues.
Algorithme BPE formalisé :
1 Initialiser un vocabulaire de symboles V0 (souvent les caractères individuels).
2 À chaque itération t , repérer la paire de symboles adjacents (a, b) la plus fréquente dans le corpus C(t) :
3 Ajouter le nouveau symbole ab à Vt , et remplacer toutes les occurrences de a b par ab dans C(t) pour obtenir C(t+1) .
4 Répéter jusqu’à atteindre un vocabulaire de taille |V | prédéfini.
Exemple (toy) :
l o w l o w e r n e w e s t w i d e s t
▶ Étape 1 : compter les paires fréquentes ⇒ (l,o), (o,w), (e,s), etc.
▶ Étape 2 : fusionner la paire la plus fréquente, disons l o → lo
▶ Corpus devient : lo w lo w e r n e w e s t w i d e s t
Remarque : BPE est rapide, déterministe et non probabiliste, mais peut générer des unités fréquentes pertinentes même pour des mots
inconnus (OOV).
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 9 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)
Méthode initialement conçue pour la compression de texte (Gage, 1994), adaptée au traitement automatique des langues par
Sennrich et al. (2016).
But : apprendre un vocabulaire de sous-mots (subwords) à partir d’un corpus en découpant ou fusionnant les mots selon des motifs
statistiques.
Idée clé : fusionner les paires de symboles les plus fréquentes dans le corpus pour construire des unités plus longues.
Algorithme BPE formalisé :
1 Initialiser un vocabulaire de symboles V0 (souvent les caractères individuels).
2 À chaque itération t , repérer la paire de symboles adjacents (a, b) la plus fréquente dans le corpus C(t) :
3 Ajouter le nouveau symbole ab à Vt , et remplacer toutes les occurrences de a b par ab dans C(t) pour obtenir C(t+1) .
4 Répéter jusqu’à atteindre un vocabulaire de taille |V | prédéfini.
Exemple (toy) :
l o w l o w e r n e w e s t w i d e s t
▶ Étape 1 : compter les paires fréquentes ⇒ (l,o), (o,w), (e,s), etc.
▶ Étape 2 : fusionner la paire la plus fréquente, disons l o → lo
▶ Corpus devient : lo w lo w e r n e w e s t w i d e s t
Remarque : BPE est rapide, déterministe et non probabiliste, mais peut générer des unités fréquentes pertinentes même pour des mots
inconnus (OOV).
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 9 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)
Méthode initialement conçue pour la compression de texte (Gage, 1994), adaptée au traitement automatique des langues par
Sennrich et al. (2016).
But : apprendre un vocabulaire de sous-mots (subwords) à partir d’un corpus en découpant ou fusionnant les mots selon des motifs
statistiques.
Idée clé : fusionner les paires de symboles les plus fréquentes dans le corpus pour construire des unités plus longues.
Algorithme BPE formalisé :
1 Initialiser un vocabulaire de symboles V0 (souvent les caractères individuels).
2 À chaque itération t , repérer la paire de symboles adjacents (a, b) la plus fréquente dans le corpus C(t) :
3 Ajouter le nouveau symbole ab à Vt , et remplacer toutes les occurrences de a b par ab dans C(t) pour obtenir C(t+1) .
4 Répéter jusqu’à atteindre un vocabulaire de taille |V | prédéfini.
Exemple (toy) :
l o w l o w e r n e w e s t w i d e s t
▶ Étape 1 : compter les paires fréquentes ⇒ (l,o), (o,w), (e,s), etc.
▶ Étape 2 : fusionner la paire la plus fréquente, disons l o → lo
▶ Corpus devient : lo w lo w e r n e w e s t w i d e s t
Remarque : BPE est rapide, déterministe et non probabiliste, mais peut générer des unités fréquentes pertinentes même pour des mots
inconnus (OOV).
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 9 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)
w = t1 t2 . . .tk , où ti ∈ V
On cherche à maximiser :
L (V ) = ∑ log P(t1 , . . . ,tk )
w∈C
Typiquement, on utilise une modélisation de type unigramme :
k
P(t1 , . . . ,tk ) = ∏ P(ti )
i=1
Algorithme :
1 Initialiser V0 à l’ensemble des caractères.
2 À chaque itération, ajouter le token (sous-mot) candidat t ∗ qui augmente le plus la log-vraisemblance du corpus :
t ∗ = arg max ∆L (t)
t∈
/V
3 Répéter jusqu’à obtenir la taille de vocabulaire souhaitée.
Avantages par rapport à BPE :
▶ Prise en compte directe de la probabilité jointe des décompositions.
▶ Plus robuste aux biais de fréquence brute.
▶ Meilleure couverture du vocabulaire en entraînement / test.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 10 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)
w = t1 t2 . . .tk , où ti ∈ V
On cherche à maximiser :
L (V ) = ∑ log P(t1 , . . . ,tk )
w∈C
Typiquement, on utilise une modélisation de type unigramme :
k
P(t1 , . . . ,tk ) = ∏ P(ti )
i=1
Algorithme :
1 Initialiser V0 à l’ensemble des caractères.
2 À chaque itération, ajouter le token (sous-mot) candidat t ∗ qui augmente le plus la log-vraisemblance du corpus :
t ∗ = arg max ∆L (t)
t∈
/V
3 Répéter jusqu’à obtenir la taille de vocabulaire souhaitée.
Avantages par rapport à BPE :
▶ Prise en compte directe de la probabilité jointe des décompositions.
▶ Plus robuste aux biais de fréquence brute.
▶ Meilleure couverture du vocabulaire en entraînement / test.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 10 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)
w = t1 t2 . . .tk , où ti ∈ V
On cherche à maximiser :
L (V ) = ∑ log P(t1 , . . . ,tk )
w∈C
Typiquement, on utilise une modélisation de type unigramme :
k
P(t1 , . . . ,tk ) = ∏ P(ti )
i=1
Algorithme :
1 Initialiser V0 à l’ensemble des caractères.
2 À chaque itération, ajouter le token (sous-mot) candidat t ∗ qui augmente le plus la log-vraisemblance du corpus :
t ∗ = arg max ∆L (t)
t∈
/V
3 Répéter jusqu’à obtenir la taille de vocabulaire souhaitée.
Avantages par rapport à BPE :
▶ Prise en compte directe de la probabilité jointe des décompositions.
▶ Plus robuste aux biais de fréquence brute.
▶ Meilleure couverture du vocabulaire en entraînement / test.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 10 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)
w = t1 t2 . . .tk , où ti ∈ V
On cherche à maximiser :
L (V ) = ∑ log P(t1 , . . . ,tk )
w∈C
Typiquement, on utilise une modélisation de type unigramme :
k
P(t1 , . . . ,tk ) = ∏ P(ti )
i=1
Algorithme :
1 Initialiser V0 à l’ensemble des caractères.
2 À chaque itération, ajouter le token (sous-mot) candidat t ∗ qui augmente le plus la log-vraisemblance du corpus :
t ∗ = arg max ∆L (t)
t∈
/V
3 Répéter jusqu’à obtenir la taille de vocabulaire souhaitée.
Avantages par rapport à BPE :
▶ Prise en compte directe de la probabilité jointe des décompositions.
▶ Plus robuste aux biais de fréquence brute.
▶ Meilleure couverture du vocabulaire en entraînement / test.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 10 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 11 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)
unhappiness
un happy ness
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 12 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)
La tokenisation affecte :
▶ La longueur des séquences d’entrée.
▶ La couverture linguistique.
▶ La capacité de généralisation du modèle.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 13 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)
La tokenisation affecte :
▶ La longueur des séquences d’entrée.
▶ La couverture linguistique.
▶ La capacité de généralisation du modèle.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 13 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)
Apprentissage auto-supervisé
L’auto-supervision consiste à créer automatiquement des labels à partir des données elles-mêmes.
Très utile dans les modèles de langage : aucun besoin d’annotations humaines coûteuses.
Deux paradigmes majeurs :
▶ Prédiction causale : prédire le prochain token à partir du contexte passé.
▶ Prédiction masquée : prédire les tokens manquants dans une séquence.
Ces stratégies d’entraînement sont à la base des grands modèles comme GPT et BERT.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 14 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)
Apprentissage auto-supervisé
L’auto-supervision consiste à créer automatiquement des labels à partir des données elles-mêmes.
Très utile dans les modèles de langage : aucun besoin d’annotations humaines coûteuses.
Deux paradigmes majeurs :
▶ Prédiction causale : prédire le prochain token à partir du contexte passé.
▶ Prédiction masquée : prédire les tokens manquants dans une séquence.
Ces stratégies d’entraînement sont à la base des grands modèles comme GPT et BERT.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 14 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)
T
P(x1 , . . . , xT ) = ∏ P(xt | x1 , . . . , xt−1 )
t=1
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 15 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)
T
P(x1 , . . . , xT ) = ∏ P(xt | x1 , . . . , xt−1 )
t=1
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 15 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)
Le modèle doit prédire les tokens manquants à partir du contexte gauche et droit :
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 16 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)
Le modèle doit prédire les tokens manquants à partir du contexte gauche et droit :
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 16 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 17 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 17 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 18 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 19 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 19 / 28
Algorithme Adam (Adaptive Moment Estimation)
Adam est un algorithme d’optimisation stochastique à pas adaptatif. Il combine deux méthodes :
▶ Momentum : moyenne exponentielle des gradients passés.
▶ RMSProp : moyenne exponentielle du carré des gradients.
Soit Lt (θ) la fonction de perte à l’étape t . À chaque itération, on calcule :
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 20 / 28
Algorithme Adam (Adaptive Moment Estimation)
Adam est un algorithme d’optimisation stochastique à pas adaptatif. Il combine deux méthodes :
▶ Momentum : moyenne exponentielle des gradients passés.
▶ RMSProp : moyenne exponentielle du carré des gradients.
Soit Lt (θ) la fonction de perte à l’étape t . À chaque itération, on calcule :
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 20 / 28
Algorithme Adam (Adaptive Moment Estimation)
Adam ou tout optimiseur peut être combiné avec un planning du taux d’apprentissage ηt .
Problème : si η est trop grand initialement ⇒ explosion des gradients ou divergence.
Solution : stratégie de Warm-up :
t
ηt = ηmax · , pour t ≤ Nwarm
Nwarm
où :
▶ Nwarm : nombre d’étapes de chauffe,
▶ ηmax : taux d’apprentissage maximal.
Après le Warm-up : décroissance du taux d’apprentissage :
▶ Inverse Square Root Decay (Transformer) :
ηmax
ηt = √ , t > Nwarm
t
▶ Cosine Annealing :
( ( ))
1 t − Nwarm
ηt = ηmin + (ηmax − ηmin ) 1 + cos π ·
2 T − Nwarm
▶ Exponential Decay :
ηt = ηmax · γt−Nwarm , γ ∈ (0, 1)
Ces stratégies assurent stabilité initiale et convergence plus fine.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 21 / 28
Algorithme Adam (Adaptive Moment Estimation)
Adam ou tout optimiseur peut être combiné avec un planning du taux d’apprentissage ηt .
Problème : si η est trop grand initialement ⇒ explosion des gradients ou divergence.
Solution : stratégie de Warm-up :
t
ηt = ηmax · , pour t ≤ Nwarm
Nwarm
où :
▶ Nwarm : nombre d’étapes de chauffe,
▶ ηmax : taux d’apprentissage maximal.
Après le Warm-up : décroissance du taux d’apprentissage :
▶ Inverse Square Root Decay (Transformer) :
ηmax
ηt = √ , t > Nwarm
t
▶ Cosine Annealing :
( ( ))
1 t − Nwarm
ηt = ηmin + (ηmax − ηmin ) 1 + cos π ·
2 T − Nwarm
▶ Exponential Decay :
ηt = ηmax · γt−Nwarm , γ ∈ (0, 1)
Ces stratégies assurent stabilité initiale et convergence plus fine.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 21 / 28
Algorithme Adam (Adaptive Moment Estimation)
ε
qsmoothed (y) = (1 − ε) · δy,y∗ +
K
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 22 / 28
Algorithme Adam (Adaptive Moment Estimation)
Taux d’apprentissage
ηt = 1
√
t
Fin warm-up
warm-up linéaire
Itérations
Cette courbe illustre une stratégie classique de variation du taux d’apprentissage : une phase
√ de warm-up linéaire où ηt croît
progressivement pour stabiliser l’entraînement, suivie d’une décroissance selon une loi en 1/ t afin de permettre une convergence plus
fine en fin d’entraînement. La transition entre les deux phases se fait au point noté "Fin warm-up".
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 23 / 28
Alignement des modèles de langage par RLHF
Les modèles de langage (GPT, T5, etc.) sont préentraînés pour approximer la distribution conditionnelle de texte :
fθ (y|x) ≈ P(y|x)
mais cela ne garantit pas que les réponses soient alignées avec les attentes humaines (éthique, utilité, sécurité, etc.).
Objectif de l’alignement : modifier la politique fθ pour qu’elle génère des sorties préférées par les humains.
Méthodologie classique : RLHF (Reinforcement Learning from Human Feedback) :
1 Préentraînement du modèle sur un grand corpus D (objectif de type maximum de vraisemblance) :
max
θ
∑ log fθ (y|x)
(x,y)∈D
−
2 Collecte de préférences humaines : pour chaque requête xi , on compare deux réponses y+
i (préférée) et yi .
3 Entraînement d’un modèle de récompense rϕ (x, y) pour approximer les préférences :
( )
max ∑ log σ rϕ (xi , y+ −
i ) − rϕ (xi , yi )
ϕ i
avec σ(z) = 1
1+e−z
la fonction sigmoïde.
4 Optimisation par renforcement (PPO) : [ ]
max Ey∼ fθ (·|x) rϕ (x, y) − β · KL( fθ k fbase )
θ
où fbase est la politique préentraînée.
Ey∼ fθ (·|x) [·] signifie qu’on calcule l’espérance (la moyenne) sur les différentes réponses y générées par le modèle fθ
conditionnellement à une entrée x.
Référence clé : InstructGPT, Ouyang et al., 2022.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 24 / 28
Alignement des modèles de langage par RLHF
Les modèles de langage (GPT, T5, etc.) sont préentraînés pour approximer la distribution conditionnelle de texte :
fθ (y|x) ≈ P(y|x)
mais cela ne garantit pas que les réponses soient alignées avec les attentes humaines (éthique, utilité, sécurité, etc.).
Objectif de l’alignement : modifier la politique fθ pour qu’elle génère des sorties préférées par les humains.
Méthodologie classique : RLHF (Reinforcement Learning from Human Feedback) :
1 Préentraînement du modèle sur un grand corpus D (objectif de type maximum de vraisemblance) :
max
θ
∑ log fθ (y|x)
(x,y)∈D
−
2 Collecte de préférences humaines : pour chaque requête xi , on compare deux réponses y+
i (préférée) et yi .
3 Entraînement d’un modèle de récompense rϕ (x, y) pour approximer les préférences :
( )
max ∑ log σ rϕ (xi , y+ −
i ) − rϕ (xi , yi )
ϕ i
avec σ(z) = 1
1+e−z
la fonction sigmoïde.
4 Optimisation par renforcement (PPO) : [ ]
max Ey∼ fθ (·|x) rϕ (x, y) − β · KL( fθ k fbase )
θ
où fbase est la politique préentraînée.
Ey∼ fθ (·|x) [·] signifie qu’on calcule l’espérance (la moyenne) sur les différentes réponses y générées par le modèle fθ
conditionnellement à une entrée x.
Référence clé : InstructGPT, Ouyang et al., 2022.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 24 / 28
Alignement des modèles de langage par RLHF
Les modèles de langage (GPT, T5, etc.) sont préentraînés pour approximer la distribution conditionnelle de texte :
fθ (y|x) ≈ P(y|x)
mais cela ne garantit pas que les réponses soient alignées avec les attentes humaines (éthique, utilité, sécurité, etc.).
Objectif de l’alignement : modifier la politique fθ pour qu’elle génère des sorties préférées par les humains.
Méthodologie classique : RLHF (Reinforcement Learning from Human Feedback) :
1 Préentraînement du modèle sur un grand corpus D (objectif de type maximum de vraisemblance) :
max
θ
∑ log fθ (y|x)
(x,y)∈D
−
2 Collecte de préférences humaines : pour chaque requête xi , on compare deux réponses y+
i (préférée) et yi .
3 Entraînement d’un modèle de récompense rϕ (x, y) pour approximer les préférences :
( )
max ∑ log σ rϕ (xi , y+ −
i ) − rϕ (xi , yi )
ϕ i
avec σ(z) = 1
1+e−z
la fonction sigmoïde.
4 Optimisation par renforcement (PPO) : [ ]
max Ey∼ fθ (·|x) rϕ (x, y) − β · KL( fθ k fbase )
θ
où fbase est la politique préentraînée.
Ey∼ fθ (·|x) [·] signifie qu’on calcule l’espérance (la moyenne) sur les différentes réponses y générées par le modèle fθ
conditionnellement à une entrée x.
Référence clé : InstructGPT, Ouyang et al., 2022.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 24 / 28
Alignement des modèles de langage par RLHF
où :
▶ rt (θ) = fθ (yt |xt )
est le rapport de probabilité,
fθold (yt |xt )
▶ Ât est l’estimateur de l’avantage (par ex., Ât = rϕ (xt , yt ) − bt avec bt une baseline),
▶ ε est un hyperparamètre (souvent 0.1 ou 0.2).
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 25 / 28
Alignement des modèles de langage par RLHF
où :
▶ rt (θ) = fθ (yt |xt )
est le rapport de probabilité,
fθold (yt |xt )
▶ Ât est l’estimateur de l’avantage (par ex., Ât = rϕ (xt , yt ) − bt avec bt une baseline),
▶ ε est un hyperparamètre (souvent 0.1 ou 0.2).
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 25 / 28
Alignement des modèles de langage par RLHF
où :
▶ rt (θ) = fθ (yt |xt )
est le rapport de probabilité,
fθold (yt |xt )
▶ Ât est l’estimateur de l’avantage (par ex., Ât = rϕ (xt , yt ) − bt avec bt une baseline),
▶ ε est un hyperparamètre (souvent 0.1 ou 0.2).
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 25 / 28
Alignement des modèles de langage par RLHF
BERT
Encodeur uniquement basé sur l’attention bidirectionnelle.
Objectif : Masked Language Modeling (MLM).
T5 (Text-to-Text Transfer Transformer)
max
θ
∑ log fθ (yi |xmasqué ) Architecture complète encodeur-décodeur.
i∈mask
Objectif unifié : tous les problèmes sont formulés comme des
Applications : classification, NER, question answering, etc. tâches de transformation texte → texte.
GPT x 7→ y où x, y ∈ V ∗
Décodeur uniquement, avec attention causale Préentraînement par Corrupted Span Prediction :
(unidirectionnelle). ▶ Plusieurs spans consécutifs sont masqués,
▶ Le modèle doit reconstruire les morceaux masqués.
Objectif : Next Token Prediction.
Très flexible pour la traduction, résumé, QA, etc.
max ∑ log fθ (yt |y<t )
θ t
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 26 / 28
Alignement des modèles de langage par RLHF
BERT
Encodeur uniquement basé sur l’attention bidirectionnelle.
Objectif : Masked Language Modeling (MLM).
T5 (Text-to-Text Transfer Transformer)
max
θ
∑ log fθ (yi |xmasqué ) Architecture complète encodeur-décodeur.
i∈mask
Objectif unifié : tous les problèmes sont formulés comme des
Applications : classification, NER, question answering, etc. tâches de transformation texte → texte.
GPT x 7→ y où x, y ∈ V ∗
Décodeur uniquement, avec attention causale Préentraînement par Corrupted Span Prediction :
(unidirectionnelle). ▶ Plusieurs spans consécutifs sont masqués,
▶ Le modèle doit reconstruire les morceaux masqués.
Objectif : Next Token Prediction.
Très flexible pour la traduction, résumé, QA, etc.
max ∑ log fθ (yt |y<t )
θ t
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 26 / 28
Alignement des modèles de langage par RLHF
Sortie générée
BERT (Encodeur) GPT (Décodeur) T5 (Encodeur-Décodeur)
Légende
BERT : encodeur bidirectionnel optimisé pour la compréhension (classification, QA).
GPT : décodeur unidirectionnel pour la génération de texte.
T5 : architecture encodeur-décodeur unifiée pour toutes les tâches sous forme textetexte.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 27 / 28
Alignement des modèles de langage par RLHF
Conclusion du Module 3
Prochaine étape
Module 4 : Préentraînement à grande échelle et fine-tuning spécialisé.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 28 / 28
Alignement des modèles de langage par RLHF
Conclusion du Module 3
Prochaine étape
Module 4 : Préentraînement à grande échelle et fine-tuning spécialisé.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 28 / 28