0% ont trouvé ce document utile (0 vote)
12 vues56 pages

Fondements des Transformers et LLMs

mathemathiques

Transféré par

billecom75
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
12 vues56 pages

Fondements des Transformers et LLMs

mathemathiques

Transféré par

billecom75
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Masterclass organisée par :

Togo Data Lab


Fondements Mathématiques des Transformers et des
LLMs

Module 3 : Des Transformers aux LLMs : fondements et pré-entraînement

Présentée par : Tiebekabe Pagdame


Enseignant-chercheur - Université de Kara

Dates : 14-15 juillet 2025

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 1 / 28
Sommaire

1 Langage probabiliste : modèle de langage, fonction de vraisemblance

2 Tokenization, vocabulaire, subword units (BPE, WordPiece)

3 Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)

4 Algorithme Adam (Adaptive Moment Estimation)

5 Alignement des modèles de langage par RLHF

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 2 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance

Modèle de Langage Probabiliste

Un modèle de langage est une distribution de probabilité définie sur les séquences de mots (w1 , w2 , . . . , wT ), avec wt appartenant à
un vocabulaire fini V .
Objectif : apprendre la distribution conjointe
P(w1 , w2 , . . . , wT )
à partir d’un corpus de textes, afin de modéliser les régularités syntaxiques, sémantiques ou pragmatiques de la langue.

Formulation mathématique par la règle de chaîne (chaîne de Markov de longueur variable)


T
P(w1 , w2 , . . . , wT ) = ∏ P(wt | w1 , . . . , wt−1 )
t=1

Hypothèse de Markov d’ordre n :


P(wt | w1 , . . . , wt−1 ) ≈ P(wt | wt−n+1 , . . . , wt−1 )
Cela simplifie l’apprentissage et réduit le nombre de paramètres, mais limite la capacité de modélisation à des dépendances de
longueur n.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 3 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance

Modèle de Langage Probabiliste

Un modèle de langage est une distribution de probabilité définie sur les séquences de mots (w1 , w2 , . . . , wT ), avec wt appartenant à
un vocabulaire fini V .
Objectif : apprendre la distribution conjointe
P(w1 , w2 , . . . , wT )
à partir d’un corpus de textes, afin de modéliser les régularités syntaxiques, sémantiques ou pragmatiques de la langue.

Formulation mathématique par la règle de chaîne (chaîne de Markov de longueur variable)


T
P(w1 , w2 , . . . , wT ) = ∏ P(wt | w1 , . . . , wt−1 )
t=1

Hypothèse de Markov d’ordre n :


P(wt | w1 , . . . , wt−1 ) ≈ P(wt | wt−n+1 , . . . , wt−1 )
Cela simplifie l’apprentissage et réduit le nombre de paramètres, mais limite la capacité de modélisation à des dépendances de
longueur n.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 3 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance

Modèle de Langage Probabiliste

Un modèle de langage est une distribution de probabilité définie sur les séquences de mots (w1 , w2 , . . . , wT ), avec wt appartenant à
un vocabulaire fini V .
Objectif : apprendre la distribution conjointe
P(w1 , w2 , . . . , wT )
à partir d’un corpus de textes, afin de modéliser les régularités syntaxiques, sémantiques ou pragmatiques de la langue.

Formulation mathématique par la règle de chaîne (chaîne de Markov de longueur variable)


T
P(w1 , w2 , . . . , wT ) = ∏ P(wt | w1 , . . . , wt−1 )
t=1

Hypothèse de Markov d’ordre n :


P(wt | w1 , . . . , wt−1 ) ≈ P(wt | wt−n+1 , . . . , wt−1 )
Cela simplifie l’apprentissage et réduit le nombre de paramètres, mais limite la capacité de modélisation à des dépendances de
longueur n.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 3 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance

Exemple simple de modèle de langage

Vocabulaire : V = {je, suis, content}


Corpus d’entraînement :
▶ “je suis content”
▶ “je suis”

On extrait les bigrammes suivants :


(je, suis) (x2), (suis, content) (x1)
D’où :
count(je suis) = 2, count(suis content) = 1

count(je) = 2, count(suis) = 2

Estimation des probabilités (bigrammes) :

2 1
P(suis | je) = = 1, P(content | suis) =
2 2
Les modèles neuronaux généralisent ce mécanisme en apprenant les probabilités via des paramètres optimisés.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 4 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance

Exemple simple de modèle de langage

Vocabulaire : V = {je, suis, content}


Corpus d’entraînement :
▶ “je suis content”
▶ “je suis”

On extrait les bigrammes suivants :


(je, suis) (x2), (suis, content) (x1)
D’où :
count(je suis) = 2, count(suis content) = 1

count(je) = 2, count(suis) = 2

Estimation des probabilités (bigrammes) :

2 1
P(suis | je) = = 1, P(content | suis) =
2 2
Les modèles neuronaux généralisent ce mécanisme en apprenant les probabilités via des paramètres optimisés.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 4 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance

Exemple simple de modèle de langage

Vocabulaire : V = {je, suis, content}


Corpus d’entraînement :
▶ “je suis content”
▶ “je suis”

On extrait les bigrammes suivants :


(je, suis) (x2), (suis, content) (x1)
D’où :
count(je suis) = 2, count(suis content) = 1

count(je) = 2, count(suis) = 2

Estimation des probabilités (bigrammes) :

2 1
P(suis | je) = = 1, P(content | suis) =
2 2
Les modèles neuronaux généralisent ce mécanisme en apprenant les probabilités via des paramètres optimisés.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 4 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance

Exemple simple de modèle de langage

Vocabulaire : V = {je, suis, content}


Corpus d’entraînement :
▶ “je suis content”
▶ “je suis”

On extrait les bigrammes suivants :


(je, suis) (x2), (suis, content) (x1)
D’où :
count(je suis) = 2, count(suis content) = 1

count(je) = 2, count(suis) = 2

Estimation des probabilités (bigrammes) :

2 1
P(suis | je) = = 1, P(content | suis) =
2 2
Les modèles neuronaux généralisent ce mécanisme en apprenant les probabilités via des paramètres optimisés.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 4 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance

Fonction de Vraisemblance et Entraînement

Objectif : Maximum de vraisemblance


Étant donné une séquence (w1 , w2 , . . . , wT ), on maximise la vraisemblance du modèle Pθ :

T
L (θ) = ∏ Pθ (wt | w1 , . . . , wt−1 )
t=1

où θ représente les paramètres du modèle (poids du réseau, biais, etc.).

Log-vraisemblance (plus stable numériquement)


T
log L (θ) = ∑ log Pθ (wt | w1 , . . . , wt−1 )
t=1

En pratique, on minimise la négative log-vraisemblance (fonction de perte) :

T
J (θ) = − ∑ log Pθ (wt | w1 , . . . , wt−1 )
t=1

Cette fonction est utilisée dans les algorithmes d’apprentissage (descente de gradient stochastique).

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 5 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance

Fonction de Vraisemblance et Entraînement

Objectif : Maximum de vraisemblance


Étant donné une séquence (w1 , w2 , . . . , wT ), on maximise la vraisemblance du modèle Pθ :

T
L (θ) = ∏ Pθ (wt | w1 , . . . , wt−1 )
t=1

où θ représente les paramètres du modèle (poids du réseau, biais, etc.).

Log-vraisemblance (plus stable numériquement)


T
log L (θ) = ∑ log Pθ (wt | w1 , . . . , wt−1 )
t=1

En pratique, on minimise la négative log-vraisemblance (fonction de perte) :

T
J (θ) = − ∑ log Pθ (wt | w1 , . . . , wt−1 )
t=1

Cette fonction est utilisée dans les algorithmes d’apprentissage (descente de gradient stochastique).

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 5 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance

Fonction de Vraisemblance et Entraînement

Objectif : Maximum de vraisemblance


Étant donné une séquence (w1 , w2 , . . . , wT ), on maximise la vraisemblance du modèle Pθ :

T
L (θ) = ∏ Pθ (wt | w1 , . . . , wt−1 )
t=1

où θ représente les paramètres du modèle (poids du réseau, biais, etc.).

Log-vraisemblance (plus stable numériquement)


T
log L (θ) = ∑ log Pθ (wt | w1 , . . . , wt−1 )
t=1

En pratique, on minimise la négative log-vraisemblance (fonction de perte) :

T
J (θ) = − ∑ log Pθ (wt | w1 , . . . , wt−1 )
t=1

Cette fonction est utilisée dans les algorithmes d’apprentissage (descente de gradient stochastique).

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 5 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance

Résumé visuel

w1 w2 w3 ... wT-1

NN NN NN NN

P(w2 |w1 ) P(w3 |w1 , w2 ) P(w4 | . . . ) P(wT | . . . )

Figure – Architecture d’un modèle de langage probabiliste basé sur réseau neuronal.

Les probabilités sont estimées par un réseau neuronal (RNN, Transformer, etc.)
L’entraînement se fait par maximisation de la vraisemblance

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 6 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance

Problème de la Tokenisation

Dans les LLMs, le texte est converti en unités élémentaires : les tokens.
Un token peut être un mot, une syllabe, un caractère ou une sous-unité morphologique.
Objectifs :
▶ Réduire la taille du vocabulaire.
▶ Gérer les mots inconnus ou rares (Out-of-Vocabulary ).
▶ Maximiser la réutilisabilité statistique des morceaux.

Problème : Comment découper un texte efficacement tout en gardant une expressivité linguistique et une efficacité computationnelle ?

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 7 / 28
Langage probabiliste : modèle de langage, fonction de vraisemblance

Problème de la Tokenisation

Dans les LLMs, le texte est converti en unités élémentaires : les tokens.
Un token peut être un mot, une syllabe, un caractère ou une sous-unité morphologique.
Objectifs :
▶ Réduire la taille du vocabulaire.
▶ Gérer les mots inconnus ou rares (Out-of-Vocabulary ).
▶ Maximiser la réutilisabilité statistique des morceaux.

Problème : Comment découper un texte efficacement tout en gardant une expressivité linguistique et une efficacité computationnelle ?

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 7 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)

Tokenisation par mots vs. caractères vs. sous-mots

Tokenisation par mots


Facile à interpréter.
Taille de vocabulaire énorme. Tokenisation par sous-mots (subwords)
Problèmes avec les mots rares ou inconnus. Compromis entre expressivité et efficacité.
Tokenisation par caractères Basée sur la fréquence des co-occurrences.
Très petit vocabulaire. Utilisée par les LLMs modernes : GPT, BERT, T5.
Longues séquences.
Perte de structure linguistique.
Les sous-mots permettent d’équilibrer la couverture lexicale et la généralisation.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 8 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)

Tokenisation par mots vs. caractères vs. sous-mots

Tokenisation par mots


Facile à interpréter.
Taille de vocabulaire énorme. Tokenisation par sous-mots (subwords)
Problèmes avec les mots rares ou inconnus. Compromis entre expressivité et efficacité.
Tokenisation par caractères Basée sur la fréquence des co-occurrences.
Très petit vocabulaire. Utilisée par les LLMs modernes : GPT, BERT, T5.
Longues séquences.
Perte de structure linguistique.
Les sous-mots permettent d’équilibrer la couverture lexicale et la généralisation.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 8 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)

Byte Pair Encoding (BPE)

Méthode initialement conçue pour la compression de texte (Gage, 1994), adaptée au traitement automatique des langues par
Sennrich et al. (2016).
But : apprendre un vocabulaire de sous-mots (subwords) à partir d’un corpus en découpant ou fusionnant les mots selon des motifs
statistiques.
Idée clé : fusionner les paires de symboles les plus fréquentes dans le corpus pour construire des unités plus longues.
Algorithme BPE formalisé :
1 Initialiser un vocabulaire de symboles V0 (souvent les caractères individuels).
2 À chaque itération t , repérer la paire de symboles adjacents (a, b) la plus fréquente dans le corpus C(t) :

(at , bt ) = arg max countC(t) (a, b)


(a,b)

3 Ajouter le nouveau symbole ab à Vt , et remplacer toutes les occurrences de a b par ab dans C(t) pour obtenir C(t+1) .
4 Répéter jusqu’à atteindre un vocabulaire de taille |V | prédéfini.
Exemple (toy) :
l o w l o w e r n e w e s t w i d e s t
▶ Étape 1 : compter les paires fréquentes ⇒ (l,o), (o,w), (e,s), etc.
▶ Étape 2 : fusionner la paire la plus fréquente, disons l o → lo
▶ Corpus devient : lo w lo w e r n e w e s t w i d e s t
Remarque : BPE est rapide, déterministe et non probabiliste, mais peut générer des unités fréquentes pertinentes même pour des mots
inconnus (OOV).

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 9 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)

Byte Pair Encoding (BPE)

Méthode initialement conçue pour la compression de texte (Gage, 1994), adaptée au traitement automatique des langues par
Sennrich et al. (2016).
But : apprendre un vocabulaire de sous-mots (subwords) à partir d’un corpus en découpant ou fusionnant les mots selon des motifs
statistiques.
Idée clé : fusionner les paires de symboles les plus fréquentes dans le corpus pour construire des unités plus longues.
Algorithme BPE formalisé :
1 Initialiser un vocabulaire de symboles V0 (souvent les caractères individuels).
2 À chaque itération t , repérer la paire de symboles adjacents (a, b) la plus fréquente dans le corpus C(t) :

(at , bt ) = arg max countC(t) (a, b)


(a,b)

3 Ajouter le nouveau symbole ab à Vt , et remplacer toutes les occurrences de a b par ab dans C(t) pour obtenir C(t+1) .
4 Répéter jusqu’à atteindre un vocabulaire de taille |V | prédéfini.
Exemple (toy) :
l o w l o w e r n e w e s t w i d e s t
▶ Étape 1 : compter les paires fréquentes ⇒ (l,o), (o,w), (e,s), etc.
▶ Étape 2 : fusionner la paire la plus fréquente, disons l o → lo
▶ Corpus devient : lo w lo w e r n e w e s t w i d e s t
Remarque : BPE est rapide, déterministe et non probabiliste, mais peut générer des unités fréquentes pertinentes même pour des mots
inconnus (OOV).

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 9 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)

Byte Pair Encoding (BPE)

Méthode initialement conçue pour la compression de texte (Gage, 1994), adaptée au traitement automatique des langues par
Sennrich et al. (2016).
But : apprendre un vocabulaire de sous-mots (subwords) à partir d’un corpus en découpant ou fusionnant les mots selon des motifs
statistiques.
Idée clé : fusionner les paires de symboles les plus fréquentes dans le corpus pour construire des unités plus longues.
Algorithme BPE formalisé :
1 Initialiser un vocabulaire de symboles V0 (souvent les caractères individuels).
2 À chaque itération t , repérer la paire de symboles adjacents (a, b) la plus fréquente dans le corpus C(t) :

(at , bt ) = arg max countC(t) (a, b)


(a,b)

3 Ajouter le nouveau symbole ab à Vt , et remplacer toutes les occurrences de a b par ab dans C(t) pour obtenir C(t+1) .
4 Répéter jusqu’à atteindre un vocabulaire de taille |V | prédéfini.
Exemple (toy) :
l o w l o w e r n e w e s t w i d e s t
▶ Étape 1 : compter les paires fréquentes ⇒ (l,o), (o,w), (e,s), etc.
▶ Étape 2 : fusionner la paire la plus fréquente, disons l o → lo
▶ Corpus devient : lo w lo w e r n e w e s t w i d e s t
Remarque : BPE est rapide, déterministe et non probabiliste, mais peut générer des unités fréquentes pertinentes même pour des mots
inconnus (OOV).

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 9 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)

WordPiece : Amélioration probabiliste de BPE


Méthode utilisée par Google dans les modèles tels que BERT, introduite dans le contexte de la reconnaissance vocale (Schuster &
Nakajima, 2012).
Objectif : construire un vocabulaire optimal de sous-unités qui maximise la probabilité du corpus.
Formulation probabiliste :
Soit un corpus C = {w(1) , w(2) , . . . }, et un vocabulaire courant V de sous-unités.
Pour chaque mot w, on peut l’écrire comme une séquence de sous-unités :

w = t1 t2 . . .tk , où ti ∈ V

On cherche à maximiser :
L (V ) = ∑ log P(t1 , . . . ,tk )
w∈C
Typiquement, on utilise une modélisation de type unigramme :
k
P(t1 , . . . ,tk ) = ∏ P(ti )
i=1

Algorithme :
1 Initialiser V0 à l’ensemble des caractères.
2 À chaque itération, ajouter le token (sous-mot) candidat t ∗ qui augmente le plus la log-vraisemblance du corpus :
t ∗ = arg max ∆L (t)
t∈
/V
3 Répéter jusqu’à obtenir la taille de vocabulaire souhaitée.
Avantages par rapport à BPE :
▶ Prise en compte directe de la probabilité jointe des décompositions.
▶ Plus robuste aux biais de fréquence brute.
▶ Meilleure couverture du vocabulaire en entraînement / test.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 10 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)

WordPiece : Amélioration probabiliste de BPE


Méthode utilisée par Google dans les modèles tels que BERT, introduite dans le contexte de la reconnaissance vocale (Schuster &
Nakajima, 2012).
Objectif : construire un vocabulaire optimal de sous-unités qui maximise la probabilité du corpus.
Formulation probabiliste :
Soit un corpus C = {w(1) , w(2) , . . . }, et un vocabulaire courant V de sous-unités.
Pour chaque mot w, on peut l’écrire comme une séquence de sous-unités :

w = t1 t2 . . .tk , où ti ∈ V

On cherche à maximiser :
L (V ) = ∑ log P(t1 , . . . ,tk )
w∈C
Typiquement, on utilise une modélisation de type unigramme :
k
P(t1 , . . . ,tk ) = ∏ P(ti )
i=1

Algorithme :
1 Initialiser V0 à l’ensemble des caractères.
2 À chaque itération, ajouter le token (sous-mot) candidat t ∗ qui augmente le plus la log-vraisemblance du corpus :
t ∗ = arg max ∆L (t)
t∈
/V
3 Répéter jusqu’à obtenir la taille de vocabulaire souhaitée.
Avantages par rapport à BPE :
▶ Prise en compte directe de la probabilité jointe des décompositions.
▶ Plus robuste aux biais de fréquence brute.
▶ Meilleure couverture du vocabulaire en entraînement / test.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 10 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)

WordPiece : Amélioration probabiliste de BPE


Méthode utilisée par Google dans les modèles tels que BERT, introduite dans le contexte de la reconnaissance vocale (Schuster &
Nakajima, 2012).
Objectif : construire un vocabulaire optimal de sous-unités qui maximise la probabilité du corpus.
Formulation probabiliste :
Soit un corpus C = {w(1) , w(2) , . . . }, et un vocabulaire courant V de sous-unités.
Pour chaque mot w, on peut l’écrire comme une séquence de sous-unités :

w = t1 t2 . . .tk , où ti ∈ V

On cherche à maximiser :
L (V ) = ∑ log P(t1 , . . . ,tk )
w∈C
Typiquement, on utilise une modélisation de type unigramme :
k
P(t1 , . . . ,tk ) = ∏ P(ti )
i=1

Algorithme :
1 Initialiser V0 à l’ensemble des caractères.
2 À chaque itération, ajouter le token (sous-mot) candidat t ∗ qui augmente le plus la log-vraisemblance du corpus :
t ∗ = arg max ∆L (t)
t∈
/V
3 Répéter jusqu’à obtenir la taille de vocabulaire souhaitée.
Avantages par rapport à BPE :
▶ Prise en compte directe de la probabilité jointe des décompositions.
▶ Plus robuste aux biais de fréquence brute.
▶ Meilleure couverture du vocabulaire en entraînement / test.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 10 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)

WordPiece : Amélioration probabiliste de BPE


Méthode utilisée par Google dans les modèles tels que BERT, introduite dans le contexte de la reconnaissance vocale (Schuster &
Nakajima, 2012).
Objectif : construire un vocabulaire optimal de sous-unités qui maximise la probabilité du corpus.
Formulation probabiliste :
Soit un corpus C = {w(1) , w(2) , . . . }, et un vocabulaire courant V de sous-unités.
Pour chaque mot w, on peut l’écrire comme une séquence de sous-unités :

w = t1 t2 . . .tk , où ti ∈ V

On cherche à maximiser :
L (V ) = ∑ log P(t1 , . . . ,tk )
w∈C
Typiquement, on utilise une modélisation de type unigramme :
k
P(t1 , . . . ,tk ) = ∏ P(ti )
i=1

Algorithme :
1 Initialiser V0 à l’ensemble des caractères.
2 À chaque itération, ajouter le token (sous-mot) candidat t ∗ qui augmente le plus la log-vraisemblance du corpus :
t ∗ = arg max ∆L (t)
t∈
/V
3 Répéter jusqu’à obtenir la taille de vocabulaire souhaitée.
Avantages par rapport à BPE :
▶ Prise en compte directe de la probabilité jointe des décompositions.
▶ Plus robuste aux biais de fréquence brute.
▶ Meilleure couverture du vocabulaire en entraînement / test.
Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 10 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)

BPE vs WordPiece : comparaison

Critère BPE WordPiece


Principe Fusion des paires fréquentes Maximisation de la probabilité jointe
Approche Déterministe, fréquence brute Probabiliste (vraisemblance)
Vitesse Très rapide Plus lente
Utilisation GPT, RoBERTa BERT, ALBERT

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 11 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)

Visualisation : Exemple de Tokenisation Subword

unhappiness

un happy ness

Découpe par BPE ou WordPiece

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 12 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)

Impact sur les modèles LLM

La tokenisation affecte :
▶ La longueur des séquences d’entrée.
▶ La couverture linguistique.
▶ La capacité de généralisation du modèle.

Choix du vocabulaire → compromis entre complexité et expressivité.


Exemples :
▶ GPT utilise un vocabulaire de ∼ 50k subwords (BPE).
▶ BERT utilise WordPiece avec ∼ 30k tokens.

Conséquence : Le succès des LLMs dépend grandement de la stratégie de tokenisation.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 13 / 28
Tokenization, vocabulaire, subword units (BPE, WordPiece)

Impact sur les modèles LLM

La tokenisation affecte :
▶ La longueur des séquences d’entrée.
▶ La couverture linguistique.
▶ La capacité de généralisation du modèle.

Choix du vocabulaire → compromis entre complexité et expressivité.


Exemples :
▶ GPT utilise un vocabulaire de ∼ 50k subwords (BPE).
▶ BERT utilise WordPiece avec ∼ 30k tokens.

Conséquence : Le succès des LLMs dépend grandement de la stratégie de tokenisation.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 13 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)

Apprentissage auto-supervisé

L’auto-supervision consiste à créer automatiquement des labels à partir des données elles-mêmes.
Très utile dans les modèles de langage : aucun besoin d’annotations humaines coûteuses.
Deux paradigmes majeurs :
▶ Prédiction causale : prédire le prochain token à partir du contexte passé.
▶ Prédiction masquée : prédire les tokens manquants dans une séquence.

Ces stratégies d’entraînement sont à la base des grands modèles comme GPT et BERT.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 14 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)

Apprentissage auto-supervisé

L’auto-supervision consiste à créer automatiquement des labels à partir des données elles-mêmes.
Très utile dans les modèles de langage : aucun besoin d’annotations humaines coûteuses.
Deux paradigmes majeurs :
▶ Prédiction causale : prédire le prochain token à partir du contexte passé.
▶ Prédiction masquée : prédire les tokens manquants dans une séquence.

Ces stratégies d’entraînement sont à la base des grands modèles comme GPT et BERT.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 14 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)

Apprentissage Auto-Régressif (Causal LM)

On modélise la probabilité jointe d’une séquence :

T
P(x1 , . . . , xT ) = ∏ P(xt | x1 , . . . , xt−1 )
t=1

L’entraînement consiste à prédire xt à chaque pas à partir de x<t .


C’est le paradigme utilisé dans :
▶ GPT-1, GPT-2, GPT-3, GPT-4.
▶ Les modèles de génération de texte.

Avantage : génération fluide.


Inconvénient : pas de contexte futur, entraînement unidirectionnel.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 15 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)

Apprentissage Auto-Régressif (Causal LM)

On modélise la probabilité jointe d’une séquence :

T
P(x1 , . . . , xT ) = ∏ P(xt | x1 , . . . , xt−1 )
t=1

L’entraînement consiste à prédire xt à chaque pas à partir de x<t .


C’est le paradigme utilisé dans :
▶ GPT-1, GPT-2, GPT-3, GPT-4.
▶ Les modèles de génération de texte.

Avantage : génération fluide.


Inconvénient : pas de contexte futur, entraînement unidirectionnel.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 15 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)

Apprentissage Masqué (Masked LM)

Paradigme introduit par BERT :


Remplacer des tokens par un symbole spécial [MASK].

Le modèle doit prédire les tokens manquants à partir du contexte gauche et droit :

P(xi | x1 , . . . , xi−1 , xi+1 , . . . , xT )


En pratique :
▶ On masque aléatoirement 15% des tokens.
▶ 80% sont remplacés par [MASK], 10% par un autre mot, 10% inchangés.

Avantage : contexte bidirectionnel.


Inconvénient : incohérence entre entraînement (avec [MASK]) et inférence (sans [MASK]).

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 16 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)

Apprentissage Masqué (Masked LM)

Paradigme introduit par BERT :


Remplacer des tokens par un symbole spécial [MASK].

Le modèle doit prédire les tokens manquants à partir du contexte gauche et droit :

P(xi | x1 , . . . , xi−1 , xi+1 , . . . , xT )


En pratique :
▶ On masque aléatoirement 15% des tokens.
▶ 80% sont remplacés par [MASK], 10% par un autre mot, 10% inchangés.

Avantage : contexte bidirectionnel.


Inconvénient : incohérence entre entraînement (avec [MASK]) et inférence (sans [MASK]).

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 16 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)

Comparaison : Causal vs Masked LM

Auto-régressif (Causal LM) Masked LM


Unidirectionnel Bidirectionnel
Génération naturelle Bonne représentation du contexte
Pas de [MASK] en entrée Pas adapté à la génération

Synthèse : Causal LM pour la génération, Masked LM pour l’encodage profond.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 17 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)

Comparaison : Causal vs Masked LM

Auto-régressif (Causal LM) Masked LM


Unidirectionnel Bidirectionnel
Génération naturelle Bonne représentation du contexte
Pas de [MASK] en entrée Pas adapté à la génération

Synthèse : Causal LM pour la génération, Masked LM pour l’encodage profond.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 17 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)

Visualisation : Masquage de tokens

Le chat [MASK] sur le tapis

Prédire dort à partir du contexte

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 18 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)

Optimisation à grande échelle

Les modèles de type Transformer comptent souvent des milliards de paramètres.


L’optimisation efficace est donc critique :
▶ pour la vitesse de convergence,
▶ pour la stabilité de l’entraînement,
▶ pour la généralisation du modèle.
Trois leviers principaux :
▶ Algorithmes d’optimisation (ex : Adam)
▶ Programmation du taux d’apprentissage (warm-up, decay)
▶ Régularisation (Dropout, Weight Decay, Label smoothing)

Un entraînement réussi repose sur la synergie entre ces techniques.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 19 / 28
Apprentissage auto-supervisé : objectif de prédiction de mot masqué (Masked LM), causale (Auto-regressive)

Optimisation à grande échelle

Les modèles de type Transformer comptent souvent des milliards de paramètres.


L’optimisation efficace est donc critique :
▶ pour la vitesse de convergence,
▶ pour la stabilité de l’entraînement,
▶ pour la généralisation du modèle.
Trois leviers principaux :
▶ Algorithmes d’optimisation (ex : Adam)
▶ Programmation du taux d’apprentissage (warm-up, decay)
▶ Régularisation (Dropout, Weight Decay, Label smoothing)

Un entraînement réussi repose sur la synergie entre ces techniques.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 19 / 28
Algorithme Adam (Adaptive Moment Estimation)

Algorithme Adam (Adaptive Moment Estimation)

Adam est un algorithme d’optimisation stochastique à pas adaptatif. Il combine deux méthodes :
▶ Momentum : moyenne exponentielle des gradients passés.
▶ RMSProp : moyenne exponentielle du carré des gradients.
Soit Lt (θ) la fonction de perte à l’étape t . À chaque itération, on calcule :

gt = ∇θ Lt (θt−1 ) (gradient instantané)


mt = β1 mt−1 + (1 − β1 )gt (moyenne mobile 1er ordre)
vt = β2 vt−1 + (1 − β2 )gt2 (moyenne mobile 2nd ordre, au carré)

Correction des biais (car m0 = 0, v0 = 0 induisent un biais vers 0 au début) :


mt
m̂t = ,
1 − βt1
vt
v̂t =
1 − βt2

Mise à jour des paramètres :


m̂t
θt = θt−1 − η · √
v̂t + ε
où :
▶ η : taux d’apprentissage,
▶ ε : petit terme de stabilité (typiquement 10−8 ),
▶ β1 , β2 : coefficients de lissage (≈ 0.9 et 0.999 respectivement).

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 20 / 28
Algorithme Adam (Adaptive Moment Estimation)

Algorithme Adam (Adaptive Moment Estimation)

Adam est un algorithme d’optimisation stochastique à pas adaptatif. Il combine deux méthodes :
▶ Momentum : moyenne exponentielle des gradients passés.
▶ RMSProp : moyenne exponentielle du carré des gradients.
Soit Lt (θ) la fonction de perte à l’étape t . À chaque itération, on calcule :

gt = ∇θ Lt (θt−1 ) (gradient instantané)


mt = β1 mt−1 + (1 − β1 )gt (moyenne mobile 1er ordre)
vt = β2 vt−1 + (1 − β2 )gt2 (moyenne mobile 2nd ordre, au carré)

Correction des biais (car m0 = 0, v0 = 0 induisent un biais vers 0 au début) :


mt
m̂t = ,
1 − βt1
vt
v̂t =
1 − βt2

Mise à jour des paramètres :


m̂t
θt = θt−1 − η · √
v̂t + ε
où :
▶ η : taux d’apprentissage,
▶ ε : petit terme de stabilité (typiquement 10−8 ),
▶ β1 , β2 : coefficients de lissage (≈ 0.9 et 0.999 respectivement).

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 20 / 28
Algorithme Adam (Adaptive Moment Estimation)

Warm-up et décroissance du taux d’apprentissage

Adam ou tout optimiseur peut être combiné avec un planning du taux d’apprentissage ηt .
Problème : si η est trop grand initialement ⇒ explosion des gradients ou divergence.
Solution : stratégie de Warm-up :
t
ηt = ηmax · , pour t ≤ Nwarm
Nwarm
où :
▶ Nwarm : nombre d’étapes de chauffe,
▶ ηmax : taux d’apprentissage maximal.
Après le Warm-up : décroissance du taux d’apprentissage :
▶ Inverse Square Root Decay (Transformer) :
ηmax
ηt = √ , t > Nwarm
t
▶ Cosine Annealing :
( ( ))
1 t − Nwarm
ηt = ηmin + (ηmax − ηmin ) 1 + cos π ·
2 T − Nwarm
▶ Exponential Decay :
ηt = ηmax · γt−Nwarm , γ ∈ (0, 1)
Ces stratégies assurent stabilité initiale et convergence plus fine.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 21 / 28
Algorithme Adam (Adaptive Moment Estimation)

Warm-up et décroissance du taux d’apprentissage

Adam ou tout optimiseur peut être combiné avec un planning du taux d’apprentissage ηt .
Problème : si η est trop grand initialement ⇒ explosion des gradients ou divergence.
Solution : stratégie de Warm-up :
t
ηt = ηmax · , pour t ≤ Nwarm
Nwarm
où :
▶ Nwarm : nombre d’étapes de chauffe,
▶ ηmax : taux d’apprentissage maximal.
Après le Warm-up : décroissance du taux d’apprentissage :
▶ Inverse Square Root Decay (Transformer) :
ηmax
ηt = √ , t > Nwarm
t
▶ Cosine Annealing :
( ( ))
1 t − Nwarm
ηt = ηmin + (ηmax − ηmin ) 1 + cos π ·
2 T − Nwarm
▶ Exponential Decay :
ηt = ηmax · γt−Nwarm , γ ∈ (0, 1)
Ces stratégies assurent stabilité initiale et convergence plus fine.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 21 / 28
Algorithme Adam (Adaptive Moment Estimation)

Régularisation dans les Transformers

Les modèles Transformer sont complexes ⇒ risque de surapprentissage élevé.


Dropout : on applique un masque aléatoire de Bernoulli sur les activations x :

y=x Bernoulli(p), où p = probabilité de conservation

▶ À l’inférence, on multiplie les activations par p pour conserver l’espérance.


Weight Decay : pénalisation L2 des grands poids :

Ltotale = Ldonnées + λ · kθk22

▶ Encourage les poids à rester petits.


▶ Interprétable comme une régularisation bayésienne (prior gaussien sur θ).
Label Smoothing : on évite la surconfiance sur une seule classe :

ε
qsmoothed (y) = (1 − ε) · δy,y∗ +
K

▶ δy,y∗ : distribution de Dirac (1 si y = y∗ , 0 sinon).


▶ K : nombre de classes.
▶ Cela revient à mélanger la vérité avec une distribution uniforme.

Effet global : meilleure généralisation, meilleure robustesse à l’overfitting.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 22 / 28
Algorithme Adam (Adaptive Moment Estimation)

Courbe typique de taux d’apprentissage

Taux d’apprentissage

ηt = 1

t
Fin warm-up

warm-up linéaire

Itérations

Cette courbe illustre une stratégie classique de variation du taux d’apprentissage : une phase
√ de warm-up linéaire où ηt croît
progressivement pour stabiliser l’entraînement, suivie d’une décroissance selon une loi en 1/ t afin de permettre une convergence plus
fine en fin d’entraînement. La transition entre les deux phases se fait au point noté "Fin warm-up".

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 23 / 28
Alignement des modèles de langage par RLHF

Alignement des modèles de langage par RLHF

Les modèles de langage (GPT, T5, etc.) sont préentraînés pour approximer la distribution conditionnelle de texte :

fθ (y|x) ≈ P(y|x)

mais cela ne garantit pas que les réponses soient alignées avec les attentes humaines (éthique, utilité, sécurité, etc.).
Objectif de l’alignement : modifier la politique fθ pour qu’elle génère des sorties préférées par les humains.
Méthodologie classique : RLHF (Reinforcement Learning from Human Feedback) :
1 Préentraînement du modèle sur un grand corpus D (objectif de type maximum de vraisemblance) :

max
θ
∑ log fθ (y|x)
(x,y)∈D


2 Collecte de préférences humaines : pour chaque requête xi , on compare deux réponses y+
i (préférée) et yi .
3 Entraînement d’un modèle de récompense rϕ (x, y) pour approximer les préférences :
( )
max ∑ log σ rϕ (xi , y+ −
i ) − rϕ (xi , yi )
ϕ i

avec σ(z) = 1
1+e−z
la fonction sigmoïde.
4 Optimisation par renforcement (PPO) : [ ]
max Ey∼ fθ (·|x) rϕ (x, y) − β · KL( fθ k fbase )
θ
où fbase est la politique préentraînée.
Ey∼ fθ (·|x) [·] signifie qu’on calcule l’espérance (la moyenne) sur les différentes réponses y générées par le modèle fθ
conditionnellement à une entrée x.
Référence clé : InstructGPT, Ouyang et al., 2022.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 24 / 28
Alignement des modèles de langage par RLHF

Alignement des modèles de langage par RLHF

Les modèles de langage (GPT, T5, etc.) sont préentraînés pour approximer la distribution conditionnelle de texte :

fθ (y|x) ≈ P(y|x)

mais cela ne garantit pas que les réponses soient alignées avec les attentes humaines (éthique, utilité, sécurité, etc.).
Objectif de l’alignement : modifier la politique fθ pour qu’elle génère des sorties préférées par les humains.
Méthodologie classique : RLHF (Reinforcement Learning from Human Feedback) :
1 Préentraînement du modèle sur un grand corpus D (objectif de type maximum de vraisemblance) :

max
θ
∑ log fθ (y|x)
(x,y)∈D


2 Collecte de préférences humaines : pour chaque requête xi , on compare deux réponses y+
i (préférée) et yi .
3 Entraînement d’un modèle de récompense rϕ (x, y) pour approximer les préférences :
( )
max ∑ log σ rϕ (xi , y+ −
i ) − rϕ (xi , yi )
ϕ i

avec σ(z) = 1
1+e−z
la fonction sigmoïde.
4 Optimisation par renforcement (PPO) : [ ]
max Ey∼ fθ (·|x) rϕ (x, y) − β · KL( fθ k fbase )
θ
où fbase est la politique préentraînée.
Ey∼ fθ (·|x) [·] signifie qu’on calcule l’espérance (la moyenne) sur les différentes réponses y générées par le modèle fθ
conditionnellement à une entrée x.
Référence clé : InstructGPT, Ouyang et al., 2022.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 24 / 28
Alignement des modèles de langage par RLHF

Alignement des modèles de langage par RLHF

Les modèles de langage (GPT, T5, etc.) sont préentraînés pour approximer la distribution conditionnelle de texte :

fθ (y|x) ≈ P(y|x)

mais cela ne garantit pas que les réponses soient alignées avec les attentes humaines (éthique, utilité, sécurité, etc.).
Objectif de l’alignement : modifier la politique fθ pour qu’elle génère des sorties préférées par les humains.
Méthodologie classique : RLHF (Reinforcement Learning from Human Feedback) :
1 Préentraînement du modèle sur un grand corpus D (objectif de type maximum de vraisemblance) :

max
θ
∑ log fθ (y|x)
(x,y)∈D


2 Collecte de préférences humaines : pour chaque requête xi , on compare deux réponses y+
i (préférée) et yi .
3 Entraînement d’un modèle de récompense rϕ (x, y) pour approximer les préférences :
( )
max ∑ log σ rϕ (xi , y+ −
i ) − rϕ (xi , yi )
ϕ i

avec σ(z) = 1
1+e−z
la fonction sigmoïde.
4 Optimisation par renforcement (PPO) : [ ]
max Ey∼ fθ (·|x) rϕ (x, y) − β · KL( fθ k fbase )
θ
où fbase est la politique préentraînée.
Ey∼ fθ (·|x) [·] signifie qu’on calcule l’espérance (la moyenne) sur les différentes réponses y générées par le modèle fθ
conditionnellement à une entrée x.
Référence clé : InstructGPT, Ouyang et al., 2022.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 24 / 28
Alignement des modèles de langage par RLHF

Formulation mathématique du RLHF

Soit une requête x et deux réponses y+ (préférée) et y− (moins bonne).


On entraîne un modèle de récompense rϕ (x, y) avec une perte par paires :
( )
Lreward (ϕ) = − ∑ log σ rϕ (xi , y+ −
i ) − rϕ (xi , yi )
i

où σ est la fonction sigmoïde : σ(z) = 1


1+e−z
.
Ensuite, on optimise une politique fθ pour maximiser la récompense, tout en restant proche de la politique de base fbase :

LRL (θ) = Ey∼ fθ (·|x) [rϕ (x, y)] − β · KL( fθ k fbase )


Cette optimisation est effectuée par PPO (Proximal Policy Optimization) :
[ ( )]
LPPO (θ) = Et min rt (θ)Ât , clip(rt (θ), 1 − ε, 1 + ε)Ât

où :
▶ rt (θ) = fθ (yt |xt )
est le rapport de probabilité,
fθold (yt |xt )
▶ Ât est l’estimateur de l’avantage (par ex., Ât = rϕ (xt , yt ) − bt avec bt une baseline),
▶ ε est un hyperparamètre (souvent 0.1 ou 0.2).

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 25 / 28
Alignement des modèles de langage par RLHF

Formulation mathématique du RLHF

Soit une requête x et deux réponses y+ (préférée) et y− (moins bonne).


On entraîne un modèle de récompense rϕ (x, y) avec une perte par paires :
( )
Lreward (ϕ) = − ∑ log σ rϕ (xi , y+ −
i ) − rϕ (xi , yi )
i

où σ est la fonction sigmoïde : σ(z) = 1


1+e−z
.
Ensuite, on optimise une politique fθ pour maximiser la récompense, tout en restant proche de la politique de base fbase :

LRL (θ) = Ey∼ fθ (·|x) [rϕ (x, y)] − β · KL( fθ k fbase )


Cette optimisation est effectuée par PPO (Proximal Policy Optimization) :
[ ( )]
LPPO (θ) = Et min rt (θ)Ât , clip(rt (θ), 1 − ε, 1 + ε)Ât

où :
▶ rt (θ) = fθ (yt |xt )
est le rapport de probabilité,
fθold (yt |xt )
▶ Ât est l’estimateur de l’avantage (par ex., Ât = rϕ (xt , yt ) − bt avec bt une baseline),
▶ ε est un hyperparamètre (souvent 0.1 ou 0.2).

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 25 / 28
Alignement des modèles de langage par RLHF

Formulation mathématique du RLHF

Soit une requête x et deux réponses y+ (préférée) et y− (moins bonne).


On entraîne un modèle de récompense rϕ (x, y) avec une perte par paires :
( )
Lreward (ϕ) = − ∑ log σ rϕ (xi , y+ −
i ) − rϕ (xi , yi )
i

où σ est la fonction sigmoïde : σ(z) = 1


1+e−z
.
Ensuite, on optimise une politique fθ pour maximiser la récompense, tout en restant proche de la politique de base fbase :

LRL (θ) = Ey∼ fθ (·|x) [rϕ (x, y)] − β · KL( fθ k fbase )


Cette optimisation est effectuée par PPO (Proximal Policy Optimization) :
[ ( )]
LPPO (θ) = Et min rt (θ)Ât , clip(rt (θ), 1 − ε, 1 + ε)Ât

où :
▶ rt (θ) = fθ (yt |xt )
est le rapport de probabilité,
fθold (yt |xt )
▶ Ât est l’estimateur de l’avantage (par ex., Ât = rϕ (xt , yt ) − bt avec bt une baseline),
▶ ε est un hyperparamètre (souvent 0.1 ou 0.2).

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 25 / 28
Alignement des modèles de langage par RLHF

Architectures Transformer : BERT, GPT, T5

BERT
Encodeur uniquement basé sur l’attention bidirectionnelle.
Objectif : Masked Language Modeling (MLM).
T5 (Text-to-Text Transfer Transformer)
max
θ
∑ log fθ (yi |xmasqué ) Architecture complète encodeur-décodeur.
i∈mask
Objectif unifié : tous les problèmes sont formulés comme des
Applications : classification, NER, question answering, etc. tâches de transformation texte → texte.

GPT x 7→ y où x, y ∈ V ∗
Décodeur uniquement, avec attention causale Préentraînement par Corrupted Span Prediction :
(unidirectionnelle). ▶ Plusieurs spans consécutifs sont masqués,
▶ Le modèle doit reconstruire les morceaux masqués.
Objectif : Next Token Prediction.
Très flexible pour la traduction, résumé, QA, etc.
max ∑ log fθ (yt |y<t )
θ t

Utilisé pour la génération de texte (autoregressive decoding).

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 26 / 28
Alignement des modèles de langage par RLHF

Architectures Transformer : BERT, GPT, T5

BERT
Encodeur uniquement basé sur l’attention bidirectionnelle.
Objectif : Masked Language Modeling (MLM).
T5 (Text-to-Text Transfer Transformer)
max
θ
∑ log fθ (yi |xmasqué ) Architecture complète encodeur-décodeur.
i∈mask
Objectif unifié : tous les problèmes sont formulés comme des
Applications : classification, NER, question answering, etc. tâches de transformation texte → texte.

GPT x 7→ y où x, y ∈ V ∗
Décodeur uniquement, avec attention causale Préentraînement par Corrupted Span Prediction :
(unidirectionnelle). ▶ Plusieurs spans consécutifs sont masqués,
▶ Le modèle doit reconstruire les morceaux masqués.
Objectif : Next Token Prediction.
Très flexible pour la traduction, résumé, QA, etc.
max ∑ log fθ (yt |y<t )
θ t

Utilisé pour la génération de texte (autoregressive decoding).

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 26 / 28
Alignement des modèles de langage par RLHF

Comparaison architecturale des modèles Transformer

Sortie générée
BERT (Encodeur) GPT (Décodeur) T5 (Encodeur-Décodeur)

Entrée tokenisée Entrée texte

Légende
BERT : encodeur bidirectionnel optimisé pour la compréhension (classification, QA).
GPT : décodeur unidirectionnel pour la génération de texte.
T5 : architecture encodeur-décodeur unifiée pour toutes les tâches sous forme textetexte.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 27 / 28
Alignement des modèles de langage par RLHF

Conclusion du Module 3

Modèles de langage modernes combinent :


▶ Apprentissage auto-supervisé massif
▶ Architectures Transformer spécialisées
▶ Optimisation à très grande échelle
▶ Alignement via feedback humain (RLHF)

GPT, BERT, T5 : chacun avec une philosophie propre


RLHF est aujourd’hui essentiel pour des LLM sûrs et utiles.

Prochaine étape
Module 4 : Préentraînement à grande échelle et fine-tuning spécialisé.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 28 / 28
Alignement des modèles de langage par RLHF

Conclusion du Module 3

Modèles de langage modernes combinent :


▶ Apprentissage auto-supervisé massif
▶ Architectures Transformer spécialisées
▶ Optimisation à très grande échelle
▶ Alignement via feedback humain (RLHF)

GPT, BERT, T5 : chacun avec une philosophie propre


RLHF est aujourd’hui essentiel pour des LLM sûrs et utiles.

Prochaine étape
Module 4 : Préentraînement à grande échelle et fine-tuning spécialisé.

Tiebekabe Pagdame Enseignant-chercheur Fondements Mathématiques des Transformers et des LLMs 14 juillet 2025 28 / 28

Vous aimerez peut-être aussi