Module 3: Training and Optimization of
Transformers
Ce module aborde les techniques d’entraînement des transformeurs, en couvrant les
stratégies d’optimisation, les pertes spécifiques, et les améliorations récentes pour rendre ces
modèles plus efficaces. Les étudiants apprendront les étapes essentielles pour entraîner un
modèle transformer et l’adapter à des tâches spécifiques.
Week 5: Training Pipeline and Loss Functions
1. Préparation des Données
Encodage des entrées :
o Tokenization : conversion du texte en tokens utilisables.
o WordPiece/BPE : segmentation des mots en sous-mots (ex. GPT, BERT).
o Ajout des tokens spéciaux (<CLS>, <SEP>, <MASK>) selon la tâche.
Positional Encoding : incorporation des positions dans les embeddings.
Batching et Padding :
o Les phrases doivent être de même longueur pour une exécution parallèle.
o Ajout de tokens de remplissage (PAD) pour homogénéiser la longueur.
2. Fonction de Perte (Loss Function) selon la Tâche
Modèles génératifs (GPT, T5) :
o Cross-Entropy Loss : compare la probabilité du token généré avec le token
cible.
o
L = - \sum y_i \log(\hat{y}_i) ]
Modèles de classification (BERT, RoBERTa) :
o Objectif : classifier une séquence en une catégorie.
o Utilisation d’une Softmax + Cross-Entropy.
Modèles de complétion de phrase (BERT - MLM) :
o Objectif : prédire un mot masqué.
o Masked Language Model Loss : on entraîne le modèle à deviner les mots
cachés.
Modèles de traduction (T5, MarianMT) :
o Seq2Seq Loss : alignement entre phrase source et cible.
3. Rôle des Regularizations
Dropout : évite l’overfitting en désactivant aléatoirement des neurones.
Weight Decay : prévient les poids excessifs qui pourraient causer du surajustement.
Gradient Clipping : empêche les gradients explosifs pendant l’entraînement.