0% ont trouvé ce document utile (0 vote)
2 vues2 pages

Techniques pour éviter l'overfitting

Ce module traite des techniques d'entraînement et d'optimisation des transformeurs, en mettant l'accent sur la préparation des données et les fonctions de perte adaptées aux différentes tâches. Les étudiants apprendront à encoder les entrées, à gérer le batching et le padding, ainsi qu'à appliquer des régularisations pour éviter l'overfitting. Les différentes fonctions de perte pour les modèles génératifs, de classification, de complétion de phrase et de traduction sont également abordées.

Transféré par

sevenindustries56
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
2 vues2 pages

Techniques pour éviter l'overfitting

Ce module traite des techniques d'entraînement et d'optimisation des transformeurs, en mettant l'accent sur la préparation des données et les fonctions de perte adaptées aux différentes tâches. Les étudiants apprendront à encoder les entrées, à gérer le batching et le padding, ainsi qu'à appliquer des régularisations pour éviter l'overfitting. Les différentes fonctions de perte pour les modèles génératifs, de classification, de complétion de phrase et de traduction sont également abordées.

Transféré par

sevenindustries56
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd

Module 3: Training and Optimization of

Transformers
Ce module aborde les techniques d’entraînement des transformeurs, en couvrant les
stratégies d’optimisation, les pertes spécifiques, et les améliorations récentes pour rendre ces
modèles plus efficaces. Les étudiants apprendront les étapes essentielles pour entraîner un
modèle transformer et l’adapter à des tâches spécifiques.

Week 5: Training Pipeline and Loss Functions


1. Préparation des Données

 Encodage des entrées :


o Tokenization : conversion du texte en tokens utilisables.
o WordPiece/BPE : segmentation des mots en sous-mots (ex. GPT, BERT).
o Ajout des tokens spéciaux (<CLS>, <SEP>, <MASK>) selon la tâche.
 Positional Encoding : incorporation des positions dans les embeddings.
 Batching et Padding :
o Les phrases doivent être de même longueur pour une exécution parallèle.
o Ajout de tokens de remplissage (PAD) pour homogénéiser la longueur.

2. Fonction de Perte (Loss Function) selon la Tâche

 Modèles génératifs (GPT, T5) :


o Cross-Entropy Loss : compare la probabilité du token généré avec le token
cible.
o

L = - \sum y_i \log(\hat{y}_i) ]

 Modèles de classification (BERT, RoBERTa) :


o Objectif : classifier une séquence en une catégorie.
o Utilisation d’une Softmax + Cross-Entropy.
 Modèles de complétion de phrase (BERT - MLM) :
o Objectif : prédire un mot masqué.
o Masked Language Model Loss : on entraîne le modèle à deviner les mots
cachés.
 Modèles de traduction (T5, MarianMT) :
o Seq2Seq Loss : alignement entre phrase source et cible.

3. Rôle des Regularizations

 Dropout : évite l’overfitting en désactivant aléatoirement des neurones.


 Weight Decay : prévient les poids excessifs qui pourraient causer du surajustement.
 Gradient Clipping : empêche les gradients explosifs pendant l’entraînement.

Vous aimerez peut-être aussi