Week 2: Birth of Transformers
1. Contexte et Motivation
Besoin d’un modèle capable de capturer des relations globales dans les séquences.
Limites des approches classiques nécessitant de nouvelles méthodes.
Approche révolutionnaire proposée par Vaswani et al. (2017).
2. Introduction au modèle Transformer
Concept central : "Attention Is All You Need"
Introduction de l’attention comme mécanisme principal pour capturer les
dépendances entre mots.
Différence fondamentale : les transformers ne traitent pas les mots de manière
séquentielle mais simultanément.
3. Différences entre RNNs et Transformers
Caractéristique RNN/LSTM Transformers
Traitement des séquences Séquentiel Parallèle
Capte les relations longues via
Mémoire des relations Limité aux états cachés
l'attention
O(1)O(1)O(1) (entièrement
Complexité computationnelle O(n)O(n)O(n) (séquentiel)
parallèle)
Apprentissage des dépendances Difficile (vanishing Plus efficace avec multi-head
longues gradient) attention
Traditionnelle (chatbots, Modèles modernes (GPT,
Utilisation en NLP
traduction) BERT, T5)
4. Composants clés du modèle Transformer
4.1. Self-Attention
Mécanisme permettant au modèle de pondérer l’importance de chaque mot d’une
séquence par rapport aux autres.
Rôle des matrices Q, K, V dans le calcul des scores d’attention.
4.2. Multi-Head Attention
Utilisation de plusieurs têtes d’attention pour apprendre différentes relations dans les
séquences.
4.3. Positional Encoding
Ajout d’informations de position dans la séquence pour compenser l’absence de
traitement séquentiel.
4.4. Normalization et Skip Connections
Techniques pour stabiliser l’apprentissage et améliorer la convergence.
Conclusion du Module 1
À la fin de ce module, les étudiants auront une compréhension approfondie de :
L’évolution des architectures de deep learning utilisées pour le traitement du langage.
Les forces et faiblesses des modèles séquentiels traditionnels (RNNs, LSTMs, CNNs).
Pourquoi et comment les transformers ont révolutionné l’intelligence artificielle.
Les concepts fondamentaux de l’article "Attention Is All You Need", qui seront
explorés en détail dans les modules suivants.