Week 4: Positional Encoding & Feed-Forward Networks
1. Problème de l’Ordre dans Transformers
Contrairement aux RNNs, les transformeurs ne traitent pas les mots dans un ordre
spécifique.
Besoin d’une méthode pour injecter une information de position dans les
embeddings des mots.
2. Positional Encoding: Ajout de l’Information de Position
Idée : utiliser des fonctions mathématiques pour ajouter un repère spatial aux mots.
Formule des encodages positionnels :
PE(pos,2i)=sin(pos/100002i/dmodel)PE_{(pos, 2i)} = \sin(pos /
10000^{2i/d_{model}})PE(pos,2i)=sin(pos/100002i/dmodel)
PE(pos,2i+1)=cos(pos/100002i/dmodel)PE_{(pos, 2i+1)} = \cos(pos /
10000^{2i/d_{model}})PE(pos,2i+1)=cos(pos/100002i/dmodel)
Où :
o pospospos = position du mot dans la séquence.
o dmodeld_{model}dmodel = dimension du modèle.
o Les fonctions sinusoïdales permettent de capter des relations entre mots
proches et éloignés.
Pourquoi utiliser des sinus et cosinus ?
✅ Introduit une continuité dans les positions.
✅ Capte les relations entre les mots indépendamment de la longueur de la phrase.
✅ Peut être appris directement par le modèle.
3. Feed-Forward Networks (FFN)
Chaque couche du transformeur inclut un réseau de neurones feed-forward appliqué
à chaque mot indépendamment.
Formule du FFN :
FFN(x)=max(0,xW1+b1)W2+b2\text{FFN}(x) = \max(0, xW_1 + b_1) W_2 +
b_2FFN(x)=max(0,xW1+b1)W2+b2
Où :
o W1,W2W_1, W_2W1,W2, b1,b2b_1, b_2b1,b2 sont les poids et biais du
réseau.
o ReLU est utilisée comme fonction d’activation.
Pourquoi inclure un FFN ?
✅ Ajoute une couche de transformation non-linéaire après l’attention.
✅ Applique une projection des dimensions internes du modèle.
✅ Permet une meilleure expressivité du modèle.
4. Normalization et Residual Connections
Problème :
o L’entraînement des transformers peut être instable.
o La profondeur du réseau peut causer des problèmes de gradient.
Solution : Normalisation de Couches (Layer Normalization)
LayerNorm(x)=x−μσ+ϵγ+β\text{LayerNorm}(x) = \frac{x - \mu}{\sigma + \epsilon} \
gamma + \betaLayerNorm(x)=σ+ϵx−μγ+β
Où :
o μ,σ\mu, \sigmaμ,σ sont la moyenne et l’écart-type de xxx.
o γ,β\gamma, \betaγ,β sont des paramètres apprenables.
Residual Connections (Connexions Résiduelles)
o Permet aux gradients de mieux circuler dans le réseau.
o Formule : Output=x+Attention(x)\text{Output} = x + \text{Attention}
(x)Output=x+Attention(x)
o Avantage : facilite l’entraînement des réseaux profonds.
Conclusion du Module 2
À la fin de ce module, les étudiants seront capables de :
✅ Comprendre et implémenter l’auto-attention multi-tête.
✅ Expliquer le rôle des encodages positionnels dans les transformers.
✅ Maîtriser l’architecture interne d’un transformer, y compris les réseaux feed-forward et la
normalisation.