0% ont trouvé ce document utile (0 vote)
18 vues2 pages

Encodage Positional et Réseaux Feed-Forward

Le document traite de l'encodage positionnel et des réseaux de neurones feed-forward dans les transformeurs, soulignant l'importance d'injecter des informations de position pour traiter les séquences de mots. Il explique les formules mathématiques utilisées pour l'encodage positionnel et le fonctionnement des réseaux feed-forward, ainsi que l'importance de la normalisation et des connexions résiduelles pour stabiliser l'entraînement. À la fin du module, les étudiants seront capables de comprendre et d'implémenter ces concepts clés dans les transformeurs.

Transféré par

sevenindustries56
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
18 vues2 pages

Encodage Positional et Réseaux Feed-Forward

Le document traite de l'encodage positionnel et des réseaux de neurones feed-forward dans les transformeurs, soulignant l'importance d'injecter des informations de position pour traiter les séquences de mots. Il explique les formules mathématiques utilisées pour l'encodage positionnel et le fonctionnement des réseaux feed-forward, ainsi que l'importance de la normalisation et des connexions résiduelles pour stabiliser l'entraînement. À la fin du module, les étudiants seront capables de comprendre et d'implémenter ces concepts clés dans les transformeurs.

Transféré par

sevenindustries56
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd

Week 4: Positional Encoding & Feed-Forward Networks

1. Problème de l’Ordre dans Transformers

 Contrairement aux RNNs, les transformeurs ne traitent pas les mots dans un ordre
spécifique.
 Besoin d’une méthode pour injecter une information de position dans les
embeddings des mots.

2. Positional Encoding: Ajout de l’Information de Position

 Idée : utiliser des fonctions mathématiques pour ajouter un repère spatial aux mots.
 Formule des encodages positionnels :

PE(pos,2i)=sin⁡(pos/100002i/dmodel)PE_{(pos, 2i)} = \sin(pos /


10000^{2i/d_{model}})PE(pos,2i)=sin(pos/100002i/dmodel)
PE(pos,2i+1)=cos⁡(pos/100002i/dmodel)PE_{(pos, 2i+1)} = \cos(pos /
10000^{2i/d_{model}})PE(pos,2i+1)=cos(pos/100002i/dmodel)

Où :

o pospospos = position du mot dans la séquence.


o dmodeld_{model}dmodel = dimension du modèle.
o Les fonctions sinusoïdales permettent de capter des relations entre mots
proches et éloignés.
 Pourquoi utiliser des sinus et cosinus ?
✅ Introduit une continuité dans les positions.
✅ Capte les relations entre les mots indépendamment de la longueur de la phrase.
✅ Peut être appris directement par le modèle.

3. Feed-Forward Networks (FFN)

 Chaque couche du transformeur inclut un réseau de neurones feed-forward appliqué


à chaque mot indépendamment.
 Formule du FFN :

FFN(x)=max⁡(0,xW1+b1)W2+b2\text{FFN}(x) = \max(0, xW_1 + b_1) W_2 +


b_2FFN(x)=max(0,xW1+b1)W2+b2

Où :

o W1,W2W_1, W_2W1,W2, b1,b2b_1, b_2b1,b2 sont les poids et biais du


réseau.
o ReLU est utilisée comme fonction d’activation.
 Pourquoi inclure un FFN ?
✅ Ajoute une couche de transformation non-linéaire après l’attention.
✅ Applique une projection des dimensions internes du modèle.
✅ Permet une meilleure expressivité du modèle.

4. Normalization et Residual Connections

 Problème :
o L’entraînement des transformers peut être instable.
o La profondeur du réseau peut causer des problèmes de gradient.
 Solution : Normalisation de Couches (Layer Normalization)

LayerNorm(x)=x−μσ+ϵγ+β\text{LayerNorm}(x) = \frac{x - \mu}{\sigma + \epsilon} \


gamma + \betaLayerNorm(x)=σ+ϵx−μγ+β

Où :

o μ,σ\mu, \sigmaμ,σ sont la moyenne et l’écart-type de xxx.


o γ,β\gamma, \betaγ,β sont des paramètres apprenables.
 Residual Connections (Connexions Résiduelles)
o Permet aux gradients de mieux circuler dans le réseau.
o Formule : Output=x+Attention(x)\text{Output} = x + \text{Attention}
(x)Output=x+Attention(x)
o Avantage : facilite l’entraînement des réseaux profonds.

Conclusion du Module 2
À la fin de ce module, les étudiants seront capables de :
✅ Comprendre et implémenter l’auto-attention multi-tête.
✅ Expliquer le rôle des encodages positionnels dans les transformers.
✅ Maîtriser l’architecture interne d’un transformer, y compris les réseaux feed-forward et la
normalisation.

Vous aimerez peut-être aussi