0% ont trouvé ce document utile (0 vote)
17 vues2 pages

Introduction aux Transformers en NLP

Le document présente l'émergence des modèles Transformers, introduits par Vaswani et al. en 2017, comme une réponse aux limitations des approches classiques de traitement des séquences. Il décrit les caractéristiques clés des Transformers, notamment le mécanisme d'attention, la multi-head attention et l'encodage positionnel, qui permettent un traitement parallèle et une meilleure capture des dépendances à long terme. À la fin du module, les étudiants comprendront l'évolution des architectures de deep learning et l'impact révolutionnaire des Transformers sur l'intelligence artificielle.

Transféré par

sevenindustries56
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
17 vues2 pages

Introduction aux Transformers en NLP

Le document présente l'émergence des modèles Transformers, introduits par Vaswani et al. en 2017, comme une réponse aux limitations des approches classiques de traitement des séquences. Il décrit les caractéristiques clés des Transformers, notamment le mécanisme d'attention, la multi-head attention et l'encodage positionnel, qui permettent un traitement parallèle et une meilleure capture des dépendances à long terme. À la fin du module, les étudiants comprendront l'évolution des architectures de deep learning et l'impact révolutionnaire des Transformers sur l'intelligence artificielle.

Transféré par

sevenindustries56
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd

Week 2: Birth of Transformers

1. Contexte et Motivation

 Besoin d’un modèle capable de capturer des relations globales dans les séquences.
 Limites des approches classiques nécessitant de nouvelles méthodes.
 Approche révolutionnaire proposée par Vaswani et al. (2017).

2. Introduction au modèle Transformer

 Concept central : "Attention Is All You Need"


 Introduction de l’attention comme mécanisme principal pour capturer les
dépendances entre mots.
 Différence fondamentale : les transformers ne traitent pas les mots de manière
séquentielle mais simultanément.

3. Différences entre RNNs et Transformers

Caractéristique RNN/LSTM Transformers


Traitement des séquences Séquentiel Parallèle
Capte les relations longues via
Mémoire des relations Limité aux états cachés
l'attention
O(1)O(1)O(1) (entièrement
Complexité computationnelle O(n)O(n)O(n) (séquentiel)
parallèle)
Apprentissage des dépendances Difficile (vanishing Plus efficace avec multi-head
longues gradient) attention
Traditionnelle (chatbots, Modèles modernes (GPT,
Utilisation en NLP
traduction) BERT, T5)

4. Composants clés du modèle Transformer

4.1. Self-Attention

 Mécanisme permettant au modèle de pondérer l’importance de chaque mot d’une


séquence par rapport aux autres.
 Rôle des matrices Q, K, V dans le calcul des scores d’attention.

4.2. Multi-Head Attention

 Utilisation de plusieurs têtes d’attention pour apprendre différentes relations dans les
séquences.

4.3. Positional Encoding

 Ajout d’informations de position dans la séquence pour compenser l’absence de


traitement séquentiel.

4.4. Normalization et Skip Connections


 Techniques pour stabiliser l’apprentissage et améliorer la convergence.

Conclusion du Module 1
À la fin de ce module, les étudiants auront une compréhension approfondie de :

 L’évolution des architectures de deep learning utilisées pour le traitement du langage.


 Les forces et faiblesses des modèles séquentiels traditionnels (RNNs, LSTMs, CNNs).
 Pourquoi et comment les transformers ont révolutionné l’intelligence artificielle.
 Les concepts fondamentaux de l’article "Attention Is All You Need", qui seront
explorés en détail dans les modules suivants.

Vous aimerez peut-être aussi