0% ont trouvé ce document utile (0 vote)
0 vues20 pages

02 Deep Learning Reseaux Neurones

Ce document présente un cours intermédiaire sur le Deep Learning, axé sur la compréhension des mécanismes des réseaux de neurones, l'optimisation et l'utilisation des Transformers. Il est destiné aux développeurs ML, Data Scientists et AI Engineers et inclut des exemples pratiques, des exercices et un projet. L'objectif est de former des ingénieurs capables de diagnostiquer et d'optimiser des architectures de réseaux profonds plutôt que de simplement mémoriser des recettes.

Transféré par

naumur2017
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
0 vues20 pages

02 Deep Learning Reseaux Neurones

Ce document présente un cours intermédiaire sur le Deep Learning, axé sur la compréhension des mécanismes des réseaux de neurones, l'optimisation et l'utilisation des Transformers. Il est destiné aux développeurs ML, Data Scientists et AI Engineers et inclut des exemples pratiques, des exercices et un projet. L'objectif est de former des ingénieurs capables de diagnostiquer et d'optimiser des architectures de réseaux profonds plutôt que de simplement mémoriser des recettes.

Transféré par

naumur2017
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Deep Learning - Réseaux de

neurones, optimisation et
Transformers
Comprendre les mécanismes qui permettent aux réseaux profonds
d’apprendre et de généraliser

Niveau Intermédiaire

Public Développeurs ML, Data Scientists et AI Engineers

Format Cours structuré + exemples + exercices + projet

Objectif Savoir raisonner sur un entraînement profond et diagnostiquer architecture, optimisa

Ce document est conçu comme un support de formation autonome. Il


privilégie la compréhension des mécanismes, la capacité à diagnostiquer un
système et le raisonnement d'ingénierie plutôt que la mémorisation de
recettes.

Cours 2 - Deep Learning Page 1


Comment utiliser ce cours
Ce cours suppose les notions de train/validation/test, métriques et sur-apprentissage. Les blocs de code
sont volontairement courts : ils servent à rattacher les concepts à une implémentation, pas à remplacer
la documentation d'un framework.

Sommaire
1. Du neurone artificiel au réseau profond
2. Fonctions de perte, backpropagation et descente de gradient
3. Initialisation, normalisation, régularisation et stabilité
4. Réseaux convolutifs et représentation des images
5. Séquences, embeddings, RNN et attention
6. Transformers : blocs, self-attention et représentations contextuelles
7. Entraînement pratique : datasets, mixed precision, checkpoints et reproductibilité
8. Transfer learning, fine-tuning et choix entre entraîner ou réutiliser
9. Projet guidé
10. Fiche de révision et glossaire

Méthode recommandée
• Tracer systématiquement les courbes train et validation.
• Modifier un facteur majeur à la fois.
• Surveiller mémoire, débit et stabilité numérique.
• Comparer avec un modèle plus simple.
• Conserver checkpoints et configuration complète.

Principe de progression

À chaque chapitre, essaie d'expliquer le concept avec tes propres mots, puis de l'implémenter sur un
petit jeu de données. Un bon AI Engineer doit savoir relier théorie, données, métriques, architecture
logicielle et contraintes produit.

Cours 2 - Deep Learning Page 2


Chapitre 1 - Du neurone artificiel au réseau
profond
Le deep learning apprend automatiquement des représentations hiérarchiques à partir de données. Au
lieu de définir manuellement toutes les features, on empile des transformations paramétrées et on
ajuste leurs poids par optimisation. La puissance du modèle vient de la composition de fonctions
simples, mais cette flexibilité augmente les besoins en données, calcul et discipline expérimentale.

Objectifs pédagogiques
• Comprendre couche, poids, biais et activation.
• Relier profondeur et capacité de représentation.
• Visualiser le passage avant dans un réseau.

Concepts essentiels
Neurone. Un neurone calcule une combinaison pondérée de ses entrées puis applique une fonction
d'activation. Le biais déplace le seuil de réponse et donne plus de flexibilité à la transformation.
L'objectif n'est pas seulement de retenir une définition, mais de comprendre le mécanisme, les
hypothèses et les conséquences pratiques. Dans un projet réel, ce point influence directement les choix
de données, la méthode d'évaluation, la robustesse du modèle et le coût de maintenance.

Couche dense. Une couche dense applique plusieurs neurones en parallèle. Elle transforme un vecteur
d'entrée en une nouvelle représentation dont chaque dimension est apprise. L'objectif n'est pas
seulement de retenir une définition, mais de comprendre le mécanisme, les hypothèses et les
conséquences pratiques. Dans un projet réel, ce point influence directement les choix de données, la
méthode d'évaluation, la robustesse du modèle et le coût de maintenance.

Activation non linéaire. Sans activation non linéaire, plusieurs couches linéaires s'effondrent en une
seule transformation linéaire. ReLU et ses variantes permettent d'apprendre des frontières complexes.
L'objectif n'est pas seulement de retenir une définition, mais de comprendre le mécanisme, les
hypothèses et les conséquences pratiques. Dans un projet réel, ce point influence directement les choix
de données, la méthode d'évaluation, la robustesse du modèle et le coût de maintenance.

Profondeur. Des couches successives peuvent construire des abstractions : motifs locaux, combinaisons
de motifs puis concepts plus haut niveau. La profondeur offre une représentation efficace de
nombreuses fonctions. L'objectif n'est pas seulement de retenir une définition, mais de comprendre le
mécanisme, les hypothèses et les conséquences pratiques. Dans un projet réel, ce point influence
directement les choix de données, la méthode d'évaluation, la robustesse du modèle et le coût de
maintenance.

Paramètres. Les poids et biais sont les variables apprises. Leur nombre détermine une partie de la
capacité du réseau et influe sur mémoire, coût de calcul et risque de sur-apprentissage. L'objectif n'est
pas seulement de retenir une définition, mais de comprendre le mécanisme, les hypothèses et les
conséquences pratiques. Dans un projet réel, ce point influence directement les choix de données, la
méthode d'évaluation, la robustesse du modèle et le coût de maintenance.

Formule / intuition
Couche dense : h = activation(Wx + b). Un réseau profond répète cette opération plusieurs fois jusqu'à
produire la sortie finale.

Exemple de code
import [Link] as nn
model = [Link](
[Link](20, 64), [Link](),
[Link](64, 32), [Link](),

Cours 2 - Deep Learning Page 3


[Link](32, 1)
)

Exemple concret
Pour prédire un risque à partir de vingt variables, une première couche peut apprendre des
combinaisons utiles entre fréquence, récence et volume ; la couche suivante combine ces signaux
intermédiaires pour produire une représentation plus abstraite du comportement.

Pièges fréquents
• Croire que plus de couches garantit une meilleure performance.
• Ignorer le nombre de paramètres et la taille du dataset.
• Utiliser une architecture complexe sans baseline classique.

Exercice
Calcule le nombre de paramètres d'un réseau 20 -> 64 -> 32 -> 1. Puis explique ce qui change si la
première couche passe à 512 neurones.

Cours 2 - Deep Learning Page 4


Chapitre 2 - Fonctions de perte, backpropagation
et descente de gradient
L'apprentissage d'un réseau consiste à réduire une fonction de perte. La backpropagation calcule
efficacement comment chaque paramètre influence cette perte, puis un optimiseur met à jour les
paramètres dans la direction qui améliore le modèle. Comprendre cette boucle permet de
diagnostiquer de nombreux problèmes d'entraînement.

Objectifs pédagogiques
• Comprendre gradient et règle de chaîne.
• Distinguer loss d’entraînement et métrique métier.
• Connaître le rôle de l’optimiseur.

Concepts essentiels
Fonction de perte. La loss traduit l'erreur en une valeur différentiable. MSE est courante en régression ;
cross-entropy est adaptée à de nombreux problèmes de classification. L'objectif n'est pas seulement de
retenir une définition, mais de comprendre le mécanisme, les hypothèses et les conséquences
pratiques. Dans un projet réel, ce point influence directement les choix de données, la méthode
d'évaluation, la robustesse du modèle et le coût de maintenance.

Gradient. Le gradient indique la direction locale d'augmentation la plus rapide de la loss. On met donc à
jour les paramètres dans la direction opposée. L'objectif n'est pas seulement de retenir une définition,
mais de comprendre le mécanisme, les hypothèses et les conséquences pratiques. Dans un projet réel,
ce point influence directement les choix de données, la méthode d'évaluation, la robustesse du modèle
et le coût de maintenance.

Backpropagation. La règle de chaîne propage la sensibilité de la sortie vers les couches précédentes.
Les frameworks automatiques construisent un graphe de calcul et calculent ces dérivées. L'objectif
n'est pas seulement de retenir une définition, mais de comprendre le mécanisme, les hypothèses et les
conséquences pratiques. Dans un projet réel, ce point influence directement les choix de données, la
méthode d'évaluation, la robustesse du modèle et le coût de maintenance.

Optimiseur. SGD effectue une mise à jour simple ; Adam adapte le pas par paramètre à partir de
moments du gradient. Le choix de l'optimiseur compte, mais le learning rate reste souvent le réglage le
plus important. L'objectif n'est pas seulement de retenir une définition, mais de comprendre le
mécanisme, les hypothèses et les conséquences pratiques. Dans un projet réel, ce point influence
directement les choix de données, la méthode d'évaluation, la robustesse du modèle et le coût de
maintenance.

Mini-batch. Au lieu de calculer le gradient sur tout le dataset, on utilise des lots. Cela réduit la mémoire
et introduit un bruit d'optimisation souvent utile à la généralisation. L'objectif n'est pas seulement de
retenir une définition, mais de comprendre le mécanisme, les hypothèses et les conséquences
pratiques. Dans un projet réel, ce point influence directement les choix de données, la méthode
d'évaluation, la robustesse du modèle et le coût de maintenance.

Formule / intuition
Mise à jour de base : theta <- theta - learning_rate * gradient(loss, theta). Si le pas est trop grand,
l'entraînement diverge ; trop petit, il progresse très lentement.

Exemple de code
optimizer.zero_grad()
pred = model(x_batch)
loss = criterion(pred, y_batch)
[Link]()

Cours 2 - Deep Learning Page 5


[Link]()

Exemple concret
Si la loss devient NaN après quelques batches, on examine le learning rate, la normalisation des
entrées, les valeurs extrêmes et les gradients. Réduire le pas ou appliquer gradient clipping peut
stabiliser certains entraînements.

Pièges fréquents
• Oublier de remettre les gradients à zéro.
• Choisir un learning rate sans observer la courbe de loss.
• Confondre amélioration de la loss et amélioration de la métrique métier.

Exercice
Trace train loss et validation loss sur plusieurs epochs. Identifie visuellement une phase de
sous-apprentissage puis une phase de sur-apprentissage. Propose un arrêt anticipé.

Cours 2 - Deep Learning Page 6


Chapitre 3 - Initialisation, normalisation,
régularisation et stabilité
Les réseaux profonds sont sensibles à la dynamique numérique de l'entraînement. Une mauvaise
échelle des activations ou des gradients peut ralentir ou bloquer l'apprentissage. L'initialisation, la
normalisation, le dropout, le weight decay et l'early stopping servent à stabiliser et régulariser le
système.

Objectifs pédagogiques
• Comprendre vanishing/exploding gradients.
• Utiliser dropout, weight decay et early stopping.
• Savoir pourquoi normaliser les activations.

Concepts essentiels
Initialisation. Les poids doivent commencer avec une variance adaptée à la taille des couches. Des
schémas comme Xavier ou He évitent que les signaux ne deviennent trop faibles ou trop grands au
départ. L'objectif n'est pas seulement de retenir une définition, mais de comprendre le mécanisme, les
hypothèses et les conséquences pratiques. Dans un projet réel, ce point influence directement les choix
de données, la méthode d'évaluation, la robustesse du modèle et le coût de maintenance.

Batch normalization. Elle normalise des activations puis apprend une remise à l'échelle. Elle peut
accélérer l'optimisation et rendre les réseaux moins sensibles à l'initialisation. L'objectif n'est pas
seulement de retenir une définition, mais de comprendre le mécanisme, les hypothèses et les
conséquences pratiques. Dans un projet réel, ce point influence directement les choix de données, la
méthode d'évaluation, la robustesse du modèle et le coût de maintenance.

Layer normalization. Elle normalise au niveau des features d'un exemple et est très utilisée dans les
architectures séquentielles et Transformers. L'objectif n'est pas seulement de retenir une définition,
mais de comprendre le mécanisme, les hypothèses et les conséquences pratiques. Dans un projet réel,
ce point influence directement les choix de données, la méthode d'évaluation, la robustesse du modèle
et le coût de maintenance.

Dropout. Pendant l'entraînement, certaines activations sont annulées aléatoirement. Le réseau apprend
ainsi des représentations moins dépendantes d'un chemin unique. L'objectif n'est pas seulement de
retenir une définition, mais de comprendre le mécanisme, les hypothèses et les conséquences
pratiques. Dans un projet réel, ce point influence directement les choix de données, la méthode
d'évaluation, la robustesse du modèle et le coût de maintenance.

Weight decay. Il pénalise les grands poids et agit comme une régularisation. Avec des optimiseurs
modernes, la manière de l'appliquer est un choix d'implémentation important. L'objectif n'est pas
seulement de retenir une définition, mais de comprendre le mécanisme, les hypothèses et les
conséquences pratiques. Dans un projet réel, ce point influence directement les choix de données, la
méthode d'évaluation, la robustesse du modèle et le coût de maintenance.

Formule / intuition
Diagnostic simple : train loss baisse et validation loss remonte => sur-apprentissage probable. Train et
validation restent mauvaises => capacité insuffisante, optimisation difficile ou signal faible.

Exemple concret
Sur un petit dataset d'images, un réseau très grand peut atteindre presque 100 % sur train et chuter en
validation. Data augmentation, weight decay, dropout et réduction du modèle peuvent améliorer la
généralisation.

Cours 2 - Deep Learning Page 7


Pièges fréquents
• Ajouter de la régularisation avant de vérifier la qualité des données.
• Utiliser dropout en mode évaluation.
• Conclure au manque de capacité sans vérifier l’optimisation.

Exercice
Entraîne le même MLP avec et sans dropout/weight decay. Compare l'écart train-validation et discute si
la régularisation améliore réellement la performance finale.

Cours 2 - Deep Learning Page 8


Chapitre 4 - Réseaux convolutifs et représentation
des images
Les convolutions exploitent la structure locale des images. Un même filtre glisse sur différentes
positions, partage ses paramètres et détecte un motif indépendamment de sa position. Les CNN ont
longtemps constitué la base de la vision par ordinateur et restent utiles même à l'ère des architectures
attentionnelles.

Objectifs pédagogiques
• Comprendre filtre, stride, padding et pooling.
• Relier convolution et invariance locale.
• Construire une petite architecture de classification.

Concepts essentiels
Convolution. Un noyau local combine les pixels d'une petite zone. Chaque canal de sortie possède ses
filtres appris. Le partage de poids réduit fortement le nombre de paramètres par rapport à une couche
dense sur tous les pixels. L'objectif n'est pas seulement de retenir une définition, mais de comprendre
le mécanisme, les hypothèses et les conséquences pratiques. Dans un projet réel, ce point influence
directement les choix de données, la méthode d'évaluation, la robustesse du modèle et le coût de
maintenance.

Stride. Le stride contrôle le déplacement du filtre. Un stride supérieur à un réduit la résolution spatiale
et peut remplacer certaines opérations de pooling. L'objectif n'est pas seulement de retenir une
définition, mais de comprendre le mécanisme, les hypothèses et les conséquences pratiques. Dans un
projet réel, ce point influence directement les choix de données, la méthode d'évaluation, la robustesse
du modèle et le coût de maintenance.

Padding. Ajouter des pixels autour de l'image permet de contrôler la taille de sortie et de mieux traiter
les bords. L'objectif n'est pas seulement de retenir une définition, mais de comprendre le mécanisme,
les hypothèses et les conséquences pratiques. Dans un projet réel, ce point influence directement les
choix de données, la méthode d'évaluation, la robustesse du modèle et le coût de maintenance.

Pooling. Max pooling ou average pooling résument des zones locales et augmentent le champ réceptif
effectif, au prix d'une perte de résolution. L'objectif n'est pas seulement de retenir une définition, mais
de comprendre le mécanisme, les hypothèses et les conséquences pratiques. Dans un projet réel, ce
point influence directement les choix de données, la méthode d'évaluation, la robustesse du modèle et
le coût de maintenance.

Augmentation. Recadrage, miroir, bruit léger ou transformations cohérentes peuvent augmenter la


diversité des exemples, mais doivent respecter la sémantique de la tâche. L'objectif n'est pas
seulement de retenir une définition, mais de comprendre le mécanisme, les hypothèses et les
conséquences pratiques. Dans un projet réel, ce point influence directement les choix de données, la
méthode d'évaluation, la robustesse du modèle et le coût de maintenance.

Formule / intuition
Taille de sortie 1D approximative : floor((W + 2P - K)/S) + 1, avec largeur W, padding P, noyau K et
stride S.

Exemple de code
cnn = [Link](
nn.Conv2d(3, 32, 3, padding=1), [Link](),
nn.MaxPool2d(2),
nn.Conv2d(32, 64, 3, padding=1), [Link](),
nn.AdaptiveAvgPool2d((1,1)), [Link](),

Cours 2 - Deep Learning Page 9


[Link](64, 10)
)

Exemple concret
Dans une classification de défauts industriels, les premières couches peuvent détecter bords et
textures ; les couches suivantes combinent ces signaux en motifs de fissure ou d'anomalie plus
spécifiques.

Pièges fréquents
• Appliquer une augmentation qui change la classe réelle.
• Aplatir trop tôt et exploser le nombre de paramètres.
• Ignorer le déséquilibre des classes visuelles.

Exercice
Dessine les dimensions d'un tenseur image à travers deux convolutions et deux poolings. Calcule le
nombre de canaux et la résolution après chaque étape.

Cours 2 - Deep Learning Page 10


Chapitre 5 - Séquences, embeddings, RNN et
attention
Les séquences apparaissent dans le texte, l'audio, les séries temporelles et les événements utilisateur.
Les RNN traitent les éléments dans l'ordre et conservent un état caché. L'attention permet au modèle
de pondérer directement les éléments pertinents d'une séquence et a ouvert la voie aux Transformers.

Objectifs pédagogiques
• Comprendre embeddings et états cachés.
• Savoir pourquoi les longues dépendances sont difficiles pour les RNN.
• Comprendre l’intuition de l’attention.

Concepts essentiels
Embedding. Un identifiant discret est associé à un vecteur dense appris. Les éléments utilisés dans des
contextes similaires peuvent acquérir des représentations proches. L'objectif n'est pas seulement de
retenir une définition, mais de comprendre le mécanisme, les hypothèses et les conséquences
pratiques. Dans un projet réel, ce point influence directement les choix de données, la méthode
d'évaluation, la robustesse du modèle et le coût de maintenance.

RNN. À chaque pas, le réseau combine l'entrée courante et son état précédent. Cette récursion partage
les paramètres dans le temps mais rend le calcul séquentiel. L'objectif n'est pas seulement de retenir
une définition, mais de comprendre le mécanisme, les hypothèses et les conséquences pratiques. Dans
un projet réel, ce point influence directement les choix de données, la méthode d'évaluation, la
robustesse du modèle et le coût de maintenance.

LSTM/GRU. Des portes contrôlent ce qui est conservé, oublié ou exposé. Elles atténuent le problème
des gradients faibles sur de longues séquences. L'objectif n'est pas seulement de retenir une définition,
mais de comprendre le mécanisme, les hypothèses et les conséquences pratiques. Dans un projet réel,
ce point influence directement les choix de données, la méthode d'évaluation, la robustesse du modèle
et le coût de maintenance.

Attention. Chaque position calcule une pondération sur d'autres positions selon leur pertinence. Le
modèle peut ainsi relier directement des éléments éloignés. L'objectif n'est pas seulement de retenir
une définition, mais de comprendre le mécanisme, les hypothèses et les conséquences pratiques. Dans
un projet réel, ce point influence directement les choix de données, la méthode d'évaluation, la
robustesse du modèle et le coût de maintenance.

Masquage. Dans une génération auto-régressive, une position ne doit pas voir les tokens futurs. Un
masque causal impose cette contrainte. L'objectif n'est pas seulement de retenir une définition, mais
de comprendre le mécanisme, les hypothèses et les conséquences pratiques. Dans un projet réel, ce
point influence directement les choix de données, la méthode d'évaluation, la robustesse du modèle et
le coût de maintenance.

Formule / intuition
Attention simplifiée : softmax(QK^T / sqrt(d)) V. Q représente les requêtes, K les clés et V les valeurs
utilisées pour produire la combinaison pondérée.

Exemple concret
Dans une phrase, un pronom peut dépendre d'un nom apparu plusieurs mots plus tôt. L'attention
permet à sa représentation de se concentrer directement sur les tokens les plus informatifs au lieu de
faire transiter tout le signal par une longue chaîne récurrente.

Cours 2 - Deep Learning Page 11


Pièges fréquents
• Confondre embedding et probabilité.
• Oublier le masque causal en génération.
• Supposer que toute attention est automatiquement interprétable.

Exercice
Pour une séquence de 6 tokens, imagine une matrice d'attention et explique ce que signifie une ligne
dont 70 % du poids pointe vers un token précédent particulier.

Cours 2 - Deep Learning Page 12


Chapitre 6 - Transformers : blocs, self-attention et
représentations contextuelles
Le Transformer remplace la récursion par des blocs d'attention et de réseaux feed-forward. Cela
permet de paralléliser davantage l'entraînement et d'apprendre des représentations contextuelles
puissantes. Les modèles de langage modernes reposent majoritairement sur cette famille
d'architecture.

Objectifs pédagogiques
• Décomposer un bloc Transformer.
• Comprendre multi-head attention et positional information.
• Relier architecture et coût quadratique de l’attention dense.

Concepts essentiels
Self-attention. Q, K et V proviennent de la même séquence. Chaque token met à jour sa représentation
en agrégeant les autres positions utiles. L'objectif n'est pas seulement de retenir une définition, mais
de comprendre le mécanisme, les hypothèses et les conséquences pratiques. Dans un projet réel, ce
point influence directement les choix de données, la méthode d'évaluation, la robustesse du modèle et
le coût de maintenance.

Multi-head. Plusieurs têtes apprennent des projections différentes. Elles peuvent capturer des relations
complémentaires avant d'être concaténées. L'objectif n'est pas seulement de retenir une définition,
mais de comprendre le mécanisme, les hypothèses et les conséquences pratiques. Dans un projet réel,
ce point influence directement les choix de données, la méthode d'évaluation, la robustesse du modèle
et le coût de maintenance.

Feed-forward. Après l'attention, un petit réseau dense appliqué indépendamment à chaque position
transforme la représentation. C'est une part importante de la capacité du bloc. L'objectif n'est pas
seulement de retenir une définition, mais de comprendre le mécanisme, les hypothèses et les
conséquences pratiques. Dans un projet réel, ce point influence directement les choix de données, la
méthode d'évaluation, la robustesse du modèle et le coût de maintenance.

Residual connections. Des connexions résiduelles ajoutent l'entrée du sous-bloc à sa sortie. Elles
améliorent le flux du gradient et facilitent l'entraînement de réseaux profonds. L'objectif n'est pas
seulement de retenir une définition, mais de comprendre le mécanisme, les hypothèses et les
conséquences pratiques. Dans un projet réel, ce point influence directement les choix de données, la
méthode d'évaluation, la robustesse du modèle et le coût de maintenance.

Position. L'attention pure ne connaît pas l'ordre. Des encodages positionnels ou des mécanismes
relatifs injectent une information sur la position des tokens. L'objectif n'est pas seulement de retenir
une définition, mais de comprendre le mécanisme, les hypothèses et les conséquences pratiques. Dans
un projet réel, ce point influence directement les choix de données, la méthode d'évaluation, la
robustesse du modèle et le coût de maintenance.

Formule / intuition
Coût de l'attention dense : la matrice QK^T relie chaque token à chaque autre token, soit un coût
approximativement quadratique en longueur de séquence.

Exemple de code
layer = [Link](
d_model=256, nhead=8, dim_feedforward=1024, batch_first=True
)
encoder = [Link](layer, num_layers=6)

Cours 2 - Deep Learning Page 13


Exemple concret
Pour résumer un document, les représentations des tokens deviennent contextuelles : le sens d'un mot
ambigu dépend de son environnement. Plusieurs blocs successifs enrichissent cette représentation
avant la tête de sortie.

Pièges fréquents
• Négliger la mémoire quand la séquence s’allonge.
• Considérer les poids d’attention comme une preuve causale.
• Changer d’architecture sans contrôler tokenizer et données.

Exercice
Explique le chemin d'un tenseur [batch, longueur, d_model] dans self-attention, résiduel, normalisation
et feed-forward. Indique quelles dimensions restent constantes.

Cours 2 - Deep Learning Page 14


Chapitre 7 - Entraînement pratique : datasets,
mixed precision, checkpoints et reproductibilité
Une bonne architecture ne suffit pas. L'entraînement profond implique gestion des batches, mémoire
GPU, précision numérique, checkpoints et suivi des expériences. La reproductibilité est
particulièrement importante lorsque les entraînements coûtent cher et prennent du temps.

Objectifs pédagogiques
• Construire une boucle d’entraînement robuste.
• Comprendre mixed precision et gradient accumulation.
• Versionner checkpoints et métriques.

Concepts essentiels
DataLoader. Le chargement doit fournir les batches sans affamer l'accélérateur. Mélange, nombre de
workers, préchargement et transformation influencent le débit. L'objectif n'est pas seulement de retenir
une définition, mais de comprendre le mécanisme, les hypothèses et les conséquences pratiques. Dans
un projet réel, ce point influence directement les choix de données, la méthode d'évaluation, la
robustesse du modèle et le coût de maintenance.

Mixed precision. Utiliser des formats numériques moins coûteux réduit mémoire et accélère certains
calculs. Un mécanisme de scaling peut prévenir l'underflow des gradients. L'objectif n'est pas
seulement de retenir une définition, mais de comprendre le mécanisme, les hypothèses et les
conséquences pratiques. Dans un projet réel, ce point influence directement les choix de données, la
méthode d'évaluation, la robustesse du modèle et le coût de maintenance.

Gradient accumulation. On additionne les gradients de plusieurs mini-batches avant une mise à jour
pour simuler un batch plus grand lorsque la mémoire est limitée. L'objectif n'est pas seulement de
retenir une définition, mais de comprendre le mécanisme, les hypothèses et les conséquences
pratiques. Dans un projet réel, ce point influence directement les choix de données, la méthode
d'évaluation, la robustesse du modèle et le coût de maintenance.

Checkpoint. Un checkpoint sérieux sauvegarde poids, optimiseur, scheduler, epoch, seed et


configuration. Il doit permettre de reprendre l'entraînement, pas seulement l'inférence. L'objectif n'est
pas seulement de retenir une définition, mais de comprendre le mécanisme, les hypothèses et les
conséquences pratiques. Dans un projet réel, ce point influence directement les choix de données, la
méthode d'évaluation, la robustesse du modèle et le coût de maintenance.

Tracking. Hyperparamètres, métriques, courbes et artefacts doivent être liés à une exécution
identifiable. Cela rend les comparaisons fiables et audite les changements. L'objectif n'est pas
seulement de retenir une définition, mais de comprendre le mécanisme, les hypothèses et les
conséquences pratiques. Dans un projet réel, ce point influence directement les choix de données, la
méthode d'évaluation, la robustesse du modèle et le coût de maintenance.

Formule / intuition
Batch effectif = batch_physique * nombre_d_accumulations * nombre_de_devices. Modifier ce batch
peut nécessiter d'ajuster learning rate et scheduler.

Exemple concret
Si un modèle ne tient pas en mémoire avec batch 64, on peut utiliser batch 8 et accumuler huit pas.
Cela conserve un batch effectif de 64, mais le comportement exact peut différer selon normalisation et
scheduler.

Cours 2 - Deep Learning Page 15


Pièges fréquents
• Sauvegarder seulement les poids et perdre l’état de l’optimiseur.
• Changer plusieurs hyperparamètres à la fois sans tracking.
• Comparer des runs utilisant des données ou seeds différents sans le noter.

Exercice
Écris une checklist de checkpoint permettant de reprendre un entraînement exactement après une
interruption. Ajoute une stratégie de nommage des expériences.

Cours 2 - Deep Learning Page 16


Chapitre 8 - Transfer learning, fine-tuning et choix
entre entraîner ou réutiliser
Le transfer learning exploite un modèle déjà pré-entraîné sur un grand corpus pour une tâche plus
spécifique. Cela réduit les besoins en données et en calcul. Le défi consiste à choisir entre extraction de
features, fine-tuning partiel, fine-tuning complet ou adaptation légère selon le budget et le niveau de
spécialisation requis.

Objectifs pédagogiques
• Comprendre pourquoi le pré-entraînement est réutilisable.
• Choisir une stratégie de fine-tuning.
• Éviter le catastrophic forgetting et la sur-adaptation.

Concepts essentiels
Features transférables. Les premières couches apprennent souvent des motifs généraux. Réutiliser ces
représentations peut être très efficace lorsque le dataset cible est petit. L'objectif n'est pas seulement
de retenir une définition, mais de comprendre le mécanisme, les hypothèses et les conséquences
pratiques. Dans un projet réel, ce point influence directement les choix de données, la méthode
d'évaluation, la robustesse du modèle et le coût de maintenance.

Freeze. Geler certaines couches réduit le nombre de paramètres entraînés. C'est rapide et limite le
sur-apprentissage, mais peut limiter l'adaptation au domaine. L'objectif n'est pas seulement de retenir
une définition, mais de comprendre le mécanisme, les hypothèses et les conséquences pratiques. Dans
un projet réel, ce point influence directement les choix de données, la méthode d'évaluation, la
robustesse du modèle et le coût de maintenance.

Fine-tuning. On réentraîne tout ou partie du modèle avec un learning rate souvent plus faible. Le
dataset doit être suffisamment représentatif et de bonne qualité. L'objectif n'est pas seulement de
retenir une définition, mais de comprendre le mécanisme, les hypothèses et les conséquences
pratiques. Dans un projet réel, ce point influence directement les choix de données, la méthode
d'évaluation, la robustesse du modèle et le coût de maintenance.

Adaptation légère. Des méthodes ajoutent ou ajustent un petit nombre de paramètres tout en
conservant la majorité du modèle figée. Elles réduisent coût mémoire et stockage par tâche. L'objectif
n'est pas seulement de retenir une définition, mais de comprendre le mécanisme, les hypothèses et les
conséquences pratiques. Dans un projet réel, ce point influence directement les choix de données, la
méthode d'évaluation, la robustesse du modèle et le coût de maintenance.

Évaluation. Le fine-tuning doit être comparé à une baseline sans adaptation. Un gain offline peut ne pas
justifier la complexité de maintenance supplémentaire. L'objectif n'est pas seulement de retenir une
définition, mais de comprendre le mécanisme, les hypothèses et les conséquences pratiques. Dans un
projet réel, ce point influence directement les choix de données, la méthode d'évaluation, la robustesse
du modèle et le coût de maintenance.

Formule / intuition
Décision pratique : si le modèle pré-entraîné fournit déjà une représentation forte, commencer par la
solution la moins coûteuse et n'augmenter le degré d'adaptation que si l'évaluation le justifie.

Exemple concret
Pour classifier des images industrielles avec 2 000 exemples, il est souvent préférable de partir d'un
backbone pré-entraîné, de remplacer la tête de classification, puis de dégeler progressivement les
dernières couches si nécessaire.

Cours 2 - Deep Learning Page 17


Pièges fréquents
• Fine-tuner tout le modèle avec un learning rate trop grand.
• Évaluer uniquement sur des exemples très proches du train.
• Choisir l’adaptation la plus lourde sans mesurer le gain.

Exercice
Propose une stratégie en trois étapes pour adapter un modèle pré-entraîné à un petit dataset : baseline
gelée, dégel partiel, puis fine-tuning plus complet avec critères d'arrêt.

Cours 2 - Deep Learning Page 18


Projet guidé - Classifieur d’images avec transfer
learning
Crée un classifieur de dix catégories à partir d'un backbone pré-entraîné. Le projet doit démontrer une
boucle d'entraînement robuste, une analyse des erreurs et une stratégie de fine-tuning progressive.

Livrables
• Pipeline de données et augmentation contrôlée.
• Baseline avec backbone gelé.
• Expérience de dégel partiel.
• Courbes loss/métriques et matrice de confusion.
• Checkpoint reproductible et script d’inférence.

Étapes
1. Séparer train/validation/test par entité si nécessaire.

2. Mettre en place les transforms et le DataLoader.

3. Entraîner uniquement la tête.

4. Analyser erreurs et classes confondues.

5. Dégeler les dernières couches avec learning rate réduit.

6. Ajouter early stopping et checkpointing.

7. Comparer coût, latence et gain de performance.

Critères d'évaluation
• Stabilité de l’entraînement.
• Pas de fuite entre splits.
• Comparaison expérimentale claire.
• Gestion correcte des checkpoints.
• Analyse de généralisation.

Extension avancée

Ajoute mixed precision, gradient accumulation et une petite expérience d'ablation montrant l'effet de
l'augmentation ou du weight decay.

Cours 2 - Deep Learning Page 19


Fiche de révision et glossaire
Les questions suivantes couvrent les mécanismes qu'un ingénieur doit savoir expliquer sur un tableau
blanc sans dépendre d'une bibliothèque particulière.

Questions flash
Q. Pourquoi une activation non linéaire est-elle nécessaire ?
R. Sans elle, plusieurs couches linéaires sont équivalentes à une seule transformation linéaire.

Q. Que fait backpropagation ?


R. Elle calcule la dérivée de la loss par rapport à chaque paramètre via la règle de chaîne.

Q. Pourquoi les residual connections aident-elles ?


R. Elles améliorent le flux du signal et du gradient à travers des réseaux profonds.

Q. À quoi sert gradient accumulation ?


R. À simuler un batch effectif plus grand lorsque la mémoire ne permet pas de le traiter en une fois.

Q. Quand préférer transfer learning ?


R. Quand un modèle pré-entraîné pertinent existe et que les données ou le budget d’entraînement cible
sont limités.

Glossaire
Terme Définition

Activation Fonction non linéaire appliquée à une couche.

Gradient Dérivée de la loss indiquant la sensibilité aux paramètres.

Epoch Passage complet sur le dataset d’entraînement.

Batch Sous-ensemble utilisé pour une étape de gradient.

Embedding Vecteur dense représentant un élément discret.

Attention Agrégation pondérée d’éléments selon leur pertinence.

Transformer Architecture fondée sur attention, feed-forward, résidus et normalisation.

Checkpoint État sauvegardé permettant inférence ou reprise d’entraînement.

Fine-tuning Adaptation d’un modèle pré-entraîné à une tâche cible.

Regularisation Techniques visant à améliorer la généralisation.

Pour aller plus loin


• Implémenter un MLP puis un petit CNN sans copier-coller une architecture complète.
• Reproduire un bloc Transformer minimal.
• Passer au PDF 3 pour LLM, RAG et agents.

Cours 2 - Deep Learning Page 20

Vous aimerez peut-être aussi