Intelligence Artificielle: Deep Learning
Abdelfattah TOULAOUI
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 1 / 103
1 Introduction au Deep Learning
2 Réseaux de Neurones Multicouches (MLP)
3 CNN
4 RNN
5 Transformer
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 2 / 103
Introduction au Deep Learning
1 Introduction au Deep Learning
Introduction Générale
Le Perceptron
Descente de Gradient
Fonctions d’Activation
2 Réseaux de Neurones Multicouches (MLP)
3 CNN
4 RNN
5 Transformer
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 3 / 103
Introduction au Deep Learning Introduction Générale
1 Introduction au Deep Learning
Introduction Générale
Le Perceptron
Descente de Gradient
Fonctions d’Activation
2 Réseaux de Neurones Multicouches (MLP)
3 CNN
4 RNN
5 Transformer
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 4 / 103
Introduction au Deep Learning Introduction Générale
Pourquoi le Deep Learning ?
Les données modernes sont volumineuses, complexes et non
structurées :
images, vidéos, sons, texte, signaux, données médicales...
Les modèles traditionnels (régression, SVM, arbres) peinent à
capturer :
la haute dimension,
les patterns non linéaires,
les relations hiérarchiques.
Le Deep Learning apprend automatiquement des
représentations des données :
formes, textures, concepts, structures linguistiques...
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 5 / 103
Introduction au Deep Learning Introduction Générale
Bref historique du Deep Learning
1943 — Modèle de neurone formel (McCulloch & Pitts).
1957 — Perceptron (Rosenblatt).
1986 — Backpropagation (Rumelhart, Hinton & Williams).
1998 — Réseaux convolutifs (LeNet — Yann LeCun).
2012 — Révolution Deep Learning : AlexNet sur ImageNet.
2014–2017 — GAN, Seq2Seq, Transformers.
2020+ — Modèles multimodaux, diffusion, LLMs (GPT, BERT...).
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 6 / 103
Introduction au Deep Learning Introduction Générale
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 7 / 103
Introduction au Deep Learning Introduction Générale
Qu’est-ce que le Deep Learning ?
Sous-domaine du Machine Learning basé sur des réseaux de
neurones profonds.
Un réseau profond :
contient plusieurs couches successives,
apprend des représentations hiérarchiques des données.
Différence clé :
Le ML traditionnel utilise des caractéristiques définies à la main.
Le Deep Learning apprend les caractéristiques automatiquement.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 8 / 103
Introduction au Deep Learning Introduction Générale
Et ensuite ?
Comprendre la structure d’un réseau de neurones :
neurones, couches, fonctions d’activation.
Comprendre comment il apprend :
propagation avant, erreur, rétropropagation.
Explorer les architectures modernes :
CNN, RNN, Transformers.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 9 / 103
Introduction au Deep Learning Le Perceptron
1 Introduction au Deep Learning
Introduction Générale
Le Perceptron
Descente de Gradient
Fonctions d’Activation
2 Réseaux de Neurones Multicouches (MLP)
3 CNN
4 RNN
5 Transformer
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 10 / 103
Introduction au Deep Learning Le Perceptron
Qu’est-ce que le Perceptron ?
Proposé par Frank Rosenblatt (1957), c’est le premier modèle
neuronal formel.
Inspiré du neurone biologique :
il reçoit des entrées,
les combine avec des poids,
applique une fonction de décision.
C’est un classifieur linéaire : il sépare les données à l’aide d’une
frontière linéaire.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 11 / 103
Introduction au Deep Learning Le Perceptron
Fonctionnement du Perceptron
Calcul de la sortie :
z = w1 x1 + w2 x2 + . . . + wn xn + b
Décision (fonction seuil) :
(
1 si z ≥ 0
ŷ =
−1 sinon
Le perceptron apprend en ajustant w et b pour séparer les deux
classes.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 12 / 103
Introduction au Deep Learning Le Perceptron
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 13 / 103
Introduction au Deep Learning Le Perceptron
Représentation vectorielle du Perceptron
Le perceptron peut être écrit de manière compacte en utilisant
des vecteurs.
On définit :
x1 w1
x2 w2
x = ... ,
w = ...
xn wn
Le calcul du neurone devient :
z = w ⊤x + b
Cette notation permet de simplifier l’écriture et de généraliser à
plusieurs neurones.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 14 / 103
Introduction au Deep Learning Le Perceptron
Règle d’apprentissage du Perceptron
Mise à jour des poids après chaque exemple mal classé :
w ← w + η yi xi
b ← b + η yi
où η est le taux d’apprentissage.
Intuition :
si le point est mal classé : on déplace la frontière vers la bonne
direction.
si le point est bien classé : on ne change rien.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 15 / 103
Introduction au Deep Learning Le Perceptron
Capacités et limites du Perceptron
Avantages Limites
Très simple et rapide à Échoue si les classes ne sont
entraı̂ner. pas linéairement séparables
Interprétable. (ex : XOR).
Fonctionne bien pour les Une seule couche → faible
données linéairement expressivité.
séparables. A mené à la pause historique
de l’IA dans les années 1970.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 16 / 103
Introduction au Deep Learning Le Perceptron
Importance historique du Perceptron
Premier modèle à apprendre à partir de données.
Ses limites ont motivé :
A introduit : les réseaux multi-couches,
les poids, le biais, les fonctions d’activation non
la notion de mise à jour, linéaires,
les limites des modèles linéaires. l’algorithme de
backpropagation.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 17 / 103
Introduction au Deep Learning Descente de Gradient
1 Introduction au Deep Learning
Introduction Générale
Le Perceptron
Descente de Gradient
Fonctions d’Activation
2 Réseaux de Neurones Multicouches (MLP)
3 CNN
4 RNN
5 Transformer
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 18 / 103
Introduction au Deep Learning Descente de Gradient
Pourquoi la Descente de Gradient ?
Le perceptron utilise une règle simple de mise à jour, mais :
elle ne minimise pas explicitement une fonction de coût,
elle ne s’applique pas aux modèles continus (ex : régression logistique),
elle ne fonctionne pas pour les réseaux neuronaux profonds.
On a besoin d’une méthode générale pour minimiser une
fonction de coût :
J(w1 , w2 , ..., wn , b)
Objectif : trouver wi et b qui rendent les prédictions les plus
justes possibles.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 19 / 103
Introduction au Deep Learning Descente de Gradient
Principe de la Descente de Gradient
La descente de gradient met à jour les paramètres pour
descendre la pente de la fonction de coût.
Mise à jour :
∂J ∂J
wi ← wi − α b ←b−α
∂wi ∂b
où α est le taux d’apprentissage.
Intuition :
Le gradient indique la direction où le coût augmente.
On se déplace dans la direction opposée pour réduire le coût.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 20 / 103
Introduction au Deep Learning Descente de Gradient
Illustration de la Descente de Gradient
À chaque itération :
le point se déplace,
la fonction de coût diminue,
le modèle devient meilleur.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 21 / 103
Introduction au Deep Learning Descente de Gradient
Variantes de la Descente de Gradient
Batch Gradient Descent
Utilise toutes les données pour une mise à jour.
Stable mais lent.
Stochastic Gradient Descent (SGD)
Met à jour les poids après chaque exemple.
Rapide mais plus bruité.
Mini-Batch Gradient Descent
Compromis : mise à jour sur un petit ensemble.
Standard dans le Deep Learning.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 22 / 103
Introduction au Deep Learning Descente de Gradient
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 23 / 103
Introduction au Deep Learning Descente de Gradient
Pourquoi la Descente de Gradient est essentielle ?
Permet d’entraı̂ner :
régression logistique,
réseaux de neurones multi-couches,
CNN, RNN, Transformers...
L’algorithme de Backpropagation utilise la descente de gradient
pour ajuster tous les poids du réseau.
C’est le cœur de l’apprentissage profond moderne.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 24 / 103
Introduction au Deep Learning Fonctions d’Activation
1 Introduction au Deep Learning
Introduction Générale
Le Perceptron
Descente de Gradient
Fonctions d’Activation
2 Réseaux de Neurones Multicouches (MLP)
3 CNN
4 RNN
5 Transformer
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 25 / 103
Introduction au Deep Learning Fonctions d’Activation
Pourquoi des fonctions d’activation ?
Le perceptron utilise une fonction seuil : sortie = -1 ou +1.
Mais cette fonction est :
non dérivable,
non continue,
inutilisable pour l’optimisation par descente de gradient.
Pour entraı̂ner des réseaux de neurones modernes, il faut des
fonctions :
continues,
dérivables,
capables d’introduire de la non-linéarité.
Introduction des fonctions d’activation.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 26 / 103
Introduction au Deep Learning Fonctions d’Activation
Qu’est-ce qu’une fonction d’activation ?
Fonction appliquée à la sortie d’un neurone :
a = ϕ(z) avec z = w ⊤ x + b
Rôle :
introduire une non-linéarité,
permettre d’apprendre des fonctions complexes,
éviter qu’un réseau profond n’agisse comme une simple régression
linéaire.
Sans activation : même 10 couches se comporteraient comme un
seul modèle linéaire.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 27 / 103
Introduction au Deep Learning Fonctions d’Activation
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 28 / 103
Introduction au Deep Learning Fonctions d’Activation
Exemples de Fonctions d’Activation
Sigmoı̈de :
1
σ(z) =
1 + e −z
Produits des probabilités (0–1).
Tanh :
e z − e −z
tanh(z) =
e z + e −z
Sorties entre -1 et +1.
ReLU :
ReLU(z) = max(0, z)
Très utilisée dans le Deep Learning.
Simple, efficace, s’entraı̂ne bien.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 29 / 103
Introduction au Deep Learning Fonctions d’Activation
Comparaison des Fonctions d’Activation
Avantages Limites
Sigmoı̈de : utile pour Sigmoı̈de : saturations →
probabilités. gradients faibles.
Tanh : centrée, meilleure Tanh : mêmes limites en
convergence. version centrée.
ReLU : rapide, évite le ReLU : neurones “morts” si
gradient faible. z < 0 trop souvent.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 30 / 103
Introduction au Deep Learning Fonctions d’Activation
Pourquoi la ReLU est si importante ?
Permet un apprentissage plus rapide dans les réseaux profonds.
Évite le problème du gradient qui disparaı̂t dans les couches.
Donne des représentations plus sparsifiées.
Est devenue la fonction dominante pour les CNNs, MLPs,
Transformers.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 31 / 103
Réseaux de Neurones Multicouches (MLP)
1 Introduction au Deep Learning
2 Réseaux de Neurones Multicouches (MLP)
Architecture du MLP
Forward Pass
Backpropagation
3 CNN
4 RNN
5 Transformer
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 32 / 103
Réseaux de Neurones Multicouches (MLP) Architecture du MLP
1 Introduction au Deep Learning
2 Réseaux de Neurones Multicouches (MLP)
Architecture du MLP
Forward Pass
Backpropagation
3 CNN
4 RNN
5 Transformer
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 33 / 103
Réseaux de Neurones Multicouches (MLP) Architecture du MLP
Qu’est-ce qu’un MLP ?
Un MLP est un réseau de neurones composé de plusieurs couches
:
couche d’entrée,
une ou plusieurs couches cachées,
couche de sortie.
Chaque couche est constituée de neurones entièrement
connectés.
C’est la généralisation du perceptron à plusieurs couches.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 34 / 103
Réseaux de Neurones Multicouches (MLP) Architecture du MLP
Structure générale d’un MLP
Notation :
x : entrée,
h(1) , h(2) , ..., h(L) : couches cachées,
ŷ : sortie.
Chaque couche applique :
h(k) = ϕ(W (k) h(k−1) + b (k) )
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 35 / 103
Réseaux de Neurones Multicouches (MLP) Architecture du MLP
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 36 / 103
Réseaux de Neurones Multicouches (MLP) Architecture du MLP
Profondeur et largeur
Profondeur : nombre de couches cachées.
Largeur : nombre de neurones dans chaque couche.
Plus profond → plus expressif.
Plus large → plus de capacité à mémoriser.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 37 / 103
Réseaux de Neurones Multicouches (MLP) Forward Pass
1 Introduction au Deep Learning
2 Réseaux de Neurones Multicouches (MLP)
Architecture du MLP
Forward Pass
Backpropagation
3 CNN
4 RNN
5 Transformer
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 38 / 103
Réseaux de Neurones Multicouches (MLP) Forward Pass
Propagation avant : une couche
Pour un neurone :
z = w ⊤x + b
Puis activation :
a = ϕ(z)
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 39 / 103
Réseaux de Neurones Multicouches (MLP) Forward Pass
Propagation avant dans le MLP
h(1) = ϕ(W (1) x + b (1) )
h(2) = ϕ(W (2) h(1) + b (2) )
ŷ = f (W (L) h(L−1) + b (L) )
Le calcul se fait de gauche à droite.
Le MLP apprend une fonction composée très expressive.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 40 / 103
Réseaux de Neurones Multicouches (MLP) Forward Pass
Représentation vectorielle d’une couche d’un MLP
Une couche d’un MLP généralise le perceptron à plusieurs
neurones.
Soit un vecteur d’entrée :
(k−1)
h1
h(k−1)
h(k−1) = 2 .
.
.
(k−1)
hnk−1
Le poids devient une matrice :
w11 w12 · · · w1nk−1
w21 w22 · · · w2nk−1
W (k) =
... .. .. ..
. . .
wnk 1 wnk 2 · · · wnk nk−1
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 41 / 103
Réseaux de Neurones Multicouches (MLP) Forward Pass
Représentation vectorielle d’une couche d’un MLP
On considère une couche k recevant un vecteur d’entrée :
h(k−1) ∈ Rnk−1
La matrice de poids possède une ligne par neurone de la couche :
W (k) ∈ R nk ×nk−1
Le biais est un vecteur colonne :
b (k) ∈ R nk
Le calcul de la couche devient :
z (k) = W (k) h(k−1) + b (k) ⇒ z (k) ∈ Rnk
h(k) = ϕ z (k)
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 42 / 103
Réseaux de Neurones Multicouches (MLP) Forward Pass
Exemple : Classification à 3 couches
Chaque couche transforme la représentation.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 43 / 103
Réseaux de Neurones Multicouches (MLP) Backpropagation
1 Introduction au Deep Learning
2 Réseaux de Neurones Multicouches (MLP)
Architecture du MLP
Forward Pass
Backpropagation
3 CNN
4 RNN
5 Transformer
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 44 / 103
Réseaux de Neurones Multicouches (MLP) Backpropagation
Pourquoi la rétropropagation ?
Le réseau a des millions de paramètres.
Il faut une méthode systématique pour :
mesurer l’erreur,
calculer l’effet de chaque poids sur l’erreur,
mettre à jour les poids.
La solution : Backpropagation.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 45 / 103
Réseaux de Neurones Multicouches (MLP) Backpropagation
Principe de la Backpropagation
Étape 1 : Propagation avant (calcul de ŷ ).
Étape 2 : Calcul de l’erreur :
L = loss(ŷ , y )
Étape 3 : Propagation arrière du gradient.
Étape 4 : Mise à jour des paramètres.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 46 / 103
Réseaux de Neurones Multicouches (MLP) Backpropagation
Rôle des dérivées
La dérivée indique comment le changement d’un poids affecte
l’erreur.
Backprop calcule :
∂L ∂L
et
∂W (k) ∂b (k)
Puis descente de gradient met à jour les poids.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 47 / 103
Réseaux de Neurones Multicouches (MLP) Backpropagation
Théorème d’approximation universelle
Un MLP avec une seule couche cachée peut approximer toute
fonction continue.
En pratique : on utilise plusieurs couches → plus efficace.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 48 / 103
Réseaux de Neurones Multicouches (MLP) Backpropagation
Importance de la non-linéarité
Sans activations, un MLP profond = un modèle linéaire.
Grâce à ϕ :
on apprend des frontières non linéaires,
on construit des représentations hiérarchiques.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 49 / 103
Réseaux de Neurones Multicouches (MLP) Backpropagation
Limitation : Vanishing Gradient
Pour sigmoı̈de / tanh :
dérivées proches de 0,
apprentissage très lent dans les couches profondes.
D’où l’importance des activations modernes (ReLU, GELU).
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 50 / 103
Réseaux de Neurones Multicouches (MLP) Backpropagation
Overfitting dans les MLP
Les MLP ont beaucoup de paramètres.
Risques :
mémorisation,
mauvaise généralisation.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 51 / 103
CNN
1 Introduction au Deep Learning
2 Réseaux de Neurones Multicouches (MLP)
3 CNN
Pourquoi les Réseaux Convolutifs (CNNs) ?
Mécanismes des Réseaux Convolutifs
4 RNN
5 Transformer
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 52 / 103
CNN Pourquoi les Réseaux Convolutifs (CNNs) ?
1 Introduction au Deep Learning
2 Réseaux de Neurones Multicouches (MLP)
3 CNN
Pourquoi les Réseaux Convolutifs (CNNs) ?
Mécanismes des Réseaux Convolutifs
4 RNN
5 Transformer
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 53 / 103
CNN Pourquoi les Réseaux Convolutifs (CNNs) ?
Pourquoi les MLPs ne suffisent pas pour les images
Une image est une donnée :
de grande dimension (ex : 224 × 224 × 3),
avec une forte structure spatiale.
Un MLP :
traite l’image comme un vecteur plat,
ignore la notion de voisinage entre pixels,
nécessite un nombre énorme de paramètres.
Conséquences :
surapprentissage,
coût mémoire élevé,
mauvaise généralisation.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 54 / 103
CNN Pourquoi les Réseaux Convolutifs (CNNs) ?
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 55 / 103
CNN Pourquoi les Réseaux Convolutifs (CNNs) ?
Idée fondamentale des CNNs
Dans une image :
les pixels proches sont fortement corrélés,
les motifs locaux (bords, textures) sont essentiels.
Les CNNs exploitent deux idées clés :
Connectivité locale : chaque neurone regarde une petite région.
Partage des poids : le même filtre est appliqué partout.
Résultat :
beaucoup moins de paramètres,
meilleure généralisation,
invariance aux translations.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 56 / 103
CNN Pourquoi les Réseaux Convolutifs (CNNs) ?
Inspiration biologique
Les CNNs sont inspirés du cortex visuel humain.
Découvertes clés (Hubel & Wiesel, 1960s) :
neurones sensibles aux bords,
neurones sensibles à l’orientation,
organisation hiérarchique de la vision.
Les CNNs reproduisent cette hiérarchie :
couches basses : bords, textures,
couches profondes : formes, objets.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 57 / 103
CNN Pourquoi les Réseaux Convolutifs (CNNs) ?
Bref historique des CNNs
1980s–1990s :
Neocognitron (Fukushima),
LeNet-5 (Yann LeCun) — reconnaissance de chiffres.
2012 — Révolution ImageNet :
AlexNet (Krizhevsky et al.),
utilisation massive du GPU,
chute drastique de l’erreur.
2014–2016 :
VGG, GoogLeNet, ResNet,
réseaux plus profonds et plus performants.
Aujourd’hui :
CNNs + Transformers,
vision, médecine, satellite, environnement.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 58 / 103
CNN Pourquoi les Réseaux Convolutifs (CNNs) ?
Pourquoi les CNNs ont tout changé
Apprentissage automatique des caractéristiques visuelles.
Robustesse aux variations :
position,
éclairage,
bruit.
Performances supérieures dans :
classification d’images,
détection d’objets,
segmentation.
Devenus la base de nombreuses applications :
imagerie médicale,
satellites et environnement,
véhicules autonomes.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 59 / 103
CNN Mécanismes des Réseaux Convolutifs
1 Introduction au Deep Learning
2 Réseaux de Neurones Multicouches (MLP)
3 CNN
Pourquoi les Réseaux Convolutifs (CNNs) ?
Mécanismes des Réseaux Convolutifs
4 RNN
5 Transformer
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 60 / 103
CNN Mécanismes des Réseaux Convolutifs
Principe de la convolution
Une convolution applique un filtre (ou noyau) sur une image.
Le filtre est une petite matrice qui parcourt l’image.
À chaque position, on calcule :
X
y (i, j) = x(i + u, j + v ) w (u, v )
u,v
Cela produit une carte de caractéristiques (feature map).
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 61 / 103
CNN Mécanismes des Réseaux Convolutifs
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 62 / 103
CNN Mécanismes des Réseaux Convolutifs
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 63 / 103
CNN Mécanismes des Réseaux Convolutifs
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 64 / 103
CNN Mécanismes des Réseaux Convolutifs
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 65 / 103
CNN Mécanismes des Réseaux Convolutifs
Convolution avec plusieurs canaux
Une image couleur possède plusieurs canaux :
x ∈ RH×W ×C
(ex : RGB → C = 3).
Un filtre convolutif a la forme :
w ∈ Rk×k×C
La sortie est une carte 2D :
′ ′
y ∈ RH ×W
Plusieurs filtres → plusieurs cartes → empilées en profondeur.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 66 / 103
CNN Mécanismes des Réseaux Convolutifs
Biais et fonction d’activation
Après la convolution, on ajoute un biais :
z =x ∗w +b
Puis on applique une fonction d’activation :
h = ϕ(z)
Typiquement :
ReLU pour les couches intermédiaires.
Lien avec MLP : convolution = transformation linéaire locale +
non-linéarité.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 67 / 103
CNN Mécanismes des Réseaux Convolutifs
Stride et Padding
Stride : pas de déplacement du filtre.
stride = 1 → déplacement pixel par pixel.
stride ¿ 1 → réduction de la taille.
Padding : ajout de zéros autour de l’image.
permet de contrôler la taille de sortie,
évite de perdre l’information aux bords.
Taille de sortie :
H − k + 2p
H′ = +1
s
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 68 / 103
CNN Mécanismes des Réseaux Convolutifs
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 69 / 103
CNN Mécanismes des Réseaux Convolutifs
Convolution avec plusieurs canaux
Une image couleur possède plusieurs canaux :
x ∈ RH×W ×C
(ex : RGB → C = 3).
Un filtre convolutif a la forme :
w ∈ Rk×k×C
La sortie est une carte 2D :
′ ′
y ∈ RH ×W
Plusieurs filtres → plusieurs cartes → empilées en profondeur.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 70 / 103
CNN Mécanismes des Réseaux Convolutifs
Biais et fonction d’activation
Après la convolution, on ajoute un biais :
z =x ∗w +b
Puis on applique une fonction d’activation :
h = ϕ(z)
Typiquement :
ReLU pour les couches intermédiaires.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 71 / 103
CNN Mécanismes des Réseaux Convolutifs
Stride et Padding
Stride : pas de déplacement du filtre.
stride = 1 → déplacement pixel par pixel.
stride > 1 → réduction de la taille.
Padding : ajout de zéros autour de l’image.
permet de contrôler la taille de sortie,
évite de perdre l’information aux bords.
Taille de sortie :
H − k + 2p
H′ = +1
s
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 72 / 103
CNN Mécanismes des Réseaux Convolutifs
Pooling
Le pooling réduit la taille spatiale des cartes.
Exemple : Max Pooling
y (i, j) = max x(i + u, j + v )
u,v ∈fenêtre
Exemple : Pooling Moyenne
1 X
y (i, j) = x(i + u, j + v )
|fenêtre| u,v ∈fenêtre
Effets :
réduction du coût de calcul,
invariance aux petites translations,
moins de surapprentissage.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 73 / 103
CNN Mécanismes des Réseaux Convolutifs
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 74 / 103
CNN Mécanismes des Réseaux Convolutifs
CNN comme empilement de blocs
Un CNN est une succession de blocs :
Conv → Activation → Pooling
Les premières couches apprennent :
bords, textures.
Les couches profondes apprennent :
formes, objets, concepts.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 75 / 103
CNN Mécanismes des Réseaux Convolutifs
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 76 / 103
RNN
1 Introduction au Deep Learning
2 Réseaux de Neurones Multicouches (MLP)
3 CNN
4 RNN
Pourquoi les Réseaux Récurrents (RNNs) ?
Mécanismes des Réseaux Récurrents
5 Transformer
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 77 / 103
RNN Pourquoi les Réseaux Récurrents (RNNs) ?
1 Introduction au Deep Learning
2 Réseaux de Neurones Multicouches (MLP)
3 CNN
4 RNN
Pourquoi les Réseaux Récurrents (RNNs) ?
Mécanismes des Réseaux Récurrents
5 Transformer
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 78 / 103
RNN Pourquoi les Réseaux Récurrents (RNNs) ?
Le problème des données séquentielles
De nombreuses données sont ordonnées dans le temps :
texte (phrases, mots),
signaux audio,
séries temporelles (climat, énergie, finance),
séquences biologiques.
Les modèles classiques (MLP, CNN) supposent :
des entrées indépendantes,
une taille fixe,
pas de notion de mémoire.
Or, dans une séquence :
l’ordre est crucial,
le contexte passé influence le présent.
Exemple : le sens d’un mot dépend des mots précédents.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 79 / 103
RNN Pourquoi les Réseaux Récurrents (RNNs) ?
Idée clé des RNNs
Les RNNs introduisent une notion de mémoire.
À chaque instant :
le réseau reçoit une entrée xt ,
il conserve un état interne ht ,
cet état résume le passé.
Le même réseau est appliqué à chaque pas de temps :
partage des paramètres dans le temps.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 80 / 103
RNN Pourquoi les Réseaux Récurrents (RNNs) ?
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 81 / 103
RNN Pourquoi les Réseaux Récurrents (RNNs) ?
CNNs vs RNNs
CNN :
exploite la structure spatiale,
traitement parallèle,
champ réceptif local.
RNN :
exploite la structure temporelle,
traitement séquentiel,
dépendance au passé.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 82 / 103
RNN Mécanismes des Réseaux Récurrents
1 Introduction au Deep Learning
2 Réseaux de Neurones Multicouches (MLP)
3 CNN
4 RNN
Pourquoi les Réseaux Récurrents (RNNs) ?
Mécanismes des Réseaux Récurrents
5 Transformer
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 83 / 103
RNN Mécanismes des Réseaux Récurrents
Équations d’un RNN simple
À chaque pas de temps t :
ht = ϕ(Wx xt + Wh ht−1 + b)
Où :
xt ∈ Rnx : entrée au temps t,
ht ∈ Rnh : état caché,
Wx ∈ Rnh ×nx ,
Wh ∈ Rnh ×nh ,
b ∈ Rnh .
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 84 / 103
RNN Mécanismes des Réseaux Récurrents
Sortie d’un RNN
Le RNN peut produire :
une sortie à chaque pas de temps,
ou une sortie finale seulement.
Sortie typique :
yt = f (Wy ht + c)
Applications :
classification de séquences,
prédiction temporelle,
modélisation du langage.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 85 / 103
RNN Mécanismes des Réseaux Récurrents
Dépliage temporel du RNN
Un RNN peut être vu comme un MLP déplié dans le temps.
Chaque pas de temps correspond à une couche :
h1 → h2 → h3 → . . .
Les paramètres sont partagés :
Wx , Wh , b sont identiques pour tous t
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 86 / 103
RNN Mécanismes des Réseaux Récurrents
Limites des RNNs classiques
Difficulté à capturer des dépendances longues.
Problèmes de :
vanishing gradients,
exploding gradients.
Motivation pour des architectures améliorées :
LSTM,
GRU.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 87 / 103
Transformer
1 Introduction au Deep Learning
2 Réseaux de Neurones Multicouches (MLP)
3 CNN
4 RNN
5 Transformer
Pourquoi les Transformers ?
Mécanismes des Transformers
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 88 / 103
Transformer Pourquoi les Transformers ?
1 Introduction au Deep Learning
2 Réseaux de Neurones Multicouches (MLP)
3 CNN
4 RNN
5 Transformer
Pourquoi les Transformers ?
Mécanismes des Transformers
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 89 / 103
Transformer Pourquoi les Transformers ?
Limites des modèles séquentiels classiques
Les RNNs traitent les données séquentiellement :
pas de parallélisation,
entraı̂nement lent.
Difficulté à capturer des dépendances longues :
information lointaine diluée,
gradients instables.
Les CNNs séquentiels :
nécessitent de nombreuses couches,
ont un champ réceptif limité.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 90 / 103
Transformer Pourquoi les Transformers ?
Idée fondamentale des Transformers
Les Transformers remplacent la récursion par l’attention.
Chaque élément de la séquence :
peut regarder tous les autres,
pondère leur importance dynamiquement.
Avantages :
parallélisation complète,
dépendances longues bien capturées,
meilleure efficacité sur grandes séquences.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 91 / 103
Transformer Pourquoi les Transformers ?
Bref historique des Transformers
2017 — Vaswani et al. :
Attention Is All You Need.
2018–2019 :
BERT (compréhension du langage),
GPT (génération).
2020+ :
Vision Transformers (ViT),
modèles multimodaux (texte + image),
LLMs modernes.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 92 / 103
Transformer Mécanismes des Transformers
1 Introduction au Deep Learning
2 Réseaux de Neurones Multicouches (MLP)
3 CNN
4 RNN
5 Transformer
Pourquoi les Transformers ?
Mécanismes des Transformers
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 93 / 103
Transformer Mécanismes des Transformers
Représentation des entrées
Une séquence d’éléments :
x1 , x2 , . . . , xT
Chaque élément est transformé en vecteur :
X ∈ RT ×d
Problème : le modèle n’a pas de notion d’ordre.
Solution : encodage positionnel.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 94 / 103
Transformer Mécanismes des Transformers
Auto-attention : principe
Chaque vecteur est projeté en :
Query (Q),
Key (K ),
Value (V ).
Calcul :
Q = XWQ , K = XWK , V = XWV
Les poids d’attention mesurent l’importance relative.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 95 / 103
Transformer Mécanismes des Transformers
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 96 / 103
Transformer Mécanismes des Transformers
Formule de l’attention
QK ⊤
Attention(Q, K , V ) = softmax √ V
d
QK ⊤ : similarité entre éléments.
Softmax : normalisation des poids.
V : information agrégée.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 97 / 103
Transformer Mécanismes des Transformers
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 98 / 103
Transformer Mécanismes des Transformers
Multi-Head Attention
Au lieu d’une seule attention :
plusieurs attentions en parallèle.
Chaque tête apprend un type de relation :
syntaxique,
sémantique,
positionnelle.
Les sorties sont concaténées puis projetées.
Résultat : représentation plus riche.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 99 / 103
Transformer Mécanismes des Transformers
Bloc Transformer
Un bloc contient :
auto-attention,
normalisation,
réseau feed-forward,
connexions résiduelles.
Schéma simplifié :
X → Attention → FFN
Lien : le FFN est un petit MLP appliqué à chaque position.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 100 / 103
Transformer Mécanismes des Transformers
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 101 / 103
Transformer Mécanismes des Transformers
Pourquoi les Transformers dominent
Entraı̂nement parallèle et scalable.
Dépendances longues capturées naturellement.
Applicables à :
texte,
images,
audio,
graphes,
données multimodales.
Base des modèles modernes :
GPT, BERT, ViT, diffusion, agents.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 102 / 103
Transformer Mécanismes des Transformers
FIN
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 103 / 103