0% ont trouvé ce document utile (0 vote)
20 vues103 pages

Introduction au Deep Learning et MLP

Le document présente une introduction au Deep Learning, en expliquant son importance face aux données modernes complexes et en détaillant les concepts fondamentaux tels que les réseaux de neurones multicouches, les CNN, les RNN et les Transformers. Il aborde également l'historique du Deep Learning, le fonctionnement du perceptron, la descente de gradient et les fonctions d'activation. Enfin, il souligne l'importance des fonctions d'activation comme la ReLU pour l'apprentissage efficace dans les réseaux profonds.

Transféré par

wissalsanhaji2023
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
20 vues103 pages

Introduction au Deep Learning et MLP

Le document présente une introduction au Deep Learning, en expliquant son importance face aux données modernes complexes et en détaillant les concepts fondamentaux tels que les réseaux de neurones multicouches, les CNN, les RNN et les Transformers. Il aborde également l'historique du Deep Learning, le fonctionnement du perceptron, la descente de gradient et les fonctions d'activation. Enfin, il souligne l'importance des fonctions d'activation comme la ReLU pour l'apprentissage efficace dans les réseaux profonds.

Transféré par

wissalsanhaji2023
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Intelligence Artificielle: Deep Learning

Abdelfattah TOULAOUI

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 1 / 103


1 Introduction au Deep Learning

2 Réseaux de Neurones Multicouches (MLP)

3 CNN

4 RNN

5 Transformer

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 2 / 103


Introduction au Deep Learning

1 Introduction au Deep Learning


Introduction Générale
Le Perceptron
Descente de Gradient
Fonctions d’Activation

2 Réseaux de Neurones Multicouches (MLP)

3 CNN

4 RNN

5 Transformer

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 3 / 103


Introduction au Deep Learning Introduction Générale

1 Introduction au Deep Learning


Introduction Générale
Le Perceptron
Descente de Gradient
Fonctions d’Activation

2 Réseaux de Neurones Multicouches (MLP)

3 CNN

4 RNN

5 Transformer

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 4 / 103


Introduction au Deep Learning Introduction Générale

Pourquoi le Deep Learning ?

Les données modernes sont volumineuses, complexes et non


structurées :
images, vidéos, sons, texte, signaux, données médicales...
Les modèles traditionnels (régression, SVM, arbres) peinent à
capturer :
la haute dimension,
les patterns non linéaires,
les relations hiérarchiques.
Le Deep Learning apprend automatiquement des
représentations des données :
formes, textures, concepts, structures linguistiques...

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 5 / 103


Introduction au Deep Learning Introduction Générale

Bref historique du Deep Learning

1943 — Modèle de neurone formel (McCulloch & Pitts).


1957 — Perceptron (Rosenblatt).
1986 — Backpropagation (Rumelhart, Hinton & Williams).
1998 — Réseaux convolutifs (LeNet — Yann LeCun).
2012 — Révolution Deep Learning : AlexNet sur ImageNet.
2014–2017 — GAN, Seq2Seq, Transformers.
2020+ — Modèles multimodaux, diffusion, LLMs (GPT, BERT...).

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 6 / 103


Introduction au Deep Learning Introduction Générale

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 7 / 103


Introduction au Deep Learning Introduction Générale

Qu’est-ce que le Deep Learning ?

Sous-domaine du Machine Learning basé sur des réseaux de


neurones profonds.
Un réseau profond :
contient plusieurs couches successives,
apprend des représentations hiérarchiques des données.
Différence clé :
Le ML traditionnel utilise des caractéristiques définies à la main.
Le Deep Learning apprend les caractéristiques automatiquement.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 8 / 103


Introduction au Deep Learning Introduction Générale

Et ensuite ?

Comprendre la structure d’un réseau de neurones :


neurones, couches, fonctions d’activation.
Comprendre comment il apprend :
propagation avant, erreur, rétropropagation.
Explorer les architectures modernes :
CNN, RNN, Transformers.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 9 / 103


Introduction au Deep Learning Le Perceptron

1 Introduction au Deep Learning


Introduction Générale
Le Perceptron
Descente de Gradient
Fonctions d’Activation

2 Réseaux de Neurones Multicouches (MLP)

3 CNN

4 RNN

5 Transformer

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 10 / 103


Introduction au Deep Learning Le Perceptron

Qu’est-ce que le Perceptron ?

Proposé par Frank Rosenblatt (1957), c’est le premier modèle


neuronal formel.
Inspiré du neurone biologique :
il reçoit des entrées,
les combine avec des poids,
applique une fonction de décision.
C’est un classifieur linéaire : il sépare les données à l’aide d’une
frontière linéaire.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 11 / 103


Introduction au Deep Learning Le Perceptron

Fonctionnement du Perceptron

Calcul de la sortie :

z = w1 x1 + w2 x2 + . . . + wn xn + b

Décision (fonction seuil) :


(
1 si z ≥ 0
ŷ =
−1 sinon

Le perceptron apprend en ajustant w et b pour séparer les deux


classes.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 12 / 103


Introduction au Deep Learning Le Perceptron

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 13 / 103


Introduction au Deep Learning Le Perceptron

Représentation vectorielle du Perceptron

Le perceptron peut être écrit de manière compacte en utilisant


des vecteurs.
On définit :
x1 w1
   
 x2  w2 
x =  ...  ,
 w =  ... 

xn wn

Le calcul du neurone devient :

z = w ⊤x + b

Cette notation permet de simplifier l’écriture et de généraliser à


plusieurs neurones.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 14 / 103


Introduction au Deep Learning Le Perceptron

Règle d’apprentissage du Perceptron

Mise à jour des poids après chaque exemple mal classé :

w ← w + η yi xi

b ← b + η yi
où η est le taux d’apprentissage.
Intuition :
si le point est mal classé : on déplace la frontière vers la bonne
direction.
si le point est bien classé : on ne change rien.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 15 / 103


Introduction au Deep Learning Le Perceptron

Capacités et limites du Perceptron

Avantages Limites
Très simple et rapide à Échoue si les classes ne sont
entraı̂ner. pas linéairement séparables
Interprétable. (ex : XOR).
Fonctionne bien pour les Une seule couche → faible
données linéairement expressivité.
séparables. A mené à la pause historique
de l’IA dans les années 1970.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 16 / 103


Introduction au Deep Learning Le Perceptron

Importance historique du Perceptron

Premier modèle à apprendre à partir de données.


Ses limites ont motivé :
A introduit : les réseaux multi-couches,
les poids, le biais, les fonctions d’activation non
la notion de mise à jour, linéaires,
les limites des modèles linéaires. l’algorithme de
backpropagation.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 17 / 103


Introduction au Deep Learning Descente de Gradient

1 Introduction au Deep Learning


Introduction Générale
Le Perceptron
Descente de Gradient
Fonctions d’Activation

2 Réseaux de Neurones Multicouches (MLP)

3 CNN

4 RNN

5 Transformer

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 18 / 103


Introduction au Deep Learning Descente de Gradient

Pourquoi la Descente de Gradient ?

Le perceptron utilise une règle simple de mise à jour, mais :


elle ne minimise pas explicitement une fonction de coût,
elle ne s’applique pas aux modèles continus (ex : régression logistique),
elle ne fonctionne pas pour les réseaux neuronaux profonds.
On a besoin d’une méthode générale pour minimiser une
fonction de coût :

J(w1 , w2 , ..., wn , b)

Objectif : trouver wi et b qui rendent les prédictions les plus


justes possibles.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 19 / 103


Introduction au Deep Learning Descente de Gradient

Principe de la Descente de Gradient

La descente de gradient met à jour les paramètres pour


descendre la pente de la fonction de coût.
Mise à jour :
∂J ∂J
wi ← wi − α b ←b−α
∂wi ∂b
où α est le taux d’apprentissage.
Intuition :
Le gradient indique la direction où le coût augmente.
On se déplace dans la direction opposée pour réduire le coût.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 20 / 103


Introduction au Deep Learning Descente de Gradient

Illustration de la Descente de Gradient

À chaque itération :
le point se déplace,
la fonction de coût diminue,
le modèle devient meilleur.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 21 / 103
Introduction au Deep Learning Descente de Gradient

Variantes de la Descente de Gradient

Batch Gradient Descent


Utilise toutes les données pour une mise à jour.
Stable mais lent.
Stochastic Gradient Descent (SGD)
Met à jour les poids après chaque exemple.
Rapide mais plus bruité.
Mini-Batch Gradient Descent
Compromis : mise à jour sur un petit ensemble.
Standard dans le Deep Learning.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 22 / 103


Introduction au Deep Learning Descente de Gradient

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 23 / 103


Introduction au Deep Learning Descente de Gradient

Pourquoi la Descente de Gradient est essentielle ?

Permet d’entraı̂ner :
régression logistique,
réseaux de neurones multi-couches,
CNN, RNN, Transformers...
L’algorithme de Backpropagation utilise la descente de gradient
pour ajuster tous les poids du réseau.
C’est le cœur de l’apprentissage profond moderne.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 24 / 103


Introduction au Deep Learning Fonctions d’Activation

1 Introduction au Deep Learning


Introduction Générale
Le Perceptron
Descente de Gradient
Fonctions d’Activation

2 Réseaux de Neurones Multicouches (MLP)

3 CNN

4 RNN

5 Transformer

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 25 / 103


Introduction au Deep Learning Fonctions d’Activation

Pourquoi des fonctions d’activation ?

Le perceptron utilise une fonction seuil : sortie = -1 ou +1.


Mais cette fonction est :
non dérivable,
non continue,
inutilisable pour l’optimisation par descente de gradient.
Pour entraı̂ner des réseaux de neurones modernes, il faut des
fonctions :
continues,
dérivables,
capables d’introduire de la non-linéarité.
Introduction des fonctions d’activation.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 26 / 103


Introduction au Deep Learning Fonctions d’Activation

Qu’est-ce qu’une fonction d’activation ?

Fonction appliquée à la sortie d’un neurone :

a = ϕ(z) avec z = w ⊤ x + b

Rôle :
introduire une non-linéarité,
permettre d’apprendre des fonctions complexes,
éviter qu’un réseau profond n’agisse comme une simple régression
linéaire.
Sans activation : même 10 couches se comporteraient comme un
seul modèle linéaire.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 27 / 103


Introduction au Deep Learning Fonctions d’Activation

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 28 / 103


Introduction au Deep Learning Fonctions d’Activation

Exemples de Fonctions d’Activation


Sigmoı̈de :
1
σ(z) =
1 + e −z

Produits des probabilités (0–1).


Tanh :
e z − e −z
tanh(z) =
e z + e −z

Sorties entre -1 et +1.


ReLU :
ReLU(z) = max(0, z)

Très utilisée dans le Deep Learning.


Simple, efficace, s’entraı̂ne bien.
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 29 / 103
Introduction au Deep Learning Fonctions d’Activation

Comparaison des Fonctions d’Activation

Avantages Limites
Sigmoı̈de : utile pour Sigmoı̈de : saturations →
probabilités. gradients faibles.
Tanh : centrée, meilleure Tanh : mêmes limites en
convergence. version centrée.
ReLU : rapide, évite le ReLU : neurones “morts” si
gradient faible. z < 0 trop souvent.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 30 / 103


Introduction au Deep Learning Fonctions d’Activation

Pourquoi la ReLU est si importante ?

Permet un apprentissage plus rapide dans les réseaux profonds.


Évite le problème du gradient qui disparaı̂t dans les couches.
Donne des représentations plus sparsifiées.
Est devenue la fonction dominante pour les CNNs, MLPs,
Transformers.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 31 / 103


Réseaux de Neurones Multicouches (MLP)

1 Introduction au Deep Learning

2 Réseaux de Neurones Multicouches (MLP)


Architecture du MLP
Forward Pass
Backpropagation

3 CNN

4 RNN

5 Transformer

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 32 / 103


Réseaux de Neurones Multicouches (MLP) Architecture du MLP

1 Introduction au Deep Learning

2 Réseaux de Neurones Multicouches (MLP)


Architecture du MLP
Forward Pass
Backpropagation

3 CNN

4 RNN

5 Transformer

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 33 / 103


Réseaux de Neurones Multicouches (MLP) Architecture du MLP

Qu’est-ce qu’un MLP ?

Un MLP est un réseau de neurones composé de plusieurs couches


:
couche d’entrée,
une ou plusieurs couches cachées,
couche de sortie.
Chaque couche est constituée de neurones entièrement
connectés.
C’est la généralisation du perceptron à plusieurs couches.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 34 / 103


Réseaux de Neurones Multicouches (MLP) Architecture du MLP

Structure générale d’un MLP

Notation :
x : entrée,
h(1) , h(2) , ..., h(L) : couches cachées,
ŷ : sortie.
Chaque couche applique :

h(k) = ϕ(W (k) h(k−1) + b (k) )

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 35 / 103


Réseaux de Neurones Multicouches (MLP) Architecture du MLP

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 36 / 103


Réseaux de Neurones Multicouches (MLP) Architecture du MLP

Profondeur et largeur

Profondeur : nombre de couches cachées.


Largeur : nombre de neurones dans chaque couche.
Plus profond → plus expressif.
Plus large → plus de capacité à mémoriser.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 37 / 103


Réseaux de Neurones Multicouches (MLP) Forward Pass

1 Introduction au Deep Learning

2 Réseaux de Neurones Multicouches (MLP)


Architecture du MLP
Forward Pass
Backpropagation

3 CNN

4 RNN

5 Transformer

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 38 / 103


Réseaux de Neurones Multicouches (MLP) Forward Pass

Propagation avant : une couche

Pour un neurone :
z = w ⊤x + b
Puis activation :
a = ϕ(z)

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 39 / 103


Réseaux de Neurones Multicouches (MLP) Forward Pass

Propagation avant dans le MLP

h(1) = ϕ(W (1) x + b (1) )


h(2) = ϕ(W (2) h(1) + b (2) )
ŷ = f (W (L) h(L−1) + b (L) )

Le calcul se fait de gauche à droite.


Le MLP apprend une fonction composée très expressive.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 40 / 103


Réseaux de Neurones Multicouches (MLP) Forward Pass

Représentation vectorielle d’une couche d’un MLP


Une couche d’un MLP généralise le perceptron à plusieurs
neurones.
Soit un vecteur d’entrée :
 (k−1) 
h1
h(k−1) 
h(k−1) =  2 . 
 
.
 . 
(k−1)
hnk−1
Le poids devient une matrice :
w11 w12 · · · w1nk−1
 
 w21 w22 · · · w2nk−1 
W (k) = 
 ... .. .. .. 
. . . 
wnk 1 wnk 2 · · · wnk nk−1
Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 41 / 103
Réseaux de Neurones Multicouches (MLP) Forward Pass

Représentation vectorielle d’une couche d’un MLP


On considère une couche k recevant un vecteur d’entrée :
h(k−1) ∈ Rnk−1

La matrice de poids possède une ligne par neurone de la couche :


W (k) ∈ R nk ×nk−1
Le biais est un vecteur colonne :
b (k) ∈ R nk

Le calcul de la couche devient :


z (k) = W (k) h(k−1) + b (k) ⇒ z (k) ∈ Rnk
h(k) = ϕ z (k)


Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 42 / 103


Réseaux de Neurones Multicouches (MLP) Forward Pass

Exemple : Classification à 3 couches

Chaque couche transforme la représentation.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 43 / 103


Réseaux de Neurones Multicouches (MLP) Backpropagation

1 Introduction au Deep Learning

2 Réseaux de Neurones Multicouches (MLP)


Architecture du MLP
Forward Pass
Backpropagation

3 CNN

4 RNN

5 Transformer

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 44 / 103


Réseaux de Neurones Multicouches (MLP) Backpropagation

Pourquoi la rétropropagation ?

Le réseau a des millions de paramètres.


Il faut une méthode systématique pour :
mesurer l’erreur,
calculer l’effet de chaque poids sur l’erreur,
mettre à jour les poids.
La solution : Backpropagation.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 45 / 103


Réseaux de Neurones Multicouches (MLP) Backpropagation

Principe de la Backpropagation

Étape 1 : Propagation avant (calcul de ŷ ).


Étape 2 : Calcul de l’erreur :

L = loss(ŷ , y )

Étape 3 : Propagation arrière du gradient.


Étape 4 : Mise à jour des paramètres.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 46 / 103


Réseaux de Neurones Multicouches (MLP) Backpropagation

Rôle des dérivées

La dérivée indique comment le changement d’un poids affecte


l’erreur.
Backprop calcule :
∂L ∂L
et
∂W (k) ∂b (k)
Puis descente de gradient met à jour les poids.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 47 / 103


Réseaux de Neurones Multicouches (MLP) Backpropagation

Théorème d’approximation universelle

Un MLP avec une seule couche cachée peut approximer toute


fonction continue.
En pratique : on utilise plusieurs couches → plus efficace.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 48 / 103


Réseaux de Neurones Multicouches (MLP) Backpropagation

Importance de la non-linéarité

Sans activations, un MLP profond = un modèle linéaire.


Grâce à ϕ :
on apprend des frontières non linéaires,
on construit des représentations hiérarchiques.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 49 / 103


Réseaux de Neurones Multicouches (MLP) Backpropagation

Limitation : Vanishing Gradient

Pour sigmoı̈de / tanh :


dérivées proches de 0,
apprentissage très lent dans les couches profondes.
D’où l’importance des activations modernes (ReLU, GELU).

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 50 / 103


Réseaux de Neurones Multicouches (MLP) Backpropagation

Overfitting dans les MLP

Les MLP ont beaucoup de paramètres.


Risques :
mémorisation,
mauvaise généralisation.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 51 / 103


CNN

1 Introduction au Deep Learning

2 Réseaux de Neurones Multicouches (MLP)

3 CNN
Pourquoi les Réseaux Convolutifs (CNNs) ?
Mécanismes des Réseaux Convolutifs

4 RNN

5 Transformer

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 52 / 103


CNN Pourquoi les Réseaux Convolutifs (CNNs) ?

1 Introduction au Deep Learning

2 Réseaux de Neurones Multicouches (MLP)

3 CNN
Pourquoi les Réseaux Convolutifs (CNNs) ?
Mécanismes des Réseaux Convolutifs

4 RNN

5 Transformer

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 53 / 103


CNN Pourquoi les Réseaux Convolutifs (CNNs) ?

Pourquoi les MLPs ne suffisent pas pour les images

Une image est une donnée :


de grande dimension (ex : 224 × 224 × 3),
avec une forte structure spatiale.
Un MLP :
traite l’image comme un vecteur plat,
ignore la notion de voisinage entre pixels,
nécessite un nombre énorme de paramètres.
Conséquences :
surapprentissage,
coût mémoire élevé,
mauvaise généralisation.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 54 / 103


CNN Pourquoi les Réseaux Convolutifs (CNNs) ?

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 55 / 103


CNN Pourquoi les Réseaux Convolutifs (CNNs) ?

Idée fondamentale des CNNs

Dans une image :


les pixels proches sont fortement corrélés,
les motifs locaux (bords, textures) sont essentiels.
Les CNNs exploitent deux idées clés :
Connectivité locale : chaque neurone regarde une petite région.
Partage des poids : le même filtre est appliqué partout.
Résultat :
beaucoup moins de paramètres,
meilleure généralisation,
invariance aux translations.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 56 / 103


CNN Pourquoi les Réseaux Convolutifs (CNNs) ?

Inspiration biologique

Les CNNs sont inspirés du cortex visuel humain.


Découvertes clés (Hubel & Wiesel, 1960s) :
neurones sensibles aux bords,
neurones sensibles à l’orientation,
organisation hiérarchique de la vision.
Les CNNs reproduisent cette hiérarchie :
couches basses : bords, textures,
couches profondes : formes, objets.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 57 / 103


CNN Pourquoi les Réseaux Convolutifs (CNNs) ?

Bref historique des CNNs

1980s–1990s :
Neocognitron (Fukushima),
LeNet-5 (Yann LeCun) — reconnaissance de chiffres.
2012 — Révolution ImageNet :
AlexNet (Krizhevsky et al.),
utilisation massive du GPU,
chute drastique de l’erreur.
2014–2016 :
VGG, GoogLeNet, ResNet,
réseaux plus profonds et plus performants.
Aujourd’hui :
CNNs + Transformers,
vision, médecine, satellite, environnement.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 58 / 103


CNN Pourquoi les Réseaux Convolutifs (CNNs) ?

Pourquoi les CNNs ont tout changé

Apprentissage automatique des caractéristiques visuelles.


Robustesse aux variations :
position,
éclairage,
bruit.
Performances supérieures dans :
classification d’images,
détection d’objets,
segmentation.
Devenus la base de nombreuses applications :
imagerie médicale,
satellites et environnement,
véhicules autonomes.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 59 / 103


CNN Mécanismes des Réseaux Convolutifs

1 Introduction au Deep Learning

2 Réseaux de Neurones Multicouches (MLP)

3 CNN
Pourquoi les Réseaux Convolutifs (CNNs) ?
Mécanismes des Réseaux Convolutifs

4 RNN

5 Transformer

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 60 / 103


CNN Mécanismes des Réseaux Convolutifs

Principe de la convolution

Une convolution applique un filtre (ou noyau) sur une image.


Le filtre est une petite matrice qui parcourt l’image.
À chaque position, on calcule :
X
y (i, j) = x(i + u, j + v ) w (u, v )
u,v

Cela produit une carte de caractéristiques (feature map).

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 61 / 103


CNN Mécanismes des Réseaux Convolutifs

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 62 / 103


CNN Mécanismes des Réseaux Convolutifs

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 63 / 103


CNN Mécanismes des Réseaux Convolutifs

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 64 / 103


CNN Mécanismes des Réseaux Convolutifs

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 65 / 103


CNN Mécanismes des Réseaux Convolutifs

Convolution avec plusieurs canaux

Une image couleur possède plusieurs canaux :

x ∈ RH×W ×C

(ex : RGB → C = 3).


Un filtre convolutif a la forme :

w ∈ Rk×k×C

La sortie est une carte 2D :


′ ′
y ∈ RH ×W

Plusieurs filtres → plusieurs cartes → empilées en profondeur.


Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 66 / 103
CNN Mécanismes des Réseaux Convolutifs

Biais et fonction d’activation

Après la convolution, on ajoute un biais :

z =x ∗w +b

Puis on applique une fonction d’activation :

h = ϕ(z)
Typiquement :
ReLU pour les couches intermédiaires.

Lien avec MLP : convolution = transformation linéaire locale +


non-linéarité.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 67 / 103


CNN Mécanismes des Réseaux Convolutifs

Stride et Padding

Stride : pas de déplacement du filtre.


stride = 1 → déplacement pixel par pixel.
stride ¿ 1 → réduction de la taille.
Padding : ajout de zéros autour de l’image.
permet de contrôler la taille de sortie,
évite de perdre l’information aux bords.
Taille de sortie :
H − k + 2p
H′ = +1
s

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 68 / 103


CNN Mécanismes des Réseaux Convolutifs

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 69 / 103


CNN Mécanismes des Réseaux Convolutifs

Convolution avec plusieurs canaux

Une image couleur possède plusieurs canaux :

x ∈ RH×W ×C

(ex : RGB → C = 3).


Un filtre convolutif a la forme :

w ∈ Rk×k×C

La sortie est une carte 2D :


′ ′
y ∈ RH ×W

Plusieurs filtres → plusieurs cartes → empilées en profondeur.


Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 70 / 103
CNN Mécanismes des Réseaux Convolutifs

Biais et fonction d’activation

Après la convolution, on ajoute un biais :

z =x ∗w +b

Puis on applique une fonction d’activation :

h = ϕ(z)
Typiquement :
ReLU pour les couches intermédiaires.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 71 / 103


CNN Mécanismes des Réseaux Convolutifs

Stride et Padding

Stride : pas de déplacement du filtre.


stride = 1 → déplacement pixel par pixel.
stride > 1 → réduction de la taille.
Padding : ajout de zéros autour de l’image.
permet de contrôler la taille de sortie,
évite de perdre l’information aux bords.
Taille de sortie :
H − k + 2p
H′ = +1
s

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 72 / 103


CNN Mécanismes des Réseaux Convolutifs

Pooling

Le pooling réduit la taille spatiale des cartes.


Exemple : Max Pooling

y (i, j) = max x(i + u, j + v )


u,v ∈fenêtre

Exemple : Pooling Moyenne


1 X
y (i, j) = x(i + u, j + v )
|fenêtre| u,v ∈fenêtre

Effets :
réduction du coût de calcul,
invariance aux petites translations,
moins de surapprentissage.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 73 / 103


CNN Mécanismes des Réseaux Convolutifs

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 74 / 103


CNN Mécanismes des Réseaux Convolutifs

CNN comme empilement de blocs

Un CNN est une succession de blocs :

Conv → Activation → Pooling

Les premières couches apprennent :


bords, textures.
Les couches profondes apprennent :
formes, objets, concepts.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 75 / 103


CNN Mécanismes des Réseaux Convolutifs

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 76 / 103


RNN

1 Introduction au Deep Learning

2 Réseaux de Neurones Multicouches (MLP)

3 CNN

4 RNN
Pourquoi les Réseaux Récurrents (RNNs) ?
Mécanismes des Réseaux Récurrents

5 Transformer

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 77 / 103


RNN Pourquoi les Réseaux Récurrents (RNNs) ?

1 Introduction au Deep Learning

2 Réseaux de Neurones Multicouches (MLP)

3 CNN

4 RNN
Pourquoi les Réseaux Récurrents (RNNs) ?
Mécanismes des Réseaux Récurrents

5 Transformer

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 78 / 103


RNN Pourquoi les Réseaux Récurrents (RNNs) ?

Le problème des données séquentielles

De nombreuses données sont ordonnées dans le temps :


texte (phrases, mots),
signaux audio,
séries temporelles (climat, énergie, finance),
séquences biologiques.
Les modèles classiques (MLP, CNN) supposent :
des entrées indépendantes,
une taille fixe,
pas de notion de mémoire.
Or, dans une séquence :
l’ordre est crucial,
le contexte passé influence le présent.

Exemple : le sens d’un mot dépend des mots précédents.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 79 / 103


RNN Pourquoi les Réseaux Récurrents (RNNs) ?

Idée clé des RNNs

Les RNNs introduisent une notion de mémoire.


À chaque instant :
le réseau reçoit une entrée xt ,
il conserve un état interne ht ,
cet état résume le passé.
Le même réseau est appliqué à chaque pas de temps :
partage des paramètres dans le temps.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 80 / 103


RNN Pourquoi les Réseaux Récurrents (RNNs) ?

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 81 / 103


RNN Pourquoi les Réseaux Récurrents (RNNs) ?

CNNs vs RNNs

CNN :
exploite la structure spatiale,
traitement parallèle,
champ réceptif local.
RNN :
exploite la structure temporelle,
traitement séquentiel,
dépendance au passé.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 82 / 103


RNN Mécanismes des Réseaux Récurrents

1 Introduction au Deep Learning

2 Réseaux de Neurones Multicouches (MLP)

3 CNN

4 RNN
Pourquoi les Réseaux Récurrents (RNNs) ?
Mécanismes des Réseaux Récurrents

5 Transformer

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 83 / 103


RNN Mécanismes des Réseaux Récurrents

Équations d’un RNN simple

À chaque pas de temps t :

ht = ϕ(Wx xt + Wh ht−1 + b)

Où :
xt ∈ Rnx : entrée au temps t,
ht ∈ Rnh : état caché,
Wx ∈ Rnh ×nx ,
Wh ∈ Rnh ×nh ,
b ∈ Rnh .

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 84 / 103


RNN Mécanismes des Réseaux Récurrents

Sortie d’un RNN

Le RNN peut produire :


une sortie à chaque pas de temps,
ou une sortie finale seulement.
Sortie typique :
yt = f (Wy ht + c)

Applications :
classification de séquences,
prédiction temporelle,
modélisation du langage.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 85 / 103


RNN Mécanismes des Réseaux Récurrents

Dépliage temporel du RNN

Un RNN peut être vu comme un MLP déplié dans le temps.


Chaque pas de temps correspond à une couche :

h1 → h2 → h3 → . . .

Les paramètres sont partagés :

Wx , Wh , b sont identiques pour tous t

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 86 / 103


RNN Mécanismes des Réseaux Récurrents

Limites des RNNs classiques

Difficulté à capturer des dépendances longues.


Problèmes de :
vanishing gradients,
exploding gradients.
Motivation pour des architectures améliorées :
LSTM,
GRU.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 87 / 103


Transformer

1 Introduction au Deep Learning

2 Réseaux de Neurones Multicouches (MLP)

3 CNN

4 RNN

5 Transformer
Pourquoi les Transformers ?
Mécanismes des Transformers

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 88 / 103


Transformer Pourquoi les Transformers ?

1 Introduction au Deep Learning

2 Réseaux de Neurones Multicouches (MLP)

3 CNN

4 RNN

5 Transformer
Pourquoi les Transformers ?
Mécanismes des Transformers

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 89 / 103


Transformer Pourquoi les Transformers ?

Limites des modèles séquentiels classiques

Les RNNs traitent les données séquentiellement :


pas de parallélisation,
entraı̂nement lent.
Difficulté à capturer des dépendances longues :
information lointaine diluée,
gradients instables.
Les CNNs séquentiels :
nécessitent de nombreuses couches,
ont un champ réceptif limité.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 90 / 103


Transformer Pourquoi les Transformers ?

Idée fondamentale des Transformers

Les Transformers remplacent la récursion par l’attention.


Chaque élément de la séquence :
peut regarder tous les autres,
pondère leur importance dynamiquement.
Avantages :
parallélisation complète,
dépendances longues bien capturées,
meilleure efficacité sur grandes séquences.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 91 / 103


Transformer Pourquoi les Transformers ?

Bref historique des Transformers

2017 — Vaswani et al. :


Attention Is All You Need.
2018–2019 :
BERT (compréhension du langage),
GPT (génération).
2020+ :
Vision Transformers (ViT),
modèles multimodaux (texte + image),
LLMs modernes.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 92 / 103


Transformer Mécanismes des Transformers

1 Introduction au Deep Learning

2 Réseaux de Neurones Multicouches (MLP)

3 CNN

4 RNN

5 Transformer
Pourquoi les Transformers ?
Mécanismes des Transformers

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 93 / 103


Transformer Mécanismes des Transformers

Représentation des entrées

Une séquence d’éléments :

x1 , x2 , . . . , xT

Chaque élément est transformé en vecteur :

X ∈ RT ×d

Problème : le modèle n’a pas de notion d’ordre.


Solution : encodage positionnel.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 94 / 103


Transformer Mécanismes des Transformers

Auto-attention : principe

Chaque vecteur est projeté en :


Query (Q),
Key (K ),
Value (V ).
Calcul :
Q = XWQ , K = XWK , V = XWV
Les poids d’attention mesurent l’importance relative.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 95 / 103


Transformer Mécanismes des Transformers

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 96 / 103


Transformer Mécanismes des Transformers

Formule de l’attention

QK ⊤
 
Attention(Q, K , V ) = softmax √ V
d

QK ⊤ : similarité entre éléments.


Softmax : normalisation des poids.
V : information agrégée.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 97 / 103


Transformer Mécanismes des Transformers

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 98 / 103


Transformer Mécanismes des Transformers

Multi-Head Attention

Au lieu d’une seule attention :


plusieurs attentions en parallèle.
Chaque tête apprend un type de relation :
syntaxique,
sémantique,
positionnelle.
Les sorties sont concaténées puis projetées.

Résultat : représentation plus riche.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 99 / 103


Transformer Mécanismes des Transformers

Bloc Transformer

Un bloc contient :
auto-attention,
normalisation,
réseau feed-forward,
connexions résiduelles.
Schéma simplifié :

X → Attention → FFN

Lien : le FFN est un petit MLP appliqué à chaque position.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 100 / 103


Transformer Mécanismes des Transformers

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 101 / 103


Transformer Mécanismes des Transformers

Pourquoi les Transformers dominent

Entraı̂nement parallèle et scalable.


Dépendances longues capturées naturellement.
Applicables à :
texte,
images,
audio,
graphes,
données multimodales.
Base des modèles modernes :
GPT, BERT, ViT, diffusion, agents.

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 102 / 103


Transformer Mécanismes des Transformers

FIN

Abdelfattah TOULAOUI Intelligence Artificielle: Deep Learning 103 / 103

Vous aimerez peut-être aussi