0% ont trouvé ce document utile (0 vote)
18 vues6 pages

Flashcards sur les Réseaux de Neurones

Transféré par

rawaa.mhimdi
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats ODT, PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
18 vues6 pages

Flashcards sur les Réseaux de Neurones

Transféré par

rawaa.mhimdi
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats ODT, PDF, TXT ou lisez en ligne sur Scribd

Parfait — je te donne une série de flashcards en français (questions →

réponses courtes) centrées UNIQUEMENT sur les réseaux de neurones,


conçues pour te préparer au QCM type CentraleSupélec que tu as montré.
Utilise-les en révision active (couvre la réponse, essaie de répondre, puis
vérifie). 🔥

Flashcards — Réseaux de neurones (Q → R)

1. Q : Qu’est-ce qu’un neurone artificiel (perceptron) ?


R : Une unité qui calcule ( z = w^\top x + b ) puis ( a = \sigma(z) )
où ( \sigma ) est une fonction d’activation.

2. Q : Pourquoi mettre une fonction d’activation non linéaire ?


R : Sans non-linéarité, le réseau reste équivalent à une
transformation linéaire ; les activations non linéaires permettent
d’apprendre des relations complexes.

3. Q : Donne 3 activations courantes et leurs propriétés.


R : Sigmoïde (bornée, saturation, bon pour sortie binaire), ReLU
(rapide, évite saturation positive, peut « mourir »), tanh (centrée,
saturation).

4. Q : Formule du softmax et usage.


R : ( \text{softmax}(z)_i = \frac{e^{z_i}}{\sum_j e^{z_j}} ). Sert à
obtenir des probabilités pour classification multi-classe.

5. Q : Perte courante pour classification binaire et multiclasses.


R : Binaire : binary cross-entropy ; Multiclasse : categorical cross-
entropy (avec softmax).

6. Q : Principe du backpropagation.
R : Application récursive de la règle de la chaîne pour calculer les
dérivées de la perte par rapport aux poids ; permet mise à jour via
gradient descent.

7. Q : Le backpropagation garantit-il un optimum global ?


R : Non — généralement il converge vers un optimum local ou un
point selle ; dépend de l'initialisation et optimisation.

8. Q : Qu’est-ce que l’initialisation des poids et pourquoi c’est


important ?
R : Choix des valeurs initiales (ex. Xavier/He) pour éviter gradients
trop grands ou trop petits (vanishing/exploding).

9. Q : Vanishing vs exploding gradients ?


R : Vanishing : gradients → 0 (profond réseau, saturations) ;
Exploding : gradients très grands (instabilité). Les activations et
initialisations influencent ça.
10. Q : Définit le terme « overfitting ».
R : Modèle qui s’adapte trop aux données d’entraînement (y compris
bruit) et généralise mal.

11. Q : 4 méthodes pour lutter contre l’overfitting en NN.


R : Regularization L2, dropout, early stopping, augmentation de
données (data augmentation).

12. Q : Regularization L2 (weight decay) : rôle ?


R : Ajoute ( \lambda \sum w^2 ) à la perte → pénalise poids grands
→ réduit variance.

13. Q : Dropout — principe succinct.


R : À chaque itération, on « coupe » aléatoirement des neurones
(probabilité p) → empêche co-dépendances → régularise.

14. Q : Batch Normalization — utilité principale.


R : Normalise activations sur mini-batch → accélère convergence,
stabilise entraînement, réduit sensibilité au learning rate.

15. Q : Fonction d’activation linéaire possible dans un


réseau ? quand ?
R : On peut utiliser une activation linéaire en sortie pour régression ;
mais pas dans toutes les couches cachées (sinon réseau reste
linéaire).

16. Q : Comment calculer le nombre de paramètres d’un


MLP fully connected ?
R : Pour couche entre dims (d_{\text{in}}) et (d_{\text{out}}) :
paramètres (= (d_{\text{in}}+1)\times d_{\text{out}}) (incluant
biais). Somme sur couches.

17. Q : Exemple rapide : 3 entrées → couche cachée 7


neurones → sortie 1. Combien de paramètres ?
R : (3+1)*7 = 28 pour W1+b1 ; (7+1)*1 = 8 pour W2+b2 ; total =
36 paramètres.

18. Q : Qu’est-ce que l’Universal Approximation Theorem ?


R : Un réseau feedforward à une couche cachée avec assez de
neurones et activation non linéaire peut approximer toute fonction
continue sur un compact (sous conditions). Limites : pas d’indication
du nombre de neurones ou d’apprentissage.

19. Q : Pourquoi l’Universal Approx. n’implique pas que NN


est toujours meilleur ?
R : Nécessite potentiellement énormément de neurones/données ;
pas d’assurance d’optimisation/praticité ni d’interprétabilité.
20. Q : Différence optimisation : batch, mini-batch, et full
batch ?
R : Full batch = gradient sur tout dataset ; mini-batch = gradient sur
petits lots (compromis vitesse/stabilité) ; stochastic = batch taille 1
(bruyant).

21. Q : Méthodes d’optimisation modernes populaires.


R : SGD (avec momentum), Adam, RMSprop, AdaGrad. Adam est
souvent utilisé par défaut.

22. Q : Qu’est-ce que le learning rate scheduler ?


R : Stratégie pour réduire le learning rate pendant l’entraînement
(ex. step decay, cosine annealing) pour améliorer convergence.

23. Q : Qu’est-ce qu’un réseau profond (deep) vs peu


profond ?
R : Deep = plusieurs couches cachées ; permet d’apprendre des
représentations hiérarchiques.

24. Q : Qu’est-ce qu’une couche convolutionnelle (CNN)


apporte ?
R : Exploite structure locale et translation invariance : filtres
partagés (moins de params), bon pour images/signaux.

25. Q : Qu’est-ce qu’un RNN et quand l’utiliser ?


R : Réseau récurrent : gère données séquentielles (dépendances
temporelles) ; variantes : LSTM, GRU pour problèmes de longue
dépendance.

26. Q : Softmax + cross-entropy : pourquoi c’est numérique


stable ?
R : On combine log et softmax pour éviter overflow (fonction log-
softmax) et obtenir gradient simple : ( \nabla = p - y ).

27. Q : Qu’est-ce que le gradient clipping et pourquoi ?


R : Limiter la norme des gradients (clip) pour éviter exploding
gradients lors de backprop dans réseaux profonds/récurrents.

28. Q : Qu’est-ce que le transfert d’apprentissage ?


R : Réutiliser des poids pré-entraînés (ex. sur ImageNet) puis fine-
tuning sur tâche spécifique → utile si peu de données.

29. Q : Comment évaluer un classifieur binaire ? Indicateurs


importants.
R : Matrice de confusion → précision, rappel (sensitivity), spécificité,
F1 score, ROC AUC selon le contexte.
30. Q : Qu’est-ce que la vanishing gradient dans RNN et
solution ?
R : Les gradients s’annulent sur longues séquences ; solutions :
LSTM/GRU, gradient clipping, architectures attention.

31. Q : Qu’est-ce qu’un ensemble (ensemble learning) pour


NN ?
R : Combiner plusieurs réseaux (bagging, averaging) pour réduire
variance et améliorer robustesse.

32. Q : Quelle est l’influence du batch size sur


généralisation ?
R : Petits batchs ajoutent bruit → parfois meilleure généralisation ;
grands batchs plus stables, nécessitent ajustement LR.

33. Q : Pourquoi surveiller training vs validation loss ?


R : Permet détecter overfitting (train loss diminue, val loss remonte)
et arrêter/ajuster l'entraînement.

34. Q : Qu’est-ce qu’un point selle et pourquoi important en


optimisation NN ?
R : Point où gradient = 0 mais ni min ni max ; très fréquent en
grands espaces de paramètres → rend convergence difficile.

35. Q : Quelle est la règle générale pour choisir


l’architecture d’un MLP ?
R : Commencer simple (peu de couches/neuronnes), valider,
augmenter si underfitting ; utiliser cross-validation, régularisation.

Comment pratiquer ces flashcards

 Passe 10–15 min/jour : active recall + spaced repetition.

 Fais ex. 16 (compte des paramètres) à la main plusieurs fois


(exemples variés).

 Pratique petits calculs de softmax/cross-entropy et backprop simples


sur papier.

Si tu veux, je peux :

 Transformer ces flashcards en PDF imprimable (format A4, 2


colonnes) ;

 Générer exercices corrigés type QCM sur les mêmes thèmes ;

 Ou te faire un quiz interactif (20 questions) dans le style


CentraleSupélec.
Que souhaites-tu maintenant ?

Oui ! Pour calculer le nombre total de paramètres d’un réseau de


neurones fully connected, on peut utiliser une règle générale
simple.

Règle générale

Pour un réseau avec :

 (L) couches (entrée exclue)

 Couche (l) avec (n_l) neurones

 Couche précédente (l-1) avec (n_{l-1}) neurones

Nombre de paramètres dans la couche (l) :

[
\text{Paramètres}l = n_l \times n{l-1} ; (\text{poids}) + n_l ; (\
text{biais})
]

Total des paramètres

[
\text{Total} = \sum_{l=1}^{L} \big( n_l \times n_{l-1} + n_l \big)
]

 (n_0) = nombre d’entrées

 (L) = nombre de couches après l’entrée


 Cette formule fonctionne pour tout MLP fully connected.

Exemple rapide

 Entrée : 3 neurones

 Couche cachée : 7 neurones

 Couche sortie : 1 neurone

Calcul :

1. Couche cachée : (7 \times 3 + 7 = 28)

2. Couche sortie : (1 \times 7 + 1 = 8)

Total = 28 + 8 = 36 ✅

Si tu veux, je peux te faire un petit tableau/matrice simple que tu


pourras utiliser comme flashcard pour tous tes réseaux, pour calculer
les paramètres en 1 coup d’œil.

Veux-tu que je fasse ça ?

Vous aimerez peut-être aussi