Parfait — je te donne une série de flashcards en français (questions →
réponses courtes) centrées UNIQUEMENT sur les réseaux de neurones,
conçues pour te préparer au QCM type CentraleSupélec que tu as montré.
Utilise-les en révision active (couvre la réponse, essaie de répondre, puis
vérifie). 🔥
Flashcards — Réseaux de neurones (Q → R)
1. Q : Qu’est-ce qu’un neurone artificiel (perceptron) ?
R : Une unité qui calcule ( z = w^\top x + b ) puis ( a = \sigma(z) )
où ( \sigma ) est une fonction d’activation.
2. Q : Pourquoi mettre une fonction d’activation non linéaire ?
R : Sans non-linéarité, le réseau reste équivalent à une
transformation linéaire ; les activations non linéaires permettent
d’apprendre des relations complexes.
3. Q : Donne 3 activations courantes et leurs propriétés.
R : Sigmoïde (bornée, saturation, bon pour sortie binaire), ReLU
(rapide, évite saturation positive, peut « mourir »), tanh (centrée,
saturation).
4. Q : Formule du softmax et usage.
R : ( \text{softmax}(z)_i = \frac{e^{z_i}}{\sum_j e^{z_j}} ). Sert à
obtenir des probabilités pour classification multi-classe.
5. Q : Perte courante pour classification binaire et multiclasses.
R : Binaire : binary cross-entropy ; Multiclasse : categorical cross-
entropy (avec softmax).
6. Q : Principe du backpropagation.
R : Application récursive de la règle de la chaîne pour calculer les
dérivées de la perte par rapport aux poids ; permet mise à jour via
gradient descent.
7. Q : Le backpropagation garantit-il un optimum global ?
R : Non — généralement il converge vers un optimum local ou un
point selle ; dépend de l'initialisation et optimisation.
8. Q : Qu’est-ce que l’initialisation des poids et pourquoi c’est
important ?
R : Choix des valeurs initiales (ex. Xavier/He) pour éviter gradients
trop grands ou trop petits (vanishing/exploding).
9. Q : Vanishing vs exploding gradients ?
R : Vanishing : gradients → 0 (profond réseau, saturations) ;
Exploding : gradients très grands (instabilité). Les activations et
initialisations influencent ça.
10. Q : Définit le terme « overfitting ».
R : Modèle qui s’adapte trop aux données d’entraînement (y compris
bruit) et généralise mal.
11. Q : 4 méthodes pour lutter contre l’overfitting en NN.
R : Regularization L2, dropout, early stopping, augmentation de
données (data augmentation).
12. Q : Regularization L2 (weight decay) : rôle ?
R : Ajoute ( \lambda \sum w^2 ) à la perte → pénalise poids grands
→ réduit variance.
13. Q : Dropout — principe succinct.
R : À chaque itération, on « coupe » aléatoirement des neurones
(probabilité p) → empêche co-dépendances → régularise.
14. Q : Batch Normalization — utilité principale.
R : Normalise activations sur mini-batch → accélère convergence,
stabilise entraînement, réduit sensibilité au learning rate.
15. Q : Fonction d’activation linéaire possible dans un
réseau ? quand ?
R : On peut utiliser une activation linéaire en sortie pour régression ;
mais pas dans toutes les couches cachées (sinon réseau reste
linéaire).
16. Q : Comment calculer le nombre de paramètres d’un
MLP fully connected ?
R : Pour couche entre dims (d_{\text{in}}) et (d_{\text{out}}) :
paramètres (= (d_{\text{in}}+1)\times d_{\text{out}}) (incluant
biais). Somme sur couches.
17. Q : Exemple rapide : 3 entrées → couche cachée 7
neurones → sortie 1. Combien de paramètres ?
R : (3+1)*7 = 28 pour W1+b1 ; (7+1)*1 = 8 pour W2+b2 ; total =
36 paramètres.
18. Q : Qu’est-ce que l’Universal Approximation Theorem ?
R : Un réseau feedforward à une couche cachée avec assez de
neurones et activation non linéaire peut approximer toute fonction
continue sur un compact (sous conditions). Limites : pas d’indication
du nombre de neurones ou d’apprentissage.
19. Q : Pourquoi l’Universal Approx. n’implique pas que NN
est toujours meilleur ?
R : Nécessite potentiellement énormément de neurones/données ;
pas d’assurance d’optimisation/praticité ni d’interprétabilité.
20. Q : Différence optimisation : batch, mini-batch, et full
batch ?
R : Full batch = gradient sur tout dataset ; mini-batch = gradient sur
petits lots (compromis vitesse/stabilité) ; stochastic = batch taille 1
(bruyant).
21. Q : Méthodes d’optimisation modernes populaires.
R : SGD (avec momentum), Adam, RMSprop, AdaGrad. Adam est
souvent utilisé par défaut.
22. Q : Qu’est-ce que le learning rate scheduler ?
R : Stratégie pour réduire le learning rate pendant l’entraînement
(ex. step decay, cosine annealing) pour améliorer convergence.
23. Q : Qu’est-ce qu’un réseau profond (deep) vs peu
profond ?
R : Deep = plusieurs couches cachées ; permet d’apprendre des
représentations hiérarchiques.
24. Q : Qu’est-ce qu’une couche convolutionnelle (CNN)
apporte ?
R : Exploite structure locale et translation invariance : filtres
partagés (moins de params), bon pour images/signaux.
25. Q : Qu’est-ce qu’un RNN et quand l’utiliser ?
R : Réseau récurrent : gère données séquentielles (dépendances
temporelles) ; variantes : LSTM, GRU pour problèmes de longue
dépendance.
26. Q : Softmax + cross-entropy : pourquoi c’est numérique
stable ?
R : On combine log et softmax pour éviter overflow (fonction log-
softmax) et obtenir gradient simple : ( \nabla = p - y ).
27. Q : Qu’est-ce que le gradient clipping et pourquoi ?
R : Limiter la norme des gradients (clip) pour éviter exploding
gradients lors de backprop dans réseaux profonds/récurrents.
28. Q : Qu’est-ce que le transfert d’apprentissage ?
R : Réutiliser des poids pré-entraînés (ex. sur ImageNet) puis fine-
tuning sur tâche spécifique → utile si peu de données.
29. Q : Comment évaluer un classifieur binaire ? Indicateurs
importants.
R : Matrice de confusion → précision, rappel (sensitivity), spécificité,
F1 score, ROC AUC selon le contexte.
30. Q : Qu’est-ce que la vanishing gradient dans RNN et
solution ?
R : Les gradients s’annulent sur longues séquences ; solutions :
LSTM/GRU, gradient clipping, architectures attention.
31. Q : Qu’est-ce qu’un ensemble (ensemble learning) pour
NN ?
R : Combiner plusieurs réseaux (bagging, averaging) pour réduire
variance et améliorer robustesse.
32. Q : Quelle est l’influence du batch size sur
généralisation ?
R : Petits batchs ajoutent bruit → parfois meilleure généralisation ;
grands batchs plus stables, nécessitent ajustement LR.
33. Q : Pourquoi surveiller training vs validation loss ?
R : Permet détecter overfitting (train loss diminue, val loss remonte)
et arrêter/ajuster l'entraînement.
34. Q : Qu’est-ce qu’un point selle et pourquoi important en
optimisation NN ?
R : Point où gradient = 0 mais ni min ni max ; très fréquent en
grands espaces de paramètres → rend convergence difficile.
35. Q : Quelle est la règle générale pour choisir
l’architecture d’un MLP ?
R : Commencer simple (peu de couches/neuronnes), valider,
augmenter si underfitting ; utiliser cross-validation, régularisation.
Comment pratiquer ces flashcards
Passe 10–15 min/jour : active recall + spaced repetition.
Fais ex. 16 (compte des paramètres) à la main plusieurs fois
(exemples variés).
Pratique petits calculs de softmax/cross-entropy et backprop simples
sur papier.
Si tu veux, je peux :
Transformer ces flashcards en PDF imprimable (format A4, 2
colonnes) ;
Générer exercices corrigés type QCM sur les mêmes thèmes ;
Ou te faire un quiz interactif (20 questions) dans le style
CentraleSupélec.
Que souhaites-tu maintenant ?
Oui ! Pour calculer le nombre total de paramètres d’un réseau de
neurones fully connected, on peut utiliser une règle générale
simple.
Règle générale
Pour un réseau avec :
(L) couches (entrée exclue)
Couche (l) avec (n_l) neurones
Couche précédente (l-1) avec (n_{l-1}) neurones
Nombre de paramètres dans la couche (l) :
[
\text{Paramètres}l = n_l \times n{l-1} ; (\text{poids}) + n_l ; (\
text{biais})
]
Total des paramètres
[
\text{Total} = \sum_{l=1}^{L} \big( n_l \times n_{l-1} + n_l \big)
]
(n_0) = nombre d’entrées
(L) = nombre de couches après l’entrée
Cette formule fonctionne pour tout MLP fully connected.
Exemple rapide
Entrée : 3 neurones
Couche cachée : 7 neurones
Couche sortie : 1 neurone
Calcul :
1. Couche cachée : (7 \times 3 + 7 = 28)
2. Couche sortie : (1 \times 7 + 1 = 8)
Total = 28 + 8 = 36 ✅
Si tu veux, je peux te faire un petit tableau/matrice simple que tu
pourras utiliser comme flashcard pour tous tes réseaux, pour calculer
les paramètres en 1 coup d’œil.
Veux-tu que je fasse ça ?