Université Batna2,
Module Deep Learning TD 3 (Master 2 SDS) 2020/2021
Remarques : essayer de résoudre les exercices suivants puis en les corrige ensemble
via une séance de ZOOM (ou google Meet) qui aura lieu le prochain dimanche 7 février.
Exercice 1 : (sur l’Erreur quadratique moyenne)
Examiner les deux graphes suivants :
- Lequel des deux ensembles de données présentés dans les graphes précédents a l'erreur
quadratique moyenne la plus élevée ?
Exercice 2 :
Exercice : Soit le réseau de neurones ci-dessous.
- Déterminer le nombre de couches caché, puis le nombre de nœuds dans chaque couche (caché
et sortie).
- Donner l’expression mathématique du facteur de correction 𝛿𝑖,𝑘 pour les neurones dans les
deux couches (de sortie et couche caché) sachant qu’une sigmoïde bipolaire est utilisée
comme fonction d’activation f(a).
- Si on présente le vecteur d’apprentissage (-1,1) comme entrée et 𝜼 = 𝟎, 𝟐𝟓, calculer la sortie
de chaque neurone de la couche caché.
Exercice 3 : (taux d’apprentissage et son optimisation)
Université Batna2,
Module Deep Learning TD 3 (Master 2 SDS) 2020/2021
Rappel : Les algorithmes de descente de gradient multiplient généralement le gradient par une valeur
scalaire appelée taux d'apprentissage (la valeur η) (ou parfois pas d'apprentissage) pour déterminer
le point suivant. Par exemple, si la magnitude du gradient est de 2,5 et que le taux d'apprentissage est
de 0,01, alors l'algorithme de descente de gradient sélectionnera le point suivant situé à une distance
de 0,025 du point précédent.
Les hyperparamètres sont les variables pouvant être ajustées par les programmeurs dans les
algorithmes de Machine Learning. La plupart des programmeurs spécialisés dans le Machine Learning
consacrent une bonne partie de leur temps à ajuster le taux d'apprentissage. Si vous sélectionnez un
taux d'apprentissage trop bas, le temps requis pour l'apprentissage sera trop long.
Taux d'apprentissage trop bas Taux d'apprentissage trop élevé
Il existe un taux d'apprentissage idéal pour chaque problème de régression. Cette valeur dépend de
la courbure de la fonction de perte. Si vous savez que le gradient de la fonction de perte est faible,
vous pouvez en toute sécurité essayer un taux d'apprentissage plus élevé, ce qui compense le gradient
faible et entraîne un pas d'apprentissage plus grand.
Dans cet exercice vous utiliser le site Playground ([Link] vous allez
effectuer deux tâches pour tester le taux d'apprentissage.
Pour cet exercice, trois boutons-vous sont proposés :
Tâche 1 :
Soit la configuration suivante :
Université Batna2,
Module Deep Learning TD 3 (Master 2 SDS) 2020/2021
Repérez le menu Taux d'apprentissage en haut à droite du Playground : Sélectionner la valeur 3 pour
le taux d'apprentissage (valeur très élevé).
- Observez dans quelle mesure ce taux affecte votre modèle en cliquant sur le bouton "Pas" 10
ou 20 fois. Après chaque itération, notez combien la visualisation du modèle change
radicalement.
Tâche 2 : procédez comme suit :
1. Appuyez sur le bouton Réinitialiser.
2. Diminuez le taux d'apprentissage. (1 puis 0.1, ensuite 0.01 et ainsi de suite)
3. Appuyez plusieurs fois sur le bouton "Pas".
Quel a été l'impact de cette diminution du taux sur la convergence ? Examinez à la fois le nombre de
pas nécessaires à la convergence du modèle et si ce dernier converge de façon régulière ou non.
Procédez à des tests en appliquant des valeurs toujours plus faibles au taux d'apprentissage. Trouvez-
vous un taux d'apprentissage trop lent pour être utile ?