Université Gaston Berger Année Académique 2025-2026
U.F.R SAT Master 2 Sciences de données
Apprentissage Statistique
Travail en groupe de 2 étudiants (pondération 10%).
à rendre avant 14 août 2026 à 23h59
′
Exercice 1 Soient X ∈ Rn×(p+1) la matrice contenant les données dont la ième ligne est (xi , 1) avec
′
xi = (x1 , . . . , xp ) et Y ∈ Rn vecteur contenant les étiquettes yi . L’estimateur des moindre carrés le
vecteur
n
!
α̂
= (X T X)−1 X T Y = min
X
(yi − (⟨α, xi ⟩ + β))2
β̂ α∈Rp ,β∈R
i=1
1. Programmez une fonction regression(X, Y) qui renvoie l’estimateur des moindre carrés.
Utiliser votre fonction de régression sur le jeu de données Boston House Prices (à charger avec
la fonction [Link] boston(). Comparez les vecteurs α̂ et β̂ renvoyés par votre fonction
avec les attributs coef_ et intercept_ d’un régresseur de type linear_model.LinearRegression.
Quelques fonctions utiles : dot(), transpose(), pinv().
2. Écrire une fonction regress(X, α, β) qui renvoie le vecteur Ŷ des étiquettes prédites tel que
ŷi = ⟨α, xi ⟩ + β
3. Calculer ϵ̂ = ∥Y − Ŷ ∥22 = ni=1 (yi − ŷi )2 l’erreur au sens des moindres carrés du régresseur
P
appris sur l’ensemble du jeu de données Boston.
4. Dans certains cas, la matrice X T X n’est pas inversible. Pour remédier à ce problème, on ajoute
un ridge λIp+1 à cette matrice où Ip+1 est la matrice identité d’ordre p + 1.
Cela correspond à une légère modification du problème d’optimisation qui pénalise la taille
des coefficients. Le vecteur des moindre carrés généralisés est donné par :
n
!
α̂
= (X T X + λIp+1 )−1 X T Y =
X
min (yi − (⟨α, xi ⟩ + β))2 + λ∥α∥22
β̂ p
α∈R ,β∈R
i=1
(a) Programmez une fonction ridge_regression(X, Y , lambda) qui renvoie l’estimateur des
moindre carrés généralisés. Comparez à nouveau les vecteurs α̂ et β̂ obtenus pour le para-
mètre lambda = 1 sur le jeu de données Boston avec les attributs coef_ et intercept_ d’un
régresseur de type linear_model.Ridge
(b) Tracez l’évolution des coefficients du vecteur α̂ en fonction du paramètre de régularisation
lambda pour des valeurs entre 0.001 et 1000. Quelles variables semblent le mieux expliquer
le prix des maisons à Boston ?
(c) Trouvez par un moyen approprié la meilleure valeur pour le paramètre lambda. Apprenez
ensuite un régresseur avec cette valeur sur l’ensemble du jeu de données Boston et calculez
l’erreur au sens des moindres carrés sur ce même échantillon.
1
5. La formulation Lasso est une variante de la régression linéaire régularisée. La pénalisation du
vecteur des coefficients se fait ici avec la norme ||1 a la place de la norme euclidienne ||2 . Soit
α ∈ Rp , ∥α∥1 = pi=1 |αi |. Il s’ensuit des solutions dites parcimonieuses, c’est-à-dire que de
P
nombreux coefficients sont égaux à zéro. Le problème d’optimisation s’écrit alors :
n
X
min
p
(yi − (⟨α, xi ⟩ + β))2 + λ∥α∥1
α∈R ,β∈R
i=1
(a) En utilisant la classe linear_model.Lasso, tracez l’évolution des coefficients du vecteur α̂ en
fonction de la valeur du paramètre lambda. Quelles variables semblent le mieux expliquer le
prix des maisons à Boston ? Sont-elles les mêmes que celles trouvées à l’exercice précédent ?
Comment se comportent les autres variables lorsque la valeur de lambda augmente ?
(b) Trouvez par un moyen approprié la meilleure valeur pour le paramètre lambda. Apprenez
ensuite un régresseur avec cette valeur sur l’ensemble du jeu de données Boston et calculez
l’erreur au sens des moindres carrés sur ce même échantillon.
Exercice 2
1. Simuler des données (taille 500) de classification binaire et deux features.
2. Découper les données en données d’apprentissage et données de test.
3. Programmer l’algorithme de Gradient Descent sur la régression logisitique et faire la prédiction
des données de test. Quel score avez obtenu ? Essayez d’améliorer ce score.