TD 8 Cours Statistique et modélisation
A.A. 2025-2026
Exercice 1 Soit Y un modèle linéaire, i.e.,
Y = Xβ + ϵ,
avec les ϵi des variables aléatoires i.i.d centrées et de variance constante σ 2 . Soit T ∈ Rn un vecteur
déterministe, montrer que
E ||T − Y ||2 = nσ 2 + ||T − Xβ||2
Exercice 2 Soit Y un modèle linéaire avec E[ϵ] = 0. On note (ϵ̂i )1≤i≤n les résidus. Montrer que
n
1X
ϵ̂i = 0.
n
i=1
Exercice 3 On se propose de montrer dans cet exercice que, pour Y qui suit le modèle linéaire
Y = Xβ + ϵ avec ϵi i.i.d de variance constante et E[ϵi ] = 0, l’estimateur des moindres carrés est
optimal parmi les estimateurs linéaires sans biais. L’optimalité est comprise dans le sens suivant : soit
β̃ un autre estimateur linéaire sans biais de β, alors
Cov(β̃) − Cov(β̂) est une matrice semi définie positive,
où β̂ est l’estimateur obtenu par la méthode des moindres carrés. Ou, de façon équivalente, pour toute
combinaisons linaires C ⊤ β des paramètres, nous avons
Var(C ⊤ β̃) ≥ Var(C ⊤ β̂).
1. Posons β̃ = M Y où M est une matrice de taille p × n. Montrer que M X = Ip .
2. Noton β̂ = T P[X] Y où P[X] est la matrice de projection sur l’espace engendré par les colonnes de
X. Montrer que M P[X] = T P[X] .
3. Montrer que β̃ = β̂ + M P[X]⊥ Y où [X]⊥ désigne l’orthogonal de [X]. Conclure.
Exercice 4 Soit X une matrice de taille n × p composée de p vecteurs indépendants de Rn . Nous
notons Xq la matrise composée des (q < p) premiers vecteurs de X. Nous avons les deux modèles
linéaires suivants
Y = Xβ + ϵ, Yq = Xq γ + ϵ.
Comparer les deux R2 des deux modèles.
Exercice 5 Soit le modèle habituel de régression
Y = Xβ + ϵ
avec ϵ = (ϵi )ni=1 des variables aléatoires i.i.d centrées et de variance constante σ 2 . Nous souhaitons
effectuer la régression ridge, i.e., l’estimateur β̂ ridge résultant du programme de minisation suivant
L(β) = ||Y − Xβ||2 − κ||β||2 , κ > 0.
1
1. Montrer que
β̂ ridge = (X ⊤ X + κIp )−1 X ⊤ Y.
2. Montrer que
Biais(β̂ ridge ) = −κ(X ⊤ X + κI)−1 β.
3. Montrer que
Var(β̂ ridge ) = σ 2 (X ⊤ X + κI)−1 X ⊤ X(X ⊤ X + κI)−1 .
4. Calculer l’erreur quadratique de β̂ ridge .
5. Retrouver que la matrice de l’erreur quadratique moyenne pour l’estimateur des moindres carrés
est
EQM(β̂ mc ) = σ 2 (X ⊤ X)−1
= σ 2 (X ⊤ X + κIp )−1 (X ⊤ X + κ2 (X ⊤ X)−1 + 2κIp )(X ⊤ X + κIp )−1 .
6. Calculer la différence entre la matrique de l’erreur quadratique moyenne pour l’estimateur ridge
et celle pour l’estimateur des moindres carrés et montrer l’égalité suivante :
∆ = EQM(β̂ ridge ) − EQM(β̂ mc )
= κ(X ⊤ X + κIp )−1 (σ 2 (2Ip + κ2 (X ⊤ X)−1 ) − κββ ⊤ )(X ⊤ X + κIp )−1 .
7. En utilisant le théorème suivant : Théorème - Si A est inversible, alors une condition nécessaire
et suffisante pour que B soit semi définie positive est que ABA⊤ le soit aussi. Déduire qu’une con-
dition nécessaire et suffisante pour que ∆ soit semi définie positive est que (σ 2 (2Ip +κ2 (X ⊤ X)−1 )−
κββ ⊤ ) le soit aussi.
8. En admettant que Ip − γγ ⊤ est semi définie positive si et seulement si γ ⊤ γ ≤ 1, déduire qu’une
condition suffisante pour que ∆ soit semi définie positive est que κ ≤ 2σ 2 /β ⊤ β.
9. Conclure sur l’optimalité de la régression ridge par rapport à celle de la régression des moindres
carrés.