MTH2302: Régression linéaire multiple 1 / 31
MTH2302: Régression linéaire multiple
Wissem Maazoun
École Polytechnique de Montréal
Département de Mathématiques et de génie industriel
Wissem Maazoun MTH2302: Régression linéaire multiple 1 / 31
MTH2302: Régression linéaire multiple 2 / 31
Introduction
Le modèle général
Le modèle de régression linéaire multiple a pour équation
y = β0 + β1 x1 + β2 x2 + . . . + βk xk +
où β0 , β1 , . . . , βk sont des paramètres à estimer.
On dispose de n observations de la forme
(yi , xi1 , xi2 , . . . , xik ), i = 1, . . . , n.
Le modèle suppose que pour i = 1, 2, . . . , n
yi = β0 + β1 xi1 + β2 xi2 + . . . + βk xik + i (1)
Wissem Maazoun MTH2302: Régression linéaire multiple 2 / 31
MTH2302: Régression linéaire multiple 3 / 31
Introduction
Le modèle général
Les conditions usuelles sont :
1 E (i ) = 0 et V (i ) = σ 2 , i = 1, 2, . . . , n ;
2 les i sont indépendantes (non corrélées) ;
3 i ∼ N(0, σ 2 ).
En utilisant les n observations, on cherche à estimer β0 , β1 , . . . , βk
et σ 2 ; et vérifier si le modèle est valide.
Wissem Maazoun MTH2302: Régression linéaire multiple 3 / 31
MTH2302: Régression linéaire multiple 4 / 31
Introduction
Estimation
En écrivant l’équation (1) pour chaque point, on obtient le
système :
y1 = β0 + β1 x11 + β2 x12 + . . . + βk x1k + 1
y2 = β0 + β1 x21 + β2 x22 + . . . + βk x2k + 2
.. .. ..
. . .
yi = β0 + β1 xi1 + β2 xi2 + . . . + βk xik + i
.. .. ..
. . .
yn = β0 + β1 xn1 + β2 xn2 + . . . + βk xnk + n
Wissem Maazoun MTH2302: Régression linéaire multiple 4 / 31
MTH2302: Régression linéaire multiple 5 / 31
Introduction
Estimation
C’est-à-dire
y = Xβ +
où
y1 1 x11 x12 . . . x1k
y2 1 x21 x22 . . . x2k
y= .. , X = .. .. .. .. ..
. . . . . .
yn 1 xn1 xn2 . . . xnk
β0 1
β1 2
β = . et = . .
.. ..
βk n
Wissem Maazoun MTH2302: Régression linéaire multiple 5 / 31
MTH2302: Régression linéaire multiple 6 / 31
Introduction
Méthode
Comme au chapitre précédent, on cherche à estimer les valeurs des
βi qui minimisent
P
L(β0 , β1 , . . . , βk ) = ni=1 2i
= 0
= (y − Xβ)0 (y − Xβ)
= y0 y − 2β 0 X0 y + β 0 X0 Xβ
Il est démontré que l’estimateur de β (par la méthode des moindres
carrés) est
β̂0
β̂1
β̂ = . = (X 0 X )−1 X 0 y
.
.
β̂k
Wissem Maazoun MTH2302: Régression linéaire multiple 6 / 31
MTH2302: Régression linéaire multiple 7 / 31
Introduction
Méthode
Il est démontré que pour j = 0, 1, 2, . . . , k, β̂j est un estimateur
sans biais de βj :
E (β̂j ) = βj ;
V (β̂j ) = σ 2 Cjj
où Cjj représente le j ème élément de la diagonale de la matrice
(X 0 X )−1 .
Wissem Maazoun MTH2302: Régression linéaire multiple 7 / 31
MTH2302: Régression linéaire multiple 8 / 31
Introduction
Estimation de σ 2
Le meilleur estimateur de σ 2 est
SSE
σ̂ 2 = MSE =
n−k −1
où SSE est la somme des carrés des résidus (erreurs)
n
X n
X
SSE = ei2 = (yi − ŷi )2
i=1 i=1
où ŷi = β̂0 + β̂1 xi1 + . . . + β̂k xik , i = 1, 2, . . . , n.
Wissem Maazoun MTH2302: Régression linéaire multiple 8 / 31
MTH2302: Régression linéaire multiple 9 / 31
Introduction
Estimation de σ 2
L’égalité fondamentale suivante est encore valide
Pn P P
i=1 (yi − ȳ )
2 = ni=1 (yi − ŷi )2 + ni=1 (ŷi − ȳ )2
Syy = SSE +SSR
n−1 = (n − k − 1) +k
On retrouve cette partition dans le tableau d’analyse de la variance.
P
Syy = ni=1 (yi − ȳ )2 = y 0 y − nȳ 2 ;
0
SSE = y 0 y − β̂ X 0 y ;
0
SSR = β̂ X 0 y − nȳ 2 .
La variance de chaque β̂j est estimée par σ̂ 2 × Cjj = MSE × Cjj ,
p
donc s(β̂j ) = MSE × Cjj .
Wissem Maazoun MTH2302: Régression linéaire multiple 9 / 31
MTH2302: Régression linéaire multiple 10 / 31
Intervalles de confiance et intervalles de prévision
Intervalle de confiance pour βj
Il est démontré que si ∼ N(0, σ 2 ), alors pour j = 1, 2, . . . , k
β̂j − βj
∼ Tν , ν = n − k − 1.
s(β̂j )
Pour un niveau de confiance 1 − α donné, l’IC pour
βj , j = 1, 2, . . . , k est
βj ∈ β̂j ± tα/2;n−k−1 × s(β̂j )
Wissem Maazoun MTH2302: Régression linéaire multiple 10 / 31
MTH2302: Régression linéaire multiple 11 / 31
Intervalles de confiance et intervalles de prévision
Région de confiance (intervalles de confiance simultanés) pour βj
Pour g coefficients βj et pour un niveau de confiance 1 − α donné,
l’IC pour βj , j = 1, 2, . . . , k est
βj ∈ β̂j ± tα/(2g );n−k−1 × s(β̂j ), j = 1, . . . , g
constitue une région de confiance (simultanéee) pour les g
coefficients βj
Wissem Maazoun MTH2302: Régression linéaire multiple 11 / 31
MTH2302: Régression linéaire multiple 12 / 31
Intervalles de confiance et intervalles de prévision
Intervalle de confiance pour E (y |x 0 )
Pour une valeur donnée de x 0 = (1, x01 , x02 , . . . , x0k )0 de x, la
moyenne correspondante de y est
E (y |x 0 ) = β0 + β1 x01 + β2 x02 + . . . + βk x0k = x 00 β,
on l’estime ponctuellement par ŷ0 = x 00 β̂.
Pour un niveau de confiance 1 − α donné, l’I.C. pour E (y |x 0 ) est
q
E (y |x 0 ) ∈ ŷ0 ± tα/2;n−k−1 MSE x 00 (X 0 X )−1 x 0 .
Wissem Maazoun MTH2302: Régression linéaire multiple 12 / 31
MTH2302: Régression linéaire multiple 13 / 31
Intervalles de confiance et intervalles de prévision
Intervalle de prévision pour y |x 0
Pour une valeur donnée de x 0 = (1, x01 , x02 , . . . , x0k )0 de x, la
moyenne correspondante de y est
y0 = β0 + β1 x01 + β2 x02 + . . . + β k x0k = x 00 β,
on l’estime ponctuellement par ŷ0 = x 00 β̂.
Pour un niveau de confiance 1 − α donné, l’I.C. pour y |x 0 est
q
y |x 0 ∈ ŷ0 ± tα/2;n−k−1 MSE 1 + x 00 (X 0 X )−1 x 0 .
Wissem Maazoun MTH2302: Régression linéaire multiple 13 / 31
MTH2302: Régression linéaire multiple 14 / 31
Intervalles de confiance et intervalles de prévision
Remarques
1 Pour les deux types d’intervalles (confiance et prévision), il est
important que la valeur de x 0 soit prise à l’intérieur des valeurs
admissibles des variables indépendantes, autrement il s’agit
d’une extrapolation ;
2 Pour calculer un intervalle de confiance pour la moyenne de p
prévisions on utilise
s
1 0 0 −1
ȳ |x 0 ∈ ŷ0 ± tα/2;n−k−1 MSE + x 0 (X X ) x 0 .
p
Wissem Maazoun MTH2302: Régression linéaire multiple 14 / 31
!"#$%&'"($)%*+,-./,%01$1%.23,%141%%%!"#$%.567$)%*+,-./,%01$8%.23,%148%
MTH2302: Régression! linéaire multiple 15 / 31
14.4 LES TESTS
Les tests
On considère deux types de tests : le test global de signification et les tests individuels.
A
Le- test
Le test global
global dedesignification
signification
Pour vérifier si globalement le modèle de régression est significatif, on effectue le test des hy-
Pour vérifier si globalement le modèle de régression est significatif,
pothèses:
on effectue le test des hypothèses
H0 : β1 = β2 = · · · = βk = 0 contre H1 : au moins un des βj �= 0, j = 1, 2, . . . , k
R SS /kR MS
H0 : β1du=test
La statistique β2est
= . .F.0 =
= βk = 0 contre = H1 : ∼au de Fisherun des βj 6= 0
F moins
SS /(n − k − 1)
E MS E
à ν1 = k et ν2 = n − k − 1 degrés de liberté.
SSR /k
La statistique du test est F0 =ouSS
La règle est de rejeter H0 si F0 > Fν1 ,ν2 (α) /(n−k−1)
deE manière
= MSMSEsi ∼
équivalente
R
F suit une loi
p − value = P (F ≥ F0 )
de
est [Link] à ν 1 = k et ν2 = n − k − 1 degrés de liberté.
Laestrègle
Ce test est de présenté
généralement rejeter dans
H0 si F0 > Fd’analyse
le tableau α;ν1 ,ν2 .deCe test estlequel
la variance, généralement
dans ce cas est
de la présenté
forme: dans le tableau d’analyse de la variance de la forme
Nombre de Moyenne
Source de variation Somme des carrés degrés de lib. des carrés F p − value
SSR M SR
Régression (modèle) SSR k M SR = F0 = P (F ≥ F0 )
k M SE
SSE
Résidus(Erreur) SSE n−k−1 M SE =
n−k−1
�
n
Totale Syy = yi2 − n(y) 2
n−1
i=1
(voir tableau 14.4 page 407)
Wissem Maazoun MTH2302: Régression linéaire multiple 15 / 31
MTH2302: Régression linéaire multiple 16 / 31
Les tests
Les tests individuels
On peut tester si un coefficient (βj ) vaut une valeur donnée (βj,0 ).
On effectue alors le test des hypothèses :
H0 : βj = βj,0 contre βj 6= βj,0
β̂j − βj,0
La statistique de ce test est t0 = ∼ T de Student à
s(β̂j )
ν = n − k − 1 degrés de liberté.
Au seuil critique α, on rejette H0 si |t0 | > tα/2;n−k−1 , ou de
manière équivalente si p − value = 2P(T > |t0 |) < α.
Pour tester si la variable xj contribue au modèle d’une façon
significative, on effectue ce test avrec βj,0 = 0.
Wissem Maazoun MTH2302: Régression linéaire multiple 16 / 31
MTH2302: Régression linéaire multiple 17 / 31
Validation du modèle
Le coefficient de corrélation multiple (coefficient de détermination)
Par définition, le coefficient de détermination est
SSR SSE
R2 = =1− .
Syy Syy
R 2 exprime la diminution de la variabilité de y obtenue en utilisant
les variables explicatives x1 , x2 , . . . , xk .
2
On distingue aussi le coefficient de détermination ajusté Rajusté qui
est donné par
2 (n − 1)R 2 − k SSE /(n − k − 1)
Rajusté = =1− .
n−k −1 Syy /(n − 1)
√
Le coefficient de corrélation multiple est donné par R = R 2
Wissem Maazoun MTH2302: Régression linéaire multiple 17 / 31
MTH2302: Régression linéaire multiple 18 / 31
Validation du modèle
L’analyse des résidus
Comme dans le cas de la régression linéaire simple, les résidus
ei = yi − ŷi , i = 1, 2, . . . , n,
doivent être analysés afin de vérifier la validité du modèle étudié.
1 Les résidus doivent suivre la loi normale ;
2 Les résidus doivent varier de façon constante ;
3 Les résidus doivent être aléatoires (non corrélés).
Wissem Maazoun MTH2302: Régression linéaire multiple 18 / 31
MTH2302: Régression linéaire multiple 19 / 31
Ajout d’une ou de plusieurs variables
Définition
Dans un modèle de régression linéaire multiple, l’ajout d’une ou de
plusieurs variables s’accompagne toujours d’une augmentation de
SSR et d’une diminution de SSE .
On peut tester si l’ajout de ces variables dans le modèle est utile si
notre modèle est composé de x1 , . . . , xq et on veut ajouter les
variables xq+1 , . . . , xp . On teste alors les hypothèses :
H0 : βq+1 = . . . = βp = 0 contre H1 : au moins un βj 6= 0
Ce test est classique pour les modèles linéaires. pour cela on
considère deux modèles.
Modèle complet (C) : Y = β0 + β1 X1 + . . . + βp Xp +
Modèle réduit (R) : Y = β0 + β1 X1 + . . . + βq Xq +
Wissem Maazoun MTH2302: Régression linéaire multiple 19 / 31
MTH2302: Régression linéaire multiple 20 / 31
Ajout d’une ou de plusieurs variables
Définition
La statistique du test est :
(SSE (R) − SSE (C )) /(p − q)
F0 =
SSE (C )/(n − p − 1)
(SSR (C ) − SSR (R)) /(p − q)
=
SSE (C )/(n − p − 1)
La règle de décision est de rejeter H0 si F0 > Fα;p−q;n−p−1 .
Wissem Maazoun MTH2302: Régression linéaire multiple 20 / 31
MTH2302: Régression linéaire multiple 21 / 31
Variables indicatrices
Définition
On peut parfois, dans le but de comparer différents groupes, utiliser
un modèle de régression faisant intervenir une ou plusieurs variables
qualitatives en présence d’au moins une variable quantitative. Ces
variables qualitatives pourraient être :
types de roches différents ;
textures différentes ;
mois, saison, année de prélèvement . . . ;
machinerie, procédés utilisés ;
etc.
Le problème consiste à identifier les facteurs qualitatifs pouvant
influencer le modèle.
Wissem Maazoun MTH2302: Régression linéaire multiple 21 / 31
MTH2302: Régression linéaire multiple 22 / 31
Variables indicatrices
Exemple
Soit une régression à deux variables. Supposons que l’on a deux
types de roches différents. On code une variable indicatrice :
I = 0 si la roche est de type 1 ;
I = 1 si la roche est de type 2 ;
Pour vérifier si les deux droites de régression selon le type de roche
sont différentes, on ajuste le modèle :
Y = β0 + β1 X + β2 I + β3 (X × I )
Wissem Maazoun MTH2302: Régression linéaire multiple 22 / 31
MTH2302: Régression linéaire multiple 23 / 31
Variables indicatrices
Exemple
À partir de ce modèle nous pouvons avoir les modèles en
considérons I = 0 pour le modèle 1 et I = 1 pour le modèle 2.
I = 0 : Y = β0 + β1 X ;
I = 1 : Y = β0 + β2 + (β1 + β3 )X ;
Les deux droites ont la même ordonnée à l’origine si
β0 + β2 = β0 c-à-d β2 = 0 ;
Les deux droites ont la même pente si β1 + β3 = β1 c-à-d
β3 = 0.
Wissem Maazoun MTH2302: Régression linéaire multiple 23 / 31
MTH2302: Régression linéaire multiple 24 / 31
Variables indicatrices
Exemple
En ajustant le modèle de régression linéaire
Y = β0 + β1 X + β2 I + β3 (X × I ), on peut tester si le type de
roche a une influence en testant :
H0 : β2 = 0 contre H1 : β2 6= 0, pour l’égalité de l’ordonnée à
l’origine ;
H0 : β3 = 0 contre H1 : β3 6= 0, pour l’égalité des pentes. ;
Wissem Maazoun MTH2302: Régression linéaire multiple 24 / 31
MTH2302: Régression linéaire multiple 25 / 31
Validation du modèle
Analyse des résidus
Comme nous avons vu dans le cadre de la régression simple, les
résidus jouent un rôle important pour la validation du modèle.
L’étude des résidus vise plusieurs objectifs :
Vérifier les hypothèses sur les résidus : normalité, hogénéité
des variances (homoscédasticité) et indépendance des résidus ;
Détection des points abérrants qui s’écartent considérablement
du modèle ;
Détection des tendances particulières.
Wissem Maazoun MTH2302: Régression linéaire multiple 25 / 31
MTH2302: Régression linéaire multiple 26 / 31
Validation du modèle
Détection des données abérrantes
La détection de données aberrantes s’effectue en considérant les
résidus qui s’écartent beaucoup de zéro. Les résidus situés à plus de
trois écarts-types
q (note l’ecart-type des résidus est estimé par
√ SSE
MSE = (n−p−1) , sont suspects et doivent être examinés avec
attention. Si des erreurs sont responsables de ces valeurs élevées, on
doit les éliminer et reprendre la régression. Si aucune cause d’erreur
ne peut les expliquer, alors il faut soit chercher à affiner le modèle
pour mieux expliquer ces données, soit chercher de nouvelles
observations avec les mêmes valeurs de X que ces données pour en
vérifier la validité. L’influence des données peut aussi être utilisée
Wissem Maazoun MTH2302: Régression linéaire multiple 26 / 31
MTH2302: Régression linéaire multiple 27 / 31
Validation du modèle
Détection des données abérrantes
Lorsqu’on effectue une régression, il est important de vérifier si le
modèle obtenu peut être causé par une (ou quelques unes)
observation particulière. On espère habituellement que le modèle
représente une caractéristique générale des données et non
l’influence d’une seule donnée particulière. L’examen des résidus
permet souvent d’identifier de telles données, mais ce n’est pas
toujours le cas. L’idée générale est ici d’enlever de la régression
chacune des observations à tour de rôle et d’examiner comment
fluctuent les coefficients de la régression. Si le fait d’enlever une
valeur change considérablement les coefficients de la régression,
alors le modèle obtenu avec toutes les observations est fortement
influencé par cette observation et il y a lieu de s’interroger sur sa
validité.
Wissem Maazoun MTH2302: Régression linéaire multiple 27 / 31
MTH2302: Régression linéaire multiple 28 / 31
Validation du modèle
Détection des données abérrantes
On peut mesurer l’influence d’une observation à l’aide de la
distance suivante (distance de Cook) :
(b(i) − b)0 (X 0 X )(b(i) − b) (Ŷ(i) − Ŷ )0 (Ŷ(i) − Ŷ )
Di = =
(k + 1)MSE (k + 1)MSE
La notation (i) signifie que la i ème observation est enlevée.
Weisberg (1985) indique que les observations présentant un Di
supérieur à 1 sont très influentes et doivent être examinées avec
attention.
Wissem Maazoun MTH2302: Régression linéaire multiple 28 / 31
MTH2302: Régression linéaire multiple 29 / 31
Validation du modèle
La multicolinéarité
Lorsque les variables X sont très corrélées, il peut arriver que X 0 X
soit quasi-singulière. Plusieurs méthodes existent pour détecter des
conditions de singularité, habituellement basées sur la détermination
des valeurs propres de la matrice X 0 X . La conséquence de
conserver toutes les variables est des estimés très instables des b (la
variance de b devient très grande et des covariances négatives très
grandes entre certains coefficients apparaissent).
Wissem Maazoun MTH2302: Régression linéaire multiple 29 / 31
MTH2302: Régression linéaire multiple 30 / 31
Validation du modèle
La multicolinéarité
Dans un tel cas, on peut régler le problème de diverses façons :
en utilisant des procédures de sélection avant des variables, où
l’on ne rencontre pas ce problème car la variable très corrélée
aux variables déjà dans la régression ne peut normalement être
sélectionnée car l’information qu’elle contient relativement à Y
est déjà prise en compte par les autres variables ;
en retirant une (ou plusieurs) variables X ;
en imposant des contraintes sur les coefficients de la régression
(c’est ce qui est fait dans les programmes spécialisés d’analyse
de variance que l’on rencontre dans l’étude d’expériences
planifiées).
en transformant les X pour qu’ils deviennent orthogonaux
(ACP : analyse en composantes principales) et en ne retenant
qu’un sous-ensemble des « p » nouvelles variables ;
Wissem Maazoun MTH2302: Régression linéaire multiple 30 / 31
MTH2302: Régression linéaire multiple 31 / 31
Validation du modèle
La multicolinéarité
en recourant à une régression biaisée (« ridge regression »).
Ceci est obtenu en ajoutant une perturbation positive sur la
diagonale de la matrice X’X.
Une statistique utilisée pour détecter la multicollinéarité est le
facteur d’inflation de la variance (Variance Inflation Factor en
anglais). On le définit comme 1/(1 − Rj2 ) où Rj2 est le coefficient
de détermination obtenu en effectuant la régression de la variable
Xj sur les autres variables explicatives X . On considère qu’un VIF
supérieur à 10 indique un problème possible de multicollinéarité.
Wissem Maazoun MTH2302: Régression linéaire multiple 31 / 31