Université Mohamed Khider de Biskra
Département Informatique Première Année Master
Module: Analyse de données 2021/2022
Solution des exercices
Solution de l’Exercice 1 (Régression linéaire simple)
1. À partir de la présentation graphique (voir figure 1), on constate que le nuage des points est distribué
sous une forme linéaire, à priori le modèle proposé est adéquat pour l’explication de Y en fonction de
x.
600
550
Ŷ = â + b̂x
500
La biomasse
450
400
350
300
0 100 200 300 400 500 600
La concentration de l’azote (NH+4 )
Figure 1: Présentation graphique du nuage des points (Xi , Yi )
2. On a d’une part :
n
1 P
n xi yi −X Y
i=n
b̂ = n et â = Y − b̂X. (1)
1 P 2 2
n xi −X
i=1
et d’autre part :
n n
1X 1 1X 1
X = xi = 1300 = 260, Y = yi = 2246 = 449.2,
n 5 n 5
i=1 i=1
n
1X 1
Cov(x, y) = xi yi − X Y = (684400) − (260) (449.2) = 20088,
n 5
i=n
n
1X 2 2 1
V ar(x) = xi − X = (570000) − (260)2 = 46400,
n 5
i=1
ainsi,
b̂ = 0.4329, et â = 336.6460,
de ce fait, la droite de régression de la biomasse (Y ) en fonction de la concentration (x) est :
Ŷ = 0.4329 x + 336.6460.
3. On a d’une part,
Cov(x, y)
r = r(x, y) = , (2)
σx σy
1
√
et d’autre part : Cov(x,
s y) = 20088, Écart-type(x) = 46400 = 215.4066 et
n 2
q √
Écart-type(Y ) = n1 yi2 − Y = 15 (1056498) − (449.2)2 = 9518.36 = 97.5621, alors
P
i=1
Cov(x, y)
ρ = ρ(x, y) = = 0.9559 = 95.59%, (3)
σx σy
Le fait que la valeur de ρ ≈ 1, on déduit qu’il y a une forte liaison linéaire entre x et Y .
4. Afin de valider le modèle nous aurons besoin des Ŷi = 0.4329 xi + 336.6460 dont leurs valeurs sont
rangées dans le tableau suivant :
Concentration (µmol) 0 100 200 400 600
Biomasse (mg) 305 378 458 540 565
ŷi (mg) 336.646 379.936 423.226 509.806 596.386
ei = yi − ŷi -31.646 -1.936 34.774 30.194 -31.386
On a d’une part
n n
(ŷ − Y )2 /1 (ŷ − Y )2 /1
P P
i=1 i=1 43477.3591/1
fc = n = n = = 31.7260,
4111.2071/(5 − 2)
(yi − ŷ)2 /(n − 2) e2i /(n − 2)
P P
i=1 i=1
et d’autre par
fα = f (1, n − 2, 1 − α) = f (1, 3, 0.95) = 10.1.
On constate que fc > fα , alors le modèle est valide (pertinent), c’est-à-dire on admet qu’on peut
expliquer la Biomasse de la plante en fonction de la concentration de l’azote par la droite
Ŷ = 0.4329 x + 336.6460.
5. On a : Ŷ = 0.4329 x + 336.6460 alors la Biomasse qu’on peut prévoir à une concentration 500 µmol
est Ŷ = 0.4329 ∗ 500 + 336.6460 = 553.0960mg.
Solution de l’Exercice 2 (Régression linéaire simple)
1. Par définition le coefficient de corrélation linéaire est donné par :
Cov(x, y)
r= .
σx σy
n n
on a : X = n1 xi = 19690 1 P
yi = 20.3
P
10 = 1969, Y = n 10 = 2.03,
s i=1 i=1
n 2
q
σx = n1 x2i − X = 10 1
42925500 − 19692 = 679.5333,
P
i=1
s
n 2
q
σy = n1 yi2 − Y = 10 1
162.4100 − 2.032 = 3.6697,
P
i=1
n
1 P 1
Cov(x, y) = n xi yi − X Y = 10 17671 − 1969 × 2.03 = −2.22997,
i=1
alors le coefficient de corrélation est :
r = −0.9936
2
2. Calculer les estimations des paramètres a, b et σ 2 pour la régression linéaire de Y sur X.
3. Le modèle linéaire de Y sur X est donné par :
Y = aX + b + ,
en utilisant la méthode des moindres carrées les estimateurs de a et b sont définis comme suite :
Cov(x,y)
â = V ar(x) = −0.0054. et b̂ = Y − âX = 12.5953 (4)
c’est-à-dire, la droite de régression est :
Ŷ = −0.0054X + 12.5953.
on a,
n
1 X
σ̂c2 = var() = var(y − â − b̂x) = (yi − â − b̂xi )2 , (5)
n−2
i=1
donc
10
1 X
σ̂c2 = (yi − â − b̂xi )2 = 0.1931.
10 − 2
i=1
6
température (degrés Celsius)
4
Ŷ = âX + b̂
2
−2
−4
−6
1000 1250 1500 1750 2000 2250 2500 2750 3000 3250
Altitude (mètres)
Figure 2: Nuage des points observés et la droite de régression
4. Les températures moyennes correspondantes à aux altitudes 1100 m et 2300 m.
(a) 1100m est : y = −0.0054 ∗ 1100 + 12.5953 = 6.6929.
(b) 2300m est : y = −0.0054 ∗ 2300 + 12.5953 = 0.2539.
Solution de l’Exercice 3 On note X est le poids, Y est le Prix et le modèle de régression est Y = aX + b.
1. A partir des données on a :
variable Moyenne Variance Carrée Moyenne
X 138.1667 1426.4722 20516.50
Y 166.6667 3222.2222 31000
X ∗Y 24643.33
d’où : Cov(X, Y ) = 1615.54, ρ = 0.754, â = 1.133, b̂ = 10.186 et Ŷ = 1.133X + 10.186.
3
2. Si on augmente le poids du Sandwich S6 à 180 g, alors son nouveau prix sera :
Ŷ = 1.133(180) + 10.186 = 214.126DA.
280
260
240
220
200 Ŷ= â x + b̂
Prix (Y)
180
160
140
120
100
80
80 100 120 140 160 180 200
Poids (X)
Figure 3: Nuage de variation du Prix des Sandwichs en fonction de leurs Poids.
3. La table d’analyse de la variance, du modèle, est donnée comme suite :
Source SC ddl MC fc Fisher (fα )
Régression 10978.215 1 10978.215 5.256 .....
Résidu 8355.118 4 2088.780
Total 19333.333 5
Table 1: Table d’ANOVA du modèle
A partir de ces résultats, on constate que pour un risque de 5%, le modèle linéaire n’est pas adéquat
pour la description de la relation entre les variables Poids et Prix. Mais on peut conclure que ce modèle
est adéquat pour un risque de 10%.
Solution de l’Exercice 4 (Régression linéaire simple et transformation des variables)
Pour faire une régression linéaire, on effectue un changement de variable en posant X = ln(D) et
Y = ln(H). Après le calcul des valeurs des variable X et Y on aura les résultats suivants :
X -1.61 -1.20 -0.97 -0.51 -0.42
Y 2.22 2.27 2.38 2.60 2.65
Ŷ 2.1690 2.3255 2.4133 2.5889 2.6232
0.0510 -0.0555 -0.0333 0.0111 0.0268
1. Le calcul du coefficient de corrélation linéaire entre X et Y nécessite les quantités suivantes : X =
n n
1 P 1 P
n x i = −0.9420, Y = n yi = 2.4240,
i=1 s i=1
n 2 √
σx = n1 x2i − X = 0.1945 = 0.4410,
P
i=1
s
n 2 √
σy = n1 yi2 − Y = 0.0299 = 0.1728,
P
i=1
n
1 P
Cov(x, y) = n xi yi − X Y = 0.0742,
i=1
ainsi on aura le coefficient de corrélation :
r = 0.9737.
2. On a,
Cov(x, y)
â = = 0.3817etb̂ = Y − âX = 2.7836.
V ar(x)
4
alors,
Y = 0.38172X + 2.78358, (6)
3. Le test de validation du modèle se base sur la statistique :
n
(ŷ − Y )2 /1
P
i=1
F = n f(1,n−2) ,
ŷ)2 /(n
P
(yi − − 2)
i=1
or on a,
n
X
(ŷ − Y )2 /1 = 0.1417
i=1
et
n
X
(yi − ŷ)2 /(n − 2) = 0.0025
i=1
alors la réalisation, f , de la statistique F est égale à : 55.7266.
A partir de la table de Fisher pour un seuil de risque α = 5%, on obtient f(1,n−2,1−α) = f(1,3,0.95) = 10.1,
on constate que la valeurs de la réalisation de la statistique F est supérieur à la valeurs tabulée de
fisher, cela signifier que le modèle est valide c’est-à-dire le modèle linéaire définie dans (6) est adéquat
pour l’explication de la variable Y en fonction de la variable X.
4. Donner la hauteur prévue d’un arbre de diamètre 0.7. on a,
Ŷ = 0.38172X + 2.78358 ⇒ ln(Ĥ) = 0.38172 ln(D) + 2.78358 ⇒ Ĥ = e0.38172 ln(D)+2.78358 .
Alors, pour un diamètre D=0.7, on prévoit une hauteur H = e0.38172 ln(0.7)+2.78358 = 14.1177.
Solution de l’Exercice 5 (Régression linéaire simple et changement des variables)
Somme
X µg/µl 0 20 40 60 80 100 300
Y 0 0.205 0.331 0.515 0.584 0.671 2.3060
X2 0 400 1600 3600 6400 10000 22000
Y2 0 0.0420 0.1096 0.2652 0.3411 0.4502 1.2081
X ∗Y 0 4.10 13.24 30.90 46.72 67.10 162.06
a) Afin de modéliser ces données, nous avons proposé le modèle linéaire suivant :
Y = a1 x + b1 .
1. Calcul des estimateurs des paramètres a1 et b1 . On a :
n
1X 1
X = xi = 300 = 50.
n 6
i=1
n
1X 1
Y = xi = 3002.3060 = 0.3843.
n 6
i=1
n
1X 1
Cov(x, y) = xi yi − X Y = (162.06) − (50) (0.3843) = 7.7950
n 6
i=n
n
1X 2 2 1
V ar(x) = xi − X = (22000) − (50)2 = 1166.6667
n 6
i=1
5
alors,
n
1 P
n x i yi −X Y
Cov(x, y) i=n
â1 = = n = 0.0067.
V ar(x) 1 P 2 2
n xi −X
i=1
b̂1 = Y − â1 X = 0.0503,
de ce fait la droite de régression de l’absorbance (Y ) en fonction de la concentration (x) est donnée
par :
Ŷ = 0.0067 x + 0.0503.
2. Quelle absorbance prévoyez-vous à une concentration 50 µg/µl?
Ŷ = 0.0067 (50) + 0.0503 = 0.3853.
3. Quelle absorbance prévoyez-vous à une concentration 40 µg/µl? Que peut-on conclure?
Ŷ = 0.0067 (40) + 0.0503 = 0.3183.
On constate que la valeur de régression est très proche de la vraie valeur (0.331), donc à priori le
modèle retenu est adéquate pour la représentation des données du tableau.
4. Calcul du coefficient de corrélation linéaire.
Cov(x, y)
r = r(x, y) = = 0.9851,
σx σy
s
p 1
n √
yi2 − Y =
P
avec σy = var(Y ) = n 0.0536 = 0.2316; La valeur du coefficient de corrélation est
i=1
très proche de 1, i.e. X et Y sont fortement linéairement liés donc le modèle est efficace ce qui confirme
les résultats de la question 3).
5. Pour un seuil de risque α = 5%, le modèle proposé est-il pertinent?
Pour répondre à cette question on utilise le test de validation du modèle (Fisher). On d’une part
n
(ŷ − Y )2 /1
P
i=1 0.3124/1
fc = n = = 131.5368,
0.0095/(6 − 2)
(yi − ŷ)2 /(n − 2)
P
i=1
et d’autre par
fα = f (1, n − 2, 1 − α) = f (1, 4, 0.95) = 7.71.
On constate que fc > fα , alors on accepte le modèle proposé, c’est-à-dire le modèle est valide (pertinent)
b) Vue les doutes qu’on a sur le modèle précèdent, nous avons proposé le modèle suivant :
Z = eY = a2 x + b2 .
1. Complétez le tableau suivant :
Somme
X µg/µl 0 20 40 60 80 100 300
Z 1.0000 1.2275 1.3924 1.6736 1.7932 1.9562 9.0429
Z2 1.0000 1.5068 1.9387 2.8011 3.2156 3.8267 14.2888
X ∗Z 0 24.5505 55.6944 100.4183 143.4558 195.6193 519.7382
6
2. Calculer les estimations des paramètres a2 et b2 pour la régression linéaire de Z sur X.
X = 50.
n
1X 1
Z = zi = (9.0429) = 1.5072.
n 6
i=1
n
1X 1
Cov(x, z) = xi zi − X Z = (162.06) − (50) (0.3843) = 7.7950
n 6
i=n
V ar(x) = 1166.6667
alors,
Cov(x, z)
â2 = = 0.0097.
V ar(x)
b̂2 = Z − â2 X = 1.0243,
de ce fait la droite de régression de (Z) en fonction de (x) est donnée par :
Ẑ = 0.0097 x + 1.0243.
3. Quelle absorbance prévoyez-vous à une concentration 40 µg/µl. Que peut-on conclure par rapport au
premier modèle?
On Z = 0.0097 (40) + 1.0243 = 1.4123 donc l’absorbance y = log(z) = log(1.4123) = 0.3452.
On constate que se modèle nous fournit une valeur proche à la vraie valeur mais c’est le premier modèle
qui nous fournis une valeur plus proche d se fait il se peut que c’est le premier modèle qui est meilleur.
4. Calculer le coefficient de corrélation linéaire de ce nouveau modèle.
Cov(x, z)
r = r(x, y) = = 0.9946,
σx σz
5. On constate que le coefficient de corrélation est plus grand pour le deuxième modèle donc le meilleur
modèle est le deuxième.