0% ont trouvé ce document utile (0 vote)
10 vues29 pages

Inférence Statistique avec R : Tests et ANOVA

Statistique documents

Transféré par

exaucel245
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
10 vues29 pages

Inférence Statistique avec R : Tests et ANOVA

Statistique documents

Transféré par

exaucel245
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Inférence statistique en Langage R

Complément du cours d’inférence statistique

Basile LUSE Belanganayi


1

I. GENERALITES

Boxplot brut
> PoidsA=c(7,8,6,9,4,7,9,11)
> PoidsB=c(9,16,21,11,18,17,15,19)
> PoidsC=c(15,10,17,6,12,14,16,11)
> boxplot(PoidsA,PoidsB,PoidsC)

Boxplot couleur uniforme et noms des axes


> PoidsA=c(7,8,6,9,4,7,9,11)
> PoidsB=c(9,16,21,11,18,17,15,19)
> PoidsC=c(15,10,17,6,12,14,16,11)
> table=[Link](cbind(PoidsA,PoidsB,PoidsC))
> table
PoidsA PoidsB PoidsC
1 7 9 15
2 8 16 10
3 6 21 17
4 9 11 6
5 4 18 12
6 7 17 14
7 9 15 16
8 11 19 11
> boxplot(table,xlab="Catégorie",ylab="Poids",col="yellow")
2

Boxplot colorié différemment


> PoidsA=c(7,8,6,9,4,7,9,11)
> PoidsB=c(9,16,21,11,18,17,15,19)
> PoidsC=c(15,10,17,6,12,14,16,11)
> boxplot(PoidsA,PoidsB,PoidsC)
> table=[Link](cbind(PoidsA,PoidsB,PoidsC))
> table
PoidsA PoidsB PoidsC
1 7 9 15
2 8 16 10
3 6 21 17
4 9 11 6
5 4 18 12
6 7 17 14
7 9 15 16
8 11 19 11
> boxplot(table,xlab="Catégorie",ylab="Poids",col=3:1)
3

Pour éviter la couleur noire utilisons le script suivant:


> boxplot(table,xlab="Catégorie",ylab="Poids",col=4:1)
4

II. TEST D’HYPOTHESES

II.1. TEST t DE STUDENT

II.1.1. Test de Student à données non appariés :

Il s’effectue lorsqu’on comparer deux moyennes provenant de deux groupes différents.

L’hypothèse nulle H0 est du genre : « les deux moyennes sont significativement les mêmes»
ce qui se traduit par l’égalité :

D’où :

Après test :

Si ( ) acceptation de H0 : il n’y a pas de différence


significative entre les deux moyennes.

Si par contre rejet de H0 : les deux moyennes diffèrent


significativement.

Exemple : Deux groupes de participants (A et B) ont pris part à une reconnaissance de mots.
La moyenne du groupe A est de 11 mots reconnus alors que celle du groupe B s’élève à 14
mots. La question est la suivante: la moyenne du groupe B est-elle significativement plus
élevée que celle du groupe A?

Groupe A Groupe B
10 14
11 12
12 13
12 13
10 15
11 15
11 14
9 14
13 14
16

Données :

La moyenne du groupe B n’est pas significativement plus élevée que celle du groupe A.
5

La moyenne du groupe B est significativement plus élevée que celle du groupe A.

Il s’agit d’un test unilatéral.

Résolution dans R :
> mots=c(10,11,12,12,10,11,11,9,13,14,12,13,13,15,15,14,14,14,16)
>groupes=c("A","A","A","A","A","A","A","A","A","B","B","B","B","B","B","B",
"B","B","B")
> test=[Link](mots~groupes,paired=FALSE)
> test

Welch Two Sample t-test

data: mots by groupes


t = -5.4772, df = 16.521, p-value = 4.523e-05
alternative hypothesis: true difference in means is not equal to 0
95 percent confidence interval:
-4.15815 -1.84185
sample estimates:
mean in group A mean in group B
11 14
Conclusion : p-value= 4.523e-05 < 0.05, on rejette H0 et accepte H1: La moyenne du groupe
B est significativement plus élevée que celle du groupe A

II.1.2. Test de Student à donnés appariées

Le test que nous allons décrire dans cette section est utilisé lorsque nous voulons comparer
deux moyennes issues d’un même groupe.

Exemple : Dix étudiants ont passé un test X dans une matière donnée. Ils ont ensuite
retravaillé la matière et ont subi un deuxième test Y. Les moyennes des deux tests

(̅ = 12.2, ̅ = 13.2) sont-elles significativement différentes?

Etudiants Examen 1 Examen 2


1 13 15
2 14 15
3 12 14
4 10 12
5 15 14
6 18 19
7 9 9
8 7 8
9 10 11
10 14 15

Données :

Les deux moyennes ne sont pas significativement différentes.


6

Les deux moyennes sont significativement différentes.

Il s’agit d’un test bilatéral.

Résolution dans R :
> cotes=c(13,14,12,10,15,18,9,7,10,14,15,15,14,12,14,19,9,8,11,15)
> examen=c(1,1,1,1,1,1,1,1,1,1,2,2,2,2,2,2,2,2,2,2)
> test=[Link](cotes~examen,paired=TRUE)
> test

Paired t-test

data: cotes by examen


t = -3.3541, df = 9, p-value = 0.008468
alternative hypothesis: true difference in means is not equal to 0
95 percent confidence interval:
-1.674445 -0.325555
sample estimates:
mean of the differences
-1
Conclusion : p-value = 0.008468 < 0.05, on rejette H0 (à 95%) : les deux moyennes sont
significativement différentes.

II.2. ANALYSE DE VARIANCE (ANOVA)

II.2.1. ANOVA I

II.2.1.1. Description

Dans ANOVA I on a une variable quantitative (expliquée) et une variable qualitative


explicative de la première, appelée facteur.

Lorsque nous avons affaire à trois moyennes ou plus, nous ne pouvons pas faire appel au test
t. Il nous faut utiliser l’analyse de variance, également appelée ANOVA (terme basé sur
l’anglais, « Analysis of variance »).

L’application de l’ANOVA I comme test est sujette au respect d’un nombre de conditions qui
sont:
 échantillon aléatoire;
 observations indépendantes;
 variable réponse quantitative;
 une variable explicative qualitative à 3 niveaux ou plus;
 distribution normale des résidus (residuals, en anglais. Par résidu, on entend la
différence ̅ );

 homoscédasticité (même variance intragroupes).


7

Normalité des résidus :


Parmi les méthodes utilisées pour vérifier la normalité des résidus, on peut mentionner:

1. L’observation du graphe quantile–quantile (QQ plot en anglais) servant à comparer


une distribution théorique à une distribution observée. Si les points s’alignent le long
d’une droite, les quantiles respectifs correspondent, ce qui indique que la distribution
observée se conforme à la distribution théorique ;
2. le test de Shapiro qui est basé sur une hypothèse nulle selon laquelle les résidus
suivent une loi normale.

Homoscédasticité :

La vérification de l’homoscédasticité se fait en utilisant un certain nombre de tests


statistiques, notamment le test de Bartlett, le test de Levene, etc. Ces tests sont basés sur une
hypothèse nulle qui stipule que les variances intragroupes sont identiques et sur une
hypothèse alternative qui stipule que la variance d’au-moins une des variables est différente
de celles des autres (hétéroscédasticité).

II.2.1.2. Demarche sur R

Afin de découvrir l’approche de l’ANOVA dans le langage R, prenons tout de suite un


exemple.

Des médecins désirent déterminer l’importance de la localisation d’une lésion cérébrale


(gauche ou droite) sur un test verbal. Ils prennent deux groupes de patients, les uns avec une
lésion droite et les autres avec une lésion gauche ainsi qu’un groupe de contrôles (des
personnes sans lésion). On soumet aux participants une liste de mots et on les prie d’en
rappeler le plus possible en une minute. On compte ensuite le nombre de mots signalés. Les
groupes se comportent-ils de façon différente? En termes plus précis, existe-t-il un effet de
groupe?

Résolution :

H0 : μ1 = μ2 = μ3 : pas d’effet des types de groupe sur la capacité à remémorer les mots.
8

H1 : pas (μ1 = μ2 = μ3) : effet de type de groupe sur la capacité de remémorer et signaler des
mots).
1. Encodage des données et test ANOVA
>Mots=c(34,28,25,31,27,17,19,18,21,27,19,17,24,23,33,27,25,35,20,23,27,26,2
8,26)
>Groupes=[Link](c("D","D","D","D","D","D","G","G","G","G","G","G","G","G
","C","C","C","C","C","C","C","C","C","C"))
> Test=aov(Mots~Groupes)
> Test
Call:
aov(formula = Mots ~ Groupes)

Terms:
Groupes Residuals
Sum of Squares 192 424
Deg. of Freedom 2 21

Residual standard error: 4.493381


Estimated effects may be unbalanced
> summary(Test)
Df Sum Sq Mean Sq F value Pr(>F)
Groupes 2 192 96.00 4.7547 0.0198 *
Residuals 21 424 20.19
---
Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

2. Test post ANOVA :


 Test de vérification multiple : Test de Tukey
Ce test nous permet de réaliser une comparaison multiple afin de voir comment « les
facteurs » se comporte deux à deux.
> TukeyHSD(Test)
Tukey multiple comparisons of means
95% family-wise confidence level

Fit: aov(formula = Mots ~ Groupes)

$Groupes
diff lwr upr p adj
D-C 0 -5.848661 5.8486610 1.0000000
G-C -6 -11.372338 -0.6276618 0.0268841
G-D -6 -12.116676 0.1166761 0.0551619

 Vérification de la normalité des distributions

Elle se faire de deux façons différentes :

 Sur base de résidus :


 Observation du graphique Quantile-Quantile.
Ici on représente graphique quantile théorique-quantile observée soit par un
nuage de point ; script :
> qqnorm(residuals(Test))
9

Soit par une droite de régression :


> qqline(residuals(Test))

 Sur base du test de Shapiro :

Ce test a pour hypothèse nulle H0 = « il y a normalité de résidus », traduite


par l’égalité des moyennes des modalités du facteur:

H0 est accepté lors que p-value > seuil α (=0,05).


> [Link](residuals(Test))

Shapiro-Wilk normality test

data: residuals(Test)
W = 0.9684, p-value = 0.627

Comme p-value (=0,627) > seuil(=0,05),on accepte H0.

 Vérification de l’homoscedasticité des variances : Test de Bartlett


10

A travers ce test on cherche à vérifier l’égalité entre les variances des modalités du
facteur. Ainsi son hypothèse nulle H0 = « les variances sont les mêmes », ce qui traduit
l’existence de l’homoscedasticité (égalité des variances).
Dans le cas où H0 est rejetée (c’est-à-dire que H1 est acceptée) on parle de l’existence
de l’hétéroscedasticité (différence d’au-moins deux variances).
> [Link](Mots~Groupes)

Bartlett test of homogeneity of variances

data: Mots by Groupes


Bartlett's K-squared = 1.5917, df = 2, p-value = 0.4512

Conclusion : p-value (0.4512) > seuil(0.05), H0 est accepté (la variance entre les
groupes est la même).

Exercice 2 : Trois groupes de souris sont nourris avec trois types d’aliment différents. Les
poids de ces souris sont donnés dans le tableau ci-dessous. Existe-t-il un effet des types
d’aliment sur le gain de poids par ces souris ?

Souris Aliment A Aliment B Aliment C


1 7 9 15
2 8 16 10
3 6 21 17
4 9 11 6
5 4 18 12
6 7 17 14
7 9 15 16
8 11 19 11

Résolution :
H0 : μA = μB = μC : pas d’effet des types d’aliment sur le gain de poids.
H1 : pas (μA = μB = μC) : effet des types d’aliment sur le gain de poids.

Encodage des données


>Poids=c(7,8,6,9,4,7,9,11,9,16,21,11,18,17,15,19,15,10,17,6,12,14,16,11)
>Aliments=[Link](c("A","A","A","A","A","A","A","A","B","B","B","B","B","
B","B","B","C","C","C","C","C","C","C","C"))
> Test=aov(Poids~Aliments)
> Test
Call:
aov(formula = Poids ~ Aliments)

Terms:
Aliments Residuals
Sum of Squares 268.75 237.25
Deg. of Freedom 2 21
11

Residual standard error: 3.361193


Estimated effects may be unbalanced
> summary(Test)
Df Sum Sq Mean Sq F value Pr(>F)
Aliments 2 268.75 134.375 11.894 0.0003516 ***
Residuals 21 237.25 11.298
---
Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

Pr (=0,0003516) < seuil (=0,001), rejet de H0:Il y a un effet des types d’aliment sur le gain de
poids.

Vérification multiple : Test de Tukey

> TukeyHSD(Test)
Tukey multiple comparisons of means
95% family-wise confidence level

Fit: aov(formula = Poids ~ Aliments)

$Aliments
diff lwr upr p adj
B-A 8.125 3.8889383 12.361062 0.0002516
C-A 5.000 0.7639383 9.236062 0.0189643
C-B -3.125 -7.3610617 1.111062 0.1753074

Vérifications de la normalité des distributions


> qqnorm(residuals(Test))

> qqline(residuals(Test))
12

Vérification de la normalité des résidus par le test de Shapiro:

H0 : les résidus sont distribués normalement.

> [Link](residuals(Test))

Shapiro-Wilk normality test

data: residuals(Test)
W = 0.9569, p-value = 0.38

p-value (=0,38) > seuil (=0,05), acceptation de H0 :

Vérification de l’homoscedasticité : Test de Bartlett

H0 : tous les groupes ont la même variance.


> [Link](Poids~Aliments)

Bartlett test of homogeneity of variances

data: Poids by Aliments


Bartlett's K-squared = 2.6161, df = 2, p-value = 0.2704

Comme p-value(0,2704)> seuil (=0,05), H0 est accepté, la variance est la même entre les
différents groupes.

Exemple 2 : une enquête universitaire se penche sur la connaissance en anglais afin de


connaître la performance en cette langue des étudiants de l’UNIKIS. Les résultats sont donnés
dans le tableau ci-dessous :
13

G1 G2 G3 L1 L2
12.4 12.4 13 15.5 15
13.5 14 15 13 17.8
11.5 15.6 13.7 15.9 19
7 17.4 14.7 16 17.9
8.4 13.3 14 17 14.7
9 16.7 15 18.9 15.8
10.4 17 14.8 17.3 16
15 17.8 17.8 12.5 15.6
13.5 13.2 14.8 15.9 14.9
14 12 15 17.7 15
12.5 15 16 14 16
12 14.5 16.3 16 18
11.5 9.6 12 17 16.3
10 11 13 15.7 15

a) Existe-t-il une différence significative dans la réussite des étudiants de ces promotions
enquêtées ?
b) Réalisez un test de comparaison multiple afin de voir comment les promotions se
comportent deux à deux.
c) Testez la normalité des résidus pour cette analyse, sur base d’un graphique quantile-
quantile mais aussi en utilisant un test de Shapiro.
d) Vérifiez si l’hypothèse que ces distributions se caractérisent par une homogénéité des
variances (homoscedasticité).
e) Représentez ces différents résultats sur des boxplots diversement colorés, en donnant
un nom à l’axe des abscisses (appelé « Promotions » et à l’axe des ordonnées (appelé
« Cotes obtenues »).

Résolution :

H0, il n'y a pas de différence significative dans la réussite des étudiants par promotion.

>Cotes=c(12.4,13.5,11.5,7,8.4,9,10.4,15,13.5,14,12.5,12,11.5,10,12.4,14,15.
6,17.4,13.3,16.7,17,17.8,13.2,12,15,14.5,9.6,11,13,15,13.7,14.7,14,15,14.8,
17.8,14.8,15,16,16.3,12,13,15.4,13,15.9,16,17,18.9,17.3,12.5,15.9,17.7,14,1
6,17,15.7,15,17.8,19,17.9,14.7,15.8,16,15.6,14.9,15,16,18,16.3,15)

>Promotions=c("G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","G1","
G1","G1","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","G2","
G2","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","G3","
L1","L1","L1","L1","L1","L1","L1","L1","L1","L1","L1","L1","L1","L1","L2","
L2","L2","L2","L2","L2","L2","L2","L2","L2","L2","L2","L2","L2")

> G1=c(12.4,13.5,11.5,7,8.4,9,10.4,15,13.5,14,12.5,12,11.5,10)
> G2=c(12.4,14,15.6,17.4,13.3,16.7,17,17.8,13.2,12,15,14.5,9.6,11)
> G3=c(13,15,13.7,14.7,14,15,14.8,17.8,14.8,15,16,16.3,12,13)
> L1=c(15.4,13,15.9,16,17,18.9,17.3,12.5,15.9,17.7,14,16,17,15.7)
> L2=c(15,17.8,19,17.9,14.7,15.8,16,15.6,14.9,15,16,18,16.3,15)
14

a) Test ANOVA :

> Test=aov(Cotes~Promotions)
> Test
Call:
aov(formula = Cotes ~ Promotions)

Terms:
Promotions Residuals
Sum of Squares 196.7434 243.9743
Deg. of Freedom 4 65

Residual standard error: 1.937382


Estimated effects may be unbalanced

> summary(Test)
Df Sum Sq Mean Sq F value Pr (>F)
Promotions 4 196.74 49.186 13.104 6.983e-08 ***
Residuals 65 243.97 3.753
---
Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

Pr < seuil, rejet de H0, il y a différence significative dans la réussite des étudiants par
promotion.

b) Vérification multiple : Test de Tukey

> TukeyHSD(Test)
Tukey multiple comparisons of means
95% family-wise confidence level

Fit: aov(formula = Cotes ~ Promotions)

$Promotions
diff lwr upr p adj
G2-G1 2.7714286 0.71683100 4.826026 0.0030198
G3-G1 3.1714286 1.11683100 5.226026 0.0004903
L1-G1 4.4000000 2.34540243 6.454598 0.0000009
L2-G1 4.7357143 2.68111671 6.790312 0.0000001
G3-G2 0.4000000 -1.65459757 2.454598 0.9820269
L1-G2 1.6285714 -0.42602614 3.683169 0.1839579
L2-G2 1.9642857 -0.09031186 4.018883 0.0676418
L1-G3 1.2285714 -0.82602614 3.283169 0.4546331
L2-G3 1.5642857 -0.49031186 3.618883 0.2175404
L2-L1 0.3357143 -1.71888329 2.390312 0.9906935

c) Véfication de la normalité :

> qqnorm(residuals(Test))
15

> qqline(residuals(Test))

Test de Shapiro :
H0 = il y a normalité de résidus.

> [Link](residuals(Test))

Shapiro-Wilk normality test

data: residuals(Test)
W = 0.9845, p-value = 0.5433

p-value > seuil, acceptation de H0, il y a normalité des résidus.


16

d) Vérification de l’homogénéité des variances (homoscedasticité) : Test de Bartlett :

H0 : toutes les variances sont égales.

> [Link](Cotes~Promotions)

Bartlett test of homogeneity of variances

data: Cotes by Promotions


Bartlett's K-squared = 6.6454, df = 4, p-value = 0.1559

Comme p-value > seuil, acceptation de H0:les variances sont égales.

e) boxplot.

> Mytable=[Link](cbind(G1,G2,G3,L1,L2))
> Mytable
G1 G2 G3 L1 L2
1 12.4 12.4 13.0 15.4 15.0
2 13.5 14.0 15.0 13.0 17.8
3 11.5 15.6 13.7 15.9 19.0
4 7.0 17.4 14.7 16.0 17.9
5 8.4 13.3 14.0 17.0 14.7
6 9.0 16.7 15.0 18.9 15.8
7 10.4 17.0 14.8 17.3 16.0
8 15.0 17.8 17.8 12.5 15.6
9 13.5 13.2 14.8 15.9 14.9
10 14.0 12.0 15.0 17.7 15.0
11 12.5 15.0 16.0 14.0 16.0
12 12.0 14.5 16.3 16.0 18.0
13 11.5 9.6 12.0 17.0 16.3
14 10.0 11.0 13.0 15.7 15.0

> boxplot(Mytable,xlab="Promotions",ylab="Cotes obtenues",col=6:1)


17

II.2.1. ANOVA II :

Dans ANOVA II, on dispose d’une variable quantitative à expliquer et de deux facteurs
(variables qualitatives explicatives).

Résolution sur R :

Exemple : Evaluer l’effet de la variété et du type de ferme sur le rendement de la production


de maïs donné dans le tableau ci-dessous.

Variété A Variété B Variété C Variété D


Ferme X 0.327 0.500 0.442 0.471
Ferme Y 0.532 0.599 0.516 0.638
Ferme Z 0.269 0.308 0.241 0.305

Résolution :

Variable quantitative : Rendement de la production du maïs.

Facteurs : variété, ferme

H0 : Il n’y a pas d’effet de la variété et de la ferme sur le rendement de la production du maïs.

Encodage des données :


>Rendement=c(0.327,0.532,0.269,0.500,0.599,0.308,0.442,0.516,0.241,0.471,0.
638,0.305)
18

> Variété=c("A","A","A","B","B","B","C","C","C","D","D","D")
> Ferme=c("X","Y","Z","X","Y","Z","X","Y","Z","X","Y","Z")

Mise ensemble des données sous le nom "Data"

> Data=[Link](cbind(Rendement,Variété,Ferme))
> Data
Rendement Variété Ferme
1 0.327 A X
2 0.532 A Y
3 0.269 A Z
4 0.5 B X
5 0.599 B Y
6 0.308 B Z
7 0.442 C X
8 0.516 C Y
9 0.241 C Z
10 0.471 D X
11 0.638 D Y
12 0.305 D Z

Précision de la variable quantitative


> Data$Rendement=Rendement

Execution d'ANOVA
> Test=aov(Rendement~Variété+Ferme,Data)
> Test
Call:
aov(formula = Rendement ~ Variété + Ferme, data = Data)

Terms:
Variété Ferme Residuals
Sum of Squares 0.02118467 0.16899650 0.00891683
Deg. of Freedom 3 2 6

Residual standard error: 0.03855047


Estimated effects may be unbalanced

> summary(Test)
Df Sum Sq Mean Sq F value Pr(>F)
Variété 3 0.021185 0.007062 4.7516 0.0501154 .
Ferme 2 0.168997 0.084498 56.8576 0.0001259 ***
Residuals 6 0.008917 0.001486
---
Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1
Conclusion :

Pour la variété : pr = 0.0501154 ≃0,05, acceptation de H0 : la variété n’a aucun effet sur le
rendement.
19

Pour la ferme : pr = 0,0001259 < 0,05 (seuil), rejet de H0 : le type de ferme a un effet sur le
rendement.

Comparaison multiple: Test de Tukey

> TukeyHSD(Test)
Tukey multiple comparisons of means
95% family-wise confidence level

Fit: aov(formula = Rendement ~ Variété + Ferme, data = Data)

$Variété
diff lwr upr p adj
B-A 0.093000000 -0.01596196 0.20196196 0.0908366
C-A 0.023666667 -0.08529530 0.13262863 0.8728537
D-A 0.095333333 -0.01362863 0.20429530 0.0831372
C-B -0.069333333 -0.17829530 0.03962863 0.2245411
D-B 0.002333333 -0.10662863 0.11129530 0.9998367
D-C 0.071666667 -0.03729530 0.18062863 0.2055376

$Ferme
diff lwr upr p adj
Y-X 0.13625 0.05261099 0.21988901 0.0058868
Z-X -0.15425 -0.23788901 -0.07061099 0.0031607
Z-Y -0.29050 -0.37413901 -0.20686099 0.0000993

II.3. CORRELATION ET REGRESSION

Un coefficient de corrélation est une valeur numérique qui reflète le sens et la force de la
relation entre deux variables. Ce coefficient s’étend de +1 (corrélation positive maximale) à -1
(corrélation négative maximale):
- Une valeur élevée et positive (ex. 0,7 ou 0,8) signale que les deux variables sont corrélées de
manière forte et positive.
- Une valeur plus basse mais toujours positive (ex. 0,3 ou 0,4) signale une corrélation faible et
positive.
- Une valeur autour de zéro signifie l’absence d’une corrélation.
- Une valeur négative signale que la corrélation est négative : si la valeur est peu importante
(ex. -0,3 ou -0,4), cela traduit une faible corrélation ; si la valeur est élevée (ex. -0,7 ou -0,8),
elle est forte.

Lorsqu’on veut tester si un coefficient de corrélation est significatif, on pose en fait


l’hypothèse nulle que le coefficient est zéro, ce qui traduit une absence de corrélation entre les
deux variables étudiées.
H0 : Pas de corrélation, vraie si r = 0 et pr < seuil

Exemple 1: Corrélation et Régression simple


20

Dans le tableau ci-dessous, nous reprenons les valeurs de poids et de la taille de 12 personnes
afin d’étudier la corrélation entre les deux variables.

Personne Taille (cm) Poids (kg)


1 167 61
2 167 60
3 171 64
4 173 60
5 165 52
6 168 56
7 172 64
8 165 57
9 167 58
10 168 53
11 161 53
12 170 58

Résolution dans R :

Graphique Taille-Poids
> Taille=c(167,167,171,173,165,168,172,165,167,168,161,170)
> Poids=c(61,60,64,60,52,56,64,57,58,53,53,58)
> cor(Taille,Poids,method="pearson")
[1] 0.6903584
> [Link](Taille,Poids)

Pearson's product-moment correlation

data: Taille and Poids


t = 3.0176, df = 10, p-value = 0.01295
alternative hypothesis: true correlation is not equal to 0
95 percent confidence interval:
0.1928725 0.9055021
sample estimates:
cor

0.6903584

p-value étant < 0,05 (le seuil), acceptation de H0, il y a corrélation entre Taille et Poids.
Et comme r = 0.6903584, cette corrélation est forte.

Equation de Régression:
> Tableau=[Link](cbind(Taille,Poids))
> Tableau
Taille Poids
1 167 61
2 167 60
3 171 64
4 173 60
5 165 52
6 168 56
7 172 64
8 165 57
9 167 58
10 168 53
11 161 53
12 170 58
21

> Régression=lm(Poids~Taille,Tableau)
> Régression

Call:
lm(formula = Poids ~ Taille, data = Tableau)

Coefficients:
(Intercept) Taille
-81.7857 0.8329

> plot(Tableau,col= « red »)

Droite de régression
> abline(Régression)
22

> summary(Régression)

Call:
lm(formula = Poids ~ Taille, data = Tableau)

Residuals:
Min 1Q Median 3Q Max
-5.1388 -2.1799 0.6927 2.5708 3.6941

Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) -81.7857 46.3326 -1.765 0.1080
Taille 0.8329 0.2760 3.018 0.0129 *
---
Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

Residual standard error: 3.069 on 10 degrees of freedom


Multiple R-squared: 0.4766, Adjusted R-squared: 0.4243
F-statistic: 9.106 on 1 and 10 DF, p-value: 0.01295

Exemple 2 : Corrélation et régression multiple


Personne Taille (cm) Poids (kg) Age Durée de sommeil
1 167 61 18,5 10
2 167 60 19 9,8
3 171 64 21,6 6,7
4 173 60 18,4 6
5 165 52 17,8 8
6 168 56 22,9 8,2
7 172 64 21 7
8 165 57 19,2 6,8
9 167 58 20 9
10 168 53 20,1 5
11 161 53 21,4 5,7
12 170 58 23,7 5,1

> Taille=c(167,167,171,173,165,168,172,165,167,168,161,170)
> Poids=c(61,60,64,60,52,56,64,57,58,53,53,58)
> Age=c(18.5,19,21.6,18.4,17.8,22.9,21,19.2,20,20.1,21.4,23.7)
> DuréeSommeil=c(10,9.8,6.7,6,8,8.2,7,6.8,9,5,5.7,5.1)

> Tableau1=[Link](cbind(Taille,Poids,Age,DuréeSommeil))
> Tableau1
Taille Poids Age DuréeSommeil
1 167 61 18.5 10.0
2 167 60 19.0 9.8
3 171 64 21.6 6.7
4 173 60 18.4 6.0
5 165 52 17.8 8.0
6 168 56 22.9 8.2
7 172 64 21.0 7.0
8 165 57 19.2 6.8
9 167 58 20.0 9.0
10 168 53 20.1 5.0
11 161 53 21.4 5.7
12 170 58 23.7 5.1
> Reg=lm(Poids~Taille+Age+DuréeSommeil,Tableau1)
> Reg
23

Call:
lm(formula = Poids ~ Taille + Age + DuréeSommeil, data = Tableau1)

Coefficients:
(Intercept) Taille Age DuréeSommeil
-104.9970 0.8889 0.3200 1.0042
> summary(Reg)

Call:
lm(formula = Poids ~ Taille + Age + DuréeSommeil, data = Tableau1)

Residuals:
Min 1Q Median 3Q Max
-3.9091 -1.3715 -0.0417 2.3150 3.3464

Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) -104.9970 45.7571 -2.295 0.0509 .
Taille 0.8889 0.2652 3.352 0.0100 *
Age 0.3200 0.5212 0.614 0.5563
DuréeSommeil 1.0042 0.5605 1.792 0.1110
---
Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

Residual standard error: 2.897 on 8 degrees of freedom


Multiple R-squared: 0.627, Adjusted R-squared: 0.4871
F-statistic: 4.482 on 3 and 8 DF, p-value: 0.03988

Exercice TP 4
Exercice 1
Encodage des données

>Poids=c(9.6,6.7,10,11.2,6.8,9.2,8.1,7.5,5.5,6.8,7.2,8.8,8.8,9.4,10.2,11,7.
5,8.6,8.2,6)
>Aliment=c("A","A","A","A","B","B","B","B","C","C","C","C","D","D","D","D",
"E","E","E","E")
>Race=c("Noir","Gris","Blanc","Foncé","Noir","Gris","Blanc","Foncé","Noir",
"Gris","Blanc","Foncé","Noir","Gris","Blanc","Foncé","Noir","Gris","Blanc",
"Foncé")

> Tableau=[Link](cbind(Poids,Aliment,Race))
> Tableau
Poids Aliment Race
1 9.6 A Noir
2 6.7 A Gris
3 10 A Blanc
4 11.2 A Foncé
5 6.8 B Noir
6 9.2 B Gris
7 8.1 B Blanc
8 7.5 B Foncé
9 5.5 C Noir
10 6.8 C Gris
11 7.2 C Blanc
12 8.8 C Foncé
13 8.8 D Noir
14 9.4 D Gris
15 10.2 D Blanc
24

16 11 D Foncé
17 7.5 E Noir
18 8.6 E Gris
19 8.2 E Blanc
20 6 E Foncé

Précision de la variable quantitative: Poids.


> Tableau$Poids=Poids

Execution d'ANOVA
> Test=aov(Poids~Aliment+Race,Tableau)
> Test
Call:
aov(formula = Poids ~ Aliment + Race, data = Tableau)

Terms:
Aliment Race Residuals
Sum of Squares 22.9170 5.0135 21.2390
Deg. of Freedom 4 3 12

Residual standard error: 1.330382


Estimated effects may be unbalanced

> summary(Test)
Df Sum Sq Mean Sq F value Pr(>F)
Aliment 4 22.9170 5.7293 3.2370 0.05095 .
Race 3 5.0135 1.6712 0.9442 0.44989
Residuals 12 21.2390 1.7699
---
Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

Comparaison multiple: Test de Tukey


> TukeyHSD(Test)
Tukey multiple comparisons of means
95% family-wise confidence level

Fit: aov(formula = Poids ~ Aliment + Race, data = Tableau)

$Aliment
diff lwr upr p adj
B-A -1.475 -4.4734884 1.5234884 0.5423367
C-A -2.300 -5.2984884 0.6984884 0.1686901
D-A 0.475 -2.5234884 3.4734884 0.9852847
E-A -1.800 -4.7984884 1.1984884 0.3611694
C-B -0.825 -3.8234884 2.1734884 0.8999753
D-B 1.950 -1.0484884 4.9484884 0.2916342
E-B -0.325 -3.3234884 2.6734884 0.9965012
D-C 2.775 -0.2234884 5.7734884 0.0746186
E-C 0.500 -2.4984884 3.4984884 0.9822258
E-D -2.275 -5.2734884 0.7234884 0.1757435

$Race
diff lwr upr p adj
Foncé-Blanc 0.16 -2.338056 2.658056 0.9974235
Gris-Blanc -0.60 -3.098056 1.898056 0.8900023
Noir-Blanc -1.10 -3.598056 1.398056 0.5757924
Gris-Foncé -0.76 -3.258056 1.738056 0.8034464
Noir-Foncé -1.26 -3.758056 1.238056 0.4685275
25

Noir-Gris -0.50 -2.998056 1.998056 0.9318912

Commentaire :Il n'y pas d'effet du type d'aliment ni de la race sur la croissance pondérale.

Exercice 2
>Mois=c("janvier","février","mars","avril","mai","juin","juillet","août","s
eptembre","octobre","novembre","décembre")
> Hauteur=c(123.6,125.6,100.5,113,134,125,124.9,143.7,129,153,146.9,135)
> Diamètre=c(20.5,23.7,34.6,24.7,23,26,27,28.9,27.4,27.9,28.9,33.8)

a) Test de corrélation: Test de Pearson.


> cor(Hauteur,Diamètre,method="pearson")
[1] -0.04010425

Comme r = -0,04, corrélation très faible en plus, les deux variables sont inversement
proportionnelles.
> [Link](Hauteur,Diamètre)

Pearson's product-moment correlation

data: Hauteur and Diamètre


t = -0.1269, df = 10, p-value = 0.9015
alternative hypothesis: true correlation is not equal to 0
95 percent confidence interval:
-0.6001919 0.5463726
sample estimates:
cor
-0.04010425

p-value > 0,05, r = -0.04010425 : la corrélation n'est pas significative. ???????

b) Régression.
> Tableau2=[Link](cbind(Hauteur,Diamètre))
> Tableau2
Hauteur Diamètre
1 123.6 20.5
2 125.6 23.7
3 100.5 34.6
4 113.0 24.7
5 134.0 23.0
6 125.0 26.0
7 124.9 27.0
8 143.7 28.9
9 129.0 27.4
10 153.0 27.9
11 146.9 28.9
12 135.0 33.8

> Régression=lm(Diamètre~Hauteur,Tableau2)
> Régression

Call:
lm(formula = Diamètre ~ Hauteur, data = Tableau2)

Coefficients:
26

(Intercept) Hauteur
28.67774 -0.01141

> plot(Tableau2,col="blue")

> abline(Régression,col="blue")

> summary(Régression)

Call:
lm(formula = Diamètre ~ Hauteur, data = Tableau2)

Residuals:
Min 1Q Median 3Q Max
-6.7675 -2.9025 -0.0293 1.8710 7.0689

Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 28.67774 11.70950 2.449 0.0343 *
Hauteur -0.01141 0.08989 -0.127 0.9015
---
Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

Residual standard error: 4.322 on 10 degrees of freedom


Multiple R-squared: 0.001608, Adjusted R-squared: -0.09823
F-statistic: 0.01611 on 1 and 10 DF, p-value: 0.9015

b) (suite) R-squared vaut 0,001608,c.à.d que la variation expliquée ne vaut que 0,16% donc il
existe d'autres facteurs qui peuvent expliquer la variation du diamètre.

d) Cette régression n'est pas significative car p-value=0,9015 > 0,05.

II.4. TEST DU KI-CARRE


1. Test d’adéquation :
Exercice des notes du cours
H0 : le nombre des voix des candidats est le même.
27

H0 est accepté si p > 0,05 (seuil),


> A=c(122,105,86,83,104)
> B=c(0.2,0.2,0.2,0.2,0.2)
> [Link](A,p=B)

Chi-squared test for given probabilities

data: A
X-squared = 10.1, df = 4, p-value = 0.03878

P < 0,05(seuil), on rejette H0:il y a donc une différence significative entre le nombre des voix.

2. Test d’indépendance :
Ce test vise à vérifier l’indépendance ou non de deux variables.
H0 : les deux variables sont dépendantes.
H1 : les deux variables sont indépendantes.

Exercice (énoncé voir notes de cours)


Résolution :
1ère possibilité : Usage des lignes.
> row1=c(90,110)
> row2=c(70,55)
> row3=c(80,95)
> Luse=rbind(row1,row2,row3)
> Luse
[,1] [,2]
row1 90 110
row2 70 55
row3 80 95
> Test=[Link](Luse)
> Test

Pearson's Chi-squared test

data: Luse
X-squared = 4.2926, df = 2, p-value = 0.1169

2ème possibilité : Usage des colonnes


> col1=c(90,70,80)
> col2=c(110,55,95)
> Luse1=cbind(col1,col2)
> Luse1
col1 col2
[1,] 90 110
[2,] 70 55
[3,] 80 95
> Test1=[Link](Luse1)
> Test1

Pearson's Chi-squared test


28

data: Luse1
X-squared = 4.2926, df = 2, p-value = 0.1169

Vous aimerez peut-être aussi