0% ont trouvé ce document utile (0 vote)
18 vues44 pages

Statistiques et TCL en Biostatistique

Transféré par

ntomankiea
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
18 vues44 pages

Statistiques et TCL en Biostatistique

Transféré par

ntomankiea
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Notes cours Biostat L2

M. Bailly-Bechet
Université Claude Bernard Lyon 1 – France

Table des matières


1 Variables aléatoires et lois de probabilité 3
1.1 Variables discrètes . . . . . . . . . . . . . . . . . . . . . . . . 3
1.2 Variables continues . . . . . . . . . . . . . . . . . . . . . . . . 5
1.3 TCL et importance de la loi normale . . . . . . . . . . . . . . 6

2 Rappels de statistiques descriptives ; estimation et intervalles


de confiance 6
2.1 Estimation ponctuelle . . . . . . . . . . . . . . . . . . . . . . . 7
2.2 Distribution d’échantillonnage . . . . . . . . . . . . . . . . . . 8
2.3 Estimation par intervalle de confiance . . . . . . . . . . . . . . 10

3 Tests 11
3.1 Raisonnement général des tests statistiques . . . . . . . . . . . 11
3.2 Différents types de tests . . . . . . . . . . . . . . . . . . . . . 14

4 Test du χ2 16
4.1 χ2 d’ajustement . . . . . . . . . . . . . . . . . . . . . . . . . . 16
4.2 χ2 d’égalité . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18
4.3 χ2 d’indépendance . . . . . . . . . . . . . . . . . . . . . . . . 19
4.4 Lien entre test du χ2 et test de comparison de proportions . . 19

5 ANOVA 1 21

6 ANOVA2 27

1
7 Analyse bivariée 32
7.1 Covariance et coefficient de corrélation linéaire . . . . . . . . . 32
7.2 Test du coefficient de corrélation . . . . . . . . . . . . . . . . . 34
7.3 Exemples . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35

8 Régression et modèle linéaire 35


8.1 Le modèle linéaire . . . . . . . . . . . . . . . . . . . . . . . . . 35
8.2 Estimation des paramètres . . . . . . . . . . . . . . . . . . . . 36

9 Comparaisons de modèles 39

Partie proba/stats du cours


DIAPOS 1-7 presentation module/notation/reussite
Des statistiques pour quoi faire ?
DIAPO 8 pourquoi stats
— Savoir si l’environnement a un effet sur le poids des pandas à la nais-
sance
— Savoir si l’expression d’un gène peut faciliter le développement d’une
tumeur
— Savoir si les acheteurs de céréales sont plus sensibles à la couleur de
la boı̂te ou au prix d’achat
D’une manière générale, les statistiques permettent de répondre à ce type
de question, de manière quantifiée, dans des situations mettant en jeu une
certaine variabilité.
On peut artificiellement décomposer les statistiques en :
Statistique descriptive : la représentation graphique et le résumé de
données observées à l’aide d’indice statistiques (i.e. la moyenne)
Statistique inférentielle : l’induction de propriétés d’une population
à partir de données observées sur un échantillon.
DIAPO 9 lien stat desc et stats inferentielle
Plan du cours de stats : probas, puis généralités sur IC et tests, puis chi2,
ANOVA, corrélation/régression et finalement comparaison de modèles.

2
1 Variables aléatoires et lois de probabilité
Une variable aléatoire est le résultat d’un tirage probabiliste. C’est une
variable qui peut prendre plusieurs valeurs, avec des probabilités données.
En biologie, on observe des caractères sur les individus : ce sont des
grandeurs qui peuvent prendre plusieurs états ou modalités
En statistiques, on travaille avec des variables aléatoires : ce sont des
variables qui peuvent prendre plusieurs valeurs avec une certaine pro-
babilité
Caractère biologique (couleur) ⇔ Variable aléatoire X
État (bleu, vert, rouge) ⇔ valeur x de probabilité p(X = x)
Les variables qualitatives sont les variables pour lesquelles une me-
sure est difficile à produire, ou subjective : couleur, type de régime
alimentaire, intensité de la douleur. . .
Les variables quantitatives sont les variables que l’on peut mesurer
explicitement : taille, poids, nombre de pattes. . .
Les variables quantitatives peuvent être distinguées par :
— leur espérance notée E(X) ou µ (valeur moyenne attendue). Une va-
riable d’espérance 0 est dite centrée
— leur écart-type notée σ (variabilité attendue des résultats autour de la
moyenne ; exemple des notes des étudiants autour de 10). Une
variable d’écart-type 1 est dite réduite. On utilise souvent pour des
raisons mathématiques σ 2 ou V(X), la variance.
On distingue :
— les variables quantitatives discrètes, ne pouvant prendre qu’un nombre
fini de valeurs (par exemple le nombre de jambes d’un individu).
— les variables quantitatives continues, pouvant prendre un nombre infini
de valeurs (par exemple la taille d’un individu).

1.1 Variables discrètes


La loi de probabilité d’une v.a. discrète est la probabilité de chaque
résultat possible, notée p(X = x). Si on lance 1 dés, la loi de probabilité
D est :

3
s p(D = d)
1
1 6
1
2 6
1
3 6
1
4 6
1
5 6
1
6 6
Peut-on prédire le résultat d’un dé ? Et pour deux dés, la somme ? Et le
temps de demain ? Intution : plus il y a de variables, plus on peut prédire le
résultat.
PNOn a toujours, si les résultats possibles sont notés xi avec i = 1..N ,
i=1 p(X = xi ) = 1.
On a toujours
b
X
P (a ≤ X ≤ b) = p(X = x).
x=a

Une loi discrète de probabilité : la loi binomiale La Loi binomiale


est la loi d’une v.a. correspondant au nombre de succès lors du tirage de n
variables de Bernouilli indépendantes. Chaque variable de Bernouilli est p
succès 1 − p échec. On la note souvent B(n, p).

 
n k
p(X = k) = p (1 − p)n−k (1)
k
E(X) = np (2)
V(X) = np(1 − p). (3)

DIAPO 11 loi binomiale

Une loi discrète de probabilité : la loi de Poisson La loi de Poisson


est la loi d’une v.a. correspondant au nombre d’evenements indépendants
qui se produisent dans un intervalle donné, si leur fréquence est constante et
connue (on la note λ). On la note souvent P(λ).
Exples : mutations, fréquence de passage d’un individu à un endroit

4
précis.

λk e−λ
p(X = k) = (4)
k!
E(X) = λ (5)
V(X) = λ. (6)

DIAPOS 12-14 loi théorique + représentation

1.2 Variables continues

p(x)
f (x) = ,
∆x
avec ∆x le pas que l’on voit.
DIAPOS 15-16 continu vers discret
La loi de probabilité d’une v.a. continue est donnée par sa densité de
probabilité. Comme vu sur la diapo précédente pour une variable continue,
p(X = x) = 0 ; on ne peut pas utiliser le formalisme du cas discret. La densité
f associée à la variable aléatoire X est la probabilité de tirer une valeur dans
un intervalle tout petit autour de x. On a toujours :
Z
f (x) ≥ 0 f (x) = 1.

On a toujours
Z b
P (a < X < b) = f (x)dx.
a
P R
On note la similarité entre discret et continu en passant de à .

Un exemple de variable continue : la loi normale La loi normale est la


loi de probabilité des variables aléatoires continues dépendantes d’un grand
nombre de causes indépendantes et additives. Elle se note N (µ, σ) avec µ
l’espérance de la loi et σ l’écart-type. Attention à la notation de l’écart-type.

5
1 1 x−µ 2
f (x) = √ e− 2 ( σ ) (7)
2πσ 2
E(X) = µ (8)
V(X) = σ 2 . (9)

DIAPO 17 loi theorique

La loi de Student La loi de Student est une variante de la loi normale


que l’on observe quand la variance de la variable étudiée est inconnue. On
l’utilise toujours de manière indirecte ; elle dépend d’un nombre de degrés de
liberté ; plus ce nombre est grand, plus elle est proche d’une loi normale de
même moyenne et écart-type.
DIAPO 18 loi theorique
DIAPOS 19 representation variables

1.3 TCL et importance de la loi normale


Un énoncé du théorème central limite (TCL) est : Toute somme de n
variables aléatoires indépendantes converge vers une loi normale quand n
devient grand.
On déduit également que la loi de la moyenne d’un échantillon est une loi
normale. Biologiquement, on en déduit que la somme de nombreuses causes
indépendantes (par exemple de nombreux gènes – taille taille des mains chez
l’homme –, de nombreux individus – quantité d’oxygène nette produite par
une forêt –,. . . ) est une loi normale. Pas mal de soucis dans la finance moderne
viennent du fait qu’on fait des hypothèses avec des lois normales alors que
les variables ne sont pas indépendantes ; exemple vente de Game of Thrones,
les N tomes ne sont pas indépendants !

2 Rappels de statistiques descriptives ; esti-


mation et intervalles de confiance
On rappelle qu’un échantillon est une sous-partie de la population étudiée.

6
L’objectif de l’inférence statistique consiste à trouver les valeurs de cer-
taines caractéristiques de la population, à partir de celles observées dans
l’échantillon.
Quand on veut la valeur numérique d’un paramètre, on parle d’estimation.
Une remarque importante est que l’inférence statistique ne dit pas si les
choses sont ou ne sont pas dans la population, mais elle donne une probabilité
à différents évenements, ou une probabilité à la valeur de certains paramètres.

2.1 Estimation ponctuelle


Dans ce cours, on peut vouloir estimer 3 paramètres dans une pop : la
moyenne d’une variable µ, sa variance σ 2 et une fréquence théorique p.
On veut mesurer la durée de l’hibernation chez les marmottes, notée µ
pour la population. On prend un échantillon de n marmottes pour lesquelless
on chronomètre l’hibernation. On a une série statistique x1 , ...xn . On peut
calculer la moyenne de cette série. On rappelle que pour calculer la moyenne
d’une série statistique, on a 2 formules :
Données non groupées :
n
1X
x̄ = xi (10)
n i=1
Données groupées :
k k
1X X
x̄ = nj x?j , avec n = nj et x?j la médiane de la classe j. (11)
n j=1 j=1

DIAPOS 20-21 mangue avec moyenne


On dit que x̄ est un estimateur de µ.
On peut montrer que x̄ → µ quand n → ∞ : on dit que la moyenne empi-
rique (observée) x̄ est un estimateur non biaisé de µ. La meilleure estimation
ponctuelle de µ que l’on puisse faire à partir des x1 ...xn est µ̂ = x̄.
De la même manière, si on veut estimer la fréquence d’occurence d’un ca-
ractère comme un allèle particulier, on va compter, sur n marmottes, combien
ont cet allèle. On note ce nombre k. Dans la population, la vraie probabi-
lité d’avoir l’allèle en question est p ; on peut montrer que f = nk est un
estimateur non biaisé de p. On note p̂ = f = nk
En ce qui concerne l’estimation de la variance σ 2 de la durée d’hiberna-
tion, un léger problème se pose. On rappelle qu’on peut calculer la variance
observée ainsi :

7
Données non groupées :
n
1X
s =2
(xi − x̄)2 , (12)
n i=1

on développe et on obtient :
n
!
1 X
s2 = x2i − x̄2 (13)
n i=1

Sur des données groupées, par le même calcul, on a les deux formules :
k
2 1X 2
s = nj x?j − x̄ , (14)
n j=1
ou encore !
k
1 X
? 2
s2 = − x̄2 .

n j xj (15)
n j=1

DIAPO 22 mangue avec moyenne


L’estimateur naturel serait s2 ; mais cet estimateur est biaisé et sous-
estime la variance globale dans la population (car on rate forcement les indi-
vidus les plus extrêmes si on en prend peu). Il faut corriger cet estimateur ;
n
un estimateur non biaisé de la variance de la population est σ̂ 2 = n−1 s2 =
1
P n 2 2
n−1 i=1 (xi − x̄) . Bien faire la différence entre σ , variance de la pop, son
estimateur σ̂ 2 et la variance observée s2 .

2.2 Distribution d’échantillonnage


A partir d’une population, on prend généralement un échantillon aléatoire.
On pourrait en prendre plusieurs ; ils seraient différents, et les valeurs des va-
riables mesurées dans chaque échantillon ne seront pas les même, et ne seront
pas strictement identiques à celles de la population (sauf constance). On parle
de distribution d’échantillonnage d’une variable. Grâce aux probabilités, on
peut calculer cette distribution.
Que vaut cette distribution d’échantillonage ? Prenons le cas de la moyenne
d’un grand échantillon. On a vu avec le TCL que la somme d’un grand nombre
de v.a quelconques suit une loi normale. En particulier la moyenne observée
x̄ aura les caractéristiques suivantes :

8
Soit X une v.a. de moyenne µ et d’écart-type σ. Sa loi est inconnue ou
qcq, on prend une loi uniforme comme exemple :
DIAPO 23 distro moyenne avec n variable mais tjs grand
— une espérance de µ
2
— une variance de σn
— suivra une loi normale, car elle est la somme d’une très grand nombre
de variables indépendantes.
DIAPOS 24-28 repartition des valeurs autour de mu et sigma : 95%, 90%, 99.9%
Donc la notion de taille d’intervalle pour un risque donne de se planter.
Exemples taille étudiants dans amphi d’à coté, notion d’erreur si je fais une
prédiction trop précise ; a l’inverse notion que si je prends un risque ridicule
je prédis une moyenne entre 1m et 3m !
Mathématiquement, on écrit, que, si on prend un risque α de se tromper :

P (µ − Cα < x̄ < µ + Cα ) = 1 − α
r r
σ2 σ2
P (µ − α < x̄ < µ + α )=1−α
n n
x̄ − µ
P (α < q < α ) = 1 − α
σ2
n

x̄−µ
Or q
σ2
est une v.a. centrée réduite qui suit une loi normale comme x̄, car
n
c’est un transformation linéaire d’une v.a. normale ; on peut donc trouver la
valeur de  pour un risque α indépendamment de µ et σ, en disant que :
P (α < N (0, 1) < α ) = 1 − α

DIAPO 29 loi normale centree reduite.


Ces valeurs seront les mêmes pour tous les problèmes où on se ramènera
a une loi normale centree réduite, et donc tous les problèmes où on aura les
mêmes hypothèses au départ. On les lit dans des tables (voir TD). Le seuil
le plus couramment utilisé est 0.05 = 1.96.
DIAPO 30 table stat ecarts reduits.
On a donc au final :
r r
σ2 σ2
P (µ − α < x̄ < µ + α ) = 1 − α.
n n

9
2.3 Estimation par intervalle de confiance
L’idée de l’estimation par intervalle de confiance est d’associer à l’estima-
tion ponctuelle la connaissance que l’on a sur la distribution d’échantillonnage.
En fonction des situations et des hypothèses, on peut avoir une idée plus ou
moins precise de la distribution d’échantillonnage, et donc un intervalle de
confiance plus ou moins précis.
On construit l’IC au risque α de se tromper en regardant l’intervalle
qu’on s’autorise à avoir dans la distro d’échantillonnage au risque α, et en
appliquant cet intervalle autour de la valeur estimée. Dans le cas précédent,
on va chercher à transformer l’expression que l’on a en un encadrement de µ,
qui est inconnu et nous intéresse : FAIRE CALCUL EN FONCTION TEMPS

r r
σ2 σ2
P (µ − α < x̄ < µ + α ) = 1 − α. (16)
rn rn
σ2 σ2
P (−α < x̄ − µ < α ) = 1 − α. (17)
r n rn
σ2 σ2
P (−x̄ − α < −µ < −x̄ + α ) = 1 − α. (18)
nr r n
σ2 σ2
P (x̄ + α > µ > x̄ − α ) = 1 − α. (19)
" n r n
r #
σ2 σ2
IC : x̄ − α , x̄ + α (20)
n n

On peut construire les IC pour d’autres hypothèses (voir cours sur In-
ternet, bouquins biostatistiques à la BU, TDs). Le principal cas à connaı̂tre
est quand la variance a été estimée à partir des données : Si X suit une loi
normale de variance inconnue – bien définir une variance inconnue –
on fait une petit erreur car on doit estimer la variance ; la loi sous-jacente
n’est plus une loi normale mais une loi de Student, et l’IC devient :
 s s 
σˆ2 σˆ2 
IC : x̄ − tα,n−1 , x̄ + tα,n−1
n n

On peut trouver les t dans la table de Student, donnéee en TD ; leur


valeur dépend à la fois de α et de n. On verra que si n est grand, tα,n−1 = α

10
Pour l’estimation d’une fréquence dans la population, la formule à connaitre,
que l’on obtient par un raisonnement similaire, est :
" r r #
p̂(1 − p̂) p̂(1 − p̂)
IC : p̂ − α , p̂ + α ,
n n

avec p̂ = nk .
Si n est petit on ne peut pas faire grand chose. Les stateux veulent tou-
jours un grand n.
toutes ces formules sont dans le formulaire distribué maintenant !

3 Tests
3.1 Raisonnement général des tests statistiques
On a les durées d’hibernation de n marmottes, notre échantillon. On peut
faire un intervalle de confiance là dessus. Mais on peut également vouloir
comparer ces valeurs à une moyenne de référence µ0 (par exemple, le temps
moyen d’hibernation des mêmes marmottes 10 ans plus tôt). Bien définir x̄,
µ et µ0
Idée générique : si l’écart observé entre x̄ et µ0 , moyenne de référence, est
petit, on va dire que l’erreur est due au hasard ; si l’écart est grand on va
dire que le hasard ne suffit pas. Cet écart va être calculé sous la forme de ce
qu’on appelle la statistique du test.
Formellement, un test statistique distingue toujours 2 hypothèses :
H0 l’hypothèse nulle : nos marmottes dorment autant que la moyenne
de référence : la différence observée entre x̄ et µ vient uniquement
de la variabilité de la distribution d’échantillonage, donc du hasard.
Mathématiquement on a µ = µ0 . Attention, x̄ = µ0 ne veut rien dire !
H1 l’hypothèse alternative : le contraire, à savoir que nos marmottes ne
dorment pas la même durée que la valeur de référence : il existe une
différence réelle entre µ0 , la moyenne globale de la population, et µ,
la moyenne de la sous-population de laquelle provient l’échantillon.
Mathématiquement on a µ 6= µ0 . Attention, x̄ 6= µ0 ne veut rien dire !
Il faut remarquer que H0 est structurellement plus simple que H1 , puisque
H0 implique qu’un seul paramètre décrit la population, alors que H1 implique
l’existance d’un deuxième paramètre. On dit que H0 est l’hypothèse nulle

11
parce que c’est celle que l’on va privilégier (la plus simple) sauf si les données
disent le contraire. Notion Rasoir d’Occam.

Logique des tests : les tests fonctionnent au rejet. Il faut se rappeler que
A → B est équivalent à nonB → nonA, mais pas du tout à B → A. Exemple
avec B : je mange toujours des céréales au petit déjeuner, et A : je suis un
poulet. On a tjs A → B. Si on ne mange pas de céréales (nonB), on peut
en conclure que l’on n’est pas un poulet (si on en était un il faudrait qu’on
mange des céréales). Mais on ne peut pas en conclure que manger toujours
des céréales au petit dejeuner implique que vous etes un poulet, puisque
d’autres choses que les poulets peuvent manger la meme chose qu’eux.
Pour chacun des échantillons ci-dessus, je peux réaliser un test statistique,
qui va se baser sur l’assertion logique suivante : H0 → statistique ∈ [] (qui
correspond à A → B).
On va donc calculer la statistique.
1. Si elle est hors de l’intervalle, on a nonB → nonA et H0 est fausse :
on rejette H0 si la statistique est forte.
2. Si la stat est dans l’intervalle, on ne peut pas en conclure logique-
ment que H0 est vraie ; on va l’accepter par défaut, et parce que c’est
l’hypothèse la plus simple.
La difficulté réside dans le fait qu’ il n’y a pas de limite précise à l’inter-
valle qui nous intéresse, à cause des propriétés des lois statistiques qui nous
intéressent : une loi normale peut donner n’importe quelle valeur, et même si
H0 est vraie, on peut observer – avec des probabilités différentes – n’importe
quelle valeur de x̄. La question est donc : quelle est la probabilité que x̄ soit
aussi éloigné de µ0 , si H0 est vrai ?
DIAPOS 31-33 comparaison xbarre et seuils
On voit qu’en fonction du seuil de précision que l’on choisit, x̄ est d’un
cote ou de l’autre.
Comme précedemment, on va se ramener à une loi normale centré réduite.
On a : DIAPO 34 equivalence seuils
r
σ2 x̄ − µ0
P (x̄|N (µ, )) = P ( q |N (0, 1))
n σ2
n

La question qui se pose est donc : si je prends comme hypothèse qu’un


résultat au hasard doit tomber dans les 1 − α pour cents des résultats les

12
plus probables, x̄ est-il dans cet intervalle ?
La valeur critique correspondant à chaque risque α dépend des hypothèses
du test effectué ; ici les valeurs critiques sont les mêmes α que précedemment.
En TD vous verrez les différents tests avec pour chacun, les hypothèses et les
valeurs critiques correspondantes ; la démarche à se rappeler est toujours la
suivante :
— Choisir un risque α ;
— En déduire en fonction du test la valeur seuil zα .
— Calculer la statistique du test, zobs .
— Si kzobs k ≤ zα , on est dans l’intervalle, on ne peut pas rejeter H0 .
— Si kzobs k > zα , on est hors de l’intervalle, on peut rejeter H0 et accepter
H1 . . . avec un risque α de se tromper.
Une autre démarche s’est développée avec l’avènement de l’informatique :
le calcul de la p-valeur. Cette valeur est la probabilité que H0 explique bien
les données observées : plus elle est faible, moins H0 a de chances d’être vraie.
Il faut cependant toujours choisir un niveau de risque avant de commencer
les calculs, la seule différence vient de la méthode de calcul. Les p-valeurs ne
se calculent pas à la main, mais toujours avec un ordinateur – voir R.
DIAPO 35 p valeur
Quand on effectue un test statistique avec un seuil choisi au risque α,
on dit en pratique que si x̄ appartient aux α pour cents de la distribution
d’échantillonage les plus rares, on va rejeter H0 comme étant fausse. Cette
assertion est par définition fausse dans α pour cents des cas. On prend donc
un risque α de se tromper, dit risque de première espèce.
Mais peut-on se tromper en choisissant H0 aussi ?
Il existe un autre risque de se tromper : c’est celui ou on conserve H0 par
défaut alors que H0 était fausse. C’est le cas ou H1 est vraie, mais peut-etre
pas tres différente de H0 , et donc on ne voit pas bien la différence. On note
ce risque de deuxième espèce β. Dans la pratique ce risque est complexe à
calculer, mais il est toujours présent.
DIAPO 36-37-38-39 exemple beta
Tableau recap risques
Réalité H0 H1
Choix
H0 1-α β
H1 α 1−β
On ne peut pas minimiser à la fois α et β : si je minimise α, donc j’augmente

13
mes chances de conserver H0 quand elle est vraie, alors je dois forcément
augmenter β et augmenter ems chances de ne pas voir que H1 est vraie. . .
Un mot sur la latéralité : si je m’intéresse à une hypothèse biologique uni-
latérale (un médicament par exemple), je vais changer mon seuil à l’avance,
et décider que je ne considererai que les effets par exemple positifs. Dans ce
cas, pour conserver le meme risque, il faut que je prenne un α différent ; vu
que la loi est symétrique, il faut que je prenne pour un test unilatéral un
seuil 2α .
DIAPO 40 Test unilatéral

3.2 Différents types de tests


Il existe différents types de tests de comparaison de moyennes et de
fréquences. En particulier, on peut vouloir comparer :
— Une moyenne observée à une moyenne de référence (test de confor-
mité)
— Une fréquence observée à une fréquence ou probabilité de référence
(conformité)
— L’égalité de 2 moyennes observées dans 2 échantillons différents (égalité
ou homogénéité)
— L’égalité de 2 fréquences observées dans 2 échantillons différents
— L’égalité de 2 variances observées dans 2 échantillons différents
La procédure est toujours directe, sauf dans le cas où on veut comparer 2
moyennes observées. Dans ce cas, il faut d’abord vérifier si les variances des
2 populations desquelles viennent les 2 échantillons sont égales.
Si on a les durées d’hibernation d’un échantillon de marmottes des Alpes
(nA valeurs x1 , x2 , ..., xnA ) et d’un échantillon de marmottes des Pyrénées
(nP valeurs y1 , y2 , ..., ynP ), on doit :
— Faire un test pour vérifier l’égalité des variances ;
— Si ce premier test nous dit que les deux variances sont égales faire un
test pour vérifier l’égalité des 2 moyennes.

Test de Fisher de comparaison de 2 variances On note s2A la variance


observée de la durée d’hibernation dans les Alpes, idem pour s2P . On note σA2

14
et σP2 respectivement les variances à l’échelle de la population.
H0 : σA2 = σP2 .
H1 : σA2 6= σP2 .

On choisit un seuil α = 0.05 par exemple. La valeur seuil de notre test


nA −1,nP −1
sera alors lue dans la table de Fisher, et sera notée F0.05 . On appelle
nA − 1 et nP − 1 les degrés de liberté. La statistique à calculer est :
nP s2P
σ̂max σ̂P 2 nP −1
Fobs = = = nA s2A
, (21)
σ̂min σ̂A2
nA −1

si la variance observée est plus grande dans les Pyrénées comme ici. On voit
que ce rapport devrait valoir une valeur proche de 1 si les variances observées
sont proches, et donc que les variances des 2 populations sont supposément
proches – ce qui est H0 .
nA −1,nP −1
On compare ensuite : si Fobs ≤ F0.05 , on en conclut que H0 ne peut
pas être rejetée, et donc que les variances sont bien égales, avec un risque β
nA −1,nP −1
de deuxième espèce inconnu. Si au contraire Fobs > F0.05 , on va rejeter
H0 avec un risque α = 5% de se tromper, et dire que les variances sont
différentes.

Test de comparaisons de 2 moyennes observées, variances égales Si


les variances sont différentes, on ne peut pas tester l’égalité des moyennes ; si
les variances sont égales, on peut faire le test, qui est alors direct. Brièvement :
Les variances étant considérées comme égales, on calcule la variance com-
mune de nos deux échantillons :
2 nA s2A + nP s2P
σ̂ = (22)
nA + nP − 2

H0 : µA = µP .
H1 : µA 6= µP

On choisit un seuil α = 0.05 par exemple ici aussi (c’est la valeur par
défaut, et ca pose actuellement des problèmes). La valeur seuil de notre test

15
A +nP −2
sera alors lue dans la table de Student, et sera notée tn0.05 , encore une
fois des degrés de liberté. La statistique à calculer est :
|x̄ − ȳ|
tobs = r  , (23)
σ̂ 2 n1A + 1
nP

On voit que ce rapport devrait valoir une valeur proche de 0 si les moyennes
observées sont proches, et donc que les moyennes des 2 populations sont
supposément proches, soit H0 .
A +nP −2
On compare ensuite : si tobs ≤ tn0.05 , on en conclut que H0 ne peut
pas être rejetée, et donc que les moyennes sont bien égales, avec un risque
A +nP −2
β de deuxième espèce inconnu. Si au contraire tobs > tn0.05 , on va rejeter
H0 avec un risque α = 5% de se tromper, et dire que les moyennes sont
différentes.
DIAPO 41-42 Comp moyennes marmottes + discussion p-valeur
Pour les formules détaillées de chaque test, formulaire, cours de première
année, TDs et bouquins de biostats à la BU.

4 Test du χ2
Le test du χ2 est un test qui vise à analyser une table de contingence,
c-à-d des comptes obtenus pour des variables qualitatives, discrètes ou re-
groupées par classe. Au sein de chaque groupe on a le nombre d’individus
qui appartiennent au groupe.
DIAPOS 43-46 exemples chi2

4.1 χ2 d’ajustement
On a une table de contingence pour une variable X. On se demande si
les comptes observés pour chaque intervalle ou valeur de X suivent une loi
donnée p(X).

H0 :X suit la loi p(X)


H1 :X ne suit pas la loi p(X)
On note que suivre une loi connue est l’hypothèse nulle : c’est ce lle
qui est structurellement plus simple, car une loi connue est plus précise que

16
”n’importe quelle autre loi”. Attention au fait que cela peut paraı̂tre contre-
intuitif ! On va voir si les données permettent de rejeter une hypothèse nulle
disant qu’on suit bien une loi donnée.
Les étapes consistent en :
— Calculer les effectifs théoriques attendus si H0 est vraie
— Regrouper les catégories pour que les effectifs théoriques vaillent au
moins 5 (en réalité ne soient pas trop petits, on utilise une convergence
vers la normale et pas la Poisson)
— Calculer la statistique qui mesure la différence entre effectifs théoriques
et effetifs observés
— Conclure en comparant à la valeur théorique que l’on a pu tabuler si
H0 était vraie.
Si H0 est vraie, l’effectif théorique de la classe i est donné par la formule
Ti = np(X = Xi ), avec n l’effectif total.

X X1 X2 ... Xk Total
Effectifs observés Oi n1 n2 ... nk n
Effectifs théoriques Ti np(X = X1 ) np(X = X2 ) ... np(X = Xk ) n

La statistique est ensuite la suivante :


k
X (Oi − Ti )2
χ2obs =
i=1
Ti
On se rend compte dans la formule que l’on compare les effectifs théoriques
et les effectifs observés ; si ceux-ci sont proches, la valeur du χ2obs sera faible,
si les écarts sont grands la statistiques sera élevée.
On va comparer cette statistique à une valeur seuil χ2k−1−c à k − 1 − c ddl,
où c est le nombre de paramètres estimés. Le n − 1 vient du fait que dans la
somme de calcul du χ2 , on a n termes, mais le dernier est défini par les n − 1
premiers, puisque on sait que la somme des effectifs totaux doit valoir n. De
plus chaque paramètre estimé à partir des données donne artificiellement un
meilleur ajustement, on enlève donc un ddl pour compenser ce biais : dans
le cas ou on estime un seul paramètre, on peut en effet déduire le contenu
des 2 dernières cases du tableau en sachant que la taille totale est n et que le
paramètre estimé vaut la valeur calculée ; et ainsi de suite si on estime plus
de un paramètre. . .
DIAPOS 47-48 ajustement à une loi de Poisson

17
4.2 χ2 d’égalité
On a une table de contingence pour une variable X à k modalités mesurées
dans m conditions. On se demande si les comptes observés pour chaque
condition ont la même distribution.
DIAPO 49 Exemple Labos

H0 : Les distributions sont les mêmes pour chaque condition


H1 : Au moins une distribution est différente des autres pour une condition

La procédure va etre la même que plus haut, la différence venant de la


table (plus complexe à première vue) et de la manière de calculer les effectifs
théoriques.

A A1 A2 ... Ap Somme
B
B1 n11 n12 n1p n1•
B2 n21 n22 n2p n2•
... ...
Bq nq1 nq2 nqp nq•
Somme n•1 n•2 n•p n

Quel est l’effectif théorique dans la case ij ? Si H0 est vraie, cet effectif
est simplement proportionnel à l’effectif de la ligne i et de la conlonne j. On
a donc :
ni• n•j ni• n•j
tij = n =
n n n
Une fois ces effectifs théoriques calculés, on les regroupe pour avoir des
cases supérieures a 5 si possible, puis on calcule le χ2 comme précedemment :
p q
X X (nij − tij )2
χ2obs =
i=1 j=1
tij

La valeur seuil du χ2 dépend à la fois du risque de première espèce α


et du nombre de degrés de liberté. Ce nombre vaut le nombre de cases
indépendantes, sachant que les sommes sur les lignes et les colonnes sont

18
fixes ; on a donc p − 1 colonnes indépendantes et q − 1 lignes indépendantes,
et (p − 1)(q − 1) ddl et on a :

χ2seuil = χ2α,(p−1)(q−1)

Si χ2obs ≤ χ2seuil , on conserve H0 par défaut, avec un risque β inconnu de


se tromper ; si χ2obs > χ2seuil , on rejette H0 et on accepte H1 avec un risque α
de se tromper.

4.3 χ2 d’indépendance
En pratique, ce test ressemble énormément au précédent : on dispose de
la table de contingence croisée pour un variable X affectée par 2 caractères
A et B. Les hypothèses sont :

H0 : Les caractères A et B sont indépendants


H1 : Les caractères A et B ne sont pas indépendants

DIAPOS 50 Pb pandas
Les effectifs théoriques sont calculés de la même manière, le regroupement
aussi, et le seuil de la même façon. La seule différence réside dans la formula-
tion des hypothèses : les différentes modalités de A et B chacun sont-elles de
simples variations ou des états complètement différents ? La différence n’est
pas toujours évidente. Le nombre de ddl est le même que précedemment,
pour les mêmes raisons.
DIAPO 51-52 Exemple Pandas + effectifs !

4.4 Lien entre test du χ2 et test de comparison de pro-


portions
A ZAPPER SI MANQUE DE TEMPS ET METTRE SUR SPIRAL
Dans les cas où on peut appliquer indifféremment un test du χ2 ou un test
de comparaison de proportions, les deux tests sont strictement équivalents.
Par exemple prenons les données de réussite à un examen. On a un groupe
d’étudiants avec leurs résultats, et on veut comparer à la moyenne nationale
p.
(n’écrire au début que les effectifs observés).

19
X Réussite Échec Total
Effectifs observés Oi n1 n − n1 n
Effectifs théoriques Ti np n(1 − p) n

On a deux possibilités de test, pour les mêmes hypothèses H0 et H1


– l’hypothèse nulle testant le fait que les données sont réparties avec une
proportion de réussite p.
— Le test de conformité d’une proportion observée à une proportion
théorique. La statistique est :

n1
n
−p
obs = q
p(1−p)
n

— Le test d’ajustement du χ2 à une loi binomiale de paramètre p. Ajou-


ter partie tableau avec effectifs théoriques. La statistique est :

(n1 − np)2 ((n − n1 ) − n (1 − p))2


χ2obs = +
np n (1 − p)

Le lien entre ces deux formules est donné par le calcul suivant :

(n1 − np)2 ((n − n1 ) − n (1 − p))2


χ2obs = +
np n (1 − p)
2
(n1 − np) (np − n1 )2
= +
np n (1 − p)
n1 np
 2
− n
 
n 1 1
= n +
n2
p 1−p
n1
2 
−p

n 1
= 1
n
p(1 − p)
 2
n1
−p
=  qn  = (obs )2
p(1−p)
n

Si on regarde les valeurs seuils χ2α,1 et α , on verra que l’on retrouve la


relation χ2α,1 = 2α

20
5 ANOVA 1
On sait comparer les moyennes issues de 2 échantillons. Comment faire
si l’on dispose de 3 échantillons 1, 2 et 3 ? La première possibilité est de
comparer :
— 1 et 2
— 2 et 3
— 1 et 3
Cela multiplie les tests, et peut conduire à des situations difficiles à in-
terpréter : par exemple 1 et 2 ne sont pas significativement différents, 2 et 3
non plus, mais 1 et 3 le sont !.
L’objectif de l’ANOVA 1 est de tester simultanément l’égalité de toutes
les moyennes de k échantillons. Chaque échantillon i = 1..k est caractérisé
par sa moyennes obervée ȳi et sa variance observée s2i . Chaque échantillon
est issu d’une population de moyenne µi et de variance σi2 . On veut donc
tester :

H0 : µi = µj ∀i, j
H1 : ∃i, j t.q. µi 6= µj .

DIAPOS 53-54-55 exemple donnees marmottes +graphique


Formellement, les données se présentent ainsi :

A
A1 A2 ... Ap
y y11 y21 yp1
y12 y22 yp2
... ...
y1n1 y2n2 ypnp
Nombre de n1 n2 np
répétitions
Moyenne ȳ1 ȳ2 ȳp
Écart-type s21 s22 s2p
observé

Le facteur A peut être qualitatif ou quantitatif, l’ANOVA peut toujours


être effectuée – mais si le facteur est quantitatif on pourra faire mieux par la

21
suite. On dira que la taille totale de l’échantillon est N =P pi=1P
P
ni . On note
également la moyenne globale de tout l’échantillon ȳ = N i=1 nj=1
1 p i
yij .
Si on devait modéliser ces données, on pourrait le faire ainsi. Sous H0 on
peut écrire :
yij = µ + eij ,
avec eij un terme de variabilité intrinsèque sur les mesures – on dira souvent
que eij , qu’on appelle les résidus, suivent une loi normale de moyenne nulle.
La moyenne théorique dans chaque groupe est donc bien µ, puisque le terme
eij est aléatoire et n’ajoute rien à la moyenne.
Et sous H1 on peut écrire :
yij = µ + ai + eij .
La différence est donc que sous H1 on suppose que en plus du terme
résiduel, on a un écart à la moyenne dans chaque groupe, avec µi = µ + ai .
L’idee générale est que la variabilité des données autour de la moyenne
globale, ȳ, est due à la fois à la variabilité au sein de chaque groupe, due au
hasard, et à la variabilité moyenne entre les groupes, qui est nulle sous H0 et
vaut ai pour le ième groupe sous H1 . On va donc calculer ces deux variabilités
et les comparer.
On va décomposer la variance globale :
p ni p ni
X X X X
2
(yij − ȳ) = [(yij − ȳi ) + (ȳi − ȳ)]2
i=1 j=1 i=1 j=1
p ni p ni
X X X X
(yij − ȳ)2 = (yij − ȳi )2 + (ȳi − ȳ)2 − 2 (yij − ȳi ) (ȳi − ȳ)
 
i=1 j=1 i=1 j=1
p ni p ni p p ni
X X X X X X X
2 2 2
yij ȳi − yij ȳ − ȳi2 + ȳi ȳ

(yij − ȳ) = (yij − ȳi ) + ni (ȳi − ȳ) − 2
i=1 j=1 i=1 j=1 i=1 i=1 j=1
p ni p ni p p
X X X X X X
2 2 2
ni ȳi2 − ni ȳi ȳ − ni ȳi2 + ni ȳi ȳ

(yij − ȳ) = (yij − ȳi ) + ni (ȳi − ȳ) − 2
i=1 j=1 i=1 j=1 i=1 i=1
p ni p ni p
X X X X X
(yij − ȳ)2 = (yij − ȳi )2 + ni (ȳi − ȳ)2
i=1 j=1 i=1 j=1 i=1

SCEtot = SCEintra + SCEinter

Retour DIAPO 55 graphique marmotte pour SCE

22
On note :
SCEinter
η2 =
SCEtot
le rapport de la variabilité expliquée par des différences entre groupes (et
donc par le facteur A) sur la variabilité totale. C’est un indicateur de la
proportion de la variabilité qui est due au facteur A ; on a tjs 0 < η 2 < 1.
On voit dans les formules que les différents SCE ne comprennent pas le
même nombre de termes libres. Dans le SCEtot , on utilise tous les yij ; ceux-ci
sont tous indépendants sauf le dernier, on a donc N − 1 ddl. Dans le terme
SCEinter , on utilise les ȳi : on a donc p − 1 ddl. Dans le terme SCEintra , on
utilise les yij par rapport aux ȳi : on a donc N − p ddl. On a :

N −1=p−1+N −p

On peut donc calculer à partir des SCE des carrés moyens, qui dépendent
de ces ddl :

SCEinter SCEintra
CMinter = CMintra =
p−1 N −p
Si H0 est vraie, on peut montrer que CMintra ∼ CMinter , parce que
la variabilité globale se décompose autant entre les groupes que dans les
groupes, une fois la normalisation par les CM faite. Si H0 est fausse alors
on attend plus de variabilité entre groupes que dans chaque groupe (CMinter
plus fort que CMintra ). La statistique de l’ANOVA1 va donc être le rapport :
CMinter
Fobs =
CMintra
Cette statistique, qui est en fait un rapport de variances, suit une loi de
Fisher, et la valeur seuil est donc Fα,p−1,N −p . Si Fobs ≤ Fα,p−1,N −p , on en
conclut que H0 ne peut pas être rejetée, et donc que les moyennes de tous
les groupes sont bien égales, avec un risque β de deuxième espèce inconnu.
Si au contraire Fobs > Fα,p−1,N −p , on va rejeter H0 avec un risque α = 5% de
se tromper, et dire que au moins une moyenne est différente des autres.
Notez bien qu’on parle d’analyse de variance pour comparer des moyennes
– parce que la technique utilise une décomposition et un test basé sur les
variances ; mais on compare bien des moyennes dans ce test.
DIAPOS 56-57 ANOVA marmotte

23
Cas particulier de 2 échantillons A ZAPPER SI MANQUE DE TEMPS
ET METTRE SUR SPIRAL
La technique de l’ANOVA1 peut aussi s’appliquer à la comparaison de
2 échantillons. Prenons l’exemple simple de 2 échantillons de même taille n.
La procédure classique de test d’égalité des moyennes, si les variances sont
considérées comme égales, consisterait à calculer la statistique :
ȳ1 − ȳ2
tobs = q .
σ̂ 2 n1 + n1

Si on applique l’ANOVA 1 dans ces conditions, les calculs que l’on va


effectuer sont les suivants :

p p
X X
2
(ȳi − ȳ)2 = n (ȳ1 − ȳ)2 + (ȳ1 − ȳ)2
 
SCEinter = ni (ȳi − ȳ) = n
i=1 i=1
" 2 2 # " #
 2
ȳ1 + ȳ2 ȳ1 + ȳ2 (ȳ1 − ȳ2 )
=n ȳ1 − + ȳ2 − =n
2 2 2
p ni n n
X X X X
SCEintra = (yij − ȳi )2 = (y1j − ȳ1 )2 + (y2j − ȳ2 )2
i=1 j=1 j=1 j=1

= ns1 + ns2 = σ̂ 2 (2n − 2)


2 2

CMinter SCEinter
(ȳ1 − ȳ2 )2
Fobs = = 1
SCEintra
=  = t2obs
CMintra σ̂ 2 2
2n−2 n

Quelques éléments pratiques : Les formules des SCE données plus


haut sont justes, mais comme dans le cas des calculs de variance, il existe des
formules développées plus simples. Ces formules développées s’obtiennent de
la même manière que les formules développées dans le cas du calcul de la
variance pour un échantillon. Les formules sont :

24
p p
ni
! n
i
X X T2 XX
SCEtot = yij2 − avec T = yij = N ȳ
i=1 j=1
N i=1 j=1
p
! n
i
X T2 i T2 X
SCEinter = − avec Ti = yij = ni ȳi
i=1
ni N j=1
p p
ni
! !
2
X X X Ti
SCEintra = SCEtot − SCEinter = yij2 −
i=1 j=1 i=1
n i

Les conditions d’application de ce test sont :


— Indépendance des différent échantillons (pas d’individus dans 2 échantillons)
– supposée
— Normalité de la distribution de chaque échantillon (on parle parfois
de normalité des résidus) – supposée mais testable avec le χ2 .
— Homoscédasticité des échantillons, ie égalité des variances.
Pour tester cette dernière condition, on ne peut pas employer les test de
Fisher classique car on a plus de 2 variances. On a plusieurs cas :
— Si les ni sont différents entre eux, le test exact est le test de Bart-
lett, non étudié cette année. On supposera alors l’homoscédasticité
des données.
— Si les ni sont tous identiques, on peut faire un test dit de Hartley.

La procédure du test de Hartely est la suivante :

H0 : σi2 = σj2 ∀i, j


H1 : ∃i, j t.q. σi2 6= σj2 .

On calcule la statistique :

s2max
Hobs = ,
s2min
Et on compare à la valeur seuil au risque α dans la table de Hartley. Ce
tableau a deux entrées : la taille des groupes ni , et le nombre de groupes
comparés.

25
Pour éviter les calculs lourdingues, R
DIAPOS 58-59 ANOVA marmottes R

26
6 ANOVA2
Exemple : on veut étudier des données concernant la vitesse de réplication
d’un virus de la grippe en fonction de la souche et de la température.
DIAPOS 60-61-62 présentation données virus + graphique
Formellement les données se présentent de cette façon :
Facteur A
Facteur B A1 A2 ... Ap
y111 y211 ... yp11
B1 y112 y212 ... yp12
... ... ...
y11n11 y21n21 ... yp1np1
y121 y221 ... yp21
B2 y122 y222 ... yp22
... ... ...
y12n12 y22n22 ... yp2np2
...
y1q1 y2q1 ... ypq1
Bq y1q2 y2q2 ... ypq2
... ... ...
y1qn1q y2qn2q ... ypqnpq

L’ANOVA comme le choix du meilleur modèle Si toutes les données


avaient la même moyenne, on aurait comme modèle sous-jacent :
yijk = µ + ijk ,
avec ijk un terme de bruit gaussien – variabilité suivant une loi normale
centrée, dont l’écart-type est la variabilité typique des données. Si le facteur
A a un effet particulier, le modèle devient :
yijk = µ + ai + ijk .
De même si le facteur B a un effet particulier, le modèle devient :
yijk = µ + ai + bj + ijk .
Finalement, si la valeur de ai dépend de la valeur de bj , ou inversement, le
modèle complet sous-jacent est le suivant :
yijk = µ + ai + bj + cij + ijk .

27
La question que pose l’ANOVA2 – qui est une généralisation de la question
posée par l’ANOVA1 – est de savoir quel est le meilleur modèle pour décrire
les données. Les modèles avec plus de coefficients sont mathématiquement
plus compliqués : ils seront des hypothèses alternatives dans les tests, les
modèles les plus simples étant à chaque fois des hypothèse nulles.
L’ANOVA2 teste 3 hypothèses en parallèle :
— Sur le facteur A :
H0 : Les moyennes dans les différentes categories du facteur A sont
les memes.
H1 : Les moyennes dans les différentes categories du facteur A sont
differentes.
ou encore
H0 : ai = 0 ∀i
H1 : ∃i t.q. ai 6= 0
— Sur le facteur B :
H0 : Les moyennes dans les différentes categories du facteur B sont
les memes.
H1 : Les moyennes dans les différentes categories du facteur B sont
differentes.
ou encore
H0 : bj = 0 ∀j
H1 : ∃j t.q. bj 6= 0
— Sur l’interaction entre ces 2 facteurs :
H0 : Les moyennes dans les différentes categories du facteur A de-
pendent des valeurs de B.
H1 : Les moyennes dans les différentes categories du facteur A ne
dependent pas des valeurs de B.
ou encore
H0 : cij = 0 ∀i, j
H1 : ∃i, j t.q. cij 6= 0
De la même manière que dans l’ANOVA1, on va comparer les variabilités
dues aux différents facteurs entre elles. On va décomposer la variabilité glo-
bale en une somme, normaliser chaque terme par le nombre de ddl approprié,
et comparer ces termes entre eux.
On suppose le nombre de répétitions par case nij égal dans toutes les
cases, et on le note n. Le cas ou le nombre de répétitions est différent est
en pratique calculatoirement complexe, et empêche de faire la décomposition
ci-dessous, ce qui est problématique à la fois en terme d’interprétation et en

28
termes de calculs.
p q n
X X X
SCEtot = (yijk − ȳ)2
i=1 j=1 k=1

La décomposition employée est la suivante :

yijk − ȳ = (ȳi• − ȳ) + (ȳ•j − ȳ) + (ȳij − ȳi• − ȳ•j + ȳ) + (yijk − ȳij ).

p q n
X X X
SCEtot = (yijk − ȳ)2
i=1 j=1 k=1
p q p q
X X X X
= qn (ȳi• − ȳ)2 + pn (ȳ•j − ȳ)2 + n (ȳij − ȳi• − ȳ•j + ȳ)2
i=1 j=1 i=1 j=1
pn q
XXX
+ (yijk − ȳij )2
i=1 j=1 k=1

= SCEA + SCEB + SCEA×B + SCEres

Les ddl correspondants sont :


— Total : N − 1 avec N = npq.
— A : p − 1.
— B : q − 1.
— A × B : (p − 1)(q − 1) car on fait une somme de pq termes avec les
moyennes de chaque catégorie fixées pour les p modalités de A et les
q modalités de B.
— Res : npq − pq = pq(n − 1)
Les calculs à faire sont donc :
SCEA
CMA =
p−1
SCEB
CMB =
q−1
SCEA×B
CMA×B =
(p − 1)(q − 1)
SCEres
CMres =
pq(n − 1)

29
On va ensuite répondre aux 3 tests en calculant les valeurs suivantes :
CMA α
FA = Fseuil = Fp−1,pq(n−1)
CMres
CMB α
FA = Fseuil = Fq−1,pq(n−1)
CMres
CMA×B α
FA = Fseuil = F(p−1)(q−1),pq(n−1)
CMres
On conclut de la manière habituelle.
DIAPOS 63-65 exemple bio
DIAPOS 66-70 deuxième cas avec interaction

Détails pratiques Si le plan est déséquilibré, les calculs précédents sont in-
valides. On fait sur machine, et attention, le problème n’est plus symétrique :
on ”attribue” la variance préférentiellement à A ou B, voir TP R sur ANOVA2.
Comme pour l’ANOVA1, on emploie en TD les formules développées
(équivalence en 2 lignes avec les formules précedentes) :
p q n
!2 p q n
X X X
2 T2 X X X
SCEtot = yijk − T = yijk
i=1 j=1 k=1
N i=1 j=1 k=1
p q
! n
1 X 2 T2 X X
SCEA = Ti• − Ti• = yijk
qn i=1 N j=1 k=1
q p
! n
1 X 2 T2 X X
SCEB = T − T•j = yijk
pn j=1 •j N i=1 k=1
p q p q
n
! n
X X X
2 1 XX 2 X
SCEres = yijk − Tij Tij = yijk
i=1 j=1 k=1
n i=1 j=1 k=1

SCEA×B = SCEtot − SCEA − SCEB − SCEres


Les conditions d’application sont :
— Indépendance des différent échantillons (pas d’individus dans 2 échantillons)
– supposée
— Normalité de la distribution de chaque échantillon (on parle parfois
de normalité des résidus) – supposée mais testable avec le χ2 .
— Homoscédasticité des échantillons, ie égalité des variances – on vérifie
avec Hartley si les nij sont égaux.

30
Cas particulier : n = 1 Si on n’a pas de répétitions, on peut voir que
les formules précédentes ne permettent pas de calculer un SCEres : on a
SCEres = 0. Donc on ne peut pas savoir s’il y a ou non interaction et calculer
en même temps les résidus. SCEres étant la valeur de référence pour tous
les tests, cette absence nous oblige à considérer qu’on ne peut pas dans ce
cas distinguer l’effet d’interaction et l’effet résiduel, et on va décomposer
la variance en un terme du à A, un terme du à B, et un unique terme
résiduel. On va donc procéder comme pour une ANOVA2 classique avec les
modifications suivantes :

SCEtot = SCEA + SCEB + SCEres


SCEres = SCEtot − SCEA − SCEB

Les 2 premiers tests restent inchangés ; le test d’interaction n’est plus


ré[Link] est obligé d’ajouter dans les hypothèse de départ qu’il n’y a pas
interaction – s’il y en a une les résultats seront faussés, puisqu’on modélise
implicitement que les cij = 0 dans ce test.

31
7 Analyse bivariée
DIAPOS 71-72 ribosome et présentation problème
Beaucoup d’expériences, en biologie notamment, mènent à considérer si-
multanément deux variables X et Y appariées, c’est-à dire où à chaque in-
dividu de l’échantillon correspond une valeur de X et une valeur de Y . On
peut :
Décrire et quantifier les relations entre deux variables : est ce que la
concentration en ARNm (X) dans la cellule et la concentration dans
la protéine correspondante (Y ) sont liées et est-ce que cette liaison est
linéaire ? C’est un calcul de corrélation.
Modéliser pour prédire les valeurs de Y à partir des valeurs de X :
connaissant X, que puis-je dire pour Y ? C’est un calcul de régression.
Si elle existe, la variable contrôlée X est appelée variable indépendante
ou explicative, et est toujours en abcisse. La variable aléatoire Y est appelée
variable dépendante ou à expliquer, et est toujours placée en ordonnée. Si on
a 2 variables non contrôlées, le sens du graphe n’est pas prédéterminé, mais
il est souvent implicite que X est la cause de Y .
DIAPOS 73-74 graphique ribosome+marmotte controle
Si l’on a plus de 2 variables que l’on veut analyser simultanément, on
procèdera à une analyse multivariée.

7.1 Covariance et coefficient de corrélation linéaire


On prend 2 variables X et Y appariées. On note xi et yi , i = 1..n les
valeurs prises dans les échantillons. On note x̄ et s2X la moyenne et la variance
observées de X, idem pour Y .
On définit la covariance de deux variables aléatoires X et Y :

cov(X, Y ) = σXY = E(XY ) − E(X)E(Y ),

avec E le symbole de l’espérance d’une variable aléatoire. Notez le lien


avec les formules de la variance – la variance d’une v.a. est la covariance
d’une variable avec elle-même :

32
var(X) = cov(X, X) =E(X 2 ) − E(X)2 , (24)
n
2 1X 2
à lier à s = xi − x̄2 . (25)
n i=1

À partir de deux échantillons de tailles n, on peut mesurer la covariance


observée :
n n
!
1X 1X
sXY = (xi − x̄)(yi − ȳ) = xi yi − x̄ȳ
n i=1 n i=1

On a alors la covariance estimée de la population :


n
σ̂XY = sXY
n−1

À partir de la covariance, et des écarts-types de X et Y , on peut définir le


coefficient de corrélation linéaire ou coefficient de Pearson de deux variables
aléatoires :
σXY
ρ= ,
σX σY
avec σX et σY les écarts-types de X et Y respectivement. Cette valeur
mesure à quel point X et Y varient ensemble – on voit que la variable sera
grande si les xi et les yi sont simultanément au dessus de leurs moyennes
respectives, ou en dessous.
DIAPO 75 graphe en 4 parties
Cette valeur est la vraie valeur du coefficient de corrélation linéaire, une
valeur à laquelle on ne peut avoir accès que partiellement au travers des
échantillons qu’on a :
n
σ̂XY sXY sXY
ρ̂ = rXY = = p n n−1 p n = ,
σ̂X σ̂Y n−1
s X n−1
s Y s X s Y

On emploie plus souvent la notation rXY que ρ̂ dans la pratique, pour


des raisons historiques. Ce coefficient mesure à quel point les variables X et
Y suivent une relation linéaire.
DIAPO 76 graphe coeff correlation

33
rXY est toujours compris entre les 2 extrêmes d’alignement ”parfait” ; on
a:

−1 ≤ rXY ≤ 1.

7.2 Test du coefficient de corrélation


Le mesure du coeff de corrélation linéaire ne dit pas si la liaison observée
est due au hasard de l’échantillonage ou à une réelle liaison entre variables.
Par exemple deux points au hasard vont toujours être alignés, et si on a peu
de points il va être difficile de juger si l’alignement est aléatoire ou pas. Pour
tester cette hypothèse, on va effectuer un test statistique.
Pour pouvoir être appliqué, il faut que les deux variables X et Y soient
distribuées normalement. Si ce n’est pas le cas, il faudra employer un test
non paramétrique, le test de corrélation de Spearman (cours MAB en L3).
Plus généralement, si les variables ne semblent pas distribuées normalement
(nuage de points elliptique), l’usage du coefficient de corrélation pour me-
surer la liaison entre variables est dangereux et peut conduire à de fausses
conclusions.
DIAPO 77 graphe Anscombe
Le test du coefficient de corrélation linéaire entre deux variables étudiées
X et Y , a pour hypothèses :
H0 : ρ = 0, X et Y sont linéairement indépendantes
H1 : ρ 6= 0, X et Y sont linéairement dépendantes

Le test est un test de Student. La statistique à calculer, pour des échantillons


de taille n, est :

r n−2
tobs = √ .
1 − r2
La valeur tobs est ensuite comparée à la valeur seuil lue sur la table de
Student, pour un risque α choisi à l’avance et n − 2 degrés de liberté. Si
tobs < tseuil , on ne peut pas rejetter l’hypothèse nulle, dans le cas contraire,
on pourra accepter l’hypothèse alternative.
On voit que plus r est grand en valeur absolue, et plus le nombre de
points augmente, plus on peut conclure à la significativité de la relation.
On voit aussi que l’on ne peut pas tester la significativité de la relation

34
entre 2 points seulement. À l’inverse, si on fait un test avec énormément de
points (en génomique, classiquement 10 à 20000), il arrive qu’un coefficient
de corrélation r = 0.02 soit significativement différent de 0. Qu’en penser ?
On verra la signification de r comme pourcentage de la variation expliquée
dans le chapitre sur la régression. Il ne faut pas confondre taille d’effet et
taille d’échantillon, l’acceptation de H1 dans le test venant toujours d’un
mélange des deux.

7.3 Exemples
DIAPOS 78-79-80 Exple concentration ARNm + erreur R cov
DIAPO 81 Exple Pandas
Dans le cas où on a des données numériques groupées, on emploie les for-
mules de la moyenne, l’écart-type et la covariance pour des données groupées
par classe :
p
1X 0
x̄ = n i xi ,
n i=1
p
!
1 X 0
s2X = ni xi − x̄2 ,
n i=1
p q
!
1 XX 0 0
sXY = nij xi yi − x̄ȳ,
n i=1 j=1
0 0
où les valeurs xi et yi sont les médianes des valeurs de chaque classe.
On note bien la différence entre le test du χ2 vu précedemment et le test
de régression linéaire : les hypothèses testées ne sont pas les mêmes, le test
de corrrélation teste une hypothèse bcp plus précise.
DIAPO 82-83 Calcul Pandas

8 Régression et modèle linéaire


8.1 Le modèle linéaire
On cherche à étudier l’évolution d’une variable Y en fonction d’une va-
riable X, aléatoire ou contrôlée. La droite de régression linéaire est un modèle

35
de la relation entre une variable X et une variable Y par une droite, qui per-
met de prédire les valeurs de Y en fonction des valeurs de X.
La principale différence conceptuelle avec le cas où les 2 variables sont
aléatoires est que, ici, on ne cherche pas à savoir s’il existe ou non une relation,
mais plutôt quelle est la nature de cette relation. Si le test de corrélation a
indiqué qu’il n’y avait pas de relation, alors écrire un modèle ne sert à rien. . .
Attention, l’existence d’une corrélation n’implique pas forcément celle
d’une causalité. On a par exemple une très bonne corrélation entre le nombre
de cigognes en Alsace et le taux de fertitilité en Asace, et pourtant les 2
phénomènes ne sont reliés causalement qu’au travers d’une cause commune :
le passage du temps. . .
Si l’on veut modéliser une relation non-linéaire entre Y et X, on parlera
de régression polynomiale, ou exponentielle, ou logarithmique en fonction de
la fonction utilisée : c’est de la régression non linéaire.
DIAPOS 84-85-86 choix droite regression et ecarts
Valeurs observées : (xi , yi )
Valeurs prédites : ŷi = axi + b
Ecarts : ei = yi − ŷi

8.2 Estimation des paramètres


On estime les paramètres a et b en trouvant les valeurs qui minimisent
les écarts entre ŷi et yi .
On note s2R la variabilité résiduelle , t.q s2R = ni=1 e2i . Cette variabilité est
P
observée, on peut calculer une estimation de cette variabilité si on avait toute
n
la population, et donc qu’on ne faisait aucune erreur sur a et b : σ̂R2 = n−2 s2R .
Cette estimation ne nous sert pas pour le calcul des paramètres, car minimiser
s2R et σR2 est équivalent.
On veut minimiser :
n
X n
X n
X
s2R = e2i = 2
(ŷi − yi ) = (axi + b − yi )2 ,
i=1 i=1 i=1

en fonction des valeurs de a et b. Pour cela, on cherche quand les dérivées de

36
cette fonction par rapport à b et a sont nulles.
n
∂F X
=0⇒ (2b + 2axi − 2yi ) = 0, (26)
∂b i=1
2nb + 2anx̄ − 2nȳ = 0, (27)
b = ȳ − ax̄. (28)

n
∂F X
2ax2i + 2bxi − 2xi yi = 0,

=0⇒ (29)
∂a i=1
n
X
2ax2i + 2ȳxi − 2ax̄xi − 2xi yi = 0,

(30)
i=1
n
X n
 X
a x2i − x̄xi = (xi yi − ȳxi ) , (31)
i=1 i=1
n
! ! n
X X
a x2i − nx̄2 = (xi yi ) − nȳx̄, (32)
i=1 i=1
sXY
a= 2 . (33)
sX

DIAPO 87 exemple calcul + 88 R


Notre modèle nous donne :
— des valeurs prédites, qui peuvent être comparées à la réalité.
— des valeurs pour les paramètres a et b, qui peuvent être interpretées
et réemployées par la suite.
Ici, â est le taux d’augmentation de concentration en protéine par unité
d’ARNm, et b̂ représente la concentration de base en protéine si [ARN m] = 0
dans notre modèle. On note que b 6= 0, ce qui est biologiquement irréaliste (ou
alors on doit tenir compte de ce qui a été passé à la cellule à sa naissance). On
aurait pu forcer b = 0 en changeant le calcul précédent ; on a alors un modèle
différent, et donc des paramètres différents. Attention aux unités dans notre
modèle !
DIAPOS 89-90-91-92-93 residus

Intervalles de confiance Dans un cadre prédictif, plutôt que d’effectuer


des tests, on peut vouloir écrire des intervalles de confiance au risque α autour

37
de la pente et de l’ordonnée à l’origine prédite. Les intervalles de confiance
ont les formes suivantes (on ne rentre pas dans le pourquoi) :
s
σ̂r2
ICα a : â ± tα,n−2
ns2X
r
σ̂r2
ICα b : b̂ ± tα,n−2 ,
n
n
Pn 2
avec σ̂R2 = n−2 i=1 ei , comme vu avant. Un des intervalle de confiance les
plus utiles est celqui que l’on peut former autour d’une prédiction : connais-
sant la régression linéaire de Y en fonction de X, quelle valeur y0 peut-on
espérer obtenir pour une valeur x0 de la variable X ?
v !
2
u
u n + 1 (x 0 − x̄)
ICα y0 : âx0 + b̂ ± tα,n−2 tσ̂r2 + .
n ns2X

DIAPOS 94-95-96 IC et generalisation


On remarque que la précision de prédictions pour des x0 situés loin de
la valeur moyenne x̄ sont beaucoup moins précises que celles correspondants
à des valeurs proches. Attention aux extrapolations ! Les causes de varia-
tion de Y effectives dans l’intervalle étudié de X ne sont pas forcément
vraies en dehors de cet intervalle. Il y donc deux sources d’erreurs quand
on s’éloigne des valeurs de l’expérience : la fait que la variabilité statistique
augmente, et le fait que le modèle peut etre biologiquement faux loin des
valeurs expérimentales.

Tests Il existe également un test permettant de vérifier l’égalité d’une


pente observée à une pente théorique, et ainsi de vérifier si des données
expérimentales infirment ou non un modèle précédent. Le test est fait ainsi :
H0 : la pente réelle a et la pente théorique γ sont égales.
H1 : la pente réelle a et la pente théorique γ sont différentes.

La statistique à calculer est :

|â − γ|
tobs = q 2 ,
σ̂r
ns2X

38
Ce tobs est à comparer à un tseuil à n − 2 ddl.
Dans le cas γ = 0, on montrera au prochain cours que ce test est équivalent
au test du coeff de corrélation.
DIAPO 97 test conformite pente
Pour vérifier l’égalité de deux pentes réelles à partir de deux pentes me-
surées, le test se déroule ainsi :
H0 : les deux pentes réelles a1 et a2 sont égales.
H1 : les deux pentes réelles a1 et a2 sont différentes.

La statistique à calculer est :


|â1 − â2 |
tobs = r  ,
1 1
σ̂ 2 n1 s2X,1
+ n2 s2X,2

avec :
2 2
(n1 − 2)σ̂r,1
2
+ (n2 − 2)σ̂r,2
σ̂ = .
n1 + n2 − 4
On compare ce tobs à un tseuil à n1 + n2 − 4 ddl.

9 Comparaisons de modèles
DIAPOS 98-99 présentation problème marmottes.
On peut, comme dans l’ANOVA1, décomposer la variance dans la régression
linéaire, en se servant des valeurs prédites au lieu des moyennes des groupes
comme point intermédiaire :

n
X n
X
(yi − ȳ)2 = (yi − ŷi + ŷi − ȳ)2 (34)
i=1 i=1
n
X n
X
2
= (yi − ŷi ) + (ŷi − ȳ)2 (35)
i=1 i=1
SCEtot =SCEres + SCEy,x (36)
ns2Y =ns2r + ns2y,x (37)

La somme des carrés totale se décompose en une somme expliquée par


la régression et une somme résiduelle. Pour un modèle linéaire, la variabilité

39
se décompose en une part expliquée par la relation entre Y et X, et une
part résiduelle qui est indépendante de X. Cette somme résiduelle est, si l’on
regarde sa définition, la somme des carrés des résidus : il s’agit donc, à un
facteur près, du s2R vu au chapitre précédent !
De la même manière que pour une ANOVA 1 on définissait un rapport de
corrélation pour donner la part de variabilité totale expliquée par le facteur :
SCEinter
η2 = ,
SCEtot
on définit pour le modèle de régression linéaire la part de variabilité linéairement
expliquée par la variable X :
Pn 2
2 SCEy,x i=1 (ŷi − ȳ)
R = = n P 2
.
SCEtot i=1 (yi − ȳ)

Pn Pn
2 i=1 (ŷi − ȳ)2
i=1 (axi + b − (ax̄ + b))2
R = Pn 2
= Pn 2
(38)
i=1 (yi − ȳ) i=1 (yi − ȳ)
Pn 2 2
i=1 a (xi − x̄)
= P n 2
(39)
i=1 (yi − ȳ)
s2
R2 =a2 X . (40)
s2Y
sXY
Or, on a a = s2X
; en remplacant on obtient :
2
s2X s2XY

sXY
2
R = = = (rXY )2
s2X s2Y s2X s2Y
On a donc au final :
s2Y = s2y,x + s2r , avec

s2y,x = R2 s2Y et s2r = (1 − R2 )s2Y .


Le carré du coefficient de corrélation linéaire représente la variabilité de Y
expliquée par une relation linéaire. La variabilité résiduelle définie au chapitre
précédent à partir des résidus est inversement proportionnelle à R2 .
Si r = 0, toute la variabilité est résiduelle, les variations de X n’ont pas
d’influence linéaire sur les variations de Y : la connaissance de X ne
donne aucune information sur Y .

40
Si r = 1 ou r = −1, toute la variabilité est expliquée, et la relation entre
Y et X est linéaire : la connaissance de X permet de prédire exacte-
ment la valeur de Y .
Reprenons la formule du test de la pente quand γ = 0, ie savoir si une
pente observée est significativement différente de 0. Dans le cas où γ = 0,
en remplacant la variabilité résiduelle par la nouvelle formule obtenue plus
haut, on retrouve bien :
sXY
â s2X
q =r (41)
σr2 n
(1−r2 )s2Y
n−2
ns2X
ns2X
sXY
= q (42)
1
sX n−2
(1 − r2 )s2Y

sXY n − 2
= √ (43)
sX sY 1 − r 2

r n−2
=√ , (44)
1 − r2
qui est la formule donnée précedemment pour tester l’égalité de r à 0 dans le
cas du test du coefficient de corrélation. On voit bien que si on a pas trouvé
un r significativement différent de 0, on trouvera une pente égale à 0, ie pas
de relation entre Y et X.
Si l’on veut mettre en parallèle la décomposition employée dans l’ANOVA1
et dans la régression, on peut l’écrire ainsi :
DIAPO 100 decomposition variance
ANOVA 1 yij = µ + ai + eij
p ni p p ni
X X X X X
2 2
(yij − ȳ) = ni (ȳi − ȳ) + (yij − ȳi )2
i=1 j=1 i=1 i=1 j=1

SCEinter
SCEtot = SCEinter + SCEintra η 2 =
SCEtot
Modèle linéaire yij = axi + b + eij
p ni p p ni
X X X X X
2 2
(yij − ȳ) = ni (ŷi − ȳ) + (yij − ŷi )2
i=1 j=1 i=1 i=1 j=1

41
SCEy,x
SCEtot = SCEy,x + SCEres R2 =
SCEtot
Expliquer les variations de Y avec un modèle linéaire est moins général
qu’avec une ANOVA 1, car dans le cas de l’ANOVA 1 on n’impose pas la
contrainte que l’explication doit être linéaire.

⇒ La variabilité expliquée par le modèle linéaire est toujours inférieure


à celle expliquée par l’ANOVA 1.
⇒ R2 ≤ η 2 .
⇒ La quantité intéressante à étudier est la différence entre les moyennes
de classes ȳi et les estimations linéaires ŷi , qui sont les deux in-
termédiaires explicatifs.
Pour cela, on peut décomposer la variance inter-groupes de l’ANOVA1 à
l’aide des ŷi , pour savoir quelle part de la variabilité expliquée par l’ANOVA
est due à une explication linéaire :

p p
X X
2
ni (ȳi − ȳ) = ni (ȳi − ŷi + ŷi − ȳ)2
i=1 i=1
p p
X X
2
= ni (ȳi − ŷi ) + ni (ŷi − ȳ)2
i=1 i=1
SCEinter = SCEEcart + SCEy,x

On a donc au final, en remettant les formules ensemble :

p ni p p p ni
X X X X X X
2 2 2
(yij − ȳ) = ni (ȳi − ŷi ) + ni (ŷi − ȳ) + (yij − ȳi )2
i=1 j=1 i=1 i=1 i=1 j=1
(45)
SCEtot = SCEEcart + SCEy,x + SCEintra . (46)

Ou encore, en divisant tout par n et en remplacant chaque SCE par l’indice


explicatif correspondant :

s2Y = (η 2 − R2 )s2Y + R2 s2Y + (1 − η 2 )s2Y .

42
η 2 − R2 est l’indice de non-linéarité. C’est la proportion de la variabilité
expliquée par une ANOVA 1 et pas par la régression linéaire.
DIAPO 101 exemple graphique η et R.
η 2 = R2 L’ANOVA 1 et la régression linéaire expliquent la même pro-
portion de la variabilité globale : les données suivent bien un modèle
linéaire.
η 2  R2 L’ANOVA 1 explique beaucoup plus de variabilité que la régression
linéaire : le modèle linéaire ne correspond pas aux données, les varia-
tions de Y sont non-linéaires.
Attention, quel que soit le rapport entre η 2 et R2 , il ne faut pas oublier
que si η 2 est très faible, on a globalement peut d’effet de X sur Y .
On calcule les CM en divisant les SCE par leur nombre de ddl associés.
Les p − 1 ddl de la variance inter dans le cas de l’ANOVA 1 se retrouvent
décomposés en 1 ddl pour la régression (qui ne contient que 2 paramètres)
et p − 2 pour le reste. On a donc :
SCEy,x SCEEcart SCEres
CMy,x = CMEcart = CMres =
1 p−2 n−p
Le test de linéarité se fait suite à une ANOVA1 pour laquelle on a rejeté
H0 . Pour réaliser le test de linéarité, on va comparer les CMEcart et CMres
comme dans une ANOVA 1. Le test a la structure suivante :
H0 : La relation entre Y et X, si elle existe, est linéaire.
H1 : La relation entre Y et X, si elle existe, est non-linéaire.
On suppose par défaut une relation linéaire ; en effet le modèle linéaire est
plus simple qu’un modèle polynomial ou exponentiel. On calcule ensuite :
CMEcart
Fobs = ,
CMres
et cette valeur est comparée à une valeur seuil à (p − 2, n − p) ddl, comme
dans le cas de l’ANOVA 1.
Le test de linéarité ne peut pas être réalisé en dehors du cadre de l’ANOVA 1.
La procédure globale de test doit être la suivante :
1. Vérifier que les hypothèses sont réunies, et réaliser une ANOVA 1.
2. Si l’ANOVA 1 est significative (effet du facteur), faire le test de linéarité
pour savoir si l’effet est linéaire.

43
3. Sinon, s’arrêter : le facteur n’ayant pas d’effet, tester la linéarité de
l’effet n’a pas de sens.

Variabilité ddl SCE CM


Totale n−1 SCEtot
Résiduelle (intra) n−p SCEres CMres = SCEres /(n − p)
Inter p−1 SCEinter CMinter = SCEinter /(p − 1)
Expliquée 1 SCEy,x
Ecart p−2 SCEEcart CMEcart = SCEEcart /(p − 2)

Les 2 tests à effectuer à partir de ce tableau sont :


— Effet du facteur ? Fobs = CM inter
CMres
, Fseuil à (p − 1, n − p) ddl.
CMEcart
— Linéarité de l’effet ? Fobs = CMres , Fseuil à (p − 2, n − p) ddl.
DIAPOS 102-103-104 exemple final marmotte
DIAPO 105 pub BISM

44

Vous aimerez peut-être aussi