Règle de Sturges en biostatistique
Règle de Sturges en biostatistique
STATISTIQUE
I - STATISTIQUE DESCRIPTIVE
• tendance centrale
• dispersion
• distribution
• valeurs extrêmes
• temps
1 - Distribution de fréquences
Une distribution de fréquences liste les valeurs des données et les fréquences
correspondantes.
A définir :
1
Cours de biostatistique
Exemple :
28 30 18 19 21 24 20 27
25 35 16 24 26 20 25 28
30 26 25 28 33 18 31
Nb théorique de classes = 6
largeur des classes = (35 – 16)/6 = 3,166666666 ; donc classes de 3 côtes, mais il y
a un reste ; que faire ? Soit 6 classes avec un classe supérieure plus large (ouverte
sur le haut) ; soit 7 classes
n f
16-18 3
19-21 4
22-24 2
25-27 6
28-30 5
> 31 3
Total 23
2
Cours de biostatistique
n f n f
16-20 6 16-17 1
21-25 6 18-19 3
26-30 8 20-21 3
31-35 3 22-23 0
24-25 5
26-27 3
28-29 3
30-31 3
32-33 1
34-35 1
Total 23 Total 23
le Dotplot
3
Cours de biostatistique
le diagramme en bâton
le diagramme circulaire
le diagramme de dispersion
Contrôle 3,2 1,9 3,6 4,6 4,1 5,1 5,5 4,8 2,9 4,9
3,9 6,9 6,8 6,0 6,9 6,5 5,5 5,5 4,1 6,3
Irrigation 4,1 2,5 4,5 3,6 2,8 5,1 2,9 5,1 1,2 1,6
6,4 6,8 6,5 6,8 5,8 2,9 5,5 3,3 6,1 6,1
Irrigation et fertilisation 3,2 4,4 6,2 6,3 6,7 6,8 7,3 7,3 7,7 6,8
moyenne =
∑ x
n
4
Cours de biostatistique
Cas du plomb : (1,10 + 0,73)/2 = 0,915 ; cas avec une valeur supplémentaire de 0,66 :
0,73
∑ (ω .x) ω = coefficient
x=
ω ∑ ω = somme des coefficients
Symétrie / asymétrie
Symétrique
Mode
Moyenne Moyenne
Médiane Mode
Médiane
5
Cours de biostatistique
4 – Mesures de dispersion
4.1 - l’étendue
Facilité de calcul mais ne tien compte que des valeurs extrêmes ; or, les autres
mesures ont un rôle important.
4.2 - Ecart type = déviation moyenne des valeurs par rapport à la moyenne
s=
∑ (x − x) 2
ou s=
n ∑ ( x) 2 − ( ∑ x) 2
n− 1 n(n − 1)
- L’écart type est une mesure de dispersion qui prend en compte toutes
les valeurs autour de la moyenne ;
- Les valeurs de s sont en général >0 ; = 0 si toutes les mesures ont ^m
valeur ;
- Un grande valeur de s indique une grande dispersion ;
- Les valeurs de s augmentent qd on inclut des valeurs extrêmes ;
- Les unités de s sont les ^m que les unités des données originales.
6
Cours de biostatistique
Plusieurs files
n ∑ ( x ) é − (∑ x ) 2 3(12 + 3 2 + 14 2 ) − (18) 2 618 − 324 294
s= s= s= = = 49 = 7
n(n − 1) 3* 2 6 6
σ =
∑ (x − x) 2
N
c) - La variance
Variance d’un ensemble de valeurs est une mesure de la dispersion égale au carré de
l’écart type.
CV :
x σ
Echantillon : CV = x 100% Population : CV = 100%
µ
7
Cours de biostatistique
1ère étape : l’écart type mesure la dispersion entre les valeurs ; des valeurs proches
donneront un petit s ; des valeurs éloignées donneront un plus grand s
a b
2ème étape : l’observation de nombreuses dispersions montre que le plus souvent 95%
des valeurs d’échantillon sont éloignées de moins de 2 s de la moyenne
étendue
" s" =
4
ème
4 étape : interprétation d’une valeur connue de l’écart type, on utilise le minimum
« usuel » et le maximum « usuel » :
Minimum « usuel » = moyenne – 2 x écart type
Maximum « usuel » = moyenne + 2 x écart type
8
Cours de biostatistique
moyenne 6,41
écart type 1,28
minimum 3,20
maximum 8,00
étendue 4,80
"s" 1,20
minimum usuel 3,85
maximum usuel 8,97
5ème étape : règle empirique des 68-95-99,7 : dans le cas d’une distribution en
cloche (normale), la dispersion des valeurs autour de la moyenne est la suivante :
- Environ 68 % des valeurs sont situées à moins d’un écart type de la
moyenne (exactement 68,26 %)
- 95 % des valeurs sont situées à moins de 2 écarts types environ de la
moyenne (exactement 1,96 fois)
- 99,7 % des valeurs sont situées à moins de 3 écarts types environ de
la moyenne.
Ex : taille des femmes : La taille des femmes a une distribution normale avec une
moyenne de 163 cm et un écart type de 6 cm. Quel est le pourcentage de femmes
compris entre 145 cm et 181 cm ?
145 et 181 correspondent respectivement à – ou + 3 écart types de la moyenne :
163 - (3 x 6) = 145 et 163 + (3 x 6) = 181 ; donc, 99,7 % des femmes ont des tailles
comprises entre 145 cm et 181 cm.
9
Cours de biostatistique
Ex : un Jordan mesure 1,98 m (moyenne des hommes 1,75 m ; écart type 7,11 cm) ;
Lobo mesure 1,93 m (moyenne des femmes 1,61 m ; écart type 6,35 cm)
Qui est relativement plus grand ou plus petit ?
x− x x− µ
Echantillon : z = Population : z = Arrondir à 2 décimales
s σ
x − µ 1,98 − 1,75
Jordan : z= = = 3,23
σ 0,0711
x − µ 1,93 − 1,61
Lobo : z= = = 5,04
σ 0,0635
Les valeurs ordinaires ont donc un score-z < 2 ; les inhabituelles un score-z > 2
Valeurs ordinaires : -2 < score-z < 2
Valeurs inhabituelles : score-z < -2 ou score-z > 2
De la même manière que la médiane divise les données en deux parties égales, les
trois quartiles notés Q1, Q2 et Q3 partagent les données en 4 parties égales.
- Q1 = premier quartiles : sépare les premiers 25 % des données triées
des autres 75 %. Au moins 25 % des données triées sont inférieures
ou égales à Q1 et au moins 75 % des données sont supérieures ou
égales à Q1
- Q2 = deuxième quartile : même chose que la médiane ; sépare les
premiers 50 % des données triées des autres 50 %.
- Q3 = troisième quartile : sépare les premiers 75 % des données triées
des autres 25 %. Au moins 75 % des données triées sont inférieures
10
Cours de biostatistique
Ex : le percentile de la valeur 112 (cotinine) ; 112 est la 13ème valeur des données
triées, donc 12 valeurs inférieures, parmi 40 valeurs totales.
12
percentile de 112 = 40 = 30
40
17
percentile de 149 = 100 = 42,5, soit 43 Le niveau 149 est le 43ème percentile
40
6
percentile de 35 = 100 = 15, soit 15 Le niveau 35 est le 15ème percentile
40
Formule de calcul :
k
L= n si L est une valeur entière, la valeur du k-ième percentile est à mi
100
chemin entre la L-ième valeur dans le tableau et la suivante ; on trouve Pk en prenant
la demi-somme de la L-ième valeur et de la suivante ; si L est une valeur décimale, on
arrondit à la valeur supérieure.
68
L= 40 = 27,2
100 on arrondit à 28 ; donc le percentile 68 (P68) est la 28ème valeur
11
Cours de biostatistique
20
L= 40 = 8
P20 100 ; le percentile 20 est entre la 8 et la 9ème valeur, soit : 46
75
L= 40 = 30
P75 100 ; le percentile 75 est entre la 30 et la 31ème valeur, soit : 251,5
1
L= 40 = 0,4
P1 100 ; le percentile 1 est la valeur 1, soit 0
Q1 = P25
Q2 = P50
Q3 = P75
Suite ex 14 :
Distance InterQuartile
25
L= 40 = 10
Q1 = P25 ; 100 donc entre la 10 et 11ème valeur, soit 86,5
Etendue 10 – 90 %
12
Cours de biostatistique
10
L= 40 = 4
P10 100 donc entre la 4 et 5ème valeur, soit 10
90
L= 40 = 36
P90 100 donc entre la 36 et 37ème valeur, soit 289,5
13
Cours de biostatistique
II – STATISTIQUE INFERENTIELLE
1. – Introduction
Utilisation des données d’échantillon pour faire des inférences sur les paramètres
de la population :
- pour estimer la valeur d’un paramètre d’une population
- pour tester une hypothèse sur la population
On sait que dans un échantillon, chaque individu produit une valeur différente des
autres individus ; d’autre part, des échantillons différents donnent naturellement
des résultats différents. On suppose que ces différences sont dues au hasard
plutôt qu’à un autre facteur. (cela suppose que les individus et les échantillons sont
aléatoires).
Estimation ponctuelle
Si on veut estimer la proportion d’une population avec la seule valeur p’, la meilleure
estimation de p est p’ ; dans ce cas, l’estimation est dite ponctuelle.
Une estimation ponctuelle est une valeur unique utilisée pour approximer le
paramètre d’une population.
14
Cours de biostatistique
Pour construire les IC, on s’appuie sur la loi normale qui permet de mesurer
pour une aire donnée (quantité d’observation), les limites entre les valeurs
contenues dans l’aire choisie et celles qui ne le sont pas. On appelle « valeurs
critiques » ces limites.
Intervalle de confiance
1-α
α /2
α /2
- Z α /2 Z =0 Z α /2
Valeurs critiques
- Dans le cas d’une distribution normale ;
15
Cours de biostatistique
La valeur qui sépare la région centrale de la queue droite est notée zα/2 et se nomme
valeur critique (la valeur qui sépare la région centrale de la queue gauche est
nommée -zα/2
Une valeur critique est un nombre sur la frontière qui sépare les statistiques
d’échantillon qui peuvent vraisemblablement survenir de celles qui ne le peuvent
pas.
La valeur critique zα/2 est un score-z et délimite des aires de α/2 pour la loi
normale.
Ex. Lecture d’une table de distribution normale pour trouver les valeurs critiques
qui correspondent à 90 %, 95 %, 99 % et 99,9 %.
Exemple : IC à 95 %
Intervalle de confiance à 95 %
α /2 = 0,025
α /2 = 0,025
- Z α /2 = - 1,96 Z =0 Z α /2 = 1,96
16
Cours de biostatistique
Marge d’erreur
Quand des données d’échantillon aléatoire simple sont utilisées pour estimer la
proportion p d’une population, la marge d’erreur (E), est la différence maximale
probable entre la proportion de l’échantillon p’ et la vraie valeur de la proportion p
de la population.
p'. q'
E = zα /2
n
Exercice :
Mendel croise des pois à gousses vertes et des pois à gousses jaunes et obtient
580 graines dont 428 vertes et 152 jaunes. Mendel s’attendait à trouver 25 % de
jaunes. Le résultat obtenu est-il différent du résultat théorique ?
Recherche de l’IC à 95 %
0,262 x 0,738
E = 1,96 = 0,035787
580
p' − E < p < p' + E 0,262 − 0,035787 < p < 0,262 + 0,035787
Ou 0,262 ± 0,036
17
Cours de biostatistique
Exercices :
lim ite sup érieure − lim ite inf érieure 0,280 − 0,220
E = = = 0,030
2 2
lim ite sup érieure + lim ite inf érieure 0,704 + 0,604
p' = = = 0,654
2 2
300
solution : p' = 400 = 0,75, soit 75% ; donc q ' = 25%
18
Cours de biostatistique
Cas théorique puisque si σ ne peut être connu que si la moyenne est connue. Mais on
considère que σ est connu car la population est de grande taille et parfaitement
normale.
Comme précédemment, la meilleure estimation de la moyenne de la population est
celle de l’échantillon avec une marge d’erreur que l’on peut déterminer à l’aide de la
formule :
σ
E = zα /2
n
x− E< µ < x+ E
[ x − E ; x + E] ou x ± E
b) - la marge d’erreur :
σ 0,34
E = zα /2 = 1,96 = 0,06472649
n 106
Loi t pour n = 15
Loi t pour n = 5
Valeur critique tα /2
x− E< µ < x+ E
[ x − E ; x + E] ou x ± E
s 0,34
E = tα /2 = 1,984 = 0,06551906
n 106
Ici, pas de différence entre l’utilisation de la loi normale ou de la loi de Student car
n est grand ; mais plus n est petit, et plus la marge d’erreur sera grande, donc plus
l’IC sera grand.
21
Cours de biostatistique
Exercices :
1 – Le rendement d’épis de maïs en kg/ha est estimé à partir d’un échantillon de 11
placettes. Les valeurs correspondant à des graines séchées au four sont les
suivantes :
2134 ; 2170 ; 2142 ; 2799 ; 2364 ; 2199 ; 2310 ; 1620 ; 1808 ; 1476 ; 1695
a) Vérifier la distribution est normalement distribuée
b) Construire un intervalle de confiance à 95%
c) Comparez les résultats à l’IC trouvé pour des graines qui ne sont pas séchées au
four (séchage à l’air) : 1611,3 < m < 2071,17
Solution :
a) vérification que la distribution est normalement distribuée par l’histogramme
des fréquences
b) Moyenne = 2065,18
Ecart type = 384,15
E = 258,062
µ ± E = 2065,2 ± 258,06
1807,12 < µ < 2323,24
c) On est sûr à 95 % que l’intervalle [1807,12 ; 2323,24] contient la vraie valeur
de la moyenne du rendement d’épis de maïs séchés au four.
d) Les intervalles se chevauchent ; donc il n’y a pas de différence entre les deux
résultats et les deux traitements.
22
Cours de biostatistique
Définition de l’hypothèse.
L’hypothèse nulle : H0 est l’affirmation que la valeur d’un paramètre est égale à une
certaine valeur supposée : ex. la température du corps humain est de 37°C.
H0 : µ = 37°C
On teste H0 directement au sens où on suppose qu’elle est vraie et où on arrive à
une conclusion qui soit rejette H0, donc infirme l’hypothèse, soit ne peut pas
rejeter H0, donc ne l’infirme pas mais ne la confirme pas non plus.
Ex : cas de la température du corps humain : je formule l’hypothèse que la
température est de 37°C ; c’est mon hypothèse nulle H0 : µ = 37°C. Par l’étude de
l’intervalle de confiance avec n = 106, je montre que la température n’est pas de
37°C, mais de 36,72 à 36,84 avec 95% de niveau de confiance. Mon test infirme
H0 ; on rejette l’hypothèse nulle et on peut dire que la température n’est pas de
37°C.
Mais en mesurant la température d’une seule personne, en admettant que je trouve
une température sup ou égale à 37°C, alors je ne peux plus infirmer l’hypothèse,
mais je ne la confirme pas non plus, car d’autres hypothèses ont pu rendre
l’évènement probable (échantillon trop faible, individu malade, normalement
hyperthermique, …)
Ce raisonnement qui infirme l’hypothèse dans le cas où on rejette H0 mais qui ne la
confirme pas quand on ne peut pas rejeter HO est qualifié de « raisonnement
dissymétrique de la statistique »
L’hypothèse alternative est l’affirmation que le paramètre a une valeur qui diffère
de celle de l’hypothèse nulle : Ha : µ > 37 ; µ < 37 ; µ ≠ 37
23
Cours de biostatistique
Dans la formulation de H0, le plus simple est de toujours retenir l’hypothèse qui
contient l’égalité :
Cas de la proportion de pois jaune égale à 25 % : p = 0,25 ; si p = 0,25 est fausse,
alors p ≠ 0,25 ; Ha est celle qui ne contient pas d’égalité : p ≠ 0,25 et H0 celle qui
contient l’égalité : p = 0,25.
Cas de la taille moyenne égale au plus à 183 cm : µ ≤ 183 ; si µ ≤ 183 cm est fausse,
alors µ > 183 ; Ha : µ > 183 et H0 : µ = 183
Cas de écart type > 6 cm : σ > 6 ; si σ > 6 est fausse alors σ ≤ 6 ; Ha : σ > 6 et H0 : σ
= 6 cm
Xobs. − µ
k=
σ
Exercice :
24
Cours de biostatistique
14,3 − 10
k1= = 1,44 NS
5
20,1 − 10
k2 = = 2,02 *
5
− 7,5 − 10
k3 = = 3,5 ***
5
x− µ
k=
σ
n
Cas de la température du corps humain. Moyenne de l’échantillon de 106 personnes =
68,78°C, σ = 0,34°C et µ = 37°C.
x− µ 36,78 − 37
k= k= = 6,66
σ soit 0,34
n 106
25
Cours de biostatistique
On calculera l’écart réduit suivant que l’on comparera aux valeurs de la table t de
Student (échantillon de taille réduite et non plus population répondant à la loi
normale) :
X1− X 2
t=
s12 s 22
+
n1 n2
26
Cours de biostatistique
Application :
121,89 − 104,83
t= = 1,947
32,66 2 33,32 2
+
71 18
Exercice : Des truites sont mesurées sur deux échantillons. Le premier échantillon
composé de 50 truites d’élevage présente une moyenne X a = 158,86 mm et une
variance s a = 37,18 mm2. Le second échantillon composé de 67 truites de rivière a
2
Solution : 1 – formulation de H0 : X a = X b
2 – calcul de t
158,86 − 134,46
t= = 22,9
37,18 2 25,92 2
+
50 67
Le t de la table est dépassé au seuil de 0,001 ; donc on rejette HO, les deux
moyennes sont différentes de moyennes très hautement significatives.
27
Cours de biostatistique
Dans le cas de l’étude de l’effet des ETM sur la longueur des racines, nous avons 10
échantillons correspondant à 10 traitements. La comparaison des traitements 2 à 2
est, d’une part fastidieuse car il faut effectuer 45 comparaisons, mais d’autre part
elle est erronée car il est nécessaire d’estimer l’effet du traitement sur l’ensemble
des 10 échantillons afin de tester l’hypothèse nulle avant de comparer les
traitements deux à deux.
∑ ( xi − X )
2
SC T = T
28
Cours de biostatistique
SCr = ∑ ( XA − X A) 2 + ∑ ( XB − X B ) 2 + ........ + ∑ ( XZ − X Z ) 2
B – Décomposition de la variance :
Les valeurs de ces trois variations dépendent des effectifs des groupes ; on
détermine la variance en divisant la variation par le nombre de degré de liberté.
SCT
Variance totale : CMT =
NT − 1
SCg
Variance inter-groupe : CMg = ; (k = nombre de traitements)
k−1
SCr
Variance résiduelle : CMr = N − k ; (N-k = nombre de valeurs totales – nombre de
traitements)
CMg
F=
CMr
Si CMg est grand devant CMr, alors F est grand ; la variation entre groupe est plus
élevée que celle à l’intérieur des traitements et il est possible qu’au moins un
traitement n’appartienne pas à la même population de résultats que les autres
traitements ; en d’autres termes, l’H0 est rejetée et on conclura à un effet du
traitement sur la longueur racinaire.
Si CMg est petit devant CMr, alors F est petit ; il est moins probable qu’au moins un
des traitements n’appartienne pas à la même population de résultats que les autres ;
29
Cours de biostatistique
l’H0 ne peut pas être rejetée et l’on n’aura pas mis en évidence un effet du
traitement. Cela ne veut pas dire qu’il n’y a pas d’effet, mais dans les conditions de
l’expérience, nous n’avons pas mis en évidence de différence.
La valeur F est lue dans la table de Snedecor avec les degrés de liberté (k-1) = ddl
inter et (N-k) ddl intra.
Si F calculé < F lu, alors on ne peut pas rejeter H0 ; on n’a pas mis en évidence
d’effet du traitement.
Si F calculé > F lu, alors on rejette H0 ; le traitement peut expliquer les différences
observées entre deux ou plusieurs niveaux de traitement.
D - Tableau de synthèse
Source de Somme des carrés des écarts Nb Variances F
variation de
ddl
Inter- SCg = nA( X A − X T ) 2 + nB ( X B − X T ) 2 + ... + nZ ( X Z − X T ) 2 k-1 SCg CMg
CMg = F=
groupe k−1 CMr
Résiduelle SCr = ∑ ( XA − X A) 2 + ∑ ( XB − X B ) 2 + .. + ∑ ( XZ − X Z ) 2 N-k
CMr =
SCr
N− k
Totale
∑ ( xi − X ) N-1
2
SCT = T
H0 : les moyennes des longueurs racinaires aux différents traitements sont égales
F à 5% = 1,97
F à 1% = 2,59
F à 0,1% = 3,44
E - Mise en évidence d’une toxicité par comparaison des moyennes deux à deux.
30
Cours de biostatistique
Dans le cas d’un rejet de l’hypothèse nulle, on sera autorisé à effectuer des
comparaisons deux à deux des moyennes aux différents niveaux de traitement, afin
notamment, de décider à partir de quelle valeur la concentration en ETM est
toxique = l’effet d’inhibition de croissance racinaire est significatif.
Exercice 7 : après le test F, comparer deux à deux les moyennes des échantillons
afin de mettre en évidence le seuil de toxicité de l’ETM considéré.
test a posteriori traitement 0 6,25 12,5 25 50 100 200 400 600 800
moyenne 121,887 104,833 126,026 126,386 142,500 136,737 136,556 111,481 124,360 134,042
écart type 32,663 33,322 22,740 29,153 35,982 31,731 36,433 43,004 47,012 42,538
n 71 18 19 22 24 19 27 27 25 24
variance 1066,851 1110,382 517,124 849,903 1294,696 1006,871 1327,333 1849,336 2210,157 1809,520
t 1,947 0,637 0,614 2,482 1,801 1,831 1,139 0,243 1,278
t 0,5 1,986 NS NS NS * NS NS NS NS NS
t 0,1 2,626
t 0,01 3,402
31
Cours de biostatistique
Les tests d’hypothèses sur les fréquences sont utilisés pour des données nominales
(qualitatives) et pour les données numériques (quantitatives) regroupées en classes.
ddl = 10
ddl = 20
32
Cours de biostatistique
Non rejet de H0
Rejet de H0
χ2
4.1 - Test d’ajustement : test d’hypothèses que la différence entre les résultats
observés et les résultats théoriques est lié au hasard dans le cas d’une seule
modalité.
Tableau de la forme :
Colonne Colonne j Total
i
1 1 n1
. . .
. . .
i j ni
total ci cj T
ni x c j
On calcule les fréquences théoriques ft ij =
T
( foij − ft ij ) 2
Puis le χ 2
= ∑ ft ij
pour un ddl =(nb de lignes -1) (nb de colonne – 1)
Placebo Médicament
Céphalées 19,5349 22,4651
Nausées 7,4419 8,5581
Somnolence 6,9767 8,0233
Fatigue 6,0451 6,9535
34
Cours de biostatistique
2
χ = 1,188
Pour un seuil de signification de 95 %, χ2 de la table = 7,82 χ2 calculé < χ2
table, donc on ne rejette pas l’hypothèse nulle, on ne montre pas de différence
significative entre les f observées et les f théoriques ; il est vraisemblable que
le médicament n’a pas d’effets secondaires.
35