Estimation
Z. Serhier
LIM,FMPC
Introduction
• En pratique : observations faites sur un échantillon
• Vraie valeur du paramètres dans la population : inconnue
• L’estimation vise à calculer, à partir des observations, la vraie
valeur du paramètre
• Tenir compte des fluctuations d’échantillonnage estimation
par intervalle
Fluctuation d’échantillonnage
Soit un ensemble de sujets = Pop (exemple Population de
Casablanca)
P : % vrai de diabétiques
●●
●● ●●● Si tirage répété,
●●●● dans quelles limites
●● va fluctuer pe ?
●●●●
●
●●
Estimation
Inversement, à partir d’un Échantillon : pe connu
=== P= ?
Sondage
P
●●
p ●●
●●
●●
●●
●●●●
●●
●●●●
Estimation d’une moyenne
sur un échantillon, on pressent que :
• valeur observée : peu de chances = la valeur inconnue
• valeur observée : néanmoins proche si échantillon est
représentatif
• en répétant l’échantillonnage, on trouverait d’autre valeurs,
toutes assez proches les unes des autres.
but de l’estimation = calcul des bornes qui permettent de
situer avec une confiance suffisamment grande où se trouve
la valeur inconnue du paramètre dans la population
Une estimation un «intervalle de confiance »
Fluctuation d’échantillonnage
• Si l’échantillon est représentatif de la population, nous
espérons que m1 observée est assez proche de la valeur
μ inconnue
• Si deuxième échantillon de même taille : on obtient alors
une deuxième valeur moyenne m2, différente de m1
m1 m3 m2
μ inconnue
Théorème central limite
• Si on disposait de la totalité des échantillons possibles tirés
dans la population : pour chaque échantillon, nous obtiendrons
une moyenne µ
m
mmm
mmmmm
mmmmmmmmmm
mmmmmmmmmmm
mmmmmmmmmmmmmmm
mmmmmmmmmmmmmmm
mmmmmmmmmmmmmmmmmmmm
m m m m m m m m m m m1 m3 m m2 m m m m m m m m m
µ
Théorème central limite
1. la moyenne d’une variable quantitative calculée sur un
échantillon est elle-même une variable aléatoire. Elle varie
selon les échantillons
2. cette variable suit une loi normale*
3. cette loi normale est centrée sur la moyenne μ de la
population
Rappel : Loi normale (Variable quantitative
continue)
1) Les 3 mesures de tendance centrale sont égales
2) l'aire contenue entre les 2 points d'inflexion de la courbe
mesure la probabilité que les valeurs de x soient comprises
entre -1 écart type et + 1 écart type autour de la moyenne
cette probabilité est de 68 %
3) l'aire contenue entre -1,96 écart type et +1,96 écart type
autour de la moyenne représente une probabilité de 95 %
5 % des valeurs sont extérieures à l'intervalle de 1,96
écart types autour de la moyenne (2,5% à gauche et 2,5% à
droite)
Loi normale
l'aire contenue entre -1,96 l'aire contenue entre les 2 points
écart type et +1,96 écart d'inflexion de la courbe mesure la
probabilité que les valeurs de x
type autour de la moyenne soient comprises entre -1 écart
cette probabilité est de 95% type et + 1 écart type autour de
la moyenne cette probabilité est
de 68%
Loi normale centrée réduite
Loi normale de moyenne=0 et écart-type=1
1) x' = x-µ => centrer la distribution
2) z =( x-µ)/s
Variable centrée réduite Z
x : variable normale
µ : moyenne de la variable x
s : écart type de la variable x
propriétés :
95 % des valeurs de Z sont comprises entre -1,96 -2
et + 1,96 +2
Loi normale centrée réduite
-1,96 +1,96
Écart type de la moyenne
• Puisque la moyenne d’un échantillon est elle-même une
variable aléatoire, on peut en calculer son écart type
• On démontre que l’écart type de la moyenne m peut être
estimé par la valeur
S
Sm
n
S : écart type des valeurs de l’échantillon
n : taille de l’échantillon
Intervalle de confiance d’une moyenne
•On doit estimer un intervalle qui a une grande probabilité
de contenir la moyenne inconnue µ
• On démontre (grâce au théorème central limite ) qu’il y a
95 % de chances que la moyenne µ de la population se
trouve comprise dans l’intervalle compris entre :
m – 1,96 x Sm et m + 1,96 x Sm
𝑆2 𝑆2
𝑚 − 1,96 et 𝑚 + 1,96
𝑛 𝑛
Condition d’application
Taille de l’échantillon supérieure ou égale à 30
NB : si tel n’est pas le cas, le terme 1,96 devrait être
remplacer par une valeur choisie dans la table T de Student
(n-1 ddl)
𝑆2
𝑚 ± 𝒕(𝒏−𝟏,𝜶)
𝟐 𝑛
Table de Student
Interprétation IC d’une moyenne
• l’intervalle de confiance à 95% d’une moyenne µ
=> bornes entre lesquelles on estime sa position
• On ne connaît pas avec exactitude sa vraie valeur, mais
on peut dire qu’on a 95 chances sur 100 que cet intervalle
comporte la vraie valeur
Application
Lors d’une enquête sur la durée de sommeil des enfants de 2
à 3 ans effectuée sur un échantillon de 540 enfants d’une
préfecture on a trouvé une moyenne du temps de sommeil
par nuit de 11,7 heures. L’écart type est 1,3 heures.
Quelle est la moyenne générale du temps de sommeil chez
tous les enfants de la préfecture ?
Solution
L’écart type de la moyenne est :
1,3
Sm 0, 056
540 heures
L’intervalle de confiance à 95% est :
11,7 1,96 x 0,056 = 11,7 0,11 heures
La moyenne du temps de sommeil est donc comprise entre
11,6 et 11,8 heures
Estimation d’un pourcentage
• Même raisonnement pour une moyenne
On démontre que :
• un pourcentage observé sur un échantillon est lui
même une variable aléatoire. Il varie selon les
échantillons
• cette variable suit une loi normale
• cette loi normale est centrée sur le pourcentage P de
la population
Écart type d’un pourcentage
• Puisqu’un pourcentage calculé sur un échantillon est lui-
même une variable aléatoire, on peut en calculer son écart
type
• On démontre que l’écart type du pourcentage p peut être
estimé par la valeur suivante :
pe (1 pe )
Sp
n
Intervalle de confiance d’un pourcentage
• On doit estimer un intervalle dans lequel le pourcentage
inconnu P a la plus grande probabilité de se trouver
• On démontre (grâce au théorème central limite) qu’il y a
95 % de chances que le pourcentage P de la population se
trouve compris dans l’intervalle compris entre :
pe – 1,96 x Sp et pe + 1,96 x Sp
𝑝𝑒(1 − 𝑝𝑒)
𝑝𝑒 ± 1,96
𝑛
Conditions d’application
• Taille de l’échantillon doit être suffisamment grande
• Si on appelle pi et ps les bornes inférieures et supérieures
de l’intervalle de confiance (calculées comme si les
conditions étaient remplies), il faut que les termes
npi, nps, n(1-pi), n(1-ps) soient supérieurs ou
égaux à 5
Si l’un de ces termes est inférieur à 5, l’intervalle de
confiance ne serait pas valide recours à la loi
binomiale
Application
Lors d’une enquête sur la durée de sommeil des enfants de
2 à 3 ans effectuée sur un échantillon de 540 enfants d’une
préfecture on a trouvé 86 enfants présentant des troubles du
sommeil
Quelle est la proportion de troubles du sommeil chez tous les
enfants de la préfecture ?
Solution
La proportion d’enfants présentant des troubles du sommeil
dans l’échantillon est de 86/540 = 15,9%
L’écart type Sp est : 0,159 (1 0,159)
0, 016
540
l’intervalle de confiance à 95% est :
0,159 1,96 x 0,016 = 0,159 0,031
= 15,9% 3,1%
la proportion d’enfants présentant des troubles dans cette
préfecture est donc comprise entre 12,8% et 19,0%
Conditions?
Interprétation de l’intervalle de confiance
• L’intervalle de confiance à 95% d’un pourcentage P nous
indique les bornes entre lesquelles on estime sa position
• l’IC a 95 chances sur 100 de comporter la vraie valeur
• Il y a 5 chances sur 100 pour que P soit à l’extérieur de
cet intervalle
Risque d’erreur consentie
• Nous avons jusqu’à présent estimé une moyenne ou un
pourcentage inconnu avec un intervalle de confiance à 95 %,
c’est à dire avec un risque d’erreur de 5 %
• On appelle ce risque d’erreur, risque
• Il ne serait pas raisonnable de choisir un risque d’erreur plus
élevé, mais rien ne nous empêche de choisir un risque
moindre
• Il faudrait alors remplacer le nombre 1,96 dans les formules
par une autre valeur
Risque d’erreur consentie
La correspondance entre le risque consenti et ces valeurs
sont fournies par la table de la loi normale centrée réduite
Pour chaque valeur du risque , il existe une valeur Z.
|Z/2|
20% 1,28
10% 1,65
5% 1,96
2% 2,33
1% 2,58
Les formules d’intervalle de confiance d’une moyenne et
d’un pourcentage peuvent être généralisées ainsi
Moyenne : μ = m± Z/2 Sm (n≥30)
Pourcentage : P= pe± Z/2 Sp
Exemple
Un enquêteur prudent serait tenté de choisir un risque
faible, 1 % au lieu de 5%
Il voudrait obtenir un intervalle de confiance à 99 %
d’une moyenne ou d’un pourcentage
on a respectivement :
μ = m 2,58 Sm ou p = pe 2,58 Sp
cet intervalle de confiance à 99 % est plus large que
celui à 95 %
Cet enquêteur prudent a donc moins de chance de se
tromper, mais il fournit une estimation moins précise
Conclusion
• Estimation se fait par intervalle de confiance
• le choix d’un risque d’erreur faible se paye du prix d’un
intervalle de confiance plus large, donc d’une estimation
moins précise
• Le consensus général adopté par l’ensemble de la
communauté scientifique est de présenter des intervalles de
confiance de 95 %