0% ont trouvé ce document utile (0 vote)
9 vues38 pages

Introduction à la modélisation probabiliste

Ce chapitre introduit les concepts fondamentaux de la modélisation probabiliste et de la statistique inférentielle. Il présente les notions de variables aléatoires, d'estimation par échantillonnage, de loi normale et d'intervalle de fluctuation.
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
9 vues38 pages

Introduction à la modélisation probabiliste

Ce chapitre introduit les concepts fondamentaux de la modélisation probabiliste et de la statistique inférentielle. Il présente les notions de variables aléatoires, d'estimation par échantillonnage, de loi normale et d'intervalle de fluctuation.
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Chapitre 2

Introduction à la modélisation probabiliste et à la


Statistique inférentielle

[Link]@[Link]
Plan

1 Introduction

2 Variables aléatoires

3 Estimation par échantillonnage

4 Loi Normale, TLC et intervalle de uctuation

Adrien Mazoyer Introduction à la Statistique 2 / 38


Objectif du chapitre

Exemple de contexte
On suppose s'intéresser à une mesure sur notre population, et on souhaite
évaluer la moyenne X de ces mesures. Par exemple
Mensurations moyennes (taille, poids, etc.) d'une population

Proportion de gens ayant l'intention de voter

...

Problème : la population est bien trop grande pour eectuer toutes les
mesure et X demeure donc inconnue.

On recourt alors à un échantillon de la population totale

Armation :  X devrait être proche de la valeur calculée sur l'échantillon.

But du chapitre : découvrir le cadre



mathématique permettant de justier le choix de
cette estimation.
Adrien Mazoyer Introduction à la Statistique 3 / 38
La statistique inférentielle en 2 mots

La statistique inférentielle constitue l'ensemble des méthodes pour transposer


de manière pertinente les conclusions de l'échantillon vers la population.

Population
Échantillonnage Échantillon
totale

Étude de
l'échantillon

"Conclusion"
Statistique Résultat sur
sur la
inférentielle l'échantillon
population

Adrien Mazoyer Introduction à la Statistique 4 / 38


Plan

1 Introduction

2 Variables aléatoires

3 Estimation par échantillonnage

4 Loi Normale, TLC et intervalle de uctuation

Adrien Mazoyer Introduction à la Statistique 5 / 38


Qu'est ce que c'est l'aléatoire ?

Expérience à caractère déterministe


La mesure ne varie pas ou très peu lorsque l'on répète l'expérience :

Mesurer la température d'ébullition de l'eau dans sa cuisine ;

Conduire seul sur une ligne droite à 50 km/h et mesurer la distance eectuée
en 1h ;

Expérience à caractère aléatoire


La mesure varie susamment pour être dicile à prévoir

Lancé de pièce, jet de dés, jeux de cartes (+simple) ;

Nombre de 'e ' dans un mot pris au hasard ;

Groupe sanguin d'un individu pris au hasard ;

Expériences scientiques

→ bruit (précision de la mesure, contrôle des conditions initiales, etc.) et


échantillonnage.

Adrien Mazoyer Introduction à la Statistique 6 / 38


Dénition

Dénition (Variable aléatoire)


Une variable aléatoire est une grandeur dont la valeur est liée au résultat d'une
expérience aléatoire.

En particulier
Les mesures X1 , . . . , Xn obtenues selon la méthode d'échantillonnage de la diapo
4 vont varier d'un échantillon à l'autre.

⇒ X1 , . . . , Xn sont des variables aléatoires.

Adrien Mazoyer Introduction à la Statistique 7 / 38


Caractériser une variable aléatoire
Pour faciliter l'intuition, on ne considérera ici que des variables aléatoires nies,
càd une variable aléatoire (v.a.) dont le nombre de valeurs possibles est ni.

Dénition (Loi d'une v.a. nie)


Soient m1 , . . . , mr les valeurs possibles pour une v.a. nie X . Exprimer la loi de X
revient à donner les probabilités d'occurrence pour chaque mi , notées P [X = mi ].
m1
On peut représenter la loi de X 1
]
m
avec un arbre de probabilité =
X
P[ ] m2
= m2
On a par ailleurs que P [X
.
.
.
P [X = m1 ]+· · ·+P [X = mr ] = 1 .
.
P [X .
=m
P[ r −1
]
X
=
m mr−1
r]

mr
Adrien Mazoyer Introduction à la Statistique 8 / 38
Caractériser une variable aléatoire

Dénition (Fonction de répartition)


La fonction de répartition FX d'une v.a. X est une fonction à valeurs dans [0;1] et
dénie pour x∈R par
FX (x) = P [X ≤ x]
En particulier, on peut remarquer que pour une v.a. X nie.

FX (mj ) = P [X = m1 ] + · · · + P [X = mj ]

1.00

0.75
Remarques
On peut faire le rapprochement avec
FX(x)

0.50
le calcul des fréquences cumulées
0.25 d'une variable quantitative discrète
(voir diapo 7 Chap. 1)
0.00
0 2 4
x

Adrien Mazoyer Introduction à la Statistique 9 / 38


Caractériser une variable aléatoire

Dénition (Espérance d'une v.a.)


L'espérance d'une v.a. nie X, est la moyenne des modalités de X pondérées par
leur probabilité d'occurrence. Elle est notée notée E [X] et s'expriment donc

E [X] = m1 P [X = m1 ] + · · · + mr P [X = mr ]

où m1 , . . . , m r les modalités possibles pour X.

Remarques
On peut faire le rapprochement avec le calcul d'une moyenne d'une variable
quantitative discrète (voir diapo 17 Chap. 1)

Plus généralement, si f est un fonction, on peut dénir

E [f (X)] = f (m1 )P [X = m1 ] + · · · + f (mr )P [X = mr ]

Adrien Mazoyer Introduction à la Statistique 10 / 38


Caractériser une variable aléatoire

Dénition (Variance et écart-type d'une v.a.)


La variance d'une v.a. nie X, est dénie par

h i
2
V [X] = E (X − E [X])
2
= E X 2 − E [X]
 

L'écart-type σ [X] est déni comme étant la racine-carrée de V [X].

Remarque
On peut faire le rapprochement avec le calcul de la variance d'une variable
quantitative discrète (voir diapos 24-25 Chap. 1)

Adrien Mazoyer Introduction à la Statistique 11 / 38


Caractériser une variable aléatoire

Dénition (Quantile d'une v.a.)


Le α-quantile d'une v.a. X est la valeur QX (α) telle que

P [X ≤ QX (α)] = α

En particulier, cette valeur vérie que FX (QX (α)) = α.

0.75 On peut trouver le quantile sur le


tracé de la fonction de répartition.
FX(x)

0.25

0
0 QX ( α) 2 4
x

Adrien Mazoyer Introduction à la Statistique 12 / 38


Plan

1 Introduction

2 Variables aléatoires

3 Estimation par échantillonnage

4 Loi Normale, TLC et intervalle de uctuation

Adrien Mazoyer Introduction à la Statistique 13 / 38


Étude d'une population

L'étude exhaustive (càd sur toute la population) d'une caractéristique est


généralement impossible. On eectue alors l'étude sur un échantillon de la
population.

Dénition (Échantillon)
Un échantillon est un sous-ensemble de la population.

On souhaite que l'échantillon soit représentatif de la population ⇒ tirage


aléatoire parmi la population.

⇒ Expérience aléatoire : transposer directement les résultats de l'échantillon à


la population totale est généralement faux (voir Chap. 3-5) !

Adrien Mazoyer Introduction à la Statistique 14 / 38


Exemple

Échantillonnage classique
1 On choisit un individu complètement au hasard dans la population, et on
appelle X1 la valeur de la quantité qui nous intéresse.

2 Indépendamment du 1er tirage, on choisit un nouvel individu


complètement au hasard dans la population, et on appelle X2 la valeur de la
quantité qui nous intéresse.

3 Indépendamment des 2 premiers tirages, on choisit un nouvel individu


complètement au hasard dans la population, et on appelle X3 la valeur de la
quantité qui nous intéresse.
.
.
.

n Indépendamment des n−1 premiers tirages, on choisit un nouvel


individu complètement au hasard dans la population, et on appelle Xn la
valeur de la quantité qui nous intéresse.

⇒ (X1 , . . . , Xn ) sont des variables aléatoires indépendantes entre elles.

Adrien Mazoyer Introduction à la Statistique 15 / 38


Variables indépendantes

Dénition (Variables indépendantes)


Soient X et Y deux v.a., et notons m1 , . . . , mp les valeurs possibles pour X et
b1 , . . . , bq les valeurs possibles pour Y .
On dit que X et Y sont indépendantes si et seulement si pour tout i = 1...p et
tout j = 1...q

P [X = mi et Y = bj ] = P [X = mi ] P [Y = bj ]

En d'autres termes si et seulement si la loi de X ne dépend pas de celle de Y et


inversement.

Adrien Mazoyer Introduction à la Statistique 16 / 38


Variables indépendantes

Soient X et Y deux v.a., et a, b des réels quelconques non-aléatoires.

Espérance
On a toujours
E [aX + bY ] = aE [X] + bE [Y ]
Si X et Y sont indépendantes, alors

E [XY ] = E [X] E [Y ]

Variance
Si X et Y sont indépendantes, alors

V [aX + bY ] = a2 V [X] + b2 V [Y ]

Adrien Mazoyer Introduction à la Statistique 17 / 38


Variables identiquement distribuées

Distribution identique
On supposera tout du long de ce cours que les variables X1 , . . . , Xn sont
identiquement distribuées, c'est-à-dire qu'elles suivent toutes la même loi.

En particulier elles ont toutes la même espérance

E [X1 ] = · · · = E [Xn ]

et même variance
V [X1 ] = · · · = V [Xn ]

Des variables aléatoires Indépendantes et Identiquement Distribuées sont dîtes


i.i.d..

Adrien Mazoyer Introduction à la Statistique 18 / 38


Moyenne d'échantillon
Rappel du contexte
On suppose s'intéresser à une mesure sur notre population, et on souhaite
estimer la moyenne X de ces mesures.

On dispose pour cela d'un échantillon Xn = (X1 , . . . , Xn ) de mesures


obtenues aléatoirement et indépendamment les unes des autres dans la
population.

On estime X par la moyenne d'échantillon

1
Xn = (X1 + · · · + Xn )
n
Remarques importantes
C'est la même formule que pour X , mais restreint aux valeurs de l'échantillon.
L'échantillon Xn = (X1 , . . . , Xn ) est le résultat d'une expérience aléatoire

Xn change d'un échantillon à un autre.

⇒ /!\ Xn est une v.a. /!\

Adrien Mazoyer Introduction à la Statistique 19 / 38


Moyenne d'échantillon

La moyenne d'échantillon est une v.a., et a donc une espérance !

Espérance de la moyenne d'échantillon


L'espérance de la moyenne d'échantillon vérie

 
E Xn = X

En d'autres termes : la variable Xn uctue autour de la valeur inconnue X.

Si on disposait d'un très grand nombre d'échantillons, et qu'on calculait la


moyenne d'échantillon pour chacun d'entre eux, alors la moyenne de toutes les
moyennes d'échantillon serait proche de X.

Adrien Mazoyer Introduction à la Statistique 20 / 38


Moyenne d'échantillon
La moyenne d'échantillon est une v.a., et a donc aussi une variance !

Variance de la moyenne d'échantillon


La variance de la moyenne d'échantillon vérie

  V [X]
V Xn =
n
En d'autres termes : la variable Xn uctue autour de la valeur inconnue X avec

σ(X)
une amplitude de l'ordre de √ .
n

Plus la taille d'échantillon n est grande, plus les uctuations sont petites.

Mais ? ?
Dans les faits, si X est inconnue, il n'y a absolument aucune raison que V [X] ou
σ(X) soient connus !

Adrien Mazoyer Introduction à la Statistique 21 / 38


Estimation de la variance de la population

Variance d'échantillon
On peut estimer la variance σ2 à l'aide de la variance de l'échantillon

1 2 2 
v(Xn ) = X1 − Xn + · · · + Xn − Xn
n
et exprimer ainsi son espérance

n−1
E [v(Xn )] = V [X]
n
n−1
En d'autres termes : la variable v(Xn ) uctue autour de V [X] et non
n
autour de V [X] !

Adrien Mazoyer Introduction à la Statistique 22 / 38


Estimation de la variance de la population

Variance d'échantillon corrigée


An qu'on ait une estimation qui uctue autour de la bonne valeur, on préfère
ainsi considérer la variance d'échantillon corrigée

n
vcorr (Xn ) = v(Xn )
n−1

1  2 2 
= X1 − Xn + · · · + Xn − Xn
n−1
 
qui vérie bien que E vcorr (Xn ) = V [X].

Adrien Mazoyer Introduction à la Statistique 23 / 38


Plan

1 Introduction

2 Variables aléatoires

3 Estimation par échantillonnage

4 Loi Normale, TLC et intervalle de uctuation

Adrien Mazoyer Introduction à la Statistique 24 / 38


Résumons

La moyenne d'échantillon Xn est une variable aléatoire

Elle uctue d'un échantillon à un autre autour de la moyenne de la


population X
σ(X)
Ces uctuations ont une amplitude de l'ordre de √ .
n

Mais on peut être encore plus précis !

Adrien Mazoyer Introduction à la Statistique 25 / 38


Illustration (ctive)

On dispose d'une population de 106 bactéries. Pour chacune d'entre elle, on a


noté l'instant de leur division cellulaire. On mesure que le temps moyen est de 20
min (disons 0.33h).
On eectue l'expérience suivante
1 On extrait un échantillon de taille n=5 de la population, et on calcule la
moyenne d'échantillon associée
2 On répète 1000 fois l'étape 1. On a alors 1000 moyennes d'échantillon
diérentes.
3 On trace l'histogramme de ces valeurs pour observer leur répartition.
4 On répète les étapes 1 à 3 pour des valeurs de n de plus en plus grande

Adrien Mazoyer Introduction à la Statistique 26 / 38


Illustration
n=5 n = 10

150
200

100
50 100

50
0

0
0.0 0.2 0.4 0.6 0.8 1.0 0.0 0.2 0.4 0.6 0.8 1.0

Moyennes d'échantillon Moyennes d'échantillon

n = 100 n = 1000

350
200

250
150
100

150
50

50
0

0.0 0.2 0.4 0.6 0.8 1.0 0.0 0.2 0.4 0.6 0.8 1.0

Moyennes d'échantillon Moyennes d'échantillon


Adrien Mazoyer Introduction à la Statistique 27 / 38
Commentaires

À mesure que n augmente, l'histogramme des valeurs de Xn


est de plus en plus centré autour de la valeur X = 0.33h.
σ(X)
est de moins en moins large (rappel : l'écart-type de la moyenne vaut √ )
n
ressemble de plus en plus à une cloche.

Ces histrogrammes illustrent en fait un théorème


fondamental en statistique, le Théorème de la Limite
Centrale (TLC).

Adrien Mazoyer Introduction à la Statistique 28 / 38


Théorème de la Limite Centrale (TLC)

Théorème
Soit (X1 , . . . , Xn ) un échantillon de n mesures obtenues aléatoirement et
indépendamment les unes des autres, issu d'une population de moyenne X et
d'écart-type σ(X). Alors, pour n susamment grand on a que

 
V [X]
Xn ∼ N X,
n

où N représente la loi normale. Autrement dit, pour n susamment grand on a


que
√ Xn − X
n ∼ N (0, 1)
σ(X)

Lorsqu'on voudra appliquer le TLC, on ne connaîtra pas la valeur de


q σ(X). On la

remplacera alors pas son estimation vcorr (Xn ). Autrement dit, pour n
√ Xn − X
susamment grand on a que nq ∼ N (0, 1)
vcorr (Xn )
Adrien Mazoyer Introduction à la Statistique 29 / 38
Illustration
n=5 n = 10

0.0 0.5 1.0 1.5 2.0 2.5

3
2
1
0
0.0 0.2 0.4 0.6 0.8 1.0 0.2 0.4 0.6 0.8

Moyennes d'échantillon Moyennes d'échantillon

n = 100 n = 1000
10

30
8

20
6
4

10
2

5
0

0.20 0.25 0.30 0.35 0.40 0.45 0.30 0.32 0.34 0.36 0.38

Moyennes d'échantillon Moyennes d'échantillon


Adrien Mazoyer Introduction à la Statistique 30 / 38
La loi Normale standard
Les valeurs d'une v.a. Z qui suit la loi Normale standard N (0, 1) se répartissent
sous la courbe de Gauss représentée ci-dessous.

P[a ≤ Z ≤ b]

a 0 b

L'aire colorée représente la probabilité que la v.a. Z prenne une valeur dans
l'intervalle [a ; b].
Remarque : l'aire sous la courbe entière vaut donc P [−∞ < Z < +∞] = 1
Adrien Mazoyer Introduction à la Statistique 31 / 38
La loi Normale standard

En particulier, l'aire colorée ci-dessous correspond à la probabilité que Z soit plus


petite que a

P[Z ≤ a]

a 0

Adrien Mazoyer Introduction à la Statistique 32 / 38


La loi Normale standard

Et donc si la taille de la surface bleue vaut α, l'abscisse de la frontière de la


surface correspond alors à QZ (α), le quantile d'ordre α de la variable Z
(dénition d'un quantile en diapo 12)

QZ(α) 0

Adrien Mazoyer Introduction à la Statistique 33 / 38


La loi Normale
On regarde à présent un intervalle de la forme [−c ; c] et on va supposer que l'aire
bleue vaut 1−α
P [−c ≤ Z ≤ c] = 1 − α

1−α

α α
2 2
−c 0 c

α α  α
On voit que P [Z > c] = ⇒ P [Z ≤ c] = 1 − ⇒ c = QZ 1 − .
2 2 2
Adrien Mazoyer Introduction à la Statistique 34 / 38
La loi Normale

On prendra très souvent α = 0.05, et auquel cas c ≈ 1.96.

0.95

0.025 0.025

−1.96 0 1.96

Et donc que P [−1.96 ≤ Z ≤ 1.96] = 0.95

Adrien Mazoyer Introduction à la Statistique 35 / 38


Intervalle de uctuation
On a d'abord vu que quand n est susamment grand, on a que

√ Xn − X
n ∼ N (0, 1)
σ(X)
et ainsi en prenant c ≈ 1.96 on a alors
√ Xn − X
 
P −1.96 ≤ n ≤ 1.96 = 0.95
σ(X)
 
σ(X) σ(X)
⇔ P X − 1.96 √ ≤ Xn ≤ X + 1.96 √ = 0.95
n n

Conclusion
Si n est susamment grand, Xn a ainsi 95% de chance de prendre sa valeur dans

 
σ(X) σ(X)
X − 1.96 √ ; X + 1.96 √
n n
Adrien Mazoyer Introduction à la Statistique 36 / 38
Intervalle de uctuation

Proposition (Intervalle de uctuation de Xn )


Soit (X1 , . . . , Xn ) un échantillon de n mesures obtenues aléatoirement et
indépendamment les unes des autres, issu d'une population de moyenne X et
d'écart-type σ(X).
Si n est susamment grand, un intervalle de uctuation de niveau (1 − α) %
pour Xn est

 
 α  σ(X)  α  σ(X)
X − QZ 1 − √ ; X + QZ 1 − √
2 n 2 n

où Z ∼ N (0, 1).

Remarque
Comme mentionné pour le TLC, généralement on ne connaît pas la valeur de
q
σ(X) qu'on remplacera alors par son estimation vcorr (Xn ).

Adrien Mazoyer Introduction à la Statistique 37 / 38


Remarque

De manière équivalente, l'intervalle de uctuation de niveau (1 − α) pour la


statistique
√ Xn − X
T = nq
vcorr (Xn )
est tout simplement l'intervalle

h  α  α i
−QZ 1 − ; QZ 1 −
2 2
et c'est généralement plutôt cette statistique qu'on considérera par la suite !
α

(Rappel : pour α = 0.05, on a que QZ 1 − 2 ≈ 1.96.)

Adrien Mazoyer Introduction à la Statistique 38 / 38

Vous aimerez peut-être aussi