Stat Prob Ts
Stat Prob Ts
Programme
BO HS n°4 du 30 août 2001
II.3 Probabilités et statistique
Après avoir introduit en classe de seconde la nature du questionnement statistique à partir
de travaux sur la fluctuation d’échantillonnage, on poursuit ici la présentation entreprise en
première des concepts fondamentaux de probabilité dans le cas fini avec la notion de
conditionnement et d’indépendance et l’étude de quelques lois de probabilité.
On vise aussi, en complément à l’usage des simulations introduit dès la seconde, une
première sensibilisation à d’autres classes de problèmes, notamment celui de l’adéquation
d’une loi de probabilité à des données expérimentales.
Exemple
Une enquête de marketing portant sur le choix entre deux abonnements A et B lors
de l’achat d’un téléphone portable et le statut de l’acheteur (salarié ou non) a conduit
au recueil des données sur 9 321 nouveaux acheteurs, enregistrées consécutivement
sur un fichier client (l’étude portait sur 10 000 acheteurs, mais pour 679 d’entre eux,
On notera qu’une seule de ces quatre représentations des données permet de recons-
tituer les trois autres.
Dans certaines études (par exemple si les lignes sont les années des deux dernières
élections présidentielles, les colonnes donnant le nombre de votants et le nombre
d’abstentions), les totaux par colonnes (dans l’exemple des élections) ou par ligne
n’ont pas d’intérêt : dans ce cas un seul des deux arbres ci-dessus est utile (le
second dans l’exemple des élections).
Sur des exemples, les élèves devront savoir passer d’un tableau à un arbre et vice-versa.
Aucun formalisme n’est à développer.
À partir du tableau (2), on peut construire les tableaux (3) et (4) ou les arbres (3) et (4) :
Annexes 127
ANNEXE
À titre d’exercice, on pourra dans un exemple analogue à celui-ci, reconstruire les
tableaux ou les arbres des effectifs à partir d’un des deux arbres ou d’un des deux
tableaux ci-dessus et du nombre n total d’individus. Pour reconstruire le tableau (2)
connaissant le tableau (3) et n = 9321, on a à résoudre par exemple le système :
r + r’ = 9321 et 72,6r + 73,3r’ = 72,8 × 9321.
On peut à ce niveau réfléchir au mode de calcul de la fréquence fA(S) des salariés parmi
les clients choisissant A et arriver à la formule :
f ( AetS )
f A (S) = ≈ 72, 7 .
f (A)
On notera dans cet exemple que cette fréquence est sensiblement la même que celle
des salariés dans l’échantillon considérée (72,8). On verra dans la partie « Test d’indé-
pendance » comment interpréter ces données.
Dans le paragraphe suivant, on donne une sens à l’égalité ci-dessus lorsqu’on remplace
les fréquences d’événements par des probabilités.
En utilisant les propriétés des lois de probabilité, on peut démontrer que si D et F sont
indépendants, les événements D et € le sont aussi, ainsi que de A et € et A et F ; les
variables aléatoires métal et monnaie sont dites indépendantes.
On peut alors généraliser et définir la probabilité conditionnelle d’un événement B quel-
conque sachant un événement A de probabilité non nulle, puis l’indépendance de A et B.
Pour n tirages de pièces avec remise, la fluctuation d’échantillonnage fait que le tableau
donnant les fréquences des événements D et €, D et F, A et €, A et F ne sera quasi-
ment jamais identique au tableau donnant les probabilités de ces quatre événements.
Il en sera presque sûrement d’autant plus proche que n est grand. On peut alors se
poser la question inverse : au seul vu d’un tableau d’effectifs ou de fréquences, comment
pourrait-on reconnaître qu’il y a indépendance des variables métal et monnaie dans
l’urne considérée ?
Annexes 129
ANNEXE
défaillance que B : la cause B est protectrice. Par exemple, si D est le décès d’un
enfant par accident imputable à un vaccin V contre une maladie M, la probabilité
PV(D) n’est pas nulle (le risque 0 n’existe pas) mais elle est très faible devant la pro-
babilité PV (D) de décès par la maladie M.
– La dépendance stochastique n’implique pas la dépendance causale des phénomènes
modélisés.
Prenons le contre-exemple fictif suivant : un candidat à la mairie d’un arrondissement
R d’une grande ville envoie à 90% des habitants de cet arrondissement une lettre (évé-
nement L) exposant sa politique, et indépendamment (au sens stochastique), il envoie
à 50 % d’entre eux une boîte de chocolats (événement C) ; il n’envoie lettre et cho-
colat que dans son arrondissement, lequel regroupe 10 % des habitants de la ville ;
la probabilité qu’un habitant de la ville rencontré par hasard ait reçu une lettre (resp.
des chocolats) est P(L) = 0,09 (resp. P(C) = 0,05) ; les événements L et C ne sont pas
stochastiquement indépendants car :
P(L et C) = 0,9 × 0,5 × 0,1 = 0,045 et P(L) × P(C) = 0,09 × 0,05 = 0,0045.
On serait ici peu enclins à dire que la lettre est une cause de la réception d’une boîte de
chocolats ou vice-versa. Les événements L et C sont indépendants conditionnellement
à la cause « être domicilié dans l’arrondissement R » et on retrouve ainsi l’indépendance
causale entre L et C. Ce contre-exemple illustre un phénomène non exceptionnel.
En dehors de quelques situations simples, la causalité est une notion délicate à cer-
ner et à manipuler ; une dépendance de nature causale peut être conjecturée ou vali-
dée par des études statistiques ; cependant, ni la causalité ni l’absence de causalité
ne peuvent être prouvées avec certitude sans recours à des considérations propres au
domaine où l’on se place. Et si dans un modèle, il y a indépendance, ou indépen-
dance conditionnelle de deux événements, c’est le plus souvent parce qu’on a
construit le modèle pour qu’il en soit ainsi (voir « Test d’indépendance »).
Arbre (3)
On en déduira la formule des probabilités totales pour une partition à deux éléments,
et on pourra alors généraliser.
On pourra faire un ou deux exercices utilisant la formule des probabilités totales pour
calculer la probabilité d’un événement A à partir d’une partition comportant plus de
deux éléments.
Un individu dont le test est positif a une probabilité 0,09 d’avoir le caractère A.
Le test peut aussi être appliqué à diverses populations, la probabilité p qu’un indi-
vidu ait le caractère A variant d’une population à l’autre. La valeur prédictive du test
est la probabilité qu’un individu dont le test est positif soit malade.
Dans le cadre d’un cours de mathématiques, il est intéressant d’établir pour ce test la
formule :
99p
PT + ( A) = .
98p + 1
D’où un tableau donnant quelques valeurs de PT+(A) :
On remarque que :
– la valeur prédictive du test n’est pas une notion intrinsèque au test lui-même : elle
varie fortement selon la population ciblée. Pour un fabricant, améliorer la qualité du
test, c’est faire en sorte d’augmenter PA(T+) et de diminuer PA– (T+) ; par contre, le fabri-
cant d’un tel test n’a aucune maîtrise sur la valeur de p ;
Annexes 131
ANNEXE
– dans les cas où p est faible, la valeur prédictive du test l’est aussi. Ainsi, si le carac-
tère A révèle la présence d’une maladie rare, un test de dépistage systématique de toute
une population aura l’inconvénient majeur de fournir beaucoup de faux positifs (indi-
vidus non malades dont le test est positif). Pour ces derniers, l’inquiétude liée à la
découverte d’un test positif peut-être grande : c’est là un des problèmes éthiques liés
à la mise en place des tests de dépistage systématique d’une maladie rare.
On remarquera cependant que, par exemple pour p = 0,01, la connaissance de la posi-
tivité du test multiplie par 50 la probabilité d’être atteint de la maladie : un test posi-
tif est toujours un élément à prendre en compte dans un processus de diagnostic ;
– si la population ciblée est celle d’individus présentant des symptômes évocateurs de
la présence du caractère A (il ne s’agit plus alors de dépistage systématique) ou une
population dite à risque pour la pathologie révélée par A, p n’est pas faible : la posi-
tivité du test sera un élément important du diagnostic ;
– en inversant les rôles de p et 1 – p, pour p < 0,10, on voit que la probabilité qu’un
individu dont le test est négatif ne soit pas atteint de la maladie étudiée est supérieure
à 0,999 : le test est utile pour exclure le caractère A.
Loi de Hardy-Weinberg
Dans les cas simples, un gène peut prendre deux formes (ou allèles) A et a et un indi-
vidu peut avoir l’un des trois génotypes suivants : AA, Aa, aa. Considérons une popu-
lation (génération 0) dont les proportions respectives de ces génotypes sont p, q, r. Un
enfant hérite d’un gène de chaque parent, chaque choix de gène se faisant au hasard.
On admet que les couples se forment au hasard quant aux génotypes considérés (appa-
riement aléatoire).
Comment évoluent les proportions de génotypes dans la population à chaque génération ?
On note pn, qn, rn les proportions des génotypes AA,Aa, aa à la génération n.
Commençons par la première génération.
Si on sait calculer p1 en fonction de p, q, r, on déterminera r1 en intervertissant dans la
formule donnant p1 les lettres p et r ; on en déduira q1 par la formule 1 = p1 + q1 + r1.
Pour calculer p1, on peut conditionner par le génotype du père. Comme l’enfant ne peut
pas être AA si le père est aa, en tenant compte des deux arbres ci-dessous, on trouve :
p1 = (p + q/2)p + (p/2 + q/4)q = (p + q/2)2 = (1 + p – r)2/4.
D’où r1 = (1 + r – p)2/4.
Dans chacun des deux arbres ci-dessus, on a mis en première ligne le génotype du père,
en seconde ligne celui de la mère ; en troisième ligne on en déduit les génotypes
possibles pour un enfant.
Notons d = p–r. On a alors :
p1 = (1 + d)2/4 et r1 = (1-d)2/4, q1 = (1 – d2)/2
Mais p1–r1 = d, il s’ensuit que :
p2 = (1 + d)2/4 et r2 = (1 – d)2/4, q2 = (1 – d2)/2
et plus généralement, pour n > 0 : pn = (1 + d)2/4 et rn = (1 – d)2/4, qn = (1 – d2)/2.
Il apparaît ainsi que la répartition des génotypes est stable à partir de la première géné-
ration : c’est ce qu’on appelle la loi de Hardy-Weinberg ; cette loi a été établie en 1905
conjointement par le mathématicien anglais G.H. Hardy et un médecin allemand
W. Weinberg.
Application
Une maladie M est causée par la présence d’un allèle récessif ; soit, si on note A cet
allèle :
– un individu AA est malade ;
– un individu Aa n’est pas malade mais peut transmettre la maladie (porteur sain) ;
– un individu aa n’est pas malade et ne peut pas transmettre la maladie.
Sachant qu’en Europe, la répartition de la maladie est stabilisée avec un enfant
atteint sur 2 500, comment estimer la proportion de porteurs sains ?
On suppose que la loi de Hardy-Weinberg s’applique. La répartition stable vérifie :
P(AA) = α2, P(aa) = (1 – α)2 et P(Aa) = 2α(1 – α). Soit α = (1/2500)1/2 0,02.
La probabilité d’être porteur sain dans ce modèle est 2α(1 – α) = 0,0392 ; on remarque,
dans les formules ci-dessus, que pour α petit, P(Aa) est voisin de 2α, i.e. la probabilité
d’être porteur sain est voisine du double de la racine de la probabilité d’être malade.
Exercice : Anonymat
On fait une enquête sur le tabac dans un lycée. On fabrique pour cela le question-
naire suivant :
Lancer une pièce à pile ou face. Si elle tombe sur pile, répondez à la question :
Est-ce que vous fumez plus d’un paquet de cigarettes par semaine ?
La réponse est donnée en cochant l’une des deux cases oui ou non en bas du
questionnaire.
Si elle tombe sur face, relancer la pièce une deuxième fois et répondez par oui ou
non à la question :
Est-ce que vous êtes tombé sur pile au deuxième lancer ?
La réponse est donnée en cochant l’une des deux cases oui ou non en bas du
questionnaire.
Lorsqu’un questionnaire porte la réponse oui (resp. non), il est impossible de
savoir s’il s’agit d’une réponse à la question 1 ou à la question 2. On suppose que
grâce à ce procédé les élèves donnent des réponses sans mentir.
On recueille une proportion p de oui. Modéliser la situation et estimer en fonction
de p la proportion de fumeurs dans ce lycée.
Annexes 133
ANNEXE
Remarques
– Parler de k expériences identiques et indépendantes, c’est considérer la loi de
probabilité qui à tout élément (r1,…, rk) associe P(r1) × … × P(rk), où P est la loi de
probabilité qui modélise chacune des expériences. Ce modèle est construit de telle
sorte que les variables aléatoires X1,…, Xk sont indépendantes, où Xi(r1,…, rk) = ri,
i = 1…k. En effet, par définition, l’indépendance de k variables aléatoires signifie
que pour tout (r1,…, rk) :
P(X1 = r1 et… et Xk = rk) = P(X1 = r1) × … × P(Xk = rk ).
– On évitera de dire que deux expériences relevant du même modèle mais qui n’ont
rien à voir entre elles sont identiques (par exemple : opérer un malade avec une
probabilité 10 –5 de complications graves et jouer à un jeu de hasard avec une
probabilité 10–5 de gagner).
– Il a été vu en première qu’un modèle d’une expérience aléatoire est une loi de
probabilité P sur l’ensemble des résultats E. On associe parfois mentalement à
l’expérience réelle une expérience de référence relevant du même modèle (faire de
telles associations n’est pas un objectif du programme). Il doit être cependant clair
que le modèle est la loi de probabilité P sur l’ensemble E et non un tirage de boules
dans une urne (on évitera pour cela de parler de modèle d’urne).
– L’indépendance est liée à l’absence de mémoire ; on dit ainsi souvent que les
résultats à la roulette sont indépendants car la roulette est sans mémoire.
La convergence, sur un grand nombre d’expériences, des fréquences vers leurs proba-
bilités est empiriquement remarquablement vérifiée lors de la réalisation d’un pro-
cessus expérimental sans mémoire. Au niveau de l’intuition, il y a là un paradoxe :
comment un processus sans mémoire peut-il conduire à une régularité prévisible ? Le
paradoxe disparaît si on acquiert l’intuition que le changement d’échelle fait passer
d’un modèle aléatoire à un modèle déterministe : étudier les expériences une par une
nécessite un modèle aléatoire et les étudier par paquet de n, n très grand, conduit à
un modèle déterministe ; l’aléatoire a partie liée à l’échelle où se situe l’observateur.
Représentation de données
Exemple
Données du site [Link]
Dans un ensemble de 423 courts articles du journal Time totalisant 245 412 mots,
on a classé les mots du vocabulaire par ordre décroissant de leur nombre d’appari-
tions dans l’ensemble des articles.
La figure (1), bien que les points d’ordonnée inférieurs à 2 000 soient mal représen-
tés, incite à regarder si la décroissance de y est simplement en 1/x et pour cela à repré-
senter y en fonction de 1/x ; la figure (2) représentant y en fonction de 1/x fait appa-
raître des points presque alignés. Mais le problème de la qualité de la représentation
se pose toujours. Pour y remédier, on peut prendre le logarithme des abscisses et des
ordonnées. En effet, si les produits sont à peu près constants, alors log(yi) sera presque
une fonction affine de log(xi). La figure (3) semble aller dans ce sens ; il conviendrait
de continuer avec les autres mots de cet ensemble de textes pour confirmer ce phé-
nomène ; nous ne disposons pas de ces données. En revanche, nous disposons des
données résultant d’une autre expérience, faite cette fois-ci en dénombrant les mots
distincts d’un corpus de 46 500 articles de journaux, totalisant 19 millions de mots.
Mot the and with on but have so week its new into
Rang 1 5 10 15 20 25 30 35 40 45 50
Occurrences 15861 5614 1839 1551 1138 914 868 793 793 572 518
(1) (2)
(3)
(4) (5)
Annexes 135
ANNEXE
Ces deux exemples illustrent effectivement une loi empirique, vérifiée pour de nom-
breuses langues, appelée loi de Zipf ; cette loi énonce que le produit du rang du mot
par sa fréquence reste à peu près constant.
Cette loi empirique s’applique aussi pour les données suivantes dans de nombreux pays :
on classe les villes par ordre décroissant de leur nombre d’habitants, et en excluant les
quelques plus grandes villes et les plus petites, le produit du rang par la taille garde le
même ordre de grandeur. Ainsi, sur la figure (6), on trouve, pour quelques années entre
1831 et 1990, des représentations des points de coordonnées (i, ni), où ni est le nombre
d’habitants de la ville de rang i : on observe un assez bon alignement des points pour
les rangs compris entre 10 et 1000, sur une droite de pente environ –1. Les géographes
appellent souvent cette loi empirique la loi rang-taille des villes et en font un outil de
référence pour lui comparer la répartition rang-taille effectivement observée.
On pourra commenter les échelles dans le graphique ci-dessous.
(6) Évolution de la distribution rang-taille des unités urbaines françaises entre 1831 et
1990.
Source : Deux siècles de croissance urbaine, coll. « Villes », Économica, 1993.
Exemple 1
On a représenté graphiquement ci-dessous les valeurs des pourcentages de naissances
hors mariages en France, entre 1980 et 1997. Nous nous intéressons ici aux deux
questions suivantes :
a) Une description qualitative simple du nuage de points consiste à dire qu’il y a, à
peu près, croissance linéaire pendant cette période. Comment rendre compte quan-
titativement de cette observation ?
b) Comment estimer le taux de naissances hors mariage en 1998 ?
Année 1980 1981 1982 1983 1984 1985 1986 1987 1988 1989
Pourcentage 11,4 12,7 14,2 15,9 17,8 19,6 21,9 24,1 26,3 28,2
∑ (y – yˆ i ) /n ; on peut se deman-
2
On choisira plus précisément de minimiser ε 2 = i
der pourquoi considérer ε2 et non δ = ∑y i − yˆ i / n ; une des raisons à cela est que
la minimisation de ε2 conduit à une solution unique et à une formule simple, à
savoir yˆ = a( x − x ) + y , où x et y désignent les moyennes des abscisses et des
ordonnées et a =
∑ (y − y ) × ( x − x ) = r s
i i y
.
∑ (x − x )
2
i
s
x
La droite d’ajustement linéaire par moindre carrés est aussi appelée droite de régres-
sion linéaire par moindres carrés, ou plus simplement droite de régression. Pour illus-
trer ce résultat, on pourra montrer que si on a 3 ou 4 points tels que x = y = 0,
alors pour une pente de droite donnée, ε2 est minimum si la droite passe par l’ori-
gine ; à titre d’exercice, on peut alors montrer que ε 2 est minimum pour
a= ∑ ∑
xi yi / xi2 .
On indiquera que si les abscisses et les ordonnées ont des dimensions, la dimension
de a doit être celle des ordonnées divisée par celle des abscisses. On pourra enfin
regarder à partir des formules comment se transforme l’équation de la droite d’ajus-
tement linéaire par moindres carrés si on change d’unités sur les abscisses par
exemple (i.e. par transformation affine des abscisses).
Dans l’exemple considéré, l’équation de la droite d’ajustement est :
τ(t) = 9,47 + 1,78(t – 1979).
Sous l’hypothèse d’un accroissement annuel du pourcentage de naissances hors
mariage égal à 1,78, on trouve τ’(1998) = 43,3. Cette extrapolation des données
Annexes 137
ANNEXE
repose sur les 18 années précédentes : est-il vraiment pertinent ici d’utiliser toutes
ces données ? Entre 1980 et 1997, les pourcentages observés ont varié de 10 à 40 %,
mais un examen un peu plus précis du nuage des 18 points montre un infléchisse-
ment pour les dernières années observées ; aussi pour l’extrapolation demandée,
on peut limiter aux quelques années précédentes. Avec les cinq années de 1993 à
1997, l’équation de la droite d’ajustement par moindres carrés est :
τ’(t) = 16,7 + 1,30(t – 1979).
Sous l’hypothèse que cette tendance linéaire (accroissement du pourcentage 1,30 par
an) se maintienne, on trouve τ’(1998) = 41,4. Si on fait les calculs avec les trois
années 1995-1996-1997, on trouve 41,2 : une prévision raisonnable est l’intervalle
[41,2 ; 41,4]
On notera que si on change d’unité pour les yi, ce qui revient à les multiplier par un nombre k, alors la
pente et l’ordonnée à l’origine de la droite d’ajustement linéaire par moindre carrés est multipliée par k
et la somme des carrés des erreurs est multipliée par k2. Dire que la somme des carrés des erreurs est
petite n’a donc pas de sens : il convient de regarder si elle est petite par rapport à la variance des
ordonnées, où, ce qui revient au même, à regarder si D est proche de 1, avec :
∑ ( ŷi − y ) = sŷ2 .
2
∆=
∑ ( yi − y ) sy
2 2
∆ représente la proportion de la variance des ordonnées expliquée par l’ajustement linéaire. Des calculs
simples montrent que ∆ est le carré du coefficient de corrélation linéaire r, soit :
∆ = r2, avec r =
∑ ( yi − y )( xi − x ) .
( ) (
2 1/ 2
∑ ( xi − x ) ∑ ( yi − y ) )
2 1/ 2
Si ∆ = 1, les points du nuage sont alignés et plus ∆ (ou r) est proche de 1, meilleur est l’ajustement : quan-
tifier ce propos est délicat et nécessite un modèle probabiliste ; la quantification de la qualité de l’ajus-
tement n’est pas un objectif du programme.
On pourra consulter, sur le logiciel SEL présent sur le cédérom, le lexique correspon-
dant au terme « régression linéaire simple » et regarder comment varie la somme des
carrés des erreurs lorsqu’on ajuste « à la main » un nuage de points par une droite. En
consultant le lexique au terme « donnée aberrante », on pourra observer la sensibi-
lité à une valeur aberrante de la droite d’ajustement par moindres carrés.
Exemple 2
Le graphique (1) page suivante représente, pour les années 1991 à 1995, le nombre
des divorces en France entre 1991 et 1995 (en abscisse) et l’espérance de vie à la nais-
sance des hommes (en ordonnée). Les cinq points sont quasiment alignés. On peut
(1)
De gauche à droite, les points représentent, dans l’ordre les années 1991 à 1995.
(2) (3)
Lois de probabilités
Annexes 139
ANNEXE
On utilisera uniquement la formule pour la loi binomiale de paramètres n et p, et les
deux lemmes d’analyse suivants, qui sont au programme de terminale :
Lemme 2. Si la suite (un)n∈ tend vers a et si la suite (vn)n∈ tend vers b, alors la suite
produit ([Link])n∈ tend vers ab.
Une modélisation simple, voire simpliste, pour la situation ci-dessus est la suivante :
on suppose que chaque année, un million de véhicules passent par le carrefour. Le
modèle envisagé est une loi binomiale de paramètres 106 et 10–6 (on lance 106 fois une
pièce qui tombe sur face avec probabilité 10–6 et on compte le nombre de face).
Il a pourtant un défaut : en général, on connaît la moyenne, mais on ne sait pas vrai-
ment le nombre de véhicules qui passent ; peut-être y en a-t-il 105 ? ou 107 ? On aurait
alors une modélisation avec 105 tirages, avec probabilité 10–5 à chaque tirage, ou bien
107 tirages, avec probabilité 10–7 à chaque tirage. Si ces modèles donnaient des résul-
tats très différents, notre modélisation serait inutilisable.
Autrement dit, nous voulons comparer les lois binomiales obtenues par n tirages indé-
pendants avec probabilité 1/n. Voici le dessin pour des valeurs de n = 20 ; 50 ; 100 ;
1000 ; on n’a représenté que les probabilités d’avoir des valeurs entre 0 et 20. Au-delà
de 10, les probabilités sont trop petites pour être correctement représentées avec
l’échelle choisie :
et 1/n, la probabilité d’avoir 0 est 1 − , et l’on sait (lemme 1) que la suite de terme
1
n
n
général 1 − tend vers 1/e quand n tend vers +∞ : une valeur approchée de la limite
1
n
est 0,368. Cherchons maintenant un résultat analogue pour la probabilité de k.
Notons Pn(k) la probabilité d’avoir k avec une loi binomiale de paramètres n et 1/n.
n−k
n 1 1
k
Remarque – Une récurrence montre que Pn(k) tend vers Lk = e–1/k! ; les lois B(n,1/n) sont définies sur
[0,n] ; lorsque n tend vers l’infini, s’il y a une loi de probabilité limite P, celle-ci est définie sur . On
admettra la propriété suivante : e = lim un avec un = 1 + 1/2 + …
n →+∞
+ 1/n! (on pourra d’abord observer ce résultat sur tableur avant
de l’admettre, en notant qu’il s’agit là d’un résultat important qui
conduit à de nombreux théorèmes et applications). D’où
( )
lim L0 + L1 +... +Ln = 1. En posant alors P(k) = Lk, on voit que
n→+∞
les lois binomiales B(n,1/n) convergent vers la loi P.
Cette loi limite est une loi de Poisson de moyenne 1. Voici le
graphe de cette loi de Poisson, très peu différent bien sûr de ceux
qui précèdent.
Dans ce modèle, pour des accidents rares qui arrivent en moyenne une fois par an, on
a environ 36 % de chances qu’aucun accident ne se produise une année donnée, la
même chance qu’il y en ait un, environ 18 % de chances qu’il y en ait 2, 6 % de chances
qu’il y en ait 3, et 2 % qu’il y en ait 4 ; au-delà, la probabilité devient très faible.
avec vn = 1 + a2/2 + … + an/n!. On retrouve bien le cas précédent en prenant a = 1. La loi limite est appe-
lée loi de Poisson de paramètre a.
Voici quelques exemples de lois de Poisson (paramètres respectifs 2 et 4)
Annexes 141
ANNEXE
Il s’avère que les observations que l’on peut faire suivent remarquablement de telles
lois de Poisson, par exemple pour des accidents à des carrefours ou pour la désinté-
gration des noyaux d’une substance radioactive.
Lois continues
Nous proposons ci-dessous une introduction aux lois de probabilité à densité continue,
qui fait naturellement suite au cours sur l’intégration et l’enrichit d’applications impor-
tantes, telles la modélisation de la durée de vie d’un noyau d’une substance radio-
active (voir le document à ce sujet). Si quelques exercices faciles peuvent être proposés
pour faire fonctionner ce concept de loi de probabilité sur un sous-ensemble de , il
convient de ne pas oublier qu’il s’agit d’une toute première approche.
Aucune difficulté technique ne sera soulevée ; en particulier on ne traitera que des cas
menant à des calculs d’intégrales s’exprimant aisément à l’aide des fonctions étudiées
en terminale. Pour une loi sur +, aucune notion d’intégrale généralisée n’est abordée
formellement : l’outil limite à l’infini d’une fonction est suffisant.
Par ailleurs, s’il est facile, dans le cas fini, d’imaginer des protocoles expérimentaux (tels
des tirages de boules dans une urne) réalisant un choix au hasard dont le résultat est connu
avec exactitude, la situation est différente pour [0,1[ : le résultat d’une mesure ne fournit
qu’un intervalle où le résultat se situe. De même, si on veut donner le résultat d’un tel
choix au hasard sous la forme de son écriture décimale, on ne pourra écrire qu’un nombre
fini de décimales, ce qui en fait revient à définir un intervalle auquel il appartient.
Ces considérations conduisent à changer de point de vue : pour des ensembles tels que
(0,1), une loi de probabilité sera caractérisée non plus par la probabilité des éléments
mais par celle de ses intervalles.
Pour la classe terminale, on se limite à des lois de probabilités définies sur un intervalle
I borné ou borné à gauche (i.e. I = [a,b], ou I = [a, + ∞)) et dites à densité continue.
Annexes 143
ANNEXE
I = (a,b), loi P de densité f. I = [a, + ∞), loi P de densité f.
f est une fonction définie sur I, f est une fonction définie sur I, continue posi-
continue positive. tive.
( ) ∫ f (x)dx = 1
b t
P(I ) = P (a, b) =
a
lim F(t) = 1 où F(t) =
t→+∞ ∫a
f (x)dx .
Pour tout intervalle borné (c,d) Pour tout intervalle borné (c,d) (ouvert, semi
(ouvert, semi ouvert ou fermé) de I : ouvert ou fermé) de I :
( ) ∫ ( ) ∫ ( )
d d
P (c, d ) = f (x)dx et P (c, d ) = f (x)dx et P (c, +∞) = 1 − F(c) .
c c
Exemples d’exercices
• Soit I = [0,1] et une loi de probabilité de densité f avec f(t) = 4t3.
Calculer P([0,25 ; 0,75]). Calculer m tel que si on choisit un nombre dans I suivant
cette loi de probabilité, la probabilité qu’il soit inférieur à m soit 0,5.
• Soit I = [0, + ∞) et une loi de probabilité de densité f avec f(t) = 2e-2t.
Calculer P([n,n + 1]). Calculer m tel que si on choisit un nombre dans I suivant cette
loi de probabilité, la probabilité qu’il soit inférieur à m soit 0,5.
• Soit I = [1,10] et une loi de probabilité de densité f avec f(t) = λt-2. Déterminer λ.
• Soit I = [1, + ∞) et une loi de probabilité de densité f avec f(t) = λt-2. Déterminer λ.
Exemple d’exercice
On choisit un nombre au hasard dans ]0,1[.
1) Sachant qu’il est inférieur à 0,3, quelle est la probabilité que le second chiffre
après la virgule soit 1 ?
2) À l’aide d’un tableur, choisir 4 nombres au hasard x1,…,x4 dans ]0,1[. À cette série
de nombres, on associe la série de leurs logarithmes : ln(x1),…,ln(x4). La moyenne
de cette seconde série est-elle égale au logarithme de la moyenne des quatre
nombres ?
On considère la variable aléatoire X qui à x fait correspondre – ln(x).
Calculer H(t) = P(X t) ; déterminer la dérivée de la fonction H.
Deux problèmes
Un joueur veut vérifier si le dé qu’il utilise est équilibré. Comment peut-il faire ?
Il pourrait étudier la symétrie du dé, mais ce n’est pas exactement de cela qu’il s’agit.
Il convient plutôt de vérifier que dans des conditions normales d’utilisation du dé, les
résultats sont compatibles avec un modèle d’équiprobabilité sur {1,2,3,4,5,6}.
Essayons donc de définir sur cet exemple un critère de compatibilité de données
expérimentales avec un modèle.
On peut par exemple s’intéresser à la distance entre la distribution des fréquences
(f1, …,f6) obtenues en lançant n fois un dé et la loi de probabilité {1/6, …,1/6} et regar-
der si cette distance est petite. En prenant la définition classique de la distance, on peut
fonder la notion de compatibilité sur l’étude du carré de cette distance, à savoir :
d2 = (f1 – 1/6)2 + (f2 – 1/6)2 + … + (f6 – 1/6)2.
2
La quantité d est soumise à la fluctuation d’échantillonnage, i.e. sa valeur varie d’une
série de lancers à l’autre. C’est précisément l’étude de la fluctuation d’échantillonnage
qui va permettre de convenir d’un seuil entre valeur petite et valeur non petite de d2.
Imaginons que le joueur ait lancé 500 fois le dé et ait obtenu une distribution de
2
fréquence (f1, …,f6), d’où une valeur observée dobs qu’on va comparer à d’autres. Pour
cela, on simule des séries de n = 500 chiffres au hasard dans {1, …,6}. Ci-dessous, on
voit un histogramme de 2 000 valeurs de d2 obtenues par des simulations de séries de
500 chiffres au hasard dans {1,…,6}.
Le 9e décile de la série des valeurs simulées de d2 est 0,003 (soit 90 % des valeurs simu-
lées de d2 sont dans l’intervalle [0 ; 0,003]).
Annexes 145
ANNEXE
Convenons de la décision suivante :
2
– si dobs 0,003, alors le dé sera déclaré équilibré ;
2
– si dobs > 0,003, alors le dé sera déclaré non équilibré.
On associera à cette conclusion le risque α = 0,1 correspondant au fait suivant : en utili-
sant cette règle de décision sur les données simulées, on se serait « trompé » dans 10 %
des cas.
Deux éléments semblent arbitraires dans cette façon de conclure ou non à l’équilibre
du dé : que se passerait-il pour une autre simulation, de taille égale ou non, et que se
passerait-il si au lieu de lancer 500 fois le dé, on le lançait par exemple 1 000 fois ?
Qu’à cela ne tienne : étudions les résultats de 5 000 simulations de séries de 1 000 tirages
de chiffres au hasard dans {1,…,6} ; le neuvième décile des valeurs d2 est 0,0015, i.e.
90 % des valeurs de d2 simulées sont dans l’intervalle [0 ; 0,0015]. Comparons les résu-
més graphiques dans les deux séries simulées : même allure, à l’échelle près. L’existence
d’un changement d’échelle est conforme au théorème des grands nombres vu en pre-
mière : plus le nombre de tirages est grand, plus la distribution des fréquences est proche
de la loi de probabilité, donc plus les valeurs de d2 sont petites.
Exemple
La répartition des sexes à la naissance est-elle équilibrée ?
La traduction mathématique de cette question est ici : la loi de probabilité (0.5,0.5)
est-elle pertinente pour modéliser la répartition des sexes à la naissance ?
On dispose pour répondre à cette question des données suivantes : sur n = 53041
naissances consécutives dans la ville de Grenoble, on observe 25 946 naissances de
Aux arrondis près, l’intervalle [0;1,4] contient 90 % des valeurs simulées et l’inter-
valle [0;2] en contient 95%.
Ici, la valeur observée de nd 22 est environ 12,5 : au vu des données et au risque α = 0,05
(donc aussi au risque α = 0,1), on rejette le modèle d’équiprobabilité et on conclut qu’il
n’y a pas égalité des sexes à la naissance. La question se pose de généraliser ce résultat
à d’autres villes, d’autres pays, et aussi de regarder si la proportion de filles est stable
géographiquement, et au cours du temps. On pourra consulter à ce sujet le hors série
n° 6 de la revue La Recherche paru en 2001.
Remarques
1) Une idée naturelle serait ici d’étudier les fluctuations de δ = f1 – 1/2 et de les comparer aux fluctua-
tions de la même quantité lorsqu’on simule un grand nombre de séries de taille 53 041 de nombres (0,1)
tirés au hasard. Mais on peut écrire : d22 = 2 δ 2 et les deux études sont donc identiques. En particulier,
comme on a vu que les variations en n de la répartition des valeurs de nd 22 pouvaient être négligées dès
que n est grand, il en est de même pour n δ . La règle de décision adoptée ici est d’accepter le modèle
équiréparti au niveau 0,95 si n δ 1, soit si 1/2 est dans l’intervalle de confiance au niveau 0,95 de
la fréquence f1 observée (voir sur le cédérom le complément théorique de la fiche sur les sondages du
document d’accompagnement de seconde).
2) Il existe en fait un théorème plus général, à savoir : dans le monde théorique défini par une loi
P = (p1,…, pk), alors la loi de probabilité de la quantité :
(f − p )
2
k
χ = n∑
2 i i
i =1 pi
Annexes 147
ANNEXE
est, pour n grand, distribuée selon une loi qui ne dépend que de k. Cette loi s’appelle loi du khi deux à
k – 1 degrés de liberté et on trouve dans des tables numériques la liste des 9e déciles de ces lois (voir
tableau ci-dessous). On peut ainsi généraliser la méthode ci-dessus et définir un critère de compatibi-
lité d’une série de données avec une loi quelconque sur un ensemble fini.
k–1 1 2 3 4 5 6 10 20 30
α = 0,1 2,71 4,61 6,25 7,78 9,24 10,64 15,99 28,41 40,26
α = 0,05 3,84 5,99 7,81 9,49 11,07 12,59 18,31 31,41 43,77
Pour k = 2, on part d’une loi binomiale et les calculs peuvent se retrouver autrement (voir sur le cédé-
rom, « Compléments aux documents d’accompagnement »).
L’objectif ici n’est pas que les élèves fassent eux-mêmes la simulation, mais qu’ils soient capables de défi-
nir une règle de décision et d’exploiter les résultats de simulations.
Test d’indépendance
Dans le paragraphe « Probabilités conditionnelles et indépendance », on s’est posé la question de l’in-
dépendance des variables abonnement et statut pour lesquelles on dispose du tableau suivant, donnant
les résultats de ce couple de variables sur N = 9321 individus (voir tableau (1) ci-dessous).
Tableau (1)
La traduction dans le champ de la statistique de cette question est : peut-on trouver un modèle compa-
tible avec les données, défini par deux nombres p et r tels que les probabilités des 4 événements en jeu
soient celles qui sont données dans le tableau ci-dessous :
( ) ( ) + (c’ −(1 − pˆ )rˆ ) + (d’ −(1 − pˆ )(1 − rˆ ))
2 2
b’ − pˆ (1 − rˆ )
2
a’ − pr
ˆˆ
z = N +
pr
ˆˆ pˆ (1 − rˆ ) (1 − pˆ )rˆ (1 − pˆ )(1 − rˆ )
n m a d
où : p̂ = , r̂ = , a'= ,... , d'=
N N N N
(on remarque que s’il existe un modèle compatible avec les données, défini par p et r, où les événements
n m
A et S sont indépendants, alors p̂ = et r̂ = seront voisins de p et r).
N N
On voit que 90 % des valeurs de la série simulée sont inférieures à 2,7 ; on peut convenir de la règle de
décision suivante :
– si la valeur observée de z est 2,7, alors les variables en jeu seront dites indépendantes ;
– si la valeur observée de z est > 2,7, alors les variables en jeu seront dites non indépendantes.
On associera à cette conclusion le risque α = 0,1 correspondant au fait suivant : en utilisant cette règle
de décision sur les données simulées, on se serait trompé dans 10 % des cas.
Si la valeur observée de z est inférieure ou égale à 2,7, on pourra choisir le modèle défini par :
( ) ( ) ( ) ( ) ( )
P A et S = p̂ r̂, P B et S = p̂ 1 − r̂ , P A et NS = 1 − p̂ r̂, P B et NS = 1 − p̂ 1 − r̂ . ( ) ( )( )
Pour le tableau (1) la valeur observée de z est 0,36 : les variables en jeu sont dites indépendantes au
risque 0,1, ou au niveau de confiance 1-0,1 = 0,9. On pourra prendre le modèle suivant :
P ( A et S ) = p̂ r̂ = 0,53, P ( B et S ) = p̂(1 − r̂ ) = 0, 20, P ( A et NS ) = (1 − p̂ ) r̂ = 0, 20, P ( B et NS ) = (1 − p̂ )(1 − r̂ ) = 0, 07 .
La démarche suivie est donc de tester l’hypothèse qu’il existe un modèle où A et S sont indépendants et
qui est compatible avec les données. Si cette hypothèse est acceptable, on construit alors une loi P qui
vérifie P(A et S) = P(A)P(S).
Cette conclusion suppose que les données manquantes ne masquent pas un phénomène spécifique ; ainsi,
si les 679 cas exclus au départ sont tous des non salariés qui prennent l’abonnement B, alors la valeur
observée de z est 225 et la conclusion change !
Statistique et TICE
Le développement rapide de l’usage de la statistique est lié à celui de l’informatique.
Pour une sensibilisation à la statistique, dans le cadre d’un enseignement de mathéma-
tiques, il convient cependant de cerner en quoi les outils logiciels sont indispensables.
Il ne s’agit pas d’initier les élèves à un logiciel spécialisé de statistique, ni même de les
entraîner à utiliser systématiquement les possibilités de logiciels comme les tableurs
ou les logiciels de géométrie (il serait utile que les enseignants acquièrent une bonne
maîtrise de tels outils). On pourra se limiter à quelques possibilités indispensables à une
mise en œuvre efficace des programmes de seconde, première et terminale.
On distinguera notamment les usages suivants :
– calculs simples, tels ceux de moyenne, d’écart type qui peuvent être faits sur calcula-
trice par un ordinateur quasi-instantanément même sur des séries de grandes tailles ;
Annexes 149
ANNEXE
– représentations graphiques diverses (l’usage d’un ordinateur permet de réfléchir sur
le choix d’un pas convenable pour un histogramme), etc. ;
– calculs nécessitant le tri d’une série : médianes, quartiles, déciles. Le principal apport
d’un logiciel est ici la possibilité de trier très rapidement un grand nombre de données.
L’élève, pour tracer un diagramme en boîte associé à une longue série, pourra le faire
« à la main », à partir de la simple observation de la série triée.
– la simulation : le programme de seconde insiste sur la nécessité de construire à partir de
situations vécues le lien entre expériences réelles et simulations (à l’occasion de lancers de
deux dés par exemple). Apprendre à simuler une expérience est un exercice formateur,
tant au plan de la connaissance des phénomènes aléatoires qu’à celui du raisonnement.
Le paragraphe « Deux problèmes » propose une approche de la notion de test, à l’aide
de simulations.
Comme application de la notion de choix au hasard dans un intervalle [a,b] et de celle
d’expériences indépendantes, on peut estimer des aires à l’aide de simulations : si on
choisit au hasard des nombres dans des intervalles I et I’ bornés, la probabilité d’un
rectangle de I × I’ est le quotient de son aire par celle de I × I’ ; on admet alors que la
probabilité d’un sous-ensemble de I × I’ est son aire.
On trouvera sur le cédérom des « appliquettes » à ce sujet, dans la section consacrée
aux « Compléments aux documents d’accompagnement ».
Sondages
On pourra reprendre la fiche « sondages » du document d’accompagnement de la
classe de seconde et adapter, en tenant compte des connaissances de la classe termi-
nale, l’aperçu théorique complétant cette fiche.
L’appliquette sur les fourchette de sondage peut permettre aux élèves de se fami-
liariser avec la notion de fourchette de sondage. On pourra aussi consulter le site
[Link]/culturemath.
Il conviendra, pour les sondages effectivement réalisés par des instituts et relatifs par
exemple à des élections, de bien séparer les situations suivantes :
– les sondages préélectoraux : cette situation est analogue au tirage de boules coloriées
dans une urne ; les boules peuvent changer de couleur au cours du temps et le sondage
reflète au mieux la répartition des couleurs à la date où il est pratiqué. De plus, dans
cette situation, certaines boules, en sortant de l’urne, changent de couleur – mais
reprennent leur couleur originelle si on les remet dans l’urne (les personnes sondées ne
disent pas toujours à l’enquêteur leur choix réel). Certaines études faites sur des élec-
tions antérieures, comparées à la réalité des votes après dépouillement, permet d’éta-
blir un modèle dans lequel on connaît la loi du changement de couleur lors du tirage.
Cela permet alors de « redresser » les calculs et d’estimer, dans le cadre de ce modèle,
les proportions de chaque couleur dans l’urne. Les calculs faits sont « justes » à l’inté-
rieur de ces modèles, mais la loi de changement de couleur peut évoluer d’une élection
à l’autre et dans ce cas, les estimations faites ne sont plus pertinentes ;
– les estimations faites « à 20 heures » à partir du dépouillement d’échantillons de
bulletins de vote. La situation est comparable ici au tirage au hasard d’un grand
nombre de boules dans une urne (les boules ne changent plus de couleurs au cours du
temps ou en sortant de l’urne). Ces estimations sont très précises et assorties d’un
niveau de confiance élevé : on a extrêmement peu de chances de donner des chiffres
éloignés de ceux qui tomberont après le dépouillement de la totalité des urnes.
Il convient enfin de distinguer d’une part la question de la fiabilité des sondages (four-
chette de sondage et estimation qualitative de la fiabilité des lois de fausses réponses
lors de l’enquête) des usages et interprétations des résultats qu’ils apportent.
Problèmes divers
Les possibilités de calculs sur tableur peuvent motiver la recherche de formules exploi-
tables au plan numérique pour résoudre un problème, indépendamment de l’intérêt
théorique d’une telle formule.
Exemple
Dans la fiche statistique « Faites vos jeux » du document d’accompagnement de la
classe de seconde (disponible sur le cédérom joint), on s’intéresse à la probabilité qu’il
y ait au moins 6 résultats consécutifs égaux dans une série de n lancers d’une pièce
équilibrée. On peut simuler cette situation, comme cela est proposée dans la fiche (ou
faire des calculs matriciels tout à fait hors de portée d’un élève de terminale).
On peut aussi se demander si le résultat est calculable à partir d’une formule
simple et exploitable sur tableur pour les valeurs de n susceptibles de nous intéres-
ser : établir une telle formule est l’objet du texte ci-dessous.
Les lancers d’une pièce de monnaie équilibrée sont associés comme on l’a vu précé-
demment à un modèle bien déterminé. Si on note Xn le résultat du n-ème lancer :
( ) 1
(
P X n = 0 = et P X n = 1 = .
2
) 1
2
On construit un compteur pouvant prendre les valeurs 1, …,6, la valeur 6 indiquant
la présence d’au moins une séquence de 6 résultats consécutifs égaux. Un exemple
est donné ci-dessous, où les résultats des lancers sont en première ligne et la valeur
du compteur en deuxième ligne.
1 2 3 1 1
Cela revient à considérer les variables aléatoires (Yn)n > 0, définies par :
6 si Yn −1 = 6
Y1 = 1 et Yynn = Yn −1 + 1 si Yn −1 < 6 et X n = X n −1 .
1 sinon
Alors P(Yn = 6) est la probabilité pour qu’il y ait au moins 6 résultats consécutifs
égaux dans une série de n lancers (on peut généraliser les résultats qui suivent à des
valeurs différentes de 6, voir sur le cédérom).
2
Soit pn = P(Yn = 6). On a p1 = p2 = p3 = p4 = p5 = 0 et p6 = 6 .
2
Si on lance n fois la pièce avec n > 6, alors l’événement « Yn = 6 » se produit dans
les cas suivants :
– lorsque Yn-1 = 6 ;
– ou dans l’un des deux cas suivants :
• on vient d’obtenir 6 fois 1 (événement An), Xn–6 = 0 et Yn–6 < 6,
• on vient d’obtenir 6 fois 0 (événement Bn), Xn–6 = 1 et Yn–6 < 6.
Il s’ensuit que, pour tout n > 6 :
pn = P (Yn-1 = 6) + P (An et Xn-6 = 0 et Yn-6 < 6) + P (Bn et Xn-6 = 1 et Yn-6 < 6),
Comme An (resp. Bn) est indépendant de l’événement « Xn-6 = 0 et Yn-6 < 6 » (resp.
« Xn-6 = 1 et Yn-6 < 6 »), on obtient :
pn = pn-1 + 1 / 26 × [P (Xn-6 = 0 et Yn-6 < 6) + P (Xn-6 = 1 et Yn-6 < 6)].
Or, P(Xn-6 = 0 et Yn-6 < 6) + P (Xn-6 = 1 et Yn-6 < 6)] = P(Yn-6 < 6) = 1– pn-6.
(1
)
D’où, pour tout n > 6 : pn = pn −1 + 6 1 − pn −6 . (1)
2
On peut ainsi calculer de proche en proche pn pour n > 6 sur tableur ou calculatrice.
On trouve les valeurs suivantes :
Annexes 151
ANNEXE
Remarques
– Dans le cadre de cette activité, les élèves pourraient eux-mêmes définir le compteur
sur des exemples de suites de lancers. L’enseignant pourrait établir la formule (1)
(formule assez exotique pour définir une suite), les élèves ayant ensuite à faire les
calculs numériques : ils sont en général surpris du résultat pour n = 150 ou n = 200,
même si des simulations ont montré que la probabilité était forte pour de telles
valeurs de n. On peut remplacer 6 par 3 ou 4, mais les élèves sont alors moins sur-
pris et intéressés par le résultat final.
– Les élèves motivés peuvent faire des expérimentations numériques (pas tous les
mêmes), en admettant la formule correspondant à « au moins k coups consécutifs
égaux », à savoir :
(1
)
pn = pn −1 + k 1 − pn −k
2
et en regardant soit à partir de quelle valeur de n la probabilité devient supérieure
à 0,5, soit la valeur de la probabilité pour n = 500 fixé par exemple.
– La suite (pn) est croissante et majorée par 1. Elle converge donc vers une limite l qui
vérifie l = l + (1 – l)/26 soit l = 1. En d’autres termes, la probabilité d’obtenir au moins
une fois six résultats consécutifs égaux tend en croissant vers 1 lorsque n tend vers ∞.
– Une autre formule permettant de calculer pn de proche en proche est donnée
dans « Enseigner la statistique au lycée : des enjeux aux méthodes », par P. Dutarte et
J.-L. Piednoir, brochure n° 112, commission inter IREM, Lycées technologiques, p. 96.
Si on note un le nombre de suites de taille n de chiffres dont les termes sont 0 ou 1, ne
contenant aucune séquence de 6 termes consécutifs égaux, on a un = un–1 + un–2 +
un–3 + un–4 + un–5 et pn = 1– un/2n. Des élèves pourraient faire les calculs avec cette
deuxième formule, et regarder si on obtient les mêmes résultats qu’avec la formule (1).
Cahier de statistique
On pourra inciter les élèves à faire dans ce cahier un bilan de ce qu’ils ont acquis depuis
la seconde en probabilités et statistique, des questions résolues et de celles qui sont
restées ouvertes.
L’évaluation du chapitre « probabilités et statistique » pourra tenir compte de la
rédaction de ce cahier.