0% ont trouvé ce document utile (0 vote)
98 vues264 pages

Phénomènes aléatoires et probabilités

Ce document introduit les concepts fondamentaux de la théorie des probabilités à travers de nombreux exemples et définitions. Il contient des informations sur les variables aléatoires discrètes et continues, l'espérance mathématique, les lois usuelles et les outils statistiques de base.

Transféré par

Pedro Macedo
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
98 vues264 pages

Phénomènes aléatoires et probabilités

Ce document introduit les concepts fondamentaux de la théorie des probabilités à travers de nombreux exemples et définitions. Il contient des informations sur les variables aléatoires discrètes et continues, l'espérance mathématique, les lois usuelles et les outils statistiques de base.

Transféré par

Pedro Macedo
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Aléatoire

Josselin Garnier, Sylvie Méléard, Nizar Touzi

Département de Mathématiques Appliquées


Ecole Polytechnique

Mars 2020
Table des matières

1 Introduction 7
1.1 Avant-propos . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 8
1.2 Phénomènes aléatoires . . . . . . . . . . . . . . . . . . . . . . . . . . . 9
1.3 Deux idées majeures et incontournables . . . . . . . . . . . . . . . . . 10
1.3.1 La loi des grands nombres . . . . . . . . . . . . . . . . . . . . . 10
1.3.2 Conditionnement et indépendance . . . . . . . . . . . . . . . . 10
1.4 Les variables aléatoires . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
1.4.1 Loi d’une variable aléatoire . . . . . . . . . . . . . . . . . . . . 11
1.4.2 Simulation de variables aléatoires . . . . . . . . . . . . . . . . . 11
1.5 Historique . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 12

2 Espace de probabilité 15
2.1 Le langage des probabilités . . . . . . . . . . . . . . . . . . . . . . . . 15
2.1.1 Information issue d’une expérience aléatoire . . . . . . . . . . . 15
2.1.2 Probabilité - Premières propriétés . . . . . . . . . . . . . . . . 18
2.2 Espace fondamental fini ou dénombrable . . . . . . . . . . . . . . . . . 23
2.2.1 Caractérisation . . . . . . . . . . . . . . . . . . . . . . . . . . . 23
2.2.2 Modèles d’urnes et calcul combinatoire . . . . . . . . . . . . . . 25
2.3 Conditionnement et indépendance . . . . . . . . . . . . . . . . . . . . 29
2.3.1 Probabilités conditionnelles . . . . . . . . . . . . . . . . . . . . 29
2.3.2 Indépendance . . . . . . . . . . . . . . . . . . . . . . . . . . . . 32
2.3.3 Le lemme de Borel-Cantelli . . . . . . . . . . . . . . . . . . . . 35
2.4 Rappels et compléments . . . . . . . . . . . . . . . . . . . . . . . . . . 36
2.4.1 Rappels sur les ensembles . . . . . . . . . . . . . . . . . . . . . 36
2.4.2 Modélisation ensembliste des événements . . . . . . . . . . . . 37
2.4.3 Les ensembles dénombrables . . . . . . . . . . . . . . . . . . . . 38
2.4.4 Quelques résultats utiles sur les séries . . . . . . . . . . . . . . 38
2.5 Exercices sur le chapitre 2 . . . . . . . . . . . . . . . . . . . . . . . . . 40

3 Espace fini ou dénombrable 43


3.1 Variables aléatoires discrètes . . . . . . . . . . . . . . . . . . . . . . . . 43
3.2 Espérance des v.a. discrètes . . . . . . . . . . . . . . . . . . . . . . . . 45

3
4 TABLE DES MATIÈRES

3.2.1 Définition . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 45
3.2.2 Propriétés de l’espérance des v.a. discrètes . . . . . . . . . . . . 47
3.2.3 Variance et écart-type . . . . . . . . . . . . . . . . . . . . . . . 48
3.2.4 Moments d’une variable aléatoire . . . . . . . . . . . . . . . . . 49
3.3 Fonction génératrice d’une v.a. entière . . . . . . . . . . . . . . . . . . 50
3.4 Variables aléatoires discrètes usuelles . . . . . . . . . . . . . . . . . . . 52
3.4.1 Variable aléatoire de Bernoulli . . . . . . . . . . . . . . . . . . 52
3.4.2 Variable aléatoire binomiale . . . . . . . . . . . . . . . . . . . . 52
3.4.3 Probabilité de succès et variable aléatoire géométrique . . . . . 54
3.4.4 Variable aléatoire de Poisson . . . . . . . . . . . . . . . . . . . 55
3.5 Lois conditionnelles et indépendance . . . . . . . . . . . . . . . . . . . 56
3.5.1 Lois marginales . . . . . . . . . . . . . . . . . . . . . . . . . . . 56
3.5.2 Lois conditionnelles . . . . . . . . . . . . . . . . . . . . . . . . 57
3.5.3 Espérance conditionnelle . . . . . . . . . . . . . . . . . . . . . . 57
3.5.4 Variables aléatoires indépendantes . . . . . . . . . . . . . . . . 59
3.5.5 Somme de v.a. indépendantes . . . . . . . . . . . . . . . . . . . 61
3.6 Exercices sur le chapitre 3 . . . . . . . . . . . . . . . . . . . . . . . . . 63

4 Espérance mathématique de variables aléatoires réelles 67


4.1 Probabilité uniforme et mesure de Lebesgue . . . . . . . . . . . . . . . 67
4.2 Variables aléatoires dans Rd . . . . . . . . . . . . . . . . . . . . . . . . 69
4.3 Espérance des v.a. réelles . . . . . . . . . . . . . . . . . . . . . . . . . 71
4.3.1 Espérance de v.a. positives . . . . . . . . . . . . . . . . . . . . 71
4.3.2 Espérance de v.a. réelles . . . . . . . . . . . . . . . . . . . . . . 74
4.4 Variables aléatoires de carré intégrable . . . . . . . . . . . . . . . . . . 76
4.4.1 Variance et Covariance . . . . . . . . . . . . . . . . . . . . . . . 76
4.4.2 Approximation linéaire . . . . . . . . . . . . . . . . . . . . . . . 78
4.5 Des inégalités fameuses . . . . . . . . . . . . . . . . . . . . . . . . . . 79
4.5.1 Inégalité de Bienaymé-Chebyshev . . . . . . . . . . . . . . . . . 79
4.5.2 Inégalité de Cauchy-Schwarz . . . . . . . . . . . . . . . . . . . 80
4.5.3 Inégalité de Jensen . . . . . . . . . . . . . . . . . . . . . . . . . 81
4.6 Loi d’un vecteur aléatoire . . . . . . . . . . . . . . . . . . . . . . . . . 82
4.6.1 Propriété de transfert . . . . . . . . . . . . . . . . . . . . . . . 82
4.6.2 Fonction de répartition . . . . . . . . . . . . . . . . . . . . . . 83
4.6.3 Variables aléatoires indépendantes . . . . . . . . . . . . . . . . 85
4.7 Premiers éléments de simulation aléatoire . . . . . . . . . . . . . . . . 88
4.7.1 Génération de la loi uniforme . . . . . . . . . . . . . . . . . . . 88
4.7.2 Simulation par inversion de la fonction de répartition . . . . . . 89
4.8 Exercices sur le chapitre 4 . . . . . . . . . . . . . . . . . . . . . . . . . 89

5 Variables aléatoires à densité 91


5.1 Notion de densité . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 91
5.2 Exemples classiques de v.a. réelles à densité . . . . . . . . . . . . . . . 95
5.3 Vecteurs aléatoires à densité . . . . . . . . . . . . . . . . . . . . . . . . 102
TABLE DES MATIÈRES 5

5.3.1 Densités marginales . . . . . . . . . . . . . . . . . . . . . . . . 103


5.3.2 Densités conditionnelles . . . . . . . . . . . . . . . . . . . . . . 104
5.3.3 Indépendance de variables aléatoires à densité . . . . . . . . . . 106
5.4 Recherche de densité . . . . . . . . . . . . . . . . . . . . . . . . . . . . 106
5.5 Simulation de suites de variables aléatoires indépendantes . . . . . . . 111
5.5.1 Inversion de la fonction de répartition . . . . . . . . . . . . . . 111
5.5.2 Méthode du rejet . . . . . . . . . . . . . . . . . . . . . . . . . . 112
5.6 Exercices sur le chapitre 5 . . . . . . . . . . . . . . . . . . . . . . . . . 114

6 Convergences et loi des grands nombres 119


6.1 Convergences de v.a. . . . . . . . . . . . . . . . . . . . . . . . . . . . 120
6.2 La loi des grands nombres . . . . . . . . . . . . . . . . . . . . . . . . . 125
6.3 Méthode de Monte-Carlo . . . . . . . . . . . . . . . . . . . . . . . . . 129
6.4 Exercices sur le chapitre 6 . . . . . . . . . . . . . . . . . . . . . . . . . 130

7 Fonctions caractéristiques et convergence en loi 133


7.1 La fonction caractéristique . . . . . . . . . . . . . . . . . . . . . . . . . 133
7.1.1 Définition et premières propriétés . . . . . . . . . . . . . . . . . 133
7.1.2 Exemples . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 135
7.1.3 Propriété fondamentale . . . . . . . . . . . . . . . . . . . . . . 137
7.1.4 Somme de vecteurs aléatoires indépendants . . . . . . . . . . . 139
7.1.5 Fonction caractéristique et moments . . . . . . . . . . . . . . . 140
7.2 Vecteurs gaussiens . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 141
7.3 Convergence en loi . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 144
7.4 Le théorème de la limite centrale . . . . . . . . . . . . . . . . . . . . . 148
7.5 Exercices sur le chapitre 7 . . . . . . . . . . . . . . . . . . . . . . . . . 152

8 Statistique : Estimation 155


8.1 Introduction à l’estimation . . . . . . . . . . . . . . . . . . . . . . . . 156
8.2 Qualités d’un estimateur . . . . . . . . . . . . . . . . . . . . . . . . . . 158
8.3 Estimateurs empiriques . . . . . . . . . . . . . . . . . . . . . . . . . . 161
8.4 Méthode de substitution . . . . . . . . . . . . . . . . . . . . . . . . . . 166
8.5 Méthode des moments . . . . . . . . . . . . . . . . . . . . . . . . . . . 166
8.6 Maximum de vraisemblance . . . . . . . . . . . . . . . . . . . . . . . . 168
8.7 Exercices sur le chapitre 8 . . . . . . . . . . . . . . . . . . . . . . . . . 172

9 Statistique : Intervalle de confiance 175


9.1 Intervalle de confiance et estimation . . . . . . . . . . . . . . . . . . . 175
9.2 Intervalles exacts pour le modèle gaussien . . . . . . . . . . . . . . . . 178
9.2.1 Estimation par intervalle de confiance de la moyenne . . . . . . 180
9.2.2 Estimation par intervalle de confiance de la variance . . . . . . 183
9.3 Résultats asymptotiques . . . . . . . . . . . . . . . . . . . . . . . . . . 186
9.3.1 Intervalles de confiance asymptotiques . . . . . . . . . . . . . . 186
9.3.2 Sondages . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 187
6 TABLE DES MATIÈRES

9.3.3 Calcul d’intégrale par la méthode de Monte-Carlo . . . . . . . 189


9.4 Exercices sur le chapitre 9 . . . . . . . . . . . . . . . . . . . . . . . . . 191

10 Statistique : Test 193


10.1 Tests et erreurs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 194
10.2 Modèle gaussien . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 197
10.2.1 Tests pour la moyenne µ . . . . . . . . . . . . . . . . . . . . . . 197
10.2.2 Tests pour la variance σ 2 . . . . . . . . . . . . . . . . . . . . . 198
10.3 Test du χ2 (test du chi-deux) . . . . . . . . . . . . . . . . . . . . . . . 199
10.3.1 Test d’adéquation à une loi . . . . . . . . . . . . . . . . . . . . 199
10.3.2 Test d’adéquation à une famille de lois . . . . . . . . . . . . . . 203
10.3.3 Test d’indépendance . . . . . . . . . . . . . . . . . . . . . . . . 206
10.4 Exercices sur le chapitre 10 . . . . . . . . . . . . . . . . . . . . . . . . 207

11 Corrections des exercices 209


11.1 Corrigés des exercices du chapitre 2. . . . . . . . . . . . . . . . . . . . 209
11.2 Corrigés des exercices du chapitre 3. . . . . . . . . . . . . . . . . . . . 214
11.3 Corrigés des exercices du chapitre 4. . . . . . . . . . . . . . . . . . . . 219
11.4 Corrigés des exercices du chapitre 5. . . . . . . . . . . . . . . . . . . . 219
11.5 Corrigés des exercices du chapitre 6. . . . . . . . . . . . . . . . . . . . 225
11.6 Corrigés des exercices du chapitre 7. . . . . . . . . . . . . . . . . . . . 228
11.7 Corrigés des exercices du chapitre 8. . . . . . . . . . . . . . . . . . . . 232
11.8 Corrigés des exercices du chapitre 9. . . . . . . . . . . . . . . . . . . . 235
11.9 Corrigés des exercices du chapitre 10 . . . . . . . . . . . . . . . . . . . 240

12 Textes et corrigés d’examens 241

Bibliographie 261

Index 263
Chapitre 1

Introduction

A quoi tu penses ?

Je pense que,

si en ouvrant un dictionnaire au hasard, on tombait sur le


mot hasard, ce serait un miracle, alors que si on tombait
sur le mot miracle, ce serait un hasard.
H. Le Tellier, Les amnésiques n’ont rien vécu d’inoubliable.

Il peut paraı̂tre irréaliste et prétentieux de vouloir, de par sa nature même, quanti-


fier le hasard. C’est pourtant ce qui a conduit à la notion de Probabilité. Nous
allons dans ce livre introduire ce concept mathématique, dont la puissance permet-
tra de modéliser d’innombrables situations où le hasard intervient, dépassant ainsi
largement le cadre restreint des jeux de dés et tirages de cartes. La modélisation
probabiliste est fondamentale dans tous les domaines d’applications, qu’ils soient is-
sus des sciences dures ou des sciences humaines, de la physique (physique quantique,
physique des particules), de la climatologie, de la biologie (mutations du génôme),
de l’écologie (variabilité des comportements individuels ou variations environnemen-
tales), de l’informatique et des réseaux de télécommunications, du traitement du si-
gnal et de la parole, de la médecine (imagerie médicale), de l’économie, l’assurance,
la finance (marchés boursiers), ou de la sociologie.

7
8 Chapitre 1 – Introduction

1.1 Avant-propos

Le mot Hasard est un mot d’origine arabe : az-zahr, le dé. Il est apparu en français
pour signifier tout d’abord un jeu de dés, puis plus généralement un événement non
prévisible, et par extension le mode d’apparition de ce type d’événement.

Dans la vie quotidienne, chacun est familier avec le mot et même le concept de pro-
babilité : probabilité qu’il pleuve la semaine suivante, probabilité d’avoir une fille aux
yeux bleus, probabilité de gagner au loto ou celle d’être dans la bonne file au super-
marché. Les assurances fixent le contrat d’assurance-vie d’un individu de 20 ans, grâce
à une estimation de sa probabilité de survie à 80 ans. Dans de nombreux domaines,
les probabilités interviennent : les entreprises cherchent à calculer le besoin probable
de leurs produits dans le futur, les médecins cherchent à connaı̂tre les probabilités
de succès de différents protocoles de soin, les compagnies pharmaceutiques doivent
estimer les probabilités d’apparitions d’effets secondaires pour leurs médicaments. Un
exemple récent et spectaculaire est celui de l’utilisation des probabilités en économie,
et en particulier en finance. Nous pouvons citer également d’autres domaines d’appli-
cations extrêmement importants et en pleine expansion, aussi variés que le calcul de
structures, la théorie du signal, l’optimisation et le contrôle des systèmes, l’imagerie
médicale, la génomique et la théorie de l’évolution.

Les probabilités sont en lien étroit avec la vie quotidienne. A ce titre, elles s’appuient
sur un passage du concret à l’abstrait : la modélisation mathématique. En effet, la
première difficulté face à un problème concret va être de transformer cette réalité phy-
sique en un modèle mathématique abstrait qu’il est possible d’étudier et sur lequel des
calculs peuvent être menés. Il est alors possible de fabriquer des expérimentations fic-
tives du problème concret sur ordinateur, que l’on appelle des simulations numériques,
obtenues à partir du modèle mathématique. Ces simulations sont utilisées, soit à des
fins descriptives, soit à des fins numériques.

Pour pouvoir modéliser les innombrables situations, de natures très différentes, où le
hasard intervient, un cadre très général d’étude est nécessaire. Ce cadre abstrait a été
défini rigoureusement par Andrei Kolmogorov en 1933 (donc très récemment), sous le
nom de modèle probabiliste. Sa définition a nécessité préalablement le développement
de théories d’analyse importantes telles le calcul intégral et la théorie de la mesure.

C’est ce grand écart entre l’apparente simplicité de certains problèmes probabilistes


concrets, et l’abstraction que nécessite leur résolution, qui peut rendre le monde
de l’aléatoire difficile ou inquiétant, mais c’est aussi ce qui en fait un domaine
mathématique fascinant et palpitant.
1.2 – Phénomènes aléatoires 9

1.2 Phénomènes aléatoires

Le but de ce cours est d’introduire les notions de base de la théorie des probabilités,
et surtout de permettre d’acquérir le raisonnement probabiliste. Cette théorie des
probabilités ne peut se construire axiomatiquement qu’en utilisant la théorie de la
mesure et de l’intégration, ce qui en constitue une des difficultés principales. Nous
n’en donnerons dans ce texte que les éléments nécessaires à sa bonne compréhension,
sans exiger de prérequis dans ce domaine. (Mais nous remarquerons que la théorie des
probabilités constitue un très bel exemple d’application de la théorie de l’intégration).

L’objet de la théorie des probabilités est l’analyse mathématique de phénomènes


dans lesquels le hasard intervient. Ces phénomènes sont appelés des phénomènes
aléatoires.

Définition 1.1 Un phénomène est dit aléatoire si, reproduit maintes fois dans des condi-
tions identiques, il se déroule chaque fois différemment de telle sorte que le résultat de
l’expérience change d’une fois sur l’autre de manière imprévisible.

Nous pouvons donner des exemples variés de tels phénomènes :


• Jeu de Pile ou Face
• Jeu de lancer de dés
Dans ces deux exemples, la différence entre les résultats, si l’on réitère l’expérience,
peut être liée à l’impulsion initiale communiquée au dé, à la rugosité de la table,
aux vibrations du plancher... Le hasard est l’illustration de la méconnaissance des
conditions initiales, car la pièce ou le dé ont des trajectoires parfaitement définies par
la mécanique classique.
• Durée de vie d’une ampoule électrique
• Temps de passage d’un bus
• Nombre de voitures passant une borne de péage
• Promenade d’un ivrogne : un pas en avant, deux pas en arrière...
• Position d’un impact sur une cible, dans un jeu de fléchettes
• Evolution du prix d’un actif financier au cours du temps
• Mutations dans le génôme.
Ces exemples présentent comme point commun des variations liées à la présence de
facteurs extérieurs, influant sur le résultat de l’expérience, et que l’on ne sait pas
contrôler. De nombreux effets physiques fonctionnent ainsi, et chaque phénomène
déterministe est inévitablement accompagné d’écarts aléatoires. Dans certains cas, il
est possible de négliger les éléments aléatoires et de remplacer le phénomène réel par
un schéma simplifié, en sélectionnant pour ce faire les paramètres les plus importants
(comme par exemple en mécanique classique). Mais cette approximation n’est pas tou-
jours possible et il est souvent fondamental de pouvoir quantifier les écarts aléatoires.
10 Chapitre 1 – Introduction

Dans d’autres domaines, tels la physique quantique, l’aléatoire fait intrinsèquement


partie de la théorie, et certaines mesures ne peuvent être connues qu’aléatoirement
dans un ensemble de résultats possibles.

1.3 Deux idées majeures et incontournables

Deux idées majeures illustrent la théorie des probabilités et son extrême richesse :
la loi des grands nombres et le conditionnement (lié à la notion d’indépendance).
Ces deux notions formeront l’ossature de ce cours et méritent d’être assimilées en
profondeur.

1.3.1 La loi des grands nombres

La notion de hasard, ou d’aléatoire, est souvent liée à la méconnaissance de pa-


ramètres intervenant dans une expérience, ou à la trop grande multitude de ceux-ci.
Néanmoins, bien que ces comportements aléatoires soient a priori sujets à des varia-
tions imprévisibles, nous serons capables de donner des renseignements sur ce type de
phénomènes. L’idée majeure est que ces informations seront données par la répétition
de l’expérience.

En effet, l’observation d’un grand nombre de répétitions d’un même phénomène


aléatoire permet d’y déceler généralement des lois régissant les résultats, tout à fait
déterminées, stables. Par exemple, pour toute pièce non truquée d’un jeu de Pile ou
Face, et quelque soit l’endroit où se déroule le jeu, 1000 lancers de la pièce donneront
environ 50% de piles et 50% de faces. De même, l’étude de la répartition des tailles
d’un groupe d’individus, et quel que soit l’échantillon pris dans ce groupe, montre
qu’il y aura toujours une courbe des répartitions de même type. Il va être ainsi pos-
sible de prévoir la fréquence d’apparition de chaque résultat, la valeur moyenne de
ces résultats et les oscillations autour de cette valeur moyenne.

C’est cette stabilité confirmée par l’expérience qui s’appelle Loi des grands
nombres, et qui légitime l’utilisation d’un modèle mathématique.

1.3.2 Conditionnement et indépendance

La construction d’un modèle probabiliste repose sur l’information connue a priori sur
l’expérience aléatoire. Ce modèle permet de quantifier les probabilités de réalisation de
certains résultats de l’expérience. Il est fondamental de remarquer que si l’information
change, les probabilités de réalisation changent. Par exemple, la chance de choisir au
1.4 – Les variables aléatoires 11

hasard un homme de plus de 100 kilos parmi 1000 hommes de la population française
est plus grande si le groupe est composé d’hommes de plus de 1,80m que si le groupe
est composé d’hommes de moins de 1,65m. La richesse du modèle probabiliste que nous
allons construire réside dans le fait que si l’information change par rapport au modèle
initial, les nouvelles chances de réalisation pourront être calculées. Ce raisonnement
lié à l’information a priori se résume en théorie des Probabilités par le mot condition-
nement. Quand l’information donnée a priori sur un phénomène aléatoire n’a aucune
influence sur la réalisation d’un autre phénomène, par exemple deux tours successifs
de roulette dans un casino, ces phénomènes aléatoires sont dits indépendants. Cette
hypothèse d’indépendance sera fondamentale dans toute la théorie, et simplifiera de
nombreux calculs.

1.4 Les variables aléatoires

1.4.1 Loi d’une variable aléatoire

Nous allons dans ce livre étudier des fonctions qui dépendent du résultat de
l’expérience aléatoire sous-jacente. Elles sont appelées variables aléatoires, car leurs
valeurs varient en fonction du hasard. Plutôt que de chercher les antécédents de chaque
valeur possible de la fonction, nous allons nous intéresser à la chance de réalisation
de l’ensemble des antécédents qui permettent à la fonction d’être égale à une de ces
valeurs ou d’appartenir à un ensemble de ces valeurs. C’est cela que nous appellerons
la loi de la variable aléatoire. Cette notion de loi d’une variable aléatoire est à la base
du raisonnement probabiliste moderne.

1.4.2 Simulation de variables aléatoires

La simulation consiste en une expérimentation fictive sur machine d’un phénomène


modélisé. Elle permet de visualiser une expérience aléatoire, de calculer des quantités
numériques et de vérifier certains résultats théoriques.

La méthode de simulation probabiliste la plus célèbre est la méthode de Monte-Carlo,


du nom du quartier où se trouve le casino de Monaco. Elle consiste à effectuer certains
calculs (calculs d’intégrales notamment) par de nombreuses simulations numériques
de réalisations indépendantes de variables aléatoires de loi donnée. Ce procédé est
fondé sur la loi des grands nombres qui en assure la convergence. Mais, pour obtenir
une précision acceptable, nous verrons qu’il faut accomplir une grande quantité de
simulations, ce qui explique que la méthode n’a pu se développer de manière signifi-
cative que depuis l’introduction d’ordinateurs performants.
12 Chapitre 1 – Introduction

L’outil de base est un générateur de nombres au hasard qui simule une variable
aléatoire de loi uniforme. La plupart des langages de programmation et des logiciels
mathématiques en possèdent un :
• la méthode [Link] en Java,
• la fonction rand sous Matlab ou Scilab,
• la bibliothèque [Link] en Python.
Ainsi, par exemple, l’application répétée de la fonction rand fournit une suite de
nombres indépendants les uns des autres et uniformément répartis sur [0, 1]. Nous
verrons comment, à partir de ce générateur, nous pouvons simuler de nombreux types
de loi.

1.5 Historique

La notion de modèle abstrait commun à des expériences variées a mis beaucoup de


temps à émerger. Le hasard étant par nature pour nos ancêtres une représentation du
divin, il a fallu, pour définir la notion de probabilité, attendre une certaine maturité
de la pensée. Il y a très peu d’écrits anciens concernant le calcul des probabilités. Au
4ème siècle, l’existence d’une science des jeux de dés apparaı̂t dans le Mahabharata
(célèbre ouvrage indien), de même que ses rapports étroits avec une évaluation de
type sondage (cf. Hacking). Mais les premières références publiées sur les chances de
gagner au jeu datent de Cardan (1501-1576) dans son livre De Ludo Alea. Des calculs
de probabilité apparaissent aussi dans les œuvres de Kepler (1571-1630) et de Galilée
(1564-1642). Le calcul probabiliste se développe au cours du 17ème siècle, motivé
en particulier par l’engouement frénétique pour les jeux de hasard à cette époque. Le
sujet commence réellement à être rigoureusement développé par Pascal (1623-1662) et
Fermat (1601-1665) vers 1654, comme un calcul combinatoire, à partir de paradoxes
issus de ces jeux (les paradoxes du Chevalier de Méré que l’on verra au Chapitre
2). Dès 1657, Huyghens (1629-1695) rédige un mémoire amplifiant sensiblement les
résultats de Pascal et Fermat, et son travail reste jusqu’à la fin du 17ème siècle
l’exposé le plus profond de calcul des Probabilités. Bernoulli (1654-1705) établit la
loi des grands nombres sous sa forme la plus simple, résultat fondamental qu’il dit
avoir médité vingt ans. Vers la fin du 17ème siècle, une autre impulsion au calcul des
probabilités vient d’Angleterre et de Hollande, motivée par des problèmes d’assurance
(Halley (1656-1742), De Witt (1625-1672)). En effet, l’évaluation des populations (par
exemple : tables de mortalité et rentes viagères) devient une discipline essentielle à la
gouvernance moderne des états.

La théorie des probabilités se construit dans la modélisation d’une réalité qui n’est pas
forcément (pas souvent) de nature physique. Pascal la croit utilisable en théologie. Le
célèbre Pari de Pascal montre que croire en Dieu est une solution statistiquement plus
avantageuse, en supposant au préalable que les deux hypothèses d’existence ou non de
Dieu ont la même probabilité. Leibniz (1646-1716), et plus tard Laplace (1749-1827),
1.5 – Historique 13

Poisson (1781-1840) (Recherches sur la probabilité des jugements en matière criminelle


et matière civile), l’appliquent aux controverses juridiques. Les probabilités sont un
outil privilégié de modélisation des comportements humains, comme en témoigne
l’intérêt récurrent des philosophes pour leurs fondements.

De Moivre (1667-1754) et Euler (1707-1803) développent les idées de Pascal et Fer-


mat, Bayes (1671-1746) introduit la notion de probabilité conditionnelle (probabilité
a priori), mais faute d’outils mathématiques puissants, il faut pour développer plus
avant la théorie, attendre Laplace (1749-1827). Celui-ci donne une application ma-
gistrale du calcul différentiel et intégral à la théorie des probabilités dans son très
important Traité analytique des probabilités (en 1812). Laplace formule le postulat du
déterminisme universel. Cette intelligence est un idéal, un horizon, que notre science
ne nous permet pas d’atteindre. Le calcul des probabilités est imaginé comme un
outil permettant de pallier cette faiblesse. Laplace permet à la discipline de dépasser
définitivement sa première phase combinatoire. Il met en avant le rôle de la loi nor-
male et démontre une version du théorème de la limite centrale. Gauss (1777-1855)
développe intensément la théorie. Dans les pays anglo-saxons se développe également
l’outil statistique, avec l’étude des données et l’analyse prédictive à partir de ces
données. Le mot ”statistique” vient du mot ”état”, et cette science a été, depuis
cette époque, un outil puissant pour les organismes de décisions. Elle se développe en
utilisant le support d’un modèle probabiliste.

Le développement des probabilités grâce aux méthodes d’analyse occupe le 19ème


siècle et le début du 20ème siècle, fondé en particulier sur les travaux de Borel (1871-
1956) et de Lebesgue (1875-1941) sur la théorie de la mesure. Les avancées au 19ème
siècle de la physique statistique (Maxwell (1831-1879), Boltzmann (1844-1906)) ap-
portent un nouveau point de vue qui dépasse les idées rationalistes de Laplace et per-
met d’envisager que le hasard est une réalité objective indépendante de nos connais-
sances, conformément aux idées du philosophe Cournot (1801-1877) qui le premier
affirme que le hasard et le déterminisme sont compatibles entre eux. Le principe d’in-
certitude d’Heisenberg montrera ultérieurement (1927) l’impossibilité de connaı̂tre
avec une infinie précision la position et la vitesse d’une particule ; on ne peut les
connaı̂tre qu’à l’aide d’une loi de probabilité.

Sous l’incitation de problèmes de physique statistique, mais aussi de démographie,


commence à se dégager, vers la fin du 19ème siècle, la notion fondamentale de fonc-
tion aléatoire, destinée à rendre compte d’un phénomène aléatoire qui évolue au
cours du temps. Les probabilités entrent à cette époque dans une nouvelle phase
de développement. Dès 1875, Galton (1822-1911) et Watson (1827-1903) étudient
l’évolution du nombre d’individus d’une population au cours de ses générations suc-
cessives, mettant en évidence un exemple de processus aléatoire qui sera introduit dans
toute sa généralité par Markov (1856-1922). Einstein (1879-1955) vers 1905 s’intéresse
à la notion de mouvement Brownien. Brown avait déjà observé le mouvement d’une
particule de pollen sur la surface de l’eau, heurtée de toutes parts par des molécules
14 Chapitre 1 – Introduction

d’eau ; ce mouvement paraı̂t totalement désordonné. En fait, Bachelier (1870-1946)


avait lui aussi introduit le mouvement brownien en 1900 pour modéliser la dynamique
d’un cours boursier. Ce processus aléatoire, évoluant de manière apparemment tota-
lement erratique, s’est avéré être un outil fondamental de modélisation probabiliste
dès lors que l’on s’intéresse à un phénomène aléatoire évoluant continûment au cours
du temps.

La période moderne, caractérisée par l’étude systématique des processus aléatoires,


débute vers 1930. Dans les Fondements de la Théorie des Probabilités que Kolmogorov
(1903-1987) publie en 1933 apparaı̂t l’axiomatique rigoureuse, fondée sur la théorie
de la mesure et de l’intégrale de Lebesgue et qui sera universellement adoptée ensuite.
L’expression mathématique donnée ainsi aux concepts confère à ceux-ci une clarté et
une maniabilité beaucoup plus grandes, et cette axiomatique s’est révélée indispen-
sable dans l’étude de tous les modèles dynamiques. Après le travail fondamental de
Kolmogorov, Lévy (1886-1971), donne le ton pour les probabilités modernes par son
travail sur les processus stochastiques, ainsi que sur les fonctions caractéristiques et
les théorèmes limites. Mentionnons ici le rôle essentiel joué par les écoles russes et
japonaises et notamment par Itô (prix Gauss 2006), qui définit une notion d’intégrale
par rapport au mouvement brownien et, grâce à elle, conduit à la création d’un calcul
intégral, appelé calcul stochastique, pour certaines familles de processus stochastiques.
Ces résultats avaient été, en partie et de manière totalement indépendante, découverts
par le mathématicien français Doeblin pendant la deuxième guerre mondiale. Celui-ci
sentant sa fin proche (il est mort en 1940 dans les Ardennes) envoya ses trouvailles
sous forme d’un  pli cacheté  à l’Académie des Sciences. Ce pli a été découvert et
ouvert il y a seulement quelques années et a suscité une grande émotion.

De nos jours, l’Ecole française de Probabilités est très active. La première Médaille
Fields décernée à un probabiliste a et́é attribuée à Wendelin Werner en 2006. Les pro-
babilités se développent de plus en plus, alimentées en particulier de manière essen-
tielle par la physique, le développement des réseaux de télécommunications, la finance,
et plus récemment, par la biologie et la médecine. Elles permettent de construire des
modèles mathématiques, qui peuvent être validés par les données suivant la théorie
statistique, et fournissent également des possibilités d’expérimentations fictives dans
de multiples domaines d’applications.
Chapitre 2

Espace de probabilité

On ne peut guère donner une définition satisfaisante de la probabilité. La définition


complète de la probabilité est donc une sorte de pétition de principe.

Henri Poincaré (1854-1912) - Calcul des Probabilités.

2.1 Le langage des probabilités

2.1.1 Information issue d’une expérience aléatoire

L’ensemble de tous les résultats possibles d’une expérience aléatoire est appelé
espace fondamental et sera noté Ω. Ses éléments, notés classiquement ω ∈ Ω, sont
aussi appelés événements élémentaires.

Un événement est un sous-ensemble de Ω dont on peut dire au vu de l’expérience


s’il est réalisé ou non. On notera P(Ω) l’ensemble de toutes les parties de Ω.

L’espace fondamental Ω peut prendre diverses formes. En voici quelques exemples.

Exemple 2.1
1. Deux Lancers d’une pièce à Pile ou Face : Ω = {P P, P F, F P, F F }. Le sous-
ensemble {P P, P F, F P } est l’événement “obtenir au moins un P ”.
2. Lancer simultané de deux pièces identiques à Pile ou Face : Ω = {P P, P F, F F },
puisque l’expérience aléatoire ne permet pas l’accès à l’ordre d’obtention de P
et F . Le sous-ensemble {P P, P F } est l’événement “obtenir au moins un P ”.

15
16 Chapitre 2 – Espace de probabilité

3. Lancer d’un dé : Ω = {1, 2, 3, 4, 5, 6}. Le sous-ensemble {2, 4, 6} est l’événement


“obtenir un chiffre pair”.
4. Nombre de passages de véhicules à une borne de péage pendant une journée :
Ω = N. Le sous-ensemble {104 , . . . , 105 } est l’événement “le nombre de passages
de véhicule à cette borne de péage est compris entre 104 et 105 ”.
5. Durée de vie d’une ampoule électrique : Ω = [0, +∞[. Le sous-ensemble
[0, 2500] est l’événement “la durée de vie de l’ampoule est inférieure ou égale
à 2500 heures”.
6. Envoi d’une fléchette sur une cible circulaire de 30 cm de diamètre.
L’expérience consiste à décrire le point d’impact de la fléchette
pdans un repère
orthonormé de centre le centre de la cible : Ω = {(x, y) ∈ R2 , x2 + y 2 ≤ 15}.
Le sous-ensemble {x2 + y 2 ≤ 2} est l’événement “le point d’impact de la
fléchette est à 2 cm du centre de la cible”.
7. Temps de passage des véhicules à une borne de péage : Ω = (R+ )N .
8. Prix d’un actif financier sur un intervalle de temps [t1 , t2 ] : Ω = C([t1 , t2 ], R+ ),
ensemble des fonctions continues de [t1 , t2 ] dans R+ . Le sous-ensemble {ω ∈
C([t1 , t2 ], R+ ) : supt∈[t1 ,t2 ] ω(t) ≤ α} est l’événement “le prix de l’actif ne
dépasse pas le seuil α pendant l’intervalle de temps [t1 , t2 ]”.
9. Vitesse d’une molécule dans un gaz raréfié sur un intervalle de temps [t1 , t2 ] :
Ω = D([t1 , t2 ], R3 ), l’ensemble des fonctions continues à droite et avec limites
à gauche de [t1 , t2 ] dans R3 .

Ainsi, l’espace fondamental peut être fini (exemples 1 à 3), infini dénombrable
(exemple 4), ou infini non dénombrable (exemples 5 à 9). Il peut être dépourvu d’une
structure topologique naturelle, comme dans l’exemple 1, ou en avoir une plus ou
moins riche. Cela permet de réaliser la richesse de la théorie qu’il faut mettre en place
afin d’englober tous ces cas.

Le modèle abstrait que nous allons construire est fondé sur la modélisation de l’in-
formation qui est définie mathématiquement par le choix de la famille des événements
(sous-ensembles de Ω) qui peuvent être discernés par l’expérience aléatoire. La
définition suivante permet de mettre en place cette notion en suivant l’intuition de
l’information révélée par une telle expérience aléatoire.

Définition 2.2 Une classe A ⊂ P(Ω) est appelée tribu ou σ−algèbre si :


(A1) Ω ∈ A.
(A2) A est stable par passage au complémentaire : A ∈ A ⇒ Ac ∈ A.
(A3) A est stable par réunion dénombrable, i.e. si (An )n∈N est une suite d’éléments
de A, alors ∪n∈N An est dans A.

Notons que (A1) et (A2) impliquent qu’une tribu A contient nécessairement ∅ = Ωc


2.1 – Le langage des probabilités 17

et que la combinaison de (A2) et (A3) implique que A est stable par intersection
dénombrable.

Notons également que (A3) n’implique pas que A soit stable par réunion ou intersec-
tion infinie non dénombrable. Cependant en considérant le cas particulier A0 = A et
An = B pour n ≥ 1 dans (A3), on obtient la condition plus faible suivante.

Définition 2.3 Une classe A ⊂ P(Ω) est dite additive si elle vérifie :
(A3)f A est stable par union finie : si A, B ∈ A, alors A ∪ B ∈ A.

Si Ω est fini, alors A ⊂ P(Ω) est finie, et (A3) est équivalente à (A3)f .

Remarque fondamentale : Dans la modélisation de notre phénomène aléatoire, la


tribu représente un ensemble de parties de Ω (parties composées de certains résultats
de l’expérience) dont on va pouvoir mesurer la chance de réalisation. C’est pour un
élément A de cette tribu que nous allons être capable de définir sa probabilité de réalisation
P(A), tandis que P(A) n’aura pas de sens dès lors que A n’appartient pas à la tribu A.

Exemple 2.4 (i) A = {∅, Ω} est la tribu grossière, ou triviale : c’est la plus petite
tribu de Ω.
(ii) L’ensemble P(Ω) des parties de Ω est une tribu sur Ω. C’est celle que nous choi-
sirons systématiquement si Ω est un ensemble fini ou dénombrable. Cependant, pour
des raisons fondamentales que nous indiquerons ultérieurement, cette tribu sera trop
grande dès que Ω est infini non dénombrable pour que l’on puisse définir la probabilité
de tous ses éléments de manière non triviale.

En dehors des cas très simples, il est souvent impossible de lister les éléments
d’une algèbre ou d’une σ−algèbre. Il est alors commode de les caractériser par des
sous-ensembles “assez riches”. D’après la définition d’une tribu, on voit que toute
intersection (même infinie non dénombrable) de tribus est une tribu. Comme P(Ω)
est une tribu, on peut définir la notion suivante.

Définition 2.5 Soit C ⊂ P(Ω). La tribu engendrée par C est la plus petite tribu conte-
nant C et est donnée par
T
σ(C) = A.
A tribu, C⊂A⊂P (Ω)

Exemple 2.6 (i) La tribu engendrée par un ensemble A ⊂ Ω est {∅, A, Ac , Ω}.
(ii) Si (Ai )i∈I est une partition finie ou dénombrable de Ω (i.e. les Ai sont deux-à-
deux disjoints et leur réunion est Ω), la tribu engendrée par {Ai , i ∈ I} est l’ensemble
des réunions BJ = ∪i∈J Ai , où J décrit la classe de toutes les parties de I.
18 Chapitre 2 – Espace de probabilité

Définition 2.7 Si Ω est un espace topologique 1 , on appelle tribu borélienne la tribu


engendrée ses ouverts.

À titre d’exemple, la tribu borélienne de R est la tribu engendrée par la classe des
intervalles ouverts de R. Le résultat suivant montre qu’on peut se restreindre aux
intervalles (ouverts ou fermés) non bornés à gauche (ou à droite). La démonstration
est un très bon exercice de maniement des tribus :

Proposition 2.8 La tribu borélienne de R est la tribu engendrée par les intervalles
de la forme ] − ∞, a] pour a ∈ Q.

Preuve. Rappelons que toute tribu est stable par passage au complémentaire, par
réunion ou intersection dénombrable. Puisque ] − ∞, a] est le complémentaire de l’in-
tervalle ouvert ]a, +∞[, ce dernier appartient à la tribu borélienne, et donc la tribu
C engendrée par ces intervalles est incluse dans la tribu borélienne. Réciproquement,
soit ]x, y[ un intervalle ouvert de R. Soit (xn )n une suite de rationnels décroissant vers
x et (yn )n une suite de rationnels croissant strictement vers y. On a :
[
] − ∞, yn ]∩] − ∞, xn ]c .

]x, y[=
n

Nous en déduisons que tout intervalle ouvert appartient à C, d’où le résultat. 

2.1.2 Probabilité - Premières propriétés

Nous cherchons à définir, pour un événement A ∈ A, la vraisemblance accordée a


priori à A (avant le résultat de l’expérience). Nous voulons donc associer à chaque
événement A un nombre P(A) compris entre 0 et 1, qui représente la chance que cet
événement soit réalisé à la suite de l’expérience.

Pour justifier notre définition d’une probabilité, nous allons faire appel à notre in-
tuition et discuter la signification usuelle de ce qu’est la probabilité d’un événement.
Considérons un événement A pouvant se produire lors d’une certaine expérience
aléatoire (par exemple, A = obtenir Pile  lors du lancer d’une pièce). Supposons
que l’on puisse répéter un grand nombre n de fois cette expérience aléatoire. Notons
n(A) le nombre de fois où l’événement A se produit. La fréquence de réalisation de A,
n(A)
fn (A) = ,
n
1. Un espace topologique est muni d’une famille d’ouverts contenant l’ensemble vide, stable par
union quelconque, et stable par intersection finie.
2.1 – Le langage des probabilités 19

est elle-même aléatoire. Mais notre expérience courante tend à nous faire penser que,
lorsque le nombre n de répétitions de l’expérience augmente, fn (A) se stabilise autour
d’une valeur limite déterministe (on peut penser que fn (A) tend vers 1/2 dans le cas
où A est l’événement  obtenir Pile  lors du lancer d’une pièce non biaisée). Cette
limite est notre idée intuitive de la probabilité P(A) de l’événement A. L’approche
intuitive et naturelle consiste donc à définir P(A) comme étant la limite quand n tend
vers l’infini des fréquences de réalisation fn (A) :
P(A) = limite de fn (A) quand n ↑ +∞. (2.1)
Nous donnerons ultérieurement une justification et un sens précis à cette limite, grâce
à la loi des grands nombres, qui est un des théorèmes fondamentaux de la théorie,
justifiant toute la construction mathématique. Des propriétés évidentes vérifiées par
les fréquences de réalisation sont les suivantes :
fn (A) ∈ [0, 1] ; fn (Ω) = 1 ;
Si A et B sont disjoints, alors fn (A ∪ B) = fn (A) + fn (B) ;
Ceci motive la définition générale 2.9 d’une probabilité. On dira qu’une suite
d’événement (An )n sont 2à2 disjoints si Ai ∩ Aj = ∅ pour tous i 6= j

Définition 2.9 Soit A une tribu sur Ω. Une probabilité sur (Ω, A) est une application
P : A −→ [0, 1]
vérifiant les deux propriétés suivantes :
• Masse totale unitaire : P(Ω) = 1, (2.2)
X
• σ−additivité : P(∪n An ) = P(An ), pour tout (An )n ⊂ A, 2à2 disjoints. (2.3)
n

Remarque : La probabilité P (dite aussi mesure de probabilité) est une mesure abstraite
de masse 1 sur l’espace mesurable (Ω, A). Le cadre dans lequel nous travaillons est
mathématiquement développé par la théorie de la mesure, mais nous n’invoquerons
aucun résultat général de cette théorie.

La propriété de σ-additivité (2.3) est plus forte que la propriété


• additivité : P(A1 ∪ A2 ) = P(A1 ) + P(A2 ), pour tous A1 , A2 ∈ A disjoints. (2.4)
Pour le voir, nous commençons
P par appliquer (2.3) avec An = ∅ pour tout n ∈ N : si
a = P(∅), nous obtenons n a = a, ce qui entraı̂ne a = 0. Ensuite, si A, B ∈ A sont
0 = A, A1 = B et An = ∅ pour tout n ≥ 2, ce
disjoints, nous appliquons (2.3) avec AP
qui donne P(A ∪ B) = P(A) + P(B) + n≥2 P(∅) = P(A) + P(B), d’où (2.4).

Notons cependant que les propriétés de σ−additivité (2.3) et d’addivité (2.4) sont
équivalentes dans le cadre d’un espace fondamental Ω fini.
20 Chapitre 2 – Espace de probabilité

Corollaire 2.10 Une probabilité vérifie de plus :

• P(∅) = 0 (2.5)
c
• P(A) + P(A ) = 1, (2.6)
n
X
• P(∪ni=1 Ai ) = P(Ai ) , si les Ai sont 2à2 disjoints, (2.7)
i=1
• P(A ∪ B) + P(A ∩ B) = P(A) + P(B), (2.8)
• P(A) ≤ P(B) si A ⊂ B. (2.9)

Preuve. La propriété (2.5) se montre en appliquant (2.4) avec A = B = ∅, et (2.6)


s’obtient de la même façon avec A et Ac . Pour prouver (2.8), nous décomposons
l’ensemble A en l’union des deux ensembles disjoints A ∩ B et son complémentaire
A\B = A ∩ B c , et de même pour B, comme cela est représenté dans la figure 2.1.
L’inégalité (2.9) se déduit de (2.4) avec B = A ∪ (B\A). 

U C B
B A
U C
A B U
A B

Figure 2.1 – A, B, A ∩ B c , A ∩ B, B ∩ Ac et A ∪ B

Remarque 2.11 (Pourquoi l’additivité ne suffit-elle pas ?) Nous allons nous


en rendre compte à travers d’un jeu à Pile ou Face. Si nous jouons n fois, l’espace
Ω naturel est l’ensemble {P, F }n (ensemble des mots de n lettres avec un alphabet
à deux lettres P et F ). C’est un ensemble fini de cardinal 2n . Si la pièce n’est pas
truquée, les probabilités de chaque tirage sont égales et nous nous retrouvons dans le
cadre de la combinatoire (voir exemple 2.18). Ainsi,

card(A)
Pn (A) = pour tout A ⊂ Ω.
2n
Supposons maintenant que le jeu se poursuive indéfiniment. L’espace fondamen-

tal devient Ω = {P, F }N , c’est-à-dire l’ensemble des mots de longueur infinie,
avec le même alphabet à deux lettres P et F . C’est un ensemble infini. Essayons
d’évaluer la probabilité P(A) de l’événement A = “on ne tire jamais Pile”. Soit
An = “on ne tire aucun Pile lors des n premiers tirages”. D’après l’expression de
Pn (A) ci-dessus, nous avons P(An ) = Pn (An ) = 2−n . Remarquons que A est la limite
2.1 – Le langage des probabilités 21

naturelle des ensembles An , au sens où les An sont décroissants (i.e. An+1 ⊂ An ) et
où A = ∩n An . Il est alors naturel d’écrire que
P(A) = lim P(An ) = 0,
n→∞

ce qui ne peut pas être justifié par la propriété d’additivité (2.4). La proposition 2.12
dit que la σ−additivité permet exactement de justifier ce passage à la limite.

Nous utilisons les notations suivantes. Une suite (An )n ⊂ P(Ω) est dite
décroissante si An+1 ⊂ An pour tout n. Pour une telle suite, on définit A = ∩n An ,
et on écrit An ↓ A ou limn ↓ An = A. De même, la suite (An )n est croissante si
An ⊂ An+1 pour tout n, on définit A = ∪n An et on écrit An ↑ A ou limn↑ An = A.

Proposition 2.12 Soit P : A → [0, 1] une application vérifiant (2.2) et (2.4). Alors,
il y a équivalence entre :
(i) La propriété de σ-additivité (2.3).
(ii) Pour toute suite (An )n croissante, on a P (limn↑ An ) = limn ↑ P(An ).
(iii) Pour toute suite (An )n décroissante, on a P (limn↓ An ) = limn ↓ P(An ).

En particulier que si (An )n est une suite croissante ou décroissante d’événements, la


suite (P(An ))n admet une limite quand n tend vers l’infini.

Preuve. Etant donné (2.6), on a (ii) ⇔ (iii). Montrons que (i) ⇔ (ii).
Supposons d’abord (ii). Considérons une suite (An )n d’éléments de A deux-à-deux
P Bn = ∪p≤n Ap et B =
disjoints, et posons P ∪n An . Comme P vérifie (2.4), elle vérifie
(2.7) et P(Bn ) = p≤n P(Ap ) croı̂t vers n P(An ) et aussi vers P(B) par (ii). Nous
avons donc (i).
Supposons maintenant (i). Soit An ∈ A pour n ≥ 0, avec An ↑ A. Soit aussi B0 = A0 ,
et définissons par récurrence Bn = An \Bn−1 , pour n ≥ 1. Comme ∪n Bn = A et
comme les Bn sont deux-à-deux disjoints, nous avons
X n
X
P(A) = P(Bn ) = lim P(Bp ) = lim P(An ),
n n
n p=0

la dernière égalité provenant de (2.7). Nous obtenons donc le résultat. 

La propriété (2.3) donne la probabilité de la réunion ∪n An en fonction des probabilités


P(An ), lorsque les événements An sont deux-à-deux disjoints. Si ce n’est pas le cas,
nous avons tout de même la majoration suivante, très utile en pratique :

Proposition 2.13 Soit P une probabilité, et soit (An )n∈I une famille finie ou
dénombrable d’événements. On a alors
[  X
P An ≤ P(An ).
n∈I n∈I
22 Chapitre 2 – Espace de probabilité

Preuve. a) Supposons d’abord l’ensemble I fini, et montrons par récurrence que



Pk : P A1 ∪ · · · ∪ Ak ≤ P(A1 ) + · · · + P(Ak ), pour tout k ∈ N. (2.10)

Cette propriété est évidente pour k = 1. Supposons la propriété vraie pour k − 1, avec
k ≥ 2, et posons B = A1 ∪ · · · ∪ Ak−1 et C = B ∪ Ak . En vertu de (2.8), nous avons
P(C) + P(B ∩ Ak ) = P(B) + P(Ak ), donc P(C) ≤ P(B) + P(Ak ), et nous en déduisons
immédiatement Pk .
b) Considérons maintenant le cas où I est dénombrable. Nous pouvons supposer sans
restriction que I = N∗ . Posons Bn P = ∪ni=1 Ai , qui croı̂t vers l’ensemble C = ∪n∈I An .
n
D’après (a), nous avons P(Bn ) ≤ i=1 P(Ai ). Mais le membre de gauche ci-dessus
croı̂t vers P(C)
P en vertu de la proposition précédente, tandis que le membre de droite
croı̂t vers n∈I P(An ) ∈ [0, +∞]. En passant à la limite, nous obtenons donc le
résultat voulu. 

Nous avons pu ainsi construire dans toute sa généralité un espace abstrait Ω (non-
vide), une tribu sur cet espace et définir la notion de probabilité sur cette tribu.
C’est cette idée géniale qu’a introduite Kolmogorov en 1933 : avoir mis au cœur des
probabilités un objet nouveau, une mesure de probabilité, et ne pas s’intéresser aux
causes de l’expérience génériquement représentées par ω ∈ Ω.

Définition 2.14 On appelle le triplet (Ω, A, P) un espace de probabilité. C’est un


espace mesuré au sens de la théorie de la mesure.

La modélisation probabiliste consiste donc à décrire une expérience


aléatoire par la donnée d’un espace de probabilité.

Une question fondamentale va ainsi être de décrire et caractériser les mesures


de probabilité définies pour des espaces de probabilité de plus en plus gros :
N, Q, R, Rn , C([t1 , t2 ], R). Le dernier exemple, qui traite de trajectoires aléatoires, ne
pourra pas être abordé dans ce cours de base.

Remarquons que l’on peut construire de nombreuses probabilités distinctes sur le


même espace (Ω, A). Nous verrons beaucoup d’exemples ultérieurement, mais nous
pouvons nous en convaincre rapidement dans le cadre du jeu de Pile ou Face : suivant
que la pièce est truquée ou non truquée, la probabilité de faire Pile est 1/2 ou p ∈ [0, 1].

La définition suivante introduit une notion de “vrai ou faux” qui dépend de la pro-
babilité choisie sur l’espace fondamental.

Définition 2.15 Soit (Ω, A, P) un espace de probabilité.


(i) Un événement de probabilité nulle est dit négligeable.
(ii) Une propriété est vraie P-presque-sûrement (en abrégé P-p.s.), si l’ensemble des ω ∈ Ω
2.2 – Espace fondamental fini ou dénombrable 23

pour lesquels elle est vraie est de probabilité égale à 1, ou en d’autres termes, l’ensemble
des ω pour lesquels la propriété est fausse est négligeable.

2.2 Espace fondamental fini ou dénombrable

2.2.1 Caractérisation

Si Ω est au plus dénombrable, les singletons {ω}, ω ∈ Ω, forment une partition de


Ω, nous avons alors la caractérisation suivante des probabilités sur Ω.

Proposition 2.16 Supposons que l’espace fondamental Ω est au plus dénombrable.


(i) Pour une probabilité P sur Ω, on a
X
P(A) = P({ω}) pour tout A ∈ P(Ω),
ω∈A

et P est ainsi caractérisée par ses valeurs sur les singletons {pω = P({ω}), ω ∈ Ω}.
(ii) Soit (pω )ω∈Ω ∈ RΩ . Alors il existe une unique probabilité P telle pour tout ω ∈ Ω,
pω = P({ω}), si et seulement si
X
0 ≤ pω ≤ 1 et pω = 1.
ω∈Ω

Preuve. Commençons par le cas Ω fini. (i) Pour une probabilité P sur Ω, le résultat
découle de (2.7) du fait que tout A ∈ P(Ω) est réunion disjointe (et finie) des single-
tons {ω}, pour les ω ∈ A.
(ii) La condition nécessaire découle de (i) appliqué à A = Ω et de P(Ω) = 1. Inver-
sement, considérons n nombres (pi )1≤i≤n vérifiant la conditionPdu (ii). Nous posons
P({ωi }) = pi et pour tout A ⊂ Ω, nous définissons P(A) = ω∈A P({ω}) et nous
vérifions immédiatement que P est une probabilité au sens de la définition 2.9.
Si Ω est infini dénombrable,Pon suit le même argument, si ce n’est que pour prouver
que P définie par P(A) = ω∈A P({ω}) vérifie (2.3), il faut utiliser la propriété de
sommation par paquets pour les séries. (Voir Section 2.4.4 ci-après.) 

Exemple 2.17 (Loi de Bernoulli de paramètre p ∈ [0, 1]) L’espace Ω est :

Ω = {ω1 , ω2 } et pω1 = p ; pω2 = 1 − p.

Cette probabilité modélise en particulier la chance pour une pièce de tomber sur Pile
dans un jeu de Pile ou Face. Dans ce cas, Ω = {P, F } peut être assimilé à {0, 1}.
24 Chapitre 2 – Espace de probabilité

Si la pièce est équilibrée, alors p = 1/2. Mais cette probabilité peut aussi modéliser
la probabilité de réalisation d’un des résultats, pour toute expérience aléatoire avec
deux résultats possibles (mon premier enfant sera-t-il une fille ou un garçon ?).

Exemple 2.18 (Loi uniforme.) Nous dirons que la probabilité P sur l’espace fini
Ω est uniforme si pω = P({ω}) ne dépend pas de ω. Nous avons donc :
1
pωi = pour tout i = 1, . . . , n,
n
où n = card(Ω) désigne le cardinal de Ω, c’est-à-dire son nombre d’éléments. Nous
déduisons de la proposition 2.16(i) que
card(A)
P(A) = , (2.11)
card(Ω)
de sorte que le calcul des probabilités se ramène à des dénombrements : nous sommes
dans le cadre du calcul combinatoire.

Remarquons que sur un espace fini donné Ω, il existe une et une seule probabilité
uniforme. Cette probabilité décrit mathématiquement l’expression intuitive de “au
hasard” (tirage au hasard d’une carte, lancer au hasard d’un dé, choix au hasard d’un
échantillon dans une population).

Exemple 2.19 (Loi de Poisson de paramètre θ). On définit


θn
pn = e−θ pour tout n ∈ N.
n!
P n
On a pn ∈ [0, 1] et n pn = e−θ n θn! = 1. La suite (pn )n définit une probabilité sur
P
N. Cette loi fut introduite par Siméon Denis Poisson, dans son ouvrage “Recherches
sur la probabilité des jugements en matière criminelle et en matière civile” (1837).

Exemple 2.20 (Mesure de Dirac - Loi discrète)


1) Considérons un espace mesurable (Ω, A) arbitraire (avec Ω non-vide) et un point
ω0 fixé dans Ω. On suppose que {ω0 } ∈ A. Alors la mesure de Dirac en ω0 est :
δω0 (A) = 1 si ω0 ∈ A ; δω0 (A) = 0 si ω0 ∈
/ A pour tout A ∈ A. (2.12)
Une propriété est alors vraie δω0 -presque-sûrement si elle est satisfaite par ω0 , et
l’ensemble Ω\{ω0 } est un ensemble δω0 -négligeable.
2) Soit P une probabilité définie sur Ω = {ωn , n ∈ N}, et pn = P({ωn }). Alors

X X
P= pn δωn et P(A) = pn δωn (A) pour tout A ∈ A.
n∈N n∈N
2.2 – Espace fondamental fini ou dénombrable 25

2.2.2 Modèles d’urnes et calcul combinatoire

Dans les calculs de probabilités uniformes sur des ensembles finis, il est fondamen-
tal de faire très attention à bien préciser l’espace de probabilité sous-jacent. Cette
remarque prend toute son ampleur dans ce paragraphe, où nous allons développer
différents “modèles d’urnes” que l’on peut également voir comme des modèles de
prélèvement d’échantillons dans une population au cours d’un sondage. Ces modèles
interviennent aussi en contrôle de fabrication, ou dans de multiples autres situations.
Si le lecteur n’est pas inspiré par les couleurs des boules d’une urne, il pourra transcrire
l’analyse suivante dans le cadre des opinions politiques dans la population française
ou celui du niveau de perfection d’un objet dans une chaı̂ne de fabrication.

Le modèle général est le suivant : une urne contient N boules de k couleurs différentes,
réparties en N1 boules de couleur 1, N2 boules de couleur 2, . . . , Nk boules de couleur
k. Nous appelons pi = Ni /N la proportion de boules de couleur i dans l’urne. Tirons
au hasard n boules de cette urne, 2 ≤ n ≤ N , et intéressons-nous à deux événements :
- A =“la couleur des deux premières boules tirées est 1”,
- B =“on obtient n1 boules de couleur 1, n2 boules de couleur 2,. . . , nk boules de
couleur k”, avec ni des entiers tels que n1 + n2 + · · · + nk = n.
On remarque que l’événement A dépend de l’ordre de tirages, mais pas l’événement B.

Nous allons considérer trois façons de tirer les boules au hasard : tirage avec remise,
tirage sans remise, tirage simultané. Nous verrons que chaque tirage donnera lieu à
un calcul de probabilité et à des résultats différents.

Le problème du choix du tirage de l’échantillon se pose sans cesse dès que l’on souhaite
récolter des données statistiques.

Pour k et n deux entiers tels que k ≤ n, nous allons souvent utiliser, dans la suite,
le nombre de parties nk à k éléments dans un ensemble à n éléments, qui vaut :


 
n n! n(n − 1) · · · (n − k + 1)
= = .
k k!(n − k)! k!

Tirage exhaustif ou simultané - La loi hypergéométrique. Nous tirons toutes


les boules en même temps. L’ensemble Ω est alors l’ensemble de toutes les  parties
possibles de n éléments distincts, et le nombre de résultats possibles est N
n .
Dans ce cadre, A n’est pas un événement, car on ne peut pas dire si A est réalisé
en connaissant seulement le résultat du tirage simultané, donc on ne peut donc pas
évaluer sa probabilité.
B est un événement et le nombre de cas favorables donnant la bonne répartition
des couleurs pour l’événement B est alors égal à N Nk
n1 · · · nk . La probabilité de B
1
26 Chapitre 2 – Espace de probabilité

recherchée vaut donc


N1 Nk
 
(1) n1 ··· nk
PB = N
 . (2.13)
n

Cette distribution s’appelle la distribution polygéométrique. Dans le cas de deux


(1)
couleurs, on obtient PB = P̂n1 ,n−n1 avec
N1 N −N1
 
n1 n−n1
P̂n1 ,n−n1 = N
 ,
n

qui est appelée distribution (ou loi) hypergéométrique.

Exemple 2.21 Dans une fabrication en série, nous savons que parmi N pièces
usinées, M sont à mettre au rebut, et si nous choisissons au hasard et simultanément
un échantillon de n pièces, la probabilité pour que cet échantillon contienne k pièces
(M )(N −M )
défectueuses sera k Nn−k .
(n)

Tirage avec remise - La loi binomiale. Les tirages sont successifs. Nous replaçons
la boule tirée dans l’urne avant le tirage suivant. Nous pouvons donc tirer plusieurs
fois la même boule. L’ensemble Ω est alors l’ensemble de tous les n-uplets d’éléments
de l’urne. Toutes les répétitions étant possibles, card(Ω) = N n . Nous munissons Ω de
sa probabilité uniforme.
La probabilité de l’événement A est facile à calculer, c’est la probabilité de tirer une
des N1 boules de couleur 1 parmi les N boules de l’urne deux fois de suite, donc A a
(2)
pour probabilité PA = (N1 /N )2 = p21 .
Pour évaluer la probabilité de l’événement B, on commence par dire que le nombre de
façons de déterminer les places des k couleurs parmi n est égal au nombre de façons de
partager n en k parties de tailles ni , à savoir n1 !n2n!!···nk ! . Une fois la place des couleurs
choisie, nous avons Ni possibilités pour chaque boule de couleur i. Le nombre de n-
uplets de répartition n1 , n2 , . . . , nk est alors égal à n1 !n2n!!···nk ! N1n1 · · · Nknk . Nous avons
donc finalement que la probabilité de l’événement B est :

(2) n! N1n1 · · · Nknk


PB = . (2.14)
n1 !n2 ! · · · nk ! Nn
Cette probabilité est appelée une distribution multinomiale. Dans le cas particulier
(2)
où k = 2, p1 = p = N1 /N et p2 = 1 − p, on a PB = Pn1 ,n−n1 avec
 
n n1
Pn1 ,n−n1 = p (1 − p)n−n1 (2.15)
n1
La probabilité définie par Pn1 ,n−n1 est appelée loi binomiale de paramètres n et p. (Elle
fait intervenir les coefficients du binôme, d’où son nom). Attention, les paramètres ne
2.2 – Espace fondamental fini ou dénombrable 27

sont pas interchangeables : n ∈ N et p ∈ [0, 1]. Notons également que cette probabilité
est définie sur l’espace Ω = {0, 1, 2, . . . , n} comportant n + 1 éléments.

Pn
Remarque 2.22 On rappelle la formule du binôme (a + b)n =  i=0 ni ai bn−i pour

Pn n i
tous a, b ∈ R. En prenant a = p et b = 1 − p, on a alors i=0 i p (1 − p)n−i = 1.

Tirage sans remise. Nous tirons maintenant successivement les boules de l’urne,
mais sans les replacer dans l’urne après tirage. L’ensemble Ω est alors l’ensemble des
suites de n éléments distincts parmi N et le nombre de cas possibles sera N (N −
1) · · · (N − n + 1) = AnN . Nous munissons Ω de sa probabilité uniforme.
La probabilité de l’événement A est la probabilité de tirer une des N1 boules de
couleur 1 parmi les N de l’urne lors du premier tirage, puis de tirer une des N1 − 1
boules de couleur 1 parmi N − 1 boules restantes de l’urne, donc A a pour probabilité
(3) −1
PA = NN1 NN1−1 .
En raisonnant comme dans le cas avec remise pour évaluer la probabilité de B, nous
pouvons montrer que le nombre de cas favorables vaut n1 !n2n!!···nk ! AnN11 · · · AnNkk , ce qui
finalement donne pour probabilité la même que celle du cas de tirage simultané :
(3) (1)
PB = PB .

Ainsi, il y a équivalence du tirage sans remise et du tirage simultané pour les


événements qui ne dépendent pas de l’ordre des individus dans le tirage.

Remarque 2.23 Cas d’une urne dont le nombre de boules est infini. Nous nous
plaçons dans les hypothèses du tirage simultané, avec 2 couleurs, en supposant que N
et N1 tendent vers l’infini de telle manière que NN1 converge vers p ∈]0, 1[. Il est facile
de montrer qu’alors,
N1 N −N1
   
n1 n−n1 n n1
P̂n1 ,n−n1 = N
 converge vers Pn1 ,n−n1 = p (1 − p)n−n1 .
n
n 1

Ce résultat est intuitivement évident car si le nombre de boules devient infini, les
tirages de boules avec ou sans remise deviennent presque équivalents : on a une chance
très infime de tomber deux fois sur la même boule.

Dans la dernière remarque, nous avons obtenu la loi binomiale comme limite de lois
hypergéométriques. Cette convergence d’une suite de probabilités vers une probabilité
donnée sera développée au chapitre 7.3 (convergence en loi).

EXERCICE 2.1 Les yeux bandés, vous manipulez 7 fiches où sont écrites les lettres
E, E, T, B, R, L, I. Quelle est la probabilité que vous écriviez le mot
LIBERTE
2 1
Solution : 7! = 2520 .
28 Chapitre 2 – Espace de probabilité

EXERCICE 2.2 On tire au hasard 4 cartes d’un jeu de 52 cartes. Quelle est la
probabilité pour que, parmi ces 4 cartes, il y ait exactement 2 rois ?

Solution : L’hypothèse au hasard amène à modéliser cette expérience comme un tirage


uniforme dans un certain ensemble Ω qu’il faut préciser. Ici, on prend pour Ω la classe
des parties à 4 éléments de l’ensemble de 52 cartes. Le cardinal de Ω est 52 4 et P est
la probabilité uniforme sur Ω. Les résultats favorables sont les tirages qui contiennent
exactement 2 rois, à savoir 2 rois et 2 cartes parmi les 48 cartes autres que des rois.
(4)(48)
Ainsi, la probabilité cherchée vaut 2 52 2 .
(4)

EXERCICE 2.3 On lance trois dés parfaitement équilibrés. Montrer que la probabi-
lité que la somme des points amenés dépasse dix strictement est égale à la probabilité
que cette somme ne dépasse pas dix. (d’où un jeu parfaitement équitable...)

Solution : L’ensemble Ω est ici l’ensemble des suites (a1 , a2 , a3 ) de 3 nombres compris
entre 1 et 6, muni de la probabilité P uniforme. Remarquons que

a1 + a2 + a3 > 10 ⇔ (7 − a1 ) + (7 − a2 ) + (7 − a3 ) ≤ 10.

Ainsi, si A désigne l’événement “la somme des points obtenus est strictement
supérieure à 10”, nous remarquons que l’application (a1 , a2 , a3 ) 7→ (7−a1 , 7−a2 , 7−a3 )
est une bijection de A sur Ac . Les événements A et Ac ont donc même cardinal, et
donc même probabilité de réalisation.

EXERCICE 2.4 (Problème du chevalier de Méré) Ce personnage marquant de la


cour de Louis XIV qui “avait très bon esprit, mais n’était pas très bon géomètre” (cf.
lettre de Pascal à Fermat du 29 juillet 1654) était un joueur impénitent, toujours à
la recherche de règles cachées lui permettant d’avoir un avantage sur ses adversaires.
Voici deux de ses règles.
(1) Il est avantageux de parier sur l’apparition d’au moins un 6 en lançant un dé 4
fois de suite.
(2) Il est avantageux de parier sur l’apparition d’au moins un double-six en lançant
deux dés 24 fois de suite.

Calculer les probabilités des événements ci-dessus et juger l’opportunité de ces règles.

Solution : La première règle est bonne puisque la probabilité de l’événement vaut


 4
5 1
1− ' 0,5177 > .
6 2
2.3 – Conditionnement et indépendance 29

La différence avec 12 est faible, mais apte à fournir à long terme des gains assurés : le
chevalier devait jouer souvent selon la règle 1...
La deuxième règle est mauvaise, puisque la probabilité de l’événement cherché vaut :
 24
35 1
1− ' 0,4914 < .
36 2
Le Chevalier était donc moins heureux avec cette règle qu’avec la précédente. En fait,
il s’était laissé abuser par un soi-disant argument d’homothétie : en lançant un dé,
il y a 6 résultats possibles, en lançant deux dés, il y en a 62 = 36, soit 6 fois plus.
Comme il est avantageux de parier sur l’apparition d’au moins un 6 en lançant un dé
4 fois de suite, il doit être avantageux de parier sur l’apparition d’un double-six en
lançant deux dés 4 × 6 = 24 fois de suite. Paradoxe !

2.3 Conditionnement et indépendance

2.3.1 Probabilités conditionnelles

La notion de conditionnement est l’une des plus fructueuses de la théorie des pro-
babilités, et la différencie fondamentalement de la théorie de la mesure. L’idée de
base permettant la compréhension de cette notion est la suivante : une information
supplémentaire concernant l’expérience modifie la vraisemblance que l’on
accorde à l’événement étudié.

Par exemple (et il serait bien de méditer sur cet exemple très simple), cherchons, pour un
lancer de deux dés, la probabilité de l’événement “la somme est supérieure ou égale à 10”.
Elle vaut 16 sans information supplémentaire, 21 si l’on sait que le résultat d’un des dés
est 6, 0 si l’on sait a priori que le résultat d’un des dés est 2. Pour obtenir ces résultats,
nous avons dans chaque cas calculé le rapport du nombre de résultats favorables sur le
nombre de cas possibles. Nous remarquons qu’il est indispensable de bien définir l’espace
de probabilité lié à l’expérience munie de l’information a priori. Remarquons également
que l’information a priori a changé la valeur de la probabilité de l’événement.

L’approche intuitive pour formaliser cette notion consiste à revenir à la notion


de fréquence empirique. La fréquence de réalisation de l’événement A sachant que
l’événement B est réalisé, sur n expériences, est égale au nombre de réalisations de A
parmi celles pour lesquelles B est réalisé. Elle vaut donc
nA∩B fn (A ∩ B)
= ,
nB fn (B)
et en faisant tendre n vers l’infini, nous aboutissons à la définition suivante.
30 Chapitre 2 – Espace de probabilité

Définition 2.24 Soit A et B deux événements, avec P(B) > 0. La probabilité condi-
tionnelle de A sachant B est le nombre
P(A ∩ B)
P(A|B) = . (2.16)
P(B)

Proposition 2.25 (i) Soit (Ω, A, P) un espace de probabilité et B ∈ A de probabilité


P(B) > 0. Alors l’application de A ∈ A 7−→ P(A|B) ∈ [0, 1] définit une nouvelle
probabilité sur Ω, appelée probabilité conditionnelle sachant B.
(ii) Si P(A) > 0 et P(B) > 0, nous avons P(A|B) P(B) = P(A ∩ B) = P(B|A) P(A).

Preuve. Il est clair que 0 ≤ P(A|B) ≤ 1. Par ailleurs, les propriétés (2.2) et (2.3)
pour P(·|B) proviennent des mêmes propriétés pour P et des remarques suivantes :
Ω ∩ B = B, et (∪n An ) ∩ B = ∪n (An ∩ B). De plus, si A et C sont disjoints, il en est
de même de A ∩ B et C ∩ B. L’assertion (ii) est évidente. 

Proposition 2.26 Formule des probabilités composées. Si A1 , . . . , An sont des


événements de Ω tels que P(A1 ∩ · · · ∩ An−1 ) > 0, alors
P(A1 ∩ · · · ∩ An ) = P(A1 ) P(A2 |A1 ) P(A3 |A1 ∩ A2 ) · · · P(An |A1 ∩ · · · ∩ An−1 ). (2.17)

Preuve. On procède par récurrence. Si n = 2, les formules (2.16) et (2.17) sont les
mêmes. Supposons que (2.17) soit vraie pour n − 1, et soit B = A1 ∩ · · · ∩ An−1 .
D’après (2.16), on a P(B ∩ An ) = P(B)P(An |B). En remplaçant P(B) par sa valeur
dans (2.17) avec n − 1, nous obtenons (2.17) pour n. 

Proposition 2.27 Formule des probabilités totales. Soit (Bi )i∈I une partition
finie ou dénombrable d’événements de Ω, telle que P(Bi ) > 0 pour chaque i ∈ I. Pour
tout A ∈ A, on a alors
X X
P(A) = P(A ∩ Bi ) = P(A|Bi ) P(Bi ).
i∈I i∈I

Preuve. On a A = ∪i∈I (A ∩ Bi ), avec les ensembles (A ∩ Bi ) deux-à-deux disjoints.


Comme par ailleurs P(A ∩ Bi ) = P(A|Bi )P(Bi ), il suffit d’appliquer (2.3). 

Théorème 2.28 Formule de Bayes. Sous les mêmes hypothèses que la proposition
2.27, et si P(A) > 0,
P(A|Bi )P(Bi )
P(Bi |A) = P pour tout i ∈ I.
j∈I P(A|Bj )P(Bj )
2.3 – Conditionnement et indépendance 31

Preuve. Le dénominateur de de la dernière expression vaut P(A) d’après la proposi-


tion 2.27, tandis que (2.16) implique

P(A ∩ Bi ) P(A|Bi ) P(Bi )


P(Bi |A) = = .
P(A) P(A)

EXERCICE 2.5 Un individu est tiré au hasard dans une population où l’on trouve
une proportion 10−4 de séropositifs. On lui fait passer un test de détection de la
séropositivité. Par ailleurs, des expérimentations antérieures ont permis de savoir que
la probabilité d’avoir un résultat positif lors de l’application du test sur un individu
séropositif est égale à 0,99 (c’est la sensibilité du test) ; la probabilité d’avoir un
résultat positif lors de l’application du test sur un individu séronégatif est 0,001
(0,999 = 1 − 0,001 est la spécificité du test). Sachant que le test donne un résultat
positif, quelle est la probabilité pour que l’individu soit effectivement séropositif ?

Solution : Considérons les événements A “l’individu est séropositif”, et B “le test


de détection donne un résultat positif”. Les données fournissent P(A) = 10−4 d’où
P(Ac ) = 0,9999, P(B|A) = 0,99 et P(B|Ac ) = 0,001. Nous trouvons alors

P(A ∩ B) P(B|A) P(A)


P(A|B) = =
P(B) P(B|A) P(A) + P(B|Ac )P(Ac )
0,99 × 10−4
= ' 0,09.
0,99 × 10−4 + 0,001 × 0,9999

Remarquons que contrairement à l’intuition, cette probabilité est petite.

EXERCICE 2.6 On classe les gérants de portefeuilles en deux catégories, les bien
informés et les autres. Lorsqu’un gérant bien informé achète une valeur boursière pour
son client, on peut montrer par une étude préalable que la probabilité que le cours
de cette valeur monte est de 0,8. Si le gérant est mal informé, la probabilité que le
cours descende est de 0,6. On sait par ailleurs que si l’on choisit au hasard un gérant
de portefeuille, il y a une chance sur 10 que celui-ci soit un gérant bien informé.
Un client choisit au hasard un gérant dans l’annuaire, et lui demande d’acheter une
valeur. Sachant que le cours de cette valeur est monté, cherchons la probabilité pour
que le gérant soit mal informé.

Solution : Notons M l’événement “la valeur monte” et I l’événement “le gérant est
bien informé”. Par la formule des probabilités totales, la probabilité que la valeur
monte vaut

P(M ) = P(M |I) P(I) + P(M |I c ) P(I c ) = 0,8 × 0,1 + 0,4 × 0,9 = 0,44.
32 Chapitre 2 – Espace de probabilité

La formule de Bayes donne alors

P(M |I c ) P(I c ) 0,4 × 0,9


P(I c |M ) = = = 0,818.
P(M ) 0,44

2.3.2 Indépendance

La notion d’indépendance est absolument fondamentale en probabilités et nous verrons


par la suite toutes ses implications dans la modélisation de l’aléatoire.

Evénements indépendants

Intuitivement, deux événements A et B sont indépendants si le fait de savoir que A est


réalisé ne donne aucune information sur la réalisation de B et réciproquement.

Supposons que la réalisation de l’événement B n’ait aucune influence sur la réalisation


de A. Alors, après n expériences, la fréquence empirique de réalisation de A sera
approximativement la même, que l’on sache ou non que B est réalisé. Ainsi donc,
fn (A|B) = fnf(A∩B)
n (B)
doit être approximativement égal à fn (A) (Le conditionnement
ne change pas l’information que l’on a sur l’expérience). Par passage à la limite sur
le nombre d’expériences, nous en déduisons les définitions suivantes.

Si B est un événement de probabilité strictement positive, A sera dit indépendant


de B si P(A|B) = P(A) = P(A∩B)
P(B) . On remarque que cette formule se symétrise et la
notion d’indépendance se définit finalement comme suit.

Définition 2.29 Deux événements A et B sont indépendants si et seulement si

P(A ∩ B) = P(A) P(B).

La probabilité de voir A réalisé ne dépend pas de la réalisation de B, et réciproquement.

Remarque 2.30 1) Cette notion est liée au choix de la probabilité P et n’est pas une
notion ensembliste. Cela n’a en particulier rien à voir avec le fait que A et B soient
disjoints ou non. (Cf. Exemple 2.31 ci-dessous).
2) Si P(A) > 0 et P(B) > 0, alors

P(A ∩ B) = P(A) P(B) ⇐⇒ P(A|B) = P(A) ⇐⇒ P(B|A) = P(B).

Exemple 2.31 1. On lance 3 fois un dé. Si Ai est un événement qui ne dépend


que du ième lancer, alors A1 , A2 , A3 sont indépendants.
2.3 – Conditionnement et indépendance 33

2. On tire une carte au hasard dans un jeu de 52 cartes. On considère


les événements A = {la carte est une dame}; B = {la carte est un cœur}.
4
Il est facile de voir que P(A) = 52 , P(B) = 13 52 , et P(A ∩ B) =
1
P( la carte est la dame de cœur ) = 52 = P(A) P(B). Ainsi, les événements
A et B sont indépendants pour la probabilité uniforme P.
3. Supposons maintenant que le jeu de cartes soit trafiqué. Soit Q la nouvelle
probabilité correspondant au tirage de cartes. Supposons que
1 1 1 1
Q(valet de pique) = , Q(autre carte) = × = .
2 2 51 102
Alors
1 2 13
Q(A ∩ B) = 6= Q(A) Q(B) = × .
102 51 102
Les événements A et B ne sont pas indépendants sous la probabilité Q.

Nous laissons en exercice (très simple à vérifier) la démonstration de la proposition


suivante, dont le résultat est tout-à-fait intuitif.

Proposition 2.32 Si les événements A et B sont indépendants, alors il en est de


même de A et B c , Ac et B, Ac et B c .

La notion d’indépendance se généralise à une suite finie ou infinie d’événements


de la manière suivante.

Définition 2.33 Une suite (An )n d’événements de (Ω, A, P ) est dite indépendante si
pour toute suite finie (i1 , . . . , ik ) d’entiers deux-à-deux distincts :

P(Ai1 ∩ · · · ∩ Aik ) = P(Ai1 ) · · · P(Aik ).

Cette définition est délicate. Par exemple, pour que la suite (A, B, C) soit
indépendante, la propriété doit être vérifiée pour toutes les intersections de deux
événements et l’intersection des trois événements. Il ne suffit pas d’avoir P(A∩B∩C) =
P(A) P(B) P(C). Par exemple, prenons un lancer de dé avec A = {1, 2, 3}, B = {2, 4, 6}
et C = {1, 2, 4, 5}. Nous avons P(A) = 21 , P(B) = 12 , P(C) = 32 . Ainsi, nous avons
bien P(A ∩ B ∩ C) = P(A) P(B) P(C) mais P(A ∩ B) 6= P(A) P(B).

Il ne suffit pas non plus que les événements soient indépendants deux-à-deux. On joue
2 fois à Pile ou Face et on considère les événements A = { Face au premier lancer },
B = { Face au deuxième lancer } et C = { les deux tirages donnent le même résultat }.
On vérifie que ces événements sont deux-à-deux indépendants mais que la probabilité
de leur intersection n’est pas égale au produit des probabilités.
34 Chapitre 2 – Espace de probabilité

Expériences aléatoires indépendantes et espace de probabilité produit

Soit (Ωn , An , Pn ) une suite d’espaces de probabilité modélisant des expériences


aléatoires. Nous souhaiterions construire un espace de probabilité rendant compte
de toutes ces expériences indépendantes les unes des autres.

Si nous avons uniquement deux espaces (Ω1 , A1 , P1 ) et (Ω2 , A2 , P2 ), nous prendrons


Ω = Ω1 × Ω2 , que nous munirons de la tribu produit A = A1 ⊗ A2 . Cette tribu
produit de A1 et A2 est définie comme étant la tribu engendrée par les pavés A1 × A2 ,
A1 ∈ A1 , A2 ∈ A2 , (voir définition 2.5). Nous définissons P sur les pavés de A par
P(A1 × A2 ) = P1 (A1 ) P2 (A2 ). On peut montrer que cela suffit pour caractériser une
probabilité sur A, que l’on appelle probabilité produit, notée P1 ⊗ P2 .

Nous pouvons généraliser cette notion d’espace de probabilité produit, et considérer


le produit (dénombrable) cartésien Ω = Πn Ωn , A = ⊗n An où ⊗n An désigne la plus
petite tribu de Ω engendrée par les produits cartésiens finis d’éléments des tribus
coordonnées, donc contenant tous les ensembles de la forme

A1 × A2 × · · · × Ak × Ωk+1 × Ωk+2 × · · · , Ai ∈ Ai , k = 1, 2, 3, . . .

Il est possible de montrer par un théorème général de théorie de la mesure qu’il existe
une unique probabilité P sur (Ω, A) qui vérifie

P (A1 × A2 × · · · × Ak × Ωk+1 × Ωk+2 × · · · ) = Πki=1 Pi (Ai )

pour tous k = 1, 2, . . . et Ai ∈ Ai . Cette probabilité rend ainsi indépendantes les


expériences aléatoires correspondant à chaque espace (Ωn , An , Pn ).

En particulier, en prenant tous les espaces coordonnées (Ωj , Aj ) égaux, cela nous
permettra de modéliser la même expérience répétée une infinité (dénombrable) de
fois, de manière indépendante et dans les mêmes conditions.

Exemple 2.34 Considérons les lancers successifs et indépendants d’une même pièce
de monnaie, telle que la probabilité de tirer Pile soit égale à p ∈]0, 1[. Soient Fn
l’événement “Face au n-ième lancer” et Pn l’événement “Pile au n-ième lancer”.
Soient Tk l’événement “le premier Pile est obtenu au k-ième lancer” et A l’événement
“on n’obtient jamais de Pile”. Alors, par indépendance des lancers, nous avons

P(Tk ) = P(F1 ∩ F2 ∩ · · · ∩ Fk−1 ∩ Pk )


= P(Face)k−1 P(Pile) = (1 − p)k−1 p pour tout k ∈ N∗ .

Remarquons que {Tk , k ≥ 1, A} est une partition (dénombrable) de Ω, donc


X
P(A) = 1 − P(T = k) = 1 − 1 = 0.
k≥1
2.3 – Conditionnement et indépendance 35

2.3.3 Le lemme de Borel-Cantelli

Nous allons maintenant voir un théorème fameux, dans lequel intervient fonda-
mentalement la notion d’indépendance, et qui sera très important, en particulier pour
les théorèmes de convergence (cf. Chapitre 6).

Pour une suite (An )n d’événements de A, on définit :

lim sup An = ∩p ∪n≥p An .


n

Comme A est stable par union et intersection dénombrables, on a lim supn An ∈ A.


Remarquons que

ω ∈ lim sup An ⇔ ∀p, ∃n ≥ p, tel que ω ∈ An


n
⇔ ω appartient à une infinité de An ,
et que ω ∈
/ lim sup An ⇔ ω appartient à au plus un nombre fini de An .
n

Théorème 2.35 P Soit (An )n une suite d’événements de A.


(i) Si la série n P(An ) < +∞, alors P(lim supn An ) = 0, c’est-à-dire que P-presque
sûrement, il y a au plus un nombre fini de An qui sont réalisés.
(ii) Si de plus la suite (An )n est indépendante, alors
X
P(An ) = +∞ =⇒ P(lim sup An ) = 1.
n
n

Dans ce cas, P-presque sûrement, une infinité de An sont réalisés.

Il est clair que cette dernière propriété n’est plus vraie dans le cas où la suite n’est
pas indépendante. Il suffit pour s’en convaincre de prendre tous les An égaux à un
même événement A de probabilité P(A) ∈]0, 1[.

La première partie de ce lemme est un outil précieux pour démontrer qu’une propriété
est vraie P-presque sûrement. Nous en verrons un exemple dans la preuve de la loi
forte des grands nombres donnée dans la section 6.2. La deuxième partie du lemme
caractérise entièrement, dans le cas indépendant, le fait que P(lim supn An ) vaut 0 ou
1 suivant la convergence ou la divergence de la série de terme général P(An ).

Preuve. Remarquons tout d’abord que


X
P(lim sup An ) = lim ↓ P(∪n≥p An ) ≤ lim ↓ P(An ),
n p p
n≥p
36 Chapitre 2 – Espace de probabilité

P
où lim ↓ désigne la limite d’une suite décroissante. Si la série n P(An ) est conver-
gente, le reste de cette série tend vers 0 et la dernière inégalité implique que
P(lim supn An ) = 0. P
Supposons maintenant que les An soient indépendants et que la série n P(An )
diverge. Soit m un nombre entier. Nous avons

P(∪m
i=p Ai ) = 1 − P(∩m c m c
i=p Ai ) = 1 − Πi=p P(Ai ) grâce à l’indépendance
Pm
− i=p P(Ai )
= 1− Πm
i=p (1 − P(Ai )) ≥ 1 − e

grâce à l’inégalité 1 − x ≤ e−x pour x ≥ 0. Ainsi,


P∞

P(∪∞
i=p Ai ) ≥ 1 − e
i=p P(Ai )
=1

et l’on conclut finalement que pour tout p, P(∪∞


i=p Ai ) = 1, ce qui implique finalement
que P(lim supn An ) = 1. 

Application : Considérons une suite de parties indépendantes de Pile ou Face, la


probabilité d’apparition d’un Pile étant égale à p ∈]0, 1[. Soit A un “mot” de lon-
gueur l choisi a priori, c’est-à-dire une suite de l lettres prises dans l’alphabet {P, F }.
Désignons par A1 l’événement consistant en le fait que le mot se réalise dans les l
premières parties, par A2 l’événement consistant en le fait que le mot se réalise dans
les l parties suivantes, etc. Les événements A1 ,PA2 , ..., sont indépendants et pour tout
n ≥ 1, nous avons P(An ) = P(A1 ) > 0, d’où n P(An ) = +∞. Il résulte du lemme
de Borel-Cantelli (deuxième assertion), qu’avec une probabilité égale à 1, le mot A se
réalise une infinité de fois au cours du jeu. Le même raisonnement montre que si un
singe tape au hasard sur une machine à écrire, alors, avec une probabilité égale à 1,
le mot ABRACADABRA se réalisera une infinité de fois au cours de la frappe. C’est
vrai pour n’importe quel texte, donc il tapera aussi une infinité de fois le livre “A
LA RECHERCHE DU TEMPS PERDU”.

2.4 Rappels et compléments

2.4.1 Rappels sur les ensembles

Considérons un ensemble Ω non-vide, c’est-à-dire une collection d’objets appelés


éléments de Ω, ou points de Ω. L’appartenance d’un point ω à l’ensemble Ω est notée
ω ∈ Ω, et ω ∈ / Ω signifie que le point ω n’appartient pas à Ω.

Une partie A de Ω est aussi un ensemble, appelé sous-ensemble de Ω. Dans ce cas,


A est dit inclus dans Ω, ce qui s’écrit A ⊂ Ω. Rappelons les opérations élémentaires
sur les parties d’un ensemble.
2.4 – Rappels et compléments 37

Intersection : A ∩ B est l’intersection des ensembles A et B, c’est-à-dire l’ensemble


des points appartenant à la fois à A et à B.

Réunion : A ∪ B est la réunion des ensembles A et B, c’est-à-dire l’ensemble des


points appartenant à au moins l’un des deux ensembles.

Ensemble vide : C’est l’ensemble ne contenant aucun point. Il est noté ∅.

Ensembles disjoints : Les ensembles A et B sont dits disjoints si A ∩ B = ∅.

Complémentaire : Si A ∈ Ω, son complémentaire (dans Ω) est l’ensemble des points


de Ω n’appartenant pas à A. Il est noté Ac ou parfois Ω\A. Les ensembles A et Ac
sont disjoints.

Différence : Si A et B sont deux sous-ensembles de Ω, A\B désigne l’ensemble des


points qui sont dans A mais pas dans B. Ainsi A\B = A ∩ B c .

La réunion et l’intersection sont des opérations commutatives et associatives. Nous


avons A ∪ B = B ∪ A et A ∩ B = B ∩ A, et aussi A ∪ (B ∪ C) = (A ∪ B) ∪ C et
A ∩ (B ∩ C) = (A ∩ B) ∩ C, ensembles que nous notons naturellement A ∪ B ∪ C et
A ∩ B ∩ C.

Plus généralement, pour une famille (Ai )i∈I d’ensembles, indexée par un ensemble
quelconque I, ∪i∈I Ai désigne la réunion de cette famille, i.e. l’ensemble des points
appartenant à au moins l’un des Ai . De même, ∩i∈I Ai désigne l’intersection de
cette famille, i.e. l’ensemble des points appartenant à tous les Ai . Dans ces deux
cas, l’ordre d’indexation des Ai n’a pas d’importance.

Une partition de Ω est une famille (Ai )i∈I telle que les ensembles Ai soient
disjoints deux-à-deux (Ai ∩ Aj = ∅, ∀i, j, i 6= j), et que ∪i∈I Ai = Ω.

2.4.2 Modélisation ensembliste des événements

Les événements étant des ensembles, (rappelons-nous qu’une partie de Ω décrit


un sous-ensemble de résultats possibles de l’expérience), nous pourrons effectuer les
opérations ensemblistes précédemment décrites, avec l’interprétation suivante. Si A
et B sont deux événements, alors :
• NON : la réalisation de l’événement contraire à A est représentée par Ac : le
résultat de l’expérience n’appartient pas à A.

• ET : l’événement “A et B sont réalisés” est représenté par A ∩ B : le résultat


de l’expérience se trouve à la fois dans A et dans B.
38 Chapitre 2 – Espace de probabilité

• OU : l’événement “A ou B sont réalisés” est représenté par l’événement A∪B :


le résultat de l’expérience se trouve dans A ou dans B.

• IMPLICATION : le fait que la réalisation de l’événement A entraı̂ne la


réalisation de B se traduit par A ⊂ B.

• INCOMPATIBILITE : si A ∩ B = ∅, A et B sont dits incompatibles. Un


résultat de l’expérience ne peut être à la fois dans A et dans B.

• TOUJOURS VRAI : l’événement Ω est l’événement certain (tous les résultats


de l’expérience prennent leurs valeurs dans Ω).

• IMPOSSIBLE : ∅ est l’événement impossible.

2.4.3 Les ensembles dénombrables

Un ensemble E est dénombrable s’il est en bijection avec N, c’est-à-dire si ses points
peuvent être énumérés en une suite (xn )n∈N . C’est le cas de l’ensemble N lui-même,
de Z, de Q, des entiers pairs ou de toute suite strictement croissante d’entiers. Ce
n’est pas le cas de R, ni des intervalles [a, b] lorsque a < b, ni de {0, 1}N , ni de P(N). 2

Enonçons quelques propriétés des ensembles dénombrables.


• Tout ensemble dénombrable est infini. La réciproque est fausse, comme nous
l’avons vu ci-dessus.
• Toute partie d’un ensemble dénombrable est elle-même finie ou dénombrable.
• La réunion d’une famille finie ou dénombrable d’ensembles eux-mêmes finis ou
dénombrables est un ensemble fini ou dénombrable.
• Si A n’est ni fini, ni dénombrable, il en est de même de A\B, pour tout B ⊂ A
qui est fini ou dénombrable.

2.4.4 Quelques résultats utiles sur les séries

Nous rappelons les résultats essentiels sur les séries, qui seront d’usage constant dans
l’étude des variables aléatoires sur un espace dénombrable.

Soit (un )n≥1 une suite numérique, et Sn = u1 + · · · + un , n ≥ 1, la suite des


sommes partielles.
2. Il n’existe pas de bijection entre N dans P(N). En effet, pour toute fonction f : N −→ P(N),
E = {n ∈ N : n ∈ / f (n)} n’a pas d’antécédent : si f (n0 ) = E, alors soit n0 ∈ E et donc n0 6∈ f (n0 ) =
E, contradiction, soit n0 6∈ E et donc n0 ∈ f (n0 ) = E, encore une contradiction !
2.4 – Rappels et compléments 39

P
S1 La série
P n un est dite convergente si Sn converge vers une limite finie S, notée
aussi S = n un . C’est la “somme” de la série.
P
S2 Si la série n un converge, la suite (unP )n≥1 tend vers 0. La réciproque est
fausse : on peut avoir un → 0 sans que la série n un converge (Prendre par exemple
un = n1 ).
P P
S3 La série n un est dite absolument convergente si la série n |un | converge.

S4 Si un ≥ 0 pour tout n, alors la suite Sn est croissante,P donc elle tend toujours
vers une limite S éventuellement infinie. On écrit encore S = n un , bien que la série
converge au sens de (S1) si et seulement si S < ∞.

En général l’ordre dans lequel on considère les termes d’une série est important.
Il existe en effet de nombreuxPexemples de suitesP(un )n≥1 et de bijections v de N∗
dans lui-même pour lesquels n un converge et n uv(n) diverge, ou converge vers
une somme différente. Cela étant, il existe deux cas importants où l’ordre des termes
n’a pas d’importance :
P
S5 Si un ≥ 0 pour tout n, la somme n un ne change pas si l’on change l’ordre
de sommation. Rappelons rapidement la démonstration de cette propriété, qui est
fondamentale pour les probabilités : soit v une bijection de N∗ dans lui-même, Sn =
u1 +. . .+un et Sn0 = uv(1) +. . .+uv(n) ; les suites (Sn ) et (Sn0 ) sont croissantes. Notons
S et S 0 leur limites respectives (dans R+ ∪ {+∞}). Pour tout n il existe un entier
m(n) tel que v(i) ≤ m(n) dès que i ≤ n. Comme ui ≥ 0, clairement Sn0 ≤ Sm(n) ≤ S
et donc en passant à la limite nous obtenons S 0 ≤ S. Nous montrons de même que
S ≤ S 0 , et donc S = S 0 .

S6 Lorsque les un sont des réels de signe quelconque et que la série est absolument
convergente, nous pouvons modifier de manière arbitraire l’ordre des termes sans
changer la propriété d’être absolument convergente, ni la somme de la série.

S7 Si un ≥ 0, il est possible de “sommer par paquets”. Cela signifie la chose


suivante : soitP(Ai )i∈I une partition finie ou dénombrable de N∗ . Pour chaque i ∈ I,
posons vi = n∈Ai un . Si Ai est fini, c’est une somme ordinaire P ; sinonPvi est elle-
même la somme d’une série à termes positifs. Nous avons alors n un = i∈I vi , qui
est de nouveau la somme d’une série à termes positifs si I = N∗ . La démonstration
de ce résultat est analogue à celle de (S5) ci-dessus.
P
S8 Si la série n un est absolument convergente, la propriété (S7) est encore vraie.

S9 Théorème de Fubini pour Ples séries. Soit (amn )m,n∈N une série
P double
P telle
que
P P la série de terme général m |amn | converge. Alors les séries n m a mn et
m n amn sont convergentes et de même somme.
40 Chapitre 2 – Espace de probabilité

2.5 Exercices sur le chapitre 2

EXERCICE 2.7
1) Parmi n personnes en présence (n ≤ 365), quelle est la probabilité pour qu’au
moins deux personnes soient nées le même jour ? (On conviendra de ne pas prendre
en compte les personnes nées le 29 février). Que vaut cette probabilité pour n = 4,
n = 16, n = 22, n = 40, n = 64 ?
2) Déterminer nmin pour que la probabilité qu’au moins deux personnes soient nées
le
√ même jour soit supérieure à 0,5. On pourra utiliser la formule de Stirling m! ∼m→∞
1
2πmm+ 2 e−m .

EXERCICE 2.8 Montrer la formule de Poincaré :


n
X X
P (∪nm=1 Am ) = (−1)k−1 pk , où pk = P(Ai1 ∩ · · · ∩ Aik ).
k=1 1≤i1 <···<ik ≤n

EXERCICE 2.9 Un facteur possède n lettres adressées à n destinataires distincts.


Il est totalement ivre et poste au hasard une lettre par boı̂te.
1) Quelle est la probabilité d’obtenir la bonne répartition ?
2) Quelle est la probabilité qu’une lettre au moins arrive à la bonne adresse ?
3) Quelle est la probabilité qu’aucune lettre n’arrive à la bonne destination ?
4) Quel est le nombre dn de manières différentes de poster les lettres de telle sorte
qu’aucune n’arrive à destination ?

EXERCICE 2.10 Soit a ∈]0, 1[. Montrer que la suite de nombres définie par pn =
(1 − a)an−1 caractérise une probabilité sur N∗ .

EXERCICE 2.11 M. et Mme Barbétipoil ont deux enfants, garçons ou filles, les
4 configurations sont équiprobables. Quelle est la probabilité que les deux enfants
Barbétipoil soient des filles,
• sans autre information,
• sachant que l’aı̂née est une fille,
• sachant que l’un des deux enfants est une fille.

EXERCICE 2.12 Modèle de Hardy-Weinberg. Les caractères héréditaires dans cer-


tains organismes, tels que les humains, sont portés par des paires de gènes. Dans le
cas le plus simple, chaque gène peut prendre deux formes appelées allèles, A et a. Ces
allèles se trouvent dans une population parentale avec les proportions p et q. Comme
Aa et aA ne sont pas discernables, il y a 3 génotypes possibles, AA, aa, Aa. Nous sup-
poserons que la reproduction peut avoir lieu entre deux individus quelconques de la
2.5 – Exercices sur le chapitre 2 41

population, indépendamment des gènes considérés. Chaque parent transmet un gène


de son génotype de façon équiprobable, les deux gènes ainsi obtenus constituant le
génotype du descendant.

Calculer la probabilité des différents génotypes dans la génération suivante. Montrer


que la proportion de chacun des allèles reste la même dans la deuxième génération.

EXERCICE 2.13 L’hémophilie est transmise par la mère. La reine porte le gène
de l’hémophilie avec une probabilité de 0,5. Si elle est porteuse, chaque prince aura
une chance sur deux de souffrir de cette maladie. La reine a eu 3 fils non hémophiles.
Quelle est la probabilité qu’elle soit porteuse du gène ? S’il naı̂t un quatrième prince,
avec quelle probabilité sera-t-il hémophile ?

EXERCICE 2.14 Le jeu des 3 portes est un jeu télévisé populaire (Let’s make a
deal) diffusé dans les années 70 aux USA. Trois portes A, B, C sont fermées. Derrière
l’une d’elle il y a une Ferrari, derrière les autres une chèvre.
• Le joueur choisit une porte, disons A.
• Le présentateur, qui sait où se trouve la voiture, l’informe alors qu’elle n’est
pas derrière la porte B et lui offre la possibilité de réviser son choix (i.e. de
choisir la porte C).
Le joueur a-t-il intérêt à réviser son choix ?

EXERCICE 2.15 Un problème simple de démographie. Soit a ∈]0, 1[. Soit pk , la


probabilité qu’une famille ait k enfants. Nous supposons que
p0 = p1 = a ; pk = (1 − 2a)2−(k−1) , ∀k ≥ 2,
et que P(Fille) = P(Garçon) = 21 .

On pose : En : “la famille a n enfants”, Fn : “n filles”, Gn : “n garçons”.


1) Donner la probabilité qu’une famille ayant deux filles aient deux enfants seulement ?
2) Doner la probabilité qu’une famille ait deux garçons sachant qu’elle a deux filles ?

EXERCICE 2.16 On jette indéfiniment une pièce de monnaie, la probabilité d’ap-


parition d’un Face étant égale à p. Soit Ak , pour k entier, l’événement selon le-
quel au moins ”k Faces” consécutifs apparaissent au cours des lancers numérotés 2k ,
2k + 1, . . . , 2k+1 − 1.
1 1
Montrer que P(lim supk Ak ) vaut 0 ou 1 selon que p < 2 ou que p ≥ 2. Comment
interprétez-vous ce résultat ?

EXERCICE 2.17 Montrer qu’il n’existe pas de probabilité P sur (N, P(N)) telle
que P(kN) = k1 pour tout entier strictement positif k, où kN désigne l’ensemble des
entiers multiples de k.
Chapitre 3

Variables aléatoires sur un


espace fini ou dénombrable

I have deeply regretted that I did not proceed at least to understand something of
the great leading principles of mathematics ; for men thus endowed seem to have an
extra sense.

Charles Darwin, Uses and abuses of Mathematics in Biology

Dans ce chapitre et le suivant, nous allons introduire la notion de variable aléatoire


et en développer une étude plus systématique. La grande nouveauté va être de com-
prendre que ce n’est pas la variable aléatoire en tant que fonction précise de l’aléa qui
nous intéresse, mais sa loi, c’est-à-dire la description de son “comportement probable”.

Dans tout ce chapitre, l’espace fondamental Ω est fini ou dénombrable.

3.1 Variables aléatoires discrètes

Soit (Ω, A, P) un espace de probabilité fini ou dénombrable muni de la tribu A =


P(Ω). Toute application X définie sur Ω :

X : Ω −→ X

est appelée variable aléatoire (v.a.). Comme Ω est fini ou dénombrable, l’ensemble
d’arrivée (quitte à le remplacer par X(Ω) sans perte de généralité) est fini ou
dénombrable et de la forme X = {xi , i ∈ I}, pour un certain sous-ensemble I ⊂ N.

43
44 Chapitre 3 – Espace fini ou dénombrable

Attention, cette définition de v.a. n’est valable que dans le cadre d’un espace Ω fini
ou dénombrable. On donnera une définition générale de v.a. dans le cas d’un espace
arbitraire dans le chapitre suivant.

La loi d’une variable aléatoire X est définie par la probabilité induite sur X ,
muni de la tribu P(X ), et le résultat suivant est une conséquence immédiate de la
proposition 2.16.

Proposition 3.1 La loi d’une v.a. X à valeurs dans un espace au plus dénombrable
X est caractérisée par
(xi , pX

i ), xi ∈ X ,
avec pX
P
i = PX ({xi }) = P({ω, X(ω) = xi }) = P(X = xi ) = ω: X(ω)=xi pω .

Exemple 3.2 Une v.a. de loi uniforme sur {1, . . . , n} a pour loi {(k, n1 )}1≤k≤n .

La représentation graphique d’une loi de variable discrète en utilisant un dia-


gramme “en bâtons” est très parlante. Les valeurs xi sont placées en abscisse et les
images pX
i en ordonnée, comme dans la figure 3.1.

Exemple 3.3 Considérons le lancer d’un dé. L’espace fondamental est Ω =


{1, . . . , 6} muni de la probabilité uniforme. Le résultat du lancer d’un dé est la variable
aléatoire X(ω) = ω, à valeurs dans X = {1, . . . , 6}, et on a donc :
1 1 1
pX
1 = , pX2 = , ..., pX
6 = ·
6 6 6
On représente cette loi par un diagramme en bâtons sur la figure 3.1a.

Exemple 3.4 Considérons le lancer de deux dés. L’espace fondamental est Ω =


{1, . . . , 6}2 muni de la probabilité uniforme. Le résultat total est la somme des deux
lancers, S(ω) = ω1 + ω2 , où ω = (ω1 , ω2 ). Cette v.a. prend ses valeurs dans l’en-
semble des entiers X = {2, . . . , 12}, et on obtient par des opérations de dénombrement
élémentaires :
1 2 6
pS2 = , pS3 = , ..., pS7 = ,
36 36 36
5 2 1
pS8 = , ..., pS11 = , pS 12 = ·
36 36 36
On représente cette loi par un diagramme en bâtons sur la figure 3.1b.

La représentation graphique ne donne pas d’information quantitative sur la loi.


Dans les paragraphes suivants, nous allons définir des nombres réels qui vont résumer
en un certain sens le comportement de la variable aléatoire.
3.2 – Espérance des v.a. discrètes 45

0.15 0.15
probabilite

probabilite
0.1 0.1

0.05 0.05

0 0
1 2 3 4 5 6 2 3 4 5 6 7 8 9 10 11 12
a) x b) s

Figure 3.1 – Diagramme en bâtons de la loi d’un lancer de dé (a) et de la loi de la
somme de deux lancers de dés (b).

3.2 Espérance des v.a. discrètes

Nous supposons ici que X est un sous-ensemble fini ou dénombrable de R.

3.2.1 Définition

Motivation : Répétons n fois une expérience aléatoire, et notons X1 , . . . , Xn les


valeurs successives prises par X. Pour avoir une idée du comportement de la variable
X, il est naturel de considérer leur moyenne arithmétique Mn = n1 (X1 + · · · + Xn ) .
(Pensez à vos propres calculs de moyennes en tant qu’élèves.) En regroupant suivant
les différents résultats possibles ω d’une expérience, nous obtenons
X
Mn = fn ({ω}) X(ω),
ω∈Ω

où fn ({ω}) est la fréquence de réalisation du singleton {ω} au cours des n expériences.
Remarquons que la dernière somme est finie puisqu’il ne peut exister qu’un nombre
fini de fn (ω) non nuls. Nous voulons faire tendre n vers l’infini. Si la propriété (2.1)
intuitée au Chapitre 2 est vraie, c’est-à-dire si fn ({ω}) → pω , et si dans l’expression
ci-dessus on peut intervertir la sommeP et la limite (ce qui est en particulier vrai si Ω est
fini), alors la suite (Mn )n tend vers ω∈Ω pω X(ω). Nous justifierons cette assertion
plus loin, dans l’un des théorèmes les plus importants de la théorie des probabilités,
appelé la loi des grands nombres.

Définition 3.5 Soit X une variable aléatoire réelle définie sur l’espace fini ou
dénombrable Ω à valeurs dans X (i.e. une application de Ω dans X ⊂ R). Son espérance
46 Chapitre 3 – Espace fini ou dénombrable

(appelée aussi parfois moyenne) est


X
E(X) = pω X(ω), (3.1)
ω∈Ω
P
pourvu que la somme E(|X|) = ω∈Ω pω |X(ω)| soit finie.

(Rappelons que, en vertu de (S6) (section 2.4.4), comme la série de terme général
pω X(ω) est absolument convergente, la somme E(X) de la série ne dépend pas de la
manière dont les ω sont ordonnés.)

L’espérance mathématique E(X) est un réel qui donne une valeur moyenne résumant
la v.a. X. C’est l’un des concepts les plus importants de la théorie des probabilités. La
dénomination d’espérance pour cette quantité fait référence aux problèmes de jeux et
d’espérance de gain. Cette terminologie imagée a été introduite par Pascal.

Théorème 3.6 Pour une variable aléatoire X satisfaisant E(|X|) < +∞, on a :
X X X
E(X) = pω X(ω) = xi P(X = xi ) = xi pX
i . (3.2)
ω∈Ω xi ∈X xi ∈X

En particulier, nous remarquons que l’espérance de X ne dépend que de la loi de X.

P
Preuve. Puisque ω∈Ω pω |X(ω)| = E(|X|) < +∞, la sommation par paquets est
justifiée par (S8) (section 2.4.4), et on obtient
X X X X X
E(X) = pω X(ω) = pω xi = xi P({ω : X(ω) = xi }) = xi p X
i .
ω∈Ω xi ∈X ω: X(ω)=xi xi ∈X xi ∈X

Analogie avec une notion de mécanique : Le concept d’espérance est à rappro-


cher de la notion de centre de gravité d’un groupe de masses au sens de la mécanique.
Considérons en effet une variable X de loi de probabilité {(xi , pX i ), i ≥ 1}. On montre
que si les masses pX i , i ≥ 1 sont réparties sur une barre sans poids aux abscisses
xi , i ≥ 1, le centre de gravité, c’est-à-dire le point sur lequel la barre pourra être posée
et rester en équilibre, est d’abscisse E(X). En effet, il suffit d’établir que la somme des
moments des forces gravitationnelles par rapport au point d’abscisse E(X) est nulle :
X
0= (xi − E(X))pX i ,
xi ∈X

ce qui est immédiat à vérifier à partir de la définition de l’espérance mathématique.


3.2 – Espérance des v.a. discrètes 47

Exemple 3.7 Un nombre est choisi au hasard entre 1 et 10, et nous devons deviner ce
nombre en posant des questions auxquelles il ne sera répondu que par oui ou par non.
Calculons l’espérance du nombre N de questions nécessaires dans les cas suivants :
• La ième question est du type “Est-ce i ?”, i étant égal à 1, 2, . . . , 10.
Soit Ak l’événement : “le nombre k ∈ {1, . . . , 10} a été choisi”. Comme les Ak forment
une partition de l’espace fondamental, on a
10
X 1
P(N = k) = P(N = k|Ak0 )P(Ak0 ) = P(N = k|Ak )P(Ak ) =
10
k0 =1

et
10
X 11
E(N ) = k P(N = k) = .
2
k=1
• Avec chaque question, nous éliminer à peu près la moitié des réponses possibles,
avec le protocole suivant : est-ce ≤ 5, ≤ 2 (resp. ≤ 7), ≤ 4 (resp. ≤ 9). Alors
6 4 17
E(N ) = 3 × +4× = .
10 10 5

3.2.2 Propriétés de l’espérance des v.a. discrètes


P
Définition 3.8 Une v.a. X est dite intégrable si ω∈Ω pω |X(ω)| = E(|X|) < +∞.
L’ensemble des v.a. intégrables est noté L1 , il dépend de Ω et de P.

Les propriétés suivantes sont immédiates :

Proposition 3.9
(i) L1 est un espace vectoriel, et l’espérance est linéaire sur L1 :

E(aX + bY ) = a E(X) + b E(Y ) pour tous X, Y ∈ L1 , et a, b ∈ R.

(ii) X ∈ L1 ⇐⇒ |X| ∈ L1 , et dans ce cas, |E(X)| ≤ E(|X|).


(iii) L’espérance est positive : si X ≥ 0 alors E(X) ≥ 0.
(iv) Pour X, Y ∈ L1 , X ≤ Y alors E(X) ≤ E(Y ).
(v) L1 contient toutes les v.a. bornées. (X est bornée si supω∈Ω |X(ω)| < ∞).
(vi) L’espérance d’une variable constante est égale à cette constante : si X(ω) = a
pour tout ω ∈ Ω, alors E(X) = a.
(vii) Si Ω est fini, L1 contient toutes les v.a. réelles.

Exemple 3.10 Pour tout événement A, on définit

1A (ω) = 1 si ω ∈ A et 1A (ω) = 0 si ω ∈
/ A.
48 Chapitre 3 – Espace fini ou dénombrable

Cette v.a. est appelée fonction indicatrice de A, et nous avons :

E(1A ) = P(A).

3.2.3 Variance et écart-type

On note par L2 l’ensemble des v.a. réelles X dont le carré X 2 est intégrable. Nous dirons
dans ce cas que X est de carré intégrable.

Proposition 3.11 L2 est un sous-espace vectoriel de L1 , et si X ∈ L2 on a


p
|E(X)| ≤ E(|X|) ≤ E(X 2 ). (3.3)

Preuve. Soient X, Y ∈ L2 et a ∈ R. Comme (aX + Y )2 ≤ 2a2 X 2 + 2Y 2 , nous


déduisons de la proposition 3.9(i) que aX + Y ∈ L2 . Ainsi, L2 est un espace vectoriel.
L’inclusion L2 ⊂ L1 découle de |X| ≤ 1 + X 2 et de la linéarité de la proposition 3.9(i).
La première inégalité de (3.3) est celle de la proposition 3.9(ii). Pour la seconde, nous
pouvons nous limiter au cas où X est positive. Soit alors a = E(X) et Y = X − a.
D’après la proposition 3.9(i) il vient

E(Y 2 ) = E(X 2 ) − 2aE(X) + a2 = E(X 2 ) − a2 ,

et E(Y 2 ) ≥ 0 par la proposition 3.9(iii). Donc a2 ≤ E(X 2 ). 

Définition 3.12 Si X ∈ L2 , sa variance est définie par


2
X
Var(X) = E((X − E(X)) ) = (xi − E(X))2 pX
i .
xi ∈X
p
Var(X) est positive, et σX = Var(X) s’appelle l’écart-type de X.

L’écart-type est une grandeur qui mesure la moyenne (en un certain sens) de l’écart
2
des valeurs de X à sa moyenne, d’où son nom. En développant le carré (X − E(X))
comme dans la preuve ci-dessus, nous obtenons la formule de Huygens :
2
σX = E(X 2 ) − E(X)2 . (3.4)

Exemple 3.13 (Loto) On considère tout d’abord la forme classique du loto, qui a été
utilisée de 1976 à 2008. Le joueur coche 6 numéros sur une grille en comportant 49,
dans le cas d’un bulletin simple. Les 6 numéros gagnants sont déterminés par tirage
3.2 – Espérance des v.a. discrètes 49

au sort. L’espace fondamental est ici l’ensemble des parties à 6 éléments ( tirage )
de {1, . . . , 49} muni de la probabilité uniforme. Son cardinal est Card(Ω) = 49 6 =
13 983 816. Notant N le nombre de numéros gagnants figurant parmi les numéros
cochés par le joueur (on rappelle que la grille du joueur comporte 6 numéros cochés et
43 non-cochés), l’événement {N = n} (n ∈ {0, . . . , 6}) est réalisé si le tirage produit
n numéros cochés et 6 − n numéros non-cochés. La loi de la v.a. N est donc :
6
 43 
n 6−n
P(N = n) = 49
 , n ∈ {0, . . . , 6} ,
6

et certaines valeurs numériques sont données dans le tableau ci-dessous. Au premier


tirage du 10 mai 2006, on recevait pour une mise de 0,3 Euros (soit une grille) le gain
G = g(N ) suivant :

n numéros gagnants gain g(n) probabilité P(N = n)


6 789 177,00 Euros 7,2 10−8
5 1 813,80 Euros 1,8 10−5
4 30,70 Euros 9,7 10−4
3 2,70 Euros 1,8 10−2

Le gain moyen est E[G] = 2,70 × 1,8 10−2 + 30,70 × 9,7 10−4 + · · · ' 0,168 Euros,
tandis que l’écart-type σ(G) = (E[G2 ] − E[G]2 )1/2 ' 212 Euros. On voit que le jeu est
défavorable au joueur, dont le bénéfice moyen est E[G] − 0,3 = −0,132 Euros, et la
grande valeur de σ vient de ce que parfois (mais très rarement) ça rapporte gros.
La forme moderne du loto, mise en place à partir de 2008, est légèrement différente :
le joueur coche 5 numéros sur une grille en comportant 49 et un  numéro chance 
sur une autre grille en comportant 10. Donc la probabilité qu’un joueur trouve la bonne
combinaison est :
1 1 1
p = 49 = ' 5,2 10−8 ,
5
10 19 068 840
49

car il y a 5 choix possibles des cinq premiers numéros, et 10 choix possibles du
 numéro chance . Notez qu’on a moins de chance de gagner le gros lot avec la

nouvelle version qu’avec la version classique.

3.2.4 Moments d’une variable aléatoire

Soit f une fonction de X dans R. La v.a. réelle f (X) prend un nombre fini ou
dénombrable de valeurs. Nous pouvons aussi considérer f comme une v.a. définie
sur l’espace de probabilité (X , P(X ), PX ). Le résultat suivant, appelé propriété de
transfert, montre la cohérence de la notion d’espérance.
50 Chapitre 3 – Espace fini ou dénombrable

Théorème 3.14 Pour f : X → R, la v.a. f (X) définie sur (Ω, P(Ω), P) est intégrable
si et seulement si la v.a. f sur (X , PX ) l’est également. Dans ce cas, les espérances
de ces deux v.a. sont égales, et
X X
E(f (X)) = f (X(ω)) pω = f (xi )P(X = xi ). (3.5)
ω∈Ω xi ∈X

Preuve. Comme nous pouvons sommer par paquets par (S7) (section 2.4.4) dans
une série à termes positifs, nous voyons comme pour (3.2) que les deux expres-
sions de droite de (3.5) sont égales si nous remplaçons f par |f | ; elles sont donc
finies simultanément. D’après la définition de l’espace L1 , nous avons donc f (X) ∈
L1 (Ω, P) ⇔ f ∈ L1 (X , PX ).
Si ces propriétés sont réalisées, en utilisant cette fois (S8) (section 2.4.4), nous voyons
de la même manière que les deux expressions de droite de (3.5) sont aussi égales pour
f , ce qui, compte-tenu de (3.1), achève la démonstration. 

Définition 3.15 Soit p ∈ N∗ . On dit que la v.a. X admet un moment d’ordre p si


X p ∈ L1 , et en utilisant le théorème précédent :
X p
E(X p ) = xi P(X = xi ).
xi ∈X

3.3 Fonction génératrice d’une v.a. entière

La loi d’une v.a. entière (à valeurs dans N) X est caractérisée par les nombres pn =
pX
n = P(X = n). Le but de ce paragraphe est de montrer qu’une telle loi de probabilité
peut également être caractérisée par une fonction, appelée fonction génératrice, définie
sur [0, 1] et indéfiniment dérivable sur [0, 1[. Les dérivées auront leur interprétation
en termes de moments de la variable aléatoire.

Définition 3.16 La fonction génératrice GX d’une v.a. entière X est la fonction


définie sur l’intervalle [0, 1] par la formule suivante :

X
GX (s) = E(sX ) = pn sn , pour tout s ∈ [0, 1]. (3.6)
n=0

La fonction génératrice ne dépend que de la loi de X, c’est-à-dire de (pn )n .

Proposition 3.17 La fonction génératrice GX est continue sur [0, 1] et indéfiniment


dérivable sur [0, 1[ ; elle caractérise la loi de X.
3.3 – Fonction génératrice d’une v.a. entière 51

Preuve. La fonctionP GX est la somme d’une série entière qui converge absolument
au point 1, puisque n pn = 1. Les propriétés de continuité et de dérivabilité en
(n)
découlent. Comme la dérivée nième en 0 est GX (0) = pn n! , la fonction GX ca-
ractérise les pn , donc la loi de X. 

Proposition 3.18 Une v.a. entière X est intégrable si et seulement si GX est


dérivable à gauche au point 1, et dans ce cas E(X) = G0X (1).

Preuve. Rappelons d’abord un résultat sur les séries : si les fonctions s 7→ un (s) sont
croissantes et positives sur [0, 1[, on a :
X X
lim un (s) = lim un (s). (3.7)
s↑1 s↑1
n≥0 n≥0

Si s < 1, nous avons


GX (s) − GX (1) X sn − 1 X
= pn = pn (1 + s + · · · + sn−1 ),
s−1 s−1
n≥0 n≥0

et les fonctions un (s) = pn (1 + s + · · · + sn−1 ) sont croissantes et positives, avec


lims↑1 un (s) = n pn . Le résultat découle alors de (3.7). 

Plus généralement, la même démonstration prouve que

Proposition 3.19 La v.a. X(X − 1) · · · (X − p) est intégrable (et donc X admet


un moment d’ordre p + 1), si et seulement si GX est p + 1 fois dérivable à gauche au
point 1, et nous avons alors
(p+1)
E (X(X − 1) · · · (X − p)) = GX (1). (3.8)

En particulier, E(X(X − 1)) = G00X (1), d’où

Var(X) = G00X (1) − (G0X (1))2 + G0X (1).

Pour retrouver cette formule, nous pouvons dériver formellement la série (3.6) terme
à terme p + 1 fois au point s = 1, ce qui donne
(p+1)
X
GX (1) = pn n(n − 1) · · · (n − p),
n

et le membre de droite ci-dessus est égal au membre de gauche de (3.8) lorsque ce


dernier existe, d’après (3.5). Cela revient à dériver formellement p + 1 fois les deux
membres de l’égalité GX (s) = E(sX ), en échangeant les dérivées et le signe espérance.
52 Chapitre 3 – Espace fini ou dénombrable

Remarque 3.20 Pour calculer les moments d’une variable aléatoire entière (espérance,
variance,...), il peut être plus simple d’utiliser les dérivées de la fonction génératrice
plutôt qu’un calcul direct, comme nous le verrons dans le paragraphe ci-dessous.

3.4 Variables aléatoires discrètes usuelles

3.4.1 Variable aléatoire de Bernoulli

Nous lançons une pièce n fois. Nous associons 1 à Pile et 0 à Face. L’espace des
résultats de l’expérience sera donc
Ω = {0, 1}n .
Nous supposons que les lancers sont indépendants les uns des autres. Par ailleurs, la
pièce peut être truquée, ce qui nous conduit à supposer que la probabilité de Pile vaut
p ∈]0, 1[. Pour une pièce équilibrée, nous prendrons p = 21 .

Pour tout k ∈ {1, . . . , n}, appelons Xk le résultat du k-ième lancer. Xk peut


prendre les deux valeurs 0 et 1, et
PXk ({1}) = P(Xk = 1) = p , PXk ({0}) = P(Xk = 0) = 1 − p.
Nous remarquons que chaque variable Xk a la même loi, prenant les deux valeurs 1
et 0 avec respectivement les probabilités p et 1 − p.

Définition 3.21 X est une variable de Bernoulli de paramètre p si X prend ses valeurs
dans {0, 1} avec P(X = 1) = 1 − P(X = 0) = p. Sa loi est la loi de Bernoulli de
paramètre p, que l’on note B(p).

L’espérance, la variance et la fonction génératrice d’une variable aléatoire de Ber-


noulli de paramètre p valent respectivement
E(X) = p, Var(X) = p(1 − p) et GX (s) = 1 − p + ps. (3.9)
Nous avons en effet E(X) = p × 1 + 0 × (1 − p) = p, Var(X) = p − p2 = p(1 − p), et
le calcul de GX est tout aussi immédiat.

3.4.2 Variable aléatoire binomiale

Le nombre de Piles obtenus sur les n lancers est donné par :


n
X
Sn = Xi .
i=1
3.4 – Variables aléatoires discrètes usuelles 53

La v.a. Sn peut prendre toutes les valeurs entières entre 0 et n. Calculons sa loi. Pour
tout k ∈ {0, . . . , n}, nous cherchons
 n
X 
PSn ({k}) = P(Sn = k) = P {ω ∈ Ω, Xi (ω) = k} .
i=1

Cela veut dire que les n lancers ont donné k Piles et n − k Faces.  Il faut tenir compte
des places des Piles dans la suite de résultats obtenus. Il y a nk possibilités d’obtenir
les k Piles parmi les n lancers. Si nous fixons une répartition précise, (par exemple les
k Piles sont les k premiers), et comme les lancers sont indépendants, la probabilité
de cette répartition est égale à pk (1 − p)n−k . Ainsi, nous obtenons que
 
n k
P(Sn = k) = p (1 − p)n−k pour tout k = 0, . . . , n.
k

Définition 3.22 X est une variable binomiale de paramètres n et p si X prend ses


valeurs dans {0, . . . , n} et si pour k ∈ {0, . . . , n},
 
n k
P(X = k) = p (1 − p)n−k .
k
Sa loi est une loi binomiale de paramètres n et p, que l’on note B(n, p).

Nous avions obtenu cette loi dans nos modèles d’urnes, par un raisonnement intuitif.
Elle correspond au choix d’un tirage avec remise. Remarquons que B(1, p) = B(p) est
la loi de Bernoulli de paramètre p.

Pour une variable binomiale X de loi B(n, p), on a


E(X) = n p, Var(X) = n p(1 − p) et GX (s) = (1 − p + p s)n . (3.10)
Pn n k k
 n−k
En effet, on calcule que GX (s) = k=0 k p s (1 − p) = (1 − p + p s)n . En
dérivant
Pn GX et en considérant la dérivée de GX en s = 1, nous obtenons que E(X) =
n k
k=0 k k p (1 − p)
n−k
= G0X (1) = p n. Si nous  dérivons deux fois en 1 ce polynôme
Pn
GX , nous obtenons GX (1) = k=1 k(k − 1) nk pk (1 − p)n−k = E (X(X − 1)) , et par
00

suite, puisque E(X) = np, nous en déduisons que Var(X) = E (X(X − 1)) + E(X) −
E(X 2 ) = n p(1 − p).

Exemple 3.23 Aux jeux olympiques de Vancouver (2010), 86 médailles d’or ont été
mises en jeu. Nous faisons l’hypothèse que le nombre de médailles remportées par
pays est proportionnel à sa population. Soit X le nombre de médailles prévues pour
la France. X va suivre une loi binomiale B(86, p), où
population France 60 × 106
p= ≈ = 0,01.
population monde 6000 × 106
54 Chapitre 3 – Espace fini ou dénombrable

Ainsi E(X) = 86 × 0,01 = 0,86. La probabilité pour que le nombre de médailles soit
inférieur à 3 est P(X ≤ 3) = P(X = 0) + P(X = 1) + P(X = 2) + P(X = 3), avec
 
86
P(X = k) = (0,01)k (0,99)86−k ,
k
d’où P(X ≤ 3) = 0,9889 (La France avait en effet remporté 2 médailles d’or).

3.4.3 Probabilité de succès et variable aléatoire géométrique

Toujours sur ce jeu de n lancers de Pile (P) ou Face (F), intéressons-nous au premier
temps où nous allons obtenir un P. Pour ce faire, définissons la variable aléatoire T
par
T (ω) = inf{k ∈ {1, . . . , n}, Xk (ω) = P },
avec la convention inf ∅ = +∞. La v.a. T est à valeurs dans {1, 2, . . . , n, +∞} et
P(T = k) = P(X1 = F, . . . , Xk−1 = F, Xk = P } = (1 − p)k−1 p, 1 ≤ k ≤ n,
car nous avons supposé que nos lancers étaient indépendants. De même,
P(T = +∞) = P(X1 = F, . . . , Xn = F ) = (1 − p)n .
Si nous faisons (heuristiquement) tendre le nombre de lancers n vers l’infini, la loi de
la variable aléatoire T de succès du premier Pile est alors une probabilité définie par
P(T = k) = p(1 − p)k−1 , pour tout k ∈ N∗ .

Définition 3.24 X est une variable géométrique de paramètre p ∈]0, 1[ si X est une
variable aléatoire à valeurs dans N∗ telle que ∀k ∈ N∗ ,
P(X = k) = p(1 − p)k−1 .

Pour une variable aléatoire X de loi géométrique de paramètre p, on a :


1 1−p ps
E(X) = , Var(X) = p2 et GX (s) = .
p 1 − (1 − p)s
P k−1 k ps
En effet, on calcule directement GX (s) = k≥1 p(1 − p) s = 1−(1−p)s , et on
p

déduit E(X) = G0X (1) = (1−s+p s)2 s=1 = p1 . Le calcul de la variance est similaire.

Ainsi, si on répète des épreuves indépendantes de Bernoulli avec même probabilité


de succès p (obtention d’un Pile par exemple), jusqu’à l’obtention du premier succès,
le nombre moyen des répétitions nécessaires est 1/p. Il faut donc s’attendre à lancer
6 fois un dé équilibré avant d’obtenir le premier 1, en moyenne.
3.4 – Variables aléatoires discrètes usuelles 55

3.4.4 Variable aléatoire de Poisson

Définition 3.25 X est une v.a. de Poisson de paramètre θ > 0 si X prend ses valeurs
dans N et si sa loi est caractérisée pour tout k ∈ N par

θk
P(X = k) = e−θ . (3.11)
k!
Sa loi est une loi de Poisson de paramètre θ > 0, que l’on note P(θ).

Pour une v.a. de Poisson X de paramètre θ, on a

E(X) = θ, Var(X) = θ et GX (s) = eθ (s−1) . (3.12)


P∞ k
En effet, on calcule directement que E(X) = k=0 k e−θ θk! = θ, puis E (X(X − 1)) =
∞ k
e−θ k=2 k(k − 1) θk! = θ2 , d’où Var(X) = θ, vu que E(X) = θ. Le calcul de GX
P
se fait de la même façon, et on retrouve par dérivations successives au point 1 les
expressions de E(X) = θ et E(X(X − 1)) = θ2 .

Exemple 3.26 Supposons que le nombre d’erreurs Y par page d’un livre suit une loi
de Poisson de paramètre 21 . Calculons la probabilité qu’il y ait au moins une erreur
dans une page donnée :
1
P(Y ≥ 1) = 1 − P(Y = 0) = 1 − e− 2 ≈ 0,39.

La loi de Poisson comme limite de lois binomiales.

Considérons, pour n ∈ N∗ et an ∈ [0, 1], la probabilité sur N définie par


 
n
pj (an , n) = 1{j≤n} (an )j (1 − an )n−j , j ∈ N.
j

Ainsi, (pj (an , n))j∈N est l’extension naturelle sur N de la loi binomiale B(n, an ) de
paramètre an et de taille n. Supposons alors que la suite (an )n tende vers 0 quand n

 vers l’infini, de telle sorte que nan → θ ∈ R+ . En développant les combinaisons
tend
n
j , il est facile de vérifier que pour tout j ∈ N,

n→∞ θj
pj (an , n) −→ pj = e−θ .
j!
La loi de Poisson modélise donc la probabilité du nombre d’apparitions d’un
événement rare (an ∼ nθ est petit) dans une grande suite d’événements (n grand).
Ce résultat est très utile pour les calculs numériques, dans le cas où l’on souhaite
56 Chapitre 3 – Espace fini ou dénombrable

modéliser les occurences d’un événement rare. Il permet de remplacer la loi binomiale
par la loi de Poisson, ce qui conduit à des calculs beaucoup plus simples.

On peut citer beaucoup d’exemples de variables aléatoires qui peuvent être modélisées
par une loi de Poisson (parce que l’on approxime ainsi une loi binomiale) :
• le nombre de centenaires dans une communauté humaine,
• le nombre de clients entrant dans un bureau de poste en l’espace d’un jour,
• le nombre de bactéries dans un volume de liquide fixé,
• le nombre de particules émises par un gramme de matière radioactive,
• le nombre d’objets défectueux trouvés pendant un contrôle de qualité.

Reprenons l’exemple 3.23. La variable aléatoire X peut être approchée par une va-
riable aléatoire Z de loi de Poisson P(0,86). Comparons les probabilités :

k P(X = k) P(Z = k)
0 0,4213 0,4231
1 0,3660 0,3639
2 0,1571 0,1564
3 0,0444 0,0448

L’approximation est très bonne.

3.5 Lois conditionnelles et variables indépendantes

3.5.1 Lois marginales

Les notions de probabilités conditionnelles et d’événements aléatoires indépendants


ont été introduites au chapitre 2. Dans ce paragraphe, nous considérons deux v.a. X
et Y définies sur le même espace Ω fini ou dénombrable, muni de la probabilité P.
Nous supposons que X et Y sont à valeurs respectivement dans X et Y, que nous
pouvons supposer eux-mêmes finis ou dénombrables. Nous posons pX i = P(X = xi )
pour xi ∈ X , et pYj = P(Y = yj ) pour yj ∈ Y.

La connaissance des deux lois PX et PY ne donne pas d’information sur les liens
qui peuvent unir les comportements aléatoires de X et de Y .

Il est plus intéressant de considérer le couple Z = (X, Y ) comme une variable


aléatoire discrète à valeurs dans le produit cartésien X × Y. Notons PZ = (pZ
k , zk ∈
X × Y) la loi du vecteur aléatoire Z. Alors

pZ
k = P(Z = zk ) = P(X = xi et Y = yj ) pour tous zk = (xi , yj ) ∈ X × Y.
3.5 – Lois conditionnelles et indépendance 57

Définition 3.27 Les lois PX et PY de X et Y s’appellent les lois marginales du


couple (X, Y ) de variables aléatoires X et Y .

L’ensemble {X = xi } est la réunion (finie ou dénombrable) des ensembles deux-à-deux


disjoints {X = xi , Y = yj } = {Z = (xi , yj )}, yj ∈ Y. La propriété de σ-additivité de
la probabilité permet d’exprimer les lois marginales à partir de la loi jointe :
X
P(X = xi ) = P(Z = (xi , yk )) pour tout xi ∈ X , (3.13)
yk ∈Y
X
P(Y = yj ) = P(Z = (xk , yj )) pour tout yj ∈ Y. (3.14)
xk ∈X

3.5.2 Lois conditionnelles

Nous lançons en même temps un dé rouge et un dé bleu. Soient X le résultat du
dé rouge et Y le résultat de la somme des deux dés. Il est clair que la connaissance
de la valeur de X va influer sur les valeurs possibles que peut prendre Y et sur sa
loi. Par exemple, si X = 3, alors Y ne pourra prendre que des valeurs supérieures ou
égales à 4, ce qui n’est pas le cas si X = 1. Il est donc naturel de s’intéresser, pour
chaque valeur fixée xi de X, à la loi de Y avec l’information a priori que X = xi .

Définition 3.28 Soient X et Y deux variables aléatoires définies sur le même espace
de probabilité, à valeurs dans X et Y. Soit xi ∈ X tel que pX
i = P(X = xi ) > 0. On
appelle loi conditionnelle de Y sachant X = xi la probabilité sur Y définie par
Y |X=xi P(Z = (xi , yj ))
pj = P(Y = yj |X = xi ) = , ∀yj ∈ Y. (3.15)
P(X = xi )

Cette définition est cohérente avec (2.16). La loi conditionnelle de Y sachant X =


Y |X=xi
xi est caractérisée par {(yj , pj ), yj ∈ Y}. Ces lois conditionnelles sont a priori
différentes pour chaque valeur de xi et différentes de la loi marginale PY . L’équivalence
suivante découle immédiatement de (3.13)-(3.14) et la définition 3.28.

Proposition 3.29 Il est équivalent de connaı̂tre les (pZ X


k : zk ∈ X × Y), et les (pi :
Y |X=xi X
xi ∈ X ) et (pj : yj ∈ Y) pour xi ∈ X tels que pi > 0.

3.5.3 Espérance conditionnelle

Pour i fixé tel que pX i > 0, la loi conditionnelle de Y sachant X = xi donnée


Y |X=xi
par {(yj , pj ), yj ∈ Y} définit une probabilité. Nous pouvons lui associer son
58 Chapitre 3 – Espace fini ou dénombrable

espérance, sa variance ou plus généralement ses moments, dès qu’ils existent. Com-
mençons par l’espérance conditionnelle.

Définition 3.30 Soit Y une v.a. intégrable. L’espérance conditionnelle de Y sachant


{X = xi } est l’espérance de la loi conditionnelle de Y sachant {X = xi } :
Y |X=xi
X X
E(Y |X = xi ) = yj p j = yj P(Y = yj |X = xi ). (3.16)
j j

Remarque 3.31 La série définie en (3.16) est bien convergente. En effet, nous pou-
vons utiliser l’observation suivante
X XX
E(|Y | |X = xi )P(X = xi ) = |yj | P(X = xi , Y = yj )
i i j
X X
= |yj | P(X = xi , Y = yj ) = E(|Y |) < ∞,
j i

d’après le théorème de Fubini (voir (S9), section 2.4.4) et l’expression de la loi mar-
ginale (3.14) de Y . On en déduit que E(|Y | |X = xi ) < ∞ pour tout xi tel que
P(X = xi ) > 0.

Cette espérance conditionnelle sachant {X = xi } est une fonction de xi , que nous


noterons ψ(xi ). Elle n’est définie que sur les valeurs possibles xi de X. Nous pouvons
alors plutôt considérer la fonction ψ(X) elle-même.

Définition 3.32 L’espérance conditionnelle de Y sachant X est la v.a.



E(Y |X = x) si P(X = x) > 0
E(Y |X) = ψ(X), avec ψ(x) = (3.17)
0 si P(X = x) = 0

ATTENTION : Contrairement à l’espérance qui est un nombre réel, l’espérance condi-


tionnelle de Y sachant X est une variable aléatoire, dépendant de l’aléa “à travers”
la variable aléatoire X.

L’espérance conditionnelle étant définie comme l’espérance de la loi conditionnelle,


elle hérite des propriétés usuelles de l’espérance :
a) E (aY + bZ | X) = a E (Y | X) + b E(Z | X)
b) E (Y | X) ≥ 0 si Y ≥ 0
c) E (1 | X) = 1.
De plus,
E (Y g(X) | X) = g(X) E (Y | X) (3.18)
est une généralisation de l’égalité a) ci-dessus, au cas où a = g(X), qui doit être
considéré “ comme une constante ” dans le calcul de l’espérance conditionnelle sachant
X. (X est fixée comme une donnée connue a priori.)
3.5 – Lois conditionnelles et indépendance 59

Théorème 3.33 Si Y est intégrable, alors E(Y | X) est intégrable, et

E(E(Y | X)) = E( Y ).

Preuve. Nous avons


X X
| X=xi
E( ψ(X)) = ψ(xi ) pX (xi ) = yj pY (yj ) pX (xi )
i i,j
X X
= yj pX,Y (xi , yj ) = yj pY (yj ) = E( Y ).
i,j j

Nous avons utilisé ici le théorème de Fubini pour les séries. La justification de
l’intégrabilité de ψ(X) et du théorème de Fubini sont montrées en utilisant le même
calcul que ci-dessus où on a remplacé yj par |yj |. 

Ce résultat permet de calculer E(Y ) en conditionnant par une variable auxiliaire X :


X
E(Y ) = E(Y | X = xi ) P(X = xi )
i

Il généralise la formule des probabilités totales de la proposition 2.27, qui correspond


ici à Y = 1A et Bi = {X = xi }.

EXERCICE 3.1 Le nombre N de voitures passant devant une station d’essence en


un jour suit la loi de Poisson de paramètre λ > 0. Chaque voiture décide de s’arrêter
à la station avec probabilité p indépendamment des autres. On note K le nombre de
voitures qui s’arrêtent à la station. Trouver E(K).
n
Solution : Nous avons pN (n) = λn! e−λ et pK | N =n (k) = nk pk (1 − p)n−k . D’où


E(K | N = n) = k k pK | N =n (k) = n p, soit E (K | N ) = p N . D’après le théorème


P
3.33, E(K) = E ( E (K | N ) ) = E( N p) = p E( N ) = p λ, puisque λ = E(N ).

3.5.4 Variables aléatoires indépendantes

Remarque : Les formules (3.13) et (3.14) expriment les lois marginales PX et PY de


X et de Y en fonction de la loi PZ de Z. L’exemple suivant illustre que la connaissance
des lois marginales ne suffit pas, en général, à retrouver la loi de Z = (X, Y ).

Exemple 3.34 Considérons une variable aléatoire Z qui vaut (1, 1) et (−1, −1) avec
probabilité p2 , et (1, −1) et (−1, 1) avec probabilité 1−p
2 , où p ∈]0, 1[. Alors, les variables
60 Chapitre 3 – Espace fini ou dénombrable

aléatoires X et Y prennent les valeurs 1 et −1 avec probabilité 21 , et leur loi ne dépend


donc pas du paramètre p ∈]0, 1[ choisi. Pour le voir, nous avons calculé par exemple
1
P(X = 1) = P(Z = (1, 1)) + P(Z = (1, −1)) = .
2

Il convient alors d’étudier le cas où l’information sur X ne change rien à la loi de Y ,
généralisant ainsi la notion d’indépendance introduite pour les événements.

Définition 3.35 Les v.a. X et Y sont dites indépendantes si pour tous événements
A ⊂ X , B ⊂ Y elles vérifient
P(X ∈ A, Y ∈ B) = P(X ∈ A) P(Y ∈ B). (3.19)

Rappellons que P(X ∈ A, Y ∈ B) = P({X ∈ A} ∩ {Y ∈ B}) = P(X ∈ A et Y ∈ B).

Proposition 3.36 Il y a équivalence entre :


(i) Les v.a. X et Y sont indépendantes, de lois respectives PX et PY .
(ii) On a P(Z = (xi , yj )) = P(X = xi )P(Y = yj ) = pX Y
i pj pour tous xi ∈ X , yj ∈ Y.
Y |X=xi
(iii) On a pj = pYj pour tout yj ∈ Y et tout xi ∈ X tel que pX
i > 0.

Remarque 3.37 (iii) signifie que la loi conditionnelle de Y sachant X = xi est égale
à la loi marginale de Y , ce qui correspond bien à l’idée intuitive d’indépendance. Bien
entendu, comme la définition 3.35 de l’indépendance est symétrique en X et Y , nous
pouvons ci-dessus échanger les v.a. X et Y .

Preuve. Pour obtenir (i)⇒(ii) il suffit de prendre A = {xi } et B = {yj } dans (3.19).
Inversement, supposons (ii). En sommant par paquets dans la série à termes positifs,
nous obtenons pour A ⊂ X et B ⊂ Y :
X
P(X ∈ A, Y ∈ B) = P(Z ∈ A × B) = P(Z = (xi , yj ))
(xi ,yj )∈A×B
X X X X
= pX Y
i pj = pX
i pYj = P(X ∈ A) P(Y ∈ B),
xi ∈A yj ∈B xi ∈A yj ∈B

et (i) s’en déduit. Enfin, l’équivalence (ii)⇔(iii) provient de la définition 3.28. 

Proposition 3.38 Supposons les v.a. X et Y indépendantes. Soient f et g deux fonc-


tions réelles sur X et Y respectivement, telles que f (X) ∈ L1 et g(Y ) ∈ L1 . Alors le
produit f (X) g(Y ) est aussi intégrable et vérifie
E (f (X)g(Y )) = E (f (X)) E (g(Y )) . (3.20)
3.5 – Lois conditionnelles et indépendance 61

Preuve. Exactement comme dans la démonstration précédente, nous pouvons écrire


X X
|f (xi ) g(yj )|pZ
(xi ,yj ) = |f (xi ) g(yj )|pX Y
i pj
(xi ,yj )∈X ×Y xi ∈X ,yj ∈Y
! 
X X
= |f (xi )| pX
i
 |g(yj )|pYj  ,
xi ∈X yj ∈Y

qui est fini par hypothèse. Par suite, la variable aléatoire f (X) g(Y ) est intégrable.
En utilisant alors (S8) (section 2.4.4), la même démonstration montre que les égalités
ci-dessus sont également vérifiées en enlevant les valeurs absolues, ce qui donne bien
(3.20). 

Exemple 3.39 Considérons n v.a. de Bernoulli (Xi )ni=1 indépendantes et de pa-


ramètre p ∈]0, 1[. Soient xi ∈ {0, 1}, pour i ∈ {1, . . . , n}. La probabilité que la suite
(X1 , . . . , Xn ) soit égale à (x1 , . . . , xn ), vaut
P P
P (Xi = xi , 1 ≤ i ≤ n) = Πni=1 pxi (1 − p)1−xi = p xi
(1 − p)n− xi
, (3.21)
et nous retrouvons les résultats donnés au chapitre 2 (modèles d’urnes).

Exemple 3.40 On admet que le nombre de clients dans un bureau de poste pen-
dant une journée est une v.a. de Poisson de paramètre λ > 0. Soit p la probabi-
lité qu’une personne entrant dans le bureau de poste soit une femme. Dans ce cas,
le nombre de femmes X et celui des hommes Y parmi les clients quotidiens sont
des v.a. indépendantes, et suivent des lois de Poisson de paramètres respectifs λ p et
λ (1 − p). Pour s’en assurer, le lecteur pourra utiliser les calculs de l’exemple 3.1.

3.5.5 Somme de v.a. indépendantes

Les résultats suivants concernent la loi d’une somme de variables aléatoires


indépendantes. Ce sont des résultats très utiles dans la pratique.

Proposition 3.41 Supposons que X et Y sont deux v.a. à valeurs dans Z et notons
Z = (X, Y ). Alors
X X
P(X + Y = i) = P(Z = (j, i − j)) = P(Z = (i − j, j)). (3.22)
j∈Z j∈Z

En particulier si X et Y sont indépendantes, on a


X X
P(X + Y = i) = P(X = j)P(Y = i − j) = P(X = i − j)P(Y = j). (3.23)
j∈Z j∈Z
62 Chapitre 3 – Espace fini ou dénombrable

La loi de X + Y est donc obtenue grâce à un calcul de convolution discrète.

Preuve. (3.23) découle immédiatement de (3.22) et de (ii) de la proposition 3.36. Pour


(3.22), il suffit d’appliquer (2.3) et le fait que {X +Y = i} est la réunion des ensembles
deux-à-deux disjoints {X = j, Y = i − j} pour j ∈ Z, et aussi des {X = i − j, Y = j}
pour j ∈ Z. 

Remarque 3.42 Ces formules peuvent se généraliser à la somme de n variables


aléatoires indépendantes. En particulier, (3.21) entraı̂ne que la somme S = X1 +
· · · + Xn de n variables aléatoires indépendantes de loi de Bernoulli de paramètre p
suit une loi binomiale B(n, p).
Ainsi, la loi binomiale B(n, p) peut être interprétée comme la loi de la somme de n
variables aléatoires indépendantes, de loi de Bernoulli de paramètre p.

Proposition 3.43 Supposons les v.a. X et Y indépendantes, à valeurs dans N, et


U = X + Y . Notons GX , GY et GU les fonctions génératrices de X, Y et U . Nous
avons alors pour tout s ∈ [0, 1]

GU (s) = GX (s) GY (s). (3.24)

Preuve. Il suffit de remarquer que pour s ∈ [0, 1], GU (s) = E(sU ) = E(sX+Y ) et
GX (s) = E(sX ) et GY (s) = E(sY ), et d’appliquer (3.20). 

Ce résutat permet d’identifier dans certains cas très facilement la loi d’une somme
de variables aléatoires.

Exemple 3.44 Soient X et Y des v.a. indépendantes de loi B(n, p) et B(m, p) (avec
le même paramètre p). D’après (3.10), U = X + Y vérifie

GU (s) = (1 − p + ps)n (1 − p + ps)m = (1 − p + ps)n+m .

En appliquant encore (3.10) et la proposition 3.17, nous en déduisons que X + Y suit


la loi binomiale B(n + m, p).

Exemple 3.45 Soient X et Y des v.a. indépendantes de loi de Poisson de paramètres


respectifs θ et ζ. D’après (3.12), U = X + Y vérifie

GU (s) = eθ(s−1) eζ(s−1) = e(θ+ζ)(s−1) ,

de sorte que X + Y suit la loi de Poisson de paramètre θ + ζ.


3.6 – Exercices sur le chapitre 3 63

3.6 Exercices sur le chapitre 3

EXERCICE 3.2 Un sauteur tente de franchir des hauteurs successives numérotées


1, . . . , n, . . .. On suppose que les sauts sont indépendants les uns des autres, et que
P( le sauteur réussit son n-ième saut) = n1 .

Soit X le dernier saut réussi. Quelle est la loi de X ? Calculer E(X), Var(X).

P∞
EXERCICE 3.3 Si X est à valeurs dans N, montrer que E(X) = k=0 P(X > k).

EXERCICE 3.4 Le nombre d’accidents N en une semaine dans une usine est
aléatoire d’espérance m et de variance σ 2 . Le nombre d’individus X blessés dans
un accident est aléatoire, d’espérance µ et de variance τ 2 . Tous ces événements sont
supposés indépendants.

Donner la fonction génératrice du nombre Y d’individus blessés par semaine, en fonc-


tion des fonctions génératrices de N et de X. En déduire la valeur des espérance et
variance de Y , en fonction de m, σ 2 , µ et τ 2 .

EXERCICE 3.5 On étudie le flux de véhicules durant une tranche horaire donnée
à un raccordement de routes, décrit dans le dessin ci-dessous.

On note X (respectivement Y ), le nombre de véhicules empruntant la première (res-


pectivement la deuxième) branche, et donc S = X + Y véhicules empruntent l’auto-
route après le raccordement. X et Y sont modélisées par des variables aléatoires de
loi de Poisson de paramètres respectifs λ > 0 et µ > 0. Les variables aléatoires X et
Y sont supposées indépendantes.

Déterminer la loi de S et l’espérance conditionnelle de X sachant S.

EXERCICE 3.6 Soit Z le nombre d’enfants d’une famille ; X le nombre de filles


et Y le nombre de garçons. Nous supposons que la probabilité qu’une famille ainsi
choisie possède k enfants dont n filles, est donnée par :

e−2 2k (0,52)n (0,48)k−n


pk,n = P(Z = k; X = n) = 1{0≤n≤k} .
n!(k − n)!
64 Chapitre 3 – Espace fini ou dénombrable

1) Montrer que Z et X ne sont pas indépendantes mais que Y et X le sont.


2) Donner la loi conditionnelle de X sachant Z = k. En déduire l’espérance condi-
tionnelle de X sachant Z.

EXERCICE 3.7 Considérons un jeu de Pile ou Face, qui associe 1 à Pile et 0 à


Face. On appelle Xn le résultat du n-ième lancer et on suppose que
P(Xn = 1) = p, où p ∈]0, 1[.
1) Les événements An = {Xn−1 6= Xn }, pour n ≥ 2, sont-ils indépendants ? Discuter
selon p.
2) On introduit la variable aléatoire T définie par
T (ω) = inf{n, Xn−1 (ω) 6= Xn (ω)}
si cet ensemble est non vide et T (ω) = +∞ sinon.
a - Calculer P(T = n).
b - Montrer que P(T < +∞) = 1.
3) On désigne par XT la variable aléatoire définie par XT (ω) = XT (ω) (ω).
Quand a-t-on P ((XT , XT +1 ) = (1, 0)) = P ((XT , XT +1 ) = (0, 1)) ?

EXERCICE 3.8 On note P l’ensemble des nombres premiers différents de 1. On


sait que tout x ∈ N∗ s’écrit de manière unique comme produit de puissances entières
de nombres premiers de P. Pour tout nombre entier p, il existe donc une fonction
Up : N∗ → N telle que ∀x ∈ N∗ , x = Πp∈P pUp (x) .
Soit Q la probabilité sur N∗ définie par Q({x}) = xc2 , (0 < c < ∞).
1) Trouver la loi de Up , pour chaque p ∈ P.
2) Calculer Q(Up ≥ n), pour n ∈ N.
3) Montrer que pour Q, les variables (Up )p sont indépendantes.
4) Calculer la fonction génératrice de la v.a. Up , ainsi que son espérance et sa variance.

EXERCICE 3.9 Probabilités de Gibbs sur un système fini.

Rappel : Considérons ψ une fonction strictement convexe, et pour i ∈ {1, . . . , n}, des
réels xi et des réels positifs ai dont l’un au moins est non nul. Alors
P  P
i ai xi ai ψ(xi )
ψ P ≤ iP ,
a
i i i ai

avec égalité si et seulement si tous les xi sont égaux.


1) Soit un espace de probabilité fini Ω = {ωi , i = 1, . . . , n} de cardinal n. On notera
p une probabilité p = {pi , i = 1, . . . , n} sur Ω et on définit son entropie :
n
X n
X
H(p) := − p(ωi ) ln p(ωi ) = − pi ln pi .
i=1 i=1
3.6 – Exercices sur le chapitre 3 65

1-a) Vérifier que φ : [0, 1] → [0, +∞[, φ(t) = −t log t est strictement concave.
1-b) Montrer que H(p) = 0 si et seulement si p est une mesure de Dirac sur Ω.
1-c) Montrer que H(p) ≤ ln |Ω| = ln n.
2) Considérons une variable aléatoire réelle U , supposée non constante, et pour p une
probabilité sur Ω, nous noterons hU ip son espérance et Varp (U ) sa variance. Nous
appellerons fonction de partition associée à l’énergie U la fonction
n
X
Z(β) = e−βU (ωi ) , β ∈ R.
i=1

−βU (ωi )
La probabilité de Gibbs associée est définie pour chaque ωi par µβ (ωi ) := e Z(β) ·
2-a) Que vaut ln Z(0) ?
2-b) Montrer que quand β tend vers +∞, µβ devient une probabilité uniforme sur
l’ensemble Ωmin := {ω; U (ω) = minΩ U }, et que lorsque β → −∞, µβ devient une
probabilité uniforme sur Ωmax := {ω; U (ω) = maxΩ U }. En déduire que

lim hU iµβ = min U ; lim hU iµβ = max U. (3.25)


β→+∞ Ω β→−∞ Ω

2-c) Montrer que l’application définie sur R par β 7→ ln Z(β) est de classe C ∞ et que

ln Z)0 (β) = −hU iµβ ; ln Z)00 (β) = Varµβ (U ).

En déduire que la fonction β 7→ ln Z(β) est strictement convexe.


3) Notre but est de rechercher une probabilité µ sur Ω qui maximise l’entropie p →
H(p) et telle que hU iµ = E, où E ∈ ] minΩ U, maxΩ U [ est donné.

On admet que, par un théorème de Lagrange, µ est un extremum de la fonction


n
X
p = (pi ; i ∈ {1, . . . , n}) 7→ F (p) := H(p) − β (hU ip − E) − λ pi
i=1

où β est un paramètre à déterminer par la contrainte hU iµ = E et λ un paramètre


à déterminer par la contrainte que µ est une probabilité. Ces paramètres sont les
“multiplicateurs” de Lagrange.
3-a) Montrer qu’il existe un unique β = β(E) ∈ R tel que hU iµβ = E.
3-b) Supposons que µβ maximise l’entropie. Montrer qu’alors son entropie vaut

H(µβ ) = ln Z(β) + β E.

3-c) Montrer que la fonction p → 7 H(p) − βhU ip − ln Z(β) est négative ou nulle, et
qu’elle est nulle si et seulement si p = µβ .

En déduire que µβ est bien un maximum et que c’est en fait l’unique maximum.
Chapitre 4

Espérance mathématique de
variables aléatoires réelles

Je crois au hasard avec une obstination constante ; c’est même cela qui fait que
lorsque je vois, je vois comme personne d’autre...

Nicolas de Stael.

4.1 Probabilité uniforme et mesure de Lebesgue

Dans ce paragraphe, nous découvrons les difficultés importantes que l’on rencontre
dans le cas de l’espace fondamental Ω = [0, 1]d muni de sa tribu Borélienne B[0,1]d .
Le cas unidimensionnel [0, 1] est l’exemple le plus simple d’un ensemble infini non
dénombrable. Nous allons voir en particulier qu’il n’est pas possible de construire
une probabilité uniforme qui s’étend sur P([0, 1]), justifiant ainsi le besoin crucial
d’introduire des tribus plus petites que P([0, 1]).

Pour définir une probabilité uniforme λ : B[0,1] −→ [0, 1], il est naturel de com-
mencer par le sous-ensemble A0 ⊂ B[0,1] constitué des parties A ⊂]0, 1] de la forme

A = ∪1≤i≤n ]ai , bi ] pour n ∈ N et 0 ≤ a1 ≤ b1 ≤ . . . ≤ an ≤ bn ≤ 1. (4.1)

Le candidat naturel pour une probabilité uniforme se doit d’être défini sur A0 par :
n
X
λ0 (A) := (bi − ai ). pour tout A ∈ A0 de la forme (4.1). (4.2)
i=1

67
68 Chapitre 4 – Espérance mathématique de variables aléatoires réelles

L’objectif est maintenant d’obtenir une probabilité λ sur B[0,1] qui soit une extension
de λ0 , c’est-à-dire λ vérifiant les propriétés de la définition 2.9 et λ(A) = λ0 (A) pour
tout A ∈ A0 .

Théorème 4.1 (admis) Il existe une unique probabilité λ sur ([0, 1], B[0,1] ) qui soit
une extension de l’application λ0 de (4.2).

Cette probabilité est appelée mesure de Lebesgue sur [0, 1] et a la propriété de


ne pas charger les points, c’est-à-dire λ({x}) = 0 pour tout x ∈ [0, 1]. Le résultat
précédent repose sur l’application d’un résultat difficile de la théorie de la mesure
dont nous rappelons l’énoncé dans le cadre d’une probabilité.

Théorème 4.2 (Caratheodory, admis) Soient


— A0 une algèbre sur Ω (c’est-à-dire vérifiant (A1)-(A2) et (A3)f des définitions
2.2 et 2.3),
— et µ0 : A0 −→ [0, 1] une fonction vérifiant les conditions de σ−additivité et
de masse totale unitaire de la définition 2.9.
Alors il existe une unique probabilité µ sur A = σ(A0 ) telle que µ = µ0 sur A0 .

L’ensemble de cette construction s’étend au cas multidimensionnel.

Théorème 4.3 (admis) Pour tout entier d ≥ 1 fixé, il existe une unique probabilité
λ définie sur B[0,1]d qui coincide avec le volume sur les pavés :

λ Πdi=1 ]ai , bi ] = Πdi=1 (bi − ai ), pour tous 0 ≤ ai < bi ≤ 1, i = 1, . . . , d.




Cette probabilité λ s’appelle la mesure de Lebesgue sur [0, 1]d .

La probabilité uniforme sur un ensemble borélien borné V de Rd d’intérieur non


vide se définit comme suit. La bornitude de V assure l’existence d’une constante r > 0
tell que rV ⊂ [0, 1]d . On peut alors définir la probabilité uniforme sur V par :
λ(rA)
PV (A) = pour tout A ∈ BV .
λ(rV )
(On peut vérifier que le résultat ne dépend pas du choix de r). La probabilité que le
résultat tombe dans une partie A de V est proportionnelle au volume de cette partie.
Si n = 1 et A est un intervalle, le volume est la longueur de l’intervalle. Le cas de la
loi uniforme sur [a, b] est donc le cas particulier où V = [a, b].

Enfin, cette construction s’étend sur Rd et permet de définir une mesure (de masse
infinie) sur l’espace (Rd , BRd ) qui coincide avec le volume sur les pavés.
4.2 – Variables aléatoires dans Rd 69

Théorème 4.4 (admis) Pour tout entier d ≥ 1 fixé, il existe une unique mesure λ
sur (Rd , BRd ), appelée mesure de Lebesgue sur Rd , telle que
λ Πdi=1 ]ai , bi ] = Πdi=1 (bi − ai ), pour tous ai < bi , i = 1, . . . , d.


La mesure λ est invariante par translation : pour tout B ∈ BRd et b ∈ Rd , on a


λ(b + B) = λ(B).

Pour aller plus loin...

Remarque 4.5 Il n’est pas possible d’étendre la probabilité λ à P([0, 1]). En parti-
culier, B[0,1] ( P([0, 1]). Nous allons en effet définir un ensemble (dit de Vitali) qui
ne peut être mesuré par la probabilité λ définie dans le théorème 4.1.
— On introduit la relation d’équivalence sur [0, 1] : x ∼ y si x − y ∈ Q. On note
(Ai )i∈I les classes d’équivalence.
— En invoquant l’axiome du choix (car I non dénombrable), on identifie chaque
Ai avec xi ∈ Ai , et on note B := (xi )i∈I .
— On introduit Bn := rn + B, où (rn )n∈N = Q ∩ [−1, 1]. Alors
— Les (Bn )n sont deux à deux disjoints. En effet, si x ∈ Bn ∩ Bp , alors il
existe in et ip tels que x = rn + xin = rp + xip ce qui implique que xin ∼ xip ,
donc xin = xip et n = p.
— Pour tout x ∈ [0, 1], il existe i tel que x ∈ Ai , donc x = xi + r pour un
certain rationnel r ∈ Q ∩ [−1, 1]. Donc
[0, 1] ⊂ ∪n Bn ⊂ [−1, 2].
— On fait un raisonnement par l’absurde. Supposons que B est mesurable. Alors
λ(Bn ) = λ(B) pour tout n car la mesure de Lebesgue λ est invariante par
translation, et d’une part
X X
1 = λ([0, 1]) ≤ λ(Bn ) = λ(B),
n≥1 n≥1

ce qui implique que λ(B) > 0, et d’autre part


X X
3 = λ([−1, 2]) ≥ λ(Bn ) = λ(B),
n≥1 n≥1

ce qui implique que λ(B) = 0. Il y a contradiction, ce qui montre que B n’est


pas mesurable.

4.2 Variables aléatoires dans Rd

Les v.a. que nous considérons maintenant peuvent être à valeurs dans Rd tout en-
tier (ou, dans ce paragraphe, dans n’importe quel espace topologique). Comme dans
70 Chapitre 4 – Espérance mathématique de variables aléatoires réelles

le chapitre précédent, nous souhaitons pouvoir évaluer les chances de réalisation


d’événements du type X −1 (B) = {X ∈ B} pour tout B ∈ BRd . Cela nous conduit à
la définition suivante.

Définition 4.6 Soit Ω l’espace fondamental muni de la tribu A des événements. On dit
que X : (Ω, A) −→ (Rd , BRd ) est une fonction mesurable ou une variable aléatoire si
X −1 (B) ∈ A pour tout B ∈ B Rd .

Dans le cas où Ω est fini ou dénombrable et muni de la tribu A = P(Ω), toute
application de (Ω, A) dans (Rd , BRd ) est une variable aléatoire, comme on l’a défini
dans le chapitre précédent.

Exemple 4.7 (i) Soit A ⊂ Ω. Alors X = 1A (l’indicatrice de A) est une v.a. si et


seulement si A ∈ A (A mesurable). En effet pour B ∈ BR , on a X −1 (B) est égal à ∅,
A, Ac ou Ω selon que B ∩ {0, 1} est égal à ∅, {1}, {0} ou {0, 1}.
0
(ii) Une fonction continue f : (Rd , BRd ) −→ (Rd , BRd0 ) est mesurable. En effet,
0
l’image réciproque de tout ouvert de Rd est un ouvert de Rd , donc un élément de BRd .

Plus généralement, nous avons le résultat suivant :

Proposition 4.8 (i) Soient X est une variable aléatoire à valeurs dans Rd et
0
f : Rd −→ Rd mesurable (par rapport aux tribus Boréliennes). Alors f (X) est une
variable aléatoire.
(ii) Soit X : Ω −→ R. Alors X est une v.a. ssi X −1 (] − ∞, a]) ∈ A pour tout a ∈ R
ssi X −1 ([a, ∞[) ∈ A pour tout a ∈ R.
(iii) Soit (Xn )n∈N? une suite de v.a. réelles (à valeurs dans R). Alors

inf Xn , sup Xn , lim inf Xn = sup inf Xn et lim sup Xn = inf sup Xn
n≥1 n≥1 n n≥1 p≥n n n≥1 p≥n


sont des variables aléatoires. En particulier, si la suite Xn (ω) n est convergente pour
tout ω ∈ Ω, alors limn Xn est une variable aléatoire.

Preuve. Pour le (i), il suffit de remarquer que pour tout B ∈ BRd0 , on a f −1 (B) ∈ BRd
d’après la mesurabilité de f et Y −1 (B) = X −1 f −1 (B) ∈ A d’après la mesurabilité
de X.
Pour le (ii), notons R = {B ∈ BR : X −1 (B) ∈ A}. Comme l’image réciproque X −1
commute avec la réunion, l’intersection et le passage au complémentaire, il est clair
que R est une tribu contenue dans BR . Alors, si R contient les intervalles ] − ∞, a]
pour tout a ∈ R, on déduit dela proposition 2.8 que R = BR . On utilise le même
argument pour montrer la deuxième équivalence.
4.3 – Espérance des v.a. réelles 71

Enfin, pour (iii), il suffit de remarquer que pour tout a ∈ R, on a {supn Xn ≤ a} =


∩n {Xn ≤ a} ∈ A, et on applique le résultat de (ii). On utilise un argument similaire
pour inf n Xn . En appliquant ces deux résultats successivement,
 on déduit la mesu-
rabilité de lim inf n X et lim supn X. Enfin, si Xn (ω) n est convergente pour tout
ω ∈ Ω, on a limn Xn = lim inf n X = lim supn X est une variable aléatoire. 

4.3 Espérance des v.a. réelles

Dans cette partie, nous généralisons la notion d’espérance introduite au Chapitre


3 à toutes les v.a. réelles “pas trop grandes” (en un certain sens). L’idée naturelle est
de se ramener au chapitre précédent en approchant X par une suite de v.a. prenant
un nombre fini de valeurs.

Remarque fondamentale : Il est important de comprendre ici que l’on connaı̂t bien
l’espace d’arrivée d’une v.a. réelle (R) mais qu’on connaı̂t mal son espace de départ
(l’espace abstrait Ω). L’idée majeure, qui est à la base de la théorie de l’intégration de
Lebesgue, est d’approcher nos v.a. par une suite obtenue par découpage de l’espace
d’arrivée, et non pas de l’espace de départ (comme dans le cas de l’intégrale de Rie-
mann).

Dans ce paragraphe, nous introduisons la notion d’intégrale de Lebesgue sur un


espace abstrait muni d’une mesure de probabilité P. Cependant, tous les arguments
sont en fait valable dans le cadre plus général d’un espace (Ω, A) muni d’une mesure.

4.3.1 Espérance de v.a. positives

Définition 4.9 Une v.a. Y est dite étagée si Y (Ω) est fini, c’est-à-dire qu’elle prend
un nombre fini de valeurs Y (Ω) = {y1 , . . . , yn } et on a
n
X
Y = yi 1Ai , avec Ai = {Y = yi }.
i=1

On note E+ l’ensemble des v.a. étagées positives.

Notons également L0 l’ensemble des v.a. réelles, et L0+ le sous-ensemble des


v.a. réelles positives. D’après (3.1), l’espérance d’une v.a. étagée est donnée par
X
E(Y ) = y P(Y = y) pour tout Y ∈ E+ . (4.3)
y∈Y (Ω)
72 Chapitre 4 – Espérance mathématique de variables aléatoires réelles

Ici, il est commode d’autoriser la valeur +∞ pour Y , et on utilisera les règles de calcul
0 × ∞ = ∞ × 0 = 0. Nous étendons à présent la définition de l’espérance à l’ensemble
L0+ des v.a. positives.

Définition 4.10 Pour X ∈ L0+ , l’espérance de X par rapport à P est définie par
E(X) = sup {E(Y ) : Y ∈ E+ et Y ≤ X} .

L’ensemble {Y ∈ E+ : Y ≤ X}, dont la borne supérieure définit l’espérance,


contient la fonction nulle. Notant par b·c la partie entière (le plus grand minorant
entier), on peut aussi construire des éléments non triviaux en introduisant la fonction
αn (x) = n ∧ 2−n b2n xc, x ∈ R.
En effet, pour tout X ∈ L0 :
Yn = αn (X), n ∈ N∗ , définit une suite croissante de E+ qui converge vers X. (4.4)
Une illustration de l’approximation de X par la suite de v.a. étagées Yn = αn (X)
est donnée par la figure 4.3.1. Nous verrons un peu plus loin (Remarque 4.14)
que cette approximation permet de donner une définition équivalente de l’espérance
mathématique.

La définition de l’espérance implique immédiatement que


E(cX) = c E(X) pour tous c ∈ R+ et X ∈ L0+ , (4.5)
ainsi que la propriété de monotonie suivante.

Lemme 4.11 Soient X1 , X2 ∈ L0+ . Si X1 ≤ X2 , alors 0 ≤ E(X1 ) ≤ E(X2 ). De plus


E(X1 ) = 0 si et seulement si X1 = 0 P−p.s.

Preuve. Pour la première partie, il suffit de remarquer que {Y ∈ E+ : Y ≤


X1 } ⊂ {Y ∈ E+ : Y ≤ X2 }. Pour la deuxième partie de l’énoncé, rappelons que
P(X > 0) = lim ↑ P(X > n−1 ) d’après la proposition 2.12. Si P(X > 0) > 0, on
a P(X > n−1 ) > 0 pour n assez grand. Alors X ≥ Y = n−1 1{X>n−1 } ∈ E+ , et on
déduit de la définition de l’intégrale que E(X) ≥ E(Y ) = n−1 P(X > n−1 ) > 0. 

Le résultat à la base de la théorie de l’intégration est l’extension suivante de la


propriété de convergence monotone de P énoncée dans la proposition 2.12.

Théorème 4.12 (convergence monotone) Soit (Xn )n ⊂ L0+ une suite croissante
P−p.s., i.e. pour tout n ≥ 1, Xn ≤ Xn+1 , P−p.s. Alors
E (lim ↑ Xn ) = lim ↑ E(Xn ).
4.3 – Espérance des v.a. réelles 73

Preuve. On procède en deux étapes.


1) On commence par supposer que la suite est monotone Xn ≤ Xn+1 sur Ω (et non
seulement p.s. c’est à dire sur une partie de mesure pleine de Ω).
On note X := lim ↑ Xn . D’après le lemme 4.11, la suite des espérances (E(Xn ))n
hérite la croissance de la suite (Xn )n et est majorée par E(X). Ceci montre l’inégalité
lim ↑ E(Xn ) ≤ E (lim ↑ Xn ). 1
Pour l’inégalité inverse, montrons que lim ↑ E(Xn ) ≥ E(Y ) pour toute v.a. de E+ ,
Pk
Y = i=1 ai 1Ai ∈ E+ ≤ X. Pour c ∈ [0, 1[, on déduit du lemme 4.11 et de (4.5) que :
k
X
E(Xn ) ≥ E(Xn 1{Xn ≥cY } ) ≥ c E(Y 1{Xn ≥cY } ) = c ai P(Ai ∩ {Xn ≥ cai }).
i=1

En utilisant la propriété de convergence monotone des mesures d’ensembles énoncée


dans la proposition 2.12 (i), on obtient alors :
k
X
lim ↑ E(Xn ) ≥ c ai P(Ai ) = c E(Y ) −→ E(Y ) quand c → 1.
i=1

2) Dans le reste de la preuve, on veut passer de la monotonie de la suite (Xn )n sur Ω


à la monotonie P−p.s. Pour cela, introduisons Ω0 = {ω ∈ Ω : (Xn (ω))n croissante} et
la suite croissante (sur Ω) X̃n := Xn 1Ω0 . La première étape de cette preuve s’applique
à la suite (X̃n ), alors il suffit de montrer que E(X̃n ) = E(Xn ). Comme X̃n ≤ Xn ,
l’inégalité E(X̃n ) ≤ E(Xn ) découle du lemme 4.11. Pour tout ε > 0, il existe Ynε ∈ E+
tel que Ynε ≤ Xn et E(Ynε ) ≥ E(Xn ) − ε. Notons Ỹnε = Ynε 1Ω0 . Alors Ỹnε ∈ E+ et
vérifie Ỹnε ≤ X̃n . Alors, E(Ỹnε ) ≤ E(X̃n ). Comme E(Ỹnε ) = E(Ynε ), on déduit que
E(Xn ) ≤ E(Ynε ) + ε ≤ E(X̃n ) + ε & E(X̃n ) pour ε & 0. 

Remarque 4.13 Par le même argument que l’étape 2 ci-dessus (approximation par
les fonctions étagées (4.4) et utilisation du théorème de convergence monotone), on
montre facilement que :
(i) Pour X1 , X2 ∈ L0+ telles que X1 = X2 P−p.s., on a E(X1 ) = E(X2 ). En particu-
lier, pour toute constante a ∈ R+ ,
Si X = a P − p.s. alors E[X] = a.
(ii) Pour X1 , X2 ∈ L0+ , on a E(X1 + X2 ) = E(X1 ) + E(X2 ).

Remarque 4.14 (Définition équivalente de l’espérance) Une conséquence di-


recte du théorème de convergence monotone 4.12 (n’utilisant en fait que l’étape 1
de la preuve) est que l’espérance peut être définie de manière équivalente par :
E(X) = lim ↑ E αn (X) pour tout X ∈ L0+ ,


1. Pour une première lecture, la première étape de cette preuve sera suffisante pour l’ensemble
des résultats de ce chapitre.
74 Chapitre 4 – Espérance mathématique de variables aléatoires réelles

1.000 1.000

0.875 0.875

0.750 0.750

0.625 0.625

0.500 0.500

0.375 0.375

0.250 0.250

0.125 0.125

0.000 0.000
0.0 0.5 1.0 1.5 2.0 2.5 3.0 3.5 4.0 0.0 0.5 1.0 1.5 2.0 2.5 3.0 3.5 4.0

Figure 4.1 – Découpage “à la Riemann” (à gauche) ou “à la Lebesgue” (à droite), en 16
intervalles de même longueur de l’abscisse ou de l’ordonnée, respectivement.

où αn (X) est l’approximation de X introduite dans (4.4) qui approxime X par un
découpage de l’espace d’arrivée. On aurait pu en fait utiliser n’importe quelle approxi-
mation monotone, la limite est toujours la même, à savoir l’espérance.

4.3.2 Espérance de v.a. réelles

Pour une v.a. X ∈ L0 , on introduit les v.a. X + := max{X, 0} et X − :=


max{−X, 0} si bien que |X| = X + + X − et X = X + − X − .

Définition 4.15 Une v.a. X ∈ L0 est dite P−intégrable si E(|X|) = E(X + ) +


E(X − ) < ∞. Dans ce cas, son espérance est définie par
Z
+ −
E(X) = E(X ) − E(X ) notée aussi X(ω)P(dω).

1 1
On note par L l’ensemble des v.a. P−intégrables (ou L (Ω, A, P) s’il convient de préciser
l’espace de probabilité sous-jacent).

On voit immédiatement que L1 est un espace vectoriel et que


E(aX + bY ) = aE(X) + bE(Y ) pour tous X, Y ∈ L1 et a, b ∈ R. (4.6)
Ceci est une conséquence immédiate de la validité de (4.5) et de la remarque 4.13
pour les v.a. positives.

Remarque 4.16 Les fonctions Riemann intégrables sont Lebesgue intégrables. La


réciproque n’est pas vraie (par exemple, la fonction f = 1Q∩[0,1] est Lebesgue-intégrable,
4.3 – Espérance des v.a. réelles 75

mais n’est pas Riemann-intégrable). Montrons ceci dans Ω = [0, 1] muni de la mesure
de Lebesgue λ. Soit f une fonction Riemann integrable bornée sur Ω d’intégrale (au
R1 R1
sens de Riemann) 0 f (x)dx. Alors f est Lebesgue intégrable et E(f ) = 0 f (x)dx.
Si f est une fonction en escalier, ce résultat est trivial. Pour une fonction Riemann
intégrable bornée f arbitraire, on peut trouver deux suites de fonctions en escalier
(gn )n et (hn )n respectivement croissante et décroissante telles que gn ≤ f ≤ hn et
Z 1 Z 1
inf (gn − hn )(x)dx = lim (gn − hn )(x)dx = 0.
n 0 n→∞ 0

Sans perte de généralité, on peut supposer hn ≤ 2 max |f |. Les fonctions f∗ := supn gn


et f ∗ := inf n hn sont boréliennes, et on a f∗ ≤ f ≤ f ∗ . D’après théorème 4.12 de
convergence monotone :
0 ≤ E(f ∗ − f∗ ) = E (inf(hn − gn )) ≤ inf E(hn − gn ) = 0,
n
R1 R1
et par suite f = f ∗ = f∗ . Enfin, E(f∗ ) = lim ↑ E(gn ) = lim ↑ 0
gn (x)dx = 0
f (x)dx.

Remarque 4.17 Les outils développés tout au long de ce paragraphe ne sont pas
spécifiques aux probabilités, et s’écrivent exactement de la même manière pour les me-
sures, c’est-à-dire les fonctions σ−additives de A dans R+ (sans condition de masse
totale unitaire). Par exemple, les mêmes arguments (fonctions étagées, puis conver-
gence monotone pour les fonction positives, puis décomposition en partie négative et
positive) permettent de définir l’intégrale par rapport à la mesure de Lebesgue (intro-
duite dans le théorème 4.4) :
Z Z
f (x)λ(dx) = f (x)dx1 . . . dxd pour tout f ∈ L0+ ∪ L1 (λ),
Rd Rd

et le théorème 4.12 est valable dans ce cadre.

Pour aller plus loin...

On peut lever une source d’ambiguité concernant l’espérance d’une variable


aléatoire réelle X. Pour cela, utilisons la notation plus précise L1 (A) qui met en
évidence la dépendence par rapport à la tribu A. Pour X ∈ L1 (A) et une partie
A ∈ A, on peut définir l’espérance de X1A , soit en intégrant la restriction XA = X|A
par rapport à la restriction PA de P à l’espace mesurable (A, AA ), où AA est la
σ−algèbre définie par AA = P(A) ∩ A.

Proposition 4.18 Pour tout X ∈ L1 (A) et A ∈ A, on a E(X1A ) = EA (XA ).

Preuve. Tout d’abord, cette propriété est vraie pour les fonctions X = 1B , B ∈ A,
puisque dans ce cas E(1B 1A ) = P(A ∩ B) = EA (1B |A ). Par linéarité, cette égalité
76 Chapitre 4 – Espérance mathématique de variables aléatoires réelles

reste vraie pour les fonctions étagées, puis par convergence monotone pour les fonc-
tions mesurables positives. Enfin, pour X ∈ L1 (A, P), on décompose X = X + − X − ,
et on obtient le résultat voulu en appliquant l’égalité à X + et X − . 

4.4 Variables aléatoires de carré intégrable

4.4.1 Variance et Covariance

Outre l’espace L1 , nous définissons aussi, comme au Chapitre 3, l’espace L2 des va-
riables aléatoires X dont le carré X 2 est dans L1 .

Définition 4.19 Une v.a. réelle X est de carré intégrable si la variable aléatoire X 2 est
intégrable, c’est-à-dire si son espérance E(X 2 ) est finie.

Proposition 4.20 L2 est un sous-espace vectoriel de L1 , et si X ∈ L2 ,


p
|E(X)| ≤ E(|X|) ≤ E(X 2 ).

La preuve est identique à celle de la proposition 3.11.

Définition
 4.21 La variance d’une v.a. réelle X ∈ L2 , est Var(X) = E (X −
2 2
E(X)) , notée aussi σX , ou σ 2 s’il n’y a pas d’ambiguité. Sa racine carrée positive
p
σX = Var(X) s’appelle l’écart-type de X.

De même que l’espérance a été comparée au centre de gravité d’un ensemble de masses,
la variance peut être rapprochée du concept mécanique de moment d’inertie (par
rapport à l’espérance).

Remarque 4.22 Soit X ∈ L2 .


(i) En utilisant la linéarité de l’espérance, nous obtenons encore la formule de Huy-
gens : “la variance est égale à la moyenne des carrés moins le carré de la moyenne”

Var(X) = E(X 2 ) − E(X)2 . (4.7)

(ii) Var(X) = 0 si et seulement si X = E(X), P−p.s. La condition nécessaire découle


du lemme 4.11. La condition suffisante est évidente.
4.4 – Variables aléatoires de carré intégrable 77

Remarquons que si X et Y sont dans L2 , la variable aléatoire XY est dans L1 . En effet,


il suffit d’écrire |XY | ≤ 21 (X 2 + Y 2 ). Nous pouvons alors définir la notion suivante.

Définition 4.23 La covariance de deux v.a. X, Y ∈ L2 est :

Cov(X, Y ) = E ((X − E(X))(Y − E(Y ))) . (4.8)

Si Var(X)Var(Y ) > 0 (i.e. X, Y ne sont pas constantes, P−p.s.), le coefficient de


corrélation est le nombre
Cov(X, Y )
ρ(X, Y ) = p . (4.9)
Var(X)Var(Y )

Par linéarité de l’espérance, nous obtenons

Cov(X, Y ) = E(XY ) − E(X)E(Y ), (4.10)

qui est extension de la formule de Huygens ci-dessus car Var(X) = Cov(X, X). On
obtient aussi que la covariance est une forme bilinéaire sur l’espace vectoriel des v.a. de
carré intégrable, et nous avons

Cov(aX + b, a0 Y + b0 ) = aa0 Cov(X, Y ) pour tous a, a0 , b, b0 ∈ R.

En particulier,

Var(aX + b) = a2 Var(X), (4.11)

et nous déduisons pour des v.a. non constantes P−p.s. que ρ(X, Y ) = ρ(aX + b, a0 Y +
b0 ) lorsque aa0 > 0.
Pn
Enfin, si X1 , . . . , Xn ∈ L2 , alors i=1 Xi ∈ L2 et
n
X X
Var(X1 + . . . + Xn ) = Var(Xi ) + 2 Cov(Xi , Xj ). (4.12)
i=1 1≤i<j≤n

Remarque 4.24 Pour une v.a. X ∈ L2 non constante P−p.s.


X − E(X)
est d’espérance nulle et d’écart-type 1.
σX
Nous dirons que cette v.a. est centrée et réduite.

La notion de variance s’étend aux vecteurs aléatoires comme suit. Dans la suite |.|
désigne la norme Euclidienne dans Rn , | l’opérateur de transposition et · le produit
scalaire correspondant.
78 Chapitre 4 – Espérance mathématique de variables aléatoires réelles

Définition 4.25 X = (X1 , . . . , Xn )| : Ω −→ Rn est appelé vecteur aléatoire si ses


composantes Xi sont des v.a. réelles. Un vecteur aléatoire sera toujours considéré sous
forme de vecteur colonne dans Rn .
(i) On dit que X est intégrable, et on note X ∈ L1 , si |X| ∈ L1 (ou de manière
équivalente Xi ∈ L1 pour tout i = 1, . . . , n). Son espérance est donnée par le vecteur
espérance E(X) = (E(X1 ), . . . , E(Xn ))| .
(ii) On dit que X est de carré intégrable, et on note X ∈ L2 , si |X|2 ∈ L1 (ou de manière
équivalente Xi ∈ L2 pour tout i = 1, . . . , n). Dans ce cas, sa matrice de variance
 ou
de covariance est la matrice de taille n×n symétrique Var(X) = Cov(Xi , Xj ) 1≤i,j≤n .
(iii) Soit Y un deuxième vecteur aléatoire à valeurs dans Rd . Si X et Y sont de carré
intégrable, leur covariance est définie par
Cov(X, Y ) = E (X − EX)(Y − EY )| ,


C’est une matrice réelle de taille n × d de composantes Cov(X, Y )ij = Cov(Xi , Yj ), 1 ≤


i ≤ n, 1 ≤ j ≤ d. En particulier, Cov(X, X) = Var(X) et Cov(Y , X) = Cov(X, Y )| .

Proposition 4.26 Pour un vecteur aléatoire X dans Rn , la matrice Var(X) est


symétrique positive, et Var(AX) = AVar(X)A| pour toute matrice réelle A de taille
m × n.

Preuve. La symétrie est évidente. En notant ci,j := Cov(Xi , Xj ), on Pvérifie par un cal-
n
cul direct que pour tout a = (a1 , . . . , an )| ∈ Rn , on a a| Var(X)a = i,j=1 ai aj ci,j =
Pn 
Var i=1 ai Xi = Var(a · X) ≥ 0, ce qui prouve que la matrice Var(X) est positive.
La formule pour Var(AX) est obtenue par un calcul direct. 

4.4.2 Approximation linéaire

Pour des v.a. réelles X, Y ∈ L2 , nous souhaitons trouver la meilleure approximation


de Y par une fonction affine de X de la forme aX + b, au sens des moindres carrés : il
s’agit de déterminer les constantes a et b telles que E(|Y − (aX + b)|2 ) soit minimale.
Grâce à la linéarité de l’espérance, on vérifie immédiatement que E(|Y −(aX +b)|2 ) est
une fonction quadratique du couple (a, b) ∈ R2 et qu’elle est convexe. Les minimiseurs
sont donc caractérisés par la condition du premier ordre (annulation des dérivées
partielles) qui fournit l’unique solution :
Cov(X, Y ) σY
a=
b = ρ(X, Y ) et bb = E(Y ) − aE(X).
Var(X) σX
La meilleure approximation linéaire de Y basée sur X au sens de la distance quadra-
tique moyenne est donc
σY
Yb = E(Y ) + ρ(X, Y ) (X − E(X)) .
σX
4.5 – Des inégalités fameuses 79

Le carré moyen de l’erreur vaut alors


E |Y − Yb |2 = σY2 + ρ2 (X, Y )σY2 − 2ρ2 (X, Y )σY2 = σY2 (1 − ρ2 (X, Y )).


Nous constatons que lorsque ρ(X, Y ) est voisin de +1 ou −1, le carré moyen de l’erreur
est presque nul : plus |ρ(X, Y )| est proche de 1, meilleure est l’approximation.

Le résultat suivant étend la régression linéaire au cas multidimensionnel.

Proposition 4.27 (Régression linéaire) Soient Y et X = (X1 , . . . , Xd ) des va-


riables aléatoires dans L2 telles que la matrice Var(X) est inversible. Alors,
 le
problème de minimisation des moindres carrés min(a,b)∈Rd ×R E |Y −a·X −b|2 admet
un unique minimiseur (â, b̂) donné par
b = Var(X)−1 Cov(X, Y ) et bb = E(Y ) − â·E(X).
a
La meilleure approximation linéaire de Y par X est
Y reg := E(Y ) + Var(X)−1 Cov(X, Y ) · X − E(X) .


Définition 4.28 L’équation y = ab ·x + bb, où a


b et bb sont donnés par la proposition 4.27,
définit la droite des moindres carrés (ou de régression) de Y sur X.

4.5 Des inégalités fameuses

4.5.1 Inégalité de Bienaymé-Chebyshev

Théorème 4.29 Soit p ≥ 1 et a > 0. Nous avons les inégalités suivantes


• Inégalité de Markov : soit X ∈ Lp , alors
E(|X|p )
P(|X| ≥ a) ≤ . (4.13)
ap
• Inégalité de Bienaymé-Chebyshev : soit X ∈ L2 ,
Var(X)
P(|X − E(X)| ≥ a) ≤ . (4.14)
a2

Preuve. On a |X|p ≥ ap 1[a,∞[ (|X|), donc


E(|X|p ) ≥ ap E 1[a,∞[ (|X|) = ap P(|X| ≥ a),


ce qui donne la première formule (inégalité de Markov). La seconde découle de la


première appliquée à X − E(X) et p = 2. 
80 Chapitre 4 – Espérance mathématique de variables aléatoires réelles

Remarque 4.30 L’inégalité de Bienaymé-Chebyshev est très utile dans la pratique,


comme nous le verrons par la suite. Elle permet de mesurer la probabilité des grands
écarts entre X et sa moyenne. Par exemple, avec a = 10 σX , il en résulte qu’il est
improbable qu’une v.a. X dévie de E(X) de plus de 10 fois son écart-type (probabilité
inférieure à 0,01). Cette inégalité, tout à fait générale, n’est cependant pas très précise,
et surestime très souvent en pratique le membre de gauche de (4.14), comme nous
allons nous en convaincre ci-dessous.

Exemple 4.31 Posons m = E(X) et σ 2 = Var(X). Alors, pour tout a > 0,

σ2
P(|X − m| ≥ a) ≤ ,
a2
1
soit encore P(|X − m| ≥ aσ) ≤ a2 , d’où

1
P(|X − m| < aσ) = P(X ∈]m − aσ, m + aσ[) ≥ 1 − .
a2
En particulier, pour a = 2 et a = 3, nous avons respectivement :
1 1
P(X ∈]m − 2σ, m + 2σ[) ≥ 1 − ≈ 0,75 ; P(X ∈]m − 3σ, m + 3σ[) ≥ 1 − ≈ 0,88.
4 9
Ces approximations sont universelles mais très grossières. Par exemple, si X suit
une loi de Bernoulli de paramètre 21 , alors m = 12 et σ = 12 et on obtient précisément
P(X ∈]m − 2σ, m + 2σ[) = P(X ∈] − 12 , 32 [) = 1.

4.5.2 Inégalité de Cauchy-Schwarz

Proposition 4.32 Soient X et Y deux variables aléatoires de carré intégrable, alors


XY ∈ L1 , et on a l’inégalité de Cauchy-Schwarz :
p
|E(XY )| ≤ E(|XY |) ≤ E(X 2 )E(Y 2 ). (4.15)

Il y a égalité dans (4.15) si et seulement si X et Y sont P−p.s. proportionnelles.

Preuve. Comme |XY | ≤ 21 (X 2 + Y 2 ), nous avons XY ∈ L1 dès que X, Y ∈ L2 . De


plus, pour tout x ∈ R, nous avons d’après la linéarité et la positivité de l’espérance

x2 E(X 2 ) + 2x E(XY ) + E(Y 2 ) = E[(xX + Y )2 ] ≥ 0.

Mais ceci n’est possible que si ce trinôme en x a au plus une seule racine réelle. Son
discriminant doit donc être négatif ou nul, ce qui donne immédiatement (4.15).
4.5 – Des inégalités fameuses 81

Le discriminant est nul si et seulement si il y a une racine double x0 et dans ce cas,


Y (ω) = −x0 X(ω) pour presque tout ω. 

Nous déduisons en particulier de l’inégalité de Cauchy-Schwarz, que le coefficient de


corrélation défini par (4.9) vérifie

− 1 ≤ ρ(X, Y ) ≤ 1. (4.16)

4.5.3 Inégalité de Jensen

Théorème 4.33 Soient X une v.a. réelle intégrable


 et f : R −→ R convexe.
(i) Si f (X) est intégrable, alors on a E f (X) ≥ f (E(X)).
(ii) f (X)− = − min(f (X), 0) est intégrable et, en définissant E f (X) = E f (X)+ −
 

E f (X)− ∈ R ∪ {+∞}, l’inégalité du (i) reste vraie.

Preuve. Il suffit de montrer la seconde assertion, puisque la première en découle.


Puisque f est convexe, elle est continue et f (X) est mesurable. Par ailleurs, la
convexité de f implique que pour tout a ∈ R, il existe λa ∈ R tel que

f (x) ≥ f (a) + λa (x − a) pour tout x ∈ R.

Appliquant cette inégalité à x = X(ω), on obtient d’une part que f (X)− ≤ f (a) +
−
λa (X − a) ∈ L1 du fait que X ∈ L1 , et d’autre part que f (X) ≥ f (a) + λa (X − a).
L’inégalité voulue est obtenue en fixant a = E(X) en prenant l’espérance. 

Exemple 4.34 Si X est une v.a. centrée (E(X) = 0), alors


• par convexité de la fonction x 7−→ (x − K)+ pour tout λ ∈ R, on a E(eλX ) ≥ 1 .
• par convexité de la fonction x 7−→ (x − K)+ , pour un paramètre K ∈ R, on a
E[(x + X − K)+ ] ≥ (x − K)+ pour tout x ∈ R.

Exemple 4.35 Un investisseur a le choix : soit il place son capital dans une affaire
risquée rapportant une somme aléatoire X d’espérance m, soit il le place en titres sans
risque qui rapporteront m avec probabilité 1. Il va prendre sa décision de manière à
maximiser l’espérance de u(R), où R est son bénéfice et u sa fonction de préférence.
L’inégalité de Jensen nous montre que si u est une fonction concave, E(u(X)) ≤ u(m),
ce qui rend le placement sûr préférable. Si par contre u est convexe, le placement risqué
est meilleur puisque E(u(X)) ≥ u(m).
82 Chapitre 4 – Espérance mathématique de variables aléatoires réelles

4.6 Loi d’un vecteur aléatoire

Définition 4.36 La loi PX d’un vecteur aléatoire X à valeurs dans Rd est la probabilité
définie sur (Rd , B Rd ) par :

PX (B) = P(X ∈ B) pour tout borélien B ∈ B Rd .

En théorie de la mesure, PX est appelée mesure image de P par X.

Nous étudions dans ce paragraphe diverses caractérisations de cette probabilité.

4.6.1 Propriété de transfert

Le résultat suivant est une extension du théorème 3.14. Nous considérons une
vecteur aléatoire X à valeurs dans Rd et une fonction mesurable h de Rd dans R.
Alors Y = h(X) est une v.a. réelle sur Ω.

Nous dirons que h est intégrable si h appartient à L1 (Rd , B Rd , PX ).

Proposition 4.37 Soient X un vecteur aléatoire à valeurs dans Rd .


(i) Pour toute fonction mesurable h : Rd −→ R, on a que h est PX −intégrable si et
seulement si h(X) est P−intégrable, et dans ce cas :
Z Z

E h(X) = h(X(ω))P(dω) = h(x)PX (dx).
Ω Rd

(ii) Soit µ une probabilité sur Rd telle que ,


Z
E(h(X)) = h(x)µ(dx), pour toute fonction h continue bornée,
Rd

alors PX = µ.

Preuve. (i) Tout d’abord, le résultat est évident lorsque lorsque h ne prend qu’un
nombre fini de valeurs, grâce à (4.3) et au fait que P(X −1 (B)) = PX (B), par définition
de la loi de X. Si h est une fonction positive, nous suivons la recette de la remarque
4.14 : nous l’approchons par la suite de fonctions étagées αn ◦ h définie dans (4.4) et
nous déduisons le résultat voulu grâce au théorème 4.12 de convergence monotone,
les trois membres étant simultanément finis ou infinis. Le résultat général s’en déduit
par décomposition de h = h+ − h− .
(ii) Pour tout x ∈ Rd , on introduit la fonction H x = 1]−∞,x] de Rd dans R, avec
4.6 – Loi d’un vecteur aléatoire 83

la convention ] − ∞, x] =] − ∞, x1 ] × · · · ×] − ∞, xd ]. On pose pour tout n ≥ 1,


Qd 1 +
φxn (y) =
d x
i=1 (1 − n(yi − xi + n )) , y ∈ R . Alors φn est une fonction conti-
nue bornée, et (φn )n est une suite croissanteR qui converge simplement vers H x .
x

Par hypothèse, nous avons que RE(φx x


n (X)) = Rd φn (y)µ(dy), ce qui implique que
x x
PX (] − ∞, x]) = E(H (X)) = Rd H (y)µ(dy) = µ(] − ∞, x]) grâce au théorème
de convergence monotone. Comme x ∈ Rd est arbitraire, ceci montre que PX et µ
coincident sur tous les pavés de la forme ] − ∞, x], et en utilisant les propriété de
σ−additivité, on voit alors PX et µ coincident sur tous les pavés de Rd . Le théorème
4.2 de Carathédory permet de conclure que PX et µ coinsident sur BRd . 

R
Ainsi, la loi de X est caractérisée par son action h 7−→ h(x)PX (dx) = E(h(X))
sur toutes les fonctions mesurables intégrables h, et permet en effet de calculer
E(h(X)) par un calcul d’intégrale (au sens de Lebesgue) sur Rd . La situation se
simplifie encore plus si X est une v.a. discrète,
R chargeant une Psuite de points (xn )n
avec probabilité pn , et nous retrouvons que Rd h(x)PX (dx) = n h(xn )pn .

4.6.2 Fonction de répartition

Pour x ∈ Rd , on note ] − ∞, x] =] − ∞, x1 ] × · · · ×] − ∞, xd ].

Définition 4.38 La fonction de répartition d’un vecteur aléatoire X à valeurs dans


Rd est :
FX (x) = PX ] − ∞, x] = P(X1 ≤ x1 , . . . , Xd ≤ xd ), pour tout x ∈ Rd .

(4.17)

Proposition 4.39 La fonction de répartition FX d’un vecteur aléatoire X ca-


ractérise sa loi PX .

Preuve. Ce résultat est en fait déjà prouvé dans la deuxième moitié de la preuve
de la proposition 4.37 (ii). Pour une meilleure compréhension, nous la reprenons
ici de manière plus détaillée en dimension d = 1. D’après (4.17), nous avons
n
PX (]x, y]) = FX (y) − FX (x) pour tousPx < y. Par suite, si PnB = ∪i=1 ]xi , yi ], avec
n
xi < yi < xi+1 , nous avons PX (B) = i=1 PX (]xi , yi ]) = i=1 (FX (yi ) − FX (xi )),
car les intervalles sont disjoints. Enfin, PX (]x, +∞[) = 1 − FX (x).
Ainsi FX caractérise la restriction de PX à l’ensemble de toutes les réunions finies
d’intervalles disjoints de la forme ]x, y] ou ]x, +∞[. Cet ensemble contient R, ∅ et est
stable par passage au complémentaire et par réunion finie, c’est donc une algèbre. Le
théorème 4.2 de Carathédory permet de conclure que FX caractérise PX . 

La notion de fonction de répartition est communément utilisée pour les v.a. réelles
car il est en général difficile de les caractériser dans le cas multi-dimensionnel.
84 Chapitre 4 – Espérance mathématique de variables aléatoires réelles

Exemple 4.40 Loi uniforme sur [0, 1]. On considère sur ([0, 1], B[0,1] , λ) la variable
aléatoire X(ω) = ω pour tout ω ∈ [0, 1]. Alors, PX = λ : X est de loi uniforme sur
[0, 1]. Sa fonction de répartition est donnée par FX (x) = x+ ∧ 1, l’identité sur [0, 1],
nulle sur R− et égale à 1 sur [1, ∞[.

En général, une fonction de répartition sur R n’est pas continue, comme illustré
par l’exemple d’un variable aléatoire constante.

Exemple 4.41 Si X = 0 (presque-sûrement), la variable aléatoire constante nulle.


Alors PX = δ0 est la mesure de Dirac en 0, voir Exemple 2.20. La fonction de
répartition est la fonction de Heaviside en 0 : H 0 (x) = 1[0,+∞) (x) pour tout x ∈ R.

Proposition 4.42 (i) La fonction de répartition FX d’une v.a. réelle X vérifie :


(F1) FX est croissante,
(F2) FX est continue à droite,
(F3) limx↓−∞ FX (x) = 0 et limx↑+∞ FX (x) = 1.
(ii) Soit F est une fonction réelle vérifiant les conditions (F1)-(F2)-(F3). Alors, il
existe une unique probabilité µ sur (R, BR ) dont F est la fonction de répartition :
F (x) = µ(] − ∞, x]). De plus, il existe une v.a. X définie sur l’espace de probabilité
([0, 1], B[0,1] , λ) telle que F = FX .

Remarquons qu’on ne peut pas, en général, définir la probabilité µ de (ii) sur la tribu
P(R) de toutes les parties de R, comme illustré par la remarque 4.5 dans l’exemple
de la fonction de répartition de la loi uniforme de l’exemple 4.40. En fait, la preuve
de (ii) ci-dessous montre que les “probabilités discrètes” du chapitre précédent sont
les seules à pouvoir être définies sur la tribu P(R).

Preuve. (i) La croissance de FX est immédiate. Puis, pour une suite xn qui décroı̂t
vers x, on a ] − ∞, xn ] décroı̂t vers ] − ∞, x] et donc F (xn ) décroı̂t vers F (x) d’après
la proposition 2.12. Enfin, on obtient les limites dans (F3) par le même argument du
fait que ] − ∞, x] décroı̂t vers ∅ (resp. croı̂t vers R) lorsque x décroı̂t vers −∞ (resp.
croı̂t vers +∞).
(ii) Sur l’espace ([0, 1], B[0,1] , λ), avec λ la mesure de Lebesgue, la variable aléatoire
X(ω) := inf{u ∈ R : F (u) ≥ ω}, ω ∈ [0, 1],
admet F pour fonction de répartition. Pour montrer cette assertion pour X, il suffit
de montrer que {ω ≤ F (c)} = {X(ω) ≤ c}, puisqu’alors F (c) = λ({X ≤ c}) = FX (c).
L’inclusion {ω ≤ F (c)} ⊂ {X(ω) ≤ c} découle de la définition. Pour l’inclusion in-
verse, on observe que F (X(ω)) ≥ ω. En effet, si ce n’était pas le cas, on déduirait de
la continuité à droite de F que F (X(ω) + ε) < ω pour ε > 0 assez petit, impliquant
l’absurdité X(ω) + ε ≤ X(ω) ! Avec cette observation et la croissance de F , on voit
que X(ω) ≤ c implique ω ≤ F (X(ω)) ≤ F (c), qui à son tour implique ω ≤ F (c). 
4.6 – Loi d’un vecteur aléatoire 85

Remarque 4.43 Dans le cadre de la dernière preuve du (ii), la variable aléatoire


X(ω) := inf{u : F (u) > ω} admet aussi F pour fonction de répartition. En effet,
nous avons par définition que ω < F (c) implique X(ω) ≤ c. Mais X(ω) ≤ c implique
X(ω) ≤ c puisque X ≤ X. On en déduit que F (c) ≤ P[X ≤ c] ≤ P[X ≤ c] = F (c).

Analysons enfin les points de continuité d’une fonction de répartition. Comme F


est croissante, elle admet une limite à gauche en chaque point notée F (x−). Comme
] − ∞, y[= limn↑] − ∞, yn ] pour yn ↑ y, on a :
pour x < y, PX (]x, y]) = P(x < X ≤ y) = FX (y) − FX (x),
PX (]x, y[) = P(x < X < y) = FX (y−) − FX (x),
PX ([x, y]) = P(x ≤ X ≤ y) = FX (y) − FX (x−),
PX ([x, y[) = P(x ≤ X < y) = FX (y−) − FX (x−).
En particulier, les sauts de F sont caractérisés par PX ({x}) = F (x) − F (x−).

Proposition 4.44 Pour une v.a. réelle X et x ∈ R, on a FX continue en x si et


seulement si PX ({x}) = P(X = x) = 0.

Exemple 4.45 (Loi d’une v.a. à valeurs dans X ⊂ R dénombrable) La loi PX


de X est caractérisée pour tout xi ∈ X par pi = PX ({xi }) = P(X = xi ). Sa fonction
de répartition est donnée par
X
FX (x) = pi , pour tout x ∈ R,
xi ∈X : xi ≤x

avec la convention qu’une somme “vide” vaut 0. La fonction FX est en escalier, avec
des sauts d’amplitude pi en tout point xi ∈ X . Il s’agit d’une fonction purement
discontinue, au sens où elle est complètement
P caractérisée par ses sauts ∆FX (x) =
FX (x) − FX (x−), via la formule FX (x) = y≤x ∆FX (y).

Notons que l’ensemble X du dernier exemple, quoiqu’au plus dénombrable, peut être
dense dans R. Par exemple il peut être égal à l’ensemble des rationnels Q. Dans ce
cas, si qi > 0 pour tout xi ∈ Q, la fonction FX nous donne un exemple de fonction
discontinue en tout nombre rationnel, et continue partout ailleurs.

4.6.3 Variables aléatoires indépendantes

Définition 4.46 Soient X et Y deux vecteurs aléatoires à valeurs dans Rd et Rm ,


respectivement. On dit que X et Y sont indépendants si
P(X ∈ A, Y ∈ B) = P(X ∈ A) P(Y ∈ B) pour tous A ∈ BRd et B ∈ BRm .
86 Chapitre 4 – Espérance mathématique de variables aléatoires réelles

Plus généralement, les vecteurs aléatoires X1 , . . . , Xn , à valeurs dans Rd1 , . . . , Rdn , sont
indépendants (ou, “mutuellement indépendants”) si
n
Y
P(X1 ∈ A1 , . . . , Xn ∈ An ) = P(Xi ∈ Ai ) pour tous Ai ∈ BRdi , 1 ≤ i ≤ n.
i=1

Proposition 4.47 Soient X et Y deux vecteurs aléatoires indépendants à valeurs


dans Rm et Rn , respectivement. Alors pour toutes fonctions mesurables g : Rm −→
0 0
Rm et h : Rn −→ Rn , les vecteurs aléatoires g(X) et h(Y ) sont aussi indépendants.
Si de plus g(X) et h(Y ) sont intégrables, alors g(X)h(Y )| (à valeurs dans les ma-
trices réelles de taille m0 × n0 ) est aussi intégrable, et
|
E g(X)h(Y )| = E g(X) E h(Y ) .
 
(4.18)

Si de plus X, Y ∈ L2 , alors Cov(X, Y ) = 0.

Preuve. La première assertion est évidente par définition même de l’indépendance.


Pour montrer (4.18), il suffit de considérer le cas m0 = n0 = 1. Remarquons d’abord
qu’elle se réduit à la définition 4.46 si g et h sont des fonctions indicatrices. Par
linéarité, on obtient (4.18) lorsque g et h sont des fonctions étagées dans E+ , puis
pour les fonctions mesurables positives grâce au théorème 4.12 de convergence mono-
tone. Enfin, si g et h sont de signe quelconque, (4.18) est vérifiée pour |g| et |h|, donc
g(X)h(Y ) hérite l’intégrabilité de g(X) et h(Y ), et en décomposant g = g + − g − et
h = h+ − h− , on obtient (4.18) en développant le produit.
Enfin, si X, Y ∈ L2 , on obtient Cov(X, Y ) = 0 en appliquant (4.18) à g = IdRm et
h = IdRn . 

Pour des v.a. réelles non constantes, P−p.s. nous savons que |ρ(X, Y )| ≤ 1 par
(4.16). Si X et Y sont indépendantes, alors ρ(X, Y ) = 0. Si les v.a. X et Y sont
indépendantes, le résultat précédent dit que ρ(X, Y ) = 0 ; au contraire si |ρ(X, Y )|
est proche de 1, nous avons déjà remarqué que les variables aléatoires sont “forte-
ment dépendantes”, d’où le nom de “coefficient de corrélation”. Attention cependant,
ρ(X, Y ) = 0 n’implique pas que X et Y soient indépendantes.

Corollaire 4.48 Soient Xj , 1 ≤ j ≤ n, des variables aléatoires réelles indépendantes


et de carré intégrable. Alors Cov(Xi , Xj ) = 0 pour i 6= j et on déduit de (4.12) que :
n
X  Xn
Var Xi = Var(Xi ). (4.19)
i=1 i=1

Définition 4.49 La suite (Xn )n∈N∗ de vecteurs aléatoires est dite indépendante si
pour tout n, la famille finie X1 , . . . , Xn est indépendante.
4.6 – Loi d’un vecteur aléatoire 87

Le résultat suivant est immédiat à vérifier.

Proposition 4.50 L’indépendance de la suite (Xn )n entraı̂ne celle de


1) toute sous-suite (Xik )k ,
2) toute suite de vecteurs
 issus de Xn ,
3) toute suite fn (Xn ) n , où les fonctions fn sont des fonctions mesurables.

Exemple 4.51 Nous considérons l’ensemble Ω = [0, 1[ muni de la tribu borélienne


restreinte à cet ensemble, et de la mesure de Lebesgue. A chaque réel ω, nous associons
son développement dyadique (unique si l’on impose que les ωi ne soient pas tous égaux
à 1 à partir d’un certain rang) :
X ωi
ω= , ωi ∈ {0, 1}.
2i
i≥1

L’application Xi : Ω → {0, 1}, qui à ω associe Xi (ω) = ωi est une v.a. sur Ω. En
effet,
i i
[ hX x j
X xj 1h
{Xi = xi } = , + , pour xi ∈ {0, 1}, 1 ≤ i ≤ n,
j=1
2j j=1
2j 2i
x1 ,...,xi−1 ∈{0,1}

qui est bien un élément de la tribu borélienne de Ω = [0, 1[, et


1
1 X 1
P({Xi = xi }) = i 1= .
2 x1 ,...,xi−1 =0
2

Montrons l’indépendance des variables aléatoires (Xi )1≤i≤n . Nous avons


n n
\ hX x i
X xi 1h  \  1
{Xi = xi } = , + , et donc P {Xi = x i } = n,
i=1
2i i=1
2i 2n 2
1≤i≤n 1≤i≤n

qui est la mesure de Lebesgue de l’intervalle ci-dessus. Cela démontre que les variables
aléatoires Xi sont indépendantes et de loi de Bernoulli de paramètre 21 . Ainsi, nous
venons de construire sur Ω = [0, 1[ une suite de v.a. telle que toute sous-suite finie
est constituée de variables aléatoires indépendantes. C’est donc une suite de variables
aléatoires indépendantes de loi de Bernoulli de paramètre 12 .

Le résultat suivant répond dans un cadre général au problème de la construction


d’une suite de variables aléatoires indépendantes de lois données.

Théorème 4.52 (admis) Soit µn une probabilité sur Rdn , dn ∈ N∗ , pour tout n ∈ N.
Alors, il existe un espace Ω muni d’une tribu A et d’une probabilité P sur lequel on
peut définir une suite (Xn )n de vecteurs aléatoires indépendants, avec Xn de loi µn
pour tout n ≥ 0.
88 Chapitre 4 – Espérance mathématique de variables aléatoires réelles

4.7 Premiers éléments de simulation aléatoire

4.7.1 Génération de la loi uniforme

La loi d’une v.a. uniforme est donnée par la mesure de Lebesgue λ sur ([0, 1], B[0,1] ).
Les réalisations d’une telle v.a. ont autant de chance d’être situées au voisinage de
chaque point de ]0, 1[.

Il n’est pas facile 2 de trouver un “bon” générateur de nombres au hasard. Les


générateurs les plus simples sont fondés sur des procédés purement déterministes
par une récurrence de la forme xn+1 = φ(xn ) sur un intervalle d’entier I = [0, m[ ∩ N,
pour une application φ de I dans I. Les valeurs normalisées un = xn /m sont com-
prises entre 0 et 1. La suite (un ) est périodique de période p ≤ m. La séquence
(u0 , u1 , . . . , up/10 ) devrait avoir les caractéristiques statistiques d’une suite de tirages
indépendants de variables aléatoires de loi uniforme sur [0, 1[ (il est conseillé de ne pas
dépasser le dixième de la période). Ces générateurs n’ont donc en fait rien d’aléatoire
et c’est pourquoi on les qualifie aussi de pseudo-aléatoires.

Sans être les plus récents, les générateurs congruentiels linéaires sont très utilisés. Ils
produisent une suite d’entiers

xn+1 = a xn + b modulo m ,

à partir d’une valeur initiale x0 . Bien entendu, les entiers m, a et b doivent être
soigneusement choisis (on exige au moins que la période p soit maximale, c’est-à-dire
égale à m).

Exemples de tels générateurs :


• la fonction rand de Scilab utilise les valeurs m = 231 , a = 843314861 et
b = 453816693 ;
• la méthode [Link] de Java utilise les valeurs m = 248 , a = 25214903917
et b = 11.
• Par contre, la fonction grand de Scilab est basée sur un générateur plus
performant et plus moderne : le Mersenne twister 3 de période colossale 219937 −
1. C’est le même générateur que celui utilisé par la bibliothèque Numpy en
Python.

2. Park & Miller, Random number generators, good ones are hard to find, Commun. ACM (1988),
31, p. 1192-1201.
3. [Link] Twister
4.8 – Exercices sur le chapitre 4 89

4.7.2 Simulation par inversion de la fonction de répartition

Le résultat suivant donne une méthode de simulation d’une v.a. réelle X de loi
quelconque à partir d’une v.a. uniforme U sur [0, 1], générée comme ci-dessus. Ce
résultat a en fait été démontré dans la preuve de la proposition 4.42 (iii) et repose
sur l’utilisation de l’inverse continue à gauche d’une fonction de répartititon

G(y) := inf{x ∈ R : F (x) ≥ y}, y ∈ [0, 1],

qui coincide avec F −1 si F est inversible.

Proposition 4.53 Soit U une variable aléatoire de loi uniforme sur [0, 1], et F une
fonction de répartition. Alors la v.a. X = G(U ) admet F pour fonction de répartition.

Exemple 4.54 Simulation d’une variable aléatoire discrète. Soit P =


(p1 , p2 , . . .) une probabilité sur un ensemble dénombrableP{x1 , x2 , . . .} avec x1 < x2 <
. . . . La fonction de répartition associée est F (x) = pi . C’est une fonction en
i: xi ≤x P P
escalier, de même que G donnée par G(u) = xi lorsque pj < u ≤ pj . La
j<i j≤i
proposition conduit alors à l’expression naturelle
X X
X = xi si pj < U ≤ pj + pi , i≥1
j<i j<i

qui définit une v.a. X de loi P.

Ainsi, une variable aléatoire de Bernoulli X de paramètre p sera simulée ainsi :


• Si U ∈ [0, 1 − p], nous posons X = 0,
• Si U ∈ ]1 − p, 1], nous posons X = 1.

Remarque 4.55 Le choix de la valeur de X lorsque U = 1 − p importe peu, car la


probabilité que U = 1 − p est nulle du fait que la fonction de répartition de U n’a pas
de saut, voir exemple 4.40 et la proposition 4.44.

4.8 Exercices sur le chapitre 4

EXERCICE 4.1 Soit X une v.a. de carré intégrable. Montrer que E((X − a)2 )
atteint son minimum lorsque a = E(X).
Chapitre 5

Variables aléatoires à densité

Random numbers should not be generated with a method chosen at random

Donald Knuth.

5.1 Notion de densité

Dans cette section, nous allons nous servir de la mesure de Lebesgue λ sur Rd
introduite dans le théorème 4.4, ainsi que l’intégrale par rapport à cette mesure in-
troduite dans la remarque 4.17. Nous allons commencer par introduire la notion de
fonction de densité qui permet de décrire une large classe de probabilités à partir de
la mesure de Lebesgue λ sur Rd .

Définition 5.1 Soit f : (Rd ,RBRd ) −→ (R, BR ) une fonction mesurable. On dit que f
est une densité si f ≥ 0 et Rd f dλ = 1. Dans ce cas, on définit la fonction Pf de
BRd −→ R :
Z Z
Pf (A) = f 1A dλ = f (x)dx pour tout A ∈ BRd .
Rd A

On vérifie que Pf définit une probabilité sur (RRd , BRd ). En Reffet :


— Pf est de masse totale unitaire : Pf (Rd ) = f 1Rd dλ = f dλ = 1,
— Pf est σ−additive : pour une R suite (An )n R⊂ BP Rd , avec les A Pn deux à deux
f
R
disjoints,
P f on a P (∪ A
n n ) = f 1 ∪n An dλ = f 1
n An dλ = n f 1 An dλ =
n P (A n ), grâce à la proposition 2.12 (ii) et la positivité de f .

91
92 Chapitre 5 – Variables aléatoires à densité

Définition 5.2 (i) On dit que f est la densité de Pf par rapport à λ, et on note
Pf = f · λ et Ef l’espérance mathématique sous Pf .
(ii) Une probabilité P sur (Rd , BRd ) est dite à densité s’il existe une densité f sur
(Rd , BRd ) telle que P = f · λ.
(iii) Une v.a. X à valeurs dans Rd est dite à densité si sa loi PX est à densité.

d d
Théorème 5.3 Soient X une v.a. dans R R et à densité f et φ : R −→ R mesurable.
(i) Si φ est positive, on a E φ(X) = Rd (f φ)(x) dx.  R
(ii) φ(X) ∈ L1 si et seulement si f φ ∈ L1 (λ), et alors E φ(X) = Rd (f φ)(x) dx.

Pn Pn
Preuve.
Pn RSi φ = i=1Rai 1Ai est une fonction étagée, on a E(φ(X)) = i=1 ai PX (Ai ) =
i=1 ai f 1Ai dλ = f φdλ. Puis, pour φ ∈ L0+ on utilise l’approximation par les
f
v.a.
R étagées Yn = αn (φ(X)) comme dans (4.4) pour laquelle nous avons E (Yn ) =
R f Yn dλ, et on conclut par le théorème 4.12 de convergence monotone que E(φ(X)) =
f φdλ, ce qui termine la démonstration de (i). Enfin pour obtenir (ii), on procède à
la décomposition φ = φ+ − φ− . 

Pour les v.a. X à valeurs dans Rd , on s’intéresse plus particulièrement aux cas où
sa loi PX est à densité.

Proposition 5.4 Si une v.a. X à valeurs dans Rd est à densité f , alors


(i) sa fonction de répartition FX vérifie
Z Z x1 Z xd
FX (x) = f (y)dy = ··· f (y1 , . . . , yd )dy1 . . . dyd (5.1)
]−∞,x] −∞ −∞

pour tout x = (x1 , . . . , xd ) ∈ Rd ,


d
R Une fonction mesurable φ : R −→ R est PX −intégrable si et seulement si
(ii)
|φ(x)|f (x)dx < ∞ (i.e. φf est Lebesgue-intégrable), et on a
Z Z Z

E φ(X) = φ(x)f (x)dx = · · · (φf )(x1 , . . . , xd )dx1 . . . dxd (5.2)
Rd R R

Preuve. L’application du résultat duR théorème 5.3 (i) à la loi PX pour Y =


1]−∞,x] (X) donne E(Y ) = FX (x) = ]−∞,x] f (x0 )dx0 , soit (5.1). De même, (5.2)
est une ré-écriture du théorème 5.3 (ii) à la v.a. Y = φ(X). 

La proposition suivante se démontre immédiatement en utilisant des résultats bien


connus d’analyse.
5.1 – Notion de densité 93

Figure 5.1 – Graphe de la densité f et de la fonction de répartition F en dimension 1.


F (x) est la surface grise dans la Figure 5.1, délimitée par l’axe y = 0, le graphe de f , et la
droite verticale d’abscisse x (ici, x = 6).

Proposition 5.5 Soit X une v.a. réelle de fonction de répartition FX .


(i) Si X est à densité f , alors FX est continue, de sorte que P(X = x) = 0 pour tout
0
x ∈ R ; FX est dérivable en tout point x où f est continue et FX (x) = f (x).
(ii) Réciproquement, si FX est dérivable, ou seulement continue partout et dérivable
par morceaux, alors X admet la densité F 0 (x) = f (x).

Ainsi pour une v.a. réelle X à densité continue, celle-ci a l’interprétation (en un
point de continuité x)
F (x + ∆x) − F (x) PX ([x, x + ∆x])
f (x) ∼ = . (5.3)
∆x ∆x
La dernière proposition donne les expressions suivantes pour l’espérance et la variance
d’une v.a. réelle à densité f (intégrable ou de carré intégrable) :
Z +∞
E(X) = xf (x)dx,
−∞
Z +∞ Z +∞ Z +∞ 2
2 2
Var(X) = (x − E(X)) f (x)dx = x f (x)dx − xf (x)dx .
−∞ −∞ −∞

Remarque 5.6 Notons que la réciproque (ii) peut être améliorée (jusqu’à l’obtension
d’une équivalence) en utilisant des outils de dérivation plus avancés qui n’ont pas
encore été abordés dans votre scolarité. Si en effet FX vérifie (5.1) pour d = 1, elle
vérifie la même propriété en remplaçant f par g = f + 1Q ; alors g est encore une
densité de PX . D’une manière générale, une densité est définie à un ensemble de
mesure de Lebesgue nulle près.
94 Chapitre 5 – Variables aléatoires à densité

0.25

0.20

0.15

0.10

0.05

0.00
0 1 2 3 4 5 6 7 8 9 10

Figure 5.2 – f (6) ∼ (F (6,5) − F (6))/0,5

Exemple 5.7 La durée de fonctionnement d’un ordinateur avant sa première panne


est une v.a. positive de densité donnée par

1 − x
f (x) = e 100 1R+ (x), x ∈ R.
100
La probabilité que X soit comprise entre 50 et 150 heures est
100 √
e−1
Z
1 − x
P(X ∈ [50, 100]) = e 100 dx = ≈ 0,24.
50 100 e

La probabilité que l’ordinateur fonctionne moins de 100 heures est :


100 √
e−1
Z
1 − x
P(X ≤ 100) = e 100 dx = ≈ 0,63.
0 100 e

Remarque 5.8 Il existe des v.a. qui n’ont pas de densité : c’est le cas des variables
aléatoires discrètes. Il existe des cas “mixtes” : soit f une fonction positive intégrable
et d’intégrale strictement positive, Ret soit I ⊂ R uneP partie finie ou dénombrable non
+∞
vide, et des qi > 0, i ∈ I, tels que −∞ f (x)dx + i∈I qi = 1; alors, on peut définir
la fonction de répartition
Z x X
F (x) = f (y)dy + qi , x ∈ R,
−∞ i∈I: i≤x

la probabilité PX associée n’admet pas de densité et n’est pas non plus discrète.
5.2 – Exemples classiques de v.a. réelles à densité 95

Exemple 5.9 Soient X une v.a. de loi de densité f et a ∈ R fixé. Considérons la


v.a. Y définie par Y = max(a, X). La fonction de répartition de Y est donnée par :

FY (y) = P(Y ≤ y) = P(a ≤ y, X ≤ y) = P(X ≤ y)1[a,∞[ (y) = FX (y)1[a,∞[ (y).

Si FX (a) > 0, alors FY n’est pas continue au point a et Y n’est pas à densité. Par
contre, on peut exprimer la loi de Y sous forme d’une masse au point a et d’une partie
à densité à droite de a.

5.2 Exemples classiques de v.a. réelles à densité

Variable aléatoire uniforme. Soient a < b deux réels, X est uniforme sur [a, b] si sa
loi PX est de densité
1
f (x) = 1[a,b] (x), x ∈ R.
b−a
En vertu de la proposition 5.5, nous pourrions aussi bien choisir f (a) = 0 ou f (b) = 0.
Au vu de l’interprétation (5.3), le fait que f soit constante sur [a, b] exprime que si
nous simulons une variable aléatoire selon la probabilité PX , nous avons “autant de
chances” de tomber au voisinage de chaque point de l’intervalle [a, b]. Cela explique
le nom “uniforme”. Remarquons aussi que PX ({x}) = 0 pour tout x (comme pour
toutes les probabilités avec densité). Nous avons donc une probabilité nulle de tomber
exactement en un point x fixé à l’avance.

On vérifie immédiatement que X est de carré intégrable, et on calcule :


Z b
x a+b (b − a)2
E(X) = dx = ; Var(X) = . (5.4)
a b−a 2 12

Avec la même chance de tirer “un quelconque point” de l’intervalle [a, b], il est naturel
d’obtenir comme espérance le milieu du segment.

EXERCICE 5.1 A partir de 7h, les bus passent toutes les 15 minutes à un arrêt
donné. Un usager se présente entre 7h et 7h30 à cet arrêt, l’heure exacte de son
arrivée étant une variable uniforme sur cette période. Trouver la probabilité qu’il
doive attendre moins de 5 minutes, puis plus de 10 minutes.

Solution : Soit X le nombre de minutes s’écoulant entre 7h et l’arrivée de l’usager.


Alors X est uniforme sur [0, 30]. L’attente est inférieure à 5 mns si l’usager arrive
entre 7h10 et 7h15 ou entre 7h25 et 7h30. La probabilité
R 15 1 d’attendre
R 30 1 moins de 5 mins
est donc P(10 < X < 15) + P(25 < X < 30) = 10 30 dx + 25 30 dx = 13 .
La probabilité d’attendre plus de 10 mins vaut P(0 < X < 5) + P(15 < X < 20) = 13 .
96 Chapitre 5 – Variables aléatoires à densité

Figure 5.3 – Graphe de la densité f (x) = e−x et de la fonction de répartition associée


F (x) = 1 − e−x .

Variable aléatoire exponentielle. On dit que X suit la loi exponentielle de paramètre


λ > 0, que l’on note E(λ), si PX admet la loi de densité

f (x) = λe−λx 1R+ (x), x ∈ R. (5.5)

On calcule alors sa fonction de répartition, ainsi que son espérance et sa variance :


+ 1 1
F (x) = 1 − e−λx , x ∈ R, E(X) = , et Var(X) = 2 . (5.6)
λ λ
En
R ∞ effet, on calcule par Rpar intégrations par parties successives que E(X) =
−λx ∞
0
xλe dx et E(X 2 ) = 0 x2 λe−λx dx.

Dans la pratique, la loi exponentielle modélise souvent une durée de vie ou le


temps d’attente avant l’arrivée d’un événement spécifique. Par exemple la durée de
vie d’une bactérie, la durée d’une conversation téléphonique ou le temps qui nous
sépare du prochain tremblement de terre peuvent être considérées comme des v.a. de
loi exponentielle.

EXERCICE 5.2 Supposons que la durée d’une conversation téléphonique mesurée


en minutes suit une loi E(λ) de paramètre λ = 10 1
(exprimé en minute−1 ). Vous
arrivez à une cabine téléphonique et quelqu’un entre juste devant vous. Avec quelle
probabilité devez-vous attendre plus de 10 minutes ? entre 10 et 20 minutes ?

Solution : X désigne la durée


R +∞de la conversation de la personne précédente. Alors,
1 − 10x
on calcule que P(X > 10) = 10 10 e dx ≈ 0.368 et P(10 < X < 20) ≈ 0,233.

La loi exponentielle possède la propriété importante dite de non vieillissement, on dit aussi
5.2 – Exemples classiques de v.a. réelles à densité 97

qu’elle est sans mémoire au sens que :

PX (X > s) > 0 et PX (X > t + s|X > t) = P(X > s) pour tous s, t ∈ R. (5.7)

Proposition 5.10 La loi exponentielle est l’unique loi vérifiant (5.7).

Preuve. Soit G(t) = P(X > t) = 1 − FX (t). D’après (2.16), la propriété de l’énoncé
équivaut à dire que G(t+s) = G(t)G(s) pour tous s, t > 0. Comme G est décroissante
et continue à droite et tend vers 0 à l’infini, cela revient aussi à dire que c’est une
exponentielle négative, de la forme G(t) = e−λt pour un λ > 0 [Poser α = G(1),
vérifier par récurrence que G(n) = αn pour tout n entier, puis que G(q) = αq pour
tout q rationnel, puis conclure que G(t) = αt pour tout t ∈ R+ par la continuité à
droite]. Le résultat s’obtient alors en comparant à (5.6) et en utilisant le fait qu’une
fonction de répartition caractérise la loi à laquelle elle est associée. 

Représentons-nous X comme la durée de vie d’un certain instrument. La propriété


ci-dessus signifie que si l’instrument fonctionne après t heures de service, la loi de sa
durée de vie à partir de là est la même que la loi de la durée de vie de l’appareil neuf.
L’appareil fonctionne sans mémoire du temps d’usage déjà écoulé.

Enfin, on peut simuler une loi exponentielle en utilisant la méthode d’inversion de


la fonction de répartition du paragraphe 4.7.2. En effet, on calcule immédiatement
que
1
F −1 (u) = − ln(1 − u) u ∈]0, 1[.
λ
Soit U est une variable aléatoire uniforme, alors les variables aléatoires
1 1
X0 = − ln(1 − U ) et X=− ln U
λ λ
suivent une loi exponentielle de paramètre λ (car U et 1 − U ont même loi).

Loi gamma. Une variable aléatoire X suit une loi gamma de paramètre d’échelle θ et
d’indice α, que l’on note Γ(α, θ), si sa loi est à densité :
1
f (x) = θα xα−1 e−θx 1R+ (x), x ∈ R,
Γ(α)

où la fonction gamma est définie par :


Z ∞
Γ(α) = xα−1 e−x dx pour tout α > 0. (5.8)
0
98 Chapitre 5 – Variables aléatoires à densité

Une intégration par parties montre que Γ(α+1) = αΓ(α), et on a de manière évidente
Γ(1) = 1. Il s’ensuit que Γ(n + 1) = n! pour tout entier n ≥ 0, avec la convention que
0! = 1. Enfin, le changement de variable x 7→ θx montre que la fonction f ci-dessus
est d’intégrale égale à 1, et est donc bien une densité.

Remarquons que Γ(1, θ) = E(θ). Pour une loi Γ(α, θ), on calcule aussi que :
α 2 α Γ(α + β) 1
E(X) = , σX = 2 et E(X β ) = .
θ θ Γ(α) θβ
En revanche si β ≤ −α, nous avons E(X β ) = +∞.
Pour α = n ∈ N, la loi gamma représente la loi du temps d’attente avant la n-ième
occurence d’événements indépendants de lois E(θ) (voir Exemple 7.9).

Variables aléatoires normales (ou variables gaussiennes). Une variable


aléatoire normale centrée réduite est une variable aléatoire X de loi notée N (0, 1)
de densité
1 2
f (x) = √ e−x /2 , x ∈ R. (5.9)

R +∞
Pour vérifier que I = −∞ f (x)dx = 1, nous remarquons que
Z +∞ Z +∞ Z 2π Z 2π
1 2 ∞ 1
I2 = dθ e−ρ /2 0 =

f (x)f (y)dxdy = dθ = 1,
−∞ −∞ 2π 0 2π 0
en passant en coordonnées polaires dans l’intégrale double. On calcule alors que
E(X) = 0 et Var(X) = 1,
justifiant les qualificatifs “centrée” et “réduite”.

Figure 5.4 – La courbe de Gauss f et les proportions d’aire sous la courbe

Définition 5.11 On dit que X est une variable aléatoire de loi normale N (m, σ 2 ), pour
m ∈ R et σ 2 > 0, si cette variable a la loi de densité
1 (x − m)2
f (x) = √ exp − . (5.10)
2πσ 2 2σ 2
5.2 – Exemples classiques de v.a. réelles à densité 99

Nous pouvons vérifier que f est une densité en nous ramenant par le changement de
variable x 7→ x−m
σ à la fonction (5.9). Le même changement de variable permet de
voir que m et σ 2 sont l’espérance et la variance d’une v.a. de loi N (m, σ 2 ).

La distribution normale fut introduite par De Moivre en 1733. Celui-ci l’utilisa pour
approximer une v.a. binomiale B(n, p) pour n grand. Ce résultat fut ensuite progres-
sivement généralisé par Laplace et d’autres confrères pour devenir le théorème connu
sous le nom de théorème de la limite centrale, qui sera démontré dans un chapitre
ultérieur. Ce théorème est l’un des plus importants de la théorie des probabilités et
prouve que de très nombreux phénomènes aléatoires suivent approximativement une
loi normale. Nous pouvons citer à titre d’exemple la taille d’un individu choisi au
hasard, les composantes de la vitesse d’une molécule de gaz ou l’erreur de mesure
d’une quantité physique.

Pour les calculs sur la loi normale. Il est difficile de faire des calculs avec la
loi normale car la densité de la loi normale centrée réduite n’admet pas de primitive
explicite. Aussi des tables numériques ont-elles été construites pour permettre aux
utilisateurs d’obtenir très rapidement des valeurs numériques.

La table 5.1 donne les valeurs de Φ(x) = P(X ≤ x), lorsque X suit la loi gaussienne
centrée réduite. Bien sûr, les logiciels classiques de statistique permettent d’obtenir
les valeurs données par la table. Par exemple, pour une variable X de loi N (0, 1),
et en utilisant la symétrie de la densité et la table numérique ci-dessous, nous avons
l’approximation
 
1
P(|X| < 2) = 2 P(0 < X < 2) = 2 P(X < 2) − ≈ 2 (0,9772 − 0,5) = 0,9544.
2

EXERCICE 5.3 Lors d’un procès en attribution de paternité, un expert témoigne


que la durée de grossesse, en jours, est de loi approximativement normale de pa-
ramètres m = 270 et σ 2 = 100. L’un des pères possibles est en mesure de prouver son
absence du pays pendant une période s’étendant entre le 290-ième et le 240-ième jour
précédant l’accouchement. Quelle est la probabilité que la conception de l’enfant ait
pu avoir lieu pendant la présence de cet homme au pays ?
X−m X−270
Solution : Comme σ = 10 suit une loi N (0, 1). D’après la table 5.1.
 X − 270   X − 270 
P(X > 290 ou X < 240) = P >2 +P < −3
10 10
= 1 − Φ(2) + 1 − Φ(3) ≈ 0,02411.

Variable aléatoire de Cauchy. Une variable aléatoire réelle X suit une loi de
Cauchy si elle admet la densité
1
f (x) = , x ∈ R,
π(1 + x2 )
100 Chapitre 5 – Variables aléatoires à densité

x 0,00 0,010 0,02 0,03 0,04 0,05 0,06 0,07 0,08 0,09

0,0 0,5000 0,5040 0,5080 0,5120 0,5160 0,5199 0,5239 0,5279 0,5319 0,5359
0,1 0,5398 0,5438 0,5478 0,5517 0,5557 0,5596 0,5636 0,5675 0,5714 0,5753
0,2 0,5793 0,5832 0,5871 0,5910 0,5948 0,5987 0,6026 0,6064 0,6103 0,6141
0,3 0,6179 0,6217 0,6255 0,6293 0,6331 0,6368 0,6406 0,6443 0,6480 0,6517
0,4 0,6554 0,6591 0,6628 0,6664 0,6700 0,6736 0,6772 0,6808 0,6844 0,6879
0,5 0,6915 0,6950 0,6985 0,7019 0,7054 0,7088 0,7123 0,7157 0,7190 0,7224
0,6 0,7257 0,7291 0,7324 0,7357 0,7389 0,7422 0,7454 0,7486 0,7517 0,7549
0,7 0,7580 0,7611 0,7642 0,7673 0,7704 0,7734 0,7764 0,7794 0,7823 0,7852
0,8 0,7881 0,7910 0,7939 0,7967 0,7995 0,8023 0,8051 0,8078 0,8106 0,8133
0,9 0,8159 0,8186 0,8212 0,8238 0,8264 0,8289 0,8315 0,8340 0,8365 0,8389

1,0 0,8413 0,8438 0,8461 0,8485 0,8508 0,8531 0,8554 0,8577 0,8599 0,8621
1,1 0,8643 0,8665 0,8686 0,8708 0,8729 0,8749 0,8770 0,8790 0,8810 0,8830
1,2 0,8849 0,8869 0,8888 0,8907 0,8925 0,8944 0,8962 0,8980 0,8997 0,9015
1,3 0,9032 0,9049 0,9066 0,9082 0,9099 0,9115 0,9131 0,9147 0,9162 0,9177
1,4 0,9192 0,9207 0,9222 0,9236 0,9251 0,9265 0,9279 0,9292 0,9306 0,9319
1,5 0,9332 0,9345 0,9357 0,9370 0,9382 0,9394 0,9406 0,9418 0,9429 0,9441
1,6 0,9452 0,9463 0,9474 0,9484 0,9495 0,9505 0,9515 0,9525 0,9535 0,9545
1,7 0,9554 0,9564 0,9573 0,9582 0,9591 0,9599 0,9608 0,9616 0,9625 0,9633
1,8 0,9641 0,9649 0,9656 0,9664 0,9671 0,9678 0,9686 0,9693 0,9699 0,9706
1,9 0,9713 0,9719 0,9726 0,9732 0,9738 0,9744 0,9750 0,9756 0,9761 0,9767

2,0 0,9772 0,9778 0,9783 0,9788 0,9793 0,9798 0,9803 0,9808 0,9812 0,9817
2,1 0,9821 0,9826 0,9830 0,9834 0,9838 0,9842 0,9846 0,9850 0,9854 0,9857
2,2 0,9861 0,9864 0,9868 0,9871 0,9875 0,9878 0,9881 0,9884 0,9887 0,9890
2,3 0,9893 0,9896 0,9898 0,9901 0,9904 0,9906 0,9909 0,9911 0,9913 0,9916
2,4 0,9918 0,9920 0,9922 0,9925 0,9927 0,9929 0,9931 0,9932 0,9934 0,9936
2,5 0,9938 0,9940 0,9941 0,9943 0,9945 0,9946 0,9948 0,9949 0,9951 0,9952
2,6 0,9953 0,9955 0,9956 0,9957 0,9959 0,9960 0,9961 0,9962 0,9963 0,9964
2,7 0,9965 0,9966 0,9967 0,9968 0,9969 0,9970 0,9971 0,9972 0,9973 0,9974
2,8 0,9974 0,9975 0,9976 0,9977 0,9977 0,9978 0,9979 0,9979 0,9980 0,9981
2,9 0,9981 0,9982 0,9982 0,9983 0,9984 0,9984 0,9985 0,9985 0,9986 0,9986

x 3,0 3,1 3,2 3,3 3,4 3,5 3,6 3,8 4,0 4,5

Φ(x) 0,99865 0,99903 0,99931 0,99952 0,99966 0,99977 0,999841 0,999928 0,999968 0,999997

Z x
Table 5.1 – Valeurs de la fonction de répartition Φ(x) = f (y)dy de la loi normale
−∞
N (0, 1). Si on cherche la valeur de Φ(x = k × 0,1 + j × 0,01), il faut regarder dans
le gros tableau supérieur, la valeur située à l’intersection de la ligne k + 1 et de la
colonne j + 1. Le tableau donne ainsi toutes les valeurs de Φ(x) pour x allant de 0
à 2,99 par pas de 0,01. Le petit tableau inférieur donne les valeurs de Φ(x) pour x
allant de 3 à 4,5 par pas variable. Enfin, si on souhaite trouver une valeur de Φ(x)
pour un x négatif, alors on utilise le fait que Φ(x) = 1 − Φ(−x).
5.2 – Exemples classiques de v.a. réelles à densité 101

Figure 5.5 – Gyrophare

R
(on vérifie immédiatement que R f (x)dx = 1). Il s’agit de l’exemple classique d’une
R +∞ |x|
v.a. qui n’a pas d’espérance. En effet, l’intégrale généralisée −∞ π(1+x2 ) dx diverge
1
car f (x) ∼x→∞ |x| . Une variable de Cauchy n’est donc pas intégrable.

L’exemple suivant illustre l’apparition naturelle de cette loi.

EXERCICE 5.4 Un gyrophare G envoie un flash lumineux dans une direction


aléatoire uniforme d’angle θ. Chercher la loi de l’abscisse X du point d’impact du
rayon lumineux sur un écran plan infini situé à distance 1 de G, comme indiqué sur
la figure 5.5.

Solution : L’angle θ est une v.a. de densité q(θ) = π1 1]− π2 , π2 [ (θ), variable de loi uni-
forme sur ] − π2 , π2 [. L’abscisse X est donnée par X = tan θ, c’est donc une v.a. de
fonction de répartition donnée pour x ∈ R par
Z arctan x
1 1
F (x) = P(X ≤ x) = P(θ ≤ arctan x) = q(θ)dθ = arctan x + .
−∞ π 2

La fonction F est de classe C 1 et sa dérivée donne précisément la densité de la loi de


Cauchy. Par conséquent, la v.a. X a la loi de densité f .

Remarque 5.12 Dans les exemples que nous venons de voir, il est intéressant de
remarquer que les densités sont paramétrées par des nombres réels (un ou deux dans
nos exemples), paramètres liés très directement aux valeurs de l’espérance et de la
variance de la variable. C’est très important en Statistique. En effet, si nous savons a
priori que la loi de X appartient à une certaine classe de lois (lois exponentielles, lois
normales), nous pourrons trouver laquelle en estimant ses paramètres en fonction des
observations de X.
102 Chapitre 5 – Variables aléatoires à densité

5.3 Vecteurs aléatoires à densité

Commençons par l’extension de la loi normale au cadre multidimensionnel. Une


étude plus systématique sera faite dans un chapitre ultérieur.

Exemple 5.13 Vecteur gaussien n-dimensionnel non-dégénéré. Soient m ∈


Rd et C une matrice réelle de taille d × d, symétrique définie positive (c’est-à-dire
x · Cx > 0 pour tout x ∈ Rd \ {0Rd }). Le vecteur aléatoire X à valeurs dans Rd est
gaussien de paramètres m et C si sa densité s’écrit
1 1 −1
f (x) = p e− 2 (x−m)·C (x−m) , x ∈ Rd .
(2π)d/2 det(C)

On a alors E(X) = m et Var(X) = C. On note cette loi N (m, C).

16
14
12
10
8
Z

6
4
2
0
−4 −4
−3 −3
−2 −2
−1 −1
0 0
1 1
2 2
Y 3 3 X
4 4

Figure 5.6 – Densité gaussienne en dimension d = 2.

Nous avons vu dans la proposition 5.4 que la loi d’un vecteur aléatoire à densité
fait intervenir des intégrales par rapport à la mesure de Lebesgue dans Rd , soit des
intégrales multiples. Nous commençons donc par rappeler le théorème de Fubini,
essentiel dans les calculs d’intégrales multiples. Pour simplifier la présentation, nous
considérons le cas d = 2, l’extension à une dimension quelconque est immédiate.

2
Théorème 5.14 R (Tonelli, Fubini) Soit f : (R 0, BR2 )1 −→ (R, BR ) mesurable. Si f
est positive, ou R2 |f (x, y)|dx dy < ∞, i.e. f ∈ L+ ∪ L (λ), alors les fonctions
Z Z
x 7−→ f (x, y)dy et y 7−→ f (x, y)dx
R R
5.3 – Vecteurs aléatoires à densité 103

sont mesurables (par rapport à la mesure de Lebesgue sur R), et


Z Z Z  Z Z 
f (x, y)dxdy = f (x, y)dy dx = f (x, y)dx dy.
R2 R R R R

Remarquons l’analogie avec le théorème de Fubini (S9) pour les séries. En fait, la
théorie de l’intégration de Lebesgue permet de voir ces résultats comme issus du
même théorème général, dont découle aussi le résultat “mixte” suivant.

d
Théorème
P R 5.15 Pour une suite de fonctions mesurables (fk )k de R dans R telle
que k Rd |fk (x)|dx < +∞,
XZ Z X 
fk (x)dx = fk (x) dx.
k Rd Rd k

5.3.1 Densités marginales

Nous allons nous limiter dans la suite de ce paragraphe au cas où d = 2, pour simplifier
les notations. Nous considérons un vecteur aléatoire Z à valeurs dans R2 de loi à
densité, et nous notons X et Y ses deux composantes : Z = (X, Y ). Comme dans le
cas discret, la loi des marginales X et Y peut s’obtenir à partir de la loi de Z. Ce
résultat se généralise sans peine à une dimension supérieure.

Proposition 5.16 Soit Z = (X, Y ) un vecteur aléatoire à valeurs dans R2 et à


densité f . Alors X et Y admettent les densités fX et fY :
Z Z
fX (x) = f (x, y)dy, x ∈ R et fY (y) = f (x, y)dx, y ∈ R. (5.11)
R R

Les fonctions fX et fY s’appellent les densités marginales de f .

Preuve. On utilise (5.2) avec φ(u, v) = 1u≤x , pour x, u, v ∈ R :


Z x Z +∞  Z x

P(X ≤ x) = E φ(X, Y ) = du f (u, v) dv = fX (u)du,
−∞ −∞ −∞

où fX est définie par (5.11). Ceci montre que fX est la densité de X et on procède
de même pour Y . 

L’exemple suivant illustre que la réciproque de cette proposition est fausse, en général :
le fait que X et Y soient à densité ne garantit pas que le vecteur aléatoire Z = (X, Y )
soit à densité. En particulier, il faut faire attention au fait que dans le cas général, la
densité d’un couple de v.a. à densité n’est pas le produit des densités.
104 Chapitre 5 – Variables aléatoires à densité

Exemple 5.17 On considère le cas X = Y et on note ∆ = {(x, x) : x ∈ R} la


diagonale de R2 . AlorsR PZ (∆) = 1, tandis que si Z était à densité f , nous aurions
PZ (∆) = E(1∆ (Z)) = R2 1∆ (z)f (z)dz = 0 car ∆ a un volume nul dans R2 .

Exemple 5.18 On lance une fléchette sur une cible circulaire de rayon unité et on
décide de n’observer que les lancés qui atteignent la cible. Le joueur est suffisamment
loin de la cible pour que le point d’impact M de la fléchette soit supposé uniformément
distribué sur la cible. Les coordonnées cartésiennes de M ∈ D = {(x, y) ∈ R2 , x2 +
y 2 ≤ 1} constituent un couple de v.a. de densité uniforme sur le disque :
1
f(X,Y ) (x, y) = 1{x2 +y2 ≤1} , (x, y) ∈ R2 .
π
L’abscisse X est distribuée selon la densité marginale
Z
2 1
fX (x) = f(X,Y ) (x, y) dy = (1 − x2 ) 2 1[−1,1] (x), x ∈ R.
π
La loi de Y a la même densité.

5.3.2 Densités conditionnelles

Pour tout x ∈ R tel que fX (x) > 0, on introduit la fonction

f (x, y)
fY |X=x (y) = , y ∈ R. (5.12)
fX (x)
R
Il est clair que fY |X=x ≥ 0 et R
fY |X=x (y)dy = 1. Il s’agit donc d’une densité.

Définition 5.19 La fonction fY |X=x est appelée densité conditionnelle de Y sachant


X = x. Elle induit pour toute fonction h : R2 −→ R, mesurable positive ou intégrable
(cf. remarque 5.20 (ii) ci-dessous), l’espérance
Z
E(h(X, Y )|X = x) = h(x, y) fY |X=x (y)dy pour tout x ∈ R tel que fX (x) > 0.
R

L’espérance conditionnelle de h(X, Y ) sachant X est la v.a. définie par :

E(h(X, Y )|X) = ψ(X), avec ψ(x) = E(h(X, Y )|X = x) 1{fX (x)>0} .

L’interprétation de (5.12) est la suivante : la fonction fY |X=x est la densité de la


“loi conditionnelle de Y sachant que X = x”. Bien sûr, nous avons P(X = x) = 0
puisque X admet une densité, donc la phrase ci-dessus n’a pas réellement de sens,
5.3 – Vecteurs aléatoires à densité 105

mais elle se justifie heuristiquement ainsi : ∆x et ∆y étant de “petits” accroissements


des variables x et y, nous avons comme en (5.3), et lorsque f est continue :

fX (x)∆x ≈ P(x ≤ X ≤ x + ∆x),


f (x, y)∆x∆y ≈ P(x ≤ X ≤ x + ∆x, y ≤ Y ≤ y + ∆y).

Par suite
P(x ≤ X ≤ x + ∆x, y ≤ Y ≤ y + ∆y)
fY |X=x (y)∆y ≈
P(x ≤ X ≤ x + ∆x)
≈ P(y ≤ Y ≤ y + ∆y|x ≤ X ≤ x + ∆x).

Remarque 5.20 (i) La fonction ψ(x) est défini de manière arbitraire sur B =
{u, fX (u)
R = 0}, ici nous avons choisi la valeur nulle. Remarquons que P(X ∈
B) = B fX (u)du = 0. Donc la définition 5.19 définit l’espérance conditionnelle
ψ(X) = E(Y | X) PX −p.s. c’est-à-dire avec probabilité pleine sous la loi de X.
R R f (x,y) 
(ii) Comme E (E(|Y | | X)) = R R |y| X,Y fX (x) dy fX (x)dx = E(|Y |) grâce au
théorème 5.14 de Fubini, l’espérance conditionnelle de Y sachant X est bien définie
dès que Y est intégrable.
(iii) Les rôles de X et de Y peuvent être inversés dans tous les résultats.

En remplaçant les sommes par des intégrales, nous pouvons adapter les preuves de
la Section 3.5.3 et obtenir dans le cadre des lois à densité les mêmes propriétés de
l’espérance conditionnelle résumées ci-dessous.

Proposition 5.21 Soient X et Y deux variables aléatoires


 R réelles.
(i) Si Y est intégrable, alors E(Y ) = E E(Y |X) = R E(Y |X = x)fX (x)dx, et
2
pour toute fonction mesurable h positive ou intégrable sur R , on a E(h(X, Y )) =
E E(h(X, Y ) | X) .
(ii) Si Y est un vecteur aléatoire intégrable à valeurs dans R2 , alors E(a · Y |X) =
a · E(Y |X) pour tout a ∈ R2 (où E(Y |X) est le vecteur d’espérances conditionnelles).
(iii) E(1|X) = 1, et si Y ≥ 0, alors E (Y | X) ≥ 0. 
(iv) Si g est mesurable et g(X)Y positive ou intégrable, alors E Y g(X)|X =
g(X)E(Y |X).

Exemple 5.22 Soient X et Y de densité jointe fX,Y (x, y) = x1 1T (x, y) où T est
R triangle T = {0 < y < x < 1}. La densité de X est donnée par fX (x) =
le
fX,Y (x, y)dy = 1]0,1[ (x) et pour x ∈]0, 1[,

1
fY |X=x (y) = 1]0,x[ (y) .
x
106 Chapitre 5 – Variables aléatoires à densité

Ainsi, X est uniformément distribuée sur ]0, 1[, et la loi de Y sachant X = x est
uniforme sur ]0, x[ (0 < x < 1). Pour un tel x, l’espérance conditionnelle E(Y | X = x)
est donnée par le milieu x/2 de l’intervalle portant cette loi uniforme, et nous obtenons
E(Y | X) = X/2 .

5.3.3 Indépendance de variables aléatoires à densité

Dans la suite de ce paragraphe, nous considérons un couple (X, Y ) de variables


aléatoires réelles. Le résultat suivant est un analogue de l’équivalence (i)⇐⇒(ii) dans
la proposition 3.36.

Proposition 5.23 Supposons que X et Y soient à densité fX et fY . Alors X et Y


sont indépendantes si et seulement si le couple Z = (X, Y ) admet la densité suivante :

fZ (x, y) = fX (x) fY (y) pour tous (x, y) ∈ R2 . (5.13)

Preuve. Par définition de l’indépendance, on a


Z x Z y
P(X ≤ x, Y ≤ y) = P(X ≤ x) P(Y ≤ y) = fX (u)du fY (v)dv,
−∞ −∞

ce qui montre que PZ est à densité fZ donnée par (5.13). Réciproquement, le même
calcul montre que (5.13) implique que P(X ≤ x, Y ≤ y) = P(X ≤ x) P(Y ≤ y) pour
tous x, y ∈ R. En utilisant le même argument que dans la preuve de la proposition
4.42, ceci entraine que P(X ∈ A, Y ∈ B) = P(X ∈ A) P(Y ∈ B) pour tous boréliens
A et B, d’où le l’indépendence de X et Y . 

5.4 Recherche de densité

Dans ce paragraphe, nous abordons le problème important suivant. Soit X un vecteur


aléatoire à valeurs dans Rd , admettant la densité fX . Soit g une fonction mesurable
0
de Rd dans Rd , de sorte que Y = g(X) soit aussi un vecteur aléatoire.
1. Est-ce que Y admet une densité ?
2. Si oui, comment la calculer ?
Concernant la première question, la réponse est : en général non ! pensez par exemple
au cas où d = d0 = 1, la fonction g est constante, g(x) = a pour tout x ∈ R, alors la
loi de Y est la masse de Dirac en a, qui n’a pas de densité. On peut aussi revenir à
l’exemple 5.9 qui illustre un cas mixte d’une v.a. à valeurs dans R où g(x) = max(x, a),
x ∈ R, place une masse au point a.
5.4 – Recherche de densité 107

Continuons alors en supposant que la v.a. a une densité. Afin de répondre à la


deuxième question, nous allons utiliser la caractérisation de la loi d’une v.a. obtenue
dans la proposition 4.37, qui dans le cas présent de recherche de densité se ré-écrit :

Proposition 5.24 Soit x un  vecteur


R aléatoire à valeurs dans Rd . S’il existe une
fonction f telle que E h(X) = Rd h(x)f (x)dx, pour toute fonction continue bornée
h, alors la loi de X admet la densité f .

On recherche alors une telle fonction de densité en écrivant pour toute fonction h
continue bornée :
Z

E(h(Y )) = E h ◦ g(X) = h ◦ g(x)fX (x) dx, (5.14)
Rd

qu’on voudrait mettre sous la forme


Z
h(y)f (y) dy, (5.15)
Rd

en faisant le changement de variable y = g(x) dans cette intégrale. Dans le cas


unidimensionnel d = 1, ceci nécessite que g soit dérivable et bijective “par morceaux”,
et il faut faire très attention aux domaines où g est croissante ou décroissante. Plutôt
qu’exposer une théorie générale, donnons des exemples.

Exemple 5.25 Soit Y = aX + b, où a 6= 0 et b sont des Rconstantes. Le change-


ment de variable
  y = ax + b dans (5.14) donne E(h(Y )) = R h(ax + b) fX (x) dx =
y−b 1
R
R
h(y) fX a |a| dy (on peut considérer séparément les cas a > 0 et a < 0). On
peut ainsi conclure Y est une v.a. de densité
 
y−b 1
fY (y) = fX , y ∈ R.
a |a|
• Si X suit la loi normale N (m, σ 2 ), alors X−m
σ suit la loi N (0, 1).
• Si X suit la loi normale N (0, 1), alors aX + b suit la loi N (b, a2 ).
• Si X suit la loi uniforme sur [α, β], alors aX + b suit la loi uniforme sur
[aα + b, aβ + b].
• Si X suit la loi Γ(α, θ), alors aX suit la loi Γ(α, θ/a).

Exemple 5.26 Soit Y = X 2 . La fonction x 7−→ x2 est décroissante sur R− et crois-


sante sur R+ . Le changement de variable y = x2 donne alors
Z 0 Z +∞
2
E(h(Y )) = h(x ) fX (x) dx + h(x2 ) fX (x) dx
−∞ 0
+∞ +∞
√ √
Z Z
1 1
= h(y) fX (− y) √ dy + h(y) fX ( y) √ dy,
0 2 y 0 2 y
108 Chapitre 5 – Variables aléatoires à densité

et nous trouvons donc que Y est à densité

√ √ 1
fY (y) = (fX (− y) + fX ( y)) √ 1]0,+∞[ (y). (5.16)
2 y

Exemple 5.27 Soit X une v.a. de loi N (0, 1). La variable aléatoire X 2 suit la loi
Γ(1/2, 1/2) (également appelée loi du Chi2 à un degré de liberté, et noté X 2 (1)), car
Y = X 2 est à densité (5.16) :

y 1
fY (y) = exp − √ 1]0,+∞[ (y).
2 y

Dans le cas des vecteurs aléatoires, l’idée est la même : il convient d’appliquer la for-
mule de changement de variable dans l’intégrale que nous allons maintenant rappeler.

d 1
Théorème
R 5.28 Soit
R A un ouvert de R , et ψ : A −→ B une bijection de classe C .
Alors, B φ(y)dy = A φ ◦ ψ(x) | det Jψ (x) | dx, pour φ positive ou intégrable.

Ici, nous rappelons que


— Jψ (x) est la matrice Jacobienne de ψ, c’est la matrice de taille d × d de com-
posantes Jψ (x)ij = ∂ψ
∂xj (x), 1 ≤ i, j ≤ d,
i


— det Jψ (x) est appelé déterminant Jacobien, et intervient par sa valeur absolue
(car, contrairement à la dimension 1, “il n’y a plus d’orientation” dans le calcul
de l’intégrale).
Comme première conséquence de la formule de changement de variable dans
l’intégrale, on voit qu’il faut se restreindre au cas où X et Y sont de même di-
mension. En effet, si Y est de dimension plus grande que X, alors Y = g(X) n’a
pas de densité, et si Y est de dimension inférieure à celle de X, alors il convient
de “compléter” Y artificiellement avec autant de composantes que nécessaires afin
de se retrouver avec la même nombre de composantes que X (voir la remarque 5.32
ci-dessous).

Proposition 5.29 Soit X un vecteur aléatoire à valeurs dans Rd de densité fX nulle


en dehors d’un ouvert A ⊂ Rd . Soit g : A −→ B une bijection telle que g −1 est de
classe C 1 . Alors Y est un vecteur aléatoire de densité :

fY (y) = 1B (y) fX ◦ g −1 (y) | det Jg−1 (y)|


1
= 1B (y) fX ◦ g −1 (y) , y ∈ Rd .
| det Jg (g −1 (y))|
5.4 – Recherche de densité 109

Preuve. Sous ces hypothèses, nous pouvons continuer le calcul dans (5.14) en utilisant
la formule de changement de variable x = ψ(y) = g −1 (y) du théorème 5.28 :
Z Z
E(h(Y )) = h ◦ g(x)fX (x) dx = h(y)fX ◦ g −1 (y) dy,
A B
1
et on conclut grâce à la proposition 5.24 et au fait que | det Jg−1 (y)| = | det Jg (g −1 (y))| .


Exemple 5.30 (Coordonnées polaires.) Soit X = (U, V ) un vecteur aléatoire


de R2 , et Y = (R, Θ) ses coordonnées polaires. La transformation g est un
difféomorphisme de A = R2 \{0} dans B =]0, ∞[×]0, 2π], et son inverse g −1 s’écrit
facilement : u = r cos θ, v = r sin θ. Alors le déterminant jacobien det Jg−1 (r, θ) = r
et on obtient par la proposition 5.29 que :
fY (r, θ) = r fX (r cos θ, r sin θ)1B (r, θ), (r, θ) ∈ R2 .
Par exemple si U et V sont
2 2
 indépendantes et de loi N (0, 1), (5.13) entraı̂ne que
1
fX (u, v) = 2π exp − u +v
2 , et

1 2
fY (r, θ) = r e−r /2 1]0,∞[ (r) 1]0,2π] (θ), (r, θ) ∈ R2 .

En particulier les v.a. R et Θ sont indépendantes, la première suit la loi de densité
2
re−r /2 1]0,∞[ (r), et la seconde est uniforme sur [0, 2π].

Remarque 5.31 Supposons qu’il existe une partition finie (Ai )1≤i≤d de A = {fX >
0}, telle que g : Ai −→ Bi = g(Ai ) est une bijection dont l’inverse est de classe C 1 .
Dans ce cas, on découpe l’intégrale selon les Ai , on applique la proposition 5.29 à
chaque morceau, et on obtient en sommant :
d
X 1
fY (y) = 1Bi (y)fX ◦ g −1 (y) , y ∈ Rd ,
i=1
| det Jg (g −1 (y))|
−1
où g est définie sur chaque Bi comme image réciproque de la restriction de g à Ai .

Remarque 5.32 Supposons que Y a moins de composantes que X, i.e. d0 < d.


Dans ce cas, on considère un vecteur Y = (Y , Y 0 ) complétant Y afin de construire
une application g : Rd −→ Rd dont les d0 premières composantes coı̈ncident avec les
composantes de g, et pour laquelle la proposition 5.29 s’applique. Nous obtenons ainsi
la densité fY de Y = g(X) et nous appliquons l’extension évidente de (5.11) :
Z
fY (y) = fY (y, y 0 )dy 0 .
Rd−d0
110 Chapitre 5 – Variables aléatoires à densité

Exemple 5.33 (Loi bêta) Soit X = (U, V ) un vecteur aléatoire de R2 , avec U et


V indépendantes de lois Γ(α, θ) et Γ(β, θ). Alors, en notant A =]0, ∞[2 , la densité du
vecteur X est
θα+β
fX (u, v) = uα−1 v β−1 e−θ(u+v) 1A (u, v), (u, v) ∈ R2 .
Γ(α)Γ(β)

Pour déterminer la densité de Y = U +V U


, nous introduisons Y = (Y, Y 0 ), avec
Y 0 = U + V , ce qui correspond à une transformation g(u, v) = u+v u

,u + v .
Cette application est bijective de A =]0, ∞[2 dans B =]0, 1[×]0, ∞[, et nous avons
g −1 (y, y 0 ) = (yy 0 , y 0 (1 − y)), qui a pour déterminant jacobien y 0 . La proposition 5.29
donne :
θα+β α+β−1 α−1
fY (y, y 0 ) = y0 y (1 − y)β−1 e−θz 1B (y, y 0 ), (y, y 0 ) ∈ R2 ,
Γ(α)Γ(β)

et on déduit la densité de la première marginale par (5.11) :


Z ∞
fY (y) = fY (y, y 0 )dy 0
0
Z ∞
θα+β α+β−1 −θy 0
= y α−1
(1 − y)β−1
1]0,1[ (y) y0 e dy 0
Γ(α)Γ(β) 0
Γ(α + β) α−1
= y (1 − y)β−1 1]0,1[ (y), (5.17)
Γ(α)Γ(β)

en utilisant (5.8). On appelle loi bêta de paramètres α et β la loi admettant cette den-
sité. Nous obtenons aussi facilement la densité de Y 0 . En effet, on voit que fY (y, y 0 )
est le produit de fY (y) par la fonction

θα+β α+β−1 −θy 0


fY 0 (y 0 ) = y0 e 1]0,∞[ (y 0 ),
Γ(α + β)

qui d’après (5.11) est la densité de la v.a. Y 0 . Ceci montre que Y 0 suit la loi Γ(α+β, θ).
On retrouvera ce résultat de manière plus simple (grâce à la fonction caractéristique)
dans l’Exemple 7.9.

Nous avons en fait démontré le résultat suivant.

Proposition 5.34 Si U et V sont indépendantes et de lois respectives Γ(α, θ) et


U
Γ(β, θ), alors U + V suit la loi Γ(α + β, θ) et est indépendante de U +V qui suit une
loi bêta de paramètres α et β.

En utilisant la même méthode on aussi le résultat suivant.


5.5 – Simulation de suites de variables aléatoires indépendantes 111

Proposition 5.35 (Produit de convolution) Si U et V sont deux variables


aléatoires réelles indépendantes de densités respectives fU et fV , alors Z = U + V
admet la densité
Z +∞ Z +∞
fZ (z) = fU (u)fV (z − u)du = fU (z − v)fV (v)dv.
−∞ −∞

La fonction fZ est appelée le produit de convolution des deux fonctions fU et fV .

Preuve. Si U et V sont indépendantes de densités respectives fU et fV , nous pou-


vons de la même manière trouver la densité de la somme Z = U + V . Là encore, nous
“complétons” Z en le couple T = (U, Z) (par exemple), correspondant à la bijection
g(u, v) = (u, u + v) sur R2 , dont le jacobien est 1. Par suite la proposition 5.29 permet
de conclure. 

Exemple 5.36 La somme de deux variables aléatoires indépendantes, de lois nor-


males N (m, σ 2 ) et N (µ, τ 2 ) est une variable aléatoire de loi normale N (m + µ, σ 2 +
τ 2 ). Nous verrons au chapitre 6 une autre preuve de ce résultat grâce à la fonction
caractéristique.

5.5 Simulation de suites de variables aléatoires


indépendantes

Un générateur aléatoire nous permet d’obtenir une suite (Xn )n potentiellement infinie,
de v.a. indépendantes et de loi uniforme sur [0, 1]. Nous voulons construire une suite
(Yn )n de vecteur aléatoires indépendants, à valeurs dans Rd , de loi donnée notée PY .

5.5.1 Inversion de la fonction de répartition

Considérons le cas d − 1 et généralisons la méthode introduite à la section refsect :si-


mul1.

Supposons que l’on connaisse la fonction de répartition F des variables Yi . A partir


d’une suite de v.a. uniformes sur [0, 1] et indépendantes, nous pouvons simuler une
suite de v.a. réelles indépendantes de fonction de répartition F . Comme au paragraphe
4.7.2, nous définissons la fonction “inverse” continue à gauche de F par :

G(x) = inf{y ∈ R : F (y) ≥ x}, ∀x ∈]0, 1[. (5.18)


112 Chapitre 5 – Variables aléatoires à densité

Proposition 5.37 La suite (Yn )n définie par Yn = G(Xn ) est une suite de variables
aléatoires indépendantes et identiquement distribuées de loi PY .

Preuve. L’indépendance et le fait que les Yn suivent la même loi sont évidents. Le
calcul de la loi a été fait à la section 4.7. 

5.5.2 Méthode du rejet

Cette méthode s’applique lorsque la probabilité PY admet une densité f , et lorsqu’on


connaı̂t une autre probabilité ν, telle que
- il est possible de simuler des v.a. de loi ν (par exemple par la méthode précédente) ;
- ν admet une densité g telle que

f (x) ≤ ag(x), ∀x ∈ Rd , (5.19)

pour une constante a connue (nécessairement a ≥ 1, et même a > 1 si PY 6= ν,


puisque f et g sont deux fonctions positives ayant la même intégrale 1).

Un cas particulier est le cas où f est une densité continue à support compact (donc
bornée).

Nous supposons aussi que nous disposons, d’une part de la suite (Xn )n ci-dessus
(constituée de v.a. indépendantes de loi uniforme sur [0, 1]), et d’autre part d’une
suite (Zn )n potentiellement infinie de v.a. indépendantes de loi ν et indépendantes
des (Xn )n . Nous posons alors

N = inf{n ∈ N? ; f (Zn ) > aXn g(Zn )} , (5.20)

avec la convention inf ∅ = +∞, et



Zn si N = n,
Y = (5.21)
0Rd si N = +∞.

Proposition 5.38 La v.a. N suit une loi géométrique de paramètre a1 (et donc
d’espérance a). Le vecteur aléatoire Y suit la loi PY . Les variables aléatoires N et Y
sont indépendantes.

Preuve. Notons An = {f (Zn ) > aXn g(Zn )}. Les événements An sont indépendants
et ont même probabilité. Posons P(An ) = α (nous calculerons α plus tard), de sorte
5.5 – Simulation de suites de variables aléatoires indépendantes 113

que P(N > n) = (1 − α)n . Pour toute fonction h continue bornée, nous avons

X
E(h(Y )) = E (h(Zn )1N =n ) + E (h(0)1N =+∞ )
n=1
X∞

= E h(Zn )1An 1{N >n−1} + h(0)P(N = +∞).
n=1

Les v.a. h(Zn )1An d’une part et 1{N >n−1} d’autre part sont indépendantes, car {N >
n − 1} = ∩n−1 c
k=1 Ak , donc

E h(Zn )1An 1{N >n−1} = E (h(Zn )1An ) (1 − α)n−1 .



(5.22)

L’espérance E (h(Zn )1An ) vaut


Z Z 1  Z Z
f (z) 1
h(z) 1{f (z)>axg(z)} dx g(z)dz = h(z) g(z)dz = h(z)f (z)dz.
Rd 0 Rd ag(z) a Rd

En particulier α est égal à cette expression lorsque h = 1, donc α = 1/a, puisque f


est une densité. Ainsi, 0 < α < 1 et comme P(N > n) = (1 − α)n , ceci montre que la
v.a. N est géométrique de paramètre α, donc en particulier P(N = +∞) = 0.

En
R remplaçant E (h(Zn )1An ) par sa valeur dans (5.22), nous obtenons que E(h(Y )) =
h(z)f (z)dz, ce qui montre que Y est de loi PY .

Enfin, l’indépendance s’obtient en vérifiant que


Z
n−1
 
E h(Y )1N =n = α(1 − α) h(z)f (z)dz = E h(Y ) P(N = n),
Rd
 
donc E h(Y )g(N ) = E h(Y ) E(g(N )) pour toute fonction g bornée. 

Nous avons ainsi obtenu une v.a. de loi PY . Pour obtenir une suite de telles variables
aléatoires indépendantes, il faut répéter la même procédure.

Nous pouvons comparer les deux méthodes :


− La première est très simple à mettre en œuvre, si l’on connaı̂t explicitement la
fonction G = F −1 , ce qui est assez rare dans la pratique.
− La seconde nécessite la connaissance de f , g et a, et aussi le fait que l’on sache
préalablement simuler selon la loi ν. L’idée est par exemple d’utiliser la première
méthode pour cette loi. Les conditions sont assez souvent remplies, mais cette
deuxième méthode est malheureusement parfois longue à mettre en œuvre (sa “lon-
gueur” est proportionnelle à N ).
114 Chapitre 5 – Variables aléatoires à densité

Un cas particulier : Supposons que la densité f est à support dans le compact


[b, c] et est bornée par une constante C. Alors la constante a de l’énoncé général
peut-être remplacée par a = C(c − b). Nous pouvons adapter la proposition 5.38 et
montrer que si (Uk )k et (Vk )k sont des suites de variables aléatoires indépendantes et
de loi respectivement uniforme sur le rectangle [b, c] et sur le rectangle [0, C], alors la
variable aléatoire

Y = UN , avec N = inf{k ≥ 1 : Vk ≤ f (Uk )},

définit une variable aléatoire de densité f .

Nous allons en déduire l’algorithme suivant :


Tirer (U, V ) de lois uniformes sur [b, c] et sur [0, C], jusqu’à ce que V ≤
f (U ). Poser alors X = U .
D’après la proposition 5.38, la v.a. X ainsi obtenue a pour densité f . Nous rejetons les
couples (U, V ) tels que V > f (U ). Cet algorithme s’appelle l’algorithme du rejet.
1
Remarquons que la loi de N est une loi géométrique de paramètre C(c−b) , d’espérance
E(N ) = C(c − b). Comme le nombre d’appels au générateur pseudo-aléatoire est 2N ,
l’algorithme sera efficace si la majoration de la densité f par la constante C sur le
support [b, c] est bien ajustée.

5.6 Exercices sur le chapitre 5

EXERCICE 5.5 Soit X ≥ 0 une variable aléatoire à densité, et g une fonction


positive croissante de classe C 1 , telle que g(0) = 0. Montrer que
Z +∞
E (g(X)) = g 0 (t)P(X > t)dt.
0

On pourra en particulier voir ce que devient cette formule dans le cas où g(x) = x.

EXERCICE 5.6 1) Un poste à incendie doit être installé le long d’une route fo-
restière de longueur A, A < ∞.
Si les incendies se déclarent en des points uniformément répartis sur (0, A), ou doit-
on placer ce poste de façon à minimiser l’espérance de la distance entre le poste et
l’incendie ?
2) Supposons que la route soit infiniment longue, s’étendant de 0 à l’infini. Si la dis-
tance entre un incendie et l’origine est exponentiellement distribuée avec un paramètre
λ, où doit-on alors installer le poste à incendie ?
5.6 – Exercices sur le chapitre 5 115

EXERCICE 5.7 La durée de fonctionnement d’une lampe suit une loi de densité
1 −t
f (t) = te 4 1t≥0
16
(l’unité de temps est l’année).

1) Vérifier que f est une densité de probabilité.


2) Calculer l’espérance et la variance de cette durée de fonctionnement.
3) Quelle est la probabilité que la lampe fonctionne pendant 6 ans ?

EXERCICE 5.8 Soit X une variable aléatoire de densité fX . Considérons la va-


riable aléatoire
Y = ce−αX 1{X>0} , (α > 0, c > 0).
Etudier l’existence d’une densité pour Y et donner sa valeur en fonction de fX .

EXERCICE 5.9 Soit X une variable aléatoire de loi N (0, 1).

1) Calculer E(eλX ) pour λ ∈ R.


a2
2) En déduire que pour a ≥ 0, on a P(X ≥ a) ≤ e− 2 .
3) Utiliser la forme intégrale de P(X ≥ a) pour obtenir l’encadrement
 
1 1 −a2 1 a2
√ − √ e 2 ≤ P(X ≥ a) ≤ √ e− 2 .
a 2π a3 2π a 2π

EXERCICE 5.10 Considérons deux paramètres a > 0 et α > 0. On dira que X


suit une loi de Pareto de paramètres (a, α) si X est une variable aléatoire de densité
f définie par
f (x) = 0 si x < a
α  a α+1
f (x) = si x ≥ a.
a x
Cette variable aléatoire décrit par exemple la répartition des richesses.

1) Montrer que f est bien une densité de probabilité. Allure du graphe de f : on


pourra prendre a = 1 et α = 3.
2) Calculer P(X > x). Allure de la fonction de répartition pour les paramètres ci-
dessus.
3) Soit y > 0 fixé. Calculer limx→∞ P(X > x + y|X > x). Qu’en conclure ? Cette
propriété est-elle vraie pour une variable exponentielle ?
4) Montrer que X admet une espérance si et seulement si α > 1. Calculer E(X)
dans ce cas.
5) Montrer que X admet une variance si et seulement si α > 2. Calculer Var(X)
dans ce cas.
116 Chapitre 5 – Variables aléatoires à densité

x 2 (1+y 2 )
1 −
EXERCICE 5.11 Soit (X, Y ) un couple aléatoire de densité f (x, y) = 2π |x|e .
2

1) Calculer la loi de X et la loi de Y . Est-ce que X et Y sont indépendantes ?


2) Est-ce que X et XY sont indépendantes ? Calculer la loi de XY .
3) Quelle est la loi de X(1 + Y ) ?

EXERCICE 5.12 Soient X et Y deux v.a. réelles. On suppose que la densité condi-
tionnelle de X sachant Y = y est la densité 1R+ (x)y 2 xe−xy et que la loi de Y est de
densité y12 1[1,+∞[ (y).
On pose T = XY .
1) Trouver la loi du couple (T, Y ). Qu’en déduit-on ?
2) Trouver la loi conditionnelle de Y sachant X = x.
3) Calculer E(Y |X).

EXERCICE 5.13 Soit Y une v.a. de loi uniforme sur [0, 1] et X à valeurs dans N,
avec X et Y indépendantes. On considère Z = XY .
Trouver la loi de Z et donner une condition pour que la loi de Z admette une densité
par rapport à la mesure de Lebesgue.

EXERCICE 5.14 Soit α, β > 0. On considère deux v.a. : X à valeurs dans N et Y


à valeurs dans R+ . La loi du couple est donnée, pour n ∈ N et y > 0, par
Z y
(αz)n
P(X = n, Y ≤ y) = β e−(α+β)z dz.
0 n!
Donner les lois respectives de X et de Y .

EXERCICE 5.15 Soient X1 , . . . , Xn des v.a. indépendantes de loi uniforme sur


[0, 1]. On pose :

U1 = X1 , U2 = X1 X2 , ..., Un = X1 · · · Xn .

1) Chercher la loi du n-uplet (U1 , . . . , Un ).


2) Chercher la loi conditionnelle de Un sachant Un−1 = u.

EXERCICE 5.16 Cet exercice donne une méthode (usuelle) pour simuler deux va-
riables aléatoires indépendantes et de loi normale.
Soient X et Y deux variables aléatoires indépendantes de loi N (0, 1). On considère
le couple (R, Θ) de variables aléatoires à valeurs R+ × [0, 2π[, obtenu en exprimant
(X, Y ) en coordonnées polaires.

1) Calculer la loi de (R, Θ) et celle de (R2 , Θ).


2) En déduire le procédé pratique suivant de simulation de variables aléatoires
5.6 – Exercices sur le chapitre 5 117

indépendantes et de loi normale : si U et V sont √ deux variables aléatoires


indépendantes
√ uniformes sur [0, 1], alors X = −2 ln U cos(2πV ) et Y =
−2 ln U sin(2πV ) sont deux variables aléatoires indépendantes de loi N (0, 1).
Y
3) Quelle est la loi de X ?

EXERCICE 5.17 Soient Z1 , . . . , Zn des variables aléatoires réelles, indépendantes


et de même loi, de fonction de répartition F . On pose

X = min Zk , Y = max Zk .
1≤k≤n 1≤k≤n

1) Calculer la fonction de répartition jointe FX,Y en fonction de F . Calculer les


fonctions de répartition FX et FY .
2) Dans le cas où la loi des Zk est de densité f , calculer les lois de X, de Y et de
(X, Y ).
3) Nous supposons désormais que les Zk ont une loi uniforme sur [a, b] pour a < b
dans R.
Expliciter les lois de X, de Y et de (X, Y ). Calculer E(X) et E(Y ), Var(X) et Var(Y ),
Cov(X, Y ) et ρ(X, Y ).

EXERCICE 5.18 Soient X et Y deux variables aléatoires exponentielles indépendantes


de paramètres λ et µ. On pose M = min(X, Y ) et D = |X − Y | = max(X, Y ) −
min(X, Y ).

1) Calculer P(M > a, D > b, X > Y ) pour a, b ≥ 0.


2) En déduire P(X > Y ), P(X < Y ), la loi de M , la loi de D conditionnellement à
X < Y , la loi de D conditionnellement à X > Y .
3) Montrer que M et {X < Y } sont indépendants.
4) Soient, pour 1 ≤ i ≤ n, des variables aléatoires Xi indépendantes de lois ex-
ponentielles de paramètre λi . Que dire de la loi de min1≤i≤n Xi et de l’événement
{ Xk = min1≤i≤n Xi } ?
Chapitre 6

Convergences et loi des


grands nombres

Un coup de dés jamais n’abolira le hasard

Stéphane Mallarmé.

Nous allons présenter dans ce chapitre l’un des résultats essentiels de la théorie des
probabilités, qui va justifier toute la théorie que nous avons construite à partir de
l’approche heuristique du Chapitre 2. Ce résultat montre rigoureusement que, quand
le nombre de répétitions de l’expérience tend vers l’infini, la fréquence de réalisation
d’un événement converge vers la probabilité de réalisation de cet événement. Ainsi,
notre modèle est bien cohérent avec l’intuition. Ce résultat, appelé Loi des grands
nombres, a d’autres portées fondamentales. Philosophique tout d’abord, puisqu’il
permet de voir le monde déterministe comme la limite macroscopique d’une accumu-
lation de phénomènes élémentaires microscopiques aléatoires. Portée numérique aussi,
car nous verrons que ce théorème est à l’origine de méthodes de calcul numérique ap-
pelées Méthodes de Monte-Carlo, qui sont extrêmement puissantes et robustes.
Elles sont par exemple très utilisées en Physique ou en Mathématiques Financières.

Considérons un espace fondamental Ω (muni de la tribu A et de la probabilité P).


Nous voulons étudier la répartition des valeurs d’une v.a. X de loi PX , réalisées au
cours d’une succession de n expériences aléatoires indépendantes. Par exemple, nous
interviewons n personnes choisies au hasard et nous leur demandons si elles aiment
les brocolis. Ici, la réponse sera 0 ou 1 et la v.a. associée X sera une variable de loi
de Bernoulli PX .

119
120 Chapitre 6 – Convergences et loi des grands nombres

Nous allons modéliser les résultats possibles de X au cours des n expériences par une
suite X1 , . . . , Xn de v.a. indépendantes et de même loi PX . Nous nous intéressons au
comportement aléatoire de cette suite de résultats et en particulier à leur moyenne
empirique, quand le nombre n tend vers l’infini (n est le nombre d’expériences ana-
logues réalisées, par exemple la taille de l’échantillon dans un sondage). La question
est donc : comment définir
X1 + · · · + Xn
lim ,
n→+∞ n
sachant que chaque Xi est une fonction de ω ?

Pour ce faire nous allons, de manière générale, définir les notions de convergence de
variables aléatoires et voir que plusieurs définitions différentes sont possibles, non
équivalentes, ce qui enrichit mais complique aussi la description des comportements
asymptotiques.

6.1 Convergences de v.a.

Dans ce paragraphe, nous allons étudier des modes de convergence impliquant la


proximité des v.a. elles-mêmes, contrairement au cas de la convergence en loi qui sera
étudiée ultérieurement.

Nous considérons une suite (Xn )n≥1 de vecteurs aléatoires, définis sur un même
espace de probabilité (Ω, A, P), et à valeurs dans Rd . Nous considérons également sur
le même espace un vecteur “limite” X. On notera |.| la valeur absolue dans R ou la
norme dans Rd .

Définition 6.1 a) La suite (Xn )n converge presque sûrement vers X, ce qui s’écrit
Xn → X p.s., s’il existe un ensemble N ∈ A de probabilité nulle tel que
Xn (ω) → X(ω) quand n → ∞ pour tout ω ∈
/ N.
P
b) La suite (Xn )n converge en probabilité vers X, ce qui s’écrit Xn → X, si pour
tout ε > 0 on a
P(|Xn − X| ≥ ε) → 0 quand n → ∞. (6.1)
L1
c) La suite (Xn )n converge en moyenne vers X, ce qui s’écrit Xn → X, si Xn et X
sont dans L1 et si
E(|Xn − X|) → 0 quand n → ∞. (6.2)

Remarque 6.2 La convergence p.s. est la plus proche de la convergence simple des
fonctions. Mais ici, nous permettons à certains ω de ne pas vérifier Xn (ω) → X(ω),
si toutefois la probabilité de réalisation de l’ensemble de ces ω est nulle.
6.1 – Convergences de v.a. 121

Ces convergences ne sont pas équivalentes, comme le montre l’exemple suivant.

Exemple 6.3 (i) Soit (Xn )n une suite de v.a. de Bernoulli B( n1 ), i.e. P(Xn = 1) =
1
n = 1 − P(Xn = 0). Alors

Xn −→ 0 en probabilité et en moyenne.

En effet P(|Xn | > ε) = n1 −→ 0 pour tout ε ∈]0, 1[, prouvant la convergence en


probabilité, et E|Xn − 0| = E(Xn ) = n1 −→ 0, prouvant la convergence en moyenne.
(ii) Pour la suite Yn = n2 Xn dont la loi est caractérisée par P(Yn = n2 ) = 1 − P(Yn =
0) = n1 , pour tout n ≥ 1, nous avons par les mêmes calculs :

Yn −→ 0 en probabilité, mais Yn 6−→ 0 en moyenne,

du fait que E(|Yn − 0|) = E(Yn ) = n −→ ∞ ! (en fait, (Yn )n ne converge vers aucune
autre limite finie).

Exemple 6.4 Soit U une v.a. uniforme sur [0, 1]. Alors, la suite de v.a. de loi B( n1 ) :

Zn = 1{U ≤ n1 } −→ 0, p.s.

En effet, considérant l’ensemble négligeable N = {U = 0}, on a que pour tout ω ∈ N c ,


il existe n0 tel que U (ω) > n10 , impliquant que Zn (ω) = 0 pour tout n ≥ n0 .

Nous allons maintenant étudier les liens entre ces différentes convergences. Com-
mençons par le résultat le plus simple.

Théorème 6.5 La convergence en moyenne entraı̂ne la convergence en probabilité.

Preuve. Pour des vecteurs aléatoires intégrables Xn et X, il suffit de remarquer que


l’inégalité de Markov (4.13) donne pour tout ε > 0,

E(|Xn − X|)
P(|Xn − X| ≥ ε) ≤ .
ε


Nous avons vu dans l’exemple 6.3 que la réciproque n’est pas toujours vraie.

L’un des résultats les plus importants de la théorie de l’intégration relie la convergence
en moyenne et la convergence presque-sûre. C’est ce résultat qui, en grande partie, fait
la supériorité de l’intégrale de Lebesgue par rapport à celle de Riemann. Commençons
122 Chapitre 6 – Convergences et loi des grands nombres

par un autre résultat qui est également très utile et qui est une conséquence simple
du théorème 4.12 de convergence monotone. Pour une suite réelle (un )n , on rappelle
la notation

lim inf un = sup inf uk et lim sup un = inf sup uk


n n≥1 k≥n n n≥1 k≥n

On rappelle que lim inf n un ≤ lim supn un avec égalité si et seulement si la limite
existe, et dans ce cas limn un = lim inf n un = lim supn un .

Lemme 6.6 (Fatou) Pour une suite de v.a. positives (Xn )n , on a E(lim inf n Xn ) ≤
lim inf n E(Xn ).


Preuve. D’après la monotonie de l’espérance,
 inf k≥n E(Xk ) ≥ E inf k≥n Xk pour
tout n ≥ 1. Comme la suite inf k≥n Xk n≥1 est croissante P−p.s., on obtient le
résultat par application du théorème 4.12 de convergence monotone. 

Théorème 6.7 (de Lebesgue, ou de convergence dominée) Si la suite de vecteurs


aléatoires Xn converge presque-sûrement sur Ω vers une limite X et si

∀n, |Xn | ≤ Z avec Z ∈ L1 ,

alors Xn et X sont intégrables et on a


n→∞
E(|Xn − X|) −→ 0.
n→∞
En particulier, E(Xn ) −→ E(X).

Preuve. On note Yn = |Xn − X| et Y ∗ = supn Yn . Par le lemme de Fatou,


E(|X|) ≤ lim inf n E(|Xn |) ≤ E(Z) < ∞. Alors X ∈ L1 et |Y ∗ | ≤ |X| + Z ∈ L1 .
Comme la v.a. Y ∗ − Yn est positive et que Yn −→ 0, P−p.s., on obtient par le lemme
de Fatou que lim inf n E(Y ∗ − Yn ) ≥ E(Y ∗ ). Simplifiant par E(Y ∗ ), ceci implique que
0 ≥ lim supn E(Yn ) ≥ lim inf n E(Yn ) ≥ 0 du fait de la positivité de Yn . 

Attention : la réciproque est fausse. Dans l’exemple 6.3, supposons que les va-
riables aléatoires réelles (Xn )n soient indépendantes. Puisque P(|Xn | > ε) = n1 , la
série de terme général P(|Xn | > ε) = n1 est divergente. Par ailleurs les événements
An = {Xn > ε} sont indépendants. Par le théorème 2.35 de Borel-Cantelli, nous en
déduisons que pour presque tout ω, une infinité de Xn (ω) seront supérieurs à ε. Ainsi,
la suite ne peut pas converger vers 0. Ainsi, la suite (Xn )n est bornée par 1, elle tend
en moyenne vers 0 mais pas presque-sûrement.
6.1 – Convergences de v.a. 123

En revanche, considérons maintenant la suite (Vn )n avec, pour a > 1


1
P(Vn = 1) = = 1 − P(Vn = 0).
na
Puisque a > 1, la série de terme général P(Vn ≥ ε) converge, et donc toujours par le
théorème de Borel-Cantelli, nous savons que pour presque tout ω, un nombre fini au
plus de Vn (ω) seront supérieurs à ε. On a donc Vn −→ 0 p.s.

Nous pouvons donc voir à travers ces exemples que ces notions sont délicates.

Remarque 6.8 L’hypothèse de domination est nécessaire. Considérons une suite de


variables aléatoires réelles (Tn )n telle que
1
P(Tn = n2 ) = √ = 1 − P(Tn = 0).
n n
Par un argument similaire à l’argument précédent, nous pouvons√montrer que la suite
(Tn )n converge presque-sûrement vers 0. En revanche, E(Tn ) = n, et la suite (Tn )n
ne peut pas converger en moyenne.

Nous explorons maintenant d’autres relations entre ces convergences.

Proposition 6.9 La convergence presque-sûre entraı̂ne la convergence en probabilité.

n→∞
Preuve. Soit An,ε = {ω, |Xn (ω) − X(ω)| ≥ ε}. Supposons que Xn −→ X presque-
sûrement. Soit N l’ensemble de probabilité nulle en dehors duquel on a Xn (ω) →
X(ω). Si ω ∈/ N , alors ω ∈/ An,ε pour tout n ≥ n0 , où n0 dépend de ω et de
ε, ce qui implique que les v.a. Yn,ε = 1N c ∩An,ε tendent simplement vers 0 quand
n → ∞. Comme nous avons aussi 0 ≤ Yn,ε ≤ 1, le théorème de convergence dominée
n→∞
(Théorème 6.7) entraı̂ne que E(Yn,ε ) −→ 0. Mais
n→∞
P(An,ε ) ≤ P(N c ∩ An,ε ) + P(N ) = P(N c ∩ An,ε ) = E(Yn,ε ) −→ 0,

et nous en déduisons (6.1). 

La convergence en probabilité n’entraı̂ne pas la convergence en moyenne, comme nous


l’avons vu dans l’exemple 6.3. Si les Xn ne sont “pas trop grands”, il y a cependant
équivalence entre les deux modes de convergence. En voici un exemple.

Proposition 6.10 S’il existe une constante a telle que |Xn | ≤ a presque-sûrement,
P L1
il y a équivalence entre Xn → X et Xn → X.
124 Chapitre 6 – Convergences et loi des grands nombres

Preuve. Etant donné le théorème 6.5, il suffit de montrer que la convergence en


probabilité implique la convergence en moyenne, lorsque |Xn | ≤ a.

Comme |Xn | ≤ a, nous avons {|X| > a + ε} ⊂ An,ε (avec la même notation que
précédemment), et donc P(|X| > a + ε) ≤ P(An,ε ). En faisant tendre n vers +∞,
nous en déduisons que P(|X| > a + ε) = 0. Ceci est vrai pour tout ε, et donc
P(|X| > a) = 0. (6.3)
Comme |Xn | ≤ a, nous avons aussi
|Xn − X| ≤ ε1Acn,ε + (|Xn | + |X|)1An,ε ≤ ε + 2a 1An,ε
sur l’ensemble {|X| ≤ a}, qui est de probabilité 1. Donc il vient
E(|Xn − X|) ≤ ε + 2aP(An,ε ).
Il s’en suit (par (6.1)) que lim supn E(|Xn − X|) ≤ ε, et comme ε est arbitrairement
proche de 0, nous en déduisons (6.2). 

Les rapports entre convergence presque-sûre et convergence en probabilité sont plus


subtils. La première de ces deux convergences est plus forte que la seconde d’après la
proposition 6.9, mais “à peine plus”, comme le montre le résultat suivant.

Proposition 6.11 Si Xn −→ X en probabilité, alors il existe une sous-suite (nk )


telle que Xnk → X p.s.

Preuve. Comme la suite (Xn )n converge en probabilité vers X, nous pouvons définir
une sous-suite de la manière suivante. Posons n1 = 1, et soit
   
1 1
nj = inf n > nj−1 ; P |Xr − Xs | > j < j , pour r, s ≥ n .
2 3
Il résulte alors de : j P(|Xnj+1 − Xnj | > 21j ) < j 31j < ∞ que la suite (Xnj )j≥1
P P
converge presque-sûrement. En effet, c’est une conséquence du lemme de Borel-
Cantelli (Théorème 2.35) appliqué aux ensembles Aj = {|Xnj+1 − Xnj | > 21j }. 

Exemple 6.12 Soient Ω = R muni de sa tribu borélienne et P la probabilité uniforme


sur [0, 1]. Soit Xn = 1An , où An est un intervalle de [0, 1] de longueur 1/n. Ainsi,
E(Xn ) = 1/n, et la suite Xn tend vers X = 0 en moyenne, et donc en probabilité.
Supposons que les An soient placés bout-à-bout, en recommençant en 0 chaque fois
qu’on arrive au point 1. Il est clair que l’on parcourt indéfiniment l’intervalle [0, 1] (car
la série de terme général 1/n diverge). Ainsi la suite numérique Xn (ω) ne converge
pour
P aucun ω, et on n’a pas Xn → X presque-sûrement ; cependant comme la série
2
n 1/n converge, il s’en suit que Xn2 → X = 0 presque-sûrement. Nous avons donc
la convergence presque-sûre de la sous-suite (Xn2 )n .
6.2 – La loi des grands nombres 125

Proposition 6.13 Soit f une fonction continue de Rd dans R.


(a) Si Xn → X p.s. alors f (Xn ) → f (X) p.s.
P P
(b) Si Xn → X, alors f (Xn ) → f (X).

Preuve. (a) est évident. Pour (b) remarquons d’abord que si K > 0 et ε > 0,
{|f (Xn ) − f (X)| ≥ ε} ⊂ {|X| > K} ∪ {|X| ≤ K, |f (Xn ) − f (X)| ≥ ε}. (6.4)
La fonction f est uniformément continue sur {x : |x| ≤ 2K}, donc il existe η > 0 tel
que |x − y| < η et |x| ≤ 2K, |y| ≤ 2K impliquent que |f (x) − f (y)| < ε. Ainsi, en
choisissant η suffisamment petit, |x| ≤ K entraı̂ne |y| ≤ 2K, et (6.4) implique :
{|f (Xn ) − f (X)| ≥ ε} ⊂ {|X| > K} ∪ {|Xn − X| ≥ η},
P(|f (Xn ) − f (X)| ≥ ε) ≤ P(|X| > K) + P(|Xn − X| ≥ η).
D’après l’hypothèse il vient
lim sup P(|f (Xn ) − f (X)| ≥ ε) ≤ P(|X| > K). (6.5)
n

Enfin limK→∞ P(|X| > K) = 0 (nous le montrons grâce au théorème de convergence


dominée) et donc dans (6.5) la lim sup est nulle. Nous obtenons ainsi le résultat. 

6.2 La loi des grands nombres

Reprenons la modélisation présentée dans l’introduction de ce chapitre. Nous


considérons une suite (Xn )n≥1 de variables aléatoires réelles indépendantes et de
même loi, que l’on note iid (pour “indépendantes et identiquement distribuées”).
Notre objectif est de montrer que la moyenne empirique définie comme la moyenne
des n premières variables aléatoires
1
Mn = (X1 + · · · + Xn ),
n
converge vers l’espérance des variables Xn lorsque cette dernière existe (comme les
Xn ont même loi, cette espérance est la même pour tout n). Il s’agit là, répétons-le,
d’un des résultats essentiels de toute la théorie des probabilités, connu sous le nom
de loi des grands nombres.

Théorème 6.14 Soit (Xn )n une suite de v.a. iid, intégrables. Alors
n
1X n→∞
Mn = Xi −→ E[X1 ] p.s. et en moyenne (et donc en probabilité).
n i=1
126 Chapitre 6 – Convergences et loi des grands nombres

Remarque 6.15 (i) Le résultat sur la convergence en probabilité est appelé loi faible
des grands nombres. Si Xn est de carré intégrable, de moyenne m et de variance
σ 2 = Var(Xn ), sa preuve est immédiate : il suffit de remarque que E(Mn ) = m et
p p σ
E(|Mn − m|) ≤ E((Mn − m)2 ) = Var(Mn ) = √ −→ 0, quand n → ∞,
n

d’où Mn −→ m en moyenne, et par suite en probabilité d’après le théorème 6.5. Nous


n→∞
avons en fait obtenu la convergence en moyenne quadratique E((Mn − m)2 ) −→ 0.

(ii) La convergence presque-sure de la moyenne empirique vers la moyenne est ap-


pelé loi forte des grands nombres. Il s’agit d’un résultat plus fort donnant une
information sur la trajectoire n → Xn (ω), pour presque tout ω.

Remarquons aussi que l’indépendance des v.a. Xn ne peut être relachée simplement.
Prenons par exemple toutes les Xn égales à une même variable aléatoire X. Alors
Mn = X, qui ne convergera vers m que si X est constante, égale à m.

Preuve. Cette preuve est due à Randal Douc. Remarquons d’abord que l’on peut
toujours se ramener
Pn au cas E(X1 ) = 0, quitte à considérer les variables centrées.
Notons Sn = i=1 Yi , où Yi = Xi + c pour une constante c > 0. Alors les Yi sont iid,
intégrables, et E(Yi ) = c > 0. Nous allons montrer que

L∗ = inf Sn > −∞, P − p.s., (6.6)


n≥1

ce qui suffira pour obtenir la loi forte des grands nombres. En effet, puisque Sk ≥ L∗
pour tout k ≥ 1, on a pour tout n ≥ 1 : inf k≥n k1 Sk ≥ inf k≥n k1 L∗ = 0 P−p.s., car L∗
est fini P−p.s.. Donc on a :

Sn Sk
c + lim inf Mn = lim inf = sup inf ≥ 0, P − p.s.
n n n n≥1 k≥n k

En appliquant le même raisonnement à Yi = −Xi + c, on obtient de même 0 ≤


c + lim inf n (−Mn ) = c − lim supn Mn , P−p.s. D’où

−c ≤ lim inf Mn ≤ lim sup Mn ≤ c, P − p.s.


n n

et en envoyant c vers 0, on obtient que lim inf n Mn = lim supn Mn = 0, P−p.s., ce qui
est exactement le résultat voulu.
Montrons à présent (6.6) ou, de manière équivalente, P(A(Y )) = 0, où Y = (Yn )n≥1
et A(Y ) = {L∗ = −∞}. Notant aussi Ln (Y ) = inf k≤n Sk et θ(Y ) = (Yn )n≥2 , on a :
   
Ln (Y ) = Y1 + inf (Sk − Y1 ) = Y1 + min 0, Ln−1 (θ(Y ) ≥ Y1 + min 0, Ln (θ(Y ) .
k≤n
6.2 – La loi des grands nombres 127

Comme A(Y ) = A(θ(Y )) et L− = − min(0, L), en multipliant par 1A(Y ) et en prenant


l’espérance, on obtient :
  − 
E 1A(Y ) Y1 ≤ E 1A(Y ) Ln (Y ) + E 1A(Y ) Ln (θ(Y )
 − 
= E 1A(Y ) Ln (Y ) + E 1A(θ(Y )) Ln (θ(Y )
− 
= E 1A(Y ) Ln (Y )+ ,
 
= E 1A(Y ) Ln (Y ) + E 1A(Y ) Ln (Y

puisque Y et θ(Y ) ont la même loidu fait que les Yi sont iid. Ceci implique que
E 1A(Y ) Y1 ≤ limn E 1A(Y ) Ln (Y )+ = 0, d’après le théorème de convergence do-
minée puisque 0 ≤ 1A(Y ) Ln (Y )+ ≤ Y1+ ∈ L1 pour tout n ≥ 1. Utilisant de nouveau
l’égalité A(Y ) = A(θ(Y )), on obtient alors
   
0 ≥ E 1A(Y ) Y1 = E 1A(θ(Y )) Y1 = E 1A(θ(Y )) E(Y1 ) = P A(Y ) E(Y1 ),

par indépendance des Yi . Comme E(Y1 ) = c > 0, ceci montre que P(A(Y )) = 0. 

Revenons à “l’approche par les fréquences” du Chapitre 2. Soit un événement A. Nous


répétons l’expérience, et nous notons Xn la v.a. qui vaut 1 si A est réalisé au cours de la
nième expérience et 0 sinon. La fréquence de réalisation de A au cours des n premières
expériences est alors
1
fn (A) = (X1 + · · · + Xn ) = Mn .
n
Par ailleurs, les Xi sont indépendantes et de même loi et E(Xi ) = P(Xi = 1) =
P(A). Donc la loi forte des grands nombres implique que fn (A) converge vers P(A)
presque-sûrement. Nous obtenons ainsi une justification a posteriori de l’approche par les
fréquences, qui, sans en démontrer de manière rigoureuse la validité (c’est évidemment
impossible), montre au moins que cette approche est compatible avec la théorie qui a été
fondée dessus.

En outre, la loi des grands nombres nous indique aussi dans quel sens il convient de
prendre la convergence dans (2.1), à savoir au sens presque-sûr. Il faut remarquer que
dans les théorèmes précédents, et donc aussi dans l’approche par les fréquences, on
ne peut pas avoir convergence de Mn (ω) vers m pour tout ω. Nous allons voir dans
l’exemple suivant qu’il existe un ensemble négligeable sur lequel la convergence n’est
pas réalisée.

Exemple 6.16 Considérons un jeu de Pile ou Face infini, c’est-à-dire une suite Xn
de v.a. ne prenant que les valeurs 0 et 1. Nous définissons cette suite sur l’espace

Ω = {0, 1}N , i.e. un point ω est une suite numérique x1 , . . . , xn , . . . de 0 et de 1.
Chaque suite est en principe possible. Soit alors Pp une probabilité sous laquelle les Xn
sont indépendantes et de même loi de Bernoulli de paramètre p ∈]0, 1[. (Il est possible
de construire une telle loi.) La loi des grands nombres nous dit que pour toute suite
128 Chapitre 6 – Convergences et loi des grands nombres

(xn )n en dehors d’un ensemble de probabilité nulle, la moyenne n1 (x1 + · · · + xn ) tend


vers le nombre p quand n tend vers l’infini. Il existe évidemment beaucoup de suites
ne vérifiant pas cette propriété, par exemple xn = 0 pour tout n. Si nous considérons
maintenant la probabilité Pq définie de la même manière pour q 6= p, l’ensemble
de probabilité 1 pour Pp des suites (xn )n qui tendent vers p, devient sous Pq un
ensemble de probabilité nulle. Remarquons également que la probabilité de chaque
suite particulière est nulle (elle vaut limk→+∞ pk1 (1 − p)k2 , k1 + k2 = k), ce qui veut
dire que P n’est pas une somme de mesures de Dirac.

Cet exemple montre que lorsque l’on étudie la convergence des variables aléatoires, il est
indispensable d’introduire la convergence presque-sûre, puisqu’on n’a généralement pas
la convergence simple (i.e. pour tout ω).

A titre de complément...

Voici une autre démonstration de la loi forte des grands nombres sous l’hypothèse
(plus forte) que les variables iid Xi sont de carré intégrable. L’argument suivant est
basé sur le lemme de Borel-Cantelli. On note σ 2 = Var(X) et on se ramène au cas où
E(X) = 0, quitte à considérer les variables centrées. On procède en deux étapes :

1) Montrons d’abord que Mn2 −→ 0, P−p.s. Notant An,q = {|Mn2 | ≥ 1q }, q ∈ N∗ , on


voit d’après la remarque 6.15 et l’inégalité de Bienaymé-Chebyshev (4.14) que

 σ2 q2 X
P An,q ≤ , et par suite P(An,q ) < ∞.
n2
n≥1

Le lemme de Borel-Cantelli (Théorème 2.35) assure alors que les événements Cq =


lim supn An,q et (par conséquent) N = ∪q≥1 Cq sont négligeables. Maintenant, ω 6∈ N
si et seulement si ω 6∈ Cq pour tout q ≥ 1, c’est à dire que pour tout q ≥ 1 il existe
n assez grand tel que Mk2 (ω) ≤ 1q dès que k ≥ n. En d’autres termes, Mn2 (ω) → 0
pour tout ω ∈/ N , ce qui est bien le résultat voulu.

2) Montrons maintenant que la suite (Mn )n tend presque-sûrement vers 0. Pour tout
entier n, notons pn l’entier tel que p2n ≤ n < (pn + 1)2 . Comme les v.a. Xi sont iid,
n √
 p(n)2 2   1 X 2  n − p2n 2 2 n+1 2
E Mn − Mp2n = E Xp = σ ≤ σ ,
n n n2 n2
p=p2n +1


puisque n − p2n ≤ (1 + pn )2 − p2n = 1 + 2pn ≤ 1 + 2 n. Une nouvelle application de
l’inégalité de Bienaymé-Chebyshev donne alors

 2 n + 1 σ2 p2n

P Bn,q ≤ , où B = − M pn ≥ q, q ∈ N .

n,q n 2
n2 q2 n
M
6.3 – Méthode de Monte-Carlo 129


P 2 n+1
Comme la série n n2 converge, le même raisonnement que la première étape
p2
montre que Mn − nn Mp2n −→ 0 quand n → ∞, P−p.s. Avec le résultat de la première
étape, et le fait que p2n /n → 1, ceci implique que Mn −→ 0 quand n → ∞, P−p.s.

6.3 Méthode de Monte-Carlo

Montrons comment nous pouvons appliquer la loi des grands nombres au calcul
d’intégrales. Pour cela, énonçons tout d’abord un corollaire immédiat de la loi des
grands nombres.

Corollaire 6.17 Soient (Xn )n une suite de v.a. iid de loi uniforme sur [0, 1], et f
une fonction mesurable bornée sur [0, 1]. Alors
Z 1
f (X1 ) + · · · + f (Xn )
−→ f (x)dx, quand n → ∞, p.s.
n 0

Preuve. Nous appliquons la loi des grands nombres aux v.a. f (Xi ) qui vérifient bien
toutes les hypothèses voulues puisque f est bornée. Nous avons alors
Z 1
f (X1 ) + · · · + f (Xn )
lim = E(f (X)) = f (x)dx.
n n 0

En choisissant des v.a. de loi uniforme sur [a, b], nous pouvons obtenir de même une
approximation d’une intégrale définie sur l’intervalle [a, b].

Ce résultat se généralise à toutes les dimensions.


R
Nous voulons calculer l’intégrale I = A f (x)dx, où f est une fonction mesurable
bornée de Rd dans R et A est le cube {x = (x1 , . . . , xd ) : |xi | ≤ α ∀i} de Rd . Pour
calculer I, nous pouvons simuler une suite X1 , . . . , Xn de v.a. indépendantes et de
loi uniforme sur A. Cela revient à dire que si chaque Xn admet les composantes Xn,j
(1 ≤ j ≤ d), les v.a. (Xn,j : n ≥ 1, 1 ≤ j ≤ d) sont indépendantes et uniformes sur
[−α, α]. Une suite de valeurs approchées de I est alors
(2α)d
In = (f (X1 ) + · · · + f (Xn )) . (6.7)
n
1
En effet la loi uniforme sur A admet la densité g(x) = 1 (x),
(2α)d A
donc l’espérance
I
des f (Xi ) est égale à (2α)d
, et il s’ensuit que In converge vers I par la loi des grands
nombres.
130 Chapitre 6 – Convergences et loi des grands nombres

L’inconvénient de cette méthode est que In est une approximation “aléatoire” de I,


donc on a un peu de peine à contrôler l’erreur In − I. Toutefois, le deuxième théorème
fondamental de ce cours, à savoir le théorème de la limite centrale qui sera l’objet du
chapitre suivant, va donner un contrôle de cette erreur comme on le montre dans la
section 9.3.

Un avantage de cette méthode est qu’elle reste valable si la fonction f est très
irrégulière (alors que les méthodes déterministes de type “méthode du trapèze” ne
se justifient que si la fonction f est continue). En outre, à précision donnée, elle est
peu sensible à la dimension d, le temps de calcul étant proportionnel à d, alors que
les méthodes déterministes ne sont possibles, du point de vue du temps de calcul, que
pour d petit, (disons d ≤ 3), puisque ce temps de calcul est environ proportionnel à
une constante à la puissance d. Dans notre cas, tirer une variable X de loi uniforme
sur A revient à tirer ses d composantes, chacune selon la loi uniforme sur [0, 1]. Nous
verrons également que la vitesse de convergence de In vers I ne dépend pas non plus
de la dimension.

Pour toutes ces raisons, les algorithmes obtenus par méthodes de Monte-Carlo sont
extrêmement utilisés dans toutes les situations nécessitant des temps de calcul très
courts ou en grande dimension.

6.4 Exercices sur le chapitre 6

EXERCICE 6.1 Soit (un )n une suite de nombres réels tels que pour tout n ≥ 1, on
ait 0 < un ≤ 1. Soit (Xn )n une suite de v.a. indépendantes telles que
 
1
P Xn = = un ; P(Xn = 0) = 1 − un pour tout n ≥ 1.
un

1) Calculer E(Xn ).
P P
2) On suppose que n≥1 un < +∞. En déduire que Xn → 0. Montrer en fait que
p.s.
Xn → 0 quand n tend vers l’infini.
p.s.
3) Montrer que la suite X1 +···+X
n
n
→ 0 quand n tend vers l’infini. Ce résultat est-il
en contradiction avec la loi des grands nombres ?

EXERCICE 6.2 Montrer que la loi forte des grands nombres reste vraie pour des
variables aléatoires indépendantes positives de même loi, d’espérance commune égale
p.s.
à +∞, c’est-à-dire que l’on a X1 +···+X
n
n
→ +∞.
6.4 – Exercices sur le chapitre 6 131

EXERCICE 6.3 Soit (Xn )n une suite de variables aléatoires indépendantes, de


même loi de Bernoulli

P(Xn = 1) = x ; P(Xn = 0) = 1 − x, où x ∈]0, 1[.

1) Montrer que pour toute fonction continue de [0, 1] dans R,


  
X1 + . . . + Xn n→∞
E f −→ f (x).
n
En déduire qu’il existe une suite de polynômes qui convergent simplement vers f .
On les appelle polynômes de Bernstein.
2) Montrer qu’en fait, la convergence est uniforme.

EXERCICE 6.4 Inégalité de Chernov. Soit (Xn )n une suite de v.a. réelles
indépendantes de loi N (m, σ 2 ).
1) On pose pour u ∈ R : M (u) = E(eu(X1 −m) ). Calculer M (u).
2) On pose Sn = X1 + · · · + Xn . Montrer pour tout a ∈ R que
n
P(Sn − nm ≥ a) ≤ e−ua (M (u)) , pour tout u ∈ R+ ,
n
P(Sn − nm ≤ a) ≤ e−ua (M (u)) pour tout u ∈ R− .
Sn
3) Soit Yn = n . Montrer que ∀ε > 0,

−nε2
 
P(|Yn − m| ≥ ε) ≤ 2 exp .
2σ 2
Cette inégalité est appelée inégalité de Chernov.
4) On suppose que m = 1 et que σ 2 = 10.
Avec α = 0,95 et ε = 0,05, quelle taille d’échantillon doit-on choisir pour obtenir

P(|Yn − m| ≤ ε) ≥ α,

• En utilisant l’inégalité de Bienaymé-Chebyshev ?


• En utilisant l’inégalité de Chernov ?

EXERCICE 6.5 (Placement risqué) Un particulier place une somme S0 sur un


placement risqué. L’évolution de son placement à des échéances fixes n = 1, 2, . . .
est donnée par Sn = (1 + Rn )Sn−1 , où les intérêts aléatoires Rn forment une suite
indépendante et de même loi à valeurs dans ] − 1, ∞[ et d’espérance finie. Que pouvez-
vous dire de l’évolution du placement Sn pour de grands n ? Que se passe-t-il si
E(R1 ) = 0 ?

EXERCICE 6.6 Soient (Xn )n une suite de variables aléatoires indépendantes de


même loi, intégrables, et f une fonction continue bornée sur R. On pose E(X1 ) = a.
132 Chapitre 6 – Convergences et loi des grands nombres

Montrer que f X1 +···+X



1) n
n
→ f (a) p.s.
 n→∞
2) Montrer que E f X1 +···+Xn
n
−→ f (a). R
Soit g ∈ C([0, 1]). Calculer limn In , où In = [0,1]n g x1 +···+x

3) n
n
dx1 · · · dxn .
1
4) En utilisant des variables aléatoires de loi E( a ), montrer que

(−1)n−1  n n (n−1)  n 
f (a) = lim F
n→∞ (n − 1)! a a
R∞
où F (t) = 0 f (x)e−tx dx. On pourra montrer que la somme de n variables aléatoires
indépendantes de loi exponentielle de paramètre α suit une loi Gamma de paramètres
αn
(n, α), c’est-à-dire de densité x 7→ (n−1)! xn−1 e−αx pour x > 0.
Chapitre 7

Fonctions caractéristiques,
convergence en loi et
théorème de la limite centrale

Rien ne m’est sûr que la chose incertaine ; Obscur, fors ce qui est tout évident ;
Doute ne fais, fors en chose certaine ; Science tiens à soudain accident.

François Villon - Ballade du concours de Blois

7.1 La fonction caractéristique

Dans ce paragraphe, nous introduisons un outil important en calcul des probabilités :


il s’agit de ce que l’on appelle la fonction caractéristique d’une variable aléatoire,
et qui dans d’autres branches des mathématiques s’appelle aussi la transformée de
Fourier.

7.1.1 Définition et premières propriétés

Nous noterons hx, yi le produit scalaire de deux vecteurs de Rn . Si u ∈ Rn , la fonction


(complexe) x 7→ ei hu,xi est continue, de module 1. Donc si X est un vecteur aléatoire
à valeurs dans Rn , nous pouvons considérer ei hu,Xi comme une variable aléatoire à

133
134 Chapitre 7 – Fonctions caractéristiques et convergence en loi

valeurs complexes. Ses parties réelle Y = cos(hu, Xi) et imaginaire Z = sin(hu, Xi)
sont des v.a. réelles. Ces v.a. réelles sont de plus bornées par 1, donc elles admettent
une espérance. Il est alors naturel d’écrire que l’espérance de ei hu,Xi est
E(ei hu,Xi ) = E(Y ) + i E(Z) = E(cos(hu, Xi)) + i E(sin(hu, Xi)).

Définition 7.1 Si X est un vecteur aléatoire à valeurs dans Rn , sa fonction ca-


ractéristique est la fonction φX de Rn dans C définie par
 
φX (u) = E ei hu,Xi . (7.1)

Si X est à valeurs réelles, φX est définie de R dans C et vaut


∀u ∈ R, φX (u) = E eiuX .

(7.2)

Remarquons que la fonction caractéristique ne dépend en fait que de la loi PX de


X : c’est la “transformée de Fourier” de la loi PX .

Nous verrons que cette fonction porte bien son nom, au sens où elle caractérise la loi
PX . C’est une notion qui, de ce point de vue, généralise la fonction génératrice que
nous avons vue au Chapitre 2. Elle vérifie
φX (u) = GX (eiu ),
pour une variables aléatoire X à valeurs dans N.

Proposition 7.2 La fonction φX est de module inférieur ou égal à 1, continue, avec


φX (0) = 1 ; φX (−u) = φX (u).

Preuve. |z| désigne le module d’un nombre complexe z.

Comme E(Y )2 ≤ E(Y 2 ) pour toute variable aléatoire réelle Y , nous avons :
2 2
|φX (u)|2 = (E(cos hu, Xi)) + (E(sin hu, Xi)) ≤ E(cos2 hu, Xi + sin2 hu, Xi),
et donc |φX (u)| ≤ 1.

Pour montrer la continuité, considérons une suite up →p→∞ u. Il y a convergence


simple de ei hup ,Xi vers ei hu,Xi . Comme ces variables aléatoires sont de module
borné par 1, nous pouvons appliquer le théorème de convergence dominée (Théorème
p→∞
6.7), et obtenir que φX (up ) −→ φX (u). Ainsi, la fonction φX est continue. 
7.1 – La fonction caractéristique 135

Proposition 7.3 Si X est un vecteur aléatoire à valeurs dans Rn , si a ∈ Rm et si


A est une matrice de taille m × n, nous avons :

φa+AX (u) = ei hu,ai φX (At u), ∀u ∈ Rm , (7.3)

où At désigne la transposée de la matrice A.

t
Preuve. Nous avons ei hu,a+AXi = ei hu,ai ei hA u,Xi . En effet, hu, AXi = hAt u, Xi.
Il suffit alors de prendre les espérances pour obtenir le résultat. 

7.1.2 Exemples

1) X suit une loi binomiale B(n, p)


n   n  
X n k X n
E(eiuX ) = eiuk p (1 − p)n−k = (eiu p)k (1 − p)n−k
k k
k=0 k=0
iu n
= (e p + 1 − p) .

Ainsi,

φX (u) = (peiu + 1 − p)n . (7.4)

2) X suit une loi de Poisson de paramètre θ


X θk −θ iu iu
E(eiuX ) = eiuk e = eθe e−θ = eθ(e −1) .
k!
k≥0

Ainsi,
iu
−1)
φX (u) = eθ(e . (7.5)

3) X suit une loi uniforme sur [a, b]


Z b
1 1 1 iux b eiub − eiua
φX (u) = eiux dx = [e ]a = .
b−a a b − a iu iu(b − a)
Ainsi, pour une loi uniforme sur [−a, a], a > 0,
sin ua
φX (u) = .
ua
136 Chapitre 7 – Fonctions caractéristiques et convergence en loi

4) X suit une loi exponentielle de paramètre λ > 0


Z +∞ Z +∞
λ λ
φX (u) = λ e−λx eiux dx = λ e(iu−λ)x dx = [e(iu−λ)x ]+∞
0 = .
0 0 iu − λ λ − iu
Ainsi,
λ
φX (u) = .
λ − iu

5) X suit une loi Γ(α, θ)


Z +∞ Z +∞
θα iux α−1 −θx θα θα
φX (u) = e x e dx = e(iu−θ)x xα−1 dx = .
Γ(α) 0 Γ(α) 0 (θ − iu)α
Ainsi,
θα
φX (u) = . (7.6)
(θ − iu)α

6) X suit une loi normale N (0, 1)

2
Appelons g la densité normale (ou gaussienne) définie par g(x) = √1

e−x /2
. Nous
constatons tout d’abord que pour tout réel s,
Z +∞
2
esx g(x) dx = es /2 , (7.7)
−∞
2
puisque g(x) esx = g(x − s) es /2 . Nous voulons montrer que (7.7) reste vraie pour
s complexe. En développant en série entière de s les deux membres de cette égalité,
nous pouvons facilement justifier que
Z +∞ ∞ ∞
sn +∞ n s2n
Z
X 2 X
sx
e g(x)dx = x g(x)dx ; es /2 = .
−∞ n=0
n! −∞ n=0
2n n!

Par identification des coefficients de sn , nous en déduisons les moments de g,


Z +∞ Z +∞
(2n)!
x2n+1 g(x)dx = 0 ; x2n g(x)dx = n .
−∞ −∞ 2 n!
Ce résultat peut aussi s’obtenir par intégration par parties et un calcul direct des
intégrales. Le rayon de convergence de la série entière étant infini, nous déduisons de
ces résultats que si s est complexe, les développements de Taylor des deux membres
de (7.7) sont encore égaux, et donc que

2
φX (u) = e−u /2
. (7.8)
7.1 – La fonction caractéristique 137

Remarque 7.4 Au cours de la preuve précedente, nous avons obtenu les moments
d’une variable aléatoire X de loi normale centrée réduite,

(2n)!
E(X 2n ) = ; E(X 2n+1 ) = 0.
2n n!
Par exemple, E(X 4 ) = 3.

7) X suit une loi normale N (m, σ 2 )

Dans ce cas, la v.a. X s’écrit X = m + σY , où Y suit la loi N (0, 1). D’après (7.3) et
(7.8), sa fonction caractéristique vaut alors
2
σ 2 /2
φX (u) = eium−u . (7.9)

7.1.3 Propriété fondamentale

L’intérêt majeur de la fonction caractéristique réside dans le fait qu’elle caractérise la


loi de la variable aléatoire.

Théorème 7.5 La fonction caractéristique φX caractérise la loi du vecteur aléatoire


X. Ainsi, si deux vecteurs aléatoires X et Y ont même fonction caractéristique, ils
ont même loi.

Preuve. La preuve montre que la transformée de Fourier d’une probabilité sur Rn


caractérise cette probabilité. Introduisons, pour σ > 0, les fonctions

1 2 2 2 2
fσ (x) = e−|x| /2σ et fˆσ (u) = e−|u| σ /2 .
(2πσ 2 )n/2

Alors fσ (x) est la densité d’un vecteur aléatoire composé de n coordonnées


indépendantes et de loi N (0, σ 2 ). Nous avons
n n
−x2j
Z Z  
Y 1 Y 2 2
ihu,xi
fσ (x)e dx = √ exp + iuj xj dx1 · · · dxn = e−uj σ /2
= fˆσ (u),
Rn Rn j=1
σ 2π 2σ 2 j=1

par le théorème de Fubini.


u−v
1
fˆ ( u−v ) 1
fσ (x)eih ,xi
R
Remarquons ainsi que fσ (u−v) = (2πσ 2 )n/2 σ σ 2
= (2πσ 2 )n/2 Rn
σ2 dx.
138 Chapitre 7 – Fonctions caractéristiques et convergence en loi

Considérons deux vecteurs aléatoires X et Y de même fonction caractéristique. Mon-


trons qu’ils ont même loi : PX = PY . Nous avons (en utilisant le théorème de Fubini)
que
Z Z Z 
1 ih u−v ,xi
fσ (u − v)PX (du) = 2 n/2
f σ (x)e σ2 dx PX (du)
Rn Rn (2πσ ) Rn
Z
1 x −v
= fσ (x) 2 n/2
φX ( 2 )eih σ2 ,xi dx,
Rn (2πσ ) σ
et la même égalité reste vraie pour PY . Nous en déduisons que
Z Z
g(x)PX (dx) = g(x)PY (dx), (7.10)
Rn Rn

pour toute fonction g de l’espace vectoriel des fonctions engendrées par u 7→ fσ (u−v).
Nous pouvons appliquer le théorème de Stone-Weierstrass pour montrer que cet en-
semble est dense dans l’ensemble des fonctions continues sur Rn qui tendent vers 0
à l’infini, muni de la convergence uniforme. L’égalité (7.10) reste vraie pour de telles
fonctions. Un argument de théorie de la mesure montre que cela suffit pour en déduire
que PX = PY . 

Corollaire 7.6 Soit X = (X1 , . . . , Xn ) un vecteur aléatoire à valeurs dans Rn . Les


composantes Xi sont indépendantes si et seulement si pour tous u1 , . . . , un ∈ R
n
Y
φX (u1 , . . . , un ) = φXj (uj ), (7.11)
j=1

où φX désigne la fonction caractéristique du vecteur aléatoire X, et φXj celle de la


composante Xj , pour chaque j.

Pn
Preuve. Nous avons hu, Xi = j=1 uj Xj . Si les Xi sont indépendantes et comme
ei hu,Xi = j ei uj Xj , nous obtenons immédiatement (7.11), en utilisant (4.18).
Q

Supposons inversement qu’on ait (7.11). Nous pouvons alors construire des variables
aléatoires Xj0 indépendantes, telles que Xj0 et Xj aient mêmes lois pour tout j et donc
telles que φXj0 = φXj . Si X 0 = (X10 , . . . , Xn0 ), alors, en utilisant la condition nécessaire
et (7.11), nous en déduisons que φX 0 = φX . Ainsi, X et X 0 ont même loi, ce qui
entraı̂ne que pour tous boréliens Aj ,
\ \ Y Y
P( {Xj ∈ Aj }) = P( {Xj0 ∈ Aj }) = P(Xj0 ∈ Aj ) = P(Xj ∈ Aj ),
j j j j

d’où l’indépendance cherchée. 


7.1 – La fonction caractéristique 139

La transformée de Laplace : Lorsque X est une v.a. à valeurs dans R+ , nous


pouvons définir sa transformée de Laplace par

ψX (λ) = E e−λX ,

λ ∈ R+ . (7.12)

C’est une fonction définie sur R+ , indéfiniment dérivable sur ]0, ∞[, et qui satisfait
formellement ψX (λ) = φX (iλ). Ainsi, il n’est pas étonnant que la transformée de La-
place ait des propriétés analogues à celles de la fonction caractéristique. En particulier,
elle caractérise la loi PX .

Si de plus X est une v.a. à valeurs dans N, de fonction génératrice GX , alors ψX (λ) =
GX (e−λ ).

Exemple 7.7 Transformée de Laplace d’une loi gamma. Soit X une variable
aléatoire de loi Γ(α, θ). Alors,

+∞ +∞
θα
Z Z
1 α 1 α
ψX (λ) = θ e−λx xα−1 e−θx dx = θ e−(λ+θ)x xα−1 dx = .
Γ(α) 0 Γ(α) 0 (λ + θ)α
(7.13)

En particulier la transformée de Laplace d’une v.a. de loi exponentielle de paramètre


θ
θ, prise en λ, vaut λ+θ .

7.1.4 Somme de vecteurs aléatoires indépendants

Proposition 7.8 Si X et Y sont deux vecteurs aléatoires indépendants à valeurs


dans Rn , la fonction caractéristique de la somme X + Y est donnée par

φX+Y = φX φY . (7.14)

Preuve. Comme ei hu,X+Y i = ei hu,Xi ei hu,Y i , il suffit d’appliquer (4.18). 

Exemple 7.9 Soient X, Y deux v.a. réelles indépendantes, et Z = X + Y :


140 Chapitre 7 – Fonctions caractéristiques et convergence en loi

1) si X suit loi normale N (m, σ 2 ) et Y suit une loi N (m0 , (σ 0 )2 ), alors Z suit une
loi N (m + m0 , σ 2 + (σ 0 )2 ) ;

Cela découle de (7.9) et (7.14).

2) si X et Y suivent des lois de Poisson de paramètres θ et θ0 , alors Z suit une loi


de Poisson de paramètre θ + θ0 ;

Cela découle de (7.5) et (7.14).

3) si X suit une loi binomiale B(n, p) et Y suit une loi B(m, p), alors Z suit une loi
B(n + m, p) ;

Cela découle de (7.4) et (7.14).

4) si X suit une loi Γ(α, θ) et Y suit une loi Γ(α, θ0 ), alors Z suit une loi Γ(α+α0 , θ) ;

Cela découle de (7.6) et (7.14).

7.1.5 Fonction caractéristique et moments

Proposition 7.10 Soit X un vecteur aléatoire de Rn . Si la v.a. |X|m (où |x| désigne
la norme euclidienne du vecteur x) est dans L1 pour un entier m, la fonction φX est
m fois continûment différentiable sur Rn , et pour tout choix des indices i1 , . . . , im ,

∂m  
φX (u) = im E ei hu,Xi Xi1 Xi2 · · · Xim (7.15)
∂ui1 ∂ui2 · · · ∂uim

(les Xj sont les composantes de X).

En prenant u = 0 ci-dessus, cette formule permet de calculer E (Xi1 Xi2 · · · Xim ) en


fonction des dérivées à l’origine de φX . Par exemple, si X est à valeurs réelles et est
intégrable (respectivement de carré intégrable), nous avons

E(X) = −i φ0X (0), (resp. E(X 2 ) = −φ00X (0) ). (7.16)

Preuve. Prouvons le résultat quand m = 1, le cas général se montrant de la même


manière, par récurrence sur m. Soit vj = (0, . . . , 0, 1, 0, . . . , 0) le j ième vecteur de base
7.2 – Vecteurs gaussiens 141

de Rn . Nous avons
i tXj
 
φX (u + tvj ) − φX (u) i hu,Xi e −1
= E e . (7.17)
t t
Soit tp une suite de réels tendant vers 0. Les v.a. (ei tp Xj − 1)/tp convergent sim-
plement vers iXj , en restant bornées en module par la v.a. |Xj | (car |eitx − 1| =
2| sin(tx/2)| ≤ |tx|), qui par hypothèse est intégrable. Donc par le théorème 6.7 (de
Lebesgue), nous en déduisons que (7.17) converge vers i E(ei hu,Xi Xj ) quand t tend
vers 0. Nous en déduisons que la première dérivée partielle de φX par rapport à uj
existe et est donnée par la formule (7.15). Enfin, nous pouvons montrer comme dans
la Proposition 7.2 que cette dérivée est continue. 

7.2 Vecteurs gaussiens


n
Définition 7.11 Un vecteur aléatoire X = (X1 , . . . , X Pnn) à valeurs dans R est appelé
un vecteur gaussien si toute combinaison linéaire j=1 aj Xj = ha, Xi, pour a =
(a1 , . . . , an ) ∈ Rn , suit une loi normale (avec la convention que la masse de Dirac au
point m est la “loi normale” N (m, 0)).

Cela entraı̂ne bien entendu que chaque composante Xj suit elle-même une loi normale.

Exemple 7.12 Si les Xi sont des v.a. normales indépendantes, le vecteur X est
gaussien (cela découle de l’exemple 7.9 (1)).

Contre-exemple Si les composantes Xi sont de loi normale mais pas indépendantes,


il se peut que X ne soit pas un vecteur gaussien. Prenons par exemple X1 de loi
N (0, 1), et
si |X1 | ≤ 1
(
X1
X2 =
−X1 sinon.
Alors X2 suit également la loi N (0, 1), mais X = (X1 , X2 ) n’est pas un vecteur
gaussien, puisque 0 < P(X1 + X2 = 0) < 1 (donc X1 + X2 ne suit pas une loi
normale).

Théorème 7.13 X est un vecteur gaussien si et seulement si sa fonction ca-


ractéristique s’écrit
1
φX (u) = ei hu,mi− 2 hu,Cui , (7.18)
142 Chapitre 7 – Fonctions caractéristiques et convergence en loi

où m ∈ Rn et C est une matrice de taille n × n symétrique positive ; dans ce cas,


m = E(X) (i.e. mj = E(Xj ) pour chaque j), et C est la matrice de covariance de X.

Preuve.
P a) Condition suffisante : supposons (7.18). Pour toute combinaison linéaire
Y = j aj Xj = ha, Xi, et pour v ∈ R, nous avons
v2
φY (v) = φX (va) = ei v hm,ai− 2 ha,Cai
,
donc Y suit la loi N (ha, mi, ha, Cai).

b) Condition nécessaire : Soit C la matrice de covariance de X et m son vecteur


moyenne. Notons que ces quantités existent, car chaque P
composante Xj étant de loi
n
normale, elle est de carré intégrable. Si Y = ha, Xi = j=1 aj Xj avec a ∈ Rn , un
calcul simple montre que
E(Y ) = ha, mi, Var(Y ) = ha, Cai.
Par hypothèse, Y suit une loi normale, donc vu ce qui précède, sa fonction ca-
ractéristique est
v2
φY (v) = ei v ha,mi− 2 ha,Cai
.
Mais φY (1) = φha,Xi (1) = E(ei ha,Xi ) = φX (a), d’où (7.18). 

Corollaire 7.14 Si X est un vecteur gaussien, ses composantes sont indépendantes


si et seulement si sa matrice de covariance est diagonale.

Attention : ce résultat peut être faux si X n’est pas gaussien (prendre le contre-
exemple précédent).

Preuve. Il suffit de combiner (7.18) et le corollaire 7.6. 

Proposition 7.15 Soit X un vecteur gaussien à valeurs dans Rn , de moyenne m.


Il existe des variables aléatoires réelles indépendantes Y1 , . . . , Yn de lois normales
N (0, λj ) avec λj ≥ 0 (si λj = 0 on convient que Yj = 0) et une matrice orthogonale
A telles que X = m + AY , où Y = (Y1 , . . . , Yn ).

Preuve. Comme C est une matrice symétrique positive (cf. Proposition 4.26), il existe
une matrice orthogonale A et une matrice diagonale L dont les éléments diagonaux
7.2 – Vecteurs gaussiens 143

vérifient λj ≥ 0, et telle que la matrice de covariance de X s’écrive C = ALAt . Soit


Y = At (X − m). Alors Y est un vecteur gaussien de covariance C0 = At CA = L et
de moyenne nulle. Les composantes Yj de Y répondent à la question. 

Proposition 7.16 Le vecteur gaussien X admet une densité sur Rn si et seulement


si sa matrice de covariance C est non-dégénérée (ou inversible, ou de valeurs propres
toutes strictement positives). Dans ce cas cette densité est donnée par
1 1 −1
fX (x) = p e− 2 hx−m,C (x−m)i
. (7.19)
(2π)n/2 det(C)

Preuve. Reprenons la preuve de la proposition précédente : les λj qui y paraissent


sont les valeurs propres de C.

Si λj > 0 pour tout j, le vecteur aléatoire Y admet la densité suivante sur Rn :


n
Y 1 2
fY (y) = p e−yj /(2λj ) .
j=1
2πλj

Comme X = m + AY , nous en déduisons que X admet la densité donnée par (7.19).

Si au contraire C n’est pas inversible, il existe a ∈ Rn tel que a 6= 0 et Ca = 0. La


v.a. réelle Z = hX, ai a pour variance ha, Cai = 0 et pour moyenne z = hm, ai,
donc P(Z = z) = 1. Ainsi, avec une probabilité 1, le vecteur X est dans un hyperplan
H orthogonalRà a, i.e. P(X ∈ H) = 1. Or, si X admettait la densité f , nous aurions
P(X ∈ H) = H f (x)dx, donc P(X ∈ H) = 0 puisque le “volume” de l’hyperplan H
est nul. 

Définition 7.17 On appelle v.a. de χ2 (chi-deux) à d degrés de liberté toute


v.a. positive qui a même loi que la somme de d carrés de variables aléatoires de loi
normale N (0, 1) indépendantes.

L’intérêt de cette loi provient essentiellement de son utilisation massive en statis-


tique (voir chapitres 9-10), puisqu’elle permet de construire un test (appelé test du
chi-deux), fondamental pour “savoir” (statistiquement parlant) si une v.a. suit une
certaine loi donnée a priori ou si deux v.a. sont indépendantes.

Grâce à l’exemple 5.27 et la proposition 5.34, nous obtenons immédiatement que la


loi du χ2 à d degrés de liberté est la loi Γ(d/2, 1/2) de densité définie sur R+ par
1
exp(−y/2) y d/2−1 . (7.20)
2d/2 Γ(d/2)
144 Chapitre 7 – Fonctions caractéristiques et convergence en loi

En utilisant la définition, nous obtenons immédiatement que si Y suit une loi de χ2


à d degrés de liberté, alors
E(Y ) = d , Var(Y ) = 2d. (7.21)

7.3 Convergence en loi

Nous allons introduire maintenant une nouvelle notion de convergence de suites de


variables aléatoires. (Nous renvoyons au Chapitre 5 pour les définitions des différentes
notions de convergence déjà introduites.)

La convergence en loi définie dans ce paragraphe va concerner les lois des variables
aléatoires. Elle signifiera que les lois sont asymptotiquement “proches”, sans que les
variables aléatoires elles-mêmes le soient nécessairement. Nous verrons également que
toutes les convergences introduites au Chapitre 6 entraı̂nent la convergence en loi.

Considérons des vecteurs aléatoires Xn et X, tous à valeurs dans le même espace Rd ,


mais pouvant éventuellement être définis sur des espaces de probabilité différents.

Définition 7.18 Nous dirons que la suite (Xn )n converge en loi vers X, et nous
L
écrirons Xn → X, si pour toute fonction f continue bornée sur Rd ,
n→∞
E(f (Xn )) −→ E(f (X)).

Exemple 7.19 Un cas très simple est celui où toutes les v.a. Xn ont un nombre
fini de valeurs {xi , 1 ≤ i ≤ N }. Alors, la suite (Xn )n converge en loi vers X si et
seulement si
lim P(Xn = xi ) = P(X = xi ) ∀ 1 ≤ i ≤ N.
n

Il suffit d’écrire
N
X
E(f (Xn )) = f (xi ) P(Xn = xi ).
i=1

Dans l’exemple ci-dessus, N est fini et fixé. Mais nous avons une définition ana-
logue (en faisant tendre N vers l’infini), si les variables aléatoires ont un nombre
dénombrable de valeurs. Au paragraphe 3.4.4, nous avons montré la convergence en
loi d’une suite de variables aléatoires binomiales vers une v.a. de Poisson, pour un
bon choix des paramètres.
7.3 – Convergence en loi 145

Exemple 7.20 Soient (Xn )n et X des variables aléatoires de lois respectives


N (0, σn2 ) et N (0, σ 2 ), pas forcément définies sur le même espace de probabilité. Nous
supposons que la suite de réels positifs (σn )n converge vers σ > 0, quand n tend vers
l’infini. Alors la suite (Xn )n converge en loi vers X. En effet, soit f une fonction
continue bornée sur R. Nous avons
Z
1 2 2
E(f (Xn )) = f (y) √ e−y /2σn dy
2πσn
Z
1 2 2
−→ f (y) √ e−y /2σ dy = E(f (X)).
n→∞ 2πσ
Cette convergence est justifiée par le théorème de convergence dominée.

La convergence en loi est plus faible que la convergence en probabilité.

P L
Proposition 7.21 Si Xn →n→∞ X, alors Xn →n→∞ X.

Ainsi, les convergences en moyenne et presque-sûre entraı̂nent également la conver-


gence en loi, par la proposition 6.9.

Preuve. Supposons que la suite (Xn )n converge en probabilité vers X. Soit f une
fonction continue bornée sur Rd . D’après la proposition 6.13, la suite (f (Xn ))n
converge en probabilité vers f (X), et comme f est bornée, la proposition 6.10 en-
traı̂ne que f (Xn ) converge aussi en moyenne vers f (X). En particulier, (E(f (Xn )))n
converge vers E(f (X)). 

Proposition 7.22 Soient Xn et X des v.a. réelles de fonctions de répartition res-


L n→∞
pectives Fn et F . Pour que Xn → X il faut et il suffit que Fn (x) −→ F (x) pour
tout x en lequel F est continue.

Notons que puisque la fonction F est continue à droite et croissante, l’ensemble


des points où F est continue est l’ensemble D = {x : F (x−) = F (x)}, et son
complémentaire est au plus dénombrable. Ainsi, D est dense dans R.

L
Preuve. a) Supposons d’abord que Xn → X. Soit a avec F (a−) = F (a). Pour tout
?
p ∈ N et tout b ∈ R, il existe une fonction fp,b continue bornée sur R telle que

1]−∞,b] ≤ fp,b ≤ 1]−∞,b+1/p] . (7.22)


146 Chapitre 7 – Fonctions caractéristiques et convergence en loi

Alors (E(fp,b (Xn )))n converge vers E(fp,b (X)) quand n tend vers l’infini. De (7.22),
nous déduisons d’abord que Fn (a) = P(Xn ≤ a) ≤ E(fp,a (Xn )) et E(fp,a (X)) ≤ F (a+
1 1
p ) ; donc lim supn Fn (a) ≤ F (a + p ) pour tout p, donc aussi lim supn Fn (a) ≤ F (a).
Nous avons également que Fn (a) ≥ E fp,a−1/p (Xn ) et E fp,a−1/p (X) ≥ F (a − p1 ) ;
 

donc lim inf n Fn (a) ≥ F (a − p1 ) pour tout p, donc aussi lim inf n Fn (a) ≥ F (a) puisque
n→∞
F (a−) = F (a). Ces deux résultats impliquent que Fn (a) −→ F (a).
n→∞
b) Inversement, supposons que Fn (x) −→ F (x) pour tout x ∈ T , où T est une partie
dense de R. Soit f une fonction continue bornée sur R et ε > 0. Soient a, b ∈ T avec
F (a) ≤ ε et F (b) ≥ 1 − ε. Il existe n0 tel que

n ≥ n0 ⇒ P(Xn ∈
/ ]a, b]) = 1 − Fn (b) + Fn (a) ≤ 3ε. (7.23)

La fonction f est uniformément continue sur [a, b], donc il existe un nombre fini de
points a0 = a < a1 < · · · < ak = b appartenant tous à T et tels que |f (x) − f (ai )| ≤ ε
si ai−1 ≤ x ≤ ai . Donc
Xk
g(x) = f (ai )1]ai−1 ,ai ] (x)
i=1

vérifie |f − g| ≤ ε sur ]a, b]. Si M = supx |f (x)|, il vient alors

|E (f (Xn )) − E (g(Xn )) | ≤ M P(Xn ∈/ ]a, b]) + ε, (7.24)


Pk
et de même pour X. Enfin E (g(Xn )) = i=1 f (ai )(Fn (ai ) − Fn (ai−1 )), et de même
pour X, par définition de g. Comme (Fn (ai ))n converge vers F (ai ) pour tout i, nous
en déduisons l’existence de n1 tel que

n ≥ n1 ⇒ |E (g(Xn )) − E (g(X)) | ≤ ε. (7.25)

D’après (7.23), (7.24) et (7.25), nous avons

n ≥ sup(n0 , n1 ) ⇒ |E (f (Xn )) − E (f (X)) | ≤ 3ε + 5M ε.

ε étant arbitraire, nous en déduisons que (E(f (Xn )))n converge vers E (f (X)), d’où
le résultat. 

Corollaire 7.23 : Si la suite (Xn )n de variables aléatoires réelles converge en loi


vers X, et si la loi de X a une densité, alors pour tous a < b,
n→∞
P(Xn ∈]a, b]) −→ P(X ∈]a, b]).

Preuve. : La fonction de répartition de X est alors continue en tout point. (Mais pas
nécessairement celles des variables aléatoires Xn .) 
7.3 – Convergence en loi 147

L
Proposition 7.24 Soient (Xn )n et X des variables aléatoires. Pour que Xn → X
n→∞
il faut et il suffit que E(f (Xn )) −→ E(f (X)) pour toute fonction f lipschitzienne
bornée.

Preuve. Il suffit de montrer que dans la preuve de la proposition 7.22, nous pouvons
remplacer les fonctions continues bornées fp,b approchant 1]−∞,b] par des fonctions
lipschitziennes bornées, ce qui est immédiat. 

Proposition 7.25 (Théorème de Slutsky) Soient (Xn )n et (Yn )n deux suites de va-
riables aléatoires définies sur le même espace de probabilité. Supposons que (Xn )n
converge en loi vers X et que (Xn − Yn )n converge vers 0 en probabilité. Alors (Yn )n
converge en loi vers X.

Preuve. Grâce à la proposition 7.24, il suffit de montrer que limn E(f (Yn )) =
E(f (X)), pour toute fonction bornée lipschitzienne f . Nous avons alors |f (x)| ≤ k et
|f (x) − f (y)| ≤ C|x − y|, pour des constantes k et C. Soit ε > 0 donné. Nous écrivons
|E(f (Yn )) − E(f (Xn ))| ≤ E(|f (Yn ) − f (Xn )|)
≤ C ε + 2k P(|Xn − Yn | > ε).
Le deuxième terme du membre de droite tend vers 0 quand n tend vers l’infini, car
(Xn − Yn )n converge en probabilité vers 0. Comme ε est arbitrairement petit, nous
en déduisons que limn→∞ |E(f (Yn )) − E(f (Xn ))| = 0, d’où le résultat. 

Une généralisation de ce lemme est développée dans l’exercice 7.6.

Le théorème suivant caractérise la convergence en loi à l’aide des fonctions ca-


ractéristiques. C’est un critère extrêmement utile dans la pratique.

Théorème 7.26 (Théorème de Lévy) Soit (Xn )n une suite de vecteurs aléatoires à
valeurs dans Rd .

a) Si la suite (Xn )n converge en loi vers X, alors φXn converge simplement


vers φX .

b) Si les φXn convergent simplement vers une fonction (complexe) φ sur Rd , et si


cette fonction est continue en 0, alors c’est la fonction caractéristique d’une v.a. X
L
et Xn → X.

Preuve. (Nous ne démontrons pas (b), qui est assez difficile).


148 Chapitre 7 – Fonctions caractéristiques et convergence en loi

Pour obtenir (a), il suffit de remarquer que φXn (u) = E(gu (Xn )) et φX (u) =
E(gu (X)), où gu est la fonction continue bornée gu (x) = ei hu,xi et d’appliquer la
définition 7.18 (en séparant parties réelle et imaginaire). 

Ce théorème, plus les formules du premier paragraphe donnant les fonctions ca-
L
ractéristiques des lois usuelles, impliquent immédiatement que Xn → X dans les cas
suivants :
1) Xn suit B(m, pn ), X suit B(m, p), et pn → p.
2) Xn suit N (mn , σn2 ), X suit N (m, σ 2 ), et mn → m, σn2 → σ 2 .
3) Xn et X suivent des lois de Poisson de paramètres θn et θ, et θn → θ.
4) Xn et X suivent des lois exponentielles de paramètres λn et λ, et λn → λ.
Il permet aussi de prouver le lemme de Slutsky très rapidement, y compris pour des
vecteurs aléatoires.

Théorème 7.27 (Théorème de Slutsky) Soit (Xn )n et (Yn )n deux suites de vecteurs
aléatoires définies sur le même espace de probabilité à valeurs dans Rd . Supposons
que (Xn )n converge en loi vers X et que (Xn − Yn )n converge vers 0 en probabilité.
Alors (Yn )n converge en loi vers X.

Preuve. Soit u ∈ Rd . On a :

|φYn (u) − φX (u)| ≤ |φYn (u) − φXn (u)| + |φXn (u) − φX (u)|.

D’une part, le théorème de Lévy partie a) montre que |φXn (u) − φX (u)| tend vers 0
quand n → +∞. D’autre part

|φYn (u) − φXn (u)| = |E(eihu,Yn i − eihu,Xn i )| ≤ E(|eihu,Yn −Xn i − 1|)

tend vers 0 quand n → +∞ d’après la proposition 6.10. 

En conclusion de ce paragraphe, nous pouvons résumer dans la figure 6.1 les relations
entre les différents modes de convergence.

7.4 Le théorème de la limite centrale

Ce théorème est aussi connu sous le nom de théorème central limite. Plus simplement,
il apparaı̂t souvent sous l’abréviation TCL.
7.4 – Le théorème de la limite centrale 149

Relations entre modes de convergence


si dominée
Convergence Convergence
presque-sûre en Moyenne

Convergence
en Probabilité

Convergence
en Loi

Figure 7.1 – Relations entre les différentes notions de convergence

La situation est la même que dans le chapitre précédent concernant la loi des grands
nombres (Théorème 6.14). Nous considérons une suite de variables aléatoires (Xn )n
indépendantes, de même loi, et de carré intégrable. Notons m et σ 2 la moyenne
et la variance communes aux variables Xn , et

Sn = X1 + · · · + Xn (7.26)

(ainsi Mn = Snn ). Nous avons vu que Snn converge vers m, presque-sûrement et en


moyenne, et il est naturel de chercher la vitesse à laquelle cette convergence a lieu.

Pour évaluer cette vitesse, c’est-à-dire trouver un équivalent de Snn − m, nous sommes
amenés à étudier la limite éventuelle de la suite nα ( Snn − m) pour différentes valeurs
de α : si α est “petit” cette suite va encore tendre vers 0, et elle va “exploser” si α
est “grand”. On peut espérer que pour une (et alors nécessairement une seule) valeur
de α, cette suite converge vers une limite qui n’est ni infinie ni nulle.

Il se trouve que la réponse à cette question a un aspect “négatif” : la suite nα ( Snn −m)
ne converge au sens presque-sûr, ou même en probabilité, pour aucune valeur de α.
(Voir l’exercice 7.8). Elle a aussi un aspect “positif” : cette suite converge, au sens de
la convergence en loi, pour la même valeur α = 1/2 quelle que soit la loi des Xn , et
toujours vers une loi normale.

Ce résultat, qui peut sembler miraculeux, a été énoncé par Laplace (1749-1827) et
démontré beaucoup plus tard par Lyapounov (1901). Il montre le caractère univer-
150 Chapitre 7 – Fonctions caractéristiques et convergence en loi

sel de la loi normale (d’où son nom !). Il fait l’objet du théorème suivant, appelé
théorème central limite, ou de la limite centrale :

Théorème 7.28 Si les Xn sont des v.a. réelles indépendantes et de même loi, de
carré intégrable, de moyenne m et de variance σ 2 avec σ 2 > 0, alors les variables
Sn − nm

σ n
convergent en loi vers une v.a. de loi N (0, 1).


En d’autres termes, n( Snn − m) converge en loi vers une variable normale de loi
N (0, σ 2 ).

Preuve. Nous donnons ici une preuve fondée sur le théorème de Lévy. Une autre
preuve sera donnée dans l’exercice 7.7.

Soit φ la fonction caractéristique de Xn − m, et posons Yn = (Sn − nm)/(σ n).

Comme les Xn sont indépendantes et d’après (7.3), la fonction caractéristique de Yn


est  n
u
φn (u) = φ √ . (7.27)
σ n

Comme E(Xn − m) = 0 et E (Xn − m)2 = σ 2 , (7.15) entraı̂ne

u2 σ 2
φ(u) = 1 − + u2 o(|u|) quand u → 0.
2
Comme φ(0) = 1 et que φ est continue en 0, il est facile de voir que pour u fixé et n
assez grand,  
u
φ √ − 1 ≤ 1/2.
σ n
Il est possible de généraliser la notion de logarithme aux complexes z tels que |z −
1| ≤ 1/2. (Voir un cours d’analyse complexe.) La fonction ln z définie sur le disque
{z ∈ C : |z − 1| ≤ 1/2} admet le même développement limité au voisinage de z = 1
que le logarithme réel. Ainsi,
u2
 
1
φn (u) = exp n ln 1 − + εn (u) ,
2n n
où εn (u) tend vers 0 quand n tend vers l’infini, et nous en déduisons immédiatement
que φn (u) converge vers exp(−u2 /2). Le résultat découle alors du théorème 7.26. 
7.4 – Le théorème de la limite centrale 151

Remarque √ Si les Xi de l’énoncé du théorème 7.28 suivent des lois N (0, 1), alors
(Sn − nm)/ n suit une loi N (0, 1) pour tout n. Le théorème de la limite centrale
implique que la loi normale centrée réduite est la seule probabilité
√ Q sur R telle que
si les Xi sont de loi Q, il en est de même de (Sn − nm)/ n.

Exemple 7.29 Convergence des lois binomiales. Supposons que Sn suive une loi
binomiale B(n, p). Cela revient à dire que Sn a la même loi qu’une somme X1 +· · ·+Xn
de n variables aléatoires Xi indépendantes de loi B(1, p), i.e. P(Xi = 1) = p et
P(Xi = 0) = 1 − p. Nous savons alors que m = p et σ 2 = p(1 − p).

Nous voulons calculer P(Sn ≤ x) pour x fixé et n grand.

Si p est très petit, de sorte que θ = np ne soit pas trop grand (en pratique, θ ≤ 5
convient), nous pouvons utiliser l’approximation par une loi de Poisson, obtenue au
Chapitre 3. Si p est très proche de 1, de sorte que θ = n(1 − p) soit comme ci-dessus,
alors n − Sn suit à son tour une loi proche de la loi de Poisson de paramètre θ.

Dans les autres cas, nous utilisons les théorèmes précédents :


Sn P
→ p, (7.28)
n
S − np L
p n → N (0, 1). (7.29)
np(1 − p)

Si nous désignons par Φ la fonction de répartition de la loi N (0, 1), il vient


!
x − np
P(Sn ≤ x) ' Φ p . (7.30)
np(1 − p)

Rappelons que la fonction de répartition Φ ci-dessus est ”tabulée”, et une table de


cette fonction est fournie à la section 4.6.

EXERCICE 7.1 Lançons 1000 fois une pièce (que l’on suppose non truquée). Cher-
chons la probabilité d’obtenir plus de 545 fois le côté Face.

Solution : Bien sûr, le calcul exact utilisant les lois binomiales serait rébarbatif et
extrêmement lourd. Nous utilisons le théorème de la limite centrale et écrivons
  Z +∞
S1000 − 1000/2 45 1 −x2
P(S1000 > 545) = P √ >√ ' √ e 2 dx.
1000/2 1000/2 √ 90
1000

152 Chapitre 7 – Fonctions caractéristiques et convergence en loi

En utilisant la table numérique, nous obtenons

P(Sn > 545) ' 1 − Φ(2, 84) ' 0, 0023.

Le théorème 7.28 admet une version multidimensionnelle, de preuve similaire.


Considérons des vecteurs aléatoires Xn à valeurs dans Rd , indépendants et de même
loi, dont les composantes sont de carré intégrable. Nous avons ainsi un vecteur
moyenne m = E(Xn ), et une matrice de covariance C = (cij )di,j=1 avec cij = la
covariance des composantes i et j de Xn . Nous pouvons alors énoncer le TCL multi-
dimensionnel.

−nm
Théorème 7.30 Les vecteurs aléatoires Sn√ n
convergent en loi vers un vecteur
aléatoire gaussien centré (i.e. de moyenne nulle) et de matrice de covariance C.

Remarque 7.31 La vitesse de convergence est toujours en √1n , indépendante de la


dimension d. Cette remarque est fondamentale pour les applications numériques et
justifie l’importance des méthodes de Monte-Carlo dans le cas des grandes dimensions.

7.5 Exercices sur le chapitre 7

EXERCICE 7.2 Soient X et Y deux v.a. indépendantes de carré intégrable, de


même loi et centrées. Soit φ leur fonction caractéristique commune. On suppose que
la variable aléatoire X+Y

2
a même loi que X et Y . Montrer que ces variables sont
nécessairement de loi normale.

EXERCICE 7.3 Soit X une variable aléatoire de Cauchy.

1. Calculer la fonction caractéristique de X.


2. Montrer que φ2X = (φX )2 .

EXERCICE 7.4 Soient X et Y deux variables aléatoires indépendantes et a > 0.


7.5 – Exercices sur le chapitre 7 153

a −|x|a
1. La loi de X a pour densité 2e . Quelle est la fonction caractéristique de
X?
1
2. La loi de Y a pour densité y 2 1y≥1 .
X
Justifier que Y est définie presque-sûrement.
X
Calculer la fonction caractéristique de Y .

EXERCICE 7.5 Soit X un vecteur gaussien centré de Rd . Soit F un sous-espace


vectoriel de Rd .

Le but de l’exercice est de montrer que P(X ∈ F ) = 0 ou 1.

1. Soient X1 et X2 deux vecteurs indépendants de même loi que X.


Montrer que les ensembles A(θ), définis pour θ ∈ [0, π2 [ par

A(θ) = {ω, X1 (ω) cos θ + X2 (ω) sin θ ∈ F ; X1 (ω) sin θ − X2 (ω) cos θ ∈
/ F}

sont disjoints pour des θ différents.


2. 
Montrer que P(A(θ)) = P(A(0)), pour tout
 θ. Onmontrera que pour tout θ,
X1 cos θ + X2 sin θ X1
a même loi que .
X1 sin θ − X2 cos θ −X2
3. Montrer que P(A(0)) = 0. En déduire le résultat.

EXERCICE 7.6 Généralisation du théorème de Slutsky. Montrer que si deux suites


de variables aléatoires (Xn )n et (Yn )n sont telles que Xn converge en loi vers X et Yn
converge en probabilité vers une constante y, alors le couple (Xn , Yn ) converge en loi
vers (X, y).

En déduire que Xn + Yn et Xn Yn convergent en loi, respectivement vers X + y et Xy.

EXERCICE 7.7 Une autre preuve du théorème de la limite centrale (due à Linde-
berg).
154 Chapitre 7 – Fonctions caractéristiques et convergence en loi

Soit une suite (Xn )n de variables aléatoires indépendantes de carré


Pn intégrable, centrées
et de variance 1. Nous voulons prouver que la suite Tn = √1n i=1 Xi converge en loi
vers une variable aléatoire T de loi N (0, 1).

Préliminaire : Montrer que Tn converge en loi vers T dès que E(f (Tn )) converge vers
E(f (T)), pour f bornée de classe C 2 avec dérivées première et seconde bornées et
uniformément continues.

Soit (Yn )n une suite de variables aléatoires indépendantes


Pn de loi N (0, 1), indépendantes
de la suite (Xn )n . Nous savons qu’alors Tn0 = √1n i=1 Yi est de loi N (0, 1). Le but est
de montrer que |E(f (Tn ))−E(f (Tn0 ))| → 0, quand n tend vers l’infini, pour toute fonc-
tion f bornée de classe C 2 avec dérivées première et seconde bornées et uniformément
continues.

Xi Yi Pi−1 Pn
1. Notons Xi,n = √
n
, Yi,n = √
n
, et Wi,n = j=1 Yj,n + j=i+1 Xj,n .
Montrer que
n
X
f (Tn ) − f (Tn0 ) = (f (Wi,n + Xi,n ) − f (Wi,n + Yi,n )) . (7.31)
i=1

2. Montrer que
1
f (Wi,n + Xi,n ) = f (Wi,n ) + f 0 (Wi,n )Xi,n + f 00 (Wi,n )(Xi,n )2 + RX,i,n ,
2
et que pour tout ε > 0, il existe δ > 0, tel que
|RX,i,n | ≤ (Xi,n )2 ε1|Xi,n |≤δ + ||f 00 ||∞ 1|Xi,n |>δ .


3. En déduire que
|E(f (Tn )) − E(f (Tn0 ))| ≤ 2ε + ||f 00 ||∞ E X12 1|X1 |>δ√n + Y12 1|Y1 |>δ√n .


4. Conclure.

EXERCICE 7.8 Soient (Xj )j des variables aléatoires indépendantesP et de même


n
loi, de carré intégrable, avec E(X1 ) = 0, et E(X12 ) = σ 2 > 0. Soit Sn = i=1 Xi .

Sn
1. Montrer que √
n
ne converge pas en probabilité.
α Sn

2. Montrer que (n n − m )n converge en probabilité vers 0, (respectivement
vers +∞), quand α < 1/2, (respectivement α > 1/2).
Chapitre 8

Statistique : Estimation

Tout ce qui existe dans l’Univers est le fruit du hasard et de la nécessité.

Démocrite

La statistique est la science des données. Un statisticien travaille sur des données
(résultats d’un sondage, données météorologiques,...) et essaie de traiter des problèmes
de différents types :
- effectuer une prévision, par exemple sur le résultat d’une élection qui aura lieu pro-
chainement à partir d’un sondage,
- quantifier la certitude liée à une prévision, par exemple par une fourchette dans le
cas d’un sondage,
- répondre à une question comme “le candidat C sera-t-il élu”, “le réchauffement
climatique est-il réel ?”, “ce médicament est-il efficace ?”, pour aider à la prise de
décision, comme l’adoption de protocoles réduisant la production de CO2 ou la mise
sur le marché d’un nouveau médicament.
La première question peut être abordée dans le cadre de l’estimation statistique, la
seconde dans le cadre de la théorie des intervalles (ou des régions) de confiance, et la
troisième dans le cadre de la théorie des tests de décision. On va dans les chapitres qui
viennent donner quelques éléments de réponse pour chacune de ces questions. Dans
ce chapitre, on aborde la question de l’estimation ponctuelle.

155
156 Chapitre 8 – Statistique : Estimation

8.1 Introduction à l’estimation

Le but de l’estimation statistique est le suivant. On observe des réalisations d’un


phénomène aléatoire (sexe d’un nouveau-né, température ou pluviométrie journalière,
...) qu’on appelle observations. Ces observations sont des copies indépendantes et iden-
tiquement distribuées d’une loi inconnue qu’on cherche à retrouver. On se limitera au
cas paramétrique dans ce cours, c’est-à-dire qu’on supposera que cette loi appartient
à une famille connue de lois qui dépend d’un ou de plusieurs paramètres inconnus.
On souhaite déterminer, ou plus exactement estimer, la valeur de ce(s) paramètre(s),
à partir des observations.

Exemple 8.1 Le sexe, fille (F) ou garçon (G), d’un nouveau-né est modélisé par une
loi Pθ sur {F, G} de paramètre inconnu θ ∈ [0, 1], avec Pθ ({G}) = θ, resp. Pθ ({F }) =
1 − θ, la probabilité qu’une naissance donne un garçon, resp. une fille. On souhaite
connaı̂tre la proportion de garçons à la naissance. Ceci revient à chercher à estimer
θ. Pour estimer θ, on observe les sexes des n nouveaux-nés dans une maternité.

Exemple 8.2 La durée de vie d’une ampoule électrique produite par une usine est
modélisée par une loi exponentielle de paramètre λ ∈]0, +∞[. Pour estimer λ, on
laisse allumées n ampoules jusqu’à ce qu’elles grillent, on observe donc n durées de
vie, à partir desquelles on essaye d’estimer λ.

D’une manière générale, un modèle statistique est défini de manière similaire à un


espace de probabilité, à la différence essentielle près que le dernier élément du triplet
n’est pas une probabilité, mais une famille paramétrique de probabilités.

Définition 8.3 Un modèle statistique est un triplet (X , A, P) où X est l’espace fon-
damental (l’ensemble des valeurs possibles des observations), A est une tribu sur X , et
P est une famille de probabilités sur (X , A). Un modèle statistique est dit paramétrique
s’il existe un entier p et un ensemble Θ ⊂ Rp tels que la famille de probabilités P s’écrit
sous la forme :
P = {Pθ , θ ∈ Θ} ,
où, pour tout θ ∈ Θ, Pθ est une probabilité sur (X , A).

On notera génériquement θ le paramètre d’une famille paramétrique de probabi-


lités.

Exemple 8.4 Dans l’exemple 8.1, le modèle statistique associé est le triplet
({F, G}, P({F, G}), P) où :
P = {Pθ , θ ∈ [0, 1]} ,
8.1 – Introduction à l’estimation 157

et Pθ ({F }) = 1 − θ et Pθ ({G}) = θ. Ici Θ = [0, 1].

Exemple 8.5 Dans l’exemple 8.2, le modèle statistique est le triplet (R, B(R), P) où
P est l’ensemble des lois exponentielles :

P = {Pλ , λ ∈]0, +∞[} ,

et Pλ est la probabilité sur (R, B(R)) de densité pλ (x) = λe−λx 1]0,+∞[ (x), avec la
notation 1A (x) = 1 si x ∈ A et 0 sinon.

De manière générale, les observations forment un n-uplet de répliques indépendantes


et identiquement distribuées.

Définition 8.6 Un n-échantillon est un vecteur aléatoire X = (Xi )i=1,...,n de n v.a.


indépendantes et identiquement distribuées (i.i.d.) de même loi qui appartient au modèle
statistique.

Notation. Le vecteur aléatoire X = (Xi )i=1,...,n est défini sur un espace Ω qu’on
ne précisera pas (on peut cependant prendre pour Ω l’ensemble X n de tous les
échantillons de taille n possibles, et de ce fait, les observations peuvent être vues
comme une réalisation particulière d’un n-échantillon). On notera respectivement
Pθ (X ∈ A) et Eθ (f (X)) la probabilité de l’événement {X ∈ A} et l’espérance de
f (X) lorsque les variables Xi sont indépendantes et identiquement distribuées de loi
Pθ .

On observe un n-échantillon X. On souhaite construire à partir de cet échantillon


une quantité f (X) qui s’approche du paramètre inconnu θ. Une telle quantité est
appelée estimateur de θ et est souvent notée θ̂ n . Un estimateur ne dépend que de
l’échantillon X et ne dépend pas de θ, et est donc entièrement caractérisé par la
fonction déterministe f : X n → Θ.

Exemple 8.7 Dans l’exemple 8.1, on souhaite connaı̂tre la proportion de garçons à


la naissance. Le modèle statistique sous-jacent est ({F, G}, P({F, G}), P) avec P =
{Pθ , θ ∈ [0, 1]} l’ensemble des lois Pθ telles que Pθ ({G}) = θ. Pour estimer θ, on
observe toutes les naissances dans une maternité, et on note les résultats X1 , . . . , Xn ,
avec Xi = G si la ieme naissance donne un garçon, et Xi = F si c’est une fille. C’est
un n-échantillon de la loi Pθ . Un estimateur intuitif de θ est la proportion empirique
de garçons, c’est-à-dire le nombre de garçons observés divisé par le nombre total de
naissances :
n
Card(i = 1, . . . , n, Xi = G) 1X
θ̂n = = 1G (Xi ) .
n n i=1
158 Chapitre 8 – Statistique : Estimation

Cet estimateur
Pn est de la forme θ̂n = f (X1 , . . . , Xn ), avec f (x1 , . . . , xn ) =
(1/n) i=1 1G (xi ).

Exemple 8.8 Dans l’exemple 8.2, les temps de vie des n ampoules du lot sont des
variables aléatoires X1 , . . . , Xn indépendantes et identiquement distribuées, de loi ex-
ponentielle de paramètre λ inconnu. Notons X n la moyenne empirique :
n
1X
Xn = Xi ,
n i=1

dont on sait qu’elle est proche de l’espérance Eλ (X1 ) = 1/λ d’après la loi forte des
grands nombres. On peut donc proposer comme estimateur de λ : λ̂n = 1/X n , c’est-
Pn
à-dire λ̂n = f (X) avec f (x) = n/ i=1 xi . Cependant, on pourrait s’y prendre autre-
ment. Par exemple, en notant
 1 Xn −1/2
λ̌n = Xi2 ,
2n i=1
−1/2
on sait aussi que λ̌n est proche de 12 Eλ (X12 ) = λ d’après la loi forte des grands
nombres. Ceci montre que λ̂n et λ̌n sont tous les deux susceptibles de nous donner
une estimation raisonnable de λ (lorsque n est grand). La question est de savoir lequel
est le meilleur (une fois qu’on aura clarifié ce qu’on entend par bon).

Plus généralement, on peut s’intéresser à l’estimation de g(θ) où g : Θ → Rq .


En pratique, l’estimation de θ correspond au choix q = p et g(θ) = θ. Lorsque
p ≥ 2, l’estimation des q premières coordonnées de θ avec q < p correspond au choix
g(θ1 , . . . , θp ) = (θ1 , . . . , θq ).

L’exemple 8.1 est particulièrement simple, mais l’exemple 8.2 sur la durée de vie
d’une ampoule montre qu’on peut avoir plusieurs estimateurs raisonnables possibles.
De plus, il s’agit de savoir si l’estimateur proposé est “bon”. Pour répondre à cette
question, il faudra d’abord éclaircir ce que nous entendons par “bon estimateur”.

8.2 Qualités d’un estimateur

Souvent, le nombre d’observations n est suffisamment grand pour qu’on puisse


exploiter les propriétés limites, ou asymptotiques, des estimateurs (asymptotique dans
le sens n → +∞). C’est ici qu’interviennent les théorèmes limites introduits dans
les chapitres précédents. Dans ce paragraphe, on examine les qualités d’une suite
d’estimateurs (θ̂ n )n∈N∗ définis par une suite de fonctions fn : X n → Θ.
8.2 – Qualités d’un estimateur 159

Exemple 8.9 Dans l’exemple 8.1 on peut examiner la suite θ̂n = fn (X1 , . . . , Xn )
définie par la suite de fonctions :

{F, G}n → R ,
fn : Pn
(x1 , . . . , xn ) 7→ n1 i=1 1G (xi ) .

La propriété de convergence est essentielle.

Définition 8.10 [Convergence] On dit que θ̂ n est convergent si, pour tout θ ∈ Θ :
 
n→+∞
Pθ θ̂ n −→ θ = 1 .

La propriété de convergence dit que, si la taille de l’échantillon est suffisam-


ment grande, alors la valeur donnée par l’estimateur devient proche de θ lorsque
l’échantillon est tiré avec la loi Pθ . Il est important de réclamer que cette propriété
soit vérifiée pour tous les θ ∈ Θ, car on ne connaı̂t pas a priori la vraie valeur de θ
(celle avec laquelle les Xi ont été tirés).

Exemple 8.11 Dans l’exemple 8.1, sous Pθ , les variables aléatoires 1G (Xi ) sont des
variables i.i.d. de loi de Bernoulli de paramètre θ. L’application de la loi forte des
grands nombres prouve la convergence de l’estimateur proposé :
   n 
1X
Pθ lim θ̂n = θ = Pθ lim 1G (Xj ) = θ = 1 .
n→+∞ n→+∞ n
j=1

Définition 8.12 [Biais] Un estimateur est dit non-biaisé si Eθ (θ̂ n ) = θ pour tout θ ∈ Θ
et pour tout n ∈ N∗ .
Un estimateur est dit asymptotiquement non-biaisé si limn→+∞ Eθ (θ̂ n ) = θ pour tout
θ ∈ Θ.

Un estimateur non-biaisé est évidemment asymptotiquement non-biaisé.

Exemple 8.13 Dans l’exemple 8.1, on utilise successivement la linéarité de l’espérance


et le fait que l’espérance d’une v.a. de Bernoulli est égale à son paramètre pour écrire :
n
1X
Eθ (θ̂n ) = Eθ (1G (Xj )) = Eθ (1G (X1 )) = θ .
n j=1

L’estimateur θ̂n est donc non-biaisé.


160 Chapitre 8 – Statistique : Estimation

La propriété de non-biais est souvent recherchée, car elle stipule que l’estimateur est
bon en moyenne, mais elle est insuffisante. Pour qualifier un estimateur, on utilise le
risque quadratique moyen défini comme suit.

Définition 8.14 [Risque quadratique moyen] Si g : Θ → R, alors le risque quadratique


moyen d’un estimateur ĝn de g(θ) est la moyenne quadratique des écarts à la valeur à
estimer :
RQMθ (ĝn ) = Eθ (ĝn − g(θ))2 .
 

On peut donner une expression différente du risque quadratique moyen en développant


le carré :
RQMθ (ĝn ) =Eθ (ĝn − Eθ (ĝn ) + Eθ (ĝn ) − g(θ))2
 

=Eθ (ĝn − Eθ (ĝn ))2 + 2Eθ ĝn − Eθ (ĝn ) (Eθ (ĝn ) − g(θ))
   

2
+ (Eθ (ĝn ) − g(θ)) .
Le second terme du membre de droite est nul car Eθ [ĝn −Eθ (ĝn )] = Eθ (ĝn )−Eθ (ĝn ) =
0. Le risque quadratique moyen se décompose donc en une partie “variance” et une
partie “biais” :
2
RQMθ (ĝn ) = Varθ (ĝn ) + (Eθ (ĝn ) − g(θ)) . (8.1)
Si un estimateur est sans biais, son risque quadratique moyen est égal à sa variance.
Entre deux estimateurs, on choisira celui au risque le plus faible. Ainsi, de deux
estimateurs non-biaisés, on choisira celui de variance plus faible.

Exemple 8.15 Dans l’exemple 8.1, on utilise le fait que la variance de la somme de
v.a. indépendantes est égale à la somme des variances pour obtenir :
 1  θ(1 − θ)
RQMθ (θ̂n ) = Varθ θ̂n = Varθ 1G (X1 ) = ·
n n
On remarque que le risque décroı̂t avec n comme 1/n, résultat assez général qu’on va
retrouver dans la suite, mais pas toujours vrai.

Enfin, lorsque l’estimateur est convergent, on peut se poser la question de la forme


de ses fluctuations. On peut penser, d’après le théorème√de la limite centrale, que les
fluctuations d’un estimateur convergent sont d’ordre 1/ n et à statistique gaussienne
quand n → ∞. C’est souvent le cas, mais pas toujours comme on va le voir dans la
suite.

Définition 8.16 [Normalité asymptotique] Soit g : Θ → R. Un estimateur ĝn de g(θ)


est dit asymptotiquement normal s’il existe deux fonctions déterministes mn (θ) et σn (θ)
telles que, sous Pθ , la suite de variables aléatoires (ĝn − mn (θ))/σn (θ) converge en loi
quand n → +∞ vers une loi gaussienne centrée réduite.
8.3 – Estimateurs empiriques 161


Très souvent, mais pas toujours, mn (θ) = g(θ) et σn (θ) = σ(θ)/ n pour une
fonction σ(θ) qu’on appelle écart-type asymptotique (et σ 2 (θ) est appelée variance
asymptotique).

Exemple 8.17 Dans l’exemple 8.1, on utilise le théorème de la limite centrale pour
obtenir que, sous Pθ :
√ n→+∞ 
n(θ̂n − θ) −→ N 0, θ(1 − θ) ,

en loi. La variance asymptotique est ici σ 2 (θ) = θ(1 − θ).

8.3 Estimateurs empiriques

On considère ici un modèle statistique de la forme (R, B(R), P) associé à des


observations réelles. Il arrive très souvent que le modèle statistique considéré soit
(ou puisse être) paramétré par la moyenne et/ou la variance de la loi inconnue. Par
exemple, le modèle gaussien qu’on étudiera en détail rentre dans ce cadre :

P = N (µ, σ 2 ), µ ∈ R, σ 2 ∈]0, +∞[ .



(8.2)

On va introduire et discuter ici les estimateurs dits “empiriques” de ces quantités.

Proposition 8.18 (Estimateur de la moyenne) Soit (Xi )i=1,...,n un n-échantillon


d’un modèle statistique (R, B(R), P) dont les lois sont intégrables et dont le paramètre
θ contient la moyenne, i.e., il existe une fonction g : Θ → R telle que g(θ) est la
moyenne µθ de la loi Pθ . La moyenne empirique X n définie par :
n
1X
Xn = Xj , (8.3)
n j=1

est un estimateur de la moyenne qui satisfait les propriétés suivantes :


(i) X n est non-biaisé.
(ii) X n est convergent.
(iii) Si de plus les lois Pθ sont de carré intégrable, alors RQMθ (X n ) = σθ2 /n, avec
σθ2 la variance de la loi Pθ et X n est asymptotiquement normal, avec
√  n→∞
n X n − µθ −→ N (0, σθ2 ) ,

en loi.

Preuve. Il n’y a rien de nouveau dans cette proposition qui découle de la linéarité de
l’espérance, de la loi forte des grands nombres, et du théorème de la limite centrale.
162 Chapitre 8 – Statistique : Estimation

D’après la formule de Huygens, la variance d’une v.a. réelle X de carré intégrable


est donnée par :
Var(X) = E(X 2 ) − E(X)2 .

En copiant ce qu’on a fait pour l’estimateur de la moyenne, on peut proposer comme


estimateur du premier moment Pn la moyenne empirique X n , et comme estimateur du
second moment la somme n1 j=1 Xj2 . On obtient alors un estimateur de la variance,
noté V n :
n n  X n 2
1X 2 2 1X 2 1
Vn = Xj − X n = Xj − Xj , (8.4)
n j=1 n j=1 n j=1

qu’on appelle variance empirique. Cette somme peut se réécrire différemment.

Proposition 8.19 (Estimateur de la variance) Soit (Xi )i=1,...,n un n-échantillon


d’un modèle statistique (R, B(R), P) dont les lois sont de carré intégrable et dont le
paramètre θ contient la variance, i.e., il existe une fonction g : Θ → R telle que g(θ)
est la variance σθ2 de la loi Pθ . La variance empirique de l’échantillon est définie par :
n
1X
Vn = (Xj − X n )2 . (8.5)
n j=1

Cet estimateur de la variance vérifie les propriétés suivantes.


(i) L’estimateur est biaisé et asymptotiquement non-biaisé :

n−1 2
Eθ (V n ) = σθ .
n

(ii) L’estimateur est convergent.


(iii) Si les lois Pθ sont de quatrième moment fini, alors le risque quadratique moyen
de V n est d’ordre 1/n :

(4)
µθ − σθ4 1
RQMθ (V n ) = +O 2 ,
n n
(4)
où µθ = Eθ (X14 )−4Eθ (X1 )Eθ (X13 )+6Eθ (X12 )Eθ (X1 )2 −3Eθ (X1 )4 , et V n est asymp-
totiquement normal :
√ n→+∞ (4)
n(V n − σθ2 ) −→ N (0, µθ − σθ4 ) ,

en loi.
8.3 – Estimateurs empiriques 163

µ(4) est le moment centré d’ordre 4, dont la définition générale est, pour p ∈ N∗ et
une v.a. réelle X de moment d’ordre p fini :

µ(p) = E [(X − E(X))p ] .

En développant le polynôme (X − E(X))p , on peut aussi écrire que :


p  
(p)
X
p−j p
µ = (−1) E(X j )E(X)p−j .
j=0
j

On peut noter que le second moment centré µ(2) est égal à la variance σ 2 de X. Donc
µ(4) − σ 4 est la variance de la v.a. réelle X (2) = (X − E(X))2 :
 2 
(4) 4 (2) (2) (2)
µ − σ = Var(X ) = E X − E(X ) .

Preuve. Pour montrer que (8.4) et (8.5) sont équivalents, on part de la seconde
expression, et on développe les carrés :
n n n n
1X 1X 2 2X 2 1X 2 2 2
(Xj − X n )2 = Xj − Xj X n + X n = X − 2X n + X n
n j=1 n j=1 n j=1 n j=1 j
n
1X 2 2
= Xj − X n .
n j=1

On va maintenant calculer les deux premiers moments de cet estimateur. On com-


mence par introduire les v.a. X̃i = Xi −µθ (avec µθ = Eθ (X1 )), qui sont indépendantes
et identiquement distribuées, de moyenne 0 et de variance σθ2 . On a alors :
n  n 2 n  n 2
1X 1X 1X 2 1X
Vn = (X̃j + µθ )2 − X̃j + µθ = X̃ − X̃j . (8.6)
n j=1 n j=1 n j=1 j n j=1

Pour p entier, le peme moment de V n se développe en somme d’espérances de la forme


Eθ (X̃i1 · · · X̃i2p ). Il faut prendre soin de distinguer les indices ij qui sont égaux, parce
que, si une variable X̃ik apparaı̂t une seule fois dans le produit X̃i1 · · · X̃i2p , alors, par
Q
indépendance des variables X̃i , l’espérance Eθ (X̃i1 · · · X̃i2p ) = Eθ (X̃ik )Eθ ( j6=k X̃ij )
est nulle car Eθ (X̃ik ) = 0. Ainsi, pour les deux premiers moments, on obtient :
n n n n
1X 1 X 1X 1 X
Eθ (V n ) = Eθ (X̃j2 ) − 2 Eθ (X̃i X̃j ) = Eθ (X̃12 ) − 2 Eθ (X̃12 )
n j=1 n i,j=1 n j=1 n i=1
1 n−1 2
= Eθ (X̃12 ) − Eθ (X̃12 ) = σθ ,
n n
164 Chapitre 8 – Statistique : Estimation

n n n
2 1 X 2 2 2 X 2 1 X
Eθ (V n ) = Eθ ( X̃ i X̃ j ) − Eθ (X̃ X̃ X̃
i j k ) + Eθ (X̃i X̃j X̃k X̃l )
n2 i,j=1 n3 n4
i,j,k=1 i,j,k,l=1
1  2  
= Eθ (X̃14 ) + (n − 1)Eθ (X̃12 )2 − 2 Eθ (X̃14 ) + (n − 1)Eθ (X̃12 )2
n n
1  4 2 2

+ 3 Eθ (X̃1 ) + 3(n − 1)Eθ (X̃1 )
n
(n − 1)2 4 (n − 1)(n2 − 2n + 3)
= E θ ( X̃ 1 ) + Eθ (X̃12 )2
n3 n3
1  1
= Eθ (X̃12 )2 + Eθ (X̃14 ) − 3Eθ (X̃12 )2 + O 2 .
n n
On peut alors calculer le risque quadratique moyen :

2 Eθ (X̃14 ) − Eθ (X̃12 )2 1
RQMθ (V n ) = Eθ (V n ) − 2σθ2 Eθ (V n ) + σθ4 = +O 2 .
n n
En tenant compte du fait que X̃1 = X1 − µθ , on obtient le résultat annoncé.

Pour montrer la convergence, il faut se servir de l’expression (8.4) et utiliser la loi


forte des grands nombres sur chacun des deux termes du membre de droite :
n  X n 2
1X 2 1 n→+∞
Vn = X − Xj −→ Eθ (X12 ) − Eθ (X1 )2 avec probabilité 1 .
n j=1 j n j=1

Enfin, pour prouver la normalité asymptotique, on invoque le théorème de la limite


centrale pour prouver la convergence en loi suivante :
n
√ 1X 2  n→+∞ (4)
X̃i − σθ2 −→ N 0, µθ − σθ4 .

n
n i=1

On a :
n
√  √ 1 X 
n V n − σθ2 = n X̃j2 − σθ2 − Yn ,
n j=1
avec
n
√ 1 X 2
Yn = n X̃j .
n j=1

Or (Yn )n converge vers 0 en probabilité, car pour tout  > 0 :



 Eθ (Yn ) nVarθ (X1 ) n→+∞
Pθ |Yn | >  ≤ = −→ 0.
 n
En utilisant le théorème de Slutsky, on trouve alors que
√  n→+∞ (4)
n V n − σθ2 −→ N 0, µθ − σθ4 ,

8.3 – Estimateurs empiriques 165

en loi, comme annoncé. 

Il est facile de proposer un estimateur non-biaisé de la variance, il suffit de prendre


la variance empirique V n et de la multiplier par n/(n − 1) (si n ≥ 2). On obtient alors
l’estimateur appelé variance empirique non-biaisée dont les propriétés sont décrites
dans la proposition suivante.

Proposition 8.20 Soit (Xi )i=1,...,n un n-échantillon d’un modèle statistique dont les
lois sont de carré intégrable et dont le paramètre θ contient la variance, i.e., il existe
une fonction g : Θ → R telle que g(θ) est la variance σθ2 de la loi Pθ . La variance
empirique non-biaisée Vn est définie par :
n
1 X
Vn = (Xj − X n )2 . (8.7)
n − 1 j=1

C’est un estimateur de la variance qui satisfait les propriétés suivantes.


(i) Vn est non-biaisé : pour tout n ≥ 2, Eθ (Vn ) = σθ2 .
(ii) Vn est convergent.
(iii) Si les lois sont de quatrième moment fini, alors le risque quadratique moyen de
la variance empirique est d’ordre 1/n :
(4)
µθ − σθ4 1
RQMθ (Vn ) = + O( 2 ) ,
n n
et Vn est asymptotiquement normal :
√ n→+∞ (4)
n(Vn − σθ2 ) −→ N (0, µθ − σθ4 ) ,
en loi.

Noter que les risques quadratiques moyens de Vn et de V n sont les mêmes à l’ordre
1/n. C’est normal, car la différence entre ces deux estimateurs se situe au niveau√du
biais. Or le risque quadratique moyen d’ordre 1/n mesure une erreur d’ordre 1/ n,
il est donc complètement insensible au biais qui est plus petit, d’ordre 1/n.

Preuve. Le premier point découle de la linéarité de l’espérance et du fait que Vn =


n
n−1 V n .

Pour montrer le deuxième point, il faut utiliser l’expression :


 X n   X n 2
n 1 2 n 1
Vn = × X − × Xj .
n−1 n j=1 j n−1 n j=1

On applique la loi forte des grands nombres à chacun des crochets. Avec probabilité
1, le premier crochet converge vers Eθ (X12 ) et le second crochet converge vers Eθ (X1 ).
166 Chapitre 8 – Statistique : Estimation

Comme n/(n − 1) converge vers 1, on obtient que Vn converge vers Eθ (X12 ) − Eθ (X1 )2
avec probabilité 1, ce qui donne la convergence de l’estimateur.

Le troisième et dernier point découle du calcul suivant :


RQMθ (Vn ) = Eθ (Vn2 ) − 2σθ2 Eθ (Vn ) + σθ4 ,
et des développements des deux premiers moments de V n obtenus précédemment.
La convergence en loi s’obtient à partir du résultat correspondant pour V n et du
théorème de Slutsky. 

8.4 Méthode de substitution

On décrit ici une méthode générale de construction d’estimateurs convergents,


qu’on va appliquer sur des cas particuliers dans la suite. Soit (Xi )i=1,...,n un n-
échantillon d’un modèle statistique P = {Pθ , θ ∈ Θ}. Soit g : Θ → Θ0 ⊂ Rd
une fonction. On suppose qu’on dispose d’un estimateur convergent ĝn de g(θ). Si
φ : Θ0 → Θ00 ⊂ Rq est une fonction continue, alors φ(ĝn ) est un estimateur convergent
de φ(g(θ)) :  
n→+∞
Pθ φ(ĝn ) −→ φ(g(θ)) = 1 .
C’est une conséquence directe de la continuité de φ. La principale application de cette
méthode générale est la méthode des moments qu’on décrit ci-dessous.

8.5 Méthode des moments

Soit (Xi )i=1,...,n un n-échantillon d’un modèle statistique P = {Pθ , θ ∈ Θ}. L’ob-
jectif est de construire un estimateur convergent de θ. La méthode des moments
consiste à trouver une fonction g : Θ → Θ0 ⊂ Rd inversible et de fonction réciproque
continue et une fonction ψ : X → Rd telle que Eθ (|ψ(X1 )|) < ∞ et g(θ) peut s’écrire
comme l’espérance de ψ(X1 ) pour tout θ ∈ Θ :

g(θ) = Eθ ψ(X1 ) .
L’estimateur des moments de θ est alors
1 Xn 
θ̂ n = g −1 ψ(Xi ) .
n i=1

L’estimateur des moments estPconvergent car c’est un cas particulier de la méthode


n
de substitution. En effet, n1 i=1 ψ(Xi ) est un estimateur convergent de g(θ) =
Eθ (ψ(X1 )) d’après la loi forte des grands nombres, et g −1 est continue.
8.5 – Méthode des moments 167

Exemple 8.21 On considère le modèle statistique (R, B(R), P) avec P = {β(α, β), α, β ∈
]0, ∞[2 }. On rappelle que la loi β(α, β) sur (R, B(R)) est à densité (cf (5.17)) :
Γ(α + β) α−1
f (x) = x (1 − x)β−1 1]0,1[ (x).
Γ(α)Γ(β)
Ici le paramètre θ = (α, β) est de dimension 2. On désire estimer θ. Si X1 a pour loi
β(α, β), alors
α αβ
Eθ (X1 ) = = g et Eθ (X1 (1 − X1 )) = = h.
α+β (α + β)(α + β + 1)
D’une part, en inversant le système précédent, on trouve que
gh (1 − g)h
α= 2
et β = .
g−h−g g − h − g2
D’autre part, si (Xi )i=1,...,n est un n-échantillon de loi β(α, β), alors on peut
construire à l’aide de la loi forte des grands nombres des estimateurs convergents
de g et h :
n n
1X 1X
ĝn = Xi et ĥn = Xi (1 − Xi ).
n i=1 n i=1
On déduit de la méthode des moments que
ĝn ĥn (1 − ĝn )ĥn
α̂n = et β̂n =
ĝn − ĥn − ĝn2 ĝn − ĥn − ĝn2
sont des estimateurs convergents de α et β.

Exemple 8.22 On considère le modèle uniforme P = {Pθ , θ ∈]0, +∞[}, où Pθ est la
loi uniforme sur [0, θ]. Si X1 a pour loi Pθ , alors on a :
θ
Eθ (X1 ) = .
2
Par conséquent, si (Xi )i=1,...,n est un n-échantillon de loi Pθ , alors on peut construire
à l’aide de la loi forte des grands nombres un estimateur convergent de θ :
n
2X
θ̂n = Xi .
n i=1
Cet estimateur est non-biaisé, son RQM est
4 θ2
RQMθ (θ̂n ) = Varθ (θ̂n ) = Varθ (X1 ) = ,
n 3n
et il est asymptotiquement normal :
√  n→+∞
n θ̂n − θ −→ N (0, θ2 /3) .
On va voir ci-dessous qu’on peut en fait construire un bien meilleur estimateur de θ.
168 Chapitre 8 – Statistique : Estimation

8.6 Maximum de vraisemblance

Dans cette section on considère un modèle statistique P = {Pθ , θ ∈ Θ} et on


supposera :
- soit que pour tout θ ∈ Θ, la loi Pθ est discrète et à valeurs dans un même espace
X au plus dénombrable. On pose alors p(x, θ) = Pθ ({x}) pour tout x ∈ X . On pose
pour tout x = (x1 , . . . , xn ) ∈ X n :

pn (x, θ) = p(x1 , θ) · · · p(xn , θ),

qu’on appelle vraisemblance. À θ fixé, en tant que fonction de x, c’est la loi d’un
n-échantillon (Xi )ni=1 sous Pθ .
- soit que pour tout θ ∈ Θ, la loi Pθ est à densité par rapport à la mesure de Lebesgue
sur R. On note alors p(x, θ) la densité de la loi sous Pθ et pn (x, θ) la densité jointe
d’un n-échantillon, qu’on appelle vraisemblance.

Définition 8.23 On suppose que pour toute réalisation x = (x1 , . . . , xn ) d’un n-


échantillon X = (X1 , . . . , Xn ), il existe une unique valeur θ n (x) ∈ Θ qui maximise
la vraisemblance (vue comme fonction de θ) de la réalisation x :

θ n (x) = argmax pn (x, θ).


θ∈Θ

Alors l’estimateur θ̂ n = θ n (X) est appelé Estimateur du Maximum de Vraisemblance


(EMV) de θ.

L’EMV est le paramètre qui maximise la vraisemblance des données étant donné
le paramètre. On peut expliquer son principe par une interprétation bayésienne. Pour
simplifier la présentation, supposons provisoirement que X et Θ sont finis. Avant de
recueillir des données, on ne sait rien sur le paramètre θ, à part qu’il est dans Θ, donc
on peut considérer que le paramètre est une variable aléatoire discrète de loi uniforme
sur Θ. Dans ce cadre, on peut donc considérer que la loi jointe des données et du
paramètre est :
1
P (x, θ) = pn (x, θ) ,
card(Θ)
car pn (x, θ) est la loi d’un n-échantillon sachant le paramètre θ. Par le théorème de
Bayes, la loi du paramètre sachant les données est :
P (x, θ) X
P (θ|x) = , avec P (x) = P (x, θ 0 ),
P (x) 0 nθ ∈X

ce qui s’écrit donc :


pn (x, θ)
P (θ|x) = .
card(Θ)P (x)
8.6 – Maximum de vraisemblance 169

Le mode de cette loi, i.e. le paramètre θ le plus probable dans Θ sachant les données
x, est l’élément de Θ qui maximise P (θ|x), qui est aussi celui qui maximise pn (x, θ) :
c’est donc l’EMV.

Exemple 8.24 Dans le modèle de Bernoulli, X = {0, 1},



P = B(1, θ), θ ∈ [0, 1] ,

la vraisemblance est :
n
Y
pn (x, θ) = θ11 (xi ) (1 − θ)10 (xi ) ,
i=1

avec la notation 1a (x) = 1 si x = a et 0 sinon. Ceci s’écrit aussi :


n
pn (x, θ) = θxn (1 − θ)1−xn ,

(8.8)
Pn
avec xn = n1 i=1 xi . A x fixé, en tant que fonction de θ, on remarque que la vrai-
semblance est maximale lorsque la fonction θ 7→ θxn (1 − θ)1−xn est maximale. Le
maximum sur [0, 1] est unique et est atteint au point où la dérivée de la fonction s’an-
nule, en θ = xn . Le maximum de la vraisemblance redonne ici l’estimateur empirique.

Exemple 8.25 Dans le modèle gaussien

P = N (µ, σ 2 ), µ ∈ R, σ 2 ∈]0, ∞[ ,


la vraisemblance est
n
1  X (xi − µ)2 
pn (x, (µ, σ 2 )) = exp − . (8.9)
2
(2πσ ) n/2
i=1
2σ 2

On va voir ci-dessous que le maximum de vraisemblance, i.e., la position du maximum


de (µ, σ 2 ) 7→ pn (x, (µ, σ 2 )), est ici aussi l’estimateur empirique.

Comme la fonction logarithme est strictement croissante, il revient au même de


maximiser la vraisemblance θ 7→ pn (x, θ) ou de maximiser la log-vraisemblance θ 7→
ln (x, θ) définie par :

ln (x, θ) = ln pn (x, θ) .

On pose également l(x, θ) = ln p(x, θ) . Les calculs sont parfois plus aisés avec la
log-vraisemblance notamment parce que ln (x, θ) = l(x1 , θ) + · · · + l(xn , θ), ce qui
simplifie le calcul des dérivées.
170 Chapitre 8 – Statistique : Estimation

Exemple 8.26 On considère le modèle gaussien P = {N (µ, σ 2 ), µ ∈ R, σ 2 > 0}.


Pour tout x = (x1 , . . . , xn ) ∈ Rn , la vraisemblance est donnée par (8.9). Donc la
log-vraisemblance s’écrit

n n (xn − µ)2 + v n
ln (x, (µ, σ 2 )) = −
ln(2π) − ln(σ 2 ) − n ,
2 2 2σ 2
Pn Pn
en notant xn = n1 i=1 xi et v n = n1 i=1 (xi − xn )2 . A σ 2 > 0 fixé, on voit que la
log-vraisemblance est maximale pour µ = xn et vaut alors − n2 (ln(2π) + f (σ 2 )) avec

vn
f (s) = ln(s) + .
s
On cherche donc maintenant à minimiser f (s) pour s ∈]0, +∞[. Comme la dérivée
f 0 (s) = 1/s − v n /s2 est négative sur ]0, v n ] et positive sur [v n , +∞[, la fonction f
atteint son minimum en v n . On conclut donc que la log-vraisemblance est maximale en
(xn , v n ). Ainsi l’EMV de (µ, σ 2 ) est le couple moyenne empirique, variance empirique
(X n , V n ). Notons qu’on obtient également l’EMV en résolvant le système

∂ x −µ
 

 ln (x, (µ, σ 2 )) = 0  n n
 =0
∂µ ⇐⇒ σ2
∂ 2
 − n 1 − (xn − µ) + v n = 0
 
2

 l n (x, (µ, σ )) = 0 
∂(σ 2 ) 2 σ2 σ4

Comme E(µ,σ2 ) [(X n , V n )] = (µ, n−1 2


n σ ), l’EMV est un estimateur biaisé. Il est
convergent d’après la loi forte des grands nombres. Pour démontrer qu’il est asymp-
totiquement normal, on remarque que d’après la proposition 9.4 le vecteur aléatoire
Pn 2 Pn
(X n , V n ) a la même loi que ( n1 j=1 Xj , σn 2
j=2 Yj ) où (Yi )i=1,...,n est une suite de
variables indépendantes et identiquement distribuées suivant la loi gaussienne centrée
réduite indépendante de (Xi )i=1,...,n . On en déduit que :
n 
!
√  Xn loi √ 0
    1 X   
µ Xj µ
n − = n − − σ2 Y12 .
Vn σ2 n σ 2 Yj σ2 √
n
j=1

D’après le théorème de la limite centrale vectoriel, le premier terme du membre de


droite converge en loi vers la loi gaussienne centrée de matrice de covariance égale à
celle du vecteur (X1 , σ 2 Y12 ) c’est-à-dire
 2 
σ 0
C= .
0 2σ 4

Le second terme du membre de droite converge presque sûrement vers (0, 0). Par
le théorème de Slutsky (théorème 7.25), on conclut que l’Estimateur du Maximum
de Vraisemblance (X n , V n ) est asymptotiquement normal de matrice de covariance
asymptotique C.
8.6 – Maximum de vraisemblance 171

Exemple 8.27 On termine par un exemple apparemment simple, mais dans lequel
on voit que la normalité asymptotique n’est pas automatique. On considère à nouveau
le modèle uniforme P = {Pθ , θ ∈]0, +∞[}, où Pθ est la loi uniforme sur [0, θ]. La
vraisemblance d’un n-échantillon est alors :
n
Y
−n
1[0,θ] (xi ) = θ−n 1[0,+∞[
 
pn (x, θ) = θ min (xi ) 1[0,θ] max (xi ) .
i=1,...,n i=1,...,n
i=1

La vraisemblance est maximale pour θn (x) = maxi=1,...,n (xi ). L’EMV est donc θ̂n =
maxi=1,...,n (Xi ). Il est facile de calculer sa loi. Sa fonction de répartition est :

 1
  x n si x ≥ θ,
n
Pθ (θ̂n ≤ x) = Pθ (X1 ≤ x) = si 0 ≤ x < θ,
 θ
0 si x < 0.

Donc, sous Pθ , θ̂n est une v.a. à densité :

xn−1
pθ̂n (x) = n 1[0,θ] (x).
θn

Ceci permet de montrer que l’EMV θ̂n est biaisé :


Z θ
nθ θ
Eθ (θ̂n ) = xpθ̂n (x)dx = =θ− ,
0 n+1 n+1

avec un biais d’ordre 1/n. La variance est

n 2 n2 n
Varθ (θ̂n ) = Eθ (θ̂n2 ) − Eθ (θ̂n )2 = θ − θ2 = θ2 ,
n+2 (n + 1)2 (n + 1)2 (n + 2)

qui est d’ordre 1/n2 . Le RQM est donc d’ordre 1/n2 lui aussi :
2 2
RQMθ (θ̂n ) = Varθ (θ̂n ) + Eθ (θ̂n ) − θ = θ2 ,
(n + 1)(n + 2)

ce qui est plus petit que les RQM des EMV observés dans les modèles précédents,
gaussiens par exemple, et aussi plus petit que le RQM de l’estimateur empirique pour
le modèle uniforme obtenu par la méthode des moments dans l’exemple 8.22. De plus,
il apparaı̂t clairement qu’on n’est pas dans le régime du théorème de la limite centrale,
où on s’attend à une variance en 1/n. Effectivement,

 1 si x ≥ 0,
   x n
Pθ n(θ̂n − θ) ≤ x = 1+ si − nθ ≤ x < 0,
 nθ
0 si x < −nθ,

172 Chapitre 8 – Statistique : Estimation

et donc, pour tout x ≥ 0 :


 n→+∞
Pθ n(θ̂n − θ) ≤ −θx −→ e−x ,

ce qui montre que


 n→+∞
n θ̂n − θ −→ −θZ
en loi, où Z est une v.a. exponentielle de paramètre 1. Les fluctuations de l’EMV
sont d’ordre 1/n et de loi exponentielle lorsque n est grand. On est donc loin de la
normalité asymptotique.
Finalement, on peut débiaiser l’EMV en considérant l’estimateur :
n+1 n+1
θen = θ̂n = max (Xi ) .
n n i=1,...,n

L’estimateur θen est non-biaisé, son RQM est :


(n + 1)2 1
RQMθ (θen ) = Varθ (θen ) = Varθ (θ̂n ) = θ2 ,
n2 n(n + 2)

qui est plus petit que le RQM de θ̂n , et il satisfait :


 n→+∞
n θen − θ −→ −θ(Z − 1),

en loi, où Z est une v.a. exponentielle de paramètre 1. Notez que E((Z − 1)2 ) = 1 <
2 = E(Z 2 ), ce qui montre que la variance asymptotique de θen est deux fois plus petite
que celle de θ̂n . Le “petit” débiaisage s’avère bien utile ici.

En fait, la normalité asymptotique se rencontre avec des modèles dits réguliers,


pour lesquels la vraisemblance a de bonnes propriétés de régularité que nous ne
détaillerons pas ici, mais qui réclament en particulier que le support (en x) de la loi
p(x, θ) soit indépendant de θ. Le modèle uniforme traité ci-dessus viole cette condi-
tion, mais c’est en fait une bonne chose du point de vue de l’estimation, puisqu’on
tombe sur un estimateur qui converge plus vite que ce que prévoit le théorème de la
limite centrale.

8.7 Exercices sur le chapitre 8

EXERCICE 8.1 Montrer que la densité de la loi Tn est de la forme (9.5).

EXERCICE 8.2 Approximation des lois χ2n et Tn .


Soit (Zn )n une suite de variables aléaoires réelles avec Zn de loi χ2n .
8.7 – Exercices sur le chapitre 8 173


1. Montrer que ((Zn − n)/ 2n)n converge en loi vers une loi gaussienne centrée
réduite.
√ √
2. En déduire que ( 2Zn − 2n − 1)n converge en loi vers une loi gaussienne
centrée réduite.
La qualité de la seconde approximation est en fait légèrement meilleure que la
première.
Soit (ζn )n une suite de variables aléatoires réelles avec ζn de loi Tn .
3. Montrer que (ζn )n converge en loi vers une loi gaussienne centrée réduite.

EXERCICE 8.3 Réduction de variance dans une méthode de Monte Carlo.

RSoit g une fonction mesurable telle que 0 ≤ g ≤ 1. On souhaite calculer m =


1
0
g(x)dx. Soient X et Y des variables indépendantes et identiquement distribuées,
de loi uniforme sur [0, 1] et

g(X) + g(1 − X)
U = 1Y ≤g(X) , V = g(X) et W = .
2

1. Calculer l’espérance et la variance de U , V et W .


2. Proposer 3 méthodes de type Monte-Carlo pour calculer m.

On suppose dans la suite que g est monotone.


3. Montrer que (g(x) − g(y))(g(1 − x) − g(1 − y)) ≤ 0 pour tous x, y.
En déduire que
Z 1 Z 1
E(g(X)g(1 − X)) = g(x)g(1 − x) dx ≤ m2 ≤ g(x)2 dx .
0 0

Comparer les variances de U , V , W .


4. Soit (Xi )i≥1 une suite de variables aléatoires indépendantes et de même loi
uniforme sur [0, 1]. Des estimateurs
2n n
1 X 1 X
An = g(Xi ) , Bn = (g(Xi ) + g(1 − Xi )) ,
2n i=1 2n i=1

lequel est le meilleur pour calculer m ?


5. Pour g(x) = x2 , déterminer pour chaque estimateur An et Bn combien de
simulations sont nécessaires pour obtenir une précision relative de l’ordre de
1% sur le calcul de m avec probabilité 95%.
174 Chapitre 8 – Statistique : Estimation

EXERCICE 8.4 Soit m un entier strictement positif fixé. On considère le modèle


binomial à m fixé, X = {0, 1, . . . , m},

P = B(m, θ), θ ∈ [0, 1] .

On observe un n-échantillon (X1 , . . . , Xn ).


1. Déterminer un estimateur de θ par la méthode des moments.
2. Donner l’Estimateur du Maximum de Vraisemblance de θ.

EXERCICE 8.5 On modélise la hauteur maximale annuelle d’un fleuve (ex-


primée en mètres) par une variable aléatoire dite de Rayleigh de densité p(x, a) =
x x2
a exp(− 2a )1]0,+∞[ (x) où a > 0 est un paramètre inconnu.
1. Calculer l’espérance Ea (X) d’une variable aléatoire X de loi de Rayleigh de
paramètre a. Calculer aussi Ea (X 2 ) et Ea (X 4 ).
2. On observe un n-échantillon (X1 , . . . , Xn ) suivant cette loi. Donner l’Estima-
teur du Maximum de Vraisemblance ân de a. Cet estimateur est-il sans biais ?
convergent ? Vérifier qu’il est asymptotiquement normal et identifier la variance
asymptotique.
3. Pendant une période de huit ans, on a observé les hauteurs maximales en mètres
suivantes pour le fleuve : (x1 , . . . , x8 ) = (2,5, 1,8, 2,9, 0,9, 2,1, 1,7, 2,2, 2,8). On
P8
a i=1 x2i = 38,69. Une compagnie d’assurance estime qu’une crue catastro-
phique avec une hauteur de 6 mètres au moins n’arrive au plus qu’une fois tous
les mille ans. Est-ce justifié ?
Chapitre 9

Statistique : Intervalle de
confiance

I only believe in statistics that I doctored myself.

Winston Churchill

9.1 Intervalle de confiance et estimation

L’estimation d’un paramètre, même dans le cas d’un estimateur convergent, don-
nera une valeur différente de la vraie valeur inconnue. Ce qu’on peut dire, c’est que
cette valeur inconnue est proche de la valeur estimée, mais tout l’art du statisticien
est de quantifier cette erreur par nature aléatoire. Pour répondre rigoureusement au
problème de l’estimation d’un paramètre, il est agréable de pouvoir donner un inter-
valle tel que le paramètre inconnu en fasse partie avec une grande probabilité donnée.

Définition 9.1 Soit (X , A, P) un modèle statistique, avec P = {Pθ , θ ∈ Θ}. Soit


g : Θ → R. Soit α ∈]0, 1[. On dit qu’un intervalle IX qui s’exprime en fonction d’un
n-échantillon X est un intervalle de confiance pour g(θ) de niveau 1 − α si pour tout
θ∈Θ:

Pθ g(θ) ∈ IX = 1 − α .

Lorsque pour tout θ ∈ Θ, on a Pθ (g(θ) ∈ IX ) ≥ 1 − α, on parle d’intervalle de confiance


de niveau 1 − α par excès.

175
176 Chapitre 9 – Statistique : Intervalle de confiance

1 0.3
r=0.95
0.25
0.8

0.2
0.6
F(x)

f(x)
0.15
0.4
0.1

0.2
0.05
1-r=0.05
0 0
-4 -2 0 qr 2 4 -4 -2 0 qr 2 4
x x

Figure 9.1 – Détermination du quantile qr d’ordre r = 0,95 d’une loi à partir de la


fonction de répartition F (x) de la loi (gauche) et à partir de la densité f (x) de la loi
(droite). Ici on a pris le cas d’une loi gaussienne centrée réduite.

L’intervalle de confiance IX est donc aléatoire dans le sens où ses bornes dépendent
de l’échantillon X. Lorsqu’on observe un échantillon, on peut affirmer que la vraie
valeur g(θ) appartient à l’intervalle IX construit à partir de l’échantillon observé avec
une certitude (ou niveau de confiance) prescrite à l’avance.

Les niveaux usuels sont 90%, 95%, et 99% et correspondent respectivement à


α = 0,1, α = 0,05 et α = 0,01.

Pour construire des intervalles de confiance, il est très utile d’introduire la notion
de quantile.

Définition 9.2 On considère la loi d’une variable aléatoire réelle de fonction de


répartition F . Pour r ∈]0, 1[, on appelle quantile (ou fractile) d’ordre r de la loi le nombre

qr = inf x ∈ R, F (x) ≥ r .

Lorsque la fonction de répartition F est continue et strictement croissante (par


exemple quand la v.a. possède une densité strictement positive, comme sur la figure
9.1), elle est inversible d’inverse F −1 et pour tout r ∈]0, 1[, on a qr = F −1 (r). Par
exemple, la médiane est le quantile d’ordre 1/2 : Une v.a. réelle a autant de chances
d’être plus petite ou plus grande que la médiane. Le premier quartile est le quantile
d’ordre 1/4 : Une v.a. réelle a une chance sur quatre d’être plus petite et trois chances
sur quatre d’être plus grande que le premier quartile.

La fonction de répartition est toujours croissante, ce qui entraı̂ne la croissance de


r 7→ qr . Pour construire des intervalles de confiance et des tests, nous utiliserons les
propriétés suivantes :
9.1 – Intervalle de confiance et estimation 177

Proposition 9.3 On suppose que la loi de la v.a. réelle X de fonction de répartition


F possède une densité. Les quantiles de la loi satisfont alors les propriétés suivantes.
1. Pour tout r ∈]0, 1[, F (qr ) = r.
2. Pour tout α ∈]0, 1[, P(X 6∈ [qα/2 , q1−α/2 ]) = P(X < qα ) = P(X > q1−α ) = α.
3. Pour tout α ∈]0, 1[, P(X ∈ [qα/2 , q1−α/2 ]) = P(X ≥ qα ) = P(X ≤ q1−α ) =
1 − α.
4. Si la loi de X est symétrique (i.e. la densité est une fonction paire), alors pour
tout α ∈]0, 1[, P(|X| > q1−α/2 ) = α et P(|X| ≤ q1−α/2 ) = 1 − α.

Preuve. 1. Pour tout y < qr , on a F (y) < r et par croissance de F , pour tout y > qr ,
F (y) ≥ r. Comme F est continue, on en déduit que F (qr ) = r.
2. Le résultat se déduit des égalités P(X < qr ) = P(X ≤ qr ) = F (qr ) = r et
P(X > qr ) = 1 − F (qr ) = 1 − r.
3. Ce point s’obtient par passage au complémentaire.
4. Lorsque la densité de X est une fonction paire, la variable aléatoire −X a même
loi que X. En outre F (0) = 1/2, ce qui entraı̂ne que q1−α/2 > 0. Donc :
  
P |X| > q1−α/2 = P X < −q1−α/2 + P X > q1−α/2

= P(−X > q1−α/2 ) + P(X > q1−α/2 = 2P(X > q1−α/2 )
= α,

et la dernière propriété s’en déduit par passage au complémentaire. 

Pour obtenir des intervalles de confiance sur la moyenne et la variance d’une


loi inconnue dont on a un échantillon, on a besoin de certaines propriétés sur des
estimateurs, tels que la moyenne empirique, la variance empirique non-biaisée, la
moyenne empirique renormalisée par la variance empirique non-biaisée, etc. Il est
établi dans la section précédente que, avec probabilité 1 :

n→+∞ n→+∞
X n −→ µ et Vn −→ σ 2 ,

c’est-à-dire que la moyenne empirique (8.3) et la variance empirique non-biaisée (8.7)


sont des estimateurs convergents de l’espérance µ et de la variance σ 2 . Mais on a besoin
de plus. Pour résumer, il arrive dans certains cas qu’on puisse caractériser entièrement
la loi des estimateurs, ce qui permet de construire des intervalles de confiance exacts
(et valables pour tout n). Mais le plus souvent la situation est trop compliquée, et on
se sert alors des propriétés aymptotiques des estimateurs (en particulier, la normalité
asymptotique) pour construire des intervalles de confiance asymptotiques, qui sont
valables pour n suffisamment grand.
178 Chapitre 9 – Statistique : Intervalle de confiance

9.2 Intervalles exacts pour le modèle gaussien

La proposition suivante caractérise la distribution statistique de la moyenne empi-


rique et de la variance empirique non-biaisée dans le cas d’un échantillon à statistique
gaussiennne.

Proposition 9.4 Soit (Xi )i=1,...,n un n-échantillon de loi N (µ, σ 2 ), avec n ≥ 2. Les
v.a. réelles X n et Vn définies par (8.3) et (8.7) sont indépendantes pour tout n. De
plus, pour tout n, on a :

√ Xn − µ
n ∼ N (0, 1) , (9.1)
σ
√ Xn − µ
n √ ∼ Tn−1 , (9.2)
Vn
n
1 X
(Xi − µ)2 ∼ χ2n , (9.3)
σ 2 i=1
n
Vn 1 X
(n − 1) = (Xi − X n )2 ∼ χ2n−1 . (9.4)
σ2 σ 2 i=1

Les lois Tn (loi de Student à n degrés de liberté) et χ2n (loi de χ2 à n degrés de


liberté) sont décrites dans les tables 9.1 et 9.2. La loi de χ2 a déjà été introduite
dans la définition 7.17, c’est la loi de la somme des carrés de n variables aléatoires
gaussiennes centrées réduites indépendantes, et elle a pour densité (7.20). Pour n
entier strictement positif, la loi Tn est définie de la manière suivante : Soit Z une
variable aléatoire de loi gaussienne centrée réduite et soit U une variable indépendante
de Z et p distribuée suivant la loi de χ2 à n degrés de liberté. Par définition la variable
T = Z/ U/n suit une loi de Student à n degrés de liberté. La densité de T est paire
et donnée par :
− n+1
1 Γ( n+1 t2

2 )
2

f (t) = √ 1 + , (9.5)
nπ Γ( n2 ) n
R∞
où Γ est la fonction Gamma d’Euler : Γ(s) = 0 e−x xs−1 dx (voir exercice 8.1). Son
espérance ne peut pas être définie pour n = 1 et est nulle pour n ≥ 2. Sa variance est
infinie pour n ≤ 2 et vaut n/(n − 2) pour n ≥ 3.

La proposition 9.4 donne donc les lois exactes des estimateurs empiriques de la
moyenne et de la variance pour tout n, ce qui va nous permettre de construire des
intervalles de confiance exacts pour ces deux paramètres.

Preuve. Introduisons les v.a. Zj = (Xj − µ)/σ. Ce sont des v.a. gaussiennes
indépendantes centrées réduites, et on peut exprimer le n-échantillon (Xi )i=1,...,n
9.2 – Intervalles exacts pour le modèle gaussien 179

comme Xj = µ + σZj . La v.a. réelle Y1 définie par :


n
√ Xn − µ 1 X
Y1 = n =√ Zj (9.6)
σ n j=1

a une loi gaussienne. Sa moyenne est 0 car les Zj sont centrés, et sa variance est 1 car
les Zj sont indépendants et de variance 1.

On trouve de la même façon :


n n
1 X 2
X
(Xi − µ) = Zj2 ,
σ 2 i=1 j=1

ce qui montre que cette v.a. réelle suit une loi χ2n .

Considérons maintenant la variance empirique renormalisée (9.4). On peut l’écrire


sous la forme :
n  2 X n  2
Vn 1 X σ Y1
(n − 1) 2 = 2 (µ + σZi ) − (µ + √ Y1 ) = Zi − √
σ σ i=1 n i=1
n
n
X
= Zi2 − Y12 .
i=1

Donnons-nous maintenant une base (e1 , . . . , en√) de Rn dont le premier vecteur est le
vecteur dont toutes les coordonnées valent 1/ n, les autres vecteurs orthonormaux
de la base étant choisis arbitrairement. Appelons U la matrice n × n orthogonale de
vecteurs lignes donnés par les ej , et Y le vecteur aléatoire donné par Y = UZ. On
peut noter que la première coordonnée Y1 est bien donnée par (9.6). Le vecteur Y est
un vecteur gaussien de moyenne nulle et de matrice de covariance C = UUt = I. Cela
veut dire que les Yj sont des v.a. gaussiennes indépendantes centrées réduites (voir
section
Pn7.2). En Putilisant une nouvelle fois le fait que la matrice U est orthogonale,
n
on a i=1 Zi2 = j=1 Yj2 , et donc :
n
Vn X
(n − 1) 2
= Yj2 ,
σ j=2

où la somme va bien de 2 à n. La loi de cette v.a. réelle est donc un χ2n−1 . Cela montre
aussi que les v.a. réelles X n et Vn sont indépendantes, car la première ne dépend que
de Y1 , alors que la seconde ne dépend√ que de (Yj )j=2,...,n . Enfin, comme les variables
aléatoires (n − 1)σ −2 Vn ∼ χ2n−1 et nσ −1 (X n − µ) ∼ N (0, 1) sont indépendantes, la
v.a. réelle : √ √ −1
n(X n − µ) √ nσ (X n − µ)
√ = n−1 √ √
Vn n − 1σ −1 Vn
suit une loi Tn−1 . 
180 Chapitre 9 – Statistique : Intervalle de confiance

Corollaire 9.5 Soit (Xi )i=1,...,n un n-échantillon de loi N (µ, σ 2 ). Les risques qua-
dratiques moyens des estimateurs empiriques de la moyenne et de la variance sont :

σ2 2σ 4
RQM(X n ) = , RQM(Vn ) = ·
n n−1

Preuve. Le risque quadratique moyen de la moyenne empirique est déjà connu par la
proposition 8.18. Celui de la variance empirique se calcule à partir de la caractérisation
(9.4) et du fait qu’une v.a. suivant la loi χ2p a pour variance 2p. 

9.2.1 Estimation par intervalle de confiance de la moyenne

On observe un n-échantillon d’une loi gaussienne N (µ, σ 2 ), et on cherche à estimer


la moyenne µ. On peut se servir de la moyenne empirique X n , dont on sait qu’elle
va donner une estimation bonne lorsque n est grand. En pratique, on cherche un
intervalle de confiance, c’est-à-dire un intervalle dont on puisse dire qu’il contient la
valeur inconnue µ avec une probabilité qu’on se fixe.

Supposons dans un premier temps que l’écart-type σ de la loi soit connu. Soit
un niveau de confiance 1 − α donné (en général α = 0,1, 0,05, ou 0,01). D’après la
proposition 9.3, le quantile q1−α/2 d’ordre 1 − α/2 de la loi gaussienne centrée réduite
est tel que si Z ∼ N (0, 1), alors P(−q1−α/2 ≤ Z ≤ q1−α/2 ) = 1 − α. On cherche alors
q1−α/2 dans une table de la loi normale ou sur un logiciel. D’après la proposition 9.4 :

√ Xn − µ
 
P n ∈ [−q1−α/2 , q1−α/2 ] = 1 − α.
σ

En réécrivant l’événement en question :

√ Xn − µ
 
σq1−α/2 σq1−α/2
n ∈ [−q1−α/2 , q1−α/2 ] ⇐⇒ µ ∈ X n − √ , Xn + √ ,
σ n n

on obtient l’intervalle de confiance I1−α pour µ au niveau 1 − α :


 
σq1−α/2 σq1−α/2
I1−α = X n − √ , Xn + √ .
n n

Bien sûr,
- plus on se fixe un niveau de confiance 1 − α élevé, plus l’intervalle est large. Si on
demande d’être absolument sûr, i.e. α = 0, alors q1 = +∞ et I1 = R.
- plus la v.a. sous-jacente a une dispersion élevée (i.e. plus σ est grand), plus l’intervalle
est grand.
- plus l’échantillon est grand, plus l’intervalle est petit. La largeur de l’intervalle de
9.2 – Intervalles exacts pour le modèle gaussien 181


confiance est proportionnelle à 1/ n. Donc, à niveau 1−α fixé, pour avoir un intervalle
de confiance 2 fois plus petit, il faut 4 fois plus d’observations.

Les calculs précédents sont intéressants, mais en pratique, il est rare qu’on
connaisse σ. Dans le cas général où on ne connaı̂t pas σ, on utilise une estimation de
celui-ci, donnée par la variance empirique sans biais Vn .

Soit un niveau de confiance 1 − α donné. D’après la proposition 9.3, le quantile


t1−α/2 d’ordre 1 − α/2 de la loi Tn−1 est tel que, si Z ∼ Tn−1 , alors P(−t1−α/2 ≤ Z ≤
t1−α/2 ) = 1 − α. D’après la proposition 9.4 :
√ Xn − µ
 
P n √ ∈ [−t1−α/2 , t1−α/2 ] = 1 − α .
Vn
En réécrivant l’événement en question, on obtient l’intervalle de confiance I1−α pour
µ au niveau 1 − α :
" √ √ #
Vn t1−α/2 Vn t1−α/2
I1−α = X n − √ , Xn + √ .
n n

L’intervalle de confiance obtenu ainsi a la même comportement qualitatif que celui


décrit dans le cas σ connu. Il n’y a rien d’étonnant à cela, car on sait que la variance
empirique converge avec probabilité 1 vers la variance théorique. Ceci se traduit aussi
par le fait que, lorsque n est grand, la loi de Student à n degrés de libertés Tn devient
très proche de la loi gaussienne centrée réduite (voir exercice 8.2). En pratique, on
utilise des tables de loi Tn (voir la table 9.1) pour n ≤ 30, et, lorsque n > 30,
on utilise souvent l’approximation gaussienne. On peut aussi utiliser des logiciels de
calcul scientifique.

Exemple 9.6 On mesure les durées de vie (en heures) de n = 10 ampoules. On


obtient :
1864 , 1934 , 2033 , 1890 , 1997 , 1974 , 1837 , 1903 , 2009 , 1950 .
On cherche la durée de vie moyenne µ d’une ampoule, en supposant que la loi
décrivant cette durée de vie est une gaussienne. La moyenne empirique et la variance
empirique non-biaisée sont :
X 10 ' 1939 , V10 ' 4244 .
Un intervalle de confiance pour la moyenne au niveau 95% est donc :
 √ √ 
V10 t0,975 V10 t0,975
I0,95 = X 10 − √ , X 10 + √ ,
10 10
où t0,975 est tel que P(Z ≤ t0,975 ) = 0,975, avec Z ∼ T9 . En utilisant une table de la
loi T9 , on trouve t0,975 ' 2,26, et on obtient ainsi l’intervalle de confiance [1892, 1986]
pour la valeur inconnue µ au niveau 0,95.
182 Chapitre 9 – Statistique : Intervalle de confiance

p
n\ 0,40 0,25 0,10 0,05 0,025 0,01 0,005 0,0005

1 0,324920 1,000000 3,077684 6,313752 12,70620 31,82052 63,65674 636,6192


2 0,288675 0,816497 1,885618 2,919986 4,30265 6,96456 9,92484 31,5991
3 0,276671 0,764892 1,637744 2,353363 3,18245 4,54070 5,84091 12,9240
4 0,270722 0,740697 1,533206 2,131847 2,77645 3,74695 4,60409 8,6103
5 0,267181 0,726687 1,475884 2,015048 2,57058 3,36493 4,03214 6,8688
6 0,264835 0,717558 1,439756 1,943180 2,44691 3,14267 3,70743 5,9588
7 0,263167 0,711142 1,414924 1,894579 2,36462 2,99795 3,49948 5,4079
8 0,261921 0,706387 1,396815 1,859548 2,30600 2,89646 3,35539 5,0413
9 0,260955 0,702722 1,383029 1,833113 2,26216 2,82144 3,24984 4,7809
10 0,260185 0,699812 1,372184 1,812461 2,22814 2,76377 3,16927 4,5869
11 0,259556 0,697445 1,363430 1,795885 2,20099 2,71808 3,10581 4,4370
12 0,259033 0,695483 1,356217 1,782288 2,17881 2,68100 3,05454 4,3178
13 0,258591 0,693829 1,350171 1,770933 2,16037 2,65031 3,01228 4,2208
14 0,258213 0,692417 1,345030 1,761310 2,14479 2,62449 2,97684 4,1405
15 0,257885 0,691197 1,340606 1,753050 2,13145 2,60248 2,94671 4,0728
16 0,257599 0,690132 1,336757 1,745884 2,11991 2,58349 2,92078 4,0150
17 0,257347 0,689195 1,333379 1,739607 2,10982 2,56693 2,89823 3,9651
18 0,257123 0,688364 1,330391 1,734064 2,10092 2,55238 2,87844 3,9216
19 0,256923 0,687621 1,327728 1,729133 2,09302 2,53948 2,86093 3,8834
20 0,256743 0,686954 1,325341 1,724718 2,08596 2,52798 2,84534 3,8495
21 0,256580 0,686352 1,323188 1,720743 2,07961 2,51765 2,83136 3,8193
22 0,256432 0,685805 1,321237 1,717144 2,07387 2,50832 2,81876 3,7921
23 0,256297 0,685306 1,319460 1,713872 2,06866 2,49987 2,80734 3,7676
24 0,256173 0,684850 1,317836 1,710882 2,06390 2,49216 2,79694 3,7454
25 0,256060 0,684430 1,316345 1,708141 2,05954 2,48511 2,78744 3,7251
26 0,255955 0,684043 1,314972 1,705618 2,05553 2,47863 2,77871 3,7066
27 0,255858 0,683685 1,313703 1,703288 2,05183 2,47266 2,77068 3,6896
28 0,255768 0,683353 1,312527 1,701131 2,04841 2,46714 2,76326 3,6739
29 0,255684 0,683044 1,311434 1,699127 2,04523 2,46202 2,75639 3,6594
30 0,255605 0,682756 1,310415 1,697261 2,04227 2,45726 2,75000 3,6460

+∞ 0,253347 0,674490 1,281552 1,644854 1,95996 2,32635 2,57583 3,2905

Table 9.1 – Table de la loi Tn . On reporte dans ce tableau les valeurs x pour lesquelles
P(Tn ≥ x) = p. Pour n > 30, on adopte souvent l’approximation gaussienne Tn ∼
N (0, 1).
9.2 – Intervalles exacts pour le modèle gaussien 183

9.2.2 Estimation par intervalle de confiance de la variance

Les raisonnements qu’on vient d’appliquer pour l’estimation de la moyenne


peuvent être repris pour l’estimation de la variance σ 2 , lorsque la moyenne µ est
connue, puis lorsqu’elle ne l’est pas.

Commençons par le cas où la moyenne µ de l’échantillon est connu. Donnons-nous


le niveau de confiance 1 − α. On commence par choisir t1−α,l et t1−α,r tels que, si
Z ∼ χ2n , alors P(t1−α,l ≤ Z ≤ t1−α,r ) = 1 − α. La loi χ2n n’est pas symétrique et il
y a une infinité de couples possibles (t1−α,l , t1−α,r ). On choisit en général les deux
extrémités t1−α,l et t1−α,r de sorte que le risque soit également réparti à gauche et à
droite, i.e. P(Z < t1−α,l ) = α/2 et P(Z > t1−α,r ) = α/2. Autrement dit, t1−α,l est
le quantile d’ordre α/2 de la loi χ2n et t1−α,r est le quantile d’ordre 1 − α/2 de la loi
χ2n . Mais on pourrait parfaitement proposer un intervalle asymétrique. On utilise en
pratique des tables de la loi χ2n (voir la table 9.2) ou des logiciels de calcul scientifique.
Lorsque la moyenne µ est connue, l’estimateur empirique de la variance est :
n
1X
Vn∗ = (Xi − µ)2 .
n i=1

Vn∗ est sans biais, convergent, et nVn∗ /σ 2 suit la loi χ2n d’après la proposition 9.4. On
peut donc affirmer que :

nVn∗
 
P ∈ [t1−α,l , t1−α,r ] = 1 − α .
σ2

En réécrivant l’événement en question, on trouve un intervalle de confiance au niveau


1 − α de la variance :
nVn∗ nVn∗
 
I1−α = , .
t1−α,r t1−α,l

Exemple 9.7 Dans l’exemple 9.6, imaginons que le fabricant ait fait des mesures
extensives, et qu’il indique sur la boı̂te la durée de vie moyenne : µ = 1920. On
recherche la variance σ 2 inconnue de la loi de durée de vie. L’estimateur empirique
de la variance est :
10
∗ 1 X
V10 = (Xi − 1920)2 ' 4184 .
10 i=1

On cherche un intervalle de confiance au niveau 1 − α = 95% de la variance à partir


de l’échantillon de 10 ampoules observées. Cet intervalle est :
∗ ∗
 
10V10 10V10
I0,95 = , .
t0,95,r t0,95,l
184 Chapitre 9 – Statistique : Intervalle de confiance

p
n\ 0,995 0,990 0,975 0,950 0,050 0,025 0,010 0,005

1 0,00004 0,00016 0,00098 0,00393 3,84146 5,02389 6,63490 7,87944


2 0,01003 0,02010 0,05064 0,10259 5,99146 7,37776 9,21034 10,59663
3 0,07172 0,11483 0,21580 0,35185 7,81473 9,34840 11,34487 12,83816
4 0,20699 0,29711 0,48442 0,71072 9,48773 11,14329 13,27670 14,86026
5 0,41174 0,55430 0,83121 1,14548 11,07050 12,83250 15,08627 16,74960
6 0,67573 0,87209 1,23734 1,63538 12,59159 14,44938 16,81189 18,54758
7 0,98926 1,23904 1,68987 2,16735 14,06714 16,01276 18,47531 20,27774
8 1,34441 1,64650 2,17973 2,73264 15,50731 17,53455 20,09024 21,95495
9 1,73493 2,08790 2,70039 3,32511 16,91898 19,02277 21,66599 23,58935
10 2,15586 2,55821 3,24697 3,94030 18,30704 20,48318 23,20925 25,18818
11 2,60322 3,05348 3,81575 4,57481 19,67514 21,92005 24,72497 26,75685
12 3,07382 3,57057 4,40379 5,22603 21,02607 23,33666 26,21697 28,29952
13 3,56503 4,10692 5,00875 5,89186 22,36203 24,73560 27,68825 29,81947
14 4,07467 4,66043 5,62873 6,57063 23,68479 26,11895 29,14124 31,31935
15 4,60092 5,22935 6,26214 7,26094 24,99579 27,48839 30,57791 32,80132
16 5,14221 5,81221 6,90766 7,96165 26,29623 28,84535 31,99993 34,26719
17 5,69722 6,40776 7,56419 8,67176 27,58711 30,19101 33,40866 35,71847
18 6,26480 7,01491 8,23075 9,39046 28,86930 31,52638 34,80531 37,15645
19 6,84397 7,63273 8,90652 10,11701 30,14353 32,85233 36,19087 38,58226
20 7,43384 8,26040 9,59078 10,85081 31,41043 34,16961 37,56623 39,99685
21 8,03365 8,89720 10,28290 11,59131 32,67057 35,47888 38,93217 41,40106
22 8,64272 9,54249 10,98232 12,33801 33,92444 36,78071 40,28936 42,79565
23 9,26042 10,19572 11,68855 13,09051 35,17246 38,07563 41,63840 44,18128
24 9,88623 10,85636 12,40115 13,84843 36,41503 39,36408 42,97982 45,55851
25 10,51965 11,52398 13,11972 14,61141 37,65248 40,64647 44,31410 46,92789
26 11,16024 12,19815 13,84390 15,37916 38,88514 41,92317 45,64168 48,28988
27 11,80759 12,87850 14,57338 16,15140 40,11327 43,19451 46,96294 49,64492
28 12,46134 13,56471 15,30786 16,92788 41,33714 44,46079 48,27824 50,99338
29 13,12115 14,25645 16,04707 17,70837 42,55697 45,72229 49,58788 52,33562
30 13,78672 14,95346 16,79077 18,49266 43,77297 46,97924 50,89218 53,67196

Table 9.2 – Table de la loi χ2n . On reporte dans ce tableau les valeurs x pour lesquelles
p
P(χ2n ≥ x) = p. Pour n > 30, on adopte souvent l’approximation gaussienne 2χ2n −

2n − 1 ∼ N (0, 1).
9.2 – Intervalles exacts pour le modèle gaussien 185

Il faut évaluer les deux nombres t0,95,l et t0,95,r . Pour cela, on consulte une table de
la fonction de répartition de la loi χ210 et on cherche les niveaux t0,95,l et t0,95,r tels
que, si Z ∼ χ210 , alors P(Z < t0,95,l ) = 0,025 et P(Z < t0,95,r ) = 0,975. On trouve
t0,95,l = 3,25 et t0,95,r = 20,48. On obtient alors que [2043, 12875] est un intervalle de
confiance pour σ 2 au niveau 0,95. Noter que l’intervalle de confiance pour la variance
est beaucoup plus large que pour l’espérance. Il est en effet plus difficile d’estimer la
variance que la moyenne.

Dans le cas d’un échantillon


√ √ √ de taille n supérieure à 30, on peut admettre que, si
Z ∼ χ2n , alors la v.a. 2 Z − 2n − 1 suit la loi gaussienne centrée réduite. Pour des
échantillons de taille n supérieure à 30, on utilise cette approximation gaussienne pour
déterminer les quantiles de la loi χ2n (voir l’exercice 8.2). C’est pourquoi les tables de
la loi χ2n s’arrêtent en général à n = 30. Bien sûr, avec un logiciel de mathématiques
ou de statistique, on peut trouver des valeurs approchées des quantiles de la loi χ2n
valables pour des n plus grands, avec une précision arbitraire.

Supposons maintenant que la moyenne µ soit inconnue. On commence par choisir


t1−α,l et t1−α,r tels que, si Z ∼ χ2n−1 , alors P(t1−α,l ≤ Z ≤ t1−α,r ) = 1 − α. Lorsque
la moyenne µ est inconnue, l’estimateur empirique non-biaisé de la variance est :
n
1 X
Vn = (Xi − X n )2 .
n − 1 i=1

Vn est sans biais, convergent, et (n − 1)Vn /σ 2 suit la loi χ2n−1 d’après la proposition
9.4. Un intervalle de confiance au niveau 1 − α de la variance est donc :
 
(n − 1)Vn (n − 1)Vn
I1−α = , .
t1−α,r t1−α,l

Exemple 9.8 On reprend l’exemple 9.7, mais sans supposer qu’on connaı̂t l’espérance
µ. L’estimateur empirique non-biaisé de la variance est alors :
10
1X
V10 = (Xi − X 10 )2 ' 4244 .
9 i=1

Un intervalle de confiance au niveau 1 − α = 95% de la variance est :


 
9V10 9V10
I0,95 = , .
t0,95,r t0,95,l
On commence par consulter une table de la fonction de répartition de la loi χ29 et on
cherche les niveaux t0,95,l et t0,95,r tels que, si Z ∼ χ29 , alors P(Z < t0,95,l ) = 0,025
et P(Z < t0,95,r ) = 0,975. On trouve t0,95,l = 2,70 et t0,95,r = 19,02. On obtient alors
que [2008, 14147] est un intervalle de confiance pour σ 2 au niveau 0,95. Comme on
pouvait s’y attendre, l’intervalle est un peu plus grand que dans le cas où on connaı̂t
l’espérance, car il y a plus d’incertitude puisque l’on ne connaı̂t pas la moyenne.
186 Chapitre 9 – Statistique : Intervalle de confiance

9.3 Résultats asymptotiques

Dans le cas non-gaussien, la proposition 9.4 n’est plus vraie, mais en vertu du
théorème de la limite centrale, on peut obtenir des résultats similaires sous forme
asymptotique. On obtient les distributions de la moyenne et de la variance empirique
“pour n assez grand”. Dans la pratique, on admettra ces résultats lorsque n ≥ 30.
Des résultats fins (utilisant le théorème de Berry-Essen ou des inégalités de concentra-
tion) permettent de contrôler l’erreur commise, mais ils sortent du cadre de ce cours.
Nous nous contenterons de donner une application particulièrement importante de
cette méthode pour les intervalles de confiance pour une proportion, c’est-à-dire les
sondages.

9.3.1 Intervalles de confiance asymptotiques

On cherche un intervalle de confiance pour un paramètre θ réel. On suppose que


θ̂n est un estimateur convergent et asymptotiquement normal √ de θ, plus exactement
qu’il existe une fonction σ(θ) de Θ dans ]0, +∞[ telle que n(θ̂n − θ)/σ(θ) converge
en loi vers une loi gaussienne centrée réduite. Comme on l’a vu, c’est un cas assez
courant, qui arrive dès qu’on est dans le régime du théorème de la limite centrale. On
suppose aussi que la fonction σ(θ) est continue. La suite de v.a. réelles σ(θ̂n ) converge

alors presque sûrement vers σ(θ), et par le théorème de Slutsky, n(θ̂n − θ)/σ(θ̂n )
converge en loi vers une loi gaussienne centrée réduite. Par conséquent, pour n pas
trop petit, on peut approcher les probabilités suivantes,
√ θ̂ − θ  √ θ̂ − θ  √ θ̂ − θ 
n n n
n ≤u , n ≤u , n ≥ −u ,

Pθ Pθ Pθ
σ(θ̂n ) σ(θ̂n ) σ(θ̂n )

avec u > 0, par Φ(u), Φ(u)−Φ(−u) = 2Φ(u)−1, et 1−Φ(−u) = Φ(u), respectivement,


où Φ est la fonction de répartition de la loi gaussienne centrée réduite. La fonction
réciproque Φ−1 de Φ est la fonction quantile de la loi gaussienne (voir la table 5.1).
Les quantiles gaussiens suivantes sont particulièrement utiles :

Φ−1 (0,975) = 1,96, Φ−1 (0,995) = 2,58. (9.7)

Définissons les intervalles aléatoires


h σ(θ̂n ) h
In,1 = θ̂n − Φ−1 (1 − α) √ , +∞ ,
n
h σ(θ̂n ) σ(θ̂n ) i
In,2 = θ̂n − Φ−1 (1 − α/2) √ , θ̂n + Φ−1 (1 − α/2) √ ,
n n
i σ(θ̂n ) i
In,3 = − ∞, θ̂n + Φ−1 (1 − α) √ ,
n
9.3 – Résultats asymptotiques 187

avec une intersection à effectuer éventuellement avec le domaine Θ des valeurs de θ.


On a alors :

Pθ θ ∈ In,j ' 1 − α ,

pour j = 1, 2, 3 et pour n assez grand.

Définition 9.9 On appelle intervalle de confiance asymptotique au niveau 1 − α de θ


un des intervalles aléatoires In,j , j = 1, 2, 3.

On dit que In,2 est un intervalle de confiance bilatère, tandis que In,1 et In,3 sont des
intervalles de confiance unilatères.

Signalons que la méthode de construction des intervalles de confiance asympto-


tiques
√ peut être étendue sans difficulté au cas où la vitesse de convergence n’est pas
n et la loi limite n’est pas gaussienne, comme par exemple pour l’EMV du modèle
uniforme vu dans l’exemple 8.27.

9.3.2 Sondages

A la veille du second tour d’une élection présidentielle, on effectue un sondage


afin de déterminer la proportion θ ∈ [0, 1] de votes pour le candidat Monsieur C.
On pourrait considérer plus généralement tout problème de sondage avec réponses
binaires. Le sondage porte sur n = 2500 individus choisis au hasard dans le corps
électoral (excluant les abstentionnistes). On note Xi = 1 si le ieme individu interrogé
vote pour C, Xi = 0 sinon. En pratique, on évite d’interroger deux fois un même
individu (tirage sans remise), de sorte que les Xi sont dépendants. Mais nous avons
vu dans la section 2.2.2 que lorsque la taille n de l’échantillon est faible comparée
à la population totale, il y a peu de différence entre les tirages avec remise et sans
remise. Nous nous placerons donc dans cette hypothèse, et supposerons ainsi les Xi
indépendantes.

Les v.a. Xi , i = 1, . . . , n, sont supposées indépendantes et de même loi de Bernoulli


P(Xi = 1) = θ = 1 − P(Xi = 0). Nous nous trouvons dans le problème statistique
suivant : comment estimer le paramètre θ inconnu au vu des observations X1 , . . . , Xn ?
Intuitivement, aucune information sur θ n’est contenue dans l’ordre des réponses, et il
suffit de résumer le sondage X1 , . . . , Xn par le nombre Sn = X1 +· · ·+Xn d’intentions
de vote pour C. Ce raisonnement heuristique peut se quantifier par le résultat qui
suit, qui dit
 que la loi conditionnelle de X sachant Sn = k est la probabilité uniforme
sur les nk suites (x1 , . . . , xn ) comportant k uns et n − k zéros.
188 Chapitre 9 – Statistique : Intervalle de confiance

Lemme 9.10 Soit k ∈ {0, . . . , n}. Pour tout x = (x1 , . . . , xn ) ∈ {0, 1}n , on a :
( 1
si x ∈ En,k ,
P(X = x|Sn = k) = (nk)
0 sinon ,

où En,k représente l’ensemble des suites (x1 , . . . , xn ) comportant k uns et n − k zéros.

Preuve. Soit x = (x1 , . . . , xn ) ∈ {0, 1}n . Par définition d’une probabilité condition-
nelle :
P({X = x} ∩ {Sn = k})
P(X = x|Sn = k) = ·
P(Sn = k)
Comme Sn suit une loi binomiale de paramètres (n, θ) :
 
n k
P(Sn = k) = θ (1 − θ)n−k .
k

Si x 6∈ En,k , alors la somme des xi ne vaut pas k, et donc :

P({X = x} ∩ {Sn = k}) = 0 .

Si x ∈ En,k , alors la somme des xi vaut k, et :

P({X = x} ∩ {Sn = k}) = P(X = x) = θk (1 − θ)n−k .

En injectant dans la probabilité conditionnelle, on obtient le résultat cherché. 

Le lemme précédent montre que la loi conditionnelle des observations (X1 , . . . , Xn )


sachant Sn = k ne dépend pas du paramètre inconnu θ. Par conséquent la valeur de
Sn contient toute l’information sur θ contenue dans le sondage. On cherche alors à
estimer θ par une fonction θ̂n de Sn , et le choix naturel est la proportion θ̂n de vote
pour C dans l’échantillon :
Sn
θ̂n = ·
n
Cet estimateur est sans biais Eθ (θ̂n ) = θ (quel que soit θ), c’est-à-dire qu’il est
“bon” en moyenne. Cet estimateur est convergent, c’est-à-dire qu’il est “bon” lorsque
l’échantillon est de grande taille. Le sondage donne 1300 intentions de votes pour C,
et 1200 pour son adversaire. L’estimateur θ̂n prend la valeur 0,52 mais est-on “sûr”
pour autant que C sera élu ? Plus précisément, cette valeur est-elle significativement
supérieure à 0,5 ? La réponse dépend de l’amplitude des fluctuations de θ̂n autour de
θ, et nous utilisons alors l’approximation gaussienne (théorème de la limite centrale) :
 p 
P |θ̂n − θ| ≤ a θ(1 − θ) ' Φ(a) − Φ(−a) = 2Φ(a) − 1 ,
9.3 – Résultats asymptotiques 189

où Φ est la fonction de répartition de la loi gaussienne centrée réduite. D’après (9.7),
l’erreur commise |θ̂n − θ| ne dépassera pas, quasi certainement (= avec 95%, resp.
99% de probabilité environ), le seuil :
p p
1,96 θ(1 − θ) 2,58 θ(1 − θ)
√ , resp. √ ·
n n
Ce seuil dépend malencontreusement du paramètre θ inconnu, mais la fonction
p
θ(1 −p θ) est majorée par sa valeur maximale 1/2, de sorte qu’en remplaçant le
facteur θ(1 − θ) par 1/2 dans les seuils précédents, on ne fera qu’augmenter notre
quasi-certitude. En conclusion, réénonçons le résultat précédent sous la forme sous
laquelle il est généralement utilisé.

Proposition 9.11 (Intervalle de confiance pour l’estimation de θ) Dès que n


est assez grand (nθ et n(1 − θ) ≥ 10 en pratique) :
 
0,98 (resp. 1,29) 0,98 (resp. 1,29)
θ ∈ θ̂n − √ , θ̂n + √ , (9.8)
n n
avec la quasi-certitude de 95% (resp. 99%).

Dans notre exemple, l’intervalle de confiance à 95% pour θ est [0,50, 0,54]. Les instituts
de sondage annoncent d’ailleurs leurs résultats ainsi (sous forme de fourchette).

9.3.3 Calcul d’intégrale par la méthode de Monte-Carlo

R Soit f : Rd → R une fonction intégrable. Lorsque le calcul analytique de I =


Rd
f (x)dx n’est pas possible, il existe diverses méthodes d’intégration numérique.
Nous décrivons ici une méthode probabiliste par simulation. Soit p une densité de
probabilité sur Rd , dont le support contient celui de f (i.e., si x est tel que f (x) 6= 0
alors p(x) > 0). On a :
Z Z
f (x)
I= f (x)dx = p(x)dx ,
Rd R p(x)
d

et I s’écrit comme :

I = E(ψ(X)) avec ψ = f /p, X v.a. de densité p .

Si p est une densité facilement simulable, on sait générer des v.a. X1 , . . . , Xn


indépendantes et de densité p. La quantité :
1
Iˆn = [ψ(X1 ) + · · · + ψ(Xn )]
n
190 Chapitre 9 – Statistique : Intervalle de confiance

constitue une approximation, en fait, une estimation au sens statistique du terme, de


I. Cette méthode de calcul (approximatif) est appelée méthode de Monte-Carlo. Le
nom de la méthode fait référence aux jeux de hasard pratiqués à Monte-Carlo.

L’estimateur Iˆn est en fait la moyenne empirique de la v.a. réelle ψ(X), qui a pour
espérance I. La proposition 8.18 donne les propriétés importantes de cet estimateur :
il est sans-biais (par linéarité de la moyenne), convergent (par application de la loi
des grands nombres), son risque quadratique moyen est RQM(Iˆn ) = σ 2 /n, où σ 2 =
Var(ψ(X)), qui est fini lorsque E(ψ(X)2 ) < +∞. Cette variance est donnée par :
Z
σ 2 = E(ψ(X)2 ) − E(ψ(X))2 = ψ(x)2 p(x)dx − I 2
Rd
2
f (x)2
Z Z
= dx − f (x)dx . (9.9)
Rd p(x) Rd

Un point remarquable de la méthode est que la variance σ 2 , et donc le risque qua-


dratique moyen, dépend explicitement du choix de la densité p. Comme il y a une
infinité de choix possibles pour la densité p, tout l’art du practicien est de bien choisir
la densité pour “réduire la variance”. Les techniques de réduction de variance pour
les méthodes de Monte Carlo font l’objet d’intenses recherches.

Le théorème de la limite centrale nous renseigne, lorsque E(ψ(X)2 ) < +∞, sur la
distribution de l’erreur Iˆn − I. En procédant comme dans le paragraphe précédent,
on obtient un intervalle de confiance pour I à la quasi-certitude 95% de la forme :
 
ˆ 1,96σ ˆ 1,96σ
In − √ , In + √ .
n n

Ici, la variance σ 2 définie par (9.9) est la plus souvent inconnue, de sorte qu’il faut
estimer sa valeur elle aussi. On définit alors :

n
!1/2
1X
σ̂n = ψ(Xi )2 − Iˆn2 ,
n i=1

qui vérifie σ̂n → σ quand n → +∞ d’après la loi des grands nombres, et on utilise
alors l’intervalle de confiance asymptotique :
 
ˆ 1,96σ̂n ˆ 1,96σ̂n
In − √ , In + √ . (9.10)
n n

L’intervalle (9.10) indique l’erreur de la méthode de Monte-Carlo. Comparée aux


méthodes d’intégration numériques usuelles, la méthode de Monte-Carlo est surtout
intéressante en dimension d grande.
9.4 – Exercices sur le chapitre 9 191

9.4 Exercices sur le chapitre 9

EXERCICE 9.1 Soit (X1 , . . . , Xn ) un n-échantillon de variables aléatoires i.i.d. sui-


vant la loi exponentielle de paramètre θ ∈]0, +∞[.
1. Soit Sn = X1 + · · · + Xn . Quelle est la loi de Sn ?
2. En déduire un intervalle de confiance au niveau 1 − α ∈ (0, 1) pour θ. A l’aide
des quantiles des lois de χ2 donnés dans la Table 9.2, préciser la mise en œuvre
de cet intervalle de confiance pour n = 10 et α = 5%.

EXERCICE 9.2 On veut évaluer la proportion p de foyers d’un pays disposant


d’un poste de télévision et désireux de recevoir les émissions par câble. Ne voulant
pas procéder à un recensement complet de la population, on se propose d’estimer cette
proportion à partir d’un échantillon de taille n prélevé au hasard dans la population
du pays. On définit une variable aléatoire X̄n , dont la réalisation est x̄n , fréquence
observée dans l’échantillon des ménages concernés par la télévision câblée.
1. Préciser l’espérance et la variance de X̄n .
2. Justifier que X̄n converge en un sens à préciser vers p.
3. Soit n = 100 et x̄n = 0,64. Déterminer un intervalle de confiance pour p au
niveau 0,9 en utilisant la borne supérieure du produit p(1 − p). En déduire une
fourchette d’estimation pour p au niveau de confiance 0,9.

EXERCICE 9.3 La loi de Pareto de paramètre de formeα α > 0 et de paramètre


d’échelle β > 0 est donnée par sa densité p(x, (α, β)) = xαβ
α+1 1[β,+∞[ (x). On observe

un n-échantillon (X1 , . . . , Xn ) suivant cette loi.


1. Déterminer l’Estimateur du Maximum de Vraisemblance du couple (α, β).
2. Le paramètre d’échelle β est maintenant supposé connu égal à 1. Vérifier que
si X suit la loi de Pareto de paramètres α et 1, ln(X) suit la loi exponentielle
de paramètre α. En déduire un estimateur de α. Montrer qu’il est convergent
et construire un intervalle de confiance asymptotique de niveau 1 − η pour α.

EXERCICE 9.4 On s’intéresse à la durée de vie de deux composants électroniques


se trouvant sur un système solidaire. Si l’un des deux composants tombe en panne,
le système tout entier doit être changé. Les durées de vie de ces deux composants
sont modélisées par des variables aléatoires exponentielles de paramètres λ et µ
indépendantes. Formellement, on considère un n-échantillon (X1 , . . . , Xn ) de loi E(λ)
et un n-échantillon (Y1 , . . . , Yn ), indépendant du précédent, de loi E(µ), où λ > 0 et
192 Chapitre 9 – Statistique : Intervalle de confiance

µ > 0. On observe seulement la durée de vie du composant qui est tombé en panne,
ce qui veut dire qu’on observe seulement le n-échantillon ((Z1 , W1 ), . . . , (Zn , Wn )) où
Zi = min(Xi , Yi ) et Wi = 1 si Zi = Xi et 0 si Zi = Yi .
1. Donner les lois de Zi et Wi .
2. Montrer que les variables Zi et Wi sont indépendantes.
Les variables aléatoires Zi et Wi étant indépendantes, la vraisemblance du
n-échantillon ((Z1 , W1 ), . . . , (Zn , Wn )) est définie comme étant le produit de la
vraisemblance du n-échantillon (Z1 , . . . , Zn ) par la vraisemblance du n-échantillon
(W1 , . . . , Wn ). Dans les questions 3 à 7, on suppose que la loi de la durée de vie du
second composant est connue, i.e. que µ est connu.
3. Donner l’Estimateur du Maximum de Vraisemblance λ̂n de λ.
4. Montrer que λ̂n est convergent.
5. Calculer Eλ (λ̂n ) et en déduire que Eλ (λ̂n ) tend vers λ lorsque n tend vers
l’infini.
6. Vérifier que λ̂n est asymptotiquement normal et identifier sa variance asymp-
totique.
7. Donner un intervalle de confiance bilatéral symétrique asymptotique de niveau
1 − α pour λ.
8. Donner l’Estimateur du Maximum de Vraisemblance (λ̂n , µ̂n ) de (λ, µ).
Chapitre 10

Statistique : Test

The true logic for this world is the calculus of Probabilities, which takes account of
the magnitude of the probability which is, or ought to be, in a reasonable man’s mind.

J. Clerk Maxwell

L’objectif d’un test d’hypothèse est de répondre à une question qu’on peut poser
de la manière suivante : au vu de l’observation d’un n-échantillon, le paramètre θ du
modèle est-il ou non dans un sous-ensemble de Θ appelé hypothèse nulle et noté H0 ?
On retrouve cette situation fréquemment :
- Lors d’un sondage d’intensition de vote sur un échantillon de 1000 personnes, on
trouve que 520 personnes déclarent vouloir voter pour A et 480 pour B. Il est naturel
d’annoncer que A sera élu. Mais est-ce que la marge d’erreur est suffisante pour
pouvoir faire une telle annonce sans (trop de) risque de se tromper ? En fait, on est
en train d’estimer le paramètre d’une loi de Bernoulli (qui représente l’intention de
vote pour le candidat A) et de tester l’hypothèse : le paramètre est-il plus grand que
1/2 ?
- Si on s’intéresse au changement climatique, on peut par exemple travailler sur les
données de température moyenne au mois d’août à Paris. Sur l’ensemble du vingtième
siècle, ces températures moyennes en degrés Celsius sont distribuées suivant une loi
gaussienne d’espérance 20 et de variance 1,4. Sur les quinze dernières années, on a

193
194 Chapitre 10 – Statistique : Test

observé les températures moyennes suivantes (données fictives) :


x1 x2 x3 x4 x5 x6 x7 x8 x9 x10 x11 x12 x13 x14 x15
22 19 21 20 18 22 21 18 20 25 21 19 23 20 22
telles que la moyenne empirique est x15 = 20,73 et la variance empirique non-biaisée
est v15 = 1,912 . On voit bien que la moyenne empirique sur les quinze dernières
années dépasse 20, ce qui indiquerait plutôt qu’il y a un réchauffement, mais on ne
peut pas en être absolument sûr. A partir des observations, on souhaite construire
un test d’hypothèse qui permette de décider s’il y a réchauffement ou pas (i.e., si
la température moyenne a effectivement augmenté ces quinze dernières années par
rapport à l’ensemble du vingtième siècle, ou pas). On comprend bien ici que quelle que
soit la décision qu’on prenne, on peut se tromper. On peut se tromper en annonçant
qu’il y a réchauffement, alors qu’il n’y en a pas. On peut se tromper en annonçant
qu’il y n’a pas de réchauffement, alors qu’il y en a.

10.1 Tests et erreurs

On considère X = (X1 , . . . , Xn ) un n-échantillon du modèle statistique P =


{Pθ , θ ∈ Θ}. Soit (H0 , H1 ) une partition de l’ensemble Θ des paramètres.

On appelle test d’hypothèse une règle de décision qui, au vu de l’observation X,


permet de décider si θ est dans l’ensemble H0 appelé hypothèse nulle ou si θ est dans
l’ensemble H1 appelé hypothèse alternative.

Un test est déterminé par sa région critique W qui constitue un sous-ensemble


(mesurable) de l’ensemble X n des valeurs possibles de X. La règle de décision du test
associé à W est la suivante. Lorsqu’on observe x = (x1 , . . . , xn ),
- si x ∈ W , alors on rejette H0 et on accepte H1 i.e. on décide que θ ∈ H1 ,
- si x 6∈ W , alors on accepte H0 et on rejette H1 i.e. on décide que θ ∈ H0 .

On appelle erreur de première espèce le rejet de H0 à tort. C’est la situation où


l’échantillon suivait la loi Pθ pour un certain θ ∈ H0 , mais on a annoncé qu’on rejetait
H0 . Cette erreur est mesurée par le risque de première espèce, qui est la fonction :
θ ∈ H0 7→ Pθ (X ∈ W ).

On appelle erreur de seconde espèce le rejet de H1 à tort. Cette erreur est mesurée
par le risque de seconde espèce : θ ∈ H1 7→ Pθ (X ∈ W c ) = 1 − Pθ (X ∈ W ). La
fonction θ ∈ H1 7→ Pθ (X ∈ W ) s’appelle puissance du test.

Exemple 10.1 On considère modèle P = {N (µ, σ 2 ), µ ∈ {µ0 , µ1 }} avec σ 2 > 0


connu et µ0 > µ1 , on souhaite tester H0 = {µ = µ0 } contre H1 = {µ = µ1 }. On va
10.1 – Tests et erreurs 195

0.8

0.6

risque
0.4

0.2
type 1 α(a)
type 2 β(a)
0
-1 -0.5 0 0.5 1 1.5 2
a

Figure 10.1 – Risques de première et deuxième espèce pour l’exemple 10.1 en fonction
du seuil a avec µ0 = 1, µ1 = 0, σ = 0, et n = 10.

bien sûr accepter H0 (resp. H1 ) si la moyenne empirique X n est grande (resp. petite),
c’est-à-dire choisir la région critique de la forme W = {X n < a} pour un certain a.
En utilisant le fait que sous H0 , la moyenne empirique X n suit la loi N (µ0 , σ 2 /n),
le risque de première espèce est :
√ a − µ 
0
α(a) = P(µ0 ,σ2 ) (W ) = P(µ0 ,σ2 ) (X n < a) = Φ n ,
σ
avec Φ la fonction de répartition de la loi gaussienne centrée réduite. Le risque de
seconde espèce est :
√ a − µ  √ µ − a 
1 1
β(a) = P(µ1 ,σ2 ) (W c ) = P(µ1 ,σ2 ) (X n ≥ a) = 1 − Φ n =Φ n .
σ σ
Il est clair que a → α(a) est croissante alors que a → β(a) est décroissante. On
dessine sur la figure 10.1 les deux erreurs en fonction du seuil a choisi.

Idéalement, on voudrait minimiser les risques de première et de deuxième espèce.


Mais ceci n’est pas possible en même temps, comme le montre l’exemple précédent.
Par convention, on minimise en priorité le risque de première espèce.

Définition 10.2 Le niveau d’un test défini par sa région critique W est le nombre

α = sup Pθ (W ).
θ∈H0

Si un test est de niveau α, alors on sait que, lorsqu’on rejette H0 , on a au plus une
probabilité α de se tromper. Parmi tous les tests de niveau inférieur à un seuil α
fixé, on souhaite minimiser le risque de seconde espèce ou de manière équivalente
maximiser la puissance. En général, on choisit α = 10%, α = 5%, ou α = 1%.
196 Chapitre 10 – Statistique : Test

Comme on décide de minimiser en priorité le risque de première espèce, les rôles


de l’hypothèse nulle H0 et de l’hypothèse alternative H1 ne sont pas symétriques. Le
choix de H0 parmi deux ensembles constituant une partition de Θ dépend donc du
problème considéré : on choisit comme hypothèse nulle l’ensemble qu’on ne souhaite
surtout pas voir rejeté à tort. Mais c’est une question de point de vue : dans le cadre
d’un test sur le réchauffement climatique, un politicien peut vouloir mettre comme
hypothèse nulle l’absence d’un réchauffement, car il ne veut surtout pas s’engager
dans un protocole contraignant si le réchauffement n’est pas avéré. Un écologiste peut
vouloir mettre comme hypothèse nulle l’existence d’un réchauffement, car il estime
que les effets d’un réchauffement seraient catastrophiques.

Définition 10.3 Soit (Wn )n une suite de régions critiques où n désigne la taille de
l’échantillon. La suite de tests basée sur (Wn )n est dite
- convergente si, pour tout θ ∈ H1 ,
lim Pθ (Wn ) = 1.
n→+∞

- de niveau asymptotique α si
lim sup Pθ (Wn ) = α.
n→+∞ θ∈H0

Souvent on utilise un estimateur aux bonnes propriétés connues pour construire


le test et guider le choix de la région critique.

Exemple 10.4 On reprend l’exemple 10.1. La région critique est de la forme Wn =


{X n < a}. Le choix a = (µ0 + µ1 )/2, qui peut sembler naturel, ne permet pas de
contrôler le risque de première espèce. Pour obtenir ce contrôle de la probabilité de
rejeter H0 à tort, on utilise le fait que sous H0 , la moyenne empirique X n suit la loi
N (µ0 , σ 2 /n). Donc on a
√ a − µ 
0
P(µ0 ,σ2 ) (Wn ) = P(µ0 ,σ2 ) (X n < a) = Φ n .
σ
En désignant par Φ−1 (r) le √quantile d’ordre r de la loi gaussienne centrée réduite,
le choix a = µ0 + σΦ−1 (α)/ n assure que le niveau du test est α. Pour ce choix, la
probabilité de rejeter H1 à tort est
√ µ − µ 
1 0
P(µ1 ,σ2 ) (Wnc ) = P(µ1 ,σ2 ) (X n ≥ a) = Φ n − Φ−1 (α) ,
σ
qui vérifie
P(µ1 ,σ2 ) (Wnc ) ≤ Φ − Φ−1 (α) = 1 − Φ Φ−1 (α) = 1 − α .
 

De plus P(µ1 ,σ2 ) (Wnc ) = E 1[Φ−1 (α)+√n(µ0 −µ1 )/σ,+∞[ (Z) (pour Z une v.a. de loi
gaussienne centrée réduite) converge vers zéro lorsque n tend vers l’infini d’après
le théorème de convergence dominée, ce qui montre que le test est convergent.
10.2 – Modèle gaussien 197

10.2 Modèle gaussien

On considère le modèle gaussien P = {N (µ, σ 2 ), µ ∈ R, σ 2 ∈]0, +∞[}. On va


proposer des tests pour la moyenne et pour la variance.

10.2.1 Tests pour la moyenne µ

Soit µ0 ∈ R. On souhaite tester H0 = {µ = µ0 } contre H1 = {µ 6= µ0 } au niveau


α ∈]0, 1[. Pn Pn
1
D’après la proposition 9.4, si X n = n1 i=1 Xi et Vn = n−1 2
i=1 (Xi −X n ) désignent
respectivement la moyenne empirique et l’estimateur empirique non-biaisé de la va-
riance, le rapport
√ X n − µ0
ζn = n √
Vn
suit la loi de Student Tn−1 sous H0 (i.e. si µ = µ0 ).
Sous H1 , par la loi forte des grands nombres, X n − µ0 converge presque sûrement
vers µ − µ0 6= 0 et Vn converge presque sûrement vers σ 2 > 0. Donc ζn tend presque
sûrement vers +∞ ou −∞ lorsque n → +∞, suivant que µ > µ0 ou µ < µ0 .
On choisit donc Wn = {|ζn | > a} pour la région critique. On note tr (n − 1) le quantile
d’ordre r de la loi de Student Tn−1 . Si a ≥ t1−α/2 (n − 1), alors pour tout σ 2 > 0 :

P(µ0 ,σ2 ) (Wn ) = P(µ0 ,σ2 ) (|ζn | > a) ≤ P(µ0 ,σ2 ) (|ζn | > t1−α/2 (n − 1)) = α ,

ce qui montre que le niveau du test est inférieur à α. Comme on souhaite ensuite
minimiser le risque de seconde espèce P(µ,σ2 ) (Wn ) pour µ 6= µ0 , on choisit au plus
juste a = t1−α/2 (n − 1). En conclusion, on choisit la région critique Wn = {|ζn | >
t1−α/2 (n − 1)} et on a alors P(µ0 ,σ2 ) (Wn ) = α pour tout σ 2 > 0. Notons que lorsque
n → +∞, t1−α/2 (n − 1) converge vers Φ−1 (1 − α/2), le quantile d’ordre 1 − α/2
de la loi gaussienne centrée réduite. Donc,par le théorème de convergence dominée,
P(µ,σ2 ) (Wn ) = E(µ,σ2 ) 1]t1−α/2 (n−1),∞[ (ζn ) tend vers 1 lorsque n tend vers l’infini.
Ainsi le test est convergent.

On peut reprendre le raisonnement précédent pour construire un test de niveau α


pour H0 = {µ ≤ µ0 } et H1 = {µ > µ0 }. La région critique est alors {ζn ≥ t1−α (n−1)}.

Exemple 10.5 On reprend l’exemple des données de température moyenne au mois


d’août à Paris.

1) On souhaite tester l’hypothèse nulle H0 = {µ ≤ 20} (absence de réchauffement


climatique) contre H1 = {µ > 20} (existence d’un réchauffement climatique). C’est
le point de vue d’un politicien comme on le décrivait ci-dessus. La région critique est
198 Chapitre 10 – Statistique : Test


{ζn ≥ t1−α (n − 1)} avec ζn = n X√n V−µ0 , µ0 = 20 et n = 15. On observe ζ15obs
=
√ n

15(20,73 − 20)/1,91 = 1,48. Comme t0,95 (14) = 1,76, on accepte H0 au niveau


α = 5%. On peut donc conclure qu’il n’y a pas de réchauffement climatique.

2) On souhaite tester l’hypothèse nulle H0 = {µ > 20} (existence d’un


réchauffement climatique) contre H1 = {µ ≤ 20} (absence de réchauffement cli-
matique). C’est le point de vue d’un écologiste comme on le décrivait ci-dessus. La

région critique est {ζn ≤ tα (n − 1)} avec ζn = n X√n V−µ0 , µ0 = 20 et n = 15. On
obs
√ n

observe ζ15 = 15(20,73 − 20)/1,91 = 1,48. Comme t0,05 (14) = −1,76, on accepte
H0 au niveau α = 5%. On peut donc conclure qu’il y a réchauffement climatique.

3) Supposons maintenant que les données de température moyenne au mois d’août


à Paris aient la forme :

x1 x2 x3 x4 x5 x6 x7 x8 x9 x10 x11 x12 x13 x14 x15


22 19 21 20 20 22 24 18 20 25 21 19 24 20 23

telles que la moyenne empirique est x15 = 21,20 et la variance empirique non-
biaisée est v15 = 2,082 . On prend pour hypothèse nulle H0 = {µ ≤ 20} (absence
de réchauffement climatique) contre √H1 = {µ > 20} (existence d’un réchauffement
obs
climatique). On observe alors ζ15 = 15(21,20−20)/2,08 = 2,25. Comme t0,95 (14) =
1,76, on rejette H0 au niveau α = 5%. Ainsi on peut conclure à l’augmentation des
températures sur les quinze dernières années. Mais si on s’impose le niveau α = 1%,
alors on accepte H0 , car t0,99 (14) = 2,62.

Comme le montre l’exempe précédent :


- Quand les données n’apportent que peu d’information, on va toujours accepter l’hy-
pothèse nulle, afin d’éviter de commettre une erreur de première espèce (rejeter à tort
l’hypothèse nulle).
- Quand les données sont informatives, mais qu’on impose un niveau α très proche
de 0, on va aussi toujours accepter l’hypothèse nulle, car c’est la seule manière d’être
quasi-certain de ne pas commettre une erreur de première espèce.
Tout ceci montre bien que le choix de l’hypothèse nulle est fondamental.

10.2.2 Tests pour la variance σ 2

Soit σ02 > 0. On souhaite tester H0 = {σ 2 ≥ σ02 } contre H1 = {σ 2 < σ02 }. On


introduit
(n − 1)Vn
ζn = .
σ02
10.3 – Test du χ2 (test du chi-deux) 199

Comme d’après la proposition 9.4, (n − 1)Vn /σ 2 suit la loi χ2n−1 sous P(µ,σ2 ) , ζn
prend des valeurs de plus en plus grandes lorsque σ 2 croı̂t. En particulier ζn va avoir
tendance à prendre des valeurs plus grandes sous H0 que sous H1 . C’est pourquoi on
acceptera H0 si ζn est grand et on rejettera H0 si ζn est petit. On choisit donc une
région critique de la forme Wn = {ζn ≤ a}. En outre, si Z ∼ χ2n−1 , alors

 (n − 1)V
n σ02 
sup P(µ,σ2 ) (ζn ≤ a) = sup P(µ,σ2 ) ≤a
(µ,σ 2 )∈H0 µ∈R,σ 2 ≥σ02 σ2 σ2
 σ2 
= sup P Z ≤ a 02 = P(Z ≤ a).
σ 2 ≥σ02 σ

Le choix a = xα (n − 1) où xr (n − 1) désigne le quantile d’ordre r de la loi χ2n−1 assure


que le niveau du test est α.

10.3 Test du χ2 (test du chi-deux)

Le test du χ2 permet de répondre à des questions telles que “Un dé à six faces
est-il pipé ?” Pour cela on observe les fréquences d’apparition des faces lors de n
lancers de ce dé et on les compare au vecteur (1/6, . . . , 1/6). Si on constate qu’on
s’éloigne significativement de ce vecteur, on peut rejeter l’hypothèse que le dé est
équilibré et annoncer que le dé est pipé. La question est de savoir ce qu’on entend par
“significativement”.

10.3.1 Test d’adéquation à une loi

On observe un n-échantillon (X1 , . . . , Xn ) de variables aléatoires indépendantes


et identiquement distribuées à valeurs dans un espace fini X = {a1 , . . . , ak }. La loi
est paramétrée par θ = (θ1 , . . . , θk ) avec Pθ (X1 = aj ) = θj pour j ∈ {1, . . . , k}.
Pk
Le paramètre θ vit dans l’ensemble Θ = {θ ∈ [0, 1]k , i=1 θi = 1}. Pour θ (0) ∈ Θ
fixé, on souhaite tester l’hypothèse nulle H0 = {θ (0) } contre l’hypothèse alternative
H1 = Θ\{θ (0) }.

Exemple 10.6 Dans le cas du dé à six faces évoqué plus haut, X = {1, . . . , 6} et
θ (0) = (1/6, . . . , 1/6).

On peut déterminer l’EMV de θ et ses propriétés.


200 Chapitre 10 – Statistique : Test

Proposition 10.7 L’EMV de θ est donné par le vecteur des fréquences empiriques
d’apparition des différentes valeurs possibles :
 N (X) n
1 Nk (X)  X
θ̂ n = ,..., , Ni (x) = 1ai (xj ), (10.1)
n n j=1

avec la notation 1a (x) = 1 si x = a et 0 sinon. L’EMV est non-biaisé, convergent,


asymptotiquement normal : Sous Pθ ,
√  n→+∞
n θ̂ n − θ −→ N (0, C(θ)), (10.2)

en loi, avec
θj − θj2 si j = j 0 ,

C(θ) jj 0 = (10.3)
−θj θj 0 6 j0.
si j =

Preuve. La vraisemblance et la log-vraisemblance sont égales à :


k
n Y 
Y 1ai (xj )
pn (x, θ) = θi ,
j=1 i=1
k
X
ln (x, θ) = Ni (x) ln(θi ). (10.4)
i=1

La log-vraisemblance peut aussi écrire :


X
ln (x, θ) = n ρi (x) ln(θi ), (10.5)
i∈K(x)

où K(x) = {i = 1, . . . , k : Ni (x) > 0} et on note


 N (x) Nk (x) 
1
ρ(x) = ,..., . (10.6)
n n
S’il existe i ∈ K(x) tel que
R y θi = 0, alors ln (x, θ) = −∞. Si θi > 0 pour tout i ∈ K(x),
comme ln(y) = y − 1 + 1 (1/z − 1)dz ≤ y − 1 pour tout y > 0 (avec inégalité stricte
dès que y 6= 1), on en déduit que :
 θ 
i
X
ln (x, θ) − ln (x, ρ(x)) = n ρi (x) ln
ρi (x)
i∈K(x)
 θ 
i
X X X
≤ n ρi (x) −1 =n θi − n ρi (x)
ρi (x)
i∈K(x) i∈K(x) i∈K(x)
X
= n θi − n ≤ 0.
i∈K(x)
10.3 – Test du χ2 (test du chi-deux) 201

La seconde inégalité est stricte dès que θ 6= ρ(x). Ceci montre que ρ(x) maximise la
vraisemblance et que l’estimateur du maximum de vraisemblance de θ est (10.1).
L’EMV θ̂ n est non-biaisé car :

Eθ (Nj (X)) = nEθ (1aj (X1 )) = nPθ (X1 = aj ) = nθj .

On trouve aussi que l’EMV est convergent en appliquant la loi forte des grands
nombres.
En utilisant le fait que

Covθ (1aj (X1 ), 1aj0 (X1 )) = Eθ (1aj (X1 )1aj0 (X1 )) − Eθ (1aj (X1 ))Eθ (1aj0 (X1 ))

qui est égal à C(θ)jj 0 défini par (10.3), on montre par le théorème de la limite cen-
trale vectoriel que l’EMV est asymptotiquement normal avec C(θ) pour matrice de
covariance asymptotique. 

Ce résultat va nous permettre de construire un test. On suppose dorénavant que


les coefficients de θ (0) sont tous non-nuls. L’idée qui est à la base du test est que le
vecteur θ̂ n est censé être plus proche de θ (0) sous H0 que sous H1 . Afin de quantifier
la “proximité”, on utilise la pseudo-distance du χ2 :
k (0)
X (θ̂n,j − θj )2
ζn = n (0)
. (10.7)
j=1 θj

On obtient le comportement asymptotique suivant :

Proposition 10.8 Soit ζn défini par (10.7).


1) Sous H0 , ζn converge en loi quand n → +∞ vers une variable aléatoire Z qui suit
une loi de χ2 à k − 1 degrés de liberté.
2) Sous H1 , ζn tend presque sûrement vers +∞.

Preuve. Sous H1 , les observations sont indépendantes et identiquement distribuées


(0)
de loi Pθ pour un certain θ 6= θ (0) . Donc il existe j ∈ {1, . . . , k} tel que θj 6= θj . Par
n
la loi forte des grands nombres, Pθ -presque sûrement, θ̂n,j = n1 i=1 1aj (Xi ) converge
P
(0)
(θ̂n,j −θj )2
vers θj , et donc n (0) tend vers +∞.
θj

Sous H0 , les observations sont indépendantes et identiquement distribuées de loi


Pθ(0) . D’après (10.2), la suite de vecteurs aléatoires
(0) (0)
 θ̂ −θ
n,1 θ̂n,k − θ 
Yn = q 1 ,..., q k
(0) (0)
θ1 θk
202 Chapitre 10 – Statistique : Test

(0) (0)
converge en loi vers un vecteur aléatoire Y de loi N (0, C(0) ) avec Cjj = 1 − θj
q
(0) (0) (0)
et Cjj 0 = − θj θj 0 si j 6= j 0 . Autrement dit, C(0) = I − e1 et1 où e1 est
q
(0)
le vecteur unitaire de coordonnées e1,j = θj . Par continuité de l’application
y ∈ Rk 7→ kyk2 ∈ R+ , ζn = kYn k2 converge en loi vers kY k2 . Tout le travail consiste
maintenant à identifier la loi de cette limite. Donnons-nous une base (e1 , . . . , ek ) de
Rk dont le premier vecteur est e1 décrit précédemment. Appelons U la matrice k × k
orthogonale de vecteurs lignes donnés par les ej , et Z le vecteur aléatoire donné par
Z = UY . D’une part, on a kY k = kZk. D’autre part, Z est un vecteur gaussien de
moyenne nulle et de matrice de covariance UC(0) Ut = I − (Ue1 )(Ue1 )t . Or Ue1 = e1
et donc UC(0) Ut est la matrice diagonale de coefficients diagonaux (0, 1, . . . , 1). Ceci
montre que Z1 = 0 p.s. et que les Zi , i = 2, . . . , k sont indépendantes et identiquement
distribuées selon la loi gaussienne centrée réduite. Par conséquent la loi limite de ζn
est la loi χ2k−1 . 

En notant xr (k − 1) le quantile d’ordre r de la loi χ2 à k − 1 degrés de liberté, on


a P(Z ≥ x1−α (k − 1)) = α. On en déduit le corollaire suivant :

Corollaire 10.9 Le test de région critique Wn = {ζn > x1−α (k − 1)} est convergent
de niveau asymptotique α.

Preuve. Sous H1 , on déduit de la proposition 10.8 que 1[x1−α (k−1),+∞[ (ζn ) converge
Pθ -presque sûrement vers 1. Le théorème de convergence dominée entraı̂ne alors que
  n→+∞
Pθ ζn ≥ x1−α (k − 1) = Eθ 1[x1−α (k−1),+∞[ (ζn ) −→ Eθ (1) = 1,
ce qui assure que le test est convergent. Pour vérifier
 que son niveau asymptotiqueest
α, il suffit de vérifier que Pθ(0) ζn ≥ x1−α (k −1) converge vers P Z ≥ x1−α (k −1) =
α lorsque n tend vers l’infini, où Z est de loi χ2k−1 . Or, c’est vrai d’après le corollaire
7.23 car Z est à densité. 

En pratique, on considère que l’approximation en loi par χ2k−1 est valide sous H0
(0)
si n minj=1,...,k θj ≥ 5. Si cette condition n’est pas satisfaite, on peut regrouper les
(0)
valeurs de aj pour lesquelles θj est trop faible et augmenter ainsi le minimum (on
appliquera cette procédure dans l’exemple 10.14).

Le principe du test du χ2 se généralise à des lois arbitraires, pas nécessairement à


valeurs dans un espace fini. Il suffit de considérer une partition finie (Ai )i=1,...,k de X
(0) (0)
telle que Pθ(0) (X1 ∈ Aj ) = θ̃j avec n minj=1,...,k θ̃j ≥ 5. On peut alors regrouper
les observations sous la forme :
n
1X
θ̂n,i = 1A (Xj ), i = 1, . . . , k .
n j=1 i
10.3 – Test du χ2 (test du chi-deux) 203

ζ̃n défini par :


k (0)
X (θ̂n,j − θ̃j )2
ζ̃n = n (0)
j=1 θ̃j
satisfait la proposition 10.8, ce qui permet de construire un test comme dans le co-
rollaire 10.9.

Exemple 10.10 On considère un dé à 6 faces. On souhaite tester au niveau 5% si


le dé n’est pas pipé. Donc ici X = {1, . . . , 6} et H0 = {(1/6, . . . , 1/6)}.
Lors de n = 100 lancers du dé on observe les résultats suivants : N1 = 20, N2 = 13,
obs
N3 = 17, N4 = 12, N5 = 23, N6 = 15. On obtient ζ100 = 5,36. Sous l’hypothèse
H0 (“le dé n’est pas pipé”), ζ100 suit une loi de χ à 5 degrés de liberté. Si Z ∼ χ25 ,
2
obs
on a P(Z ≥ 11,07) = 0,05. Comme ζ100 < 11,07, on accepte donc, au niveau 5%,
l’hypothèse que le dé n’est pas pipé.
Lors de n = 1000 lancers du dé on observe les résultats suivants : N1 = 200, N2 = 130,
obs
N3 = 170, N4 = 120, N5 = 230, N6 = 150. On obtient ζ1000 = 53,6. Comme
obs
ζ1000 > 11,07, on rejette, au niveau 5%, l’hypothèse que le dé n’est pas pipé, autrement
dit, on affirme que le dé est pipé.
Dans le premier cas où n = 100, les proportions observées étaient les mêmes que
dans le second cas où n = 1000, mais on a cependant accepté l’hypothèse que le dé
n’était pas pipé car on n’avait pas assez de données pour rejeter avec suffisamment
d’assurance cette hypothèse.

10.3.2 Test d’adéquation à une famille de lois

Nous discutons ici une généralisation du test précédent qui permet entre autres
de répondre à une question du type : les observations sont-elles géométriques, gaus-
siennes, etc ? Il ne s’agit plus de tester l’adéquation d’observations à une loi donnée,
mais à une famille de lois.

On observe toujours un n-échantillon (X1 , . . . , Xn ) de variables aléatoires


indépendantes et identiquement distribuées à valeurs dans un espace fini X =
{a1 , . . . , ak }. La loi est paramétrée par θ = (θ1 , . . . , θk ) avec Pθ (X1 = aj ) = θj pour
Pk
j ∈ {1, . . . , k}. Le paramètre θ vit dans l’ensemble Θ = {θ ∈ [0, 1]k , i=1 θi = 1}. On
souhaite tester l’hypothèse nulle H0 contre H1 = Θ\H0 pour un certain sous-ensemble
H0 ⊂ Θ.

Exemple 10.11 On considère n = 200 rouleaux d’un jeu de grattage contenant 100
tickets chacun. Pour k = 1, . . . , n, on observe Xk le nombre de tickets gagnants dans
le kème rouleau. On veut tester l’hypothèse H0 =“la loi du nombre de tickets ga-
gnants par rouleau est une binomiale” (en d’autres mots, on veut vérifier si les tickets
204 Chapitre 10 – Statistique : Test

gagnants sont bien uniformément répartis dans les rouleaux, sans présumer de la pro-
portion
 de tickets gagnants). Ici X = {0, . . . , 100} et H0 = {θ ∈ Θ, ∃p ∈ [0, 1] , θj =
100 j 100−j
j p (1 − p) ∀j = 0, . . . , 100}.

Pour être plus précis, on va paramétrer l’ensemble des lois qui forment l’hypothèse
nulle sous la forme H0 = {θ π , π ∈ Π}, où
- Π est une partie d’intérieur non vide de Rh avec h < k − 1,
- π 7→ θ π est une application de Π dans Θ.

Exemple 10.12 On reprend l’exemple 10.11. Ici on peut paramétrer H


 0 j avec
l’ensemble Π = [0, 1] et l’application θp : p ∈ [0, 1] 7→ θj = 100
j p (1 −

p)100−j j=0,...,100 ∈ Θ.

L’idée consiste alors à utiliser un estimateur π̂ n de π à valeurs dans Π (très


souvent, ce sera l’EMV de π) et à comparer les vecteurs θ̂ n défini par (10.1) et θ π̂n .
Si ces vecteurs sont suffisamment proches, on pourra accepter l’hypothèse H0 . Encore
une fois, la question essentielle est de savoir ce que veut dire “suffisamment proches”.

Proposition 10.13 Soit


k
X (θ̂n,j − θjπ̂n )2
ζn = n .
j=1 θjπ̂n

Sous des hypothèses de régularité non-précisées (vérifiées en général lorsque θ̂ n est


l’EMV de θ et π̂ n est l’EMV de π) :
- Sous H0 , ζn converge en loi vers Z ∼ χ2k−h−1 .
- Sous H1 , ζn tend presque sûrement vers +∞.

Il est essentiel de noter que le nombre de degrés de liberté dans la limite en loi
sous H0 est k − h − 1 et non plus k − 1 comme dans le test d’adéquation à une loi
donnée. En effet, il faut estimer le paramètre π ce qui réduit le nombre de degrés de
liberté.

Finalement, en procédant comme pour le corollaire 10.9, on conclut que le test de


région critique Wn = {ζn ≥ x1−α (k − h − 1)} est convergent de niveau asymptotique
α, avec xr (k − h − 1) le quantile d’ordre r de la loi χ2 à k − h − 1 degrés de liberté.

Exemple 10.14 On reprend l’exemple 10.11-10.12. On note Ni = Card(k =


1 . . . , 200 , Xk = i) et on observe :
i 0 1 2 3 4 5 6 7 8 9 10 11 12 ≥ 13
Ni 1 7 14 29 36 41 26 17 17 8 1 1 2 0
10.3 – Test du χ2 (test du chi-deux) 205

L’EMV de p est (voir l’exercice 8.4) :


P200 P
k=1 Xk i iNi
p̂200 = = ' 0,05.
100 × 200 100 × 200
On regroupe par paquets de tailles supérieures à 5 :
i ≤1 2 3 4 5 6 7 8 ≥9
Ni 8 14 29 36 41 26 17 17 12
200θip̂200 7,45 16,29 27,97 35,67 36,00 29,97 21,16 12,93 12,55

et donc, avec θ̂200,i = Ni /200,


i ≤1 2 3 4 5 6 7 8 ≥9
θ̂200,i 0,0400 0,0700 0,1450 0,1800 0,2050 0,1300 0,0850 0,0850 0,0600
θip̂200 0,0372 0,0814 0,1399 0,1783 0,1800 0,1499 0,1058 0,0647 0,0627
On calcule
obs
200
X (θ̂200,j − θjp̂200 )2
ζ200 = 200 ' 3,74 .
j=1 θjp̂200
Or ici on a 9 − 1 − 1 = 7 degrés de liberté, le seuil pour le test {ζ200 ≥ x0,95 (7)} au
obs
niveau 0,05 est x0,95 (7) = 14,07. Comme on a ζ200 < x0,95 (7), on accepte l’hypothèse
nulle “la loi du nombre de tickets gagnants par rouleau est une binomiale”.

Exemple 10.15 On considère les résultats au concours de l’X de deux lycées :

Admis Recalés Présentés


Henri IV 81 17 98
Le Parc 136 17 153
Total 217 34 251

On désire tester l’hypothèse selon laquelle les élèves des deux lycées ont le même taux
de réussite à l’X.

Ici chaque observation est de la forme (Xi , Yi ) où Xi est à valeurs dans {H, L}
et Xi = H, resp. L, signifie que l’étudiant vient du lycée H, resp. lycée L, et Yi
est à valeurs dans {A, R} et Yi = A, resp. R, signifie que l’étudiant a été admis,
resp. a été recalé. L’ensemblePΘ de toutes les lois possibles est de la forme Θ =
{(θjl )j∈{H,L},l∈{A,R} ∈ [0, 1]4 , jl θjl = 1} et l’hypothèse nulle est de la forme H0 =
{(θjl )j∈{H,L},l∈{A,R} , θHA = qp, θLA = (1 − q)p, θHR = q(1 − p), θLR = (1 − q)(1 −
p), p ∈ [0, 1], q ∈ [0, 1]}, qui contient toutes les lois pour lesquelles le taux d’admission
p (inconnu) ne dépend pas du lycée. La pseudo-distance du χ2 est

obs
X (θ̂jl − q̂j p̂l )2
ζ251 = 251 ,
q̂j p̂l
j∈{H,L},l∈{A,R}
206 Chapitre 10 – Statistique : Test

avec
98 153 217 34
q̂H =, q̂L = , p̂A = , p̂R = ,
251 251 251 251
81 17 136 17
θ̂HA = , θ̂HR = , θ̂LA = , θ̂LR = .
251 251 251 251
obs
On trouve : ζ251 = 1,98. Or ici on a 4 − 2 − 1 = 1 degré de liberté, le seuil pour le test
obs
{ζ251 ≥ x0,95 (1)} au niveau 0,05 est x0,95 (1) = 3,84. Comme on a ζ251 < x0,95 (1), on
accepte l’hypothèse nulle que les deux lycées ont le même taux de réussite.

On peut voir le dernier exemple comme un test d’indépendance (on teste


l’indépendance du taux de réussite et du lycée d’origine). Il peut se généraliser comme
on l’explique ci-dessous.

10.3.3 Test d’indépendance

Ici on suppose que les observations sont des paires (Xi , Yi ), par exemple taux
de réussite au concours et lycée d’origine, ou encore température et hygrométrie
journalières, et on se demande si ces deux quantités sont indépendantes. On
peut construire un test d’indépendance qui est en fait un cas particulier du test
d’adéquation à une famille de lois qu’on vient de présenter.

On observe un n-échantillon ((Y1 , Z1 ), . . . , (Yn , Zn )) de vecteurs aléatoires indépendants


et identiquement distribués, avec Yi à valeurs dans {b1 , . . . , bd } et Zi à valeurs dans
{c1 , . . . , cm }. On pose Xi = (Yi , Zi ) à valeurs dans l’espace fini X = {b1 , . . . , bd } ×
{c1 , . . . , cm } de cardinal dm. On note θ = (θjl , 1 ≤ j ≤ d, 1 ≤ l ≤ m) où
Pθ (Yi = bj , Zi = cl ) = θjl . L’ensemble H0 des θ qui donnent des lois Pθ de
forme produit correspondant à l’indépendance de Yi et Zi peut être paramétré par
H0 = {θ π , π ∈ Π}, avec
 (1) (2)

 πj πl si 1 ≤ j ≤ d − 1, 1 ≤ l ≤ m − 1,
 1 − Pd−1 π (1) π (2)

si j = d, 1 ≤ l ≤ m − 1,
π j 0 =1 j 0 l
θjl = (1) Pm−1 (2) 
π
 j P

 1 − π
l0 =1 l0 si 1 ≤ j ≤ d − 1, l = m,
d−1 (1)  Pm−1 (2) 
1 − j 0 =1 πj 0 1 − l0 =1 πl0

si j = d, l = m,
et n
(1) (2) 
Π= π = πj ∈ [0, 1], 1 ≤ j ≤ d − 1, πl ∈ [0, 1], 1 ≤ l ≤ m − 1 ,
Pd−1 (1) Pm−1 (2) o
avec j=1 πj ≤ 1, l=1 πl ≤ 1 ,

qui est une partie d’intérieur non-vide de Rd+m−2 . On pose


n n n
1X (1) 1X (2) 1X
θ̂jl = 1(b ,c ) (Yi , Zi ), π̂j = 1b (Yi ), π̂l = 1c (Zi ) .
n i=1 j l n i=1 j n i=1 l
10.4 – Exercices sur le chapitre 10 207

(1) (2) (1)


Notons que l’EMV de π = (πj , 1 ≤ j ≤ d − 1, πl , 1 ≤ l ≤ m − 1) est π̂ = (π̂j , 1 ≤
(2)
j ≤ d − 1, π̂l , 1 ≤ l ≤ m − 1). On note
d X
m (1) (2)
X (θ̂jl − π̂j π̂l )2
ζn = n (1) (2)
j=1 l=1 π̂j π̂l

(avec la convention que les termes de la somme pour lesquels le dénominateur est
nul sont nuls). ζn mesure la “distance” entre la matrice θ̂ des fréquences des couples
(bj , cl ) et la matrice π̂ des produits des fréquences marginales. On comprend que, si
les deux coordonnées Yi et Zi sont indépendantes, θ̂ et π̂ doivent être proches. Donc
on rejettera l’hypothèse H0 d’indépendance si ζn est grand. Plus quantitativement,
comme la dimension h de Π est d + m − 2, on a k − h − 1 = dm − d − m + 1 =
(d − 1)(m − 1). On rejette l’hypothèse H0 d’indépendance au niveau α si ζn dépasse
x1−α ((d − 1)(m − 1)) et on l’accepte sinon, où x1−α ((d − 1)(m − 1)) le quantile d’ordre
1 − α de la loi χ2 à (d − 1)(m − 1) degrés de liberté. L’exemple 10.15 est un cas
particulier d’application de cette méthode, avec d = m = 2.

10.4 Exercices sur le chapitre 10

EXERCICE 10.1 On se place dans le modèle exponentiel P = {E(θ), θ ∈ Θ},


Θ =]0, +∞[.
1. Rappeler Eθ (X1 ).
2. Soit Sn = X1 + · · · + Xn . En remarquant que 2θSn ∼ χ22n , construire un test
de niveau α pour H0 = {θ0 } et H1 = H0c .
A.N. : n = 15, xn = 1.47, θ0 = 1, α = 5%.
3. Proposer un test pour H0 = [θ0 , +∞[ et H1 =]0, θ0 [.

EXERCICE 10.2 On souhaite vérifier la qualité du générateur de nombres


aléatoires d’un ordinateur. Pour cela, on procède à 250 tirages dans l’ensemble
{0, . . . , 9} et on obtient les résultats suivants :

x 0 1 2 3 4 5 6 7 8 9
N (x) 28 32 23 26 23 31 18 19 19 31

Tester au niveau α = 0,1 si le générateur produit des entiers uniformément répartis


sur {0, . . . , 9}.
Chapitre 11

Corrections des exercices

11.1 Corrigés des exercices du chapitre 2

Exercice 2.7 : 1) Soit Pn cette probabilité. Alors

Pn = 1 − P(il n’y a pas de personnes ayant leur anniversaire le même jour)


365 × 364 × · · · × (365 − n + 1)
= 1− .
(365)n

Le calcul donne :

P4 = 0,016 ; P16 = 0,284 ; P22 = 0,476 ; P40 = 0,891 ; P64 = 0,997.


365! 1
2) Nous cherchons le plus petit entier n tel que (365−n)!(365)n ≤ 2 . Avec une égalité,

la formule de Stirling donne alors qu’approximativement,


 n −(365+ 12 −n)
e−n 1 − = 0,5.
365
En passant au logarithme et en ne gardant que les termes prépondérants, nous obte-
n2 −n
nons 2(365) = 0,693, d’où n = 23.

Exercice 2.8 : Cette formule se montre par récurrence sur n. Elle est triviale pour
n = 1. Remarquons que pour n = 2,

P(A1 ∪ A2 ) = P(A1 ) + P(A2 ) − P(A1 ∩ A2 ). (11.1)

209
210 Chapitre 11 – Corrections des exercices

La formule est donc vérifiée puisque dans ce cas, p1 = P(A1 ) + P(A2 ) et p2 = P(A1 ∩
A2 ). Supposons que la formule soit vraie pour toute réunion de n − 1 événements.
Montrons-la pour n. Posons B1 = A1 ∪ · · · ∪ An−1 et B2 = An . En appliquant (11.1)
à B1 et B2 et la formule de récurrence pour calculer P(B1 ) et P((A1 ∩ An ) ∪ · · · ∪
(An−1 ∩ An )), nous obtenons immédiatement le résultat.

Exercice 2.9 :

1) Il y a une seule possibilité de bonne remise de lettres parmi les n! possibilités. La


1
probabilité de bonne répartition est donc n! .

2) Numérotons de 1 à n les lettres et numérotons par les mêmes numéros les boı̂tes qui
sont censées leur correspondre. Appelons Ai l’événement “La lettre numéro i arrive
dans la boı̂te numéro i”. Ainsi, Ai sera réalisé si la remise de la lettre i est fixée à la
bonne valeur, indépendamment de la manière aléatoire dont les n − 1 autres lettres
sont distribuées. Nous en déduisons que P(Ai ) = (n−1)!
n! . De même, pour deux numéros
(n−2)!
quelconques i1 et i2 , on aura P(Ai1 ∩ Ai2 ) = n! .

L’événement E ”une lettre au moins arrive à la bonne adresse” est égal à E =


A1 ∪ · · · ∪ An . On peut donc appliquer la formule de Poincaré.
n
X X
P(E) = (−1)k−1 P(Ai1 ∩ · · · ∩ Aik )
k=1 1≤i1 <···<ik ≤n
n n
n (n − k)! X (−1)k−1
X  
= (−1)k−1 = .
k n! k!
k=1 k=1

Remarquons que quand n tend vers l’infini, cette quantité tend vers 1 − e−1 ' 0.632.
On se convaincra que pour des valeurs modérées de n (n=7) on est très proche de
cette limite.

3) La probabilité pour qu’aucune lettre n’arrive à destination vaut alors


n
X (−1)k
P(E c ) = 1 − P(E) = ,
k!
k=0

qui tend donc vers e−1 = 0, 368 quand n tend vers l’infini.

4) dn = n! P(E c ). 

Exercice
P 2.10 : Il est immédiat de montrer que pour tout n ∈ N∗ , 0 ≤ pn ≤ 1 et que
n∈N∗ pn = 1.
11.1 – Corrigés des exercices du chapitre 2 211

Exercice 2.11 : Notons F et G les événements “fille” ou “garçon”.


1. Une configuration possible (F,F) sur 4 configurations : 14 .
2. Une configuration possible sur les 2 configurations (F,F), (F,G) : 12 .
3. Une configuration possible sur les 3 configurations (F,F), (F,G), (G,F) : 31 .

Exercice 2.12 : Les probabilités des différents génotypes valent alors, par indépendance

P(AA) = p2 , P(Aa) = 2p q , P(aa) = q 2 .

La proportion d’allèle A dans la deuxième génération sera alors

P(A) = P(A| individu de génotype AA) P(AA) + P(A| individu de génotype Aa) P(Aa)
2pq
= p2 + = p,
2
et de même la proportion d’allèle a sera q.

Exercice 2.13 : Notons H le fait d’être hémophile et NH le contraire. Nous savons que
 3
1 1
P(Reine H) = ; P(3 fils NH|Reine H) = ,
2 2

par indépendance des naissances. Nous cherchons à calculer P(Reine H|3 fils NH).
Nous allons utiliser la formule de Bayes. Nous avons

P( 3 fils NH ) = P( 3 fils NH | Reine H ) P( Reine H )


+ P(3 fils NH| Reine NH ) P( Reine NH )
 3
1 1 1 9
= × + = 4,
2 2 2 2
3 1
1
2× ( 21 )
d’où P(Reine H|3 fils NH) = 9 = 24
9 = 19 .
24 24

De plus,
P(4ème fils H|3 fils NH) = P(4ème fils H|3 fils H, Reine H) P(Reine H|3 fils NH) =
1 1 1
2 × 9 = 18 .

Exercice 2.14 : Notons A (resp. B, C) l’événement “la Ferrari est derrière la porte
A” (resp. B, C). Soit E l’événement “le présentateur annonce au joueur qu’elle n’est
pas derrière la porte B”. On a
1
P(A) = P(B) = P(C) = .
3
212 Chapitre 11 – Corrections des exercices

Par ailleurs,
1
P(E|A) = , P(E|B) = 0, P(E|C) = 1.
2
En effet, si la voiture est derrière A, le présentateur a le choix entre B et C, alors que
si elle est derrière C, il n’a pas le choix puisqu’il ne peut pas parler de A. Ainsi,
1 1 1 1
P(E) = P(E|A)P(A) + P(E|B)P(B) + P(E|C)P(C) = × + = .
2 3 3 2
On en déduit que

P(A ∩ E) P(E|A)P(A) 1
P(A|E) = = = .
P(E) P(E) 3

De même
P(E|C)P(C) 2
P(C|E) = = .
P(E) 3
Il faut donc que le joueur révise son choix.

Exercice 2.15 : 1)

P(E2 ∩ F2 ) P(E2 )P(F2 |E2 )


P(E2 |F2 ) = = .
P(F2 ) P(F2 )
+∞  
X n 1
P(F2 ) = P(F2 |En )P(En ) et P(F2 |En ) = .
n=2
2 2n

On a P(F2 |E0 ) = P(F2 |E1 ) = 0.


+∞   +∞
X n 1 (1 − 2a) X 1
P(F2 ) = pn = n(n − 1) n−2 .
n=2
2 2n 42 n=2
4

xn .
P
Calcul de la somme : dérivée seconde de la série entière n

8(1−2a)
On obtient P(F2 ) = 27 , et

p2 14 27
P(E2 |F2 ) = 8(1−2a)
= ' 0,42.
64
27

P(G2 ∩F2 )
2) On calcule P(G2 |F2 ) = P(F2 ) .
 
1 4 1 3(1 − 2a)
P(G2 ∩ F2 ) = P(E4 )P(G2 ∩ F2 |E4 ) = (1 − 2a) 3 4
= .
2 2 2 64
11.1 – Corrigés des exercices du chapitre 2 213

81
P(G2 |F2 ) = ' 0,158.
512

Exercice 2.16 : Remarquons que les événements aléatoires Ak sont indépendants.


Ainsi, par le lemme de Borel-Cantelli 2.35, P(lim supk Ak ) sera égale à 0 ou 1 suivant
que la série de terme général P(Ak ) converge ou diverge. La réalisation de Ak entraı̂ne
l’existence d’un nombre i ∈ {2k , . . . , 2k+1 − k} tel que les lancers i, i + 1, . . . , i + k
donnent tous Face. En appelant Ak,i cet événement, nous obtenons
2k+1
X−k
P(Ak ) ≤ P(Ak,i ) = (2k − k + 1) pk ≤ 2k pk .
i=2k

Donc, si p < 12 , nous en déduisons que la série


P
k P(Ak ) converge, et par le lemme
de Borel-Cantelli, que P(lim supk Ak ) = 0.

Nous allons maintenant montrer que si p ≥ 12 , la série diverge. Découpons


k
{2k , . . . , 2k+1 −1} en à peu près 2k morceaux de longueur k, {2k , . . . , 2k +k −1}, {2k +
k, . . . , 2k + 2k − 1}, . . .. Notons Bk,i l’événement “tous les lancers du ième morceau
donnent Face”. Alors
P(Ak ) ≥ P ∃i ∈ {1, . . . , [2k /k]}; Bk,i est réalisé .


Or les Bk,i ne concernent pas les mêmes lancers et sont donc indépendants. Nous
avons alors
k
P(Ack ) ≤ P ∀i Bk,i
c
est réalisé = (1 − pk )[2 /k] ≤ exp(−pk [2k /k]).


Ainsi, pour k assez grand, P(Ak ) ≥ 1 − exp(−pk [2k /k]).

Si p > 1/2, pk [2k /k] → ∞ et donc P(Ak ) > 1/2 pour k assez grand.
P
Si p = 1/2, P(Ak ) ≥ 1/(2k) pour k assez grand et donc k P(Ak ) = ∞.

Exercice 2.17 : Remarquons que si p et q sont des nombres premiers, alors pN ∩ qN =


pqN. Par ailleurs, si cette probabilité existe, nous aurons
1
P(pqN) = = P(pN) P(qN).
pq
Les P
événements pN et qN sont donc indépendants, et de même pour toute suite finie.
Or p premier P(pN) = +∞ (série harmonique), et donc par le lemme de Borel-
Cantelli, nous avons que P(lim supp premier pN) = 1. Ce qui voudrait dire que P-
presque sûrement tout nombre entier serait multiple d’une infinité de nombres pre-
miers, et en particulier que l’ensemble des nombres entiers multiples d’une infinité de
nombres premiers serait non vide, ce qui est faux.
214 Chapitre 11 – Corrections des exercices

11.2 Corrigés des exercices du chapitre 3


k
Exercice 3.2 : Pour k ≥ 1, P(X = k) = (k+1)! . Nous en déduisons que E(X) = e − 1
et Var(X) = 3 e − e2 .

P
Exercice 3.3 : Nous pouvons écrire : X = k∈N 1k<X . Ainsi,
∞ ∞
! !
X X X X
E(X) = E 1k<X = pP 1k<X = p = p P(X = p),
k∈N p=0 k∈N p=0

où nous avons appliqué le théorème de Fubini pour les séries doubles de termes positifs.

Exercice
PN 3.4 : Soit Xi le nombre de blessés dans le i-ème accident. Nous avons Y =
i=1 X i . Ainsi, pour s ∈ [0, 1[,
 PN  X  PN 
GY (s) = E(sY ) = E s i=1 Xi = E s i=1 Xi | N = k P(N = k)
k
X
X1 Xk
 
= E s ...E s P(N = k),
k

par indépendance des variables aléatoires N, X1 , . . . , Xk . Nous en déduisons que


X
GY (s) = P(N = k) (GX (s))k = GN (GX (s)).
k

Ainsi, en dérivant cette formule en 1 et en utilisant que GX (1) = 1 et G0Y (1) = E(Y ),
G0X (1) = E(X), G0N (1) = E(N ), nous obtenons

E(Y ) = E(N ) E(X) = m µ.

De même, en dérivant de nouveau la fonction génératrice, nous pouvons en déduire


la variance de Y . Tous calculs faits, nous obtenons

Var(Y ) = Var(N ) (E(X))2 + E(N ) Var(X) = σ 2 µ2 + m τ 2 .

Exercice 3.5 : a) Nous savons que S suit la loi de Poisson de paramètre λ + µ, comme
somme de variables aléatoires indépendantes, de loi de Poisson de paramètres λ et µ.

b) La loi conditionnelle de X sachant S = n (n ≥ 0) est par définition


  k  n−k
X|S=n pX,S (k, n) n λ µ
pk = =
pS (n) k λ+µ λ+µ
11.2 – Corrigés des exercices du chapitre 3 215

X|S=n
 λ 
pour k ∈ [0, n] entier, et pk = 0 sinon. Cette loi est la loi binomiale B n, .
λ+µ

On peut alors calculer E(X | S = n) en utilisant (3.16), mais il est plus rapide d’utiliser
λ
la valeur np de l’espérance d’une variable de loi B(n, p). Ainsi, E(X | S = n) = n ,
λ+µ
ou encore
λ
E(X | S) = S .
λ+µ

Exercice 3.6 : Calculons les lois de Z, Y , et X :

e−2 2k
Pk
Loi de Z : P(Z = k) = n=0 pk,n = k! . C’est une loi de Poisson de paramètre 2.

P∞ e−1,04 (1,04)n
Loi de X : P(X = n) = k=n pk,n = n! . C’est une loi de Poisson de
paramètre 1,04.

Nous remarquons immédiatement que Z et X ne sont pas indépendantes puisque

P(Z = k) P(X = n) 6= P(Z = k; X = n).

Loi de Y = Z − X :
X e−0,96 (0,96)m
P(Y = m) = P(Z = X + m) = pn+m,n = .
n
m!

C’est une loi de Poisson de paramètre 0,96.

Nous observons que que

P(X = n, Y = m) = P(Z = n + m, X = n) = P(X = n) P(Y = m).

Les v.a. X et Y sont indépendantes.

Loi conditionnelle de X sachant Z = k : pour tout 0 ≤ n ≤ k, nous avons


 
P(X = n, Z = k) k
P(X = n|Z = k) = = (0,52)n (0,48)k−n .
P(Z = k) n

La loi conditionnelle de X sachant Z = k est donc une loi binomiale B(k; 0,52). Son
espérance vaut donc E(X|Z = k) = 0,52 k, et E(X|Z) = 0,52 Z.

Exercice 3.7 :
216 Chapitre 11 – Corrections des exercices

1)

P(Xn 6= Xn−1 ) = P(Xn = 0, Xn−1 = 1) + P(Xn = 1, Xn−1 = 0)


= (1 − p)p + p(1 − p) = 2p(1 − p).

Par ailleurs,

P(An ∩ An−1 ) = P(Xn = 0, Xn−1 = 1, Xn+1 = 1) + P(Xn = 1, Xn−1 = 0, Xn+1 = 0)


= p2 (1 − p) + p(1 − p)2 = p(1 − p).

Ainsi
1
P(An ∩ An−1 ) = P(An ) P(An−1 ) ⇐⇒ p(1 − p) = 4p2 (1 − p)2 ⇐⇒ p = .
2
Cette condition est suffisante pour avoir l’indépendance de la suite (An )n . En effet, dès
que les indices k et n sont distants de plus d’une unité, Ak et An sont indépendants,
par définition, car les variables aléatoires Xn le sont.

2-a) For n ≥ 2, P(T = n) = P(X1 = · · · = Xn−1 , Xn−1 6= Xn ) = pn−1 (1 − p) + p(1 −


p)n−1 .

2-b) P(T < ∞) = P(∪n≥2 {T = n}) = (1 − p) n≥1 pn + p n≥1 (1 − p)n = 1.


P P

3)
X
P((XT , XT +1 ) = (0, 1)) = P((Xn , Xn+1 ) = (0, 1); T = n)
n≥2
X
= P(X1 = · · · = Xn−1 = 1, Xn = 0, Xn+1 = 1)
n≥2
X
= (1 − p)pn = p2 .
n≥2

Puisque nous avons également P((XT , XT +1 ) = (1, 0)) = (1 − p)2 , ces deux quantités
sont égales si et seulement si p = 12 .

Exercice 3.8 :

1) Remarquons que {Up (x) = n} = {x = pn y, y ∈ N∗ , premier avec p}. Ainsi,


X X c c X 1
Q(Up = n) = Q(pn y) = = .
y;y∧p=1 y;y∧p=1
p2n y 2 p2n y;y∧p=1
y 2

P∞ P∞ c 1
= 1. Ainsi Kp = y;y∧p=1 y12
P P
Mais Q(Up
n=0 = n) = 1, d’où n=0 p2n y;y∧p=1 y 2
  
1 1 1 1
vérifie cKp 1− 1 = 1, et cKp = 1 − p 2 . Finalement, Q(U p = n) = 1 − p 2 p2n .
p2
11.2 – Corrigés des exercices du chapitre 3 217

2) Q(Up ≥ n) = Q({x = pn y, y ∈ N∗ }) = c 1 1 1
P P
p2n y∈N∗ y 2 = p2n car c y∈N∗ y 2 = 1,
puisque Q est une probabilité.

3) Comme ci-dessus,

Q(Up1 ≥ n1 , . . . , Upk ≥ nk ) = Q(x, x = pn1 1 . . . pnk k y, y ∈ N∗ )


1
= .
p2n
1
1
· · · p2n
k
k

Ainsi les événements {Up1 ≥ n1 }, . . . , {Upk ≥ nk } sont indépendants. Il en est de


même des événements {Up1 = n1 }, . . . , {Upk = nk }, et donc des variables aléatoires.

p2 −1 1
4) Le calcul donne G(x) = p2 −x , pour x ∈ [0, 1]. Il en résulte E(Up ) = p2 −1 et
2
p
Var(Up ) = (p2 −1)2 .

Exercice 3.9 :
1-a) C’est évident.

1-b) La condition suffisante P Elle est nécessaire car φ ≥ 0, φ ne s’annule


est immédiate.P
qu’en 0 ou en 1, et H(p) = i φ(pi ) avec i pi = 1.

1-c) On utilise le rappel avec l’inégalité inverse car φ est concave.


n n
1X 1 X  1
φ(pi ) ≤ φ pi = φ .
n i=1 n i=1 n

Pn  
Donc H(p) = i=1 φ(pi ) ≤ n φ n1 = ln n. L’égalité a lieu si et seulement si p =
 
1 1
n, . . . , n car φ est strictement concave.

L’interprétation des deux propriétés précédentes est la suivante : l’entropie quantifie


l’incertitude sur l’état p. Dans le cas extrême où p est une mesure de Dirac, l’entropie
est nulle. Elle est maximale quand tous les états ont la même probabilité n1 .

2-a) Observons que ln Z(0) = ln n.

µ (ω) β→+∞
2-b) On a µββ(ω0 ) −→ 0 si U (ω) > U (ω 0 ). Nous en déduisons que quand β tend
vers l’infini, µβ devient une probabilité uniforme sur l’ensemble Ωmin := {ω; U (ω) =
minΩ U }.

De même que lorsque β → −∞, µβ devient une probabilité uniforme sur Ωmax := {ω :
U (ω) = maxΩ U }. Les limites (3.25) s’en suivent immédiatement.
218 Chapitre 11 – Corrections des exercices

2-c) β → Z(β) est non nulle et de classe C ∞ sur R, il en est donc de même pour
β → ln Z(β). On calcule
n
Z 0 (β) 1 X
ln Z)0 (β) = =− U (ωi )e−βU (ωi ) = −hU iµβ
Z(β) Z(β) i=1
2
Z 00 (β)
 0
Z (β) 1 X 2 2
ln Z)00 (β) = − = U (ωi )e−βU (ωi ) − hU iµβ
Z(β) Z(β) Z(β) i
= Varµβ (U ) ≥ 0.

Ainsi, β 7→ ln Z(β) est convexe et strictement convexe si et seulement si la variance


ne s’annule pas, c’est-à-dire si U n’est pas constante.

3-a) Nous déduisons de la question précédente que β 7→ hU iµβ est strictement


décroissante. Comme elle est continue, elle est donc bijective. (3.25) nous permet
de conclure.
P
3-b) On a H(µβ ) = − i µβ (ωi ) ln µβ (ωi ).
∂F
Recherchons les extrémas de F : ∂η i
= − ln ηi − 1 − βU (ωi ) − λ = 0 donne η(ωi ) =
−βU (ωi )−λ−1
e . On détermine λ par la condition que η est une probabilité :
n
X
λ + 1 = ln e−βU (ωi ) = ln Z(β).
i=1

Ainsi, si µβ maximise l’entropie, on aura

ln µβ (ωi ) = −βU (ωi ) − λ − 1 = −βU (ωi ) − ln Z(β),

d’où le résultat.

3-c) Nous allons utiliser l’inégalité de convexité pour la fonction φ..


X X 
− pi ln pi + − βU (ωi ) pi − ln Z(β)
i i
X X  X
=− pi ln pi + pi ln e−βU (ωi ) − pi ln Z(β)
i i i
X pi
=− pi ln
i
µβ (ωi )
 
X pi pi X pi
=− µβ (ωi ) ln = µβ (ωi )φ
i
µβ (ωi ) µβ (ωi ) i
µβ (ωi )
X 
pi
≤φ µβ (ωi ) = φ(1) = 0.
µβ (ωi )
11.3 – Corrigés des exercices du chapitre 4 219

Nous avons donc montré que pour toute proba p :



H(p) + h − βU ip ≤ ln Z(β).

On sait que µβ atteint le maximum de p 7→ H(p)+h −βU ip qui vaut ln Z(β). Puisque
φ est strictement concave, l’inégalité de convexité n’est saturée que si pi /µβ (ωi ) est
un constante, qui ne peut être autre que 1. Donc pi = µβ (ωi ) et µβ est l’unique
probabilité qui maximise l’entropie étant donnée l’espérance E.

Ainsi, nous avons démontré le “principe variationnel” : pour tout β ∈ R,


  
H(µβ ) + h − βU iµβ = ln Z(β) = sup H(p) + h − βU ip .
p probabilité

De plus, µβ est l’unique probabilité qui atteint le maximum.

11.3 Corrigés des exercices du chapitre 4

Exercice 4.1 : Il suffit d’écrire


E((X − a)2 ) = E((X − E(X))2 ) + (E(X) − a)2 .

11.4 Corrigés des exercices du chapitre 5


Rx
Exercice 5.5 : Puisque g est de classe C 1 , nous avons g(x) = 0 g 0 (t)dt. Alors
! Z Z
Z X ∞ x 
0
E(g(X)) = E g (t)dt = g 0 (t)dt f (x)dx,
0 0 0

où f est la densité de X. Alors en appliquant le théorème de Fubini, nous obtenons


Z ∞ Z ∞  Z ∞
E(g(X)) = g 0 (t) 1{t<x} f (x)dx dt = g 0 (t)P(X > t)dt.
0 0 0
R∞
Remarquons que pour g(t) = t, nous obtenons E(X) = 0
P(X > t)dt.

En fait, cette propriété est vraie pour toute variable aléatoire X positive. Il faut pour
cela appliquer le théorème de Fubini à la mesure abstraite P(dω) ⊗ dt.

Exercice 5.6 : 1) La position de l’incendie X suit une loi uniforme sur [0, A]. Nous
RA
cherchons à placer a tel que E(|X −a|) = A1 0 |x−a|dx soit minimum. Il est immédiat
de montrer que ce minimum vaut a = A2 .
220 Chapitre 11 – Corrections des exercices

R∞
2) Nous devons alors minimiser la quantité 0
λ e−λx |x − a|dx. Tous calculs faits,
nous obtenons que a = lnλ2 .

R∞
Exercice 5.7 : Rappel sur la fonction Γ : Γ(α) = 0 xα−1 e−x dx est convergente si
et seulement si α > 0. De plus Γ(α + 1) = αΓ(α), d’où nous déduisons que pour n
entier, Γ(n + 1) = n!.

Ainsi, si X est variable aléatoire de densité Cxα−1 e−px sur R+ , pour α, p > 0, alors

C = Γ(α) .

Nous pouvons utiliser ces préliminaires pour montrer que si X est la durée de fonc-
tionnement de la lampe, alors

1) f est une densité de probabilité,

2) E(X) = 8, Var(X) = 32.

3) Par changement de variable et intégration par parties, nous obtenons également


3
que : P(X ≥ 6) = 25 e− 2 .

Exercice 5.8 : Remarquons que Y ∈ [0, c]. De plus, P(Y = 0) = P(X < 0). Donc, si
P(X < 0) 6= 0, Y ne peut pas avoir de densité. Si P(X < 0) = 0, introduisons une
fonction g continue et bornée sur [0, c]. Alors
Z ∞ Z c  
1 y 1
E(g(Y )) = g(ce−αx ) fX (x)dx = g(y) fX − ln dy,
0 0 α c αy

grâce au changement de variable : y = ce−αx ⇐⇒ x = − α1 ln yc , pour x ∈ R+ et


y ∈ [0, c]. La densité de Y , dans ce cas, vaut donc
 
1 1 y
fY (y) = fX − ln 1]0,c[ (y).
αy α c

Exercice 5.9 : 1)
Z +∞ Z +∞
1 x2 1 (x−λ)2 λ2 λ2
E(eλX ) = √ eλx e− 2 dx = √ e− 2 e 2 dx = e 2 .
2π −∞ 2π −∞

2) Puisque eλX ≥ eλa 1X≥a , nous avons

E(eλX ) λ2
P(X ≥ a) ≤ ≤ e 2 −λa ,
eλa
11.4 – Corrigés des exercices du chapitre 5 221

pour tout λ > 0. En minimisant le terme de droite en λ, (minimum atteint en λ = a),


nous obtenons finalement que
a2
P(X ≥ a) ≤ e− 2 .

3)
Z +∞ Z +∞
1 − x2
2 1 1 x2
P(X ≥ a) = √ e dx = √ x e− 2 dx.
2π a 2π a x
Une intégration par parties donne
Z +∞ Z +∞
1 x2 1 a2 1 − x2
x e− 2 dx = e− 2 − e 2 dx.
a x a a x2

Or
Z +∞ Z +∞ Z +∞
1 − x2 1 − x2 1 x2 1 − a2
e 2 dx = x e 2 dx ≤ 3 x e− 2 dx = e 2.
a x2 a x 3 a a a3

Nous en déduisons l’inégalité voulue.

Exercice 5.10 : 1) Il est immédiat de vérifier que f est positive et d’intégrale 1.



2) P(X > x) = xa si x > a et P(X > x) = 1 si x ≤ a.

3) Soit X > a. Alors


 α    α
a x α x
P(X > x + y|X > x) = = .
x+y a x+y

Cette quantité tend vers 1 quand x tend vers l’infini.

Cela veut dire que plus X prend de grandes valeurs, plus elle a de chances d’en prendre
de plus grandes. Cela n’est pas vrai pour la loi exponentielle qui n’a pas de mémoire.
Cette loi fut introduite par le marquis de Pareto comme modèle de richesse, celui-ci
ayant remarqué au début du 20ème siècle que 20% de la population possédait 80% des
richesses. D’autres phénomènes ont ce même type de propriété : pour un service, 20%
des clients sont responsables de 80% des réclamations ; pour une activité sportive,
20% d’entraı̂nement supplémentaire peut amener 80% de performance en plus.

4)
Z +∞
x
E(X) = αaα dx < +∞ ⇐⇒ α > 1.
a xα+1
αa
Dans ce cas, E(X) = α−1 .
222 Chapitre 11 – Corrections des exercices

5) De même,
E(X 2 ) < +∞ ⇐⇒ α > 2.
αa2 αa2
Dans ce cas, E(X 2 ) = α−2 et Var(X) = (α−2)(α−1)2 .

Exercice 5.11 : 1) Loi de X : loi de densité


Z Z
1 x2 x2 y 2 1 x2
fX (x) = f (x, y)dy = |x|e− 2 e− 2 dy = √ e− 2 .
2π 2π
X suit une loi normale centrée réduite.
1 1
Un calcul analogue montre que la densité de Y vaut fY (y) = π 1+y 2 . Y suit donc une
loi de Cauchy. En particulier, Y n’a pas d’espérance.

Puisque le produit de fX et fY n’est clairement pas égal à f , les deux variables


aléatoires X et Y ne sont pas indépendantes.
2
R2) Soit g une fonction continue et bornée sur R . On a E(g(X, XY )) =
g(x, xy)f (x, y)dxdy. Considérons le changement de variable (x, y) 7→ (x, z = xy).
x2 z2
1
g(x, z)e− 2 e− 2 dxdz. X et XY sont
R
Le jacobien vaut x. Ainsi, E(g(X, XY )) = 2π
indépendantes, et Z = XY suit une loi normale centrée réduite.

3) X(1 + Y ) = X + Z, avec X et Z indépendantes. La somme de deux variables


aléatoires indépendantes de loi normale N (0, 1) suit une loi normale N (0, 2).

Exercice 5.12 : 1) Avec les notations du cours, la densité f du couple (X, Y ) vaut

1
f (x, y) = fX|Y =y fY (y) = 1R+ (x) 1[1,+∞[ (y)xe−xy .
y2

Soit g une fonction continue bornée sur R2+ . Le changement de variable (x, y) 7→
(t
R∞= R ∞ xy, y), −tde jacobien y, donne alors que E(g(T, Y )) = E(g(XY, Y )) =
t −t t
1 0
g(t, y)e y 2 dtdy. Comme la densité du couple (T, Y ), qui vaut e y 2 1R+ (t)
1[1,+∞[ (y) s’écrit comme produit d’une fonction de t et d’une fonction de y, nous en
déduisons que T et Y sont indépendantes et que T a la densité te−t 1R+ (t).
R∞
2) La loi de X a pour densité fX (x) = 1 e−xy xdy = e−x . Ainsi X suit une loi
exponentielle de paramètre 1 et la loi conditionnelle de Y sachant X = x admet la
densité fY |X=x (y) = ffX (x,y)
(x) = xe
−x(y−1)
1[1,+∞[ (y), pour x > 0.
R∞
y xe−x(y−1) dy = x+1

3) Nous en déduisons que E(Y |X = x) = 1 x 1R+ (x). Ainsi,
E(Y |X) = X+1
X .
11.4 – Corrigés des exercices du chapitre 5 223

Exercice 5.13 :

Soit h une fonction continue bornée sur R+ . Comme X et Y sont indépendantes,


nous avons
XZ 1 X Z 1
E(h(XY )) = h(ny)P(X = n)dy = P(X = n) h(ny)dy.
n 0 n 0

Pour n 6= 0, posons z = ny. Alors


Z n
X 1
E(h(XY )) = h(0)P(X = 0) + P(X = n) h(z)dz
n
n 0
Z !
X P(X = n)
= h(0)P(X = 0) + 1[0,n] (z) h(z)dz.
n
n

Ainsi, Z admet une densité si et seulement si P(X = 0) = 0.

Exercice 5.14 :

Loi de X :
∞ n
n
αn Γ(n + 1)
Z 
−(α+β)y (αy) β α
P(X = n) = β e dy = β = .
0 n! n! (α + β)n+1 α+β α+β
β
Ainsi, X suit une loi géométrique de paramètre α+β .

Loi de Y :
y y
X Z (αu)n
Z
P(Y ≤ y) = β e−(α+β)u du = β e−β u du.
0 n! 0
n≥0

Ainsi, Y suit une loi exponentielle de paramètre β.

Exercice 5.15 : 1) Soit h une fonction continue bornée sur [0, 1]n . Alors E(h(U1 , . . . , Un )) =
R1 R1
0
. . . 0 h(x1 , x1 x2 , . . . , x1 · · · xn )dx1 · · · dxn . On pose u1 = x1 , u2 = x1 x2 , . . . , un =
x1 · · · xn . Le jacobien de cette transformation vaut u1 · · R· un−1 . Nous en déduisons que
E(h(U1 , . . . , Un )) = h(u1 , . . . , un )10≤u1 ≤···≤un ≤1
1 1
u1 ···un−1 du 1 · · · dun . La loi de (U 1 , . . . , U n ) a donc la densité 10≤u1 ≤...≤un ≤1 u1 ···u n−1
.

2) Un = Un−1 Xn , et Un−1 et Xn sont indépendantes. D’où si g est une fonction


continue bornée sur [0, 1]2 ,
Z
E(g(Un , Un−1 )) = g(un−1 xn , un−1 )fXn (xn )fUn−1 (un−1 )dun−1 dxn
Z 1Z u
1
= g(z, u)fUn−1 (u) dzdu.
0 0 u
224 Chapitre 11 – Corrections des exercices

Ainsi, la loi conditionnelle de Un sachant Un−1 = u aura la densité z 7→ u1 1z≤u .

Exercice 5.16 : 1) Soit f une fonction continue bornée sur R+ × [0, 2π[ . Alors
R +∞ R +∞ x2 +y 2 R ∞ R 2π r2
1
E(f (R, Θ) = 2π −∞ −∞
f (r, θ)e− 2 dxdy = 2π1
0 0
f (r, θ)e− 2 rdrdθ. D’où
r2
R admet la loi de densité re− 2 1r>0 et Θ la loi uniforme sur [0, 2π], et R et Θ sont
indépendants.

R2 et Θ sont indépendants, et si h est une fonction continue bornée sur R+ ,


R∞ 2 R∞
E(h(R2 )) = 0 h(r2 )re−r /2 dr = 21 0 h(z)e−z/2 dz. R2 suit une loi exponentielle
de paramètre 21 .

2) Nous avons vu que R2 peut se simuler en prenant −2 ln U , où U suit une loi
uniforme sur [0, 1]. Θ va être simulée par 2πV , où V suit une loi uniforme
√ sur [0, 1], et
2
U et V sont
√ indépendants (comme R et Θ). Alors X = R cos Θ = −2 ln U cos(2πV )
et Y = −2 ln U sin(2πV ).
Y
3) Soit g une fonction continue bornée sur R+ . E(g( X )) = E(g(tan Θ)) =
π
1 2π 1
g(tan θ)dθ. La fonction θ 7→ tan θ est inversible sur ]− π2 , π2 [.
R R
2π 0 g(tan θ)dθ = π − π
2
2
Y
)) = π1 R f (t) 1+t
dt Y
R
On obtient E(g( X 2 . Donc X suit une loi de Cauchy.

Exercice 5.17 : 1) Soit x ≤ y.

P(X ≤ x, Y ≤ y) = P(Zk ≤ y, ∀k) − P(x < Zk ≤ y, ∀k) = F (y)n − (F (y) − F (x))n ,

par indépendance des Zk . Ainsi, FX (x) = 1 − (1 − F (x))n , et FY (y) = F (y)n .


0
2) F est dérivable de dérivée f . Ainsi, X admet une densité qui vaut fX (x) = FX (x) =
n−1 n−1
n(1 − F (x)) f (x), et de même Y admet la densité fY (y) = n(F (y)) f (y).
2

La densité du couple (X, Y ) vaut h(x, y) = ∂x∂y F (x, y), où F (x, y) = P(X ≤ x, Y ≤
y). Ainsi, nous obtenons h(x, y) = n(n − 1)(F (Y ) − F (x))n−2 f (x)f (y).
n n−1 n
3) F (x) = x. Nous avons donc fX (x) = (b−a)n (b − x) 1]a,b[ (x), fY (y) = (b−a)n (y −
n(n−1)
a)n−1 1]a,b[ (y), h(x, y) = (b−a)n (y − x) n−2
1a≤x≤y≤b .

b−a b−a n(b−a)2


Les calculs donnent E(X) = a+ n+1 , E(Y ) = b− n+1 , Var(X) = Var(Y ) = (n+1)2 (n+2)
2
(b−a) 1
Cov(X, Y ) = (n+1) 2 (n+2) , et ρ(X, Y ) = n . Ainsi, plus n est grand, moins les variables

X et Y sont corrélées, ce qui est raisonnable !


11.5 – Corrigés des exercices du chapitre 6 225

Exercice 5.18 : 1)
Z Z
µ −λb −(λ+µ)a
P(M > a, D > b, X > Y ) = λµ e−λx e−µy dxdy = e e .
y>a x>y+b λ+µ

µ λ
2) P(X > Y ) = P(M > 0, D > 0, X > Y ) = λ+µ , P(X < Y ) = λ+µ , P(M >
µ −(λ+µ)a λ −(λ+µ)a
a, X > Y ) = λ+µ e , P(M > a, X < Y ) = λ+µ e . Ainsi, M suit une loi
exponentielle de paramètre λ + µ. De plus,

P(M > 0, D > b, X > Y )


P(D > b|X > Y ) = = e−λb .
P(X > Y )

La loi conditionnelle de D sachant X > Y est donc une loi exponentielle de paramètre
λ. De même, la loi conditionnelle de D sachant X < Y est une loi exponentielle de
paramètre µ.

3) Nous remarquons que P(M > a, X > Y ) = P(M > a)P(X > Y ).

4) Nous pouvons
P montrer par récurrence que min1≤i≤n Xi suit une loi exponentielle
de paramètre 1≤i≤n λi , que P(Xk = min1≤i≤n Xi ) = P λk λi , et que min1≤i≤n Xi
1≤i≤n
et { Xk = min1≤i≤n Xi } sont indépendants.

11.5 Corrigés des exercices du chapitre 6

Exercice 6.1 : 1) E(Xn ) = 1.

2) Puisque n≥1 un < +∞, la suite (un )n tend vers 0 et donc u1n tend vers +∞.
P

Ainsi, pour ε fixé et n assez grand, P(Xn > ε) = P(Xn = u1n ) = un qui tend vers 0.
P
Donc Xn → 0.
P
Les ensembles An = {|Xn | > ε} vérifient que n P(An ) < ∞, par hypothèse.
Alors, par la première partie du lemme de de Borel-Cantelli (Théorème 2.35),
P(lim supn An ) = 0. Ainsi presque-sûrement, au plus un nombre fini de An sont
p.s.
réalisés. Il en résulte que Xn → 0.

X1 +···+Xn p.s.
3) Nous en déduisons par un argument de limite de Césaro que n → 0 quand
n tend vers l’infini.

Cé résultat n’est pas en contradiction avec la loi des grands nombres, bien que
E(Xn ) = 1. En effet, les variables aléatoires Xn n’ont pas les mêmes lois, donc nous
ne sommes pas sous les hypothèses de la LGN.
226 Chapitre 11 – Corrections des exercices

Exercice 6.2 : Considérons un réel M > 0 donné. Alors les variables aléatoires bornées
Xi ∧ M satisfont les hypothèses de la loi des grands nombres. Nous en déduisons que
X1 ∧M +···+Xn ∧M p.s.
n → E(X1 ∧ M ).

Soit maintenant une suite Mk de réels qui tend vers l’infini. Pour chaque k, il existe
un ensemble négligeable Nk en dehors duquel pour tout ω, X1 (ω)∧Mk +···+X
n
n (ω)∧Mk

E(X1 ∧ Mk ). Alors N = ∪k Nk est encore négligeable (comme réunion dénombrable
/ N , ∀k, X1 (ω)∧Mk +···+X
d’ensembles négligeables), et pour ω ∈ n
n (ω)∧Mk
→ E(X1 ∧ Mk ).
Nous pouvons alors faire tendre k vers l’infini, et nous en déduisons que pour ω ∈ / N,
X1 (ω)+···+Xn (ω) X1 +···+Xn
n → E(X1 ) = +∞, d’où la convergence presque-sure de n vers
+∞.

X1 +···+Xn
Exercice 6.3 : 1) La loi des grands nombres entraı̂ne que Mn = n →p.s. x
et donc, puisque f est continue,
 
X1 + · · · + Xn
f →p.s. f (x).
n

f étant continue sur [0, 1], elle est bornée. Ainsi, les variables aléatoires f X1 +···+X

n
n
le sont également. Nous pouvons alors appliquer le théorème de convergence dominée,
et
   X n  
X1 + · · · + Xn k
E f = f xk (1 − x)n−k −→ f (x).
n n
k=1
Pn k

On appelle les polynômes Pn (x) = k=1 f n xk (1−x)n−k polynômes de Bernstein.

2) f est uniformément continue sur [0, 1] : ∀ε > 0, ∃α, tel que ∀x, y ∈ [0, 1] , |x − y| <
α ⇒ |f (x) − f (y)| < ε. Nous avons alors

|E (f (Mn )) − f (x)|
 
≤ E |f (Mn ) − f (x)| 1{|Mn −x|≥α} + E |f (Mn ) − f (x)| 1{|Mn −x|<α}
≤ 2kf k∞ P(|Mn − x| ≥ α) + ε
Var(X1 ) kf k∞
≤ 2kf k∞ 2
+ε≤ + ε,
nα 2 nα2
par l’inégalité de Bienaymé-Chebyshev, puisque Var(X1 ) = x (1 − x) ≤ 14 .

Nous avons donc prouvé : Toute fonction continue sur [0, 1] est approchée uni-
formément par une suite de polynômes. (Théorème de Weierstrass)

2
σ 2 /2
Exercice 6.4 : 1) M (u) = eu .
11.5 – Corrigés des exercices du chapitre 6 227

2) Nous avons : eu(Sn −nm) ≥ eua 1Sn −nm≥a , d’où


E(eu(Sn −nm) ) n
P(Sn − nm ≥ a) ≤ = e−ua (M (u)) ,
eua
par indépendance des Xi .

3)
P(|Yn − m| ≥ ε) = P(Sn − nm ≥ nε) + P(Sn − nm ≤ −nε)
n n n
≤ e−nuε (M (u)) + e−n(−u)(−ε) (M (−u)) = 2e−nuε (M (u))
2
σ 2 /2
≤ 2e−nuε enu , ∀u ≥ 0.
La meilleure majoration va être obtenue en minimisant l’exposant, c’est-à-dire pour
u = ε. Nous en déduisons l’inégalité de Chernov.

4) Par l’inégalité de Bienaymé-Chebyshev, P(|Yn − m| ≥ ε) ≤ Var(Y ε2


n)
. Ainsi, P(|Yn −
σ2
m| ≤ ε) ≥ α dès que 1 − nε 2 ≤ 1 − α = 0, 05. Avec ε = 0, 05, il vient que n ≥ 80000.
nε2
Par l’inégalité de Chernov, nous obtenons 2e− 20 ≤ 0, 05. Il vient que n ≥ 29512. Pour
avoir une évaluation du même ordre de la probabilité cherchée, nous pouvons donc
prendre un échantillon beaucoup plus petit si nous utilisons l’inégalité de Chernov. A
taille d’échantillon fixée, nous aurons une meilleure évaluation avec cette inégalité.

Exercice 6.5 :
n
!
1X
Sn = S0 (1 + R1 ) · · · (1 + Rn ) = S0 exp n ln(1 + Rk ) .
n
k=1

Or, R1 > −1, donc −1 < E(R1 ) < ∞, et ln(1+E(R1 )) < ∞. Par l’inégalité de Jensen,
nous en déduisons que E(ln(1 + R1 )) P ≤ ln(1 + E(R1 )) < ∞. Nous pouvons alors
n
appliquer la loi des grands nombres : n1 k=1 ln(1 + Rk ) → E(ln(1 + R1 )). Ainsi, pour
n assez grand, Sn va se comporter presque-sûrement comme S0 exp (nE(ln(1 + R1 ))).

Si E(R1 ) = 0, (et R1 non identiquement nulle), alors E(ln(1 + R1 )) < 0, et Sn va


décroı̂tre exponentiellement vite vers 0.

Exercice 6.6 : Les deux premières questions se résolvent comme dans l’exercice 6.3.

3) Supposons que les Xi suivent des lois uniformes sur [0, 1]. Alors a = 12 , et limn In =
g( 12 ).

4) Le résultat sur la somme de variables aléatoires indépendantes de loi exponentielle


se démontre par récurrence. En appliquant ce résultat, nous aurons donc
Z ∞ Z ∞
1 z z 1 nt
f (a) = lim f z n−1 e− a dz = lim f (t)nn−1 tn−1 e− a ndt.
n an (n − 1)! 0 n n an (n − 1)! 0
228 Chapitre 11 – Corrections des exercices

R∞
En posant F (t) = 0 f (x)e−tx dx, nous obtenons
R∞ nt
F (n−1) ( na ) = (−1)n−1 0 f (t)tn−1 e− a dt. D’où le résultat.

11.6 Corrigés des exercices du chapitre 7


 2
Exercice 7.2 : Soit t un réel. Alors φ(t) = φ X+Y (t) = φ X+Y ( √t ) = φ( √t ) .
√ 2 2
2
  2n
Par récurrence, nous en déduisons que pour tout n, φ(t) = φ √t2n =
  
n t 2 2
exp 2 ln φ √2n . Comme X est centrée et a un moment d’ordre 2, σ = E(X ),
φ est deux fois dérivable en 0 et

σ 2 t2
   2
t t
φ √ n =1− n
+o n
.
2 2 2 2
  2n 2 2 2 2
Nous en déduisons que limn→∞ φ √t2n = e−σ t /2 . Ainsi, φ(t) = e−σ t /2 , et
X et Y suivent des lois N (0, σ 2 ).

1
R +∞ eitx
Exercice 7.3 : 1) φX (t) = π ∞ 1+x2 dx.
Nous appliquons le théorème des résidus.
 
eitz eitz 1 1
Nous considérons la fonction de variable complexe f (z) = π(1+z 2 ) = 2iπ z−i − z+i
qui a les deux pôles i et −i. Pour t > 0, prenons comme contour Γ le demi-cercle
supérieur de centre 0 et de rayon R, qui encercle i. Alors la formule des résidus donne
−t
f (z)dz = 2iπRes(f, i). Nous avons Res(f, i) = e2iπ , d’où
R
Γ

R
eitx
Z Z
e−t = dx + f (z)dz.
−R 1 + x2 Γ\[−R,R]

itR cos θ −tR sin θ


Mais sur ce contour, f (z) = e e
1+z 2 qui tend vers 0 quand R tend vers l’infini
(car sin θ > 0). Pour t < 0, nous prenons l’autre contour et nous obtenons et . Ainsi,
la fonction caractéristique d’une variable aléatoire de Cauchy vaut φX (t) = e−|t| .

2) φ2X (t) = e−|2t| = (φX (t))2 .

R +∞ a2
Exercice 7.4 : 1) φX (t) = ∞
eitx a2 e−|x|a dx = a2 +t2 .

2) Y a une densité qui ne charge que y ≥ 1. Donc Y > 0 presque-sûrement.

Soit f la densité de X et g celle de Y . Nous avons (par le théorème de Fubini et la


question précédente),
11.6 – Corrigés des exercices du chapitre 7 229

Z +∞ Z +∞ Z +∞ Z +∞ 
it x it x
φ X (t) = e f (x)g(y)dxdy =
y g(y)dy e y f (x)dx
Y
∞ ∞ ∞ ∞
Z +∞ Z +∞
y 2 a2 1 y 2 a2
 
= g(y) dy = dy
∞ y 2 a2 + t2 1 y 2 y 2 a 2 + t2
  
a π a
= − arctan .
|t| 2 |t|

Exercice 7.5 : 1) Supposons que A(θ) ∩ A(θ0 ) 6= ∅. Si ω ∈ A(θ) ∩ A(θ0 ), alors


X1 (ω) cos θ + X2 (ω) sin θ ∈ F et X1 (ω) cos θ0 + X2 (ω) sin θ0 ∈ F . Puisque θ 6= θ0 , tous
deux dans [0, π2 [, cos θ sin θ0 −sin θ cos θ0 = sin(θ−θ0 ) 6= 0. Cela entraı̂ne que X1 (ω) ∈ F
et X2 (ω) ∈ F . Contradictoire avec le fait que X1 (ω) sin θ − X2 (ω) cos θ ∈ / F.
 
X1
2) Comme X1 et X2 sont indépendantes, le vecteur V = est gaussien
−X2
centré et de matrice de covariance CV diagonale par bloc, chaque bloc étant la matrice
de covariance CX de X :  
CX 0d
CV =
0d CX
 
X1 cos θ + X2 sin θ
avec 0d la matrice nulle de taille d×d. Nous remarquons que W = =
  X1 sin θ − X2 cos θ
X1
M avec M la matrice de taille 2d × 2d :
−X2
 
cos θId sin θId
M=
sin θId − cos θId

et Id la matrice identité de taille d×d. Nous utilisons alors la formule CW = MCV Mt


et obtenons que CW = CV . Les deux vecteurs gaussiens, ayant même espérance et
même matrice de covariance, ont donc même loi.

Nous en déduisons en particulier que P(A(θ)) = P(A(0)), pour tout θ.

3) Supposons que P(A(0)) = η > 0. Alors pour n angles θi distincts de [0, π2 [, comme
les A(θi ) sont disjoints, nous aurions P(∪ni=1 A(θi )) = nη. Pour n grand, nous obtien-
drions que cette probabilité est strictement supérieure à 1 ce qui est absurde. D’où
P(A(0)) = 0.

Exercice 7.6 : Il suffit de prouver que pour f1 et f2 des fonctions continues bornées,
et f2 lipschitzienne de constante de lipschitzianité C, E(f1 (Xn )f2 (Yn )) converge vers
E(f1 (X)f2 (y)) = f2 (y) E(f1 (X)), puisque y est constante.
230 Chapitre 11 – Corrections des exercices

En nous inspirant de la preuve du théorème de Slutsky 7.27, nous écrivons pour ε > 0,
|E(f1 (Xn )f2 (Yn )) − E(f1 (X)f2 (y))|
≤ |f2 (y)| |E(f1 (Xn )) − E(f1 (X))| + E (|f1 (Xn )| |f2 (Yn ) − f2 (y)|)
≤ kf2 k∞ |E(f1 (Xn )) − E(f1 (X))| + Cε kf1 k∞ + 2kf1 k∞ kf2 k∞ P(|Yn − y| > ε).
Les termes de gauche et de droite tendent vers 0 quand n tend vers l’infini, par
hypothèse. Comme l’inégalité est vraie pour tout ε > 0, nous en déduisons le résultat.

Puisque (x, y) 7→ x + y et (x, y) 7→ xy sont des fonctions continues, il est immédiat


que Xn + Yn et Xn Yn convergent en loi respectivement vers X + y et Xy.

Exercice 7.7 : Préliminaire : Il suffit d’adapter la preuve de la proposition 7.22 en


approchant les indicatrices d’intervalles ] − ∞, b] par des fonctions bornées de classe
C 2 avec dérivées première et seconde bornées et uniformément continues.

1) Nous avons Wi,n + Xi,n = Wi−1,n + Yi−1,n . Ainsi, par un argument de somme
télescopique, nous obtenons
n
X
(f (Wi,n + Xi,n ) − f (Wi,n + Yi,n )) = f (W1,n + X1,n ) − f (Wn,n + Yn,n ) = f (Tn ) − f (Tn0 ).
i=1

2) Puisque Xi,n et Yi,n sont petits pour n grand, nous allons utiliser un développement
de Taylor. Nous pouvons écrire
1
f (Wi,n + Xi,n ) = f (Wi,n ) + f 0 (Wi,n )Xi,n + f 00 (Wi,n )(Xi,n )2 + RX,i,n ,
2
où RX,i,n = 21 (Xi,n )2 (f 00 (Wi,n +θXi,n )−f 00 (Wi,n )) pour un 0 ≤ θ ≤ 1. D’une part nous
avons |RX,i,n | ≤ (Xi,n )2 ||f 00 ||∞ . D’autre part, puisque f 00 est uniformément continue,
pour ε > 0 donné, il existe δ > 0, tel que |RX,i,n | ≤ ε (Xi,n )2 , pour |Xi,n | ≤ δ. Nous
en déduisons que
|RX,i,n | ≤ (Xi,n )2 ε1|Xi,n |≤δ + ||f 00 ||∞ 1|Xi,n |>δ .


3) Une inégalité similaire à ci-dessus est vrai pour Yi,n . Nous substituons alors ces
approximations de Taylor dans (7.31). En prenant l’espérance, du fait que Xi,n et Yi,n
2
sont centrées, et que E(Xi,n ) = n1 = E(Yi,n
2
), et que Xi,n et Yi,n sont indépendantes
de Wi,n , nous en déduisons que
n
X
|E(f (Tn ) − E(f (Tn0 )| ≤ E(|RX,i,n | + |RY,i,n |)
i=1
Xn
2 2
) + ||f 00 ||∞ E(Xi,n
2 2 
≤ ε E(Xi,n + Yi,n 1|Xi,n |>δ + Yi,n 1|Yi,n |>δ )
i=1

≤ 2ε + ||f 00 ||∞ E X12 1|X1 |>δ√n + Y12 1|Y1 |>δ√n .



11.6 – Corrigés des exercices du chapitre 7 231


4) Comme E(X12 ) = 1, limn E X12 1|X1 |>δ√n = 0, et de même pour Y1 . Puisque le
choix de ε est arbitraire, nous en déduisons finalement que |E(f (Tn ) − E(f (Tn0 )| → 0,
quand n tend vers l’infini, d’où le théorème de la limite centrale.

Sn S2n Sn
Exercice 7.8 : 1) Si √ n
converge en probabilité, alors √ 2n
−√ n
converge en probabilité
1 1 1
vers 0. Cette différence vaut ( √2n − √n )(X1 + · · · + Xn ) + √2n (X2n+1 + · · · + X2n ).
C’est la somme de deux variables aléatoires indépendantes. C’est donc une variable
aléatoire centrée de variance n1 (nσ 2 ) + 2n
n 2
σ = 33 σ 2 . Cette quantité ne peut donc pas
tendre en probabilité vers 0.

2) Si α < 1/2, alors pour tout β > 0 fixé, on a βn1/2−α → +∞ quand n → ∞. Alors
pour tout A > 0, ∃n0 , tel que n ≥ n0 ⇐= βn1/2−α > A. Alors P(nα | Snn − m| > β) =
√ √ √
P( n| Snn −m| > βn1/2−α ) ≤ P( n| Snn −m| > A). Comme n( Snn −m) converge en loi
vers une variable aléatoire de loi N (0, 1) ayant une fonction de répartition continue, les
fonctions de répartition convergent, et en particulier, lim supn P(nα | Snn − m| > β) ≤
3 α Sn
2 P(|N (0, 1)| > A). Si A tend vers l’infini, nous obtenons que lim supn P(n | n − m| >
β) = 0.

Pour α > 1/2, un raisonnement analogue permet de montrer que lim supn P( nα | S1n −m|
n
> 1
β) = 0, d’où nα | Snn − m| tend vers +∞ en probabilité.
232 Chapitre 11 – Corrections des exercices

11.7 Corrigés des exercices du chapitre 8

Exercice 8.1 : Soit h une fonction de R dans R continue bornée. Soit T une v.a. de loi
Tn . Avec Z v.a. de loi N (0, 1) et U de loi χ2n indépendante de Z, on a d’après (7.20) :
 h √ Z i
E h(T ) = E h n √
U
Z +∞ Z +∞ √ z 
1 n u z2
= √ du dzu 2 −1 e− 2 e− 2 h n √
2n/2 Γ(n/2) 2π 0 −∞ u
Z +∞ Z +∞
2 x2 +z 2
 √ z  √
= √ dx dzxn−1 e− 2 h n avec u 7→ x = u
n/2
2 Γ(n/2) 2π 0 −∞ x
Z +∞ Z +∞
2 x 2 +x2 t2 /n √ z
= √ dx dtxn e− 2 h(t) avec z 7→ t = n
2n/2 Γ(n/2) 2πn 0 −∞ x
Z +∞ Z +∞
2 2 2

x t
= √ dth(t) dxxn e− 2 1+ n par Fubini
n/2
2 Γ(n/2) 2πn −∞ 0
n+1 Z +∞
t 2 − 2 t2 
Z
1  n−1 y

= √ dth(t) 1 + dyy 2 e− 2 avec x 7→ y = x2 1 +
2n/2 Γ(n/2) 2πn R n 0 n
Z 2 − n+1
Γ((n + 1)/2)  t 2
= √ dth(t) 1 + .
πnΓ(n/2) R n

Ce calcul permet d’identifier la loi de T et sa densité.

Exercice 8.2 : 1) Soit (Xi )i une suite de variables


Pn aléatoires i.i.d. de loi N (0, 1). Par
définition de la loi χ2n , Zn a même loi que 2
i=1 Xi . On en déduit que E[Zn ] =
nE[X12 ] = n et Var(Zn ) = nVar(X12 ) = 2n. De plus, par le théorème de la limite
centrale, on trouve :
Pn
Zn − n loi i=1 Xi2 − nE[X12 ] n→+∞
√ = p √ −→ N (0, 1),
2n Var(X12 ) n

la convergence ayant lieu en loi.


−n
2) On note Yn := Z√n2n et on écrit
s √
p √
q √ √ √ 2 √
2Zn − 2n − 1 = 2n + 2 2nYn − 2n − 1 = 2n 1+ √ Yn − 2n − 1
n
√ √
= 2n − 2n − 1 + Rn + Yn ,

avec
√  √2  √ x
Rn = 2nf √ Yn , f (x) = 1+x−1− .
n 2
11.7 – Corrigés des exercices du chapitre 8 233

On montre que pour tout x ∈] − 1, +∞[, |f (x)| ≤ 12 x2 et donc


√ √ 2
1 √  2Yn 2 2Y
|Rn | ≤ 2n √ = √ n .
2 n n
2

Comme (Yn )n converge en√loi, (Y√ n / n)n converge en loi vers 0, et donc converge en
( 2n − √2n − 1 + Rn )n converge en probabilité vers 0. On
probabilité vers 0. Donc √
peut alors conclure que ( 2Zn − 2n − 1)n converge en loi vers la loi N (0, 1) avec le
théorème de Slutsky.

3) Soit X une v.a. gaussienne centrée réduite et soit (Yi )i une suite de variables
aléatoires
Pni.i.d.2 de loi gaussienne centrée réduite indépendante de X. Pour tout n,
2
Un = p Y
i=1 i est indépendante de X et suit la loi de χ à n degrés de p
liberté,
donc X/ Un /n suit la loi de Student à n degrés de liberté. Donc ζn et X/ Un /n
ont même loi pour tout n. Or pUn /n converge en probabilité vers 1 d’après la loi
des grands nombres, donc X/ Un /n converge vers N (0, 1) d’après le théorème de
Slutsky.

Exercice 8.3 : 1) E(U ) = E(V ) = E(W ) = m. Var(U ) = m(1 − m), Var(V ) =


R1 2 R1
0
g (x)dx − m2 ≤ Var(U ), car g ≤ 1. Var(W ) = 21 0 (g 2 (x) + g(x)g(1 − x))dx − m2 .

2) Soient Xi et Yi des variables aléatoires indépendantes de loi uniforme sur [0, 1]. On
peut appliquer la loi des
Pgrands nombres Pnaux variables correspondantes PnUi , Vi et Wi .
n
Ainsi, nous aurons : n1 i=1 g(Xi ), 2n 1
i=1 (g(X i ) + g(1 − Xi )) et 1
n i=1 1Yi ≤g(Xi )
convergent presque-sûrement vers m.

3) La monotonie de g entraı̂ne que E((g(X)−g(Y ))(g(1−X)−g(1−Y ))) ≤ 0. Nous en


déduisons que 2E(g(X)g(1−X))−2E(g(Y )g(1−X)) ≤ 0. Or, E(g(Y )g(1−X)) = m2 .
R1 R1
Donc 0 g(x)g(1 − x)dx ≤ m2 . Par ailleurs, m2 ≤ 0 g 2 (x)dx. Finalement, nous avons
Z 1 
1 1
Var(W ) ≤ g 2 (x)dx − m2 ≤ Var(V ).
2 0 2

1
4) Var(An ) = 2n Var(V ) et Var(Bn ) = n1 Var(W ). La comparaison ci-dessus entraı̂ne
que Bn est le meilleur.
R1 √
5) m = 0 x2 dx = 13 . Var(g(X)) = 45 4
= σ 2 . Le TCL nous dit que 2n (Anσ−m)
converge vers une variable aléatoire de loi N (0, 1). Nous aurons
√ ! √
√ (An − m)

2nε 2nε
P(|An − m| > ε) = P 2n
> = 0,05 ⇐⇒ = 1,96.
σ σ σ

En prenant ε = 0, 01, nous obtenons n = 1708. R1


1
Etudions maintenant l’estimateur Bn . Var(W ) = 2 0
(g 2 (x)+g(x)g(1−x))dx−m2 =
234 Chapitre 11 – Corrections des exercices

1
180 = β 2 . Le même raisonnement que précédemment nous dit que n dans ce cas doit

vérifier βnε = 1,96 avec ε = 0,01. Cela donne n = 214, ce qui est bien meilleur comme
nous l’avions prévu.

Exercice 8.4 : 1) On sait que E(X1 ) = mθ. Donc un estimateur de θ est


n
1 X
θ̌n = Xi .
mn i=1

2) La vraisemblance est :
n  
Y m xi
pn (x, θ) = θ (1 − θ)m−xi ,
i=1
x i

Ceci s’écrit aussi :


n  i
hY m  xn n
pn (x, θ) = θ (1 − θ)m−xn , (11.2)
i=1
xi
Pn
avec xn = n1 i=1 xi . A x fixé, en tant que fonction de θ, on remarque que la vrai-
semblance est maximale lorsque la fonction θ 7→ θxn (1 − θ)m−xn est maximale. Le
maximum sur [0, 1] est unique et est atteint au point où la dérivée de la fonction
s’annule, en θ = xn /m. Le maximum de la vraisemblance redonne ici l’estimateur
empirique.

Exercice 8.5 : 1) On calcule


Z ∞ 2  x2  r Z ∞  x2  i
x 1 2π h 1
Ea (X) = exp − dx = √ x2 exp − dx
0 a 2a 2 a 2πa −∞ 2a
r r
1 2π πa
= a= ,
2 a 2
où on a reconnu dans l’expression entre crochets la variance d’une loi gaussienne
N (0, a). Puis
Z ∞ k+1  x2  Z ∞
x
Ea (X k ) = exp − dx = (2a)k/2 y k/2 e−y dy,
0 a 2a 0

et donc Ea (X 2 ) = 2a et Ea (X 4 ) = 8a2 .

2) La log-vraisemblance est égale à :


n n
X 1 X 2
ln (X, a) = ln Xi − n ln a − X .
i=1
2a i=1 i
11.8 – Corrigés des exercices du chapitre 9 235

En tant que fonction de a, il y a un unique minimum sur ]0, +∞[ atteint au point où
la dérivée s’annule, ce qui donne l’EMV :
n
1 X 2
ân = X .
2n i=1 i

L’estimateur est non-biaisé :


n
1 X
Ea (ân ) = Ea (Xi2 ) = a.
2n i=1

Le théorème de la limite centrale donne la normalité asymptotique :


√ n→+∞
n ân − a) −→ N 0, σ 2 (a)),

en loi, avec σ 2 (a) = 41 Vara (X12 ) = 14 Ea (X14 ) − 41 Ea (X12 )2 = a2 .

3) L’EMV de a est ân = 38,69/16 = 2,42. La compagnie d’assurance pense que le


paramètre a vérifie Pa (X ≥ 6) ≤ 10−3 , ce qui est équivalent à exp(−62 /(2a)) ≤ 10−3 ,
soit a ≤ 18/ ln(1000) ' 2,61. Comme 2,42 < 2,61, cela semble raisonnable. Mais ici
l’incertitude est grande car l’échantillon n’était pas très grand. Prenons l’approxima-
tion gaussienne :
√ â − a 
n
Pa n ≥ −u ' Φ(u),
ân
qui est équivalente à :
√ 
Pa a ≤ ân (1 + u/ n) ' Φ(u).
La√probabilité que a soit plus √
petit que 2,61 est donc Φ(u) avec u tel que ân (1 +
u/ n) = 2,61, c’est-à-dire u = n(2,61/ân − 1). Avec n = 8 et ân = 2,42, cela donne
u = 0,22 et donc la probabilité que a soit plus petit que 2,61 est de Φ(u) = 0,59
seulement.

11.8 Corrigés des exercices du chapitre 9

Exercice 9.1 : 1) Sous Pθ , X1 , . . . , Xn sont indépendantes et identiquement distribuées


selon la loi exponentielle de paramètre θ, donc Sn suit la loi Γ(n, θ) : Pour tout z ≥ 0,
Z zθ
1
Pθ (Sn ≤ z) = xn−1 e−x dx.
(n − 1)! 0

Il est équivalent de dire que θSn suit la loi Γ(n, 1), ou que 2θSn suit la loi χ22n .
236 Chapitre 11 – Corrections des exercices

2) Si on note Φχ(2n) la fonction de répartition de la loi χ22n , alors on peut trouver


deux nombres an , bn ∈ [0, +∞] tels que Φχ(2n) (an ) = α/2 et Φχ(2n) (bn ) = 1 − α/2 (ce
sont les quantiles de la loi χ22n d’ordre α/2 et 1 − α/2, respectivement). On a alors
 h a bn i
n 
Pθ θ ∈ , = Pθ 2θSn ∈ [an , bn ]
2Sn 2Sn
= Φχ(2n) (bn ) − Φχ(2n) (an ) = 1 − α,
h i
an
ce qui montre que 2S , bn est un intervalle de confiance exact au niveau 1 − α
n 2Sn
pour θ.

Par exemple, pour n = 10 et α = 5%, on a an = 9,59 et bn = 34,17 d’après la


Table 9.2, et donc on trouve que [4,80/Sn , 17,08/Sn ] est un intervalle de confiance au
niveau 95% de θ.

p(1−p)
Exercice 9.2 : 1) E(X̄n ) = p, Var(X̄n ) = n .

2) La loi des grands nombres implique que X̄n converge presque-sûrement et dans L1
vers p.
Rc
3) L’intervalle de confiance aura la forme [X̄n − 2√c n ; X̄n + 2√c n ], où −c g(x)dx = 0,9,
avec g la densité de la loi normale N (0, 1). La table numérique donne c = 1,645. Nous
en déduisons alors la fourchette d’estimation 0,64 − 1,645 20 ≤ p ≤ 0,64 + 1,645 20 , soit
encore 0,56 ≤ p ≤ 0,72.

Exercice 9.3 : 1) La vraisemblance est :


n
Y −α−1
pn (x, (α, β)) = αn β nα xi 1min(xi )≥β .
i=1

A x et α fixés, cette fonction de β est maximale en β = β̂n = min(xi ), et alors


n
Y −α−1 Y n −1
pn (x, (α, β = min(xi ))) = αn (min(xi ))nα xi = αn ψ(x)α xi ,
i=1 i=1
n
min(x
Qn i )
avec ψ(x) = x ∈ [0, 1]. Sauf si les xi sont tous égaux, on a ψ(x) < 1 et donc,
i
i=1
en tant que fonction de α, cette fonction est minimale en
n 1
α̂n = − = 1
Pn .
ln ψ(x) n i=1 ln(xi ) − ln min(xi )

Si les xi sont tous égaux, alors la fonction est croissante en α et tend vers +∞ en
+∞. Donc l’EMV de (α, β) est
 1 
(α̂n , β̂n ) = min(Xi ), 1 Pn .
n i=1 ln(Xi ) − ln mini (Xi )
11.8 – Corrigés des exercices du chapitre 9 237

Il est bien défini si X n’a pas toutes ses coordonnées identiques.

2) On calcule la fonction de répartition de Z = ln X. Soit z ∈ R. On a P(Z ≤ z) =


P(X ≤ ez ). Donc si z < 0, ez < 1 et P(Z ≤ z) = 0. Si z ≥ 0 :
Z ez
α
P(Z ≤ z) = dx = 1 − e−αz ,
1 xα+1

ce qui montre que Z suit la loi exponentielle de paramètre α.

Un estimateur de α est donc


n
h1 X i−1
α̂n = ln Xi .
n i=1

Par la loi forte des grands nombres, on a


n→+∞
1/α̂n −→ 1/α
n→+∞
Pα -presque sûrement. Donc α̂n −→ α Pα -presque sûrement. Par le théorème de la
limite centrale, 1/α̂n vérifie
√  n→+∞ 
n 1/α̂n − 1/α −→ N 0, Varα (ln X) ,

en loi, avec Varα (ln X) = Varα (Z) = Eα (Z 2 ) − Eα (Z)2 = 1/α2 . En utilisant cette
approximation normale et le théorème de Slutsky, on a
√ 
Pα nα̂n 1/α̂n − 1/α ≤ Φ−1 (1 − η/2) ' 1 − η,

en notant Φ−1 (1−η/2) le quantile d’ordre 1−α/2 de la loi gaussienne centrée réduite.
Ceci s’écrit aussi :
 √ 
Pα α̂n /α − 1 ≤ Φ−1 (1 − η/2)/ n ' 1 − η.

On en déduit l’intervalle de confiance asymptotique :


  α̂n α̂n 
Pα α ∈ √ , √ ' 1 − η.
1+ Φ−1 (1 −1
− η/2)/ n 1 − Φ (1 − η/2)/ n

Exercice 9.4 : 1) D’une part, pour tout z > 0, Pλ,µ (Zi ≤ z) = 1 − Pλ,µ (min(Xi , Y1 ) >
z) = 1 − exp(−(λ + µ)z), ce qui montre que Zi ∼ E(λ + µ). D’autre part, Wi ne
prend pour valeurs que 0 ou 1, c’est une variable de Bernoulli. On a Pλ,µ (Wi =
238 Chapitre 11 – Corrections des exercices

R∞R∞ λ
1) = Pλ,µ (Xi ≤ Yi ) = 0 x
µ exp(−µy)dyλ exp(−λx)dx = λ+µ , ce qui montre que
λ

Wi ∼ B λ+µ .

2) Soit f et g deux fonctions continues bornées. En décomposant sur les valeurs prises
par Wi , on a
  
Eλ,µ f (Zi )g(Wi ) = g(1)Eλ,µ f (Zi )1Wi =1 + g(0)Eλ,µ f (Zi )1Wi =0 .

Or
  
Eλ,µ f (Zi )1Wi =1 = Eλ,µ f (Zi )1Xi ≤Yi = Eλ,µ f (Xi )1Xi ≤Yi
Z ∞ Z ∞
= f (x) µ exp(−µy)dyλ exp(−λx)dx
0
Z ∞x
λ λ
= f (x)(λ + µ) exp(−(λ + µ)x)dx = Eλ,µ (f (Zi )),
λ+µ 0 λ+µ
µ

et de même Eλ,µ f (Zi )1Wi =0 = λ+µ Eλ,µ (f (Zi )). On conclut que
  
Eλ,µ f (Zi )g(Wi ) = Eλ,µ f (Zi ) Eλ,µ g(Wi ) ,

ce qui assure l’indépendance de Zi et Wi .

3) La vraisemblance est :
n
Y  λ 1wi =1 µ 1wi =0
pn ((z, w), λ) = (λ + µ) exp − (λ + µ)zi
i=1
λ+µ λ+µ
 n
X  Pn Pn
= exp − (λ + µ) zi λ i=1 wi µn− i=1 wi
i=1
n
Pn zi Pn  X  Pn
= e−λ i=1
λ i=1 wi
exp − µ zi µn− i=1 wi .
i=1

La log-vraisemblance est :
n
X n
X n
X  n
X 
ln ((z, w), λ) = −λ zi + ln λ wi − µ zi + ln µ n − wi .
i=1 i=1 i=1 i=1
Pn Pn
En particulier ∂λ ln ((z, w), λ) = − i=1 zi + P i=1 wi /λ,P qui est une fonction
n n
décroissante en λ qui s’annuleP uniquement en i=1 w i / i=1 zi . Donc la log-
n Pn
vraisemblance est maximale en i=1 wi / i=1 zi . On en déduit que l’Estimateur du
Maximum de Vraisemblance de λ est
Pn
Wi
λ̂n = Pi=1
n .
i=1 Zi
11.8 – Corrigés des exercices du chapitre 9 239

1
Pn λ
4) D’après la loi forte des grands nombres, sous Pλ , on a n i=1 Wi → λ+µ p.s. et
1
Pn 1
n i=1 Zi → λ+µ p.s.. Donc λ̂n → λ p.s..

Pn Pn λ
5) Sous Pλ , i=1 Zi ∼ Γ(n, λ + µ) est indépendante de i=1 Wi ∼ B(n, λ+µ ). Donc
n Z ∞
X   1  nλ
1 1
Eλ (λ̂n ) = Eλ Wi Eλ Pn = (λ + µ)n z n−1 e−(λ+µ)z dz
i=1
Z
i=1 i 0λ+µ
z Γ(n)
Z ∞
nλΓ(n − 1) 1 nλ
= (λ + µ)n−1 z n−2 e−(λ+µ)z dz = .
Γ(n) 0 Γ(n − 1) n −1

Donc λ̂n est un estimateur biaisé mais asymptotiquement non-biaisé.

6) On a
n
√ 1 1 X
n(λ̂n − λ) = √ (Wi − λZi ),
Z n n i=1
Pn
avec Z n = n1 i=1 Zi qui converge Pλ -p.s. vers Eλ (Z1 ) = λ+µ1
d’après la loi forte des
grands nombres. Sous Pλ , d’après le théorème de la limite centrale,
n
1 X n→+∞ 
√ (Wi − λZi ) −→ N 0, Varλ (W1 − λZ1 ) ,
n i=1

en loi. On a
λµ λ2 λ
Varλ (W1 − λZ1 ) = Varλ (W1 ) + λ2 Varλ (Z1 ) = 2
+ = .
(λ + µ) (λ + µ)2 λ+µ
D’après le théorème de Slutsky, sous Pλ ,
√ n→+∞ 
n(λ̂n − λ) −→ N 0, λ(λ + µ) ,

en loi.

7) Sous Pλ , λ̂n (λ̂n + µ) converge p.s. vers λ(λ + µ). Donc, toujours d’après le théorème
de Slutsky, sous Pλ ,

n n→+∞ 
q (λ̂n − λ) −→ N 0, 1 ,
λ̂n (λ̂n + µ)

en loi. Si Φ−1 (r) désigne le quantile d’ordre r de la loi gaussienne centrée réduite,
alors
s s
h λ̂ (
n nλ̂ + µ) λ̂n (λ̂n + µ) i
λ̂n − Φ−1 (1 − α/2) , λ̂n + Φ−1 (1 − α/2)
n n
240 Chapitre 11 – Corrections des exercices

est un intervalle de confiance bilatéral asymptotique pour λ de niveau 1 − α.


Pn
i w
8) A µ fixé, ln ((z, w), (λ, µ)) est maximum pour λ = Pi=1 n et vaut alors
i=1 zi
n
 P 
Pn wi  P n P n 
i=1 wi ln
Pi=1
n − 1 + f (µ) avec f (µ) = −µ i=1 zi + n − i=1 wi ln µ.
i=1 zi
Pn Pn
La fonction f 0 (µ) = − i=1 zi + µ1 n − i=1 wi est décroissante et s’annule pour

Pn
n− w
µ = Pni=1zi i . Donc f (µ) est croissante jusqu’à cette valeur, puis décroissante. On
i=1
conclut donc que l’EMV de (λ, µ) est
 Pn W n − Pn W 
i i
(λ̂n , µ̂n ) = Pi=1
n , Pn i=1 .
Z
i=1 i Z
i=1 i

11.9 Corrigés des exercices du chapitre 10

Exercice 10.1 : 1) Eθ (X1 ) = 1/θ.

2) On a Sn ∼ Γ(n, θ), donc θSn ∼ Γ(n, 1), soit 2θSn ∼ χ22n . On pose ζn = 2θ0 Sn .
Sous H0 , ζn ∼ χ22n . Sous H1 , ζn = (θ0 /θ)(2θSn ) va avoir tendance à prendre des
valeurs plus petites (si θ > θ0 ) ou plus grandes (si θ < θ0 ) que sous H0 . On choisit
donc Wn = {ζn 6∈ [xα/2 (2n), x1−α/2 (2n)]} où xr (2n) désigne le quantile d’ordre r de
la loi χ22n . Ce test a pour niveau α.
obs
A.N. : ζ15 = 44,1 et d’après la Table 9.2, x0,025 (30) = 16,79 et x0,975 (30) = 46,98.

3) La nouvelle région critique est Wn = {ζn ∈]x1−α (2n), +∞[}.


A.N. : x0,95 (30) = 43,77.

P9
Exercice 10.2 : Ici Θ = {(θi )9i=0 , θi ≥ 0, i=0 θi = 1} et H0 = {θ (0) } avec θ (0) =
(1/10, . . . , 1/10). On note θ̂250,i = N (i)/250 et
9 (0)
X (θ̂250,i − θ )2
i
ζ250 = 250 (0)
.
i=0 θi
obs
On a ζ250 ' 10,4. Sous l’hypothèse H0 , ζ250 suit une loi du χ2 à 9 degrés de liberté.
2 obs
Si Z ∼ χ9 , on a P(Z ≥ 16,9) = 0,05. Comme ζ250 ≤ 16,9, on accepte l’hypothèse que
le générateur produit des entiers uniformément répartis sur {0, . . . , 9} au niveau 5%.
Chapitre 12

Textes et corrigés d’examens

Examen Ecole Polytechnique 2017


Exercice : File de voitures.

Sur une route à une seule voie et un seul sens de circulation, on considère une file
infinie de véhicules numérotés 0, 1, 2, 3, .... On suppose qu’ils circulent tous à la même
vitesse prise égale à 1. Ils sont séparés par des distances (Lj )j≥1 comptées de l’arrière
du véhicule j − 1 à l’avant du véhicule j qui suit.
On suppose que pour que le véhicule j s’arrête, il lui faut, à partir du moment où le
véhicule j − 1 qui est devant lui commence à freiner, une distance Rj + Dj où Rj est
la distance parcourue pendant le délai de réaction du conducteur du véhicule j et Dj
est la distance d’immobilisation de ce véhicule.
On suppose que les triplets (Lj , Rj , Dj )j≥1 sont i.i.d. avec L1 , D1 et R1 indépendantes
et positives.

On va étudier les risques de collision lorsqu’un objet encombrant tombe du véhicule 0


en tête de file et empêche la circulation. Pour cela on supposera pour simplifier que :
— lorsqu’un automobiliste freine, il tente d’arrêter son véhicule sur la distance la
plus courte possible, peu importe s’il laisse de la place devant lui,
— les vitesses de décélération sont telles que les collisions n’ont lieu qu’entre un
véhicule en mouvement et un véhicule arrêté.
On pose D0 = 0 et pour n ≥ 1, on note Bn = {Rn + Dn < Ln + Dn−1 }.

1. Montrer que P(B1 ) ≤ P(B2 ). Comparer P(B2 ) et P(B3 ).


2. Dans cette question, on suppose que R1 , L1 et D1 possèdent des densités
respectivement notées pR , pL et pD .

241
242 Chapitre 12 – Textes et corrigés d’examens

(a) Exprimer en fonction de pR , pD et F L (`) = P(` < L1 ) la probabilité pour


que le véhicule 1 ne percute pas l’obstacle.
(b) Calculer cette probabilité lorsque pR , pL et pD sont les densités exponen-
tielles de paramètres respectifs θR , θL et θD .
3. Expliquer pourquoi
Tn l’événement “les véhicules de 1 à n s’arrêtent sans collision”
s’écrit An = k=1 Bk .
4. On suppose que P(R1 ≥ L1 ) > 0 et on note p cette probabilité.
1+P(D2 =D1 )
(a) Montrer que P(D2 ≥ D1 ) = 2 et que P(B2c ) ≥ p2 .
(b) Que peut-on dire des événements (B2k )k≥1 ? En déduire que lim P(A2n ) =
n→+∞
0.
(c) Conclure qu’il y a presque sûrement au moins un accident.
(d) On suppose que D1 est déterministe égale à dF . Déterminer la loi de l’indice
N du premier véhicule qui n’arrive pas à s’arrêter à temps.
Lorsque P(R1 + dF < L1 ) > 0, quelle est la loi conditionnelle de N − 1
sachant N ≥ 2 ?

Problème : Loi de Pareto.

Pour a ∈ R et b > 0, on appelle loi de Pareto de paramètre (a, b) et on note P(a, b)


b
la loi de densité p1 (x, a, b) = (x−a) b+1 1[a+1,+∞[ (x). On note X ∼ P(a, b) si la variable

aléatoire X est distribuée suivant la loi de Pareto de paramètre (a, b). Cette loi est
par exemple utilisée pour modéliser la distribution des revenus dans une population.

I) Analyse probabiliste

Soit X ∼ P(a, b).


1. Montrer que (X − a)−b suit la loi uniforme sur [0, 1] et en déduire sans calcul
que ln(X − a) suit la loi exponentielle de paramètre b.
1
2. A l’aide du changement de variables u = x−a vérifier que
Z 1
∀c ∈] − 1, b[, E[(X − (a + 1))c ] = b (1 − u)c ub−c−1 du.
0

Reconnaı̂tre l’intégrale d’une densité usuelle à la constante de normalisation


près et en déduire que
Γ(b − c)Γ(c + 1)
∀c ∈] − 1, b[, E[(X − (1 + a))c ] = . (12.1)
Γ(b)
R∞
où Γ est la fonction gamma d’Euler définie par ∀a > 0, Γ(a) = 0 xa−1 e−x dx
qui vérifie Γ(a + 1) = aΓ(a) et ∀n ∈ N∗ , Γ(n) = (n − 1)!.
Chapitre 12 – Textes et corrigés d’examens 243

Les deux questions qui suivent sont indépendantes du reste du problème.


Soient b, c > 0, Y ∼ P(0, b), Z ∼ P(0, c) et ε une variable aléatoire de Bernoulli de
c
paramètre b+c indépendantes.
1−ε
3. Déterminer la densité de S = εY + Z .
4. Déterminer la loi de (R, Z) où R = Y /Z. Les variables aléatoires R et Z sont-
elles indépendantes ? Vérifier que R et S ont même loi.

II) Estimation statistique

On observe une réalisation de X = (X1 , . . . , Xn ) où les Xi sont des variables aléatoires
indépendantes et identiquement distribuées de loi commune dans {P(a, b) : a ∈ R, b >
0}.
5. Soient a ∈ R, b > 0. Déterminer la vraisemblance pn (x, a, b) pour x =
(x1 , . . . , xn ) ∈ Rn . Exprimer à l’aide de min1≤i≤n xi la valeur an (x) ∈ R qui
maximise a 7→ pn (x, a, b) pour tout (x, b) ∈ Rn ×]0, +∞[.
6. Calculer la log-vraisemblance ln (x, a, b). Quelle valeur bn (x, a) ∈]0, +∞[
maximise-t-elle b 7→ ln (x, a, b) pour a ∈ R et x ∈]a + 1, +∞[n fixés ? En
déduire l’estimateur du maximum de vraisemblance (EMV) (ân , b̂n ) du couple
(a, b).
7. (a) Calculer P(a,b) (X1 > x) pour x ≥ a + 1. En déduire que sous P(a,b) , Mn =
min1≤i≤n Xi ∼ P(a, nb). Calculer E(a,b) (ân −a) pour n > 1/b. L’EMV est-il
sans biais ?
3 3 6
√ que limn→∞ n E(a,b) [|ân − a| ] =
(b) A l’aide de l’équation (12.1), vérifier b3
et en déduire que P(a,b) (limn→∞ n(ân − a) = 0) = 1.
Pn Pn
8. On pose Rn = n1 i=1 ln(Xi − a) − n1 i=1 ln(Xi − ân ).
(a) A l’aide de la question 1.,Pdonner les comportements
√ asymptotiques lorsque
n Pn
n → ∞ sous P(a,b) de n1 i=1 ln(Xi − a) et n 1b − n1 i=1 ln(Xi − a) .

Pn −a
(b) Avec l’inégalité ∀x > 0, ln(x) ≤ x − 1, vérifier que Rn ≤ n1 i=1 Xâin−â n
.
En déduire que 0 ≤ Rn ≤ ân − a.
(c) Montrer que (ân , b̂n ) converge P(a,b) p.s. vers (a, b) lorsque n → ∞.
√ √ Pn  √
(d) En écrivant que n(b̂n −b) = bb̂n × n 1b − n1 i=1 ln(Xi − a) + nRn ,


vérifier que n(b̂n − b) converge en loi vers N (0, b2 ) lorsque n → ∞.

Corrigé de l’examen Ecole Polytechnique 2017

Exercice : File de voitures.


244 Chapitre 12 – Textes et corrigés d’examens

1. On a B1 = {R1 + D1 − L1 < 0}, B2 = {R2 + D2 − L2 < D1 } et B3 =


L
{R3 + D3 − L3 < D2 }. Comme (R1 , D1 , L1 ) = (R2 , D2 , L2 ) et, par positivité
de D1 , {R2 + D2 − L2 < 0} ⊂ B2 , P(B1 ) = P(R2 + D2 − L2 < 0) ≤ P(B2 ).
L
Comme (R2 , D2 , L2 , D1 ) = (R3 , D3 , L3 , D2 ), on en déduit que P(B2 ) = P(B3 ).
2. (a)
Z ∞Z ∞Z ∞
 
P(B1 ) = E 1{R1 +D1 <L1 } = 1{r+δ<`} pL (`)d`pD (δ)dδpR (r)dr
0 0 0
Z ∞Z ∞
= F L (r + δ)pD (δ)dδpR (r)dr.
0 0

(b) Pour ` ≥ 0, F L (`) = e−θL ` si bien que


Z ∞ Z ∞
−(θR +θL )r θR θD
P(B1 ) = θR e dr θD e−(θD +θL )δ dδ = × .
0 0 θR + θL θD + θL
3. Montrons le résultat par récurrence sur n. A partir du moment où l’obstacle
tombe du véhicule 0, le véhicule 1, à distance L1 de cet obstacle, a besoin de
la distance R1 + D1 pour s’arrêter en freinant. Donc l’événement ”le véhicule
1 s’arrête sans collision” s’écrit {R1 + D1 < L1 } = A1 . Supposons que pour
n ≥ 2, l’événement ”les véhicules de 1 à n − 1 s’arrêtent sans collision” s’écrive
An−1 . Dans le cas où le véhicule n − 1 ne percute pas son prédécesseur, à partir
du moment où il commence à freiner
— il parcourt Dn−1 avant de s’arrêter,
— le véhicule n, à distance Ln de lui, a besoin de la distance Rn + Dn pour
s’arrêter par freinage.
Donc l’événement ”les véhicules de 1 à n s’arrêtent sans collision” s’écrit An−1 ∩
B n = An .
4. (a) Par sigma-additivité, 1 = P(D2 = D1 ) + P(D2 > D1 ) + P(D1 > D2 ) où les
L
deux dernières probabilités sont égales puisque (D1 , D2 ) = (D2 , D1 ). Donc
1 P(D =D )
2 =
2
2
1
+P(D2 > D1 ) et P(D2 ≥ D1 ) = P(D2 = D1 )+P(D2 > D1 ) =
P(D2 =D1 )+1
2 . Comme {R2 ≥ L2 }∩{D2 ≥ D1 } ⊂ {R2 +D2 ≥ L2 +D1 } = B2c ,
par indépendance P(B2c ) ≥ P(R2 ≥ L2 )P(D2 ≥ D1 ) où le premier facteur
est égal à p et le second est minoré par 1/2.
(b) Les événements (B2k )k≥1 sont Tn indépendants et équiprobables d’après la
question 1.. Comme A2n ⊂ k=1 B2k , on a
n
n→+∞
\
P(A2n ) ≤ P( B2k ) = (1 − P(B2c ))n −→ 0
k=1

car P(B2c ) > 0 d’après la question précédente.


T
(c) L’événement “il n’y a pas d’accident” s’écrivant k≥1 Ak , il est inclus dans
A2n pour tout n ≥ 1 et donc de probabilité nulle.
Chapitre 12 – Textes et corrigés d’examens 245

(d) On a alors B1 = {R1 + dF < L1 } et Bk = {Rk < Lk } pour k ≥ 2 si bien


que les événements (Bk )k≥1 sont indépendants. On a {N = 1} = B1c si bien
Tn−1
que P(N = 1) = P(R1 + dF ≥ L1 ) et pour n ≥ 2, {N = n} = k=1 Bk ∩ Bnc
si bien que P(N = n) = P(R1 + dF < L1 )(1 − p)n−2 p. Comme P(N ≥ 2) =
P(R1 + dF < L1 ), lorsque cette probabilité est strictement positive, pour
n ∈ N∗ ,

P(N = n + 1)
P(N − 1 = n|N ≥ 2) = = (1 − p)n−1 p.
P(N ≥ 2)

La loi conditionnelle est donc la loi géométrique de paramètre p.

Problème : Loi de Pareto.

I) Analyse probabiliste

1. Pour ϕ : R → R mesurable bornée,

Z ∞ Z 0 Z 1
E[ϕ((X−a)−b )] = ϕ((x−a)−b )b(x−a)−b−1 dx = − ϕ(u)du = ϕ(u)du,
a+1 1 0

en effectuant le changement de variables u = (x − a)−b tel que du = −b(x −


a)−b−1 dx. Comme ln(X −a) = − 1b ln((X −a)−b ), on conclut avec le paragraphe
4.6.2 du polycopié.

2.
Z ∞
E[(X − (1 + a))c ] = (x − (a + 1))c b(x − a)−b−1 dx
a+1
Z ∞
 c
1 1 dx
=b 1− b−c−1 (x − a)2
a+1 x − a (x − a)
Z 0
u=1/(x−a)
= −b (1 − u)c ub−c−1 du
1
1
Γ(b − c)Γ(c + 1)
Z
Γ(b + 1)
= ub−c−1 (1 − u)c du
Γ(b) 0 Γ(b − c)Γ(c + 1)

où la dernière intégrale vaut 1 comme intégrale de la densité β(b − c, c + 1).

3. Comme ϕ(S) = εϕ(Y ) + (1 − ε)ϕ( Z1 ), en utilisant la linéarité de l’espérance et


246 Chapitre 12 – Textes et corrigés d’examens

l’indépendance des variables aléatoires, on a

E[ϕ(S)] = E[ε]E[ϕ(Y )] + E[1 − ε]E[ϕ(1/Z)]


Z ∞ Z ∞
c b dz
= ϕ(y)by −b−1 dy + ϕ (1/z) cz −c+1 2
b+c 1 b+c 1 z
Z ∞ Z 1
s=1/z c b
= ϕ(y)by −b−1 dy + ϕ(s)csc−1 ds
b+c 1 b+c 0
Z ∞
bc
= ϕ(s)(1{s≤1} sc−1 + 1{s>1} s−b−1 )ds.
b+c 0

Ainsi S a pour densité bc


b+c (1{0<s≤1} s
c−1
+ 1{s>1} s−b−1 ).
4. Pour ϕ : R2 → R mesurable bornée, comme par indépendance de Y et Z le
couple (Y, Z) a pour densité le produit de celle de Y par celle de Z,
Z ∞Z ∞
E[ϕ(R, Z)] = E[ϕ(Y /Z, Z)] = ϕ(y/z, z)by −b−1 dycz −c−1 dz
z=1 y=1
Z ∞ Z ∞
r=y/z
= ϕ(r, z)b(rz)−b−1 zdrcz −c−1 dz
z=1 r=1/z
Z
= ϕ(r, z)bc1{z>1,rz>1} r−b−1 z −b−c−1 drdz.
R2

Ainsi (R, Z) a pour densité bc1{z>1,rz>1} r−b−1 z −b−c−1 qui ne peut pas se
mettre sous forme produit à cause du terme 1{rz>1} si bien que R et Z ne sont
pas indépendantes. La densité marginale de R est donc
Z ∞  −b−c ∞
−b−1 −b−c−1 −b−1 z
1{r>0} bcr z dz = 1{r>0} bcr
max(1,1/r) b + c max(1,1/r)
bcr−b−1 b+c 
= r 1{0<r≤1} + 1{r>1} .
b+c
On conclut que R et S ont même densité et donc même loi.

II) Estimation statistique

5. On a
bn
pn (x, a, b) = Qn 1
b+1 {a≤min1≤i≤n xi −1}
.
i=1 (xi − a)
n
La fonction a 7→ Qn (xbi −a)b+1 étant positive et strictement croissante sur
i=1
] − ∞, min1≤i≤n xi [, on en déduit que

an (x) = min xi − 1.
1≤i≤n
Chapitre 12 – Textes et corrigés d’examens 247

Pn
6. Pour x ∈]a + 1, +∞[n , ln (x, a,P
b) = n ln(b) − (b + 1) i=1 ln(xi − a). La dérivée
n
partielle ∂l n n
∂b (x, a, b) = b − i=1 ln(xi − a) s’annule en b =
Pn n
ln(xi −a) .
i=1
2
Comme ∂∂bl2n (x, a, b) = − bn2 < 0, bn (x, a) = Pn ln(xn
i −a)
. On en déduit que
i=1
l’EMV du couple (a, b) est
 
n
(ân , b̂n ) = min Xi − 1, Pn .
1≤i≤n i=1 ln(Xi − ân )

7. (a) Pour x ≥ a + 1,
Z ∞ ∞
b(y − a)−b−1 dy = −(y − a)−b x = (x − a)−b .

P(a,b) (X1 > x) =
x
Tn
Comme {Mn > x} = i=1 {Xi > x}, par indépendance, P(a,b) (Mn > x) =
(P(a,b) (X1 > x))n = (x − a)−nb . Ainsi sous P(a,b) , Mn a même fonction de
répartition que X1 au remplacement près de b par nb, si bien que Mn ∼
P(a, nb). Pour nb > 1, en utilisant (12.1), on a
Γ(nb − 1)Γ(2) 1
E(a,b) [ân − a] = E(a,b) [Mn − (a + 1)] = = ,
Γ(nb) nb − 1
si bien que l’EMV est biaisé.
(b) P(a,b) p.s. ∀i ≥ 1, Xi > a + 1, et ∀n ≥ 1, Mn > a + 1, |ân − a|3 =
(Mn − (a + 1))3 et (12.1) assure que pour n > 3/b,
Γ(nb − 3)Γ(4) 6
E(a,b) [|ân − a|3 ] = = .
Γ(nb) (nb − 1)(nb − 2)(nb − 3)
√ 6
Ainsi pour n → ∞, E(a,b) [| n(ân − a)|3 ] ∼ n3/2 b3
. Donc
√ X √
X  
3 3

∞> E(a,b) | n(ân − a)| = E(a,b) | n(ân − a)| ,
n>3/b n>3/b
P √ 3

si bien que P(a,b) n>3/b | n(ân − a)| < ∞ = 1. Comme le terme
général d’une série convergente tend vers 0, on en déduit que
 √ 
P(a,b) lim | n(ân − a)|3 = 0 = 1.
n→∞

8. (a) D’après la question 1., les variables ln(Xi − a) sont i.i.d. suivant la loi
exponentielle E(b) d’espérance 1/b et variance 1/b2 sous P(a,b) . La loi forte
Pn
des grands nombres assure que P(a,b) n1 i=1 ln(Xi − a) →n→∞ 1/b = 1.
Le théorème de la limite centrale entraı̂ne que sous P(a,b) , on a
n
√ 1
 
1X L
n − ln(Xi − a) −→ Z ∼ N (0, 1/b2 ).
b n i=1
248 Chapitre 12 – Textes et corrigés d’examens

(b) L’inégalité entraı̂ne que


n   n
1X Xi − a 1 X Xi − a − Xi + ân
Rn = ln ≤ .
n i=1 Xi − ân n i=1 Xi − ân

Comme Xi − ân ≥ 1 pour i ∈ {1, . . . , n} et ân > a, on en déduit la


majoration de Rn . Sa positivité découle de l’inégalité ân > a.
(c) La question précédente et la question 7b. entraı̂nent que
√ n→∞
P(a,b) ((ân , nRn ) −→ (a, 0)) = 1.
Pn
Comme b̂1 = n1 i=1 ln(Xi − a) − Rn , avec la question 8a. et la continuité
n
n→∞
de x 7→ 1/x en 1/b, on conclut que P(a,b) ((ân , b̂n ) −→ (a, b)) = 1.

(d) Comme sous P(a,b) , nRn converge p.s. vers 0 et
n

 
1 1X L
n − ln(Xi − a) −→ Z ∼ N (0, 1/b2 ),
b n i=1

le théorème de Slutsky assure que


n
√ 1 √
 
1X L
n − ln(Xi − a) + nRn −→ Z
b n i=1

lorsque n → ∞. Comme bb̂n converge p.s. vers b2 , une nouvelle application


du théorème de Slutsky permet de conclure que
√ L
n(b̂n − b) −→ b2 Z ∼ N (0, b2 ).

Examen Ecole Polytechnique 2018


Exercice : On a mesuré la hauteur moyenne annuelle des eaux du lac Huron en
Amérique du Nord chaque année depuis 1875. Si on note Xi cette hauteur moyenne
annuelle pour l’année 1875 + i, avec i = 0, 1, ... et si l’on trace Xi+1 en fonction de Xi
pour i = 0, 1, ..., on remarque un nuage de points très alignés. Aussi pour modéliser
les Xi , on propose la dynamique suivante :

Xn = α Xn−1 + εn pour n ≥ 1, (12.2)

où
— α est un réel fixé de ] − 1, 1[ ;
— (εn )n∈N est une suite de variables aléatoires indépendantes et identiquement
distribuées suivant une loi normale(=gaussienne) centrée N (0, σ 2 ) avec σ 2 > 0 ;
Chapitre 12 – Textes et corrigés d’examens 249

— X0 est une variable aléatoire indépendante de (εi )i≥1 .


Pn−1
1. Montrer que Xn = αn X0 + i=0 αi εn−i pour tout n ∈ N∗ .
2. Montrer que la suite (αn X0 )n∈N tend presque sûrement vers 0. Montrer que
Pn−1
( i=0 αi εn−i )n∈N∗ est une suite  de variables gaussiennes convergeant en loi
2 −1
vers la loi N 0 , σ 2 (1 − α ) . En déduire que (Xn )n∈N converge en loi vers
N 0 , σ 2 (1 − α2 )−1 .


3. On suppose maintenant  et jusqu’à la fin de ce problème que X0 suit la


loi N 0 , σ 2 (1 − α2)−1 . Montrer que pour tout n ∈ N, Xn suit cette loi
N 0 , σ 2 (1 − α2 )−1 .
4. Montrer que Cov(Xi , Xj ) = σ 2 (1 − α2 )−1 α|j−i| pour tout (i, j) ∈ N2 .
En utilisant la matrice Σ = (Cov(Xi , Xj ))0≤i,j≤n dont on peut montrer qu’elle
est inversible (ne pas le faire !), déterminer la densité f(X0 ,...,Xn ) de la loi de
(X0 , . . . , Xn ) (sans calculs...).

Problème 1 : Soit (m, λ) ∈ R×]0, ∞[. On considère la densité par rapport à la


mesure de Lebesgue sur R définie par :

f (x) = λ exp − λ(x − m) 1x≥m .
Questions de probabilités :
1. Soit X une variable aléatoire de densité f . Quelle est la loi de X − m ?
2. Déterminer E(X) et Var(X).
Déterminer la fonction de répartition de X.
3. On considère (X1 , . . . , Xn ) une famille de variables aléatoires indépendantes
distribuées suivant la même loi que X. On note Mn = min(X1 , . . . , Xn ).
Montrer que Mn est une variable aléatoire à densité par rapport à la mesure
de Lebesgue et déterminer la.
Montrer que (Mn ) converge en loi et identifier sa limite.
4. Soit Zn = n(Mn − m). Quelle est la loi de Zn ?
Questions de statistique :
5. On suppose désormais que m est connu mais que λ est inconnu. Déterminer
la vraisemblance pn (x1 , . . . , xn ; λ). Montrer que l’estimateur λ
bn par maximum
de vraisemblance de λ est donné par
bn = Pn n
λ .
i=1 (Xi − m)

6. En utilisant la Delta méthode, montrer que λ


bn vérifie :
√ L
N 0 , λ2 .
 
bn − λ −→
n λ
n→∞

En déduire un intervalle de confiance asymptotique de niveau 95% pour λ.


250 Chapitre 12 – Textes et corrigés d’examens

Problème 2 : Le but de cet exercice est d’étudier une modélisation aléatoire de


la répartition des nombres premiers [L’idée est de proposer un modèle qui reproduit le
fait que le nombre π(n) de nombres premiers entre 1 et n satisfait π(n) ∼ lnnn pour
n → ∞].
On considère la suite (Xk )k≥3 définie par Xk = 1{k est un nombre premier} et
on suppose que (Xk )k≥3 est une suite de variables aléatoires indépendantes, telles
que pour k ≥ 3 :
1
P(Xk = 1) = 1 − P(Xk = 0) = .
ln k
On note :
n n
X X 1
Sn = Xk et An = .
ln k
k=3 k=3
n
Dans la suite, on pourra utiliser le fait que An ∼ ln n lorsque n → ∞.
1. Quelle est la probabilité que le nombre de nombres premiers entre 3 et n soit
nul ?
2. Déterminer E(Sn ).
 
3. On note E = n ≥ 3, Xn = 1 . Montrer que P E est infini = 1.
4. Calculer Var(Sn ). En déduire que Sn /An converge en probabilité vers 1.

5. Pour t > 0, montrer que E[etSn ] ≤ exp An (et − 1) .
Pour ε ∈ ]0, 1[, en choisissant astucieusement t, montrer qu’il existe une fonc-
tion φ+ : ]0, 1[ → ]0, +∞[ vérifiant
 
P Sn ≥ (1 + ε)An ≤ exp − φ+ (ε) An .

De la même manière, on peut montrer (ne pas le faire


 !) qu’il existe une fonction

φ− : ]0, 1[ → ]0, +∞[ telle que P Sn ≤ (1 − ε)An ≤ exp − φ− (ε) An .
ln n p.s.
6. Déduire de ce qui précède que Sn × −→ 1 .
n n→+∞

Corrigé de l’examen Ecole Polytechnique 2018


Exercice :
1. Ceci se fait par récurrence.P
Vrai pour n = 1, et si vrai à l’ordre n,Palors Xn+1 =
n−1 n
α Xn + εn+1 = αn+1 X0 + i=0 αi+1 εn−i + εn+1 = αn+1 X0 + i=0 αi εn+1−i
donc vrai à l’ordre n + 1.
2. Comme α ∈ ]−1, 1[, on a αn −→ 0. Comme on a pour presque tout ω ∈ Ω,
n→∞
p.s.
|X0 (ω)| < ∞, on en déduit que αn X0 −→ 0.
n→+∞
Comme les (εi ) sont des variables gaussiennes indépendantes, on sait que toute
Pn−1
combinaison linéaire des (εi ) est une variable gaussienne, donc i=0 αi εn−i a
Chapitre 12 – Textes et corrigés d’examens 251

Pn−1
une loi gaussienne. Elle est clairement centrée et sa variance vaut σ 2 i=0 (α2 )i
du fait de l’indépendance des (εi ), donc sa variance vaut σ 2 (1 − α2n ) (1 −
α2 )−1 −→ σ 2 (1−α2 )−1 . Comme on sait qu’une suite de variables gaussiennes
n→∞
dont l’espérance et la variance convergent est une suite qui converge en loi
vers une variable gaussienne d’espérance et variance limites, on en déduit que
Pn−1 i L 2 2 −1
i=0 α εn−i −→ N (0 , σ (1 − α )
n→∞
).
p.s. P
En utilisant le Lemme de Slutsky, comme αn X0 −→ 0 donc αn X0 −→ 0
n→+∞ n→+∞
Pn−1 i L 2 2 −1
et comme on a i=0 α ε n−i −→ N (0 , σ (1 − α ) ), on en déduit que
n→∞
L
Xn −→ N (0 , σ 2 (1 − α2 )−1 ).
n→∞
3. Ceci se montre par récurrence, avec l’argument principal que Xn suit la loi
N (0 , σ 2 (1 − α2 )−1 ), donc αXn suit la loi N (0 , α2 σ 2 (1 − α2 )−1 ), avec εn+1
une variable gaussiene indépendante de Xn , alors αXn + εn+1 est une variable
gaussienne centrée de variance la somme des variances, soit αXn + εn+1 suit
une loi N 0 , α2 σ 2 (1 − α2 )−1 + σ 2 = N 0 , σ 2 (1 − α2 )−1 .


4. On a pour j > i, avec la formule de récurrence initiale, Xj = αj−i Xi +


Pj−i−1 k Pj−i−1
k=0 α εj−k , donc Cov(Xi , Xj ) = Cov(Xi , αj−i Xi )+Cov( k=0 αk εj−k , Xi )
car les variables sont indépendantes et ainsi Cov(Xi , Xj ) = αj−i Var(Xi ) =
σ 2 αj−i (1 − α2 )−1 . Du fait de la symétrie Cov(Xi , Xj ) = Cov(Xj , Xi ), on en
déduit le résultat recherché.
Il est clair qu’il existe une matrice réelle A telle que le vecteur (X0 , X1 , . . . , Xn )t
s’écrive comme AZ, où Z = (X0 , ε1 , . . . , εn )t . Comme Z est un vecteur gaus-
sien centré car composé de variables gaussiennes centrées indépendantes, on en
déduit que (X0 , X1 , . . . , Xn )t est également un vecteur gaussien centré. Sa ma-
trice de covariance est bien Σ d’après la question précédente et comme celle-ci
est inversible, la densité de (X0 , X1 , . . . , Xn )t est :
1  1 
f(X0 ,...,Xn ) (x0 , . . . , xn ) = √ exp − (x0 , . . . , xn )t Σ−1 (x0 , . . . , xn ) .
(2π)(n+1)/2 det Σ 2

Problème 1 :
1. Il est facile de voir que X − m a pour loi une loi exponentielle de paramètre λ.
2. On déduit de la question précédente que E(X) = m + 1/λ et Var(X) = 1/λ2 .
Qn
3. Pour x ≥ m, on a Fmn (x) := P(mn ≤ x) = 1 − i=1 P(Xi > m) =
n
1 − P(X1 > m) du fait de l’indépendance et de l’équidistribution. Or
R ∞ −λ(t−m)
P(X1 > m) = m λe dt = e−λ(x−m) . On en déduit que Fmn (x) =
−λn(x−m)
(1 − e )1x≥m qui est une fonction différentiable presque partout, donc
mn est une variable aléatoire admettant une densité par rapport à la mesure
de Lebesgue qui est la dérivée de Fmn (x) (sauf en m), donc sa densité est :

fmn (x) := λn e−λn(x−m) 1x≥m .


252 Chapitre 12 – Textes et corrigés d’examens

Il est clair que pour tout x > m, Fmn (x) −→ 1, donc Fmn converge vers
n→∞
la fonction de répartition d’une masse de Dirac en m. On en déduit que mn
converge en loi vers m, et comme converger en loi vers une constante revient
à converger en probabilité vers cette constante, on en déduit que mn converge
en probabilité vers m.
4. Pour x ≥ m, an a FZn (x) := P(Zn ≤ x) = P mn ≤ m + x/n = 1 − e−λx : on


en déduit que Zn suit une loi exponentielle de paramètre λ.


Qn  Pn Q
n
5. On a pn (x1 , . . . , xn ; λ) = i=1 fθ (xi ) = λn exp −λ i=1 (xi −m) i=1 1xi ≥m
du fait de l’indépendance et de l’équidistributivité des X i . Par ailleurs,
Pnpour les
xi ≥ m, on peut considérer `(λ) = ln pn (x1 , . . . , xn ; λ) = nP ln λ−λ i=1 (xi −
n
b En dérivant cette fonction, on obtient `0 (λ) = n/λ − i=1 (xi − m),
m). b un
P n
point critique étant atteint en λ = λ = n/ i=1 (xi − m)
b b et en la dérivant
encore on obtient `00 (λ) = −n/λ2 toujours négative : le point critique est donc
un maximum local et global, d’où l’expression de l’estimateur.
6. D’après le théorème de la limite centrale dont les hypothèses (v.a.i.i.d. de carré
intégrable) sont ici respectées, on a
n
√ 1 X 1 L 1
n (Xi − m) − −→ N 0 , 2 .
n i=1 λ n→∞ λ

Il suffit maintenant d’appliquer la méthode Delta avec la fonction g(x) = 1/x,


de dérivée g 0 (x) = −1/x2 , pour obtenir le théorème voulu.
√ b  L
Enfin, on a encore n λ/λ − 1 −→ N (0, 1). Avec q0.975 le quantile à
n→∞
√ b 
97.5% de la loi normale centrée réduite, on sait donc que P n λ/λ −1 ∈
  √ √ 
[−q0.975 , q0.975 ] = P λ ∈ λ/(1
b + q0.975 / n) , λ/(1
b − q0.975 / n) −→ 0.95,
n→∞
intervalle asymptotique à 95% pour λ.

Problème 2 :
Qn
1. On a P(Sn = 0) = k=3 ln1k .
Pn Pn 1
2. On a E(Sn ) = k=3 E(Xk ) = k=3 ln k .
3. Soit Ek l’événement “Xk = 1”. Montrer que E est infini avec une proba-
bilité 1 c’est montrer que lim supk→∞ Ek = 1. D’après le Lemme de Borel-
Cantelli,Pcomme les Xk sont indépendantes, donc les Ek également, ceci est
∞ P∞
vrai si k=3 P(Ek ) = ∞. Or k=3 P(Ek ) = limn→∞ An = ∞ (d’après son
équivalent), donc P(E est infini) = 1.
Pn
4. On a Var(Sn ) = k=3 Var(Xk ) puisque les variables sont indépendantes, et
comme les Xk sont des variables de Bernoulli, on a Var(Xk ) = lnlnk−1 2 k . D’où
Pn
Var(Sn ) = k=3 lnlnk−1 2k .
D’après l’inégalité de Bienaymé-Tchevychev,
 il est clair que pour tout ε >
0, P |Sn /An − 1| ≥ ε ≤ Var(Sn )/(εAn )2 . Comme on voit facilement que
Chapitre 12 – Textes et corrigés d’examens 253


Var(Sn ) ∼ An quand n → ∞, on a ainsi P |Sn /An − 1| ≥ ε −→ 0 : Sn /A/n
n→∞
converge bien en probabilité vers 1.
Qn
5. On a E[etSn ] = k=3 E[etXk ] car les variables sont indépendantes. Mais on
t
a facilement E[etXk ] = ln1k et + 1 − ln1k = 1 + eln−1
 tSn

k . D’où ln E[e ] =
et −1
Pn  tSn

k=3 ln 1+ ln k . Comme ln(1+u) ≤ u pour tout u > −1, on a ln E[e ] ≤
Pn et −1 t
k=3 ln k ≤ An (e − 1) d’où le résultat.
  
On a P Sn ≥ (1+ε)An = P etSn ≥ e(1+ε)tAn ≤ exp t
 An (e −1)−(1+ε)tA n
grâce à l’inégalité de Markov, soit P Sn ≥ (1+ε)An ≤ exp An (et −1−t−εt) .
Soit la fonction hε (t) = et − 1 − t − εt pour t ∈ ]0, 1[. Alors h0ε (t) = et − 1 − ε,
donc h0ε (t) = 0 pour t = ln(1 + ε). De plus h0ε (t) < 0 pour t < ln(1 + ε) et
h0ε (t) > 0 pour t > ln(1 + ε). On en déduit que hε atteint son minimum en
t = ln(1 + ε) et comme hε (0) = 0 ce minimum est négatif. En choisissant cette
valeur pour t et en posant φ+  (ε) = −hε (ln(1 + ε)) = −ε + (1 + ε) ln(1 + ε) > 0,
on a bien P Sn ≥ (1 + ε)An ≤ exp − An φ+ (ε) .
6. De ce qui précède, on a pour tout ε ∈ ]0, 1[ :
 S 
n  
− 1 ≥ ε = P Sn ≥ (1 + ε)An + P Sn ≥ (1 − ε)An

P
An
 
≤ exp − An φ+ (ε) + exp − An φ− (ε) .
P∞ S
Comme An ∼ n/ ln n et comme φ+ (ε) > 0 et φ− (ε) > 0, on a n=3 P A n
n


1 ≥ ε < ∞. Ce critère caractérisant la convergence presque sûre, on en déduit
Sn p.s.
que A n
−→ 1. De l’équivalence de An , on en déduit le résultat final.
n→+∞

Examen Ecole Polytechnique 2019


Exercice 1 : Les trois questions de l’exercice sont indépendantes.
1. Soit X ∼ N (0, 1) et Y = RX avec R indépendante de X et telle que P(R =
−1) = P(R = 1) = 1/2. Quelle est la loi de Y ? Quelle est la covariance entre
X et Y ? Quelle est la loi de la variable S = X + Y ? Le vecteur (X, Y ) est-il
gaussien ?
2. Soit X ∼ N (0, 1) et Y une variable telle que pour tout x, sachant X = x,
Y suit une loi normale de moyenne x et de variance 1. Déterminer la densité
f (x, y) de la loi de (X, Y ). Calculer E[X|Y ].
3. On considère des variables aléatoires Xi i.i.d. suivant une loi normale centrée
réduite. On rappelle que Var(X12 ) = 2. Déduire du théorème central limite
et de la méthode delta le résultat de normalitépasymptotique vérifié par la
suite de variables aléatoires (Dn )n≥1 , où Dn = X12 + · · · + Xn2 . Déterminer
un intervalle de confiance asymptotique pour Dn à 95 %, et commenter la
254 Chapitre 12 – Textes et corrigés d’examens

distance à l’origine en grande dimension d’un point tiré aléatoirement suivant


une loi normale multivariée standard N (0, I).

Exercice 2 : Soit (Xn )n≥1 une suite de variables aléatoires indépendantes telles
que, pour tout n ≥ 1, on a E[Xn ] = 0 et |Xn | ≤ M pour un M > 0 déterministe. On
rappelle que 2 cosh(u) = eu + e−u .
1. Montrer, par exemple grâce à un argument de convexité, que
M − x −λM x + M λM
eλx ≤ e + e pour tout x ∈ [−M, M ] et λ > 0 .
2M 2M
 1 2 2
2. En déduire que, pour tout i ≥ 1, E eλXi ≤ cosh(λM ) ≤ e 2 λ M . Pour la
dernière inégalité, on pourra comparer les séries entières des fonctions cosh(u)
u2
et e 2 .
3. Soit n ≥ 1. On note Sn = X1 + · · · + Xn . Pour tout λ > 0 et x > 0, montrer
que l’on a  
Sn λ2 M 2
P ≥ x ≤ en( 2 −λx) .
n
nx2
4. En déduire que, pour tout x > 0, P( Snn ≥ x) ≤ e− 2M 2 , puis que
 
Sn nx2
P ≥ x ≤ 2e− 2M 2 .
n
Exercice 3 : Sur l’ensemble des densités de probabilité sur R (fonctions positives
d’intégrale 1), on définit le carré de la distance de Hellinger h entre f et g par
Z p 2
2 1 p
h (f, g) = f (x) − g(x) dx.
2 R
1. Montrer que Z p
h2 (f, g) = 1 − f (x)g(x) dx.
R
Vérifier que h est une distance sur l’ensemble des densités sur R (i.e. positivité
avec nullité si et seulement si égalité presque partout, symétrie et inégalité
triangulaire), avec de plus 0 ≤ h(f, g) ≤ 1.
2. Soient θ > 0 et fθ la densité de la loi uniforme sur [0, θ] : fθ (x) = θ1 1[0,θ] (x).
q
Montrer que h2 (fθ , fθ0 ) = 1 − θθ0 si θ ≤ θ0 .
3. Soient n ≥ 1 et X1 , . . . , Xn i.i.d. de loi uniforme sur [0, θ] pour un
θ > 0 inconnu. Donner l’estimateur du maximum de vraisemblance hp i θ̂n =
ϕn (X1 , . . . , Xn ) de θ et identifier la fonction ϕn . Calculer Eθ θ̂n , et en
h i
1
déduire que Eθ h2 (fθ , fθ̂n ) = 2n+1 (fθ̂n est la densité de la loi uniforme sur
[0, θ̂n ]).
Chapitre 12 – Textes et corrigés d’examens 255

4. Soit la densité
 
1 10
fn∗ (x) = 10 1 − 1{0≤x≤ 10
1
}+ 1 9 .
n n { 10 ≤x≤1}

(a) Pour tout n ≥ 1, soit Yn une variable aléatoire de loi à densité fn∗ . Montrer
que la suite (Yn )n≥1 converge en loi et identifier sa limite.
(b) Calculer h2 (fn∗ , f 10
1 ).

5. Soit n ≥ 1. Les variables X1 , . . . , Xn sont désormais i.i.d. de densité fn∗ , mais


on les croit toujours i.i.d. suivant une densité uniforme fθ , avec θ > 0 inconnu.
En particulier, l’estimateur θ̂n = ϕn (X1 , . . . , Xn ) est le même que celui défini
ci-dessus en question 3.
(a) Montrer qu’avec probabilité 1 − (1 − n1 )n , on a : 9
10 ≤ θ̂n ≤ 1.
9
(b) Montrer que, sur l’événement { 10 ≤ θ̂n ≤ 1}, on a :
r
2 ∗ 1 1 1
h (fn , fθ̂n ) ≥ 1 − 1− − √ .
3 n 3 n

(c) En notant E∗n [·] l’espérance par rapport au modèle où les données
X1 , . . . , Xn sont i.i.d. de densité fn∗ , en déduire que E∗n [h2 (fn∗ , fθ̂n )] ≥ un ,
avec limn→∞ un = 32 (1 − 1e ).
(d) Conclure quant à la robustesse de l’estimateur du maximum de vraisem-
blance à une mauvaise spécification du modèle.

Corrigé de l’examen Ecole Polytechnique 2019


Exercice 1 :
1. En notant Φ la fonction de répartition de la loi normale standard, on a pour
tout réel y, via l’indépendance de R et X :

P(Y ≤ y) = P(R = −1, X ≥ −y) + P(R = 1, X ≤ y) = Φ(y),

donc Y ∼ N (0, 1). Pour la covariance entre X et Y , les variables R et X étant


centrées avec R indépendante de X, il vient :

Cov(X, Y ) = E[XY ] = E[RX 2 ] = 0.

Par la même méthode que ci-dessus, la fonction de répartition de S s’écrit


1
P(S ≤ s) = (1s≥0 + Φ(s/2)).
2
La variable S = X + Y n’étant pas gaussienne, le vecteur (X, Y ) n’est pas
gaussien.
256 Chapitre 12 – Textes et corrigés d’examens

2. En notant f (x, y) la densité de la loi de (X, Y ), on a


 2
(y − x)2
 
1 x
f (x, y) = fX (x)fY |X=x (y) = exp − exp −
2π 2 2

En notant fX|Y =y (x) la densité conditionnelle de X sachant Y = y, on a (en


tant que fonction de x)

f (x, y)
∝ f (x, y) ∝ exp −(x − y/2)2 ,

fX|Y =y (x) =
fY (y)

ce qui montre que, sachant Y = y, X suit une loi N (y/2, 1/2). En particulier,
on en déduit que E[X|Y ] = Y /2.
3. Puisque E[X12 ] = 1 et Var(X12 ) = 2, le théorème central limite appliqué aux
variables Xi2 donne
n
!
√ 1X 2 L
n X − 1 −−−−→ N (0, 2).
n i=1 i n→∞


La méthode delta appliquée avec g(x) = x permet d’en déduire que


 
Dn L
n √ − 1 −−−−→ N (0, 1/2),
n n→∞

ou encore √ √  L
2 Dn − n −−−−→ N (0, 1).
n→∞

En arrondissant le quantile d’ordre 0.975 d’une loi normale standard à 2, ceci


signifie que : √ √
√ √
P( n − 2 ≤ Dn ≤ n + 2) −−−−→ 0.95.
n→∞

En grande dimension, un point tiré aléatoirement suivant une √loi normale


√ stan-
dard a environ 95% de chances d’être à distance inférieure à 2 de n.

Exercice 2 :
1. On commence par écrire que

M −x x+M
λx = × (−λM ) + × (λM ).
2M 2M
Par convexité de la fonction exponentielle, on en déduit que, pour tout x ∈
[−M, M ] et λ > 0,

M −x x+M
exp(λx) ≤ exp(−λM ) + exp(λM ).
2M 2M
Chapitre 12 – Textes et corrigés d’examens 257

2. Puisque, pour tout i ∈ N, Xi est centrée et |Xi | ≤ M , il en découle que


E(exp(λXi )) ≤ cosh(λM ).
Les séries entières des fonctions cosh(u) et exp(u2 /2) sont
∞ ∞
X u2n 2
X u2n
cosh(u) = et exp(u /2) = ,
n=0
(2n)! n=0
2n × n!

or 2n × n! correspond uniquement au produit des facteurs pairs de (2n)!. Donc


2n × n! ≤ (2n)! et on trouve
E(exp(λXi )) ≤ cosh(λM ) ≤ exp(λ2 M 2 /2).
3. Par croissance stricte de la fonction exponentielle et via l’inégalité de Markov,
on a pour tout x > 0 et tout λ > 0,
 
Sn
P ≥ x = P (exp(λSn ) ≥ exp(λnx)) ≤ exp(−nλx)E[exp(λSn )].
n
L’indépendance des Xi et l’inégalité précédente donnent bien
    2 2 
Sn λ M
P ≥ x ≤ exp n − λx .
n 2
4. Ceci étant vrai pour tout λ > 0, un calcul élémentaire de minimum permet de
conclure que
  2 2
nx2
    
Sn λ M
P ≥ x ≤ inf exp n − λx = exp − .
n λ>0 2 2M 2
De plus,      
Sn Sn −Sn
P ≥x =P
≥x +P ≥x ,
n n n
avec −Sn = (−X1 ) + · · · + (−Xn ), les variables −Xi centrées et | − Xi | ≤ M ,
donc la même inégalité s’applique, d’où
nx2
   
Sn
P ≥ x ≤ 2 exp − .
n 2M 2
Exercice 3 :
1. Puisque
1 p √
h(f, g) = √ k f − gk2 ,
2
il est clair que h est une distance. La formule
Z p
h2 (f, g) = 1 − f (x)g(x) dx
R

découle du fait que f et g intègrent à 1. Une distance étant positive et le dernier


terme étant positif, on en déduit aussi que 0 ≤ h(f, g) ≤ 1.
258 Chapitre 12 – Textes et corrigés d’examens

θ > 0 et fθ la densité de la loi uniforme sur [0, θ]. Le fait que h2 (fθ , fθ0 ) =
2. Soitq
1 − θθ0 si θ ≤ θ0 est une conséquence directe de la formule précédente.
3. Soit X1 , . . . , Xn i.i.d. de loi uniforme sur [0, θ] pour un θ > 0 inconnu. La
vraisemblance associée à cet échantillon s’écrit
1
Ln (θ) = 1θ≥X(n) ,
θn
où X = maxi=1,...,n (Xi ), qui est maximale pour θ = θ̂n = X(n) . La variable
p (n) √
θ̂n étant positive (et inférieure à θ), on peut écrire que

q  Z ∞ q  Z θ q 
Eθ θ̂n = P θ̂n > x dx = P θ̂n > x dx,
0 0

d’où
√ √ n 
θ θ
x2
q  Z  q  Z  
Eθ θ̂n = 1−P θ̂n ≤ x dx = 1− dx,
0 0 θ
ce qui donne finalement

q   
1
Eθ θ̂n = θ 1 − .
2n + 1

Puisque presque sûrement 0 < θ̂n ≤ θ, le calcul d’espérance par conditionne-


ment et les résultats précédents donnent
 s 
h i h h ii θ̂n  1
Eθ h2 (fθ , fθ̂n ) = Eθ Eθ h2 (fθ , fθ̂n ) θ̂n = Eθ 1 − = .

θ 2n + 1

4. Soit la densité
 
1 10
fn∗ (x) = 10 1 − 10≤x≤1/10 + 19/10≤x≤1 .
n n
(a) Pour toute fonction continue bornée ϕ, il est clair que
 Z 1/10
10 1
 Z Z 1/10
1
E[ϕ(Yn )] = 10 1 − ϕ(x)dx+ ϕ(x)dx −−−−→ 10 ϕ(x)dx,
n 0 n 9/10 n→∞ 0

ce qui montre que (Yn ) converge en loi vers une loi uniforme sur [0, 1/10].
(b) Un calcul immédiat donne
Z q r
2 ∗ ∗
1
h (fn , f1/10 ) = 1 − fn (x)f1/10 (x) dx = 1 − 1 − ,
R n
quantité qui tend bien vers 0 lorsque n tend vers l’infini.
Chapitre 12 – Textes et corrigés d’examens 259

5. Soit n > 1.
(a) On rappelle que θ̂n = maxi=1,...,n (Xi ). Comme les Xi sont i.i.d. et que
R1
P∗n (X1 ≥ 9/10) = 9/10 fn∗ (x)dx = 1/n :
 
P∗n (θ̂n ≥ 9/10) = 1−P∗n max (Xi ) ≤ 9/10 = 1−P∗n (X1 ≤ 9/10)n = 1−(1−1/n)n
i=1,...,n

(b) Sur l’événement {9/10 ≤ θ̂n ≤ 1}, on a :


s s
Z 1/10 Z θ̂n
1 1 10 1
h 2
(fn∗ , fθ̂n ) =1− 10 1 − dx − dx
0 n θ̂n 9/10 n θ̂n
s s
1 1 9 10 1
=1− 1− − θ̂n −
n 10θ̂n 10 n θ̂n
r
1 1 1
≥1− 1− − √ .
3 n 3 n

(c) En notant E∗n [·] l’espérance par rapport au modèle où les données
X1 , . . . , Xn sont i.i.d. de densité fn∗ , on trouve :

E∗n [h2 (fn∗ , fθ̂n )] ≥ E∗n [h2 (fn∗ , fθ̂n )1{9/10≤θ̂n ≤1} ]
= E∗n [h2 (fn∗ , fθ̂n )|9/10 ≤ θ̂n ≤ 1]P∗n 9/10 ≤ θ̂n ≤ 1

r
 1 1 1  
≥ 1− 1− − √ 1 − (1 − 1/n)n =: un
3 n 3 n

avec limn→∞ un = 2/3 × (1 − 1/e).


(d) On constate que, alors que fn∗ est très proche de f1/10 quand n est grand
d’après la question 4, la distance entre la densité fn∗ et la densité estimée
fθ̂n ne tend pas vers 0. L’estimateur du maximum de vraisemblance n’est
donc pas robuste à une mauvaise spécification du modèle.
Bibliographie

Ouvrages généraux :

M. Benaı̈m, N. El Karoui : Promenade aléatoire. Chaı̂nes de Markov et simulations ;


martingales et stratégies, Editions de l’Ecole Polytechnique, 2004.

P. Billingsley : Probability and Measure, Wiley, New York (1979).

L. Breiman : Probability, Addison Wesley 1968.

J.F. Delmas, B. Jourdain : Modèles aléatoires : applications aux sciences de l’ingénieur


et du vivant, Springer 2006.

W. Feller : An introduction to Probability Theory and its Applications, 2 Vol. Wi-


ley, 1957.

D. Foata, A. Fuchs : Calcul des probabilités : cours et exercices corrigés, Dunod 2003.

H.O. Georgii, Stochastics. Introduction to probability and statistics. De Gruyter, 2008.

C. Graham : Chaı̂nes de Markov, Mathématiques Appliquées pour le Master/SMAI,


Dunod, 2008.

G. Grimmett, D. Stirzaker : Probability and Random Processes, Oxford University


Press, 1992.

J. Jacod, P. Protter : L’essentiel en théorie des probabilités, Cassini, 2003.

B. Jourdain : Probabilités et statistique, Ellipses, 2009.

Y. Lacroix, L. Mazliak : Probabilités, variables aléatoires, convergences, condition-


nement, ellipses, 2006.

261
262 Bibliographie

E. Pardoux : Processus de Markov et applications. Algorithmes, réseaux, génome et


finance, Mathématiques Appliquées pour le Master/SMAI, Dunod, 2007.

J. Neveu : Bases mathématiques du calcul des probabilités, Masson 1964.

Pour ceux qui veulent tout savoir sur les probabilités du quotidien :

G. Pagès, C. Bouzitat : En passant par hasard... Les probabilités de tous les jours,
Vuibert 1999.

Pour les passionnés d’Histoire des Sciences et de Philosophie :

P.S. Laplace : Essai philosophique sur les probabilités, Christian Bourgeois 1986.

I. Hacking : L’émergence de la Probabilité, Seuil 1975.

Quelques romans probabilistes :

D. Kehlmann : Les arpenteurs du monde, Actes Sud 2006. (Les tribulations de Hum-
boldt et Gauss)

M. Petit : L’équation de Kolmogoroff, Folio 2003.

Pour un choix aléatoire dans une lecture poétique :

R. Queneau : 100 000 milliards de poèmes, Gallimard 1961.

Bibliographie des Mathématiciens : http ://[Link]/∼history/


Index

écart-type, 48 espace fondamental, 15


échantillon, 157 estimateur du maximum de vraisemblance,
événement, 15 168
événements indépendants, 32 expériences aléatoires indépendantes, 34

approximation linéaire, 79 Fatou, lemme, 122


fonction caractéristique, 134
biais, 159 fonction de répartition, 83
fonction génératrice, 50
coefficient de corrélation, 77
fonction indicatrice, 48
convergence d’estimateur, 159
formule de Bayes, 30
convergence de test, 196
formule de Huygens, 48
convergence dominée, 122
formule des probabilités composées, 30
convergence en loi, 144
convergence en moyenne, 120 formule des probabilités totales, 30
convergence en probabilités, 120 fréquence de réalisation, 18
convergence monotone, théorème, 72
inégalité de Bienaymé-Chebyshev, 79
convergence presque-sûre, 120
inégalité de Cauchy-Schwarz, 80
convolution, 111
inégalité de Jensen, 81
corrélation, 77
indépendance, 60
covariance, 77
intervalle de confiance, 175
densité, 91
densité marginale, 103 lemme de Borel-Cantelli, 35
droite des moindres carrés, 79 lemme de Fatou, 122
log-vraisemblance, 169
ensemble dénombrable, 38 loi des grands nombres, 125
ensemble négligeable, 22 loi binomiale, 53
espérance conditionnelle de Y sachant loi conditionnelle pour des v.a. discrètes,
X = xi , 58 57
espérance conditionnelle pour des v.a. loi d’une v.a. discrète, 44
discrètes, 58 loi de Bernoulli, 52
espérance de v.a. discrètes, 45 loi de chi-deux, 143
espérance de v.a. réelles, 74 loi de Poisson, 55
espace de probabilité, 22 loi hypergéométrique, 25
espace de probabilité produit, 34 lois marginales, 57

263
264 INDEX

méthode de Monte-Carlo, 11, 129 variable aléatoire étagée, 71


mesure de Dirac, 24 variable aléatoire centrée réduite, 77
mesure de Lebesgue, 68 variable aléatoire de loi normale, 98
mesure de Lebesgue sur Rn , 68 variable aléatoire de chi-deux, 143
modèle statistique, 156 variable aléatoire exponentielle, 96
moment, 50 variable aléatoire géométrique, 54
variable aléatoire normale centrée réduite,
niveau d’un test, 195 98
normalité asymptotique, 160 variable aléatoire réelle, 70
variable aléatoire réelle de carré intégrable,
partition, 37 76
phénomènes aléatoires, 9 variable aléatoire uniforme, 95
probabilité, 19 variable binomiale, 53
probabilité conditionnelle, 30 variable de Poisson, 55
probabilité produit, 34 variable discrète de carré intégrable, 48
probabilité uniforme, 24 variable discrète intégrable, 47
propriété de non-vieillissement, 97 variable gaussienne, 98
propriété vraie presque-sûrement, 22 variables aléatoires discrètes, 43
variance, 48
quantile, 176 variance d’une variable aléatoire réelle, 76
variance empirique non-biaisée, 165
risque quadratique moyen, 160
vecteur espérance, 78
sondages, 187 vecteur gaussien, 141
suite d’événements indépendants, 33 vecteurs aléatoires indépendants, 85
suite de vecteurs aléatoires indépendantes, vraisemblance, 168
86

table de la loi de Gauss, 99


test du chi-deux, 199
théorème central limite multi-dimensionnel,
152
théorème de convergence dominée, 122
théorème de convergence monotone, 72
théorème de Fubini, 102
théorème de Lévy, 147
théorème de la limite centrale, 150
théorème de Slutsky, 148
transformée de Laplace, 139
tribu, 16
tribu borélienne, 18
tribu engendrée par une partie de Ω, 17
tribu produit, 34

variable aléatoire de Bernoulli, 52

Vous aimerez peut-être aussi