0% ont trouvé ce document utile (0 vote)
9 vues76 pages

Probabilités et statistiques avancées

Ce document présente un cours avancé sur les probabilités et statistiques continues, structuré autour de divers concepts fondamentaux tels que l'espace de probabilité, les variables aléatoires, et les lois classiques. Il aborde également des thèmes comme l'indépendance des événements, les inégalités de concentration, et la convergence des variables aléatoires. L'objectif est de fournir une compréhension approfondie des probabilités en utilisant la théorie de la mesure comme base.

Transféré par

diomandelassina070905
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
9 vues76 pages

Probabilités et statistiques avancées

Ce document présente un cours avancé sur les probabilités et statistiques continues, structuré autour de divers concepts fondamentaux tels que l'espace de probabilité, les variables aléatoires, et les lois classiques. Il aborde également des thèmes comme l'indépendance des événements, les inégalités de concentration, et la convergence des variables aléatoires. L'objectif est de fournir une compréhension approfondie des probabilités en utilisant la théorie de la mesure comme base.

Transféré par

diomandelassina070905
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Probabilités et statistiques continues avancées

Michel Pain

KMAXPP03
Université Paul Sabatier
Licence 3

24 octobre 2024
Table des matières

1 Fondements de la théorie des probabilités 6


1.1 Espace de probabilité . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
1.1.1 Définition . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
1.1.2 Rappels de théorie de la mesure . . . . . . . . . . . . . . . . . . . . . . . . 7
1.2 Variables aléatoires . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 8
1.2.1 Cadre général . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 8
1.2.2 Variable aléatoire réelle . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9
1.3 Espérance . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 10
1.3.1 Définition . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 10
1.3.2 Rappels de théorie de la mesure . . . . . . . . . . . . . . . . . . . . . . . . 11
1.3.3 Théorème de transfert . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 12
1.3.4 Moments . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 14
1.3.5 Espérance et queue de distribution . . . . . . . . . . . . . . . . . . . . . . . 14
1.4 Fonctions caractérisant une loi sur R . . . . . . . . . . . . . . . . . . . . . . . . . . 15
1.4.1 Fonction de répartition . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15
1.4.2 Fonction caractéristique . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18
1.4.3 Transformée de Laplace . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21
1.5 Lois classiques . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21
1.5.1 Lois discrètes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 22
1.5.2 Lois continues . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 23

2 Vecteurs aléatoires et indépendance 25


2.1 Rappels de théorie de la mesure . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 25
2.1.1 Tribus produit . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 25
2.1.2 Mesures produit . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 25
2.1.3 Formule de changement de variable . . . . . . . . . . . . . . . . . . . . . . . 26
2.2 Vecteurs aléatoires, loi jointe et marginale . . . . . . . . . . . . . . . . . . . . . . . 27
2.2.1 Loi jointe, lois marginales . . . . . . . . . . . . . . . . . . . . . . . . . . . . 27
2.2.2 Lois continues sur Rd . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28
2.3 Indépendance . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 30
2.3.1 Indépendance d’événements . . . . . . . . . . . . . . . . . . . . . . . . . . . 30
2.3.2 Indépendance de variables aléatoires . . . . . . . . . . . . . . . . . . . . . . 31
2.3.3 Indépendance de variables aléatoires continues . . . . . . . . . . . . . . . . 33
2.3.4 Indépendance de variables aléatoires discrètes . . . . . . . . . . . . . . . . . 34
2.3.5 Somme de variables aléatoires indépendantes . . . . . . . . . . . . . . . . . 35
2.3.6 Minimum ou maximum de variables aléatoires indépendantes . . . . . . . . 36

3 Inégalités de concentration et intervalles de confiance 38


3.1 Inégalités de concentration . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 38
3.1.1 Inégalité de Markov . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 38
3.1.2 Inégalité de Bienaymé–Tchebychev . . . . . . . . . . . . . . . . . . . . . . . 39

2
3.1.3 Inégalité de Hoeffding . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 40
3.2 Intervalles de confiance . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 42

4 Convergence de variables aléatoires et loi des grands nombres 44


4.1 Suite de variables aléatoires indépendantes . . . . . . . . . . . . . . . . . . . . . . . 44
4.2 Rappels sur les limites inférieure et supérieure . . . . . . . . . . . . . . . . . . . . . 45
4.2.1 Limites inférieure et supérieure de réels . . . . . . . . . . . . . . . . . . . . 45
4.2.2 Limites inférieure et supérieure d’ensembles . . . . . . . . . . . . . . . . . . 45
4.3 Premières notions de convergence . . . . . . . . . . . . . . . . . . . . . . . . . . . . 46
4.3.1 Convergence presque sûre . . . . . . . . . . . . . . . . . . . . . . . . . . . . 46
4.3.2 Convergence Lp . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 47
4.3.3 Convergence en probabilité . . . . . . . . . . . . . . . . . . . . . . . . . . . 49
4.3.4 Liens entre les notions . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 50
4.4 Lemmes de Borel–Cantelli et applications . . . . . . . . . . . . . . . . . . . . . . . 51
4.4.1 Lemmes de Borel–Cantelli . . . . . . . . . . . . . . . . . . . . . . . . . . . . 51
4.4.2 Application à la convergence p.s. . . . . . . . . . . . . . . . . . . . . . . . . 54
4.4.3 Une caractérisation de la convergence en probabilité (bonus) . . . . . . . . 57
4.5 La loi forte des grands nombres . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 58
4.5.1 Démonstration . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 58
4.5.2 Applications . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 62

5 Convergence en loi et théorème central limite 64


5.1 Convergence en loi et convergence étroite . . . . . . . . . . . . . . . . . . . . . . . 64
5.1.1 Définitions . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 64
5.1.2 Lien avec les autres convergences . . . . . . . . . . . . . . . . . . . . . . . . 66
5.1.3 Caractérisations de la convergence en loi . . . . . . . . . . . . . . . . . . . . 67
5.2 Théorème central limite et applications . . . . . . . . . . . . . . . . . . . . . . . . 71
5.2.1 Le théorème central limite . . . . . . . . . . . . . . . . . . . . . . . . . . . . 71
5.2.2 Précision dans la méthode de Monte–Carlo . . . . . . . . . . . . . . . . . . 74
5.2.3 Intervalles de confiance asymptotiques . . . . . . . . . . . . . . . . . . . . . 75

3
Préambule

Ce cours introduit à la théorie des probabilités en se reposant sur la théorie de la mesure.


L’usage de la théorie de la mesure permet d’unifier les probabilités discrètes et continues. Ainsi, le
cours ne se limite pas au cas des variables aléatoires continues, mais présente des résultats généraux,
qui peuvent ensuite s’appliquer dans les cas discrets et continus. Un objectif de cours est d’arriver
à la présentation de deux des plus célèbres résultats en probabilité : la loi des grands nombres et le
théorème central limite. Concernant les statistiques, elles ne seront que discrètement présentes dans
ce cours, qui couvre uniquement la question des intervalles de confiance. Voici quelques références
utilisées pour créer ces notes :
• Probabilité de Philippe Barbe et Michel Ledoux, livre avec exercices.
• De l’intégration aux probabilités d’Olivier Garet et Aline Kurtzmann, livre avec exercices
corrigés (pour certains).
• Intégration, Probabilités et Processus Aléatoires de Jean-François Le Gall, notes de cours
disponible ici.

4
Notations

P(E) ensemble des parties de E (pour E un ensemble)


B(E) tribu borélienne de E (pour E un espace topologique)
|E| cardinal de E (pour E un ensemble)
Jm, nK ensemble des entiers de m à n inclus
δx masse de Dirac en x
λd mesure de Lesbesgue sur Rd

5
Chapitre 1

Fondements de la théorie des


probabilités

1.1 Espace de probabilité


1.1.1 Définition
Définition 1.1.1. Un espace de probabilité (Ω, A, P) est un ensemble Ω muni d’une tribu A sur
laquelle est définie une mesure de probabilité P (c’est-à-dire une mesure telle que P(Ω) = 1).
Il faut voir Ω comme l’ensemble de toutes les éventualités possibles, toutes les déterminations
du hasard dans l’expérience considérée. Les éléments de A sont appelés événements, ce sont les
parties de Ω auxquelles on peut attribuer une probabilité. Contrairement au cas des probabilités
discrètes, on ne peut pas a priori attribuer une probabilité à n’importe quelle partie de Ω.
Exemple 1.1.2. On veut modéliser un lancer de dé à 6 faces équilibré. Une première manière de
faire est de considérer Ω = {1, 2, 3, 4, 5, 6}, A = P(Ω) l’ensemble des parties de Ω et P la mesure
uniforme sur Ω, que l’on peut écrire
1
P = (δ1 + δ2 + δ3 + δ4 + δ5 + δ6 ).
6
Cependant, il y a plein d’autres manières de modéliser cette expérience aléatoire : on peut toujours
“grossir” Ω en rajoutant des réalisations de l’expérience qui n’ont aucune chance d’arriver. On peut
par exemple prendre Ω = {1, 2, 3, 4, 5, 6, 7}, A = P(Ω) et la même mesure P que précédemment :
l’issue 7 est alors présente dans l’espace des possibles, mais l’événement {7} a une probabilité nulle
d’avoir lieu. De la même manière, on peut prendre Ω = R, A n’importe quelle tribu contenant
toutes les parties de {1, 2, 3, 4, 5, 6} (par exemple P(R) ou les boréliens de R ou seulement les
parties de {1, 2, 3, 4, 5, 6}) et P comme précédemment.
Exemple 1.1.3. On tire aléatoirement un nombre dans [0, 1] de manière uniforme. Cette expé-
rience peut être modélisée par ([0, 1], B([0, 1]), λ), où B([0, 1]) est la tribu borélienne sur [0, 1] et
λ est la mesure de Lebesgue sur [0, 1]. Notons que, pour cette probabilité, chaque issue de l’expé-
rience a une probabilité nulle : λ({a}) = 0 pour tout a ∈ [0, 1]. Par contre, la probabilité d’obtenir
un résultat inférieur ou égal à 1/3 est λ([0, 1/3]) = 1/3.
Exemple 1.1.4 (Paradoxe de Bertrand). Joseph Bertrand pose en 1889 la question suivante :
quelle
√ est la probabilité qu’une corde tirée au hasard sur un cercle de rayon 1 soit plus longue que
3, c’est-à-dire que la longueur d’un côté d’un triangle équilatéral inscrit ? Bertrand propose trois
manières de tirer cette corde :
(i) On choisit les deux extrémités de la corde uniformément au hasard sur le cercle ;
(ii) On choisit le centre de la corde uniformément au hasard sur le disque unité ;

6
(iii) On choisit uniformément au hasard la direction du rayon orthogonal à la corde, puis le centre
de la corde uniformément sur ce rayon.
Il montre alors que la probabilité recherchée est 1/3 dans le cas (i), 1/4 dans le cas (ii) et 1/2 dans
le cas (iii). Il présente cela comme un paradoxe, bien qu’il soit conscient qu’il n’y en a pas : cela
met en évidence le fait qu’il y a plusieurs manières de “tirer une corde au hasard sur le cercle”, qui
se précisent en définissant l’espace de probabilité sur lequel on travaille et il est normal que selon
l’espace de probabilité, le résultat diffère. Cet exemple est traité en détail dans le TD2.
Définition 1.1.5. Soit (Ω, A, P) un espace de probabilité et A ∈ A. On dit que l’événement A a
lieu presque sûrement (abrégé en p.s.) si P(A) = 1 (c’est-à-dire s’il a lieu P-presque partout).
Exemple 1.1.6. On tire un nombre aléatoire uniformément dans [0, 1] comme dans l’Exemple 1.1.3.
Alors il est presque sûrement irrationnel : en effet, λ([0, 1] \ Q) = 1. C’est a priori possible dans
notre modèle de tirer un nombre rationnel puisque toutes les issues dans [0, 1] sont incluses, mais
cela a lieu avec probabilité nulle.
Définition 1.1.7. Soit (Ω, A, P) un espace de probabilité et A, B ∈ A. Si P(B) > 0, on définit la
probabilité conditionnelle de A sachant B par
P(A ∩ B)
P(A|B) := .
P(B)

1.1.2 Rappels de théorie de la mesure


La proposition suivante recense diverses propriétés de la mesure P qui seront utilisées à répé-
tition. Les points (i) et (vi) font partie de la définition de mesure de probabilité. Les autres sont
des propriétés vues en cours de théorie de la mesure. En particulier, la continuité décroissante en
(viii) est toujours vraie pour une mesure de probabilité car c’est une mesure finie.
Proposition 1.1.8. Soit (Ω, A, P) un espace de probabilité. Soit A, B ∈ A et (An )n≥0 ∈ AN .
(i) P(∅) = 0 et P(Ω) = 1.
(ii) P(Ac ) = 1 − P(A).
(iii) Si A ⊂ B alors P(A) ≤ P(B).
(iv) P(A ∪ B) = P(A) + P(B) − P(A ∩ B).

S P
(v) P( n≥0 An ) n≥0 P(An ).
F P
(vi) Si les An sont deux à deux disjoints, alors P( n≥0 An ) = n≥0 P(An ).
↑ An ) = limn→∞ ↑ P(An ).
S
(vii) Si (An )n≥0 est une suite croissante, alors P( n≥0
↓ An ) = limn→∞ ↓ P(An ).
T
(viii) Si (An )n≥0 est une suite décroissante, alors P( n≥0
Théorème 1.1.9 (Théorème d’unicité de mesure). Soit (E, E) un espace mesurable. Soit P et
Q deux mesures de probabilité sur E. Supposons qu’il existe C ⊂ E tel que C soit stable par
intersections finies et
∀C ∈ C, P (C) = Q(C).
Alors P et Q coïncident sur la tribu engendrée par C.
Théorème 1.1.10 (Théorème d’unicité de mesure 2). Soit d ≥ 1. Soit P et Q deux mesures de
probabilité sur Rd . Les propriétés suivantes sont équivalents
(i) P = Q ;
(ii) pour toute f : Rd → R+ mesurable,
R R
Rd f (x) dP (x) = Rd f (x) dQ(x) ;
(iii) pour toute f : Rd → R continue bornée,
R R
Rd f (x) dP (x) = Rd f (x) dQ(x) ;
Rd C∞ compact 1 ,
R R
(iv) pour toute f : → R de classe à support Rd f (x) dP (x) = Rd f (x) dQ(x).
1. Une fonction est dite à support compact s’il existe un compact en dehors duquel elle est nulle.

7
1.2 Variables aléatoires
1.2.1 Cadre général
Définition 1.2.1. Soit (Ω, A, P) un espace de probabilité et (E, E) un espace mesurable. Une
variable aléatoire (abrégé en v.a.) à valeurs dans E est une application mesurable X : (Ω, A) →
(E, E), c’est-à-dire vérifiant
∀B ∈ E, X −1 (B) ∈ A.
Exemple 1.2.2. On lance deux dés à 6 faces équilibrés, ce que l’on modélise par Ω = J1, 6K2 ,
A = P(Ω) et P la mesure uniforme sur Ω, qui vérifie P(A) = |A|/36 pour tout A ⊂ Ω. Alors
X((i, j)) = i + j, pour (i, j) ∈ Ω, définit une variable aléatoire à valeurs dans J1, 12K. La v.a. X
représente la somme des deux dés. On peut aussi dire que X est une v.a. à valeurs dans R.
Notation. Si (E, E) et (F, F) sont des espaces mesurables, X est une v.a. à valeurs dans E et
f : E → F une fonction mesurable, alors on écrit f (X) pour la variable aléatoire f ◦ X : Ω → F ,
qui est bien mesurable comme composée de fonctions mesurables.
Définition 1.2.3. Soit (Ω, A, P) un espace de probabilité, (E, E) un espace mesurable et X une
v.a. à valeurs dans E. La loi de X, notée PX , est la mesure image de P par X, c’est-à-dire la
mesure de probabilité définie par
∀B ∈ E, PX (B) = P(X −1 (B)).
De manière générale, une loi sur (E, E) désigne une mesure de probabilité sur (E, E).
Le fait que PX est bien une mesure de probabilité a été vu au TD1. Connaître la loi de
X permet de calculer la probabilité des événements dépendants de la variable aléatoire X. À
chaque détermination du hasard ω ∈ Ω correspond une réalisation X(ω), et PX (B) nous donne la
probabilité que cette réalisation tombe dans B.
Notation. En pratique, l’événément X −1 (B) = {ω ∈ Ω : X(ω) ∈ B} est noté {X ∈ B}. De plus,
quand on en prend la probabilité, on omet les accolades et on écrit P(X ∈ B). Ainsi,
PX (B) = P(X ∈ B).
De la même manière, on écrit par exemple {X = x} = {ω ∈ Ω : X(ω) = x} ou, si X et Y sont
des v.a. réelles (c’est-à-dire à valeurs dans R), {X < Y } = {ω ∈ Ω : X(ω) < Y (ω)}. On écrit
également P(X = x) et P(X < Y ) sans accolades pour les probabilités associées.
Exemple 1.2.4. Dans le cadre de l’Exemple 1.2.2, la loi de X est donnée par
1 2 3 4 5 6 5 4 3 2 1
PX = δ2 + δ3 + δ4 + δ5 + δ6 + δ7 + δ8 + δ9 + δ10 + δ11 + δ12 ,
36 36 36 36 36 36 36 36 36 36 36
que l’on obtient en calculant la probabilité que X = k pour chaque k ∈ J1, 12K : par exemple
4
PX ({5}) = P(X = 5) = P({(1, 4), (2, 3), (3, 2), (4, 1)}) = .
36
Connaître les PX ({k}) pour tout k ∈ E = J1, 12K caractérise PX car l’espace E est fini (vrai aussi
si E est dénombrable).
Il y a alors deux manières de calculer la probabilité d’un événement dépendant de X. Soit on
travaille sur l’espace Ω = J1, 6K2 en utilisant la mesure P :
6 1
P(X ≤ 4) = P({(1, 1), (1, 2), (2, 1), (2, 2), (1, 3), (3, 1)}) = = .
36 6
Soit on travaille sur l’espace E = J1, 12K en utilisant la mesure PX :
1 2 3 1
P(X ≤ 4) = PX ({2, 3, 4}) = + + = .
36 36 36 6

8
Notons que la loi d’une v.a. ne la caractérise pas : il peut y avoir plein de v.a. avec la même
loi, voir l’exemple ci-dessous.
Exemple 1.2.5. Dans le cadre de l’exemple ci-dessus, considérons la v.a. Y = 14 − X. Alors elle
a la même loi que X mais elle n’est pas égale à X (on a X = Y ssi la somme des dés est 7).
Remarque 1.2.6. Dans ce cours, on travaillera principalement avec des variables aléatoires. Alors,
l’espace de probabilité (Ω, A, P) est principalement un prétexte pour pouvoir définir ces variables
aléatoires. Ainsi, très souvent dans la suite, on ne spécifiera pas le choix de (Ω, A, P), ce qui nous
intéresse est uniquement l’espace d’arrivée (E, E) et la loi PX .
Par exemple, un énoncé peut commencer par “Soit X une v.a. de Poisson de paramètre 3” et
cela est suffisant pour calculer la probabilité que X soit pair :
∞ ∞ −3 2n
e 3 1 + e−6
= e−3 cosh(3) =
X X
P(X ∈ 2N) = PX (2N) = PX ({2n}) = ,
n=0 n=0
(2n)! 2

sans que l’on ait à connaître le choix de (Ω, A, P).


Notons que si µ est une mesure de probabilité sur (E, E), il existe toujours un espace de
probabilité (Ω, A, P) et une variable aléatoire à valeurs dans E de loi µ. En effet, il suffit de prendre
(Ω, A, P) = (E, E, µ) et X la fonction identité. On sait donc qu’un espace (Ω, A, P) convenable
existe, mais le spécifier n’apporte généralement rien à la résolution des problèmes, donc on ne le
fait pas (il y a quelques cas exceptionnels mais pas dans ce cours !).
En particulier, les énoncés qui suivront ne contiendront plus la mention “Soit (Ω, A, P) un
espace de probabilité”, même s’il est toujours sous-entendu qu’on en a fixé un.

1.2.2 Variable aléatoire réelle


Définition 1.2.7. Une variable aléatoire réelle est une v.a. à valeurs dans (R, B(R)).
Il y a deux cas particuliers importants de v.a. réelles : les v.a. discrètes et les v.a. continues
que nous allons à présent définir. L’intérêt de l’approche moderne des probabilités à l’aide de la
théorie de la mesure est d’unifier ces deux cas et de les traiter de manière indifférenciée.
Définition 1.2.8. Une loi P sur R est dite discrète si elle s’écrit de la forme
X
P = pi δxi ,
i∈I

avec I un ensemble non vide fini ou dénombrable, (pi )i∈I ∈ (R∗+ )I et xi ∈ RI . Les xi sont appelés
les atomes de P . Une v.a. réelle X est dite discrète si sa loi est discrète.
Notons que si X a une loi discrète écrite sous la forme ci-dessus, alors pi = P(X = xi ). On a
aussi nécessairement X
pi = 1.
i∈I
Rappelons que pour une telle loi P , on a
pi 1B (xi )
X
∀B ∈ B(R), P (B) =
i∈I
Z X
∀f : R → R+ mesurable, f (x) dP (x) = pi f (xi )
R i∈I

De nombreux exemples de v.a. discrètes ont été vus en cours de probabilités discrètes : variables
de Bernoulli, binomiale, géométrique, de Poisson. Voir la Section 1.5 pour un rappel.
De manière générale, on dira qu’une v.a. réelle X (ou que sa loi) a un atome en x ∈ R si
P(X = x) > 0. Une loi discrète est entièrement caractérisée par la connaissance de ses atomes
et de leur mesure. À l’opposé, une loi est dite diffuse si elle n’a pas d’atome. Les lois continues
définies ci-dessous sont un cas particulier de loi diffuse.

9
Définition 1.2.9. Une loi sur R est dite continue si elle est à densité par rapport à la mesure
de Lebesgue sur R. Une v.a. réelle X est dite continue si sa loi est continue et on notera alors
généralement pX : R → R+ sa densité.
Rappelons qu’on dit que P a densité p : R → R+ par rapport à la mesure de Lebesgue sur R si
p est mesurable et Z
∀B ∈ B(R), P (B) = p(x) dx,
B
ce qui est équivalent à
Z Z
∀f : R → R+ mesurable, f (x) dP (x) = f (x)p(x) dx
R R

Le fait que P soit une mesure de probabilité implique que l’intégrale de p sur R est égale à 1. On
note dP (x) = p(x) dx et on peut dire “X a loi p(x) dx” si X a pour loi P (c’est un léger abus de
notation où on amalgame P et dP (x)).
Exemple 1.2.10. Soit X une v.a. réelle de loi x
1
2 [0,2] (x) dx. Alors on peut par exemple calculer
la probabilité suivante
" #1
x2
Z 1 Z 1
x x 1
P(X ≤ 1) = PX (] − ∞, 1]) = 1[0,2] (x) dx = dx = = .
−∞ 2 0 2 4 0
4

En outre, comme la densité de X est nulle en dehors de [0, 2], on peut dire que X ∈ [0, 2] p.s.
Remarque 1.2.11. Il y a des v.a. réelles qui ne sont ni discrètes, ni continues. Il suffit de considérer
un mélange de loi discrète et de loi continue, comme par exemple
1 1
δ0 + λ,
2 2
où λ est la mesure de Lebesgue sur [0, 1]. Cette loi correspond à l’expérience suivante : avec
probabilité 1/2 on tire 0 et avec probabilité 1/2 on tire un nombre dans [0, 1] uniformément. Il
existe également des lois sur R qui sont diffuses mais pas continues : on peut par exemple considérer
la mesure uniforme sur l’ensemble triadique de Cantor (qu’on ne construira pas proprement ici)
qui n’a aucun atome mais n’a pas de densité par rapport à la mesure de Lebesgue (car elle est
supportée par l’ensemble de Cantor qui a mesure de Lebesgue nulle).

1.3 Espérance
1.3.1 Définition
Définition 1.3.1. Soit X une v.a. réelle. L’espérance de X est définie par
Z
E[X] = X(ω) dP(ω),

dès que cette intégrale a un sens, c’est-à-dire dans l’un des cas suivants :
• si X ≥ 0 (alors E[X] peut potentiellement être infinie) ;
• si X est intégrable pour P, c’est-à-dire E[|X|] < ∞.
Exemple 1.3.2. Soit n ∈ N∗ . On considère Ω = J1, nK avec A = P(Ω) et P la mesure uniforme
sur Ω. Soit X une v.a. réelle. Alors
n
X(1) + X(2) + · · · + X(n)
Z X
E[X] = X(ω) dP(ω) = X(i)P({i}) = .
Ω i=1
n

Dans ce cas, l’espérance est donc la moyenne des valeurs de X au sens classique du terme.

10
Remarque 1.3.3. Soit A ∈ A un événement. Rappelons que la fonction indicatrice 1A est définie
par (
1 si ω ∈ A,
∀ω ∈ Ω, 1A (ω) =
0 sinon.
Comme 1A est mesurable (car A l’est), c’est une v.a. Son espérance est E[1A ] = P(A).

1.3.2 Rappels de théorie de la mesure


Par définition, l’espérance est l’intégrale par rapport à P. Les résultats sur les intégrales par
rapport à une mesure quelconque s’appliquent donc directement. Rappelons-en quelques-uns.

Proposition 1.3.4 (Linéarité de l’espérance). Soit X, Y des v.a. réelles et a, b ∈ R.


• Si X et Y sont intégrables pour P, alors aX + bY est intégrable pour P.
• Si X, Y, a, b ≥ 0, alors aX + bY ≥ 0.
Dans chacun des cas précédents, on a E[aX + bY ] = aE[X] + bE[Y ].

Pour montrer la convergence de l’espérance d’une suite de v.a., on dispose des trois mêmes
N
outils que pour les intégrales. Rappelons la définition suivante, pour (an )n≥0 ∈ R ,

lim sup an = lim ↓ sup ak et lim inf an = lim ↑ inf ak .


n→∞ n→∞ k≥n n→∞ n→∞ k≥n

Théorème 1.3.5. Soit (Xn )n∈N une suite de v.a. réelles.


• (Convergence monotone). Si Xn ≥ 0 pour tout n ≥ 0 et Xn ↑ X, alors E[Xn ] ↑ E[X].
• (Lemme de Fatou). Si Xn ≥ 0 pour tout n ≥ 0, alors E[lim inf Xn ] ≤ lim inf E[Xn ].
• (Convergence dominée). Si Xn converge p.s. vers une v.a. réelle X et qu’il existe une v.a.
réelle Z telle que E[|Z|] < ∞ et |Xn | ≤ Z p.s. pour tout n ≥ 0, alors E[Xn ] → E[X].

Rappelons les théorèmes de continuité et de dérivabilité des intégrales à paramètre.

Théorème 1.3.6 (Continuité d’espérances à paramètre). Soit X une v.a. à valeurs dans (E, E).
Soit I un intervalle de R et f : I × E → R. Supposons
• pour tout t ∈ I, l’application x ∈ E 7→ f (t, x) est mesurable ;
• presque sûrement, l’application t ∈ I 7→ f (t, X) est continue sur I ;
• il existe une v.a. réelle Z telle que E[|Z|] < ∞ et, pour tout t ∈ I, |f (t, X)| ≤ Z p.s.
Alors la fonction t ∈ I 7→ E[f (t, X)] est continue sur I.

Théorème 1.3.7 (Dérivabilité d’espérances à paramètre). Soit X une v.a. à valeurs dans (E, E).
Soit I un intervalle de R et f : I × E → R. Supposons
• pour tout t ∈ I, l’application x ∈ E 7→ f (t, x) est mesurable ;
• presque sûrement, l’application t ∈ I 7→ f (t, X) est dérivable sur I ;
• il existe une v.a. réelle Z telle que E[|Z|] < ∞ et, pour tout t ∈ I, | ∂f
∂t (t, X)| ≤ Z p.s.
Alors la fonction t ∈ I 7→ E[f (t, X)] est dérivable sur I, de dérivée t 7→ E[ ∂f
∂t (t, X)].

On peut également considérer les espaces Lp (Ω, A, P) pour p ∈ [1, ∞]. Pour X une v.a. réelle,
rappelons que kXkp = E[|X|p ]1/p quand p < ∞ et kXk∞ = inf{C > 0 : |X| ≤ C p.s.}. L’espace
Lp (Ω, A, P) est défini comme l’ensemble des v.a. réelles X telles que kXkp < ∞, que l’on quotiente
par la relation d’équivalence “être égal p.s.” (i.e. deux variables aléatoires qui sont égales p.s. sont
considérées comme identiques). Alors (Lp (Ω, A, P), k·kp ) est un espace de Banach.

11
Proposition 1.3.8 (Inégalité de Hölder). Soit X et Y des v.a. réelles. Soit p, q ∈ [1, ∞] tels que
1 1
p + q = 1. Alors
kXY k1 ≤ kXkp kY kq .

En particulier, si X ∈ Lp (Ω, A, P) et Y ∈ Lp (Ω, A, P), alors XY ∈ L1 (Ω, A, P). Dans le cas où


p, q ∈]1, ∞[, on peut réécrire l’inégalité de Hölder comme

E[|XY |] ≤ E[|X|p ]1/p · E[|Y |q ]1/q .

Le cas p = q = 2 donne l’inégalité de Cauchy-Schwarz :


h i1/2 h i1/2
E[|XY |] ≤ E X 2 ·E Y2 .

1.3.3 Théorème de transfert


Le théorème de transfert (ou de transport) est une formule exprimant une espérance d’une
fonction d’une v.a. X comme une intégrale contre la loi de X. C’est une conséquence simple de la
définition de la loi de X comme mesure image, mais c’est un résultat très important : c’est l’outil
principal pour calculer des espérances.
Théorème 1.3.9 (Théorème de transfert). Soit X une v.a. à valeurs dans un espace mesurable
(E, E). Soit f : E → R une fonction mesurable (rappelons que R = R ∪ {−∞, +∞}). On a l’équi-
valence
f ∈ L1 (E, E, PX ) ⇔ f (X) ∈ L1 (Ω, A, P).
En outre, si f ∈ L1 (E, E, PX ) ou si f est positive, alors
Z
E[f (X)] = f (x) dPX (x). (1.1)
E

Démonstration. C’est une propriété générale de la mesure image. La démonstration consiste à


traiter des fonctions de plus en plus générales, de manière similaire à la construction de l’intégrale
en théorie de la mesure.
Étape 1. On commence par remarquer que la formule (1.1) est vraie par définition de PX quand
f = 1B avec B ∈ B(R) :

E[f (X)] = E[1X −1 (B) ] (car f = 1B )


= P(X −1 (B)) (cf Remarque 1.3.3)
= PX (B) (par définition de PX )
Z
= f (x) dPX (x) (car f = 1B ).
E

Étape 2. Il en suit par linéarité que la formule (1.1) est vraie pour toute fonction étagée positive,
i.e. pour f = ni=1 ci 1Bi , pour n ∈ N, c1 , . . . , cn ≥ 0 et B1 , . . . , Bn ∈ B(R).
P

Étape 3. Considérons à présent f : E → R mesurable et positive. Il a été vu en cours de théorie


de la mesure qu’une telle fonction f est limite croissante d’une suite de fonctions étagées positives
(fn )n≥0 . Ainsi, on a

E[f (X)] = lim E[fn (X)] (convergence monotone)


n→∞
Z
= lim fn (x) dPX (x) (par l’étape 2)
n→∞ E
Z
= f (x) dPX (x) (convergence monotone).
E

Cela montre la formule (1.1) pour les fonctions f positives.

12
Étape 4. Soit f : E → R mesurable. Alors, par l’étape 3, la formule (1.1) est vraie pour |f | donc
les deux côtés de l’égalité sont soit finis tous les deux soit infinis tous les deux. Cela montre
que f ∈ L1 (E, E, PX ) si et seulement si f (X) ∈ L1 (Ω, A, P). En outre, si f ∈ L1 (E, E, PX ), on
décompose f = f+ − f− avec f+ = max(f, 0) et f− = max(−f, 0). Comme f+ est positive, on a,
par l’étape 3, Z
E[f+ (X)] = f+ (x) dPX (x)
E
et les deux côtés de cette égalité sont finis car f+ ≤ |f |. La même chose étant vraie pour f− , on
en conclut par linéarité que la formule (1.1) est vraie pour f .

Exemple 1.3.10. Considérons une v.a. X de loi uniforme sur [0, π], on veut calculer E[sin(X)].
Notons tout d’abord que X a pour densité pX (x) = π1 1[0,π] (x). Pour appliquer le théorème de
transfert, on vérifie que sin ∈ L1 (R, B(R), PX ) : en effet,
Z Z
|sin| dPX ≤ 1 dPX = PX (R) = 1 < ∞.
R R

On peut donc appliquer le théorème de transfert et on obtient


Z π
1 1
Z Z
E[sin(X)] = sin(x) dPX (x) = sin(x)pX (x) dx = sin(x) dx = .
R R π 0 π
Méthode (Déterminer une loi). Une méthode pour déterminer la loi d’une v.a. R
réelle X consiste
à exprimer E[f (X)], pour f : R → R+ mesurable quelconque, sous la forme R f (x) dµ(x). Alors
on peut en conclure que PX = µ : en effet, par la formule de transfert, cela implique
Z Z
f (x) dPX (x) = f (x) dµ(x),
R R

pour tout f : R → R+ mesurable, et donc PX = µ (en prenant f = 1B pour B ∈ B(R)).


Cette méthode est particulièrement utile dans le cas où X est de la forme ψ(Y ) où ψ est une
fonction explicite et Y est une v.a. réelle continue dont on connaît la densité pY . Alors, on peut
écrire Z
E[f (X)] = E[f (ψ(Y ))] = f (ψ(y))pY (y) dy,
R
d’après le théorème de transfert. Il faut
R
ensuite faire le changement de variable x = ψ(y) pour se
ramener à une intégrale de la forme R f (x)p(x) dx, ce qui permet de conclure que X a densité p.
Ce changement de variable peut nécessiter de découper le domaine de ψ en parties sur lesquelles
ψ est injective et dérivable, ce qui n’est pas toujours possible. En particulier, une telle v.a. X n’est
pas forcément continue : par exemple, si ψ ne prend qu’un nombre fini de valeurs, alors X est
discrète. Dans ce cas, la méthode présentée dans le 1er paragraphe peut quand même fonctionner,
mais il faut s’attendre à trouver une mesure µ qui contient des masses de Dirac.

Exemple 1.3.11. Soit Y une v.a. réelle de loi e−y 1[0,∞[ (y) dy. On veut déterminer la loi de
X = Y 2 . Pour cela on écrit, pour f : R → R+ mesurable quelconque,
Z ∞
E[f (X)] = E[f (Y )] = 2
f (y 2 )e−y dy.
0

On effectue alors le changement de variable x = y 2 qui est bijectif de R∗+ dans R∗+ , ce qui donne
Z ∞ √ 1
E[f (X)] = f (x)e− x
√ dx.
0 2 x

Cela montre que X est continue, de densité x 7→ e−√ x
2 x
1[0,∞[ (x).

13
1.3.4 Moments
Définition 1.3.12. Soit X une v.a. réelle et n ∈ N. Le moment d’ordre n de X (ou n-ième
moment) est E[X n ], dès que cette quantité est bien définie (i.e. si E[|X|n ] < ∞ ou X ≥ 0).

Une conséquence importante de l’inégalité de Hölder est la propriété d’inclusion suivante pour
les espaces Lp . Attention, elle est particulière aux mesures finies et n’est pas vraie pour des espaces
Lp associés à des mesures infinies. En particulier, ce résultat implique que si une v.a. réelle a un
moment d’ordre n fini, alors tous ses moments d’ordres plus petits sont finis aussi.

Proposition 1.3.13. Soit 1 ≤ p < q ≤ ∞. Alors Lq (Ω, A, P) ⊂ Lp (Ω, A, P).

Démonstration. Soit X une v.a. réelle. En appliquant l’inégalité de Hölder aux v.a. |X|p et 1 avec
p0 = q/p > 1 et q 0 tel que p10 + q10 = 1, on obtient
h 0
i1/p0 h 0
i1/q0
E[|X|p ] = E[|X|p · 1] ≤ E (|X|p )p E (1)q = E[|X|q ]p/q .

Ainsi, si X ∈ Lq (Ω, A, P), alors E[|X|q ] < ∞ et donc E[|X|p ] < ∞ par l’inégalité ci-dessus, ce qui
montre que X ∈ Lp (Ω, A, P).

Définition 1.3.14. Soit X ∈ L2 (Ω, A, P). La variance de X est


h i
Var(X) = E (X − E[X])2 .
p
et l’écart type de X est σX = Var(X).

Proposition 1.3.15. Soit X ∈ L2 (Ω, A, P). Alors


h i
Var(X) = E X 2 − E[X]2 .

Démonstration. Notons m = E[X]. On a alors en développant le carré et en utilisant la linéarité


de l’espérance :
h i h i h i
Var(X) = E (X − m)2 = E X 2 − 2mE[X] + m2 = E X 2 − E[X]2 ,

en remplaçant m par E[X] dans la dernière égalité.

1.3.5 Espérance et queue de distribution


La queue de distribution d’une v.a. réelle X fait référence au comportement asymptotique de
P(X > x) et de P(X < −x) quand x → ∞. Pour une v.a. positive, la formule suivante relie queue
de distribution et espérance et peut se révéler très utile.

Proposition 1.3.16. Soit X une v.a. positive. Alors


Z ∞ Z ∞
E[X] = P(X > x) dx = P(X ≥ x) dx.
0 0

Démonstration. Notons que l’espérance est bien définie car X ≥ 0. Par le théorème de transfert
(et le fait que PX est supportée sur [0, ∞) car X ≥ 0), on a
Z ∞ Z ∞ Z ∞  Z ∞ Z ∞ 
E[X] = x dPX (x) = 1t<x dt dPX (x) = 1t<x dPX (x) dt,
0 0 0 0 0

par le théorème de Fubini–Tonelli. Notons alors que 0 1t<x dPX (x) = PX (]t, ∞[) = P(X > t), ce
R∞

qui montre la première égalité de l’énoncé. La deuxième égalité se montre de manière similaire, en
remarquant que l’on peut remplacer ‘t < x’ par ‘t ≤ x’ au début du calcul.

14
Corollaire 1.3.17. Soit X une v.a. positive et p > 0. Alors
Z ∞ Z ∞
E[X p ] = P(X > x)pxp−1 dx = P(X ≥ x)pxp−1 dx.
0 0

Démonstration. Voir TD 3.

Ces formules permettent d’avoir des critères simples en terme de la vitesse de décroissance de
la queue de distribution pour savoir si le moment d’ordre n de X est fini.

1.4 Fonctions caractérisant une loi sur R


1.4.1 Fonction de répartition
Définition 1.4.1. Soit P une loi sur R. La fonction de répartition de P est la fonction F : R →
[0, 1] définie par
∀x ∈ R, F (x) = P (] − ∞, x]).
Soit X une v.a. réelle. La fonction de répartition de X est la fonction de répartition de sa loi. On
la notera souvent FX : R → [0, 1] et elle vérifie

∀x ∈ R, FX (x) = P(X ≤ x).

Exemple 1.4.2. Soit X une variable réelle continue. Sa fonction de répartition est donnée, pour
x ∈ R, par Z x
FX (x) = pX (y) dy.
−∞

En particulier, si pX est continue sur R alors FX est de classe C 1 sur R et FX0 = pX .


1
Exemple 1.4.3. On considère la mesure discrète P = 2 δ−1 + 16 δ1 + 13 δ2 . Alors sa fonction de
répartition est donnée, pour x ∈ R, par



 0 if x < −1,

1/2 if x ∈ [−1, 1[,

1 1 1
F (x) = 1[−1,∞[ (x) + 1[1,∞[ (x) + 1[2,∞[ (x) = 
2 6 3 2/3
 if x ∈ [1, 2[,

1 if x ≥ 2,

et est représentée sur la figure suivante. On peut noter que la fonction de répartition est constante
par morceaux et effectue un saut à chaque atome de P de la taille du poids de cet atome.
y
1 y = F (x)

-2 -1 1 2 3 x

Proposition 1.4.4. Soit X une v.a. réelle. Sa fonction de répartition FX est croissante, continue
à droite et satisfait
lim FX (x) = 0 et lim FX (x) = 1.
x→−∞ x→∞

Démonstration. Voir TD1.

15
Théorème 1.4.5. Une loi sur R est caractérisée par sa fonction de répartition. Autrement dit, si
deux v.a. ont la même fonction de répartition, alors elles ont la même loi.

Démonstration. Soit X et Y des v.a. telles que FX = FY . Alors, pour tout a ∈ R,

PX (] − ∞, a]) = P(X ≤ a) = FX (a) = FY (a) = P(Y ≤ a) = PY (] − ∞, a]).

Donc les mesures de probabilité PX et PY coïncident sur C = {] − ∞, a] : a ∈ R}. Comme C est


stable par intersections finies, par le Théorème 1.1.9, PX et PY coïncident sur la tribu engendrée
par C, qui est B(R).

Le théorème précédent est un résultat d’unicité : une fonction de répartition est associée à au
plus une loi. Notons qu’une fonction de répartition ne caractérise pas la v.a. : des v.a. qui ont la
même loi ont la même fonction de répartition. Le théorème suivant est un résultat d’existence :
pour toute fonction ressemblant à une fonction de répartition (i.e. satisfaisant les propriétés de la
Proposition 1.4.4), il existe une loi dont c’est la fonction de répartition, et donc en particulier il
existe une v.a. dont c’est la fonction de répartition.

Théorème 1.4.6. Soit F : R → [0, 1]. Supposons que F soit croissante, continue à droite et
satisfasse
lim F (x) = 0 et lim F (x) = 1.
x→−∞ x→∞

Alors il existe une loi P sur R telle que F soit la fonction de répartition de P .

Démonstration. Admise. La construction de P suit une méthode proche de celle utilisée pour
construire la mesure de Lebesgue en cours de théorie de la mesure : on introduit une mesure exté-
rieure appropriée, on montre que tous les boréliens sont mesurables pour cette mesure extérieure
et on vérifie que sa restriction aux boréliens a pour fonction de répartition F . Voir les notes de Le
Gall, Section 3.5 pour les détails.

Au delà de ce résultat théorique, il y a de nombreux cas pratiques où l’on peut déterminer la


loi à partir de la fonction de répartition F . Deux cas particuliers sont importants, déjà évoqués
aux Exemples 1.4.2 et 1.4.3 : si F est constante par morceaux, alors la loi est discrète avec des
atomes aux points de discontinuité dont la masse est donnée par la taille du saut de F en ce point ;
si F est de classe C 1 sur R, alors la loi est continue de densité F 0 . Le résultat suivant couvre un
mélange de ces deux cas. Cela exclut certaines lois, comme des lois discrètes avec accumulation
d’atomes en certains points, des lois continues avec une densité trop irrégulière ou des lois diffuses
qui ne sont pas continues (cf. Remarque 1.2.11).

Proposition 1.4.7. Soit P une loi sur R et F sa fonction de répartition. Supposons que F est de
classe C 1 sur R \ {ai , i ∈ I} avec (ai )i∈I une suite strictement croissante dans l’un des cas suivants
• I = J1, nK avec n ∈ N ;
• I = N et an → ∞ quand n → ∞ ;
• I = Z− et an → −∞ quand n → −∞ ;
• I = Z et an → ±∞ quand n → ±∞.
On définit f par f = F 0 sur R \ {ai , i ∈ I} et f = 0 en dehors. Alors
X
dP (x) = f (x) dx + (F (ai ) − F (ai −)) dδai (x),
i∈I

où F (a−) désigne la limite à gauche de F en a.

16
Démonstration. Notons Q la mesure définie par la formule ci-dessus, de sorte que l’on cherche à
montrer P = Q. Considérons des réels a < b, on va montrer que F (b) − F (a) = Q(]a, b]).
Cas 1. Supposons ]a, b] ∩ {ai , i ∈ I} = ∅. Alors F est continue sur [a, b] (on utilise ici que F est
continue à droite en a) et dérivable sur ]a, b[, donc, par le théorème fondamental de l’analyse,
Z b
F (b) − F (a) = f (x) dx = Q(]a, b]),
a

car aucun des atomes de Q n’est dans ]a, b].


Cas 2. Supposons ]a, b] ∩ {ai , i ∈ I} = {b}. Alors, cette fois, on a F (b−) − F (a) = ab f (x) dx 2 et
R

donc Z b
F (b) − F (a) = F (b−) − F (b) + f (x) dx = Q({b}) + Q(]a, b[) = Q(]a, b]),
a
car l’unique atome de Q sur ]a, b] est en b et sa masse est F (b−) − F (b).
Cas 3. Supposons que ]a, b] ∩ {ai , i ∈ I} 6= ∅. Notons que, par nos hypothèses sur la suite (ai )i∈I ,
]a, b] ne peut contenir qu’un nombre fini de ses éléments, que l’on note ak < · · · < a` avec k ≤ `.
On écrit alors, grâce à une somme télescopique
`−1
X
F (b) − F (a) = F (b) − F (a` ) + (F (ai+1 ) − F (ai )) + F (ak ) − F (a)
i=k
`−1
X
= Q(]a` , b]) + Q(]ai , ai+1 ]) + Q(]a, ak ]),
i=k

en utilisant le Cas 1 sur l’intervalle ]a` , b] et le Cas 2 sur les autres intervalles. En prenant l’union
de ces intervalles disjoints, on en déduit que F (b) − F (a) = Q(]a, b]).
Conclusion. Fixons b et prenons a → −∞. Alors F (a) → 0 par la Proposition 1.4.4 et Q(]a, b]) →
Q(] − ∞, b]) par continuité croissante de la mesure. On a donc montré que F (b) = Q(] − ∞, b]),
donc F est la fonction de répartition de Q. Comme la fonction de répartition caractérise la loi, on
a donc P = Q.

Exemple 1.4.8. Pour x ∈ R, on définit


1
 
F (x) = 1x≥0 1− .
x+2

Cette fonction est croissante, continue à droite, limx→−∞ F (x) = 0 et limx→∞ F (x) = 1. c’est donc
la fonction de répartition d’une loi P sur R par le Théorème 1.4.6. Comme F est C 1 sur R \ {0},
par la Proposition 1.4.4, on a
1x>0 1
dP (x) = dx + δ0 .
(x + 2)2 2
Remarque 1.4.9. Dans la Proposition 1.4.4, les points ai ne sont pas forcément des points de
discontinuité de F , seulement des points où F n’est pas C 1 . Si F est continue en ai , alors F (ai ) −
F (ai −) = 0 donc il n’y a pas d’atome en ai . En particulier, si F vérifie les hypothèses de la
Proposition 1.4.4 et est continue sur R, alors la loi P associée est continue de densité f = F 0 qui
est définie Lebesgue-presque partout (voir par exemple la loi exponentielle en Section 1.5).

Méthode (Déterminer une loi). Une autre méthode pour déterminer la loi d’une v.a. réelle X
consiste à calculer sa fonction de répartition et utiliser la Proposition 1.4.7. Cette méthode est
particulièrement appropriée si X est définie comme un minimum ou un maximum d’autres v.a.
2. Pour s’en convaincre on peut considérer la fonction Fe définie par Fe = F sur [a, b[ et Fe(b) = F (b−). Alors Fe
est continue sur [a, b] et dérivable sur ]a, b[, donc on peut lui appliquer le théorème fondamental de l’analyse et cela
donne la formule voulue.

17
Fonction quantile (bonus). La fin de cette section concernant la fonction quantile n’a pas été
traitée en cours.
Définition 1.4.10. Soit P une loi sur R et F sa fonction de répartition. La fonction quantile de
P est la fonction q : [0, 1] → R définie par

∀α ∈ [0, 1], q(α) = inf{x ∈ R : α ≤ F (x)},

où l’on prolonge par continuité F (−∞) = 0 et F (∞) = 1. On appelle q(α) le α-quantile de P et


q(1/2) la médiane.
Notons que si, pour un intervalle I ⊂ R, la fonction F : I → [0, 1] est bijective, alors on peut
écrire plus simplement q = F −1 , où F −1 est l’inverse de la fonction F restreinte à I. De manière
générale, on a toujours F (q(α)) ≥ α (par continuité à droite de F ) mais pas forcément d’égalité.
La fonction q permet de générer une v.a. avec la loi P à partir d’une v.a. de loi uniforme
sur [0, 1] (c’est-à-dire dont la loi est la mesure de Lebesgue sur [0, 1]), comme montré dans le
résultat suivant.
Proposition 1.4.11. Soit P une loi sur R et Q sa fonction quantile. Soit U une v.a. uniforme
sur [0, 1]. Alors q(U ) suit la loi P .
Démonstration. On va montrer le résultat en calculant la fonction de répartition de la v.a. X =
q(U ). Pour x ∈ R, on a FX (x) = P(q(U ) ≤ x). De plus, pour α ∈ [0, 1], on a α ≤ F (x) ssi q(α) ≤ x :
• Si α ≤ F (x), alors q(α) ≤ x par définition de q.
• Si q(α) ≤ x, alors F (q(α)) ≤ F (x) car F est croissante. Mais, par continuité à droite de F ,
on a F (q(α)) ≥ α. On a donc α ≤ F (x)
On en déduit que

FX (x) = P(q(U ) ≤ x) = P(U ≤ F (x)) = PU ([0, F (x)]) = F (x),

car PU est la mesure de Lebesgue sur [0, 1]. Comme la fonction de répartition caractérise la loi, on
en déduit que PX = P .

1.4.2 Fonction caractéristique


Définition 1.4.12. Soit P une loi sur R. La fonction caractéristique de P est la fonction φ : R → C
définie par Z
∀θ ∈ R, φ(θ) = eiθx dP (x).
R
Soit X une v.a. réelle. La fonction caractéristique de X est la fonction caractéristique de sa loi.
On la notera souvent φX et elle vérifie
h i
∀θ ∈ R, φX (θ) = E eiθX .

Comme |eiθx | ≤ 1 (et que 1 est intégrable pour une mesure de probabilité !), la fonction carac-
téristique est bien définie pour tout θ ∈ R et |φ(θ)| ≤ 1. La reformulation en terme d’espérance est
une conséquence du théorème de transfert.
En analyse, la transformée de Fourier d’une mesure finie µ sur R est la fonction
Z
θ ∈ R 7−→ e−iθx dµ(x).
R

Ainsi, au signe de θ près, elle correspond à la fonction caractéristique de µ quand µ est une mesure
de probabilité.
Le résultat suivant montre qu’une fonction caractéristique est toujours continue et que, plus la
v.a. a de moments finis, plus la fonction caractéristique est régulière.

18
Proposition 1.4.13 (Régularité). Soit n ∈ N. Soit X une v.a. réelle de moment d’ordre n fini.
Alors φX est de classe C n sur R et
h i
(k)
∀k ∈ J0, nK, ∀θ ∈ R, φX (θ) = ik E X k eiθX .

Démonstration. Voir TD3.

En particulier, il est intéressant de noter que les moments de X s’expriment alors en termes
des dérivées en 0 de sa fonction caractéristique :
(k)
∀k ∈ J0, nK, E[X k ] = (−i)k φX (0).

La réciproque suivante est vraie : si, pour m ∈ N, φX est 2m fois dérivable en 0, alors le moment
d’ordre 2m de X est fini.
Finalement, le résultat le plus important de cette section est le suivant, qui justifie le nom de
“fonction caractéristique”.

Théorème 1.4.14. Une loi sur R est caractérisée par sa fonction caractéristique.

Démonstration (non vue en cours, donc non requise). Soit P une loi sur R et φ sa fonction carac-
téristique. On pose, pour x ∈ R et σ > 0,
!
1 x2
gσ (x) = √ exp − 2 ,
σ 2π 2σ

de sorte que gσ est la densité de la loi gaussienne N (0, σ 2 ), voir Section 1.5. On définit également,
pour tout x ∈ R, Z
(gσ ∗ P )(x) = gσ (x − y) dP (y),
R
qui est bien définie par gσ est bornée, donc P -intégrable. Les étapes sont les suivantes :
1. Écrire gσ comme une fonction caractéristique d’une autre gaussienne.
2. Utiliser l’étape 1, pour écrire gσ ∗ P uniquement en terme de φ, ce qui montre en particulier
que gσ ∗ P est caractérisée par φ.
R R
3. Montrer que, pour toute f : R → R continue bornée, R f (x)(gσ ∗ P )(x) dx → R f (x) dP (x)
quand σ → 0.
On conclut alors ainsi. Soit Q une loi sur R de fonction caractéristique
R
φ. Alors
R
l’étape 2 montre
que gσ ∗ P = gσ ∗ Q. Donc, par l’étape 3, on en déduit que R f (x) dP (x) = R f (x) dQ(x) pour
tout f continue bornée. Cela implique que P = Q d’après le Théorème 1.1.10.
Étape 1. Par le calcul de la fonction caractéristique de la gaussienne (énoncé en Section 1.5 et fait
au TD 3), on a, pour tout σ > 0 et θ ∈ R,
! √
σ2 θ2 2π
Z
iθx
e gσ (x) dx = exp − = g (θ).
R 2 σ 1/σ

En remplaçant σ par 1/σ, on obtient


1
Z
gσ (θ) = √ eiθx g1/σ (x) dx,
σ 2π R

ce qui écrit gσ (à un préfacteur près) comme une fonction caractéristique.

19
Étape 2. Pour tout x ∈ R, on a
Z
(gσ ∗ P )(x) = gσ (x − y) dP (y) (définition)
ZR
1
Z 
= √ ei(x−y)t g1/σ (t) dt dP (y) (par l’étape 1)
R σ 2π R
1
Z Z 
ixt −iyt
= √ e g1/σ (t) e dP (y) dt (par Fubini)
σ 2π R R
1
Z
= √ eixt g1/σ (t)φ(−t) dt, (par définition de φ)
σ 2π R

où le théorème de Fubini est justifié en bornant |ei(x−y)t g1/σ (t)| ≤ g1/σ (t) qui est intégrable par
rapport à dt et donc par rapport à dt ⊗ P (dy) (car P est une mesure de probabilité). On a donc
exprimé gσ ∗ P en terme de φ uniquement.
Étape 3. Soit f : R → R continue bornée. Alors, on a
Z Z Z  Z Z 
f (x)(gσ ∗ P )(x) dx = f (x) gσ (x − y) dP (y) dx = f (x)gσ (x − y) dx dP (y),
R R R R R

en utilisant le théorème de Fubini justifié en bornant |f (x)gσ (x − y)| ≤ kf k∞ gσ (x − y) qui est


intégrable par rapport à dx, d’intégrale indépendante de y (par changement de variable x − y → x)
et qui est donc elle-même intégrable par rapport à dP (y). En utilisant que gσ est paire puis la
définition de la convolution de deux fonctions, on obtient
Z Z Z  Z
f (x)(gσ ∗ P )(x) dx = f (x)gσ (y − x) dx dP (y) = (f ∗ gσ )(y) dP (y).
R R R R

Mais la famille (gσ )σ>0 , quand σ → 0, est une approximation de Dirac au sens où elle vérifie
Z Z
∀σ > 0, gσ (x) dx = 1 et ∀ε > 0, gσ (x) dx −−−→ 0.
R R\[−ε,ε] σ→0

Une conséquence vue en cours de théorie de la mesure est que, pour f continue bornée, f ∗ gσ
converge simplement vers f quand σ → 0. Ainsi, par le théorème de convergence dominée (en
bornant |(f ∗ gσ )(y)| ≤ kf k∞ qui est P -intégrable), on obtient
Z Z Z
f (x)(gσ ∗ P )(x) dx = (f ∗ gσ )(y) dP (y) −−−→ f (y) dP (y),
R R σ→0 R

qui est ce que l’on voulait démontrer à cette étape.

En général, il est difficile de retrouver une loi P à partir de sa fonction caractéristique. Mais
dans le cas où la fonction caractéristique est intégrable sur R on peut utiliser cette version du
théorème d’inversion de Fourier.

Théorème 1.4.15. Soit X une v.a. réelle. Si sa fonction caractéristique φX est intégrable par
rapport à la mesure de Lebesgue sur R, alors X est continue de densité donnée par
1
Z
∀x ∈ R, pX (x) = e−iθx φX (θ) dθ.
2π R

Démonstration (non vue en cours, donc non requise). On Rreprend les notations de la démonstra-
tion du Théorème 1.4.14, avec P = PX . Posons p(x) := 2π1 −iθx φ (θ) dθ (on ne sait pas encore
Re X
que c’est pX ). On veut montrer que X a pour loi p(x) dx. Pour cela, il suffit de montrer que, pour
tout f : R → R continue à support compact
Z Z
f (x) dPX (x) = f (x)p(x) dx, (1.2)
R R

20
car cela caractérise PX par le Théorème 1.1.10.
Dans l’étape 3 de la démonstration du Théorème 1.4.14, on a montré que
Z Z
f (x)(gσ ∗ P )(x) dx −−−→ f (x) dPX (x). (1.3)
R σ→0 R

En calculant la limite autrement on va obtenir (1.2). Dans l’étape 2, on a aussi montré, pour tout
σ > 0 et tout x ∈ R,
1 1
Z Z
2 θ 2 /2
(gσ ∗ PX )(x) = √ eixt g1/σ (t)φX (−t) dt = eixt e−σ φX (−t) dt,
σ 2π R 2π R
2 2
où l’on a utilisé la définition de g1/σ dans la 2ème égalité. On a e−σ θ /2 → 0 quand σ → 0,
2 2
ainsi que la domination |eixt e−σ θ /2 φX (−t)| ≤ |φX (−t)| qui est intégrable sur R par hypothèse du
théorème. Donc, par le théorème de convergence dominée,
1 1
Z Z
(gσ ∗ PX )(x) −−−→ eixt φX (−t) dt = e−ixt φX (t) dt = p(x). (1.4)
σ→0 2π R 2π R

Donc, f (x)(gσ ∗ PX )(x) → f (x)p(x) quand σ → 0 et on a la domination suivante, pour tout σ > 0
et tout x ∈ R,
1
Z
|f (x)(gσ ∗ PX )(x)| ≤ kf k∞ 1[−M,M ] (x) · |φX (t)| dt,
2π R
où M > 0 est tel que f est nulle en dehors de [−M, M ]. La fonction squi domine est bien intégrable
en x sur R, donc, par convergence dominée, on obtient
Z Z
f (x)(gσ ∗ P )(x) dx −−−→ f (x)p(x) dx.
R σ→0 R

En combinant cela à (1.3), on obtient (1.2) et cela conclut la démonstration.

1.4.3 Transformée de Laplace


Définition 1.4.16. Soit P une loi sur R. La transformée de Laplace de P est la fonction L : R →
[0, ∞] définie par Z
∀t ∈ R, L(t) = e−tx dP (x).
R
Soit X une v.a. réelle. La transformée de Laplace de X est la transformée de Laplace de sa loi.
On la notera souvent LX et elle vérifie
h i
∀t ∈ R, LX (t) = E e−tX .

La transformée de Laplace est bien définie sur tout R car e−tx ≥ 0, mais elle peut être infinie.
Pour certaines lois, elle est même infinie partout sauf en 0 (voir la loi de Cauchy en Section 1.5).
En particulier, elle ne caractérise pas la loi en général. On peut montrer que si elle est finie autre
part qu’en 0, alors elle caractérise la loi. Cependant nous n’énoncerons pas et ne montrerons pas
ce résultat ici. Plus globalement, la transformée de Laplace sera peu utilisée dans ce cours, même
si c’est une notion importante.

1.5 Lois classiques


Dans cette section sont regroupées certaines lois classiques, ainsi que certaines de leurs pro-
priétés. Les notations pour ces lois ne sont pas universellement utilisées (sauf pour la gaussienne).
Pour certaines de ces lois, d’autres choix de paramètres ou même de définition sont parfois faits.
Il est important de connaître la définition de ces lois, mais pas toutes leurs caractéristiques, à
l’exception de la gaussienne qui joue un rôle particulièrement important en probabilités.
Notation. Si P est une loi, on note X ∼ P pour dire que X est une v.a. de loi P .

21
1.5.1 Lois discrètes
Loi de Bernoulli.
La loi de Bernoulli de paramètre p ∈ [0, 1] est la loi B(p) := (1 − p)δ0 + pδ1 , modélisant une
expérience à deux issues (échec et succès). Toute indicatrice d’événement suit une loi de Bernoulli
puisqu’elle ne prend que les valeurs 0 et 1.
Si X ∼ B(p), alors E[X] = p et Var(X) = p(1 − p). De plus, φX (θ) = (1 − p) + peiθ pour tout
θ ∈ R et LX (t) = (1 − p) + pe−t pour tout t ∈ R.

Loi binomiale.
La loi binomiale de paramètres n ∈ N et p ∈ [0, 1], notée B(n, p), est la loi supportée par J0, nK
telle que, si X ∼ B(n, p),
!
n k
∀k ∈ J0, nK, P(X = k) = p (1 − p)n−k .
k

Elle modélise le nombre de succès obtenus en répétant n fois une expérience qui résulte en un
succès avec probabilité p. Notons que B(1, p) = B(p).
On a E[X] = np et Var(X) = np(1 − p). En outre, φX (θ) = ((1 − p) + peiθ )n pour tout θ ∈ R
et LX (t) = ((1 − p) + pe−t )n pour tout t ∈ R.

Loi géométrique.
La loi géométrique de paramètre p ∈ ]0, 1], notée G(p), est la loi supportée par N∗ telle que, si
X ∼ G(p),
∀k ∈ N∗ , P(X = k) = p(1 − p)k−1 .
Elle modélise le nombre de fois qu’il faut répéter une expérience résultant en un succès avec
probabilité p afin d’obtenir un premier succès.
On a E[X] = 1/p et Var(X) = (1 − p)/p2 . Sa fonction caractéristique est donnée par

peiθ
∀θ ∈ R, φX (θ) =
1 − (1 − p)eiθ

et sa transformée de Laplace

pe−t

1−(1−p)e−t si t > log(1 − p),
∀t ∈ R, LX (t) =
∞ sinon.

Loi de Poisson.
La loi de Poisson de paramètre (ou de taux) λ > 0, notée P(λ), est la loi supportée par N telle
que, si X ∼ P(λ),
λk
∀k ∈ N, P(X = k) = e−λ .
k!
Elle est généralement introduite comme la limite (en un sens que l’on formalisera plus tard dans
ce cours) de la loi binomiale B(n, p) dans le régime où n → ∞ et p → 0 simultanément de sorte
que pn → λ.
iθ −t
On a E[X] = λ et Var(X) = λ. De plus, φX (θ) = eλ(e −1) pour tout θ ∈ R et LX (t) = eλ(e −1)
pour tout t ∈ R.

22
1.5.2 Lois continues
Loi uniforme.
1
Soit a < b des réels. La loi uniforme sur [a, b], notée U([a, b]), est la mesure de densité b−a 1[a,b]
par rapport à la mesure de Lebesgue. Elle représente un point tiré uniformément au hasard sur [a, b].
Si X ∼ U([a, b]), alors
a+b (b − a)2
E[X] = et Var(X) = .
2 12
Notons que E[X] est le milieu du segment [a, b]. Sa fonction de répartition est donnée par

0

 si x ≤ a,
∀x ∈ R, FX (x) = x−a
si a < x < b,
 b−a
si x ≥ b.

1

Sa fonction caractéristique et sa transformée de Laplace sont


eiθb − eiθa e−ta − e−tb
∀θ ∈ R, φX (θ) = et ∀t ∈ R, LX (t) =
iθ(b − a) t(b − a)

Loi gaussienne.
Soit m ∈ R et σ > 0. La loi gaussienne (ou loi normale) de moyenne m et variance σ 2 , notée
N (m, σ 2 ), est la mesure !
1 (x − m)2
√ exp − dx.
σ 2π 2σ 2
Dans le cas particulier m = 0 et σ = 1, la loi N (0, 1) est appelée loi gaussienne standard (ou
loi normale standard, ou loi normale centrée réduite). Une propriété importante est que l’on peut
réécrire toutes les lois gaussiennes à partir de la loi gaussienne standard : si X ∼ N (0, 1), alors
m + σX ∼ N (m, σ 2 ), voir TD2.
2 2
Si Z ∼ N (m, σ 2 ), on a E[Z] = m et Var(Z) = σ 2 . De plus, φZ (θ) = eimθ−σ θ /2 pour tout
θ ∈ R, comme on le verra au TD3 en vérifiant que φZ est solution d’une équation différentielle. Par
2 2
calcul direct, on peut montrer que LZ (t) = e−mt+σ t /2 pour tout t ∈ R. La fonction de répartition
de Z n’est pas explicite en terme des fonctions usuelles. On note généralement Φ la fonction de
répartition de N (0, 1). Alors, on a FZ (x) = Φ( x−m
σ ) pour tout x ∈ R.

Loi exponentielle.
La loi exponentielle de paramètre λ > 0, notée E(λ), est la mesure λe−λx 1[0,∞[ (x) dx. Elle
représente un temps d’attente avec la propriété de perte de mémoire suivante : si X ∼ E(λ), alors
∀s, t ≥ 0, P(X > t + s|X > t) = P(X > s).
Autrement dit, à l’instant t, si l’on sait que l’attente n’est pas terminée (i.e. X > t), alors le temps
d’attente restant est toujours de loi E(λ). Les lois exponentielles sont les seules lois sur [0, ∞[ à
satisfaire cette propriété de perte de mémoire (à l’exception de la loi δ0 qui est un cas dégénéré),
voir TD3.
Si X ∼ E(λ), on a E[X] = 1/λ et Var(X) = 1/λ2 . Sa fonction de répartition est donnée par
(
0 si x ≤ 0,
∀x ∈ R, FX (x) =
1 − e−λx si x ≥ 0.
Sa fonction caractéristique et sa transformée de Laplace sont
(
λ
λ λ+t si t > −λ,
∀θ ∈ R, φX (θ) = et ∀t ∈ R, LX (t) =
λ − iθ ∞ si t ≤ −λ.

23
Loi de Cauchy.
La loi de Cauchy de paramètre de position m et de paramètre d’échelle a > 0, notée C(m, a),
est la mesure
a
dx.
π(a + (x − m)2 )
2

Le paramètre m est le centre de symétrie de la densité et le point où elle atteint son maximum.
La densité forme une bosse dont la largeur est proportionnelle à a et la hauteur à 1/a. Dans le cas
particulier m = 0 et a = 1, la loi C(0, 1) est appelée loi de Cauchy standard. Si Y ∼ C(0, 1), alors
aY + m ∼ C(m, a).
Si X ∼ C(m, a), alors E[|X|] = ∞, donc ni E[X] ni Var(X) ne sont bien définis. Sa fonction de
répartition est donnée par FX (x) = π1 arctan( x−m 1
a )− 2 pour tout x ∈ R. Sa fonction caractéristique
et sa transformée de Laplace sont
(
1 si t = 0,
∀θ ∈ R, φX (θ) = eimθ−a|θ| et ∀t ∈ R, LX (t) =
∞ si t 6= 0.

Cette fonction caractéristique peut s’obtenir en utilisant la formule d’inversion de Fourier, voir le
TD3 pour les détails.

24
Chapitre 2

Vecteurs aléatoires et indépendance

2.1 Rappels de théorie de la mesure


2.1.1 Tribus produit
Définition 2.1.1. Soit (E1 , E1 ), . . . , (Ed , Ed ) des espaces mesurables. On peut munir E1 × · · · × Ed
de la tribu produit, notée E1 ⊗ · · · ⊗ Ed , qui est la tribu engendrée par l’ensemble des pavés

{B1 × · · · × Bd : B1 ∈ E1 , . . . , Bd ∈ Ed }.

On peut montrer que la tribu produit E1 ⊗ · · · ⊗ Ed est la plus petite tribu sur E1 × · · · × Ed
rendant les projections
πi : E1 × · · · × Ed −→ Ei
(x1 , . . . , xd ) 7−→ xi
mesurables pour chaque i ∈ {1, . . . , d}.
Nous serons particulièrement intéressé par l’espace produit Rd , pour lequel le produit des tribus
boréliennes de R coïncide avec la tribu borélienne de Rd , comme énoncé dans le résultat suivant.
Par défaut, Rd sera toujours supposé être muni de sa tribu borélienne B(Rd ).
Proposition 2.1.2. On a B(Rd ) = B(R)⊗d . De plus, cette tribu est engendrée par

{] − ∞, a1 ] × · · · × ] − ∞, ad ] : a1 , . . . , ad ∈ R}.

Il en découle le résultat d’unicité suivant pour les mesures de probabilités sur Rd .


Corollaire 2.1.3. Soit P et Q deux mesures de probabilité sur (Rd , B(Rd )). Supposons que

∀a1 , . . . , ad ∈ R, P (] − ∞, a1 ] × · · · × ] − ∞, ad ]) = Q(] − ∞, a1 ] × · · · × ] − ∞, ad ]).

Alors P = Q.
Démonstration. C’est une conséquence directe du Théorème 1.1.9 et de la Proposition 2.1.2, car
l’ensemble des ] − ∞, a1 ] × · · · × ] − ∞, ad ] est stable par intersection finie.

2.1.2 Mesures produit


Les mesures produit sont un cas particulier de mesures construites sur un espace produit. Leur
construction a été vue en théorie de la mesure.
Théorème 2.1.4. Soit (E1 , E1 , µ1 ), . . . , (Ed , Ed , µd ) des espaces mesurés, avec µ1 , . . . , µd des me-
sures σ-finies. Il existe une unique mesure µ1 ⊗ · · · ⊗ µd sur (E1 × · · · × Ed , E1 ⊗ · · · ⊗ Ed ), appelée
mesure produit, telle que

∀B1 ∈ E1 , . . . , Bd ∈ Ed , (µ1 ⊗ · · · ⊗ µd )(B1 × · · · × Bd ) = µ1 (B1 ) · · · µd (Bd ).

25
Sur Rd , on notera λd la mesure de Lebesgue. Elle coïncide avec le produit de d mesures de
Lebesgue sur R, i.e. λd = λ⊗d
1 .
Pour travailler avec des intégrales par rapport à des mesures produits, les résultats les plus
importants sont les deux théorèmes de Fubini.

Théorème 2.1.5 (Fubini–Tonelli). Soit (E, E, µ) et (F, F, ν) des espaces mesurés, avec µ et ν des
mesures
R
σ-finies. Soit f : E ×
R
F → [0, ∞] une fonction mesurable. Alors, les fonctions x ∈ E 7→
F f (x, y) dν(y) et y ∈ F 7→ E f (x, y) dµ(x) sont mesurables et on a
Z Z Z  Z Z 
f d(µ ⊗ ν) = f (x, y) dν(y) dµ(x) = f (x, y) dµ(x) dν(y).
E×F E F F E

Théorème 2.1.6 (Fubini–Lebesgue). Soit (E, E, µ) et (F, F, ν) des espaces mesurés, avec µ et ν
des mesures σ-finies. Soit f : E × F → R une Rfonction mesurable. Supposons que f est intégrable
par rapport à µ⊗ν. Alors, la fonction x ∈ E 7→ FR f (x, y) dν(y) est bien définie µ-p.p., mesurable et
intégrable par rapport à µ, la fonction y ∈ F 7→ E f (x, y) dµ(x) est bien définie ν-p.p., mesurable
et intégrable par rapport à ν, et on a
Z Z Z  Z Z 
f d(µ ⊗ ν) = f (x, y) dν(y) dµ(x) = f (x, y) dµ(x) dν(y).
E×F E F F E

2.1.3 Formule de changement de variable


La formule de changement de variable est un outil spécifique à la mesure de Lebesgue sur Rd .
Elle nous sera particulièrement utile pour travailler avec des vecteurs aléatoires de loi continue.
Soit U et V deux ouverts de Rd . Soit ϕ : U → V , on note ϕ = (ϕ1 , . . . , ϕd ). Rappelons qu’on
dit que ϕ est un C 1 -difféomorphisme si ϕ est bijective, de classe C 1 sur U et ϕ−1 est de classe C 1
sur V . Cela implique en particulier que la matrice jacobienne de ϕ en x, donnée par
 ∂ϕ ∂ϕ1 
! 1
∂x1 (x) ··· ∂xd (x)
∂ϕi  .. .. .. 
(x) = . . .

∂xj 1≤i,j≤d

∂ϕd ∂ϕd

∂x1 (x) · · · ∂xd (x)

est inversible en tout point de x ∈ U . On note Jacϕ (x) le déterminant de la matrice jacobienne et
on l’appelle le Jacobien de ϕ en x.

Théorème 2.1.7 (Changement de variable). Soit U et V deux ouverts de Rd . Soit ϕ : U → V un


C 1 -difféomorphisme. Alors, pour toute fonction mesurable f : V → R+ ,
Z Z
f (y) dy = f (ϕ(x))|Jacϕ (x)| dx.
V U

Rappelons que, grâce au théorème d’inversion globale, une manière de montrer que ϕ : U → V
est un C 1 -difféomorphisme est de vérifier que
• ϕ : U → V est bijective ;
• Les dérivées partielles de ϕ sont continues sur U ;
• Pour tout x ∈ U , Jacϕ (x) 6= 0.
Il est aussi suffisant de vérifier ces propriétés pour ϕ−1 , ce qui est intéressant si ses dérivées partielles
sont plus faciles à calculer. On peut alors utiliser Jacϕ (x) = [Jacϕ−1 (ϕ(x))]−1 .

26
2.2 Vecteurs aléatoires, loi jointe et marginale
2.2.1 Loi jointe, lois marginales
Si X est une v.a. à valeurs dans Rd (que l’on munira toujours de B(Rd )) et qu’on note
(X1 , . . . , Xd ) ses coordonnées, alors les Xi sont des v.a. réelles. Réciproquement, si X1 , . . . , Xd
sont des v.a. réelles, alors X = (X1 , . . . , Xd ) est une v.a. à valeurs dans Rd . Ainsi, il est équi-
valent de considérer un vecteur de d variables aléatoires réelles ou de considérer une seule variable
aléatoire à valeur dans Rd .

Définition 2.2.1. Soit X = (X1 , . . . , Xd ) une v.a. à valeur dans Rd .


• Les lois PXi pour i ∈ J1, dK sont appelées les lois marginales de X.
• La loi PX est appelée loi jointe de (X1 , . . . , Xd ).

Notons que la notion de loi jointe n’apporte rien de nouveau : la loi jointe de (X1 , . . . , Xd ) est
simplement la loi de (X1 , . . . , Xd ). Le mot “jointe” est là pour souligner le fait que l’on considère
les v.a. réelles X1 , . . . , Xd comme un vecteur aléatoire, en opposition aux lois marginales où on
considère les Xi individuellement. Comme nous allons le voir, connaître la loi jointe permet de
connaître les lois marginales, mais la réciproque est fausse !

Proposition 2.2.2. Soit X = (X1 , . . . , Xd ) une v.a. à valeur dans Rd . La loi de X caractérise
ses lois marginales. Plus précisément, pour i ∈ J1, dK, en notant πi : Rd → R la projection sur la
i-ème coordonnée, PXi est la mesure image de PX par la fonction πi .

Démonstration. Pour tout B ∈ B(R), on a

PXi (B) = P(Xi ∈ B) = P(πi (X) ∈ B) = P(X ∈ πi−1 (B)) = PX (πi−1 (B)).

Cela montre que PXi est la mesure image de PX par la fonction πi et, en particulier, que PXi est
caractérisée par PX .

Exemple 2.2.3. Considérons une v.a. X = (X1 , X2 ) à valeurs dans R2 de loi


1 1 1 1
PX = δ(0,0) + δ(0,1) + δ(1,0) + δ(1,1) .
4 4 4 4
On peut noter que X1 est à valeurs dans {0, 1}, donc sa loi est déterminée par la connaissance de
1 1 1
P(X1 = 0) = P(X ∈ {(0, 0), (0, 1)}) = + = ,
4 4 2
ce qui implique que P(X1 = 1) = 12 et donc X1 est de loi B(1/2) (i.e. la loi de Bernoulli de
paramètre 1/2). De la même manière, X2 est aussi de loi B(1/2).
Considérons à présent Y = (Y1 , Y2 ) à valeurs dans R2 de loi
1 1
PY = δ(0,0) + δ(1,1) .
2 2
Alors, on peut montrer de manière similaire que Y1 et Y2 sont de loi B(1/2).
Ainsi X et Y ont les mêmes lois marginales, mais pas la même loi. Autrement dit, dire “considé-
rons deux v.a. de loi B(1/2)” ne permet pas de décrire leur loi jointe. Ici, X1 et X2 correspondent au
cas où les deux v.a. sont indépendantes (voir la prochaine section) alors que Y1 et Y2 correspondent
au cas où les deux v.a. sont identiques (on a Y1 = Y2 p.s., car Y ∈ {(0, 0), (1, 1)} p.s.).

On conclut cette section en définissant la covariance de deux v.a. réelles. Cette quantité quantifie
à quel point X et Y prennent leurs valeurs au-dessus de la moyenne en même temps.

27
Définition 2.2.4. Soit X et Y des v.a. réelles dans L2 (Ω, A, P). La covariance de X et Y est
h i
Cov(X, Y ) = E (X − E[X])(Y − E[Y ]) .

Remarque 2.2.5. Par l’inégalité de Cauchy–Schwarz, on a


h i1/2 h i1/2
|Cov(X, Y )| ≤ E (X − E[X])2 · E (Y − E[Y ])2 = σX · σY ,

où on rappelle que σX est l’écart-type de X. Quelques cas particuliers important sont :


• Si Cov(X, Y ) = σX · σY , alors Y = cX + a p.s. pour c ≥ 0 et a ∈ R ou X = a p.s. pour a ∈ R.
Voir le TD4 pour la démonstration.
• Si Cov(X, Y ) = −σX · σY , alors Y = −cX + a p.s. pour c ≥ 0 et a ∈ R ou X = a p.s. pour
a ∈ R.
• Quand X et Y sont indépendantes, on verra que leur covariance est nulle. Cependant, la
réciproque est fausse.
Proposition 2.2.6. Soit X et Y des v.a. réelles dans L2 (Ω, A, P). On a

Cov(X, Y ) = E[XY ] − E[X]E[Y ].

Démonstration. Cela s’obtient en développant le produit (X − E[X])(Y − E[Y ]), puis en prenant
l’espérance.

2.2.2 Lois continues sur Rd


Définition 2.2.7. Une loi sur Rd est dite continue si elle est à densité par rapport à la mesure
de Lebesgue sur Rd . Une v.a. X à valeurs dans Rd est dite continue si sa loi est continue et on
notera alors généralement pX : Rd → R+ sa densité.
On notera alors dPX (x) = pX (x) dx, où x = (x1 , . . . , xd ) est ici un élément de Rd . Il est
équivalent de dire “X est une v.a. continue de densité pX ” et “X est de loi pX (x) dx”.
Le résultat suivant décrit les marginales d’une v.a. continue à valeurs dans Rd .
Proposition 2.2.8. Soit X = (X1 , . . . , Xd ) une v.a. continue à valeur dans Rd . Alors ses lois
marginales sont continues. Plus précisément, pour i ∈ J1, dK, Xi a pour densité
Z
pXi : xi ∈ R 7−→ pX (x1 , . . . , xd ) dx1 · · · dxi−1 dxi+1 · · · dxd .
Rd−1

Par exemple, si d = 2, on a
Z Z
pX1 (x1 ) = pX (x1 , x2 ) dx2 et pX2 (x2 ) = pX (x1 , x2 ) dx1 .
R R

Démonstration. Soit f : R → R+ une fonction mesurable. Notons πi la projection sur la i-ième


coordonnée, de sorte que Xi = πi (X). Alors, par le théorème de transfert,
Z Z
E[f (Xi )] = E[f (πi (X))] = f (πi (x))pX (x) dx = f (xi )pX (x1 , . . . , xd ) dx1 · · · dxd .
Rd Rd

Par Fubini-Tonelli, on peut intégrer dans l’ordre que l’on souhaite. On intégre d’abord par rapport
à toutes les variables sauf xi , ce qui donne
Z Z 
E[f (Xi )] = f (xi ) pX (x1 , . . . , xd ) dx1 · · · dxi−1 dxi+1 · · · dxd dxi .
R Rd−1

Cela implique que la loi de Xi est continue, de densité donnée par la quantité entre parenthèses
dans l’intégrale ci-dessus, vue comme une fonction de xi .

28
Exemple 2.2.9. On veut tirer au hasard un point du plan, de manière uniforme dans le triangle
de sommets (0, 0), (0, 1), (1, 0). Notons
n o
T = (x, y) ∈ R2 : x ≥ 0, y ≥ 0, x + y ≤ 1
ce triangle. Sa mesure de Lebesgue est λ2 (T ) = 1/2 (c’est son aire !). La loi uniforme sur T est
donc 21T (x, y) dx dy. On considère donc une v.a. (X, Y ) continue de densité 21T , qui représente un
point du plan tiré uniformément au hasard dans T . Ses marginales sont donc également continues
et on a, pour tout x ∈ R,
(
0 si x ∈
/ [0, 1],
Z Z
pX (x) = p(X,Y ) (x, y) dy = 21T (x, y) dy = R 1−x
R R 0 2 dy si x ∈ [0, 1].
Donc X a pour densité pX : x 7→ 2(1 − x)1[0,1] (x). Par symétrie du problème, Y a la même loi.
Méthode (Déterminer une loi sur Rd ). La méthode présentée en Section 1.3.3 pour déterminer
la loi d’une v.a. réelle fonctionne aussi en dimension supérieure. Ainsi, pour déterminer la loi
d’une v.a. X à valeurs dansR Rd , on peut essayer d’exprimer E[f (X)], pour f : Rd → R+ mesurable
quelconque, sous la forme R f (x) dµ(x) avec µ une mesure sur Rd . Alors on peut en conclure que
PX = µ. Dans le cas où X est définie à partir d’une autre v.a. continue, cela nécessite généralement
de faire un changement de variable en dimension d, voir le Théorème 2.1.7 pour un rappel.
Exemple 2.2.10. On reprend l’exemple précédent. On s’intéresse maintenant au point (U, V ) qui
est le symétrique de (X, Y ) par rapport à l’hypoténuse de T , voir le dessin. On veut déterminer la
loi de (U, V ).
y

T (U, V )

(X, Y )
1 x

Pour cela, notons que (U, V ) = (1 − Y, 1 − X). Donc, pour f : R2 → R+ mesurable, on a


E[f (U, V )] = E[f (1 − Y, 1 − X)]
Z
= f (1 − y, 1 − x)p(X,Y ) (x, y) dx dy
2
ZR
= f (1 − y, 1 − x) · 21x≥0,y≥0,x+y≤1 dx dy.
R2
On veut alors faire le changement de variables (u, v) = (1 − y, 1 − x) ⇔ (x, y) = (1 − v, 1 − u).
Pour cela on considère la fonction ϕ : (u, v) ∈ R2 7→ (1 − v, 1 − u) ∈ R2 qui est bijective (elle est sa
propre réciproque), a des dérivées partielles continues sur R2 (car constantes) et son Jacobien est
0 −1
Jacϕ (u, v) = = −1,
−1 0
il est donc non nul partout. Donc ϕ : R2 → R2 est un C 1 -difféomorphisme et on peut appliquer la
formule de changement de variables pour obtenir
Z
E[f (U, V )] = f (1 − (1 − u), 1 − (1 − v)) · 211−v≥0,1−u≥0,2−u−v≤1 · |Jacϕ (u, v)| du dv
2
ZR
= f (u, v) · 21v≤1,u≤1,u+v≥1 du dv.
R2

29
Donc (U, V ) a pour loi 21v≤1,u≤1,u+v≥1 du dv, qui est la loi uniforme sur le symétrique de T par
rapport à son hypoténuse.

2.3 Indépendance
2.3.1 Indépendance d’événements
Définition 2.3.1. Soit (Ω, A, P) un espace de probabilité. Soit A, B ∈ A des événements. On dit
que A et B sont indépendants si P(A ∩ B) = P(A) · P(B).
Cette définition peut s’interpréter, si P(B) > 0, en notant qu’on a alors P(A|B) = P(A), ce
qui signifie que le fait de savoir que l’événement B est réalisé ne modifie pas la probabilité de
l’événement A.
Remarque 2.3.2. Si A et B sont indépendants, alors A et B c sont indépendants. En effet

P(A ∩ B c ) = P(A) − P(A ∩ B) = P(A) − P(A) · P(B) = P(A) · (1 − P(B)) = P(A) · P(B c ).

Définition 2.3.3. Soit (Ω, A, P) un espace de probabilité. Soit A1 , . . . , An ∈ A des événements.


On dit que A1 , . . . , An sont indépendants si, pour tout p ∈ J1, nK et tous 1 ≤ k1 < · · · < kp ≤ n,
P(Ak1 ∩ · · · ∩ Akp ) = P(Ak1 ) · · · P(Akp ).
Il est important de noter qu’il n’est pas suffisant de montrer que les événements A1 , . . . , An
sont deux à deux indépendants pour obtenir l’indépendance des n événements ensemble, comme
montré dans l’exemple suivant.
Exemple 2.3.4. Considérons l’expérience consistant à lancer deux dés à 6 faces équilibrés, mo-
délisée par Ω = J1, 6K2 muni de A = P(Ω) et de la mesure uniforme P, i.e. P(A) = |A|/36 pour
A ∈ A. On considère les événements suivants :

A = ‘les deux dés donnent le même résultat’


B = ‘le 1er dé donne un résultat pair’
C = ‘le 2ème dé donne un 1’
D = ‘le 2ème dé donne un 1 ou un 2’.

On calcule alors P(A) = 1/6, P(B) = 1/2, P(C) = 1/6 et P(D) = 1/3. On a ensuite
3 1
P(A ∩ B) = P({(2, 2), (4, 4), (6, 6)}) = = = P(A) · P(B),
36 12
donc A et B sont indépendants. On montre similairement que A et C sont indépendants, ainsi que
A et D, B et C, B et D. Mais, on a
1 1
P(C ∩ D) = P(C) = 6= = P(C) · P(D),
6 18
donc C et D ne sont pas indépendants. D’autre part, même si A, B et C sont deux à deux
indépendants, ils ne sont pas indépendants tous les trois ensemble car
1
P(A ∩ B ∩ C) = P(∅) = 0 6= = P(A) · P(B) · P(C).
72
Mais, on peut dire que A, B et D sont indépendants car
1
P(A ∩ B ∩ D) = P({(2, 2)}) = = P(A) · P(B) · P(D)
36
et on a déjà vérifié les autres conditions de la définition pour p = 2 (et pour p = 1, elles sont
toujours vraies).

30
2.3.2 Indépendance de variables aléatoires
Définition 2.3.5. Pour 1 ≤ i ≤ n, soit Xi une v.a. à valeurs dans (Ei , Ei ). On dit que X1 , . . . , Xn
sont indépendantes si pour tous B1 ∈ E1 , . . . , Bn ∈ En ,

P(X1 ∈ B1 , . . . , Xn ∈ Bn ) = P(X1 ∈ B1 ) · · · P(Xn ∈ Bn ).

L’indépendance entre X1 et X2 signifie que le fait de savoir quelque chose sur X1 n’ap-
porte pas d’information sur X2 (et vice-versa) : on a P(X2 ∈ B2 |X1 ∈ B1 ) = P(X2 ∈ B2 ) dès
que P(X1 ∈ B1 ) > 0.
Comme pour les événements, ils ne suffit pas que les v.a. X1 , . . . , Xn soient indépendantes deux
à deux pour qu’elles soient indépendantes dans leur ensemble.

Remarque 2.3.6. Cette définition peut sembler différente de celle pour les événements, car on
n’a pas besoin de considérer des sous-familles. Cependant les deux définitions sont cohérentes car,
pour A1 , . . . , An ∈ A, on a l’équivalence suivante : les événements A1 , . . . , An sont indépendants si
et seulement si les v.a. 1A1 , . . . 1An sont indépendantes. Voir le TD4 pour la démonstration.

Remarque 2.3.7. On a les deux conséquences suivantes de l’indépendance. Supposons que X1 , . . . , Xn


sont indépendantes.
• Pour n’importe quel I ⊂ J1, nK, les v.a. Xi pour i ∈ I sont indépendantes. En effet, il suffit
d’appliquer la définition de l’indépendance pour X1 , . . . , Xn en prenant Bj = Ω pour j ∈
/ I.
• Pour tous B1 ∈ E1 , . . . , Bn ∈ En , les événements {X1 ∈ B1 }, . . . , {Xn ∈ Bn } sont in-
dépendants. Pour le vérifier, on considère une sous-famille 1 ≤ i1 < · · · < ip ≤ n et
on utilise le fait que Xi1 , . . . , Xip sont indépendantes par le point précédent pour obtenir
P(Xi1 ∈ Bi1 , . . . , Xip ∈ Bip ) = P(Xi1 ∈ Bi1 ) · · · P(Xip ∈ Bip ).

Proposition 2.3.8 (Fonctions de v.a. indépendantes). Pour 1 ≤ i ≤ n, soit Xi une v.a. à valeurs
dans (Ei , Ei ) et fi : (Ei , Ei ) → (Fi , Fi ) mesurable. Supposons que X1 , . . . , Xn sont indépendantes.
Alors f1 (X1 ), . . . , fn (Xn ) sont indépendantes.

Démonstration. Pour tous B1 ∈ F1 , . . . , Bn ∈ Fn ,


 
P(f1 (X1 ) ∈ B1 , . . . , fn (Xn ) ∈ Bn ) = P X1 ∈ f1−1 (B1 ), . . . , Xn ∈ fn−1 (Bn )
   
= P X1 ∈ f1−1 (B1 ) · · · P Xn ∈ fn−1 (Bn )
= P(f1 (X1 ) ∈ B1 ) · · · P(fn (Xn ) ∈ Bn ),

où l’on a utilisé l’indépendance de X1 , . . . , Xn dans la 2ème égalité, en notant que fi−1 (Bi ) ∈ Ei
car fi est mesurable.

Exemple 2.3.9. Soit X et Y des v.a. réelles indépendantes. Alors X 2 et 2Y +1 sont indépendantes.

La prochaine proposition présente quelques caractérisations de l’indépendance. La caractérisa-


tion (ii) est très importante : X1 , . . . , Xn sont indépendantes si et seulement si leur loi jointe est
le produit des lois marginales. Cela implique en particulier que, dans le cas de v.a. indépendantes,
connaître les lois marginales suffit à connaître la loi jointe.

Proposition 2.3.10 (Caractérisations de l’indépendance). Pour 1 ≤ i ≤ n, soit Xi une v.a. à


valeurs dans (Ei , Ei ). Les propositions suivantes sont équivalentes :
(i) X1 , . . . , Xn sont indépendantes ;
(ii) P(X1 ,...,Xn ) = PX1 ⊗ · · · ⊗ PXn ;
Qn Qn
(iii) pour toutes f1 : E1 → R+ , . . . , fn : En → R+ mesurables, E[ i=1 fi (Xi )] = i=1 E[fi (Xi )] ;

31
(iv) pour toutes f1 : E1 → R, . . . , fn : En → R mesurables telles que E[|fi (Xi )|] < ∞ pour chaque
i ∈ J1, nK, on a E[ ni=1 |fi (Xi )|] < ∞ et E[ ni=1 fi (Xi )] = ni=1 E[fi (Xi )] ;
Q Q Q

Démonstration. On va d’abord montrer (i) ⇒ (ii) ⇒ (iii) ⇒ (i), ce qui montrera que les trois
premières propositions sont équivalentes :
• (i) ⇒ (ii). Soit B1 ∈ E1 , . . . , Bn ∈ En . On a

P(X1 ,...,Xn ) (B1 × · · · × Bn ) = P(X1 ∈ B1 , . . . , Xn ∈ Bn ) (définition de la loi)


= P(X1 ∈ B1 ) · · · P(Xn ∈ Bn ) (par (i))
= PX1 (B1 ) · · · PXn (Bn ) (définition de la loi)
= (PX1 ⊗ · · · ⊗ PXn )(B1 × · · · × Bn ) (déf de la mesure produit)

ce qui montre (ii) par le Théorème 1.1.9 car l’ensemble des pavés est stable par intersections
finies et engendre la tribu produit.
• (ii) ⇒ (iii). Pour f1 , . . . , fn : R → R+ mesurables, on a
" n # Z n
!
Y Y
E fi (Xi ) = fi (xi ) dP(X1 ,...,Xn ) (x1 , . . . , xn ) (théorème de transfert)
i=1 E1 ×···×En i=1
n
Z !
Y
= fi (xi ) d(PX1 ⊗ · · · ⊗ PXn )(x1 , . . . , xn ) (par (ii))
E1 ×···×En i=1
n Z
Y
= fi (xi ) dPXi (xi ) (par Fubini–Tonelli)
i=1 Ei
Yn
= E[fi (Xi )]. (théorème de transfert)
i=1

• (iii) ⇒ (i). La définition de l’indépendance correspond à un cas particulier de (iii) où on prend


fi = 1Bi : en effet fi (Xi ) = 1{Xi ∈Bi } et ni=1 fi (Xi ) = 1{X1 ∈B1 ,...,Xn ∈Bn } .
Q

Il reste à montrer que (iv) est équivalente aux autres propositions. Montrons (ii) ⇒ (iv). Le
fait que (ii) ⇒ (iii) appliqué aux fonctions |fi | justifie que E[ ni=1 |fi (Xi )|] = ni=1 E[|fi (Xi )|] < ∞.
Q Q

Puis on peut répéter le calcul fait dans la partie (ii) ⇒ (iii), en utilisant Fubini–Lebesgue à la place
de Fubini–Tonelli. Cela montre que (ii) ⇒ (iv). Puis la démonstration de (iv) ⇒ (i) est identique
à celle de (iii) ⇒ (i) car E[1Bi (Xi )] < ∞. Donc (iv) est équivalent aux propriétés précédentes.

Exemple 2.3.11. Soit X une v.a. uniforme sur [0, 1] et Y une v.a. de loi de Cauchy standard.
Supposons que X et Y sont indépendantes. Alors leur loi jointe est
1
dP(X,Y ) (x, y) = d(PX ⊗ PY )(x, y) = dPX (x) dPY (y) = 1[0,1] (x) dx dy.
π(1 + y 2 )

Remarque 2.3.12. Soit X, Y ∈ L2 (Ω, A, P). Si X et Y sont indépendantes, alors E[XY ] =


E[X]E[Y ] par la partie (iv) de la proposition précédente, car E[|X|] < ∞ et E[|Y |] < ∞, parce que
L2 (Ω, A, P) ⊂ L1 (Ω, A, P). On a donc Cov(X, Y ) = 0. La réciproque est fausse : une covariance
nulle n’implique pas l’indépendance, voir TD5.

Corollaire 2.3.13 (Regroupement par paquets). Pour 1 ≤ i ≤ n, soit Xi une v.a. à valeurs dans
(Ei , Ei ). Supposons que X1 , . . . , Xn sont indépendantes. Soit k ≥ 1 et 0 = i0 < i1 < · · · < ik = n.
Alors (Xi0 +1 , . . . , Xi1 ), (Xi1 +1 , . . . , Xi2 ), . . . , (Xik−1 +1 , . . . , Xik ) sont indépendantes.

32
Démonstration. Cela découle de la caractérisation de l’indépendance en terme de mesure produit
ainsi que de l’associativité du produit de mesures. En effet, on a

P((Xi0 +1 ,...,Xi1 ),...,(Xi ,...,Xik )) = P(X1 ,...,Xn )


k−1 +1

= PX1 ⊗ · · · ⊗ PXn
= (PXi0 +1 ⊗ · · · ⊗ PXi1 ) ⊗ · · · ⊗ (PXik−1 +1 ⊗ · · · ⊗ PXik )
= P(Xi0 +1 ,...,Xi1 ) ⊗ · · · ⊗ P(Xi ,...,Xik ) ,
k−1 +1

où on a utilisé l’indépendance de X1 , . . . , Xn dans la 2ème égalité (avec le critère (ii) de la Pro-


position 2.3.10), l’associativité du produit de mesures dans la 3ème et le fait que Xi`−1 +1 , . . . , Xi`
sont indépendantes pour chaque ` ∈ J1, kK (voir Remarque 2.3.7). Par le critère (ii) de la Propo-
sition 2.3.10), la relation ci-dessus montre que (Xi0 +1 , . . . , Xi1 ), . . . , (Xik−1 +1 , . . . , Xik ) sont indé-
pendantes.

Exemple 2.3.14. Soit X1 , . . . , X4 des v.a. indépendantes. Alors X12 X2 et X3 − X4 sont indé-
pendantes. En effet, par le Corollaire 2.3.13, (X1 , X2 ) et (X3 , X4 ) sont indépendantes, puis par la
Proposition 2.3.8, appliquée aux fonctions f : (x, y) ∈ R2 → x2 y et g : (x, y) ∈ R2 → x − y, les v.a.
f (X1 , X2 ) et g(X3 , X4 ) sont indépendantes.

2.3.3 Indépendance de variables aléatoires continues


On s’intéresse à présent au cas de variables dont la loi jointe est continue. La proposition
suivante permet de déterminer, au vu de la densité de la loi jointe, si les v.a. sont indépendantes
et de trouver facilement leurs marginales.
Proposition 2.3.15. Soit X1 , . . . , Xn des v.a. réelles telles que (X1 , . . . , Xn ) soit continue. Sup-
posons que sa densité s’écrive sous la forme
n
Y
p(X1 ,...,Xn ) (x1 , . . . , xn ) = qi (xi ),
i=1

avec q1 , . . . , qn : R → R+ mesurables. Alors X1 , . . . , Xn sont indépendantes et, pour chaque i, Xi a


pour densité pXi = c1i qi où ci = R qi (x) dx > 0.
R

Démonstration. On remarque d’abord que, par Fubini–Tonelli,


n Z n
 Z ! Z
Y Y
qi (xi ) dxi = qi (xi ) dx1 · · · dxn = p(X1 ,...,Xn ) (x1 , . . . , xn ) dx1 · · · dxn = 1.
i=1 R Rn i=1 Rn
R
En particulier, on a ci = R qi (x) dx > 0 pour tout i ∈ J1, nK. Par la Proposition 2.2.8, on sait que,
pour chaque i ∈ J1, nK, Xi est continue de densité donnée, pour tout xi ∈ R, par
Z
pXi (xi ) = p(X1 ,...,Xn ) dx1 · · · dxi−1 dxi+1 · · · dxn
Rn−1
Z !
Y
= qi (xi ) qj (xj ) dx1 · · · dxi−1 dxi+1 · · · dxn
Rn−1 j6=i
!
Y Z
= qi (xi ) qj (xj ) dxj (par Fubini–Tonelli)
j6=i R

n
!
1 Y Z
= qi (xi ) qj (xj ) dxj
ci j=1 R

1
= qi (xi ),
ci

33
par l’égalité démontrée précédemment. On a donc montré la formule pour la densité de Xi . Il reste
à montrer l’indépendance. Pour cela, on remarque que
n n n n n
! !
Y Y Y Y Y
p(X1 ,...,Xn ) (x1 , . . . , xn ) = qi (xi ) = ci pXi (xi ) = ci pXi (xi ) = pXi (xi ),
i=1 i=1 i=1 i=1 i=1

en utilisant de nouveau que ni=1 ci = 1. Cela implique que P(X1 ,...,Xn ) = PX1 ⊗ · · · ⊗ PXn , et donc
Q

que X1 , . . . , Xn sont indépendantes par la Proposition 2.3.10.

Exemple 2.3.16. Soit (X, Y ) une v.a. à valeurs dans R2 de loi

e−2x 1R+ ×[0,2] (x, y) dx dy.

La densité de (X, Y ) s’écrit sous la forme d’un produit d’une fonction de x et d’une fonction de y :

p(X,Y ) (x, y) = e−2x 1R+ (x) · 1[0,2] (y) .


   

1[0,2] (y) dy = 2 (donc


R
Donc X et Y sont indépendantes. Pour trouver leurs densités, on calcule R
nécessairement R e−2x 1R+ (x) dx = 1/2) et on en déduit que
R

1
pX (x) = 2e−2x 1R+ (x) et pY (y) = 1 (y).
2 [0,2]
On peut donc conclure en disant que X et Y sont indépendantes avec X de loi exponentielle de
paramètre 2 et Y de loi uniforme sur [0, 2].

Exemple 2.3.17. Reprenons le cadre de l’Exemple 2.2.9 : soit (X, Y ) un point tiré de manière
uniforme dans le triangle T = (x, y) ∈ R2 : x ≥ 0, y ≥ 0, x + y ≤ 1 . On a vu que la loi de (X, Y )
est continue de densité

p(X,Y ) (x, y) = 2 · 1T (x, y) = 2 · 1x≥0 1y≥0 1x+y≤1 .

Il ne semble pas possible de factoriser 1x+y≤1 sous la forme d’un produit d’une fonction de x et d’une
fonction de y, ce qui suggère que X et Y ne sont pas indépendantes. Mais cela ne fournit pas une
démonstration. Pour le montrer, on va trouver un contre-exemple à la définition de l’indépendance.
Par exemple on peut montrer que

P(X > 1/2, Y > 1/2) 6= P(X > 1/2)P(Y > 1/2).

En effet, on aP(X > 1/2, Y > 1/2) = 0 car X + Y ≤ 1 p.s. mais, d’autre part, P(X > 1/2) > 0
(car la région (x, y) ∈ R2 : x > 1/2, y ≥ 0, x + y ≤ 1 est un triangle d’aire non nulle) et de même
P(Y > 1/2) > 0. Notons qu’on a P(X > 1/2) = P(Y > 1/2) = 1/4 mais qu’on n’a pas besoin de
les calculer précisément pour conclure.

2.3.4 Indépendance de variables aléatoires discrètes


On rappelle ici le critère pour vérifier que des v.a. discrètes sont indépendantes.

Proposition 2.3.18. Soit X1 , . . . , Xn des v.a. à veleurs dans des ensembles finis ou dénombrables
E1 , . . . , En . Si on a

∀x1 ∈ X1 , . . . , xn ∈ Xn , P(X1 = x1 , . . . , Xn = xn ) = P(X1 = x1 ) · · · P(Xn = xn ),

alors X1 , . . . , Xn sont indépendantes.

Notons que la réciproque est clairement vraie en prenant Bi = {xi } dans la définition de
l’indépendance.

34
Démonstration. La v.a. X = (X1 , . . . , Xn ) prend ses valeurs dans E1 ×· · ·×En qui est dénombrable.
Sa loi est donc caractérisée par sa valeur sur les singletons. Soit x = (x1 , . . . , xn ) ∈ E1 × · · · × En .
On a
PX ({x}) = P(X = x) (par définition de la loi)
= P(X1 = x1 , . . . , Xn = xn )
= P(X1 = x1 ) · · · P(Xn = xn ) (par l’hypothèse)
= PX1 ({x1 }) · · · PXn ({xn }) (par définition de la loi)
= (PX1 ⊗ · · · ⊗ PXn )({x}) (car {x} = {x1 } × · · · × {xn }).
Donc P(X1 ,...,Xn ) = PX1 ⊗· · ·⊗PXn et X1 , . . . , Xn sont indépendantes par la Proposition 2.3.10.
Exemple 2.3.19. Considérons de nouveau l’expérience consistant à lancer deux dés à 6 faces
équilibrés. On s’intéresse à la v.a. X qui est la différence absolue entre les dés, i.e. X(i, j) = |i − j|
pour (i, j) ∈ Ω, et la v.a. Y = 1B , où B est l’événement ‘le 1er dé donne un résultat pair’. Montrons
que X et Y sont indépendantes. Notons que X est à valeurs dans {0, 1, 2, 3, 4, 5} et Y à valeurs
dans {0, 1}. On vérifie les égalités suivantes :
3 6 1
P(X = 0, Y = 1) = P({(2, 2), (4, 4), (6, 6)}) = = · = P(X = 0) · P(Y = 1),
36 36 2
5 10 1
P(X = 1, Y = 1) = P({(2, 1), (2, 3), (4, 3), (4, 5), (6, 5)}) = = · = P(X = 1) · P(Y = 1),
36 36 2
4 8 1
P(X = 2, Y = 1) = P({(2, 4), (4, 2), (4, 6), (6, 4)}) = = · = P(X = 2) · P(Y = 1),
36 36 2
et de même P(X = i, Y = 1) = P(X = i) · P(Y = 1) pour i = 3, 4, 5. Notons qu’on n’a pas besoin
de faire le calcul pour P(X = i, Y = 0) : en effet, pour i ∈ {0, . . . , 5}, on vient de montrer que les
événements {X = i} et {Y = 1} sont indépendants, mais donc {X = i} et {Y = 1}c = {Y = 0}
sont aussi indépendants (voir Remarque 2.3.2), donc on a bien
P(X = i, Y = 0) = P(X = i) · P(Y = 0).
On a vérifié les hypothèses de la Proposition 2.3.18 donc X et Y sont indépendantes.

2.3.5 Somme de variables aléatoires indépendantes


Cette section regroupe quelques résultats concernant les sommes de v.a. indépendantes. Le
premier montre que la densité de la somme de deux v.a. continues est la convolution de leur
densité.
Proposition 2.3.20. Soit X et Y des v.a. réelles continues indépendantes. Alors X + Y est
continue et sa densité est pX+Y = pX ∗ pY , i.e.
Z
∀s ∈ R, pX+Y (s) = pX (x)pY (s − x) dx.
R
Démonstration. Soit f : R → R+ mesurable. Comme X et Y sont indépendantes, la loi de (X, Y )
est pX (x)pY (y) dx dy. Ainsi,
Z
E[f (X + Y )] = f (x + y)pX (x)pY (y) dx dy
R2
Z Z 
= pX (x) f (x + y)pY (y) dy dx (Fubini–Tonelli)
R R
Z Z 
= pX (x) f (s)pY (s − x) ds dx (changement s = x + y)
R R
Z Z 
= f (s) pX (x)pY (s − x) dx ds, (Fubini–Tonelli)
R R
ce qui montre le résultat.

35
Un autre outil très utile lorsqu’on travaille avec des sommes de v.a. indépendantes est la fonction
caractéristique.

Méthode (Déterminer la loi d’une somme de v.a. indépendantes). Si X1 , . . . , Xn sont des v.a.
indépendantes, alors leur somme a la fonction caractéristique suivante, pour tout θ ∈ R,
" n # n n
h i Y Y h i Y
iθ(X1 +···+Xn ) iθXk
φX1 +···+Xn (θ) = E e =E e = E eiθXk = φXk (θ),
k=1 k=1 k=1

où, pour la 3ème égalité, on a utilisé l’indépendance et le critère (iv) de la Proposition 2.3.10 (qui
se généralise facilement au cas de fonctions à valeurs complexes). Ainsi la fonction caractéristique
de X1 + · · · + Xn se calcule facilement. Si on arrive à l’identifier avec la fonction caractéristique
d’une loi connue, on peut alors conclure que X1 + · · · + Xn suit cette loi.

Exemple 2.3.21 (Somme de v.a. de Poisson). Soit X1 , . . . , Xn des v.a. indépendantes telles que
Xk suive la loi de Poisson P(λk ). Rappelons que φXk (θ) = exp(λk (eiθ − 1)), on a donc
n n n
! !
Y Y X
iθ iθ
φX1 +···+Xn (θ) = φXk (θ) = exp(λk (e − 1)) = exp λk (e − 1) .
k=1 k=1 k=1
Pn
Donc X1 + · · · + Xn suit la loi de Poisson de paramètre k=1 λk .

Exemple 2.3.22 (Somme de v.a. gaussiennes). Soit X1 , . . . , Xn des v.a. indépendantes telles que
Xk suive la loi gaussienne N (mk , σk2 ). Rappelons que φXk (θ) = exp(imk θ − 21 σk2 θ2 ), on a donc
n n n n
! ! !
1 2 2 1 X
Y Y   X
φX1 +···+Xn (θ) = φXk (θ) = exp imk θ − σk θ = exp i mk θ − σk2 θ2 .
k=1 k=1
2 k=1
2 k=1
Pn Pn 2
Donc X1 + · · · + Xn suit la loi gaussienne N ( k=1 mk , k=1 σk ).

2.3.6 Minimum ou maximum de variables aléatoires indépendantes


Une autre quantité que l’on croise régulièrement est le maximum ou le minimum de v.a. indé-
pendantes. Dans ce cas, l’outil le plus adapté est la fonction de répartition.

Méthode (Déterminer la loi du minimum ou du maximum de v.a. indépendantes). Si X1 , . . . , Xn


sont des variables aléatoires réelles indépendantes, et qu’on s’intéresse à la loi de max(X1 , . . . , Xn )
ou de min(X1 , . . . , Xn ), alors la méthode la plus efficace est de calculer leur fonction de répartition.
En effet, pour a ∈ R, on a

P(max(X1 , . . . , Xn ) ≤ a) = P(X1 ≤ a, . . . , Xn ≤ a) = P(X1 ≤ a) · · · P(Xn ≤ a)

et, en notant que P(min(X1 , . . . , Xn ) ≤ a) = 1 − P(min(X1 , . . . , Xn ) > a),

P(min(X1 , . . . , Xn ) ≤ a) = 1 − P(X1 > a, . . . , Xn > a) = 1 − P(X1 > a) · · · P(Xn > a),

où l’on peut ensuite écrire P(Xk > a) = 1 − P(Xk ≤ a) si l’on veut se ramener à la fonction de
répartition de Xk .

Exemple 2.3.23 (Minimum de v.a. exponentielles). Soit X1 , . . . , Xn des v.a. indépendantes de


lois exponentielles de paramètres λ1 , . . . , λn et Mn = min(X1 , . . . , Xn ). Rappelons que la fonction
de répartition de la loi exponentielle de paramètre λ > 0 est donnée, pour a ≥ 0, par
Z a
F (a) = λe−λx dx = 1 − e−λa
0

36
et, pour a < 0, par F (a) = 0. En procédant comme dans la méthode ci-dessus, on obtient, pour
a ≥ 0,

FMn (a) = P(min(X1 , . . . , Xn ) ≤ a)


= 1 − P(X1 > a) · · · P(Xn > a)
= 1 − (1 − FX1 (a)) · · · (1 − FXn (a))
= 1 − e−λ1 a · · · e−λn a
= 1 − e−(λ1 +···+λn )a

et, pour a < 0, FMn (a) = 0 car Mn > 0 p.s. On reconnaît que FMn est la fonction de répartition
de la loi exponentielle de paramètre λ1 + · · · + λn . Donc Mn suit la loi exponentielle de paramètre
λ1 + · · · + λn .
Cette propriété de la loi exponentielle est très importante. Par exemple, si l’on sait qu’un
atome radioactif se désintègre au bout d’un temps aléatoire de loi exponentielle de paramètre λ
(on peut raisonnablement penser que c’est le cas, car on s’attend à avoir la propriété de perte de
mémoire, voir TD3), alors le temps avant d’observer une désintégration parmi N atomes suit la
loi exponentielle de paramètre N λ.

37
Chapitre 3

Inégalités de concentration et
intervalles de confiance

3.1 Inégalités de concentration


3.1.1 Inégalité de Markov
La première inégalité de ce chapitre est très basique mais aussi très utile. C’est en particulier
la base pour démontrer les autres inégalités présentées dans cette section.

Proposition 3.1.1 (Inégalité de Markov). Soit X une v.a. positive. Alors, pour tout a > 0,

E[X]
P(X ≥ a) ≤ .
a
Démonstration. En distinguant les cas X ≥ a et 0 ≤ X < a, on remarque que 1X≥a ≤ X/a. En
prenant l’espérance de chaque côté, on obtient l’inégalité désirée.

Notons que cette inégalité est inutile si E[X] = ∞ ou si a ≤ E[X]. Elle est aussi optimale au
sens où, pour chaque a > 0 il existe une v.a. X telle qu’il y ait égalité. En effet, en considérant X
qui vaut a avec probabilité p ∈ [0, 1] et 0 sinon, on a E[X] = pa et donc

E[X]
P(X ≥ a) = p = .
a
Dans le cas d’une v.a. réelle X pas forcément positive, on a, pour tout a > 0,

E[|X|]
P(|X| ≥ a) ≤ ,
a
ce qui permet de borner à la fois P(X ≥ a) et P(X ≤ −a).

Remarque 3.1.2. L’inégalité de Markov ne s’utilise pas forcément telle quelle. Il peut être judi-
cieux de l’appliquer à une fonction de X pour obtenir une meilleure décroissance de la queue de
distribution à l’infini. Par exemple, si X est une v.a. positive telle que E[X p ] < ∞ pour un certain
p > 1, on peut écrire
E[X p ]
P(X ≥ a) = P(X p ≥ ap ) ≤ .
ap
Pour a suffisamment grand, cette inégalité sera meilleure que celle obtenue en appliquant directe-
ment l’inégalité de Markov.

38
3.1.2 Inégalité de Bienaymé–Tchebychev
La seconde inégalité de cette section est une conséquence directe de l’inégalité de Markov. Elle
est particulièrement utile pour étudier des sommes de v.a. indépendantes, comme on va le voir.
Proposition 3.1.3 (Inégalité de Bienaymé–Tchebychev). Soit X ∈ L2 (Ω, A, P). Alors, pour tout
a > 0,
Var(X)
P(|X − E[X]| ≥ a) ≤ .
a2
Démonstration. On passe au carré l’inégalité à l’intérieur de la probabilité, puis on applique l’in-
égalité de Markov :
  E[(X − E[X])2 ] Var(X)
P(|X − E[X]| ≥ a) = P (X − E[X])2 ≥ a2 ≤ 2
= ,
a a2
ce qui montre l’inégalité désirée.

Afin d’appliquer l’inégalité de Bienaymé–Tchebychev a des sommes de v.a. indépendantes, on


va tout d’abord montrer ce résultat concernant leur variance.
Proposition 3.1.4 (Variance d’une somme). Soit X1 , . . . , Xn ∈ L2 (Ω, A, P). On a
n n X
n
!
X X
Var Xk = Cov(Xk , X` ).
k=1 k=1 `=1

Si en outre X1 , . . . , Xn sont indépendantes, alors


n n
!
X X
Var Xk = Var(Xk ).
k=1 k=1

Démonstration. Montrons la première identité. On a


 #!2   !2 
n n
! " n n
X X X X
Var Xk = E Xk − E Xk  = E (Xk − E[Xk ]) .
k=1 k=1 k=1 k=1

Puis en développant le carré, on obtient


n
! " n n # n X
n
X XX X
Var Xk =E (Xk − E[Xk ])(X` − E[X` ]) = Cov(Xk , X` ),
k=1 k=1 `=1 k=1 `=1

en sortant les sommes de l’espérance. Si X1 , . . . , Xn sont indépendantes, alors Cov(Xk , X` ) = 0


dès que k 6= ` et donc on obtient la seconde identité (car Cov(Xk , Xk ) = Var(Xk )).

On en déduit l’inégalité de concentration suivante pour des sommes de variables aléatoires


indépendantes et identiquement distribuées (abrégé en i.i.d.), c’est-à-dire indépendantes et ayant
toutes la même loi.
Corollaire 3.1.5 (Bienaymé–Tchebychev pour une somme de v.a. i.i.d.). Soit X1 , . . . , Xn des v.a.
réelles i.i.d. telles que E[X12 ] < ∞. Alors, pour tout ε > 0,
X1 + · · · + Xn Var(X1 )
 
P − E[X1 ] ≥ ε ≤ .
n nε2
Cette inégalité nous montre que, si l’on répète plusieurs fois la même expérience aléatoire,
la moyenne empirique des résultats (X1 + · · · + Xn )/n se concentre autour de la vraie moyenne
E[X1 ]. En effet, pour tout ε > 0, la probabilité que la moyenne empirique soit dans l’intervalle
[E[X1 ] − ε, E[X1 ] + ε] est aussi proche de 1 que l’on veut en choisissant n suffisamment grand.

39
Démonstration. Comme X1 , . . . , Xn sont identiquement distribuées, elles ont les mêmes moments :
en particulier, elles sont toutes dans L2 et, pour tout i ∈ J1, nK, E[Xi ] = E[X1 ] et Var(Xi ) =
Var(X1 ). On pose X = (X1 + · · · + Xn )/n. On a alors
1
E[X] = (E[X1 ] + · · · + E[Xn ]) = E[X1 ],
n
et, par indépendance de X1 , . . . , Xn et la Proposition 3.1.4,
1 1 1
Var(X) = 2
Var(X1 + · · · + Xn ) = 2 (Var(X1 ) + · · · + Var(Xn )) = Var(X1 ).
n n n
En appliquant l’inégalité de Bienaymé–Tchebychev à X, on obtient

X1 + · · · + Xn Var(X) Var(X1 )
   
P − E[X1 ] ≥ ε = P X − E[X] ≥ ε ≤ 2
= ,
n ε nε2
qui est le résultat désiré.

3.1.3 Inégalité de Hoeffding


L’application de l’inégalité de Bienaymé–Tchebychev aux sommes de v.a. i.i.d. vue ci-dessus a
le mérite d’être vraie dès que les v.a. ont un moment d’ordre 2 fini, mais la borne qu’elle donne sur
les probabilités ne décroît pas très vite quand n tend vers l’infini. En général, plus l’on suppose que
les v.a. considérées ont une queue de distribution qui décroît vite, meilleures seront les inégalités
que l’on peut obtenir. On traite ici le meilleur cas possible concernant la queue de distribution,
c’est-à-dire celui de v.a. bornées.
Proposition 3.1.6 (Inégalité de Hoeffding). Soit a < b. Soit X1 , . . . , Xn des v.a. réelles i.i.d. à
valeurs dans [a, b]. Alors, pour tout ε > 0,
!
X1 + · · · + Xn 2ε2 n
 
P − E[X1 ] > ε ≤ 2 exp − .
n (b − a)2

Pour un ε fixé, cette inégalité montre que la probabilité que la moyenne empirique dévie de
plus de ε de la vraie moyenne décroît au moins exponentiellement vite en n. C’est une décroissance
bien plus rapide que celle en 1/n obtenue par l’inégalité de Bienaymé–Tchebychev.
La démonstration de l’inégalité de Hoeffding repose sur une méthode classique en probabilité :
au lieu d’appliquer l’inégalité de Markov à |S| avec S = X1 + · · · + Xn − nE[X1 ] (ou à S 2 comme
on l’a fait pour Bienaymé–Tchebychev), on va l’appliquer à etS pour t ≥ 0 quelconque, puis on
optimisera en t pour obtenir la meilleur borne possible. Afin de majorer E[etS ], nous aurons besoin
du lemme préliminaire suivant.
Lemme 3.1.7. Soit a < b et Y une variable aléatoire à valeur dans [a, b] telle que E[Y ] = 0.
Alors, pour tout t ≥ 0, !
h
tY
i t2 (b − a)2
E e ≤ exp .
8

Démonstration (non vue en cours, donc non requise). Par convexité de la fonction y ∈ [a, b] 7→
Y −a
ety , en écrivant Y = b−Y
b−a a + b−a b, on a

b − Y ta Y − a tb
etY ≤ e + e
b−a b−a
et donc, en passant à l’espérance et en utilisant que E[Y ] = 0,
h i b ta −a tb
E etY ≤ e + e .
b−a b−a

40
b ta −a tb
En notant g(t) = log( b−a e + b−a e ), on veut maintenant montrer que g(t) ≤ 18 t2 (b − a)2 . On
calcule les dérivées :

ab(eta − etb ) (b − a)2 et(a+b)


g 0 (t) = et g 00 (t) = ab .
beta − aetb (beta − aetb )2

Or par formule de Taylor avec reste intégral, on a


Z t
g(t) = g(0) + g 0 (0)t + g 00 (u)u du.
0

Remarquons alors que g(0) = g 0 (0) = 0 et

abeu(a+b) xy
g 00 (u) = (b − a)2 ua ub 2
= −(b − a)2
(be − ae ) (x + y)2

avec x = beua ≥ 0 et y = −aeub ≥ 0 (en effet on a a ≤ 0 ≤ b car E[Y ] = 0). Finalement, on en


déduit que |g 00 (u)| ≤ (b − a)2 /4 et donc

t2 (b − a)2
Z t
|g(t)| = g 00 (u)u du ≤ ,
0 8
ce qui donne le résultat souhaité.

Démonstration de la Proposition 3.1.6. On pose S = X1 + · · · + Xn − nE[X1 ]. Alors, on a

X1 + · · · + Xn
 
P − E[X1 ] > ε = P(|S| > εn) = P(S > εn) + P(S < −εn).
n

Pour majorer P(S > εn), on considère un paramètre t ≥ 0 et on écrit


  E[etS ]
P(S ≥ εn) = P etS ≥ etεn ≤ ,
etεn
par l’inégalité de Markov appliquée à etS . On veut à présent majorer E[etS ]. Pour cela, on pose
Yi = Xi − E[Xi ]. En utilisant que S = Y1 + · · · + Yn , puis l’indépendance de Y1 , . . . , Yn , on obtient
n n
!
h
tS
i Y h
tYi
i Y t2 (b − a)2
E e = E e ≤ exp ,
i=1 i=1
8

en utilisant le Lemme 3.1.7 car E[Yi ] = 0 et Yi est à valeurs dans [a − E[Xi ], b − E[Xi ]]. On a donc
montré que !
t2 (b − a)2
P(S ≥ εn) ≤ exp −tεn + n .
8
Finalement, on cherche le t qui minimise cette expression et c’est t = 4ε/(b − a)2 . En choisissant
ce t, on obtient !
2ε2 n
P(S ≥ εn) ≤ exp − .
(b − a)2
En appliquant ce résultat aux v.a. −X1 , . . . , −Xn , on obtient la même borne pour P(−S ≥ εn) et
ça conclut la démonstration.

41
3.2 Intervalles de confiance
Dans cette section, on va présenter l’application des inégalités de concentration à l’obtention
d’intervalles de confiance en statistique. Soulignons tout d’abord la différence de point de vue entre
la statistique et les probabilités. En probabilités, on suppose connue la loi des variables aléatoires
et on en déduit des résultats sur leurs comportements. En statistique, on observe des réalisations
de variables aléatoires de lois inconnues et on tente d’en déduire des informations sur ces lois.
On se place ici dans le cadre où l’on observe la réalisation de v.a. réelles X1 , . . . , Xn i.i.d. dont
la loi appartient à une certaine famille (Pθ )θ∈Θ (on dit alors que X1 , . . . , Xn est un échantillon de
taille n). L’objectif est d’estimer la valeur du paramètre θ ∈ Θ tel que la loi des Xi soit Pθ . On
suppose pour simplifier que Θ ⊂ R et on se concentre sur le fait d’établir un intervalle de confiance
pour θ : on veut construire un intervalle I(ω) à partir des réalisations X1 (ω), . . . , Xn (ω) tel que
l’on pourra affirmer que l’intervalle aléatoire I contient θ avec probabilité au moins 95% ou 99%.

Définition 3.2.1. Soit α ∈ ]0, 1[. Un intervalle de confiance pour θ de niveau 1 − α est un
intervalle aléatoire I de la forme [F (X1 , . . . , Xn ), G(X1 , . . . , Xn )] avec F, G : Rn → R mesurables
(ne dépendant pas de θ), tel que pour tout θ ∈ Θ, si X1 , . . . , Xn ont loi Pθ , alors

P(θ ∈ I) ≥ 1 − α.

Il est très important que I soit défini à partir de X1 , . . . , Xn sans faire intervenir θ, car on ne
connaît pas θ (sinon on prendrait I = [θ − ε, θ + ε] avec ε aussi petit que l’on veut et on aurait
toujours P(θ ∈ I) = 1). Il faut aussi bien noter que dans l’écriture “θ ∈ I”, c’est I qui est aléatoire
et pas θ. En particulier, il ne faut pas confondre l’intervalle de confiance, qui est aléatoire, et sa
réalisation : ça n’a pas de sens d’écrire P(θ ∈ [0.74, 0.78]) = 0.95 car cette probabilité vaut 0 si
θ∈/ [0.74, 0.78] et 1 si θ ∈ [0.74, 0.78].
Pour un certain niveau α donné, il n’y a pas de choix unique de l’intervalle de confiance mais
on essaie d’en trouver un le plus court possible. En particulier, selon l’inégalité de concentration
utilisée, on obtiendra des résultats différents. Il est également important de noter qu’il y a toujours
un compromis entre le niveau et la longueur : plus on veut un niveau proche de 1, plus l’intervalle
sera long.

Exemple 3.2.2. Considérons un sondage où l’on interroge n individus et chacun répond 1 avec
probabilité θ et 0 avec probabilité 1−θ. On suppose de plus que leurs réponses sont indépendantes.
Cela correspond au cas où Θ = [0, 1], Pθ = B(θ) (la loi de Bernoulli de paramètre θ) et Xi est la
réponse de i-ème individu. Si X1 , . . . , Xn ont loi Pθ , alors E[Xi ] = θ donc on sait que la moyenne
empirique X n = (X1 + · · · + Xn )/n va nous fournir un bon estimateur de la valeur de θ. Il reste à
quantifier cela pour obtenir un intervalle de confiance pour θ de niveau 1−α. On va le faire de deux
manières différentes : avec l’inégalité de Bienaymé–Tchebychev puis avec l’inégalité de Hoeffding.
• Par l’inégalité de Bienaymé–Tchebychev, on a, pour tout ε > 0,
  Var(X1 ) θ(1 − θ)
P |X n − θ| ≥ ε ≤ 2
= ,
nε nε2
où l’on a utilisé que la variance de la loi B(θ) vaut θ(1 − θ). On en déduit que
  θ(1 − θ)
P θ ∈ [X n − ε, X n + ε] ≥ 1 − .
nε2
On veut à présent choisir ε le plus petit possible tel que, pour tout θ ∈ Θ,
s
θ(1 − θ) θ(1 − θ)
1− ≥1−α ⇔ ε≥ .
nε2 nα

42
On rappelle
p que l’intervalle de confiance ne doit pas dépendre de θ donc on ne peut pas choisir
ε = θ(1 − θ)/(nα). On remarque plutôt que θ(1 − θ) ≤ 1/4 pour tout θ ∈ Θ, donc on peut
prendre r
1
ε= ,
4nα
qui satisfait l’inégalité précédente pour tout θ ∈ Θ. Ainsi, l’intervalle
" r r #
1 1
I = Xn − , Xn +
4nα 4nα

est un intervalle de confiance pour θ de niveau 1 − α.


• Si l’on utilise l’inégalité de Hoeffding (car les Xi sont à valeurs dans [0, 1]), on obtient, pour
tout ε > 0,    
P |X n − θ| ≥ ε ≤ 2 exp −2ε2 n
et donc    
P θ ∈ [X n − ε, X n + ε] ≥ 1 − 2 exp −2ε2 n ,

où ici la borne obtenue ne dépend pas de θ. On choisi donc ε tel que 2 exp(−2ε2 n) = α. Cela
donne l’intervalle  s s 
log(2/α) log(2/α) 
I = X n − , Xn + ,
2n 2n

qui est donc aussi un intervalle de confiance pour θ de niveau 1 − α.


On peut à présent comparer la longueur de ces intervalles de confiance pour voir lequel est le
meilleur. Il est intéressant de voir que pour les deux la dépendance en n est la même : leur

longueur décroît en 1/ n. On ne peut pas espérer mieux, car le théorème central limite nous dit

que X n fluctue autour de E[X1 ] à l’ordre 1/ n.
Concernant la dépendance en α, on voit que le premier intervalle est plus court ssi α >
0.2322 . . . Quand α est proche de 0, le second intervalle de confiance est vraiment meilleur :
par exemple pour α = 0.01 et n = 1000, on obtient environ les intervalles
h i h i
X n − 0.16, X n + 0.16 et X n − 0.0026, X n + 0.0026 .

43
Chapitre 4

Convergence de variables aléatoires et


loi des grands nombres

Dans ce chapitre seront présentées trois premières notions de convergence pour des suites de
variables aléatoires : la convergence presque sûre, la convergence dans Lp et la convergence en
probabilité. Les deux premières ont déjà été considérées en théorie de la mesure. En effet, une
suite (Xn )n≥1 de v.a. réelles n’est rien d’autre qu’une suite de fonctions mesurables de (Ω, A) dans
(R, B(R)) et donc on peut transposer les notions de convergences vues pour des suites de fonctions.
Une quatrième notion de convergence sera vue au chapitre suivant : la convergence en loi.

4.1 Suite de variables aléatoires indépendantes


Pour fournir de la matière aux exemples qui seront couverts dans ce chapitre, on a besoin de
généraliser la notion d’indépendance à des suites.
Définition 4.1.1 (Indépendance de suites).
• Soit A1 , A2 , . . . ∈ A. On dit que (Ak )k≥1 est une suite d’événements indépendants si, pour
tout n ≥ 1, A1 , . . . , An sont indépendants.
• Soit X1 , X2 , . . . des v.a. On dit que (Xk )k≥1 est une suite de variables aléatoires indépen-
dantes si, pour tout n ≥ 1, X1 , . . . , Xn sont indépendantes.
Le choix de faire commencer ces suites à k = 1 est bien évidemment arbitraire et la définition
se généralise aisément aux autres cas. Certaines propriétés vues pour un nombre fini d’événements
ou de v.a. indépendants se transfèrent directement aux suites comme conséquence de cette défini-
tion. Par exemple, si (Ak )k≥1 est une suite d’événements indépendants, alors on peut remplacer
n’importe quelle partie de ces événements par leur complémentaires et la suite reste indépendante.
Si (Xk )k≥1 est une suite de v.a. indépendantes, alors :
• Toute sous-suite (Xϕ(k) )k≥1 , avec ϕ : N∗ → N∗ strictement croissante, est une suite de v.a.
indépendantes.
• Pour toutes fonctions fk mesurables, (fk (Xk ))k≥1 est une suite de v.a. indépendantes.
• Toute suite de paquets disjoints de v.a. parmi les Xk est aussi une suite de v.a. indépendantes.
Par exemple, ((X2k−1 , X2k ))k≥1 est une suite de v.a. indépendantes.
Le résultat suivant garantit l’existence d’une suite de variables aléatoires indépendante avec
des lois données. Il nous assure que l’on ne travaille pas avec un objet inexistant dans les exemples.
Théorème 4.1.2 (Existence de suite de v.a. indépendantes). Pour chaque k ≥ 1, soit Pk une loi
sur R. Alors il existe un espace de probabilité (Ω, A, P) et des v.a. réelles X1 , X2 , . . . définies sur
cet espace tels que (Xk )k≥1 soit une suite de variables aléatoires indépendantes et, pour tout k ≥ 1,
Xk ait pour loi Pk .

44
Démonstration (admise). Pour les curieux, vous pouvez consulter le Théorème IV.3.1 dans le livre
de Barbe et Ledoux.

Remarque 4.1.3. Dans le cas d’un nombre fini de variables aléatoires, ce résultat découle du
théorème d’existence des mesures produits (Théorème 2.1.4). En effet, pour construire des v.a.
réelles X1 , . . . , Xn indépendantes et de lois P1 , . . . , Pn , on peut considérer Ω = Rn , A = B(Rn ),
P = P1 ⊗ · · · ⊗ Pn et
Xk : ω = (ω1 , . . . , ωn ) ∈ Rn 7−→ ωk ∈ R.
Alors la fonction X = (X1 , . . . , Xn ) : Rn → Rn est l’identité et donc la loi de X (qui est la mesure
image de P par X) est égale à P = P1 ⊗ · · · ⊗ Pn . Il en découle que X1 , . . . , Xn sont indépendantes
et de lois P1 , . . . , Pn .

Le théorème ci-dessus revient donc à montrer qu’il existe une mesure sur RN qui est la mesure
produit de toutes les lois Pk pour k ∈ N∗ . Cette construction d’un produit infini de mesures est
spécifique aux mesures de probabilité, alors que l’on peut définir le produit fini de mesures dès
qu’elles sont σ-finies. Cela nécessite également de préciser la définition de la tribu produit dont on

munit RN . Nous n’aborderons pas ces détails dans ce cours.
Remarque 4.1.4. Un cas particulier de ce théorème peut être déduit de l’existence de la mesure
de Lebesgue : c’est l’existence d’une suite (Xn )n≥1 de v.a. indépendantes de loi de Bernoulli
de paramètre 1/2. Pour cela, on considère Ω = [0, 1[ muni de A = B([0, 1[) et de P la mesure
de Lebesgue sur [0, 1[, puis, pour ω ∈ Ω, on définit Xk (ω) comme le k-ième coefficient dans le
développement dyadique de ω. Voir le TD6 pour les détails (en particulier, pour certains ω ∈ [0, 1[,
le développement dyadique n’est pas unique et il faut donc préciser comment on le choisit pour
être rigoureux).

4.2 Rappels sur les limites inférieure et supérieure


4.2.1 Limites inférieure et supérieure de réels
Rappelons les définitions et propriétés des limites inférieure et supérieure de réels. Pour (xn )n≥1
une suite de réels, on définit
lim inf xn = lim ↑ inf xk ∈ R,
n→∞ n→∞ k≥n
lim sup xn = lim ↓ sup xk ∈ R,
n→∞ n→∞ k≥n

où R = R ∪ {±∞}. Ces deux limites sont toujours bien définies par monotonie, ce qui permet de
les étudier sans savoir encore que la vraie limite existe (ou même si la vraie limite n’existe pas).
De plus, lim inf n→∞ xn est la plus petite valeur d’adhérence de (xn )n≥1 et lim supn→∞ xn est
la plus grande valeur d’adhérence de (xn )n≥1 . Finalement, la convergence de la suite peut être
caractérisée en termes des limites inférieure et supérieure :
lim xn existe dans R ⇔ lim inf xn = lim sup xn ,
n→∞ n→∞ n→∞

et dans ce cas les trois limites coïncident.

4.2.2 Limites inférieure et supérieure d’ensembles


Soit (An )n≥1 une suite de parties de Ω. Ses limites inférieure et supérieure sont définies ainsi :
[ \
lim inf An = An = {ω ∈ Ω : ω est dans tous les An à partir d’un certain rang},
n→∞
m≥1 n≥m
\ [
lim sup An = An = {ω ∈ Ω : ω appartient à une infinité de An }.
n→∞
m≥1 n≥m

45
Si les An sont des événements (c’est-à-dire appartiennent à la tribu A) alors leurs limites inférieure
et supérieure aussi.
Rappelons que l’on a vu au TD1 les inégalités
   
lim sup P(An ) ≤ P lim sup An et lim inf P(An ) ≥ P lim inf An ,
n→∞ n→∞ n→∞ n→∞

l’une pouvant se déduire de l’autre grâce au fait que (lim supn→∞ An )c = lim inf n→∞ Acn .

4.3 Premières notions de convergence


4.3.1 Convergence presque sûre
La convergence presque sûre est l’équivalent de la convergence presque partout pour les pro-
babilistes.

Définition 4.3.1. Soit X, X1 , X2 , . . . des v.a. réelles. On dit que (Xn )n≥1 converge presque sûre-
ment vers X, que l’on note
p.s.
Xn −−−→ X,
n→∞

si (Xn )n≥1 converge P-presque partout vers X, i.e. si l’événement


n o n o
lim Xn = X = ω ∈ Ω : lim Xn (ω) = X(ω)
n→∞ n→∞

a probabilité 1.

Cette définition repose sur le fait que l’ensemble {limn→∞ Xn = X} est mesurable. Rappelons
que cela ce montre ainsi :
1 1
n o   \ [ \  
lim Xn = X = ∀k ≥ 1, ∃m ≥ 1, ∀n ≥ m, |Xn − X| ≤ = |Xn − X| ≤ ,
n→∞ k k≥1 m≥1 n≥m
k

où chacun des ensembles {|Xn − X| ≤ 1/k} est dans A et donc, par stabilité de A par unions et
intersections dénombrables, on a {limn→∞ Xn = X} ∈ A.
Cela a également un sens de dire “(Xn )n≥1 converge p.s.” sans préciser la limite. En effet,
l’ensemble {(Xn )n≥1 converge} est mesurable : on peut le montrer ainsi, en utilisant la complétude
de R,‘
\  1
\ [ 
{(Xn )n≥1 converge} = {(Xn )n≥1 est de Cauchy} = |Xn − Xm | ≤ ,
k≥1 `≥1 m,n≥`
k

dont on déduit que {(Xn )n≥1 converge} ∈ A.

Exemple 4.3.2. Soit U une v.a. uniforme dans [0, 1]. On a


p.s.
U n −−−→ 0.
n→∞

En effet, on a U ∈ [0, 1[ p.s. et, pour tout ω ∈ {U ∈ [0, 1[}, on a U (ω)n → 0.

La convergence p.s. satisfait les mêmes propriétés de stabilité par opérations que la convergence
de suites de réels. Par exemple, si (Xn )n≥1 et (Yn )n≥1 sont des suites de v.a. réelles convergeant
p.s. vers X et Y respectivement, alors
p.s. p.s. p.s.
Xn + Yn −−−→ X + Y, Xn − Yn −−−→ X − Y et Xn Yn −−−→ XY.
n→∞ n→∞ n→∞

46
En effet, il suffit de considérer ω ∈ {limn→∞ Xn = X} ∩ {limn→∞ Yn = Y }, qui est un événement
de probabilité 1, puis d’appliquer les résultats connus pour les suites de réels Xn (ω) et Yn (ω). Si
on a en outre P(Y = 0) = 0, alors
p.s.
Xn /Yn −−−→ X/Y,
n→∞

en considérant ω ∈ {limn→∞ Xn = X} ∩ {limn→∞ Yn = Y } ∩ {Y 6= 0}, qui est aussi un événement


de probabilité 1 car Y 6= 0 p.s. Mentionnons finalement que, si f : R → R est continue, alors on a
p.s.
f (Xn ) −−−→ f (X).
n→∞

4.3.2 Convergence Lp
Soit p ∈ [1, ∞[. Rappelons que, pour X une v.a. réelle, on définit kXkp = E[|X|p ]1/p . L’espace
Lp (Ω, A, P), que l’on abrégera en Lp quand il n’y a pas d’ambiguité possible, est l’ensemble des
v.a. réelles X telles que kXkp < ∞, que l’on quotiente par la relation d’équivalence “être égal p.s.”.
En outre, k·kp définit bien une norme sur Lp et donc naturellement d’une notion de convergence.

Définition 4.3.3. Soit p ∈ [1, ∞[. Soit X, X1 , X2 , · · · ∈ Lp . On dit que (Xn )n≥1 converge dans Lp
vers X, que l’on note
Lp
Xn −−−→ X,
n→∞

si kXn − Xkp → 0 quand n → ∞, i.e. si E[|Xn − X|p ] → 0 quand n → ∞.

Remarque 4.3.4. Soit p ∈ [1, ∞[. On rappelle que si (Xn )n≥1 converge dans Lp vers X, alors

kXn kp −−−→ kXkp .


n→∞

De plus, si p est un entier (de sorte que xp ait un sens pour tout x ∈ R), alors

E[Xnp ] −−−→ E[X p ].


n→∞

Méthode (Montrer une convergence dans Lp ). Voici quelques approches possibles pour montrer
qu’une suite (Xn )n≥1 converge dans Lp vers X :
• À partir d’autres convergences dans Lp , en utilisant les inégalités de Minkowski et d’Hölder
(voir par exemple l’exercice 1 du TD8).
• En calculant directement E[|Xn − X|p ] pour montrer qu’elle tend vers zéro. On peut le faire
si l’on connaît la loi explicitement. Un autre cas important est celui où p = 2 et Xn est une
somme de v.a. indépendantes : on utilise alors le fait que la variance d’une somme de v.a.
indépendantes est égale à la somme des variances.
• Si l’on sait que (Xn )n≥1 converge p.s. vers X, on peut appliquer le théorème de convergence
dominée pour en déduire une convergence dans Lp (si l’on arrive à justifier la domination !).

Exemple 4.3.5. Soit U une v.a. uniforme dans [0, 1]. On a vu à l’Exemple 4.3.2 que (U n )n≥0
converge p.s. vers 0. En outre, on a |(U n )p | ≤ 1 p.s. et E[1] < ∞. Donc, par le théorème de
convergence dominée,
E[|U n − 0|p ] = E[(U n )p ] −−−→ 0.
n→∞

Donc (U n )
n≥0 converge dans Lp
vers 0, pour tout p ≥ 1.
On peut également montrer cette convergence par calcul direct : on a
Z 1
n p np 1
E[|U − 0| ] = E[(U ]= xnp dx = −−−→ 0,
0 np + 1 n→∞

ce qui montre que (U n )n≥0 converge dans Lp vers 0.

47
On omet dans ce cours le cas de la convergence L∞ , qui est la convergence pour la norme k·k∞ ,
dont la définition est rappelée en Section 1.3.2. En effet, cette convergence est rarement utilisée
pour des variables aléatoires.
On a déjà vu que si 1 ≤ p < q < ∞, alors Lq ⊂ Lp (voir Proposition 1.3.13). De la même
manière il est plus fort de converger dans Lq que dans Lp , comme montré dans le résultat suivant.
Proposition 4.3.6. Soit X, X1 , X2 , · · · ∈ Lq . Soit 1 ≤ p < q < ∞. Si (Xn )n≥1 converge dans Lq
vers X, alors (Xn )n≥1 converge dans Lp vers X.
Démonstration. On applique l’inégalité de Hölder aux v.a. |Xn − X|p et 1 avec p0 = q/p > 1 et q 0
tel que p10 + q10 = 1 :
h 0
i1/p0 h 0
i
E[|Xn − X|p ] = E[|Xn − X|p · 1] ≤ E (|Xn − X|p )p E (1)q = E[|Xn − X|q ]p/q .

Comme E[|Xn − X|q ] → 0, on en déduit que E[|Xn − X|p ] → 0 et donc que (Xn )n≥1 converge dans
Lp vers X.

Concernant la stabilité par opérations de la convergence Lp , tout ne marche pas aussi bien que
pour la convergence p.s. On a la stabilité par combinaison linéaire qui découle directement du fait
que l’on considère une convergence par rapport à une norme : si (Xn )n≥1 et (Yn )n≥1 sont des suites
de v.a. réelles convergeant dans Lp vers X et Y respectivement et si a, b ∈ R, alors
Lp
aXn + bYn −−−→ aX + bY,
n→∞

Mais pour le produit c’est plus compliqué : les v.a. Xn Yn n’appartiennent pas forcément à Lp (et
même si c’est le cas elles ne convergent pas forcément dans Lp ). De même, il n’y a pas non plus
forcément stabilité par composition par une fonction continue f générale : en effet, f (Xn ) n’est
pas forcément dans Lp (par exemple avec f (x) = x2 ). Cependant, certains résultats de stabilité
pour le produit et la composition sont vrais avec des hypothèses appropriées (voir l’exercice 1 du
TD8).
Remarque 4.3.7. Rappelons que Lp muni de k·kp est complet (ce qui en fait un espace de Banach).
Cela signifie que si une suite (Xn )n≥1 de v.a. dans Lp est de Cauchy, i.e.

∀ε > 0, ∃n0 ≥ 1, ∀n > m ≥ n0 , kXn − Xm kp ≤ ε,

alors il existe X ∈ Lp telle que (Xn )n≥1 converge dans Lp vers X. Utiliser la complétude est utile
pour montrer qu’une suite converge sans en connaître la limite. C’est par exemple souvent le cas
pour des séries, voir ci-dessous.
Exemple 4.3.8. Soit (Yk )k≥1 une suite de v.a. indépendantes dans L2 telles que
X
E[Yk ] = 0 et E[Yk2 ] < ∞.
k≥1

converge dans L2 , c’est-à-dire que la suite des sommes partielles


P
On va montrer que la série k≥1 Yk

n
X
Xn := Yk
k=1

converge dans L2 . Pour cela, on va vérifier que (Xn )n≥1 est de Cauchy dans L2 . Soit n > m ≥
n0 ≥ 1. On a

n
!2  n
! n n
Xm k22
X X X X
kXn − = E Yk  = Var Yk = Var(Yk ) = E[Yk2 ],
k=m+1 k=m+1 k=m+1 k=m+1

48
où l’on utilise que E[Yk ] = 0 (pour passer du moment d’ordre 2 à la variance et vice versa), et
l’indépendance des Yk à la 3ème égalité (pour appliquer la Proposition 3.1.4). Soit ε > 0. Comme
la série k≥1 E[Yk2 ] est convergente, son reste tend vers 0 donc il existe n0 ≥ 1 tel que
P

X
E[Yk2 ] ≤ ε.
k≥n0

Alors, par le calcul précédent, on voit que pour tout n > m ≥ n0 , on a kXn − Xm k22 ≤ ε. Cela
montre que (Xn )n≥1 est de Cauchy dans L2 et donc convergente par complétude.

4.3.3 Convergence en probabilité


La nouvelle notion de convergence vue dans ce chapitre est la suivante.
Définition 4.3.9. Soit X, X1 , X2 , . . . des v.a. réelles. On dit que (Xn )n≥1 converge en probabilité
vers X, que l’on note
P
Xn −−−→ X,
n→∞

si, pour tout ε > 0, P(|Xn − X| > ε) → 0 quand n → ∞.


Exemple 4.3.10 (Loi faible des grands nombres). Soit (Xk )k≥1 une suite de v.a. réelles i.i.d. telles
que E[X12 ] < ∞. Alors
X1 + · · · + Xn P
−−−→ E[X1 ].
n n→∞

En effet, pour tout ε > 0, par l’inégalité de Bienaymé–Chebychev, on a


X1 + · · · + Xn Var(X1 )
 
P − E[X1 ] ≥ ε ≤ −−−→ 0,
n nε2 n→∞

ce qui montre la convergence en probabilité énoncée ci-dessus. C’est ce qu’on appelle la loi faible
des grands nombres, en opposition à la loi forte que l’on verra plus loin dans ce chapitre. La loi
forte a une hypothèse plus faible et une conclusion plus forte, c’est donc un résultat strictement
meilleur, mais sa preuve est aussi (beaucoup) plus compliquée.
Proposition 4.3.11. Une limite en probabilité est unique à égalité p.s. près. Autrement dit, si
une suite de v.a. réelles (Xn )n≥1 converge en probabilité à la fois vers X et vers Y , alors X = Y
p.s.
Démonstration. Soit ε > 0. Si |X − Y | > ε, alors on a nécessairement |Xn − X| > ε/2 ou
|Xn − Y | > ε/2 (par inégalité triangulaire). Donc, on a

P(|X − Y | > ε) ≤ P(|Xn − X| > ε/2) + P(|Xn − Y | > ε/2) −−−→ 0,


n→∞

car (Xn )n≥1 converge en probabilité vers X et vers Y . On en déduit que P(|X − Y | > ε) = 0. On
a alors  
[  1 1
  
P(X 6= Y ) = P ↑ |X − Y | >  = lim ↑ P |X − Y | > = 0,
n≥1
n n→∞ n

ce qui montre que X = Y p.s.

La convergence en probabilité satisfait les mêmes propriétés de stabilité par transformation que
la convergence p.s., comme énoncé dans le résultat suivant.
Proposition 4.3.12. Soit (Xn )n≥1 et (Yn )n≥1 des suites de v.a. réelles convergeant en probabilité
vers X et Y respectivement. Alors, on a les convergences suivantes :
P P P
• Xn + Yn −−−→ X + Y, Xn − Yn −−−→ X − Y et Xn Yn −−−→ XY ;
n→∞ n→∞ n→∞

49
P
• Si P(Y = 0) = 0, alors Xn /Yn −−−→ X/Y ;
n→∞
P
• Si f : R → R est continue, alors f (Xn ) −−−→ f (X).
n→∞

Démonstration. Voir le TD9 pour une démonstration à partir de la définition de la convergence


en probabilité. Une autre démonstration (plus courte) sera donnée plus loin en s’appuyant sur une
caractérisation de la convergence en probabilité.

4.3.4 Liens entre les notions


La convergence en probabilité est la plus faible des trois notions de convergence introduites
plus haut : comme montré dans les deux prochaines propositions, la convergence en probabilité est
impliqué par la convergence p.s. ou par la convergence dans Lp .

Proposition 4.3.13. Soit (Xn )n≥1 une suite de v.a. réelles convergeant p.s. vers une v.a. réelle
X. Alors (Xn )n≥1 converge en probabilité vers X.

Démonstration. Soit ε > 0. On a


n o [ \
lim Xn = X ⊂ {|Xn − X| ≤ ε} = lim inf {|Xn − X| ≤ ε}.
n→∞ n→∞
m≥1 n≥m

Comme (Xn )n≥1 converge p.s. vers X, l’événement de gauche a probabilité 1 et donc celui de droite
aussi. Donc son complémentaire a probabilité nulle :
 
  \ [
P lim sup{|Xn − X| > ε} = P {|Xn − X| > ε} = 0.
n→∞
m≥1 n≥m

On a vu en Section 4.2.2 que lim supn→∞ P(An ) ≤ P(lim supn→∞ An ) pour toute suite d’événements
(An )n≥1 . Donc
lim sup P(|Xn − X| > ε) = 0.
n→∞

Comme P(|Xn − X| > ε) ≥ 0, cela montre que P(|Xn − X| > ε) → 0 quand n → ∞. Donc (Xn )n≥1
converge en probabilité vers X.

Proposition 4.3.14. Soit p ≥ 1. Soit (Xn )n≥1 une suite de v.a. réelles convergeant dans Lp vers
une v.a. réelle X. Alors (Xn )n≥1 converge en probabilité vers X.

Démonstration. Par la Proposition 4.3.6, on sait que (Xn )n≥1 converge dans L1 vers X. Donc
E[|Xn − X|] → 0 quand n → ∞. Soit ε > 0. Par l’inégalité de Markov, on a

E[|Xn − X|]
P(|Xn − X| > ε) ≤ −−−→ 0.
ε n→∞

Donc (Xn )n≥1 converge en probabilité vers X.

On peut en déduire qu’une suite de v.a. réelles ne peut pas avoir deux limites différentes pour
deux notions de convergence (à égalité p.s. près).

Corollaire 4.3.15. Soit (Xn )n≥1 une suite de v.a. réelles convergeant vers une v.a. réelle X pour
la convergence p.s. ou Lp ou en probabilité. Supposons que (Xn )n≥1 converge aussi vers une v.a.
réelle Y pour la convergence p.s. ou Lp ou en probabilité (pas forcément pour la même notion).
Alors X = Y p.s.

Démonstration. Par les deux propositions précédentes, on sait que (Xn )n≥1 converge en probabilité
vers X et vers Y . Donc par la Proposition 4.3.11, on a X = Y p.s.

50
On va montrer dans les exemples suivants qu’il n’y a pas d’autre implication vraie en général
entre ces notions de convergence.
Exemple 4.3.16. Soit U une v.a. uniforme dans [0, 1]. Comme U ∈ [0, 1[ p.s., on a
p.s.
nU n −−−→ 0.
n→∞

Mais, d’autre part,


Z 1
n
E[|nU n − 0|] = E[nU n ] = nxn dx = −−−→ 1.
0 n + 1 n→∞
Donc (nU n )n≥1 ne converge dans L1 pas vers 0 et donc pas non plus dans Lp pour p > 1. Cela
montre que la convergence p.s. n’implique pas la convergence L1 (ni Lp ). En particulier, la conver-
gence en probabilité n’implique pas la convergence L1 (car on a vu que la convergence p.s. est plus
forte que la convergence en probabilité).
Exemple 4.3.17. On considère Ω = [0, 1] muni de A = B([0, 1]) et de P la mesure de Lebesgue.
Soit n ≥ 1. Soit k l’unique entier tel que 2k ≤ n < 2k+1 . On définit Xn comme l’indicatrice de
l’intervalle " #
n − 2k n − 2k + 1
In = , .
2k 2k
On a X1 = 1[0,1] , X2 = 1[0,1/2] , X3 = 1[1/2,1] , X4 = 1[0,1/4] , X5 = 1[1/4,1/2] , et ainsi de suite. Notons
que la longueur de In est 2−k < 2/n, avec l’entier k introduit ci-dessus. Donc, pour p ≥ 1, on a
2
E[|Xn − 0|p ] = E[1In ] = P(In ) < −−−→ 0.
n n→∞
Cela montre que (Xn )n≥1 converge dans Lp vers 0, pour tout p ≥ 1. D’autre part, pour ω ∈ [0, 1]
fixé, on a à la fois ω ∈ In pour une infinité de n et aussi ω ∈
/ In pour une infinité de n. Donc

lim inf Xn (ω) = 0 et lim sup Xn (ω) = 1.


n→∞ n→∞

Cela montre que (Xn (ω))n≥1 ne converge pour aucun ω ∈ Ω. En particulier, (Xn )n≥1 ne converge
pas pour la convergence p.s. On a donc montré que, pour tout p ∈ [1, ∞[, la convergence Lp
n’implique pas la convergence p.s.

4.4 Lemmes de Borel–Cantelli et applications


4.4.1 Lemmes de Borel–Cantelli
Les lemmes de Borel–Cantelli fournissent des critères pour montrer que la limite supérieure
d’une suite d’événements a probabilité 0 (premier lemme) ou 1 (deuxième lemme).
Lemme 4.4.1 (Lemme de Borel–Cantelli). Soit (An )n≥1 une suite d’événements. Si
X
P(An ) < ∞,
n≥1

alors  
P lim sup An = 0.
n→∞

Rappelons qu’on a vu en Section 4.2.2 que lim supn→∞ P(An ) ≤ P(lim supn→∞ An ), donc en
particulier P(lim supn→∞ An ) = 0 implique que P(An ) → 0 quand n → ∞. Le lemme de Borel–
Cantelli fournit un contrôle dans l’autre sens : si P(An ) tend suffisamment vite vers 0 pour être
sommable, alors P(lim supn→∞ An ) = 0.

51
Démonstration. Par définition de la limsup ensembliste, on a
  ! !
\ [ [ X
P lim sup An = P ↓ An = lim ↓ P An ≤ lim ↓ P(An ) = 0,
n→∞ m→∞ m→∞
m≥1 n≥m n≥m n≥m
P
car comme la série n≥1 P(An ) est convergente, son reste tend vers 0.

Exemple 4.4.2 (Retours en 0 de la marche aléatoire simple asymétrique). Soit (Xn )n≥1 une suite
de v.a. indépendantes avec la loi suivante :

P(Xn = 1) = p et P(Xn = −1) = 1 − p,

pour p ∈ [0, 1]. On pose S0 := 0 et, pour n ≥ 1,


n
X
Sn := Xk .
k=1

La suite de v.a. (Sn )n≥0 est appelée marche aléatoire simple. On suppose que p 6= 1/2 (c’est le cas
asymétrique). On va montrer que, presque sûrement, la marche (Sn )n≥0 ne passe qu’un nombre
fini de fois en 0.
Pour n ≥ 0, on pose An := {Sn = 0}, de sorte que lim supn→∞ An soit l’événement “(Sn )n≥0
passe une infinité de fois en 0”. D’après le lemme de Borel-Cantelli, il suffit de montrer que la série
P
n≥0 P(An ) converge pour obtenir le résultat voulu. Calculons donc P(An ) :
• Cas n impair. On montre facilement par récurrence que Sn a la même parité que n. Donc, si
n est impair, alors Sn est impair et donc ne peut pas être nul. On a donc P(An ) = 0.
• Cas n pair. Si n est pair, on l’écrit n = 2m avec m ∈ N. Soit N le nombre de Xk égaux à 1
pour k ∈ J1, 2mK. Alors on a S2m = 0 si et seulement si N = m, et donc
!
2m m
P(An ) = P(S2m = 0) = P(N = m) = p (1 − p)m ,
m

en remarquant que N suit la loi binomiale de paramètre (2m, p).


Par ce qui précède, on obtient donc
X X
P(An ) = P(A2m ) < ∞,
n≥0 m≥0

(2m+1)(2m+2)
car P(A2m+2 )/P(A2m ) = (m+1)2
p(1 − p) → 4p(1 − p) quand m → ∞ et 4p(1 − p) < 1 puisque
p 6= 1/2.

Sn

52
On peut se demander si la condition n≥1 P(An ) < ∞ est une condition nécessaire pour avoir
P

P(lim supn→∞ An ) = 0. En général, la réponse est non, mais le lemme suivant montre que c’est le
cas pour une suite d’événements indépendants.
Lemme 4.4.3 (Second lemme de Borel–Cantelli). Soit (An )n≥1 une suite d’événements. Si
X
P(An ) = ∞
n≥1

et si les événements de la suite (An )n≥1 sont indépendants, alors


 
P lim sup An = 1.
n→∞
Démonstration. Par définition de la limsup ensembliste, on a
  ! ! !
\ [ [ \
P lim sup An = P ↓ An = lim ↓ P An = 1 − lim ↑ P Acn .
n→∞ m→∞ m→∞
m≥1 n≥m n≥m n≥m

Mais, pour tout m ≥ 1, on a


N N
! ! !
\ \ \ \
P Acn =P ↓ Acn = lim ↓ P Acn
N →∞
n≥m N ≥m n=m n=m

Pour N ≥ m, en utilisant que Acm , . . . , AcN sont indépendants, on obtient


N N N N
! !
\ Y Y X
P Acn = P(Acn ) = (1 − P(An )) ≤ exp − P(An )
n=m n=m n=m n=m

où l’on a utilisé que 1 − x ≤ e−x pour tout x ∈ R. Mais comme = ∞, on a


P
n≥1 P(An )
PN
n=m P(An ) → ∞ quand N → ∞ et donc
N
! !
\ X
P Acn ≤ lim exp − P(An ) = 0.
N →∞
n≥m n=m

En revenant à la première équation de la démonstration, cela montre le résultat désiré.


Exemple 4.4.4. Soit (Xn )n≥1 une suite de v.a. indépendantes de loi de Bernoulli de paramètre
p ∈ ]0, 1]. On veut montrer que, presque sûrement, elle contient une infinité de fois quatre 1 d’affilée.
Pour cela, on considère les événements
Ak = {X4k+1 = X4k+2 = X4k+3 = X4k+4 = 1}
pour k ∈ N. Par regroupement par paquets, la suite des v.a. (X4k+1 , X4k+2 , X4k+3 , X4k+4 ) pour
k ∈ N est indépendante et donc les événements Ak pour k ∈ N le sont aussi. De plus, P(Ak ) = p4 > 0
pour tout k ∈ N, donc X
P(Ak ) = ∞.
k≥0
Par le 2nd lemme de Borel–Cantelli, on en déduit que
 
P lim sup An = 1,
n→∞
ce qui signifie que, p.s., pour une infinité de k, on a X4k+1 = X4k+2 = X4k+3 = X4k+4 = 1.
Notons que les événements Ak ne comptabilisent pas toutes les séquences de quatre 1 d’affilée
mais seulement celles commençant à un indice de la forme 4k + 1. On aurait pu être tenté de
considérer les événements
Bk = {Xk+1 = Xk+2 = Xk+3 = Xk+4 = 1},
qui comptabilisent toutes les séquences de quatre 1 d’affilée. Mais ces événements ne sont pas
indépendants : par exemple B0 et B1 dépendent tous les deux du résultat de X2 .

53
4.4.2 Application à la convergence p.s.
On utilise souvent le premier lemme de Borel–Cantelli pour montrer des convergences p.s., par
exemple à travers le critère suivant.
Proposition 4.4.5. Soit X, X1 , X2 , . . . des v.a. réelles. Supposons que, pour tout ε > 0, on ait
X
P(|Xn − X| > ε) < ∞.
n≥1

Alors (Xn )n≥1 converge p.s. vers X.


Il est intéressant de comparer ce critère à la définition de la convergence en probabilité. Pour
montrer que (Xn )n≥1 converge en probabilité vers X, il suffit de vérifier que P(|Xn − X| > ε) → 0
pour tout ε > 0. Pour montrer une convergence p.s., ce critère nous dit qu’il suffit de vérifier que
P(|Xn − X| > ε) tend suffisamment vite vers 0 pour être sommable.

Démonstration. Soit ε > 0. Comme n≥1 P(|Xn − X| > ε) < ∞, par le lemme de Borel–Cantelli,
P

on a  
P lim sup {|Xn − X| > ε} = 0
n→∞
et donc p.s. il n’y a qu’un nombre fini de n tel que |Xn − X| > ε. Autrement dit, en prenant
ε = 1/k avec k ∈ N∗ , on a montré que

∀k ∈ N∗ , p.s., pour tout n à partir d’un certain rang, |Xn − X| ≤ 1/k.

Mais on peut échanger le “pour tout k ∈ N∗ ” avec le “p.s.” (car N∗ est dénombrable, voir la
remarque ci-dessous), donc on a

p.s., ∀k ∈ N∗ , pour tout n à partir d’un certain rang, |Xn − X| ≤ 1/k.

Mais cela signifie exactement que, p.s., Xn converge vers X.

Remarque 4.4.6. On a utilisé dans la démonstration le fait important suivant : dans une propo-
sition, on peut échanger un “p.s.” avec un “pour tout”, si ce “pour tout” porte sur un ensemble au
plus dénombrable : si (Ak )k≥1 est une suite d’événements alors

∀k ≥ 1, p.s., Ak a lieu ⇔ p.s., ∀k ≥ 1, Ak a lieu.

En d’autres termes, si P(Ak ) = 1 pour tout k ≥ 1, alors on a P(


T
k≥1 Ak ) = 1. En effet, on peut
vérifier que   !c !
\ [ X
P Ak =P Ack ≤ P(Ack ) = 0.
k≥1 k≥1 k≥1

Exemple 4.4.7 (Loi forte des grands nombres pour des v.a. bornées). Soit X1 , . . . , Xn des v.a.
réelles i.i.d. à valeurs dans un intervalle borné [a, b]. Montrons que
X1 + · · · + Xn p.s.
−−−→ E[X1 ].
n n→∞

Pour cela, on vérifie le critère de la proposition précédente : pour ε > 0, on a, par l’inégalité de
Hoeffding, !
X1 + · · · + Xn 2ε2 n
 
P − E[X1 ] > ε ≤ 2 exp − ,
n (b − a)2
qui est bien sommable en n. Notons que, pour des v.a. dans L2 , l’inégalité de Bienaymé–Chebychev
donne une borne qui décroît en 1/n et qui n’est donc pas sommable. On ne peut donc pas montrer
simplement qu’il y a convergence p.s. dans ce cas, mais c’est vrai comme nous le verrons dans en
Section 4.5.

54
Le second lemme de Borel–Cantelli peut (parfois) permettre de montrer qu’une suite (Xn )n≥1
de v.a. réelles n’est pas p.s. convergente, voire qu’elle est p.s. pas convergente 1 . Une stratégie pour
cela consiste à montrer que les limites inférieures et supérieures de la suite ne sont pas p.s. égales,
voire sont p.s. différentes.

Exemple 4.4.8. Soit (Yn )n≥1 une suite de v.a. indépendantes de loi exponentielle de paramètre 1.
Pour n ≥ 2, on pose Xn = Yn / log n. On va montrer que, pour tout p ∈ [1, ∞[,
Lp
Xn −−−→ 0,
n→∞

mais qu’il n’y a pas convergence p.s. Cela fournit un exemple plus probabiliste que celui vu à
l’Exemple 4.3.17, du fait que la convergence Lp n’implique pas la convergence p.s.
Soit p ∈ [1, ∞[. Comme Yn et Y1 ont la même loi, on a

E[|Yn |p ] E[|Y1 |p ]
E[|Xn − 0|p ] = = −−−→ 0,
(log n)p (log n)p n→∞

car E[|Y1 |p ] = 0∞ xp e−x dx < ∞. Cela montre la convergence dans Lp (et donc aussi en probabilité).
R

À présent on va montrer qu’il n’y a pas convergence p.s. en vérifiant que

lim sup Xn ≥ 1 p.s. et lim inf Xn ≤ 0 p.s.


n→∞ n→∞

Commençons par étudier la limite supérieure. Comme Yn suit une loi exponentielle de paramètre
1, on a, pour tout a ≥ 0, P(Yn ≥ a) = a∞ e−x dx = e−a donc
R

1
P(Xn ≥ 1) = P(Yn ≥ log n) = e− log n = .
n
Donc n≥1 P(Xn ≥ 1) = ∞ et, comme les événements {Xn ≥ 1} pour n ≥ 1 sont indépendants,
P

le second lemme de Borel–Cantelli nous dit que


 
P lim sup {Xn ≥ 1} = 1.
n→∞

Autrement dit : p.s., il existe une infinité de n tels que Xn ≥ 1. Mais si pour un certain ω ∈ Ω, la
suite Xn (ω) prend une infinité de valeurs supérieure à 1, alors

lim sup Xn (ω) = lim sup Xn (ω) ≥ 1.


n→∞ m→∞ n≥m

Ainsi, on a montré que


lim sup Xn ≥ 1 p.s.
n→∞

Étudions à présent la limite inférieure. On ne peut pas montrer que p.s. il existe une infinité de
n tels que Xn ≤ 0, car P(Xn ≤ 0) = P(Yn ≤ 0) = 0. On considère donc d’abord ε > 0 et on va
montrer que la limite inférieure de Xn est plus petite que ε p.s. Pour cela, on remarque que

P(Xn ≤ ε) = 1 − P(Yn > ε log n) = 1 − e−ε log n = 1 − n−ε −−−→ 1.


n→∞

Donc n≥1 P(Xn ≤ ε) = ∞ et, comme les événements {Xn ≤ ε} sont indépendants, le second
P

lemme de Borel–Cantelli nous donne


 
P lim sup {Xn ≤ ε} = 1.
n→∞

1. La négation d’un presque sûr peut toujours être ambigu. Ici on dit que (Xn )n≥1 n’est pas p.s. convergente si
P(limn→∞ Xn existe) < 1. On dit qu’elle est p.s. pas convergente si P(limn→∞ Xn existe) = 0.

55
Donc p.s., il existe une infinité de n tels que Xn ≤ ε, ce qui implique que la limite inférieure est
plus petite que ε. Ainsi on a montré que

∀ε > 0, p.s., lim inf Xn ≤ ε.


n→∞

On a envie d’échanger le “∀ε > 0” avec le “p.s.” pour pouvoir conclure. Pour cela on le transforme en
une “pour tout” dénombrable : on a ∀k ∈ N∗ , p.s., lim inf n→∞ Xn ≤ 1/k. On peut alors échanger
(voir Remarque 4.4.6) : on a p.s., ∀k ∈ N∗ , lim inf n→∞ Xn ≤ 1/k. Mais, pour ω ∈ Ω fixé, on a
1
∀k ∈ N∗ , lim inf Xn (ω) ≤ ⇒ lim inf Xn (ω) ≤ 0.
n→∞ k n→∞

On a donc montré que


lim inf Xn ≤ 0 p.s.
n→∞

Ainsi, p.s. les limites inférieure et supérieure de (Xn )n≥2 sont différentes, on en conclut donc que
p.s. (Xn )n≥2 ne converge pas.

Xn

0 n

Notons qu’on peut transformer les inégalités sur les limites supérieures et inférieures en égalités
et montrer que
lim sup Xn = 1 p.s. et lim inf Xn = 0 p.s.
n→∞ n→∞

Pour la limite inférieure, c’est facile, on sait que pour tout n ≥ 2, p.s. Xn ≥ 0 donc p.s., pour tout
n ≥ 2, Xn ≥ 0 et donc p.s. lim inf n→∞ Xn ≥ 0. Pour la limite supérieure, cela nécessite un peu
plus de travail. On fixe ε > 0 et on remarque que P(Xn ≥ 1 + ε) = n−1−ε est sommable en n.
Par le 1er lemme de Borel–Cantelli, on en déduit que p.s., il n’y a qu’un nombre fini de n tels que
Xn ≥ 1 + ε. Cela implique que
lim sup Xn ≤ 1 + ε p.s.
n→∞

En remplaçant ε par 1/k pour k ∈ N∗ ,


puis en échangeant le “pour tout” et le “p.s.” on en déduit :
p.s., ∀k ≥ 1, lim supn→∞ Xn ≤ 1 + 1/k. On en conclut que lim supn→∞ Xn ≤ 1 p.s.
Commentons intuitivement ce qu’il se passe, pour comprendre la différence entre convergence
en probabilité et convergence p.s. La convergence en probabilité vers 0 signifie que pour n grand
il est de plus en plus probable que Xn soit proche de 0 : une grande majorité des réalisations ω
sont telles que |Xn (ω)| ≤ ε. Mais ce ne sont pas forcément les mêmes ω pour Xn et pour Xn+1
puisqu’elles sont indépendantes. Au contraire, la convergence p.s. vers 0 signifierait que, si l’on fixe
ω dans un certain événement de probabilité 1, on a convergence de Xn (ω) vers 0, donc |Xn (ω)| ≤ ε
pour tous les n à partir d’un certain rang. Ici ce n’est pas le cas : pour un ω fixé, même si la grande
majorité des Xn (ω) sont proches de 0, il y en a quand même une infinité qui sont plus grand que 1
(pour des n de plus en plus espacés, mais pour une infinité de n quand même). Voir la figure pour
une illustration.

56
Remarque 4.4.9. Il est important de ne pas mélanger limites supérieures de suites et ensemblistes.
L’événement lim supn→∞ {Xn ≥ a} n’est pas égal à {lim supn→∞ Xn ≥ a} (mais pas loin) et
l’événement lim supn→∞ {Xn ≤ a} n’est pas égal à {lim supn→∞ Xn ≤ a} (alors là pas du tout).
De même avec les limites inférieures. Voir l’exercice 4 du TD8 pour les détails.

4.4.3 Une caractérisation de la convergence en probabilité (bonus)


Cette section ne sera pas traitée en cours et n’est donc pas à connaître pour les examens. On y
présente la caractérisation suivante de la convergence en probabilité en terme de convergence p.s.
ainsi qu’une application.
Rappelons que pour une suite (xn )n≥1 dans un espace quelconque, une sous-suite est une suite
de la forme (xϕ(n) )n≥1 , où ϕ : N∗ → N∗ est une extractrice, i.e. une fonction strictement croissante.
Si (xn )n≥1 converge vers x pour quelque notion que ce soit, alors toutes ses sous-suites convergent
vers x.
Proposition 4.4.10. Soit X, X1 , X2 , . . . des v.a. réelles. La suite (Xn )n≥1 converge en probabilité
vers X si et seulement si, de toute sous-suite de (Xn )n≥1 , on peut extraire une sous-sous-suite qui
converge p.s. vers X.
On va clarifier la preuve en présentant tout d’abord deux lemmes.
Lemme 4.4.11. Soit X, X1 , X2 , . . . des v.a. réelles. Si la suite (Xn )n≥1 converge en probabilité
vers X, alors on peut en extraire une sous-suite qui converge p.s. vers X.
Démonstration. Voir TD9.

Lemme 4.4.12. Soit x, x1 , x2 , · · · ∈ R. La suite (xn )n≥1 converge vers x si et seulement si, de
toute sous-suite de (xn )n≥1 , on peut extraire une sous-sous-suite qui converge vers x.
Démonstration. (⇒) Cela découle du fait que si (xn )n≥1 converge vers x alors toute sous-suite de
(xn )n≥1 converge vers x.
(⇐) On va montrer la contraposée : supposons que (xn )n≥1 ne converge pas vers x. Alors on
a forcément lim supn→∞ xn 6= x ou lim inf n→∞ xn 6= x. Supposons qu’on soit dans le 1er cas
(l’autre étant identique). La limite supérieure étant une valeur d’adhérence de (xn )n≥1 , il existe
une extractrice ϕ : N∗ → N∗ telle que (xϕ(n) )n≥1 converge vers lim supn→∞ xn . Alors, toute sous-
suite de (xϕ(n) )n≥1 converge vers lim supn→∞ xn 6= x donc ne converge pas vers x. On a donc
construit une sous-suite de (xn )n≥1 dont on ne peut pas extraire de sous-sous-suite qui converge
vers x. La contraposée est donc montrée.

Démonstration de la Proposition 4.4.10. (⇒) Supposons que (Xn )n≥1 converge en probabilité vers
X. Alors, toute sous-suite de (Xn )n≥1 converge aussi en probabilité vers X, donc, par le Lemme
4.4.11, on peut en extraire une sous-sous-suite qui converge p.s. vers X.
(⇐) Supposons que de toute sous-suite de (Xn )n≥1 , on peut extraire une sous-sous-suite qui
converge p.s. vers X. Soit ε > [Link] montrer que P(|Xn − X| ≥ ε) tend vers 0, on va utiliser le
Lemme 4.4.12 : il suffit de montrer que de toute sous-suite de P(|Xn − X| ≥ ε), il existe une sous-
sous-suite qui tend vers 0. Considérons donc une sous-suite P(|Xϕ(n) − X| ≥ ε) avec ϕ : N∗ → N∗
une extractrice. Alors (Xϕ(n) )n≥1 est une sous-suite de (Xn )n≥1 donc il existe une sous-sous-suite
(Xϕ(ψ(n)) )n≥1 convergeant p.s. vers X. Alors, (Xϕ(ψ(n)) )n≥1 converge aussi en probabilité vers X,
donc
P(|Xϕ(ψ(n)) − X| ≥ ε) −−−→ 0.
n→∞
On a donc bien montré qu’il existe une sous-suite de P(|Xϕ(n) − X| ≥ ε) tendant vers 0. Donc
P(|Xn − X| ≥ ε) tend vers 0 et cela montre que (Xn )n≥1 converge en probabilité vers X.

Comme application de cette caractérisation, on va montrer la stabilité de la convergence en


probabilité par les différentes opérations.

57
Démonstration de la Proposition 4.3.12. L’idée est de transférer les propriétés de stabilité de la
convergence p.s. grâce à la Proposition 4.3.12. On va montrer la stabilité par somme, les autres
étant identiques. Pour montrer que
P
Xn + Yn −−−→ X + Y,
n→∞

on va montrer que de toute sous-suite de (Xn + Yn )n≥1 on peut extraire une sous-sous-suite qui
converge p.s. Considérons donc une sous-suite (Xϕ(n) +Yϕ(n) )n≥1 avec ϕ : N∗ → N∗ une extractrice.
Comme (Xn )n≥1 converge en probabilité vers X, de la sous-suite (Xϕ(n) )n≥1 on peut extraire une
sous-sous-suite (Xϕ(ψ(n)) )n≥1 convergeant p.s. vers X. Puis, comme (Yn )n≥1 converge en proba-
bilité vers Y , de la sous-suite (Yϕ(ψ(n)) )n≥1 on peut extraire une sous-sous-suite (Yϕ(ψ(ξ(n))) )n≥1
convergeant p.s. vers Y . Mais (Xϕ(ψ(ξ(n))) )n≥1 convergeant p.s. vers X (en tant que sous-suite de
(Xϕ(ψ(n)) )n≥1 qui converge p.s. vers X). Donc, par stabilité par somme de la convergence p.s.,
p.s.
Xϕ(ψ(ξ(n))) + Yϕ(ψ(ξ(n))) −−−→ X + Y.
n→∞

On a donc montré qu’il existe une sous-suite de (Xϕ(n) + Yϕ(n) )n≥1 convergeant p.s. vers 0 et cela
conclut la preuve.

4.5 La loi forte des grands nombres


La loi des grands nombres stipule que la moyenne empirique d’un grand nombre de v.a. i.i.d.
se rapproche de leur vraie moyenne. On parle généralement de loi forte quand on obtient une
convergence p.s. et de loi faible quand on obtient une convergence en probabilité. Nous avons vu
deux versions de loi des grands nombres dans des exemples de ce chapitre :
• À l’Exemple 4.3.10, on a montré une loi faible pour des v.a. dans L2 .
• À l’Exemple 4.4.7, on a montré une loi forte pour des v.a. bornées (hypothèse très forte).
Voici l’énoncé unique pour les unifier tous. Il a à la fois la conclusion la plus forte (la convergence
p.s.) et une hypothèse plus faible que les versions mentionnées plus haut (v.a. dans L1 ). C’est donc
l’unique résultat à retenir.
Théorème 4.5.1 (Loi forte des grands nombres). Soit (Xn )n≥1 une suite de v.a. réelles i.i.d. Si
E[|X1 |] < ∞, alors
X1 + · · · + Xn p.s.
−−−→ E[X1 ].
n n→∞

On peut également montrer que l’hypothèse E[|X1 |] < ∞ est nécessaire pour avoir une conver-
gence p.s. vers un réel. Plus précisément, si E[|X1 |] = ∞, différents cas sont possibles : soit les
moyennes empiriques tendent vers +∞ p.s., soit elles tendent vers −∞ p.s., soit elles oscillent p.s.
entre les deux, c’est-à-dire
X1 + · · · + Xn X1 + · · · + Xn
lim inf = −∞ et lim sup = +∞ p.s.
n→∞ n n→∞ n
Cependant, il y a des cas où E[|X1 |] = ∞, mais où la moyenne empirique converge en probabilité
vers un réel.

4.5.1 Démonstration
La démonstration que l’on présente ici est dûe à Etemadi en 1981. La première démonstration
de la loi forte des grands nombres est dûe à Kolmogorov en 1930. Deux idées importantes sont
présentes dans cette preuve : le fait de tronquer des variables aléatoires pour pouvoir ensuite leur
appliquer l’inégalité de Bienaymé–Chebychev et le fait de d’abord montrer la convergence d’une
sous-suite pour ensuite comparer les termes restants de la suite à ceux de cette sous-suite.

58
1/2 1

1000 1000

1 1

1000 1000

Figure 4.1 – Représentation de (X1 + · · · + Xn )/n pour n = 1, . . . , 1000 pour (Xn )n≥1 une suite de v.a. réelles i.i.d.
de différentes lois. En haut à gauche, X1 a loi B(1/2). En haut à droite, X1 a loi E(1). En bas à gauche, X1 a loi
N (0, 1). En bas à droite, X1 a la loi 43 (1 + |x|)−5/2 dx. Cette dernière loi a une queue lourde (par exemple X ∈ / L2 )
et on peut remarquer que la convergence est plus difficile, car même tardivement il y a des grands sauts.

Étape 1 : Se ramener au cas de v.a. positives.


Supposons le résultat montré dans le cas où X1 est positive. Montrons que l’on peut en déduire
le cas où X1 est de signe quelconque : supposons que E[|X1 |] < ∞ et montrons la loi forte des
grands nombres.
Pour cela, on décompose Xn = Xn+ − Xn− pour tout n ≥ 1, où

Xn+ = max(Xn , 0) et Xn− = − min(Xn , 0).

Alors, (Xn+ )n≥1 forme une suite de v.a. i.i.d. avec E[X1+ ] ≤ E[|X1 |] < ∞ et X1+ positive donc,
comme on a supposé la loi forte des grands nombres montré pour les v.a. positives, on a

X1+ + · · · + Xn+ p.s.


−−−→ E[X1+ ].
n n→∞

De manière identique, on a la même convergence pour (Xn− )n≥1 . En combinant les deux, on obtient

X1 + · · · + Xn X + + · · · + Xn+ X1− + · · · + Xn− p.s.


= 1 − −−−→ E[X1+ ] − E[X1− ] = E[X1 ].
n n n n→∞

ce qui montre la loi forte des grands nombres pour (Xn )n≥1 .
Conclusion. On suppose donc dans la suite de la démonstration que X1 est une v.a. positive et
on cherche à montrer le théorème dans ce cas.

Étape 2 : Argument de troncature pour se ramener à des v.a. dans L2 .


L’idée ici est de remplacer Xn par Yn := Xn 1Xn ≤n , qui a l’avantage d’avoir un second moment
fini, ce qui nous permettra d’utiliser l’inégalité de Bienaymé–Chebychev dans la suite. Notons que
les Yn pour n ≥ 1 sont indépendantes mais pas identiquement distribuées.
On va montrer ici que
X1 + · · · + Xn Y1 + · · · + Yn p.s.
− −−−→ 0. (4.1)
n n n→∞

59
Pour cela, on commence par remarquer que
X X X XZ n
P(Xn 6= Yn ) = P(Xn > n) = P(X1 > n) = P(X1 > n) dx
n≥1 n≥1 n≥1 n≥1 n−1
XZ n Z ∞
≤ P(X1 > x) dx = P(X1 > x) dx = E[X1 ] < ∞,
n≥1 n−1 0

où la dernière égalité vient de la Proposition 1.3.16. Ainsi, par le 1er lemme de Borel–Cantelli,
 
P lim sup {Xn 6= Yn } = 0,
n→∞

ce qui signifie que, p.s., il n’y a qu’un nombre fini de n tels que Xn = Yn . Fixons un tel ω. Il existe
m (qui dépend de ω) tel que, pour tout n ≥ m, Xn (ω) = Yn (ω). Alors, pour tout n ≥ m,
X1 (ω) + · · · + Xn (ω) Y1 (ω) + · · · + Yn (ω) X1 (ω) + · · · + Xm (ω) Y1 (ω) + · · · + Ym (ω)
− = − ,
n n n n
qui tend vers 0 quand n → ∞ (car m est fixé). Cela montre (4.1).
Conclusion. Il suffit donc à présent de montrer que
Y1 + · · · + Yn
−−−→ E[X1 ], presque sûrement.
n n→∞

Étape 3 : Majorer les variances des Yn .


En vue d’appliquer l’inégalité de Bienaymé–Chebychev, on va montrer ici la borne suivante sur
les variances des Yn :

X Var(Yn )
≤ 4E[X1 ]. (4.2)
n=1
n2
Par le Corollaire 1.3.17, on a
Z ∞ Z n
E[Yn2 ] = 2yP(Yn > y) dy ≤ 2yP(X1 > y) dy.
0 0

car Yn = Xn 1Xn ≤n donc P(Yn > y) = 0 si y ≥ n, et P(Yn > y) ≤ P(Xn > y) = P(X1 > y) si
y ∈ [0, n]. Comme Var(Yn ) ≤ E[Yn2 ], on en déduit que
∞ ∞ ∞
Z ∞ !
Var(Yn ) 1 n 1
Z
1n>y P(X1 > y) dy,
X X X
≤ 2yP(X1 > y) dy = 2y
n=1
n2 n=1
n2 0 0 n=1
n2

où l’on a utilisé Fubini–Tonelli pour échanger la somme et l’intégrale. On veut à présent majorer
la dernière somme sur n. D’une part, pour y ≥ 1, par décroissance de la fonction x 7→ 1/x2 sur
R∗+ , on a
∞ ∞ ∞ Z n Z ∞
1 1 1 1 1 2
1 =
X X X
2 n>y
≤ dx ≤ dx = ≤ ,
n=1
n n=byc+1
n2 n=byc+1 n−1 x2 byc x2 byc y

où l’on utilise que y ≥ 1 pour la dernière inégalité. D’autre part, pour y < 1, on a
∞ ∞
1 1 π2 2
1 ≤
X X
2 n>y
= ≤2≤ .
n=1
n n=1
n2 6 y

On peut donc majorer


∞ Z ∞ Z ∞
X Var(Yn ) 2
≤ 2y · · P(X1 > y) dy = 4 P(X1 > y) dy = 4E[X1 ],
n=1
n2 0 y 0

par la Proposition 1.3.16. On a donc montré (4.2).

60
Étape 4 : Convergence d’une sous-suite.
Pour n ≥ 1, on note Sn := Y1 +· · ·+Yn . Rappelons que l’on veut montrer que Sn /n converge p.s.
vers E[X1 ] quand n → ∞. On va utiliser une technique classique pour montrer des convergences
p.s. : on va d’abord montrer la convergence d’une sous-suite explicite, avant de comparer au reste
de la suite dans l’étape suivante. Travailler avec une sous-suite permet d’avoir moins de termes
dans la série lorsque l’on essaie d’appliquer le critère de convergence vu à la Proposition 4.4.5.
Soit α > 1. On définit nk = bαk c, où b·c est la partie entière 2 . On va d’abord montrer la
convergence
Snk − E[Snk ] p.s.
−−−→ 0. (4.3)
nk k→∞
Pour cela on veut utiliser le critère vu à la Proposition 4.4.5. Soit ε > 0. Par l’inégalité de Bienaymé–
Chebychev,
nk
Snk − E[Snk ] Var(Snk ) 1 X
 
P ≥ε ≤ = Var(Yn ),
nk (εnk )2 (εnk )2 n=1
par indépendance des Yn . On veut vérifier que cette probabilité est sommable : on a
X  Sn − E[Sn ] nk
1 1 X 1
 XX X
k k
P ≥ε ≤ Var(Yn ) = 2 Var(Yn ) .
k≥1
nk k≥1 n=1
(εnk )2 ε n≥1 k tel que n
n2
≥n k
k

αk
On majore la somme sur k, en notant que nk = bαk c ≥ 2 car αk ≥ 1 et que
log n log n
 
k k
nk ≥ n ⇔ bα c ≥ n ⇔ α ≥n ⇔ k≥ ⇔ k≥ ,
log α log α
ce qui nous donne
X 1 X
−2k α−2 log n/ log α 4 1
2 ≤ 4 · α ≤ 4 · −2
= −2
· 2.
k tel que nk
n
≥n k k≥dlog n/ log αe
1−α 1−α n

On revient à ce qui précède et on obtient


X  Sn − E[Sn ] 
4 X Var(Yn ) 16E[X1 ]
k k
P ≥ε ≤ ≤ 2 < ∞,
k≥1
nk ε2 (1 − α−2 ) n≥1 n2 ε (1 − α−2 )

où l’on a utilisé l’étape 3 dans la 2ème inégalité. Par la Proposition 4.4.5, cela montre (4.3).
Finalement, on veut vérifier que E[Snk ]/nk tend vers E[X1 ]. Pour cela, notons que
E[Yn ] = E[X1 1X1 ≤n ] −−−→ E[X1 ],
n→∞

par convergence dominée car X1 1X1 ≤n → X1 p.s. quand n → ∞ et |X1 1X1 ≤n | ≤ X1 ∈ L1 . Donc,
par le théorème de Cesàro 3 ,
E[Snk ] E[Y1 ] + · · · + E[Ynk ]
= −−−→ E[X1 ].
nk nk k→∞

En combinant cela avec (4.3), on obtient


Snk p.s.
−−−→ E[X1 ].
nk k→∞
On a donc montré la convergence que l’on souhaitait, mais le long de la sous-suite indexée par nn
seulement.
2. On a fait un abus de langage en disant que (Snk )k≥1 est une sous-suite de (Sn )n≥1 car la suite (nk )k≥1 n’est
pas strictement croissante (seulement croissante). Mais peu importe : la convergence (4.3) a bien un sens et on peut
aussi vérifier que la suite (nk )k≥1 est strictement croissante à partir d’un certain rang.
3. Rappelons le théorème de Cesàro : si une suite (an )n≥1 de réels converge vers a ∈ R, alors (a1 +· · ·+an )/n → a
quand n → ∞.

61
Étape 5 : En déduire la convergence de toute la suite.
On veut à présent montrer la convergence de toute la suite (Sn /n)n≥1 . C’est ici principalement
que l’on utilise la positivité de X1 car ainsi (Sn )n≥1 est une suite croissante et on peut donc
comparer tous les termes de la suite à ceux de la sous-suite.
Soit n ≥ n1 . Comme nk → ∞ quand k → ∞, il existe k tel que nk ≤ n ≤ nk+1 . Comme
(Sn )n≥1 est croissante, on peut encadrer Sn /n ainsi :

Snk nk Snk Sn Sn Sn nk+1


= ≤ ≤ k+1 = k+1 .
nk nk+1 nk+1 n nk nk+1 nk
Soit ω ∈ Ω tel que Snk (ω)/nk tend vers E[X1 ]. On fait tendre n → ∞ (et donc le k associé tend
aussi vers l’infini) dans l’encadrement ci-dessus : comme nk+1 /nk → α, on obtient

E[X1 ] Sn (ω) Sn (ω)


≤ lim inf ≤ lim sup ≤ αE[X1 ].
α n→∞ n n→∞ n
Comme Snk /nk → E[X1 ] p.s. par l’étape 4, on a montré que

E[X1 ] Sn Sn
∀α > 1, p.s., ≤ lim inf ≤ lim sup ≤ αE[X1 ].
α n→∞ n n→∞ n

En se restreignant à α ∈ Q∩]1, ∞[, on peut échanger le “pour tout α” (qui est devenu dénombrable)
avec le “p.s.”, et on en déduit que
Sn Sn
p.s., E[X1 ] ≤ lim inf ≤ lim sup ≤ E[X1 ].
n→∞ n n→∞ n

Cela montre que


Sn p.s.
−−−→ E[X1 ],
n n→∞
ce qui conclut la démonstration par l’étape 2.

4.5.2 Applications
Méthode de Monte–Carlo.
La loi des grands nombres fournit une manière d’approcher numériquement la valeur d’une
espérance, en simulant de nombreuses fois la variable aléatoire sous-jacente et en calculant la
moyenne empirique. Plus précisément, soit X une v.a. réelle et f : R → R mesurable telle que
E[|f (X)|] < ∞. Supposons que l’on veuille estimer E[f (X)] numériquement. Pour cela, on génère
une suite (Xn )n≥1 de v.a. réelles i.i.d. de même loi que X et on utilise que

f (X1 ) + · · · + f (Xn ) p.s.


−−−→ E[f (X1 )] = E[f (X)],
n n→∞

par la loi forte des grands nombres, car les v.a. de la suite (f (Xn ))n≥1 sont i.i.d. et E[|f (X1 )|] =
E[|f (X)|] < ∞. Le principal défaut de cette méthode est de savoir quel n on doit choisir pour
quelle précision, ce que ne dit pas la loi des grands nombres. Pour cela, il faut utiliser des inégalités
de concentration, ou le théorème central limite que l’on verra au prochain chapitre.
Un cas particulier important est celui du calcul de probabilités. Si B ∈ B(R), on peut estimer
P(X ∈ B) par la méthode de Monte–Carlo avec f = 1B . On a alors

|{k ∈ J1, nK : Xk ∈ B}| 1B (X1 ) + · · · + 1B (Xn )


−−−→ E[1B (X)] = P(X ∈ B).
p.s.
=
n n n→∞

C’est la définition fréquentiste de la probabilité : P(X ∈ B) est la proportion asymptotique de Xk


qui tombent dans B.

62
1 F5 (x)

X3 X2 X5 X1 X4 x

Fonction de répartition empirique.


Soit (Xn )n≥1 une suite de v.a. réelles i.i.d. Pour n ≥ 1, la fonction de répartition empirique de
l’échantillon X1 , . . . , Xn est la fonction définie par
n
1X
∀x ∈ R, Fn (x) := 1X ≤x .
n k=1 k

Il est important de noter que c’est une fonction aléatoire : pour chaque x ∈ R, Fn (x) est une v.a.
réelle. C’est en fait la fonction de répartition de la mesure empirique de l’échantillon, qui est la
mesure de probabilité sur R suivante (qui est aléatoire aussi !) :
n
1X
δX .
n k=1 k

Pour chaque x ∈ R fixé, on a vu dans le paragraphe précédent que

|{k ∈ J1, nK : Xk ≤ x}| p.s.


Fn (x) = −−−→ P(X1 ≤ x) = F (x),
n n→∞

où F est la fonction de répartition de X1 . Ainsi, la fonction de répartition empirique approche la


fonction de répartition théorique quand la taille de l’échantillon tend vers l’infini.
On vient de voir que :
∀x ∈ R, p.s., Fn (x) −−−→ F (x).
n→∞

On peut alors se demander si on peut échanger le “pour tout” et le “p.s.” Pour cela on se restreint
d’abord aux x rationnels, de sorte à rendre le “pour tout” dénombrable. On peut alors l’échanger
avec le p.s. et on obtient : p.s., ∀x ∈ Q, Fn (x) → F (x). Mais on a le résultat suivant pour des
fonctions déterministes (laissé en exercice) : si f, f1 , f2 , . . . sont des fonctions croissantes continues
à droite telles que ∀x ∈ Q, fn (x) → f (x), alors ∀x ∈ R, fn (x) → f (x). On en conclut

p.s., ∀x ∈ R, Fn (x) −−−→ F (x).


n→∞

Autrement dit, presque sûrement, la suite de fonctions (Fn )n≥1 converge simplement vers F .

63
Chapitre 5

Convergence en loi et théorème


central limite

5.1 Convergence en loi et convergence étroite


5.1.1 Définitions
Définition 5.1.1. Soit X, X1 , X2 , . . . des v.a. réelles. On dit que (Xn )n≥1 converge en loi vers X,
que l’on note
loi
Xn −−−→ X,
n→∞

si, pour toute fonction f : R → R continue bornée,

E[f (Xn )] −−−→ E[f (X)].


n→∞

Remarque 5.1.2. Cette notion de convergence ne dépend que de la loi des v.a. considérées :
le choix précis des v.a. (leurs valeurs pour chaque ω) n’importe pas, seule leur loi compte. En
effet, si X et Y ont la même loi, alors pour toute fonction f : R → R continue bornée, on a
E[f (X)] = E[f (Y )]. En particulier, il est clair que l’on peut remplacer X par Y de même loi à la
limite et la convergence a toujours lieu.
Réciproquement, par le Théorème 1.1.10, si, pour toute fonction f : R → R continue bornée,
on a E[f (X)] = E[f (Y )], alors X et Y ont la même loi. Il y a donc unicité de la limite en loi. C’est
à comparer aux convergences vues au chapitre précédent pour lesquelles il y a unicité de la limite
à égalité p.s. près.

Comme cette convergence ne concerne que les lois des variables aléatoires, on parle parfois
directement de la convergence des lois : on introduit pour cela la notion de convergence étroite.

Définition 5.1.3. Soit P, P1 , P2 , . . . des lois sur R. On dit que (Pn )n≥1 converge étroitement
vers P , que l’on note
étroit.
Pn −−−→ P,
n→∞

si, pour toute fonction f : R → R continue bornée,


Z Z
f (x) dPn (x) −−−→ f (x) dP (x).
R n→∞ R

Si X, X1 , X2 , . . . sont des v.a. réelles, il est clair que


loi étroit.
Xn −−−→ X ⇔ PXn −−−−→ PX .
n→∞ n→∞

64
Quand on montre la convergence en loi d’une suite de v.a., comme la définition précise de la
variable aléatoire limite n’importe pas mais seule sa loi compte, on écrit parfois
loi
Xn −−−→ P,
n→∞

où P est une loi. C’est un léger abus de notation car les quantités ne sont pas du même type
des deux côtés de la flèche : cela signifie que PXn converge étroitement vers P ou, de manière
équivalente, que Xn converge en loi vers X, où X est n’importe quelle v.a. de loi P .
Exemple 5.1.4. Si X, X1 , X2 , . . . sont des v.a. réelles de même loi, alors il est clair que (Xn )n≥1
converge en loi vers X. Si ces v.a. sont toutes égales, alors il y a aussi convergence p.s. et en
probabilité (et dans Lp si elles sont dans Lp ). Mais si on les prend toutes indépendantes alors
aucune de ces autres convergences ne sera vraie (sauf si les v.a. sont constantes p.s.).
Exemple 5.1.5. Soit (λn )n≥1 une suite décroissante de réels convergeant vers λ > 0. Pour tout
n ≥ 1, soit Xn une v.a. de loi E(λn ). Soit X une v.a. de loi E(λ). Montrons que
loi
Xn −−−→ X.
n→∞

Pour cela, on considère f : R → R continue bornée quelconque. Par le théorème de transfert, on a


Z ∞
E[f (Xn )] = f (x)λn e−λn x dx
0

Comme λn → λ, on a f (x)λn e−λn x → f (x)λe−λx pour tout x ≥ 0. En outre, par décroissance de


(λn )n≥1 , on peut dominer

∀x ≥ 0, f (x)λn e−λn x ≤ kf k∞ λ1 e−λx ,


la fonction de droite étant indépendante de n et intégrable par rapport à la mesure de Lebesgue
sur [0, ∞[. Par le théorème de convergence dominée, on obtient
Z ∞ Z ∞
E[f (Xn )] = f (x)λn e−λn x dx −−−→ f (x)λe−λx dx = E[f (X)].
0 n→∞ 0

Cela montre que (Xn )n≥1 converge en loi vers X.


Exemple 5.1.6 (Convergence en loi de v.a. aléatoires constantes p.s.). Soit (xn )n≥1 une suite de
réels et, pour chaque n ≥ 1, une v.a. Xn telle que Xn = xn p.s. Soit x ∈ R et X une v.a. telle que
X = x p.s. Alors, on montrera au TD11 que
loi
xn −−−→ x ⇔ Xn −−−→ X.
n→∞ n→∞

En terme de convergence de lois, cela se réécrit


étroit.
xn −−−→ x ⇔ δxn −−−−→ δx .
n→∞ n→∞

Remarque 5.1.7. Il est important de noter que la convergence en loi ne requiert la convergence
E[f (Xn )] → E[f (X)] que pour les fonctions f : R → R continues bornées, et pas toutes les fonctions
mesurables bornées. Et, si (Xn )n≥1 converge en loi vers X, il peut y avoir des fonctions f : R → R
mesurables bornées telles que E[f (Xn )] 9 E[f (X)]. Il peut même y avoir des boréliens B ∈ B(R)
tels que P(Xn ∈ B) 9 P(X ∈ B).
Montrons le sur un exemple. Prenons, Xn = 1/n p.s. et X = 0 p.s. Alors (Xn )n≥1 converge en
loi vers X par l’exemple précédent. Mais, on a
P(Xn ≤ 0) = 0 −−6 −→ 1 = P(X ≤ 0)
n→∞
P(Xn > 0) = 1 −−6 −→ 0 = P(X > 0),
n→∞

ce qui montre que la convergence P(Xn ∈ B) → P(X ∈ B) n’a pas lieu en général, même pour B
fermé ou ouvert ou un intervalle.

65
5.1.2 Lien avec les autres convergences
Le résultat suivant montre que la convergence en loi est plus faible que la convergence en
probabilité, et donc est plus faible que toutes les convergences vues au Chapitre 4.

Proposition 5.1.8. Soit (Xn )n≥1 une suite de v.a. réelles convergeant en probabilité vers une v.a.
réelle X. Alors (Xn )n≥1 converge en loi vers X.

Démonstration. Soit f continue bornée. Montrons que E[f (Xn )] → E[f (X)]. Pour cela on considère
ε > 0 et on écrit

|E[f (Xn )] − E[f (X)]| ≤ E[|f (Xn ) − f (X)|]


= E |f (Xn ) − f (X)|1|f (Xn )−f (X)|≤ε + E |f (Xn ) − f (X)|1|f (Xn )−f (X)|>ε
h i h i

≤ ε + 2kf k∞ P(|f (Xn ) − f (X)| > ε).

Comme f est continue et (Xn )n≥1 converge en probabilité vers X, par la Proposition 4.3.12, on
sait que (f (Xn ))n≥1 converge en probabilité vers f (X). Ainsi P(|f (Xn ) − f (X)| > ε) → 0 et donc,
pour tout n à partir d’un certain rang,

|E[f (Xn )] − E[f (X)]| ≤ 2ε.

Cela montre que E[f (Xn )] → E[f (X)] et donc que (Xn )n≥1 converge en loi vers X.

En général, la réciproque est fausse : converger en loi n’implique pas converger en probabilité.
En effet, pour la convergence en loi, on peut remplacer la limite X d’une suite (Xn )n≥1 par
n’importe qu’elle autre v.a. X 0 de même loi. Alors (Xn )n≥1 converge en loi aussi vers X 0 . Mais,
si on peut choisir X et X 0 qui ne sont pas égales p.s. alors (Xn )n≥1 ne peut pas converger en
probabilité à la fois vers X et vers X 0 (par la Proposition 4.3.11).
Il n’y a qu’un seul cas où on ne peut pas choisir X et X 0 de même loi mais pas égales p.s. :
c’est dans le cas où leur loi est une masse de Dirac, c’est-à-dire dans le cas de v.a. constantes p.s. Il
se trouve que dans ce cas particulier, la convergence en loi implique la convergence en probabilité
comme montré ci-dessous.

Proposition 5.1.9. Soit (Xn )n≥1 une suite de v.a. réelles convergeant en loi vers une v.a. réelle X.
Si X est constante p.s., alors (Xn )n≥1 converge en probabilité vers X.

Démonstration. Comme X est constante p.s., il existe x ∈ R tel que X = x p.s. On considère la
fonction
f (t) = min(1, |t − x|), t ∈ R.
C’est une fonction continue et bornée, donc par convergence en loi de (Xn )n≥1 vers X,

E[f (Xn )] −−−→ E[f (X)] = f (x) = 0.


n→∞

Montrons que Xn → x en probabilité. Soit ε ∈ ]0, 1]. Alors

E[f (Xn )]
P(|Xn − x| ≥ ε) = P(min(1, |Xn − x|) ≥ ε) = P(f (Xn ) ≥ ε) ≤ −−−→ 0,
ε n→∞

où l’on a utilisé l’inégalité de Markov. Si ε ≥ 1, alors P(|Xn − x| ≥ ε) ≤ P(|Xn − x| ≥ 1) → 0. Cela


montre que Xn → x en probabilité et donc que Xn → X en probabilité.

66
5.1.3 Caractérisations de la convergence en loi
Fonctions test plus régulières.
On montre ici que pour montrer une convergence en loi, on peut se restreindre à des fonctions
test f qui sont de classe C ∞ et à support compact. On rappelle qu’une fonction est dite à support
compact s’il existe un compact en dehors duquel elle est nulle.

Théorème 5.1.10. Soit X, X1 , X2 , . . . des v.a. réelles. Alors (Xn )n≥1 converge en loi vers X si
et seulement si, pour toute fonction f : R → R de classe C ∞ et à support compact,

E[f (Xn )] −−−→ E[f (X)].


n→∞

Pour la démonstration, on utilisera le lemme de densité suivant (probablement vu en théorie


de la mesure).

Lemme 5.1.11. Soit f : R → R continue à support compact. Soit ε > 0. Il existe une fonction
g : R → R de classe C ∞ et à support compact telle que kf − gk∞ ≤ ε, c’est-à-dire

∀x ∈ R, |f (x) − g(x)| ≤ ε.

Démonstration du Théorème 5.1.10. L’implication directe est évidente car toute fonction C ∞ à
support compact est aussi continue bornée. On se concentre donc sur le fait de montrer l’implication
réciproque : on suppose que E[f (Xn )] → E[f (X)] pour toute fonction f de classe C ∞ à support
compact. On va procéder en deux étapes : on montre d’abord que la convergence reste vraie pour
f continue à support compact, puis on étend à toute fonction f continue bornée.
Première étape. Soit f : R → R continue à support compact. Soit ε > 0. Par le lemme 5.1.11,
il existe g : R → R de classe C ∞ et à support compact telle que kf − gk∞ ≤ ε. On borne alors, par
inégalité triangulaire,

|E[f (Xn )] − E[f (X)]| ≤ |E[f (Xn )] − E[g(Xn )]| + |E[g(Xn )] − E[g(X)]| + |E[g(X)] − E[f (X)]|
≤ ε + |E[g(Xn )] − E[g(X)]| + ε.

Comme g est C ∞ à support compact, on sait que E[g(Xn )] → E[g(X)] par hypothèse. Donc, pour
tout n à partir d’un certain rang, on a |E[f (Xn )] − E[f (X)]| ≤ 3ε. Cela montre que E[f (Xn )] →
E[f (X)] quand n → ∞.
Deuxième étape. Soit f : R → R continue bornée. Soit ε > 0. Par continuité décroissante de la
mesure, !
\
lim P(|X| ≥ N ) = P ↓ {|X| ≥ N } = P(|X| = ∞) = 0,
N →∞
N ≥1

donc il existe N ≥ 1 tel que P(|X| ≥ N ) ≤ ε. Soit h : R → R continue à support compact telle que
1[−N,N ] ≤ h ≤ 1. On a, en écrivant f = f h + f (1 − h) et en utilisant l’inégalité triangulaire,
|E[f (Xn )] − E[f (X)]| ≤ |E[f h(Xn )] − E[f h(X)]| + |E[f (1 − h)(Xn )] − E[f (1 − h)(X)]|
≤ |E[f h(Xn )] − E[f h(X)]| + kf k∞ (E[(1 − h)(Xn )] + E[(1 − h)(X)]),

car 1 − h ≥ 0. On a E[(1 − h)(Xn )] = 1 − E[h(Xn )] et, en appliquant le résultat de la première


étape à f h et h qui sont continues à support compact, on obtient

lim sup|E[f (Xn )] − E[f (X)]| ≤ 0 + kf k∞ (1 − E[h(X)] + E[(1 − h)(X)]) ≤ 2εkf k∞ ,


n→∞

car E[(1 − h)(X)] ≤ P(|X| > N ) ≥ ε. Cela montre que E[f (Xn )] → E[f (X)] quand n → ∞.

67
Fonction de répartition.
Une des manières de montrer la convergence en loi d’une suite de v.a. réelles est de montrer la
convergence de leurs fonctions de répartition. Notons qu’elle n’a pas forcément lieu en tout point,
comme on l’avait vu dans la Remarque 5.1.7 avec l’exemple Xn = 1/n et X = 0.
Théorème 5.1.12. Soit X, X1 , X2 , . . . des v.a. réelles. Alors (Xn )n≥1 converge en loi vers X si
et seulement si
∀a ∈ R point de continuité de FX , FXn (a) −−−→ FX (a).
n→∞

Remarque 5.1.13. L’ensemble des points de discontinuité de FX est au plus dénombrable (c’est
le cas de toute fonction croissante). En effet, comme FX est croissante et 0 ≤ FX ≤ 1, il ne peut
y avoir qu’au plus k discontinuités de tailles 1/k pour k ∈ N∗ , donc l’ensemble des points de
discontinuité de FX peut s’écrire
[ 1

a ∈ R : FX (a) − FX (a−) ≥ ,
k≥1
k

qui est une union dénombrable d’ensembles finis et est donc au plus dénombrable.
Démonstration. Sens direct. Supposons que (Xn )n≥1 converge en loi vers X. Soit a ∈ R un point
de continuité de FX . Alors

1]−∞,a] (Xn ) .
h i
FXn (a) = P(Xn ≤ a) = E

Cependant on ne peut pas passer à la limite car la fonction 1]−∞,a] n’est pas continue. Soit ε > 0.
Soit δ > 0 qu’on choisira plus tard en fonction de ε > 0. Il existe des fonctions continues f1 et f2
(on peut les prendre affines par morceaux) telles que

1]−∞,a−δ] ≤ f1 ≤ 1]−∞,a] ≤ f2 ≤ 1]−∞,a+δ] .


Alors on a l’encadrement
E[f1 (Xn )] ≤ FXn (a) ≤ E[f2 (Xn )]
Mais pour i ∈ {1, 2}, on a E[fi (Xn )] → E[fi (X)] quand n → ∞, car fi est continue bornée. Donc,
pour tout n à partir d’un certain rang,

E[f1 (X)] − ε ≤ FXn (a) ≤ E[f2 (X)] + ε

Mais E[f2 (X)] ≤ E[1]−∞,a+δ] (X)] = FX (a + δ) et de même E[f1 (X)] ≥ FX (a − δ). On a donc
montré que, pour tout n à partir d’un certain rang,

FX (a − δ) − ε ≤ FXn (a) ≤ FX (a + δ) + ε.

En choisissant δ suffisamment petit pour que |FX (a ± δ) − FX (a)| ≤ ε (possible par continuité de
FX en a), cela donne |FXn (a) − FX (a)| ≤ 2ε. On a donc montré que FXn (a) → FX (a).
Sens réciproque. Supposons que, pour tout point de continuité a de FX , on ait FXn (a) → FX (a).
On va montrer la convergence en loi grâce au Théorème 5.1.10. On considère donc une Rx
fonction
test f : R → R de classe C à support compact. Pour une telle fonction, on a f (x) = −∞ f 0 (y) dy

et donc
Z Z Z 
E[f (Xn )] = f (x)PXn (dx) = 1y<x f 0 (y) dy PXn (dx)
R R R
Z Z  Z
= 1y<x PXn (dx) f (y) dy =
0
P(Xn > y)f 0 (y) dy
ZR R R
0
= (1 − FXn (y))f (y) dy,
R

68
où la 3ème égalité est justifiée par le théorème de Fubini–Lebesgue car, comme PXn a masse totale 1,
on a R ( R |1y<x f 0 (y)|PXn (dx)) dy ≤ R |f 0 (y)| dy < ∞ (car f 0 est nulle en dehors d’un compact
R R R

et bornée sur ce compact car continue). Par hypothèse, (1 − FXn (y))f 0 (y) → (1 − FX (y))f 0 (y)
Lebesgue-presque partout (car les points de discontinuité de FX sont au plus dénombrables par la
0 0 0
R
Remarque 5.1.13). En outre, on peut dominer |(1 − FXn (y))f (y)| ≤ |f (y)| et R |f (y)| dy < ∞.
Donc, par le théorème de convergence dominée,
Z
E[f (Xn )] −−−→ (1 − FX (y))f 0 (y) dy = E[f (X)],
n→∞ R

par le calcul précédent appliqué à X au lieu de Xn . Cela implique la convergence en loi par le
Théorème 5.1.10.

Montrer une convergence en loi en utilisant les fonction de répartition est particulièrement
utile quand on étudie un minimum ou un maximum de v.a. indépendantes, comme dans l’exemple
suivant.

Exemple 5.1.14. Soit (Un )n≥1 une suite de v.a. i.i.d. de loi uniforme sur [0, 1]. On considère
Mn = min(U1 , . . . , Un ). Pour a ∈ R, on a

FMn (a) = 1 − P(Mn > a) = 1 − P(U1 > a, . . . , Un > a) = 1 − P(U1 > a) · · · P(Un > a),

par indépendance des Uk et donc



0

 si a < 0,
FMn (a) = 1 − (1 − a)n si a ∈ [0, 1],


1 si a > 1.

À partir de ce calcul, on peut vérifier aisément que (Mn )n≥1 converge en probabilité vers 0, et avec
un peu plus d’effort on peut montrer que la convergence a lieu p.s. On se demande alors à quelle
vitesse (Mn )n≥1 tend vers 0. Une manière d’avoir une idée est de calculer E[Mn ] : comme Mn est
positive, on a Z ∞ Z 1
1 1
E[Mn ] = P(Mn > x) dx = (1 − x)n dx = ∼ ,
0 0 n+1 n
quand n → ∞. Ainsi, une quantité que l’on peut espérer être d’ordre 1 est nMn et, en effet, on
va montrer la convergence en loi de (nMn )n≥1 . Pour cela, on calcule la fonction de répartition de
nMn : pour tout a ∈ R,

0

 si a < 0,
a
 
a n
FnMn (a) = FMn = 1 − (1 − n) si a ∈ [0, n],
n 

1 si a > n.

On rappelle que (1 − na )n → e−a donc, pour tout a ∈ R,

FnMn (a) −−−→ 1 − e−a 1a≥0 .



n→∞

C’est la fonction de répartition d’une v.a. X de loi exponentielle de paramètre 1. Donc


loi
nMn −−−→ X.
n→∞

Remarque 5.1.15. Pour étudier la convergence en loi ou non d’une suite (Xn )n≥1 à l’aide des
fonctions de répartition, on procède ainsi. Tout d’abord, on calcule FXn pour tout n ≥ 1 et on

69
étudie la convergence de FXn (a) pour a ∈ R. Si FXn (a) ne converge pas pour un ensemble non-
dénombrable de a alors il n’y a pas convergence en loi (d’après le Théorème 5.1.12 et la Remarque
5.1.13). Sinon, on a une limite pour tout a ∈ R sauf un sous-ensemble au plus dénombrable :
FXn (a) −−−→ F (a),
n→∞

où la fonction F est nécessairement croissante et est choisie continue à droite aux points de
discontinuité (quitte à ce que F (a) ne soit pas égal à la limite de FXn (a)). Il est essentiel pour
cette méthode de bien choisir F continue à droite. Il y a alors deux cas :
• Si limx→−∞ F (x) = 0 et limx→∞ F (x) = 1, alors F est bien la fonction de répartition d’une
v.a. X par le Théorème 1.4.6 et on a convergence en loi de (Xn )n≥1 vers X. De plus, on peut
souvent déterminer la loi de X avec la Proposition 1.4.7.
• Sinon, F n’est pas une fonction de répartition et donc (Xn )n≥1 ne converge pas en loi. Pour
le montrer, supposons que (Xn )n≥1 converge en loi vers X. Alors FXn (a) → FX (a) en tout a
point de continuité de FX . Alors on a F (a) = FX (a) pour tout a ∈ A où A est un ensemble de
complémentaire au plus dénombrable. En particulier, A est dense dans R 1 et donc pour tout
a ∈ R, il existe une suite de an ∈ A telle que an → a avec an ≥ a. Comme F (an ) = FX (an )
pour tout n et F et FX sont continues à droite, cela implique que F (a) = FX (a). Donc
F = FX sur R. Cela contredit le fait que F ne soit pas une fonction de répartition.
Quand la fonction de répartition limite est continue, ce qui arrive par exemple si la limite est
une v.a. continue, on peut en déduire la convergence des probabilités d’être dans n’importe quel
intervalle.
Corollaire 5.1.16. Soit (Xn )n≥1 une suite de v.a. réelles convergeant en loi vers X. On suppose
que FX est continue sur R (ou, de manière équivalente, que X n’a pas d’atome). Alors, pour tout
intervalle I ⊂ R,
P(Xn ∈ I) −−−→ P(X ∈ I).
n→∞

Démonstration. Voir le TD12.

Fonction caractéristique.
Une autre manière de montrer une convergence en loi est de montrer la convergence des fonc-
tions caractéristiques. Cette approche est particulièrement utile lorsqu’on travaille avec une somme
de v.a. indépendantes, comme dans la démonstration du théorème central limite dans la section
suivante.
Théorème 5.1.17 (Théorème de Lévy faible). Soit X, X1 , X2 , . . . des v.a. réelles. Alors (Xn )n≥1
converge en loi vers X si et seulement si
∀θ ∈ R, φXn (θ) −−−→ φX (θ).
n→∞

Démonstration (admise).

Le cas des v.a. à valeurs entières.


Pour des v.a. à valeurs entières, il suffit de montrer la convergence des probabilités de prendre
chaque valeur possible pour montrer la convergence en loi. On se restreint ici au cas de v.a. à
valeurs entières, mais cela se généralise de manière similaire au cas d’une suite de v.a. à valeurs
dans le même ensemble E ⊂ R dénombrable sans point d’accumulation (pour tout K compact
inclus dans R, E ∩ K est fini).
1. Notons λ la mesure de Lebesgue sur R. Comme Ac est au plus dénombrable, on a λ(Ac ) = 0. Donc pour tout
a < b, on a λ(]a, b[ ∩ A) = λ(]a, b[) = b − a > 0. En particulier, cela implique que ]a, b[ ∩ A 6= ∅. Donc A est dense
dans R.

70
Proposition 5.1.18. Soit X, X1 , X2 , . . . des v.a. à valeurs dans Z. Alors (Xn )n≥1 converge en loi
vers X si et seulement si
∀k ∈ Z, P(Xn = k) −−−→ P(X = k).
n→∞

Démonstration. Sens direct. Supposons que (Xn )n≥1 converge en loi vers X. Soit k ∈ Z. On
considère une fonction f : R → R continue bornée telle que f (k) = 1 et f est nulle sur tous les
autres entiers (par exemple, f (x) = max(1 − |x − k|, 0)). Alors
X
E[f (Xn )] = P(Xn = i)f (i) = P(Xn = k)
i∈Z

et de même E[f (X)] = P(X = k). Or, par convergence en loi, on a E[f (Xn )] → E[f (X)] quand
n → ∞ et donc P(Xn = k) → P(X = k).
Sens réciproque. Supposons que, pour tout k ∈ Z, on ait P(Xn = k) → P(X = k) quand
n → ∞. Soit f : R → R à support compact. Soit M > 0 tel que f (x) = 0 pour tout x ∈
/ [−M, M ].
Alors
X X
E[f (Xn )] = P(Xn = k)f (k) = P(Xn = k)f (k)
k∈Z k∈Z∩[−M,M ]
X
−−−→ P(X = k)f (k) = E[f (X)],
n→∞
k∈Z∩[−M,M ]

où la convergence est justifiée car la somme est finie. Cela implique la convergence en loi par le
Théorème 5.1.10.

Exemple 5.1.19 (Limite poissonienne des lois binomiales). Soit (Xn )n≥1 une suite de v.a. telle
que Xn ait une loi binomiale de paramètre (n, pn ), où (pn )n≥1 est une suite de réels dans [0, 1] telle
que
npn −−−→ λ,
n→∞
pour un certain λ > 0. Alors, pour tout k ∈ N fixé, on a
! k
n k n! pn

P(Xn = k) = pn (1 − pn )n−k = exp(n log(1 − pn )).
k k!(n − k)! 1 − pn
pn
En utilisant la formule de Stirling, le fait que 1−p n
∼ nλ et que n log(1 − pn ) ∼ −λ, on obtient

2πn( ne )n
 k n
1 λ 1 −k n

P(Xn = k) ∼ ·p · exp(−λ) ∼ · e · λk e−λ .
k! 2π(n − k)( n−k e ) n−k n k! n − k

Finalement, comme ( n−k n k −k


n ) = exp(n log(1 − n )) → e , on obtient

λk −λ
P(Xn = k) −−−→ e .
n→∞ k!
Notons aussi que, pour tout k < 0, P(Xn = k) = 0 → 0. Par la proposition précédente, cela montre
que (Xn )n≥1 converge en loi vers une v.a. de loi de Poisson de paramètre λ.

5.2 Théorème central limite et applications


5.2.1 Le théorème central limite
Nous avons vu la loi des grands nombres qui garantit que, pour une suite (Xn )n≥1 une suite
de v.a. réelles i.i.d. dans L1 , on a
X1 + · · · + Xn p.s.
−−−→ E[X1 ].
n n→∞

71
Autrement dit, au premier ordre, la v.a. X1 + · · · + Xn se comporte de manière déterministe
comme nE[X1 ]. On s’intéresse ici à l’ordre suivant dans ce comportement asymptotique ou, en
termes probabilistes, aux fluctuations autour de cette loi des grands nombres. C’est le théorème
central limite qui décrit ces fluctuations dans le cas où les v.a. Xk sont dans L2 . Il nous dit

que, typiquement, la différence entre X1 + · · · + Xn et nE[X1 ] est d’ordre n et se distribue
approximativement comme une loi gaussienne à cette échelle.

Théorème 5.2.1. Soit (Xn )n≥1 une suite de v.a. réelles i.i.d. telle que E X12 < ∞. On pose
 

m = E[X1 ] et σ 2 = Var(X1 ). Si σ 2 > 0, alors

X1 + · · · + Xn − nm loi
√ −−−→ Z,
n n→∞

où Z est une v.a. de loi N (0, σ 2 ).

Démonstration. Quitte à considérer Xk − m à la place de Xk (ce qui ne change pas sa variance),


on peut supposer que m = 0. On veut alors montrer la convergence de
X1 + · · · + Xn
Zn := √
n

et pour cela on va calculer sa fonction caractéristique. Soit θ ∈ R. On a


n
" !# " n # n n
iθ X iθ iθ θ
Y  Y    
φZn (θ) = E exp √ Xk =E exp √ Xk = E exp √ Xk = φX1 √ ,
n k=1 k=1
n k=1
n n

où l’on a utilisé l’indépendance des Xk dans la 3ème égalité et le fait qu’ils aient la même loi dans
la 4ème. On remarque à présent que, comme E[X12 ] < ∞, par la Proposition 1.4.13, on sait que
φX1 est de classe C 2 sur R et
h i
φX1 (0) = 1, φ0X1 (0) = iE[X1 ] = 0 et φ00X1 (0) = −E X12 = −σ 2 .

On a donc le développement, quand n → ∞ (pour θ fixé),

θ σ2 θ2 1 1
     
−σ 2 θ2 /(2n)
φX1 √ =1− +o =e +o .
n 2n n n

Ainsi, on a
n
θ θ
  n  
2 θ 2 /2 2 θ 2 /(2n) 2 θ 2 /(2n)
φZn (θ) − e−σ = φX1 √ − e−σ ≤ n φX1 √ − e−σ −−−→ 0,
n n n→∞

où l’on a utilisé l’inégalité |z n − wn | ≤ n|z − w| pour z, w ∈ C de modules inférieurs à 1 2 , puis le


développement mentionné précédemment pour obtenir la convergence vers 0. On a donc montré
que
2 2
φZn (θ) −−−→ e−σ θ /2 = φZ (θ),
n→∞

pour tout θ ∈ R et cela montre la convergence en loi désirée.

Remarque 5.2.2. Le théorème central limite est un exemple de convergence en loi qui ne peut
pas être améliorée en une des autres convergences vues au Chapitre 4, pour lesquelles le choix
précis de la v.a limite Z est important (i.e. sa définition pour P-presque tout ω ∈ Ω, pas seulement
sa loi). Une manière non rigoureuse de voir cela est la Figure 5.1.
Pn−1
2. Pour montrer cette inégalité, on écrit z n −wn = (z −w) k=0
z k wn−1−k , puis on utilise l’inégalité triangulaire.

72
X1 + · · · + Xn

n

0 n
104 3 · 104

−1


Figure 5.1 – Représentation de (X1 + · · · + Xn )/ n où (Xk )k≥1 est une suite de v.a. i.i.d. de loi 12 δ1 + 12 δ−1 , qui a
moyenne nulle. Cinq réalisations sont représentées dans des couleurs différentes. On peut voir que cette quantité reste
d’ordre 1, mais ne converge pas vers une limite pour un ω fixé (c’est-à-dire le long d’une des courbes représentées).
La convergence n’a lieu qu’en loi : si l’on représentait un grand nombre de ses réalisations (plus que cinq !) alors à
chaque n, elles seraient distribuées approximativement comme une gaussienne.

Plus rigoureusement, supposons que la convergence vers Z ait lieu en probabilité. On peut
décomposer
X1 + · · · + X2n − 2nm 1 X1 + · · · + Xn − nm Xn+1 + · · · + X2n − nm
 
√ =√ √ + √ ,
2n 2 n n
et donc écrire
Xn+1 + · · · + X2n − nm √ X1 + · · · + X2n − 2nm X1 + · · · + Xn − nm
√ = 2· √ − √
n 2n n
P √
−−−→ ( 2 − 1)Z,
n→∞

par stabilité par somme de la convergence en probabilité. Cela implique en particulier la conver-
gence en loi. Mais d’autre part,
Xn+1 + · · · + X2n − nm X1 + · · · + Xn − nm
√ a la même loi que √ .
n n
Donc, comme la convergence en loi ne dépend que de la loi, on a également
Xn+1 + · · · + X2n − nm loi
√ −−−→ Z.
n n→∞

Comme ( 2−1)Z et Z n’ont pas la même loi, c’est une contradiction car la limite d’une convergence
en loi est unique à égalité en loi près.
Remarque 5.2.3. Plaçons nous sous les hypothèses du théorème, on donne ici d’autres manières
d’écrire la conclusion du théorème. Tout d’abord, comme Z/σ a la loi N (0, 1) et que la convergence
en loi est stable par composition par une fonction continue (ici x 7→ x/σ), on a
X1 + · · · + Xn − nm loi
√ −−−→ Y,
σ n n→∞

où Y est une v.a. de loi N (0, 1). On peut alors en déduire que, pour tout intervalle I ⊂ R,
2
X1 + · · · + Xn − nm e−x /2
  Z
P √ ∈I −−−→ √ dx. (5.1)
σ n n→∞ I 2π

73
En effet, cela découle du fait que la fonction de répartition de Y est continue et du Corollaire
5.1.16.

5.2.2 Précision dans la méthode de Monte–Carlo


Le théorème central limite permet d’estimer combien de variables aléatoires il faut considérer
dans la méthode de Monte–Carlo pour une obtenir une certaine précision. Rappelons que pour
estimer E[f (X)] avec X une v.a. réelle et f : R → R mesurable telle que E[|f (X)|] < ∞, on génère
une suite (Xn )n≥1 de v.a. réelles i.i.d. de même loi que X et on calcule
f (X1 ) + · · · + f (Xn )
n
qui approche E[f (X)] p.s. par la loi forte des grands nombres. Supposons que l’on veuille approcher
E[f (X)] à ε près avec probabilité au moins 1 − α, pour ε > 0 et α ∈ ]0, 1[ donnés. Cela signifie que
l’on veut trouver n tel que
f (X1 ) + · · · + f (Xn )
 
P − E[f (X)] ≤ ε ≥ 1 − α
n
On peut trouver une valeur de n telle que cette inégalité soit satisfaite (de manière exacte) en
utilisant les inégalités de concentrations vues au Chapitre 3. Mais ici, on va voir comment choisir
n de sorte que cette inégalité soit asymptotiquement satisfaite (quand n → ∞, i.e. ε → 0) et pour
cela on utilise le théorème central limite. Heuristiquement, à α fixé, il nous dit qu’il faut que n
soit de l’ordre de 1/ε2 , car les fluctuations de (f (X1 ) + · · · + f (Xn ))/n autour de la vraie moyenne

sont d’ordre 1/ n.
Plus précisément, supposons que E f (X)2 < ∞ (sans quoi on ne peut pas appliquer le théorème
 

central limite). Alors, en notant σ 2 = Var(f (X)) et en utilisant (5.1), on a, pour tout a > 0 fixé,
f (X1 ) + · · · + f (Xn ) aσ f (X1 ) + · · · + f (Xn ) − nE[f (X)]
   
P − E[f (X)] ≤ √ =P √ ∈ [−a, a]
n n σ n
Z a −x2 /2
e
−−−→ √ dx.
n→∞ −a 2π
Rappelons que l’on note Φ la fonction de répartition de la loi N (0, 1). On choisit a en terme de
α ∈ ]0, 1[ de sorte que
Z a −x2 /2
e
1−α= √ dx ⇔ 1 − α = 2Φ(a) − 1
−a 2π
α
 
−1
⇔ a=Φ 1− , (5.2)
2
où l’on a utilisé dans la première équivalence le calcul suivant
Z a −x2 /2 Z a −x2 /2 Z −a −x2 /2 Z ∞ −x2 /2
e e e e
√ dx = √ dx − √ dx = Φ(a) − √ dx
−a 2π −∞ 2π −∞ 2π a 2π
= Φ(a) − (1 − Φ(a)) = 2Φ(a) − 1.
Puis on choisit n tel que
aσ a2 σ 2
ε= √ ⇔ n= 2 .
n ε
Alors, la convergence ci-dessus se réécrit en l’approximation
f (X1 ) + · · · + f (Xn )
 
P − E[f (X)] ≤ ε ≈ 1 − α.
n
On a donc bien trouvé comment choisir n en fonction de α et ε pour répondre approximativement
à la question (où l’approximation se justifie dans la limite ε → 0 avec α fixé).

74
Remarque 5.2.4. On peut voir que le choix de n est proportionnel à la variance σ 2 . En particulier,
plus la variance est grande, moins on est précis dans une méthode de Monte–Carlo et donc plus on
doit prendre n grand (sans grande surprise). Une difficulté ici est que généralement on ne connaît
pas la valeur de σ 2 : en effet, on essaie d’estimer numériquement E[f (X)] car on ne sait pas le
calculer de manière théorique, mais il y a alors peu de chance que l’on sache calculer Var(f (X)). Une
solution peut être d’obtenir une borne supérieure σmax2 pour Var(f (X)) et prendre n = a2 σmax
2 /ε2 ,

qui correspond au “pire des cas”. Si on ne voit pas comment majorer Var(f (X)), il est bon au
moins d’avoir en tête que n doit être proportionnel à 1/ε2 : pour gagner une décimale de plus en
précision, il faut prendre n cent fois plus grand.

5.2.3 Intervalles de confiance asymptotiques


On a vu en Section 3.2 comment construire des intervalles de confiance à n fixé à partir des
inégalités de concentration. Ici on utilise le théorème central limite pour construire des intervalles
de confiance asymptotiques, c’est-à-dire qu’ils satisfont le niveau de confiance désiré dans la limite
n → ∞. On se place dans le même cadre qu’en Section 3.2 : soit (Xk )k≥1 une suite de v.a. réelles
X1 , . . . , Xn i.i.d. dont la loi appartient à une certaine famille (Pθ )θ∈Θ , où Θ ⊂ R.
Définition 5.2.5. Soit α ∈ ]0, 1[. Un intervalle de confiance asymptotique pour θ de niveau 1 − α
est la donnée, pour chaque n ≥ 1, d’un intervalle aléatoire In = [Fn (X1 , . . . , Xn ), Gn (X1 , . . . , Xn )]
avec Fn , Gn : Rn → R mesurables (ne dépendant pas de θ), tel que pour tout θ ∈ Θ, si les v.a. Xk
ont loi Pθ , alors
lim inf P(θ ∈ In ) ≥ 1 − α.
n→∞
Contrairement au cas de l’intervalle de confiance non-asymptotique vu en Section 3.2 où la
définition a un sens à n fixé, ici la définition n’a de sens que si l’on est capable de définir une suite
d’intervalles pour pouvoir parler du comportement limite. En particulier, c’est pour cela qu’ici on
souligne dans la notation In la dépendance en n de l’intervalle.
Ce type d’intervalle de confiance est moins satisfaisant, car on ne connaît pas la vitesse de
convergence de P(θ ∈ In ), donc, en pratique, quand on veut l’appliquer à des données pour un
certain n fixé, on n’est pas sûr de si ce n est suffisamment grand pour justifier l’approximation de
P(θ ∈ In ) par sa limite.
Exemple 5.2.6. Reprenons la cas d’un sondage traité dans l’exemple 5.2.6. On a Θ = [0, 1], Pθ =
B(θ) (la loi de Bernoulli de paramètre θ). Soit (Xk )k≥1 est une suite de v.a. i.i.d. de loi Pθ . Comme
E[Xk ] = θ, il est naturel d’utiliser la moyenne empirique X n = (X1 + · · · + Xn )/n pour construire
notre intervalle de confiance asymptotique. Les v.a. Xk sont dans L2 et Var(Xk ) = θ(1 − θ), donc,
par le théorème central limite (la version (5.1)), pour tout a > 0 fixé,
p ! ! Z a −x2 /2
a θ(1 − θ) X1 + · · · + Xn − nθ e
P Xn − θ ≤ √ =P p √ ≤a −−−→ √ dx.
n θ(1 − θ) n n→∞ −a 2π
On choisit alors a en terme de α ∈ ]0, 1[ de sorte que
Z a −x2 /2
e α
 
1−α= √ dx ⇔ a = Φ−1 1 − ,
−a 2π 2
en procédant comme en (5.2). Pour cette valeur de a, on a donc
" p p #!
a θ(1 − θ) a θ(1 − θ)
P θ ∈ Xn − √ , Xn + √ −−−→ 1 − α. (5.3)
n n n→∞

Mais l’intervalle ci-dessus dépend de θ ! Il faut donc choisir In de sorte qu’il contienne l’intervalle
ci-dessus pour tout θ ∈ [0, 1]. Pour cela, on remarque que maxθ∈[0,1] θ(1 − θ) = 1/4, donc on prend
a a
 
In := X n − √ , X n + √ .
2 n 2 n

75
Alors, comme P(θ ∈ In ) est supérieure à la probabilité dans (5.3), on en déduit que

lim inf P(θ ∈ In ) ≥ 1 − α.


n→∞

Donc, In est un intervalle de confiance asymptotique pour θ de niveau 1 − α.

76

Vous aimerez peut-être aussi