0% ont trouvé ce document utile (0 vote)
8 vues188 pages

Probabilités et Statistique en Cryptographie

Transféré par

marcnzomambu02
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
8 vues188 pages

Probabilités et Statistique en Cryptographie

Transféré par

marcnzomambu02
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Master de cryptographie

Probabilités et statistique
pour la théorie de l’information
Notes de cours
Dimitri Petritis

UFR Mathématiques Rennes


Janvier 2023
Dimitri Petritis
Institut de recherche mathématique de Rennes
Université de Rennes et CNRS (UMR6625)
Campus de Beaulieu
35042 Rennes Cedex
France

Mathematics subject classification (2010): 60-01 94-01

c 2012 – 2023 D. Petritis


Table des matières

1 Aléa et information 1
1.1 Rôle de l’aléa . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 1
1.2 Probabilités et intuition aléatoire . . . . . . . . . . . . . . . . . . . . . . . 3
1.3 Esquisse du problème d’estimation statistique . . . . . . . . . . . . . . . 3
1.4 Exercices . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4

I Théorie des probabilités ; statistique mathématique 7


2 Théorie élémentaire des probabilités 9
2.1 Espace de probabilité . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9
2.1.1 Espace des épreuves, espace des événements . . . . . . . . . . . . 9
2.1.2 Probabilisation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
2.2 Variables aléatoires . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 16
2.3 Exercices . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18

3 Probabilité conditionnelle et indépendance 23


3.1 Conditionnement . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 23
3.2 Indépendance . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 26
3.3 Exercices . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28

4 Espérance, variance ; théorèmes des grands nombres 31


4.1 Espérance . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
4.1.1 Cas discret . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
4.1.2 Cas continu (à densité) . . . . . . . . . . . . . . . . . . . . . . . . . 33
4.2 Variance et covariance . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 34
4.3 Fonction génératrice . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35
4.4 Fonction caractéristique . . . . . . . . . . . . . . . . . . . . . . . . . . . . 36
4.5 Théorèmes des grands nombres . . . . . . . . . . . . . . . . . . . . . . . . 37
4.6 Théorème central limite . . . . . . . . . . . . . . . . . . . . . . . . . . . . 41
4.7 Exercices . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 42

5 Chaînes de Markov sur des espaces d’états dénombrables 47


5.1 Probabilités de transition, matrices stochastiques . . . . . . . . . . . . . . 47
5.2 Temps d’arrêt. Propriété forte de Markov . . . . . . . . . . . . . . . . . . 49
5.3 Classification des états ; récurrence, transience . . . . . . . . . . . . . . . 50
5.4 Probabilité limite, probabilité invariante (stationnaire) . . . . . . . . . . . 53
5.5 Stationnarité, réversibilité . . . . . . . . . . . . . . . . . . . . . . . . . . . 56
5.6 Théorème des grands nombres pour les chaînes de Markov . . . . . . . . 58

iii
TABLE DES MATIÈRES TABLE DES MATIÈRES

5.7 Exemples d’applications algorithmiques . . . . . . . . . . . . . . . . . . . 60


5.7.1 Classification de pages internet ; algorithme PageRank . . . . . . 60
5.7.2 Algorithme de Metropolis . . . . . . . . . . . . . . . . . . . . . . . 61
5.8 Exercices . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 62

6 Notions de statistique 67
6.1 Motivation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 67
6.2 Estimation paramétrique . . . . . . . . . . . . . . . . . . . . . . . . . . . . 69
6.2.1 Estimation ponctuelle . . . . . . . . . . . . . . . . . . . . . . . . . 69
6.2.2 Estimation d’intervalles de confiance . . . . . . . . . . . . . . . . 70
6.2.3 Tests d’hypothèses . . . . . . . . . . . . . . . . . . . . . . . . . . . 72
6.3 Exercices . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 75

II Théorie de l’information 77
7 Quantification de l’information 79
7.1 Postulats d’une quantité d’incertitude, entropie . . . . . . . . . . . . . . . 79
7.2 Trois interprétations de l’entropie . . . . . . . . . . . . . . . . . . . . . . . 84
7.2.1 H est une espérance (qui nous fait vieillir !) . . . . . . . . . . . . . 84
7.2.2 H est le nombre moyen de questions nécessaires pour déterminer
la valeur que prend une variable aléatoire . . . . . . . . . . . . . . 84
7.2.3 H est le rapport des logarithmes du volume des configurations
typiques sur celui de toutes les configurations . . . . . . . . . . . 87
7.3 Propriétés de la fonction entropie, entropie relative . . . . . . . . . . . . 89
7.4 Entropie des évolutions markoviennes . . . . . . . . . . . . . . . . . . . . 91
7.5 Couples de variables aléatoires . . . . . . . . . . . . . . . . . . . . . . . . 93
7.5.1 Entropie conjointe . . . . . . . . . . . . . . . . . . . . . . . . . . . 93
7.5.2 Entropie conditionnelle . . . . . . . . . . . . . . . . . . . . . . . . 94
7.5.3 Information mutuelle . . . . . . . . . . . . . . . . . . . . . . . . . 94
7.6 Registres de stockage de l’information . . . . . . . . . . . . . . . . . . . . 95
7.7 Irreversibilité et principe de Landauer . . . . . . . . . . . . . . . . . . . . 97
7.8 Exercices . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 103

8 Sources et leur codage 107


8.1 Sources . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 107
8.2 Codes uniquement décodables . . . . . . . . . . . . . . . . . . . . . . . . 108
8.3 Théorème de Shannon sur le codage sans bruit . . . . . . . . . . . . . . . 112
8.3.1 Inégalité de Kraft . . . . . . . . . . . . . . . . . . . . . . . . . . . . 112
8.3.2 Codes optimaux . . . . . . . . . . . . . . . . . . . . . . . . . . . . 113
8.3.3 Algorithme de Huffman pour la construction de codes optimaux 116
8.3.4 Examen critique du code de Huffman . . . . . . . . . . . . . . . . 118
8.4 Autres types de codes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 119
8.4.1 Le code arithmétique de Shannon-Fano-Elias . . . . . . . . . . . . 119
8.4.2 Codage universel et algorithme de Lempel-Ziv . . . . . . . . . . . 122
8.5 Exercices . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 126

/Users/dp/a/ens/[Link] iv
2023-01-02 • 09:41:54.
TABLE DES MATIÈRES TABLE DES MATIÈRES

9 Canaux bruités sans mémoire 129


9.1 Modélisation markovienne . . . . . . . . . . . . . . . . . . . . . . . . . . . 129
9.2 Classification des canaux . . . . . . . . . . . . . . . . . . . . . . . . . . . . 130
9.2.1 Canaux sans perte . . . . . . . . . . . . . . . . . . . . . . . . . . . 130
9.2.2 Canaux déterministes . . . . . . . . . . . . . . . . . . . . . . . . . 131
9.2.3 Canaux sans bruit . . . . . . . . . . . . . . . . . . . . . . . . . . . 132
9.2.4 Canaux inutiles . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 132
9.2.5 Canaux symétriques . . . . . . . . . . . . . . . . . . . . . . . . . . 132
9.3 Capacité du canal, propriétés de la capacité . . . . . . . . . . . . . . . . . 133
9.4 Un exemple illustratif simple . . . . . . . . . . . . . . . . . . . . . . . . . 134
9.5 Le théorème fondamental de la transmission . . . . . . . . . . . . . . . . 135
9.5.1 Codage du canal bruité . . . . . . . . . . . . . . . . . . . . . . . . 135
9.5.2 Probabilité d’erreur de transmission . . . . . . . . . . . . . . . . . 137
9.5.3 Le théorème fondamental de la transmission . . . . . . . . . . . . 138
9.5.4 Démonstration du théorème 9.5.4 . . . . . . . . . . . . . . . . . . 140
9.6 Exercices . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 143

10 Chiffrement 149
10.1 Sécurité des communications . . . . . . . . . . . . . . . . . . . . . . . . . 149
10.1.1 Les exigences du chiffrement . . . . . . . . . . . . . . . . . . . . . 150
10.1.2 Les niveaux de sécurité . . . . . . . . . . . . . . . . . . . . . . . . 150
10.2 Le chiffrement comme code . . . . . . . . . . . . . . . . . . . . . . . . . . 152
10.2.1 Code de Vernam (one-time pad) . . . . . . . . . . . . . . . . . . . . 152
10.2.2 Le rôle essentiel des nombres aléatoires . . . . . . . . . . . . . . . 155
10.3 Authentification . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 155
10.3.1 Illustration du problème et notation . . . . . . . . . . . . . . . . . 156
10.3.2 Minoration de la probabilité de fraude (cas de substitution) . . . 156
10.3.3 Minoration de la probabilité de fraude (cas d’usurpation d’identité)157
10.4 Qu’est-ce la cryptographie post-quantique ? . . . . . . . . . . . . . . . . . 159
10.5 Exercices . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 160

11 Codes correcteurs d’erreur 161


11.1 Structure algébrique des codes . . . . . . . . . . . . . . . . . . . . . . . . 161
11.2 Structure géométrique des codes . . . . . . . . . . . . . . . . . . . . . . . 162
11.2.1 Métrisation de Hamming . . . . . . . . . . . . . . . . . . . . . . . 162
11.2.2 Matrice génératrice . . . . . . . . . . . . . . . . . . . . . . . . . . . 163
11.2.3 Matrice de contrôle de parité . . . . . . . . . . . . . . . . . . . . . 165
11.3 Décodage . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 166
11.3.1 Maximum de vraisemblance . . . . . . . . . . . . . . . . . . . . . 166
11.3.2 Décodage par partition . . . . . . . . . . . . . . . . . . . . . . . . . 170
11.3.3 Décodage par syndrome . . . . . . . . . . . . . . . . . . . . . . . . 172
11.4 Exercices . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 173

Références 176

Index 182

/Users/dp/a/ens/[Link] v
2023-01-02 • 09:41:54.
TABLE DES MATIÈRES TABLE DES MATIÈRES

/Users/dp/a/ens/[Link] vi
2023-01-02 • 09:41:54.
Aléa et information
1
Des nos jours, le codage, le stockage, la transmission, le traitement, l’extraction et le
chiffrement de l’information se font de manière algorithmique sur des messages numé-
riques que nous pouvons toujours considérer comme des suites de bits. On peut donc
légitimement s’interroger qu’ont à faire les probabilités et la statistique — branches
mathématiques étudiant le caractère aléatoire des phénomènes — dans cet univers al-
gorithmique.

1.1 Rôle de l’aléa


De manière générale, il y a plusieurs phénomènes purement déterministes qui pré-
sentent une indétermination aléatoire. Par exemple le lancer d’une pièce est une ex-
périence déterministe, l’aléa résulte de l’imprécision dans la définition de la condi-
tion initiale. Un système dynamique chaotique est un objet purement déterministe ; le
comportement aléatoire est dû à l’imprécision avec laquelle on peut représenter des
fonctions très irrégulières. La mesure d’une grandeur est un processus déterministe ;
l’aléa dans l’estimation de la valeur et la probabilité que l’on attache à cette estimation
(intervalle de confiance) est dû à l’imprécision inhérente à toute mesure physique.
Plus spécifiquement, il s’avère que les probabilités interviennent dans tous les étapes
de la vie de l’information, tantôt de manière fondamentale pour définir la notion même
d’information, tantôt comme modélisation d’une nuisance externe ou d’une richesse
algorithmique, tantôt comme outil de chiffrement ; la statistique intervient tantôt de
manière fondamentale pour définir la notion d’extraction d’information, tantôt comme
outil d’estimation, tantôt comme outil de quantification de la confiance que nous atta-
chons à nos prévisions.
En guise de motivation, quelques exemples de l’utilité de probabilités et de la sta-
tistique en théorie de l’information sont donnés ci-dessous :
— Quelle est la quantité d’information contenue dans une suite de bits ? Pour ré-
pondre à cette question, considérons le bit codant le résultat d’une expérience
de pile (0) ou face (1) provenant du lancer d’une pièce honnête. L’incertitude
avant que le résultat de l’expérience nous soit révélé est totale (100%). Après

1
1.1. Rôle de l’aléa Aléa et information

que le résultat nous soit révélé, l’incertitude est nulle. L’information contenue
dans le bit correspondant au résultat du lancer d’une pièce honnête est égale à
la réduction de l’incertitude après révélation du résultat. Nous verrons au cha-
pitre 7 que pour une pièce arbitraire, donnant face avec probabilité p ∈ [0, 1],
l’information contenue dans le bit codant le résultat du lancer est la quantité

H ( p) = − p log2 p − (1 − p) log2 (1 − p) ∈ [0, 1], (avec 0 log2 0 = 0),

connue sous le nom d’entropie ou quantité d’information [63, 41]. Remarquer


que H (1/2) = 1.
— Même si la suite de bits est construite de manière totalement déterministe (cor-
respondant au cas p = 0, 1 dans l’exemple ci-dessus), pour être utilisée, elle doit
être stockée dans un vecteur physique (laser, courant électrique, signal hertzien,
molécule d’ADN) et propagée à travers un canal physique (fibre optique, câble,
atmosphère, cellule). Le canal introduit nécessairement du bruit de sorte que la
suite des bits reçus est toujours une suite aléatoire. Nous verrons dans le cha-
pitre 9 que si le bruit du canal est un bruit symétrique, i.e.

P(bit transmis = 1|bit émis = 0) = P(bit transmis = 0|bit émis = 1) = p ∈ [0, 1],

alors la capacité du canal est C ( p) = 1 − H ( p) [64]. On remarque que si p = 1/2,


le canal symétrique correspondant est totalement inutile car il ne peut trans-
mettre aucune information !
— Une autre utilité des probabilités intervient dans les opérations de chiffrement.
Supposons que nous voulions transmettre une suite de n bits. Si nous lui su-
perposons une autre suite — la clé de chiffrement — de n bits aléatoires (par
addition bit par bit modulo 2), la suite ainsi obtenue devient une suite pure-
ment aléatoire. Gilbert Vernam a déposé en 1919 le brevet US1310719 qui pro-
posa une réalisation physique de ce chiffrement. Il a été démontré par Shannon
durant la 2e guerre mondiale (et publié ultérieurement [64]) que le chiffrement
de Vernam, pourvu que la suite de chiffrement soit utilisée une seule fois, est
inviolable. La fonction entropie est de nouveau présente dans les estimations
utilisées par Shannon pour montrer ce résultat (cf. chapitre 10).
— Les codes correcteurs d’erreur permettent de détecter et/ou corriger certaines
erreurs de transmission. Cependant, l’utilisation d’un code correcteur dégrade
nécessairement le taux de transmission d’un message car des ressources sont
mobilisées pour transmettre les bits supplémentaires qui servent à la détec-
tion/correcion des erreurs. Nous verrons au chapitre 11 qu’ il existe une fron-
tière dans le plan probabilité d’erreur résiduelle / taux de transmission, appelée
frontière de Shannon, au delà de laquelle il n’est pas possible de transmettre de
message. La forme de cette frontière est encore déterminée par la fonction d’en-
tropie [23, 24].
Cette liste d’exemples d’utilisation des probabilités en théorie de l’information est loin
d’être exhaustive. Plusieurs autres aspects de la théorie (codage de la source, codage
du canal, reconstitution du message, etc.) nécessitent l’utilisation de méthodes proba-
bilistes.
Quant à l’utilité de la statistique, elle est vaste. Mentionons ici seulement les aspects
inférentiels, c’est-à-dire comment à partir d’un nombre fini d’observations (ou de me-
sures) pouvons-nous inférer (déterminer, prédire) les valeurs des grandeurs observées
et comment déterminer des intervalles de confiance pour nos prédictions.

/Users/dp/a/ens/[Link] 2
2022-08-30 • 11:36:05.
Aléa et information 1.2. Probabilités et intuition aléatoire

1.2 Probabilités et intuition aléatoire


Lorsque nous lançons une pièce honnête, il est intuitivement clair que nous nous
attendons à obtenir pile avec « probabilité » 50% et face avec la même probabilité et ceci
malgré le fait que le lancer de la pièce est une opération purement déterministe, régie
par les équations de la mécanique newtonienne. L’aléa ne traduit que la connaissance
incomplète de la condition initiale et des caractéristiques mécaniques de l’usinage de
la pièce.
Dans la phrase précédente, nous n’avons pas définie le terme « probabilité ». La si-
gnification intuitive que nous donnons est que si nous répétons l’expérience N fois (ou
que nous faisons l’expérience en lançant simultanément N pièces identiques) et nous
N ( F)
notons N ( F ) le nombre de fois que nous obtenons « face », le rapport P N ( F ) = N
tend vers P( F ) = 1/2 lorsque N → ∞. Nous assignons alors le nombre P( F ) à la
« probabilité d’obtenir face ». Dans cette approche, la notion de probabilité est alors
identifiée à la notion de la limite de la fréquence relative de réalisation de l’événement
F = « obtenir face » = {face}, F étant considéré comme partie d’un ensemble univer-
sel Ω = {pile,face} de tous les résultats possibles de l’expérience qui consiste à lancer
une pièce.
La formulation axiomatique [42] de la théorie des probabilités introduit la notion
d’espace probabilisé comme étant le couple 1 (Ω, P) où Ω est un ensemble universel
de tous les résultats possibles d’une expérience et P une fonction qui à chaque partie
F ⊆ Ω associe un nombre P( F ) ∈ [0, 1], sa probabilité. L’interprétation fréquentielle
devient alors un théorème de la théorie des probabilités, connu sous le nom de loi des
grands nombres (cf. chapitre 4).

1.3 Esquisse du problème d’estimation statistique


Il n’est pas aisé de donner une description des problématiques et des méthodes de
la statistique mathématique sans une exposition préalable de la théorie des probabi-
lités. C’est pourquoi dans ce chapitre introductif, nous nous limitons à présenter un
exemple concret.
Supposons que nous disposions d’une pièce qui donne « face » avec une probabi-
lité θ fixe mais inconnue. Nous voulons estimer cette valeur en effectuant une expé-
rience avec cette pièce. Par exemple, on peut la lancer N fois (N est nécessairement
fini pour que l’expérience soit physiquement réalisable), on note Xn ∈ {0, 1} le résultat
de chaque lancer et on calcule
N
1
θN =
N ∑ 1{0} ( Xn ).
n =1
On verra que θ N est un estimateur asymptotique de θ dans le sens que lim N →∞ θ N = θ
(la limite a lieu dans un certain sens qui sera précisé dans ce cours) et que pour un
certain seuil de confiance c, on peut trouver un intervalle de confiance 2 IN = [θ N −
1. Nous verrons dans le chapitre 2 que cette construction n’est pas possible si Ω n’est pas dé-
nombrable ; la construction de la fonction P n’est en général possible que sur une famille spécifique
F ⊂ P (Ω), appelée tribu. Le choix de F = P (Ω) n’est possible que dans le cas dénombrable ; dans le
cas non-dénombrable, les tribus F utiles sont beaucoup plus petites que P (Ω) (cf. théorème 2.1.13). Un
espace probabilisé sera donc la donnée du triplet (Ω, F , P) et non du couple (Ω, P).
2. Cet intervalle est aléatoire.

/Users/dp/a/ens/[Link] 3
2022-08-30 • 11:36:05.
1.4. Exercices Aléa et information

a N , θ N + a N ] tel que la probabilité pour que la vraie valeur (déterministe) θ appartienne


dans IN dépasse le seuil c, c’est-à-dire P(θ ∈ IN ) ≥ c.

1.4 Exercices
Le premier exercice est purement combinatoire ; nous introduisons les 4 types de
dénombrement. Pour les exercices sur les probabilités élémentaires de ce chapitre, nous
laissons de côté les questions de définition de la notion de probabilité en nous limitant
à la définition empirique (fréquentielle) des probabilités exposée plus haut. Dans ce
contexte, les probabilités de ces exercices se calculent comme des rapports de cardi-
naux.

Les quatre types de dénombrement


1. On rappelle les quatre types de dénombrement :
— n tirages discernables à choisir parmi M possibilités avec remise (n > 0, M >
0) :
Ω1 = {ω = (ω1 , . . . , ωn ); ωi ∈ {1, . . . , M}, i = 1, . . . , n}.
cardΩ1 = Mn .
— n tirages discernables à choisir parmi M possibilités sans remise (0 < n ≤
M) :

Ω2 = {ω = (ω1 , . . . , ωn ); ωi ∈ {1, . . . , M}, i = 1, . . . , n; ωi 6= ω j , pour i 6= j}.

cardΩ2 = ( MM!
−n)!
.
— n tirages indiscernables à choisir parmi M possibilités avec remise (n >
0, M > 0) :

Ω3 = {ω = [ω1 , . . . , ωn ]; ωi ∈ {1, . . . , M }, i = 1, . . . , n}.

cardΩ3 = Cnn+ M−1 .


— n tirages indiscernables à choisir parmi M possibilités sans remise (0 < n ≤
M) :

Ω4 = {ω = [ω1 , . . . , ωn ]; ωi ∈ {1, . . . , M}, i = 1, . . . , n; ωi 6= ω j , pour i 6= j}.


M! n .
cardΩ4 = n!( M −n)!
= CM
Pour chacun de ces quatres types,
(a) démontrer les formules des cardinaux,
(b) donner un exemple concret d’application.

Événements et ensembles
2. Sous quelles conditions les événements A et B satisfont l’égalité A = A ∪ B ?
L’égalité A = A ∩ B ?
3. Soit ( Ai )i∈ I une collection d’ensembles. Déterminer (∪i∈ I Ai )c et (∩i∈ I Ai )c .
4. La figure suivante décrit un circuit électrique entre les points 1 et 2 comportant
les fusibles a, b1 , b2 et b3 qui peuvent tomber en panne.

/Users/dp/a/ens/[Link] 4
2021-08-19 • 17:06:16.
Aléa et information 1.4. Exercices

b1

1 a b2 2

b3

Noter A (resp. Bi ) les événements : « le fusible a (resp. le fusible bi ) est en panne »,


pour i = 1, 2, 3 et C l’événement « le courant passe de 1 à 2 ». Déterminer C c et
C en termes des événements A, B1 , B2 et B3 .
5. Une cible est constituée de 10 disques concentriques de rayons rk , k = 1, . . . , 10.
L’événement Ak signifie « le projectile a touché la cible à l’intérieur du disque de
rayon rk », pour k = 1, . . . , 10. Quelle est la signification des événements B et C
définis par
B = ∪5k=1 Ak et C = ∩10
k =1 A k ?

6. 20 chevaux sont au départ d’une course. Trouver le nombre de tiercés, de quar-


tés, de quintés dans l’ordre et dans le désordre.

Probabilités élémentaires
7. Un ouvrage de 4 volumes est placé dans un ordre aléatoire sur le rayonnage
d’une bibliothèque. Quelle est la probabilité que les 4 volumes soient placés
dans l’ordre (ascendant ou descendant) ? Rép. : 1/12.
8. Toutes les faces d’un cube en bois sont peintes. Ensuite le cube est découpé (se-
lon des plans parallèles à ses faces) en 1000 cubes identiques. Un petit cube
est choisi au hasard ; quelle est la probabilité qu’il comporte exactement 2 faces
peintes ? Rép. : 0,096.
9. Dix livres sont placés dans un ordre aléatoire sur un rayonnage. Quelle est la
probabilité que trois livres spécifiques se retrouvent côte-à-côte ? Rép. : 1/15.
10. Un sac contient 5 bâtonnets de longueurs 1, 3, 5, 7 et 9. On en extrait 3. Quelle est
la probabilité que l’on puisse construire un triangle ayant ces bâtonnets comme
côtés ? Rappel : La longueur d’un côté d’un triangle ne peut pas excéder la somme des
longueurs des autres côtés.
11. Supposons qu’un entier entre 1 et 1000 est choisi au hasard. Quelle est la pro-
babilité que les 2 derniers digits décimaux de son cube soient 1 ? Suggestion : Il
n’est pas nécessaire de consulter une table des cubes des tous les entiers entre 1 et 1000.
Rép. : 0,01.
12. Quelle est la probabilité qu’au moins deux étudiants suivant un cours auquel
N étudiants sont inscrits (N ≥ 2) aient leur anniversaire le même jour ? On
néglige les années bissextiles et on suppose que tous les jours de l’année sont
équiprobables en tant que jour de naissance.
13. Une tombola comporte M tickets dont n (avec M ≥ 2n) sont gagnants. Une
personne achète n tickets. Quelle est la probabilité pour qu’elle gagne au moins
un lot ?

/Users/dp/a/ens/[Link] 5
2021-08-19 • 17:06:16.
1.4. Exercices Aléa et information

14. On gagne (au premier rang) une loterie si l’on coche 6 bons numéros parmi les
49 que comporte une grille. Quelle est la probabilité de gagner cette loterie au
premier rang ?

/Users/dp/a/ens/[Link] 6
2022-08-30 • 11:36:05.
Première partie

Théorie des probabilités ; statistique


mathématique

7
Théorie élémentaire des probabilités
2
Nous présentons la théorie telle qu’elle a été formulée par Kolmogorov [42] et nous
nous inspirons librement des exposés pédagogiques [29, 61, 65, 69], en particulier pour
le choix de certains exemples. Les livres [2, 8, 52] peuvent utilement être consultés mais
sont mathématiquement plus exigeants.
La formulation de Kolmogorov est une construction mathématique abstraite. Ce-
pendant, déjà dans l’œuvre originale [42] transparaît une forte intuition expérimen-
tale ; pour comprendre les notions de base de la théorie, il est très utile de nous servir
des modèles venant d’autres domaines de mathématiques ou de la physique.
La présentation naturelle de la théorie requiert la théorie de la mesure. Dans la suite
nous essaierons de donner une présentation élémentaire i.e. qui ne fait pas appel à la
théorie de la mesure.

2.1 Espace de probabilité


2.1.1 Espace des épreuves, espace des événements
Épreuves
Lors d’une expérience aléatoire, on note Ω l’ensemble de tous les résultats possibles
et imaginables. Les éléments de Ω sont notés ω et appelés épreuves. L’espace des
épreuves Ω peut être dénombrable (fini ou infini) ou non dénombrable et s’appelle
aussi univers.

Événements
Les parties de Ω — plus précisément certaines parties de Ω — sont appelés évé-
nements ; Ω lui-même est toujours un événement (l’événement certain) ainsi que ∅
(l’événement impossible). Intuitivement, un événement est un ensemble d’épreuves
qui vérifient une propriété. Si la famille A ⊆ P (Ω) est une famille d’événements, il est
naturel de demander qu’elle constitue une algèbre.

9
2.1. Espace de probabilité Théorie élémentaire des probabilités

Définition 2.1.1. Une famille A de parties de Ω est une algèbre si


1. Ω ∈ A,
2. A ∈ A ⇒ Ac ∈ A (stabilité par complémentation) et
3. A1 , A2 ∈ A ⇒ A1 ∪ A2 ∈ A (stabilité aux réunions finies).

Remarque 2.1.2. De la définition 2.1.1 d’une algèbre A sur Ω découlent immédiate-


ment les faits suivants :
1. ∅ ∈ A et
2. A1 , A2 ∈ A ⇒ A1 ∩ A2 ∈ A (stabilité aux intersections finies).

Exemple 2.1.3 (Pile ou face). L’espace des épreuves pour le lancer d’une pièce est
Ω = {pile, face} ≡ {0, 1}. La famille A = P (Ω) est une algèbre qui correspond à tous
les événements possibles.

Exemple 2.1.4 (Pile ou face répété n fois). L’espace des épreuves pour cette expérience
est Ω = {ω = (ω1 , . . . , ωn ) : ωi ∈ {0, 1}, i = 1, . . . , n} ≡ {0, 1}n . On remarque que
cardΩ = 2n . La famille A = P (Ω) est une algèbre qui correspond à tous les événements
n
possibles ; elle a cardA = 22 .

Exemple 2.1.5 (Pile ou face répété indéfiniment). Parfois on s’intéresse à des suites
infinies d’expériences (par exemple une suite de bits indéfiniment longue). L’espace
des épreuves pour cette expérience est Ω = {ω = (ω1 , ω2 , . . .) : ωi ∈ {0, 1}, i ∈ N} ≡
{0, 1}N . On remarque que cardΩ = 2ℵ0 = c (donc Ω ∼= R).

Remarque 2.1.6. Le dernier exemple établit que si nous voulons considérer des limites
de suites — considérer la suite donc dans son intégralité — nous sommes obligés de
sortir du cadre discret.

Lorsque l’espace Ω est dénombrable infini (ou a fortiori non dénombrable), il est na-
turel de demander la stabilité de la famille des événements aux réunions (intersections)
dénombrables. Ceci nous amène à la

Définition 2.1.7. Une famille F de parties de Ω est dite une tribu (ou σ-algèbre) si elle
est une algèbre et vérifie la propriété de stabilité aux intersections dénombrables :

[∀n ∈ N, An ∈ F ] ⇒ [∪n∈N An ∈ F ].

Exemple 2.1.8. Soit Ω un ensemble arbitraire. Alors F1 = {∅, Ω} et F2 = P (Ω) sont


des tribus. F1 est appelée tribu grossière, F2 est appelée tribu exhaustive. Lorsque
cardΩ = N, alors cardP (Ω) = 2 N . Lorsque cardΩ = ℵ0 alors cardP (Ω) = c. Lorsque
cardΩ = c alors cardP (Ω) = 2c ce qui montre que la tribu exhaustive dans le cas d’un
espace des épreuves avec la puissance du continu est un objet énorme (dit aussi non-
énumerable).

Définition 2.1.9. Soit Ω un espace des épreuves et F une tribu sur Ω. Le couple (Ω, F )
est appelé espace des événements (ou espace mesurable dans la terminologie de la
théorie de la mesure).

/Users/dp/a/ens/[Link] 10
2022-08-30 • 11:37:23.
Théorie élémentaire des probabilités 2.1. Espace de probabilité

2.1.2 Probabilisation
Définition 2.1.10. Soit (Ω, F ) un espace des événements. Supposons qu’il existe une
application P : F → [0, 1] vérifiant
1. P(Ω) = 1 (normalisation de la masse totale) et
2. [∀n ∈ N, An ∈ F et Am ∩ An = ∅, m 6= n] ⇒ [P(∪n∈N An ) = ∑n∈N P( An )]
(additivité dénombrable disjointe dite aussi σ-additivité disjointe).
Alors P est appelée (mesure de) probabilité sur (Ω, F ) et le triplet (Ω, F , P) est alors
appelé espace probabilisé.

Proposition 2.1.11. Supposons que Ω est dénombrable (fini ou infini) et qu’il existe une
application ρ : Ω → [0, 1] telle que ∑ω ∈Ω ρ(ω ) = 1. Alors ρ définit une mesure de probabilité
P sur (Ω, F ), où F = P (Ω), par

F 3 A 7 → P( A ) = ∑ ρ(ω ) ∈ [0, 1].


ω∈ A

Reciproquement, si P est une probabilité sur (Ω, P (Ω)) et Ω est dénombrable, alors il existe
ρ : Ω → [0, 1] telle que ∑ω ∈Ω ρ(ω ) = 1 permettant de définir P comme ci-dessus. (En fait
ρ(ω ) = P({ω }) pour tout ω ∈ Ω).

Démonstration. Cf. exercice 20.


L’application ρ de la proposition précédente est appelée vecteur de probabilité ou
densité discrète de P. Cette proposition établit en outre une bijection entre les mesures
de probabilités sur les espaces dénombrables et les vecteurs de probabilité.

Exemple 2.1.12. Probabilité sur des ensembles discrets.


1. Soient Ω = {1, 2, 3, 4, 5, 6} et ρ(ω ) = 1/6 = 1/card(Ω) pour tout ω ∈ Ω.
Ce vecteur de probabilité définit une probabilité uniforme sur (Ω, P (Ω)) cor-
respondant à un dé honnête. Noter qu’une probabilité uniforme P sur un en-
semble fini Ω s’exprime alors nécessairement comme un rapport de cardinaux :
card( A)
P( A) = card(Ω) , pour tout A ∈ P (Ω).
2. Soient Ω = {1, 2, 3, 4, 5, 6} et p(1) = p(6) = 1/4 et p(2) = p(3) = p(4) =
p(5) = 1/8 définit une probabilité non-uniforme sur (Ω, P (Ω)) correspondant
à un dé lesté qui donne 6 (ou 1) deux fois plus fréquemment que les autres faces.
3. Soient Ω = N et ρ(ω ) = 1/2ω +1 . Ce vecteur de probabilité définit une proba-
bilité non-uniforme sur (Ω, P (Ω)). Noter qu’il n’est pas possible de définir une
probabilité uniforme sur un ensemble dénombrable infini.

L’exercice 21 montre que l’ensemble fini Ω = {0, 1}n peut être probabilisé par un
vecteur de probabilité vérifiant en outre la propriété d’invariance à l’application Tk
« renversement du ke bit » définie par

Ω 3 ω = (ω1 , . . . , ωn ) 7→ Tk (ω ) = ((ω1 , . . . , ωk−1 , 1 − ωk , ωk+1 , . . . , ωn ), k = 1, . . . , n.

Cette construction ne peut pas s’étendre au cas Ω = {0, 1}N comme le montre le

Théorème 2.1.13 (Vitali 1905). Soit Ω = {0, 1}N l’ensemble des suites infinies de bits. Il
n’existe pas d’application P : P (Ω) → [0, 1] vérifiant sumultanément
— (normalisation) : P(Ω) = 1,

/Users/dp/a/ens/[Link] 11
2022-08-30 • 11:37:23.
2.1. Espace de probabilité Théorie élémentaire des probabilités

— (additivité dénombrable disjointe) : si ( An ) est une suite d’événements mutuellement


disjoints, P(tn∈N An ) = ∑n∈N P( An ),
— (invariance aux renversements des bits) : si A ∈ P (Ω) alors P( Tk A) = P( A) pour
tout k.
La démonstration fait appel à l’axiome de choix 1 , rappelé en 2.1.14 ; elle peut être omise en première
lecture.

Axiome 2.1.14 (de choix). Pour toute collection C d’ensembles non-vides, il existe une fonction de choix
définie sur C qui à chaque ensemble A ∈ C associe un élément de cet ensemble. Plus précisément :

∀C[∅ 6∈ C ⇒ ∃ f : C → ∪C t.q. ∀ A ∈ C , ( f ( A) ∈ A].

Démonstration du théorème 2.1.13. On introduit une relation d’équivalence sur Ω en décrétant que deux
suites ω, ω 0 ∈ Ω sont équivalentes si elles sont identiques à partir d’une certaine position, i.e.

[ω ∼ ω 0 ] ⇔ [∃n0 ∈ N : ωn = ωn0 , ∀n ≥ n0 ].

Par l’axiome de choix, il existe une partie A ⊆ Ω qui contient exactement un élément de chaque classe
d’équivalence de Ω/ ∼.
On note S = {S ⊂ N : cardS < ∞} ⊆ t`∈N S` , où S` = {S ⊂ N : max S = `}. De toute évidence,
S est dénombrable. Si S ∈ S , on définit TS = ◦k∈S Tk (l’ordre de composition des fonctions est sans
importance car les applications Tk et Tk0 commutent pour k 6= k0 ). On observe que
— La famille ( TS A)S∈S est composée de parties deux-à-deux disjoints. En effet, supposons que
TS A ∩ TS0 A 6= ∅ pour S, S0 ∈ S . Il existe alors ω, ω 0 ∈ A tels que TS ω = Ts0 ω 0 . Nous aurons
alors,
ω ∼ TS ω = Ts0 ω 0 ∼ ω 0 .
Par le choix de A, ceci signifie que ω = ω 0 et par conséquent S = S0 .
— Par ailleurs Ω = tS∈S TS A, car, en effet, pour tout ω ∈ Ω, il existe ω 0 ∈ A, tel que ω ∼ ω 0 . Par
conséquent, il existe un S ∈ S tel que ω = TS ω 0 ∼ ω 0 ∈ TS A.
— En utilisant successivement les propriétés de normalisation, d’additivité dénombrable disjointe
et d’invariance aux renversements des bits, nous arrivons à la conclusion absurde :

1 = P( Ω ) = ∑ P(TS A) = ∑ P( A) ∈ {0, ∞}.


S∈S S∈S

Remarque 2.1.15. Dans le théorème précédent, cardΩ = c ; ce que nous apprend ce


théorème est qu’il n’est pas possible d’avoir une mesure de probabilité, invariante aux
renversements de bits, sur la tribu exhaustive P (Ω) lorsque l’ensemble Ω a le cardinal
du continu. L’introduction de la notion abstraite de tribu nous permet de définir une
probabilité pour certaines tribus plus petites que la tribu exhaustive. L’ensemble A, dans
la démonstration précédente, est un ensemble de Vitali ; il fournit un exemple concret
d’ensemble non mesurable (voir remarque 2.1.17 plus loin).
Dans l’exercice 18 nous introduisons la notion de tribu engendrée par une famille
arbitraire (non-vide) A de parties de P (Ω) comme étant la plus petite tribu qui contient
A — notée σ(A).
Définition 2.1.16 (Tribu borélienne). Soient Ω = Rd , pour d ≥ 1 entier, et
d
R d = { ∏ [ a i , bi ] : a i < bi , a i , bi ∈ Q } ,
i =1

1. L’axiome de choix a été introduit par Zermelo en 1904 pour formaliser la théorie axiomatique des
ensembles.

/Users/dp/a/ens/[Link] 12
2022-08-30 • 11:37:23.
Théorie élémentaire des probabilités 2.1. Espace de probabilité

le système de pavés rectangulaires avec des arêtes parallèles aux axes et sommets avec
des coordonnées rationnelles. La tribu σ (Rd ) engendrée par cette famille est appelée
tribu borélienne sur Rd et notée Bd := B(Rd ). (Lorsque d = 1, nous abrégeons la
notation en B ). Les événements de Bd sont appelés boréliens.

Remarque 2.1.17. La tribu Bd est beaucoup plus grosse que l’on pouvait supposer à
première vue. En particulier elle contient les classes
— des ouverts ;
— des fermés ;
— Gδ (intersections dénombrables d’ouverts) ;
— Fσ (réunions dénombrables de fermés) ;
— Gδσ (réunions dénombrables d’éléments de Gδ ) ;
— Fσδ (réunions dénombrables d’éléments de Fσ )
— ...
Pour les besoins de ce cours il est suffisant de connaître que toutes les parties de Rd
que nous rencontrons en pratique sont boréliennes. Montrer l’existence de parties non-
boréliennes n’est pas tâche aisée, il faut recourir à l’axiome du choix. On peut en don-
ner une en s’inspirant de la démonstration du théorème 2.1.13 ; on peut en trouver une
dans [8, pp. 24–28] par exemple.

Définition 2.1.18 (Tribu produit). Soient (Ωn , Fn )n∈N une suite d’espaces mesurables,
Ω = ×n∈N Ωn et R = ×n∈N Fn . La tribu F = σ(R) sur Ω, engendrée par le produit
cartésien R de tribus est appelée tribu produit et notée F = ⊗n∈N Fn .

Théorème 2.1.19 (Propriétés de P). Toute mesure de probabilité P sur un espace d’événe-
ments (Ω, F ) vérifie les propriétés suivantes pour des événements arbitraires A, B, A1 , A2 , . . . ∈
F:
1. P(∅) = 0.
2. Additivité finie. P( A ∪ B) + P( A ∩ B) = P( A) + P( B). En particulier P( A) +
P( Ac ) = 1.
3. Monotonie. Si A ⊆ B alors P( A) ≤ P( B).
4. σ-sous-additivité. P(∪n∈N An ) ≤ ∑n∈N P( An ).
5. σ-continuité monotone. Si soit An ↑ A soit An ↓ A (i.e. la suite ( An ) est soit croissante
avec réunion A soit décroissante avec intersection A), alors P( An ) −−−→ P( A).
n→∞

Démonstration. 1. Puisque l’ensemble vide est disjoint de tout événement, donc de


lui-même, la suite constante ∅, ∅, ∅, . . . est composée d’événements mutuelle-
ment disjoints. La propriété de additivité dénombrable disjointe de P (propriété
2, déf. 2.1.10) devient

P( ∅ ) = P( ∅ ∪ ∅ ∪ . . . ) = ∑ P( ∅ ).
n ∈N

Cette égalité n’est possible que si P(∅) = 0.


2. Supposons pour commencer que A et B sont disjoints. Or la propriété 2 de la
définition 2.1.10 requiert une suite infinie d’événements disjoints. On complète
donc par des ensembles vides et on a

P( A ∪ B ) = P( A ∪ B ∪ ∅ ∪ ∅ ∪ . . . ) = P( A ) + P( B ) + 0 + 0 + . . . .

/Users/dp/a/ens/[Link] 13
2022-08-30 • 11:37:23.
2.1. Espace de probabilité Théorie élémentaire des probabilités

Dans le cas général, nous décomposons

P( A ∪ B) + P( A ∩ B) = P( A \ B) + P( B \ A) + 2P( A ∩ B) = P( A) + P( B).

Le cas particulier s’obtient en posant B = Ac et en utilisant la condition de


normalisation (propriété 1, déf. 2.1.10).
3. Si A ⊆ B, alors de la propriété d’additivité finie établie en 2, on obtient P( B) =
P( A) + P( B \ A) ≥ P( A) car les probabilités sont toujours positives.
4. Toute réunion ∪n∈N An peut s’écrire comme réunion d’événements mutuelle-
ment disjoints : On aura alors

P(∪n∈N An ) = P(tn∈N ( An \ ∪m<n Am ) = ∑ P( A n \ ∪ m < n A m ) ≤ ∑ P( A n ).


n ∈N n ∈N

5. Supposons que An ↑ A ; alors nécessairement A ∈ F (pourquoi ?). Sans perte de


généralité, on peut supposer que A0 = ∅. On a alors

P( A) = P(tn≥1 ( An \ An−1 )) = ∑ P ( A n \ A n −1 )
n ≥1
N
= lim
N →∞
∑ P( An \ An−1 ) = Nlim
→∞
P( A N ).
n =1

Le cas de suite décroissante est laissé en exercice.

Pour montrer que deux probabilités P et P0 sur (Ω, F ) coïncident, il faut montrer
qu’elles coïncident sur tous les éléments de la tribu F . Or, nous avons vu que les tribus
sont des objets compliqués, difficilement maniables. Le théorème suivant nous donne
un moyen très efficace de montrer plusieurs propriétés de probabilités sans avoir re-
cours explicitement à la tribu sous-jacente.

Théorème 2.1.20 (Théorème d’unicité). Soit (Ω, F , P) un espace de probabilité et suppo-


sons que F = σ(G) où G ⊆ P (Ω) est une famille génératrice stable par intersections finies.
Alors P est uniquement déterminée par sa restriction PG .

La démonstration de ce théorème peut être omise dans le cadre de ce cours ; elle


peut être trouvée dans [29, Théorème 1.12], par exemple.
Nous sommes maintenant en mesure de construire une probabilité sur un espace
non-dénombrable.

Proposition 2.1.21. Soit Ω = Rd , muni de sa tribu borélienne. Supposons qu’il existe ρ :


Ω → R+ vérifiant les propriétés :
1. ´pour tout c > 0, on a {ρ ≤ c} := {ω ∈ Ω : ρ(ω ) ≤ c} ∈ Bd ,
2. Ω ρ(ω )dω1 · · · dωd = 1.
Alors, il existe une unique probabilité P sur (Rd , Bd ), définie par
ˆ ˆ
P( B ) = ρ(ω )λd (dω ) = 1B (ω )ρ(ω )λd (dω ),
B Ω

où λd (dω ) = dω1 . . . dωd désigne la mesure de Lebesgue en dimension d.

/Users/dp/a/ens/[Link] 14
2022-08-30 • 11:37:23.
Théorie élémentaire des probabilités 2.1. Espace de probabilité

Démonstration. La seule chose à montrer est la propriété d’additivité dénombrable dis-


jointe. Or si ( Bn )n est une suite de boréliens deux-à-deux disjoints, on a 1∪n∈N Bn =
∑n∈N 1Bn . La propriété découle du théorème de convergence monotone.
Remarque 2.1.22. La proposition 2.1.21 est l’analogue continu de la proposition 2.1.11,
établi dans le cas discret. La fonction ρ est l’analogue de la notion de vecteur de proba-
bilité et porte le nom de densité de probabilité (par rapport à la mesure de Lebesgue).
Noter cependant que contrairement au cas dénombrable — où les probabilités sont
en bijection avec les densités discrètes —, Il n’est pas vrai que toutes les probabilités
sur (Rd , Bd ) s’expriment sous cette forme. En général, toute probabilité sur (Rd , Bd )
se décompose en trois parties : une partie discrète, une partie qui s’écrit sous la forme
de la proposition 2.1.21 (appelée absolument continue par rapport à Lebesgue) et une
partie qui n’est ni discrète, ni absolument continue et s’appelle singulière continue (cf.
[2, exemple III.2.5, p. 47]). Cependant, nous n’aurons pas à considérer des probabilités
avec partie singulière continue dans ce cours. Pour utiliser une terminologie unifiée
dans les cas discret et continu, nous pouvons appeler le vecteur de probabilité ρ de la
proposition 2.1.11 aussi densité de probabilité (par rapport à la mesure de dénombre-
ment) ou densité discrète.

Exemple 2.1.23. Probabilité sur des ensembles non-dénombrables.


1. Soient Ω = [0, 1] et ρ(ω ) = 1 pour tout ω ∈ Ω. La fonction densité ρ définit une
probabilité sur ([0, 1], B([0, 1]), qui est appelée probabilité uniforme sur [0, 1].
exp(−ω 2 /2σ2 ) ´
2. Soient Ω = R et ρ(ω ) = √ . Alors ρ est une densité, i.e. R ρ(ω )λ(dω ) =
2πσ
1 (pouvez-vous le montrer ?) qui définit une probabilité non-uniforme sur (R, B(R))
appelée probabilité gaussienne centrée de variance σ pour des raisons qui se-
ront explicitées plus loin dans ce texte. Il s’agit d’une des lois les plus impor-
tantes en théorie des probabilités, nous donnons donc ci-dessous quelques dé-
tails sur elle.

ω2
 
1
√ exp − 2
2πσ 2σ

34%34%
0.1% 2% 14% 14% 2% 0.1%
ω
−3σ −2σ −σ σ 2σ 3σ

Figure 2.1 – La masse de la loi gaussienne s’étend sur tout l’axe R. Cependant, elle reste essentiel-
lement concentrée sur l’intervalle [−3σ, 3σ].

Définition 2.1.24. Sur un espace de probabilité (Ω, F , P), un événement N ∈ F avec


P( N ) = 0 est appelé négligeable ; un événement S ∈ F avec P(S) = 1 est appelé
presque sûr.

Il n’est pas vrai en général qu’un événement négligeable est vide ; ni qu’un ensemble
presque sûr coïncide avec l’univers tout entier comme le contre-exemple suivant nous
enseigne.

/Users/dp/a/ens/[Link] 15
2022-08-30 • 11:37:23.
2.2. Variables aléatoires Théorie élémentaire des probabilités

Contre-exemple 2.1.25. Soient (Ω, F , P) = ([0, 1], B([0, 1]), λ), N = [0, 1] ∩ Q et S =
[0, 1] \ Q. Alors P( N ) = 0 et P(S) = 1 − P( N ) = 1. Pourtant, N n’est pas vide (il est
même dense dans [0, 1]) et S = [0, 1] \ Q (il manque à S une infinité de points pour
qu’il devienne égal à Ω).

2.2 Variables aléatoires


Supposons que nous lançons une pièce 3 fois de suite. L’espace des épreuves sera
alors l’espace de configurations possibles de 3 bits : Ω = {ω = (ω1 , ω2 , ω3 ) : ωi ∈
{0, 1}} ; il sera muni de la tribu exhaustive F = P (Ω). Mais supposons que l’informa-
tion que nous intéresse est le nombre de fois que la pièce tombe sur la face « 1 ». L’infor-
mation codée dans ω est surabondante. Ce qui nous intéresse est une information plus
sommaire, à savoir la valeur que prend l’application X : Ω → X := {0, 1, 2, 3} défi-
nie par X (ω ) = ∑3i=1 1{1} (ωi ). Si la pièce est honnête, l’espace des événements (Ω, F )
est probabilisé par la densité discrète uniforme ρ(ω ) = 1/23 pour tout ω. Cette pro-
babilité induit une probabilité PX sur (X, P (X)) définie par la densité non uniforme
ρ X (0) = ρ X (3) = 1/8 et ρ X (1) = ρ X (2) = 3/8. Cet exemple fournit l’archétype d’une
variable aléatoire, notion formalisée dans la

Définition 2.2.1. Soient (Ω, F , P) un espace de probabilité, (X, X ) un espace d’évé-


nements (F et X sont des tribus) et X : Ω → X telle que pour tout A ∈ X , on
a X −1 ( A) ∈ F . Alors X est appelée variable aléatoire sur (Ω, F , P) à valeurs dans
(X, X ). Elle induit une probabilité PX sur (X, X ) par

X 3 A 7→ PX ( A) = P({ω ∈ Ω : X (ω ) ∈ A}) =: P( X −1 ( A)).

La probabilité PX sur (X, X ) est appelée loi de la variable aléatoire X.

Remarque 2.2.2. La condition X −1 ( A) ∈ F pour tout A ∈ X est essentielle dans


les cas où les tribus ne sont pas exhaustives. Considérer par exemple Ω = {0, 1}3 ,
X = {0, 1, 2, 3} et X (ω ) = ∑3i=1 ωi . Si l’on munit X avec la tribu exhaustive X = P (X)
tandis que Ω est muni de la tribu F = σ( F ) = {∅, Ω, F, F c } avec F := {011, 101, 111},
alors X n’est pas une variable aléatoire car par exemple X −1 ({2}) = {011, 101, 110} 6∈ F .
Par contre, la même application est une variable aléatoire si F est la tribu exhaustive.

Remarque 2.2.3. La donnée importante pour une variable aléatoire est sa loi PX (une
probabilité sur (X, X )). L’espace abstrait (Ω, F , P) n’est qu’une construction auxiliaire.
Le choix du triplet (Ω, F , P) reflète le moyen où le système décrit par la variable aléa-
toire X est construite et il n’est pas unique comme le montre l’exemple 2.2.4.

Exemple 2.2.4. (Trois manières radicalement différentes de jouer au pile ou face). Jouer
au pile ou face équivaut à construire une probabilité PX = 12 ε 0 + 12 ε 1 sur X = {0, 1},
muni de sa tribu exhaustive X = P (X).
Monsieur Tout-le-monde joue au pile ou face. On lance une pièce sur une table
approximativement considérée infiniment étendue dans le plan horizontale et
infiniment plastique. L’état instantané de la pièce est un élément de Ω = (R+ ×
R2 ) × R3 × R3 × S2 . Cet espace code la position du centre de masse R, la vi-
tesse du centre de masse V, le moment angulaire M et l’orientation N de la
normale extérieure sur la face « face ». On choisit pour F = B(Ω) et P désigne

/Users/dp/a/ens/[Link] 16
2022-08-30 • 11:37:23.
Théorie élémentaire des probabilités 2.2. Variables aléatoires

une probabilité à support compact dans Ω, décrivant l’incertitude de la condi-


tion initiale du système mécanique. Une fois la pièce lancée, son mouvement
est régi par les équations de Newton. La pièce touche la table dans un temps
aléatoire T (ω ) = inf{t > 0 : R3 (t) = 0; V(t) = 0, M(t) = 0} et elle s’arrête
immédiatement à cause de la plasticité de la table. On définit

0 si N( T (ω )) · e3 = −1
X (ω ) =
1 si N( T (ω )) · e3 = 1,

où e3 est le vecteur unité vertical de R3 . La cause de l’aléa est la stratification


très fine (cf. figure 2.2) de l’espace Ω. Ce système mécanique set étudié en détail
dans [39, 19].

v
Figure 2.2 – L’espace de phases (v, M ) (sous quelques conditions simplificatrices), où v désigne la
vitesse verticale et M le moment angulaire, est stratifié en régions rouges et bleues selon les résultats
possibles (pile ou face). Seulement les premières strates sont présentées ; cependant, la stratification
couvre tout le quadrant.

Le simulateur (sur ordinateur) joue au pile ou face. Soient Ω = [0, 1], F = B([0, 1])
et P la mesure de Lebesgue sur [0, 1]. Le résultat d’une pièce honnête est modé-
lisé par la variable aléatoire

0 si ω < 1/2
X (ω ) =
1 si ω > 1/2.

Le mathématicien joue au pile ou face. Soient Ω = {0, 1}, F = P (Ω) et P =


1 1
2 ε 0 + 2 ε 1 . Le résultat d’une pièce honnête est modélisé par la variable aléatoire
X = id. En outre, PX = P. Une telle réalisation est appelée minimale.
La nature probabiliste d’une variable aléatoire X est totalement codée en sa loi PX .
On va s’intéresser à de variables aléatoires à valeurs dans X ⊆ R ; dans ce cas, la loi
PX est à son tour totalement spécifiée par une fonction réelle.

/Users/dp/a/ens/[Link] 17
2022-08-30 • 11:37:23.
2.3. Exercices Théorie élémentaire des probabilités

Définition 2.2.5. Soit X une variable aléatoire réelle (i.e. à valeurs dans X ⊆ R) définie
sur l’espace de probabilité (Ω, F , P). On appelle fonction de répartition de X (ou de
sa loi PX ) l’application

R 3 x 7→ FX ( x ) := P({ω ∈ Ω : X (ω ) ≤ x }) = PX (] − ∞, x ]).

Remarque 2.2.6. Si cardΩ = m, alors on peut choisir X = X (Ω) avec cardX = n ≤ m,


i.e. on peut écrire X = { x1 , . . . , xn } pour des réels xi , i = 1, . . . , n avec xi ≤ x j si i < j.
Alors, on pourra écrire
FX ( x ) = ∑ PX ({ xi })
i:xi ≤ x

où PX ({ xi }) = ρ X ( xi ) = ∆FX ( xi ) := FX ( xi ) − FX ( xi −).

Exemple 2.2.7. Soit X = {0, 1, 2} ⊂ R et p = (0.2, 0.5, 0.3) un vecteur de probabilité


sur X. La fonction de répartition est cette loi est représentée sur la figure 2.3.

0.8

0.6

0.4

0.2

0
−6 −4 −2 0 2 4 6

Figure 2.3 – Fonction de répartition de la loi sur X = {0, 1, 2} définie par le vecteur de probabilité
p := (0.2, 0.5, 0.3).

Proposition 2.2.8. La fonction de répartition FX d’une variable aléatoire réelle vérifie


1. FX est croissante.
2. limx→−∞ FX ( x ) = 0 et limx→+∞ FX ( x ) = 1.
3. FX est continue à droite, i.e. FX ( x +) = FX ( x ) pour tout x ∈ R.

Démonstration. Cf. exercice 23.

2.3 Exercices
Algèbres, tribus
15. Soit A une algèbre sur Ω (fini) et soient A, B et C trois événements quelconques
de A. Exprimer les événements suivants. Parmi A, B, C
(a) A seul se produit,
(b) A et B se produisent et C ne se produit pas,

/Users/dp/a/ens/[Link] 18
2022-09-12 • 09:36:12.
Théorie élémentaire des probabilités 2.3. Exercices

(c) les trois événements se produisent,


(d) l’un au moins des événements se produit,
(e) au moins deux des événements se produisent,
(f) un seul événement se produit,
(g) aucun des événements ne se produit.
16. Soit (Ai )i∈ I une famille d’algèbres sur Ω. Montrer que ∩i∈ I Ai est une algèbre
sur Ω. En déduire que si C ⊆ P (Ω) est une famille arbitraire de parties de Ω,
il existe une algèbre minimale qui contient C ; on la note α(C) et on l’appelle
algèbre engendrée par C . La famille C est alors appelée famille génératrice de
l’algèbre.
17. Soit A une algèbre d’événements sur un espace fini Ω. Montrer qu’il existe une
unique partition D de Ω génératrice de A, i.e. A = α(D).
18. Soit (Fi )i∈ I une famille de tribus sur Ω. Montrer que ∩i∈ I Fi est une tribu 2 sur
Ω. En déduire que si G ⊆ P (Ω) est une famille arbitraire (non-vide) de parties
de Ω, il existe une tribu minimale qui contient G ; on la note σ(G) et on l’appelle
tribu engendrée par G . La famille G est appelée famille génératrice de la tribu.

Propriétés des probabilités discrètes


19. Le but de cet exercice est de donner une interprétation géométrique de l’en-
semble des probabilités M1 (Ω, F ) sur un univers fini Ω et F une tribu sur Ω.
(a) Rappeler la définition d’un ensemble convexe.
(b) Montrer que M1 (Ω, F ) est convexe.
(c) Rappeler la définition d’un point extrémal d’un ensemble convexe et mon-
trer que P ∈ M1 (Ω, F ) est extrémal si, et seulement si, pour tout F ∈ F ,
on a P( F ) ∈ {0, 1}. On note par ∂e M1 (Ω, F ) l’ensemble des probabilités
extrémales.
(d) Conclure que E = {ε ω : ω ∈ Ω} est un ensemble composé de probabilités
qui sont toutes extrémales.
(e) Donner un exemple où E 6= ∂e M1 (Ω, F ).
(f) Montrer que si F est dénombrablement engendrée et contient les singletons,
alors E = ∂e M1 (Ω, F ).
(g) Donner la structure géométrique de M1 (Ω, F ) dans le cas où |Ω| < ∞ et
F = P (Ω). On peut utiliser sans démonstration les deux théorèmes sui-
vants :
Théorème A : (Carathéodory) Tout point dans l’enveloppe convexe co( A) d’un
ensemble non-vide A ⊂ Rd peut être exprimé comme combinaison convexe d’au
plus d + 1 points de A.
Théorème B : (Krein-Milman) Si X est un espace vectoriel de dimension finie, toute
partie convexe compacte non-vide de X est la collection des combinaisons convexes
de ses points extrémaux.
(h) Lorsque cardΩ = 3, dessiner la partie de R2 qui est isomorphe à M1 (Ω, P (Ω))
4 12 3
et y placer le point qui correspond au vecteur de probabilité p = ( 19 , 19 , 19 ).

2. Attention : La réunion ∪i∈ I Fi n’est pas, en général, une tribu. Même dans le cas où (Fi )i∈N est
une filtration dénombrable (i.e. une suite des tribus strictement emboîtées Fi ⊂ Fi+1 , pour i ∈ N), la
réunion ∪i∈N Fi n’est jamais une tribu ; cf. [12]. La réunion engendre cependant une tribu, notée ∨i∈N Fi ,
par le procédé décrit dans cet exercice, i.e. ∨i∈N Fi = σ(∪i∈ I Fi ).

/Users/dp/a/ens/[Link] 19
2022-09-12 • 09:36:12.
2.3. Exercices Théorie élémentaire des probabilités

20. Supposons que Ω est dénombrable (fini ou infini) et qu’il existe une application
ρ : Ω → [0, 1] telle que ∑ω ∈Ω ρ(ω ) = 1. Montrer que ρ définit une mesure de
probabilité sur (Ω, F ) définie par

F 3 A 7 → P( A ) = ∑ ρ(ω ) ∈ [0, 1].


ω∈ A

Suggestion : la seule chose à démontrer est la propriété d’additivité dénombrable dis-


jointe.
21. Soit Ω = {0, 1}n l’espace des épreuves de n lancers d’une pièce, muni de sa
tribu exhaustive F = P (Ω). L’espace des événements est probabilisé à l’aide
du vecteur de probabilité uniforme ρ, chargeant chaque ω ∈ Ω par ρ(ω ) = 21n .
Pour chaque k = 1, . . . , n, on définit l’application

Ω 3 ω = (ω1 , . . . , ωk , . . . , ωn ) 7→ Tk ω := (ω1 , . . . , 1 − ωk , . . . , ωn ) ∈ Ω.

L’application Tk est appelée « kth bit-flip » (renversement du ke bit). Montrer que


pour tout A ∈ F , on a l’invariance P( Tk A) = P( A).

Variables aléatoires, fonctions de répartition


22. On lance une pièce lestée (donnant face (1) avec probabilité p ∈ [0, 1]) n fois.
(a) Décrire très précisément l’espace (Ω, F , P) qui modélise cette expérience en
déterminant la densité discrète ρ de P.
(b) On s’intéresse au nombre de fois que la pièce tombe sur face (1). Décrire très
précisément la variable aléatoire X qui décrit cette grandeur et déterminer
sa loi PX et la densité discrète ρ X correspondante.
(c) Vérifier que la fonction de répartition vérifie FX ( x ) = 1 pour x ≥ n.
23. Montrer les propriétés de la fonction de répartition FX d’une variable aléatoire
réelle X (à savoir qu’elle est croissante, continue à droite et vérifie limx→−∞ FX ( x ) =
0 et limx→+∞ FX ( x ) = 1).
24. Montrer que si F est une fonction de répartition, elle a au plus une infinité dé-
nombrable de discontinuités. Suggestion : étant donné que F est continue à droite,
un point x est une discontinuité s’il est une discontinuité gauche, i.e. si DF ( x ) =
F ( x ) − F ( x −) > 0. Écrire alors { x ∈ R : DF ( x ) > 0} comme une réunion dénom-
brable de parties de R et . . . réfléchir un peu sur le cardinal de chacun de ces ensembles.
25. Soient (Ω, F , P) = ([0, 1], B([0, 1]), λ) et X : Ω → R une application continue.
Suppposons que l’espace image R est muni de sa tribu borélienne. Montrer que
X est une variable aléatoire.
26. Soit F : R → [0, 1] une fonction croissante, continue à droite, vérifiant limx→−∞ F ( x ) =
0 et limx→+∞ F ( x ) = 1. Montrer qu’il existe un espace de probabilité (Ω, F , P)
et une variable aléatoire réelle X sur cet espace ayant F comme fonction de ré-
partition.
27. Soit X une variable aléatoire réelle dont la loi admet une densité ρ X (par rap-
port à la mesure de Lebesgue) sur R. Montrer que sa fonction de répartition FX
s’exprime comme l’intégrale
ˆ
FX ( x ) = ρ X (t)λ(dt).
]−∞,x ]

/Users/dp/a/ens/[Link] 20
2022-09-12 • 09:36:12.
Théorie élémentaire des probabilités 2.3. Exercices

Noter que si FX a une densité comme ci-dessus, alors FX est continue et différen-
tiable avec FX0 = ρ X . (La démonstration de ces affirmations n’est pas demandée.
Tandis que la démonstration de la continuité est facile, celle de la différentiabi-
lité est longue et non-triviale.

/Users/dp/a/ens/[Link] 21
2022-08-30 • 11:37:23.
2.3. Exercices Théorie élémentaire des probabilités

/Users/dp/a/ens/[Link] 22
2022-08-30 • 11:38:08.
Probabilité conditionnelle et
3
indépendance

3.1 Conditionnement
Revenons pour l’instant à l’interprétation fréquentielle de la probabilité, présentée
dans le chapitre 1, et considérons l’expérience suivante. On jette un dé N fois et on
compte deux grandeurs : le nombre de fois NB que l’événement B = « la face supé-
rieure montre 6 » se réalise et le nombre NA de réalisations de l’événement A = « la
face supérieure porte un numéro pair ». Lorsque N est très grand, nous estimons la
probabilité d’apparition de la face 6 par P( B) ' NB /N ' 1/6 et la probabilité d’appa-
rition d’une face paire par P( A) ' NA /N ' 1/2. Mais supposons que quelqu’un nous
informe que lors de cette expérience une face paire est apparue. En quoi cette informa-
tion va modifier notre estimation de la probabilité d’obtenir 6 ? Un instant de réflexion,
nous indique que la probabilité d’obtenir 6 sachant que le dé montre une face paire est
P A ( B) ' NB /NA ' 1/3 ; la connaissance que l’événement A s’est réalisé a transformé
la probabilité de P en P A qui doit logiquement vérifier les propriétés suivantes :
1. P A ( A) = 1, i.e. l’événement A, sachant que A s’est réalisé, est maintenant cer-
tain,
2. il existe une constante c A > 0 telle que pour tout événement D ⊆ A on ait
P A ( D ) = c A P( D ), i.e. les événements sont répondérés.
Proposition 3.1.1. Soient (Ω, F , P) un espace de probabilité et A ∈ F avec P( A) > 0. Il
existe une unique probabilité P A sur (Ω, F ) vérifiant les deux propriétés ci-dessus, définie par
la formule
P( A ∩ B )
P A ( B) := , ∀B ∈ F .
P( A )
Démonstration. Supposons que P A vérifie les deux propriétés ci-dessus. Pour B ∈ F
arbitraire,

P A ( B ) = P A ( B ∩ A ) + P A ( B \ A ) = P A ( B ∩ A ) + 0 = c A P( B ∩ A ).

23
3.1. Conditionnement Probabilité conditionnelle et indépendance

Pour B = A, nous avons P A ( A) = c A P( A), par conséquent c A = 1/P( A) et nous


obtenons ainsi la formule pour P A . Inversement, si P A est donnée par cette formule,
elle vérifie les deux propriétés 1 et 2 ci-dessus.

Ces considérations nous amènent à la

Définition 3.1.2. Soient (Ω, F , P) un espace de probabilité et A, B ∈ F avec P( A) > 0.


On appelle probabilité conditionnelle de l’événement B — sachant que l’événement
A s’est réalisé — la quantité

P( A ∩ B )
P A ( B ) : = P( B | A ) : = .
P( A )

Remarque 3.1.3. Lorsque P( A) = 0, alors P( A ∩ B) = 0 aussi. Par conséquent la


probabilité conditionnelle n’est pas bien définie dans ce cas ; plus précisément, on peut
définir la probabilité conditionnelle comme prenant une valeur pré-déterminée arbi-
traire dans [0, 1].

Théorème 3.1.4. Soient (Ω, F , P) un espace de probabilité et ( Bn )n∈ I une partition au plus
dénombrable de Ω) avec Bn ∈ F pour tout n ∈ I. Alors, pour tout A ∈ F on a :

P( A ) = ∑ P( A| Bn )P( Bn ) (formule de probabilité totale),


n∈ I

et, pour tout k ∈ I,

P( A| Bk )P( Bk )
P( Bk | A) = (formule de Bayes).
∑n∈ I P( A| Bn )P( Bn )

Démonstration. Nous avons

∑ P( A| Bn )P( Bn ) = ∑ P( A ∩ Bn ) = P( A ∩ (∪n∈ I Bn )) = P( A).


n∈ I n∈ I

La formule de Bayes s’obtient immédiatement de la définition de la probabilité condi-


tionnelle et de la formule précédente.

Exercice 3.1.5. (Important ; résolvez-le avant de continuer). Une urne contient deux
pièces de monnaie. Une honnête et une biaisée qui donne face avec probabilité 1/3.
On en extrait une, on la lance et on obtient face. Quelle est la probabilité qu’il s’agissait
de la pièce honnête ?

Proposition 3.1.6. Soient (Ω, F , P) un espace de probabilité et A1 , . . . , An ∈ F . Alors

P ( A 1 ∩ · · · ∩ A n ) = P ( A 1 )P ( A 2 | A 1 ) · · · P ( A n | A 1 ∩ · · · ∩ A n −1 ).

Démonstration. Par simple substitution et simplification de termes dans le produit té-


lescopique.

/Users/dp/a/ens/[Link] 24
2022-08-30 • 11:38:08.
Probabilité conditionnelle et indépendance 3.1. Conditionnement

Cette proposition nous fournit un moyen efficace de construction de modèles réa-


listes. Supposons que X est une variable aléatoire définie sur un espace de probabilité
abstrait (Ω, F , P), à valeurs dans X = A N +1 où A est un ensemble dénombrable.
Alors X = ( X0 , . . . , X N ) ∈ A N peut-être considérée comme un mot aléatoire de N
lettres construit sur l’alphabet A. Tout joueur de scrabble connaît que les différentes
lettres dans un mot français ne sont pas choisies purement au hasard ; la fréquence
d’apparition d’une lettre en deuxième position dépend de la lettre déjà apparue en
première position.
Si x = ( x0 , . . . , x N ) ∈ X est un mot de longueur N + 1 construit sur l’alphabet A
et k : 1 ≤ k ≤ N, on note xk = ( x0 , . . . , xk ) la restriction du mot à ses k + 1 premières
lettres.

Théorème 3.1.7. Soient N ∈ N et X0 , . . . , X N une famille d’ensembles dénombrables (finis


ou infinis). On note X = ×nN=0 Xn et x = ( x0 , . . . , x N ) les éléments de X. L’espace X est
supposé muni de la tribu X = ⊗nN=0 P (Xn ). Supposons que ρ0 est un vecteur de probabilité sur
A0 et, pour tout k = 1, . . . N et x ∈ X, ρk,xk−1 est une vecteur de probabilité sur Ak . Alors, il
existe un espace probabilisé (Ω, F , P), avec (Ω, F ) suffisamment riche pour que la suite X =
( X0 , . . . , Xn ) de variables aléatoires soit définie de façon que, pour tout x = ( x0 , . . . , x N ) ∈ X,
P est l’unique probabilité sur (Ω, F ) vérifiant

P(X = x) = ρ0 ( x0 )ρ1,x0 ( x1 ) · · · ρ N,xN −1 ( x N ).

Dans le cas considéré dans le théorème précédant (où N < ∞) la tribu X = ⊗nN=0 P (Xn )
coïncide avec la tribu exhaustive X = P (X), engendrée par les singletons X = σ({x}, x ∈
X). La démonstration donc du théorème est élémentaire. Pour établir par exemple
l’unicité de la construction, il suffit de vérifier que toutes les probabilités définies par
le membre de droite de la formule de l’énoncé coïncident sur les singletons, sont donc
identiques sur X .
Nous serons cependant amenés à considérer des suites infinies de variables aléa-
toires, par exemple pour étudier les suites de bits générées par une source. Nous avons
donc besoin d’un résultat analogue au théorème 3.1.7 mais pour N → ∞. La difficulté
essentielle provient du fait que, même pour une suite (Xn )n∈N d’alphabets finis, l’es-
pace X = ×n∈N Xn n’est plus dénombrable. Le théorème 3.1.8, démontré ci-dessous,
fournit la généralisation du théorème 3.1.7 dans le cas N = ∞.

Théorème 3.1.8. Soit (Xn )n∈N une suite d’alphabets dénombrables. On note X = ×n∈N Xn
le produit cartésien des ces alphabets. L’espace X est supposé muni de la tribu X = ⊗n∈N P (Xn ).
Supposons que ρ0 est un vecteur de probabilité sur X0 et pour tout k ≥ 1, et tout x =
( x0 , x1 , . . .) ∈ X, ρk,xk−1 un vecteur de probabilité sur Xk . Alors, il existe un espace probabi-
lisé (Ω, F , P), avec (Ω, F ) suffisamment riche pour que toute la suite X = ( X0 , X1 , . . .) =
( Xn )n∈N de variables aléatoires soit définie de façon que, pour tout N ≥ 1 et tout x ∈ X, la
probabilité P soit l’unique probabilité sur (Ω, F ) vérifiant

P(X N = x N ) = ρ0 ( x0 )ρ1,x0 ( x1 ) · · · ρ N,xN −1 ( x N ).

Remarque 3.1.9. La tribu X = ⊗n∈N P (Xn ) n’est pas la tribu exhaustive. Elle est
engendrée par la famille des « rectangles » R = ∪ N ∈N R N , où

R N = {×k∈N Bk : Bk ∈ P (Xk ) et ]{k ∈ N : Bk 6= Xk } < ∞}.

/Users/dp/a/ens/[Link] 25
2022-08-30 • 11:38:08.
3.2. Indépendance Probabilité conditionnelle et indépendance

Elle est aussi engendrée par la famille des « cylindres » C = ∪ N ∈N C N , où


N
C N = {{ x0 · · · x N } ×k> N Xk , x0 · · · x N ∈ (×`= 0 X` )}.

On remarque que pour un N ∈ N arbitraire, un cylindre arbitraire de la famille C N


s’écrit comme
[ x 0 · · · x N ] : = { x 0 · · · x N } × X N +1 × X N +2 × · · · .
Pour un x ∈ X on note donc le cylindre [ x0 · · · x N ] = [x N ].
Démonstration du théorème 3.1.8. Existence. Choisir Ω = I∅ := [0, 1[ muni de la tribu borélienne B([0, 1[)
et probabilisé par la mesure de Lebesgue λ. On introduit une partition de I∅ en cardX0 intervalles semi-
ouverts contigus I∅ = t x0 ∈X0 Ix0 en imposant λ( Ix0 ) = ρ0 ( x0 ). Supposons que nous ayons construit une
partition à l’ordre k − 1, i.e. pour x0 · · · xk−1 ∈ X0 × · · · × Xk−1 , nous disposons de la famille exhaustive
d’intervalles disjoints contigus Ix0 ··· xk−1 dont les longueurs vérifient

λ( Ix0 ··· xk−1 ) = ρ0 ( x0 ) · · · ρk−2,xk−2 ( xk−1 ).

Nous obtenons une partition à l’ordre k, en écrivant chacun de ceux intervalles comme une partition
plus fine
Ix0 ··· xk−1 = t xk ∈Xk Ix0 ··· xk ,
avec λ( Ix0 ··· xk ) = λ( Ix0 ··· xk−1 )ρk,xk−1 ( xk ). Cette construction peut être répétée ad infinitum.
Pour chaque k, la famille ( Ix )x∈X0 ×···×Xk forme une partition de Ω. Il s’ensuit que pour chaque
ω ∈ Ω, il existe un unique intervalle de la génération k qui le contient, i.e. il existe une suite X(ω ) =
( X0 (ω ), X1 (ω ), . . .) ∈ X ' Ω telle que ω ∈ IX0 (ω )···Xk (ω ) , pour tout k ∈ N.
L’application X : Ω → X est une variable aléatoire. En effet, considérer la famille G = {∅} ∪ k≥0 Gk ,
S


Gk = { X0 = x0 , . . . , Xk = xk , xi ∈ Xi , i = 0, . . . , k} = {Xk = xk }.
Cette famille constitue une algèbre qui engendre une tribu F , sous-tribu de B([0, 1[). Par ailleurs, pour
tout cylindre C = [ x0 · · · x N ] ∈ C , on aura X−1 (C ) = {X N = x N } = IxN ∈ F ⊆ B([0, 1[). En outre,
λ ◦ X−1 définit bien une probabilité P sur (Ω, F ) ayant les propriétés requises.
Unicité. Supposons qu’il existe deux mesures de probabilité P et P0 sur (Ω, F ) telles que

P(X N = x N ) = ρ0 ( x0 )ρ1,x0 ( x1 ) · · · ρ N,xN −1 ( x N ) = P0 (X N = x N ).

On remarque que ces probabilités coïncident sur G . Comme G contient l’ensemble vide, est stable par
intersection finie et engendre F , elles coïncideront sur F .

Définition 3.1.10. La probabilité P, dont l’existence et l’unicité sont établies dans le


théorème 3.1.8 est appelée loi ou probabilité conjointe de la suite aléatoire ( X0 , X1 , . . . , ).
La probabilité sur X0 × · · · × X N définie par sommation partielle sur toutes les valeurs
x N +1 , x N +2 , . . . non observées est appelée probabilité marginale.

3.2 Indépendance
La signification intuitive de l’indépendance entre deux événements A et B est que
la probabilité de B n’est pas influencée par la révélation que A s’est réalisé (ou vice
versa avec les rôles de A et B interchangés). Ceci nous incite à introduire la notion
d’indépendance par la
Définition 3.2.1. Soit (Ω, F , P) un espace de probabilité. Deux événement A, B ∈ F
sont indépendants par rapport à la probabilité P si
P( A ∩ B ) = P( A )P( B ).

/Users/dp/a/ens/[Link] 26
2022-08-30 • 11:38:08.
Probabilité conditionnelle et indépendance 3.2. Indépendance

Remarque 3.2.2. — Un fait qui est souvent négligé est que l’indépendance entre
deux événements n’est pas une propriété intrinsèque des événements en consi-
dération mais fait intervenir de manière cruciale la probabilité sous-jacente. (Cf.
exercice 38). Deux événements A et B sur (Ω, F ) peuvent être indépendants par
rapport à une probabilité P sur F et dépendants par rapport à une probabilité
P0 .
— L’indépendance définie en 3.2.1, appelée aussi indépendance stochastique, ne
doit pas être confondue avec un autre type d’indépendance, l’indépendance
causale, entre deux événements, signifiant qu’il n’y a pas de relation de cause à
effet entre eux. (Cf. exercice 39).
Définition 3.2.3. Soient (Ω, F , P) un espace de probabilité et I 6= ∅ une famille arbi-
traire d’indices.
1. Une famille ( Ai )i∈ I d’événements de F est dite indépendante par rapport à P
si pour toute partie finie J, ∅ 6= J ⊆ I, nous avons
P ∩ j ∈ J A j = ∏ P( A j ).

j∈ J

2. Soient (Xi , X )i∈ I une famille d’espace d’événements et ( Xi )i∈ I une famille de
variables aléatoires avec Xi : Ω → Xi . La famille est indépendante si pour
tout choix d’événements Bi ∈ Xi , la famille d’événements ({ Xi ∈ Bi })i∈ I est
indépendante, i.e. si pour toute partie finie J avec ∅ 6= J ⊆ I, nous avons
P ∩ j∈ J { X j ∈ Bj } = ∏ P({ X j ∈ Bj }).

j∈ J

(Le cas trivial cardJ = 1 est inclus dans cette définition pour de raisons de simplicité).
Une famille d’événements (ou de variables aléatoires) peut être telle que si l’on
considère deux éléments arbitraires de la famille, ils sont indépendants sans que la
famille soit indépendante comme le montre le
Contre-exemple 3.2.4. On lance une pièce deux fois de suite. L’univers est Ω = {0, 1}2 ;
on probabilise sa tribu exhaustive avec la probabilité uniforme sur Ω. Considérer les
événements
A = {lors du premier lancer la pièce tombe sur face},
B = {lors du second lancer la pièce tombe sur face},
C = {lors des deux lancers la pièce tombe du même côté}.
Alors
1 1
P( A ∩ B ∩ C ) =6 = = P( A )P( B )P( C ),
4 8
tandis que les événements pris deux-à-deux sont indépendants.
La définition 3.2.3 appliquée à la construction faite dans le théorème 3.1.8 implique
que les vecteurs de probabilité ne dépendent pas de x. Une famille de variables aléa-
toires ( Xn )n=1,...,N , avec Xn : Ω → Bn , est indépendante si sur chaque (Xn , P (Xn )), il
existe un vecteur de probabilité ρn (indépendant des xi pour i < n) et
N N
P ( X1 = x 1 , . . . , X N = x n ) = ∏ P( Xn = x n ) = ∏ ρ n ( x n ).
n =1 n =1

/Users/dp/a/ens/[Link] 27
2022-08-30 • 11:38:08.
3.3. Exercices Probabilité conditionnelle et indépendance

(Étant donné que les ρn ne dépendent pas dex xi , i < n, nous pouvons calculer les mar-
ginales arbitraires). Ceci reste valable même pour des suites infinies ( Xn )n∈N de va-
riables aléatoires Xn : Ω → Xn indépendantes, sur des alphabets dénombrables (Xn ).
Le théorème 3.1.8 combiné avec la propriété d’indépendance implique qu’il existe une
suite infinie de vecteurs de probabilité (ρn ) et une unique probabilité P telles que pour
toute partie finie non-vide J ⊆ N, on ait

P ∩ j ∈ J { X j = x j } = ∏ ρ j ( x j ).

j∈ J

3.3 Exercices
Probabilité conditionelle
Dans tout ce paragraphe, on travaille sur un espace probabilité (Ω, A, P). Tous les
événements utilisés, A, B, ( Ak ), . . ., appartiennent à A.
28. Montrer que les formules

P( B| A) + P( B| Ac ) = 1 et P( B| A) + P( Bc | Ac ) = 1

sont fausses.
29. Pour une famille d’événements ( Ak )k=1,...,n indépendante, noter pk = P( Ak ).
Calculer la probabilité de l’événement « aucun des ( Ak ) ne se réalise ».
30. Soient A et B deux événements indépendants, avec p = P( A) et q = P( B).
Calculer les probabilités pour que
(a) exactement k,
(b) au moins k,
(c) au plus k,
des événements A et B se réalisent pour k = 0, 1, 2.
31. Exprimer P(∪nk=1 Ak ) lorsque les Ak sont indépendants.
32. Un lot de 100 objets manufacturés subit un contrôle par échantillonnage : un
échantillon de 5 objets est examiné et s’il contient un article défectueux, tout le
lot est rejeté. Quelle est la probabilité qu’un lot soit rejeté s’il contient 5% d’objets
défectueux ?
33. Une personne a oublié le dernier digit du numéro de téléphone de son corres-
pondant ; elle compose donc au hasard. Quelle est la probabilité p qu’elle soit
obligée de composer moins de 3 fois (≤ 3) ? Que devient cette probabilité, si la
personne se souvient que le dernier digit est impair ?
34. Une personne écrit n lettres différentes, chacune destinée a un destinataire spé-
cifique. Elle les a scellées et posées bien rangées en pile sur son bureau afin
d’écrire le lendemain les adresses sur les enveloppes. Un plaisantin est passé
par là, il a renversée la pile par erreur et il a remis les enveloppes sur le bureau
mais dans un ordre aléatoire par rapport à l’ordre correct. Ignorant ce fait, la
personne qui a rédigé les lettres a inscrit le lendemain les adresses. Quelle est la
probabilité qu’une lettre parvienne à la personne à laquelle elle était destinée ?
35. Le circuit électrique suivant comporte 5 interrupteurs, notés a à e ; chacun d’eux
peut être fermé (laisse le courant passer) avec probabilité p ou ouvert (coupe le
courant) avec probabilité q = 1 − p.

/Users/dp/a/ens/[Link]
28
2021-11-13 • 17:54:44.
Probabilité conditionnelle et indépendance 3.3. Exercices

a b

c d

(a) Quelle est la probabilité pour que le courant passe de gauche à droite ?
(b) Sachant que le courant passe de gauche à droite, quelle est la probabilité
pour que l’interrupteur e soit fermé ?

Variables aléatoires ; probabilités conjointes


36. On lance une pièce honnête et on désigne par X1 ∈ {0, 1} le résultat obtenu. Si
X1 = 1, on lance une pièce honnête sinon on lance une pièce lestée qui donne 1
avec probabilité 2/3 ; on note X2 le résultat du deuxième lancer. Si on a obtenu
2 fois 1 lors des 2 premiers lancers, on lance un dé honnête, sinon on lance un
dé lesté qui donne 6 avec probabilité 1/2 et les autres faces équiprobables.
(a) Calculer explicitement les vecteurs de probabilité ρ1 , ρ2,x1 et ρ3,( x1 ,x2 ) .
(b) Déterminer la probabilité conjointe P( X1 = x1 , X2 = x2 , X3 = x3 ) pour
x1 , x2 ∈ {0, 1} et x3 ∈ {1, . . . , 6}.
(c) Calculer les probabilités marginales P( X1 = x1 ), P( X1 = x1 , X2 = x2 ),
P ( X2 = x 2 ) , P ( X3 = x 3 ) ,
37. (Formule de Bayes).

Une usine a produit 2 lots, notés a et b, d’objets. Tous les objets du lot a sont fonc-
tionnels tandis que seulement 75% d’objets du lot b sont fonctionnels, les autres
étant défectueux. On note p = (1/2, 1/2) le vecteur de probabilité uniforme sur
l’ensemble de lots L = { a, b} et X = {d, f }.
(a) On modélise par la variable aléatoire L à valeurs dans L, de loi a priori p, le
choix du lot et par une variable aléatoire X à valeurs dans X l’état de l’objet
choisi. On choisit un lot au hasard (selon p) et un objet au hasard (selon
la loi uniforme) dans le lot ; l’objet se trouve être fonctionnel. Déterminer le
vecteur de probabilité a posteriori q sur L, obtenue après que cette expérience
ait eu lieu (i.e. sachant que l’objet choisi est fonctionnel).
(b) On remet l’objet dans le lot duquel il a été extrait et on choisit au hasard un
deuxième objet de ce même lot. Quelle est la probabilité que cet objet soit
défectueux ? (On note Y la variable aléatoire à valeurs dans X qui modélise
l’état du second objet extrait).

Indépendance
38. Une urne contient n boules discernables noires et r boules discernables rouges
et on considère l’espace Ω = {1, . . . , n + r }2 (qui peut décrire toutes les expé-
riences d’extraction de deux boules avec ou sans remise). On note
A = {la première boule est rouge} = {ω ∈ Ω : ω1 ∈ {1, . . . , r }}

/Users/dp/a/ens/[Link]
29
2021-11-13 • 17:54:44.
3.3. Exercices Probabilité conditionnelle et indépendance

et
B = {la seconde boule est rouge} = {ω ∈ Ω : ω2 ∈ {1, . . . , r }}.
(a) On en extrait une boule, on la remet dans l’urne et on en extrait une seconde ;
on note P la probabilité uniforme sur Ω. Les événements A et B sont-ils
indépendants (par rapport à P) ?
(b) On extrait une première boule et sans la remettre dans l’urne, on en extrait
une seconde. On note P0 la probabilité uniforme sur

Ω0 = {ω = (ω1 , ω2 ), ωi ∈ {1, . . . , n + r }, ω1 6= ω2 } ⊂ Ω.

La probabilité P0 peut être étendue en une probabilité, aussi notée P0 , sur


Ω chargeant avec masse 0 les éléments de Ω \ Ω0 . Les événements A et B
sont-ils indépendants (par rapport à P0 ) ?
39. On jette un dé deux fois de suite et on note Ω = {1, . . . , 6}2 l’espace des épreuves
correspondant. On munit la tribu exhaustive de cet espace de la probabilité uni-
forme et on considère les événements

A = {la somme est 7} et B = {le premier dé tombe sur 6}.

(a) Montrer que A et B sont indépendants (sous la probabilité uniforme).


(b) Soient G = (G0 , G1 ) un graphe dirigé acyclique, U = {Uv , v ∈ G0 } une
famille de variables aléatoires indexée par les sommets du graphe et F =
{ f v , v ∈ G0 } une famille d’applications réelles à plusieurs variables. Une
famille de variables aléatoires ( Xv )v∈G0 suit un modèle causal si pour tout
sommet v ∈ G0 , on peut exprimer Xv = f v ( Xu , u ∈ pa(v); Uv ). Montrer que
A est déterminé de B de manière causale.

/Users/dp/a/ens/[Link] 30
2022-08-30 • 11:38:08.
Espérance, variance ; théorèmes des
4
grands nombres

4.1 Espérance
Soient (Ω, F , P) un espace de probabilité et (X, X ) un espace d’événements avec
X ⊂ R et cardX = n. Alors, il existe des réels distincts xi , i = 1, . . . , n tels que X =
{ x1 , . . . , xn }. Une variable aléatoire X : Ω → X peut alors s’écrire à l’aide de la partition
Ai = { X = xi }, i = 1, . . . , n comme X (ω ) = ∑in=1 xi 1 Ai (ω ). La loi de X s’exprime en
termes du vecteur de probabilité ρ vérifiant pi := ρ( xi ) = P( X = xi ) = P( Ai ), pour
i = 1, . . . , n. Si nous observons N réalisations de la variable aléatoire X, nous nous
attendons à ce que xi soit obtenu approximativement N pi fois. Si nous exprimons la
moyenne pondérée des N réalisations de X, nous obtenons
n
1
[ N p1 x1 + . . . + N p n x n ] = ∑ p i x i .
N i =1

L’expression du second membre ci-dessus est ce que nous appelons espérance de la


variable aléatoire X (voir définition 4.1.1). Sa signification est le barycentre (pondéré
par les probabilités pi = P( X = xi )) de l’ensemble de valeurs distinctes ( xi ) que peut
prendre X.

4.1.1 Cas discret


Soient (Ω, F , P) un espace de probabilité et X : Ω → R une variable aléatoire
réelle. La variable aléatoire X est appelée discrète si X (Ω) est dénombrable (fini ou
infini).

Définition 4.1.1. 1. Une variable aléatoire réelle discrète X sur (Ω, F , P) est dite
intégrable (plus précisément P-intègrable) si ∑ x∈X (Ω) | x |P({ X = x }) < ∞. On
note alors X ∈ L1 := L1 (Ω, F , P).

31
4.1. Espérance Espérance, variance ; théorèmes des grands nombres

2. Si X ∈ L1 (Ω, F , P), on définit son espérance EX par

E( X ) = EP ( X ) := ∑ xP( X = x ).
x ∈ X (Ω)

Remarque 4.1.2. — Si A ∈ F , l’application 1 A : Ω → {0, 1} est une variable


aléatoire. Son espérance est E(1 A ) = P( A).
— Si une variable aléatoire X est discrète, nous pouvons toujours la décomposer
comme
X (ω ) = ∑ x1 Ax (ω ),
x ∈ X (Ω)

où A x = {ω ∈ Ω : X (ω ) = x }. Nous aurons alors

E( X ) = ∑ xP( A x )
x ∈ X (Ω)

= ∑ xPX ({ x })
x ∈ X (Ω)

= ∑ xρ X ( x )
x ∈ X (Ω)

= ∑ x∆FX ( x ), où ∆FX ( x ) = FX ( x ) − FX ( x −).


x ∈ X (Ω)

Proposition 4.1.3. Soient (Ω, F , P) un espace de probabilité et X, Y, ( Xn ), (Yn ) de variables


aléatoires réelles discrètes et intégrables sur (Ω, F , P). Alors nous avons les propriétés sui-
vantes :
1. Si X ≤ Y alors E( X ) ≤ E(Y ) (monotonie).
2. Pour tout c ∈ R, E(cX ) = cE( X ) et E( X + Y ) = E( X ) + E(Y ) (linéarité).
3. Si pour tout n ∈ N on Xn ≥ 0 et X = ∑n∈N Xn , alors E( X ) = ∑n∈N E( Xn )
(σ-additivité).
4. Si Yn ↑ Y, alors E(Y ) = limn→∞ E(Yn ) (convergence monotone).
5. Si X et Y sont indépendantes, alors XY ∈ L1 et E( XY ) = E( X )E(Y ) (mulitiplicati-
vité en cas d’indépendance).

Démonstration. 1. Soit (Ω, F , P) un espace probabilisé sur lequel les deux variables aléatoires X :
Ω → X = X (Ω) et Y : Ω → Y = Y (Ω) sont simultanément définies. La condition X ≤ Y
signifie que pour toute réalisation ω ∈ Ω, X (ω ) ≤ Y (ω ). On conclut que

E( X ) = ∑ xP( X −1 ({ x })) = ∑ xP( X −1 ({ x }), Y −1 (Y))


x ∈X x ∈X
= ∑ xP( X −1 ({ x }), Y −1
({y})) ≤ ∑ yP( X −1 ({ x }), Y −1 ({y}))
x ∈X,y∈Y x ∈X,y∈Y

= ∑ yP( X −1
(X), Y −1
({y})) = ∑ yP(Y −1 ({y})) = E(Y ).
y ∈Y y ∈Y

2. L’égalité E(cX ) = cE( X ) découle immédiatement de la définition de l’espérance. Pour montrer


la deuxième égalité, on remarque que si X et Y sont des variables aléatoires réelles discrètes
définies sur le même espace probabilisé (Ω, F , P), à valeurs respectivement sur X = X (Ω)
et Y = Y (Ω), la variable « somme », W = X + Y est une variable aléatoire discrète définie sur

/Users/dp/a/ens/[Link] 32
2022-09-18 • 20:20:33.
Espérance, variance ; théorèmes des grands nombres 4.1. Espérance

(Ω, F , P) à valeurs dans W, image de X × Y par l’application X × Y 3 ( x, y) 7→ x + y = w ∈ W.


La variable aléatoire est intégrable car

E(|W |) = ∑ | w |P( X + Y = w ) = ∑ |w|P( X = x, Y = w − x )


w ∈W x ∈X,w∈W
≤ ∑ (| x | + |w − x |)P( X = x, Y = w − x )
x ∈X,w∈W
= ∑ (| x | + |y|)P( X = x, Y = y) = E(| X |) + E(|Y |).
x ∈X,y∈Y

L’égalité requise s’obtient en enlevant la valeur absolue dans la suite des relations ci-dessus.
3. Par la positivité des variables, pour tout N ∈ N, nous avons X ≥ S N := ∑kN=0 Xk et par consé-
quent, par la linéartité de l’espérance E( X ) ≥ ∑kN=0 E( Xk ). La dernière inégalité est vraie pour
tout N ∈ N ; elle sera alors vraie dans la limite N → ∞, i.e. E( X ) ≥ ∑k∈N E( Xk ).
Pour conclure, il faut établir l’inégalité inverse. Soit c ∈]0, 1[ arbitraire τ = inf{ N ≥ 0 : S N ≥
cX } ∈ N ∪ {+∞}. Puisque S N ↑ X, il s’ensuit que τ < ∞. Or {τ < ∞} = ∪ N ∈N {τ = N } ; par
conséquent, Sτ = Sτ ∑ N ∈N 1{τ = N } = ∑ N ∈N S N 1{τ = N } . On a alors

cE( X ) ≤ E(Sτ ) = ∑ x ∑ P(τ = N, S N = x ) = ∑ E ( S N 1{ τ = N } )


x ∈S(Ω) N ∈N N ∈N
N N
= ∑ ∑ E ( Xk 1{ τ = N } ) = ∑ ∑ ∑ xP( Xk = x, τ = N )
N ∈N k =0 N ∈N k =0 x ∈ X ( Ω )

= ∑ ∑ xP( Xn = x; τ ≥ n) ≤ ∑ ∑ xP( Xn = x ) = ∑ E( Xn ).
n ∈N x ∈ Xn ( Ω ) n ∈N x ∈ Xn ( Ω ) n ∈N

Le paramètre c étant arbitraire, en prenant la limite c ↑ 1, on obtient E( X ) ≤ ∑n∈N E( Xn ).


4. On applique le résultat précédent aux variables aléatoires positives X = Y − Y0 et Xn+1 =
Yn+1 − Yn pour n ∈ N.
5. La variable aléatoire XY est une variable aléatoire discrète définie sur (Ω, F , P). Son intégrabi-
lité découle de l’observation

∑ |w|P(XY = w) = ∑ |w| ∑ P(X = x, Y = w/x) = ∑ | x ||y|P( X = x, Y = y)


w w 6 =0 x 6 =0 x 6=0,y6=0

= ∑ | x ||y|P( X = x )P(Y = y) (à cause de l’indépendance)


x 6=0,y6=0

= E(| X |)E(|Y |).

La multiplicativité s’obtient en enlevant la valeur absolue dans les égalités précédentes.

4.1.2 Cas continu (à densité)


Dans le cas continu, lorsque la mesure de probabilité admet une densité, nous ex-
primons de nouveau la mesure de probabilité à l’aide de sa densité.

Définition 4.1.4. Soient Ω ' Rd , muni de sa tribu borélienne F = Bd et P une proba-


bilité sur (Ω, F ) ayant une densité ρ par rapport à la mesure de Lebesgue. Soit X une
variable aléatoire réelle définie sur (Ω, F ).
1. On dit que X est intégrable (plus précisément P-intégrable) si
ˆ
| X (ω )|ρ(ω )dω1 · · · dωd < ∞.

On note alors X ∈ L1 := L1 (Ω, F , P).

/Users/dp/a/ens/[Link] 33
2022-09-18 • 20:20:33.
4.2. Variance et covariance Espérance, variance ; théorèmes des grands nombres

2. Si X ∈ L1 (Ω, F , P), on appelle espérance E( X ) de X, la quantité


ˆ ˆ
E( X ) = EP ( X ) := X (ω )ρ(ω )dω1 · · · dωd = xρ X ( x )dx.
Ω X

Il faudrait bien sûr donner un sens aux intégrales (de Lebesgue) qui apparaissent
dans la définition précédente. Cependant, dans tous les cas qui se présenteront dans
ce cours, nous pouvons considérer que ces intégrales sont égales aux intégrales habi-
tuelles (de Riemann).

Remarque 4.1.5. Les affirmations de la proposition 4.1.3, établies dans le cas discret,
restent valables dans le cas continu.

4.2 Variance et covariance


Tout comme l’espérance exprime la moyenne pondérée (barycentre) des valeurs
d’une variable aléatoire, la variance mesure la dispersion de la variable autour de son
espérance. Soit (Ω, F , P) un espace de probabilité et X une variable aléatoire réelle. Si
pour un r ∈ N∗ , la variable X r ∈ L1 (Ω, F , P), on dit que la variable est r-intégrable et
l’on note X ∈ Lr (Ω, F , P). Puisque | XY | ≤ X 2 + Y 2 , il s’ensuit que si X, Y ∈ L2 alors
XY ∈ L1 . Cette remarque permet donc de définir :

Définition 4.2.1. Soit X, Y ∈ L2 (Ω, F , P) variables aléatoires réelles.


1. On appelle variance de X, le nombre positif Var( X ) = E([ X − E( X )]2 ) ; sa racine
carré est appelée écart-type de X.
2. On appelle covariance de X et Y le nombre réel

Cov( X, Y ) = E[( X − E( X )][Y − E(Y )]).

3. Si Cov( X, Y ) = 0 alors les variables aléatoires sont dites non-corrélées.


4. Si les variables aléatoires X et Y sont non-triviales (i.e. non-constantes), leur
coefficient de corrélation est donné par

Cov( X, Y )
r ( X, Y ) = p .
Var( X )Var(Y )

Théorème 4.2.2. Soient X, Y, ( Xn )n∈N de variables aléatoires de carré intégrables et a, b, c, d ∈


R. Alors,
1. aX + b, cY + d ∈ L2 et Cov( aX + b, cY + d) = acCov( X, Y ) ;
2. Cov( X, Y )2 ≤ Var( X )Var(Y ) ;
3. Var(∑nN=1 Xn ) = ∑nN=1 Var( Xn ) + ∑1≤m6=n≤ N Cov( Xm , Xn ) ;
4. si X et Y sont indépendantes, alors elles sont non-corrélées.

Démonstration. Exercice !

Remarque 4.2.3. La non-corrélation n’entraîne pas nécessairement l’indépendance.


(Donner un exemple).

/Users/dp/a/ens/[Link] 34
2022-09-18 • 20:20:33.
Espérance, variance ; théorèmes des grands nombres 4.3. Fonction génératrice

4.3 Fonction génératrice


Définition 4.3.1. Supposons que X est une variable aléatoire sur (Ω, F , P), à valeurs
dans X = N et l’on note ρ X la densité discrète de PX . On appelle fonction génératrice
de X (ou de PX ) la fonction
G ( z ) = E( z X ) = ∑ P(X = x)zx = ∑ ρX (x)zx , z ∈ [0, 1].
x ≥0 x ≥0

La série entière qui définit la fonction G converge lorsque z se trouve dans l’inter-
valle [0, 1] car G (1) = 1. Calculons formellement G 0 (z) = ∑ x≥1 ρ X ( x ) xz x−1 . Mainte-
nant, rien ne garantit plus que G 0 (1) < ∞ ; pour que cela soit le cas, il faut que la série
entière ∑ x≥1 ρ X ( x ) x < ∞. Mais ∑ x≥1 ρ X ( x ) x = E( X ).
Plus généralement, la fonction génératrice contient de manière condensée plusieurs
caractéristiques de la loi de X comme le montre le théorème suivant :
Théorème 4.3.2. Soit X est une variable aléatoire sur (Ω, F , P), à valeurs dans X = N ; on
note ρ := ρ X la densité discrète de PX et G := GX la fonction génératrice de X. Alors
n
1. Pour tout n ∈ N, on a ρ X (n) = n! 1 d G
dzn (0). Par conséquent, la fonction génératrice
détermine de manière unique la loi de la variable aléatoire X.
2. E( X ) < ∞ si, et seulement si, G 0 (1−) existe et, dans ce cas, E( X ) = G 0 (1−) =
limz↑1 G 0 (z).
3. Var( X ) < ∞ si, et seulement si, G 00 (1−) existe et, dans ce cas, Var( X ) = G 00 (1−) −
G 0 (1−)2 + G 0 (1−).
Démonstration. La démonstration est triviale si la loi de la variable aléatoire a un support fini. Nous
nous concentrons donc au cas où X prend une infinité de valeurs dans N avec probabilité strictement
positive.
1. Puisque pour z ∈ [0, 1], nous avons G (z) = ∑k≥0 ρ(k)zk , il s’ensuit que G (0) = ρ(0). De même,
pour 0 ≥ z < 1, G 0 (z) = ∑k≥1 ρ(k)kzk−1 et G 0 (0) = ρ(1). Par récurrence, pour0 ≥ z < 1, nous
avons G (n) (z) = ∑k≥n ρ(k)k (k − 1) · · · 1zk−1 et G 0 (0) = k!ρ(k).
2.
G (1) − G ( z ) 1 − zx
1−z
= ∑ ρ( x ) 1 − z = ∑ ρ(x)(1 − zx ) ∑ zk
x ≥1 x ≥1 k ≥0
x −1
= ∑ ρ( x ) ∑ zk , expression bien définie sur [0, 1[.
x ≥1 k =0

En prenant la limite
x −1
G (1) − G ( z )
lim = lim ∑ ρ( x ) ∑ zk
z ↑1 1−z z ↑1 x ≥1 k =0
N x −1
= sup sup ∑ ρ( x ) ∑ zk
z <1 N ≥1 x =1 k =0
N x −1
= sup ∑ ρ(x) sup ∑ zk , car, par monotonie, on peut intervertir les limites
N ≥1 x =1 z <1 k =0
N
= sup ∑ ρ( x ) x
N ≥1 x =1

= sup ∑ ρ(x)xzx−1 , car sup xz x−1 = x.
z <1 x =1 z <1

Si toutes ces expressions restent finies lorsque z = 1, nous avons que EX = limz↑1 G 0 (z) =
G 0 (1−).

/Users/dp/a/ens/[Link] 35
2022-09-18 • 20:20:33.
4.4. Fonction caractéristique Espérance, variance ; théorèmes des grands nombres

3. De même,
G 0 (1−) − G 0 (z)
lim
z ↑1 1−z
= G 00 (1−) = ∑ ρ(x)x(x − 1) ∈ [0, ∞].
x ≥2

Si G 00 (1−) < ∞, alors, G 00 (1−) = E( X 2 ) − E( X ).

4.4 Fonction caractéristique


Définition 4.4.1. Soit X une variable aléatoire réelle définie sur un espace probabilisé
(Ω, F , P). On appelle fonction caractéristique , l’application χ X : R → C, définie par
ˆ ˆ
χ X (t) = E(exp(itX )) = exp(itX (ω ))P(dω ) = exp(itx )PX (dt), t ∈ R.
Ω R

On remarque immédiatement que la fonction caractéristique ne dépend pas de X


mais de PX ; elle est la transformée de Fourier de cette loi.

Proposition 4.4.2. La fonction caractéristique possède les propriétés suivantes :


1. Pour tout t ∈ R, on a

|χ(t)| ≤ 1 = χ(0) et χ(t) = χ(−t).

2. Elle est uniformément continue sur R, i.e.

∀ε > 0, ∃δ > 0 : |h| < δ ⇒ ∀t ∈ R, |χ(t + h) − χ(t)| ≤ ε.

3. La fonction caractéristique est réelle si, et seulement si, elle provient d’une loi symé-
trique.
(r )
4. Si pour un entier n ≥ 1 on a E| X |n < ∞, alors χ X existe pour tout entier r ≤ n et
limt→0 ε n (t) = 0.
(r ) ´
— χ X (t) = R (ix )r exp(itx )PX (dx ),
(r )
χ X (0)
— EX r = ir ,
(it)r (it)n
— χ X (t) = (∑rn=0 r! EX r ) + n! ε n (t), où ε n (t) ≤ 3E| X |n et limt→0 ε n (t) = 0.
(2n)
5. Si χ X (0) existe et est finie, alors EX 2n < ∞.
(E| X |n )1/n
6. Si E| X |n < ∞ pour tout n ≥ 1 et lim supn→∞ n
1
= eR < ∞, alors

(it)n
χ X (t) = ∑ n! EX n ,
n ∈N

pour tout t avec |t| < R.


7. Elle définit un noyau positif, i.e. pour toutes les familles finies de réels (t j ) j=1,...,n et de
complexes (z j ) j=a,...,n , on a
n n
∑ ∑ χ(t j − tk )z j zk ≥ 0.
j =1 k =1

Démonstration. Voir [65, Théorème 1, §II.12, pp. 278–281].

/Users/dp/a/ens/[Link] 36
2022-09-18 • 20:20:33.
Espérance, variance ; théorèmes des grands nombres 4.5. Théorèmes des grands nombres

Théorème 4.4.3 (Critère de Bochner). Une application f : R → C est une fonction ca-
ractéristique si, et seulement si, elle définit un noyau positif, elle est continue en 0 et vérifie
f (0) = 1.
Démonstration. Voir [15, Théorème 6.5.2, page 180] ou [47, Théorème 4.2.1, pp. 71–73]
par exemple.
Comme un cas particulier d’un résultat de Cramér [18] sur la représentation des
certaines fonctions par des intégrales de Fourier, on a aussi le
Théorème 4.4.4 (Critère de Cramér). Une fonction f complexe, bornée, continue sur R est
caractéristique, si et seulement si,
1. f (0) = 1 et
2. la fonction g, définie par
ˆ Aˆ A
g( x, A) = f (t − s) exp(i (t − s) x )dtds,
0 0

est réelle et positive pour tout x ∈ R et tout A > 0.


Démonstration. Voir [47, Théorème 4.2.3, pp. 73–75].
Par ailleurs la fonction caractéristique caractérise la loi dans le sens que si X1 et X2
ont la même loi, alors χ X1 = χ X2 et nous avons une formule d’inversion décrite par le
Théorème 4.4.5 (Formule d’inversion de Lévy). La loi PX de laquelle découle la fonction
caractéristique χ X s’obtient par la formule d’inversion
ˆ T
PX ({ x1 }) + PX ({ x2 }) 1 exp(−itx1 ) − exp(−itx2 )
PX (] x1 , x2 [) + = lim χ X (t)dt.
2 T →∞ 2π − T it
Démonstration. Voir [14, Théorème 1, §8.3, page 287]

4.5 Théorèmes des grands nombres


Avant de présenter les deux théorèmes de grands nombres, commençons par un
exemple. Soit (Ω, F , P) un espace de probabilité, avec Ω = {ω = (ω1 , . . . , ωn ), ωi ∈
{0, 1}} et F = P (Ω). On probabilise l’espace par la loi non-uniforme ayant la densité
n n
discrète ρ(ω ) = p∑i=1 ωi (1 − p)n−∑i=1 ωi pour un p ∈ [0, 1] et on s’intéresse à la famille
de variables aléatoires Xi : Ω → {0, 1}, définies par Xi (ω ) = ωi , i = 1, . . . , n. On peut
alors calculer la ie marginale

P( Xi = 1) = P({ω : ωi = 1})
= p ∑ p ∑ k 6 =i ω k (1 − p ) n −1− ∑ k 6 =i ω k
ω1 ,...,ωi−1 ,ωi+1 ,...,ωn
  ωk
p
= p (1 − p ) n −1
∑ ∏ 1− p
ω1 ,...,ωi−1 ,ωi+1 ,...,ωn k6=i
= p.
Par conséquent, on calcule de même que P( Xi = 0) = 1 − p. Maintenant, si on note
la somme partielle Sk = X1 + . . . + Xk , pour k = 1, . . . , n, il est immédiat de calculer

/Users/dp/a/ens/[Link] 37
2022-09-18 • 20:20:33.
4.5. Théorèmes des grands nombres Espérance, variance ; théorèmes des grands nombres
 
Sn
E( Sk ) = ∑ik=1 E( Xi )= pk et par conséquent E = p : l’espérance du nombre
n
moyen de fois où l’on a observé « face » est égale à la probabilité d’obtenir « face » lors
d’une réalisation.
D’un autre côté, on ne peut pas s’attendre à ce que pour tout ε > 0 et tout ω ∈ Ω
S (ω )
on ait | n n − p| < ε. En effet, pour p ∈]0, 1[,
 
Sn
P =1 = P( X1 = 1, . . . , Xn = 1) = pn
n
 
Sn
P =0 = P( X1 = 0, . . . , Xn = 0) = (1 − p)n .
n
1 1
En choisissant p = 2 et ε < 2n ,
on voit qu’en notant
 
Sn ( ω )
As = ω ∈ Ω : = s , s ∈ [0, 1],
n
A1 est un événement avec P( A1 ) = pn 6= 0 (par conséquent non-vide). Pour des ω ∈
S (ω )
A1 , on aura n n − p = 1 − p = 12 ≥ ε.
Nous observons cependant que lorsque n est grand, les probabilités des événe-
ments A0 et A1 sont exponentiellement petites en n, puisque P( A1 ) = pn et P( A0 ) =
(1 − p)n . Il est donc naturel de s’attendre à ce que la probabilité des événements {ω ∈
S (ω )
Ω : | n n − p| > ε} soit petite.
Proposition 4.5.1 (Inégalité de Markov). Soit (Ω, F , P) un espace de probabilité et ξ une
variable aléatoire réelle positive définie sur Ω. Alors

∀ε > 0, P(ξ ≥ ε) ≤ .
ε
Démonstration. Nous avons de manière évidente
ξ = ξ1ξ <ε + ξ1ξ ≥ε ≥ ξ1ξ ≥ε ≥ ε1ξ ≥ε .
Par conséquent, E(ξ ) ≥ εP(ξ ≥ ε).
Remarque 4.5.2. L’inégalité de Markov présente un intérêt uniquement si E(ξ ) < ∞.
Corollaire 4.5.3. Soit (Ω, F , P) un espace de probabilité et ξ une variable aléatoire réelle
définie sur Ω. Alors, pour tout ε > 0, on a
E(|ξ |)
P(|ξ | ≥ ε) ≤
ε
E( ξ 2 )
P(|ξ | ≥ ε) ≤
ε2
Var(ξ )
P(|ξ − E(ξ )|) ≥ ε) ≤ (inégalité de Bienaymé-Tchebychev).
ε2

Remarque 4.5.4. De nouveau ces inégalités présentent un intérêt si le second membre


est petit et en particulier si les espérances ou la variance qui y apparaissent sont finies.
L’inégalité de Bienaymé-Tchebychev est très grossière. Dans beaucoup de situations
intéressantes, on peut améliorer de manière très substantielle le majorant de la proba-
bilité P(|ξ − E(ξ )|) ≥ ε) (cf. exercice ??).

/Users/dp/a/ens/[Link] 38
2022-09-18 • 20:20:33.
Espérance, variance ; théorèmes des grands nombres 4.5. Théorèmes des grands nombres

Lemme 4.5.5. Soient (Ω, F , P) un espace de probabilité et ( Xn )n∈N une suite de variables
aléatoires réelles de carré intégrables (i.e. Xi ∈ L2 (Ω, F , P; R), pour tout i ∈ N) indépen-
dantes et identiquement distribuées. On note m = E( X1 ) l’espérance de l’une d’entre elles,
σ2 = Var( X1 ) la variance de l’une d’entre elles et, pour tout entier k ≥ 0, Sk = ∑ik=1 Xk .
Alors

E(Sk ) = km
Var(Sk ) = kσ2 .

Démonstration. En utilisant la linéarité de l’espérance, nous obtenons E(Sk ) = ∑ik=1 E( Xi ) =


km. Par 4.2.2, nous avons

k k k
Var(Sk ) = ∑ Var(Xi ) + ∑ ∑ Cov( Xi , X j ) = kσ2
i =1 i =1 j=1;j6=i

car l’indépendance entraîne la non-corrélation.

Remarque 4.5.6. Dans le lemme 4.5.5, nous utilisons implicitement le fait que l’es-
pace (Ω, F , P) est suffisamment grand pour contenir dans son intégralité la suite X =
( Xn )n∈N , avec Xk : Ω → X, où (X, X ) est un espace d’événements. Lorsque nous nous
référons aux lois d’une variable aléatoire individuelle, par exemple Xk , nous sous-
entendons que cette loi est la marginale uni-dimensionnelle de la loi conjointe pour
toute la suite :

P( Xk ∈ A) = P( X1 ∈ X, . . . Xk−1 ∈ X, Xk ∈ A, Xk+1 ∈ X, Xk+2 ∈ X, . . .), A ∈ X .

Théorème 4.5.7 (Théorème faible des grands nombres). Soit ( Xk )k∈N une suite de va-
riables aléatoires indépendantes et identiquement distribuées, définies sur (Ω, F , P), à valeurs
dans X ⊆ R, telles que E( X12 ) < ∞. Alors
 
Sn ( ω )
∀ε > 0, lim P ω∈Ω: − E ( X1 ) ≥ ε = 0.
n→∞ n

Démonstration. La condition de carrée intégrabilité E( X12 ) < ∞ entraîne la finitude


de σ2 . Étant donné que la suite est indépendante et équidistribuée, nous utilisons le
résultat obtenu dans le lemme 4.5.5 pour établir que Var(Sn ) = nσ2 , où σ2 = Var( X1 ).
Il s’ensuit, de l’inégalité de Biaynaymé-Tchebychev, que pour tout ε > 0,

σ2
 
Sn Var(Sn )
P − E ( X1 ) ≥ ε = P (|Sn − nE( X1 )| ≥ nε) ≤ = → 0.
n n2 ε nε2

Définition 4.5.8. Soit (ξ n )n∈N une suite de variables aléatoires définies sur un espace
de probabilité (Ω, F , P) et ξ une autre variable sur (Ω, F , P). On dit que la suite (ξ n )
P
converge en probabilité vers ξ, et on note limn→∞ ξ n = ξ, si

∀ε > 0, lim P(|ξ n − ξ | > ε) = 0.


n→∞

/Users/dp/a/ens/[Link] 39
2022-09-18 • 20:20:33.
4.5. Théorèmes des grands nombres Espérance, variance ; théorèmes des grands nombres

Remarque 4.5.9. Le théorème faible des grands nombres établit que pour une suite de
variables aléatoires indépendantes, identiquement distribuées et de carré intégrables,
∑n X P
on a limn→∞ k=n1 k = E( X1 ). Les conditions d’applicabilité du théorème peuvent être
affaiblies de différentes manières.
— Pour des variables aléatoires de carré intégrables, le théorème reste valable pour
des variables qui sont seulement décorrélées au lieu d’être indépendantes ; même
la condition d’équidistribution peut être affaiblie. On a alors limn→∞ n1 ∑nk=1 ( Xk −
P
E( Xk )) = 0.
— La condition de carré-intégrabilité peut être affaiblie en une condition d’intégra-
bilité. La suite doit, dans ce cas, rester indépendante et équidistribuée (voir [65,
P
Théorème 2, §III.3, pp. 325–326]). On a alors limn→∞ 1
n ∑nk=1 Xk = E( X1 ).

Lemme 4.5.10. Soient (ζ n ) et (ξ n ) des suites de variables aléatoires sur (Ω, F , P) et ( an )


une suite numérique. Alors
P P P
1. [limn∈N ζ n = 0] ∧ [limn∈N ξ n = 0] =⇒ [limn∈N (ζ n + ξ n ) = 0].
P P
2. [limn∈N ξ n = 0] ∧ [supn∈N | an | < ∞] =⇒ [limn∈N an ξ n = 0].

D’autres types de convergence, plus fortes que la convergence en probabilité, sont


possibles pour des suites de variables aléatoires.

Définition 4.5.11. Soit (ξ n )n∈N une suite de variables aléatoires définies sur un espace
de probabilité (Ω, F , P) et ξ une autre variable sur (Ω, F , P). On dit que la suite (ξ n )
p.s.
converge presque sûrement vers ξ, et on note limn→∞ ξ n = ξ, si

P({ω ∈ Ω : lim ξ n (ω ) = ξ (ω )}) = 1.


n→∞

Théorème 4.5.12 (Théorème fort des grands nombres). Soit une suite ( Xn ) de variables
aléatoires réelles définies sur un espace de probabilités (Ω, F , P) qui sont deux-à-deux décor-
rélées et vérifiant supn∈N Var( Xn ) < ∞. Alors

1 n p.s.
lim
n→∞ n
∑ ( Xk − E( Xk )) = 0.
k =1

La démonstration de ce théorème reste en dehors des exigences de ce cours. L’uti-


lisation de l’adjectif « fort » est justifiée par le fait que l’on peut montrer que la conver-
gence presque sûre entraîne la convergence en probabilité mais que la réciproque n’est
pas vraie.

Exercice 4.5.13. (Principe d’une simulation Monte Carlo pour des échantillons indé-
pendants). Soit (Un )n∈N une suite de variables aléatoires indépendantes et identique-
ment distribuées avec la loi uniforme sur l’intervalle [0, 1]. Soit f : [0, 1] → R une appli-
cation de carré intégrable. On construit la suite des sommes partielles Sn = ∑nk=1 f (Uk ).
La suite Snn converge-t-elle en probabilité et si oui vers quoi ? Application : simuler sur
ordinateur avec la suite Snn avec f ( x ) = 1+1x2 .

/Users/dp/a/ens/[Link] 40
2022-09-18 • 20:20:33.
Espérance, variance ; théorèmes des grands nombres 4.6. Théorème central limite

4.6 Théorème central limite


Les théorèmes des grands nombres affirment qu’en répétant plusieurs fois la même
expérience aléatoire, la moyenne empirique des observations finit par se stabiliser à
la valeur numérique de l’espérance. Le théorème central limite nous renseigne sur la
dispersion de ces observations empiriques autour la valeur moyenne. On commence
par rappeler deux résultats élémentaires.
Lemme 4.6.1. Soit (cn )n∈N une suite de nombre complexes vérifiant limn→∞ cn = c pour
un certain c ∈ C. Alors limn→∞ (1 + cnn )n = exp(c).
Lemme 4.6.2. On note χm,σ2 la fonction caractéristique de la loi normale de moyenne m et de
variance σ2 , c’est-à-dire de la loi ayant une densité √ 1 exp(−( x − m)2 /2σ2 ) par rapport à
2πσ
la mesure de Lebesque sur R. On a alors

χm,σ2 (t) = exp(itm − t2 σ2 /2).

Dans le tableau 4.1 on rappelle les densités ρ de quelques lois usuelles ainsi que
leurs fonctions caractéristiques χ.

Loi de X X ρX χX
Binomiale Bn,p {0, . . . , n} x x
Cn p (1 − p )n− x (1 − peit )n
x
Poisson(λ) N exp(−λ) λx! exp(λ(eit − 1))
1 eitb −eita
Uniforme [ a, b] [ a, b] ⊂ R 1
b− a 1[ a,b] ( x ) b− a it
√ 1 exp(− ( x −m )2
Normale N (m, σ2 ) R 2σ 2 ) exp(itm − t2 σ2 /2)
2πσ
Γ( p, λ) R+ 1
Γ( p)
p
λ x p − 1 exp(−λx ) (1 − itλ )− p

Table 4.1 – Densités et fonctions caractéristiques pour quelques lois usuelles.

Théorème 4.6.3. (Théorème central limite) Soit ( Xn )n∈N une suite de variables aléatoires
indépendantes et identiquement distribuées avec EX1 = m et VarX1 = σ2 . En notant Sn =
∑nk=1 Xk , on a
Sn − nm
 
lim P √ ≤ x = Φ0,1 ( x ),
n→∞ σ n
où Φ0,1 désigne la fonction de répartition d’une variable aléatoire normale d’espérance 0 et de
variance 1.
La convergence établie par ce théorème est une convergence plus faible que la
convergence en probabilité ; on l’appelle convergence en loi.
Définition 4.6.4. Soient (ξ n )n∈N une suite de variables aléatoires réelles sur un espace
(Ω, F , P) et ξ une variable aléatoire réelle sur le même espace. On dit que la suite
(ξ n )n∈N converge en loi vers ξ, et l’on note 1 limn→∞ ξ n = ξ, si, pour tout x ∈ R,
loi

lim P(ξ n ≤ x ) = Fξ ( x ) := P(ξ ≤ x ).


n→∞
d
1. Cette convergence est aussi notée limn→∞ ξ n =ξ, surtout dans la littérature anglo-saxonne (pour
convergence in distribution).

/Users/dp/a/ens/[Link] 41
2022-09-18 • 20:20:33.
4.7. Exercices Espérance, variance ; théorèmes des grands nombres

Démonstration du théorème 4.6.3. Puisque pour toute variable aléatoire réelle X et tout
couple de nombres réels a, b on χ aX +b (t) = χ X ( at) exp(itb) (voir exercice 54, on peut
sans perte de généralité, supposer que EX1 = 0.
On utilise l’indépendance des variables et les faits que χ0X1 (0) = EX1 = 0 et
χ00X1 (0) = EX12 = σ2 pour des variables d’espérance nulle et de variance σ2 , pour écrire
  n
Sn t
E(exp(it √ ) = χ √ .
σ n σ n
σ2 √
Or, en utilisant la proposition 4.4.2, on a, pour grand n, que χ( σ√t n ) = 1 − t
2 (σ n)
2 +
|t|
o ( σ√n )2 . Par conséquent,

2 2 ! n
σ2 |t|
 
Sn t
lim E(exp(it √ )) = 1− √ +o √ = exp(−t2 /2) = χN (0,1) (t), t ∈ R,
n→∞ σ n 2 σ n σ n

où χN (0,1) est la fonction caractéristique de la loi normale centrée (i.e. d’espérance


nulle) réduite (i.e. de variance 1).
Remarque 4.6.5. La condition de carré intégrabilité ne peut pas être affaiblie. Si les
variables aléatoires de la suite sont intégrables mais pas de carré
√ intégrables (i.e. ont
des “queues lourdes”), la bonne normalisation n’est plus en n mais des exposants
déterminés par la puissance des moments fractionnaires qui existent et la convergence
peut avoir lieu vers des lois stables autres que la loi normale.
Dans ce chapitre, nous avons introduit plusieurs notions de convergence : en proba-
bilité, presque sûre, en loi. On peut introduire d’autres, par exemple les convergences
en L p , avec p ∈ [1, ∞[ définies par
Lp
lim ξ n = ξ ⇔ lim kξ n − ξ k p = 0,
n n

où kξ n − ξ k p = [E(|ξ n − ξ | p )]1/p . La raison d’être de toutes ces définition est qu’elles


ne sont pas équivalentes ; nous avons l’hiérarchie suivante :

p.s.
ξ n −→ ξ

P loi
ξ n −→ ξ ξ n −→ ξ

Lp
ξ n −→ ξ

4.7 Exercices
Lois, espérance, variance
40. Soit α la variable aléatoire définie sur (Ω, F , P) qui prend des valeurs dans X =
{0, π/2, π } avec probabilité uniforme. On note X = sin α et Y = cos α. Calculer

/Users/dp/a/ens/[Link]
42
2022-11-08 • 17:09:00.
Espérance, variance ; théorèmes des grands nombres 4.7. Exercices

(a) EX,
(b) EY,
(c) Cov( X, Y ),
(d) P( X = 1, Y = 1).
Quelle est votre conclusion ?
41. Soient (ξ k )k=1,...,n des variables aléatoires indépendantes sur (Ω, F , P) prenant
un nombre fini de valeurs réelles. Calculer la loi de X = max ξ k , k = 1, . . . , n et
de Y = min{ξ k , k = 1, . . . , n}.
42. Soient (ξ k )k=1,...,n des variables aléatoires indépendantes sur (Ω, F , P) à valeurs
dans X = {0, 1} et (λk )k=1,...,n une suite de nombres strictement positifs fixés.
On sait que P(ξ k = 1) = λk ∆ avec ∆ un petit nombre réel strictement positif.
(a) Pouvez-vous donner une borne sur ∆ qui traduit proprement la notion de
« petitesse » ?
(b) Estimer P(ξ 1 + . . . + ξ n = 1) en ordre ∆2 .
(c) Estimer P(ξ 1 + . . . + ξ n > 1).
43. Soient X et Y deux variables aléatoires réelles sur (Ω, F , P) avec VarX > 0 et
VarY > 0.
(a) Montrer que |r ( X, Y )| ≤ 1.
(b) Monter que |r ( X, Y )| = 1 si et seulement si X = aY + b.
44. Soit ξ une variable aléatoire réelle avec E(ξ 2 ) < ∞.
(a) Montrer que E(|ξ |) < ∞.
(b) Montrer que infa∈R E((ξ − a)2 ) est atteint pour une valeur a0 ∈ R. Détermi-
ner ce a0 .
(c) Déterminer la valeur de infa∈R E((ξ − a)2 ) en termes d’une quantité relative
à la variable ξ.
45. Soit ξ une variable aléatoire réelle de loi Pξ et fonction de répartition Fξ .
(a) Déterminer Faξ +b pour a > 0 et b ∈ R.
(b) Déterminer Fξ 2 .
(c) Si ξ + = max(ξ, 0), déterminer Fξ + .
46. Soient ξ, η de variables aléatoires réelles définies sur (Ω, F , P) à valeurs dans
une partie discrète X ⊂ R. On note P(ξ,η ) leur loi conjointe ; on suppose que
Eξ = Eη = 0 et Varξ = Varη = 1. On note r := r (ξ, η ) le coefficient de corréla-
tion de ξ et η. Monter que
p
E(max(ξ 2 , η 2 )) ≤ 1 + 1 − r2 .

47. (Identité de Wald). Soient ( Xn )n∈N une suite de variables aléatoires réelles, indé-
pendantes et identiquement distribuées définies sur (Ω, F , P) et τ une variable
aléatoire définie sur le même espace (Ω, F , P), à valeurs dans N. Nous suppo-
sons que E(| X1 |) < ∞, E(τ ) < ∞ et que la variable τ est indépendante des
variables aléatoires ( Xn )n∈N . Montrer que la variable aléatoire
τ
Sτ = ∑ Xi
n =1

a une espérance et que E(Sτ ) = E(τ )E( X1 ). (La somme Sτ est une somme par-
tielle de la série de terme général Xn comportant un nombre aléatoire de termes).

/Users/dp/a/ens/[Link]
43
2022-11-08 • 17:09:00.
4.7. Exercices Espérance, variance ; théorèmes des grands nombres

Fonctions génératrices
48. On rappelle qu’une variable aléatoire X est dite suivre la loi binomiale Bn,p de
paramètres p ∈ [0, 1] et n ≥ 1 si P( X = k ) = Cnk pk (1 − p)n−k , pour k = 0, . . . , n.
(a) Calculer la fonction génératrice G := GBn,p correspondante.
(b) Calculer E( X ) à l’aide de la fonction génératrice.
(c) Calculer Var( X ) à l’aide de la fonction génératrice.
49. On rappelle qu’une variable aléatoire X est dite suivre la loi exponentielle Eλ de
k
paramètre λ > 0 si P( X = k ) = exp(−λ) λk! , pour k ∈ N.
(a) Calculer la fonction génératrice G := GEλ correspondante.
(b) Calculer E( X ) à l’aide de la fonction génératrice.
(c) Calculer Var( X ) à l’aide de la fonction génératrice.
50. Soient X et Y deux variables aléatoires indépendantes sur (Ω, F , P) à valeurs
dans N. Exprimer la fonction génératrice GX +Y de la somme X + Y, en termes
de fonctions génératrices GX et GY des variables individuelles.
51. En se servant du résultat de l’exercice 50, déterminer GBn,p en termes de GB1,p et
comparer avec le résultat direct, obtenu en exercice 48.
52. (Extrait du CC du 16 novembre 2017).
Soit p := ( pn )n∈N la suite définie par

an
pn = , pour n ∈ N et a > 0.
(1 + a ) n +1
(a) Montrer que pour tout a > 0, la suite p est un vecteur de probabilité sur N.
(b) Soit X une variable aléatoire sur un espace probabilisé (Ω, F , P) à valeurs
dans N dont la loi est déterminée par le vecteur de probabilité p. Calculer la
fonction génératrice GX (z) de X pour z ∈ [−1, 1].
(c) Calculer GX0 ( z ) et G 00 ( z ).
X
(d) En déduire E( X ) et Var( X ).
53. Une somme de variables aléatoires comportant un nombre aléatoire de termes.
(Extrait de l’examen du 15 décembre 2018).
Soient ( Xn )n≥1 une suite de variables aléatoires réelles, indépendantes et iden-
tiquement distribuée, d’espérance nulle et de variance finie, et N une variable
aléatoire à valeurs dans N, indépendante de la suite ( Xn ), de loi ν(k ) = P( N =
k) = 2k1+1 pour tout k ∈ N. On note S N = ∑nN=1 Xn et σ2 = var( X1 ).
(a) Calculer la fonction génératrice G (z) = E(z N ) et s’en servir pour calculer
E( N ).
(b) Montrer que E(S N ) = 0.
(c) Calculer var(S N ). (Utiliser l’indépendance !)

Fonctions caractéristiques
54. Soient X une variables aléatoire réelle et a, b ∈ R. Montrer que χ aX +b (t) =
χ X ( at) exp(itb).
55. Soient (χn )n∈N une suite de fonctions caractéristiques et (λn )n∈N une suite de
variables positives avec ∑n∈N λn = 1. Monter que ∑n∈N λn χn est encore une
fonction caractéristique.

/Users/dp/a/ens/[Link]
44
2022-11-08 • 17:09:00.
Espérance, variance ; théorèmes des grands nombres 4.7. Exercices

56. Soit la famille (χ j ) j=1,...,n de fonctions caractéristiques. Montrer que ∏nj=1 χ j est
encore une fonction caractéristique.

Inégalité de Bienaymé-Tchebychev, théorèmes des grands nombres


57. Dans cet exercice, les variables aléatoires utilisées sont à valeurs dans des parties
finies de R. Toutes les espérances utilisées dans l’énoncé existent.
(a) Soit ξ une variable aléatoire discrète à valeurs dans une partie de R+ . Rappe-
ler comment on démontre, pour tout a > 0, l’inégalité de Markov-Tchebychev


P( ξ ≥ a ) ≤ .
a
(b) Soient a > 0 et f : R → R+ une fonction croissante telle que f ( a) > 0.
Montrer que
E( f (ξ ))
P( ξ ≥ a ) ≤ .
f ( a)
(c) En conclure que

P(ξ ≥ a) ≤ inf [exp(−sa)E(exp(sξ ))] .


s >0

(d) Soit ( Xi )i∈N une suite de variables aléatoires indépendantes à valeurs dans
{0, 1} et de même loi, chargeant 1 avec probabilité p, avec p ∈]0, 1[. Calculer,
pour un s > 0 arbitraire,
!
n
g(s) := E exp(s ∑ Xi )
i =1

et utiliser cette formule explicite pour majorer, pour un a ∈] p, 1[, la probabi-


lité P( n1 ∑in=1 Xi ≥ a).
(e) Déterminer s0 := arg mins>0 exp(−nas) g(s).
(f) En conclure que
!
1 n
n i∑
P Xi ≥ a ≤ exp (nh( a, p)) ,
=1

a −a
où h( a, p) := − a log p − (1 − a) log 11− p.
58. Soit (ξ n )n∈N une suite de variables aléatoires indépendantes réelles et de même
loi, vérifiant P(ξ n = 1) = p = 1 − P(ξ n = −1), pour tout n ∈ N. On note
Sn = ∑in=1 ξ i . Le but de l’exercice est d’établir, dans le cas particulier où p = 1/2,
la formule (valable pour p ∈ [0, 1] arbitraire)
 
Sn 1
∀ε > 0, P − (2p − 1) ≥ ε ≤ 2 exp(− ε2 n).
n 2

Il s’agit d’une amélioration de l’inégalité de Bienaymé-Tchebychev. On verra


plus loin (exercice 74) que cette inégalité peut se généraliser à des variables aléa-
toires bornées indépendantes non nécessairement équidistribuées.

/Users/dp/a/ens/[Link]
45
2022-11-08 • 17:09:00.
4.7. Exercices Espérance, variance ; théorèmes des grands nombres

59. Dans une circonscription d’un million d’électeurs les candidats A et B sont en
lice. Parmi ces électeurs, 2000 connaissent bien le candidat A et votent unanime-
ment pour lui. Les autres 998000 choisissent purement au hasard en lançant une
pièce honnête. Minorer la probabilité pour que le candidat A gagne.
60. Soit ( Xn )n∈N une suite de variables aléatoires réelles indépendantes et identi-
quement distribuées, avec E| X1 | < ∞. On note m = EX1 .
(a) Calculer la fonction caractéristique de la variable aléatoire Snn , où Sn = ∑nk=1 Xk .
loi
(b) S’en servir pour montrer que Snn −→ m.
61. Soit (Ψn )n≥1 une suite de variables aléatoires indépendantes, uniformément dis-
tribuées sur [0, 2π [, définies sur (Ω, F , P). Une particule se déplace aléatoire-
ment dans le plan selon la règle suivante : lorsque à l’instant n elle est en posi-
tion ξ n ∈ R2 , à l’instant n + 1 elle sera en une position ξ n+1 ∈ R2 telle que la
longueur du déplacement ξ n+1 − ξ n est une constante r > 0 et l’angle formé par
ce déplacement et l’axe des abscisses est Ψn+1 . Soit Dn2 = kξ n − ξ 0 k2 la distance
entre les positions initiale et au temps n de la particule.
ξ
(a) Calculer limn→∞ nn .
(b) Calculer E( Dn2 ).
D2
(c) Calculer limn→∞ nn .
62. Soit ( Tn )n∈N une suite de variables aléatoires indépendantes et identiquement
distribuées à valeurs réelles positives, bornées (donc intégrables), définies sur
(Ω, F , P). La variable aléatoire Tn sera interprétée comme représentant la durée
de vie de la ne ampoule changée. Dès qu’une ampoule est grillée on la remplace
aussitôt. Pour tout t > 0, on note
N
Nt = sup{ N ≥ 1 : ∑ Tn ≤ t}
n =1
p.s.
le nombre d’ampoules utilisées jusqu’au temps t. Montrer que limt→∞ Nt t =
1
E( T1 )
.
63. (Extrait du contrôle du 16 novembre 2017).
On considère un espace probabilisé (Ω, F , P) suffisamment grand pour pouvoir
contenir simultanément toutes les variables aléatoires dont on se servira dans
cet exercice.
(a) Soient X et Y deux variables aléatoires indépendantes sur (Ω, F , P) à valeurs
dans X = {0, 1}. La loi de X est déterminée par le vecteur de probabilité
p = ( p, 1 − p) et celle de Y par le vecteur q = (q, 1 − q), où 0 ≤ p, q ≤ 1.
Exprimer la valeur r := P( X = Y ) en fonction des p et q.
(b) Calculer Var(1{X =Y } ).
(c) On considère maintenant deux suites définies sur (Ω, F , P). La première
est une suite ( Xn )n∈N de copies indépendantes de X (i.e. elle est indépen-
dante et identiquement distribuée selon la loi p). La seconde est une suite
(Yn )n∈N de copies indépendantes de Y (i.e. elle est indépendante et identi-
quement distribueé selon la loi q). La deux suites sont en outre mutuelle-
ment indépendantes. Utiliser un résultat du cours pour montrer que la suite
1 N
N ∑n=1 1{ Xn =Yn } converge en probabilité vers une constante qu’il faudra dé-
terminer.

/Users/dp/a/ens/[Link] 46
2022-09-18 • 20:20:33.
Chaînes de Markov sur des espaces
5
d’états dénombrables

Les chaînes de Markov présentent des multiples intérêts :


— De point de vue purement probabiliste, elles s’intègrent dans la hiérarchie gé-
nérale des modèles probabilistes introduite par le théorème ?? ; elles font partie
du niveau qui se situe juste au dessus des suites indépendantes étudiées dans le
chapitre précédant.
— En théorie de l’information, elles modélisent le fonctionnement des canaux de
transmission et permettent l’étude de leur fonctionnement asymptotique.
— En théorie de la complexité, elles modélisent la notion d’automate fini (et plus
généralement de machine de Turing) et les méthodes développées pour leur
étude servent à étudier le « problème d’arrêt » en théorie de calculabilité.

5.1 Probabilités de transition, matrices stochastiques


Soit X un espace dénombrable (muni de sa tribu exhaustive). On considère un sys-
tème aléatoire qui peut occuper n’importe quel état de X. À l’instant initial n = 0,
le système occupe l’état x0 ∈ X avec P( X0 = x0 ) = ρ0 ( x0 ). Aux instants suivants
n = 1, 2, . . . le système change son état en X1 , X2 , . . . selon des probabilités condition-
nelles déterminées comme suit : Supposons que jusqu’à l’instant n le système ait visité
les états x0 , x1 , . . . , xn . Alors, il évoluera selon la probabilité conditionnelle vérifiant la
condition

ρn+1,xn (y) := P( Xn+1 = y| X0 = x0 , . . . , Xn = xn ) = P( Xn+1 = y| Xn = xn ) =: Pxn ,y ,

i.e. l’évolution future du système oublie le passé pour ne se souvenir que du présent.
Cette condition de dépendance s’appelle propriété faible de Markov.
Cette évolution est un cas particulier du théorème 3.1.8. Il est évident que ∀ x, y ∈ X,
nous avons Px,y ≥ 0 et ∑z∈X Px,z = 1, i.e. chaque ligne de la matrice P = ( Px,y ) x,y∈X est
un vecteur de probabilité sur X. Une telle matrice est appelée matrice stochastique.

47
5.1. Probabilités de transition, matrices stochastiques Chaînes de Markov

Définition 5.1.1. Soient X un espace dénombrable, X = P (X) sa tribu exhaustive et P


une matrice stochastique sur X. On note Ω = XN et F = ⊗n∈N X et ρ0 un vecteur de
probabilité sur X . Soit Pρ0 l’unique probabilité (qui existe en vertu du théorème 3.1.8)
sur (Ω, F ) avec ρn+1,xn (y) = Pxn ,y . Alors la suite de variables aléatoires X = ( Xn )n∈N
sur (Ω, F , Pρ0 ) à valeurs dans (X, X ) vérifiant
1. Pρ0 ( X0 = x0 ) = ρ0 ( x0 ) et
2. P( Xn+1 = xn+1 | X0 = x0 , . . . , Xn = xn ) = Pxn ,xn+1
est appelée chaîne de Markov à espace d’états X, matrice stochastique P et probabilité
initiale ρ0 , notée CM(X, P, ρ0 ).
Le cas où X est non-dénombrable ne sera pas abordé dans ce cours (cf. [56], par
exemple, pour une construction dans le cas où X est un espace mesurable).
En traduisant la construction du théorème 3.1.8 dans la situation présente, nous
obtenons la loi conjointe de ( X0 , . . . , Xn ) comme marginale fini-dimensionnelle de la
loi Pρ0 , par la formule

Pρ0 ( X0 = x0 , . . . , Xn = xn ) = ρ0 ( x0 ) Px0 ,x1 · · · Pxn−1 xn .

À cause de la forme simplifiée qu’a le second membre, nous pouvons alors calculer la
ne marginale

Pρ0 ( Xn = x n ) = ∑ ρ0 ( x0 ) Px0 ,x1 · · · Pxn−1 ,xn


x0 ,...,xn−1 ∈X
= (ρ0 Pn )( xn ),

où le vecteur de probabilité ρ0 est écrit sous forme de vecteur ligne. On voit donc que
dans l’hiérarchie des modèles décrits par le théorème ??, le modèle de dépendance
markovienne se situe au niveau de complexité juste au dessus du modèle indépendant
introduit en §3.2.
Remarque 5.1.2. Lorsque le vecteur ρ0 (y) = δx,y pour un x ∈ X donné, nous écrivons
Px au lieu de Pρ0 . Nous avons alors Px ( Xn = y) = Pn ( x, y). Il ne faut pas confondre
la notation PX , signifiant la loi d’une variable aléatoire X, avec Px , signifiant la loi sur
l’espace des trajectoires avec démarrage initiale déterministe ρ0 = ε x . En fait, Px dé-
signe la loi conjointe PX de la suite infinie X = ( X0 , X1 , . . .) conditionnée à l’évènement
{ X0 = x } .
Exemple 5.1.3. On dispose de deux pièces de monnaie, une honnête et une lestée,
donnant « face » avec probabilité 1/3. Si la pièce lancée au ne jeu montre « pile » on
utilise la pièce honnête pour la lancer au (n + 1)e jeu ; si elle montre « face » on utilise
la pièce lestée pour jouer au (n + 1)e jeu. Si on note ( Xn ) la suite de variables aléatoires
dans X = {0, 1} correspondant à ce jeu, elles constituent une chaîne de Markov, avec
probabilité conditionnelle de transition

P( Xn+1 = y| Xn = x ) = Pxy ,
1 1

où la matrice P := ( Pxy ) x,y∈X est égale à P = 2 2 . L’étude du comportement
2 1
3 3
asymptotique à grand n de la probabilité Pρ0 ( Xn = x ) = (ρ0 Pn )( x ) peut se faire en
s’inspirant de la méthode développée à l’exercice 67.

/Users/dp/a/ens/[Link] 48
2022-10-11 • 21:26:10.
Chaînes de Markov 5.2. Temps d’arrêt. Propriété forte de Markov

Théorème 5.1.4. La définition d’une chaîne de Markov est équivalente à la propriété d’in-
dépendance du futur et du passé, conditionnellement au présent. Plus précisément, en notant
pour 1 < p < n et x1 , . . . , xn ∈ X,

A = { X1 = x 1 , . . . , X p − 1 = x p − 1 } ,
B = { X p = x p },
C = { X p +1 = x p +1 , . . . , X n = x n } ,

nous avons
P( A ∩ C | B ) = P( A | B )P( C | B ).

Démonstration. Exercice.

5.2 Temps d’arrêt. Propriété forte de Markov


Définition 5.2.1. Soit ( Xn ) ∈ CM(X, P, ρ0 ) définie sur un espace (Ω, F , P). Une va-
riable aléatoire T : Ω → N ∪ {+∞} est un temps d’arrêt, si pour tout n ∈ N, l’évé-
nement { T = n} est entièrement déterminé par la donnée des valeurs prises 1 par les
variables X0 , . . . , Xn .

Exemple 5.2.2. Soit ( Xn )n∈N le relevée de température (en degrés Celsius avec une
décimale) à l’ombre dans un lieu donné à midi du jour n (où n = 0 correspond au
jour où des éphémérides ont commencé à exister). Soit T1 := inf{n ≥ 0 : Xn = 42.2}
et T2 := inf{n ≥ 0 : Xn est la température maximale jamais enregistrée en ce lieu}.
Évidemment T1 est un temps d’arrêt mais pas T2 . Qu’en est-t-il de T3 := inf{n ≥ 0 :
Xn > maxk=0,...,n−1 Xk } ?

Remarque 5.2.3. La notion de temps d’arrêt est importante en théorie de la complexité


algorithmique. Une machine de Turing est en effet une chaîne de Markov ; une condi-
tion nécessaire pour que la machine de Turing (i.e. un programme informatique) ré-
solve un problème algorithmique est de s’arrêter en un temps fini. La calculabilité al-
gorithmique d’un problème est donc directement reliée à l’existence d’un temps d’arrêt
fini pour la machine de Turing sensée le résoudre.

Définition 5.2.4. Soit ( Xn ) ∈ CM(X, P, ρ0 ) définie sur (Ω, F , P). Pour tout A ∈ X , on
note
(1)
τA0 := inf{n ≥ 0 : Xn ∈ A} ∈ N ∪ {+∞} et τA = τA := inf{n > 0 : Xn ∈ A} ∈ N ∪ {+∞}

les temps de premier retour et temps de première entrée de la chaîne dans l’ensemble
A. Lorsque A = {y}, nous simplifions la notation en τy0 au lieu de τ{0y} (et de même
pour τ{y} ).

Lemme 5.2.5. Les temps τA0 et τA définis dans 5.2.4 sont des temps d’arrêt par rapport à la
(filtration naturelle de) la chaîne.
1. En termes plus précis, si on note Fn = ⊗nk=0 X , et si { T = n} ∈ Fn pour tout n, on dit que T
est un (Fn )-temps d’arrêt. La suite des tribus (Fn ) est une suite croissante, appelée filtration naturelle
de la chaîne. Pour tout n ∈ N, la tribu Fn est la plus petite tribu qui rend les variables ( X0 , . . . , Xn )
(simultanément) mesurables.

/Users/dp/a/ens/[Link] 49
2022-10-11 • 21:26:10.
5.3. Classification des états ; récurrence, transience Chaînes de Markov

Supposons que Ω = tn∈N { T = n} (et par conséquent Pρ0 ( T < ∞) = 1). Par
ailleurs, la chaîne arrêtée à l’instant aléatoire T vérifiera :
XT ( ω ) : = XT (ω ) ( ω ) = ∑ X T ( ω ) ( ω )1{ T = n } ( ω ) = ∑ Xn ( ω )1{ T = n } ( ω ).
n ∈N n ∈N

Cette remarque, nous amène à définir F T comme la tribu trace


FT := { F ∈ F : ∀n ∈ N, F ∩ { T = n} ∈ Fn }.
Elle contient les événements qui lorsque on les restreint sur l’événement { T = n} ne
dépendent que de ( X0 , X1 , . . . , Xn ).
Théorème 5.2.6. Soient ( Xn )n∈N une CM(X, X , ρ), où X est dénombrable (fini ou infini) et
T un temps d’arrêt pour (la filtration naturelle de) la chaîne. On note XT≤ = ( X0 , . . . , XT ) le
passé de la chaîne et XT> = ( XT +1 , XT +2 , . . .) son futur strict (par rapport à l’instant aléatoire
T). Alors, sur l’événement { T < ∞}, la loi conditionnelle conjointe du futur strict de la chaîne
XT> sachant le passé XT≤ est égale à la loi conditionnelle conjointe du futur strict de la XT>
sachant le présent XT ; cette propriété est appelée propriété forte de Markov.
Démonstration. Utiliser la décomposition Ω = { T < ∞} = tn∈N { T = n}, fixer k ≥ 1
et calculer la probabilité conditionnelle
P( XT +1 = y1 , . . . XT +k = yk | T = n; X0 = x0 , . . . , Xn = xn ).
L’événement { T = n} est déterminé par les valeurs que prennent les variables aléa-
toires ( X0 , . . . , Xn ). Lorsque nous considérons les événements { T = n} et { X0 =
x0 , . . . , Xn = xn } des deux choses l’une :
— soit ils sont compatibles et dans ce cas { T = n} ∩ { X0 = x0 , . . . , Xn = xn } =
{ X0 = x 0 , . . . , X n = x n } ,
— soit ils sont incompatibles et dans ce cas { T = n} ∩ { X0 = x0 , . . . , Xn = xn } = ∅,
Dans le premier cas, en utilisant la propriété faible de Markov, on obtient sur { T = n},
P ( X n + 1 = y 1 , . . . X n + k = y k | X0 = x 0 , . . . , X n = x n ) = P ( X n + 1 = y 1 , . . . X n + k = y k | X n = x n ) .
Dans le deuxième cas, l’ensemble par rapport auquel nous conditionnons a une pro-
babilité nulle ; par conséquent, nous pouvons attribuer une valeur arbitraire à la pro-
babilité conditionnelle, par exemple la valeur prise par la probabilité conditionnelle au
premiers cas, à savoir P( Xn+1 = y1 , . . . Xn+k = yk | Xn = xn ).

5.3 Classification des états ; récurrence, transience


Lorsque l’espace des états X est fini et P a tous ses éléments de matrice strictement
positifs, il est facile de voir que si la chaîne de Markov évolue sans arrêt alors elle visite
tous les éléments de X une infinité de fois ; on dit que tous les états sont récurrents. Les
choses sont plus compliquées lorsque X est dénombrable infini ou si P n’a pas tous ses
éléments strictement positifs.
Définition 5.3.1. Soit ( Xn ) une chaîne de Markov CM(X, P, ρ0 ).
1. Le graphe dirigé ayant comme sommets l’ensemble X et comme arêtes les couples
( x, y) ∈ X2 tels que Px,y > 0 est appelé graphe (des transitions) de la chaîne de
Markov.

/Users/dp/a/ens/[Link] 50
2022-10-11 • 21:26:10.
Chaînes de Markov 5.3. Classification des états ; récurrence, transience

2. Un état y est dit accessible depuis l’état x, s’il existe un entier n := n( x, y) ≥ 1


n > 0. On note x → y.
tel que Px,y
3. Un état x communique avec un état y si x → y et y → x.
4. Un état x est dit essentiel si pour tout état y tel que x → y alors y → x.
L’ensemble des états essentiels est noté Xe . Leur complémentaire constitue l’en-
semble des états inessentiels Xi = X \ Xe .
Remarque 5.3.2. Il est immédiat de constater que x → y si, et seulement si, il existe une
suite finie d’arêtes dirigées composables dans le graphe de P qui forment un chemin
de x à y.
Proposition 5.3.3. Soit ( Xn ) une chaîne de Markov CM(X, P, ρ0 ).
1. La relation de communication restreinte à Xe est une relation d’équivalence. On note K
l’ensemble de classes d’équivalence Xe / ↔.
2. La classification des états est la partition de l’espace en
 
X = t[ x]∈K [ x ] t Xi ,

où [ x ] = {y ∈ Xe : x ↔ y}.
Démonstration. Exercice.
Définition 5.3.4. 1. Un ensemble d’états A ⊆ X est dit absorbant (ou stochasti-
quement fermé) si A 6= ∅ et pour x ∈ A ⇒ ∑y∈ A Px,y = 1.
2. Si pour un x ∈ X, on [ x ] = X, la chaîne est dite irréductible, i.e. ∀( x, y) ∈
X2 , ∃n := n( x, y) ≥ 1 : Px,y
n > 0.
N = α >
3. La chaîne est dite fortement irréductible si ∃ N > 0, ∃α > 0 : minx,y Px,y
0.
Définition 5.3.5. Soit ( Xn ) ∈ CM(X, P, ρ0 ) définie sur (Ω, F , P). Pour x ∈ X fixé et
tout n ≥ 1, on note qn = Px (τx = n) et q = ∑n≥1 qn = Px (τx < ∞). On dit qu’un état
x ∈ X est
— transient si q < 1,
— récurrent si q = 1,
— récurrent positif si Ex (τx ) < ∞.
Un état récurrent qui n’est pas récurrent positif est appelé récurrent nul.
Il s’avère pratique d’étendre la suite (qn )n≥1 en q0 = 0 et de définir une autre suite
(rn )n≥0 par rn = Px ( Xn = x ) = Pn ( x, x ), n ∈ N, avec bien sûr r0 = 1.
Lemme 5.3.6. Pour une chaîne de Markov et les suites (rn ) et (qn ) définies comme ci-dessus,
on a :
1. Pour tout n ≥ 0, la probabilité rn se décompose en

r n = r 0 q n + r 1 q n −1 + . . . + r n q 0 .

2. Les séries génératrices

R(z) = ∑ rn zn et Q(z) = ∑ qn zn
n ∈N n ∈N

sont bien définies pour z ∈ C avec |z| < 1.

/Users/dp/a/ens/[Link] 51
2022-10-11 • 21:26:10.
5.3. Classification des états ; récurrence, transience Chaînes de Markov

1
3. Pour |z| < 1, on a R(z) = 1− Q ( z )
.

Démonstration. 1. On décompose
n
r n = P x ( Xn = x ) = ∑ Px (Xn = x|τx = k)Px (τx = k)
k =1
n
= ∑ r n − k q k = r 0 q n + r 1 q n −1 + . . . + r n q 0 , avec la convention q0 ≡ 1.
k =0

2. Les séries définissant R(z) et Q(z) sont absolument convergentes pour |z| < 1.
En effet
1
| R(z)| ≤ ∑ rn |z|n ≤ ∑ |z|n = 1 − |z| , et
n ≥0 n ≥0
| Q(z)| ≤ ∑ qn |z| n
≤ ∑ qn = Px (τx < ∞) ≤ 1.
n ≥0 n ≥0

3. Pour |z| < 1 :


n
R ( z ) = r0 + ∑ r n z n = r0 + ∑ ∑ rn−k zn−k qk zk
n ≥1 n ≥1 k =0
n
= r0 + ∑ ∑ r n − k z n − k q k z k = r0 + R ( z ) Q ( z ).
n ≥0 k =0

1
Puisque r0 = 1, on conclut que R(z) = 1− Q ( z )
.

Lemme 5.3.7. Pour tout état x ∈ X,

Px (τx < ∞) = ∑ q n = Q (1).


n ≥1

Démonstration. Immédiate.

Théorème 5.3.8. Un état x ∈ X est récurrent si, et seulement si, ∑n≥0 Px ( Xn = x ) =


∑n≥0 rn = ∞.
Démonstration. L’état x est récurrent si q := ∑n≥1 qn = Q(1) = limz∈[0,1[,z→1 Q(z) = 1.
En utilisant l’expression pour R(z), établie en lemme 5.3.6, nous obtenons

1
lim R(z) = lim = ∞.
z∈[0,1[,z→1 z∈[0,1[,z→1 1 − Q ( z )

Supposons que ∑n≥0 rn < ∞. Comme tous les termes rn sont positifs, nous avons pour
tout N, ∑nN=1 rn ≤ limz∈[0,1[,z→1 R(z) = ∑n≥0 rn . Or limz∈[0,1[,z→1 R(z) = ∞, il y a donc
contradiction avec l’hypothèse ∑n≥0 rn < ∞.

Remarque 5.3.9. La condition ∑n≥0 rn = ∞ est équivalente à Ex (ηx ) = ∞, où la va-


riable aléatoire η A := ∑n≥0 1 A ( Xn ) dénombre les retours de la chaîne de Markov dans
A. Comme d’habitude, si A = {y}, on allège la notation en ηy au lieu de η{y} .

/Users/dp/a/ens/[Link] 52
2022-10-11 • 21:26:10.
Chaînes de Markov 5.4. Probabilité limite, probabilité invariante (stationnaire)

Théorème 5.3.10. Si l’état x ∈ X est récurrent alors tout état y ∈ X, accessible depuis x, est
aussi récurrent.
Démonstration. Supposons x récurrent, x → y mais y 6→ x. L’accessibilité x → y signifie
qu’il existe un entier M tel que P M ( x, y) = α > 0 ; la non-accessibilité de x à partir de
y signifie donc que Px (τx < ∞) ≤ 1 − α < 1 en contradiction avec l’hypothèse de
récurrence de x. Il existe donc un entier N tel que P N (y, x ) = β > 0. Nous avons donc
pour tout entier n ≥ 0

P M+ N +n (y, y) ≥ P N (y, x ) Pn ( x, x ) P M ( x, y) = βαPn ( x, x )

et
P M+ N +n ( x, x ) ≥ P M ( x, y) Pn (y, y) P N (y, x ) = αβPn (y, y).
Par conséquent, les séries ∑n≥0 Pn ( x, x ) et ∑n≥0 Pn (y, y) soit elles convergent simulta-
nément soit elles divergent simultanément. On conclut par le théorème 5.3.8.
Corollaire 5.3.11. Un chaîne de Markov irréductible sur un ensemble d’états X fini est né-
cessairement récurrente.

5.4 Probabilité limite, probabilité invariante (stationnaire)


Nous avons vu qu’une chaîne de Markov dépend du passé lointain uniquement à
travers sa dépendance du passé immédiat. Il est donc intuitivement clair qu’elle « ou-
blie » la condition initiale pour adopter un mode d’évolution dicté par la seule matrice
stochastique. Cette intuition est précisée par le théorème suivant.
Théorème 5.4.1 (Théorème ergodique pour une chaîne de Markov). Soit une chaîne de
Markov ( Xn ) ∈ CM(X, P, ε x ) fortement irréductible sur un ensemble d’états X fini. Alors, il
existe une unique mesure de probabilité µ sur X et limn→∞ Px ( Xn = y) = µ(y) pour tout
y ∈ X. Par ailleurs, il existe de constantes C, D > 0 telles que maxx∈X | Pn ( x, y) − µ(y)| ≤
C exp(− Dn) asymptotiquement (pour n suffisamment grand).
Démonstration. L’irréductibilité forte de la chaîne sur l’ensemble fini X signifie qu’il
existe un entier N > 0 et un réel α > 0 tels que minx,y∈X P N ( x, y) = α > 0. Introduire,
pour tout y ∈ X et tout entier n ≥ 1, la notation

mn (y) = min Pn ( x, y)
x ∈X
Mn (y) = max Pn ( x, y)
x ∈X

On a alors

mn+1 (y) = min Pn+1 ( x, y) = min


x ∈X
∑ P(x, z) Pn (z, y) ≥ mn (y)
x ∈X z ∈X

et
Mn+1 (y) = max Pn+1 ( x, y) = max
x ∈X x ∈X z ∈X
∑ P(x, z) Pn (z, y) ≤ Mn (y).
Par conséquent, les suites (mn (y)) et ( Mn (y)) sont adjacentes

m1 (y) ≤ . . . ≤ mn (y) ≤ mn+1 (y) ≤ . . . ≤ Mn+1 (y) ≤ Mn (y) ≤ . . . ≤ M1 (y).

/Users/dp/a/ens/[Link] 53
2022-10-11 • 21:26:10.
5.4. Probabilité limite, probabilité invariante (stationnaire) Chaînes de Markov

Par ailleurs, pour x, x 0 ∈ X arbitraires, nous avons

∑ P N ( x, y) = ∑ P N ( x 0 , y) = 1.
y ∈X y ∈X

Il s’ensuit la cascade d’égalités

0 = ∑ P N ( x, y) − ∑ P N ( x0 , y)
y ∈X y ∈X
+ −
= ∑ [P N N
( x, y) − P ( x , y)] + 0
∑ [ P N (x, y) − P N (x0 , y)]
y ∈X y ∈X

+
où ∑ signifie la somme sur ceux des y ∈ X pour lesquels [ P N ( x, y) − P N ( x 0 , y)] ≥ 0 et

pareillement pour ∑. La condition d’irréductibilité renforcée implique qu’il existe un
+
réel 0 ≤ d < 1 tel que maxx,x0 ∑ [ P N ( x, y) − P N ( x 0 , y)] = d. On estime maintenant la
y ∈X
différence

M N (y) − m N (y) = max P N ( x, y) − min P N ( x, y) = max [ P N ( x, y) − P N ( x 0 , y)]


x ∈X x ∈X x,x 0 ∈X
+
≤ max
0
∑ [ P N (x, z) − P N (x0 , z)] = d.
x,x ∈X z∈X

On peut maintenant itérer cette différence

M N +n (y) − m N +n (y) = max


x,x 0 ∈X
∑ [ P N (x, z) − P N (x0 , z)] Pn (z, y)
z ∈X
" #
+ −
≤ max
0x,x ∈X
∑ [ P N (x, z) − P N (x0 , z)] Mn (y) + ∑ [ P N (x, z) − P N (x0 , z)]mn (y)
z ∈X z ∈X
" #
+
= max
0x,x ∈X
∑ [ P N (x, z) − P N (x0 , z)][ Mn (y) − mn (y)]
z ∈X
= d[ Mn (y) − mn (y)].

Par conséquent, MkN +n (y) − mkN +n (y) ≤ dk+1 , pour k ∈ N arbitraire ; en combi-
nant avec la propriété d’adjacence pour les suites (mn (y)) et ( Mn (y)), nous concluons
qu’elles convergent vers la même limite µ(y) := limn→∞ mn (y) = limn→∞ Mn (y), car
d < 1. Par ailleurs, maxx∈X | Pn ( x, y) − µ(y)| ≤ Mn (y) − µ(y) ≤ d[n/N ]−1 . L’inégalité
est alors prouvée pour avec C = 1d et D = − lnNd .
Définition 5.4.2. La probabilité µ(y) = limn→∞ Px ( Xn = y) = limn→∞ Pn ( x, y) est
appelée probabilité limite. Le vecteur propre gauche, π, de P associé à la valeur propre
1 est appelé probabilité invariante (ou stationnaire).
Corollaire 5.4.3. Sous les conditions du théorème 5.4.1, le vecteur (ligne) de probabilité limite
µ est égale à un vecteur propre gauche, associé à la valeur propre 1, de la matrice P.
Démonstration. De l’égalité Pn+1 ( x, y) = ∑z∈X Pn ( x, z) P(z, y), en passant à la limite
n → ∞, nous obtenons µ(y) = ∑z∈X µ(z) P(z, y).

/Users/dp/a/ens/[Link] 54
2022-10-11 • 21:26:10.
Chaînes de Markov 5.4. Probabilité limite, probabilité invariante (stationnaire)

On dispose d’une formulation (voir le théorème 5.4.5 ci-dessous) plus complète du


théorème de convergence qui permet de s’affranchir de la l’hypothèse d’irréductibilité
forte.
Définition 5.4.4. Soit x ∈ X un état vérifiant Px (τx < ∞) > 0. On appelle période de
x la quantité
d x = pgcd{n ≥ 1 : Px ( Xn = x ) > 0}.
Lorsque d x = 1, l’état est appelé apériodique.
On peut facilement montrer que la période de x est une propriété de classe, i.e. tous
les états de la classe [ x ] ont la même période.
En tant que matrice, P agit sur l’espace vectoriel CX . Le spectre de la matrice P est
défini comme l’ensemble
spec( P) = {λ ∈ C : P − λI est non inversible}.
Puisque la matrice P est stochastique, toutes les valeurs spectrales ont un module
|λ| ≤ 1 ; en outre on a toujours 1 ∈ spec( P). L’ensemble spec( P) \ {1} est appelé spectre
périphérique de P tandis que l’ensemble {λ ∈ spec( P) : |λ| < 1} est le spectre contrac-
tant. Notons que les spectres périphérique ou contractant peuvent être vides.
Soit P une matrice irréductible et d la période d’un état (donc de tous les états) de la
chaîne. La partie du spectre non-contractant (i.e. le spectre périphérique et le singleton
{1}) est égal aux racines d-èmes de l’unité. Par conséquent, le spectre périphérique est
vide si, et seulement si, la chaîne est apériodique.
Théorème 5.4.5. Soit P la matrice de transitions d’une chaîne sur un espace d’états X fini.
On note Eλ le projecteur sur l’espace D λ ( P) = ∪k≥1 ker( P − λI )k .
1. Il existe une constante K1 > 0 telle que pour grand n,
1 n −1 k K
k ∑ P − E1 k ≤ 1 .
n k =0 n
−1
En outre pour toute probabilité initiale ρ (vue comme vecteur ligne), on a k n1 ∑nk= k
0 ρP −
ρE1 k ≤ Kn1 .
2. Si le spectre périphérique est vide (i.e. la chaîne est apériodique), il existe une constante
K2 > 0 et un paramètre r ∈]0, 1[ tels que
k Pn − E1 k ≤ K2 r n .
3. Si la valeur propre 1 est simple (i.e. dim D λ ( P) = 1), le projecteur E1 définit une
unique probabilité invariante π par E1 f = π ( f )1, pour tout f : X → C (mesurable)
bornée.
La démonstration de ce résultat est simple mais longue car elle nécessite une longue
série de lemmes préliminaires ; elle peut être consultée dans [56].
Un autre résultat important est le
Théorème 5.4.6. Soit P la matrice stochastique irréductible d’une chaîne de Markov sur un
espace d’état dénombrable. On a équivalence entre les affirmations suivantes :
1. tout état est récurrent positif,
2. il existe un état récurrent positif,
3. la matrice P possède une probabilité invariante π.
En outre (si 3. est vérifié) alors Ex (τx ) = π (1x) .
Démonstration. Voir [53, Théorème 1.7.7, p. 37].

/Users/dp/a/ens/[Link] 55
2022-10-11 • 21:26:10.
5.5. Stationnarité, réversibilité Chaînes de Markov

5.5 Stationnarité, réversibilité


Définition 5.5.1. Soient X un ensemble dénombrable (muni de sa tribu exhaustive)
et ( Xn )n∈Z (i.e. le temps varie sur Z au lieu de N) une famille doublement infinie
de variables aléatoires à valeurs dans X. Si pour tout n ∈ N et tout n-uplet d’instants
t1 < t2 < · · · < tn , avec ti ∈ Z pour i = 1, . . . , n, la loi conjointe des variables aléatoires
( Xt1 , . . . , Xtn ) est connue, la famille ( Xn )n∈N est dite processus stochastique (à temps
discret). Le processus est
— stationnaire si la loi conjointe de ( XT +t1 , . . . , XT +tn ) est la même pour tous les
T ∈ Z;
— réversible si la loi conjointe de ( Xt1 , . . . , Xtn ) est la même que la loi de ( XT −t1 , . . . , XT −tn ),
pour tout T ∈ Z ;
— markovien si

P ( X t n = x n | X t 1 = x 1 , . . . , X t n −1 = x n −1 ) = P ( X t n = x n | X t n −1 = x n −1 ) .

Si la probabilité conditionnelle P( Xn+1 = y| Xn = x ) ne dépend pas de n, la


chaîne est dite homogène et cette probabilité conditionnelle définit une matrice
stochastique ( P( x, y)) x,y∈X par P( x, y) := P( Xn+1 = y| Xn = x ).

Remarque 5.5.2. Si la loi conjointe du processus, échantillonnée à un nombre arbitraire


d’instants,
— est invariante aux translations temporelles, le processus est stationnaire ;
— est invariante aux renversements du temps, le processus est réversible.
L’invariance ci-dessus signifie qu’il est statistiquement impossible de distinguer entre
la loi initiale et la loi transformée (par translation ou par renversement).

Lemme 5.5.3. Un processus réversible est stationnaire.

Démonstration. Par réversibilité, les lois de ( Xt1 , . . . , Xtn ) et de ( XT +t1 , . . . , XT +tn ) sont
les mêmes que la loi de ( X−t1 , . . . , X−tn ), car la loi de ( XT +t1 , . . . , XT +tn ) est égale à la
loi de ( XS−T −t1 , . . . , XS−T −tn ), pour tout S ∈ Z. Il suffit donc de choisir S = T.

Théorème 5.5.4. Soit ( Xn ) une MC(X, P, π ) irréductible et ayant π comme probabilité in-
variante. Pour un N ∈ N, on pose Yn = X N −n pour n = 0, . . . , N. Alors (Yn ) est une chaîne
de Markov (à horizon fini). Si la matrice Q est définie par

π (y) Qyx = π ( x ) Pxy ,

alors Q est stochastique et irréductible et admet π comme probabilité invariante (i.e. πQ = π).
En outre, elle est la matrice des transitions de la chaîne (Yn ).

Démonstration. — La matrice Q est stochastique car

1 π (y)
∑ Qyx =
π (y) ∑ π ( x ) Pxy =
π (y)
= 1.
x ∈X x ∈X

— La probabilité π est invariante pour Q car

∑ π (y)Qyx = ∑ π (x) Pxy = π (x).


y ∈Y y ∈X

/Users/dp/a/ens/[Link] 56
2022-10-11 • 21:26:10.
Chaînes de Markov 5.5. Stationnarité, réversibilité

— De la définition de la chaîne (Yn )n=0,...,N découlent les égalités :


P(Y0 = y0 , . . . , YN = y N ) = P( X N = y0 , . . . , X0 = y N )
= π (y N ) Py N y N −1 · · · Py1 y0
= π ( y 0 ) Q y 0 y 1 · · · Q y N −1 y N .
L’irréductibilité de P signifie que pour tout x, y ∈ X, il existe L ∈ N et une suite
d’états y L ≡ x, y L−1 , . . . , y0 ≡ y telle que
Py L y L−1 · · · Py1 y0 > 0.
Pour N ≥ L, il s’ensuit que
π (y L )
Q y 0 y 1 · · · Q y L −1 y L = Py y · · · Py1 y0 > 0,
π ( y 0 ) L L −1
ce qui garantit l’irréductibilité de Q.

Théorème 5.5.5. Une chaîne de Markov stationnaire et irréductible est réversible si, et seule-
ment si, la chaîne vérifie la condition de bilan détaillé, i.e. s’il existe un vecteur de probabilité
π := (π ( x )) x∈X tel que
π ( x ) P( x, y) = π (y) P(y, x ), ∀ x, y ∈ X.
Si un tel vecteur de probabilité existe, alors π est la probabilité invariante de la chaîne.
Démonstration. Supposons le processus réversible. Puisqu’il est stationnaire, sa margi-
nale πt à l’instant t est constante en t, i.e. π ( x ) = P( Xt = x ). La réversibilité impose
alors : P( Xt = x, Xt+1 = y) = P( Xt = y, Xt+1 = x ), ou
π ( x ) P( x, y) = π (y) P(y, x ), ∀ x, y ∈ X.
Réciproquement, supposons qu’un vecteur de probabilité π, vérifiant la condition
de bilan détaillé existe. Il est alors de toute évidence une probabilité invariante pour le
processus. Nous aurons alors
P ( X t = x 0 , X t +1 = x 1 , . . . , X t + n = x n ) = π ( x 0 ) P ( x 0 , x 1 ) · · · P ( x n −1 , x n ),
P ( X t = x n , X t +1 = x n −1 , . . . , X t + n = x 0 ) = π ( x n ) P ( x n , x n −1 ) · · · P ( x 1 , x 0 ).
Mais la condition de bilan détaillé entraîne que les seconds membres de ces égalités
sont identiques. On conclut alors la réversibilité du processus.
Exemple 5.5.6 (Modèle d’urne de Paul et Tatiana Ehrenfest [22]). Supposons que N
boules discernables (par exemple étiquetées) sont distribuées dans deux urnes no-
tées respectivement urne 0 et urne 1. À chaque instant entier, une étiquette est choi-
sie au hasard et la boule correspondante est transférée dans l’autre urne avec proba-
bilité p ∈]0, 1[ ou laissée sur place avec probabilité 1 − p. On note Xn le nombre de
boules dans l’urne 0 à l’instant n. La suite ( Xn )n∈Z constitue une chaîne de Markov sur
X = {0, . . . , N } qui évolue selon la matrice stochastique
 x

 pN si x ∈ {1, . . . , N } et y = x − 1,
si x ∈ X et y = x,

1 − p
P( x, y) = x
 p(1 − N ) si x ∈ {0, . . . , N − 1} et y = x + 1,


0 sinon.

/Users/dp/a/ens/[Link] 57
2022-10-11 • 21:26:10.
5.6. Théorème des grands nombres pour les chaînes de Markov Chaînes de Markov

Cette chaîne est fortement irréductible. Par le théorème ergodique pour les chaînes
de Markov , on conclut que la probabilité limite π (y) = limn→∞ Px ( Xn = y) =
limn→∞ Pn ( x, y) existe et est indépendante de x ; elle est l’unique mesure invariante
Cx
de la chaîne. Par ailleurs, on montre facilement que la probabilité µ( x ) = 2NN , x ∈ X,
vérifie la condition de bilan détaillé ; la chaîne est donc réversible et π = µ. Puisque
µ est la probabilité d’équilibre, après un temps suffisamment long, la probabilité pour
qu’une boule soit dans l’une ou l’autre urne est 1/2. D’un autre côté, la réversibilité de
la chaîne signifie que (pour T grand)

Pµ ( X0 = N, XT = N/2) = Pµ ( X0 = N/2, XT = N ),

résultat qui peut paraître contre-intuitif de prime abord. (Nous retournerons sur ce
résultat au paragraphe 7.6).

5.6 Théorème des grands nombres pour les chaînes de


Markov
Nous avons établi le théorème de grands nombres pour des suites indépendantes.
Ici on généralise le résultat au cas de suites stationnaires.
Soit ( Xn )n∈N une CM(X, P, ε x ) une chaîne de Markov à valeurs dans un ensemble
X dénombrable (muni de sa tribu exhaustive) irréductible et récurrente. On définit
(0)
τx = 0 et par récurrence la suite des temps successifs de retour en x :

(r ) (r −1)
τx = inf{n > τx : Xn = x }, pour r ≥ 1.

La chaîne étant récurrente, elle revient indéfiniment en x, donc r → ∞. Par ailleurs,


(r )
pour tout r ∈ N, τx est un temps d’arrêt pour la chaîne. Pour alléger la notation dans
(r )
la suite, nous fixons x et nous écrivons simplement τ r au lieu de τx .
f
Soit f : X → R une fonction réelle. On s’intéressera à la somme partielle Sn := Sn =
S
∑nk=0 f ( Xk ) ; plus précisément, on veut examiner sour quelles hypothèses la limn→∞ nn
existe et déterminer sa valeur.

Lemme 5.6.1. Avec les notations et hypothèses précédentes, on introduit la suite ( Zr )r≥1 par

τ r +1

f
Zr := Zr = f ( Xk ), r ≥ 1.
k = τ r +1

Alors cette suite est indépendante et identiquement distribuée.


Démonstration. La propriété forte de Markov garantit que la loi conjointe du futur strict à partir de τ r
conditionnellement au passé jusqu’au temps τ r est égale à la loi conjointe du futur strict de τ r condi-
tionnellement au présent. Or à l’instant τ r , la chaîne vaut Xτ r = x. Par conséquent : la loi conjointe de
( Xτr +1 , Xτr +2 , . . .) conditionnellement au passé est égale à la loi conjointe de ( X1 , X2 , . . .) conditionnel-
lement à X0 = x. On a alors, pour tout r ≥ 1,

P( Zr ∈ B|passé) = Px ( Z1 ∈ B), pour tout B ∈ B(R).

/Users/dp/a/ens/[Link] 58
2022-10-11 • 21:26:10.
Chaînes de Markov 5.6. Théorème des grands nombres pour les chaînes de Markov

Théorème 5.6.2. Soient ( Xn )n∈N une CM(X, P, ·), x ∈ X un point récurrent positif et
f : X → R telle que
Ex (| f ( X1 )| + . . . + | f ( Xτx1 |) < ∞.
Alors
1 n Ex ( f ( X1 ) + . . . + f ( Xτx1 )
lim
n→∞ n
∑ f ( Xk ) =
Ex τx1
, Px − p.s.
k =0
Si la chaîne est irréductible, la convergence est presque sûre indépendamment de la condition
initiale.
Démonstration. Pour x ∈ X et n ∈ N, définir le nombre de visites de la chaîne au point x avant le temps
n
n
ηn ( x ) = ∑ 1{x} (Xk ) = sup{r ≥ 1 : τxr ≤ n}.
k =1

Puisque la chaîne est récurrente, limn→∞ ηn ( x ) = ∞. Par ailleurs, sur l’événement { X0 = x }, on a la


décomposition évidente :
η ( x )+1
n τx1 ηn ( x ) τx n
1 1 1 1
n ∑ f ( Xk ) =
n ∑ f ( Xk ) +
n ∑ Zr −
n ∑ f ( Xk ).
k =0 k =0 r =1 k = n +1

La première somme partielle du membre de droite, tends vers 0 lorsque n → ∞ car

τx1 τx1
| ∑ f ( Xk )| ≤ ∑ | f (Xk )|
k =0 k =0

et la dernière somme est intégrable (par hypothèse), donc presque sûrement finie.
La deuxième somme partielle peut se réécrire

ηn ( x ) ηn ( x )
1 ηn ( x ) 1
n ∑ Zr =
n ηn ( x ) ∑ Zr .
r =1 r =1

Comme limn ηn ( x ) = ∞ et les variables aléatoires Zr sont i.i.d., on aura

ηn ( x )
1
lim
n ηn ( x ) ∑ Zr = Ex ( Z1 )
r =1

par le théorème de grands nombres pour des suites indépendantes.


η (x)
Pour conclure avec le deuxième terme, il reste à montrer que limn nn = Ex (τx1 ). Or, la chaîne étant
récurrente, on Px (τx < ∞) = 1, pour tout r ≥ 1. Par conséquent, par la propriété forte de Markov, la
r

famille ( Xτxr +n )n∈N est une MC(X, P, ε x ) et, en outre, la loi conjointe de ( Xτxr +n )n∈N est indépendante de
( X0 , . . . , Xτxr −1 ). On note σxr := τxr+1 − τxr le temps qui s’écoule entre deux retours successifs (r et r + 1)
au point x. On a
η ( x )−1 η (x)
σx1 + . . . + σx n ≤ n − 1 ≤ n ≤ σx1 + . . . + σx n .
En divisant ces inégalités par ηn ( x ), on obtient :
η ( x )−1 η (x)
σx1 + . . . + σx n n σ1 + . . . + σx n
≤ ≤ x .
ηn ( x ) ηn ( x ) ηn ( x )

Chacun des termes aux extrémités des inégalités précédentes converge (par la loi forte de grands nombres
et la propriété forte de Markov) presque sûrement vers Ex (σx1 ) = Ex (τx1 ). Par conséquent limn→∞ η n( x) =
n
Ex (τx1 ).
ηn ( x )+1
1
∑k=
τx
Reste à montrer que le terme de correction Rn = n n+1 f ( Xk ) tendra vers 0 ce qui est garanti
par la condition Ex (| f ( X1 )| + . . . + | f ( Xτx1 |) < ∞.

/Users/dp/a/ens/[Link] 59
2022-10-11 • 21:26:10.
5.7. Exemples d’applications algorithmiques Chaînes de Markov

5.7 Exemples d’applications algorithmiques


5.7.1 Classification de pages internet ; algorithme PageRank
Lorsqu’on lance une requête sur internet, on reçoit une liste de liens vers des do-
cuments classée selon la pertinence (supposée) de chaque document. Une question
importante est de comprendre comment cette liste est-elle obtenue.
En 1998, il y avait 26 × 106 de pages indexées par Google. En 2017, ce nombre se
montait en 30 × 1012 pages. Il est donc naturel que les méthodes utilisées aient large-
ment évolué au cours du temps.
Au début de la toile, les moteurs de recherche maintenait un index de mots-clefs
k = (k1 , . . . , k N ). Chaque page était balayée et le nombre d’apparitions de chaque mot-
clef était compté. Ainsi la page u était représentée par un vecteur sémantique ν(u) =
(ν1 (u), . . . , νN (u)), où νi (u) est le nombre de fois que le terme k i apparaît dans la page
u. Une requête était à son tour assimilée à un vecteur de requête r = (r1 , . . . , r N ), où
les ri prennent la valeur 0 ou 1 selon que le terme k i apparaissait dans la requête. Les
liens vers les pages classées par valeur décroissante du produit scalaire hr, ν(u)i étaient
alors retournés.
Cette méthode de classification souffre d’un inconvénient majeur. Elle est suscep-
tible de retourner de liens vers des pages totalement impertinentes qui ne contiennent
qu’un très grand nombre de répétitions du même mot-clef.
Serguey Brin et Lawrence Page (dans [11]) ont fait une avancée significative dans
l’efficacité d’indexation des pages ; leur méthode porte le nom d’algorithme de Page-
Rank. Elle est implémentée dans les moteurs de recherche Google ou Bing.
Soient X l’ensemble de pages de la toile et ( A x,y ) x,y∈X la matrice d’adjacence définie
par (
1 si la page x pointe vers la page y
A x,y =
0 sinon.
On construit une matrice stochastique
(
1
dx si A x,y = 1,
Px,y =
0 sinon,

où d x est le nombre de pages vers lesquelles pointe la page x. Un degré d’autorité


β x = |X1 | ad hoc est rattaché à la page x ∈ X et ensuite le système évolue de la manière
suivante : si la page x pointe vers la page y, la portion β x Px,y de son autorité est héritée
par y. Dans l’état d’équilibre, on aura alors un vecteur de probabilité α := (α x ) x∈X —
l’autorité d’équilibre — qui vérifiera α = αP, i.e. il sera la probabilité stationnaire de la
chaîne de Markov de matrice stochastique P.
Cette méthode présente encore l’inconvénient que rien ne garantit que P soit for-
tement irréductible. Brin et Page proposèrent alors de modifier P en une matrice P0
0 = (1 − p ) P 1
dont les éléments de matrice sont Px,y x,y + p |X| , pour un petit paramètre
p ∈]0, 1[ qui est le « secret maison » de Google. La matrice P0 est maintenant fortement
irréductible et l’on peut appliquer le théorème 5.5.6 pour montrer l’existence et l’uni-
cité de α ainsi que la convergence exponentielle des itérations successives de P0 vers
la probabilité invariante. Les pages retournées par le moteur de recherche sont alors
classées dans l’ordre décroissant des composantes de α.

/Users/dp/a/ens/[Link] 60
2022-10-11 • 21:26:10.
Chaînes de Markov 5.7. Exemples d’applications algorithmiques

5.7.2 Algorithme de Metropolis


Sur un espace fini (X, X ), on veut simuler des variables distribuées selon une cer-
taine loi π. Dans les applications |X| ' 106 − 107 et la mesure π traduit souvent en
langage probabiliste des contraintes rigides non-triviales sur les x (cf. exercice 69) ; il
est donc assez difficile de simuler directement la loi π par génération selon la loi uni-
forme et rejet des échantillons qui ne vérifient pas la contrainte. Il est en général plus
facile de générer une chaîne de Markov ( Xn )n∈N à valeurs dans X qui admet π comme
probabilité stationnaire, i.e. construire une chaîne qui évolue suivant une matrice sto-
chastique P fortement irréductible telle que πP = π. Étant donné que la matrice P est
de taille |X| × |X| ' 1012 − 1014 , il est hors de question de stocker une telle matrice
et s’en servir pour générer la chaîne de Markov. Il faut concevoir un algorithme qui
génère une chaîne de Markov évoluant selon P, telle que πP = π, sans que P soit
stockée.
Soit Q une matrice stochastique irréductible et apériodique arbitraire sur X.
Définition 5.7.1. Pour x ∈ X, on note Ax = {y ∈ X : Q xy > 0} les états accessibles
de x en une étape par la matrice stochastique Q. Pour tout y ∈ Ax , νx (y) = Q xy définit
une probabilité sur Ax appelée probabilité de tentative de la transition x → y.
La matrice Q sert donc à proposer des transitions x → y. On peut se poser la ques-
tion quel est son intérêt puisque P remplit le même rôle ? La réponse est que tandis
|X| ' 106 , |typiquement |Ax | ' 10. Bien sûr si nous remplaçons P par Q nous chan-
geons la probabilité d’équilibre du problème. On doit donc refuser certaines transitions
proposées par Q.
Définition 5.7.2. Soit A = ( A xy ) x,y∈X ∈ M|X|×|X| (]0, 1]). Cette matrice est appelée
matrice d’acceptation. Une transition x → y, proposée par Q, sera acceptée avec pro-
babilité A xy et rejeteée (on reste alors sur place) avec probabilité 1 − A xy .
On construit ainsi la matrice P par
Pxy = P( Xn+ = y| Xn = x )

 Q xy A xy
 si y ∈ Ax \ { x },
= Q xx + ∑z∈Ax \{ x} (1 − A xz ) Q xz si y = x,

0 sinon.

Lemme 5.7.3. La matrice P est stochastique, irréductible et apériodique.


Démonstration. La positivité des éléments de P est évidente. Sa stochasticité s’obtient
par

∑ Pxy = Pxx + ∑ Pxy


y ∈X y∈Ax \{ x }

= Q xx + ∑ (1 − A xz ) Q xz + ∑ A xy Q xy
z∈Ax \{ x } y∈Ax \{ x }

= ∑ Q xz = 1.
z ∈A x

Son irréductibilité et son apériodicité s’obtiennent par l’observation que pour x, y ∈ X,


Q xy > 0 ⇒ Pxy > 0.

/Users/dp/a/ens/[Link] 61
2022-10-11 • 21:26:10.
5.8. Exercices Chaînes de Markov

Lemme 5.7.4. Si la matrice d’acceptation A vérifie la condition

A xy π (y) Qyx
= , ∀ x ∈ X, ∀y ∈ Ax \ { x }
Ayx π ( x ) Q xy

alors la matrice P vérifie la condition de bilan détaillé et réciproquement.

Démonstration. (⇒) Pour y ∈ Ax \ { x }, on a

π ( x ) Pxy = π ( x ) Q xy A xy
Ayx
= π (y) Qyx A xy
A xy
= π (y) Pyx .

(⇐) L’égalité π ( x ) Pxy = π (y) Pyx devient

π ( x ) Q xy A xy = π (y) Qyx Ayx .

F (z)
Corollaire 5.7.5. Soit F : [0, ∞] → [0, 1] une application telle que F(1/z) = z pour tout
z ∈ [0, ∞]. Si
π (y) Qyx
 
A xy = F , ∀ x ∈ X, ∀y ∈ Ax \ { x },
π ( x ) Q xy
alors P vérifie la condition de bilan détaillé.
z
Exemple 5.7.6. Les fonctions données par les formules F (z) = 1+ z et F (z) = min(1, z)
vérifient les hypothèses du lemme.

La construction de la matrice P à l’aide des matrices de tentatives et d’acceptation


selon le procédé décrit dans ce paragraphe est connu comme algorithme de Metropo-
lis. Sa mise en œuvre pour la génération d’une chaîne de Markov selon P est appelée
simulation Monte Carlo markovienne.

5.8 Exercices
Chaînes de Markov ; matrices stochastiques
64. Soient X = {0, 1, . . . , m} un ensemble fini d’états et une suite indépendante
(Un )n≥1 , identiquement distribuée selon la loi uniforme sur {1, . . . , m}. On in-
troduit la suite ( Xn )n≥0 de variables aléatoires, définies par X0 = 0 et Xn+1 =
max( Xn , Un+1 ), pour n ≥ 0.
(a) Montrer que ( Xn ) est une chaîne de Markov et déterminer sa matrice de
transition P.
(b) Esquisser le graphe de la matrice stochastique lorsque m est petit.
(c) En utilisant des arguments d’estimation directe, indiquer quels états sont
récurrents et quels sont transients.
(d) Pour m = 4, calculer P2 .

/Users/dp/a/ens/[Link]
62
2022-11-15 • 19:54:13.
Chaînes de Markov 5.8. Exercices

65. Soient (ξ n )n≥1 une suite de variables aléatoires indépendantes, identiquement


distribuées sur l’ensemble {−1, 1} selon une loi µ avec µ(−1) = p ∈ [0, 1]. On
construit la suite Xn0 = ∑nk=1 ξ k , pour n ∈ N avec la convention que la somme
sur une famille vide d’indices est nulle.
(a) Montrer que ( Xn0 ) est une chaîne de Markov sur l’espace des états X0 , avec
matrice de transition P et probabilité initiale ρ (on précisera X0 , P0 et ρ0 ).
(b) Montrer que la suite ( Xn ) définie récursivement par X0 = x0 ∈ Z et Xn+1 =
Xn + ξ n+1 , pour n ≥ 0, est aussi une CM(X, P, ρ) (préciser X, P et ρ). La suite
Xn est appelée marche aléatoire simple en dimension 1.
(c) Montrer — sous l’hypothèse que p ∈]0, 1[ — que la marche aléatoire simple
en dimension 1 est irréductible (argumenter en utilisant le graphe de la ma-
trice de transition).
(d) Montrer que la marche aléatoire simple en dimension 1 est récurrente si p =
1/2, transiente si p 6= 1/2.
(e) Soient a, b ∈ Z avec a < b. Pour un x ∈ [ a, b] ∩ Z, on note h( x ) = Px (τa0 <
τb0 ).
— Pour p = 1/2, montrer que h( x ) = 21 h( x − 1) + 12 h( x + 1) pour x ∈
[ a + 1, b − 1] ∩ Z. Par un argument géométrique simple résoudre cette
équation en utilisant les valeurs au bord évidentes pour h( a) et h(b) pour
−a
montrer que h( x ) = 1 − xb− a.
— Établir la relation analogue pour h( x ) lorsque p 6= 1/2 et résoudre expli-
citement la récurrence.
(f) Interpréter ces résultats pour le problème de la « ruine du joueur ».
66. (Extrait du contrôle du 16 novembre 2017).
Soit ( Xn )n∈N une chaîne de Markov CM(X, P, ·), où X = {1, 2, 3, . . . , } = N> et
la matrice stochastique P = ( Px,y ) x,y∈X est définie par

 x+1 si x ∈ X, y = 1
 x

Px,y = x+ 1
1 si x ∈ X, y = x + 1

0 sinon.

(a) Soit p := ( p x ) x≥1 la suite définie par p x = (e−11) x! . Montrer que p est un
vecteur de probabilité sur X.
(b) Montrer que le vecteur de probabilité p est invariant pour P, i.e. le vecteur
ligne p est vecteur propre gauche de P associé à la valeur propre 1). Clin
x 1
d’œil : x+ 1 = 1 − x +1 .
(c) Déterminer la décomposition de X en classes de communication.
67. (Extrait de l’examen du 7 mai 2013).
Soit β ∈]0, 1[. On considère la matrice
 
1−β β
P := .
β 1−β

(a) On note spec( P) l’ensemble des valeurs propres de P. Vérifier que spec( P) =
{1, 1 − 2β}.    
1 −1
(b) Vérifier que les vecteurs D1 = et D1−2β = sont des vecteurs
1 1
propres droits associés aux valeurs propres correspondantes.

/Users/dp/a/ens/[Link]
63
2022-11-15 • 19:54:13.
5.8. Exercices Chaînes de Markov

Dλ Dλ
(c) Pour chaque λ ∈ spec( P), on note dλ = kDλ ksup
et δλ = k D λ k1
, où, pour tout
z ∈ R2 , on note kzk1 = |z1 | + |z2 | et kzksup = max{|z1 |, |z2 |}. Déterminer
0
 λ, λ ∈ spec
dλ et δλ , pour  (P).  
a1 b1 t a1 b1 a1 b2
(d) Pour a = et b = vecteurs arbitraires, on note a ⊗ b = .
a2 b2 a2 b1 a2 b2
Vérifier que P = ∑λ∈spec( P) λEλ , où Eλ = dλ ⊗ δtλ .
(e) Montrer que Eλ Eλ0 = δλ,λ0 Eλ .
(f) En déduire que pour un n ≥ 1 arbitraire,
 
n pn 1 − pn
P = .
1 − pn pn
(g) On déterminera explicitement pn . Quelle est la valeur de limn→∞ pn ?
(h) On note ( Xn ) la chaîne de Markov sur un espace X à deux états, dont la
matrice de transition est P et la probabilité initiale ρ0 . Déterminer π (y) :=
limn→∞ Pρ0 ( Xn = y), pour y ∈ X.
(i) Montrer que π est une probabilité invariante.

Simulations Monte Carlo, algorithme de Metropolis


68. Comment à partir d’une pièce truquée à mémoire, de matrice stochastique (des
tentatives)
3 2
 
Q= 5 5
1 4
5 5
peut-on construire une matrice stochastique P qui admet π = ( 21 , 12 ) comme
probabilité d’équilibre ?
69. (Marches aléatoires sans recoupement sur Zd , devoir du 20 octobre 2019). Une
marche aléatoire simple sur Zd est une chaîne de Markov ( Xn ) obtenue par la
récurrence Xk+1 = Xk + ξ k+1 , k ∈ N, avec X0 = x ∈ Zd et (ξ k )k≥1 une suite
de variables aléatoires indépendantes et uniformément distribuées sur Ed =
{±e j , j = 1, . . . , d}, où e j , j = 1, . . . , d, sont les vecteurs de la base canonique de
Zd . L’ensemble des trajectoires (de longueur N fixée) possibles de telles marches
constitue l’ensemble Xmas
d
Xmas := Xmas
x,N = { y : {0, . . . , N } → Z : [ y0 = x ] ∧ [ yk+1 − yk ∈ Ed ]}.

On s’intéresse au sous-ensemble des trajectoires sans recoupement


Xmsr := Xmsr
x,N = { y ∈ Xx,N : y ( k ) 6 = y ( l ), 0 ≤ k < l ≤ N }
mas

muni de la probabilité uniforme. Ces ensembles, pour N ' 104 , modélisent bien
certains polymères tels que le poly-chloro-éthylène, mais la contrainte géomé-
trique forte de non-recoupement ne nous permet même pas d’estimer le cardinal
de Xmsr
x,N dès que N prenne de valeurs modérément grandes.
On note Gd le sous-groupe discret de transformations orthogonales de Rd qui
laisse Zd invariant. Par exemple, en dimension d = 2, le sous-groupe Gd devient
le groupe diédral
π
G2 = {e, ± , π, réflexions/axes Ox, Oy, réflexions/diagonales D1 , D2 }.
2
Soit ρ une probabilité sur Gd telle que

/Users/dp/a/ens/[Link]
64
2022-11-15 • 19:54:13.
Chaînes de Markov 5.8. Exercices

— si g ∈ Gd \ {e}, alors ρ( g) > 0.


— ρ( g) = ρ( g−1 ), ∀ g ∈ Gd .
Pour k ∈ {1, . . . , N } et g ∈ Gd on introduit la transformation (k, g) : Xmsr
x,N →
Xx,N par
msr

(k, g)y = y0 := (y0 , . . . , yk−1 , yk−1 + g(yk − yk−1 ), . . . , yk−1 + g(y N − yk−1 ), ∀y ∈ Xmsr
x,N .

Dans la suite on note simplement Xmas et Xmsr au lieu de Xmas


x,N et Xx,N .
msr

Algorithme de génération de marches aléatoires sans recoupement


Require: Générateur g ∈ Gd selon ρ,
générateur unif({1, . . . , N })
y ∈ Xmsr .
Ensure: z ∈ Xmsr .
Choisir g ∈ Gd selon ρ.
Choisir k ∈ {1, . . . , N } selon unif({1, . . . , N }).
if (k, g)y ∈ Xmsr then
z ← (k, g)y
else
z←y
end if

(a) Montrer que l’algorithme ci-dessus définit une matrice stochastique P sur
Xmsr . Plus précisément, montrer que pour toute paire y, z ∈ Xmsr , on a
1
 N ∑ ρ( g)1{z} ((k, g)y)
 si z 6= y,
(k,g)
P(y, z) = 1 1
 N ∑ ρ( g)1{y} ((k, g)y) +
 N ∑ ρ( g)1Xmas \Xmsr ((k, g)y) si z = y.
(k,g) (k,g)

(b) Montrer que pour tout entier N ≥ 2, la matrice P est stochastique, bistochas-
tique, irréductible et apériodique.
(c) Conclure que P admet la mesure uniforme sur Xmsr comme mesure d’équi-
libre.

/Users/dp/a/ens/[Link] 65
2022-10-11 • 21:26:10.
5.8. Exercices Chaînes de Markov

20

15

10

5
y

−5

−10

−15

−20

−25 −20 −15 −10 −5 0 5 10 15 20 25


x

Figure 5.1 – Exemple de trajectoire d’une marche sans recoupement sur Z2 partant de l’origine et
de longueur 437.

/Users/dp/a/ens/[Link] 66
2022-10-11 • 21:26:10.
Notions de statistique
6
6.1 Motivation
L’objet de la théorie des probabilités peut se formuler succinctement comme l’étude
de variables aléatoires définies sur un espace abstrait de probabilités (Ω, F , P) et qui
prennent des valeurs dans un espace d’événements (X, X ). Les questions que nous
avons abordées aux chapitres précédents, concernent
— la loi PX sur (X, X ), image de P par X,
— certaines fonctionnelles définies sur l’espace de variables aléatoires à valeurs
dans X, comme l’espérance, la variance,
— le comportement asymptotique des suites de variables aléatoires ( Xn )n∈N , lorsque
celles-ci sont indépendantes ou ont des dépendances moins triviales, des dépen-
dances markoviennes par exemple, etc.
En résumant, la théorie des probabilités permet de répondre à la question suivante :
étant donné un certain procédé de génération de X, que peut-on dire à propos des
observations qui en découlent. Par exemple, quelle est la valeur de P( X = x ) lorsque
x ∈ X, ou quel est le comportement de ∑nk=1 f ( Xk ) à grand n, lorsque f a « des bonnes
propriétés » et ( Xk )k∈N est une suite indépendante ou une suite markovienne, sont des
questions étudiées par la théorie des probabilités.
En statistique mathématique, nous intéressons encore moins à l’espace (Ω, F , P)
qu’en théorie des probabilités. Nous avons un espace d’événements (X, X ) et une fa-
mille spécifique Π ⊂ M1 (X, X ) de probabilités 1 , avec |Π| ≥ 2 pour éviter les tri-
vialités. Nous disposons d’une variable aléatoire X à valeurs dans X dont la loi est un
élément de l’ensemble Π mais nous ignorons lequel. Nous observons plusieurs réalisa-
tions (observations) de la variable aléatoire X et nous voulons, à partir des observations
inférer 2 la loi qui a servi à générer les réalisations de X.

1. En dehors de quelques cas particulièrement simples, il n’est pas possible de choisir Π =


M1 (X, X ) car le problème serait mal posé.
2. INFÉRER, verbe trans. A–(log.) Tirer, d’un fait ou d’une proposition donné(e), la conséquence qui en
résulte. B–(p. ext.) Tirer une conclusion d’un fait ou d’un événement donnés. Trésor de la langue française,
version en ligne (2019).

67
6.1. Motivation Notions de statistique

Exemple 6.1.1. On note (X, X , Π) le triplet qui permet de poser le problème d’infé-
rence.
1. Lorsque X = {0, 1} muni de sa tribu exhaustive, on peut s’intéresser à la famille

Π = {Pθ ∈ M1 (X ) : Pθ = (1 − θ )ε 0 + θε 1 , θ ∈ Θ := [0, 1]}.

Dans ce cas simple, la famille Π = (Pθ )θ ∈Θ , avec Θ = [0, 1], coïncide avec
M1 (X, X ). On veut, à partir d’un échantillon X1 , . . . , Xn inférer la valeur de θ.
On peut aussi identifier Pθ avec la densité discrète (par rapport à la mesure de
dénombrement) f θ qui vaut

f θ ( x ) = θ x (1 − θ )1− x , x ∈ X, θ ∈ Θ.

2. Lorsque X = R et il est muni de sa tribu borélienne, on peut s’intéresser à la


famille
Π = {Pθ = N (m, s2 ) : θ = (m, s2 ) ∈ Θ := R × R+ }
strictement incluse dans M1 (X, X ) et on veut, à partir d’un échantillon X1 , . . . , Xn
inférer la valeur de θ. Il est à signaler que dans cet exemple, la famille des proba-
bilités qui composent Π est équivalente à la famille ( f θ )θ ∈Θ des fonctions posi-
tives intégrables sur R qui sont des densités de probabilité, i.e. pour θ = (m, s2 )
et pour tout B ∈ B(R),
ˆ
( x − m )2
 
1
Pθ ( B ) = f θ ( x )dx, avec f θ ( x ) = √ exp − , x ∈ R.
B 2πs s2

3. Lorsque X = R, muni de sa tribu borélienne, on peut considérer la famille des


probabilités donnée par
ˆ
Π = {P ∈ M1 (X ) : P a un densité f , t.q. f 00 (t)2 dt < ∞}
R

strictement incluse dans M1 (X, X ).


Dans les deux premiers cas, la famille Π est isomorphe à un (sous)-espace de Rd pour
un d < ∞. Dans le dernier cas, Π est isomorphe à un espace fonctionnel de dimension
infinie (l’espace de Sobolev W 2,2 (R)). Dans tous les cas, on peut identifier les probabi-
lités qui composent Π avec leur densité par rapport à une mesure de référence.

Définition 6.1.2. Un modèle statistique est la donnée (X, X , Π), où la famille des
probabilités (ou de leurs densités par rapport à une mesure de référence) Π ⊂ M1 (X )
est appelée population. Lorsque Π est isomorphe à un ensemble de paramètres) Θ,
partie d’un espace de dimension finie, on parle de modèle statistique paramétrique,
sinon de modèle statistique non paramétrique.

Lorsque un modèle statistique (X, X , Π) est donné, nous pouvons considérer le


modèle statistique produit, noté par abus de notation, (X, X , Π)n = (Xn , X ⊗n , Π⊗n ),

Π ⊗ n = { P⊗ n : P ∈ Π }
qui correspond à n répétitions indépendantes d’une même expérience statistique. Lorsque
X est une variable aléatoire dans X de loi P ∈ Π et X = ( X1 , . . . , Xn ) une suite de

/Users/dp/a/ens/[Link] 68
2022-12-06 • 18:15:34.
Notions de statistique 6.2. Estimation paramétrique

n variables copies indépendantes de X, alors X ∈ Xn et sa loi sera P⊗n , i.e. le mo-


dèle statistique pour l’échantillon indépendant de taille n est entièrement déterminé
par le modèle (X, X , Π). Parfois, nous notons donc le modèle statistique simplement
(X, X , Π), même lorsqu’il s’agit d’un échantillon indépendant de taille n. Nous distin-
guons cependant entre les variables aléatoires X ou X à valeurs respectivement dans X
ou Xn et leurs réalisations respectives x = X (ω ) ∈ X ou x = X(ω ) ∈ Xn .

Définition 6.1.3. Soient un modèle statistique (X, X , Π), un espace d’événements


(Y, Y ) et S : Xn → Y une applcation mesurable (une variable aléatoire sur Xn ). Alors
S est appelée une statistique.

Une question pertinente est la suivante : puisqu’une statistique est une variable
aléatoire sur Xn à valeurs dans Y pourquoi introduisons-nous un nouveau terme ? La
réponse est que l’usage que nous en ferons de S engendrera une intuition différente de
celle développée pour des variables aléatoires « ordinaires ».

6.2 Estimation paramétrique


Dans ce paragraphe, le modèle statistique est (X, X , Π), où Θ est un sous-ensemble
d’un espace Rd avec un certain d < ∞ et Π := (Pθ )θ ∈Θ , où . Notre but, est d’introduire
des statistiques S qui permettront, à partir d’un échantillon généré avec une certaine
probabilité Pθ , d’inférer θ.

6.2.1 Estimation ponctuelle


Exemple 6.2.1. Soient X = {0, 1} et X(n) := ( X1 , . . . , Xn ) des variables aléatoires in-
dépendantes identiquement distribuées selon la loi Pθ = Bernoulli(θ ), avec θ ∈ R> . La
moyenne empirique
1 n
m n ( X ( n ) ) = ∑ Xk
n k =1
P
est une statistique pour le modèle. Elle a la particularité que mn (X(n) ) −→
θ
θ, lorsque
n → ∞. En outre Eθ (mn ) = θ.

Définition 6.2.2. (X, X , (Pθ )θ ∈Θ ) un modèle statistique et X(n) := ( X1 , . . . , Xn ) des


variables aléatoires indépendantes sur X distribuées selon la loi inconnue Pθ , pour un
certain θ ∈ Θ ⊂ Rd . Un estimateur ponctuel (de θ) est une statistique θ̂n : Xn → Rd .
L’estimateur est

— cohérent si θ̂n (X(n) ) −→ θ, lorsque n → ∞,
— non-biaisé si le biais bθ (θ̂n ) := Eθ (θ̂n ) − θ = 0, pour tout n.
L’erreur quadratique moyenne d’un estimateur est définie comme

EQMθ (θ̂n ) := Eθ [(θ̂n − θ )2 ].

Dans l’exemple 6.2.1, la moyenne empirique est un estimateur ponctuel cohérent et


non-biaisé de θ.

Lemme 6.2.3.
EQMθ (θ̂n ) = bθ (θ̂n )2 + Varθ (θ̂n ).

/Users/dp/a/ens/[Link] 69
2022-12-06 • 18:15:34.
6.2. Estimation paramétrique Notions de statistique

Démonstration. Voir exercice 72.


Définition 6.2.4. Un estimateur est asymptotiquement normal si

θ̂n − θ loi
√ −→ N (0, 1).
n
Au delà de l’estimateur de la moyenne empirique, d’autres estimateurs sont cou-
ramment utilisés, comme celui du maximum de vraisemblance.
Définition 6.2.5. Soient un modèle statistique (X, X , ( f θ )θ ∈Θ ), X(n) = ( X1 , . . . , Xn )
une famille indépendante de variables aléatoires à valeurs dans X, identiquement dis-
tribuées selon une loi de densité (discrète ou continue) f θ . On définit les statistiques
suivantes :
vraisemblance : Ln (θ ) := Ln (θ, X(n) ) = ∏in=1 f θ ( Xi ),
log-vraisemblance : ln (θ ) = log Ln (θ ),
estimateur du maximum de vraisemblance : θ̂nMV := arg max Ln (θ ) = arg max ln (θ ).
Exemple 6.2.6. Soit X(n) = ( X1 , . . . , Xn ) une famille de variables aléatoires indépen-
dantes et identiquement distribuées.
— Si X1 suit la loi de Bernoulli(θ ) avec θ ∈ [0, 1], l’estimateur du maximum de
vraisemblance θ̂nMV coïncide avec la moyenne empirique θ n .
— Si X1 suit une loi normale de paramètres θ := (m, s2 ), l’estimateur de maximum
de vraisemblance est θ̂nMV = (mn , vn ), où l’estimateur de maximum de vraisem-
blance pour m coïncide avec la moyenne emprique θ̂n,1 = mn et

1 n
n i∑
vn = ( Xi − m n ) 2
=1

est un estimateur de la variance.


— Si X1 suit la loi uniforme sur [0, θ ], θ > 0, alors l’estimateur du maximum de
vraisemblance de θ est θ̂nMV = max( X1 , . . . , Xn ).
Définition 6.2.7. Soit X(n) = ( X1 , . . . , Xn ) une famille de variables aléatoires indépen-
dentes et identiquement distribuées et de variance finie. La statistique
n
1
n − 1 k∑
V n ( X(n) ) = ( Xk − mn (X(n) ))2
=1

est appelée variance empirique.


Remarque 6.2.8. Il ne faut pas confondre vn avec V n (ils diffèrent en la normalisation)
et ne deviennent égaux qu’asymptotiquement. Il est montré (voir exercice 70) que la
variance empirique est un estimateur non-biaisé de la variance.

6.2.2 Estimation d’intervalles de confiance


Définition 6.2.9. Soit (X, X , (Pθ )θ ∈Θ un modèle statistique, avec Θ ⊂ R. Un intervalle
de confiance à niveau d’erreur α ∈ [0, 1] est un intervalle (aléatoire) de la forme Cn =
[ an , bn ], où an := an ( X1 , . . . , Xn ) et bn := bn ( X1 , . . . , Xn ) sont deux statistiques telles
que
P(θ ∈ Cn ) ≥ 1 − α.

/Users/dp/a/ens/[Link] 70
2022-12-06 • 18:15:34.
Notions de statistique 6.2. Estimation paramétrique

Remarque 6.2.10. Un intervalle de confiance n’est pas une affirmation probabiliste à


propos de θ car θ n’est pas aléatoire ! La signification de l’affirmation est que si on ré-
(i ) (i )
pétait l’expérience indéfiniment, i.e. on observait X(i) = ( X1 , . . . , Xn ) pour i ∈ N,
(i ) (i ) (i )
la suite d’intervalles aléatoires Cn , déterminés par les statistiques an et bn , contien-
draient la valeur déterministe (mais inconnue) θ dans 100(1 − α)% des cas.
Définition 6.2.11. Une variable aléatoire Z à valeurs dans R≥ dont la loi a comme
densité P( Z ∈ dz) = f k (z)dz, avec
k z
z 2 −1 e − 2
f k (z) = k
,
2 2 Γ( 2k )

est dite suivre la loi de χ2k avec k degrés de liberté. La fonction de répartition de cette
loi est
γ(k/2, z/2)
Fk (z) = ,
Γ(k/2)
où γ est la loi gamma incomplète (Fk est tabulée).

Figure 6.1 – La densité f k (figure de gauche) et la fonction de répartition Fk (figure de droite)


respectivement pour k = 2, 3, 4, 5, 10, 20, 30, 40 et k = 1, 2, 3, 4, 5, 10, 20, 30, 40 degrés de liberté. La
densité pour k = 1 n’est pas présentée car elle diverge en 0.

Lemme 6.2.12. Soient k variables Y1 , . . . , Yk indépendantes et identiquement distribuées selon


la loi N (0, 1). Alors la variable Z = ∑ik=1 Yi2 suit la loi de χ2k avec k degrés de liberté.

Théorème 6.2.13. Soit X(n) = ( X1 , . . . , Xn ) une famille de variables aléatoires indépendantes


et identiquement distribuées selon la loi N (m, σ2 ). Alors (n − 1)V n /σ2 , où V n est la variance
empirique (définie en 6.2.7), suit la loi du χ2n−1 .
Exemple 6.2.14. Lors d’une expérience, les valeurs suivantes ont été obtenues lors de 8
réalisations indépendantes d’une variable aléatoire X : 4.4, 4.7, 4.8, 4.5, 4.4, 4.2, 4.2, 4.0.
La moyenne empirique est m8 = 4.4 et la variance empirique V 8 = 0.0714. On cherche

/Users/dp/a/ens/[Link] 71
2022-12-06 • 18:15:34.
6.2. Estimation paramétrique Notions de statistique

à determiner un intervalle de confiance à seuil d’erreur α = 0.1 pour la variance σ2


de la loi qui a servi pour générer l’échantillon. On sait que 7V 8 /σ2 suit la loi de χ27 .
À partir des tables, on détermine les valeurs z− (α) et z+ (α) telles que la variable Z
suivant la loi de χ27 , vérifie

P( Z ≤ z− (α)) = P( Z ≥ z+ (α)) = α/2.

Par conséquent, l’intervalle de confiance à niveau d’erreur α sera C = [ z7V(α8 ) , z7V(α8 ) ] et


+ −
on aura que P(σ2 ∈ C ) = 1 − α. Pour α = 0.1, on détermine à partir des tables de F7 que
z− (α) = 2.17 et z+ (α) = 14.1, ce qui conduit à l’estimation P(0.19 ≤ σ ≤ 0.48) = 0.9.

6.2.3 Tests d’hypothèses


Théorème de Neyman-Pearson
On illustre le problème dans une situation simple. Soit (X, X , (Pθ )θ ∈Θ ) un modèle
statistique, avec Θ = {θ0 , θ1 } ≡ {0, 1} et X ⊂ R discret. Pour alléger la notation, on
écrit f 0 et f 1 pour les densités de probabilité de la population. On observe un échan-
tillon X(n) = ( X1 , . . . , Xn ) généré selon l’une des lois ; on doit décider s’il a été engen-
dré par une loi de densité f 0 ou f 1 . (En général, on note f θ la densité de la loi Pθ ). On
appelle traditionnellement
— H0 l’hypothèse nulle : « l’échantillon a été engendré par la loi de densité f 0 » que
l’on test contre
— H1 l’hypothèse dite alternative : « l’échantillon n’a pas été engendré par f 0 »
(dans le cas présent ultrasimplifié, H1 correspond bien sûr à la génération par
f 1 ).

Définition 6.2.15. Un test d’hypothèses est la donnée du triplet (X(n) , ( H0 , H1 ), R) où


R ⊆ Rn est la région critique de rejet de H0 : si X(n) ∈ R, alors on accepte H1 sinon,
on accepte H0 .
— On appelle 3 erreur de type I la quantité

α := α( R) = P(X(n) ∈ R) = P( H1 acceptée| H0 prévaut)

— et erreur de type II la quantité

β := β( R) = P(X(n) ∈ Rc ) = P( H0 acceptée| H1 prévaut).

Le paramètre α est aussi appelé taille de la région critique tandis que le paramètre
1 − β est appelé puissance.
On souhaiterait minimiser la probabilité de prendre une décision erronée :

γ = P( H1 acceptée et H0 prévaut) + P( H0 acceptée et H1 prévaut)


= α« P »( H0 prévaut) + β« P »( H1 prévaut)

mais ce problème est mal posé car il n’y a pas de moyen objectif de déterminer la pro-
babilité notée « P » ci-dessus. Cependant, même si « P » est une quantité subjective, on
3. Il serait plus cohérent de les appeler erreurs d’ordre 0 et 1 respectivement mais, pour des raisons
historiques, on garde la nomenclature type I et II.

/Users/dp/a/ens/[Link] 72
2022-12-06 • 18:15:34.
Notions de statistique 6.2. Estimation paramétrique

exige que « P »( H0 prévaut) + « P »( H1 prévaut) = 1, par conséquent, γ ≤ max(α, β).


La théorie des tests d’hypothèses consiste donc à construire des régions critiques de
taille α fixée qui minimisent β. Le théorème de Neyman-Pearson 6.2.16 nous donne
une méthode de construction explicite de la région d’acceptation de l’hypothèse H1 .
Pour Pθ , de densité f θ , θ ∈ Θ ' {0, 1} et pour un n-uplet x = ( x1 , . . . , xn ), la
fonction de vraisemblance prend la forme Lθ (x) := f θ ( x1 ) · · · f θ ( xn ). On remarque
que l’erreur de type I, correspondant à une région critique de rejet R, est
ˆ ˆ
n
α( R) = P0 (( X1 , . . . , Xn ) ∈ R) = f 0 ( x1 ) · · · f 0 ( x n )d x = L0 (x)dx,
R R

tandis que l’erreur de type II est déterminée par complémentation de


ˆ ˆ
n
1 − β( R) = P1 (( X1 , . . . , Xn ) ∈ R) = f 1 ( x1 ) · · · f 1 ( x n )d x = L1 (x)dx.
R R

Théorème 6.2.16 (Neyman-Pearson). Soit (( X1 , . . . , Xn ), ( H0 , H1 ), R) un test d’hypo-


L (x)
thèses où, pour tout δ > 0, on pose R := R(δ) = {x ∈ Rn : L0 (x) ≤ δ} pour une région
1
critique et α := α( R) pour sa taille. Toute autre région critique S ayant la même taille, i.e.
α(S) = α( R), vérifiera β(S) ≥ β( R). En d’autres termes, la région R est la région critique
optimale à taille fixée α.
Démonstration. On aura démontré l’optimalité de R si pour toute région critique S
avec
´ α(S) = ´α( R) on aura montré 1 − β(S) ≤ 1 − β( R) ou, ce qui est équivalent,
S 1 x )dx ≤ R L1 ( x )dx. Or, on a
L (
ˆ ˆ
α( R) = α(S) ⇔ L0 (x)dx = L0 (x)dx.
R S

En décomposant
R = ( R ∩ S ) t ( R ∩ S c ),
S = ( S ∩ R ) t ( S ∩ R c ),
nous avons
ˆ ˆ ˆ ˆ
L0 (x)dx + L0 (x)dx = L0 (x)dx + L0 (x)dx
R∩S R∩Sc R∩S S∩ Rc
ou ˆ ˆ
L0 (x)dx = L0 (x)dx.
R∩Sc S∩ Rc

Par ailleurs, sur R, nous avons L1 ≥ Lδ0 tandis que sur Rc , nous avons L1 < L0
δ . On
conclut que
ˆ ˆ ˆ ˆ
L0 ( x ) L0 ( x )
L1 (x)dx ≥ dx = dx ≥ L1 (x)dx.
R∩Sc R∩Sc δ S∩ Rc δ S∩ Rc

En comparant les expressions aux deux extrémités des inégalités précédentes, on a


finalement
ˆ ˆ ˆ ˆ ˆ ˆ
L1 (x)dx = L1 (x)dx + L1 (x)dx ≥ L1 (x)dx + L1 ( x ) = L1 (x)dx.
R R∩Sc R∩S S∩ Rc R∩S S

/Users/dp/a/ens/[Link] 73
2022-12-06 • 18:15:34.
6.2. Estimation paramétrique Notions de statistique

Test χ2 d’ajustement de Pearson


Dans l’approche ci-dessus, nous avons utilisé la statistique de vraisemblance. Une
autre statistique couramment utilisée est celle de Pearson, notée Qn , dont la définition
est donnée dans l’énoncé du théorème 6.2.17 ci-dessous, communément appelée « test
du χ2 ». Nous donnons quelques détails supplémentaires sur ce test dans un cadre un
peu plus général.
Supposons qu’à partir du modèle stochastique primaire (X, X , (Pθ )θ ∈Θ ), on agrège
les observations en k + 1 classes, c’est-à-dire, on définit une partition X = ti∈K Xi où
K ' {0, . . . , k} et on introduit la statistique ν : Xn → NK par
 
(n) (n) (n)
ν(X ) = ν0 (X ), . . . , νk (X ) ,

où, pour tout j ∈ K, on pose νj := νj (X(n) ) = ∑in=1 1Xj ( Xi ). Il est évident que νj /n
représente la fréquence empirique avec laquelle la classe j ∈ K est chargée par l’échan-
tillon. Par ailleurs, chaque Pθ de la population induit un vecteur de probabilité p :=
pθ ∈ VPK , où
k
VPK = {p ∈ Rk>+1 : ∑ p ( i ) = 1}.
i =0
i.e. on suppose que pour tout i ∈ K, on a pi > 0. Par le théorème de grands nombres

νi (X(n) )
lim = P θ ( Xi ) = p i .
n→∞ n
Ce résultat permet d’affirmer que composante par composante, νi /n est un estimateur
de pi . Or les paramètres ( pi )i∈K ne sont pas libres car elles vérifient l’égalité ∑i pi = 1.
Nous voulons cependant une approche qui permet de former un estimateur simultané
pour toutes les composantes du vecteur de probabilité. Pour cela nous utiliserons l’es-
timateur du maximum de vraisemblance. Pour tout vecteur de probabilité q ∈ VPK ,
on introduit la fonction de vraisemblance
ν (X(n) )
Ln (q) := Ln (q, X(n) ) = ∏ qi i
i ∈K

et on cherche le maximum de vraisemblance (voir exercice 76). On constate que le


ν (X( n ) )
maximum de vraisemblance est atteint pour q̂ := q̂n = n .
Nous voulons tester l’hypothèse nulle H0 : p = p̂ (où p̂ = ν/n) contre l’hypothèse
alternative H1 : p 6= p̂.
Il convient donc de considérer le rapport des vraisemblances
Ln (p̂)
Rn = .
Ln (p)
Par un simple calcul, on constate que

log Rn = n ∑ p̂i log pii .
i ∈K

Or la fonction f : R≥ → R donnée par la formule f ( x ) = x log xx0 , où x0 > 0 et 0 log 0 =


0, admet comme développement f ( x ) = ( x − x0 ) + 2x1 0 ( x − x0 )2 + o (| x − x0 |3 ). Par
(νi −npi )2
conséquent log Rn = ∑i∈K npi + o (| p̂i − pi |3 ).

/Users/dp/a/ens/[Link] 74
2022-12-06 • 18:15:34.
Notions de statistique 6.3. Exercices

Théorème 6.2.17. Sous l’hypothèse H0 , lorsque n → ∞, la statistique

(νi − npi )2
Qn = ∑ npi
i ∈K

converge en loi vers χ2k .

Par conséquent, nous pouvons exprimer la condition de rejet de l’hypothèse H0 à


niveau d’erreur α si Qn > χ2k,α , où χ2k,α est le quantile supérieur de la loi χ2k , i.e. si Z est
une variable aléatoire distribuée selon la loi du χ2k ,

P( Z > χ2k,α ) = α.

6.3 Exercices
Estimation ponctuelle
70. Montrer que la variance empirique, définie par :
n  2
1
V n ( X(n) ) : = ∑
n − 1 i =1
Xi − m n ( X ( n ) ) ,

est un estimateur non-biaisé de la variance.


71. Soit (X, X , Π) un modèle statistique adéquat. Déterminer l’estimateur du maxi-
mum de vraisemblance lorsque Π = (Pθ )θ ∈Θ avec
(a) Θ = R> et Pθ = B( N, θ ),
(b) Θ = R × R> et Pθ = N (θ1 , θ22 ).
72. Démontrer le lemme établissant l’égalité

EQMθ (θ̂n ) = bθ (θ̂n )2 + Varθ (θ̂n ).

73. Soit la population Π = unif([0, θ ]) avec θ ∈ R> . Considérer les statistiques


(a) S1 (x) = n2 ∑in=1 xi et
(b) S2 (x) = max{ x1 , . . . , xn }.
(c) S3 (x) l’estimateur de maximum de vraisemblance.
Définissent-elles des estimateurs de θ ? Si oui, ces estimateurs sont-ils non-biaisés ?

Intervalles de confiance
74. Le but de cet exercice est de démontrer une amélioration — connue sous le nom
d’inégalité de Hoeffding — de l’inégalité obtenue en exercice 58.

Inégalité de Hoeffding : Soit ( Xi )i∈N une suite de variables aléatoires indépen-


dantes centrées telles que, pour tout i ∈ N, nous avons Xi ∈ [ ai , bi ] (pour deux
réels ai < bi ). Soit ε > 0. Alors
n n  2 !
t ( bi − a i ) 2
P( ∑ Xi ≥ ε) ≤ inf exp(−εt) ∏ exp .
i =1
t >0
i =1
8

/Users/dp/a/ens/ptin-td-stati-linked.tex75
2022-06-22 • 17:02:43.
6.3. Exercices Notions de statistique

(a) Utiliser l’inégalité de Markov pour montrer que, pour tout t > 0,
n n
P( ∑ Xi ≥ ε) ≤ exp(−tε) ∏ E exp(tXi ).
i =1 i =1

(b) Montrer que l’on peut écrire, pour tout i ∈ N, la variable aléatoire Xi comme
une combinaison convexe aléatoire, i.e.
[ a i , bi ] 3 X i = ( 1 − ξ i ) a i + ξ i bi
pour une variable aléatoire ξ i que l’on exprimera en fonction de Xi .
(c) Utiliser la convexité de t 7→ exp(tx ), pour x ∈ R arbitraire fixé, pour ma-
jorer exp(tXi ) en se servant de la décomposition convexe de Xi , établie à la
question précédente.
(d) Utiliser le centrage des variables aléatoires (EXi = 0), pour exprimer E exp(tXi ) =
exp( g(ui )), où ui = t(bi − a1 ) et g(u) = −ci ui + log(1 − ci + ci exp(ui )) et
ai
ci = − b − .
i ai
(e) Calculer g(0), g0 (0) et montrer que pour tout v > 0, g00 (v) ≤ 1/4.
(f) On rappelle que pour toute fonction g ∈ C2 (R), et pour tout u > 0, il existe
2
v ∈ [0, u] tel que g(u) = g(0) + ug0 (0) + u2 g00 (v). S’en servir pour conclure
2
que E exp(tXi ) ≤ exp( g(ui )) ≤ exp( t8 (bi − ai )2 ).
75. Soit ( Xi )i∈N une suite indépendante et identiquement distribuée selon la loi
Bernoulli(θ ), avec θ ∈ [0, 1].
q
1
(a) Soient α ∈]0, 1[ et ε n = 2n log α2 . Noter mn la moyenne empirique et

Cn =]mn − ε n , mn + ε n [∩[0, 1]
la troncature éventuelle de l’intervalle aléatoire de longueur 2ε n et de centre
aléatoire θ̂n induite par son intersection avec l’intervalle [0, 1]. Montrer que
Pθ (Cn 3 θ ) ≥ 1 − α.
(b) Effectuer l’expérience suivante sur ordinateur. Fixer α = 0.05, θ = 0.4 et
générer un échantillon ( Xi )i=1,...,10000 .
(c) Déterminer pour tout j = 1, . . . , 10000, les bords de l’intervalle Cj .
(d) Calculer la suite Kn = ∑in=1 1Ci (θ ) pour n = 1, . . . , 10000 et présenter les
couples (n, Kn ) et (n, |Cn |) pour n = 1, . . . , 10000.

Tests d’hypothèses

76. Maximiser la fonction de vraisemblance Ln (pθ , X) = ∏kj=0 pθ ( j)νj (X) (correspon-


dant au modèle statistique agrégé en k + 1 classes) sur l’ensemble VPk+1 en in-
troduisant un multiplicateur de Lagrange pour tenir compte de la contrainte
∑kj=0 p( j) = 1. Conclure que l’estimateur du maximum de vraisemblance est
p̂n = νn .
77. Utiliser un générateur de nombres aléatoires sur votre ordinateur et engendrer
un échantillon de taille 1000. Séparer l’intervalle [0, 1] en 10 classes équipro-
bables et tester par la méthode de χ2 si l’hypothèse H0 : le générateur est uni-
forme (contre l’alternative H1 : le générateur n’est pas uniforme) doit être reje-
tée.

/Users/dp/a/ens/[Link] 76
2022-12-06 • 18:15:34.
Deuxième partie

Théorie de l’information

77
Quantification de l’information
7
Dans le chapitre 1 nous avons présenté les arguments qui nous amènent à mesurer
la quantité d’information en bits. Dans ce chapitre, nous allons formaliser précisément
les propriétés que doit avoir la quantité d’information, démontrer que la seule fonc-
tion qui possède ces propriétés est la fonction introduite en chapitre 1 et donner trois
interprétations différentes de cette notion.
Une fois la notion d’information clarifiée, nous introduirons la notion de registre
de stockage et de ses états (informationnels) comme une abstraction mathématique
d’un dispositif physique dans lequel l’information puisse être stockée et nous allons
décrire son état informationnel comme une représentation abstraite de son contenu à
un instant particulier.

7.1 Postulats d’une quantité d’incertitude, entropie


Soit X une variable aléatoire définie sur un espace (Ω, F , P) à valeurs dans un
ensemble (alphabet) fini X (muni de sa tribu exhaustive) et de loi PX (décrite par son
vecteur de probabilité). Si cardX = M, nous pouvons toujours identifier l’alphabet X
avec { x1 , . . . , x M } ' {1, . . . , M} ' {0, . . . , M − 1}. La loi de X sera caractérisée par la
donnée de PX ({ x }) = P( X = x ), pour x ∈ X, codée dans le vecteur de probabilité
p = ( p( x )) x∈X , i.e.
PX ({ x }) = P( X = x ) = p( x ).
Dans le cadre défini ci-dessus, nous introduisons deux quantités.
Une fonction h : quantifiant la réduction de l’incertitude d’un événement.
Considérons l’événement { X = x }, pour un x ∈ X. Avant que l’expérience dé-
crite par la variable aléatoire X soit réalisée, nous avons une incertitude maxi-
male ; lorsque la valeur prise par X nous est révelée, l’incertitude s’annule. La
réduction de l’incertitude sera donc exactement l’incertitude a priori. Il est in-
tuitivement clair que l’incertitude a priori de { X = x } est une fonction de p( x ).
En effet, si nous savons que la loi de X est concentrée sur x, cette incertitude est
nulle. Par contre, elle doit être maximale lorsque la loi de X est l’équidistribution

79
7.1. Postulats d’une quantité d’incertitude, entropie Quantification de l’information

sur X. Nous définissons donc, pour un événement A ∈ X donné de probabilité


PX ( A) = p, la fonction h par

]0, 1] 3 p 7→ h( p) ∈ R.

La fonction H : l’espérance de h.
La fonction h pouvant varier beaucoup avec p, il est plus raisonnable d’associer
à l’incertitude d’une variable aléatoire X dont la loi est décrite par le vecteur
p = ( p( x )) x∈X la quantité H (p) = ∑ x∈X p( x )h( p( x )) qui représente l’incerti-
tude moyenne de l’observation. Les variables aléatoires étant en bijection avec
les vecteurs de probabilités qui décrivent leurs lois, nous pouvons identifier la
quantité H (p) avec H ( X ) et nous pouvons (provisoirement) noter H M ( X ) où
H M (p) cette espérance lorsque |X| = M.
Supposons que la variable aléatoire X soit uniformément distribuée dans X, i.e.
1
p( x ) = M , pour tout x = X, où |X| = M, et notons f ( M) = H M (( M 1 1
,..., M )) la valeur
de l’incertitude moyenne associée dans ce cas d’équidistribution. L’incertitude inhé-
rente à une expérience consistant à choisir entre les valeurs prise par une pièce honnête
est plus petite que l’incertitude inhérente d’un tirage du loto, i.e. f (2) < f (1.3 × 107 ).
Il est donc intuitivement clair d’exiger comme premier postulat :
Postulat 7.1.1 (Postulat de monotonie). La fonction f : N → R+ définie par f ( M) :=
1 1
H M (( M ,..., M )) est une fonction strictement croissante de son argument.
Considérons maintenant deux variables aléatoires indépendantes X et Y définies
sur le même espace de probabilité (Ω, F , P) uniformément distribuées respectivement
dans X et Y, avec |X| = L et |Y| = M. L’expérience composite fait intervenir la variable
aléatoire ( X, Y ) à valeurs dans X × Y, dont le cardinal est L × M. Si la valeur prise par
X nous est révélée, l’incertitude de Y n’est pas affectée car Y est indépendante de X.
Cependant, l’incertitude totale f ( LM) est réduite de l’incertitude f ( L) relative à X.
Ceci nous amène donc au deuxième
Postulat 7.1.2 (Postulat d’extensivité). Pour tout L, M ≥ 1, nous avons f ( LM) = f ( L) +
f ( M ).
Nous allons maintenant relaxer la condition de distribution uniforme. Supposons
que p est un vecteur de probabilité arbitraire sur X (de cardinal |X| = M) et que
X prend des valeurs dans X avec probabilité P( X = x ) = p( x ). Considérons une
partition X = X1 t X2 et notons qi = ∑ x∈Xi p( x ), avec |Xi | = Mi , i = 1, 2.
Nous allons considérer l’expérience effectuée en deux étapes : lors de la première
étape, nous nous intéressons à l’événement X ∈ Xi , avec P( X ∈ Xi ) = qi , i = 1, 2
et lors de la deuxième étape nous examinons si la variable aléatoire prend une valeur
précise sachant qu’elle est dans l’un ou l’autre des groupes X1 ou X2 . Plus précisément,
nous calculons

P( X = x ) = P( X = x | X ∈ X1 )P( X ∈ X1 ) + P( X = x | X ∈ X2 )P( X ∈ X2 )
p( x ) p( x )
= q1 1X1 ( x ) + q2 1X2 ( x )
q1 q2
= p ( x ).

Nous formulons alors le troisième postulat de la quantité d’incertitude

/Users/dp/a/ens/[Link] 80
2022-09-06 • 16:25:42.
Quantification de l’information 7.1. Postulats d’une quantité d’incertitude, entropie

Postulat 7.1.3 (Postulat de regroupement). Avec les mêmes notations que ci-dessus,
pX1 pX2
   
H M (p) = q1 H M1 + q2 HM2 + H2 ((q1 , q2 )).
q1 q2
Finalement, nous introduisons le
Postulat 7.1.4 (Postulat de continuité). La fonction H2 ( p, 1 − p) est continue en p ∈ [0, 1].
Théorème 7.1.5. L’unique fonction (à une constante multiplicative près) qui vérifie les pos-
tulats de monotonie, d’extensivité, de regroupement et de continuité est la fonction

PV M 3 p 7→ H M (p) = −C ∑ p( x ) log p( x ),
x ∈X

où le logarithme est en une base b > 1 arbitraire, où PV M désigne l’ensemble de vecteurs de


probabilité en dimension M.
Démonstration. Il n’est pas difficile de montrer que la fonction H M donnée dans l’énoncé
du théorème vérifie les 4 postulats précités. Nous devons montrer la réciproque. Nous
observons que pour tout a, b > 1 et tout x > 0, on a loga x = loga b logb x. Par consé-
quent, nous pouvons travailler dans une base arbitraire de logarithmes car le chan-
gement de base peut être absorbé dans la constante C. La démonstration se fera en
plusieurs étapes :
1. Pour tous les entiers M, k ≥ 1 nous avons, par le postulat d’extensivité,

f ( M k ) = f ( M · M k −1 ) = f ( M ) + f ( M k −1 ),

ce qui, en itérant, mène à f ( Mk ) = k f ( M).


2. Nous allons montrer que pour M ≥ 1 entier, il existe C > 0 telle que f ( M) =
C log M. Pour M = 1, nous avons f (1) = f (1 · 1) = f (1) + f (1), donc f (1) = 0
qui vérifie donc l’égalité f ( M) = C log M. Supposons-la vraie pour M > 1
entier. Pour tout entier r ≥ 1, il existe entier k ≥ 0 tel que Mk ≤ 2r ≤ Mk+1 (où
l’une de deux inégalités d’encadrement est stricte). Nous avons

f ( Mk ) ≤ f (2r ) ≤ f ( Mk+1 ) (par le postulat de monotonie)


k f ( M) ≤ r f (2) ≤ (k + 1) f ( M) (par le postulat d’extensivité)
k f (2) k +1
ce qui entraîne l’encadrement r ≤ f ( M)
≤ r . Par ailleurs, la fonction log (pour
une base b > 1 est strictement croissante. Des inégalités Mk ≤ 2r ≤ Mk+1 , nous
log 2 k +1
avons donc aussi les encadrements kr ≤ log M ≤ r . Par conséquent,

log 2 f (2) 1
− < .
log M f ( M) r
Puisque M est fixé tandis que r est arbitraire, nous avons

log 2 f (2) f (2)


= ⇒ f ( M) = C log M, où C = .
log M f ( M) log 2

Par ailleurs f (1) = 0 tandis que f est strictement croissante, donc f (2) > 0 ; par
conséquent C > 0.

/Users/dp/a/ens/[Link] 81
2022-09-06 • 16:25:42.
7.1. Postulats d’une quantité d’incertitude, entropie Quantification de l’information

3. Si p ∈ Q+ , nous démontrerons que H (( p, 1 − p)) = −C [ p log p + (1 − p) log(1 −


p)]. En effet, si nous écrivons p = rs avec des entiers r, s ≥ 1, nous obtenons, en
utilisant le postulat de regroupement,
 
− s−r
 
 1 1 1 1  r s r  r
f (s) = Hs  s , . . . , s , s , . . . , s  = H2
 , + f (r ) + f ( s − r ).
| {z } | {z } s s s s
r s −r

Nous avons donc, en utilisant ce que nous avons démontré en 2, que

f (s) = C log s = H2 (( p, 1 − p)) + Cp log r + C (1 − p) log(s − r ).

En résolvant, nous obtenons, pour p ∈ Q+ , que

H2 (( p, 1 − p)) = −C [ p log p + (1 − p) log(1 − p)].

4. Nous utilisons maintenant le postulat de continuité pour établir que pour tout
p ∈]0, 1[, nous avons H (( p, 1 − p)) = −C [ p log p + (1 − p) log(1 − p)]. Ceci est
une conséquence immédiate du fait que tout réel p ∈]0, 1[ peut être approximé
par une suite ( pn )n de rationnels pn ∈]0, 1[ pour tout n ∈ N.
5. Il reste à établir la formule pour H M dans le cas général p = ( p1 , . . . , p M ). La
formule H M (p) = −C ∑iM =1 pi log pi est vraie pour M = 1 et M = 2. Pour M >
2, nous supposons la formule vraie jusqu’à l’ordre M − 1 et nous utilisons le
postulat de regroupement pour l’établir dans le cas M. En effet, en notant q =
p1 + . . . + p M−1 et en utilisant le postulat de regroupement, nous obtenons
p p
H M (p) = H2 ((q, p M )) + qH M−1 (( 1 , . . . , M−1 )) + p M H1 ((1))
q q
" #
M −1
pi pi
= −C q log q + p M log( p M ) + q ∑ log
i =1
q q
M
= −C ∑ pi log pi .
i =1

Remarque 7.1.6. Sauf indication contraire, nous utiliserons des logarithmes en base
2 et la constante de normalisation C = 1. La fonction H mesure alors la réduction de
l’incertitude lorsque la valeur du tirage d’une pièce honnête nous est révélée en une
unité appelée bit. D’autres choix sont possibles, par exemple exprimer le logarithme
en base e et poser C = 1 ; l’unité correspondante est alors appelée nat. En Physique, on
utilise la constante C = 1.3806488 × 10−23 J/K — appelée constante de Boltzmann — et
on exprime le logarithme en base e ; l’unité de H est alors exprimée en J/K (Joules par
degré Kelvin) et la quantité H est alors appelée entropie. Dans la suite de ce cours, log
représentera le logarithme binaire ; nous utiliserons la notation ln pour le logarithme
neperien.
Remarque 7.1.7. L’incertitude associée à l’ignorance des valeurs d’une variable aléa-
toire X avant que l’expérience soit effectuée et la réalisation nous soit relevée, ne dé-
pend pas des valeurs possibles de X mais uniquement des probabilités avec lesquelles

/Users/dp/a/ens/[Link] 82
2022-09-06 • 16:25:42.
Quantification de l’information 7.1. Postulats d’une quantité d’incertitude, entropie

0.8

H2 ( p, 1 − p)
0.6

0.4

0.2

0
0 0.2 0.4 0.6 0.8 1
p

Figure 7.1 – La fonction H joue un rôle capital dans toute la suite de ce cours. Il est donc utile de
garder à l’esprit le comportement qualitatif de H2 ( p, 1 − p) en fonction de p ∈ [0, 1].

ces variables sont prises. Si par exemple X ∈ X = {−1, 1} correspond à une expé-
rience dans laquelle vous perdez un euro si la pièce honnête tombe sur « pile » ou
bien X ∈ Y = {exécution, libération} correspond à l’expérience où un prisonnier est
exécuté si la pièce honnête tombe sur « pile », les deux expériences ont exactement la
même incertitude même si les conséquences sont autrement graves pour le perdant.
Nous écrirons dans la suite indifféremment H ( X ) ou H (p) pour signifier l’entropie
associée à la variable aléatoire X ou à sa loi.
Remarque 7.1.8. Dans ce qui précède, nous avons indiqué H M pour signifier l’entropie
pour une variable aléatoire prenant M valeurs distinctes. Dans la suite nous omettrons
cette dépendance et nous considérerons la fonction H définie sur PV = ∪∞ M=1 PV M où
M
M
PV M = {p := ( p1 , . . . , p M ) ∈ R+ : ∑ p i = 1}.
i =1

En fait, H est une collection dénombrable de fonctions ( H M ) M≥1 . Lorsque nous ap-
pliquons H sur un vecteur de probabilité p ∈ PV, en réalité nous appliquons H M sur
p ∈ PV M pour un certain M. Le résultat est alors calculé par application de la fonction
H M . Finalement, nous simplifierons la notation pour écrire H ( p1 , . . . , p M ) au lieu de
H M (( p1 , . . . , p M )).

Définition 7.1.9. Soit p ∈ PV un vecteur de probabilité. La quantité


dim(p)
H (p) := Hdim(p) (p) = − ∑ pi log pi ,
i =1

est appelée entropie ou (quantité d’)information associée au vecteur p.


La formule de la définition 7.1.9 est souvent attribuée à Shannon 1 [62] dans prati-
quement tous les livres consacrés à la théorie de l’information. Sans vouloir minimiser
1. Claude Elwood Shannon, Michigan 1916 – Massachussets 2001, ingénieur électrique et mathéma-
ticien américain, fondateur de la théorie de l’information.

/Users/dp/a/ens/[Link] 83
2022-09-06 • 16:25:42.
7.2. Trois interprétations de l’entropie Quantification de l’information

l’immense apport de Shannon en théorie de l’information, il est cependant nécessaire,


afin de rétablir la vérité historique, de rappeler que si l’article de Shannon a effective-
ment donné pour la première fois les propriétés mathématiques de l’information, elles
se trouvent être identiques à celles d’une autre quantité — physique — découverte un
siècle plus tôt (1856) par Rudolph Julius Emmanuel Clausius 2 et formalisée par Lud-
wig Eduard Boltzmann 3 [9] (cf. figure 7.2) et Josiah Willard Gibbs 4 [30], connue sous
le nom d’entropie 5 .
L’influence de la théorie des probabilités et de la thermodynamique est explorée
dans des textes classiques [1, 17, 28, 41, 50, 48] (mentionnons aussi l’article de revue [46]
ainsi que dans le livre récent [38]), textes desquels ces notes sont librement inspirées.
Plusieurs travaux récents (cf. [5, 27, 54]) empruntent le chemin inverse en examinant
les conséquences qu’ont en thermodynamique les notions introduites en théorie de
l’information.

7.2 Trois interprétations de l’entropie


7.2.1 H est une espérance (qui nous fait vieillir !)
Soit p ∈ PV M un vecteur de probabilité. On définit une variable aléatoire ξ =
− log p( X ) sur un espace de probabilité (Ω, F , P) prenant de valeurs dans l’alphabet
Y = {− log p1 , . . . , − log p M }
avec loi P(Y = − log pi ) = pi , pour i = 1, . . . , M. Alors
M
Eξ = E log p( X ) = − ∑ pi log pi = H (p).
i =1

L’entropie est donc égale à l’espérance de la variable aléatoire ξ, définie ci-dessus.

7.2.2 H est le nombre moyen de questions nécessaires pour détermi-


ner la valeur que prend une variable aléatoire
Nous commençons par l’exemple d’une variable aléatoire X prenant de valeurs
dans X = { x1 , . . . , x5 } selon un vecteur de probabilité est p = (0.3, 0.2, 0.2, 0.15, 0.15).
2. Physicien allemand, Koszalin 1822 – Bonn 1888, connu pour ses contributions en thermodyna-
mique.
3. Physicien autrichien, Vienne 1844 – Trieste 1906. Fondateur de la physique statistique et défenseur
de la théorie atomique qui à son temps n’était pas encore acceptée comme théorie physique. Il a par
ailleurs introduit l’hypothèse ergodique, idée selon laquelle sous certaines conditions on peut rempla-
cer des moyennes temporelles de suites stationnaires par des moyennes spatiales, une des idées les plus
fructueuses en physique mathématique ; elle a donné naissance à toute une sous-discipline mathéma-
tique connue aujourd’hui sous le nom de théorie ergodique. Dans son livre Vorlesungen über Gastheorie
[9], il a introduit la fonction H (cf. définition 7.1.9 et facsimilé de la page 41 de ce livre, en figure 7.2)
pour expliquer l’irréversibilité macroscopique de la physique régie microscopiquement par des équa-
tions différentielles réversibles.
4. Physicien théoricien, chimiste et mathématicien américain, 1839 – 1903. Il a posé les fondements
mathématiques de la thermodynamique chimique et de la mécanique statistique.
5. John von Neumann a signalé par ailleurs à Shannon que la quantité d’information introduite par
ce dernier était déjà connue sous le nom d’entropie par Boltzmann et c’est von Neumann qu’a suggéré
à Shannon de garder le nom d’entropie.

/Users/dp/a/ens/[Link] 84
2022-09-06 • 16:25:42.
Quantification de l’information 7.2. Trois interprétations de l’entropie
,

[Gleich. 35j J;
6. Math. Bedeutung der Grösse H. 41

andere Permutation möglich. Viel wahrscheinlicher schon wäre


der Fall, dass die Hälfte der Moleküle eine bestimmte, be-
stimmt gerichtete, die andere Hälfte eine andere, wieder für
alle gleiche und gleichgerichtete Geschwindigkeit hätten. Dann
wäre die Hälfte der Geschwindigkeitspunkte in einer, die andere
Hälfte in einer zweiten Zelle: es wäre also:

Z= / «\ , / w \ , u. s. w.
2/ \2
Da nun die Anzahl der Moleküle eine überaus grosse ist,
so sind n^oo, n^w u. s. w. ebenfalls als sehr grosse Zahlen zu

betrachten.
Wir wollen die Annäherungsformel:

p\ = ]/2p;r(
P Y
e

benützen, wobei e die Basis der natürlichen Logarithmen und


p eine beliebige grosse Zahl ist.^)

Bezeichnen wir daher wieder mit l den natürlichen Loga-


rithmus, so folgt:

l [(Wj cö) !] = [n^(o + -1) Z Wj + n-^co{lco — 1 ) + -|- (/ w + / 2 tt) .

Vernachlässigt man hier gegen die sehr grosse Zahl


-i- n^ co
und bildet den analogen Ausdruck für {n^(o)l, (wg«)! u. s. f.,

so ergibt sich:

l Z= — (ji[n-^ln^ + n^ln^" .) +C
wobei
C= l{n\)-n{l(ü- l)-4(^w -\-l27i)

für alle Geschwindigkeitsvertheilungen denselben Wertli hat,


also als Constante zu betrachten ist. Denn wir fragen ja bloss
nach der relativen Wahrscheinlichkeit der Eintheilung der ver-
schiedenen Geschwindigkeitspunkte unserer Moleküle in unsere
Zellen (o, wobei selbstverständlich die Zelleneintheilung, daher
auch die Grösse einer Zelle co, die Anzahl der Zellen t, und
die Gesammtzahl n der Moleküle und deren gesammte leben-
dige Kraft als unveränderhch gegeben betrachtet werden
müssen. Die wahrscheinlichste Eintheilung der Geschwindig-

^) Siehe Schlömilch, Comp, der höh. Analysis. Bd. 1. S. 437.


3. Aufl.

Figure 7.2 – Facsimilé de la page 41 du livre de Boltzmann Vorlesungen über Gastheorie [9], où
une définition mathématique de la fonction entropie, identique à la définition 7.1.9, est donnée pour
la première fois, quoiqu’obtenue par une méthode différente de celle utilisée par Shannon. La formule
correspondante est encadrée en rouge dans le texte original de Boltzmann qui est reproduit dans la
figure ci-dessus (le logarithme népérien est noté l). Ce livre a été traduit en français [10].

/Users/dp/a/ens/[Link] 85
2022-09-06 • 16:25:42.
7.2. Trois interprétations de l’entropie Quantification de l’information

oui (0.5) oui 0.6 X = x1


= x1 ?
[2, 0.5 · 0.6]

∈ X = x2
X { x1 , x2 } ?
non (0.4) [2, 0.5 · 0.4]

oui (0.4)
= x3 ? X = x3
non (0.5) [2, 0.5 · 0.4]

non (0.6)

oui (0.5) X = x4
= x4 ?
[3, 0.5 · 0.6 · 0.5]

X = x5
non (0.5) [3, 0.5 · 0.6 · 0.5]

Figure 7.3 – Le diagramme logique permettant de déterminer la valeur de X. Les étiquettes entre
parenthèse sur les arrêtes du diagramme désignent les probabilités conditionnelles de l’arbre de déci-
sions sachant à quel embranchement on se trouve. Par exemple, l’étiquette en vert sur le diagramme
ci-dessus, correspond à la probabilité conditionnelle P( X 6= x3 | X 6∈ { x1 , x2 }). Les étiquettes de la
forme [N, p] entre crochets désignent les nombres de questions posées N et la probabilité de la feuille
de l’arbre p.

Le diagramme logique — donné en figure 7.3 — permet de déterminer les valeurs de


la variable aléatoire X en posant un certain nombre de questions admettant comme
réponse soit « oui » soit « non ».
Le díagramme correspond à un arbre de décision ; chaque feuille de l’arbre (déter-
mination non ambiguë de la valeur de X) correspond à un chemin sur l’arbre muni
d’une probabilité. Par ailleurs chaque chemin qui mène de la racine à une feuille de
l’arbre correspond à un certain nombre de questions posées, noté N, (c’est le nombre
de losanges rencontrés le long du chemin). Calculons E( N ) pour l’exemple ci-dessus :

E( N ) = 2 · [0.5 · 0.6 + 0.5 · 0.4 + 0.5 · 0.4] + 3 · [0.5 · 0.6 · 0.5 + 0.5 · 0.6 · 0.5]
= 2 · [0.3 + 0.2 + 0.2] + 3 · [0.15 + 0.15]
= 2.3.
Par ailleurs, nous pouvons calculer l’entropie de p :

H (p) = −0.3 log 0.3 − 0.4 log 0.2 − 0.3 log 0.15 = 2.27.

La proximité des valeurs numériques de E( N ) et de H (p) est très frappante. Nous


verrons dans les chapitres suivants qu’il n’existe pas de schéma permettant de déterminer
la valeur de X en posant des questions binaires dont le nombre moyen serait plus petit
que H (p).
Le vecteur de probabilité p dans l’exemple ci-dessus est tel que son entropie H (p)
et l’espérance du nombre de questions E( N ) sont très proches. Ceci n’est pas tou-
jours le cas. Considérons en effet l’exemple d’une variable aléatoire à valeurs dans
X = { x1 , x2 } dont la loi est décrite par le vecteur de probabilité p = (0.7, 0.3). On

/Users/dp/a/ens/[Link] 86
2022-09-06 • 16:25:42.
Quantification de l’information 7.2. Trois interprétations de l’entropie

oui (0.7) X = x1 [1, 0.7]

X = x1 ?

non (0.3) X = x2 [1, 0.3]

Figure 7.4 – Le diagramme logique permettant de déterminer la valeur de X avec les mêmes
conventions de notation que pour la figure 7.3.

observe que dans ce cas H (p) = 0.88 tandis que E( N ) = 1 et il semble que nous ne
pouvons pas faire mieux que cela. En fait, il est possible de faire mieux. Supposons
en effet qu’au lieu de considérer une variable aléatoire X, nous considérons une paire
Z = ( X1 , X2 ) de deux copies indépendantes de X, i.e. la variable aléatoire Z prend de
valeurs dans {( x1 , x1 ), ( x1 , x2 ), ( x2 , x1 ), ( x2 , x2 )} ; sa loi sera décrite par le vecteur de
probabilité q = (0.49, 0.21, 0.21, 0.09). On peut construire facilement un schéma de dé-
cision des valeurs que prend la variable aléatoire Z avec E( N ) = 1.81. (Construisez ce
schéma). Cependant, ce schéma permet de déterminer une paire indépendante de va-
riables aléatoires X, donc l’espérance du nombre de questions par variable aléatoire est
0.905, plus proche de l’entropie que la valeur 1 déterminée précédemment. Nous pou-
vons continuer ce procédé avec des triplets, quadruplets, etc. de variables aléatoires ;
chaque fois nous obtiendrons une espérance du nombre de questions par variable qui
s’approche de H (p). L’exercice 86e montre que l’espérance du nombre de questions
par variable converge en décroissant vers l’entropie de la loi de l’une d’entre elles mais
il n’existe pas de schéma permettant de faire mieux que la barrière de l’entropie.

7.2.3 H est le rapport des logarithmes du volume des configurations


typiques sur celui de toutes les configurations
Soit X une variable aléatoire prenant de valeurs 6 dans un alphabet fini A, dont
la loi est décrite par le vecteur de probabilité p := ( p a ) a∈A . Pour tout n ∈ N, nous
considérons la variable aléatoire X := X(n) := ( X1 , . . . , Xn ), composée de n copies
indépendantes de la variable aléatoire X et qui prend des valeurs dans An . Pour tout
mot de n lettres α := (α1 , . . . , αn ) ∈ An et toute lettre a ∈ A, nous notons νa (α) :=
(n)
νa (α) = ∑in=1 1{a} (αk ). À cause de l’indépendance des variables aléatoires ( Xi )i=1,...,n ,
il est évident que
 
P X = α = ∏ p a a , ∀ α ∈ An
(n) ν (α)

a ∈A
 
(n)
P νa (X(n) ) =l = Cnl pla (1 − p a )n−l , ∀ a ∈ A, l = 0, . . . , n.

Remarque 7.2.1. Il est nettement plus aisé de travailler avec des suites infinies α ∈
(n)
AN ou avec des suites aléatoires infinies X = ( X1 , X2 , . . .) et de définir νa (α) =
6. Si M = cardA, sans perte de généralité, nous pouvons supposer que A ' {1, . . . , M} et que
p = ( pi )i=1,...,M .

/Users/dp/a/ens/[Link] 87
2022-09-06 • 16:25:42.
7.2. Trois interprétations de l’entropie Quantification de l’information

∑nk=1 1{a} (αk ) par la somme tronquée aux n premières lettres de la suite. De même,
nous pouvons utiliser la notation αn ou Xn pour signifier la troncature des suites aux
n premières lettres. On peut aussi remarquer que pour tout n ∈ N> et α ∈ AN , on a :
1 (n)
nν (α) ∈ PVA ; ce vecteur de probabilité est appelé type de la suite α.
(n)
Nous calculons aisément que E(νa (X)) = np a , pour tout a ∈ A. Il est donc intui-
tivement clair pourquoi nous définissons :
Définition 7.2.2. Soient un entier n ≥ 1, un alphabet fini A, un vecteur de probabilité
p ∈ PVcardA et un entier K > 0. Une suite α ∈ An est dite typique (plus précisément
(n, p, K )-typique) si
(n)
νa (α) − np a
∀ a ∈ A, p < K,
np a (1 − p a )
sinon, elle est appelée atypique. L’ensemble

Tn,p,K := {α ∈ An : α est (n, p, K )-typique} ⊂ An

désigne l’ensemble de suites (n, p, K )-typiques.


Remarque 7.2.3. Dans une suite α, typique pour un vecteur de probabilité p, nous
(n)
ν (α)
avons : | a n − p a | < √ K √1 = O( n−1/2 ), pour toute lettre a ∈ A. Il faut souli-
n
p a (1− p a )
gner que les suites typiques dépendent du vecteur de probabilité p mais ne sont pas elles-mêmes
aléatoires. Il s’agit tout simplement d’une famille de mots à n lettres sur l’alphabet A
dont les lettres apparaissent avec une densité pré-fixée (définie par p).
q
Théorème 7.2.4. Soient ε ∈]0, 1[ et K > d cardA ε e. Pour tout n ≥ K,
1. P(Xn 6∈ Tn,p,K ) < ε ;
2. ∃c > 0 tel que ∀α ∈ Tn,p,K , nous avons
√ √
2−nH (p)−c n
≤ P(Xn = α) ≤ 2−nH (p)+c n
;

3. card(Tn,p,K ) = 2n( H (p)+δn ) , avec limn→∞ δn = 0.


Démonstration. 1. Pour alléger la notation, écrivons X au lieu de Xn .
( (n) )!
νa (X) − np a
P(X 6∈ Tn,p,K ) = P
[
p ≥K
a ∈A np a (1 − p a )
(n)
!
νa (X) − np a
≤ ∑ P p ≥K .
a ∈A np a (1 − p a )

L’inégalité de Bienaymé-Tchebychev nous permet d’estimer les termes indivi-


duels dans la dernière expression par
(n) (n)
!
νa (X) − np a E(|νa (X) − np a |2 ) 1 ε
P p ≥K ≤ 2
= 2 < ,
np a (1 − p a ) K np a (1 − p a ) K cardA

ce qui nous permet de conclure que P(X 6∈ Tn,p,K ) ≤ ε


cardA × cardA = ε.

/Users/dp/a/ens/[Link] 88
2022-09-06 • 16:25:42.
Quantification de l’information 7.3. Propriétés de la fonction entropie, entropie relative

2. Pour toute α ∈ An , nous avons à cause de l’indépendance des variables aléa-


toires ( Xi ) que

(n)
− log P(X = α) = − νa (α) log p a .
a ∈A

Or, pour α ∈ Tn,p,K , nous avons, pour tout a ∈ A,


q q
(n)
np a − K np a (1 − p a ) ≤ νa (α) ≤ np a + K np a (1 − p a ).

(n)
Remplaçant les encadrements de νa (α) obtenusp dans la dernière formule dans
la pénultième et en définissant c := −K ∑ a∈A p a (1 − p a ) log p a , nous concluons.
3. Par l’affirmation 1 du théorème, nous avons

1 − ε ≤ P(X ∈ Tn,p,K ) ≤ 1.

À partir de l’affirmation 2, en combinant avec la relation précédente, nous obte-


nons

1 − ε < P(X ∈ Tn,p,K ) = ∑ P(X = α) ≤ 2−nH (p)+c n
card(Tn,p,K ),
α∈Tn,p,K

permettant de minorer card(Tn,p,K ) ≥ 2nH (p)−c n+log(1−ε) . Par ailleurs,

card(Tn,p,K )2−nH (p)−c n
≤ ∑ P(X = α) ≤ 1,
α∈Tn,p,K

permettant de majorer card(Tn,p,K ) ≤ 2nH (p)+c n . En combinant les deux bornes
nous obtenons
0
2n( H (p)−δn ) ≤ card(Tn,p,K ) ≤ 2n( H (p)+δn ) ,
log(1−ε)
où, δn = √c
n
→ 0 et δn0 = √c
n
− n → 0.

Remarque 7.2.5. Le théorème précédent établit les faits importants suivants. L’affir-
mation 1, établit que si p n’est pas l’équidistribution sur A, parmi les√[card(A)]n suites
possibles une proportion exponentiellement petite (de cardinal 2nH (p)±c n ) supporte pra-
tiquement toute la masse de P. L’affirmation 2 établit que dans ce petit ensemble de
configurations typiques, toutes ont essentiellement la même probabilité, i.e. il y a équi-
distribution sur l’ensemble de configurations typiques.

7.3 Propriétés de la fonction entropie, entropie relative


Il est évident que H (p) ≥ 0 car − p a log p A ≥ 0 pour tout a ∈ A.

Lemme 7.3.1. Soient p, q ∈ PVcardA , deux vecteurs de probabilité arbitraires. Alors

− ∑ p a log p a ≤ − ∑ p a log q a .
a ∈A a ∈A

/Users/dp/a/ens/[Link] 89
2022-09-06 • 16:25:42.
7.3. Propriétés de la fonction entropie, entropie relative Quantification de l’information

Démonstration. La fonction t 7→ ln t est concave sur R+ , i.e. le graphe de cette fonction


est en dessous de la tangente à n’importe quel point du graphe. Nous avons ln 1 = 0
et (ln t)0 |t=1 = 1t |t=1 = 1, par conséquent, la tangente qui passe par le graphe de la
fonction ln au point 1 a comme équation t − 1. La concavité devient donc ln t ≤ t − 1
q q
pour tout t > 0, avec égalité si et seulement si t = 1. Nous aurons donc ln paa ≤ paa − 1
(avec égalité si et seulement si q a = p a ). Nous aurons donc

qa qa
∑ p a ln
pa
≤ ∑ pa (
pa
− 1) = ∑ ( pa − qa ) = 0.
a ∈A a ∈A a ∈A

Théorème 7.3.2. Pour tout p ∈ PVcardA ,

H (p) ≤ log cardA,

avec égalité si et seulement si p a = 1


cardA pour tout a ∈ A.

Démonstration. Appliquer le lemme au vecteur de probabilité q uniforme sur A. Nous


aurons H (p) ≤ log cardA et la borne sera saturée pour p = q.

Pour deux vecteurs de probabilité p et q sur le même alphabet A, on dit que p est
absolument continu par rapport à q, et l’on note p  q, si p a = 0 pour tout a ∈ A tel
que q a = 0, i.e. si q a = 0 implique que p a = 0.

Définition 7.3.3. Soient p et q deux vecteurs de probabilité sur le même espace A.


On appelle entropie relative ou contraste de Kullback-Leibler de p par rapport à q la
quantité
(  
p
∑ a∈A p a log qaa si p  q
D (pkq) :=
+∞ sinon.

L’exercice 82 établit les propriétés importantes de D. En particulier, il permet de


montrer que D (pkq) ≥ 0, pour p et q arbitraires.

Remarque 7.3.4. La fonction D n’est pas symétrique en ses arguments. Cependant,


plus la valeur D (pkq) est grande, plus il est facile de discriminer entre les probabilités
p et q. De cette remarque découle la grande utilité de D en statistique. La définition
7.3.5 et la proposition 7.3.6 illustrent le pouvoir discriminant de D.

Définition 7.3.5. Soient (X, p) et (Y, q) deux espaces probabilisés finis (munis de leurs
tribus exhaustives) avec X ⊆ Y. On dit que (Y, q) est une fragmentation de (X, p)
(ou que (X, p) est une coalescence de (Y, q)) si on peut partitioner Y = t x∈X Yx , de
sorte que pour tout x ∈ X, on a p( x ) = ∑y∈Yx q(y).

Proposition 7.3.6. Pour i = 0, 1, on suppose que (Y, qi ) sont des fragmentations de (X, pi ).
Alors
D ( q0 k q1 ) ≥ D ( p0 k p1 ),
en d’autres termes, la fragmentation augmente le contraste de Kullback-Leibler.

/Users/dp/a/ens/[Link] 90
2022-09-06 • 16:25:42.
Quantification de l’information 7.4. Entropie des évolutions markoviennes

Démonstration. Sans perte de généralité, on suppose que q0  q1 . On a

q0 ( y ) p0 ( x )
D ( q0 k q1 ) − D ( p0 k p1 ) = ∑ q0 (y) log q1 (y) − ∑ p0 ( x ) log
p1 ( x )
y ∈Y x ∈X
 
q0 ( y ) p (x)
= ∑ ∑ q0 (y) log
q1 ( y )
− q0 (y) log 0
p1 ( x )
x ∈X y ∈Y x
q0 ( y ) p1 ( x )
= ∑ ∑ q0 (y) log
q1 ( y ) p0 ( x )
x ∈X y ∈Y x
 
q ( y ) p0 ( x ) 1
≥ ∑ ∑ q0 ( y ) − q0 ( y ) 1
q0 ( y ) p1 ( x )
(car log t ≥ 1 − )
t
x ∈X y ∈Y x
= 0.

7.4 Entropie des évolutions markoviennes

Soit ( Xt )t∈N une chaîne de Markov irréductible et apériodique sur un espace dé-
nombrable X (muni de sa tribu exhaustive X ) et de matrice stochastique P. On note π
sa probabilité d’équilibre, vérifiant π = πP et µn (y) := Pρ ( Xt = y) pour une probabi-
lité initiale ρ ∈ M1 (X) fixée.
Supposons que f : R+ → R soit une fonction mesurable strictement concave et,
pour n ∈ N,

 
µn (y)
Fn = ∑ π (y) f π (y)
.
y ∈X

Théorème 7.4.1. Sous le conditions ci-dessus, la suite des fonctions Fn est strictement crois-
sante en n.

Démonstration. La chaîne étant irréductible et apériodique, sa mesure invariante π


µ (y)
charge nécessairement tous les états y ∈ X. Le rapport un (y) := πn(y) est donc bien
défini pour tout n ∈ N et tout y ∈ Y. En notant, comme d’habitude par P̂( x, y) :=

/Users/dp/a/ens/[Link] 91
2022-09-06 • 16:25:42.
7.4. Entropie des évolutions markoviennes Quantification de l’information

π (y) P(y,x )
π (x)
le noyau de la chaîne renversée dans le temps, nous avons

µ n +1 ( y )
u n +1 ( x ) =
π (y)
P(z, x )
= ∑ µn (z) π (x)
z ∈X
µn (z) P(z, x )
= ∑ π (z)
π (z)
π (x)
z ∈X
= ∑ P̂(x, z)un (z).
z ∈X
!
f (un+1 ( x )) = f ∑ P̂(x, z)un (z)
z ∈X
> ∑ P̂(x, z) f (un (z)) (à cause de la stricte concavité de f ).
z ∈X
Fn+1 = ∑ π ( x ) f (un+1 ( x ))
x ∈X
π (z) P(z, x )
> ∑ π (x)
π (x)
f (un (z))
x,z∈X
= ∑ π (z) f (un (z)) (car ∑ P(z, x ) = 1 ).
z ∈X x
= Fn .

Corollaire 7.4.2. Sous les mêmes conditions, le contraste de Kullback-Leibler entre µn et π


est strictement décroissant en n. Il s’annule lorsque µn devient égale à la probabilité d’équilibre
π.

Démonstration. La fonction f := t 7→ −t log t est strictement concave, par conséquent,


pour cette fonction f ,
 
µn ( x ) µn ( x ) µn ( x )
Fn = ∑ π (x) f
π (x)
=− ∑ π (x)
π (x)
log
π (x)
= − D ( µ n k π ).
x ∈X x ∈X

Puisque D (µn kπ ) = − Fn , le contraste de Kullback-Leibler est strictement décroissante


en n et, par ailleurs, minoré par 0. Donc la suite ( D (µn kπ ))n admet une limite. On
en déduit que limn→∞ D (µn kπ ) = 0 lorsque µn converge vers la mesure d’équilibre
π.

En d’autres termes, le contraste de Kullback-Leibler entre la mesure µn — qui garde


la trace de la condition initiale — et la mesure d’équilibre π s’amenuise avec le temps.
Lorsque le contraste s’annule, la chaîne a atteint son état d’équilibre. Si l’initialisation
se fait avec π (au lieu de la mesure arbitraire ρ), on a stationnarité de la chaîne, i.e.
µn = π pour tout n et, dans ce cas, D (µn kπ ) = 0.

/Users/dp/a/ens/[Link] 92
2022-09-06 • 16:25:42.
Quantification de l’information 7.5. Couples de variables aléatoires

7.5 Couples de variables aléatoires


7.5.1 Entropie conjointe
Si X et Y sont deux variables aléatoires définies sur le même espace de probabilité
(Ω, F , P) et prennent leurs valeurs dans les alphabets finis respectivement X et Y,
la loi du couple ( X, Y ) est la loi conjointe déterminée par le vecteur κ de probabilité
conjointe κ ( x, y) := P( X = x; Y = y), pour x ∈ X et y ∈ Y. Il est donc naturel de
définir
Définition 7.5.1. Soient X et Y deux variables aléatoires définies sur le même espace de
probabilité (Ω, F , P) et à valeurs dans les alphabets finis X et Y. On note κ le vecteur
de probabilité de leur loi conjointe. Nous définissons l’entropie conjointe
H ( X, Y ) := H (κ) = − ∑ κ ( x, y) log κ ( x, y) = −E(log κ ( X, Y )).
( x,y)∈X×Y

De manière similaire, si X = ( X1 , . . . , Xn ) est un vecteur aléatoire de loi conjointe dé-


crite par le vecteur κ, i.e. pour x = ( x1 , . . . , xn ) ∈ X1 × · · · × Xn on a κ (x) = P( X1 =
x1 , . . . , Xn = xn ), l’entropie conjointe est définie par
H ( X1 , . . . , X n ) = − ∑ P(X = x) log P(X = x) = −E(log κ (X)).
x∈X1 ×···×Xn

Théorème 7.5.2. L’entropie est une quantité sous-additive, i.e.


H ( X, Y ) ≤ H ( X ) + H (Y ),
avec égalité si, et seulement si, les variables aléatoires X et Y sont indépendantes.
Démonstration. Soit κ le vecteur de probabilité conjointe. Notons µ( x ) = ∑y∈Y κ ( x, y)
le vecteur de probabilité de la première marginale, ν(y) = ∑ x∈X κ ( x, y) le vecteur de
probabilité de la deuxième marginale et q( x, y) = µ( x )ν(y) le vecteur de probabilité de
la loi conjointe de deux variables aléatoires Z1 et Z2 indépendantes ayant comme lois
respectives µ et ν. Nous avons
H (X) = − ∑ µ( x ) log µ( x ) = − ∑ ∑ κ (x, y) log µ(x)
x ∈X x ∈X y ∈Y

H (Y ) = − ∑ ν(y) log ν(y) = − ∑ ∑ κ (x, y) log ν(y)


y ∈Y x ∈X y ∈Y

H ( X ) + H (Y ) = − ∑ ∑ κ (x, y) log[µ(x)ν(y)] = − ∑ ∑ κ (x, y) log q(x, y).


x ∈X y ∈Y x ∈X y ∈Y

Par le lemme 7.3.1 nous obtenons


H ( X, Y ) = − ∑ κ ( x, y) log κ ( x, y) ≤ − ∑ κ ( x, y) log q( x, y) = H ( X ) + H (Y ),
x ∈X,y∈Y x ∈X,y∈Y

avec égalité si, et seulement si, κ ( x, y) = q( x, y) = µ( x )ν(y), pour tout x ∈ X et y ∈ Y,


i.e. si les variables aléatoires X et Y sont indépendantes.
Corollaire 7.5.3. 1. H ( X1 , . . . , Xn ) ≤ ∑nk=1 H ( Xk ) avec égalité si, et seulement si, les
variables aléatoires ( Xk )k=1,...,n sont indépendantes.
2. H ( X1 , . . . , Xm ; Y1 , . . . , Yn ) ≤ H ( X1 , . . . , Xm ) + H (Y1 , . . . , Yn ) avec égalité si, et seule-
ment si, les vecteurs aléatoires X = ( X1 , . . . , Xm ) et Y = (Y1 , . . . , Yn ) sont indépen-
dants.

/Users/dp/a/ens/[Link] 93
2022-09-06 • 16:25:42.
7.5. Couples de variables aléatoires Quantification de l’information

7.5.2 Entropie conditionnelle


Si X et Y sont deux variables définies sur le même espace de probabilité (Ω, F , P) à
valeurs respectivement dans X et Y, alors la connaissance que X = x permet de déter-
miner la loi conditionnelle de P(Y ∈ B| X = x ), pour B ⊆ Y et x ∈ X. Étant donné que
la probabilité conditionnelle est une probabilité, il s’ensuit que nous pouvons définir
son entropie par

H (Y | X = x ) = − ∑ P(Y = y|X = x) log P(Y = y|X = x).


y ∈Y

Définition 7.5.4. L’entropie conditionnelle de Y sachant X est définie par

H (Y | X ) = ∑ H (Y | X = x ) P ( X = x ) .
x ∈X

Remarque 7.5.5. L’expression de l’entropie conditionnelle n’est pas symétrique par


rapport aux deux variables. Nous avons en effet

H (Y | X ) = − ∑ P(X = x) ∑ P(Y = y|X = x) log P(Y = y|X = x)


x ∈X y ∈Y

= − ∑ P( X = x, Y = y)[log P(Y = y; X = x ) − log P( X = x )]


( x,y)∈X×Y
= H ( X, Y ) − H ( X ).

Nous obtenons une expression plus symétrique en écrivant

H ( X, Y ) = H (Y | X ) + H ( X ) = H ( X |Y ) + H (Y ).

La signification de l’entropie conditionnelle H (Y | X ) découle immédiatement des for-


mules précédentes : elle correspond à l’incertitude de la loi conjointe du couple ( X, Y )
réduite de l’incertitude de la variable aléatoire X car la valeur de X nous est révélée.

Théorème 7.5.6. H (Y | X ) ≤ H (Y ) avec égalité si, et seulement si, Y et X sont indépendantes.

Démonstration. Par l’égalité établie en remarque 7.5.5 et par la propriété de sous-additivité


de l’entropie (théorème 7.5.2), nous avons

7.5.5 7.5.2
H ( X, Y ) = H (Y | X ) + H ( X ) ≤ H (Y ) + H ( X ),

avec égalité si, et seulement si, les variables sont indépendantes.

7.5.3 Information mutuelle


Une autre quantité importante est la différence H ( X ) − H ( X |Y ) ; l’entropie H ( X )
correspond à l’incertitude a priori que nous avons sur X (sur la base de sa loi), l’entro-
pie conditionnelle correspond à l’incertitude sur X sachant que Y a été observée. La
différence ci-dessus contient donc l’information sur X que véhicule l’observation de Y.

Définition 7.5.7. On appelle information mutuelle de X et Y, la quantité

I ( X : Y ) : = H ( X ) − H ( X |Y ) .

/Users/dp/a/ens/[Link] 94
2022-09-06 • 16:25:42.
Quantification de l’information 7.6. Registres de stockage de l’information

Remarque 7.5.8. Le théorème 7.5.6 garantit que I ( X : Y ) ≥ 0, avec égalité si, et seule-
ment si, les variables aléatoires X et Y sont indépendantes ; dans le cas d’indépendance,
l’observation de Y ne nous apprend rien sur X, par conséquent, si nous soustrayons
de l’incertitude de X l’incertitude conditionnelle, l’incertitude résiduelle est nulle. Par
ailleurs, des égalités

H ( X, Y ) = H (Y | X ) + H ( X ) = H ( X |Y ) + H (Y ),

nous obtenons la symétrie de l’information mutuelle :

I ( X : Y ) = H ( X ) − H ( X |Y )
= H ( X ) + H (Y ) − H ( X, Y )
= I (Y : X ) .

7.6 Registres de stockage de l’information


En informatique nous devons stocker, accéder et traiter l’information ; nous avons
donc besoin d’un dispositif physique dont les états physiques peuvent être associés à
des états logiques (abstraits). Un tel dispositif doit
— posséder suffisamment d’états physiques dans lesquels le système peut être pré-
paré,
— son état courant doit être déterminé de manière non ambiguë et
— son état doit être transformable dans n’importe quel autre état légitime en exer-
çant sur le dispositif une action spécifique.
Des dispositifs physiques avec ces propriétés sont appelés registres et doivent être
pensés comme les cellules mémoire d’un ordinateur.
Définition 7.6.1. Soit A un alphabet fini, l’ensemble des états logiques, (X, X ) an
espace mesurable separable 7 , vérifiant |X| ≥ |A|, et θ > 0 le seuil de discernabi-
lité. L’ensemble des mesures de probabilité M1 (X) correspond à l’ensemble d’états
physiques. Pour un seuil θ > 0 donné, un registre est une application abstraitei
R : A → P (M1 (X, X )) telle que pour tout a, b ∈ A, avec a 6= b,
— R( a) ∩ R(b) = ∅ et
— ∀µ ∈ R( a), ∀ν ∈ R(b) : D (µkν) ≥ θ.
En d’autres termes, les mesures de probabilité dans R( a) et dans R(b), associées
à des lettres différentes a, b ∈ A peuvent être discriminées efficacement. En termes
opérationnels, un registre est un dispositif physique qui associe à chaque état logique
a une réalisation physique du système, préparé dans un état physique ρ ∈ R( a).
Puisque A est un alphabet fini arbitraire, la définition précédente s’étend triviale-
ment à des n-registres, pour n ≥ 1, vus comme applications R : An → P (M1 (X)), où
|X| ≥ |A| n .
Remarque 7.6.2. Dans la définition 7.6.1, nous pouvons remplacer le contraste de
Kullback-Leibler D (µkν) par le distance de variation totale kµ − νk1 qui, contrairemen
à D, a l’avantage d’être une vraie distance quoique moins discriminante que D. Do-
rénavant, lorsque cardA > 2, nous utiliserons toujours la distance de variation totale ;
pour cardA = 2, nous utilisons le contraste D ou la variation totale.
7. I.e. sa tribu X est dénombrablement engendrée et contient les singletons.

/Users/dp/a/ens/[Link] 95
2022-09-06 • 16:25:42.
7.6. Registres de stockage de l’information Quantification de l’information

Exemple 7.6.3. (Un registre idéal vu comme un objet mathématique abstrait). Sup-
posons A = X = {0, 1}, avec X équipé de sa tribu exhaustive. Les mesures de pro-
babilité extrémales sont les mesures qui n’admettent pas de décomposition convexe
non-triviale en d’autres mesures de probabilité. Il est aussi évident que {ε x , x ∈ X} ⊆
∂e M1 (X, X ). Cette inclusion devient une égalité si l’espace (X, X ) est séparable, ce qui
est effectivement la cas dans la situation présente.
De façon abstraite (i.e. en négligeant les contraintes de la réalisation physique), un
registre idéal 8 est l’application définie par la formule x 7→ R( x ) := {ε x } pour tout
x ∈ X. Lorsque x 6= y,
D (ε x kε y ) = +∞,
par conséquent les lettres x et y sont réalisées par deux mesures de probabilité unique-
ment définies et parfaitement discernables.

Exemple 7.6.4. (Un registre idéal vu comme un objet physique). Sous la même notation
que dans l’exemple 7.6.3, i.e. A = X = {0, 1}, associer avec l’état logique ‘0’, une
pièce totalement biaisée avec deux cotés « face » et avec l’état logique ‘1’, une pièce
totalement biaisée avec deux cotés « pile ». Ce système remplit les conditions pour qu’il
soit considéré comme registre ; il implémente physiquement la notion mathématique
abstraite de registre. Cependant, un tel système est totalement inutile pratiquement car
le codage des états logiques se fait en dur dans la construction de la pièce qui empêche
la transformation de 0 en 1 par l’action d’une opération raisonnable sur le système.
Bien sûr, il est toujours possible de faire fondre la pièce pour en frapper une nouvelle
avec un côté « pile » et un côté « face », une opération qui n’est pas très pratique pour
stocker, extraire et traiter l’information sur un ordinateur !

La discernabilité parfaite est une exigence trop forte pour qu’elle soit physiquement
implémentable. Pour cette raison, la définition 7.6.1 assouplit la condition de discerna-
bilité parfaite en la condition de discernabilité au dessus d’un certai seuil θ > 0, en
déclarant deux mesures µ et ν dans M1 (X) comme discernées (au seuil θ ∈ ]0, ∞[)
si θ ≤ D (µkν). Or, si le contraste n’est pas infini, les deux mesures ne peuvent pas
être mutuellement singulières ; par conséquent, elles ne peuvent pas être des masses
de Dirac masses supportées par des lettres différentes. Il est donc nécessaire de consi-
dérer pas seulement des mesures extrémales mais aussi des mesures générales dans
M1 (X) = co({ε x , x ∈ X}).
Une difficulté supplémentaire surgit lorsqu’on relaxe la condition de stricte dis-
cernabilité. Tandis que l’ensemble des probabilités extrémales ∂e M(X) est en bijec-
tion avec l’ensemble des états logiques X, l’ensemble M1 (X) est beaucoup plus grand
que X. En outre, puisque la discrimination est faite à l’aide du seuil θ > 0, l’image
R(A) = t a∈A R( a) ne couvre pas M1 (X). Puisqu’alors M1 (X) \ R(A) 6= ∅, il existe
d’états physiques qui ne correspondent pas à des états logiques ; lorsque le système
est préparé dans l’un de ces états, son état logique reste indéterminé. Moyennant l’ex-
tension de l’alphabet A en Au par adjonction d’une nouvelle lettre Au := A t {∂},
l’application R peut être conçue comme l’application de l’alphabet étendu dans les
classes d’équivalence des mesures de probabilité sur X, engendrée par la partition
M1 (X) = t a∈Au R( a), où R(∂) = M1 (X) \ R(A).
Le contraste de Kullback-Leibler n’est pas de maniement facile pour discriminer
le codage de différentes lettres pour des alphabets à trois lettres ou plus. La distance
8. I.e. qui discerne parfaitement les états physiques p.

/Users/dp/a/ens/[Link] 96
2022-09-06 • 16:25:42.
Quantification de l’information 7.7. Irreversibilité et principe de Landauer

Figure 7.5 – Gauche : D (pkq) pour p = ( p, 1 − p), q = (q, 1 − q), comme fonction de
p, q ∈ ]0.05, 0.95[. Les intersections avec les plans horizontaux à hauteur θ ∈ {0.1, 0.2, . . . , 1.9, 2.0}
sont représentées par les courbes rouges sur la surface. Milieu : Projection de la surface précédente sur
me plan horizontal (à hauteur 0) ; elle permet de visualiser les courbes de niveau à hauteur θ. Si nous
fixons le seuil de discrimination à θ = 0.1, la région interne (« lac » coloré en bleu clair) correspond à
la classe d’équivalence des états physiques R(∂) provenant de l’état logique indéterminé ∂. La région
gauche supérieure (au delà de la rive nord-ouest du lac) correspond à la classe d’équivalence R(1)
des états physiques provenant de l’état logique 1, la région droite inférieure (au delà de la rive sud-
est du lac) à la classe d’équivalence R(0) provenant de l’état logique 0. Droite : Intersection de la
surface descrvant D (pkq) avec le plan vertical q = 1 − p. Nous remarquons que quand p = 1/2,
les vecteurs p = ( p, 1 − p) et q = (1 − p, p) coïncident ; par conséquent leur contraste s’annule et
les vecteurs deviennent indiscernables. Les probabilités peuvent être discriminées efficacement lorsque
leur contraste excède un certain seuil, ex. 0.1.

de variation totale, malgré son pouvoir discriminant inférieur à celui du contraste,


est plus adaptée pour des tels alphabets ; la figure 7.6 donne un exemple dans le cas
A = X = { a, b, c}.
De nos jours, les registres de mémoire sont implémentés par des transistors. Plus
précisément, un registre peut être réalisé par un système physique bistable composé
de deux jonctions bipolaires montées en opposition. Il n’est pas le but de ce texte de
présenter tous les détails de la technologie des transistors 9 . Il est par contre important
de souligner que la définition de registre donnée ici et la bijection de l’alphabet logique
étendu avec les classes d’équivalence ( R( a)) a∈Au décrit parfaitement les registres à
transistors.

7.7 Irreversibilité et principe de Landauer


Dans ce paragraphe, nous allons présenter un résultat général — le principe de
Landauer — qui régit le fonctionnement de registres mémoire. La formulation initiale
de ce principe [44] est faite de manière assez informelle et les arguments utilisés pour
sa justification font appel à des principes thermodynamiques. Ces approches ne sont
pas très rigoureuses car elle font intervenir des arguments thermodynamiques pour
décrire des systèmes composés d’un seul atome.

9. Le lecteur intéressé peut consulter les livres [25, 34] pour des détails techniques.

/Users/dp/a/ens/[Link] 97
2022-09-06 • 16:25:42.
7.7. Irreversibilité et principe de Landauer Quantification de l’information

εa εa

R( a)
ρ1
ρ0
ρ2
R(b) R(c)
εb εc εb εc

Figure 7.6 – Gauche : L’ensemble convexe des états M1 ({ a, b, c}) et exemples de boules (pour
la distance de variation totale) de rayon δ = 0.1 autour des états ρ0 = 31 (ε a + ε b + ε c ), ρ1 =
1
2 ( ε a + ε b ) et ρ2 = 0.2ε a + 0.3ε b + 0.5ε c . Droite : Partition de l’ensemble des états en régions
disjointes R( a), R(b), R(c) codant les lettres a, b, c ∈ X et région tampon (orange) d’épaisseur 0.1,
correspondant à l’état indéterminé ∂. Cette région est obtenue comme enveloppe convexe de toutes
les boules de rayon δ = 0.1 centrées autour des états entre ρ0 et 21 (ε a + ε b ), entre ρ0 et 12 (ε b + ε c )
et entre ρ0 et 12 (ε c + ε a ). Les régions R( a), R(b) et R(c) sont des ensembles disjoints provenant de
la complémentation de la région tampon ; elles correspondent aux classes d’équivalence [ε a ], [ε b ] et
[ε c ] d’états qui peuvent sans ambiguïté être associés (à seuil de discernabilité that can be θ = 0.1)
aux lettres a, b et c respectivement.

Le principe de Landauer constitue un aspect de l’irréversibilité inhérente à tout cal-


cul sur ordinateur 10 Dans la suite, nous esquissons l’idée de démonstration du prin-
cipe de Landauer en faisant appel à des notions de physique statistique 11 .
Un modèle de registre plus réaliste — quoique encore naïf — que celui de l’exemple
7.6.4 est un système physique bistable possédant deux états distincts quasi-stables. Par
exemple, considérer une petite masse sphérique qui évolue dans le potentiel à double
puit esquissée en figure figure 7.7. L’état logique 0 est codé dans l’état physique x0 et
l’état logique 1 dans x1 .
Considérer l’opération logique R EMISE ÀZ ERO ( RÀZ ) définie comme 0 7→ 0 et 1 7→
0. Naïvement, on peut penser que lorsque l’état initial du registre est x0 , l’opération
RÀZ est synonyme à l’operation N E R IEN FAIRE entraînant un coût énergétique nul.
Lorsque l’état initial est x1 , une force dépendante du temps doit être exercée sur la
masse. Durant la première partie du mouvement, la force doit agir dans le même sens
que le mouvement en fournissant le travail nécessaire pour élever la masse ; après avoir
atteint le maximum local du potentiel, une force freinant la masse doit être exercée
pour qu’elle arrive à x0 à vitesse nulle. Puisque la force freinante agit en sens opposé
au mouvement, de travail mécanique est produit égal en quantité au travail consommé
en première étape. Nous pouvons donc conclure que l’opération RÀZ s’effectue à coût
énergétique nul.
10. Il ne faut pas oublier que la notion d’entropie a été introduite pour expliquer l’irréversibilité de
certains systèmes physiques macroscopiques.
11. La mécanique statistique est la théorie physique qui explique la phénoménologie de la thermody-
namique.

/Users/dp/a/ens/[Link] 98
2022-09-06 • 16:25:42.
Quantification de l’information 7.7. Irreversibilité et principe de Landauer

Figure 7.7 – Un double puits de potentiel avec deux


positions d’équilirbre x0 et x1 . Une masse sphérique avec
V (x)
vitesse initiale null placée en x0 ou x1 restera là pour
toujours et peut être considérée comme codant les états
logiques 0 ou 1. Quand la masse, initialement en x0 , est
poussée vers x1 avec une force suffisante pour surmon-
ter la barrière de potentiel, et ensuite ralentie durant sa
descente pour arriver à x1 avec une vitesse nulle, l’évolu-
x
x0 x1 tion du système correspondra à un changement de l’état
physique de celui codant le bit 0 à celui codant 1 à coût
énergétique nul.

Cependant, ce schéma ne reflète pas le fonctionnement réaliste d’un registre mé-


moire d’un ordinateur. En réalité la même routine est appliquée au registre pour implé-
menter l’opération RÀZ, indépendamment de l’état initial du registre.
En outre, comme mentionné en §7.6, le registre peut se trouver dans un état phy-
sique qui n’est pas un état pur correspondant à x0 ou x1 mais à un état mélange. La
description d’un registre simple fournie par la figure 7.7 est assez rudimentaire et naïve
puisqu’elle ne représente les états logiques 0 ou 1 que par les états purs R(0) = {(1, 0)}
et R(1) = {(0, 1)}. Mais, comme déjà expliqué, les mémoires d’un ordinateur sont im-
plémentées par des circuits physiques de transistors ; il est donc totalement illusoire de
penser qu’elles correspondent à des strictes masses de Dirac. Il est important d’avoir
des systèmes capables de représenter n’importe quel état physique p = ( p, 1 − p), pour
un p ∈ [0, 1] arbitraire.
Un réel arbitraire p ∈ [0, 1] peut être approché par des rationnels. Soient r, N des
entiers tels que Nr ≤ p < r+ 1
N et supposons qu’une urne à deux compartiments contient
and N boules indiscernables. L’ensemble de configurations possibles des N boules
dans les deux compartiments est isomorphe à

B = {b = [b1 , . . . , b N ], bk ∈ A = {0, 1}}.

Puisque l’ordre des lettres dans le mot b est sans importance, b est bijectivement re-
présenté par le vecteur d’occupation :

B 3 b 7 → ρ b ∈ M1 (A),


N
1
ρb ( a) =
N ∑ 1 { a } ( bi ) .
k =1
N −r
· · 0} 1| ·{z
Autrement dit, le mot b = [0| ·{z · · 1}] engendre le vecteur ρb = ( Nr , N ). Soit
r N −r
(Ω, F , P) un espace de probabilité (suffisamment grand). Nous introduisons le va-
riable aléatoire U : Ω → {1, . . . , N } et une famille paramétrique de variables aléatoire
X : B × Ω → A, où U est uniformement distribuée sur {1, . . . , N } et X (b, ω ) = bU (ω ) .
Lorsqu’il y a r boules dans le compartiment gauche et N − r boules dans le comparti-
ment droit,
N N
1
P( X = 0) = ∑ P ( X = 0 |U = k ) P (U = k ) =
N ∑ 1 { 0 } ( bk ) = ρ b ( 0 ) .
k =1 k =1

/Users/dp/a/ens/[Link] 99
2022-09-06 • 16:25:42.
7.7. Irreversibilité et principe de Landauer Quantification de l’information

L’ensemble des états physiques représentables est alors {ρb , b ∈ B} ⊂ M1 (A).

Exemple 7.7.1. Instancier le modèle précédent dans le cas N = 2 (deux boules dans
une urne à 2 compartiments) engendrant les états physiques (1, 0), (1/2, 1/2) et (1, 1) ;
ils peuvent être réalisés respectivement par les configurations des boules [00], [01] et
[11]. De toute évidence, nous associons l’état logique 0 avec la configuration physique
ρ[00] , l’état logique 1 avec l’état physique ρ[11] et l’état logique ∂ avec la configuration
ρ[01] .

Instancier maintenant les considérations précédentes dans le cas de N suffisam-


ment grand et d’un r arbitraire r ∈ {0, . . . , N }. Un tel système modélise un registre
dans l’état ( p, 1 − p) avec p = Nr ∈ [0, 1]. Réaliser physiquement ce registre comme un
récipient de volume V avec une paroi externe adiabatique 12 et une paroi adiabatique
séparant le récipient en deux compartiments ; sur cette paroi séparatrice il existe un
trou qui peut être ouvert ou fermé. Initialement le trou est fermé et le compartiment
gauche contient r atomes d’un gaz parfait et le droit N − r atomes du même gaz (voir
(a) de la figure 7.8). Le recipient est maintenu à la température T. Selon la loi des gaz
parfaits, le pression P dans chaque compartiment est donnée par les formules

V V
Pgauche = rkT = pNkT, Pdroite = ( N − r )kT = (1 − p) NkT,
2 2

où k := k B = 1.380 649 × 10−23 J/K est la constante de Boltzmann.


L’opération logique RÀZ peut maintenant être implémentée par le processus phy-
sique décrit dans la légende de la figure 7.8.

(a)

(b)

(c)

(d)

Figure 7.8 – (a) État initial du système ( p, 1 − p), avec p = r/N. (b) Le trou dans la paroi interne
est ouverte à coût énergétique zéro. Très rapidement après l’ouverture du troi, le gaz occupe désormais
uniformément la totalité du volume. Les couleurs différentes pour les atomes sont uniquement pour
des raisons d’illustration pour rappeler la provenance de chaque atome individuel. Penser cependant
que les atomes sont indiscernables. Par conséquent la couleur ne sera pas montrée dans les étapes
suivantes. (c) La paroir à l’extrémité droite est en réalité un piston qui comprime le gaz de façon
isotherme jusqu’à la moitié du volume. (d) Le trou est de nouveau fermé et le piston retourné à sa
position initiale à l’extrémité droite du récipient. Maintenant, tous les atomes se trouvent dans le
compartiment gauche et le registre est dans l’état pur (1, 0).

12. A DIABATIQUE, adj. et subst. fém. Qui se produit sans qu’il y ait échange de chaleur avec l’extérieur.

/Users/dp/a/ens/[Link] 100
2022-09-06 • 16:25:42.
Quantification de l’information 7.7. Irreversibilité et principe de Landauer

Nous sommes maintenant en mesure de faire quelques calculs élémentaires. Écrire


V = LA pour le volume, où L est la longueur du récipient et A l’aire de sa section
transverse. Considérer la situation décrite en (c) lorsque l’abscisse courante du piston
est x ∈ [ L/2, L]. La force instantanée F ( x ) qui doit être exercée sur le piston pour
équilibrer la force exercée sur le piston par la pression est F ( x ) = NkT
x (la force pointe
vers la gauche), donc le travail total nécessaire pour comprimer le gaz du volume V à
V/2 est ˆ L/2
dx
W(b)→(d) = Nk B T = − Nk B T ln 2.
L x
Le signe négatif signifie que le travail doit être dépensé pour changer l’état du sys-
tème de l’état (b) à (d). Par ailleurs, si l’on associe une variable aléatoire 0 ou 1 à
chaque atome selon qu’il se trouve à gauche ou à droite de la position courante du
piston, l’entropie totale 13 de cette famille, lorsque le piston est en position (b) est
NH (1/2, 1/2) = Nbits = Nk B ln 2 J/K, tandis que NH (1, 0) = 0 bits = 0 J/K. Par
conséquent, le coût énergétique par atome pour changer l’état initial du registre de l’état
T
arbitraire ( p, 1 − p) à l’état (1, 0) est N ∆S où ∆S = S(1, 0) − S(1/2, 1/2).
L’opération logique RÀZ correspond à l’effacement 14 du contenu informationnel
initial du registre. Ce que monte le calcul heuristique précédent est l’égalité

W
∆S = .
k B T ln 2
Plus spécificement, « effcer » un bit d’information coûte de l’énergie. Dans le calcul pré-
cédent, uniquement des transformations adiabatiques sont considérées. Si l’hypothèse
d’adiabaticité est assouplie, au lieu de l’égalité nous avons l’inégalité

∆S ≤ β∆Q,

où Q est la chaleur ajoutée au système et le symbole β est habituellement utilisé en


mécanique statistique pour désigner la quantité β = k 1T (nous pouvons absorber ln 2
B
en une redéfinition de k B .)
L’évolution des systèmes physiques isolés est réversible. Ceci signifie qu’il n’existe
pas d’expérience physique réalisable qui permet de distinguer un film d’évolution
d’un sytème projeté à l’endroit du même film projeté à l’envers.
L’entropie est étroitement liée à l’irréversibilité puisque selon le second principe de
thermodynamique, dans sa version microscopique formulée par Carathéodory [13],
stipule que l’entropie d’un système isolé
— est une fonction croissante du temps ; pour des tels systèmes, l’énergie est pré-
servée et ils évoluent spontanément vers des états d’équilibre thermodynamique,
i.e. des états à entropie maximale ;
13. Il faut se rappeler que l’entropie informationnelle est mesurée en bits et correspond à k = 1 et
logarithme binaire tandis que l’entropie thermodynamique est mesurée en J/K and correspond à k =
1.380 649 × 10−23 J/K and logarithme néperien.
14. Dans les langages de programmation anciennes, lorsque une réservation de cellules mémoire
pour un tableau était faite, il était nécessaire d’appliquer l’opération RÀZ. Une erreur fréquente com-
mise par des programmeurs inexpérimentés des années ’70 était d’omettre cette opération et commen-
cer à référencer les cellules de ce tableau directement ; or, les cellules mémoire pouvaient contenir de
bits « aléatoires », reliques des programmes précédents. Les compilateurs modernes évitent ce piège en
initialisant à 0 presque systématiquement toutes les cellules mémoires lorsqu’elles sont référencées pour
la première fois.

/Users/dp/a/ens/[Link] 101
2022-09-06 • 16:25:42.
7.7. Irreversibilité et principe de Landauer Quantification de l’information

— peut rester constante uniquement pour des évolutions réversibles isolées.


Remarque 7.7.2. Une évolution d’un système physique (classique) avec espace des
états S est un noyau stochastique agissant à gauche sur des états (≡ probabilités) en
les transformant à des nouvelles probabilités. Soit H la fonction entropie telle que dé-
finie dans le cas fini (i.e. cardX < ∞) au théorème ??). Dans ce cas, les noyaux stochas-
tiques sont des matrices stochastiques ; ils correspondent à des évolutions réversibles
si le noyau est une matrice stochastique déterministe inversible, i.e. représente une
permutation on X. L’invariance de H aux permutations est inhérente à sa definition.
Lorsqu’un système physique évolue dans le temps, son état change vers un nouvel
état. Il est
— expérimentalement observé en thermodynamique,
— postulé en physique théorique,
— démontré en mécanique statistique et en théorie des probabilités,
que l’entropie est une fonction croissante dans le temps ; elle peut rester constante si,
et seulement si, l’évolution est réversible (une telle évolution correspond à celle d’un
système isolé). Cette remarque a des conséquences importantes en théorie de l’infor-
mation car le traitement, la transmission et l’extraction de l’information sont des pro-
cédés physiques, malgré que ce fait n’est jamais souligné dans les livres consacrés à la
théorie de l’information où tout est décrit en termes du formalisme abstrait des portes
logiques.
L’effacement des bits est de toute évidence une opération non réversible. Une ques-
tion naturelle se pose : pourquoi effacer des bits, gaspillant 15 ainsi de l’énergie élec-
trique ou mécanique précieuse en la transformant en chaleur (une forme d’énergie
dégradée) ?
Nous avons déjà évoqué (cf. note en bas de la page ??) la nécessité d’effacer les
reliques des calculs précédents de cellules mémoire. On pourrait alors dire « trop de
bruit pour rien ». Mais réfléchissons un peu ! Sur un ordinateur classique, les opération
logiques sont exécutées sur des portes logiques (AND, OR, etc.). Ces portes on 2 entrées
et une sortie ; elles sont donc nécessairement irréversibles. Un bit est perdu (effacé)
chaque fois qu’une telle porte est appelée, i.e. des milliards de fois par seconde sur un
ordinateur moderne !
Le principe de Landauer [44, 4] : Tout gain informationnel (décroissance de l’entropie)
induit par des opérations logiquement irréversibles doit impérativement être com-
pensé par une augmentation de l’entropie des degrés de liberté non-informationnels
de l’ordinateur et de son environnement (registres, alimentation électrique et autres
parties non génératrices d’information) au moins équivalent à la information acquise.
I.e. pour acquérir 1 bit d’information, l’entropie de l’environnement doit croître, d’au
moins 0.957 × 10−23 J/K. La dissipation d’énergie résultant de l’effacement d’un bit
d’information a été expérimentalement vérifié sur un système microscopique pour la
première fois 2012 [6] et confirmé en 2016 [33].
15. La thermodynamique introduit une hiérarchie parmi les différentes formes d’énergie. Les formes
d’énergie les plus nobles sont celle qui peuvent facilement être converties en d’autres formes avec un
facteur de conversion élevé. Par exemple, on peut convertir de l’énergie électrique en énergie mécanique
avec un facteur de l’ordre de 95% dans un moteur électrique. Ceci constitue la raison pour laquelle les
trains électriques sont si fréquents. À l’inverse, une machine à vapeur peut servir à transformer l’énergie
chimique contenue dans du charbon en chaleur et ensuite en énergie mécanique, avec un facteur de
conversion total de l’ordre de 1%. C’est la raison pour laquelle on ne rencontre plus des locomotives à
vapeur que dans les musées technologiques.

/Users/dp/a/ens/[Link] 102
2022-09-06 • 16:25:42.
Quantification de l’information 7.8. Exercices

Penser que la valeur 0.957 × 10−23 J/K, correspondant à l’accroissement d’entropie


pour l’acquisition d’un bit d’information, est le minimum théorique absolu. Un ordi-
nateur classique de tous les jours accroît l’entropie de l’environnement par des valeurs
dépassant de plusieurs ordres de grandeur cette borne. Typiquement, l’accroissement
de l’entropie est couplé avec la consommation d’énergie électrique qui est fournie à
l’ordinateur par son alimentation et qui est convertie en chaleur, dissipée finalement
dans l’environnement. Ce phénomène peut facilement s’observer lorsque un ordina-
teur portable exécute un calcul compliqué ; il devient de plus en plus chaud et son
ventilateur se met à fonctionner de plus en plus rapidement.
Le coût énergétique de la technologie d’information et du calcul (ICT pour Informa-
tion and computer technology) constitue une part importante de l’énergie consommée
sur Terre. Comme reporté dans [26], le cout d’ICT en 2012 était approximativement de
3.3 HJ, soit le 4.7% de l’électricité mondialement produite 16 .

7.8 Exercices
Entropie, mesure de l’information

78. Les habitants d’un village sont divisés en deux parties. Une partie A contient
des individus qui disent la vérité avec probabilité 1/2, mentent avec probabi-
lité 3/10 et refusent de répondre avec probabilité 2/10. La partie B contient des
individus dont les probabilités pour chaque type de comportement sont res-
pectivement 3/10, 1/2 et 2/10. Soit p ∈ [0, 1] la probabilité qu’un habitant du
village choisi au hasard appartienne au groupe A. On note i := i ( p) l’informa-
tion sur son comportement vis-à-vis des questions posées qui est véhiculé par
son appartenance à un groupe donné. Calculer p0 = arg max i ( p) et i ( p0 ).
79. Soient ( ai )i=1,...,n des nombres positifs vérifiant ∑in=1 ai = 1 et ( xi )i=1,...,n des
nombres strictement positifs. Établissez l’inégalité

n
x1a1 · · · xnan ≤ ∑ ai xi .
i =1

80. Soit p = ( p1 , . . . , pn ) un vecteur de probabilité (i.e. ayant des coordonnées pi ≥


0 et vérifiant la condition de normalisation ∑in=1 pi = 1). Supposons que p1 > p2
p −p
et notons δ ∈]0, 2 2 1 ]. On considère le nouveau vecteur de probabilité p0 avec
p10 = p1 − δ, p20 = p2 + δ et pi0 = pi pour i = 3, . . . , n. Les entropies H (p0 ) et
H (p) se comparent-elles et si oui comment ?
81. Soient A = ( Aij )i,j=1,...n une matrice doublement stochastique (i.e. une matrice
dont tous les termes sont positifs et dont chaque ligne et chaque colonne a une
somme normalisée à 1), et p = ( p1 , . . . , pn ) un vecteur (ligne) de probabilité.
(a) Montrer que le vecteur (ligne) p0 = pA est un vecteur de probabilité.
(b) Comparer les entropies H (p) et H (p0 ).

16. Selon les données publiées par l’International Energy Agency, la consommation totale d’élecricité
est environ de 68.4 HJ et représente 13% du total de l’énergie produite (ca. 540 HJ.) Le symbole H désigne
le préfixe hexa, représentant le facteur 1018 .

/Users/dp/a/ens/[Link]
103
2022-09-05 • 14:37:22.
7.8. Exercices Quantification de l’information

Propriétés de différentes variantes d’entropie et relations entre elles


82. (a) Montrer l’inégalité de Jensen (dans un cas simple), à savoir que si f est une
fonction convexe dérivable et ( an )i∈ I une famille finie de nombre positifs tels
que ∑i∈ I ai = 1, alors
∑ a i f ( t i ) ≥ f ( ∑ a i t i ).
i∈ I i∈ I

(b) Soient ( ai )i=1,...,n une famille de nombres positifs et (bi )i=1,...,n une famille de
nombres strictement positifs. Montrer que
n
ai n ∑nj=1 a j
∑ ai log bi ≥ ∑ log ∑n bk .
i =1 i =1 k =1

(c) Montrer que D (pkq) est convexe en le couple (p, q), i.e. si (p, q) et (p0 , q0 )
sont deux couples de vecteurs de probabilité et λ ∈ [0, 1] alors

D (λp + (1 − λ)p0 kλq + (1 − λ)q0 ) ≤ λD (pkq) + (1 − λ) D (p0 kq0 ).

83. En se servant du résultat précédent pour q = q0 = u, où u est le vecteur de


probabilité de la loi uniforme, montrer que H (p) est concave en p.
84. (Extrait de l’examen du 19 décembre 2013).
Soient X1 et X2 deux variables aléatoires sur (Ω, F , P) prenant des valeurs dans
le même espace X avec des lois décrites par les vecteurs de probabilité p et
p0 respectivement. Soit Y une variable aléatoire sur le même espace (Ω, F , P)
prenant de valeurs dans Y = {1, 2} selon le vecteur de probabilité (λ, 1 − λ),
avec λ ∈ [0, 1] ; on note Z = XY la variable aléatoire à valeurs dans X.
(a) Calculer P( Z = x ).
(b) En se servant du fait que le conditionnement réduit l’incertitude, i.e. H ( Z ) ≥
H ( Z |Y ), établir le résultat de concavité de H (p) par rapport à p avec une
méthode alternative à celle utilisée dans l’exercice précédent.

Compléments sur l’entropie


85. (Extrait de l’examen du 20 décembre 2017).
Le but de cet exercice est de montrer le
Théorème : Soient X un ensemble fini, β un paramètre positif et U : X → R+
une variable aléatoire réelle positive sur X. Pour une mesure de probabilité arbitraire
ν ∈ M1 (X) sur X, on note νU := ∑ x∈X ν( x )U ( x ), l’espérance 17 de U sous ν. Alors,
(a) il existe une mesure de probabilité µ β sur X qui sature le supν∈M1 (X) ( H (ν) − βνU ),
où H (ν) désigne l’entropie de ν,
exp(− βU ( x ))
(b) µ β ( x ) = Z ( β)
, pour tout x ∈ X, où Z ( β) = ∑y∈X exp(− βU (y)) est un
facteur de normalisation.
(a) Utiliser la concavité de la fonction log pour montrer que pour tout ν ∈
M1 (X), on a H (ν) − βνU ≤ log Z ( β).
(b) Calculer H (µ β ) − βµ β U.
17. Le vecteur de probabilité ν est considéré comme un vecteur ligne, la variable aléatoire U comme
un vecteur colonne ; pour ν fixé, l’espérance de U est la forme linéaire νU.

/Users/dp/a/ens/[Link]
104
2022-09-05 • 14:37:22.
Quantification de l’information 7.8. Exercices

86. Simulation d’une loi arbitraire avec une pièce honnête. (Extrait de l’examen du
15 décembre 2014). On dispose d’une pièce honnête (prenant de valeurs dans
B = {0, 1} selon le vecteur de probabilité (1/2, 1/2)). Les lancers successifs de
la pièce sont modélisés par des suites aléatoires de longueur arbitraire de bits
indépendants, c’est-à-dire par des mots ξ ∈ B+ (on rappelle que B+ = ∪∞ n=1 B ).
n

On veut simuler une variable aléatoire X à valeurs dans un ensemble fini X dont
la loi est décrite par un vecteur de probabilité p arbitraire. Autrement dit, nous
voulons exprimer X comme fonction de certains mots, choisis d’une certaine
manière, parmi les mots de B+ , de façon que la loi de X soit déterminée par les
probabilités des mots choisis.
Commencer par l’ensemble à trois éléments X =
{ a, b, c} et p = (1/2, 1/4, 1/4). Placer les lettres
a, b, c comme des feuilles d’un arbre binaire com-
plet (i.e. dont chaque nœud a 0 ou 2 descendants)
comme dans la figure adjacente. En associant le
(a) bit 0 aux arêtes gauches et le bit 1 aux arêtes a
droites, on constate que l’ensemble de feuilles
F = {0, 10, 11} de l’arbre se surjecte sur X. On b c
note F : F → X cette surjection (dans ce cas par-
ticulier, il s’agit d’une bijection). Expliciter l’algo-
rithme de génération de X.
(b) Dans le cas particulier de la question précédente, estimer le nombre moyen
de fois qu’il faudra lancer la pièce pour réaliser X et comparer ce résultat
avec l’entropie H ( X ).
(c) Considérer maintenant l’ensemble X = { a, b} et le vecteur de probabilité
p = (2/3, 1/3). Suggestion : Observer que ∑∞ 1 2
k=0 22k+1 = 3 et utiliser cette égalité
pour donner les représentations binaires des nombres 2/3 et 1/3 ; se servir de cette
représentation pour déterminer l’ensemble F de feuilles et la surjection F : F → X.
(d) Estimer le nombre moyen de lancers nécessaires pour simuler X.
(e) Pouvez-vous proposer une méthode générale pour un ensemble fini X arbi-
traire muni d’un vecteur de probabilité arbitraire p ?

/Users/dp/a/ens/[Link] 105
2022-09-06 • 16:25:42.
7.8. Exercices Quantification de l’information

/Users/dp/a/ens/[Link] 106
2022-09-08 • 19:58:05.
Sources et leur codage
8
Nous disposons d’une source qui génère une suite de symboles que nous sup-
posons qu’ils puissent être transmis sans erreur, i.e. à travers un canal de transmis-
sion parfait (il restitue à sa sortie un message identique à celui qu’il reçoit en entrée).
Notre préoccupation donc est uniquement d’optimiser le codage de la source en tenant
compte de la probabilité avec laquelle les lettres constitutives du message-source sont
produites.

8.1 Sources
Définition 8.1.1. Soit (Ω, F , P) un espace probabilisé adéquat.
1. Une source discrète est un dispositif qui émet une suite ( Xn )n∈N de variables
aléatoires à valeurs dans un ensemble fini X. L’ensemble X constitue les sym-
boles émis par la source. La source est totalement déterminée par la donnée
((Ω, F , P), X) que nous pouvons abréger en (X, P).
2. Une source discrète (X, P) est stationnaire si pour tout N ∈ N, tout n ≥ 1 et
tout n-uplet ( x1 , . . . , xn ) ∈ Xn , on a
P ( X N + 1 = x 1 , . . . , X N + n = x n ) = P ( X1 = x 1 , . . . , X n = x n ) .

3. Une source discrète (X, P) est markovienne si la suite ( Xn )n∈N est une chaîne
de Markov MC(X, P, ·).
4. Une source discrète (X, P) est sans mémoire si la suite ( Xn )n∈N est une suite
indépendante.
5. Une source discrète (X, P) sans mémoire est homogène si la suite ( Xn )n∈N est
une suite indépendante et identiquement distribuée avec P( Xn = x ) = p( x ),
pour tout x ∈ X et tout n ∈ N, où p = ( p( x )) x∈X ∈ PVX est le vecteur de
probabilité de la loi de X1 .
Dans ce chapitre nous nous limiterons au cas de sources discrètes homogènes sans
mémoire, c’est-à-dire que les messages produits peuvent être considérés comme des

107
8.2. Codes uniquement décodables Sources et leur codage

réalisations d’une suite de variables aléatoires à valeurs dans X indépendantes et iden-


tiquement distribuées 1 selon la loi décrite par le vecteur de probabilité p. De telles
sources seront notées dans la suite (X, p). Sans perte de généralité, on peut supposer
que X = supp p.

8.2 Codes uniquement décodables


Nous nous intéressons à une représentation de chaque symbole émis par la source
dans une alphabet fini A.
Définition 8.2.1. Soient (X, P) une source discrète arbitraire et A un alphabet fini avec
cardA ≥ 2.
— Un codage des symboles émis par la source est une application (le code) C :
X → A+ .
— On appelle glossaire du code l’ensemble C (X) ⊂ A+ .
— On note |C ( x )| la longueur du mot α ∈ A+ codant le symbole x. Lorsque tous
les symboles x ∈ X sont représentés par des mots de An (avec un certain n ≥ 1),
le code est dit de longueur fixe n, sinon il est de longueur variable.
— Un code par blocs (plus précisément m-blocs, avec m ≥ 1), est un codage de
l’alphabet étendu Xm , c’est-à-dire une application C : Xm → A+ .
— Un code étendu par concaténation est une application C̃ : X+ → A+ , définie
pour tout ξ ∈ X+ par
C̃ (ξ ) := C (ξ 1 ) · · · C (ξ |ξ | ).
Dans la suite nous omettrons le signe distinctif C̃ pour l’extension du code
par concaténation et nous noterons indifféremment C le code primaire ou son
extension.
Exemple 8.2.2. Le code ASCII 2 permet le codage de l’ensemble X contenant les 95
caractères imprimables et les 33 caractères de contrôle non-imprimables en mots de 7
bits. La colonne « Char » de la figure 8.1 représente les éléments de X tandis que la
colonne « Decimal » représente la valeur décimale du code binaire sur A7 , où A :=
{0, 1}.
Ce codage fut développé aux débuts de l’ère informatique pour coder l’anglais. Au-
jourd’hui il est connu sous l’appelation ISO / CEI -646. Ce code fut étendu en différentes
variantes de longueur fixe de 8-bits pour permettre le codage des principales langues
européennes. La variante ISO / CEI -8859-1 (aussi connue sous le nom de latin-1) permet
le codage de plusieurs langues d’Europe occidentale (dont le français).
Exemple 8.2.3. La standard UNICODE [16] est un codage C : X → A32 de longueur
fixe de 32 bits où X est l’ensemble de lettres utilisées par tous les alphabets des langues
principales du monde 3 . Il comporte en tout 1114112 symboles différents, donc C (X)
est un petit sous-ensemble de A32 qui a un cardinal |A32 | = 232 = 4294967296. Le
1. Il faut cependant garder à l’esprit que plusieurs des résultats obtenus dans ce chapitre se généra-
lisent au cas des sources markoviennes.
2. American standard code for information interchange.
3. Y compris les alphabets latin, grec, cyrillique, arménien, hébreux, arabe, syriaque, thaana, de-
vanagari, bengali, gurmukhi, gujarati, oriya, tamil, telugu, kannada, malayalam, sinhala, thaï, laotien,
tibétain, myanmar, géorgien, hangul jamo, éthiopien, cherokee, aborigène canadien, syllabique, ogham,
runique, khmer, philippinais, limbu, tai le, tai lue, mongole, phonétique, extensions du latin et du grec,

/Users/dp/a/ens/[Link] 108
2022-09-08 • 19:58:05.
Sources et leur codage 8.2. Codes uniquement décodables

Figure 8.1 – Le code iso/cei-646 C128 : X → A7 de longueur fixe de 7 bits. Par exemple la
lettre z ∈ X est codée en C128 (z) = h122i10 = h7Ai16 = h1111010i2 ∈ A7 . (Source de la figure :
domaine public).

codage UTF -8, connu aussi comme ISO / CEI -10646, du standard UNICODE est un code
C : X → {0, 1}8m de longueur variable en 8m bits où m ∈ {1, 2, 3, 4}, assurant la
compatibilité descendante avec le code ASCII.
Exemple 8.2.4. 1. Soient X = {1, 2, 3, 4}, A = {0, 1}, p = (1/2, 1/4, 1/8, 1/8) et
C le code
x C(x)
1 0
2 10
3 110
4 111
Nous calculons E(|C ( X )| = 1.75 ; il se trouve que pour cet exemple, l’entropie a
aussi la valeur numérique H (p) = 1.75.
2. Soient X = {1, 2, 3}, A = {0, 1}, p = (1/3, 1/3, 1/3) et C le code
x C(x)
1 0
2 10
3 11
Nous calculons E(|C ( X )| = 1.66 tandis que la valeur numérique de l’entropie
est H (p) = 1.58.
buginais, balinais, linéaire A et B, italique, gothique, ugaritique, chypriote, phénicien, kharostht, sys-
tèmes de numérotation anciens, cunéiforme, ainsi que les parties constitutives d’idéogrammes chinois,
japonais et coréens, des symboles mathématiques courants, etc.

/Users/dp/a/ens/[Link] 109
2022-09-08 • 19:58:05.
8.2. Codes uniquement décodables Sources et leur codage

Pour les deux codes de l’exemple précédent 8.2.4, nous observons que si α ∈ A∗
est un mot, image par C d’un mot ξ ∈ X+ , nous pouvons de manière unique décoder
α pour obtenir le mot duquel il est construit. Par exemple, pour le premier codage,
si α = 0110111100110, nous constatons aisément que α = C (134213). De la même
façon, pour le deuxième exemple, le mot α = 0100011 = C (12113). Cette possibilité de
décoder de manière unique est une caractéristique essentielle du code.

Définition 8.2.5. Le code C est dit


1. non-singulier si C : X → A+ est injective, i.e. x 6= x 0 ⇒ C ( x ) 6= C ( x 0 ),
2. uniquement décodable si son extension à X+ est injective,
3. instantané 4 si aucun mot C ( x ), x ∈ X du glossaire n’est préfixe d’un autre mot
du glossaire.
Les familles de différents types de codes — sous familles de la famille de codes ar-
bitraires C — sont notées respectivement Cinst , Cud , Cns . Elles vérifient les inclusions
suivantes
Cinst ⊆ Cud ⊆ Cns ⊆ C .

Exemple 8.2.6. Parmi les codes suivants,

x C1 ( x ) C2 ( x ) C3 ( x ) C4 ( x )
1 0 0 10 0
2 0 010 00 10
3 1 01 11 110
4 1 10 110 111

C1 est singulier car il n’est pas injectif, C2 est non-singulier mais non uniquement dé-
codable car C2−1 (010) = {31, 2, 14}, C3 est uniquement décodable mais non instantané
car le mot de code 11 est préfixe du mot de code 110, C4 est instantané.

Le qualificatif instantané pour le codes dont les mots de code ne sont pas préfixes
d’autres mots de code provient du fait qu’un mot α nous est donné, son décodage se
fait au fur et à mesure de sa lecture ; la fin de chaque mot de code le composant est
déterminée uniquement par l’information accumulée par la lecture du mot de gauche
à droite ; il n’est pas nécessaire de connaître les lettres ultérieures pour décoder. Par
exemple, le code C sur X = {0, 1} défini par C (0) = 0, C (1) = 0| .{z
. . 0} 1 est uniquement
n
décodable ; cependant, si le mot 0| .{z
. . 0} 1 est envoyé, nous devons attendre la réception
n +1
des tous les n + 2 symboles pour savoir que le mot source était 01. Il n’est donc pas
instantané (comme son caractère non-préfixe le laisse entendre).

Remarque 8.2.7. L’unique décodabilité d’un code C impose l’injectivité de l’extension


de C sur X+ . Ceci implique, qu’il existe alors une fonction partielle ∆ : A+ → X+ qui
est l’inverse de C lorsque cette dernière application est vue comme C : X+ → C (X+ ),
i.e.
∀ξ ∈ X+ , ∆(C (ξ )) = ξ.
4. Dans la littérature, les codes instantanés sont souvent appelés « codes préfixes », terminologie pour
le moins absurde car ils sont précisément des « codes non-préfixes ».

/Users/dp/a/ens/[Link] 110
2022-09-08 • 19:58:05.
Sources et leur codage 8.2. Codes uniquement décodables

Il est donc important de pouvoir décider si un code est uniquement décodable. Or


si décider de l’instantanéité du code est facile car il suffit de comparer tous les couples
(α, β) des mots de {C ( x ), x ∈ X} et vérifier que α 6≺ β et β 6≺ α, décider si un code C
est uniquement décodable est plus difficile car il faut s’assurer de l’injectivité de C sur
X+ .
On peut établir un critère (condition nécessaire et suffisante) d’unique décodabilité
d’un code arbitraire à l’aide d’une procédure itérative. On note S0 = C (X) l’ensemble
de mots du code (vu comme suffixes du mot vide). Pour tout n ≥ 1, on construit
itérativement la suite des suffixes relatifs possibles

Sn = { β ∈ A+ : (αβ = γ) ∨ (γβ = α), pour α ∈ S0 , γ ∈ Sn−1 }.

On note ensuite S∞ = ∪n≥1 Sn . Le critère est donné par le

Théorème 8.2.8. [Sardinas-Patterson (1953)] Un code C : X → A+ est uniquement déco-


dable si, et seulement si,
S∞ ∩ S0 = ∅.

Démonstration. À rédiger ultérieurement.

Remarque 8.2.9. L’utilité du critère précédent peut paraître limitée car son application
nécessite la détermination de la suite infinie de suffixes relatifs (Sn )n≥1 . Il n’en est rien.
Notons en effet L = maxx∈X |C ( x )| la longueur maximale des mots du code. Il s’ensuit
que tous les mots de β ∈ Sn vérifient | β| ≤ L et, par conséquent, tous les ensembles de
suffixes Sn sont finis. La suite (Sn ) est donc nécessairement finalement périodique (i.e.
il existe deux entiers N, p ≥ 1 tels que pour tout m ≥ N : Sm = Sm+ p ). Une instance
particulière de périodicité finale est le cas S N = ∅ pour un certain N ≥ 1 ; il est alors
évident que Sm = ∅ pour tout m ≥ N. Cette remarque garantit que l’algorithme 8.2.10
s’arrête en un temps fini.

Pour B, C ⊆ A+ , on note B−1 C = {γ ∈ A∗ : βγ ∈ C, β ∈ B}. Le symbole ε est


toujours réservé pour le mot vide.

Algorithme 8.2.10. Sardinas-Patterson


Require: C : X → A+
Ensure: 1Cud (C )
S0 ← C ( X )
S1 ← S0−1 S0 \ {ε}
n←1
while ε 6∈ Sn et ∀m < n : Sn 6= Sm do
n ← n+1
Sn ← S0−1 Sn−1 ∪ Sn−−1 1 S0
end while
1Cud (C ) ← 1 − 1Sn (ε)

/Users/dp/a/ens/[Link] 111
2022-09-08 • 19:58:05.
8.3. Théorème de Shannon sur le codage sans bruit Sources et leur codage

8.3 Théorème de Shannon sur le codage sans bruit


8.3.1 Inégalité de Kraft
Définition 8.3.1. Soit A un alphabet avec A = cardA. On dit qu’une famille I d’entiers
(li )i∈ I , li ≥ 1 pour tout i ∈ I, vérifie l’inégalité de Kraft si

∑ A−li ≤ 1.
i∈ I

Théorème 8.3.2. (Kraft [43]).


1. Si C : X → A+ est un code instantané, alors la famille des longueurs des mots du code
(|C ( x )|) x∈X doit vérifier l’inégalité de Kraft.
2. Réciproquement, si (lx ) x∈X est une famille d’entiers ≥ 1 vérifiant l’inégalité de Kraft,
alors il existe un code instantané C : X → A+ tel que |C ( x )| = lx , ∀ x ∈ X.

Démonstration. Il est élémentaire de montrer que — pour tout entier L ≥ 1 — l’arbre


enraciné T possédant exactement L générations et dont chaque nœud possède A des-
cendants est en bijection avec ∪lL=0 Al .
(⇒) Supposons que nous ayons rangé l’ensemble de symboles X de sorte que la
condition
x  y =⇒ lx := |C ( xi )| ≤ |C (y)| =: ly
soit vérifiée. Notons α x = C ( x ), pour x ∈ X, le mot qui code le symbole x
et L = max{|C ( x )|, x ∈ X}. Puisque le mot α x ne peut pas être préfixe d’au-
cun autre mot du code, lorsque nous le plaçons sur un nœud de l’arbre T,
nous devons exclure tout le sous-arbre émanant de α x , par conséquence ex-
clure A L−lx feuilles de la génération L. Nous recommençons ensuite avec le mot
α x0 = C ( x 0 ), x  x 0 qui sera placé sur une autre branche de l’arbre ; son place-
ment exclura A L−lx0 nouvelles feuilles de la génération L. Pour que cette opéra-
tion puisse être répétée avec tous les mots du code, il faut que le nombre total
de feuilles exclues soit majoré par le nombre total de feuilles de la génération L,
i.e.
∑ A L−|C(x)| ≤ A L =⇒ ∑ A−|C(x)| ≤ 1.
x ∈X x ∈X

(⇐) Sans perte de généralité, nous pouvons supposer que les x soient rangées en
x1 , . . . , xcardX de sorte que l1 ≤ l2 ≤ . . . ≤ lcardX , où li = lx1 . Nous choisissons un
nœud arbitraire de la l1e génération de T et nous assignons le mot qui correspond
au nœud choisi à C ( x1 ) ; nous excluons simultanément le sous-arbre enraciné
à α1 = C ( x1 ) ce qui revient à exclure A L−l1 feuilles de la génération L. Il est
évident que

∑ A−lx ≤ 1 ⇒ ∑ A L − l x ≤ A L ⇒ A L − l1 < A L ;
x ∈X x ∈X

Il y a donc au moins une feuille qui subsiste après l’exclusion de ce sous-arbre et


donc toute la branche qui la relie à la génération l1 . Nous allons ensuite choisir
un nœud arbitraire de la génération l2 pour assigner le mot C ( x2 ). Nous savons
que ceci est possible car nous venons de montrer qu’il y a au moins une branche

/Users/dp/a/ens/[Link] 112
2022-09-08 • 19:58:05.
Sources et leur codage 8.3. Théorème de Shannon sur le codage sans bruit

reliant la génération l1 avec une feuille de la génération L ; cette branche rencon-


trera nécessairement un nœud de la génération l2 . Nous recommençons donc
l’argument :

∑ A−lx ≤ 1 ⇒ ∑ A L − l x ≤ A L ⇒ A L − l1 + A L − l2 < A L ;
x ∈X x ∈X

il subsiste donc au moins une feuille de la génération L après effacement des


deux sous-arbres précédents. L’inégalité de Kraft vérifiée par les (lx ) garantit
que cardX mots puissent être placés sans qu’aucun ne soit préfixe d’un autre.

8.3.2 Codes optimaux


L’inégalité de Kraft est une condition nécessaire et suffisante pour l’existence d’un
code instantané avec longueurs des mots (lx ). Cependant, toute permutation des (lx )
est encore une famille de longueurs acceptables pour des mots d’un code. Si les lx ne
sont pas constantes et la probabilité sous-jacente sur X n’est pas l’uniforme, parmi ce
deux codes, il y a nécessairement un qui est meilleur que l’autre. Il est donc évident
qu’il ne suffit pas de vérifier l’inégalité de Kraft pour construire un code optimal. Il
faut plutôt minimiser E|C ( X )| = ∑ x∈X p( x )lx sous la contrainte ∑ x∈X A−lx ≤ 1. Nous
utilisons la méthode traditionnelle des multiplicateurs de Lagrange pour trouver la
solution qui sature la contrainte, i.e. impose ∑ x A−lx − 1 = 0 ; nous considérons par
conséquent la fonctionnelle

J (`) = ∑ p ( x ) l x + λ ( ∑ A − l x − 1),
x x

où ` = (lx ) x∈X . En dérivant, nous obtenons

∂J
∀ x, = p( x ) − λA−lx log A = 0,
∂lx
∗ p( x )
équation qui admet comme solution A−lx = λ log A . La saturation de la contrainte per-
met de déterminer la constante λ = 1/ log A et par conséquent, exprimer la solution
sous la forme : lx∗ = − log A p( x ). Si les lx∗ étaient tous des entiers, on pourrait alors
construire un code instantané C ∗ qui aurait une longueur moyenne de E|C ∗ ( X )| =
− ∑ x p( x ) log A p( x ) = H A ( X ). Cependant, les lx∗ ne sont pas nécessairement des en-
tiers. Nous avons donc le

Théorème 8.3.3 ((Shannon [62]).). Pour tout code instantané C : X → A+ , avec A =


cardA, nous avons la minoration

E|C ( X )| ≥ H A ( X ),

avec égalité si, et seulement si, A−|C( x)| = p( x ), ∀ x.

A−|C( x)|
Démonstration. Introduisons un nouveau vecteur de probabilité r ( x ) = sur
∑y A−|C(y)|

/Users/dp/a/ens/[Link] 113
2022-09-08 • 19:58:05.
8.3. Théorème de Shannon sur le codage sans bruit Sources et leur codage

X. Nous aurons
E|C ( X )| − H A ( X ) = ∑ p(x)|C(x)| + ∑ p(x) log A p(x)
x x
= − ∑ p( x ) log A A −|C ( x )|
+ ∑ p( x ) log A p( x )
x x
p( x )
= ∑ p( x ) log A − log(∑ A−|C(y)| )
x r(x) y
1
= D (pkr) + log
∑y A−|C(y)|
≥ 0,
car l’entropie relative D est positive et ∑y A−|C(y)| ≤ 1. Nous aurons égalité si D (pkr) =
0 et ∑y A−|C(y)| = 1.
Théorème 8.3.4. Soit X une variable aléatoire de loi décrite par le vecteur de probabilité p. Il
existe un code instantané C, tel que
H A (p) ≤ E|C ( X )| < H A (p) + 1.
Démonstration. En général, nous ne pouvons pas nous attendre à ce que les valeurs lx∗ =
− log A p( x ) qui minimisent la fonctionnelle d’optimisation J — introduite en début du
paragraphe — soient entières. Cependant, chaque intervalle [− log A p( x ), − log A p( x ) +
1[ contient nécessairement un entier lx . La famille des entiers (lx ) x∈X vérifie l’inégalité

de Kraft car A−lx ≤ A−lx , pour tout x. Par conséquent, il existe un code instantané
C qui admet cette famille comme famille de longueurs de mots du code. De l’enca-
drement lx∗ ≤ lx ≤ lx∗ + 1 découle immédiatement l’inégalité H A (p) ≤ E|C ( X )| <
H A (p) + 1.
Nous avons établi l’inégalité de Kraft pour des codes C ∈ Cinst . Or la classe Cud
est plus grande que C ∈ Cinst . Nous pouvons donc légitimement nous interroger si
en optimisant E|C ( X )| sur la famille des codes uniquement décodables nous pouvons
améliorer la borne de l’entropie. Le théorème suivant répond négativement à cette
question.
Théorème 8.3.5. (McMillan [51]).
1. Tout code C ∈ Cud vérifie ∑ x A−|C( x)| ≤ 1.
2. Réciproquement, pour toute famille d’entiers (lx ) vérifiant l’inégalité de Kraft, il existe
un code C ∈ Cud tel que |C ( x )| = lx , ∀ x.
Démonstration. On utilise le même symbole C pour noter le code primaire et son exten-
sion sur l’alphabet Xk de blocs de taille k.
1. On note
Xkj = {ξ ∈ Xk : |C (ξ )| = j};
Bi1 ,...,ik = {α ∈ A+ : α = α1 · · · αk , |α1 | = i1 , . . . , |αk | = ik }.
Introduisons les symboles L = maxx |C ( x )| et νl = cardX1l . Pour tout k ≥ 1 :
 k
! k ! k
L L kL
∑A −|C ( x )|
= ∑ ∑ A −l 
= ∑ νl A −l
= ∑ Nl A−l ,
x l =1 x ∈X1 l =1 l =k
l

/Users/dp/a/ens/[Link] 114
2022-09-08 • 19:58:05.
Sources et leur codage 8.3. Théorème de Shannon sur le codage sans bruit


Nl = ∑
m ,...,m
νm1 · · · νmk = cardXkl .
1 k
m1 +...+mk =l

L’unique décodabilité du code C implique que pour chaque mot β ∈ Bi1 ,...,ik
avec i1 + . . . + ik = l, il existe au plus un mot ξ ∈ Xkl tel que C (ξ ) = β. Il est
évident par ailleurs que
Bi1 ,...,ik = Al .
[

i1 ,...,ik
i1 +...+ik =l

Ceci entraîne la majoration


 

Nl = cardXkl ≤ card  Bi1 ,...,ik  l l


 [ 
  = cardA = A .
i1 ,...,ik
i1 +...+ik =l

En remplaçant, on conclut que


!k
kL
∑ A−|C(x)| ≤ ∑ Al A−l = kL − k + 1 ≤ kL,
x l =k

ce qui entraîne que ∑ x A−|C( x)| ≤ k1/k L1/k . Cette majoration étant vraie pour
tout k ≥ 1, restera vraie en passant à la limite k → ∞, établissant ainsi l’inégalité
de Kraft pour les longueurs |C ( x )| du code C.
2. Par le théorème 8.3.2, nous savons que si l’inégalité de Kraft est vérifiée pour
une famille d’entiers (lx ), il existe un code instantané C qui admet cette famille
d’entiers comme famille des longueurs. Or tout code instantané est uniquement
décodable.

Définition 8.3.6. 1. Un code C est dit K-optimal pour une classe particulière K ⊂
C si pour tout code C 0 ∈ K on a

E|C ( X )| ≤ E|C 0 ( X )|.

2. Un code C ∈ Cud qui sature la borne de Shannon, i.e. qui vérifie E|C ( X )| =
H A ( X ), est dit absolument optimal.

Remarque 8.3.7. Nous avons vu en §7.2.2 qu’une interprétation de l’entropie est le


nombre moyen de questions à réponse binaire que nous devons poser pour déterminer
la valeur d’une variable aléatoire X. En marquant 0 chaque fois que la réponse est
« non » et 1 chaque fois que la réponse est « oui », lorsque nous parcourons l’arbre de
décision, nous obtenons le code optimal C (cf. l’exemple de la figure 7.3).

En général nous ne pouvons pas espérer qu’un code primaire C : X → A+ soit ab-
solument optimal ; la saturation de la borne de Shannon pourra s’obtenir uniquement
pour des codes étendus sur Xk , lorsque k → ∞. Il est donc utile d’avoir des résultats
permettant d’ordonner de manière abstraite les codes par leur optimalité.

/Users/dp/a/ens/[Link] 115
2022-09-08 • 19:58:05.
8.3. Théorème de Shannon sur le codage sans bruit Sources et leur codage

Lemme 8.3.8. Un code C optimal pour la classe Cinst est optimal pour la classe Cud .
Démonstration. Supposons qu’il existe un code C2 ∈ Cud meilleur que C. Nous au-
rons alors E|C2 ( X )| < E|C ( X )|. Notons l2 ( x ) = |C2 ( x )| pour x ∈ X ; le théorème
de McMillan 8.3.5 implique que les longueurs (l2 ( x )) vérifient l’inégalité de Kraft. Par
le théorème de Kraft 8.3.2, nous savons qu’il existe un code C1 ∈ Cinst qui admet a
|C1 ( x )| = l2 ( x ). Nous avons donc trouvé un code instantané C1 strictement meilleur
que C ce qui contredit l’optimalité de ce dernier.

8.3.3 Algorithme de Huffman pour la construction de codes optimaux


Notons M = cardX et supposons que |A| = 2 ; par conséquent nous pouvons, sans
perte de généralité, identifier X ' {1, . . . , M } et A = {0, 1}. Si C : X → A+ est un
code, nous notons (li )i=1,...,M la famille des longueurs de ses mots. Si p ∈ PV M est un
vecteur de probabilité, nous supposons que l’identification de X avec {1, . . . , M } s’est
faite en imposant : p1 ≥ . . . ≥ p M et que si pi = . . . = pi+s , pour un s ≥ 1, alors
li ≤ . . . ≤ li+s . Avec ces conventions en vigueur, nous avons le
Lemme 8.3.9. Sous les conditions et conventions précédentes, si C est optimal dans Cinst , alors
1. pi > pk ⇒ li ≤ lk ,
2. les deux symboles les moins probables, M − 1 et M, ont de longueurs de code identiques
l M −1 = l M ,
3. parmi tous les mots de code de longueur maximale, l M , il en existe deux dont les l M − 1
premières lettres coïncident (ils diffèrent uniquement par leur dernière lettre).
Démonstration. 1. Si pi > pk et li > lk , on peut construire un code instantané C 0 , en
échangeant i et k : 
 C ( j) si j 6= i, k,
0
C ( j) = C (k ) si j = i,
C (i ) si j = k.

Nous avons alors


E|C 0 ( X )| − E|C ( X )| = pi lk + pk li − pi li − pk lk
= ( pi − pk )(lk − li )
< 0.
Donc C 0 est meilleur que C en contradiction avec l’optimalité supposée de ce
dernier.
2. Nous avons toujours l M−1 ≤ l M car
— si p M−1 > p M alors l M−1 ≤ l M par 1 ;
— si p M−1 = p M alors l M−1 ≤ l M par l’hypothèse de rangement.
Étant donné que le code C est instantané les mots C ( M − 1) et C ( M) corres-
pondent à des feuilles de branches différentes de l’arbre de mots du code. Si
l M−1 < l M , on peut effacer la dernière lettre de C ( M) ; ce nouveau mot de lon-
gueur l M − 1 correspondra encore à un mot de code instantané car ce nouveau
mot sera encore sur une branche différente que C ( M − 1). Par ailleurs, ce nou-
veau code est strictement meilleur que C. Nous pouvons répéter cet argument
jusqu’à ce que nous obtenions un code avec l M−1 = l M , auquel cas nous devons
arrêter cette procédure car si nous enlevons encore une lettre nous obtiendrons
un préfixe de C ( M − 1).

/Users/dp/a/ens/[Link] 116
2022-09-08 • 19:58:05.
Sources et leur codage 8.3. Théorème de Shannon sur le codage sans bruit

3. S’il existe deux mots de code de longueur maximale l M qui ne coïncident pas sur
les l M − 1 premières lettres, nous pouvons effacer la dernière lettre de chacun
d’eux pour obtenir un code qui reste instantané et qui est meilleur que C.

Lemme 8.3.10. Supposons que C : X → A+ est un code instantané, A = {0, 1} et p


un vecteur de probabilité. Nous utilisons les mêmes conventions que celles en vigueur pour le
lemme 8.3.9 quant à l’ordre de X = {1, . . . , M}. Introduire 5 Y ' {1, . . . , M − 2, y M−1,M }
avec un vecteur de probabilité q = ( p1 , . . . , p M−2 , p M−1 + p M ). Supposons que C2 : Y →
A+ est un code instantané optimal. Alors, le code C1 : X → A+ , défini par

 C2 (i ) si i = 1, . . . , M − 2,
C1 (i ) = C (y )0 si i = M − 1,
 2 M−1,M
C2 (y M−1,M )1 si i = M,

est un code optimal.

Démonstration. Supposons qu’au contraire C1 ne soit pas optimal ; il existe donc un


code C10 : X → A+ qui lui est strictement meilleur. Par l’affirmation 2 du lemme 8.3.9,
on a |C10 ( M − 1)| = |C10 ( M )|. Par l’affirmation 3 de ce même lemme, il existe α ∈ A+ et
a, b ∈ A tels que C10 ( M − 1) = αa et C10 ( M) = αb. En recombinant les symboles M − 1
et M en le symbole y M−1,M , on construit un code C20 : Y → A+ par
 0
0 C1 (i ) si i = 1, . . . , M − 2,
C2 (i ) =
α si i = y M−1,M .

Nous avons
M −2
E|C20 ( X )| = ∑ pi |C10 (i )| + ( p M−1 + p M )|α|
i =1
M
= ∑ pi |C10 (i)| − p M−1 |C10 ( M − 1)| − p M |C10 ( M)| + ( p M−1 + p M )(|C10 ( M − 1)| − 1)
i =1
= E|C10 ( X )| − ( p M−1 + p M ), car |C10 ( M − 1)| = |C10 ( M)|,
< E|C1 ( X )| − ( p M−1 + p M ), car C10 est supposé strictement meilleur que C1 ,
= E|C2 ( X )|,

contredisant ainsi l’optimalité de C2 .

Définition 8.3.11. Un arbre enraciné T est un arbre binaire si


— soit T est vide,
— soit T peut être écrit récursivement comme un triplet (r, Tg , Td ), où r est un
nœud (la racine de l’arbre) et Tg et Td sont deux sous arbres (respectivement
gauche et droit).
Une collection d’arbres est appelée une forêt.

Remarque 8.3.12. 1. Soit X un ensemble de symboles. Un symbole x ∈ X peut


être considéré comme l’arbre binaire ponctuel ( x, ∅, ∅). L’ensemble X peut donc
être vu comme une forêt d’arbres ponctuels.
5. L’ensemble Y n’est donc pas nécessairement ordonné selon la convention en vigueur pour X.

/Users/dp/a/ens/[Link] 117
2022-09-08 • 19:58:05.
8.3. Théorème de Shannon sur le codage sans bruit Sources et leur codage

2. Un arbre binaire est dit de type 0 − 2 si chaque sommet de l’arbre a 0 ou 2 des-


cendants. De manière équivalente, un arbre est de type 0 − 2 si dans sa décom-
position récursive (r, Tg , Td ) les deux sous-arbres sont soit tous les deux vides,
soit tous les deux non-vides.
3. Si S = (u, Sg , Sd ) et T = (v, Tg , Td ) sont deux arbres enracinés binaires arbi-
traires, S ◦ V = (z, S, T ) est un nouvel arbre enracine binaire ayant les deux
arbres précédents comme sous-arbres gauche et droit. Il est souligné que z est
un nouveau nœud qui constitue la racine du nouvel arbre.
Lemme 8.3.13. Soient p ∈ PVX et A = {0, 1}. Alors il existe un code C : X → A+
instantané optimal qui vérifie les propriétés 1–3 du lemme 8.3.9.
Nous pouvons maintenant présenter l’algorithme de Huffman [35] de construction
de codes optimaux sous forme de pseudo-code.
Algorithme 8.3.14. Huffman
Require: Vecteur de probabilité p.
Ensure: Forêt F = { T1 , T2 } composée de deux arbres binaires non vides T1 et T2 .
M ← dim p
i←1
F ←∅
repeat
ti ← (i, ∅, ∅)
w ( ti ) ← p (i )
F ← F ∪ { ti }
i ← i+1
until i > M ;
repeat
T1 ← arg mint∈F w(t)
T2 ← arg mint∈F \T1 w(t)
T ← T1 ◦ T2
F ← F \ { T1 , T2 }
F ← F ∪ {T }
w( T ) ← w( T1 ) + w( T2 )
until cardF = 2.

Théorème 8.3.15. Le code de Huffman, consistant à l’attribuer la lettre 0 à tout sous-arbre


gauche et la lettre 1 à tout sous-arbre droit dans l’algorithme précédent, est un code instantané
optimal.
Exemple 8.3.16.

8.3.4 Examen critique du code de Huffman


Le code de Huffman nous fournit un codage pour un alphabet de source X et un
vecteur de probabilité p donnés. Lorsque les probabilités p( x ), pour x ∈ X sont des
puissances négatives de 2, le code de Huffman est optimal (sature la borne d’entropie)
car les nombres − log p( x ) sont des entiers pour tout x ∈ X est déterminent la longueur
des mots de code. En général, les probabilités p( x ) ne sont pas des puissances négatives
de 2 et, dans ce cas, le code de Huffman ne fournit des codes optimaux qu’asymptoti-
quement pour des alphabets étendus Xk en des blocs de taille k grande. Dans ce cas,

/Users/dp/a/ens/[Link] 118
2022-09-08 • 19:58:05.
Sources et leur codage 8.4. Autres types de codes

la taille de la table du code, i.e. du vecteur (C (x))x∈Xk à |X|k composantes, croît expo-
nentiellement avec la taille k des blocs. Or pour pouvoir décoder les messages, et étant
donné que le code de Huffman n’est pas uniquement déterminé par p, la connaissance
de la table du code est nécessaire par le destinataire. Ce qui implique que la table doit
aussi être transmise, ce qui dégrade les qualités du codage de Huffman.
Un autre inconvénient du code est que sa table dépend très fortement du vecteur
p. Si par exemple on veut transmettre du texte bilingue français/anglais, le vecteur de
probabilité variera selon que la portion codée est en français ou en anglais. Or le code
de Huffman n’est pas adapté à cette situation.
Pour pallier ces inconvénients, d’autres codages on été introduits. Les codes arith-
métiques, dont un exemple est présenté en §8.4.1, nécessite toujours la connaissance
du vecteur de probabilité mais cette information est suffisante pour coder et décoder le
message sans qu’une table complète pour des blocs de grande taille soit nécessaire. Les
codes par dictionnaire, dont un exemple est présenté en §8.4.2, ne nécessitent même
pas la connaissance du vecteur de probabilité et sont donc adaptés pour des codages
de textes plurilingues.

8.4 Autres types de codes


8.4.1 Le code arithmétique de Shannon-Fano-Elias
Dans le folklore de la théorie de l’information, le code présenté dans ce paragraphe
porte le nom de code de Shannon, Fano et Elias (FSE). Cependant, selon [55], la pre-
mière trace écrite de ce type de codage se trouve dans le livre [36] 6 . Ce code est un
précurseur du standard JPEG.
Afin de présenter précisément cet algorithme on introduit la
Notation 8.4.1. On note A = |A| (on identifie A = {0, . . . A − 1}) et on définit deux
applications num et seq comme suit :
— L’application num est définie par la formule
l
b
A+ 3 β = b1 · · · bl 7→ num( β) = ∑ Aii ∈ [0, 1[.
i =1

— Pour un x ∈ [0, 1[, on définit seq comme le pseudo-inverse de num par

[0, 1[3 x 7→ seq( x ) = [ β] ∈ AN / ∼,


où deux suites β = b1 · · · bn ( A − 1)( A − 1) · · · et γ = b1 · · · (bn + 1)00 · · · , pour
0 ≤ bn ≤ A − 2, sont équivalentes — et on note β ∼ γ — car num( β) = num(γ).
Pour pallier cet inconvénient, on peut choisir systématiquement comme repré-
sentant de la classe d’équivalence la suite qui se termine par une suite infinie de
zéros.
Par ailleurs, une suite de AN qui se termine par une suite infinie de zéros, sera
identifiée avec une suite de A L où L est sa dernière lettre non nulle.
On considère maintenant un alphabet d’entrée X de cardinal M = cardX ≥ 1 et une
probabilité de génération de lettres déterminée par le vecteur de probabilité p ∈ R+
M

6. L’auteur n’a pas pu accéder à la référence [36].

/Users/dp/a/ens/[Link] 119
2022-09-08 • 19:58:05.
8.4. Autres types de codes Sources et leur codage

(avec ∑ x∈X p( x ) = 1). Le symbole précis qui représente chaque lettre d’entrée ne jouera
aucun rôle ; on identifie donc X avec l’ensemble {0, . . . , M − 1}. Cette identification in-
duit un ordre naturel sur le lettres de l’alphabet. Nous pouvons donc définir la fonction
de répartition d’une variable aléatoire X prenant des valeurs dans X selon la loi décrite
par p :

F ( z ) = P( X ≤ z ) = ∑ p ( y ),
y∈X,y≤ x

F (z−) = P( X < z) = ∑ p ( y ),
y∈X,y< x

pour tout z ∈ R.

Exemple 8.4.2. Soit l’alphabet de la source X = { a, b, c} ' {0, 1, 2} et un symbole


X ∈ X émis avec P( X = x ) = p( x )., avec p(0) = 0.2, p(1) = 0.5 et p(2) = 0.3.

La fonction de répartition pour cet exemple est donnée dans la figure 8.2.

0.8

0.6

0.4

0.2

0
−6 −4 −2 0 2 4 6

Figure 8.2 – Fonction de répartition pour l’exemple 8.4.2.

Derrière cet algorithme se trouvent quelqes idées simples :


— Chaque lettre x ∈ X va être associée, non pas à un mot de A+ mais à un sous-
intervalle Ix de [0, 1[, où Ix = [ F ( x −), F ( x )[= [ F ( x −), F ( x −) + p( x )[, de lon-
gueur p( x ). Le tableau 8.1 indique cette représentation pour l’exemple 8.4.2.
— Par construction les intervalles sont disjoints.

x p( x ) F ( x −) Ix
a'0 0.2 0.0 [0.0, 0.2[
b'1 0.5 0.2 [0.2, 0.7[
c'2 0.3 0.7 [0.7, 1.0[
Table 8.1 – L’association x 7→ Ix , x ∈ X, pour l’exemple 8.4.2.

— Maintenant, si on veut coder un mot de 2 lettres, par exemple ξ = bc, nous


commençons par lire la première lettre b. L’intervalle qui représentera ξ sera
donc un sous-intervalle de Ib = [0.2, 0.7[. Nous devons ensuite subdiviser l’in-
tervalle Ib en sous-intervalles semi-ouverts contigus de Ib qui auront des rap-
ports de longueurs | Ibx |/| Ib | = p( x ), pour x ∈ X. Comme la deuxième lettre est
c, on conclut que | Ibc | = 0.5 × 0.3 = 0.15 et son extrémité gauche sera au point
0.2 + 0.5 × (0.2 + 0.5) = 0.55.

/Users/dp/a/ens/[Link] 120
2022-09-08 • 19:58:05.
Sources et leur codage 8.4. Autres types de codes

— Plus généralement, pour coder un mot ξ = x1 · · · xK ∈ X N , on commence par


déterminer l’intervalle Ix1 = [ g1 , g1 + l1 [, où g1 = F ( x1 −), de longueur l1 =
p( x1 ) et ensuite procéder récursivement en définissant, pour 1 < k ≤ N :
gk = gk−1 + F ( xk −)lk−1
l k = p ( x k ) l k −1
Ix1 ...xk = [ gk , gk + lk [.
On peut même commencer la récurrence ci-dessus à k = 0, en associant l’inter-
valle Iε = [0, 1[ à l’unique mot de longueur 0, à savoir le mot vide.
— Maintenant, on doit transmettre l’information qui permet au récipiendaire du
message de déterminer l’intervalle Iξ . Or, on ne peut pas transmettre un inter-
valle mais une suite finie de bits. Supposons que nous avons déterminé Iξ =
[ g, g + l [. Étant donné qu’il existe un unique Iξ correspondant à un ξ ∈ X N
donné, tout y ∈ Iξ peut servir à représenter Iξ , par exemple y = g + l/2. Cepen-
dant, on ne peut pas transmettre y non plus car, en général il s’agit d’un réel,
représenté par une suite (en principe infinie) β = seq(y) ∈ AN .
— Supposons que nous tronquons la suite β = seq(y) à L digits (L sera déterminé
dans la suite). On dispose alors d’une suite tronquée β̂ = β L ∈ A L dont la va-
leur numérique num( β̂) = ∑kL=1 Aii = ŷ ∈ [0, 1[. On a alors y − ŷ = ∑i≥ L+1 Aii ≤
β β

( A − 1) ∑i≥ L+1 A1i = A1L . En choisissant A1L < 2l , i.e.


L > − log A (l/2) = d− log A (l/2)e,
on est sûr que l’approximation ŷ de y est encore dans l’intervalle Iξ ; elle peut
donc servir à représenter Iξ .
— Il s’ensuit que nous pouvons coder le mot ξ ∈ X N en posant C (ξ ) = β̂ L .
— Il est à souligner que le nombre de bits L := Lξ nécessaire dépend du mot ξ =
x1 · · · x N à travers la dépendance de la longueur l := lξ de l’intervalle Iξ . En
effet, lξ = p( x1 ) · · · p( x N ). Par conséquent Lξ = d− ∑kN=1 log A p( xk ) + log A 2e.
— Le décodage s’effectue en suivant le cheminement logique inverse.
On est alors en mesure de présenter le codage et le décodage SFE sous forme algo-
rithmique.
Algorithme 8.4.3. Codage SFE
Require: Vecteur de probabilité p (donc fonction de répartition F),
mot à coder ξ = x1 · · · x|ξ | ∈ X+ .
Ensure: N longueur du mot ξ et β = C (ξ ) ∈ A+ .
N ← |ξ |
k←0
gk ← 0
lk ← 1
while k < N do
k ← k+1
gk ← gk−1 + F ( xk −)lk−1
l k ← p ( x k ) l k −1
end while
L ← d− log A (l N /2)e
β ← seq( g N + l2N ) L ∈ A L

/Users/dp/a/ens/[Link] 121
2022-09-08 • 19:58:05.
8.4. Autres types de codes Sources et leur codage

Algorithme 8.4.4. Décodage SFE


Require: β̂ qui finit par des 0, N et ρ(⇔ F ).
Ensure: ξ ∈ X N .
k←1
r1 ← num( β̂)
x1 ← arg maxy 1[ F(y−),F(y)[ (r1 )
ξ ← ξxk
while k < N do
k ← k+1
r − F ( x −)
rk ← k−1ρ( x k−) 1
k −1
xk ← arg maxy 1[ F(y−),F(y)[ (rk )
ξ ← ξxk
end while

Théorème 8.4.5. Soit ( Xn )n∈N une suite de variables aléatoires, à valeurs dans un alphabet
X, indépendantes et identiquement distribuées. On note X ( N ) = X1 · · · X N ∈ X N le N-uplet
de N copies indépendantes de la même variable aléatoire X distribuée selon la loi commune et
C : X → A+ le code de Shannon-Fano-Elias (et son extension sur X+ ). Alors

log A 2 E|C ( X ( N ) )| 1 + log A 2


HA (X ) + ≤ ≤ HA (X ) + .
N N N
Démonstration. On a vu que L X ( N ) = d− ∑kN=1 log A p( Xk ) + log A 2e, par conséquent

N log A 2 N
− ∑ log A p( xk ) +
N
≤ |C ( X ( N ) )| = L X ( N ) ≤ − ∑ log A p( xk ) + log A 2 + 1.
k =1 k =1

En multipliant tous le membres de l’inégalité par ∏nn=1 p( xn ) et en intégrant sur les


mots, on obtient

H A ( X1 , . . . , X N ) + log A 2 ≤ E|C ( X ( N ) )| ≤ H A ( X1 , . . . , X N ) + log A 2 + 1.

On conclut par l’additivité H A ( X1 , . . . , X N ) = NH A ( X ) de l’entropie dans le cas indé-


pendant.
Une généralisation de cet algorithme qui consiste à utiliser deux ordres différents
pour indexer les lettres de l’alphabet est utilisée dans [37] pour proposer un algorithme
de cryptage.

8.4.2 Codage universel et algorithme de Lempel-Ziv


Les défauts des codages précédents sont corrigés par le codage de Lempel et Ziv
[74, 73] et ses variantes ultérieures. Nous présentons l’algorithme connu sous l’acro-
nyme LZ78 qui est largement utilisé en informatique, par exemple par l’utilitaire gzip
en système d’exploitation linux/unix.
L’algorithme effectue un premier passage sur le texte à coder et construit un dic-
tionnaire. Le premier mot du dictionnaire est le mot vide et ensuite des bouts de mots
sont ajoutés dans le dictionnaire chaque fois qu’un nouveau mot est rencontré dans
l’analyse du texte. Le deuxième passage se fait après la construction de la totalité du

/Users/dp/a/ens/[Link] 122
2022-09-08 • 19:58:05.
Sources et leur codage 8.4. Autres types de codes

dictionnaire pour déterminer sa taille. Avant de présenter l’algorithme commençons


par un exemple commenté. Supposons que nous voulons coder le mot ξ ∈ X+ , ou
X = {0, 1} et ξ = 1011010100010, de longueur L = |ξ | = 13. Le dictionnaire en posi-
tion 0 contient toujours le mot vide, noté ε. En analysant α, nous rencontrons comme
premier sous-mot, non encore contenu dans le dictionnaire la lettre 1, identifiée avec
le mot ε1. Nous codons ce mot en indiquant le couple (adr, suffixe), où suffixe est
la lettre que nous devons ajouter comme suffixe au mot qui se trouve en position adr
dans le dictionnaire ; en l’occurrence, nous codons (0, 1), signifiant « ajouter au mot en
position 0 dans le dictionnaire le suffixe 1. Ainsi le dictionnaire contient maintenant le
mot ε en position 0 et le mot 1 en position 1. Ensuite dans l’analyse de ξ nous rencon-
trons la lettre 0 qui est identifiée au mot ε0. Le dictionnaire contiendra alors en position
2 le mot 0, codé (0, 0). Ceci signifie que le mot est obtenu en ajoutant comme suffixe au
mot en position 0 la lettre 0, etc. En continuant ainsi l’analyse de ξ, nous remplissons
les dictionnaire comme indiqué sur la table 8.2.

adr mot code


0 ε
1 1 (0,1)
2 0 (0,1)
3 11 (1,1)
4 01 (2, 1)
5 010 (4, 0)
6 00 (2, 0
7 10 (1,0)

Table 8.2 – La construction du dictionnaire selon LZ78 ; elle correspond à l’analyse du mot ξ =
·0 · 1 · 11 · 01 · 010 · 00 · 10 ; le symbole · sert à visualiser les positions de césure. Le dictionnaire
contient 8 entrées —numérotées de 0 à 7 — nécessitant donc 3 bits pour être codées. Le code
brut correspondant à ξ est C (ξ ) = (0, 1)(0, 0)(1, 1)(2, 1)(4, 1)(2, 0)(1, 0). En codant la position
de chaque préfixe dans le dictionnaire par un mot de 3 bits, on obtient pour le code final C (ξ ) =
000100000010101100101000010 de longueur |C (ξ )| = 28 bits.

La structure de données du dictionnaire D sera donc une liste ordonnée. Si L =


( L1 , . . . , L N ) est une liste ordonnée d’objets Li ∈ B, pour i = 1, . . . , N et B un certain
ensemble, nous définissons l’opération « annexer en dernière position » ADP définie
par ADP( L, β) := ( L1 , . . . , L N , β) pour β ∈ B. Nous pouvons maintenant donner la
définition précise de l’algorithme.

/Users/dp/a/ens/[Link] 123
2022-09-08 • 19:58:05.
8.4. Autres types de codes Sources et leur codage

Algorithme 8.4.6. LZ78


Require: Mot α ∈ A+ , fonctions ADP et adr .
Ensure: Dictionnaire D (i.e. liste ordonnée de mots de A+ ) et code C (α) (i.e. liste or-
donnée de couples (adr, suf)).
β←ε
D ← (ε)
C ← ()
K ← |α|
k←1
drapeau_fin ← 0
while k ≤ K et drapeau_fin = 0 do
a ← αk
if βa ∈ D then
if k = K then
C ← ADP(C, (adr( βk−1 ), a))
drapeau_fin ← 1
else
β ← βa
end if
else
D ← ADP( D, βa)
C ← ADP(C, (adr( β), a))
β←ε
end if
k ← k+1
end while

On peut remarquer que le code LZ78 en aucun moment ne fait appel explicitement
au vecteur de probabilité de l’alphabet. Par ailleurs, il semble que pour le mot court de
l’exemple ci-dessus, on a |C (ξ )| > |ξ |, i.e. un code qui est plus plus long que le mot sur
lequel il s’applique. Il est cependant remarquable que l’on peut montrer le

Théorème 8.4.7. Soit ( Xn )n∈N une suite de variables aléatoire indépendantes et identique-
ment distribuées à valeurs dans X. Pour tout n ∈ N, on note X := X(n) = ( X1 X2 · · · Xn ) ∈
Xn . On a alors, en désignant par C le code LZ78,

|C (X(n) )|
lim = H ( X1 ) .
n→∞ n
De manière encore plus remarquable, on peut étendre ce résultat à des suites de
variables aléatoires stationnaires (cf. définition 5.5.1).

Exemple 8.4.8. La notion de processus stationnaire a été introduite dans la définition


5.5.1. Il s’ensuit qu’une suite ( Xn )n∈N de variables aléatoires sur un espace de pro-
babilité (Ω, F , P) à valeurs dans (X, X ) est stationnaire si, pour tout k ∈ N, les lois
conjointes P( Xn ∈ B0 , . . . Xn+k ∈ Bk ), pour B0 , . . . , Bk ∈ X , ne dépendent pas de n. Les
suites stationnaires généralisent les suites i.i.d.
1. Toute suite i.i.d. est stationnaire. Il existe cependant des suites stationnaires qui
ne sont pas i.i.d. comme le montrent les cas ci-dessous.

/Users/dp/a/ens/[Link] 124
2022-09-08 • 19:58:05.
Sources et leur codage 8.4. Autres types de codes

2. Soient (ξ n )n∈N une suite variables aléatoires réelles i.i.d. intégrables et (αn )n∈N
une suite réelle sommable. La suite ( Xn )n∈N définie, pour tout n ∈ N, par Xn =
∑∞m=0 αm ξ n+m est stationnaire.
3. Soit ( Xn )n∈N une chaîne de Markov (X, P, π ), où π est la probabilité invariante
de la chaîne. Alors ( Xn )n∈N est stationnaire.

Définition 8.4.9. Soit X = ( Xn )n∈N une suite aléatoire arbitraire.


1. Le taux de croissance de l’entropie conjointe (ou entropie spécifique ou taux
de production d’entropie) de X est

H ( X1 , . . . , X n )
h(X) = lim (lorsque cette limite existe).
n→∞ n
2. Le taux de production d’entropie conditionnelle est

ĥ(X) = lim H ( Xn | Xn−1 · · · X1 ) (lorsque cette limite existe).


n→∞

Exemple 8.4.10. 1. Entropie produite par un « singe dactylographe » : Soit X un


alphabet arbitraire fini. Si on tape au hasard sur une machine à écrire à alphabet
X, on produit un texte X := X1 X2 X3 · · · avec ( Xk ) suite i.i.d. uniformément
distribuée sur X, alors h(X) = H ( X1 ) = log |X|.
2. Si on assouplit la condition d’identique distribution, il n’est plus garanti que la
limite existe.

Théorème 8.4.11. Soient X = ( Xk )k∈N une suite stationnaire sur un alphabet fini et ĥn (X) =
H ( Xn | Xn−1 · · · X1 ). Alors la suite (ĥ(X))n est décroissante et possède une limite ĥ(X).

Démonstration. Cf. exercice 96.

Théorème 8.4.12. Soit X = ( Xk )k∈N une suite stationnaire sur un alphabet fini. Alors les
limites h(X) et ĥ(X) existent et
h(X) = ĥ(X).

Démonstration. Cf. exercice 97.

On peut aussi montrer le

Théorème 8.4.13. Soit X := ( Xn )n∈N une chaîne de Markov (X, P, π ), où π est la probabi-
lité invariante de la chaîne. Alors, si C désigne le code LZ78,

|C ( X1 · · · Xn )|
lim = ĥ(X).
n→∞ n

La démonstration (voir [7, pp. 184–189] par exemple) de ce théorème est en dehors
des exigences de ce cours. On peut même démontrer un résultat analogue pour toute
suite stationnaire ergodique — pas nécessairement une chaîne de Markov possédant
une probabilité invariante — (voir [17, pp. 319–326]). Ce résultat s’inscrit dans le cadre
plus général de la relation entre la complexité de Kolmogorov — notion que sera ef-
fleurée dans le cours de Complexité [58] — et l’entropie.

/Users/dp/a/ens/[Link]
125
2022-09-06 • 15:56:48.
8.5. Exercices Sources et leur codage

8.5 Exercices
Codes instantanés, codes uniquement décodables
87. Soit C : {a, b} → {0, 1}∗ le code défini par
x C(x)
a 1
b 101
(a) Le code C est-il instantané ?
(b) Est-il uniquement décodable ?
88. Déterminer si les codes suivants — définis sur des ensembles à 7 ou 8 éléments
selon le cas — sont instantanés ; sinon sont-ils uniquement décodables.
x1 abc 0101 00 00
x2 abcd 0001 112 11
x3 e 0110 0110 0101
x4 dba 1100 0112 111
x5 bace 00011 100 1010
x6 ceac 00110 201 100100
x7 ceab 11110 212 0110
x8 eabd 101011 22
89. Soient X un ensemble de cardinal M = 4 et p = (1/2, 1/4, 1/8, 1/8) un vecteur
de probabilité sur X. On considère les quatre codes Ck , k = 1, . . . , 4, définis ci-
dessous.
X C1 ( X ) C2 ( X ) C3 ( X ) C4 ( X )
a 0 00 0 0
b 10 01 1 01
c 110 10 00 011
d 111 11 11 111
(a) Calculer H (p).
(b) Pour k = 1, . . . , 4, calculer E|Ck ( X )| et comparer avec H (p).
(c) Pour k = 1, . . . , 4, déterminer si Ck est un code instantané et sinon s’il est
uniquement décodable.

Codes de Huffman
90. Soient X un ensemble de cardinal M et p un vecteur de probabilité sur X. Calcu-
ler un code de Huffman et comparer l’espérance de sa longueur avec l’entropie
dans les cas suivants :
(a) M = 5 et p = (0.25, 0.25, 0.2, 0.15, 0.15).
(b) M = 6 et p = (0.3, 0.25, 0.2, 0.1, 0.1, 0.05).
91. Soient X = {0, 1}, p = (0.9, 0.1) et p0 = (0.6, 0.4) deux vecteurs de probabilité et
K un entier strictement positif. On note X K = ( X1 , . . . , XK ), où ( Xi )i=1,...,K sont
des copies indépendantes de la même variable aléatoire sur X.
(a) Calculer H ( X K ) lorsque X1 est distribuée selon p et selon p0 .
(b) Calculer un code de Huffman C pour K = 2, . . . , 4 dans les deux cas p et p0 .

/Users/dp/a/ens/[Link]
126
2022-09-06 • 15:56:48.
Sources et leur codage 8.5. Exercices

(c) Calculer Ep |C ( X K )| et Ep0 |C ( X K )| pour K = 2, . . . , 4.


92. Déterminer un vecteur de probabilité p sur X = {a, b, c, d} qui donne lieu à
deux codes de Huffman différents. Pour chacun de ces codes calculer l’espé-
rance de sa longueur et comparer la avec H (p).

Compléments sur les codes


93. Soient X une variable aléatoire à valeurs dans X = {a,b,c,d} distribuée selon
une loi décrite par le vecteur de probabilité p = (1/2, 1/4, 1/8, 1/8) et C : X →
A+ , avec A = {0, 1}, un code de Huffman. On note avec le même symbole — C
— l’extension du code sur X+ et on considère un mot ξ ∈ X+ de longueur L =
|ξ |. On désigne par α = C (ξ ) ∈ A+ la suite codant ξ. Quelle est la probabilité
qu’un bit au hasard de cette suite prenne la valeur 1 lorsque L → ∞ ?
94. Construire le dictionnaire de chaînes-préfixes du codage du mot

α = the fat cat sat on the mat.

par l’algorithme de Lempel-Ziv 78.


95. Coder et décoder selon LZ78 le mot

β = 00121212102101210122101

96. Soit X = ( Xn )n∈N une suite stationnaire sur un ensemble fini.


(a) Montrer que pour tout n ≥ 1, on a : H ( Xn+1 | Xn · · · X1 ) ≤ H ( Xn+1 | Xn · · · X2 ).
(b) Conclure que limn→∞ H ( Xn | Xn−1 · · · X1 ) existe.
97. Soit X = ( Xn )n∈N une suite stationnaire sur un ensemble fini.
(a) Vérifier que
1 1 n
H ( X1 · · · X n ) = ∑ H ( X k | X k − 1 · · · X1 ) .
n n k =1
(b) Utiliser le résultat obtenu en exercice 96 pour conclure.

/Users/dp/a/ens/[Link] 127
2022-09-08 • 19:58:05.
8.5. Exercices Sources et leur codage

/Users/dp/a/ens/[Link] 128
2022-12-05 • 10:56:42.
Canaux bruités sans mémoire
9
La notion de canal est très générale. Initialement elle a été introduite pour signifier
la transmission d’un signal codant de l’information à travers un milieu et décrire les
altérations que subit l’information à cause du bruit. Cependant, on parle aujourd’hui
de canal pour modéliser une transformation arbitraire que subit un mot codé dans un
alphabet fini. Les codes que nous avons vus au chapitre précédent sont des cas par-
ticuliers des canaux. Ce qui va nous intéresser dans ce chapitre n’est pas de coder
efficacement la source mais de décrire précisément l’action du canal, c’est-à-dire les
perturbations dues au bruit.

9.1 Modélisation markovienne


On suppose que le canal reçoit en entrée un mot aléatoire X ∈ X+ , où X est un al-
phabet fini et transmet en sortie un mot aléatoire Y ∈ Y+ . La probabilité conditionnelle
P(Y = y|x = x) est appelée probabilité de transmission du canal. Dans la suite, nous
supposons que les entrées et les sorties ont la même longueur, i.e. |x| = |y| et que les
symboles qui arrivent en entrée sont émis selon une source indépendante. Cette hypo-
thèse d’indépendance peut être relaxée au prix d’une complication dans les formules
et dans la modélisation de la source.

Définition 9.1.1. Soit ( pn )n∈N une suite d’applications, définies pour tout n ∈ N, par

Xn × Yn 3 (x, y) → pn (x, y) := P(Y = y|x = x) ∈ [0, 1].

1. La triplet (X, Y, ( pn )n∈N ) est appelé canal discret.


2. Le canal est dit sans mémoire, s’il existe une matrice stochastique P : X × Y →
[0, 1] telle que pour tout n ∈ N et tous x ∈ Xn et y ∈ Yn , la probabilité condition-
nelle s’écrit pn (x, y) = ∏in=1 P( x, y). Un canal sans mémoire sera alors identifié
avec le triplet (X, Y, P), où P est une matrice stochastique |X| × |Y|.

Dorénavant, nous ne considérons que de canaux sans mémoire.

129
9.2. Classification des canaux Canaux bruités sans mémoire
 
1 − e0 e0
Exemple 9.1.2. Considérer le canal avec X = Y = {0, 1} et P = e1 1 − e1 , avec
e0 , e1 ∈ [0, 1]. Il s’agit d’un canal discret sans mémoire. On calcule
P(Y = 110|X = 010) = P(0, 1) P(1, 1) P(0, 0) = e0 (1 − e1 )(1 − e0 ).
Si e0 = e1 = 0 ce canal est parfait car P = I. Dans un certain sens, qui sera précisé
en §9.2 mais qui est intuitivement clair, le cas avec e0 = e1 = 1 correspond aussi à un
canal parfait, tandis que le cas e0 = e1 = 1/2 à un canal inutile.
Remarque 9.1.3. La notion de canal est une notion très générale. Nous avons étudié
en chapitre 8 le codage de la source. Si X = { a, b, c, d} et A = {0, 1}, nous avons
vu que C : X → A+ avec C ( a) = 0, C (b) = 10, C (c) = 110 et C (d) = 111 est
un code instantané. Ce code peut aussi être vu comme un canal avec Y = C (X) =
{0, 10, 110, 111} et P une matrice stochastique déterministe, correspondant à un canal
parfait. Plus généralement toute fonction f : X → Y est équivalente à une matrice
stochastique déterministe |X| × |Y|, notée K f , dont les éléments de matrice sont définis
par
X × Y 3 ( x, y) 7→ K f ( x, y) = δ f ( x) (y).
C’est-à-dire une fonction f : X → Y est le canal (X, Y, K f ).
Nous avons établi en chapitre 7 les propriétés de l’entropie et les relations entre
entropie conjointe, entropie conditionnelle et information mutuelle. Rappelons aussi
que si la loi (le vecteur de probabilité) de la source µ ∈ PVX et la matrice stochastique
P du canal sont données, nous pouvons calculer
— l’entropie de la source H ( X ),
— la loi conjointe κ ( x, y) = P( X = x, Y = y) = µ( x ) P( x, y) (et par conséquent
l’entropie conjointe H ( X, Y )),
— la loi de sortie ν(y) = ∑ x∈X κ ( x, y) = ∑ x∈X µ( x ) P( x, y) (et par conséquent l’en-
tropie de la sortie H (Y )),
— les entropies conditionnelles H ( X |Y ) et H (Y | X ) et l’information mutuelle I ( X :
Y ).
La figure 9.1 rappelle schématiquement les relations qui existent entre ces différentes
quantités. Il va de soi que toutes ces quantités sont fonctions du couple (µ, P). Ceci
nous amène, lorsque la loi de l’entrée est fixée, à une notation plus précise du canal.
Notation 9.1.4. Un canal discret sans mémoire est le quadruplet (X, µ, Y, P), où X, Y
sont les alphabets d’entrée er de sortie, µ la loi de l’entrée et P la matrice de trans-
mission. On garde cependant la notation sous forme de triplet (X, Y, P) lorsque nous
ne voulons pas préciser d’emblée la loi d’entrée (par exemple lorsque nous voulons
étudier le comportement du canal pour une famille de lois d’entrée (cf. définition de
capacité 9.3.1 plus loin).

9.2 Classification des canaux


9.2.1 Canaux sans perte
Les canaux sans perte sont les canaux caractérisés par la propriété H ( X |Y ) = 0 ;
cette propriété signifie que si nous connaissons la sortie, il ne reste plus aucune incerti-
tude quant à la valeur en entrée, autrement dit, l’entrée est totalement déterminée par

/Users/dp/a/ens/[Link] 130
2022-12-05 • 10:56:42.
Canaux bruités sans mémoire 9.2. Classification des canaux

H ( X, Y )

H (X)

H (Y )

H ( X |Y ) I (X : Y) H (Y | X )

Figure 9.1 – Représentation schématique des valeurs de différentes entropies. Toutes ces quantités
sont fonctions de la loi de la source µ et de la matrice stochastique P du canal.

la sortie. De manière équivalente, I ( X : Y ) = H ( X ) − H ( X |Y ) = H ( X ), c’est-à-dire


que l’information mutuelle entre l’entrée et la sortie coïncide avec toute l’information
de l’entrée.
Il est instructif de visualiser un tel canal. Supposons que cardX = M (par consé-
quent X ' { x1 , . . . , x M }) et que Y soit partitionné en M parties ( Bi )i=1,...,N non-vides
(i.e. Y = tiM=1 Bi ). Le canal est décrit par une matrice stochastique ( P ( x, y )) x ∈X,y∈Y telle
que, pour tout i ∈ {1, . . . , M} on ait

P(Y ∈ Bi | X = xi ) = ∑ P( xi , y) = P( xi , Bi ) = 1.
y∈ Bi

Mais alors, en notant µ la loi de la source,

P( X = xi ; Y ∈ Bi ) = µ( xi );
µ ( xi ) µ ( xi )
P( X = xi |Y ∈ Bi ) = =
P(Y ∈ Bi ) ∑ j P(Y ∈ Bi | X j = x j )P( X = x j )
µ ( xi ) µ ( xi )
= = = 1.
∑ j δi,j µ( x j ) µ ( xi )

9.2.2 Canaux déterministes


Les canaux déterministes sont les canaux dont la matrice stochastique P est déter-
ministe, i.e. dans chaque ligne il existe un unique élément égal à 1 (∀ x ∈ X, ∃!y := y x ∈
Y, P( x, y x ) = 1) tandis que tous les autres éléments de matrice sont nuls. Si µ est la loi
d’entrée, on calcule la loi conjointe d’entrée-sortie

X × Y 3 ( x, y) 7→ κ ( x, y) = µ( x ) P( x, y) = µ( x )1{yx } (y).

Un calcul élémentaire donne H ( X, Y ) = H (κ ) = H ( X ) et par conséquent H (Y | X ) =


H ( X, Y ) − H ( X ) = 0 et I ( X : Y ) = H (Y ) − H (Y | X ) = H (Y ).

Exemple 9.2.1. Supposons que nous disposions d’un jeu de 52 cartes. Soit X ∈ X =
{1, . . . , 10, J, Q, K} × {♥, ♦, ♠, ♣} le vecteur aléatoire du couple (valeur, enseigne) d’une
carte tirée au hasard et Y ∈ Y = {♥, ♦, ♠, ♣} la variable aléatoire « enseigne » de la
carte qui est transmise. Si la loi de X est la loi uniforme sur X, alors I ( X : Y ) = H (Y ) =
log 4 = 2.

/Users/dp/a/ens/[Link] 131
2022-12-05 • 10:56:42.
9.2. Classification des canaux Canaux bruités sans mémoire

9.2.3 Canaux sans bruit


Un canal sans bruit est un canal qui est à la fois sans perte (H ( X |Y ) = 0, i.e. l’entrée
est déterminée par la sortie) et déterministe (H (Y | X ) = 0, i.e. la sortie est déterminée
par l’entrée). Par conséquent, I ( X : Y ) = H ( X ) = H (Y ).

9.2.4 Canaux inutiles


Un canal inutile est un canal qui, pour toute loi d’entrée µ ∈ M1 (X), vérifie I ( X :
Y ) = 0. On a alors

0 = I ( X : Y ) = H ( X ) − H ( X |Y ) = 0 ⇒ H ( X ) = H ( X |Y ) ,

c’est-à-dire que les variables X et Y d’entrée-sortie sont indépendantes ou, dit autre-
ment, l’observation de la sortie ne nous apprend rien sur l’entrée. Une autre manifes-
tation de l’indépendance de variables X et Y est que toutes les lignes de la matrice
stochastique P sont égales entre elles (et bien-sûr correspondent à un vecteur de pro-
babilité sur Y).

9.2.5 Canaux symétriques


Définition 9.2.2. Soient Sn le groupe des permutations sur n objets et (X, Y, P) un
canal sans mémoire. Supposons qu’il existe un vecteur de probabilité p ∈ M1 (Y) et
un vecteur dans z ∈ [0, 1]|X| , tels que
1. ∀ x ∈ X, ∃σx ∈ S|Y| : ∀y ∈ Y, P( x, y) = p(σx y) et
2. ∀y ∈ X, ∃σy ∈ S|X| : ∀ x ∈ X, P( x, y) = z(σy x ).
Alors le canal est dit canal symétrique.
Exemple 9.2.3. Les canaux (entre les espaces d’entrée et sortie idoines) dont les ma-
trices de transmission sont
1 1 1
1 1 1 1
2 3 6
P1 = 13 31 61 16 et P2 =  16 12 13 
6 6 3 3 1 1 1
3 6 2

sont des canaux symétriques. Effectivement, dans les deux cas, chaque ligne est la per-
mutation d’un même vecteur de probabilité et chaque colonne la permutation d’un
même vecteur de [0, 1]|X| .
Calculons l’entropie conditionnelle :

H (Y | X ) = ∑ µ ( x ) H (Y | X = x )
x ∈X
=− ∑ µ( x ) ∑ P(Y = y|X = x) log P(Y = y|X = x)
x ∈X y ∈Y

=− ∑ µ( x ) ∑ P( x, y) log P( x, y)
x ∈X y ∈Y

=− ∑ µ( x ) ∑ p(σx y) log p(σx y)


x ∈X y ∈Y
= H ( p ).

/Users/dp/a/ens/[Link] 132
2022-12-05 • 10:56:42.
Canaux bruités sans mémoire 9.3. Capacité du canal, propriétés de la capacité

On constate donc que l’entropie conditionnelle dépend uniquement des caractéris-


tiques du canal (à travers le vecteur de probabilité p) et elle est indépendante de la
loi d’entrée µ. L’information mutuelle sera donnée par I ( X : Y ) = H (Y ) − H (Y | X ) =
H (Y ) − H (p) et il est facile de voir que
cap( P) := sup I ( X : Y ) = log cardX − H (p).
µ∈M1 (X)

En particulier pour un canal symétrique binaire, cap( P) = supµ∈M1 (X) I ( X : Y ) =


1 − H (p) s’annule pour p = (1/2, 1/2) signifiant que — dans ce cas — le canal binaire
est alors inutile.

9.3 Capacité du canal, propriétés de la capacité


Définition 9.3.1. Pour un canal fixé (i.e. une matrice de transmission fixée P), on ap-
pelle capacité la quantité
cap := cap( P) = sup I ( X : Y ).
µ∈M1 (X)

Remarque 9.3.2. La signification de la définition 9.3.1 n’est pas encore très claire. Elle
le deviendra dans le §9.5. Signalons pour l’instant les deux résultats qui seront montrés
dans la suite :
1. il est possible de transmettre de l’information avec un taux d’erreur arbitraire-
ment petit à tout taux de transmission R (cf. définition 9.5.2) R < cap,
2. dès que le taux de transmission R dépasse la capacité cap, la transmission n’est
plus fiable.
Ceci signifie que chaque canal se comporte comme un « tuyau » à travers lequel on
peut faire passer un débit maximal de fluide.
Proposition 9.3.3. Soient un canal sans bruit (X, Y, P) et cap sa capacité.
1. cap ≥ 0.
2. cap ≤ log cardX.
3. cap ≤ log cardY.
Démonstration. 1. Comme I ( X : Y ) ≥ 0 (cf. remarque 7.5.8), la positivité de cap en
découle immédiatement.
2. On a
cap = sup I (X : Y) = sup ( H ( X ) − H ( X |Y )) ≤ sup H ( X ) ≤ log cardX.
µ∈M1 (X) µ∈M1 (X) µ∈M1 (X)

3. On a
cap = sup I (X : Y) = sup ( H (Y ) − H (Y | X )) ≤ sup H (Y ) ≤ log cardY.
µ∈M1 (X) µ∈M1 (X) µ∈M1 (X)

Le calcul de la capacité du canal est un problème difficile. Une formule fermée


pour cap peut être trouvée uniquement dans quelques cas simples, comme les canaux
symétriques, mais nous ne connaissons de formule dans le cas général.

/Users/dp/a/ens/[Link] 133
2022-12-05 • 10:56:42.
9.4. Un exemple illustratif simple Canaux bruités sans mémoire

9.4 Un exemple illustratif simple


Exemple 9.4.1. Soit un canal (X, Y, P) avec X = { x1 , x2 , x3 }, Y = {y1 , y2 , y3 } et
 
0.5 0.3 0.2
Pxy := P(Y = y| X = x ) = 0.2 0.3 0.5 .
0.3 0.3 0.4
On doit fixer une règle de décision raisonnable ∆ : Y → X permettant de deviner
le symbole émis x ∈ X lorsque y ∈ Y est reçu. Cette décision dépend évidemment de
P mais aussi de la probabilité d’émission µ des symboles de la source. Supposons que
cette dernière est la probabilité uniforme. Il paraît plausible qu’il faille définir y1 7→ x1
et y3 7→ x2 mais quelle est la valeur plausible pour y2 ? Toutes le valeurs de x semblent
plausibles. Si le canal était plus compliqué aurait-on une manière systématique pour
définir la règle de décision ∆ ?
Définition 9.4.2. La règle de décision
∆(y) ∈ arg max P( X = z|Y = y), y ∈ Y
z ∈X

s’appelle règle du maximum de vraisemblance.


Remarquons qu’en général, P( X = z|Y = y) 6= Pzy ! Pour calculer cette probabilité
conditionnelle, nous devons utiliser la formule de Bayes :

t P( X = z, Y = y) µ(z) Pzy
P̂zy = P̂yz = P( X = z|Y = y) = = .
P (Y = y ) ∑w∈X µ(w) Pwy
Si µ est la loi uniforme sur X, cette formule se réduit à

t Pzy
P̂zy = P̂yz = P( X = z|Y = y) = .
∑w∈X Pwy
Dans l’exemple ci-dessus (avec probabilité uniforme pour la source), elle devient donc
 
0.5 0.33333 . . . 0.181818 . . .
P̂t = 0.2 0.33333 . . . 0.454545 . . . .
0.3 0.33333 . . . 0.363636 . . .
On constate que la solution au problème de maximisation de vraisemblance est
y arg maxz∈X P̂zy
y1 { x1 }
y2 { x1 , x2 , x3 }
y3 { x2 }
Tout élément x ∗ dans l’ensemble arg maxz∈X P( X = z|Y = y), pour y ∈ Y, peut
servir à définir ∆(y) := ∆MV (y) = x ∗ .
D’autres règles de décision sont possibles. Par exemple si X = {0, 1} ' {000, 111}
et Y = {0, 1}3 , on peut définir, pour tout y = (y1 , y2 , y3 ) ∈ Y, la règle de la majorité,
donnée par la formule
(
000 si y1 + y2 + y3 ≤ 1,
∆(y) := ∆Maj (y) =
111 si y1 + y2 + y3 > 1,

/Users/dp/a/ens/[Link] 134
2022-12-05 • 10:56:42.
Canaux bruités sans mémoire 9.5. Le théorème fondamental de la transmission

où y = y1 y2 y3 . On peut même définir des règles de décision stochastiques, i.e. décrites


par des noyaux stochastiques non-déterministes K∆ : Y × X → [0, 1], signifiant qu’à
chaque symbole y ∈ Y reçu, on assigne un symbole x ∈ X avec probabilité K∆ (y, x ).
Dans l’exemple 9.4.1, on peut définir une règle de décision stochastique décrite par le
noyau stochastique  
1 0 0
K∆ := 1/3 1/3 1/3 .
0 1 0
Mais ceci n’est pas le seul choix. Tout noyau stochastique K∆ : Y × X → [0, 1] correspon-
drait à une règle de décision pas nécessairement plausible mais acceptable du point
de vue de la théorie. Noter aussi que les règles de décision du maximum de vrai-
semblance et de la majorité (ainsi que toute autre règle de décision décrite par une
fonction ∆ : Y → X) sont aussi décrites par des noyaux stochastiques déterministes
K∆ : Y × X → {0, 1}, définis par K∆ (y, x ) = 1{∆(y)} ( x ).
On arrive ainsi à la définition suivante :
Définition 9.4.3. Une règle de décision est un noyau stochastique
K∆ : Y × X → [0, 1]
qui assigne à tout symbole y ∈ Y reçu par le canal, un symbole émis x ∈ X avec
probabilité K∆ (y, x ).

9.5 Le théorème fondamental de la transmission


9.5.1 Codage du canal bruité
Nous disposons d’un canal sans mémoire (X, Y, P) à travers lequel allons trans-
mettre des mots de longueur fixe n. Nous avons deux méthodes équivalents pour dé-
crire le processus de transmission :
— soit avec le canal (X, Y, P) et considérer la transmission des vecteurs aléatoires
X = X1 · · · Xn ∈ Xn vers des vecteurs aléatoires Y = Y1 · · · Yn ∈ Yn selon la
matrice de transmission P, c’est-à-dire (cf. exemple 9.1.2)
n
P( Y = y | X = x ) = ∏ P(xi , yi ) =: Qn (x, y),
i =1

— soit étendre le canal en (Xn , Yn , Qn ), où Qn est la matrice de transmission entre


Xn et Yn définie dans la ligne précédente, et considérer la transmission des va-
riables aléatoires X ∈ Xn vers des variables aléatoires Y ∈ Yn , selon la matrice de
transmission Qn , c’est-à-dire
P(Y = y|X = x) =: Qn (x, y),
Le choix de l’une ou l’autre approche est une pure question de commodité d’écriture.
Cependant, les ensembles (de mots) Xn et Yn qui apparaissent dans la description
précédente, ne sont pas les objets qui nous intéressent réellement ; nous sommes plutôt
intéressés à un ensemble fini de messages M qui sont codés en des mots de Xn et aux
messages de M qui sont obtenus en décodant les mots de Yn . Plus précisément nous
disposons des ensembles finis M, Xn et Yn et de deux applications

/Users/dp/a/ens/[Link] 135
2022-12-05 • 10:56:42.
9.5. Le théorème fondamental de la transmission Canaux bruités sans mémoire

— une de codage M 3 m 7→ C(m) ∈ Xn et


— une de décodage 1 — supposée déterministe dans ce paragraphe (cf. exercice
102 pour un exemple de décodage stochastique) — Yn 3 y 7→ ∆(y) ∈ M.
La figure 9.2 résume schématiquement ces actions prises séparément tandis que la fi-
gure 9.3 schématise la séquence de ces actions.

M codage Xn Yn décodage M

m C(m) y ∆(y)

Xn canal Yn

y (1)

x ..
.

y( L)
Qn (x, y(i) )

Figure 9.2 – Résumé des actions de codage, transmission et décodage, considérées séparément.

Notez que l’action du canal transforme toute entrée x ∈ Xn en une variable aléatoire
Y ∈ Xn de loi conditionnelle (à l’entrée) Qn (x, ·), i.e. pour tout A ⊂ Yn , P(Y ∈ A|X =
x) = ∑y∈ A Qn (x, y).

M codage Xn canal Yn décodage M

y (1) ∆ ( y (1) )

m C(m) .. ..
. .

y( L) ∆ (y( L) )
Qn ( C ( m ), y (i ) )

Figure 9.3 – Résumé des actions de codage, transmission et décodage, considérées séquentiellement.

L’intercalation du canal entraîne la probabilisation naturelle de l’ensemble Yn et,


de ce fait, la probabilisation naturelle de l’ensemble M de sortie. Par conséquent, la
présentation devient plus symétrique si nous probabilisons d’emblée l’ensemble M
(d’entrée) avec une probabilité a priori µ, la probabilisation de l’espace M (de sortie)
se fera alors par une probabilité a posteriori ν := νµ que nous déterminons ci-dessous.
L’opération de codage C est une fonction ; elle sera donc équivalente à une matrice sto-
chastique déterministe |M| × |X|n , notée KC , dont les éléments de matrice sont définis
par
M × Yn 3 (m, x) 7→ KC (m, x) = δC(m),x .
1. On pourrait raisonnablement la noter D mais le symbole D est déjà utilisé pour le contraste de
Kullback-Leibler.

/Users/dp/a/ens/[Link] 136
2022-12-05 • 10:56:42.
Canaux bruités sans mémoire 9.5. Le théorème fondamental de la transmission

I.e. le codage est le canal déterministe (M, Xn , KC ) (cf. remarque 9.1.3). L’opération
de décodage ∆ est aussi une fonction ; elle est donc équivalente au canal déterministe
(Yn , M, K∆ ), où K∆ (y, m) = δ∆(y),m . La séquence codage-transmission-décodage équi-
vaut donc à la multiplication de 3 matrices stochastiques KC Qn K∆ (vérifier que les
dimensions des matrices permettent leur multiplication dans cet ordre). Ce canal com-
posé transformera tout vecteur de probabilité (ligne) a priori µ ∈ M1 (M) en un vec-
teur de probabilité (ligne) a posteriori νµ = µKC Qn K∆ ∈ M1 (M). En particulier, il
transformera l’entrée déterministe M = m (correspondant au vecteur de probabilité
µ = δm ) en la variable aléatoire M0 ∈ M de loi ν, c’est-à-dire,

νδm (m0 ) = Pm ( M0 = m0 ) = P( M0 = m0 | M = m)
= ∑ P( M0 = m0 | M = v)δm (v) = KC Qn K∆ (m, m0 )
v ∈M
= ∑ n ∑ n KC (m, x)Qn (x, y)K∆ (y, m0 ) = ∑ n Qn (C(m), y)δ∆(y),m0 .
x ∈X y ∈Y y ∈Y

Plus généralement, lorsque le message d’entrée est lui même considéré comme résul-
tant d’un choix aléatoire selon une loi µ non-déterministe, nous obtenons

ν µ ( m 0 ) = Pµ ( M 0 = m 0 ) = ∑ P( M 0 = m 0 | M = m ) µ ( m )
m ∈M
= ∑ ∑ µ(m) Qn (C(m), y)δ∆(y),m0 .
m ∈M y ∈Yn

9.5.2 Probabilité d’erreur de transmission


La forme explicite de la loi νµ sur M (obtenue dans le paragraphe précédent pour
une canal (Xn , Yn , Qn )) qui décrit le résultat de décodage nous permet d’estimer la
probabilité d’erreur de transmission. On parle d’erreur de transmission lorsque le ré-
sultat m0 que nous obtenons à la fin du traitement diffère du message initial m. La
probabilité de réalisation d’une telle erreur est, pour tout m ∈ M,

e(m) := e(n) (m) = Pδm ( M0 6= m) = ∑ ∑ Qn (C(m), y)δ∆(y),m0


m 0 6 = m y ∈Yn
= ∑ Qn (C(m), y)1M\{m} (∆(y)).
y ∈Yn

La qualité de transmission est quantifiée soit par l’erreur maximale


(n)
emax := emax = max e(n) (m),
m ∈M

soit par l’erreur moyenne

e : = e(n) = ∑ µ ( m ) e ( n ) ( m ).
m ∈M

(n) (n)
Comme e(n) (m) ≤ emax pour tout m ∈ M, il est évident que e(n) ≤ emax . Cependant, un
des résultats importants du théorème fondamental de la transmission sera que lorsque
n → ∞, les deux erreurs sont du même ordre.

/Users/dp/a/ens/[Link] 137
2022-12-05 • 10:56:42.
9.5. Le théorème fondamental de la transmission Canaux bruités sans mémoire

Définition 9.5.1. Un [n, k]-code (par blocs) (avec k et n entiers supérieurs à 1) pour un
canal discret sans mémoire (X, Y, P) est la donnée
— d’un ensemble de messages M avec cardM = k,
— d’un codage C : M → Xn de taille fixe n,
— d’un décodage ∆ : Yn → M.
On note ce code K, ou plus précisément K(n, k) (ou simplment [n, k ]) si on veut préciser
ses paramètres. L’ensemble C(M) ⊆ Xn est appelé glossaire du code K.

Le codage C est toujours supposé non-singulier, i.e. injectif. En le considérant comme


une application C : M → C(M), il devient aussi surjectif, donc bijectif. Étant donné
que C est bijectif entre M et son glossaire, on peut identifier M avec le glossaire et
considérer M comme isomorphe à une partie spécifique de Xn .
(n)
Il est évident qu’une fois le code K choisi, les erreurs emax et e(n) définies plus haut,
dépendent de K ; on précise cette dépendance en écrivant emax [K(k, n)] ou e[K(k, n)].

Définition 9.5.2. Soit K un [n, k]-code par blocs.


1. Son taux de transmission R est défini par

log|X| k
R := R[K] = .
n
2. Un taux de transmission R est atteignable s’il existe une suite (K` )`∈N de [n` , k ` ]-
codes par blocs, tels que

log|X| k `
lim → R et lim emax [K` ] = 0.
l →∞ n` l →∞

Exemple 9.5.3. Soit X = {0, 1} l’alphabet binaire.


1. On considère le (3, 2)-code par blocs de répétition de taille 3 avec M = {0, 1},
défini par C(b) = bbb, pour b ∈ M, i.e. de glossaire C(M) := {000, 111}. Il a un
log 2
taux de transmission R = 32 = 13 .
2. On considère le (3, 4)-code par blocs avec bit de parité de taille 3 avec M =
{00, 01, 10, 11}, découlant, pour tout message ab ∈ M, du codage C( ab) = abc ∈
X3 avec c = a + b mod 2, i.e. ayant comme glossaire C(M) = {000, 011, 101, 110}.
log 4
Il a un taux de transmission R = 32 = 23 .

9.5.3 Le théorème fondamental de la transmission


Le théorème fondamental de la transmission établit que la capacité est le supremum
des taux de transmission atteignables.

Théorème 9.5.4. Soit (X, Y, P) un canal sans mémoire de capacité cap := cap( P).
1. Pour tout R < cap, il existe une suite infinie (K` )`∈N de [n` , k ` ]-codes, ayant des taux
log k`
de transmission R` := n|X| vérifiant R` → R, tels que lim`→∞ e[K` ] = 0.
`
2. Réciproquement, pour tout R > cap et toute suite (K` )`∈N de [n` , k ` ]-codes avec des
blocs de taille croissante (i.e. n1 < n2 < n3 < . . .) et des taux de transmission vérifiant
R` ≥ R, on a lim`→∞ e[K` ] = 1.

/Users/dp/a/ens/[Link] 138
2022-12-05 • 10:56:42.
Canaux bruités sans mémoire 9.5. Le théorème fondamental de la transmission

Figure 9.4 – Le touches blanches correspondent aux notes de base : do, re, mi, fa, sol, la, si. La
touche représentée en cyan sur la figure correspond au « do » de base, la touche représentée en jaune
sur la figure au « la » et la gamme se répète périodiquement sur le clavier. Source de la figure :
Wikipédia ; distribuée sous licence CC BY-SA 3.0.

La démonstration de ce théorème est longue. Elle est basée sur la notion de suites
conjointement typiques et est esquissée aux exercices 105 et 106. Elle fait usage du
fait que si I ( X : Y ) > 0, en prenant des blocs suffisamment longs, on peut distiller
un code et en raréfiant l’ensemble de messages à coder (i.e. en ne considérant qu’un
sous-ensemble suffisamment épars de messages) on peut transmettre avec une erreur
arbitrairement petite. L’idée est illustrée dans l’exemple 9.5.5.

Exemple 9.5.5. (Das ,falschtemperierte‘ Klavier ou le problème du « pianiste non-doué »).


Les touches des notes do-re-mi-fa-sol-la-si se répètent périodiquement sur le clavier du
piano (cf. figure 9.4). On peut donc les supposer enroulés sur un cercle de façon que le
si se trouve à proximité immédiate du do. (C’est le cas en réalité, le si d’une octave se
trouve effectivement juste avant le do de l’octave supérieure). Un pianiste mal préparé,
lorsqu’il lit une note dans la partition, frappe tantôt cette note tantôt la suivante avec
probabilité 1/2. Ainsi, lorsqu’il lit mi, il frappe mi avec probabilité 1/2 et fa avec proba-
bilité 1/2. Le système est donc décrit comme un canal bruité (c’est le pianiste qui cause
le bruit . . . ) avec M = X = Y = {do, re, mi, fa, sol, la, si} et C = ∆ = id. La matrice de
transmission du canal est, à cause de la périodisation,
 
1/2 1/2 0 0 0 0 0
 0 1/2 1/2 0 0 0 
P =  .. ..  .
 
.. .. .. .. ..
 . . . . . . . 
1/2 0 0 0 0 0 1/2

On calcule immédiatement que H (Y | X ) = H (p), où p = (1/2, 1/2, 0, 0, 0, 0, 0),


c’est-à-dire H (Y | X ) = log 2 = 1. On a donc I ( X : Y ) = H (Y ) − H (Y | X ) = H (Y ) −
1. Par ailleurs, le vecteur de probabilité uniforme µ( x ) = 1/7, pour tout x ∈ X est
invariant, i.e. µP = µ ce qui signifie que la loi uniforme est un choix possible comme
loi de Y. Mais la loi uniforme sature la borne de l’entropie : H (Y ) = log 7. On a donc
calculé la capacité de ce pianiste : cap = supµ ( H (Y ) − 1) = log 7 − 1 = log 72 . (Si le
pianiste était doué, on aurait cap = log 7).
Si le compositeur n’utilisait que les notes M = {do, mi, sol}, par exemple, (c’est-à-
dire il raréfiait suffisamment l’ensemble des messages pour que les signaux transmis
appartiennent à des parties disjointes de Y), on pourrait décoder l’œuvre, telle qu’in-
terprétée par le pianiste, sans erreur 2 . Par contre, si le pianiste était doué, on pourrait
décoder sans erreur sans raréfaction de M car alors la capacité serait log 7 = log cardM.
2. Le théorème ne dit rien sur . . . la musicalité de l’interprétation. Le titre de cet exemple est un jeu
de mots faisant référence à l’œuvre Das wohltemperierte Klavier de J.-S. Bach, connu en français sous le
titre Le clavier bien tempéré. Falschtemperierte pourrait se traduire par mal tempéré.

/Users/dp/a/ens/[Link] 139
2022-12-05 • 10:56:42.
9.5. Le théorème fondamental de la transmission Canaux bruités sans mémoire

L’idée intuitive sous-tendant la démonstration du théorème 9.5.4 est que tout canal,
pour des blocs de taille n suffisamment grande, se comporte comme l’exemple 9.5.5.

9.5.4 Démonstration du théorème 9.5.4


Typicité conjointe
Définition 9.5.6. Soient X et Y deux alphabets finis. On considère un couple de va-
riables aléatoires ( X, Y ) à valeurs dans X × Y de loi conjointe κ, i.e. P( X = x, Y = y) =
κ ( x, y), pour x ∈ X et y ∈ Y. On note µ la première marginale de κ et ν la seconde, i.e.
µ( x ) = ∑ κ (x, y), x ∈ X et ν(y) = ∑ κ (x, y), y ∈ Y.
y ∈Y x ∈X

L’ensemble des configurations conjointement typiques (pour la probabilité κ) à niveau


ε > 0 et taille n ∈ N> est l’ensemble
1 n
n i∑
J := Jκ,ε,n = {(x, y) ∈ Xn × Yn : | − log µ( xi ) − H (µ)| < ε,
=1
1 n
n i∑
|− log ν( xi ) − H (ν)| < ε,
=1
1 n
n i∑
|− log κ ( xi , yi ) − H (κ )| < ε}.
=1

Il s’avère pratique dans la suite de décomposer l’ensemble J = A1 ∩ A2 ∩ A3 , où


( )
n
1
A1 := A1,κ,ε,n = x ∈ Xn : | − ∑ log µ( xi ) − H (µ)| < ε ,
n i =1
( )
1 n
A2 := A2,κ,ε,n = y ∈ Y : | − ∑ log ν(yi ) − H (ν)| < ε ,
n
n i =1
( )
1 n
A3 := A3,κ,ε,n = (x, y) ∈ X × Y : | − ∑ log κ ( xi , yi ) − H (κ )| < ε ,
n n
n i =1

et d’introduire les abbreviations


n
µn (x) := ∏ µ ( x i ), pour x ∈ Xn ,
i =1
n
νn (y) := ∏ ν ( y i ), pour y ∈ Yn ,
i =1
n
κn (x, y) := ∏ κ ( xi , yi ) pour y ∈ Xn × Yn .
i =1

Théorème 9.5.7. Soit ( Xi , Yi )i∈N une suite de couples aléatoires à valeurs dans X × Y indé-
pendants et identiquement distribués selon la loi conjointe κ, i.e. ∀i ∈ N,
P(( Xi , Yi ) = ( x, y)) = P(( X1 , Y1 ) = x, y) = κ ( x, y).
On note Xn (resp. Xn ) la troncature des suites infinies aux n premiers termes, i.e. Xn =
( X1 , X2 , . . . , Xn ) (resp. Yn = (Y1 , Y2 , . . . , Yn ). Alors, pour ε ∈]0, 1[ (suffisamment petit)

/Users/dp/a/ens/[Link] 140
2022-12-05 • 10:56:42.
Canaux bruités sans mémoire 9.5. Le théorème fondamental de la transmission

P
1. limn→∞ P ((Xn , Yn ) ∈ Jκ,ε,n ) = 1.
2. (1 − ε)2n( H (κ )−ε) ≤ |Jκ,ε,n | ≤ 2n( H (κ )+ε) .
3. Soient X̃ = ( X̃i )i∈N et Ỹ = (Ỹi )i∈N des suites aléatoires indépendantes et mutuelle-
ment indépendantes, à valeurs respectivement dans X et Y, distribués selon les lois
P( X̃1 = x ) = µ( x ) et P(Ỹ1 = y) = ν(y), i.e. la loi du couple est donnée par
P (X̃n , Ỹn ) = ( x, y) = µ( x )ν( x ). Alors

(1 − ε)2−nI (X1 :Y1 )+3ε) ≤ P (X̃n , Ỹn ) ∈ Jκ,ε,n ≤ 2−nI (X1 :Y1 )−3ε) ,


où I ( X1 : Y1 ) désigne l’information mutuelle entre les variables aléatoires X1 et Y1 .

Démonstration. Voir exercice 105.

Démonstration de l’affirmation directe


Le but de ce paragraphe est de démontrer la première affirmation du théorème 9.5.4
(dans la formulation simplifée 9.5.10 ci-dessous).

Remarque 9.5.8. Le code avec des tailles de blocks n pourrait coder jusqu’à |X|n mes-
sages. Ce que nous dit le théorème fondamental de la transmission est que si cap < 1
on peut, en raréfiant l’ensemble de message à un cardinal k = |X|nR avec R < cap,
transmettre les messages sans erreur. C’est précisément ce résultat que est illustré par
l’exemple 9.5.5 et c’est le résultat que nous allons démontrer dans la suite.

Dans la suite on raréfiera l’ensemble de messages M en Mk ⊂ M avec |Mk | = k <


|M|. Le paramètre k sera déterminé plus tard. Sans perte de généralité, on identifie
l’ensemble Mk avec {1, . . . , k }.
En utilisant un code C : M → Xn , nous avons déjà établi que la probabilité d’erreur
de transmission d’un message spécifique m ∈ M est donnée par

e(m) = P( M̂ 6= m) = ∑ Qn (C(m), y)1M\{m} ( M̂ (y))


y ∈Yn

où M̂ est un estimateur (souvent du maximum de vraisemblance) du message d’entrée


lorsque le sortie est déterminée par le canal. Nous allons généraliser ce modèle de
plusieurs façons.
— Étant donné que nous raréfions l’ensemble de messages, nous allons appliquer
la formule de probabilité d’erreur sur les messages de Mk au lieu de M, i.e.

e(m) = P( M̂ 6= m) = ∑ Qn (C(m), y)1Mk \{m} ( M̂(y)), pour m ∈ Mk . (9.1)


y ∈Yn

— Connaître le code C c’est connaître son glossaire G , i.e. la liste ordonnée G =


(C(m))m∈Mk = (C(1), . . . , C(k)). Dans la suite, nous allons considérer des codes
aléatoires, i.e. nous allons introduire un aléa supplémentaire et, pour chaque
m ∈ Mk , associer à C(m) à un mot aléatoire X(m) ∈ Xn de longueur n sur
l’alphabet X. La loi des variables aléatoires X(m) est donnée par µn , i.e.

(m) (m)
P( X ( m ) = x ( m ) ) = µ n ( x ( m ) ) = µ ( x1 ) · · · µ ( x n )

/Users/dp/a/ens/[Link] 141
2022-12-05 • 10:56:42.
9.5. Le théorème fondamental de la transmission Canaux bruités sans mémoire

et les variables X(l ) et X(m) codant des messages différents l 6= m sont indépen-
dates. Par conséquent, le choix du code sera déterminé par la loi
  k k n
∏ µ n ( x (m) ) = ∏ ∏ µ ( xi
(1) (k) (m)
P G = (x ,...,x ) = ). (9.2)
m =1 m =1 i =1

— Supposons que l’on s’intéresse à la probabilité d’erreur lors de la transmission


du message spécifique m ∈ Mk .
L’estimateur M̂ que nous allons utiliser ne sera pas celui de maximum de vrai-
semblance mais celui de typicité conjointe. L’estimateur M̂ de typicité conjointe
nécessite l’information pas seulement de la variable Y(m) mais aussi de tous les
mots potentiellement contenus dans le glossaire. M̂ sera m si les deux conditions
suivantes sont simultanément vérifées :
— (X(m) , Y(m) ) ∈ Jκ,ε,n et
— il n’existe aucun autre message l ∈ Mk , tel que (X(l ) , Y(m) ) ∈ Jκ,ε,n .
Si l’une des conditions est violée, on introduit un nouveau symbole ∂ 6∈ Mk et
on retourne ce symbole comme estimation du message d’entrée (il contribuera
toujours à l’erreur). Ainsi, pour un mot Y arbitraire,
(
r si (X(r) , Y) ∈ J et ∀l 6= r, (X(l ) , Y) 6∈ J,
M̂(Y) =
∂ si ∀r, (X(r) , Y) 6∈ J ou ∃(l, r ), l 6= r avec (X(l ) , Y) ∈ J, (X(r) , Y) ∈ J.
(9.3)
Remarque 9.5.9. Dans la définition de l’estimateur M̂, on reconnaît l’idée véhiculée
par l’exemple 9.5.5 du polycopié : on peut décoder sans erreur si l’espace de messages
Mk est tellement raréfié que le code C : Mk → C(Mk ), avec C(Mk ) ⊂ Yn , peut-être
rendu (approximativement) bijective.
Le schéma du canal et de son codage est donné en figure 1.
On note K le vecteur de probabilité conjointe des variables X(1) , . . . , X(k) , Y(m) pour
un m ∈ Mk (cf. figure 9.5) et Pm la mesure de probabilité conjointe de toutes les va-
riables aléatoires lorsque nous commençons par le message m :

Pm ( X (1) = x (1) , . . . , X ( k ) = x ( k ) ; Y( m ) = y ( m ) ) = K ( x (1) , . . . , x ( k ) ; y ( m ) ) (9.4)


k
= κn (x(m) , y(m) ) ∏ µn (x(l ) ) (9.5)
l =1
l 6=m

où κn (x(m) , y(m) ) = µn (x(m) ) Qn (x(m) , y(m) ) et Qn est la matrice de transition pour le


canal avec des entrées et sorties de blocks de taille n.
Théorème 9.5.10 (Version simplifiée du théorème fondamental). Soit (X, Y, P) un ca-
nal sans mémoire, de capacité cap := cap( P). Tout [k, n]-code de taux de transmission R =
log|X| k
n < cap est (asymptotiquement à grand n) atteignable.
Démonstration. Voir exercice 106
La démonstration de la réciproque se base sur des arguments similaires à ceux dé-
velopppés dans les exercices 105 et 106. La réciproque faible peut être consultée dans
[60, pp. 98–101] ; la réciproque forte dans [60, pp. 101–102].

/Users/dp/a/ens/[Link]
142
2021-11-25 • 21:12:16.
Canaux bruités sans mémoire 9.6. Exercices

Mk codage Xn canal Yn décodage Mk +1

C Qn M̂

1 X (1)
.. ..
. .
m X(m) Y(m) M̂(Y(m) ) ∈ Mk ∪ {∂}

.. ..
. .

k X(k)
Figure 9.5 – Résumé des actions de codage du message m ∈ Mk , de sa transmission et de son
décodage. Les flèches pointillées signifient qu’une information concernant les X(l ) est utilisée lors du
décodage. Il faut cependant comprendre que cette information est juste une astuce théorique pour
démontrer le théorème ; on ne sous-entend pas que M̂ a effectivement besoin de cette information
contenue dans la réalisation précise des variables X(l ) pour effectuer le décodage.

9.6 Exercices
Codage du canal
98. Pour trois variables aléatoires X, W, Y discrètes arbitraires, établir les relations
suivantes :
(a) H (W, Y | X ) ≤ H (W | X ) + H (Y | X ).
(b) H (W, Y | X ) = H (W | X ) + H (Y | X, W ).
(c) H (Y | X, W ) ≤ H (Y | X ).
99. Soient les canaux K1 = (X, π, W, P) et K2 = (W, ρ, Y, Q) où X, W et Y sont
des alphabets d’entrée ou de sortie et P et Q des matrices de transmission. On
construit le canal K = (X, π, Y, PQ) en mettant les canaux K1 et K2 en cascade.
(a) Comparer les probabilités conditionnelles P(Y = y| X = x, W = w) et P(Y =
y |W = w ) .
(b) Montrer que la capacité CK du canal composé ne peut pas excéder la plus
petite des capacités CK1 et CK2 .
(c) Commenter ce dernier résultat.
100. Soit K = (X, Y, P) le canal avec alphabets d’entrée et de sortie X = Y, ayant
cardX = cardY = 27. On suppose que ces ensembles sont ordonnés ; on peut par
conséquent les identifier avec Z27 = {0, . . . , 26} d’une part et avec l’alphabet
latin augmenté du symbole blanc d’autre part à travers la bijection 0 → , 1 →
a, . . . , 26 → z. La périodisation signifie que le symbole ≡ 0 succède à z ≡ 26
et précède a ≡ 1. Lorsque l’entrée du canal X est une lettre x ∈ X, la sortie est
une variable aléatoire Y uniformément distribuée dans { x − 1 mod 27, x, x + 1
mod 27} ⊂ Y.
Suggestion : Pour cet exercice vous pouvez vous inspirez de l’exemple du « cla-
vier mal tempéré » traité en cours.

/Users/dp/a/ens/[Link]
143
2021-11-25 • 21:12:16.
9.6. Exercices Canaux bruités sans mémoire

(a) Déterminer la matrice de transmission P := ( P( x, y)) x,y∈Z27 du canal, définie


par
P (Y = y | X = x ) .
(b) Calculer H (Y | X ). Suggestion : l’entropie s’exprime facilement soit en trits —
i.e. en log3 — soit en log27 .
(c) Le vecteur de probabilité µ ∈ M1 (X) uniforme, i.e. µ( x ) = 1/27 pour tout
x ∈ X, est-il invariant par P ?
(d) Pour une entrée du canal distribuée selon µ, calculer H (Y ) où Y est la va-
riable de sortie.
(e) Déterminer la capacité cap(K) du canal.
(f) Soit M = X l’ensemble de messages que nous envisageons de faire transiter
par le canal et C : M → X le codage « identité » C = 1. Quelle est la di-
lution minimale de l’ensemble M pour que le théorème fondamental de la
transmission nous garantisse le possibilité de transmission sans erreur ?
101. Soient X un espace fini, X une variable aléatoire à valeurs dans X, g : X → W
une application arbitraire et Y une variable aléatoire à valeurs dans Y de loi
conjointe κ avec X. Monter par deux méthodes différentes que H (Y | g( X )) ≥
H (Y | X ) .
102. (Codage du canal et décision optimale) – Extrait de l’examen du 19 décembre
2013.

Soit un canal discret sans mémoire ayant un alphabet d’entrée X, un alphabet


de sortie Y, une matrice stochastique de transmission P et une loi des symboles
d’entrée déterminée par le vecteur de probabilité π. Lorsque un symbole y ∈ Y
est transmis, on le décode par un schéma de décision qui peut être soit une
fonction déterministe d : Y → X soit une variable aléatoire D définie sur Y à
valeurs dans X.
(a) Déterminer les vecteurs de probabilité κ et ρ définissant respectivement la
loi conjointe et la loi des symboles de sortie.
(b) Pour une règle de décodage d : Y → X, on note respectivement DC(d) et
DE(d) les probabilités de décodage correct et erroné. Montrer que DC(d) =
∑y∈Y ρ(y)P( X = d(y)|Y = y). Que vaudra alors DE(d) ?
(c) On appelle décodage déterministe optimal la règle de décision définie pour
tout y ∈ Y par la formule do (y) = xy , où xy maximise la probabilité condi-
tionnelle P( X = x |Y = y), c’est-à-dire :

xy = arg max P( X = x |Y = y).


x

Montrer que la règle de décision ainsi définie est optimale, c’est-à-dire, pour
toute autre règle déterministe d0 , on DC(d0 ) ≤ DC(do ).
(d) Soit D une règle de décision stochastique arbitraire correspondant à la pro-
babilité conditionnelle Qyx = P( D (y) = x |Y = y). Montrer que DC( D ) ≤
DC(do ).
(e) Dorénavant
 X= { x1 , x2 , x3 }, Y = {y1 , y2 , y3 }, π = (1/2, 1/4, 1/4) et P =
1 0 0
0 1 0 , calculer ρ.
0 1/2 1/2

/Users/dp/a/ens/[Link]
144
2021-11-25 • 21:12:16.
Canaux bruités sans mémoire 9.6. Exercices

(f) Soit d : Y → X la règle déterministe de décodage donnée par la formule


d(y1 ) = x1 ; d(y2 ) = d(y3 ) = x3 . Calculer la valeur numérique de la probabi-
lité de décodage correct.
103. (Extrait de l’examen du 20 décembre 2017).

Soit K = (X, Y, P, µ) un canal avec alphabets d’entrée et de sortie finis, notés


respectivement X et Y, matrice stochastique P et probabilité des symboles de la
source µ. Nous écrirons µ( x ) au lieu de µ({ x }), i.e. nous identifierons — comme
d’habitude — la mesure de probabilité µ avec le vecteur (ligne) de probabilité
(µ( x )) x∈X . Déterminer, pour des variables d’entrée X et de sortie Y et pour des
symboles x ∈ X et y ∈ Y :
(a) La mesure de probabilité conjointe κ ( x, y) := P( X = x, Y = y).
(b) La mesure de probabilité de sortie ν
(c) La probabilité Q(y, x ) := P( X = x |Y = y) que l’entrée soit x, sachant que la
sortie observée est y.
(d) On fixe maintenant les alphabets d’entrée et de sortie X = Y = {0, 1} (canal
binaire) et la loi 3 de la source µ = (1/4, 3/4).
i. Si le canal est symétrique avec taux d’erreur f = 1/16,
— Déterminer la matrice stochastique P du canal.
— Determiner le vecteur probabilité ν de sortie.
— Calculer Q(1, 0) et Q(1, 1).
ii. Si le canal est « enZ » avec tauxd’erreur f = 1/16, i.e. sa matrice sto-
1 0
chastique est P = , calculer
1/16 15/16
— Le vecteur de probabilité de sortie ν.
— Les probabilités Q(1, 0) et Q(1, 1).
104. (« Somme » de deux canaux). Soient Ki , avec i = 1, 2 deux canaux avec alphabets
d’entrée Xi , alphabets de sortie Yi et matrices de transmission Pi . On note X =
X1  X2 (si les alphabets X1 et X2 sont distincts alors X1  X2 = X1 t X2 ; s’ils ne
sont pas distincts, on commence par distinguer artificiellement les éléments de
X1 et de X2 avant de prendre leur réunion). Il en va de même de Y = Y1  Y2 .
Finalement
 la
 matrice de transmission du canal « somme » est la matrice bloc
P1 0
P= .
0 P2
(a) Soient X une variable aléatoire à valeurs dans X dont la loi est décrite par le
vecteur de probabilité π et Y une variable aléatoire à valeurs dans Y, dont la
loi est déterminée par le canal. On note κ la loi conjointe du couple ( X, Y ).
Soit p = ∑ x∈X1 π ( x ) (donc 1 − p = ∑ x∈X2 π ( x )). Pour x ∈ X1 on note
π (x) π (x)
ρ1 ( x ) = p et pour x ∈ X2 on note ρ2 ( x ) = 1− p . Calculer H (π )
(b) Montrer que

H ( X |Y ) = − p ∑ ρ1 ( x ) P1 ( x, y) log P( X = x |Y = y)
x ∈X1 ,y∈Y1

− (1 − p ) ∑ ρ2 ( x ) P2 ( x, y) log P( X = x |Y = y).
x ∈X2 ,y∈Y2
3. Les valeurs numériques données pour les probabilités de la source et de l’erreur permettent de
déterminer toutes les autres probabilités comme des rationnels calculables facilement à la main.

/Users/dp/a/ens/[Link]
145
2021-11-25 • 21:12:16.
9.6. Exercices Canaux bruités sans mémoire

(c) On considère des variables aléatoires X1 et X2 respectivement à valeurs dans


X1 et X2 et de lois ρ1 et ρ2 ; on note Y1 et Y2 les variables aléatoires obtenues
par restriction de Y sur Y1 et Y2 . Montrer que
H ( X |Y ) = pH ( X1 |Y1 ) + (1 − p) H ( X2 |Y2 )
et conclure que
C ( p) := sup I ( X : Y ) = H ( p, 1 − p) + pC1 + (1 − p)C2 .
π:∑ x∈X π ( x )= p
1

2C1
(d) Montrer que la valeur de p qui maximise C ( p) est p = C .
2 +2C2
1
(e) En conclure que la capacité du canal « somme » vérifie 2C = 2C1 + 2C2 ).
105. (Typicité conjointe). On utilise la notation introduite dans le paragraphe sur la
typicité conjointe.
(a) Montrer que

∀x ∈ A1,κ,ε,n : 2−n( H (µ)+ε) ≤ µn (x) ≤ 2−n( H (µ)−ε) .


Le deux encadrements qui suivent se démontrent de la même façon. Il n’est pas
demandé de les (re)démontrer ; vous aurez cependant à les utiliser ultérieurement.

∀y ∈ A2,κ,ε,n : 2−n( H (ν)+ε) ≤ νn (y) ≤ 2−n( H (ν)−ε) ,


et
∀(x, y) ∈ A3,κ,ε,n : 2−n( H (κ )+ε) ≤ κn (x, y) ≤ 2−n( H (κ )−ε) .
(b) Montrer que pour ∀ε > 0,
c ε
∃n1 := n1 (ε) ≥ 1 : ∀n ≥ n1 , P(Xn ∈ A1,κ,ε,n )≤ ,
3
c ε
∃n2 := n2 (ε) ≥ 1 : ∀n ≥ n2 , P(Yn ∈ A2,κ,ε,n )≤ ,
3
c ε
∃n3 := n3 (ε) ≥ 1 : ∀n ≥ n3 , P((Xn , Yn ) ∈ A3,κ,ε,n ) ≤ .
3
(c) Conclure que pour tout ε > 0,
lim P ((Xn , Yn ) ∈ Jκ,ε,n ) = 1.
n→∞

(d) En utilisant la minoration de κn (x, y) pour (x, y) ∈ A3,κ,ε,n — établie en ques-


tion 105a — montrer que |Jκ,ε,n | ≤ 2n( H (κ )+ε) .
(e) Montrer que P(X̃n , Ỹn ) ∈ Jκ,ε,n ) ≤ 2−n( I (X1 :Y1 )−3ε) .
(f) Montrer que |Jκ,ε,n | ≥ (1 − ε)2n( H (κ )−ε) .
(g) Conclure que

P (X̃n , Ỹn ) ∈ Jκ,ε,n ≥ (1 − ε)2−nI (X1 :Y1 )+3ε) .




106. (Théorème fondamental de la transmission).


(a) Montrer que la loi conjointe du couple (X(m) , Y(m) ) est κn et celle du couple
(X(m) , Y(m) ), avec l 6= m, est µn ⊗ νn , où,
νn (z) = ∑ n κn (w, z) = ∑ n µn (w)Qn (w, z), z ∈ Yn .
w ∈X w ∈X

/Users/dp/a/ens/[Link]
146
2021-11-25 • 21:12:16.
Canaux bruités sans mémoire 9.6. Exercices

(b) Que peut-on conclure sur la dépendance des variables aléatoires composant
le couple (X(m) , Y(m) ) ? Même question pour le variables du couple (X(l ) , Y(m) ),
avec l 6= m.
(c) Partant de l’expression évidente, valable pour un m ∈ Mk fixé, pour la pro-
babilité d’erreur :

e(m) = P( M̂ 6= m) = ∑ P( M̂ 6= m|G = (x(1) , . . . , x(k) ))P(G = (x(1) , . . . , x(k) )),


x(1) ,...,x(k) ∈Xn
(9.6)
montrer que
 
n
e(m) ≤ ∑ K ( x ( 1 ) , . . . , x ( k ) ; y ( m ) )  1J c ( x ( m ) , y ( m ) ) + ∑ 1J ( x ( l ) , y ( m ) )  .
 
x(1) ,...,x(k ) ∈Xn l =1
l 6=m
y ( m ) ∈Yn
(9.7)
(d) Utiliser le résultat, obtenu en question 106b — à savoir que la loi conjointe
du couple (X(m) , Y(m) ) est κn — et le résultat obtenu en question 105f pour
majorer la probabilité

P((X(m) , Y(m) ) ∈ (Jκ,ε,n )c ) < ε.

asymptotiquement à grand n.
(e) Utiliser les résultats, obtenus aux questions 106b et 105e pour majorer la
probabilité
P((X(l ) , Y(m) ) ∈ Jκ,ε,n )
asymptotiquement à grand n.
(f) Conclure que
e(m) ≤ ε + (k − 1)2−n( I (X1 :Y1 )−3ε)
où le couple ( X1 , Y1 ) est distribué selon κ.
(g) Choisir maintenant k = 2nR . Montrer que tant que R < cap, la transmission
peut se faire avec une erreur négligeable.

/Users/dp/a/ens/[Link] 147
2022-12-05 • 10:56:42.
9.6. Exercices Canaux bruités sans mémoire

/Users/dp/a/ens/[Link] 148
2023-07-18 • 17:43:52.
10
Chiffrement

Desiderata de la cryptographie militaire


Il faut bien distinguer entre un système d’écriture chiffrée, imaginé pour un échange momentané de
lettres entre quelques personnes isolées, et une méthode de cryptographie destinée à régler pour un
temps illimité la correspondance des différents chefs d’armée entre eux. Ceux-ci, en effet, ne peuvent
à leur gré et à un moment donné, modifier leurs conventions ; de plus, ils ne doivent jamais garder sur
eux aucun objet ou écrit qui soit de nature à éclairer l’ennemi sur le sens des dépêches sécrètes qui
pourraient tomber entre ses mains.
Un grand nombre de combinaisons ingénieuses peuvent répondre au but qu’on veut atteindre dans
le premier cas ; dans le second, il faut un système remplissant certaines conditions exceptionnelles,
conditions que je résumerai sous les six chefs suivants :
1. Le système doit être matériellement, sinon mathématiquement, indéchiffrable ;
2. Il faut qu’il n’exige pas le secret, et qu’il puisse sans inconvénient tomber entre les mains de
l’ennemi ;
3. La clef doit pouvoir en être communiquée et retenue sans le secours de notes écrites, et être
changée ou modifiée au gré des correspondants ;
4. Il faut qu’il soit applicable à la correspondance télégraphique ;
5. Il faut qu’il soit portatif, et que son maniement ou son fonctionnement n’exige pas le concours
de plusieurs personnes ;
6. Enfin, il est nécessaire, vu les circonstances qui en commandent l’application, que le système
soit d’usage facile, ne demandant ni tension d’esprit, ni la connaissance d’une longue série de
règles à observer.

Augustus Kerchoffs : La cryptographie militaire ; Journal des sciences militaires (1883) [40, page 12].

Dans l’extrait ci-dessus, Augustus Kerchoffs énonçait, en 1883, avec une surpre-
nante modernité, les conditions que doit remplir un bon système de cryptage. On
pourrait utiliser ce passage — presque mot pour mot — pour formuler les exigences
cryptographiques d’aujourd’hui.

10.1 Sécurité des communications


Dans ce chapitre, nous nous intéressons aux méthodes de protection de l’informa-
tion basées sur le partage d’une clé secrète entre les partenaires qui souhaitent com-
muniquer. Ceci se réalise par le partage d’une clé aléatoire privée qui est utilisée de
manière symétrique entre les partenaires, contrairement aux méthodes asymétriques à
clé publique (comme RSA par exemple).

149
10.1. Sécurité des communications Chiffrement

10.1.1 Les exigences du chiffrement


Le cryptage est conçu (voir [21] ou [31, 32] par exemple) pour assurer :
— La confidentialité des messages transmis, dans le sens que seul le récipien-
daire légal du cryptogramme (possesseur de la clé) peut le décoder facilement.
D’autres personnes peuvent intercepter le cryptogramme mais, ne possédant
pas la clé, ne peuvent pas le décoder (dans un temps raisonnable . . . ).
— La signature du message par son expéditeur qui permet à toute personne de
vérifier efficacement la signature de l’expéditeur sur un document spécifique
assurant ainsi les fonctions d’intégrité 1 et de non-rétractation 2 .
— L’authentification qui permet à l’expéditeur de s’identifier auprès du destina-
taire légitime en lui prouvant qu’il connaît un secret que lui seul et le destinataire
connaissent.
La discussion à propos des signatures irréfutables a été initiée durant les siècles pré-
cédents par le besoin qu’ont différentes parties de s’engager par des propositions ou
de déclarations qu’elles font. Mais ces discussions ont surtout porté sur l’irréfutabilité
de signatures manuscrites. En transposant (et en renforçant) ces exigences aux com-
munications numérisées, un schéma de signature numérique irréfutable doit vérifier
les conditions suivantes :
— chaque utilisateur peut efficacement apposer sa signature sur tout document de
son choix,
— tout utilisateur peut efficacement vérifier si une chaîne de caractère est la signa-
ture d’un autre utilisateur spécifique apposée sur un document spécifique et
— il est impossible d’apposer des signatures de tierces personnes sur des docu-
ments qu’elles n’ont pas effectivement signés.
Le schéma analogue pour l’authentification doit vérifier les conditions suivantes :
— chacun des deux partenaires peut générer efficacement un sceau d’authentifica-
tion (authentication tag) sur tout document de son choix ;
— chacun des deux partenaires peut vérifier efficacement si un mot est le sceau
d’authentification d’un message donné ;
— nul adversaire ne peut produire efficacement des sceaux d’authentification sur
des messages non émis par les deux partenaires.
Il est évident qu’une signature électronique assure l’authentification mais, en gé-
néral, l’authentification ne suffit pas comme signature comme le résume le tableau
suivant :
Action Clé de vérification Possibilité de vérification
Signature Connue de tout le monde Par tout le monde
(y compris l’adversaire)
Authentification Connue uniquement des Par les partenaires légi-
partenaires légitimes times

10.1.2 Les niveaux de sécurité


Un critère essentiel de la qualité d’un chiffrement est la difficulté que l’on rencontre
pour le casser. Le cryptage (sans que la partie adverse connaisse la clé de cryptage)
1. Elle garantit à tout destinataire potentiel qu’aucun intrus malicieux n’ait apporté des modifications
volontaires au message.
2. Dans le sens que l’expéditeur ne puisse pas prétendre qu’il n’a pas envoyé le message ou qu’il a
envoyé un autre message.

/Users/dp/a/ens/[Link] 150
2023-07-18 • 17:43:52.
Chiffrement 10.1. Sécurité des communications

offre un certain niveau de sécurité. On parle de


— sécurité calculatoire (ou algorithmique) si la partie adverse (sans connaissance
de la clé) ne peut pas déchiffrer le code avec la technologie actuelle dans un
temps de calcul raisonnable. Par exemple, le chiffrement asymétrique basé sur
la difficulté (conjecturée) de factoriser un grand entier composé en facteurs pre-
miers est encore considéré comme algorithmiquement sûr pour des opérations
courantes (voir la légende du tableau 10.1).

n O(exp(n)) O(exp(n1/3 (log n)2/3 )) O(n3 )


100 1.26 × 1021 s = 4.01 × 1013 a 3.13s = 9.93 × 10−8 a 1 × 10−3 s = 3.17 × 10−11 a
500 3.27 × 10141 s = 1.31 × 10134 a 6.74 × 1010 s = 2139a 0.125s = 3.96 × 10−9 a
1000 1.07 × 10292 s = 3.39 × 10284 a 6.42 × 1017 s = 2.03 × 1010 a 1s = 3.17 × 10−8 a

Table 10.1 – Une estimation grossière de l’ordre de grandeur du temps nécessaire pour factoriser un
entier à n bits (avec n = 100, 500, 1000), sous l’hypothèse d’exécution du programme de factorisation
sur un ordinateur hypothétique faisant une opération par nanoseconde, comme fonction de la com-
plexité temporelle de l’algorithme. Lorsque le protocole RSA a été proposée [59] en 1978, le meilleur
algorithme avait une complexité temporelle de O(exp(n)). De nos jours, le meilleur algorithme [45] a
une complexité O(exp(n1/3 log2/3 n)). Si un ordinateur quantique se construit, l’algorithme de Shor
[66] a une complexité O(n3 ). Pour mémoire : « âge de l’univers » = 1.377 × 1010 a.

— sécurité inconditionnelle (ou informationnelle) si l’interception du cryptogramme


ne nous apprend rien sur le message qui l’a produit. Par conséquent, un code
offre une sécurité inconditionnelle si une partie adverse, même possédant une
puissance de calcul illimitée, ne pourra pas le casser.
Le terme de sécurité inconditionnelle a été introduit par Diffie et Hellman d’où
est tirée la définition suivante [20, page 646] :

Unconditionally secure systems [ . . . ] belong to that portion of information theory,


called the Shannon theory, which is concerned with optimal performance obtai-
nable with unlimited computation. Unconditional security results from the exis-
tence of multiple meaningful solutions to a cryptogram. [ . . . ] A computationally
secure cryptogram, in contrast, contains sufficient information to uniquely deter-
mine the plaintext and the key. Its security resides solely in the cost of computing
them. The only unconditionally secure system in common use is the one-time
pad, in which the plaintext is combined with a randomly chosen key of the same
length.

Comme on verra dans les paragraphes suivants 10.2 et 10.3, la mise en place d’un
code inconditionnellement sûr exige
— la génération d’une suite de même longueur que le message à coder de nombres
purement aléatoires ,
— l’utilisation de la suite une seule fois ou one-time pad et
— la transmission sûre de la clé de cryptage.
Durant plus d’un siècle, ces trois exigences étaient impossibles à réaliser dans la pra-
tique. C’est pourquoi, les méthodes de cryptographie symétrique à clé privée ont été
abandonnées au profit du cryptage asymétrique à clé publique (RSA par exemple).
L’avènement de la technologie quantique en cryptographie change la donne car aujour-
d’hui on dispose des méthodes rapides, fiables et efficaces remplissant ces exigences.

/Users/dp/a/ens/[Link] 151
2023-07-18 • 17:43:52.
10.2. Le chiffrement comme code Chiffrement

Des solutions quantiques sont déjà proposées dans un stade pré-industriel et à un coût
raisonnable (cf. cours [57]).
Dans ce chapitre, nous nous intéressons uniquement aux cryptage et à l’authentifi-
cation offrant une sécurité informationnelle (inconditionnelle).

10.2 Le chiffrement comme code


Un système cryptographique est défini [64] comme une famille paramétrique ( Tk )k∈K
de transformations Tk : M → Y, indexée par une famille K des clés de cryptage k. Pour
chaque k fixé, la fonction Tk agit sur un ensemble fini M de messages m pour produire
un cryptogramme y ∈ Y. Restreinte sur les y ∈ Tk (M), l’application Tk : M → Tk (M)
est supposée inversible. Dans tous les systèmes cryptologiques, il est supposé qu’il est
très difficile de calculer l’inverse si la clé est inconnue.
On peut donc décrire les opérations de cryptage et de décryptage comme des opé-
rations de codage et de décodage vues aux chapitres précédents. Plus précisément :
Définition 10.2.1. Soient M un ensemble fini de messages et K un ensemble fini de
clés. Un code de chiffrement est une application
C : M × K → Y,
où Y est un ensemble de cryptogrammes. Un code de déchiffrement est une règle de
décision, i.e. une application partielle ∆ — définie sur une partie de Y (le domaine de
∆) —
∆ : Y × K → M,
telle que ∆(C (m, k ), k) = m pour tout message m ∈ M et toute clé k ∈ K.

10.2.1 Code de Vernam (one-time pad)


Comme mentionné dans l’article de revue de Bellovin ([3]), en 1882, Frank Miller 3
avait proposé une méthode de chiffrement, appelée one-time pad, qui permettait de chif-
frer des messages en les combinant avec des clés de même longueur. Le 13 septembre
1918, Gilbert Vernam dépose aux États-Unis une demande de brevet pour un dispositif,
appelé « Secret signaling system » de chiffrement, selon la méthode de one-time-pad.
La demande est acceptée et Vernam devient détenteur du brevet US Patent 1310719 le
22 juillet 1919 4 .
La méthode introduite par Vernam porte aujourd’hui le nom de code de Vernam
et sa description peut être trouvée dans [71]. La méthode est censée réponde aux exi-
gences de Kerchoffs.
Soit A un alphabet fini, identifié au groupe additif Z|A| := {0, . . . , |A| − 1} des en-
tiers modulo |A|. Les messages que nous enverrons constituent une partie spécifique
M ⊆ X := A+ , i.e. ils sont des mots finis sur cet alphabet. Les fréquences d’appari-
tion de lettres sont arbitraires ; M peut par conséquent correspondre à une partie d’un
langage naturel, du français par exemple.
3. L’auteur de ces notes n’a pas pu consulter le texte original de la contribution de Frank Miller,
Telegraphic code to insure privacy and secrecy in the transmission of telegrams. C.M. Cornwell (1882). L’infor-
mation qu’il dispose sur cet article est celle rapportée dans [3].
4. Par la suite il améliore son invention en accédant à d’autres brevets US Patent 1416765, US Patent
1584749 et US Patent 1613686.

/Users/dp/a/ens/[Link] 152
2023-07-18 • 17:43:52.
Chiffrement 10.2. Le chiffrement comme code

Supposons que l’on veuille chiffrer le message m ∈ M, avec N := |m|. On suppose


que nous disposons d’une clé aléatoire K ∈ K := A N , distribuée selon la loi uniforme
sur K, i.e. P(K = k) = |K1
|
= |A1| N . Le chiffrement se fait par addition lettre par lettre
modulo |A| des lettres de m et de k, i.e. C (m, k) = y, avec yi = mi + k i mod |A|. Plus
précisément, on a

Algorithme 10.2.2. Chiffrement de Vernam


Require: Message initial m ∈ M et U NIF(A).
Ensure: Clé de chiffrement k ∈ A+ et message chiffré y ∈ A+ , avec |k| = |y| = |m|.
N ← | m |.
for i ∈ {1, . . . , N } do
Générer selon U NIF(A) la ie lettre k i ∈ A de la clé de cryptage.
yi ← mi + k i mod |A|.
end for
k ← k1 · · · k N .
y ← y1 · · · y N .

On constate que l’algorithme de Vernam génère une clé aléatoire de même lon-
gueur que le message à chiffrer et que cette clé est utilisée pour ce seul message. Le
récipiendaire du message chiffré y, s’il connaît la clé k, exécute l’algorithme suivant :

Algorithme 10.2.3. Déchiffrement de Vernam


Require: Message chiffré y ∈ A+ clé k ∈ A+ avec |y| = |k|.
Ensure: Message déchiffré m0 ∈ A|y| .
N ← | y |.
for i ∈ {1, . . . , N } do
mi0 = yi − k i mod |A|.
end for
m0 = m10 · · · m0N .

Lemme 10.2.4. Si m0 est obtenu par l’application de l’algorithme 10.2.3 sur le cryptgramme
y produit par l’algorithme 10.2.2, alors
(
0 0 1 si m0 = m
P( M = m | M = m ) =
0 sinon.

Théorème 10.2.5 (Shannon [64]). Si la clé est


1. de longueur N = |m|,
2. utilisée une seule fois et
3. connue uniquement des deux partenaires légitimes,
alors l’algorithme de Vernam (10.2.2 et 10.2.3) est parfaitement sûr, i.e. il offre une sécurité
inconditionnelle.

Démonstration: Les variables aléatoires M ∈ M, K ∈ K et Y ∈ A N représentent res-


pectivement le message d’entrée, la clé et le message chiffré. Pour des m, k fixés, on

/Users/dp/a/ens/[Link] 153
2023-07-18 • 17:43:52.
10.2. Le chiffrement comme code Chiffrement

définit y := Tk (m) = m ⊕ k, où ⊕ désigne l’addition lettre par lettre modulo |A|.


Cette transformation induit un noyau stochastique déterministe
(
1 si y = Tk (m) = m ⊕ k
P(Y = y|K = k, M = m) := Pk (m, y) =
0 sinon.

Il est évident, par la construction de la clé, que P(K = k, M = m) = P(M = m)P(K =


k), car le choix du mot aléatoire K ne dépend pas de M. En outre,

P(M = m, Y = y) P(M = m, K = k, Y = y)
P( Y = y | M = m ) = = ∑
P( M = m ) k∈K
P( M = m )
P(Y = y|M = m, K = k)
= ∑ P( M = m )
P(M = m, K = k)
k∈K
1
= ∑ P(K = k)δy,m⊕k = P(K = y m) =
|A| N
, ∀m ∈ M.
k∈K

Le cryptogramme est donc équidistribué sur A N , indépendamment du message. On


calcule de même
P(m = m, Y = y) P(m = m, K = k, Y = y)
P( M = m | Y = y ) = = ∑
P( Y = y ) k∈K
P( Y = y )
P(Y = y|M = m, K = k)
= ∑ P( Y = y )
P(M = m, K = k)
k∈K
P( K = k)P( M = m ) P( K = y m )
= ∑ P( Y = y )
δy,m⊕k =
P( Y = y )
P( M = m )
k∈K
= P( M = m ).

On conclut que Y et M sont indépendants. De ce fait découle la sécurité incondition-


nelle du code de Vernam. 
Plusieurs formulations (équivalentes) de la sécurité inconditionnelle peuvent être
données :
— Le message est indépendant du cryptogramme, i.e. P(M = m|Y = y) = P(M =
m) ;
— L’information mutuelle entre message et cryptogramme s’annule, i.e. I (M :
Y) = 0 ;
— Tous le messages ont la même probabilité de produire un même cryptogramme
donné, i.e. pour tous k ∈ K et m, m0 ∈ M,

P(C (M, K) = y|M = m, K = k) = P(C (M, K) = y|M = m0 , K = k).

Exemple 10.2.6. Le résultat précédent implique qu’en absence de connaissance de la


clé, le seul moyen d’attaquer le code de Vernam est la recherche exhaustive des clés
dans K. Maintenant, supposons que le message initial est

m = wewonthebattlebutwedefinitelylostthewar

et que par une clé k il est codé en y. Un intrus qui ne connaît pas la clé k doit examiner
toutes les clés k0 ∈ K (étant donné que m = 39, il en existe 2639 = 1.53 × 1055 telles

/Users/dp/a/ens/[Link] 154
2023-07-18 • 17:43:52.
Chiffrement 10.3. Authentification

clés) et calculer tous les message m0 = y k0 . La plupart de messages ainsi obtenus


n’auront aucun sens. Mais il en existe qui ont un sens totalement différent, par exemple
parmi ces messages il trouvera bien sûr m mais aussi

m0 = overwhelminglyvictoriousovertheevilaxis

avec |m| = |m0 | = 39. Ce sont précisément


— l’uniformisation de la probabilité sur l’espace des message et
— la dégénérescence de la règle de décision
qui confèrent au code de Vernam son indéchiffrabilité.

10.2.2 Le rôle essentiel des nombres aléatoires


Insistons encore une fois sur l’importance d’un générateur qui permet de produire
des clés longues (aussi longues que le message à coder) et vraiment aléatoires. Il s’agit
d’une tache difficile — stricto sensu impossible, comme nous verrons dans le cours de
« Complexité » [58] — en algorithmique classique.
La quête d’algorithmes générant de nombres pseudo-aléatoires qui miment, autant que
faire se peut, les propriétés des nombres vraiment aléatoires est même source de manipulations
malveillantes. Rappelons en effet, quelques faits troublants.
En 2007, le National Institute of Standards and Technology (NIST) 5 a émis une recommanda-
tion 6 où il préconisait l’utilisation de 4 générateurs de nombres aléatoires. Parmi ces quatre
générateurs, le dual elliptic curve deterministic random bit generator (Dual_EC_DRBG) était floué.
Malgré les alertes de la communauté scientifique internationale, le NIST, pas seulement conti-
nuait sa préconisation mais militait activement pour que cet algorithme devienne un standard
ISO 7 . Au lieu de cryptographie, on est en présence d’une affaire de . . . cleptographie.
Après que l’affaire des révélations d’Edward Snowden éclate (en 2013), le NIST est obligé
d’admettre que l’algorithme est floué et publie, en 2015, une recommandation révisée 8 d’où il
retire l’algorithme incriminé. L’American Mathematical Society (AMS) initie la publication dans
ses Notices d’une série d’articles sur le thème « Mathematicians discuss the Snowden revela-
tion ». Dans cette série, apparaît un article 9 par Michael Wertheimer. Notons que l’AMS se sent
obligée d’apposer la précision « At the time of the writing of this piece Michael Wertheimer
was the Director of Research at the NSA ; he recently retired from that position » sur cet article.

10.3 Authentification
L’authentification d’un message consiste à fournir au destinataire légitime l’évi-
dence que le message reçu émane bien de l’expéditeur, même en présence d’un adver-
saire qui peut
— envoyer au destinataire des messages frauduleux de sa propre facture (non émis
par l’expéditeur), — on parle alors d’usurpation d’identité (impersonation en
anglais) — et/ou
5. Organisme dépendant du gouvernement des États-Unis dont les missions sont décrites à ce lien.
6. NIST Special Publication 800-90 : Recommendation for Random Number Generation Using Deter-
ministic Random Bit Generators (2007).
7. Organisation internationale de normalisation, reconnue par 162 pays dont les missions sont dé-
crites sur ce lien.
8. NIST Special Publication 800-90A Revision 1: Recommendation for Random Number Generation
Using Deterministic Random Bit Generators (2015).
9. Intitulé « Encryption and the NSA role in international standards ».

/Users/dp/a/ens/[Link] 155
2023-07-18 • 17:43:52.
10.3. Authentification Chiffrement

— intercepter les messages expédiés en les substituant par des messages fraudu-
leux générés par lui — on parle alors de substitution.
Dans ce paragraphe nous nous intéressons à une authentification informationnelle
(inconditionnelle) 10 c’est-à-dire, nous supposons que la partie adverse connaît tous
les algorithmes utilisés par les partenaires légitimes ; elle ignore uniquement la clé se-
crète qu’ils ont utilisée. Nous suivons les exposés [68, 67, 49]. Contrairement au cas de
cryptage, où le théorème de Shannon fournit comme définition du parfait chiffrement
l’indépendance entre les messages émis et chiffré, la situation est plus subtile dans le
cas de l’authentification. On ne connaît pas de définition d’authentification parfaite : on
peut rendre la probabilité de fraude (deceit probability en anglais) arbitrairement petite
— en utilisant une clé d’authentification suffisamment longue — sans jamais l’annuler.

10.3.1 Illustration du problème et notation


On considère deux partenaires A et B qui partagent une clé sécrète aléatoire K ∈ K,
où K est un ensemble fini.
1. A veut envoyer un message X choisi dans un ensemble fini X (typiquement
X = Am pour un certain alphabet fini A et m un entier strictement positif).
2. Pour le message X, A génère une clé K ∈ K (K un ensemble fini de clés)
pour l’authentifier. Les variables X et K sont supposées distribuées selon une
loi conjointe κ ( x, k ) = P( X = x, K = k ), avec x ∈ X et k ∈ K.
3. Pour authentifier le message (et éventuellement le crypter) A dispose d’une fa-
mille — indexée par K — de noyaux stochastiques (déterministes ou aléatoires)
M := ( Mk )k∈K de X à un autre ensemble Y (typiquement Y = An avec n > m)
et s’en sert pour préparer un message 11 Y ∈ Y destiné à être envoyé à B, i.e.
P(Y = y| X = x; K = k) = Mk ( x, y), x ∈ X, y ∈ Y, k ∈ K.
Il s’ensuit que la loi conjointe des variables X, K, Y est
P( X = x, K = k, Y = y) = P(Y = y| X = x, K = k )P( X = x, K = k )
= κ ( x, k) Mk ( x, y), x ∈ X, k ∈ K, y ∈ Y.
Les lois marginales se calculent de manière élémentaire :
µ(k, y) = P(K = k, Y = y) = ∑ P(X = x, K = k, Y = y)
x ∈X
= ∑ κ (x, k) Mk (x, y);
x ∈X
ρ ( k ) = P( K = k ) = ∑ κ (x, k);
x ∈X
ν ( y ) = P (Y = y ) = ∑ ∑ κ (x, k) Mk (x, y).
x ∈X k ∈K

10.3.2 Minoration de la probabilité de fraude (cas de substitution)


La partie adverse observe Y et tente de deviner la clé K. Si elle parvient, elle pourra
coder n’importe quel message X ∈ X de manière authentifiable par B et donc le substi-
10. Par opposition à une authentification algorithmique (calculatoire).
11. Ce message peut être le cryptogramme de X concaténé avec son sceau d’identification.

/Users/dp/a/ens/[Link] 156
2023-07-18 • 17:43:52.
Chiffrement 10.3. Authentification

tuer avec succés au message Y initialement envoyé à B. En résumé, l’adversaire tente


d’envoyer un message Ỹ ∈ Y qui serait
— interprété par B comme un message authentique et
— décodé comme un message particulier voulu par l’adversaire.
L’adversaire réussira son coup s’il devine correctement la clé car alors il pourra co-
der n’importe quel message et le faire admettre comme authentique. La probabilité
moyenne de réussite pour l’adversaire est donnée, pour une clé k, par ∑y∈Y ν(y) P(K =
k|Y = y). Pour se prémunir dans tous les scénarios, on doit considérer le maximum
sur les clés, donnée par la quantité
sub
βmax := ∑ ν(y) max
`∈K
P(K = `|Y = y).
y ∈Y

sub
Théorème 10.3.1. La probabilité moyenne β := βmax que l’adversaire réussisse sa tentative
de fraude par substitution est
β ≥ 2 − H ( K |Y ) .

Démonstration. Nous avons

H ( K |Y ) = ∑ H ( K |Y = y ) ν ( y )
y ∈Y

= ∑ ν(y)P(K = k |Y = y) (− log(P(K = k|Y = y)))


k∈K,y∈Y

≥− ∑ µ(k, y) log(max P(K = `|Y = y))


`∈K
k∈K,y∈Y

=− ∑ ν(y) log(max P(K = `|Y = y))


`∈K
k∈K,y∈Y
!
≥ − log ∑ ν(y) max
`∈K
P(K = `|Y = y) par l’inégalité de Jensen.
y ∈Y

10.3.3 Minoration de la probabilité de fraude (cas d’usurpation d’iden-


tité)
La partie adverse — qui tente d’usurper l’identité de A mais ignore la clé utilisée —
génère un message Ỹ ∈ Y selon une loi (arbitraire) q̃, i.e. P(Ỹ = y) = q̃(y) et l’envoie
de manière intempestive à B.
Le problème mathématique se pose donc comme un problème de test d’hypothèses
statistiques ; on note H0 l’hypothèse nulle signifiant que le message reçu par B est un
message authentique et H1 l’hypothèse alternative signifiant que le message reçu est
frauduleux.
Pour décider quel est le cas qui prévaut, le partenaire B dispose d’une famille —
indexée par K — de règles de décision (∆k )k∈K , i.e. des applications ∆k : Y → D :=
{0, 1}, où D désigne l’espace de décisions ; les valeurs 0 ou 1 prises par ∆k signifient res-
pectivement que H0 ou H1 sont acceptées, i.e. que le message est respectivement jugé
« authentique » ou « frauduleux ». Pour chaque k, la règle de décision permet donc de

/Users/dp/a/ens/[Link] 157
2023-07-18 • 17:43:52.
10.3. Authentification Chiffrement

partitioner l’ensemble Y en deux sous-ensembles disjoints Yk (0) := {y ∈ Y : ∆k (y) =


0} et Yk (1) := {y ∈ Y : ∆k (y) = 1}.
Le partenaire B reçoit donc un message
(
Y si l’hypothèse H0 prévaut,
Ŷ =
Ỹ si l’hypothèse H1 prévaut

et doit se servir de sa règle de décision pour départager les deux cas. Il est alors évident
que, sur l’évènement {Ŷ = y},

P(K = k, ∆k (y) = 1| H0 ) = µ(k, y),


P(K = k, ∆k (y) = 0| H1 ) = ρ(k )q̃(y).

Sous les conditions et notations du paragraphe précédent, on définit

α= ∑ µ(k, z),
z ∈Yk (1 )

β= ∑ ρ(k )q̃(z).
z ∈Yk (0 )

On voit que α représente l’erreur de première espèce (juger le message non authentique
tandis qu’il l’est) et β l’erreur de deuxième espèce (juger le message authentique tandis
qu’il ne l’est pas) ; β représente donc la probabilité que l’adversaire réussisse son coup.
On introduit deux vecteurs de probabilité p0 et p1 sur l’espace des décisions D,
définis par
p0 = (1 − α, α) et p1 = ( β, 1 − β),
où α, β désignent les erreurs de type I et II respectivement. Par ailleurs, on introduit
deux vecteurs de probabilité q0 et q1 sur Y, définis pour chaque k ∈ K fixé, par

q0 = µ(k, ·) et q1 = ρ(k )q̃(·).

Lemme 10.3.2. Les espaces probabilisés (Y, q0 ) et (Y, q1 ) sont des fragmentations (cf. défi-
nition 7.3.5) des espaces probabilisés (D, p0 ) et (D, p1 ).
Démonstration. Par simple vérification.
Théorème 10.3.3. Sous les conventions et avec les notations précédentes, on définit
1−α α
d(α, β) := D ((1 − α, α)k( β, 1 − β)) = (1 − α) log + α log .
β 1−β
Nous avons alors
d(α, β) ≤ D (µkρ ⊗ q̃).
En particulier, β ≥ 2− I (K:Y ) .
Démonstration. La majoration D ((1 − α, α)k( β, 1 − β)) ≤ D (µkρ ⊗ q̃) est une consé-
quence directe du lemme 10.3.2 et de la proposition 7.3.6 (qui établit que la fragmenta-
tion augmente le contraste). Cette majoration est valable pour tout vecteur de probabi-
lité q̃ sur Y. On peut donc optimiser le second membre pour obtenir

d(α, β) ≤ inf D ( µ k ρ ⊗ q 0 ) ≤ D ( µ k ρ ⊗ ν ),
q0 ∈M 1 (Y)

/Users/dp/a/ens/[Link] 158
2023-07-18 • 17:43:52.
Chiffrement 10.4. Qu’est-ce la cryptographie post-quantique ?

car ν n’est pas nécessairement optimal. Or, D (µkρ ⊗ ν) = I (K : Y ), car


I (K : Y ) = H (K ) + H (Y ) − H (K, Y )
=− ∑ ρ(k) log ρ(k) − ∑ ν(y) log ν(y) + ∑ µ(k, y) log µ(k, y)
k ∈K y ∈Y (k,y)∈K×Y
µ(k, y)
= ∑ µ(k, y) log
ρ(k)ν(y)
(k,y)∈K×Y
= D ( µ k ρ ⊗ ν ).
En particulier, d(0, β) = − log β ≤ I (K : Y ), par conséquent la probabilité d’usur-
pation d’identité sera minorée par
β ≥ 2− I (K:Y ) .

Remarque 10.3.4. Nous constatons que si K et Y sont de variables aléatoires indépen-


dantes, les probabilités de fraude (par substitution ou par usurpation d’identité) sont
égales à 1. Contrairement donc au cryptage, où l’indépendance entre K et Y est la ga-
rante de l’indéchiffrabilité du code, ici un certain degré de dépendance est nécessaire
rien que pour obtenir une minoration non-triviale de la probabilité de fraude. Il faut
encore montrer que cette minoration est essentiellement atteinte, ce qui a été prouvé
dans [72] à l’aide des fonctions de hachage universelles.

10.4 Qu’est-ce la cryptographie post-quantique ?


Nous avons déjà évoqué dans ce cours les notions de cryptographie quantique et
de calcul quantique. Récemment un nouveau terme est apparu : la cryptographie post-
quantique dont la sémantique ne reflète pas très clairement son objet d’étude. Une cla-
rification est donc nécessaire car tous ces termes mélangent des aspects algorithmiques
et des aspects de réalisation physique de dispositifs de communication. En nous limi-
tant à la partie algorithmique nous distinguons :
Le calcul quantique : appelé quantum computing en anglais, englobe les algorithmes
qui exploitent les spécificités de la physique quantique pour réduire la com-
plexité algorithmique du problème.
La cryptographie quantique : décrit l’ensemble de protocoles qui exploitent les spé-
cificités de la physique quantique pour communiquer en offrant un chiffrement
inconditionnel de l’information. Ces protocoles et leurs implémentation phy-
sique sont basés sur la distribution inviolable d’une clé privée.
La cryptographie post-quantique : désigne des algorithmes cryptographiques clas-
siques à clé publique dont la complexité algorithmique ne permettrait pas leur
déchiffrement (en un temps raisonnable) par l’avènement éventuel d’un ordina-
teur quantique. Elle ne doit pas être confondue avec la cryptographie quantique
qui est une cryptographie exploitant les phénomènes quantiques pour parvenir
à ses fins.
Récemment, une compétition internationale 12 est lancée par le NIST sur la recherche
algorithmique post-quantique « pour solliciter, évaluer et standardiser un ou plusieurs
12. To solicit, evaluate, and standardize one or more quantum-resistant public-key cryptographic algorithms.
[Link]

/Users/dp/a/ens/[Link] 159
2023-07-18 • 17:43:52.
10.5. Exercices Chiffrement

algorithmes cryptographiques à clé publique, incassables par des ordinateurs quan-


tiques ».

10.5 Exercices

/Users/dp/a/ens/[Link] 160
2023-07-18 • 17:43:52.
Codes correcteurs d’erreur
11
Or rappelle qu’un système de communication est décrit par la figure 9.3. Le théo-
rème fondamental de transmission 9.5.4 garantit l’existence d’un codage permettant
la communication sans erreur à travers un canal K = (X, Y, P) pourvu que le taux
de transmission R < cap( P) = supµ∈M1 (X) I ( X : Y ), où µ est la loi de la variable X
à l’entrée du canal. Ce résultat s’obtient en imposant une rarefaction des messages à
transmettre, i.e. |M| < |Xn |, qui a comme conséquence d’utiliser un codage redondant
pour chaque message. Cependant, ce résultat est existentiel. Dans ce chapitre nous
allons construire des codes effectifs dans le cas où M ' Xl , avec l < n. Une telle
raréfaction induit un taux de transmission

log |Xl | l
R= = .
log |X |
n n

En contrepartie, la redondance qu’elle impose permet la correction des erreurs com-


mises.

11.1 Structure algébrique des codes


Très souvent dans les applications, les alphabets d’entrée et de sortie du canal vé-
rifient X = Y = {0, 1}. Dans ce cas, l’alphabet {0, 1}, muni de l’addition modulo
2 — notée + — coïncide avec le groupe abélien Z2 des congruences modulo 2 ; il se
trouve que le groupe (Z2 , +) muni d’une multiplication est aussi un corps. Munir les
alphabets d’une structure algébrique présente plusieurs avantages comme on le verra
dans ce chapitre. En particulier, cela permet d’identifier les mots sur l’alphabet à des
vecteurs dans un espace vectoriel.
Des alphabets plus généraux sont aussi possibles. Pour tout entier q = pe , où p est
premier et e > 0, Fq désigne le corps fini à q éléments. Si e = 1, alors, Fq = Zq (i.e. Zq
est un corps) mais si e > 1, alors, le groupe abélien Zq n’est qu’un anneau mais il n’est
plus un corps car pe = 0 et p est un diviseur de 0.

161
11.2. Structure géométrique des codes Codes correcteurs d’erreur

Pour p > 1 premier et q = pe , soit f ( x ) un polynôme primitif à coefficients dans


−1
Z p , i.e. un polynôme f ( x ) = ∑ie= i
0 ai x de degré e avec ( ai )i =0,...,e−1 une famille d’élé-
ments de Z p tel que f ait une racine α qui engendre tout le corps Fq , i.e. Fq :=
{0, 1, α, α2 , . . . , αq−2 }.
Exemple 11.1.1. Puisque q = 4 = 22 = p2 , le corps F4 ne coïncide pas avec Z4 . Le
polynôme f ( x ) = x2 + x + 1 n’a pas de racines dans Z2 car f (0) = f (1) = 1. Si α est
une racine de f , en adjoignant les éléments de la forme a + bα, a, b ∈ Z2 , on voit que le
corps fini F4 a 4 éléments : F4 = {0, 1, α, α2 }. On vérifie immédiatement que α2 = 1 + α,
i.e. α et 1 + α sont l’inverse l’un de l’autre.
Il faut cependant garder à l’esprit que tous les alphabets X (à un nombre |X| ar-
bitraire d’éléments) ne peuvent pas être mis en correspondance avec des corps finis.
Pour cela, il faut que |X| = pe avec p premier et e ∈ N. Nous avons en effet le
Théorème 11.1.2. Soit F un corps fini. Alors sa caractéristique 1 est un premier p et F peut
être considéré comme un espace vectoriel sur Z p . La dimension e = dimZ p F de cet espace
vectoriel est le degré de l’extension (F : Z p ), i.e. |F| = pe .
Démonstration. Voir, par exemple, [70, Théorème 12.15, p. 224].
L’identification de l’alphabet X avec un corps fini Fq s’étend à une identification
entre l’ensemble des mots de longueur n et le Fq -espace vectoriel de dimension n. Plus
précisément, il existe deux bijections V : Xn → Fnq et W : Fnq → Xn (V pour « vecteur »
et W pour « word ») définies par
 
x1
 .. 
X 3 ξ = x1 · · · xn 7→ V(ξ ) = x =  .  ∈ Fnq , x1 , . . . , xn ∈ Fq
n

xn
et  
x1
Fnq 3 x =  ...  7→ W(x) = ξ = x1 · · · xn ∈ Xn
 
xn
qui sont l’inverse l’une de l’autre : W−1 = V et V−1 = W.

11.2 Structure géométrique des codes


11.2.1 Métrisation de Hamming
Définition 11.2.1. Soit X un alphabet fini avec q = |X| puissance d’un premier, iden-
tifié avec le corps fini Fq . Pour n ∈ N> , on identifie l’ensemble de mots Xn avec le
Fq -espace vectoriel Fnq . Pour deux mots ξ = x1 · · · xn et ξ 0 = x10 · · · xn0 on définit leur
distance de Hamming 2 par
n
d(ξ, ξ 0 ) := d H (ξ, ξ 0 ) = ∑ (1 − δxi ,xi0 ).
i =1

1. On rappelle que la caractéristique d’un corps unifère est le plus petit entier n tel n · 1 = 0.
2. Vérifier que d H est bien une distance.

/Users/dp/a/ens/[Link] 162
2022-01-07 • 10:22:29.
Codes correcteurs d’erreur 11.2. Structure géométrique des codes

Cette distance induit une distance, aussi notée d H , sur Fnq par d H (x, x0 ) := d H (W(x), W(x0 )).
L’espace (Xn , d H ) devient un espace métrique isomorphe à l’espace vectoriel métrisé
(Fnq , d H ).

Le poids de Hamming, w(ξ ), d’un mot ξ ∈ Xn est défini par

w(ξ ) = d H (ξ, 0n ) = d H (V(ξ ), 0).

Exemple 11.2.2. Pour q = 2, on identifie X = F2 = {0, 1}. Pour n = 3, on calcule


d H (000, 111) = d H (0,√1) = 3 = w(111) (à ne pas confondre donc avec la distance
euclidienne d(0, 1) = 3).

Dans tout ce qui suit, les alphabets d’entrée et de sortie du canal sont identiques,
isomorphes à Fq (X = Y ' Fq ), avec q puissance d’un premier (le plus souvent q = 2
et X = Y = {0, 1}). S’il n’y a pas d’ambiguïté, nous ne ferons plus la distinction entre
ces espaces. Un code est une application C : Xl → Xn avec n ≥ l.

Définition 11.2.3. 1. Un code C : Xl → Xn est dit linéaire si C est une applica-


tion linéaire. Comme tout code peut être identifié à son glossaire G := G(C ) =
C (Xl ), un code linéaire est identifié au sous-espace vectoriel C (Flq ) de Fnq .
2. La dimension du code linéaire C est la dimension du sous-espace vectoriel en-
gendré par son glossaire k = dim C (Flq ).
3. La distance minimale, d, du code est la distance de Hamming minimale entre
deux mots distincts du glossaire

d = min d(x, x0 ).
x,x0 ∈G
x6=x0

4. On note (n, ql ), ou plus précisément (n, ql , d), le code linéaire sur l’alphabet Fq
agissant sur des blocs de taille l, produisant des blocs de taille n et à distance
minimale d. Une autre notation 3 , qui privilégie la dimension du glossaire k =
dim G , est [n, k ], ou plus précisément [n, k, d].
5. Si des bases sont fixées dans Flq et Fnq , le code linéaire C : Xl → Xn est représenté
par une matrice de Ml,n (Fq ) dépendante des bases choisies.

11.2.2 Matrice génératrice


On cherche une écriture systématique pour la matrice représentant le code. Soit
[n, k, d] un code linéaire C et G la matrice qui le représente. Si k < l, tous les vecteurs
de Flq ne donneront pas d’images indépendantes. On peut donc se limiter à représenter
C par une matrice G de taille k × n correspondant à une application linéaire injective
Fkq → G(C ) définie par
xt G = yt ,
où (·)t désigne le vecteur transposé, x ∈ Fkq et y ∈ Fnq . Cette matrice est appelée géné-
ratrice du code.
Dans la suite, on admettra, sans perte de généralité, que l = k.

3. Noter la différence de notation (n, ql , d) et [n, k, d].

/Users/dp/a/ens/[Link] 163
2022-01-07 • 10:22:29.
11.2. Structure géométrique des codes Codes correcteurs d’erreur

Proposition 11.2.4. Soit C un [n, k]-code linéaire sur Fq et (e1 , . . . , ek ) une base arbitraire
du glossaire G . La matrice génératrice de C est
 
e1t
G =  ...  ∈ Mk,n .
 
etk

On peut par des opérations sur les lignes de G, i.e. par un changement de base, la
ramener à sa forme systématique

G := G (C ) = [ Ik | A],

où Ik est la matrice identité k × k et A ∈ Mk,n−k (Fq ).

Exemple 11.2.5. Soit X = {0, 1} (donc q = |X| = 2).


1. Le [n, 1, n] code linéaire dont la matrice génératrice est G = [1| 1| ·{z
· · 1}] est le code
n −1
à répétition Rn . Le glossaire du code est G := G(Rn ) = {0n , 1n }.
2. Le [k + 1, k, k − 1] code linéaire dont la matrice génératrice (sous sa forme systé-
matique) est donnée par G = [ Ik | A] avec
   
−1 1
 ..   .. 
A =  .  =  .  ∈ Mk,1 ,
−1 1

est le code de test de parité Pn avec n = k + 1. Par exemple si k = 2, les en-


trées possibles sont {00, 01, 10, 11} et le glossaire du code P3 est G := G(P3 ) =
{000, 011, 101, 110} avec d = 2.
3. Le code de Hamming H AM (7, 4) est un code linéaire [7, 4, 3] qui a comme ma-
trice génératrice (sous sa forme systématique) la matrice G = [ I4 | A], avec
 
1 0 1
1 1 0
A=  ∈ M4,3 .
1 1 1
0 1 1

La matrice A effectue un test de parité sur les sous-ensembles différents à 3 (des


4) bits d’entrée, i.e. le glossaire est

G := G( H AM (7, 4)) = {y ∈ F72 : xt G = yt , x ∈ F42 }

et les mots qui le composent vérifient yi = xi , pour i = 1, . . . , 4, et

y5 = x1 + x2 + x3
y6 = x2 + x3 + x4
y7 = x1 + x3 + x4 .

/Users/dp/a/ens/[Link] 164
2022-01-07 • 10:22:29.
Codes correcteurs d’erreur 11.2. Structure géométrique des codes

11.2.3 Matrice de contrôle de parité


Dans les exemples précédents, nous avons examiné de [n, k ]-codes avec k et n petits.
Il était alors simple de construire explicitement le glossaire du code. Lorsque k et n sont
grands, il n’est pas efficace de générer d’emblée tout le glossaire du code. Il est donc
intéressant de disposer d’un algorithme efficace pour vérifier si un vecteur donné de
Fnq fait partie du glossaire du code.

Définition 11.2.6. Soit C un [n, k ]-code sur un corps F. Une matrice H := H (C ) à n


colonnes sur F est dite matrice de contrôle de parité si

g ∈ G(C ) ⇐⇒ Hg = 0,

i.e. G(C ) = ker H (C ).


Remarque 11.2.7. La notation est particulièrement malencontreuse (mais standard)
comme H désigne aussi la fonction entropie. La signification sera cependant claire par
le contexte ; à défaut, elle sera explicitement précisée.
Le nombre de lignes de H n’est pas précisé dans la définition précédente. Cepen-
dant, lorsque l = k = rg G (C ) = dim G , alors nous avons la
Proposition 11.2.8. Soit C un [n, k ]-code et G = [ Ik | A] ∈ Mk,n (F) sa matrice génératrice
sous sa forme systématique, avec A ∈ Mk,n−k (F). Alors la forme systématique de la matrice
de contrôle de parité est
H = [− At | In−k ] ∈ Mn−k,n (F).
Démonstration. g ∈ G(C ) si, et seulement si, il existe x ∈ Fk tel que xt G = gt ; par
conséquent, g = G t x. On aura alors Hg = HG t x = 0, pour tout x ∈ Fk . Ceci entraîne
que HG t = 0. Or
 
Ik
t t  = − At Ik + In−k At = − At + At = 0.
HG = [− A | In−k ] 
A t

Exemple 11.2.9. Pour des alphabets d’entrée et de sortie binaires, identifiés à F2 , la


matrices H de test de parité
— pour le code à répétition Rn est
   
−1 1
 ..   .. 
H (Rn ) = [ B| In−1 ] ∈ Mn−1,n , avec B =  .  =  .  ∈ Mn−1,1 = G (Pn );
−1 1

— pour le code de test de parité Pn est

H (Pn ) = G (Rn );

— pour le code H AM (7, 4) est


 
1 1 1 0 1 0 0
H ( H AM (7, 4)) = 0 1 1 1 0 1 0 .
1 0 1 1 0 0 1

/Users/dp/a/ens/[Link] 165
2022-01-07 • 10:22:29.
11.3. Décodage Codes correcteurs d’erreur

Définition 11.2.10. Soit C un [n, k ] code sur Fq dont le glossaire est G . Le code dual est
défini par son glossaire
n −1
G ⊥ = {x ∈ Fnq : x · g = xt g := ∑ xj gj mod q = 0, ∀g ∈ G},
j =0

i.e. le code dual C ⊥ de C est le [n, n − k]-code dont le glossaire G( G ⊥ ) = G ⊥ ( G ) est


l’orthogonal du glossaire du code C.

11.3 Décodage
11.3.1 Maximum de vraisemblance
Le problème que nous voulons résoudre est illustré par l’exemple suivant.
Exemple 11.3.1. Un message m ∈ F2k est codé en un message x := C (m) ∈ F2n , avec
n ≥ k. Le message x est ensuite transmis à travers un canal symétrique binaire qui
change avec probabilité p < 1/2 un bit en son opposé. Le message transmis est alors
une variable aléatoire Y à valeurs dans F2n de loi conditionnelle

Qn (x, y) = P(Y = y|X = x) = pd(x,y) (1 − p)n−d(x,y)


 d(x,y)
n p
= (1 − p ) .
1− p
— Peut-on détecter qu’un message transmis y contient des erreurs ?
— Si oui, peut-on choisir un message ŷ qui corrige l(es) erreur(s) de transmission ?
Le théorème de Neyman-Pearson (théorème 6.2.16, page 73) établit l’optimalité de
la règle de décision du maximum de vraisemblance ; l’exercice 102 (page 144) donne un
exemple concret de l’application de ce résultat au problème de décodage. En applicant
ce résultat ici, on voit que le message qui estime « le mieux » le message transmis est
donné par la règle du maximum de vraisemblance ŷ = ∆ MV (x), où

∆(x) := arg maxn Qn (x, z)


z∈F2
 d(x,z)
p
= arg maxn
z ∈ F2 1− p
= arg minn d(x, z) ∈ F2n (car p < 1/2).
z ∈ F2

La règle probabiliste du maximum de vraisemblance est donc équivalente à un ré-


sultat purement géométrique de minimisation de la distance de Hamming entre des
mots du code appelé décodage par le plus proche voisin.
Définition 11.3.2. Soient x ∈ Fnq (pour q puissance d’un premier) et r > 0. La boule
de Hamming 4 est donnée par

Bn,r (x) = {y ∈ Fnq : d(x, y) ≤ r } ⊆ Fnq .


4. Dans la littérature, cette boule est désignée par le terme erroné de sphère de Hamming !

/Users/dp/a/ens/[Link] 166
2022-01-07 • 10:22:29.
Codes correcteurs d’erreur 11.3. Décodage

Une boule de Hamming est centrée sur chaque mot g ∈ G du glossaire. Tout
y ∈ Bn,r (g) sera donc décodé par l’estimation ŷ = arg minz∈F2n d(g, z) = g ∈ G . On
voit donc immédiatement les contraintes d’un bon décodage par maximum de vrai-
semblance :
1. Le rayon r de la boule doit être aussi grand que possible pour que le maximum
des mots de Fnq se trouvent dans une boule de Hamming.
2. Le rayon r doit être suffisamment petit pour que les boules de la famille { Bn,r (g), g ∈
G} soient disjointes de sorte que chaque mot dans la boule puisse être décodé
sans ambiguïté. Cette dernière condition sera vérifiée dès que r < 21 d, où d est la
distance minimale du code.
Exemple 11.3.3. Soit C = R3 le code à répétition sur F2 . Il s’agit d’un [3, 1, 3]-code.
L’estimateur du plus proche voisin corrigera une erreur si r ≤ 1. Le glossaire de ce
code est G = {000, 111} et les boules de Hamming de rayon 1 sont

B3,1 (000) = {000, 001, 010, 100} et B3,1 (111) = {111, 011, 101, 110}.

On constate que B3,1 (000) t B3,1 (111) = F32 . Tout mot de F32 peut donc être décodé sans
ambiguïté et le code corrige toute erreur qui modifie la valeur d’un bit.
Lemme 11.3.4. Un code linéaire C sur le corps F, avec distance minimale d, permet de corriger
jusqu’à t = b d− 1
2 c erreurs.

Démonstration. Supposons que d ≥ 2t + 1, que le mot g ∈ G est envoyé et qu’un bruit


additif e corrompt le message, i.e. le message reçu est y = g + e ∈ Fn . Supposons que
le poids de Hamming du bruit vérifie w(e) ≤ t, donc

d(g, y) = d(0, y − g) = w(e) ≤ t.

Pour tout g0 ∈ G , avec g0 6= g, on a

2t + 1 ≤ d ≤ d(g, g0 ) ≤ d(g, y) + d(y, g0 ).

On aura donc,

d(y, g0 ) ≥ d(g, g0 ) − d(g, y) ≥ 2t + 1 − t = t + 1 > d(g, y).

Le mot y sera donc décodé par l’estimation ŷ = ∆(y) = g qui est le mot effectivement
envoyé (avec toutes les erreurs de transmission corrigées).
Réciproquement, supposons que d < 2t + 1. Il s’ensuit que d ≤ 2t. Par définition de
d, il existe deux mots différents g et g0 du glossaire différent exactement sur d positions,
i.e. d = d(g, g0 ). Il existe alors x ∈ Fn avec d(g, x) ≤ t et d(g0 , x) ≤ t. Par exemple,
en modifiant g en b 2d c positions, on obtient un tel x. Or l’estimation x̂ sera ambiguë car
tant g que g0 sont à distance inférieure à d de x.
Pour un [n, k ]-code sur Fq , les k qits sont appelés qits d’information tandis que les
n − k qits restants, qits de contrôle.
Théorème 11.3.5 (Empilement de boules de Hamming). Soit C un [n, k, d]-code linéaire
sur Fq permettant de corriger t erreurs (t ≤ b d− 1
2 c). Alors,
t
Vq (n, t) := ∑ Cnr (q − 1)r ≤ qn−k .
r =0

/Users/dp/a/ens/[Link] 167
2022-01-07 • 10:22:29.
11.3. Décodage Codes correcteurs d’erreur

Démonstration. Pour chaque mot du glossaire, g ∈ G , il existe une boule de Hamming,


Bn,t (g), centrée sur g et de rayon t. On a

| Bn,t (g)| = |{x ∈ Fnq : d(x, g) ≤ t}|


= | trt =0 {x ∈ Fnq : d(x, g) = r }|
t
= ∑ |{x ∈ Fnq : d(x, g) = r}|.
r =0

Or, pour chaque g, les mots dans {x ∈ Fnq : d(x, g) = r } diffèrent de g en exactement r
indices. Si i est un tel indice, xi peut prendre n’importe quel valeur xi ∈ Fq \ { gi }. Par
conséquent, le volume Vq (n, r ) = |{x ∈ Fnq : d(x, g) = r }| = Cnr (q − 1)r .
On a donc
t
| Bn,t (g)| = ∑ Cnr (q − 1)r .
r =0

Or, dim G = k, donc il existe qk mots différents dans G . Les boules Bn,t (g) centrées sur
les mots du glossaire sont disjointes car leur rayon est inférieur à d/2. Comme elles
sont toutes contenues dans Fnq , on a de manière évidente,

t
∑ | Bn,t (g)| = qk ∑ Cnr (q − 1)r ≤ qn .
G
Bn,t (g) =
g∈G g∈G r =0

Ce dernier résultat peut-être lu dans l’autre sens.

Corollaire 11.3.6. Soit C code sur Fq ayant un glossaire G de dimension k (i.e. k qits d’infor-
mation). Pour que le code puisse corriger t erreurs, il faut qu’il dispose de n − k qits de contrôle,
où !
t
n − k ≥ logq ∑ Cnr (q − 1)r .
r =0

Corollaire 11.3.7. Soit C un [n, k]-code sur F2 permettant de corriger t erreurs. Asymp-
totiquement, lorsque limn,t→∞ , avec limn→∞ nt = x ∈ [0, 1], le taux de transmission R =
limn→∞ k/n du code vérifie
1 − R ≥ H2 ( x ),
où H2 ( x ) = − x log2 x − (1 − x ) log2 (1 − x ) est l’entropie binaire.

Démonstration. La borne d’empilement, établie en théorème 11.3.5, garantit que

t
n
2 ≥2 k
∑ Cnr ≥ 2k Cnt .
r =0

On conclut en utilisant l’approximation de Stirling pour le factoriel : n!  (n/e)n 2πn.

/Users/dp/a/ens/[Link] 168
2022-01-07 • 10:22:29.
Codes correcteurs d’erreur 11.3. Décodage

Les deux corollaires précédents, montrent qu’afin de maximiser le taux de trans-


mission, il faut choisir M = |G| aussi grand que possible pourvu que la borne d’empi-
lement de Hamming soit vérifiée ; ils établissent une borne supérieure sur M = qk . Plus
précisément, on s’intéresse à un (n, M)-code sur Fq de glossaire G , avec M := Mn = |G|
et distance minimale d := dn = d(G). On note

Aq (n, d) := max{|G| : G ⊆ Fnq , d(G) = d}.

Le théorème 11.3.5 montre que


!
t
Aq (n, d) ∑ Cnr (q − 1)r ≤ qn ,
r =0

où t = b(d − 1)/2c. La borne de Gilbert-Varhsamov, établie en théorème 11.3.8, donne


une borne inférieure.

Théorème 11.3.8 (Borne de Gilbert-Varshamov). Soient q ≥ 2 et n ≥ d ≥ 1. Alors


!
d −1
Aq (n, d) ∑ Cnr (q − 1)r ≥ qn .
r =0

Démonstration. Parmi tous le codes ayant q, n et d fixés, soit G le (glossaire du) code
qui maximise la taille du glossaire, i.e. M = |G| = Aq (n, d). Les boules de Hamming
Bd−1 (g) = {x ∈ Fnq |d(g, x) ≤ d − 1}, où g ∈ G , doivent couvrir Fnq . En effet, si y ∈ Fnq
n’appartient pas à la boule Bd−1 (g), cela signifie que d(g, y) ≥ d ; si y n’appartenait à
aucune des boules cela signifierait que d(y, g) ≥ d pour tout g ∈ G . Par conséquent,
le code dont le glossaire serait G 0 = G ∪ {y} aurait les mêmes paramètres q, n, d mais
avec |G 0 | > |G| ; ceci contredirait la maximalité de G . Maintenant,
d −1
| Bd−1 (g)| = ∑ Cnr (q − 1)r ,
r =0

tandis que la réunion (pas nécessairement disjointe) de ces boules couvre Fnq .
Dans la plupart de cas, la différence entre les bornes supérieure et inférieure de
Aq (n, d) est grande et sa valeur précise est en général difficile à calculer. On peut ce-
pendant délimiter une région entre les deux bornes asymptotiques (lorsque n → ∞) en
remarquant que si, limn→∞ d− 1 2t
n = limn→∞ n = z ∈ [0, 1], alors, dans le cas q = 2, on a
l’encadrement
1 − H (z/2) ≤ R ≤ 1 − H (z), z ∈ [0, 1],
où H désigne la fonction entropie.

Définition 11.3.9. Un [n, k, d]-code C sur Fq pour lequel la borne du théorème 11.3.5
est saturée, i.e.
t
∑ Cnr (q − 1)r = qn−k ,
r =0
est dit parfait.

Exemple 11.3.10. Sur F2 , les codes Rn avec n ∈ 2N + 1 et H AM (7, 4) sont parfaits.

/Users/dp/a/ens/[Link] 169
2022-01-07 • 10:22:29.
11.3. Décodage Codes correcteurs d’erreur

1
1 − H (z)

Taux de transmission R
0.8 1 − H (z/2)
Codes réalisables
0.6

0.4

0.2

0
0 0.2 0.4 0.6 0.8 1
z

Figure 11.1 – Bornes supérieure et inférieure asymptotiques du taux de transmission en fonction


du rapport z = limn→∞ nd .

11.3.2 Décodage par partition


On se place de nouveau dans le cas d’un [n, k ]-code linéaire C sur Fq . Une autre
méthode systématique de décodage consiste en la construction d’une partition de l’es-
pace d’arrivée (qui induit une relation d’équivalence) et la construction d’un représen-
tant dominant pour chaque classe d’équivalence. Plus précisément, on note X = Fkq ,
Y = Fnq (avec n > k), les espace d’entrée et de sortie du code, G = {g0 , . . . gK −1 } son
glossaire avec |G| = K := qk et L = qn−k .
Algorithme 11.3.11. Partition de l’espace de codage
Require: k, n, q, G
Ensure: Partition Y = trL=−01 Yr ; suite des représentants dominants yr ∈ Yr pour r =
0, . . . , L − 1
K ← qk
L ← qn−k
Y0 ← G
y0 ← 0
for r ← 1, . . . , L − 1 do
yr ← arg minz∈tr−1 Ys w(z)
s =0
Yr ← y r + G
end for

Il est évident que la numérotation des classes n’est pas unique car plusieurs élé-
ments peuvent avoir le même poids. Cependant, pour chaque décomposition fixée, la
famille (Yr )r=0,...,L−1 est une partition de Y ; il s’ensuit que (pour cet ordre)
∀y ∈ Y, ∃!r ∈ {0, . . . , L − 1} et ∃!s ∈ {0, . . . , K − 1} : y = yr + gs .
On appelle indice pivot de la partition, et on le note r p ,
d−1
r p = max{r ∈ {0, . . . , L − 1} : w(yr ) ≤ t = b c.
2

/Users/dp/a/ens/[Link] 170
2022-01-07 • 10:22:29.
Codes correcteurs d’erreur 11.3. Décodage

Lemme 11.3.12. Soit (Yr )r=0,...,L−1 une partition de Y pour un [n, k ]-code linéaire sur Fq et
G = {g0 , . . . , gK−1 } son glossaire. On note yr le représentant dominant de la classe Yr . Soit
y ∈ Y.
1. Si y = yr + gs pour un r ∈ {0, . . . , L − 1} et s ∈ {0, . . . , K − 1}, alors gs est à
distance au plus w(yr ) de y dans G .
2. Si r ≤ r p , où r p est l’indice pivot de la partition (i.e. w(yr ) ≤ t), alors gs est l’unique
élément de G à distance au plus w(yr ) de y. On pourra donc décoder, sans erreur, y par
ŷ = gs .
Démonstration. 1. Supposons que gs ne soit pas à distance au plus w(yr ) de y. Il
existe donc un gs0 ∈ G tel que d(y, gs0 ) < d(y, gs ). Puisque pour tout x, x0 ∈ Fnq ,
nous avons d(x, x0 ) = w(x − x0 ), il s’ensuit que w(y − gs0 ) < w(y − gs ) = w(yr ).
Par ailleurs, y − gs0 = yr + (gs0 − gs ) ∈ yr + G = Yr . Ceci contredit l’hypothèse
que yr est un représentant dominant de la classe de congruence Yr .
2. Maintenant r < r p , i.e. w(yr ) ≤ t. Supposons qu’il existe gs0 ∈ G tel que
d(y, gs0 ) < d(y, gs ). On aura alors

d( g s , g s 0 ) ≥ d
> 2t ≥ 2d(y, gs ) = d(y, gs ) + d(y, gs )
≥ d(y, gs ) + d(y, gs0 ) ( car d(y, gs0 ) < d(y, gs ))
≥ d(gs , gs0 ) (par l’inégalité triangulaire).
Ceci mène à l’inégalité impossible d(gs , gs0 ) > d(gs , gs0 ).

Exemple 11.3.13. (Partition de l’espace de codage pour R4 sur F2 ). Il s’agit d’un


[4, 1, 4]-code sur {0, 1} qui permet de corriger t ≤ b d−2 1 c = 1 erreur. Ici K = 24 = 16 et
L = 23 = 8.
r yr w ( yr ) Yr
0 0000 0 {0000, 1111}
1 0001 1 {0001, 1110}
2 0010 1 {0010, 1101}
3 0100 1 {0100, 1011}
4 1000 1 {1000, 0111}
5 0011 2 {0011, 1100}
6 0101 2 {0101, 1010}
7 0110 2 {0110, 1001}

Table 11.1 – Par abus de notation, on écrit y = ξ au lieu de y = V(ξ ). Pour ξ ∈ {0, 1}4 , le trait
discontinu sépare les classes dont le représentant dominant a un poids inférieur ou égal à t des autres.
Le dernier indice avant le trait est dit indice pivot, noté r p ; dans cet exemple r p = 4. Supposons
que 1111 est transmis mais le bruit le corrompt en 0111. En cherchant dans le tableau précédent, on
constate que y = 0111 ∈ Y4 et y = y4 + g1 . Par conséquent, g1 = 1111 est à distance 1 = w(y4 )
de y dans G . Comme 4 ≤ r p , 1111 est l’unique élément de G à distance 1 de y et on le décode sans
erreur ∆(0111) = 1111. Si y = 0101 est reçu, on constate que y ∈ Y6 . Alors 0000 est à distance 2
de y dans G ; mais comme 6 > r p , rien ne garantit que 0000 est l’unique élément de G à distance 2
de 0101. En effet 1111 l’est aussi.

/Users/dp/a/ens/[Link] 171
2022-01-07 • 10:22:29.
11.3. Décodage Codes correcteurs d’erreur

11.3.3 Décodage par syndrome


Cette méthode est basée sur la partition de l’espace de codage introduite au §11.3.2
en systématisant la recherche de la classe de congruence dans laquelle appartient chaque
message y ∈ Fn reçu. Pour cela on calcule un indicateur associé à y, son syndrome 5
s(y). Le calcul du syndrome permet d’abréger l’algorithme de décodage.
Définition 11.3.14. Soient C un [n, k ]-code linéaire sur Fq , G son glossaire et H sa
matrice de contrôle de parité. Pour tout y ∈ Y = Fnq , on appelle syndrome de y, le
vecteur
s := s(y) = Hy ∈ Fnq −k .

De toute évidence, s(g) = 0 pour tout g ∈ G .


Lemme 11.3.15. Soient C un [n, k ]-code linéaire sur Fq et G son glossaire. Deux vecteurs
y, y0 ∈ Y = Fnq sont dans la même classe de congruence par rapport à G si, et seulement si, il
ont le même syndrome.
Démonstration.

y + G = y0 + G ⇐⇒ y − y0 ∈ G ⇐⇒ s(y) − s(y0 ) = 0 ⇐⇒ s(y) = s(y0 ).

Corollaire 11.3.16. Le syndrome d’un vecteur y ∈ Y reçu ne dépend pas de y mais unique-
ment du bruit additif qui l’a corrompu.
Démonstration. Le vecteur reçu est obtenu par y = xG + b, où b est le bruit additif. Or
xG ∈ G ; par conséquent s(y) = H (g + b) = Hb, car g = xG ∈ G .
Ce résultat permet de systématiser le décodage comme le montre l’algorithme 11.3.17
ci-dessous.
Algorithme 11.3.17. Décodage par syndrome
Require: k, n, q, G , matrice H du code, partition (Yr ), suite de représentants dominants
(yr ), message à décoder y.
Ensure: ŷ = ∆(y).
s ← Hy
r←0
sr ← Hyr
while sr 6= s do
r ← r+1
sr ← Hyr
end while
ŷ ← y − yr

Exemple 11.3.18. (Décodage par syndrome de R4 sur F2 ). On utilise le tableau intro-


duit dans l’exemple 11.3.13, auquel on ajoute une colonne avec le calcul du syndrome.

5. S YNDROME, subst. masc. (Méd. Pathol.) Ensemble de signes, de symptômes, de modifications


morphologiques, fonctionnelles ou biochimiques de l’organisme, d’apparence parfois disparate mais
formant une entité reconnaissable qui, sans présager obligatoirement des causes de ces manifestations,
permettent d’orienter le diagnostic. Trésor de la langue française, version en ligne.

/Users/dp/a/ens/[Link]
172
2021-08-20 • 15:45:18.
Codes correcteurs d’erreur 11.4. Exercices

r yr w ( yr ) s ( y2 ) Yr
0 0000 0 000 {0000, 1111}
1 0001 1 001 {0001, 1110}
2 0010 1 010 {0010, 1101}
3 0100 1 100 {0100, 1011}
4 1000 1 111 {1000, 0111}
5 0011 2 011 {0011, 1100}
6 0101 2 101 {0101, 1010}
7 0110 2 110 {0110, 1001}

Table 11.2 – Supposons que 1111 est transmis mais le bruit le corrompt en 0111 ayant s(0111) =
111 correspondant à la classe r = 4. On calcule alors ∆(0111) = 0111 − 1000 = 1111.

1
Shannon
Taux de transmission R

0.8 Inaccessible
Inaccessible Rn
0.6

0.4

0.2

0
10−1410−1210−10 10−8 10−6 10−4 10−2
Probabilité d’erreur résiduelle q

Figure 11.2 – Pour un canal symétrique binaire, avec taux d’erreur p = 0.1, la ligne rouge représente
la frontière de Shannon établie en théorème 9.5.4, délimitant la région inaccessible de la région où
des codes existent. Les points bleus représentent la suite des taux de transmission en fonction de la
probabilité d’erreur résiduelle pour la famille de codes à répétition Rn , avec n = 1, 3, 5, . . . , 61.

11.4 Exercices
Codes à répétition
107. Dans cet exercice, on considère un canal binaire symétrique ayant une proba-
bilité d’erreur p. On note Rn le code à n ∈ N> répétitions pour chaque bit et
pb (Rn , p) la probabilité de décoder de manière erronée un bit par la méthode de
vote majoritaire.
(a) Calculer pb (R3 , 0.1).
(b) Calculer pb ( Rn , p), pour n ∈ N> .
(c) Pour p = 0.1 quel est le terme dominant dans l’expression de pb (Rn , p).
(d) À partir de quelle valeur de n, on obtient une valeur de pb (Rn , 0.1) ≤ 10−15 ?
(e) Quel est le taux de transmission pour Rn ?
(f) Placer les couples (Rn , log pb (Rn , p)) pour n ∈ {1, 3, 5 . . . , 61} sur un gra-

/Users/dp/a/ens/[Link]
173
2021-08-20 • 15:45:18.
11.4. Exercices Codes correcteurs d’erreur

phique. Qu’observez-vous ?
108. Soit Rn un code à répétition sur Fq . Montrer que
(a) si q = 2 et n est impair alors Rn est parfait,
(b) si q > 2 ou n est pair, alors Rn est imparfait.

Propriétés géométriques des codes


109. Soit C un code de glossaire G et de distance minimale d. Montrer que d =
min{w(g), g ∈ G , g 6= 0}.
110. Soit une matrice J ∈ Mn,n ({−1, 1}) — vue comme l’empilement de n vecteurs
lignes ri , i = 1, . . . , n — telle que ri · r j = 0 si i 6= j. Une telle matrice est dite de
Hadamard. On note H AD n , l’ensemble de matrices de Hadamard 6 d’ordre n.
(a) Montrer que J J t = nIn et conclure que  det J =nn/2 .
J J
(b) Montrer que si J ∈ H AD n , alors K = ∈ H AD2n . En conclure qu’il
J −J
existe une matrice dans H AD2m , pour tout m ∈ N.
(c) Si J ∈ H AD n , montrer que n est nécessairement pair 7 .
(d) À partir des vecteurs lignes d’une matrice J ∈ H AD n , on construit les 2n
vecteurs r1 , −r1 , . . . , rn , −rn et on transforme chaque composante −1 en 0.
Ces vecteurs (leurs transposés) engendrent alors un sous-espace vectoriel
de F2n (i.e. constituent le glossaire d’un code, appelé code de Hadamard).
Montrer que la distance minimale de ce code est d = n/2.
111. Soit C un [n, k ]-code sur F2 de glossaire G . Monter que
(
|G| si x ∈ G ⊥ ,
∑ (−1) = 0 sinon.
xt g
g∈G

Codes de Hamming
112. Décoder par le code de Hamming H AM (7, 4) les messages suivants :
(a) α = 1101011,
(b) α = 0110110,
(c) α = 0100111,
(d) α = 1111111.
113. Calculer toutes les chaînes de bruit b ∈ {0, 1}7 qui donnent un syndrome nul
pour H AM (7, 4).
114. Pour le code H AM (7, 4) et le canal binaire symétrique avec p = 0.1,
(a) déterminer la probabilité qu’un block de 7 bits ne soit pas décodé correcte-
ment,
(b) en déduire la probabilité du taux d’erreur par bit, dans le cas où le poids du
bruit est exactement kbk = 2.
6. Hadamard a montré que le déterminant de toute matrice J ∈ Mn,n ([−1, 1]) avec des lignes deux-
à-deux orthogonales est majoré par nn/2 ; cette borne est saturée si, et seulement si, Ji,j = ±1.
7. On peut montrer que si J est une matrice de Hadamard d’ordre n > 2, alors n est divisible par 4.
L’affirmation qu’il existe une matrice de Hadamard pour tout ordre n divisible par 4 reste une conjecture
encore ouverte !

/Users/dp/a/ens/[Link]
174
2021-08-20 • 15:45:18.
Codes correcteurs d’erreur 11.4. Exercices

115. La matrice de contrôle de parité du code H AM (15, 11) est donnée par
 
0 0 0 0 1 1 1 1 1 1 1 1 0 0 0
 1 1 1 0 0 0 0 1 1 1 1 0 1 0 0 
H := 
 0 1 1 1 0 1 1 0 0 1 1 0 0 1 0 .

1 0 1 1 1 0 1 0 1 0 1 0 0 0 1

Décoder le mot α = 000010000011001.


116. Les codes H AM (7, 4) et H AM (15, 11) des exercices précédents n’ont rien de spé-
cial. Ils sont membres d’une famille infinie de codes parfaits H AM (n, k) pour
certaines valeurs de n et k.
(a) Pour un code binaire parfait qui corrige une erreur, on pose t = 1 et q = 2
dans la borne d’empilement des boules de Hamming. Déterminer la relation
qui doit relier k et n dans ce cas.
(b) Noter c = n − k le nombre de bits de contrôle et déterminer les valeurs
possibles de n := n(c) et k := k (c), pour c ∈ N> . Les quelques premiers jeux
de valeurs sont donnés dans le tableau suivant où l’on reconnaît H AM (7, 4)
et H AM (15, 11) comme des codes correspondant à c = 3 et 4.
c 1 2 3 4 5 ...
n 1 3 7 15 31 ...
k 0 1 4 11 26 ...
(c) En notant Hc , c ≥ 1, le code de Hamming H AM (n(c), k(c)), déterminer son
k(c)
taux de transmission asymptotique R = limc→∞ n(c) .

/Users/dp/a/ens/[Link] 175
2022-01-07 • 10:22:29.
Références Codes correcteurs d’erreur

/Users/dp/a/ens/[Link] 176
2021-12-23 • 14:43:13.
Bibliographie

[1] Robert B. Ash. Information theory. Dover Publications Inc., New York, 1990. Cor-
rected reprint of the 1965 original. 84

[2] Philippe Barbe and Michel Ledoux. Probabilité. EDP Sciences, Les Ulis, 2007.
Deuxième édition, revue et corrigée. 9, 15

[3] Steven M. Bellovin. Frank Miller: Inventor of the one-time pad. Cryptologia, 35, 07
2011. doi:10.1080/01611194.2011.583711. 152

[4] Charles H. Bennett. Notes on Landauer’s principle, reversible computation and


Maxwell’s demon. Studies in History and Philosophy of Modern Physics, 34:501–510,
2003. 102

[5] Manabendra Nath Bera, Arnau Riera, Maciej Lewenstein, Zahra Baghali Kha-
nian, and Andreas Winter. Thermodynamics as a consequence of information
conservation. Quantum, 3:121, February 2019. URL: [Link]
q-2019-02-14-121, doi:10.22331/q-2019-02-14-121. 84

[6] Antoine Bérut, Artak Arakelyan, Artyom Petrosyan, Sergio Ciliberto, Raoul
Dillenschneider, and Eric Lutz. Experimental verification of Landauer’s
principle linking information and thermodynamics. Nature, 483, 3 2012.
URL: [Link]
doi:10.1038/nature10872. 102

[7] Rabi N. Bhattacharya and Edward C. Waymire. Stochastic processes with applica-
tions. Wiley Series in Probability and Mathematical Statistics: Applied Probability
and Statistics. John Wiley & Sons Inc., New York, 1990. A Wiley-Interscience Pu-
blication. 125

[8] Patrick Billingsley. Probability and measure. Wiley Series in Probability and Ma-
thematical Statistics. John Wiley & Sons Inc., New York, third edition, 1995. A
Wiley-Interscience Publication. 9, 13

[9] Ludwig Boltzmann. Vorlesungen über Gastheorie, 1. Theil. Verlag von Johann Am-
brosius Barth, Leipzig, 1896. 84, 85

[10] Ludwig Boltzmann. Leçons sur la théorie cinétique des gaz. Traduit de l’original al-
lemand par A. Galloti. Gauthiers-Villars, Paris, 1902. Ré-imprimé par les Éditions
Jacques Gabay, Paris (1987). 85

[11] Sergey Brin and Lawrence Page. The anatomy of a large-scale hypertextual web
search engine. Comput. Netw. ISDN Syst., 30(1-7):107–117, April 1998. URL: http:

177
Références BIBLIOGRAPHIE

//[Link]/10.1016/S0169-7552(98)00110-X, doi:10.1016/S0169-7552(98)
00110-X. 60

[12] Allen Broughton and Barthel W. Huff. A comment on unions of sigma-fields.


Amer. Math. Monthly, 84(7):553–554, 1977. URL: [Link]
2320022, doi:10.2307/2320022. 19

[13] C. Carathéodory. Untersuchungen über die Grundlagen der Thermodynamik.


Mathematische Annalen, 67(3):355–386, Sep 1909. URL: [Link]
BF01450409, doi:10.1007/BF01450409. 101

[14] Yuan Shih Chow and Henry Teicher. Probability theory. Springer Texts in Sta-
tistics. Springer-Verlag, New York, third edition, 1997. Independence, interchan-
geability, martingales. URL: [Link]
doi:10.1007/978-1-4612-1950-7. 37

[15] Kai Lai Chung. A course in probability theory. Academic Press, Inc., San Diego, CA,
third edition, 2001. 37

[16] The Unicode Consortium. Unicode Standard, Version 5.0, The (5th Edition). Addison-
Wesley Professional, 5 edition, 2006. 108

[17] Thomas M. Cover and Joy A. Thomas. Elements of information theory. Wiley-
Interscience [John Wiley & Sons], Hoboken, NJ, second edition, 2006. 84, 125

[18] Harald Cramér. On the representation of a function by certain Fourier inte-


grals. Trans. Amer. Math. Soc., 46:191–201, 1939. URL: [Link]
1989919, doi:10.2307/1989919. 37

[19] Persi Diaconis, Susan Holmes, and Richard Montgomery. Dynamical bias in the
coin toss. SIAM Rev., 49(2):211–235, 2007. URL: [Link]
S0036144504446436, doi:10.1137/S0036144504446436. 17

[20] Whitfield Diffie and Martin E. Hellman. New directions in cryptography. IEEE
Trans. Information Theory, IT-22(6):644–654, 1976. URL: [Link]
1109/tit.1976.1055638, doi:10.1109/tit.1976.1055638. 151

[21] Jean-Guillaume Dumas, Jean-Louis Roch, Éric Tannier, and Sébastien Varette.
Foundations of Coding: Compression, Encryption, Error Correction. Wiley, 2015. doi:
10.1002/9781119005940. 150

[22] Paul Ehrenfest and Tatiana Ehrenfest. Über zwei bekannte Einwände gegen das
Boltzmannsche H-Theorem. Physikalische Zeitschrift, 8:311–314, 1907. 57

[23] Peter Elias. Error-free coding. Information Theory, Transactions of the IRE Professional
Group on, 4(4):29–37, 1954. doi:10.1109/TIT.1954.1057464. 2

[24] Peter Elias. The noisy channel coding theorem for erasure channels. Amer. Math.
Monthly, 81(8):853–862, 1974. URL: [Link] doi:
10.2307/2319442. 2

[25] Thomas L. Floyd. Electronic devices. What’s New in Trades & Technology. Pearson
College Division, 10th edition, 2017. 10th edition. 97

/Users/dp/a/ens/[Link] 178
2021-12-23 • 14:43:13.
BIBLIOGRAPHIE Références

[26] Erol Gelenbe and Yves Caseau. The impact of information technology on energy
consumption and carbon emissions. Ubiquity, 2015(June), June 2015. URL: https:
//[Link]/10.1145/2755977, doi:10.1145/2755977. 103

[27] J. Gemmer, M. Michel, and G. Mahler. Quantum thermodynamics, volume 784 of


Lecture Notes in Physics. Springer-Verlag, Berlin, second edition, 2009. Emergence
of thermodynamic behavior within composite quantum systems. 84

[28] Hans-Otto Georgii. Probabilistic aspects of entropy. In Entropy, Princeton Ser.


Appl. Math., pages 37–54. Princeton Univ. Press, Princeton, NJ, 2003. 84

[29] Hans-Otto Georgii. Stochastik. de Gruyter Lehrbuch. [de Gruyter Textbook]. Wal-
ter de Gruyter & Co., Berlin, expanded edition, 2009. Einführung in die Wahr-
scheinlichkeitstheorie und Statistik. [Introduction to probability and statistics]. 9,
14

[30] J. Willard Gibbs. Elementary principles in statistical mechanics: developed with especial
reference to the rational foundation of thermodynamics. Dover publications Inc., New
York, 1960. 84

[31] Oded Goldreich. Foundations of cryptography. I. Cambridge University Press, Cam-


bridge, 2001. Basic tools. URL: [Link]
doi:10.1017/CBO9780511546891. 150

[32] Oded Goldreich. Foundations of cryptography. II. Cambridge University Press,


Cambridge, 2004. Basic Applications. URL: [Link]
CBO9780511721656.002, doi:10.1017/CBO9780511721656.002. 150

[33] Jeongmin Hong, Brian Lambson, Scott Dhuey, and Jeffrey Bokor. Experimen-
tal test of Landauer’s principle in single-bit operations on nanomagnetic me-
mory bits. Science advances, 2(3):e1501492–e1501492, 2016. doi:10.1126/sciadv.
1501492. 102

[34] Paul Horowitz and Winfield Hill. The art of electronics. Cambridge Unversity Press,
Cambridge, 2015. 97

[35] David A. Huffman. A method for the construction of minimum-redundancy


codes. Proceedings of the IRE, 40, 1952. 118

[36] F. Jelinek. Probabilistic Information Theory. McGraw-Hill, N. Y., 1968. 119

[37] R.S. Katti and A. Ghosh. Security using Shannon-Fano-Elias codes. In Circuits
and Systems, 2009. ISCAS 2009. IEEE International Symposium on, pages 2689–2692,
2009. doi:10.1109/ISCAS.2009.5118356. 122

[38] Mark Kelbert and Yuri Suhov. Information Theory and Coding by Example. Cam-
bridge University Press, Cambridge, 2013. 84

[39] Joseph B. Keller. The probability of heads. Amer. Math. Monthly, 93(3):191–197,
1986. URL: [Link] doi:10.2307/2323340. 17

[40] Auguste Kerchoffs. La cryptographie militaire. Journal des sciences militaires, pages
5–38, 1883. 149

/Users/dp/a/ens/[Link] 179
2021-12-23 • 14:43:13.
Références BIBLIOGRAPHIE

[41] Aleksandr Yakovlevich Khinchin. Mathematical foundations of information theory.


Dover Publications Inc., New York, N. Y., 1957. Translated by R. A. Silverman and
M. D. Friedman. 2, 84

[42] Andrej Nikolaevich Kolmogoroff. Grundbegriffe der Wahrscheinlichkeitsrechnung.


Springer-Verlag, Berlin, 1977. Reprint of the 1933 original. 3, 9

[43] Leon G. Kraft. A device for quantizing, grouping, and coding amplitude-modulated
pulses. PhD thesis, Massachusetts Institute of Technology, 1949. URL: http://
[Link]/1721.1/12390. 112

[44] R. Landauer. Irreversibility and heat generation in the computing process. IBM
Journal of Research and Development, 5(3):183–191, July 1961. doi:10.1147/rd.53.
0183. 97, 102

[45] A. K. Lenstra and H. W. Lenstra, Jr., editors. The development of the number field
sieve, volume 1554 of Lecture Notes in Mathematics. Springer-Verlag, Berlin, 1993.
URL: [Link] doi:10.1007/BFb0091534. 151

[46] Annick Lesne. Shannon entropy: a rigorous notion at the crossroads between
probability, information theory, dynamical systems and statistical physics. Math.
Structures Comput. Sci., 24(3):e240311, 63, 2014. URL: [Link]
S0960129512000783, doi:10.1017/S0960129512000783. 84

[47] Eugene Lukacs. Characteristic functions. Hafner Publishing Co., New York, 1970.
Second edition, revised and enlarged. 37

[48] David J. C. MacKay. Information theory, inference and learning algorithms. Cambridge
University Press, New York, 2003. 84

[49] Ueli M. Maurer. Authentication theory and hypothesis testing. IEEE Trans. Inform.
Theory, 46(4):1350–1356, 2000. URL: [Link] doi:
10.1109/18.850674. 156

[50] R. J. McEliece. The theory of information and coding, volume 86 of Encyclopedia of


Mathematics and its Applications. Cambridge University Press, Cambridge, student
edition, 2004. With a foreword by Mark Kac. 84

[51] Brockway McMillan. The basic theorems of information theory. Ann. Math. Sta-
tistics, 24:196–219, 1953. 114

[52] Jacques Neveu. Bases mathématiques du calcul des probabilités. Préface de R. Fortet.
Deuxième édition, revue et corrigée. Masson et Cie, Éditeurs, Paris, 1970. 9

[53] J. R. Norris. Markov chains, volume 2 of Cambridge Series in Statistical and Probabi-
listic Mathematics. Cambridge University Press, Cambridge, 1998. Reprint of 1997
original. 55

[54] Juan M. R. Parrondo, Jordan M. Horowitz, and Takahiro Sagawa. Thermody-


namics of information. Nature Physics, 11:131 EP –, 02 2015. URL: https:
//[Link]/10.1038/nphys3230. 84

/Users/dp/a/ens/[Link] 180
2021-12-23 • 14:43:13.
BIBLIOGRAPHIE Références

[55] William A. Pearlman and Amir Said. Digital signal compression : principles and
practice. Cambridge University Press, 2011. 119
[56] Dimitri Petritis. Markov chains on measurable spaces, 2015. Premimi-
nary draft of lecture notes taught at the University of Rennes 1. URL:
[Link]
2_pdfsam_markov.pdf. 48, 55
[57] Dimitri Petritis. Mathematical foundations of quantum mechanics, 2018. Notes
de cours pour le master de cryptographie - version préliminaire, Univer-
sité de Rennes 1. URL: [Link]
enseignement/ptin/[Link]. 152
[58] Dimitri Petritis. Théorie de la complexité, 2018. Notes de cours pour le master
de cryptographie - version préliminaire, Université de Rennes 1. URL: http://
[Link]/[Link]/enseignement/lcm1/[Link]. 125,
155
[59] R. L. Rivest, A. Shamir, and L. Adleman. A method for obtaining digital signatures
and public-key cryptosystems. Comm. ACM, 21(2):120–126, 1978. URL: http:
//[Link]/10.1145/359340.359342, doi:10.1145/359340.359342. 151
[60] Steven Roman. Coding and information theory, volume 134 of Graduate Texts in Ma-
thematics. Springer-Verlag, New York, 1992. 142
[61] Y. A. Rozanov. Probability theory. Dover Publications Inc., New York, english edi-
tion, 1977. A concise course, Translated from the Russian and edited by Richard
A. Silverman. 9
[62] Claude E. Shannon. A mathematical theory of communication. Bell System Tech.
J., 27:379–423, 623–656, 1948. 83, 113
[63] Claude E. Shannon. Communication in the presence of noise. Proc. I.R.E., 37:10–
21, 1949. 2
[64] Claude E. Shannon. Communication theory of secrecy systems. Bell System Tech.
J., 28:656–715, 1949. Claude Shannon’s report, originally issued as a classified do-
cument entitled “A Mathematical Theory of Cryptography”, Memorandum MM
45-110-02, September 1, 1945, was formally published in 1949 as “Communica-
tion Theory of Secrecy Systems” in Bell System Technical Journal, 28 (1949) 656–
715. The original form of the paper, is nowadays available only as a low quality
scanned version. Recently a version has been retyped by Jiejun Kong and made
available to the community. 2, 152, 153
[65] Albert Nikolaevich Shiryayev. Probability, volume 95 of Graduate Texts in Mathema-
tics. Springer-Verlag, New York, 1984. Translated from the Russian by R. P. Boas.
9, 36, 40
[66] Peter W. Shor. Polynomial-time algorithms for prime factorization and discrete
logarithms on a quantum computer. SIAM J. Comput., 26(5):1484–1509, 1997. 151
[67] G. J. Simmons. A survey of information authentication. In Contemporary crypto-
logy, pages 379–419. IEEE, New York, 1992. 156

/Users/dp/a/ens/[Link] 181
2021-12-23 • 14:43:13.
Index BIBLIOGRAPHIE

[68] Gustavus J. Simmons. Authentication theory/coding theory. In George Robert


Blakley and David Chaum, editors, Advances in Cryptology, pages 411–431, Berlin,
Heidelberg, 1985. Springer Berlin Heidelberg. 156

[69] Yakov Grigorevich Sinai. Probability theory. Springer Textbook. Springer-Verlag,


Berlin, 1992. An introductory course, Translated from the Russian and with a
preface by D. Haughton. 9

[70] Karlheinz Spindler. Abstract algebra with applications. Vol. II. Marcel Dekker Inc.,
New York, 1994. Rings and fields. 162

[71] G. S. Vernam. Cipher printing telegraph systems for secret wire and radio telegra-
phic communications. Transactions of the American Institute of Electrical Engineers,
XLV:295–301, Jan 1926. doi:10.1109/T-AIEE.1926.5061224. 152

[72] Mark N. Wegman and J. Lawrence Carter. New hash functions and their use
in authentication and set equality. J. Comput. System Sci., 22(3):265–279, 1981.
Special issue dedicated to Michael Machtey. URL: [Link]
0022-0000(81)90033-7, doi:10.1016/0022-0000(81)90033-7. 159

[73] Jacob Ziv. Coding theorems for individual sequences. IEEE Trans. Inform. Theory,
24(4):405–412, 1978. 122

[74] Jacob Ziv and Abraham Lempel. Compression of individual sequences


via variable-rate coding. IEEE Trans. Inform. Theory, 24(5):530–536, 1978.
URL: [Link] doi:10.1109/TIT.1978.
1055934. 122

/Users/dp/a/ens/[Link] 182
2023-01-02 • 09:41:54.

Vous aimerez peut-être aussi