0% ont trouvé ce document utile (0 vote)
30 vues289 pages

Mathématiques pour la Physique II

Le document présente un cours de mathématiques pour la physique, axé sur le calcul différentiel et les variations, ainsi que sur les transformations intégrales, notamment la transformation de Fourier. Il couvre des sujets tels que les équations d'Euler-Lagrange, les séries de Fourier, et les propriétés des fonctions intégrables. Ce cours est destiné aux étudiants en Licence de Physique à l'Université de Provence pour l'année universitaire 2011-12.

Transféré par

seostore.team
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
30 vues289 pages

Mathématiques pour la Physique II

Le document présente un cours de mathématiques pour la physique, axé sur le calcul différentiel et les variations, ainsi que sur les transformations intégrales, notamment la transformation de Fourier. Il couvre des sujets tels que les équations d'Euler-Lagrange, les séries de Fourier, et les propriétés des fonctions intégrables. Ce cours est destiné aux étudiants en Licence de Physique à l'Université de Provence pour l'année universitaire 2011-12.

Transféré par

seostore.team
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

M ATH ÉMATIQUE POUR LA P HYSIQUE II

B. Torrésani
Université de Provence

Licence de Physique, L3

Année Universitaire 2011-12, second semestre


2
Table des matières

I Préliminaires : calcul différentiel, calcul des variations 9

1 Calcul des variations 11


1.1 Calcul différentiel, optimisation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
1.1.1 Dérivées partielles . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
1.1.2 Optimisation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 15
1.1.3 Optimisation sous contrainte . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18
1.2 Calcul des variations, équations d’Euler-Lagrange, équation de Beltrami . . . . . . . . . 19
1.2.1 Equations d’Euler-Lagrange . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19
1.2.2 Equation de Beltrami . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21
1.3 Quelques exemples... et contre-exemples simples . . . . . . . . . . . . . . . . . . . . . . . 22
1.3.1 Le brachistrochrone . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 22
1.3.2 Le Principe de Fermat . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 25
1.3.3 La colonne de Cox et Overton... . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 25
1.4 Extensions à des cadres plus généraux . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 26
1.4.1 Le cas multidimensionnel ; exemples de l’équation de Laplace et de l’équation
des ondes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 26
1.4.2 Fonctionnelles dépendant de plusieurs fonctions . . . . . . . . . . . . . . . . . . . 29
1.4.3 Fonctionnelles de dérivées d’ordre supérieur . . . . . . . . . . . . . . . . . . . . . 30
1.4.4 Conditions aux bords naturelles . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
1.5 Formalisme Hamiltonien . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 32
1.6 Calcul des variations sous contrainte . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 33

II Transformations intégrales 35

2 Transformation de Fourier finie 37


2.1 Préliminaires : équation de la chaleur finie . . . . . . . . . . . . . . . . . . . . . . . . . . . 37
2.2 La transformation de Fourier finie (TFF) . . . . . . . . . . . . . . . . . . . . . . . . . . . . 38
2.2.1 Définition, Propriétés, Inversion . . . . . . . . . . . . . . . . . . . . . . . . . . . . 38
2.2.2 Une base particulière de C N . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 39
2.2.3 Convolution ; produit . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 43
2.2.4 Remarques sur la périodicité . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 44
2.2.5 Transformation de Fourier rapide ; le problème de la complexité . . . . . . . . . . 46

3
Table des matières

2.3 La transformation de Fourier discrète (TFD) . . . . . . . . . . . . . . . . . . . . . . . . . . 46


2.3.1 Définition, difficultés . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 46
2.3.2 Convolution et produit . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 47
2.3.3 Notions de signal et de filtrage numériques . . . . . . . . . . . . . . . . . . . . . . 48
2.3.4 Approximation d’une TFD par une TFF . . . . . . . . . . . . . . . . . . . . . . . . 48
2.3.5 Inversion : les séries de Fourier . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 50

3 Séries de Fourier 53
3.1 Fonctions trigonométriques . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 53
3.1.1 Polynômes trigonométriques . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 53
3.1.2 Orthogonalité . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 54
3.2 Séries de Fourier . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 54
3.2.1 Généralités . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 54
3.2.2 Une base orthonormée de L2p ([ a, b]) . . . . . . . . . . . . . . . . . . . . . . . . . . 56
3.2.3 Un exemple . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 57
3.2.4 Quelques remarques . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 58
3.2.5 Problèmes de convergence des séries de Fourier . . . . . . . . . . . . . . . . . . . 61
3.2.6 Le problème de l’extension . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 63
3.3 Retour sur la transformation de Fourier discrète . . . . . . . . . . . . . . . . . . . . . . . 66

4 Intégrales de Fourier 69
4.1 La transformation de Fourier des fonctions intégrables . . . . . . . . . . . . . . . . . . . 71
4.1.1 Propriétés élémentaires . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 73
4.1.2 Le théorème de Riemann-Lebesgue . . . . . . . . . . . . . . . . . . . . . . . . . . 75
4.1.3 Dérivabilité . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 76
4.1.4 Transformation de Fourier d’une dérivée . . . . . . . . . . . . . . . . . . . . . . . 77
4.1.5 Le problème de l’inversion . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 78
4.1.6 La convolution . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 79
4.2 Les fonctions de carré intégrable . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 80
4.2.1 La transformation de Fourier dans l’espace de Schwartz S(R) . . . . . . . . . . . 81
4.2.2 Le passage à L2 (R) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 82
4.2.3 Le théorème convolution-produit . . . . . . . . . . . . . . . . . . . . . . . . . . . 83
4.2.4 L’inégalité de Heisenberg . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 83
4.3 Transformation de Fourier des fonctions de plusieurs variables . . . . . . . . . . . . . . 84
4.3.1 Transformation de Fourier des fonctions intégrables . . . . . . . . . . . . . . . . . 85
4.3.2 Propriétés simples . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 85
4.3.3 Convolution-produit . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 86
4.3.4 Différentiation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 87
4.3.5 Passage à L2 (Rn ) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 87

5 La transformation de Laplace 91
5.1 Définition et premières propriétés . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 91
5.2 Propriétés élémentaires . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 93
5.3 La convolution finie . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 93
5.4 Propriétés de régularité . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 94
5.4.1 La transformée de Laplace est holomorphe . . . . . . . . . . . . . . . . . . . . . . 94
5.4.2 Transformation de Laplace et dérivation . . . . . . . . . . . . . . . . . . . . . . . . 95
5.4.3 Transformation de Laplace et intégration . . . . . . . . . . . . . . . . . . . . . . . 97
5.5 Inversion de la transformation de Laplace . . . . . . . . . . . . . . . . . . . . . . . . . . . 97
5.6 La transformation de Laplace bilatérale . . . . . . . . . . . . . . . . . . . . . . . . . . . . 101

4
Table des matières

III Equations différentielles et aux dérivées partielles 105

6 Equations différentielles 107


6.1 Définitions, généralités . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 108
6.1.1 Généralités, équations linéaires . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 108
6.1.2 Equations homogènes à coefficients constants . . . . . . . . . . . . . . . . . . . . 109
6.1.3 Equations homogènes : variation de la constante . . . . . . . . . . . . . . . . . . . 110
6.1.4 Facteur intégrant pour les équations linéaires du premier ordre . . . . . . . . . . 113
6.1.5 Equations du second ordre, Wronskien . . . . . . . . . . . . . . . . . . . . . . . . 114
6.2 La méthode de Fröbenius . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 116
6.2.1 Notion de point singulier, théorème de Fuchs . . . . . . . . . . . . . . . . . . . . 116
6.2.2 Un exemple : les fonctions de Bessel . . . . . . . . . . . . . . . . . . . . . . . . . . 118
6.2.3 Un autre exemple : les polynômes de Legendre . . . . . . . . . . . . . . . . . . . . 123
6.2.4 Autres exemples de polynômes orthogonaux . . . . . . . . . . . . . . . . . . . . . 124
6.3 Problème de Sturm-Liouville . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 125
6.3.1 Généralités . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 125
6.3.2 Propriétés des fonctions propres et valeurs propres d’une équation de Sturm-
Liouville . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 128
6.4 Résolution d’équations différentielles par transformation . . . . . . . . . . . . . . . . . . 129
6.4.1 Transformation de Fourier . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 129
6.4.2 Transformation de Laplace . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 130

7 Equations aux dérivées partielles 133


7.1 EDP du second ordre, classification . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 133
7.2 Problèmes elliptiques : le Laplacien . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 134
7.2.1 Le Laplacien . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 134
7.2.2 Conditions aux bords . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 136
7.2.3 Le problème de Dirichlet intérieur en dimension 2 pour l’équation de Laplace . . 137
7.2.4 Problème extérieur, problème dans une couronne . . . . . . . . . . . . . . . . . . 140
7.3 Problèmes paraboliques : phénomènes de diffusion . . . . . . . . . . . . . . . . . . . . . 141
7.3.1 Exemples . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 141
7.3.2 Le cas de domaines infinis : transformations . . . . . . . . . . . . . . . . . . . . . 142
7.3.3 Domaines bornés : conditions aux bords . . . . . . . . . . . . . . . . . . . . . . . . 142
7.3.4 Equation de la chaleur 1D sur un domaine borné . . . . . . . . . . . . . . . . . . 142
7.3.5 Problèmes inhomogènes : utilisation des bases “Sturm-Liouville” . . . . . . . . . 148
7.4 Problèmes hyperboliques : phénomènes de propagation . . . . . . . . . . . . . . . . . . . 149
7.4.1 Exemples : corde et poutre . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 149
7.4.2 Problèmes sans bord : la solution de d’Alembert . . . . . . . . . . . . . . . . . . . 149
7.4.3 Corde vibrante : condition aux bords et résolution . . . . . . . . . . . . . . . . . . 151
7.4.4 Cas bi-dimensionnel : la membrane d’un tambour . . . . . . . . . . . . . . . . . . 153

IV Distributions, fonctions de Green 157

8 Distributions et fonctions de Green 159


8.1 Distributions : définition, propriétés et exemples . . . . . . . . . . . . . . . . . . . . . . . 160
8.1.1 Fonctions test et dualité . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 160
8.1.2 Distributions sur R . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 160
8.1.3 Propriétés élémentaires . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 162
8.2 Distributions sur Rn . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 163
8.3 Dérivation des distributions . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 165

5
Table des matières

8.3.1 Le cas unidimensionnel . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 165


8.3.2 Un exemple : la valeur principale de 1/t . . . . . . . . . . . . . . . . . . . . . . . 167
8.3.3 Le cas multidimensionnel . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 168
8.3.4 Surfaces fermées dans R2 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 170
8.3.5 Domaines fermés dans R3 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 171
8.4 Suites de distributions . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 174
8.5 Produit de convolution des fonctions et des distributions . . . . . . . . . . . . . . . . . . 175
8.5.1 Convolution des fonctions . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 175
8.5.2 Support d’une distribution . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 176
8.5.3 Convolution des distributions . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 177
8.5.4 Equations de convolution . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 178
8.5.5 Application aux problèmes de valeur initiale . . . . . . . . . . . . . . . . . . . . . 180
8.6 Transformations de Laplace et Fourier des distributions . . . . . . . . . . . . . . . . . . . 182
8.6.1 Espace de Schwartz et distributions tempérées . . . . . . . . . . . . . . . . . . . . 182
8.6.2 Transformation de Laplace des distributions . . . . . . . . . . . . . . . . . . . . . 183
8.6.3 Transformée de Fourier des distributions tempérées . . . . . . . . . . . . . . . . . 185
8.6.4 Propriétés . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 186
8.6.5 Transformation de Fourier et dérivation . . . . . . . . . . . . . . . . . . . . . . . . 186
8.6.6 Inversion de la transformation de Fourier . . . . . . . . . . . . . . . . . . . . . . . 188
8.7 Application au calcul des fonctions de Green . . . . . . . . . . . . . . . . . . . . . . . . . 188
8.7.1 Exemple simple : fonction de Green de l’opérateur de dérivation dans D+ 0 . . . . 189
8.7.2 Oscillateur harmonique 1D . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 189
8.7.3 Un exemple multidimensionnel : l’opérateur de la chaleur . . . . . . . . . . . . . 190

V Opérateurs linéaires 193

9 Opérateurs linéaires 195


9.1 Introduction, rappels . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 195
9.1.1 Formes sesquilinéaires, formes Hermitiennes . . . . . . . . . . . . . . . . . . . . . 195
9.1.2 Bases, matrices . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 196
9.1.3 Rang et noyau . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 197
9.1.4 Réduction d’une forme Hermitienne . . . . . . . . . . . . . . . . . . . . . . . . . . 198
9.1.5 Espaces pré-Hilbertiens, espaces Hermitiens . . . . . . . . . . . . . . . . . . . . . 200
9.2 Opérateurs linéaires dans les espaces Hermitiens . . . . . . . . . . . . . . . . . . . . . . . 201
9.2.1 Définitions . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 201
9.2.2 Opérateur adjoint . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 203
9.2.3 Diagonalisation des opérateurs autoadjoints . . . . . . . . . . . . . . . . . . . . . 204
9.2.4 Diagonalisation simultanée d’opérateurs auto-adjoints qui commutent . . . . . . 207
9.3 Opérateurs linéaires dans les espaces de Hilbert . . . . . . . . . . . . . . . . . . . . . . . 208
9.3.1 Généralités . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 208
9.3.2 Adjoint d’un opérateur sur un espace de Hilbert . . . . . . . . . . . . . . . . . . . 210
9.3.3 Spectre d’un opérateur sur un espace de Hilbert . . . . . . . . . . . . . . . . . . . 212
9.4 Théorie spectrale des opérateurs compacts . . . . . . . . . . . . . . . . . . . . . . . . . . 216
9.5 Quelques mots sur les opérateurs non bornés . . . . . . . . . . . . . . . . . . . . . . . . . 218
9.6 Eléments de théorie des perturbations . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 220
9.6.1 Perturbation d’un vecteur propre non-dégénéré d’un opérateur linéaire auto-
adjoint sur un espace Hermitien . . . . . . . . . . . . . . . . . . . . . . . . . . . . 220
9.6.2 Le cas des valeurs propres dégénérées . . . . . . . . . . . . . . . . . . . . . . . . . 222

6
Table des matières

VI Probabilités 223

10 Introduction aux Probabilités 225


10.1 Modélisation probabiliste . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 225
10.1.1 Généralités . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 225
10.1.2 Calcul des probabilités . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 227
10.1.3 Exemples . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 233
10.2 Variables aléatoires . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 239
10.2.1 Généralités . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 239
10.2.2 Variables aléatoires discrètes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 240
10.2.3 Variables aléatoires à densité . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 248
10.3 Variables aléatoires indépendantes, distribution conditionnelle . . . . . . . . . . . . . . . 254
10.3.1 Variables aléatoires indépendantes . . . . . . . . . . . . . . . . . . . . . . . . . . . 254
10.3.2 Sommes de variables aléatoires indépendantes . . . . . . . . . . . . . . . . . . . . 258
10.3.3 Variables aléatoires et probabilités conditionnelles . . . . . . . . . . . . . . . . . . 261
10.3.4 Espérance conditionnelle et prédiction . . . . . . . . . . . . . . . . . . . . . . . . . 264

VII Annexes 267

A Mesure et convergence A.1


A.1 Notion de mesure . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . A.1
A.2 Convergence . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . A.2
A.2.1 Convergence simple . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . A.2
A.2.2 Convergence uniforme . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . A.2
A.2.3 Convergence en moyenne . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . A.2
A.2.4 Convergence simple presque partout . . . . . . . . . . . . . . . . . . . . . . . . . A.3

B Espaces fonctionnels B.1


B.1 Espaces caractérisant la régularité . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . B.1
B.2 Les espaces C ∞ (R), D(R) et S(R) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . B.2
B.3 Eléments de théorie de l’intégration . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . B.2
B.4 Les espaces de Lebesgue . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . B.4
B.5 Relations entre S(R), D(R) et L2 (R) . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . B.5

C Elements de géométrie des courbes et surfaces C.1


C.1 Courbes, courbes paramétrées . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . C.1
C.1.1 Courbes planes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . C.1
C.1.2 Courbes gauches . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . C.2
C.2 Surfaces paramétrées dans l’espace . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . C.4

D Théorie des perturbations D.1


D.1 Comparaisons : notations de Landau . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . D.1
D.1.1 Négligeabilité . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . D.1
D.1.2 Equivalence . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . D.1
D.1.3 Domination . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . D.2
D.2 Perturbations, équations algébriques . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . D.2

7
Table des matières

8
Première partie

Préliminaires : calcul différentiel, calcul


des variations

9
C HAPITRE

1
Calcul des variations

De nombreux problèmes de la physique peuvent être posés sous ce que l’on appelle une formulation
variationnelle, c’est à dire comme la recherche d’un optimum parmi une famille de solutions possibles.
C’est notamment le cas de la mécanique de Hamilton (principe de moindre action), mais aussi du
principe de Fermat en optique et de multiples autres exemples.
Dans les problèmes d’optimisation simples, la solution (l’optimum) est la plupart du temps obtenu
en cherchant les zéros de la dérivée de la fonction à optimiser, ou de son gradient dans les cas de
dimension supérieure. Ceci fournit dans la plupart des cas des optima locaux, parmi lesquels on doit
trouver le vrai optimum.
On va s’intéresser ici à la situation de dimension infinie, dans laquelle on sera amené à étendre la
notion de gradient à ce cadre plus large.

1.1 Calcul différentiel, optimisation


Classiquement, le calcul des variations s’applique pour rechercher des minima ou maxima d’une
fonction. Il consiste à partir d’une solution donnée, et examiner les solutions proches pour voir si
elles sont meilleures ou moins bonnes. Ceci se fait à l’aide de la dérivation.
Il est utile de rappeler dans un premier temps les bases du calcul différentiel sur les fonctions de
plusieurs variables.

1.1.1 Dérivées partielles


Soit f : Rn → Rm , et soit U ⊂ Rn . Soit x0 ∈ U.
– f admet une dérivée en x0 , suivant v ∈ Rn si la fonction d’une variable réelle

ϕv : t ∈ R → ϕv (t) = f ( x0 + tv)

est dérivable en t = 0. On note alors


1 
Dv f ( x0 ) = lim f ( x0 + tv) − f ( x0 ) (1.1)
t →0 t

la dérivée directionnelle, dans la direction v de f .


– Etant donnée la base canonique B = {e1 , . . . en } de Rn , les dérivées partielles de f en x0 sont les
nombres
∂f
( x ) = De i f ( x 0 ) . (1.2)
∂xi 0

11
1 Calcul des variations

– Les fonctions
∂f
x→ (x)
∂xi
sont également appelées fonctions dérivées partielles de f .

D ÉFINITION 1.1 Soit U ⊂ Rn . f : Rn → Rm est de classe C1 sur U si les fonctions dérivées


partielles ∂ f /∂xi existent et sont continues sur U.

La base du calcul différentiel est la formule de Taylor au premier ordre, donnée dans la proposition
suivante

P ROPOSITION 1.1 (TAYLOR ) Soit f : Rn → Rm , de classe C1 sur U ⊂ Rn . Soit x0 ∈ U,


notons U0 = { h, x0 + h ∈ U }. Alors il existe une application e : U0 → Rn , telle que
n
∂f
f ( x0 + h) = f ( x0 ) + ∑ h j ( x ) + |h|e(h) , (1.3)
j =1
∂x j 0
q
où |h| = h21 + h22 + · · · + h2n est la norme Euclidienne de h, et

lim e(h) = 0 . (1.4)


h →0

Le second terme du développement forme ce que l’on appelle l’application différentielle de f en x0 ,


définie plus précisément comme suit.

D ÉFINITION 1.2 Avec les mêmes notations que ci-dessus, l’application


n
∂f
d x0 f : h ∈ U0 → d x0 f (h) = ∑ h j ∂x j (x0 ) ∈ Rm (1.5)
j =1

est appelée différentielle de f en x0 (ou application tangente à f en x0 ).

R EMARQUE 1.1 On note généralement

x j : h = ( h 1 , . . . h n ) ∈ Rn → h j ∈ R

l’application “projection” sur la j-ième composante. Pour tous y ∈ Rn et h ∈ Rn , on a x j (y + h) =


y j + h j , et donc
dy x j ( h) = h j ,
de sorte que l’on peut noter dx j = dy x j , et ainsi écrire la différentielle de f sous la forme classique

n
∂f
d x0 f = ∑ ∂x j (x0 ) dx j . (1.6)
j =1

12
1.1 Calcul différentiel, optimisation

E XEMPLE 1.1 (L ONGUEUR DU GRAPHE D ’ UNE FONCTION ) On considère une fonction continûment
différentiable f : [ a, b] → R, et la fonction ` = u → `(u) qui à u ∈ [ a, b] associe la longueur de la
courbe définie par le graphe de f entre a et u. En approximant la courbe par une fonction affine par
morceaux, affine sur des intervalles [ xk , xk+1 ] de longueur h, on obtient, par le théorème de Pythagore,
q
`(u) = lim ∑ ( xk+1 − xk )2 + ( f ( xk+1 ) − f ( xk ))2
h →0
k
s
2
f ( x k +1 ) − f ( x k )

= lim ∑( xk+1 − xk ) 1 + .
h →0
k
x k +1 − x k

Le théorème des accroissements finis montre que pour tout k, il existe τk ∈ [ xk , xk+1 ] tel que f ( xk+1 ) −
f ( xk ) = f 0 (τk )( xk+1 − xk ). En passant à la limite h → 0, on obtient donc (par définition de l’intégrale
de Riemann) l’expression de la fonction ` :
Z uq
`(u) = 1 + f 0 ( x )2 dx (1.7)
a

et la longueur L = `(b) de la courbe.


De plus,
d`
q
( x0 ) = 1 + f 0 ( x0 )2 ,
dx
et la différentielle en x0 de ` vaut donc
d`
d x0 ` = ( x0 )dx .
dx

F IG . 1.1: Fonction d’une variable et longueur du graphe

D ÉFINITION 1.3 Avec les mêmes définitions que ci-dessus, la matrice Jacobienne de f en x0
est la matrice  ∂ f1 ∂ f1 ∂ f1 
∂x ∂x . . . ∂xn
 ∂ f21 ∂ f22 ∂f 
 ∂x1 ∂x2 . . . ∂x2n 
J f ( x0 ) =  .

.. .. ..  .
 (1.8)
 . . . . . 
∂ fm ∂ fm ∂f
∂x1 ∂x2 . . . ∂xmn
Lorsque m = n, le déterminant de la matrice Jacobienne est appelé Jacobien de f en x0 .

13
1 Calcul des variations

La matrice Jacobienne permet une écriture synthétique de la formule de Taylor :

f ( x0 + h) = f ( x0 ) + J f ( x0 )h + he(h) . (1.9)

La différentielle et la matrice Jacobienne possèdent d’importantes propriétés vis à vis de la composi-


tion des fonctions.

T H ÉOR ÈME 1.1 Soient U ⊂ Rn , V ⊂ Rm , f : Rn → Rm , de classe C1 dans U, telle que


f (U ) ⊂ V, et g : Rm → R p , de classe C1 dans V. Alors g ◦ f est de classe C1 dans U, et on a

d x0 ( g ◦ f ) = d f ( x0 ) g ◦ d x0 f , (1.10)
Jg◦ f ( x0 ) = Jg ( f ( x0 )) J f ( x0 ) . (1.11)

Les dérivées d’ordre supérieur sont définies récursivement. Par exemple, étant donnée une fonction
de plusieurs variables f : Rn → C, on définit

∂2 f ∂ ∂f
( x0 ) = (x ) . (1.12)
∂xi ∂x j ∂xi ∂x j 0

Pour des dérivées d’ordres peu élevés, on utilisera également la notation suivante

∂f ∂2 f
f x0 i = , f x00i x j = ,...
∂xi ∂xi ∂x j

Le résultat essentiel est le théorème de Schwarz, qui stipule que lorsque toutes les dérivées partielles
considérées sont continues, le résultat d’une dérivation multiple ne dépend pas de l’ordre dans lequel
les dérivations sont effectuées. Plus précisément :

T H ÉOR ÈME 1.2 (S CHWARZ ) Soit U ⊂ Rn , soit x0 ∈ U, et soit f : Rn → Rm . Si f est de


classe C1 dans U, si f x00i x j et f x00j xi existent et sont continues en x0 , alors

∂2 f ∂2 f
( x0 ) = (x ) . (1.13)
∂xi ∂x j ∂x j ∂xi 0

R EMARQUE 1.2 Ce résultat semble évident. Cependant, il est important de noter qu’il n’est plus va-
lable lorsque les hypothèses sont violées. Par exemple, prenons
( xy3
2 2 si ( x, y) 6= (0, 0)
f ( x, y) = x +y
0 sinon

Les dérivées partielles premières sont :


y2 − x 2 3x2 +y2
( (
∂f y3 (x2 +y2 )2 si ( x, y) 6= (0, 0) ∂f xy2 (x2 +y2 )2 si ( x, y) 6= (0, 0)
( x, y) = , ( x, y) =
∂x 0 sinon ∂y 0 sinon,

de sorte que
∂2 f ∂2 f
(0, 0) = 0 alors que (0, 0) = 1 .
∂x∂y ∂y∂x

14
1.1 Calcul différentiel, optimisation

D ÉFINITION 1.4 On dira que f : Rn → Rm est de classe C k dans U ⊂ Rn si toutes les dérivées
partielles
∂ α1 ∂ α2 ∂ αn
α1 α2 . . .
∂x1 ∂x2 ∂xnαn
de degré |α| = α1 + α2 + · · · + αn ≤ k existent et sont continues dans U.

1.1.2 Optimisation

Optimiser une fonction de plusieurs variables équivaut à en chercher les extrêma, c’est à dire les
maxima et les minima.

D ÉFINITION 1.5 Soit f : X ⊂ Rn → R.


– f admet un maximum local (resp. maximum local strict) en x0 ∈ X si il existe un voisinage
V de x0 , telle que pour tout x ∈ V, f ( x ) ≤ f ( x0 ) (resp. f ( x ) < f ( x0 )).
– f admet un minimum local (resp. minimum local strict) en x0 ∈ X si il existe un voisinage
V de x0 , telle que pour tout x ∈ V, f ( x ) ≥ f ( x0 ) (resp. f ( x ) > f ( x0 )).
– f admet un maximum global (resp. maximum global strict) en x0 ∈ X si pour tout x ∈ X,
f ( x ) ≤ f ( x0 ) (resp. f ( x ) < f ( x0 )).
– f admet un minimum global (resp. minimum global strict) en x0 ∈ X si pour tout x ∈ X,
f ( x ) ≥ f ( x0 ) (resp. f ( x ) > f ( x0 )).

Une notion centrale pour la recherche d’extrêma locaux est la notion de point critique. On dit que
x0 est un point critique de la fonction f (supposée de classe C1 dans un voisinage de x0 ) si pour tout
i = 1, . . . n, on a
∂f
( x ) = 0 , i = 1, . . . n ,
∂xi 0
ce que l’on note
∇ f ( x0 ) = 0 .

Les points critiques caractérisent les extrêma locaux d’une fonction f à l’ordre 1. Cependant, le gra-
dient ∇ f de f ne permet pas de décider si un point critique est effectivement un extrêmum, ni si il
s’agit d’un minimum ou d’un maximum. Il est nécessaire pour cela d’effectuer une étude à l’ordre
deux. On utilise pour cela le résultat suivant, qui étend la proposition 1.1

T H ÉOR ÈME 1.3 (TAYLOR -Y OUNG ) Soient U ⊂ Rn , x0 ∈ U et f : Rn → R, de classe C2 dans


U. On a alors pour tout h ∈ U tel que x0 + h ∈ U,
n
∂f 1 n ∂2 f
f ( x 0 + h ) = f ( x 0 ) + ∑ hi ( x 0 ) + ∑ hi h j ( x ) + | h |2 e ( h ) , (1.14)
i =1
∂xi 2 i,j=1 ∂xi ∂x j 0

avec lim|h|→0 e(h) = 0.

15
1 Calcul des variations

Le terme de second ordre dans le théorème ci-dessus fait intervenir la Matrice Hessienne (ou Hes-
sienne) de f en x0 :
∂2 f ∂2 f ∂2 f
 
2 ( x 0 ) ∂x 1 ∂x2
( x0 ) ... ∂x1 ∂xn ( x 0 )
 ∂x2 1 2

 ∂ f ∂ f ∂2 f
 ∂x2 ∂x1 ( x0 ) ( x0 ) ... ∂x2 ∂xn ( x 0 )

∂x22

H f ( x0 ) = 
  . (1.15)
.. .. .. .. 

 . . . . 

∂2 f ∂2 f ∂2 f
∂xn ∂x1 ( x 0 ) ∂xn ∂x2 ( x 0 ) ... ∂xn2
( x0 )

La matrice Hessienne est réelle symétrique, elle est donc diagonalisable. Ses valeurs propres (qui sont
réelles) possèdent une interprétation simple.

T H ÉOR ÈME 1.4 Soit f : U ⊂ Rn → R une fonction de classe C2 dans U. Soit x0 ∈ U un point
critique de f .
1. Si la Hessienne H f ( x0 ) est définie positive (i.e. si ses valeurs propres sont strictement posi-
tives), x0 est un minimum local de f .
2. Si la Hessienne H f ( x0 ) est définie négative (i.e. si ses valeurs propres sont strictement
négatives), x0 est un maximum local de f .
3. Si la Hessienne H f ( x0 ) est indéfinie (avec des valeurs propres non nulles), x0 est un point
selle.

Notons que si certaines valeurs propres de H f ( x0 ) sont nulles, il n’est pas possible de conclure.

E XEMPLE 1.2 Soit f : R2 → R, définie par

f ( x, y) = x4 + y4 − 4xy + 1 ,

et représentée en F IGURE 1.2.

F IG . 1.2: Graphe de la fonction f ( x, y) = x4 + y4 − 4xy + 1

On a f x0 ( x, y) = 4x3 − 4y et f y0 ( x, y) = 4y3 − 4x. Ainsi les points critiques ( x, y) satisfont nécessairement


x9 = x et y9 = y, d’où les trois solutions (0, 0), (1, 1) et (−1, −1). La matrice Hessienne est de la forme

12x2 −4
 
H f ( x, y) = .
−4 12y2

16
1.1 Calcul différentiel, optimisation

On en déduit aisément que (0, 0) est un point selle, alors que (1, 1) et (−1, −1) sont des minima
locaux.

E XEMPLE 1.3 (L OIS DE S NELL -D ESCARTES EN DEUX DIMENSIONS ) Un rayon lumineux se propage à
la vitesse v1 dans le milieu 1 (demi-plan supérieur dans la F IG . 1.3), et à la vitesse v2 dans le milieu 2
(demi-plan inférieur). Le principe de Fermat précise que la lumière suit le trajet le plus économique
en temps. En notant x l’abscisse du point où la trajectoire coupe l’interface, le temps nécessaire pour
aller de ( x1 , z1 ) à ( x2 , z2 ) en passant par le point d’abscisse x vaut
q q
( x − x1 )2 + z21 ( x2 − x )2 + z22
T (x) = + .
v1 v2
Cette quantité est (localement) optimale quand sa dérivée par rapport à x s’annule, c’est à dire lorsque
x − x1 x2 − x
q − q =0,
v1 ( x − x1 )2 + z21 v2 ( x2 − x )2 + z22

ce qui conduit à la loi de Snell-Descartes

sin θ1 sin θ2
= .
v1 v2
On vérifie facilement qu’il s’agit effectivement d’un minimum. On obtient de la même façon la loi de

(x1,z1)

θ1

(x,0)

θ2
(x2,z2)

F IG . 1.3: Loi de Snell-Descartes

Snell-Descartes à la réflexion.

E XEMPLE 1.4 (L OIS DE S NELL -D ESCARTES EN TROIS DIMENSIONS ) Dans le cas tridimensionnel, la si-
tuation est similaire. Il s’agit cette fois de déterminer les coordonnées ( x, y) dans le plan de l’interface
où le rayon coupera celui-ci. Le temps de trajet vaut cette fois
q q
( x − x1 )2 + (y − y1 )2 + z21 ( x2 − x )2 + (y2 − y)2 + z22
T ( x, y) = + .
v1 v2
Il s’agit cette fois d’optimiser par rapport à x et y simultanément, ce qui revient à annuler simul-
tanément les dérivées de T par rapport à x et y, c’est à dire son gradient bidimensionnel. Ceci conduit

17
1 Calcul des variations

aux équations

x − x1 x2 − x
q − q = 0,
v1 ( x − x1 )2 + (y − y1 )2 + z21 v2 ( x2 − x )2 + (y2 − y)2 + z22
y − y1 y2 − y
q − q = 0,
v1 ( x − x1 )2 + (y − y1 )2 + z21 v2 ( x2 − x )2 + (y2 − y)2 + z22

qui impliquent immédiatement

   
x2 − x v2 d2 x − x1
= ,
y2 − y v1 d1 y − y1

i.e. le point du plan de coordonnées ( x, y) se trouve dans le segment compris entre ( x1 , y1 ) et ( x2 , y2 ).


On se ramène donc à un problème bidimensionnel, et le raisonnement ci-dessus s’applique directe-
ment.

1.1.3 Optimisation sous contrainte

Il arrive que l’on ait à rechercher des extrêma de certaines fonctions de plusieurs variables, aux-
quelles sont imposées un certain nombre de contraintes supplémentaires. On a dans ce cas recours à
la méthode des multiplicateurs de Lagrange, qui est illustrée en F IG . 1.4 dans un exemple bidimen-
sionnel. Dans cet exemple, on cherche à minimiser une certaine fonction F définie sur le plan, dont
les lignes de niveau sont tracées en courbes (presque parallèles sur la figure), sous une contrainte
prenant la forme G ( x ) = C (une constante), représentée comme le bord d’un domaine sur la figure).
Il apparaı̂t clairement que l’optimum est obtenu lorsque les gradients de F et G sont confondus.

F IG . 1.4: Optimisation sous contrainte par multiplicateurs de Lagrange : les lignes sont les lignes de
niveau de la fonction à optimiser, et la contrainte est représentée par le bord de la surface
fermée.

Cet exemple peut se généraliser en dimension quelconque, où il prend une forme tout à fait similaire.
Plus précisément, le résultat général est le suivant :

18
1.2 Calcul des variations, équations d’Euler-Lagrange, équation de Beltrami

T H ÉOR ÈME 1.5 Soient f et g deux fonctions différentiables dans Ω ⊂ Rd . Soit x0 ∈ Ω, tel que
∇ g( x0 ) 6= 0. Si f admet un extrêmum en x0 , sous la contrainte g( x ) = 0, alors il existe λ0 tel
qu’en posant
F ( x, λ) = f ( x ) + λg( x ) ,
on ait
∂F
∇ F ( x 0 , λ0 ) = 0 , et ( x , λ0 ) = 0 .
∂λ 0

E XEMPLE 1.5 Cherchons les extrêma de la fonction

f ( x, y, z) = x2 + y2 + z2

sous la contrainte
g( x, y, z) = x + y + z − 1 = 0 .
Pour cela, on forme la fonction étendue

F ( x, y, z, λ) = x2 + y2 + z2 − λ( x + y + z − 1) ,

que l’on optimise. Ceci conduit aux équations

x = y = z = λ/2 .

En imposant la contrainte x + y + z = 1, on obtient la valeur de λ, qui conduit à x = y = z = 1/3.

1.2 Calcul des variations, équations d’Euler-Lagrange, équation de


Beltrami
Le calcul des variations constitue une généralisation du problème de l’optimisation à des fonctions
dépendant non plus d’une ou plusieurs variables réelles, mais aux “fonctions de fonctions” (on parle
alors de fonctionnelles). Dans cette section, on décrit assez rapidement les bases du calcul des varia-
tions, non seulement dans sa formulation la plus usuelle, qui conduit à la mécanique de Hamilton,
mais aussi dans des cadres plus généraux.

1.2.1 Equations d’Euler-Lagrange


Le formalisme d’Euler-Lagrange étend l’approche précédente au cas de fonctionnelles, c’est à dire
d’applications définies sur un espace de fonctions à valeurs dans R (ou C)

Φ : f 1 , . . . f N → Φ( f 1 , . . . f N ) ∈ R (ou C)

c’est à dire d’applications associant une valeur numérique à une ou plusieurs fonctions f 1 , . . . f N , et
l’on recherche les fonctions qui minimisent cette fonctionnelle.
On part du cas simple d’une fonctionnelle Φ, dépendant des valeurs d’une unique fonction recherchée
f et sa dérivée f 0 , sous la forme
Z x2
Φ[ f ] = F ( x, f ( x ), f 0 ( x )) dx . (1.16)
x1

La variable x est appelée variable indépendante , et les variables f ( x ), f 0 ( x ) sont les variables dépen-
dantes.

19
1 Calcul des variations

Le problème posé est de trouver la fonction f telle que le nombre Φ[ f ] soit minimal (ou maximal),
sous contrainte que les valeurs de f aux bords x1 et x2 soient fixées. Dans le cas de des fonctions de
plusieurs variables, rechercher les extrêma d’une fonction revient à chercher les points où la dérivée
s’annule. C’est cette notion qu’il nous faut généraliser au cas des fonctionnelles. Nous allons recher-
cher les fonctions f telles que Φ ne varie pas lorsque l’on varie f de façon infinitésimale, dans une
“direction” quelconque.
Etudier les variations de f dans une “direction” g (ici, g est donc une fonction) donnée revient à
étudier la quantité (la variation)
Φ[ f + eg] − Φ[ f ]
 
d
Dg Φ[ f ] = Φ[ f + eg] = lim .
de e =0 e →0 e
La quantitée Dg Φ porte le nom de dérivée fonctionnelle de Φ dans la direction g ; l’ensemble des
dérivées fonctionnelles de Φ dans “toutes” les directions g (à condition de préciser le sens qu’on
donne à l’expression “toutes”) peut être vu comme une généralisation de la notion de gradient au cas
des fonctionnelles.
On se limite aux fonctions g telles que
g ( x1 ) = g ( x2 ) = 0 .
Un calcul formel montre que ceci revient à écrire
Z x2  
∂F 0 0 ∂F 0
g( x ) ( x, f ( x ), f ( x )) + g ( x ) 0 ( x, f ( x ), f ( x )) dx = 0 ,
x1 ∂f ∂f
et une intégration par parties conduit à
Z x2  
∂F 0 d ∂F 0
g( x ) ( x, f ( x ), f ( x )) + ( x, f ( x ), f ( x )) dx = 0 .
x1 ∂f dx ∂ f 0
On utilise ici la version unidimensionnelle du Lemme fondamental du calcul variationnel

L EMME 1.1 Soit Ω ⊂ Rn un domaine ouvert de l’espace n-dimensionnel, de bord noté ∂Ω, et
soit f ∈ C (Ω), telle que Z
f ( x )h( x ) dx = 0

pour toute fonction h ∈ C2 (Ω) telle que h( x ) = 0 pour tout x ∈ ∂Ω. Alors f ( x ) = 0 pour tout
x ∈ Ω.

En prenant pour Ω l’intervalle Ω =] a, b[, on en déduit alors le résultat principal :

T H ÉOR ÈME 1.6 Considérons la fonctionnelle Φ définie en (1.16), et soit f ∈ C2 ([ a, b]) un


extrêmum de cette fonctionnelle, avec des conditions aux bords fixées

f ( x1 ) = f 1 , f ( x2 ) = f 2 .

Alors f satisfait nécessairement l’équation différentielle

∂F d ∂F
− =0, (1.17)
∂f dx ∂ f 0

appelée équation d’Euler-Lagrange associée.

20
1.2 Calcul des variations, équations d’Euler-Lagrange, équation de Beltrami

E XEMPLE 1.6 (L A LIGNE DROITE ) Etant donné un chemin continu

y : x ∈ [ x1 , x2 ] → y ( x )

reliant y1 = y( x1 ) à y2 = y( x2 ), sa longueur s’écrit


Z x2 q
L[y] = 1 + y0 ( x )2 dx ,
x1

c’est à dire F ( x, y, y0 ) =
p
1 − y0 ( x )2 : pas de dépendance explicite en x et y. L’équation d’Euler-
Lagrange s’écrit donc

d ∂F d y0 ( x ) y00 ( x )
= = =0,
dx ∂y0 (1 + y0 ( x )2 )3/2
p
dx 1 + y0 ( x )2

ce qui implique y00 ( x ) = 0 pour tout x, i.e. y( x ) = ax + b, où a et b sont déterminés par les conditions
aux bords. On retrouve donc bien une trajectoire rectiligne entre les deux points.

Cet exemple était aussi intéressant car il s’agissait d’un cas où la fonction F ne dépend pas explicite-
ment de f , mais seulement de f 0 . Alors, l’équation d’Euler-Lagrange prend la forme plus simple

∂F
= C te .
∂f0

1.2.2 Equation de Beltrami


Une autre situation dans laquelle les choses se simplifient est celle où F ne dépend pas explicitement
de x. Dans ce cas, on peut écrire

d ∂F ∂F
F ( f ( x ), f 0 ( x )) = f 0 ( x ) ( f ( x ), f 0 ( x )) + f 00 ( x ) 0 ( f ( x ), f 0 ( x )) .
dx ∂f ∂f

L’équation d’Euler-Lagrange implique alors que

∂F d ∂F d 0 ∂F
f 0 (x) ( f ( x ), f 0 ( x )) = f 0 ( x ) ( f ( x ), f 0 ( x )) = [ f ( x ) F ( f ( x ), f 0 ( x ))] − f 00 ( x ) 0 ( f ( x ), f 0 ( x ))
∂f dx ∂ f 0 dx ∂f

d’où
d d ∂F ∂F
F ( f ( x ), f 0 ( x )) = f 0 (x) ( f ( x ), f 0 ( x )) + f 00 ( x ) 0 ( f ( x ), f 0 ( x ))
dx dx ∂ f 0 ∂f
 
d 0 ∂F 0
= f ( x ) 0 ( f ( x ), f ( x )) .
dx ∂f

On en déduit l’équation de Beltrami

P ROPOSITION 1.2 Si la fonction F ne dépend pas explicitement de la variable indépendante x,


alors l’équation d’Euler-Lagrange se ramène à l’équation de Beltrami

∂F
F ( f ( x ), f 0 ( x )) − f 0 ( x ) ( f ( x ), f 0 ( x )) = C te . (1.18)
∂f0

21
1 Calcul des variations

A
x1 =0 x x
2

y B

F IG . 1.5: Trajet le plus court (en temps) d’un point à un autre : trois trajectoires possibles, plus ou
moins vraisemblables.

Ce résultat a souvent d’importantes implications lorsqu’il s’applique à un contexte physique. Il tra-


duit le fait que lorsque la fonctionnelle à minimiser ne comporte pas de dépendance explicite dans la
variable indépendante, alors il existe une quantité conservée , ici

∂F
F − f0 .
∂f0

Par exemple, dans le cas de l’application à la mécanique Hamiltonienne, nous verrons que lorsque le
Lagrangien ne dépend pas explicitement du temps (qui est alors la variable indépendante), il existe
une quantité conservée, le Hamiltonien, qui représente en fait l’énergie du système considéré.
0 0
p
0 2
E XEMPLE 1.6 ( SUITE ). Dans ce cas, on a F ( x, y, y ) = F (y ) = 1 + y , et la proposition ci-dessus
s’applique. On écrit

∂F (y0 ) y 02 1
q
F (y0 ) − y0 = 1 + y 02 − p =p .
∂y0 1 + y 02 1 + y 02

Cette quantité est constante si et seulement si y0 est constante ce qui nous conduit au même résultat.

1.3 Quelques exemples... et contre-exemples simples


1.3.1 Le brachistrochrone
On considère un mobile de masse m, asujetti à glisser sans frottement sur une surface inclinée reliant
un point initial A de coordonnées ( x1 , z1 ) à un point final B de coordonnées ( x2 , z2 ), utilisant la seule
force de la pesanteur. On suppose que la vitesse initiale du mobile est nulle, et on cherche la forme de
la surface inclinée (donc la trajectoire du mobile) qui conduira au trajet le plus court en temps.
On note x la variable horizontale, qui sera notre variable indépendante, et z = z( x ) la variable verti-
cale (dépendante), orientée vers le bas. On choisit le système de coordonnées de sorte que A soit placé
à l’origine des abscisses et des côtes. L’énergie cinétique et l’énergie potentielle valent respectivement

1 2
T= mv , V = −mgz + C .
2
La conservation de l’énergie totale implique que

E = T+V = C

22
1.3 Quelques exemples... et contre-exemples simples

de sorte que la vitesse varie avec l’altitude comme


p
v(z) = 2gz .

Le temps total nécessaire pour le trajet x ∈ [ x1 , x2 ] → z( x ) vaut


Z x2 p
1 + z 0 ( x )2
Z x2
ds( x ) 1
Φ[z] = =p p dx
x1 v(z( x )) 2g x1 z( x )

On est bien dans le cas de l’équation de Beltrami (pas de dépendance explicite de F dans la variable
indépendante x), qui s’écrit donc

z 0 ( x )2
p
1 + z 0 ( x )2
p − p =C.
z( x )(1 + z0 ( x )2 ) z( x )

Quelques manipulations donnent

C 2 z ( x ) 1 + z 0 ( x )2 = 1 ,


d’où, en posant k = 1/C2 ,


s
dz k − z( x )
(x) = .
dx z( x )

Remarquons
p que C2 z ≤ 1, donc 0 ≤ z ≤ k. On peut donc poser z = k sin2 φ, d’où on déduit
(k − z)/z = cotanφ.
Pour exprimer x en fonction de φ, calculons

dx dx dz
= = 2k sin2 φ = k[1 − cos(2φ)] .
dφ dz dφ

Ainsi, on en déduit (puisque pour x = 0 on a aussi z = 0)

x = k (φ − sin(2φ)/2) ,

d’où on tire une forme paramétrique de la solution

k

x = 2 (2φ − sin(2φ))
k (1.19)
z = 2 (1 − cos(2φ)) ,

ce qui est l’équation paramétrique d’une cycloı̈de. On peut éliminer le paramètre φ, en posant a =
k/2, et en remarquant que
−1 a − z
 
2φ = cos ,
a
puis en insérant dans l’équation de x
s
2
a−z a−z a−z
     p
−1 −1
x (z) = a cos −a 1− = a cos − 2az − z2 .
a a a

La valeur numérique de a est alors déterminée par la condition limite x (z2 ) = x2 .

23
1 Calcul des variations

F IG . 1.6: La cycloı̈de.

F IG . 1.7: Le phénomène du mirage : deux trajectoires de lumière du ciel (traits pleins) ; la trajectoire du
bas est courbée par un gradient de densité (dû, par exemple, à un gradient de température) ;
l’oeil perçoit une image virtuelle au sol, qui est en fait une image du ciel.

F IG . 1.8: Un vrai mirage

24
1.3 Quelques exemples... et contre-exemples simples

1.3.2 Le Principe de Fermat


Retour sur les lois de Snell-Descartes, dans un cas où l’indice (et donc la vitesse de propagation de la
lumière) dépend de la position : le problème des mirages, illustré en F IG . 1.7 et F IG . 1.8
Le temps de trajet dépend du chemin choisi ; en prenant y = y( x ), ou alternativement x = x (y), on
obtient pour le temps de trajet de la lumière entre deux points l’expression suivante
Z Z Z q Z q
nds = f (y)ds = 0 2
f (y) 1 + x (y) dy = f (y) 1 + y0 ( x )2 dx .

On privilégie y comme variable indépendante, car on n’a ainsi pas de dépendance explicite dans la
variable dépendante x, ce qui simplifie l’équation d’Euler-Lagrange1 . Celle-ci donne
x0
f (y) √ =C,
1 + x 02
c’est à dire, en supposant x 0 ≥ 0 (le cas x 0 ≤ 0 se traite similairement, et conduit à la même solution)
C
x0 = p .
f ( y )2 − C 2
Pour aller plus loin, il est temps de faire un choix pour la variation de l’indice en fonction de l’altitude.
Supposons une dépendance linéaire. Le choix particulier f (y) = n0 (1 + αy) donne
C dy
dx = p
αn0 (y + 1/α)2 − (C/αn0 )2
en posant u = y + 1/α = (C/αn0 )coshθ on obtient dy = αnC0 sinhθ dθ, d’où

C 2
 
sinhθ dθ C
dx = q = dθ ,
αn0 αn0
(C/αn0 )2 cosh2 θ − (C/αn0 )2
et finalement, une simple intégration donne θ = (αn0 /C )( x − x0 ), d’où
1 C
y=− + cosh((αn0 /C )( x − x0 )) .
α αn0
Il s’agit d’une chaı̂nette, ou caténoı̈de, que l’on peut approximer par une parabole au second ordre,
autour de x0 . Les constantes d’intégration x0 et C peuvent être déterminées en considérant les condi-
tions aux bords.

1.3.3 La colonne de Cox et Overton...


ou même les plus grands peuvent se tromper...
Les équations d’Euler-Lagrange que nous avons dérivées plus haut donnent des conditions nécessaires
que doit satisfaire l’optimum de la fonctionnelle considérée, sous l’hypothèse que celui-ci soit deux fois
différentiable. Il existe des problèmes pour lesquels cette hypothèse n’est pas adaptée, au sens où il
existe des solutions f ne la satisfaisant pas, mais donnant à la fonctionnelle une valeur meilleure que
la meilleure solution deux fois différentiable.
Un exemple célèbre est donné par un problème étudié par Lagrange en 1783 (initialement formulé
par Euler en 1744 puis Bernoulli) : trouver la forme optimale d’une colonne de hauteur et volume
fixés, pouvant supporter une pression maximale au sommet. Lagrange eut le grand mérite de donner
une formulation mathématique précise au problème, mais la solution qu’il proposa, et qui le conduit
à une colonne cylindrique, était entâchée d’un certain nombre d’erreur, en particulier une hypothèse
de différentiabilité de la solution. Il a en fait fallu attendre 1992 (après plusieurs tentatives, chacune
marquée par des erreurs dues à des hypothèses inadaptées) pour que Cox et Overton aboutissent à
une solution rigoureuse à ce problème, qui s’est ainsi avéré bien plus difficile qu’il n’y paraissait.
1 On peut vérifier qu’en prenant x comme variable indépendante, l’équation de Beltrami conduit au même résultat.

25
1 Calcul des variations

F IG . 1.9: Le problème d’Euler-Bernoulli, la solution de Lagrange (à gauche) et la solution de Cox et


Overton (à droite)

1.4 Extensions à des cadres plus généraux


Le cas que nous avons considéré est en fait le cas le plus simple, qui peut être généralisé de diverses
manières. Les cas d’intérêt les plus classiques concernent les situations multidimensionnelles, ainsi
que les cas de fonctionnelles dépendant de plusieurs fonctions.

1.4.1 Le cas multidimensionnel ; exemples de l’équation de Laplace et de l’équation des


ondes
La généralisation la plus immédiate concerne l’extension au cas d’une variable indépendante x ∈
Ω ⊂ Rd vectorielle : la fonctionnelle Φ considérée dépend alors des dérivées partielles de f par rapport
aux différentes composantes de x. Pour simplifier, on notera

∂f
f x0 i = , i = 1, . . . d
∂xi

la dérivée partielle de la fonction f par rapport à la variable xi ,

∂2 f
f x00i x j = , i, j = 1, . . . d
∂xi ∂x j

et ainsi de suite.
Prenons l’exemple bidimensionnel : on se donne un domaine du plan Ω ⊂ R2 , dont on note ∂Ω le
bord, et on recherche les extrêma f : Ω → R de la fonctionnelle Φ définie par
Z
Φ[ f ] = F ( x, f ( x ), f x0 1 ( x ), f x0 2 ( x )) dx .

Comme dans le cas plus simple, on doit étudier les variations de Φ dans les “directions” g

Φ( f + eg) − Φ( f )
 
d
Dg Φ[ f ] = Φ[ f + eg] = lim ,
de e =0 e →0 e

en se limitant aux fonctions g telles que g( x ) = 0 pour tout x ∈ ∂Ω. En suivant pas à pas le calcul
précédent, on aboutit à
Z Z
∂F ∂F
g( x ) ( x, f ( x ), f x0 1 ( x ), f x0 2 ( x )) dx + g0x1 ( x ) ( x, f ( x ), f x0 1 ( x ), f x0 2 ( x )) dx
Ω ∂f Ω ∂ f x0 1

26
1.4 Extensions à des cadres plus généraux

Z
∂F
+ g0x2 ( x ) ( x, f ( x ), f x0 1 ( x ), f x0 2 ( x ))) dx = 0 ,
Ω ∂ f x0 2
et une intégration par parties dans chacun des deux derniers termes, prenant en compte le fait que
g = 0 sur ∂Ω conduit à
Z 
∂F ∂ ∂F
g( x ) ( x, f ( x ), f x0 1 ( x ), f x0 2 ( x )) + ( x, f ( x ), f x0 1 ( x ), f x0 2 ( x ))
Ω ∂f ∂x1 ∂ f x0 1

∂ ∂F 0 0
+ ( x, f ( x ), f x1 ( x ), f x2 ( x )) dx = 0 .
∂x2 ∂ f x0 2
Il suffit alors d’utiliser le lemme fondamental du calcul des variations (voir le lemme 1.1), pour en
déduire
∂F ∂ ∂F ∂ ∂F
− − =0.
∂f ∂x1 ∂ f x0 1 ∂x2 ∂ f x0 2
Plus généralement, on montre le résultat suivant

T H ÉOR ÈME 1.7 Soit Ω ⊂ Rd , et soit f ∈ C2 (Ω) un extrêmum de la fonctionnelle Φ définie par
Z
Φ[ f ] = F ( x, f ( x ), f x0 1 ( x ), . . . , f x0 d ( x )) dx ,

avec conditions aux bords f ( x ) = f 0 ( x ) fixé, pour tout x ∈ ∂Ω. Alors f satisfait nécessairement
l’équation d’Euler-Lagrange correspondante

d
∂F ∂ ∂F
−∑ =0.
∂f i =1
∂xi ∂ f x0 i

On obtient donc un résultat qui est une généralisation directe du Théorème 1.6.
On considère ci-dessous un certain nombre d’exemples d’applications de ce résultat.

Surfaces minimales

Le problème de Plateau (ou du film de savon) : que se passe-t-il lorsque l’on plonge un anneau de
forme quelconque dans de l’eau savonneuse ? Un film de savon se forme à l’intérieur de l’anneau,
représentant une surface. La forme de cette surface peut être calculée, partant du principe que la
nature cherche à minimiser l’aire de la surface ainsi créée.
On modélise cela de la façon suivante. on considère un domaine Ω ⊂ R2 du plan, de bord ∂Ω et la
hauteur du film de savon au point x est notée z = u( x ), x ∈ Ω. L’anneau est modélisé comme une
fonction u0 : x ∈ ∂Ω → u0 ( x ) ∈ R, et la surface du film de savon représenté par u s’écrit comme
Z q
Φ[u] = 1 + u0x1 ( x )2 + u0x2 ( x )2 dx . (1.20)

Le problème posé est donc de minimiser Φ, avec la condition au bord

u = u0 sur ∂Ω .

On a donc q
F ( x, u( x ), u0x1 ( x ), u0x2 ( x )) = 1 + u0x1 ( x )2 + u0x2 ( x )2 .

27
1 Calcul des variations

fonction qui ne dépend explicitement ni de la variable indépendante ni de u. Donc Calculons

∂F u0x1
= ,
∂u0x1
q
1 + u0x1 ( x )2 + u0x2 ( x )2

et une expression similaire pour la dérivée par rapport à u0x2 . Calculons maintenant

∂ ∂F u00x1 x1 [1 + u0x1 ( x )2 + u0x2 ( x )2 ] − u0x1 ( x )(u0x1 ( x )u00x1 x1 ( x ) + u0x2 ( x )u00x1 x2 ( x ))


( x ) = ,
∂x1 ∂u0x1 [1 + u0x1 ( x )2 + u0x2 ( x )2 ]3/2
∂ ∂F
et une expression similaire pour ∂x2 ∂u0x ( x ).
2
L’équation d’Euler-Lagrange associée

∂ ∂F ∂ ∂F
0
(x) + (x) = 0
∂x1 ∂u x1 ∂x2 ∂u0x2

prend donc la forme


   
2 2
1 + u0x1 u00x2 x2 − 2u0x1 u0x2 u00x1 x2 + 1 + u0x2 u00x1 x1 = 0 (1.21)

Equation de Laplace

On cherche à déterminer le champ électromagnétique à l’intérieur d’un domaine Ω ⊂ R3 , dont les


bords sont fixés à un potentiel φ0 . On note φ le potentiel dont dérive le champ électrique E.
L’énergie électromagnétique engendrée par un potentiel φ quelconque dans un volume Ω ⊂ R3 est
de la forme Z Z
e0
W [φ] = |∇φ( x )|2 dx = F [φx0 1 ( x ), φx0 2 ( x ), φx0 3 ( x )] dx ,
2 Ω Ω
avec
e0  0
F [φx0 1 ( x ), φx0 2 ( x ), φx0 3 ( x )] = φx1 ( x )2 + φx0 2 ( x )2 + φx0 3 ( x )2

2
Pour un potentiel aux bords fixé, le potentiel intérieur est celui qui minimise cette énergie.
En variant W [φ] par rapport à φ, avec conditions aux bords fixées φ = φ0 sur ∂Ω, on obtient l’équation
d’Euler-Lagrange
3
∂2 φ
−e0 ∑ 2 = −e0 ∆φ = 0 .
i =1 ∂xi

C’est l’équation de Laplace. En l’absence de conditions aux bords, un potentiel nul (et donc un champ
nul) serait une solution, ce qui n’est évidemment plus le cas en présence de conditions aux bords.

Equation des ondes

Soit φ : ( x, t) ∈ Ω ⊂ R4 → φ( x, t) ∈ R une fonction de l’espace et du temps, représentant la valeur


d’un champ (scalaire) au point x et à l’instant t. On suppose que l’énergie associée à ce champ φ
coı̈ncide avec l’intégrale de la (pseudo)norme de Minkowsky du quadrivecteur des dérivées spatiales
et temporelle du champ :
"  #
1 ∂φ( x, t) 2
Z 
2
I [φ] = |∇φ( x, t)| − 2 dxdt .
Ω c ∂t

En minimisant cette quantité par rapport à φ avec une condition aux bords donnée

φ( x, t) = φ0 ( x, t) , ∀ x ∈ ∂Ω

28
1.4 Extensions à des cadres plus généraux

Il est facile de voir, par un calcul similaire au précédent, que l’équation d’Euler-Lagrange correspon-
dante est alors l’équation des ondes

∂2 1
2
φ( x, t) = 2 ∆φ( x, t) ,
∂t c
∆ représentant le Laplacien spatial.

1.4.2 Fonctionnelles dépendant de plusieurs fonctions


Une autre extension possible est celle au cas de fonctionnelles non plus d’une mais de plusieurs va-
riables dépendantes. Contrairement à la section précédente, c’est maintenant la variable dépendante
qui est ici vectorielle, et non plus la variable indépendante.
Par exemple, supposons que Φ s’écrive sous la forme
Z
Φ[ f 1 , f 2 ] = F ( x, f 1 ( x ), f 2 ( x ), f 10 ( x ), f 20 ( x )) dx .

Pour trouver les extrêma d’une telle fonctionnelle, c’est à dire les couples ( f 1 , f 2 ) qui la minimisent
ou la maximisent, il faut faire varier simultanément f 1 et f 2 , et annuler les dérivées fonctionnelles

Φ[ f 1 + eg1 , f 2 ] − Φ[ f 1 , f 2 ] Φ[ f 1 , f 2 + eg2 ] − Φ[ f 1 , f 2 ]
lim , lim
e →0 e e →0 e

pour toutes fonctions g1 , g2 de classe C1 s’annulant sur les bords du domaine considéré.
Il est facile de vérifier que dans un tel cas de figure, on obtient non plus une mais deux équations
d’Euler-Lagrange, donc un système d’équations de la forme
d ∂F
( ∂F
∂ f 1 − dx ∂ f 0 = 0,
1
d ∂F
∂F
∂ f2 − dx ∂ f 20 = 0.

Dans le cas de dimension quelconque, on montre similairement le résultat suivant

T H ÉOR ÈME 1.8 Soit Φ une fonctionnelle de plusieurs fonctions f 1 , f 2 , . . . f n , de la forme


Z
Φ[ f 1 , f 2 , . . . f n ] = F ( x, f 1 ( x ), f 2 ( x ), f 10 ( x ), f 20 ( x ), . . . f n ( x ), f n0 ( x )) dx ,

où F est une fonction fixée, continûment différentiable.


Soit ( f 1 , . . . f n ) ∈ C2 (Rn ) un optimum de cette fonctionnelle, avec des conditions aux bords
f k ( x1 ) et f k ( x2 ) fixées. Alors celui-ci satisfait nécessairement le système d’équations d’Euler-
Lagrange
∂F d ∂F
− = 0 , k = 1, . . . n .
∂ fk dx ∂ f k0

E XEMPLE 1.7 La mécanique Hamiltonienne fournit de nombreux exemples de telles situations. No-
tons par exemple q1 (t), q2 (t), q3 (t) les coordonnées d’un point matériel à l’instant t, et q̇i (t), i = 1, 2, 3
les dérivées temporelles de ces coordonnées. Si on note L(t, q1 (t), . . . q̇3 (t)) la densité Lagrangienne
associée, alors les trajectoires entre t1 et t2 sont données par les minima de l’intégrale d’action
Z t2
A[q] = L(t, q1 (t), q2 (t), q3 (t), q̇1 (t), q̇2 (t), q̇3 (t)) dt .
t1

29
1 Calcul des variations

L’équation de Beltrami (Proposition 1.2) se généralise elle aussi de façon simple. Supposons que la
fonction F ne dépende pas explicitement de la variable dépendante x, on peut alors écrire (en omet-
tant les variables, pour simplifier les écritures) pour tout i

n  
dF ∂F ∂F
=∑ f i0 + f i00 0 .
dx i =1
∂ fi ∂ fi

Partant des équations d’Euler-Lagrange du T H ÉOR ÈME 1.7, multipliant la i-ième par par f i0 et som-
mant sur i, on obtient alors
n n
∂F d ∂F
∑ fi0 ∂ fi = ∑ fi0 dx ∂ f i0
i =1 i =1
n
dF ∂F
= − ∑ f i00 0 ,
dx i=1 ∂ fi

d’où
n  
dF ∂F d ∂F
dx
= ∑ f i00
∂ f i0
+
dx ∂ f i0
i =1
!
n
d 0 ∂F
=
dx ∑ fi ∂ f 0 .
i =1 i

On a donc montré

P ROPOSITION 1.3 Avec les notations du théorème 1.8, si la fonction F ne dépend pas explicite-
ment de la variable indépendante x, alors l’équation d’Euler-Lagrange se ramène à l’équation de
Beltrami
n
∂F
F ( f 1 , . . . f n , f 10 , . . . f n0 ) − ∑ f i0 0 ( f 1 , . . . f n , f 10 , . . . f n0 )) = C te .
i =1
∂ fi

Dans ce cadre aussi, l’absence de dépendance dans la variable indépendante se traduit par l’existence
d’une quantité conservée. On verra plus loin une interprétation de cette formule dans le cadre de la
mécanique Hamiltonienne.

1.4.3 Fonctionnelles de dérivées d’ordre supérieur


Nous avons jusqu’à présent considéré uniquement le cas de fonctionnelles Φ dépendant d’une va-
riable dépendante y et de sa dérivée y0 (essentiellement motivés par la formulation Hamiltonienne
de la mécanique classique). On peut en fait étendre le formalisme du calcul des variations à des
cadres plus larges, comme par exemple le cadre où la fonctionnelle Φ dépend de dérivées d’ordre
supérieur de la variable dépendante y. On est dans ce cas conduit à des équations différentielles
d’ordre supérieur.
Par exemple, considérons la fonctionnelle Φ, définie par
Z x2
Φ[ f ] = F ( x, f ( x ), f 0 ( x ), f 00 ( x )) dx ,
x1

et soit f ∈ C4 , extrêmum de cette fonctionnelle. Alors, pour tout g ∈ C2 , telle que g( x1 ) = g( x2 ) =

30
1.4 Extensions à des cadres plus généraux

g0 ( x1 ) = g0 ( x2 ) = 0, on a
Z x2 
d ∂F
Φ[ f + eg] = g( x ) ( x, f ( x ), f 0 ( x ), f 00 ( x ))
de x1 ∂f
∂F
+ g0 ( x ) 0 ( x, f ( x ), f 0 ( x ), f 00 ( x ))
∂f

00 ∂F 0 00
+ g ( x ) 00 ( x, f ( x ), f ( x ), f ( x )) dx
∂f

Par intégrations par parties successives, et application du lemme fondamental, on obtient l’équation
d’Euler-Lagrange correspondante

∂F d ∂F d2 ∂F
− 0
+ 2 00 = 0
∂f dx ∂ f dx ∂ f

On voit bien que cette équation sera généralement une équation différentielle d’ordre supérieur.

R EMARQUE 1.3 Dans ce cadre, on voit intervenir des dérivées d’ordres supérieurs des fonctions
considérées. Il est donc nécessaire en toute rigueur, de faire les hypothèses de différentiabilité cor-
respondantes pour pouvoir énoncer un théorème correct.

1.4.4 Conditions aux bords naturelles


Les calculs que nous avons effectués jusqu’à présent concernaient les situations dans lesquelles les
conditions aux bords sont totalement fixées. Il existe des situations dans lesquelles les conditions aux
bords ne sont pas complètement fixées, et il est possible d’étendre l’analyse faite plus haut à ces cas
de figure.
Prenons par exemple le cas où f ∈ C2 ([ x1 , x2 ]) extrêmum de
Z x2
Φ[ f ] = F ( x, f ( x ), f 0 ( x )) dx
x1

sous la seule condition aux limites


f ( x1 ) = a .
Dans ce cas, la condition nécessaire d’existence d’un extrêmum en f s’écrit

d
Φ[ f + eg] = 0
de

pour tout g ∈ C2 (] x1 , x2 [) tel que g( x1 ) = 0, sans autre condition en x = x2 pour g. Ceci implique
Z x2 h i
g( x ) ∂F
∂ f ( x, f ( x ), f 0 ( x )) − d ∂F
dx ∂ f 0 ( x, f ( x ), f 0 ( x )) dx
x1
+ g( x2 ) ∂∂Ff 0 ( x2 , f ( x2 ), f 0 ( x2 )) = 0 .

Ceci étant vérifié pour tout g, en particulier pour les g telles que g( x2 ) = 0, on en déduit que l’équation
d’Euler-Lagrange (1.17) reste valide. De plus, le cas g(s2 ) 6= 0, quelconque, implique une seconde
équation, appelée condition aux bords naturelle

∂F
( x2 , f ( x2 ), f 0 ( x2 )) = 0 . (1.22)
∂f0

31
1 Calcul des variations

F IG . 1.10: Pendule double

1.5 Formalisme Hamiltonien


La mécanique Hamiltonienne est l’exemple le plus classique d’application du calcul variationnel, et
des théorèmes 1.6, 1.7 et 1.8. Elle postule que la trajectoire suivie entre les instants t1 et t2 par un
système en mouvement dans l’espace est toujours celle qui optimisera la quantité suivante, appelée
action Z t2
J= Ldt ,
t1
où L = T − V est le Lagrangien, égal à la différence entre l’énergie cinétique et l’énergie potentielle.
C’est ce que l’on appelle le principe de moindre action . Le Lagrangien est en fait une fonctionnelle,
qui dépend de la trajectoire suivie.
Supposons par exemple que le système dynamique considéré soit décrit par des coordonnées q1 , q2 , . . . qn
et leurs dérivées q̇1 , q̇2 , . . . q̇n , alors le Lagrangien prend la forme
L = L(q1 , q2 , . . . qn , q̇1 , q̇2 , . . . q̇n ) ,
et conduit aux équations du mouvement, appelées ici équations de Lagrange
∂L d ∂L
− =0, i = 1, . . . n .
∂qi dt ∂q̇i

R EMARQUE 1.4 Ces équations du mouvement peuvent aussi être obtenues à partir des lois de New-
ton (et sont en fait équivalentes). Toutefois, pour des systèmes complexes, les équations de Lagrange
sont généralement bien plus faciles à obtenir que ce que l’on pourrait faire à partir des équations de
Newton.
E XEMPLE 1.8 (P ENDULE DOUBLE ) On considère le pendule double représenté en F IG . 1.10, et on note
θ et φ les coordonnées angulaires décrivant les deux brins.
On choisit pour origine des hauteurs des deux masses leur hauteur d’équilibre. L’énergie potentielle
est alors donnée par
V (θ, φ) = mga(1 − cos(θ )) + Mg ( a(1 − cos θ ) + b(1 − cos φ)) .
On montre facilement que l’énergie cinétique est quant à elle donnée par
1 2 2 1
ma θ̇ + M a2 θ̇ 2 + b2 φ̇2 + 2abθ̇ φ̇ sin(θ + φ) .

T (θ, φ, θ̇, φ̇) =
2 2
Tous calculs faits, les équations d’Euler-Lagrange s’écrivent
d
(m + M) a2 θ̇ + Mabφ̇ sin(θ + φ) + ( M + m) ga sin θ = 0

dt
d
Mb2 φ̇ + Mabθ̇ sin(θ + φ) + Mgb sin φ = 0 .

dt

32
1.6 Calcul des variations sous contrainte

Le Hamiltonien : Supposons maintenant que le Lagrangien ne dépende pas explicitement du temps.


On peut alors utiliser la variante multidimensionnelle de l’identité de Beltrami (Proposition 1.3) et
écrire les équations d’Euler-Lagrange sous la forme
!
n
d ∂L
L − ∑ q̇i =0,
dt i =1
∂q̇i

ce qui implique que


n
∂L
L − ∑ q̇i =C,
i =1
∂q̇i
C étant une constante. Cette propriété est appelée loi de conservation. On définit le Hamiltonien du
système par
n
∂L
H = ∑ q̇i −L, (1.23)
i =1
∂q̇i
et la loi de conservation stipule donc que le Hamiltonien est une quantité conservée.

1.6 Calcul des variations sous contrainte


Il est parfois possible d’utiliser le même type d’approche pour résoudre des problèmes variationnels
lorsque des contraintes supplémentaires sont imposées à la solution. On a alors recours à la méthode
des multiplicateurs de Lagrange, que nous avons déjà vu dans la section 1.1.3, et à une généralisation
du théorème 1.5.
Plus précisément :

T H ÉOR ÈME 1.9 Soit f : Ω ⊂ Rn → R, extrêmum de la fonctionnelle


Z
Φ[ f ] = F ( x, f ( x ), ∇ f ( x )) dx ,

avec conditions aux bords f = f 0 sur ∂Ω, et sous la contrainte


Z
Ψ[ f ] := G ( x, f ( x ), ∇ f ( x )) dx = C ,

C étant une constante fixée. Alors f est nécessairement solution des équations d’Euler-Lagrange
associées à la fonctionnelle
Z 
Γ[ f ] = Φ[ f ] − λ(Ψ[ f ] − C ) =

F ( x, f ( x ), ∇ f ( x )) − λG ( x, f ( x ), ∇ f ( x )) dx − C .

Notons que C ne joue aucun rôle dans les équations d’Euler-Lagrange ci-dessus, et peut donc être
supprimé. Il doit cependant être pris en compte (naturellement) lorsque la contrainte est imposée, ce
qui permet de déterminer la valeur du multiplicateur λ.
On peut mettre ce résultat en application sur l’exemple suivant.

E XEMPLE 1.9 (C ORDE PESANTE À L’ ÉQUILIBRE ) on se donne une corde pesante de masse linéique µ
et de longueur L, dans le plan xOz, attachée à ses extrêmités A = (0, 0) et B = ( a, z1 ). La corde est
supposée à l’équilibre, donc le problème se ramène à minimiser l’énergie potentielle
Z a q
V= µgz( x ) 1 + z0 ( x )2 dx ,
0

33
1 Calcul des variations

sous la contrainte Z aq
L= 1 + z0 ( x )2 dx .
0
On introduit donc la fonctionnelle
Z a q Z a q 
J [z] = 1 + z0 ( x )2 dx + λ
µgz( x ) 1 + z0 ( x )2 dx − L
0 0
Z a q
= (µgz( x ) + λ) 1 + z0 ( x )2 dx − λL ,
0

à minimiser par rapport à z et à λ. Il n’y a pas de dépendance explicite dans la variable indépendante
x, on peut donc utiliser l’identité de Beltrami, qui s’écrit
p z 02 µgz + λ
(µgz + λ) 1 + z02 − (µgz + λ) √ =√ =C.
1 + z 02 1 + z 02

Posons u = z − λ/µg. On a u0 = z0 et l’équation devient µgu/ 1 + u02 = C. Cette forme suggère de
rechercher u sous la forme u = ccosh(( x − x0 )/c), ce qui impose c = C/µg. Finalement, la solution
est une chaı̂nette
x − x0
 
λ
z( x ) = − + c cosh .
µg c
Les constantes c et x0 sont déterminées par les conditions aux limites, et le multiplicateur de Lagrange
λ est quant à lui déterminé en imposant la contrainte.

La physique offre de nombreuses autres applications de ce principe variationnel sous contrainte. Pour
n’en citer qu’un autre, on peut mentionner l’équation de Schrödinger.

E XEMPLE 1.10 (F ORMULATION VARIATIONNELLE POUR L’ ÉQUATION DE S CHR ÖDINGER ) L’équation de


Schrödinger donnant les niveaux d’énergie d’un opérateur Hamiltonien

h̄2
Hψ = Eψ , H=− ∆+V ,
2m
où V est une fonction à valeurs réelles, peut être obtenue comme équation d’Euler-Lagrange d’un
problème variationnel (c’est d’ailleurs ainsi que Schrödinger la formula initialement). On considère
pour cela la fonctionnelle
" #
h̄2
Z
Φ[ψ] = 2 2
|∇ψ( x )| + V ( x )|ψ( x )| dx .
R3 2m

On montre facilement que la fonction φ qui minimise cette fonctionnelle, avec conditions aux limites
nulles, et sous la contrainte de normalisation
Z
|ψ( x )|2 dx = 1 ,
R3

doit satisfaire l’équation de Schrödinger ci-dessus.

34
Deuxième partie

Transformations intégrales

35
C HAPITRE

2 Transformation de
Fourier finie

2.1 Préliminaires : équation de la chaleur finie


Le problème de l’équation de la chaleur est un problème très classique de la physique. Il peut être
résolu assez facilement dans un cadre très simple. Supposons que la variable temporelle soit une
variable continue (t ∈ R+ ), mais considérons une variable spatiale discrète : n ∈ Z. On considère
maintenant un champ de température

T : (n, t) → Tn (t) ∈ R ,

et on suppose pour simplifier encore que le champ T est périodique en n : il existe un nombre enter
positif N tel que pour tout n, on ait Tn+ N (t) = Tn (t) pour tout t. Ainsi, nous avons ramené notre
problème à un problème plus simple ne faisant intervenir que N variables indépendantes.
La version correspondante de l’équation de la chaleur précédente est la famille d’équation différentielles
couplées
dTn (t)
= α ( Tn+1 (t) − 2Tn (t) + Tn−1 (t)) , n = 0, . . . N − 1 , (2.1)
dt
et c’est ce système que nous voulons résoudre. On introduit pour cela les fonctions (t, k ) → T̂k (t),
définies par
N −1
T̂k (t) = ∑ Tn (t) e−2iπkn/N . (2.2)
n =0

Calculons maintenant
N −1
dTn (t) −2iπkn/N d T̂ (t)
∑ dt
e = k
dt
.
n =0

La même transformation appliquée au membre de droite de l’équation de la chaleur discrète conduit



N −1 N −1 
∑ (Tn+1 (t)−2Tn (t)+ Tn−1 (t)) e−2iπ N = ∑
kn kn
e2iπk/N− 2 + e−2iπk/N Tn (t)e−2iπ N
n =0 n =0
 
2 πk
= −4 sin T̂k (t) .
N

Ainsi, notre équation devient


 
∂ T̂k (t) πk
= −4α sin2 T̂k (t) . (2.3)
∂t N

37
2 Transformation de Fourier finie

Il s’agit d’une famille de N équations différentielles découplées, dont les solutions sont connues :

  
2 πk
T̂k (t) = T̂k (0) exp −4αt sin . (2.4)
N

Ainsi, si nous savons calculer les Tn (t) à partir des T̂k (t), nous aurons résolu notre problème.
La transformation { Tn , n = 0, . . . N − 1} → { T̂k , k = 0, . . . N − 1} est un exemple de ce que l’on appelle
la transformation de Fourier finie. Cette dernière est inversible, comme nous allons maintenant le
voir. Ainsi, nous pourrons, à partir des fonctions t → T̂k (t) données en (2.4), obtenir le champ de
température Tn (t) en tout point n et tout instant t.

2.2 La transformation de Fourier finie (TFF)

Le champ d’application de la transformation de Fourier finie est le domaine des suites de longueur
finie N, que l’on notera sous la forme f = { f 0 , f 1 , . . . f N −1 }, où les nombres f n sont des nombres a priori
complexes (mais peuvent être réels, ou imaginaires purs). Une suite finie f ∈ C N peut également être
considérée comme un vecteur de C N , dont les nombres f n sont les composantes par rapport à une
base orthonormée de référence. C’est ce langage là que nous emploierons dans un premier temps.

2.2.1 Définition, Propriétés, Inversion

Définition et propriétés

Commençons par introduire la transformation de Fourier finie :

D ÉFINITION 2.1 Soit f = { f 0 , . . . f N −1 } un vecteur de C N . Sa transformée de Fourier finie est


le vecteur f̂ = { fˆ0 , . . . fˆN −1 } défini par

N −1  
kn
fˆk = ∑ f n exp −2iπ
N
. (2.5)
n =0

Il est facile de vérifier que la transformation

F : f ∈ C N → f̂ ∈ C N

est une transformation linéaire : pour tous f , g ∈ C N et λ, µ ∈ C, on a

F (λ f + µg) = λ f̂ + µ ĝ .

38
2.2 La transformation de Fourier finie (TFF)

Inversion

T H ÉOR ÈME 2.1 La TFF est inversible de la façon suivante : si f̂ est la TFF de f ∈ C N , on a alors

N −1
1

kn
fn = fˆk e2iπ N . (2.6)
N k =0

On a de plus la formule de Parseval :


N −1 N −1
1
N ∑ | fˆk |2 = ∑ | f n |2 . (2.7)
k =0 n =0

Preuve : Calculons tout d’abord la série géométrique : soit n un nombre entier, et supposons tout
d’abord n ne soit pas un multiple entier de N. On a

N −1 1 − exp −2iπ nN
  
kn
∑ exp −2iπ
N
= N
1 − exp −2iπ Nn
 =0 (2.8)
k =0

(le dénominateur est bien défini). Par contre, si n est un multiple entier de N, le terme générique de
la série est constant et égal à 1. Par conséquent, on a

N −1  
kn
∑ exp −2iπ
N
= Nδn[mod N ],0 . (2.9)
k =0

Calculons maintenant le membre de droite de (2.6) :

N −1 N −1 N −1 N −1
1 1 k(n−m) 1
∑ ∑ ∑ ∑
kn
fˆk e2iπ N = f m e2iπ N = f m Nδ(m−n)[mod N ],0
N k =0
N k =0 m =0
N m =0

ce qui complète la preuve de (2.6). La preuve de (2.7) est très similaire. Il suffit de calculer

N −1 N −1 N −1 N −1 N −1 N −1
1 1 k(n−m) 1
N ∑ | fˆk |2 =
N ∑ ∑ ∑ f m f n e2iπ N =
N ∑ ∑ f m f n Nδ(m−n)[mod N ] ,
k =0 k =0 m =0 n =0 m =0 n =0

ce qui prouve (2.7), et achève la preuve du théorème. ♠

2.2.2 Une base particulière de C N


C N est un espace vectoriel complexe de dimension N, muni du produit scalaire suivant : si f , g ∈ C N ,
on définit
N −1
f .g = ∑ f n gn ,
n =0
q
et on note k.k la norme correspondante : k f k = f.f.

Noter la présence de la conjugaison complexe dans la définition du produit scalaire, nécessaire


car on est en présence d’un espace vectoriel complexe. Ceci permet que la norme soit bien
à valeurs réelles. Par contre, on a aussi, pour f , g ∈ C N , f .g = g. f .

39
2 Transformation de Fourier finie

F IG . 2.1: Les vecteurs γk (partie réelle) pour différentes valeurs de k.

40
2.2 La transformation de Fourier finie (TFF)

Il est facile de vérifier qu’il s’agit bien d’un produit scalaire. Introduisons maintenant les N vecteurs
γk , k = 0, . . . N − 1, définis par
 
1 kn
γnk = √ exp 2iπ , n = 0, . . . N − 1 . (2.10)
N N

Les résultats précédents impliquent alors

C OROLLAIRE 2.1 La famille {γ0 , . . . γ N −1 } est une base orthonormée de C N .

Preuve : Il suffit d’utiliser les résultats déjà obtenus : on a

N −1
n(` − k )
 
1
k
γ .γ = `
N ∑ exp 2iπ N = δk,` .
n =0

On a donc une famille de N vecteurs unitaires, orthogonaux deux à deux, dans un espace de dimen-
sion N, et c’est donc une base orthonormée. ♠
Il est alors facile de donner une interprétation de la transformation de Fourier finie. Etant donné un
vecteur f ∈ C N , les composantes de sa TFF fˆ sont de la forme

√ N −1 √
fˆk = N ∑ f n γkn = N γk . f . (2.11)
n =0

Ainsi, à un facteur multiplicatif ( N) près, les coefficients fˆk ne sont autres que les coordonnées de f
par rapport à la base des γk . La formule d’inversion de la TFF peut aussi s’écrire

N −1  
f = ∑ γk . f γk , (2.12)
k =0

alors que la formule de Parseval n’est autre que la version correspondante du théorème de Pythagore

N −1
k f k2 = ∑ | γ k . f |2 . (2.13)
k =0

Il est important de bien saisir le rôle des vecteurs γk . Comme on peut le voir sur la
F IG . 2.1, le graphe des suites finies γnk , n = 0, . . . N − 1 montre des oscillations dont
la vitesse augmente avec k pour k ∈ {0, . . . N/2}, puis diminue. Ainsi, la formule de
décomposition (2.12) permet de décomposer la suite finie f en une somme de contribu-
tions qui varient à des vitesses différentes. On donne à la variable k/N le nom de fréquence.
Lorsque, pour une valeur de k proche de N/2, le nombre fˆk est grand, ceci signifie que
la suite γk correspondante, qui varie rapidement, est affectée d’un gros coefficient dans
la décomposition (2.12), et que la suite f est elle aussi rapidement variable. Par contre,
lorsque les coefficients fˆk pour k proche de N/2 sont petits, ceci signifie que la suite f
varie lentement. On dit qu’elle est plus “lisse”, ou “régulière”.
Ceci nous indique la marche à suivre lorsque l’on veut rendre une suite finie f plus “lisse” :
il suffit de diminuer les valeurs des coefficients fˆk pour les valeurs de k proches de N/2,
en préservant les valeurs correspondant à des k proches de 0. On verra plus loin les effets
de telles transformations.

41
2 Transformation de Fourier finie

F IG . 2.2: Signal sonar de veille et de chasse de chauve souris, et sa TFF

F IG . 2.3: Signal de parole et sa TFF.

Pour illustrer la transformation de Fourier finie, examinons quelques exemples. Le premier exemple
est un exemple de signal acoustique (une onde de pression donc), plus précisément le signal SONAR
émis par les chauve-souris (les chauve-souris étant pratiquement aveugles, elles utilisent les ultra-
sons pour s’orienter et détecter et localiser leurs proies). La F IG . 2.2 représente le signal lui même,
et sa transformée de Fourier. On voit que le signal est assez oscillant, avec des oscillations assez
régulières. Ceci est confirmé par la transformée de Fourier, qui présente un pic bien marqué autour
d’une fréquence donnée, qui est précisément la fréquence des oscillations régulières que l’on observe.
Le second exemple que nous considérons en F IG . 2.3 est lui aussi un signal acoustique, puisqu’il s’agit
de signal de parole. Dans ce cas, la suite f (le signal) est aussi très rapidement oscillante, mais son
graphe est plus complexe que le précédent. L’examen de la transformée de Fourier f̂ nous permet
d’en comprendre la raison : le signal f̂ contient non plus une fréquence prépondérante, mais un
grand nombre (une dizaine environ), qui sont toutes multiples d’une fréquence fondamentale. Ceci
est spécifique du signal de parole, que l’on qualifie parfois de signal harmonique. Cette structure du
signal de parole peut être expliquée grâce à des modèles physiques décrivant les vibrations des cordes
vocales et la propagation du son dans le conduit vocal...

42
2.2 La transformation de Fourier finie (TFF)

2.2.3 Convolution ; produit


La transformation de Fourier, sous toutes ses formes, est intimement liée au concept de produit de
convolution. Nous allons le vérifier tout d’abord dans le cas simple de la TFF.
Etat donnés f , g ∈ C N , on définit leur produit de convolution h = f ∗ g ∈ C N comme le vecteur de
composantes
N −1
hn = ( f ∗ g)n = ∑ f m gn−m [mod N ] . (2.14)
m =0
Une propriété essentielle du produit de convolution est qu’il est symétrique (on dit aussi commuta-
tif) :
f ∗g = g∗ f . (2.15)
Calculons maintenant la TFF de h :
N −1 N −1  
kn
ĥk = ∑ ∑ f m gn−m [mod N ] exp −2iπ
N
n =0 m =0
N −1 N −1
k(n − m)
   
km
= ∑ ∑ f m gn−m [mod N ] exp −2iπ
N
exp −2iπ
N
n =0 m =0
N −1 N −1    
km kj
= ∑ ∑ f m g j exp −2iπ
N
exp −2iπ
N
n =0 j =0

= fˆk ĝk .
Ainsi, la transformée de Fourier finie du produit de convolution de deux vecteurs f et g est égale au
vecteur dont les composantes sont égales au produit des composantes correspondantes de f̂ et ĝ. On
note ĥ = f̂ ĝ ce nouveau vecteur, appelé produit simple de f̂ et ĝ.
Attention : il ne faut pas confondre le vecteur f̂ ĝ avec le produit scalaire f̂ . ĝ, qui est un
nombre (et pas un vecteur).
Considérons maintenant la TFF du produit simple de deux vecteurs. Pour cela, nous pouvons écrire
en utilisant la formule d’inversion de la TFF
N −1  
kn
f g = ∑ f n gn exp −2iπ
c
k
n =0 N
1 N −1 N −1 (` − k)n
 

N n∑
= f n ∑ ` ĝ exp 2iπ
=0 `=0
N
N −1
1
=
N ∑ ĝ` fˆ`−k[mod N ]
`=0
1
= ( f̂ ∗ ĝ)k .
N
Nous obtenons donc, à peu ce choses près, un résultat “symétrique” du précédent : la TFF d’un
produit simple est égale (à un facteur 1/N près) au produit de convolution des TFF. On résume les
résultats obtenus dans la proposition suivante :

P ROPOSITION 2.1 Soient f , g ∈ C N . Alors, on a, pour tout k = 0, . . . N − 1 :

f ∗ g)k =
([ fˆk ĝk (2.16)
1
(c
f g)k = ( f̂ ∗ ĝ)k . (2.17)
N

43
2 Transformation de Fourier finie

Ce résultat, parfois appelé théorème convolution-produit, est un résultat que nous allons retrouver dans
toutes les formes de transformation de Fourier (à de petites modifications près, à savoir des constantes
multiplicatives différentes).
Nous sommes maintenant en position de terminer la résolution du problème posé au
début de ce chapitre. On déduit de (2.4) la solution

N −1     
1 πk k
Tn (t) =
N ∑ T̂k (0) exp −4αt sin 2
N
exp 2iπ
N
,
n =0

qui prend la forme de la TFF inverse d’un produit simple. Ainsi, la solution peut aussi
s’écrire sous la forme d’un produit de convolution de la condition initiale T (0) = { Tn (0), n =
0, . . . N − 1} par la TFF inverse de la suite
    
2 πk
ĥk (t) = exp −4αt sin , k = 0, . . . N − 1 .
N

C’est là aussi une forme que nous allons retrouver souvent. On remarque que ĥk (t) est
proche de 1 pour k proche de 0 ou N, et vaut exp{−4αt} pour k = N/2 (en supposant N
pair).
Les solutions sont représentées en F IG . 2.4, pour différentes valeurs de t. On remarque
que l’évolution temporelle consiste en un “lissage” progressif de la condition initiale, qui
devient de plus en plus “étalée”. C’est un comportement que l’on peut comprendre assez
facilement, dans la mesure où l’équation (2.4) montre que dans l’espace des transformées
de Fourier, l’évolution temporelle se traduit par une atténuation des composantes corres-
pondant à k proche de N/2, c’est à dire les composantes qui varient le plus rapidement.

2.2.4 Remarques sur la périodicité

Dans la définition de la transformation de Fourier finie,

N −1  
kn
fˆk = ∑ f n exp −2iπ
N
,
n =0

il est clair que fˆk peut également être défini pour des valeurs entières de k n’appartenant pas nécessairement
à {0, . . . N − 1}. Par contre, on a pour tout k ∈ Z

fˆk+ N = fˆk (2.18)

de sorte que f̂ peut être considéré soit comme un vecteur de C N , soit comme une suite infinie,
périodique de période N. C’est pourquoi on rencontre souvent dans la littérature des définitions
différentes de la TFF, par exemple, une définition dans laquelle fˆk est défini pour k = 1 − N/2, . . . N/2
(quand N est pair).
Inversement, la formule
1 N −1 ˆ
 
kn
N k∑
fn = f k exp 2iπ
=0
N

permet de définir une suite infinie, N-périodique. On peut donc considérer f soit comme un vecteur
de C N , soit comme une suite infinie, périodique de période N.

44
2.2 La transformation de Fourier finie (TFF)

F IG . 2.4: Solution de l’équation de la chaleur, à des temps différents

45
2 Transformation de Fourier finie

2.2.5 Transformation de Fourier rapide ; le problème de la complexité


Lorsque l’on veut calculer une transformée de Fourier finie sur un ordinateur, il est nécessaire de se
préoccuper du coût de cette transformation, c’est à dire d’essayer d’avoir une estimation du temps
de calcul. Pour cela, un moyen simple consiste à compter le nombre d’opérations élémentaires (mul-
tiplications, additions, ou les deux) nécessaires au calcul. On appelle cela l’analyse de la complexité du
calcul.
Dans le cas de la transformation de Fourier finie, le calcul de la complexité est assez simple. Pour
faciliter les choses, on se limitera au calcul des multiplications (souvent plus coûteuses que les ad-
ditions). Si on suppose que les nombres complexes exp{−2iπkn/N } ont été calculés une bonne fois
pour toutes, le calcul de
N −1  
kn
∑ f n exp −2iπ N
n =0

fait intervenir N multiplications. Ce calcul est effectué N fois, ce qui conduit à N 2 multiplications. On
dit que l’algorithme a une complexité en O( N 2 ) (littéralement, de l’ordre de N 2 ).
Lorsque N est grand, le temps de calcul peut devenir exagérément long. Fort heureusement, il existe
une façon d’organiser les calculs (un algorithme) plus efficace, permettant d’effectuer une TFF avec une
complexité de O( N log2 N ). Il s’agit de la transformation de Fourier rapide (TFR, ou FFT en anglais).
Décrire l’algorithme de TFR dépasse le cadre de ce cours, mais il est important d’en
connaı̂tre l’existence, et d’en mesurer l’importance. Prenons pour cela le cas N = 210 =
1024. Alors N 2 = 220 , alors que N log2 N ≈ 10 × 210 , de sorte que l’algorithme de TFR est
dans ce cas approximativement 210 /10 ≈ 102 fois plus rapide. Ceci se passe de commen-
taire...

2.3 La transformation de Fourier discrète (TFD)


2.3.1 Définition, difficultés
Passons maintenant au cas de la dimension infinie : nous allons maintenant étudier la version de
la transformation de Fourier adaptée au cas de “vecteurs infinis”, c’est à dire adaptée au cas des
suites. La dimension infinie pose toutefois des problèmes que l’on ne rencontre pas en dimension
finie. Le premier a trait à la définition même de la transformation de Fourier : étant donnée une suite
f = { f n , n ∈ Z}, sa transformée de Fourier est la fonction 2π périodique fˆ définie par

fˆ(ω ) = ∑ f n e−inω . (2.19)
n=−∞

Cette série n’est pas nécessairement convergente, et il faut donc faire des hypothèses sur f pour
s’assurer de l’existence de fˆ. L’hypothèse la plus simple consiste à supposer que la suite f considérée
est sommable, c’est à dire telle que

∑ | fn | < ∞ .
n=−∞

On dit alors que f appartient à l’espace `1 (Z).


On vérifie facilement que `1 (Z) est bien un espace linéaire, c’est à dire tel que pour tous
f , g ∈ `1 (Z), et λ ∈ C, f + g ∈ `1 (Z), et λ f ∈ `1 (Z) : ∑n | f n + gn | ≤ ∑n | f n | + ∑n | gn | < ∞,
et ∑n |λ f n | = |λ| ∑n | f n | < ∞ On vérifie aussi que l’application k.k1 : f ∈ `1 (Z) → k f k1 ∈
R définie par

k f k1 = ∑ | fn |
n=−∞

46
2.3 La transformation de Fourier discrète (TFD)

est une norme sur `1 (Z) : on a bien k f + gk1 ≤ k f k1 + k gk1 et k ambda f k1 = |λ|k f k1 (voir
ci dessus). De plus, k f k1 = 0 implique que f n = 0 pour tout n, donc f = 0.

D ÉFINITION 2.2 Soit f ∈ `1 (Z). Sa transformée de Fourier discrète est la fonction 2π


périodique fˆ définie par (2.19). fˆ est une fonction bornée.

Le fait que fˆ soit bornée est facilement vérifié : en effet on a

∞ ∞
| fˆ(ω )| = ∑ f n e−inω ≤ ∑ | f n | = k f k1 < ∞ .
n=−∞ n=−∞

Comme son homologue finie, la transformation de Fourier discrète est une transformation linéaire.
Nous verrons par la suite quelques propriétés plus “fines”, mais nous nous en tiendrons pour le
moment à des priopriétés élémentaires.

2.3.2 Convolution et produit


Le produit de convolution de deux suites est défini de façon similaire au produit de convolution des
vecteurs. Etant données deux suites f , g ∈ `1 (Z), on définit h = f ∗ g = g ∗ f par

hn = ∑ f m gn − m . (2.20)
n=−∞

Il est facile de vérifier que h ∈ `1 (Z) :

∑ | ∑ f m gn−m | ≤ ∑ ∑ | f m || gn−m | = k f k1 k gk1 .


n m n m

Par conséquent, sa transformée de Fourier discrète existe et est une fonction bornée. On a
∞ ∞
ĥ(ω ) = ∑ ∑ f m gm−n e−iωn
n=−∞ m=−∞
∞ ∞
= ∑ ∑ f m e−iωm gn−m e−iω (n−m)
n=−∞ m=−∞
= fˆ(ω ) ĝ(ω ) .

On a donc le résultat suivant :

P ROPOSITION 2.2 Soient f , g ∈ `1 (Z). Alors f ∗ g ∈ `1 (Z), et pour tout ω ∈ R,

f ∗ g(ω ) = fˆ(ω ) ĝ(ω ) .


[ (2.21)

On peut également montrer un résultat analogue dans le cas d’un produit simple : si f et g sont deux
suites quelconques, leur produit simple est la suite notée f g, définie par ( f g)n = f n gn . La TFD de
f g est alors égale à un produit de convolution “continu” des fonctions fˆ et ĝ. Cette propriété sera
discutée en détails au chapitre suivant.

47
2 Transformation de Fourier finie

2.3.3 Notions de signal et de filtrage numériques


En théorie des communications, le support de l’information est appelé signal. Un signal peut prendre
différentes formes, souvent la forme d’une fonction ou une suite. Dans le premier cas, il s’agit en
général d’un signal “physique” : onde acoustique, électromagnétique,... on parle dans ce cas de signal
analogique. Dans le second cas, on parle de signal numérique.
L’opération de base en traitement du signal est le filtrage des signaux. Nous verrons par la suite
des exemples plus précis de filtrage, mais nous pouvons d’ores et déjà voir les bases du filtrage
numérique. Le filtrage numérique est généralement réalisé par convolution : le filtre est caractérisé
par une suite h = { hn , n ∈ Z} ∈ `1 (Z), appelée réponse impulsionnelle du filtre. Le filtre Kh est une
application linéaire qui associe à toute suite f une suite g = Kh f , définie par

gn = ( K h f ) n = ( h ∗ f ) n = ∑ hm f n−m .
m=−∞

Supposons f ∈ `1 (Z). Comme nous l’avons vu, après transformation de Fourier, nous obtenons un
produit simple :
ĝ(ω ) = ĥ(ω ) fˆ(ω )
de sorte que le filtrage permet de modifier le contenu fréquentiel du signal f .
Un exemple de filtrage est présenté dans la F IG . 2.5. Il s’agit en fait d’un lissage, c’est à dire d’un
filtrage qui a pour but de diminuer les valeurs de fˆ(ω ) pour les grandes valeurs de ω. En l’occurrence,
on travaille sur une suite finie f assez “irrégulière” appelée mouvement Brownien, et le filtrage est
effectué en remplaçant par des zéros toutes les valeurs de fˆ(ω ) supérieures (en valeur absolue) à une
valeur limite ωc .ωc est pris de plus en plus petit, de sorte que le lissage est de plus en plus important.
Un tel filtrage peut être réalisé via un produit de convolution, mais est dans ce cas plus aisé à réaliser
en travaillant directement sur les coefficients fˆ(ω ).

2.3.4 Approximation d’une TFD par une TFF


En pratique, on ne peut calculer numériquement la transformée de Fourier discrète, et ce pour la
simple raison que l’on ne peut utiliser sur ordinateur que des suites (ou vecteurs) finies. Le mieux
que l’on puisse faire est alors de se rabattre sur la TFF.
Soit donc f ∈ `1 (Z) une suite, et soit fˆ sa transformée de Fourier discrète. fˆ est donc une fonction
2π-périodique d’une variable réelle ω. Supposons maintenant que nous ne disposions pas de la suite
f entière, mais d’une sous-suite finie, par exemple f = { f 0 , . . . f N −1 } ∈ C N . L’idée la plus simple est
alors de calculer une approximation fˆapp de fˆ :

N −1
fˆapp (ω ) = ∑ f n e−inω . (2.22)
n =0

On verra dans le chapitre suivant comment mesurer l’erreur commise en utilisant cette approxima-
tion. Par contre, la TFD étant une transformation linéaire, l’image de C N par TFD ne peut être de
dimension supérieure à N, de sorte que considérer des valeurs fˆapp (ω ) pour une infinité de valeurs
de ω n’a pas grand sens. On peut se limiter à N valeurs de ω, et le choix le plus simple consiste à
considérer N valeurs régulièrement espacées entre 0 et 2π, soit

k
ωk = 2π , k = 0, . . . N − 1 .
N
On obtient alors
N −1 N −1
fˆapp (ωk ) = ∑ f n e−inωk = ∑ f n e−2iπkn/N = fˆk , (2.23)
n =0 n =0

48
2.3 La transformation de Fourier discrète (TFD)

F IG . 2.5: Un exemple de signal “irrégulier” (mouvement Brownien, figure du haut), et des versions
filtrées, de plus en plus “lissées”.

49
2 Transformation de Fourier finie

de sorte que nous retombons naturellement sur la transformation de Fourier finie de la sous-suite
finie f ∈ C N .
Reste à vérifier que ceci caractérise effectivement fˆapp . Pour cela, il suffit de calculer, pour ω 6=
πk/N, k ∈ Z

N −1
1
fˆapp (ω ) =
N ∑ f n e−inω
n =0
N −1 N −1
1
=
N ∑ ∑ fˆk e2iπkn/N e−inω
n =0 k =0
N −1 N −1
1
=
N ∑ fˆk ∑ exp{−i (ω − 2πk/N )}n
k =0 n =0
N −1
1 1 − exp{−iNω }
=
N ∑ fˆk
1 − exp{−i (ω − πk/N )}
,
k =0

ce qui montre que l’on peut bien calculer fˆapp (ω ) pour tout ω à partir des fˆ(ωk ).

2.3.5 Inversion : les séries de Fourier

Nous avons vu que l’inversion de la transformation de Fourier finie est une opération assez simple.
Le cas de la transformation de Fourier discrète est plus complexe. Cependant, le résultat suivant reste
simple.

T H ÉOR ÈME 2.2 Soit f ∈ `1 (Z), et soit fˆ sa transformée de Fourier discrète. Alors on a pour
tout n ∈ Z
1
Z π
fn = fˆ(ω )einω dω . (2.24)
2π −π

Preuve : Nous savons que fˆ est bornée. Donc l’intégrale du membre de droite de (2.24) est convergente,
et nous pouvons calculer


1 1
Z π Z π

2π −π
fˆ(ω )einω dω =
2π ∑
−π m=−∞
f m ei(n−m)ω dω

1
Z π
=
2π ∑ fm
−π
ei(n−m)ω dω
m=−∞
= fn ,

ce qui prouve le théorème. ♠


Notons que la formule (2.24) coı̈ncide avec la définition des coefficients de Fourier :

f n = an + ibn ,

avec
1 1
Z π Z π
an = fˆ(ω ) cos(nω ) dω , bn = fˆ(ω ) sin(nω ) dω .
2π −π 2π −π

Nous verrons au chapitre suivant un lien plus étroit entre ces deux théories.

50
2.3 La transformation de Fourier discrète (TFD)

Nous avons donc maintenant à notre disposition une transformation de Fourier discrète,
définie sur `1 (Z), que nous savons inverser. Cependant, elle n’est pas tout à fait satisfai-
sante, pour plusieurs raisons. D’une part, l’hypothèse f ∈ `1 (Z) est parfois trop restric-
tive. Et d’autre part, nous n’avons pas dans ce cadre d’interprétation simple en termes de
base orthonormée. Nous verrons que la théorie des séries de Fourier permet de compler
ces manques.

51
2 Transformation de Fourier finie

52
C HAPITRE

3
Séries de Fourier

Nous avons étudié au chapitre précédent la transformation de Fourier des suites, finies ou infinies.
Nous passons maintenant au cas des fonctions, qui est plus complexe. Pour simplifier quelque peu,
on s’intéressera tout d’abord au cas des fonctions à support borné, ou aux fonctions périodiques, qui
peuvent être traitées de façon similaires. La théorie de Fourier correspondante est la théorie des séries
de Fourier.
La théorie des séries de Fourier est tout d’abord développée dans le contexte des fonctions périodiques.
Rappelons qu’une fonction t → f (t) est périodique de période T si pour tout t ∈ R, on a f (t + T ) =
f (t). La théorème général de Fourier montre que si f est une telle fonction, elle peut s’exprimer
sous forme de combinaison linéaire infinie de sinusoı̈des, de fréquences multiples d’une fréquence
fondamentale égale à l’inverse de T. Toutefois, il est encore nécessaire ici de faire attention au sens
que l’on donne à l’égalité, qui peut varier suivant le contexte.

3.1 Fonctions trigonométriques


3.1.1 Polynômes trigonométriques
Un exemple simple de fonction périodique de période T est l’oscillation en , définie par
en (t) = e2inπt/T (3.1)
pour tout entier n. Il en va de même pour les fonctions
P(t) = ∑ cn e2inπt/T ,
n∈ I

où I est un index fini, et les cn , n ∈ I des nombres complexes quelconques. Quitte à compléter l’ex-
pression précédente par des coefficients cn nuls, on peut mettre P(t) sous la forme
N
P(t) = ∑ cn e2inπt/T , (3.2)
n=− N

que l’on appelle polynôme trigonométrique de degré N.


En décomposant l’exponentielle complexe en sinus et cosinus, on peut aussi mettre [3.2) sous la forme
N     
2nπt 2nπt
P(t) = c0 + ∑ an cos + bn sin , (3.3)
n =1
T T
en posant 
an = cn + c−n
(3.4)
bn = i ( c n − c − n )

53
3 Séries de Fourier

3.1.2 Orthogonalité
Soit P N l’espace vectoriel des polynômes trigonométriques de degré inférieur ou égal à N (qui est de
dimension 2N + 1). Cet espace peut être muni du produit scalaire suivant : ∀ P, Q ∈ P N , on pose
Z T
h P, Qi = P(t) Q(t)dt . (3.5)
0

On peut vérifier que ce produit possède bien toutes les propriétés d’un produit scalaire. Posons pour
simplifier
1
en (t) = √ e2inπt/T . (3.6)
T
Il est facile de voir que
Z T Z T
1
h em , en i = em (t)en (t) dt = e2i(n−m)πt/T dt = δn,m , (3.7)
0 T 0

c’est à dire que les fonctions e2nπT sont orthogonales deux à deux.
On dispose donc d’une famille de 2N + 1 fonctions orthogonales, de norme égale à 1, dans un espace
de dimension 2N + 1. Donc,

P ROPOSITION 3.1 La famille {en , n = − N, . . . , N } est une base orthonormée de P N .

Par conséquent, étant donné un polynôme trigonométrique P ∈ P N , nous pouvons calculer les coef-
ficients cn de son développement par rapport à la base {en , n = − N, . . . N } grâce à la relation
√ √ √
hen , Pi = T ∑ cm hen , em i = T cn ||en ||2 = T cn ,
m

et donc on a
1 1 T
Z
c n = √ h en , P i = P(t)e−2inπt/T dt . (3.8)
T T 0
Le calcul de la norme quadratique fournit quant à lui la formule de Parseval, qui est essentiellement
une version adaptée du théorème de Pythagore :
Z T
1
| P(t)|2 dt = ∑ |cn |2 . (3.9)
T 0 n

3.2 Séries de Fourier


3.2.1 Généralités
Jusqu’à présent, nous avons travaillé dans un contexte de dimension finie, que nous voulons main-
tenant étendre au cas d’espaces de fonctions autres que des polynômes trigonométriques, qui sont
généralement des espaces de dimension infinie. Parmi les espaces fonctionnels classiques, les espaces
de fonctions de module carré intégrable jouent un rôle primordial. Dans le cas qui nous intéresse, à
savoir le cas des fonctions périodiques, il s’agit de l’espace L2p ([ a, b]), défini de la façon suivante :

L2p ([ a, b]) = { f : R → C, f périodique de période b − a, || f || < ∞} , (3.10)

où a < b sont deux réels, et où on a noté


Z b
|| f ||2 = | f (t)|2 dt . (3.11)
a

54
3.2 Séries de Fourier

Il est facile de vérifier qu’il s’agit bien d’un espace linéaire (si f , g ∈ L2p ([ a, b]), alors f + g ∈ L2p ([ a, b]),
et λ f ∈ L2p ([ a, b]) pour tout λ ∈ C. C’est de plus un espace normé (l’application f ∈ L2p ([ a, b]) →
k f k est bien une norme). Cependant, ce qui différencie L2p ([ a, b]) de la majeure partie des espaces
fonctionnels normés, c’est le fait que cet espace possède un produit scalaire : pour f , g ∈ L2p ([ a, b]), on
définit
Z b
h f , gi = f (t) g(t) dt , (3.12)
a

On peut en fait montrer que ceci munit L2p ([ a, b]) d’une structure d’espace de Hilbert.

La notion d’intégrale utilisée est l’intégrale de Lebesgue. Cette dernière coı̈ncide dans la
plupart des cas avec l’intégrale de Riemann, mais permet d’étendre la notion d’intégration
à des fonctions pour lesquelles l’intégrale “à la Riemann” n’est pas définie. Des détails
complémentaires sur l’intégrale de Lebesgue, et plus généralement sur les espaces fonc-
tionnels “classiques” se trouvent en Annexe B.

R EMARQUE 3.1 Pour être précis, l’espace L2p ([ a, b]) n’est pas un espace de fonctions à proprement
parler, mais plutôt un espace de classes d’équivalence de fonctions : en effet, si f ∈ L2p ([0, 1]), et si
on définit g par g(t) = f (t) pour tout t 6= 1/2, et g(1/2) = f (1/2) + 1, alors conformément à la
définition de l’intégrale de Lebesgue, on a k f − gk = 0, de sorte que l’on ne peut dans L2p ([0, 1])
discerner g de f 1 . Plus généralement, toute fonction g obtenue à partir de f en la modifiant sur un
sous-ensemble de [0, 1] de mesure nulle sera indiscernable de f , et donc identifiée à f . On dit parfois
que les fonctions des espaces de Lebesgue L p sont définies modulo un ensemble de mesure nulle.

Par la suite, on posera


T = b−a.

Il est immédiat de vérifier que les oscillations en et les fonctions en appartiennent à L2p ([ a, b]), de sorte
que pour tout N ∈ Z+ , on a l’inclusion

Pn ⊂ L2p ([ a, b]) . (3.13)

On peut maintenant se poser la question suivante :

Etant donné un f ∈ L2p ([ a, b]), quel est l’élément de P N qui en est le plus prôche ? en d’autres
termes, quelle est la projection orthogonale f N de f sur P N ?

Il est facile de répondre à cette question en utilisant les outils à notre disposition dans L2p ([ a, b]), et en
particulier la norme. La distance entre f ∈ L2p ([ a, b]) et un polynôme P ∈ P N , de la forme

N
P(t) = ∑ c n en ( t ) ,
−N

est naturellement définie par


d( f , P) = || f − P|| . (3.14)

1 Précisément, la norme k.k munit L2p ([0, 1]) d’une topologie qui ne sépare pas f de g.

55
3 Séries de Fourier

Calculons alors
N N
|| f − P||2 = h( f − ∑ cn en ), ( f − ∑ cn en )i
−N −N
!
N N
= || f ||2 − 2< ∑ c n h f , en i + ∑ c n c m h em , en i
−N n,m=− N
!
N N
= || f ||2 − 2< ∑ dn cn +T ∑ | c n |2
n=− N n=− N
!
1 N N √ √ 2
= || f ||2 −
T ∑ | d n |2 +∑ Tcn − dn / T ,
−N −N

où on a posé
Z b
d n = h en , f i = f (t)e−2inπt/T dt . (3.15)
a
Les deux premiers termes (entre parenthèses) sont indépendants des coefficients cn recherchés, de
sorte que minimiser || f − P|| est équivalent à minimiser la seconde somme par rapport aux coeffi-
cients cn . Il est clair que cette dernière est minimale (et nulle) si et seulement si
Z b
1 1
cn = cn ( f ) = dn = f (t)e−2iπnt/T dt . (3.16)
T T a

On a alors
N
P(t) = f N (t) = ∑ cn ( f )e2iπnt/T . (3.17)
n=− N

De plus, on a également
N
|| f − f N ||2 = || f ||2 − T ∑ |cn ( f )|2 . (3.18)
−N

Nous avons donc montré :

P ROPOSITION 3.2 1. La projection orthogonale FN de f sur P N est donnée par


N
f N (t) = ∑ cn ( f )e2iπnt/T , (3.19)
n=− N

où les cn ( f ) sont définis en (3.16).


2. On a de plus l’inégalité de Bessel
N
1
∑ |cn ( f )|2 ≤
T
|| f ||2 . (3.20)
n=− N

3.2.2 Une base orthonormée de L2p ([ a, b])


Le cas de la transformation de Fourier finie était très simple, mais aussi très utile pour comprendre le
statut de la transformation de Fourier. Non seulement, nous avions montré que la TFF est une trans-
formation inversible dee C N dans C N , mais que de plus la famille des suites finies γk , k = 0, . . . N − 1
est une base orthonormée de C N , et que la TFF n’est autre que l’application qui associe à tout élément

56
3.2 Séries de Fourier

f ∈ C N la suite finie des coefficients ( fˆ0 , . . . fˆN −1 ) de son développement par rapport à cette base (à
un facteur multiplicatif constant près). Il se trouve que ceci reste vrai lorsque l’on passe au cadre de
l’espace L2p ([ a, b]) et des séries de Fourier associées.
En effet, nous avons déjà vu que les fonctions t → en (t) définies en (3.6) sont orthogonales deux
à deux, et normées. Plus précisément, la Proposition 3.1 montre qu’elles forment des bases ortho-
normées de sous-espaces de dimension finie de L2p ([ a, b]). Qu’en est il en dimension infinie ? La
réponse est apportée par le théorème suivant, donné sans démonstration :

T H ÉOR ÈME 3.1 La famille des fonctions exponentielles en définies en (3.6) est une base ortho-
normée de L2p ([ a, b]). Pour tout f ∈ L2p ([ a, b]), on a

|| f − f N ||2 = T ∑ |cn ( f )|2 −→ 0 quand N → ∞ , (3.21)


|n|> N

où on a posé
N
fN = ∑ c n ( f ) en (3.22)
n=− N

De plus, la formule de Parseval s’écrit, pour toutes f , g ∈ L2p ([ a, b])


∞ Z b
1 1
∑ cn ( f )cn ( g) = b−a a
f (t) g(t) dt =
b−a
h f , gi . (3.23)
−∞

Ainsi, on a également la propriété suivante : pour tout f ∈ L2p ([ a, b]), la suite de ses coefficients de
Fourier est de module carré sommable.

D ÉFINITION 3.1 Etant donnée f ∈ L2p ([ a, b]), la limite f ∞ des fonctions f N définies en (3.22)
est appelée série de Fourier de f .

Ainsi, le théorème montre que pour tout f , f N → f (au sens de L2p ([ a, b])). On parle alors de conver-
gence forte.

R EMARQUE 3.2 Ceci ne signifie nullement que pour tout t ∈ [ a, b], f N (t) → f (t). On verra des contre-
exemples plus loin. Par contre, une conséquence du théorème est que f N (t) → f (t) pour presque tout
t, c’est à dire pour tout t sauf éventuellement un ensemble de mesure nulle. En effet, si tel n’était pas
le cas, alors on aurait k f N − f k 6→ 0 quand N → ∞.

3.2.3 Un exemple
Considérons le cas de la fonction f ∈ L2p ([0, 2π ]), définie par

1 si 0 ≤ t < π
f (t) =
−1 si π ≤ t < 2π ,

(appelée fonction de Haar) et complétée par périodicité. Un calcul explicite donne


Z 2π
1
c0 ( f ) = f (t) dt = 0 ,
2π 0

57
3 Séries de Fourier

et pour n 6= 0,
1 1 − (−1)n
Z 2π Z Z 2π 
1 −int 1 π
−int −int
cn ( f ) = f (t)e dt = e dt − e dt = .
2π 0 2π 0 π π in
Ainsi 
0 si n est pair
cn ( f ) = 2
inπ si n est impair.
On a par exemple
4
f 1 (t) = sin(πt)
π 
4 1
f 3 (t) = sin(πt) + sin(3πt)
π 3
 
4 1 1
f 5 (t) = sin(πt) + sin(3πt) + sin(5πt) .
π 3 5
Il est généralement instructif de s’intéresser à l’erreur d’approximation k f − f N k. Dans notre cas, on
a

2 2
4 ∞ 1 4 ∞ 1
k f − f 2K−1 k2 = 4π ∑ = ∑
πm∑
≤ .
m=K
(2m + 1)π πm=K (m + 1/2)2 =K m
2

Or, on a Z m
dt 1 1 1 1
2
= − = ≥ 2,
m −1 t m−1 m m ( m − 1) m
de sorte que
Z ∞
4 2 4 1 dt
k f − f 2K−1 k ≤ = .
π
K −1 π K−1 t2

L’erreur d’approximation k f − f N k décroı̂t donc comme 1/ N. Nous verrons par la suite des condi-
tions permettant d’estimer a priori l’erreur d’approximation en fonction de propriétés génériques (es-
sentiellement des propriétés de régularité) de f .
Il est également intéressant d’étudier les propriétés de convergence ponctuelle de la série de Fourier
de f . On sait que f N (t) converge vers f (t) pour presque tout t. Par contre, on a également f N (0) = 0
pour tout N, de sorte que f N (0) → 0 6= f (0). Voici donc un contre-exemple à la convergence ponc-
tuelle. Par contre, on peut aussi remarquer que lim N →∞ f N (0) = 0 = (limt→0+ f (t) + limt→0− f (t))/2,
ce qui est en fait un résultat que nous allons montrer un peu plus loin dans un cadre général.
L’exemple est représenté en F IG . 3.1. On voit clairement que les approximations successives convergent
(lentement) vers la fonction étudiée (en haut
√ à gauche). La lenteur de la convergence s’explique par le
fait que k f − f N k se comporte comme 1/ N. On observe également des oscillations qui apparaissent
au voisinage des discontinuités de la fonction. Ces discontinuités sont en fait les caractéristiques de
f les plus difficiles à approximer par des sinusoı̈des, et se traduisent donc par l’apparition d’oscilla-
tions. Ce phénomène est appelé phénomène de Gibbs.
Ce phénomène est toujours présent dans l’exemple de la fonction “dents de scie” de la F IG . 3.2, mais
est considérablement atténué. En effet, dans ce cas, la fonction considérée étant une fonction continue,
on peut montrer que ses coefficients
√ de Fourier cn ( f ) décroissent comme 1/n2 , de sorte que k f − f N k
se comporte comme 1/N N. La convergence est ainsi plus rapide.

3.2.4 Quelques remarques


1. Soit f ∈ L2p ([ a, b]). Ses coefficients de Fourier sont définis par (3.16) ; cependant, compte tenu de
la périodicité supposée de f , on peut également prendre (en posant T = b − a)
Z T/2
1 1
Z
−2iπnt/T
cn ( f ) = f (t)e dt = f (t)e−2iπnt/T dt ,
T − T/2 T I

58
3.2 Séries de Fourier

F IG . 3.1: Séries de Fourier tronquées de la fonction de Haar : Le phénomène de Gibbs.

59
3 Séries de Fourier

F IG . 3.2: Séries de Fourier tronquées d’une fonction “dents de scie” : Le phénomène de Gibbs.

60
3.2 Séries de Fourier

où I est n’importe quel intervalle de longueur b − a.


2. Considérons une fonction f ∈ L2p ([ a, b]), et supposons que f soit paire : f (−t) = f (t) pour tout
t. Alors, on a
Z T/2 Z T/2
1 1
c−n ( f ) = f (t)e2iπnt/T dt = f (−t)e−2iπnt/T dt = cn ( f ) .
T − T/2 T − T/2

De plus, on peut aussi ècrire


Z T/2
1 1
cn ( f ) = (cn ( f ) + c−n ( f )) = f (t) cos(2πnt/T ) dt ,
2 T − T/2
et
N N
a0 ( f )
f N (t) = ∑ cn ( f )e2iπnt/T =
2
+ ∑ an ( f ) cos(2πnt/T ) ,
n=− N n =1
où an ( f ) = 2cn ( f ).
3. Similairement, supposons maintenant que f soit impaire : f (−t) = − f (t) pour tout t. On a alors
N
f N (t) = ∑ bn ( f ) sin(2πnt/T ) ,
n =1

où Z T/2
2
bn ( f ) = 2cn ( f ) = f (t) sin(2πnt/T ) dt .
T − T/2

3.2.5 Problèmes de convergence des séries de Fourier


La théorie L2 ne donne que des indications relativement limitées sur le comportement des coefficients
de Fourier, et sur la convergence des séries de Fourier. Par exemple, la formule de Parseval implique
que si f ∈ L2p ([ a, b]), alors |cn ( f )| → 0 quand n → ∞. On sait également que la série de Fourier de f
converge (fortement) vers f . Ceci entraine la convergence presque partout, mais pas nécessairement
la convergence ponctuelle.
Il est donc utile de se poser de tels problèmes dans des cadres fonctionnels différents. Un cadre
intéressant est le cadre L1 , plus large (dans le cas des fonctions périodiques) que le cadre L2 . En
effet, on a

L EMME 3.1 Soit f ∈ L2p ([ a, b]). Alors f ∈ L1p ([ a, b]).

Preuve : Supposons f ∈ L2p ([ a, b]), et calculons


s s
Z b Z b Z b
| f (t)| dt ≤ dt | f (t)|2 dt < ∞ ,
a a a

la première inégalité étant simplement l’inégalité de Cauchy-Schwarz. Ceci montre le lemme. ♠


Commençons par le résultat important suivant, appelé Théorème de Riemann-Lebesgue, qui joue un rôle
central dans la preuve de nombreux résultats, et que nous retrouverons aussi dans d’autres cadres.

T H ÉOR ÈME 3.2 (R IEMANN -L EBESGUE ) Soit f ∈ L1 ([ a, b]). Alors


Z b
f (t)e−int dt −→ 0 quand n → ∞ . (3.24)
a

61
3 Séries de Fourier

La démonstration utilise le résultat classique suivant

P ROPOSITION 3.3 C1 ([ a, b]) est dense dans L1 ([ a, b]).

Ceci signifie que pour tout f ∈ L1 ([ a, b]), et pour tout e > 0, il existe ge ∈ C1 ([ a, b]) tel que k f − ge k1 ≤
e.
Preuve du Théorème 3.2 : Supposons dans un premier temps que f ∈ C1 ([ a, b]). Alors, par intégration
par parties, on a
Z b Z b
1 1
f (t)e−int dt = − [ f (b)e−inb − f ( a)e−ina ] + f 0 (t)e−int dt ,
a in in a

qui tend bien vers 0 quand n → ∞. On utilise maintenant la densité de C1 ([ a, b]) dans L1 ([ a, b]) : si
Rb
f ∈ L1 ([ a, b]), pour tout e > 0, il existe ge ∈ C1 ([ a, b]) tel que a | f (t) − ge (t)|dt < e/2. Alors
Z b Z b Z b
f (t)e−int dt ≤ | f (t) − ge (t)|dt + ge (t)e−int dt .
a a a

Pour tout e, il existe N tel que la seconde intégrale soit plus petite que e/2 pour |n| ≥ N. Ceci
complète la démonstration. ♠
Une conséquence importante de ce résultat est le résultat suivant de convergence ponctuelle. Pour
simplifier, on se limitera dans cette section au cas particulier b = − a = π. Etant donné un point t0 ,
on notera
f (t0+ ) = lim f (t) , f (t0− ) = lim f (t)
t → t0 , t ≥ t0 t → t0 , t ≤ t0

quand ces limites existent.

T H ÉOR ÈME 3.3 (D IRICHLET ) Soit f ∈ L1p ([−π, π ]). Soit t0 un point tel que les limites f (t0+ )
et f (t0− ) existent, de même que les dérivées à gauche et à droite de f en t0 . Alors quand N → ∞,

1
f N ( t0 ) → ( f (t0+ ) + f (t0− )) . (3.25)
2

Preuve : Commençons par évaluer la somme partielle f N (t0 ) :


!
N
1
Z π
f N ( t0 ) =
2π −π
f (t) ∑ e in(t0 −t)
dt
n=− N
1 π sin( N + 1/2)(t0 − t)
Z
= f (t) dt
2π −π sin(t0 − t)/2
1 sin( N + 1/2)s
Z π
= f ( t0 + s ) ds
2π −π sin s/2
1 π sin( N + 1/2)s
Z
= ( f (t0 + s) + f (t0 − s)) ds
π 0 sin s/2

En posant µ = ( f (t0+ ) + f (t0− ))/2, on a donc

1
Z π
f N ( t0 ) − µ = φ(s) sin( N + 1/2)s ds , (3.26)
π 0

62
3.2 Séries de Fourier

où on a posé
f ( t 0 + s ) − f ( t 0+ ) f ( t 0 − s ) − f ( t 0− )
φ(s) = + .
sin s/2 sin s/2
Puisque f est supposée différentiable à droite et à gauche en t0 , φ(s) admet une limite finie en s → 0.
Donc, il existe α > 0 tel que φ soit bornée sur ]0, α] :

|φ(s)| ≤ C pour tout s ∈]0, α] .

φ est donc intégrable sur ]0, α]. Comme f ∈ L1 ([−π, π ]), φ est également intégrable sur ]α, π ], et donc
sur [0, π ]. Il suffit alors d’appliquer le théorème de Riemann-Lebesgue à (3.26) pour conclure. ♠

E XEMPLE 3.1 Prenons l’exemple de f ∈ L2p ([−π, π ]) définie par f (t) = χ[0,π ] (t) − χ[−π,0] (t). Un
calcul immédiat donne c0 ( f ) = 0, et cn ( f ) = (1 − (−1)n )/(inπ ) pour n 6= 0. On obtient également
∑∞−∞ cn ( f ) exp{int } = 0 pour t = kπ, k ∈ Z, ce qui coı̈ncide bien avec le résultat du théorème
précédent.

R EMARQUE 3.3 En particulier, si de plus f est continue en t0 , f N (t0 ) → f (t0 ) quand N → ∞.

R EMARQUE 3.4 Il est possible de prouver des versions plus “fines” de ce résultat, ainsi que des
résultats de convergence uniforme des séries de Fourier. On pourra se référer au livre de Zygmund
(Trigonometric series) pour plus de détails.

3.2.6 Le problème de l’extension


Le théorème de Riemann-Lebesgue montre en particulier que si f ∈ L1p ([ a, b]), alors |cn ( f )| → 0
quand n → ±∞. En pratique, on s’intéresse non seulement à la convergence ponctuelle, mais aussi à
la vitesse de convergence. Or cette dernière est directement liée à la régularité de f , comme le montre
le lemme suivant.

L EMME 3.2 Soit f ∈ Cr (R), périodique de période b − a ; alors il existe une constante K telle
que
|cn ( f )| ≤ Kn−r .

Preuve : une intégration par parties donne


Z b Z b
1 −2iπ bnt 1 nt
cn ( f ) = f (t) e −a dt = f 0 (t) e−2iπ b−a dt ,
b−a a 2iπn a

car f étant continue, on a en particulier f (b) = f ( a). Similairement, on a


r Z b
(b − a)

1 nt
cn ( f ) = f (r) (t) e−2iπ b−a dt .
b−a 2iπn a

Cette dernière intégrale étant bornée par hypothèse, on en déduit le lemme. ♠

R EMARQUE 3.5 Ceci permet d’estimer la vitesse de convergence des sommes partielles :

|| f − f N ||2 = (b − a) ∑ |cn ( f )|2 ≤ 2(b − a)K2 ∑ n−2r ≤ K 0 N 1−2r .


|n|> N |n|> N

63
3 Séries de Fourier

Cependant, on utilise également les séries de Fourier pour développer des fonctions à support borné.
Et il y a là une différence importante avec le cas des fonctions périodiques. En effet, le développement
en série de Fourier d’une fonction à support borné n’est pas unique, comme on va le voir.
Soit f ∈ L2 (R), à support borné dans l’intervalle [ a, b]. Soit f p la fonction périodique de période b − a,
qui coı̈ncide avec f sur [ a, b], définie par

f p (t) = ∑ f (t − k (b − a)) .
k =−∞

Il est clair que f p ∈ L2p ([ a, b]). On peut donc la développer en série de Fourier, et écrire, puisque
f = f p χ[a,b]
f = lim f N , (3.27)
N →∞

où la limite est toujours à prendre au sens de L2 (c’est à dire lim N →∞ || f − f N || = 0), et où
!
N
f N (t) = ∑ cn ( f )e2iπnt/(b−a) χ[a,b] (t) , (3.28)
n=− N

et où les coefficients de Fourier cn ( f ) = cn ( f p ) sont toujours définis par


Z b
1
cn ( f ) = f (t)e−2iπnt/(b−a) dt . (3.29)
b−a a

La série de Fourier de la fonction f p est unique. Cependant, le passage de f à f p n’est pas la seule
possibilité. Il existe de multiples alternatives, dont on va donner deux exemples ci dessous.
Considérons tout d’abord la fonction g, définie sur l’intervalle [2a − b, b] par

f (t) si t ∈ [ a, b]
g(t) =
f (2a − t) si t ∈ [2a − b, a] .

g est une fonction symétrique par rapport à a, et on peut considérer sa périodisée, de période 2(b − a)

g p (t) = ∑ g(t − 2k (b − a)) .
k =−∞

g p admet un développement en série de Fourier

g p (t) = ∑ cn ( g)eiπnt/(b−a) ,
n

où Z b
1
cn ( g) = g p (t)eiπnt/(b−a) dt .
2( b − a ) 2a−b

Cependant, on peut aussi écrire, pour n 6= 0,


Z b
t−a
 
1
cn ( g) = e−inπa/(b−a) f (t) cos πn dt ,
b−a a b−a
et
c0 ( g ) = c0 ( f ) .
Posons maintenant Z b
t−a
 
2
An ( f ) = f (t) cos πn dt . (3.30)
b−a a b−a

64
3.2 Séries de Fourier

Il est clair que A−n ( f ) = An ( f ) ; la série de Fourier de g p s’écrit maintenant

1 1
g p (t) = A0 + ∑ An ( f )eiπn(t−a)/(b−a) .
2 2 n 6 =0

Ceci nous donne directement une autre série de Fourier pour la fonction f :
(C )
f = lim f N , (3.31)
N →∞

(C )
où les sommes partielles f N sont définies par
N !
t−a

1
A0 + ∑ An ( f ) cos πn
(C )
f N (t) = χ[a,b] (t) . (3.32)
2 n =1
b−a

Une autre possibilité consiste à considérer une extension non pas symétrique (comme l’est la fonction
g) de f , mais une extension antisymétrique h, définie par

f (t) si t ∈ [ a, b]
h(t) =
− f (2a − t) si t ∈ [2a − b, a] .
Il est alors facile de vérifier que la même procédure conduit à un développement en série de sinus :
on a
(S)
f = lim f N , (3.33)
N →∞
(S)
où les sommes partielles fN sont définies par
N !
t−a

∑ Bn ( f ) sin πn b − a
(S)
f N (t) = χ[a,b] (t) , (3.34)
n =1

et où les coefficients Bn ( f ) sont donnés par


Z b
t−a
 
2
Bn ( f ) = f (t) sin πn dt . (3.35)
b−a a b−a

La question qui se pose alors est celle du choix de la série à utiliser. Dans certaines applications, par
exemple pour le codage des signaux ou des images, on a intérêt à privilégier la vitesse de décroissance
des coefficients du développement de f . Nous avons vu plus haut que celui-ci est directement lié à
la régularité, non pas de f elle même, mais de la fonction périodique utilisée dans le développement,
c’est à dire ici f p , ou g p , ou la fonction équivalente dans le cas du développement en série de sinus.
Or, même si f est une fonction continue, il est rare qu’elle soit telle que f (b) = f ( a). Donc f p est
discontinue, et les coefficients cn ( f ) n’ont aucune raison de décroı̂tre assez vite quand n est grand.
Par contre, si f est continue, alors il est facile de voir que g p est continue également, de sorte que les
coefficients An ( f ) ont toutes les chances de décroı̂tre plus rapidement que les coefficients cn ( f ).
C’est pourquoi on utilise souvent les séries de cosinus dans les codeurs de signaux comme ceux
employés dans les standards de communication (comme JPEG ou MPEG par exemple).
E XEMPLE 3.2 Comme illustration de cet fait, prenons la fonction f (t) = χ[0,π ] . Un calcul immédiat
montre que cn ( f ) = δn,0 . Par contre, les coefficients Bn ( f ) se comportent comme 1/n ; Le développement
en série de sinus est donc très inapproprié dans ce cas, comme on peut le voir en F IG . 3.3, avec
l’approximation par cosinus (qui est exacte, et identique à la série de Fourier usuelle, et ne com-
porte qu’un terme) et l’approximation par une série de sinus comportant 10 termes. La série de sinus
convergera toujours vers 0 en t = 0 et en t = π.

65
3 Séries de Fourier

F IG . 3.3: Diverses séries de Fourier décrivant χ[0,1] : série de sinus, série de cosinus.

F IG . 3.4: Diverses séries de Fourier décrivant un arc de parabole : arc de parabole, et sa série de Fou-
rier usuelle.

E XEMPLE 3.3 On considère l’exemple de la fonction

f (t) = t(π − t)

définie sur [0, π ]. Un calcul explicite montre que ses coefficients de Fourier sont donnés par
1 1
Z π
cn ( f ) = f (t)e−2int dt = − .
π 0 2n2
Par contre, on a aussi
2
An ( f ) = − (1 − (−1)n ) ,
n2
et
4
Bn ( f ) = − (1 − (−1)n ) .
πn3
Donc, dans ce cas particulier, le développement en série de sinus est le plus économique. Les fi-
gures 3.4 et 3.5 représentent les approximations obtenues avec ces 3 développements, respectivement
(S) (C ) (S)
f , f 10 , f 10 et f 10 . La figure 3.6 représente l’erreur d’approximation dans les 3 cas : f − f 5 , f − f 5 et
(C )
f − f5 .

3.3 Retour sur la transformation de Fourier discrète


Nous avons vu au chapitre précédent comment associer à une suite de `1 (Z) une fonction périodique
bornée, dont les coefficients de Fourier ne sont autres que les éléments de la suite. Nous sommes
maintenant en position de développer√une théorie similaire, valable dans le cadre `2 (Z).
La famille de fonctions ω → einω / 2π étant une base orthonormée de L2 ([−π, π ]), on déduit
immédiatement de la discussion précédente le résultat suivant.

66
3.3 Retour sur la transformation de Fourier discrète

F IG . 3.5: Diverses séries de Fourier décrivant un arc de parabole (suite) : série de sinus, série de cosi-
nus.

F IG . 3.6: Diverses séries de Fourier décrivant un arc de parabole (suite) : erreurs de reconstruction.

T H ÉOR ÈME 3.4 La transformation s ∈ `2 (Z) → √1 ŝ, où ŝ est la



transformée de Fourier
discrète de s, est une isométrie bijective de `2 (Z) sur L2 ([−π, π ]). On a la formule de Parseval :
pour toutes u, v ∈ `2 (Z),

1
Z π
∑ un vn = 2π −π
û(ω )v̂(ω ) dω . (3.36)
n

De plus, la transformation inverse s’écrit

1
Z π
sn = ŝ(ω )einω dω . (3.37)
2π −π

67
3 Séries de Fourier

68
C HAPITRE

4
Intégrales de Fourier

On a vu jusquà présent plusieurs versions différentes des transformations de Fourier : transforma-


tions de Fourier finie et discrète, et séries de Fourier. Dans tous les cas, les propriétés essentielles
suivantes étaient vérifiées :
– La transformation de Fourier est une transformation linéaire, inversible pour peu que l’on se place
dans un espace approprié.
– Théorème convolution-produit : Le produit simple et le produit de convolution possèdent des pro-
priétés remarquables vis à vis de la transformation de Fourier : à une constante multiplicative
près, la transformée de Fourier d’un produit simple est égale au produit de convolution des trans-
formées de Fourier. Et la transformée de Fourier d’un produit de convolution est égale (toujours à
une constante multiplicative près) au produit simple des transformées de Fourier.
– La transformation de Fourier finie, et la décomposition en séries de Fourier peuvent s’interpréter
comme des décompositions par rapport à une base orthonormée de l’espace considéré, le corollaire
en étant l’existence de la formule de Parseval.
On s’intéresse maintenant à une autre version de la transformation de Fourier, adaptée cette fois aux
fonctions définies sur R (ou Rn ). On va maintenant voir que ces propriétés restent vraies pour l’essen-
tiel dans le cas de la transformation de Fourier intégrale, à ceci près que de nouvelles difficultés inter-
viennent. Ces difficultés ont trait à la définition même de la transformée de Fourier, qui est définie par
une intégrale, qui n’est pas obligatoirement convergente même dans des cas simples. Ceci implique
qu’il va falloir faire des hypothèses supplémentaires pour nous assurer l’existence de la transformée
de Fourier des fonctions considérées. De même, la transformation de Fourier est inversible, à condi-
tion de se placer dans des espaces de fonctions bien choisis. Le théorème convolution-produit reste
valable, à condition que toutes les fonctions considérées soient bien définies. On verra aussi que l’in-
terprétation de la décomposition en termes de décomposition par rapport à une base orthonormée
n’est plus correcte stricto sensu, mais qu’il reste néanmoins un analogue de la formule de Parseval,
qui porte dans ce cas le nom de formule de Plancherel.
Avant d’entrer dans le vif du sujet, il est utile de se pencher sur un exemple qui montre l’utilité de la
transformation de Fourier.

Préliminaires : circuit RC
On considère le circuit décrit dans la figure 4.1, composé d’une résistance R et d’une capacité C,
entretenu par une tension dépendant du temps t → u(t). On note Q(t) la charge du condensateur,
i (t) l’intensité du courant.
En notant v(t) = Q(t)/C la tension aux bornes du condensateur, la loi d’Ohm s’écrit

Ri (t) + v(t) = u(t) ,

69
4 Intégrales de Fourier

F IG . 4.1: Le filtre RC

ce qui entraı̂ne, puisque i (t) = Q0 (t) = Cv0 (t), que la tension v(t) satisfait à l’équation différentielle
ordinaire
RC v0 (t) + v(t) = u(t) .
Pour résoudre cette dernière, il est utile d’introduire la fonction auxiliaire w(t) = v(t)et/RC . On a donc

1 t/RC
w0 (t) = e u(t)
RC
et la solution est Z t
1
w(t) = es/RC u(s)ds .
RC −∞
Par conséquent,
Z t Z ∞
1
v(t) = e−(t−s)/RC u(s)ds = h(t − s)u(s)ds ,
RC −∞ −∞
où nous avons posé
h(t) = Θ(t)e−t/RC
Θ(t) étant la fonction d’Heaviside :

1 si t ≥ 0
Θ(t) =
0 sinon .

Nous voyons donc que la solution possède une forme bien particulière, celle d’un produit de convo-
lution, que nous allons maintenant étudier plus avant.
Le produit de convolution de deux fonctions est défini de la façon suivante.

D ÉFINITION 4.1 Etant données deux fonctions f et g, la fonction h, définie par


Z ∞
t → h(t) = f (s) g(t − s)ds (4.1)
−∞

(quand l’intégrale est bien définie) est appelée produit de convolution de f et g, et notée h =
f ? g.

Etant donnée une fonction g, l’application linéaire K g qui à toute fonction f associe la
fonction K g f , définie par
Kg f = f ? g ,
est appelé opérateur de convolution par g.
Enonçons maintenant quelques propriétés simples des produits de convolution. Les propriétés sui-
vantes découlent directement de la définition.

70
4.1 La transformation de Fourier des fonctions intégrables

1. Commutativité : étant données deux fonctions f et g, alors f ? g = g ? f .


2. Associativité : ( f ? g) ? h = f ? ( g ? h).
3. Distributivité : f ? ( g1 + g2 ) = ( f ? g1 ) + ( f ? g2 ).
Une autre propriété caractéristique du produit de convolution nous ramène aux fonctions oscillantes
eω (t). Supposons que f soit une fonction intégrable, et calculons
Z ∞
1
( f ? eω )(t) = √ f (s)eiω (t−s) ds
2π −∞
Z ∞ 
−iωs
= f (s)e ds eω (t) ,
−∞

où il est facile de vérifier que l’intégrale de la dernière ligne ci-dessus est absolument convergente
(voir ci-dessous).
Nous retrouvons ici une propriété simple : pour toute fonction f , l’action de K f sur la fonction oscil-
lante
eω : t ∈ R → eiωt
se ramène à une multiplication par une constante (finie) f (s)e−iωs ds. Cette constante n’est autre
R
que la transformée de Fourier de la fonction f (à un facteur près), dont nous donnons maintenant la
définition.

La transformation de Fourier

D ÉFINITION 4.2 Etant donnée une fonction f , sa transformée de Fourier est une fonction, notée
fˆ ou encore F f , d’une variable réelle notée ω, définie par
Z ∞
1
fˆ(ω ) = √ f (t)e−iωt dt (4.2)
2π −∞

pour toute valeur de ω pour laquelle cette intégrale est convergente.

R EMARQUE 4.1 La convergence de l’intégrale ci-dessus est loin d’être un fait acquis dans nombre
de situations. Pour s’en assurer, il est nécessaire de faire des hypothèses supplémentaires. Dans cer-
tains cas où fˆ(ω ) n’existe pas pour tout ω, il est encore possible de construire une théorie pour la
transformation de Fourier. Ce sont ces aspects que nous abordons ci-dessous.

On a donc introduit la transformation de Fourier F , qui est une application linéaire agissant sur des
espaces de fonctions. On utilisera également la transformation de Fourier conjuguée F , définie par
Z ∞
1
[F ϕ](t) = √ ϕ(ω )eiωt dω . (4.3)
2π −∞

On verra que lorsque la transformation de Fourier est inversible, la transformation inverse est donnée
par F . Mais avant cela, il faut tout d’abord analyser les propriétés élémentaires de F .

4.1 La transformation de Fourier des fonctions intégrables


Pour donner un sens précis à la transformation de Fourier que nous venons de voir, il est nécessaire
de faire des hypothèses supplémentaires sur la fonction étudiée. Il est utile à ce point d’introduire

71
4 Intégrales de Fourier

l’espace des fonctions intégrables (ou absolument intégrables) L1 (R), défini de la façon suivante.
Etant donnée une fonction intégrable f , on lui associe le nombre
Z ∞
k f k1 = | f (t)| dt . (4.4)
−∞

L’espace L1 (R) est alors défini par


L1 (R) = { f : R → C, k f k1 < ∞} . (4.5)
L1 (R) est le premier des espaces de fonctions que nous rencontrons. On peut vérifier que
c’est bien un espace vectoriel, c’est à dire que toute combinaison linéaire d’éléments de
L1 (R) est élément de L1 (R). On verra plus loin des propriétés plus fines de L1 (R), ainsi
que d’autres espaces du même type.
Supposons donc que f soit une fonction intégrable. Alors, il vient immédiatement que
Z ∞ Z ∞
1 1
| fˆ(ω )| = √ f (t)e−iωt dt ≤ √ | f (t)|dt =< ∞
2π −∞ 2π −∞

Par conséquent, fˆ(ω ) existe pour tout ω ∈ R, et la transformée de Fourier de f est bien définie, et
bornée. L’espace L1 (R) est donc un premier cadre naturel pour définir la transformation de Fourier,
et étudier ses propriétés essentielles (puisqu’on n’a pas à se soucier du problème de convergence des
intégrales).
R EMARQUE 4.2 De même, on montre avec les mêmes arguments que si ϕ ∈ L1 (R), alors F ϕ est une
fonction bornée. En fait, les applications F et F ont des propriétés tout à fait similaires.

F IG . 4.2: Exponentielle décroissante (à gauche), et sa transformée de Fourier (à droite)

E XEMPLE 4.1 Considérons l’exemple de la fonction t → f (t) = exp{−λ|t|}. Cette fonction est
intégrable, et sa transformée de Fourier est donc bien définie en tant que fonction bornée. On peut
donc calculer
Z ∞
1
fˆ(ω ) = √ e−λ|t| e−iωt dt
2π −∞
Z ∞ Z 0 
1 −(λ+iω )t (λ−iω )t
= √ e dt + e dt
2π 0 −∞
 
1 1 1 1 2λ
= √ + =√
2π λ + iω λ − iω 2π λ + ω 2
2

Il s’agit bien d’une fonction bornée, qui est de plus continue et tend vers zéro à l’infini. Nous verrons
plus loin qu’il s’agit d’une propriété générale des transformées de Fourier des fonctions intégrables.
Les graphes de f et fˆ sont donnés en F IG . 4.2.

72
4.1 La transformation de Fourier des fonctions intégrables

F IG . 4.3: Function caractéristique (à gauche), et sa transformée de Fourier (à droite)

E XEMPLE 4.2 Prenons maintenant le cas de t → f (t) = χ[−1,1] (t), la fonction caractéristique de l’in-
tervalle [−1, 1]. Un calcul direct montre que
Z 1  −iω iω

1 − 1 e e 1 sin ω
fˆ(ω ) = √ e iωt
dt = √ − =√ .
2π −1 2π −iω iω 2π ω
Cette dernière fonction est appelée sinus cardinal, et joue un rôle important dans bon nombre d’ap-
plications. Notons qu’elle est également bornée, continue (la continuité en ω = 0 vient du fait que
sin x ∼ x quand x → 0), et tend vers 0 quand ω → ±∞.
Les graphes de f et fˆ sont donnés en F IG . 4.3.

F IG . 4.4: Signal sonar émis par un dauphin (à gauche), et sa transformée de Fourier : partie réelle (au
centre) et partie imaginaire (à droite)

E XEMPLE 4.3 Naturellement, la transformation de Fourier n’est pas réservée aux fonctions dont on
connait une expression analytique. En pratique, on peut calculer (sur ordinateur si nécessaire) la
transformée de Fourier de n’importe quelle fonction issue d’une mesure physique (on appelle généralement
de telles fonctions des signaux). Un exemple est montré en F IG . 4.4, qui représente un son émis par
un dauphin (sonar), et sa transformée de Fourier (parties réelle et imaginaire).

4.1.1 Propriétés élémentaires


Commençons par quelques propriétés de nature “algébrique”.

Linéarité

Soient f 1 et f 2 deux fonctions intégrables. Alors, il est clair que pour tous α, β ∈ C, la fonction α f 1 + β f 2
est elle aussi intégrable. Un calcul élémentaire montre alors que pour tout ω ∈ R,
F (α f 1 + β f 2 ) (ω ) = α fˆ1 (ω ) + β fˆ2 (ω ) (4.6)

73
4 Intégrales de Fourier

On dit que la transformation de Fourier est une transformation linéaire.

Symétrie Hermitienne

Soit f ∈ L1 (R). Si f est à valeurs réelles, alors


Z ∞
1
fˆ(−ω ) = √ f (t)eiωt dt = fˆ(ω ) (4.7)
2π −∞

On dit alors que la transformée de Fourier fˆ possède la symétrie Hermitienne. Similairement, suppo-
sons que f possède la symétrie Hermitienne, c’est à dire que pour tout t ∈ R, on ait f (−t) = f (t).
Alors
Z ∞ Z ∞
1 1
fˆ(ω ) = √ f (t)e−iωt dt = √ f (−t)eiωt dt = fˆ(ω ) , (4.8)
2π − ∞ 2π − ∞

de sorte que fˆ(ω ) est cette fois une fonction à valeurs réelles.

Comportement vis à vis des translations et des modulations

Considérons maintenant une fonction intégrable f . On définit la translatée de f par la quantité b ∈ R


comme la fonction g ∈ L1 (R) définie par g(t) = f (t − b). On a alors, par un simple changement de
variables
Z ∞ Z ∞
1 1
ĝ(ω ) = √ f (t − b)e−iωt dt = √ eiωb f (t − b)e−iω (t−b) dt = eiωb fˆ(ω ) (4.9)
2π −∞ 2π −∞

On dit que ĝ est une version modulée de fˆ. Similairement, si h ∈ L1 (R) définie par h(t) = eiηt f (t) est
une version modulée de la fonction intégrable f , alors on a
Z ∞
1
ĥ(ω ) = √ f (t)e−i(ω −η )t dt = fˆ(ω − η ) , (4.10)
2π −∞

de sorte que la transformée de Fourier de h est une version translatée de fˆ(ω ).

Comportement vis à vis des dilatations

Soit f une fonction intégrable, et soit fˆ sa transformée de Fourier. Si a est une constante réelle, on
considère une fonction t → f a (t), dilatée de f du facteur a, définie par
 
t
f a (t) = f .
a

Alors, on a, par un changement de variable u = t/a,


Z ∞   Z ∞
1 t −iωt a
fˆa (ω ) = √ f e dt = √ f (u)e−iaωu du = a fˆ( aω ) .
2π −∞ a 2π −∞

Ainsi, la transformée de Fourier de la copie dilatée d’une fonction n’est autre qu’une copie dilatée
(d’un rapport inverse) de la transformée de Fourier de la fonction originale.

74
4.1 La transformation de Fourier des fonctions intégrables

4.1.2 Le théorème de Riemann-Lebesgue


Le théorème de Riemann-Lebesgue est l’un des premiers résultats “fins” concernant la transformation
de Fourier. Il précise d’une part la régularité (ici la continuité) et la décroissance de la transformée de
Fourier d’une fonction de L1 (R).
Ces deux notions sont fondamentales, et souvent difficiles à appréhender, car on peut leur
associer différentes définitions. Sans entrer dans les détails, il faut dire que la régularité
d’une fonction va de pair avec la vitesse de la décroissance à l’infini de sa transformée de
Fourier. En d’autres termes plus imagés, plus une fonction “varie lentement” (ce que l’on
peut prendre comme une idée acceptable de fonction régulière), plus fˆ(ω ) tend rapide-
ment vers zéro quand ω → ∞.

T H ÉOR ÈME 4.1 (R IEMANN -L EBESGUE ) Soit f ∈ L1 (R). Alors sa transformée de Fourier fˆ
est bornée, et uniformément continue : pour tout e > 0, il existe δ tel qu’en tout point ω ∈ R

| fˆ(ω + δ) − fˆ(ω )| ≤ e (4.11)

De plus, fˆ(ω ) tend vers zéro quand ω tend vers ±∞.

Preuve : Nous savons déjà que si f ∈ L1 (R), alors fˆ est bornée. Passons à la continuité. La preuve est
relativement simple. Commençons par calculer, pour un ω quelconque,

1
Z  
fˆ(ω + δ) − fˆ(ω ) = √ f (t) e−i(ω +δ)t − e−iωt dt

−2i
 
tδ −itδ/2 −iωt
Z
= √ f (t) sin e e dt
2π 2
R −T R∞ √
Le fait que f soit intégrable implique qu’il existe T tel que −∞ | f (t)|dt + T | f (t)|dt ≤ 2πe/4.
Nous n’avons donc plus qu’à nous préoccuper de l’intégrale entre − T et T. Mais dans cet intervalle,
nous savons que | sin(tδ/2)| ≤ |tδ/2| ≤ Tδ/2. Donc, nous avons

1 Tδ T
Z
e
fˆ(ω + δ) − fˆ(ω ) ≤ +√ | f (t)|dt
2 2π 2 −T
e 1 Tδ
≤ +√ || f ||1
2 2π 2

Il suffit maintenant de choisir δ de sorte que Tδ|| f ||1 ≤ 2πe, et on obtient bien l’estimation sou-
haitée (4.11). Notons au passage que le δ obtenu ne dépend pas de ω. La première partie du théorème
est donc montrée.
Le fait que fˆ(ω ) → 0 quand ω → ±∞ résulte de la densité des fonctions constantes par morceaux
dans l’espace L1 (R) : pour toute fonction f ∈ L1 (R), il existe une suite de fonctions gn , constantes
par morceaux, telle que pour tout e fixé, on ait || f − gn ||1 ≤ e pour un n assez grand. Il suffit donc
d’étudier le comportement de la fonction caractéristique d’un intervalle ; prenons g = χ[a,b] . Alors, on

a ĝ(ω ) = (e−iωb − e−iωa )/iω 2π, qui tend bien vers 0 quand |ω | → ∞. De même, la transformée de
Fourier de toute fonction intégrable constante par morceaux tend vers 0 à l’infini. Pour conclure, il
suffit de remarquer que pour tout ω, on a par hypothèse | fˆ(ω ) − ĝn (ω )| ≤ || f − gn ||1 . Comme pour
tout n, ĝn (ω ) → 0 quand |ω | → ∞, et comme || f − gn ||1 peut être rendu aussi prôche de 0 que ce que
l’on veut, on en déduit que fˆ(ω ) → 0 quand |ω | → ∞. ♠

75
4 Intégrales de Fourier

E XEMPLE 4.4 Dans les deux exemples que nous avons vus plus haut (à savoir f (t) = e−λ|t| et f (t) =
χ[−1,1] (t), nous avons affaire à une fonction de L1 (R), et on vérifie directement la continuité et la
décroissance à l’infini de fˆ.

E XEMPLE 4.5 Contre exemple : Remarquons que l’hypothése d’intégrabilité est importante. Prenons
l’exemple suivant :
1
f (t) = .
t+i
Un calcul√simple par la méthode des résidus montre que pour ω < 0, fˆ(ω ) = 0, alors que pour ω > 0,
fˆ(ω ) = i 2πe−ω . Dans ce cas, f 6∈ L1 (R), et ceci se traduit par le fait que fˆ est discontinue en 0.

E XEMPLE 4.6 Un autre contre exemple : Prenons l’exemple suivant :

t2
 
f (t) = cos .
2

Bien que cette fonction n’appartienne pas à L1 (R) (elle ne tend absolument pas vers 0 à l’infini), il est
quand même possible de lui associer une tramsformée de Fourier. Le résultat est

ω2
 
π
fˆ(ω ) = cos − .
2 4

Dans ce cas aussi, f 6∈ L1 (R), et ceci se traduit cette fois par le fait que fˆ(ω ) ne tend pas vers 0 quand
ω → ±∞.

4.1.3 Dérivabilité
Nous allons maintenant nous focaliser quelque peu sur les propriétés de régularité des transformées
de Fourier des fonctions intégrables. Le théorème de Riemann-Lebesgue ci-dessus nous a déjà permis
de vérifier la continuité de la transformée de Fourier des fonctions de L1 (R). Nous allons voir que
sous des hypothèses appropriées, on peut montrer des pripriétés de régularité plus forte.
Començons par la différentiabilité.

P ROPOSITION 4.1 Soit f une fonction intégrable, telle que la fonction t → t f (t) soit elle aussi
intégrable. Alors sa transformée de Fourier fˆ admet en tout point une dérivée continue, qui n’est
autre que la transformée de Fourier de la fonction t → −it f (t).

Preuve : Calculons donc


Z ∞
1 −iωt

−iωδ

fˆ(ω + δ) − fˆ(ω ) = √ f (t)e e − 1 dt
2π −∞
Z ∞
δ sin(δt/2) −iδt/2 −iωt
= √ (−it f (t)) e e dt
2π −∞ δt/2

En divisant des deux cotés par δ, et en utilisant des arguments similaires aux précédents, il est facile
de montrer que la limite du quotient ainsi obtenu, quand δ → 0, existe. Comme limu→0 sin(u)/u = 1,
ceci montre la proposition. ♠
En itérant ce résultat, on montre que si f est une fonction intégrable, telle que les fonctions t →
t f (t), . . . tn f (t) sont intégrables alors fˆ admet n dérivées continues, qui ne sont autres que les trans-
formées de Fourier des fonctions t → (−it)k f (t), k = 1, . . . n.

76
4.1 La transformation de Fourier des fonctions intégrables

P ROPOSITION 4.2 Soit f : t → f (t) une fonction intégrable, telle que les fonctions t → t f (t),
t → t2 f (t),... t → tn f (t) soient elles aussi intégrables. Alors sa transformée de Fourier fˆ admet
en tout point des dérivées d’ordre 1,2,... n continues, qui ne sont autres que les transformées de
Fourier des fonctions t → (−it)k f (t).

R EMARQUE 4.3 Notons que le résultat ainsi obtenu est celui que l’on obtient en dérivant sous le signe
somme. La démonstration que nous avons faite donne une justification à cette opération.

4.1.4 Transformation de Fourier d’une dérivée


On vient de voir que la transformée de Fourier de la fonction t → (−it)k f (t) (si celle-ci est intégrable)
est la dérivée k-ième de fˆ. On se pose maintenant la question “duale”, à savoir, “quelle est la trans-
formée de la dérivée d’une fonction ?” Nous allons montrer le résultat suivant :

P ROPOSITION 4.3 Soit f : t → f (t) une fonction intégrable, et supposons que les dérivées
f (k) , k = 1, . . . n de f existent presque partout et sont intégrables. Alors pour tout k ≤ n, la
fonction f (k) a pour transformée de Fourier la fonction ω → (iω )k fˆ(ω ).

Preuve : Pour démontrer ce résultat, considérons une fonction t → f (t) satisfaisant aux hypothèses du
théorème, et montrons tout d’abord que f (t) → 0 quand t → ∞. Supposons que limt→∞ f (t) existe.
Alors comme f est intégrable, cette limite est nécessairement nulle. Reste à vérifier limt→∞ f (t) existe.
Rt Rt
Pour cela, écrivons f (t) = f (0) + 0 f 0 (s)ds. Comme f 0 est supposée intégrable, limt→∞ 0 f 0 (s)ds
existe, et donc limt→∞ f (t) existe. De même, on montre que limt→−∞ f (t) existe.
On peut donc intégrer par parties dans l’intégrale qui définit la transformée de Fourier de f 0 , et on
obtient Z ∞ h i∞ Z ∞
0 −iωt −iωt
f (t)e dt = e f (t) + iω f (t)e−iωt dt
−∞ −∞ −∞
et dont
(F f 0 )(ω ) = iω fˆ(ω ) (4.12)
De façon plus générale, en intégrant par parties autant de fois qu’il le faut, on obtient de même, pour
k ≤ n,
(F f (k) )(ω ) = (iω )k fˆ(ω ) , (4.13)
ce qui est le résultat souhaité. ♠
Ce résultat, combiné au théorème de Riemann-Lebesgue, a le corollaire important suivant :

C OROLLAIRE 4.1 Soit f une fonction intégrable, dont les dérivées f (k) , k = 1, . . . n existent
presque partout et sont intégrables. Alors il existe une constante C telle que

C
| fˆ(ω )| ≤ . (4.14)
1 + |ω |n

Preuve : D’après le théorème de Riemann-Lebesgue, on sait que la transformée de Fourier de f est


bornée (donc, il existe C1 telle que | fˆ(ω )| ≤ C1 pour tout ω), et que la transformée de Fourier ω →
(iω )n fˆ(ω ) de f (n) tend vers zéro quand ω → ±∞. Donc, a fortiori, il existe une constante C2 telle que
| fˆ(ω )| ≤ C2 /|ω |n . La borne (4.14) est une conséquence de ces deux bornes. Il suffit en effet d’écrire,

77
4 Intégrales de Fourier

pour |ω | ≥ 1, que | fˆ(ω )| ≤ 2C2 /(|ω |n + |ω |n ) ≤ 2C2 /(1 + |ω |n ) ; de même, pour |ω | ≤ 1, on utilise
| fˆ(ω )| ≤ 2C1 /(1 + 1) ≤ 2C1 /(1 + |ω |n ) ; on obtient alors (4.14) en prenant C = max(2C1 , 2C2 ). ♠
Ce résultat permet de préciser quelque peu l’assertion faite plus tôt. Il montre clairement
que plus une fonction est régulière (c’est à dire dans ce cas, plus elle possède de dérivées
continues), plus sa transformée de Fourier tend vers 0 rapidement à l’infini.

4.1.5 Le problème de l’inversion


Il s’agit d’un problème délicat. Il suffit pour s’en convaincre de remarquer que la transformation de
Fourier étant définie à l’aide de l’intégrale de Lebesgue, deux fonctions différant sur un ensemble de
mesure nulle ont la même transformée de Fourier. Par exemple, si f est une fonction intégrable, et si
la fonction f˜ est telle que f˜(t) = f (t) sauf pour un nombre fini de valeurs de l’argument t, f et f˜ ont
la même transformée de Fourier. Par conséquent, il faut s’attendre à devoir imposer des hypothèses
supplémentaires si on veut inverser la transformation de Fourier.
Nous avons déjà introduit en (4.3) l’application linéaire F . Pour les mêmes raisons que précédemment,
F g définit une fonction bornée dès que g ∈ L1 (R). Nous allons maintenant montrer que sous cer-
taines conditions, F est effectivement l’inverse de la transformation de Fourier, c’est à dire que l’on
peut écrire Z ∞
  1
f (t) = F fˆ (t) = √ fˆ(ω )eiωt dω
2π −∞
Cependant, pour les raisons évoquées plus haut, ce “résultat” est à prendre avec précautions. Nous
allons en fait montrer le résultat suivant :

T H ÉOR ÈME 4.2 Soit f une fonction telle que f , fˆ ∈ L1 (R). Supposons que f soit continue en
t = t0 . Alors on a Z ∞
1
f ( t0 ) = √ fˆ(ω )eiωt0 dω (4.15)
2π −∞

Ce résultat utilise le résultat suivant, appelé lemme d’échange

L EMME 4.1 Soient f , g ∈ L1 (R) deux fonctions intégrables. Alors on a l’égalité


Z ∞ Z ∞
f (t) ĝ(t)dt = fˆ(s) g(s)ds (4.16)
−∞ −∞

Preuve du lemme : Puisque f et g sont intégrables, fˆ et ĝ sont bornées, et les produits f ĝ et fˆg sont
intégrables. Les deux intégrales dans (4.16) sont donc convergentes, et on peut écrire
Z ∞ Z ∞
1
f (t) ĝ(t)dt = √ f (t) g(s)e−ist dsdt .
−∞ 2π −∞

Le lemme de Fubini s’applique, et l’intégration par rapport à t donne précisément (4.16). ♠


Preuve du théorème : Considérons la famille de fonctions intégrables définies par

gn (t) = e−|t|/n . (4.17)

Leur transformée de Fourier est donnée par


Z ∞
1 1 2n
ĝn (ω ) = √ e−|t|/n e−iωt dt = √ (4.18)
2π −∞ 2π 1 + n2 ω 2

78
4.1 La transformation de Fourier des fonctions intégrables

La formule d’échange donne alors


Z ∞ Z ∞
fˆ(ω ) gn (ω )eiωt dω = f (s) ĝn (s − t)ds (4.19)
−∞ −∞

Intéressons nous tout d’abord au terme de gauche de cette égalité. Nous savons que limn→∞ gn (t) = 1
pour tout t, et que par ailleurs, fˆ(ω ) gn (ω )eiωt ≤ | fˆ(ω )|, qui est fini. Le théorème de convergence
dominée de Lebesgue (voir plus loin) nous assure donc que pour tout t,
Z ∞ Z ∞
fˆ(ω ) gn (ω )eiωt dω → fˆ(ω )eiωt dω quand n → ∞ .
−∞ −∞
R∞ √
Passons maintenant au membre de droite, et notons tout d’abord que −∞ ĝn (u)du = 2π. Calculons
Z ∞ √ Z ∞
f (s + t) ĝn (s)ds − 2π f (t) = [ f (s + t) − f (t)] ĝn (s)ds . (4.20)
−∞ −∞

Supposons que f soit continue en t = t0 . Donc, pour tout e > 0, il existe un ρ > 0 tel que s ≤ ρ
entraı̂ne | f (t0 + s) − f (t0 )| ≤ e. En traitant de façon différente les valeurs s ≤ ρ et s > ρ dans le
membre de droite de (4.20), nous sommes amenés à considérer
Z Z
[ f (s + t0 ) − f (t0 )] ĝn (s)ds ≤ e gn (s)ds ≤ e ,
|s|≤ρ |s|≤ρ

que nous pouvons rendre aussi petit que nous voulons. Quant à l’autre terme, nous avons à considérer
Z ∞
4n ds 4 π
Z 
f ( t0 ) | ĝn (s)|ds = | f (t0 )| √ = √ − arc tan ( ρn ) | f (t0 )|
|s|>ρ 2π ρ 1 + n2 s2 2π 2
qui tend vers zéro quand n → ∞, et
Z
f (t0 + s) ĝn (s)ds ≤ ĝn (ρ)|| f ||1
|s|>ρ

qui tend lui aussi vers zéro quand n → ∞. Ainsi, la limite du membre de droite de (4.19), au point de
continuité t = t0 , n’est autre que f (t0 ). Ceci achève la preuve du théorème. ♠

4.1.6 La convolution
Le produit de convolution, brièvement évoqué plus haut, joue un rôle central. Il est donc important
d’étudier ses propriétés. Supposons que f soit une fonction intégrable, et que ĝ soit elle aussi une
fonction intégrable. Par conséquent, les fonctions définies par
1 ∞ Z
fˆ(ω ) = √ f (t)e−iωt dt (4.21)
2π −∞
Z ∞
1
g(t) = √ ĝ(ω )eiωt dω (4.22)
2π −∞
sont bornées. De plus, la fonction h définie par
Z ∞
h(t) = ( f ? g)(t) = f (s) g(t − s)ds (4.23)
−∞

existe pour tout t ∈ R, et est elle aussi bornée. Si on remplace g(t) par sa définition dans l’expression
de h, on obtient Z ∞
1
h(t) = √ f (s)eiω (t−s) ĝ(ω )dωds , (4.24)
2π −∞

79
4 Intégrales de Fourier

que l’on peut encore écrire en utilisant le lemme de Fubini (l’intégrale étant absolument convergente,
c’est licite) et la définition de la transformation de Fourier
Z ∞
h(t) = ĝ(ω ) fˆ(ω )eiωt dω (4.25)
−∞

h s’écrit ainsi (à un facteur 2π près) comme la transformée de Fourier inverse du produit fˆĝ. Re-
marquons que cette transformée est bien définie, dans la mesure où fˆ est bornée, et ĝ est intégrable
par hypothèse.
De même, la fonction produit f g : t → ( f g)(t) = f (t) g(t) est elle aussi intégrable ; on peut donc
calculer
1 ∞ Z
[F ( f g)] (ω ) =√ f (t) g(t)e−iωt dt
2π −∞
Z ∞
1
= f (t) ĝ(η )ei(η −ω )t dηdt
2π −∞
Z ∞
1
= √ ĝ(η ) fˆ(ω − η )dη
2π −∞
et vaut donc (à une constante près) le produit de convolution f ? g(ω ). Nous avons donc montré :

P ROPOSITION 4.4 (C ONVOLUTION -P RODUIT ) Si f , ĝ ∈ L1 (R), et si on définit fˆ et g par


fˆ = F f et g = F ĝ, alors
√  
( f ? g) = 2π F fˆĝ (4.26)
et
1 ˆ 
F ( f g) = √ f ? ĝ (4.27)

Ce résultat est d’une importance pratique considérable, en particulier pour tout ce qui concerne la
résolution des équations différentielles et équations aux dérivées partielles. Il est aussi utile d’un
point de vue calculatoire, comme nous le montre l’exemple suivant.
2 2 2 2
E XEMPLE 4.7 Considérons les deux fonctions suivantes : f (t) = e−t /2a , et g(t) = e−t /2b , et sup-
posons que nous ayons à calculer leur produit de convolution f ? g. Nous savons que la transformée
2 2 2 2
de Fourier de la fonction h définie par h(t) = e−t /2 est ĥ(ω ) = e−ω /2 . Donc, fˆ(ω ) = ae−a ω /2
2 2 2 2 2
et ĝ(ω ) = be−b ω /2 , et fˆ(ω ) ĝ(ω ) = abe−(a +b )ω /2 . Le résultat précédent donne donc ( f ? g)(t) =
√ 2 2 2
2π √ ab e−t /2(a +b ) . Nous avons pu ainsi éviter un calcul (simple mais sans intérêt) d’intégrales
a2 + b2
Gaussiennes.

4.2 Les fonctions de carré intégrable


Le cadre des fonctions de carré intégrables est souvent un cadre naturel pour formuler les problèmes
de physique. Il est donc intéressant d’étudier les propriétés des transformées de Fourier des fonctions
de carré intégrable. Cependant, il faut remarquer immédiatement que contraitement au cas précédent,
la transformée de Fourier d’une fonction de carré intégrable existe en tout point. En effet, supposer
f ∈ L2 (R) ne permet pas a priori d’assurer immédiatement que contraitement au cas précédent, la
transformée de Fourier d’une fonction de carré intégrable existe en tout point. En effet, supposer
f ∈ L2 (R) ne permet pas a priori d’assurer que l’intégrale
Z ∞
f (t)e−iωt dt
−∞

80
4.2 Les fonctions de carré intégrable

converge pour toute valeur de t. Les transformées de Fourier des fonctions de carré intégrable qui ne
sont pas intégrables ne sont pas bornées en général, et seront à manipuler avec précaution.
Il existe plusieurs manières (équivalentes) de définir la transformation de Fourier sur L2 (R). La plu-
part sont basées sur une construction sur un sous-espace dense de L2 (R), et étendent la définition
par passage à la limite. C’est cette approche que nous emploierons, en nous basant sur l’espace S(R)
de Schwartz.

4.2.1 La transformation de Fourier dans l’espace de Schwartz S(R)

L’espace de Schwartz S(R) possède une propriété remarquable : la transformée de Fourier d’une
fonction appartenant à S(R) est elle aussi une fonction de S(R). Pour nous en convaincre, commençons
par faire les remarques suivantes :
1. Si f ∈ S(R), alors pour tout polynôme t → P(t), la fonction P f : t → P(t) f (t) est elle aussi une
fonction de S(R).
2. Si f ∈ S(R), alors f 0 ∈ S(R), et plus généralement, toutes les dérivées f (k) de f sont des
fonctions de S(R).
3. S(R) ⊂ L1 (R).
On déduit de ces remarques que la transformation de Fourier est bien définie sur S(R) : toute fonction
de S(R) possède une transformée de Fourier bornée. De plus, si f ∈ S(R), alors pour tout k, tk f (t)
est aussi dans S(R) et est ainsi intégrable ; donc fˆ ∈ C k (R), et ce pour tout k. Donc f ∈ C ∞ (R).
Le même raisonnement s’applique à toutes les dérivées de f : f (k) ∈ S(R) implique que la fonction
ω → ω k fˆ(ω ) est bornée, et ce quel que soit k. Donc nous avons montré que la transformée de Fourier
ω → fˆ(ω ) de toute fonction f ∈ S(R) est elle même une fonction de S(R).
Inversement, fˆ ∈ S(R) ⊂ L1 (R), et la discussion précédente s’applique tout aussi bien à fˆ. Par
conséquent, nous avons montré

T H ÉOR ÈME 4.3 La transformation de Fourier est une bijection entre S(R) et S(R).

Soient f , g ∈ S(R), et posons h(ω ) = ĝ(ω ). Alors un calcul simple montre que ĥ(t) = g(t). Appli-
quons la formule d’échange à f et h. Ceci nous donne la formule de Plancherel-Parseval :
Z ∞ Z ∞
f (t) g(t)dt = fˆ(ω ) ĝ(ω )dω , (4.28)
−∞ −∞

et en particulier dans le cas g = f :


Z ∞ Z ∞
| f (t)|2 dt = | fˆ(ω )|2 dω , (4.29)
−∞ −∞

(il découle de la discussion ci-dessus que toutes ces intégrales sont convergentes. Par conséquent,
dans ce cas, nous avons aussi f ∈ L2 (R) et fˆ ∈ L2 (R)). Nous avons donc montré :

P ROPOSITION 4.5 La transformation de Fourier est une isométrie de S(R) sur S(R).

81
4 Intégrales de Fourier

4.2.2 Le passage à L2 (R)


Le passage au cadre L2 (R) se fait en utilisant la densité de S(R) dans L2 (R), et le théorème général
d’analyse fonctionnelle suivant :

T H ÉOR ÈME 4.4 Soient E et F deux espaces vectoriels normés, F étant un espace complet, et soit
E0 ⊂ E un sous-espace dense de E. Soit Φ0 : E0 → Φ0 ( E0 ) ⊂ F une application isométrique
bijective. Alors, il existe une unique application Φ : E → F, isométrique et bijective de E sur F,
qui prolonge Φ0 (c’est à dire telle que sa restriction à E0 coı̈ncide avec Φ0 .

En considérant le cas E = F = L2 (R) et E0 = S(R), Φ0 = F (la transformation de Fourier sur S(R),


et en utilisant les résultats obtenus dans la sous-section précédente, on obtient directement le résultat
important suivant :

T H ÉOR ÈME 4.5 (T RANSFORMATION DE F OURIER SUR L2 (R) ) 1. La transformation de


Fourier sur S(R) se prolonge en une isométrie bijective de L (R) sur L2 (R). De plus,
2

on a la formule de Parseval-Plancherel : ∀ f , g ∈ L2 (R),


Z ∞ Z ∞
f (t) g(t)dt = fˆ(ω ) ĝ(ω )dω . (4.30)
−∞ −∞

2. Si f ∈ L1 (R) ∩ L2 (R), les deux définitions de la transformée de Fourier fˆ coı̈ncident.

Ce dernier résultat, pour important qu’il soit, n’est pas constructif, au sens où la transformation de
Fourier dans L2 (R) n’y est construite que par un argument de passage à la limite abstrait. Il est
complété par la proposition suivante, qui prouve que la transformée de Fourier d’une fonction de
L2 (R) s’obtient (aux points où elle est bien définie) via le calcul usuel.

P ROPOSITION 4.6 Si f ∈ L2 (R), fˆ(ω ) peut s’obtenir comme


Z T
1
fˆ(ω ) = √ lim f (t)e−iωt dt (4.31)
2π T →∞ −T

Preuve : Il suffit de remarquer que pour toute fonction f ∈ L2 (R), on peut écrire

lim k f − f χ[−T,T ] k = 0 ,
T →∞

c’est à dire que f ∈ L2 (R) est arbitrairement bien approximée par des fonctions f χ[−T,T ] , pour T assez
grand. Or ces dernières appartiennent à L1 (R), donc leur transformée de Fourier est bien définie.
D’après la formule de Plancherel, on a ainsi limT →∞ k fˆ − f \
χ[−T,T ] k = limT →∞ k f − f χ[−T,T ] k = 0, ce
qui conclut la preuve de la proposition. ♠

E XEMPLE 4.8 Considérons la fonction f définie par

1
f (t) = .
t+i

82
4.2 Les fonctions de carré intégrable

Cette fonction n’est pas intégrable, mais elle appartient à L2 (R). Sa transformée de Fourier est facile-
ment obtenue grâce à la méthode des résidus, et on obtient

fˆ(ω ) = i 2πe−ω Θ(ω ) ,
où Θ est la fonction de Heaviside. fˆ est bien de carré intégrable, mais est discontinue.

4.2.3 Le théorème convolution-produit


Le théorème convolution-produit que nous avons déjà rencontré auparavant s’étend sans difficulté
au cadre L2 (R). En effet, soient f , g ∈ L2 (R). Alors fˆ, ĝ ∈ L2 (R), et les produits f g, fˆĝ ∈ L1 (R). Les
calculs que nous avons faits précédemment sont toujours corrects, et on a

P ROPOSITION 4.7 (C ONVOLUTION -P RODUIT DANS L2 (R) ) Si f , g ∈ L2 (R), alors


√  
( f ? g)(ω ) = 2π F fˆĝ (ω ) (4.32)

et
1 ˆ 
F ( f g)(ω ) = √ f ? ĝ (ω ) (4.33)

4.2.4 L’inégalité de Heisenberg


Nous avons vu jusqu’à présent des relations liant une fonction à sa transformée de Fourier, et réciproquement.
Nous allons maintenant voir une relation d’un type quelque peu différent, qui a de fortes implica-
tions pratiques, en mécanique quantique et en traitement du signal en particulier. Il s’agit d’inégalités,
dues à W. Heisenberg, qui montrent qu’une fonction ne peut être aussi localisée simultanément en
temps et en fréquence que ce que l’on pourrait le vouloir. Il faut pour cela introduire des mesures de
localisation. Etant donnée une fonction f ∈ L2 (R), on introduit sa moyenne µ f par
Z ∞
1
µf = t| f (t)|2 dt , (4.34)
k f k2 −∞

et son écart quadratique moyen σ f par


Z ∞
1
σ2f = (t − µ f )2 | f (t)|2 dt , (4.35)
k f k2 −∞

pour peu que ces deux intégrales soient convergentes. On définit de même les quantités analogues
dans le domaine fréquentiel : µ fˆ et σ fˆ. Les nombres µ sont des mesures de localisation, alors que les
σ sont des mesures de “concentration”. On a donc alors :

T H ÉOR ÈME 4.6 Soit f ∈ C1 (R), telle que les fonctions f (t), f 0 (t) et t f (t) soient de carré
intégrable. Alors on a
1
σ f σ fˆ ≥ . (4.36)
2

Preuve : Supposons tout d’abord que µ f = µ fˆ = 0. La preuve est une conséquence de l’inégalité de
Cauchy-Schwarz : écrivons
Z ∞ Z ∞
d 2 2 ∞
| f (t)|2 dt
 
t | f (t)| dt = t| f (t)| −∞ −
−∞ dt −∞

83
4 Intégrales de Fourier

Il est possible de montrer que sous les hypothèses du théorème, limt→±∞ t| f (t)|2 = 0. Donc, en pre-
nant la valeur absolue et en développant la dérivée, on a
Z ∞ Z ∞
|| f ||2 ≤ t f (t) f 0 (t)dt + t f 0 (t) f (t)dt
−∞ −∞

En appliquant l’inégalité de Cauchy-Schwarz à ces deux termes, on aboutit à


∞ Z ∞
rZ
2
|| f || ≤ 2 2 2
t | f (t)| dt | f 0 (t)|2 dt .
−∞ −∞

Or, nous savons que la transformée de Fourier de f 0 n’est autre que la fonction ω → iω fˆ(ω ). En
utilisant la formule de Plancherel, nous obtenons
Z ∞ Z ∞
| f 0 (t)|2 dt = ω 2 | fˆ(ω )|2 dω = k f k2 σ2fˆ .
−∞ −∞

On a bien le résultat désiré, dans le cas particulier µ f = µ fˆ = 0


Pour le cas général, considérons la fonction g définie par
−iµ fˆ t
g(t) = e f (t + µ f ) .

Un calcul immédiat montre que µ g = µ ĝ = 0, de sorte que l’on peut appliquer à g le résultat que nous
venons de montrer. Or, on a k gk = k f k,
Z ∞
1
σg2 = t2 | f (t + µ f )|2 dt = σ2f ,
k g k2 −∞

et Z ∞
1
σĝ2 = ω 2 | fˆ(t + µ fˆ )|2 dω = σ2fˆ .
k ĝk2 −∞
Ceci conclut la démonstration. ♠

4.3 Transformation de Fourier des fonctions de plusieurs variables


La majorité des résultats obtenus dans le cas des fonctions d’une variable réelle se généralisent sans
difficulté majeure au cas multidimensionnel. On notera génériquement
 
x1
 x2 
 ...  ∈ R
n
x= 

xn

les vecteurs de Rn (ou Cn ). La transformation de Fourier F associe à toute fonction de n variables


x → f ( x ) une fonction de n variables k → fˆ(k ), définie formellement par
Z
fˆ(k ) = [F f ](k ) = (2π )−(n/2) f ( x ) e−ik.x dx , (4.37)
Rn

alors que la transformation de Fourier inverse (quand elle est définie) s’obtient via
Z
[F fˆ]( x ) = (2π )−(n/2) fˆ(k ) eik.x dk , (4.38)
Rn

Il est clair que les mêmes problèmes de définition qu’en dimension un se posent dans ce cas également.
On se contentera ici de passer en revue les résultats importants dans le cas des fonctions intégrables
et de carré intégrable

84
4.3 Transformation de Fourier des fonctions de plusieurs variables

4.3.1 Transformation de Fourier des fonctions intégrables


Les espaces de Lebesgue en dimension n sont définis de façon similaire á leurs homologues unidi-
mensionnels : étant donnée une fonction de n variables f , on lui associe le nombre
Z 1/p
p
k f kp = | f ( x )| dx , (4.39)
Rn

quand cette intégrale est convergente. Les espaces L p (Rn ) sont alors définis par

L p (Rn ) = f : Rn → C, k f k p < ∞ .

(4.40)

Il est clair que si f ∈ L1 (Rn ), la fonction fˆ définie par (4.37) est bien définie pour tout k ∈ Rn . Plus
généralement, on a l’analogue n-dimensionnel du théorème de Riemann-Lebesgue :

T H ÉOR ÈME 4.7 (R IEMANN -L EBESGUE ) Soit f ∈ L1 (Rn ). Alors fˆ(k) tend vers zéro quand
|k| tend vers ∞. De plus, la fonction fˆ est bornée et continue.

La démonstration est une généralisation directe de la démonstration dans le cas unidimensionnel.


L’inversion de la transformation de Fourier se heurte aux mêmes obstacles que dans le cas unidi-
mensionnel : si f ∈ L1 (Rn ), on sait que fˆ est bornée, mais ceci n’est pas suffisant pour assurer que
F fˆ existe. Si par contre on suppose en outre que fˆ ∈ L1 (Rn ), alors F fˆ existe bien, et on montre
l’analogue du théorème 4.2 :

T H ÉOR ÈME 4.8 Soit f ∈ L1 (Rn ) une fonction telle que fˆ ∈ L1 (R) aussi. En tout point x = x0
où f est continue, on a
Z
f ( x0 ) = [F fˆ]( x0 ) = (2π )−n/2 fˆ(k )eik.x0 dk . (4.41)
Rn

4.3.2 Propriétés simples


Translations, modulations

Soit f ∈ L1 (Rn ). On définit la translatée de f par la quantité b ∈ Rn comme la fonction g ∈ L1 (Rn )


définie par g( x ) = f ( x − b). On vérifie immédiatement que

ĝ(k ) = eik.b fˆ(k ) (4.42)

ĝ est une version modulée de fˆ. Similairement, si x → h( x ) = eik0 .x f ( x ) est une version modulée de
f ∈ L1 (Rn ), alors on a
ĥ(k ) = fˆ(k − k0 ) , (4.43)
de sorte que la transformée de Fourier de h est une version translatée de fˆ.

Dilatations

Soit f ∈ L1 (Rn ), et soit a 6= 0 est une constante réelle. On considère une fonction f a , dilatée de f du
facteur a, définie par x
f a (x) = f .
a

85
4 Intégrales de Fourier

Alors, on a, par un changement de variable y = x/a,


x an
Z Z
fˆa (k ) = (2π )−n/2 f e−ik.x dx = f (y)e−iak.y dy = an fˆ( ak ) .
Rn a (2π )n/2 Rn

De nouveau, la transformée de Fourier de la copie dilatée d’une fonction n’est autre qu’une copie
dilatée (d’un rapport inverse) de la transformée de Fourier de la fonction originale.

Transformations linéaires

Plus généralement, Considérons une matrice n × n A, inversible. Etant donnée une fonction f ∈
L1 (Rn ), on lui associe la fonction g ∈ L1 (Rn ) définie par

g( x ) = f ( A.x ) .

On voit alors facilement qu’en notant t A la transposée de A, et | A| son déterminant, et par un chan-
gement de variables y = Ax, on a
Z
ĝ(k ) = (2π )−n/2 f ( Ax )e−ik.x dx
Rn
Z
−1 y
= | A| −1
(2π ) −n/2
f (y)e−ik.A dy
Rn
 
= | A|−1 fˆ t ( A−1 )k .

Ce résultat est une généralisation du précédent (dilatation). En effet, si nous prenons pour A une
matrice diagonale égale à a fois la matrice identité, alors f ( Ax ) = f ( ax ). De plus, | A| = an , et t ( A−1 )
n’est autre que a−1 fois la matrice identité. Ceci nous redonne exactement ce que nous avons obtenu
plus haut.

E XEMPLE 4.9 Prenons un autre exemple : n = 2, et a = rθ , la matrice de rotation d’angle θ :


 
cos θ − sin θ
rθ = .
sin θ cos θ

On vérifie immédiatement que rθ−1 = r−θ (l’inverse d’une rotation d’angle θ est une rotation d’angle
−θ), et que donc
t
((rθ )−1 ) = rθ .
Comme |rθ | = 1, on en déduit que si g est définie par g( x ) = f (rθ x ), alors ĝ(k) = fˆ(rθ k ).

4.3.3 Convolution-produit
Le théorème convolution-produit que nous avons vu dans le cas unidimensionnel s’étend sans diffi-
culté au cas n-dimensionnel. La seule différence est une modification de la constante multiplicative.

P ROPOSITION 4.8 (C ONVOLUTION -P RODUIT ) Si f , ĝ ∈ L1 (Rn ), et si on définit fˆ et g par


fˆ = F f et g = F ĝ, alors  
( f ? g) = (2π )n/2 F fˆĝ (4.44)
et  
−n/2
F ( f g) = (2π ) fˆ ? ĝ . (4.45)

86
4.3 Transformation de Fourier des fonctions de plusieurs variables

4.3.4 Différentiation

De nouveau, la situation est similaire au cas unidimensionnel, et on peut d’ailleurs utiliser les résultats
obtenus en dimension 1 pour les étendre au cas multidimensionnel. Par exemple, soit f ∈ L1 (Rn ), et
supposons que la dérivée f par rapport à la première variable x1 soit intégrable. Alors, en posant

∂k f
g( x ) = (x)
∂x1

on peut calculer
∂k f
Z
ĝ(k ) = (2π )−n/2 ( x )e−ik.x dx = ik1 fˆ(k) .
Rn ∂x1

Plus généralement, étant donnée une fonction f de n variables, et un n-uplet de nombres entiers
positifs {α1 , α2 , . . . αn }, on notera

∂ α1 ∂ α2 ∂ αn
f (α1 α2 ...αn ) = . . . f. (4.46)
∂x1 α1 ∂x2 α2 ∂xn αn

On montre :

P ROPOSITION 4.9 1. Soit f ∈ L1 (Rn ), telle que ses dérivées partielles f ( β1 β2 ...β n ) , pour
β 1 ≤ α1 , . . . , β n ≤ αn sont intégrables. Alors pour tout n-uplet { β 1 , β 2 , . . . , β n }, avec
β 1 ≤ α1 , . . . β n ≤ αn , on a

[F f ( β1 β2 ...βn ) ](k) = (ik1 ) β1 (ik2 ) β2 . . . (ik n ) βn fˆ(k) . (4.47)

2. Soit f ∈ L1 (Rn ), telle que pour tout n-uplet { β 1 β 2 . . . β n }, avec β k ≤ αk , k = 1, . . . n, la


fonction g β1 ...β n définie par

gβ1 ...β n ( x ) = (−ix1 ) β1 (−ix2 ) β2 . . . (−ixn ) β n f ( x ) (4.48)

soit elle aussi intégrable. Alors sa transformée de Fourier fˆ admet en tout point des dérivée
partielles ∂ 1β1 . . . ∂ βn fˆ continues, qui ne sont autres que les transformées de Fourier des
β βn

∂k1 ∂k n
fonctionse g β1 ...β n :
∂ β1 ∂ βn ˆ
. . . f = F gβ1 ...β n . (4.49)
∂k1 β1 ∂k n β n

4.3.5 Passage à L2 (Rn )

La construction de la transformation de Fourier multidimensionnelle se fait comme dans le cas uni-


dimensionnel : on construit tout d’abord la transformation de Fourier sur un sous-espace dense de
L2 (Rn ) (par exemple, la version n-dimensionnelle S(Rn ) de l’espace de Schwartz, puis on utilise la
densité de ce dernier pour étendre le résultat à L2 (Rn ). Le résultat est similaire, et est résumé dans le
théorème suivant :

87
4 Intégrales de Fourier

T H ÉOR ÈME 4.9 Soit f ∈ L2 (Rn ). Alors la fonction fˆ : k ∈ Rn → fˆ(k ), définie par
Z
fˆ(k ) = (2π )−n/2 lim f ( x )e−ik.x dx (4.50)
ρ→∞ | x |≤ρ

est de carré intégrable également. Plus précisément, l’application f ∈ L2 (Rn ) → fˆ ∈ L2 (Rn )


est bijective, et on a la formule de Plancherel :
Z Z
| fˆ(k)|2 dk = | f ( x )|2 dx . (4.51)
Rn Rn

Le produit de convolution en dimension n est une généralisation directe du produit de convolution


unidimensionnel : Z
( f ? g)( x ) = f (y) g( x − y) dy , (4.52)
Rn
quand cette intégrale est convergente. Le théorème convolution-produit prend cette fois la forme

P ROPOSITION 4.10 (C ONVOLUTION -P RODUIT DANS L2 (Rn ) ) Si f , g ∈ L2 (Rn ), alors


 
( f ? g) = (2π ) n/2
F fˆĝ , (4.53)

et  
F ( f g) = (2π )−n/2 fˆ ? ĝ . (4.54)

R EMARQUE 4.4 Notons au passage que si f , g ∈ L2 (Rn ), alors il en va de même pour leur trans-
formée de Fourier fˆ et ĝ. On sait de plus, d’après Cauchy-Schwarz,
  que f g ∈ L1 (Rn ) et fˆĝ ∈ L1 (Rn ).
Donc, d’après le théorème de Rieman-Lebesgue, F fˆĝ et F ( f g) sont des fonctions continues.
Comme le produit de convolution de deux fonctions de carré intégrable définit également une fonc-
tion continue, les deux égalités de la Proposition 4.10 sont des égalités entre fonctions continues,
valables point par point.

88
4.3 Transformation de Fourier des fonctions de plusieurs variables

F ORMULAIRE

On rappelle les définitions de la transformation de Fourier F et de la transformation de Fourier


conjuguée F . Z ∞
ˆf (ω ) = [F f ](ω ) = √1 f (t) e−iωt dt .
2π −∞
Z ∞
1
ϕ̌(t) = [F ϕ](t) = √ ϕ(s) eist ds .
2π −∞

Quelques propriétés utiles sont listées dans la TABLE 4.1 ci-dessous. Les conditions d’application de
ces résultats sont également indiquées. Les propriétés sont pour la plupart énoncées dans le cas de
fonctions intégrables, mais restent valides dans d’autres cadres.

h(t) ĥ(ω ) hypothèse, commentaire

f (t)eiλt fˆ(ω − λ) λ∈R

f (t − b) e−iωb fˆ(ω ) b∈R

t
a fˆ( aω ) a ∈ R∗

f a

f 0 (t) iω fˆ(ω ) si f 0 ∈ L1 (R)

f (m) (t ) (iω )m fˆ(ω ) si f (m) ∈ L1 (R)

(−it)k f (t) fˆ(k) (ω ) si t → tk f (t) est intégrable


( f ∗ g)(t) 2π fˆ(ω ) ĝ(ω ) Voir Propositions 4.4 et 4.7

f (t) g(t) √1 ( fˆ ∗ ĝ )(ω ) Voir Propositions 4.4 et 4.7


TAB . 4.1: Propriétés utiles de la transformation de Fourier unidimensionnelle

En dimension n, les applications F et F sont définis par


Z
fˆ(k ) = [F f ](k ) = (2π )−n/2 f ( x )e−ik.x dx ,
Rn

et Z
ϕ̌( x ) = [F ϕ]( x ) = (2π )−n/2 ϕ(k)eik.x dk ,
Rn
L’analogue de la table précédente en dimension quelconque est donnée dans la TABLE 4.2.

89
4 Intégrales de Fourier

h( x ) ĥ(k) hypothèse, commentaire

f ( x )eik0 .x fˆ(k − k0 ) k 0 ∈ Rn

f ( x − x0 ) e−ik.x0 fˆ(k) x 0 ∈ Rn

x
f a an fˆ( ak) a ∈ R∗

f ( Ax ) | A|−1 fˆ(t ( A−1 )k) A matrice n × n, non singulière

∂f ∂f
∂ x` (x) ik ` fˆ(k) si ∂ x` ∈ L1 (R)

∂αn ∂αn
∂ α1
α ... ∂αxnn
f (ik1 )α1 . . . (ik n )αn fˆ(k) si ∂ α1
α ... ∂αxnn
f ∈ L1 (Rn )
∂ x11 ∂ x11

∂αn
(−ix1 )α1 . . . (−ixn )αn f ( x ) ∂ α1
α ... ∂αxnn
fˆ(k) si x → ( x1 )α1 . . . ( xn )αn f ( x ) est L1
∂ x11

( f ∗ g)( x ) (2π )n/2 fˆ(k) ĝ(k) Voir Propositions 4.8 et 4.10

f ( x ) g( x ) (2π )−n/2 ( fˆ ∗ ĝ)(ω ) Voir Propositions 4.8 et 4.10

TAB . 4.2: Propriétés utiles de la transformation de Fourier multidimensionnelle

90
C HAPITRE

5 La transformation de
Laplace

La transformation de Laplace (TL) apparaı̂t comme une extension de la transformation de Fourier


des fonctions. Cette dernière est parfois difficile à manipuler dans le cas de certaines fonctions ne
possédant pas de transformée de Fourier bornée ; on a maintenant tendance à résoudre ce problème
en utilisant la théorie des distributions. Cependant, la transformation de Laplace fournit une alterna-
tive relativement simple.
La transformation de Laplace permet de s’abstraire simplement de ce problème dans de nombreuses
situations. Elle est couramment utilisée dans certains domaines comme le traitement du signal, ou les
équations différentielles. Dans les deux cas, on utilise sa propriété essentielle, qui est de transformer
les dérivations en multiplications par une variable complexe.
La transformation de Laplace existe en deux versions : la TL unilatérale, adaptée à des fonctions
définies sur le demi-axe positif, et la TL bilatérale, définie sur R. On se limitera ici à la TL unilatérale.

5.1 Définition et premières propriétés


Il est utile d’introduire à ce point la notion de fonction localement intégrable.

D ÉFINITION 5.1 On dit qu’une fonction f est localement intégrable sur R (resp. R+ ) si elle
est intégrable sur tout intervalle borné I de R (resp. R+ ) : on écrit alors f ∈ L1loc (R) (resp.
f ∈ L1loc (R+ )).

D ÉFINITION 5.2 (T RANSFORMATION DE L APLACE ) La transformée de Laplace d’une fonc-


tion f ∈ L1loc (R+ ) est la fonction p ∈ C → F ( p) = (L f )( p) d’une variable complexe p, définie
par Z ∞
F ( p) = (L f )( p) = f (t)e− pt dt , (5.1)
0
quand cette intégrale converge.

La variable p = γ + iω est une variable complexe. Le domaine des valeurs de p pour lesquelles cette
intégrale est convergente pose déjà quelques problèmes. Deux remarques importantes sont à faire.
1. L’intégrabilité de e− pt f (t) ne dépend pas de p lui même, mais seulement de sa partie réelle
γ = <( p).

91
5 La transformation de Laplace

2. Si pour un certain γ0 , la fonction t → e−γ0 t f (t) est absolument intégrable, alors t → e−γt f (t) est
elle aussi absolument intégrable pour tout γ ≥ γ0 .
Ceci nous conduit au résultat suivant :

T H ÉOR ÈME 5.1 Soit f ∈ L1loc (R+ ). Il existe un s ∈ R tel que pour tout p ∈ C, <( p) > s,
F ( p) existe (c’est à dire que l’intégrale dans l’équation (5.1) est convergente). Si <( p) = s, on ne
peut pas conclure dans le cas général.

D ÉFINITION 5.3 Le nombre s défini ci-dessus est appelé abscisse d’intégrabilité (ou abscisse de
sommabilité) de F.

Il est utile de considérer quelques exemples.


1. f (t) = Θ(t) (la fonction de Heaviside) ; alors F ( p) est bien définie pour <( p) > 0 : l’intégrale
est convergente (par contre, l’intégrale n’est pas absolument convergente pour <( p) < 0). Donc
s = 0 ; et si <( p) > 0, on a Z ∞
1
F ( p) = e− pt dt = .
0 p
Notons que la fonction p ∈ C → 1/p est bien définie pour tout p ∈ C∗ ; cependant, elle n’est la
transformée de Laplace de la fonction Θ que dans le demi-plan R+ × R, domaine de définition
de cette dernière.
2. f (t) = tn Θ(t) : de nouveau, s = 0. Si <( p) > 0, on a
Z ∞
n!
F ( p) = tn e− pt dt = .
0 p n +1
3. f (t) = eλt , où λ ∈ R. L’intégrale définissant F ( p) est convergente dès que <( p) > λ. Donc
s = λ, et si <( p) > s, on voit immédiatement que
1
F ( p) = .
p−λ
2
4. f (t) = e−t ; alors l’intégrale définissant F ( p) est convergente quel que soit p ∈ C, et par
conséquent s = −∞.
2
5. f (t) = et ; alors l’intégrale définissant F ( p) n’est jamais convergente, et donc s = ∞.
Plus généralement, on utilise souvent des critères simples qui assurentl’existence de la transformée
de Laplace.

D ÉFINITION 5.4 Soit f : R+ → C.


1. f est à croissance lente si il existe deux constantes A ∈ R+ et m ∈ N telles que pour tout
t ∈ R+ , on ait
| f (t)| ≤ A|t|m . (5.2)

2. f est à croissance au plus exponentielle si il existe deux constantes réelles A > 0 et a telles
que pour tout t on ait
| f (t)| ≤ Ae−at . (5.3)

92
5.2 Propriétés élémentaires

P ROPOSITION 5.1 Soit f ∈ L1loc (R+ ).


1. Si f est à croissance lente et vérifie (5.2), alors l’abscisse d’intégrabilité s de sa transformée
de Laplace vérifie s ≤ 0.
2. Si f est à croissance au plus exponentielle et vérifie (5.3), alors l’abscisse d’intégrabilité s de
sa transformée de Laplace est tel que s ≤ a.

Preuve : La preuve est immédiate dans les deux cas. Dans le premier cas il suffit d’insérer l’estima-
tion (5.2) dans la définition de la transformée de Laplace, et de voir que
Z ∞
| F ( p)| ≤ A tm e pt dt ,
0

qui converge dès que <( p) > 0, car l’exponentielle l’emporte alors sur tm . La preuve dans le second
cas est identique. ♠
Les hypothèses faites dans cette dernière proposition sont suffisamment générales pour couvrir un
grand nombre de cas d’intérêt.

5.2 Propriétés élémentaires


La transformation de Laplace possède un certain nombre de propriétés simples, conséquences di-
rectes de la définition. Nous donnons ci-dessous les plus simples.
1. Linéarité : Si f , g ∈ L1loc (R+ ) ont pour transformées de Laplace respectives F ( p) et G ( p), et
abscisses d’intégrabilité s f et s g , soit h la fonction définie par h(t) = f (t) + g(t). Alors sh =
max(s f , s g ) si s f 6= s g , et sh ≤ s f si s f = s g . De plus, si p → H ( p) est la TL de h, alors H ( p) =
F ( p ) + G ( p ).
2. Translation : Soit f ∈ L1loc (R+ ), d’abscisse d’intégrabilité s f , et soit g définie par g(t) = f (t − b),
où b ∈ R+ . Alors g ∈ L1loc (R+ ) a pour abscisse d’intégrabilité s g = s f , et sa transformée de
Laplace est donnée par
G ( p) = e−bp F ( p) , <( p) > s g .
3. Modulation : Soit f ∈ L1loc (R+ ), d’abscisse d’intégrabilité s f , et soit g définie par g(t) = e at f (t),
où a ∈ C. Alors g ∈ L1loc (R+ ) a pour abscisse d’intégrabilité s g = s f + <( a), et sa transformée
de Laplace est donnée par
G ( p) = F ( p − a) , <( p) > s g .
4. Lien avec la transformation de Fourier : Soit f ∈ L1loc (R+ ), d’abscisse d’intégrabilité s et soit F
sa transformée de Laplace. Pour tout γ ∈ R, γ > s, soit f γ (t) = f (t)e−γt . Alors, on a pour
p = γ + iω, γ > s : Z ∞ √
F (γ + iω ) = f γ (t)e−iωt dt = 2π fbγ (ω ) .
0
Cette dernière propriété va jouer un rôle important dans le problème d’inversion de la transfor-
mation de Laplace.

5.3 La convolution finie


Etant données deux fonctions f , g définies et localement intégrables sur R+ , on définit naturellement
leur produit de convolution par
Z t
( f ∗ g)(t) = f (τ ) g(t − τ )dτ . (5.4)
0

93
5 La transformation de Laplace

Il est facile de vérifier que si f , g ∈ L1loc (R+ ), alors f ∗ g ∈ L1loc (R+ ) aussi, de sorte que l’on peut
s’intéresser à sa transformée de Laplace.

P ROPOSITION 5.2 Soient f , g ∈ L1loc (R+ ), d’abscisses d’intégrabilité respectifs s f et s g . Soit


h = f ∗ g. Alors la transformée de Laplace de h est donnée par

H ( p) = F ( p) G ( p) , <( p) > sh , (5.5)

et est bien définie pour <( p) > max(s f , s g ).

Preuve : Il suffit de considérer


Z ∞Z t Z ∞Z t
f (s) g(t − s) ds e− pt dt = f (s)e− ps g(t − s)e− p(t−s) ds dt .
0 0 0 0

Un changement de variables u = t − s, suivi du lemme de Fubini, permet d’obtenir (5.5), à condition


que F ( p) et G ( p) soient bien définies, ce qui est assuré dès que <( p) > max(s f , s g ). Ceci conclut la
preuve. ♠
Ce résultat trouvera son intérêt quand on considèrera la transformation de Laplace inverse. Cette
propriété est aussi utile pour évaluer certaines intégrales, comme le montre l’exemple suivant.
E XEMPLE 5.1 On peut montrer p que la transformée de Laplace de la fonction de Bessel t → J0 (t) est
la fonction p → F ( p) = 1/ p2 + 1, définie pour <( p) > 0. Donc, F ( p)2 = 1/(1 + p2 ), qui n’est
autre que la transformée de Laplace de la fonction t → sin t. Par conséquent (cela découle en fait de
l’inversibilité de la transformation de Laplace que nous allons voir plus loin), on en déduit
Z t
J0 (s) J0 (t − s) ds = sin t .
0

5.4 Propriétés de régularité


5.4.1 La transformée de Laplace est holomorphe
L’un des intérêts de la transformation de Laplace est que dans le domaine où elle est définie, elle
est holomorphe. Ceci permet alors d’utiliser des techniques d’intégration dans le plan complexe, en
particulier pour le calcul de la transformation de Laplace inverse que nous allons voir plus bas.
Plus précisément, on a le résultat suivant :

T H ÉOR ÈME 5.2 Soit f ∈ L1loc (R+ ), et soit s l’abscisse d’intégrabilité de sa transformée de La-
place F = L f . Alors, F est holomorphe dans le domaine

D = { p ∈ C, <( p) > s} . (5.6)

Pour tout entier positif m, la dérivée m-ième de F est donnée par


Z ∞
F (m) ( p ) = (−t)m f (t)e− pt dt . (5.7)
0

Ainsi, la dérivée de la transformée de Laplace d’une fonction t → f (t) n’est autre que la transformée
de Laplace de la fonction t → −t f (t). On verra plus loin l’utilité de cette remarque pour le calcul de
transformées de Laplace inverses.

94
5.4 Propriétés de régularité

Preuve : Commençons par étudier l’abscisse d’intégrabilité de la fonction t → tm f (t), noté s0 . Pour
t ≥ 1, on a | f (t)e− pt | ≤ tm | f (t)e− pt |. Donc l’intégrabilité de t → tm | f (t)e− pt | dans [1, ∞[ implique
l’intégrabilité de t → | f (t)e− pt | dans [1, ∞[, et donc dans [0, ∞[. Par conséquent, on a s0 ≥ s.
Inversement, pour tout e > 0, on peut toujours trouver t0 ≥ 0 tel que pour tout t ≥ t0 , on ait
tm | f (t)e− pt | ≤ | f (t)e−( p−e)t |. L’argument précédent montre donc que pour tout e > 0, on a s0 ≤ s + e.
Par conséquent, s0 = s.
On peut donc dériver sous le signe somme, et on obtient bel et bien l’expression voulue. L’holomor-
phie est donnée par le case m = 1. ♠

E XEMPLE 5.2 Reprenons le cas particulier de la fonction

f (t) = cos(λt) .

Cette fonction n’admet pas de transformée de Fourier dans le sens usuel (la théorie des distributions
permet d’en définir une), mais possède une transformée de Laplace. Un calcul explicite donne
Z ∞  
1 −( p−iλ)t −( p+iλ)t
 1 1 1 p
F ( p) = e +e dt = + = ,
2 0 2 p − iλ p + iλ p2 + λ2

à condition de se limiter à p > 0 (c’est à dire que l’on a s = 0). La fonction que l’on obtient est bien
holomorphe dans le demi-plan (ouvert) R+ + iR. Par contre, noter les deux pôles en p = ±iλ.

R EMARQUE 5.1 L’exemple précédent est aussi intéressant pour la raison suivante. La fonction p →
p/( p2 + λ2 ) est en fait bien définie dès que p 6= ±iλ. Cependant, cette fonction n’est transformée de
Laplace de t → cos λt que dans le domaine ouvert R+ + iR (la TL n’étant pas définie ailleurs). Dans
le reste du plan complexe (privé de ±iλ bien sûr), elle n’est que le prolongement analytique de la TL
du cosinus.

C OROLLAIRE 5.1 La transformée de Laplace d’une fonction f ∈ Ł1loc (R+ ) est analytique dans
son domaine de définition : ∀ p0 ∈ C, <( p0 > s f , le développement en série entière de F autour
de 0

F ( p) = ∑ a n ( p − p0 ) n
n =0

converge pour tout p tel que <( p) > s f .

5.4.2 Transformation de Laplace et dérivation

Nous avons déjà vu que la transformation de Fourier se comporte de façon remarquable vis à vis
des opérateurs différentiels (ce qui était d’ailleurs le point de départ du travail de J. Fourier). La
transformation de Laplace possède des propriéés similaires, à une petite différence près, qui vient du
fait que l’on ne travaille que sur le demi axe réel positif1 : les valeurs de f et ses dérivées à l’origine
interviennent, comme conséquence d’intégrations par parties successives. Pour cela, il faut que ces
valeurs soient définies, ce qui suppose des hypothèses de régularité sur la fonction étudiée.
1 Nous verrons que la TL bilatérale est plus simple à cet égard.

95
5 La transformation de Laplace

P ROPOSITION 5.3 Soit f ∈ L1loc (R+ ), telle que toutes ses dérivées f (k) d’ordre k < m soient
continues et localement intégrables. Supposons de plus qu’il existe deux constantes a ∈ R et
t0 > 0 telles que pour tout j = 0, 1, . . . m − 1 et t ≥ t0 , on ait

| f ( j) (t)| ≤ A j e at (5.8)

pour une certaine constante A j . Alors pour tout p ∈ C, <( p) > a, la transformée de Laplace de
la dérivée d’ordre m de f est donnée par

[L f (m) ]( p) = pm F ( p) − pm−1 f (0) − pm−2 f 0 (0) − pm−3 f 00 (0) − · · · − f (m−1) (0) . (5.9)

Preuve : Commençons par le cas m = 1. Il suffit de calculer, pour <( p) > a,


Z ∞
0
[L f ]( p) = f 0 (t)e− pt dt
0
∞ Z ∞
f (t)e− pt f 0 (t)e− pt dt

= 0
+p
0
= pF ( p) − f (0) .

La disparition du terme tout intégré évalué en t = ∞ résulte de (5.8), et du fait que <( p) > a. Pour m
quelconque, il suffit d’itérer comme suit

[L f (m) ]( p) = p[L f (m−1) ]( p) − f (m−1) (0) ,

qui donne (5.9) par récurrence. Ceci conclut la preuve. ♠


Cette dernière propriété est souvent utilisée pour la résolution d’équations différentielles ou d’équations
aux dérivées partielles.
E XEMPLE 5.3 Prenons l’exemple de l’équation de Poisson

∆u = f , (5.10)

où f est un second membre fixé, et ∆ = d2 /dx2 est le Laplacien unidimensionnel. Pour obtenir une
solution unique, on sait qu’il est nécessaire de faire des hypothèses supplémentaires, et d’adjoindre
à cette équation deux conditions additionnelles. On suppose donc que u, u0 et f satisfont la condi-
tion (5.8) (il est possible de démontrer dans un cadre plus général l’existence de solutions satisfaisant
à de telles conditions), et que f et f 0 sont continues. Supposons aussi par exemple que

u (0) = u0 , u 0 (0) = v0 ,

où u0 et v0 sont deux nombres fixés. On note U la transformée de Laplace de u, et F la transformée


de Laplace de f . Les hypothèses faites assurent l’existence (et l’analyticité) de F dans un domaine
{ p ∈ C, <( p) > su }, avec su < ∞. on se ramène alors à

p2 U ( p) − pu0 − v0 = F ( p) ,

soit encore, pour p 6= 0,


F ( p ) + v0 u0
U ( p) = 2
+ ,
p p
dans un domaine de valeurs de p bien choisi : la fonction U ainsi obtenue est analytique dans le
domaine { p ∈ C, <( p) > max(s f , 0)}. Cette équation permet d’obtenir une solution u à partir de f ,
par transformation de Laplace inverse (que nous verrons plus loin).

96
5.5 Inversion de la transformation de Laplace

On peut toutefois utiliser ce que l’on sait déjà, c’est à dire les propriétés de linéarité de la transfor-
mation de Laplace, sa relation avec le produit de convolution ainsi que les quelques transformées de
Laplace déjà vues.
Ainsi, on sait que l’oiginal de Laplace de la fonction p → 1/p est la fonction de Heaviside Θ, et que
l’original de Laplace de p → 1/p2 est la fonction t → tΘ(t). Par ailleurs, l’original de Laplace de la
fonction p → F ( p)/p2 est le produit de convolution de f par la fonction t → tΘ(t). On en déduit
donc  Z t 
u ( t ) = Θ ( t ) u0 + v0 t + s f (t − s) ds .
0

5.4.3 Transformation de Laplace et intégration

P ROPOSITION 5.4 Soit f ∈ L1loc (R+ ), telle qu’il existe des constantes t0 ≥ 0, a ∈ R et A > 0
vérifiant, pour tout t ≥ t0
| f (t)| ≤ Ae at . (5.11)
Soit g la fonction définie par
Z t
g(t) = f (u)du . (5.12)
0

Alors, pour <( p) > a, la transformée de Laplace de g est donnée par

1
G ( p) = F ( p) . (5.13)
p

Preuve : Il résulte des hypothèses que l’abscisse d’intégrabilité s de f est tel que s ≤ a. Comme f ∈
L1loc (R+ ), g est continue et dérivable, et on a aussi, pour tout t ≥ t0 ,
| g(t)| ≤ A0 e at ,
pour une certaine constante positive A. Il suffit alors d’appliquer le théorème précédent, qui donne
F ( p) = pG ( p) − g(0) = pG ( p) ,
et ceci prouve la proposition. ♠

5.5 Inversion de la transformation de Laplace


Contrairement à la transformation de Fourier, la transformation de Laplace ne permet pas de décomposer
une fonction en une superposition de “fonctions élémentaires” (sinus et cosinus). Cependant, la trans-
formation de Laplace inverse a une expression simple, et facilement calculable dans bon nombre de
cas.
Une première approche possible consiste à utiliser certaines expressions connues pour les trans-
formées de Laplace de certaines fonctions élémentaires, comme on va le voir dans l’exemple suivant.

E XEMPLE 5.4 Considérons la fonction f dont la transformée de Laplace est donnée par
b
F ( p) = , <( p) > a ,
( p − a )2 + b2
où a et b sont des nombres réels, b 6= 0. Une décomposition en éléments simples de F donne
 
1 1 1
F ( p) = − ,
2 p − ( a + ib) p − ( a − ib)

97
5 La transformation de Laplace

F IG . 5.1: Contour d’intégration. Le contour complet est noté CR , et le demi-cercle de rayon R est Γ R .
Les deux pôles sont indiqués par des croix (+).

et ces deux termes sont transformées de Laplace de fonctions connues. On en déduit donc directement
1  (a+ib)t 
f (t) = e − e(a−ib)t = e at sin(bt) .
2

T H ÉOR ÈME 5.3 Soit f ∈ L1loc (R+ ), d’abscisse d’intégrabilité s, et soit F ( p) sa transformée
de Laplace, définie pour <( p) > s. Pour tout γ ∈ R, γ > s on définit la fonction gγ par
gγ ∈ L1 (R), on a
gγ (t) = f (t)e−γt . Alors, si c
Z γ+i∞
1
f (t) = F ( p)e pt dp . (5.14)
2iπ γ−i∞

Preuve : Le résultat est une conséquence de la relation entre transformation de Laplace et transforma-
tion de Fourier. Soit γ ∈ R, γ > s, et soit p = γ + iω. Si cgγ ∈ L1 (R), alors on a
Z ∞ Z ∞
1 1
gγ ( t ) = √ gγ (ω ) eiωt dt =
c F (γ + iω ) dω .
2π −∞ 2π −∞

En utilisant l’holomorphie de F dans le domaine p ∈ C, <( p) > s et la relation entre f et gγ , on a bien


Z ∞ Z γ+i∞
1 γ+iωt 1
f (t) = F (γ + iω )e dω = F ( p)e pt dp ,
2π −∞ 2iπ γ−i∞

ce qui est le résultat désiré. ♠


Par conséquent, on fait généralement appel à la formule des résidus pour évaluer une transformée de
Laplace inverse.
R EMARQUE 5.2 Il est important de signaler que le choix de γ est crucial. γ doit obligatoirement être
choisi dans le demi-plan où la transformée de Laplace est holomorphe. Un autre choix conduit im-
manquablement à un résultat erroné.
E XEMPLE 5.4 ( SUITE ) Reprenons l’exemple de la fonction f dont la transformée de Laplace est donnée
par
b
F ( p) = , <( p) > a ,
( p − a )2 + b2
où a et b sont des nombres réels, b 6= 0. F a 2 pôles simples en a + ib et a − ib. On choisit un contour
d’intégration comme donné sur la F IGURE 5.1, où CR = [γ − iR, γ + iR] ∪ Γ R . Il est clair que pour

98
5.5 Inversion de la transformation de Laplace

<( p) < a, on a lim| p|→∞ ( p − a) F ( p)e pt = 0 (car t > 0), de sorte que l’intégrale sur Γ R tend vers 0
quand R → ∞ (on peut aussi utiliser le critère de Carslaw et Jaeger ci-dessous dans ce cas). On peut
donc écrire
1
Z
f (t) = lim F ( p)e pt dt
R→∞ 2iπ CR
= (Res( a + ib) + Res( a − ib))
1  (a+ib)t 
= e − e(a−ib)t
2i
= e at sin(bt) .

Dans ce type de problème, l’intégrale sur l’arc de cercle Γ R tend vers 0 lorsque R → ∞. On peut
soit vérifier ceci directement, soit invoquer des conditions suffisantes sur la transformée de Laplace
F assurant que cette intégrale tend réellement vers 0. On peut souvent utiliser pour cela le Lemme
de Jordan. Une condition adaptée à la transformation de Laplace a aussi été donnée par Carslaw et
Jaeger :

L EMME 5.1 (C ARSLAW ET J AEGER ) Si il existe des constantes positives C > 0, R0 > 0 et
k > 0 telles que pour p appartenant au demi plan <( p) < a et | p| > R0 , on ait

| F ( p)| < C | p|−k

Alors l’intégrale sur le contour Γ R tend vers 0 quand R → ∞.

E XEMPLE 5.5 Considérons un problème de conduction de chaleur dans un solide unidimensionnel


semi-infini (x > 0), dont la température initiale est nulle, et dont l’extrémité x = 0 est maintenue à
une température constante T0 > 0. Ce système est schématisé en Fig. 5.2 ci dessous.

F IG . 5.2: Le milieu semi-infini

L’évolution spatio-temporelle de ce champ u( x, t) est régie par l’équation de la chaleur

∂u ∂2 u
( x, t) = α 2 ( x, t) , (5.15)
∂t ∂x
que l’on complète par les conditions initiales et aux limites

u(0, t) = T0 ∀t ≥ 0 (5.16)
u( x, 0) = 0 ∀ x > 0 . (5.17)

99
5 La transformation de Laplace

F IG . 5.3: Contour d’intégration pour le calcul de la solution de l’équation de la chaleur à partir de sa


transformée de Laplace. Le contour complet est noté CR , et le demi-cercle de rayon R est Γ R .

On suppose que u est une fonction continue de la variable t, et que les fonctions u, ∂u/∂t sont bornées
(donc satisfont la condition (5.8)), ce qui nous assure de pouvoir utiliser les résultats de la Proposi-
tion 5.3. Par transformation de Laplace (par rapport à la variable t), en notant
Z ∞
U ( x, p) = u( x, t)e− pt dt , (5.18)
0

on se ramène à l’équation
∂2 U
pU ( x, p) = α ( x, p) , (5.19)
∂x2
dont la solution générale est de la forme
√ √
U ( x, p) = C1 ( p)e− x p/α
+ C2 ( p)e x p/α
.

Si l’on impose à la solution d’être bornée quand x → ∞, on a nécessairement C2 ( p) = 0 ∀ p. Donc


Z ∞
T0
C1 ( p) = U ( p, 0) = T0 e− pt dt = .
0 p

Donc,
T0 − x√ p/α
U ( x, p) = e , (5.20)
p
et le problème sera résolu dès que l’on aura l’original de Laplace de cette fonction, qui est holomorphe
dans le demi plan ouvert <( p) > 0. Soit donc γ ∈ R+ , et considérons l’intégrale
Z γ+i∞ √
1 dp
Ia ( t ) = e− a p pt
e . (5.21)
2iπ γ−i∞ p

La présence du terme p nous oblige à faire un choix de détermination pour la racine carrée. On
introduit donc une coupure, par exemple sur le demi axe réel négatif R− .
Considérons le contour Γ R (voir F IG . 5.3). L’intégrand étant holomorphe à l’intérieur de Γ R , l’intégrale
sur Γ R est nulle, de sorte que l’on peut écrire
A Z B Z C Z D Z E
Z
1
Ia (t) = lim + + + + ,
R→∞;e→0 2iπ B C D E F

et il faut maintenant évaluer chacun des termes.

100
5.6 La transformation de Laplace bilatérale

– A la limite e → 0, l’intégrale sur le cercle (CD ) s’évalue grâce à la méthode des résidus (pôle en 0),
et on obtient
Z C √ √
dp
e−a p e pt = 2iπRes0 (e−a p e pt ) = 2iπ .
D p

– Pour l’intégrale sur le segment (CB), on pose p = ueiπ , avec u > 0. On a alors
Z B √ Z ∞ √
dp du
lim e− a p pt
e = e−ia u −ut
e .
R→∞;e→0 C p 0 u

– Pour l’intégrale sur le segment ( DE), on doit poser p = ue−iπ , avec u > 0. On a alors
Z D √ Z ∞ √
dp du
lim e− a p pt
e =− eia u −ut
e .
R→∞;e→0 E p 0 u

– Reste à se charger de la contribution des arcs de cercle, à la limite R → ∞. On applique ici le critère
de Carslaw et √ Jaeger. Sur le quart de cercle supérieur, on pose p = ueiθ , avec θ ∈ [π/2, π ]. On
√ √
a donc p = u(cos(θ/2) + i sin(θ/2)), et <( p) ≥ 0. Sur le quart de cercle inférieur, on pose

p = ueiθ , avec θ ∈ [−π/2, −π ]. On a donc θ/2 ∈ [−π/4, −π/2], et de nouveau <( p) ≥ 0. Par

conséquent, sur l’arc de cercle complet, | exp{− a p}/p| ≤ 1/| p|, et le critère de Carslaw et Jaeger
s’applique. Donc les intégrales sur les deux quarts de cercle ( AB) et (CD ) tendent vers 0 quand
R → ∞.
Mettant ces résultats ensembles, nous avons donc à calculer
Z ∞
1 √ du 2 ∞ −tv2 dv 2
Z
Ia ( t ) = 1 − e−tu sin( a u) = 1− e sin( av) = 1 − Ja ( t ) .
π 0 u π 0 v π

Pour finir, on remarque que


Z ∞ Z ∞ r
d −tv2 1 −tv2

iav −iav
 1 π −a2 /4t
Ja ( t ) = e cos( av) dv = e e +e dv = e ,
da 0 4 −∞ 2 t

de sorte que
Z a r Z a √ Z a/2√t  
1 π −u2 /4t − u2 π a
Ja (t) = J0 + Ju (t) du = e du = π e du = erf √ .
0 2 t 0 0 2 2 t

On en déduit l’intégrale recherchée


 
a
Ia = erfc √ .
2 t
Donc, la solution est finalement  
x
T ( x, t) = T0 erfc √ . (5.22)
2 αt
Quelques graphes de la solution, pour diverses valeurs de t, se trouvent en F IG . 5.4.

5.6 La transformation de Laplace bilatérale


La transformée de Laplace bilatérale s’adresse aux fonctions définies sur la droite réelle, et non plus
sur la demi droite. Le cadre mathématique approprié est le cadre des fonctions localement intégrables
sur l’axe réel L1loc (R).

101
5 La transformation de Laplace

F IG . 5.4: Profils de température en fonction de la variable d’espace x, solutions de l’équation de la


chaleur (α = 1, T0 = 1). Solutions pour des temps t = 0, 01, t = 0, 1, t = 1, t = 5, t = 50 et
t = 5000.

D ÉFINITION 5.5 La transformée de Laplace bilatérale d’une fonction f ∈ L1loc (R) est la fonction
p ∈ C → F ( p) = (L f )( p) d’une variable complexe p, définie par
Z ∞
F ( p) = (L f )( p) = f (t)e− pt dt , (5.23)
−∞

quand cette intégrale converge.

La transformation de Laplace bilatérale possède des propriétés très semblables à celles de la transfor-
mation de Laplace unilatérale. La différence essentielle vient de leurs domaines de définition respec-
tifs.
Supposons que pour deux nombres réels x0 et x1 , avec x0 < x1 la fonction t → e− pt f (t) soit intégrable
pour <( p) = x0 et <( p) = x1 . Alors, on voit immédiatement que cette fonction est également
intégrable pour tout p tel que x0 ≤ <( p) ≤ x1 . En notant s0 et s1 le minimum et le maximum respec-
tivement des valeurs de x0 et x1 telles que la propriété précédente soit vraie, on aboutit au résultat
suivant, qui généralise le cas unilatéral.

T H ÉOR ÈME 5.4 1. Soit f ∈ L1loc (R). Il existe deux nombres réels s1 et s2 tels que l’intégrale
définissant F ( p) soit convergente pour tout p tel que <( p) ∈]s0 , s1 [. Pour <( p) 6∈ [s0 , s1 ],
l’intégrale est divergente, et pour <( p) = s0 ou <( p) = s1 , on ne peut pas conclure dans
le cas général.
2. La fonction p → F ( p) est holomorphe dans le domaine p ∈ C, <( p) ∈]s0 , s1 [.

Les propriétés essentielles de la transformation de Laplace bilatérale sont essentiellement des para-
phrases des propriétés que nous avons vues dans le cas unilatéral. On ne s’étendra pas sur ces pro-

102
5.6 La transformation de Laplace bilatérale

priétés. On insistera plutôt sur deux propriétés importantes, c’est à dire la forme de la transformée de
Laplace d’une dérivée, et la formule d’inversion.

P ROPOSITION 5.5 Soit f ∈ C m−1 (R), telle que sa dérivée m-ième f (m) appartienne à L1loc (R).
Supposons en outre qu’il existe quatre constantes −∞ < tb ≤ t a < ∞ et a < b, et 2m constantes
positives A j , Bj telles que pour tout j = 0, . . . m − 1

| f ( j) (t)| ≤ Bj ebt pour t ≤ tb (5.24)


| f ( j) (t)| ≤ A j e at pour t ≥ ta (5.25)

Alors, pour tout p tel que <( p) ∈] a, b[ on a

(L f (m) )( p) = pm F ( p) . (5.26)

La formule d’inversion quant à elle est comme dans le cas unilatéral une conséquence de la formule
d’inversion de la transformée de Fourier.

T H ÉOR ÈME 5.5 Soit f ∈ C m−1 (R), et soit D f = { p ∈ C, s0 < <( p) < s1 } le domaine de
définition et d’analyticité de sa transformée de Laplace bilatérale F. Alors, en posant p = γ + iω,
si pour tout γ fixé dans ]s0 , s1 [, la transformée de Fourier ĝγ de la fonction gγ : t → f (t)e−γt est
dans L1 (R), alors pour presque tout t ∈ R on a
Z γ+i∞
1
f (t) = F ( p)e pt dp . (5.27)
2iπ γ−i∞

Les transformées de Laplace bilatérales inverses se calculent généralement en utilisant la méthode


des résidus.

103
5 La transformation de Laplace

Formulaire
Quelques propriétés utiles de la transformation de Laplace unilatérale sont listées dans la Table 5.1.
Dans cette table, la fonction f est une fonction localement intégrable sur R+ , et l’abscisse d’intégrabilité
de sa transformée de Laplace est noté s f . Dans certains cas, certaines hypothèses supplémentaires sont
nécessaires pour donner un sens aux propriétés listées.

g(t) G ( p) sg Hypothèse

f (t)e at F ( p − a) s f + <( a) f ∈ L1loc (R)

f (t − b) ebp F ( p) sf f ∈ L1loc (R)

f 0 (t) pF ( p) − f 0 (0) sf f , f 0 ∈ L1loc (R)

m −1
f (m) (t ) pm F ( p)−∑ pm−k−1 f (k)(0) sf f , f 0 , . . . f (m) ∈ L1loc (R)
0

Rt 1
0 f (τ )dτ p F ( p) sf f ∈ L1loc (R)

Rt
0 f 1 ( τ ) f 2 ( t − τ ) dτ F1 ( p) F2 ( p) max(s f1 , s f2 ) f 1 , f 2 ∈ L1loc (R)

TAB . 5.1: Propriétés utiles de la transformation de Laplace unilatérale

104
Troisième partie

Equations différentielles et aux dérivées


partielles

105
C HAPITRE

6
Equations différentielles

Les équations différentielles et les équations aux dérivées partielles constituent une composante fon-
damentale de la physique, dans la mesure où elles sont utiles pour décrire de nombreux systèmes
physiques. On se limitera ici à certaines classes d’équations différentielles qui admettent des solu-
tions relativement simples à obtenir.
Dans le cas de fonctions d’une variable réelle, une équation différentielle d’ordre n d’indéterminée f
est une relation de la forme
F ( x, f ( x ), f 0 ( x ), . . . f (n) ( x )) = 0 , (6.1)

où on a noté f (n) la dérivée n-ième de f :

dn f
f (n) ( x ) = (x) . (6.2)
dx n

Résoudre une équation différentielle revient à trouver toutes ses solution.


Une solution d’une équation différentielle définit dans un repère (généralement choisi orthonormé)
une courbe, appelée courbe intégrale de l’équation. Résoudre l’équation revient donc à déterminer
la courbe intégrale correspondante.
Lorsque l’équation différentielle se met sous la forme

f (n) ( x ) = G ( x, f ( x ), . . . f (n−1) ( x )) ,

on dit qu’elle est sous forme résolue. Lorsque G ne dépend pas explicitement de x, on parle d’équation
différentielle autonome.

Une équation différentielle est généralement complétée de conditions supplémentaires, qui peuvent
garantir l’unicité de la solution. Par exemple, quand une équation différentielle sour forme résolue
est complétée par des conditions initiales (aussi appelées conditions de Cauchy)

f ( x0 ) = f 0 , f 0 ( x0 ) = f 1 , ... f ( n −1) ( x 0 ) = f n −1 ,

pour un certain x0 donné (souvent x0 = 0). Sous des conditions assez peu restrictives sur G, les
conditions de Cauchy garantissent l’existence de solutions locales (c’est à dire au voisinage de x0 ) de
l’équation. Plus précisément, dans le cas n = 1

107
6 Equations différentielles

T H ÉOR ÈME 6.1 (C AUCHY-L IPSCHITZ ) Supposons que pour tout x fixé, G soit telle que

| G ( x, y2 ) − G ( x, y1 )| ≤ K |y2 − y1 | ,

dans un certain voisinage de x0 , pour une certaine constante K (on dit que G est localement
Lipschitzienne en x0 ). Alors il existe une et une seule solution maximale (c’est à dire qui n’est la
restriction d’aucune autre) satisfaisant une condition de Cauchy donnée.

Ce théorème se généralise à des équations d’ordre supérieur (toujours sous forme résolue, avec condi-
tions de Cauchy).
On recourt parfois à des conditions aux bords (par exemple, f ( x0 ) = y0 et f ( x1 ) = y1 pour une
équation du second ordre). De tels problèmes peuvent très bien n’avoir aucune solution ou au contraire
une infinité de solutions.

6.1 Définitions, généralités


6.1.1 Généralités, équations linéaires
La grande majorité des équations différentielles n’admettent pas de solution explicite. Par exemple,
l’équation différentielle
 3 2.5
d f (x)
q
cos( x ) +x 7
f ( x ) = πe− x
dx3
est très probablement difficile à résoudre explicitement. L’une des raisons est que cette équation
différentielle est non-linéaire ; ainsi, étant donnée une solution f , 2 f n’est pas solution.

D ÉFINITION 6.1 1. Une équation différentielle d’ordre n est dite linéaire si elle peut se
mettre sous la forme

a0 ( x ) f ( x ) + a1 ( x ) f 0 ( x ) + a2 ( x ) f 00 ( x ) + · · · + an ( x ) f (n) ( x ) = b( x ) , (6.3)

a0 , a1 , . . . an et b étant des fonctions fixées.


2. Cette équation est homogène si b( x ) = 0 pour tout x.
3. Elle est à coefficients constants si a0 , a1 , . . . an et b sont indépendants de x.

Il est facile de démontrer que des combinaisons linéaires de solutions d’une équation différentielle
linéaire homogène sont toujours solutions de cette équation. En fait, on montre le résultat fondamen-
tal suivant

T H ÉOR ÈME 6.2 L’ensemble des solutions d’une équation différentielle linéaire homogène d’ordre
n est un espace vectoriel de dimension n.

Ainsi, une équation différentielle de ce type est loin d’admettre une unique solution. L’unicité peut
être retrouvée en imposant des conditions supplémentaires. Dans le cas d’une équation d’ordre n,
on a besoin de n équations linéaires supplémentaires pour spécifier une solution unique. Ceci est
généralement effectué en imposant des conditions aux bords, ou conditions aux limites .

108
6.1 Définitions, généralités

Les équations homogènes jouent en fait un rôle fondamental. En effet, considérons une équation
différentielle linéaire inhomogène, comme en (6.3), et soient f 1 et f 2 deux solutions de cette équation.
On voit alors facilement que f 1 − f 2 est solution de l’équation différentielle homogène

a0 ( x ) f ( x ) + a1 ( x ) f 0 ( x ) + a2 ( x ) f 00 ( x ) + · · · + an ( x ) f (n) ( x ) = 0 . (6.4)

Inversement, étant donnée une solution de (6.3), on peut lui ajouter n’importe quelle solution de
l’équation homogène correspondante, le résultat étant toujours solution de (6.3). On a donc montré

P ROPOSITION 6.1 La solution générale d’une équation différentielle linéaire inhomogène peut
toujours s’écrire comme la somme de la solution générale de l’équation homogène correspondante,
et d’une solution particulière de l’équation inhomogène.

On dit que l’ensemble des solutions d’une équation différentielle linéaire inhomogène est un espace
affine.
E XEMPLE 6.1 Considérons l’exemple simple

( x2 + 1)y0 ( x ) + 3xy( x ) = x .

L’équation homogène correspondante s’écrit sous la forme

y0 ( x ) −3x
= 2 ,
y( x ) x +1
et s’intègre facilement, pour donner
3
ln |y( x )| = − ln( x2 + 1) + ln |λ| ,
2
d’où la solution générale de l’équation homogène

y0 ( x ) = λ( x2 + 1)−3/2 .

Par ailleurs, une solution apparente (à défaut d’être évidente) de l’équation inhomogène est donnée
par
1
y p (x) = .
3
On en déduit la solution générale de l’équation inhomogène
1
y( x ) = + λ( x2 + 1)−3/2 .
3
On obtient en fait une famille à un paramètre de solutions.

6.1.2 Equations homogènes à coefficients constants


Les équations différentielles linéaires à coefficients constants se traitent souvent de façon simple.
Prenons le cas d’une équation du second ordre homogène

a f 00 ( x ) + b f 0 ( x ) + c f ( x ) = 0 . (6.5)

En recherchant des solutions sous la forme f ( x ) = eαx , cette équation se transforme en une équation
algébrique
aα2 + bα + c = 0 ,

109
6 Equations différentielles

qui se résout par la méthode des radicaux. Dans ce cas, les racines sont de la forme
1  
α± = −b ± ∆1/2 ,
2a

où ∆ = b2 − 4ac est le discriminant, et où ∆1/2 doit être compris comme i −∆ si ∆ < 0. Supposons
que ∆ 6= 0. Alors on a deux solutions linéairement indépendantes de cette équation :

f ± ( x ) = e α± x ,

qui engendrent bien l’espace vectoriel de dimension 2 des solutions de l’équation. La solution générale
est alors de la forme
f ( x ) = A + e α+ x + A − e α− x ,
les constantes A± étant déterminées par les conditions aux limites.
Le cas limite ∆ = 0 est un peu plus complexe. En effet, il y a dans ce cas une seule racine
b
α0 = −
2a
à l’équation caractéristique, qui ne fournit qu’une seule solution de l’équation homogène

f 0 ( x ) = A 0 e α0 x .

Or on sait d’après le Théorème 6.2 qu’il existe deux solutions linéairement indépendantes de l’équation
de départ (puisqu’elle est du second ordre). On verra un peu plus loin une méthode (basée sur le
Wronskien, permettant d’obtenir une seconde solution. Dans notre cas, cette approche se simplifie,
et revient à rechercher une seconde solution, sous la forme particulière

f 1 ( x ) = u( x ) f 0 ( x ) .

Comme f 0 ( x ) est déjà solution de l’équation homogène (6.5), en insérant la forme particulière de f 1
dans (6.5), on aboutit à une nouvelle équation que doit satisfaire u :

a u00 ( x ) f 0 ( x ) + 2u0 ( x ) f 00 ( x ) + bu0 ( x ) f 0 ( x ) = 0 ,




soit en insérant la forme particulière de f 0 et en simplifiant par eα0 x , on aboutit à la forme parti-
culièrement simple
au00 ( x ) = 0 ,
d’où
u( x ) = λx + µ .
Ainsi, on obtient la solution générale de l’équation (6.5), dans le cas particulier b2 = 4ac,

f ( x ) = (λx + µ)eα0 x ,

6.1.3 Equations homogènes : variation de la constante


La méthode de variation de la constante, ou méthode de Laplace permet de trouver une solution
particulière d’équations inhomogènes, dans les cas où il n’en existe pas d’évidente. L’idée est de se
baser sur la solution générale de l’équation homogène, et de « faire varier les constantes » dans le
sens suivant.
Considérons une équation linéaire d’ordre n comme en (6.3), et supposons que l’on ait déjà obtenu
la solution générale de l’équation homogène (6.4), celle-ci engendrant un espace de dimension n. La
solution générale s’écrit alors comme combinaison linéaire de n « solutions élementaires »

y0 ( x ) = α1 y0,1 ( x ) + α2 y0,2 ( x ) + · · · + αn y0,n ( x ) .

110
6.1 Définitions, généralités

La méthode de Laplace revient à rechercher une solution particulière de (6.3) comme combinaison
des solutions y0,k , avec coefficients variables (d’où l’expression « variation de la constante ») :

y p ( x ) = α1 ( x )y0,1 ( x ) + α2 ( x )y0,2 ( x ) + · · · + αn ( x )y0,n ( x ) .

En insérant cette forme dans l’équation inhomogène (6.3), on aboutit à une nouvelle équations différentielle,
impliquant uniquement les fonctions α1 , . . . αn . Cette unique équation ne suffit (sauf dans le cas n = 1)
pas à caractériser ces fonctions, et il faut la compléter par d’autres.
On ne traitera pas ici le cas général, et on se limitera aux cas n = 1 ou 2.
Dans le cas n = 1, partant d’une équation

f 0 ( x ) + a( x ) f ( x ) = g( x ) , (6.6)

partons d’une solution f 0 de l’équation homogène, et soit f 1 ( x ) = α( x ) f 0 ( x ). Alors, f 10 ( x ) = a( x ) f 00 ( x ) +


a0 ( x ) f 0 ( x ). En insérant cette solution dans l’équation inhomogène, et en utilisant l’équation homogène
pour simplifier l’expression ainsi obtenue, on se ramène à

α0 ( x ) f 0 ( x ) = g( x ) ,

d’où la solution Z x
g(y)
α ( x ) = α ( x0 ) + dy , (6.7)
x0 f 0 (y)
d’où on déduit la solution de l’équation inhomogène. Reprenons l’exemple précédent.
E XEMPLE 6.1 ( SUITE ). Dans ce cas, on recherche une solution sous la forme

y( x ) = α( x )(1 + x2 )−3/2 .

On a alors, compte tenu du fait que y0 est solution de l’équation homogène,

(1 + x2 )y0 ( x ) + 3xy( x ) = α0 ( x )(1 + x2 )−1/2

Imposer que y soit solution de l’équation inhomogène implique que


p
α0 ( x ) = x 1 + x2 ,

d’où Z x p Z x2 √
1 1
α( x ) = λ + t 1 + t2 dt = λ + 1 + u du = λ + (1 + x2 )3/2 ,
0 2 0 3
λ étant une constante d’intégration. Finalement, on obtient bien la solution générale

1
y( x ) = α( x )(1 + x2 )−3/2 = λ(1 + x2 )−3/2 + .
3

Le cas des équations du second ordre est un peu plus complexe, car l’espace vectoriel engendré
par les solutions de l’équation homogène est de dimension 2. On peut alors imposer une condition
supplémentaire sur λ1 et λ2 . On choisit en général

λ10 ( x ) f 1 ( x ) + λ20 ( x ) f 2 ( x ) = 0 ,

arbitraire... mais efficace.


Partons d’une équation de la forme

f 00 ( x ) + a( x ) f 0 ( x ) + b( x ) f ( x ) = g( x ) ,

111
6 Equations différentielles

considérons deux solutions f 1 et f 2 de l’équation homogène, et recherchons une solution de l’équation


inhomogène sous la forme
f ( x ) = λ1 ( x ) f 1 ( x ) + λ2 ( x ) f 2 ( x ) .
On a alors

f 0 ( x ) = λ1 ( x ) f 10 ( x ) + λ10 ( x ) f 1 ( x ) + λ2 ( x ) f 20 ( x ) + λ20 ( x ) f 2 ( x ) = λ1 ( x ) f 10 ( x ) + λ2 ( x ) f 20 ( x ) ,

compte tenu de la condition supplémentaire imposée, et donc

f 00 ( x ) = λ1 ( x ) f 100 ( x ) + λ10 ( x ) f 10 ( x ) + λ2 ( x ) f 200 ( x ) + λ20 ( x ) f 20 ( x ) .

En insérant cela dans l’équation de départ, on aboutit pour tout x au système linéaire d’équations en
(λ10 ( x ), λ20 ( x ))  0
λ1 ( x ) f 10 ( x ) + λ20 ( x ) f 20 ( x ) = g( x )
(6.8)
λ10 ( x ) f 1 ( x ) + λ20 ( x ) f 2 ( x ) = 0 .
Si f 1 et f 2 ne sont pas proportionnelles, le déterminant de ce système, appelé Wronskien,
 
0 0 2 d f2 (x)
W (x) = f1 (x) f2 (x) − f2 (x) f1 (x) = f1 (x)
dx f 1 ( x )

est non nul. Le système (6.8) admet donc une unique solution notée ( L1 ( x ), L2 ( x )), d’où on déduit,
en prenant des primitives
Z Z 
(λ1 ( x ), λ2 ( x )) = L1 ( x )dx, L2 ( x )dx .

Notons que le choix de la constante d’intégration dans ces primitives n’a pas d’importance.
E XEMPLE 6.2 On considère l’équation du second ordre
1
f 00 ( x ) + f 0 ( x ) − 2 f ( x ) = .
cosh( x )
L’équation homogène est à coefficients constants, et se prête donc bien à des solutions sous forme
d’exponentielles. L’équation caractéristique

α2 + α − 2 = 0

admet les deux racines α1 = 1 et α2 = −2, d’où la solution générale de l’équation homogène

f 0 ( x ) = λ1 e x + λ2 e−2x .

On utilise maintenant la variation de la constante. La condition supplémentaire prend ici la forme

λ10 ( x )e x + λ20 ( x )e−2x = 0 ,

d’où on tire
λ20 ( x ) = −λ10 ( x )e3x .
En reportant cela dans l’autre équation, on obtient
1
λ10 ( x ) f 10 ( x ) − e3x f 20 ( x ) =

,
cosh( x )
c’est à dire
2 1
λ10 ( x ) = .
3 e2x + 1

112
6.1 Définitions, généralités

On a donc
2 x dy
Z
λ1 ( x ) = λ1 (0) +
3 0 e2y + 1
Z x
2 e du
= λ1 (0) +
3 1 u ( u2 + 1)
Z x
2 e 1

u
= λ1 (0) + − 2 du
3 1 u u +1
 ex
2 1 2
= λ1 (0) + ln |u| − ln(u + 1)
3 3 1
1
= C1 + ln(1 + e−2x ) ,
3
où C1 est une constante. Un calcul similaire donne
Z ex 2 Z ex  
2 u du 2 1
λ2 ( x ) = λ2 (0) + 2
= λ2 (0) + 1− 2 du
3 1 u +1 3 1 u +1

d’où on déduit
2
λ2 ( x ) = C2 + (Arc tan(e x ) − e x ) ,
3
pour une certaine constante C2 . De là on déduit la solution particulière, puis la solution générale de
l’équation inhomogène.

6.1.4 Facteur intégrant pour les équations linéaires du premier ordre


De façon générale, un facteur intégrant pour une équation différentielle est une fonction telle que la
multiplication terme à terme de l’équation par cette fonction permet d’en simplifier l’intégration. On
se limitera ici aux équations du premier ordre (on rencontrera de nouveau un facteur intégrant en
discutant la théorie de Sturm-Liouville).
Considérons une équation différentielle du premier ordre, sous forme résolue

dy
( x ) = ψ( x, y) .
dx
Dans les cas où ψ ne dépend pas explicitement de y, la solution est de la forme
Z x
y( x ) = C + ψ(z) dz ,
x0

où C = y( x0 ) est une constante. Dans le cas général, il existe une famille de solutions, dépendant d’un
paramètre C, données de façon implicite

Ξ(y, x, C ) = 0 ,

pour une certaine fonction Ξ.


On se limite ici aux équations du pemier ordre linéaires. La forme la plus générale est

y0 ( x ) + a( x )y( x ) = b( x ) , (6.9)

a et b étant des fonctions continues dans un intervalle [ x0 , x1 ], et y0 = y( x0 ) est une condition au bord
donnée.

113
6 Equations différentielles

D ÉFINITION 6.2 Un facteur intégrant pour l’équation (6.9) est une fonction α : x ∈ [ x0 , x1 ] →
α( x ) ∈ C telle que (6.9) puisse s’écrire

d
(α( x )y( x )) = α( x )b( x ) . (6.10)
dx

On peut remarquer que le facteur intégrant est défini à une constante multiplicative près.
Supposant
Rx connu un facteur intégrant α, une solution de (6.9) est alors explicite : α( x )y( x ) = α( x0 )y( x0 ) +
x0
α(u)b(u) du, d’où
Z x
α ( x0 ) y0 1
y( x ) = + α(u)b(u) du . (6.11)
α( x ) α ( x ) x0
Pour utiliser ce résultat, il faut déterminer un facteur intégrant, qui doit donc satisfaire

( x ) = α( x ) a( x ) ,
dx
de sorte que la solution est
x
Z 
α( x ) = α( x0 ) exp a(u) du (6.12)
x0

(on peut fixer la constante multiplicative pour que α( x0 ) = 1).


E XEMPLE 6.3 On considère l’équation différentielle du premier ordre

y0 ( x ) + xy( x ) = x ,

avec la condition y( x0 ) = y0 . On vérifie aisément que le facteur intégrant est de la forme

α( x ) = exp ( x2 − x02 )/2




(donc α( x0 ) = 1), de sorte que la solution s’écrit finalement


 Z x 
2 2 2 2 2 2
y( x ) = e−(x − x0 )/2 y0 + ze(z − x0 )/2 dz = 1 + (y0 − 1)e−(x − x0 )/2 .
x0

6.1.5 Equations du second ordre, Wronskien


Le Wronskien, que nous avons déjà rencontré, permet de construire, à partir d’une solution d’une
équation différentielle linéaire homogène, une seconde solution linéairement indépendante. Le prin-
cipe général est, comme souvent, de rechercher une solution y2 ( x ) sous la forme f ( x )y1 ( x ), où y1 est
la solution déjà connue.

D ÉFINITION 6.3 Soient y1 et y2 deux solutions linéairement indépendantes de l’équation


différentielle linéaire homogène du second ordre

d2 y dy
2
( x ) + α( x ) ( x ) + β( x )y( x ) = 0 .
dx dx
Le Wronskien (ou déterminant de Wronski) de y1 et y2 est la fonction x → W ( x ) définie par

dy2 dy
W ( x ) = y1 ( x ) ( x ) − y2 ( x ) 1 ( x ) . (6.13)
dx dx

114
6.1 Définitions, généralités

Soit donc W le Wronskien, et calculons


W 0 ( x ) = y10 ( x )y20 ( x ) + y1 ( x )y200 ( x ) − y10 ( x )y20 ( x ) − y100 ( x )y2 ( x )
= y1 ( x )y200 ( x ) − y100 ( x )y2 ( x )
= y1 ( x ) −α( x )y20 ( x ) − β( x )y2 ( x ) − y2 ( x ) −α( x )y10 ( x ) − β( x )y1 ( x )
   

= − α ( x )W ( x )
Le Wronskien vérifie l’équation du premier ordre
dW
( x ) = − α ( x )W ( x ) ,
dx
de sorte que sa forme est  Z x 
W ( x ) = W ( x0 ) exp − α(z) dz . (6.14)
x0
Ce résultat est appelé Théorème de Liouville.
R EMARQUE 6.1 Le Wronskien admet une interprétation géométrique simple. Dans l’espace des phases,
c’est à dire l’espace engendré par les vecteurs (y(t), y0 (t)), le Wronskien associé à deux solutions
(y1 , y10 ) et (y2 , y20 ) est l’aire du parallélogramme engendré par ces deux vecteurs du plan (soit le double
de l’aire du triangle). Le théorème de Liouville décrit donc l’évolution temporelle de cette aire. No-
tons en particulier que si α = 0, c’est à dire si l’équation ne contient pas de terme d’amortissement,
cette aire est indépendante du temps.
Le Wronskien permet aussi de construire la solution générale de l’équation différentielle, connaissant
une solution particulière. Supposant connue y1 , on a en effet
y1 ( x )y20 ( x ) − y10 ( x )y2 ( x ) W (x)
= ,
y1 ( x )2 y1 ( x )2
d’où  
d y2 ( x ) W (x)
= .
dx y1 ( x ) y1 ( x )2
On en déduit par intégration
Z x  Z x 
y2 ( x0 ) W (u) W (u)
y2 ( x ) = y1 ( x ) + y1 ( x ) du = y1 ( x ) C1 + C2 du . (6.15)
y1 ( x0 ) x0 y1 ( u )2 x0 y1 ( u )2
Ainsi, connaissant une première solution d’une équation homogène du second ordre, on peut en
déduire une seconde, linéairement indépendante ; il suffit pour cela de calculer au préalable de Wrons-
kien via l’équation (6.14), puis d’utiliser (6.15).
E XEMPLE 6.4 Soit l’équation différentielle
y00 − 2y0 + y = 0 , x∈R.
il est immédiat que la méthode de l’équation caractéristique donne la solution
y1 ( x ) = e x .
Un calcul explicite donne un Wronskien
W ( x ) = e2x ,
d’où on déduit Z x
y2 ( x ) = C1 e x + C2 e x du ,
x0
et donc une seconde solution linéairement indépendante
y2 ( x ) = xe x .

115
6 Equations différentielles

6.2 La méthode de Fröbenius


Une approche classique pour résoudre des équations différentielles, consiste à rechercher des solu-
tions sous forme de séries. Lorsque les équations sont à coefficients réguliers (c’est à dire suffisam-
ment différentiables), les séries à considérer sont des séries entières. Par exemple, pour l’équation

y0 − y = 0 ,

si l’on recherche des solutions sous forme de série entière1 y( x ) = ∑0∞ an x n , on obtient en remplaçant
terme à terme
∞ ∞
∑ nan en−1 − ∑ an xn = 0 ,
1 0

soit par une changement d’indice de sommation



∑ [ a n − ( n + 1 ) a n +1 ] x n , ∀x
0

ce qui implique que tous les termes soient nuls, c’est à dire
an a n −1 a0
a n +1 = = = ··· = .
n+1 ( n + 1) n n!

On en déduit la solution

xn
y ( x ) = a0 ∑ = a0 e x .
0 n!
Dans le cas où les coefficients de l’équation ne sont plus aussi réguliers, cette technique se généralise
comme on va le voir, et porte le nom de méthode de Fröbenius.. Il est nécessaire d’introduire tout
d’abord un peu de terminologie.
On se focalise ici sur le cas des équations linéaires du second ordre, homogènes, que l’on met sous la
forme générique
y00 ( x ) + p( x )y0 ( x ) + q( x )y( x ) = 0 . (6.16)
Les équations inhomogènes se traitent de la façon usuelle, en résolvant tout d’abord l’équation ho-
mogène associée, et en ajoutant à la solution générale de celle-ci une solution particulière de l’équation
inhomogène.

6.2.1 Notion de point singulier, théorème de Fuchs


La méthode de Fröbenius consiste à rechercher des solutions sous forme de série, soit une série
entière, soit une série de Laurent, soit encore une série faisant intervenir des exposants non-entiers.
La différence entre ces deux situations tient aux propriétés de régularité des coefficients (variables)
de l’équation.

D ÉFINITION 6.4 1. Un point x0 est un point ordinaire (ou régulier) pour cette équation
si y00 ( x ) reste fini en x = x0 dès que y0 ( x0 ) et y( x0 ) sont finis. Sinon x0 est dit singulier.
2. Un point singulier à distance finie x0 est régulier pour l’équation si ( x − x0 ) p( x ) et ( x −
x0 )2 q( x ) sont finis en x0 . Dans le cas contraire, le point singulier est dit essentiel.

1 Pourquoi faire simple, quand on peut faire compliqué ?

116
6.2 La méthode de Fröbenius

Rechercher un possible point régulier ou singulier en x0 revient donc à étudier le comportement de p


et q au voisinage de x0 . Un point x0 est régulier si p( x0 ) et q( x0 ) sont finis. Il est singulier inessentiel
si ( x − x0 ) p( x ) et ( x − x0 )2 q( x ) admettent une limite finie lorsque x → x0 .

R EMARQUE 6.2 La définition ci-dessus n’a de sens que pour l’étude des points sur l’axe réel. Pour
étudier le comportement des points à l’infini, il est nécessaire de faire le changement de variable
x 0 = 1/x, et d’étudier le comportement en x 0 → 0.

Les théorèmes de Fuchs donnent des conditions simples et explicites pour l’existence de solutions
d’équations de type (6.16). Considérons tout d’abord les cas où les coefficients sont réguliers. Il est
alors possible de les développer en série entière au voisinage d’un point régulier x0 , et d’en déduire
une solution elle même sous forme de série entière. Plus précisément, on a le résultat suivant.

T H ÉOR ÈME 6.3 On considère l’équation différentielle (6.16), avec conditions y( x0 ) = f 0 et


y0 ( x0 ) = g0 . Alors si les fonctions p et q, considérées comme fonctions d’une variable complexe z,
sont régulières dans un cercle de rayon r0 centré sur x0 dans C, il existe une unique solution de
l’équation développable en série entière autour de x0 et obéissant aux conditions données.

Dans ces conditions, étant donné un point régulier x0 , on peut rechercher des solutions de l’équation
différentielle sous la forme

y( x ) = ∑ a k ( x − x0 ) k .
k =0

Dans le cas plus complexe où les conditions de régularité sur p et q ne sont pas remplies, les solutions
peuvent prendre une forme un peu plus compliquée.
Supposons que x0 soit un point singulier régulier. L’équation différentielle (6.16) conduit à

( x − x0 )2 y00 ( x ) + ( x − x0 ) a( x )y0 ( x ) + b( x )y( x ) = 0 ,

où a( x ) = ( x − x0 ) p( x ) et b( x ) = ( x − x0 )2 q( x ) sont deux fonctions régulières.


Au voisinage de x0 , on approxime cette équation par l’équation approchée

( x − x0 )2 y00 ( x ) + ( x − x0 ) a( x0 )y0 ( x ) + b( x0 )y( x ) = 0 ,

dont les solutions sont de la forme

A1 ( x − x0 )ν1 , A2 ( x − x0 )ν2 ,

où A1 et A2 sont deux constantes d’intégration, et ν1 et ν2 sont les racines de l’équation indicielle

ν(ν − 1) + νa( x0 ) + b( x0 ) = 0 .

Ceci conduit à rechercher des solutions de la forme

y1 ( x ) = ( x − x0 )ν1 f 1 ( x ) , y2 ( x ) = ( x − x0 )ν2 f 2 ( x ) ,

où f 1 et f 2 sont deux fonctions régulières (c’est à dire développables en série entière en x0 )... à l’ex-
ception du cas où ν1 − ν2 est entier, voir ci dessous.
Dans le cas où x0 est un point singulier essentiel, les choses sont encore plus complexes, mais on
montre qu’il est encore possible de trouver des solutions sous forme de série infinie.
Plus précisément, le résultat est le suivant :

117
6 Equations différentielles

T H ÉOR ÈME 6.4 (T H ÉOR ÈME DE F UCHS ) Si x0 est un pôle ou un point singulier essentiel de p
ou q, c’est à dire si p et q peuvent être exprimés sous forme de série de Laurent

p(z) = ∑∞ k

k =−∞ ak ( z − x0 ) (6.17)
∞ k
q(z) = ∑k=−∞ bk (z − x0 ) ,

alors l’équation homogène admet deux solutions linéairement indépendantes, qui au voisinage de
x0 peuvent être représentées comme

f 1 ( x ) = ( x − x0 )ν1 ∑∞ k

k =−∞ ck ( x − x0 ) (6.18)

f 2 ( x ) = ( x − x0 ) 2 ∑k=−∞ dk ( x − x0 )k ,
ν

et dans le cas dégénéré (ν1 − ν2 entier)

f 1 ( x ) = ( x − x0 )ν1 ∑∞ k

k =−∞ ck ( x − x0 ) (6.19)
f 2 ( x ) = ( x − x0 )ν2 ∑∞ k
k =−∞ dk ( x − x0 ) + α f 1 ( x ) ln( x − x0 ) .

R EMARQUE 6.3 Dans le résultat ci-dessus, si le point singulier au voisinage duquel on effectue le
développement est inessentiel, on peut toujours se ramener à une somme sur k ∈ N, par exemple
dans le cas non dégénéré

f 1 ( x ) = ( x − x0 )ν1 ∑∞ k

k =0 c k ( x − x 0 )

f 2 ( x ) = ( x − x 0 ) ∑ k =0 d k ( x − x 0 ) k ,
ν2

Ainsi, étant donnée une équation différentielle linéaire d’ordre deux, homogène, la procédure à suivre
est la suivante :
– Mettre l’équation sous la forme (6.16).
– Analyser les propriétés des fonctions p( x ) et q( x ).
– Si elles sont régulières, on peut rechercher une solution sous forme de série entière.
– Si elles sont singulières en x0 , mais que limx→ x0 ( x − x0 ) p( x ) et limx→ x0 ( x − x0 )2 q( x ) existent, on
peut rechercher une solution sous la forme d’une série ∑∞ k =0 a k ( x − x 0 )
k+ν .

– Dans le cas contraire, il faut rechercher une solution sous la forme d’une série doublement infinie
∑∞ k =−∞ ak ( x − x0 )
k+ν .

Nous allons voir ci-dessous un certain nombre d’exemples.

6.2.2 Un exemple : les fonctions de Bessel


Les fonctions de Bessel apparaissent naturellement dans le cadre de l’étude de l’équation de Helm-
holtz bidimensionnelle exprimée en coordonnées polaires, c’est à dire l’équation aux dérivées par-
tielles
(∆ + k2 )ψ(r, θ ) = 0 , (6.20)
et donnent un premier exemple d’utilisation de la méthode de séparation des variables pour les
équations aux dérivées partielles. En exprimant le Laplacien en coordonnées polaires

∂2 1 ∂ 1 ∂2
∆= + + ,
∂r2 r ∂r r2 ∂θ 2
et en recherchant des solutions à variables séparées

ψ(r, θ ) = R(r )Θ(θ ) , r ∈ R+ , θ ∈ [0, 2π ]

118
6.2 La méthode de Fröbenius

on obtient la forme particulière

r 2 d2 R (r ) r dR(r ) k2 r2 1 d2 Θ ( θ )
+ + = − = p2 ,
R(r ) dr2 R(r ) dr R (r ) Θ(θ ) dθ 2

p étant une constante, a priori complexe (dont on verra qu’elle doit être réelle).
L’équation angulaire se résout facilement, et a pour solution

Θ(θ ) = Aeipθ + Be−ipθ .

Maintenant, notons que nous devons nécessairement avoir

Θ(2π ) = Θ(0) , Θ0 (2π ) = Θ0 (0) ,

ce qui implique A + B = Ae2ipπ + Be2ipπ et ip( A − B) = ip( Ae2ipπ − Be2ipπ ), et donc la restriction
p = n ∈ Z. (notons que si la constante p avait eu une partie imaginaire non nulle, les solutions
auraient été non bornés).
Passons à l’équation radiale

r2 R00 (r ) + rR0 (r ) + (k2 r2 − n2 ) R(r ) = 0 . (6.21)

Elle s’écrit sous la forme simple

p2
   
d dR
r (r ) + k2 r − R (r ) = 0 ,
dr dr r

ou en posant x = kr, et y( x ) = R( x/k )


 
d dy
x ( x ) + x 2 − p2 y ( x ) = 0

x (6.22)
dx dx

Cette équation est appelée équation de Bessel d’ordre p . On se propose de la résoudre maintenant
en utilisant les séries de Fröbenius.
On voit facilement que x = 0 est un point singulier régulier. On peut également montrer l’existence
d’un point singulier essentiel à l’infini. Supposons donc une solution de la forme

y( x ) = ∑ ak x k+ν .
k =0

En insérant cette forme particulière dans l’équation, on obtient


∞ ∞
∑ a k ( k + ν )2 x k + ν + ( x 2 − p2 ) ∑ ak x k+ν = 0 .
k =0 k =0

Le terme de plus bas degré (c’est à dire x ν ) nous donne

a0 ( ν2 − p2 ) = 0 ,

soit a0 = 0 ou ν = ± p. Le terme en x ν+1 donne

a1 ((ν + 1)2 − p2 ) = 0 ,

donc soit a0 = 0 ou ν + 1 = ± p.

119
6 Equations différentielles

Choisissons ν = p, et donc a1 = 0. Le terme générique donne quant à lui


− a k −2 − a k −2
ak = = ,
( k + p )2 − p2 k (k + 2p)
et donc tous les coefficients ak d’indice impair sont nuls. On a donc
a2k−2 (−1)k a0 Γ( p + 1)
a2k = − = 2k ,
4k (k + p) 2 Γ ( k + 1) Γ ( k + p + 1)
où Γ est la fonction Gamma d’Euler, définie par l’inégrale
Z ∞
Γ( x ) = t x −1 e − t , t 6 ∈ Z− , (6.23)
0
et qui vérifie (comme le montre une simple intégration par parties)
Γ( x + 1) = xΓ( x ) , ∀ x 6 ∈ Z− .
On a donc obtenu une solution particulière, qui dépend d’une constante a0 . Si on impose une norma-
lisation de la forme
1
a0 = p ,
2 Γ ( p + 1)
on aboutit à l’expression suivante pour la solution, appelée fonction de Bessel d’ordre p et notée J p

(−1)k  x 2k+ p
Jp (x) = ∑ Γ ( k + 1) Γ ( k + p + 1) 2
. (6.24)
k =0

R EMARQUE 6.4 On a choisi ici le cas p = ν. On peut se convaincre facilement que p = −ν ne donne
pas de nouvelle solution. En effet, on a pour tout x
J− p ( x ) = (−1) p J p ( x ) .
Nous avons aussi fait un autre choix, lorsque nous avons posé a1 = 0, choix qui nous a conduit à une
seule solution (pour p fixé). Or l’espace des solutions est bidimensionnel. Il est facile d’obtenir une
seconde solution en utilisant le Wronskien. Les fonctions correspondantes sont appelées fonctions de
Neumann, et notées Np .
Le Wronskien, défini par
W ( x ) = J p ( x ) Np0 ( x ) − Np ( x ) J p0 ( x ) ,
est donné par Rx
− P(z) dz
W ( x ) = W ( x1 ) e x1
,
où P( x ) = 1/x, d’où une solution possible pour le Wronskien est
1
W (x) =
.
x
On a alors une autre solution, linéairement indépendante, de la forme
n R o
Z x exp − z P(s) ds Z x
x1 dz
y2 ( x ) = J p ( x ) 2
dz = J p ( x ) 2
. (6.25)
x0 J p (z) x0 zJ p ( z )

Pour un certain choix (conventionnel) des constantes, on obtient ainsi une seconde solution appelée
fonction de Neumann, notée Np ( x ). On montre que Np diverge logarithmiquement à l’origine.
On introduit parfois aussi les fonctions de Hankel de première et deuxième espèce, définies par
(
(1)
H p ( x ) = = J p ( x ) + iNp ( x )
(2) (6.26)
H p ( x ) = = J p ( x ) − iNp ( x )

120
6.2 La méthode de Fröbenius

F IG . 6.1: Les fonctions de Bessel de J0 à J4 .

Orthogonalité et complétude des fonctions de Bessel

Les fonctions de Bessel de J0 à J4 sont tracées en F IG . 6.1. Comme on peut le voir, ce sont des fonctions
extrêmement oscillantes. Il s’avère que leurs zéros jouent un rôle prépondérant, comme on va le voir.
Notons α pn le (n + 1)-ième zéro de la fonction de Bessel J p :

J p (α pn ) = 0 , n = 0, 1, . . . .

On a alors la propriété d’orthogonalité suivante :

P ROPOSITION 6.2 Soit a un réel positif, et posons

k pn = α pn /a .

Alors on a Z a Z a
J p (k pn r ) J p (k pm r ) rdr = δmn J p (k pn r )2 rdr (6.27)
0 0

Preuve : Posons Rn (r ) = J p (k pn r ). Alors on a Rn ( a) = 0 ; de plus, il résulte de l’équation de Bessel


que
p2
   
d dRn 2
r (r ) = − k pn r − R n (r ) .
dr dr r

121
6 Equations différentielles

Par conséquent, on peut écrire


p2
Z a   Z a 
d dRn (r ) 2
r Rm (r ) dr = − k pn r − Rn (r ) Rm (r ) dr
0 dr dr 0 r
p2
Z a   Z a 
d dRm (r ) 2
r Rn (r ) dr = − k pm r − Rm (r ) Rn (r ) dr .
0 dr dr 0 r
Notons aussi que grâce à deux intégrations par parties, on a
Z a    a Z a
d dRn (r ) dRn (r )
r Rm (r ) dr = R m (r )r − rR0m (r ) R0n (r ) dr
0 dr dr dr 0 0
dRm (r ) a
  Z a  
d dRm (r )
= − R n (r )r + r Rn (r ) dr
dr 0 0 dr dr
Z a  
d dRm (r )
= r Rn (r ) dr ,
0 dr dr
de sorte que l’on peut écrire, par soustraction
Z a
(k2pn − k2pm ) Rm (r ) Rn (r ) rdr = 0 ,
0
d’où on déduit le résultat. ♠
R EMARQUE 6.5 Comme on peut le voir, le calcul ci-dessus a été possible grâce à une forme parti-
culière donnée à l’équation de Bessel, appelée forme de Sturm-Liouville
d dR p2
r (r ) − R(r ) = −k2 rR(r ) ,
dr dr r
que l’on peut voir comme une équation aux valeurs propres généralisée (par la présence du facteur r
dans le membre de droite) pour l’opérateur
d d p2
r −
L= .
dr dr r
Pour ce qui est de la normalisation, elle peut être obtenue explicitement (calculs non reproduits ici).
On pose
J p (k pn r )
J pn (r ) = R a 2 dr
,
0
J p ( k pn r )
et on obtient ainsi une famille orthonormale dans l’espace de Hilbert
 Z a 
L ([0, a], r dr ) = f : [0, a] → C
2
| f (r )| rdr < ∞ .
2
0

Par ailleurs, il est possible de montrer que cette famille est complète dans L2 ([0, a], r dr ) :
Z a
f (r )J pn (r ) rdr = 0 ∀n =⇒ f = 0 .
0
Ainsi, on a le résultat suivant :

T H ÉOR ÈME 6.5 La famille des fonctions de Bessel {J pn , n = 0, 1, . . .} est une base orthonormée
de L2 ([0, a], r dr ).

Ainsi, pour toute fonction f ∈ L2 ([0, a], r dr ), on peut écrire, quel que soit p,

f = ∑ h f , J pn iJ pn . (6.28)
n =0

122
6.2 La méthode de Fröbenius

Autres propriétés des fonctions de Bessel

1. Fonction génératrice : En posant

g( x, t) = e x(t−1/t)/2 ,
il est possible de montrer que les fonctions de Bessel d’ordre entier s’obtiennent via

g( x, t) = ∑ Jn ( x )tn . (6.29)
n=−∞

En effet, en développant les exponentielles en série entière, on obtient


∞  r r ∞   s
x t x (−t)−s
g( x, t) = ∑
r! s∑
,
r =0 2 =0 2 s!
de sorte qu’en posant n = r − s, on obtient
∞ ∞
!
(−1)s  x n+2s
g( x, t) = ∑ ∑ tn ,
n=−∞ s=0 s! ( n + s ) ! 2

d’où le résultat (on a utilisé ici le fait que 1/n! = 0 pour tout n entier négatif.
2. Relations de récurrence : en différenciant la fonction génératrice par rapport à t, on obtient la
relation
2n
Jn−1 ( x ) + Jn+1 ( x ) = Jn ( x ) . (6.30)
x
De même, en dérivant par rapport à x et en identifiant les termes, on aboutit à
Jn−1 ( x ) − Jn+1 ( x ) = 2Jn0 ( x ) . (6.31)
On en déduit en particulier
n
Jn−1 ( x ) = Jn ( x ) + Jn0 ( x ) (6.32)
x
n
Jn+1 ( x ) = Jn ( x ) − Jn0 ( x ) . (6.33)
x

6.2.3 Un autre exemple : les polynômes de Legendre


On considère le Laplacien en coordonnées sphériques (r, θ, ϕ), et l’équation de Laplace
∂2 F
 
1 ∂ 2  1 ∂ ∂F 1
r F + sin θ + =0. (6.34)
r2 ∂r r2 sin θ ∂θ ∂θ r2 sin2 θ ∂ϕ2
En recherchant des solutions sous forme de fonctions à variables séparées
F (r, θ, ϕ) = R(r )Θ(θ )Φ( ϕ) ,
et en supposant que la fonction Φ soit constante, il est possible de montrer (voir le chapitre suivant)
qu’en introduisant la variable x ∈ [−1, 1] et la fonction y telles que
x = cos θ , y( x ) = Θ(θ ) ,
l’équation en θ se ramène à une équation différentielle de la forme
(1 − x2 )y00 ( x ) − 2xy0 ( x ) + Cy( x ) = 0 , x ∈ [−1, 1] . (6.35)
Cette équation est appelée équation de Legendre, et se résout par la méthode de Fröbenius. On peut
montrer que l’équation possède deux points singuliers réguliers en x = ±1. Ses solutions dépendent
de la constante C. On peut montrer

123
6 Equations différentielles

T H ÉOR ÈME 6.6 Supposons qu’il existe ` ∈ N tel que

C = `(` + 1) .

Alors,
1. il existe une solution de l’équation de Legendre qui s’écrive sous forme d’un polynôme de
degré `, noté
`
P` ( x ) = ∑ ak x k .
k =0

2. Les polynômes de Legendre forment une base orthogonale dans l’espace de Hilbert
L2 ([−1, 1]) :
Z 1
1
Pk ( x ) P` ( x ) dx = δ ,
−1 ` + 1/2 k`
et pour tout f ∈ L2 ([−1, 1]),
Z 1
f (u) = (` + 1/2) f ( x ) P` ( x ) dx P` (u) .
−1

Dans le cas général, c’est à dire si C n’est pas de la forme C = `(` + 1), les solutions de l’équation de
Legendre ne sont plus des polynômes, mais sont des séries infinies.

Tout comme les fonctions de Bessel, et bien d’autres systèmes de polynômes ou fonctions spéciales,
les polynômes de Legendre peuvent être obtenus à partir d’une fonction génératrice, ici la fonction

1
g( x, t) = √ .
1 − 2tx + t2

Il suffit pour s’en convaincre d’utiliser le développement en série entière de (1 + e)−1/2 , qui converge
pour |e| < 1 (pour nous ici, |t| < 1).
On peut en déduire une relation de récurrence

(n + 1) Pn+1 ( x ) − 2nxPn ( x ) + (n − 1) Pn−1 ( x ) = 0 .

On montre également la formule de Rodrigues :

1 dn 2
Pn ( x ) = ( x − 1) n
2n n! dx n

6.2.4 Autres exemples de polynômes orthogonaux


La même approche peut se transposer à d’autres situations, c’est à dire à d’autres équations différentielles,
que l’on résout de façon similaire. Par exemple, on peut obtenir les polynômes de Laguerre à partir
de l’équation différentielle

xy00 ( x ) + (1 − x )y0 ( x ) = λy( x ) , x ∈ R+

(noter le point singulier régulier en x = 0). Ils peuvent également être définis par la formule de
Rodrigues
e x dn
e− x x n ,

Ln ( x ) = n
n! dx

124
6.3 Problème de Sturm-Liouville

ou une fonction génératrice, via



e− xt/(1−t)
= ∑ Ln ( x )tn ,
1−t n =0

et sont orthogonaux par rapport au produit scalaire


Z ∞
h f | gi = f ( x ) g( x )e− x dx .
0

Ils apparaissent notamment en mécanique quantique dans la partie radiale de la solution de l’équation
de Schrödinger pour un atome à un électron.
Les polynômes d’Hermite sont quant à eux obtenus comme solutions de l’équation

y00 ( x ) − 2xy0 ( x ) = 2λy( x ) , x∈R.

Ils peuvent également s’écrire via une formule de Rodrigues

2 /2 dn  − x2 /2 
Hn ( x ) = (−1)n e x e ,
dx n
où à l’aide de la fonction génératrice

tn
exp( xt − t2 /2) = ∑ Hen ( x )
n!
,
n =0

et sont orthogonaux par rapport au produit scalaire


Z ∞
2 /2
h f | gi = f ( x ) g( x )e− x dx .
−∞

On peut trouver de multiples autres exemples d’intérêt physique. Ils sont toutefois souvent des cas
particuliers d’une théorie plus générale, que nous allons brièvement évoquer plus loin.

6.3 Problème de Sturm-Liouville


Le cas des polynômes de Legendre que nous avons vus plus haut correspond à un cas particulier
d’un problème plus général, appelé problème de Sturm-Liouville, qu’on décrit ici sous une forme
quelque peu simplifiée.

6.3.1 Généralités
On considère, sur un intervalle [ a, b], les équations du second ordre, de la forme

d2 y dy
Ly( x ) = a0 ( x ) 2
( x ) + a1 ( x ) ( x ) + a2 ( x ) y ( x ) = 0 , (6.36)
dx dx
où a0 ∈ C2 ([ a, b]), a1 ∈ C1 ([ a, b]) et a2 ∈ C ([ a, b]) sont des fonctions à valeurs réelles, telles que a0 ne
s’annule pas sur [ a, b], sauf éventuellement en un nombre fini de points.
Pour espérer existence et unicité de solutions de cette équation ou d’équations associées (voir ci-
dessous), on doit la complèter par deux conditions supplémentaires, des conditions aux bords. On
choisit généralement des conditions aux bords de la forme y( a) = y(b) = 0, ou plus généralement
des conditions qui assurent que a0 ( x )y( x )y0 ( x ) = 0 en x = a et x = b. Plaçons nous dans le cas le plus
simple, et limitons l’analyse à l’espace C02 ([ a, b]) des fonctions deux fois continûment différentiables
qui s’annulent en a et b.

125
6 Equations différentielles

L est un opérateur différentiel, dont l’adjoint L∗ est obtenu de la façon habituelle : par définition,
∀u, v ∈ C02 ([ a, b]),
h L∗ u, vi = hu, Lvi
Z b
u( x ) a0 ( x )v00 ( x ) + a1 ( x )v0 ( x ) + a2 ( x )v( x ) dx
 
=
a
b Z b
a0 ( x ) u ( x ) v 0 ( x ) ( a0 u)0 ( x )v0 ( x ) dx + [ a1 ( x )u( x )v( x )]ba

= a

a
Z b Z b
0
− ( a1 u) ( x )v( x ) dx + a2 ( x )u( x )v( x ) dx
a a
b Z b
= − ( a0 u)0 ( x )v( x ) a + ( a0 u)00 ( x )v( x ) dx

a
Z b Z b
− ( a1 u)0 ( x )v( x ) dx + a2 ( x )u( x )v( x ) dx
a a
Z b
( a0 u)00 ( x ) − ( a1 u)0 ( x ) + a2 ( x )u( x ) v( x ) dx ,

=
a

où on a utilisé des intégrations par parties, et le fait que les fonctions u, v considérées ainsi que leurs
dérivées s’annulent en a et b. On a donc montré que l’adjoint de L est donné par

d2 d
L∗ y( x ) = 2
( a0 ( x )y( x )) − ( a1 ( x )y( x )) + a2 ( x )y( x ) , (6.37)
dx dx
d’où on déduit

L EMME 6.1 L est auto-adjoint si et seulement si les fonctions a0 et a1 sont telles que

a00 ( x ) = a1 ( x ) .

Preuve : il suffit de calculer

( a0 y)00 = a0 y00 + 2a00 y0 + a000 y , ( a1 y)0 = a1 y0 + a10 y


et d’insérer ce résultat dans l’expression de L∗ . ♠
Dans ces conditions, L peut aussi se mettre sous la forme
d d
L= p +q, (6.38)
dx dx
ou encore  
d dy
[ Ly]( x ) = p( x ) ( x ) + q( x )y( x ) = 0 , (6.39)
dx dx
avec p( x ) = a0 ( x ) et q( x ) = a2 ( x ).
R EMARQUE 6.6 Les équations de type Sturm-Liouville peuvent généralement s’obtenir suite à des
problèmes d’optimisation de fonctionnelles du type
Z b
1
J [y] = [ p( x )y0 ( x )2 + q( x )y( x )2 ] dx
2 a

avec conditions aux bords y( a) = y(b) = 0, et une contrainte de normalisation


Z b
w( x )y( x )2 dx = 1 .
a

126
6.3 Problème de Sturm-Liouville

R EMARQUE 6.7 Dans le cas général, une équation telle que (6.36) peut toujours se mettre sous la
forme (6.39), en la multipliant terme à terme par le facteur intégrant
Z x 
1 a1 ( z )
I (x) = exp dz
a0 ( x ) x0 a 0 ( z )

et en posant
x
Z 
a1 ( z )
p( x ) = exp dz ,
x0 a0 ( z )
et
x
Z 
a2 ( x ) a1 ( z )
q( x ) = exp dz .
a0 ( x ) x0 a0 ( z )

D ÉFINITION 6.5 Une équation

Ly( x ) = λw( x )y( x ) ,

où L est un opérateur différentiel du second ordre auto-adjoint, et w est une fonction positive
sur [ a, b] (sauf éventuellement en un nombre fini de points où elle peut s’annuler) est appelée
équation de Sturm-Liouville
 
d d
p( x ) y( x ) + q( x )y( x ) = λw( x )y( x ) . (6.40)
dx dx

Lorsque, pour des conditions aux bords données, cette équation admet des solutions yn pour cer-
taines valeurs λn spécifiques, yn est appelée fonction propre, et λn valeur propre.

E XEMPLE 6.5 Prenons le cas particulier de l’équation des ondes sur [0, 1], c’est à dire p( x ) = 1, q( x ) =
0 et w( x ) = 1 pour tout x ∈ [0, 1]. L’équation de Sturm-Liouville prend la forme

y00 ( x ) = λy( x ) ,

dont on a déjà vu qu’elle peut se résoudre via l’équation caractéristique

α2 = λ .

Les solutions sont de la forme

y( x ) = A exp{λ1/2 x } + B exp{−λ1/2 x } .

En imposant les conditions aux bords

y (0) = y (1) = 0 ,

on aboutit à B = − A, et sh(λ1/2 ) = 0, dont les solutions sont λ1/2 = ikπ. Les valeurs propres sont
donc de la forme
λ = − k 2 π 2 , k ∈ Z+ ,
et les fonctions propres correspondantes sont

yk ( x ) = sin(kπx ) .

Ainsi, dans ce cas particulier, la base orthonormale associée au problème de Sturm-Liouville considéré
est une base trigonométrique. On considère généralement les bases associées à des problèmeqs de
Sturm-Liouville comme des généralisations des bases de Fourier.

127
6 Equations différentielles

6.3.2 Propriétés des fonctions propres et valeurs propres d’une équation de


Sturm-Liouville
Les fonctions propres et les valeurs propres de ces équations possèdent des propriétés importantes.
Notamment, on va montrer que les valeurs propres sont toujours réelles, et que les fonctions propres
associées sont orthogonales, au sens du produit scalaire
Z b
h f | giw = f ( x ) g( x ) w( x ) dx
a
définissant l’espace
 Z b 
L2 ([ a, b], w) = f : [ a, b] → C , | f ( x )|2 w( x ) dx < ∞ ,
a
dont on peut montrer qu’il s’agit d’un espace de Hilbert.
Pour cela, soient λm et λn deux valeurs propres, et ym et yn les fonctions propres associées. On a alors
 
d d
p( x ) ym ( x ) = −(q( x ) − λm w( x ))ym ( x ) ,
dx dx
 
d d
p( x ) yn ( x ) = −(q( x ) − λn w( x ))yn ( x ) .
dx dx
Multipliant complexe conjuguée de la première équation par yn ( x ) et la seconde équation par ym ( x ),
on obtient par intégration
Z b 0 0  Z b
0 0
 
ym ( x ) p( x )yn ( x ) − yn ( x ) p( x )ym ( x ) dx = (λn − λm ) ym ( x )yn ( x ) w( x ) dx
a a
Après intégration par parties, en utilisant les conditions aux bords pour éliminer les termes tout
intégrés, on obtient
Z b
(λn − λm ) ym ( x )yn ( x ) w( x ) dx = 0 ,
a
d’où on déduit :
– Deux fonctions propres yn et ym correspondant à des valeurs propres différentes λn et λm sont
orthogonales par rapport au produit scalaire de L2 ([ a, b], w) :
Z b
hym |yn iw = ym ( x )yn ( x ) w( x ) dx = 0 si m 6= n .
a
– Les valeurs propres λn sont réelles.
Il est possible de montrer de plus que
– Les valeurs propres λn ne sont pas bornées, plus précisément
lim λn = ∞ ,
n→∞

– les fonctions propres sont complètes dans L2 ([ a, b], w) : une fonction f ∈ L2 ([ a, b], w) telle que
h f |yn iw = 0 est nécessairement nulle : k f kw = 0.
Par conséquent, on a

P ROPOSITION 6.3 Les fonctions propres associées à une équation de Sturm-Liouville (6.39)
forment une base orthogonale de l’espace L2 ([ a, b], w). En les normalisant de sorte que

kyn k2w = hyn |yn iw = 1 ,

on a donc, ∀ f ∈ L2 ([ a, b], w),


f = ∑hyn | f iw yn . (6.41)
n

128
6.4 Résolution d’équations différentielles par transformation

Notons que ceci implique directement que ∀ f ∈ L2 ([ a, b], w),

Lf = ∑hyn | L f iw yn = ∑h Lyn | f iw yn = ∑ λn hyn | f iw yn , (6.42)


n n n

expression qui sera souvent utile pour la résolution d’équations aux dérivées partielles.

6.4 Résolution d’équations différentielles par transformation


Dans certaines situations, notamment pour ce qui concerne les équations différentielles à coeffi-
cients constants, il est possible d’exploiter les propriétés remarquables de certaines transformations
vis à vis de la différentiation. C’est particulièrement le cas de la transformation de Fourier et de la
transformation de Laplace. La première s’utilise préférentiellement dans des situations où l’équation
différentielle est considérée dans un domaine non-borné (on parle alors de problème aux limites). La
seconde est plus adaptée aux problèmes dits de Cauchy, c’est à dire sur R+ .

6.4.1 Transformation de Fourier


Etant donnée une fonction f , on sait que la transformée de Fourier de sa dérivée p-ième s’exprime
simplement via la transformée de Fourier de la fonction elle même :

f ( p) (ω ) = (iω ) p fˆ(ω ) ,
d

où on a défini la transformée de Fourier par


Z ∞
1
fˆ(ω ) = √ f (t)e−iωt dt , (6.43)
2π −∞

à condition que la fonction f soit de classe C p sur R, et que ses dérivées tendent vers zéro à l’infini.
R EMARQUE 6.8 L’hypothèse f ∈ C p est importante pour que cette relation soit correcte. Si elle n’est
pas satisfaite, des termes supplémentaires doivent être pris en compte.
Ainsi, la transformation de Fourier transforme dérivation en multiplication point par point, et donc
équation différentielle en équation algébrique.
E XEMPLE 6.6 Considérons l’équation différentielle ordinaire

− f 00 ( x ) + a2 f ( x ) = g( x ) ,
où g ∈ L2 (R) est une fonction fixée. On complète cette équation par les conditions aux limites

lim f ( x ) = 0 .
x →±∞

En faisant l’hypothèse que f est de classe C2 , on obtient par transformation de Fourier

(ω 2 + a2 ) fˆ(ω ) = ĝ(ω ) ,
d’où on déduit la solution (dans l’espace de Fourier
ĝ(ω )
fˆ(ω ) = 2 .
ω + a2
Une transformation de Fourier inverse (utilisant le théorème des résidus, ou une table de trans-
formées de Fourier) conduit alors à la solution
Z ∞
1
f (x) = e−a|y| g( x − y) dy .
2a −∞

129
6 Equations différentielles

Dans l’exemple ci-dessus, ainsi que dans de nombreux autres exemples, la transformation de Fourier
transforme une équation différentielle
Lf = g
(où L est un opérateur différentiel, à coefficients constants) en équation algébrique

Ω(ω ) fˆ(ω ) = ĝ(ω ) .

Ensuite, si la fonction ω → 1/Ω(ω ) a de bonnes propriétés, cette équation permet d’exprimer fˆ en


fonction de ĝ, et finalement f en fonction de g. Notons que fˆ s’exprimant comme produit simple dans
le domaine de Fourier, f s’exprimera comme produit de convolution de g avec une certaine fonction
(appelée réponse impulsionnelle, ou fonction de Green de L), transformée de Fourier inverse de 1/Ω. On
obtient ainsi des solutions de la forme
Z
f (x) = h(y) f ( x − y) dy ,

où h est une transformée de Fourier inverse de 1/Ω. Il est à noter que la détermination de la fonction
de Green h doit exploiter les conditions aux bords ou aux limites associées à l’équation différentielle
considérée. Nous verrons cela plus en détails dans le chapitre consacré aux distributions et aux fonc-
tions de Green.

6.4.2 Transformation de Laplace


De même, dans le cas d’une fonction définie sur R+ (comme on en rencontre dans les problèmes de
valeur initiale), elles aussi de classe C p sur R+ , on a recours à la transformée de Laplace
Z ∞
F ( p) = [L f ]( p) = f (t)e− pt dt , <( p) > s f (6.44)
0

qui vérifie
L f ( m ) ( p ) = p m F ( p ) − p m −1 f (0 ) − p m −2 f 0 (0 ) − · · · − f ( m −1) (0 ) .
A l’instar de la transformation de Fourier, la transformation de Laplace a la propriété marquante de
transformer une équation différentielle à coefficients constants en équation algébrique.

E XEMPLE 6.7 Prenons l’exemple de l’équation de Poisson

∆u = f , (6.45)

où f est un second membre fixé, et ∆ = d2 /dx2 est le Laplacien unidimensionnel. Pour obtenir une
solution unique, on sait qu’il est nécessaire de faire des hypothèses supplémentaires, et d’adjoindre
à cette équation deux conditions additionnelles. On suppose donc que u, u0 et f satisfont la condi-
tion (6.44) (il est possible de démontrer dans un cadre plus général l’existence de solutions satisfaisant
à de telles conditions), et que f et f 0 sont continues. Supposons aussi par exemple que

u (0) = u0 , u 0 (0) = v0 ,

où u0 et v0 sont deux nombres fixés. On note U la transformée de Laplace de u, et F la transformée


de Laplace de f . Les hypothèses faites assurent l’existence (et l’analyticité) de F dans un domaine
{ p ∈ C, <( p) > su }, avec su < ∞. on se ramène alors à

p2 U ( p) − pu0 − v0 = F ( p) ,

130
6.4 Résolution d’équations différentielles par transformation

soit encore, pour p 6= 0,


F ( p ) + v0 u0
U ( p) = + ,
p2 p
dans un domaine de valeurs de p bien choisi : la fonction U ainsi obtenue est analytique dans le
domaine { p ∈ C, <( p) > max(s f , 0)}. Cette équation permet d’obtenir une solution u à partir de f ,
par transformation de Laplace inverse (que nous avons déjà vue).
On peut toutefois utiliser ce que l’on sait déjà, c’est à dire les propriétés de linéarité de la transfor-
mation de Laplace, sa relation avec le produit de convolution ainsi que les quelques transformées de
Laplace déjà vues.
Ainsi, on sait que l’original de Laplace de la fonction p → 1/p est la fonction de Heaviside Θ, et que
l’original de Laplace de p → 1/p2 est la fonction t → tΘ(t). Par ailleurs, l’original de Laplace de la
fonction p → F ( p)/p2 est le produit de convolution de f par la fonction t → tΘ(t). On en déduit
donc  Z t 
u ( t ) = Θ ( t ) u0 + v0 t + s f (t − s) ds .
0

131
6 Equations différentielles

132
C HAPITRE

7 Equations aux dérivées


partielles

Les équations aux dérivées partielles (qu’on notera EDP) jouent un rôle fondamental en physique.
En particulier les EDP du second ordre permettent de décrire un certain nombre de phénomènes
physiques de base, tels que les phénomènes de diffusion, ou de propagation.
L’objectif de ce chapitre est de décrire les principales classes d’EDP du second ordre, et de donner les
principales approches pour leur résolution. On verra en particulier que les transformations (notam-
ment la transformation de Fourier) jouent un rôle important pour les problèmes “sans bord” (c’est à
dire en espace infini), alors que les méthodes de type “Sturm-Liouville” que nous avons décrites dans
le chapitre 6 sont particulièrement appropriées pour ce que l’on appelle les problèmes “aux bords”.

7.1 EDP du second ordre, classification


La majorité des équations différentielles qui apparaissent en physique font intervenir des dérivées
partielles par rapport aux variables spatiales et temporelle, et sont donc des équations aux dérivées
partielles. On se limitera ici aux équations aux dérivées partielles du second ordre, c’est à dire aux
équations de la forme

∂2 ∂
∑ αk` ∂xk ∂x` ϕ(x) + ∑ βk ∂xk ϕ(x) + γϕ(x) = 0 ,
k,` k

où les αk` , β k et γ sont des fonctions fixées.


Dans le cas d’équations dépendant de deux variables, on distingue les trois cas suivants :
1. Equations hyperboliques : l’exemple classique est l’équation des ondes

∂2 ϕ 1 ∂2 ϕ
( x, t ) − ( x, t) = f ( x, t) .
∂x2 c2 ∂t2

2. Equations paraboliques : l’exemple classique est l’équation de la chaleur

∂2 ϕ ∂ϕ
( x, t) − α ( x, t) = f ( x, t) .
∂x2 ∂t

3. Equations elliptiques : l’exemple classique est l’équation de Laplace

∂2 ϕ ∂2 ϕ
( x, y ) + ( x, y) = f ( x, y) .
∂x2 ∂y2

133
7 Equations aux dérivées partielles

Les solutions de ces différentes équations aux dérivées partielles ont des comportements radicale-
ment différents, qui correspondent à des situations physiques très différentes elles aussi.
La classification est basée sur une analogie avec les côniques, et les considérations suivantes.
Considérons une EDP du second ordre, faisant intervenir deux variables t et x :
∂2 f ( x, t) ∂2 f ( x, t) ∂2 f ( x, t) ∂ f ( x, t) ∂ f ( x, t)
A 2
+ B + C 2
+D +E = g( x, t) . (7.1)
∂t ∂t∂x ∂x ∂t ∂x
Par analogie avec les côniques, d’équation
ax2 + bxt + ct2 + dt + ex = g ,
cette équation est dite
– Parabolique si B2 − 4AC = 0.
– Hyperbolique si B2 − 4AC > 0.
– Elliptiques si B2 − 4AC < 0.
R EMARQUE 7.1 En général, les paramètres A, B, C, D et E peuvent être des fonctions de x et t, de
sorte que le signe du discriminant B2 − 4AC peut varier d’un point ( x, t) à l’autre, et par là l’équation
changer de régime.

7.2 Problèmes elliptiques : le Laplacien


Avant d’aborder les problèmes elliptiques, il est utile de s’attarder un peu sur le Laplacien.

7.2.1 Le Laplacien
L’opérateur Laplacien joue un rôle majeur en Physique. En effet, il intervient par exemple dans le
calcul des variations de fonctionnelles faisant intervenir la norme carrée du gradient d’une fonction,
ce qui est une situation courante.
Le Laplacien peut prendre différentes formes, suivant le système de coordonnées utilisé. Par exemple,
dans le cas bidimensionnel, il s’écrit soit en coordonnées Cartésiennes, soit en coordonnées polaires
(voir la Figure 7.1) :
∂2 f ( x, y) ∂2 f ( x, y)
∆ f ( x, y) = + (7.2)
∂x2 ∂y2
∂2 g(r, θ ) 1 ∂g(r, θ ) 1 ∂2 g(r, θ )
∆g(r, θ ) = + + . (7.3)
∂r2 r ∂r r2 ∂θ 2
Dans le cas tridimensionnel, on peut l’exprimer en coordonnées Cartésiennes, cylindriques ou sphériques
(voir la Figure 7.2) :
∂2 f ( x, y, z) ∂2 f ( x, y, z) ∂2 f ( x, y, z)
∆ f ( x, y, z) = + + (7.4)
∂x2 ∂y2 ∂z2
∂2 g(r, θ, z) 1 ∂g(r, θ, z) 1 ∂2 g(r, θ, z) ∂2 g( x, y, z)
∆g(r, θ, z) = + + + (7.5)
∂r2 r ∂r r2 ∂θ 2 ∂z2
2
∂ h(r, θ, ϕ) 2 ∂h(r, θ, ϕ) 1 2
∂ h(r, θ, ϕ)
∆h(r, θ, ϕ) = 2
+ + 2 2 (7.6)
∂r r ∂r r sin ϕ ∂θ 2
1 ∂2 h(r, θ, ϕ) 1 ∂h(r, θ, ϕ)
+ 2 2
+ 2
r ∂ϕ r tan ϕ ∂ϕ

Il est important de bien comprendre la signification physique du Laplacien, nous allons l’illustrer
dans le cas bidimensionnel. L’information fondamentale est que le Laplacien d’une fonction de deux
variables F mesure la concavité de F au point considéré. Ainsi :

134
7.2 Problèmes elliptiques : le Laplacien

F IG . 7.1: Systèmes de coordonnées polaires dans le plan.

F IG . 7.2: Systèmes de coordonnées cylindriques et sphériques dans l’espace 3D.

– Si ∆F ( x0 , y0 ) > 0, la fonction F est concave au point ( x0 , y0 ). Donc F ( x0 , y0 ) est automatiquement


inférieur à une moyenne de F sur un voisinage de ( x0 , y0 ), par exemple un petit cercle centré sur le
point ( x0 , y0 ).
– Si ∆F ( x0 , y0 ) < 0, la fonction F est convexe au point ( x0 , y0 ). Donc F ( x0 , y0 ) est automatiquement
supérieur à une moyenne de F sur un voisinage de ( x0 , y0 ), par exemple un petit cercle centré sur
le point ( x0 , y0 ).
– Si ∆F ( x0 , y0 ) = 0, la fonction F est “plate” au point ( x0 , y0 ). Donc F ( x0 , y0 ) est automatiquement
égal à une moyenne de F sur un voisinage de ( x0 , y0 ), par exemple un petit cercle centré sur le point
( x0 , y0 ).
De là, nous pouvons donner une interprétation simple à un certain nombre d’équations classiques de
la physique.

1. L’équation de Laplace ∆u = 0 traduit le fait que la solution u est toujours égale à sa moyenne
prise sur un voisinage. Par exemple, la hauteur d’une membrane attachée par son bord satisfait
l’équation de Laplace. Ceci traduit le fait que la hauteur de la membrane en un point est toujours
égale à la moyenne des hauteurs sur un petit cercle centré en ce point.
2. L’équation de la chaleur u0t = α2 ∆u décrit (entre autres) l’évolution d’un champ de température
(ou de concentration), et peut s’interpréter comme le fait que la variation de température u0t ( x, y)
au point de coordonnées ( x, y) est proportionnelle ∆u( x, y), c’est à dire à la concavité de la

135
7 Equations aux dérivées partielles

membrane au point de coordonnées ( x, y). Ainsi, si u( x, y) est inférieur à la moyenne de u dans


un voisinage de ( x, y), alors la température en ce point va augmenter. Inversement, si u( x, y)
est supérieur à la moyenne de u dans un voisinage de ( x, y), alors la température en ce point va
diminuer.
3. L’équation des ondes u00tt = α2 ∆u décrit (entre autres) le déplacement vertical de la membrane
d’un tambour, et peut s’interpréter comme le fait que l’accéleration (ou la force) u00tt ( x, y) au
point de coordonnées ( x, y) est proportionnelle ∆u( x, y), c’est à dire à la concavité de la mem-
brane au point de coordonnées ( x, y). Ainsi, si u( x, y) est inférieur à la moyenne de u dans un
voisinage de ( x, y), alors l’accélération (et la force) est positive.

7.2.2 Conditions aux bords


On s’intéresse ici à ce que l’on appelle des problèmes aux bords, c’est à dire des équations aux
dérivées partielles faisant intervenir des dérivées spatiales, définies dans un domaine borné, et dans
lesquels des conditions aux bords sont spécifiées. Ce type de problème peut se rencontrer dans de
nombreuses circonstances, par exemple après avoir éliminé une variable temporelle d’un problème
parabolique ou hyperbolique par séparation des variables.

Conditions de Dirichlet

Les conditions aux bords de Dirichlet spécifient les valeurs de la solution sur le bord du domaine.
L’exemple le plus simple, en deux dimensions, est fourni par l’équation de Laplace

∆u( x, y) = 0 , (7.7)

dans un disque Ω de rayon R fixé, avec une condition aux bords

u( x, y) = g( x, y) , ∀( x, y) ∈ ∂Ω , (7.8)

g étant une fonction fixée sur ∂Ω. On parle alors de problème de Dirichlet intérieur , par opposition
au problème de Dirichlet extérieur , dans lequel on résout (7.7) dans l’espace extérieur à Ω (son
complémentaire dans le plan), toujours avec la condition aux bords (7.8).

Conditions de Neumann

Ici, contrairement au cas des conditions aux bords de Dirichlet, on fixe la valeur de la dérivée normale
de la solution à la frontière du domaine considéré. La dérivée normale correspond généralement à
une quantité physique appelée le flux : ce qui entre (ou qui sort) du domaine considéré.
Etant donné le vecteur n( x, y), normal au bord ∂Ω du domaine Ω au point ( x, y) ∈ ∂Ω on note

∂u( x, y)
= n( x, y) · ∇u( x, y)
∂n

la dérivée normale de u au point ( x, y) de ∂Ω.


Les conditions de Neumann prennent la forme

∂u( x, y)
= g( x, y) , ∀( x, y) ∈ ∂Ω , (7.9)
∂n

g étant une fonction fixée sur ∂Ω. On parle alors de problème de Neumann intérieur , et de problème
de Neumann extérieur pour le cas complémentaire.

136
7.2 Problèmes elliptiques : le Laplacien

Conditions mixtes

On verra également apparaı̂tre des conditions au bord “mixtes”, faisant intervenir à la fois la valeur
de la solution sur le bord et sa dérivée normale. Ce cas de figure se présentera notamment dans le cas
de l’équation de la chaleur ci dessous.

∂u( x, y)
+ λu( x, y) = g( x, y) , ∀( x, y) ∈ ∂Ω , (7.10)
∂n

7.2.3 Le problème de Dirichlet intérieur en dimension 2 pour l’équation de Laplace


On s’intéresse au problème de Dirichlet intérieur pour l’équation de Laplace dans un disque de rayon
unité. En coordonnées polaires, le problème est le suivant :

∂2 u(r, θ ) 1 ∂u(r, θ ) 1 ∂2 u(r, θ )


+ + = 0, r≤1 (7.11)
∂r2 r ∂r r2 ∂θ 2
u(1, θ ) = g(θ ) , (7.12)

g étant une fonction fixée.


On utilise la méthode de séparation des variables, et on recherche des solutions sous la forme

u(r, θ ) = R(r )Θ(θ ) , (7.13)

où R et Θ sont des fonctions supposées de classe C2 .


En reportant cette forme particulière dans l’équation de Laplace, et en divisant membre à membre
par RΘ, on obtient
R00 (r ) 1 R0 (r ) 1 Θ00 (θ )
+ + 2 =0,
R (r ) r R (r ) r Θ(θ )
qui s’écrit aussi
R00 (r ) R 0 (r ) Θ00 (θ )
r2 +r =− .
R (r ) R (r ) Θ(θ )
Le premier membre étant indépendant de θ, et le second étant indépendant de r, ils sont tous deux
égaux à une constante, appelée constante de séparation, que l’on pose égale à λ2 , avec λ ∈ C. Ceci nous
conduit au système de deux équations découplées

r2 R00 (r ) + rR0 (r ) − λ2 R(r ) = 0 (7.14)


00
Θ (θ ) + λ Θ(θ ) = 0 .
2
(7.15)

L’équation angulaire se résout facilement, et donne des solutions de la forme

Θ(θ ) = Aeiλθ + Be−iλθ , (7.16)

et les contraintes de régularité sur Θ impliquent que λ doit être un entier, que l’on peut choisir positif
sans perte de généralité.
λ = n ∈ Z+ .
Passons maintenant à l’équation radiale. Il faut distinguer deux cas, selon que n = 0 ou n 6= 0.
Si n = 0, on a l’équation
rR00 (r ) + R0 (r ) = 0 ,
qui équivaut à l’équation de Sturm-Liouville simple (rR0 (r ))0 = 0, d’où rR0 (r ) = β et donc

R0 (r ) = β ln(r ) + α0 . (7.17)

137
7 Equations aux dérivées partielles

Si l’on veut que la solution soit bornée en r = 0, on doit nécessairement avoir β = 0, d’où
R0 (r ) = α0 .
Si n 6= 0 : l’équation prend la forme
r2 R00 (r ) + rR0 (r ) − n2 R(r ) = 0 ,
qui est une équation à coefficients non constants, qui peut être résolue par la méthode de Fröbenius.
Il y a en fait plus simple, en observant que l’on peut rechercher des solutions sous la forme R(r ) = r λ ;
en reportant cette forme particulière, on obtient
λ ( λ − 1) + λ − n2 = 0 ,
d’où la solution λ = ±n. On vérifie facilement que
R n (r ) = α n r n + β n r − n , (7.18)
et de nouveau la contrainte d’avoir une solution bornée implique β n = 0, d’où la solution
R n (r ) = α n r n .
Les solutions à variables séparées conduisent à une solution de la forme
∞  
u(r, θ ) = a0 + ∑ r n an einθ + bn e−inθ
n =1

pour certaines constantes an , bn ∈ C, à déterminer.


Il est maintenant temps d’imposer les conditions aux bords :
∞  
u(1, θ ) = ∑ an einθ + bn e−inθ = g(θ ) , ∀θ .
n =0

En posant
a − n = bn , ∀ n ∈ Z− ,
on peut remarquer que les coefficients an ne sont autres que les coefficients de Fourier de la fonction
g
Z 2π
1
an = g(θ )e−inθ dθ .
2π 0
Ceci conclut la solution du problème. Dans le cas un peu plus général d’un disque de rayon fixé R,
on montre de même

T H ÉOR ÈME 7.1 Soit D un disque de rayon R, centré sur l’origine, et soit g une fonction
périodique continue sur [0, 2π ]. La solution du problème de Dirichlet intérieur dans D

∆u(r, θ ) = 0 dans D (7.19)


u( R, θ ) = g(θ ) , sur ∂D (7.20)

est donnée par


∞  r n  
u(r, θ ) = a0 + ∑ R
an einθ + bn e−inθ (7.21)
n =1

où les coefficients sont donnés par


Z 2π
1
an = g(θ )e−inθ dθ , bn = a − n . (7.22)
2π 0

138
7.2 Problèmes elliptiques : le Laplacien

E XEMPLE 7.1 Considérons le cas


g(θ ) = 1 .
Alors on voit facilement que
an = δn,0 ,
et que la solution est donc donnée par

u( x, y) = 1 , ∀( x, y) ∈ D .

E XEMPLE 7.2 Considérons le cas

g(θ ) = cos(kθ ) , k∈Z.

On voit facilement que


1
an = (δ + δn,−k ) ,
2 n,k
et la solution est donc de la forme
q
u( x, y) = r k cos(θ ) , avec r = x2 + y2 , θ = arctan(y/x ) .

On voit apparaı̂tre dans ce cas particulier une caractéristique générale des solutions : plus la condition
au bord varie rapidement, plus la solution décroı̂t vite quand r → 0. Ceci apparaı̂tra clairement dans
les représentations graphiques de l’exemple suivant.

E XEMPLE 7.3 On a représenté ici la solution (obtenue numériquement) correspondant à la condition


au bord
g(θ ) = cos(kθ )2 ,
pour différentes valeurs de k. Les solutions pour les cas k = 1, k = 3 et k = 5 se trouvent sur les
figures de gauche et droite. On y voit en particulier que la solution « suit » bien la condition au bord,
et que la remarque de l’exemple précédent est toujours valide : plus k est grand, plus la solution tend
vers zéro rapidement quand r → 0.

Une autre forme de cette solution est donnée par la formule intégrale de Poisson

C OROLLAIRE 7.1 La solution du problème de Dirichlet intérieur sur le cercle peut s’écrire

R2 − r 2
Z 2π
1
u(r, θ ) = g(α) dα (7.23)
2π 0 R2 + r2 − 2rR cos(θ − α)

Preuve : Il suffit de reporter les coefficients de Fourier à l’intérieur de la solution trouvée :

∞  n  Z 2π
"Z #
1 2π r
Z 2π
u(r, θ ) = g(α) dα + ∑ ein(θ −α) g(α) dα + e−in(θ −α) g(α)dα
2π 0 n =1
R 0 0

∞  n 
Z 2π
" #
1 r 
= 1+ ∑ ein(θ −α) + e−in(θ −α) g(α) dα
2π 0 n =1
R
Z 2π  
1 1 1
= 1+ + − 2 g(α) dα ,
2π 0 1 − rei(θ −α) /R 1 − re−i(θ −α) /R
d’où on déduit le résultat par simplification. ♠

139
7 Equations aux dérivées partielles

F IG . 7.3: Solution de l’équation de Laplace dans un disque avec condition au bord de Dirichlet pour
des conditions au bord oscillantes.

Cette expression est assez remarquable, car elle exprime la solution directement en fonction de la
condition au bord, sous la forme d’un produit de convolution

u(r, θ ) = ( Pr ∗ g)(θ ) ,

où la fonction Pr , appelée noyau de Poisson et donnée par

1 R2 − r 2
Pr (θ ) = 2 2
2π R + r − 2rR cos(θ )

joue donc un rôle fondamental. Notons que ce noyau est singulier en r = R, θ = 0 (mais la singularité
est intégrable), ce qui montre que pour r ≈ R, la contribution principale à l’intégrale (7.23) est donnée
par θ ≈ α. Le noyau de Poisson est représenté dans la figure 7.4 (où la singularité a été « gommée »,
pour que la figure soit interprétable) ; on y voit clairement le comportement mentionné ci-dessus.

7.2.4 Problème extérieur, problème dans une couronne


Le problème extérieur

∂2 u(r, θ ) 1 ∂u(r, θ ) 1 ∂2 u(r, θ )


+ + = 0, r≥R (7.24)
∂r2 r ∂r r2 ∂θ 2
u( R, θ ) = g(θ ) , (7.25)

g étant une fonction fixée. peut être résolu de façon tout à fait similaire. Les solutions générales an-
gulaire (7.16) et radiale (7.17) et (7.18) sont toujours valides. L’exigence d’une solution bornée impose

140
7.3 Problèmes paraboliques : phénomènes de diffusion

F IG . 7.4: Le noyau de Poisson

encore la nullité du coefficient du terme logarithmique dans (7.17), mais impose cette fois la nullité
des coefficients des termes en r n dans (7.17), ce qui conduit à des solutions de la forme
∞  r −n  
u(r, θ ) = a0 + ∑ R
an einθ + bn e−inθ (7.26)
n =1

où les coefficients sont toujours donnés par (7.22).


Le cas du problème de Dirichlet dans une couronne R1 ≤ r ≤ R2 , donné par

∂2 u(r, θ ) 1 ∂u(r, θ ) 1 ∂2 u(r, θ )


+ + = 0 , R1 ≤ r ≤ R2 (7.27)
∂r2 r ∂r r2 ∂θ 2
u ( R 1 , θ ) = g1 ( θ ) , (7.28)
u ( R 2 , θ ) = g2 ( θ ) , (7.29)

où g1 et g2 sont deux fonctions fixées est un peu plus complexe, mais se résout par des techniques
tout à fait similaires. La solution est de la forme
∞ h    i
u(r, θ ) = a0 + b1 ln(r ) + ∑ r −n an einθ + bn e−inθ + r n cn einθ + dn e−inθ ,
n =1

et les constantes sont cette fois encore déterminées à partir des deux conditions aux bords, en calculant
leurs coefficients de Fourier.

7.3 Problèmes paraboliques : phénomènes de diffusion


7.3.1 Exemples
L’exemple le plus classique est celui de l’équation de la chaleur (ou équation de Fourier)

∂u
= α2 ∆u (7.30)
∂t
où α ∈ R est un paramètre, et ∆ représente le Laplacien en espace. L’équation de la chaleur est utilisée
dans de nombreux contextes, par exemple pour décrire l’évolution d’un champ de temprérature dans
un espace donné, avec une condition initiale donnée. Elle est également utilisée dans de nombreux
autres contextes, qui exhibent des comportements de type diffusif.

141
7 Equations aux dérivées partielles

Comme on l’a vu, le Laplacien mesure la convexité d’une fonction. Si ∆u( x, t) > 0, alors u( x, t) est
inférieure à sa moyenne sur un petit voisinage de x ; alors u0t ( x, t) > 0, ce qui va faire augmenter
la valeur de u( x, t). Inversement, si ∆u( x, t) < 0, alors la valeur de u( x, t) va diminuer. Ce type
d’équation a donc tendance à moyenner, ou “lisser” la solution au cours du temps.
Comme autre exemple d’équation parabolique, on peut notamment mentionner l’équation de convection-
diffusion, que l’on obtient en ajoutant un terme de convection à l’équation de la chaleur

∂u
= α2 ∆u − V · ∇u ,
∂t
V étant un vecteur (vitesse) fixé.
Les EDP de cette classe peuvent être considérées dans l’espace tout entier, ou dans un domaine borné
de l’espace, ce qui donne lieu soit à des conditions au bord, soit des conditions aux limites (dans ce cas
on impose en général que la solution tende vers zéro à l’infini). La variable temporelle est en général
prise dans R+ , et on complète le problème par des conditions initiales.

7.3.2 Le cas de domaines infinis : transformations


Les équations du type “équation de la chaleur” en domaine infini ou semi-infini sont souvent traitées
en utilisant des transformations intégrales, comme la transformation de Fourier dans le cas de do-
maine infini, ou la transformation de Laplace dans le cas semi-infini. L’idée essentielle est que ces
transformations transforment la dérivation en multiplication, et donc une EDP en une famille d’équations
différentielles ordinaires, plus faciles à traiter.
Comme on a vu quelques exemples auparavant, on ne discutera pas ce cas davantage ici.

7.3.3 Domaines bornés : conditions aux bords


Les conditions aux bords les plus faciles à exploiter sont comme souvent les conditions de Dirichlet

u( x, t) = g(t) , ∀ x ∈ ∂Ω , (7.31)

g étant un fonction fixée. Lorsque g = 0, on parle de condition au bord homogène.


Il arrive toutefois que les conditions aux bords portent sur le flux, c’est à dire la dérivée normale de
la solution sur le bord. On parle alors de condition de Neumann

∂u
( x, t) = g(t) , ∀ x ∈ ∂Ω , (7.32)
∂n
homogène si g = 0.
Les conditions au bord mixtes, ou conditions de Robin apparaissent assez couramment, notamment
dans les problèmes de conduction de la chaleur, pour lesquels la dérivée normale est proportionnelle
à la différence entre la valeur de la solution à l’intérieur du domaine et sa valeur à l’extérieur.
∂u
( x, t) − λu( x, t) = g(t) , ∀ x ∈ ∂Ω . (7.33)
∂n
Là encore, la condition au bord est homogène si g = 0.

7.3.4 Equation de la chaleur 1D sur un domaine borné


Le champ de température d’une barre conductrice de longueur L fixée, isolée latéralement, est décrit
par l’équation de la chaleur (ou équation de Fourier)

∂u( x, t) ∂2 u( x, t)
= α2 , α∈R (7.34)
∂t ∂x2

142
7.3 Problèmes paraboliques : phénomènes de diffusion

à laquelle on ajoute une condition initiale

u( x, 0) = φ( x ) , (7.35)

φ étant une fonction fixée, et des conditions aux bords, par exemple de type Dirichlet, Neumann ou
Robin.
On recherche en général des solutions par la méthode de séparation des variables, c’est à dire sous la
forme
u( x, t) = X ( x ) T (t) .
Sous cette forme, on se ramène alors à une équation de la forme

X ( x ) T 0 (t) = α2 X 00 ( x ) T (t) ,

où encore
T 0 (t) X 00 ( x )
= α2 = −λα2 ,
T (t) X (x)
λ étant une constante de séparation, a priori complexe.
L’équation temporelle conduit directement à
2
T (t) = Ce−λα t ,

ce qui force <(λ) > 0 si on se limite à des solutions bornées. Pour ce qui est de l’équation spatiale

X 00 ( x ) + λX ( x ) = 0 ,

elle conduit à des solutions de la forme


1/2 x 1/2 x
X ( x ) = Aeiλ + Be−iλ . (7.36)

Pour aller plus loin, il faut imposer les conditions aux bords. On se limitera ici aux deux types de
conditions aux bords les plus courantes, c’est à dire les conditions de Dirichlet et les conditions mixtes
de Robin.

Conditions de Dirichlet homogènes

On impose les deux conditions


X (0, t) = X ( L, t) = 0 .
Ceci correspond à une situation physique décrite dans la figure 7.5 : une barre conductrice de la
chaleur, dont les deux extrémités sont maintenues à température nulle par un thermostat, et isolée
latéralement.

F IG . 7.5: Barre conductrice, isolée latéralement, dont les deux extrêmités sont à température nulle.

Cette condition au bord conduit à


1/2 L 1/2 L
A+B = 0, Aeiλ + Be−iλ =0.

La première équation donne B = − A, et la seconde conduit à


 
A sin λ1/2 L = 0 .

143
7 Equations aux dérivées partielles

Si on évite la solution nulle, ceci implique que les seules solutions pour λ sont de la forme
nπ 2
λ = λn = ( ) . (7.37)
L
On obtient donc des solutions à variables séparées de la forme
 nπx 
un ( x, t) = An exp −(nπα/L)2 t sin

,
L
et plus généralement, l’équation et les conditions aux bords étant homogènes, une solution générale
∞   
nπα 2  nπx 
u( x, t) = ∑ An exp − t sin .
n =1
L L
La dernière étape consiste à trouver les valeurs des constantes An . On utilise pour cela la condition
initiale, qui prend donc la forme
∞  nπx 
φ( x ) = u( x, 0) = ∑ An sin .
n =1
L
Restent à trouver les constantes An . Pour cela, remarquons que
Z L  mπx  ∞ Z L  mπx   nπx 
φ( x ) sin dx = ∑ An sin sin dx
0 L n =1 0 L L

An L (m − n)πx
    
(m + n)πx
Z
= ∑ φ( x ) cos − cos dx
n =1
2 0 L L
L
= Am
2
Par conséquent, les coefficients An du développement de la solution s’expriment directement à partir
de la condition initiale, et on a

T H ÉOR ÈME 7.2 La solution de problème de Dirichlet pour l’équation de la chaleur unidimen-
sionnelle sur l’intervalle [0, L] prend la forme
∞   
nπα 2  nπx 
u( x, t) = ∑ An exp − t sin , (7.38)
n =1
L L

où les constantes An sont données à partir de la condition initiale φ par


Z L  nπx 
2
An = φ( x ) sin dx . (7.39)
L 0 L

La manière dont on a retrouvé les coefficients An peut sembler un peu arbitraire. En fait, elle provient
du résultat suivant, qui suggère donc le calcul fait pour retrouver les An :

L EMME 7.1 La famille de fonctions

1  πnx 
en : x ∈ [0, L] → en ( x ) = √ sin , n = 1, . . . ∞ (7.40)
L L

est une base orthonormée de l’espace L20 ([0, L]) des fonctions de carré intégrable sur [0, L] qui
s’annulent en x = 0 et en x = L.

144
7.3 Problèmes paraboliques : phénomènes de diffusion

R EMARQUE 7.2 Il est utile de revenir en arrière et retracer l’origine de cette base de fonctions. Nous
les avons obtenues comme solutions du problème de type Sturm Liouville
X 00 ( x ) + λX ( x ) = 0 ,
en imposant des conditions au bord particulières. Or nous avons vu au chapitre 6 que ces problèmes
de Sturm-Liouville fournissent des bases orthonormées d’espaces de Hilbert adaptés aux conditions
aux bords choisies. Le lemme ci-dessus se place donc précisément dans ce cadre.

Il est important de donner une interprétation physique à la solution obtenue en (7.38). Le cas t = 0
redonne la condition initiale, sous forme d’une série de Fourier particulière (ici une série de sinus).
On peut remarquer que l’évolution temporelle de la solution se caractérise par une atténuation de ces
coefficients de Fourier, atténuation d’autant plus forte que l’indice fréquentiel (le n du coefficient An .
Ainsi, les composantes sinusoı̈dales les plus rapides sont les plus rapidement atténuées. La solution
va donc devenir de plus en plus « lisse » au cours du temps.
On peut en voir un exemple dans les représentations graphiques de la figure 7.6, où on a représenté
les solutions à différents temps, pour une condition initiale aléatoire.

Conditions de Robin homogènes

On considère maintenant le cas des conditions aux bords mixtes. Ce choix se justifie par des considérations
physiques. En effet, la loi de Newton précise que le flux de température à l’interface entre deux mi-
lieux est proportionnel à la différence de température entre ces deux milieux. De plus, la loi de Fourier
spécifie que ce flux est également proportionnel à la valeur du gradient de température à l’interface.
On considère ici la situation décrite dans la figure 7.7, d’une barre conductrice isolée latéralement,
dont le côté gauche est maintenu à température nulle, et le droit est en contact avec un milieu se
trouvant lui aussi à température nulle.
Le calcul de la solution générale est le même que plus haut, jusqu’à l’équation (7.36). On doit mainte-
nant utiliser la condition au bord, que l’on doit cette fois choisir de type Dirichlet à gauche, et mixte
à droite
u(0, t) = 0 , u0x ( L, t) + hu( L, t) = 0
La première condition implique comme précédemment B = − A, d’où des solutions de la forme
X ( x ) = A sin(λ1/2 x ) .
Comme précédemment, les valeurs possibles de λ sont déterminées par la seconde condition au bord,
à savoir
λ1/2 cos(λ1/2 L) + h sin(λ1/2 L) = 0 ,
d’où les valeurs possibles de λ1/2 sont les solutions de l’équation

λ1/2
tg(λ1/2 L) = − , (7.41)
h
équation qui doit être résolue numériquement. On peut toutefois voir que les solutions λ1/2 sont les
points d’intersection de la droite t → −t/h (en rouge... pour ceux qui ont la couleur !) avec la courbe
t → tg(tL) (en bleu) dans la figure 7.8. Les valeurs admissibles de λ forment donc un ensemble discret
{ λ n , n ∈ Z+ } .
La solution générale du problème considéré est donc de la forme

∑ an e−λ α t sin(λ1/2
2
u( x, t) = n
n x) , (7.42)
n =1

(le cas λ0 = 0 ne contribue pas), les coefficients an restant à déterminer via la condition initiale. On va
pour cela utiliser le lemme suivant

145
7 Equations aux dérivées partielles

F IG . 7.6: Solutions de l’équation de la chaleur avec une condition initiale aléatoire, et des conditions
aux bords de Dirichlet homogènes, pout t = 0 (condition initiale), t = 0, 1, t = 0, 5, t = 1,
t = 5 et t = 50

146
7.3 Problèmes paraboliques : phénomènes de diffusion

F IG . 7.7: Barre conductrice, isolée latéralement, dont l’extrêmité gauche est maintenue à température
nulle, et la droite se trouve en contact avec un milieu à température nulle

F IG . 7.8: Valeurs propres pour l’équation de la chaleur avec condition au bord mixte : les valeurs de
λ1/2 sont les intersections des deux courbes.

L EMME 7.2 La famille de fonctions

2 p
f n : x ∈ [0, L] → f n ( x ) = q √ sin( λn x ) , n = 1, . . . ∞ (7.43)
2L − sin(2 λn L)

est une base orthonormée de l’espace

H = f ∈ C2 ([0, L]), f (0) = 0 et f 0 ( L) + h f ( L) = 0



.

147
7 Equations aux dérivées partielles


Preuve : pour simplifier, posons µn = λn , et calculons
Z L  L Z L
1 µn
sin(µn x ) sin(µm x ) dx = − sin(µn x ) cos(µm x ) + cos(µn x ) cos(µm x ) dx
0 µm 0 µm 0
 
1 µn sin(µm x )
= − sin(µn L) cos(µm L) + cos(µn x )
µm µm µm
Z L 
µn
+ sin(µn x ) sin(µm x ) dx
µm 0
 
1
= − sin(µn L) cos(µm L) − [−h sin(µn L)][− cos(µm L)/h]
µm
 2 Z L
µn
+ sin(µn x ) sin(µm x ) dx
µm 0
 2 Z L
µn
= sin(µn x ) sin(µm x ) dx ,
µm 0

d’où il s’ensuit que l’intégrale est nulle pour µn 6= µn . Pour ce qui est de l’orthogonalité, il suffit de
remarquer que
Z L
L sin(2µn L)
sin(µn x )2 dx = − ,
0 2 4
ce qui conclut la preuve. ♠

7.3.5 Problèmes inhomogènes : utilisation des bases “Sturm-Liouville”


Dans le cas où l’équation considérée est inhomogène, il est encore possible d’utiliser des techniques
telles que celle que nous venons de voir. Par exemple, prenons le cas de l’équation de la chaleur
inhomogène
∂u ∂2 u
( x, t) = α2 2 ( x, t) + f ( x, t) , (7.44)
∂t ∂x
f étant une fonction fixée, jouant le rôle de “source de chaleur”, avec condition au bord de Dirichlet.
On peut alors utiliser la base de Sturm-Liouville

x → Xn ( x ) = Cn sin (µn x ) ,

avec µn = πn/L et Cn = 1/ L, pour décomposer le terme source

f ( x, t) = ∑ Fn (t)Xn (x) ,
n =1

où Z L
Fn (t) = f ( x, t) Xn ( x ) dx ,
0
et de là développer un calcul similaire au précédent.
En effet, on sait que la solution se décompose sous la forme

u( x, t) = ∑ Tn (t)Xn (x) ,
n =1

où les fonctions Tn (t) sont à déterminer. L’équation (7.44) se met sous la forme
∞ ∞
∑ Tn0 (t) Xn ( x ) = α2 ∑ λ2n Tn (t) Xn ( x ) + Fn (t) Xn ( x ) ,

n =1 n =1

148
7.4 Problèmes hyperboliques : phénomènes de propagation

d’où on déduit la famille (infinie) d’équations différentielles inhomogènes

Tn0 (t) − α2 λ2n Tn (t) = Fn (t) .

En résolvant ces dernières, on obtient les fonctions Tn , qui fournissent la solution du problème inho-
mogène.

7.4 Problèmes hyperboliques : phénomènes de propagation


Terminons ce chapitre par une rapide discussion des problèmes hyperboliques, qui décrivent les
phénomènes de propagation d’ondes par exemple.

7.4.1 Exemples : corde et poutre


L’exemple le plus simple et classique est celui de l’équation aux dérivées partielles décrivant les vi-
brations transversales d’une corde de violon (ou piano) ; si on note u( x, t) la position du point x de la
corde à l’instant t, on a
∂2 u( x, t) ∂2 u( x, t)
2
= c2 . (7.45)
∂t ∂x2
Comme on l’a vu plus haut, cette équation signifie qu’à tout instant t s’exerce au point x une force de
rappel proportionnelle à la concavité ∆u( x, t) de u en x.
Bien qu’il ne s’agisse pas d’une équation du second ordre, l’équation régissant les vibrations d’une
poutre, appelée équation de Cantilever

∂2 u( x, t) 4
2 ∂ u ( x, t )
= − α (7.46)
∂t2 ∂x4
conduit à des solutions possédant des propriétés qualitatives similaires.

7.4.2 Problèmes sans bord : la solution de d’Alembert


Le cas unidimensionnel

Commençons par le cas unidimensionnel en espace. L’équation des ondes (7.45) possède des solutions
simples. Il s’avère avantageux dans ce cas d’introduire les variables ξ = x − ct et ζ = x + ct. On a
alors
∂ ∂ ∂ ∂ ∂ ∂
= + , = −c + c
∂x ∂ξ ∂ζ ∂t ∂ξ ∂ζ
et
∂2 ∂2 ∂2 ∂2 ∂2
 2
∂2 ∂2

2 ∂
= 2 + 2 +2 , =c + 2 −2 ,
∂x2 ∂ξ ∂ζ ∂ξ∂ζ ∂t2 ∂ξ 2 ∂ζ ∂ξ∂ζ
de sorte que (7.45) est équivalente à l’équation

∂2 u
=0.
∂ξ∂ζ
En intégrant une première fois par rapport à ξ, on obtient
∂v
= a(ζ ) ,
∂ζ
une fonction ne dépendant que de ζ. En intégrant cette fois par rapport à ζ, on obtient finalement

v(ξ, ζ ) = f (ξ ) + g(ζ ) ,

149
7 Equations aux dérivées partielles

d’où la solution de d’Alembert

u( x, t) = f ( x − ct) + g( x + ct) . (7.47)

On obtient ainsi deux ondes f et g, se propageant respectivement dans la direction des x positifs
(onde progressive) et négatifs (onde régressive). Les fonctions f et g sont déterminées à partir des
conditions initiales
∂u
u( x, 0) = φ( x ) , ( x, 0) = ψ( x ) ,
∂t
qui conduit au système

f ( x ) + g( x ) = φ( x )
−c( f ( x ) − g0 ( x )) = ψ( x )
0

qui peut ensuite être résolu directement. On obtient


 
0 1 1
f (x) = φ0 ( x ) − ψ( x )
2 c
 
0 1 1
g (x) = φ0 ( x ) + ψ( x )
2 c

d’où
1 x
 
1
Z
f (x) = φ( x ) − ψ(y) dy
2 c a
1 x
 
1
Z
g( x ) = φ( x ) + ψ(y) dy
2 c a

et finalement Z x+ct
1 1
u( x, t) = (φ( x − ct) + φ( x + ct)) + ψ(s) ds . (7.48)
2 2c x −ct

Le cas tridimensionnel

Le cas tridimensionnel est plus complexe, mais conduit à une solution de nature similaire. On considère
l’équation des ondes dans l’espace R3

1 ∂2 u
∆u( x, t) = ( x, t) . (7.49)
c2 ∂t2

Considérons le problème défini par l’équation des ondes (7.49) dans l’espace R3 , complété par les
conditions initiales

u( x, 0) = φ( x ) (7.50)
u0t ( x, 0) = ψ( x ) (7.51)

pour un couple de fonctions φ, ψ donné. Il est facile de voir que la solution peut s’exprimer comme la
somme d’une solution avec conditions aux bords (0, ψ) et d’une solution avec conditions aux bords
(φ, 0).
Le problème peut se résoudre et utilisant une transformation de Fourier tridimensionnelle, et conduit
au résultat suivant. On se place dans un système de coordonnées sphériques (r, θ, ϕ), ϕ ∈ [0, π ] étant
l’angle azimutal et θ ∈ [0, 2π ] l’angle fait par la projection du vecteur dans le plan ( xOy) avec l’axe
Ox (voir Figure 7.2).

150
7.4 Problèmes hyperboliques : phénomènes de propagation

T H ÉOR ÈME 7.3 La solution du problème défini par l’équation des ondes (7.49) dans l’espace,
complété par les conditions initiales (7.50) et (7.51) est donné par les ondes sphériques


u( x, t) = tΨ( x, t) + [tΦ( x, t)] , (7.52)
∂t
où Φ et Ψ sont les moyennes des conditions initiales φ et ψ, prises sur une sphère de centre
x = ( x, y, z) et de rayon ct :

1 π 2π
Z Z
Ψ( x, t) = 2 2
ψ( x + ct sin ϕ cos θ, y + ct sin ϕ sin θ, z + ct cos ϕ) c2 t2 sin ϕdϕdθ
4πc t 0 0
Z πZ 2π
1
Φ( x, t) = φ( x + ct sin ϕ cos θ, y + ct sin ϕ sin θ, z + ct cos ϕ) c2 t2 sin ϕdϕdθ
4πc2 t2 0 0

Ce résultat est comme annoncé la somme de la solution du problème avec φ = 0 et de la solution avec
ψ = 0. La première est assez simple à interpréter : on voit que la solution en ( x, y, z) à l’instant t est la
moyenne de la fonction ψ dans une sphère de rayon ct centrée en ( x, y, z).

7.4.3 Corde vibrante : condition aux bords et résolution

On se place dans le cas unidimensionnel, et on s’intéresse à l’équation

∂2 2 ∂
2
u ( x, t ) = c u( x, t) , t ∈ R+ , x ∈ [0, L] . (7.53)
∂t2 ∂x2

La solution de cette équation peut être utilisée pour décrire un grand nombre de situations physiques
différentes, comme par exemple
– des ondes acoustiques (transverses),
– des vibrations dans les solides (longitudinales, transverses ou ondes de torsion),
– des ondes de probabilité en mécanique quantique,
– les vibrations (transverses) d’une corde
– ...
C’est ce dernier exemple qu’on prendra comme illustration.

Conditions au bord

On considère généralement trois types de conditions au bord.


1. Une condition de type Dirichlet, qu’on appelle dans ce cas condition de bords contrôlés

u(0, t) = g1 (t) , u( L, t) = g2 (t) .

2. Une condition de type Neumann, qui revient à exercer sur les bords des forces fixées

u0x (0, t) = g1 (t) , u0x ( L, t) = g2 (t) .

3. Une condition mixte, qui revient à supposer un lien élastique sur les bords

u0x (0, t) + h1 u(0, t) = g1 (t) , u0x ( L, t) + h2 u( L, t) = g2 (t) .

151
7 Equations aux dérivées partielles

Résolution du problème de Dirichlet homogène

La méthode de résolution suit fidèlement celle employée pour l’équation de la chaleur. On recherche
des solutions sous forme de fonctions à variables séparées

u( x, t) = X ( x ) T (t) ,

ce qui conduit à deux équations pour les deux fonctions

T 00 (t) = c2 λT (t) (7.54)


00
X ( x ) = λX ( x ) (7.55)

Suivant les valeurs de λ, on sera confronté à divers types de solutions. Dans la mesure où u( x, t)
représente la position d’un point d’une corde, il est naturel de se limiter à des valeurs réelles de λ. On
a donc les trois situations
– Si λ = 0, les solutions sont de la forme

u( x, t) = ( Ax + B)(Ct + D ) .

La solution ne sera bornée que si A = C = 0, et ne satisfera les conditions au bord que si B = D = 0.


Reste donc la seule solution nulle u( x, t) = 0.
– Si λ = β2 > 0, les solutions sont de la forme
  
u( x, t) = Aecβt + Be−cβt Ce βx + De− βx ,

et là encore, seule la solution nulle est admissible.


– Si λ = − β2 > 0, les solutions sont de la forme
  
u( x, t) = Aeicβt + Be−icβt Ceiβx + De−iβt .

Seul le dernier cas de figure convient. En imposant les conditions aux bords, on voit facilement que
D = −C, de sorte que la solution prend la forme
 
un ( x, t) = Aeicβ n t + Be−icβ n t sin( β n x ) ,

avec

βn = .
L
La solution générale est donc de la forme
∞  
u( x, t) = ∑ An eicβ n t + Bn e−icβ n t sin( β n x ) (7.56)
n =1

Pour conclure, il faut maintenant imposer les conditions initiales, que l’on prend de la forme

u( x, 0) = φ( x ) , u0t ( x, 0) = ψ(t) .

On aboutit alors au système



φ( x ) = ∑ ( An + Bn ) sin( βn x)
n =1

ψ( x ) = ∑ icβn ( An − Bn ) sin( βn x)
n =1

152
7.4 Problèmes hyperboliques : phénomènes de propagation

d’où on déduit, grâce au lemme 7.1, le système

2 L
Z
An + Bn = φ( x ) sin( β n x ) dx
L 0
Z L
2
An − Bn = ψ( x ) sin( β n x ) dx ,
icL 0

de sorte que nous avons donc montré le résultat suivant :

T H ÉOR ÈME 7.4 La solution u : ( x, t) ∈ [0, L] × R+ → u( x, t) ∈ R du problème formé de


l’équation des ondes unidimensionnelle (7.53), complétée par les conditions aux bord de Dirichlet
u(0, t) = u( L, t) = 0 et des conditions initiales u( x, 0) = Φ( x ) et ∂ x x (0, t) = ψ(t) est donnée
par la série
∞    nπx 
u( x, t) = ∑ An einπct/L + Bn e−inπct/L sin ,
n =1
L
où les coefficients An et Bn s’expriment en fonction des conditions initiales sous la forme

1 L
Z    nπx 
1
An = φ( x ) + ψ( x ) sin dx
L 0 ic L
1 L
Z    nπx 
1
Bn = φ( x ) − ψ( x ) sin dx .
L 0 ic L

Bien entendu, si d’autres types de conditions aux bords avaient été requises, nous aurions obtenu
un résultat similaire, la famille des fonctions sin( β n x ) étant alors remplacée par la base de Sturm-
Liouville associée au problème correspondant.

7.4.4 Cas bi-dimensionnel : la membrane d’un tambour


Passons pour finir à un exemple en dimension supérieure, qui nous donnera l’occasion de revoir nos
vieilles amies les fonctions de Bessel.
On se propose ici d’étudier les vibrations d’une membrane de tambour, décrites par une équation des
ondes bidimensionnelle. On suppose que le bord de la membrane est un cercle de rayon 1, et on note
u( x, t) = u(r, θ, t) la hauteur du point de coordonnées polaires x = (r, θ ) de la membrane à l’instant
t ∈ R+ . En écrivant le Laplacien en coordonnées polaires, l’évolution de u est décrite par l’équation
des ondes
∂2 u
 2
1 ∂2 u

2 ∂ u 1 ∂u
(r, θ, t) = c (r, θ, t) + (r, θ, t) + 2 2 (r, θ, t) . (7.57)
∂t2 ∂r2 r ∂r r ∂θ
Cette équation est complétée par la condition au bord

u(1, θ, t) = 0 ,

ainsi que les conditions initiales

u(r, θ, 0) = g1 (r, θ ) , u0t (r, θ, 0) = g2 (r, θ ) .

On recherche des solutions à variables séparées

u(r, θ, t) = U (r, θ ) T (t) ,

153
7 Equations aux dérivées partielles

ce qui conduit au système

∆U (r, θ ) + λ2 U (r, θ ) = 0 (7.58)


00 2 2
T (t) + c λ T (t) = 0 (7.59)

où ∆ est le Laplacien spatial, exprimé en coordonnées polaires.


L’équation temporelle est facile à résoudre, et conduit à des solutions de la forme

T (t) = Aeiλct + Beiλct .

Considérons maintenant l’équation d’Helmholtz (7.58), complétée par la condition au bord

U (1, θ ) = 0 .

On recherche encore une fois des solutions sous forme de fonction à variables séparées

U (r, θ ) = R(r )Θ(θ ) ,

ce qui conduit aux deux équations

r2 R00 (r ) + rR0 (r ) + (λ2 r2 − n2 ) R(r ) = 0 (7.60)


00
Θ (θ ) + n Θ(θ ) = 0
2
(7.61)

où on a pris la constante de séparation égale à n2 (où n est a priori un nombre complexe quelconque).
Il s’agit d’un problème que nous avons déjà rencontré au chapitre 6. Encore une fois, l’équation an-
gulaire est facile à résoudre, et conduit à des solutions

Θn (θ ) = Aeinθ + Be−inθ ,

et la périodicité et la continuité de Θn et Θ0n imposent n ∈ Z+ .


De plus on sait que la solution de l’équation radiale est donnée par les fonctions de Bessel de première
espèce et deuxième espèce Jn (λr ) et Yn (λr ). Ces dernières étant non bornées, on a donc des solutions
de la forme
R(r ) = Jn (λr ) .
On doit maintenant imposer la condition au bord U (1, θ ) = 0. Ceci impose

Jn (λ) = 0 ,

c’est à dire que la constante de séparation λ doit être un zéro αnm de la fonction de Bessel Jn . Par
conséquent  
Unm (r, θ ) = Anm einθ + Bnm e−inθ Jn (αnm r ) .

Ainsi, la solution générale de notre problème est de la forme


∞ ∞  
u(r, θ, t) = ∑ ∑ Jn (αnm r ) Anm einθ + Bnm e−inθ (Cnm sin(αnm ct) + Dnm cos(αnm ct)) (7.62)
n =0 m =1

La dernière étape consiste à calculer les constantes à partir des conditions initiales. Le cas général est
assez difficile à traiter, on se limitera ici au cas particulier où la vitesse initiale u0t (r, θ, 0) est nulle, et
où la condition initiale u(r, θ, 0) dépend uniquement de la variable radiale r. En d’autres termes, on
considère le cas
u(r, θ, 0) = f (r ) , u0t (r, θ, 0) = 0 .

154
7.4 Problèmes hyperboliques : phénomènes de propagation

On a alors
∞ ∞  
u(r, θ, 0) = f (r ) = ∑ ∑ Jn (αnm r ) Anm einθ + Bnm e−inθ Dnm ,
n =0 m =1

et on en déduit par exemple pour k ∈ N,


Z 2π ∞ ∞
1
2π 0
u(r, θ, 0)e−ikθ dθ = f (r )δk,0 = ∑ ∑ Jn (αnm r) Anm δn, k = ∑ Jk (αkm r ) Akm Dkm ,
m =1 n m =1

et un résultat similaire pour k ≤ 0, faisant intervenir les coefficients Bnm .


Ainsi, pour tout k 6= 0 on a
∞ ∞
∑ Jk (αkm r ) Akm Dkm = ∑ Jk (αkm r ) Bkm Dkm , k 6= 0
m =1 m =1

qui implique Akm Dkm = Bkm Dkm = 0, et pour k = 0,



∑ J0 (α0m r )( A0m + B0m ) D0m = f (r ) ,
m =1

de sorte que les coefficients dm = ( A0m + B0m ) D0m sont les coefficients du développement de f sur la
base de Bessel Jom .
En raisonnant similairement, on montre que les coefficients Amn Cmn et Bmn Cmn sont tous nuls, comme
conséquence de la seconde condition initiale.
Ainsi, en posant k m = α0m

u(r, θ, t) = ∑ dm J0 (k m r ) cos(k m ct) .
m =1

Il reste donc à déterminer les constantes dm . On écrit pour cela



f (r ) = ∑ dm J0 (k m r ) ,
m =1

et on utilise maintenant un résultat obtenu au chapitre précédent, à savoir l’orthogonalité des fonc-
tions de Bessel Z 1
rJn (αnm r ) Jn (αnm0 r ) dr = 0 si m0 6= m .
0
Dans notre cas, on obtient, après calcul
Z 1
1
rJn (k m r ) Jn (k m0 r ) dr = δmm0 J12 (k m ) ,
0 2
d’où on déduit les constantes cherchées
Z 1
2
dm = 2
r f (r ) J0 (k m r ) dr .
J1 (k m ) 0

R EMARQUE 7.3 Notons que nous avons travaillé ici dans un cas particulier, tant pour la condition
au bord (indépendante de θ), que pour les conditions initiales. Dans le cas général, on obtient un
développement sur les fonctions de Bessel (7.62), et on peut vérifier que les constantes peuvent être
déterminées par les conditions initiales et les conditions aux bords.

155
7 Equations aux dérivées partielles

156
Quatrième partie

Distributions, fonctions de Green

157
C HAPITRE

8 Distributions et fonc-
tions de Green

La théorie des distributions, développée en mathématiques par I.M. Gelfand, puis par L. Schwartz,
trouve ses origines dans certains problèmes de physiques. Comme motivation on cite généralement
le problème du calcul du potentiel généré par une “distribution” de charge. Lorsque ces charges sont
des charges ponctuelles, situées en des points x1 , . . . x N ∈ R3 , le potentiel créé en un point x ∈ R3
s’écrit
1 n qi
V (x) = ∑
4πe0 i=1 | x − xi |
,

où e0 est la permittivité du vide, qi représente la charge au point xi , et on note | x | la norme Euclidienne
du vecteur x ∈ R3 . Dans le cas d’une distribution volumique, de densité ρ à support dans un domaine
Ω, on écrit alors
1 ρ( x0 )
Z
V (x) = dx 0 .
4πe0 Ω | x − x 0 |
Dans le cas le plus général, on est amené à considérer simultanément ces différents cas, ce qui com-
plique le formalisme. La théorie des distributions permet de donner une approche unifiée pour ces
situations.
Le but de la théorie des distributions est de permettre d’étendre des opérations “classiques” sur les
fonctions, telles que dérivation, intégration, convolution, transformations de Fourier, à des cadres
dans lesquels ces opérations ne sont a priori pas définies.
L’exemple le plus simple est celui de la fonction “saut”, ou fonction de Heaviside t → Θ(t). Cette
fonction, bien que très simple, est difficile à appréhender dans un cadre de calcul intégral, dans la
mesure où elle ne tend pas vers zéro à l’infini. Elle est également difficile à manipuler dans un cadre
de calcul différentiel, car elle est discontinue en t = 0.
Cependant, l’idée intuitive que l’on peut s’en faire est que sa dérivée, si elle avait un sens, devrait
être nulle pour tout t 6= 0, et “infinie” en t = 0. Dirac a donc proposé de lui associer une “pseudo-
fonction” dérivée, notée δ, définie par un passage à la limite
 
1 t
δ( x ) = lim g ,
e →0 e e

qui possède bien le comportement désiré. Ici, g est une fonction régulière (par exemple une Gaus-
sienne), d’intégrale égale à 1, possédant un maximum en 0.
On va voir que cette limite n’a pas de sens en tant que fonction usuelle ; il s’agit d’une limite d’une
suite de fonctions continues, qui ne définit néanmoins pas une fonction continue (puisqu’elle diverge
en 0.
La théorie des distributions permet de donner un sens à ce type de limites, via l’introduction d’un
concept assez élaboré, le concept de dual d’un espace fonctionnel.

159
8 Distributions et fonctions de Green

8.1 Distributions : définition, propriétés et exemples


8.1.1 Fonctions test et dualité
La notion essentielle pour la théorie des distributions est la notion de dualité.

D ÉFINITION 8.1 Etant donné un espace fonctionnel E, on définit l’espace dual de E, noté E0 ,
comme l’ensemble des formes linéaires continues sur E, c’est à dire l’ensemble des applications
linéaires
T : E → C , f ∈ E → h T, f i ∈ C
satisfaisant les propriétés suivantes :
1. Linéarité : pour toutes f , g ∈ E et λ, µ ∈ C,

h T, λ f + µgi = λh T, f i + µh T, gi , (8.1)

2. Continuité :
f n → f dans E =⇒ h T, f n i → h T, f i dans C (8.2)

Un espace des distributions sera le dual, dans un sens que nous allons voir, d’un espace vectoriel de
fonctions bien choisi, que l’on appellera espace de fonctions test. On verra dans ce qui suit différents
espaces de fonctions test.

8.1.2 Distributions sur R


Les distributions sont donc définies par dualité, en considérant pour espace fonctionnel E l’espace
des fonctions C ∞ à support compact.
D(R) = { f ∈ C ∞ (R), et ∃K ⊂ R, compact, tel que f (t) = 0∀t 6∈ K } . (8.3)
Pour construire le dual D 0 (R) de D(R), il faut définir ce que l’on entend par convergence au sens de
D(R). On dira qu’une suite de fonctions f n ∈ D(R) converge vers f ∈ D(R) si
– il existe un compact K tel que le support de f n soit contenu dans K pour tout n.
(k)
– Pour tout k ∈ Z+ , la suite des dérivées f n converge uniformément vers f (k) .

D ÉFINITION 8.2 Une distribution sur R est une forme linéaire continue

T : D(R) −→ C .

On note D 0 (R) l’espace vectoriel des distributions sur R.

E XEMPLE 8.1 L’exemple le plus simple est celui de la distribution nulle :


0 : f ∈ D(R) → 0 .
Les propriétés de linéarité et continuité sont vérifiées facilement.

E XEMPLE 8.2 La distribution de Dirac δa , où a est un réel quelconque, est définie de la façon sui-
vante : pour toute fonction de test f ∈ D(R),
hδa , f i = f ( a) . (8.4)

160
8.1 Distributions : définition, propriétés et exemples

E XEMPLE 8.3 Le peigne de Dirac, noté h (lettre de l’alphabet cyrillique), associe à toute fonction
test la somme de la série de ses échantillons (ou valeurs ponctuelles) régulièrement espacés.

h h, fi = ∑ f (kh) . (8.5)
k =−∞

Comme f est supposée à support compact, cette série est automatiquement convergente (car finie).
Le peigne de Dirac s’exprime comme

h = ∑ δkh .
k =−∞

En quoi les distributions sont elles des généralisations des fonctions ? on va voir que l’espace D 0 (R)
contient l’espace L1loc (R)... dans un certain sens, qu’on va maintenant préciser. Rappelons tout d’abord
qu’en notant χ I l’indicatrice d’un domaine I ⊂ R :

1 si t ∈ I
χ I (t) =
0 sinon ,

on définit n o
L1loc (R) = f :R→C, f χ I ∈ L1 (R) ∀ I ⊂ R borné . (8.6)

A toute fonction de L1loc (R) on peut associer une distribution de la façon suivante. Soit ϕ ∈ D(R).
Soit Tϕ l’application définie par
Z
h Tϕ , f i = ϕ(t) f (t) dt , ∀ f ∈ D(R) . (8.7)

Comme ϕ, f ∈ D(R), cette intégrale est absolument convergente. De plus, il est immédiat de vérifier
que Tϕ est une forme linéaire sur D 0 (R). Le point le plus délicat à vérifier est la continuité de Tϕ .
Ainsi, à toute fonction localement intégrable f , on peut associer une distribution, appelée distribution
régulière T f ∈ D 0 .

R EMARQUE 8.1 En pratique, on note souvent (abusivement) f la distribution régulière T f associée à


f (et on dit donc L1loc (R) ⊂ D 0 (R), par abus de notation, au lieu de T ( L1loc (R)) ⊂ D 0 (R)).
Ainsi, on note parfois une distribution T ∈ D 0 (R) sous la même forme qu’une fonction t → T (t), et
on écrit alors Z ∞
h T, f i = T (t) f (t) dt .
−∞

Par exemple, on associe à la distribution de Dirac une “fonction généralisée”, notée t → δ(t), qui a la
propriété que pour toute f ∈ D(R)
Z ∞
hδ, f i = f (t)δ(t) dt = f (0) .
−∞

Avec ces notations, on peut donc noter

δa (t) = δ(t − a) ,

de sorte que l’on écrit Z ∞


hδa , f i = δ(t − a) f (t) dt = f ( a) .
−∞
Dans ce qui suit, on essaie au maximum d’éviter de recourir à ce type de notation, qui est cependant
parfois plus pratique pour effectuer des calculs.

161
8 Distributions et fonctions de Green

8.1.3 Propriétés élémentaires


Produit d’une fonction par une distribution

Soit u ∈ C ∞ . Le produit de u par une fonction f ∈ D(R) est toujours une fonction u f ∈ D(R). On a
donc

P ROPOSITION 8.1 Etant donnée une fonction u ∈ C ∞ (R) et une distribution ϕ ∈ D 0 (R), la
forme linéaire
uϕ : f ∈ D(R) → huϕ, f i = h ϕ, u f i
définit une distribution.

E XEMPLE 8.4 Etant donnée la distribution de Dirac δa , et u ∈ C ∞ (R), on a

huδa , f i = hδa , u f i = u( a) f ( a) ,

de sorte que l’on a l’égalité suivante, au sens des distributions

uδa = u( a)δa . (8.8)

Notons en particulier que l’on a nécessairement tδ = 0. Inversement, on a le résultat fondamental


suitant

P ROPOSITION 8.2 Soit T une distribution telle que

tT = 0

(c’est à dire le produit de T par la fonction linéaire t → t est la distribution nulle). Alors T est
multiple de la distribution de Dirac, i.e.

T = αδ , α∈C.

Plus généralement, en appliquant ce résultat plusieurs fois successivement, on aboutit à

P ROPOSITION 8.3 Soit T une distribution telle que

tn T = 0

Alors T est combinaison linéaire de la distribution de Dirac et de ses n − 1 premières dérivées


n −1
T= ∑ αk δ(k) , αk ∈ C .
k =0

R EMARQUE 8.2 Alors que le produit d’une distribution T ∈ D 0 (R) par une fonction C ∞ est bien
définie, le produit d’une distribution par une autre distribution n’a généralement pas de sens, c’est à
dire ne définit par une nouvelle distribution. Par exemple, le produit δδ n’a pas de sens.

162
8.2 Distributions sur Rn

Distributions paires et impaires

On considère l’opérateur parité, défini par

[Π f ](t) = f (−t) .

L’action de cet opérateur sur des distributions se définit de la façon suivante. Etant donnée T ∈
D 0 (R), on note T − ∈ D 0 (R), la distribution définie par

h T − f i = h T, Π f i , ∀ f ∈ D(R) . (8.9)

On rappelle qu’une fonction f est paire si Π f = f , et impaire si Π f = f .

D ÉFINITION 8.3 Une distribution T ∈ D 0 (R) est paire si T − = T, et impaire si T − = − T.

Il est clair que pour toute fonction paire, la distribution régulière associée est paire :
Z ∞ Z ∞ Z ∞
h Tϕ− , f i = ϕ(−t) f (t) dt = ϕ(t) f (−t) dt = ϕ(t) f (t) dt = h Tϕ− , f i .
−∞ −∞ −∞

De même la distribution associée à une fonction impaire est impaire.


Par exemple, on vérifie que la distribution de Dirac δ est paire, alors que sa dérivée δ0 est impaire.

Distributions périodiques

Soit τa l’opérateur de translation par a ∈ R, défini par

[τa ] f (t) = f (t − a) .

Une fonction f est périodique de période a si τa f = f . On définit la translatée τa T d’une distribution


T ∈ D 0 (R) par
hτa T, f i = h T, τ−a f i , ∀ f ∈ D(R) .

D ÉFINITION 8.4 La distribution T ∈ D 0 (R) est périodique de période a ∈ R si τa T = T.

On vérifie facilement que le peigne de Dirac h est périodique de période h.

8.2 Distributions sur Rn


On construit de même les distributions sur Rn . Il suffit d’introduire les espaces E (Rn ) des fonctions
dont toutes les dérivées sont continues, et

D(Rn ) = { f ∈ E (Rn ), supp( f ) borné} .

D ÉFINITION 8.5 Une distribution sur Rn est une forme linéaire continue

T : D(Rn ) −→ C .

On note D 0 (Rn ) l’espace vectoriel des distributions sur Rn .

163
8 Distributions et fonctions de Green

Comme en dimension 1, les exemples ne manquent pas. On définit par exemple les distributions
régulières de la même façon qu’en dimension 1 : en définissant l’espace des fonction localement
intégrables n o
L1loc (Rn ) = f : Rn → C , f χΩ ∈ L1 (R) ∀Ω ⊂ Rn compact . (8.10)

on associe à toute ϕ ∈ L1loc (Rn ) la distribution régulière Tϕ , définie par


Z
h Tϕ , f i = ϕ( x ) f ( x ) dx . (8.11)
Rn

Avec les mêmes précautions qu’en dimension 1, on a parfois tendance à identifier une fonction loca-
lement intégrable ϕ avec la distribution régulière associée Tϕ ... et à associer à des distributions non
régulières T ∈ D 0 (Rn ) une “pseudo-fonction”, ou fonction généralisée, notée x → T ( x ), de sorte que
l’on écrit Z
h T, f i = T ( x ) f ( x ) dx .
Rn
Là encore, il convient d’être très précautionneux avec ce type de notation.

E XEMPLE 8.5 On considère la fonction de Heaviside unidimensionnelle Θ, et on construit la fonction


u : R3 → C suivante
u( x, y, z) = Θ( x ) .
Il s’agit d’une variante 3D de la fonction de Heaviside. Cette fonction est localement intégrable, et
permet donc de définir une distribution régulière.
Soit maintenant v ∈ L1loc (R3 ), définie par

v( x, y, z) = Θ( x )Θ(y)Θ(z) .

La fonction v (que l’ont note aussi Θ ⊗ Θ ⊗ Θ) est l’indicatrice d’un quadrant de l’espace tridimen-
sionnel, et définit une distribution régulière.

E XEMPLE 8.6 Toujours dans R3 , la distribution de Dirac δa , où a ∈ R3 est définie de façon similaire à
la distribution de Dirac unidimensionnelle : pour f ∈ D(R3 ),

hδa , f i = f ( a) . (8.12)

Cependant, il est aussi possible de définir des variantes à la distribution de Dirac. Par exemple, étant
donnée une surface S ⊂ R3 , la distribution de Dirac associée δS est définie par
Z
hδS , f i = f (s) ds , (8.13)
S

c’est à dire associe à toute fonction test son intégrale sur la surface. Ce type d’exemple est courant en
physique, par exemple en électrostatique, où on est couramment amené à considérer des distributions
de charge dite superficielles.
On définit de façon similaire une distribution de Dirac δC associée à une courbe C ⊂ R3 :
Z
hδC , f i = f (u) du . (8.14)
C

Plus généralement, on peut utiliser des distributions unidimensionnelles pour construire des dis-
tributions multidimensionnelles, par la méthode du produit tensoriel. Commençons par le cas des
distributions régulières.
Dans le cas bidimensionnel, soient u, v ∈ L1loc (R). On définit u ⊗ v ∈ D(R2 ) par

(u ⊗ v)( x, y) = u( x )v(y) .

164
8.3 Dérivation des distributions

Soit Tu⊗v la distribution régulière associée. On a alors, pour f ∈ D(R2 )


Z
h Tu⊗v , f i = u( x )v(y) f ( x, y) dx dy
R2
Z ∞ Z ∞ 
= u( x ) v(y) f ( x, y) dy dx
−∞ −∞
Z ∞ Z ∞ 
= v( x ) u(y) f ( x, y) dx dy .
−∞ −∞

De façon générale, étant données T, S ∈ D 0 (R), T agissant sur la variable x et S sur la variable y, on
définira U = T ⊗ S de la façon suivante : pour toute f ∈ D 0 (R2 ),

h T ⊗ S, ϕi = h T, hS, ϕii = h T, hS, ϕii ,

où par exemple h T, ϕi représente la dualité par rapport à la variable x, et produit une fonction de y,
et hS, h T, ϕii représente cette fois la dualité par rapport à la variable y.

8.3 Dérivation des distributions


8.3.1 Le cas unidimensionnel

Les distributions constituant une généralisation des fonctions, la dérivation des fonctions, lorsqu’elle
est bien définie (c’est à dire pour les fonctions à dérivée continue), doit être un cas particulier de
la dérivation des distributions. C’est pourquoi il est utile de se placer tout d’abord dans le cas des
distributions régulières, associées aux fonctions de C1 (R).
Soit ϕ ∈ C1 (R), et soit Tϕ la distribution régulière associée. Soit Tϕ0 la distribution régulière associée
à ϕ0 . On a alors pour tout f ∈ D(R)
Z ∞ Z ∞
h Tϕ0 , f i = ϕ0 (t) f (t) dt = − ϕ(t) f 0 (t) dt = −h Tϕ , f i ,
−∞ −∞

où le terme tout intégré dans l’intégration par parties est nul car f est à support borné. Ceci suggère
de définir la dérivée d’une distribution de la façon suivante :

D ÉFINITION 8.6 Soit T ∈ D 0 (R). Sa dérivée T 0 est définie par

h T 0 , f i = −h T, f 0 i , ∀ f ∈ D(R) . (8.15)

De même, la dérivée p-ième est définie par

h T ( p) , f i = (−1) p h T, f ( p) i , ∀ f ∈ D(R) . (8.16)

On vient de voir que la dérivée de la distribution régulière associée à une fonction ϕ ∈ C1 coı̈ncide
avec la distribution régulière de la dérivée de cette fonction. Qu’en est-il lorsque ϕ n’est plus régulière ?
supposons par exemple que ϕ soit continûment différentiable, sauf en un point t0 où elle admet une
discontinuité de première espèce (c’est à dire que les limites à droite et à gauche de ϕ en t0 existent,
mais diffèrent). On notera
σt0 = lim ϕ(t) − lim ϕ(t) .
t→t0+ t→t0−

165
8 Distributions et fonctions de Green

Calculons alors
Z ∞
h Tϕ0 , fi = − ϕ(t) f 0 (t) dt
−∞
Z t0 Z ∞
= − ϕ(t) f 0 (t) dt − ϕ(t) f 0 (t) dt
−∞ t0
Z t0 Z ∞
= −[ ϕ(t) f (t)]t−0 ∞ − [ ϕ(t) f (t)]∞
t0 + ϕ0 (t) f (t) dt + ϕ0 (t) f (t) dt
−∞ t0
Z ∞
0 0
= σt0 f (t0 ) + ϕ (t) f (t) dt
−∞
= h Tϕ0 + σt0 δt0 , f i ,

de sorte que l’on peut écrire


Tϕ0 = Tϕ0 + σt0 δt0 . (8.17)
On dit alors que la dérivée au sens des distributions est égale à la dérivée au sens des fonctions,
additionnée d’une distribution de Dirac localisée sur le saut, multipliée par la hauteur du saut.
Plus généralement, on montre le théorème suivant, appelé règle d’or

T H ÉOR ÈME 8.1 (R ÈGLE D ’ OR ) Soit ϕ une fonction de classe C1 (R), sauf en t0 , t1 , . . . , où elle
admet des discontinuités de hauteur

σk = lim ϕ(t) − lim ϕ(t) .


t→t+
k t→t−
k

Alors, on a
Tϕ0 = Tϕ0 + ∑ σtk δtk . (8.18)
k

E XEMPLE 8.7 On considère la fonction “escalier”, ou partie entière

t → E(t) = t [mod 1] .

Cette fonction admet une discontinuité en tous les points entiers. Elle est localement intégrable, et
définit donc une distribution régulière. Sa dérivée au sens des distributions vaut

E0 = ∑ δk = .
k =−∞

Similairement, la fonction “dents de scie” t − E(t) admet comme dérivée au sens des distributions la
fonction 1 + .

Dans d’autres situations, la dérivée d’une distribution régulière peut prendre une forme plus com-
plexe. C’est le cas de la valeur principale, que nous allons étudier plus en détails un peu plus bas.
Auparavant, notons la propriété importante suivante, qui généralise au cas des distributions une
propriété utile dans le cas des fonctions.

P ROPOSITION 8.4 Soit T ∈ D 0 (R) et soit u ∈ C ∞ (R). Alors on sait que uT ∈ D 0 (R) est aussi
une distribution, et on a alors
(uT )0 = u0 T + uT 0 . (8.19)

166
8.3 Dérivation des distributions

Preuve : pour toute f ∈ D(R), on a

h(uT )0 , f i = −huT, f 0 i = −h T, u f 0 i = −h T, (u f )0 − u0 f i = hu0 T + uT 0 , f i ,

ce qui démontre la proposition. ♠

8.3.2 Un exemple : la valeur principale de 1/t


Considérons la fonction ϕ(t) = ln |t|. Cette fonction est localement intégrable, et admet donc une
distribution régulière associée Tϕ ∈ D 0 (R). Cependant, sa dérivée usuelle ϕ0 (t) = 1/t n’est pas
localement intégrable, et ne définit donc pas de distribution régulière. On peut toutefois calculer la
dérivée de Tϕ au sens des distributions.
Calculons, pour f ∈ D(R)
Z ∞ Z ∞
h Tϕ0 , fi = − 0
ϕ(t) f (t) dt = − ln |t| f 0 (t) dt .
−∞ −∞

Le point t = 0 nécessite un traitement particulier, on écrit donc


Z
h Tϕ0 , f i = − lim ln |t| f 0 (t) dt ,
e→0 |t|≥e

et on calcule, par exemple


Z ∞ Z ∞
f (t)
ln |t| f 0 (t) dt = [ln(t) f (t)]∞
e − dt
e e t
Z ∞
f (t)
= ln(e) f (e) − dt .
e t
De même,
Z −e Z ∞
ln |t| f 0 (t) dt = ln(t) f 0 (−t) dt
−∞ e
Z ∞
f (−t)
= −[ln(t) f (−t)]∞
e + dt ,
e t
Z −e
f (t)
= − ln(e) f (e) − dt ,
−∞ t
d’où on déduit
f (t)
Z
h Tϕ0 , f i = lim dt . (8.20)
e→0 |t|≥e t
La distribution ainsi définie (dûe à Cauchy) est appelée valeur principale de 1/t , et notée
 
0 1
Tln |t| = v.p. .
t
Il s’agit d’une distribution non régulière (ce qui montre au passage que la dérivée d’une distribution
régulière n’est pas nécessairement régulière).
Un calcul similaire permet de montrer que la dérivée de la valeur principale est une autre distribution
non régulière, appelée partie finie de 1/t2 (dûe au mathématicien français Hadamard), donnée par
   
d 1 1
v.p. = −p.f. 2 ,
dt t t

f ( t ) − f (0)
   
1
Z
p.f. 2 , f = lim dt .
t e→0 |t|≥e t2

167
8 Distributions et fonctions de Green

On définit de façon similaire les parties finies de t−n pour tout n, par

(−1)n−1 dn
   
1 1
p.f. = v.p.
tn (n − 1)! dt n t

On peut montrer facilement que


 
1
t v.p. =1
t

(1 représentant ici la distribution régulière associée à la fonction constante égale à 1). Inversement, on
a aussi

P ROPOSITION 8.5 Soit T une distribution solution de

tT = 1

(le produit de T par la fonction linéaire t → t est la distribution régulière associée à la fonction
constante 1). Alors T est égale à la valeur principale de 1/t, plus un multiple de la distribution de
Dirac  
1
T = v.p. + αδ , α∈C.
t

Preuve : La preuve est une conséquence de la Proposition 8.2. Notons S = T − v.p.(1/t). On a alors
tS = 0, et il suffit d’appliquer la Proposition 8.2 pour conclure. ♠
On montre également le résultat suivant

P ROPOSITION 8.6 Soit T ∈ D 0 , solution de

( t2 − a2 ) T = 1 .

Alors T est de la forme  


1
T = v.p. + αδa + βδ−a ,
t − a2
2

où α, β ∈ C, et où on a noté


      
1 1 1 1
v.p. 2 = v.p. − v.p. .
t − a2 2a t−a t+a

8.3.3 Le cas multidimensionnel

Dans le cas multidimensionnel, les opérations de dérivation partielle des distributions sont définies
similairement au cas unidimensionnel, compme généralisations de la dérivation des distributions
régulières.

168
8.3 Dérivation des distributions

D ÉFINITION 8.7 Soit T ∈ D 0 (Rn ).


1. La dérivé partielle k-ième de T par rapport à la variable x` est définie par
* + * +
∂k T ∂k f
, f = (−1) T, k , ∀ f ∈ D(Rn ) .
k
(8.21)
∂x`k ∂x`

2. Soit α = (α1 , α2 , . . . , αn ), où les αk sont des entiers non-négatifs, un multi-indice. On note

∂|α|
Dα =
∂αx11 ∂αx22. . . ∂αxnn

l’opérateur de dérivation partielle, où on a noté

| α | = α1 + α2 + · · · + α n ,

appelé degré de D α . Alors D α T est définie par

h D α T, f i = (−1)|α| h T, D α f i , ∀ f ∈ D(Rn ) . (8.22)

Comme on l’a signalé, la dérivation des distributions régulières associées aux fonctions de classe
C1 (Rn ) coı̈ncide avec la notion usuelle : soit ϕ ∈ C1 (Rn ). On voit facilement, par intégrations par
parties, que dans ce cas
D α Tϕ = TDα ϕ . (8.23)
Le cas des fonctions présentant des discontinuités est quant à lui plus complexe, comme on va le voir
sur l’exemple suivant.
E XEMPLE 8.8 Soit u = Θ ⊗ Θ ⊗ Θ la fonction localement intégrable définie par
u( x, y, z) = Θ( x )Θ(y)Θ(z) .
Calculons par exemple, pour f ∈ D(R3 )
 3
∂3 f
  
∂ Tu
,f = − Θ ⊗ Θ ⊗ Θ,
∂ x ∂y ∂z ∂ x ∂y ∂z
Z ∞Z ∞Z ∞
∂3 f
= ( x, y, z) dx dy dz
0 0 0 ∂ x ∂y ∂z
= f (0, 0, 0) ,
car f est à support compact. Ainsi, on a
TΘ⊗Θ⊗Θ = δ ,
on retrouve ainsi la distribution de Dirac “ponctuelle” à l’origine.
E XEMPLE 8.9 Si nous considérons maintenant u( x, y, z) = Θ( x ), un calcul similaire montre que pour
toute fonction test f ∈ D(R3 ),  
∂Tu
, f = f (0, y, z) ,
∂x
de sorte que
∂Tu
= δPyOz ,
∂x
la distribution de Dirac associée au plan d’équation x = 0, c’est à dire le plan yOz.
On va maintenant s’intéresser de plus près aux cas bi et tridimensionnels.

169
8 Distributions et fonctions de Green

F IG . 8.1: Un exemple de surface bornée convexe dans R2 , à bord différentiable.

8.3.4 Surfaces fermées dans R2

Considérons une courbe fermée différentiable C du plan, définie par la paramétrisation

γ : s ∈ [0, 1] → γ(s) ∈ R2 .

Cette courbe définit une surface fermée Ω ⊂ R2 , de bord différentiable ∂Ω = C (voir par exemple la
F IG . 8.1, où un exemple de surface fermée convexe du plan est représenté).
La dérivée en tous points de γ permet de définir un vecteur tangent à la courbe en tous points ; on
note t la tangente à la courbe, normalisée de sorte que |t| = 1 :

−1
dγ(s) dγ(s)
t(s) = K , K= .
ds ds

Dans le plan, la tangente suffit à définir le vecteur normal à la courbe, noté n, que l’on choisit orienté
vers l’extérieur.
Soit maintenant ϕ ∈ L1loc (R2 ), telle que ϕ soit continûment différentiable partout sauf sur ∂Ω, où elle
admet une discontinuité de première espèce. On notera, pour ω ∈ ∂Ω

σ(ω ) = ϕext (ω ) − ϕin (ω ) ,

où ϕext (ω ) est la limite de ϕ( x ) quand x → ω par l’extérieur, et une définition similaire pour ϕin (ω ).
Considérons par exemple la dérivation partielle par rapport à la coordonnée x, et étudions ce qui
se passe le long d’une droite d’ordonnée y. Lorsque cette droite n’intersecte pas le domaine Ω, la
dérivée au sens des distributions est égale à la dérivée au sens des fonctions. Lorsqu’elle la droite
d’ordonnée y (représentée en petits tirets sur la F IG . 8.1) intersecte Ω , on notera a(y) et b(y) les
abscisses respectives des deux points où elle intersecte ∂Ω (on a choisi un exemple convexe, il n’y
a donc que deux points d’intersection). Le long de cette droite, ϕ est continûment différentiable par
rapport à x partout sauf en x = a(y) et x = b(y).

170
8.3 Dérivation des distributions

Calculons pour tout f ∈ D(R2 ),


  Z u Z ∞ Z ∞Z ∞
∂Tϕ ∂ f ( x, y) ∂ f ( x, y)
,f = − ϕ( x, y) dx − ϕ( x, y) dx
∂x −∞ −∞ ∂x v −∞ ∂x
Z v  Z a( x ) Z b( x )
∂ f ( x, y) ∂ f ( x, y)
− ϕ( x, y) dx + ϕ( x, y) dx
u −∞ ∂x a( x ) ∂x
Z ∞ 
∂ f ( x, y)
+ ϕ( x, y) dx dy
b( x ) ∂x

 
∂f
Z  
= − Tϕ , + f ( a(y), y) ϕ( a+ (y), y) − ϕ( a− (y), y) dy
∂x −∞
Z ∞  
+ f (b(y), y) ϕ(b+ (y), y) − ϕ(b− (y), y) dy
−∞
D E Z
= T ∂ϕ , f − f (ω ) σ∂Ω (ω ) n x (ω ) dω ,
∂x ∂Ω

où on rappelle que la distribution de Dirac sur une courbe C du plan est définie par
Z
hδC , f i = f (ω ) dω .
C

Ce calcul ne fonctionne que dans le cas particulier d’une surface convexe. Plus généralement, on
montre le théorème suivant

T H ÉOR ÈME 8.2 (R ÈGLE D ’ OR EN DEUX DIMENSIONS ) Soit Ω ⊂ R2 une surface du plan, de
bord différentiable ∂Ω. Soit ϕ : R2 → R, continûment différentiable partout sauf sur la courbe
∂Ω où elle admet une discontinuité de première espèce. Soit n(ω ) = (n x (ω ), ny (ω ))t la normale
extérieure à ∂Ω en ω ∈ ∂Ω. Alors on a
 ∂T
 ∂xϕ = T ∂ϕ + σ∂Ω δ∂Ω n x
∂x
(8.24)
 ∂T∂y
ϕ
= T ∂ϕ + σ∂Ω δ∂Ω n y .
∂y

Pour une fonction localement intégrable vectorielle ψ = (ψ1 , ψ2 ) ∈ D(R2 )2 , notons Tψ la distribution
régulière (vectorielle) correspondante.
On peut appliquer le théorème précédent au gradient d’une distribution : étant donnée ϕ ∈ L2loc (R2 ),
continûment différentiable partout sauf sur ∂Ω où elle admet une discontinuité de première espèce,
on a
Grad Tϕ = TGrad ϕ + n σ∂Ω δ∂Ω . (8.25)

Dans cette équation, Tϕ est une distribution régulière scalaire, son gradient est une distribution vec-
torielle, et TGrad ϕ est également vectorielle.

8.3.5 Domaines fermés dans R3


Passons maintenant au cas tridimensionnel. On considère une surface différentiable S de l’espace,
définie par une application différentiable

γ : (u, v) ∈ [0, 1] × [0, 1] → γ(u, v) ∈ R3 .

171
8 Distributions et fonctions de Green

F IG . 8.2: Un exemple de domaine borné de R3 , à bord différentiable : le tore

Un exemple de telle surface se trouve en F IG . 8.2. Comme dans le cas bidimensionnel, la différentiabilité
de la surface permet de définir en tout point de la surface ω ∈ S non plus une tangente, mais un plan
tangent, caractérisé par les deux vecteurs unitaires

−1
 t(ω ) = K ∂γ(u,v) ,

K = ∂γ(u,v)
∂u ∂u
∂γ(u,v) ∂γ(u,v)
−1
 t0 (ω ) = K 0
 , K0 = ,
∂v ∂v

et une normale extérieure unitaire à la surface n, perpendiculaire à t et t0 .


On définit la distribution de Dirac associée à la surface S de la façon suivante : étant donnée f ∈
D(R3 ), Z
hδS , f i = f (ω ) dω .
S
On peut alors montrer le résultat suivant :

T H ÉOR ÈME 8.3 (R ÈGLE D ’ OR EN TROIS DIMENSIONS ) Soit Ω le domaine de R3 , intérieur à


S (donc ∂Ω = S ), et soit ϕ une fonction localement intégrable dans l’espace R3 , de classe C1
partout sauf sur la surface S = ∂Ω, où elle admet une discontinuité de première espèce. Soit
n(ω ) = (n x (ω ), ny (ω ), nz (ω ))t la normale extérieure à ∂Ω en ω ∈ ∂Ω. Alors on a
 ∂Tϕ

 ∂x = T ∂ϕ + σ∂Ω δ∂Ω n x

 ∂x
∂Tϕ
∂y = T ∂ϕ + σ∂Ω δ∂Ω ny (8.26)
 ∂y
 ∂Tϕ
= T ∂ϕ + σ∂Ω δ∂Ω nz .


∂z ∂z

Comme application, on peut s’intéresser aux trois opérateurs de dérivation classiques : gradient, di-
vergence et rotationnel. Avec les mêmes notations que ci-dessus, le théorème peut s’écrire
Grad Tϕ = TGrad ϕ + nσ δ∂Ω , (8.27)
où on a noté TGrad ϕ la distribution vectorielle dont les trois composantes sont les dérivées partielles
de Tϕ .
Soit maintenant une fonction vectorielle ϕ = ( ϕ1 , ϕ2 , ϕ3 ) où ϕi ∈ L1loc (R3 ) pour i = 1, 2, 3 satisfont
les conditions ci-dessus. On note σ = (σ1 , σ2 , σ3 ) la fonction vectorielle décrivant les sauts des trois
composantes de ϕ sur le bord ∂Ω.
Alors (
DivTϕ = TDiv ϕ + n · σδ∂Ω
(8.28)
RotTϕ = TRot ϕ + n ∧ σδ∂Ω .

172
8.3 Dérivation des distributions

E XEMPLE 8.10 Les équations de Maxwell au sens des distributions : Dans la même situation que
ci-dessus, c’est à dire en présence d’un domaine Ω de bord différentiable ∂Ω, considérons l’équation
de Maxwell
∂B
Rot E = − .
∂t
Supposons l’existence de densités de charge et de courant superficielles sur ∂Ω seulement (pas de
densité volumique). En considérant les champs B et E comme des distributions, écrivons ces équations
au sens des distributions :

Rot TE = − TB ,
∂t
ce qui en appliquant la règle d’or conduit à

TRot (E) + n ∧ σ E δ∂Ω = − T ∂B .


∂t

La composante “volumique” de cette équation (c’est à dire ne faisant pas apparaı̂tre de distribu-
tion superficielle δ∂Ω ) redonne l’équation de Maxwell précédente. Par contre, l’équation superficielle
conduit à
n ∧ σE = 0 ,
c’est à dire à l’égalité des composantes tangentielles du champ électrique à la frontière du domaine.
De même, supposant l’existence d’une densité superficielle de courant j sur ∂Ω, et écrivant au sens
des distributions

Rot TH = Tj + TD ,
∂t
ce qui en sˆ’eparant la partie volumique de la partie superficielle, donne l’équation de Maxwell clas-
sique
TRot H = T ∂D ,
∂t

ainsi que la condition de raccordement du champ magnétique à la frontière, c’est à dire la disconti-
nuité des composantes tangentielles de H :

n ∧ σH = j .

Passons aux équations à la divergence, et supposons l’existence d’une densité superficielle de charge
ρ sur ∂Ω. En écrivant au sens des distributions

Div TD = Tρ ,

on aboutit à l’équation classique pour la partie volumique

TDiv D = Tρ ,

ainsi qu’à la condition de raccordement


n · σD = ρ ,
qui spécifie donc la discontinuité de la composante normale de l’induction électrique. De même, en
utilisant la dernière équation
Div TB = 0 ,
on obtient la continuité de la composante normale de l’induction magnétique.
Ainsi, l’écriture des équations de Maxwell au sens des distributions permet d’unifier le traiteent des
équations elles-mêmes et des conditions de raccordement.

173
8 Distributions et fonctions de Green

8.4 Suites de distributions


De nombreuses distributions sont définies via un passage à la limite d’une suite de distributions
régulières. La convergence au sens des distributions est définie comme suit.

D ÉFINITION 8.8 Une suite de distributions Tn ∈ D 0 (R), n ∈ Z+ converge vers une distribu-
tion limite T ∈ D 0 (R) si pour toute fonction test f ∈ D(R), on a

lim h Tn , f i = h T, f i . (8.29)
n→∞

( p)
Supposons que Tn → T dans D 0 (R), et considérons la suite des dérivées p-ièmes Tn de Tn . On a
pour tout f ∈ D(R)

( p)
lim h Tn , f i = (−1) p lim h Tn , f ( p) i = (−1) p h T, f ( p) i = h T ( p) , f i .
n→∞ n→∞

Ainsi, on a montré

P ROPOSITION 8.7 Soit Tn une suite de distributions convergeant vers T dans D 0 (R). Alors
( p)
Tn 7−→ T ( p)

quand n → ∞.

Les distributions permettent de donner un sens à des limites de suites de fonctions qui n’existent pas
au sens des fonctions, comme le montre l’exemple suivant.

E XEMPLE 8.11 Soit ϕn la suite fonctions localement intégrables définies par

ϕn (t) = sin(2πnt)χ[−1/2,1/2] (t) .

La suite ϕ ne converge pas au sens usuel quand n → ∞ ; en fait, à l’exception des points t = 0 et
t = ±1/2 où ϕn s’annule pour tout n, on n’a jamais convergence simple. Par contre, il est possible de
montrer que
lim h Tϕn , f i = 0 ∀ f ∈ D(R) ,
n→∞

d’où
lim Tϕn = 0
n→∞

au sens des distributions.

Il est tentant de penser que toute suite de fonctions localement intégrables convergeant presque
partout vers une fonction localement intégrable converge au sens des distributions vers la distri-
bution régulière correspondante. Ceci n’est pas tout à fait vrai, mais le devient via une hypothèse
supplémentaire.

174
8.5 Produit de convolution des fonctions et des distributions

P ROPOSITION 8.8 Soit { ϕn ∈ L1loc (R), n ∈ Z+ } une suite convergeant presque partout vers
ϕ ∈ L1loc (R), et telle qu’il existe g ∈ L1loc (R) vérifiant

| ϕn (t)| ≤ g(t) ∀t ∈ R .

Alors
Tϕn 7−→ Tϕ quand n → ∞ .

E XEMPLE 8.12 Soit ϕn la suite fonctions localement intégrables définies par



n si |t| ≤ 1/2n
ϕn (t) =
0 sinon.
On voit que ϕn converge presque partout vers la fonction nulle (en fait, partout sauf en 0, où la limite
n’est pas définie). Par contre, la limite de la suite ϕn (ou plus précisément de la suite des distributions
régulières associées) est bien définie au sens des distributions. Soit en effet f ∈ D(R).
Z 1/2n
h Tϕn , f i = n f (t) dt → f (0) ,
−1/2n

d’où on déduit
Tϕn 7−→ δ
au sens des distributions. Ainsi, la limite de cette suite de distributions régulières est dans ce cas une
distribution non régulière.
Un cas particulièrement important est celui de la convergence vers la distribution de Dirac, qu’on
vient de voir. Plus généralement, on a

T H ÉOR ÈME 8.4 Soit { ϕn } une suite de fonctions localement intégrables, telles que
1. Il existe A > 0 tel que pour tout t ∈ R, |t| ≤ A, ϕn (t) ≥ 0.
2. Pour tout e ∈]0, 1[, |t|≤e ϕn (t) dt → 1 quand n → ∞.
R

3. Pour tout e ≥ 0, ϕn → 0 uniformément dans le domaine |t| ∈]e, 1/e[.


Alors
Tϕn → δ quand n → ∞

8.5 Produit de convolution des fonctions et des distributions


Le produit de convolution des fonctions (et des distributions) joue un rôle fondamental en Phy-
sique. On va se limiter ici au cas des fonctions (et distributions) d’une variable ; la généralisation
des définitions au cas de plus d’une variable se fait assez simplement, mais certaines propriétés et
applications sont parfois bien plus complexes en dimensions supérieures.

8.5.1 Convolution des fonctions


Rappelons tout d’abord la définition du produit de convolution des fonctions. Etant données deux
fonctions f , g d’une variable réelle, leur produit de convolution est la fonction h = f ∗ g définie par
Z ∞
( f ∗ g)(t) = f (s) g(t − s) ds , (8.30)
−∞

175
8 Distributions et fonctions de Green

pour tout t tel que l’intégrale converge. Le produit de convolution possède des propriétés simples : il
est commutatif, et distributif par rapport à l’addition.
La notion de convolution joue un rôle fondamental en physique. Elle intervient en particulier lors-
qu’une quantité physique, représentée par une fonction f , est mesurée à l’aide d’un dispositif expérimental.
Ce dernier est généralement incapable de reproduire les fluctuations les plus rapides de f , et ne donne
pour approximation de la valeur f (t) en t qu’une moyenne locale des valeurs de f dans un voisinage
de t. On représente ceci via un produit de convolution comme en (8.30), où la fonction g est une
fonction localisée autour de 0 (de sorte que g(t − s) est localisée autour de s = t), qui représente en
quelque sorte la réponse du dispositif expérimental.

R EMARQUE 8.3 Un dispositif expérimental parfait admettrait comme réponse une fonction g telle
que f ∗ g = f . Or il s’avère que la réponse g permettant ceci n’est autre que la distribution de Dirac :
Z ∞
f (s)δ(t − s) ds = f (t) .
−∞

8.5.2 Support d’une distribution


Rappelons tout d’abord la notion de support d’une fonction. Par définition, le support d’une fonction
d’une variable réelle f est le plus petit sous-ensemble fermé de R tel que f s’annule en dehors de ce
domaine. Plus généralement, en dimension quelconque, étant donnée f : Rn → C,

Supp( f ) = { x ∈ Rn , f ( x ) 6= 0} ,

la barre représentant la fermeture.


Ceci nous permet de donner un sens à la notion de support d’une distribution.

D ÉFINITION 8.9 Soit T ∈ D 0 (Rn ).


1. T est nulle sur un domaine Ω ⊂ Rn si

h T, f i = 0 ∀ f ∈ D(Rn ) , Supp( f ) ⊂ Ω .

2. Le support de T est le plus petit domaine fermé Ω ⊂ Rn tel que T soit nulle en dehors de ce
domaine.

Bien évidemment, le support d’une distribution régulière Tϕ coı̈ncide avec le support de ϕ.

E XEMPLE 8.13 Il est facile de vérifier que le support de la distribution de Dirac δ est le singleton {0}.
De même, le support de δa est le singleton { a}. En dimension supérieure, le support de la distribution
δC sur une courbe C de R2 est la courbe C elle-même.

Muni de cette définition, on peut alors introduire aussi les notions suivantes

D ÉFINITION 8.10 1. Une distribution T ∈ D 0 (R) est à support limité à gauche si


Supp( T ) ⊂ [ a, ∞[, pour un certain a ∈ R. On note en particulier D+
0 (R) les distribu-

tions à support limité à gauche telles que a ≥ 0.


2. Une distribution T ∈ D 0 (R) est à support limité à droite si Supp( T ) ⊂] − ∞, b[, pour un
certain b ∈ R. On note en particulier D− 0 (R) les distributions à support limité à droite

telles que b ≤ 0.

176
8.5 Produit de convolution des fonctions et des distributions

8.5.3 Convolution des distributions


Comme d’habitude, la convolution des distributions s’obtient comme généralisation de la convolu-
tion des distributions régulières. Considérons donc ϕ, ψ ∈ D(R) et les distributions régulières as-
sociées. Alors, ϕ ∗ ψ ∈ D(R), et on peut considérer Tϕ∗ψ : soit f ∈ D(R),
Z ∞ Z ∞ Z ∞ Z ∞
Tϕ∗ψ , f = ϕ(s)ψ(t − s) f (t) ds dt = ϕ(s)[τs ψ](t) f (t) dt ds ,
−∞ −∞ −∞ −∞

où τs est l’opérateur de translation


[τs f ](t) = f (t − s) .
On reconnait dans l’intégrale sur t l’action de la distribution régulière Tτs ψ = τs Tψ sur f
Z ∞
[τs ψ](t) f (t) dt = hτs Tψ , f i ,
−∞

qui produit donc une fonction de s ; l’intégrale par rapport à t représente alors l’action de Tϕ sur cette
fonction de s, ce que l’on note
Tϕ∗ψ , f = Tϕ , hτ• Tψ , f i ,
où on a aussi noté hτ• Tψ , f i la fonction d’une variable réelle

hτ• Tψ , f i : t −→ hτt Tψ , f i = h Tτt ψ , f i .

Cette fonction possède la propriété suivante

L EMME 8.1 Soit T ∈ D 0 (R). Pour tout f ∈ D(R), la fonction hτ• Tψ , f i est C ∞ . Cette fonction
est à support limité à gauche (resp. à droite) si T est à support limité à droite (resp. à gauche).

Dans un cadre plus général, en définissant l’action d’un opérateur de translation sur une distribution
T ∈ D 0 (R) par
hτs T, f i = h T, τ−s f i ,
on est conduit à définir de même la fonction hτ• T, f i par

hτ• T, f i : t −→ hτt T, f i = h T, τ−t f i . (8.31)

On peut alors introduire le produit de convolution de deux distributions :

D ÉFINITION 8.11 Soient T, S ∈ D 0 (R). Le produit de convolution T ∗ S est défini par

h T ∗ S, f i = h T, hτ• S, f ii , (8.32)

lorsque ces opérations ont un sens.

Malgré cette définition quelque peu formelle, le produit de convolution est relativement simple à uti-
liser, comme on le verra. En pratique, on utilise souvent la notation des distributions comme fonctions
généralisées, ce qui permet de se débarrasser des notations trop lourdes.
En fait, le produit de convolution de deux distributions données n’est pas toujours bien défini. Il l’est
toutefois au prix d’hypothèses supplémentaires.

177
8 Distributions et fonctions de Green

P ROPOSITION 8.9 Soient T, S ∈ D 0 (R). Le produit de convolution est bien défini en tant que
distribution de D 0 (R) quand
1. T et S sont à support limité à gauche. T ∗ S est alors à support limité à gauche. En particu-
lier, le produit de deux distributions de D+ 0 (R) est toujours une distribution de D 0 (R).
+
2. T et S sont à support limité à droite. T ∗ S est alors à support limité à droite. En particulier,
le produit de deux distributions de D− 0 (R) est toujours une distribution de D 0 (R).

3. T et S appartiennent à l’espace E 0 (R) des distributions à support compact, dual de l’espace
E (R) des fonctions indéfiniment différentiables.

Alors, le produit de convolution possède les propriété suivantes :


1. Il est commutatif :
T ∗ S = S ∗ T , S, T ∈ D 0 (R) .
2. Il est distributif par rapport à l’addition :
T ∗ (U + V ) = T ∗ U + T ∗ V , T, U, V ∈ D 0 (R) .
3. Il est associatif,
T ∗ (U ∗ V ) = ( T ∗ U ) ∗ V , T, U, V ∈ D 0 (R) ,
lorsque toutes ces opérations sont bien définies.
E XEMPLE 8.14 La distribution de Dirac est élément neutre pour le produit de convolution :
δ∗T = T , ∀ T ∈ D 0 (R) .
Similairement, pour tout réel a, on montre que
δa ∗ T = τa T ,
d’où, en appliquant cela au peigne de Dirac, on obtient pour tout T ∈ D 0 (R)

h ∗T = ∑ τkh T .
k ∈Z

Cette distribution est appelée périodisée de T de période h.

8.5.4 Equations de convolution


L’utilisation des distributions pour la résolution d’équations différentielles et équations aux dérivées
partielles repose essentiellement sur le résultat suivant :

P ROPOSITION 8.10 1. Soient S, T ∈ D 0 (R), telles que S ∗ T existe dans D 0 (R). Alors

(S ∗ T )0 = S0 ∗ T = S ∗ T 0 ,

et plus généralement, pour tout entier positif n,

( S ∗ T )(n) = S(n) ∗ T = S ∗ T (n) . (8.33)

2. Pour tout T ∈ D 0 (R), et tout entier positif n,

T (n) = δ(n) ∗ T . (8.34)

178
8.5 Produit de convolution des fonctions et des distributions

Preuve : Commençons par la première partie, et supposons que S ∗ T existe. Alors (S ∗ T )0 ∈ D 0 (R)
aussi, et

h(S ∗ T )0 , f i = −hS ∗ T, f 0 i
= − S, hτ• T, f 0 i
= S, h(τ• T )0 , f i
= S, hτ• T 0 , f i
= hS ∗ T 0 , f i

car la dérivation commute avec les translations. L’autre égalité se montre de même. La preuve pour
les dérivées de tous ordres est identique.
Pour la seconde partie, il suffit de remarquer que

T 0 = T 0 ∗ δ = T ∗ δ0 ,

cette démonstration se généralisant elle aussi à tous les ordres. ♠


La conséquence immédiate de cette proposition est que les équations différentielles au sens des distri-
butions peuvent se mettre sous la forme d’équations de convolution. Plus précisément, considérons
une équation différentielle d’ordre n, de la forme

α n X ( n ) + α n −1 X ( n −1) + · · · + α 1 X 0 + α 0 X = Y ,

où les αk sont des coefficients fixés, et le membre de droite Y ∈ D(R) est lui aussi supposé connu.
Cette équation se met sous la forme
T∗X =Y,
où la distribution T est donnée par

T = α n δ ( n ) + α n −1 δ ( n −1) + · · · + α 1 δ 0 + α 0 δ .

La question est alors la suivante : peut on trouver un “inverse” à T pour le produit de convolution. En
d’autres termes, puisque comme on l’a vu, la distribution de Dirac est élément neutre pour le produit
de convolution, existe-t-il une distribution, que l’on note T ∗−1 , telle que

T ∗−1 ∗ T = δ ?

Si tel est le cas, on pourra alors écrire

X = T ∗−1 ∗ T ∗ X = T ∗−1 ∗ Y ,

ce qui résout l’équation différentielle.


La question est : dans quel cadre ce calcul a-t-il un sens ?
Un cadre possible est donné par les algèbres de convolution.

D ÉFINITION 8.12 Une algèbre de convolution dans D 0 (R) est un sous-espace vectoriel A de
D 0 (R), tel que
1. A est stable par convolution : ∀ T, S ∈ A, T ∗ S ∈ A, et le produit de convolution est
commutatif et associatif dans A.
2. δ ∈ A .

179
8 Distributions et fonctions de Green

E XEMPLE 8.15 Les sous-espaces de D 0 (R) suivants sont des algèbres de convolution :
– L’espace E 0 (R) des distributions à support compact.
– L’espace des distributions à support limité à gauche.
– L’espace des distributions à support limité à droite.
– L’espace D+ 0 (R) des distributions à support dans [0, ∞ [.

– L’espace D− (R) des distributions à support dans ] − ∞, 0].


0

Considérons l’équation de convolution


T∗X =Y (8.35)
Etant donnée une algèbre de convolution A, et une distribution T ∈ A, si il existe U ∈ A telle que
U∗T = δ, (8.36)
alors il est possible de montrer que U est unique dans A.

D ÉFINITION 8.13 Etant donnée T ∈ A, l’inverse de convolution U ∈ A de T ∈ A,


vérifiant (8.36), si il existe, est appelé solution élémentaire de (8.35).

E XEMPLE 8.16 Dans D+ 0 (R), soit T ∈ D 0 (R) la distribution de Heaviside (distribution régulière
Θ +
associée à la fonction de Heaviside). On considère l’équation
TΘ ∗ X = Y .
0 (R), on a
On a déjà vu que δ = TΘ0 , et comme δ ∈ D+
δ0 ∗ TΘ = δ ∗ TΘ0 = δ ∗ δ = δ .
0 (R) de l’équation
δ0 est l’inverse de convolution de TΘ , et est donc la solution élémentaire dans D+
ci-dessus.
E XEMPLE 8.17 La primitive peut aussi s’interpréter en termes de solution fondamentale. On considère
0 (R)
cette fois l’équation, toujours dans D+
X 0 = δ0 ∗ X = Y .
Comme on vient de le voir, l’inverse de convolution de δ0 est TΘ , qui est donc solution fondamentale
de l’équation ci-dessus.

8.5.5 Application aux problèmes de valeur initiale


On vient de voir que la dérivation des distributions est équivalente à la convolution avec une dérivée
de la distribution de Dirac. Un domaine d’applications immédiat est constitué par les équations
différentielles. On se limite ici à un cadre relativement simple, en se limitant à l’algèbre de convo-
lution D+ 0 , qui permet toutefois de cerner les points importants.

Considérons l’équation différentielle au sens des distributions

X ( n ) + a n −1 X ( n −1) + · · · + a 1 X 0 + a 0 X = Y , (8.37)
0 (R) est lui aussi fixé. Comme on
où les ak sont des coefficients fixés, et le membre de droite Y ∈ D+
l’a vu, cette équation se met sous la forme
D∗X =Y,
où la distribution D est donnée par

D = δ ( n ) + a n −1 δ ( n −1) + · · · + a 1 δ 0 + a 0 δ . (8.38)

180
8.5 Produit de convolution des fonctions et des distributions

T H ÉOR ÈME 8.5 Soit f une fonction, solution de l’équation différentielle

f ( n ) ( t ) + a n −1 f ( n −1) ( t ) + · · · + a 1 f 0 ( t ) + a 0 f ( t ) = 0 , (8.39)

avec les conditions initiales

f (0 ) = f 0 (0 ) = · · · = f ( n −2) (0 ) = 0 , f ( n −1) (0 ) = 1 . (8.40)


0 (R) de l’équation
Alors la solution fondamentale U = D ∗−1 ∈ D+

D∗X =Y,

où D est donné en (8.38) est la distribution régulière

U = Tf Θ , (8.41)
0 (R)
et (8.37) admet donc l’unique solution dans D+
0
X = T f Θ ∗ Y ∈ D+ (R) . (8.42)

Preuve : soit donc U = T f Θ . Un calcul direct montre que

U0 = Tf 0 Θ , . . . U ( n − 1 ) = T f ( n −1) Θ , U ( n ) = T f (n) Θ + δ .

Par conséquent, on a bien

U (n) + an−1 U (n−1) + · · · + a1 U 0 + a0 U (t) = T f (n) +an−1 f (n−1) +···+a1 f 0 +a0 f + δ = δ ,

ce qui montre que U est une solution fondamentale. U ∈ D+ 0 , et est donc l’unique solution fonda-
0
mentale dans D+ . Finalement, on voit facilement que U ∗ Y est solution de l’équation différentielle.
Comme U, Y ∈ D+ 0 , qui est une algèbre de convolution, on en déduit le résultat. ♠

E XEMPLE 8.18 Considérons l’exemple simple d’un circuit RC ; on note V1 la tension générée par un
générateur, et V2 la tension aux bornes du condensateur. Comme on l’a vu, V1 et V2 sont liés par
l’équation
τV20 + V2 = V1 ,
où τ = RC. Il s’agit donc d’un problème de la forme

X 0 + λX = Y ,

avec X = V2 , λ = 1/τ et Y = V1 /τ. La solution élémentaire prend donc la forme d’une distribution
régulière
U = Tuθ ,
où u, solution de u0 + λu avec u(0) = 1 est donné par

u(t) = e−λt .

Finalement, la solution est donc


1
V2 = X = TuΘ ∗ Y = TuΘ ∗ V1 .
τ

181
8 Distributions et fonctions de Green

La solution élémentaire possède une interprétation physique simple : elle donne la réponse du système
à une “impulsion élémentaire”, représentée par une distribution de Dirac :

TuΘ = TuΘ ∗ δ .

C’est pourquoi on appelle parfois réponse impulsionnelle la solution élémentaire.


Dans le cas où le système étudié (ici le circuit RC) est excité par une distribution Y plus complexe, la
solution V2 apparaı̂t comme une superposition de ces réponses impulsionnelle.
Supposons maintenant que Y soit une distribution régulière, Y = Tϕ pour une certaine fonction
ϕ ∈ L1loc (R). On a alors
V1 = TuΘ ∗ Tϕ = T(uθ )∗ ϕ .
La fonction v = (uΘ) ∗ ϕ prend la forme
Z ∞ Z ∞ Z ∞
v(t) = u(s)Θ(s) ϕ(t − s) ds = u(s) ϕ(t − s) ds = e−s/τ ϕ(t − s) ds .
−∞ 0 0

8.6 Transformations de Laplace et Fourier des distributions


La transformation de Fourier joue elle aussi un rôle fondamental, et la théorie des distributions per-
met de lui donner un sens dans des cas où la définition usuelle (au sens des fonctions) n’en a plus.

8.6.1 Espace de Schwartz et distributions tempérées

D ÉFINITION 8.14 1. Une fonction f ∈ C ∞ (R) est dite à décroissance rapide si pour tout
entier positif k, on a
lim tk | f (t)| = 0 . (8.43)
t→±∞

L’espace des fonctions C∞


dont toutes les dérivées sont à décroissance rapide est appelé
Espace de Schwartz, et noté S(R).

On peut facilement voir que toute fonction de D(R) appartient automatiquement à l’espace de Schwartz.
De plus, toute fonction de S(R) est de carré intégrable. On a donc

D(R) ⊂ S(R) ⊂ L2 (R) .

Pour préciser la topologie de S(R), il est nécessaire de définir la convergence dans S(R). On dira
qu’une suite de fonctions { f n ∈ C ∞ (R), n ∈ Z+ } converge vers f si pour tout k, la suite des dérivées
d’ordre k de f n converge uniformément vers f (k) .
On peut alors définir les distributions tempérées :

D ÉFINITION 8.15 Une distribution tempérée est une forme linéaire continue sur l’espace de
Schwartz. Les distributions tempérées forment un espace vectoriel, noté S 0 (R).

Comme conséquence des inclusions ci-dessus, on montre également les includsions inverses au ni-
veau des espaces duaux :
L2 (R) ⊂ S 0 (R) ⊂ D 0 (R) .

182
8.6 Transformations de Laplace et Fourier des distributions

E XEMPLE 8.19 Les exemples les plus simples de distributions tempérées sont les distributions régulières.
Cependant, toute distribution régulière n’est pas nécessairement tempérée. En effet, étant donnée
ϕ ∈ L1loc (R), h Tϕ , f i peut être bien définie pour toute fonction test f ∈ D(R), mais pas pour f ∈ S(R).
2
Par exemple, en prenant ϕ(t) = et pour tout t, h Tϕ , f i n’est pas bien défini pour une large classe de
fonctions f ∈ S(R) (par exemple f (t) = et ). Il est nécessaire de faire des hypothèses supplémentaires
sur ϕ.
On dit que ϕ ∈ L1loc (R) est à croissance lente si il existe A, M et k tels que pour tout |t| ≥ M, on
ait | ϕ(t)| ≤ A|t|k . On montre alors que les distributions régulières associées à de telles fonctions à
croissance lente sont tempérées.
Par exemple, TΘ est une distribution tempérée.

E XEMPLE 8.20 On montre facilement que toutes les distributions de Dirac et leurs dérivées sont des
distributions tempérées. En effet, leur action sur les fonctions test de l’espace de Schwartz est bien
définie. Par exemple, hδ(n) , f i = (−1)n f (n) (0) est bien défini pour tout entier n si f ∈ S(R).

Il est possible de montrer pour les distributions tempérées un certain nombre de propriétés similaires
à celles que nous avions rencontrées dans D 0 (R). Notamment

P ROPOSITION 8.11 Soit T ∈ S 0 (R). Alors


1. T ( p) ∈ S 0 (R) pour tout p ∈ Z+ .
2. PT ∈ S 0 (R) pour tout polynôme P.

8.6.2 Transformation de Laplace des distributions


Commençons par aborder brièvement la transformation de Laplace. Comme dans le cas des fonctions,
on se limitera ici au cas de distributions à support borné à gauche, plus précisément aux distributions
de D+0 (R).

D ÉFINITION 8.16 Soit T une distribution à support borné à gauche, telle qu’il existe α tel que
pour tout x ≥ α, la distribution e− xt T (t) soit tempérée. La transformée de Laplace unilatérale de
T est la distribution régulière

[L T ]( p) = h T, e− p• i . (8.44)

La borne inférieure des α satisfaisant cette propriété est appelée abscisse de sommabilité.

Il est important d’insister sur le fait que la transformée de Laplace ainsi définie est une distribution
régulière, c’est à dire une distribution de type « fonction ». Ceci simplifie beaucoup les choses dans
certains calculs.
Par exemple, la distribution de Dirac est elle même une distribution tempérée, à support borné à
gauche, et admet une transformée de Laplace

[Lδ]( p) = 1 , (8.45)

avec abscisse de sommabilité égal à −∞.


Le lien entre transformation de Laplace et dérivation reste assez simple, voire plus simple que dans
le cas des fonctions.

183
8 Distributions et fonctions de Green

P ROPOSITION 8.12 Soit T ∈ D+ 0 , et soit T 0 sa dérivée. Alors si T admet une transformée de

Laplace L T, T 0 admet également une transformée de Laplace L T 0 , qui satisfait

[L T 0 ]( p) = p[L T ]( p) .

Il est à noter que ce résultat est compatible avec celui que nous avons vu dans le cas des fonctions. En
effet, considérons ϕ ∈ L1loc (R+ ), continûment différentiable sur R+ , et soit T = TΘϕ . On a alors

[ TΘϕ0 ]0 = TΘϕ0 + ϕ(0)δ ,

et par application de la transformation de Laplace,

[L TΘϕ0 ]( p) = p[L TΘϕ ]( p) − ϕ(0) ,

ce qui coı̈ncide avec la règle de transformation de Laplace de la dérivée des fonctions.

E XEMPLE 8.21 On a déjà vu que la transformée de Laplace de la distribution de Dirac est la fonction
constante égale à 1. plus généralement, on a en notation « fonction » (rappelons que la transformée
de Laplace est une fonction)
[Lδ(n) ]( p) = pn , n∈N. (8.46)

Pour finir, il est intéressant de caractériser les distributions qui sont transformées de Laplace d’une
distribution :

P ROPOSITION 8.13 Toute fonction p → F ( p), holomorphe et majorée par un polynôme en p


0 .
dans un demi-plan <( p) > α est transformée de Laplace d’une distribution de D±

0
E XEMPLE 8.22 Application au calcul de certaines fonctions de Green dans D+
0 doit satis-
1. Considérons le cas de la dérivation : la fonction de Green correspondante G dans D+
0
faire G = δ, d’où par transformation de Laplace

pG ( p) = 1 .

On en déduit (rappelons que la transformée de Laplace d’une distribution est une distribution
régulière) que
1
[L G ]( p) = , <( p) > 0 ,
p
dont on a vu que c’était la transformée de Laplace de la fonction de Heaviside, d’où

G = TΘ .

Donc, la solution de l’équation T 0 = S est de la forme T = TΘ ∗ S, sans surprise quand on


se souvient que convoluer avec la fonction de Heaviside est la même chose que calculer la
primitive valant 0 à l’origine.
2. Considérons le cas de l’opérateur de Helmholtz : d2 /dt2 + ω02 . Les fonctions de Green satisfont
G 00 + ω02 G = δ, soit dans le domaine de Laplace

( p2 + ω02 )[L G ]( p) = 1 ,

184
8.6 Transformations de Laplace et Fourier des distributions

dont la solution (L G étant une fonction) est [L G ]( p) = 1/( p2 + ω02 , avec <( p) > 0. La solution
prend donc la forme de la distribution régulière

1
G (t) = TΘg , g(t) = sin(ω0 t) .
ω0

Notons que la présence de la fonction de Heaviside dans cette affaire provient du domaine de
définition de L G, à savoir <( p) > 0.

8.6.3 Transformée de Fourier des distributions tempérées


On rappelle la propriété centrale de la transformation de Fourier des fonctions, appelée formule
d’échange : pour toutes fonctions f , g ∈ L1 (R), on a
Z ∞ Z ∞
f (t) ĝ(t) dt = fˆ(s) g(s) ds .
−∞ −∞

La transformation de Fourier des distributions généralise cette propriété aux distributions tempérées.

D ÉFINITION 8.17 Soit T ∈ S 0 (R). Sa transformée de Fourier T


b est la distribution tempérée
définie par
b f i = h T, fˆi ,
h T, ∀ f ∈ S(R) . (8.47)
On note F l’opérateur de transformation de Fourier :

b = FT .
T

E XEMPLE 8.23 Distributions de Dirac. Calculons δ̂ : pour toute fonction test f ∈ S(R),
Z ∞
1
hδ̂, f i = hδ, fˆi = fˆ(0) = √ f (t) dt .
2π −∞

Par conséquent, la transformée de Fourier de la distribution de Dirac est, à une constante près, la
distribution régulière associée à la fonction identiquement égale à 1 :

1
δ̂ = √ T1 . (8.48)

De même, pour tout a ∈ R,
Z ∞
1
hδ̂a , f i = hδa , fˆi = fˆ( a) = √ f (t)e−iat dt ,
2π −∞

d’où on déduit
1
δ̂a = √ Tea , (8.49)

où ea est la sinusoı̈de
ea (t) = e−iat .

E XEMPLE 8.24 Sinusoı̈des. Calculons tout d’abord


Z ∞ √
h Tb1 , f i = h T1 , fˆi = fˆ(ω ) dω = 2π f (0) ,
−∞

185
8 Distributions et fonctions de Green

d’après la formule d’inversion de Fourier, qui s’applique (point par point) pour les fonctions de S(R).
On a donc √
Tb1 = 2π δ . (8.50)
Si on prend le parti de noter les distributions sous forme de fonction généralisée, on notera alors
1
Z ∞ √
√ e−iωt dt = 2π δ(ω ) ,
2π −∞

d’où la formule suivante, extrêmement utile dans les calculs :


Z ∞
1
δ(ω ) = e−iωt dt . (8.51)
2π −∞

De même, on montre facilement que √


ea =
Tc 2π δ−a , (8.52)
que l’on interprète aussi en termes de fonctions généralisées comme
Z ∞
1
δ(ω + a) = e−i(ω +a)t dt .
2π −∞

8.6.4 Propriétés
La transformation de Fourier des distributions tempérées possède la plupart des propriétés “standar-
d” de la transformation de Fourier des fonctions. On en donne une liste (non exhaustive) ci-dessous.
1. Linéarité. On vérifie facilement que pour tous T, S ∈ S 0 (R) et λ ∈ C,

T+S = T
\ b + Sb (8.53)
c = λT
λT b. (8.54)

2. Comportement vis à vis des translations et modulations. Soit a ∈ R, et soit τa l’opérateur de


translation par a : τa f (t) = f (t − a). En notant comme plus haut ea la fonction qui à tout t ∈ R
associe ea (t) = e−iat , on a
τda T = ea T . (8.55)
b

De même, en notant comme d’habitude ea T le produit de la distribution (tempérée) par la fonc-


tion C ∞ ea ,
eda T = τ− a T . (8.56)
b

8.6.5 Transformation de Fourier et dérivation


Comme on l’a vu plus haut, l’espace de Schwartz ainsi que l’espace des distributions tempérées sont
stables par dérivation. Par conséquent, étant donnée une distribution tempérée T, à laquelle on sait
associer sa transformée de Fourier T, b on sait également associer une transformée de Fourier à toutes
ses dérivées, qui sont elles aussi dans S 0 (R).
Par ailleurs, on sait que pour toute fonction f ∈ S(R),

( fˆ)0 (ω ) = (− \ it) f (ω )
ˆf 0 (ω ) = iω fˆ(ω ) ,

où on a noté it la fonction qui à t associe it.


Ecrivons donc, pour T ∈ S 0 (R) et tout f ∈ S(R)

h Tb0 , f i = h T 0 , fˆi = −h T, ( fˆ)0 i = −h T, (−


\ it f )i = h T,
b it f i = hit T,
b fi .

186
8.6 Transformations de Laplace et Fourier des distributions

Ceci étant vrai pour tout f ∈ S 0 (R), on a donc montré

Tb0 = it T
b. (8.57)

Similairement, calculons

b0 , f i = −h T,
hT b f 0 i = −h T, fˆ0 )i = −h T, it fˆi = h(−
\ it) T, f i .

En étendant ces calculs aux dérivées d’ordres quelconques, on montre similairement

T H ÉOR ÈME 8.6 Soit T ∈ S 0 (R). Alors on a, pour tout entier positif n,

Td(n) = (it )n T
b (8.58)
Tb(n) = (−
\ it)n T (8.59)

E XEMPLE 8.25 Dérivées de distributions de Dirac. En appliquant directement les expressions que
nous venons de voir, et l’expression de la transformée de Fourier de distributions de Dirac, on obtient
directement
( p) = (it ) p δ̂ = √1 (it ) p T .
δd (8.60)
1

E XEMPLE 8.26 Distribution de Heaviside. Pour simplifier les notations, on notera Θ la distribution
régulière TΘ associée à la fonction de Heaviside Θ. De l’égalité Θ0 = δ on déduit la relation

b = √1
iω Θ

d’où on déduit, d’après la Proposition 8.5 que Θ̂ est nécessairement de la forme


 
1 1
Θ = √ v.p.
b + aδ
i 2π ω

pour une certaine constante a. Cette dernière est déterminée grâce à la remarque suivante : la fonction
Θ − 1/2 est réelle et impaire, de même que la distribution associée. Par conséquent, la transformée
de Fourier
√ de Θ − 1/2 doit être impaire également. Donc, la transformée √ de Fourier de 1/2 valant
δ/2 2, et la distribution de Dirac étant paire, on a nécessairement a = 1/2 2, d’où
   
1 1
Θ= √
b v.p. + iπδ . (8.61)
i 2π ω

De même, en notant Θ− la distribution régulière associée à t → Θ(−t), on a


   
1 1
Θ− =
b √ −v.p. + iπδ . (8.62)
i 2π ω

Finalement, notons sgn = Θ + Θ− la distribution régulière associée à la fonction qui à t associe son
signe :
sgn = Θ − Θ− .
On a alors  
2 1
gn = √ v.p.
sd
i 2π ω

187
8 Distributions et fonctions de Green

8.6.6 Inversion de la transformation de Fourier


La transformation de Fourier des distributions tempérées hérite de la propriété d’inversibilité de la
transformation de Fourier dans l’espace de Schwartz. En effet, si f ∈ S(R), alors fˆ(ω ) est bien défini
pour tout ω ∈ R, et on a, pour tout t ∈ R,
Z ∞
1
f (t) = √ fˆ(ω )eiωt dω , (8.63)
2π −∞

ce que l’on note


f = F fˆ ,
l’opérateur linéaire F étant appelé transformée de Fourier conjuguée, ou transformée de Fourier
adjointe. On peut donc noter
F F = 1S(R) , F F = 1S(R) . (8.64)
Ceci permet de définir la transformation de Fourier conjuguée des distributions tempérées : si T ∈
S 0 (R), on définit sa transformée de Fourier conjuguée Ť = F T par dualité :

h Ť, f i = h T, fˇi . (8.65)

On voit alors facilement que pour tout TR ∈ S 0 (R) et tout f ∈ S(R),

hF F T, f i = hF T, F f i = h T, F F f i = h T, f i ,

d’après (8.64), d’où on déduit

T H ÉOR ÈME 8.7 La transformation de Fourier des distributions tempérées est inversible : on a

F F = 1 S 0 (R) , F F = 1 S 0 (R) . (8.66)

Ce résultat trouve de nombreuses applications, notamment pour la résolution d’équations différentielles,


et d’équations aux dérivées partielles en dimensions supérieures.

8.7 Application au calcul des fonctions de Green


On a déjà vu plus haut l’intérêt de la transformation de Fourier pour la résolution des équations
différentielles (ou équations aux dérivées partielles) à coefficients constants. La transformation de
Fourier permet également le calcul explicite de Fonctions de Green, dans le même contexte, et en
prenant en compte des conditions aux bords ou aux limites.
Le schéma général est le suivant : étant donné un opérateur différentiel linéaire D, une fonction de
Green G de D satisfait
DG = δ .
Par transformation de Fourier, cette équation devient

b = √1 ,
d = HG
DG

où H est une distribution, et c’est cette dernière équation qu’il faut ensuite résoudre au sens des
distributions.

188
8.7 Application au calcul des fonctions de Green

0
8.7.1 Exemple simple : fonction de Green de l’opérateur de dérivation dans D+
Reprenons l’exemple de l’opérateur D = d/dt en dimension 1. Par transformation de Fourier, on
aboutit à l’équation
b(ω ) = √1 ,
iω G

d’où on déduit  
b(ω ) = √1 v.p.
G
1
+ cδ ,
i 2π ω

pour une certaine constante c. Or nous savons d’après l’Exemple 8.26 que G b est donc égal à la trans-
formée de Fourier de la distribution de Heaviside, à un terme additif de la forme c0 δ près. Donc G
est de la forme G = TΘ + c00 pour une certaine constante c00 . Parmi toutes les valeurs possibles de c00 ,
la seule qui assure G ∈ D+0 est c00 = 0. Donc l’unique fonction de Green G ∈ D 0 du problème est la
+
distribution de Heaviside
G = TΘ . (8.67)

8.7.2 Oscillateur harmonique 1D


Considérons le cas de l’oscillateur harmonique, défini comme solution de l’équation différentielle

f 00 (t) + ω02 f (t) = u(t) . (8.68)

Par définition, une fonction de Green associée à cette équation doit donc satisfaire l’équation

G 00 + ω02 G = (δ00 + ω02 δ) ∗ G = δ , (8.69)

ce qui en passant dans le domaine de Fourier, conduit à

1
(ω02 − ω 2 ) Ĝ (ω ) = √ . (8.70)

A ce point, on pourrait conclure que Ĝ (ω ) = 1/(ω02 − ω 2 ), et terminer le calcul par transforma-


tion de Fourier inverse, mais c’est aller un peu vite en besogne. En effet, au sens des distributions,
l’équation (8.70) n’admet pas une solution unique, comme le montre la Proposition 8.6. La solution
est de la forme
 
1 1
Ĝ (ω ) = √ v.p. + αδω0 + βδ−ω0
2π ω02 − ω 2
    
1 1 1
= √ −v.p. + v.p. + αδω0 + βδ−ω0 ,
2ω0 2π ω − ω0 ω + ω0

pour certaines constantes α, β ∈ C. Notons que ces deux constantes sont précisément les constantes
d’intégration qui apparaissent lorsque l’on veut résoudre une équation différentielle du second ordre.
On obtient de la sorte une famille paramétrique de fonctions de Green, définies pour l’instant dans
le domaine de Fourier. Il faut maintenant en calculer les transformées de Fourier inverses. Pour celà,
nous avons déjà vu dans l’Exemple 8.16 que v.p.(1/ω ) est la transformée de Fourier de la distribution
isgn/2. On a donc
1
G (t) = sin(ω0 t)sgn(t) + α0 eiω0 t + β0 e−iω0 t
2ω0
pour certaines constantes α0 , β0 ∈ C.

189
8 Distributions et fonctions de Green

Il est maintenant temps de se préoccuper des conditions aux bords. On peut par exemple voir que le
choix α0 = − β0 = 1/2ω0 conduit à une fonction de Green causale Gret ∈ D+ 0 , appelée fonction de

Green retardée
1
Gret (t) = Θ(t) sin(ω0 t) (8.71)
ω0
alors que le choix α0 = − β0 = −1/2ω0 produit la fonction de Green avancée Gav ∈ D− 0 , qui est

anticausale
1
Gav (t) = − Θ(−t) sin(ω0 t) (8.72)
ω0
La fonction de Green retardée est précisément celle que nous avons obtenue plus haut en utilisant la
transformation de Laplace.
R EMARQUE 8.4 Nous nous sommes spécialisés ici sur les problèmes de type problème de Cauchy, c’est
à dire des problèmes dans lesquels l’équation considérée est complétée par des données initiales. Des
techniques similaires s’appliquent pour des problèmes aux bords, par exemple des problèmes dans
lesquels l’équation différentielle est considérée sur un intervalle, et complétée par des conditions aux
bords. Les conditions aux bords peuvent alors être utilisées pour fixer les valeurs des constantes α et
β ci-dessus.

8.7.3 Un exemple multidimensionnel : l’opérateur de la chaleur


Nous avons déjà vu l’utilisation de la transformation de Laplace pour résoudre l’équation de la cha-
leur. Nous allons maintenant étudier l’approche basée sur les distributions.
On considère l’opérateur différentiel L agissant sur les fonctions de deux variables par
∂u ∂2 u
Lu( x, t) = ( x, t) − α 2 ( x, t) (8.73)
∂t ∂x
Soit G une fonction de Green de L : on a donc
∂G ∂2 G
( x, t) − α 2 ( x, t) = δ( x )δ(t) . (8.74)
∂t ∂x
Introduisons une transformation de Fourier en temps et en espace. En notant respectivement ω et k
les fréquences temporelle et spatiale, la transformée de Fourier Ĝ de G est solution de
1
(iω + αk2 ) Ĝ (k, ω ) = . (8.75)

Donc, à une distribution solution de (iω + αk2 ) Ĝ (k, ω ) = 0 près, la solution est de la forme
1 1 1 1
Ĝ (k, ω ) = 2
= . (8.76)
2π iω + αk 2iπ ω − iαk2
La transformation de Fourier inverse par rapport à la variable ω peut se calculer en utilisant le
théorème des résidus. Sans entrer dans les détails, notons que pour t < 0, la présence d’un terme
eiωt dans l’intégrand force à prolonger le contour d’intégration par un demi-cercle dans le demi-plan
complexe inférieur, à l’intérieur duquel l’intégrand est holomorphe. Ainsi,
G ( x, t) = 0 ∀t < 0 . (8.77)
Pour t > 0 on doit prolonger par un demi-cercle dans le demi-plan complexe supérieur, à l’intérieur
duquel l’intégrand admet un pôle simple en ω = iαk2 . En notant G̃ (k, t) la transformée de Fourier
temporelle inverse, le théorème des résidus1 fournit donc
1 2 2
G̃ (k, t) = 2iπe−αk t = e−αk t .
2iπ
1 La vérification du fait que l’intégrale sur le demi-cercle tend vers 0 quand le rayon tend vers l’infini est laissée en exercice

au lecteur,... qui ne demande que ça.

190
8.7 Application au calcul des fonctions de Green

Il suffit maintenant de calculer la transformée de Fourier inverse de G̃ :


Z ∞
1 1 2 /4αt
G ( x, t) = − √ G̃ (k, t)eikx dk = √ e− x , (8.78)
2π −∞ 2αt
une expression déjà vue quelque part.
La solution de l’équation aux dérivées partielles

∂u ∂2 u
( x, t) − α 2 ( x, t) = v
∂t ∂x
prend finalement la forme d’un produit de convolution bidimensionnel
Z ∞ Z ∞
u( x, t) = ( G ∗ v)( x, t) = G ( x 0 , t0 )v( x − x 0 , t − t0 ) dt0 dx 0 .
−∞ 0

Il faut noter que cette solution correspond à une condition initiale nulle : limt→0 u( x, t) = 0. Pour tenir
compte d’une contition initiale non-nulle, il faut ajouter une solution u0 de l’équation homogène,
satisfaisant une condition initiale donnée

u0 ( x, 0) = T0 ( x ) .

Ce problème peut lui aussi être résolu grâce aux distributions. Introduisons une solution sous forme
de distribution régulière (notée comme fonction pour simplifier) U0 ( x, t) = u0 ( x, t)Θ(t). La distribu-
tion U0 satisfait
∂U0 ∂2 U0
( x, t) − α 2 ( x, t) = T0 ( x )δ(t)
∂t ∂x
d’où on déduit la solution Z ∞
U0 ( x, t) = G ( x 0 , t) T0 ( x − x 0 ) dx 0 ,
−∞
et finalement
Z ∞ Z ∞ Z ∞
v( x, t) = G ( x 0 , t0 )v( x − x 0 , t − t0 ) dt0 dx 0 + G ( x 0 , t) T0 ( x − x 0 ) dx 0 . (8.79)
−∞ 0 −∞

191
8 Distributions et fonctions de Green

192
Cinquième partie

Opérateurs linéaires

193
C HAPITRE

9
Opérateurs linéaires

9.1 Introduction, rappels


Dans cette section, on revoit les notions de base d’algèbre linéaire, en se plaçant sur le corps des
complexes C, en dimension finie et infinie, avec toutefois l’accent sur la dimension finie.
Commençons par le premier rappel suivant :
Soient E, F deux espaces vectoriels sur C. Une application f : E → F est linéaire si pour tous x, y ∈ E
et tous λ, µ ∈ C, on a f (λx + µy) = λ f ( x ) + µ f (y). Une application f : E → F est antilinéaire si pour
tous x, y ∈ E et tous λ, µ ∈ C, on a f (λx + µy) = λ f ( x ) + µ f (y).

9.1.1 Formes sesquilinéaires, formes Hermitiennes

D ÉFINITION 9.1 Soit E un espace vectoriel sur C.


1. Une forme sesquilinéaire sur E est une application

γ : E×E → C,

qui est antilinéaire par rapport à la première variable, et linéaire par rapport à la seconde.
En d’autres termes, pour tous x, y, z ∈ E et λ, µ ∈ C, on a

γ(λx + µy, z) = λγ( x, z) + µγ(y, z) , (9.1)


γ( x, λy + µz) = λγ( x, y) + µγ( x, z) . (9.2)

2. Une forme sesquilinéaire γ sur E est Hermitienne si pour tous x, y ∈ E,

γ(y, x ) = γ( x, y) . (9.3)

E XEMPLE 9.1 les exemples suivants donnent un premier aperçu de situations possibles.
1. Soit E = C2 , muni de la base canonique.
 Pour  x, y ∈ E, caractérisés par leurs coordonnées
 tous
x1 y1
par rapport à la base : x = et y = , on définit
x2 y2
γ( x, y) = x1 y1 + x2 y2 .
On vérifie facilement qu’il s’agit d’une forme Hermitienne.
2. Avec les mêmes notations, toujours dans E = C2 , on définit
 
1 i
γ( x, y) = x1 y1 + 3x2 y2 + ix1 y2 − ix2 y1 = xt y.
−i 3
De nouveau, on vérifie facilement qu’il s’agit d’une forme Hermitienne.

195
9 Opérateurs linéaires

3. Passons maintenant à un exemple en dimension infinie. On note C0 (Z) l’ensemble des suites
(infinies) {un , n ∈ Z} à support fini :
C0 (Z) = {u : Z → C, ∃ N ∈ Z∗ |un = 0 si |n| > N } .
On définit alors γ = C0 (Z) × C0 (Z) → C par

γ( x, y) = ∑ x n yn , x, y ∈ C0 (Z) .
n=−∞

Il s’agit là encore d’une forme Hermitienne.


4. Considérons maintenant l’espace C ([0, 1]) des fonctions continues dans l’intervalle [0, 1]. On
vérifie facilement que l’application γ définie par
Z 1
γ( f , g) = f (t) g(t) dt , f , g ∈ C ([0, 1])
0

est une forme Hermitienne.


5. Avec les mêmes notations, étant donnée une fonction de deux variables a : [0, 1] → C bornée,
l’application γ définie par
Z 1
γ( f , g) = a(t) f (t) g(t) dt , f , g ∈ C ([0, 1])
0

est une forme sesquilinéaire, qui est Hermitienne si et seulement si a est à valeurs réelles.

9.1.2 Bases, matrices


Commençons par considérer le cas d’espaces vectoriels complexes de dimension finie (voir la re-
marque 9.3 ci dessous pour la dimension infinie). Soit E un tel espace, de dimension dim( E) = n, et
soit B = {e1 , . . . en } une base de E. Soit γ : E × E → C une forme sesquilinéaire sur E.
Soient x, y ∈ E, quelconques, et soient x = ( x1 , . . . xn )t et y = (y1 , . . . yn )t leurs vecteurs colonne de
coordonnées par rapport à la base B . Alors on peut écrire
!
n n n n
γ( x, y) = γ ∑ x i ei , ∑ y j e j = ∑ ∑ x i y j γ ( ei , e j ) = x t Γ y , (9.4)
i =1 j =1 i =1 j =1

où Γ est la matrice dont les éléments sont donnés par


Γij = γ(ei , e j ) . (9.5)

R EMARQUE 9.1 La forme sesquilinéaire γ est Hermitienne si et seulement si sa matrice dans la base
considérée est telle que
Γt = Γ .
On dit que la matrice Γ est Hermitienne.
Par exemple, dans les exemples (1) et (2) de l’exemple 9.1, les matrices, respectivement
   
1 0 1 i
, et ,
0 1 −i 3
sont Hermitiennes.
Il est important de se souvenir que la matrice d’une forme sesquilinéaire dépend de la base choisie.
Lorsque l’on passe d’une base à une autre, la matrice change, comme l’exprime la remarque suivante.

196
9.1 Introduction, rappels

R EMARQUE 9.2 Soit γ une forme sesquilinéaire sur E, soit B = {e1 , . . . en } une base de E, et soit Γ
la matrice de γ par rapport à cette base. Soit B 0 = {e10 , . . . en0 } une autre base de E. On rappelle que
les coordonnées x d’un vecteur x ∈ E par rapport à la base B se transforment en coordonnées x 0 par
rapport à la base B 0 comme
x 0 = P −1 x , (9.6)
où P = PB→B 0 est la matrice de passage de la base B à la base B 0 , dont les colonnes sont les compo-
santes des vecteurs ei0 dans la base B . En d’autres termes,
 0
e = P11 e1 + P21 e2 + · · · + Pn1 en ,
 10


e2 = P12 e1 + P22 e2 + · · · + Pn2 en ,
(9.7)

 ... = ...
 0
en = P1n e1 + P2n e2 + · · · + Pnn en .

On peut alors écrire, pour tous x, y ∈ E,

γ( x, y) = x t Γy = x 0t Pt ΓPy0 ,

de sorte que la matrice de γ dans la base B 0 prend la forme

Γ0 = Pt ΓP . (9.8)

R EMARQUE 9.3 Le cas des espaces de dimension infinie. Si l’espace vectoriel considéré est un espace
de dimension infinie, et étant donnée une base de cet espace {e1 , e2 , , . . .}, il est encore possible d’as-
socier une matrice Γ à une forme sesquilinéaire γ : E × E → C. Cette matrice est toujours constituée
des images des vecteurs de base, comme en (9.5), mais il s’agit cette fois d’une matrice infinie. Les
manipulations effectuées dans cette section se transposent facilement à ce nouveau cas, à condition
toutefois de vérifier que les opérations sont bien définies.

9.1.3 Rang et noyau


Dans cette section, on se limite de nouveau au cas d’espaces vectoriels complexes de dimension finie.

D ÉFINITION 9.2 1. Soit γ une forme sesquilinéaire sur E. Le rang de γ, noté rg (γ), est
défini comme le rang de la matrice Γ, c’est à dire la dimension de l’espace engendré par les
vecteurs-colonne de Γ.
2. γ est non-dégénérée si son rang est égal à la dimension de E, ou de façon équivalente, si
det(Γ) 6= 0.

Cette définition peut donner l’impression que le rang d’une forme sesquilinéaire dépend de la base
dans laquelle la matrice est calculée. Il n’en est rien, en effet les matrices de passage étant toujours
inversibles, l’équation (9.8) montre que pour toute autre base B 0 , le rang de la matrice associée Γ0 est
égal au rang de Γ.

D ÉFINITION 9.3 Le noyau de la forme sesquilinéaire γ : E × E → C est défini par

N (γ) = {y ∈ E, γ( x, y) = 0 ∀ x ∈ E} . (9.9)

197
9 Opérateurs linéaires

R EMARQUE 9.4 Nous avons déjà remarqué que dans une base quelconque de E, on a γ( x, y) = x t Γy.
Donc, dire que γ( x, y) = 0 pour tout x ∈ E revient à dire que Γy = 0, de sorte que la définition du
noyau de γ coı̈ncide avec la définition du noyau de la matrice associée Γ.

Le dernier résultat de cette section, donné sans démonstration, est un résultat fondamental de l’algèbre
linéaire.

T H ÉOR ÈME 9.1 Soit γ une forme sesquilinéaire sur l’espace vectoriel complexe E. Alors on a

dim( E) = rg (γ) + dim( N (γ)) . (9.10)

9.1.4 Réduction d’une forme Hermitienne

Parmi les bases d’un espace vectoriel sur C, certaines sont particulièrement bien adaptées à une forme
Hermitienne donnée.

D ÉFINITION 9.4 Une base B = {e1 , e2 , . . .} de l’espace vectoriel complexe E est orthogonale
pour la forme Hermitienne γ si pour tous i, j, on a

γ ( ei , e j ) = 0 , si i 6= j . (9.11)

Dans une telle base, la matrice Γ de γ prend une forme diagonale :

 
a1 0 0 . . .
 0 a2 0 . . . 
Γ= ,
 
 0 0 a3 . . .  
.. .. .. . .
. . . .

les nombres ai étant des réels (car γ est supposée Hermitienne). En d’autres termes, étant donnés
x, y ∈ E, en notant x = ( x1 , x2 , . . . )t et y = (y1 , y2 , . . . )t leurs coordonnées par rapport à cette base, on
peut écrire,

γ( x, y) = ∑ ai xi yi .
i

Un autre résultat fondamental de l’algèbre linéaire montre qu’en dimension finie, il existe toujours
de telles bases. Plus précisément,

198
9.1 Introduction, rappels

T H ÉOR ÈME 9.2 Soit γ une forme Hermitienne sur E, espace vectoriel complexe de dimension
finie.
1. Il existe toujours une base orthogonale pour γ.
2. Il existe une base orthogonale B = {e1 , . . . en } telle que la matrice Γ de γ dans cette base
prenne la forme
 
1 0 ... 0
 0 1 ... 0 
.. .. . . ..
 
.
 

 . . . 


 0 0 ... 1 


 −1 0 . . . 0 

 0 −1 . . . 0 
Γ=  , (9.12)
 
.. .. .. ..

 . . . . 


 0 ... ... −1 


 0 0 ... 0 


 0 0 ... 0 

 .. .. . . .. 
 . . . . 
0 0 ... 0

de sorte que l’on puisse écrire pour tous x, y ∈ E, en notant x = ( x1 , x2 , . . . )t et y =


(y1 , y2 , . . . )t leurs coordonnées par rapport à cette base,
p r
γ( x, y) = ∑ x i yi − ∑ x i yi , (9.13)
i =1 i = p +1

r étant le rang de γ. Le couple ( p, r − p) est appelé signature de γ, et noté sign(γ).

La seconde partie de ce théorème porte le nom de théorème d’inertie de Sylvester.

E XEMPLE 9.2 Reprenons le cas (2) de l’exemple 9.1. On a manifestement, en utilisant la méthode de
réduction de Gauss,

γ( x, x ) = | x1 |2 + 3| x2 |2 + ix1 x2 − ix2 x1 = | x1 + ix2 |2 + 2| x2 |2 ,

et on vérifie sans peine que

γ( x, y) = ( x1 + ix2 )(y1 + iy2 ) + 2x2 y2 .

On est donc dans ce cas en présence d’une forme non-dégénéré, de signature (2,0). γ est diagonale
dans le nouveau système de coordonnées

x10 = x1 + ix2 ; x20 = x2 .

199
9 Opérateurs linéaires

9.1.5 Espaces pré-Hilbertiens, espaces Hermitiens

D ÉFINITION 9.5 1. Une forme Hermitienne γ sur E est positive si γ( x, x ) ≥ 0 pour tout
x ∈ E.
2. Elle est définie si γ( x, x ) = 0 implique x = 0.
3. Si γ n’est pas définie, un vecteur x ∈ E tel que γ( x, x ) = 0 est dit isotrope.

Notons qu’une forme Hermitienne définie est non-dégénérée.

D ÉFINITION 9.6 1. Un espace pré-Hilbertien est un espace vectoriel sur C, muni d’une forme
Hermitienne définie positive.
2. Un espace pré-Hilbertien de dimension finie est appelé espace Hermitien.

On utilise généralement une notation spécifique lorsque l’on se place dans un cadre d’espace pré-
Hilbertien. La forme Hermitienne correspondante, appelée produit scalaire Hermitien est notée h·|·i et
on note aussi q
k · k : x → kxk = hx|xi .

R EMARQUE 9.5 Cette application est appelée norme associée au produit Hermitien. Elle possède en
effet les propriétés d’une norme :
1. kλx k = |λ| k x k, pour tous x ∈ E et λ ∈ C.
2. k x k = 0 implique x = 0.
3. k x + yk ≤ k x k + kyk pour tous x, y ∈ E (inégalité de Minkowsky).
Par ailleurs, la connaissance de la norme est suffisante pour caractériser le produit scalaire Hemmi-
tien, grâce à l’identité de polarisation

h x |yi = k x + yk2 − k x − yk2 − i k x + iyk2 + i k x − iyk2 .

Une propriété essentielle des espaces pré-Hilbertiens est l’inégalité de Cauchy-Schwarz :

P ROPOSITION 9.1 Soit E un espace pré-Hilbertien. ALors pour tous x, y ∈ E, on a

|h x, yi| ≤ k x k kyk ,

l’inégalité devenant une égalité si et seulement si x et y sont proportionnels.

Une grande vertu des espaces Hermitiens est qu’ils possèdent toujours une base orthonormée. En
effet, d’après le théorème d’inertie de Sylvester (voir théorème 9.2 plus haut), on peut toujours trouver
une base orthogonale pour la forme Hermitienne , telle que les éléments diagonaux de la matrice
vaillent 1, -1 ou 0. La forme Hermitienne étant supposée définie positive, les valeurs -1 et 0 sont
impossibles, ce qui prouve ce résultat.

200
9.2 Opérateurs linéaires dans les espaces Hermitiens

9.2 Opérateurs linéaires dans les espaces Hermitiens


Les notions introduites dans ce qui suit peuvent l’être dans un cadre plus général que ce qui est fait
ici. On a plutôt choisi pour simplifier de se limiter au cadre des espaces Hermitiens, dans lesquels on
a l’assurance de pouvoir disposer de bases orthonormées par exemple.

9.2.1 Définitions

D ÉFINITION 9.7 1. Soit H un espace Hermitien. Un opérateur linéaire de H (aussi appelé


endomorphisme de H) est une application linéaire A : H → H.
2. La norme d’un opérateur linéaire A sur H est définie par

k Ax k
k Akop = sup . (9.14)
x ∈H kxk

La norme d’un opérateur A sur un espace Hermitien H peut aussi s’écrire

|h Ax |yi|
k Akop = sup .
x,y∈H k x k k y k

Etant donné un opérateur linéaire A sur H, et une base B de H, on peut construire la matrice M = M A
de A par rapport à cette base : il s’agit de la matrice dont les colonnes sont les composantes de Ae1 ,
Ae2 ,... Aen par rapport à la base :


 Ae1 = M11 e1 + M21 e2 + · · · + Mn1 en ,
Ae2 = M12 e1 + M22 e2 + · · · + Mn2 en ,

(9.15)

 . .. = ...
Aen = M1n e1 + M2n e2 + · · · + Mnn en .

Considérons x ∈ H, et notons x = ( x1 , . . . xn )t le vecteur colonne de ses coordonnées par rapport à la


base B . On peut donc écrire
n
x= ∑ x i ei ,
i =1

et donc !
n n n n n
Ax = ∑ xi ∑ Mji e j = ∑ ∑ Mji xi ej = ∑ ( Mx) j e j .
i =1 j =1 j =1 i =1 j =1

Par conséquent, les coordonnées de Ax dans la base B = {e1 , . . . en } sont données par le vecteur
colonne Mx :
Ax = M A x .

R EMARQUE 9.6 En prenant des produits scalaires avec les vecteurs de base, on obtient par exemple

he1 | Ae1 i = M11 he1 |e1 i + M21 he2 |e1 i + · · · + Mn1 hen |e1 i = (Γt M)11 ,

et plus généralement, en notant M̃ la matrice définie par

M̃ij = hei | Ae j i ,

201
9 Opérateurs linéaires

on a
M̃ = Γt M .
La situation est évidemment plus simple si la base B considérée est orthonormée pour la forme Her-
mitienne h · | · i. Dans ce cas, Γ est la matrice identité, et M̃ = M.

D ÉFINITION 9.8 Soit A un opérateur linéaire de H. Le rang de A est la dimension de l’image


AH de H par A. Le noyau de A est le sous-espace de H dont l’image par A est nulle :

N ( A) = { x ∈ H, Ax = 0} . (9.16)

Le théorème de la dimension est un résultat fondamental :

T H ÉOR ÈME 9.3 Soit A : E → E un opérateur linéaire sur l’espace vectoriel de dimension finie
E. Alors on a
dim( E) = rg( A) + dim( N ( A)) . (9.17)

Les exemples les plus simples d’opérateurs sont les opérateurs de rang 1, c’est à dire les opérateurs
dont l’image est de dimension 1. La forme générale de ces opérateurs est la suivante : étant donnés
u, v ∈ H, on construit l’opérateur suivant :
A(u, v) : x ∈ H → hv| x iu , (9.18)
qui sont parfois notés (en mécanique quantique notamment) comme des “dyades”
A(u, v) = |uihv| .
Un cas particulier important est fourni par les opérateurs de projection orthogonale de rang 1, qui
correspondent au cas v = u, avec kuk = 1.
On peut également s’intéresser aux opérateurs de projection orthogonale de rang supérieur à 1. On
peut facilement montrer la proposition suivante :

P ROPOSITION 9.2 Soit H un espace Hermitien, soit F ⊂ H un sous-espace de H, et soit


{ f 1 , . . . f m } une base orthonormée de F. Alors l’opérateur de projection orthogonale Π F de H
sur F est la somme des projecteurs orthogonaux de rang 1
m
ΠF = ∑ A( f i , f i ) . (9.19)
i =1

Preuve : Soit x ∈ H, quelconque, et notons x0 = Π F x = ∑m k =1 αk f k son projeté orthogonal sur F. Alors


on a pour tout i = 1, . . . m, x − x0 ⊥ f i , ce qui s’écrit
h f i | x − x0 i = 0 , ∀i = 1, . . . m .
En remplaçant x0 par son expression, on aboutit à
m
h fi |xi = ∑ α k h f i | f k i = αi ,
k =1
d’où
m
x0 = Π F x = ∑ h f k |xi f k ,
k =1
ce qui est le résultat recherché.

202
9.2 Opérateurs linéaires dans les espaces Hermitiens

9.2.2 Opérateur adjoint


La notion d’opérateur adjoint est une notion fondamentale.

T H ÉOR ÈME 9.4 Soit H un espace Hermitien. Pour tout opérateur linéaire A de H, il existe un
unique opérateur linéaire A∗ , appelé opérateur adjoint de A, tel que pour tous x, y ∈ H,

h x | Ayi = h A∗ x |yi . (9.20)

Considérons une base B , orthonormée pour la forme Hermitienne de H. Alors la matrice de l’adjoint
A∗ de A dans cette base n’est autre que la conjuguée Hermitienne (en d’autres termes, le complexe
conjugué de la transposée) de la matrice de A. En effet, on peut écrire
n n n n
h x | Ayi = x t My = ∑ xi ∑ Mij y j = ∑ ∑ Mij xi y j = Mt xt y
i =1 j =1 j =1 i =1

Ceci s’écrit donc


M A∗ = MtA . (9.21)

R EMARQUE 9.7 Lorsque la base considérée n’est pas orthonormée, la relation est quelque peu plus
complexe : il faut cette fois écrire
M A∗ = Γ−1 MtA Γ .

L’adjoint possède un certain nombre de propriétés simples, qui sont énoncées ci-après

P ROPOSITION 9.3 Pour tous opérateurs linéaires A, B sur H, et tout λ ∈ C,


1. A∗∗ = A ; 1∗ = 1.
2. ( A + B)∗ = A∗ + B∗ ; (λA)∗ = λA∗ ; ( AB)∗ = B∗ A∗ .
3. rg ( A∗ ) = rg ( A).

Preuve : La plupart de ces propriétés sont démontrées de façon élémentaire. Par exemple pour la
première : pour tous x, y ∈ H, on a

h x | A∗∗ yi = h A∗ x |yi = h x | Ayi ,

ce qui montre bien que A∗∗ = A. De façon similaire,

h( AB)∗ x |yi = h x | AByi = h A∗ x | Byi = h B∗ A∗ x |yi .

E XEMPLE 9.3 1. Dans C2 , on considère l’opérateur linéaire déterminé dans la base canonique par
la matrice
1√−i −1
!

M= 3 3
−1
√ 1√+i
3 3
L’adjoint de cet opérateur est déterminé par la matrice
1√+i −1
!

∗ 3 3
M = −1 1√−i .

3 3

203
9 Opérateurs linéaires

2. Dans C3 , on considère l’opérateur linéaire déterminé par la matrice


 √ √ 
1/√ 2 1/ √2 0
M =  i/ 2 −i/ 2 0  .
0 0 i

On peut aussi vérifier que M∗ est également l’inverse de M, de sorte que l’on a MM∗ = M∗ M =
1. De tels opérateurs sont dits unitaires.
3. Soient u, v ∈ H, espace Hermitien, et soit A(u, v) l’opérateur de rang 1 associé, défini en (9.18).
Pour tous x, y ∈ H, on a

h x | A(u, v)yi = h x |hv|yiui = hv|yih x |ui = hhu| x iv|yi = h A(v, u) x |yi ,

de sorte que l’adjoint de l’opérateur de rang 1 A(u, v) n’est autre que l’opérateur de rang 1
A(v, u) :
A(u, v)∗ = A(v, u) . (9.22)

4. De façon plus générale, étant donnés un espace Hermitien H et un sous-espace F ⊂ H, la


projection orthogonale Π F de H sur F (voir Proposition 9.2) est auto-adjointe :

Π∗F = Π F .

9.2.3 Diagonalisation des opérateurs autoadjoints


On rappelle que v ∈ E est vecteur propre de l’opérateur A si il vérifie

Av = λv ,

pour un certain λ ∈ C. λ est appelé valeur propre de A. Le sous-espace propre associé à λ est l’ensemble
des vecteurs propres de A de valeur propre λ :

Eλ = {v ∈ E, Av = λv} .

A est diagonalisable s’il existe une base {e1 , . . .} telle que la représentation de A dans cette base soit
diagonale.  
a1 0 . . . 0
M A =  0 a2 . . . 0  (9.23)
 
.. . . .. .
.
. . . .

D ÉFINITION 9.9 Un opérateur linéaire A sur H est auto-adjoint si A∗ = A, c’est à dire si pour
tous x, y ∈ H,
h x | Ayi = h Ax |yi . (9.24)

Compte tenu de la forme donnée en (9.21) pour la matrice de l’adjoint dans une base orthonormée,
il est clair que A est auto-adjoint si et seulement si sa matrice M A dans une base orthonormée est
Hermitienne, c’est à dire telle que
MtA = M A . (9.25)
Le résultat fondamental concernant les opérateurs linéaires auto-adjoints en dimension finie est le
suivant :

204
9.2 Opérateurs linéaires dans les espaces Hermitiens

T H ÉOR ÈME 9.5 Soit A un opérateur auto-adjoint sur un espace Hermitien H.


1. Les valeurs propres de A sont toutes réelles.
2. A est diagonalisable.
3. Les sous-espaces propres de A sont orthogonaux deux à deux. On peut donc construire une
base orthonormée de H en choisissant une base orthonormée dans chaque sous-espace propre
de A.

En termes de matrices et vecteurs, ce résultat est équivalent au résultat suivant.

C OROLLAIRE 9.1 Toute matrice Hermitienne est diagonalisable, et possède des valeurs propres
réelles. Les sous-espaces propres correspondants sont deux à deux orthogonaux pour le produit
scalaire Hermitien canonique dans Cn : h x |yi = ∑1n xi yi .

Partant du théorème 9.5, on peut donner de la formule (9.23) l’interprétation suivante : soit x ∈ H, sa
décomposition sur la base orthonormée qui diagonalise A est
n
x= ∑ h ei | x i ei , (9.26)
i =1

et l’image de x par A s’écrit quant à elle


n
Ax = ∑ a i h ei | x i ei . (9.27)
i =1

Une telle expression porte le nom de représentation spectrale de l’opérateur A.


R EMARQUE 9.8 Partant de leur représentation spectrale, il est possible de construire simplement cer-
taines fonctions d’opérateurs. Commençons par les puissances. Etant donné un opérateur autoadjoint
quelconque A ∈ L(H), sa puissance k-ième est obtenue en appliquant k fois consécutivement A. En
utilisant (9.27), on obtient facilement la représentation spectrale du carré de A :
n n
A2 x = ∑ ai hei |xi Aei = ∑ a2i hei |xiei .
i =1 i =1

Plus généralement, on a de même, pour tout k ∈ N


n
Ak x = ∑ aik hei |xiei .
i =1

De là, on peut également construire des fonctions plus élaborées d’opérateurs. L’exemple le plus
simple est la fonction exponentielle : en écrivant

1
exp( A) = ∑ k! Ak ,
k =0

on obtient de même la représentation spectrale de l’exponentielle de l’opérateur audo-adjoint A :


pour tout x ∈ H,
∞ ∞ n n
1 1
exp( A) x = ∑ k! Ak x = ∑ k! ∑ aik hei |xiei = ∑ exp(ai )hei |xiei .
k =0 k =0 i =1 i =1

205
9 Opérateurs linéaires

Partant de là, on obtient également les représentations spectrales d’autres fonctions d’opérateurs,
pourvu que ces fonctions puissent être développées en série entière, et que les problèmes de conver-
gence de ces dernières puissent être évités. Nous n’entrerons pas dans les détails de ces problèmes
ici.

La norme des opérateurs auto-adjoints prend une forme particulièrement simple. En effet, on a

P ROPOSITION 9.4 Soit A un opérateur auto-adjoint sur l’espace Hermitien H, et soit λmax la
plus grande (en valeur absolue) de ses valeurs propres. Alors

k Akop = |λmax | . (9.28)

Preuve : Supposons que A ait été diagonalisé, notons a1 , . . . a N ses valeurs propres (réelles, car A est
auto-adjoint). Partant de la représentation spectrale (9.27), on peut écrire pour tout x = ∑in=1 αi ei

k Ax k2 ∑in=1 a2i |αi |2


= .
k x k2 ∑in=1 |αi |2

Supposons sans perte de généralité que la plus grande valeur propre (en valeur absolue) soit a1 , et
écrivons
n
∑in=1 ( ai /a1 )2 − 1 |αi |2

k Ax k2 2
2 ∑i =1 ( ai /a1 ) | αi |
2
2
= a1 = a1 + .
k x k2 ∑in=1 |αi |2 ∑in=1 |αi |2
Le second terme est toujours négatif ou nul, de sorte que l’on a

k Ax k2
≤ a21 ,
k x k2

et l’inégalité devient une égalité si et seulement si αi = 0 pour tout i tel que | ai | < | a1 |. Donc k Akop =
| a1 |, ce qui prouve la proposition.

E XEMPLE 9.4 1. Dans un espace Hermitien H, soit u ∈ H, tel que kuk = 1, et soit A(u, u) le
projecteur orthogonal sur Cu ⊂ H. Si on note K le complément orthogonal de Cu dans H, c’est
à dire le sous-espace de H engendré par les vecteurs orthogonaux à u, on a pour tout v ∈ Cu,
A(u, u)v = v, et pour tout v ∈ K, A(u, u)v = 0. Par conséquent, A(u, v) admet 0 et 1 pour
valeurs propres, et la décomposition
H = Cu ⊕ K
est la décomposition de H en sous-espaces propres correspondants. Il est clair que k A(u, u)kop =
1.
2. Similairement, soit F ⊂ H un sous-espace de H, et soit ΠF le projecteur orthogonal de H sur
F . Soit K le complément orthogonal de F dans H. Alors pour tout v ∈ F , ΠF v = v, et pour
tout v ∈ K, ΠF v = 0. Le projecteur orthogonal ΠF admet 0 et 1 pour valeurs propres, et la
décomposition
H = F ⊕K
est la décomposition de H en sous-espaces propres correspondants. De nouveau kΠF kop = 1.
3. Considérons le cas de H = C2 , et soit A ∈ L(C2 ), défini par sa matrice dans la base canonique :
 
2 1+i
MA = .
1−i 2

206
9.2 Opérateurs linéaires dans les espaces Hermitiens

A est clairement auto-adjoint (car M A possède la symétrie Hermitienne : MtA = M A ), et est donc
diagonalisable. Chercher les vecteurs propres et valeurs propres de A revient à diagonaliser M A ,
donc à rechercher les racines (en λ) du polynôme caractéristique

P(λ) = det( M A − λ1) = (2 − λ)2 − (1 + i )(1 − i ) = λ2 − 4λ + 2 .


√ √
Les racines sont λ± = 2 ± 2, donc k Akop = λ+ = 2 + 2. Les vecteurs propres correspondants
ont pour coordonnées dans la base canonique
!
1√+i
1
e± = √ 2
2 ±1

On peut écrire √
 
2+ 2 0√
MA = P P −1 ,
0 2− 2
où P est la matrice de passage, dont les colonnes ne sont autres que les vecteurs e± :
!
1√+i 1√+i
1
P= √ 2 2 .
2 1 −1

Finalement, la représentation spectrale de A s’écrit


√ √
Ax = (2 + 2)he+ | x ie+ + (2 − 2)he− | x ie− .

9.2.4 Diagonalisation simultanée d’opérateurs auto-adjoints qui commutent


Etant donnés deux opérateurs sur un espace Hermitien, ils ne sont généralement pas diagonaux dans
la même base, sauf dans certaines situations particulières. Considérons tout d’abord le cas de deux
opérateurs auto-adjoints A et B sur H, et soit

[ A, B] = AB − BA
leur commutateur. Supposons que [ A, B] = 0, soit a ∈ R une valeur propre quelconque de A, soit

H a = { x ∈ H, Ax = ax }
le sous-espace propre associé, et soit x ∈ H a un vecteur propre de A, de valeur propre a. Calculons

ABx = BAx = aBx .

Nous avons montré que Bx est lui aussi vecteur propre de A avec la même valeur propre. En d’autres
termes, le sous-espace propre de A de valeur propre a est stable par B. En diagonalisant la restriction
de B à ce sous-espace propre, nous obtenons donc une base orthonormée de H a , formée de vecteurs
propres simultanés de A et B. Ceci étant vrai pour toute valeur propre a de A, on a donc montré le
résultat important suivant :

T H ÉOR ÈME 9.6 Soient A et B deux opérateurs auto-adjoints sur H, tels que [ A, B] = 0. Alors
il existe une base orthonormée de H formée de vecteurs propres simultanés de A et B.

Ce résultat, et sa généralisation aux opérateurs auto-adjoints en dimension infinie, prend toute son
importance en mécanique quantique, où la diagonalisation simultanée d’observables (opérateurs
auto-adjoints) qui commutent permet de spécifier l’état quantique d’un système. Nous considèrerons
des exemples plus loin.

207
9 Opérateurs linéaires

9.3 Opérateurs linéaires dans les espaces de Hilbert


9.3.1 Généralités
Après avoir analysé le cas de la situation finie, passons maintenant au cas plus général.

D ÉFINITION 9.10 Un espace de Hilbert est un espace pré-Hilbertien, complet pour la norme
issue du produit Hermitien.

En d’autres termes, on impose que toute suite de Cauchy dans un espace de Hilbert converge dans
cet espace.

R EMARQUE 9.9 1. Le cas de la dimension finie est le plus simple : tout espace Hermitien est un
espace de Hilbert.
2. L’exemple classique d’espace de Hilbert est l’exemple des espaces de fonctions de module carré
intégrable. Par exemple, l’espace
 Z 1 
2
L ([0, 1]) = f : [0, 1] → C, | f (t)| dt < ∞
2
,
0

muni du produit Hermitien


Z 1
h f | gi = f (t) g(t) dt , f , g ∈ L2 ([0, 1])
0

est un espace de Hilbert.


3. Un exemple d’espace pré-Hilbertien qui n’est pas un espace de Hilbert est fourni par l’espace
C ([0, 1]) des fonctions continues sur [0, 1], muni du même produit Hermitien que L2 ([0, 1]). En
effet, considérons la suite de fonctions f n ∈ C ([0, 1]), définies par f n (t) = inf(n, t−1/3 ). Un calcul
simple montre que pour tout n,
3
k f n + p − f n k2 ≤ ,
n
de sorte qu’il s’agit bien d’une suite de Cauchy. Par contre, il est aussi facile de voir que lorsque
n → ∞, f n tend vers t → t−1/3 , qui n’est pas continue en t = 0. Ainsi, cette suite ne converge
pas dans C ([0, 1]), et cet espace n’est donc pas un espace de Hilbert.

R EMARQUE 9.10 On se limitera ici au cas des espaces de Hilbert séparables, c’est à dire admettant
au moins une base orthonormée. C’est un cadre suffisamment large pour ce dont nous avons besoin.
On peut par exemple montrer que tous les espaces de fonctions de module carré intégrable sont des
espaces de Hilbert séparables.

Comme plus haut, étant donné un espace de Hilbert H, nous appellerons opérateur sur H une appli-
cation linéaire
A:H→H
bornée, au sens où sa norme

k Ax k |h x | Ayi|
k Akop = sup = sup
x ∈H kxk x,y∈H k x k k y k

208
9.3 Opérateurs linéaires dans les espaces de Hilbert

est finie. On note L(H) l’ensemble des opérateurs sur un espace de Hilbert H. On montre facilement
qu’étant donnés deux opérateurs A, B ∈ L(H), leur somme et leur produit (ou leur composition) est
également un opérateur de L(H). De plus, on a l’inégalité

k ABkop ≤ k Akop k Bkop .

E XEMPLE 9.5 1. Opérateurs scalaires : étant donné un espace de Hilbert H, on considère l’opérateur
A ∈ L(H) défini par
Ax = λx , ∀ x ∈ H ,
où λ ∈ C est une constante. On vérifie facilement que k Akop = |λ|.
2. Opérateurs de rang 1 : ces opérateurs sont définis similairement à leurs analogues en dimension
finie. Etant donnés u, v ∈ H, on note A(u, v) l’opérateur défini par

A(u, v) x = hv| x iu , ∀x ∈ H .
Il est clair que si u 6= 0 et v 6= 0, dim( A(u, v)H) = dim(Cu) = 1, il s’agit donc d’un opérateur
de rang 1.
3. Opérateurs de rang fini et projecteurs orthogonaux : Les opérateurs de rang fini, qui jouent un
rôle important dans la théorie des opérateurs compacts (voir plus bas), sont définis comme
sommes d’opérateurs de rang 1 : partant d’une suite de vecteurs u1 , . . . u N , v1 , . . . v N ∈ H, on
construit A : H → H, défini par
N N
A= ∑ A(un , vn ) : x ∈ H → ∑ hvn | x iun .
n =1 n =1

Un cas particulier est fourni par le cas dans lequel un = vn pour tout n, et les vecteurs un
forment une base orthonormée de l’espace qu’ils engendrent. On montre alors facilement qu’un
tel opérateur A est le projecteur orthogonal sur l’espace en question.
4. Opérateurs définis par une matrice infinie : Supposons que B = {e1 , e2 , . . .} soit une base ortho-
normée de l’espace de Hilbert H, et soit A ∈ L(H). A est caractérisé par les images des vecteurs
de base. Plus précisément, pour tout

v= ∑ h ei | v i ei ∈ H ,
i =1

on a

Av = ∑ hei |vi Aei ,
i =1
et
∞ ∞ ∞
!
Av = ∑ he j | Avie j = ∑ ∑ he j | Aei ihei |vi ej .
j =1 j =1 i =1

Ainsi, A est caractérisé par la (double) suite de nombres complexes

Mij = he j | Aei i ,

qui forme la matrice (infinie) M A de A dans la base orthonormée choisie.


Inversement, soit M = { Mij , i, j = 1, 2, . . .} une famille infinie de nombres complexes. Il est ten-
tant d’introduire un opérateur A sur H, qui serait défini par Aei = ∑∞ j=1 M ji e j . Ceci n’est mal-
heureusement pas possible en général, car une telle suite produit généralement un opérateur A
qui ne serait pas borné.

209
9 Opérateurs linéaires

5. Opérateurs de translation : Considérons l’espace L2 (R) des fonctions de module carré intégrable
sur R, et soit a ∈ R. On lui associe l’opérateur Ta de translation par a, qui associe à toute fonction
f ∈ L2 (R) sa translatée
( Ta f )(t) = f (t − a) .
Il est immédiat de vérifier que pour tout f ∈ L2 (R), k Ta f k = k f k, (on dit que Ta est une
isométrie), et on a donc k Ta kop = 1.
6. Opérateurs de multiplication : Toujours dans L2 (R), soit m : t ∈ R → m(t) une fonction bornée
(c’est à dire telle qu’il existe C > 0 tel que |m(t)| ≤ C pour tout t). On associe à cette fonction
l’opérateur de multiplication Mm sur L2 (R), défini par

( Mm f )(t) = m(t) f (t) , ∀ f ∈ L2 (R) .

Il est facile de vérifier que la norme d’un tel opérateur vaut

k Mm kop = sup |m(t)| .


t ∈R

7. Opérateurs à noyau : Plaçons nous encore une fois dans le cadre de l’espace de Hilbert L2 (R),
et soit k une fonction de deux variables, à valeurs complexes. On peut associer à cette fonction
un opérateur, défini comme suit. Pour tout f ∈ H,
Z ∞
K f (x) = k ( x, y) f (y) dy , ∀x ∈ R .
−∞

Pour vérifier que cette expression définit bien un opérateur borné sur L2 (R), des hypothèses
supplémentaires sur le noyau k sont nécessaires. Nous verrons quelques exemples plus loin.
Attention : ne pas confondre le noyau d’un opérateur tel que celui-ci, et l’ensemble des fonctions
dont l’image par K est nulle, que l’on appelle aussi noyau. Il y a là une regrettable confusion de
terminologie.

9.3.2 Adjoint d’un opérateur sur un espace de Hilbert


L’objectif est de pouvoir construire une théorie spectrale pour les opérateurs linéaires sur un espace
de Hilbert, similaire à celle que nous avons construire sur les matrices. Nous avons besoin pour cela
d’une version adaptée de l’opérateur adjoint, dont l’existence est donnée par le résultat important
suivant, dont nous omettrons la preuve (pour les connaisseurs, c’est une conséquence du théorème
de Riesz-Fisher).

P ROPOSITION 9.5 Soit A ∈ L(H) un opérateur linéaire sur l’espace de Hilbert H. Alors il
existe un unique opérateur A∗ ∈ L(H), appelé adjoint de A, tel que pour tous u, v ∈: H

hu| Avi = h A∗ u|vi . (9.29)

Notons que l’on a aussi, pour tous u, v ∈: H,

h Au|vi = hu| A∗ vi .

Les propriétés de l’adjoint généralisent celles que nous avons vues dans le cas des espaces Hermi-
tiens :

210
9.3 Opérateurs linéaires dans les espaces de Hilbert

P ROPOSITION 9.6 Soit H un espace de Hilbert. Pour tous A, B ∈ L(H), et tout λ ∈ C,


1. A∗∗ = A ; 1∗ = 1.
2. ( A + B)∗ = A∗ + B∗ ; (λA)∗ = λA∗ ; ( AB)∗ = B∗ A∗ .
3. k A∗ kop = k Akop .

Preuve : La preuve des premiers points reprend essentiellement la preuve donnée dans le cas de la
dimension finie. Pour ce qui est du dernier point, notons que pour tous u, v ∈ H, on a

|hu| A∗ vi| = |h Au|vi| = |hv| Aui| ,

de sorte que
|hu| A∗ vi| |hv| Aui|
k A∗ kop = sup = sup = k Akop .
u,v∈H k u k k v k u,v∈H k u k k v k

ce qui conclut la preuve.

D ÉFINITION 9.11 Soit A ∈ L(H) A est auto-adjoint si A∗ = A.

Les exemples suivants donnent quelques illustrations pour la détermination de l’adjoint d’un opérateur
sur un espace de Hilbert, dans les situations considérées dans l’exemple 9.5

E XEMPLE 9.6 1. Opérateurs scalaires : on voit facilement que dans ce cas, pour tous x, y ∈ H,

h x | Ayi = h x |λyi = hλx |yi ,

de sorte que A∗ est l’opérateur scalaire de multiplication par λ, complexe conjugué de λ. Donc
A est auto-adjoint si et seulement si λ ∈ R.
2. Opérateurs de rang 1 : soient u, v ∈ H, et soit A(u, v) l’opérateur de rang 1 correspondant. Pour
tous x, y ∈ H, on a

h x | A(u, v)yi = h x |hy|viui = hh x |uiv|yi = h A(v, u) x |yi ,

de sorte que
A(u, v)∗ = A(v, u) .
Par conséquent, A(u, v) est autoadjoint si et seulement si v = u.
3. Opérateurs de rang fini et projecteurs orthogonaux : Comme corollaire immédiat de l’exemple
précédent, l’adjoint de
N
A= ∑ A(un , vn )
n =1

est
N
A∗ = ∑ A(vn , un ) .
n =1

Les projecteurs orthogonaux sont toujours auto-adjoints.

211
9 Opérateurs linéaires

4. Opérateurs définis par une matrice infinie : Soit A ∈ L(H), et soit M = M A sa matrice (infinie)
dans la base orthonormée B = {e1 , e2 , . . .}. On vérifie facilement que l’adjoint de A est lui aussi
caractérisé par une matrice infinie :
∞ ∞
hu| Avi = ∑ ∑ he j | Aei ihei |vihu|e j i = ∑ hhu|ei ih Aei |e j ie j |vi
j =1 i =1 i,j

Ainsi, la matrice de A∗ n’est autre que la conjuguée Hermitienne de la matrice de A :

M A∗ = MtA .

5. Opérateurs de translation : Soit a ∈ R, et soit TA l’opérateur de translation par a dans L2 (R).


Alors pour tous f , g ∈ L2 (R), on a
Z ∞ Z ∞
h f | Ta gi = f (t) g(t − a) dt = f (t + a) g(t) dt = h T−a f | gi .
−∞ −∞

Donc
( Ta )∗ = T−a .
6. Opérateurs de multiplication : Dans L2 (R), soit Mm l’opérateur de multiplication par la fonc-
tion bornée m. Alors on voit facilement que l’adjoint de Mm est donné par

Mm = Mm ,

c’est à dire un opérateur de multiplication par la complexe conjuguée de m. Evidemment, Mm


est auto-adjoint si et seulement si m est à valeurs réelles.
7. Opérateurs à noyau : Toujours dans L2 (R), soit K l’opérateur à noyau, de noyau k. On vérifie
de même que l’adjoint de K est toujours un opérateur à noyau, de noyau k̃, défini par

k̃ ( x, y) = k (y, x ) .

9.3.3 Spectre d’un opérateur sur un espace de Hilbert


Dans le cas d’opérateurs en dimension finie, l’analyse spectrale se ramène au calcul des valeurs
propres, et (si possible) à la diagonalisation de l’opérateur étudié. Nous allons voir qu’en dimen-
sion infinie, la situation peut malheureusement être bien plus complexe, comme nous allons le voir
sur les exemples suivants.
E XEMPLE 9.7 1. Considérons tout d’abord le cas de l’espace L2 ([0, 1]) des fonctions de module
carré intégrable sur l’intervalle [0, 1], et de l’opérateur de “position” de la mécanique quantique,
noté X, et défini comme suit. Pour tout f ∈ L2 ([0, 1]),

( X f )( x ) = x f ( x ) .

Manifestement, X est auto-adjoint, et k X kop = 1. La question est de savoir si X admet des


valeurs propres et vecteurs propres. En d’autres termes, existe-t-il λ ∈ R et ϕ ∈ L2 ([0, 1]) tels
que Xϕ = λϕ ? La réponse est négative... On aurait pu penser que pour λ ∈ [0, 1], la distribution
de Dirac δλ fasse l’affaire... mais ça n’est pas une fonction de L2 ([0, 1]).
2. Considérons maintenant le cas de l’espace L2 (R), et de l’opérateur position, défini comme ci-
dessus. Dans ce cas, la situation est même plus complexe, dans la mesure où X n’est même plus
un opérateur borné sur L2 (R). Par exemple, la fonction f ( x ) = 1/(1 + x2 ) ∈ L2 (R), mais X f 6∈
L2 (R). Comme on ne peut pas se passer d’un tel opérateur, il y a là une difficulté supplémentaire
à lever.

212
9.3 Opérateurs linéaires dans les espaces de Hilbert

La notion qui étend la notion de valeur propre dans ce nouveau cas est la notion de spectre.

D ÉFINITION 9.12 Soit A ∈ L(H).


1. Le spectre de A est l’ensemble

Sp( A) = {λ ∈ C : ( A − λ1) n’est pas inversible} . (9.30)

2. L’ensemble résolvant Ω( A) est le complément de Sp( A) dans C.


3. La famille d’opérateurs

R(·, A) : λ ∈ Ω( A) → R(λ, A) = (λ1 − A)−1 (9.31)

est appelée la résolvante de A.


4. Le nombre ( )
ρ( A) = sup |λ| (9.32)
λ∈Sp( A)

est le rayon spectral de A.

La question suivante est de savoir, pour un opérateur donné A ∈ L(H) donné, de quoi son spectre
est formé. Nous avons déjà vu que si H est un opérateur Hermitien, le spectre est formé de valeurs
propres. Tel n’est plus le cas dans le cas général.
E XEMPLE 9.8 Reprenons l’exemple de l’opérateur position sur L2 ([0, 1]), et cherchons les valeurs λ ∈
C telles que X − λ ne soit pas inversible. Etant donnée ϕ ∈ L2 ([0, 1]), soit ψ ∈ L2 ([0, 1]), telle que
ϕ = ( X − λ)ψ. Alors on aurait ψ( x ) = ϕ( x )/( x − λ). Si λ 6∈ [0, 1], la fonction x → 1/( x − λ) est
bornée, et kψk ≤ k ϕk supx (1/( x − λ)), d’où ( X − λ)−1 est borné. Donc dans ce cas λ ∈ Ω( X ).
Supposons maintenant λ ∈ [0, 1]. Nous allons maintenant voir que ( X − λ) n’est plus inversible. Soit
ϕ définie par ϕ( x ) = 1 pour tout x ∈ [0, 1]. Alors ( X − λ)−1 ϕ( x ) = 1/( x − λ), et cette fonction
n’appartient pas à L2 ([0, 1]).
Ainsi, dans ce cas, Sp( X ) = [0, 1], mais aucune des valeurs du spectre n’est valeur propre, comme
nous l’avons vu.

D ÉFINITION 9.13 Soit A ∈ L(H).


1. λ ∈ C est valeur propre de A s’il existe ψ ∈ H, ψ 6= 0, telle que

Aψ = λψ . (9.33)

Un tel ψ est appelé vecteur propre de A (ou fonction propre su H est un espace de fonctions).
2. λ est valeur propre approchée de A si il existe une suite de fonctions ψn ∈ H, telles que
ψn = 1 pour tout n, et

k Aψn − λψn k −→ 0 quand n → ∞ . (9.34)

E XEMPLE 9.9 Revenons une fois encore sur le cas de l’opérateur position sur L2 ([0, 1]), et montrons
que tout λ ∈ [0, 1] est valeur propre approchée. Pour cela, soit πn la fonction définie par
 pn
ψn ( x ) = 2 si x ∈ [ λ − 1/n, λ + 1/n ]
0 sinon

213
9 Opérateurs linéaires

On vérifie facilement que kψn k = 1 pour tout n. Calculons maintenant


Z λ+1/n Z 1/n
n 1
2
k( X − λ)ψn k = 2
( x − λ) dx = x2 dx = −→ 0 quand n → ∞ ,
λ−1/n 2 −1/n 3n2
ce qui est le résultat désiré. Donc,
Sp( X ) = [0, 1] .

Il est clair que toute valeur propre de A ∈ L(H) appartient au spectre de A. Plus généralement,

P ROPOSITION 9.7 Toute valeur propre approchée d’un opérateur A ∈ L(H) appartient à
Sp( A).

Dans une situation quelconque, le spectre d’un opérateur peut ne pas être seulement composé de ses
valeurs propres et ses valeurs propres approchées. Toutefois, la situation est plus simple dans certains
cas, comme par exemple le cas des opérateurs normaux.

D ÉFINITION 9.14 Un opérateur A ∈ L(H) est dit normal s’il commute avec son adjoint, c’est
à dire si
AA∗ = A∗ A .

Les opérateurs normaux sont les opérateurs qui permettent d’obtenir des résultats de décomposition
spectrale proches de ceux que l’on peut obtenir en dimension finie.
R EMARQUE 9.11 Notons que tout opérateur auto-adjoint est normal. Par contre, il existe des opérateurs
normaux qui ne sont pas auto-adjoints. Par exemple, si A est auto-adjoint, λA est normal pour tout
λ ∈ C, mais n’est pas auto-adjoint dès que la partie imaginaire de λ est non-nulle.
Prenons l’exemple suivant : dans C3 , l’opérateur linéaire A défini par sa matrice dans la base cano-
nique  
−i −i 0
M A =  −i i 0 
0 0 1
est effectivement normal. Il est aussi diagonalisable, et ses vecteurs propres sont orthogonaux deux à
deux (le vérifier).

L EMME 9.1 Soit A ∈ L(H) un opérateur normal. Alors, son image est orthogonale à son noyau.

Preuve : pour tout x ∈ H, on a

k Ax k2 = h Ax | Ax i = h x | A∗ Ax i = h x | AA∗ x i = k A∗ x k2 .

Donc, Ax = 0 implique A∗ x = 0, autrement dit, pour tout y ∈ H,

0 = h A∗ x |yi = h x | Ayi ,

ce qui implique que x est orthogonal à Ay, pour tout y ∈ H. Ceci prouve le résultat.
Une conséquence simple (dont la démonstration est omise ici car elle dépasse le cadre de ce cours)
est le résultat suivant, que nous avons déjà rencontré dans le cas de l’opérateur position :

214
9.3 Opérateurs linéaires dans les espaces de Hilbert

T H ÉOR ÈME 9.7 Le spectre d’un opérateur normal est l’ensemble de ses valeurs propres ap-
prochées.

Il est souvent relativement facile de trouver les valeurs propres approchées d’un opérateur normal.
Par contre, la représentation spectrale d’un opérateur normal quelconque est souvent bien plus com-
plexe, et fait appel à des notions qui dépassent le cadre de ce cours. On se contentera de signaler ici
que dans ce cas, il existe tout de même un théorème, appelé Théorème spectral, permettant de donner
un sens précis à ces notions. Comme on le verra, ce théorème spectral prendra toutefois une forme
plus simple dans le cas des opérateurs compacts.

E XEMPLE 9.10 Prenons l’équation de la chaleur unidimensionnelle sur R. Le champ de température


au point x et au temps t, noté T ( x, t), est solution de l’équation aux dérivées partielles

∂T ( x, t) ∂2 T ( x, t)
=C ,
∂t ∂x2

C étant une constante positive. Comme on le verra plus tard, il est possible de montrer que pour une
condition initiale fixée T0 ∈ L2 (R), il existe une et une seule solution, donnée par
Z ∞
1 2
T ( x, t) = eikx e−Ck t T̂0 (k) dk ,
2π −∞

où T̂0 est la transformée de Fourier spatiale de la condition initiale :


Z ∞
T̂0 (k ) = T0 ( x )e−ikx dx .
−∞

Soit Pt : ϕ ∈ L2 (R) → Pt ϕ l’opérateur linéaire sur L2 (R) qui à la condition initiale associe la solution
à l’instant t, donc défini pour tout t ∈ R+ par
Z ∞
1 2
( Pt ϕ)( x ) = êikx e−Ck t ϕ̂(k ) dk
2π −∞

Pour tout t ∈ R+ , Pt est auto-adjoint, donc normal. Il est possible de montrer que tout λ ∈ R+ est
valeur propre approchée de Pt . En effet, pour tout λ ∈ R+ , on peut écrire pour tout ϕ ∈ L2 (R) (grâce
à la formule de Plancherel)
Z ∞
1 1 2 2
2
k( Pt − λ1) ϕk = − λ1) ϕk2 =
k( Pt\ e−Ck t − λ | ϕ̂(k)|2 dk ,
2π 2π −∞

et il est facile de construire une suite de fonctions ϕn de norme unité telles que k( Pt − λ1) ϕn k → 0
quand n → ∞ : par exemple, les fonctions ϕn définies par leur transformée de Fourier

ϕ̂n (k ) = 2nπχ[α−1/2n,α+1/2n] (k )

font parfaitement l’affaire, et sont associées à la valeur propre approchée λ = exp(−Cα2 t). Par contre,
aucune de ces valeurs propres approchées n’est une “vraie” valeur propre. Il n’existe pas dans L2 (R)
de fonction propre correspondante. Les candidats naturels seraient les fonctions x → eikx , mais ces
fonctions ne sont pas de module carré intégrable.

215
9 Opérateurs linéaires

9.4 Théorie spectrale des opérateurs compacts

Le cas des opérateurs compacts constitue un cas particulier assez simple, pour lequel les résultats de
l’analyse spectrale généralisent assez simplement les résultats vus en dimension finie.

D ÉFINITION 9.15 Un opérateur A ∈ L(H) sur l’espace de Hilbert H est compact si pour toute
suite bornée {un ∈ H, n ∈ Z}, on peut extraire de la suite { Aun , n ∈ Z} une sous suite
convergente.

Les opérateurs compacts possèdent un certain nombre de propriétés intéressantes, que nous énonçons
ci-dessous, sans démonstration.

P ROPOSITION 9.8 1. L’ensemble des opérateurs compacts sur un espace de Hilbert H est un
sous-espace vectoriel de L(H).
2. Si A, B ∈ L(H) avec A compact, alors AB et BA sont compacts.
3. L’adjoint A∗ d’un opérateur compact A est compact.

Une propriété remarquable des opérateurs compacts est qu’ils peuvent être approchés par des opérateurs
de rang fini (c’est à dire par des opérateurs dont l’image est de dimension finie).

T H ÉOR ÈME 9.8 Pour tout opérateur compact A ∈ L(H) sur un espace de Hilbert séparable H,
il existe une suite d’opérateurs de rang fini An ∈ L(H), tels que

lim k A − An kop = 0 . (9.35)


n→∞

Inversement, étant donné un opérateur A tel qu’il puisse être arbitrairement bien approché par
des opérateurs de rang fini comme en (9.35) ; alors A est compact.

Le résultat essentiel de la théorie spectrale des opérateurs compacts tient dans les deux résultats
suivants.

T H ÉOR ÈME 9.9 Soit A ∈ L(H) un opérateur compact sur un espace de Hilbert séparable H.
Alors les éléments non-nuls du spectre de A sont des valeurs propres, de multiplicité finie. De
plus, pour tout e > 0, le nombre de valeurs propres supérieures à e en module est fini.

Ainsi, ce théorème montre que le spectre d’un opérateur normal est constitué de valeurs propres
de multiplicité finie, qui peuvent être ordonnés de façon à tendre vers 0 (qui est valeur propre ap-
prochée). Dans le cas des opérateurs compacts normaux, la représentation spectrale prend une forme
simple, réminiscente de la situation rencontrée en dimension finie.

216
9.4 Théorie spectrale des opérateurs compacts

T H ÉOR ÈME 9.10 Soit A ∈ L(H) un opérateur compact normal sur un espace de Hilbert
séparable H. Alors il existe une suite orthonormée de vecteurs propres ψn de A et une suite de
nombres {λn ∈ C, n = 1, . . .}, telles que

λn −→ 0 quand n → ∞ (9.36)

et, pour tout x ∈ H,


Ax = ∑ λn hψn |xiψn . (9.37)
n

E XEMPLE 9.11 Soit H = L2p ([0, 1]) l’espace des fonctions périodiques de période 1, de module carré
intégrable sur [0, 1]. Soit h ∈ L1p ([0, 1]), et soit T = Kh l’opérateur de convolution par h, défini sur
L2p ([0, 1]) par
Z 1
Kh f (t) = h(s) f (t − s) ds .
0
Grâce à la formule de Parseval, on peut écrire

Kh f (t) = ∑ cn (h)cn ( f )e2iπnt ,
−∞

expression qui fait intervenir les coefficients de Fourier de h


Z 1
ck ( h) = h(t)e−2iπkt dt
0

et ceux de f . Il est possible de montrer que cet opérateur est un opérateur compact. Les fonctions
propres correspondantes sont les fonctions

en : t ∈ [0, 1] −→ e2iπkt ,

et les valeurs propres correspondantes ne sont autres que les coefficients de Fourier ck (h) de h.
Comme h ∈ L2 ([0, 1]), le théorème de Riemann-Lebesgue implique que ces coefficients de Fourier
tendent vers 0 lorsque k → ∞, et 0 est valeur propre approchée, sans être nécessairement valeur
propre (sauf si l’un des coefficients de Fourier de h est nul).

Parmi les opérateurs compacts, il existe une classe particulièrement intéressante : il s’agit des opérateurs
à noyaux (comme on les a déjà rencontrés plus haut) dits de Hilbert-Schmidt.

D ÉFINITION 9.16 Soit k ∈ L2 (R2 ), et soit K l’opérateur sur L2 (R) défini par le noyau k : pour
tout f ∈ L2 (R), Z ∞
K f (x) = k ( x, y) f (y) dy . (9.38)
−∞
Un tel opérateur est appelé opérateur de Hilbert-Schmidt.

Pour que cette définition définisse réellement un opérateur sur L2 (R), il faut montrer que si f ∈
L2 (R), alors K f ∈ L2 (R) aussi. Pour cela, on a par l’inégalité de Cauchy-Schwarz
Z ∞ rZ

|K f ( x )| = k ( x, y) f (y)dy ≤ |k( x, y)|2 dy k f k ,
−∞ −∞

217
9 Opérateurs linéaires

d’où on déduit
kK f ( x )k2 ≤ kkk2L2 (R2 ) k f k2 < ∞ .

Il est facile de montrer que tout opérateur de Hilbert-Schmidt est automatiquement compact. Ainsi,
les propriétés spectrales que nous avons énoncées dans les théorèmes 9.9 et 9.10 sont valables.

9.5 Quelques mots sur les opérateurs non bornés

Jusqu’à présent, nous nous sommes limités aux opérateurs bornés sur un espace de Hilbert. Mal-
heureusement, il existe de multiples exemples d’opérateurs, ayant un intérêt physique indéniable,
qui ne sont pas bornés. Par exemple, comme nous l’avons vu, l’opérateur position de la mécanique
quantique n’est pas borné sur L2 (R). De même, l’opérateur de dérivation n’est pas borné sur L2 (R),
ni sur L2 ([0, 1]) par exemple. Dans ces situations, il est nécessaire de se limiter à un domaine (ou do-
maine de définition) dans lequel l’opérateur en question est bien défini. On note alors ( A, D A ) le couple
constitué de l’opérateur A et de son domaine D A ⊂ H.
Dans cette situation, la notion d’opérateur auto-adjoint est elle aussi plus subtile, et on doit recourir
à la notion (plus faible) d’opérateur symétrique.

D ÉFINITION 9.17 Soit A un opérateur linéaire sur H, de domaine D A . ( A, D A ) est symétrique


si pour tous x, y ∈ D A , on a
h x | Ayi = h Ax |yi . (9.39)

E XEMPLE 9.12 1. Soit H = L2 (R), et considérons l’opérateur position X vu précédemment. Alors


Z ∞
D X = { f ∈ L (R), 2
x2 | f ( x )|2 dx < ∞} .
−∞

Il est facile de vérifier que ( X, D X ) est symétrique. Pour tout f , g ∈ D X , on a en effet


Z ∞ Z ∞
h f | Xgi = f ( x ) xg( x ) dx = x f ( x ) g( x ) dx = h X f | gi .
−∞ −∞

2. Soit de nouveau H = L2 (R), et soit P l’opérateur “impulsion” de la mécanique quantique :

( P f )( x ) = i f 0 ( x ) .

Le domaine de P est l’espace

D P = f ∈ L2 (R), f 0 ∈ L2 (R) .


Etant données f , g ∈ D P , on peut calculer


Z ∞ Z ∞
0
h f | Pgi = i f (t) g (t) dt = i f 0 (t) g(t) dt = h P f | gi .
−∞ −∞

Donc P est symétrique.

218
9.5 Quelques mots sur les opérateurs non bornés

D ÉFINITION 9.18 Soit ( A, D A ) un opérateur linéaire sur H, tel que D A soit dense dans H. Soit

D ∗A = {ψ ∈ H, t.q. l’application ϕ ∈ H → h ϕ| Aψi est continue } . (9.40)

1. L’adjoint ( A∗ , D ∗A ) de ( A, D A ) est défini de la façon suivante :

h x | A∗ yi = h Ax |yi , ∀ x ∈ D A , y ∈ D ∗A . (9.41)

2. ( A, D A ) est auto-adjoint si
( A∗ , D ∗A ) = ( A, D A ) . (9.42)

Si A est un opérateur symétrique, il est clair que


D A ⊂ D ∗A
et que la restriction de A∗ à D A est A. Par contre, D ∗A est souvent strictement plus grand que D A .
La plupart des opérateurs linéaires intervenants en physique (bornés ou non-bornés) sont auto-
adjoints. On montre qu’il est possible dans ce cas d’en donner une représentation spectrale. Cepen-
dant, il en existe une sous-classe pour laquelle cette représentation se simplifie. Cette sous-classe fait
appel à la résolvante, que nous avons déjà rencontrée plus haut en (9.31), et dont nous rappelons la
définition :
R(·, A) : λ ∈ Ω( A) → R(λ, A) = (λ1 − A)−1 .
Si il existe λ dans l’ensemble résolvant tel que l’opérateur R(λ, A) soit compact, alors la situation se
simplifie considérablement.

T H ÉOR ÈME 9.11 Soit ( A, D A ) un opérateur linéaire sur un espace de Hilbert séparable H. Alors
les trois propriétés suivantes sont équivalentes.
1. Il existe λ ∈ Ω( A) tel que R(λ, A) soit compact.
2. Pour tout λ ∈ Ω( A), R(λ, A) est compact.
3. a) ( A, D A ) admet une base orthonormée de vecteurs propres {un , n ∈ Z} :

Aun = λn un , et λn ∈ D A . (9.43)

b) Le spectre de ( A, D A ) est un ensemble infini dénombrable {λn , n ∈ Z+ } de points


isolés.
c) Le domaine de A n’est autre que l’ensemble des éléments u ∈ H tels que la suite de
terme général λn hun |ui soit de module carré sommable :

D A = u ∈ H , { λ n h u n | u i, n ∈ Z+ } ∈ `2 (Z+ ) .

(9.44)

On ne donnera pas la preuve complète de cet important résultat ici. Ceci étant, il est intéressant de
comprendre quelle en est l’origine. Pour cela, supposons que le point (1) soit vérifié, et montrons
les grandes lignes du point (2). Soit λ ∈ Ω( A) tel que R(λ, A) soit compact. A étant autoadjoint,
on vérifie facilement que R(λ, A) l’est aussi. Alors on sait que le spectre de R(λ, A) est constitué de
valeurs propres non-nulles µn , avec limn→∞ µn = 0. Notons un les vecteurs propres correspondants.
On a alors, comme µn 6= 0,
1
un = (λ1 − A)un ,
µn

219
9 Opérateurs linéaires

de sorte que  
1
Aun = λ− un .
µn
Comme A est auto-adjoint, ses valeurs propres sont réelles (notons que R(λ, A) n’étant pas nécessairement
auto-adjoint, ses valeurs propres sont généralement complexes, tout comme λ).

9.6 Eléments de théorie des perturbations


Il existe des situations dans lesquelles le spectre d’un opérateur n’est pas calculable explicitement,
mais peut l’être de façon approchée. C’est en particulier le cas d’opérateurs A0 ∈ L(H) qui peuvent
s’écrire comme “perturbations” d’un opérateur A0 dont la représentation spectrale est connue, c’est à
dire comme la somme de celui-ci et d’un “petit” opérateur eW (petit au sens où sa norme est petite) :

A = A0 + eW .

Dans ce cas là, il est naturel de s’attendre à ce que le spectre de A soit dans un certain sens proche
de celui de A0 , et de même pour la représentation spectrale. La théorie des perturbations permet
de donner une estimation du spectre de A sous forme d’une développement en série suivant les
puissances de e, le premier terme (d’ordre zéro) correspondant au spectre de A0 .
Dans ce qui suit, on va démontrer un résultat de ce type, dans le cas particulier d’opérateurs sur un
espace Hermitien (c’est à dire de dimension finie), en nous limitant au premier ordre.

9.6.1 Perturbation d’un vecteur propre non-dégénéré d’un opérateur linéaire auto-adjoint
sur un espace Hermitien
Soit H un espace Hermitien, et soit
e → A(e) ∈ L(H)
une famille d’opérateurs linéaires auto-adjoints sur H, que l’on suppose C ∞ par rapport à la variable
e.1 On suppose que la représentation spectrale de A0 est connue, et on note λ0 , . . . λ N −1 et x0 , . . . x N −1
les valeurs propres et vecteurs propres correspondants. On s’intéresse dans un premier temps aux
valeurs propres non-dégénérées, et on suppose que λ0 est non-dégénérée.
Il est possible de démontrer (en utilisant la continuité de l’application e → A(e)) que pour e suffisam-
ment petit, il existe un voisinage O de λ0 tel que A(e) admette une unique valeur propre λ(e) dans O ,
et on note x (e) le vecteur propre correspondant. Ce dernier étant défini à une constante multiplicative
près, on le normalise, en imposant (par exemple)

h x0 | x (e)i = 1 . (9.45)

Le caractère C ∞ de e → A(e) implique que e → λ(e) et e → x (e) sont C ∞ également. Ecrivons

A(e) x (e) = λ(e) x (e) . (9.46)

En différenciant par rapport à e, on obtient

A0 (e) − λ0 (e) x (e) = ( A(e) − λ(e)) x 0 (e) ,



(9.47)

alors que (9.45) donne


h x0 | x 0 (e)i = 0 .
L’équation (9.47) donne, par produit scalaire avec x0

λ0 (e) = h x0 | A0 (e) x (e)i + h x0 | A(e) x 0 (e)i ,


1 Ceci revient à supposer que la matrice de A(e) est C ∞ .

220
9.6 Eléments de théorie des perturbations

et dans le cas particulier e = 0,


λ0 (0) = h x0 | A0 (0) x0 i + h x0 | A(0) x 0 (0)i = h x0 | A0 (0) x0 i . (9.48)
Ceci, combiné à un développement de Taylor au premier ordre, donne donc une estimation de la
valeur propre perturbée :
λ ( e ) = λ0 + e h x0 | A 0 (0) x0 i + O ( e2 ) .
Passons maintenant à l’analyse du vecteur propre perturbé. En considérant le cas e = 0 dans (9.47),
on a  0
A (0) − h x0 | A 0 (0) x0 i x0 + A (0) − λ0 x 0 (0) = 0 ,
  

d’où on déduit
A (0 ) − λ 0 x 0 (0 ) = h x 0 | A 0 (0 ) x 0 i x 0 − A 0 (0 ) x 0 = Π x0 − 1 A 0 (0 ) x 0 ,
 
(9.49)
où on note Π x0 le projecteur orthogonal sur l’espace (de dimension 1) Cx0 engendré par x0 .
A ce point, il suffit d’appliquer des deux côtés de cette équation l’inverse de A(0) − λ0 1 pour obtenir
une expression de x 0 (0), d’où on tire une expression de x (e) par développement de Taylor au pre-
mier ordre. Cependant, il faut faire attention, car λ0 étant valeur propre de A0 , A(0) − λ0 1 n’est pas
inversible.
Commençons par remarquer que le noyau de l’opérateur A(0) − λ0 1 n’est autre que Cx0 , et que
x 0 (0) ⊥ Cx0 (voir plus haut). Par ailleurs, on peut aussi noter que le membre de droite de l’équation (9.49)
ci-dessus n’est autre que la projection orthogonale de A0 (0) x0 sur le complément orthogonal (Cx0 )⊥
de Cx0 dans H. Donc cette dernière équation est une équation dans (Cx0 )⊥ .
Notons ( A(0) − λ0 1)] l’opérateur défini par
( A(0) − λ0 1)−1 x si x ∈ (Cx0 )⊥

]
( A (0) − λ0 1 ) x =
0 sinon
Alors on peut écrire
]
x 0 (0) = A (0) − λ0 1 Π x0 − 1 A 0 (0 ) x 0 ,

(9.50)
Pour conclure, il nous suffit maintenant d’expliciter le membre de droite de cette dernière équation.
Partant de la représentation spectrale de A0
N −1
x= ∑ h xi | x i xi , ∀x ∈ H ,
i =0

on peut écrire
N −1
Π x0 − 1 x = − ∑ h x i | x i x i ,

∀x ∈ H ,
i =1
et
N −1
] 1
Π x0 − 1 A 0 (0 ) x 0 = ∑ h x i | A 0 (0) x0 i x i .

A (0) − λ0 1
i =1
λ i − λ0
Ainsi, nous avons obtenu l’expression suivante pour la dérivée du premier vecteur propre x0 :
N −1
1
x 0 (0) = ∑ λ i − λ0
h x i | A 0 (0) x0 i x i , (9.51)
i =1

d’où par développement de Taylor au premier ordre,


N −1
1
x ( e ) = x0 + e ∑ λ i − λ0
h x i | A 0 (0) x0 i x i .
i =1

Bien entendu, le même traitement s’applique à toutes les valeurs propres non-dégénérées.

221
9 Opérateurs linéaires

R EMARQUE 9.12 Notons que dans ce calcul, nous avons uniquement supposé que la valeur propre
λ0 était non-dégénérée, sans aucune hypothèse de la sorte sur les autres λi (qui peuvent quant à elles
être dégénérées).

9.6.2 Le cas des valeurs propres dégénérées


Relaxons maintenant nos hypothèses, en évitant de supposer que la valeur propre considérée est de
multiplicité 1. On se limitera ici à étudier les valeurs propres perturbées, le calcul des vecteurs propres
correspondants est laissé en exercice au lecteur intéressé.
Supposons donc que la valeur propre considérée λ0 a pour multiplicité m. Donc, le sous-espace
propre correspondant, noté H0 , est de dimension m, et admet une base orthonormée que l’on no-
(1) (2) (m)
tera { x0 , x0 , . . . x0 }. Pour e 6= 0, il n’y a aucune raison que la valeur propre λ(e) sois elle aussi
dégénérée, et on va donc supposer qu’il existe m valeurs propres λ(1) (e), . . . λ(m) (e), simples ou
dégénérées. On note x (1) (e), . . . x (m) (e) les vecteurs propres correspondants.
Le point de départ du calcul est le même que précédemment, partant de

A ( e ) − λ(k) ( e ) x (k) ( e ) = 0 ,
 

(`)
en différentiant par rapport à e puis en prenant le produit scalaire par rapport à un x0 quelconque,
on aboutit à
(`)  0 (`)  0
h x0 | A0 (e) − λ(k) (e) x (k) (e)i + h x0 | A(e) − λ(k) (e) x (k) (e)i = 0 .
 

En prenant le cas particulier e = 0, et en utilisant le fait que A0 est auto-adjoint, et que λ(k) (0) = λ0
pour tout k, on obtient
(`)  0  (k)
h x0 | A 0 (0) − λ ( k ) (0) x0 i = 0 , ∀` = 1, . . . m . (9.52)
0
Ceci étant vrai pour tout ` = 1, . . . m, on en déduit que λ(k) (0) est nécessairement valeur propre de
la restriction de A0 (0) au sous-espace propre H0 .

222
Sixième partie

Probabilités

223
C HAPITRE

10 Introduction aux Pro-


babilités

10.1 Modélisation probabiliste


10.1.1 Généralités
Modèle probabiliste :

Les modèles probabilistes s’introduisent naturellement en physique dans deux contextes différents :
– Il existe une grande quantité de systèmes physiques qui sont trop complexes pour pouvoir être
décrits de façon déterministe. L’exemple le plus immédiat est fourni par des systèmes de particules
“libres”. Supposons simplement que nous ayons à décrire un système de 1010 particules, évoluant
librement dans un volume fini donné, interagissant par chocs élastiques. Il est clair que les lois
fondamentales de la dynamique nous permettent théoriquement de calculer les trajectoires indivi-
duelles de chacunes des particules. Cependant, un tel calcul s’avère irréalisable en pratique, compte
tenu du grand nombre de possibilités dont il faut tenir compte.
– Il existe aussi des systèmes qui ont une nature intrinsèquement probabiliste. C’est en particulier le
cas des systèmes quantiques, si on s’en tient aux interprétations classiques. Etant donné un système
quantique, on ne peut généralement pas prédire à l’avance ce que sera le résultat d’une mesure. On
doit se contenter de connaitre les résultats possibles, auxquels on peut affecter une probabilité.
Dans de tels cas de figure, la modélisation est une modélisation probabiliste. Une modélisation proba-
biliste consiste essentiellement en un ensemble (discret ou continu) de “possibles” (appelés évènements),
auxquels on associe un nombre (la probabilité de l’évènement) qui en caractérise la vraisemblance.

E XEMPLE 10.1 Prenons l’exemple d’une pièce normale, avec laquelle on tire à pile ou face. Il est qua-
siment impossible de calculer avec une précision suffisante la trajectoire de la pièce pour prédire le
résultat. Par contre, il est possible d’associer des probabilités aux résultats possibles. Par exemple,
si on note P et F les 2 résultats possibles d’un tirage, et si on effectue un seul tirage, on a donc
deux résultats possibles, avec probabilités 1/2. Si on effectue 2 tirages, on a 4 résultats possibles
équiprobables ; et ainsi de suite. On peut faire le tableau suivant :

P F PP PF FP FF ... PP . . . P ... FF . . . F

1
2
1
2
1
4
1
4
1
4
1
4 ... 2− n ... 2− n

On associe ainsi une probabilité à chacun des évènements considérés. On vérifie facilement que la
somme des probabilités associées à un nombre de tirages n fixé vaut 1.

E XEMPLE 10.2 Marche au hasard : Prenons l’exemple d’un ivrogne, à la démarche hésitante. Si il a une
jambe plus courte que l’autre, on peut penser qu’il a une probabilité p d’aller vers la gauche (G), et
q = 1 − p d’aller vers la droite (D). On peut faire le tableau suivant, représentant les configurations
possibles pour un nombre n de pas donné :

225
10 Introduction aux Probabilités

G D GG GD DG DD ... GG . . . G ... FF . . . F

p q p2 pq pq q2 ... p−n ... q−n

On vérifie aussi dans ce cas que pour un nombre fixé de pas n, la somme des probabilités vaut 1.

Ces exemples suggèrent de poser la première ébauche de définition suivante.


P R É -D ÉFINITION Un modèle probabiliste pour une expérience à un nombre fini N de résultats possibles
consiste en
1. Un ensemble Ω = {ω1 , . . . ω N } de résultats possibles.
2. Une application P : Ω → [0, 1]
ωj → P ωj ,


telle que
N
∑P

ωj = 1 . (10.1)
j =1

Nous allons voir un peu plus loin que cette définition n’est pas suffisante pour couvrir les cas suscep-
tibles de nous intéresser.

E XEMPLE 10.3 On tire à pile ou face avec une pièce ordinaire. Si le résultat est pile (P), on jette un dé
à 6 faces. Si le résultat est face (F), on retire à pile ou face. L’ensemble des résultats possibles est
Ω = {( P, 1), ( P, 2), ( P, 3), ( P, 4), ( P, 5), ( P, 6), ( F, P), ( F, F )}

ω ( P, 1) ( P, 2) ( P, 3) ( P, 4 ( P, 5) ( P, 6) ( F, P) ( F, F )

P{ ω } 1
12
1
12
1
12
1
12
1
12
1
12
1
4
1
4

Probabilités et statistique

La théorie des probabilités et la statistique sont deux sciences complémentaires. Plus précisément, la
théorie des probabilités est une science prédictive : son objectif est de construire des modèles décrivant
la réalité, et prédisant les fréquences d’apparition de phénomènes, ou résultats de mesure.
Comment connait on les probabilités de tels évènements ? La réponse à cette question est fournie par
la théorie statistique, qui permet d’estimer ces probabilités à partir d’expériences. La statistique est
donc une science descriptive.
Comment fait on le lien entre les deux théories ? la relation est souvent donnée par ce que l’on nomme
des théorèmes limites, comme par exemple la loi des grands nombres, ou encore le théorème central limite.
L’exemple suivant permet d’illustrer la situation.
On considère un dé usuel à 6 faces. Si le dé est un dé ordinaire, les 6 faces sont équiprobables, et les
6 faces ont donc probabilités p1 = p2 = · · · = p6 = 1/6. Supposons maintenant que l’on fasse N
expériences, c’est à dire N tirages, et que l’on obtienne n1 fois la face 1, ... et n6 fois la face 6. Posons
alors pour i = 1, . . . 6 : p̂i = ni /N. En général, on n’a pas p̂i = pi , mais le “bon sens” suggère que
lorsque N est grand, on devrait avoir p̂i ≈ pi . La loi des grands nombres permet de donner un sens
plus précis à cette assertion. On montre en fait que pour tout δ > 0,
P{| p̂i − pi | > δ} → 0 quand N→∞.
Le théorème central limite permet de préciser cette limite.

226
10.1 Modélisation probabiliste

10.1.2 Calcul des probabilités


Ensembles d’évènements, union, intersection

Etant donnés un ensemble Ω et une application P comme ci-dessus, nous allons maintenant étendre
ces notions. P associe un nombre à tout élément de Ω ; on veut également être capables d’associer
une probabilité à des sous-ensembles de Ω : calculer les probabilités pour que le résultat appartienne
à un certain ensemble A ⊂ Ω de résultats possibles. Les sous-ensembles A ⊂ Ω auxquels on peut
associer une probabilité seront appelés évènements.
Pour cela, examinons cas par cas un certain nombre de situations possibles.

Le cas fini Supposons tout d’abord que Ω soit un ensemble fini, et qu’on dispose d’une application
P:Ω→ R+ ,définie donc sur les éléments de Ω. Pour tout sous-ensemble A ⊂ Ω, il est alors facile
d’introduire P{ A} :

D ÉFINITION 10.1 Soit Ω un ensemble fini, et soit A ⊂ Ω. On définit alors P{ A} par

P{ A } = ∑ P{ ω } . (10.2)
ω∈ A

Il est immédiat qu’avec cette définition, on a nécessairement

P{ Ω } = 1 . (10.3)

Ayant posé cette définition, on se retrouve tout naturellemement dans un contexte de théorie des
ensembles. On a alors :

P ROPOSITION 10.1 1. Si A, B ⊂ Ω sont deux ensembles disjoints (c’est à dire A ∩ B = ∅),


alors
P{ A ∪ B } = P{ A } + P{ B } . (10.4)

2. Plus généralement : si A, B ⊂ Ω,

P{ A ∪ B } = P{ A } + P{ B } − P{ A ∩ B } . (10.5)

3. Si Ac est le complémentaire de A dans Ω :

P{ A c } = 1 − P{ A } . (10.6)

Le cas infini dénombrable Supposons maintenant que Ω soit un ensemble infini dénombrable.
Supposons aussi qu’on ait introduit une application P : Ω → R+ . On peut alors étendre P à
des sous-ensembles plus généraux de Ω, comme dans le cas fini, en définissant (comme dans la
D ÉFINITION 10.1) pour toute famille (finie ou infinie dénombrable) A = { a1 , a2 , . . . , ai ∈ Ω} la proba-
bilité de l’évènement A par

P{ A } = ∑ P{ a n } = P{ a1 } + P{ a2 } + . . . . (10.7)
n

La formule (10.3) est bien évidemment toujours valable.

227
10 Introduction aux Probabilités

E XEMPLE 10.4 On considère une variante du jeu de pile ou face, dans laquelle les deux faces de la
pièce ont probabilités 1/2, mais la pièce est tirée jusqu’à ce que “face” apparaisse. L’ensemble des
résultats possibles est
Ω = { F, PF, PPF, . . .} ,

et les probabilités des éléments de Ω sont données par

ω F PF PPF PPPF ... P . . . PF (n fois P)

P{ ω } 1
2
1
4
1
8
1
16 ... 2−(n+1)

A partir de là, on peut calculer les probabilités des évènements (les sous-ensembles de Ω) : par
exemple, la probabilité pour que le nombre de P soit inférieur à 4 est donnée par

1 1 1 1 15
P{{ F, PF, PPF, PPPF }} = + + + = .
2 4 8 16 16

On a évidemment

1
P{ Ω } = ∑ 2−n = 1 − 1/2 − 1 = 1 .
n =1

Le cas continu Le cas infini continu est un peu plus complexe. Prenons l’exemple d’un nombre tiré
au hasard dans l’intervalle [0, 1], toutes les valeurs ayant même probabilité. On a donc Ω = [0, 1].
Mais Ω étant un ensemble continu, les probabilités des valeurs individuelles sont nulles :

P{t} = 0 ∀t ∈ [0, 1] .

Dans ce cas, il est nécessaire d’utiliser directement des sous-ensembles de Ω pour construire le modèle.
Toutes les valeurs étant équiprobables, on définit alors P par

P{[ a, b[} = b − a

pour tout intervalle [ a, b[⊂ Ω. Pour définir P{ A} pour des sous-ensembles (presque) quelconques
A ⊂ Ω, on peut alors s’inspirer de la P ROPOSITION 10.1, et écrire par exemple, pour toute famille
d’intervalles disjoints deux à deux I1 = [ a1 , b1 [, I2 = [ a2 , b2 [, . . . ,

P{ I1 ∪ I2 ∪ . . . } = P{ I1 } + P{ I2 } + · · · = (b1 − a1 ) + (b2 − a2 ) + . . .

Dans ce cas, nous serons naturellement amenés à considérer des intégrales, comme nous le verrons
dans la section 10.1.2.

Définition fondamentale Motivé par les discussions précédentes, on peut maintenant donner la
définition suivante d’un modèle probabiliste au sens de Kolmogorov (dans la littérature mathématique,
on parle d’espace probabilisé).

228
10.1 Modélisation probabiliste

D ÉFINITION 10.2 Un modèle probabiliste consiste en


1. Un ensemble de résultats possibles Ω (appelé univers, espace des épreuves ou
référentiel).
2. Une tribu, c’est à dire une famille F de parties de Ω, appelées évènements, telle que :
– Ω ∈ F.
– Si A ∈ F , alors son complémentaire Ac = Ω\ A ∈ F .
– Si A1 , A2 , · · · ∈ F est un ensemble (fini ou infini dénombrable) de parties de Ω, alors
A1 ∪ A2 ∪ · · · ∈ F .
– Si A1 , A2 , · · · ∈ F est un ensemble (fini ou infini dénombrable) de parties de Ω, alors
A1 ∩ A2 ∩ · · · ∈ F .
3. Une application P : A ∈ F → P{ A} ∈ [0, 1], telle que
– P{Ω} = 1.
– Si A1 , A2 , · · · ∈ F est un ensemble de parties de Ω deux à deux disjointes,

P{ A1 ∪ A2 ∪ . . . } = P{ A1 } + P{ A2 } + . . . . (10.8)

L’ensemble F possédant les propriétés ci-dessus est parfois appelé tribu. Une conséquence immédiate
de la définition est que ∅ ∈ F , et que P{∅} = 0.

Calcul sur les évènements

La formulation en termes de théorie des ensembles permet de formuler simplement un certain nombre
de résultats. En particulier, le résultat suivant est une conséquence immédiate des définitions.

P ROPOSITION 10.2 Soit (Ω, F , P) un modèle probabiliste.


1. Si A, B ∈ F et A ⊂ B, alors P{ A} ≤ P{ B}.
2. Si A ∈ F , P{ Ac } = 1 − P{ A}.
3. Si A, B ∈ F et A ⊂ B, alors P{ B\ A} = P{ B} − P{ A}.
4. Si A, B ∈ F , P{ A ∪ B} = P{ A} + P{ B} − P{ A ∩ B}.

Preuve : 1) On a B = A ∪ ( B\ A), et A ∩ ( B\ A) = ∅. Donc P{ B} = P{ A} + P{ B\ A} ≥ P{ A}.


2) est immédiat : P{ A} + P{ Ac } = P{ A ∪ Ac } = P{Ω} = 1.
3) Si A ⊂ B : B = A ∪ ( B\ A) avec A ∩ ( B\ A) = ∅. Donc P{ B} = P{ A} + P{ B\ A}.
4) A ∪ B = A ∪ ( B ∩ Ac ), donc P{ A ∪ B} = P{ A} + P{ B ∩ Ac }. De plus, P{ B} = P{ B ∩ A} +
P{ B ∩ Ac }, d’où le résultat. ♠

Indépendance ; probabilités conditionnelles

Rappelons que l’opération d’intersection des ensembles correspond au et logique des évènements.

229
10 Introduction aux Probabilités

D ÉFINITION 10.3 Soit (Ω, F , P) un modèle probabiliste


1. On dit que deux évènements A, B ∈ F sont indépendants si

P{ A ∩ B } = P{ A }P{ B } . (10.9)

2. Une famille finie ( A1 , A2 , . . . An ) d’éléments de F est une famille d’évènements


indépendants si

P{ A1 ∩ A2 ∩ · · · ∩ A n } = P{ A1 }P{ A2 } . . . P{ A n } . (10.10)

R EMARQUE 10.1 Il est important de signaler que si ( A1 , A2 , . . . An


) est une famille d’évènements
indépendants, les évènements Ai sont indépendants deux à deux : P Ai ∩ A j = P{ Ai }P A j pour


tous i, j. La réciproque n’est pas vraie, comme le montre l’exemple suivant.

E XEMPLE 10.5 On tire à pile ou faces 2 fois avec une pièce non biaisée. On considère les évènements
suivants : A = { PP, PF }, B = { PF, FF }, C = { FF, PP}, qui ont tous probabilité 1/2. Il est facile de
voir que A, B, C sont deux à deux independants, mais que P{ A ∩ B ∩ C } = 0, de sorte que la famille
{ A, B, C } n’est pas une famille d’évènements indépendants.
Lorsque deux évènements A et B sont indépendants, le fait que A soit réalisé n’apporte aucune in-
formation sur le fait que B soit réalisé ou pas. Par contre, ça n’est plus le cas si A et B ne sont pas
indépendants. Il est dans ce cas utile d’introduire la notion de probabilité conditionnelle, qui permet de
calculer la probabilité P{ B| A} de B, supposant A réalisé.

D ÉFINITION 10.4 Soit (Ω, F , P) un modèle probabiliste. Si A et B sont deux évènements quel-
conques, la probabilité de A sachant B (ou conditionnée par B) est le nombre

P{ A ∩ B }
P{ A | B } = (10.11)
P{ B }

E XEMPLE 10.6 On considère deux dés non pipés. Calculer la probabilité pour que le résultat obtenu
avec le premier soit un 4, sachant que le résultat du “bi-tirage” appartient à l’ensemble
B = {(3, 6), (4, 5), (4, 6), (5, 4), (5, 5), (5, 6), (6, 3), (6, 4), (6, 5), (6, 6)} .
L’espace de configurations est Ω = {(i, j), i, j = 1, . . . 6} et card(Ω) = 36. Pour tout ω ∈ Ω, P{ω } =
1/36.
A = {(4, 1), (4, 2), . . . (4, 6)} .
P{ A ∩ B} = 2/36, et P{ B} = 10/36. On a donc
1
P{ A | B } = .
5
Sous forme multiplicative, on peut aussi écrire
P{ A ∩ B } = P{ A | B }P{ B } , (10.12)
d’où on déduit la formule de Bayes

P{ A | B }P{ B } = P{ B | A }P{ A } . (10.13)


On en déduit également le résultat plus général suivant :

230
10.1 Modélisation probabiliste

P ROPOSITION 10.3 Pour toute famille finie d’évènements ( A1 , A2 , . . . An ) :

P{ A1 ∩ A2 ∩ · · · ∩ A n } = P{ A1 }P{ A2 | A1 }P{ A3 | A1 ∩ A2 } . . .
(10.14)
× P { A n | A 1 ∩ · · · ∩ A n −1 } .

Preuve : Il suffit de procéder de proche en proche :

P { A 1 ∩ · · · ∩ A n } = P { A n | A 1 ∩ · · · ∩ A n −1 } P { A 1 ∩ · · · ∩ A n −1 }
= P { A n | A 1 ∩ · · · ∩ A n −1 } P { A n −1 | A 1 ∩ · · · ∩ A n −2 }
× P { A 1 ∩ · · · ∩ A n −2 }
= ...
= P{ A1 }P{ A2 | A1 }P{ A3 | A1 ∩ A2 } . . .
× P { A n | A 1 ∩ · · · ∩ A n −1 } ,

ce qui prouve la proposition. ♠


Une autre propriété utile est la formule de probabilité totale

P ROPOSITION 10.4 Pour toute famille dénombrable d’évènements ( A1 , A2 , . . . ) telle que Ai ∩


A j = ∅ pour tous i, j et ∩ Ai ⊂ Ω, on a pour tout B ∈ F

P{ B } = ∑ P{ B | A i }P{ A i } . (10.15)
n

Preuve : Ecrivons la propriété de distributivité

P{ B} = P{ B ∩ ( A1 ∪ A2 ∪ . . . )} = P{( B ∩ A1 ) ∪ ( B ∩ A2 ) ∪ . . . )} .

Les B ∩ Ai étant disjoints deux à deux, il suffit d’appliquer (10.8) puis la formule de Bayes. ♠

Probabilités et intégrales

La façon la plus usuelle de construire un modèle probabiliste dans le cas continu est basée sur l’heu-
ristique suivante, que nous décrivons tout d’abord en dimension 1, par exemple dans le cas Ω ⊂ R.
On a déjà vu que dans ce cas, les nombres P{t}, t ∈ Ω n’ont pas de signification. On considère plutôt
un petit intervalle de la forme ∆t = [t, t + δt[, et on écrit

P{∆t} = P{[t, t + δt[} ≈ ρ(t)δt ;

ceci revient à écrire que la probabilité se comporte, en première approximation, de façon linéaire
par rapport à la taille de l’intervalle, tout du moins lorsque celui ci est petit, les variations sur des
distances plus grandes étant décrites par une fonction ρ.
Etant donné maintenant un intervalle I = [ a, b[, on commence par le “découper” en petits intervalles
de tailles δt1 , δt2 . . . δt N , centrés sur les valeurs t1 , t2 , . . . t N , et on écrit

P{ I } = ρ(t1 )δt1 + ρ(t2 )δt2 + · · · + ρ(t N )δt N .

Or, ceci n’est autre qu’une approximation de l’intégrale


Z Z b
ρ(t)dt = ρ(t)dt
I a

231
10 Introduction aux Probabilités

par une somme finie (à la Riemann). Ceci suggère de définir


Z
P{ I } = ρ(t) dt .
I

De plus étant donnés K intervalles I1 , . . . IK , disjoints deux à deux, et si A = I1 ∪ I2 ∪ · · · ∪ IK , on peut


écrire Z Z Z Z
P{ A } = ρ(t)dt + ρ(t)dt + . . . ρ(t)dt = ρ(t)dt.
I1 I2 IK A

Ainsi, dans les cas où Ω est un ensemble infini continu, on peut (sauf dans certains cas pathologiques)
définir l’application P à partir d’une fonction ρ, par la formule
Z
P{ A } = ρ(t) dt . (10.16)
A

D ÉFINITION 10.5 La fonction ρ ci-dessus est appelée densité de probabilités.

E XEMPLE 10.7 Si on reprend l’exemple ci-dessus d’un nombre tiré au hasard dans l’intervalle [0, 1],
on a bien Z b
P{[ a, b[} = b − a = dt ,
a
de sorte que cette probabilité est bien construire à partir d’une densité, qui est dans ce cas

ρ(t) = χ[0,1] (t) .

R EMARQUE 10.2 Nous avons utilisé l’intégrale de Riemann pour introduire la notion de densité de
probabilités. Cependant, une formulation plus rigoureuse et générale de la théorie doit être basée sur
la notion de mesure et l’intégrale de Lebesgue. Ceci ne change toutefois pas grand chose tant qu’il
s’agit de faire des calculs explicites.

Lorsqu’un modèle probabiliste est construit à partir d’une densité de probabilités, celle-ci doit satis-
faire un certain nombre de conditions. On en donne les deux les plus importantes ci-dessous.

P ROPOSITION 10.5 Soit ρ une densité de probabilités sur Ω ⊂ R.


1. ρ(ω ) ≥ 0 pour presque tout ω ∈ Ω.
R
2. Ω ρ(t)dt = 1

R ensemble A ⊂ Ω de mesure non nulle, tel que ρ(ω ) <


Preuve : Tout d’abord, supposons qu’il existe un
0 pour tout ωR ∈ A. Alors on aurait P{ A} = A ρ(ω )dω < 0, ce qui est impossible. Par ailleurs, on a
évidemment Ω ρ(ω )dω = P{Ω} = 1 ♠

R EMARQUE 10.3 une densité n’est pas à proprement parler une probabilité. Elle est certes à valeurs
positive, mais n’a aucune raison d’être toujours inférieure à 1 : il peut exister des valeurs t telles que
ρ(t) ≥ 1.

En dimension supérieure, on peut procéder de façon similaire. Par exemple, si Ω ⊂ Rn , on est conduit
à introduire une densité de probabilités ρ, qui est cette fois une fonction de plusieurs variables, ou
d’une variable vectorielle x = ( x1 , . . . xn ) :

ρ : Ω → R+ ,

232
10.1 Modélisation probabiliste

qui est telle que Z


ρ( x ) dx = 1 .

et
ρ( x ) ≥ 0 , ∀x ∈ Ω .
On peut aussi s’intéresser à des Ω plus compliqués (par exemple en considérant des points tirés au
hasard sur des sphères ou dans des objets géométriques complexes). On en verra des exemples par la
suite.

Variables aléatoires

Nous étudierons les variables aléatoires en détails dans le chapitre suivant. On se contente ici de
donner une idée grossière de la définition.
On considère un modèle probabiliste (Ω, F , P). On dira qu’une fonction X : Ω → U ⊂ R (ou parfois
C) est une variable aléatoire si on peut lui associer une distribution de probabilités, c’est à dire des
nombres
P X {V } = P{ ω ∈ Ω : X ( ω ) ∈ V }
pour certains sous ensembles V ⊂ U, telle que

P X {U } = 1 .

On verra de multiples utilisations de cette notion essentielle.

10.1.3 Exemples
Les exemples suivants illustrent la souplesse qu’offre la modélisation probabiliste, qui permet de
couvrir des situations très différentes. On va voir ici des exemples qui couvrent les trois cas de figures
que nous avons vus, à savoir des espaces Ω finis, infinis dénombrables, et continus.

Modèles finis

Quelques formules utiles Les modèles finis sont souvent construits à partir de dénombrements. On
voit ici quelques exemples simples.
1. Nombre d’applications E → F (où E, F sont deux ensembles finis) :

Card( F E ) = Card( F )Card(E) .

2. Nombre d’injections E → F (où E, F sont deux ensembles finis, avec r = Card( E) ≤ n =


Card( F )) :
n!
Arn = .
(n − r )!
Ce nombre représente le nombre de façons différentes de ranger r objets différents dans n boites,
avec au maximum un objet par cellule.
En particulier, le nombre de bijections E → E est donné par Ann = n! (aussi appelé nombre
d’arrangements de E).
3. Nombre de parties à r éléments de F :
Arn
 
n n!
Cnr = = = .
r r! r! (n − r )!
Ce nombre représente le nombre de façons différentes de ranger r objets identiques dans n
boites (permutations), avec au maximum un objet par boite.

233
10 Introduction aux Probabilités

Le modèle uniforme fini Le modèle uniforme consiste en un ensemble fini Ω = {ω1 , . . . , ω N }, au-
quel on associe des probabilités
1
P{ ωi } = , i = 1, . . . N .
N
On prend alors pour F l’ensemble (fini) de toutes les parties de Ω, et il est facile de voir que pour
tout k-uplet de ωi distincts ωi1 , . . . ωik , on a P ωi1 , . . . ωik = k/N.


Le modèle binômial On considère tout d’abord une expérience à 2 résultats possibles Ω0 = {ω1 , ω2 },
avec probabilités
P { ω1 } = p 1 , P { ω2 } = p 2 = 1 − p 1 .
Considérons maintenant N réalisations de cette expérience. Les résultats possibles sont des n-uplets
(ωi1 , ωi2 , . . . ωi N ), qui engendrent l’ensemble

Ω1 = {(ωi1 , ωi2 , . . . ωi N ) ∈ Ω0N } ,

et on a
P{(ωi1 , ωi2 , . . . ωi N )} = p1n1 p2n2 ,
où ni est le nombre d’occurrences de ωi dans le n-uplet (ωi1 , ωi2 , . . . ωi N ). Supposons maintenant que
l’on ne s’intéresse qu’aux nombres n1 et n2 . Comme n2 = N − n1 , il suffit de s’intéresser à n1 . Les
valeurs possibles de n1 forment l’ensemble

Ω = {0, 1, . . . N } ,

et la probabilité d’une valeur particulière de n1 est de la forme


n1 n1 N − n1
P{ n1 } = C N p1 p2 . (10.17)
n le nombre de façons différentes d’obtenir n fois le résultat ω en N tirages. Il est bien
On a noté ici CN 1
connu que l’on a

L EMME 10.1
n N!
CN = . (10.18)
n! ( N − n)!

Preuve : Procédons par récurrence et supposons le résultat valide jusqu’à l’ordre m, pour tout n =
0, . . . m. Pour obtenir n fois ω1 en m tirages, il faut soit avoir obtenu n fois ω1 en m − 1 tirages (Cm n
−1
n −1
chances), soit avoir obtenu n − 1 fois ω1 en m − 1 tirages (Cm −1 chances), et l’obtenir au m-ième tirage.

n n n −1 ( m − 1) ! ( m − 1) ! m!
Cm = Cm −1 + Cm−1 = + = .
n!(m − 1 − n)! (n − 1)!(m − n)! n!(m − n)!

Comme C00 = 1, ceci prouve le résultat. ♠


La formule du binôme donne immédiatement
N
∑ CNn p1n p2N−n = ( p1 + p2 ) N = 1 .
n =0

Comme précédemment, on prend pour F l’ensemble (fini) de toutes les parties de Ω. Le modèle
correspondant est appelé modèle binômial, et est donc caractérisé par
n n N −1
P{ n } = C N p1 p2 .

234
10.1 Modélisation probabiliste

Le modèle multinômial On considère tout d’abord une expérience à K résultats possibles Ω0 =


{ω1 , ω2 , . . . , ωK }, avec probabilités

P { ω1 } = p 1 , P { ω2 } = p 2 , . . . P { ω K } = p K ,

avec
p1 + p2 + · · · + p K = 1 .

Considérons maintenant N réalisations de cette expérience. Les résultats possibles sont des n-uplets
(ωi1 , ωi2 , . . . ωi N ), qui engendrent l’ensemble

Ω1 = {(ωi1 , ωi2 , . . . ωi N ) ∈ Ω0N } ,

et on a
P{(ωi1 , ωi2 , . . . ωi N )} = p1n1 p2n2 . . . pnKK ,

où ni est le nombre d’occurrences de ωi dans le n-uplet (ωi1 , ωi2 , . . . ωi N ). On a évidemment

n1 + n2 + · · · + n K = N .

Supposons maintenant que l’on ne s’intéresse qu’aux nombres n1 , . . . nK . Leurs valeurs possibles
forment un ensemble noté Ω, et la probabilité d’un ω = {n1 , n2 , . . . nK } particulier est de la forme

P{n1 , n2 , . . . nK } = N ( N; n1 , n2 , . . . nK ) p1n1 p2n2 . . . pnKK . (10.19)

Les nombres N ( N; n1 , . . . nK ) sont obtenus pas un calcul similaire au précédent :

L EMME 10.2
N!
N ( N; n1 , . . . nK ) = . (10.20)
n1 ! n2 ! . . . n K !

Le modèle correspondant est appelé modèle multinômial.

Le modèle hypergéométrique Le modèle hypergéométrique décrit des situations où un choix aléatoire
est effectué dans une population d’objets de deux types : par exemple, choisir 8 individus dans une
population de 10 garçons et 7 filles. Plus généralement, on considère une population de N objets, dont
n sont de type 1 et N − n sont de type 2. On en tire m au hasard, et on s’intéresse à la probabilité d’en
avoir tiré k de type 1 (et donc m − k de type 2). On peut montrer que cette probabilité vaut

k C n−k
(
Cm N −m
si max(0, n − ( N − m)) ≤ k ≤ min(m, n)
P{ k } = n
CN (10.21)
0 sinon.

On parle alors de modèle hypergéométrique H( N, n, m).


Un autre exemple est donné par ldes problèmes de type “loterie”, dans lesquelles on effectue n tirages
(sans remise), parmi N résultats possibles. Un joueur choisit (ou mise sur) m résultats possibles (bien
entendu, m ≤ N), et la probabilité qu’il ait k bons numéros vaut précisément le P{k } donné ci-dessus.

235
10 Introduction aux Probabilités

Modèles infinis dénombrables

Le modèle de Pascal Le modèle de Pascal (on parle aussi de modèle géométrique) est donné par

Ω = Z+ ,

et F est l’ensemble (infini dénombrable) des parties de Ω. La distribution de probabilités correspon-


dante est complètement caractérisée par un nombre p ∈]0, 1[, par

P{ n } = p n (1 − p ) . (10.22)

On vérifie facilement que


∞ ∞
∑ P{ n } = (1 − p ) ∑ pn = 1 ,
n =0 n =0

car il s’agit de la somme d’une série géométrique, qui converge puisque 0 < p < 1.

Le modèle de Poisson Le modèle de Poisson est généralement utilisé pour décrire la fréquence
d’apparition d’évènements rares. C’est un modèle dans lequel l’ensemble des résultats possibles Ω
est infini dénombrable :
Ω = Z+ ,
et on a, pour n ∈ Z+ ,
λn −λ
P{ n } = e , (10.23)
n!
où λ est un réel positif fixé. On vérifie que
∞ ∞
λn
∑ P{ n } = e − λ ∑ =1.
n =0 n=0 n!

R EMARQUE 10.4 Le modèle de Poisson peut être obtenu comme une certaine limite d’un modèle
binômial. En effet, partons d’un modèle binômial comme plus haut, et supposons que la probabilité
p1 soit très faible et que le nombre d’expériences N soit très grand :

p1  1 , N 1.

Alors, pour n  N, et en posant λ = N p1 , on peut écrire


   2 !!
  λ λ λ
log P{0} = log (1 − p1 ) N
= N log 1 − = −N +O ,
N N N

de sorte que l’on peut écrire


P{0} ≈ e − λ ,
l’approximation étant d’autant plus valide que λ2 /N est petit. De même, on a aussi

P{ n + 1} ( N − k)!n!
 
p1 λ n 1 λ
= = 1− ≈ ,
P{ n } ( N − n − 1) ! ( n − 1) ! p2 n+1 N p2 n+1

si on utilise l’hypothèse n  N et p1  1. Ceci conduit alors à

λn −λ
P{ n } ≈ e ,
n!
c’est à dire à un modèle Poissonnien.

236
10.1 Modélisation probabiliste

Modèles continus

Le modèle exponentiel Le modèle exponentiel est généralement utilisé pour décrire le temps d’at-
tente avant un évènement rare. Il s’agit d’un modèle continu :

Ω = R+ ,

et
P{[t, ∞[} = e−λt , (10.24)
où λ ∈ R+ caractérise le modèle. On voit facilement que
Z b
P{[ a, b]} = P{[ a, ∞[} − P{[b, ∞[} = e−λa − e−λb = ρ(t)dt ,
a

d’où une densité de probabilités de la forme

ρ(t) = λ e−λt . (10.25)

de nouveau, il est facile de vérifier que


Z ∞ Z ∞
ρ(t) dt = λ e−λt dt = 1 .
0 0

Le modèle exponentiel peut aussi être obtenu comme une limite de modèles discrets, comme le
montre l’exemple suivant.
E XEMPLE 10.8 On s’intéresse à la désintégration d’un atome (disons, un atome de radium), et on
s’intéresse au temps de survie de l’atome. Les valeurs possibles sont des nombres positifs (ou nuls),
de sorte que l’on prend Ω = R+ .
Pour décrire le processus en termes probabilistes, on commence par découper Ω en intervalles de
taille δt, et on fait le modèle suivant : si l’atome ne s’est toujours pas désintégré à l’instant t0 , on
suppose qu’il a une probabilité pδt de se désintégrer entre t0 et t0 + δt, et une probabilité égale à
qδt = 1 − pδt de ne pas se désintégrer entre t0 et t0 + δt. L’hypothèse essentielle qui est faite ici est
que ces deux probabilités ne dépendent pas de t0 . Par contre, il est normal de supposer que ces deux
probabilités dépendent de δt (et que pδt soit une fonction croissante de δt).
On peut alors calculer la probabilité pour que l’atome ne se soit toujours pas désintégré après le temps
t:  t
P{[t, ∞[} = (qδt )t/δt = q1/δt
δt .

Supposons que la limite limδt→0 q1/δt


δt existe, elle est nécessairement comprise entre 0 et 1. On pose
alors
lim q1/δt
δt = e−λ ,
δt→0
où λ est un nombre positif, et on obtient ainsi un “modèle limite” exponentiel.

Le modèle uniforme continu Le modèle uniforme est un autre exemple de modèle à ensemble Ω
continu, et correspond à la notion d’équiprobabilité : dans un modèle uniforme, les résultats possibles
ont tous même probabilité.
Commençons par le cas le plus simple : Etant donné un intervalle

Ω = [ a, b] ⊂ R ,

on définit le modèle uniforme sur [ a, b] en associant une probabilité à tout intervalle [u, v[⊂ [ a, b] :
v−u
P{[u, v[} = , (10.26)
b−a

237
10 Introduction aux Probabilités

et en utilisant (10.8) pour associer des probabilités à des sous-ensembles plus compliqués de Ω. Il est
facile de vérifier que ce modèle uniforme peut être construit à partir d’une densité de probabilités ρ
de la forme
1
ρ( x ) = χ (x) . (10.27)
b − a [a,b]
Plus généralement, il est possible de construire des modèles uniformes dans des domaines plus com-
plexes que des intervalles. Par exemple, étant donné un domaine borné V de dimension n, le modèle
uniforme sur V est donné par les probabilités P{ A} des sous-ensembles A ⊂ V
vol ( A)
P{ A } = , (10.28)
vol (V )
où l’application volume vol associe à A ⊂ V sa longueur (en dimension 1), son aire (en dimension 2),
son volume (en dimension 3) ou les généralisations en dimension supérieure.
Par exemple, prenons le cas d’un disque D de rayon fixé R. Sa surface vaut πR2 . Etant donné un
sous-ensemble A ⊂ D, sa probabilité vaut
1
Z
P{ A } = dx ,
πR2 A

de sorte que l’on peut caractériser le modèle par la densité de probabilités


1
ρ( x ) = χD (x) .
πR2
Notons qu’il s’agit d’une fonction qui est constante sur son support.
R EMARQUE 10.5 Il est important de signaler ici une propriété “désagréable” de la densité de proba-
bilités : elle change de forme lorsque l’on change de variables : en effet, considérons l’écriture de x en
coordonnées polaires : x = (r, θ ). En effectuant le changement de variables (r, θ ) = φ( x ), on a alors
1
Z
P{ A } = r dr dθ ,
πR2 A

de sorte qu’une fois écrite en coordonnées polaires, la densité de probabilités correspondante est
donnée par
r
ρ p (r, θ ) = ρ(φ( x )) = χ (r )χ[0,2π ] (θ ) ,
πR2 [0,R]
et n’est donc plus une fonction constante de θ et r. On verra cette propriété de façon plus précise en
discutant les variables aléatoires.

Le modèle normal (ou Gaussien) Le modèle normal joue un rôle central en théorie des probabilités
et en physique, car il est obtenu comme cas “limite” de bon nombre d’autres modèles. Il s’agit d’un
modèle à espace Ω infini continu :
Ω = R , ou Ω = Rn .
Dans le cas unidimensionnel, il est donné par la densité de probabilités Gaussienne :
1 2 2
ρ(t) = √ e−(t−µ) /2σ , (10.29)
σ 2π
où σ ∈ R+ et µ ∈ R sont deux paramètres caractérisant respectivement la largeur de ρ et sa localisa-
tion. Pour tout intervalle [ a, b[⊂ R, on a
Z b
1 2 /2σ2
P{[ a, b[} = √ e−(t−µ) dt ,
σ 2π a
R∞
et de nouveau −∞ ρ(t)dt = 1.

238
10.2 Variables aléatoires

10.2 Variables aléatoires


10.2.1 Généralités
Les modèles probabilistes que nous avons décrits dans le chapitre précédent ne donnent pas un cadre
suffisamment large pour les applications. On introduit alors les variables aléatoires, qui permettent
d’enrichir le calcul des probabilités.
Pour introduire la notion de variable aléatoire, il est bon d’illustrer tout d’abord par quelques exemples.

E XEMPLE 10.9 Dans un expérience de N tirages de “pile ou face”, à chaque ω ∈ Ω on peut associer
le nombre de fois où on a obtenu face dans ω = (ωi1 , . . . ωi N ). Ceci définit donc une fonction

N : ω ∈ Ω → N ( ω ) ∈ Z+ ,

qui est un premier exemple de variable aléatoire.

E XEMPLE 10.10 On tire au hasard, selon un modèle uniforme, un point dans un carré [0, 1] × [0, 1],
et on s’intéresse à la distance à l’origine :

R : ω ∈ [0, 1] × [0, 1] → R(ω ) ∈ [0, 2] .

R est encore une fonction Ω → [0, 2], et est un autre exemple de variable aléatoire.

En termes imagés, les variables aléatoires permettent de manipuler des “produits dérivés” des modèles
probabilistes.

D ÉFINITION 10.6 Etant donné un modèle probabiliste (Ω, F , P), on appelle variable aléatoire
toute fonction mesurable
X : ω ∈ Ω → X (ω ) ∈ R (ou Z) ,
c’est à dire telle que pour tout intervalle I ⊂ R, son image inverse X −1 ( I ) par X appartienne à
F.

Soit maintenant un sous ensemble Borélien A ⊂ R (c’est à dire une partie de R à laquelle on sait
associer une mesure). On peut alors s’intéresser à la quantité

P X { A } = P{ ω ∈ Ω : X ( ω ) ∈ A } , (10.30)

qui est bien définie.

D ÉFINITION 10.7 La collection des nombres PX { A}, où A ⊂ R est un sous-ensemble Borélien
de R, est appelée distribution de probabilités de la variable aléatoire X.

Dans la suite, on utilisera indistinctement les notations

P X { A } = P{ ω ∈ Ω : X ( ω ) ∈ A } = P{ X ( ω ) ∈ A } = P{ X ∈ A } .

R EMARQUE 10.6 Il est utile de faire ici un certain nombre de remarques.

239
10 Introduction aux Probabilités

1. En pratique, on n’a pas à se donner les nombres PX { A} pour tout A ⊂ R. On se contente d’une
règle permettant de calculer ces nombres. On en verra de nombreux exemples dans ce qui suit.
2. Dans le cas où Ω ⊂ R, la variable aléatoire la plus simple correspond à la fonction identité :
X (ω ) = ω.
3. Souvent, il n’est pas nécessaire de connaı̂tre les détails du modèle probabiliste sous-jacent pour
caractériser la distribution d’une variable aléatoire. C’est d’ailleurs préférable, dans la mesure
où les ensembles Ω sont souvent gigantesques et difficiles à manipuler (en particulier pour ce
qui est des applications en physique).

E XEMPLE 10.11 Si nous reprenons un des exemples que nous avons déjà abordés précédemment,
à savoir celui qui nous a conduits au modèle binômial, on considère l’ensemble Ω1 de toutes les
configurations possibles en N tirages. A chaque a ∈ Ω1 on peut alors associer le nombre X ( a) de fois
où ω1 est apparu. Cette fonction X définit une variable aléatoire dont la distribution est donnée par
n n N −n
P X { n } = P{ a ∈ Ω1 , X ( a ) = n } = C N p1 p2 ,

et il s’agit d’une distribution binômiale.

De même que nous avions vu des modèles probabilistes discrets et continus, on peut considérer des
variables aléatoires prenant leurs valeurs dans un espace discret (par exemple Z), ou continu. Plus
précisément, on distingue trois types de variables aléatoires : les variables aléatoires discrètes (c’est à
dire les fonctions X prenant un nombre fini ou infini dénombrable de valeurs), et deux catégories de
variables aléatoires continues : des variables aléatoires dites “à densité”, qui sont caractérisées par une
fonction appelée densité de probabilités, et des variables aléatoires dites “mixtes”, dont la distribution
de probabilités ne peut être caractérisée par une densité.
On discutera ici les deux premiers cas (discret et continu) séparément, évitant les variables aléatoires
mixtes, dont le traitement est plus complexe. Le cas discret nous permettra d’introduire des notions
dont la plupart se généralisent facilement au cas continu.

10.2.2 Variables aléatoires discrètes


Commençons donc par le cas des variables aléatoires discrètes. Etant donné un modèle probabiliste
(Ω, F , P), on considère donc la fonction mesurable X : Ω → R, dont on suppose qu’elle ne prend
qu’un nombre fini ou infini dénombrable de valeurs { x1 , x2 , . . .}. Il est clair que la distribution de
probabilités de X est complètement caractérisée par la donnée des nombres PX { xi } : en effet, on peut
facilement en déduire la probabilité pour que X prenne une des valeurs xk1 , xk2 , . . . xkn } grâce à la
règle
PX { xk1 , xk2 , . . . xk n } = PX { xk1 } + PX { xk2 } + · · · + PX { xk n } .

Fonction de répartition

La fonction de répartition constitue un intermédiaire de calcul souvent utile (dans le cas discret et
plus encore dans le cas continu).

D ÉFINITION 10.8 Soit X une variable aléatoire sur (Ω, F , P). Sa fonction de répartition est la
fonction FX : R → [0, 1] définie par

FX ( x ) = PX {] − ∞, x [} = P{ω ∈ Ω : X (ω ) < x } . (10.31)

240
10.2 Variables aléatoires

F IG . 10.1: Fonction de répartition d’une variable aléatoire discrète

Si X est une variable aléatoire discrète à valeurs dans { x1 , x2 , . . .}, on a alors

FX ( x ) = ∑ PX { xk } . (10.32)
k:xk < x

La fonction de répartition possède un certain nombre de propriétés intéressantes, faciles à démontrer :

P ROPRI ÉT É 10.1 1. FX est monotone : si x ≤ y, alors FX ( x ) ≤ FX (y).


2. Par conséquent, pour tout x, 0 ≤ FX ( x ) ≤ limy→∞ FX (y) = 1.
3. La fonction de répartition est continue à gauche : pour tout x,

lim FX (y) = FX ( x ) .
y→ x,y≤ x

En fait, quand X est une variable aléatoire discrète, sa fonction de répartition est une fonction constante
par morceaux, comme on peut le voir dans l’exemple donné en F IG . 10.1.

Fonction d’une variable aléatoire : transfert de loi

Etant donnée la distribution d’une variable aléatoire X, et une fonction ϕ : R → R, on peut en déduire
la distribution de probabilités d’une nouvelle variable aléatoire (on parle alors de transfert de loi)

Y = ϕ( X ) : ω ∈ Ω → Y (ω ) = ϕ( X (ω )) ,

à condition que ϕ vérifie des conditions de mesurabilité appropriées. On peut alors calculer
n o
PY {y} = P{ω : ϕ( X (ω )) = y} = P ω : X (ω ) ∈ ϕ−1 ({y}) = PX { ϕ−1 ({y})} , (10.33)

où ϕ−1 ({y}) est l’image inverse du singleton {y} par la fonction ϕ. Si ϕ est bijective, le choses sont
plus simples car ϕ−1 ({y}) est le singleton ϕ−1 (y), et on peut écrire
n o
PY {y} = P ω : X (ω ) = ϕ−1 (y) = PX { ϕ−1 (y)} .

E XEMPLE 10.12 Prenons l’exemple d’une variable aléatoire X à valeurs entières : X (ω ) ∈ Z pour
tout ω ∈ Ω, et la fonction ϕ( x ) = x2 . Alors pour y 6= 0 on a
√ √ √
PY {y} = P{ω : X (ω ) = ± y} = PX { y} + PX {− y} ,

241
10 Introduction aux Probabilités

et PY {0} = PX {0}.
Prenons le cas particulier d’une variable aléatoire X Poissonnienne : PX {n} = e−λ λn /n!. Comme X
ne prend que des valeurs positives, ϕ est une bijection de Z+ sur ϕ(Z+ ), et on peut écrire
√ √ √
e−λ λ y
si y ∈ Z+

/( y!)
PY {y} =
0 sinon .

Espérance, variance

Espérance mathématique L’espérance mathématique est la notion probabiliste qui permet de décrire
la valeur moyenne d’une variable aléatoire. La définition est donnée par

D ÉFINITION 10.9 Soit X une variable aléatoire discrète sur (Ω, F , P). Son espérance
mathématique est donnée par
E { X } = ∑ xk PX { xk } , (10.34)
k

où les xk sont les valeurs prises par X.

L’espérance mathématique est une application linéaire : si X, Y sont deux variables al éatoires sur le
même modèle probabiliste, alors E { X + Y } = E { X } + E {Y }. De même, si λ ∈ R, on a E {λX } =
λE { X }.
Une autre propriété importante est la propriété suivante :

E {| X |} = 0 implique X (ω ) = 0 presque sûrement. (10.35)

La signification précise de cette dernière assertion est la suivante : si E {| X |} = 0, alors P{ X (ω ) = 0} =


1.

E XEMPLE 10.13 Prenons l’exemple de la roulette : 37 résultats possibles (Ω = {0, d . . . 36}. Si on mise
une somme x0 sur l’une des 37 cases, le gain est de 36 x0 en cas de tirage favorable, et de 0 sinon. On
peut donc modéliser le gain comme une variable aléatoire X qui vaut 36x0 avec probabiilité p = 1/37,
et 0 avec probabilité 1 − p = 36/37. L’espérance de X vaut alors

36
E {X} = x0 .
37

On peut également miser sur rouge ou noir, ou sur pair ou impair. Dans ce cas (comme le 0 est
considéré comme “ni pair ni impair”, et est associé à la couleur verte), la probabilité de gagner est
p = 18/37. Si on mise x0 , le gain est une variable aléatoire X qui vaut 2x0 en cas de tirage gagnant, et
0 sinon. L’espérance du gain vaut de nouveau E { X } = 36x0 /37.

E XEMPLE 10.14 Espérance d’une variable aléatoire de loi géométrique : Considérons le cas d’une variable
aléatoire X de distribution géométrique. X prend des valeurs entières positives ou nulles, et sa distri-
bution est complètement caractérisée par un nombre p ∈]0, 1[, par

P X { k } = p k (1 − p ) , k = 0, 1, . . .

242
10.2 Variables aléatoires

On peut alors calculer



E {X} = ∑ kpk (1 − p)
k =0

= p (1 − p ) ∑ k p k −1
k =1

d
= p (1 − p )
dp ∑ pk
k =1
 
1 d
= p (1 − p ) −1
1− p dp
p (1 − p ) p
= 2
= ,
(1 − p ) 1− p

où on a utilisé la somme de la série géométrique, qui converge puisque p < 1.

R EMARQUE 10.7 Il existe des variables aléatoires pour lesquelles l’espérance mathématique n’est pas
définie, ou plutôt telles que la somme dans l’équation (10.34) soit divergente. C’est le cas par exemple
de la variable aléatoire X à valeurs dans Z+ définie par PX {k } = 6/(kπ )2 , k = 1, 2, . . . . On a bien
∑1∞ PX {k } = 1, mais ∑1∞ kPX {k } est divergente.

Espérance d’une fonction d’une variable aléatoire Soit X une variable aléatoire discrète prenant
les valeurs x1 , x2 , . . . avec probabilités p1 , p2 , . . . , et considérons la variable aléatoire Y = X 2 . Si les xi
sont tous positifs, les nombres xi2 sont tous différents, et Y prendra donc les valeurs x12 , x22 , . . . avec
probabilités p1 , p2 , . . . , et on pourra écrire

E {Y } = ∑ xi2 pi .
i

Supposons maintenant que les xi2 ne soient pas tous différents, par exemple que x12 = x22 , et que
tous les autres x2j soient deux à deux différents. Alors PX { x12 } = p1 + p2 , et E {Y } = ( p1 + p2 ) x12 +
∑i6∈{1,2} xi2 pi , qui coı̈ncide avec l’équation précédente. On vérifie de même que cette expression reste
inchangée dans les cas où plus de deux valeurs de xi2 coı̈ncident. Ceci suggère la définition suivante :

D ÉFINITION 10.10 Soient X et Y = ϕ( X ) deux variables aléatoires discrètes. On note


x1 , x2 , . . . les valeurs prises par X. L’espérance de Y = ϕ( X ) est donnée par

E {Y } = ∑ ϕ ( x i )P X { x i } . (10.36)
i

On définit ainsi (lorsque les séries correspondantes sont convergentes) les moments de X

E {Xn } = ∑ xin PX {xi } , (10.37)


i

la variance de X :
Var { X } = E ( X − E { X })2 ,

(10.38)
et l’écart type de X
q
σX = Var { X } .

243
10 Introduction aux Probabilités

On peut en particulier remarquer que

Var { X } = E X 2 − E { X }2 .


La variance est une opération non-linéaire : Var { X + Y } 6= Var { X } + Var {Y } en général (lorsque
l’égalité est vérifiée, on dit que X et Y sont décorrélées). De plus, si λ ∈ R, on a Var {λX } =
λ2 Var { X }.
E XEMPLE 10.14 ( SUITE ) On peut calculer la variance d’une variable aléatoire de loi géométrique en
utilisant les mêmes techniques que pour le calcul de l’espérance :


E X2 ∑ k 2 p k (1 − p )

=
k =0

= E {X} + ∑ k ( k − 1) p k (1 − p )
k =0

p
=
1− p
+ p2 (1 − p ) ∑ k ( k − 1 ) p k −2
k =2

p d2
=
1− p
+ p2 (1 − p ) 2
dp ∑ pk
k =2
d2
 
p 1
= + p2 (1 − p ) 2 −1− p
1− p dp 1− p
p 2p2 p + p2
= + = ,
1 − p (1 − p )2 (1 − p )2

d’où on déduit la variance :


p
Var { X } = .
(1 − p )2

E XEMPLE 10.15 Considérons une variable aléatoire Poissonnienne X, de paramètre λ > 0. Les va-
leurs prises par X sont donc 0, 1, 2, . . . , avec des probabilités données par une loi de Poisson :

λk −λ
PX {k } = e .
k!

Un calcul direct donne


∞ ∞
λk λ k −1
E {X} = ∑ k k! e−λ = λe−λ ∑ (k − 1)! = λ .
0 1

De même,

∞ ∞
λk λ k −2
E X 2 = E { X } + ∑ k ( k − 1) e − λ = λ + λ2 e − λ ∑ = λ + λ2 ,

0 k! 2 ( k − 2 ) !

de sorte que
Var { X } = λ .

R EMARQUE 10.8 On peut construire de même l’espérance de fonctions ϕ( X ) de X dans le cas où ϕ
est à valeurs complexes, comme on le verra en étudiant les fonctions caractéristiques.

244
10.2 Variables aléatoires

La fonction caractéristique La fonction caractéristique (parfois appelée fonction génératrice) est


un intermédiaire de calcul souvent très utile lorsqu’il s’agit de calculer les moments d’une variable
aléatoire.

D ÉFINITION 10.11 Soit X une variable aléatoire discrète. La fonction caractéristique de X est la
fonction GX : R → C définie par
n o
GX (u) = E e−iuX = ∑ e−iuxk PX { xk } . (10.39)
k

Il est facile de voir que cette série est absolument convergente, puisque

| GX (u)| ≤ ∑ e−iuxk PX { xk } = ∑ PX { xk } = 1 .
k k

Remarquons que cette définition est réminiscente de la transformation de Fourier. Cette analogie sera
plus claire dans le cas des variables aléatoires à densité.
La fonction caractéristique permet de calculer facilement les moments de X (lorsqu’ils existent) :

P ROPOSITION 10.6 Soit GX la fonction caractéristique de la variable aléatoire X. Alors

GX ( 0 ) = 1 , (10.40)

et plus généralement, pour tout n ∈ Z+ tel que E { X n } existe

d n
  
i GX ( 0 ) = E { X n } . (10.41)
du

Preuve : Partant de la définition de GX , on a

d n −iuxk
 
∑ i du e PX {xk } = ∑ xkn e−iux PX {xk } .
k

k k

Si cette série est absolument convergente, elle vaut E { X n } pour u = 0, et on peut aussi intervertir la
sommation et la dérivation, ce qui prouve le résultat. ♠
E XEMPLE 10.15 (suite). Reprenons l’exemple de la variable aléatoire Poissonnienne. La fonction ca-
ractéristique vaut
∞ ∞ λe−iu k

k
−iuk λ −λ
GX ( u ) = ∑ e e =∑
−iu
e−λ = e−λ eλe .
0 k! 0 k!
Comme attendu, GX (0) = 1. En dérivant une première fois,

0 −iu −iu
iGX (u) = ie−λ (−i )λe−iu eλe = λe−λ e−iu eλe ,
0 (0) = λ. En dérivant une seconde fois,
de sorte que iGX
 −iu −iu
   −iu
− GX00 (u) = iλe−λ −ie−iu eλe − iλe−2iu eλe = λe−iu + λ2 e−2iu e−λ eλe ,

00 (0) = λ + λ2 , et donc σ = λ.
ce qui redonne bien − GX X

245
10 Introduction aux Probabilités

Paires de variables aléatoires

Généralités On s’intéresse maintenant à des familles de variables aléatoires. Considérons pour com-
mencer une paire de variables aléatoires X, Y sur un même modèle probabiliste (Ω, F , P). Les distri-
butions de probabilités PX et PY donnent des indications sur le comportement de X et Y, mais pas
sur les relations existant entre X et Y. C’est pourquoi il est important de s’intéresser au comportement
de la paire ( X, Y ).

D ÉFINITION 10.12 Soient X, Y deux variables aléatoires sur un même modèle probabiliste
(Ω, F , P). La distribution de probabilités jointe de X, Y est l’ensemble des nombres

PX,Y {U } = P{ω ∈ Ω : ( X (ω ), Y (ω )) ∈ U } , (10.42)

où U ⊂ R2 est un ensemble mesurable quelconque. Les distributions de probabilités PX et PY


sont appelées distributions marginales de PX,Y .

Il est facile d’obtenir les distributions marginales à partir de la distribution jointe. Supposons que X et
Y soient des variables aléatoires discrètes, à valeurs dans { x1 , x2 , . . .} et {y1 , y2 , . . .} respectivement.
Soit V un sous-ensemble mesurable de R. On peut écrire

P X {V } = ∑ PX { xi }
xi ∈V

= ∑ P{ X (ω ) = xi , Y (ω ) ∈ {y1 , y2 , . . .}}
xi ∈V

∑ ∑P

= X ( ω ) = xi , Y ( ω ) = y j
xi ∈V j

= ∑ PX,Y {V × {y j }}
j

Notons que la réciproque est fausse : la connaissance des distributions marginales ne permet pas de
retrouver la distribution jointe en général. Il suffit pour s’en convaincre de considérer le cas extrême
Y = X. La connaissance des distributions marginales PX et PY (au demeurant identiques) ne permet
pas de savoir que Y = X.

E XEMPLE 10.16 Soient deux variables aléatoires X, Y, prenant des valeurs entières 0, 1, . . . N, de dis-
tribution jointe multinômiale
N!
PX,Y {n, m} = p n p m (1 − p1 − p2 ) N − n − m ,
n! m! ( N − n − m)! 1 2

où p1 , p2 ∈ [0, 1] sont tels que 0 ≤ p1 + p2 ≤ 1.


On obtient de là la distribution de X :
N −n
N!
PX {n} = ∑ p n p m (1 − p1 − p2 ) N − n − m ,
n! m! ( N − n − m)! 1 2
m =0
N −n
N! 1 ( N − n)!
= p1n ∑ p2m (1 − p1 − p2 )( N −n)−m ,
n! ( N − n)! m =0 m! ( N − n − m ) !
N!
= p n (1 − p1 ) N − n .
n! ( N − n)! 1

Il s’agit là encore d’une distribution binômiale.

246
10.2 Variables aléatoires

Espérance de fonction de deux variables aléatoires Etant données deux variables aléatoires X, Y,
et une fonction mesurable ϕ : R2 → R, on considère la variable aléatoire Z = ϕ( X, Y ), définie par :
pour tout ω ∈ Ω,
Z (ω ) = ϕ( X (ω ), Y (ω )) .
Pour calculer l’espérance de Z, une première démarche consiste à calculer tout d’abord la distribution
de probabilités de Z, puis de calculer l’espérance grâce à l’expression classique : dans le cas discret :

E {Z} = ∑ zi PZ { zi } ,
i

oú les zi sont les valeurs possibles de Z. On peut en fait montrer que l’espérance de Z peut également
être obtenue de la façon suivante :

D ÉFINITION 10.13 Soient X, Y, Z = ϕ( X, Y ) trois variables aléatoires discrètes sur (Ω, F , P).
On note { x1 , x2 , . . .} et {y1 , y2 , . . .} les valeurs possibles de X et Y respectivement. L’espérance
mathématique de Z est donnée par

E {Z} = ∑ ϕ(xi , y j )PX,Y {xi , y j } . (10.43)


i,j

Ces notions nous sont utiles pour introduire la covariance et la corrélation :

D ÉFINITION 10.14 Soient X, Y deux variables aléatoires sur (Ω, F , P).


1. La covariance de X et Y est le nombre

Γ X,Y = E {( X − E { X })(Y − E {Y })} . (10.44)

2. X et Y sont décorrélées si Γ X,Y = 0.


3. Le coefficient de corrélation de X et Y est donné par

Γ X,Y
r ( X, Y ) = . (10.45)
σX σY

Remarquons que
Γ X,X = Var { X } ,
et que
Var { X + Y } = Var { X } + Var {Y } + 2Γ X,Y .
La covariance donne des indications sur une possible “association” systématique des variables aléatoires
X et Y. Le coefficient de corrélation (qui est toujours un nombre sans dimension) fournit une version
“normalisée” de la covariance. Il a les propriétés suivantes.

P ROPOSITION 10.7 Soient X et Y deux variables aléatoires sur (Ω, F , P).


1. −1 ≤ r ( X, Y ) ≤ 1.
2. Si r ( X, Y ) = 1, alors il existe une relation du type Y = aX + b, où a, b ∈ R et a > 0.
3. Si r ( X, Y ) = −1, alors il existe une relation du type Y = aX + b, où a, b ∈ R et a < 0.

247
10 Introduction aux Probabilités

Preuve : 1. Si on note X̃ = X − E { X } et Ỹ = Y − E {Y }, on a clairement Γ X̃,Ỹ = Γ X,Y , et r ( X̃, Ỹ ) =


r ( X, Y ). Calculons
( 2 )
E X̃ 2 E Ỹ 2 E X̃Ỹ E X̃Ỹ
   
X̃ Ỹ
E − = + −2 = 2−2 ≥0.
σX σY σX2 σY2 σX σY σX σY

Donc, E X̃Ỹ ≤ σX σY , ce qui montre que r ( X, Y ) ≤ 1. De même, l’inégalité




( 2 )
X̃ Ỹ
E + ≥0
σX σY

permet de montrer que r ( X, Y ) ≥ −1.


2. Supposons r ( X, Y ) = 1. Ceci implique Γ X,Y = σX σY . Par conséquent
( 2 )
X̃ Ỹ
E − =0,
σX σY

ce qui implique, d’après (10.35) que


σY
Ỹ = X̃ ,
σX
et donc le résultat cherché, avec a = σY /σX > 0, et b = σY E { X }/σX − E {Y }.
3. La démonstration est identique, et conduit à a = −σY /σX < 0. ♠

Vecteurs aléatoires

On considère maintenant des familles de plusieurs variables aléatoires, que l’on nomme vecteurs
aléatoires.

D ÉFINITION 10.15 Soient X1 , X2 , . . . Xn n variables aléatoires sur un même modèle probabiliste


(Ω, F , P). La distribution de probabilités jointe de X1 , . . . Xn est l’ensemble des nombres

PX1 ,...Xn {U } = P{( X1 (ω ), . . . Xn (ω )) ∈ U } , (10.46)

où U ⊂ Rn est un ensemble mesurable quelconque. Les distributions de probabilités PXi sont
appelées distributions marginales.

Comme dans le cas des paires de variables aléatoires, il est facile d’obtenir les distributions marginales
à partir de la distribution jointe. La réciproque est toujours fausse : la connaissance des distributions
marginales ne permet pas de retrouver la distribution jointe en général.
La distribution jointe permet également de calculer l’espérance de fonctions du vecteur aléatoire
considéré. Si Z = ϕ( X1 , . . . Xn ) est fonction du vecteur aléatoire ( X1 , . . . Xn ), on a alors

E {Z} = ∑ ϕ( x1 , . . . xn )PX1 ,...Xn { x1 , . . . xn } . (10.47)


x1 ,...xn

10.2.3 Variables aléatoires à densité


On s’intéresse maintenant aux variables aléatoires prenant leurs valeurs dans un ensemble infini
continu, et on s’intéresse aux variables aléatoires dites “à densité”.

248
10.2 Variables aléatoires

D ÉFINITION 10.16 Une variable aléatoire X sur (Ω, F , P) est dite à densité si il existe une
fonction ρ X ∈ L1 (R) telle que pour tout ensemble mesurable U ⊂ R,
Z
P X {U } = ρ X ( x ) dx . (10.48)
U

Propriétés de la densité

Une densité de probabilités ρ X est à valeurs réelles. Cependant, ρ X ( x ) ≥ 0 presque partout (par
contre, rien de contraint la densité de probabilités à prendre des valeurs inférieures à 1). De plus, on
a Z ∞
ρ X ( x ) dx = PX {R} = 1 . (10.49)
−∞

Fonction de répartition La fonction de répartition d’une variable aléatoire à densité est définie
comme dans le cas discret (voir D ÉFINITION 10.8), et les propriétés énoncées dans la section P RO -
PRI ÉT ÉS 10.1 restent valables. La nouveauté est que la fonction de répartition est maintenant donnée
par Z x
FX ( x ) = PX {] − ∞, x [} = ρ X ( x ) dx ,
−∞
et est continue. De plus, on a
d
ρX (x) = FX ( x ) . (10.50)
dx

E XEMPLE 10.17 Soit X une variable aléatoire exponentielle, de paramètre α : pour tout x > 0,
P{ X (ω ) ≥ x } = e−αx .
On a donc la fonction de répartition
FX ( x ) = (1 − e−αx )Θ( x ) ,
et la densité
ρ X ( x ) = FX0 ( x ) = αe−αx Θ( x ) .
La fonction de répartition (définie sur R+ ) est montrée en F IGURE 10.2.

Densité d’une fonction de variable aléatoire Etant données deux variables aléatoires à densité X et
Y = ϕ( X ) sur (Ω, F , P), on cherche à relier la densité de Y à la densité ρ X de X. Dans le cas général,
il faut procéder en deux étapes : dans un premier temps, calculer la fonction de répartition de Y en
fonction de la densité ρ X de X ; puis en déduire la densité par dérivation.
Prenons l’exemple d’une variable aléatoire à valeurs réelles (positives ou négatives) X, de densité ρ X ,
et de Y = X 2 . La fonction de répartition de Y est donnée par


Z y
FY (y) = P X (ω )2 < y = P{ X (ω ) < y}Θ(y) = Θ(y)

√ ρ X ( x ) dx .
− y

On en déduit la densité de Y par dérivation :


√ −1 √ √ √
 
1 1
ρY ( y ) = Θ ( y ) √ ρ X ( y) − √ ρ X (− y) = Θ(y) √ (ρ X ( y) + ρ X (− y)) .
2 y 2 y 2 y
On voit bien sur l’exemple ci-dessus la difficulté introduite par le fait que le ϕ choisi ne soit pas bijectif.
Lorsque ϕ est bijectif, les choses sont un peu plus simples, et on peut énoncer le résultat suivant :

249
10 Introduction aux Probabilités

F IG . 10.2: Fonction de répartition d’une variable aléatoire de distribution exponentielle

T H ÉOR ÈME 10.1 Si ϕ est une bijection différentiable, à inverse différentiable, la densité ρY de
Y = ϕ( X ) est donnée par
ρY (y) = ( ϕ−1 )0 (y)ρ X ( ϕ−1 (y)) . (10.51)

Preuve : Les hypothèses faites sont précisément celles qui nous permettent de faire un changement de
variables :
d d y
Z Z
ρY ( y ) = ρ X ( x ) dx = ρ X ( ϕ−1 (u)) ( ϕ−1 )0 (u) du ,
dy ϕ−1 (]−∞,y[ dy −∞

ce qui prouve le résultat. ♠

Une convention de notation

Il est parfois utile d’introduire une notation permettant de traiter simultanément les cas discrets et
continus. On introduit pour cela le symbole dPX ( x ) (que l’on note parfois PX (dx )), auquel on donne
la signification suivante :
 R
ρ ( x ) dx si X est à densité ρ X
Z
P X {U } = dPX ( x ) = U X (10.52)
U ∑ x i ∈U P X { x i } si X prend les valeurs x1 , x2 , . . .

De même, étant donnée une fonction f : R → C, on notera


 R
f ( x )ρ X ( x ) dx si X est à densité ρ X
Z
f ( x )dPX ( x ) = U (10.53)
U ∑ x i ∈U f ( x i ) P X { x i } si X prend les valeurs x1 , x2 , . . .

Bien entendu, des hypothèses sont nécessaires dans les deux cas pour assurer l’existence du membre
de gauche. Nous utiliserons cette notation dans la suite, en particulier en manipulant l’espérance
mathématique.

Espérance, moments,...

Les définitions des espérances mathématiques des variables aléatoires à densité sont similaires à celles
vues dans le cas discret.

250
10.2 Variables aléatoires

D ÉFINITION 10.17 1. L’espérance mathématique d’une variable aléatoire continue X de den-


sité ρ X est définie par Z ∞
E {X} = xρ X ( x ) dx . (10.54)
−∞

2. Etant donnés deux variables aléatoires continues X et Y = ϕ( X ), l’espérance mathématique


de Y est définie par Z ∞
E { ϕ( X )} = ϕ( x )ρ X ( x ) dx . (10.55)
−∞

En utilisant la notation introduite plus haut, on peut noter l’espérance d’une fonction de variable
aléatoire quelconque (continue ou discrète)
Z ∞
E { ϕ( X )} = ϕ( x ) dPX ( x ) . (10.56)
−∞

On introduit par exemple les moments


Z ∞
E {Xn } = x n ρ X ( x ) dx ,
−∞

et la variance Z ∞
Var { X } = ( x − E { X })2 ρ X ( x ) dx .
−∞

La fonction caractéristique est introduite de façon similaire :

D ÉFINITION 10.18 Soit X une variable aléatoire continue de densité ρ X . La fonction ca-
ractéristique de X est la fonction GX : R → C définie par
n o Z ∞
−iuX
GX ( u ) = E e = e−iux ρ X ( x ) dx . (10.57)
−∞

En utilisant le symbole dPX , on notera dans le cas général


Z ∞
GX ( u ) = e−iux dPX ( x ) .
−∞

Dans le cas d’une variable aléatoire à densité, la fonction caractéristique est proportionnelle à la trans-
formée de Fourier de la densité :

GX (u) = 2π ρ̂ X (u) .

On peut également en déduire (si la formule d’inversion de Fourier a un sens dans ce contexte) une
expression de la densité à partir de la fonction caractéristique :
Z ∞
1
ρX (x) = GX (u)eiux du .
2π −∞

Il est facile de montrer que la P ROPOSITION 10.6 reste valide dans le cas des variables aléatoires à
densité (la démonstration est similaire à celle donnant la dérivée d’une transformée de Fourier).

251
10 Introduction aux Probabilités

E XEMPLE 10.18 Considérons une variable aléatoire exponentielle X, de paramètre α. La densité est
donc
ρ X ( x ) = αe−αx Θ( x ) ,
et la fonction caractéristique est donnée par
Z ∞
α
GX ( u ) = α e−αx e−iux dx = .
0 α + iu
On vérifie facilement que GX (0) = 1. En dérivant une première fois, on a

0 α
iGX (u) = ,
(α + iu)2

d’où
1
E {X} = .
α
De même,

− GX00 (u) =
(α + iu)3
donne
2
E X2 = 2 ,

α
et donc Var { X } = α−2 .

Vecteurs aléatoires

Ici encore, la discussion faite dans le cas discret se transpose sans grande diffiulté au cas continu.

Densité jointe

D ÉFINITION 10.19 Un vecteur aléatoire ( X1 , . . . Xn ) sur (Ω, F , P) est dit vecteur aléatoire
à densité si il existe une fonction de n variables ρ X1 ,...Xn telle que pour toute partie mesurable
V ⊂ Rn , on puisse écrire
Z
P{( X1 (ω ), . . . Xn (ω )) ∈ V } = ρ X1 ,...Xn ( x1 , . . . xn ) dx1 . . . dxn . (10.58)
V

La fonction ρ X1 ,...Xn est appelée densité de probabilités jointe de X1 , . . . Xn .

Au même titre que la densité de probabilités d’une variable aléatoire, la densité jointe d’un vecteur
aléatoire est positive presque partout. Elle a également un comportement remarquable vis à vis des
changements de variables, comme le montre le résultat suivant, qui généralise le T H ÉOR ÈME 10.1

T H ÉOR ÈME 10.2 Soit ( X1 , . . . Xn ) un vecteur aléatoire sur (Ω, F , P), à valeurs dans U ⊂ Rn ,
et soit Φ : U → V = Φ(U ) ⊂ Rn une application bijective différentiable, à inverse différentiable.
On note (Y1 , . . . Yn ) = Φ( X1 , . . . Xn ), et JΦ−1 le Jacobien de Φ−1 . Alors la densité jointe de
(Y1 , . . . Yn ) est donnée par

ρY1 ,...Yn (y1 , . . . yn ) = | JΦ−1 (y1 , . . . yn )| ρ X1 ,...Xn (Φ−1 (y1 , . . . yn )) . (10.59)

252
10.2 Variables aléatoires

Preuve : La démonstration de ce résultat est relativement simple. Soit f une fonction bornée à support
borné définie sur U. Calculons
Z
E { f (Y1 , . . . Yn )} = f (y1 , . . . yn )ρY1 ,...Yn (y1 , . . . yn ) dy1 . . . dyn
ZV
= f (Φ( x1 , . . . xn ))ρ X1 ,...Xn ( x1 , . . . xn ) dx1 . . . dxn
U
Z
= f (y1 , . . . yn )ρ X1 ,...Xn (Φ−1 (y1 , . . . yn ))
V
× | JΦ−1 (y1 , . . . yn )| dy1 . . . dyn ,

par changement de variables. Ceci étant vrai pour toute fonction f continue à support borné, on en
déduit le résultat. ♠
Il est utile de considérer quelques exemples pour illustrer ce résultat. Les exemples les plus simples
sont fournis par les changements de systèmes de coordonnées (du système Cartésien au système
angulaire en particulier).
E XEMPLE 10.19 Supposons que des fléchettes soient tirées au hasard sur une cible ronde de rayon r0 ,
avec une distribution uniforme sur le disque. On s’intéresse à la répartition des impacts en fonction
de la distance au centre de la cible. La modélisation la plus adaptée consiste à introduire un espace
Ω égal au disque de rayon r0 . La distribution étant uniforme sur Ω, elle est associée à une densité de
probabilités ρ, de sorte que pour tout A ⊂ Ω, on ait

Vol( A) 1
Z Z
P{ A } = = 2 dxdy = ρ( x, y) dxdy .
Vol(Ω) πr0 A A

Ainsi, la densité ρ est donnée de la façon suivante : si ω = ( x, y) ∈ Ω,


(
1
πr02
si ω ∈ Ω
ρ(ω ) =
0 sinon .

Introduisons les variables aléatoires X et Y correspondant aux coordonnées Cartésiennes de ω :


X (ω ) = x et Y (ω ) = y. La densité jointe de X et Y est évidemment
(
1
πr02
si le point de coordonnées ( x, y) appartient à Ω
ρ X,Y ( x, y) =
0 sinon .

Si nous introduisons maintenant les variables aléatoires R et Θ représentant les coordonnées polaires
de ω, nous avons d’après le théorème précédent
(
r
πr02
si le point de coordonnées polaires (r, θ ) appartient à Ω
ρ R,Θ (r, θ ) =
0 sinon .

Il est important de remarquer que la distribution jointe de X, Y est une distribution uniforme, alors
que la distribution jointe de R, Θ n’est absolument pasnuniforme. o

Ceci nous permet entre autres de calculer E { R} = E X 2 + Y 2 de deux façons différentes :
Z r0 Z 2π
1 2
Z q
E { R} = x2 + y2 ρ X,Y ( x, y ) dxdy = r2 dt dθ = r0 ;
Ω πr02 0 0 3
ou encore Z r0 Z 2π
2
E { R} = rρ R,Θ (r, θ ) rdrdθ = r0 .
0 0 3
Ces deux calculs sont en fait tout à fait similaires.

253
10 Introduction aux Probabilités

E XEMPLE 10.20 Prenons un autre exemple, issu de la physique. On suppose que l’état d’une particule
est décrit par une fonction d’onde ( x, y, z) ∈ R3 → ψ( x, y, z) ∈ C. Conformément à l’interprétation
donnée par Sommerfeld, on donne à ρ = |ψ( x, y, z)|2 le sens d’une densité de probabilité de présence
au point ω = ( x, y, z) ∈ R3 . De nouveau, on peut interpréter ρ comme la densité jointe des variables
aléatoires X, Y, Z représentant les coordonnées Cartésiennes du point considéré. On peut également
introduire les variables aléatoires R, Θ et φ représentant les coordonnées sphériques. Il est alors facile
de voir que
ρ R,Θ,φ (r, θ, ϕ) = r2 sin θ ρ(r sin θ cos ϕ, r sin θ sin ϕ, r cos θ ) .

Fonction de plusieurs variables aléatoires Etant données n variables aléatoires ( X1 , . . . Xn ), et une


fonction ϕ : Rn
→ R, on peut de nouveau introduire une variable aléatoire Z = ϕ( X1 , . . . Xn ). Sa dis-
tribution peut dans certains cas être déduite simplement de la distribution jointe de ( X1 , . . . Xn ), mais
ce cas se présente rarement. Pour calculer l’espérance de Z, il est généralement préférable d’utiliser
la relation Z
E { ϕ( X1 , . . . Xn )} = ϕ( x1 , . . . xn )ρ X1 ,...Xn ( x1 , . . . xn ) dx1 . . . dxn . (10.60)
Rn

Si nous reprenons l’exemple inspiré de la mécanique quantique donné plus haut, nous en déduisons
par exemple une expression pour l’espérance de la variable aléatoire R :
Z
E { R} = r3 sin θ ρ(r sin θ cos ϕ, r sin θ sin ϕ, r cos θ ) dr dθ dϕ .
R3

10.3 Variables aléatoires indépendantes, distribution conditionnelle


Nous avons vu au chapitre précédent que lorsque l’on a à étudier plusieurs variables aléatoires
définies sur un même modèle probabiliste, il ne suffit pas de connaı̂tre leurs distributions indivi-
duelles pour les caractériser. Il faut surtout connaı̂tre leur distribution jointe (qui permet également de
conaı̂tre les distributions individuelles, ou marginales). Cependant, il existe un cas où la connaissance
des distributions marginales est suffisante :. On dit alors que les variables aléatoires sont indépendantes.

10.3.1 Variables aléatoires indépendantes


Nous avons déjà rencontré la notion d’indépendance dans le premier chapitre : deux évènements
A, B ∈ F sont indépendants si P{ A ∩ B} = P{ A}P{ B}, et on donne une définition similaire pour
des familles finies d’évènements indépendants. Nous nous intéressons maintenant à l’utilisation de
cette notion dans le cas de variables aléatoires.

Définitions

Commençons par donner la définition d’une famille de variables aléatoires indépendantes.

D ÉFINITION 10.20 Etant données N variables aléatoires X1 , . . . X N définies sur un même


modèle probabiliste (Ω, F , P), on dit qu’elles sont indépendantes si pour toute famille
(U1 , . . . UN ) de sous-ensembles de R, on a

PX1 ,X2 ,...XN {U1 × U2 × · · · × UN } = PX1 {U1 }PX2 {U2 } . . . PXN {UN } (10.61)

Des variables aléatoires indépendantes possèdent des propriétés simples, que nous décrivons ci-
dessous.

254
10.3 Variables aléatoires indépendantes, distribution conditionnelle

1. Si les variables aléatoires X1 , . . . X N sont des variables aléatoires discrètes, alors leur indépendance
est équivalente à la propriété :
P { X 1 = x 1 , X 2 = x 2 , X N = x N } = P X1 { x 1 } P X2 { x 2 } . . . P X N { x N } (10.62)
pour tous x1 , . . . x N appartenant aux ensembles de valeurs possibles respectifs de X1 , . . . X N .
2. Si les variables aléatoires sont toutes continues, alors l’indépendance se traduit en une propriété
de leurs densités de probabilités : on a alors
ρ X1 ,X2 ,...XN { x1 , x2 , . . . , x N } = ρ X1 { x1 }ρ X2 { x2 } . . . ρ XN { x N } . (10.63)
Ces dernières propriétés sont faciles à démontrer. Prenons l’exemple de deux variables aléatoires
continues X1 , X2 indépendantes. On a alors, pour tous U1 , U2 ⊂ R,
Z
PX1 ,X2 {U1 × U2 } = ρ X1 ,X2 ( x1 , x2 ) dx1 dx2
U1 ×U2
Z Z
= ρ X1 ,X2 ( x1 , x2 ) dx1 dx2
U1 U2
Z Z
= ρ X1 ( x1 )ρ X2 ( x2 ) dx1 dx2 .
U1 U2

Ceci devant être vérifié pour tous U1 , U2 ⊂ R, on en déduit bien la propriété de factorisation ρ X1 ,X2 =
ρ X1 ρ X2 souhaitée. Le cas des variables aléatoires discrètes se traite de façon similaire.
Il est parfois utile d’étendre cette définition au cas d’une famille infinie de variables aléatoires.

D ÉFINITION 10.21 Une famille infinie { Xn , n ∈ Z} de variables aléatoires définies sur un


même modèle probabiliste (Ω, F , P) est une famille indépendante si toute sous-famille finie est
une famille indépendante.

E XEMPLE 10.21 Le nombre de particules N entrant dans un compteur obéit à une loi de Poisson de
paramètre λ donné. Ceci produit une tension aléatoire
V = NU
où U est une tension aléatoire, indépendante du nombre de particules, et de distribution caractérisée
par la densité de probabilités
1
ρU ( u ) = Θ(u) .
(1 + u )2
L’hypothèse d’indépendance nous permet de calculer

P{V < 1} = ∑ P{ N = n, U < 1/n}
n =0

= ∑ P{ N = n}P{U < 1/n}
n =0

λn −λ
Z 1/n
du
= ∑ e (1 + u )2
n=0 n! 0

λn −1 1/n
 
= e−λ ∑
n=0 n! 1 + u 0

λn 1 e − λ ∞ λ n +1
= e−λ ∑ =
λ n∑
n=0 n! n + 1 =0 ( n + 1 ) !
e−λ  λ  1 − e−λ
= e −1 =
λ λ

255
10 Introduction aux Probabilités

Conséquences de l’indépendance

1. L’indépendance est une propriété forte d’une famille de variables aléatoires. Il est possible de
trouver des exemples de triplets de variables aléatoires ( X1 , X2 , X3 ) tels que toutes les sous-
paires ( Xi , X j ) soient des paires de v.a. indépendantes, mais que le triplet ( X1 , X2 , X3 ) soit quant
à lui dépendant.
2. Par contre, étant donnée une famille de v.a. indépendantes, toute sous-famille est également
indépendante. Si nous reprenons l’exemple des triplets de v.a. indépendantes, on voit facilement
que

P{ X1 ∈ U1 , X2 ∈ U2 } = P{ X1 ∈ U1 , X2 ∈ U2 , X3 ∈ R}
= P{ X1 ∈ U1 }P{ X2 ∈ U2 }P{ X3 ∈ R}
= P{ X1 ∈ U1 }P{ X2 ∈ U2 } .

3. Si X1 , . . . X N forment une famille de variables aléatoires indépendantes. Alors étant données


des fonctions f 1 , . . . f N : R → R, les variables aléatoires Y1 = f 1 ( X1 ), . . . YN = f N ( X N ) forment
une famille de variables aléatoires indépendantes. Vérifions le sur l’exemple simple d’une paire
de variables aléatoires. Calculons
n o
P{ f 1 ( X1 ) ∈ U1 , f 2 ( X2 ) ∈ U2 } = P X1 ∈ f 1−1 (U1 ), X2 ∈ f 2−1 (U2 )
n o n o
= P X1 ∈ f 1−1 (U1 ) P X2 ∈ f 2−1 (U2 )
= P{ f 1 ( X1 ) ∈ U1 }P{ f 2 ( X2 ) ∈ U2 } ,

ce qui prouve l’assertion.


4. Plus généralement, si X1 , . . . X N forment une famille de variables aléatoires indépendantes,
alors f ( X1 , X2 ), g( X3 ), h( X5 , X7 ), . . . sont des variables aléatoires indépendantes.

Nous pouvons résumer les résultats obtenus dans cette section dans la proposition importante sui-
vante

P ROPOSITION 10.8 Soit ( X1 , . . . X N ) une famille de variables aléatoires indépendantes. Alors


toutes fonctions de groupes disjoints de ces variables aléatoires forment des familles de variables
aléatoires indépendantes.

Indépendance, variance et espérance

Les espérances de fonctions de variables aléatoires indépendantes offrent des simplifications.

P ROPOSITION 10.9 Soient X et Y deux variables aléatoires indépendantes. Alors, on a

E { XY } = E { X }E {Y } (10.64)
Γ XY = 0 . (10.65)

256
10.3 Variables aléatoires indépendantes, distribution conditionnelle

Preuve : On se limitera aux cas de variables aléatoires discrètes ou continues (le cas mixte se traitre de
façon similaire). Supposons X et Y discrètes. On a alors

E { XY } = ∑ xi y j P

X = xi , Y = y j
xi ,y j

∑ ∑ x i y j P{ X = x i }P

= Y = yj
xi y j

= E { X } E {Y } .

Dans le cas continu, on a


Z
E { XY } = xyρ X,Y ( x, y) dxdy
ZR Z
2

= xyρ X ( x )ρY (y)dxdy


R R
= E { X } E {Y } .

On a immédiatement le corollaire suivant

C OROLLAIRE 10.1 1. Si X et Y sont indépendantes, on a pour toutes fonctions f , g : R →


R
E { f ( X ) g(Y )} = E { f ( X )}E { g(Y )} . (10.66)

2. Si X1 , . . . X N sont indépendantes, alors

E { X1 X2 . . . X N } = E { X1 } E { X2 } . . . E { X N } (10.67)

Preuve : la première assertion est une conséquence directe du fait que X, Y étant indépendantes, f ( X )
et g(Y ) le sont également. La seconde assertion se montre par récurrence : X1 et X2 X3 . . . X N sont
indépendantes, de même que X2 et X3 X4 . . . X N , et ainsi de suite. Donc

E { X1 X2 . . . X N } = E { X1 } E { X2 . . . X N } = E { X1 } E { X2 } . . . E { X N } .

Les moments d’ordre deux des variables aléatoires indépendantes possèdent aussi d’intéressantes
propriétés.

P ROPOSITION 10.10 Si X1 , . . . X N sont indépendantes, alors

Var{ X1 + X2 + · · · + X N } = Var{ X1 } + Var{ X2 } + · · · + Var{ X N } . (10.68)

Preuve : Il suffit de calculer


n o
Var{ X1 + X2 + · · · + X N } = E [( X1 − E { X1 }) + · · · + ( X N − E { X N })]2
= Var{ X1 } + · · · + Var{ X N } + 2 ∑ Γ Xi Xj
i6= j

ce qui termine la preuve, car Γ Xi Xj = 0 pour tous i 6= j.

257
10 Introduction aux Probabilités

10.3.2 Sommes de variables aléatoires indépendantes


Généralités

Considérons tout d’abord une paire de variables indépendantes discrètes X et Y, prenant des valeurs
entières, et soit Z = X + Y. On a alors de façon évidente
P{ Z = n } = ∑ P{X = k, Y = n − k} = ∑ PX {k}PY {n − k} .
k k

On aboutit donc à un produit de convolution discret. On a aussi, en utilisant les fonctions caractéristiques
de X, Y, Z : n o
GZ (u) = E e−iuZ = ∑ e−iun ∑ PX {k }PY {n − k } = GX (u) GY (u) .
n k
De même, si nous considérons deux variables aléatoires continues X, Y, indépendantes, de densités
ρ X et ρY on a en posant de nouveau Z = X + Y
Z
FZ (z) = P{ Z < z} = ρ X ( x )ρY (y) dxdy
x +y<z
Z z Z
= ρ X ( x )ρY (u − x ) dxdu ,
−∞
de sorte que la densité ρ Z de Z peut s’écrire sous la forme d’un produit de convolution
Z
ρ Z (z) = ρ X ( x )ρY (z − x ) dx .

Au niveau des fonctions caractéristiques, on a aussi


n o Z
GZ (u) = E e−iuZ = e−iuz ρ Z (z) dz = GX (u) GY (u) .

On peut montrer une propriété similaire dans le cas de variables aléatoires mixtes. En fait, on a dans
le cas général n o n o n o
GZ (u) = E e−iu(X +Y ) = E e−iuX E e−iuY = GX (u) GY (u) .
En étendant ce résultat à plusieurs variables aléatoires (ce qui se fait par récurrence), on peut donc
montrer :

P ROPOSITION 10.11 Si X1 , . . . X N sont indépendantes, et si on pose

Z = X1 + X2 + · · · + X N

alors on a
G Z ( u ) = G X1 ( u ) G X2 ( u ) . . . G X N ( u ) . (10.69)

Cette propriété nous sera utile par la suite.

La loi des grands nombres

C’est un résultat d’une grande importance historique et pratique. C’est le plus simple des théorèmes
limites, et il est à la base de la théorie des statistiques. Il montre essentiellement qu’une moyenne de
variables aléatoires indépendantes, identiques, tend vers leur espérance commune quand le nombre
de variables aléatoires tend vers l’infini. Ce résultat est assez intuitif, et la difficulté essentielle réside
dans le sens précis qu’on lui donne. En effet, la moyenne des variables aléatoires est toujours aléatoire,
alors que l’espérance est quant à elle un nombre déterministe. Ecrire une égalité entre ces deux quan-
tités demande donc un minimum de précautions.

258
10.3 Variables aléatoires indépendantes, distribution conditionnelle

E XEMPLE 10.22 Considérons une expérience de pile ou face, avec une pièce non pipée, effectuée un
grand nombre N de fois. On note S N le nombre de fois où la pièce retombe sur “pile”. On s’attend
intuitivement à ce que lorsque N tend vers l’infini, S N /N soit de plus en plus proche de 1/2, qui est
la probabilité de “pile”. La loi des grands nombres précise cette intuition, en montrant que pour tout
nombre δ > 0,
P{[S N /N − 1/2] < δ} → 1 quand N → ∞ .
Pour donner un énoncé dans le cas général, on a besoin de la définition suivante :

D ÉFINITION 10.22 1. Les variables aléatoires X1 , . . . X N sur un même modèle probabiliste


(Ω, F , P) sont dites identiquement distribuées si pour tout U ⊂ R on a

P X1 { U } = P X2 { U } = · · · = P X N { U } (10.70)

2. Si elles sont de plus indépendantes, on dit qu’elles sont i.i.d.

T H ÉOR ÈME 10.3 Soient X1 , . . . X N des variables aléatoires i.i.d. ; soit δ > 0. Alors, en posant
N
SN = ∑ Xn (10.71)
n =1

on a   
SN
P − E { X1 } <δ → 1 quand N→∞. (10.72)
N

Preuve : La preuve est relativement simple : posons


SN
Z= − E { X1 } ,
N
et soit
A = {ω ∈ Ω, Z (ω ) ≥ δ} .
On a alors E Z2 δ2 P

≥ { A}, de sorte que
P{| Z | ≥ δ} ≤ δ−2 E Z2 .


Mais on a aussi, comme E {S N } = NE { X1 },


 
SN 1
E Z 2

= Var{ Z } = Var = Var{ X1 } .
N N
Comme cette dernière quantité tend vers 0 quand N → ∞, le théorème est donc démontré.

Le théorème “Central Limit”

La loi des grands nombres montre que la moyenne d’une famille de variables aléatoires i.i.d. tend vers
leur espérance commune quand la taille de la famille tend vers l’infini. Cependant, cette moyenne
possède quand même un caractère aléatoire, et il est donc utile de s’intéresser au comportement
asymptotique de sa distribution. Le théorème “Central Limit” montre que celui-ci obéit (gńéralement)
à une “loi générique”.
On ne donnera pas ici de preuve du théorème “Central Limit” en toute généralité. On s’appuiera
plutôt sur l’exemple suivant.

259
10 Introduction aux Probabilités

E XEMPLE 10.23 Considérons N variables aléatoires i.i.d., uniformes sur l’intervalle [−1, 1], et soit

1
Z = √ ( X1 + X2 + · · · + X N ) .
N

Intéressons nous tout d’abord à la distribution de X/ N, où X est une v.a. continue donnée. On voit
facilement que

n√ o Z x N √ Z x √
FX/ N ( x ) = P X < x N =
√ ρ X (y)dy = N ρ X (u N ) du ,
−∞ −∞

de sorte que
√ √
ρ X/√ N ( x ) = Nρ X ( x N ) ,

et, au niveau de la fonction caractéristique

√ Z √ 
λ

GX/√ N (λ) = N ρ X ( x N )e−iλx dx = GX √ .
N

Revenant à notre famille X1 , . . . X N :


Z 1
1 sin λ
G X1 ( λ ) = G X2 ( λ ) = · · · = G X N ( λ ) = e−iλx dx = .
2 −1 λ

On a donc
      √ !N
λ λ λ sin λ/ N
G Z ( λ ) = G X1 √ G X2 √ . . . GX N √ = √ .
N N N λ/ N

Calculons maintenant, dans la limite des grandes valeurs de N,

√ !
sin λ/ N
log( GZ (λ)) = N log √
λ/ N
λ2
  4 
λ
≈ N log 1 − +O
6N N2
λ2 λ4
 
≈ − +O
6 N

On a donc
2 /6
lim GZ (λ) = e−λ ,
N →∞

et donc, par transformation de Fourier inverse


r
3 −3x2 /2
lim ρ Z ( x ) = e .
N →∞ 2π

On a donc montré qu’à la limite N → ∞, la variable aléatoire Z a un comportement Gaussien.

Le théorème, dans sa version plus générale, est le suivant :

260
10.3 Variables aléatoires indépendantes, distribution conditionnelle

T H ÉOR ÈME 10.4 Soit ( X1 , X2 , . . . X N ) une famille de variables aléatoires i.i.d. sur un même
modèle probabiliste (Ω, F , P), de moyenne µ et d’écart type σ. Soit

1
ZN = √ ( X1 + X2 + · · · + X N − Nµ) . (10.73)
σ N
Alors, on a Z z
1 2 /2
lim P{ ZN < z} = e− x dx . (10.74)
N →∞ 2π −∞

En plus du comportement Gaussien de ZN , ce théorème permet de préciser le comportement de


l’écart type de la variable aléatoire

S N = X1 + X2 + · · · + X N .

On a √
σSN = σ N
(on savait déjà d’après la loi des grands nombres que µSN = Nµ).

10.3.3 Variables aléatoires et probabilités conditionnelles


Nous avons déjà rencontré au chapitre 1 la notion de probabilité conditionnelle : soit (Ω, F , P) un
modèle probabiliste ; si A et B sont deux évènements quelconques, la probabilité de A sachant B (ou
conditionnée par B) est le nombre
P{ A ∩ B }
P{ A | B } = (10.75)
P{ B }
La notion de probabilité conditionnelle (et de distribution conditionnelle) s’étend aux variables aléatoires.

Distribution conditionnelle d’une variable aléatoire

De là, on déduit les probabilités conditionnelles des variables aléatoires. Par exemple, si X et Y sont
des variables aléatoires discrètes :

P X = x i |Y = y j = P ω ∈ Ω, X (ω ) = xi et Y (ω ) = y j |{ω 0 ∈ Ω, Y (ω 0 ) = y j }
 

P X = xi , Y = y j

=
P Y = yj


Rappelons que dans ce cas,


P Y = yj = ∑P
 
X = xi , Y = y j .
i
Dans le cas général, on a

D ÉFINITION 10.23 Etant données deux variables aléatoires X et Y définies sur le même modèle
probabiliste, la distribution conditionnelle de X sachant que Y ∈ V est la collection de nombres

P{ X ∈ U, Y ∈ V }
P { X ∈ U |Y ∈ V } = (10.76)
P {Y ∈ V }

pour tout ensemble mesurable U ⊂ R.

261
10 Introduction aux Probabilités

On a donc, de façon évidente

P ROPOSITION 10.12 Deux variables aléatoires X et Y sont indépendantes si et seulement si


pour tous U, V ⊂ R, mesurables

P { X ∈ U |Y ∈ V } = P { X ∈ U } .

Exemple : On tire à pile ou face avec une pièce tordue, telle que la probabilité d’obtenir “pile” à un
tirage vaut p. Soit T le nombre d’essais nécessaires pour obtenir “pile”, et soit S le nombre de “pile”
en n tirages. Calculons P{ T = k |S = 1} : pour cela, il suffit de ne considérer que les k premiers tirages,
et on calcule
P{ T = k, S = 1} = p(1 − p)k−1 ,

et
k!
P{ S = 1} = p (1 − p ) k −1
1! (k − 1)!

d’où on déduit
1
P{ T = k | S = 1} =
k

La distribution de X sachant Y = y

On considère maintenant le cas particulier important où une variable aléatoire X est conditionnée par
une valeur particulière y de la variable aléatoire Y. On s’intéresse donc aux nombres

P{ X ∈ A, Y = y}
P { X ∈ A |Y = y } = .
P {Y = y }

La première question qui se pose est celle du sens que l’on donne à ces nombres. Si Y est une variable
aléatoire discrète ou mixte, et si P{Y = y} 6= 0, il n’y a pas de problème. Par contre, si P{Y = y} = 0,
il faut avoir recours à des arguments limite. On procède comme suit. Soit ∆y = [y − δy, y + δy[ un
intervalle de largeur δy centré sur y.
– Si P{Y ∈ ∆y} = 0, on pose P{ X ∈ A|Y = y} = 0.
– sinon, on pose P{ X ∈ A|Y = y} = limδy→0 P{ X ∈ A|Y ∈ ∆y}.
Si X et Y possèdent une densité de probabilités jointe ρ X,Y ( x, y), on sait alors que
Z
ρY ( y ) = ρ X,Y ( x, y)dx ,

et on a alors
R
A×∆y
ρ X,Y ( x, y)dxdy
P{ X ∈ A|Y ∈ ∆y} = R
∆y
ρY (y)dy
ρ X,Y ( x, y)dx ∆y
R
A
→ .
ρY (y) ∆y

On obtient ainsi

262
10.3 Variables aléatoires indépendantes, distribution conditionnelle

P ROPOSITION 10.13 Si les variables aléatoires X et Y possèdent une densité de probabilités


jointe ρ X,Y ( x, y), alors P{ X ∈ A|Y = y} est aussi définie par une densité de probabilités
Z
P { X ∈ A |Y = y } = ρ( x |y)dx , (10.77)
A

où
ρ X,Y ( x, y)
ρ( x |y) = . (10.78)
ρY ( y )

D ÉFINITION 10.24 La fonction ρ( x |y) est la densité conditionnelle de X sachant Y.

Exemple : On tire au hasard un point sur un disque de rayon 1, avec une densité de probabilités
proportionnelle à la distance au centre du disque. Calculer la probabilité pour que la coordonnée x
soit supérieure à un x0 donné sachant que la coordonnée y vaut 0.
On note X, Y les variables aléatoires décrivant les coordonnées x et y du point tiré au hasard. Il faut
tout d’abord expliciter
R la distribution jointe de X et Y : ρ X,Y ( x, y) = K ( x2 + y2 ). La condition de
normalisation ρ X,Y ( x, y)dxdy = 1 donne K = π/2. La distribution de Y est de la forme

2 1
Z q q
ρY ( y ) = √ 1 − y2 ( x2 + y2 )dx = 1 − y2 (1 + 2y2 ) ,
π − 1− y2 3π

d’où on déduit
3( x 2 + y2 )
ρ( x |y) = p .
2(1 + 2y2 ) 1 − y2
Finalement, Z 1
3 1
P { X ≥ x 0 |Y = 0 } = x2 dx = (1 − x02 ) .
2 x0 2

Notation : Pour unifier les notations entre les cas discret, continu et mixte, on notera
Z
P { X ∈ A |Y = y } = P{dx |Y = y} .
A

Probabilités conditionnelles d’une fonction de variables alátoires

Etant donnée deux variables aléatoires X, Y, on se donne une nouvelle variable aléatoire Z, fonction
de X, Y : Z = ϕ( X, Y ). On s’intéresse à la distribution de Z sachant que Y = y. On a alors le résultat
suivant :

P ROPOSITION 10.14 La distribution conditionnelle de ϕ( X, Y ) sachant que Y = y est égale à


la distribution conditionnelle de ϕ( X, y) sachant que Y = y.

Preuve : si A ∈ S , on considère

P{ ϕ( X, Y ) ∈ A|Y = y}
P{ ϕ( X, Y ) ∈ A|Y = y} = .
P {Y = y }

263
10 Introduction aux Probabilités

Les ensembles
{ω : ϕ( X (ω ), Y (ω )) ∈ A, Y (ω ) = y}
et
{ω : ϕ( X (ω ), y) ∈ A, Y (ω ) = y}
étant identiques, ceci prouve la proposition.

La règle d’addition des probabilités conditionnelles

Exemple : Une urne contient 7 boules noires et 3 boules blanches. Quelle est la probabilité pour que
la seconde boule tirée soit blanche ? Le raisonnement le plus simple distingue 2 cas : soit la première
boule tirée est blanche (probabilité 3/10) et la seconde est blanche (probabilité 2/9) ; soit la première
est noire (probabilité 7/10) et la seconde est blanche (probabilité 3/9). Donc, la probabilité vaut
3 2 7 3 3
+ = .
10 9 10 9 10

Plus généralement, étant données deux variables aléatoires discrètes X et Y, on a


P { X = x i } = ∑ P X = x i , Y = y j = ∑ P X = x i |Y = y j ∑ P Y = y j ,
  
j j j

et dans le cas de variables aléatoires continues


Z Z ∞ Z Z ∞
P{ X ∈ A } = ρ X,Y ( x, y)dxdy = ρ( x |y)ρY (y)dxdy ,
A −∞ A −∞
de sorte que Z
ρX (x) = ρ( x |y)ρY (y)dy .
On a donc montré

P ROPOSITION 10.15 Etant données deux variables aléatoires X et Y définies sur le même modèle
probabiliste, Z
PX { A} = P{ X ∈ A|Y = y}dPY {y} . (10.79)

10.3.4 Espérance conditionnelle et prédiction


Définition et propriétés

La notion d’espérance conditionnelle est celle qui permet de donner un sens à celle de “résultat at-
tendu pour la variable aléatoire X connaissant Y”.

D ÉFINITION 10.25 Etant données deux variables aléatoires X et Y définies sur le même modèle
probabiliste, on définit l’espérance de X sachant que Y = y par
Z
E { X |Y = y } = xP{dx |Y = y} . (10.80)

De même, étant donnée une fonction ϕ( X ) de la variable aléatoire X, l’espérance conditionnelle


de ϕ( X ) sachant Y est définie par
Z
E { ϕ( X )|Y = y} = ϕ( x )P{dx |Y = y} . (10.81)

264
10.3 Variables aléatoires indépendantes, distribution conditionnelle

L’espérance conditionnelle possède un certain nombre de propriétés simples, et faciles à démontrer.


1. Si X et Y sont deux variables aléatoires indépendantes, et si ϕ est une fonction quelconque,

E { ϕ( X )|Y = y} = E { ϕ( X )} .

En effet, E { ϕ( X )|Y = y} = ϕ( x )P{dx |Y = y} = ϕ( x )P{dx } = E { ϕ( X )}.


R R

2. Etant données deux variables aléatoires X et Y,


Z
E {X} = E { X |Y = y}dPY {y} .

R exemple, dans le cas de variables aléatoires à densité, on a E { X } =


R R
Par xρ X ( x )dx = xρ( x |y)ρY (y)dxdy =
E { X |Y = y}ρY (y)dxdy.
3. Si X, Y, Z sont des variables aléatoires dépendantes :

E { X + Y | Z = z } = E { X | Z = z } + E {Y | Z = z } .

4. Pour toute fonction ϕ( X, Y ),

E { ϕX, Y |Y = y} = E { ϕX, y|Y = y} .

Prédiction

La prédiction est devenue une thématique scientifique d’une importance considérable dans de mul-
tiples domaines (et pas seulement en météorologie, à la bourse ou chez Mme soleil...). On peut en
particulier citer le problème du contrôle de la trajectoire des fusées (connaissant leur position et leur
vitesse jusqu’à l’instant t, prédire la trajectoire à venir afin de pouvoir éventuellement apporter des
corrections).
La formulation probabiliste du problème de prédiction est la suivante :
Etant données deux variables aléatoires X et Y (ou N + 1 variables aléatoires X et Y1 , , . . . YN ), comment
construire une fonction de Y (ou Y1 , , . . . YN ) permettant de prédire au mieux la valeur prise par X, si l’on
connaı̂t la valeur prise par Y (ou les valeurs prises par les Y1 , , . . . YN ).
Pour estimer la qualité de la prédiction, il faut tout d’abord réaliser que tout prédicteur φ(Y ) est lui
aussi une variable aléatoire. Le critère le plus simple consiste à trouver la fonction ϕ qui minimise
l’erreur en moyenne quadratique :
min E [ X − ϕ(Y )]2 .

(10.82)
ϕ

On montre alors le résultat suivant

P ROPOSITION 10.16 La fonction ϕ∗ qui minimise l’erreur de prédiction en moyenne quadra-


tique est donnée par
ϕ ∗ ( y ) = E { X |Y = y } . (10.83)

En pratique, cette solution n’est pas toujours facile à expliciter, et il faut se contenter d’approxima-
tions.

265
10 Introduction aux Probabilités

266
Septième partie

Annexes

267
A NNEXE

A
Mesure et convergence

A.1 Notion de mesure


La notion de mesure, essentielle en physique, a également pris un sens précis en mathématiques. On
en donne ici très brièvement les éléments essentiels.

D ÉFINITION A.1 Soit un ensemble E , et soit A une famille de sous-ensembles de E. On dit que
A est une algèbre si
1. A est non vide.
2. Pour tout E ∈ A, le complémentaire E de E appartient aussi à A.
3. Pour tous E1 , E2 ∈ A, leur réunion E1 ∪ E2 appartient aussi à A
On dit que A est une sigma-algèbre si de plus
4 Pour toute famille dénombrable { E1 , E2 , . . .} d’élements de A, leur réunion
S
Ei appartient
aussi à A.

L’exemple le plus classique est l’exemple des nombres réels : E = R. On considère la famille des sous
ensembles de la forme ] − ∞, x ], où x ∈ R. Il est possible de montrer que cette famille est en fait une
sigma-algèbre, que l’on appelle sigma-algèbre de Borel.

D ÉFINITION A.2 Soit E un ensemble, et soit A une sigma algèbre sur E . On appelle mesure
sur A une application
µ : A → C (ou R)
telle que
1. La mesure de l’ensemble vide est nulle.
2. Pour toute famille dénombrable { E1 , E2 , . . .} d’élements de A, disjoints deux à deux (c’est
à dire tels que pour tous i, j, Ei ∩ Ej soit vide),

∑ µ( Ej ) .
[
µ( Ej ) = (A.1)
j

De nouveau, l’exemple le plus usuel est l’exemple de la mesure de Lebesgue sur R. Cette mesure
est définie de la façon suivante : à tout intervalle ] a, b], on associe sa mesure qui n’est autre que sa
longueur :
µ(] a, b]) = b − a . (A.2)

A.1
A Mesure et convergence

Un élément simple t0 , ou une union dénombrable d’élements de R sont alors des ensembles de me-
sure nulle : pour tous t0 , t1 , · · · ∈ R,

µ(t0 ) = µ({t0 , t1 , . . .}) = 0 .

La notion d’ensemble de mesure nulle joue un rôle très important.

A.2 Convergence
La notion de convergence d’une suite de nombres est une notion classique. Par contre, dès lors que
l’on s’intéresse à des suites de fonctions, il est possible de donner à la notion de convergence de suites
des sens différents, qui traduisent des notions plus ou moins précises (ou fines) de convergence.
On résume ici rapidement les notions de convergence les plus usuelles, dans le cas de fonctions d’une
variable réelle. Le cas des fonctions de plusieurs variables s’en déduit sans difficulté.

A.2.1 Convergence simple


On dit que la suite de fonctions { f n , n = 0, 1, . . .} définies sur un domaine A (soit donc f n : A →
C) converge simplement vers la fonction f si pour tout t, la suite des nombres { f (t), n = 0, 1, . . .}
converge vers le nombre f (t). On traduit cela par :

f n → f si ∀e > 0, ∀t ∈ A, ∃ N (t, e) tel que n ≥ N (t, e) =⇒ | f n (t) − f (t)| ≤ e . (A.3)

Cette notion de convergence n’est pas la notion la plus fine, dans la mesure où le nombre N (t, e)
peut ici dépendre du point t considéré. Lorsque cet aspect n’est pas souhaitable, on préfère utiliser la
notion de convergence uniforme.

A.2.2 Convergence uniforme


La contrainte de convergence uniforme est donc plus exigeante, et suppose que l’on puisse contrôler
l’erreur commise en approximant f par f n de façon indépendante du point étudié.

f n → f si ∀e > 0, ∃ N (e) tel que ∀t ∈ A , n ≥ N (e) =⇒ | f n (t) − f (t)| ≤ e . (A.4)

Bien évidemment, la convergence uniforme entraı̂ne la convergence simple.

A.2.3 Convergence en moyenne


Les deux notions de convergence ci-dessus sont basées sur les valeurs ponctuelles des fonctions
étudiées. Or, il est souvent utile de s’abstraire de l’utilisation des valeurs ponctuelles, et de définir
des notions de convergence en moyenne.
Soit p un nombre réel positif. On dit que la suite de fonctions { f n , n = 0, 1, . . .} définies
R sur un
domaine A (soit donc f n : A → C) converge vers f en moyenne d’ordre p si la suite A | f (t) −
f n (t)| p dt tend vers zéro lorsque n tend vers l’infini :
Z
f n → f si ∀e > 0, ∃ N (e) tel que n ≥ N (e) =⇒ | f n − f | p dt ≤ e . (A.5)
A

Pour que ces notions aient un sens, il faut bien entendu que les intégrales A | f (t) − f n (t)| p dt existent
R
pour tout n. Ceci est assuré dès que l’on se place dans le cadre des espaces de Lebesgue appropriés,
c’est à dire si l’on suppose que f , f n ∈ L p ( A). Les espaces L p sont définis dans l’Annexe B.
La convergence en moyenne d’ordre p n’implique nullement la convergence uniforme ni la conver-
gence simple. On en verra des contre exemples dans l’étude des séries de Fourier. Par contre, la
convergence en moyenne d’ordre p entraı̂ne la convergence simple presque partout.

A.2
A.2 Convergence

A.2.4 Convergence simple presque partout


On dit que la suite de fonctions { f n , n = 0, 1, . . .} définies sur un domaine A (soit donc f n : A → C)
converge presque partout vers f si pour tout t ∈ A, f n (t) → f (t), à l’exception éventuellement d’un
ensemble de mesure nulle.

A.3
A Mesure et convergence

A.4
A NNEXE

B
Espaces fonctionnels

La thérie des fonctions (aussi appelée analyse fonctionnelle) repose sur la notion d’espace fonctionnel,
ou espace de fonctions. Il s’agit généralement de construire des ensembles de fonctions possédant cer-
taines propriétés génériques (intégrabilité, dérivabilité,...) permettant d’effectuer certaines opérations
données. Ces ensembles possèdent une structure d’espace vectoriel (c’est à dire qu’ils sont stables
par addition et multiplication scalaire), et sont munis d’une norme, qui leur confère une structure
d’espace de Banach. Dans certains cas, ils sont également munis d’un produit Hermitien, qui les
munit d’une structure d’espace de Hilbert.
On donne ici une description succinte de certains des espaces fonctionnels les plus utiles, ainsi que
de leurs propriétés essentielles. Entrer dans plus de détails dépasserait le cadre de ce cours.

B.1 Espaces caractérisant la régularité


Très grossièrement, la notion de régularité décrit la vitesse à laquelle varie une fonction. Plus elle
varie lentement, plus elle est régulière. Par exemple, une fonction continue est plus régulière qu’une
fonction discontinue, qui varie brusquement à chaque point de discontinuité.
Il existe de multiples façons de décrire (et en fait de définir) la régularité. La plus simple fait appel au
degré de diffèrentiabilité.
Dans ce qui suit, r est un nombre entier positif ou nul, appelé degré de régularité, ou régularité tout
simplement. On note aussi, pour tout entier k et toute fonction f pour laquelle cette expression a un
sens
dk f
f (k) ( t ) = k ( t )
dt
La première famille d’espaces fonctionnels intéressants est la famille d’espaces de fonctions continûment
différentiables : n o
Cr (R) = f : R → C, f (k) est continue ∀k ≤ r (B.1)

On vérifie aisément que Cr (R) est un espace vectoriel. On a, de façon évidente

C r +1 (R ) ⊂ C r (R ) . (B.2)

De même, si I ⊂ R est un intervalle borné, on définit


n o
Cr ( I ) = f : I → C, f (k) est continue ∀k ≤ r (B.3)

Cr ( I ) est un espace vectoriel, et on a encore

C r +1 ( I ) ⊂ C r ( I ) . (B.4)

Etant donnée une fonction f , on définit son support supp( f ) par

supp( f ) = {t ∈ R, f (t) 6= 0} (B.5)

B.1
B Espaces fonctionnels

Ceci nous permet d’introduire l’espace des fonctions continûment différentiables à support borné (ou
compact) n o
C0r (R) = f : R → C, f (k) est continue ∀k ≤ r et supp( f ) est borné (B.6)
Il s’agit de nouveau d’un espace vectoriel, et on a les inclusions
C0r (R) ⊂ Cr (R) ; C0r+1 (R) ⊂ C0r (R) . (B.7)

B.2 Les espaces C ∞ (R), D(R) et S(R)


Les cas limites suivants sont eux aussi très utiles. L’espace des fonctions dont toutes les dérivées sont
continues n o
C ∞ (R) = f : R → C, f (k) est continue ∀k ∈ Z+ , (B.8)
et l’espace des fonctions C ∞ à support borné
D(R) = { f ∈ C ∞ (R), supp( f ) est borné } , (B.9)
Il est maintenant utile d’introduire la notion de fonction à décroissance rapide.

D ÉFINITION B.1 (F ONCTION À D ÉCROISSANCE RAPIDE ) Soit f une fonction continue. On


dit que f est à décroissance rapide si pour tout entier positif k, il existe une constante Ck telle que
l’on ait
C
| f (t)| ≤ kk (B.10)
|t|

Il s’agit donc de fonctions qui décroissent à l’infini plus vite que toutes les puissances. Ceci nous
permet d’introduire l’espace de Schwartz S(R) (parfois appelé aussi classe de Schwartz) :
n o
S(R) = f ∈ C ∞ (R), f (k) est à décroissance rapide ∀k ∈ Z+ . (B.11)

De nouveau, on a des relations d’inclusion simples


D(R) ⊂ S(R) ⊂ C ∞ (R) (B.12)

B.3 Eléments de théorie de l’intégration


Nous avons jusqu’à présent traité l’intégration en évitant d’entrer dans les détails. Cependant, pour
pouvoir aborder certains aspects plus fins, il est maintenant nécessaire de préciser quelque peu
les choses, sans toutefois entrer dans les détails. On donne ici une description “superficielle” de la
différence entre l’intégration “à la Riemann” et l’intégration “à la Lebesgue”. Plus de détails peuvent
être trouvés dans les références indiquées à la fin de ce chapitre.
La théorie de l’intégration qui nous est familière est la théorie de l’intégration de Riemann. Cette
intégrale est construite de la façon suivante. Supposons que nous voulions calculer
Z b
ϕ(t)dt ,
a

où a < b sont deux nombres finis. On commence par “découper” l’intervalle [ a, b] en n sous-intervalles
[ a j , a j+1 [ de taille a j+1 − a j inférieure à un certain δn , avec a0 = a et an+1 = b. Puis on forme la quantité
n
∑ ϕ(ti )(a j+1 − a j ) .
j =1

B.2
B.3 Eléments de théorie de l’intégration

L’intégrale est alors égale à la limite de cette dernière quantité lorsque n → ∞, quand cette limite
existe. C’est en particulier le cas lorsque ϕ est une fonction continue, mais aussi une fonction bornée
admettant une infinité de discontnuités. On montre également que cette intégrale existe pour une
certaine classe de fonctions non bornées. Par exemple, si ϕ est divergente en t = c ∈ [ a, b], on convient
Rb R c−γ Rb
de définir a ϕ(t)dt la limite quand γ, γ0 → 0 de la somme a ϕ(t)dt + c+γ0 ϕ(t)dt, quand cette
limite existe.
Cependant, cette théorie n’est pas encore assez générale pour permettre d’intégrer certaines fonctions
simples. Par exemple, la fonction de Dirichlet t → f (t), définie par

1 si t est rationnel
f (t) =
0 sinon.
Cette fonction n’est pas intégrable au sens de Riemann. Mais la notion d’intégrale introduite par
H. Lebesgue en 1900 permet de donner une définition à l’intégrale de cette fonction, et de montrer
qu’elle est en fait nulle. Très grossièrement, la construction de Lebesgue revient à découper l’axe des
ordonnées plutôt que l’axe des abscisses. Plus précisément, étant donnée une fonction ϕ, on com-
mence par partager le domaine [ A, B] dans lequel ϕ prend ses valeurs en sous-intervalles [α j , α j+1 [.
Etant donné un intervalle [α j , α j+1 [, on note Ej l’ensemble des t tels que ϕ(t) ∈ [α j , α j+1 [, et on attri-
bue à l’ensemble Ej sa mesure de Lebesgue µi ; par exemple, si Ej est un intervalle, sa mesure est la
longueur de l’intervalle. Ou si Ej est une réunion d’intervalles disjoints, sa mesure µ j est la somme
des longueurs des intervalles. Autre exemple, si Ej est réduit à un point ou un ensemble fini ou
dénombrable de points, sa mesure est nulle. On considère alors les sommes partielles

∑ µ j φj ,
j
Rb
où φj ∈ [α j , α j+1 [, et a ϕ(t)dt est alors défini comme la limite de ces expressions quand l’on fait tendre
tous les α j+1 − α j vers 0, quand cette limite existe.
Très grossièrement, la différence entre l’intégration à la Riemann” et l’intégration “à la Lebesgue”
peut être schématisée comme en F IG . B.1. On y voit en particulier que le découpage effectué dans
le cadre de l’intégration “à la Lebesgue” est bien plus précis dans les régions où la fonction intégrée
varie rapidement.

F IG . B.1: L’intégration “à la Riemann” (à gauche) et l’intégration “à la Lebesgue” (à droite)

E XEMPLE B.1 Revenons à la fonction de Dirichlet. Elle ne peut prendre que deux valeurs différentes,
0 et 1. En notant E1 le domaine des valeurs de t pour lesquelles ϕ(t) = 1, on voit que E1 n’est autre
que l’ensemble des nombres rationnels, qui est un ensemble infini dénombrable. Donc sa mesure est
égale à 0, et par conséquent, l’intégrale de la fonction de Dirichlet est nulle.

R EMARQUE B.1 Nous avons vu intervenir la notion de mesure d’un ensemble. Il découle de la construc-
tion même de l’intégrale de Lebesgue que si deux fonctions diffèrent sur un ensemble de mesure nulle
(on dit alors qu’elles sont égales presque partout), leurs intégrales seront égales.

B.3
B Espaces fonctionnels

On montre que les résultats classiques de la théorie de l’intégration (intégration par parties, lemme de
Fubini,...) restent valides dans le cadre de la théorie de Lebesgue. De plus, le résultat suivant, appelé
théorème de convergence dominée de Lebesgue est très important, car il donne d’une part un moyen de
vérifier l’intégrabilité d’une fonction, mais aussi de calculer l’intégrale.

T H ÉOR ÈME B.1 (C ONVERGENCE DOMIN ÉE ) Soit { f k , k = 0, 1, . . .} une suite de fonctions,
telle que pour presque tout t, f (t) = limk→∞ f k (t) existe. Supposons de plus qu’il existe une
fonction intégrable positive g telle que pour tout k, | f k (t)| ≤ g(t). Alors, f est intégrable, et
Z ∞ Z ∞
f (t)dt = lim f k (t)dt . (B.13)
−∞ k→∞ −∞

B.4 Les espaces de Lebesgue


Ces considérations nous permettent maintenant de nous pencher sur des espaces caractérisant les
propriétés d’intégrabilité des fonctions, aprés avoir examiné des espaces caractérisant leurs propriétés
de régularité.
A partir de maintenant, p désigne un nombre réel supérieur à 1 : 1 ≤ p < ∞. A toute fonction f , on
associe le nombre  Z ∞  1/p
|| f || p = | f (t)| p dt . (B.14)
−∞

Ceci permet d’introduire les espaces de Lebesgue

L p (R) = f : R → C, || f || p < ∞

(B.15)

Il est important de remarquer que l’intégrale utilisée ici étant l’intégrale de Lebesgue, les fonctions de
L p (R) doivent être vues plutôt comme des classes d’équivalence de fonctions (deux fonctions étant
équivalentes si elles diffèrent sur un ensemble de mesure nulle) que comme des fonctions définies en
chaque point. Ceci étant entendu, l’application f ∈ L p (R) → || f || p définit une norme sur L p (R) :
1. Inégalité triangulaire : si f , g ∈ L p (R), || f + g|| p ≤ || f || p + || g|| p .
2. si f ∈ L p (R) et λ ∈ C, ||λ f || p = |λ| || f || p .
3. || f || p = 0 implique f = 0.

R EMARQUE B.2 Il n’est pas tout à fait exact de dire que l’application f ∈ L p (R) → || f || p définit une
norme sur les espaces L p ainsi définis. En effet, si f = 0 presque partout, alors || f || p = 0, sans que f
soit nécessairement uniformément nulle. Pour s’abstraire de ce problème, on convient d’identifier les
fonctions qui ne diffèrent que sur un ensemble de mesure nulle. Dans ce cas, la propriété 3 ci dessus
est bien vérifiée.

R EMARQUE B.3 Les normes introduites plus haut permettent de proposer de nouveaux critères de
convergence pour les suites de fonction. On dira par exemple que la suite { f n , n = 0, 1, . . .} de fonc-
tions de L p (R) converge vers une fonction f ∈ L p (R) en moyenne d’ordre p si limk→∞ || f − f k || p = 0.
La vérification de la convergence en moyenne d’ordre p utilise souvent le théorème de convergence
dominée que nous avons vu plus haut.

Parmi les espaces L p (R), l’espace L2 (R) possède un statut particulier : il possède un produit scalaire :
si f , g ∈ L2 (R), on définit Z ∞
h f , gi = f (t) g(t)dt (B.16)
−∞

B.4
B.5 Relations entre S(R), D(R) et L2 (R)

Ce produit scalaire est associé à la norme || f ||2 = || f ||, par


q
|| f || = h f , f i . (B.17)

On montre que ce produit est sesquilinéaire, c’est à dire qu’il vérifie les conditions suivantes :
1. Hermiticité : si f , g ∈ L2 (R), on a h f , gi = h g, f i.
2. Linéarité à droite : pour tous f , g1 , g2 ∈ L2 (R), α1 , α2 ∈ C, h f , α1 g1 + α2 g2 i = α1 h f , g1 i +
α 2 h f , g2 i .
3. Positivité : soit f ∈ L2 (R). Si pour toute g ∈ L2 (R), on a h f , gi = 0, alors f = 0.
En conséquence des propriétés précédentes, nous avons donc antilinéarité à gauche : pour tous
f 1 , f 2 , g ∈ L2 (R), α1 , α2 ∈ C, hα1 f 1 + α2 f 2 , gi = α1 h f 1 , gi + α2 h f 2 , gi.
Les espaces de Lebesgue possèdent des propriétés intéressantes et utiles, appelées inégalités de Hölder
et inégalités d’Young, qui sont des généralisations de l’inégalité de Cauchy-Schwarz. Nous les donnons
sans démonstration ci-dessous.

P ROPOSITION B.1 (I N ÉGALIT ÉS DE H ÖLDER ET Y OUNG ) 1. Soient f ∈ L p (R) et g ∈


Lq (R). Soit r défini par
1 1 1
= + . (B.18)
r p q
Alors, f g : t → f (t) g(t) appartient à Lr (R), et on a (inégalité de Hölder) :

k f g kr ≤ k f k p k g k q . (B.19)

2. Soient f ∈ L p (R) et g ∈ Lq (R). Soit r 0 défini par

1 1 1
1+ 0
= + . (B.20)
r p q
0
Alors, f ? g ∈ Lr (R), et on a (inégalité d’Young) :

k f ? g kr 0 ≤ k f k p k g k q . (B.21)

De plus, si p = q = 2, (donc r 0 = ∞) f ? g est continue.

R EMARQUE B.4 On vérifie bien que dans le cas p = q = 2, on a r = 1, et donc l’inégalité de Hölder
correspondante se ramène bien à l’inégalité de Cauchy-Schwarz.

B.5 Relations entre S(R), D(R) et L2 (R)


Deux remarques sont importantes à faire. Tout d’abord, il est facile de voir que

S(R) ⊂ L2 (R) (B.22)

En effet, si f ∈ S(R), nous savons qu’il existe une constante A telle que

| f (t)| ≤ A/(1 + t2 ) .

Par conséquent,
Z ∞
dt
2
|| f || ≤ A 2
<∞,
−∞ (1 + t2 )2

B.5
B Espaces fonctionnels

ce qui montre que f ∈ L2 (R).


Le second point important est contenu dans la proposition suivante, que nous donnons sans démonstration :

P ROPOSITION B.2 D(R) est dense dans L2 (R) : pour toute fonction f ∈ L2 (R) et pour tout
nombre e > 0, il existe une fonction f e ∈ D(R) telle que

|| f − f e || ≤ e

En d’autres termes, pour toute fonction f ∈ L2 (R), on peut toujours trouver une suite de fonctions
appartenant à D(R) qui converge vers f en moyenne d’ordre 2. Un corollaire immédiat est que S(R)
est lui aussi dense dans L2 (R). C’est sur cette propriété que l’on s’appuie généralement pour étendre
la transformation de Fourier à L2 (R).

B.6
A NNEXE

C Elements de géométrie
des courbes et surfaces

C.1 Courbes, courbes paramétrées


C.1.1 Courbes planes
Les courbes planes sont des courbes dans le plan, généralement définies en coordonnées Cartésiennes
par une équation de la forme F ( x, y) = 0. Cette relation permet parfois d’exprimer directement y en
fonction de x, ou vice-versa. On a aussi souvent recours à des formes paramétrées.

D ÉFINITION C.1 On appelle courbe plane paramétrée, ou arc paramétré une application α
 
x (t)
t ∈ [ a, b] 7−→ α(t) = ∈ R2 ,
y(t)

où a, b sont deux réels, et x et y sont deux fonctions continues. Si x et y sont différentiables, on
parle de courbe différentiable. Si x 0 et y0 ne s’annulent jamais simultanément, la courbe est dite
régulière.

Des exemples de courbes paramétrées (des cardioı̈des), d’équation paramétrique



x (θ ) = a cos θ (1 + cos θ )
θ ∈ [0, 2π ] 7−→ α(θ ) =
y(θ ) = a sin θ (1 + cos θ )

où a est un paramètre, se trouvent en F IG . C.1.


La longueur d’un arc paramétré t ∈ [ a, b] → α(t) est donnée par l’expression
Z b Z bq
0
L(α) = kα (t)k dt = x 0 (t)2 + y0 (t)2 dt . (C.1)
a a

Ceci permet de définir l’abscisse curviligne


Z tq
s : t ∈ [ a, b] → s(t) = x 0 (u)2 + y0 (u)2 du , (C.2)
a

qui fournit une reparamétrisation naturelle de la courbe

β(s) = α(t(s)) , (C.3)

où on a noté s → t(s) la réciproque de la fonction t → s(t). On montre facilement que le vecteur

N (s) = β0 (s) (C.4)

est un vecteur unitaire, tangent à la courbe en β(s).

C.1
C Elements de géométrie des courbes et surfaces

F IG . C.1: Quatre cardioı̈des

La courbure est quant à elle définie à partir de l’abscisse curviligne s comme

κ : s 7−→ κ (s) = k β00 (s)k , (C.5)

et on définit le rayon de courbure comme l’inverse de la courbure ρ = 1/κ. Un calcul explicite donne
en outre
α00 (t) · α0⊥ (t)
κ (t) = . (C.6)
k α 0 k3
Le rayon de courbure est le rayon d’un cercle, appelé cercle osculateur, tangent à la courbe au point
considéré, et qui en est dans un certain sens le plus proche possible (c’est à dire qui en épouse la
forme au mieux). Le centre de ce cercle est appelé centre de courbure
Etant donnée une courbe paramétrée, on peut lui associer en tout point son vecteur unitaire tangent

x 0 (t)
 
1
T (t) = p (C.7)
x 0 ( t )2 + y 0 ( t )2 y0 (t)

et le vecteur unitaire normal

−y0 (t)
 
1
N (t) = p . (C.8)
x 0 ( t )2 + y 0 ( t )2 x 0 (t)

On peut alors montrer les relations de Frénet

dT (s) N dN (s) T
= , et =− . (C.9)
ds ρ(s) ds ρ(s)

C.1.2 Courbes gauches


Une courbe gauche est une courbe dans l’espace tridimensionnel. Dans un repère orthonormé, une
courbe gauche s’écrit naturellement sous forme paramétrique

C.2
C.1 Courbes, courbes paramétrées

D ÉFINITION C.2 On appelle courbe gauche paramétrée une application α


 
x (t)
t ∈ [ a, b] 7−→ α(t) =  y(t)  ∈ R3 ,
z(t)

où a, b sont deux réels, et x, y et z sont trois fonctions continues. Si x, y, z sont différentiables, on
parle de courbe gauche différentiable. Si x 0 , y0 et z0 ne s’annulent jamais simultanément, la courbe
est dite régulière.

Un exemple de courbe gauche, la courbe de Viviani, d’équation paramétrique

R cos2 (t)

 x (t) =
y(t) = R cos(t) sin(t)
z(t) = R sin(t)

où R est un paramètre, se trouve en F IG . C.2.

F IG . C.2: La courbe de Viviani est l’intersection d’une sphère de rayon R et d’un cylindre de
révolution de diamètre R dont une génératrice passe par le centre de la sphère.

La longueur d’un arc de courbe gauche se définit de façon similaire au cas des courbes planes :
Z b Z bq
L(α) = kα0 (t)k dt = x 0 (t)2 + y0 (t)2 + z0 (t)2 dt , (C.10)
a a

ce qui permet cette fois encore de définir l’abscisse curviligne


Z tq
s : t ∈ [ a, b] → s(t) = x 0 (u)2 + y0 (u)2 + z0 (u)2 du , (C.11)
a

et fournit une reparamétrisation naturelle de la courbe

β(s) = α(t(s)) , (C.12)

où on a noté s → t(s) la réciproque de la fonction t → s(t).


On définit comme dans le cas des courbes planes le vecteur unitaire tangent
1
T (t) = p ( x 0 (t), y0 (t), z0 (t)) . (C.13)
x 0 ( t )2 + y 0 ( t )2 + z 0 ( t )2

C.3
C Elements de géométrie des courbes et surfaces

De même, on montre que la dérivée du vecteur unitaire tangent lui est perpendiculaire, ce qui permet
de définit le vecteur normal principal N, par

dT 1
= N, (C.14)
ds ρ

où ρ = 1/κ est le rayon de courbure, inverse de la courbure. En complétant par le vecteur binormal

B = T × dN , (C.15)

on obtient ainsi un repère orthonormé direct, appelé repère de Frénet ( T, N, B) de l’espace. On montre
facilement que dB/dt est proportionnel à N, de sorte que l’on écrit

dB 1
= N, (C.16)
ds r

où r = 1/τ est le rayon de torsion, inverse de la torsion τ. Finalement, on montre aussi

dN 1 1
=− T− B. (C.17)
ds ρ r

C.2 Surfaces paramétrées dans l’espace

D ÉFINITION C.3 On appelle surface paramétrée une application α

(t1 , t2 ) ∈ [ a1 , b1 ] × [ a2 , b2 ] 7−→ α(t1 , t2 ) = ( x (t1 , t2 ), y(t1 , t2 ), z(t1 , t2 )) ∈ R3 ,

où a1 , a2 , , b1 , b2 sont quatre réels, et x, y et z sont trois fonctions continues. Si x, y, z sont


différentiables, on parle de surface différentiable.

Un exemple de surface paramétrée se trouve en F IG . C.3 ; il s’agit d’un coquillage, d’équation pa-
ramétrique
 x (t1 , t2 ) = ( a + b cos(t2 ))emt1 cos(t1 )

y(t1 , t2 ) = ( a + b cos(t2 ))emt1 sin(t1 )


x (t1 , t2 ) = ( a + b sin(t2 ))emt1 ,

où a, b et m sont des paramètres réels qui contrôlent la forme de la surface.

F IG . C.3: Un coquillage

C.4
C.2 Surfaces paramétrées dans l’espace

En tout point t = (t1 , t2 ), on peut calculer les deux vecteurs tangents définis par
 
∂x (t)  ∂x(t) 
∂α  ∂y∂t(1t)  ∂α ∂t
 ∂y(2t) 
(t) = 
 ∂t1 
 , (t) =  ∂t  . (C.18)
∂t1 ∂t2 2
∂z(t) ∂z(t)
∂t1 ∂t2

Lorsqu’en un point t ces deux vecteurs sont linéairement indépendants (c’est à dire ne sont pas co-
linéaires), on dit que ce point est régulier, et on définit le plan tangent à la surface par
 
∂α ∂α
Tt = α(t) + a (t) + b (t), a, b ∈ R , (C.19)
∂t1 ∂t2

En notant T 1 et T 2 les vecteurs unitaires correspondant

1 ∂α 1 ∂α
T 1 (t) = (t) , T 2 (t) = (t) , (C.20)
∂α ∂t1 ∂α ∂t2
∂t1 ∂t2

on en déduit l’expression de la normale à la surface :

N (t) = T 1 (t) × T 2 (t) . (C.21)

Il est possible de démontrer que l’aire d’une surface paramétrée est donnée par l’expression
ZZ ZZ
∂α ∂α
A(α) = dA(t) = (t) × (t) dt1 dt2 , (C.22)
∂t1 ∂t2

et que cette aire ne dépend pas de la paramétrisation. L’expression

∂α ∂α
dA(t) = (t) × (t) dt1 dt2
∂t1 ∂t2

représente ce que l’on nomme parfois élément d’aire. Sans entrer dans les détails de la démonstration,
remarquons que ceci n’est autre que l’intégrale de la norme du produit vectoriel des deux vec-
teurs tangents, et que ce produit vectoriel représente l’aire du parallélogramme engendré par les
deux vecteurs. Ainsi, calculer cette intégrale revient en quelque sorte à sommer des aires de “pa-
rallélogrammes infinitésimaux” utilisés pour paver la surface.

R EMARQUE C.1 Il est possible d’associer à une surface paramétrée des notions de courbure locale ; plus
précisément, on associe à tout point d’une surface régulière deux courbures dites principales, qui permettent
d’en caractériser certaines propriétés géométriques. Nous n’irons pas plus loin ici.

Une surface est dite orientable s’il est possible de définir une normale orientée en tout point, et que
cette normale dépend continûment des paramètres. Par exemple, un ruban usuel est orientable, alors
qu’un ruban de Moëbius (voir F IG . C.4) ne l’est pas.
Etant donnée une surface orientable, la fonction t → N (t) définit une orientation. A tout champ de
vecteur x ∈ R3 → V de l’espace on peut alors associer son flux à travers la surface α :
Z
Φ α (V ) = V (α(t)) · N (t) dA(t) . (C.23)
α

On montre que le flux est indépendant de la paramétrisation, et ne dépend que de l’orientation.

C.5
C Elements de géométrie des courbes et surfaces

F IG . C.4: Le ruban de Moëbius n’est pas orientable

T H ÉOR ÈME C.1 (F ORMULE D ’O STROGRADSKY ) Soit S une surface fermée qui délimite un
domaine U de R3 . Soit V un champ de vecteurs de classe C1 défini sur U. On paramètrise S =
{t → α(t)} de sorte que le vecteur normal N (t) pointe toujours vers l’extérieur de U. Alors on a
ZZZ ZZ
div(V ( x, y, z)) dxdydz = V (α(t)) · N (t) dA(t) = Φα (V ) .
U S

Cette formule trouve de nombr euses applications en physique ; elle peut également être utilisée pour
calculer le volume du solide délimité par une surface fermée.

E XEMPLE C.1 (A IRE ET VOLUME DE LA SPH ÈRE ) Considérons une sphère de rayon r, centrée à l’ori-
gine. En coordonnées sphériques, elle est paramétrée par

 x (θ, ϕ) = r sin ϕ cos θ
y(θ, ϕ) = r sin ϕ sin θ
z(θ, ϕ) = r cos ϕ

Les deux vecteurs tangents naturellement associés à cette paramétrisation sont donnés par
   
− sin θ cos ϕ cos θ
T 1 (θ, ϕ) = r sin ϕ  cos θ  , T 2 (θ, ϕ) = r  cos ϕ sin θ  ,
0 − sin ϕ

et  
− cos θ sin ϕ
T 1 (θ, ϕ) × T 2 (θ, ϕ) = r2 sin ϕ  sin θ sin ϕ  , dA( ϕ, θ ) = r2 sin ϕ dθdϕ
cos ϕ
de sorte que
Z π Z 2π
A= r2 sin ϕ dθdϕ = 4πr2 .
0 0
Le volume s’obtient quant à lui grâce à la formule d’Ostrogradsky. Il suffit de prendre le champ de
vecteur V (θ, ϕ) = r (θ, ϕ). On a alors divV = 3, et

1 r 4 3
ZZZ ZZ
V= div(V ( x, y, z)) dxdydz = dA(θ, ϕ) = πr .
3 3 3

C.6
A NNEXE

D Théorie des perturba-


tions

D.1 Comparaisons : notations de Landau


La comparaison asymptotique consiste à étudier le comportement d’une fonction au voisinage d’un
point ou à l’infini, en prenant pour référence le comportement d’une autre fonction fixée. On utilise
souvent pour cela des monômes.
Ci dessous, on note R = R ∪ {+∞; −∞}.

D.1.1 Négligeabilité
Soit a ∈ R. Soient f et g deux fonctions de la variable réelle t, telles que g ne s’annule pas sur un
voisinage de a. On dit que f est négligeable devant g en a, et on note

f (t) = o ( g(t))
t→a

lorsque
f (t)
−→ 0 .
g ( t ) t→a

Si le contexte est clair, on ne précise pas le domaine d’étude et on note : f (t) = o ( g(t)), voire f = o ( g)
(dire petit o).. Cependant, la notation est toujours associée à un lieu a et au voisinage de ce lieu : être
négligeable est un concept local.
Par abus de langage, on effectue parfois des opérations sur “les petits o”, c’est-à-dire sur les négligeables.
En effet, on peut dire que : o ( f ) + o ( f ) = o ( f ) et o ( f ) − o ( f ) = o ( f ).

D.1.2 Equivalence
Soit a ∈ R. Soient f et g deux fonctions de la variable réelle t, telles que g ne s’annule pas sur un
voisinage de a. On dit que f équivaut à g en a, ou que g équivaut à f en a, et on note

f (t) ∼ g(t) ,
t→ a

lorsque
f (t) − g(t) = o ( g(t)) .
t→ a

D.1
D Théorie des perturbations

D.1.3 Domination
La notation grand O dénote le caractère dominé d’une fonction par rapport à une autre. Soit a ∈ R.
Soient f et g deux fonctions de la variable réelle t. On dit que f est dominée par g en ±∞ , ou que g
domine f en ±∞ , et on note
f (t) = O ( g(t)) ,
t→+∞

lorsqu’il existe des constantes N et C telles que

∀t ∈ R tel que |t| > N , | f (t)| ≤ C | g(t)| .

Intuitivement, cela signifie que f ne croı̂t pas plus vite que g.


Similairement, si a est un réel, on dit que f est dominé par g au voisinage de a, et on écrit

f (t) = O( g(t)) quand t→a

si et seulement si il existe des constantes δ > 0 et C telles que

∀t |t − a| < δ =⇒ | f (t)| ≤ C | g(t)| .

D.2 Perturbations, équations algébriques


La théorie des perturbations consiste à rechercher des solutions de problèmes complexes, partant de
problèmes plus simples que l’on sait résoudre. Par exemple, supposons que x0 soit solution d’une
équation
F(x) = 0 ,
pour une certaine fonction F, et que l’on cherche à résoudre une équation légèrement différente

Fe ( x ) = 0 ,

où la fonction Fe est proche de F, la différence dépendant d’un “petit” paramètre e, par exemple

Fe = F + eG

pour une certainbe fonction G. On dit que Fe est une version perturbée de F, et G est la perturbation.
On peut alors chercher une solution x (e) sous forme d’une perturbation de x, sous la forme

x (e) = x0 + ex1 + o (e) ,

ou plus généralement d’une série



x (e) = ∑ xk ek ,
k =0

dont on va chercher à identifier les coefficients xk .

À SUIVRE ...

D.2
Index

Abscisse d’intégrabilité, 92 Echantillon, 161


Abscisse de sommabilité, 92 Equation aux dérivées partielle, 133
Action, 32 Equation d’Euler-Lagrange, 19, 20
Application différentielle, 12 Equation de Beltrami, 21
Application tangente, 12 Equation de Bessel, 120
Equation de la chaleur, 190
Brachistochrone, 22 Equation de la chaleur dans un milieu semi-
infini, 99
Caténoı̈de, 25 Equation de la chaleur finie, 37
Chaı̂nette, 25, 34 Equation de Laplace, 28
Circuit RC, 69 Equation de Legendre, 119
Colonne de Cox-Overton, 25 Equation de Sturm-Liouville, 127
Condition aux bords naturelle, 31 Equation des ondes, 29
Condition de Neumann, 142 Equation différentielle, 107
Conditions aux bords, 108, 126 Equation différentielle à coefficients constants,
Conditions aux limites, 108 108
Conditions de Cauchy, 107 Equation différentielle homogène, 108
Conditions de Dirichlet, 142 Equation différentielle non-linéaire, 108
Conditions de Robin, 142 Equation différentielle autonome, 107
Conditions initiales, 107 Equation indicielle, 117
Convolution des fonctions, 70 Equations de Lagrange, 32
Convolution des suites, 47 Espace affine, 109
Convolution des vecteurs, 43 Espace de Schwartz, 81
Convolution sur R+ , 93 Espace des phases, 115
Corde pesante, 33 Espace dual, 160
Courbe intégrale, 107
Cycloı̈de, 23 Facteur intégrant, 113, 127
Filtrage numérique, 48
Dérivée fonctionnelle, 20 Filtre RC, 69
Dérivées de la transformée de Fourier intégrale, Fonction à croissance au plus exponentielle, 92
76 Fonction à croissance lente, 92
Distribution de Dirac, 160 Fonction de Green, 130
Distribution impaire, 163 Fonction de Hankel, 122
Distribution paire, 163 Fonction de Heaviside, 159
Distribution régulière, 161, 164 Fonction de Neumann, 121, 122
Dual, 159 Fonction génératrice, 125

D.3
Index

Fonction Gamma, 121 Point ordinaire, 116


Fonction impaire, 163 Point régulier, 116
Fonction localement intégrable, 91, 164 point selle, 16
Fonction paire, 163 Point singulier, 116
Fonctionnelle, 19 Polynômes d’Hermite, 125
Fonctions de Bessel, 153 Polynômes de Laguerre, 125
Formalisme Hamiltonien, 32 Principe de Fermat, 17, 25
Forme résolue d’une équation différentielle, 107 Principe de moindre action, 32
Formulation variationnelle, 11 Problème aux bords, 136
Formule de Rodrigues, 125 problème de Dirichlet extérieur, 136
Formule d’échange, 78 Problème de Dirichlet intérieur, 136
Formule de Plancherel, 81, 82 Problème de Neumann extérieur, 136
Formule de Rodrigues, 119, 125 Problème de Neumann intérieur, 136
Formule intégrale de Poisson, 139 Problème de plateau, 27
Problème de Sturm-Liouville, 125
Hamiltonien, 22, 33 Produit tensoriel, 164
Hessienne, 16
Quantité conservée, 22, 30
Inégalité de Heisenberg, 83
Intégrale de Fourier, 71 Réponse impulsionnelle, 48, 130

Jacobien, 13 Signal analogique, 48


Signal numérique, 48
Lagrangien, 32 Sinus cardinal, 73
Lemme d’échange, 78 Solution de d’Alembert, 150
Lemme de Carslaw-Jaeger, 99 Surface minimale, 27
Lemme fondamental du calcul variationnel, 20
Ligne droite, 21 Théorème convolution produit : le cas des suites,
Loi de conservation, 33 47
Lois de Snell-Descartes, 17 Théorème convolution produit : le cas des vec-
teurs, 44
Mécanique Hamiltonienne, 32 Théorème convolution-produit : le cas des fonc-
Méthode de Laplace, 110 tions, 80, 83
Méthode de variation de la constante, 110 Théorème de Riemann-Lebesgue, 75
Méthode de Fröbenius, 116 Théorème de Liouville, 115
Matrice Jacobienne, 13 Traitement du signal, 48
Mirage, 25 Transformée de Fourier de la dérivée d’une fonc-
Modèle probabiliste, 225 tion, 77
Multiplicateur de Lagrange, 18 Transformation de Fourier conjuguée, 71
Transformation de Fourier discrète, 46
Noyau de Poisson, 140
Transformation de Fourier discrète : inversion,
Opérateur de convolution, 70 50
Opérateur de translation, 163 Transformation de Fourier finie, 38
Opérateur différentiel, 126 Transformation de Fourier finie : inversion, 39
Opérateur parité, 163 Transformation de Fourier finie : périodicité, 44
Opérateur de la chaleur, 190 Transformation de Fourier intégrale , 71
Optimisation contrainte, 18, 33 Transformation de Fourier intégrale : inversion,
78
Partie finie de 1/t2 , 167 Transformation de Laplace unilatérale, 91
Peigne de Dirac, 161 Transformation de Laplace : dérivation, 95
Pendule double, 32 Transformation de Laplace : holomorphie, 94,
Point critique, 15 95

D.4
Index

Valeur principale de 1/t, 167


Variable dépendante, 19
Variable indépendante, 19
Vibrations d’une corde, 149
Vibrations d’une poutre, 149

Wronskien, 110, 112, 114

D.5

Vous aimerez peut-être aussi