0% ont trouvé ce document utile (0 vote)
10 vues74 pages

Cours de Probabilités-Statistiques Ingénieur

Ce document est une note de cours en probabilités et statistiques destinée aux ingénieurs, couvrant divers sujets tels que les variables aléatoires, l'estimation paramétrique, les tests d'hypothèses, la modélisation statistique, les plans d'expériences et la statistique exploratoire. Il est structuré en plusieurs sections détaillant les concepts fondamentaux et les méthodes appliquées dans le domaine. La version est provisoire et invite les lecteurs à faire des remarques.

Transféré par

mouhamadoumouctarou9
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
10 vues74 pages

Cours de Probabilités-Statistiques Ingénieur

Ce document est une note de cours en probabilités et statistiques destinée aux ingénieurs, couvrant divers sujets tels que les variables aléatoires, l'estimation paramétrique, les tests d'hypothèses, la modélisation statistique, les plans d'expériences et la statistique exploratoire. Il est structuré en plusieurs sections détaillant les concepts fondamentaux et les méthodes appliquées dans le domaine. La version est provisoire et invite les lecteurs à faire des remarques.

Transféré par

mouhamadoumouctarou9
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Note de cours en Probabilités-Statistiques pour Ingénieur

(Version provisoire ! Merci pour toute remarque.)

David Jaurès FOTSA MBOGNE


Me contacter à david jamesf@[Link]
Aller à ma page web [Link]

18 septembre 2019
Table des matières

1 Généralités de probabilité 1
1.1 Variables aléatoires discrètes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 2
1.2 Variables aléatoires continues . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
1.3 n-uplet de variables aléatoires et échantillonnage . . . . . . . . . . . . . . . . . . . 9
1.4 Convergence d’une suite de variables aléatoires . . . . . . . . . . . . . . . . . . . . 13
1.5 Analyses descriptives . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 14
1.5.1 Les tableaux . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 14
1.5.2 Les diagrammes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 17
1.5.3 Les graphes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19

2 Estimation paramétrique 21
2.1 Généralités sur les estimateurs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21
2.2 Estimation par la méthode du maximum de vraisemblance . . . . . . . . . . . . . 24
2.3 Intervalle de confiance . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 25

3 Tests d’hypothèses 29
3.1 Tests d’hypothèses paramétriques . . . . . . . . . . . . . . . . . . . . . . . . . . . 29
3.1.1 Test du rapport de vraisemblance (RV) . . . . . . . . . . . . . . . . . . . . 30
3.1.2 Autres tests basés sur les intervalles de confiance . . . . . . . . . . . . . . 31
3.1.3 Exemples d’applications . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
3.2 Tests pour des variables catégorielles . . . . . . . . . . . . . . . . . . . . . . . . . 32
3.2.1 Test du rapport de vraisemblance . . . . . . . . . . . . . . . . . . . . . . . 33
3.2.2 Test du Khi-2 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 33
3.2.3 Tests de l’Odd Ratio (OR) et du Risque Relatif (RR) . . . . . . . . . . . . 34
3.2.4 Exemples d’applications . . . . . . . . . . . . . . . . . . . . . . . . . . . . 34
3.3 Analyses de la variance et la covariance . . . . . . . . . . . . . . . . . . . . . . . . 35
3.3.1 ANOVA à un facteur . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35
3.3.2 ANOVA à plusieurs facteurs . . . . . . . . . . . . . . . . . . . . . . . . . . 36

4 Modélisation statistique 39
4.1 Régression paramétrique . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 39
4.1.1 Le modèle linéaire général . . . . . . . . . . . . . . . . . . . . . . . . . . . 39
4.1.2 Le modèle linéaire généralisé . . . . . . . . . . . . . . . . . . . . . . . . . . 42
4.2 Analyse de la regression . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 42
4.2.1 Analyse de la variance . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 42
4.2.2 Analyse de la covariance (ANCOVA) . . . . . . . . . . . . . . . . . . . . . 44
4.3 La méthode géostatistique du krigeage . . . . . . . . . . . . . . . . . . . . . . . . 44

i
TABLE DES MATIÈRES TABLE DES MATIÈRES
5 Plans d’expériences 47
5.1 Généralités . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 47
5.1.1 Vocabulaire des plans d’expériences . . . . . . . . . . . . . . . . . . . . . . 47
5.1.2 Modélisation mathématique et plans complets . . . . . . . . . . . . . . . . 49
5.1.3 Ordre des essais et réduction des erreurs . . . . . . . . . . . . . . . . . . . 50
5.1.4 Plans optimaux . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 53
5.2 Plans factoriels fractionnaires ou plans de criblage . . . . . . . . . . . . . . . . . . 54
5.2.1 Calcul de Box et générateurs d’aliases . . . . . . . . . . . . . . . . . . . . . 54
5.2.2 Evaluations d’importance de coefficients . . . . . . . . . . . . . . . . . . . 56
5.3 Autres plans . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 57
5.3.1 Carrés latins et plans associés . . . . . . . . . . . . . . . . . . . . . . . . . 57
5.3.2 Plans de Koshal . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 57
5.3.3 Plans de Plackett et Burman . . . . . . . . . . . . . . . . . . . . . . . . . 58
5.3.4 Plans de Taguchi . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 58
5.3.5 Plans de Rechtschaffner . . . . . . . . . . . . . . . . . . . . . . . . . . . . 58
5.4 Plans pour les surfaces de réponse . . . . . . . . . . . . . . . . . . . . . . . . . . . 59
5.4.1 Plans composites . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 59
5.4.2 Plans de Box-Behnken . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 59
5.4.3 Plans de Doehlert . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 59
5.4.4 Les plans hybrides . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 60
5.4.5 Les plans de Mozzo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 60
5.5 Plans de mélange . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 60
5.5.1 Plans en réseaux ou de Scheffé . . . . . . . . . . . . . . . . . . . . . . . . . 60
5.5.2 Plans de mélange centrés . . . . . . . . . . . . . . . . . . . . . . . . . . . . 61
5.5.3 Modélisation mathématique des plans de mélanges . . . . . . . . . . . . . . 61

6 Statistique explratoire 62
6.1 Analyse en composante principale (ACP) et analyse canonique (AC) . . . . . . . . 62
6.1.1 Analyse en composante principale (ACP) . . . . . . . . . . . . . . . . . . . 62
6.1.2 Analyse canonique (AC) . . . . . . . . . . . . . . . . . . . . . . . . . . . . 62
6.2 Analyse des correspondances . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 62
6.2.1 Analyse factorielle des correspondances (AFC) . . . . . . . . . . . . . . . . 62
6.2.2 Analyse des correspondances multiples (ACM) . . . . . . . . . . . . . . . . 62
6.3 Classification . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 62
6.3.1 Classification hiérarchique . . . . . . . . . . . . . . . . . . . . . . . . . . . 62
6.3.2 Les K-moyennes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 62
6.3.3 Séparateurs à vaste marge (SVM) . . . . . . . . . . . . . . . . . . . . . . . 62
6.3.4 Réseaux de neurones . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 62

7 Quelques exercices 63
7.1 Travaux personnels des étudiants . . . . . . . . . . . . . . . . . . . . . . . . . . . 63
7.2 Notions de probabilité . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 63
7.3 Estimateurs paramétriques et Intervalles de confiances . . . . . . . . . . . . . . . 64
7.4 Tests paramétriques et catégoriels . . . . . . . . . . . . . . . . . . . . . . . . . . . 65
7.5 Analyse des données statistiques . . . . . . . . . . . . . . . . . . . . . . . . . . . . 66

A Bruit 68

ii
TABLE DES MATIÈRES TABLE DES MATIÈRES
B Fonction de Bessel 69

iii
Chapitre 1

Généralités de probabilité

Dans ce chapitre nous rappelons quelques notions de probabilité jugées utiles pour la suite du
document.

Definition 1.0.1 Soient Ω un ensemble et T ⊆ P (Ω) une famille de partie de Ω. On dit que T
est une tribu ou σ-algèbre sur Ω, si elle satisfait les conditions suivantes :
(i) ∅, Ω ∈ T .
(ii) ∀A ∈ T , CΩA ∈ T (T est stable par passage au complémentaire).
S
(iii) ∀I ⊆ N, ∀ {Ai }i∈I ⊆ T , i∈I Ai ∈ T (T est stable par réunion au plus dénombrable).
Lorsque T est une tribu (sur Ω) on appelle la paire (Ω, T ) un espace probabilisable.

Remarque 1.0.1 La condition (iii) dans la définition ci-avant peut être remplacée
T par la condi-
tion stabilité par intersection au plus dénombrable : ∀I ⊆ N, ∀ {Ai }i∈I ⊆ T , i∈I Ai ∈ T .

Exemple 1.0.1
1. Pour tout ensemble Ω, {∅, Ω} et P (Ω) sont des tribus (triviales) sur Ω. En termes d’inclu-
sion ensembliste, {∅, Ω} est la plus petite tribu sur Ω et P (Ω) est la plus grande.
2. Si Ω = {a, b} on a les tribus sur Ω sont : {∅, Ω}, P (Ω) = {∅, Ω, {a} , {b}}
3. Si Ω = {1, 4, 7} on a les tribus sur Ω sont : {∅, Ω}, {∅, {1, 4, 7} , {1} , {4, 7}},
P (Ω) = {∅, {1, 4, 7} , {1} , {4} , {7} , {1, 4} , {1, 7} , {4, 7}}, {∅, {1, 4, 7} , {4} , {1, 7}},
{∅, {1, 4, 7} , {7} , {1, 4}}.

Definition 1.0.2 Soient Ω un ensemble et A ⊆ P (Ω) une famille de partie de Ω. On appelle


tribu engendrée par A, la tribu de plus petite cardinalité contenant A .

Exemple 1.0.2
1. Pour tout ensemble Ω, la tribu engendrée par les singleton {{∅}} et {{Ω}} est {∅, Ω}. La
tribu P (Ω) engendrée par P (Ω) ou même par l’ensemble des singletons de Ω.
2. Si Ω = {1, 4, 7}, les ensembles {{1}}, {{4, 7}} et {{1} , {4, 7}} engendrent touts la tribu
{∅, {1, 4, 7} , {1} , {4, 7}} sur Ω.
3. Sur R, on définit la tribu borélienne comme la tribu engendrée par intervalles ouverts.

1
2 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
Definition 1.0.3 Soient (Ω, T ) un espace probabilisable et une application P : T → [0, 1]. On dit
que P est une probabilité sur (Ω, T ) si elle satisfait :
(i) P (∅) = 0 et P (Ω) = 1.
(ii) ∀ {Ai }i∈I⊆N ⊆ T une famille d’éléments deux à deux disjoints (ie. ∀i, j ∈ I si i 6= j alors
S  P
Ai ∩ Aj = ∅), on a nécessairement P i∈I Ai = i∈I P (Ai ).

Lorsque P est une probabilité sur (Ω, T ), on appelle le triplet (Ω, T , P ) espace probabilisé.

Definition 1.0.4 Soient (Ω1 , T1 , P ) un espace probabilisé et (Ω2 , T2 ) un espace probabilisable. Une
variable aléatoire à valeurs dans Ω2 est une application mesurable X : (Ω1 , T1 , P ) → (Ω2 , T2 ) qui
vérifie ∀A ∈ T2 , X −1 (A) ≡ {ω1 ∈ Ω1 ; X (ω1 ) ∈ A} ∈ T1 . On définit la probabilité image sur
(Ω2 , T2 ) pour tout A ∈ T2 par P (A) ≡ P (X −1 (A)). P est appelée la loi de probabilité de X.

Par souci de simplicité on utilisera l’abus P (A) pour désigner P (X −1 (A)). La variable aléatoire
X est dite réelle si Ω2 ⊆ R. On distingue deux grandes classes de variables aléatoires : les discrètes
et les continues.

Exemple 1.0.3 (Modèle de Bernoulli) On pose Ω1 = {échec, succès}, Ω2 = {0, 1}, T1 =


P (Ω1 ), T2 = P (Ω2 ),


 0, si A = ∅
1, si A = Ω1

P : A ∈ T1 7→ P (A) = 1 .

 5
, si A = {échec}
 4
5
, si A = {succès}

0, si A = {échec}
Alors l’application Y : (Ω1 , T1 , P ) → (Ω2 , T2 ) , ω1 ∈ Ω1 7→ X (ω1 ) = est
1, si A = {succès}
une variable aléatoire de Bernoulli.

1.1 Variables aléatoires discrètes


Une variable aléatoire est dite discrète, si Ω2 est finie ou dénombrable. Nous rappelons qu’un
ensemble est dit dénombrable s’il est en bijection avec l’ensemble des entiers naturels N.

Exemple 1.1.1 L’ensembles Z est dénombrable. En effet l’application



k, si n = 2k
n ∈ N 7→ ∈Z
−k, si n = 2k + 1

est une bijection.

Definition 1.1.1 (Espérance mathématique ou moyenne)


Soit g une application mesurable à valeur réelle définie sur Ω2 . L’espérance mathématique
d’une variable aléatoire rélle discrète g (X), est donnée si elle existe par
X
E [g (X)] = g (x) × P ({x})
x∈Ω2

Une interprétation géométrique de la moyenne est celle du barycentre. Notons qu’en général
général E [g (X)] 6= g (E [X]).

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


3 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
Definition 1.1.2 (Moment simple, moment centré)
Soient X une variable aléatoire réelle (continue ou discrète) et k ∈ N.
1. On appelle moment simple d’ordre k, l’espérance mathématique de la variable aléatoire X k .
2. On appelle moment centré d’ordre k, l’espérance mathématique de la variable aléatoire
(X − E [X])k .

On peut montrer aisément que l’opérateur E [.] est linéaire aussi bien dans le cas continu
que discontinu ; les propriétés des moments s’en déduisent. Il existe des moments particuliers à
2
l’instar du moment centré d’ordre 2 donnant la variance (V ar [X] ≡ σX ), ou du moment simple
d’ordre 1 qui est l’espérance mathématique. La racine carré de la variance lorsque cette dernière
existe est appelée écart-type (σX ). Grâce à la notion de moment on définit également le coefficient
d’asymétrie
E (X − E [X])3 E (X − µX )3
   
3/2 ≡ 3
σX
E (X − E [X])2


et le coefficient d’aplatissement (ou de curtose)

E (X − E [X])4 E (X − µX )4
   
2 − 3 ≡ 4
− 3.
E (X − E [X])2 σX


Le coefficient d’asymétrie est nul si la distribution est symétrique par rapport à la moyenne ;
c’est le cas pour la loi normale que nous présenterons dans la suite. S’il y a une tendance vers
la gauche de la moyenne, le coefficient d’asymétrie sera negatif ; il sera par contre positif s’il y
a une tendance à droite de la moyenne. Le coefficient d’aplatissement compare quant à lui, le
regroupement autour de la moyenne comparativement à la distribution normale pour laquelle il
vaut 0. Lorsqu’il y a une concentration relativement forte autour de la moyenne et la queue de
distribution est fine, le coefficient de curtose est négatif. Par contre, lorsqu’il y a une concentration
relativement faible autour de la moyenne et la queue de distribution est épaisse, le coefficient de
curtose est positif. La moyenne et le coefficient d’asymétrie sont des paramètres de position tandis
que la variance (de manière équivalente l’écart-type) et le coefficient d’aplatissement sont des
paramètres de dispersion.

Definition 1.1.3 (Fonction génératrice)


Soit X une variable aléatoire réelle (continue
 tX  ou discrète). On appelle fonction génératrice de
X, et on note gX la fonction t ∈ R 7→ E e .

La fonction génératrice est très importante. Elle permet notamment de calculer les moments
simples d’ordre k en appliquant ses dérivées d’ordre k à 0. En posant s = et on obtient une
seconde version de la fonction génératrice s ∈ R 7→ E sX . Avec cette version on calcule les
moments simples d’ordre k en appliquant les dérivées d’ordre k à 1. Toutefois, dans le cas d’une
variable aléatoire à valeurs finies entières et positives elle ne permettra de caculer qu’un nombre
fini de moments.

Definition 1.1.4 (Fonction caractéristique)


Soit X une variable aléatoire réelle
 continue. On appelle fonction caractéristique de X, et on
itX
note ψX , la fonction t ∈ R 7→ E e .

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


4 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ

 Lak fonction
−k (k)
caractéristique permet d’exprimer les moments simple d’ordre k via la relation
E X = i ψX (0). L’intérêt  itX  de la fonction caractéristique parrapport
 à la fonction génératrice
tX
est que l’existance de E e est plus probable que celle de E e . Cela est lié aux problèmes
de convergences des sommes ou intégrales.
Listons à présent quelques lois discrètes connues :
— Loi uniforme discrète
Cette loi modélise l’équi-probabilité dans un ensemble fini. Si card (Ω2 ) = N < +∞ et
x ∈ Ω2 , alors P (X = x) = N1 . On a en outre, les caractéristiques suivantes :
1X
E [X] = x
N x∈Ω2

2
= V ar [X] = E X 2 − E 2 [X]
 
σX

Remarque 1.1.1 La variance est toujours positive. L’écart-type qui est sa racine carrée est donc
bien définie. On peut l’établir grâce à l’inégalité des Jensen.

— Loi de Bernoulli B (p).


La loi de Bernoulli modélise des phénomènes similaires au lancé unique d’une pièce de
monnaie. p désigne en général la probabilité d’avoir le résultat souhaité (succès). Une
généralisation de cette loi est la loi binomiale, qui elle modélise le fait d’avoir X succès
au bout de n répétition(s) du lancé. On a P (X = k) = Cnk pk (1 − p)n−k 1|{k∈[0,n]} . D’autres
généralisations comme la loi multinomiale existent. On a en outre, les caractéristiques sui-
vantes pour la loi B (p) :
E [X] = p
V ar [X] = p (1 − p)
gX (x) = pex + (1 − p)
Pour la loi binomiale B (n, p),
E [X] = np
V ar [X] = np (1 − p)
gX (x) = [pex + (1 − p)]n
— Loi géométrique G (p).
Ici il s’agit du nombre d’échecs obtenus avant le premier succès : P (X = k) = p (1 − p)k 1|{k≥0} .
Cette loi se généralise par la loi binomiale négative et elle modélise le nombre d’échecs
k
avant d’avoir le r-ième succès : P (X = k) = Ck+r−1 pr (1 − p)k 1|{k≥0} . On a en outre, les
caractéristiques suivantes pour la loi G (p) :
1−p
E [X] =
p
1−p
V ar [X] =
p2
p
gX (x) =
1 − (1 − p) ex
Pour la loi binomiale négative,
r (1 − p)
E [X] =
p

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


5 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
r (1 − p)
V ar [X] =
p2
 r
p
gX (x) =
1 − (1 − p) ex
— Loi hypergéométrique H (N, M, n). Dans ce cas, il s’agit d’une population de taille
N + M , où N individus vérifient un certain critère (c) et pas les M autres. On fait un
tirage sans remise de n ≤ N + M individus, et on s’intéresse au nombre qui vérifie le critère
C k C n−k
(c). On a P (X = k) = CNn M . On admet que Cba = 0, si a > b.
N +M
— Loi de poisson P (λ) , λ ≥ 0. Il s’agit ici de modéliser la taille d’une file d’attente dans
k
intervalle de temps. On a P (X = k) = λk! e−λ . On a en outre, les caractéristiques suivantes :

E [X] = λ

V ar [X] = λ
x −1)
gX (x) = eλ(e

Definition 1.1.5 (Fonctions de répartition et de survie)


Soit X une variable aléatoire réelle (continue ou discrète). On appelle fonction de répartition,
l’application F : x 7→ P (X ≤ x). On appelle fonction de survie , l’application

S : x 7→ P (X > x) = 1 − P (X ≤ x) = 1 − F (x)

Definition 1.1.6 Soit X une variable aléatoire réelle (continue ou discrète). On appelle quantile
d’ordre q ∈ [0, 1] de X, la valeur xq ∈ Ω2 telle que F (xq ) = q. Les quantiles non-nuls multiples
de 0.25 sont appelés quartiles. La médiane est le deuxième quartile, c’est à dire le quantile d’ordre
0.5.

Exercice 1.1.1 Pour chacune des lois citées dans cette section déterminer en utilisant leurs
définitions, les fonctions génératrice et caractéristique, en précisant leurs domaines de définitions
à chaque fois. Déterminer également le moment simple d’ordre 1, le moment centré d’ordre 2, les
coefficients de asymétrie et de curtose.

Exercice 1.1.2 Pour chacune des lois citées dans cette section déterminer la fonction de répartition,
la médiane et les autres quartiles.

1.2 Variables aléatoires continues


Une variable aléatoire est dite continue, si Ω2 est infini non dénombrable. Dans le cas où les
tribus T1 et T2 sont boréliennes, la mesure de probabilité est ”proportionnelle” à la mesure de
Borel.

Definition 1.2.1 (Densité de probabilité)


Soit X une variable aléatoire réelle continue. On appelle densité de probabilité de X la fonction
f satisfaisant :
1. Pour tout x ∈ Ω2 , f (x) ≥ 0.

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


6 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
Z
2. f (t) dt = 1.
Ω2

Definition 1.2.2 (Espérance mathématique ou moyenne)


Soit g une application mesurable à valeurs réelles définie sur Ω2 où une variable aléatoire X
de densité f prend ses valeurs. L’espérance mathématique
Z de la variable aléatoire rélle continue
g (X), est donnée si elle existe par E [g (X)] = g (t) f (t) dt.
Ω2

Listons quelques exemples de lois continues.


— Loi uniforme U ([a, b]).
Cette loi modélise l’équi-probabilité et la densité de probabilité est donnée ∀x ∈ [a, b] par
1
f (x) = b−a . On a en outre, les caractéristiques suivantes :

b+a
E [X] =
2
(b − a)2
V ar [X] =
12
bx ax
e −e
gX (x) = , x 6= 0
(b − a) x
— Loi exponentielle E (λ) , λ > 0.
Ici, on s’intéresse au temps d’attente entre deux occurences d’un phénomène. La densité cor-
respondante est donnée ∀x ∈ R par f (x) = λe−λx 1|{x≥0} . On a en outre, les caractéristiques
suivantes :
1
E [X] =
λ
1
V ar [X] = 2
λ
λ
gX (x) =
λ−x
La loi exponentielle est souvent qualifiée d’être sans mémoire du fait que

P (X > t + h|X > t) = P (X > h)

où P (X > t + h|X > t) désigne la probabilité d’avoir X > t + h conditionellement au


(sachant le) fait que X > t.
— Loi exponentielle double ou de Laplace de paramètre λ > 0 et m.
Elle généralise la loi E (λ) dans le sens où elle tient compte de l’ordre des occurences d’un
phénomène. En effet, le temps peut être négatif ou positif. Sa densité est donnée ∀x ∈ R
par f (x) = λ2 e−λ|x−m| . On a en outre

E [X] = m
1
V ar [X] =
λ2
−λ2 emx
gX (x) = 2
x − λ2

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


7 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
La distribution est symétrique par rapport à la moyenne qui n’est pas liée à l’écart-type. La
fonction de densité f est continûment dérivable sauf en m où elle n’est que continue. Cette
irrégularité peut poser des problèmes lors d’une estimation par la méthode du maximum
de vraisemblance.
— Loi Gamma Γ (r, λ) ou loi d’Erlang lorsque r est un entier naturel non nul. La loi d’Er-
lang modélise le temps écoulé entre la première et la r + 1-ième occurence d’un évènement
régi par une loi de poisson. Lorsque r = 1, on retrouve la loi [Link] densité de
+∞
λr
probabilité est donnée ∀x ∈ R par f (x) = Γ(r)
xr−1 e−λx 1|{x≥0} , où Γ (x) = tx−1 e−t dt
0
est la fonction gamma d’Euler qui généralise la fonction factoriel. En effet, ∀x > −1,
Γ (x + 1) = xΓ (x). En particulier∀n ∈ N, Γ (n + 1) = n!. On a en outre, les caractéristiques
suivantes :
r
E [X] =
λ
r
V ar [X] = 2
λ
 r
λ
gX (x) =
λ−x
— Loi de Weibull W (λ, α) , λ, α > 0.
Cette loi généralise la loi exponentielle en modélisant la survie. Si X suit une loi E (λ) alors
X 1/α suit la loi W (λ, α). La fonction de densité de la loi W (λ, α) est donnée ∀x ∈ R par
α
f (x) = αλxα−1 e−λx 1|{x>0} . On a en outre, les caractéristiques suivantes :

Γ 1 + α1

E [X] =
λ1/α
Γ 1 + α2 − Γ2 1 + α1
 
V ar [X] = .
λ2/α
— Loi de Gauss ou normale N (m, σ 2 ).
La loi de Gauss est l’une des loi les plus utilisées autant en probabilité qu’en statistique.
Elle a entre autres propriétés celle d’être une distribution sur tout l’ensemble R qui est
symétrique par rapport la moyenne. Elle h est en outre infiniment dérivable. Sa densité est
1 1 x−m 2
i
donnée ∀x ∈ R par f (x) = σ 2π exp − 2 σ
√ . On a en outre, les caractéristiques
suivantes :
E [X] = m
V ar [X] = σ 2
σ2 2
 
gX (x) = exp mx + x
2
En dimension n, la loi de Gauss se généralise pour le vecteur gaussien X = [X1 , X2 , · · · , Xn ]T ,
de moyenne M = [M1 , M2 , · · · , Mn ]T , par la fonction de densité donnée ∀X ∈ Rn par
 
1 1 T −1
f (X) = p n exp − (X − M ) K (X − M )
det (K) (2π) 2 2

où la matrice des covariances K satisfait pour tous i, j ∈ [1, n], Kij = Cov [Xi , Xj ] = Kji .

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


8 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
Grâce à la loi normale N (m, σ 2 ) on définit la loi lognormale LN (m, σ 2 ). Une variable
aléatoire suit la loi lognormale si son logarithme suit la loi normale. On a

σ2
 
E [X] = exp m +
2
 2 
V ar [X] = exp 2m + 2σ 2 eσ − 1

σ2 2
 
gX (x) = exp mx − x
2
— Loi de Pareto de paramètre a, θ > 0
La loi de Pareto permet d’étudier les événements dits rares ou extrêmes d’une variable
aléatoire à valeurs positives. Il s’agit des réalisations de la variable aléatoire qui sont très
éloignées de la moyenne, mais dont la survenue a une importance capitale. On peut l’utiliser
pour modéliser la probabilité que variable aléatoire dépasse un certain seuil. Sa densité est
donnée ∀x ∈ R par f (x) = θaθ x−θ−1 1|{x>a} . On a

θa
E [X] = (n’existe que si θ > 1)
θ−1
θa2
V ar [X] = (n’existe que si θ > 2)
(θ − 1)2 (θ − 2)
Sa fonction génératrice ne s’exprime pas par des fonctions usuelles.
— Loi de Gumbel de paramètre α, β avec β > 0 et α ∈ R
Cette loi modélise également les événements dits rares ou extrêmes d’une variable aléatoire
à valeurs réelles. Il peut s’agir par exemple de la loi du maximum ou du minimum d’une
très grande série de
 réalisations
 d’un phénomène aléatoire. Sa densité est donnée ∀x ∈ R
1 α−x α−x
par f (x) = β exp β − exp β . On montre que

E [X] = α + γβ

π2β 2
V ar [X] =
6
αx
gX (x) = e Γ (1 − βx)
où γ ' 0.577... est la constante Euler.
— Loi Beta B (α, β) , α, β > −1
Cette loi modélise les phénomènes aléatoires dont les réalisations sont contenues dans l’in-
tervalle ]0, 1[. Il pourrait s’agir des proportions ou des taux par exemple. Sa densité est
donnée ∀x ∈ R par f (x) = B(α+1,β+1) 1
xα (1 − x)β 1|{x∈]0,1[} . On peut remarquer que si
α = β = 0 on retrouve la loi uniforme U ([0, 1]). Si α, β > 0 on peut vérifier que le mode de
α
cette loi est α+β . On rappelle l’expression de la fonction beta d’Euler donnée ∀α, β > 0 par
Z 1
B (α, β) = xα−1 (1 − x)β−1 dx
0
Γ (α) Γ (β)
=
Γ (α + β)

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


9 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
On a en outre
α+1
E [X] =
α+β+2
(α + 1) (β + 1)
V ar [X] =
(α + β + 2)2 (α + β + 3)
Exercice 1.2.1 Pour chacune des lois citées dans cette section déterminer en utilisant leurs
définitions, les fonctions génératrice et caractéristique, en précisant leurs domaines de définitions
à chaque fois. Déterminer également le moment simple d’ordre 1, le moment centré d’ordre 2, les
coefficients de asymétrie et de curtose.

Exercice 1.2.2 Pour chacune des lois citées dans cette section déterminer la fonction de répartition,
la médiane et les autres quartiles.
1
Exercice 1.2.3 Montrer que la loi de Cauchy de densité donnée ∀x ∈ R par f (x) = π(1+x2 )
n’admet pas d’espérance mathématique.

1.3 n-uplet de variables aléatoires et échantillonnage


Dans cette section on considère le n-uplet de variables aléatoires réelles (X1 , X2 , · · · , Xn ).

Definition 1.3.1 Soit (X1 , X2 , · · · , Xn ) un n-uplet de variables aléatoires réelles. On appelle


densité marginale fi (ou fXi ) d’une des variables Xi la densité de probabilité de ladite variable
indépendamment des autres variable. La densité conjointe f de du n-uplet (X1 , X2 , · · · , Xn ) est
sa densité de probabilité vu comme une variable aléatoire globale (vectorielle). De la même façon
on définit la fonction de répartition conjointe et les fonctions de répartitions marginales.

Definition 1.3.2 Soit (X1 , X2 , · · · , Xn ) un n-uplet de variables aléatoires réelles. Le système


{X1 , X2 , · · · , Xn } est dit indépendant si

F (x1 , x2 , · · · , xn ) = P ∩i∈[1,n] {Xi ≤ xi }
Y
= P ({Xi ≤ xi })
i∈[1,n]
Y
= Fi (xi )
i∈[1,n]

ou de manière équivalente Y
f (x1 , x2 , · · · , xn ) = fi (xi ) .
i∈[1,n]

Remarque 1.3.1 Il est également établi que le système {X1 , X2 , · · · , Xn } est indépendant si et
seulement si E [X1 X2 · · · Xn ] = E [X1 ] E [X2 ] · · · E [Xn ].

Definition 1.3.3 (Covariance et coefficient de corrélation)


Soit {X, Y } un paire de variables aléatoires réelles (continues ou discrètes). On définit la
covariance de la paire {X, Y } comme
Cov [X, Y ] = E [(X − E [X]) (Y − E [Y ])]
= E [XY ] − E [X] E [Y ] .
Cov[X,Y ]
Le rapport rXY = σX σY
est appelé coefficient de corrélation.

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


10 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
On remarque que Cov [X, X] = V ar [X] et si la paire {X, Y } est indépendante alors Cov [X, Y ] =
0. La covariance peut être vue géométriquement comme un produit scalaire et l’écart-type comme
une norme dans un espace vectoriel des variables aléatoires. S’il y a indépendance (orthogonalité),
la covariance est nulle et par conséquence le coefficient de correlation aussi. La covariance et le
coefficient de corrélation donnent une information sur la dépendance linéaire entre des variables
aléatoires. Pratiquement, si rXY est proche de 0 il n’y a pas de dépendance linéaire et si |rXY |
est proche de 1 il y en a une. Lorsque rXY > 0 on parle de corrélation positive, et si rXY < 0 on
parle de corrélation négative. La corrélation négative s’interprète comme un antagonisme des effets
des variables l’une sur l’autre. On établit grâce à l’inégalité de Cauchy-Schwarz et la linéarité de
l’espérance mathématique que le coefficient de correlation est toujours en valeur absolue inférieure
ou égal à 1.

Definition 1.3.4 On appelle échantillon aléatoire de taille n ou n-échantillon tout n-uplet de


variables aléatoires indépendantes et identiquement distribuées (iid). La loi suivie par ses variables
aléatoires est appelée loi mère.

Proposition 1.3.1 Soit (X1 , X2 , · · · , Xn ) un n−uplet de variables indépendantes. Alors


Yn Yn
gXn = gXk et ψXn = ψXk
Xk k=1 Xk k=1
k=1 k=1

Definition 1.3.5 Soit (X1 , X2 , · · · , Xn ) un n-échantillon. On appelle statistique toute variable


aléatoire S fonction de l’échantillon (X1 , X2 , · · · , Xn ).

Proposition 1.3.2 Soit (X1 , X2 , · · · , Xn ) un n-échantillon de loi mère N (0, 1). Alors
Xn
1. La statistique X n = n1 Xk suit la loi N 0, n1 . De façon plus générale, si la loi mère

k=1
est N (m, σ 2 ) alors la statistique
Xn − m
Zn = √
σ/ n
suit la loi N (0, 1).
Xn
2. La statistique nX 2 n = X 2 suit une loi dite du Khi-deux à n dégrés de liberté, notée
k=1 k
X 2 (n). De façon plus générale, si la loi mère est N (m, σ 2 ) alors la statistique
 
2 n 2 n 1 Xn 2
1 Xn = 2 S1 = 2 (Xk − m)
σ σ n k=1

suit la loi X 2 (n). La densité de probabilité correspondant à une variable aléatoire Z suivant
n −1 − x
la loi du Khi-carré est f (x) = x 2n2 en 2 1|{x>0} . La fonction caractéristique correspondant à
2 Γ( 2 )
1
cette loi est ψZ (z) = n . En outre E [Z] = n et V ar [Z] = 2n.
(1−2z)2

Proposition 1.3.3 Soit (X1 , X2 , · · · , Xn ) un n-échantillon de loi mère N (m, σ 2 ). Alors la sta-
tistique  
2 n−1 2 n−1 1 Xn 2
2 Xn = S = Xk − X n
σ2 2 σ2 n−1 k=1

suit une loi X 2 (n − 1).

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


11 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
Proposition 1.3.4 Soient X et Y deux variables √
aléatoires suivant respectivement les lois N (0, 1)
2 X n
et X (n). Alors la variable aléatoire Tn = √Y suit la loi de Student t (n), à n degrés de liberté.
Γ( n+1
− n+1
2 )

t2 2
La fonction de densité correspondant à cette loi est f (t) = nπΓ n 1 + n
√ .
(2)
Proposition 1.3.5 Soit (X1 , X2 , · · · , Xn ) un n-échantillon de loi mère N (m, σ 2 ). Alors les sta-
tistiques √  √ 
n Xn − m n Xn − m
1 Tn = et 2 Tn =
S1 S2
suivent respectivement une loi t (n) et une loi t (n − 1).
Proposition 1.3.6 Soient X et Y deux variables aléatoires suivant respectivement les lois X 2 (n)
et X 2 (m). Alors la variable aléatoire Fn,m = mX nY
suit la loi de Fisher-Snedecor F (n, m), à n dégrés
de liberté pour le numérateur et m dégrés
n n−2
de liberté pour le dénominateur. La fonction de densité
Γ( n+m ) ( ) n 2
t 2
de cette loi est f (t) = Γ n Γ2 m m n+m 1|{t>0} .
( 2 ) ( 2 ) (1+ n ) 2
m

On remarque de par la définition de la loi de Fisher-Snedecor, que si H F (n, m) alors


1 m
H
F (m, n). Si m ≥ 3, la moyenne d’une loi de Fisher existe et vaut m−2 . Si m ≥ 5, sa variance
2m2 (n+m−2)
existe et est égale à n(m−2)2 (m−4)
.
2
Proposition 1.3.7 Soient (X1 , X2 , · · · , Xn ) un n-échantillon de loi mère N (mX , σX ) et (Y1 , Y2 , · · · , Ym )
2
un m-échantillon de loi mère N (mY , σY ), les deux étant indépendants. On distingue les cas sui-
vants :
(i) La statistique 
X n − Y m − (mX − mY )
Zn,m = q
2
σX σ2
n
+ mY
suit une loi N (0, 1).
(ii) La statistique  √
X n − Y m − (mX − mY ) m+n
1 Tn,m = q q 2
2
σX σ 2 S S2
n
+ mY n Xσ2 1 + m Yσ21
X Y

suit une loi t (n + m). En particulier, si σX = σY alors la statistique se réduit à l’expression



X n − Y m − (mX − mY )
q
2 2
.
X S1 Y S1
m
+ n

(iii) La statistique
 √
X n − Y m − (mX − mY ) m+n−2
2 Tn,m = q
2 2
q 2 2
σX σY X S2 Y S2
n
+ m
(n − 1) σ 2 + (m − 1) σ 2
X Y

suit une loi t (n + m − 2). En particulier, si σX = σY alors la statistique se réduit à l’ex-


pression r 
nm (n + m − 2) X n − Y m − (mX − mY )
p .
m+n (n − 1)X S22 + (m − 1)Y S22

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


12 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
(iv) La statistique
 √
X n − Y m − (mX − mY ) m+n−1
1,2 Tn,m = q q 2 2
2
σX 2
σY X S1 Y S2
n
+ m
n σX2 + (m − 1) 2
σY

suit une loi t (n + m − 1). En particulier, si σX = σY alors la statistique se réduit à l’ex-


pression r 
nm (n + m − 1) X n − Y m − (mX − mY )
p .
m+n nX S22 + (m − 1)Y S22
(iii) Si m = n alors les statistiques
 
√ X n − Y n − (mX − mY ) √ X n − Y n − (mX − mY )
1 Tn = n et 2 Tn = n
X−Y S1 X−Y S2

suivent respectivement une loi t (n) et une loi une loi t (n − 1).
(iv) La statistique

σY2 X S12 σY2 X S22 σY2 X S12


1 Fn,m = 2
, F
2 2 n,m
= 2 2
, 1,2 Fn,m = 2 2
,
σX Y S1 σX Y S2 σX Y S2

suivent respectivement des lois F (n, m), F (n − 1, m − 1) et F (n, m − 1).

Proposition 1.3.8 Soient (X1 , X2 , · · · , Xn ) et (Y1 , Y2 , · · · , Yn ) deux n-échantillons tous de lois


mères normales. On considère les deux estimateurs de la covariance Cov [X, Y ] donnés par
1 Xn
XY S1 = (Xi − mX ) ((Yi − mY ))
n i=1
1
E [XY ] − (E [XY ] + (n − 1) E [XY ])
n
et
1 Xn  
XY S2 = Xi − X n Yi − Y n
n − 1  i=1 
n 1 X n 
= Xi Yi − X n Y n ,
n−1 n i=1

et les estimateurs respectifs associés du coefficient de corrélation rXY donnés par

XY S1 XY S2 n−1
r1 = et r2 = = r1
X S1 Y S1 X S2 Y S2 n
Alors les statistiques √ √
(n − 1) n − 2r1 n − 2r2
q et p
n2 − (n − 1)2 r12 1 − r22

suivent toutes la loi respectives t (n − 2).

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


13 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
1.4 Convergence d’une suite de variables aléatoires
Dans cette section, on considère une suite (Xn )n∈N de variables aléatoires réelles. L’objectif est
celui de définir des différents types de convergence. Ces notions seront importantes pour évaluer
la qualité des estimateurs dans le chapitre suivant.

Definition 1.4.1 Soient (fn )n∈N et f une famille d’applications toutes définies de A vers B ⊆ R.
On dit que
(i) La suite (fn )n∈N converge simplement vers f et on note fn → f si ∀ε > 0, ∀x ∈ A,
∃N (ε, x) ∈ N tel que ∀n ≥ N, |fn (x) − f (x)| < ε.
(ii) La suite (fn )n∈N converge uniformément vers f et on note fn ⇒ f si ∀ε > 0, ∃N (ε) ∈ N
tel que ∀x ∈ A, ∀n ≥ N, |fn (x) − f (x)| < ε.

Il est facile de remarquer que la convergence uniforme implique la convergence simple. La


réciproque est vraie si l’ensemble A est compact (par exemple un fermé borné de R).

Definition 1.4.2 On dit qu’une suite de variables aléatoires (Xn )n∈N converge en loi vers une
variable aléatoire X, si la suite des fonctions de répartition (Fn )n∈N correspondant à (Xn )n∈N ,
L
converge simplement vers la fonction de répartion F de X. On note Xn → X.

Proposition 1.4.1 Une suite de variables aléatoires (Xn )n∈N converge en loi vers une variable
aléatoire X si et seulement si la suite des fonctions génératrices (resp. caractéristiques) (gXn )n∈N
(resp. (ψXn )n∈N ) converge simplement vers gX (resp. ψX ).

Definition 1.4.3 On dit qu’une suite de variables aléatoires (Xn )n∈N converge en probabilité (ou
faiblement) vers une variable aléatoire X, si pour tout réel ε > 0 donné,

lim P (|Xn − X| < ε) = 1.


n→+∞

p
On note Xn → X.

La convergence en probabilité implique la convergence en loi. Cependant, elle sont équivalentes


si X est une constante.

Definition 1.4.4 On dit qu’une suite de variables aléatoires (Xn )n∈N converge presque sûrement
(ou fortement) vers une variable aléatoire X, si pour tout réel ε > 0 donné,
 
lim P sup {|Xm − X|} < ε = 1.
n→+∞ m≥n
 
p.s.
On note Xn → X. Une autre formulation de la convergence presque sûre est P lim Xn = X =
n→+∞
1. L’expression lim Xn = X est prise ici au sens de la convergence uniforme des fonctions.
n→+∞

Proposition 1.4.2 Soient (Xn )n∈N , une suite de variables aléatoires, et g une fonction continue.
p.s.
On suppose que Xn → X. Alors
p
1. Xn → X.
p.s.
2. g (Xn ) → g (X).

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


14 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
Definition 1.4.5 On dit qu’une suite de variables aléatoires (Xn )n∈N converge en moyenne qua-
m.q.
dratique vers une variable aléatoire X, si lim E (Xn − X)2 = 0. On note Xn → X.
 
n→+∞

La convergence en moyenne quadratique implique la convergence en probabilité.

Théorème 1.4.1 (Loi des grands nombres)


Soit (Xn )n∈N , une suite de variables aléatoires iid, de moyenne m et de variance σ 2 .
(i) (Loi faible des grands nombres)
1 Xn p
Xn = Xk → m
n k=1

(ii) (Loi forte des grands nombres) Si E [|X1 |] < ∞ alors


1 Xn p.s.
Xn = Xk → m
n k=1

Théorème 1.4.2 (Théorème de la limite centrale)


Soit (Xn )n∈N , une suite de variables aléatoires iid, de moyenne m et de variance σ 2 . Alors

Xn − m L
Zn = → N (0, 1)
√σ
n

Dans la pratique, on suppose que la limite est atteinte pour n > 30.

1.5 Analyses descriptives


Étant donné une réalisation (x1 , x2 , · · · , xn ) d’un n−échantillon (X1 , X2 , · · · , Xn ) on peut se
poser plusieurs questions au sujet de la loi mère de ce dernier. Peut-on identifier la loi mère ? Est-
elle paramétique ? Le cas échéant, peut-on déterminer lesdits paramètres ? Quels sont les quantiles
et le modes ? Les réponses à ces question ne sont pas aisées et nécessitent une certaine expérience.
Dans cette section nous rappelons quelques éléments classiques qui permettent de faire une analyse
grossière des données dans l’optique de répondre aux questions précédentes. L’hypothèse préalable
est que la série statistique (x1 , x2 , · · · , xn ) est réprésentative.

1.5.1 Les tableaux


Le principe des tableaux est celui de regroupement des données en classes et de mettre en relief
la distribution de celles-ci. Les classes peuvent être des sous-ensembles de l’univers dont la nature
définit le type de variable (quantitave ou qualitative). Lorsques les classes sont des singletons on
parle de modalité. lorqu’on peut avoir plus d’un élément dans une classe, on parle de classe de
modalités.
Pour une variable aléatoire atomique on distiguera les tableaux d’effectifs, d’effectifs cumulés
croissants ou décroissants, de fréquences, de fréquences cumulées croissantes ou décroissantes.
L’effectif marginal d’une classe est le nombre d’occurences de celle-ci dans l’échantillon tandis que
l’effectif total est la taille de l’échantillon. La fréquence (ùarfinale) d’une classe est le rapport de
son effectif (marginal) par l’effectif total. Trivialement la fréquence totale vaut 1. Les fréquences

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


15 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
peuvent être exprimées en pourcentage ou non selon les préférences d’usage. Dans le cas des
variables aléatoires discrètes, le tableau des fréquences donne un premier aperçu de la distribution
de probabilité. On définit le mode ou la classe modale comme la modalité ou la classe de modalités
qui a le plus grand effectif, et de manière équivalente la plus grande fréquence. Dans le cas de
variables numériques discrètes, on peut calculer ou tout au moins estimer les moments, grâce au
tableau de fréquences. On a le tableau récapitulatif suivant :

Modalités [x1 ] [x2 ] ··· [xm ] Total


n= m
P
Effectifs n1 n2 ··· nm j=1 nj
Pm
Fréquences f1 = nn1 f2 = nn2 ··· fm = nnm 1 = j=1 fj

La représentation des tableaux nécessite le choix d’un ordre d’apparition des classes. Les ta-
bleaux des effectifs cumulés croissants et décroissants (respectivement des fréquences cumulées
croissantes et décroissantes) est un cumul progressif dans l’ordre croissant ou décroissant des ef-
fectifs (respectivement fréquences). Le tableau de fréquences cumulées croissantes donne un idée
vague de la fonction de répartition qui est particulièrement utile dans le cas réel continu. Le ta-
bleau de fréquences cumulées décroissantes quant à lui fait référence à la fonction de survie. Les
tableaux de fréquences cumulées permettent également de déduire les quantiles. On a le tableau
récapitulatif suivant :

Modalités [x1 ] [x2 ] ··· [xm−1 ] [xm ] Total


Effectifs Pm−2 Pm−1
cumulés n1 n1 + n2 ··· j=1 nj + nm−1 j=1 nj + nm n
croissants
Effectifs Pm Pm
cumulés n1 + j=2 nj n2 + j=3 nj ··· nm−1 + nm nm n
décroissants
Fréquences Pm−2 Pm−1
cumulées f1 f1 + f2 ··· j=1 fj + fm−1 j=1 nj + nm 1
croissantes
Fréquences Pm Pm
cumulées f1 + j=2 fj f2 + j=3 fj ··· fm−1 + fm fm 1
décroissantes

Exemple 1.5.1 1. D’une étude sur les teints on obtient la série statistique : noir, noir, noir,
albinos, noir, brun, brun, albinos, noir, brun, brun, brun, noir. Dresser un tableau contenant
les fréquences et effectifs marginaux, puis les fréquences et effectifs cumulés croissants et
décroissants. Quelle est la classe modale ?
2. D’une étude sur le jeu de lancé de dé à six faces on obtient les résultats suivants :

1, 2, 6, 4, 2, 1, 1, 2, 3, 3, 3, 4, 6, 6, 6, 6, 6, 4.

(a) Quel est le mode de cette série ? Quelle est la médiane ? Quelles sont la moyenne et la
variance de cette série ?
(b) On décide d’étudier la parité des réalisations. Combien de classe a-t-on désormais ?
Quelles est la probabilité d’obtenir un résultat impair ?

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


16 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
3. D’une étude sur les âges on obtient les données :

21, 21, 23, 25, 28, 28, 27, 29, 30, 33, 32, 32, 34, 28, 27, 24, 24, 25, 19, 30, 25.

Quelle est le mode de cette série ? Quelle est la probabilité d’avoir un âge compris entre
20 et 31 ? Quelle est la probabilité d’avoir un âge inférieur ou égal à 31 ? Quelle est la
probabilité d’avoir un âge supérieur ou égal à 31 ?

Les tableaux croisés sont utilisés pour représenter les effectifs ou les fréquences pour des va-
riables non-atomiques. Ils sont pratiques pour avoir une vue globale de la distribution et des
éventuelles relations. Toutefois, l’utilisation des tableaux croisés est plus pratique et aisée en di-
mension 2 ou au plus 3. En dimension 2, on a le tableau d’effectifs suivant :

Modalités [x1 ] [x2 ] ··· [xm ] Total


[y1 ] n11 n12 ··· n1m n1·
[y2 ] n21 n22 ··· n2m n2·
.. .. .. .. .. ..
. . . . . .
[yp ] np1 np2 ··· npm np·
Total n·1 n·2 ··· n·m n

Avec Xp Xm
n·j = nij , ni· = nij et
i=1 j=1

Xm Xp
n= nij
j=1 i=1
Xp
= ni·
i=1
Xm
= n·j
j=1

En dimension 2, on a le tableau de fréquences suivant :

Modalités [x1 ] [x2 ] ··· [xm ] Total


[y1 ] f11 f12 ··· f1m f1·
[y2 ] f21 f22 ··· f2m f2·
.. .. .. .. .. ..
. . . . . .
[yp ] fp1 fp2 ··· fpm fp·
Total f·1 f·2 f·m 1

Avec
nij Xp Xm
fij = , f·j = fij , fi· = fij
n i=1 j=1

et
Xm Xp
n= fij
j=1 i=1
Xp
= fi·
i=1
Xm
= f·j
j=1

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


17 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
Exemple 1.5.2 D’une enquête sur le sexe et l’âge on obtient la série de données :

(19, F ), (19, F ), (25, M ), (20, M ), (27, F ), (28, F ), (18, M ), (20, F )


, (29, M ), (28, M ), (31, F ), (32, F ), (31, F ), (30, M ), (26, F ), (25, M ).

1. Dresser les tableaux croisés des effectifs et des fréquences. Quel est le mode de cette série ?
2. Dresser les tableaux marginaux des effectifs et des fréquences. Quelle est la probabilité d’être
de sexe féminin ? Quelle est la médiane pour l’âge ?

1.5.2 Les diagrammes


Les diagrammes constituent une représentations graphiques des tableaux. Ils permettent lorsque
leur réprésentation est possible de visualiser certains détails qui pouraient passer inaperçus dans
les tableaux. On distingue entre autres le diagramme circulaire, le diagramme radar, le diagramme
à bandes, le diagramme à bâtons, l’histogramme et la boı̂te à moustache.
— Le diagramme circulaire
Le diagramme circulaire est un disque subdivisé en secteurs dont les aires sont proportionnelles
aux effectifs (et de manière équivalente aux fréquences) des classes auxquelles ils correspondent. Le
rayon du disque est choisi selon des critères supplémentaires. Pour une classe i, avec une fréquence
fi = nni , on a la relation de proportionnalité

α (i) = 2πfi .

α (i) désigne la mesure en radian de l’angle du secteur correspondant à la classe i.

Exemple 1.5.3 1. D’une étude sur les teints on obtient la série statistique : noir, noir, noir,
albinos, noir, brun, brun, albinos, noir, brun, brun, brun, noir. Construire le diagramme
circulaire correspondant.
2. D’une étude sur le jeu de lancé de dé à six faces on obtient les résultats suivants :

1, 2, 6, 4, 2, 1, 1, 2, 3, 3, 3, 4, 6, 6, 6, 6, 6, 4.

Construire le diagramme circulaire correspondant.


3. D’une étude sur les âges on obtient les données :

21, 21, 23, 25, 28, 28, 27, 29, 30, 33, 32, 32, 34, 28, 27, 24, 24, 25, 19, 30, 25.

On considère les classes [20, 23], ]23, 24[, [24, 31], ]31, 34]. Construire le diagramme circu-
laire correspondant.

— Le diagramme polaire (ou Kiviat, ou radar, ou en toı̂le d’araı̂gnée)


Le diagramme polaire est tout comme son nom l’indique une représentation polaire des moda-
lités et de leurs effectifs (ou fréquences). L’angle correspondant à une modalité est proportionnelle
à son ordre retranché d’un. Le rayon quant à lui est proportionnelle à l’effectif ou la fréquence.
Pour une classe i (i ≥ 1), avec une fréquence fi = nni , on a les relations de proportionnalité

α (i) = 2π (i − 1) fi et r (i) = Rfi

α (i) et r (i) désignent respectivement la mesure en radian de l’angle et le rayon correspondant à


la classe i. La valeur R est un coefficient de proportionnalité.

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


18 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
Exemple 1.5.4 1. D’une étude sur les teints on obtient la série statistique : noir, noir, noir,
albinos, noir, brun, brun, albinos, noir, brun, brun, brun, noir. Construire le diagramme
kiviat correspondant.
2. D’une étude sur le jeu de lancé de dé à six faces on obtient les résultats suivants :

1, 2, 6, 4, 2, 1, 1, 2, 3, 3, 3, 4, 6, 6, 6, 6, 6, 4.

Construire le diagramme radar correspondant.


3. D’une étude sur les âges on obtient les données :

21, 21, 23, 25, 28, 28, 27, 29, 30, 33, 32, 32, 34, 28, 27, 24, 24, 25, 19, 30, 25.

On considère les classes [20, 23], ]23, 24[, [24, 31], ]31, 34]. Construire le diagramme polaire
correspondant.

— L’histogramme
Les histogrammes se construisent pour représenter des données numériques atomiques re-
groupées en des classes sous forme d’intervalle. L’histogramme consiste en un ensemble de
rectangles représentés dans un repère. La base de chaque rectangle correspond à l’étendu
d’une classe et sa hauteur est choisie de sorte que l’aire soit proportionnelle à l’effectif
(ou de manière équivalente la fréquence) de ladite classe. Précisément pour une classe i
de la forme [a, b] ou [a, b[ ou ]a, b[ ou ]a, b], avec une fréquence fi = nni on la relation de
proportionnalité
base (i) × hauteur (i) = A (i) = k × fi .
k×fi
Dans la formule ci-avant base (i) = b − a et hauteur (i) = base(i) . k est un coefficient de
proportionnalité choisi selon des critères supplémentaires, mais qu’on pourra prendre par
défaut égal à 100.

Exemple 1.5.5 D’une étude sur les âges on obtient les données :

21, 21, 23, 25, 28, 28, 27, 29, 30, 33, 32, 32, 34, 28, 27, 24, 24, 25, 19, 30, 25.

On considère les classes [20, 23], ]23, 24[, [24, 31], ]31, 34]. Construire l’histogramme associée à
cette série.

— Le diagramme à bâtons
Le diagramme à bâtons est similaire à l’histogramme, mais il est utilisé pour les variables
discrètes aussi bien qualitatives que quatitatives. À la place des rectangles on a des tiges
dont les hauteurs sont proportionnelles à l’effectif (ou de manière équivalente la fréquence)
des modalités correspondantes. Pour une classe i, avec une fréquence fi = nni on la relation
de proportionnalité
hauteur (i) = k × fi .
k est un coefficient de proportionnalité choisi selon des critères supplémentaires, mais qu’on
pourra prendre par défaut égal à un.

Exemple 1.5.6 1. D’une étude sur les teints on obtient la série statistique : noir, noir, noir,
albinos, noir, brun, brun, albinos, noir, brun, brun, brun, noir. Construire le diagramme à
bâtons correspondant.

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


19 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
2. D’une étude sur le jeu de lancé de dé à six faces on obtient les résultats suivants :

1, 2, 6, 4, 2, 1, 1, 2, 3, 3, 3, 4, 6, 6, 6, 6, 6, 4.

Construire le diagramme à bâtons correspondant.

— Le diagramme à bandes
Le diagramme à bandes est similaire à l’histogramme, mais il est utilisé pour les variables
regroupées en classes discrètes. Il est en particulier employé pour les variables qualitatives.
Les bandes sont des rectangles dont les hauteurs sont proportionnelles à l’effectif (ou de
manière équivalente la fréquence) des modalités correspondantes. Le choix de longueur de
la base est plus flexible. Il peut correspondre à l’étendu d’une classe intervalle dans le cas
numérique ou avoir une longueur arbitraire fixée pour les variables qualitatives. Pour une
classe i, avec une fréquence fi = nni on la relation de proportionnalité

hauteur (i) = k × fi .

k est un coefficient de proportionnalité choisi selon des critères supplémentaires, mais qu’on
pourra prendre par défaut égal à un.

Exemple 1.5.7 1. D’une étude sur les teints on obtient la série statistique : noir, noir, noir,
albinos, noir, brun, brun, albinos, noir, brun, brun, brun, noir. Construire le diagramme à
bandes correspondant.
2. D’une étude sur les âges on obtient les données :

21, 21, 23, 25, 28, 28, 27, 29, 30, 33, 32, 32, 34, 28, 27, 24, 24, 25, 19, 30, 25.

On considère les classes [20, 23], ]23, 24[, [24, 31], ]31, 34]. Construire le diagramme à bandes
correspondant.

— La boı̂te à moustache
La boı̂te à moutache permet de représenter les principales caratéristiques de l’échantillon
d’une variable aléatoire numérique atomique dans un repère. Elle est sous forme d’intervalle
et fait apparaı̂tre le minimum, le maximum, la moyenne et les autres quartiles de la série.
Remarquons que le maximum est le quatrième quartile.

Exemple 1.5.8 D’une étude sur les âges on obtient les données :

21, 21, 23, 25, 28, 28, 27, 29, 30, 33, 32, 32, 34, 28, 27, 24, 24, 25, 19, 30, 25.

Construire la boı̂te à moustache associée à cette série.

1.5.3 Les graphes


Les graphes sont des représentations fonctionnelles qui comme les diagrammes complètent les
tableaux. Toutefois, ils sont plus utilisés pour les variables aléatoires numériques et continues.
On distingue les polygônes d’effectifs et de fréquences éventuelement cumulés et les nuages de
points. Les polygones des fréquences marginales et des fréquences cumulées croissantes donnent
une approximation graphique des courbes de densité et de fonction de répartition. Il existent des

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


20 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
tests (paramétriques ou non) qui permettent de décider de l’identification ou non de la loi mère
de l’échantillon avec une loi candidate. D’autres techniques d’estimation (paramétrique ou non)
permettent d’approcher directement la loi mère inconnue de l’échantillon. Le nuage de points
quant à lui permet d’identifier une éventuelle relation fonctionnelle dont les points font partie du
graphe. Cela nécessite parfois une bonne culture des courbes représentatives des fonctions et des
éventuelles transformations. Le nuage de points est très utilisé pour les problème de regression
simple ; c’est une représentation graphique du tableau croisé.

Exemple 1.5.9 D’une étude sur les âges on obtient les données :

21, 21, 23, 25, 28, 28, 27, 29, 30, 33, 32, 32, 34, 28, 27, 24, 24, 25, 19, 30, 25.

1. Représenter sur un graphe le nuage de points et le polygone d’effectifs marginaux.


2. Représenter sur un graphe le nuage de points et le polygone des fréquences marginales.
3. Retrouver sur les deux graphes précédents le mode.
4. Représenter sur le même graphe les polygones d’effectifs cumulés croissants et décroissants.
5. Représenter sur le même graphe les polygones d’e fréquences cumulées croissantes et
décroissantes.
6. Retrouver sur les deux graphes précédents la médiane et les autres quartiles.

Exemple 1.5.10 D’une étude on obtient la série de couples

(−1, 2), (3, 11), (−2, 5), (2, 5), (−0.5, 1.25), (0, 1).

Représenter le nuage de points correspondant. Quelle est la relation fonctionnelle décrit ce nuage ?

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


Chapitre 2

Estimation paramétrique

Dans ce chapitre on suppose qu’on dispose d’une réalisation d’un n−échantillon dont on connaı̂t
une famille paramétrique à laquelle appartient la loi mère. La plupart des lois de probabilité
abordées ci-avant sont définies selon un paramètre vectoriel θ. Le problème est l’estimation du
paramètre θ correspondant au n−échantillon considéré.

Definition 2.0.1 Soit une famille kparamétrique de lois admettant des fonctions de densité (resp.
de probabilité) f (., θ) ; θ ∈ Θ ⊆ R . On dit qu’elle appartient à la classe exponentielle des lois
si X k 
f (x, θ) = a0 (θ) b0 (x) exp ai (θ) bi (x)
i=1

La classe exponentielle des lois est assez large. Elle contient les lois uniforme, Bernoulli, Bino-
miale, Binomiale négative, Poisson, exponentielle, gamma, normale, Pareto, Beta, ...

Exemple 2.0.11 Lorsque p ∈ ]0, 1[, la loi de Bernoulli B (p) peut s’écrire de façon compacte sous
la forme

f (x, p) = (1 − p)1|{x=0} p1|{x=1}


1|{x=0}
ln (1 − p) +1|{x=1} ln (p)

= exp

Definition 2.0.2 Soit f (., θ), une loi. On appelle support de f (., θ) l’ensemble des valeurs x pour
lesquelles f (x, θ) > 0.

2.1 Généralités sur les estimateurs


Un estimateur θ, b du paramètre θ est une statistique sensée donner une valeur approchée de θ
à partir d’un échantillon.

Definition 2.1.1 On appelle biais d’un estimateur θ,


b l’espérance mathématique
h i h i
E θb − θ = b θb

Si le biais est nul, l’estimateur est dit sans biais, sinon il est biaisé.

21
22 CHAPITRE 2. ESTIMATION PARAMÉTRIQUE
Exemple 2.1.1 On montre que la variance empirique
1 Xn 2
Se2 = Xk − X n
n k=1
2
2
= X n − Xn
est un estimateur biaisé de la variance. Par contre la variance de l’échantillon
1 Xn 2
S22 = Xk − X n
n − 1  k=1
n 2
2 
= X n − Xn
n−1
est estimateur sans biais. X n désigne ici la moyenne arithmétique ou moyenne empirique ou
moyenne de l’échantillon qui est elle-même un estimateur sans biais de la moyenne E [X]. Natu-
rellement, X 2 n désigne la moyenne arithmétique des carrés qui est un estimateur sans biais de la
moyenne quadratique E [X 2 ]. On définit également les moments empiriques simples et le moments
empiriques centrés d’ordre k par les formules respectives
1 Xn 0 1 Xn k
Mk = Xik et Mk = Xi − X .
n i=1 n i=1

Definition 2.1.2 On appelle erreur quadratique moyenne d’un estimateur θ, b l’espérance mathématique
 2  h i h i h i
E θb − θ = b2 θb + V ar θb = eqm θb
h i h i
On dit qu’un estimateur θb1 domine un autre estimateur θb2 , si eqm θb1 ≤ eqm θb2 pour tout
θ ∈ Θ. La
h dominance
i h définit
i une relation d’ordre partiel que nous considérons dans la suite (θb1 ≥ θb2
ssi eqm θb1 ≤ eqm θb2 ).

Definition 2.1.3 Soit θb∗ un estimateur.


1. On dit que θb∗ est admissible s’il est maximal (c’est à dire qu’il n’existe aucun estimateur
qui le domine).
n h io n h io
b sup eqm θb∗ ≤ sup eqm θb .
2. On dit que θb∗ est minimax si pour tout estimateur θ,
θ∈Θ θ∈Θ

Pour la suite on note θbn un estimateurdu paramètre θ pour un n−échantillon. Le résultat


suivant concerne la convergence de la suite θbn vers θ.

Proposition 2.1.1 Soit une variable aléatoire X suivant la loi mère d’une suite de variables
aléatoires iid. Si E X k existe, alors tous les moments empiriques simples (resp. centrés) d’ordre
inférieur ou égal à k sont des estimateurs convergeant presque sûrement vers les moments simples
(resp. centrés) correspondant à ladite loi.

On dit qu’un estimateur θbn est une statistique exhaustive pour θ ∈ Θ, si la loi conditionnelle
de l’échantillon sachant θbn ne dépend pas de θ. θbn est exhautive minimale si elle est exhaustive
  et
si, pour toute statistique exhaustive 2 θn , on peut trouver une fonction v telle que θn = v 2 θn .
b b b
On rappelle à toute fin utile la loi de Bayes suivante :
P (A) P (B|A) = P (A ∩ B) = P (B) P (A|B)

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


23 CHAPITRE 2. ESTIMATION PARAMÉTRIQUE
Proposition 2.1.2 Soit une loi mère appartenant à une famille paramétrique de la classe expo-
nentielle, avec un paramètre de dimension k. Alors, dans les notations de la définition 2.0.1, la
statistique de dimension k :
X n Xn Xn 
b1 (Xi ) , b2 (Xi ) , · · · , bk (Xi )
i=1 i=1 i=1

est exhautive minimale pour le paramètre inconnu.


On pourra juger la qualité d’un estimateur à travers plusieurs critères ; notamment son biais, sa
variance, son erreur quadratique moyenne et son exhaustivité. C’est ainsi qu’on parlera d’estima-
teur UMVUE (Uniformly minimum variance unbiased estimator). On démontre que si la famille
de la lois mères appartient à la classe exponentielle
Xn avec paramètre
Xn unidimensionnel,
Xn et s’il
 existe
un estimateur sans biais θbn , fonction de b1 (Xi ) , b2 (Xi ) , · · · , bk (Xi ) , alors
i=1 i=1 i=1
celui-ci est unique et est UMVUE. Sous certaines conditions de régularité pour la famille de la
lois mères et de l’estimateur sans biais considéré, on montre que la variance (ici égale à l’erreur
quadratique moyenne) admet une borne inférieure appelée borne de Cramer-Rao.
Théorème 2.1.1 (Inégalité de Cramer-Rao ou de Fréchet)
Soit θbn un estimateur sans biais pour un paramètre
h i θ unidimensionnel. Sous certaines condi-
1
tions de régularité on a pour tout θ ∈ Θ, V ar θn ≥ nI(θ)
b . I (θ) est l’information de Fisher et
h i

 2
vaut E ∂θ ln (f (X, θ)) .

L’estimateur θbn est dit efficace pour θ ∈ Θ, si la borne de Cramer-Rao est atteinte. Cela ne
peut être le cas que si la famille de lois considérée est dans la classe exponentielle. Dans le cas
continu, les conditions de régularité évoquées dans le théorème précédent sont :
1. I (θ) existe pour tout θ ∈ Θ.
2. ∀i ∈ [1, n] ∩ N, le support de fi (., θ) est indépendant de θ.
Z Z Z Z
∂ ∂
3. ∂θ · · · f (x1 , x2 , · · · , xn , θ) dx1 dx2 · · · dxn = · · · ∂θ f (x1 , x2 , · · · , xn , θ) dx1 dx2 · · · dxn ,
où f désigne la densité conjointe.
4.
Z Z
∂ hb i ∂
E θn = · · · θbn f (x1 , x2 , · · · , xn , θ) dx1 dx2 · · · dxn
∂θ ∂θ
Z Z

= · · · θbn f (x1 , x2 , · · · , xn , θ) dx1 dx2 · · · dxn
∂θ
Dans le cas discret, on remplace les intégrales par des sommes. Les conditions de régularité
sont regroupées en la propriété ”Best Asymptotically Normal” (BAN).
Exercice 2.1.1 On considère un n-échantillon ((X1 , Y1 ) , · · · (Xn , Yn )) dont la loi mère est suivie
par le couple de variable variable (X, Y ). On considère les estimateurs de Cov [X, Y ] suivants :
Xn  Xn 
1 1
i) Θ1 = n
b (Xi − E[X]) (Yi − E[Y ]) ii) Θ2 = n
b Xi Yi − E[X]E[Y ]
Xi=1
n  Xi=1 n 
b3 = 1
iii) Θ (X i − E[X]) Y i iv) Θb 4 = 1
X i i − E[X]Y n
Y
n
Xi=1
n  n Xi=1
n 
1 1
 
v) Θ5 = n
b X i − X n Yi − Y n vi) Θ6 = n
b X i Yi − X n Y n
Xi=1
n Xi=1 n
b7 = 1 b8 = 1
 
vii) Θ n
X i − X n Y i viii) Θ n−1
X i − X n Yi
i=1 i=1
X n  X n 
b9 = 1 b 10 = 1 n
 
ix) Θ n−1
Xi − X n Yi − Y n x) Θ n−1
Xi Yi − n−1 X nY n
i=1 i=1

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


24 CHAPITRE 2. ESTIMATION PARAMÉTRIQUE
b 1 6= Θ
Vérifier que Θ b 2, Θ
b3 = Θ
b 4, Θ
b5 = Θ
b6 = Θ b 7 et Θb8 = Θ b9 = Θ b 10 . Déterminer le biais de
chacun de ces estimateurs. Classer les par qualité et utilité décroissante.

Exercice 2.1.2 Soit X N (m, σ).


1. En supposant σ connu, calculer la borne de Cramer-Rao pour l’estimation de la moyenne.
Montrer que l’estimateur de la moyenne empirique est efficace.
2. En supposant m connu, calculer la borne de Cramer-Rao pour l’estimation de la variance.
Montrer que l’estimateur de la variance de l’échantillon est efficace.

Il existe plusieurs méthodes de détermination d’estimateurs. Entre autres on a, la méthode des


moments 1 et celle du maximum de vraisemblance. Nous nous attardons sur la seconde méthode.

2.2 Estimation par la méthode du maximum de vraisem-


blance
Cette méthode présente les avantages d’être efficace asymptotiquement, et facile à mettre en
oeuvre.

Definition 2.2.1 Soit (X1 , X2 , · · · , Xn ) un n-échantillon


 dont la loi mère appartient à une famille
paramétrique de densités (resp. de probabilités) f (., θ) ; θ ∈ Θ ⊆ Rk . On appelle fonction de
vraisemblance de θ pour une réalisation donnée (x1 , x2 , · · · , xn ) de l’échantillon, la fonction
Yn
f (x1 , x2 , · · · , xn , θ) = fk (xk , θ) ≡ Ln (θ)
k=1
   
Un estimateur θ1 est dit plus vraisemblable qu’un autre θ2 si Ln θ1 ≥ Ln θb2 .
b b b

Definition 2.2.2 On appelle estimation du maximum de vraisemblance toute valeur

θbnM V = θbnM V (x1 , x2 , · · · , xn )


 
, s’il existe, vérifiant Ln θbnM V = supL (θ). La statistique θbnM V = θbnM V (X1 , X2 , · · · , Xn ) est appelé
θ∈Θ
estimateur de maximum de vraisemblance (EMV).

Dans la pratique, vu les propriétés de la fonction logarithme (bijection croissante), on essaie


de maximixer le log-vraisemblance donné par ln ◦Ln .

Proposition 2.2.1 Soit l’échantillon (X1 , X2 , · · · , Xn ) dont la densité de la loi mère vérifie cer-
taines conditions de régularité
 qui garantissent
 notamment
 pour tout entier naturel n, l’existence
L 1
d’un EMV θbnM V . Alors θbnM V − θ → N 0, nI(θ) .

Exercice 2.2.1 Trouver des estimateurs de la moyenne et de la variance pour une loi normale
par la méthode du maximum de vraisemblance.
1. Voir [6].

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


25 CHAPITRE 2. ESTIMATION PARAMÉTRIQUE
2.3 Intervalle de confiance
L’objectif de cette section est de déterminer un intervalle dans lequel on espère que la valeur
du paramètre estimé est contenue ; ceci avec une certaine probabilité. Le paramètre considéré
ici est donc unidimensionnel. Dans le cas multidimensionnel, on parlera de region de confiance.
Cependant nous n’aborderons pas cette éventualité.

Definition 2.3.1 Soit (X1 , X2 , · · · , Xn ) un échantillon de loi mère f (., θ), où θ ∈ Θ est le pa-
ramètre inconnu de dimension 1. On appelle procédure d’intervalle de confiance de niveau γ ∈
[0, 1], tout couple de statistiques (T1 , T2 ) tel que, quel que soit θ ∈ Θ, on ait P (T1 ≤ θ ≤ T2 ) ≥ γ.
Pour toute réalisation (t1 , t2 ) du couple (T1 , T2 ), l’intervalle [t1 , t2 ] est appelé intervalle de confiance
de niveau γ. La valeur α = 1 − γ est appelée risque de première espèce. On note ICγ (θ) = [t1 , t2 ].

Definition 2.3.2 Une fonction g (X1 , X2 , · · · , Xn , θ) est appelée fonction pivot si :


1. La loi de g (X1 , X2 , · · · , Xn , θ) est connue et ne dépend pas de θ,
2. Pour tous réels u1 et u2 tels que u1 ≤ u2 et tout (x1 , x2 , · · · , xn ) ∈ Rn , la double inégalité
u1 ≤ g (x1 , x2 , · · · , xn , θ) ≤ u2 peut se résoudre (ou pivoter) en θ selon t1 (x1 , x2 , · · · , xn ) ≤
θ ≤ t2 (x1 , x2 , · · · , xn ).

Le diamètre d’un intervalle de confiance est appelé précision. La précision croı̂t en général avec
la taille de l’échantillon. Dans la pratique on se ramène souvent à la loi normale centrée réduite
grâce au théorème de la limite centrale et on choisit un intervalle de confiance en utilisant les
quantiles. Cet intervalle est couramment de l’un des deux types suivant :
- Bilatéral : Ies intervalles de ce type sont le plus souvent de la forme [t1 , t2 ], avec t1 et t2
finis et satisfaisant
α
P (θ ≤ t1 ) = P (θ ≥ t2 ) = (2.1)
2
- Unilatéral : Ies intervalles de ce type sont le plus souvent de la forme [t1 , t2 ], avec t1 , t2 ∈
R ∪ {−∞, +∞} et satisfaisant

P (θ ≤ t1 ) = α et P (θ ≥ t2 ) = 0 (2.2)

ou
P (θ ≤ t1 ) = 0 et P (θ ≥ t2 ) = α (2.3)
Dans cette section, nous nous restreindrons au intervalles de confiance bilatéraux. Toutefois,
nous présenterons les intervalles unilatéraux dans le chapitre reservé aux tests.

Exemple 2.3.1 (Intervalle de confiance bilatéral pour la moyenne d’une loi de normale où l’écart-
type est connu)
Nous savons que X−m √
σ/ n
N (0, 1). Supposons que la variance σ 2 est connue et déterminons un
intervalle de confiance à γ = 95% (ou avec un risque de première espèce valant α = 5%) de la
moyenne. Soit Z N (0, 1). Déterminons z1− α2 , le quantile d’ordre 1 − α2 = 1 − 0.025 = 0, 975.
En utilisant la symétrie de la loi normale on a
 
P |Z| ≤ z1− α2 = γ = 0, 95 ⇔ z1− α2 = 1, 96
   
X −m σ σ
−z1− α2 ≤ √ ≤ z1− α2 ⇔ X − √ z1− α2 ≤ m ≤ X + √ z1− α2
σ/ n n n

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


26 CHAPITRE 2. ESTIMATION PARAMÉTRIQUE
h i
D’où ICγ (m) = X − √σ z1− α , X + √σ z1− α , et sa précision est i = √2σ
z α . Pour atteindre une
n 2 n 2 n 1− 2
2
précision d’ordre ε, on résoud i ≤ ε et on obtient que n ≥ 2σ z α .
ε 1− 2

Exemple 2.3.2 (Intervalle de confiance bilatéral pour la moyenne d’une loi de normale où l’écart-
type est inconnu) 
On suppose que Z t (n − 1) et P |Z| ≤ z1− α2 = γ.
— Si la moyenne m est connue, on utilise le fait que la statistique
√ 
n X −m
t (n)
S1
h i
pour obtenir ICγ (m) = X − √S1n z1− α2 , X + √S1n z1− α2 .
— Si la moyenne m est inconnue, on utilise le fait que la statistique
√ 
n X −m
t (n − 1)
S2
h i
pour obtenir ICγ (m) = X − √S2n z1− α2 , X + √S2n z1− α2 .

Exemple 2.3.3 (Intervalle de confiance bilatéral pour la variance d’une loi de normale où l’écart-
type est inconnu)
On suppose que Z χ2 (n − 1), P (Z < z1 ) = α2 et P (Z > z2 ) = α2 .
n 2
— Si la moyenneh m est iconnue, on utilise le fait que la statistique σ2 S1 χ2 (n) pour obtenir
nS12 nS12
ICγ (σ 2 ) = z2
, z1 .
n−1 2
— Si la moyenne m esth inconnue, on utilise
i le fait que la statistique σ2
S2 χ2 (n − 1) pour
2 (n−1)S22 (n−1)S22
obtenir ICγ (σ ) = z2
, z1 .

Exemple 2.3.4 (Intervalle de confiance bilatéral pour le rapport de deux variances de deux échantillons
de tailles n1 et n2 , de loi de mères normales N (m1 , σ12 ) et N (m2 , σ22 ), où les écarts-type sont tous
inconnus)
On suppose que Z F (n1 , n2 ), P (Z < z1 ) = α2 et P (Z > z2 ) = α2 . Si on pose fα/2 (n1 , n2 ) le
quantile d’ordre 1− α2 pour F (n1 , n2 ) alors fα/2 (n2 , n1 ) est le quantile d’ordre 1− α2 pour F (n1 , n2 )
et on a :
z2 = fα/2 (n1 , n2 ) et z1 = 1/fα/2 (n2 , n1 ) .
n1 2 n2 2
— Si les moyennes m1 et m2 sont toutes connues alors S
σ12 11
χ2 (n1 ) et S
σ22 12
χ2 (n2 ).
2 σ2
S11
Il suit que 2
2 σ2
S12
F (n1 , n2 ) et
1

σ22 2 2
   
S12 S12
ICγ = z1 2 , z2 2 .
σ12 S11 S11
n1 2 n2 2
— Si les moyennes m1 et m2 sont toutes inconnues alors S
σ12 21
χ2 (n1 − 1) et S
σ22 22
2 σ2
S21
χ2 (n2 − 1). Il suit que 2
2 σ2
S22
F (n1 − 1, n2 − 1) et
1
 2  2 2

σ2 S22 S22
ICγ = z1 2 , z2 2 ,
σ12 S21 S21
avec
z2 = fα/2 (n1 − 1, n2 − 1) et z1 = 1/fα/2 (n2 − 1, n1 − 1) .

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


27 CHAPITRE 2. ESTIMATION PARAMÉTRIQUE
n1 2 n2 −1 2
— Si m1 est connue et m2 est inconnue alors S
σ12 11
χ2 (n1 ) et σ22
S22 χ2 (n2 − 1). Il
2 σ2
S11
suit que 2
2 σ2
S22
F (n1 , n2 − 1) et
1

σ22 2 2
   
S22 S22
ICγ = z1 2 , z2 2 ,
σ12 S11 S11
avec
z2 = fα/2 (n1 , n2 − 1) et z1 = 1/fα/2 (n2 − 1, n1 ) .

Exercice 2.3.1 Soient deux échantillons de tailles respectives n1 et n2 , de loi de mères normales
N (m1 , σ12 ) et N (m2 , σ22 ).
 
σ2 σ2
1. Montrer que la statistique X1 − X2 N m1 − m2 , n11 + n22 .
2. On suppose que σ1 et σ2 sont connus.
(a) Quelle est la loi à utiliser pour determiner ICγ (m1 − m2 ) ?
 q 2 
σ σ22
(b) Montrer que dans le cas bilatéral, ICγ (m1 − m2 ) = X1 − X2 ∓ z1− 2 n11 +
α
n2
.

3. On suppose que les moyennes m1 et m2 sont toutes connues, mais que σ1 et σ2 sont incon-
nus.

n1 2 n2 2 ((Xr1 −X2 )−(m1 −m2 )) n1 +n2
(a) Quelles lois suivent les statistiques S
σ12 11
+ S
σ22 12
et 2
σ1 σ2
r ?
n1 2 n2 2
n1
+ n2 2 S11 + σ 2 S12
2 σ1 2

(b) Montrer que si σ1 = σ2 alors dans le cas bilatéral,


 s 
2 2
S11 S12
ICγ (m1 − m2 ) = X1 − X2 ∓ z1− α2 +  .
n2 n1

4. On suppose que m1 , m2 , σ1 et σ2 sont inconnus.



n1 2 n2 −1 2 ((r
X1 −X2 )−(m1 −m2 )) n1 +n2 −2
(a) Quelles lois suivent les statistiques S
σ12 21
+ σ22
S22 et 2
σ1 σ2
r ?
n1 −1 2 n2 −1 2
n1
+ n2 2 S21 + σ 2 S22
2 σ1 2

(b) Montrer que si σ1 = σ2 alors dans le cas bilatéral,


 r 
n1 + n2
q
2 2
ICγ (m1 − m2 ) = X1 − X2 ∓ z1− α2 (n1 − 1) S21 + (n2 − 1) S22 .
n1 n2 (n1 + n2 − 2)

(c) On suppose que la moyenne m1 est connue mais m2 et σ1 = σ2 sont inconnus. Comment
calculer ICγ (m1 − m2 ) ?
5. Quels sont les cas où ICγ (m1 − m2 ) est effectivement calculable ?

La méthode utilisée dans les exemples précédents se généralisent à tout les estimateurs dont on
connait la loi. Il existe toutefois, une méthode simpliste et valide pour déterminer des intervalles
de confiance indépendamment de la loi considérée. Elle se base sur le résultat suivant :

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


28 CHAPITRE 2. ESTIMATION PARAMÉTRIQUE
Proposition 2.3.1 (Inégalité de Tchebichev)
Soient X une variable aléatoire réelle, x, ε ∈ R et n ∈ N. Alors, |ε|n P (|X − x| > |ε|) ≤
E [|X − x|n ]. En particulier, ε2 P (|X − E [X]| > |ε|) ≤ V ar [X].
h i
σ σ
L’intervalle de confiance θb − √θαb , θb + √θαb d’un paramètre θ dont l’estimateur sans biais θb est de
variance est σθ2b est de niveau 1−α. L’inconvénient de cette méthode réside d’une part en la difficulté
de connaı̂tre σθb. D’autre part, la longueur de l’intervalle n’est pas nécessairement minimale par
rapport aux intervalles donnés par les autres méthodes. Dans le cas particulier
h de l’estimation
i de
σ σ
la moyenne d’un n−échantillon, on obtient l’intervalle de confiance X − √nα , X + √nα . Pour
X X

des raisons de calcul pratique, on remplace σX par un estimateur.

Exercice 2.3.2 Dans une ville on donne la répartition du nombre de jours sans accident, avec
un accident, etc. Parmi 50 jours d’observation au cours d’une même année :

Nombre d’accidents 0 1 2 3 4
Nombres de jours 21 18 7 3 1

On suppose que le nombre d’accidents par jour suit une loi de Poisson. Donner un intervalle
de confiance de niveau 0.95 pour le nombre moyen d’accident par jour.

Exercice 2.3.3 On veut estimer le rendement d’un engrais pour la culture du blé. Sur douze
parcelles expérimentales, on a trouvé les rendements suivants en tonnes par hectare :

7.7 8.4 7.8 8.2 7.9 8.5 8.4 8.2 7.6 7.8 8.4 8.3

Donner un intervalle de confiance à 95% pour le rendement moyen de l’engrais en supposant


que ces quantités suivent une loi lognormale.

Les intervalles de confiance interviennent également dans les tests statistiques. Il s’agit entre
autre des tests d’égalité ou de comparaison.

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


Chapitre 3

Tests d’hypothèses

Les tests statistiques ont pour objet de décider de la véracité d’un fait (appelé hypothèse) en se
basant sur un échantillon. L’hypothèse à vérifier est appelée hypothèse nulle (H0 ) et son contraire
est l’hypothèse alternative ou de recherche (H1 ).

3.1 Tests d’hypothèses paramétriques


Dans le cadre paramétrique, les tests correspondent à des considérations sur des paramètres de
lois mères d’échantillons. Le test sur un paramètre θ consistera de manière générale à vérifier son
appartenance à un sous-ensemble de paramètres Θ0 ⊆ Θ (H0 est verifiée), ou au complémentaire
Θ1 = Θ\Θ0 (H1 est verifiée). L’hypothèse Hi est dite simple si Card (Θi ) = 1 ; elle est dite multiple
si Card (Θi ) > 1. On distinguera les tests bilatéraux (égalité versus différence, appartenance versus
non-appartenance) des tests unilatéraux (supériorité versus infériorité). Dans la pratique on notera
une équivalence entre la validation de l’hypothèse nulle et l’ntersection non vide de Θ0 avec un
certain intervalle de confiance. Le choix du type d’intervalle de confiance s’adaptera à la nature
du test (unilatéral, bilatéral, loi utilisée,...) .

Definition 3.1.1 (Risques)


Soit T un test d’hypothèses simples.
1. On appelle erreur de première espèce le rejet de l’hypothèse H0 alors qu’elle est vraie en
réalité. La probabilité de cet évènement est appelée risque de première espèce (ou niveau de
T ) et est notée α.
2. On appelle erreur de deuxième espèce l’acceptation de l’hypothèse H0 alors qu’elle est fausse
en réalité. La probabilité de cet évènement est appelée risque de deuxième espèce et est notée
β.

Definition 3.1.2 (Puissance et biais)


Soit T un test d’hypothèses simples.
1. On appelle puissance du test T , la probabilité de rejeter H0 alors qu’elle est effectivement
fausse. Elle vaut 1 − β.
2. On dit que le test est sans biais si sa puissance est supérieure au risque de première espèce
(1 > β + α).

29
30 CHAPITRE 3. TESTS D’HYPOTHÈSES

Récapitulatif H0 vraie (H1 Fausse) H0 Fausse (H1 vraie)


H0 validée (H1 rejétée) confiance γ = 1 − α risque β
H0 rejétée (H1 validée) risque α Puissance P = 1 − β
Les définitions précédentes se généralisent aux tests d’hypothèses multiples de la façon sui-
vante :
— Le risque de T est noté α = sup {α (θ)}.
θ∈Θ0
— La fonction de puissance est θ ∈ Θ1 7→ PT (θ) = 1 − β (θ), où β (θ) correspond au risque de
deuxième espèce dans le cas d’une hypothèse alternative simple.
— Le test est sans biais si α ≤ inf {PT (θ)}.
θ∈Θ1

Remarque 3.1.1 Dans la pratique, on valide l’hypothèse nulle si l’intervalle de confiance IC (θ)
rencontre l’ensemble Θ0 ; au cas contraire on valide l’hypothèse alternative. Les risques s’expriment
alors de la façon suivante :

α (θ) = P (IC (θ) ∩ Θ0 = {} |θ ∈ Θ0 )

et
β (θ) = P (IC (θ) ∩ Θ0 6= {} |θ ∈ Θ1 ) .
Connaissant la loi de l’estimateur θb de θ, on peut calculer ses probabilités.

Definition 3.1.3 Soit T1 et T2 deux tests d’hypothèses.


1. On dit que T1 est uniformément plus puissant que T2 au niveau α, si T1 est de niveau α,
T2 est de niveau inférieur ou égal à α, PT1 ≥ PT2 sur Θ1 , et cette inégalité est stricte pour
au moins un θ ∈ Θ1 .
2. On dit que T1 est uniformément plus puissant (UPP) niveau α, s’il l’est par rapport à tout
test au niveau α.

3.1.1 Test du rapport de vraisemblance (RV)


Definition 3.1.4 Soient la famille paramétrique {f (., θ) ; θ ∈ Θ ⊆ R} et les hypothèses H0 : θ =
θ0 versus H1 : θ = θ1 . On appelle rapport de vraisemblance (RV), la fonction λ (X1 , X2 , · · · , Xn ) ≡
λn telle que λn = LLnn (θ
(θ0 )
1)
. Le test du RV au niveau α est le test défini par une region de rejet de la
forme λn ≤ kα .

Théorème 3.1.2 Le test du RV est le plus puissant à tous les niveaux pris dans ]0, 1[ (lemme de
Neyman-Pearson). En outre, il est sans biais.

Definition 3.1.5 Soient la famille paramétrique f (., θ) ; θ ∈ Θ ⊆ Rk et les hypothèses H0 : θ ∈
Θ0 versus H1 : θ ∈ Θ1 = Θ\Θ0 . On appelle rapport de vraisemblance généralisé (RVG), la fonction
sup {Ln (θ)}
θ∈Θ0
λG (X1 , X2 , · · · , Xn ) ≡ λG G
n telle que λn = sup {Ln (θ)}
. Le test du RVG est le test défini par une
θ∈Θ1

region de rejet de la forme λG


n ≤ λ0 ≤ 1.

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


31 CHAPITRE 3. TESTS D’HYPOTHÈSES

Théorème 3.1.3 1 Soient la famille paramétrique f (., θ) ; θ ∈ Θ ⊆ Rk et l’hypothèse H0 spécifiant
les valeurs de r composantes de θ (1 ≤ r ≤ k). Supposons que les conditions de régularité garan-
tissant que l’estimateur EMV est BAN (Best Asymptotically Normal) sont remplies. Alors, sous
 L 2
H0 , la statistique λG
n du RVG, est telle que −2 ln λ G
n → X (r).

3.1.2 Autres tests basés sur les intervalles de confiance


Definition 3.1.6 La P -valeur est la probabilité que sous H0 , la statistique de test (l’estimateur)
prenne une valeur au moins aussi extrême que celle qui a été observée (l’estimation).

Dans la plupart des logiciels, on valide l’hypothèse nulle si la P -valeur est plus grande que le
risque de première espèce α et on la rejette au cas contraire. Donnons dans les trois cas suivants
la P -valeur correspondante. On pose Z = g (X1 , X2 , · · · , Xn , θ), où g désigne la fonction pivot.
— Test unilatéral (H0 ) : θ ≤ θ0 versus (H1 ) : θ > θ0
On construit un intervalle de confiance de niveau 1 − α de la forme ]−∞, z1−α ] où z1−α est
le quantile d’ordre 1 − α. On déduit l’intervalle de confiance de θ. On valide classiquement
l’hypothèse H0 si IC (θ) ∩ ]−∞, θ0 ] 6= {} et on l’invalide au cas contraire. La P -valeur est
la probabilité sous l’hypothèse H0 d’avoir Θ b n > θbn .
— Test unilatéral (H0 ) : θ ≥ θ0 versus (H1 ) : θ < θ0
On construit un intervalle de confiance de niveau 1 − α de la forme [zα , +∞[ où zα est
le quantile d’ordre α. On déduit l’intervalle de confiance de θ. On valide classiquement
l’hypothèse H0 si IC (θ) ∩ [θ0 , +∞[ 6= {} et on l’invalide au cas contraire. La P -valeur est
la probabilité sous l’hypothèse H0 d’avoir Θ b n < θbn .
— Test bilatéral (H0 ) : θ = θ0 versus (H1 ) : θ 6= θ0
On construit un intervalle de confiance de niveau 1 − α de la forme [zα , z1−α ] où zα et z1−α
sont les quantiles d’ordre α et 1−α respectivement. On déduit l’intervalle de confiance de θ.
On valide classiquement l’hypothèse H0 si θ0 ∈ IC (θ) et on l’invalide au cas contraire. La P -
valeur est sous l’hypothèse H0 le double du minimun des probabilités d’avoir respectivement
Θ
b n < θbn et Θb n > θbn .
L’intérêt de la P -valeur est qu’elle ne nécessite pas le cacul effectif de l’intervalle de confiance.
Toutefois, il semblait important de mentionner les méthodes de calcul des intervalles de confiance
selon les types de test.

3.1.3 Exemples d’applications


Exemple 3.1.1 Une étude sur 5 années consécutives s’intéresse à la production annuelle de deux
variétés A et B de maı̈s. Le tableau suivant est obtenu :
2000 2001 2002 2003 2004
A 10 9 15 18 12
B 13 10 11 8 11

La variété A est-elle meilleure que la variété B ? La variété B est-elle meilleure que la variété
A ? Les deux variétés sont elles similaires ? On supposera dans un premier temps que les écart-
types σA et σB valent respectivement 0, 1 et 0, 2. Par la suite, ils seront supposés égaux, mais
inconnus.
1. Pour la preuve, voir [6].

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


32 CHAPITRE 3. TESTS D’HYPOTHÈSES
Exemple 3.1.2 On lance une pièce 15 fois de suite. On obtient la séquence

(F, F, P, F, P, F, P, F, F, F, P, P, F, P, F )
1
Peut on dire que la probabilité d’avoir pile est 2
?

Exercice 3.1.1 On considère deux machines A et B produisant des ordinateurs. Les produits de
A sont de qualité supérieure et plus chers. La qualité des produits issus de A suit une loi N (15, 1)
et celle des produits issus de B suit la loi N (10, 1). Un revendeur se fait livrer 100 ordinateurs
au prix des produits issus de A. Il veut tester leur provenance effective via un test sur la qualité,
au niveau 5%.
1. Présenter les hypothèses. Sont-elles simples ou multiples ?
2. Sous l’hypothèse nulle, quelle est la loi de la moyenne de l’échantillon ? Donner un intervalle
de confiance de la moyenne.
3. Quelle est la puissance de ce test ? Le test est-il sans biais ?

Exercice 3.1.2 Le temps qui sépare l’arrivée d’une personne et de son successeur dans une file
d’attente est modélisé par un loi E (λ). Après un échantillonnage, on fait le test du Rapport de
Vraisemblance (RV) simple (H0 ) : λ = 1 versus (H1 ) : λ = 0.4. Quel est le résultat ?

Nombre de termes 30 35 15 30 20 10 5 5 8 9
Temps (m) 0.1 0.15 0.2 0.25 0.45 0.55 0.7 0.8 0.95 1
Nombre de termes 5 6 6 4 2 5 4 1 10 2
Temps (m) 1.2 1.55 1.75 1.9 2 2.5 2.8 3 3.5 5

Exercice 3.1.3 Une étude sur 5 années consécutives, s’intéresse à la production annuelle de deux
variétés A et B de maı̈s. Le tableau suivant est obtenu :
1999 2000 2001 2002 2003
A 10 9 15 18 12
B 13 10 11 8 11

1. Estimer les variances des productions des variétés A et B. Donner leurs intervalles de
confiance à 99%.
2. On suppose que les deux variétés ont la même moyenne.
(a) La variété A est-elle meilleure que la variété B ?
(b) La variété B est-elle meilleure que la variété A ?
(c) Les deux variétés sont elles similaires ?

3.2 Tests pour des variables catégorielles


Les variables catégorielles peuvent être considérées comme des généralisations des variables de
Bernoulli, dans la mesure où au lieu de deux évantualités on a n évatualités représentant toutes
les modalités possibles. Vu sous cet angle l’intérêt est donc
Xnporté sur la distribution de probabilité
(Pi )1≤i≤n des différentes modalités, avec la contrainte Pi = 1. Lors d’un m-échantillonage
i=1
on obtinent un n−uplet (M1 , M2 , · · · , Mn ) représentant les nombres d’apparition de chacune des

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


33 CHAPITRE 3. TESTS D’HYPOTHÈSES
Xn
modalités. On a par conséquent Mi = m et les (Mi )1≤i≤n sont dépendants. La loi du n−uplet
i=1 Xn
(M1 , M2 , · · · , Mn ) est multinomiale et donnée, pour mi = m, par :
i=1

m!
(P (M1 = m1 , M2 = m2 , · · · , Mn = mn )) = P m1 P m2 · · · Pnmn
m1 !m2 ! · · · mn ! 1 2
≡ Lm (P1 , P2 , · · · , Pn )

3.2.1 Test du rapport de vraisemblance


En utilisant
Xn la méthode d’estimation du maximum de log-vraisemblance, et en ajoutant la
contrainte Pi = 1, on obtient l’estimateur de la distribution de probabilité (Pi )1≤i≤n suivant :
i=1
  m 
i
Pbi =
1≤i≤n m 1≤i≤n

Les tests sur les variables catégorielles portent en général, sur une hypothèse nulle (H0 ) : P1 =
p1 , P2 = p2 , · · · , Pn = pn . Sous l’hypothèse H0 , avec une réalisation (m1 , m2 , · · · , mn ) du m-
échantillon (M1 , M2 , · · · , Mn ), le test du RVG porte sur le rapport de vraisemblance

Lm (p1 , p2 , · · · , pn )
λm =
p1 , pb2 , · · · , pbn )
Lm (b
Yn  pi mi
=
i=1 pbi
 mi
Yn pi
= m
i=1 mi
Xn
Compte tenu de la contrainte pi = 1, la donnée de n − 1 valeurs des pi suffit pour avoir
i=1
L
toutes les n valeurs. Ainsi, on a la relation de convergence −2 ln (λm ) → X 2 (n − 1). En supposant
la limite atteinte, l’hypothèse nulle est rejétée avec un risque de première espèce α, si −2 ln (λm ) >
2
X1−α (n − 1).

3.2.2 Test du Khi-2


En 1900, Karl Pearson montre moyennantX des approximations gaussiennes 2 , que sous l’hy-
n (m −mp )2
2
pothèse nulle, la statistique de test Xobservé ≡ i
mpi
i
suit la loi X 2 (n − 1). L’hypothèse
i=1
2 2
nulle est rejétée avec un risque de première espèce α, si Xobservé > X1−α (n − 1).
On peut généraliser tous les concepts évoqués ci-avant à k variables catégorielles à nj évantualités
(1 ≤ j ≤ k). On a une distribution de probabilité (Pi1 ,i2 ,··· ,ik )1≤ij ≤nj dont l’estimation, lors d’un
m 2 ,··· ,ik
m-échantillonage, est donnée par la relation Pbi1 ,i2 ,··· ,ik = i1 ,im . Sous l’hypothèse nulle et à la
Xn1 Xn2 Xnk (mi ,i ,··· ,i −mpi ,i ,··· ,i )2
2
limite, la statistique de test Xobservé ≡ ··· 1 2 k 1 2
mpi1 ,i2 ,··· ,ik
k
suit la loi
i1 =1 i2 =1 ik =1
Yk 
X2 (nj − 1) .
j=1

2. Voir [7] pour une preuve.

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


34 CHAPITRE 3. TESTS D’HYPOTHÈSES
3.2.3 Tests de l’Odd Ratio (OR) et du Risque Relatif (RR)
L’odds ratio (OR) est une statistique permettant de comparer les fréquences d’occurence d’un
événement dans deux groupes A et B considérés. Il est très souvent utilisé en épidémiologie
et est connu sous les noms rapport des chances, rapport des cotes ou risque relatif rapproché.
Désignons par pbA et pbB les estimations de probabilités respective d’occurence du dit événement
conditionellement à l’appartenance aux groupes A et B. L’odds ratio se cacule à travers la formule

pbA (1 − pbB )
OR = .
pbB (1 − pbA )

Il suit une loi log-normale LN (m, σ 2 ) et σ 2 est estimé par


1 1
b2 =
σ + ,
nA pA (1 − pA ) nB pB (1 − pB )

où nA et nB désignent les effectifs respectifs des groupes A et B. Un OR est égal à 1 on s’interprète
comme une égalité des probabilités d’occurence indépendamment du groupe. Lorsque OR est
strictement supérieur (respectiement inférieur) à 1 on conclu que pbA > pbB (respectivement pbA <
pbB ).
Le risque relatif (RR) est une statistique qui s’utilise de la même façon que l’odd ratio. Son
calcul s’obtient par la formule
pbA
RR = .
pbB
Le RR suit également une loi log-normale LN (m, σ 2 ) et σ 2 est estimé par
1 − pA 1 − pB
b2 =
σ + .
nA pA nB pB

3.2.4 Exemples d’applications


Exemple 3.2.1 (Application au test d’indépendance)
Dans une population on aimerait connaı̂tre s’il y a un lien entre le sexe et le teint. On fait une
enquête et le tableau suivant est obtenu lors du dépouillement :

Femme Homme
Brun(e) 15 5
Noir(e) 6 14

Quelle conclusion peut-on tirer avec un risque de première espèce de 5% ? On pocèdera aux
tests du Khi-deux de Pearson, de l’odd ratio et du risque relatif et du rapport de vraisemblance.

Exercice 3.2.1 On lance 15 fois un dé et on obtient la séquence

(1, 1, 1, 2, 5, 3, 6, 6, 4, 5, 5, 1, 2, 4, 3)

Peut on dire que ce dé est non pipé ? Dans un premier temps faire un test d’égalité de proportions
en estimant l’écart-type,puis en fixant sa valeur à 21 . On effectuera par la suite les test du Khi-deux
de Pearson, puis un test du rapport de vraisemblance.

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


35 CHAPITRE 3. TESTS D’HYPOTHÈSES
3.3 Analyses de la variance et la covariance
L’analyse de la variance (ANOVA) permet d’établir l’impact d’une ou de plusieurs variables
catégorielles sur une variable quantitative. Il s’agit d’une décomposition de la variance selon les
différentes catégories.

3.3.1 ANOVA à un facteur


Pour l’ANOVA à un facteur, on se base sur un échantillon (Yij )1≤i≤k,1≤j≤ni , où la variable Y
est quantitative et ni est le nombre de termes dans la catégorie i de la variable qualitative X. On
Xk
pose ni = n. On obtient la décomposition de la variance suivante, en utilisant la variance
i=1
de l’échantillon :

 X X 2
(n − 1) 2 1 Xk Xni 2 1 k ni
S2 = yij − yij
n n i=1 j=1 n i=1 j=1
 X 2
1 Xk 2 1 k
= ni yi. − ni yi.
n i=1 n i=1

1 Xk 1 Xk Xk
= ni yi.2 − 2 ni yi. nr yr.
n i=1
 n i=1 i=r

1 Xk (ni − 1) ni  2 2

2 1 Xk
= yi. − yi. + ni yi. − ni yi. y
n i=1 (ni − 1) n i=1

1 Xk   1 Xk
= (ni − 1) Si.2 + ni yi. 2 − ni yi. 2
n i=1 n i=1
1 Xk 1 Xk
= (ni − 1) Si.2 + ni yi. (yi. − y)
n i=1 n i=1
1 Xk 1 Xk
= (ni − 1) Si.2 + ni (yi. − y)2
n i=1 n i=1

D’où Xk Xk
(n − 1) S22 = ni (yi. − y)2 + (ni − 1) Si.2
i=1 i=1
On pose
Xk
SCE = (ni − 1) Si.2
i=1
Xk
SCT R = ni (yi. − y)2
i=1

SCT = SCT R + SCE = (n − 1) S22


SCE désigne la somme des carrés des erreurs, SCTR la somme des carrés des traitements, et SCT
la somme des carrés totale. On a les dégrés de liberté n − 1 de la variation totale, n − k de la
variation intra-catégories i, k − 1 de la variation inter-catégorie.
On dresse en général la table d’ANOVA suivante :

Source DL SC MC (SC/DL) F-statistique F-lu


Traitement k − 1 SCT R M CT R = SCT
k−1
R
F = MMCTCE
R
F 1−α (k − 1, n − k)
Erreur n−k SCE M CE = SCE
n−k
Total n−1 SCT

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


36 CHAPITRE 3. TESTS D’HYPOTHÈSES
MCE est la moyenne des carrés des erreurs, et MCTR est la moyenne des carrés des traitements.
On montre que la variable F = MMCT CE
R
suit une loi de Fisher-Snedecor à (k − 1, n − k) dégrés de
liberté. L’hypothèse nulle à tester est celle de l’égalité des moyennes marginales par catégorie, c’est
à dire que la variable catégorielle n’a aucune influence. L’hypothèse nulle est rejétée si F > F1−α .

Exemple 3.3.1 Une étude sur le diamètre des écrous produits par trois machines donne en mi-
limètre. :

A 10 12 9 14 20 11
B 13 9 15 18 12 14 13 14
C 13 10 11 8 11 8 7
Y-a-t-il une différence entre les pièces produites par ces machines ? Supposons que la norme
soit de 11mm. Quelles sont les machines conformes ? On supposera dans un premier temps que
les écarts-type sont connus et valent 1mm ; par la suite il seront supposés inconnus.

Exercice 3.3.1 Une étude sur le diamètre des écrous produits par trois machines donne en mi-
limètre. :
A 15 16 9 13 17 11
B 13 9 17 18 15 14 13 18
C 14 10 15 5 11 9 7
1. Dresser une table d’ANOVA. Y-a-t-il une différence entre les pièces produites par ces ma-
chines ?
2. Supposons que la norme soit de 11mm. Quelles sont les machines conformes ? On supposera
que les écarts-type sont connus et valent tous 1mm.

3.3.2 ANOVA à plusieurs facteurs


L’ANOVA à plusieurs facteurs généralise celle à un facteur, en augmentant le nombre de
variables explicatives catégorielles. Dans cette sous-section on se restreint au cas de deux facteurs.
On suppose que la variable quantitative expliquée est Y , et les variables qualitatives explicatives
sont X1 et X2 . Les nombres de catégories de X1 et X2 sont respectivement k1 et k2 . Le principe

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


37 CHAPITRE 3. TESTS D’HYPOTHÈSES
de décomposition de la variance demeure le même et on a :
 X X X 2
(n − 1) 2 1 Xk1 Xk2 Xnij 2 1 k1 k2 nij
S2 = yijl − yijl
n n i=1 j=1 l=1 n i=1 j=1 l=1
 X X 2
1 Xk1 Xk2 2 1 k1 k2
= nij yij. − nij yij.
n i=1 j=1 n i=1 j=1

1 Xk1 Xk2 2 1 Xk1 Xk2


= nij yij. − 2 ni. yi.. n.j y.j.
n i=1 j=1 n i=1 j=1
1 Xk1 Xk2   1 Xk1 Xk2
= nij yij. 2
− yij. 2 + yij. 2 − 2 ni. yi.. n.j y.j.
n i=1 j=1 n i=1 j=1
1 Xk1 Xk2 2 1 Xk1 Xk2 Xk1 Xk2 ni. n.j
= (nij − 1) Sij. + nij yij. 2 − yi.. y.j.
n i=1 j=1 n i=1 j=1 i=1 j=1 n n
1 Xk1 Xk2 2
Xk1 Xk2 ni. n.j 1 Xk1 Xk2
= (nij − 1) Sij. − yi.. y.j. + nij yij. 2
n i=1 j=1 i=1 j=1 n n n i=1 j=1
1 Xk1 Xk2 2
Xk1 Xk2 ni. n.j
= (nij − 1) Sij. − yi.. y.j.
n i=1 j=1 i=1 j=1 n n
Xk1 Xk2 nij
+ [(yij. − yi.. ) (yij. − y.j. ) + yij. (yi.. + y.j. ) − yi.. y.j. ]
i=1 j=1 n
1 Xk1 Xk2 2
Xk1 Xk2 nij
= (nij − 1) Sij. + (yij. − yi.. ) (yij. − y.j. )
n i=1 j=1 i=1 j=1 n
Xk1 Xk2 nij h nij nij ni. n.j i
+ yij. yi.. + yij. y.j. − yi.. y.j. − yi.. y.j.
i=1 j=1 n n n n n
1 Xk1 Xk2 2
Xk1 Xk2 nij
= (nij − 1) Sij. + (yij. − yi.. ) (yij. − y.j. )
n i=1 j=1 i=1 j=1 n
Xk1 Xk2 nij Xk1 Xk2 nij Xk1 Xk2 nij
+ yij. yi.. + yij. y.j. − yi.. y.j.
i=1 j=1 n i=1 j=1 n i=1 j=1 n
Xk1 Xk2 ni. n.j
− yi.. y.j.
i=1 j=1 n n
1 Xk1 Xk2 2
Xk1 Xk2 nij
= (nij − 1) Sij. + (yij. − yi.. ) (yij. − y.j. )
n i=1 j=1 i=1 j=1 n
Xk1 ni. Xk1 ni. Xk2 n.j Xk2 n.j
+ yi.. 2 − yi.. y + y.j. 2 − yy.j.
i=1 n i=1 n j=1 n j=1 n
1 Xk1 Xk2 2
Xk1 Xk2 nij
= (nij − 1) Sij. + (yij. − yi.. ) (yij. − y.j. )
n i=1 j=1 i=1 j=1 n
1 Xk1 1 Xk2
+ ni. (yi.. − y)2 + n.j (y.j. − y)2
n i=1 n j=1

D’où
Xk1 Xk2
(n − 1) S22 = ni. (yi.. − y)2 + n.j (y.j. − y)2
i=1 j=1
Xk1 Xk2 Xk1 Xk2
2
+ nij (yij. − yi.. ) (yij. − y.j. ) + (nij − 1) Sij.
i=1 j=1 i=1 j=1

On pose
Xk1
SCT R1 = ni. (yi.. − y)2
i=1
Xk2
SCT R2 = n.j (y.j. − y)2
j=1

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


38 CHAPITRE 3. TESTS D’HYPOTHÈSES
Xk1 Xk2
SCT R12 = nij (yij. − yi.. ) (yij. − y.j. )
i=1 j=1
Xk1 Xk2
2
SCE = (nij − 1) Sij.
i=1 j=1

SCT = SCT R1 + SCT R2 + SCT R12 + SCE


SCT R1
M CT R1 =
k1 − 1
SCT R2
M CT R2 =
k2 − 1
SCT R12
M CT R12 =
(k1 − 1) (k2 − 1)
SCE
M CE =
n − k1 k2
On dresse en général la table d’ANOVA suivante :

Source DL SC MC (SC/DL) F-statistique


Traitement 1 k1 − 1 SCT R1 M CT R1 F1 = MMCT
CE
R1
M CT R2
Traitement 2 k2 − 1 SCT R2 M CT R2 F2 = M CE
Traitement 12 (k1 − 1) (k2 − 1) SCT R12 M CT R12 F12 = MMCTCE
R12

Erreur n − k1 k2 SCE M CE
Total n−1 SCT

Les règles de décision sont similaires à celles de L’ANOVA à un facteur. Si F1 > F1−α
(k1 − 1, n − k1 k2 )(respectivement F2 > F1−α (k2 − 1, n − k1 k2 )) alors l’impact de la catégorisation
par rapport à la variable X1 (respectivement X2 ) est avéré. Si F12 > F1−α ((k1 − 1) (k2 − 1) , n − k1 k2 )
alors l’impact de la double catégorisation par rapport au couple de variables (X1 , X2 ) est également
avéré.

Exercice 3.3.2 Pour étudier l’impact de la saison et de la race du café sur sa production annuelle
en tonnes, on mêne une enquête. A l’issue de celle-ci on obtient

S-Sèche S-pluie
Variété A 13, 10, 11, 12 9, 15, 16, 15
Variété B 7, 8, 10, 11 13, 17, 18, 19
Que conclure ?

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


Chapitre 4

Modélisation statistique

4.1 Régression paramétrique


Dans cette section, il est question d’estimer les paramètres d’une relation fonctionnelle pa-
ramétrique, entre deux variables Y et X à valeurs dans Rp et Rk respectivement. Cette estimation
s’appuie sur un n-échantillon ((X, Y )1 , (X, Y )2 , · · · , (X, Y )n ). Dans le jargon habituel, s’il s’agit
d’exprimer Y en fonction de X, la variable Y est dite expliquée et la variable X est dite explicative.

4.1.1 Le modèle linéaire général


Dans le cadre du modèle linéaire général, on se donne une bijection f : Rp → Rq et on cherche
une application affine g : Rk → Rq telle que

f (Y ) = g (X) + ∆ (X) + E

En général, on suppose que l’écart E est un vecteur aléatoire indépendant de X et d’espérance


mathématique nulle, qui suit une loi N (0, K) (K étant la matrice des variances-covariances).
∆ (X) représente l’erreur du modèle mathématique qui est sensée être nulle. Les composantes de
la variable aléatoire X sont par hypothèse supposées indépendantes mais peuvent en pratique être
liées par des relations fonctionnelles non-linéaires ; par exemple les puissances d’une composante
dans le cas d’une régression polynomiale. Il semble important de remarquer que

E [f (Y ) |X] = g (X)

et que conditionnellement à X = x,

E [f (Y ) |X = x] = g (x) + E.

Pour simplifier l’exposé, supposons p = q = 1 et posons Z = f (Y ). On aura par conséquent


g (X1 , · · · , Xk ) = a0 +a1 X1 +· · ·+ak Xk . Par hypothèse d’indépendance du système {X1 , X2 , · · · , Xk , ε},
en calculant E [Z], les termes Cov [Xi , Z] et V ar [Xi , Z], on observe que

a0 = E [Z] − A1 E [X1 ] − · · · − Ak E [Xk ]

et
Cov [Xi , Z]
ai = , 1 ≤ i ≤ k.
V ar [Xi ]

39
40 CHAPITRE 4. MODÉLISATION STATISTIQUE
Dans le cas gaussien, pour une estimation par la méthode du maximum de vraisemblance, on
utilise la fonction
 
Yn 1 1 2
L (ak , ak−1 , · · · , a1 , a0 , σ) = √ exp − 2 (f (Yi ) − g (X1i , · · · , Xki ))
i=1 σ 2π 2σ

où Xij désigne le j-ème terme de l’echantillon pour la variable Xi .


En supposant k = 1 (régression linéaire simple), on obtient les estimations

XY S2
a1 =
b 2
a0 = Z n − b
et b a1 X n .
X S2

Le modèle après estimation des coefficient devient

Z =b
a1 X + b
a0 + ε

où ε désigne le résidu (à ne pas confondre avec l’écart).


On peut établir 1 que E [b ai ] = E [E [bai |X]] = E [ai ] = ai , i = 0, 1. En outre, conditionnellement
à X = x,
V ar [Z|X = x] V ar [ε]
V ar [ba1 ] = 2
=
(n − 1) X S2 (n − 1) X S22
et
" 2 #
1 Xn
V ar [ba0 ] = + V ar [Z|X = x]
n (n − 1) X S22
" 2 #
1 Xn
= + V ar [ε] .
n (n − 1) X S22

2
Proposition 4.1.1 La statistique

2 1 Xn 2
εS = εi
n−2 i=1
1 Xn
= (Zi − b a0 )2
a1 X i − b
n−2 i=1

Xn
est un estimateur sans biais de V ar [ε] . Ainsi, la variable Vn−2
ar[ε] ε
S 2
= 1
V ar[ε]
ε2i suit une loi
i=1
du khi-deux à n − 2 dégrés de liberté. En outre, cette dernière est indépendante des estimateurs
a0 et b
b a1 .
3
Proposition 4.1.2 Si ε S 2 désigne l’estimateur sans biais présenté ci-avant de la variance V ar [ε],
alors on a
a1 −a1 )
(b
1. ε S/ X S2

n−1
t (n − 2),
a0 −a0 )
(b
2. s t (n − 2).
1 (X n )2
εS n
+ 2
(n−1)X S2

1. Voir [6, 7].


2. Voir [7].
3. Voir [6].

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


41 CHAPITRE 4. MODÉLISATION STATISTIQUE
En supposant k ≥ 1 (régression linéaire multiple), on pose Z = f (Y ) et
 
1 X11 X21 · · · Xk1
1 X12 X22 · · · Xk2 
M =  .. ..  .
 
.. .. ..
. . . . . 
1 X1n X2n · · · Xkn

On remarque que
···
 
1 X1 X2 Xk
 X1 X 2 X1 X2 ··· X1 X k 
 1 
T X X X
M M = n 2 1 2 X22 ··· X2 X k 
 et
 . .. .. .. .. 
 .. . . . . 
Xk X1 Xk X2 X k ··· Xk2
X Yk
det M T M = n2
 
sign (σ) Xi Xσ(i) − Xi Xσ(i) .
σ∈Sk i=1
Q  2

Si de plus les vecteur xi,· sont deux à deux orthogonaux alors det M T M = n2 ki=1 Xi2 − Xi .

 T
Le vecteur ba= b a0 ba1 · · · b ak s’obtient par la formule générale
−1
a = MT M
b MT z
−1
= MT M M T (M a + E)
−1 T
= a + MT M M E.

a] = a. Posons u = [u1 , · · · , un ]T avec nui = 1, i = 1, · · · , n. On a


Il suit que E [b
 −1 T 
Z = M a + E = Mb a + ε et ε = E − M (b a − a) = I − M M T M M E.
  −1 T   −1 T 
Ainsi, ε N 0, I − M M T M M K I − M MT M M . De même,
−1 −1
a = a + MT M
b MT E − MT M MT ε
 −1 T −1 
T T
et du fait que b
a indépendant de ε conditionnelement à X, on a b a N a, M M M KM M M .
Par construction, ba est le projété orthogonal de Z dans l’espace le sous-espace engendré par les k+1
T
−1 T  
vecteurs colonne indépendants de M . Ainsi le rang de la matrice I − M M M M K I − M MT M

T T
−1 T  21
vaut n − k − 1 et M M M KM M M (b a − a) N (0, I).
Xn
4 1
Proposition 4.1.3 La statistique ε S 2 = n−k−1 ε2i est un estimateur sans biais de V ar [E].
Xn i=1
1
Ainsi, la variable V ar[E] ε2i suit une loi du khi-deux à n − k − 1 dégrés de liberté. En outre,
i=1
elle est indépendante des estimateurs b ai (0 ≤ i ≤ k).

Proposition 4.1.4 Si ε S 2 désigne l’estimateur sans biais présenté ci-avant de la variance V ar [ε],
alors on a
4. Voir [7].

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


42 CHAPITRE 4. MODÉLISATION STATISTIQUE
ai −ai )
(b
1. ε S/ Xi S2

n−1
t (n − k − 1), ∀i = 1, · · · , k et
a0 −a0 )
(b
2. s t (n − k − 1).
1 Pk (Xin )2
εS n
+ i=1 (n−1) 2
Xi S2

Remarque 4.1.1 Dans le cas non gaussien, la méthode d’estimation


qXn couramment
qXn utilisée est celle
2
des moindres carrés. Elle consiste à minimiser la fonction ki εk = kf (i Y ) − g (i X)k2 .
i=1 i=1

4.1.2 Le modèle linéaire généralisé


Le modèle linéaire généralisé est une extension du modèle linéaire général aux cas où la variable
expliquée Y suit une loi paramétrique dont le paramètre θ est fonction de la variable explicative
X. Y peut par exemple être une variable de Bernoulli ou de Poisson. La fonction à estimer
est donc θ = θ (x). Dans les cas de Bernoulli B (p) et de Poisson P (λ), on a respectivement
p (x) = E [Y |X = x] et λ (x) = E [Y |X = x]. Intéressons nous aux regressions simples pour les
familles de Bernoulli et de Poisson.

Famille de Bernoulli

Dans le  cas de la regression logistique, il s’agit d’estimer les coefficients a1 et a0 , tels que
p(X) exp(a1 X+a0 ) et
ln 1−p(X) = a1 X+a0 ; de façon équivalente p (X) = 1+exp(a 1 X+a0 )
. La fonction g : t 7→ g (t) = 1+e t

t

est appelée fonction logistique ; sa bijection réciproque, le logit, est t 7→ ln 1−t . On définit de
façon équivalente le probit et le gompit, en remplaçant respectivement la fonction g par t 7→
g (t) = √12π exp − 12 t2 et t 7→ g (t) = 1 − exp (− exp (t)). Le probit et le gompit donnent lieu eux
aussi à des modèles.
Soit un n-échantillon ((X, Y )1 , (X, Y )2 , · · · , (X, Y )n ), où il y a M modalités de X. On pose
S (xi ) le nombre de couples (xi , 1), et E (xi ) le nombre de couples (xi , 0) dans l’échantillon. La
fonction de vraisemblance utilisée pour l’estimation est
YM
Ln (a1 , a0 ) = [p (xi )]S(xi ) [1 − p (xi )]E(xi )
i=1

Famille de poisson
Ici nous explorons le modèle log-normal, en considérant la relation ln (λ (X)) = a1 X + a0 . Soit
un n-échantillon ((X, Y )1 , (X, Y )2 , · · · , (X, Y )n ), où il y a MX modalités de X et MY modalités de
Y . On pose C (xi , yj ) le nombre de couples (xi , yj ) dans l’échantillon. La fonction de vraisemblance
utilisée pour l’estimation est
YMX YMY [λ (xi )]C(xi ,yj )
Ln (a1 , a0 ) = exp (−λ (xi ))
i=1 j=1 C (xi , yj )!

4.2 Analyse de la regression


4.2.1 Analyse de la variance
Dans cette sous-section on considère le modèle linéaire général Z = a0 + a1 X1 + · · · + ak Xk .
Il existe plusieurs critères pour étudier le niveau d’ajustement d’un modèle. En particulier, le R2

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


43 CHAPITRE 4. MODÉLISATION STATISTIQUE
et surtout le R2 -ajusté sont très utilisés. Le R2 a une valeur comprise entre 0 et 1. Plus le R2 et
le R2 -ajusté (RAdj
2
)sont (proches en valeur absolue pour le second) de 0, moins le modèle s’ajuste
aux données. Il se calcule sur la base d’une analyse de la variance du modèle linéarisé. Sous
l’hypothèse nulle d’ajustement, on a la décomposition
SCT = SCM + SCE
où Xn
SCT = (zj − z . )2 ,
j=1
Xn  Xk 2
SCE = zj − ba0 − ai xij ,
b
j=1 i=1
Xk Xn
SCM = ai − ai ) xij + (b
((b a0 − a0 ))2 .
i=1 j=1
Ainsi, pour une regression linéaire à k variables explicatives et donc k + 1 paramètres, on aura la
table d’ANOVA suivante :
Source DL SC MC (SC/DL) R2 F-statistique
R2
Modèle k SCM M CM = SCM
k
SCM
SCT
= R2 M CM
M CE
= n−k−1
k 1−R2
SCE SCE M CE
Erreur n − k − 1 SCE M CE = n−k−1 SCT
= 1 − R2 M CT
2
= 1 − RAdj
Total n−1 SCT M CT = SCT
n−1
n−k−1 R2 2
Notons que k 1−R2
suit une loi F (k, n − k − 1) et 1−RAdj suit une loi F (n − k − 1, n − 1).
2 √
En particulier, lorsque k = 1, (n−2)R
1−R2
suit une loi F (1, n − 2) et donc √n−2R
1−R2
suit une loi t (n − 2).
Lorsqu’on doit comparer plusieurs modèles, le meilleur est celui qui a un M CE = RM CE 2 faible
et un R2 (respectivement RAdj
2
) plus grand. On peut également procéder lorsque V ar [ε] est connue,
à un test d’ajustement du Khi-2 à n − k − 1 degrés de liberté en considérant sous l’hypothèse nulle
d’ajustement, la statistique
SCE 1 Xn 2
χ2obs = = εi .
V ar [ε] V ar [ε] i=1

Un autre critère d’appéciation du modèle est basé la minimalité du critère d’information d’Akaike
(AIC) dont la définition générale utilise la fonction de vraisemblance Ln et s’exprime par
AIC = −2 ln (Ln ) + 2 (k + 1) .
En particulier, pour la regression linéaire multiple on a
AIC = n ln (M CE) + 2 (k + 1) .
Toutefois, il est plus utilisé l’AIC corrigé
2 (k + 1) (k + 2)
AICc = AIC + .
n−k−2
L’AIC s’accompagne parfois par le critère bayésien d’information (BIC) défini par l’expression
BIC = −2 ln (Ln ) + (k + 1) ln (n) .
En particulier, pour la regression linéaire multiple on a
BIC = n ln (M CE) + (k + 1) ln (n) .
L’AIC et le BIC pénalisent les modèles ayant trop de paramètres, mais l’AIC est plus recommandé.
On peut rémarquer que AIC −2 (k + 1)−n ln (2πV ar [ε]) et BIC −(k + 1) ln (n)−n ln (2πV ar [ε])
suivent des lois du Khi-2 à n − k − 1 degrés de liberté sous l’hypothèse nulle.

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


44 CHAPITRE 4. MODÉLISATION STATISTIQUE
4.2.2 Analyse de la covariance (ANCOVA)
L’analyse de la covariance est similaire à l’analyse de la variance, car il s’agit toujours d’expli-
quer la variation totale d’une variable quantitative par d’autres variables. La différence vient du
fait qu’au lieu que les variables explicatives soient uniquement qualitatives comme pour l’ANOVA,
elles sont désormais une combinaison de variables qualitatives et quantitatives. La partie qualita-
tive correspond toujours au facteur. Ainsi, selon qu’on a n variables explicatives qualitatives et m
variables explicatives quantitatives, on parlera d’ANCOVA à n facteurs.

4.3 La méthode géostatistique du krigeage


Le krigeage est une méthode à la fois d’interpolation et d’extrapolation spatiale. On dispose
d’un n-échantillon ((X, Y )1 , (X, Y )2 , · · · , (X, Y )n ), qui représente quelques valeurs d’un champ
de vecteurs aléatoires f : X ∈ E ⊆ Rk 7−→ Y ∈ F ⊆ Rp . Le principe est celui de restreindre
f (E), à sa projection dans V ect {Yi ; 1 ≤ i ≤ n}, l’espace vectoriel engendré par les (Yi )1≤i≤n . On
aura donc Xn
f (X) ' fe(X) = Ye = λi (X) Yi
i=1

Les qualités de cet estimateur sont mesurées par le biais (b : X 7−→ E[fe(X) − f (X)]), la
variance (v : X 7−→ V ar[fe(X)]) et par conséquent l’erreur quadratique moyenne. Pour minimiser
l’erreur quadratique moyenne, il faut et il suffit que les poids (λi (X))1≤i≤n vérifient
Xn
λj (X) E [Yi Yj ] = E [Yj Y ] , i = 1, · · · , n
j=1

En d’autres termes
Xn
λj (X) (Cov [Yi , Yj ] + E [Yi ] E [Yj ]) = (Cov [Yi , Y ] + E [Yi ] E [Y ]) , i = 1, · · · , n (4.1)
j=1

Lorsque la moyenne est l’espérance mathématique E[Y ] est connue et indépendante de X, on


parle du krigeage simple. Pour le krigeage ordinaire, E[Y ] est également indépendante de X, mais
inconnue. Dans ces cas, avoir un biais nul correspond à la condition
Xn
λi (X) = 1
i=1

et par conséquent, les équations (4.1) deviennent


Xn
λj (X) Cov [Yi , Yj ] = Cov [Yi , Y ] , i = 1, · · · , n
j=1

Les hypothèses de modélisation utilisées en général constituent la stationnarité d’ordre 2 :


1. E[Y ] ne dépend pas de X .
2. Cov [f (X + h) , f (X)] = C (h) ne dépend que de h.
La fonction h 7−→ C (h) est choisie selon un certain nombre de critères (choix ou estimation du
variogramme). Elle est associée très souvent à une mesure spectrale. Le champ f est dit isotrope
si C (h) = r (khk), où r est la fonction de covariance isotropique. La stationnarité n’étant pas
toujours vérifiée l’affaiblir serait intéressant. Considérons le champ de vecteurs aléatoires

I h : X ∈ E 7−→ I h (X) = f (X + h) − f (X)

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


45 CHAPITRE 4. MODÉLISATION STATISTIQUE
Definition 4.3.1 Le champ f est dit intrinsèque si
(i) E[f (X)] ne dépend pas de X .
(ii) Pour tout h, le champ I h est stationnaire au second ordre.

Lorsque le champ f est dit intrinsèque, on définit le variogramme de la façon suivante :

2γ (h) = V ar [f (X + h) − f (X)]

Le semi-variogramme est γ (h). On remarque aisément que γ (−h) = γ (h) ≥ 0, γ (0) = 0, et si f


est stationnaire, γ (h) = C (0) − C (h).
Si C (h) tend vers 0 lorsque khk tend vers l’infini, le semi-variogramme présentera un palier
au niveau C (0) = V ar [f (X)], lorsque khk tendra vers l’infini. La portée (respectivement portée
pratique) du variogramme est la distance à partir de laquelle le palier ( respectivement 95% de la
valeur du palier) est atteint.
Voici quelques exemples de semi-variogrammes isotropiques sur Rk :
— Pépitique : γ (h, σ 2 ) = σ 2 1|{h>0}
 (associéau bruit
 blanc faible)
— Exponentiel : γ (h, σ 2 , a) = σ 2 1 − exp khk a
, a > 0.
  
  2
 σ2 khk khk
2 3 − , khk ≥ a > 0
— Sphérique : γ (h, σ , a) = 2a a , k ≤ 3.
2
 σ , a> khk


2
— Gaussien : γ (h, σ 2 , a) = σ 2 1 − exp − khk a
, a > 0.
  ν K khk 
2 2 1−ν khk ν( a )
— Matérn : γ (h, σ , a, ν) = σ 1 − 2 a Γ(ν)
, a > 0. Où Kν est la fonction de
Bessel modifiée de 2-ième espèce de paramètre ν > 0.
— Puissance : γ (h, a, α) = a khkα , α ≤ 2.
On peut généraliser les exemples de variagrammes précédents en faisant des combinaison
linéaires. Dans la pratique, il est courant d’ajouter un effet pépite.
En anisotropie on définie le variogramme directionnel de la façon suivante :


e (h) = V ar [f (X + h e ) − f (X)]
2γ−

, où →

e est un vecteur unitaire et h ∈ R. On distingue l’anisotropie géométrique de l’anisotropie
de support. La première est due à une déformation, via un endomorphisme bijectif, d’un vario-
gramme isotropique (γ (h) = γ0 (kA1 hk)) . La seconde correspond elle, à une déformation, via
un endomorphisme non-bijectif, d’un variogramme isotropique (γ (h) = γ0 (kA2 hk)). Si f est la
somme de deux champs intrinsèques, son variogramme est la somme de leurs variogrammes : il
est dit gigogne. Le champ f est souvent décomposé sous la forme :

f (X) = m (X) + W (X) + η (X) + ε (X)

,où m est une dérive déterministe représentant la variation à grande échelle, W est un champ
intrinsèque de grande portée, η est un champ intrinsèque de petite portée, et ε est une composante
pépitique modélisant l’erreur.
En pratique, on estime le semi-variogramme, on choisit un modèle connu auquel il s’ajuste le
plus, et on estime les paramètres. Les estimation peuvent être faites par les méthodes du maximum
de vraisemblance (MV), ou des moindres carrés (MCO). Pour déceler l’anisotropie, on estime les

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


46 CHAPITRE 4. MODÉLISATION STATISTIQUE
semi-variogrammes au moins dans les quatres directions cardinales ( Nord, Sud, Est, Ouest) avec
une marge de ±22.5◦ .
On pose pour tous réels positifs h et ε, tels que h ≥ ε,

E (h, ε) = {(i ,j ) ; h − ε ≤ kXi − Xj k ≤ h + ε}

Un estimateur du semi-variogramme, avec une tolérance ε est


1 X
γ
b (h) = (Xi − Xj )2
Card (E (h, ε)) ( ,
i j )∈E(h,ε)i

En pratique la tolérance ε est choisie de telle sorte que Card (E (h, ε)) soit minoré par 30. Les
covariances sont estimées par la formule
1 X  
C
b (h) = Xi − X Xj − X .
Card (E (h, ε)) (i ,j )∈E(h,ε)i

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


Chapitre 5

Plans d’expériences

5.1 Généralités
5.1.1 Vocabulaire des plans d’expériences
La compréhension d’un phénomène d’intérêt commence en général par des observations,
la formulation des hypothèses qui vont être validées par des enquêtes ou des expériences. Ces
expériences doivent être menées de façon à arriver rapidement aux meilleurs résultats possibles,
éviter de réaliser des expériences inutiles, obtenir la meilleure précision possible sur les résultats,
permettre d’avancer à coup sûr, établir la modélisation du phénomène étudié, et découvrir la
solution optimale [4]. Les trois étapes essentielles d’une étude sont :
— Le choix de la méthode d’expérimentation : il s’agit de faciliter l’interprétation des résultats,
minimiser le nombre des essais sans toutefois sacrifier la qualité ;
— L’analyse des résultats : il s’agit de trouver les outils appropriés pour tirer le maximum de
connaissances possibles ;
— L’acquisition progressive de la connaissance : il s’agit de structurer la démarche de réponse
aux questions posés.
En général, la compréhension d’un phénomène consiste à établir une relation (fonctionnelle)
entre une variable Y appelée réponse, et une variable explicative X appelée facteur. L’ensemble
des valeurs prises par le facteur X est appelé espace expérimental. Les éléments de l’espaces
expérimental sont appelés points expérimentaux et dans le cas atomique (unidimensionnel) on
parle de niveaux. Dans plusieurs cas de facteurs atomique (dimension 1), l’espace expérimental
est muni d’une relation d’ordre et admet un minimum appelé niveau bas et un maximum appelé
niveau haut. Si on se restreint à une sous-partie de l’espace expérimental, on parle de domaine
(de variation) du facteur ou domaine d’étude. On appelle surface de réponse le graphe de relation
entre les facteurs et les réponses. De la même façon on parle de courbe isoréponse pour tout lieu
géométrique de la surface de réponse. Il est de coutume pour simplifier les expressions procéder à
une transformation ou encore une codification. Par exemple −1 représente le niveau bas, 0 le niveau
intermédiare (ou milieu) et 1 pour le niveau haut. Cette transformation a également l’avantage
d’avoir des quantités comparables dont les effets sont plus réalistes, puisque sans dimensions. Le
tableau des données réelles est appelé tableau (ou matrice) expérimental(e) tandis que celui des
valeurs codées est appelé plan ou matrice d’expérience.

47
48 CHAPITRE 5. PLANS D’EXPÉRIENCES

Table 5.1 – Matrice expérimentale


N◦ Essai Facteur 1 · · · Facteur p
1 x1,1 ··· xp,1
.. .. .. ..
. . . .
n x1,n ··· xp,n

Table 5.2 – Matrice expérimentale et résultats


N◦ Essai Facteur 1 · · · Facteur p Réponse
1 x1,1 ··· xp,1 y1
.. .. .. .. ..
. . . . .
n x1,n ··· xp,n yn

Table 5.3 – Matrice d’expériences


N◦ Essai Facteur 1 · · · Facteur p
1 c1,1 ··· cp,1
.. .. .. ..
. . . .
n c1,n ··· cp,n
Niveau 1 val1,1 ··· valp,1
.. .. .. ..
. . . .
Niveau k val1,k ··· valp,k

Table 5.4 – Matrice d’expériences et résultats


N◦ Essai Facteur 1 · · · Facteur p Réponse
1 c1,1 ··· cp,1 y1
.. .. .. .. ..
. . . . .
n c1,n ··· cp,n yn
Niveau 1 val1,1 ··· valp,1
.. .. .. ..
. . . .
Niveau k val1,k ··· valp,k

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


49 CHAPITRE 5. PLANS D’EXPÉRIENCES
Le choix du nombre et de l’emplacement des points d’expériences est le problème fondamental
des plans d’expériences. On cherche à réaliser le minimum d’expériences tout en réduisant l’in-
fluence de l’erreur expérimentale sur les modélisations mathématiques qui serviront à prendre des
décisions. On atteint ce but en considérant les propriétés mathématiques et statistiques qui relient
la réponse aux facteurs. Lorsqu’il n’y a pas de contraintes sur le domaine d’étude, il existe des
plans classiques qui possèdent d’excellentes qualités statistiques et qui permettent de modéliser
les réponses dans les meilleures conditions. Lorsqu’il existe des contraintes, il faut construire des
plans sur mesure en recherchant la position des points expérimentaux qui conduisent, là aussi, à
de bonnes qualités statistiques et à une bonne modélisation des réponses. En général, les vecteurs
colonnes de la matrice d’expérience sont indépendants. Une matirice carrée à colonnes deux à deux
orthogonales est appelée matrice d’Hadamard. On représente certaines contraintes de préférence
par des fonctions dites de désirabilité.

Definition 5.1.1 (Fonction de désirabiilité) Soit D = D1 ×· · ·×Dp un domaine expérimental.


On appelle fonction de désirabilité associée à un facteur i = 1, · · · , p, toute application fi : D1 →
[0; 1]. De même la fonction de désirabilité globale est définie comme une application f : D → [0; 1]
1
qui vaut en général ( pi=1 fi ) n .
Q

5.1.2 Modélisation mathématique et plans complets


Les modèles mathématiques utilisés pour les plans d’expériences sont en général basés sur
le principe du developpement en série de Taylor, et donc suppose une certaine régularité de la
relation facteurs et réponses. Ainsi à un certain ordre n, on se restreint à un polynôme d’ordre
inférieur ou égale à n dont les coefficients correspondent pour la constante à la réponse au centre
du domaine d’étude, et pour les autres aux effets des facteurs ou interactions entre facteurs.
Pour déterminer les coefficient d’un polynôme à n coefficients, faut naturellement n équation
indépendantes correspondant chacune à une expérience. En général, un modèle polynômial prenant
en compte les effets de p facteurs (à ki niveauxQ pour le facteur i = 1, · · · , p) et leurs interactions
en plus du terme constant nécessitera n = pi=1 ki coefficents : on parle de plan complet. Si on se
restreint à deux niveaux par facteur on obtient un plan complet à 2p expériences. En général, on
appelle plan factoriel tout plan d’expérinces dont le nombre d’essais est une puissance de 2 et
plan de Plackett et Burman tout autre plan. Le modèle est alors de la forme
Xp X
Y = a0 + ai1 i2 ···ik Xi1 Xi2 · · · Xik . (5.1)
k=1 1≤i1 <i2 <···<ik ≤p

où ai représente l’effet du facteur Xi et ai1 i2 ···ik représente l’effet de l’interaction des facteurs Xi1 ,
Xi2 , · · · , Xik . a0 représente la réponse au centre du domaine expérimental. Un plan est dit saturé s’il
comporte autant d’essais que de coefficients à déterminer dans le modèle mathématique. De façon
analogue, un plan est dit sursaturé s’il comporte moins d’essais que de coefficients à déterminer
dans le modèle mathématique.
On peut représenter graphiquement l’effet individuel d’un facteur. Il suffit de parcourir les
différents niveaux du facteur et à chaque niveau fixé de calculer la moyenne arithmétique des
réponses obtenues en faisant varier les autres facteurs. Un graphe non-constant illustre l’effet du
facteur ; en particulier dans le cas à deux niveaux on obtient un segment de droite de pente ai pour
le facteur i. Defaçon similaire, on peut représenter l’effet de l’interaction entre deux facteurs en
représentant les effets de l’un pour chaque niveau fixé de l’autre. On obtient plusieurs graphes qui
sont les translatés verticaux les uns des autres s’il n’y a pas d’interaction. Dans le cas particulier

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


50 CHAPITRE 5. PLANS D’EXPÉRIENCES
à deux facteurs, deux segments de droites à supports parallèles s’interprètent comme l’absence
d’interactions. Il est difficile de faire une représentation graphique des interactions au delà de
deux facteurs. Une analyse statistique de la significativité des coefficients du modèle s’impose
alors et nécessite la répétition des expériences (au moins trois fois en général).

Exemple 5.1.1 Un chauffeur désire mesurer l’impact de la vitesse et de la surcharge sur la


consommation de sa voiture en cl/km. Il roule en général avec pas plus de 300kg à une vitesse
comprise entre 80km/h et 120km/h. On décide d’utiliser un plan d’expériences complet à facteurs
à deux niveaux.
1. Déterminer les matrices d’expérimentation et d’expérience. Y associer une représentation
graphique du domaine expérimental.
2. On dispose d’un parcours test de 10km de long et d’une charge de 300kg. Selon vous quel
est le meilleur ordre pour les expériences ?
3. On choisit le modèle polynomiale

c (v, s) = c0 + c1 v + c2 s + c12 sv.

Ce modèle en termes d’effets correspond à

c (x1 , x2 ) = a0 + a1 x1 + a2 x2 + a12 x1 x2 .

(a) Quel est le changement de variable adéquat pour la transformation des facteurs ?
(b) Quelle est la consommation si on roule à 80km/h avec une charge d’une demi tonne ?
(c) Déterminer de façon formèle les coefficients a0 , a1 , a2 , a12 et les interpréter.
(d) Déterminer de façon numérique les coefficients a0 , a1 , a2 , a12 .lorsque dans l’ordre
d’expérimentation évoqué ci-avant on obtient les réponses 8, 3 ; 10, 7 ; 9.7 et 12, 3. En
déduire le modèle avec des coefficients légaux c0 , c1 , c2 , c12 .
(e) Quelle est la consommation si on roule à 90km/h avec une charge de 100kg ?
(f ) Quelle est la consommation supplémentaire quand je roule à 100km/h au lieu de 80km/h
avec une surcharge de 150kg ?
(g) Faire des illustrations graphiques des effets des facteurs et de leurs interactions.

5.1.3 Ordre des essais et réduction des erreurs


Il peut arriver que les conditions expérimentales inflencent les expériences. La différence entre
les réponses selon ces conditions s’appelle erreur systématique. L’ordre dans lequel on mène les
expériences peut également avoir un impact soit sur leurs résultats, soit sur la facilité à les
réaliser. Quand on réalise plusieurs fois la même mesure dans les mêmes conditions opératoires, on
constate de petites différences entre toutes ces mesures. Ces petites variations constituent l’erreur
expérimentale ou erreur pure. L’origine de ces variations doit être cherchée dans les variations
des niveaux de tous les facteurs qui peuvent modifier la réponse. On considère que l’on peut
classer les facteurs actifs sur la réponse en deux catégories : les facteurs contrôlés et les facteurs
non contrôlés. Les facteurs contrôlés sont ceux dont l’expérimentateur fixe les niveaux. Il s’agit
donc des facteurs pris en compte pour l’exécution du plan et de tous les facteurs fixés à un ni-
veau constant pendant toute l’expérimentation. On considère (hypothèse de la régression linéaire)
que ces facteurs n’introduisent pas d’erreurs. Les facteurs non contrôlés sont les autres facteurs,

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


51 CHAPITRE 5. PLANS D’EXPÉRIENCES
ceux dont les niveaux ne sont pas fixés par l’expérimentateur. Ces facteurs peuvent faire varier la
réponse dans des limites plus ou moins importantes selon les variations imprévues et inconnues
de leurs niveaux. On distingue plusieurs types de facteurs non contrôlés donnant lieu aux trois
techniques de lutte suivantes : blocking, plans anti-dérive et randomisation.
— Blocking : cela consiste à identifier des conditions dans lesquelles le facteur non contrôlé
reste à des niveaux constants et à mener l’expérience pour chacun de ces niveaux (saisons,
parcelles, opérateurs, etc). Le blocking permet ainsi d’étudier l’effet du facteur non contrôlé,
en particulier lorsque ses variations sont non négligeables.
— Plans anti-dérive : le niveau d’un facteur non contrôlé peut diminuer ou augmenter
régulièrement (pas constant) en fonction des essais. Les réponses seront modifiées par cette
variation de niveau et les effets des facteurs du plan seront faussés si l’on ne prend pas
de précautions. Cette variation progressive s’appelle une dérive. Comme exemples, on peut
citer l’activité d’un catalyseur qui diminue progressivement, le flux d’un liquide qui se
réduit à cause du bouchage progressif d’un tuyau, une solution de soude qui s’altère au
fur et à mesure du temps qui passe, ou le vieillissement d’une colonne chromatographique
qui sépare de moins en moins bien, etc. Les plans anti-dérives se basent sur l’ordre des
expériences et l’ajout des points de répétition de l’expérience dans les buts respectifs de
réduire l’impact de la dérive sur les effets (principaux) et d’évaluer l’évolution de cette
dérive, afin de pouvoir apporter les corrections nécessaires à l’obtention des effets comme
s’il n’y en avait pas. Le nombre de répétitions dépend de l’enjeu de l’étude et du coût des
essais. Il faut prévoir au moins un point de répétition au début, au milieu et à la fin du plan.
On peut prévoir au plus un point de répétition entre chaque essai du plan. Ces répétitions
peuvent être faites au centre du domaine expérimental représenté par le niveau 0. Hormis
les corrections, les points de répétition (ou encore points de contrôle) ne sont pas à priori
utilisés pour le calcul des effets des facteurs et des interactions. Toutefois, si les points de
contrôle valident le modèle, on peut les intégrer ensuite pour le recalcul des coefficients.
Exemple 5.1.2 Dans le cas d’un plan à 3 facteurs contrôlés et 1 facteur non contrôlé on
a la matrice d’expérience complète

Essai n◦ I 1 2 3 12 13 23 123 réponse avec dérive


1 +1 −1 −1 −1 +1 +1 +1 −1 y1 + h
2 +1 +1 −1 −1 −1 −1 +1 +1 y2 + 2h
3 +1 −1 +1 −1 −1 +1 −1 +1 y3 + 3h
4 +1 +1 +1 −1 +1 −1 −1 −1 y4 + 4h
5 +1 −1 −1 +1 +1 −1 −1 +1 y5 + 5h
6 +1 +1 −1 +1 −1 +1 −1 −1 y6 + 6h
7 +1 −1 +1 +1 −1 −1 +1 −1 y7 + 7h
8 +1 +1 +1 +1 +1 +1 +1 +1 y8 + 8h
Influence facteur 36h 4h 8h 16h 0 0 0 0

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


52 CHAPITRE 5. PLANS D’EXPÉRIENCES
On en déduit que les effets des facteurs sont modifiés comme il suit :
36
a00 = a0 + h = a0 + 4, 5h
8
4
a01 = a1 + 5h = a1 + 0, 5h
8
8
a02 = a2 + h = a2 + h
8
16
a03 = a3 + h = a3 + 2h
8
0
a012 = a12 + h = a12
8
0
a13 = a13
a023 = a23
a0123 = a123 .

On constate que les quatre interactions ne sont pas influencées par la dérive contraire-
ment aux principaux effets. On peut y remédier en modifiant l’ordre des essais de la façon
suivante :
Essai n◦ I 10 20 30 10 20 10 30 20 30 10 20 30 réponse avec dérive
7(1) +1 −1 −1 −1 +1 +1 +1 −1 y1 + h
6(2) +1 +1 −1 −1 −1 −1 +1 +1 y2 + 2h
2(3) +1 −1 +1 −1 −1 +1 −1 +1 y3 + 3h
3(4) +1 +1 +1 −1 +1 −1 −1 −1 y4 + 4h
4(5) +1 −1 −1 +1 +1 −1 −1 +1 y5 + 5h
1(6) +1 +1 −1 +1 −1 +1 −1 −1 y6 + 6h
5(7) +1 −1 +1 +1 −1 −1 +1 −1 y7 + 7h
8(8) +1 +1 +1 +1 +1 +1 +1 +1 y8 + 8h
Influence facteur 36h 0 0 0 16h 4h 0 8h

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


53 CHAPITRE 5. PLANS D’EXPÉRIENCES
En ajoutant le nombre maximal de répétitions on obtient

Essai n◦ 10 20 30 Dérives
01 0 0 0 h
7(1) −1 −1 −1 2h
02 0 0 0 3h
6(2) +1 −1 −1 4h
03 0 0 0 5h
2(3) −1 +1 −1 6h
04 0 0 0 7h
3(4) +1 +1 −1 8h
05 0 0 0 9h
4(5) −1 −1 +1 10h
06 0 0 0 11h
1(6) +1 −1 +1 12h
07 0 0 0 13h
5(7) −1 +1 +1 14h
08 0 0 0 15h
8(8) +1 +1 +1 16h
09 0 0 0 17h

— Randomisation : elle consiste à choisir l’ordre des essais de manière aléatoire. La rando-
misation permet de transformer des erreurs systématiques en erreurs aléatoires et d’utiliser
les tests statistiques. Toutefois, elle a pour inconvénient d’accroı̂tre l’erreur alétoire et
de rendre plus difficile la détection les facteurs peu influent. Si les erreurs systématiques
sont importantes, la randomisation peut devenir une technique inappropriée. Les erreurs
systématiques doivent être éliminées avant la randomisation. La procédure correcte est
d’éliminer d’abord les erreurs systématiques les plus importantes en utilisant le blocking
ou les plans anti-dérive et de randomiser ensuite.

5.1.4 Plans optimaux


L’expérimentateur se demande s’il ne pourrait pas choisir le nombre d’essais plutôt que le
plan lui-même. Quand on considère l’aspect économique, la question devient : ”Quel est le nombre
minimal d’essais nécessaire pour traiter le problème ?”. Les plans construits à cet effet portent
parfois le nom de ”custom designs” dont la traduction pourrait être ”plans sur mesure” pour
bien montrer qu’ils sont conçus pour s’adapter à l’étude et aux exigences de l’expérimentateur.
L’optimalité d’un plan est considéré comme son aptitude à minimiser l’erreur sur les effets, ce en
réduisant la variance. Ainsi, les plans optimaux sont plus adaptés pour le criblage et les points de
contrôle ne sont plus choisis nécessairement au centre du domaine expérimental. L’exemple des
pésées d’Hotelling permet de mieux aborder le concept d’optimalité évoqué ci-avant.
On considère un balance à deux plateaux et des masses permettant d’estimer la masse d’un
produit donné. Le principe est de mettre le produit sur un plateau et les masses sur l’autre de
façon à obtenir un équilibre. L’estimation faite donne en moyenne la vrai masse du produit mais
avec un écart type σ. Si on a deux produits A et B qui sont pesés individuellement on commet à
chaque fois une erreur moyenne de ±σ. On peut décider de peser mA + mB en mettant les produits
A et B sur le même plateaux, puis leur différence mA −mB en les mettant sur des plateaux opposés

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


54 CHAPITRE 5. PLANS D’EXPÉRIENCES
et en équilibrant par des masses d’un côté. Cette approche permet en tirant mA et mB d’avoir des
estimation dont la variance est la moitié de celle de l’autre approche. Elle est donc meilleur. Cet
exemple peut être transposé aux plans d’expérience en termes de facteurs pour les produits et de
niveaux pour les plateaux de la balance. On a en effet les deux matrices suivantes
   
+1 0 +1 +1
M1 = et M2 = .
0 +1 +1 −1

Manifestement, la plus optimale est M2 . De façon général, on garantit l’optmalité d’une matrice
M par la maximalité du déterminant de la matrice carré symétrique M T M : il s’agit de la D-
optimalité. Selon les valeurs associées au niveaux, on peut connaı̂tre cette valeur maximale qui
sera atteinte si les colonnes sont deux à deux orthogonales : elle vaudra exactement la somme des
carrés des norme euclidiennes de chacune des colonnes. Ainsi, une matrice optimale est un extrait
des colonne d’une matrice d’Hadamard dont les coefficients sont le moins possible nuls. Pour des
plans à niveaux −1 et +1 on atteint la D-optimalité avec un déterminant valant nn .

5.2 Plans factoriels fractionnaires ou plans de criblage


Dans les cas des facteurs à deux niveaux, un plan factoriel fractionnaire désigne un plan
d’expérience à 2p−k essais, k = 0, · · · , p. En effet le nombre d’expérience pour un plan factoriel
complet dévient très vite assez grand. On se contente souvent de savoir quels sont les facteurs
influents, et parfois on va un peu plus loin en examinant les interactions d’ordre 2. C’est la raison
pour laquelle ces plans sont souvent appelés plans de criblage. Ces plans permettent d’étudier
beaucoup de facteurs et de déterminer ceux qui sont influents. L’analyse ne va souvent pas plus
loin et atteint rarement la modélisation mathématique des réponses. Les modèles mathématiques
utilisés sont donc, eux aussi, beaucoup plus simples. On emploie des modèles ne comportant que
les facteurs principaux au premier degré ou des modèles avec des interactions d’ordre 2 suivant
les objectifs de l’étude. L’interprétation des plans fractionnaires nécessite de connaı̂tre la théorie
des aliases et d’appliquer des hypothèses d’interprétation suivantes :
— Les interactions d’ordre trois et toutes celles d’ordre plus élevé peuvent être négligées ;
— Tous les coefficients aliasés dans un contraste faible (négligeable) sont eux-mêmes faibles
(négligeables) ;
— Si deux contrastes sont forts, on se méfiera de leur interaction qui peut être forte ;
— Si deux contrastes sont faibles, on suppose que leur interaction l’est aussi ;
— Un facteur principal faible et un facteur principal fort engendrent, le plus souvent mais pas
toujours, une interaction faible.
Le nombre d’expériences devenant réduit, on a l’inconvénient que certains facteurs se confondent
à certaines interactions : on dit que les coefficients de ces facteurs sont aliasés à ceux des interac-
tions associées. L’aliasage se manifeste par l’égalité des colonnes dans la matrice d’expérience ; dans
le modèle seul l’un des facteurs confondus apparaı̂t et son coefficient est la somme des coefficients
de tous. Le nouveau coefficient obtenu est appelé aliase ou contraste ou confusion.

5.2.1 Calcul de Box et générateurs d’aliases


Le calcul de Box permet de retrouver rapidement pour les plans fractionnaires à deux niveaux,
comment les effets et les interactions sont aliasés dans les contrastes. Dans la notation de Box,
on désigne par le chiffre 1 (en gras) la colonne des signes du facteur 1, signes ordonnés selon la

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


55 CHAPITRE 5. PLANS D’EXPÉRIENCES
présentation de Yates (alternance de −1 e +1 tous les 21−1 chiffres). De même, on désigne par le
chiffre 2 (en gras) la colonne des signes du facteur 2 (alternance de −1 e +1 tous les 22−1 chiffres).
Enfin on note −I et +I les matrices colonnes dont toutes les composantes valent respectivement −1
et +1. On considère la multplication de deux vecteurs colonnes de même dimension par (U × V )i =
Ui ×Vi . Grâce au calcul de Box, on peut générer un plan factoriel fractionnaire 2p−k sur la base d’un
ensemble k relations d’équivalences appelé groupe de générateurs d’aliases (GGA) ou relation
de définition. Chaque générateur aliases consiste à identifier un des k facteurs supplémentaires
à l’une des interactions. Le nombre k est inférieur ou égale au nombre d’interaction qui vaut
2p−k + k − p − 1 ; ce qui est équivalent à prendre .

k ≤ p − log2 (p + 1) (5.2)

Exemple 5.2.1 .
1. Pour une expérience à 5 facteur, pour construire un plan fractionnaire 25−2 on peut considérer
entre autres comme GGA les ensemble de relations {4 = 12; 5 = 13} ou {4 = 12; 5 = 23}
ou {4 = 12; 5 = 123}. Si on reste sur GGA = {4 = 12; 5 = 13} on obtient la matrice
d’expérience :

Essai n◦ I 1 2 3 4=1×2 5=1×3


1 +1 −1 −1 −1 +1 +1
2 +1 +1 −1 −1 −1 −1
3 +1 −1 +1 −1 −1 +1
4 +1 +1 +1 −1 +1 −1
5 +1 −1 −1 +1 +1 −1
6 +1 +1 −1 +1 −1 +1
7 +1 −1 +1 +1 −1 −1
8 +1 +1 +1 +1 +1 +1

En effet, de 4 = 12 et 5 = 13, en multipliant par 1, 2, 3, 4 et 5 on obtient les équivalences


I = 124 = 135 = 2345, 1 = 24 = 35 = 12345, 2 = 14 = 345 = 1235, 3 = 15 = 245 = 1234,
4 = 12 = 124 = 235 = 1345, 5 = 13 = 234 = 1245, 25 = 34 = 123 = 145, 23 =
45 = 125 = 134.
Le modèle complet est

y =a0 + a1 x1 + a2 x2 + a3 x3 + a4 x4 + a5 x5 + a12 x1 x2 + a13 x1 x3 + a14 x1 x4 + a15 x1 x5


+ a23 x2 x3 + a24 x2 x4 + a25 x2 x5 + a34 x3 x4 + a35 x3 x5 + a45 x4 x5 + a123 x1 x2 x3
+ a124 x1 x2 x4 + a125 x1 x2 x3 + a134 x1 x3 x4 + a135 x1 x3 x5 + a145 x1 x4 x5 + a234 x2 x3 x4
+ a235 x2 x3 x5 + a245 x2 x4 x5 + a345 x3 x4 x5 + a1234 x1 x2 x3 x4 + a1235 x1 x2 x3 x5
+ a1245 x1 x2 x4 x5 + a1345 x1 x3 x4 x5 + a2345 x2 x3 x4 x5 + a12345 x1 x2 x3 x4 x5 .

Le modèle avec l’aliasage considéré est

y = `0 + `1 x1 + `2 x2 + `3 x3 + `4 x4 + `5 x5 + `23 x2 x3 + `25 x2 x5

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


56 CHAPITRE 5. PLANS D’EXPÉRIENCES
avec

`0 = a0 + a124 + a135 + a2345


`1 = a1 + a24 + a35 + a12345 ,
`2 = a2 + a14 + a345 + a1235 ,
`3 = a3 + a15 + a245 + a1234 ,
`4 = a4 + a12 + a235 + a1345 ,
`5 = a5 + a13 + a234 + a1245 ,
`23 = a23 + a45 + a125 + a134 ,
`25 = a25 + a34 + a123 + a145

2. On définit le plan complémentaire au plan précédent avec les générateur {4 = −12; 5 = −13}.
On obtient les contrastes

`00 = a0 − a124 − a135 − a2345


`01 = a1 − a24 − a35 − a12345 ,
`02 = a2 − a14 − a345 − a1235 ,
`03 = a3 − a15 − a245 − a1234 ,
`04 = a4 − a12 − a235 − a1345 ,
`05 = a5 − a13 − a234 − a1245 ,
`023 = a23 − a45 − a125 − a134 ,
`025 = a25 − a34 − a123 − a145
` +`0 `1 −`01
On remarque a1 = 1 2 1 et a24 +a35 +a12345 = 2
. Ainsi, les contrastes `1 et `01 permettent
de désaliaser a1 des autres interactions.

On définit pour les plans factoriels fractionnaires le concept de résolution de la façon suivante :
— Un plan factoriel est de résolution III si les effets principaux ne sont pas aliasés entre
eux mais avec les interactions d’ordre 2 ;
— Un plan factoriel est de résolution IV si les effets principaux ne sont aliasés ni entre
eux, ni avec les interactions d’ordre 2, mais ces dernières peuvent être aliasées ;
— Un plan factoriel est de résolution V s’il n’y a aucun aliasage dans l’ensemble constitué
des effets principaux et des interactions d’ordre 2, mais les effets principaux sont aliasés
aux interactions d’ordre 4 tandis les interctions d’ordres 2 et 3 sont aliasées.

5.2.2 Evaluations d’importance de coefficients


Dans le cas d’un plan d’expériences complet, si les expériences sont répétées on peut
procéder à une analyse de la variance du modèle pour évaluer la significativité des coefficients.
En effet pour une regression à k coefficient il faut au moins k équations indépendantes garanties
justement par le plan complet. Dans le cadre d’un plan fractionnaire, cela peut être plus délicat.
Un premier raisonnement consiste à dire que tous les effets en valeur absolue inférieurs à une
certaine valeur ne sont pas assez élevés pour influencer de façon significative la réponse. Il existe
en outres deux outils permettant de se faire une idée de l’importance relative des coefficients :
les diagrammes de Pareto et de Daniel. Ces outils aident l’expérimentateur à fixer une limite

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


57 CHAPITRE 5. PLANS D’EXPÉRIENCES
entre les facteurs influents et peut-être faiblement influents. Dans cette situation on peut tenir
plusieurs types de raisonnement qui se complètent les uns les autres sans apporter chacun une
réponse définitive. L’utilisation du diagramme de Pareto se fait en ordonnant les valeurs absolues
des coefficients par ordre décroissant. On a ainsi une vue d’ensemble de tous les coefficients et
on conserve les coefficients qui sont au-dessus d’une certaine valeur et on élimine ceux qui sont
au-dessous. Il n’y a pas une grande différence de fond avec le premier raisonnement à part qu’on
s’appuie désormais sur un diagramme facilitant les comparaisons. Pour l’utilisation du diagramme
de Daniel on suppose que les coefficients de faibles valeurs suivent une distribution normale ; ils
sont assimilés aux erreurs expérimentales et s’alignent sur la droite de Henry 1 . Les coefficients de
valeur élevée ne suivent pas une distribution normale et ils ne s’alignent pas sur la droite de Henry
précédente. On distingue donc deux populations, les erreurs expérimentales et les effets à prendre
en compte. Avec le diagramme de Daniel, l’arbitraire de la décision est ainsi considérablement
diminué.

5.3 Autres plans


5.3.1 Carrés latins et plans associés
Suivant Goupy et al. dans [4] , les carrés latins figurent parmi les premiers plans d’expériences
introduits dans l’expérimentation. Il s’agit en gros de matrices ou hypercubes faisant apparaı̂tre
sur chaque ligne et chaque colonne exactement une fois chaque niveau de chaque facteur. Ils sont
surtout utilisés pour les variables discrètes. Le plus simple des carrés latins permet d’étudier 3
facteurs prenant 3 niveaux en 9 essais au lieu de 27. Il s’agit donc, si l’on étend la notation des
plans factoriels fractionnaires aux carrés latins, d’un plan 33−1 . On appelle aussi carrés latins des
plans ayant toujours 3 facteurs mais possédant 4 et 5 niveaux par facteurs. On peut aussi imaginer
des plans de 4 facteurs ayant 4 niveaux par facteurs. Il s’agit alors de plans gréco-latins ou plus
simplement de plans 44−2 qui ne comprennent que 16 essais au lieu de 256 pour le plan complet
44 . La dénomination carré latin vient du fait que les premières représentations de ces plans uti-
lisaient des lettres latines pour désigner le troisième facteur. La dénomination gréco-latin vient
du fait que les niveaux du troisième facteur étaient désignés par des lettres latines et ceux du
quatrième facteur par des lettres grecques. Si le nombre de niveaux dépasse 5, on parle de carrés
de Youden en hommage au chimiste qui les a introduits. On peut avoir, par exemple, un plan de
2 facteurs prenant 7 niveaux ou un plan de 3 facteurs prenant 8 niveaux. Les variables discrètes
ont une modélisation mathématique spécifique qui nécessite d’adapter la notion d’effet de facteur
(ANOVA, ANCOVA, etc). Nous renvoyons à le lecteur aux références [1, 4] pour un exposé détaillé
sur ces plans.

5.3.2 Plans de Koshal


Les plans de Koshal permettent de déterminer uniquement les effets principaux des facteurs
sans pouvoir évaluer les interactions. Ces plans sont pratiques lorsqu’on a de nombreux facteurs.
Ils sont basés sur le modèle mathématique linéaire sans interaction :
Xp
Y = a0 + ai X i .
i=1

1. Il s’agit d’une droite de regression basée sur les couples (xi , yi ) où xi est une modalité obsevée étant le quantile
théorique d’ordre αi et yi est le quantile théorique d’ordre αi pour la loi normale centrée-réduite N (0, 1).

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


58 CHAPITRE 5. PLANS D’EXPÉRIENCES
5.3.3 Plans de Plackett et Burman
Les plans de Plackett et Burman sont basés sur le modèle mathématique linéaire sans interac-
tion : Xp
Y = a0 + ai X i .
i=1
Ces plans sont basés sur les matrices orthogonales. Une matrice d’expérience est dite orthogonale
si ces colonnes sont deux à deux orthogonales. Une caractérisation simple de l’orthogonalité est
que pour toute paire de colonnes, les différents couples de niveaux apparaissent autant de fois
dans les essais. Cette caractérisation a pour conséquence que pour les plans à deux niveaux on
un nombre d’essais multiple de 4. Ils permettent d’avoir des nombres d’essais intermédiares aux
puissances de 2 des plans complets.

5.3.4 Plans de Taguchi


Un plan de Taguchi Ln ( pi=1 ki ) est un plan fractionnaire à n éssais pour p facteurs dont le
Q
i-ème a ki niveaux. L’objectif ici est de réduire les effets indésirables des facteurs non contrôlés.
Comme pour les plans fractionnaires, en général on se définit les facteurs
Qp et les interactions à
considérer. Ce choix définit par quoi remplacer exactement le terme i=1 ki . En général pour les
plans de Taguchi, on numérote les niveaux dans N. Par exemple pour un plan à deux niveaux on
note le niveau bas 2 et le niveau haut 1. Tout comme pour les plans de Plackett et Burman, les
matrices de Taguchi sont orthogonales au sens de l’apparition des coefficients donnés plus tôt.
Le tableau suivant est très souvent recommandé :
Etude des Etude des Etude des
interactions interactions interactions
impossibles limitées possibles
Usage Screening Screening Surface de réponse
Plans à 2 niveaux L4 (23 ) , L8 (27 ) ,
L12 (211 ) L16 (215 ) , L32 (231 ) ,
L64 (231 ) , L64 (263 )
Plans à 3 niveaux L9 (34 ) , L27 (313 ) ,
L36 (313 ) , L81 (340 )
Plans à 2 et 3 niveaux L36 (22 × 313 ) ,
L36 (211 × 312 ) L18 (2 × 3 ) L54 (21 × 325 )
1 7

Plans à 4 et 5 niveaux L18 (21 × 49 ) , L16 (45 ) , L64 (421 ) ,


L50 (21 × 511 ) L25 (56 )

5.3.5 Plans de Rechtschaffner


Les plans de Rechtschaffner sont des plans factoriels fractionnaires simplifiés qui permettent
de déterminer les effets des facteurs et les interactions d’ordre deux ; toutes les autres interactions
sont supposées nulles avant même l’expérimentation. Ils sont basés sur le modèle
Xp Xp
Y = a0 + ai X i + aij Xi Xj . (5.3)
i=1 1≤i<j≤p

Rechtschaffner a toutefois étendu ses plans aux plans du second degré et aux facteurs prenant
trois niveaux.

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


59 CHAPITRE 5. PLANS D’EXPÉRIENCES
5.4 Plans pour les surfaces de réponse
Les plans examinés précédemment n’avaient que deux niveaux d’étude par facteur et les
modèles mathématiques utilisés étaient du premier degré (avec ou sans interactions) par rapport
à chaque facteur. Ces plans sont les plus employés car ils permettent le criblage des facteurs et
conduisent parfois à des modélisations simples mais suffisantes. Toutefois, il existe de nombreux
cas où il est nécessaire d’avoir une bonne modélisation des phénomènes étudiés et où il faut passer
à des modèles mathématiques du second degré (plans composites, plans de Box-Behnken,
plans de Doehlert, etc). On fait alors appel aux plans pour surfaces de réponse qui pour p
facteurs utilisent des modèles polynomiaux de la forme
Xp Xp
Y = a0 + ai X i + aij Xi Xj . (5.4)
i=1 1≤i≤j≤p

On constate que ce modèle possède p(p+5) 2


+ 1 coefficients. Les surfaces de réponses permettent au
delà de la prédiction et de l’évaluation des effet, d’envisager la résoluton des problèmes d’optimi-
sation.

5.4.1 Plans composites


Les plans composites se prêtent bien au déroulement séquentiel d’une étude. L’un des
éléments de motivation pour passer d’un plan complet ou fractionnaire de deux niveaux à un
plan composite est la différence significative entre la réponse calculer au centre et celle observée
effectivement. Ledit passage se fait en ajoutant de nouveaux points expérimentaux sur les axes et
au centre. Les plans composites on trois parties :
— Le plan complet ou fractionnaire de deux niveaux pour lequel les points expérimentaux
sont aux sommet du domaine d’étude cubique ;
— Le plan en étoile dont les points expérimentaux sont situés ”à l’intérieur” des arêtes et sont
équidistant du centre du domaine d’étude ;
— Les points au centre du domaine d’étude.

5.4.2 Plans de Box-Behnken


Box et Behnken ont proposé en 1960 ces plans qui permettent d’établir directement des
modèles du second degré. Tous les facteurs ont trois niveaux : −1, 0 et +1. Ces plans sont faciles
à mettre en œuvre et possèdent la propriété de séquentialité. On peut entreprendre l’étude des k
premiers facteurs en se réservant la possibilité d’en ajouter de nouveaux sans perdre les résultats
des essais déjà effectués. Les points expérimentaux sont pris aux centres des arêtes et au centre (en
général trois) du domaine qui est un carré, un cube ou un hypercube selon le nombre de facteurs.
Dans le cas de deux facteurs on aura 4 + 3 = 7 points, tandis que pour trois facteurs on aura
12 + 3 = 15 points

5.4.3 Plans de Doehlert


Les points d’expériences des plans proposés par David H. Doehlert en 1970 remplissent de
manière uniforme l’espace expérimental. Pour deux facteurs les points expérimentaux sont situés
aux sommets d’un hexagone régulier et il y a un point au centre. Ayant sept points expérimentaux,
ce plan permet de calculer au moins sept inconnues, donc sept coefficients. Pour plus de deux fac-
teurs, il s’agit de choisir les extrémités et le centre d’un polygône régulier inscrit dans la sphère

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


60 CHAPITRE 5. PLANS D’EXPÉRIENCES
unité. Comme les points expérimentaux sont régulièrement répartis dans l’espace expérimental,
il sera facile d’étendre le plan vers n’importe quelle direction de l’espace en ajoutant des points
qui seront, eux aussi, régulièrement répartis. Ces plans permettent également l’introduction fa-
cile de nouveaux facteurs. Les nouvelles expériences viendront compléter les premières et aucune
expérience ne sera perdue. La seule précaution à prendre est de maintenir les facteurs non étudiés
à une valeur constante (niveau 0) pendant l’étude des facteurs actifs.

5.4.4 Les plans hybrides


5.4.5 Les plans de Mozzo

5.5 Plans de mélange


Dans les plans d’expériences classiques (plans factoriels, plans pour surfaces de réponse)
les facteurs sont indépendants. Cela signifie que l’on peut choisir en toute liberté le niveau d’un
facteur quels que soient les niveaux déjà attribués aux autres facteurs. Cette liberté est absente pas
lorsque l’on étudie des mélanges car, en général, on étudie les réponses en fonction des proportions
des constituants du mélange. Ainsi, si on considère p facteurs d’un plan de mélange on a la
contrainte fondamentale Xp
Xi = 1.
i=1
La représentation graphique du domaine expérimental est un segment, un triangle équilatéral
et un tétraèdre équilatéral respectivement en dimension 1, 2 et 3. Le diagramme des mélanges
binaires est un segment doublement orienté et gradué dont chaque point i à l’abscisse αi dans
un sens (proportion du premier élément) et 1 − αi dans l’autre (proportion du second élément),
αi ∈ [0; 1]. De façon similaire, le diagramme des mélanges ternaires est un triangle équilatéral
dont chaque côté est gradué et chaque sommet est l’origine d’une graduation et l’extrémité d’une
autre. Le triangle est nommé dans le sens direct et les graduations dans sens indirect. Tout point
de mélange ou point expérimental se repère en procédant à trois projections dans les directions et
sens de chacun des axes gradués. Les propriétés de Thalès appliquées aux triangles équilatéraux
sont pratiques pour la lecture.

5.5.1 Plans en réseaux ou de Scheffé


Les plans en réseaux (simplex lattice designs en anglais) sont les premiers plans de mélanges
qui ont été introduits. Ils ont été présentés par Scheffé dans les années 1958-1965. Les points
expérimentaux sont régulièrement repartis dans l’espace d’étude. Pour les mélanges à trois consti-
tuants, le plus simple des plans de mélanges en réseaux ne contient que les trois produits purs. Les
points représentatifs de ces produits sont aux sommets du triangle équilatéral. On peut enrichir ce
plan en construisant un maillage triangulaire régulier . Cela correspond dans un premier temps à
subdivider chaque côté du triangle en n sous-segments de longeurs n1 . On relie ensuite les extrémités
de ces sous-segments par de nouveaux segments à supports parallèles au supports des côtés du tri-
angle. Ces derniers se rencontrent en de nouveaux points à également considérer dans le nouveaux
plan d’expérience. On obtient ainsi pour p facteurs un plan {p, n} à Cn+p−1n p−1
= Cn+p−1 = (n+p−1)!
n!(p−1)!
facteurs.

Exemple 5.5.1 Représenter les plans {2, 2}, {2, 3}, {3, 2}, {3, 3} et {3, 4}.

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


61 CHAPITRE 5. PLANS D’EXPÉRIENCES
5.5.2 Plans de mélange centrés
Les plans de mélanges centrés (Simplex-centroid designs en anglais) pour p facteurs ont
trois constituants :
— Les produits purs ;
— Les mélanges moitié-moitié des produits purs deux à deux ;
— Le mélange contenant un p-ième de chaque produit pur (point central).
Ils diffèrent des plan en réseaux {p, 2} par l’ajout du point central. Ils ont donc au total
2p − 1 points de composition. Les plans de mélanges centrés augmentés (Augmented Simplex-
centroid designs en anglais) sont des plans de mélanges centrés auxquels on ajoute les centres
de gravité des simplex unitaires (éléments du maillage). Par exemple, le plan de mélanges centré
pour trois composants comprend quatre simplex unitaires. Le centre de gravité de l’un des simplex
unitaires est déjà occupé par le point central. Il reste donc à ajouter trois points au centre des
trois autres simplex unitaires.

5.5.3 Modélisation mathématique des plans de mélanges


Les modèles mathématiques appliqués aux plans de mélanges prend en compte la contrainte
fondamentale des mélanges. Pour un modèle linéaire
Xp
Y = a0 + ai X i ,
i=1

grâce à la contrainte fondamentale des mélanges on obtient que


Xp
Y = (a0 + ai ) Xi
Xpi=1
= bi X i .
i=1

De la même façon le modèle quadratique


Xp Xp
Y = a0 + ai Xi + aij Xi Xj
i=1 1≤i≤j≤p

peut se réduire à Xp Xp
Y = bi X i + bij Xi Xj .
i=1 1≤i<j≤p

Le modèle cubique complet est


Xp Xp Xp
Y = bi X i + bij Xi Xj + b0ij Xi Xj (Xi − Xj ) .
i=1 1≤i≤j≤p 1≤i≤j≤p

A la place du modèle cubique complet il est courant d’utilisé le plan cubique simplifié
Xp Xp Xp
Y = bi X i + bij Xi Xj + b0ijk Xi Xj Xk .
i=1 1≤i≤j≤p 1≤i<j<k≤p

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


Chapitre 6

Statistique explratoire

6.1 Analyse en composante principale (ACP) et analyse


canonique (AC)
6.1.1 Analyse en composante principale (ACP)
6.1.2 Analyse canonique (AC)

6.2 Analyse des correspondances


6.2.1 Analyse factorielle des correspondances (AFC)
6.2.2 Analyse des correspondances multiples (ACM)

6.3 Classification
6.3.1 Classification hiérarchique
6.3.2 Les K-moyennes
6.3.3 Séparateurs à vaste marge (SVM)
6.3.4 Réseaux de neurones

62
Chapitre 7

Quelques exercices

7.1 Travaux personnels des étudiants


Exercice 7.1.1 Estimations non paramétriques : outils, méthodes et cas pratiques.

Exercice 7.1.2 Tests non paramétriques outils, méthodes et cas pratiques.

7.2 Notions de probabilité


Exercice 7.2.1 Le mot mémoire d’un ordinateur est codé sur 32 bits.
1. Combien de différents mots peut on former ?
2. Si la mémoire a une capacité de 10 Mio, combien de mots peuvent y être stockés ?
3. Combien de phrases possibles peuvent être lues en mémoire à chaque instant ?

Exercice 7.2.2 On considère le mot ”Maintenance”.


1. Combien de mots de sept lettres distinctes peuvent être constitués à partir des lettres de ce
mot ?
2. Combien de mots de trois lettres distinctes peuvent être constitués à partir des lettres de ce
mot ?
3. Combien de mots de trois lettres distinctes peuvent être constitués à partir des lettres de ce
mot, sans tenir compte de l’ordre des lettres ?
4. Combien de mots de quatre lettres peuvent être constitués à partir des lettres de ce mot ?

Exercice 7.2.3 Combien y-a-t-il de façons de partager 4 stylos identiques à 5 individus.

Exercice 7.2.4 Soient X et Y deux variables aléatoires réelles.


1. Montrer que E [X + Y ] = E [X] + E [Y ].
2. Montrer que E [aX] = aE [X].
3. Déduire des questions précédentes que V ar [aX + bY ] = a2 V ar [X] + 2abCov [X, Y ] +
b2 V ar [Y ] .
4. Montrer que Cov [X, Y ] = E [XY ] − E [X] E [Y ]. En déduire que V ar [X] = Cov [X, X].

63
64 CHAPITRE 7. QUELQUES EXERCICES
1 −|x|
Exercice 7.2.5 Soit la loi dite exponentielle double (ou de laplace) de densité f (x) = 2
e
(x ∈ R).
1. Déterminer sa fonction génératrice. En déduire son espérance mathématique et sa variance.
E [(X−E[X])3 ]
2. Calculer son coefficient d’asymétrie σ3
.
E [(X−E[X])4 ]
3. Calculer son coefficient d’aplatissement ou curtose σ4
− 3.

Exercice 7.2.6 Soient un n1 -échantillon (X1 , · · · Xn ) de loi mère N (mX , σX ), et un n2 -échantillon


(Y1 , · · · Yn ) de loi mère N (mY , σY ). On suppose que X N (mX , σX ), Y N (mY , σY ) et qu’il
y a indépendance.
1. Montrer que ψX+Y = ψX ψY , où ψX désigne la fonction caractéristique de la variable X.
h i
σ2
On montre que ψX (t) = exp imX t − 2X t2 .
2. Déterminer ψX+Y , ψX et ψX−Y , où X désigne la moyenne de l’échantillon (X1 , · · · Xn1 ).
3. Déduire des questions précédentes une expession équivalante à V ar[X − Y ].

Exercice 7.2.7 Soient un n-échantillon (X1 , · · · Xn ) dont la loi mère est suivie par une variable
X.
1. Montrer que εn P (|X| > ε) ≤ E [|X|n ]. En déduire l’inégalité de Tchebichev

V ar [X]
P (|X − E [X]| > ε) ≤
ε2

2. Démontrer que la moyenne empirique X converge en probabilité vers E [X].


h i
3. Montrer que l’intervalle X − √σnk
X
, X + √σnk
X
est un intervalle de confiance de la moyenne
de risque k.
n
4. Montrer que pour tout réel x, lim 1 + nx = ex . En déduire une preuve du théorème
n→+∞
de la limite centrale. (Suggestion : usage des fonctions caractéristiques ou génératrices, et
approximation par dévéloppement à l’ordre deux)

7.3 Estimateurs paramétriques et Intervalles de confiances


Exercice 7.3.1 On considère un n-échantillon (X1 , · · · Xn ) dont
 la loi mère est suivie par une
variable X. On considère la statistique d’ordre X(1) , · · · X(n) où X(r) est en r-ième position si
l’on classe du plus petit au plus grand (X1 , · · · Xn ) (on considère que Xi précède Xj si Xi < Xj ,
X n
1
ou i < j et Xi = Xj ). On considère en outre la fonction Fn : x 7→ n 1|{]−∞;x]} (Xi ).
i=1

1. (a) Montrer que pour tout x, Fn (x) est un estimateur sans biais de FX (x). Montrer en
outre que Fn (x) converge presque sûrement vers FX (x).
 q 
FX (x)(1−FX (x))
(b) Etablir la convergence en loi de Fn (x) vers N FX (x) , n
. Remarquer
que cette convergence est uniforme.
2. On désigne par FX(i) (x) la probabilité qu’au moins i termes de l’échantillon soient inférieures
à x.

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


65 CHAPITRE 7. QUELQUES EXERCICES
Xn
(a) Montrer que FX(i) (x) = Cnk [FX (x)]k [1 − FX (x)]n−k
k=i
(b) Calculer pour tout x la limite lim FX(1) (x) et lim FX(n) (x).
n→+∞ n→+∞

(a) Lorsque n = 2m, calculer la probabilité Pn (x) = P X(m) ≤ x et X(m+1) ≥ x .
(b) Montrer que la médiane de X maximise Pn . En déduire un estimateur Xn0.5 de cette
médiane.
Exercice 7.3.2 Soit X B (p). Calculer la borne de Cramer-Rao pour l’estimation de la va-
riance.
Exercice 7.3.3 On veut estimer le rendement d’un engrais pour la culture du blé. Sur douze
parcelles expérimentales, on a trouvé les rendements suivants en tonnes par hectare :
7.7 8.4 7.8 8.2 7.9 8.5 8.4 8.2 7.6 7.8 8.4 8.3
Donner un intervalle de confiance à 95% pour le rendement moyen de l’engrais (en supposant
que ces quantités suivent une loi log-normale).
Exercice 7.3.4 Un stock comporte 10000 pièces. Pour évaluer le nombre de pièces défectueuses
dans le stock, on tire au hasard 400 pièces dont on constate que 45 sont défectueuses.
1. Montrer que la variance d’une variable de Bernoulli est inférieure ou égale à 0.25.
2. Donner un intervalle de confiance à 99% pour le nombre total de pièces défectueuses. Dans
un premier cas on prendra l’écart-type égal à 0.5, puis on le prend inconnu.
Exercice 7.3.5 On veut évaluer la différence des proportions de pièces défectueuses dans deux
procédés de fabrication différents. Pour cela on tire au hasard 1000 pièces réalisées selon le premier
procédé. Les ayant testées on en a trouvé 86 défectueuses. On opère de même pour 800 pièces
réalisées selon le deuxième procédé et on trouve 92 défectueuses. Donner un intervalle de confiance
sur la différence des proportions de pièces défectueuses dans les deux procédés.
Exercice 7.3.6 Dans une ville on donne la répartition du nombre de jours sans accident, avec
un accident, etc. Parmi 50 jours d’observation au cours d’une même année :
Nombre d’accidents 0 1 2 3 4
Nombres de jours 21 18 7 3 1
On suppose que le nombre d’accidents par jour suit une loi de Poisson. Donner un intervalle
de confiance de niveau 0.95 pour le nombre moyen d’accident par jour.

7.4 Tests paramétriques et catégoriels


Exercice 7.4.1 Le temps qui sépare l’arrivée d’une personne et de son successeur dans une file
d’attente est modélisé par un loi E (λ). Après un échantillonnage, on fait le test du Rapport de
Vraisemblance (RV) simple (H0 ) : λ = 1 versus (H1 ) : λ = 0.4. Quel est le résultat ?
Nombre de termes 30 35 15 30 20 10 5 5 8 9
Temps (m) 0.1 0.15 0.2 0.25 0.45 0.55 0.7 0.8 0.95 1
Nombre de termes 5 6 6 4 2 5 4 1 10 2
Temps (m) 1.2 1.55 1.75 1.9 2 2.5 2.8 3 3.5 5

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


66 CHAPITRE 7. QUELQUES EXERCICES
Exercice 7.4.2 En un point de captage d’une source, on a répété six mesures du taux d’oxygène
dissous dans l’eau (en partie par million). On a trouvé

4.92 5.10 4.93 5.02 5.06 4.71

La norme en dessous de laquelle on ne doit pas descendre pour la potabilité de l’eau est 5ppm.
Peut-on affirmer que l’eau est potable ?

Exercice 7.4.3 Une étude sur 5 années consécutives, s’intéresse à la production annuelle de deux
variétés A et B de maı̈s. Le tableau suivant est obtenu :
1999 2000 2001 2002 2003
A 10 9 15 18 12
B 13 10 11 8 11

1. Estimer les variances des productions des variétés A et B. Donner leurs intervalles de
confiance à 99%.
2. On suppose que les deux variétés ont la même moyenne.
(a) La variété A est-elle meilleure que la variété B ?
(b) La variété B est-elle meilleure que la variété A ?
(c) Les deux variétés sont elles similaires ?

Exercice 7.4.4 Un nouveau vaccinn contre le VIH-SIDA est expérimenté auprès de la population
d’une ville d’Afrique du sud. On prend deux échantillons A et B de 300 personnes chacun. On
injecte le vaccin aux individus de l’échantillon A et un placebo à ceux de l’échantillon B. Au bout
d’un an on constante que 30 personnes de l’échantillon A sont infectés et 70 de l’échantillon B.
Que dire de l’éfficacité du vaccin ? (Remarque : La population B est dite témoin, et elle permet
d’évaluer la probabilité naturelle de contracter le virus du VIH-SIDA).

Exercice 7.4.5 Suite à des sondages, l’institut SONDACAM donne 511 avis favorables au can-
didat A sur 1000 personnes interrogées, l’institut SONDAFR donne 480 favorables sur 945. La
proportion d’avis favorables donnée par SONDACAM est-elle supérieure à celle donnée par SON-
DAFR ?

7.5 Analyse des données statistiques


Exercice 7.5.1 Une étude sur le diamètre des écrous produits par trois machines donne en mi-
limètre. :
A 15 16 9 13 17 11
B 13 9 17 18 15 14 13 18
C 14 10 15 5 11 9 7
1. Dresser une table d’ANOVA. Y-a-t-il une différence entre les pièces produites par ces ma-
chines ?
2. Supposons que la norme soit de 11mm. Quelles sont les machines conformes ? On supposera
que les écarts-type sont connus et valent tous 1mm.

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


67 CHAPITRE 7. QUELQUES EXERCICES
Exercice 7.5.2 Pour établir l’impact de la saison et de la race du café sur sa production annuelle
en tonnes, on mêne une enquête. A l’issue de celle-ci on obtient

S-Sèche S-pluie
Variété A 13, 10, 11, 12 9, 15, 16, 15
Variété B 7, 8, 10, 11 13, 17, 18, 19
Que conclure ?

Cameroun, Université de Ngaoundéré David Jaurès FOTSA MBOGNE


Annexe A

Bruit

On considère un processus stochastique réel (Xt )t∈T .

Definition A.0.1 1. (Xt )t∈T est un bruit blanc fort (BBF), si les variables aléatoires Xt sont
toutes de moyenne nulle (ie centrées), indépendantes et identiquement distribuées (iid).
2. (Xt )t∈T est un bruit blanc faible (BBf ), si les variables aléatoires Xt sont centrées, de même
variance finie σ 2 et sont deux à deux de covariances nulles.
3. (Xt )t∈T est un bruit blanc gaussien (BBG), si les variables aléatoires Xt sont iid et de loi
commune la gaussienne centrée réduite.

68
Annexe B

Fonction de Bessel

On considère l’équation différentielle du second ordre suivante :


d2 x dx
t2 2 + t + t2 − ν 2 t = 0

(B.1)
dt dt
1. On appelle fonction de Bessel de première espèce la solution à l’équation (B.1), qui est
définie en t = 0. On la note Jν .
2. On appelle fonction de Bessel de deuxième espèce la solution à l’équation (B.1), qui n’est
pas définie en t = 0. On la note Yν .
On montre qu’on a asymptotiquement
r  
2 x − πν
Jν (t) ' cos
πt 2 − π4
et r  
2 x − πν
Yν (t) ' sin
πt 2 − π4
On considère l’équation différentielle du second ordre suivante :
d2 x dx
t2 2 + t − t2 − ν 2 t = 0

(B.2)
dt dt
1. On appelle fonction de Bessel modifiée de première espèce la solution à l’équation (B.1),
qui est définie en t = 0. On la note Iν .
2. On appelle fonction de Bessel modifiée de deuxième espèce la solution à l’équation (B.1),
qui n’est pas définie en t = 0. On la note Kν .
On montre qu’on a asymptotiquement
et
Iν (t) ' √
2πt
et r
π −t
Kν (t) ' e
2t
Definition B.0.2 On appelle fonctions Hankel ou de Bessel de troisième espèce, les fonctions
H1,ν (t) = Jν (t) + iYν (t)
et
H2,ν (t) = Jν (t) − iYν (t)

69
Bibliographie

[1] COHEN C., Introduction aux plans d’expériences, Rev. Statistique Appliquée, XXXVII (2),
pp 17-46, 1989.
[2] DAGNELIE P., Principes d’expérimentation : Planification des expériences et analyse de leurs
résultats, Les Presses Agronomiques de Gembloux, A.S.B.L., 2012.
[3] EASTERLING R.G., Fundamentals of Statistical Experimental Design and Analysis, John
Wiley & Sons, Ltd, 2015.
[4] GOUPY J., CREIGHTON L., Introduction aux plans d’expériences, troisième édition, Dunod,
2006.
[5] Gut A., Probability : A Graduate Course, Springer Science+Business Media Inc., 2005.
[6] LEJEUNE M., Statistique : la Théorie et ses Applications, deuxième édition, Springer-Verlag
France, Paris, 2010.
[7] SAPORTA G., Probabilités ; Analyses de données et Statistique, deuxième édition, TECHNIP,
Paris 2006.
[8] STEPHENS L., Theory and Problems of Beginning Statistics, Schaum’s Outlines, McGraw-
Hill, 1998.

70

Vous aimerez peut-être aussi