Cours de Probabilités-Statistiques Ingénieur
Cours de Probabilités-Statistiques Ingénieur
18 septembre 2019
Table des matières
1 Généralités de probabilité 1
1.1 Variables aléatoires discrètes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 2
1.2 Variables aléatoires continues . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
1.3 n-uplet de variables aléatoires et échantillonnage . . . . . . . . . . . . . . . . . . . 9
1.4 Convergence d’une suite de variables aléatoires . . . . . . . . . . . . . . . . . . . . 13
1.5 Analyses descriptives . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 14
1.5.1 Les tableaux . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 14
1.5.2 Les diagrammes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 17
1.5.3 Les graphes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19
2 Estimation paramétrique 21
2.1 Généralités sur les estimateurs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21
2.2 Estimation par la méthode du maximum de vraisemblance . . . . . . . . . . . . . 24
2.3 Intervalle de confiance . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 25
3 Tests d’hypothèses 29
3.1 Tests d’hypothèses paramétriques . . . . . . . . . . . . . . . . . . . . . . . . . . . 29
3.1.1 Test du rapport de vraisemblance (RV) . . . . . . . . . . . . . . . . . . . . 30
3.1.2 Autres tests basés sur les intervalles de confiance . . . . . . . . . . . . . . 31
3.1.3 Exemples d’applications . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
3.2 Tests pour des variables catégorielles . . . . . . . . . . . . . . . . . . . . . . . . . 32
3.2.1 Test du rapport de vraisemblance . . . . . . . . . . . . . . . . . . . . . . . 33
3.2.2 Test du Khi-2 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 33
3.2.3 Tests de l’Odd Ratio (OR) et du Risque Relatif (RR) . . . . . . . . . . . . 34
3.2.4 Exemples d’applications . . . . . . . . . . . . . . . . . . . . . . . . . . . . 34
3.3 Analyses de la variance et la covariance . . . . . . . . . . . . . . . . . . . . . . . . 35
3.3.1 ANOVA à un facteur . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35
3.3.2 ANOVA à plusieurs facteurs . . . . . . . . . . . . . . . . . . . . . . . . . . 36
4 Modélisation statistique 39
4.1 Régression paramétrique . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 39
4.1.1 Le modèle linéaire général . . . . . . . . . . . . . . . . . . . . . . . . . . . 39
4.1.2 Le modèle linéaire généralisé . . . . . . . . . . . . . . . . . . . . . . . . . . 42
4.2 Analyse de la regression . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 42
4.2.1 Analyse de la variance . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 42
4.2.2 Analyse de la covariance (ANCOVA) . . . . . . . . . . . . . . . . . . . . . 44
4.3 La méthode géostatistique du krigeage . . . . . . . . . . . . . . . . . . . . . . . . 44
i
TABLE DES MATIÈRES TABLE DES MATIÈRES
5 Plans d’expériences 47
5.1 Généralités . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 47
5.1.1 Vocabulaire des plans d’expériences . . . . . . . . . . . . . . . . . . . . . . 47
5.1.2 Modélisation mathématique et plans complets . . . . . . . . . . . . . . . . 49
5.1.3 Ordre des essais et réduction des erreurs . . . . . . . . . . . . . . . . . . . 50
5.1.4 Plans optimaux . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 53
5.2 Plans factoriels fractionnaires ou plans de criblage . . . . . . . . . . . . . . . . . . 54
5.2.1 Calcul de Box et générateurs d’aliases . . . . . . . . . . . . . . . . . . . . . 54
5.2.2 Evaluations d’importance de coefficients . . . . . . . . . . . . . . . . . . . 56
5.3 Autres plans . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 57
5.3.1 Carrés latins et plans associés . . . . . . . . . . . . . . . . . . . . . . . . . 57
5.3.2 Plans de Koshal . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 57
5.3.3 Plans de Plackett et Burman . . . . . . . . . . . . . . . . . . . . . . . . . 58
5.3.4 Plans de Taguchi . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 58
5.3.5 Plans de Rechtschaffner . . . . . . . . . . . . . . . . . . . . . . . . . . . . 58
5.4 Plans pour les surfaces de réponse . . . . . . . . . . . . . . . . . . . . . . . . . . . 59
5.4.1 Plans composites . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 59
5.4.2 Plans de Box-Behnken . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 59
5.4.3 Plans de Doehlert . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 59
5.4.4 Les plans hybrides . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 60
5.4.5 Les plans de Mozzo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 60
5.5 Plans de mélange . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 60
5.5.1 Plans en réseaux ou de Scheffé . . . . . . . . . . . . . . . . . . . . . . . . . 60
5.5.2 Plans de mélange centrés . . . . . . . . . . . . . . . . . . . . . . . . . . . . 61
5.5.3 Modélisation mathématique des plans de mélanges . . . . . . . . . . . . . . 61
6 Statistique explratoire 62
6.1 Analyse en composante principale (ACP) et analyse canonique (AC) . . . . . . . . 62
6.1.1 Analyse en composante principale (ACP) . . . . . . . . . . . . . . . . . . . 62
6.1.2 Analyse canonique (AC) . . . . . . . . . . . . . . . . . . . . . . . . . . . . 62
6.2 Analyse des correspondances . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 62
6.2.1 Analyse factorielle des correspondances (AFC) . . . . . . . . . . . . . . . . 62
6.2.2 Analyse des correspondances multiples (ACM) . . . . . . . . . . . . . . . . 62
6.3 Classification . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 62
6.3.1 Classification hiérarchique . . . . . . . . . . . . . . . . . . . . . . . . . . . 62
6.3.2 Les K-moyennes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 62
6.3.3 Séparateurs à vaste marge (SVM) . . . . . . . . . . . . . . . . . . . . . . . 62
6.3.4 Réseaux de neurones . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 62
7 Quelques exercices 63
7.1 Travaux personnels des étudiants . . . . . . . . . . . . . . . . . . . . . . . . . . . 63
7.2 Notions de probabilité . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 63
7.3 Estimateurs paramétriques et Intervalles de confiances . . . . . . . . . . . . . . . 64
7.4 Tests paramétriques et catégoriels . . . . . . . . . . . . . . . . . . . . . . . . . . . 65
7.5 Analyse des données statistiques . . . . . . . . . . . . . . . . . . . . . . . . . . . . 66
A Bruit 68
ii
TABLE DES MATIÈRES TABLE DES MATIÈRES
B Fonction de Bessel 69
iii
Chapitre 1
Généralités de probabilité
Dans ce chapitre nous rappelons quelques notions de probabilité jugées utiles pour la suite du
document.
Definition 1.0.1 Soient Ω un ensemble et T ⊆ P (Ω) une famille de partie de Ω. On dit que T
est une tribu ou σ-algèbre sur Ω, si elle satisfait les conditions suivantes :
(i) ∅, Ω ∈ T .
(ii) ∀A ∈ T , CΩA ∈ T (T est stable par passage au complémentaire).
S
(iii) ∀I ⊆ N, ∀ {Ai }i∈I ⊆ T , i∈I Ai ∈ T (T est stable par réunion au plus dénombrable).
Lorsque T est une tribu (sur Ω) on appelle la paire (Ω, T ) un espace probabilisable.
Remarque 1.0.1 La condition (iii) dans la définition ci-avant peut être remplacée
T par la condi-
tion stabilité par intersection au plus dénombrable : ∀I ⊆ N, ∀ {Ai }i∈I ⊆ T , i∈I Ai ∈ T .
Exemple 1.0.1
1. Pour tout ensemble Ω, {∅, Ω} et P (Ω) sont des tribus (triviales) sur Ω. En termes d’inclu-
sion ensembliste, {∅, Ω} est la plus petite tribu sur Ω et P (Ω) est la plus grande.
2. Si Ω = {a, b} on a les tribus sur Ω sont : {∅, Ω}, P (Ω) = {∅, Ω, {a} , {b}}
3. Si Ω = {1, 4, 7} on a les tribus sur Ω sont : {∅, Ω}, {∅, {1, 4, 7} , {1} , {4, 7}},
P (Ω) = {∅, {1, 4, 7} , {1} , {4} , {7} , {1, 4} , {1, 7} , {4, 7}}, {∅, {1, 4, 7} , {4} , {1, 7}},
{∅, {1, 4, 7} , {7} , {1, 4}}.
Exemple 1.0.2
1. Pour tout ensemble Ω, la tribu engendrée par les singleton {{∅}} et {{Ω}} est {∅, Ω}. La
tribu P (Ω) engendrée par P (Ω) ou même par l’ensemble des singletons de Ω.
2. Si Ω = {1, 4, 7}, les ensembles {{1}}, {{4, 7}} et {{1} , {4, 7}} engendrent touts la tribu
{∅, {1, 4, 7} , {1} , {4, 7}} sur Ω.
3. Sur R, on définit la tribu borélienne comme la tribu engendrée par intervalles ouverts.
1
2 CHAPITRE 1. GÉNÉRALITÉS DE PROBABILITÉ
Definition 1.0.3 Soient (Ω, T ) un espace probabilisable et une application P : T → [0, 1]. On dit
que P est une probabilité sur (Ω, T ) si elle satisfait :
(i) P (∅) = 0 et P (Ω) = 1.
(ii) ∀ {Ai }i∈I⊆N ⊆ T une famille d’éléments deux à deux disjoints (ie. ∀i, j ∈ I si i 6= j alors
S P
Ai ∩ Aj = ∅), on a nécessairement P i∈I Ai = i∈I P (Ai ).
Lorsque P est une probabilité sur (Ω, T ), on appelle le triplet (Ω, T , P ) espace probabilisé.
Definition 1.0.4 Soient (Ω1 , T1 , P ) un espace probabilisé et (Ω2 , T2 ) un espace probabilisable. Une
variable aléatoire à valeurs dans Ω2 est une application mesurable X : (Ω1 , T1 , P ) → (Ω2 , T2 ) qui
vérifie ∀A ∈ T2 , X −1 (A) ≡ {ω1 ∈ Ω1 ; X (ω1 ) ∈ A} ∈ T1 . On définit la probabilité image sur
(Ω2 , T2 ) pour tout A ∈ T2 par P (A) ≡ P (X −1 (A)). P est appelée la loi de probabilité de X.
Par souci de simplicité on utilisera l’abus P (A) pour désigner P (X −1 (A)). La variable aléatoire
X est dite réelle si Ω2 ⊆ R. On distingue deux grandes classes de variables aléatoires : les discrètes
et les continues.
Une interprétation géométrique de la moyenne est celle du barycentre. Notons qu’en général
général E [g (X)] 6= g (E [X]).
On peut montrer aisément que l’opérateur E [.] est linéaire aussi bien dans le cas continu
que discontinu ; les propriétés des moments s’en déduisent. Il existe des moments particuliers à
2
l’instar du moment centré d’ordre 2 donnant la variance (V ar [X] ≡ σX ), ou du moment simple
d’ordre 1 qui est l’espérance mathématique. La racine carré de la variance lorsque cette dernière
existe est appelée écart-type (σX ). Grâce à la notion de moment on définit également le coefficient
d’asymétrie
E (X − E [X])3 E (X − µX )3
3/2 ≡ 3
σX
E (X − E [X])2
E (X − E [X])4 E (X − µX )4
2 − 3 ≡ 4
− 3.
E (X − E [X])2 σX
Le coefficient d’asymétrie est nul si la distribution est symétrique par rapport à la moyenne ;
c’est le cas pour la loi normale que nous présenterons dans la suite. S’il y a une tendance vers
la gauche de la moyenne, le coefficient d’asymétrie sera negatif ; il sera par contre positif s’il y
a une tendance à droite de la moyenne. Le coefficient d’aplatissement compare quant à lui, le
regroupement autour de la moyenne comparativement à la distribution normale pour laquelle il
vaut 0. Lorsqu’il y a une concentration relativement forte autour de la moyenne et la queue de
distribution est fine, le coefficient de curtose est négatif. Par contre, lorsqu’il y a une concentration
relativement faible autour de la moyenne et la queue de distribution est épaisse, le coefficient de
curtose est positif. La moyenne et le coefficient d’asymétrie sont des paramètres de position tandis
que la variance (de manière équivalente l’écart-type) et le coefficient d’aplatissement sont des
paramètres de dispersion.
La fonction génératrice est très importante. Elle permet notamment de calculer les moments
simples d’ordre k en appliquant ses dérivées d’ordre k à 0. En posant s = et on obtient une
seconde version de la fonction génératrice s ∈ R 7→ E sX . Avec cette version on calcule les
moments simples d’ordre k en appliquant les dérivées d’ordre k à 1. Toutefois, dans le cas d’une
variable aléatoire à valeurs finies entières et positives elle ne permettra de caculer qu’un nombre
fini de moments.
Lak fonction
−k (k)
caractéristique permet d’exprimer les moments simple d’ordre k via la relation
E X = i ψX (0). L’intérêt itX de la fonction caractéristique parrapport
à la fonction génératrice
tX
est que l’existance de E e est plus probable que celle de E e . Cela est lié aux problèmes
de convergences des sommes ou intégrales.
Listons à présent quelques lois discrètes connues :
— Loi uniforme discrète
Cette loi modélise l’équi-probabilité dans un ensemble fini. Si card (Ω2 ) = N < +∞ et
x ∈ Ω2 , alors P (X = x) = N1 . On a en outre, les caractéristiques suivantes :
1X
E [X] = x
N x∈Ω2
2
= V ar [X] = E X 2 − E 2 [X]
σX
Remarque 1.1.1 La variance est toujours positive. L’écart-type qui est sa racine carrée est donc
bien définie. On peut l’établir grâce à l’inégalité des Jensen.
E [X] = λ
V ar [X] = λ
x −1)
gX (x) = eλ(e
S : x 7→ P (X > x) = 1 − P (X ≤ x) = 1 − F (x)
Definition 1.1.6 Soit X une variable aléatoire réelle (continue ou discrète). On appelle quantile
d’ordre q ∈ [0, 1] de X, la valeur xq ∈ Ω2 telle que F (xq ) = q. Les quantiles non-nuls multiples
de 0.25 sont appelés quartiles. La médiane est le deuxième quartile, c’est à dire le quantile d’ordre
0.5.
Exercice 1.1.1 Pour chacune des lois citées dans cette section déterminer en utilisant leurs
définitions, les fonctions génératrice et caractéristique, en précisant leurs domaines de définitions
à chaque fois. Déterminer également le moment simple d’ordre 1, le moment centré d’ordre 2, les
coefficients de asymétrie et de curtose.
Exercice 1.1.2 Pour chacune des lois citées dans cette section déterminer la fonction de répartition,
la médiane et les autres quartiles.
b+a
E [X] =
2
(b − a)2
V ar [X] =
12
bx ax
e −e
gX (x) = , x 6= 0
(b − a) x
— Loi exponentielle E (λ) , λ > 0.
Ici, on s’intéresse au temps d’attente entre deux occurences d’un phénomène. La densité cor-
respondante est donnée ∀x ∈ R par f (x) = λe−λx 1|{x≥0} . On a en outre, les caractéristiques
suivantes :
1
E [X] =
λ
1
V ar [X] = 2
λ
λ
gX (x) =
λ−x
La loi exponentielle est souvent qualifiée d’être sans mémoire du fait que
E [X] = m
1
V ar [X] =
λ2
−λ2 emx
gX (x) = 2
x − λ2
Γ 1 + α1
E [X] =
λ1/α
Γ 1 + α2 − Γ2 1 + α1
V ar [X] = .
λ2/α
— Loi de Gauss ou normale N (m, σ 2 ).
La loi de Gauss est l’une des loi les plus utilisées autant en probabilité qu’en statistique.
Elle a entre autres propriétés celle d’être une distribution sur tout l’ensemble R qui est
symétrique par rapport la moyenne. Elle h est en outre infiniment dérivable. Sa densité est
1 1 x−m 2
i
donnée ∀x ∈ R par f (x) = σ 2π exp − 2 σ
√ . On a en outre, les caractéristiques
suivantes :
E [X] = m
V ar [X] = σ 2
σ2 2
gX (x) = exp mx + x
2
En dimension n, la loi de Gauss se généralise pour le vecteur gaussien X = [X1 , X2 , · · · , Xn ]T ,
de moyenne M = [M1 , M2 , · · · , Mn ]T , par la fonction de densité donnée ∀X ∈ Rn par
1 1 T −1
f (X) = p n exp − (X − M ) K (X − M )
det (K) (2π) 2 2
où la matrice des covariances K satisfait pour tous i, j ∈ [1, n], Kij = Cov [Xi , Xj ] = Kji .
σ2
E [X] = exp m +
2
2
V ar [X] = exp 2m + 2σ 2 eσ − 1
σ2 2
gX (x) = exp mx − x
2
— Loi de Pareto de paramètre a, θ > 0
La loi de Pareto permet d’étudier les événements dits rares ou extrêmes d’une variable
aléatoire à valeurs positives. Il s’agit des réalisations de la variable aléatoire qui sont très
éloignées de la moyenne, mais dont la survenue a une importance capitale. On peut l’utiliser
pour modéliser la probabilité que variable aléatoire dépasse un certain seuil. Sa densité est
donnée ∀x ∈ R par f (x) = θaθ x−θ−1 1|{x>a} . On a
θa
E [X] = (n’existe que si θ > 1)
θ−1
θa2
V ar [X] = (n’existe que si θ > 2)
(θ − 1)2 (θ − 2)
Sa fonction génératrice ne s’exprime pas par des fonctions usuelles.
— Loi de Gumbel de paramètre α, β avec β > 0 et α ∈ R
Cette loi modélise également les événements dits rares ou extrêmes d’une variable aléatoire
à valeurs réelles. Il peut s’agir par exemple de la loi du maximum ou du minimum d’une
très grande série de
réalisations
d’un phénomène aléatoire. Sa densité est donnée ∀x ∈ R
1 α−x α−x
par f (x) = β exp β − exp β . On montre que
E [X] = α + γβ
π2β 2
V ar [X] =
6
αx
gX (x) = e Γ (1 − βx)
où γ ' 0.577... est la constante Euler.
— Loi Beta B (α, β) , α, β > −1
Cette loi modélise les phénomènes aléatoires dont les réalisations sont contenues dans l’in-
tervalle ]0, 1[. Il pourrait s’agir des proportions ou des taux par exemple. Sa densité est
donnée ∀x ∈ R par f (x) = B(α+1,β+1) 1
xα (1 − x)β 1|{x∈]0,1[} . On peut remarquer que si
α = β = 0 on retrouve la loi uniforme U ([0, 1]). Si α, β > 0 on peut vérifier que le mode de
α
cette loi est α+β . On rappelle l’expression de la fonction beta d’Euler donnée ∀α, β > 0 par
Z 1
B (α, β) = xα−1 (1 − x)β−1 dx
0
Γ (α) Γ (β)
=
Γ (α + β)
Exercice 1.2.2 Pour chacune des lois citées dans cette section déterminer la fonction de répartition,
la médiane et les autres quartiles.
1
Exercice 1.2.3 Montrer que la loi de Cauchy de densité donnée ∀x ∈ R par f (x) = π(1+x2 )
n’admet pas d’espérance mathématique.
ou de manière équivalente Y
f (x1 , x2 , · · · , xn ) = fi (xi ) .
i∈[1,n]
Remarque 1.3.1 Il est également établi que le système {X1 , X2 , · · · , Xn } est indépendant si et
seulement si E [X1 X2 · · · Xn ] = E [X1 ] E [X2 ] · · · E [Xn ].
Proposition 1.3.2 Soit (X1 , X2 , · · · , Xn ) un n-échantillon de loi mère N (0, 1). Alors
Xn
1. La statistique X n = n1 Xk suit la loi N 0, n1 . De façon plus générale, si la loi mère
k=1
est N (m, σ 2 ) alors la statistique
Xn − m
Zn = √
σ/ n
suit la loi N (0, 1).
Xn
2. La statistique nX 2 n = X 2 suit une loi dite du Khi-deux à n dégrés de liberté, notée
k=1 k
X 2 (n). De façon plus générale, si la loi mère est N (m, σ 2 ) alors la statistique
2 n 2 n 1 Xn 2
1 Xn = 2 S1 = 2 (Xk − m)
σ σ n k=1
suit la loi X 2 (n). La densité de probabilité correspondant à une variable aléatoire Z suivant
n −1 − x
la loi du Khi-carré est f (x) = x 2n2 en 2 1|{x>0} . La fonction caractéristique correspondant à
2 Γ( 2 )
1
cette loi est ψZ (z) = n . En outre E [Z] = n et V ar [Z] = 2n.
(1−2z)2
Proposition 1.3.3 Soit (X1 , X2 , · · · , Xn ) un n-échantillon de loi mère N (m, σ 2 ). Alors la sta-
tistique
2 n−1 2 n−1 1 Xn 2
2 Xn = S = Xk − X n
σ2 2 σ2 n−1 k=1
(iii) La statistique
√
X n − Y m − (mX − mY ) m+n−2
2 Tn,m = q
2 2
q 2 2
σX σY X S2 Y S2
n
+ m
(n − 1) σ 2 + (m − 1) σ 2
X Y
suivent respectivement une loi t (n) et une loi une loi t (n − 1).
(iv) La statistique
XY S1 XY S2 n−1
r1 = et r2 = = r1
X S1 Y S1 X S2 Y S2 n
Alors les statistiques √ √
(n − 1) n − 2r1 n − 2r2
q et p
n2 − (n − 1)2 r12 1 − r22
Definition 1.4.1 Soient (fn )n∈N et f une famille d’applications toutes définies de A vers B ⊆ R.
On dit que
(i) La suite (fn )n∈N converge simplement vers f et on note fn → f si ∀ε > 0, ∀x ∈ A,
∃N (ε, x) ∈ N tel que ∀n ≥ N, |fn (x) − f (x)| < ε.
(ii) La suite (fn )n∈N converge uniformément vers f et on note fn ⇒ f si ∀ε > 0, ∃N (ε) ∈ N
tel que ∀x ∈ A, ∀n ≥ N, |fn (x) − f (x)| < ε.
Definition 1.4.2 On dit qu’une suite de variables aléatoires (Xn )n∈N converge en loi vers une
variable aléatoire X, si la suite des fonctions de répartition (Fn )n∈N correspondant à (Xn )n∈N ,
L
converge simplement vers la fonction de répartion F de X. On note Xn → X.
Proposition 1.4.1 Une suite de variables aléatoires (Xn )n∈N converge en loi vers une variable
aléatoire X si et seulement si la suite des fonctions génératrices (resp. caractéristiques) (gXn )n∈N
(resp. (ψXn )n∈N ) converge simplement vers gX (resp. ψX ).
Definition 1.4.3 On dit qu’une suite de variables aléatoires (Xn )n∈N converge en probabilité (ou
faiblement) vers une variable aléatoire X, si pour tout réel ε > 0 donné,
p
On note Xn → X.
Definition 1.4.4 On dit qu’une suite de variables aléatoires (Xn )n∈N converge presque sûrement
(ou fortement) vers une variable aléatoire X, si pour tout réel ε > 0 donné,
lim P sup {|Xm − X|} < ε = 1.
n→+∞ m≥n
p.s.
On note Xn → X. Une autre formulation de la convergence presque sûre est P lim Xn = X =
n→+∞
1. L’expression lim Xn = X est prise ici au sens de la convergence uniforme des fonctions.
n→+∞
Proposition 1.4.2 Soient (Xn )n∈N , une suite de variables aléatoires, et g une fonction continue.
p.s.
On suppose que Xn → X. Alors
p
1. Xn → X.
p.s.
2. g (Xn ) → g (X).
Xn − m L
Zn = → N (0, 1)
√σ
n
Dans la pratique, on suppose que la limite est atteinte pour n > 30.
La représentation des tableaux nécessite le choix d’un ordre d’apparition des classes. Les ta-
bleaux des effectifs cumulés croissants et décroissants (respectivement des fréquences cumulées
croissantes et décroissantes) est un cumul progressif dans l’ordre croissant ou décroissant des ef-
fectifs (respectivement fréquences). Le tableau de fréquences cumulées croissantes donne un idée
vague de la fonction de répartition qui est particulièrement utile dans le cas réel continu. Le ta-
bleau de fréquences cumulées décroissantes quant à lui fait référence à la fonction de survie. Les
tableaux de fréquences cumulées permettent également de déduire les quantiles. On a le tableau
récapitulatif suivant :
Exemple 1.5.1 1. D’une étude sur les teints on obtient la série statistique : noir, noir, noir,
albinos, noir, brun, brun, albinos, noir, brun, brun, brun, noir. Dresser un tableau contenant
les fréquences et effectifs marginaux, puis les fréquences et effectifs cumulés croissants et
décroissants. Quelle est la classe modale ?
2. D’une étude sur le jeu de lancé de dé à six faces on obtient les résultats suivants :
1, 2, 6, 4, 2, 1, 1, 2, 3, 3, 3, 4, 6, 6, 6, 6, 6, 4.
(a) Quel est le mode de cette série ? Quelle est la médiane ? Quelles sont la moyenne et la
variance de cette série ?
(b) On décide d’étudier la parité des réalisations. Combien de classe a-t-on désormais ?
Quelles est la probabilité d’obtenir un résultat impair ?
21, 21, 23, 25, 28, 28, 27, 29, 30, 33, 32, 32, 34, 28, 27, 24, 24, 25, 19, 30, 25.
Quelle est le mode de cette série ? Quelle est la probabilité d’avoir un âge compris entre
20 et 31 ? Quelle est la probabilité d’avoir un âge inférieur ou égal à 31 ? Quelle est la
probabilité d’avoir un âge supérieur ou égal à 31 ?
Les tableaux croisés sont utilisés pour représenter les effectifs ou les fréquences pour des va-
riables non-atomiques. Ils sont pratiques pour avoir une vue globale de la distribution et des
éventuelles relations. Toutefois, l’utilisation des tableaux croisés est plus pratique et aisée en di-
mension 2 ou au plus 3. En dimension 2, on a le tableau d’effectifs suivant :
Avec Xp Xm
n·j = nij , ni· = nij et
i=1 j=1
Xm Xp
n= nij
j=1 i=1
Xp
= ni·
i=1
Xm
= n·j
j=1
Avec
nij Xp Xm
fij = , f·j = fij , fi· = fij
n i=1 j=1
et
Xm Xp
n= fij
j=1 i=1
Xp
= fi·
i=1
Xm
= f·j
j=1
1. Dresser les tableaux croisés des effectifs et des fréquences. Quel est le mode de cette série ?
2. Dresser les tableaux marginaux des effectifs et des fréquences. Quelle est la probabilité d’être
de sexe féminin ? Quelle est la médiane pour l’âge ?
α (i) = 2πfi .
Exemple 1.5.3 1. D’une étude sur les teints on obtient la série statistique : noir, noir, noir,
albinos, noir, brun, brun, albinos, noir, brun, brun, brun, noir. Construire le diagramme
circulaire correspondant.
2. D’une étude sur le jeu de lancé de dé à six faces on obtient les résultats suivants :
1, 2, 6, 4, 2, 1, 1, 2, 3, 3, 3, 4, 6, 6, 6, 6, 6, 4.
21, 21, 23, 25, 28, 28, 27, 29, 30, 33, 32, 32, 34, 28, 27, 24, 24, 25, 19, 30, 25.
On considère les classes [20, 23], ]23, 24[, [24, 31], ]31, 34]. Construire le diagramme circu-
laire correspondant.
1, 2, 6, 4, 2, 1, 1, 2, 3, 3, 3, 4, 6, 6, 6, 6, 6, 4.
21, 21, 23, 25, 28, 28, 27, 29, 30, 33, 32, 32, 34, 28, 27, 24, 24, 25, 19, 30, 25.
On considère les classes [20, 23], ]23, 24[, [24, 31], ]31, 34]. Construire le diagramme polaire
correspondant.
— L’histogramme
Les histogrammes se construisent pour représenter des données numériques atomiques re-
groupées en des classes sous forme d’intervalle. L’histogramme consiste en un ensemble de
rectangles représentés dans un repère. La base de chaque rectangle correspond à l’étendu
d’une classe et sa hauteur est choisie de sorte que l’aire soit proportionnelle à l’effectif
(ou de manière équivalente la fréquence) de ladite classe. Précisément pour une classe i
de la forme [a, b] ou [a, b[ ou ]a, b[ ou ]a, b], avec une fréquence fi = nni on la relation de
proportionnalité
base (i) × hauteur (i) = A (i) = k × fi .
k×fi
Dans la formule ci-avant base (i) = b − a et hauteur (i) = base(i) . k est un coefficient de
proportionnalité choisi selon des critères supplémentaires, mais qu’on pourra prendre par
défaut égal à 100.
Exemple 1.5.5 D’une étude sur les âges on obtient les données :
21, 21, 23, 25, 28, 28, 27, 29, 30, 33, 32, 32, 34, 28, 27, 24, 24, 25, 19, 30, 25.
On considère les classes [20, 23], ]23, 24[, [24, 31], ]31, 34]. Construire l’histogramme associée à
cette série.
— Le diagramme à bâtons
Le diagramme à bâtons est similaire à l’histogramme, mais il est utilisé pour les variables
discrètes aussi bien qualitatives que quatitatives. À la place des rectangles on a des tiges
dont les hauteurs sont proportionnelles à l’effectif (ou de manière équivalente la fréquence)
des modalités correspondantes. Pour une classe i, avec une fréquence fi = nni on la relation
de proportionnalité
hauteur (i) = k × fi .
k est un coefficient de proportionnalité choisi selon des critères supplémentaires, mais qu’on
pourra prendre par défaut égal à un.
Exemple 1.5.6 1. D’une étude sur les teints on obtient la série statistique : noir, noir, noir,
albinos, noir, brun, brun, albinos, noir, brun, brun, brun, noir. Construire le diagramme à
bâtons correspondant.
1, 2, 6, 4, 2, 1, 1, 2, 3, 3, 3, 4, 6, 6, 6, 6, 6, 4.
— Le diagramme à bandes
Le diagramme à bandes est similaire à l’histogramme, mais il est utilisé pour les variables
regroupées en classes discrètes. Il est en particulier employé pour les variables qualitatives.
Les bandes sont des rectangles dont les hauteurs sont proportionnelles à l’effectif (ou de
manière équivalente la fréquence) des modalités correspondantes. Le choix de longueur de
la base est plus flexible. Il peut correspondre à l’étendu d’une classe intervalle dans le cas
numérique ou avoir une longueur arbitraire fixée pour les variables qualitatives. Pour une
classe i, avec une fréquence fi = nni on la relation de proportionnalité
hauteur (i) = k × fi .
k est un coefficient de proportionnalité choisi selon des critères supplémentaires, mais qu’on
pourra prendre par défaut égal à un.
Exemple 1.5.7 1. D’une étude sur les teints on obtient la série statistique : noir, noir, noir,
albinos, noir, brun, brun, albinos, noir, brun, brun, brun, noir. Construire le diagramme à
bandes correspondant.
2. D’une étude sur les âges on obtient les données :
21, 21, 23, 25, 28, 28, 27, 29, 30, 33, 32, 32, 34, 28, 27, 24, 24, 25, 19, 30, 25.
On considère les classes [20, 23], ]23, 24[, [24, 31], ]31, 34]. Construire le diagramme à bandes
correspondant.
— La boı̂te à moustache
La boı̂te à moutache permet de représenter les principales caratéristiques de l’échantillon
d’une variable aléatoire numérique atomique dans un repère. Elle est sous forme d’intervalle
et fait apparaı̂tre le minimum, le maximum, la moyenne et les autres quartiles de la série.
Remarquons que le maximum est le quatrième quartile.
Exemple 1.5.8 D’une étude sur les âges on obtient les données :
21, 21, 23, 25, 28, 28, 27, 29, 30, 33, 32, 32, 34, 28, 27, 24, 24, 25, 19, 30, 25.
Exemple 1.5.9 D’une étude sur les âges on obtient les données :
21, 21, 23, 25, 28, 28, 27, 29, 30, 33, 32, 32, 34, 28, 27, 24, 24, 25, 19, 30, 25.
(−1, 2), (3, 11), (−2, 5), (2, 5), (−0.5, 1.25), (0, 1).
Représenter le nuage de points correspondant. Quelle est la relation fonctionnelle décrit ce nuage ?
Estimation paramétrique
Dans ce chapitre on suppose qu’on dispose d’une réalisation d’un n−échantillon dont on connaı̂t
une famille paramétrique à laquelle appartient la loi mère. La plupart des lois de probabilité
abordées ci-avant sont définies selon un paramètre vectoriel θ. Le problème est l’estimation du
paramètre θ correspondant au n−échantillon considéré.
Definition 2.0.1 Soit une famille kparamétrique de lois admettant des fonctions de densité (resp.
de probabilité) f (., θ) ; θ ∈ Θ ⊆ R . On dit qu’elle appartient à la classe exponentielle des lois
si X k
f (x, θ) = a0 (θ) b0 (x) exp ai (θ) bi (x)
i=1
La classe exponentielle des lois est assez large. Elle contient les lois uniforme, Bernoulli, Bino-
miale, Binomiale négative, Poisson, exponentielle, gamma, normale, Pareto, Beta, ...
Exemple 2.0.11 Lorsque p ∈ ]0, 1[, la loi de Bernoulli B (p) peut s’écrire de façon compacte sous
la forme
Definition 2.0.2 Soit f (., θ), une loi. On appelle support de f (., θ) l’ensemble des valeurs x pour
lesquelles f (x, θ) > 0.
Si le biais est nul, l’estimateur est dit sans biais, sinon il est biaisé.
21
22 CHAPITRE 2. ESTIMATION PARAMÉTRIQUE
Exemple 2.1.1 On montre que la variance empirique
1 Xn 2
Se2 = Xk − X n
n k=1
2
2
= X n − Xn
est un estimateur biaisé de la variance. Par contre la variance de l’échantillon
1 Xn 2
S22 = Xk − X n
n − 1 k=1
n 2
2
= X n − Xn
n−1
est estimateur sans biais. X n désigne ici la moyenne arithmétique ou moyenne empirique ou
moyenne de l’échantillon qui est elle-même un estimateur sans biais de la moyenne E [X]. Natu-
rellement, X 2 n désigne la moyenne arithmétique des carrés qui est un estimateur sans biais de la
moyenne quadratique E [X 2 ]. On définit également les moments empiriques simples et le moments
empiriques centrés d’ordre k par les formules respectives
1 Xn 0 1 Xn k
Mk = Xik et Mk = Xi − X .
n i=1 n i=1
Definition 2.1.2 On appelle erreur quadratique moyenne d’un estimateur θ, b l’espérance mathématique
2 h i h i h i
E θb − θ = b2 θb + V ar θb = eqm θb
h i h i
On dit qu’un estimateur θb1 domine un autre estimateur θb2 , si eqm θb1 ≤ eqm θb2 pour tout
θ ∈ Θ. La
h dominance
i h définit
i une relation d’ordre partiel que nous considérons dans la suite (θb1 ≥ θb2
ssi eqm θb1 ≤ eqm θb2 ).
Proposition 2.1.1 Soit une variable aléatoire X suivant la loi mère d’une suite de variables
aléatoires iid. Si E X k existe, alors tous les moments empiriques simples (resp. centrés) d’ordre
inférieur ou égal à k sont des estimateurs convergeant presque sûrement vers les moments simples
(resp. centrés) correspondant à ladite loi.
On dit qu’un estimateur θbn est une statistique exhaustive pour θ ∈ Θ, si la loi conditionnelle
de l’échantillon sachant θbn ne dépend pas de θ. θbn est exhautive minimale si elle est exhaustive
et
si, pour toute statistique exhaustive 2 θn , on peut trouver une fonction v telle que θn = v 2 θn .
b b b
On rappelle à toute fin utile la loi de Bayes suivante :
P (A) P (B|A) = P (A ∩ B) = P (B) P (A|B)
L’estimateur θbn est dit efficace pour θ ∈ Θ, si la borne de Cramer-Rao est atteinte. Cela ne
peut être le cas que si la famille de lois considérée est dans la classe exponentielle. Dans le cas
continu, les conditions de régularité évoquées dans le théorème précédent sont :
1. I (θ) existe pour tout θ ∈ Θ.
2. ∀i ∈ [1, n] ∩ N, le support de fi (., θ) est indépendant de θ.
Z Z Z Z
∂ ∂
3. ∂θ · · · f (x1 , x2 , · · · , xn , θ) dx1 dx2 · · · dxn = · · · ∂θ f (x1 , x2 , · · · , xn , θ) dx1 dx2 · · · dxn ,
où f désigne la densité conjointe.
4.
Z Z
∂ hb i ∂
E θn = · · · θbn f (x1 , x2 , · · · , xn , θ) dx1 dx2 · · · dxn
∂θ ∂θ
Z Z
∂
= · · · θbn f (x1 , x2 , · · · , xn , θ) dx1 dx2 · · · dxn
∂θ
Dans le cas discret, on remplace les intégrales par des sommes. Les conditions de régularité
sont regroupées en la propriété ”Best Asymptotically Normal” (BAN).
Exercice 2.1.1 On considère un n-échantillon ((X1 , Y1 ) , · · · (Xn , Yn )) dont la loi mère est suivie
par le couple de variable variable (X, Y ). On considère les estimateurs de Cov [X, Y ] suivants :
Xn Xn
1 1
i) Θ1 = n
b (Xi − E[X]) (Yi − E[Y ]) ii) Θ2 = n
b Xi Yi − E[X]E[Y ]
Xi=1
n Xi=1 n
b3 = 1
iii) Θ (X i − E[X]) Y i iv) Θb 4 = 1
X i i − E[X]Y n
Y
n
Xi=1
n n Xi=1
n
1 1
v) Θ5 = n
b X i − X n Yi − Y n vi) Θ6 = n
b X i Yi − X n Y n
Xi=1
n Xi=1 n
b7 = 1 b8 = 1
vii) Θ n
X i − X n Y i viii) Θ n−1
X i − X n Yi
i=1 i=1
X n X n
b9 = 1 b 10 = 1 n
ix) Θ n−1
Xi − X n Yi − Y n x) Θ n−1
Xi Yi − n−1 X nY n
i=1 i=1
Proposition 2.2.1 Soit l’échantillon (X1 , X2 , · · · , Xn ) dont la densité de la loi mère vérifie cer-
taines conditions de régularité
qui garantissent
notamment
pour tout entier naturel n, l’existence
L 1
d’un EMV θbnM V . Alors θbnM V − θ → N 0, nI(θ) .
Exercice 2.2.1 Trouver des estimateurs de la moyenne et de la variance pour une loi normale
par la méthode du maximum de vraisemblance.
1. Voir [6].
Definition 2.3.1 Soit (X1 , X2 , · · · , Xn ) un échantillon de loi mère f (., θ), où θ ∈ Θ est le pa-
ramètre inconnu de dimension 1. On appelle procédure d’intervalle de confiance de niveau γ ∈
[0, 1], tout couple de statistiques (T1 , T2 ) tel que, quel que soit θ ∈ Θ, on ait P (T1 ≤ θ ≤ T2 ) ≥ γ.
Pour toute réalisation (t1 , t2 ) du couple (T1 , T2 ), l’intervalle [t1 , t2 ] est appelé intervalle de confiance
de niveau γ. La valeur α = 1 − γ est appelée risque de première espèce. On note ICγ (θ) = [t1 , t2 ].
Le diamètre d’un intervalle de confiance est appelé précision. La précision croı̂t en général avec
la taille de l’échantillon. Dans la pratique on se ramène souvent à la loi normale centrée réduite
grâce au théorème de la limite centrale et on choisit un intervalle de confiance en utilisant les
quantiles. Cet intervalle est couramment de l’un des deux types suivant :
- Bilatéral : Ies intervalles de ce type sont le plus souvent de la forme [t1 , t2 ], avec t1 et t2
finis et satisfaisant
α
P (θ ≤ t1 ) = P (θ ≥ t2 ) = (2.1)
2
- Unilatéral : Ies intervalles de ce type sont le plus souvent de la forme [t1 , t2 ], avec t1 , t2 ∈
R ∪ {−∞, +∞} et satisfaisant
P (θ ≤ t1 ) = α et P (θ ≥ t2 ) = 0 (2.2)
ou
P (θ ≤ t1 ) = 0 et P (θ ≥ t2 ) = α (2.3)
Dans cette section, nous nous restreindrons au intervalles de confiance bilatéraux. Toutefois,
nous présenterons les intervalles unilatéraux dans le chapitre reservé aux tests.
Exemple 2.3.1 (Intervalle de confiance bilatéral pour la moyenne d’une loi de normale où l’écart-
type est connu)
Nous savons que X−m √
σ/ n
N (0, 1). Supposons que la variance σ 2 est connue et déterminons un
intervalle de confiance à γ = 95% (ou avec un risque de première espèce valant α = 5%) de la
moyenne. Soit Z N (0, 1). Déterminons z1− α2 , le quantile d’ordre 1 − α2 = 1 − 0.025 = 0, 975.
En utilisant la symétrie de la loi normale on a
P |Z| ≤ z1− α2 = γ = 0, 95 ⇔ z1− α2 = 1, 96
X −m σ σ
−z1− α2 ≤ √ ≤ z1− α2 ⇔ X − √ z1− α2 ≤ m ≤ X + √ z1− α2
σ/ n n n
Exemple 2.3.2 (Intervalle de confiance bilatéral pour la moyenne d’une loi de normale où l’écart-
type est inconnu)
On suppose que Z t (n − 1) et P |Z| ≤ z1− α2 = γ.
— Si la moyenne m est connue, on utilise le fait que la statistique
√
n X −m
t (n)
S1
h i
pour obtenir ICγ (m) = X − √S1n z1− α2 , X + √S1n z1− α2 .
— Si la moyenne m est inconnue, on utilise le fait que la statistique
√
n X −m
t (n − 1)
S2
h i
pour obtenir ICγ (m) = X − √S2n z1− α2 , X + √S2n z1− α2 .
Exemple 2.3.3 (Intervalle de confiance bilatéral pour la variance d’une loi de normale où l’écart-
type est inconnu)
On suppose que Z χ2 (n − 1), P (Z < z1 ) = α2 et P (Z > z2 ) = α2 .
n 2
— Si la moyenneh m est iconnue, on utilise le fait que la statistique σ2 S1 χ2 (n) pour obtenir
nS12 nS12
ICγ (σ 2 ) = z2
, z1 .
n−1 2
— Si la moyenne m esth inconnue, on utilise
i le fait que la statistique σ2
S2 χ2 (n − 1) pour
2 (n−1)S22 (n−1)S22
obtenir ICγ (σ ) = z2
, z1 .
Exemple 2.3.4 (Intervalle de confiance bilatéral pour le rapport de deux variances de deux échantillons
de tailles n1 et n2 , de loi de mères normales N (m1 , σ12 ) et N (m2 , σ22 ), où les écarts-type sont tous
inconnus)
On suppose que Z F (n1 , n2 ), P (Z < z1 ) = α2 et P (Z > z2 ) = α2 . Si on pose fα/2 (n1 , n2 ) le
quantile d’ordre 1− α2 pour F (n1 , n2 ) alors fα/2 (n2 , n1 ) est le quantile d’ordre 1− α2 pour F (n1 , n2 )
et on a :
z2 = fα/2 (n1 , n2 ) et z1 = 1/fα/2 (n2 , n1 ) .
n1 2 n2 2
— Si les moyennes m1 et m2 sont toutes connues alors S
σ12 11
χ2 (n1 ) et S
σ22 12
χ2 (n2 ).
2 σ2
S11
Il suit que 2
2 σ2
S12
F (n1 , n2 ) et
1
σ22 2 2
S12 S12
ICγ = z1 2 , z2 2 .
σ12 S11 S11
n1 2 n2 2
— Si les moyennes m1 et m2 sont toutes inconnues alors S
σ12 21
χ2 (n1 − 1) et S
σ22 22
2 σ2
S21
χ2 (n2 − 1). Il suit que 2
2 σ2
S22
F (n1 − 1, n2 − 1) et
1
2 2 2
σ2 S22 S22
ICγ = z1 2 , z2 2 ,
σ12 S21 S21
avec
z2 = fα/2 (n1 − 1, n2 − 1) et z1 = 1/fα/2 (n2 − 1, n1 − 1) .
σ22 2 2
S22 S22
ICγ = z1 2 , z2 2 ,
σ12 S11 S11
avec
z2 = fα/2 (n1 , n2 − 1) et z1 = 1/fα/2 (n2 − 1, n1 ) .
Exercice 2.3.1 Soient deux échantillons de tailles respectives n1 et n2 , de loi de mères normales
N (m1 , σ12 ) et N (m2 , σ22 ).
σ2 σ2
1. Montrer que la statistique X1 − X2 N m1 − m2 , n11 + n22 .
2. On suppose que σ1 et σ2 sont connus.
(a) Quelle est la loi à utiliser pour determiner ICγ (m1 − m2 ) ?
q 2
σ σ22
(b) Montrer que dans le cas bilatéral, ICγ (m1 − m2 ) = X1 − X2 ∓ z1− 2 n11 +
α
n2
.
3. On suppose que les moyennes m1 et m2 sont toutes connues, mais que σ1 et σ2 sont incon-
nus.
√
n1 2 n2 2 ((Xr1 −X2 )−(m1 −m2 )) n1 +n2
(a) Quelles lois suivent les statistiques S
σ12 11
+ S
σ22 12
et 2
σ1 σ2
r ?
n1 2 n2 2
n1
+ n2 2 S11 + σ 2 S12
2 σ1 2
(c) On suppose que la moyenne m1 est connue mais m2 et σ1 = σ2 sont inconnus. Comment
calculer ICγ (m1 − m2 ) ?
5. Quels sont les cas où ICγ (m1 − m2 ) est effectivement calculable ?
La méthode utilisée dans les exemples précédents se généralisent à tout les estimateurs dont on
connait la loi. Il existe toutefois, une méthode simpliste et valide pour déterminer des intervalles
de confiance indépendamment de la loi considérée. Elle se base sur le résultat suivant :
Exercice 2.3.2 Dans une ville on donne la répartition du nombre de jours sans accident, avec
un accident, etc. Parmi 50 jours d’observation au cours d’une même année :
Nombre d’accidents 0 1 2 3 4
Nombres de jours 21 18 7 3 1
On suppose que le nombre d’accidents par jour suit une loi de Poisson. Donner un intervalle
de confiance de niveau 0.95 pour le nombre moyen d’accident par jour.
Exercice 2.3.3 On veut estimer le rendement d’un engrais pour la culture du blé. Sur douze
parcelles expérimentales, on a trouvé les rendements suivants en tonnes par hectare :
7.7 8.4 7.8 8.2 7.9 8.5 8.4 8.2 7.6 7.8 8.4 8.3
Les intervalles de confiance interviennent également dans les tests statistiques. Il s’agit entre
autre des tests d’égalité ou de comparaison.
Tests d’hypothèses
Les tests statistiques ont pour objet de décider de la véracité d’un fait (appelé hypothèse) en se
basant sur un échantillon. L’hypothèse à vérifier est appelée hypothèse nulle (H0 ) et son contraire
est l’hypothèse alternative ou de recherche (H1 ).
29
30 CHAPITRE 3. TESTS D’HYPOTHÈSES
Remarque 3.1.1 Dans la pratique, on valide l’hypothèse nulle si l’intervalle de confiance IC (θ)
rencontre l’ensemble Θ0 ; au cas contraire on valide l’hypothèse alternative. Les risques s’expriment
alors de la façon suivante :
et
β (θ) = P (IC (θ) ∩ Θ0 6= {} |θ ∈ Θ1 ) .
Connaissant la loi de l’estimateur θb de θ, on peut calculer ses probabilités.
Théorème 3.1.2 Le test du RV est le plus puissant à tous les niveaux pris dans ]0, 1[ (lemme de
Neyman-Pearson). En outre, il est sans biais.
Definition 3.1.5 Soient la famille paramétrique f (., θ) ; θ ∈ Θ ⊆ Rk et les hypothèses H0 : θ ∈
Θ0 versus H1 : θ ∈ Θ1 = Θ\Θ0 . On appelle rapport de vraisemblance généralisé (RVG), la fonction
sup {Ln (θ)}
θ∈Θ0
λG (X1 , X2 , · · · , Xn ) ≡ λG G
n telle que λn = sup {Ln (θ)}
. Le test du RVG est le test défini par une
θ∈Θ1
Dans la plupart des logiciels, on valide l’hypothèse nulle si la P -valeur est plus grande que le
risque de première espèce α et on la rejette au cas contraire. Donnons dans les trois cas suivants
la P -valeur correspondante. On pose Z = g (X1 , X2 , · · · , Xn , θ), où g désigne la fonction pivot.
— Test unilatéral (H0 ) : θ ≤ θ0 versus (H1 ) : θ > θ0
On construit un intervalle de confiance de niveau 1 − α de la forme ]−∞, z1−α ] où z1−α est
le quantile d’ordre 1 − α. On déduit l’intervalle de confiance de θ. On valide classiquement
l’hypothèse H0 si IC (θ) ∩ ]−∞, θ0 ] 6= {} et on l’invalide au cas contraire. La P -valeur est
la probabilité sous l’hypothèse H0 d’avoir Θ b n > θbn .
— Test unilatéral (H0 ) : θ ≥ θ0 versus (H1 ) : θ < θ0
On construit un intervalle de confiance de niveau 1 − α de la forme [zα , +∞[ où zα est
le quantile d’ordre α. On déduit l’intervalle de confiance de θ. On valide classiquement
l’hypothèse H0 si IC (θ) ∩ [θ0 , +∞[ 6= {} et on l’invalide au cas contraire. La P -valeur est
la probabilité sous l’hypothèse H0 d’avoir Θ b n < θbn .
— Test bilatéral (H0 ) : θ = θ0 versus (H1 ) : θ 6= θ0
On construit un intervalle de confiance de niveau 1 − α de la forme [zα , z1−α ] où zα et z1−α
sont les quantiles d’ordre α et 1−α respectivement. On déduit l’intervalle de confiance de θ.
On valide classiquement l’hypothèse H0 si θ0 ∈ IC (θ) et on l’invalide au cas contraire. La P -
valeur est sous l’hypothèse H0 le double du minimun des probabilités d’avoir respectivement
Θ
b n < θbn et Θb n > θbn .
L’intérêt de la P -valeur est qu’elle ne nécessite pas le cacul effectif de l’intervalle de confiance.
Toutefois, il semblait important de mentionner les méthodes de calcul des intervalles de confiance
selon les types de test.
La variété A est-elle meilleure que la variété B ? La variété B est-elle meilleure que la variété
A ? Les deux variétés sont elles similaires ? On supposera dans un premier temps que les écart-
types σA et σB valent respectivement 0, 1 et 0, 2. Par la suite, ils seront supposés égaux, mais
inconnus.
1. Pour la preuve, voir [6].
(F, F, P, F, P, F, P, F, F, F, P, P, F, P, F )
1
Peut on dire que la probabilité d’avoir pile est 2
?
Exercice 3.1.1 On considère deux machines A et B produisant des ordinateurs. Les produits de
A sont de qualité supérieure et plus chers. La qualité des produits issus de A suit une loi N (15, 1)
et celle des produits issus de B suit la loi N (10, 1). Un revendeur se fait livrer 100 ordinateurs
au prix des produits issus de A. Il veut tester leur provenance effective via un test sur la qualité,
au niveau 5%.
1. Présenter les hypothèses. Sont-elles simples ou multiples ?
2. Sous l’hypothèse nulle, quelle est la loi de la moyenne de l’échantillon ? Donner un intervalle
de confiance de la moyenne.
3. Quelle est la puissance de ce test ? Le test est-il sans biais ?
Exercice 3.1.2 Le temps qui sépare l’arrivée d’une personne et de son successeur dans une file
d’attente est modélisé par un loi E (λ). Après un échantillonnage, on fait le test du Rapport de
Vraisemblance (RV) simple (H0 ) : λ = 1 versus (H1 ) : λ = 0.4. Quel est le résultat ?
Nombre de termes 30 35 15 30 20 10 5 5 8 9
Temps (m) 0.1 0.15 0.2 0.25 0.45 0.55 0.7 0.8 0.95 1
Nombre de termes 5 6 6 4 2 5 4 1 10 2
Temps (m) 1.2 1.55 1.75 1.9 2 2.5 2.8 3 3.5 5
Exercice 3.1.3 Une étude sur 5 années consécutives, s’intéresse à la production annuelle de deux
variétés A et B de maı̈s. Le tableau suivant est obtenu :
1999 2000 2001 2002 2003
A 10 9 15 18 12
B 13 10 11 8 11
1. Estimer les variances des productions des variétés A et B. Donner leurs intervalles de
confiance à 99%.
2. On suppose que les deux variétés ont la même moyenne.
(a) La variété A est-elle meilleure que la variété B ?
(b) La variété B est-elle meilleure que la variété A ?
(c) Les deux variétés sont elles similaires ?
m!
(P (M1 = m1 , M2 = m2 , · · · , Mn = mn )) = P m1 P m2 · · · Pnmn
m1 !m2 ! · · · mn ! 1 2
≡ Lm (P1 , P2 , · · · , Pn )
Les tests sur les variables catégorielles portent en général, sur une hypothèse nulle (H0 ) : P1 =
p1 , P2 = p2 , · · · , Pn = pn . Sous l’hypothèse H0 , avec une réalisation (m1 , m2 , · · · , mn ) du m-
échantillon (M1 , M2 , · · · , Mn ), le test du RVG porte sur le rapport de vraisemblance
Lm (p1 , p2 , · · · , pn )
λm =
p1 , pb2 , · · · , pbn )
Lm (b
Yn pi mi
=
i=1 pbi
mi
Yn pi
= m
i=1 mi
Xn
Compte tenu de la contrainte pi = 1, la donnée de n − 1 valeurs des pi suffit pour avoir
i=1
L
toutes les n valeurs. Ainsi, on a la relation de convergence −2 ln (λm ) → X 2 (n − 1). En supposant
la limite atteinte, l’hypothèse nulle est rejétée avec un risque de première espèce α, si −2 ln (λm ) >
2
X1−α (n − 1).
pbA (1 − pbB )
OR = .
pbB (1 − pbA )
où nA et nB désignent les effectifs respectifs des groupes A et B. Un OR est égal à 1 on s’interprète
comme une égalité des probabilités d’occurence indépendamment du groupe. Lorsque OR est
strictement supérieur (respectiement inférieur) à 1 on conclu que pbA > pbB (respectivement pbA <
pbB ).
Le risque relatif (RR) est une statistique qui s’utilise de la même façon que l’odd ratio. Son
calcul s’obtient par la formule
pbA
RR = .
pbB
Le RR suit également une loi log-normale LN (m, σ 2 ) et σ 2 est estimé par
1 − pA 1 − pB
b2 =
σ + .
nA pA nB pB
Femme Homme
Brun(e) 15 5
Noir(e) 6 14
Quelle conclusion peut-on tirer avec un risque de première espèce de 5% ? On pocèdera aux
tests du Khi-deux de Pearson, de l’odd ratio et du risque relatif et du rapport de vraisemblance.
(1, 1, 1, 2, 5, 3, 6, 6, 4, 5, 5, 1, 2, 4, 3)
Peut on dire que ce dé est non pipé ? Dans un premier temps faire un test d’égalité de proportions
en estimant l’écart-type,puis en fixant sa valeur à 21 . On effectuera par la suite les test du Khi-deux
de Pearson, puis un test du rapport de vraisemblance.
X X 2
(n − 1) 2 1 Xk Xni 2 1 k ni
S2 = yij − yij
n n i=1 j=1 n i=1 j=1
X 2
1 Xk 2 1 k
= ni yi. − ni yi.
n i=1 n i=1
1 Xk 1 Xk Xk
= ni yi.2 − 2 ni yi. nr yr.
n i=1
n i=1 i=r
1 Xk (ni − 1) ni 2 2
2 1 Xk
= yi. − yi. + ni yi. − ni yi. y
n i=1 (ni − 1) n i=1
1 Xk 1 Xk
= (ni − 1) Si.2 + ni yi. 2 − ni yi. 2
n i=1 n i=1
1 Xk 1 Xk
= (ni − 1) Si.2 + ni yi. (yi. − y)
n i=1 n i=1
1 Xk 1 Xk
= (ni − 1) Si.2 + ni (yi. − y)2
n i=1 n i=1
D’où Xk Xk
(n − 1) S22 = ni (yi. − y)2 + (ni − 1) Si.2
i=1 i=1
On pose
Xk
SCE = (ni − 1) Si.2
i=1
Xk
SCT R = ni (yi. − y)2
i=1
Exemple 3.3.1 Une étude sur le diamètre des écrous produits par trois machines donne en mi-
limètre. :
A 10 12 9 14 20 11
B 13 9 15 18 12 14 13 14
C 13 10 11 8 11 8 7
Y-a-t-il une différence entre les pièces produites par ces machines ? Supposons que la norme
soit de 11mm. Quelles sont les machines conformes ? On supposera dans un premier temps que
les écarts-type sont connus et valent 1mm ; par la suite il seront supposés inconnus.
Exercice 3.3.1 Une étude sur le diamètre des écrous produits par trois machines donne en mi-
limètre. :
A 15 16 9 13 17 11
B 13 9 17 18 15 14 13 18
C 14 10 15 5 11 9 7
1. Dresser une table d’ANOVA. Y-a-t-il une différence entre les pièces produites par ces ma-
chines ?
2. Supposons que la norme soit de 11mm. Quelles sont les machines conformes ? On supposera
que les écarts-type sont connus et valent tous 1mm.
D’où
Xk1 Xk2
(n − 1) S22 = ni. (yi.. − y)2 + n.j (y.j. − y)2
i=1 j=1
Xk1 Xk2 Xk1 Xk2
2
+ nij (yij. − yi.. ) (yij. − y.j. ) + (nij − 1) Sij.
i=1 j=1 i=1 j=1
On pose
Xk1
SCT R1 = ni. (yi.. − y)2
i=1
Xk2
SCT R2 = n.j (y.j. − y)2
j=1
Erreur n − k1 k2 SCE M CE
Total n−1 SCT
Les règles de décision sont similaires à celles de L’ANOVA à un facteur. Si F1 > F1−α
(k1 − 1, n − k1 k2 )(respectivement F2 > F1−α (k2 − 1, n − k1 k2 )) alors l’impact de la catégorisation
par rapport à la variable X1 (respectivement X2 ) est avéré. Si F12 > F1−α ((k1 − 1) (k2 − 1) , n − k1 k2 )
alors l’impact de la double catégorisation par rapport au couple de variables (X1 , X2 ) est également
avéré.
Exercice 3.3.2 Pour étudier l’impact de la saison et de la race du café sur sa production annuelle
en tonnes, on mêne une enquête. A l’issue de celle-ci on obtient
S-Sèche S-pluie
Variété A 13, 10, 11, 12 9, 15, 16, 15
Variété B 7, 8, 10, 11 13, 17, 18, 19
Que conclure ?
Modélisation statistique
f (Y ) = g (X) + ∆ (X) + E
E [f (Y ) |X] = g (X)
et que conditionnellement à X = x,
E [f (Y ) |X = x] = g (x) + E.
et
Cov [Xi , Z]
ai = , 1 ≤ i ≤ k.
V ar [Xi ]
39
40 CHAPITRE 4. MODÉLISATION STATISTIQUE
Dans le cas gaussien, pour une estimation par la méthode du maximum de vraisemblance, on
utilise la fonction
Yn 1 1 2
L (ak , ak−1 , · · · , a1 , a0 , σ) = √ exp − 2 (f (Yi ) − g (X1i , · · · , Xki ))
i=1 σ 2π 2σ
XY S2
a1 =
b 2
a0 = Z n − b
et b a1 X n .
X S2
Z =b
a1 X + b
a0 + ε
2
Proposition 4.1.1 La statistique
2 1 Xn 2
εS = εi
n−2 i=1
1 Xn
= (Zi − b a0 )2
a1 X i − b
n−2 i=1
Xn
est un estimateur sans biais de V ar [ε] . Ainsi, la variable Vn−2
ar[ε] ε
S 2
= 1
V ar[ε]
ε2i suit une loi
i=1
du khi-deux à n − 2 dégrés de liberté. En outre, cette dernière est indépendante des estimateurs
a0 et b
b a1 .
3
Proposition 4.1.2 Si ε S 2 désigne l’estimateur sans biais présenté ci-avant de la variance V ar [ε],
alors on a
a1 −a1 )
(b
1. ε S/ X S2
√
n−1
t (n − 2),
a0 −a0 )
(b
2. s t (n − 2).
1 (X n )2
εS n
+ 2
(n−1)X S2
On remarque que
···
1 X1 X2 Xk
X1 X 2 X1 X2 ··· X1 X k
1
T X X X
M M = n 2 1 2 X22 ··· X2 X k
et
. .. .. .. ..
.. . . . .
Xk X1 Xk X2 X k ··· Xk2
X Yk
det M T M = n2
sign (σ) Xi Xσ(i) − Xi Xσ(i) .
σ∈Sk i=1
Q 2
Si de plus les vecteur xi,· sont deux à deux orthogonaux alors det M T M = n2 ki=1 Xi2 − Xi .
T
Le vecteur ba= b a0 ba1 · · · b ak s’obtient par la formule générale
−1
a = MT M
b MT z
−1
= MT M M T (M a + E)
−1 T
= a + MT M M E.
Proposition 4.1.4 Si ε S 2 désigne l’estimateur sans biais présenté ci-avant de la variance V ar [ε],
alors on a
4. Voir [7].
Famille de Bernoulli
Dans le cas de la regression logistique, il s’agit d’estimer les coefficients a1 et a0 , tels que
p(X) exp(a1 X+a0 ) et
ln 1−p(X) = a1 X+a0 ; de façon équivalente p (X) = 1+exp(a 1 X+a0 )
. La fonction g : t 7→ g (t) = 1+e t
t
est appelée fonction logistique ; sa bijection réciproque, le logit, est t 7→ ln 1−t . On définit de
façon équivalente le probit et le gompit, en remplaçant respectivement la fonction g par t 7→
g (t) = √12π exp − 12 t2 et t 7→ g (t) = 1 − exp (− exp (t)). Le probit et le gompit donnent lieu eux
aussi à des modèles.
Soit un n-échantillon ((X, Y )1 , (X, Y )2 , · · · , (X, Y )n ), où il y a M modalités de X. On pose
S (xi ) le nombre de couples (xi , 1), et E (xi ) le nombre de couples (xi , 0) dans l’échantillon. La
fonction de vraisemblance utilisée pour l’estimation est
YM
Ln (a1 , a0 ) = [p (xi )]S(xi ) [1 − p (xi )]E(xi )
i=1
Famille de poisson
Ici nous explorons le modèle log-normal, en considérant la relation ln (λ (X)) = a1 X + a0 . Soit
un n-échantillon ((X, Y )1 , (X, Y )2 , · · · , (X, Y )n ), où il y a MX modalités de X et MY modalités de
Y . On pose C (xi , yj ) le nombre de couples (xi , yj ) dans l’échantillon. La fonction de vraisemblance
utilisée pour l’estimation est
YMX YMY [λ (xi )]C(xi ,yj )
Ln (a1 , a0 ) = exp (−λ (xi ))
i=1 j=1 C (xi , yj )!
Un autre critère d’appéciation du modèle est basé la minimalité du critère d’information d’Akaike
(AIC) dont la définition générale utilise la fonction de vraisemblance Ln et s’exprime par
AIC = −2 ln (Ln ) + 2 (k + 1) .
En particulier, pour la regression linéaire multiple on a
AIC = n ln (M CE) + 2 (k + 1) .
Toutefois, il est plus utilisé l’AIC corrigé
2 (k + 1) (k + 2)
AICc = AIC + .
n−k−2
L’AIC s’accompagne parfois par le critère bayésien d’information (BIC) défini par l’expression
BIC = −2 ln (Ln ) + (k + 1) ln (n) .
En particulier, pour la regression linéaire multiple on a
BIC = n ln (M CE) + (k + 1) ln (n) .
L’AIC et le BIC pénalisent les modèles ayant trop de paramètres, mais l’AIC est plus recommandé.
On peut rémarquer que AIC −2 (k + 1)−n ln (2πV ar [ε]) et BIC −(k + 1) ln (n)−n ln (2πV ar [ε])
suivent des lois du Khi-2 à n − k − 1 degrés de liberté sous l’hypothèse nulle.
Les qualités de cet estimateur sont mesurées par le biais (b : X 7−→ E[fe(X) − f (X)]), la
variance (v : X 7−→ V ar[fe(X)]) et par conséquent l’erreur quadratique moyenne. Pour minimiser
l’erreur quadratique moyenne, il faut et il suffit que les poids (λi (X))1≤i≤n vérifient
Xn
λj (X) E [Yi Yj ] = E [Yj Y ] , i = 1, · · · , n
j=1
En d’autres termes
Xn
λj (X) (Cov [Yi , Yj ] + E [Yi ] E [Yj ]) = (Cov [Yi , Y ] + E [Yi ] E [Y ]) , i = 1, · · · , n (4.1)
j=1
2γ (h) = V ar [f (X + h) − f (X)]
, où →
−
e est un vecteur unitaire et h ∈ R. On distingue l’anisotropie géométrique de l’anisotropie
de support. La première est due à une déformation, via un endomorphisme bijectif, d’un vario-
gramme isotropique (γ (h) = γ0 (kA1 hk)) . La seconde correspond elle, à une déformation, via
un endomorphisme non-bijectif, d’un variogramme isotropique (γ (h) = γ0 (kA2 hk)). Si f est la
somme de deux champs intrinsèques, son variogramme est la somme de leurs variogrammes : il
est dit gigogne. Le champ f est souvent décomposé sous la forme :
,où m est une dérive déterministe représentant la variation à grande échelle, W est un champ
intrinsèque de grande portée, η est un champ intrinsèque de petite portée, et ε est une composante
pépitique modélisant l’erreur.
En pratique, on estime le semi-variogramme, on choisit un modèle connu auquel il s’ajuste le
plus, et on estime les paramètres. Les estimation peuvent être faites par les méthodes du maximum
de vraisemblance (MV), ou des moindres carrés (MCO). Pour déceler l’anisotropie, on estime les
En pratique la tolérance ε est choisie de telle sorte que Card (E (h, ε)) soit minoré par 30. Les
covariances sont estimées par la formule
1 X
C
b (h) = Xi − X Xj − X .
Card (E (h, ε)) (i ,j )∈E(h,ε)i
Plans d’expériences
5.1 Généralités
5.1.1 Vocabulaire des plans d’expériences
La compréhension d’un phénomène d’intérêt commence en général par des observations,
la formulation des hypothèses qui vont être validées par des enquêtes ou des expériences. Ces
expériences doivent être menées de façon à arriver rapidement aux meilleurs résultats possibles,
éviter de réaliser des expériences inutiles, obtenir la meilleure précision possible sur les résultats,
permettre d’avancer à coup sûr, établir la modélisation du phénomène étudié, et découvrir la
solution optimale [4]. Les trois étapes essentielles d’une étude sont :
— Le choix de la méthode d’expérimentation : il s’agit de faciliter l’interprétation des résultats,
minimiser le nombre des essais sans toutefois sacrifier la qualité ;
— L’analyse des résultats : il s’agit de trouver les outils appropriés pour tirer le maximum de
connaissances possibles ;
— L’acquisition progressive de la connaissance : il s’agit de structurer la démarche de réponse
aux questions posés.
En général, la compréhension d’un phénomène consiste à établir une relation (fonctionnelle)
entre une variable Y appelée réponse, et une variable explicative X appelée facteur. L’ensemble
des valeurs prises par le facteur X est appelé espace expérimental. Les éléments de l’espaces
expérimental sont appelés points expérimentaux et dans le cas atomique (unidimensionnel) on
parle de niveaux. Dans plusieurs cas de facteurs atomique (dimension 1), l’espace expérimental
est muni d’une relation d’ordre et admet un minimum appelé niveau bas et un maximum appelé
niveau haut. Si on se restreint à une sous-partie de l’espace expérimental, on parle de domaine
(de variation) du facteur ou domaine d’étude. On appelle surface de réponse le graphe de relation
entre les facteurs et les réponses. De la même façon on parle de courbe isoréponse pour tout lieu
géométrique de la surface de réponse. Il est de coutume pour simplifier les expressions procéder à
une transformation ou encore une codification. Par exemple −1 représente le niveau bas, 0 le niveau
intermédiare (ou milieu) et 1 pour le niveau haut. Cette transformation a également l’avantage
d’avoir des quantités comparables dont les effets sont plus réalistes, puisque sans dimensions. Le
tableau des données réelles est appelé tableau (ou matrice) expérimental(e) tandis que celui des
valeurs codées est appelé plan ou matrice d’expérience.
47
48 CHAPITRE 5. PLANS D’EXPÉRIENCES
où ai représente l’effet du facteur Xi et ai1 i2 ···ik représente l’effet de l’interaction des facteurs Xi1 ,
Xi2 , · · · , Xik . a0 représente la réponse au centre du domaine expérimental. Un plan est dit saturé s’il
comporte autant d’essais que de coefficients à déterminer dans le modèle mathématique. De façon
analogue, un plan est dit sursaturé s’il comporte moins d’essais que de coefficients à déterminer
dans le modèle mathématique.
On peut représenter graphiquement l’effet individuel d’un facteur. Il suffit de parcourir les
différents niveaux du facteur et à chaque niveau fixé de calculer la moyenne arithmétique des
réponses obtenues en faisant varier les autres facteurs. Un graphe non-constant illustre l’effet du
facteur ; en particulier dans le cas à deux niveaux on obtient un segment de droite de pente ai pour
le facteur i. Defaçon similaire, on peut représenter l’effet de l’interaction entre deux facteurs en
représentant les effets de l’un pour chaque niveau fixé de l’autre. On obtient plusieurs graphes qui
sont les translatés verticaux les uns des autres s’il n’y a pas d’interaction. Dans le cas particulier
c (x1 , x2 ) = a0 + a1 x1 + a2 x2 + a12 x1 x2 .
(a) Quel est le changement de variable adéquat pour la transformation des facteurs ?
(b) Quelle est la consommation si on roule à 80km/h avec une charge d’une demi tonne ?
(c) Déterminer de façon formèle les coefficients a0 , a1 , a2 , a12 et les interpréter.
(d) Déterminer de façon numérique les coefficients a0 , a1 , a2 , a12 .lorsque dans l’ordre
d’expérimentation évoqué ci-avant on obtient les réponses 8, 3 ; 10, 7 ; 9.7 et 12, 3. En
déduire le modèle avec des coefficients légaux c0 , c1 , c2 , c12 .
(e) Quelle est la consommation si on roule à 90km/h avec une charge de 100kg ?
(f ) Quelle est la consommation supplémentaire quand je roule à 100km/h au lieu de 80km/h
avec une surcharge de 150kg ?
(g) Faire des illustrations graphiques des effets des facteurs et de leurs interactions.
On constate que les quatre interactions ne sont pas influencées par la dérive contraire-
ment aux principaux effets. On peut y remédier en modifiant l’ordre des essais de la façon
suivante :
Essai n◦ I 10 20 30 10 20 10 30 20 30 10 20 30 réponse avec dérive
7(1) +1 −1 −1 −1 +1 +1 +1 −1 y1 + h
6(2) +1 +1 −1 −1 −1 −1 +1 +1 y2 + 2h
2(3) +1 −1 +1 −1 −1 +1 −1 +1 y3 + 3h
3(4) +1 +1 +1 −1 +1 −1 −1 −1 y4 + 4h
4(5) +1 −1 −1 +1 +1 −1 −1 +1 y5 + 5h
1(6) +1 +1 −1 +1 −1 +1 −1 −1 y6 + 6h
5(7) +1 −1 +1 +1 −1 −1 +1 −1 y7 + 7h
8(8) +1 +1 +1 +1 +1 +1 +1 +1 y8 + 8h
Influence facteur 36h 0 0 0 16h 4h 0 8h
Essai n◦ 10 20 30 Dérives
01 0 0 0 h
7(1) −1 −1 −1 2h
02 0 0 0 3h
6(2) +1 −1 −1 4h
03 0 0 0 5h
2(3) −1 +1 −1 6h
04 0 0 0 7h
3(4) +1 +1 −1 8h
05 0 0 0 9h
4(5) −1 −1 +1 10h
06 0 0 0 11h
1(6) +1 −1 +1 12h
07 0 0 0 13h
5(7) −1 +1 +1 14h
08 0 0 0 15h
8(8) +1 +1 +1 16h
09 0 0 0 17h
— Randomisation : elle consiste à choisir l’ordre des essais de manière aléatoire. La rando-
misation permet de transformer des erreurs systématiques en erreurs aléatoires et d’utiliser
les tests statistiques. Toutefois, elle a pour inconvénient d’accroı̂tre l’erreur alétoire et
de rendre plus difficile la détection les facteurs peu influent. Si les erreurs systématiques
sont importantes, la randomisation peut devenir une technique inappropriée. Les erreurs
systématiques doivent être éliminées avant la randomisation. La procédure correcte est
d’éliminer d’abord les erreurs systématiques les plus importantes en utilisant le blocking
ou les plans anti-dérive et de randomiser ensuite.
Manifestement, la plus optimale est M2 . De façon général, on garantit l’optmalité d’une matrice
M par la maximalité du déterminant de la matrice carré symétrique M T M : il s’agit de la D-
optimalité. Selon les valeurs associées au niveaux, on peut connaı̂tre cette valeur maximale qui
sera atteinte si les colonnes sont deux à deux orthogonales : elle vaudra exactement la somme des
carrés des norme euclidiennes de chacune des colonnes. Ainsi, une matrice optimale est un extrait
des colonne d’une matrice d’Hadamard dont les coefficients sont le moins possible nuls. Pour des
plans à niveaux −1 et +1 on atteint la D-optimalité avec un déterminant valant nn .
k ≤ p − log2 (p + 1) (5.2)
Exemple 5.2.1 .
1. Pour une expérience à 5 facteur, pour construire un plan fractionnaire 25−2 on peut considérer
entre autres comme GGA les ensemble de relations {4 = 12; 5 = 13} ou {4 = 12; 5 = 23}
ou {4 = 12; 5 = 123}. Si on reste sur GGA = {4 = 12; 5 = 13} on obtient la matrice
d’expérience :
y = `0 + `1 x1 + `2 x2 + `3 x3 + `4 x4 + `5 x5 + `23 x2 x3 + `25 x2 x5
2. On définit le plan complémentaire au plan précédent avec les générateur {4 = −12; 5 = −13}.
On obtient les contrastes
On définit pour les plans factoriels fractionnaires le concept de résolution de la façon suivante :
— Un plan factoriel est de résolution III si les effets principaux ne sont pas aliasés entre
eux mais avec les interactions d’ordre 2 ;
— Un plan factoriel est de résolution IV si les effets principaux ne sont aliasés ni entre
eux, ni avec les interactions d’ordre 2, mais ces dernières peuvent être aliasées ;
— Un plan factoriel est de résolution V s’il n’y a aucun aliasage dans l’ensemble constitué
des effets principaux et des interactions d’ordre 2, mais les effets principaux sont aliasés
aux interactions d’ordre 4 tandis les interctions d’ordres 2 et 3 sont aliasées.
1. Il s’agit d’une droite de regression basée sur les couples (xi , yi ) où xi est une modalité obsevée étant le quantile
théorique d’ordre αi et yi est le quantile théorique d’ordre αi pour la loi normale centrée-réduite N (0, 1).
Rechtschaffner a toutefois étendu ses plans aux plans du second degré et aux facteurs prenant
trois niveaux.
Exemple 5.5.1 Représenter les plans {2, 2}, {2, 3}, {3, 2}, {3, 3} et {3, 4}.
peut se réduire à Xp Xp
Y = bi X i + bij Xi Xj .
i=1 1≤i<j≤p
A la place du modèle cubique complet il est courant d’utilisé le plan cubique simplifié
Xp Xp Xp
Y = bi X i + bij Xi Xj + b0ijk Xi Xj Xk .
i=1 1≤i≤j≤p 1≤i<j<k≤p
Statistique explratoire
6.3 Classification
6.3.1 Classification hiérarchique
6.3.2 Les K-moyennes
6.3.3 Séparateurs à vaste marge (SVM)
6.3.4 Réseaux de neurones
62
Chapitre 7
Quelques exercices
63
64 CHAPITRE 7. QUELQUES EXERCICES
1 −|x|
Exercice 7.2.5 Soit la loi dite exponentielle double (ou de laplace) de densité f (x) = 2
e
(x ∈ R).
1. Déterminer sa fonction génératrice. En déduire son espérance mathématique et sa variance.
E [(X−E[X])3 ]
2. Calculer son coefficient d’asymétrie σ3
.
E [(X−E[X])4 ]
3. Calculer son coefficient d’aplatissement ou curtose σ4
− 3.
Exercice 7.2.7 Soient un n-échantillon (X1 , · · · Xn ) dont la loi mère est suivie par une variable
X.
1. Montrer que εn P (|X| > ε) ≤ E [|X|n ]. En déduire l’inégalité de Tchebichev
V ar [X]
P (|X − E [X]| > ε) ≤
ε2
1. (a) Montrer que pour tout x, Fn (x) est un estimateur sans biais de FX (x). Montrer en
outre que Fn (x) converge presque sûrement vers FX (x).
q
FX (x)(1−FX (x))
(b) Etablir la convergence en loi de Fn (x) vers N FX (x) , n
. Remarquer
que cette convergence est uniforme.
2. On désigne par FX(i) (x) la probabilité qu’au moins i termes de l’échantillon soient inférieures
à x.
La norme en dessous de laquelle on ne doit pas descendre pour la potabilité de l’eau est 5ppm.
Peut-on affirmer que l’eau est potable ?
Exercice 7.4.3 Une étude sur 5 années consécutives, s’intéresse à la production annuelle de deux
variétés A et B de maı̈s. Le tableau suivant est obtenu :
1999 2000 2001 2002 2003
A 10 9 15 18 12
B 13 10 11 8 11
1. Estimer les variances des productions des variétés A et B. Donner leurs intervalles de
confiance à 99%.
2. On suppose que les deux variétés ont la même moyenne.
(a) La variété A est-elle meilleure que la variété B ?
(b) La variété B est-elle meilleure que la variété A ?
(c) Les deux variétés sont elles similaires ?
Exercice 7.4.4 Un nouveau vaccinn contre le VIH-SIDA est expérimenté auprès de la population
d’une ville d’Afrique du sud. On prend deux échantillons A et B de 300 personnes chacun. On
injecte le vaccin aux individus de l’échantillon A et un placebo à ceux de l’échantillon B. Au bout
d’un an on constante que 30 personnes de l’échantillon A sont infectés et 70 de l’échantillon B.
Que dire de l’éfficacité du vaccin ? (Remarque : La population B est dite témoin, et elle permet
d’évaluer la probabilité naturelle de contracter le virus du VIH-SIDA).
Exercice 7.4.5 Suite à des sondages, l’institut SONDACAM donne 511 avis favorables au can-
didat A sur 1000 personnes interrogées, l’institut SONDAFR donne 480 favorables sur 945. La
proportion d’avis favorables donnée par SONDACAM est-elle supérieure à celle donnée par SON-
DAFR ?
S-Sèche S-pluie
Variété A 13, 10, 11, 12 9, 15, 16, 15
Variété B 7, 8, 10, 11 13, 17, 18, 19
Que conclure ?
Bruit
Definition A.0.1 1. (Xt )t∈T est un bruit blanc fort (BBF), si les variables aléatoires Xt sont
toutes de moyenne nulle (ie centrées), indépendantes et identiquement distribuées (iid).
2. (Xt )t∈T est un bruit blanc faible (BBf ), si les variables aléatoires Xt sont centrées, de même
variance finie σ 2 et sont deux à deux de covariances nulles.
3. (Xt )t∈T est un bruit blanc gaussien (BBG), si les variables aléatoires Xt sont iid et de loi
commune la gaussienne centrée réduite.
68
Annexe B
Fonction de Bessel
69
Bibliographie
[1] COHEN C., Introduction aux plans d’expériences, Rev. Statistique Appliquée, XXXVII (2),
pp 17-46, 1989.
[2] DAGNELIE P., Principes d’expérimentation : Planification des expériences et analyse de leurs
résultats, Les Presses Agronomiques de Gembloux, A.S.B.L., 2012.
[3] EASTERLING R.G., Fundamentals of Statistical Experimental Design and Analysis, John
Wiley & Sons, Ltd, 2015.
[4] GOUPY J., CREIGHTON L., Introduction aux plans d’expériences, troisième édition, Dunod,
2006.
[5] Gut A., Probability : A Graduate Course, Springer Science+Business Media Inc., 2005.
[6] LEJEUNE M., Statistique : la Théorie et ses Applications, deuxième édition, Springer-Verlag
France, Paris, 2010.
[7] SAPORTA G., Probabilités ; Analyses de données et Statistique, deuxième édition, TECHNIP,
Paris 2006.
[8] STEPHENS L., Theory and Problems of Beginning Statistics, Schaum’s Outlines, McGraw-
Hill, 1998.
70