Estimation
Estimation
15 octobre 2025
1 / 90
Plan du Cours
Introduction à l’Estimation
Synthèse et Applications
2 / 90
Problématique de l’Estimation
Question fondamentale :
4 / 90
Notation et Vocabulaire
Notations importantes
▶ θ : Paramètre de la population (inconnu)
▶ θ̂ : Estimateur du paramètre
▶ X1 , X2 , . . . , Xn : Échantillon aléatoire de taille n
▶ X̄ : Moyenne échantillonnale
▶ S2 : Variance échantillonnale
Remarque : Un estimateur est une variable aléatoire, tandis qu’une estimation est une valeur
numérique.
5 / 90
Qu’est-ce qu’une Estimation Ponctuelle ?
Definition
Une estimation ponctuelle est une valeur unique calculée à partir d’un échantillon pour
estimer un paramètre de la population.
Exemples :
▶ Moyenne : µ̂ = X̄ Limitation
▶ Variance : σ̂ 2 = S2 Une estimation ponctuelle ne donne aucune
▶ Proportion : p̂ = x information sur la précision de l’estimation.
n
6 / 90
Qualités d’un Bon Estimateur
2. Convergent (Consistent)
3. Efficace (Efficient)
Variance minimale parmi tous les estimateurs sans biais.
7 / 90
Question Interactive 1
Réflexion
Supposons que vous ayez deux estimateurs de la moyenne :
∑n
▶ Estimateur A : µ̂A = n1 i=1 Xi (moyenne arithmétique)
▶ Estimateur B : µ̂B = X1 +Xn
2 (moyenne du premier et dernier)
8 / 90
Question Interactive 1
Réflexion
Supposons que vous ayez deux estimateurs de la moyenne :
∑n
▶ Estimateur A : µ̂A = n1 i=1 Xi (moyenne arithmétique)
▶ Estimateur B : µ̂B = X1 +Xn
2 (moyenne du premier et dernier)
Discussion
▶ Les deux sont sans biais
▶ Mais A utilise toute l’information disponible
▶ A est plus efficace (variance plus faible)
8 / 90
Exemple : Estimation de la Moyenne
Contexte IA/Cybersécurité
Un système de détection d’intrusion enregistre le temps de réponse (en ms) pour 10 requêtes :
1∑
n
12 + 15 + 13 + 18 + 14 + 16 + 15 + 17 + 13 + 14
µ̂ = X̄ = xi =
n 10
i=1
9 / 90
Exemple : Estimation de la Moyenne
Contexte IA/Cybersécurité
Un système de détection d’intrusion enregistre le temps de réponse (en ms) pour 10 requêtes :
1∑
n
12 + 15 + 13 + 18 + 14 + 16 + 15 + 17 + 13 + 14
µ̂ = X̄ = xi =
n 10
i=1
147
µ̂ = = 14.7 ms
10
Remarque : Cette valeur est notre meilleure estimation du temps de réponse moyen du
système.
9 / 90
Exemple : Estimation de la Variance
Avec les mêmes données : 12, 15, 13, 18, 14, 16, 15, 17, 13, 14
1 ∑
n
σ̂ 2 = S2 = (xi − x̄)2
n−1
i=1
10 / 90
Exemple : Estimation de la Variance
Avec les mêmes données : 12, 15, 13, 18, 14, 16, 15, 17, 13, 14
1 ∑
n
σ̂ 2 = S2 = (xi − x̄)2
n−1
i=1
1[ ]
S2 = (12 − 14.7)2 + (15 − 14.7)2 + · · · + (14 − 14.7)2
9
1
= [7.29 + 0.09 + 2.89 + 10.89 + 0.49 + 1.69 + 0.09 + 5.29 + 2.89 + 0.49]
9
32.1
= = 3.57
9
10 / 90
Exemple : Estimation de la Variance
Avec les mêmes données : 12, 15, 13, 18, 14, 16, 15, 17, 13, 14
1 ∑
n
σ̂ 2 = S2 = (xi − x̄)2
n−1
i=1
1[ ]
S2 = (12 − 14.7)2 + (15 − 14.7)2 + · · · + (14 − 14.7)2
9
1
= [7.29 + 0.09 + 2.89 + 10.89 + 0.49 + 1.69 + 0.09 + 5.29 + 2.89 + 0.49]
9
32.1
= = 3.57
9
√
σ̂ = 3.57 ≈ 1.89 ms
10 / 90
Pourquoi n − 1 dans la Variance ?
Biais de la variance
▶ Si on divise par n : estimateur biaisé (sous-estime la variance)
▶ Si on divise par n − 1 : estimateur sans biais
▶ On perd un degré de liberté en estimant la moyenne
n−1 2
2
E[σ̂biaise ]= σ E[S2 ] = σ 2
n
11 / 90
Exemple : Estimation d’une Proportion
Contexte Cybersécurité
Sur 200 tentatives de connexion analysées, 45 ont été identifiées comme suspectes.
Estimer la proportion de connexions suspectes.
Estimateur de la proportion :
x nombre de succès
p̂ = =
n taille de l’échantillon
12 / 90
Exemple : Estimation d’une Proportion
Contexte Cybersécurité
Sur 200 tentatives de connexion analysées, 45 ont été identifiées comme suspectes.
Estimer la proportion de connexions suspectes.
Estimateur de la proportion :
x nombre de succès
p̂ = =
n taille de l’échantillon
45
p̂ = = 0.225 = 22.5%
200
12 / 90
Limites de l’Estimation Ponctuelle
Problème
Une estimation ponctuelle ne donne pas d’information sur :
▶ La précision de l’estimation
▶ L’incertitude liée à l’échantillonnage
▶ La fiabilité du résultat
P(L ≤ θ ≤ U) = 1 − α
13 / 90
Concept d’Intervalle de Confiance
Definition
Un intervalle de confiance à (1 − α) × 100% pour un paramètre θ est un intervalle aléatoire
[L, U] tel que :
P(θ ∈ [L, U]) = 1 − α
IC à 95%
θ
L θ̂ U
14 / 90
Interprétation de l’Intervalle de Confiance
Interprétation correcte
Si on répète l’expérience (échantillonnage) un grand nombre de fois :
▶ Environ 95% des intervalles construits contiendront la vraie valeur de θ
▶ 5% des intervalles ne contiendront pas θ
Attention !
INCORRECT : ”La probabilité que θ soit dans l’intervalle est 95%”
CORRECT : ”Nous avons 95% de confiance que l’intervalle contient θ”
Remarque : Le paramètre θ est fixe (mais inconnu). C’est l’intervalle qui est aléatoire !
15 / 90
Niveau de Confiance et Valeur Critique
95%
Valeurs critiques (loi normale) :
▶ 90% : z0.05 = 1.645 −1.96 1.96
▶ 95% : z0.025 = 1.96
▶ 99% : z0.005 = 2.576
16 / 90
IC pour une Moyenne (Variance Connue)
Composantes :
▶ X̄ : estimation ponctuelle (centre)
▶ zα/2 √σ : marge d’erreur
n
▶ σ
√ : erreur standard
n
17 / 90
Exemple : IC pour une Moyenne (Variance Connue)
Contexte
Un système de reconnaissance faciale a un temps de traitement moyen à estimer. On sait par
expérience que σ = 2 ms. Sur 100 images, on obtient x̄ = 15 ms.
Construire un IC à 95%.
18 / 90
Exemple : IC pour une Moyenne (Variance Connue)
Contexte
Un système de reconnaissance faciale a un temps de traitement moyen à estimer. On sait par
expérience que σ = 2 ms. Sur 100 images, on obtient x̄ = 15 ms.
Construire un IC à 95%.
Solution :
▶ n = 100, x̄ = 15, σ = 2, α = 0.05
▶ z0.025 = 1.96
▶ Marge d’erreur : ME = 1.96 × √2 = 1.96 × 0.2 = 0.392
100
18 / 90
Exemple : IC pour une Moyenne (Variance Connue)
Contexte
Un système de reconnaissance faciale a un temps de traitement moyen à estimer. On sait par
expérience que σ = 2 ms. Sur 100 images, on obtient x̄ = 15 ms.
Construire un IC à 95%.
Solution :
▶ n = 100, x̄ = 15, σ = 2, α = 0.05
▶ z0.025 = 1.96
▶ Marge d’erreur : ME = 1.96 × √2 = 1.96 × 0.2 = 0.392
100
18 / 90
IC pour une Moyenne (Variance Inconnue)
où :
▶ tα/2,n−1 : quantile de la loi de Student
▶ S : écart-type échantillonnal
Remarque : Quand n est grand (n > 30), la loi de Student converge vers la loi normale.
19 / 90
Loi de Student vs Loi Normale
Student (df=5)
Normale
20 / 90
Exemple : IC avec Loi de Student
Données
Temps de réponse (ms) : 12, 15, 13, 18, 14, 16, 15, 17, 13, 14
On a calculé : x̄ = 14.7, s = 1.89, n = 10
Construction d’un IC à 95% :
21 / 90
Exemple : IC avec Loi de Student
Données
Temps de réponse (ms) : 12, 15, 13, 18, 14, 16, 15, 17, 13, 14
On a calculé : x̄ = 14.7, s = 1.89, n = 10
Construction d’un IC à 95% :
▶ Degrés de liberté : df = n − 1 = 9
▶ Valeur critique : t0.025,9 = 2.262 (table de Student)
▶ Erreur standard : SE = √s = √ 1.89
= 0.598
n 10
▶ Marge d’erreur : ME = 2.262 × 0.598 = 1.353
21 / 90
Exemple : IC avec Loi de Student
Données
Temps de réponse (ms) : 12, 15, 13, 18, 14, 16, 15, 17, 13, 14
On a calculé : x̄ = 14.7, s = 1.89, n = 10
Construction d’un IC à 95% :
▶ Degrés de liberté : df = n − 1 = 9
▶ Valeur critique : t0.025,9 = 2.262 (table de Student)
▶ Erreur standard : SE = √s = √ 1.89
= 0.598
n 10
▶ Marge d’erreur : ME = 2.262 × 0.598 = 1.353
21 / 90
IC pour une Proportion
Composantes :
▶ p̂ = nx : proportion échantillonnale
√
▶ p̂(1−p̂)
n : erreur standard de la proportion
22 / 90
Exemple : IC pour une Proportion
Rappel
Sur 200 connexions, 45 ont été identifiées comme suspectes.
p̂ = 0.225
Construction d’un IC à 95% :
23 / 90
Exemple : IC pour une Proportion
Rappel
Sur 200 connexions, 45 ont été identifiées comme suspectes.
p̂ = 0.225
Construction d’un IC à 95% :
▶ Vérification : np̂ = 45 ≥ 5 et n(1 − p̂) = 155 ≥ 5 �
▶ z0.025 = 1.96
√ √
▶ Erreur standard : SE = 0.225×0.775
200 = 0.000872 = 0.0295
▶ Marge d’erreur : ME = 1.96 × 0.0295 = 0.058
23 / 90
Exemple : IC pour une Proportion
Rappel
Sur 200 connexions, 45 ont été identifiées comme suspectes.
p̂ = 0.225
Construction d’un IC à 95% :
▶ Vérification : np̂ = 45 ≥ 5 et n(1 − p̂) = 155 ≥ 5 �
▶ z0.025 = 1.96
√ √
▶ Erreur standard : SE = 0.225×0.775
200 = 0.000872 = 0.0295
▶ Marge d’erreur : ME = 1.96 × 0.0295 = 0.058
23 / 90
Question Interactive 2
Réflexion
Comment varie la largeur d’un intervalle de confiance si :
1. On augmente le niveau de confiance de 95% à 99% ?
2. On double la taille de l’échantillon ?
3. La variance de la population augmente ?
24 / 90
Question Interactive 2
Réflexion
Comment varie la largeur d’un intervalle de confiance si :
1. On augmente le niveau de confiance de 95% à 99% ?
2. On double la taille de l’échantillon ?
3. La variance de la population augmente ?
Réponses
1. L’intervalle devient plus large (plus de confiance = plus d’incertitude)
√
2. L’intervalle devient plus étroit (∝ 1/ n)
3. L’intervalle devient plus large (plus de variabilité)
24 / 90
Taille d’Échantillon Nécessaire
Question pratique
Quelle taille d’échantillon faut-il pour obtenir une marge d’erreur souhaitée ?
Pour estimer une moyenne :
(z )2
α/2 σ
n=
ME
Pour estimer une proportion :
(z )2
α/2
n = p̂(1 − p̂)
ME
Si p̂ inconnu, utiliser p̂ = 0.5 (cas le plus défavorable).
25 / 90
Exemple : Détermination de la Taille d’Échantillon
Problème
Un ingénieur cybersécurité veut estimer la proportion de paquets malveillants avec une marge
d’erreur de 3% et un niveau de confiance de 95%.
Combien de paquets doit-il analyser ?
26 / 90
Exemple : Détermination de la Taille d’Échantillon
Problème
Un ingénieur cybersécurité veut estimer la proportion de paquets malveillants avec une marge
d’erreur de 3% et un niveau de confiance de 95%.
Combien de paquets doit-il analyser ?
Solution :
▶ ME = 0.03, α = 0.05, z0.025 = 1.96
▶ Pas d’estimation préalable : p̂ = 0.5
26 / 90
Exemple : Détermination de la Taille d’Échantillon
Problème
Un ingénieur cybersécurité veut estimer la proportion de paquets malveillants avec une marge
d’erreur de 3% et un niveau de confiance de 95%.
Combien de paquets doit-il analyser ?
Solution :
▶ ME = 0.03, α = 0.05, z0.025 = 1.96
▶ Pas d’estimation préalable : p̂ = 0.5
( )2
1.96
n = 0.5 × 0.5 × = 0.25 × (65.33)2 = 0.25 × 4268 = 1067
0.03
Réponse : Il faut analyser au moins 1067 paquets.
26 / 90
Introduction aux Méthodes d’Estimation
Objectif
Comment construire de ”bons” estimateurs pour les paramètres d’une distribution ?
Principales méthodes :
1. Méthode du Maximum de Vraisemblance (MLE)
2. Méthode des Moments (MM)
3. Estimation Bayésienne
27 / 90
Principe du Maximum de Vraisemblance
Definition
La méthode du maximum de vraisemblance (MLE) consiste à choisir comme estimateur la
valeur du paramètre qui maximise la probabilité d’observer l’échantillon obtenu.
Intuition :
▶ On observe des données x1 , x2 , . . . , xn
▶ On cherche θ̂ qui rend ces observations les plus ”vraisemblables”
▶ On maximise L(θ|x1 , . . . , xn )
28 / 90
Fonction de Vraisemblance
Définition
Pour un échantillon i.i.d. X1 , . . . , Xn de densité/masse f(x|θ) :
∏
n
L(θ) = L(θ|x1 , . . . , xn ) = f(xi |θ)
i=1
∑
n
ℓ(θ) = ln L(θ) = ln f(xi |θ)
i=1
29 / 90
Procédure MLE
Étapes
∏n
1. Écrire la fonction de vraisemblance : L(θ) = i=1 f(xi |θ)
2. Calculer la log-vraisemblance : ℓ(θ) = ln L(θ)
dℓ(θ)
3. Dériver par rapport à θ : dθ
dℓ(θ)
4. Résoudre : dθ =0
d2 ℓ(θ)
5. Vérifier que c’est un maximum : dθ 2 <0
30 / 90
Exemple : MLE pour la Moyenne d’une Loi Normale
Contexte : X1 , . . . , Xn ∼ N (µ, σ 2 ) avec σ 2 connu.
Trouver µ̂MLE .
31 / 90
Exemple : MLE pour la Moyenne d’une Loi Normale
Contexte : X1 , . . . , Xn ∼ N (µ, σ 2 ) avec σ 2 connu.
Trouver µ̂MLE .
Étape 1 : Vraisemblance
∏
n ( )
1 (xi − µ)2
L(µ) = √ exp −
2πσ 2 2σ 2
i=1
31 / 90
Exemple : MLE pour la Moyenne d’une Loi Normale
Contexte : X1 , . . . , Xn ∼ N (µ, σ 2 ) avec σ 2 connu.
Trouver µ̂MLE .
Étape 1 : Vraisemblance
∏
n ( )
1 (xi − µ)2
L(µ) = √ exp −
2πσ 2 2σ 2
i=1
Étape 2 : Log-vraisemblance
1 ∑
n
n
ℓ(µ) = − ln(2πσ 2 ) − 2 (xi − µ)2
2 2σ
i=1
31 / 90
Exemple : MLE pour la Moyenne d’une Loi Normale
Contexte : X1 , . . . , Xn ∼ N (µ, σ 2 ) avec σ 2 connu.
Trouver µ̂MLE .
Étape 1 : Vraisemblance
∏
n ( )
1 (xi − µ)2
L(µ) = √ exp −
2πσ 2 2σ 2
i=1
Étape 2 : Log-vraisemblance
1 ∑
n
n
ℓ(µ) = − ln(2πσ 2 ) − 2 (xi − µ)2
2 2σ
i=1
Étape 3 : Dérivée
1 ∑
n
dℓ(µ)
= 2 (xi − µ)
dµ σ
i=1
31 / 90
Exemple : MLE pour la Moyenne d’une Loi Normale (suite)
Étape 4 : Résolution
dℓ(µ) ∑ n
=0⇒ (xi − µ) = 0
dµ
i=1
∑
n
⇒ xi − nµ = 0
i=1
1∑
n
⇒ µ̂MLE = xi = X̄
n
i=1
32 / 90
Exemple : MLE pour la Moyenne d’une Loi Normale (suite)
Étape 4 : Résolution
dℓ(µ) ∑ n
=0⇒ (xi − µ) = 0
dµ
i=1
∑
n
⇒ xi − nµ = 0
i=1
1∑
n
⇒ µ̂MLE = xi = X̄
n
i=1
Étape 5 : Vérification
d2 ℓ(µ) n
2
=− 2 <0
dµ σ
�
32 / 90
Exemple : MLE pour la Loi de Poisson
Contexte : Nombre d’attaques détectées par heure suit une loi de Poisson.
Données : x1 , x2 , . . . , xn (nombre d’attaques observées)
Paramètre : λ (taux moyen d’attaques)
33 / 90
Exemple : MLE pour la Loi de Poisson
Contexte : Nombre d’attaques détectées par heure suit une loi de Poisson.
Données : x1 , x2 , . . . , xn (nombre d’attaques observées)
Paramètre : λ (taux moyen d’attaques)
x −λ
e
Fonction de masse : P(X = x) = λ x!
33 / 90
Exemple : MLE pour la Loi de Poisson
Contexte : Nombre d’attaques détectées par heure suit une loi de Poisson.
Données : x1 , x2 , . . . , xn (nombre d’attaques observées)
Paramètre : λ (taux moyen d’attaques)
x −λ
e
Fonction de masse : P(X = x) = λ x!
Vraisemblance :
∏
n
λxi e−λ
L(λ) =
xi !
i=1
33 / 90
Exemple : MLE pour la Loi de Poisson
Contexte : Nombre d’attaques détectées par heure suit une loi de Poisson.
Données : x1 , x2 , . . . , xn (nombre d’attaques observées)
Paramètre : λ (taux moyen d’attaques)
x −λ
e
Fonction de masse : P(X = x) = λ x!
Vraisemblance :
∏
n
λxi e−λ
L(λ) =
xi !
i=1
Log-vraisemblance :
∑
n ∑
n
ℓ(λ) = xi ln(λ) − nλ − ln(xi !)
i=1 i=1
33 / 90
Exemple : MLE pour la Loi de Poisson (suite)
Dérivée :
1∑
n
dℓ(λ)
= xi − n
dλ λ
i=1
34 / 90
Exemple : MLE pour la Loi de Poisson (suite)
Dérivée :
1∑
n
dℓ(λ)
= xi − n
dλ λ
i=1
Résolution :
1∑
n
dℓ(λ)
=0⇒ xi = n
dλ λ
i=1
1 ∑
n
⇒ λ̂MLE = xi = X̄
n
i=1
34 / 90
Exemple : MLE pour la Loi de Poisson (suite)
Dérivée :
1∑
n
dℓ(λ)
= xi − n
dλ λ
i=1
Résolution :
1∑
n
dℓ(λ)
=0⇒ xi = n
dλ λ
i=1
1 ∑
n
⇒ λ̂MLE = xi = X̄
n
i=1
34 / 90
Propriétés des Estimateurs MLE
Avantages
▶ Asymptotiquement sans biais
▶ Asymptotiquement efficace (variance minimale)
▶ Convergent
▶ Invariant par transformation : si θ̂ est MLE de θ, alors g(θ̂) est MLE de g(θ)
Limitations
▶ Peut être biaisé pour petits échantillons
▶ Nécessite de connaître la forme de la distribution
▶ Calculs parfois complexes
35 / 90
Question Interactive 3
Réflexion
On observe les temps de défaillance (en heures) de 5 composants :
Si on modélise ces temps par une loi exponentielle de paramètre λ (densité : f(x) = λe−λx ),
quelle serait votre intuition pour estimer λ ?
36 / 90
Question Interactive 3
Réflexion
On observe les temps de défaillance (en heures) de 5 composants :
Si on modélise ces temps par une loi exponentielle de paramètre λ (densité : f(x) = λe−λx ),
quelle serait votre intuition pour estimer λ ?
Discussion
▶ La moyenne des observations est x̄ = 15 heures
▶ Pour la loi exponentielle : E[X] = λ1
▶ Intuition : λ̂ ≈ 1x̄ = 15
1
≈ 0.067
▶ C’est effectivement l’estimateur MLE ! (à vérifier par calcul)
36 / 90
Principe de la Méthode des Moments
Definition
La méthode des moments consiste à égaler les moments théoriques de la distribution aux
moments empiriques de l’échantillon.
Moments :
▶ Moment théorique d’ordre k : µk = E[Xk ]
∑
▶ Moment empirique d’ordre k : mk = n1 ni=1 Xki
37 / 90
Procédure de la Méthode des Moments
Étapes
1. Identifier le nombre p de paramètres à estimer
2. Exprimer les p premiers moments théoriques en fonction des paramètres :
38 / 90
Exemple : Méthode des Moments pour la Loi Normale
39 / 90
Exemple : Méthode des Moments pour la Loi Normale
39 / 90
Exemple : Méthode des Moments pour la Loi Normale
39 / 90
Exemple : Méthode des Moments pour la Loi Normale
39 / 90
Exemple : Méthode des Moments pour la Loi Normale (suite)
Résolution :
De la première équation :
µ̂MM = X̄
40 / 90
Exemple : Méthode des Moments pour la Loi Normale (suite)
Résolution :
De la première équation :
µ̂MM = X̄
De la deuxième équation :
1∑ 2
n
2
σ̂MM = Xi − X̄2
n
i=1
1 ∑
n
2X̄ ∑
n
= X2i − Xi + X̄2
n n
i=1 i=1
1 ∑
n
= (Xi − X̄)2
n
i=1
40 / 90
Exemple : Méthode des Moments pour la Loi Normale (suite)
Résolution :
De la première équation :
µ̂MM = X̄
De la deuxième équation :
1∑ 2
n
2
σ̂MM = Xi − X̄2
n
i=1
1 ∑
n
2X̄ ∑
n
= X2i − Xi + X̄2
n n
i=1 i=1
1 ∑
n
= (Xi − X̄)2
n
i=1
Remarque : L’estimateur de la variance par la méthode des moments est biaisé (division par n
au lieu de n − 1).
40 / 90
Exemple : Méthode des Moments pour la Loi Uniforme
41 / 90
Exemple : Méthode des Moments pour la Loi Uniforme
41 / 90
Exemple : Méthode des Moments pour la Loi Uniforme
41 / 90
Exemple : Méthode des Moments pour la Loi Uniforme
41 / 90
Exemple : Méthode des Moments pour la Loi Uniforme
41 / 90
Exemple : Application Numérique (Uniforme)
Données
On observe des temps d’exécution (en secondes) supposés uniformes sur [0, θ] :
2.3, 4.1, 3.5, 5.2, 1.8, 3.9, 4.5, 2.7, 3.2, 4.8
42 / 90
Exemple : Application Numérique (Uniforme)
Données
On observe des temps d’exécution (en secondes) supposés uniformes sur [0, θ] :
2.3, 4.1, 3.5, 5.2, 1.8, 3.9, 4.5, 2.7, 3.2, 4.8
Calcul de l’estimateur :
2.3 + 4.1 + 3.5 + 5.2 + 1.8 + 3.9 + 4.5 + 2.7 + 3.2 + 4.8
x̄ =
10
36
= = 3.6
10
42 / 90
Exemple : Application Numérique (Uniforme)
Données
On observe des temps d’exécution (en secondes) supposés uniformes sur [0, θ] :
2.3, 4.1, 3.5, 5.2, 1.8, 3.9, 4.5, 2.7, 3.2, 4.8
Calcul de l’estimateur :
2.3 + 4.1 + 3.5 + 5.2 + 1.8 + 3.9 + 4.5 + 2.7 + 3.2 + 4.8
x̄ =
10
36
= = 3.6
10
Interprétation : On estime que les temps d’exécution sont uniformément répartis entre 0 et
7.2 secondes.
42 / 90
Comparaison MLE vs Méthode des Moments
Conseil pratique :
▶ MLE : quand la distribution est bien connue
▶ Moments : pour une première approximation rapide
▶ Dans beaucoup de cas, les deux méthodes donnent des résultats similaires
43 / 90
Estimation Ponctuelle d’une Moyenne - Synthèse
Estimateur naturel
1∑
n
µ̂ = X̄ = Xi
n
i=1
Propriétés :
▶ Sans biais : E[X̄] = µ
P
▶ Convergent : X̄ −
→ µ (loi des grands nombres)
2
▶ Variance : Var(X̄) = σn
▶ C’est l’estimateur MLE et MM pour la loi normale !
44 / 90
Distribution de la Moyenne Échantillonnale
X̄ − µ d
√ − → N (0, 1)
σ/ n
Implications pratiques :
▶ Pour n grand (n ≥ 30), X̄ ≈ N (µ, σ 2 /n)
▶ Valable quelle que soit la distribution originale !
▶ Permet de construire des IC même sans normalité
45 / 90
Exemple : Estimation dans un Contexte IA
Problème
Un modèle de deep learning est entraîné 20 fois avec différentes initialisations aléatoires. On
obtient les précisions suivantes (en %) :
87, 89, 86, 90, 88, 87, 91, 89, 88, 90,
46 / 90
Exemple : Estimation dans un Contexte IA
Problème
Un modèle de deep learning est entraîné 20 fois avec différentes initialisations aléatoires. On
obtient les précisions suivantes (en %) :
87, 89, 86, 90, 88, 87, 91, 89, 88, 90,
46 / 90
Exemple : Estimation dans un Contexte IA
Problème
Un modèle de deep learning est entraîné 20 fois avec différentes initialisations aléatoires. On
obtient les précisions suivantes (en %) :
87, 89, 86, 90, 88, 87, 91, 89, 88, 90,
Contexte
Comparer deux populations (ex : performances de deux algorithmes)
▶ Population 1 : X1 , . . . , Xn1 avec moyenne µ1
▶ Population 2 : Y1 , . . . , Yn2 avec moyenne µ2
Estimateur de µ1 − µ2 :
µ̂1 − µ̂2 = X̄ − Ȳ
IC pour µ1 − µ2 (variances égales) :
[ √ ]
1 1
(X̄ − Ȳ) ± tα/2,n1 +n2 −2 × Sp +
n1 n2
47 / 90
Exemple : Comparaison de Deux Algorithmes
Contexte
Deux algorithmes de chiffrement sont comparés sur leur temps d’exécution (ms) :
▶ Algo A : n1 = 15, x̄1 = 12.5, s1 = 2.1
▶ Algo B : n2 = 12, x̄2 = 14.8, s2 = 2.3
Construire un IC à 95% pour la différence de temps moyen.
48 / 90
Exemple : Comparaison de Deux Algorithmes
Contexte
Deux algorithmes de chiffrement sont comparés sur leur temps d’exécution (ms) :
▶ Algo A : n1 = 15, x̄1 = 12.5, s1 = 2.1
▶ Algo B : n2 = 12, x̄2 = 14.8, s2 = 2.3
Construire un IC à 95% pour la différence de temps moyen.
Calculs :
14 × 4.41 + 11 × 5.29 119.93
S2p = = = 4.80
25 25
Sp = 2.19
48 / 90
Exemple : Comparaison de Deux Algorithmes
Contexte
Deux algorithmes de chiffrement sont comparés sur leur temps d’exécution (ms) :
▶ Algo A : n1 = 15, x̄1 = 12.5, s1 = 2.1
▶ Algo B : n2 = 12, x̄2 = 14.8, s2 = 2.3
Construire un IC à 95% pour la différence de temps moyen.
Calculs :
14 × 4.41 + 11 × 5.29 119.93
S2p = = = 4.80
25 25
Sp = 2.19
t0.025,25 = 2.060
√
1 1
ME = 2.060 × 2.19 × + = 2.060 × 2.19 × 0.386 = 1.74
15 12
48 / 90
Exemple : Comparaison de Deux Algorithmes
Contexte
Deux algorithmes de chiffrement sont comparés sur leur temps d’exécution (ms) :
▶ Algo A : n1 = 15, x̄1 = 12.5, s1 = 2.1
▶ Algo B : n2 = 12, x̄2 = 14.8, s2 = 2.3
Construire un IC à 95% pour la différence de temps moyen.
Calculs :
14 × 4.41 + 11 × 5.29 119.93
S2p = = = 4.80
25 25
Sp = 2.19
t0.025,25 = 2.060
√
1 1
ME = 2.060 × 2.19 × + = 2.060 × 2.19 × 0.386 = 1.74
15 12
Différence fondamentale
▶ Approche fréquentiste : Le paramètre θ est fixe mais inconnu
▶ Approche bayésienne : Le paramètre θ est une variable aléatoire
Philosophie bayésienne :
1. On a une connaissance a priori sur θ : π(θ)
2. On observe des données : x1 , . . . , xn
3. On met à jour notre connaissance : π(θ|x1 , . . . , xn )
49 / 90
Théorème de Bayes
Formule fondamentale
f(x|θ)π(θ)
π(θ|x) = ∝ f(x|θ)π(θ)
f(x)
où :
▶ π(θ) : distribution a priori
▶ f(x|θ) : vraisemblance
▶ π(θ|x) : distribution a posteriori
▶ f(x) : constante de normalisation
En mots :
Posteriori ∝ Vraisemblance × Priori
50 / 90
Estimation Bayésienne
2. Moyenne a posteriori : ∫
θ̂Bayes = E[θ|x] = θπ(θ|x)dθ
3. Médiane a posteriori :
P(θ ≤ θ̂med |x) = 0.5
51 / 90
Choix de la Distribution A Priori
Types de prioris
▶ Priori informatif : Reflète une connaissance préalable forte
▶ Priori peu informatif : Influence minimale sur le posteriori
▶ Priori conjugué : Le posteriori a la même forme que le priori
52 / 90
Exemple : Estimation Bayésienne d’une Proportion
Contexte
Détection de spam : On veut estimer la proportion p de spams.
A priori : On pense que p ≈ 0.3 avec une certaine incertitude.
On utilise p ∼ Beta(α, β) avec α = 3, β = 7 (moyenne = 0.3)
53 / 90
Exemple : Estimation Bayésienne d’une Proportion
Contexte
Détection de spam : On veut estimer la proportion p de spams.
A priori : On pense que p ≈ 0.3 avec une certaine incertitude.
On utilise p ∼ Beta(α, β) avec α = 3, β = 7 (moyenne = 0.3)
Données : Sur 100 emails, 40 sont des spams (x = 40, n = 100)
53 / 90
Exemple : Estimation Bayésienne d’une Proportion
Contexte
Détection de spam : On veut estimer la proportion p de spams.
A priori : On pense que p ≈ 0.3 avec une certaine incertitude.
On utilise p ∼ Beta(α, β) avec α = 3, β = 7 (moyenne = 0.3)
Données : Sur 100 emails, 40 sont des spams (x = 40, n = 100)
Vraisemblance : Binomiale
f(x|p) ∝ px (1 − p)n−x
53 / 90
Exemple : Estimation Bayésienne d’une Proportion
Contexte
Détection de spam : On veut estimer la proportion p de spams.
A priori : On pense que p ≈ 0.3 avec une certaine incertitude.
On utilise p ∼ Beta(α, β) avec α = 3, β = 7 (moyenne = 0.3)
Données : Sur 100 emails, 40 sont des spams (x = 40, n = 100)
Vraisemblance : Binomiale
f(x|p) ∝ px (1 − p)n−x
Posteriori : Beta(α + x, β + n − x) = Beta(3 + 40, 7 + 60) = Beta(43, 67)
53 / 90
Exemple : Estimation Bayésienne d’une Proportion
Contexte
Détection de spam : On veut estimer la proportion p de spams.
A priori : On pense que p ≈ 0.3 avec une certaine incertitude.
On utilise p ∼ Beta(α, β) avec α = 3, β = 7 (moyenne = 0.3)
Données : Sur 100 emails, 40 sont des spams (x = 40, n = 100)
Vraisemblance : Binomiale
f(x|p) ∝ px (1 − p)n−x
Posteriori : Beta(α + x, β + n − x) = Beta(3 + 40, 7 + 60) = Beta(43, 67)
Estimation (moyenne a posteriori) :
α+x 43
p̂Bayes = = = 0.391
α+β+n 110
53 / 90
Exemple : Visualisation Bayésienne
Densité
Priori : Beta(3,7) Posteriori : Beta(43,67)
0.391
0.3
p
0 0.5 1
Observation : Le posteriori combine le priori et les données, se déplaçant vers les observations.
54 / 90
Intervalle de Crédibilité Bayésien
Definition
Un intervalle de crédibilité à (1 − α) × 100% est un intervalle [L, U] tel que :
P(L ≤ θ ≤ U|x) = 1 − α
Remarque : L’interprétation bayésienne est souvent plus intuitive mais nécessite un priori.
55 / 90
Exemple : Intervalle de Crédibilité
56 / 90
Exemple : Intervalle de Crédibilité
56 / 90
Exemple : Intervalle de Crédibilité
56 / 90
Avantages et Inconvénients de l’Approche Bayésienne
Avantages
▶ Intègre naturellement les connaissances préalables
▶ Interprétation probabiliste directe
▶ Particulièrement utile avec peu de données
▶ Adapté aux problèmes séquentiels (mise à jour continue)
Inconvénients
▶ Choix du priori peut être subjectif
▶ Calculs parfois complexes (nécessite souvent MCMC)
▶ Dépend du priori choisi (sensibilité)
▶ Coût computationnel plus élevé
57 / 90
Question Interactive 4
Discussion
Un système de détection d’anomalies doit être calibré. Vous avez :
1. Une connaissance experte suggérant un taux d’anomalies autour de 2%
2. Très peu de données d’entraînement disponibles (50 observations)
58 / 90
Question Interactive 4
Discussion
Un système de détection d’anomalies doit être calibré. Vous avez :
1. Une connaissance experte suggérant un taux d’anomalies autour de 2%
2. Très peu de données d’entraînement disponibles (50 observations)
Éléments de réponse
Approche bayésienne recommandée car :
▶ Permet d’utiliser la connaissance experte (priori)
▶ Plus robuste avec peu de données
▶ Quantifie mieux l’incertitude dans ce contexte
58 / 90
Tableau Récapitulatif des Méthodes
MLE Maximiser vraisemblance Optimal asymptotiquement, ef- Nécessite la distribution, peut être
ficace complexe
Moments Égaler moments théoriques et Simple à calculer Peut être inefficace, parfois biaisé
empiriques
Bayésienne Actualiser distribution a priori Intègre connaissances préalables Choix du priori, calculs complexes
59 / 90
Application en Intelligence Artificielle
Exemples d’utilisation
1. Évaluation de modèles :
▶ Estimer la précision moyenne d’un modèle
▶ Comparer les performances de plusieurs algorithmes
2. Hyperparamètres :
▶ Estimation bayésienne pour l’optimisation d’hyperparamètres
▶ Construction d’IC pour quantifier l’incertitude
3. Apprentissage actif :
▶ Utiliser l’estimation pour décider quelles données étiqueter
60 / 90
Application en Cybersécurité
Cas d’usage
1. Détection d’anomalies :
▶ Estimer les paramètres du comportement normal
▶ Établir des seuils de détection via IC
2. Analyse de risques :
▶ Estimer la probabilité d’attaque
▶ Quantifier l’incertitude sur les métriques de sécurité
3. Systèmes adaptatifs :
▶ Mise à jour bayésienne des modèles de menaces
▶ Estimation séquentielle des paramètres de sécurité
61 / 90
Cas Pratique Intégré : Système IDS
Contexte complet
Un système de détection d’intrusion (IDS) analyse le trafic réseau. On souhaite :
1. Estimer le taux moyen d’alertes par heure
2. Construire un IC pour ce taux
3. Comparer avec un nouveau système IDS
4. Mettre à jour l’estimation avec de nouvelles données (approche bayésienne)
62 / 90
Cas Pratique - Étape 1 : Estimation Ponctuelle
Données : n = 24 observations
Calculs : ∑
xi 148
x̄ = = = 6.17 alertes/heure
24 24
63 / 90
Cas Pratique - Étape 1 : Estimation Ponctuelle
Données : n = 24 observations
Calculs : ∑
xi 148
x̄ = = = 6.17 alertes/heure
24 24
1 ∑
s2 = (xi − 6.17)2 = 1.28
23
s = 1.13 alertes/heure
63 / 90
Cas Pratique - Étape 1 : Estimation Ponctuelle
Données : n = 24 observations
Calculs : ∑
xi 148
x̄ = = = 6.17 alertes/heure
24 24
1 ∑
s2 = (xi − 6.17)2 = 1.28
23
s = 1.13 alertes/heure
Remarque : Pour la loi de Poisson, l’estimateur MLE coïncide avec la moyenne échantillonnale.
63 / 90
Cas Pratique - Étape 2 : Intervalle de Confiance
64 / 90
Cas Pratique - Étape 2 : Intervalle de Confiance
64 / 90
Cas Pratique - Étape 2 : Intervalle de Confiance
1.13
ME = 2.069 × √ = 2.069 × 0.231 = 0.478
24
64 / 90
Cas Pratique - Étape 2 : Intervalle de Confiance
1.13
ME = 2.069 × √ = 2.069 × 0.231 = 0.478
24
64 / 90
Cas Pratique - Étape 3 : Comparaison de Systèmes
65 / 90
Cas Pratique - Étape 3 : Comparaison de Systèmes
65 / 90
Cas Pratique - Étape 3 : Comparaison de Systèmes
65 / 90
Cas Pratique - Étape 3 : Comparaison de Systèmes
Remarque : L’ancien système génère en moyenne 1.82 alertes de plus par heure.
65 / 90
Cas Pratique - Étape 4 : Approche Bayésienne
Contexte : L’expert sécurité pense que le taux devrait être autour de 5 alertes/heure.
66 / 90
Cas Pratique - Étape 4 : Approche Bayésienne
Contexte : L’expert sécurité pense que le taux devrait être autour de 5 alertes/heure.
Priori : Gamma(25, 5) (moyenne = 5, variance = 1)
66 / 90
Cas Pratique - Étape 4 : Approche Bayésienne
Contexte : L’expert sécurité pense que le taux devrait être autour de 5 alertes/heure.
Priori : Gamma(25, 5) (moyenne = 5, variance = 1)
Données : 24 observations, somme = 148
66 / 90
Cas Pratique - Étape 4 : Approche Bayésienne
Contexte : L’expert sécurité pense que le taux devrait être autour de 5 alertes/heure.
Priori : Gamma(25, 5) (moyenne = 5, variance = 1)
Données : 24 observations, somme = 148
Vraisemblance : Poisson ∑
f(x|λ) ∝ λ xi e−nλ
66 / 90
Cas Pratique - Étape 4 : Approche Bayésienne
Contexte : L’expert sécurité pense que le taux devrait être autour de 5 alertes/heure.
Priori : Gamma(25, 5) (moyenne = 5, variance = 1)
Données : 24 observations, somme = 148
Vraisemblance : Poisson ∑
f(x|λ) ∝ λ xi e−nλ
∑
Posteriori : Gamma(α + xi , β + n) = Gamma(25 + 148, 5 + 24) = Gamma(173, 29)
66 / 90
Cas Pratique - Étape 4 : Approche Bayésienne
Contexte : L’expert sécurité pense que le taux devrait être autour de 5 alertes/heure.
Priori : Gamma(25, 5) (moyenne = 5, variance = 1)
Données : 24 observations, somme = 148
Vraisemblance : Poisson ∑
f(x|λ) ∝ λ xi e−nλ
∑
Posteriori : Gamma(α + xi , β + n) = Gamma(25 + 148, 5 + 24) = Gamma(173, 29)
Estimation bayésienne :
173
λ̂Bayes = = 5.97 alertes/heure
29
Comparaison :
▶ MLE : 6.17 (données seules)
▶ Bayésien : 5.97 (données + expertise)
66 / 90
Exercice Guidé 1
Énoncé
Un système de reconnaissance vocale est testé sur 50 phrases. Le taux de reconnaissance
correct observé est de 94% (47 phrases correctes sur 50).
Questions :
1. Quelle est l’estimation ponctuelle du taux de réussite ?
2. Construire un IC à 95% pour ce taux.
3. Interpréter le résultat.
67 / 90
Exercice Guidé 1
Énoncé
Un système de reconnaissance vocale est testé sur 50 phrases. Le taux de reconnaissance
correct observé est de 94% (47 phrases correctes sur 50).
Questions :
1. Quelle est l’estimation ponctuelle du taux de réussite ?
2. Construire un IC à 95% pour ce taux.
3. Interpréter le résultat.
Indications :
▶ Utilisez l’estimateur de proportion : p̂ = x/n
▶ Vérifiez les conditions d’application
▶ z0.025 = 1.96
67 / 90
Exercice Guidé 1 - Solution
1. Estimation ponctuelle :
47
p̂ = = 0.94 = 94%
50
68 / 90
Exercice Guidé 1 - Solution
1. Estimation ponctuelle :
47
p̂ = = 0.94 = 94%
50
2. Vérification des conditions :
np̂ = 50 × 0.94 = 47 ≥ 5
68 / 90
Exercice Guidé 1 - Solution
1. Estimation ponctuelle :
47
p̂ = = 0.94 = 94%
50
2. Vérification des conditions :
np̂ = 50 × 0.94 = 47 ≥ 5
68 / 90
Exercice Guidé 1 - Solution
1. Estimation ponctuelle :
47
p̂ = = 0.94 = 94%
50
2. Vérification des conditions :
np̂ = 50 × 0.94 = 47 ≥ 5
Énoncé
Les temps de réponse (en ms) d’une API sont mesurés :
23, 28, 25, 30, 27, 24, 29, 26, 28, 25, 27, 26
Questions :
1. Estimer le temps de réponse moyen et son écart-type
2. Construire un IC à 95%
3. Estimer par la méthode des moments si les données suivent une loi normale
69 / 90
Exercice Guidé 2
Énoncé
Les temps de réponse (en ms) d’une API sont mesurés :
23, 28, 25, 30, 27, 24, 29, 26, 28, 25, 27, 26
Questions :
1. Estimer le temps de réponse moyen et son écart-type
2. Construire un IC à 95%
3. Estimer par la méthode des moments si les données suivent une loi normale
À faire en groupe (5 minutes)
69 / 90
Exercice Guidé 2 - Solution (1/2)
1. Estimations :
23 + 28 + 25 + . . . + 26 318
x̄ = = = 26.5 ms
12 12
70 / 90
Exercice Guidé 2 - Solution (1/2)
1. Estimations :
23 + 28 + 25 + . . . + 26 318
x̄ = = = 26.5 ms
12 12
1 ∑ 1 44
s2 = (xi − 26.5)2 = (12.25 + 2.25 + . . . + 0.25) = =4
11 11 11
s = 2 ms
70 / 90
Exercice Guidé 2 - Solution (1/2)
1. Estimations :
23 + 28 + 25 + . . . + 26 318
x̄ = = = 26.5 ms
12 12
1 ∑ 1 44
s2 = (xi − 26.5)2 = (12.25 + 2.25 + . . . + 0.25) = =4
11 11 11
s = 2 ms
2. IC à 95% :
▶ n = 12, df = 11
▶ t0.025,11 = 2.201
▶ SE = √2 = 0.577
12
▶ ME = 2.201 × 0.577 = 1.270
70 / 90
Exercice Guidé 2 - Solution (1/2)
1. Estimations :
23 + 28 + 25 + . . . + 26 318
x̄ = = = 26.5 ms
12 12
1 ∑ 1 44
s2 = (xi − 26.5)2 = (12.25 + 2.25 + . . . + 0.25) = =4
11 11 11
s = 2 ms
2. IC à 95% :
▶ n = 12, df = 11
▶ t0.025,11 = 2.201
▶ SE = √2 = 0.577
12
▶ ME = 2.201 × 0.577 = 1.270
70 / 90
Exercice Guidé 2 - Solution (2/2)
3. Estimation par méthode des moments :
Pour une loi normale N (µ, σ 2 ) :
▶ Moment d’ordre 1 : µ1 = µ
▶ Moment d’ordre 2 : µ2 = σ 2 + µ2
71 / 90
Exercice Guidé 2 - Solution (2/2)
3. Estimation par méthode des moments :
Pour une loi normale N (µ, σ 2 ) :
▶ Moment d’ordre 1 : µ1 = µ
▶ Moment d’ordre 2 : µ2 = σ 2 + µ2
Moments empiriques :
▶ m1 = x̄ = 26.5
∑ 2
▶ m2 = 12
1
xi = 8470
12 = 705.83
71 / 90
Exercice Guidé 2 - Solution (2/2)
3. Estimation par méthode des moments :
Pour une loi normale N (µ, σ 2 ) :
▶ Moment d’ordre 1 : µ1 = µ
▶ Moment d’ordre 2 : µ2 = σ 2 + µ2
Moments empiriques :
▶ m1 = x̄ = 26.5
∑ 2
▶ m2 = 12
1
xi = 8470
12 = 705.83
Résolution :
µ̂MM = 26.5
2
σ̂MM = 705.83 − (26.5)2 = 705.83 − 702.25 = 3.58
σ̂MM = 1.89 ms
71 / 90
Erreurs Courantes à Éviter
1. Interprétation de l’IC
� ”Il y a 95% de chances que µ soit dans l’intervalle”
� ”Nous avons 95% de confiance que l’intervalle contient µ”
2. Confusion entre σ et s
� Utiliser l’écart-type de la population au lieu de l’échantillon
� Distinguer clairement paramètres et estimations
4. Oubli du n − 1
� Diviser par n pour la variance échantillonnale
� Diviser par n − 1 pour avoir un estimateur sans biais
72 / 90
Bonnes Pratiques
Recommandations
1. Toujours visualiser les données avant d’estimer (histogramme, boxplot)
2. Vérifier les hypothèses (normalité, indépendance, etc.)
3. Rapporter l’incertitude (IC, pas seulement estimation ponctuelle)
4. Choisir la méthode appropriée selon le contexte
5. Interpréter les résultats dans le contexte du problème
6. Documenter les choix (niveau de confiance, méthode, hypothèses)
73 / 90
Outils Logiciels
R:
▶ Fonctions natives : mean(), var(), [Link]()
▶ Package MASS : MLE
▶ Package rstan ou JAGS : Bayésien
74 / 90
Exemple de Code Python
Estimation et IC en Python
import numpy as np
from scipy import stats
# Données
data = [12, 15, 13, 18, 14, 16, 15, 17, 13, 14]
# Estimation ponctuelle
mean_est = [Link](data)
std_est = [Link](data, ddof=1) # ddof=1 pour n-1
# IC à 95%
n = len(data)
se = std_est / [Link](n)
t_crit = [Link](0.975, df=n-1)
ci = (mean_est - t_crit*se, mean_est + t_crit*se)
print(f"Moyenne: {mean_est:.2f}")
print(f"IC 95%: [{ci[0]:.2f}, {ci[1]:.2f}]")
75 / 90
Résumé du Chapitre 1 : Estimation Ponctuelle et IC
Points clés
▶ Estimation ponctuelle : Unique valeur pour estimer un paramètre
▶ Qualités : Sans biais, convergent, efficace
▶ IC : Quantifie l’incertitude de l’estimation
▶ Interprétation IC : 95% de confiance, pas 95% de probabilité
▶ Formules IC : Dépendent de la taille d’échantillon et de σ connu/inconnu
▶ Loi de Student : Utilisée quand σ inconnu et n petit
Formule à retenir :
S
IC1−α = X̄ ± tα/2,n−1 × √
n
76 / 90
Résumé du Chapitre 2 : Méthodes d’Estimation
Points clés
▶ MLE : Maximiser la vraisemblance, optimal asymptotiquement
▶ Méthode des moments : Égaler moments théoriques et empiriques, simple
▶ Estimation bayésienne : Combiner priori et données
▶ Choix de méthode : Dépend du contexte et des hypothèses
77 / 90
Liens avec les Autres Concepts
78 / 90
Questions Fréquentes
Q1 : Quelle taille d’échantillon est suffisante ?
Dépend du contexte, mais règles générales :
▶ n ≥ 30 pour appliquer le TCL
▶ n ≥ 100 pour les proportions
▶ Plus grand si grande variabilité
Q2 : Quand utiliser z vs t ?
▶ z : σ connu ET (n > 30 OU population normale)
▶ t : σ inconnu (cas le plus fréquent)
79 / 90
Projet Pratique Suggéré
Mini-projet : Analyse d’un Dataset de Sécurité
Objectif : Appliquer toutes les méthodes d’estimation apprises
Étapes :
1. Collecter des données de logs système (temps de réponse, nombre d’événements, etc.)
2. Effectuer une analyse exploratoire
3. Estimer les paramètres par différentes méthodes (MLE, Moments)
4. Construire des IC pour les paramètres
5. Comparer avec une approche bayésienne
6. Rédiger un rapport avec interprétations
Livrables :
▶ Code Python/R commenté
▶ Rapport d’analyse (3-5 pages)
▶ Présentation des résultats (10 min)
80 / 90
Ressources Complémentaires
Livres recommandés
▶ Statistical Inference - Casella & Berger (référence)
▶ Probability and Statistics - DeGroot & Schervish
▶ Bayesian Data Analysis - Gelman et al.
Ressources en ligne
▶ Khan Academy : Statistiques et probabilités
▶ Coursera : Statistical Inference
▶ StatQuest (YouTube) : Explications visuelles
Pour la pratique
▶ Kaggle : Datasets et notebooks
▶ UCI Machine Learning Repository
▶ Documentation [Link]
81 / 90
Exercices pour la Maison
82 / 90
Exercices pour la Maison (suite)
Exercice 3 : MLE
Soit X1 , . . . , Xn un échantillon d’une loi exponentielle de densité : f(x|λ) = λe−λx , x>0
1. Trouver l’estimateur MLE de λ
2. Appliquer avec les données : 2.3, 1.8, 3.1, 2.5, 2.9
Exercice 4 : Bayésien
Pour une proportion p avec priori Beta(2, 3) et 20 succès sur 50 essais :
1. Déterminer la distribution a posteriori
2. Calculer l’estimation bayésienne
3. Comparer avec l’estimation MLE
83 / 90
Points à Retenir - Formules Essentielles
Estimateurs ponctuels
∑
▶ Moyenne : µ̂ = X̄ = n1 Xi
∑
▶ Variance : σ̂ = S = n−1 (Xi − X̄)2
2 2 1
▶ Proportion : p̂ = x
n
Intervalles de confiance
▶ Moyenne (σ connu) : X̄ ± zα/2 √σ
n
▶ Moyenne (σ inconnu) : X̄ ± tα/2,n−1 √S
n
√
▶ Proportion : p̂ ± zα/2 p̂(1−p̂)
n
84 / 90
Points à Retenir - Méthodes
Maximum de Vraisemblance
∏
1. L(θ) = f(xi |θ)
∑
2. ℓ(θ) = ln f(xi |θ)
dℓ(θ)
3. dθ =0
Méthode ∑
des Moments
1
E[Xk ] = n Xki pour k = 1, 2, . . .
Bayésien
π(θ|x) ∝ L(θ|x) × π(θ)
85 / 90
Préparation pour le Prochain Cours
Tests d’hypothèses
Le prochain cours portera sur :
▶ Formulation d’hypothèses (H0, H1)
▶ Tests paramétriques (test-t, test-z)
▶ P-valeur et décision statistique
▶ Tests du chi-deux
▶ Erreurs de type I et II
▶ Puissance d’un test
À préparer :
▶ Réviser les notions d’estimation
▶ Comprendre la loi normale et la loi de Student
▶ Réfléchir : Comment décider si deux moyennes sont différentes ?
86 / 90
Quiz Rapide de Révision (1/2)
Question 1
Un estimateur sans biais signifie :
a) Sa variance est nulle
b) Son espérance égale le paramètre
c) Il converge vers le paramètre
d) Il a la variance minimale
87 / 90
Quiz Rapide de Révision (1/2)
Question 1
Un estimateur sans biais signifie :
a) Sa variance est nulle
b) Son espérance égale le paramètre
c) Il converge vers le paramètre
d) Il a la variance minimale
Réponse : b) E[θ̂] = θ
Question 2
Pour un IC à 95%, si on augmente la taille d’échantillon :
a) L’intervalle devient plus large
b) L’intervalle devient plus étroit
c) L’intervalle reste identique
d) Le niveau de confiance change
87 / 90
Quiz Rapide de Révision (1/2)
Question 1
Un estimateur sans biais signifie :
a) Sa variance est nulle
b) Son espérance égale le paramètre
c) Il converge vers le paramètre
d) Il a la variance minimale
Réponse : b) E[θ̂] = θ
Question 2
Pour un IC à 95%, si on augmente la taille d’échantillon :
a) L’intervalle devient plus large
b) L’intervalle devient plus étroit
c) L’intervalle reste identique
d) Le niveau de confiance change
√
Réponse : b) Car la marge d’erreur ∝ 1/ n 87 / 90
Quiz Rapide de Révision (2/2)
Question 3
L’estimateur MLE de la moyenne d’une loi normale est :
a) La médiane
b) La moyenne échantillonnale
c) La variance échantillonnale
d) Le mode
88 / 90
Quiz Rapide de Révision (2/2)
Question 3
L’estimateur MLE de la moyenne d’une loi normale est :
a) La médiane
b) La moyenne échantillonnale
c) La variance échantillonnale
d) Le mode
Réponse : b) µ̂MLE = X̄
Question 4
Dans l’approche bayésienne, le paramètre θ est :
a) Fixe et inconnu
b) Une variable aléatoire
c) Toujours égal à sa moyenne
d) Impossible à estimer
88 / 90
Quiz Rapide de Révision (2/2)
Question 3
L’estimateur MLE de la moyenne d’une loi normale est :
a) La médiane
b) La moyenne échantillonnale
c) La variance échantillonnale
d) Le mode
Réponse : b) µ̂MLE = X̄
Question 4
Dans l’approche bayésienne, le paramètre θ est :
a) Fixe et inconnu
b) Une variable aléatoire
c) Toujours égal à sa moyenne
d) Impossible à estimer
Réponse : b) C’est la différence fondamentale avec l’approche fréquentiste 88 / 90
Conclusion du Cours
Compétences acquises
▶ Quantifier l’incertitude d’une estimation
▶ Choisir la méthode appropriée selon le contexte
▶ Interpréter correctement les résultats
▶ Éviter les erreurs courantes
89 / 90
Merci pour votre attention !
Questions et Discussion
Contact :
ENSA Béni Mellal
Département Intelligence Artificielle et Cybersécurité