0% ont trouvé ce document utile (0 vote)
5 vues163 pages

Estimation

Le document présente des méthodes d'estimation statistique, notamment l'estimation ponctuelle et par intervalle de confiance. Il aborde les concepts clés tels que les estimateurs, leurs qualités, et les limites de l'estimation ponctuelle, tout en introduisant l'intervalle de confiance comme solution pour évaluer l'incertitude. Des exemples concrets sont fournis pour illustrer l'estimation de la moyenne, de la variance et des proportions dans des contextes pratiques.

Transféré par

Rihana Laznasni
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
5 vues163 pages

Estimation

Le document présente des méthodes d'estimation statistique, notamment l'estimation ponctuelle et par intervalle de confiance. Il aborde les concepts clés tels que les estimateurs, leurs qualités, et les limites de l'estimation ponctuelle, tout en introduisant l'intervalle de confiance comme solution pour évaluer l'incertitude. Des exemples concrets sont fournis pour illustrer l'estimation de la moyenne, de la variance et des proportions dans des contextes pratiques.

Transféré par

Rihana Laznasni
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Estimation Statistique

Estimation Ponctuelle et par Intervalle de Confiance


Méthodes d’Estimation

ENSA Béni Mellal

Cycle Ingénieur - Intelligence Artificielle et Cybersécurité


Semestre 1

15 octobre 2025

1 / 90
Plan du Cours

Introduction à l’Estimation

Chapitre 1 : Estimation Ponctuelle

Estimation par Intervalle de Confiance

Chapitre 2 : Méthodes d’Estimation


Maximum de Vraisemblance
Méthode des Moments
Estimation d’une Moyenne
Estimation Bayésienne

Synthèse et Applications

2 / 90
Problématique de l’Estimation

Question fondamentale :

Comment estimer les paramètres d’une


population à partir d’un échantillon ?

Contexte pratique : Population Échantillon


θ inconnu θ̂ estimé
▶ Population : Trop grande ou inaccessible
▶ Échantillon : Données disponibles
▶ Objectif : Inférer sur la population

4 / 90
Notation et Vocabulaire

Notations importantes
▶ θ : Paramètre de la population (inconnu)
▶ θ̂ : Estimateur du paramètre
▶ X1 , X2 , . . . , Xn : Échantillon aléatoire de taille n
▶ X̄ : Moyenne échantillonnale
▶ S2 : Variance échantillonnale

Remarque : Un estimateur est une variable aléatoire, tandis qu’une estimation est une valeur
numérique.

5 / 90
Qu’est-ce qu’une Estimation Ponctuelle ?

Definition
Une estimation ponctuelle est une valeur unique calculée à partir d’un échantillon pour
estimer un paramètre de la population.

Exemples :
▶ Moyenne : µ̂ = X̄ Limitation
▶ Variance : σ̂ 2 = S2 Une estimation ponctuelle ne donne aucune
▶ Proportion : p̂ = x information sur la précision de l’estimation.
n

6 / 90
Qualités d’un Bon Estimateur

1. Sans biais (Unbiased)


Un estimateur θ̂ est sans biais si :
E[θ̂] = θ

2. Convergent (Consistent)

lim P(|θ̂ − θ| < ϵ) = 1 ∀ϵ > 0


n→∞

3. Efficace (Efficient)
Variance minimale parmi tous les estimateurs sans biais.

7 / 90
Question Interactive 1

Réflexion
Supposons que vous ayez deux estimateurs de la moyenne :
∑n
▶ Estimateur A : µ̂A = n1 i=1 Xi (moyenne arithmétique)
▶ Estimateur B : µ̂B = X1 +Xn
2 (moyenne du premier et dernier)

Question : Lequel préféreriez-vous ? Pourquoi ?

8 / 90
Question Interactive 1

Réflexion
Supposons que vous ayez deux estimateurs de la moyenne :
∑n
▶ Estimateur A : µ̂A = n1 i=1 Xi (moyenne arithmétique)
▶ Estimateur B : µ̂B = X1 +Xn
2 (moyenne du premier et dernier)

Question : Lequel préféreriez-vous ? Pourquoi ?

Discussion
▶ Les deux sont sans biais
▶ Mais A utilise toute l’information disponible
▶ A est plus efficace (variance plus faible)

8 / 90
Exemple : Estimation de la Moyenne

Contexte IA/Cybersécurité
Un système de détection d’intrusion enregistre le temps de réponse (en ms) pour 10 requêtes :

12, 15, 13, 18, 14, 16, 15, 17, 13, 14

Calcul de l’estimation ponctuelle de la moyenne :

1∑
n
12 + 15 + 13 + 18 + 14 + 16 + 15 + 17 + 13 + 14
µ̂ = X̄ = xi =
n 10
i=1

9 / 90
Exemple : Estimation de la Moyenne

Contexte IA/Cybersécurité
Un système de détection d’intrusion enregistre le temps de réponse (en ms) pour 10 requêtes :

12, 15, 13, 18, 14, 16, 15, 17, 13, 14

Calcul de l’estimation ponctuelle de la moyenne :

1∑
n
12 + 15 + 13 + 18 + 14 + 16 + 15 + 17 + 13 + 14
µ̂ = X̄ = xi =
n 10
i=1

147
µ̂ = = 14.7 ms
10

Remarque : Cette valeur est notre meilleure estimation du temps de réponse moyen du
système.

9 / 90
Exemple : Estimation de la Variance
Avec les mêmes données : 12, 15, 13, 18, 14, 16, 15, 17, 13, 14

Variance échantillonnale (sans biais) :

1 ∑
n
σ̂ 2 = S2 = (xi − x̄)2
n−1
i=1

10 / 90
Exemple : Estimation de la Variance
Avec les mêmes données : 12, 15, 13, 18, 14, 16, 15, 17, 13, 14

Variance échantillonnale (sans biais) :

1 ∑
n
σ̂ 2 = S2 = (xi − x̄)2
n−1
i=1

1[ ]
S2 = (12 − 14.7)2 + (15 − 14.7)2 + · · · + (14 − 14.7)2
9
1
= [7.29 + 0.09 + 2.89 + 10.89 + 0.49 + 1.69 + 0.09 + 5.29 + 2.89 + 0.49]
9
32.1
= = 3.57
9

10 / 90
Exemple : Estimation de la Variance
Avec les mêmes données : 12, 15, 13, 18, 14, 16, 15, 17, 13, 14

Variance échantillonnale (sans biais) :

1 ∑
n
σ̂ 2 = S2 = (xi − x̄)2
n−1
i=1

1[ ]
S2 = (12 − 14.7)2 + (15 − 14.7)2 + · · · + (14 − 14.7)2
9
1
= [7.29 + 0.09 + 2.89 + 10.89 + 0.49 + 1.69 + 0.09 + 5.29 + 2.89 + 0.49]
9
32.1
= = 3.57
9

σ̂ = 3.57 ≈ 1.89 ms

10 / 90
Pourquoi n − 1 dans la Variance ?

Biais de la variance
▶ Si on divise par n : estimateur biaisé (sous-estime la variance)
▶ Si on divise par n − 1 : estimateur sans biais
▶ On perd un degré de liberté en estimant la moyenne

Variance biaisée : Variance sans biais :


1 ∑
n
1 ∑
n
2
σ̂biaise = (Xi − X̄)2 S2 = (Xi − X̄)2
n n−1
i=1
i=1

n−1 2
2
E[σ̂biaise ]= σ E[S2 ] = σ 2
n

11 / 90
Exemple : Estimation d’une Proportion

Contexte Cybersécurité
Sur 200 tentatives de connexion analysées, 45 ont été identifiées comme suspectes.
Estimer la proportion de connexions suspectes.

Estimateur de la proportion :
x nombre de succès
p̂ = =
n taille de l’échantillon

12 / 90
Exemple : Estimation d’une Proportion

Contexte Cybersécurité
Sur 200 tentatives de connexion analysées, 45 ont été identifiées comme suspectes.
Estimer la proportion de connexions suspectes.

Estimateur de la proportion :
x nombre de succès
p̂ = =
n taille de l’échantillon

45
p̂ = = 0.225 = 22.5%
200

Interprétation : On estime que 22.5% des connexions sont suspectes.

Remarque : Cet estimateur est sans biais : E[p̂] = p

12 / 90
Limites de l’Estimation Ponctuelle

Problème
Une estimation ponctuelle ne donne pas d’information sur :
▶ La précision de l’estimation
▶ L’incertitude liée à l’échantillonnage
▶ La fiabilité du résultat

Solution : Intervalle de Confiance


Au lieu d’estimer θ par une seule valeur θ̂, on construit un intervalle [L, U] tel que :

P(L ≤ θ ≤ U) = 1 − α

où 1 − α est le niveau de confiance (souvent 95%).

13 / 90
Concept d’Intervalle de Confiance

Definition
Un intervalle de confiance à (1 − α) × 100% pour un paramètre θ est un intervalle aléatoire
[L, U] tel que :
P(θ ∈ [L, U]) = 1 − α

IC à 95%

θ
L θ̂ U

14 / 90
Interprétation de l’Intervalle de Confiance

Interprétation correcte
Si on répète l’expérience (échantillonnage) un grand nombre de fois :
▶ Environ 95% des intervalles construits contiendront la vraie valeur de θ
▶ 5% des intervalles ne contiendront pas θ

Attention !
INCORRECT : ”La probabilité que θ soit dans l’intervalle est 95%”
CORRECT : ”Nous avons 95% de confiance que l’intervalle contient θ”

Remarque : Le paramètre θ est fixe (mais inconnu). C’est l’intervalle qui est aléatoire !

15 / 90
Niveau de Confiance et Valeur Critique

Niveaux de confiance usuels :


▶ 90% (α = 0.10)
▶ 95% (α = 0.05)
▶ 99% (α = 0.01)

95%
Valeurs critiques (loi normale) :
▶ 90% : z0.05 = 1.645 −1.96 1.96
▶ 95% : z0.025 = 1.96
▶ 99% : z0.005 = 2.576

16 / 90
IC pour une Moyenne (Variance Connue)

Cas : σ connu, n grand ou population normale


[ ]
σ σ
IC1−α = X̄ − zα/2 √ , X̄ + zα/2 √
n n
où zα/2 est le quantile de la loi normale standard.

Composantes :
▶ X̄ : estimation ponctuelle (centre)
▶ zα/2 √σ : marge d’erreur
n
▶ σ
√ : erreur standard
n

17 / 90
Exemple : IC pour une Moyenne (Variance Connue)

Contexte
Un système de reconnaissance faciale a un temps de traitement moyen à estimer. On sait par
expérience que σ = 2 ms. Sur 100 images, on obtient x̄ = 15 ms.
Construire un IC à 95%.

18 / 90
Exemple : IC pour une Moyenne (Variance Connue)

Contexte
Un système de reconnaissance faciale a un temps de traitement moyen à estimer. On sait par
expérience que σ = 2 ms. Sur 100 images, on obtient x̄ = 15 ms.
Construire un IC à 95%.
Solution :
▶ n = 100, x̄ = 15, σ = 2, α = 0.05
▶ z0.025 = 1.96
▶ Marge d’erreur : ME = 1.96 × √2 = 1.96 × 0.2 = 0.392
100

18 / 90
Exemple : IC pour une Moyenne (Variance Connue)

Contexte
Un système de reconnaissance faciale a un temps de traitement moyen à estimer. On sait par
expérience que σ = 2 ms. Sur 100 images, on obtient x̄ = 15 ms.
Construire un IC à 95%.
Solution :
▶ n = 100, x̄ = 15, σ = 2, α = 0.05
▶ z0.025 = 1.96
▶ Marge d’erreur : ME = 1.96 × √2 = 1.96 × 0.2 = 0.392
100

IC95% = [15 − 0.392, 15 + 0.392] = [14.608, 15.392] ms


Interprétation : Nous avons 95% de confiance que le temps moyen de traitement est entre
14.6 et 15.4 ms.

18 / 90
IC pour une Moyenne (Variance Inconnue)

Cas : σ inconnu, petits échantillons


On utilise la distribution de Student avec n − 1 degrés de liberté :
[ ]
S S
IC1−α = X̄ − tα/2,n−1 √ , X̄ + tα/2,n−1 √
n n

où :
▶ tα/2,n−1 : quantile de la loi de Student
▶ S : écart-type échantillonnal

Remarque : Quand n est grand (n > 30), la loi de Student converge vers la loi normale.

19 / 90
Loi de Student vs Loi Normale

Student (df=5)
Normale

Caractéristiques de la loi de Student :


▶ Plus aplatie que la normale (queues plus épaisses)
▶ Dépend du nombre de degrés de liberté (df = n − 1)
▶ Converge vers la normale quand df augmente

20 / 90
Exemple : IC avec Loi de Student

Données
Temps de réponse (ms) : 12, 15, 13, 18, 14, 16, 15, 17, 13, 14
On a calculé : x̄ = 14.7, s = 1.89, n = 10
Construction d’un IC à 95% :

21 / 90
Exemple : IC avec Loi de Student

Données
Temps de réponse (ms) : 12, 15, 13, 18, 14, 16, 15, 17, 13, 14
On a calculé : x̄ = 14.7, s = 1.89, n = 10
Construction d’un IC à 95% :
▶ Degrés de liberté : df = n − 1 = 9
▶ Valeur critique : t0.025,9 = 2.262 (table de Student)
▶ Erreur standard : SE = √s = √ 1.89
= 0.598
n 10
▶ Marge d’erreur : ME = 2.262 × 0.598 = 1.353

21 / 90
Exemple : IC avec Loi de Student

Données
Temps de réponse (ms) : 12, 15, 13, 18, 14, 16, 15, 17, 13, 14
On a calculé : x̄ = 14.7, s = 1.89, n = 10
Construction d’un IC à 95% :
▶ Degrés de liberté : df = n − 1 = 9
▶ Valeur critique : t0.025,9 = 2.262 (table de Student)
▶ Erreur standard : SE = √s = √ 1.89
= 0.598
n 10
▶ Marge d’erreur : ME = 2.262 × 0.598 = 1.353

IC95% = [14.7 − 1.353, 14.7 + 1.353] = [13.347, 16.053] ms


Interprétation : Avec 95% de confiance, le temps de réponse moyen est entre 13.3 et 16.1 ms.

21 / 90
IC pour une Proportion

Intervalle de confiance pour p


Sous certaines conditions (np ≥ 5 et n(1 − p) ≥ 5) :
[ √ √ ]
p̂(1 − p̂) p̂(1 − p̂)
IC1−α = p̂ − zα/2 , p̂ + zα/2
n n

Composantes :
▶ p̂ = nx : proportion échantillonnale

▶ p̂(1−p̂)
n : erreur standard de la proportion

22 / 90
Exemple : IC pour une Proportion

Rappel
Sur 200 connexions, 45 ont été identifiées comme suspectes.
p̂ = 0.225
Construction d’un IC à 95% :

23 / 90
Exemple : IC pour une Proportion

Rappel
Sur 200 connexions, 45 ont été identifiées comme suspectes.
p̂ = 0.225
Construction d’un IC à 95% :
▶ Vérification : np̂ = 45 ≥ 5 et n(1 − p̂) = 155 ≥ 5 �
▶ z0.025 = 1.96
√ √
▶ Erreur standard : SE = 0.225×0.775
200 = 0.000872 = 0.0295
▶ Marge d’erreur : ME = 1.96 × 0.0295 = 0.058

23 / 90
Exemple : IC pour une Proportion

Rappel
Sur 200 connexions, 45 ont été identifiées comme suspectes.
p̂ = 0.225
Construction d’un IC à 95% :
▶ Vérification : np̂ = 45 ≥ 5 et n(1 − p̂) = 155 ≥ 5 �
▶ z0.025 = 1.96
√ √
▶ Erreur standard : SE = 0.225×0.775
200 = 0.000872 = 0.0295
▶ Marge d’erreur : ME = 1.96 × 0.0295 = 0.058

IC95% = [0.225 − 0.058, 0.225 + 0.058] = [0.167, 0.283]


= [16.7%, 28.3%]
Interprétation : Avec 95% de confiance, entre 16.7% et 28.3% des connexions sont suspectes.

23 / 90
Question Interactive 2

Réflexion
Comment varie la largeur d’un intervalle de confiance si :
1. On augmente le niveau de confiance de 95% à 99% ?
2. On double la taille de l’échantillon ?
3. La variance de la population augmente ?

24 / 90
Question Interactive 2

Réflexion
Comment varie la largeur d’un intervalle de confiance si :
1. On augmente le niveau de confiance de 95% à 99% ?
2. On double la taille de l’échantillon ?
3. La variance de la population augmente ?

Réponses
1. L’intervalle devient plus large (plus de confiance = plus d’incertitude)

2. L’intervalle devient plus étroit (∝ 1/ n)
3. L’intervalle devient plus large (plus de variabilité)

24 / 90
Taille d’Échantillon Nécessaire

Question pratique
Quelle taille d’échantillon faut-il pour obtenir une marge d’erreur souhaitée ?
Pour estimer une moyenne :
(z )2
α/2 σ
n=
ME
Pour estimer une proportion :
(z )2
α/2
n = p̂(1 − p̂)
ME
Si p̂ inconnu, utiliser p̂ = 0.5 (cas le plus défavorable).

25 / 90
Exemple : Détermination de la Taille d’Échantillon

Problème
Un ingénieur cybersécurité veut estimer la proportion de paquets malveillants avec une marge
d’erreur de 3% et un niveau de confiance de 95%.
Combien de paquets doit-il analyser ?

26 / 90
Exemple : Détermination de la Taille d’Échantillon

Problème
Un ingénieur cybersécurité veut estimer la proportion de paquets malveillants avec une marge
d’erreur de 3% et un niveau de confiance de 95%.
Combien de paquets doit-il analyser ?
Solution :
▶ ME = 0.03, α = 0.05, z0.025 = 1.96
▶ Pas d’estimation préalable : p̂ = 0.5

26 / 90
Exemple : Détermination de la Taille d’Échantillon

Problème
Un ingénieur cybersécurité veut estimer la proportion de paquets malveillants avec une marge
d’erreur de 3% et un niveau de confiance de 95%.
Combien de paquets doit-il analyser ?
Solution :
▶ ME = 0.03, α = 0.05, z0.025 = 1.96
▶ Pas d’estimation préalable : p̂ = 0.5
( )2
1.96
n = 0.5 × 0.5 × = 0.25 × (65.33)2 = 0.25 × 4268 = 1067
0.03
Réponse : Il faut analyser au moins 1067 paquets.

26 / 90
Introduction aux Méthodes d’Estimation

Objectif
Comment construire de ”bons” estimateurs pour les paramètres d’une distribution ?

Principales méthodes :
1. Méthode du Maximum de Vraisemblance (MLE)
2. Méthode des Moments (MM)
3. Estimation Bayésienne

Remarque : Chaque méthode a ses avantages et ses domaines d’application privilégiés.

27 / 90
Principe du Maximum de Vraisemblance

Definition
La méthode du maximum de vraisemblance (MLE) consiste à choisir comme estimateur la
valeur du paramètre qui maximise la probabilité d’observer l’échantillon obtenu.

Intuition :
▶ On observe des données x1 , x2 , . . . , xn
▶ On cherche θ̂ qui rend ces observations les plus ”vraisemblables”
▶ On maximise L(θ|x1 , . . . , xn )

28 / 90
Fonction de Vraisemblance

Définition
Pour un échantillon i.i.d. X1 , . . . , Xn de densité/masse f(x|θ) :


n
L(θ) = L(θ|x1 , . . . , xn ) = f(xi |θ)
i=1

Log-vraisemblance : (plus pratique pour les calculs)


n
ℓ(θ) = ln L(θ) = ln f(xi |θ)
i=1

Remarque : Maximiser L(θ) équivaut à maximiser ℓ(θ).

29 / 90
Procédure MLE

Étapes
∏n
1. Écrire la fonction de vraisemblance : L(θ) = i=1 f(xi |θ)
2. Calculer la log-vraisemblance : ℓ(θ) = ln L(θ)
dℓ(θ)
3. Dériver par rapport à θ : dθ
dℓ(θ)
4. Résoudre : dθ =0
d2 ℓ(θ)
5. Vérifier que c’est un maximum : dθ 2 <0

Notation : L’estimateur MLE est noté θ̂MLE ou θ̂ML

30 / 90
Exemple : MLE pour la Moyenne d’une Loi Normale
Contexte : X1 , . . . , Xn ∼ N (µ, σ 2 ) avec σ 2 connu.
Trouver µ̂MLE .

31 / 90
Exemple : MLE pour la Moyenne d’une Loi Normale
Contexte : X1 , . . . , Xn ∼ N (µ, σ 2 ) avec σ 2 connu.
Trouver µ̂MLE .
Étape 1 : Vraisemblance


n ( )
1 (xi − µ)2
L(µ) = √ exp −
2πσ 2 2σ 2
i=1

31 / 90
Exemple : MLE pour la Moyenne d’une Loi Normale
Contexte : X1 , . . . , Xn ∼ N (µ, σ 2 ) avec σ 2 connu.
Trouver µ̂MLE .
Étape 1 : Vraisemblance


n ( )
1 (xi − µ)2
L(µ) = √ exp −
2πσ 2 2σ 2
i=1

Étape 2 : Log-vraisemblance

1 ∑
n
n
ℓ(µ) = − ln(2πσ 2 ) − 2 (xi − µ)2
2 2σ
i=1

31 / 90
Exemple : MLE pour la Moyenne d’une Loi Normale
Contexte : X1 , . . . , Xn ∼ N (µ, σ 2 ) avec σ 2 connu.
Trouver µ̂MLE .
Étape 1 : Vraisemblance


n ( )
1 (xi − µ)2
L(µ) = √ exp −
2πσ 2 2σ 2
i=1

Étape 2 : Log-vraisemblance

1 ∑
n
n
ℓ(µ) = − ln(2πσ 2 ) − 2 (xi − µ)2
2 2σ
i=1

Étape 3 : Dérivée
1 ∑
n
dℓ(µ)
= 2 (xi − µ)
dµ σ
i=1

31 / 90
Exemple : MLE pour la Moyenne d’une Loi Normale (suite)
Étape 4 : Résolution
dℓ(µ) ∑ n
=0⇒ (xi − µ) = 0

i=1


n
⇒ xi − nµ = 0
i=1

1∑
n
⇒ µ̂MLE = xi = X̄
n
i=1

32 / 90
Exemple : MLE pour la Moyenne d’une Loi Normale (suite)
Étape 4 : Résolution
dℓ(µ) ∑ n
=0⇒ (xi − µ) = 0

i=1


n
⇒ xi − nµ = 0
i=1

1∑
n
⇒ µ̂MLE = xi = X̄
n
i=1

Étape 5 : Vérification
d2 ℓ(µ) n
2
=− 2 <0
dµ σ

Conclusion : L’estimateur MLE de la moyenne est la moyenne échantillonnale !

32 / 90
Exemple : MLE pour la Loi de Poisson

Contexte : Nombre d’attaques détectées par heure suit une loi de Poisson.
Données : x1 , x2 , . . . , xn (nombre d’attaques observées)
Paramètre : λ (taux moyen d’attaques)

33 / 90
Exemple : MLE pour la Loi de Poisson

Contexte : Nombre d’attaques détectées par heure suit une loi de Poisson.
Données : x1 , x2 , . . . , xn (nombre d’attaques observées)
Paramètre : λ (taux moyen d’attaques)
x −λ
e
Fonction de masse : P(X = x) = λ x!

33 / 90
Exemple : MLE pour la Loi de Poisson

Contexte : Nombre d’attaques détectées par heure suit une loi de Poisson.
Données : x1 , x2 , . . . , xn (nombre d’attaques observées)
Paramètre : λ (taux moyen d’attaques)
x −λ
e
Fonction de masse : P(X = x) = λ x!
Vraisemblance :

n
λxi e−λ
L(λ) =
xi !
i=1

33 / 90
Exemple : MLE pour la Loi de Poisson

Contexte : Nombre d’attaques détectées par heure suit une loi de Poisson.
Données : x1 , x2 , . . . , xn (nombre d’attaques observées)
Paramètre : λ (taux moyen d’attaques)
x −λ
e
Fonction de masse : P(X = x) = λ x!
Vraisemblance :

n
λxi e−λ
L(λ) =
xi !
i=1

Log-vraisemblance :

n ∑
n
ℓ(λ) = xi ln(λ) − nλ − ln(xi !)
i=1 i=1

33 / 90
Exemple : MLE pour la Loi de Poisson (suite)
Dérivée :
1∑
n
dℓ(λ)
= xi − n
dλ λ
i=1

34 / 90
Exemple : MLE pour la Loi de Poisson (suite)
Dérivée :
1∑
n
dℓ(λ)
= xi − n
dλ λ
i=1

Résolution :
1∑
n
dℓ(λ)
=0⇒ xi = n
dλ λ
i=1

1 ∑
n
⇒ λ̂MLE = xi = X̄
n
i=1

34 / 90
Exemple : MLE pour la Loi de Poisson (suite)
Dérivée :
1∑
n
dℓ(λ)
= xi − n
dλ λ
i=1

Résolution :
1∑
n
dℓ(λ)
=0⇒ xi = n
dλ λ
i=1

1 ∑
n
⇒ λ̂MLE = xi = X̄
n
i=1

Application numérique : Nombre d’attaques observées sur 10 heures : 3, 5, 2, 4, 6, 3, 4, 5, 3, 5


3+5+2+4+6+3+4+5+3+5 40
λ̂MLE = = =4
10 10
Interprétation : On estime à 4 attaques par heure en moyenne.

34 / 90
Propriétés des Estimateurs MLE

Avantages
▶ Asymptotiquement sans biais
▶ Asymptotiquement efficace (variance minimale)
▶ Convergent
▶ Invariant par transformation : si θ̂ est MLE de θ, alors g(θ̂) est MLE de g(θ)

Limitations
▶ Peut être biaisé pour petits échantillons
▶ Nécessite de connaître la forme de la distribution
▶ Calculs parfois complexes

35 / 90
Question Interactive 3

Réflexion
On observe les temps de défaillance (en heures) de 5 composants :

10, 15, 12, 18, 20

Si on modélise ces temps par une loi exponentielle de paramètre λ (densité : f(x) = λe−λx ),
quelle serait votre intuition pour estimer λ ?

36 / 90
Question Interactive 3

Réflexion
On observe les temps de défaillance (en heures) de 5 composants :

10, 15, 12, 18, 20

Si on modélise ces temps par une loi exponentielle de paramètre λ (densité : f(x) = λe−λx ),
quelle serait votre intuition pour estimer λ ?

Discussion
▶ La moyenne des observations est x̄ = 15 heures
▶ Pour la loi exponentielle : E[X] = λ1
▶ Intuition : λ̂ ≈ 1x̄ = 15
1
≈ 0.067
▶ C’est effectivement l’estimateur MLE ! (à vérifier par calcul)

36 / 90
Principe de la Méthode des Moments

Definition
La méthode des moments consiste à égaler les moments théoriques de la distribution aux
moments empiriques de l’échantillon.

Moments :
▶ Moment théorique d’ordre k : µk = E[Xk ]

▶ Moment empirique d’ordre k : mk = n1 ni=1 Xki

Principe : µk (θ) = mk pour k = 1, 2, . . . , p


où p est le nombre de paramètres à estimer.

37 / 90
Procédure de la Méthode des Moments

Étapes
1. Identifier le nombre p de paramètres à estimer
2. Exprimer les p premiers moments théoriques en fonction des paramètres :

µ1 (θ), µ2 (θ), . . . , µp (θ)

3. Calculer les p premiers moments empiriques :


1∑ 2
m1 = X̄, m2 = Xi , ...
n
4. Résoudre le système :
µk (θ) = mk pour k = 1, . . . , p

Notation : L’estimateur est noté θ̂MM ou θ̃

38 / 90
Exemple : Méthode des Moments pour la Loi Normale

Contexte : X ∼ N (µ, σ 2 ) avec µ et σ 2 inconnus.

39 / 90
Exemple : Méthode des Moments pour la Loi Normale

Contexte : X ∼ N (µ, σ 2 ) avec µ et σ 2 inconnus.


Moments théoriques :
▶ µ1 = E[X] = µ
▶ µ2 = E[X2 ] = σ 2 + µ2

39 / 90
Exemple : Méthode des Moments pour la Loi Normale

Contexte : X ∼ N (µ, σ 2 ) avec µ et σ 2 inconnus.


Moments théoriques :
▶ µ1 = E[X] = µ
▶ µ2 = E[X2 ] = σ 2 + µ2
Moments empiriques :
▶ m1 = X̄

▶ m2 = n1 ni=1 X2i

39 / 90
Exemple : Méthode des Moments pour la Loi Normale

Contexte : X ∼ N (µ, σ 2 ) avec µ et σ 2 inconnus.


Moments théoriques :
▶ µ1 = E[X] = µ
▶ µ2 = E[X2 ] = σ 2 + µ2
Moments empiriques :
▶ m1 = X̄

▶ m2 = n1 ni=1 X2i
Système d’équations :
µ = X̄
1∑ 2
n
σ 2 + µ2 = Xi
n
i=1

39 / 90
Exemple : Méthode des Moments pour la Loi Normale (suite)
Résolution :
De la première équation :
µ̂MM = X̄

40 / 90
Exemple : Méthode des Moments pour la Loi Normale (suite)
Résolution :
De la première équation :
µ̂MM = X̄
De la deuxième équation :
1∑ 2
n
2
σ̂MM = Xi − X̄2
n
i=1

1 ∑
n
2X̄ ∑
n
= X2i − Xi + X̄2
n n
i=1 i=1

1 ∑
n
= (Xi − X̄)2
n
i=1

40 / 90
Exemple : Méthode des Moments pour la Loi Normale (suite)
Résolution :
De la première équation :
µ̂MM = X̄
De la deuxième équation :
1∑ 2
n
2
σ̂MM = Xi − X̄2
n
i=1

1 ∑
n
2X̄ ∑
n
= X2i − Xi + X̄2
n n
i=1 i=1

1 ∑
n
= (Xi − X̄)2
n
i=1

Remarque : L’estimateur de la variance par la méthode des moments est biaisé (division par n
au lieu de n − 1).

40 / 90
Exemple : Méthode des Moments pour la Loi Uniforme

Contexte : X ∼ U (0, θ) (uniforme sur [0, θ])


Estimer θ par la méthode des moments.

41 / 90
Exemple : Méthode des Moments pour la Loi Uniforme

Contexte : X ∼ U (0, θ) (uniforme sur [0, θ])


Estimer θ par la méthode des moments.
Moment théorique d’ordre 1 :
0+θ θ
µ1 = E[X] = =
2 2

41 / 90
Exemple : Méthode des Moments pour la Loi Uniforme

Contexte : X ∼ U (0, θ) (uniforme sur [0, θ])


Estimer θ par la méthode des moments.
Moment théorique d’ordre 1 :
0+θ θ
µ1 = E[X] = =
2 2
Moment empirique d’ordre 1 :
m1 = X̄

41 / 90
Exemple : Méthode des Moments pour la Loi Uniforme

Contexte : X ∼ U (0, θ) (uniforme sur [0, θ])


Estimer θ par la méthode des moments.
Moment théorique d’ordre 1 :
0+θ θ
µ1 = E[X] = =
2 2
Moment empirique d’ordre 1 :
m1 = X̄
Équation :
θ
= X̄
2

41 / 90
Exemple : Méthode des Moments pour la Loi Uniforme

Contexte : X ∼ U (0, θ) (uniforme sur [0, θ])


Estimer θ par la méthode des moments.
Moment théorique d’ordre 1 :
0+θ θ
µ1 = E[X] = =
2 2
Moment empirique d’ordre 1 :
m1 = X̄
Équation :
θ
= X̄
2
Solution :
θ̂MM = 2X̄

41 / 90
Exemple : Application Numérique (Uniforme)

Données
On observe des temps d’exécution (en secondes) supposés uniformes sur [0, θ] :
2.3, 4.1, 3.5, 5.2, 1.8, 3.9, 4.5, 2.7, 3.2, 4.8

42 / 90
Exemple : Application Numérique (Uniforme)

Données
On observe des temps d’exécution (en secondes) supposés uniformes sur [0, θ] :
2.3, 4.1, 3.5, 5.2, 1.8, 3.9, 4.5, 2.7, 3.2, 4.8
Calcul de l’estimateur :
2.3 + 4.1 + 3.5 + 5.2 + 1.8 + 3.9 + 4.5 + 2.7 + 3.2 + 4.8
x̄ =
10
36
= = 3.6
10

42 / 90
Exemple : Application Numérique (Uniforme)

Données
On observe des temps d’exécution (en secondes) supposés uniformes sur [0, θ] :
2.3, 4.1, 3.5, 5.2, 1.8, 3.9, 4.5, 2.7, 3.2, 4.8
Calcul de l’estimateur :
2.3 + 4.1 + 3.5 + 5.2 + 1.8 + 3.9 + 4.5 + 2.7 + 3.2 + 4.8
x̄ =
10
36
= = 3.6
10

θ̂MM = 2 × 3.6 = 7.2 secondes

Interprétation : On estime que les temps d’exécution sont uniformément répartis entre 0 et
7.2 secondes.

42 / 90
Comparaison MLE vs Méthode des Moments

Critère MLE Moments


Simplicité calcul Parfois complexe Généralement simple
Efficacité Optimale (asympt.) Sous-optimale
Biais Faible (asympt.) Peut être biaisé
Distribution nécessaire Oui Non
Robustesse Moyenne Bonne

Conseil pratique :
▶ MLE : quand la distribution est bien connue
▶ Moments : pour une première approximation rapide
▶ Dans beaucoup de cas, les deux méthodes donnent des résultats similaires

43 / 90
Estimation Ponctuelle d’une Moyenne - Synthèse

Estimateur naturel
1∑
n
µ̂ = X̄ = Xi
n
i=1

Propriétés :
▶ Sans biais : E[X̄] = µ
P
▶ Convergent : X̄ −
→ µ (loi des grands nombres)
2
▶ Variance : Var(X̄) = σn
▶ C’est l’estimateur MLE et MM pour la loi normale !

Remarque : La moyenne échantillonnale est un estimateur optimal sous de nombreux aspects.

44 / 90
Distribution de la Moyenne Échantillonnale

Théorème Central Limite


Si X1 , . . . , Xn sont i.i.d. avec E[X] = µ et Var(X) = σ 2 , alors :

X̄ − µ d
√ − → N (0, 1)
σ/ n

Implications pratiques :
▶ Pour n grand (n ≥ 30), X̄ ≈ N (µ, σ 2 /n)
▶ Valable quelle que soit la distribution originale !
▶ Permet de construire des IC même sans normalité

45 / 90
Exemple : Estimation dans un Contexte IA
Problème
Un modèle de deep learning est entraîné 20 fois avec différentes initialisations aléatoires. On
obtient les précisions suivantes (en %) :

87, 89, 86, 90, 88, 87, 91, 89, 88, 90,

86, 89, 87, 88, 90, 89, 87, 88, 91, 89


Estimer la précision moyenne du modèle et construire un IC à 95%.

46 / 90
Exemple : Estimation dans un Contexte IA
Problème
Un modèle de deep learning est entraîné 20 fois avec différentes initialisations aléatoires. On
obtient les précisions suivantes (en %) :

87, 89, 86, 90, 88, 87, 91, 89, 88, 90,

86, 89, 87, 88, 90, 89, 87, 88, 91, 89


Estimer la précision moyenne du modèle et construire un IC à 95%.
Calculs :
▶ x̄ = 88.45%
▶ s = 1.54%
▶ n = 20, df = 19, t0.025,19 = 2.093

46 / 90
Exemple : Estimation dans un Contexte IA
Problème
Un modèle de deep learning est entraîné 20 fois avec différentes initialisations aléatoires. On
obtient les précisions suivantes (en %) :

87, 89, 86, 90, 88, 87, 91, 89, 88, 90,

86, 89, 87, 88, 90, 89, 87, 88, 91, 89


Estimer la précision moyenne du modèle et construire un IC à 95%.
Calculs :
▶ x̄ = 88.45%
▶ s = 1.54%
▶ n = 20, df = 19, t0.025,19 = 2.093
[ ]
1.54 1.54
IC95% = 88.45 − 2.093 × √ , 88.45 + 2.093 × √
20 20
= [87.73%, 89.17%]
46 / 90
Estimation de la Différence de Deux Moyennes

Contexte
Comparer deux populations (ex : performances de deux algorithmes)
▶ Population 1 : X1 , . . . , Xn1 avec moyenne µ1
▶ Population 2 : Y1 , . . . , Yn2 avec moyenne µ2

Estimateur de µ1 − µ2 :
µ̂1 − µ̂2 = X̄ − Ȳ
IC pour µ1 − µ2 (variances égales) :
[ √ ]
1 1
(X̄ − Ȳ) ± tα/2,n1 +n2 −2 × Sp +
n1 n2

(n1 −1)S21 +(n2 −1)S22


où S2p = n1 +n2 −2 (variance poolée)

47 / 90
Exemple : Comparaison de Deux Algorithmes
Contexte
Deux algorithmes de chiffrement sont comparés sur leur temps d’exécution (ms) :
▶ Algo A : n1 = 15, x̄1 = 12.5, s1 = 2.1
▶ Algo B : n2 = 12, x̄2 = 14.8, s2 = 2.3
Construire un IC à 95% pour la différence de temps moyen.

48 / 90
Exemple : Comparaison de Deux Algorithmes
Contexte
Deux algorithmes de chiffrement sont comparés sur leur temps d’exécution (ms) :
▶ Algo A : n1 = 15, x̄1 = 12.5, s1 = 2.1
▶ Algo B : n2 = 12, x̄2 = 14.8, s2 = 2.3
Construire un IC à 95% pour la différence de temps moyen.
Calculs :
14 × 4.41 + 11 × 5.29 119.93
S2p = = = 4.80
25 25
Sp = 2.19

48 / 90
Exemple : Comparaison de Deux Algorithmes
Contexte
Deux algorithmes de chiffrement sont comparés sur leur temps d’exécution (ms) :
▶ Algo A : n1 = 15, x̄1 = 12.5, s1 = 2.1
▶ Algo B : n2 = 12, x̄2 = 14.8, s2 = 2.3
Construire un IC à 95% pour la différence de temps moyen.
Calculs :
14 × 4.41 + 11 × 5.29 119.93
S2p = = = 4.80
25 25
Sp = 2.19

t0.025,25 = 2.060

1 1
ME = 2.060 × 2.19 × + = 2.060 × 2.19 × 0.386 = 1.74
15 12

48 / 90
Exemple : Comparaison de Deux Algorithmes
Contexte
Deux algorithmes de chiffrement sont comparés sur leur temps d’exécution (ms) :
▶ Algo A : n1 = 15, x̄1 = 12.5, s1 = 2.1
▶ Algo B : n2 = 12, x̄2 = 14.8, s2 = 2.3
Construire un IC à 95% pour la différence de temps moyen.
Calculs :
14 × 4.41 + 11 × 5.29 119.93
S2p = = = 4.80
25 25
Sp = 2.19

t0.025,25 = 2.060

1 1
ME = 2.060 × 2.19 × + = 2.060 × 2.19 × 0.386 = 1.74
15 12

IC95% = [12.5 − 14.8 − 1.74, 12.5 − 14.8 + 1.74] = [−4.04, −0.56]


L’algorithme A est plus rapide de 0.56 à 4.04 ms (IC 95%).
48 / 90
Introduction à l’Approche Bayésienne

Différence fondamentale
▶ Approche fréquentiste : Le paramètre θ est fixe mais inconnu
▶ Approche bayésienne : Le paramètre θ est une variable aléatoire

Philosophie bayésienne :
1. On a une connaissance a priori sur θ : π(θ)
2. On observe des données : x1 , . . . , xn
3. On met à jour notre connaissance : π(θ|x1 , . . . , xn )

Remarque : L’estimation bayésienne combine information a priori et données observées.

49 / 90
Théorème de Bayes

Formule fondamentale
f(x|θ)π(θ)
π(θ|x) = ∝ f(x|θ)π(θ)
f(x)
où :
▶ π(θ) : distribution a priori
▶ f(x|θ) : vraisemblance
▶ π(θ|x) : distribution a posteriori
▶ f(x) : constante de normalisation

En mots :
Posteriori ∝ Vraisemblance × Priori

50 / 90
Estimation Bayésienne

Estimateurs bayésiens courants


1. MAP (Maximum A Posteriori) :

θ̂MAP = arg max π(θ|x)


θ

2. Moyenne a posteriori : ∫
θ̂Bayes = E[θ|x] = θπ(θ|x)dθ

3. Médiane a posteriori :
P(θ ≤ θ̂med |x) = 0.5

51 / 90
Choix de la Distribution A Priori

Types de prioris
▶ Priori informatif : Reflète une connaissance préalable forte
▶ Priori peu informatif : Influence minimale sur le posteriori
▶ Priori conjugué : Le posteriori a la même forme que le priori

Exemples de prioris conjugués :

Vraisemblance Priori conjugué Posteriori


Binomiale Beta Beta
Poisson Gamma Gamma
Normale (variance connue) Normale Normale

52 / 90
Exemple : Estimation Bayésienne d’une Proportion

Contexte
Détection de spam : On veut estimer la proportion p de spams.
A priori : On pense que p ≈ 0.3 avec une certaine incertitude.
On utilise p ∼ Beta(α, β) avec α = 3, β = 7 (moyenne = 0.3)

53 / 90
Exemple : Estimation Bayésienne d’une Proportion

Contexte
Détection de spam : On veut estimer la proportion p de spams.
A priori : On pense que p ≈ 0.3 avec une certaine incertitude.
On utilise p ∼ Beta(α, β) avec α = 3, β = 7 (moyenne = 0.3)
Données : Sur 100 emails, 40 sont des spams (x = 40, n = 100)

53 / 90
Exemple : Estimation Bayésienne d’une Proportion

Contexte
Détection de spam : On veut estimer la proportion p de spams.
A priori : On pense que p ≈ 0.3 avec une certaine incertitude.
On utilise p ∼ Beta(α, β) avec α = 3, β = 7 (moyenne = 0.3)
Données : Sur 100 emails, 40 sont des spams (x = 40, n = 100)
Vraisemblance : Binomiale
f(x|p) ∝ px (1 − p)n−x

53 / 90
Exemple : Estimation Bayésienne d’une Proportion

Contexte
Détection de spam : On veut estimer la proportion p de spams.
A priori : On pense que p ≈ 0.3 avec une certaine incertitude.
On utilise p ∼ Beta(α, β) avec α = 3, β = 7 (moyenne = 0.3)
Données : Sur 100 emails, 40 sont des spams (x = 40, n = 100)
Vraisemblance : Binomiale
f(x|p) ∝ px (1 − p)n−x
Posteriori : Beta(α + x, β + n − x) = Beta(3 + 40, 7 + 60) = Beta(43, 67)

53 / 90
Exemple : Estimation Bayésienne d’une Proportion

Contexte
Détection de spam : On veut estimer la proportion p de spams.
A priori : On pense que p ≈ 0.3 avec une certaine incertitude.
On utilise p ∼ Beta(α, β) avec α = 3, β = 7 (moyenne = 0.3)
Données : Sur 100 emails, 40 sont des spams (x = 40, n = 100)
Vraisemblance : Binomiale
f(x|p) ∝ px (1 − p)n−x
Posteriori : Beta(α + x, β + n − x) = Beta(3 + 40, 7 + 60) = Beta(43, 67)
Estimation (moyenne a posteriori) :

α+x 43
p̂Bayes = = = 0.391
α+β+n 110

53 / 90
Exemple : Visualisation Bayésienne

Densité
Priori : Beta(3,7) Posteriori : Beta(43,67)
0.391

0.3
p
0 0.5 1

Observation : Le posteriori combine le priori et les données, se déplaçant vers les observations.

54 / 90
Intervalle de Crédibilité Bayésien

Definition
Un intervalle de crédibilité à (1 − α) × 100% est un intervalle [L, U] tel que :

P(L ≤ θ ≤ U|x) = 1 − α

Différence avec l’IC fréquentiste :


▶ IC bayésien : ”La probabilité que θ soit dans [L, U] est 95%”
▶ IC fréquentiste : ”95% des intervalles construits contiendraient θ”

Remarque : L’interprétation bayésienne est souvent plus intuitive mais nécessite un priori.

55 / 90
Exemple : Intervalle de Crédibilité

Reprise de l’exemple précédent :


Posteriori : p|x ∼ Beta(43, 67)

Intervalle de crédibilité à 95% :


On cherche [L, U] tel que :
P(L ≤ p ≤ U|x) = 0.95

56 / 90
Exemple : Intervalle de Crédibilité

Reprise de l’exemple précédent :


Posteriori : p|x ∼ Beta(43, 67)

Intervalle de crédibilité à 95% :


On cherche [L, U] tel que :
P(L ≤ p ≤ U|x) = 0.95
Calcul numérique (quantiles de Beta(43, 67)) :
▶ L = 0.303 (quantile 2.5%)
▶ U = 0.482 (quantile 97.5%)

56 / 90
Exemple : Intervalle de Crédibilité

Reprise de l’exemple précédent :


Posteriori : p|x ∼ Beta(43, 67)

Intervalle de crédibilité à 95% :


On cherche [L, U] tel que :
P(L ≤ p ≤ U|x) = 0.95
Calcul numérique (quantiles de Beta(43, 67)) :
▶ L = 0.303 (quantile 2.5%)
▶ U = 0.482 (quantile 97.5%)

ICBayes,95% = [0.303, 0.482] = [30.3%, 48.2%]


Interprétation : Il y a 95% de probabilité que la vraie proportion de spams soit entre 30.3% et
48.2%.

56 / 90
Avantages et Inconvénients de l’Approche Bayésienne

Avantages
▶ Intègre naturellement les connaissances préalables
▶ Interprétation probabiliste directe
▶ Particulièrement utile avec peu de données
▶ Adapté aux problèmes séquentiels (mise à jour continue)

Inconvénients
▶ Choix du priori peut être subjectif
▶ Calculs parfois complexes (nécessite souvent MCMC)
▶ Dépend du priori choisi (sensibilité)
▶ Coût computationnel plus élevé

57 / 90
Question Interactive 4

Discussion
Un système de détection d’anomalies doit être calibré. Vous avez :
1. Une connaissance experte suggérant un taux d’anomalies autour de 2%
2. Très peu de données d’entraînement disponibles (50 observations)

Quelle approche d’estimation préféreriez-vous : fréquentiste ou bayésienne ?


Justifiez votre choix.

58 / 90
Question Interactive 4

Discussion
Un système de détection d’anomalies doit être calibré. Vous avez :
1. Une connaissance experte suggérant un taux d’anomalies autour de 2%
2. Très peu de données d’entraînement disponibles (50 observations)

Quelle approche d’estimation préféreriez-vous : fréquentiste ou bayésienne ?


Justifiez votre choix.

Éléments de réponse
Approche bayésienne recommandée car :
▶ Permet d’utiliser la connaissance experte (priori)
▶ Plus robuste avec peu de données
▶ Quantifie mieux l’incertitude dans ce contexte

58 / 90
Tableau Récapitulatif des Méthodes

Méthode Principe Avantages Limitations

MLE Maximiser vraisemblance Optimal asymptotiquement, ef- Nécessite la distribution, peut être
ficace complexe

Moments Égaler moments théoriques et Simple à calculer Peut être inefficace, parfois biaisé
empiriques

Bayésienne Actualiser distribution a priori Intègre connaissances préalables Choix du priori, calculs complexes

Conseil : Le choix de la méthode dépend du contexte, des données disponibles et des


hypothèses acceptables.

59 / 90
Application en Intelligence Artificielle

Exemples d’utilisation
1. Évaluation de modèles :
▶ Estimer la précision moyenne d’un modèle
▶ Comparer les performances de plusieurs algorithmes
2. Hyperparamètres :
▶ Estimation bayésienne pour l’optimisation d’hyperparamètres
▶ Construction d’IC pour quantifier l’incertitude
3. Apprentissage actif :
▶ Utiliser l’estimation pour décider quelles données étiqueter

60 / 90
Application en Cybersécurité

Cas d’usage
1. Détection d’anomalies :
▶ Estimer les paramètres du comportement normal
▶ Établir des seuils de détection via IC
2. Analyse de risques :
▶ Estimer la probabilité d’attaque
▶ Quantifier l’incertitude sur les métriques de sécurité
3. Systèmes adaptatifs :
▶ Mise à jour bayésienne des modèles de menaces
▶ Estimation séquentielle des paramètres de sécurité

61 / 90
Cas Pratique Intégré : Système IDS

Contexte complet
Un système de détection d’intrusion (IDS) analyse le trafic réseau. On souhaite :
1. Estimer le taux moyen d’alertes par heure
2. Construire un IC pour ce taux
3. Comparer avec un nouveau système IDS
4. Mettre à jour l’estimation avec de nouvelles données (approche bayésienne)

Données IDS actuel : 24 heures de surveillance


Nombre d’alertes par heure :
5, 7, 4, 6, 8, 5, 6, 7, 5, 4, 6, 7, 8, 6, 5, 7, 6, 8, 5, 7, 6, 5, 7, 6

62 / 90
Cas Pratique - Étape 1 : Estimation Ponctuelle

Données : n = 24 observations
Calculs : ∑
xi 148
x̄ = = = 6.17 alertes/heure
24 24

63 / 90
Cas Pratique - Étape 1 : Estimation Ponctuelle

Données : n = 24 observations
Calculs : ∑
xi 148
x̄ = = = 6.17 alertes/heure
24 24
1 ∑
s2 = (xi − 6.17)2 = 1.28
23
s = 1.13 alertes/heure

63 / 90
Cas Pratique - Étape 1 : Estimation Ponctuelle

Données : n = 24 observations
Calculs : ∑
xi 148
x̄ = = = 6.17 alertes/heure
24 24
1 ∑
s2 = (xi − 6.17)2 = 1.28
23
s = 1.13 alertes/heure

Estimation MLE (loi de Poisson) :

λ̂MLE = x̄ = 6.17 alertes/heure

Remarque : Pour la loi de Poisson, l’estimateur MLE coïncide avec la moyenne échantillonnale.

63 / 90
Cas Pratique - Étape 2 : Intervalle de Confiance

Construction d’un IC à 95% :


Hypothèse : Pour n grand, X̄ ∼ N (µ, σ 2 /n) (TCL)

64 / 90
Cas Pratique - Étape 2 : Intervalle de Confiance

Construction d’un IC à 95% :


Hypothèse : Pour n grand, X̄ ∼ N (µ, σ 2 /n) (TCL)
▶ x̄ = 6.17
▶ s = 1.13
▶ n = 24
▶ t0.025,23 = 2.069

64 / 90
Cas Pratique - Étape 2 : Intervalle de Confiance

Construction d’un IC à 95% :


Hypothèse : Pour n grand, X̄ ∼ N (µ, σ 2 /n) (TCL)
▶ x̄ = 6.17
▶ s = 1.13
▶ n = 24
▶ t0.025,23 = 2.069

1.13
ME = 2.069 × √ = 2.069 × 0.231 = 0.478
24

64 / 90
Cas Pratique - Étape 2 : Intervalle de Confiance

Construction d’un IC à 95% :


Hypothèse : Pour n grand, X̄ ∼ N (µ, σ 2 /n) (TCL)
▶ x̄ = 6.17
▶ s = 1.13
▶ n = 24
▶ t0.025,23 = 2.069

1.13
ME = 2.069 × √ = 2.069 × 0.231 = 0.478
24

IC95% = [6.17 − 0.478, 6.17 + 0.478] = [5.69, 6.65]


Interprétation : Avec 95% de confiance, le taux moyen d’alertes est entre 5.69 et 6.65 par
heure.

64 / 90
Cas Pratique - Étape 3 : Comparaison de Systèmes

Nouveau système IDS : 20 heures de surveillance


Nombre d’alertes : 4, 5, 3, 4, 5, 6, 4, 5, 4, 3, 5, 4, 6, 5, 4, 5, 3, 4, 5, 4

65 / 90
Cas Pratique - Étape 3 : Comparaison de Systèmes

Nouveau système IDS : 20 heures de surveillance


Nombre d’alertes : 4, 5, 3, 4, 5, 6, 4, 5, 4, 3, 5, 4, 6, 5, 4, 5, 3, 4, 5, 4
Calculs :
▶ ȳ = 4.35 alertes/heure
▶ sy = 0.88
▶ n2 = 20

65 / 90
Cas Pratique - Étape 3 : Comparaison de Systèmes

Nouveau système IDS : 20 heures de surveillance


Nombre d’alertes : 4, 5, 3, 4, 5, 6, 4, 5, 4, 3, 5, 4, 6, 5, 4, 5, 3, 4, 5, 4
Calculs :
▶ ȳ = 4.35 alertes/heure
▶ sy = 0.88
▶ n2 = 20
Différence :
x̄ − ȳ = 6.17 − 4.35 = 1.82 alertes/heure

65 / 90
Cas Pratique - Étape 3 : Comparaison de Systèmes

Nouveau système IDS : 20 heures de surveillance


Nombre d’alertes : 4, 5, 3, 4, 5, 6, 4, 5, 4, 3, 5, 4, 6, 5, 4, 5, 3, 4, 5, 4
Calculs :
▶ ȳ = 4.35 alertes/heure
▶ sy = 0.88
▶ n2 = 20
Différence :
x̄ − ȳ = 6.17 − 4.35 = 1.82 alertes/heure
Question : Cette différence est-elle statistiquement significative ?
(Test d’hypothèse - sujet du prochain cours !)

Remarque : L’ancien système génère en moyenne 1.82 alertes de plus par heure.

65 / 90
Cas Pratique - Étape 4 : Approche Bayésienne

Contexte : L’expert sécurité pense que le taux devrait être autour de 5 alertes/heure.

66 / 90
Cas Pratique - Étape 4 : Approche Bayésienne

Contexte : L’expert sécurité pense que le taux devrait être autour de 5 alertes/heure.
Priori : Gamma(25, 5) (moyenne = 5, variance = 1)

66 / 90
Cas Pratique - Étape 4 : Approche Bayésienne

Contexte : L’expert sécurité pense que le taux devrait être autour de 5 alertes/heure.
Priori : Gamma(25, 5) (moyenne = 5, variance = 1)
Données : 24 observations, somme = 148

66 / 90
Cas Pratique - Étape 4 : Approche Bayésienne

Contexte : L’expert sécurité pense que le taux devrait être autour de 5 alertes/heure.
Priori : Gamma(25, 5) (moyenne = 5, variance = 1)
Données : 24 observations, somme = 148
Vraisemblance : Poisson ∑
f(x|λ) ∝ λ xi e−nλ

66 / 90
Cas Pratique - Étape 4 : Approche Bayésienne

Contexte : L’expert sécurité pense que le taux devrait être autour de 5 alertes/heure.
Priori : Gamma(25, 5) (moyenne = 5, variance = 1)
Données : 24 observations, somme = 148
Vraisemblance : Poisson ∑
f(x|λ) ∝ λ xi e−nλ

Posteriori : Gamma(α + xi , β + n) = Gamma(25 + 148, 5 + 24) = Gamma(173, 29)

66 / 90
Cas Pratique - Étape 4 : Approche Bayésienne

Contexte : L’expert sécurité pense que le taux devrait être autour de 5 alertes/heure.
Priori : Gamma(25, 5) (moyenne = 5, variance = 1)
Données : 24 observations, somme = 148
Vraisemblance : Poisson ∑
f(x|λ) ∝ λ xi e−nλ

Posteriori : Gamma(α + xi , β + n) = Gamma(25 + 148, 5 + 24) = Gamma(173, 29)
Estimation bayésienne :
173
λ̂Bayes = = 5.97 alertes/heure
29
Comparaison :
▶ MLE : 6.17 (données seules)
▶ Bayésien : 5.97 (données + expertise)

66 / 90
Exercice Guidé 1

Énoncé
Un système de reconnaissance vocale est testé sur 50 phrases. Le taux de reconnaissance
correct observé est de 94% (47 phrases correctes sur 50).

Questions :
1. Quelle est l’estimation ponctuelle du taux de réussite ?
2. Construire un IC à 95% pour ce taux.
3. Interpréter le résultat.

67 / 90
Exercice Guidé 1

Énoncé
Un système de reconnaissance vocale est testé sur 50 phrases. Le taux de reconnaissance
correct observé est de 94% (47 phrases correctes sur 50).

Questions :
1. Quelle est l’estimation ponctuelle du taux de réussite ?
2. Construire un IC à 95% pour ce taux.
3. Interpréter le résultat.
Indications :
▶ Utilisez l’estimateur de proportion : p̂ = x/n
▶ Vérifiez les conditions d’application
▶ z0.025 = 1.96

67 / 90
Exercice Guidé 1 - Solution
1. Estimation ponctuelle :
47
p̂ = = 0.94 = 94%
50

68 / 90
Exercice Guidé 1 - Solution
1. Estimation ponctuelle :
47
p̂ = = 0.94 = 94%
50
2. Vérification des conditions :

np̂ = 50 × 0.94 = 47 ≥ 5

n(1 − p̂) = 50 × 0.06 = 3 < 5 (limite)

68 / 90
Exercice Guidé 1 - Solution
1. Estimation ponctuelle :
47
p̂ = = 0.94 = 94%
50
2. Vérification des conditions :

np̂ = 50 × 0.94 = 47 ≥ 5

n(1 − p̂) = 50 × 0.06 = 3 < 5 (limite)


3. IC à 95% : √
0.94 × 0.06 √
SE = = 0.001128 = 0.0336
50
ME = 1.96 × 0.0336 = 0.0658

68 / 90
Exercice Guidé 1 - Solution
1. Estimation ponctuelle :
47
p̂ = = 0.94 = 94%
50
2. Vérification des conditions :

np̂ = 50 × 0.94 = 47 ≥ 5

n(1 − p̂) = 50 × 0.06 = 3 < 5 (limite)


3. IC à 95% : √
0.94 × 0.06 √
SE = = 0.001128 = 0.0336
50
ME = 1.96 × 0.0336 = 0.0658

IC95% = [0.94 − 0.0658, 0.94 + 0.0658] = [0.874, 1.006]


≈ [0.874, 1.000] = [87.4%, 100%]
Interprétation : Avec 95% de confiance, le taux de réussite est entre 87.4% et 100%.
68 / 90
Exercice Guidé 2

Énoncé
Les temps de réponse (en ms) d’une API sont mesurés :

23, 28, 25, 30, 27, 24, 29, 26, 28, 25, 27, 26

Questions :
1. Estimer le temps de réponse moyen et son écart-type
2. Construire un IC à 95%
3. Estimer par la méthode des moments si les données suivent une loi normale

69 / 90
Exercice Guidé 2

Énoncé
Les temps de réponse (en ms) d’une API sont mesurés :

23, 28, 25, 30, 27, 24, 29, 26, 28, 25, 27, 26

Questions :
1. Estimer le temps de réponse moyen et son écart-type
2. Construire un IC à 95%
3. Estimer par la méthode des moments si les données suivent une loi normale
À faire en groupe (5 minutes)

69 / 90
Exercice Guidé 2 - Solution (1/2)
1. Estimations :
23 + 28 + 25 + . . . + 26 318
x̄ = = = 26.5 ms
12 12

70 / 90
Exercice Guidé 2 - Solution (1/2)
1. Estimations :
23 + 28 + 25 + . . . + 26 318
x̄ = = = 26.5 ms
12 12
1 ∑ 1 44
s2 = (xi − 26.5)2 = (12.25 + 2.25 + . . . + 0.25) = =4
11 11 11
s = 2 ms

70 / 90
Exercice Guidé 2 - Solution (1/2)
1. Estimations :
23 + 28 + 25 + . . . + 26 318
x̄ = = = 26.5 ms
12 12
1 ∑ 1 44
s2 = (xi − 26.5)2 = (12.25 + 2.25 + . . . + 0.25) = =4
11 11 11
s = 2 ms
2. IC à 95% :
▶ n = 12, df = 11
▶ t0.025,11 = 2.201
▶ SE = √2 = 0.577
12
▶ ME = 2.201 × 0.577 = 1.270

70 / 90
Exercice Guidé 2 - Solution (1/2)
1. Estimations :
23 + 28 + 25 + . . . + 26 318
x̄ = = = 26.5 ms
12 12
1 ∑ 1 44
s2 = (xi − 26.5)2 = (12.25 + 2.25 + . . . + 0.25) = =4
11 11 11
s = 2 ms
2. IC à 95% :
▶ n = 12, df = 11
▶ t0.025,11 = 2.201
▶ SE = √2 = 0.577
12
▶ ME = 2.201 × 0.577 = 1.270

IC95% = [26.5 − 1.270, 26.5 + 1.270] = [25.23, 27.77] ms

70 / 90
Exercice Guidé 2 - Solution (2/2)
3. Estimation par méthode des moments :
Pour une loi normale N (µ, σ 2 ) :
▶ Moment d’ordre 1 : µ1 = µ
▶ Moment d’ordre 2 : µ2 = σ 2 + µ2

71 / 90
Exercice Guidé 2 - Solution (2/2)
3. Estimation par méthode des moments :
Pour une loi normale N (µ, σ 2 ) :
▶ Moment d’ordre 1 : µ1 = µ
▶ Moment d’ordre 2 : µ2 = σ 2 + µ2
Moments empiriques :
▶ m1 = x̄ = 26.5
∑ 2
▶ m2 = 12
1
xi = 8470
12 = 705.83

71 / 90
Exercice Guidé 2 - Solution (2/2)
3. Estimation par méthode des moments :
Pour une loi normale N (µ, σ 2 ) :
▶ Moment d’ordre 1 : µ1 = µ
▶ Moment d’ordre 2 : µ2 = σ 2 + µ2
Moments empiriques :
▶ m1 = x̄ = 26.5
∑ 2
▶ m2 = 12
1
xi = 8470
12 = 705.83
Résolution :

µ̂MM = 26.5
2
σ̂MM = 705.83 − (26.5)2 = 705.83 − 702.25 = 3.58
σ̂MM = 1.89 ms

Conclusion : N (26.5, 3.58) est une approximation raisonnable.

71 / 90
Erreurs Courantes à Éviter

1. Interprétation de l’IC
� ”Il y a 95% de chances que µ soit dans l’intervalle”
� ”Nous avons 95% de confiance que l’intervalle contient µ”

2. Confusion entre σ et s
� Utiliser l’écart-type de la population au lieu de l’échantillon
� Distinguer clairement paramètres et estimations

3. Application aveugle des formules


� Ne pas vérifier les hypothèses (normalité, taille échantillon, etc.)
� Toujours vérifier les conditions d’application

4. Oubli du n − 1
� Diviser par n pour la variance échantillonnale
� Diviser par n − 1 pour avoir un estimateur sans biais

72 / 90
Bonnes Pratiques

Recommandations
1. Toujours visualiser les données avant d’estimer (histogramme, boxplot)
2. Vérifier les hypothèses (normalité, indépendance, etc.)
3. Rapporter l’incertitude (IC, pas seulement estimation ponctuelle)
4. Choisir la méthode appropriée selon le contexte
5. Interpréter les résultats dans le contexte du problème
6. Documenter les choix (niveau de confiance, méthode, hypothèses)

73 / 90
Outils Logiciels

Pour l’estimation statistique


Python :
▶ [Link] : distributions, tests, IC
▶ statsmodels : modèles statistiques avancés
▶ pymc : estimation bayésienne

R:
▶ Fonctions natives : mean(), var(), [Link]()
▶ Package MASS : MLE
▶ Package rstan ou JAGS : Bayésien

74 / 90
Exemple de Code Python
Estimation et IC en Python
import numpy as np
from scipy import stats

# Données
data = [12, 15, 13, 18, 14, 16, 15, 17, 13, 14]

# Estimation ponctuelle
mean_est = [Link](data)
std_est = [Link](data, ddof=1) # ddof=1 pour n-1

# IC à 95%
n = len(data)
se = std_est / [Link](n)
t_crit = [Link](0.975, df=n-1)
ci = (mean_est - t_crit*se, mean_est + t_crit*se)

print(f"Moyenne: {mean_est:.2f}")
print(f"IC 95%: [{ci[0]:.2f}, {ci[1]:.2f}]")
75 / 90
Résumé du Chapitre 1 : Estimation Ponctuelle et IC

Points clés
▶ Estimation ponctuelle : Unique valeur pour estimer un paramètre
▶ Qualités : Sans biais, convergent, efficace
▶ IC : Quantifie l’incertitude de l’estimation
▶ Interprétation IC : 95% de confiance, pas 95% de probabilité
▶ Formules IC : Dépendent de la taille d’échantillon et de σ connu/inconnu
▶ Loi de Student : Utilisée quand σ inconnu et n petit

Formule à retenir :
S
IC1−α = X̄ ± tα/2,n−1 × √
n

76 / 90
Résumé du Chapitre 2 : Méthodes d’Estimation

Points clés
▶ MLE : Maximiser la vraisemblance, optimal asymptotiquement
▶ Méthode des moments : Égaler moments théoriques et empiriques, simple
▶ Estimation bayésienne : Combiner priori et données
▶ Choix de méthode : Dépend du contexte et des hypothèses

Méthode Quand l’utiliser ?


MLE Distribution connue, grands échantillons
Moments Approximation rapide, simplicité
Bayésienne Connaissance a priori, petits échantillons

77 / 90
Liens avec les Autres Concepts

L’estimation est fondamentale pour :


▶ Les tests d’hypothèses (prochain cours)
▶ La régression et la prédiction
▶ L’apprentissage automatique
▶ L’analyse de données en cybersécurité

78 / 90
Questions Fréquentes
Q1 : Quelle taille d’échantillon est suffisante ?
Dépend du contexte, mais règles générales :
▶ n ≥ 30 pour appliquer le TCL
▶ n ≥ 100 pour les proportions
▶ Plus grand si grande variabilité

Q2 : Quand utiliser z vs t ?
▶ z : σ connu ET (n > 30 OU population normale)
▶ t : σ inconnu (cas le plus fréquent)

Q3 : Comment choisir le niveau de confiance ?


▶ 95% : standard dans la plupart des cas
▶ 99% : applications critiques (médical, sécurité)
▶ 90% : études exploratoires

79 / 90
Projet Pratique Suggéré
Mini-projet : Analyse d’un Dataset de Sécurité
Objectif : Appliquer toutes les méthodes d’estimation apprises

Étapes :
1. Collecter des données de logs système (temps de réponse, nombre d’événements, etc.)
2. Effectuer une analyse exploratoire
3. Estimer les paramètres par différentes méthodes (MLE, Moments)
4. Construire des IC pour les paramètres
5. Comparer avec une approche bayésienne
6. Rédiger un rapport avec interprétations

Livrables :
▶ Code Python/R commenté
▶ Rapport d’analyse (3-5 pages)
▶ Présentation des résultats (10 min)
80 / 90
Ressources Complémentaires
Livres recommandés
▶ Statistical Inference - Casella & Berger (référence)
▶ Probability and Statistics - DeGroot & Schervish
▶ Bayesian Data Analysis - Gelman et al.

Ressources en ligne
▶ Khan Academy : Statistiques et probabilités
▶ Coursera : Statistical Inference
▶ StatQuest (YouTube) : Explications visuelles

Pour la pratique
▶ Kaggle : Datasets et notebooks
▶ UCI Machine Learning Repository
▶ Documentation [Link]
81 / 90
Exercices pour la Maison

Exercice 1 : Estimation de performance


Un algorithme de classification est testé 30 fois. La précision moyenne est 0.85 avec un
écart-type de 0.04.
1. Construire un IC à 95% pour la précision moyenne
2. Quelle taille d’échantillon serait nécessaire pour une marge d’erreur de 0.01 ?

Exercice 2 : Comparaison d’algorithmes


Deux algorithmes de chiffrement ont des temps d’exécution moyens de 15ms et 18ms avec des
écarts-types de 3ms et 4ms respectivement (échantillons de 25 et 30).
1. Estimer la différence moyenne de temps
2. Construire un IC à 99% pour cette différence

82 / 90
Exercices pour la Maison (suite)

Exercice 3 : MLE
Soit X1 , . . . , Xn un échantillon d’une loi exponentielle de densité : f(x|λ) = λe−λx , x>0
1. Trouver l’estimateur MLE de λ
2. Appliquer avec les données : 2.3, 1.8, 3.1, 2.5, 2.9

Exercice 4 : Bayésien
Pour une proportion p avec priori Beta(2, 3) et 20 succès sur 50 essais :
1. Déterminer la distribution a posteriori
2. Calculer l’estimation bayésienne
3. Comparer avec l’estimation MLE

83 / 90
Points à Retenir - Formules Essentielles

Estimateurs ponctuels

▶ Moyenne : µ̂ = X̄ = n1 Xi

▶ Variance : σ̂ = S = n−1 (Xi − X̄)2
2 2 1

▶ Proportion : p̂ = x
n

Intervalles de confiance
▶ Moyenne (σ connu) : X̄ ± zα/2 √σ
n
▶ Moyenne (σ inconnu) : X̄ ± tα/2,n−1 √S
n

▶ Proportion : p̂ ± zα/2 p̂(1−p̂)
n

84 / 90
Points à Retenir - Méthodes

Maximum de Vraisemblance

1. L(θ) = f(xi |θ)

2. ℓ(θ) = ln f(xi |θ)
dℓ(θ)
3. dθ =0

Méthode ∑
des Moments
1
E[Xk ] = n Xki pour k = 1, 2, . . .

Bayésien
π(θ|x) ∝ L(θ|x) × π(θ)

85 / 90
Préparation pour le Prochain Cours
Tests d’hypothèses
Le prochain cours portera sur :
▶ Formulation d’hypothèses (H0, H1)
▶ Tests paramétriques (test-t, test-z)
▶ P-valeur et décision statistique
▶ Tests du chi-deux
▶ Erreurs de type I et II
▶ Puissance d’un test

À préparer :
▶ Réviser les notions d’estimation
▶ Comprendre la loi normale et la loi de Student
▶ Réfléchir : Comment décider si deux moyennes sont différentes ?

86 / 90
Quiz Rapide de Révision (1/2)
Question 1
Un estimateur sans biais signifie :
a) Sa variance est nulle
b) Son espérance égale le paramètre
c) Il converge vers le paramètre
d) Il a la variance minimale

87 / 90
Quiz Rapide de Révision (1/2)
Question 1
Un estimateur sans biais signifie :
a) Sa variance est nulle
b) Son espérance égale le paramètre
c) Il converge vers le paramètre
d) Il a la variance minimale
Réponse : b) E[θ̂] = θ

Question 2
Pour un IC à 95%, si on augmente la taille d’échantillon :
a) L’intervalle devient plus large
b) L’intervalle devient plus étroit
c) L’intervalle reste identique
d) Le niveau de confiance change
87 / 90
Quiz Rapide de Révision (1/2)
Question 1
Un estimateur sans biais signifie :
a) Sa variance est nulle
b) Son espérance égale le paramètre
c) Il converge vers le paramètre
d) Il a la variance minimale
Réponse : b) E[θ̂] = θ

Question 2
Pour un IC à 95%, si on augmente la taille d’échantillon :
a) L’intervalle devient plus large
b) L’intervalle devient plus étroit
c) L’intervalle reste identique
d) Le niveau de confiance change

Réponse : b) Car la marge d’erreur ∝ 1/ n 87 / 90
Quiz Rapide de Révision (2/2)
Question 3
L’estimateur MLE de la moyenne d’une loi normale est :
a) La médiane
b) La moyenne échantillonnale
c) La variance échantillonnale
d) Le mode

88 / 90
Quiz Rapide de Révision (2/2)
Question 3
L’estimateur MLE de la moyenne d’une loi normale est :
a) La médiane
b) La moyenne échantillonnale
c) La variance échantillonnale
d) Le mode
Réponse : b) µ̂MLE = X̄

Question 4
Dans l’approche bayésienne, le paramètre θ est :
a) Fixe et inconnu
b) Une variable aléatoire
c) Toujours égal à sa moyenne
d) Impossible à estimer
88 / 90
Quiz Rapide de Révision (2/2)
Question 3
L’estimateur MLE de la moyenne d’une loi normale est :
a) La médiane
b) La moyenne échantillonnale
c) La variance échantillonnale
d) Le mode
Réponse : b) µ̂MLE = X̄

Question 4
Dans l’approche bayésienne, le paramètre θ est :
a) Fixe et inconnu
b) Une variable aléatoire
c) Toujours égal à sa moyenne
d) Impossible à estimer
Réponse : b) C’est la différence fondamentale avec l’approche fréquentiste 88 / 90
Conclusion du Cours

Ce que nous avons appris


▶ Distinguer estimation ponctuelle et par intervalle
▶ Construire et interpréter des intervalles de confiance
▶ Appliquer les méthodes MLE et moments
▶ Comprendre l’approche bayésienne
▶ Utiliser ces outils dans des contextes IA/cybersécurité

Compétences acquises
▶ Quantifier l’incertitude d’une estimation
▶ Choisir la méthode appropriée selon le contexte
▶ Interpréter correctement les résultats
▶ Éviter les erreurs courantes

89 / 90
Merci pour votre attention !
Questions et Discussion

Contact :
ENSA Béni Mellal
Département Intelligence Artificielle et Cybersécurité

”En statistique, nous cherchons la vérité,


mais nous devons toujours quantifier notre incertitude.”

Vous aimerez peut-être aussi