0% ont trouvé ce document utile (0 vote)
13 vues30 pages

Moyenne, Écart-Type et Coefficient de Variation

La comparaison entre la moyenne et l'écart-type, à travers le coefficient de variation (CV), permet d'analyser la dispersion des données et d'identifier des problèmes de qualité des données. Trois situations sont décrites : lorsque l'écart-type est inférieur, égal ou supérieur à la moyenne, chacune ayant des implications différentes pour l'analyse statistique et la communication des résultats. Comprendre ces relations est crucial pour éviter des erreurs d'interprétation et pour choisir les méthodes d'analyse appropriées.

Transféré par

mulumbadidier12
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOC, PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
13 vues30 pages

Moyenne, Écart-Type et Coefficient de Variation

La comparaison entre la moyenne et l'écart-type, à travers le coefficient de variation (CV), permet d'analyser la dispersion des données et d'identifier des problèmes de qualité des données. Trois situations sont décrites : lorsque l'écart-type est inférieur, égal ou supérieur à la moyenne, chacune ayant des implications différentes pour l'analyse statistique et la communication des résultats. Comprendre ces relations est crucial pour éviter des erreurs d'interprétation et pour choisir les méthodes d'analyse appropriées.

Transféré par

mulumbadidier12
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOC, PDF, TXT ou lisez en ligne sur Scribd

𝗠𝗢𝗬𝗘𝗡𝗡𝗘 𝗩𝗦 𝗘́𝗖𝗔𝗥𝗧-𝗧𝗬𝗣𝗘 : 𝗖𝗲 𝗾𝘂𝗲 𝗿𝗲́𝘃𝗲̀𝗹𝗲 𝗹𝗲𝘂𝗿 𝗰𝗼𝗺𝗽𝗮𝗿𝗮𝗶𝘀𝗼𝗻

📊 𝗨𝗻 𝗶𝗻𝗱𝗶𝗰𝗮𝘁𝗲𝘂𝗿 𝘀𝘁𝗮𝘁𝗶𝘀𝘁𝗶𝗾𝘂𝗲 𝗺𝗲́𝗰𝗼𝗻𝗻𝘂 𝗺𝗮𝗶𝘀 𝗽𝘂𝗶𝘀𝘀𝗮𝗻𝘁

La comparaison entre la moyenne et l'écart-type d'une distribution est un indicateur statistique simple
mais extraordinairement révélateur. Le rapport entre ces deux mesures, appelé coefficient de variation
(CV), nous renseigne sur la nature de la dispersion des données, la présence de valeurs extrêmes, et
peut même signaler des problèmes de qualité des données ou des distributions particulières.

Comprendre ce que signifie avoir un écart-type supérieur, égal ou inférieur à la moyenne est essentiel
pour interpréter correctement vos données et éviter des erreurs d'analyse.

𝗥𝗮𝗽𝗽𝗲𝗹𝘀 𝗳𝗼𝗻𝗱𝗮𝗺𝗲𝗻𝘁𝗮𝘂𝘅

La moyenne (μ ou x̄ )

Définition : Somme des valeurs divisée par le nombre d'observations

μ = (Σ xi) / n

Interprétation : Centre de gravité de la distribution, valeur "typique" ou "centrale"

Unité : Même unité que les données (euros, kg, années, etc.)

L'écart-type (σ ou s)

Définition : Racine carrée de la variance, mesure la dispersion autour de la moyenne

σ = √[(Σ (xi - μ)²) / n]

Interprétation : Mesure de la variabilité ou dispersion des données

Unité : Même unité que les données et la moyenne

Le coefficient de variation (CV)

Définition : Rapport de l'écart-type sur la moyenne

CV = (σ / μ) × 100%

Avantage : Sans unité, permet de comparer la dispersion relative entre distributions d'échelles
différentes

𝗟𝗲𝘀 𝘁𝗿𝗼𝗶𝘀 𝘀𝗶𝘁𝘂𝗮𝘁𝗶𝗼𝗻𝘀 𝗽𝗼𝘀𝘀𝗶𝗯𝗹𝗲𝘀

🔷 SITUATION 1 : σ < μ (Écart-type inférieur à la moyenne)

Ce que cela signifie :


Dispersion relative faible à modérée (CV < 100%)

Les données sont relativement homogènes autour de la moyenne

La distribution est concentrée

Peu de valeurs extrêmes

La moyenne est représentative de l'ensemble des données

Coefficient de variation :

CV < 15% : Très faible dispersion (données très homogènes)

15% < CV < 30% : Dispersion modérée (acceptable)

30% < CV < 100% : Dispersion importante mais gérable

Exemples concrets :

Taille humaine adulte :

Moyenne : 170 cm

Écart-type : 10 cm

CV = 5.9% (très faible dispersion)

Interprétation : La plupart des adultes mesurent entre 160 et 180 cm

Salaires dans une entreprise :

Moyenne : 3 500 €
Écart-type : 800 €

CV = 22.9% (dispersion modérée)

Interprétation : Salaires relativement homogènes, hiérarchie salariale modérée

Notes d'examen :

Moyenne : 13/20

Écart-type : 3 points

CV = 23% (dispersion acceptable)

Interprétation : Niveau relativement homogène des étudiants

Température quotidienne en été :

Moyenne : 28°C

Écart-type : 4°C

CV = 14.3% (faible dispersion)

Interprétation : Climat stable, températures prévisibles

Quand s'attendre à σ < μ :

Variables naturellement bornées inférieurement à des valeurs éloignées de zéro

Processus contrôlés ou régulés

Populations homogènes

Variables continues positives avec distribution symétrique ou légèrement asymétrique


Implications pratiques :

✅ La moyenne est un bon indicateur de tendance centrale

✅ Les prévisions basées sur la moyenne sont fiables

✅ Faible risque de valeurs aberrantes

✅ Intervalle de confiance étroit autour de la moyenne

🔶 SITUATION 2 : σ ≈ μ (Écart-type proche de la moyenne)

Ce que cela signifie :

Dispersion relative élevée (CV ≈ 100%)

Les données sont hétérogènes

Variabilité importante par rapport au niveau moyen

La moyenne commence à perdre sa représentativité

Point de transition critique

Coefficient de variation :

CV ≈ 100% : Dispersion égale à la valeur centrale

Zone d'attention particulière

Exemples concrets :

Revenus des ménages (souvent) :

Moyenne : 35 000 €/an


Écart-type : 32 000 €

CV = 91% (forte dispersion)

Interprétation : Grande inégalité de revenus, moyenne peu représentative

Durée d'hospitalisation :

Moyenne : 5 jours

Écart-type : 4.8 jours

CV = 96%

Interprétation : Forte variabilité, cas courts (1-2 jours) et longs (15+ jours)

Temps de réponse serveur web :

Moyenne : 250 ms

Écart-type : 240 ms

CV = 96%

Interprétation : Performances très variables, pics de latence fréquents

Nombre de clients par jour (petit commerce) :

Moyenne : 30 clients

Écart-type : 28 clients

CV = 93%

Interprétation : Forte volatilité, jours très calmes vs très chargés


Quand s'attendre à σ ≈ μ :

Distributions avec asymétrie marquée

Données avec présence de sous-groupes distincts

Processus avec forte variabilité naturelle

Variables économiques avec inégalités

Transition vers des distributions exponentielles

Implications pratiques :

⚠️La moyenne devient moins informative

⚠️Médiane souvent plus appropriée que la moyenne

⚠️Utiliser des visualisations (boxplot, histogramme)

⚠️Considérer des transformations (log)

⚠️Analyser par sous-groupes si possible

🔴 SITUATION 3 : σ > μ (Écart-type supérieur à la moyenne)

Ce que cela signifie :

Dispersion excessive (CV > 100%)

Les données sont extrêmement hétérogènes

Présence probable de valeurs extrêmes ou outliers

La moyenne est peu représentative, voire trompeuse

Distribution fortement asymétrique (skewed)

Possible mélange de populations distinctes


Coefficient de variation :

100% < CV < 200% : Très forte dispersion

CV > 200% : Dispersion extrême, données très problématiques

Exemples concrets :

Patrimoine des ménages :

Moyenne : 150 000 €

Écart-type : 450 000 €

CV = 300% (dispersion extrême !)

Interprétation : Inégalités massives, quelques ultra-riches tirent la moyenne vers le haut. La médiane (50
000 €) est bien plus représentative.

Nombre de followers sur les réseaux sociaux :

Moyenne : 500 followers

Écart-type : 15 000 followers

CV = 3000% (!!!)

Interprétation : Distribution "power law", quelques influenceurs vs masse d'utilisateurs ordinaires

Sinistres en assurance :

Moyenne : 2 000 €

Écart-type : 25 000 €
CV = 1250%

Interprétation : Beaucoup de petits sinistres, quelques sinistres catastrophiques (incendie, etc.)

Temps avant défaillance d'un composant électronique :

Moyenne : 1 000 heures

Écart-type : 1 800 heures

CV = 180%

Interprétation : Distribution exponentielle, mortalité infantile et vieillissement

Nombre de publications scientifiques par chercheur :

Moyenne : 3 publications/an

Écart-type : 8 publications/an

CV = 267%

Interprétation : Quelques "stars" ultra-productives, beaucoup de chercheurs avec peu de publications

Montants de dons caritatifs :

Moyenne : 50 €

Écart-type : 500 €

CV = 1000%

Interprétation : Beaucoup de petits dons (5-20 €), quelques très gros dons (milliers d'euros)

Quand s'attendre à σ > μ :


Distributions exponentielles (durées de vie, temps d'attente)

Distributions log-normales (revenus, tailles de villes, prix d'actifs)

Distributions de Pareto (richesse, citations scientifiques)

Données de comptage avec overdispersion (événements rares)

Présence d'outliers ou valeurs aberrantes

Mélange de plusieurs populations

Données tronquées ou censurées à gauche (près de zéro)

Implications pratiques :

❌ La moyenne est trompeuse et non représentative

❌ Ne pas utiliser la moyenne seule pour communiquer

✅ Privilégier la médiane comme mesure de tendance centrale

✅ Utiliser les percentiles (Q1, Q3, P90, P95) pour décrire la distribution

✅ Transformer les données (log, racine carrée) pour normaliser

✅ Identifier et traiter les outliers

✅ Segmenter l'analyse par sous-groupes homogènes

✅ Utiliser des visualisations appropriées (boxplot, log-scale)

𝗜𝗺𝗽𝗹𝗶𝗰𝗮𝘁𝗶𝗼𝗻𝘀 𝗽𝗼𝘂𝗿 𝗹'𝗮𝗻𝗮𝗹𝘆𝘀𝗲 𝘀𝘁𝗮𝘁𝗶𝘀𝘁𝗶𝗾𝘂𝗲

🔍 Pour les tests d'hypothèses

Si σ < μ (CV faible) :

✅ Tests paramétriques (t-test, ANOVA) généralement appropriés

✅ Hypothèse de normalité souvent raisonnable

✅ Taille d'échantillon modérée suffisante

Si σ ≈ μ (CV ≈ 100%) :
⚠️Vérifier la normalité avec tests (Shapiro-Wilk, Kolmogorov-Smirnov)

⚠️Considérer des tests non-paramétriques si normalité violée

⚠️Augmenter la taille d'échantillon si possible

Si σ > μ (CV > 100%) :

❌ Tests paramétriques probablement inappropriés

✅ Privilégier tests non-paramétriques (Mann-Whitney, Kruskal-Wallis)

✅ Transformer les données (log) avant tests paramétriques

✅ Utiliser bootstrap pour intervalles de confiance robustes

📈 Pour la modélisation

Si σ < μ :

✅ Régression linéaire classique souvent appropriée

✅ Modèles gaussiens pertinents

✅ Prévisions par intervalles de confiance classiques

Si σ ≈ μ :

⚠️Examiner les résidus attentivement

⚠️Considérer transformations ou modèles GLM

⚠️Vérifier l'homoscédasticité

Si σ > μ :

❌ Régression linéaire simple inadaptée

✅ Modèles log-linéaires (log transformation)

✅ Modèles GLM (Gamma, inverse Gaussian)

✅ Modèles de comptage (Poisson, binomiale négative)

✅ Régression quantile pour analyser différentes parties de la distribution

💡 Pour la communication des résultats

Si CV < 30% :
✅ "En moyenne X ± σ" est informatif

✅ Graphique en barres avec barres d'erreur acceptable

✅ La moyenne résume bien les données

Si 30% < CV < 100% :

⚠️Mentionner explicitement la forte dispersion

⚠️Compléter avec médiane et quartiles

⚠️Utiliser boxplots plutôt que barres

Si CV > 100% :

❌ Éviter de présenter seulement "moyenne ± écart-type"

✅ Privilégier : "Médiane [Q1 - Q3]" ou "Médiane [P10 - P90]"

✅ Utiliser graphiques adaptés : boxplot, violin plot, histogramme log-scale

✅ Préciser dans le texte : "Distribution fortement asymétrique, moyenne peu représentative"

𝗖𝗮𝘀 𝗽𝗮𝗿𝘁𝗶𝗰𝘂𝗹𝗶𝗲𝗿𝘀 𝗲𝘁 𝗽𝗶𝗲̀𝗴𝗲𝘀

⚠️Cas 1 : Données strictement positives

Pour des variables ne pouvant être négatives (revenus, prix, durées, distances), un CV > 100% signale
souvent une distribution log-normale plutôt que normale.

Solution : Transformation logarithmique

Y_transformé = log(Y)

Après transformation, CV généralement < 100% et distribution plus symétrique.

⚠️Cas 2 : Présence de zéros

Beaucoup de zéros + quelques valeurs élevées → inflation de zéros

Exemple : Dépenses médicales (beaucoup de personnes : 0 €, quelques-unes : milliers d'€)

Moyenne : 150 €

Écart-type : 800 €

CV = 533%
Solutions :

Modèles "zero-inflated" (Poisson, binomiale négative)

Analyse séparée : probabilité d'avoir dépense non-nulle + montant sachant dépense > 0

Médiane et percentiles conditionnels

⚠️Cas 3 : Valeurs négatives possibles

Si la variable peut être négative (rendements financiers, températures, variations), le CV perd son sens si
la moyenne est proche de zéro ou négative.

Exemple problématique :

Rendements boursiers : Moyenne = 0.5%, Écart-type = 15%

CV = 3000% (n'a pas de sens ici !)

Solutions :

Utiliser directement l'écart-type (volatilité)

Ratio de Sharpe : (Moyenne - Taux sans risque) / Écart-type

Ne pas calculer de CV

⚠️Cas 4 : Échantillon vs population

Le CV échantillonnal peut être biaisé pour petits échantillons.

Correction : Pour n < 30, utiliser coefficient de variation corrigé :

CV_corrigé = CV × (1 + 1/(4n))

⚠️Cas 5 : Comparaison entre groupes


Le CV permet de comparer la dispersion relative entre groupes d'échelles différentes.

Exemple : Comparer variabilité des salaires

Groupe A (cadres) : Moyenne = 5000 €, σ = 1000 €, CV = 20%

Groupe B (employés) : Moyenne = 2000 €, σ = 600 €, CV = 30%

→ Bien que σ(A) > σ(B), la dispersion relative est plus élevée chez les employés.

𝗗𝗶𝘀𝘁𝗿𝗶𝗯𝘂𝘁𝗶𝗼𝗻𝘀 𝘁𝗵𝗲́𝗼𝗿𝗶𝗾𝘂𝗲𝘀 𝗲𝘁 𝗿𝗮𝗽𝗽𝗼𝗿𝘁 σ/μ

Distribution normale (Gaussienne)

Théoriquement : σ peut prendre n'importe quelle valeur par rapport à μ

En pratique : Pour variables naturelles positives avec CV faible → normale tronquée

Distribution exponentielle

Propriété : σ = μ (toujours !)

Modélise durées de vie, temps entre événements

CV = 100% exactement

Distribution log-normale

Propriété : σ > μ typiquement

Variable = exp(Normal)

Asymétrique à droite, queue lourde

CV > 100% fréquent


Modélise revenus, prix d'actifs, tailles de particules

Distribution de Poisson

Propriété : σ = √μ donc σ < μ (si μ > 1)

Pour données de comptage

CV = 1/√μ, diminue avec μ

Distribution binomiale négative

Généralisation de Poisson avec overdispersion

σ > √μ, donc σ peut dépasser μ pour petits μ

Modélise comptages avec forte variabilité

𝗖𝗼𝗺𝗺𝗲𝗻𝘁 𝗿𝗲́𝗮𝗴𝗶𝗿 𝗾𝘂𝗮𝗻𝗱 σ > μ ?

Étape 1 : Vérifier la qualité des données

Y a-t-il des erreurs de saisie ?

Des valeurs aberrantes évidentes ?

Des doublons ?

Étape 2 : Visualiser la distribution

- Histogramme (échelle normale et log)

- Boxplot

- Q-Q plot
- Density plot

Étape 3 : Calculer des statistiques robustes

Médiane : Non affectée par outliers

Quartiles (Q1, Q3) : Décrivent 50% central des données

IQR (Interquartile Range) : Q3 - Q1, mesure de dispersion robuste

MAD (Median Absolute Deviation) : Alternative robuste à l'écart-type

Étape 4 : Identifier les outliers

Méthode de Tukey :

Outliers légers : < Q1 - 1.5×IQR ou > Q3 + 1.5×IQR

Outliers extrêmes : < Q1 - 3×IQR ou > Q3 + 3×IQR

Étape 5 : Décider du traitement

Option A : Conserver les données telles quelles

Si outliers sont réels et pertinents

Utiliser statistiques robustes (médiane, percentiles)

Modèles adaptés (GLM, régression quantile)

Option B : Transformer les données

Transformation logarithmique : log(X)

Transformation racine carrée : √X


Transformation Box-Cox : (X^λ - 1) / λ

Vise à normaliser et réduire asymétrie

Option C : Retirer les outliers

ATTENTION : À faire avec précaution et justification

Documenter combien et pourquoi

Ne retirer que si erreurs de mesure avérées

Option D : Analyse stratifiée

Segmenter en sous-groupes homogènes

Analyser séparément outliers et données principales

𝗘𝘅𝗲𝗺𝗽𝗹𝗲𝘀 𝗰𝗼𝗺𝗽𝗹𝗲𝘁𝘀 𝗮𝘃𝗲𝗰 𝗰𝗼𝗱𝗲

Exemple 1 : Salaires d'entreprise

Données :

n = 100 employés

Moyenne = 3 200 €

Écart-type = 4 500 €

CV = 141% → σ > μ (problématique !)

Analyse :

r# R code

salaires <- c(rep(1800, 60), rep(2500, 25), rep(3800, 10),

8000, 9000, 12000, 15000, 80000)


mean(salaires) # 3200 €

sd(salaires) # 4500 €

median(salaires) # 2200 € (plus représentatif !)

# Percentiles

quantile(salaires, c(0.25, 0.50, 0.75, 0.90, 0.95))

# Q1=1800, Q2=2200, Q3=3000, P90=8500, P95=13500

# Identification outlier

Q1 <- 1800; Q3 <- 3000; IQR <- 1200

outlier_threshold <- Q3 + 1.5*IQR # 4800 €

# 5 salaires > 4800 € sont des outliers (dirigeants)

Interprétation :

Moyenne (3200 €) tirée vers le haut par quelques très hauts salaires

Médiane (2200 €) beaucoup plus représentative du salaire "typique"

75% des employés gagnent < 3000 €

Une poignée de dirigeants gagne > 10 000 €

Communication appropriée :

❌ Mauvais : "Le salaire moyen est de 3 200 €"

✅ Bon : "Le salaire médian est de 2 200 €, avec 50% des employés entre 1 800 € et 3 000 €. Quelques
dirigeants perçoivent des rémunérations nettement supérieures."

Exemple 2 : Temps de réponse serveur

Données :
n = 1000 requêtes

Moyenne = 180 ms

Écart-type = 320 ms

CV = 178% → σ > μ (très problématique !)

Investigation :

python# Python code

import numpy as np

import [Link] as plt

# Génération de données simulées

[Link](42)

normal_requests = [Link](shape=2, scale=60, size=950)

spike_requests = [Link](1000, 3000, size=50)

response_times = [Link]([normal_requests, spike_requests])

print(f"Moyenne: {[Link](response_times):.0f} ms")

print(f"Écart-type: {[Link](response_times):.0f} ms")

print(f"Médiane: {[Link](response_times):.0f} ms")

print(f"P95: {[Link](response_times, 95):.0f} ms")

print(f"P99: {[Link](response_times, 99):.0f} ms")

# Moyenne: 180 ms, Écart-type: 320 ms

# Médiane: 108 ms, P95: 245 ms, P99: 1850 ms

Interprétation :
95% des requêtes < 245 ms (performance acceptable)

5% des requêtes > 245 ms, dont quelques-unes > 1000 ms (pics pathologiques)

Moyenne peu informative, médiane et P95/P99 essentiels

Action :

Identifier causes des pics (base de données, requêtes lourdes)

SLA basé sur P95 ou P99, pas sur la moyenne

Monitorer outliers spécifiquement

𝗖𝗼𝗻𝘀𝗲𝗶𝗹𝘀 𝗽𝗿𝗮𝘁𝗶𝗾𝘂𝗲𝘀 𝗲𝘀𝘀𝗲𝗻𝘁𝗶𝗲𝗹𝘀

✅ Toujours faire

Calculer le CV systématiquement en même temps que moyenne et écart-type

Visualiser les données (histogramme, boxplot) avant toute analyse

Rapporter médiane ET moyenne si CV > 50%

Utiliser percentiles (Q1, Q3, P90, P95) pour décrire distributions asymétriques

Documenter la dispersion dans vos rapports ("forte dispersion, CV = 150%")

⚠️Attention à

Ne pas se fier uniquement à la moyenne si CV > 100%

Ne pas utiliser tests paramétriques sans vérifier normalité quand CV élevé

Ne pas présenter "moyenne ± écart-type" si cela donnerait des valeurs négatives impossibles

Ne pas ignorer les outliers sans investigation


Ne pas comparer dispersions absolues (σ) entre groupes d'échelles différentes

🎯 Règles de décision rapides

CV < 15% : Dispersion faible

→ Moyenne très représentative, données homogènes

15% < CV < 30% : Dispersion modérée

→ Moyenne acceptable, mentionner dispersion

30% < CV < 100% : Dispersion importante

→ Compléter moyenne avec médiane et quartiles

CV > 100% : Dispersion excessive

→ Privilégier médiane, analyser distribution en détail

CV > 200% : Dispersion extrême

→ Éviter la moyenne, transformation ou segmentation nécessaire

𝗖𝗼𝗻𝗰𝗹𝘂𝘀𝗶𝗼𝗻

La comparaison entre moyenne et écart-type est un outil diagnostic puissant mais souvent négligé. Le
coefficient de variation (CV = σ/μ) vous renseigne immédiatement sur :

La représentativité de la moyenne

La nature de la distribution (symétrique, asymétrique)

La présence potentielle d'outliers

Le choix des méthodes statistiques appropriées

La manière de communiquer vos résultats

Messages clés à retenir :

📌 σ < μ (CV < 100%) : Situation classique et saine, moyenne représentative

📌 σ ≈ μ (CV ≈ 100%) : Zone d'attention, vérifier distribution et considérer médiane


📌 σ > μ (CV > 100%) : Signal d'alarme, moyenne peu représentative, privilégier médiane et percentiles

Ne jamais rapporter une moyenne isolée sans son écart-type et son coefficient de variation. Ces trois
chiffres ensemble racontent une histoire complète sur vos données.

𝗘𝗖𝗢𝗦𝗧𝗔𝗧 𝗦𝗖𝗜𝗘𝗡𝗖𝗘 vous accompagne dans l'interprétation de vos statistiques descriptives

✅ Analyse complète de vos distributions (moyenne, médiane, écart-type, CV, percentiles)

✅ Identification et traitement des valeurs aberrantes

✅ Choix des statistiques appropriées selon la nature de vos données

✅ Transformations de données pour normalisation si nécessaire

✅ Visualisations adaptées (histogrammes, boxplots, violin plots)

✅ Interprétation contextuelle de vos indicateurs statistiques

✅ Rédaction méthodologique claire et précise

✅ Formation aux bonnes pratiques statistiques descriptives

✅ Détection d'erreurs dans vos bases de données

Expertise approfondie en : Statistiques descriptives | Analyse de distributions | Coefficient de variation |


Détection d'outliers | Visualisation de données | Transformation de données | Choix de tests
statistiques

Logiciels maîtrisés : STATA | SPSS | R | Python | EViews | JAMOVI | SAS | EXCEL

📧 ecostatscience@[Link]

📘 Ecostat Sciences

Vos données méritent une analyse rigoureuse. Ne laissez pas une moyenne trompeuse fausser vos
conclusions !

#StatistiquesDescriptives #MoyenneEcartType #CoefficientDeVariation #AnalyseDeDonnées #Outliers


#ECOSTATSCIENCE #Médiane #Percentiles #Distribution #DataAnalysis

𝗛𝗲́𝘁𝗲́𝗿𝗼𝘀𝗰𝗲́𝗱𝗮𝘀𝘁𝗶𝗰𝗶𝘁𝗲́ : 𝗗𝗲́𝘁𝗲𝗰𝘁𝗲𝗿 𝗲𝘁 𝗖𝗼𝗿𝗿𝗶𝗴𝗲𝗿


L'hétéroscédasticité est l'un des problèmes les plus fréquents en économétrie, mais aussi l'un des plus
mal compris. Ce problème peut invalider vos tests statistiques et mener à des conclusions erronées.
Voici comment le détecter et le corriger simplement dans STATA.

𝗤𝘂'𝗲𝘀𝘁-𝗰𝗲 𝗾𝘂𝗲 𝗹'𝗵𝗲́𝘁𝗲́𝗿𝗼𝘀𝗰𝗲́𝗱𝗮𝘀𝘁𝗶𝗰𝗶𝘁𝗲́ ?

Définition simple : La variance des erreurs (résidus) n'est pas constante. Elle change selon les valeurs des
variables explicatives.

En termes plus clairs : L'incertitude de votre modèle varie selon le contexte. Par exemple, la variabilité
des salaires peut être plus grande pour les personnes très éduquées que pour celles peu éduquées.

𝗛𝗼𝗺𝗼𝘀𝗰𝗲́𝗱𝗮𝘀𝘁𝗶𝗰𝗶𝘁𝗲́ : 𝗹𝗲 𝗰𝗮𝘀 𝗶𝗱𝗲́𝗮𝗹

Variance des erreurs CONSTANTE à tous les niveaux des variables explicatives. Les résidus sont dispersés
uniformément autour de zéro.

𝗛𝗲́𝘁𝗲́𝗿𝗼𝘀𝗰𝗲́𝗱𝗮𝘀𝘁𝗶𝗰𝗶𝘁𝗲́ : 𝗹𝗲 𝗽𝗿𝗼𝗯𝗹𝗲̀𝗺𝗲

Variance des erreurs VARIABLE. Les résidus s'écartent de plus en plus (ou de moins en moins) à mesure
que X augmente.

Exemple visuel : Un nuage de points en forme d'entonnoir ou de cône au lieu d'une bande horizontale
uniforme.

𝗣𝗼𝘂𝗿𝗾𝘂𝗼𝗶 𝗰'𝗲𝘀𝘁 𝗴𝗿𝗮𝘃𝗲 ?

Conséquences de l'hétéroscédasticité :

Les coefficients restent NON BIAISÉS (bonne nouvelle), mais les ERREURS STANDARD sont biaisées
(mauvaise nouvelle). Par conséquent, les tests t et F deviennent NON FIABLES, les intervalles de
confiance sont INCORRECTS, et vous risquez de conclure à tort qu'un effet est significatif ou non
significatif.

En résumé : Vos estimations des coefficients sont bonnes, mais vous ne pouvez pas faire confiance à vos
tests d'hypothèses.

𝗖𝗮𝘂𝘀𝗲𝘀 𝗰𝗼𝘂𝗿𝗮𝗻𝘁𝗲𝘀

L'hétéroscédasticité apparaît fréquemment dans les données en coupe transversale avec grande
hétérogénéité (revenus, tailles d'entreprises), en cas d'erreurs de mesure variables selon les
observations, lors de processus d'apprentissage ou d'amélioration au fil du temps, en présence de
spécification incorrecte du modèle (variables omises, forme fonctionnelle), avec des valeurs aberrantes,
ou simplement du fait de la nature même des données économiques.

Secteurs particulièrement touchés : Finance, économie du travail (salaires), économie d'entreprise


(profits), données de panel.
𝗗𝗘́𝗧𝗘𝗖𝗧𝗜𝗢𝗡 : 𝗖𝗼𝗺𝗺𝗲𝗻𝘁 𝗿𝗲𝗽𝗲́𝗿𝗲𝗿 𝗹'𝗵𝗲́𝘁𝗲́𝗿𝗼𝘀𝗰𝗲́𝗱𝗮𝘀𝘁𝗶𝗰𝗶𝘁𝗲́ ?

𝗠𝗲́𝘁𝗵𝗼𝗱𝗲 𝟭 : 𝗜𝗻𝘀𝗽𝗲𝗰𝘁𝗶𝗼𝗻 𝘃𝗶𝘀𝘂𝗲𝗹𝗹𝗲

Graphique des résidus :

stata* Après votre régression

regress salaire education experience age

* Générer les résidus et valeurs prédites

predict residus, residuals

predict y_predit

* Graphique résidus vs valeurs prédites

scatter residus y_predit

* Ou résidus vs une variable explicative

scatter residus education

Ce que vous cherchez :

Homoscédasticité : nuage de points horizontal, largeur constante

Hétéroscédasticité : forme d'entonnoir, cône, largeur croissante ou décroissante

Graphique rvfplot (résidus vs fitted) :

stataregress salaire education experience

rvfplot

𝗠𝗲́𝘁𝗵𝗼𝗱𝗲 𝟮 : 𝗧𝗲𝘀𝘁 𝗱𝗲 𝗕𝗿𝗲𝘂𝘀𝗰𝗵-𝗣𝗮𝗴𝗮𝗻

Le test le PLUS utilisé en économétrie.


Commande STATA :

stataregress salaire education experience age

estat hettest

Hypothèses :

H₀ : Homoscédasticité (variance constante)

H₁ : Hétéroscédasticité

Interprétation :

Si p-value < 0.05 : Rejetez H₀, hétéroscédasticité PRÉSENTE

Si p-value > 0.05 : Ne rejetez pas H₀, pas de preuve d'hétéroscédasticité

Exemple de sortie :

Breusch-Pagan / Cook-Weisberg test for heteroskedasticity

Ho: Constant variance

chi2(1) = 23.45

Prob > chi2 = 0.0001

Ici p = 0.0001 < 0.05, donc hétéroscédasticité détectée.

𝗠𝗲́𝘁𝗵𝗼𝗱𝗲 𝟯 : 𝗧𝗲𝘀𝘁 𝗱𝗲 𝗪𝗵𝗶𝘁𝗲

Version plus générale et robuste.

Commande STATA :

stataregress salaire education experience age

estat imtest, white

Avantage : Détecte l'hétéroscédasticité sous des formes plus complexes.


Interprétation identique : p-value < 0.05 indique la présence d'hétéroscédasticité.

𝗠𝗲́𝘁𝗵𝗼𝗱𝗲 𝟰 : 𝗧𝗲𝘀𝘁 𝘀𝗽𝗲́𝗰𝗶𝗳𝗶𝗾𝘂𝗲 𝗽𝗮𝗿 𝘃𝗮𝗿𝗶𝗮𝗯𝗹𝗲

Tester si la variance dépend d'une variable spécifique :

stataregress salaire education experience

estat hettest education

Utile pour identifier quelle variable cause l'hétéroscédasticité.

𝗖𝗢𝗥𝗥𝗘𝗖𝗧𝗜𝗢𝗡 : 𝗤𝘂𝗲 𝗳𝗮𝗶𝗿𝗲 𝗾𝘂𝗮𝗻𝗱 𝗰'𝗲𝘀𝘁 𝗱𝗲́𝘁𝗲𝗰𝘁𝗲́ ?

𝗦𝗼𝗹𝘂𝘁𝗶𝗼𝗻 𝟭 : 𝗘𝗿𝗿𝗲𝘂𝗿𝘀 𝘀𝘁𝗮𝗻𝗱𝗮𝗿𝗱 𝗿𝗼𝗯𝘂𝘀𝘁𝗲𝘀 (𝗥𝗘𝗖𝗢𝗠𝗠𝗔𝗡𝗗𝗘́)

LA solution la plus simple et la plus utilisée.

Commande STATA :

stataregress salaire education experience age, robust

Ou version longue :

stataregress salaire education experience age, vce(robust)

Ce que cette option fait :

Corrige les erreurs standard pour tenir compte de l'hétéroscédasticité

Les coefficients restent identiques

Les tests t et F deviennent fiables

Aucune hypothèse sur la forme de l'hétéroscédasticité

Avantages :

Simple, une seule option à ajouter

Fonctionne toujours (même en absence d'hétéroscédasticité)

Standard académique reconnu


Compatible avec toutes les régressions

Note importante : Les erreurs standard robustes sont maintenant la NORME dans la recherche
économique. Beaucoup d'économistes les utilisent systématiquement.

𝗦𝗼𝗹𝘂𝘁𝗶𝗼𝗻 𝟮 : 𝗠𝗼𝗶𝗻𝗱𝗿𝗲𝘀 𝗖𝗮𝗿𝗿𝗲́𝘀 𝗣𝗼𝗻𝗱𝗲́𝗿𝗲́𝘀 (𝗪𝗟𝗦)

Quand utiliser ? Si vous connaissez la structure de l'hétéroscédasticité.

Principe : Pondérer les observations inversement à leur variance.

Commande STATA (exemple) :

stata* Si variance proportionnelle à X

gen poids = 1/education

regress salaire education experience [aweight=poids]

Avantages : Plus efficace que robust si structure correctement spécifiée

Inconvénients : Nécessite de connaître la forme de l'hétéroscédasticité, risque d'erreur de spécification,


moins utilisé en pratique.

𝗦𝗼𝗹𝘂𝘁𝗶𝗼𝗻 𝟯 : 𝗧𝗿𝗮𝗻𝘀𝗳𝗼𝗿𝗺𝗮𝘁𝗶𝗼𝗻 𝗹𝗼𝗴𝗮𝗿𝗶𝘁𝗵𝗺𝗶𝗾𝘂𝗲

Quand utiliser ? Variables avec grande dispersion (revenus, profits, populations).

Commande STATA :

statagen log_salaire = ln(salaire)

gen log_education = ln(education)

regress log_salaire log_education experience age

estat hettest

Avantages : Réduit souvent l'hétéroscédasticité naturellement, interprétation en élasticités (utile en


économie), stabilise la variance.

Inconvénients : Change l'interprétation du modèle, ne peut pas transformer variables négatives ou


nulles, pas toujours approprié théoriquement.

𝗦𝗼𝗹𝘂𝘁𝗶𝗼𝗻 𝟰 : 𝗠𝗼𝗱𝗶𝗳𝗶𝗲𝗿 𝗹𝗮 𝘀𝗽𝗲́𝗰𝗶𝗳𝗶𝗰𝗮𝘁𝗶𝗼𝗻


L'hétéroscédasticité peut signaler un problème de spécification.

Actions possibles :

Ajouter des variables omises pertinentes

Ajouter des termes quadratiques ou interactions

Retirer des outliers influents

stata* Ajouter terme quadratique

gen education2 = education^2

regress salaire education education2 experience age

estat hettest

𝗦𝗼𝗹𝘂𝘁𝗶𝗼𝗻 𝟱 : 𝗕𝗼𝗼𝘁𝘀𝘁𝗿𝗮𝗽

Méthode de rééchantillonnage pour estimer les erreurs standard.

statabootstrap, reps(1000): regress salaire education experience age

Génère des erreurs standard robustes à l'hétéroscédasticité par simulation.

𝗪𝗢𝗥𝗞𝗙𝗟𝗢𝗪 𝗖𝗢𝗠𝗣𝗟𝗘𝗧 𝗱𝗮𝗻𝘀 𝗦𝗧𝗔𝗧𝗔

Voici la procédure complète à suivre :

stata* 1. Régression standard

regress salaire education experience age

* 2. Stockage des résultats

estimates store ols_standard

* 3. Test d'hétéroscédasticité

estat hettest
* 4. Inspection visuelle

predict residus, residuals

predict y_predit

scatter residus y_predit

rvfplot

* 5. Si hétéroscédasticité détectée : régression robuste

regress salaire education experience age, robust

estimates store ols_robust

* 6. Comparaison des résultats

estimates table ols_standard ols_robust, star stats(N r2)

* 7. Tests supplémentaires

estat hettest

estat imtest, white

* 8. Alternative : transformation log

gen log_salaire = ln(salaire)

regress log_salaire education experience age

estat hettest

𝗤𝗨𝗘𝗟𝗟𝗘 𝗦𝗢𝗟𝗨𝗧𝗜𝗢𝗡 𝗖𝗛𝗢𝗜𝗦𝗜𝗥 ?

Règle générale (par ordre de préférence) :

Premier choix : Erreurs standard robustes - Solution universelle, toujours acceptable


Deuxième choix : Transformation log - Si théoriquement justifié et variables positives

Troisième choix : Modification de spécification - Si évidence de variables omises

Quatrième choix : WLS - Seulement si structure d'hétéroscédasticité bien connue

Recommandation pratique : Utilisez TOUJOURS l'option "robust" dans vos régressions, même si vous ne
détectez pas d'hétéroscédasticité. C'est devenu le standard académique.

𝗘𝗥𝗥𝗘𝗨𝗥𝗦 𝗖𝗟𝗔𝗦𝗦𝗜𝗤𝗨𝗘𝗦

Les erreurs fréquentes incluent : ignorer complètement le problème, penser que les coefficients sont
biaisés (alors que seules les erreurs standard le sont), utiliser WLS sans connaître la structure de
l'hétéroscédasticité, ne faire qu'un test visuel sans test formel, utiliser des transformations
inappropriées, ne pas mentionner le problème dans le mémoire, et confondre hétéroscédasticité avec
autocorrélation.

𝗣𝗥𝗘́𝗦𝗘𝗡𝗧𝗔𝗧𝗜𝗢𝗡 𝗗𝗔𝗡𝗦 𝗩𝗢𝗧𝗥𝗘 𝗠𝗘́𝗠𝗢𝗜𝗥𝗘

Section méthodologie :

"Pour tester la présence d'hétéroscédasticité, nous avons appliqué le test de Breusch-Pagan. La


statistique de test (χ² = 23.45, p = 0.0001) rejette l'hypothèse nulle d'homoscédasticité au seuil de 1%.
Par conséquent, nous utilisons des erreurs standard robustes à l'hétéroscédasticité (estimateur de
White) pour tous nos modèles de régression, garantissant ainsi la validité des tests d'inférence."

Ou si pas d'hétéroscédasticité :

"Le test de Breusch-Pagan (χ² = 2.31, p = 0.128) ne détecte pas d'hétéroscédasticité significative.
Néanmoins, nous utilisons des erreurs standard robustes par précaution, suivant la pratique standard en
économétrie appliquée."

𝗖𝗔𝗦 𝗣𝗔𝗥𝗧𝗜𝗖𝗨𝗟𝗜𝗘𝗥𝗦

𝗗𝗼𝗻𝗻𝗲́𝗲𝘀 𝗱𝗲 𝗽𝗮𝗻𝗲𝗹

Pour les données de panel, utilisez l'option robust avec cluster :

stataxtreg salaire education experience, fe vce(cluster id)

Le clustering corrige à la fois l'hétéroscédasticité et l'autocorrélation intra-groupe.

𝗦𝗲́𝗿𝗶𝗲𝘀 𝘁𝗲𝗺𝗽𝗼𝗿𝗲𝗹𝗹𝗲𝘀

Utilisez Newey-West pour corriger hétéroscédasticité ET autocorrélation :

statanewey salaire education experience, lag(4)


𝗥𝗲́𝗴𝗿𝗲𝘀𝘀𝗶𝗼𝗻 𝗹𝗼𝗴𝗶𝘀𝘁𝗶𝗾𝘂𝗲

statalogit emploi education experience, vce(robust)

L'option robust fonctionne également pour logit, probit et autres modèles non-linéaires.

En résumé : L'hétéroscédasticité est fréquente mais facile à gérer. Détectez-la avec le test de Breusch-
Pagan et un graphique des résidus. Corrigez-la avec l'option "robust" qui devrait être votre réflexe
automatique dans toute régression.

𝗘𝗖𝗢𝗦𝗧𝗔𝗧 𝗦𝗖𝗜𝗘𝗡𝗖𝗘 : 𝗗𝗶𝗮𝗴𝗻𝗼𝘀𝘁𝗶𝗰𝘀 𝗲́𝗰𝗼𝗻𝗼𝗺𝗲́𝘁𝗿𝗶𝗾𝘂𝗲𝘀 𝗰𝗼𝗺𝗽𝗹𝗲𝘁𝘀

Votre modèle présente des problèmes de diagnostic ? ECOSTAT SCIENCE vous accompagne dans la
détection et correction de l'hétéroscédasticité, les tests de multicolinéarité (VIF), la détection
d'autocorrélation, l'analyse de résidus complète, l'identification de valeurs influentes, les tests de
spécification (Ramsey RESET), l'analyse de robustesse, et la validation complète de vos modèles.

Problèmes économétriques traités : Hétéroscédasticité | Autocorrélation | Multicolinéarité |


Endogénéité | Non-normalité | Valeurs aberrantes | Spécification

Logiciels maîtrisés : STATA | R | EViews | Python

Contact : ecostatscience@[Link]

Page Facebook : Ecostat Sciences

𝗗𝗲𝘀 𝗺𝗼𝗱𝗲̀𝗹𝗲𝘀 𝗿𝗼𝗯𝘂𝘀𝘁𝗲𝘀 𝗽𝗼𝘂𝗿 𝗱𝗲𝘀 𝗰𝗼𝗻𝗰𝗹𝘂𝘀𝗶𝗼𝗻𝘀 𝗳𝗶𝗮𝗯𝗹𝗲𝘀

#Hétéroscédasticité #STATA #Économétrie #RégressionLinéaire #DiagnosticÉconométrique


#ErreursStandardRobustes #ECOSTATSCIENCE #TestBreuschPagan #AnalyseStatistique #Mémoire
#Recherchepersonnalisee

Vous aimerez peut-être aussi