𝗠𝗢𝗬𝗘𝗡𝗡𝗘 𝗩𝗦 𝗘́𝗖𝗔𝗥𝗧-𝗧𝗬𝗣𝗘 : 𝗖𝗲 𝗾𝘂𝗲 𝗿𝗲́𝘃𝗲̀𝗹𝗲 𝗹𝗲𝘂𝗿 𝗰𝗼𝗺𝗽𝗮𝗿𝗮𝗶𝘀𝗼𝗻
📊 𝗨𝗻 𝗶𝗻𝗱𝗶𝗰𝗮𝘁𝗲𝘂𝗿 𝘀𝘁𝗮𝘁𝗶𝘀𝘁𝗶𝗾𝘂𝗲 𝗺𝗲́𝗰𝗼𝗻𝗻𝘂 𝗺𝗮𝗶𝘀 𝗽𝘂𝗶𝘀𝘀𝗮𝗻𝘁
La comparaison entre la moyenne et l'écart-type d'une distribution est un indicateur statistique simple
mais extraordinairement révélateur. Le rapport entre ces deux mesures, appelé coefficient de variation
(CV), nous renseigne sur la nature de la dispersion des données, la présence de valeurs extrêmes, et
peut même signaler des problèmes de qualité des données ou des distributions particulières.
Comprendre ce que signifie avoir un écart-type supérieur, égal ou inférieur à la moyenne est essentiel
pour interpréter correctement vos données et éviter des erreurs d'analyse.
𝗥𝗮𝗽𝗽𝗲𝗹𝘀 𝗳𝗼𝗻𝗱𝗮𝗺𝗲𝗻𝘁𝗮𝘂𝘅
La moyenne (μ ou x̄ )
Définition : Somme des valeurs divisée par le nombre d'observations
μ = (Σ xi) / n
Interprétation : Centre de gravité de la distribution, valeur "typique" ou "centrale"
Unité : Même unité que les données (euros, kg, années, etc.)
L'écart-type (σ ou s)
Définition : Racine carrée de la variance, mesure la dispersion autour de la moyenne
σ = √[(Σ (xi - μ)²) / n]
Interprétation : Mesure de la variabilité ou dispersion des données
Unité : Même unité que les données et la moyenne
Le coefficient de variation (CV)
Définition : Rapport de l'écart-type sur la moyenne
CV = (σ / μ) × 100%
Avantage : Sans unité, permet de comparer la dispersion relative entre distributions d'échelles
différentes
𝗟𝗲𝘀 𝘁𝗿𝗼𝗶𝘀 𝘀𝗶𝘁𝘂𝗮𝘁𝗶𝗼𝗻𝘀 𝗽𝗼𝘀𝘀𝗶𝗯𝗹𝗲𝘀
🔷 SITUATION 1 : σ < μ (Écart-type inférieur à la moyenne)
Ce que cela signifie :
Dispersion relative faible à modérée (CV < 100%)
Les données sont relativement homogènes autour de la moyenne
La distribution est concentrée
Peu de valeurs extrêmes
La moyenne est représentative de l'ensemble des données
Coefficient de variation :
CV < 15% : Très faible dispersion (données très homogènes)
15% < CV < 30% : Dispersion modérée (acceptable)
30% < CV < 100% : Dispersion importante mais gérable
Exemples concrets :
Taille humaine adulte :
Moyenne : 170 cm
Écart-type : 10 cm
CV = 5.9% (très faible dispersion)
Interprétation : La plupart des adultes mesurent entre 160 et 180 cm
Salaires dans une entreprise :
Moyenne : 3 500 €
Écart-type : 800 €
CV = 22.9% (dispersion modérée)
Interprétation : Salaires relativement homogènes, hiérarchie salariale modérée
Notes d'examen :
Moyenne : 13/20
Écart-type : 3 points
CV = 23% (dispersion acceptable)
Interprétation : Niveau relativement homogène des étudiants
Température quotidienne en été :
Moyenne : 28°C
Écart-type : 4°C
CV = 14.3% (faible dispersion)
Interprétation : Climat stable, températures prévisibles
Quand s'attendre à σ < μ :
Variables naturellement bornées inférieurement à des valeurs éloignées de zéro
Processus contrôlés ou régulés
Populations homogènes
Variables continues positives avec distribution symétrique ou légèrement asymétrique
Implications pratiques :
✅ La moyenne est un bon indicateur de tendance centrale
✅ Les prévisions basées sur la moyenne sont fiables
✅ Faible risque de valeurs aberrantes
✅ Intervalle de confiance étroit autour de la moyenne
🔶 SITUATION 2 : σ ≈ μ (Écart-type proche de la moyenne)
Ce que cela signifie :
Dispersion relative élevée (CV ≈ 100%)
Les données sont hétérogènes
Variabilité importante par rapport au niveau moyen
La moyenne commence à perdre sa représentativité
Point de transition critique
Coefficient de variation :
CV ≈ 100% : Dispersion égale à la valeur centrale
Zone d'attention particulière
Exemples concrets :
Revenus des ménages (souvent) :
Moyenne : 35 000 €/an
Écart-type : 32 000 €
CV = 91% (forte dispersion)
Interprétation : Grande inégalité de revenus, moyenne peu représentative
Durée d'hospitalisation :
Moyenne : 5 jours
Écart-type : 4.8 jours
CV = 96%
Interprétation : Forte variabilité, cas courts (1-2 jours) et longs (15+ jours)
Temps de réponse serveur web :
Moyenne : 250 ms
Écart-type : 240 ms
CV = 96%
Interprétation : Performances très variables, pics de latence fréquents
Nombre de clients par jour (petit commerce) :
Moyenne : 30 clients
Écart-type : 28 clients
CV = 93%
Interprétation : Forte volatilité, jours très calmes vs très chargés
Quand s'attendre à σ ≈ μ :
Distributions avec asymétrie marquée
Données avec présence de sous-groupes distincts
Processus avec forte variabilité naturelle
Variables économiques avec inégalités
Transition vers des distributions exponentielles
Implications pratiques :
⚠️La moyenne devient moins informative
⚠️Médiane souvent plus appropriée que la moyenne
⚠️Utiliser des visualisations (boxplot, histogramme)
⚠️Considérer des transformations (log)
⚠️Analyser par sous-groupes si possible
🔴 SITUATION 3 : σ > μ (Écart-type supérieur à la moyenne)
Ce que cela signifie :
Dispersion excessive (CV > 100%)
Les données sont extrêmement hétérogènes
Présence probable de valeurs extrêmes ou outliers
La moyenne est peu représentative, voire trompeuse
Distribution fortement asymétrique (skewed)
Possible mélange de populations distinctes
Coefficient de variation :
100% < CV < 200% : Très forte dispersion
CV > 200% : Dispersion extrême, données très problématiques
Exemples concrets :
Patrimoine des ménages :
Moyenne : 150 000 €
Écart-type : 450 000 €
CV = 300% (dispersion extrême !)
Interprétation : Inégalités massives, quelques ultra-riches tirent la moyenne vers le haut. La médiane (50
000 €) est bien plus représentative.
Nombre de followers sur les réseaux sociaux :
Moyenne : 500 followers
Écart-type : 15 000 followers
CV = 3000% (!!!)
Interprétation : Distribution "power law", quelques influenceurs vs masse d'utilisateurs ordinaires
Sinistres en assurance :
Moyenne : 2 000 €
Écart-type : 25 000 €
CV = 1250%
Interprétation : Beaucoup de petits sinistres, quelques sinistres catastrophiques (incendie, etc.)
Temps avant défaillance d'un composant électronique :
Moyenne : 1 000 heures
Écart-type : 1 800 heures
CV = 180%
Interprétation : Distribution exponentielle, mortalité infantile et vieillissement
Nombre de publications scientifiques par chercheur :
Moyenne : 3 publications/an
Écart-type : 8 publications/an
CV = 267%
Interprétation : Quelques "stars" ultra-productives, beaucoup de chercheurs avec peu de publications
Montants de dons caritatifs :
Moyenne : 50 €
Écart-type : 500 €
CV = 1000%
Interprétation : Beaucoup de petits dons (5-20 €), quelques très gros dons (milliers d'euros)
Quand s'attendre à σ > μ :
Distributions exponentielles (durées de vie, temps d'attente)
Distributions log-normales (revenus, tailles de villes, prix d'actifs)
Distributions de Pareto (richesse, citations scientifiques)
Données de comptage avec overdispersion (événements rares)
Présence d'outliers ou valeurs aberrantes
Mélange de plusieurs populations
Données tronquées ou censurées à gauche (près de zéro)
Implications pratiques :
❌ La moyenne est trompeuse et non représentative
❌ Ne pas utiliser la moyenne seule pour communiquer
✅ Privilégier la médiane comme mesure de tendance centrale
✅ Utiliser les percentiles (Q1, Q3, P90, P95) pour décrire la distribution
✅ Transformer les données (log, racine carrée) pour normaliser
✅ Identifier et traiter les outliers
✅ Segmenter l'analyse par sous-groupes homogènes
✅ Utiliser des visualisations appropriées (boxplot, log-scale)
𝗜𝗺𝗽𝗹𝗶𝗰𝗮𝘁𝗶𝗼𝗻𝘀 𝗽𝗼𝘂𝗿 𝗹'𝗮𝗻𝗮𝗹𝘆𝘀𝗲 𝘀𝘁𝗮𝘁𝗶𝘀𝘁𝗶𝗾𝘂𝗲
🔍 Pour les tests d'hypothèses
Si σ < μ (CV faible) :
✅ Tests paramétriques (t-test, ANOVA) généralement appropriés
✅ Hypothèse de normalité souvent raisonnable
✅ Taille d'échantillon modérée suffisante
Si σ ≈ μ (CV ≈ 100%) :
⚠️Vérifier la normalité avec tests (Shapiro-Wilk, Kolmogorov-Smirnov)
⚠️Considérer des tests non-paramétriques si normalité violée
⚠️Augmenter la taille d'échantillon si possible
Si σ > μ (CV > 100%) :
❌ Tests paramétriques probablement inappropriés
✅ Privilégier tests non-paramétriques (Mann-Whitney, Kruskal-Wallis)
✅ Transformer les données (log) avant tests paramétriques
✅ Utiliser bootstrap pour intervalles de confiance robustes
📈 Pour la modélisation
Si σ < μ :
✅ Régression linéaire classique souvent appropriée
✅ Modèles gaussiens pertinents
✅ Prévisions par intervalles de confiance classiques
Si σ ≈ μ :
⚠️Examiner les résidus attentivement
⚠️Considérer transformations ou modèles GLM
⚠️Vérifier l'homoscédasticité
Si σ > μ :
❌ Régression linéaire simple inadaptée
✅ Modèles log-linéaires (log transformation)
✅ Modèles GLM (Gamma, inverse Gaussian)
✅ Modèles de comptage (Poisson, binomiale négative)
✅ Régression quantile pour analyser différentes parties de la distribution
💡 Pour la communication des résultats
Si CV < 30% :
✅ "En moyenne X ± σ" est informatif
✅ Graphique en barres avec barres d'erreur acceptable
✅ La moyenne résume bien les données
Si 30% < CV < 100% :
⚠️Mentionner explicitement la forte dispersion
⚠️Compléter avec médiane et quartiles
⚠️Utiliser boxplots plutôt que barres
Si CV > 100% :
❌ Éviter de présenter seulement "moyenne ± écart-type"
✅ Privilégier : "Médiane [Q1 - Q3]" ou "Médiane [P10 - P90]"
✅ Utiliser graphiques adaptés : boxplot, violin plot, histogramme log-scale
✅ Préciser dans le texte : "Distribution fortement asymétrique, moyenne peu représentative"
𝗖𝗮𝘀 𝗽𝗮𝗿𝘁𝗶𝗰𝘂𝗹𝗶𝗲𝗿𝘀 𝗲𝘁 𝗽𝗶𝗲̀𝗴𝗲𝘀
⚠️Cas 1 : Données strictement positives
Pour des variables ne pouvant être négatives (revenus, prix, durées, distances), un CV > 100% signale
souvent une distribution log-normale plutôt que normale.
Solution : Transformation logarithmique
Y_transformé = log(Y)
Après transformation, CV généralement < 100% et distribution plus symétrique.
⚠️Cas 2 : Présence de zéros
Beaucoup de zéros + quelques valeurs élevées → inflation de zéros
Exemple : Dépenses médicales (beaucoup de personnes : 0 €, quelques-unes : milliers d'€)
Moyenne : 150 €
Écart-type : 800 €
CV = 533%
Solutions :
Modèles "zero-inflated" (Poisson, binomiale négative)
Analyse séparée : probabilité d'avoir dépense non-nulle + montant sachant dépense > 0
Médiane et percentiles conditionnels
⚠️Cas 3 : Valeurs négatives possibles
Si la variable peut être négative (rendements financiers, températures, variations), le CV perd son sens si
la moyenne est proche de zéro ou négative.
Exemple problématique :
Rendements boursiers : Moyenne = 0.5%, Écart-type = 15%
CV = 3000% (n'a pas de sens ici !)
Solutions :
Utiliser directement l'écart-type (volatilité)
Ratio de Sharpe : (Moyenne - Taux sans risque) / Écart-type
Ne pas calculer de CV
⚠️Cas 4 : Échantillon vs population
Le CV échantillonnal peut être biaisé pour petits échantillons.
Correction : Pour n < 30, utiliser coefficient de variation corrigé :
CV_corrigé = CV × (1 + 1/(4n))
⚠️Cas 5 : Comparaison entre groupes
Le CV permet de comparer la dispersion relative entre groupes d'échelles différentes.
Exemple : Comparer variabilité des salaires
Groupe A (cadres) : Moyenne = 5000 €, σ = 1000 €, CV = 20%
Groupe B (employés) : Moyenne = 2000 €, σ = 600 €, CV = 30%
→ Bien que σ(A) > σ(B), la dispersion relative est plus élevée chez les employés.
𝗗𝗶𝘀𝘁𝗿𝗶𝗯𝘂𝘁𝗶𝗼𝗻𝘀 𝘁𝗵𝗲́𝗼𝗿𝗶𝗾𝘂𝗲𝘀 𝗲𝘁 𝗿𝗮𝗽𝗽𝗼𝗿𝘁 σ/μ
Distribution normale (Gaussienne)
Théoriquement : σ peut prendre n'importe quelle valeur par rapport à μ
En pratique : Pour variables naturelles positives avec CV faible → normale tronquée
Distribution exponentielle
Propriété : σ = μ (toujours !)
Modélise durées de vie, temps entre événements
CV = 100% exactement
Distribution log-normale
Propriété : σ > μ typiquement
Variable = exp(Normal)
Asymétrique à droite, queue lourde
CV > 100% fréquent
Modélise revenus, prix d'actifs, tailles de particules
Distribution de Poisson
Propriété : σ = √μ donc σ < μ (si μ > 1)
Pour données de comptage
CV = 1/√μ, diminue avec μ
Distribution binomiale négative
Généralisation de Poisson avec overdispersion
σ > √μ, donc σ peut dépasser μ pour petits μ
Modélise comptages avec forte variabilité
𝗖𝗼𝗺𝗺𝗲𝗻𝘁 𝗿𝗲́𝗮𝗴𝗶𝗿 𝗾𝘂𝗮𝗻𝗱 σ > μ ?
Étape 1 : Vérifier la qualité des données
Y a-t-il des erreurs de saisie ?
Des valeurs aberrantes évidentes ?
Des doublons ?
Étape 2 : Visualiser la distribution
- Histogramme (échelle normale et log)
- Boxplot
- Q-Q plot
- Density plot
Étape 3 : Calculer des statistiques robustes
Médiane : Non affectée par outliers
Quartiles (Q1, Q3) : Décrivent 50% central des données
IQR (Interquartile Range) : Q3 - Q1, mesure de dispersion robuste
MAD (Median Absolute Deviation) : Alternative robuste à l'écart-type
Étape 4 : Identifier les outliers
Méthode de Tukey :
Outliers légers : < Q1 - 1.5×IQR ou > Q3 + 1.5×IQR
Outliers extrêmes : < Q1 - 3×IQR ou > Q3 + 3×IQR
Étape 5 : Décider du traitement
Option A : Conserver les données telles quelles
Si outliers sont réels et pertinents
Utiliser statistiques robustes (médiane, percentiles)
Modèles adaptés (GLM, régression quantile)
Option B : Transformer les données
Transformation logarithmique : log(X)
Transformation racine carrée : √X
Transformation Box-Cox : (X^λ - 1) / λ
Vise à normaliser et réduire asymétrie
Option C : Retirer les outliers
ATTENTION : À faire avec précaution et justification
Documenter combien et pourquoi
Ne retirer que si erreurs de mesure avérées
Option D : Analyse stratifiée
Segmenter en sous-groupes homogènes
Analyser séparément outliers et données principales
𝗘𝘅𝗲𝗺𝗽𝗹𝗲𝘀 𝗰𝗼𝗺𝗽𝗹𝗲𝘁𝘀 𝗮𝘃𝗲𝗰 𝗰𝗼𝗱𝗲
Exemple 1 : Salaires d'entreprise
Données :
n = 100 employés
Moyenne = 3 200 €
Écart-type = 4 500 €
CV = 141% → σ > μ (problématique !)
Analyse :
r# R code
salaires <- c(rep(1800, 60), rep(2500, 25), rep(3800, 10),
8000, 9000, 12000, 15000, 80000)
mean(salaires) # 3200 €
sd(salaires) # 4500 €
median(salaires) # 2200 € (plus représentatif !)
# Percentiles
quantile(salaires, c(0.25, 0.50, 0.75, 0.90, 0.95))
# Q1=1800, Q2=2200, Q3=3000, P90=8500, P95=13500
# Identification outlier
Q1 <- 1800; Q3 <- 3000; IQR <- 1200
outlier_threshold <- Q3 + 1.5*IQR # 4800 €
# 5 salaires > 4800 € sont des outliers (dirigeants)
Interprétation :
Moyenne (3200 €) tirée vers le haut par quelques très hauts salaires
Médiane (2200 €) beaucoup plus représentative du salaire "typique"
75% des employés gagnent < 3000 €
Une poignée de dirigeants gagne > 10 000 €
Communication appropriée :
❌ Mauvais : "Le salaire moyen est de 3 200 €"
✅ Bon : "Le salaire médian est de 2 200 €, avec 50% des employés entre 1 800 € et 3 000 €. Quelques
dirigeants perçoivent des rémunérations nettement supérieures."
Exemple 2 : Temps de réponse serveur
Données :
n = 1000 requêtes
Moyenne = 180 ms
Écart-type = 320 ms
CV = 178% → σ > μ (très problématique !)
Investigation :
python# Python code
import numpy as np
import [Link] as plt
# Génération de données simulées
[Link](42)
normal_requests = [Link](shape=2, scale=60, size=950)
spike_requests = [Link](1000, 3000, size=50)
response_times = [Link]([normal_requests, spike_requests])
print(f"Moyenne: {[Link](response_times):.0f} ms")
print(f"Écart-type: {[Link](response_times):.0f} ms")
print(f"Médiane: {[Link](response_times):.0f} ms")
print(f"P95: {[Link](response_times, 95):.0f} ms")
print(f"P99: {[Link](response_times, 99):.0f} ms")
# Moyenne: 180 ms, Écart-type: 320 ms
# Médiane: 108 ms, P95: 245 ms, P99: 1850 ms
Interprétation :
95% des requêtes < 245 ms (performance acceptable)
5% des requêtes > 245 ms, dont quelques-unes > 1000 ms (pics pathologiques)
Moyenne peu informative, médiane et P95/P99 essentiels
Action :
Identifier causes des pics (base de données, requêtes lourdes)
SLA basé sur P95 ou P99, pas sur la moyenne
Monitorer outliers spécifiquement
𝗖𝗼𝗻𝘀𝗲𝗶𝗹𝘀 𝗽𝗿𝗮𝘁𝗶𝗾𝘂𝗲𝘀 𝗲𝘀𝘀𝗲𝗻𝘁𝗶𝗲𝗹𝘀
✅ Toujours faire
Calculer le CV systématiquement en même temps que moyenne et écart-type
Visualiser les données (histogramme, boxplot) avant toute analyse
Rapporter médiane ET moyenne si CV > 50%
Utiliser percentiles (Q1, Q3, P90, P95) pour décrire distributions asymétriques
Documenter la dispersion dans vos rapports ("forte dispersion, CV = 150%")
⚠️Attention à
Ne pas se fier uniquement à la moyenne si CV > 100%
Ne pas utiliser tests paramétriques sans vérifier normalité quand CV élevé
Ne pas présenter "moyenne ± écart-type" si cela donnerait des valeurs négatives impossibles
Ne pas ignorer les outliers sans investigation
Ne pas comparer dispersions absolues (σ) entre groupes d'échelles différentes
🎯 Règles de décision rapides
CV < 15% : Dispersion faible
→ Moyenne très représentative, données homogènes
15% < CV < 30% : Dispersion modérée
→ Moyenne acceptable, mentionner dispersion
30% < CV < 100% : Dispersion importante
→ Compléter moyenne avec médiane et quartiles
CV > 100% : Dispersion excessive
→ Privilégier médiane, analyser distribution en détail
CV > 200% : Dispersion extrême
→ Éviter la moyenne, transformation ou segmentation nécessaire
𝗖𝗼𝗻𝗰𝗹𝘂𝘀𝗶𝗼𝗻
La comparaison entre moyenne et écart-type est un outil diagnostic puissant mais souvent négligé. Le
coefficient de variation (CV = σ/μ) vous renseigne immédiatement sur :
La représentativité de la moyenne
La nature de la distribution (symétrique, asymétrique)
La présence potentielle d'outliers
Le choix des méthodes statistiques appropriées
La manière de communiquer vos résultats
Messages clés à retenir :
📌 σ < μ (CV < 100%) : Situation classique et saine, moyenne représentative
📌 σ ≈ μ (CV ≈ 100%) : Zone d'attention, vérifier distribution et considérer médiane
📌 σ > μ (CV > 100%) : Signal d'alarme, moyenne peu représentative, privilégier médiane et percentiles
Ne jamais rapporter une moyenne isolée sans son écart-type et son coefficient de variation. Ces trois
chiffres ensemble racontent une histoire complète sur vos données.
𝗘𝗖𝗢𝗦𝗧𝗔𝗧 𝗦𝗖𝗜𝗘𝗡𝗖𝗘 vous accompagne dans l'interprétation de vos statistiques descriptives
✅ Analyse complète de vos distributions (moyenne, médiane, écart-type, CV, percentiles)
✅ Identification et traitement des valeurs aberrantes
✅ Choix des statistiques appropriées selon la nature de vos données
✅ Transformations de données pour normalisation si nécessaire
✅ Visualisations adaptées (histogrammes, boxplots, violin plots)
✅ Interprétation contextuelle de vos indicateurs statistiques
✅ Rédaction méthodologique claire et précise
✅ Formation aux bonnes pratiques statistiques descriptives
✅ Détection d'erreurs dans vos bases de données
Expertise approfondie en : Statistiques descriptives | Analyse de distributions | Coefficient de variation |
Détection d'outliers | Visualisation de données | Transformation de données | Choix de tests
statistiques
Logiciels maîtrisés : STATA | SPSS | R | Python | EViews | JAMOVI | SAS | EXCEL
📧 ecostatscience@[Link]
📘 Ecostat Sciences
Vos données méritent une analyse rigoureuse. Ne laissez pas une moyenne trompeuse fausser vos
conclusions !
#StatistiquesDescriptives #MoyenneEcartType #CoefficientDeVariation #AnalyseDeDonnées #Outliers
#ECOSTATSCIENCE #Médiane #Percentiles #Distribution #DataAnalysis
𝗛𝗲́𝘁𝗲́𝗿𝗼𝘀𝗰𝗲́𝗱𝗮𝘀𝘁𝗶𝗰𝗶𝘁𝗲́ : 𝗗𝗲́𝘁𝗲𝗰𝘁𝗲𝗿 𝗲𝘁 𝗖𝗼𝗿𝗿𝗶𝗴𝗲𝗿
L'hétéroscédasticité est l'un des problèmes les plus fréquents en économétrie, mais aussi l'un des plus
mal compris. Ce problème peut invalider vos tests statistiques et mener à des conclusions erronées.
Voici comment le détecter et le corriger simplement dans STATA.
𝗤𝘂'𝗲𝘀𝘁-𝗰𝗲 𝗾𝘂𝗲 𝗹'𝗵𝗲́𝘁𝗲́𝗿𝗼𝘀𝗰𝗲́𝗱𝗮𝘀𝘁𝗶𝗰𝗶𝘁𝗲́ ?
Définition simple : La variance des erreurs (résidus) n'est pas constante. Elle change selon les valeurs des
variables explicatives.
En termes plus clairs : L'incertitude de votre modèle varie selon le contexte. Par exemple, la variabilité
des salaires peut être plus grande pour les personnes très éduquées que pour celles peu éduquées.
𝗛𝗼𝗺𝗼𝘀𝗰𝗲́𝗱𝗮𝘀𝘁𝗶𝗰𝗶𝘁𝗲́ : 𝗹𝗲 𝗰𝗮𝘀 𝗶𝗱𝗲́𝗮𝗹
Variance des erreurs CONSTANTE à tous les niveaux des variables explicatives. Les résidus sont dispersés
uniformément autour de zéro.
𝗛𝗲́𝘁𝗲́𝗿𝗼𝘀𝗰𝗲́𝗱𝗮𝘀𝘁𝗶𝗰𝗶𝘁𝗲́ : 𝗹𝗲 𝗽𝗿𝗼𝗯𝗹𝗲̀𝗺𝗲
Variance des erreurs VARIABLE. Les résidus s'écartent de plus en plus (ou de moins en moins) à mesure
que X augmente.
Exemple visuel : Un nuage de points en forme d'entonnoir ou de cône au lieu d'une bande horizontale
uniforme.
𝗣𝗼𝘂𝗿𝗾𝘂𝗼𝗶 𝗰'𝗲𝘀𝘁 𝗴𝗿𝗮𝘃𝗲 ?
Conséquences de l'hétéroscédasticité :
Les coefficients restent NON BIAISÉS (bonne nouvelle), mais les ERREURS STANDARD sont biaisées
(mauvaise nouvelle). Par conséquent, les tests t et F deviennent NON FIABLES, les intervalles de
confiance sont INCORRECTS, et vous risquez de conclure à tort qu'un effet est significatif ou non
significatif.
En résumé : Vos estimations des coefficients sont bonnes, mais vous ne pouvez pas faire confiance à vos
tests d'hypothèses.
𝗖𝗮𝘂𝘀𝗲𝘀 𝗰𝗼𝘂𝗿𝗮𝗻𝘁𝗲𝘀
L'hétéroscédasticité apparaît fréquemment dans les données en coupe transversale avec grande
hétérogénéité (revenus, tailles d'entreprises), en cas d'erreurs de mesure variables selon les
observations, lors de processus d'apprentissage ou d'amélioration au fil du temps, en présence de
spécification incorrecte du modèle (variables omises, forme fonctionnelle), avec des valeurs aberrantes,
ou simplement du fait de la nature même des données économiques.
Secteurs particulièrement touchés : Finance, économie du travail (salaires), économie d'entreprise
(profits), données de panel.
𝗗𝗘́𝗧𝗘𝗖𝗧𝗜𝗢𝗡 : 𝗖𝗼𝗺𝗺𝗲𝗻𝘁 𝗿𝗲𝗽𝗲́𝗿𝗲𝗿 𝗹'𝗵𝗲́𝘁𝗲́𝗿𝗼𝘀𝗰𝗲́𝗱𝗮𝘀𝘁𝗶𝗰𝗶𝘁𝗲́ ?
𝗠𝗲́𝘁𝗵𝗼𝗱𝗲 𝟭 : 𝗜𝗻𝘀𝗽𝗲𝗰𝘁𝗶𝗼𝗻 𝘃𝗶𝘀𝘂𝗲𝗹𝗹𝗲
Graphique des résidus :
stata* Après votre régression
regress salaire education experience age
* Générer les résidus et valeurs prédites
predict residus, residuals
predict y_predit
* Graphique résidus vs valeurs prédites
scatter residus y_predit
* Ou résidus vs une variable explicative
scatter residus education
Ce que vous cherchez :
Homoscédasticité : nuage de points horizontal, largeur constante
Hétéroscédasticité : forme d'entonnoir, cône, largeur croissante ou décroissante
Graphique rvfplot (résidus vs fitted) :
stataregress salaire education experience
rvfplot
𝗠𝗲́𝘁𝗵𝗼𝗱𝗲 𝟮 : 𝗧𝗲𝘀𝘁 𝗱𝗲 𝗕𝗿𝗲𝘂𝘀𝗰𝗵-𝗣𝗮𝗴𝗮𝗻
Le test le PLUS utilisé en économétrie.
Commande STATA :
stataregress salaire education experience age
estat hettest
Hypothèses :
H₀ : Homoscédasticité (variance constante)
H₁ : Hétéroscédasticité
Interprétation :
Si p-value < 0.05 : Rejetez H₀, hétéroscédasticité PRÉSENTE
Si p-value > 0.05 : Ne rejetez pas H₀, pas de preuve d'hétéroscédasticité
Exemple de sortie :
Breusch-Pagan / Cook-Weisberg test for heteroskedasticity
Ho: Constant variance
chi2(1) = 23.45
Prob > chi2 = 0.0001
Ici p = 0.0001 < 0.05, donc hétéroscédasticité détectée.
𝗠𝗲́𝘁𝗵𝗼𝗱𝗲 𝟯 : 𝗧𝗲𝘀𝘁 𝗱𝗲 𝗪𝗵𝗶𝘁𝗲
Version plus générale et robuste.
Commande STATA :
stataregress salaire education experience age
estat imtest, white
Avantage : Détecte l'hétéroscédasticité sous des formes plus complexes.
Interprétation identique : p-value < 0.05 indique la présence d'hétéroscédasticité.
𝗠𝗲́𝘁𝗵𝗼𝗱𝗲 𝟰 : 𝗧𝗲𝘀𝘁 𝘀𝗽𝗲́𝗰𝗶𝗳𝗶𝗾𝘂𝗲 𝗽𝗮𝗿 𝘃𝗮𝗿𝗶𝗮𝗯𝗹𝗲
Tester si la variance dépend d'une variable spécifique :
stataregress salaire education experience
estat hettest education
Utile pour identifier quelle variable cause l'hétéroscédasticité.
𝗖𝗢𝗥𝗥𝗘𝗖𝗧𝗜𝗢𝗡 : 𝗤𝘂𝗲 𝗳𝗮𝗶𝗿𝗲 𝗾𝘂𝗮𝗻𝗱 𝗰'𝗲𝘀𝘁 𝗱𝗲́𝘁𝗲𝗰𝘁𝗲́ ?
𝗦𝗼𝗹𝘂𝘁𝗶𝗼𝗻 𝟭 : 𝗘𝗿𝗿𝗲𝘂𝗿𝘀 𝘀𝘁𝗮𝗻𝗱𝗮𝗿𝗱 𝗿𝗼𝗯𝘂𝘀𝘁𝗲𝘀 (𝗥𝗘𝗖𝗢𝗠𝗠𝗔𝗡𝗗𝗘́)
LA solution la plus simple et la plus utilisée.
Commande STATA :
stataregress salaire education experience age, robust
Ou version longue :
stataregress salaire education experience age, vce(robust)
Ce que cette option fait :
Corrige les erreurs standard pour tenir compte de l'hétéroscédasticité
Les coefficients restent identiques
Les tests t et F deviennent fiables
Aucune hypothèse sur la forme de l'hétéroscédasticité
Avantages :
Simple, une seule option à ajouter
Fonctionne toujours (même en absence d'hétéroscédasticité)
Standard académique reconnu
Compatible avec toutes les régressions
Note importante : Les erreurs standard robustes sont maintenant la NORME dans la recherche
économique. Beaucoup d'économistes les utilisent systématiquement.
𝗦𝗼𝗹𝘂𝘁𝗶𝗼𝗻 𝟮 : 𝗠𝗼𝗶𝗻𝗱𝗿𝗲𝘀 𝗖𝗮𝗿𝗿𝗲́𝘀 𝗣𝗼𝗻𝗱𝗲́𝗿𝗲́𝘀 (𝗪𝗟𝗦)
Quand utiliser ? Si vous connaissez la structure de l'hétéroscédasticité.
Principe : Pondérer les observations inversement à leur variance.
Commande STATA (exemple) :
stata* Si variance proportionnelle à X
gen poids = 1/education
regress salaire education experience [aweight=poids]
Avantages : Plus efficace que robust si structure correctement spécifiée
Inconvénients : Nécessite de connaître la forme de l'hétéroscédasticité, risque d'erreur de spécification,
moins utilisé en pratique.
𝗦𝗼𝗹𝘂𝘁𝗶𝗼𝗻 𝟯 : 𝗧𝗿𝗮𝗻𝘀𝗳𝗼𝗿𝗺𝗮𝘁𝗶𝗼𝗻 𝗹𝗼𝗴𝗮𝗿𝗶𝘁𝗵𝗺𝗶𝗾𝘂𝗲
Quand utiliser ? Variables avec grande dispersion (revenus, profits, populations).
Commande STATA :
statagen log_salaire = ln(salaire)
gen log_education = ln(education)
regress log_salaire log_education experience age
estat hettest
Avantages : Réduit souvent l'hétéroscédasticité naturellement, interprétation en élasticités (utile en
économie), stabilise la variance.
Inconvénients : Change l'interprétation du modèle, ne peut pas transformer variables négatives ou
nulles, pas toujours approprié théoriquement.
𝗦𝗼𝗹𝘂𝘁𝗶𝗼𝗻 𝟰 : 𝗠𝗼𝗱𝗶𝗳𝗶𝗲𝗿 𝗹𝗮 𝘀𝗽𝗲́𝗰𝗶𝗳𝗶𝗰𝗮𝘁𝗶𝗼𝗻
L'hétéroscédasticité peut signaler un problème de spécification.
Actions possibles :
Ajouter des variables omises pertinentes
Ajouter des termes quadratiques ou interactions
Retirer des outliers influents
stata* Ajouter terme quadratique
gen education2 = education^2
regress salaire education education2 experience age
estat hettest
𝗦𝗼𝗹𝘂𝘁𝗶𝗼𝗻 𝟱 : 𝗕𝗼𝗼𝘁𝘀𝘁𝗿𝗮𝗽
Méthode de rééchantillonnage pour estimer les erreurs standard.
statabootstrap, reps(1000): regress salaire education experience age
Génère des erreurs standard robustes à l'hétéroscédasticité par simulation.
𝗪𝗢𝗥𝗞𝗙𝗟𝗢𝗪 𝗖𝗢𝗠𝗣𝗟𝗘𝗧 𝗱𝗮𝗻𝘀 𝗦𝗧𝗔𝗧𝗔
Voici la procédure complète à suivre :
stata* 1. Régression standard
regress salaire education experience age
* 2. Stockage des résultats
estimates store ols_standard
* 3. Test d'hétéroscédasticité
estat hettest
* 4. Inspection visuelle
predict residus, residuals
predict y_predit
scatter residus y_predit
rvfplot
* 5. Si hétéroscédasticité détectée : régression robuste
regress salaire education experience age, robust
estimates store ols_robust
* 6. Comparaison des résultats
estimates table ols_standard ols_robust, star stats(N r2)
* 7. Tests supplémentaires
estat hettest
estat imtest, white
* 8. Alternative : transformation log
gen log_salaire = ln(salaire)
regress log_salaire education experience age
estat hettest
𝗤𝗨𝗘𝗟𝗟𝗘 𝗦𝗢𝗟𝗨𝗧𝗜𝗢𝗡 𝗖𝗛𝗢𝗜𝗦𝗜𝗥 ?
Règle générale (par ordre de préférence) :
Premier choix : Erreurs standard robustes - Solution universelle, toujours acceptable
Deuxième choix : Transformation log - Si théoriquement justifié et variables positives
Troisième choix : Modification de spécification - Si évidence de variables omises
Quatrième choix : WLS - Seulement si structure d'hétéroscédasticité bien connue
Recommandation pratique : Utilisez TOUJOURS l'option "robust" dans vos régressions, même si vous ne
détectez pas d'hétéroscédasticité. C'est devenu le standard académique.
𝗘𝗥𝗥𝗘𝗨𝗥𝗦 𝗖𝗟𝗔𝗦𝗦𝗜𝗤𝗨𝗘𝗦
Les erreurs fréquentes incluent : ignorer complètement le problème, penser que les coefficients sont
biaisés (alors que seules les erreurs standard le sont), utiliser WLS sans connaître la structure de
l'hétéroscédasticité, ne faire qu'un test visuel sans test formel, utiliser des transformations
inappropriées, ne pas mentionner le problème dans le mémoire, et confondre hétéroscédasticité avec
autocorrélation.
𝗣𝗥𝗘́𝗦𝗘𝗡𝗧𝗔𝗧𝗜𝗢𝗡 𝗗𝗔𝗡𝗦 𝗩𝗢𝗧𝗥𝗘 𝗠𝗘́𝗠𝗢𝗜𝗥𝗘
Section méthodologie :
"Pour tester la présence d'hétéroscédasticité, nous avons appliqué le test de Breusch-Pagan. La
statistique de test (χ² = 23.45, p = 0.0001) rejette l'hypothèse nulle d'homoscédasticité au seuil de 1%.
Par conséquent, nous utilisons des erreurs standard robustes à l'hétéroscédasticité (estimateur de
White) pour tous nos modèles de régression, garantissant ainsi la validité des tests d'inférence."
Ou si pas d'hétéroscédasticité :
"Le test de Breusch-Pagan (χ² = 2.31, p = 0.128) ne détecte pas d'hétéroscédasticité significative.
Néanmoins, nous utilisons des erreurs standard robustes par précaution, suivant la pratique standard en
économétrie appliquée."
𝗖𝗔𝗦 𝗣𝗔𝗥𝗧𝗜𝗖𝗨𝗟𝗜𝗘𝗥𝗦
𝗗𝗼𝗻𝗻𝗲́𝗲𝘀 𝗱𝗲 𝗽𝗮𝗻𝗲𝗹
Pour les données de panel, utilisez l'option robust avec cluster :
stataxtreg salaire education experience, fe vce(cluster id)
Le clustering corrige à la fois l'hétéroscédasticité et l'autocorrélation intra-groupe.
𝗦𝗲́𝗿𝗶𝗲𝘀 𝘁𝗲𝗺𝗽𝗼𝗿𝗲𝗹𝗹𝗲𝘀
Utilisez Newey-West pour corriger hétéroscédasticité ET autocorrélation :
statanewey salaire education experience, lag(4)
𝗥𝗲́𝗴𝗿𝗲𝘀𝘀𝗶𝗼𝗻 𝗹𝗼𝗴𝗶𝘀𝘁𝗶𝗾𝘂𝗲
statalogit emploi education experience, vce(robust)
L'option robust fonctionne également pour logit, probit et autres modèles non-linéaires.
En résumé : L'hétéroscédasticité est fréquente mais facile à gérer. Détectez-la avec le test de Breusch-
Pagan et un graphique des résidus. Corrigez-la avec l'option "robust" qui devrait être votre réflexe
automatique dans toute régression.
𝗘𝗖𝗢𝗦𝗧𝗔𝗧 𝗦𝗖𝗜𝗘𝗡𝗖𝗘 : 𝗗𝗶𝗮𝗴𝗻𝗼𝘀𝘁𝗶𝗰𝘀 𝗲́𝗰𝗼𝗻𝗼𝗺𝗲́𝘁𝗿𝗶𝗾𝘂𝗲𝘀 𝗰𝗼𝗺𝗽𝗹𝗲𝘁𝘀
Votre modèle présente des problèmes de diagnostic ? ECOSTAT SCIENCE vous accompagne dans la
détection et correction de l'hétéroscédasticité, les tests de multicolinéarité (VIF), la détection
d'autocorrélation, l'analyse de résidus complète, l'identification de valeurs influentes, les tests de
spécification (Ramsey RESET), l'analyse de robustesse, et la validation complète de vos modèles.
Problèmes économétriques traités : Hétéroscédasticité | Autocorrélation | Multicolinéarité |
Endogénéité | Non-normalité | Valeurs aberrantes | Spécification
Logiciels maîtrisés : STATA | R | EViews | Python
Contact : ecostatscience@[Link]
Page Facebook : Ecostat Sciences
𝗗𝗲𝘀 𝗺𝗼𝗱𝗲̀𝗹𝗲𝘀 𝗿𝗼𝗯𝘂𝘀𝘁𝗲𝘀 𝗽𝗼𝘂𝗿 𝗱𝗲𝘀 𝗰𝗼𝗻𝗰𝗹𝘂𝘀𝗶𝗼𝗻𝘀 𝗳𝗶𝗮𝗯𝗹𝗲𝘀
#Hétéroscédasticité #STATA #Économétrie #RégressionLinéaire #DiagnosticÉconométrique
#ErreursStandardRobustes #ECOSTATSCIENCE #TestBreuschPagan #AnalyseStatistique #Mémoire
#Recherchepersonnalisee