Mathématiques pour l’ingénieur I
GEMI
Ibrahim BOUZALMAT
Faculté des Sciences et Techniques Tanger, Maroc
Chapitre 2 : Statistique Descriptive
November 12, 2025 1 / 48
Introduction
Statistique Descriptive
Du chaos des données à l’information utile
Le pont entre Probabilités et Statistiques
En probabilités, nous avons étudié des modèles théoriques
(lois de probabilité). En statistiques, nous partons de don-
nées réelles, brutes, souvent massives et chaotiques.
November 12, 2025 2 / 48
Introduction
Statistique Descriptive
Du chaos des données à l’information utile
Le pont entre Probabilités et Statistiques
En probabilités, nous avons étudié des modèles théoriques
(lois de probabilité). En statistiques, nous partons de don-
nées réelles, brutes, souvent massives et chaotiques.
⇒ L’objectif de la statistique descriptive est de résumer et de
structurer ces données pour en extraire une information claire,
pertinente et facilement communicable.
November 12, 2025 2 / 48
Introduction
Les Concepts Fondamentaux de la Statistique
De qui parle-t-on et que mesure-t-on ?
1. Population et Échantillon
I La Population (P) : C’est l’ensemble complet de tous les
individus (ou objets) que l’on souhaite étudier.
I Exemples : L’ensemble de tous les pistons produits par l’usine,
tous les étudiants ingénieurs du Maroc, toutes les requêtes
reçues par un serveur.
November 12, 2025 3 / 48
Introduction
Les Concepts Fondamentaux de la Statistique
De qui parle-t-on et que mesure-t-on ?
1. Population et Échantillon
I La Population (P) : C’est l’ensemble complet de tous les
individus (ou objets) que l’on souhaite étudier.
I Exemples : L’ensemble de tous les pistons produits par l’usine,
tous les étudiants ingénieurs du Maroc, toutes les requêtes
reçues par un serveur.
I L’Échantillon (E ) : C’est un sous-ensemble de la
population, que l’on observe en pratique car il est souvent
impossible ou trop coûteux d’étudier la population entière.
I Exemples : Un lot de 200 pistons prélevés pour le contrôle, les
500 étudiants interrogés pour un sondage.
November 12, 2025 3 / 48
Introduction
Les Concepts Fondamentaux de la Statistique
De qui parle-t-on et que mesure-t-on ?
1. Population et Échantillon
I La Population (P) : C’est l’ensemble complet de tous les
individus (ou objets) que l’on souhaite étudier.
I Exemples : L’ensemble de tous les pistons produits par l’usine,
tous les étudiants ingénieurs du Maroc, toutes les requêtes
reçues par un serveur.
I L’Échantillon (E ) : C’est un sous-ensemble de la
population, que l’on observe en pratique car il est souvent
impossible ou trop coûteux d’étudier la population entière.
I Exemples : Un lot de 200 pistons prélevés pour le contrôle, les
500 étudiants interrogés pour un sondage.
L’objectif de l’ingénieur
Utiliser les informations mesurées sur l’échantillon pour en
déduire des conclusions fiables sur la population entière.
C’est le principe de l’inférence statistique.
November 12, 2025 3 / 48
Introduction
Les Concepts Fondamentaux de la Statistique
De qui parle-t-on et que mesure-t-on ?
2. Individu et Variable
I L’Individu : C’est l’élément de base de la population (un
piston, un étudiant, une requête).
I La Variable Statistique : C’est la caractéristique que l’on
mesure ou que l’on observe sur chaque individu. Une variable
(ou caractère) peut être quantitative ou qualitative.
November 12, 2025 4 / 48
Introduction
Les Concepts Fondamentaux de la Statistique
De qui parle-t-on et que mesure-t-on ?
2. Individu et Variable
I L’Individu : C’est l’élément de base de la population (un
piston, un étudiant, une requête).
I La Variable Statistique : C’est la caractéristique que l’on
mesure ou que l’on observe sur chaque individu. Une variable
(ou caractère) peut être quantitative ou qualitative.
Exemples :
Le diamètre du piston, la note en mathématiques de l’étudiant, le
temps de réponse de la requête.
November 12, 2025 4 / 48
Introduction
Typologie des Variables Statistiques
November 12, 2025 5 / 48
Introduction
Typologie des Variables Statistiques
On distingue deux catégories de v.a. :
I Qualitatives: Variable portant sur des grandeurs non numériques
⇒ Nominales : v.a. correspond à des noms sans ordre précis.
⇒ Ordinales : v.a. possédant un ordre.
I Quantitatives : Variable portant sur des grandeurs numériques
⇒ Discrètes : v.a. dont les valeurs sont énumérables.
⇒ Continues : v.a. dont les valeurs sont tellement nombreuses
qu’elles en deviennent non-énumérables.
November 12, 2025 5 / 48
Introduction
Typologie des Variables Statistiques
Pourquoi cette distinction est-elle fondamentale ?
Pourquoi cette distinction est-elle fondamentale ?
Le type de variable détermine :
I Le type de graphique que l’on peut utiliser pour la
visualiser.
I Le type d’indicateur numérique (moyenne, médiane,
etc.) qui a un sens.
Exemple :
Calculer la "moyenne" des couleurs d’une voiture n’a aucun sens !
November 12, 2025 6 / 48
Introduction
Représentations Graphiques Univariées
Un bon dessin vaut mieux qu’un long discours
Pour les variables
QUALITATIVES
I Diagramme en barres (ou
en bâtons) :
Représente les effectifs ou
fréquences de chaque
modalité.
November 12, 2025 7 / 48
Introduction
Représentations Graphiques Univariées
Un bon dessin vaut mieux qu’un long discours
Pour les variables
QUALITATIVES
I Diagramme en barres (ou
en bâtons) :
Représente les effectifs ou
fréquences de chaque
modalité.
I Diagramme circulaire
(camembert) :
Représente la part de chaque
modalité dans le total. (À
utiliser avec prudence, peu
lisible si > 5 catégories).
November 12, 2025 7 / 48
Introduction
Représentations Graphiques Univariées
Un bon dessin vaut mieux qu’un long discours
Pour les variables Pour les variables
QUALITATIVES QUANTITATIVES
I Diagramme en barres (ou I Histogramme (pour les
en bâtons) : continues) :
Représente les effectifs ou Représente les effectifs dans
fréquences de chaque des classes (intervalles).
modalité. L’aire des rectangles est
I Diagramme circulaire proportionnelle à l’effectif.
(camembert) :
Représente la part de chaque
modalité dans le total. (À
utiliser avec prudence, peu
lisible si > 5 catégories).
November 12, 2025 7 / 48
Introduction
Représentations Graphiques Univariées
Un bon dessin vaut mieux qu’un long discours
Pour les variables Pour les variables
QUALITATIVES QUANTITATIVES
I Diagramme en barres (ou I Histogramme (pour les
en bâtons) : continues) :
Représente les effectifs ou Représente les effectifs dans
fréquences de chaque des classes (intervalles).
modalité. L’aire des rectangles est
I Diagramme circulaire proportionnelle à l’effectif.
(camembert) : I Diagramme en boîte
Représente la part de chaque (Boxplot) :
modalité dans le total. (À Résume la distribution à
utiliser avec prudence, peu l’aide de la médiane, des
lisible si > 5 catégories). quartiles et des valeurs
extrêmes. Très efficace pour
les comparaisons.
November 12, 2025 7 / 48
Introduction
Représentations Graphiques Univariées
Un bon dessin vaut mieux qu’un long discours
Pour les variables QUALITATIVES
November 12, 2025 8 / 48
Introduction
Représentations Graphiques Univariées
Un bon dessin vaut mieux qu’un long discours
Pour les variables QUALITATIVES
Pour les variables QUANTITATIVES
November 12, 2025 8 / 48
Introduction
Représentations Graphiques Univariées
Un bon dessin vaut mieux qu’un long discours
Histogramme vs. Diagramme en barres
Ne les confondez jamais !
I Barres : Pour les variables qualitatives ou quantitatives
discrètes. Les barres sont séparées. L’axe des abscisses
n’a pas de continuité.
Introduction
Représentations Graphiques Univariées
Un bon dessin vaut mieux qu’un long discours
Histogramme vs. Diagramme en barres
Ne les confondez jamais !
I Barres : Pour les variables qualitatives ou quantitatives
discrètes. Les barres sont séparées. L’axe des abscisses
n’a pas de continuité.
I Histogramme : Pour les variables quantitatives
continues. Les barres sont collées (sauf si une classe
est vide). L’axe des abscisses est un axe numérique
continu.
November 12, 2025 9 / 48
Introduction
Statistique Descriptive
Les quatre grandes questions que l’on se pose face à un jeu de
données :
I Tendance Centrale :
Autour de quelle valeur "typique" les données se regroupent-elles ?
November 12, 2025 10 / 48
Introduction
Statistique Descriptive
Les quatre grandes questions que l’on se pose face à un jeu de
données :
I Tendance Centrale :
Autour de quelle valeur "typique" les données se regroupent-elles ?
I Dispersion :
Les données sont-elles très concentrées ou très étalées ?
November 12, 2025 10 / 48
Introduction
Statistique Descriptive
Les quatre grandes questions que l’on se pose face à un jeu de
données :
I Tendance Centrale :
Autour de quelle valeur "typique" les données se regroupent-elles ?
I Dispersion :
Les données sont-elles très concentrées ou très étalées ?
I Forme :
La distribution des données est-elle symétrique ? Présente-t-elle une
"queue" ?
November 12, 2025 10 / 48
Introduction
Statistique Descriptive
Les quatre grandes questions que l’on se pose face à un jeu de
données :
I Tendance Centrale :
Autour de quelle valeur "typique" les données se regroupent-elles ?
I Dispersion :
Les données sont-elles très concentrées ou très étalées ?
I Forme :
La distribution des données est-elle symétrique ? Présente-t-elle une
"queue" ?
I Concentration :
Une petite partie des individus concentre-t-elle une grande partie de
la valeur totale ?
November 12, 2025 10 / 48
Caractéristiques de Tendance Centrale
Caractéristiques de Tendance Centrale
Où se situe le "centre de gravité" des données ?
1. La Moyenne (arithmétique)
I Définition : C’est le centre de gravité des données.
• Cas 1 : Données Brutes (non groupées)
n
1X
x̄ = xi
n i=1
November 12, 2025 11 / 48
Caractéristiques de Tendance Centrale
Caractéristiques de Tendance Centrale
Où se situe le "centre de gravité" des données ?
1. La Moyenne (arithmétique)
I Définition : C’est le centre de gravité des données.
• Cas 1 : Données Brutes (non groupées)
n
1X
x̄ = xi
n i=1
• Cas 2 : Données Groupées en p Classes
p p
1X X
x̄ = ni ci = fi ci
n i=1 i=1
où : ni : L’effectif absolu de la classe i.
fi : La fréquence ou l’effectif relatif de la classe i.
ci : Le centre de la classe i : ci = borne inf+borne
2
sup
I Avantage : Simple à calculer et à interpréter.
I Inconvénient : Très sensible aux valeurs extrêmes (aberrantes).
November 12, 2025 11 / 48
Caractéristiques de Tendance Centrale
Caractéristiques de Tendance Centrale
2. La Médiane (Me)
I Définition : C’est la valeur qui sépare l’échantillon (trié) en deux
parties égales. 50% des données sont en dessous, 50% sont
au-dessus.
⇒ Cas des Données Brutes :
1. On trie les n données par ordre croissant.
2. Si n est impair, la médiane est la valeur au centre (à la
2 ).
position n+1
3. Si n est pair, la médiane est la demi-somme des deux valeurs
centrales (positions n2 et n2 + 1).
November 12, 2025 12 / 48
Caractéristiques de Tendance Centrale
Caractéristiques de Tendance Centrale
2. La Médiane (Me)
I Définition : C’est la valeur qui sépare l’échantillon (trié) en deux
parties égales. 50% des données sont en dessous, 50% sont
au-dessus.
⇒ Cas des Données Brutes :
1. On trie les n données par ordre croissant.
2. Si n est impair, la médiane est la valeur au centre (à la
2 ).
position n+1
3. Si n est pair, la médiane est la demi-somme des deux valeurs
centrales (positions n2 et n2 + 1).
⇒ Cas des Données Groupées en Classes :
1. On identifie la classe médiane, celle qui contient la n2 -ième
observation (en utilisant les effectifs cumulés).
2. On calcule la médiane par interpolation linéaire à l’intérieur
de cette classe :
n/2 − Ni−1
Me = Li + ai
ni
November 12, 2025 12 / 48
Caractéristiques de Tendance Centrale
Caractéristiques de Tendance Centrale
Où : Li est la borne inférieure de la classe médiane, ai son amplitude, ni
son effectif, et Ni−1 l’effectif cumulé de la classe précédente.
I Avantage : Robuste aux valeurs extrêmes.
I Inconvénient : Moins "intuitive" et se prête moins bien aux calculs
algébriques.
November 12, 2025 13 / 48
Caractéristiques de Tendance Centrale
Caractéristiques de Tendance Centrale
Où : Li est la borne inférieure de la classe médiane, ai son amplitude, ni
son effectif, et Ni−1 l’effectif cumulé de la classe précédente.
I Avantage : Robuste aux valeurs extrêmes.
I Inconvénient : Moins "intuitive" et se prête moins bien aux calculs
algébriques.
3. Le Mode (Mo)
I Définition : C’est la valeur (ou la classe) la plus fréquente dans
l’échantillon.
⇒ Cas des Données Brutes : C’est simplement la valeur qui
apparaît le plus fréquemment.
November 12, 2025 13 / 48
Caractéristiques de Tendance Centrale
Caractéristiques de Tendance Centrale
Où : Li est la borne inférieure de la classe médiane, ai son amplitude, ni
son effectif, et Ni−1 l’effectif cumulé de la classe précédente.
I Avantage : Robuste aux valeurs extrêmes.
I Inconvénient : Moins "intuitive" et se prête moins bien aux calculs
algébriques.
3. Le Mode (Mo)
I Définition : C’est la valeur (ou la classe) la plus fréquente dans
l’échantillon.
⇒ Cas des Données Brutes : C’est simplement la valeur qui
apparaît le plus fréquemment.
⇒ Cas des Données Groupées en Classes :
1. On identifie la classe modale, celle qui a le plus grand effectif
(pour des classes de même amplitude).
2. (Optionnel) On peut affiner la position du mode dans la classe
par interpolation :
d1
Mo = Li + ai
d1 + d2
November 12, 2025 13 / 48
Caractéristiques de Tendance Centrale
Caractéristiques de Tendance Centrale
Où : d1 est l’écart d’effectif avec la classe précédente, d2 l’écart d’effectif
avec la classe suivante.
I Avantage : Seul indicateur utilisable pour les variables qualitatives.
I Inconvénient : Peut ne pas exister, ou ne pas être unique.
November 12, 2025 14 / 48
Caractéristiques de Tendance Centrale
Caractéristiques de Tendance Centrale
Où : d1 est l’écart d’effectif avec la classe précédente, d2 l’écart d’effectif
avec la classe suivante.
I Avantage : Seul indicateur utilisable pour les variables qualitatives.
I Inconvénient : Peut ne pas exister, ou ne pas être unique.
Exemple illustratif
Considérons les salaires dans une petite entreprise (en k€) : {30,
32, 35, 38, 40, 150}.
I Moyenne : x̄ = 54.1 k€. Ne représente personne, tirée vers
le haut par le salaire du patron.
I Médiane : Me = (35+38)/2 = 36.5 k€. Représente bien
mieux le salaire "typique" de l’employé.
November 12, 2025 14 / 48
Caractéristiques de Tendance Centrale
Quantiles
Définition
Les quantiles sont des caractéristiques de position partageant la
série statistique ordonnée en k parties égales.
⇒ Pour k = 4, les quantiles, appelés quartiles, sont trois nombres
Q1 , Q2 , Q3 tels que :
– 25 % des valeurs prises par la série sont inférieures à Q1
– 25 % des valeurs prises par la série sont supérieures à Q3
– Q2 est la médiane Me
November 12, 2025 15 / 48
Caractéristiques de Tendance Centrale
Quantiles
Définition
Les quantiles sont des caractéristiques de position partageant la
série statistique ordonnée en k parties égales.
⇒ Pour k = 4, les quantiles, appelés quartiles, sont trois nombres
Q1 , Q2 , Q3 tels que :
– 25 % des valeurs prises par la série sont inférieures à Q1
– 25 % des valeurs prises par la série sont supérieures à Q3
– Q2 est la médiane Me
⇒ Pour k = 10, les quantiles sont appelés déciles, il y a neuf déciles
D1 , D2 ... 10 % des valeurs de la série sont inférieures à D1 ...
November 12, 2025 15 / 48
Caractéristiques de Tendance Centrale
Quantiles
Définition
Les quantiles sont des caractéristiques de position partageant la
série statistique ordonnée en k parties égales.
⇒ Pour k = 4, les quantiles, appelés quartiles, sont trois nombres
Q1 , Q2 , Q3 tels que :
– 25 % des valeurs prises par la série sont inférieures à Q1
– 25 % des valeurs prises par la série sont supérieures à Q3
– Q2 est la médiane Me
⇒ Pour k = 10, les quantiles sont appelés déciles, il y a neuf déciles
D1 , D2 ... 10 % des valeurs de la série sont inférieures à D1 ...
⇒ Pour k = 100, les quantiles sont appelés centiles, il y a 99 centiles,
chacun correspondant à 1 % de la population.
November 12, 2025 15 / 48
Les Caractéristiques de Dispersion
Les Caractéristiques de Dispersion
Les données sont-elles regroupées ou étalées ?
1. L’Étendue
I Définition : Étendue = xmax − xmin .
I Usage : Très simple, mais peu informatif et très sensible aux
valeurs extrêmes.
November 12, 2025 16 / 48
Les Caractéristiques de Dispersion
Les Caractéristiques de Dispersion
Les données sont-elles regroupées ou étalées ?
1. L’Étendue
I Définition : Étendue = xmax − xmin .
I Usage : Très simple, mais peu informatif et très sensible aux
valeurs extrêmes.
2. La Variance (s 2 ) et l’Écart-type (s)
I Définition : La variance est la moyenne des carrés des écarts à la
moyenne.
n n
1X 1X 2
s2 = (xi − x̄ )2 = x − x̄ 2
n i=1 n i=1 i
√
I L’écart-type s = s 2 a l’avantage d’être dans la même unité que
les données.
I Usage : C’est l’indicateur de dispersion le plus important et le plus
utilisé. Plus s est petit, plus les données sont regroupées autour de
la moyenne et plus la population est homogène
November 12, 2025 16 / 48
Les Caractéristiques de Dispersion
Les Caractéristiques de Dispersion
Les données sont-elles regroupées ou étalées ?
3. Coefficient de variation
I Définition : Il s’exprime, sous la forme d’un pourcentage,
s
CV = × 100
x̄
I Usage :
1. Il permet d’apprécier l’homogénéité de la distribution, une
valeur du coefficient de variation inférieure à 15 % traduit une
bonne homogénéité de la distribution.
2. Il permet de comparer deux distributions, même si les données
ne sont pas exprimées avec la même unité ou si les moyennes
arithmétiques des deux séries sont très différentes.
November 12, 2025 17 / 48
Les Caractéristiques de Dispersion
Les Caractéristiques de Dispersion
Les données sont-elles regroupées ou étalées ?
4. L’Écart Interquartile (IQR)
I Définition : IQR = Q3 − Q1 , où Q1 et Q3 sont les premier et
troisième quartiles (les "médianes" de chaque moitié de
l’échantillon).
I Usage : C’est l’étendue de la "boîte" dans un boxplot
(diagramme en boîte à moustaches). Il mesure la
dispersion des 50% de données centrales et est robuste aux
valeurs extrêmes.
November 12, 2025 18 / 48
Les Caractéristiques de Dispersion
Les Caractéristiques de Dispersion
Les données sont-elles regroupées ou étalées ?
4. L’Écart Interquartile (IQR)
I Définition : IQR = Q3 − Q1 , où Q1 et Q3 sont les premier et
troisième quartiles (les "médianes" de chaque moitié de
l’échantillon).
I Usage : C’est l’étendue de la "boîte" dans un boxplot
(diagramme en boîte à moustaches). Il mesure la
dispersion des 50% de données centrales et est robuste aux
valeurs extrêmes.
November 12, 2025 18 / 48
Caractéristiques de forme
Caractéristiques de forme
Au-delà du centre
1. Mesure de l’asymétrie
Définition : Coefficient d’asymétrie (Skewness) de Fisher γ1
n
µ3 1X
γ1 = , µ3 = (xi − x̄ )3
s3 n i=1
November 12, 2025 19 / 48
Caractéristiques de forme
Caractéristiques de forme
Au-delà du centre
1. Mesure de l’asymétrie
Définition : Coefficient d’asymétrie (Skewness) de Fisher γ1
n
µ3 1X
γ1 = , µ3 = (xi − x̄ )3
s3 n i=1
1. γ1 = 0 : Distribution symétrique. Moyenne ≈ Médiane.
2. γ1 > 0 : Asymétrie à droite (queue vers les valeurs élevées).
Moyenne > Médiane.
3. γ1 < 0 : Asymétrie à gauche (queue vers les valeurs faibles).
Moyenne < Médiane.
November 12, 2025 19 / 48
Caractéristiques de forme
Caractéristiques de forme
Au-delà du centre
1. Mesure de l’asymétrie
Définition : Coefficient d’asymétrie (Skewness) de Fisher γ1
n
µ3 1X
γ1 = , µ3 = (xi − x̄ )3
s3 n i=1
1. γ1 = 0 : Distribution symétrique. Moyenne ≈ Médiane.
2. γ1 > 0 : Asymétrie à droite (queue vers les valeurs élevées).
Moyenne > Médiane.
3. γ1 < 0 : Asymétrie à gauche (queue vers les valeurs faibles).
Moyenne < Médiane.
November 12, 2025 19 / 48
Caractéristiques de forme
Caractéristiques de forme
Au-delà de l’étalement
2. Mesure de l’aplatissement
Définition : Coefficient d’aplatissement (Kurtosis) de Fisher γ2
n
µ4 1X
γ2 = − 3, µ4 = (xi − x̄ )4
s4 n i=1
November 12, 2025 20 / 48
Caractéristiques de forme
Caractéristiques de forme
Au-delà de l’étalement
2. Mesure de l’aplatissement
Définition : Coefficient d’aplatissement (Kurtosis) de Fisher γ2
n
µ4 1X
γ2 = − 3, µ4 = (xi − x̄ )4
s4 n i=1
1. Compare l’aplatissement de la distribution à celui de la loi Normale.
2. γ2 > 0 : Distribution plus "pointue" que la normale
(leptokurtique).
3. γ2 < 0 : Distribution plus "aplatie" que la normale
(platykurtique).
November 12, 2025 20 / 48
Caractéristiques de forme
Caractéristiques de forme
Au-delà de l’étalement
2. Mesure de l’aplatissement
Définition : Coefficient d’aplatissement (Kurtosis) de Fisher γ2
n
µ4 1X
γ2 = − 3, µ4 = (xi − x̄ )4
s4 n i=1
1. Compare l’aplatissement de la distribution à celui de la loi Normale.
2. γ2 > 0 : Distribution plus "pointue" que la normale
(leptokurtique).
3. γ2 < 0 : Distribution plus "aplatie" que la normale
(platykurtique).
November 12, 2025 20 / 48
Caractéristiques de concentration
Caractéristiques de Concentration
La richesse est-elle équitablement répartie ?
Le Contexte
On étudie la répartition d’une variable quantitative X (ex: salaires,
chiffre d’affaires, nombre de pannes) au sein d’une population.
Question clé : Une petite fraction de la population concentre-
t-elle une grande partie de la valeur totale de X ?
November 12, 2025 21 / 48
Caractéristiques de concentration
Caractéristiques de Concentration
La richesse est-elle équitablement répartie ?
Le Contexte
On étudie la répartition d’une variable quantitative X (ex: salaires,
chiffre d’affaires, nombre de pannes) au sein d’une population.
Question clé : Une petite fraction de la population concentre-
t-elle une grande partie de la valeur totale de X ?
Méthodologie : La Courbe de Lorenz
La courbe de Lorenz est la représentation graphique de la fonction
Qi = L(Fi ), où :
I Fi est la fréquence cumulée des individus Fi = ij=1 fj .
P
I Qi est la fréquence cumulée de la variable Qi = ij=1 qj , avec
P
ni ci
qi = P
nj cj
où ci est le centre de la classe i.
November 12, 2025 21 / 48
Caractéristiques de concentration
Caractéristiques de Concentration
L’Indice de Gini : La mesure numérique de la concentration
L’indice de Gini (IG ) mesure l’aire de la surface de concentration (entre la
droite d’équirépartition et la courbe de Lorenz), rapportée à l’aire du
triangle sous cette droite.
Formule de calcul (méthode des trapèzes) :
p
X
IG = 1 − (Fi − Fi−1 )(Qi + Qi−1 ), F0 = 0 et Q0 = 0
i=1
1. IG = 0 : Égalité parfaite.
2. IG = 1 : Inégalité maximale (une personne détient tout).
November 12, 2025 22 / 48
Caractéristiques de concentration
Caractéristiques de Concentration
L’Indice de Gini : La mesure numérique de la concentration
L’indice de Gini (IG ) mesure l’aire de la surface de concentration (entre la
droite d’équirépartition et la courbe de Lorenz), rapportée à l’aire du
triangle sous cette droite.
Formule de calcul (méthode des trapèzes) :
p
X
IG = 1 − (Fi − Fi−1 )(Qi + Qi−1 ), F0 = 0 et Q0 = 0
i=1
1. IG = 0 : Égalité parfaite.
2. IG = 1 : Inégalité maximale (une personne détient tout).
November 12, 2025 22 / 48
Caractéristiques de concentration
Cas Pratique Complet : Analyse des Salaires
De la tendance centrale à la forme et la concentration
On étudie la distribution des salaires dans une PME de 20 employés.
Classe de Salaire (€) Centre (ci ) Effectif (ni )
[1500, 2500[ 2000 10
[2500, 3500[ 3000 6
[3500, 5500[ 4500 3
[5500, 8500[ 7000 1
1. Calculer le salaire moyen et le salaire médian.
November 12, 2025 23 / 48
Caractéristiques de concentration
Cas Pratique Complet : Analyse des Salaires
De la tendance centrale à la forme et la concentration
On étudie la distribution des salaires dans une PME de 20 employés.
Classe de Salaire (€) Centre (ci ) Effectif (ni )
[1500, 2500[ 2000 10
[2500, 3500[ 3000 6
[3500, 5500[ 4500 3
[5500, 8500[ 7000 1
1. Calculer le salaire moyen et le salaire médian.
2. Comparer la moyenne et la médiane. Que peut-on en déduire sur la
forme de la distribution des salaires ? Est-ce cohérent avec la réalité
d’une entreprise ?
November 12, 2025 23 / 48
Caractéristiques de concentration
Cas Pratique Complet : Analyse des Salaires
De la tendance centrale à la forme et la concentration
On étudie la distribution des salaires dans une PME de 20 employés.
Classe de Salaire (€) Centre (ci ) Effectif (ni )
[1500, 2500[ 2000 10
[2500, 3500[ 3000 6
[3500, 5500[ 4500 3
[5500, 8500[ 7000 1
1. Calculer le salaire moyen et le salaire médian.
2. Comparer la moyenne et la médiane. Que peut-on en déduire sur la
forme de la distribution des salaires ? Est-ce cohérent avec la réalité
d’une entreprise ?
3. Calculer l’indice de Gini et interpréter le résultat. Par exemple,
quelle part de la masse salariale totale est détenue par les 20%
d’employés les mieux payés ?
November 12, 2025 23 / 48
Caractéristiques de concentration
Correction du Cas Pratique
Interpréter les indicateurs
1. Calcul de la moyenne et de la médiane
x̄ = 2925 €, Me = 2500 €
November 12, 2025 24 / 48
Caractéristiques de concentration
Correction du Cas Pratique
Interpréter les indicateurs
1. Calcul de la moyenne et de la médiane
x̄ = 2925 €, Me = 2500 €
2. Analyse de la forme de la distribution
I Comparaison : On observe que x̄ = 2925 € > Me = 2500 €.
November 12, 2025 24 / 48
Caractéristiques de concentration
Correction du Cas Pratique
Interpréter les indicateurs
1. Calcul de la moyenne et de la médiane
x̄ = 2925 €, Me = 2500 €
2. Analyse de la forme de la distribution
I Comparaison : On observe que x̄ = 2925 € > Me = 2500 €.
I Conclusion : La moyenne est "tirée" vers les valeurs élevées par
rapport à la médiane. Cela indique une asymétrie à droite (ou
étalement à droite).
November 12, 2025 24 / 48
Caractéristiques de concentration
Correction du Cas Pratique
Interpréter les indicateurs
1. Calcul de la moyenne et de la médiane
x̄ = 2925 €, Me = 2500 €
2. Analyse de la forme de la distribution
I Comparaison : On observe que x̄ = 2925 € > Me = 2500 €.
I Conclusion : La moyenne est "tirée" vers les valeurs élevées par
rapport à la médiane. Cela indique une asymétrie à droite (ou
étalement à droite).
I Cohérence : C’est une forme de distribution très classique pour les
salaires. Une majorité d’employés a un salaire relativement groupé,
et une minorité de cadres ou dirigeants a des salaires beaucoup plus
élevés, ce qui crée une "queue" de distribution vers la droite.
November 12, 2025 24 / 48
Caractéristiques de concentration
Correction du Cas Pratique
Interpréter les indicateurs
3. Analyse de la concentration (Indice de Gini)
I D’après le calcul précédent, l’indice de Gini est IG ≈ 0.208. C’est
une concentration modérée.
I Question bonus : Quelle part de la masse salariale est détenue par
les 20% les mieux payés ?
November 12, 2025 25 / 48
Caractéristiques de concentration
Correction du Cas Pratique
Interpréter les indicateurs
3. Analyse de la concentration (Indice de Gini)
I D’après le calcul précédent, l’indice de Gini est IG ≈ 0.208. C’est
une concentration modérée.
I Question bonus : Quelle part de la masse salariale est détenue par
les 20% les mieux payés ?
I Les 20% les mieux payés correspondent à 20% × 20 = 4
employés. Ce sont les 3 employés de la classe [3500, 5500[ et
l’unique employé de la classe [5500, 8500[.
I Leur masse salariale est :
(3 × 4500) + (1 × 7000) = 13500 + 7000 = 20500 €.
I La masse salariale totale est de 58500 €.
I Part détenue : 20500
58500 ≈ 0.3504.
November 12, 2025 25 / 48
Caractéristiques de concentration
Correction du Cas Pratique
Interpréter les indicateurs
3. Analyse de la concentration (Indice de Gini)
I D’après le calcul précédent, l’indice de Gini est IG ≈ 0.208. C’est
une concentration modérée.
I Question bonus : Quelle part de la masse salariale est détenue par
les 20% les mieux payés ?
I Les 20% les mieux payés correspondent à 20% × 20 = 4
employés. Ce sont les 3 employés de la classe [3500, 5500[ et
l’unique employé de la classe [5500, 8500[.
I Leur masse salariale est :
(3 × 4500) + (1 × 7000) = 13500 + 7000 = 20500 €.
I La masse salariale totale est de 58500 €.
I Part détenue : 20500
58500 ≈ 0.3504.
I Interprétation : Les 20% d’employés les mieux payés concentrent
35% de la masse salariale totale, ce qui confirme l’inégalité de la
répartition et l’asymétrie à droite.
November 12, 2025 25 / 48
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Analyser les relations entre deux variables
Pourquoi l’analyse bivariée ?
L’analyse univariée nous a permis de décrire une variable à la fois.
Mais les questions les plus intéressantes pour un ingénieur concer-
nent les relations :
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Analyser les relations entre deux variables
Pourquoi l’analyse bivariée ?
L’analyse univariée nous a permis de décrire une variable à la fois.
Mais les questions les plus intéressantes pour un ingénieur concer-
nent les relations :
I Est-ce que la température du four influence le taux de
défauts des pièces ?
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Analyser les relations entre deux variables
Pourquoi l’analyse bivariée ?
L’analyse univariée nous a permis de décrire une variable à la fois.
Mais les questions les plus intéressantes pour un ingénieur concer-
nent les relations :
I Est-ce que la température du four influence le taux de
défauts des pièces ?
I Est-ce que le fournisseur d’une matière première est lié à la
fiabilité du produit final ?
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Analyser les relations entre deux variables
Pourquoi l’analyse bivariée ?
L’analyse univariée nous a permis de décrire une variable à la fois.
Mais les questions les plus intéressantes pour un ingénieur concer-
nent les relations :
I Est-ce que la température du four influence le taux de
défauts des pièces ?
I Est-ce que le fournisseur d’une matière première est lié à la
fiabilité du produit final ?
I Peut-on prédire la consommation d’un moteur en fonction
de sa vitesse ?
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Analyser les relations entre deux variables
Pourquoi l’analyse bivariée ?
L’analyse univariée nous a permis de décrire une variable à la fois.
Mais les questions les plus intéressantes pour un ingénieur concer-
nent les relations :
I Est-ce que la température du four influence le taux de
défauts des pièces ?
I Est-ce que le fournisseur d’une matière première est lié à la
fiabilité du produit final ?
I Peut-on prédire la consommation d’un moteur en fonction
de sa vitesse ?
L’analyse bivariée nous donne les outils pour répondre à ces ques-
tions en étudiant deux variables simultanément.
November 12, 2025 26 / 48
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Analyser les relations entre deux variables
La nature des deux variables détermine les outils à utiliser :
I Quantitative vs Quantitative : Nuage de points, Corrélation &
Régression linéaire
November 12, 2025 27 / 48
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Analyser les relations entre deux variables
La nature des deux variables détermine les outils à utiliser :
I Quantitative vs Quantitative : Nuage de points, Corrélation &
Régression linéaire
I Qualitative vs Qualitative : Table de contingence & Test du
Khi-deux
November 12, 2025 27 / 48
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Analyser les relations entre deux variables
La nature des deux variables détermine les outils à utiliser :
I Quantitative vs Quantitative : Nuage de points, Corrélation &
Régression linéaire
I Qualitative vs Qualitative : Table de contingence & Test du
Khi-deux
I Quantitative vs Qualitative : Boxplots comparatifs & ANOVA
November 12, 2025 27 / 48
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Distributions Jointes, Marginales et Conditionnelles
Formalisation Théorique
Soient deux variables qualitatives X et Y .
I X prend p modalités {x1 , . . . , xp }.
I Y prend q modalités {y1 , . . . , yq }.
On observe un échantillon de n individus.
November 12, 2025 28 / 48
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Distributions Jointes, Marginales et Conditionnelles
Formalisation Théorique
Soient deux variables qualitatives X et Y .
I X prend p modalités {x1 , . . . , xp }.
I Y prend q modalités {y1 , . . . , yq }.
On observe un échantillon de n individus.
1. Distribution Conjointe (ou Loi Jointe)
On note nij l’effectif des individus présentant simultanément la
modalité xi de X et la modalité yj de Y . La fréquence con-
jointe est :
nij
fij = P(X = xi , Y = yj ) =
n
L’ensemble de ces p × q fréquences, présenté
Pp dansPq un tableau, est
la table de contingence. On a toujours i=1 j=1 nij = n.
November 12, 2025 28 / 48
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Distributions Jointes, Marginales et Conditionnelles
Table de contingence
Les variables X et Y sont "mesurées" conjointement sur les n individus
d’une population ou d’un échantillon. Les résultats sont regroupés dans
un tableau dit de contingence.
X\Y y1 y2 . yj . yq ni·
x1 n11 n12 - n1j - n1q n1·
x2 n21 n22 . n2j . n2q n2·
. . . - . . . .
xi ni1 ni1 - nij . niq ni·
· . . - . - . .
xp np1 np2 . npj . npq np·
n·j n·1 n·2 . n·j . n·q n
November 12, 2025 29 / 48
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Distributions Jointes, Marginales et Conditionnelles
Distributions Marginales
Distributions Marginales
On obtient la distribution d’une seule variable en sommant sur
toutes les modalités de l’autre.
I Effectif marginal de la modalité xi :
Pq
ni. = j=1 nij , i ∈ {1, · · · , p}
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Distributions Jointes, Marginales et Conditionnelles
Distributions Marginales
Distributions Marginales
On obtient la distribution d’une seule variable en sommant sur
toutes les modalités de l’autre.
I Effectif marginal de la modalité xi :
Pq
ni. = j=1 nij , i ∈ {1, · · · , p}
I Fréquence marginale de la modalité xi :
Pq
fi. = P(X = xi ) = nni. = j=1 fij
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Distributions Jointes, Marginales et Conditionnelles
Distributions Marginales
Distributions Marginales
On obtient la distribution d’une seule variable en sommant sur
toutes les modalités de l’autre.
I Effectif marginal de la modalité xi :
Pq
ni. = j=1 nij , i ∈ {1, · · · , p}
I Fréquence marginale de la modalité xi :
Pq
fi. = P(X = xi ) = nni. = j=1 fij
I Moyenne marginale de X : X̄ = n1 pi=1 ni. xi
P
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Distributions Jointes, Marginales et Conditionnelles
Distributions Marginales
Distributions Marginales
On obtient la distribution d’une seule variable en sommant sur
toutes les modalités de l’autre.
I Effectif marginal de la modalité xi :
Pq
ni. = j=1 nij , i ∈ {1, · · · , p}
I Fréquence marginale de la modalité xi :
Pq
fi. = P(X = xi ) = nni. = j=1 fij
I Moyenne marginale de X : X̄ = n1 pi=1 ni. xi
P
I De même pour Y : n.j = pi=1 nij ,
P
n.j Pp Pq
f.j = P(Y = yj ) = n = i=1 fij et Ȳ = n1 j=1 n·j yj
November 12, 2025 30 / 48
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Distributions Jointes, Marginales et Conditionnelles
Distributions Conditionnelles
Elles décrivent le comportement d’une variable sachant la valeur
de l’autre.
I Loi de Y sachant X = xi (profil en ligne) :
P(X =x ,Y =y ) f nij
fj|i = P(Y = yj |X = xi ) = P(Xi=xi ) j = [Link] = ni.
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Distributions Jointes, Marginales et Conditionnelles
Distributions Conditionnelles
Elles décrivent le comportement d’une variable sachant la valeur
de l’autre.
I Loi de Y sachant X = xi (profil en ligne) :
P(X =x ,Y =y ) f nij
fj|i = P(Y = yj |X = xi ) = P(Xi=xi ) j = [Link] = ni.
I Moyenne de Y sachant X = xi
Pq
Ȳi = n1i. j=1 nij yj
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Distributions Jointes, Marginales et Conditionnelles
Distributions Conditionnelles
Elles décrivent le comportement d’une variable sachant la valeur
de l’autre.
I Loi de Y sachant X = xi (profil en ligne) :
P(X =x ,Y =y ) f nij
fj|i = P(Y = yj |X = xi ) = P(Xi=xi ) j = [Link] = ni.
I Moyenne de Y sachant X = xi
Pq
Ȳi = n1i. j=1 nij yj
I Loi de X sachant Y = yj (profil en colonne) :
P(X =x ,Y =y ) f n
fi|j = P(X = xi |Y = yj ) = P(Yi=yj ) j = [Link] = [Link]
Statistiques descriptives bivariées
Statistiques Descriptives Bivariées
Distributions Jointes, Marginales et Conditionnelles
Distributions Conditionnelles
Elles décrivent le comportement d’une variable sachant la valeur
de l’autre.
I Loi de Y sachant X = xi (profil en ligne) :
P(X =x ,Y =y ) f nij
fj|i = P(Y = yj |X = xi ) = P(Xi=xi ) j = [Link] = ni.
I Moyenne de Y sachant X = xi
Pq
Ȳi = n1i. j=1 nij yj
I Loi de X sachant Y = yj (profil en colonne) :
P(X =x ,Y =y ) f n
fi|j = P(X = xi |Y = yj ) = P(Yi=yj ) j = [Link] = [Link]
I Moyenne de X sachant Y = yj
Pp
X̄j = n1.j i=1 nij xi
November 12, 2025 31 / 48
Mesure de dépendance Cas de Deux Variables Quantitatives
Liaison entre deux variables quantitatives
Nuage de points et Corrélation
1. Visualisation : Le Nuage de Points (Scatter Plot)
C’est la première étape indispensable. Chaque individu est un point de
coordonnées (xi , yi ). Le graphique permet de détecter visuellement :
I La forme de la relation (linéaire, quadratique, ...).
November 12, 2025 32 / 48
Mesure de dépendance Cas de Deux Variables Quantitatives
Liaison entre deux variables quantitatives
Nuage de points et Corrélation
1. Visualisation : Le Nuage de Points (Scatter Plot)
C’est la première étape indispensable. Chaque individu est un point de
coordonnées (xi , yi ). Le graphique permet de détecter visuellement :
I La forme de la relation (linéaire, quadratique, ...).
I Le sens de la relation (positive/croissante ou
négative/décroissante).
November 12, 2025 32 / 48
Mesure de dépendance Cas de Deux Variables Quantitatives
Liaison entre deux variables quantitatives
Nuage de points et Corrélation
1. Visualisation : Le Nuage de Points (Scatter Plot)
C’est la première étape indispensable. Chaque individu est un point de
coordonnées (xi , yi ). Le graphique permet de détecter visuellement :
I La forme de la relation (linéaire, quadratique, ...).
I Le sens de la relation (positive/croissante ou
négative/décroissante).
I La force de la relation (points très groupés ou très dispersés).
November 12, 2025 32 / 48
Mesure de dépendance Cas de Deux Variables Quantitatives
Liaison entre deux variables quantitatives
Nuage de points et Corrélation
1. Visualisation : Le Nuage de Points (Scatter Plot)
C’est la première étape indispensable. Chaque individu est un point de
coordonnées (xi , yi ). Le graphique permet de détecter visuellement :
I La forme de la relation (linéaire, quadratique, ...).
I Le sens de la relation (positive/croissante ou
négative/décroissante).
I La force de la relation (points très groupés ou très dispersés).
November 12, 2025 32 / 48
Mesure de dépendance Cas de Deux Variables Quantitatives
Liaison entre deux variables quantitatives
Nuage de points et Corrélation
2. Covariance et Corrélation
Soient deux variables quantitatives X et Y observées sur n individus.
I La Covariance Empirique : Mesure la façon dont les deux
variables varient simultanément par rapport à leurs moyennes
respectives.
n
1X 1X
Cov(X , Y ) = (xi − x̄ )(yi − ȳ ) = xi yi − x̄ ȳ
n i=1 n
November 12, 2025 33 / 48
Mesure de dépendance Cas de Deux Variables Quantitatives
Liaison entre deux variables quantitatives
Nuage de points et Corrélation
2. Covariance et Corrélation
Soient deux variables quantitatives X et Y observées sur n individus.
I La Covariance Empirique : Mesure la façon dont les deux
variables varient simultanément par rapport à leurs moyennes
respectives.
n
1X 1X
Cov(X , Y ) = (xi − x̄ )(yi − ȳ ) = xi yi − x̄ ȳ
n i=1 n
I Le signe de la covariance indique le sens de la relation, mais sa
valeur dépend des unités et est difficile à interpréter.
November 12, 2025 33 / 48
Mesure de dépendance Cas de Deux Variables Quantitatives
Liaison entre deux variables quantitatives
Nuage de points et Corrélation
2. Covariance et Corrélation
Soient deux variables quantitatives X et Y observées sur n individus.
I La Covariance Empirique : Mesure la façon dont les deux
variables varient simultanément par rapport à leurs moyennes
respectives.
n
1X 1X
Cov(X , Y ) = (xi − x̄ )(yi − ȳ ) = xi yi − x̄ ȳ
n i=1 n
I Le signe de la covariance indique le sens de la relation, mais sa
valeur dépend des unités et est difficile à interpréter.
I Le Coefficient de Corrélation Linéaire (r ) : Il mesure la force et
le sens d’une relation linéaire entre deux variables.
Cov(X , Y )
rXY =
sX sY
Où sX et sY sont les écarts-types de X et Y .
November 12, 2025 33 / 48
Mesure de dépendance Cas de Deux Variables Quantitatives
Liaison entre deux variables quantitatives
Nuage de points et Corrélation
I r est toujours compris entre -1 et 1.
I r > 0 : Corrélation positive (quand X augmente, Y a tendance à
augmenter).
I r < 0 : Corrélation négative (quand X augmente, Y a tendance à
diminuer).
I r ≈ 0 : Absence de corrélation linéaire.
I |r | ≈ 1 : Corrélation linéaire très forte.
November 12, 2025 34 / 48
Mesure de dépendance Cas de Deux Variables Quantitatives
Liaison entre deux variables quantitatives
Nuage de points et Corrélation
I r est toujours compris entre -1 et 1.
I r > 0 : Corrélation positive (quand X augmente, Y a tendance à
augmenter).
I r < 0 : Corrélation négative (quand X augmente, Y a tendance à
diminuer).
I r ≈ 0 : Absence de corrélation linéaire.
I |r | ≈ 1 : Corrélation linéaire très forte.
Attention !
Corrélation n’est pas causalité ! Et r = 0 ne signifie pas "pas de
relation", mais juste "pas de relation linéaire" (la relation peut être
quadratique, par exemple).
November 12, 2025 34 / 48
Mesure de dépendance Régression Linéaire Simple
Modélisation : La Régression Linéaire Simple
Prédire Y en fonction de X
L’objectif
Si le nuage de points et le coefficient de corrélation suggèrent une
relation linéaire forte, on peut chercher à la modéliser par une droite : la
droite de régression. Cette droite permettra de prédire la valeur de Y
pour une nouvelle valeur de X.
November 12, 2025 35 / 48
Mesure de dépendance Régression Linéaire Simple
Modélisation : La Régression Linéaire Simple
Prédire Y en fonction de X
L’objectif
Si le nuage de points et le coefficient de corrélation suggèrent une
relation linéaire forte, on peut chercher à la modéliser par une droite : la
droite de régression. Cette droite permettra de prédire la valeur de Y
pour une nouvelle valeur de X. Le modèle : On cherche la "meilleure"
droite d’équation ŷ = a + bx .
I b : la pente (slope). De combien ŷ augmente si x augmente d’une
unité.
I a : l’ordonnée à l’origine (intercept). La valeur prédite de y si x = 0.
November 12, 2025 35 / 48
Mesure de dépendance Régression Linéaire Simple
Modélisation : La Régression Linéaire Simple
Prédire Y en fonction de X
L’objectif
Si le nuage de points et le coefficient de corrélation suggèrent une
relation linéaire forte, on peut chercher à la modéliser par une droite : la
droite de régression. Cette droite permettra de prédire la valeur de Y
pour une nouvelle valeur de X. Le modèle : On cherche la "meilleure"
droite d’équation ŷ = a + bx .
I b : la pente (slope). De combien ŷ augmente si x augmente d’une
unité.
I a : l’ordonnée à l’origine (intercept). La valeur prédite de y si x = 0.
La Méthode des Moindres Carrés (Ordinary Least Squares - OLS)
Comment trouver la "meilleure" droite ? C’est celle qui minimise la
somme des carrés des erreurs (les résidus) entre les points observés yi et
les points prédits ŷi .
November 12, 2025 35 / 48
Mesure de dépendance Régression Linéaire Simple
Modélisation : La Régression Linéaire Simple
Prédire Y en fonction de X
On cherche à minimiser la quantité :
n
X n
X
SCE = (yi − ŷi )2 = (yi − (a + bxi ))2
i=1 i=1
November 12, 2025 36 / 48
Mesure de dépendance Régression Linéaire Simple
Modélisation : La Régression Linéaire Simple
Prédire Y en fonction de X
On cherche à minimiser la quantité :
n
X n
X
SCE = (yi − ŷi )2 = (yi − (a + bxi ))2
i=1 i=1
November 12, 2025 36 / 48
Mesure de dépendance Régression Linéaire Simple
Modélisation : La Régression Linéaire Simple
Prédire Y en fonction de X
Les formules des coefficients
Le calcul de minimisation (en utilisant les dérivées partielles) donne les
solutions uniques pour a et b :
Cov(X , Y ) sY
b= =r
Var(X ) sX
a = ȳ − bx̄
November 12, 2025 37 / 48
Mesure de dépendance Régression Linéaire Simple
Modélisation : La Régression Linéaire Simple
Prédire Y en fonction de X
Les formules des coefficients
Le calcul de minimisation (en utilisant les dérivées partielles) donne les
solutions uniques pour a et b :
Cov(X , Y ) sY
b= =r
Var(X ) sX
a = ȳ − bx̄
Interprétation : La droite de régression passe toujours par le point
moyen (x̄ , ȳ ).
November 12, 2025 37 / 48
Mesure de dépendance Rapport de Corrélation
Au-delà du Linéaire : Le Rapport de Corrélation
Mesurer l’intensité de n’importe quelle liaison fonctionnelle
La Limite du Coefficient de Corrélation (r )
Le coefficient r ne mesure que la force d’une relation linéaire. Si la
relation entre X et Y est forte mais non-linéaire (ex: parabolique),
r peut être proche de 0, nous faisant conclure à tort à une absence
de liaison.
Mesure de dépendance Rapport de Corrélation
Au-delà du Linéaire : Le Rapport de Corrélation
Mesurer l’intensité de n’importe quelle liaison fonctionnelle
La Limite du Coefficient de Corrélation (r )
Le coefficient r ne mesure que la force d’une relation linéaire. Si la
relation entre X et Y est forte mais non-linéaire (ex: parabolique),
r peut être proche de 0, nous faisant conclure à tort à une absence
de liaison.
Sur la graphe droite, la liaison est forte et prédictive, mais r ≈ 0.
November 12, 2025 38 / 48
Mesure de dépendance Rapport de Corrélation
Au-delà du Linéaire : Le Rapport de Corrélation
Mesurer l’intensité de n’importe quelle liaison fonctionnelle
Le Rapport de Corrélation (ηY2 /X ) : Une mesure plus générale
I Objectif : Mesurer l’intensité de la liaison entre une variable
quantitative Y et une variable X (qui peut être quantitative ou
qualitative).
I Idée fondamentale : On compare la dispersion des données à
l’intérieur de chaque groupe (défini par les valeurs de X) à la
dispersion totale des données.
I Si la connaissance de X réduit fortement l’incertitude sur Y, alors la
liaison est forte.
November 12, 2025 39 / 48
Mesure de dépendance Rapport de Corrélation
Au-delà du Linéaire : Le Rapport de Corrélation
Mesurer l’intensité de n’importe quelle liaison fonctionnelle
Le Rapport de Corrélation (ηY2 /X ) : Une mesure plus générale
I Objectif : Mesurer l’intensité de la liaison entre une variable
quantitative Y et une variable X (qui peut être quantitative ou
qualitative).
I Idée fondamentale : On compare la dispersion des données à
l’intérieur de chaque groupe (défini par les valeurs de X) à la
dispersion totale des données.
I Si la connaissance de X réduit fortement l’incertitude sur Y, alors la
liaison est forte.
Décomposition de la Variance (ANOVA)
Le rapport de corrélation est basé sur la décomposition de la variance
totale de Y :
Variance Totale = Variance Expliquée (par X)+Variance Résiduelle (inexpliquée)
SCT = SCE + SCR
November 12, 2025 39 / 48
Mesure de dépendance Rapport de Corrélation
Au-delà du Linéaire : Le Rapport de Corrélation
Mesurer l’intensité de n’importe quelle liaison fonctionnelle
I Variance Totale (SCT - Somme des Carrés Totaux) : C’est la
variance classique de Y. Pn
SCT = i=1 (yi − ȳ )2
I Variance Expliquée (SCE - Somme des Carrés Expliqués) :
C’est la variance des moyennes conditionnelles. Elle représente la
part de la dispersion de Y qui est "expliquée" par l’appartenance à
un groupe de X. Pp
SCE = i=1 ni. (ȳi − ȳ )2
(où ȳj est la moyenne de Y pour la modalité/classe j de X, et nj son
effectif).
November 12, 2025 40 / 48
Mesure de dépendance Rapport de Corrélation
Au-delà du Linéaire : Le Rapport de Corrélation
Mesurer l’intensité de n’importe quelle liaison fonctionnelle
I Variance Totale (SCT - Somme des Carrés Totaux) : C’est la
variance classique de Y. Pn
SCT = i=1 (yi − ȳ )2
I Variance Expliquée (SCE - Somme des Carrés Expliqués) :
C’est la variance des moyennes conditionnelles. Elle représente la
part de la dispersion de Y qui est "expliquée" par l’appartenance à
un groupe de X. Pp
SCE = i=1 ni. (ȳi − ȳ )2
(où ȳj est la moyenne de Y pour la modalité/classe j de X, et nj son
effectif).
Formule et Propriétés du Rapport de Corrélation
Le rapport de corrélation est la part de la variance de Y qui est
expliquée par X.
Variance Expliquée SCE
ηY2 /X = =
Variance Totale SCT
November 12, 2025 40 / 48
Mesure de dépendance Rapport de Corrélation
Au-delà du Linéaire : Le Rapport de Corrélation
Mesurer l’intensité de n’importe quelle liaison fonctionnelle
Propriétés Clés :
I 0 ≤ η 2 ≤ 1.
I η 2 = 0 ⇐⇒ Les moyennes conditionnelles sont toutes égales
(ȳj = ȳ ), il n’y a pas de liaison.
I η 2 = 1 ⇐⇒ La variance résiduelle est nulle. La connaissance de X
détermine parfaitement Y.
I Relation fondamentale :
η 2 ≥ r 2 . L’égalité n’a lieu que si la liaison est parfaitement linéaire.
November 12, 2025 41 / 48
Mesure de dépendance Cas de Deux Variables Qualitatives
Indépendance et Liaison (Quali x Quali)
Comment détecter une relation ?
Définition de l’Indépendance Statistique
Deux variables qualitatives X et Y sont dites statistiquement
indépendantes si la connaissance de l’une ne modifie pas la distribution
de l’autre. Mathématiquement, cela se traduit par l’une des conditions
équivalentes suivantes :
November 12, 2025 42 / 48
Mesure de dépendance Cas de Deux Variables Qualitatives
Indépendance et Liaison (Quali x Quali)
Comment détecter une relation ?
Définition de l’Indépendance Statistique
Deux variables qualitatives X et Y sont dites statistiquement
indépendantes si la connaissance de l’une ne modifie pas la distribution
de l’autre. Mathématiquement, cela se traduit par l’une des conditions
équivalentes suivantes :
I En termes de fréquences conjointes : Pour tout couple (i, j), la
fréquence observée est égale au produit des fréquences marginales.
fij = fi. × f.j ( ⇐⇒ P(X = xi , Y = yj ) = P(X = xi )P(Y = yj ))
November 12, 2025 42 / 48
Mesure de dépendance Cas de Deux Variables Qualitatives
Indépendance et Liaison (Quali x Quali)
Comment détecter une relation ?
Définition de l’Indépendance Statistique
Deux variables qualitatives X et Y sont dites statistiquement
indépendantes si la connaissance de l’une ne modifie pas la distribution
de l’autre. Mathématiquement, cela se traduit par l’une des conditions
équivalentes suivantes :
I En termes de fréquences conjointes : Pour tout couple (i, j), la
fréquence observée est égale au produit des fréquences marginales.
fij = fi. × f.j ( ⇐⇒ P(X = xi , Y = yj ) = P(X = xi )P(Y = yj ))
I En termes de fréquences conditionnelles : Les distributions
conditionnelles sont égales aux distributions marginales.
fj|i = f.j pour tout i ET fi|j = fi. pour tout j
(Savoir que X = xi ne change rien à la probabilité de Y = yj )
November 12, 2025 42 / 48
Mesure de dépendance Cas de Deux Variables Qualitatives
Indépendance et Liaison (Quali x Quali)
Comment détecter une relation ?
Mesure de la Liaison : Le Test du Khi-deux (χ2 )
En pratique, l’indépendance parfaite est rare. On cherche à mesurer
l’écart entre la situation observée et la situation théorique
d’indépendance.
1. Calcul des effectifs théoriques (attendus) nij0 : C’est l’effectif
que l’on devrait avoir si les variables étaient indépendantes.
n n ×n
nij0 = n × fi. × f.j = n × nni. × n.j = i. n .j
November 12, 2025 43 / 48
Mesure de dépendance Cas de Deux Variables Qualitatives
Indépendance et Liaison (Quali x Quali)
Comment détecter une relation ?
Mesure de la Liaison : Le Test du Khi-deux (χ2 )
En pratique, l’indépendance parfaite est rare. On cherche à mesurer
l’écart entre la situation observée et la situation théorique
d’indépendance.
1. Calcul des effectifs théoriques (attendus) nij0 : C’est l’effectif
que l’on devrait avoir si les variables étaient indépendantes.
n n ×n
nij0 = n × fi. × f.j = n × nni. × n.j = i. n .j
2. Calcul de la distance du Khi-deux : On somme les carrés des
écarts entre les effectifs observés (nij ) et théoriques (nij0 ), pondérés
par l’effectif théorique.
Pp Pq (nij −n0 )2
χ2calcul = i=1 j=1 n0 ij
ij
November 12, 2025 43 / 48
Mesure de dépendance Cas de Deux Variables Qualitatives
Indépendance et Liaison (Quali x Quali)
Comment détecter une relation ?
Mesure de la Liaison : Le Test du Khi-deux (χ2 )
En pratique, l’indépendance parfaite est rare. On cherche à mesurer
l’écart entre la situation observée et la situation théorique
d’indépendance.
1. Calcul des effectifs théoriques (attendus) nij0 : C’est l’effectif
que l’on devrait avoir si les variables étaient indépendantes.
n n ×n
nij0 = n × fi. × f.j = n × nni. × n.j = i. n .j
2. Calcul de la distance du Khi-deux : On somme les carrés des
écarts entre les effectifs observés (nij ) et théoriques (nij0 ), pondérés
par l’effectif théorique.
Pp Pq (nij −n0 )2
χ2calcul = i=1 j=1 n0 ij
ij
Interprétation :
I Si χ2calcul est proche de 0, les variables sont proches de
l’indépendance.
I Si χ2calcul est grand, la liaison entre les variables est statistiquement
significative.
November 12, 2025 43 / 48
Mesure de dépendance Cas de Deux Variables Qualitatives
Exercice de Synthèse : Analyse Bivariée
Impact de la température de cuisson sur la résistance d’un alliage
Contexte
Un ingénieur en matériaux étudie un nouveau procédé de fabrication pour
un alliage métallique. Il pense que la température de cuisson (en
centaines de ◦ C) a un impact sur la résistance à la traction (en MPa). Il
réalise 10 essais en faisant varier la température et mesure la résistance
de chaque échantillon.
Données de l’expérience :
Température X 1.0 1.5 2.0 2.5 3.0 3.5 4.0 4.5 5.0 5.5
Résistance Y 15 28 35 40 43 44 45 42 38 30
November 12, 2025 44 / 48
Mesure de dépendance Cas de Deux Variables Qualitatives
Exercice de Synthèse : Analyse Bivariée
Impact de la température de cuisson sur la résistance d’un alliage
1. Quel type de graphique est le plus adapté pour visualiser la relation
entre ces deux variables ? Décrivez qualitativement ce que vous
observez.
November 12, 2025 45 / 48
Mesure de dépendance Cas de Deux Variables Qualitatives
Exercice de Synthèse : Analyse Bivariée
Impact de la température de cuisson sur la résistance d’un alliage
1. Quel type de graphique est le plus adapté pour visualiser la relation
entre ces deux variables ? Décrivez qualitativement ce que vous
observez.
2. Calculez le coefficient de corrélation linéaire r . Que concluez-vous
sur la pertinence d’un modèle linéaire pour décrire cette relation ?
November 12, 2025 45 / 48
Mesure de dépendance Cas de Deux Variables Qualitatives
Exercice de Synthèse : Analyse Bivariée
Impact de la température de cuisson sur la résistance d’un alliage
1. Quel type de graphique est le plus adapté pour visualiser la relation
entre ces deux variables ? Décrivez qualitativement ce que vous
observez.
2. Calculez le coefficient de corrélation linéaire r . Que concluez-vous
sur la pertinence d’un modèle linéaire pour décrire cette relation ?
3. Pour affiner l’analyse, on regroupe les données en 3 classes de
température : A=[1, 2], B=]2, 4], C=]4, 5.5]. Les moyennes de
résistance pour ces classes sont ȳA = 26, ȳB = 43, ȳC = 35.
Calculez le rapport de corrélation ηY2 /X .
November 12, 2025 45 / 48
Mesure de dépendance Cas de Deux Variables Qualitatives
Exercice de Synthèse : Analyse Bivariée
Impact de la température de cuisson sur la résistance d’un alliage
1. Quel type de graphique est le plus adapté pour visualiser la relation
entre ces deux variables ? Décrivez qualitativement ce que vous
observez.
2. Calculez le coefficient de corrélation linéaire r . Que concluez-vous
sur la pertinence d’un modèle linéaire pour décrire cette relation ?
3. Pour affiner l’analyse, on regroupe les données en 3 classes de
température : A=[1, 2], B=]2, 4], C=]4, 5.5]. Les moyennes de
résistance pour ces classes sont ȳA = 26, ȳB = 43, ȳC = 35.
Calculez le rapport de corrélation ηY2 /X .
4. Comparez r 2 et ηY2 /X . Quelle est votre conclusion finale sur la
nature de la liaison entre la température et la résistance ? Que
conseilleriez-vous à l’ingénieur pour optimiser son procédé ?
November 12, 2025 45 / 48
Mesure de dépendance Cas de Deux Variables Qualitatives
Correction de l’Exercice de Synthèse
Interpréter les indicateurs pour décider
1. Visualisation
I Le graphique adapté est un nuage de points (scatter plot), car il
s’agit de deux variables quantitatives.
I Observation qualitative : En traçant les points, on observe que la
résistance semble d’abord augmenter avec la température, atteindre
un pic, puis diminuer. La relation ne semble pas être linéaire, mais
plutôt quadratique (en forme de parabole inversée).
November 12, 2025 46 / 48
Mesure de dépendance Cas de Deux Variables Qualitatives
Correction de l’Exercice de Synthèse
Interpréter les indicateurs pour décider
1. Visualisation
I Le graphique adapté est un nuage de points (scatter plot), car il
s’agit de deux variables quantitatives.
I Observation qualitative : En traçant les points, on observe que la
résistance semble d’abord augmenter avec la température, atteindre
un pic, puis diminuer. La relation ne semble pas être linéaire, mais
plutôt quadratique (en forme de parabole inversée).
2. Coefficient de Corrélation Linéaire (r ) Informations pré-calculées
: x̄ = 3.25, ȳ = 36, sX ≈ 1.54, sY ≈ 8.45, Cov(X , Y ) ≈ 4.56.
Cov(X , Y ) 4.56 4.56
r= = ≈ ≈ 0.35
sX sY 1.54 × 8.45 13.003
Conclusion : r est positif mais faible (r ≈ 0.35). Si on se fiait
uniquement à cet indicateur, on pourrait conclure à une liaison linéaire
faible. Cela semble contradictoire avec l’observation visuelle d’une liaison
forte mais non-linéaire.
November 12, 2025 46 / 48
Mesure de dépendance Cas de Deux Variables Qualitatives
Correction de l’Exercice de Synthèse
Interpréter les indicateurs pour décider
3. Rapport de Corrélation (ηY2 /X ) On utilise la formule
Variance Expliquée (SCE)
ηY2 /X = Variance Totale (SCT) .
I Variance Totale :
SCT = (yi − ȳ )2 = (n − 1)sY2 = 9 × (8.45)2 ≈ 642.6.
P
I Variance Expliquée : SCE = nj (ȳj − ȳ )2 .
P
I Classe A: nA = 3, ȳA = 26.
I Classe B: nB = 4, ȳB = 43.
I Classe C: nC = 3, ȳC = 35.
SCE = 3(26 − 36)2 + 4(43 − 36)2 + 3(35 − 36)2 =
3(−10)2 + 4(7)2 + 3(−1)2 SCE = 300 + 196 + 3 = 499.
I Rapport de corrélation : ηY2 /X = 499
642.6 ≈ 0.777.
November 12, 2025 47 / 48
Mesure de dépendance Cas de Deux Variables Qualitatives
Correction de l’Exercice de Synthèse
Interpréter les indicateurs pour décider
4. Synthèse et Décision
I Comparaison : On a r 2 ≈ (0.35)2 ≈ 0.12. On constate que
ηY2 /X ≈ 0.78 est très supérieur à r 2 .
I Conclusion finale : Cela confirme nos soupçons. Il existe une
liaison fonctionnelle très forte entre la température et la
résistance (la température "explique" environ 78% de la variabilité
de la résistance), mais cette liaison est fortement non-linéaire. Le
modèle linéaire n’est pas du tout adapté.
I Conseil à l’ingénieur : Pour maximiser la résistance de l’alliage, il
ne faut ni une température trop basse, ni trop haute. La
température optimale semble se situer autour de 3.5 à 4.0
(350 − 400◦ C). Il faudrait réaliser des essais supplémentaires dans
cette zone pour affiner la recherche de l’optimum et modéliser la
relation à l’aide d’un modèle quadratique (y = ax 2 + bx + c) plutôt
que linéaire.
November 12, 2025 48 / 48