Variable Statistique
├── Qualitative
│ ├── Nominale Pas d’ordre (Exple: Couleur, Sexe)
│ └── Ordinale Ordre (Exple: Niveau d’éducation)
└── Quantitative
├── Discrète Valeurs isolées (Exple: Nombre d’enfants)
└── Continue Valeurs infinies dans un intervalle (Exple: Taille)
Courbes et Graphiques adaptés :
Type de variable Représentation graphique conseillée
Nominale (qualitative sans Diagramme en barres, Diagramme
ordre) circulaire
Ordinale (qualitative avec Diagramme en barres ordonné,
ordre) Histogramme
Discrète (quantitative finie) Diagramme en bâtons
Continue (quantitative infinie) Histogramme, Courbe de densité
Si le caractère étudié est quantitatif discret le diagramme qui convient
est le diagramme en bâton et le polygone des effectifs.
Si le caractère étudié est qualitatif le diagramme qui convient est le
diagramme à bandes.
Si le caractère étudié est quantitatif continu le diagramme qui
convient est l’histogramme et le polygone des effectifs.
Définition de la médiane
La médiane est une mesure de tendance centrale qui divise une série
statistique en deux parties égales. Autrement dit, c'est la valeur qui sépare
les 50 % inférieurs des 50 % supérieurs des données.
Elle est particulièrement utile lorsqu’il y a des valeurs extrêmes dans la série,
car contrairement à la moyenne, elle n'est pas influencée par ces valeurs
aberrantes.
Comment calculer la médiane ?
Le calcul dépend du nombre total d'observations 𝑛 :
Cas 1 : Nombre impair d’observations
Si 𝑛 est impair, la médiane est la valeur centrale de la série ordonnée.
Médiane = 𝑋𝑛+1
2
Exemple :
Données ordonnées : 3, 5, 7, 9, 11
𝑛 = 5 (nombre impair)
5+1
Position de la médiane : 2
= 3 3ème valeur
Médiane = 7
Cas 2 : Nombre pair d’observations
Si 𝑛 est pair, la médiane est la moyenne des deux valeurs centrales.
𝑋𝑛+𝑋𝑛
+1
2 2
Médiane = 2
Exemple :
Données ordonnées : 2, 4, 6, 8, 10, 12
𝑛 = 6 (nombre pair)
Les deux valeurs centrales sont 6 et 8 (positions 3 et 4)
6+8
Médiane = 2 =7
Interprétation de la médiane
Elle représente le "milieu" des données, utile pour comprendre la répartition
des valeurs.
Elle est robuste aux valeurs extrêmes, contrairement à la moyenne qui peut
être influencée par des valeurs très grandes ou très petites.
Si la distribution est symétrique, la médiane et la moyenne sont proches.
Si la distribution est asymétrique, la médiane peut être différente de la
moyenne et donne une meilleure idée du "centre" réel des données.
Exemple pratique : Salaire d'une entreprise
Imaginons qu'une entreprise ait ces salaires mensuels (en milliers d’euros) :
1, 1.5, 1.8, 2, 2.2, 50
1+1.5+1.8+2+2.2+50
Moyenne : = 9.75 (faussée par le salaire de 50k€)
6
1.8+2
Médiane : 2
= 9.75 (représente mieux les salaires typiques)
Ici, la médiane est plus représentative de la réalité que la moyenne, car elle
n'est pas influencée par la valeur extrême de 50k€.
Conclusion
✅ La médiane est la valeur qui sépare une série en deux moitiés égales.
✅ Elle est facile à calculer et moins sensible aux valeurs extrêmes que la
moyenne.
✅ Elle donne une meilleure idée du centre réel des données lorsqu'il y a des
écarts importants.
Définition du Mode
Le mode est la valeur qui apparaît le plus souvent dans une série de données.
Il représente donc la valeur la plus fréquente et permet d’identifier la
tendance principale d’une distribution.
Le mode est particulièrement utile pour :
✅ Analyser des données qualitatives (ex : couleur préférée, catégorie d’un
produit).
✅ Détecter la valeur dominante dans une série numérique.
✅ Résumer une distribution sans calculs complexes.
Comment calculer le Mode ?
Cas 1 : Un mode unique (unimodal)
Si une seule valeur est la plus fréquente, on dit que la distribution est
unimodale.
Exemple : Nombre d'élèves ayant obtenu une note
Note 10 12 14 15 18
Fréquence 2 4 3 1 4
La note 12 et 18 apparaissent 4 fois chacune (plus que les autres).
La série est bimodale avec 12 et 18 comme modes.
Cas 2 : Plusieurs modes (bimodal ou multimodal)
Si deux ou plusieurs valeurs ont la même fréquence maximale, la série est
bimodale ou multimodale.
Exemple :
Données : 3, 5, 7, 5, 9, 3, 3, 5, 9
Modes : 3 et 5 (fréquence = 3 fois chacun).
Cas 3 : Aucun mode
Si toutes les valeurs apparaissent une seule fois, il n’y a pas de mode.
Exemple :
Données : 2, 4, 6, 8, 10
Chaque valeur apparaît une seule fois pas de mode.
Interprétation du Mode
Série unimodale : Une seule valeur dominante.
Série bimodale/multimodale : Deux ou plusieurs valeurs fréquentes.
Pas de mode : Aucune valeur dominante.
Le mode est utile en statistique descriptive, surtout pour analyser des
données catégoriques (ex : couleur préférée, marque de téléphone la plus
achetée).
Exemple pratique : Couleur préférée d’un groupe
Couleur Rouge Bleu Vert Jaune Bleu
Fréquence 5 8 3 4 8
Mode = Bleu (8 fois) (valeur la plus fréquente).
Différences entre Mode, Médiane et Moyenne
Mesure Définition Utilisation
Mode Valeur la plus fréquente Meilleure pour les données qualitatives
(ex : marque préférée)
Médiane Valeur centrale Idéale si la distribution est asymétrique
(ex : salaires)
Moyenne Somme des valeurs ÷ Sensible aux valeurs extrêmes
nombre de valeurs
Exemple : Salaires (en milliers d’€) :
1, 1.5, 1.8, 2, 2.2, 50
Moyenne = 9.75 (faussée par 50k€)
Médiane = 1.9 (représente mieux la majorité des salaires)
Mode = 1 et 2 (les valeurs les plus fréquentes)
Médiane et Mode pour une Série Continue
Dans une série continue, les données sont regroupées en classes
d’intervalles (ex : 0-10, 10-20…). On ne connaît pas les valeurs exactes des
observations, donc on utilise des formules spécifiques pour calculer la
médiane et le mode.
Calcul de la Médiane pour une Série Continue
La médiane est la valeur qui coupe la distribution en deux moitiés égales.
Formule de la médiane :
𝑁
−𝐹
𝑀é𝑑𝑖𝑎𝑛𝑒 = 𝐿 + ( 2 )∗ℎ
𝑓
avec:
𝐿 = borne inférieure de la classe médiane
𝑁 = effectif total (somme des fréquences)
𝐹 = fréquence cumulée avant la classe médiane
𝑓 = fréquence de la classe médiane
ℎ = amplitude de la classe (largeur de l’intervalle)
Exemple de Calcul de la Médiane
Classes Effectifs (𝒇) Effectif Cumulé
0 – 10 5 5
10 – 20 8 13
20 – 30 12 25 (Classe Médiane)
30 – 40 10 35
40 – 50 7 42
Étapes :
𝑁
1. Effectif total 𝑁 = 42 2 = 21
2. La première classe avec une fréquence cumulée ≥ 21 est 20 – 30 c'est
la classe médiane
3. Paramètres :
o 𝐿 = 20
o 𝐹 = 13 (fréquence cumulée avant la classe médiane)
o 𝑓 = 12 (effectif de la classe médiane)
o ℎ = 10 (largeur de l’intervalle)
Calcul de la médiane :
𝑁
−𝐹
𝑀é𝑑𝑖𝑎𝑛𝑒 = 𝐿 + ( 2 )∗ℎ
𝑓
21 − 13
𝑀é𝑑𝑖𝑎𝑛𝑒 = 20 + ( ) ∗ 10
12
𝑀é𝑑𝑖𝑎𝑛𝑒 = 26.67
✅ Médiane ≈ 26.67
Calcul du Mode pour une Série Continue
Le mode est la valeur correspondant à la classe ayant la fréquence
maximale.
Formule du mode :
𝑑1
𝑀𝑜𝑑𝑒 = 𝐿 + ( )∗ℎ
𝑑1 + 𝑑2
avec:
𝐿 = borne inférieure de la classe modale
𝑑1 = différence entre la fréquence de la classe modale et celle de la classe
précédente
𝑑2 = différence entre la fréquence de la classe modale et celle de la classe
suivante
ℎ = amplitude de la classe
Exemple de Calcul du Mode
On reprend la même table :
Classes Effectifs (𝒇)
0 – 10 5
10 – 20 8
20 – 30 12 (Classe Modale)
30 – 40 10
40 – 50 7
1. Classe modale = 20 – 30 (car 𝒇 = 𝟏𝟐, la plus grande fréquence)
2. Paramètres :
o 𝐿 = 20 (borne inférieure de la classe modale)
o 𝑑1 = 12 − 8 = 4
o 𝑑2 = 12 − 10 = 2
o ℎ = 10 (largeur de la classe)
3. Calcul du mode :
𝑑1
𝑀𝑜𝑑𝑒 = 𝐿 + ( )∗ℎ
𝑑1 + 𝑑2
4
𝑀𝑜𝑑𝑒 = 20 + ( ) ∗ 10
4+2
𝑀𝑜𝑑𝑒 = 26.67
✅ Mode ≈ 26.67
Interprétation et Comparaison entre Mode, Médiane et Moyenne
Mesure Interprétation
Moyenne Moyenne arithmétique des valeurs (très influencée par les valeurs
extrêmes)
Médiane Valeur centrale, coupe la distribution en deux (utile si asymétrie)
Mode Valeur la plus fréquente (indique la tendance principale)
Dans notre exemple, Médiane ≈ 26.67 et Mode ≈ 26.67, donc la distribution
est plutôt symétrique. Si le mode était beaucoup plus petit ou plus grand
que la médiane, cela indiquerait une asymétrie.
Quartiles : Q1 et Q3 dans une Série Continue
Les quartiles sont des valeurs qui divisent une série en quatre parties égales.
𝑸𝟏 (1er quartile) : 25% des données sont inférieures à cette valeur.
𝑸𝟑 (3e quartile) : 75% des données sont inférieures à cette valeur.
On utilise des formules spécifiques pour calculer 𝑸𝟏 et 𝑸𝟑 dans une série
continue (regroupée en classes d’intervalles).
Formule Générale pour les Quartiles
La formule pour calculer 𝑸𝟏 ou 𝑸𝟏 est similaire à celle de la médiane :
𝑘𝑁
−𝐹
𝑄𝑘 = 𝐿 + ( 4 )∗ℎ
𝑓
avec :
𝑘 = 1 pour 𝑄1 et 3 pour 𝑄3
𝐿 = borne inférieure de la classe du quartile
𝑁 = effectif total (somme des fréquences)
F = fréquence cumulée avant la classe du quartile
𝑓 = fréquence de la classe du quartile
ℎ = amplitude de la classe (largeur de l’intervalle)
Exemple de Calcul de 𝑄1 et 𝑄3
Classes Effectifs (𝒇) Effectif Cumulé
0 – 10 5 5
10 – 20 8 13
20 – 30 12 25 (Q1)
30 – 40 10 35
40 – 50 7 42 (Q3)
L'effectif total N=42
1∗42
𝑸𝟏 Position = 4
= 10.5
3∗42
𝑸𝟑 Position = 4
= 31.5
Calcul de 𝑄1
La première classe ayant une fréquence cumulée ≥ 10.5 est 20 – 30
𝐿 = 20
F = 13 (effectif cumulé avant cette classe)
𝑓 = 12
ℎ = 10
1∗𝑁
−𝐹
𝑄1 = 𝐿 + ( 4 )∗ℎ
𝑓
42
− 13
𝑄1 = 20 + ( 4 ) ∗ 10
12
𝑄1 = 17.92
Calcul de 𝑄3
La première classe ayant une fréquence cumulée ≥ 31.5 est 40 – 50
𝐿 = 30
F = 25
𝑓 = 10
ℎ = 10
3∗𝑁
−𝐹
𝑄3 = 𝐿 + ( 4 )∗ℎ
𝑓
3 ∗ 42
− 25
𝑄3 = 20 + ( 4 ) ∗ 10
10
𝑄3 = 36.5
Interprétation de 𝑄1 et 𝑄3
𝑄1 = 17.92 : 25% des valeurs sont inférieures à 17.92
𝑄3 = 36.5 : 75% des valeurs sont inférieures à 36.5
L’écart interquartile (IQR), qui mesure la dispersion des données, est :
𝐼𝑄𝑅 = 𝑄3 − 𝑄1 = 36.5 - 17.92 = 18.58
*****************************************************************************************
Exercice 1 :
Les diagrammes qui conviennent sont les histogrammes.
La distribution des temps d’hospitalisation avec le traitement B correspond à
des temps d’hospitalisation plus courts (des temps d’hospitalisations réduits)
: le traitement B est plus rapide que le traitement A (i.e. Le traitement B est
plus efficace que A).
Traitement A :
𝑥𝑖 𝑛𝑖 𝑛𝑖 ∗ 𝑥𝑖 𝑛𝑖 ∗ 𝑥𝑖2
1.5 2 3 4.5
4 3 12 48
5.5 6 33 181.5
6.5 10 65 422.5
7.5 18 135 1012.5
8.5 23 195.5 1661.75
9.5 18 171 1624.5
10.5 12 126 1323
13 8 104 1352
Total 100 844.5 7630.25
1 1
La moyenne : 𝑥 = 𝑁 ∑9𝑖=1 𝑥𝑖 ∗ 𝑛𝑖 = 100 (844.5) = 8.445
1 2 1
La variance : 𝑣𝑎𝑟(𝑥) = 𝑁 ∑9𝑖=1 𝑛𝑖 𝑥𝑖2 − 𝑥 = 100 (7630.25) − 8.4452 = 4.984
L’écart-type : 𝜎𝑥 = 2.23
Traitement B : …………………………
.
.
.
.
.
Exercice 2
Cinq personnes souffrant d’obésité suivent un régime d’amincissement. Le tableau
suivant donne le nombre de Kgs perdus par chacune d’elle pendant la période de cure
suivie.
N° de l’individu 1 2 3 4 5
Durée X (en mois) 3 1 2 4 5
Nombre Y de Kgs 6 4 5 9 11
perdus
1. Donner la droite de la régression linéaire (Y en fonction de X).
2. Calculer le coefficient de corrélation linéaire et conclure.
Correction de l'exercice 2
1. 𝑌 = 𝑎𝑋 + 𝑏
𝑐𝑜𝑣(𝑥,𝑦)
𝑎 = 𝑣𝑎𝑟(𝑥)
{
𝑏 = 𝑦 − 𝑎𝑥
1 2 2
𝑣𝑎𝑟(𝑥) = 𝑁 ∑5𝑖=1 𝑥𝑖2 − 𝑥 = 𝑥 2 − 𝑥 = 11 − 9 = 2
1 1
Avec 𝑥 = 𝑁 ∑5𝑖=1 𝑥𝑖 = 3 ; 𝑦 = 𝑁 ∑5𝑖=1 𝑦𝑖 = 7
1 1
𝐶𝑜𝑣(𝑥, 𝑦) = ∑5𝑖=1 𝑥𝑖 𝑦𝑖 − 𝑥 𝑦 = (3 ∗ 6 + 1 ∗ 4 + 2 ∗ 5 + 4 ∗ 9 + 5 ∗ 11) − 3 ∗ 7 = 3.6
𝑁 5
𝑐𝑜𝑣(𝑥,𝑦) 3.6
𝑎 = 𝑣𝑎𝑟(𝑥) = 2 = 1.8
{
𝑏 = 𝑦 − 𝑎𝑥 = 7 − 1.8 ∗ 3 = 1.6
𝑌 = 1.8 ∗ 𝑋 + 1.6
𝑐𝑜𝑣(𝑥,𝑦)
2. 𝑟 =
𝜎𝑥𝜎𝑦
1 2 2
𝑣𝑎𝑟(𝑦) = 𝑁 ∑5𝑖=1 𝑦𝑖2 − 𝑦 = 𝑦 2 − 𝑦 = 55.8 − 49 = 6.8
𝜎𝑦 = 2.607681
𝑐𝑜𝑣(𝑥,𝑦) 3.6
𝑟= 𝜎𝑥𝜎𝑦
= = 0.97618706018
√2∗√6.8
1. 𝑅 = 𝑟 = 0.98802179135
2
Corrélation linéaire forte entre X et Y