0% ont trouvé ce document utile (0 vote)
12 vues45 pages

Introduction à la Statistique Descriptive

Ce document est un cours de statistique descriptive destiné aux étudiants de Licence 2, présenté par Dr Coulibaly Harouna à l'ESATIC. Il couvre des thèmes tels que la terminologie de base, les représentations graphiques, les paramètres numériques, et les statistiques à deux variables. Le contenu est structuré en plusieurs sections avec des sous-sections détaillant les concepts et méthodes statistiques essentiels.

Transféré par

angechristopher2
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
12 vues45 pages

Introduction à la Statistique Descriptive

Ce document est un cours de statistique descriptive destiné aux étudiants de Licence 2, présenté par Dr Coulibaly Harouna à l'ESATIC. Il couvre des thèmes tels que la terminologie de base, les représentations graphiques, les paramètres numériques, et les statistiques à deux variables. Le contenu est structuré en plusieurs sections avec des sous-sections détaillant les concepts et méthodes statistiques essentiels.

Transféré par

angechristopher2
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Statistique descriptive

Licence 2

Dr COULIBALY Harouna

ESATIC

Université Félix Houphouët-Boigny


Table des matières

1 Introduction 5
1.1 Terminologie de base . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
1.2 Caractères . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
1.2.1 Caractère qualitatif . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
1.2.2 Caractère quantitatif . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
[Link] Caractère quantitatif discret . . . . . . . . . . . . . . . . . . . . 6
[Link] Caractère quantitatif continu . . . . . . . . . . . . . . . . . . . 6
1.3 Effectif, fréquences . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 7
1.3.1 Effectifs cumulés, Fréquences cumulées . . . . . . . . . . . . . . . . . . . 7
1.4 Présentation générale des tableaux statistiques . . . . . . . . . . . . . . . . . . . 8

2 Représentations graphiques 11
2.1 Introduction . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
2.2 Diagrammes à secteurs . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 11
2.3 Diagramme en barres, diagramme en bâtons . . . . . . . . . . . . . . . . . . . . 12
2.4 Histogramme . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 14
2.5 Diagramme de fréquences cumulées . . . . . . . . . . . . . . . . . . . . . . . . . . 15
2.5.1 Cas d’un caractère qualitatif ordinal . . . . . . . . . . . . . . . . . . . . . 15
2.5.2 Cas d’un caractère quantitatif discret . . . . . . . . . . . . . . . . . . . . 16
2.5.3 Cas d’un caractère quantitatif continu . . . . . . . . . . . . . . . . . . . 17

3 Paramètres numériques 19
3.1 Paramètres de tendance centrale . . . . . . . . . . . . . . . . . . . . . . . . . . . 19
3.1.1 Le mode . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19
[Link] Caractère quantitatif discret . . . . . . . . . . . . . . . . . . . . 19
[Link] Caractère quantitatif continu . . . . . . . . . . . . . . . . . . . 19
3.1.2 La moyenne arithmétique . . . . . . . . . . . . . . . . . . . . . . . . . . . 20
[Link] Données brutes . . . . . . . . . . . . . . . . . . . . . . . . . . . 20
[Link] Données rangées : caractère quantitatif discret . . . . . . . . 20
[Link] Données rangées : caractère quantitatif continu . . . . . . . . 20
[Link] Remarques . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21
3.1.3 La moyenne géométrique . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21
3.1.4 La moyenne harmonique . . . . . . . . . . . . . . . . . . . . . . . . . . . . 21
3.1.5 La médiane . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 22
[Link] Caractère quantitatif discret . . . . . . . . . . . . . . . . . . . 22
[Link] Caractère quantitatif continu . . . . . . . . . . . . . . . . . . . 24
[Link] Remarques . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24
3.1.6 Les quantiles . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 24
3.1.7 Boı̂te à moustaches . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 26

2
TABLE DES MATIÈRES 3
3.2 Paramètres de dispersion . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 26
3.2.1 L’étendue . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 27
3.2.2 L’écart moyen absolu . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 27
3.2.3 Variance, écart-type . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28
3.2.4 L’écart inter-quartile . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 28
3.2.5 Le Coefficient de variation . . . . . . . . . . . . . . . . . . . . . . . . . . . 28
3.3 Les paramètres de concentration . . . . . . . . . . . . . . . . . . . . . . . . . . . 29
3.3.1 La médiale . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 29
3.3.2 L’écart entre médiane et médiale . . . . . . . . . . . . . . . . . . . . . . . 30
3.3.3 La courbe de Lorenz . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
3.3.4 L’indice de Gini . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
3.4 Paramètres de forme . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
3.4.1 Moments . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 31
3.4.2 Asymétrie . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 32
3.4.3 L’aplatissement . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 34

4 Statistiques à deux variables 35


4.1 Introduction . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35
4.2 Généralités . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35
4.2.1 Distribution conjointe . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 35
4.2.2 Distributions marginales . . . . . . . . . . . . . . . . . . . . . . . . . . . . 36
4.2.3 Distributions conditionnelles . . . . . . . . . . . . . . . . . . . . . . . . . 38
4.2.4 Indépendance . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 38
4.3 Liaison entre deux caractères qualitatifs . . . . . . . . . . . . . . . . . . . . . . . 39
4.3.1 Mesure de l’intensité de la liaison . . . . . . . . . . . . . . . . . . . . . . 39
4.3.2 Coefficient de Cramer . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 40
4.3.3 Exercices . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 40
[Link] Exercice 1 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 40
[Link] Exercice 2 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 40
4.4 Liaison entre deux caractères quantitatifs . . . . . . . . . . . . . . . . . . . . . . 41
4.4.1 Représentation graphique : nuage de points. . . . . . . . . . . . . . . . . 41
4.4.2 Covariance, coefficient de correlation linéaire . . . . . . . . . . . . . . . 41
4.4.3 Regression linéaire . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 43
4.4.4 Exemple Taux de cholestérol en fonction de l’âge . . . . . . . . . . . . . 43
4.5 Caractère quantitatif et caractère qualitatif . . . . . . . . . . . . . . . . . . . . . 45
4.5.1 Rapport de correlation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 45
4.5.2 Exemple . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 46

5 Analyse combinatoire 47
5.1 Principe multiplicatif . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 47
5.2 Arrangements . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 47
5.2.1 Arrangements sans répétitions . . . . . . . . . . . . . . . . . . . . . . . . 47
5.2.2 Arrangements avec répétitions . . . . . . . . . . . . . . . . . . . . . . . . 48
5.3 Combinaisons . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 48
5.3.1 Combinaisons sans répétitions . . . . . . . . . . . . . . . . . . . . . . . . 48
5.3.2 Combinaisons avec répétitions . . . . . . . . . . . . . . . . . . . . . . . . 48
Chapitre

1 Introduction

La statistique est l’ensemble des méthodes et des techniques destinées à la collecte, l’ex-
ploration, l’analyse et l’interprétation des données. Elle a pour objectif de mettre en évidence
des informations cachées dans ces données en vue généralement de prendre une décision
concernant le phénomène ayant généré ces données. La statistique se divise généralement en
deux grandes parties :
- la statistique descriptive qui a pour but d’obtenir un résumé des données ;
- la statistique inférentielle qui a pour but d’utiliser les données afin de rechercher des
modèles ou de faire des prévisions.

1.1 Terminologie de base


Population. C’est l’ensemble sur lequel porte l’étude statistique. La population que l’on
envisage en statistique dépend du domaine que l’on traite, et peut donc aussi bien
être constituée d’êtres humains que d’animaux voire d’objets.
Individu ou unité statistique. C’est un élément de la population.
Echantillon. C’est un sous-ensemble de la population ; l’échantillon doit être représen-
tatif de la population, c’est à dire qu’il doit refléter fidèlement sa composition et
sa complexité ; en effet, les informations obtenues à partir de l’échantillon doivent
pouvoir être étendues, sans erreur grave, à l’ensemble de la population.
Enquête statistique. C’est l’opération consistant à collecter des données sur l’ensemble
des individus d’un échantillon ou éventuellement la population entière.
Recensement. C’est une enquête statistique effectuée sur toute la population.
Sondage. C’est une enquête statistique effectuée sur un échantillon de la population.
Caractère. C’est une grandeur ou un attribut observable sur un individu ; parfois, on
emploie le terme de variable statistique au lieu de caractère.
Modalité. C’est un état du caractère ; les modalités d’un caractère sont exhaustives et
incompatibles, c’est à dire que chaque individu présente une et une seule modalité
du caractère.
Série statistique : C’est la suite des valeurs du caractère observée sur chaque individu
de l’ensemble étudié (population ou échantillon).

5
6 CHAPITRE 1. INTRODUCTION

1.2 Caractères
On distingue deux types de caractères : le caractère qualitatif et le caractère quantitatif.

1.2.1 Caractère qualitatif


Le caractère est dit qualitatif si ses modalités sont non mesurables. Le caractère qualitatif
est dit ordinal s’il existe un ordre entre ses modalités. Dans le cas contraire, il est dit qualitatif
nominal.

Exemple 1.2.1. Caractère qualitatif ordinal.


- Population : la classe.
- Individu : un étudiant
- Caractère : décision du jury
- Modalités : ajourné, passable, assez-bien, bien, très bien.

Exemple 1.2.2. Caractère qualitatif nominal.


- Population : la classe.
- Individu : un étudiant
- Caractère : groupe sanguin.
- Modalités : A, B, AB et O.

1.2.2 Caractère quantitatif


Lorsque les modalités d’un caractère sont mesurables, on dit que ce caractère est quan-
titatif.

[Link] Caractère quantitatif discret


Le caractère quantitatif est dit discret lorsqu’il ne peut prendre que des valeurs isolées
notées par exemple x1 , x2 , . . . , xk où k est le nombre de modalités.

Exemple 1.2.3. - Population : le personnel d’une entreprise


- Individu : un employé
- Caractère : nombre d’enfants
- Modalités : 0, 1, 2, 3, 4, 5, 6 et 7.

[Link] Caractère quantitatif continu


Le caractère quantitatif est dit continu lorsqu’il peut prendre n’importe quelle valeur d’un
intervalle de l’ensemble des nombres réels R. Dans ce cas, l’intervalle des valeurs possibles
est divisé en k classes

[a 0 , a 1 [, [a 1 , a 2 [, . . . , [a k−1 , a k [, où a 0 < a 1 < . . . < a k−1 < a k .


a +a
a j−1 et a j sont les frontières de la j -ième classe, c j = j−12 j est le centre de celle-ci. L’am-
plitude de cette classe est a j − a j−1 . On supposera que les observations d’une classe sont
concentrées au centre.

Exemple 1.2.4. - Population : l’ensemble des ouvriers d’une entreprise


1.3. EFFECTIF, FRÉQUENCES 7
- Individu : un ouvrier
- Caractère : salaire mensuel net (en milliers francs)
- Modalités : [80, 100[, [100, 110[, [110, 120[, [120, 130[ et [130, 150[.
Le centre de la classe [80, 100[ est :
80 + 100
= 90.
2
La répartition en classes des données nécessite de définir a priori le nombre de classes J
et donc l’amplitude de chaque classe. Il existe des formules qui nous permettent d’établir le
nombre de classes et l’amplitude pour une série statistique de n observations.
— La règle de Sturge : J = 1 + 3.3 × log10 (n)
— La règle de Yule : J = 2.5 × n1/4 .
L’amplitude de classe est obtenue ensuite de la manière suivante :
xmax − xmin
amplitude =
J
où xmax (resp. xmin ) désigne la plus grande (resp. la plus petite) valeur observée.

1.3 Effectif, fréquences


On observe un caractère X présentant k modalités sur n individus. L’effectif n i de la
i -ème modalité du caractère est le nombre d’individus qui possède cette modalité. On a
k
X
n = n1 + . . . + n k = ni.
i =1

On appelle fréquence de la i -ème modalité le rapport


ni
fi = .
n
La fréquence est la proportion par rapport au nombre d’observations des individus pour
lesquels le caractère prend la valeur x i ou appartient à la classe [a i , a i+1 [. Elle est un nombre
réel compris entre 0 et 1. Nous avons
k
X
f i = 1.
i =1

On exprime la fréquence souvent en pourcentage :


ni
fi = × 100 %
n
Dans ce cas, nous avons :
k
X
f i = 100.
i =1

1.3.1 Effectifs cumulés, Fréquences cumulées


On suppose que les modalités du caractère quantitatif étudié sont rangées par ordre
croissant. L’effectif cumulé croissant de la i -ème modalité x i est la somme des effectifs des
modalités inférieures ou égales à cette modalité :
i
X
Ni = n j = n1 + · · · + n i .
j =1
8 CHAPITRE 1. INTRODUCTION
Le nombre n i représente le nombre d’observations inférieures ou égale à x i .

La fréquence cumulée croissante de la i -ème modalité x i est la somme des fréquences des
modalités inférieures ou égales à cette modalité :

i
X Ni
Fi = fj = .
j =1 n

Cette fréquence représente la proportion (ou le pourcentage) des observation inférieures ou


égales à la i -ème modalité x i du caractère quantitatif si il est discret ou bien inférieures à
la borne supérieure du i -ème intervalle s’il est continu.

L’effectif cumulé décroissant de la i -ème modalité x i est la somme des effectifs des modalités
supérieures ou égales à cette modalité :

k
X
Di = n j.
j= i

La fréquence cumulée décroissante de la i -ème modalité est la somme des fréquences des
modalités supérieures ou égales à cette modalité :

k
X Di
Gi = fj = .
j= i n

1.4 Présentation générale des tableaux statistiques


On considère un échantillon de taille n issu d’une population. Pour chaque individu, on
fait une observation concernant le caractère X comportant k modalités M1 , M2 ,. . ., M k . On
obtient une série statistique x1 , . . . , xn . Les données recueillies, appelées données brutes, sont
soumises à un premier traitement afin d’en faciliter à la fois la présentation et l’exploitation.
Cela consiste à classer chacun des n individus dans les k sous-ensembles définis par les
diverses modalités du caractère X . Pour chaque modalité M i , on pourra inscrire dans le
tableau statistique son effectif n i , son effectif cumulé croissant ou décroissant, sa fréquence
f i et sa fréquence cumulée croissante ou décroissante. On prendra toujours soin de préciser
dans la présentation du tableau :

- la population étudiée et le caractère ;

- l’origine du renseignement.

La présentation des données sous forme de tableaux est intéressante car elle propose un
premier résumé. On dégage ainsi les tendances de la population. Ces tableaux vont nous
permettre de faire des représentations graphiques. L’idée sera de rendre compte visuelle-
ment du résumé que nous avons commencé. Ensuite, pour les caractères quantitatifs, nous
chercherons à résumer numériquement l’information.
1.4. PRÉSENTATION GÉNÉRALE DES TABLEAUX STATISTIQUES 9
Modalité Effectif Effectif Cumulé Fréquence Fréquence cumulée
n1
M1 n1 n1 f1 = n F1 = f 1
n2
M2 n2 n1 + n2 f2 = n F2 = f 1 + f 2
.. .. .. .. ..
. . . . .
j j
X nj X
Mj nj n= ni fj = n Fj = fi
i =1 i =1
.. .. .. .. ..
. . . . .
k k
X nk X
Mk nk n= ni fk = n Fk = fi = 1
i =1 i =1
Total n 1

Exemple 1.4.1. Caractère quantitatif discret : Répartition des ménages selon le nombre de
pièces du logement occupé

Nombre de pièces Nombre de ménages Fréquence Fréquence cumulée Fréquence cumulée


croissante decroissante
20
1 20 200 = 0. 1 0.1 1
2 40 0.2 0.3 0.9
3 40 0.2 0.5 0.7
4 60 0.3 0.8 0.5
5 40 0.2 1 0.2
Total 200 1

Exemple 1.4.2. Caractère quantitatif continu : Répartition des ouvriers selon leur salaire
mensuel net (en milliers francs).
Salaire Effectif Fréquence (%) Fréquence cumulées Fréquence cumulées
croissante (%) decroissantes (%)
[80, 100[ 26 18.6 18.6 100
[100, 110[ 33 23.5 42.1 81.4
[110, 120[ 64 45.8 87.9 57.9
[120, 130[ 7 5.0 92.9 12.1
[130, 150[ 10 7.1 100 7.1
Total 140 100

Exemple 1.4.3. Caractère qualitatf ordinal : Répartition de 50 personnes selon le dernier


diplôme obtenu.

Diplôme Nombre de personnes Fréquence Fréquence cumulée Fréquence cumulée


croissante decroissante
4
Sans diplôme 4 50 = 1
Primaire 11
Secondaire 14
Supérieur 21
Total 50
10 CHAPITRE 1. INTRODUCTION
Exemple 1.4.4. Caractère qualitatif nominal : Répartition des touristes et visiteurs arrivés
à l’aéoroport Félix Houphouet-Boigny par continent de provenance en 1999.

Continent Effectif Fréquence (%)


Afrique 168238
Europe 164542
Amérique 27540
Asie 15058
Océanie 1014
Total 100

Source : Ministère de l’Economie et des Finances, 2007.

Remarque 1.4.1. Il s’agit d’un caractère qualitatif nominal. Les fréquences cumulées sont
sans intérêt car il n’existe pas de relation d’ordre entre les modalités.
Chapitre

2 Représentations graphiques

2.1 Introduction
La représentation graphique a pour objectif de visualiser la distribution des données.
Dans ce chapitre, nous passons en revue les principales représentations graphiques utilisées
dans les analyses statistiques. Selon le type de variable statistique étudié, on a recours à des
graphiques différents.

2.2 Diagrammes à secteurs


Les diagrammes à secteurs conviennent pour représenter les effectifs et les fréquences
des caractères qualitatifs ou des caractères quantitatifs discrets. Un diagramme en secteurs
est un graphique constitué d’un cercle divisé en secteurs dont les angles au centre sont
proportionnels aux effectifs (ou aux fréquences). L’angle α i d’une modalité d’effectif n i ou
de fréquence f i est donné en dégrés par

ni
αi = × 360 = f i × 360.
n

Exemple 2.2.1. Caractère qualitatif :

Continent Effectif Fréquence (%)


Afrique 168238 44.7
Europe 164542 43.72
Amérique 27540 7.32
Asie 15058 4.00
Océanie 1014 0.27
Total 376392 100

Table 2.1 – Répartition des touristes et visiteurs arrivés à l’aéoroport Félix Houphouet-
Boigny par continent de provenance en 1999
Source : Ministère de l’Economie et des Finances, 2007.

11
12 CHAPITRE 2. REPRÉSENTATIONS GRAPHIQUES

Afrique

Oceanie
Asie

Amerique

Europe

2.3 Diagramme en barres, diagramme en bâtons


Les diagrammes en barres et les diagrammes en bâtons conviennent pour représenter les
fréquences des caractères qualitatifs ou quantitatifs discrets. Les modalités du caractère sont
en abscisse et les fréquences sont en ordonné. Dans le cas d’un caractère qualitatif nominal,
la position des modalités n’a pas de signification particulière. Si le caractère est qualitatif
ordinal ou quantitatif discret, on placera les modalités dans leur ordre naturel.
— Le digramme en barres : à chaque modalité du caractère, on associe un rectangle de
base constante dont la hauteur est proportionnelle à la fréquence.
— Le diagramme en bâtons : à chaque modalité du caractère, on fait correspondre un
segment vertical de longueur proportionnelle à la fréquence de cette modalité.

Exemple 2.3.1. Le tableau suivant donne la répartition selon le groupe sanguin de 50 indi-
vidus pris au hasard dans une population :

Groupe sanguin A B AB O
Effectif 25 10 12 3

1. Déterminer la variable statistique et son type.

Variable statistique : groupe sanguin


Nature : qualitative nominale.
2.3. DIAGRAMME EN BARRES, DIAGRAMME EN BÂTONS 13
2. Donnez une représentation graphique qui fasse apparaı̂tre l’importance relative des
différents groupes sanguins.

Nous pouvons faire un diagramme en barres ou un diagramme en secteurs

25
20
15
10
5
0

A B AB O

Exemple 2.3.2. A Cauphygombokro, en vue d’instaurer la taxe d’habitation, une enquête


portant sur le nombre de pièces du logement occupé a été réalisée auprès des ménages. Cette
enquête a donné les résultats suivants :

Nomrbe de pièces Nombre de ménages


1 20
2 40
3 40
4 60
5 40

1. Caractériser la distribution (population, individu, caractère, nature du caractère, mo-


dalités)
Population : l’ensemble des ménages de Cauphygombokro
Individu : un ménage
Caractère : nombre de pièces du logement occupé
Modalités : 1,2,3,4,5.
2. Tracer le diagramme en bâtons.
14 CHAPITRE 2. REPRÉSENTATIONS GRAPHIQUES

60
50
40
30
20
10
0

1 2 3 4 5

2.4 Histogramme
L’histogramme est la représetation graphique de la distribution des effectifs ou des fré-
quences d’une variable statistique continue. Pour construire l’histogramme, on place en abs-
cisse les différentes extrémités a i des classes, puis on trace, pour chaque classe, un rectangle
parallèle aux axes, de telle sorte que la partie parallèle à l’axe des abscisses ait une longueur
correspondant à l’amplitude de la classe et que la surface du rectangle soit proportionnelle à
l’effectif (ou à la fréquence) de la classe (ceci afin de bien visualiser l’importance de chaque
classe). Deux classes de même amplitude sont directement comparables. Cette comparaison
ne peut être étendue à des classes d’amplitude différente. Pour effectuer la comparaison
correctement, nous allons construire les histogrammes en respectant le protocole ci-dessus :
- Choix de l’unité d’amplitude u : on retiendra par exemple le pgcd des diverses am-
plitudes.
- Expression des amplitudes dans cette nouvelle unité d’amplitude :
a i − a i−1
ei =
u
- La hauteur h i de chaque rectangle est égale à
fi
hi =
ai
de telle sorte que la surface des rectangles représentatifs est égale à la fréquence de
la classe correspondante ; h i est la fréquence par unité d’amplitude de la classe i .
2.5. DIAGRAMME DE FRÉQUENCES CUMULÉES 15
Exemple 2.4.1. Répartition des ouvriers selon leur salaire mensuel net (en milliers francs.

Salaire Effectif Fréquence (%) Fréquence cumulées (%)


[80, 100[ 26 18.6 18.6
[100, 110[ 33 23.5 42.1
[110, 120[ 64 45.8 87.9
[120, 130[ 7 5.0 92.9
[130, 150[ 10 7.1 100
Total 140 100
0.04
0.03
0.02
0.01
0.00

80 100 110 120 130 150

2.5 Diagramme de fréquences cumulées


2.5.1 Cas d’un caractère qualitatif ordinal
Exemple 2.5.1. On interroge 50 personnes sur leur dernier diplôme obtenu (Sans diplôme,
Primaire, Secondaire, Supérieur non universitaire, Universitaire). On a obtenu la série sta-
tistique suivante (Sd= Sans diplôme, P=Primaire, Se=Secondaire, Su=Supérieur, U=Universitqire)
Sd Sd Sd Sd P P P P P P P P P P P Se Se Se Se Se Se Se Se Se Se Se Se Se Se Su Su Su
Su Su Su Su Su Su U U U U U U U U U U U U.

Eff EffCum Freq FreqCum


Sd 7 7 0.13 0.13
P 11 18 0.21 0.34
16 CHAPITRE 2. REPRÉSENTATIONS GRAPHIQUES
Se 14 32 0.26 0.60
Su 9 41 0.17 0.77
U 12 53 0.23 1.00

Les fréquences cumulées d’une variable qualitative ordinale sont représentées au moyen d’un
diagramme en barres.
1.0
0.8
0.6
0.4
0.2
0.0

Sd P Se Su U

2.5.2 Cas d’un caractère quantitatif discret


C’est la représentation graphique de la fonction F X définie par

0 si x < x1

F X ( x) = F i si x i ≤ x < x i+1 i = 1, . . . , k − 1,

1 si x ≥ xk

ou

0 si x < x1

F X ( x) = N i si x i ≤ x < x i+1 i = 1, . . . , k − 1,

n si x ≥ xk

Exemple 2.5.2. Répartition des ménages selon le nombre de pièces du logement occupé. Le
tableau statistique est :
2.5. DIAGRAMME DE FRÉQUENCES CUMULÉES 17
Effectif Frequence Frequence_Cumulees
1 20 10 10
2 40 20 30
3 40 20 50
4 60 30 80
5 40 20 100
A partir de ce tableau, nous déduisons :


0 si x < 1

10 si 1 ≤ x < 2






30 si 2 ≤ x < 3
F ( x) =


50 si 3 ≤ x < 4

80 si 4 ≤ x < 5





100 x ≥ 5

La courbe des fréquences cumulées est donc :


1.0
0.8
0.6
0.4
0.2
0.0

0 1 2 3 4 5 6

2.5.3 Cas d’un caractère quantitatif continu


La courbe cumulative est la représentation graphique de la fonction cumulative. Les
observations étant groupées par classe, on ne connait de cette fonction que les valeurs qui
correspondent aux extrémités supérieures de chaque classe et pour lesquelles elle est égale à
la fréquence cumulée F i :
F (a i ) = F i
18 CHAPITRE 2. REPRÉSENTATIONS GRAPHIQUES
Exemple 2.5.3. Répartition des ouvriers selon leur salaire mensuel net (en milliers francs.

Salaire Effectif Fréquence (%) Fréquence cumulées (%)


[80, 100[ 26 18.6 18.6
[100, 110[ 33 23.5 42.1
[110, 120[ 64 45.8 87.9
[120, 130[ 7 5.0 92.9
[130, 150[ 10 7.1 100
Total 140 100

Dans notre exemple, nous avons :

F (80) = 0
F (100) = 0.186
F (110) = 0.421
F (120) = 0.879
F (130) = 0.929
F (150) = 1.

La courbe des fréquences cumulées est donc :


1.0
0.8
0.6
0.4
0.2
0.0

80 100 110 120 130 150


Chapitre

3 Paramètres numériques

On distingue les paramètres de tendance centrale (ou de position ou de localisation), les


paramètres de dispersion, les paramètres de concentration et les paramètres de forme.

3.1 Paramètres de tendance centrale

Les paramètres de tendance centrale ont pour objet de résumer la série d’observations
par une valeur considérée comme représentative. Selon les cas, certains sont plus appropriés
que d’autres.

3.1.1 Le mode

Le mode est la valeur la plus fréquente du caractère. Il peut être calculé pour tous les
types de caractère (quantitatif ou qualitatif). Le mode n’est pas nécessairement unique.

[Link] Caractère quantitatif discret

Le mode d’un caractère quantitatif discret est la valeur pour laquelle la fréquence est
la plus élevée. Graphiquement, le mode est la modalité qui correspond au sommet du dia-
gramme en bâton.

[Link] Caractère quantitatif continu

Le mode est plus difficile à définir dans le cas d’un caractère quantitatif continu. Lorsque
les données sont regroupées en classes, on définit la classe modale. La classe modale n’est
pas la classe de plus grande fréquence mais la classe de plus grande densité c’est à dire de
plus grande fréquence par amplitude. Il est néanmoins possible de déterminer une valeur
unique comme mode.

19
20 CHAPITRE 3. PARAMÈTRES NUMÉRIQUES

La classe modale [ x i , x i+1 [ étant déterminée, le mode M0 est égale est :


∆1
M0 = x i + ( x i+1 − x i ).
∆1 + ∆2

Lorsque les classes adjacentes à la classe modale ont des densités de fréquences égales, le
mode coincide avec le centre de la classe modale. Le mode dépend beaucoup de la répartition
en classes.

3.1.2 La moyenne arithmétique


[Link] Données brutes
Pour une série statistique x1 , x2 , . . . , xn , on définit la moyenne par

1X n
x̄n = xi .
n i=1

C’est la somme de toutes les observations divisée par le nombre total des observations.

[Link] Données rangées : caractère quantitatif discret


Pour un caractère quantitatif discret dont les n observations sont rangées selon ses k
modalités x1 , . . . , xk d’effectifs respectifs n1 , . . . , n k , la moyenne est

1X k
x̄n = n i xi .
n i=1

[Link] Données rangées : caractère quantitatif continu


Pour un caractère quantitatif continu dont les n observations ont été réparties dans k
intervalles ([a i−1 , a i [) i=1,...,k , la moyenne est

1X k
x̄ = ni ci
n i=1

a i−1 + a i
où c i = est le centre de la classe [a i−1 , a i [.
2
3.1. PARAMÈTRES DE TENDANCE CENTRALE 21
[Link] Remarques
- La moyenne n’est pas nécessairement une valeur observable du caractère.
- La moyenne est sensible aux valeurs extrêmes ou atypiques.

3.1.3 La moyenne géométrique


Si x i ≥ 0, alors la moyenne géométrique est définie par
n
³Y ´1/n ³ ´1/n
n
G= xi i = x1 × x2 × ... × xn .
i =1

La moyenne géométrique s’utilise, par exemple, quand on veut calculer la moyenne de taux
d’intérêt.
Exemple 3.1.1. Supposons que les taux d’intérêt pour 4 années consécutives soient respecti-
vement de 5, 10, 15, et 10%. Que va-t-on obtenir après 4 ans si je place 100 francs ?

Solution.
— Après 1 an on a, 100 × 1.05 = 105.
— Après 2 ans on a, 100 × 1.05 × 1.1 = 115.5
— Après 3 ans on a, 100 × 1.05 × 1.1 × 1.15 = 132.825.
— Après 4 ans on a, 100 × 1.05 × 1.1 × 1.15 × 1.1 = 146.1075.
Si on calcule la moyenne arithmétique des taux on obtient
1.05 + 1.10 + 1.15 + 1.10
x= = 1.10
4
Si on calcule la moyenne géeométrique des taux, on obtient
1
G = (1.05 × 1.10 × 1.15 × 1.10) 4 = 1.099431377.

Le bon taux moyen est bien G et non x, car si on applique 4 fois le taux moyen G aux 100
francs, on obtient
100 × G 4 = 100 × 1.0994313774 = 146.1075.

3.1.4 La moyenne harmonique


Si x i ≥ 0 alors la moyenne harmonique, H , est l’inverse de la moyenne arithmétique des
inverses des obervations :
n
H = Pk ni .
i =1 x i

On peut par exemple la moyenne harmonique pour les vitesses.


Exemple 3.1.2. Un cycliste parcourt 4 étapes de 100 km. Les vitesses respectives pour ces
étapes sont de 10 km/h, 30 km/h, 40 km/h, 20 km/h. Quelle a été sa vitesse moyenne ?

Solution. Il a parcouru la première étape en 10 h, la deuxième en 3 h20 la troisième en 2 h30


et la quatrième en 5h. Il a donc parcouru le total des 400km en :

10 + 3 h20 + 2 h30 + 5 h = 20 h50 = 20.8333 h.

Sa vitesse moyenne est donc


400
Mo y = = 19.2 km
20.8333
22 CHAPITRE 3. PARAMÈTRES NUMÉRIQUES
Si on calcule la moyenne arithmétique des vitesses, on obtient

10 + 30 + 40 + 20
x= = 25 km/ h.
4

Si on calcule la moyenne harmonique des vitesses, on obtient

4
H= 1 1 1 1
= 19.2 km/ h.
10 + 30 + 40 + 20

La moyenne harmonique est donc la manière appropriée de calculer la vitesse moyenne.

3.1.5 La médiane

La médiane M e est la valeur du caractère pour laquelle la fréquence cumulée est égale à
0.5. Elle correspond donc au centre de la série statistique classée par ordre croissant ou à la
valeur pour laquelle 50% des valeurs observées sont supérieures et 50% sont inférieures.

[Link] Caractère quantitatif discret

On procède ainsi après avoir rangé les n observations x1 , x2 , . . . , xn par ordre croissant
x(1) ≤ x(2) ≤ . . . ≤ x(n) :

- si n est impair, alors n = 2 m + 1 et la médiane est la valeur M e = x(m+1) .

Exemple 3.1.3. On considère la série statistique :

3 2 1 0 0 1 2

On ordonne la série

0 0 1 1 2 2 3
3.1. PARAMÈTRES DE TENDANCE CENTRALE 23

1.00
0.75
0.50
0.25
0.00

−1 0 1 2 3 4

- si n est pair, alors n = 2m et une médiane est une valeur quelconque entre x(m) et
x(m+1) ; ( x(m) , x(m+1) ) est appelé intervalle médian. Dans ce cas, on prend souvent le
milieu comme médiane, c’est à dire

x(m) + x(m+1)
Me = .
2

Exemple 3.1.4. On considère la série statistique :

3 2 1 0 0 1 2 4

On ordonne la série

0 0 1 1 2 2 3 4
24 CHAPITRE 3. PARAMÈTRES NUMÉRIQUES

1.00
0.75
0.50
0.25
0.00

−1 0 1 2 3 4 5

[Link] Caractère quantitatif continu


On utilisera la méthode de l’interpolation linéaire exposée ci-dessous.

[Link] Remarques
- La médiane peut être calculéee pour un caractère quantitatif et pour un caractère
qualitatif ordinal.
- La médiane est plus robuste que la moyenne car elle n’est pas influencée par les
valeurs extrêmes.
- La médiane est influencée par le nombre d’observations.

3.1.6 Les quantiles


Le quantile d’ordre α est la valeur xα du caractère qui laisse une proportion α des obser-
vations en dessous et 1 − α des observations au dessus d’elle. Les fractiles sont les quantiles
qui partitionnent les données triées en classes de taille égale. Les fractiles les plus utilisés
sont les quartiles, les déciles et les centiles.

Les quartiles sont au nombre de trois.


- Le premier quartile Q 1 est le quantile d’ordre 41 ; c’est la valeur du caractère telle
qu’il ait 25% des observations qui lui soient inférieures et 75% supérieures.
- Le deuxième quartile Q 2 est le quantile d’ordre 12 , est la médiane.
3.1. PARAMÈTRES DE TENDANCE CENTRALE 25
3
- Le troisième quartile Q 3 est la quantile d’ordre ; c’est la valeur du caractère telle
4
que 75% des observations lui soient inférieures et 25% supérieures.
Les quartiles Q 1 , Q 2 et Q 3 partagent la série ordonnée en quatre groupes de même effectif
(25% chacun).

Remarque 3.1.1. Un décile est l’une des neuf valeurs qui partagent la série ordonnée en 10
groupes de même effectif (10% chacun). Un centile est l’une des cent valeurs qui partagent
la série ordonnée en 100 groupes de même effectif (1% chacun).

Détermination pratique de la médiane


On utilise le tableau des effectifs cumulés ou des fréquences cumulées.

Caractère quantitatif discret : s’il existe une modalité x j du caractère telle que N j−1 <
α n ≤ N j ou F j−1 < α ≤ F j alors le quantile d’ordre α est x j .
Caractère quantitatif continu : soit la première classe dont la fréquence empirique est su-
périeure ou égale à α. Notons là C i = [a i−1 , a i [ et appelons F i sa fréquence cumulée. Si
F i = α, le quantile est a i . Dans le cas contraire, F i > α, considérons les points de coordon-
nées (a i−1 , F i−1 ) et (a i , F i ), F i−1 est la fréquence cumulée de la classe précédant C i si elle
existe, 0 sinon. La droite passant par ces deux points passe par un point d’ordonées α dont
l’abscisse est xα .
a i−1 F i−1
xα α
ai Fi
On tire xα à partir de la formule suivante :
xα − a i−1 a i − a i−1
= .
α − F i−1 F i − F i−1

Par suite
α − F i−1
xα = a i−1 + (a i − a i−1 ) .
F i − F i−1
Exemple 3.1.5. Répartition des ouvriers selon leur salaire mensuel net (en milliers francs.

Salaire Effectif Fréquence (%) Fréquence cumulées (%)


[80, 100[ 26 18.6 18.6
[100, 110[ 33 23.5 42.1
[110, 120[ 64 45.8 87.9
[120, 130[ 7 5.0 92.9
[130, 150[ 10 7.1 100
Total 140 100

100 18.6
Q1 25
110 42.1
Par suite
25 − 18.6
Q 1 = 100 + (110 − 100) = 102.72
42.1 − 18.6
110 42.1
Q2 50
120 87.9
26 CHAPITRE 3. PARAMÈTRES NUMÉRIQUES
Par suite
50 − 42.1
Q 2 = 110 + (120 − 110) = 111.72
87.9 − 42.1
110 42.1
Q3 75
120 87.9
Par suite
75 − 42.1
Q 3 = 110 + (120 − 110) = 117.18
87.9 − 42.1

3.1.7 Boı̂te à moustaches


La boı̂te à moustaches ou boxplot est un diagramme qui permet de représenter la distribution
d’un caractère. Ce diagramme est composé de :
- un rectangle qui s’étend du premier au troisième quartile ; le rectangle est divisé par
une ligne correspondant à la médiane ;
- ce rectangle est complété par deux segments de droites ; pour les dessiner, on calcule
d’abord les bornes
b− = Q 1 − 1.5(Q 3 − Q 1 )

b+ = Q 3 + 1.5(Q 3 − Q 1 ).

Les valeurs au-délà des moustaches sont des valeurs hors norme éventuellement sus-
pectes ou aberrantes mais pas nécessairement.

Ce diagramme est utilisé notamment pour comparer un même caractère dans deux ou plu-
sieurs échantillons de tailles différentes.

3.2 Paramètres de dispersion


Exemple 3.2.1. Deux groupes d’étudiants ont été observés selon la note obtenue en statistique
descriptive :

Groupe 1 2 5 10 10 10 15 18
Groupe 2 8 9 10 10 10 11 12
3.2. PARAMÈTRES DE DISPERSION 27
Pour le groupe 1 : M01 = M e1 = X 1 = 10
Pour le groupe 2 : M02 = M e2 = X 2 = 10.
On remarque que les deux séries présentent un même mode, une même médiane et une même
moyenne. Cependant, leur distribution se fait d’une manière nettement différente. En effet,
contrairement au groupe 1, les notes du groupe 2 ne s’écartent pas trop des valeurs centrales
( M e = X̄ = 10). Ainsi, les indicateurs de tendance centrale peuvent s’avèrer insuffisant pour
permettre à eux seuls de résumer et de comparer deux ou plusieurs séries statistiques, d’où
la nécessité de calculer d’autres indicateurs dits de dispersion.

Les paramètres de dispersion servent à préciser la variabilité de la série statistique, c’est


à dire à résumer l’éloignement de l’ensemble des observations par rapport à leur tendance
centrale.

3.2.1 L’étendue
On appelle étendue l’écart entre la plus grande valeur et la plus petite valeur. Posons

xmin = min( x1 , . . . , xn ) xmax = max( x1 , . . . , xn ).

L’etendue est définie par


E = xmax − xmin .

Plus l’étendue est faible, plus la série est moins dispersée. L’inconvénient majeur de l’étendue
est qu’il ne dépend que des valeurs extrêmes qui sont souvent exceptionnelles et aberrantes.

3.2.2 L’écart moyen absolu


Pour un caractère quantitatif discret dont les n observations sont rangées selon ses k
modalités x1 , . . . , xk d’effectifs respectifs n1 , . . . , n k , l’écart absolu moyen est le nombre

1X k
EM A = n i | x i − x̄n | .
n i=1

Pour un caractère quantitatif continu dont les n observations ont été réparties dans k inter-
valles ([a i , a i+1 [) i=1,...,k , l’écart absolu moyen est le nombre

1X k
EM A = n i | c i − x̄n |,
n i=1

a i + a i+1
où c i = est le centre de la classe [a i , a i+1 [.
2
Remarque 3.2.1. On appelle écart absolu par rapport à la médiane M e :

1X k
EM A 1 = n i | xi − M e | .
n i=1

Cet indicateur de dispersion tient compte de tous les écarts entre les valeurs observées
et la moyenne arithmétique. Son inconvénient est qu’il n’est pas commode pour le calcul
algébrique vu la présence de l’expression de la valeur absolue. Une solution alternative
consiste à considérer la moyenne des carrés des écarts et de calculer ensuite la racine carrée.
28 CHAPITRE 3. PARAMÈTRES NUMÉRIQUES
3.2.3 Variance, écart-type
Pour un caractère quantitatif discret dont les n observations sont rangées selon ses k
modalités x1 , . . . , xk d’effectifs respectifs n1 , . . . , n k ,

1X k
σ2 = n i ( x i − x̄)2 .
n i=1

Pour un caractère quantitatif continu dont les n observations ont été réparties dans k inter-
valles ([a i , a i+1 [) i=1,...,k , la variance est

1X k
σ2 = n i ( c i − x̄)2 .
n i=1

a i + a i+1
où c i = est le centre de la classe [a i , a i+1 [.
2
L’écart-type σ est la racine carrée de la variance.

La variance mesure la dispersion des valeurs autour de la moyenne. La variance est ex-
primée dans le carré de l’unité de mesure de la variable. C’est la raison pour laquelle on ne
doit pas interpréter la variance mais plutôt sa racine carrée : l’écart-type. L’écart-type est
utilisé comme un indicateur de la dispersion de la série statistique. Plus il est grand, plus la
dispersion des observations autour de la moyenne de la variable est forte, plus la population
est hétérogène.

3.2.4 L’écart inter-quartile


L’intervalle interquartile est l’intervalle [Q 1 ,Q 3 ]. L’écart interquartile est défini par

IQ = Q 3 − Q 1 .

Nous avons 50% des observations qui se trouvent entre Q 1 et Q 3 . Ainsi, 50% des observations
s’étalent sur un intervalle de longueur égale à Q 3 −Q 1 . Plus l’intervalle interquartiles est petit,
plus la dispersion est faible et plus la population est homogène.
Cette quantité mesure la dispersion autour de la médiane. Plus IQ est grand, plus il existe
des valeurs éloignées de la médiane.

3.2.5 Le Coefficient de variation


Le coefficient de variation CV est défini comme le rapport de l’écart-type à la moyenne :
σ
CV = .

C’est un nombre sans dimension qui mesure la proportion de la moyenne expliquée par
l’écart-type. Le coefficient de variation permet de comparer deux ou plusieurs distribu-
tions exprimées dans des unités différentes et qui n’ont pas le même ordre de grandeur (les
moyennes sont différentes). Le coefficient de variation est souvent exprimé en pourcentage.
Plus le coefficient de variation est faible, plus la dispersion est faible et plus la population
est homogène.
3.3. LES PARAMÈTRES DE CONCENTRATION 29

3.3 Les paramètres de concentration


La notion de concentration tient une place importante dans les études économiques ; on
parle de concentration des entreprises, de concentration du pouvoir ou de la richesse, etc.
L’étude de concentration ne s’applique qu’à des variables statistiques continues à valeurs
positives et cumulables. Il est clair qu’elle ne peut s’appliquer à des ensembles d’individus
classés selon l’âge, la taille ou le poids, parce que la somme des âges par exemple d’une
population n’a pas de signification. Elle a pour but de mesurer les inégalités de répartition
d’une masse totale.

3.3.1 La médiale
La médiale est la valeur du caractère qui partage la valeur totale ou la masse totale
en deux parties égales. La médiale se détermine par interpolation linéaire sur les valeurs
globales relatives cumulées croissantes.
Soit X un caractère continu dont les observations sont rangées dans les classes [a i−1 , a i [,
a i−1 + a i
k = 1, . . . , k. Soit n i l’effectif de la classe [a i−1 , a i [ et c i = son centre.
2
• On appelle n i c i la valeur globale (v.g.) associée à la classe [a i−1 , a i [.
n
X
• n i c i est appelée valeur totale ou masse totale du caractère étudié.
i =1
ni ci
• qi = n
est la valeur globale relative (v.g.r.) associée à la classe [a i−1 , a i [. q i
X
ni ci
i =1
désigne la part, dans la valeur totale, detenur par les individus ayant une valeur du
caractère appartenant à la classe [a i−1 , a i [.
i
X
• V (a i ) = Vi = q j est appelée valeur globale relative cumulée croissante (v.g.r.c.c).
j =1
Elle indique la part, dans la valeur totale, detenue par les individus ayant une valeur
du caractère appartenant à la classe [a i−1 , a i [.

La médiale M vérifie V ( M ) = 0.5. La détermination de la médiale se fait en deux étapes :


1. Soit la première classe [a i−1 , a i [ dont la valeur globale relative cumulée croissante Vi
est supérieure ou égale à 0.5. Si Vi = 0.5 alors la médiale est M = F i . Sinon, nous
avons Vi−1 < 0.5 < Vi .
2. Par interpolation linéaire, on calcule la valeur de la médiale :

a i−1 Vi−1
M 0. 5
ai Vi

a i − a i−1 M − a i−1 0.5 − Vi−1


= ⇔ M = a i−1 + (a i − a i−1 ).
Vi − Vi−1 0.5 − Vi−1 Vi − Vi−1
Exemple 3.3.1. La médiale est le niveau de salaire qui divise en deux la masse salariale : les
salaires inférieurs à la médiale représentent la moitié de la masse salariale et ceux supérieurs
à la médiale représentent aussi la moitié de la masse salariale.
30 CHAPITRE 3. PARAMÈTRES NUMÉRIQUES
Modalié Effectif Centre Valeur Valeur gloable Valeur gloable
globale relative relative cumulée
a 0 +a 1 n1 c1
[a 0 , a 1 [ n1 c1 = 2 n1 c1 q 1 = Pk V1 = q 1
i =1 n 1 c 1
a 1 +a 2 n2 c2
[a 1 , a 2 [ n2 c2 = 2 n2 c2 q 2 = Pk V2 = q 1 + q 2
i =1 n i c i
.. .. .. .. .. ..
. . . . . .
.. .. .. .. .. ..
. . . . . .
a i−1 +a i ni ci Pi
[a i−1 , a i [ ni ci = 2 ni ci q i = Pk Vi = j =1 q j
i =1 n i c i
.. .. .. .. .. ..
. . . . . .
.. .. .. .. .. ..
. . . . . .
a 0 +a 1 nk ck Pk
[a k−1 , a k [ nk ck = 2 nk ck q k = Pk Vk = j =1 q j =1
i =1 n i c i
Total n

Table 3.1 – Tableau de calcul de la médiale

Classe de salaire Effectif Centre Masse Valeur globale Valeur glaobale


(en milliers francs) de classe salariale relative relative cumulée
[80, 100[ 26 90 2340 15.15 15.15
[100, 110[ 33 105 3465 22.44 37.59
[110, 120[ 64 115 7360 47.67 85.26
[120, 130[ 7 125 875 5.67 90.93
[130, 150[ 10 140 1400 9.07 100
Total 140 15440

110 37.59
M 50
120 85.26
50 − 37.59
M = 110 + (120 − 110) × .
65.26 − 37.59

3.3.2 L’écart entre médiane et médiale


On appelle écart médiale-médiane d’une série statistique, le nombre défini par :

∆M = M − M e .

Cet écart nous fournit un premier renseignement sur la concentration d’une distribution
statistique.
• Si ∆ M = 0 ⇔ M = M e alors alors la concentration est nulle et la répartition de la valeur
totale est parfaitement égalitaire.
• Si ∆ M ̸= 0 alors la répartition de la valeur totale n’est pas égalitaire. Cependant,
aucune information sur l’intensité de cette inégalité ne peut être avancée.
• Pour comparer la concentration de deux ou plusieurs séries statistiques, on peut
∆M
utiliser le rapport . La concentration d’une série est d’autant plus forte que le
E
rapport est élevé. (E représente l’etendue de la série).
3.4. PARAMÈTRES DE FORME 31
3.3.3 La courbe de Lorenz
La courbe de Lorenz est obtenue en reliant, par des segments de droites, les points de
coordonnées (F i , Vi ), i = 0, . . . , k avec (F0 , V0 ) = (0, 0). Plus la courbe de Lorenz s’éloigne de la
première bissectrice, plus la concentration est forte et plus la répartition est inégalitaire.

3.3.4 L’indice de Gini


L’indice de Gini ou coefficient de Gini est le double de l’aire comprise entrelacourbe de
concentration et la première bissectrice (zone hachuré en rouge). Il mesure le niveau d’inéga-
lité de la répartition d’une variable dans la population. L’indice de Gini est compris entre 0
(égalité parfaite) et 1 (inégalité parfaite). Une baisse de l’indice de Gini indique une dimi-
nution globale des inégalités. A l’inverse, une élévation de l’indice reflète une augmentation
globale des inégalités.

L’indice de Gini I est alors


k n
X i
I = 2S = 1 − (Vi + Vi−1 ).
i =1 n

3.4 Paramètres de forme


Les paramètres de forme permettent d’avoir une idée staisfaisante et plus précise sur la
forme de la distribution. On distingue les coefficients d’asymétrie et les coefficients d’apla-
tissement.
Une distribution est dite symétrique si les observations également dispersées de part et
d’autre de la valeur centrale. Dans le cas contraire, la distribution est dite asymétrique ou
dissymétrique.

3.4.1 Moments
Pour un caractère quantitatif discret dont les n observations sont rangées selon ses k
modalités x1 , . . . , xk d’effectifs respectifs n1 , . . . , n k , le moment centré d’ordre r est défini par

1X k
µr = n i ( x i − x̄)r .
n i=1
32 CHAPITRE 3. PARAMÈTRES NUMÉRIQUES
Pour un caractère quantitatif continu dont les n observations ont été réparties dans k inter-
valles ([a i , a i+1 [) i=1,...,k , le moment centré d’ordre r est défini par

1X k
µr = n i ( c i − x̄)r ,
n i=1

a i + a i+1
où c i = est le centre de la classe [a i , a i+1 [.
2
Remarque 3.4.1. µ0 = 1, µ1 = 0 et µ2 est la variance.

3.4.2 Asymétrie
Le coefficient d’asymétrie de Pearson
Dans une distribution faiblement asymétrique, c’est la position du mode par rapport à la
moyenne (ou à la médiane) qui caractérise l’asymétrie. Le coefficient d’asymétrie de Pearson
est défini par :
X̄ − M0
s= .
σ

Le coefficient d’asymétrie de Fisher


Le Coefficient d’asymétrie de Fisher permet de quantifier le degré de déviation de la
forme de la distribution par rapport à une distribution symétrique. Il est défini par
µ3
s= .
µ3/2
2

Le coefficient d’asymétrie de Yule


On compare ici létalement de la courbe de distribution à gauche de la médiane et l’éta-
lement à droite et à rapporter leur diiférence à leur somme. Le coefficient d’asymétrie de
Yule est défini par :
(Q 3 − Q 2 ) − (Q 2 − Q 1 ) Q 1 + Q 3 − 2Q 2
s= = .
Q3 − Q1 Q3 − Q1

Interprétation
Quelque soit la formule adoptée, nous avons l’interprétation suivante. Ces coefficients
n’ont d’intérât que dans la mesure où ils permettent de comparer les formes de deux ou plu-
sieurs distributions ; bien entendu, les comparaison ne sont valables que si la même formule
est retenue pour les diverses distributions.
1. s = 0 indique une distribution parfaitement symétrique. Dans ce cas M e = M0 = x̄.

2. s > 0 indique une distribution unimodale étalée vers la droite.


Dans ce cas M0 < M e < x̄
3. s < 0 indique une distribution unimodale étalée vers la gauche.
Dans ce cas x̄ < M e < M0
3.4. PARAMÈTRES DE FORME 33

Figure 3.1 – s = 0 : la distribution symétrique.

Figure 3.2 – s > 0 : la distribution étalée à droite.

Figure 3.3 – s < 0 : la distribution étalée à gauche.


34 CHAPITRE 3. PARAMÈTRES NUMÉRIQUES

Figure 3.4 – γ = 0 : la distribution est normale.

Figure 3.5 – γ > 0 : la distribution est aigue.

3.4.3 L’aplatissement
Le coefficient d’aplatissement (kurtosis) permet de mesurer le relief ou la platitude d’une
courbe issue d’une distribution de fréquences. On compare la courbe de fréquence de la
distribution à la courbe de fréquence de la distribution normale considérée comme la dis-
tribution idéale. On fait apparaı̂tre ainsi l’aplatissement ou l’allongement au voisinage du
mode. Quand la courbe est plus aplatie que la courbe normale, on dit qu’elle est platicur-
tique ; quand elle est plus aigue, on dit qu’elle est leptocurtique ; une courbe normale est
dite mésocurtique. Le coefficient d’aplatissement de Fisher est :
µ4
γ= −3 µ2 ̸= 0.
µ22

1. γ = 0 : la distribution est normale


2. γ > 0 : la distribution est aigue.
3. γ < 0 : la distribution est aplatie.
Remarque 3.4.2. Les coefficients de kurtosis et de skewness peuvent être utilisés pour s’as-
surer que les variables suivent une distribution normale. On estime que le coefficient de
symétrie ou skewness doit être inférieur à 1 et le coefficient d’aplatissement ou kurtosis doit
être inférieur à 1.5 pour considérer que la variable suit bien une loi normale.

Figure 3.6 – γ < 0 : la distribution est aplatie.


Chapitre

4 Statistiques à deux variables

4.1 Introduction
La question centrale de ce chapitre est relative aux statistiques bivariées (deux variables).
Comment juger de l’intensité de la dépendance statistique esntre deux variables ?
Répondre statistiquement à cette question dépend de la nature des deux variables étu-
diées. Trois combinaisons sont possibles :
— Deux variables qualitatives :
— Une variable qualitative et une variable quantitative :
— Deux variables quantitatives
L’analyse dans ce cas n’est plus univariée mais bien bivariée. On analyse de manière simul-
tanée les caractéristiques des individus suivant deux variables.

4.2 Généralités

4.2.1 Distribution conjointe


Soit une population comprenant n individus pour chacun desquels on a fait une ob-
servation concernant simultanément les caractères X et Y . Le caractère X comporte les k
modalités X 1 , · · · , X k et le caractère Y , les l modalités Y1 , · · · , Yl . L’opération préliminaire de
mise en ordre des observations va consister à classer chacun des n individus dans les k × l
sous-ensembles définis par le croisement des caractères X et Y . A chacun des sous-ensembles
correspond une case du tableau statistique à double entrée où figurent en ligne les modalités
de X et en colonne les modalités de Y (tableau à k lignes et l colonnes). Ce tableau est
appelé tableau de contingence.
On note n i j l’effectif des individus présentant à la fois la modalité X i et la modalité Y j . La
fréquence des individus présentant à la fois la modalité X i et la modalité Y j est

ni j
fi j = .
n

La distribution conjointe des caractères X et Y est donnée par le tableau de contingence :

35
36 CHAPITRE 4. STATISTIQUES À DEUX VARIABLES
HH Y Y
H
Y2 ··· Yj ··· Yl
X HH 1
X1 n 11 n 12 ··· n1 j ··· n 1l
X2 n 21 n 22 ··· n2 j ··· n 2l
.. .. .. .. .. .. ..
. . . . . . .
Xi n i1 n i2 ··· ni j ··· n il
.. .. .. .. .. .. ..
. . . . . . .
Xk n k1 n k2 ··· nk j ··· n kl

Exemple 4.2.1. Deux variables qualitatives : répartition de 22 personnes selon le genre et le


statut d’activité :
XXX
XXX Statut Actifs occupés Chômeurs Inactifs Total
Genre XXX
X
Masculin 5 5 1 11
Féminin 4 3 4 11
Total 9 8 5 22

Exemple 4.2.2. Deux variables quantitatives continues : répartition de 19 adolescents selon


la taille et le poids.
XXX
XXX Taille [20, 40[ [40, 60[ [60, 80]
Poids XXX
X
[120, 140[ 1 0 0
[140, 160[ 6 4 0
[140, 160[ 0 6 2

Exemple 4.2.3. Une variable quantitative continue et une variable qualitative : Répartition
d’un groupe de 50 personnes réparties par âge et par genre, tous âgés de moins de 45 ans.

PPGenre Homme
PP
Femme
Age PP
P
P
[0, 18[ 10 20
[18, 45[ 5 15

4.2.2 Distributions marginales


Le nombre d’individus présentant la modalité X i du caractère X n i• est
l
X
n i• = ni j.
j =1

La fréquence de la modalité X i est donnée par


n i•
f i• = .
n

Le nombre d’individus présentant la modalité Y j du caractère Y est

k
X
n• j = ni j.
i =1
4.2. GÉNÉRALITÉS 37
La fréquence de la modalité Y j est donnée par
n• j
f• j = .
n

Nous avons
X l
k X k
X l
X
n= ni j = n i• = n• j
i =1 j =1 i =1 j =1

X l
k X k
X l
X
fi j = f i• = f • j = 1.
i =1 j =1 i =1 j =1

HH Y
HH Y1 Y2 ··· Yj ··· Yl Total
X H
X1 n 11 n 12 ··· n1 j ··· n 1l n 1•
X2 n 21 n 22 ··· n2 j ··· n 2l n 2•
.. .. .. .. .. .. .. ..
. . . . . . . .
Xi n i1 n i2 ··· ni j ··· n il n i•
.. .. .. .. .. .. .. ..
. . . . . . . .
Xk n k1 n k2 ··· nk j ··· n kl n k•
Total n •1 n •2 ··· n• j ··· n •l n

HH Y
HH Y1 Y2 ··· Yj ··· Yl Total
X H
X1 f 11 f 12 ··· f1 j ··· f 1l f 1•
X2 f 21 f 22 ··· f2 j ··· f 2l f 2•
.. .. .. .. .. .. .. ..
. . . . . . . .
Xi f i1 f i2 ··· fi j ··· f il f i•
.. .. .. .. .. .. .. ..
. . . . . . . .
Xk f k1 f k2 ··· fk j ··· f kl f k•
Total f •1 f •2 ··· f• j ··· f •l 1

La distribution marginale de X est donnée par le tableau ci-dessous :

Modalités de X Effectif Fréquence


X1 n 1• f 1•
X2 n 2• f 2•
.. .. ..
. . .
Xi n i• f i•
.. .. ..
. . .
Xk n k• f k•
total n 1

La distribution marginale de Y est donnée par le tableau ci-dessous :


38 CHAPITRE 4. STATISTIQUES À DEUX VARIABLES
Modalités de Y Effectif Fréquence
Y1 n •1 f •1
Y2 n •2 f •2
.. .. ..
. . .
Yj n• j f• j
.. .. ..
. . .
Yl n •l f •l
total n 1

4.2.3 Distributions conditionnelles


Les distributions conditionnelles s’obtiennent en fixant la valeur d’une des deux variables.
La distribution conditionnelle de Y sachant X = X i est donnée par :

Y| X = X i Y1 ··· Yj ··· Yl Total


Effectif n i1 ··· ni j ··· n il n i•

Remarque 4.2.1. Nous pouvons ainsi définir k distributions conditionnelles de Y .


La distribution conditionnelle de X sachant Y = Y j est donnée par

X |Y = Y j X1 ··· Xi ··· Xk Total


Fréquence n1 j ··· ni j ··· nk j n• j

Remarque 4.2.2. Nous pouvons aussi définir l distributions conditionnelles de X .


Exemple 4.2.4. Deux variables qualitatives : répartition de 22 personnes selon le genre et le
statut d’activité :
XXX
XXX Statut Actifs occupés Chômeurs Inactifs Total
Genre XXX
X
Masculin 5 5 1 11
Féminin 4 3 4 11
Total 9 8 5 22

Statut | Genre=Masculin Actifs occupé Chomeurs Inactifs Total


Effectif 5 5 1 n 1• = 11
n 11 n 12 n 13
frequence f 1⧸1 = n 1• = 0.4545 f 2⧸1 = n 1• = 0.4545 f 3⧸1 = n 1• = 0.091 1

4.2.4 Indépendance
On dit que les caractères X et Y sont satistiquement indépendants dans l’ensemble des
n individus considérés si toutes les distributions conditionnelles de X sont identiques à la
distribution marginale en X .

Indépendance entre X et Y ⇐⇒ Pour tous ( i, j ), f i⧸ j = f i•

Puisque
ni j
ni j n fi j
f i⧸ j = = n• j = ,
n• j f• j
n
alors
f i j = f • j × f i⧸ j = f i• × f j⧸ i .
4.3. LIAISON ENTRE DEUX CARACTÈRES QUALITATIFS 39
Ainsi, nous obtenons

Indépendance entre X et Y ⇐⇒ Pour tous ( i, j ), f i j = f i• f • j


n i• n• j
⇐⇒ Pour tous ( i, j ), ni j =
n
n i• n• j
⇐⇒ Pour tous ( i, j ), ni j − = 0.
n
Par symétrie :

Indépendance entre X et Y ⇐⇒ Pour tous ( i, j ), f j⧸ i = f • j

Lorsque deux variables dépendent statistiquement l’une de l’autre, on cherche à évaluer


l’intensité de leur liaison et, dans le cas de deux variables quantitatives, on examine si on
peut les considérer liées par une relation linéaire.

4.3 Liaison entre deux caractères qualitatifs


4.3.1 Mesure de l’intensité de la liaison
L’intensité de la liaison entre deux caractères qualitatifs est mesurée par
´2
n n
³
k X
l n i j − i•n • j
χ2 =
X
n i• n• j .
i =1 j =1 n

Le χ2 est toujours positif ou nul.

Exemple 4.3.1. Prenons k = 2 et l = 3

n i• n• j 2
³ ´
3 ni j −
2 X n
χ2 =
X
n i• n• j
i =1 j =1 n
µ¡ n i• n •1 ¢2 ¡ n n ¢2 ¡ n n ¢2 ¶
2
X n i1 − n n i2 − i•n •2 n i3 − i•n •3
= n i• n •1 + n i• n •2 + n i• n •3
i =1 n n n
n 1• n •1 ¢2 n 1• n •2 ¢2 n 1• n •3 ¢2 ¢2 ¢2 ¢2
n 21 − n2•nn•1 n 22 − n2•nn•2 n 23 − n2•nn•3
¡ ¡ ¡ ¡ ¡ ¡
n 11 − n n 12 − n n 13 − n
= n 1• n •1 + n 1• n •2 + n 1• n •3 + n 2• n • 1 + n 2• n •2 + n 2• n • 3
n n n n n n

On sait que :

X et Y sont indépendants ⇐⇒ f i j = f i• × f • j i = 1, . . . , k, j = 1, . . . , l.

Ainsi, nous avons


ni j n• j n i•
f i j = f i• × f • j ⇐⇒ = ×
n n n
n• j × n i•
⇐⇒ n i j =
n
n ×n
De ce fait on a χ2 = 0 si et seulement si n i j = i• n • j . La quantité χ2 mesure l’écart entre les
n ×n
effectifs observés n i j et ceux attendus i• n • j sous l’hypothèse d’indépendance. On dira que
X et Y ne sont pas indépendants si χ2 est trop grand.
40 CHAPITRE 4. STATISTIQUES À DEUX VARIABLES
4.3.2 Coefficient de Cramer
Le coefficient de Cramer est défini par
s
χ2
C= .
n × min( k − 1, l − 1)

Nous avons 0 ≤ C ≤ 1. Si C ≈ 0, les deux caractères sont indépendants. Si C = 1, on parle de


dépendance entre X et Y .

Exemple 4.3.2. Prenons k = 2 et l = 3 Le coefficient de Cramer est défini par


s s s
χ2 χ2 χ2
C= = = .
n × min(2 − 1, 3 − 1) n × min(1, 2) n

4.3.3 Exercices
[Link] Exercice 1
Nous voulons étudier la liaison entre le type de musique X et l’âge Y . X a trois modalités
(chansons, jazz, classique) et Y a quatre modalités (jeunes, adulte femme, adulte homme,
vieux). Voici le tableau de contingence :

HH Y Jeunes
H
Adulte femme Adulte homme Vieux Total
X HH
Chansons 69 172 133 27 401
Jazz 41 84 118 11 254
Classique 18 127 157 43 345
Total 128 383 408 81 1000

Etudions la liaison entre X et Y .

Nous avons

n i• n• j 2
³ ´
4 ni j −
3 X n
χ2 =
X
n i• n• j = 52.9138.
i =1 j =1 n

Le coefficient de Cramer est


s s
χ2 χ2
C= = ≈ 0.16.
1000 × min(2, 3) 2000

La dépendance entre X et Y est très faible.

[Link] Exercice 2
Un site internet reçoit 113 457 visiteurs durant un mois. On désigne par X le navigateur
internet utilisé et Y le système d’exploitation utilisé.
4.4. LIAISON ENTRE DEUX CARACTÈRES QUANTITATIFS 41
HH Y
H
Windows Mac Linux
X HH
Chrome 14103 1186 427
Firefox 30853 4392 3234
Internet explorer 47389 23 0
Safari 668 6416 0
Autres 2974 40 1752

1. Identifier la population, sa taille ainsi que les variables étudiées en précisant leur type.
2. Quelle est la proportion de visiteurs sous Windows ?
3. Quelle proportion de visiteurs utilisent le navigateur Safari ?
4. Parmi les utilisateurs de Mac, quelle proportion utilise Chrome ?
5. Parmi les utilisateurs de Safari, quelle proportion est sous Windows ?
6. Représenter graphiquement la distribution des proportions par Navigateur pour chaque
système d’exploitation. Les variables X et Y sont-elles indépendantes ?

4.4 Liaison entre deux caractères quantitatifs


4.4.1 Représentation graphique : nuage de points.
On suppose que les deux caractères X et Y sont quantitatifs. Pour chaque individu i ,
on connaı̂t le couple de valeurs ( X i , Yi ) qui lui est attaché. Sur un graphique à axes de coor-
données rectangulaires, nous pouvons représenter chaque élément, par un point d’abscisse
X i et d’ordonnée Yi . Ce graphique est appelé graphique de corrélation ou nuage de points.
Schématiquement, le nuage peut revêtir trois aspects :
1. Les points représentatifs sont distribués sur toute la surface du graphique, à peu près
comme s’ils avaient été placés au hasard. C’est le signe qu’il n’y a aucun lien entre
les deux variables X et Y : on dit qu’elles sont indépendantes ;
2. Les points représentatifs sont , au contraire rangés le long d’une courbe (droite, arc
de cercle,...). Une loi rigoureuse préside alors aux relations entre les deux variables.
A chaque valeur de X correspond une seule valeur de Y . On dit qu’il y a liaison
fonctionnelle entre Y et X
3. La plupart des phénomènes identifiés à des distributions à deux variables se trouvent
entre ces deux extrèmes. Les points représentatifs se distribuent dans une région
privilégiée du dessin. Moins le nuage de points a d’épaisseur et plus on se trouve
proche de la liaison fonctionnelle : on dit qu’il y a une forte corrélation entre les deux
variables. Inversement, plus le nuage de points s’étale, moins ses limites sont précises,
plus on est proche de l’indépendance : la corrélation est faible.

4.4.2 Covariance, coefficient de correlation linéaire


La covariance entre les caractères X et Y est défini par

1X n
Cov( X , Y ) = ( X i − X n )(Yi − Y n )
n i=1
1X n
= X i Yi − X n Y n .
n i=1
42 CHAPITRE 4. STATISTIQUES À DEUX VARIABLES
La covariance est un indice symétrique, c’est à dire, Cov( X , Y ) = Cov(Y , X ) et peut prendre
toute valeur (négative, nulle ou positive).
Le coefficient de correlation linéaire entre les caractères X et Y est défini par
Cov( X , Y )
rXY =
σ X σY

où σ X et σY les écart-types respectifs de X et σY , sont définis


à !1/2 à !1/2
1X n 1X n
σX = ( X i − X n )2 σY = (Yi − Y n )2 .
n i=1 n i=1

Nous avons :
1. −1 ≤ r X Y ≤ 1.
2. Si r X Y > 0 alors les deux variables évoluent dans le même sens.
3. Si r X Y < 0 alors les deux variables n’évoluent pas dans le même sens.
4. | r X Y | = 1 ⇐⇒ les n points ( X i , Yi ) sont alignés.
5. r X Y = 0 ⇐⇒ Pas de liaison linéaire, mais possibilité d’une liaison d’un autre type.
6. X et Y indépendantes=⇒ r X Y = 0.

Figure 4.1 – Exemples de nuage de points et coefficients de corrélation

Remarque 4.4.1. • La covariance dépend des unités de mesure dans lesquelles sont ex-
primées X et Y . Le coefficient de corrélation est un indice de liaison sans unité.
• La covariance et le coefficient de corrélation ne permettent de mettre en évidence
qu’une relation linéaire entre X et Y .
• Si deux variables sont statistiquement indépendantes (aucun lien), la corrélation est
nulle, mais l’inverse est faux : il peut exister un lien autre que linéaire entre elles.
4.4. LIAISON ENTRE DEUX CARACTÈRES QUANTITATIFS 43
4.4.3 Regression linéaire
Si | r X Y | ≃ 1, on peut supposer que X est cause de Y . Il est naturel de chercher, dans un
ensemble donné de fonctions, la fonction de X approchant Y ”le mieux possible” au sens d’un
certain critère. On dit que l’on fait la regression de Y sur X . Si l’on choisit pour ensemble de
fonctions celui des fonctions affines du type (aX + b), on parle de regression linéaire. C’est le
choix que l’on fait le plus fréquemment dans la pratique, le critère le plus usuel étant celui
des moindres carrés.
Le critère des moindres carrés. Il consiste à minimiser la quantité
n
[Yi − (aX i + b)]2 .
X
S (a, b) =
i =1
100

y *i
90

ei

yi
poids

80
70
60

155 160 165 170 175 180 185 190

taille

Solution. La minimisation de S en a et b fournit la solution suivante :


Cov( X , Y )
a= b = ȳ − a x̄.
σ2X

La droite d’équation y = ax + b est appelée droite de régression de Y sur X . Elle passe par
le point ( X n , Y n ).

4.4.4 Exemple Taux de cholestérol en fonction de l’âge


Sur un échantillon de 10 sujets d’âges différents, on a recueilli les données expérimentales
suivant :
- âge en année
44 CHAPITRE 4. STATISTIQUES À DEUX VARIABLES
- la concentration sanguine du cholestérol (en g/L).
Age ( X i ) 30 60 40 20 50 30 40 20 70 60
gl (Yi ) 1.6 2.5 2.2 1.4 2.7 1.8 2.1 1.5 2.8 2.6
Le taux de cholestérol est-il lié à l’âge ? La relation fonctionnelle est-elle linéaire ? Peut-on
prévoir le taux de cholestérol attendu à 35 ans, 75 ans ?
1. Représentation du nuage de points.
2.8
2.6
2.4
2.2
gl

2.0
1.8
1.6
1.4

20 30 40 50 60 70

Age

Les points sont rangés le long d’une droite. On peut donc supposer l’existence d’une
relation linéaire entre l’age et le taux de cholesterol.
2. Le coefficient de corrélation est donné par :
10
X
x i yi − 12 x12 y12
i =1
rXY = v v ≈ 0.95
u 10 u 10
uX uX
t x2 − 12( x )2 t yi2 − 12( y12 )2
i 12
i =1 i =1

Le coefficient de corrélation est positif. Ce qui signifie que l’age et le taux de choles-
terol évolue dans le même sens. De plus ils sont fortement corrélés ; ce qui confirme
la relation linéaire entre l’age et le taux de cholesterol.
3. Estimation des paramètres
P10
i =1 x i yi − 12 x12 y12
a= P 10 2
= 0.03
2
i =1 x i − 12( x12 )
4.5. CARACTÈRE QUANTITATIF ET CARACTÈRE QUALITATIF 45
b = y12 − âx12 = 0.92

4. La droite de regression est


gl = 0.03 ∗ age + 0.92
. La droite de régression est en rouge.
5. Prévisions A 35 ans le taux de cholestérol prédit est gl = 0.03 ∗ 35 + 0.92 = 1.97
A 75 ans le taux de cholestérol prédit est gl = 0.03 ∗ 75 + 0.92 = 3.17

4.5 Caractère quantitatif et caractère qualitatif


4.5.1 Rapport de correlation
Soient n observations portant simultanément sur un caractère qualitatif X à k modalités
et sur un caractère quantitatif Y . Les observations du caractère quantitatif Y se répartissent
dans les k modalités de X . Nous notons n i• le nombre d’observations de Y relatifs à la i-ème
modalité de X , Yi j la j-ème mesure de Y pour la i-ème modalité de X et Y i la moyenne des
observations dans la i-ème modalité
n i•
1 X
Yi = Yi j .
n i• j=1

La moyenne des observations de Y dans la popultion entière est

1X n
Yn = n i• Y i .
n i=1

On définit :
- la variance intra-groupe
1X k
Vintra = n i• σ2i
n i=1
avec
n i•
1 X
σ2i = (Yi j − Y i )2
n i• j=1

- la variance inter-groupe
1X k
Vinter = n i• (Y i − Y n )2
n i=1

Formule de décomposistion de la variance totale σ2 :

σ2 = Vintra + Vinter .

Le rapport de corrélation est défini par


Vinter
η2Y | X =
σ2

η2X |Y est un nombre compris entre 0 et 1.

- η2X |Y = 0 ⇒ Vinter = 0 ⇒ Y i = Y n . Ce qui signifie que les moyennes de Y sont les mêmes
dans toutes les modalités de X . En moyenne, les données ne diffèrent pas selon qu’elles
se trouvent dans telle ou telle modalité de X .
46 CHAPITRE 4. STATISTIQUES À DEUX VARIABLES
- η2X |Y= 1 ⇒ Vintra = 0 ⇒ Yi j = Y i . Les données diffèrent d’un groupe à l’autre mais à
l’interieur même de chaque groupe, il n’y a aucune variabilité.

Remarque 4.5.1. Si η2X |Y est proche de 1, c’est que le caractère X explique une grande partie
de la variabilité des données alors que si sa valeur est proche de 0, elle n’en explique que
très peu.

4.5.2 Exemple
Liaison entre le sexe (caractère X ) et le salaire (caractère Y ).
Le caractère X admet deux modalités : femme et homme.

Salaire des femmes


1955 1764 1668 1441 1970 1795 1716 1911 1660 2001
1744 1676 1695 1652 1626 1698 1656 1739 1789 1716
1684 1445 1646 1617 1630 1440 1850 1252 1493 1537

Salaire des hommes


2283 2010 1970 2019 1941 2024 2046 1962 1948 2071
2108 1880 2008 2119 2030 2014 1919 1837 2094 2169
Soient n F , l’effectif des femmes ; Y F la moyenne des salaires des femmes ; σ2F la variance des
salaires des femmes ; n H , l’effectif des hommes ; Y H la moyenne des salaires des hommes ;
σ2H la variance des salaires des hommes ; Y la moyenne générale des salaires (hommes et
femmes).
Nous avons
n F = 30 Y F = 1682.2 σ2F = 26959.56

n H = 20 Y H = 2022.6 σ2F = 9925.44

30Y F + 20Y H
Y= = 1818.36
30 + 20
La variance inter-groupe est :
1
½ ³ ´2 ³ ´2 ¾
Vinter = nF Y F − Y + nH Y H − Y = 27809.32
50

La variance totale est σ2 = 47955.23. Le rapport de correlation est


Vinter
ηY | X = ≈ 0.58.
σ2

On peut considérer que le caractère sexe explique environ 58% de la variabilité des salaires
observés.

Vous aimerez peut-être aussi