0% ont trouvé ce document utile (0 vote)
5 vues64 pages

Cours Stat 1

Le document traite des concepts fondamentaux de la statistique, y compris les définitions de population, variables et séries statistiques. Il aborde également l'organisation des données, les méthodes de collecte et les approches descriptives et inférentielles. Les sections détaillent les types de variables, les méthodes de regroupement et l'analyse des données à travers des tableaux et des graphiques.

Transféré par

toureahmed426
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
5 vues64 pages

Cours Stat 1

Le document traite des concepts fondamentaux de la statistique, y compris les définitions de population, variables et séries statistiques. Il aborde également l'organisation des données, les méthodes de collecte et les approches descriptives et inférentielles. Les sections détaillent les types de variables, les méthodes de regroupement et l'analyse des données à travers des tableaux et des graphiques.

Transféré par

toureahmed426
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd

Contents

1 DONNÉES STATISTIQUES 3
1.1 Un peu de vocabulaire . . . . . . . . . . . . . . . . . . . . . . . . . . 3
1.2 Notations ................................. 4
1.3 Démarches statistiques . . . . . . . . . . . . . . . . . . . . . . . . . . 6

2 ORGANISATION DES DONNÉES 7


2.1 Groupement des données . . . . . . . . . . . . . . . . . . . . . . . . . 7
2.2 Tableau des effectifs et des fréquences . . . . . . . . . . . . . . . . . . 8
2.2.1 Effectifs et fréquences . . . . . . . . . . . . . . . . . . . . . . . 8
2.2.2 Effectifs et fréquences cumulées . . . . . . . . . . . . . . . . . 9
2.2.3 Amplitude et densité de proportion . . . . . . . . . . . . . . . 12
2.3 Représentations ....................... 13
2.3.1 graphiques
Variables qualitatives . . . . . . . . . . . . . . . . . . . . . . . 13
2.3.2 Variables quantitatives discrètes . . . . . . . . . . . . . . . . . 14
2.3.3 Variables quantitatives ................ 15
2.3.4 continues 16
Fonction de répartition empirique . . . . . . . . . . . . . . . .

3 STATISTIQUE DESCRIPTIVE UNIVARIEE 18


3.1 Paramètres de position . . . . . . . . . . . . . . . . . . . . . . . . . . 18
3.1.1 Le mode . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 18
3.1.2 Les quantiles ........................... 19
3.1.3 Les moyennes . . . . . . . . . . . . . . . . . . . . . . . . . . . 22
3.2 Paramètres de dispersion . . . . . . . . . . . . . . . . . . . . . . . . . 25
3.2.1 Étendue et distance inter-quartile . . . . . . . . . . . . . . . . 25
3.2.2 Écart absolu moyen . . . . . . . . . . . . . . . . . . . . . . . . 25
3.2.3 Variance et écart-type ...................... 26
3.3 Paramètres de forme . . . . . . . . . . . . . . . . . . . . . . . . . . . 28
3.3.1 Variable centrée ..................... 28
réduite
3.3.2 Moments d’une distribution . . . . . . . . . . . . . . . . . . . 28
3.3.3 Coefficient d’asymétrie de ................ 28
3.3.4 Fisher
Coefficient d’aplatissement . . . . . . . . . . . . . . . . . . . . 29

4 Analyse bi-variée 30
4.1 Tableau de contingence, distributions marginales, distributions conditionnelles 30
4.1.1 Tableau de contingence . . . . . . . . . . . . . . . . . . . . . . 30
4.1.2 Distributions marginales . . . . . . . . . . . . . . . . . . . . . 31
4.1.3 Distributions conditionnelles . . . . . . . . . . . . . . . . . . . 32
1
CONTENTS 2

4.1.4 Tableau profils-colonne, tableau profils-ligne . . . . . . . . . . 33


4.2 Indépendance, liaison ................... 35
4.2.1 fonctionnelle
Indépendance . . . . . . . . . . . . . . . . . . . . . . . . . . . 35
4.2.2 Liaison fonctionnelle ....................... 35
4.3 Résumés numériques . . . . . . . . . . . . . . . . . . . . . . . . . . . 36
4.3.1 Caractéristiques ................... 36
4.3.2 marginales
Caractéristiques conditionnelles . . . . . . . . . . . . . . . . . 37
4.4 Lien entre caractéristiques marginales et caractéristiques conditionnelles 39
4.5 Mesure de la corrélation ......................... 39
4.5.1 Covariance . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 39
4.5.2 Coefficient de corrélation ................ 40
4.6 linéaire
Ajustements affines . . . . . . . . . . . . . . . . . . . . . . . . . . . . 41
4.6.1 Méthode des moindres carrées . . . . . . . . . . . . . . . . . . 41
4.6.2 Méthode de MAYER . . . . . . . . . . . . . . . . . . . . . . . 41

Dr KANGA Gérard 2 gerardkanga17@[Link]


Chapter 1
DONNÉES STATISTIQUES

La statistique est une méthode scientifique qui consiste à observer et à étudier


une/plusieurs particularité(s) commune(s) chez un groupe de personnes ou de choses.

1.1 Un peu de vocabulaire

Définition 1.1.1 On appelle population statistique, l’ensemble de


référence sur
lequel on réalise une enquête statistique. Chaque élément de la population
est appelé
individu ou unité statistique et le nombre d’individus est appelé taille
de la
population.

Exemple 1.1.1 Ensemble des ménages d’une ville. Un "ménage" est un


individu.
Le nombre total de ménages est la taille de la population. On peut
extraire les
ménages d’un quartier pour avoir un échantillon.

Remarque 1.1.1 La collecte de données (obtention de l’échantillon à partir


de la
population) est une étape clé et délicate. Nous ne traitons pas ici des
méthodes
possibles, mais attirons l’attention sur le fait que l’hypothèse sous-jacente
est que
l’échantillon d’individus étudiés est choisi "au hasard" parmi tous les
individus qui
auraient pu être choisis(échantillon représentatif). Il faut tout mettre en oeuvre pour
que cette hypothèse soit satisfaite. Dans la suite, sauf mention explicite du
contraire,
nous considérons que l’étude statistique porte sur la population complète.

Définition 1.1.2 Une variable ou un caractère est une propriété


commune aux
individus de la population que l’on souhaite étudier.
Exemple 1.1.2 Couleur préférée; Niveau d’étude; nombre d’enfants; âge
sont des
variables que l’on peut étudier sur une population d’employés.

Définition 1.1.3 Les modalités d’une variable sont les "valeurs" possibles de cette
variable.

3
CHAPTER 1. DONNÉES STATISTIQUES 4

Exemple 1.1.3 • Couleur préférée: rouge, bleu, vert, violet- - -

• Niveau d’étude: primaire, secondaire, supérieur

• nombre d’enfants: 0;1;2;3- - - -

• âge: moins de 25 ans; de 25 à moins de 30 ans - - -

On distingue plusieurs types de variables statistiques.

Définition 1.1.4 (Typologie des variables statistiques)

1. Une variable qualitative est une variable dont les modalités ne sont pas des
nombres(non mesurable). Exemple: Couleur préférée, niveau d’étude.

(a) S’il est possible d’ordonner les modalités, on dit que la variable est qualitative
ordinale. Exemple: Niveau d’étude.
(b) Si non, on dit qu’elle est qualitative nominale. Exemple:Couleur
préférée.

2. Une variable quantitative est une variable dont les modalités sont des
nombres(mesurable).
Exemple: Nombre d’enfants, âge.

(a) Si les valeurs sont des nombres entiers ou "isolés" (en nombre fini), on
dit que la variable est discrète. Exemple: Nombre d’enfants.
(b) Si par contre la variable est susceptible de prendre n’importe quelle valeur
dans un intervalle de R, on dit qu’elle est continue. Exemple:âge.

Définition 1.1.5 Une série statistique est un ensemble de couples {(Mi, ni)}1≤i≤p
ou {(xi, ni)}1≤i≤p où
• p est le nombre de modalités ou valeurs de la variable;

• les Mi sont les modalités;

• les xi sont les valeurs de la variable;

• ni est le nombre d’individus qui présentent la modalité Mi ou la valeur xi.

1.2 Notations

Voici les terminologies et notations usuelles pour les définitions ci-dessus.

Dr KANGA Gérard 4 gerardkanga17@[Link]


CHAPTER 1. DONNÉES STATISTIQUES 5

Variable qualitave nominale

(pas d’ordre)

Variable qualitave

Variable qualitave ordinale

(possibilité d’ordonner)

Caractère ou variable
stasque

Variable quantave discrète

(valeurs précises)

Variable quantave

Variable quantave connue

(valeurs non précises)

Terminologie Notation
Taille de la population N
Population P = {1, . . . N}
Individu u ∈P
Variable ou caractère X, Y, . . .
Valeur de la variable X pour l’individu u X(u)
Série statistique simple brute pour X {X(1), X(2), . . . X(N)}
Série statistique double brute pour X et Y {(X(1), Y (1)) , . . . (X(N), Y (N))}
Exemple 1.2.1 Une petite enquête s’intéresse à la marque de voiture
préférée de
10 employés d’une société. Les marques proposées sont: Peugeot(P),
Renault(R),
Citroen(C), Nissan(N). On obtient la série statistique simple brute suivante:

Tableau 1.2.1
Employés 1 2 3 4 5 6 7 8 9 10
Marque C R C N P P P R C N

La population P est l’ensemble des 10 employés. La taille de la population


est
N = 10. Le caractère X est la "marque préférée". C’est un caractère
qualitatif
Dr KANGA Gérard 5 gerardkanga17@[Link]
CHAPTER 1. DONNÉES STATISTIQUES 6

nominal.
X(1) = Citroen, X(7) = Peugeot.

1.3 Démarches statistiques

Le but de la statistique est d’organiser des données chiffrées sur de


grands
ensembles, de les synthétiser et de les interpréter. Dans le traitement de
ces données,
la méthode statistique présente deux approches:

• La statistique descriptive(objet de ce cours)


C’est l’ensemble des méthodes à partir desquelles on recueille, on
ordonne, on
réduit, et on condense les données. A cette fin, la statistique
descriptive utilise
des tableaux, des graphiques, des paramètres ou indicateurs.

• La statistique inférentielle
C’est la méthode statistique pour laquelle il est possible de déduire les
caractéristiques
quantitatives de toute une population à partir d’une étude sur un échantillon
issu de celle-ci. Elle nécessite des méthodes d’échantillonnage et des
méthodes
probabilistes.
Dr KANGA Gérard 6 gerardkanga17@[Link]
Chapter 2
ORGANISATION DES
DONNÉES

2.1 Groupement des données

Dans le chapitre précédent nous avons vu des exemples de séries statistiques simples
dont les données sont écrites sous forme brute : {X(1), X(2), . . . X(N)}. Dans la
pratique, le nombre d’individus étant typiquement très grand, il faut
réorganiser ces
données en les regroupant. On dit qu’on fait un dépouillement. La première
étape
consiste:

• pour une variable qualitative ou quantitative discrète : à identifier les


modalités/valeurs
prises par la variable, c’est-à-dire à identifier X(P);

• pour une variable quantitative continue : à construire des intervalles ou


classes
formant une partition de l’ensemble des valeurs possibles de la
variable. Si
possible, on fait en sorte que les classes soient d’amplitudes égales, au
nombre
de 5 à 20 (de préférence entre 6 et 12), du type [a; b[.

Cependant, lorsque une variable quantitative discrète prend un grand


nombre de
valeurs différentes, il est souvent utile de la voir comme une variable
quantitative
continue et d’effectuer un regroupement en classes. Cela permet une
analyse plus
claire des données.
Voici les notations utilisées dans ce cours.

Terminologie Notation
Nombre de modalités/valeur/classes pour p
X
Modalités d’une variable qualitative X X(P) = {m1, . . . mp}
Valeurs prises par une variable discrète X X(P) = {x1, . . . xp}
Intervalles pour une variable continue X X(P) = {[a0; a1[, . . . [ap−1;
ap[}

7
CHAPTER 2. ORGANISATION DES DONNÉES 8

On a toujours p ≤N.

Exemple 2.1.1 Si nous reprenons l’exemple 1.2.1: p = 4, les modalités sont:m1 =


P, m2 = R, m3 = C et m4 = N

2.2 Tableau des effectifs et des fréquences


Afin
de retrouver toute l’information de la série statistique brute en utilisant les
regroupements
de la section précédente, il faut donner pour chacune des
modalités/valeurs/classes
son effectif. Ceci nous permet ensuite de définir les fréquences et fréquences
cumulées.
Dans toute cette section, nous considérons une population P de taille N sur
laquelle
nous étudions une variable X.

2.2.1 Effectifs et fréquences


Définition 2.2.1 Soit i ∈{1 . . . p}

1. Le nombre ni d’individus pour lesquels la modalité/la valeur de la variable


X est mi/xi/dans[ai−1; ai[ est appelé effectif ou fréquence absolue
associé à
mi/xi/[ai−1; ai[.

2. La fréquence relative ou simplement fréquence associée à mi/xi/[ai−1;


ai[ est le
rapport de l’effectif sur la taille de la population.

fi =ni
N

Propriétés 1
p p
ni = N et fi = 1 (2.1)
i=1 i=1

A l’aide ces quantités, on peut construire un tableau qui permet de résumer ces
données.

Variable X m1/x1/[a0; a1[ m2/x2/[a1; a2[ . . . mp/xp/[ap−1; ap[ Total


Effectif n1 n2 ... np N
Fréquence f1 f2 ... fp 1

Exemple 2.2.1 Situation matrimoniale de 50 employés d’une société.

Tableau 2.2.1
Modalités Marié Célibataire divorcé veuf(ve) Total
Effectifs 18 22 7 3 50
Fréquences
Exemple 2.2.2 Nombre d’enfants à charge de 50 employés d’une société.

Dr KANGA Gérard 8 gerardkanga17@[Link]


CHAPTER 2. ORGANISATION DES DONNÉES 9

Tableau 2.2.2
Nombre d’enfants 0 1 2 3 4 5 Total
Effectifs 6 15 17 6 4 2 50
Fréquences

Exemple 2.2.3 Revenus moyens (en milliers de F) des ménages d’un quartier.

Tableau 2.2.3
Revenus [75; 100[ [100; 150[[150; 200[[200; 300[[300; 500[ Total
Nbre ménages 12 24 36 6 2 80
Fréquences

2.2.2 Effectifs et fréquences cumulées


Dans cette section, on exclut le cas des variables qualitatives nominales.

• Si la variable X est qualitative ordinale, les modalités m1, m2, . . . mp sont


ordonnées suivant l’ordre croissant naturel (ou hiérarchique ascendant);

• si elle est quantitative discrète, les valeurs sont classées en ordre croissant :
x1 < x 2 < · · · < x p ;

• si elle est quantitative continue, les intervalles suivent un ordre croissant


naturel: [a0; a1, [a1; a2, . . . [ap−1; ap[.

Définition 2.2.2 Soit k ∈{1 . . . p}

1. L’effectif cumulé croissant (respectivement décroissant) de la modalité mk/valeur


xk/ classe [ak−1; ak[, est la somme des effectifs n1 . . . nk(respectivement nk . . . np).

k p
νk = nj etνk = nj (2.2)
j=1 j=k

2. La fréquence cumulée croissante (respectivement décroissante) de la modalité


mk/valeur xk/ classe [ak−1; ak[, est la somme des fréquences f1 . . .
fk(respectivement
fk . . . fp).

k p
ϕk = fj etϕk = fj (2.3)
j=1 j=k

Remarque 2.2.1
 ν1 = n 1
νk+1 = νk + nk+1 ∀k ∈{1 . . . p −1} (2.4)

 νp = N
Dr KANGA Gérard 9 gerardkanga17@[Link]
CHAPTER 2. ORGANISATION DES DONNÉES 10

 νp = n p
νk−1 =νk + nk−1 ∀k ∈{1 . . . p −1} (2.5)

 ν1 = N
 ϕ1 = f1
ϕk+1 = ϕk + fk+1 ∀k ∈{1 . . . p −1} (2.6)

 ϕp = 1

 ϕp = fp
ϕk−1 =ϕk + fk−1 ∀k ∈{1 . . . p −1} (2.7)

 ϕ1 = 1

Dr KANGA Gérard 10 gerardkanga17@[Link]


CHAPTER 2. ORGANISATION DES DONNÉES 11

INTERPRÉTATIONS

1. CAS D’UNE VARIABLE DISCRÈTE

(a) L’effectif cumulé croissant (νk) d’une valeur xk représente le nombre


d’individus
de la population dont la valeur de la variable est inférieure ou égale à
xk ;
(b) L’effectif cumulé décroissant (νk) d’une valeur xk représente le nombre
d’individus de la population dont la valeur de la variable est supérieure ou
égale à xk;
(c) La fréquence cumulée croissante (ϕk) d’une valeur xk représente le
pourcentage
d’individus de la population dont la valeur de la variable est inférieure ou égale
à xk;
(d) La fréquence cumulée décroissante (ϕk) d’une valeur xk représente le
pourcentage
d’individus de la population dont la valeur de la variable est supérieure ou
égale à xk;

2. CAS D’UNE VARIABLE CONTINUE

(a) L’effectif cumulé croissant (νk) d’une classe [ak−1; ak[ représente le nombre
d’individus de la population dont la valeur de la variable est strictement
inférieure à ak;
(b) L’effectif cumulé décroissant (νk) d’une classe [ak−1; ak[ représente le nombre
d’individus de la population dont la valeur de la variable est supérieure ou
égale à ak−1;
(c) La fréquence cumulée croissante (ϕk) d’une classe [ak−1; ak[ représente le
pourcentage d’individus de la population dont la valeur de la variable est
strictement inférieure à ak;
(d) La fréquence cumulée décroissante (ϕk) d’une classe [ak−1; ak[ représente
le pourcentage d’individus de la population dont la valeur de la
variable
est supérieure ou égale à ak−1;

APPLICATIONS: Compléter les tableaux suivants:

Tableau 2.2.4
Nombre d’enfants 0 1 2 3 4 5 Total
Effectifs 6 15 17 6 4 2 50
Fréquences
νk
νk
ϕk
ϕk
Tableau 2.2.5
Revenus [75; 100[ [100; 150[[150; 200[[200; 300[[300; 500[ Total
Nbre ménages 12 24 36 6 2 80
Fréquences
νk
νk
ϕk
ϕk

Dr KANGA Gérard 11 gerardkanga17@[Link]


CHAPTER 2. ORGANISATION DES DONNÉES 12

2.2.3 Amplitude et densité de proportion


Dans cette section, on se restreint au cas où la variable X est quantitative continue,
avec les classes [a0; a1[, . . . [ap−1; ap[. On a:

Définition 2.2.3 Soit i ∈{1 . . . p}

1. L’amplitude de la classe [ai−1; ai[ est li = ai −ai−1.

2. La densité de proportion de la classe [ai−1; ai[ est di .


=fi
Remarque 2.2.2 1. La densité de proportion permet de comparer les effectifs
dans chaque classe en tenant compte de la taille de ces classes.

2. Dans le cas de classes qui ont toutes la même longueur, il n’est pas nécessaire
de calculer la densité de proportion, il est suffisant d’étudier les fréquences
relatives ou absolues (qui sont directement proportionnelles à la densité de
proportion)

APPLICATIONS

Dr KANGA Gérard 12 gerardkanga17@[Link]


CHAPTER 2. ORGANISATION DES DONNÉES 13

2.3 Représentations graphiques


Pour chaque type de variable, il existe des représentations graphiques qui
illustrent
les tableaux obtenus dans la section précédente.

2.3.1 Variables qualitatives


Diagrammes circulaires
Dans un diagramme circulaire (ou camembert), les modalités sont
représentées par
des secteurs angulaires d’un disque (ou d’un demi-disque), tels que la
mesure de
chaque angle soit proportionnelle à l’effectif ou à la fréquence de la
modalité qu’il
représente. On effectue donc un produit en croix pour connaître l’angle de
chaque
secteur. Dans le cas d’un disque complet, la mesure de l’angle (en degré)
est fi∗360.

Exemple 2.3.1 Tableau 2.2.1

Repartition selon la situation


matrimoniale

6%
14%
36%
Marié
Célibataire
Divorcé
44%
Veuf(ve)

:
Dr KANGA Gérard 13 gerardkanga17@[Link]
CHAPTER 2. ORGANISATION DES DONNÉES 14

Diagrammes en barres
Pour obtenir un diagramme en barres, on trace un repère formé d’un axe
horizontal
non gradué et d’un axe vertical gradué.
- Sur l’axe horizontal, on trace des rectangles de même largeur,
représentant les
modalités, que l’on place à des distances régulières les uns des autres;
- Les hauteurs des rectangles sont proportionnelles aux effectifs ou aux
fréquences
des modalités.

Exemple 2.3.2 Tableau 2.2.1

2.3.2 Variables quantitatives discrètes


Diagrammes en bâtons
Pour obtenir un diagramme en bâtons, on trace un repère formé de deux
axes gradués
orthogonaux.
-Sur l’axe des abscisses, on place les valeurs x1, . . . xp prises par la variable.
- Sur l’axe des ordonnées, on place les effectifs ou les fréquences
correspondant aux
différentes valeurs.
La courbe joignant les sommets des bâtons est appelée polygones des
effectifs ou des
fréquences.

Exemple 2.3.3 Prendre tableau 2.2.2


Dr KANGA Gérard 14 gerardkanga17@[Link]
CHAPTER 2. ORGANISATION DES DONNÉES 15

2.3.3 Variables quantitatives continues


Histogrammes
Pour obtenir un histogramme, on trace un repère formé de deux axes
gradués
orthogonaux.
- Sur l’axe des abscisses, on place les valeurs des bornes des classes,
- Sur l’axe des ordonnées, on place des pourcentages. Une classe [ai−1;
ai[ est
représentée par un rectangle de largeur l’amplitude li et de hauteur la
densité de
proportion di. Cela revient en fait à ce que l’aire de ce rectangle soit la
fréquence
fi. En effet, l’aire du rectangle représentant [ai−1; ai[ est:

fi
lidi = li = fi
li
Exemple 2.3.4
Dr KANGA Gérard 15 gerardkanga17@[Link]
CHAPTER 2. ORGANISATION DES DONNÉES 16

2.3.4 Fonction de répartition empirique


Dans cette section, nous nous restreignons au cas des variables quantitatives.

Variables quantitatives discrètes


On suppose que la variable X est discrète et prend les valeurs x1 < · · · < xp
Définition 2.3.1 La fonction de répartition empirique de X est l’application
FX : R →[0, 1] définie par:

• ∀t ∈] −∞, x1[, FX(t) = 0;

• ∀i ∈{1, . . . , p −1} , ∀t ∈[xi, xi+1[, FX(t) = ϕi;

• ∀t ∈[xp, +∞[, FX(t) = 1


REPRÉSENTATION GRAPHIQUE

Dr KANGA Gérard 16 gerardkanga17@[Link]


CHAPTER 2. ORGANISATION DES DONNÉES 17

Variables quantitatives continues


On suppose que la variable X est continue et a les classes [a0, a1[, . . . [ap−1, xp[.
Définition 2.3.2 La fonction de répartition empirique de X est l’application
FX : R →[0, 1] définie par:

• ∀t ∈] −∞, a0[, FX(t) = 0;

• ∀i ∈{1, . . . , p} , ∀t ∈[ai−1, ai[, FX(t) = ϕi−1+di(t−ai−1); (convention: ϕ0 = 0)

• ∀t ∈[ap, +∞[, FX(t) = 1.

Remarque 2.3.1 La représentation graphique de la fonction de répartition empirique


est est courbe obtenue en reliant par des segments de droite, les points A0(a0; 0) et
Ai(ai; ϕi), i = 1 . . . p.
En effet, une équation de la droite qui passe par deux points consécutifs Ai−1(ai−1; ϕi−1),
et Ai(ai; ϕi), est:
y =ϕi −ϕi−1 t + ϕi−1 −ϕi ai−1
ai −ai−1 ai −ai−1
−ϕi−1
Cette courbe est appelée polygone cumulatif croissant.
On peut envisager aussi le polygone cumulatif décroissant en reliant par des segments
de droite les pointsAi(ai−1;ϕi), i = 1 . . . p −1; et Ap(ap; 0).

REPRÉSENTATION GRAPHIQUE

Dr KANGA Gérard 17 gerardkanga17@[Link]


Chapter 3
STATISTIQUE DESCRIPTIVE
UNIVARIEE

Considérons une population P de taille N sur laquelle on étudie une variable


X.
Nous disposons donc d’une série statistique univariée à laquelle nous
souhaitons
associer des paramètres qui synthétisent l’information. Ils sont
essentiellement de
trois types:

• Les paramètres de position;

• Les paramètres de dispersion;

• Les paramètres de forme;


Nous rappelons que:
- les individus sont numérotés de sorte que la variable X soit croissante,
c’est à dire
X(1) < X(2) < · · · < X(N) en série brute.
- Si la variable est quantitative discrète, nous regroupons la série de sorte que
x1 < x 2 < · · · < x p .
- Si la variable est quantitative continue, nous regroupons les classes de
façon
ordonnée:[a0, a1[, . . . [ap−1, xp[.
Pour i ∈1, . . . p, nous notons xi =ai−1 + le centre de la classe [ai−1, ai[.
aRappelons
i aussi que lors du regroupement en classes, on perd l’information
de la
répartition à l’intérieur des classes. Dans les calculs de paramètres ci-
dessous, on
approchera les valeurs de la classe par le centre et on obtiendra donc des
paramètres
approchés pour les variables continues.

3.1 Paramètres de position


3.1.1 Le mode
Le mode contient l’information des valeurs où les données sont les plus "concentrées".
Définition 3.1.1 1. Si la variable X est discrète, son mode est la ou les
valeurs
de la variable correspondant à la fréquence maximale.

18
CHAPTER 3. STATISTIQUE DESCRIPTIVE UNIVARIEE 19

2. Si la variable X est continue, sa classe modale, est la ou les classes de


densité
de proportion maximale.

Exemple 3.1.1

3.1.2 Les quantiles


• Médiane:

Définition 3.1.2 Supposons que la variable X soit discrète. La


médiane m
est un nombre tel qu’au moins la moitié de l’effectif de la série soit
inférieur
ou égal à m et au moins la moitié de l’effectif de la série soit supérieur
ou égal
à m.

- Si N est impair (N=2p+1) alors la médiane est X(p + 1).


- Si N est pair (N=2p) alors l’intervalle [X(P), X(p + 1)] est appelé intervalle
médian et son centre est la médiane.
Dans tous les cas, nous pouvons retenir que:

m = min xi : i ∈1, . . . p, ϕi ≥1 (3.1)


2

Exemple 3.1.2

Définition 3.1.3 Supposons que la variable X soit continue. La classe


médiane
est telle que au moins la moitié de l’effectif appartienne aux classes
"inférieures
ou égales" à cette classe et au moins la moitié appartienne aux classes
"supérieures
ou égales" à cette classe.

De manière analogue au cas discret, il est plus aisé d’avoir une


définition qui
donne un nombre que l’on puisse calculer. On introduit donc la
définition
suivante. La médiane d’une variable continue X, notée m, est la plus
petite
solution de l’équation:

FX(t) = 1 (3.2)
2
où FX est la fonction de répartition empirique de X. Autrement dit,
m = min t ∈[a0; ap] : FX(t) = 1
2

Dr KANGA Gérard 19 gerardkanga17@[Link]


CHAPTER 3. STATISTIQUE DESCRIPTIVE UNIVARIEE 20

Propriétés 2 La médiane d’une variable continue X satisfait à l’égalité suivante:


1
m = ai0−1 +ai0 −ai0−1 2−ϕi0−1 (3.3)
ϕi0 −ϕi0−1

où i0 = min i ∈{1, . . . p} : FX(ai) ≥1


2

APPLICATION

• Quantiles d’ordre r:

Définition 3.1.4 Soit r ∈]0; 1[.


- Si X est discrète, le quantile d’ordre r, noté Qr est l’unique valeur xi0,
i0 ∈{1, . . . p}, telle que ϕi0−1 < r < ϕi0.

Qr = min {xi : i ∈{1, . . . p} et ϕi ≥r}

- Si X est continue, le quantile d’ordre r noté Qr est la plus petite solution de


l’équation FX(t) = r.

Qr = min {t ∈[a0, ap] : FX(t) = r}

Remarque 3.1.1 Le quantile d’ordre 1/2 est la médiane.

Définition 3.1.5 • Pour n ∈{1; 2; 3}, le nèmequartile est le quantile d’ordre


n
4: Qn .
4
Il y a 3 quartiles qui divisent la population en 4 parties égales.

• Pour n ∈{1 . . . 9}, le nèmedécile est le quantile d’ordren .


10: Q n 10
Il y a 9 quartiles qui divisent la population en 10 parties égales.
n
• Pour n ∈{1, . . . 99}, le nèmecentile est le quantile 100: Q n .
d’ordre 100
Il y a 99 centiles qui divisent la population en 100 parties égales.

Propriétés 3 Le quantile d’ordre r d’une variable continue X satisfait à l’égalité


suivante:
Qr = ai0−1 +ai0 −ai0−1 (r −ϕi0−1) (3.4)
ϕi0 −ϕi0−1
où i0 = min {i ∈{1, . . . p} : FX(ai) ≥r}

Méthode pratique:

1. S’il existe k ∈{1; 2; . . . p} tel que ϕk = r, alors Qr = ak;

Dr KANGA Gérard 20 gerardkanga17@[Link]


CHAPTER 3. STATISTIQUE DESCRIPTIVE UNIVARIEE 21

2. Si non,

Qr =r −ϕi−1 (ai −ai−1) + ai−1 (3.5)


ϕi −ϕi−1
C’est la formule de l’interpolation linéaire.

APPLICATIONS

1. Poids d’un certain nombre de marchandises

Tableau 3.1.1
Poids en kg [5; 10[ [10; 15[ [15; 20[ [20; 30[ [30; 40[ [40; 50[ Total
effectifs 3 4 6 12 15 10 50
f.c.c ϕi 0.06 0.14 0.26 0.50 0.80 1

• la médiane: m=30; 50% des marchandises ont un poids inférieur à 30


Kg.
• le huitième décile(quantile d’ordre 0.8) : D8=40; 80% des marchandises
ont un poids inférieur à 40 Kg.
• Quantile d’ordre 0.2

0.14 0.2 0.26


15 Q0.2 20
ϕ2 r ϕ3
a2 Qr a3
Qr −a2 =r −ϕ2
(3.6)
a3 −a2 ϕ3 −ϕ2
Donc,
Qr =r −ϕ2 (a3 −a2) + a2
ϕ3 −ϕ2

Dr KANGA Gérard 21 gerardkanga17@[Link]


CHAPTER 3. STATISTIQUE DESCRIPTIVE UNIVARIEE 22

3.1.3 Les moyennes


1. Moyenne arithmétique

Définition 3.1.6 La moyenne arithmétique de X est:

p p
x =1 n i xi = fixi
N i= i=1
1
(3.7)

APPLICATIONS

Proposition 3.1.1 Soient X et Y deux variables, et soient a et b deux nombres


réels. Alors,
- la moyenne arithmétique de la variable U = aX + b est u = ax + b;
- la moyenne arithmétique de la variable V = aX + bY est v = ax + by;

APPLICATIONS

Proposition 3.1.2 Une variable X est définie sur une population P subdivisée
en k sous populations P1, . . . Pk, d’effectifs respectifs N1, . . . Nk, et de moyennes
respectives x1, . . . xk, alors la moyenne de la population est:
k
1
x= N i xi (3.8)
i=1Ni i=1

APPLICATION

2. Moyenne géométrique

Dr KANGA Gérard 22 gerardkanga17@[Link]


CHAPTER 3. STATISTIQUE DESCRIPTIVE UNIVARIEE 23

Définition 3.1.7 On suppose que X ne prend que des valeurs


positives.
La moyenne géométrique de X la quantité
N
GX = 1∗· · · ∗xnp (3.9)

Remarque 3.1.2 La moyenne géométrique de X est l’exponentielle de la


moyenne
arithmétique du logarithme de X.

En effet,

1 p
GX = exp nilnxi (3.10)
N i=1

1 p
GX = exp lnxni i
N i=1

1 p
GX = exp N ln xni
i
i=1

1
 p N 
GX = exp xini 
ln i=1 

N
GX = 1∗· · · ∗xnp (3.11)
APPLICATION

3. Moyenne harmonique

Définition 3.1.8 On suppose que X ne prend aucune valeur nulle.


La moyenne harmonique de X est l’inverse de la moyenne arithmétique de
l’inverse de X.
−1
1 p 1
HX = ni (3.12)
N i=1 xi

APPLICATION

4. Moyenne quadratique

Dr KANGA Gérard 23 gerardkanga17@[Link]


CHAPTER 3. STATISTIQUE DESCRIPTIVE UNIVARIEE 24

Définition 3.1.9 La moyenne quadratique de X est la racine carrée de la


moyenne arithmétique du carré de X:

1 p
QX = ni x 2 (3.13)
N i=1

APPLICATION

Dr KANGA Gérard 24 gerardkanga17@[Link]


CHAPTER 3. STATISTIQUE DESCRIPTIVE UNIVARIEE 25

3.2 Paramètres de dispersion


Les paramètres de dispersion mesurent la dispersion des valeurs autour des
paramètres
de position, notamment autour de la moyenne arithmétique.

3.2.1 Étendue et distance inter-quartile


Définition 3.2.1 L’étendue de la variable X est l’écart entre la plus grande
valeur
et la plus petite valeur de X.

eX = Xmax −Xmin (3.14)

Exemple 3.2.1

Définition 3.2.2 La distance inter-quartile de la variable X est l’écart entre


le
troisième quartile et le premier quartile.

DIQX = Q3/4 −Q1/4 (3.15)

Exemple 3.2.2

3.2.2 Écart absolu moyen


Définition 3.2.3 L’écart absolu moyen de X est la moyenne arithmétique
des écarts
entre les valeurs et la moyenne arithmétique de X.
p p
Em = 1 ni |xi −x| fi |xi −x| (3.16)
N i=1 = i=1

Exemple 3.2.3

Dr KANGA Gérard 25 gerardkanga17@[Link]


CHAPTER 3. STATISTIQUE DESCRIPTIVE UNIVARIEE 26

3.2.3 Variance et écart-type


Définition 3.2.4 La variance d’une variable X est la moyenne arithmétique des
carrés des écarts entre les valeurs et la moyenne arithmétique de X:
p p
V (X) = 1 ni (xi −x)2= fi (xi −x)2 (3.17)
N i=1 i=1

et l’écart-type est:
σX = V (X)

Exemple 3.2.4

Proposition 3.2.1
p
V (X) = fix2 1−x2 (3.18)
i=1

(moyenne quadratique au carré-moyenne arithmétique au carré)


Preuve:

Proposition 3.2.2 Si a et b sont deux nombres réels, alors la variance de la variable


Y = aX + b est:
V (Y ) = a2V (X) (3.19)
et l’écart-type est
σY = |a| σX (3.20)

Preuve:

APPLICATION:

Dr KANGA Gérard 26 gerardkanga17@[Link]


CHAPTER 3. STATISTIQUE DESCRIPTIVE UNIVARIEE 27

Proposition 3.2.3 Une variable X est définie sur une population P subdivisée en k
sous populations P1, . . . Pk, d’effectifs respectifs N1, . . . Nk, de moyennes respectives
x1, . . . xk, et de variances respectives V1(X) . . . Vp(X) alors la variance de la population
est:
p p
V (X) = 1 Ni (xi −x)2+ 1 NiVi(X) (3.21)
N i=1 N i=1

Variance des moyennes(Variance inter-population)+moyenne des variances(Variance


intra-population).

Preuve:

APPLICATION

Dr KANGA Gérard 27 gerardkanga17@[Link]


CHAPTER 3. STATISTIQUE DESCRIPTIVE UNIVARIEE 28

3.3 Paramètres de forme


3.3.1 Variable centrée réduite
Définition 3.3.1 Une variable X est dite centrée si sa moyenne arithmétique est
nulle (x = 0) et elle est dite réduite si son écart-type est égal à 1 (σX = 1).
Propriétés 4 Si X une variable statistique alors la variable T =X −x est une
σX
variable centrée réduite.
Remarque 3.3.1 Lorsqu’on on transforme une variable en variable centrée
réduite
conformément à la propriété précédente, on retire à cette variable toute
l’information
concernant son échelle ou unité, et sa localisation. Il ne reste plus que des
informations
sur la forme de la distribution. Cette transformation permet de comparer
plusieurs
variables sur le plan de la forme.

3.3.2 Moments d’une distribution


Définition 3.3.2 1. On appelle moment à l’origine d’ordre r, le paramètre
m r= 1 p p
N n i x r i= f i xr (3.22)
i=1 i=1

2. On appelle moment centré d’ordre r, le paramètre


p p
mr = 1 ni(xi −x)r= fi(xi −x)r (3.23)
N i=1 i=1

3.3.3 Coefficient d’asymétrie de Fisher


Une distribution est parfaitement symétrique, si les valeurs qu’elle prend sont
également
dispersées de part et d’autre de la moyenne. Dans ce cas, son mode, sa
moyenne
et sa médiane sont confondues, ses quartiles Q1 et Q3, ses déciles D1 et D9
sont
équidistants de la valeur centrale, et son histogramme admet un axe de
symétrie
(symétrie par rapport à la valeur de la moyenne).
Ce n’est pas le cas pour les distributions asymétriques ou obliques. On
peut
mesurer l’asymétrie d’une distribution au moyen du moment centré d’ordre
3:
Définition 3.3.3 Le coefficient d’asymétrie de Fisher est la quantité suivante:
p 3
i=1fi(xi−x)3 xi −x
γ1 =m3 = = fi (3.24)
σ3 σ3 i=1 σX
X X
Critère d’asymétrie
1. Si γ1 < 0, alors la distribution est allongée à gauche c’est à dire les
petites
valeurs de X sont moins fréquentes que les grandes.
2. Si γ1 > 0, alors la distribution est allongée à droite c’est à dire les
grandes
valeurs de X sont moins fréquentes que les petites.
3. Si γ1 = 0, alors la distribution est symétrique.

Dr KANGA Gérard 28 gerardkanga17@[Link]


CHAPTER 3. STATISTIQUE DESCRIPTIVE UNIVARIEE 29

APPLICATIONS

3.3.4 Coefficient d’aplatissement


L’aplatissement (ou kurtosis en anglais) est mesuré à l’aide du moment centré
d?ordre 4.

Définition 3.3.4 1. Le coefficient d’aplatissement de Pearson est la quantité


suivante:
p 4
i=1fi(xi−x)4 xi −x
β2 =m4 = = fi (3.25)
σ4 σ4 i=1 σX
X X

2. Le coefficient d’aplatissement de Fisher ou coefficient de Yule est la quantité


suivante:
γ2 = β2 −3 (3.26)

Critère d’aplatissement

1. Si γ2 < 0, son histogramme est plus arrondi et possède des queues plus
courtes (distribution plus aplatie que la distribution normale). On dit que
la distribution est platykurtique.

2. Si γ2 > 0, son histogramme est plus pointu et possède des queues plus longues
(distribution moins aplatie que la distribution normale). On dit que la distribution
est leptokurtique.

3. Si γ2 = 0, (la densité de la loi normale, ou courbe en cloche, est mésokurtique).


APPLICATION:

Dr KANGA Gérard 29 gerardkanga17@[Link]


Chapter 4
Analyse bi-variée

Considérons une population P de taille N, P = {1 . . . N} sur laquelle on étudie


deux variables X et Y . Ces variables peuvent être soit qualitatives, quantitatives
discrètes ou continues. Le but de cette section est d’étudier les relations entre X et
Y , ce qui revient mathématiquement à étudier les propriétés du couple (X, Y ). On
définit dans ce chapitre essentiellement deux types de quantités, celles dites :

• marginales qui dépendent que d’un seul critère(variable);


• conditionnelles qui renseignent sur une variable en fonction des modalités de
l’autre.

On suppose que la variable X possède p modalités x1, x2, . . . xp et que la variable


Y possède q modalités y1, y2, . . . yq.
Les modalités du couple (X, Y ) sont {(xi, yj)}1≤i≤p 1≤j≤q au nombre de p × q.

4.1 Tableau de contingence, distributions


marginales,
distributions conditionnelles
4.1.1 Tableau de contingence
Définition 4.1.1 On appelle tableau de contingence, un tableau du type:

Tableau 4.1.1
y1 y2 ... yj ... yq Total
HHHHHH
x1 n11 n12 . . . n1j ... n1q n1.
x2 n21 n22 . . . n2j ... n2q n2.
... ... ... ... ... ... ... ...
xi ni1 ni2 . . . nij ... niq ni.
... ... ... ... ... ... ... ...
xp np1 np2 . . . npj ... npq np.
Total n.1 n.2 . . . n.j ... n.q n..
30
CHAPTER 4. ANALYSE BI-VARIÉE 31

• nij est le nombre d’individus présentant la modalité xi pour la variable


X et
la modalité yj pour la variable Y .

• n.. est l’effectif total(taille de la population).

• Les rapports fij =nij n..sont appelés fréquences partielles. Il s’agit de la


proportion
des individus qui présentent la modalité xi de la variable X et la
modalité yj
de la variable Y .

Le tableau (4.1.1), appelé tableau de contingence des effectifs, peut


se construire
avec les fréquences partielles. On obtient alors le tableau de
contingence des
fréquences. Nous pouvons donc remarquer que:

nij = n.. = N (4.1)


i,j

fij = 1 (4.2)
i,j

La formule (4.2) s’obtient de la formule (4.1) en la divisant par n..

4.1.2 Distributions marginales


Définition 4.1.2 Une distribution marginale est une distribution univariée: variable
X ou variable Y .

• Pour tout i = 1 . . . p, l’effectif marginal de la modalité xi est l’effectif de


xi de
la variable X (on ignore les valeurs de Y ). On le note ni.

• Pour tout j = 1 . . . q, l’effectif marginal de la modalité yj est l’effectif de


yj de
la variable Y (on ignore les valeurs de X). On le note n.j

• Pour tout i = 1 . . . p, la fréquence marginale de la modalité xi est la


fréquence
de xi de la variable X (on ignore les valeurs de Y ). On le note fi..

q
fi. =ni. N= fij (4.3)
j=1
Dr KANGA Gérard 31 gerardkanga17@[Link]
CHAPTER 4. ANALYSE BI-VARIÉE 32

• Pour tout j = 1 . . . q, la fréquence marginale de la modalité yj est la fréquence


de yj de la variable Y (on ignore les valeurs de X). On la note f.j.

p
f.j =n.j N= fij (4.4)
i=1

Propriétés 5 • (P1):
p q
ni. = n.j = N (4.5)
i=1 j=1

• (P2):
p q
fi. = f.j = 1 (4.6)
i=1 j=1

4.1.3 Distributions conditionnelles


En extrayant une colonne (respectivement une ligne) du tableau de contingence, on
obtient une distribution conditionnelle de X (respectivement de Y ). Précisément,
l’extraction de la colonne j (respectivement de la ligne i) permet de répondre à
la question « Sachant que Y vaut yj (respectivement X vaut xi), comment se
comporte X (respectivement Y ) ? » Ainsi, une distribution conditionnelle est l’étude
d’un critère lorsque l’autre reste fixé à une valeur ou modalité connue. On note
X/Y =yj (respectivement Y/X=xi) la distribution conditionnelle de X sachant Y =
yj
(respectivement distribution conditionnelle de Y sachant X = xi).

Définition 4.1.3 Soient i ∈{1 . . . p} et j ∈{1 . . . q}.

• La fréquence conditionnelle de xi sachant yj est la fréquence fi/j =nij n.j.

• La fréquence conditionnelle de yj sachant xi est la fréquence fj/i =nij

Propriétés 6 •
p
∀j ∈{1 . . . q} , fi/j = 1 (4.7)
i=1


q
∀i ∈{1 . . . p} , fj/i = 1 (4.8)
j=1

Dr KANGA Gérard 32 gerardkanga17@[Link]


CHAPTER 4. ANALYSE BI-VARIÉE 33

4.1.4 Tableau profils-colonne, tableau profils-ligne


Définition 4.1.4 • Le tableau profils-colonne est le tableau qui représente les q
distributions conditionnelles de X sachant Y.

• Le tableau profils-ligne est le tableau qui représente les p distributions


conditionnelles
de Y sachant X.

Exemple 4.1.1 Le tableau suivant indique les notes en Maths(X) et les


notes en
Anglais(Y) obtenues par 50 étudiants à un examen.

Tableau 4.1.2
11 12 13 Total
HHHHHH
10 2 10 3 15
11 3 9 6 18
14 1 5 6 12
15 0 2 3 5
Total 6 26 18 50

1. Tableau de contingence des fréquences

Tableau 4.1.3
11 12 13 Total
HHHHHH
10
11
14
15
Total

2. Tableaux des distributions marginales

(a) Distribution marginale de X

Tableau 4.1.4

HHHHHH
effectifs
10 15
11 18
14 12
15 5
Total 50

(b) Distribution marginale de Y

Dr KANGA Gérard 33 gerardkanga17@[Link]


CHAPTER 4. ANALYSE BI-VARIÉE 34

Tableau 4.1.5
11 12 13 Total
HHHHHH

Effectifs 6 26 18 50

3. Tableaux des distributions conditionnelles

(a) Distribution conditionnelle de X sachant Y=12

Tableau 4.1.6
12 Total
HHHHHH
10 10
11 9
14 5
15 2
Total 26

C’est la distribution des notes de Maths des étudiants qui ont eu 12 en


Anglais.
(b) Distribution conditionnelle de Y sachant X=14

Tableau 4.1.7
11 12 13 Total
HHHHHH

14 1 5 6 12

Total

C’est la distribution des notes d’Anglais des étudiants qui ont eu 14 en


Maths.

4. Tableau profils-colonne

Tableau 4.1.8
11 12 13 Total
HHHHHH
10 2
6
10 3
18
11 3
6
26
9
26
6
18
1 5 6
14 6 26 18
15 0
6
2
26
3
18
Total 1 1 1

Dr KANGA Gérard 34 gerardkanga17@[Link]


CHAPTER 4. ANALYSE BI-VARIÉE 35

5. Tableau profils-ligne

Tableau 4.1.9
11 12 13 Total
HHHHHH
10 2
15
10 3
15
1
11 3
18
15
9
18
6
18
1
14 1
12
5
12
6
12
1
15 0
5
2
5
3
5
1
Total

4.2 Indépendance, liaison fonctionnelle


4.2.1 Indépendance
Définition 4.2.1 Les variables X et Y sont dites indépendantes lorsque:
∀(i, j) ∈{1 . . . p} × {1 . . . q}, fi. ∗f.j = fij
Proposition 4.2.1 Les assertions suivantes sont équivalentes:
• (i) X et Y sont indépendantes

• (ii) ∀(i, j) ∈{1 . . . p} × {1 . . . q}, nij =ni.n.j


N
• (iii) ∀(i, j) ∈{1 . . . p} × {1 . . . q}, fi/j = fi.
• (iv)∀(i, j) ∈{1 . . . p} × {1 . . . q}, fj/i = f.j

Exemple 4.2.1

HHHHHH
y1 y2 y3 y4 Total
x1 2 5 4 1 12
x2 4 10 8 2 24
x3 6 15 12 3 36
Total 12 30 24 6 72

4.2.2 Liaison fonctionnelle


Définition 4.2.2 On dit que la variable X est liée fonctionnellement à la variable
Y , lorsque à chaque valeur yj de Y correspond une seule valeur xi possible de X,
c’est à dire pour j fixé, il existe un seul i tel que nij ̸= 0 et donc nij = n.j.

Exemple 4.2.2
HHHHHH
y1 y2 y3 y4 Total
x1 7 0 0 1 8
x2 0 0 8 0 8
x3 0 4 0 0 4
Total 7 4 8 1 20

Dr KANGA Gérard 35 gerardkanga17@[Link]


CHAPTER 4. ANALYSE BI-VARIÉE 36

Définition 4.2.3 On dit que la variable Y est liée fonctionnellement à la


variable
X, lorsque à chaque valeur xi de X correspond une seule valeur yj possible
de Y ,
c’est à dire pour i fixé, il existe un seul j tel que nij ̸= 0 et donc nij = ni..

Exemple 4.2.3

HHHHHH
y1 y2 y3 Total
x1 0 5 0 5
x2 3 0 0 3
x3 0 0 4 4
x4 0 0 5 5
Total 3 5 9 17

Remarque 4.2.1 • Si X est liée fonctionnellement à Y , alors toute


colonne du
tableau contient un seul effectif non nul et nécessairement q ≥p.

• Si Y est liée fonctionnellement à X, alors toute ligne du tableau contient


un
seul effectif non nul et nécessairement p ≥q.

• En conséquence, pour que X soit liée fonctionnellement à Y et Y liée


fonctionnellement
à X, il faut nécessairement que p = q.

Exemple 4.2.4

HHHHHH
y1 y2 y3 y4 Total
x1 0 13 0 0 13
x2 6 0 0 0 6
x3 0 0 12 0 12
x4 0 0 0 9 9
Total 6 13 12 9 40

4.3 Résumés numériques


Dans cette section, nous considérons que les variables X et Y sont quantitatives.

4.3.1 Caractéristiques marginales


1. Moyennes marginales
La moyenne marginale de X est la moyenne de la distribution
marginale de X
p p  q 
x= [Link] = fij fijxi (4.9)
i=1 i=1 j=1 xi = i,j

La moyenne marginale de Y est la moyenne de la distribution marginale de Y

q q p

y= [Link] = fij yj = fijyj (4.10)


j=1 j=1 i=1 i,j

Dr KANGA Gérard 36 gerardkanga17@[Link]


CHAPTER 4. ANALYSE BI-VARIÉE 37

2. Variance et écart-types marginaux La variance marginale de X est la


variance
de la distribution marginale de X
p p q
 
V (X) = fi.(xi −x)2= fij fij(xi −x)2 (4.11)
i=1 i=1 j=1 (xi −x)2= i,j

La variance marginale de Y est la variance de la distribution marginale de Y


q q p
V (Y ) = f.j(yj −y)2= fij (yj −y)2= fij(yj −x)2 (4.12)
j=1 j=1 i=1 i,j

Application et interprétation
Tableau des notes en Maths(X) et des notes en Anglais (Y) d’une classe
de 50
étudiants.
10 12 Total
HHHHHH
8 2 3 5
10 15 20 35
12 4 6 10
Total 21 29 50

1. Moyenne marginale de X: ¯x = 10.2


2. Moyenne marginale de Y: ¯y = 11.16

3. Variance marginale de X: V (X) = 1.16


4. Variance marginale de Y: V (Y ) = 0.9744

Proposition 4.3.1 (Linéarité de la moyenne)


Soient X et Y deux variables et soient a et b deux nombres réels. La
moyenne ¯z de
la variable Z = aX + bY est donnée par ¯z = a¯z + b¯y.

Attention la variance n’est pas linéaire. Nous verrons un peu plus tard comment
calculer la variance d’une combinaison linéaire.

4.3.2 Caractéristiques conditionnelles


Les caractéristiques conditionnelles sont les caractéristiques des distributions
conditionnelles.
1. Moyennes conditionnelles:
Il existe q moyennes conditionnelles de X
sachant Y:
p
xj = fi/jxi j = 1 . . . q (4.13)
i=1

Exemple:
(a) moyennes conditionnelle: ¯x1 = 10.19; la moyenne en Maths des
étudiants
qui ont eu 10 en Anglais est de 10.19.

Dr KANGA Gérard 37 gerardkanga17@[Link]


CHAPTER 4. ANALYSE BI-VARIÉE 38

yj y1 = 10 y2 = 14
¯xj 10.19 ...

Il existe p moyennes conditionnelles de Y sachant X:


q
yi = fj/iyj i = 1 . . . p (4.14)
j=1

Exemple:

(a) moyennes conditionnelle: ¯y1 = 11.2; la moyenne en Anglais des étudiants


qui ont eu 8 en Maths est de 11.2.

xi ¯yi
x1 = 8 11.2
x2 = 10 . . .
x3 = 12 . . .

2. Variances conditionnelles:
Il existe q variances conditionnelles de X sachant Y:
p
Vj(x) = fi/j(xi −xj)2j = 1 . . . q (4.15)
i=1

Il existe p variances conditionnelles de Y sachant X:


q
Vi(y) = fj/i(yj −yi)2i = 1 . . . p (4.16)
j=1

Tableau des caractéristiques conditionnelles et marginales

moyennes variances marginales


Variable X marginales
¯x = i,jfijxi V (X) = i,jfij(xi−¯x)2 = ijfijx2 i−¯x2
Variable Y ¯y = i,jfijyj V (Y ) = i,jfij(yj−¯y)2 = ijfijy2 j−¯y2

sachant X = xi sachant Y = yj
Moyenne conditionnelle de ¯xj =p i=1fi/jxi
X
Moyenne conditionnelle de Y ¯yi = j=1fj/iyj
Variance conditionnelle de X Vj(x) =p i=1fi/j(xi−xj)2
Variance conditionnelle de Y Vi(y) =q j=1fj/i(yj−yi)2

Dr KANGA Gérard 38 gerardkanga17@[Link]


CHAPTER 4. ANALYSE BI-VARIÉE 39

4.4 Lien entre caractéristiques marginales et


caractéristiques
conditionnelles
En observant les q distributions conditionnelles de X sachant Y, nous
pouvons
considérer que la population P est subdivisée en
q sous-populations P1 . . . Pj . . . Pq,
de moyennes conditionnelles respectives x1, . . . xj . . . xq,
de variances conditionnelles respectives V1(X) . . . Vj(X) . . . Vq(X),
et de fréquences respectives f.1 . . . f.j . . . f.q.
En vertu du théorème - - -(chap 3) la moyenne marginale de X est donnée par:
q
x= [Link] (4.17)
j=1

et la variance marginale de X est donnée par:


q q
V (X) = f.j(xj −x)2+ [Link](X) (4.18)
j=1 j=1

(variance des moyennes+moyenne des variances).


Par les p distributions conditionnelles de Y sachant X, nous obtenons de manière
analogue, la moyenne marginale de Y:
p
y= [Link] (4.19)
i=1

et la variance marginale de Y:
p p
V (Y ) = fi.(yi −y)2+ [Link](Y ) (4.20)
i=1 i=1

4.5 Mesure de la corrélation


Dans le souci de calculer la variance d’une combinaison linéaire de deux variables,
nous introduisons les notions suivantes.

4.5.1 Covariance
Soient X et Y deux variables quantitatives.

Définition 4.5.1 On appelle covariance de X et Y , la moyenne des produits


des
écarts des valeurs ou centres des classes de X et Y à leur moyenne
respective.

Cov(X, Y ) = 1 nij(xi −x)(yj −y) (4.21)


N i,j

Remarque 4.5.1 • La covariance est symétrique c’est à dire


Cov(X, Y ) = Cov(Y, X);
Dr KANGA Gérard 39 gerardkanga17@[Link]
CHAPTER 4. ANALYSE BI-VARIÉE 40

• Cov(X, X) = V ar(X)

Proposition 4.5.1

Cov(X, Y ) = 1 nijxiyj −x ∗y = fijxiyj −x ∗y (4.22)


N i,j i,j

Preuve:

Proposition 4.5.2 Soient a, b, c, et d 4 nombres réels. Alors on a:


Cov(aX + b, cY + d) = acCov(X, Y ) (4.23)

V ar(aX + bY ) = a2V ar(X) + 2abCov(X, Y ) + b2V ar(Y ) (4.24)

Preuve:

Théorème 4.5.1 Si X et Y sont indépendantes, alors Cov(X, Y ) = 0

Preuve:

Corollaire 4.5.1 Si X et Y sont indépendantes alors

V ar(X + Y ) = V ar(X) + V ar(Y ) (4.25)

4.5.2 Coefficient de corrélation linéaire


Définition 4.5.2 On appelle coefficient de corrélation linéaire de X et Y le quotient

r(X, Y ) =Cov(X, Y ) (4.26)


σX.σY
Proposition 4.5.3
−1 ≤r(X, Y ) ≤1 (4.27)

INTERPRÉTATION: Lorsque le coefficient de corrélation linéaire en valeur


absolue est proche de 1 (|r(X, Y )| ≥0, 9), cela signifie qu’il existe une corrélation
affine importante entre les deux variables.

APPLICATION:

Dr KANGA Gérard 40 gerardkanga17@[Link]


CHAPTER 4. ANALYSE BI-VARIÉE 41

4.6 Ajustements affines


On suppose qu’il existe une corrélation importante entre X et Y . Le principe de
l’ajustement affine (ou régression linéaire) est de déterminer la "meilleure" droite qui
traduit la liaison affine entre X et Y c’est à dire qui approxime mieux le
nuage de
points. L’objectif est donc de déterminer a et b tels que la droite (D) : Y =
aX + b
traduise au mieux la liaison affine.

4.6.1 Méthode des moindres carrées


Définition 4.6.1 La droite de régression de Y en fonction de X par la méthode des
moindres carrés est la droite:

(DY/X) : Y = aX + b avec a =Cov(X, Y ) et b = Y −aX. (4.28)


V ar(X)
APPLICATION:

4.6.2 Méthode de MAYER


La méthode de MAYER consiste à classé l’ensemble des points dans un
ordre
croissant des valeurs xi de X, ensuite à diviser ces points en deux sous-
groupes
G1 et G2 de même effectif.

Définition 4.6.2 La droite de MAYER est l’unique droite qui passe par les
points
moyens de G1 et G2. Elle est définie par:

(DY/X) : Y = aX + b avec a =Y2 −Y1 et b = Y1 −aX1 (4.29)


X2 −X1
APPLICATION:
Dr KANGA Gérard 41 gerardkanga17@[Link]

Vous aimerez peut-être aussi