0% ont trouvé ce document utile (0 vote)
10 vues9 pages

Analyse de la série statistique double

Transféré par

Ouissèm Sahbani
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
10 vues9 pages

Analyse de la série statistique double

Transféré par

Ouissèm Sahbani
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Statistiques

Introduction :

Le but de ce chapitre est d’étudier simultanément deux caractères statistiques différents dans une même population,
on parle alors de série statistique double. L’étude statistique consiste donc à voir s’il existe un lien entre les deux
caractères d’une série statistique double.

I. SERIE STATISTIQUE DOUBLE

1. Définition :
On dit qu’un couple (X, Y) de variables statistiques définit une série statistique double si les deux variables
X et Y sont observées simultanément sur une même population.

Exemple

L’étude statistique suivante porte sur une population de nouveau- nés. Deux caractères sont étudiés : le poids et la
taille.

X : poids en kg (xi) 2.4 2.6 2.7 3 3.2 3.3 3.5 3.6 3.8 4
Y : taille en cm (yi) 45 47 48 50 51 52 53 54 54 56

Ce tableau est constitué de deux suites de nombres associés à deux caractères quantitatifs X désignant la poids et Y
désignant la taille ; il définit donc une série statistique double ( ou à deux caractères ) . Les valeurs de X et Y sont
données par des couples (x i, y i).

1 10
• La moyenne arithmétique de X est : X = ∑ xi = 3.21 , c’est le poids moyen d’un nouveau-né de cette
10 i =1
population.
1 10
• La moyenne arithmétique de Y est : Y = ∑ yi = 51 , c’est la taille moyenne d’un nouveau-né de cette
10 i =1
population.
1 10 2
( )
2
• La variance de X est : V ( X ) = ∑ xi − X
10 i =1
= 0.2549 .

1 10 2
( )
2
• La variance de Y est : V ( Y ) = ∑ yi − Y
10 i =1
= 11 .

• L’écart-type de X est :  ( X ) = V ( X ) = 0.504 .

• L’écart-type de Y est :  ( Y ) = V ( Y ) = 3.316 .

1
2. Nuage de points :

On considère l’exemple (1) précédent .Dans un repère orthogonal (O, i; j ) on place les points Mi (x i, y i).

L’ensemble des points obtenus est appelé nuage de points représentant la série statistique double.

( )
Le point G X ,Y est appelé point moyen du nuage.( lorsque les variables sont continues on considère les centres des

ai + ai +1
classes : pour une classe  ai , ai + 1  , xi =
2

3. Etude de la liaison entre deux caractères :

Dans ce paragraphe on s’intéresse à la liaison éventuelle entre deux variables statistiques , pour voir comment varie
l’une en fonction de l’autre et de pouvoir prévoir le comportement dans le temps de ces deux variables Pour cela on
peut utiliser le nuage de points de ces deux variables : Si les points du nuage se répartissent autour d’une droite , on
dit que l’une de ces variables est une fonction affine de l’autre . On dit alors qu’on a pratiqué un ajustement linéaire
entre les variables X et Y. Pour déterminer un tel ajustement on déterminera les deux paramètres spécifiques a la
série double qui sont la covariance et le coefficient de corrélation linéaire.

2
a. Covariance :
• Soit (X,Y) une série statistique double de taille n. On désigne par x 1 , x2 ,………x n
les valeurs de X et y1 , y2 ,………y n les valeurs prise par Y.
1 n
On appelle covariance de (X,Y) le réel noté cov(X,Y) défini par : cov ( X ,Y ) = ∑ x i yi − XY
n i =1
On a : cov ( X ,Y ) = cov ( Y , X )

Avec la calculatrice pour calculer la cov(X,Y) on effectue le calcul suivant :

cov( X ,Y ) = [ ( X ) (Y )] .r

• Interprétation de la covariance :
La covariance mesure la tendance qu’ont les deux variables X et Y à varier ensemble.
 Si la covariance est négative alors les deux variables X et Y varient en sens inverses.
 Si la covariance est positive alors les deux variables X et Y varient dans le même sens
( si la covariance est nulle alors on ne peut pas estimer une relation linéaire entre les deux variables).

b. Coefficient de corrélation linéaire :


Soit (X,Y) une série statistique double.
On appelle coefficient de corrélation linéaire le réel r défini par :

cov ( X ,Y )
r= Le réel r est noté aussi  XY .
 ( X ) (Y )

• Le réel r est noté aussi  XY


• −1 ≤ r ≤ 1

c. Ajustement linéaire :
 Méthode des moindres carrés :
3
 Les statisticiens conviennent que lorsque r >  0.86 l’ajustement affine est justifié.
2
Graphiquement le nuage de points aura une forme allongé, dans ce cas il est possible de trouver une
relation affine entre X et Y.
 Droites de régression :
Soit ( X ,Y ) une série statistique double sur un échantillon de taille n.

3
Lorsque < r < 1 (un nuage de points de forme allongé), on peut trouver un ajustement affine
2
entre X et Y donné par les deux droites passants par le point moyen G X ,Y : ( )
- La droite D de régression de Y en X ou des moindres carrés Y en X d’équation :
cov ( X ,Y )
( )
D : Y =  X − X + Y où  =
 2 (X)

3
Ou encore : D : Y − Y =  X − X( )
- La droite D’ de régression de X en You des moindres carrés de X en Y d’équation :
cov ( X ,Y )
( )
D ' : X =  ' Y − Y + X où  ' =
 2 (Y )

(
Ou encore : D ' : X − X =  ' Y − Y )
- Remarque :

(
Y = X − X +Y ⇔ )
Y =  X − X + Y ⇔
cov ( X ,Y )
( )
Y =  X + Y −  X ⇔ Y = bX + a où b =
 2 (X)
et a =Y - b X

Les valeurs de a et b sont déterminées directement en utilisant la calculatrice.


 Exemple :

Dans l’exemple (1), on a un nuage de point de forme allongé, calculons alors r.

3
En utilisant la calculatrice on obtient : r = 0.991 > donc il y a une forte corrélation linéaire entre X et Y,
2

On peut donc pratiquer un ajustement linéaire. Pour expliquer la taille à partir du poids on donnera la droite de
régression de Y en X, soit D cette droite.

cov ( X ,Y )
( )
On a D : Y =  X − X + Y avec  =
 2 (X)

Y=b.X+a avec a =30.095 et b=6.512 donc D : Y=6.512 X+30.095

4
On peut donc prévoir la taille d’un nouveau-né de poids égal à 6 kg. Remplaçons X dans l’équation de la droite D par
la valeur 6 kg, le calcul donne : Y = 6, 512 × 6 + 30,95 = 70,022 cm .

 Méthode de Mayer :
Soit un nuage de points représentant une série statistique double (X, Y) et G son point moyen.
Lorsque le nuage a une forme allongée, on peut effectuer un ajustement linéaire de la série
statistique double (X, Y) par la méthode de Mayer :
 On scinde l’ensemble des points du nuage en deux parties (contenant à peu prés le même nombre de
points).
 On considère les deux points moyens G1 et G2 des deux nuages obtenus.
 La droite (G1 G2) définit un ajustement affine du nuage de points représentant la série statistique
double (X, Y).
 La droite (G1 G2) est appelée : droite de Mayer, elle passe par le point moyen G du nuage.
 Exemple : Dans l’exemple (1)

X : poids en kg (xi) 2.4 2.6 2.7 3 3.2 3.3 3.5 3.6 3.8 4
Y : taille en cm (yi) 45 47 48 50 51 52 53 54 54 56
1er nuage 2 ème nuage

X 1 = 2,78
• G1 ( 2,78; 48, 2 ) est le point moyen du premier nuage.
Y1 = 48, 2
X 2 = 3,64
• G2 ( 3,64; 53,8 ) est le point moyen du deuxième nuage.
Y2 = 53,8
• Droite de Mayer :

5
• Equation cartésienne de la droite (G1 G2) :
1ére méthode :
On pose : ( G1G2 ) : Y = AX + B
Y2 − Y1
A= = 6, 511 d’où ( G1G2 ) : Y = 6, 511X + B
X 2 − X1
G1 ( 2,78; 48, 2 ) ∈ ( G1G2 ) donc : B = 48, 2 − 6, 54 × 2,78 = 30,01
Par suite : ( G1G2 ) : Y = 6, 511X + 30,01 .
2éme méthode :
  0,86 
Le vecteur G1G2   est un vecteur directeur de la droite ( G1G2 ) .
 5,6 
 
M ( X ,Y ) ∈ ( G1G2 ) ⇔ G1 M et G1G2 sont colinéaires
X − 2,78 0,86
⇔ =0
Y − 48, 2 5,6
⇔ 5,6 ( X − 2,78 ) − 0,86 ( Y − 48, 2 ) = 0
⇔ 5,6X − 0,86Y + 25,884 = 0
5,6 25,884
⇔Y = X+
0,86 0,86
Par suite : ( G1G2 ) : Y = 6, 511X + 30,09 .

II. Distributions marginales

Lorsque les données individuelles et l’effectif total d’une population est assez grand, on les présente dans un
tableau appelé tableau à double entrée.
Exemple (Exercice n°4 page 115)
Le tableau suivant donne la répartition d’une population de 100 ménages (familles) selon les deux caractères :
X : le nombre de pièces habitées par ménage.
Y : le nombre d’enfants.

Y 0 1 2 3 4 Total
X

1 6 2 1 0 0 9

2 5 12 8 1 1 27

3 2 7 15 11 3 38

4 0 1 8 14 3 26

Total 13 22 32 26 7 100

nj ni

Le tableau ci-dessus définie une série statistique double ou distribution statistique à deux variables, c’est un cas
d’échantillon groupé.

6
A chaque valeur xi 1 ≤ i ≤ 4 de X et y j de Y 1 ≤ j ≤ 5 on définit un couple xi , y j . ( )
( )
Pour chaque couple xi , y j on associe le nombre nij appelé effectif qui désigne le nombre d’apparition du couple

( x , y ) , par exemple l’effectif du couple ( 4, 2 ) est n


i j 4 ,3 = 8 c’est le nombre de ménages ayant 4 pièces et 2 enfants.

nij
( )
N=100 est l’effectif [Link] fréquence du couple xi , y j est la valeur fij =
N

Distributions marginales :A partir du tableau a double entrée précédent on peut extraire deux séries statistiques à
une variable :

X : la répartition des 100 ménages suivant le nombre de pièces par logement.

X 1 2 3 4 Total
ni 9 27 38 26 100
C’est la distribution marginale de X

Y : la répartition des 100 ménages selon le nombre d’enfants.

Y 0 1 2 3 4 total
nj 13 22 32 26 7 100

C’est la distribution marginale de Y

1 4 1
X= ∑
N i =1
ni xi =
100
( 9 × 1 + 27 × 2 + 38 × 3 + 26 × 4 )
= 2.81

1 5 1
Y= ∑
N j =1
njy j =
100
( 0 × 13 + 22 × 1 + 32 × 2 + 26 × 3 + 7 × 4 )
= 1.92

1 4
( )
2
V (X) = ∑ ni xi − X
N i =1
= 0.84

1 5
( )
2
V (Y ) = ∑ nj y j − Y
N j =1
= 1.273

( )
Soit une série statistique double (X, Y) de taille n, nij est le nombre de fois qu’apparait le couple xi , y j on a alors :

1 q p
cov ( X ,Y ) = ∑∑ nij xi y j − XY
N j =1 i =1

7
III. Ajustement non linéaire

Lorsque le modèle n'est a priori pas une droite, on pourra néanmoins tenter de réaliser une régression
linéaire en effectuant un changement de variable (lorsque cela est bien sûr possible).
Exemple :

• Modèle exponentiel

( On effectue le changement de variable suivant: )

Activité
On a mesuré, entre 1989 et 1974, l’effet de la population sur une population piscicole d’une rivière
Les résultats présentés dans le tableau suivant donnent une estimation du nombre y i de poissons, exprimé en milliers,
correspondant à l’année dont le rang est x i

Année 1989 1990 1991 1992 1993 1994

Rang de l’année x i 1 2 3 4 5 6

yi 591,3 106,7 96,5 63,2 21 9,4

1) On considère la série statistique double ( x i , y i ) . Calculer le coefficient de corrélation entre x et y. Expliquer pourquoi
un ajustement linéaire ne paraît pas bien adapté
{
2) On pose : zi = L n y i , pour i Î 1, 2, 3, 4, 5, 6 }
a) Calculer les nombres zi
(
b) Représenter dans un repère orthogonal le nuage de points xi , z i )
(
c) Calculer le coefficient de corrélation de cette série. Justifier l’utilisation d’un ajustement affine pour la série xi , z i )
d) Déterminer l’équation de la droite de régression de z en x. Tracer cette droite dans le repère de la question 2) b)
3) On suppose que l’évolution de cette population se poursuit sur le même modèle
8
Donner une estimation de la population de cette rivière en l’an 2010.

8
9

Vous aimerez peut-être aussi