0% ont trouvé ce document utile (0 vote)
10 vues28 pages

Méthodes de Statistiques Descriptives

Transféré par

aleddinejen1903
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
10 vues28 pages

Méthodes de Statistiques Descriptives

Transféré par

aleddinejen1903
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Dénition

La Statistique, c'est l'étude des variations observables. C'est une méthode qui consiste à réunir des données
chirées sur des ensembles nombreux, puis à les analyser et à les interpréter.

I) Méthodes Statistiques
1ère étape : on collecte des données
Soit de manière exhaustive.
Soit par sondage.
2ème étape : on trie les données que l'on organise en tableaux, diagrammes, etc...
3ème étape : on interprète les résultats : on les compare avec ceux déduits de la théorie des
probabilités.

Manel Amdouni Statistiques descriptives 1D et 2D 1 / 27


II) Séries Statistiques a une variable :
Dénition (Terminologie)
Population : Ensemble que l'on observe et qui sera soumis à une analyse statistique. Chaque élément de cet
ensemble est un individu ou unité statistique.
Échantillon : C'est un sous ensemble de la population considérée.
Le nombre d'individus dans l'échantillon est la taille de l'échantillon.
Caractère : C'est la propriété ou l'aspect singulier que l'on se propose d'observer dans la population ou
l'échantillon. Un caractère qui fait le sujet d'une étude porte aussi le nom de variable statistique.
Diérents types de variables statistiques
▷ Lorsque la variable ne se prête pas à des valeurs numériques, elle est dite qualitative (exemple : opinions
politiques, couleurs des yeux, . . .). Elle peut être ordonnée ou non, dichotomique ou non.

Manel Amdouni Statistiques descriptives 1D et 2D 2 / 27


▷ Lorsque la variable peut être exprimée numériquement, elle est dite quantitative (ou mesurable). Dans
ce cas, elle peut être discontinue ou continue.
Elle est discontinue si elle ne prend que des valeurs isolées les unes des autres. Une variable
discontinue qui ne prend que des valeurs entières est dite discrète (exemple : nombre d'enfants
d'une famille).
Elle est dite continue lorsqu'elle peut prendre toutes les valeurs d'un intervalle ni ou inni
(exemple : diamètre de pièces, salaires, . . .).

Manel Amdouni Statistiques descriptives 1D et 2D 3 / 27


Représentation graphique

Une première façon de se faire une idée d'une série de chires est de les représenter graphiquement, il y a diérentes
façons de faire,
1) Caractères quantitatifs discrets :
Dénition (Diagrammes en bâtons)
Un diagramme en bâtons est un moyen de représenter une série statistique dont le caractère est quantitatif discret.
Si x1 , . . . , xp sont les valeurs possibles prises par le caractère et si les eectifs correspondants sont n1 , . . . , np , il est
constitué par les segments qui relient le point (xk , 0) au point (xk , nk ).
Exemple : Dans une classe, les notes obtenues du QCM à un devoir sont
Notes 1 2 3 4 5 6 7 8 9 10
Eectif 2 1 6 5 2 9 7 1 0 1

Manel Amdouni Statistiques descriptives 1D et 2D 4 / 27


Exemple (Diagramme en bâtons)

Remarque : dans les diagrammes en bâtons, les


longueurs sont alors proportionnelles aux eectifs.
(Caractères quantitatifs discrets).

Figure  Diagramme en bâtons

Manel Amdouni Statistiques descriptives 1D et 2D 5 / 27


Représentation graphique

2) Caractères quantitatifs continus :


Dénition (Histogrammes)
Un histogramme est un moyen de représenter une série statistique dont le caractère est quantitatif continu. Si la série
statistique est donnée par les classes ([ai , ai+1 [), il est constitué par des rectangles dont la base est le segment
[ai , ai+1 [ (sur l'axe des réels) et l'aire est proportionnelle à l'eectif de la classe

Exemple : On a demandé la taille des élèves dans une classe de 33 élèves. On obtient les résultats suivants :
Taille(en cm) 150-160 160-170 170-175 175-180 180-190 190-200
Eectif 3 12 9 6 2 1

Manel Amdouni Statistiques descriptives 1D et 2D 6 / 27


Exemple(Histogramme)

Remarque : Dans l'histogramme en rectangle,


l'aire qui doit être proportionnelle à l'eectif de
la classe et non la hauteur elle-même. Si toutes
les classes ont la même étendue, il n'y a pas de
problème. Sinon, on note ni l'eectif de la classe
[ai , ai+1 [. On choisit un rapport de proportionna-
lité k . La hauteur du rectangle de base [ai , ai+1 [
n
sera alors k × a i−a
i+1 i

Figure  Histogramme

Manel Amdouni Statistiques descriptives 1D et 2D 7 / 27


Caractères Qualitatifs

3)Caractères Qualitatifs :
Dénition (Diagrammes circulaires)
Un diagramme circulaire est un moyen de représenter une série statistique dont le caractère est qualitatif. Il est obtenu
en découpant un disque en secteurs dont les mesures d'angle sont proportionnelles à l'eectif.
Exemple : Dans une entreprise, on a demandé aux employés leur moyen de transport pour venir au travail. Les
résultats sont les suivants :
Moyen utilisé à pied voiture métro
Eectif 50 110 200

Manel Amdouni Statistiques descriptives 1D et 2D 8 / 27


Exemple(Diagramme circulaire)

Figure  Diagramme circulaire

Manel Amdouni Statistiques descriptives 1D et 2D 9 / 27


Fréquence cumulée et courbe de fréquence cumulée

Dénition (Fréquence)
On appelle fréquence le rapport entre l'eectif d'une valeur et l'eectif total. Si N = n1 + n2 + · · · + nt , alors fi =
ni
N
.

Considérons l'exemple suivant des notes obtenues dans une classe :


Exemple : Dans une classe, les notes obtenues à un devoir sont les résultats sont les suivants :

Notes 1 2 3 4 5 6 7 8 9 10
Eectif 2 1 6 5 2 9 7 1 0 1
Fréquence 0.059 0.029 0.176 0.147 0.059 0.265 0.206 0.029 0 0.029
Fréquence 0.059 0.088 0.264 0.411 0.47 0.735 0.941 0.970 0.970 1
cumulée

Manel Amdouni Statistiques descriptives 1D et 2D 10 / 27


Exemple

Dénition : On note gk la fréquence cumulée du carac-


tère xk , c'est-à-dire gk = f1 + · · · + fk où fi = nNi est la
fréquence du caractère xi . La courbe des fréquences cu-
mulées est celle obtenue en joignant les points (xi , gi ).

Figure  Graphique

Manel Amdouni Statistiques descriptives 1D et 2D 11 / 27


Les paramètres de position

4)Les paramètres de position : Considérons les deux séries de chires suivantes :


S1 := 0; 0; 10; 15; 20 , S2 := 2000; 2000; 2010; 2015; 2020 .
 
Dans les deux cas, nous avons 5 nombres. On va donc regarder certains paramètres.

La moyenne arithmétique
La moyenne arithmétique est égale à la somme des valeurs divisées par leur nombre. Elle donne une idée sur la
localisation.
Cas de données énumérées Dans ce cas, le calcul de la moyenne est très simple. Pour les exemples précédents,
on obtient des moyennes respectives de 9 et 2009.
Cas de données qualitatives . La formule de la moyenne pondérée s'écrit pour les valeurs x1 , . . . , xk de la
variable x = 1 1
n x + · · · + n k xk
= f1 x1 + · · · + fk xk
n1 + · · · + nk

Manel Amdouni Statistiques descriptives 1D et 2D 12 / 27


Les paramètres de position

Exemple : Dans une classe, les notes obtenues à un devoir sont


Notes 1 2 3 4 5 6 7 8 9 10
Eectif 2 1 6 5 2 9 7 1 0 1
2 × 1 + 1 × 2 + 6 × 3 + · · · + 1 × 10
La moyenne est = 5, 09
34

La médiane
La médiane d'une série statistique, généralement notée x1/2 , est le nombre qui sépare la série (ordonnée en valeurs croissantes)
en deux groupes de même eectif. Pour trouver cette médiane, quand la série est discrète, on écrit la liste de toutes les valeurs de
la série par ordre croissant, chacune d'entre elles étant répétée autant de fois que son eectif.

x n+1 si n est impair
(
2)




La médiane x1/2

:= x( n ) + x( n +1)
2 2 si est pair



 n
2

Manel Amdouni Statistiques descriptives 1D et 2D 13 / 27


Les paramètres de dispersion

Exemple : Soient S1 et S2 les deux séries statistiques :


S1 := 0; 0; 10; 15; 20 =⇒ n = 5 et La médiane x1/2 = x3 = 10.


x3 +x4
′ :=
S1 0; 0; 10; 11; 15; 20 6 et La médiane x1/2 2 10, 5.

=⇒ n = = =

Le mode
Le mode d'une série statistique est la valeur le plus fréquente. Dans le cas de la série statistique S1 0; 0; 10; 15; 20 le mode

:=
est 0.
Les paramètres de dispersion

Considérons deux séries ayant même moyenne et pourtant très diérentes S1 := 0; 0; 10; 15; 20 et


S2 := − 1000; −1000; 10; 1015; 1020 . On remarque que dans le premier cas les valeurs sont beaucoup plus rapprochées que


dans le second, on peut mesurer cet éloignement de diérentes façons.

L'étendue
L'étendue d'une série statistique est la diérence entre les deux valeurs extrêmes. Pour les séries précédentes S1 et S2 , on obtient
respectivement 20 et 2020.

Manel Amdouni Statistiques descriptives 1D et 2D 14 / 27


Les paramètres de dispersion

La moyenne Soit une série statistique (xk , nk ) telle que


1 N est l'eectif total de la série.
2 Les valeurs xk sont les valeurs prises par la série.
3 nk est le nombre de fois où la valeur xk est prise.
n1 x1 + · · · + nk xk
4 x représente la moyenne de la série x :=
N

La variance
On appelle variance de la série statistique (xk , nk ) le nombre :

n1 (x1 − x)2 + · · · + nk (xk − x)2 n1 x12 + · · · + nk xk2 2


V = =⇒ V = −x
N N

Manel Amdouni Statistiques descriptives 1D et 2D 15 / 27


L'écart moyen et médian absolu

L'écart-type

L'écart-type σ est la racine carrée de la variance : σ = V Dans les séries précédentes, on a
respectivement σ = ... et σ = ....

L'écart moyen absolu et l'écart médian absolu


1 X
N
L'écart moyen absolu est déni par eN = |xk − x|.
N k=1

1 N
L'écart médian absolu est déni par eN∗ =
X
|xk − x1/2 |.
N k=1

Manel Amdouni Statistiques descriptives 1D et 2D 16 / 27


Les quartiles et l'intervalle interquartile

Exemple : Considérons la série statistique suivante :1; 2; 3; 4; 5; 10; 11; 12; 15. On a x = 7 et x1/2 = 5.
xk 1 2 3 4 5 10 11 12 15 Somme
|xk − x|
|xk − x1/2 |

Les quartiles et l'intervalle interquartile :

Les valeurs ont été rangées dans l'ordre croissant, de la plus petite à la plus grande.

Les quartiles
Les quartiles permettent de séparer une série statistique en quatre groupes de même eectif (à une unité près) :
1 . Un quart des valeurs sont inférieures au premier quartile Q1 .
2 . Un quart des valeurs sont supérieures au troisième quartile Q3 .

Manel Amdouni Statistiques descriptives 1D et 2D 17 / 27


Les quartiles et l'intervalle interquartile

l'intervalle interquartile
On appelle intervalle interquartile l'intervalle ]Q1 ; Q3 [. On appelle écart interquartile la diérence Q3 − Q1 . Pour
déterminer les quartiles Q1 et Q3 d'une série de N valeurs, on procède de la façon suivante : On calcule la quantité
N . Deux cas sont possibles :
4
1. Cas 1 : le résultat est entier.
- Q1 est la nième valeur de la série où n = N4 .
- Q3 est la k ième valeur de la série où k = 34N .
1. Cas 2 : le résultat n'est pas entier.
- On arrondit N4 à l'entier supérieur n et Q1 est la nième valeur de la série.
- On arrondit 34N à l'entier supérieur k et Q3 est la k ième valeur de la série.

Manel Amdouni Statistiques descriptives 1D et 2D 18 / 27


Exemple

Exemple :
Prenons les valeurs rangées dans l'ordre croissant
S1 := 1; 3; 3; 3; 5; 5; 6; 7; 7; 8; 8; 8; 9; 9; 10; 10; 10; 10; 11; 11; 12; 13; 13; 13; 14; 15; 16; 19 .
Déterminer Q1 et Q3
Il y a N = 28 valeurs et N4 = 7. Le résultat est un entier =⇒
- Pour Q1 = 6 (la 7ième valeur de la série rangée dans l'ordre croissant).
- Pour Q3 = 12 (la 21ième valeur de la série rangée dans l'ordre croissant).
Interprétation des quartiles :
Si on connait les quartiles Q1 et Q3 d'une série, on peut en déduire les renseignements suivants sur la série statistique :
1 Au moins un quart (25%) des valeurs sont inférieures ou égales à Q1 .
2 Au moins trois quarts (75%) des valeurs sont inférieures ou égales à Q3 .
3 Environ la moitié des valeurs se trouvent dans l'intervalle interquartile [Q1 ; Q3 ].

Manel Amdouni Statistiques descriptives 1D et 2D 19 / 27


Exemple

Exemple :
Prenons les valeurs rangées dans l'ordre croissant
S1 := 1; 3; 3; 3; 5; 5; 6; 7; 7; 8; 8; 8; 9; 9; 10; 10; 10; 10; 11; 11; 12; 13; 13; 13; 14; 15; 16; 19 .
Déterminer Q1 et Q3
Il y a N = 28 valeurs et N4 = 7. Le résultat est un entier =⇒
- Pour Q1 = 6 (la 7ième valeur de la série rangée dans l'ordre croissant).
- Pour Q3 = 12 (la 21ième valeur de la série rangée dans l'ordre croissant).
Interprétation des quartiles :
Si on connait les quartiles Q1 et Q3 d'une série, on peut en déduire les renseignements suivants sur la série statistique :
1 Au moins un quart (25%) des valeurs sont inférieures ou égales à Q1 .
2 Au moins trois quarts (75%) des valeurs sont inférieures ou égales à Q3 .
3 Environ la moitié des valeurs se trouvent dans l'intervalle interquartile [Q1 ; Q3 ].

Manel Amdouni Statistiques descriptives 1D et 2D 19 / 27


Statistique à deux dimensions

Cadre et Objectifs
On dispose de 2 caractères X et Y . On distingue deux objectifs :
On cherche à savoir s'il existe un lien entre X et Y
On cherche à savoir si X a une inuence sur Y .
Liaison entre X et Y . On dénit un indice de liaison : coe de corrélation par exemple , existe-t-il un lien entre
le volume des ventes d'une entrprise et le montant alloué à la publicité ? de même existe-t-il un lien entre le
poids de courrier reçu par une entreprise chaque matin et le nombre de commandes traitées dans la journée ?
Estimation des paramètres : méthodes des moindres carré : mesure de l'intensité de la laision Test : Existence
du lien
Infulence de X sur Y on modélise l'inuence de X sur Y régression logistique, analyse de la variance, régression
linéaire , .. Estimation description de l'inuence et prédiction

Manel Amdouni Statistiques descriptives 1D et 2D 20 / 27


Covariance

1 n
Covariance : Cov (x, y ) = E
  X
(X − X )(Y − Y ) = (Xi − X )(Yi − Y ).
n i=1
Propriétés :
Cov (X , Y ) = E (XY ) − E (X )E (Y )
Cov (X , Y ) = Cov (Y , X )
Cov (aX + b, cY + d) = acCov (X , Y )
X et Y indépendants −→ Cov (X , Y ) = 0, la réciproque étant fausse.

Manel Amdouni Statistiques descriptives 1D et 2D 21 / 27


Coecient du corrélation

Dénition
Pour deux variables X et Y , le coef de corrélation linéaire r = ρ(X , Y ) vaut :

Cov (X , Y )
ρ(X , Y ) = ∈ [−1, 1]
σX σY
ρ est une mesure symétrique qui mesure le lien linéaire entre X et Y :
si ρ = −1 =⇒ : X et Y sont proportionnels et varient en sens opposé.
si ρ = 1 =⇒ : X et Y sont proportionnels et varient dans le même sens.
si ρ = 0 =⇒ : X et Y ne sont pas corrélés .

Propriété
- si X et Y sont indépendants, alors ρ(X , Y ) = 0.
- si X et Y sont gaussiens, il y a équivalence entre indépendance et corrélation nulle.

Manel Amdouni Statistiques descriptives 1D et 2D 22 / 27


Coecient du corrélation

Estimation du coecient du corrélation :


Les données : pour chaque individu d'un échantillon de taille n, on relève les valeurs prises par X et Y . on
obtient n couples indépendants les uns des autres notés (xi , yi ) pour i = 1, . . . , n
n
X
xi yi − nx.y
i=1
Un estimateur de ρ est : r = v
n n
2 2  X y 2 − ny 2 
u
u X
u
t xi − nx i
i=1 i=1

1 n
1 n
avec x et y
X X
= xi = yi
n i=1 n i=1

Lorsque les points de coordonnées (xi , yi ) pour i = 1, . . . , n sont parfaitement alignés, alors r = 1.
Lorsqu'on obtient un nuage ou de points, r est proche de 0

Manel Amdouni Statistiques descriptives 1D et 2D 23 / 27


Régression linéaire

La régression simple
Objectif : On souhaite expliquer les variations de la variable Y à partir des valeurs observées pour la variable X : on
cherche une relation entre X et Y .

Données : on dispose d'un échantillon de n couples (xi , yi ) pour i = 1, . . . , n indépendants les un des autres.
Régression linéaire : On suppose que pour tout i : Yi = axi + b
Droite de régression : y = ax + b à ajuster sur les données au sens des moindres carrées ordinaires (MCO).
Droite de régression estimée (meilleure droite ajustée) y = abx + b
b
avec ab estimateur de a et bb estimateur de b.

Manel Amdouni Statistiques descriptives 1D et 2D 24 / 27


Régression linéaire

On cherche les valeurs a et b qui minimisent la somme des carrés des résidus, i.e. les écarts entre les observations (Yi )
et les prédictions (axi + b) du modèle.
n
 X 2
min f (a, b) = min yi − axi − b ; a, b
i=1
a,b a,b

Pour cela, on développe f . On considère d'abord f comme un trinôme en b. Donc pour minimiser le dérivée doit être
nulle.
Puis, b étant déterminé, on considère f comme un trinôme en a que l'on va minimiser à nouveau. On obtient alors

cov (x, y )
b = y − ax et a=
V (x)

Manel Amdouni Statistiques descriptives 1D et 2D 25 / 27


Exercice 1 (Corrélation)

La corrélation entre deux variables X et Y mesure le lien linéaire entre deux variables.
La fonction correl calcule la corrélation entre deux variables .
On considère deux vecturs X = (xn ), n ∈ {1, . . . , 100} et y = (yn ), n ∈ {1, . . . , 100}
1) Vérier que si xn = n et yn = 2xn alors le coecient de corrélation entre X et Y vaut 1.
2) Vérier que si xn = n et yn = −2xn alors le coecient de corrélation entre X et Y vaut −1.
3) Calculer le coecient de corrélation entre X et Y si xn = n et yn = √xn .
4) Calculer le coecient de corrélation entre X et Y si xn =n et yn = xn2 .
Pour n = 14 la construition graphique

Manel Amdouni Statistiques descriptives 1D et 2D 26 / 27


Exemple

Figure  Y = 2X ; corr = 1 Figure  Y = −2X ; corr = −1

Y = X 2;

Figure  Y = X; corr = 0, 988 Figure  corr = 0, 973

Manel Amdouni Statistiques descriptives 1D et 2D 27 / 27

Vous aimerez peut-être aussi