0% ont trouvé ce document utile (0 vote)
28 vues216 pages

Avis sur le Dr Luc Nihoul

Transféré par

wola wola
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
28 vues216 pages

Avis sur le Dr Luc Nihoul

Transféré par

wola wola
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Haute-École Namur-Liège-Luxembourg

Implantation IESN

Bachelier en Marketing

Par les professeurs de Mathématiques de l’IESN


Dessy A. et Nihoul M.
TABLE DES MATIÈRES
Table des matières ..................................................................................................................... 2
PARTIE 0 : Introduction .............................................................................................................. 5

Modalités d’évaluation........................................................................................................... 6
1. Bloc 1 (MK121) ......................................................................................................... 6
2. Bloc 2 (MK211) ......................................................................................................... 6
3. Bloc 3 (MK311) ......................................................................................................... 6
PARTIE 1 : Statistiques Descriptives .......................................................................................... 7

Chapitre 1 : Introduction ........................................................................................................ 7


1. Population et échantillon ......................................................................................... 7
2. Un peu de vocabulaire ............................................................................................. 9
3. Méthodes d’échantillonnage ................................................................................... 9
4. Types de données .................................................................................................. 10

Chapitre 2 : Statistique descriptive univariée sur une population ...................................... 14


1. Les données brutes ................................................................................................ 14
2. Tableau de distribution (tri à plat) ......................................................................... 14
3. Représentations graphiques .................................................................................. 22
4. Paramètres de position .......................................................................................... 33
5. Paramètres de dispersion ...................................................................................... 42
6. En résumé .............................................................................................................. 53

Chapitre 3 : Statistique descriptive bivariée pour une population ...................................... 54


1. Introduction ........................................................................................................... 54
2. Deux variables qualitatives .................................................................................... 54
3. Une variable qualitative et une variable quantitative (discrète ou continue) ...... 62
4. Deux variables quantitatives .................................................................................. 67

Chapitre 4 : L’estimation des paramètres ............................................................................ 80


1. Les estimateurs ...................................................................................................... 80
2. L’estimation ponctuelle ......................................................................................... 81
3. L’estimation par intervalle de confiance (95%) ..................................................... 83

Chapitre 5 : Communiquer les résultats .............................................................................. 90


PARTIE 2 : Prise en main de XLSTAT ........................................................................................ 97
Chapitre 1 : Les données brutes ........................................................................................... 97

Chapitre 2 : Logiciel Xlstat .................................................................................................... 98

Chapitre 3 : Préparation des données.................................................................................. 98


1. Données Manquantes ............................................................................................ 98
2. Gestion des Données ........................................................................................... 102
3. Codage ................................................................................................................. 103
4. Convertir .............................................................................................................. 103
5. Exercices Xlstat..................................................................................................... 104

Chapitre 4 : Visualisation des données .............................................................................. 106

Chapitre 5 : Description des données ................................................................................ 107


1. Descriptive univariée sur une population ............................................................ 107
2. Descriptive bivariée sur une population .............................................................. 107
3. Estimation sur un échantillon .............................................................................. 108

Chapitre 6 : Redressement d’enquête ............................................................................... 110


1. Définition et principe ........................................................................................... 110
2. Cas spécifique de l’estimation de la moyenne et la variance .............................. 112
3. Exercices ............................................................................................................... 115
PARTIE 3 : Probabilités .......................................................................................................... 116

Chapitre 1 : L’estimation par intervalle de Confiance........................................................ 117

Chapitre 2 : Les variables aléatoires................................................................................... 118


1. Variables aléatoires discrètes .............................................................................. 119
2. Espérance et Variance d’une variable aléatoire discrète .................................... 119
3. Variables aléatoires continues ............................................................................. 121
4. Espérance et Variance d’une variable aléatoire continue ................................... 123
5. La loi Normale 𝑵(𝝁, 𝝈) ........................................................................................ 124
6. Autres lois continues ............................................................................................ 130

Chapitre 3 : Calcul de l’intervalle de confiance .................................................................. 131


1. Intervalle de confiance pour une proportion ...................................................... 131
2. Intervalle de confiance pour une moyenne ......................................................... 132
3. Intervalle de confiance pour une variance .......................................................... 133
PARTIE 4 : Statistique inférentielle, Les tests statistiques ................................................... 134

Chapitre 1 : Les tests d’hypothèses.................................................................................... 134


1. La formulation des hypothèses ............................................................................ 134

Page 3
2. Choix du test approprié : Test paramétrique Vs Test non paramétrique ........... 136
3. La statistique de test ............................................................................................ 136
4. Choix du seuil de risque alpha ............................................................................. 137
5. Exécution du test ................................................................................................. 138
6. Interprétation du résultat et réponse à la question ............................................ 139
7. Statistique de test en fonction du paramètre testé ............................................ 140
8. Exemples et Exercices .......................................................................................... 142

Chapitre 2 : Exercices de rappel ......................................................................................... 146

Chapitre 3 : Application des différents tests ...................................................................... 151


1. Tests sur les variables qualitatives ....................................................................... 153
2. Tests de forme ou de relation pour des variables qualitatives ou quantitatives 168
3. Tests sur les variables quantitatives .................................................................... 182
4. Résumé des différents tests................................................................................. 197
5. Exercices ............................................................................................................... 201
6. Données relatives aux exercices .......................................................................... 207
Annexe.................................................................................................................................... 211
Bibliographie .......................................................................................................................... 216

Page 4
Introduction

PARTIE 0 : INTRODUCTION
Tout au long de votre cursus, vous allez découvrir et utiliser différentes méthodes statistiques.
Ces méthodes permettent d’analyser, de traiter, d’interpréter, de modéliser et de tester des
données. Le but est de rendre ces dernières compréhensibles de tous.

Une méthode n’étant jamais indépendante de l’autre, ce syllabus reprend dès lors l’ensemble
de la matière vue en Statistique tout au long de votre cursus. Ainsi, la globalité des notions se
trouvera dans une seule ressource et nous évitera de faire des rappels incessants.

Votre cursus en statistique sera découpé en trois morceaux :

Bloc 1 : Statistiques en Marketing 1 (MK121)


Partie 1 : Statistiques Descriptives
Décrire, représenter et interpréter les résultats d'une
enquête.

Bloc 2 : Statistiques en Marketing 2 (MK211)


•Partie 2 : Prise en main de XLSTAT
Utilisation d'un logiciel.
•Partie 3 : Probabilités
Calculer et interpréter des probabilités d'événements sur une population.
•Partie 4 : Statistiques Inférentielles
Tester des hypothèses sur la population à partir des données d'un
échantillon.

Bloc 3: Statistiques en Marketing 3 (MK311)


Partie 4 : Statistiques Inférentielles
Tester des hypothèses sur la population à partir des données
d'un échantillon.

Dans chacune de ces parties, nous mettrons l’accent sur l’interprétation des résultats obtenus.

Page 5
Introduction

MODALITÉS D’ÉVALUATION
1. Bloc 1 (MK121)
• Les modalités de validation de l’UE sont accessibles via la fiche UE.

2. Bloc 2 (MK211)
• Les modalités de validation de l’UE sont accessibles via la fiche UE.

3. Bloc 3 (MK311)
• Voir modalités d’évaluation de l’UE Entrepreneuriat.

Page 6
MK121 – Statistiques Descriptives

PARTIE 1 : STATISTIQUES
DESCRIPTIVES
La Statistique Descriptive contient l’ensemble des outils permettant de décrire, de visualiser
et de modéliser les données d’un sondage ou d’une étude de marché. Nous nous attarderons
à comprendre la méthode de calcul de certains paramètres. Mais surtout nous essaierons
toujours d’en donner une interprétation et une représentation la plus compréhensible
possible.

CHAPITRE 1 : INTRODUCTION
De manière générale, nous pouvons définir la statistique comme le domaine des
Mathématiques dédié à l’étude des données.

Lorsque nous nous intéressons à un sujet ou à une question (le temps passé sur internet par
jour, le budget mensuel alloué aux loisirs, la marque de voiture, …) la première étape consiste
généralement à recueillir des données pertinentes. Une fois celles-ci récoltées se pose la
question « Comment les faire parler ? » C’est précisément à cette interrogation que la
statistique apporte des réponses.

Dans ce cours, une grande importance sera accordée aux interprétations des résultats. Une
partie des calculs sera faite avec les logiciels Microsoft Excel et XLSTAT
([Link] de façon plus approfondie dans les parties ultérieures.

1. Population et échantillon
Lorsque nous nous intéresserons à une question (comme par exemple « Parmi les namurois
intéressés par notre projet d’implantation, y-a-t-il autant d’hommes que de femmes ? »), nous
ne pourrons pas récolter toutes les données nécessaires pour y répondre. Pratiquement, il est
impossible de comptabiliser tous les namurois intéressés pour savoir s’il y a plus d’hommes
ou de femmes.

Dans ce cas-là, nous nous contenterons de récolter une partie des données, partie que nous
espérons aussi significative que possible.

Ce procédé est appelé « échantillonnage ». Il consiste à se procurer seulement une partie des
données (l’échantillon). Le but final reste d’obtenir des informations à propos du groupe plus
large (ici, tous les namurois intéressés). Ce groupe plus large est appelé la population.

Page 7
MK121 – Statistiques Descriptives

Dans un premier temps, nous analyserons une par une les données de l’échantillon :

➢ Nous les regrouperons de manière lisible dans un tableau de distribution,


➢ Nous les présenterons de manière claire grâce à des graphiques,
➢ Nous calculerons et interpréterons les principaux paramètres de position et de
dispersion,
➢ Nous construirons et interpréterons une boîte de dispersion.

Ces processus d’analyse des données font l’objet de la statistique descriptive.

Dans un deuxième temps, nous généraliserons à la population les résultats obtenus. Ce


procédé, appelé l’inférence, est étudié par la statistique inférentielle.

Recueillir l'information

Construire les variables statistiques

Décrire les données

Généraliser à une population les


résultats obtenus sur un échantillon

Modéliser des phénomènes

Recenser les sources d'erreur

Page 8
MK121 – Statistiques Descriptives

2. Un peu de vocabulaire
Le point précédent a déjà introduit quelques mots possédant une signification précise en
statistique.

• Population : c’est l’ensemble des individus / objets auxquels on s’intéresse (par


exemple : les namurois intéressés par notre projet d’implantation).
• Échantillon : c’est l’ensemble des individus / objets au sujet desquels on a obtenu des
informations (par exemple : 378 namurois intéressés par notre projet et sondés via
internet).

En voici quelques autres.

• Individu : c’est le nom générique donné aux objets qui constituent la population ; il
peut s’agir de personnes, de choses, d’associations ou d’objets immatériels (dans
l’exemple, il s’agit de namurois intéressés par le projet).
• Effectif ou effectif total : c’est le nombre d’individus dans l’échantillon (donc, le
nombre de données récoltées). On le note souvent 𝑛.
• Caractère, caractère étudié, variable ou variable statistique : c’est l’aspect qu’on
étudie (ici, le sexe).
• Espace des observables : c’est l’ensemble des réponses/résultats possibles pour le
caractère étudié (dans l’exemple, il s’agit de l’ensemble Ω = {M, F})

3. Méthodes d’échantillonnage
• Sondage aléatoire simple : les individus ont tous la même chance d’appartenir à la
population mère. Comme si tous les individus de la population étaient repris dans une
urne et on procède à un tirage au sort. Il faudrait dans ce cas posséder la liste
exhaustive de tous les individus qui compose la population, la base de sondage. On
peut encore distinguer le tirage avec et sans remise. Ce dernier est à privilégier mais
les tirages ne seront pas indépendants les uns des autres ce qui complexifie les calculs.
Dans la pratique on utilise peu cette méthode car la base de sondage n’est pas toujours
connue.
• Sondage aléatoire stratifié : la population est découpée en plusieurs groupes, appelés
strates, puis un tirage aléatoire simple est réalisé dans chacune des strates. Il faudra
donc identifier au préalable une variable qui influence la population (la taille d’une
société, le type de client, la situation géographique…)
• Sondage par méthodes empiriques : on sélectionne les individus par un choix raisonné
et pas de manière aléatoire. On peut utiliser la méthode des quotas dans laquelle on
construit un échantillon qui est un modèle réduit de la population selon deux ou trois
critères. (Sexe, âge, …)

Page 9
MK121 – Statistiques Descriptives

Exercice
1) Dans chacune des situations suivantes, identifiez la population, l’échantillon, le caractère étudié,
l’effectif et l’espace des observables. L’échantillon est-il représentatif de la population ?

a) Une enquête a été réalisée dans toute la Wallonie pour déterminer le nombre d’armes à feu
que chaque ménage possédait. L’équipe en charge de l’enquête a envoyé 5 000 questionnaires
par courrier, sur lesquels 3 500 ont été complétés et renvoyés.
b) Pour connaître le temps que les directeurs de PME wallonnes consacrent chaque semaine aux
tâches administratives, on en a choisi 200 au hasard et on les a interrogés à ce sujet.
c) Les responsables d’un bureau de marketing font un sondage dans les rues de Namur afin de
savoir ce que les Namurois pensent de la propreté de leur ville. Ils demandent aux
100 personnes interrogées de choisir l’un des qualificatifs suivants : très sale, sale, moyenne,
propre, très propre.
d) Les enseignants de l’IESN décident d’organiser un test sur ordinateur pour mieux cerner leurs
futurs étudiants. Le test est constitué de 25 questions de culture générale de type vrai/faux
valant chacune 1 point. Ils font appel à 50 volontaires pour effectuer ce test.
e) Un enseignant étonné de voir ses étudiants s’endormir en cours décide d’en retenir 20 après
la classe. Il leur demande à quelle heure ils ont été dormir la veille et note leurs réponses.

4. Types de données
La statistique peut traiter des données de divers types. Nous distinguons tout d’abord les
données qualitatives des données quantitatives. Nous parlons de données quantitatives
lorsqu’il s’agit de nombres qui mesurent une certaine grandeur (longueur, volume, cardinalité,
durée…). Dans le cas contraire (lorsqu’il ne s’agit pas de valeurs numériques ou lorsque ces
nombres ne sont pas des mesures), nous parlons de données qualitatives.

Parmi les données qualitatives, nous distinguons encore deux catégories : les données
qualitatives ordinales et les données qualitatives nominales. Nous parlons de données
ordinales quand nous pouvons les classer. Nous parlons de données nominales dans le cas
contraire.

Exemples de données qualitatives : votre couleur préférée, le nom de votre acteur/actrice


préféré(e), le type de chaussures que vous portez, le sexe de votre meilleur(e) ami(e) sont des
données qualitatives nominales. Votre chiffre préféré, le code postal, la mention à un examen
sont des données qualitatives ordinales.

Parmi les données quantitatives, nous distinguons encore deux catégories : les données
quantitatives discrètes et les données quantitatives continues. Nous parlons de données
discrètes quand le nombre de valeurs possibles pour la variable est limité. Nous parlons de
données continues quand le nombre de valeurs possibles pour la variable est proche (voire
égal) de la taille de la population.

Par exemple, le nombre de boules de glace du dernier cornet dégusté est une donnée discrète,
car la valeur ne peut être que 1, 2, 3, 4, 5. À l’inverse, la durée de votre dernière conversation
téléphonique (en minutes) est une variable continue.

Page 10
MK121 – Statistiques Descriptives

Le type de la variable nous permet de choisir la bonne méthode statistique à appliquer. Nous
essayons en général de collecter des données quantitatives continues pour lesquelles il existe
de nombreuses méthodes.

Une variable supposée continue avant sondage pourrait se révéler discrète


à la lecture des résultats de celui-ci.

La manière dont la question est formulée dans le sondage peut influencer


le type de données obtenues.

Exercice
2) De quel type de variable s’agit-il ?
a) Les calories de votre dernier repas
b) Le code postal de votre localité
c) Le candidat pour lequel un électeur a voté aux dernières présidentielles françaises
d) La date de création d’un fond de placement
e) L’âge d’un fond de placement en années
f) Le taux d’un crédit immobilier
g) L’année de naissance des étudiants inscrits à l’IESN
h) L’âge des étudiants inscrits à l’IESN
i) La marque d’un véhicule
j) Le grade obtenu par un étudiant en fin de cycle
k) Le nombre de grands-parents encore en vie pour une personne de 40 ans

Page 11
MK121 – Statistiques Descriptives

3) Quel type de variable récolte-t-on en posant les questions suivantes ?

a) Quel est en euros votre budget loisir mensuel ?


o [0, 50[
o [50, 75[
o [75, 100[
o [100, 150[
o [150, 250[
o [250 et plus
b) Quel est en euros votre budget loisir mensuel ? ꙱꙱꙱꙱,꙱꙱€
c) Quel score attribuez-vous à notre service après-vente ?
o 0
o 1
o 2
o 3
o 4
o 5
d) A quelle fréquence regardez-vous la télévision ?
o Tous les jours
o Presque tous les jours
o 1 à 2 fois par semaine
o 1 à 2 fois par mois
o 1 à 2 fois par an
o Jamais
e) Indiquez votre degré d’accord avec la proposition : « Pour avoir de la qualité, il faut mettre le
prix »
o Tout à fait d’accord
o Plutôt d’accord
o Ni d’accord, ni pas d’accord
o Plutôt en désaccord
o Tout à fait en désaccord

Page 12
Variables
statistiques
𝑋

Qualitatives Quantitatives
Non mesurables Mesurables

Ordinales Nominales Discrètes Continues


Classement Pas d'ordre Nombre limité Nombre non limité

Page 13
MK121 – Statistiques Descriptives

CHAPITRE 2 : STATISTIQUE DESCRIPTIVE


UNIVARIÉE SUR UNE POPULATION
1. Les données brutes
Après la récolte des informations, le statisticien dispose de données brutes : une valeur pour
chaque individu de l’échantillon. Cette longue liste de valeurs n’est pas forcément facile à
utiliser telle quelle, mais nous pouvons la transformer en tableaux plus aisés à lire.
Nombre Poids Taille
Nom Sexe Etat civil Age(ans) d'enfants (kg) (cm) Pointure Intérêt
Bob Masculin Veuf 34 4 79 124 45 Oui
Julia Féminin Célibataire 68 0 35 206 44 Non
Valérie Féminin Divorcé 82 1 134 40 Non
Monique Féminin Célibataire 50 4 66 173 47 Non
Georges Masculin Marié 65 3 82 169 32 Oui
Arthur Masculin Divorcé 4 64 188 35 Non
Albert Masculin Divorcé 74 3 56 211 40 Oui
Jérémy Masculin Marié 73 6 43 170 41 Non
Gertrude Féminin Célibataire 45 3 29 206 46 Non
Irène Féminin Marié 49 0 69 201 46 Non
Firmin Masculin Veuf 45 1 49 149 45 Non
Luc Masculin Veuf 43 5 71 127 43 Non
Lucie Féminin Veuf 34 0 109 144 45 Oui
Charlotte Féminin Célibataire 32 0 80 209 40 Non
Caroline Féminin Célibataire 22 3 68 128 48 Oui
Elines Féminin Veuf 57 3 54 164 44 Oui
Charles Masculin Veuf 70 4 99 120 48 Oui
Henry Masculin Divorcé 25 6 20 175 45 Oui

2. Tableau de distribution (tri à plat)


Une première simplification consiste à repérer les valeurs qui se répètent. Plutôt que de les
citer à de multiples reprises, il est plus clair d’indiquer le nombre de fois qu’elles apparaissent.
Ce nombre est leur effectif.

Dans un tableau de distribution, nous citons les différentes valeurs (nous les appelons les
modalités), et leur effectif. Nous ferons également apparaître l’effectif total, taille de
l’échantillon ou de la population.

Page 14
MK121 – Statistiques Descriptives

EXEMPLE 1 (QUALITATIF NOMINAL) : UN CLUB DE SPORT A DEMANDÉ À SES 23 7


ADHÉRENTS LEUR ÉTAT CIVIL.
Etat civil Nombre d’adhérents
Célibataire 119
Divorcé 12
Marié 79
Veuf 1
Cohabitant 26
Total 237

EXEMPLE 2 (QUALITATIF ORDINAL): UN PROFESSEUR A RELEVÉ DANS SES GROUPES DE


BLOC1 L’ANNÉE DE NAISSANCE DE CHAQUE ÉTUDIANT.
Année de Nbre
naissance d'étudiants
1996 6
1997 12
1998 20
1999 42
2000 12
Total 92

EXEMPLE 3 (QUANTITATIF DISCRET) : UNE PETITE SOCIÉTÉ A DEMANDÉ À CHACUN DE


SES 80 EMPLOYÉS COMBIEN D’ENFANTS PARTICIPERONT AU GOÛTER ORGANISÉ EN
FIN D’ANNÉE.
Nombre
d’enfants Nombre d’employés
0 13
1 11
2 13
3 10
4 9
5 14
6 10
Total 80

Page 15
MK121 – Statistiques Descriptives

Exercices
1) A la sortie d’une petite salle de cinéma on a demandé à chaque spectateur de donner une note de
0 (mauvais) à 5 (excellent) au film qu’il venait de voir. Voici les résultats obtenus :
5 2 3 0 4 5 2 4 4 4 4
1 1 2 3 3 4 4 4 5 5 2
5 5 5 3 3 3 3 5 3

a) Identifiez la variable étudiée et précisez son type.


b) Construisez le tableau de distribution.

2) Un biologiste s’intéresse à la longévité d’une race de papillons exotiques. Il a examiné tous ceux
de sa serre et a noté combien d’heures ils ont vécu. Le tableau de distribution est donné ci-dessous.

Durée de vie (heures) 27 28 29 30 31 32 33


Nombre de papillons 2 4 8 7 5 3 1

a) Identifiez la variable étudiée et précisez son type.


b) Quel est l’effectif total ?

3) On a recensé la couleur de cheveux des 20 étudiants d’une classe, voici les résultats obtenus :

Brun, Blond, Brun, Brun, Blond, Blond, Blond, Roux, Blanc, Blanc, Noir, Roux, Blond, Brun, Brun,
Blanc, Blond, Blond, Roux, Blond.

a) Identifiez la variable étudiée et précisez son type.


b) Construisez le tableau de distribution.

4) On a recensé l’âge des étudiants d’une classe et on a obtenu les résultats suivants. Construisez le
tableau de distribution et calculez l’effectif total.

18 18 19 19 20 19 19 18 19 21
18 18 19 19 18 19 20 21 21 21
19 18 21 20 18 19 19 19 18 18

Page 16
MK121 – Statistiques Descriptives

Dans le cas de données quantitatives continues, il est nécessaire de regrouper les valeurs en
classes au risque d’avoir un tableau de distribution avec une ligne par individu.

Nous parlons de discrétisation. Cette fonctionnalité est disponible dans XLSTAT.

Ces groupes de valeurs, appelés classes, regroupent ensemble toutes les données qui se
trouvent entre deux valeurs limites.

L’amplitude d’une classe est la différence entre la borne supérieure et la borne inférieure de
la classe, c’est la « longueur » de la classe.

Pour obtenir une valeur unique qui représente au mieux la classe, nous pouvons utiliser le
barycentre. Celui-ci étant la moyenne des différentes valeurs au sein de la classe.

Plusieurs méthodes existent pour constituer ces classes.

➢ Faire des classes de même amplitude


➢ Faire des classes comportant le même nombre d’individus
➢ Faire un mélange des deux méthodes précédentes en trouvant une amplitude qui
permettent des effectifs quasi constants
➢ Faire des classes en fonction de contraintes liées à notre étude. En effet, si nous
voulons par la suite comparer nos résultats avec une étude existante, il est préférable
d’appliquer des regroupements identiques.

Note. Le choix des classes n’est pas toujours évident : il s’agit de réaliser un compromis pour
éviter d’une part des classes trop larges (perte de précision trop importante) et d’autre part
des classes trop étroites (gain insuffisant en lisibilité). Les limites des classes sont souvent
choisies en divisant l’étendue de la population (c’est-à-dire la différence entre la valeur la plus
petite et la valeur la plus grande) par le nombre de classes désiré.

Données brutes :
variable
quantitative
continue

Barycentre :
Classes : variable
variable
qualitative
quantitative
ordinale
discrète

Page 17
MK121 – Statistiques Descriptives

EXEMPLE 4 (QUANTITATIF CONTINU): UN CLUB DE SPORT A DEMANDÉ À SES 237


ADHÉRENTS LEUR DERNIÈRE DÉPENSE EN € À LA CAFÉTÉRIA .
Nombre
Dépense Barycentres
d’adhérents
[10-20[ 18,91 11
[20-30[ 22,02 112
[30-40[ 35,32 28
[40-50[ 43,67 30
[50-60[ 54,15 34
[60-70[ 65,88 17
[70-80] 71,40 5
Total 237

Exercices
5) On a mesuré la taille (en mètres) des 25 meilleurs joueurs de foot du monde et on a obtenu les
résultats suivants. Construisez un tableau de distribution en utilisant 4 classes de même amplitude
recouvrant les tailles de 1,55 m à 1,95 m.

1,71 1,58 1,65 1,7 1,75 1,85 1,9 1,67 1,72 1,77 1,85
1,82 1,9 1,69 1,87 1,92 1,76 1,7 1,8 1,86 1,59 1,6
1,67 1,77 1,82

6) Voici les notes sur 100 d’un groupe de 80 étudiants.

53 56 61 73 62 80 60 66 70 71 72
63 62 87 61 65 72 75 67 64 97 90
73 74 71 58 75 76 70 81 71 63 78
75 60 72 82 94 64 64 72 74 61 78
61 84 62 95 79 77 77 73 81 91 83
96 70 77 63 67 81 83 84 83 78 76
78 64 80 92 80 84 77 73 76 75 79
80 61 97

a) Répartissez ces notes en classe d’amplitude 5, la première étant [50,55[ puis dressez le tableau
de distribution.
b) Faites de même en utilisant des classes d’amplitude 10 (la première commençant à 50).
c) Dans les deux cas, calculez le nombre d’étudiants ayant une note < 65, < 75 et >= 80.
d) En vous servant des tableaux, pouvez-vous calculer le nombre d’étudiants ayant une cote <
87,5 et > 73 ? Si non, comment trouvez ces nombres ?

Page 18
MK121 – Statistiques Descriptives

Les proportions et effectifs cumulés


Les tableaux de recensement construits dans le point précédent se composent de deux
colonnes : une colonne indiquant les modalités ou les classes et une colonne indiquant les
effectifs.

On y ajoute souvent trois autres colonnes :


• La colonne des effectifs cumulés qui indique le total de tous les effectifs jusque-là ;
• La colonne des proportions qui indique le pourcentage des résultats qui correspond à
la modalité/classe en question ;
• La colonne des proportions cumulées qui indique le total des proportions jusque-là.

Les proportions permettent de « relativiser » les résultats par rapport à la taille de la


population. Par exemple, l’affirmation « Dans mon groupe, 10 étudiants ont réussi
l’interrogation. » possède une signification très différente selon que le groupe en question
comporte 20 ou 10 étudiants. Il serait plus porteur de sens de dire que « 50% des étudiants
ont réussi l’interrogation » (ou « 100% des étudiants ont réussi l’interrogation »).

Ajoutons quand cela a du sens ces trois colonnes aux exemples précédents :
EXEMPLE 1 : UN CLUB DE SPORT A DEMANDÉ À SES 237 ADHÉRENTS LEUR ÉTAT CIVIL.
Etat civil Nombre d’adhérents Proportion
Célibataire 119 50,21%
Divorcé 12 5,06%
Marié 79 33,33%
Veuf 1 0,42%
Cohabitant 26 10,97%
Total 237 100%

EXEMPLE 2 : UN PROFESSEUR A RELEVÉ DANS SES GROUPES DE BLOC1 L’ANNÉE DE


NAISSANCE DE CHAQUE ÉTUDIANT.
Année de Nbre Prop.
Nbr cumulé Proportion
naissance d'étudiants Cumulée
1996 6 6 6,52% 6,52%
1997 12 18 13,04% 19,57%
1998 20 38 21,74% 41,30%
1999 42 80 45,65% 86,96%
2000 12 92 13,04% 100,00%
92 100,00%

Page 19
MK121 – Statistiques Descriptives

EXEMPLE 3 : UNE PETITE SOCIÉTÉ A DEMANDÉ À CHACUN DE SES 80 EMPLOYÉS


COMBIEN D’ENFANTS PARTICIPERONT AU GOÛTER ORGANISÉ EN FIN D’ANNÉE.
Nombre Nombre Prop.
Nbr cumulé Proportion
d’enfants d’employés Cumulée
0 13 13 16,25% 16,25%
1 11 24 13,75% 30,00%
2 13 37 16,25% 46,25%
3 10 47 12,50% 58,75%
4 9 56 11,25% 70,00%
5 14 70 17,50% 87,50%
6 10 80 12,50% 100,00%
Total 80 100,00%

EXEMPLE 4 : UN CLUB DE SPORT A DEMANDÉ À SES 237 ADHÉRENTS LEUR DERNIÈRE


DÉPENSE EN € À LA CAFÉTÉRIA .
Nombre Prop.
Dépense Barycentre Nbr cumulé Proportion
d’adhérents Cumulée
[10-20[ 18,91 11 11 4,64% 4,64%
[20-30[ 22,02 112 123 47,26% 51,90%
[30-40[ 35,32 28 151 11,81% 63,71%
[40-50[ 43,67 30 181 12,66% 76,37%
[50-60[ 54,15 34 215 14,35% 90,72%
[60-70[ 65,88 17 232 7,17% 97,89%
[70-80[ 71,40 5 237 2,11% 100,00%
Total 237 100,00%

Il est important de savoir bien interpréter chacune des valeurs qui apparaissent dans le
tableau. Faisons-le avec les cellules grisées des tableaux précédents.

• 33,33% des adhérents au club de sport sont mariés.


• 38 étudiants sont nés entre 1996 et 1998 compris.
• 46,25% des employés viendront avec maximum deux enfants.
• 11 adhérents ont dépensé entre 10 et 20 € non compris.
• 63,71% des adhérents ont dépensé moins de 40 €.
• 14,35% des adhérents ont dépensé entre 50 et 60 € non compris.
• 9,28% (100%-90,72%) des adhérents ont dépensé plus de 60 €.

Notation Signification
𝑋𝑖 𝑖 e modalité de la variable 𝑋
𝑁𝑖 Effectif de la 𝑖 e modalité de la variable 𝑋
𝜋𝑖 La proportion de la 𝑖 e modalité

Remarque. D’un point de vue mathématique, les expressions « 0,3 », « 3/10 » et « 30% » sont
entièrement identiques. Toutes peuvent convenir pour exprimer des proportions relatives,
même si on préfère généralement la forme de pourcentage.

Page 20
MK121 – Statistiques Descriptives

Exercices
7) S’il y a 𝑝 modalités dans le tableau, que vaut toujours le dernier effectif cumulé ? Pourquoi ?

8) S’il y a 𝑝 modalités dans le tableau, que vaut toujours la dernière proportion cumulée ? Pourquoi ?

9) Un professeur a relevé lors d’une interrogation les points que les étudiants d’un groupe ont
obtenus. Il a construit le tableau de recensement complet ci-dessous. Répondez aux questions
suivantes (il peut y avoir plusieurs manières de trouver les réponses).
a) Combien d’étudiants ont eu une note de 8/10 ?
b) Quelle proportion représentent les étudiants qui ont eu une note de 9/10 ?
c) Combien d’étudiants ont échoué (c’est-à-dire ont obtenu une note de 4/10 ou moins) ?
d) Quelle proportion représentent les étudiants qui n’ont pas obtenu une dispense (c’est-à-dire
qui ont obtenu une note de 5/10 ou moins) ?
e) Combien d’étudiants ont eu une cote supérieure ou égale à 6/10 ?
f) Quelle proportion représentent les étudiants qui ont réussi (c’est-à-dire ont obtenu une note
de 5/10 ou plus) ?
g) Combien d’étudiants ont eu une note située entre 3/10 et 7/10 (bornes comprises) ?
h) Quelle proportion représentent les étudiants qui ont eu une note située entre 4/10 et 8/10
(bornes non comprises) ?

Cote Effectif Effectif cumulé Proportion (%) Prop. Cumulée (%)


1 1 1 5 5
2 2 3 10 15
3 0 3 0 15
4 3 6 15 30
5 4 10 20 50
6 2 12 10 60
7 1 13 5 65
8 3 16 15 80
9 3 19 15 95
10 1 20 5 100
20 100

10) Le service après-vente d’une entreprise fait établir des statistiques quant à la fréquence des appels
reçus. À plusieurs reprises, des experts comptent le nombre d’appels reçus au cours d’une période
de 1 minute. Voici les résultats qu’ils ont obtenus.

Nb d’appels au cours de la minute 0 1 2 3 4 5 6 7 8


Nb de relevés correspondant à cette valeur 93 261 416 393 308 174 93 42 20

a) Complétez le tableau de distribution


b) Combien de relevés ont-ils effectués ?
c) À quel point est-il fréquent que ce service après-vente ne reçoive aucun appel pendant
1 minute ?
d) À quel point est-il fréquent que ce service après-vente reçoive plus de 4 appels par minute ?

Page 21
MK121 – Statistiques Descriptives

3. Représentations graphiques
Bien souvent, « une image vaut mieux qu’un long discours. » C’est pour cela qu’il existe toute
une série de représentations graphiques standards pour les données statistiques. Dans le
cadre de ce cours, nous nous contenterons d’en aborder quelques-unes.

Représenter une variable qualitative nominale


Les diagrammes en secteur sont bien adaptés, les angles des secteurs sont alors
proportionnels aux effectifs.

Attention aux artifices de présentations qui pourraient biaiser la lecture !

Nous pouvons aussi utiliser des diagrammes figuratifs mais il faut que l’aire de la figure reste
proportionnelle à l’effectif.

POUR L’EXEMPLE 1, NOUS OBTENONS LE DIAGRAMME SUIVANT :

Etat civil des adhérents


Veuf(ve) Cohabitant(e)
1% 11%

Marié(e)
33%

Divorcé(e) Célibataire
5% 50%

Célibataire
50% Divorcé(e)
5%

Marié(e)
33%

Cohabitant(e) Veuf(ve)
11% 1%

Page 22
MK121 – Statistiques Descriptives

Représenter une variable qualitative ordinale


Comme dans le cas précédent, nous pourrions utiliser un diagramme en secteurs mais pour
tenir compte de l’ordre des modalités, il est préférable d’utiliser un diagramme en barre. Nous
pouvons aussi utiliser cette représentation pour les variables nominales afin de mettre en
évidence l’une ou l’autre modalité.

POUR L’EXEMPLE 2 :

Distribution des années de naissance


45

40

35

30
Effectif

25

20

15

10

0
1996 1997 1998 1999 2000
Année

Représenter une variable quantitative discrète


Les diagrammes en bâton permettent de représenter graphiquement les effectifs : à chaque
modalité correspond un bâton dont la hauteur est proportionnelle à la répétition. Plus une
modalité est représentée et plus son bâton sera long. Nous obtenons ainsi la distribution des
valeurs.

L’axe vertical du graphique peut être échelonné par les effectifs ou par les proportions
relatives. Dans les deux cas, le diagramme produit est le même, à l’échelle près.

Page 23
MK121 – Statistiques Descriptives

POUR L’EXEMPLE 3, NOUS OBTENONS LE DIAGRAMME EN BÂTON SUIVANT :

Distribution du nombre d'enfants


16

14

12

10
Nbre d'employés

0
0 1 2 3 4 5 6
Nombre d'enfants

Distribution du nombre d'enfants


20

18
Proportion d'employés (%)

16

14

12

10

0
0 1 2 3 4 5 6

Nombre d'enfants

Page 24
MK121 – Statistiques Descriptives

La fonction de répartition peut également être utilisée, dans le cas discret nous parlons plus
communément de diagramme en escalier. Celle-ci représente nos valeurs sur l’axe des
abscisses et les fréquences cumulées sur l’axe des ordonnées.

EXEMPLE

Nous avons récolté le nombre d’heures de sport pratiquées par semaine dans une population
de 500 individus.

Heures de sport par semaine


1

0,9

0,8

0,7
Fréquence cumulée

0,6

0,5

0,4

0,3

0,2

0,1

0
1 3 5 7 9 11 13 15 17
Heure

Nous pouvons, par exemple, voir que 40% de notre population pratiquent au plus 7 heures de
sport par semaine, que le maximum est de 16 heures, etc.

Page 25
MK121 – Statistiques Descriptives

Représenter une variable quantitative continue


Les histogrammes sont le pendant des diagrammes par bâtons dans le cas de variables
quantitatives continues. À chaque classe, nous associons un rectangle dont la surface est
proportionnelle à la répétition ou proportion de la classe. Dans le cas où toutes les classes ont
la même amplitude, cela revient à considérer que les hauteurs de ces rectangles doivent être
proportionnelles aux effectifs. Par contre, si les classes n’ont pas toutes la même amplitude,
la hauteur des rectangles devra être modifiée afin que les aires restent proportionnelles aux
effectifs. Dans ce dernier cas, l’axe des ordonnées représente les densités (c’est-à-dire la
proportion divisée par l’amplitude de la classe) et la lecture de l’histogramme sera moins
aisée.

POUR L’EXEMPLE 4, NOUS OBTENONS LES HISTOGRAMMES SUIVANTS :


Dépense Effectif Proportion Densité
[10 -20[ 11 0,046 0,005
[20 -30[ 112 0,473 0,047
[30 -40[ 28 0,118 0,012
[40 -50[ 30 0,127 0,013
[50 -60[ 34 0,143 0,014
[60 -70[ 17 0,072 0,007
[70 -80] 5 0,021 0,002

Histogramme (Dépense) CORRECT Histogramme (Dépense) CORRECT

0,5 0,05

0,45 0,045

0,4 0,04

0,35 0,035
Fréquence

0,3 0,03
Densité

0,25 0,025

0,2 0,02

0,15 0,015

0,1 0,01

0,05 0,005

0 0
0 20 40 60 80 0 20 40 60 80
Dépense Dépense

Page 26
MK121 – Statistiques Descriptives

Mais si nous avions des classes d’amplitudes différentes…

Dépense Effectif Proportion Densité


[15-20[ 11 0,046 0,009
[20-25[ 100 0,422 0,084
[25-35[ 21 0,089 0,009
[35-45[ 37 0,156 0,016
[45-55[ 32 0,135 0,014
[55-70[ 31 0,131 0,009
[70-75] 5 0,021 0,004

Histogramme (Dépense) !!! FAUX!!! Histogramme (Dépense) CORRECT


120 0,09

0,08
100
0,07

80 Densité 0,06
Effectif

0,05
60
0,04

40 0,03

0,02
20
0,01

0 0
10 20 30 40 50 60 70 80 10 20 30 40 50 60 70 80
Dépense Dépense

Page 27
MK121 – Statistiques Descriptives

La fonction de répartition peut également être représentée dans le cas continu. Nous ne
parlerons plus de diagramme en escalier car celui-ci est quasiment lisse (certain programme
propose même une option de lissage).

EXEMPLE

Nous avons observé le budget hebdomadaire (€) en nourriture d’une population de 500
individus.

Budget hebdomadaire
1

0,9

0,8

0,7
Fréquence cumulée

0,6

0,5

0,4

0,3

0,2

0,1

0
141 161 181 201 221 241 261
Budget (€)

Nous pouvons, par exemple, observer que 50 % de notre population dépensent au plus 200€
par semaine en nourriture, que le budget maximum est de 250€, etc.

Analyse d’un graphique


Un graphique doit comporter toutes les informations nécessaires à une compréhension
rapide !

➢ Titre approprié
➢ Population
➢ Variable
➢ Valeurs/modalités

Il peut permettre d’identifier certains phénomènes :

➢ Présence de valeurs extrêmes


➢ Présence de sous populations
➢ Forme de la distribution d’une variable quantitative

La création de ceux-ci se fera via un logiciel, dans cette première partie nous nous
contenterons de les analyser.

Page 28
MK121 – Statistiques Descriptives

Exercices (Interprétations de graphiques)


11) Un budget est représenté sous forme d’un histogramme. Parmi les propositions suivantes laquelle
est Fausse :

a) Aucune classe n’a une proportion supérieure à 14%.


b) 6,25% de la population a un budget compris entre 125€ inclus et 145€ non inclus.
c) L’étendue est de 200€
d) Les effectifs des classes comprises entre 45€ et 105€ sont identiques.

Budget hebdomadaire (€)


0,14

0,12

0,1

0,08
Fréquence

0,06

0,04

0,02

0
5 25 45 65 85 105 125 145 165 185 205 225 245
Budget hebdomadaire (€)

Page 29
MK121 – Statistiques Descriptives

12) Les temps de match au tennis ont été mis sous forme d’histogramme pour chacune des disciplines.
Un seul de ces graphiques est faux. Lequel :

a) Double homme
b) Simple homme
c) Double femme
d) Simple femme

Histogramme (Temps de match | Histogramme (Temps de match |


Double homme)
Simple homme)
0,2
0,5
0,15 0,4
Fréquence

Fréquence
0,3
0,1
0,2
0,05
0,1
0 0
60 110 160 0 50 100 150
Temps de match | Double homme Temps de match | Simple homme

Histogramme (Temps de match | Histogramme (Temps de match |


Double femme) Simple femme)
0,03 0,2
0,025
0,15
0,02
Fréquence
Densité

0,015 0,1
0,01
0,05
0,005
0 0
0 50 100 150 70 90 110 130 150
Temps de match | Double femme Temps de match | Simple femme

Page 30
MK121 – Statistiques Descriptives

13) Lors d’une enquête, nous nous sommes intéressés à la durée idéale pour un jeu. Les résultats nous
apparaissent ici sous forme d’un histogramme. Sur base de ce graphique quelle proposition est
fausse ?

a) Le temps maximum observé est de 150 minutes.


b) 13,5% de la population estiment que la durée doit être comprise entre 60 minutes (inclus) et
70 minutes (non inclus).
c) 10,7% de la population estiment que la durée doit être supérieure à 110 minutes.
d) 60,2% de la population estiment que la durée doit être inférieure à une heure trente.
e) La proportion de la population estimant que la durée doit se situer dans l’intervalle [50,60[ est
quasi identique à la proportion de villageois estimant que la durée doit se situer dans
l’intervalle [110,120[.

Durée idéale d'un jeu


0,18

0,16

0,14

0,12
Fréquence

0,1

0,08

0,06

0,04

0,02

0
0 20 40 60 80 100 120 140 160 180 200
Durée en minutes

Page 31
MK121 – Statistiques Descriptives

14) Nous avons interrogé une population de 200 individus afin de connaître le nombre de mails reçus
par heure pour chacun d’entre eux. Voici la fonction de répartition.

Nombre de mails par heure


1
0,9
Fréquence cumulée 0,8
0,7
0,6
0,5
0,4
0,3
0,2
0,1
0
1 3 5 7 9 11
Mails

Reconstruisez son tableau de recensement reprenant les valeurs observées, les effectifs, les effectifs
cumulés, les proportions et les proportions cumulées.

15) Pour une certaine population, nous avons relevé le budget des individus désirant acquérir un
nouveau smartphone. Au vue l’histogramme et de la fonction de répartition, complétez les phrases
suivantes:

a) … % de la population ont un budget compris entre 600 € et 700 €.


b) … % de la population ont un budget inférieur à 450 €.
c) … % de la population ont un budget supérieur de 650 €.
d) 70% de la population ont un budget inférieur à … €.
e) 14% de la population ont un budget compris entre … € et … €

Budget nouveau smartphone Budget nouveau smartphone


0,35 1
0,9
0,3
0,8
Fréquence cumulée

0,25 0,7
Fréquence

0,6
0,2
0,5
0,15
0,4

0,1 0,3
0,2
0,05
0,1
0 0
0 100 200 300 400 500 600 700 800 900 1000 0 100 200 300 400 500 600 700 800 900
Budget (€) Budget (€)

Page 32
MK121 – Statistiques Descriptives

4. Paramètres de position
Le mode : paramètre de position
Le mode est la modalité ou la valeur qui possède le plus grand effectif.

Le mode est le seul paramètre qui peut être déterminé quel que soit le type de variable.

Dans les cas d’ex-aequo, on peut se retrouver avec plusieurs modes. On parle alors de
distribution et d’échantillon multimodal(e), bimodal(e) s’il y en a deux, trimodal(e) s’il y en a
trois…).

Pour que la notion de mode statistique soit véritablement significative, il faut que sa répétition
soit nettement supérieure à celle des autres modalités.

Attention si nous avons une variable quantitative continue regroupée en classe, nous
parlerons de classe modale à condition que les classes soient de même amplitude. Sinon, il
faut prendre la classe avec la densité la plus élevée.

La moyenne arithmétique : paramètre de position


Si le mode est le paramètre le plus facile à définir, la moyenne est, par contre, le plus connu
pour décrire une variable quantitative.

Son calcul dépend de la forme sous laquelle les données sont présentées.

Données brutes. À partir des données brutes 𝑋1 , 𝑋2 , …, 𝑋𝑁 (dont certaines sont peut-être
répétées), nous calculons la moyenne en additionnant toutes les valeurs et en divisant par
l’effectif total 𝑁.
𝑁
1 𝑋1 + 𝑋2 + ⋯ + 𝑋𝑁
𝜇𝑋 = ∑ 𝑋𝑖 =
𝑁 𝑁
𝑖=1

Avec Excel, il suffira d’utiliser la fonction =MOYENNE(plage de données).

EXEMPLE DE BASE

On a relevé la température maximale (°C) de ces dix derniers jours : 10, 15, 12, 14, 18, 24,
16, 10, 9, 6.
10+15+12+14+18+24+16+10+9+6 134
La température moyenne est de = = 13,4°𝐶 par jour.
10 10

Page 33
MK121 – Statistiques Descriptives

Données rassemblées par effectifs. Si nous avons dressé un tableau des modalités et des
effectifs qui leur sont associés, la formule est légèrement différente. En effet, nous devons
tenir compte du nombre de fois que chacune des modalités apparaît. Nous multiplions chaque
valeur par son effectif puis nous effectuons une addition et nous divisons par l’effectif total.
𝑝
1 𝑋1 𝑁1 + 𝑋2 𝑁2 + ⋯ + 𝑋𝑝 𝑁𝑝
𝜇𝑋 = ∑ 𝑋𝑖 × 𝑁𝑖 =
𝑁 𝑁
𝑖=1

Ce qui revient donc à faire une moyenne des modalités pondérées par les effectifs.

DANS L’EXEMPLE 3
Nombre d’enfants Nombre d’employés Calcul
0 13 0
1 11 11
2 13 26
3 10 30
4 9 36
5 14 70
6 10 60
Total 80 233

233
Le nombre moyen d’enfant est de = 2,9125 enfants par employés.
80

Le type de la variable nous permet de choisir la bonne méthode statistique à appliquer. Nous
essayons en général de collecter des données quantitatives continues pour lesquelles il existe
de nombreuses méthodes.

Une variable supposée continue avant sondage pourrait se révéler discrète


à la lecture des résultats de celui-ci.

La manière dont la question est formulée dans le sondage peut influencer


le type de données obtenues.

Page 34
MK121 – Statistiques Descriptives

Exercices
16) Dans une entreprise, on constate que l’âge moyen des employées (femmes) est de 25 ans alors
que l’âge moyen des employés (hommes) est de 27 ans. Peut-on en déduire que l’âge moyen des
employés (tous sexes confondus) est de 26 ans ?

17) Calculez la moyenne des valeurs suivantes : 2, 4, 4, 6, 7, 7, 8, 9, 9, 10.

18) Calculez la note moyenne des résultats à une interrogation d’une classe donnés ci-dessous.

Note 5 6 7 8 9 10 11 12 13 14 15
Nb étudiants 1 3 9 4 3 1 4 1 2 1 3

19) En fin d’année, un professeur corrige un examen de Statistiques (côté sur 50 points) et se rend
compte qu’une de ses classes obtient une moyenne de 22,5.

a) Quelle moyenne aurait-il obtenu s’il avait d’abord pris la peine de ramener chacune des cotes
sur 20 points ?
b) Comme l’examen s’est déroulé dans de mauvaises conditions (bruits causés par des travaux
de construction), le professeur décide d’ajouter 3 points à la cote (sur 50) de chacun des
étudiants. Quelle moyenne obtiendra-t-il ?

20) Une étude révèle qu’en moyenne, les ménages d’une certaine ville belge remplissent
annuellement 42 sacs poubelles. Si la ville en question décidait d’imposer une taxe annuelle de
0,5 € par sac augmentée d’une partie fixe de 3 € par ménage, combien celle-ci rapporterait-elle en
moyenne par ménage ?

21) On s’est intéressé aux sommes totales versées par 10 entreprises belges à leurs actionnaires sous
la forme de dividendes au cours de l’année passée et on a obtenu les résultats suivants.

Total des dividendes versés (× 1000 €) : 3 – 2 – 9 – 2,5 – 3,5 – 8 – 4,5 – 7,5 – 8 - 5

On supposera que chacune de ces entreprises a calculé la part de ses profits à consacrer aux
dividendes comme suit : une base forfaitaire de 1 000 € augmentée d’1/5 (donc 20%) des profits.

a) Calculez la somme moyenne consacrée aux dividendes par ces entreprises.


b) Calculez le profit moyen de ces entreprises.
c) Si on suppose que ces entreprises décident d’augmenter la base forfaitaire à 2 000 € et de
diminuer la part des profits à 15%, déterminez la somme moyenne qu’elles consacreront aux
dividendes cette année-ci, sachant que leurs profits auront augmenté de 5%.

Page 35
MK121 – Statistiques Descriptives

La médiane : paramètre de position


La médiane est une valeur qui permet de diviser la distribution en deux sous-ensembles de
même effectif dans le cas de variable quantitative à condition que les valeurs soient
ordonnées au préalable.

Mathématiquement, la médiane est une valeur 𝑚 telle que


• 50% des observations sont ≤ 𝑚 et
• 50% des observations sont ≥ 𝑚.
50% 𝒎 50%

L’avantage de la médiane est qu’elle n’est pas sensible aux valeurs extrêmes
comme la moyenne car elle ne tient compte que des valeurs centrales. C’est
pour cela que la médiane est plus utilisée que la moyenne en présence de
valeurs hors norme.

À partir des données brutes 𝑋1, 𝑋2, …, 𝑋𝑛 (dont certaines sont peut-être répétées), on peut
trouver la médiane 𝑚 en accomplissant les étapes suivantes :
(1) Ordonner les valeurs 𝑋1, 𝑋2, …, 𝑋𝑛 de la plus petite à la plus grande ;
(2) Si 𝑛 est un nombre impair, la médiane est la valeur qui se trouve au milieu de la liste ;
(3) Si 𝑛 est un nombre pair, la médiane est la moyenne entre les deux valeurs centrales.
C’est un choix arbitraire, on pourrait prendre toute valeur comprise entre les deux
valeurs centrales.

La médiane pourra donc prendre une valeur qui ne sera pas forcément observée.

Considérons les exemples suivants. Nous avons mesuré la taille en cm des enfants d’un groupe
scolaire et nous avons obtenu les résultats suivants (déjà ordonnés par ordre croissant) :

108, 112, 120, 121, 122, 123, 123, 125, 126, 128.

Si nous voulons diviser le groupe en deux en mettant les plus petits d’un côté et les plus grands
de l’autre, où fixer la limite ? Ici, on a un nombre pair de valeurs. La médiane sera donc à mi-
chemin entre les deux valeurs au centre : 122 et 123. Elle vaudra donc 122,5 cm. La moitié des
enfants mesure moins de 122,5 cm.

108, 112, 120, 121, 122, 122, 123, 125, 126, 128.

Si nous voulons diviser le groupe en deux en mettant les plus petits d’un côté et les plus grands
de l’autre, où fixer la limite ? Ici, on a un nombre pair de valeurs. La médiane sera donc à mi-
chemin entre les deux valeurs au centre : 122 et 122. Elle vaudra donc 122 cm. La moitié des
enfants mesure moins de 122 cm.

108, 112, 120, 121, 123, 123, 123, 125, 126.

Si nous voulons diviser le groupe en deux en mettant les plus petits d’un côté et les plus grands
de l’autre, où fixer la limite ? Ici, on a un nombre impair de valeurs. La médiane sera donc la
valeur centrale : 123. La moitié des enfants mesure moins de 123 cm.

Page 36
MK121 – Statistiques Descriptives

De manière générale, si les résultats 𝑋1, 𝑋2, …, 𝑋𝑁 sont ordonnés par ordre croissant, la
médiane 𝑚 vaut
𝑁+1
• 𝑋𝑁+1 , le -ème résultat si 𝑁 est impair ; et
2
2

𝑋𝑁 +𝑋𝑁
+1 𝑁
• 2 2
, la moyenne entre le 2 -ème résultat et le suivant si 𝑁 est pair.
2

Avec Excel, il suffira d’utiliser la fonction =MEDIANE(plage de données ordonnées)

DANS L’EXEMPLE 3
Nombre d’enfants Nombre d’employés Nbre cumulé d’employés
0 13 13
1 11 24
2 13 37
3 10 47
4 9 56
5 14 70
6 10 80
Total 80

La médiane se trouve à mi-chemin entre la 40ième et la 41ième observation. Toutes deux étant
égales à 3. 50% des employés seront accompagnés de maximum 3 enfants.

Page 37
MK121 – Statistiques Descriptives

Exercices
22) Calculez la médiane des données ci-dessous.

a) 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11
b) 2, 3, 4, 5, 6, 7, 7, 8, 8, 8
c) 2, 4, 4, 6, 7, 7, 8, 9, 9, 10

23) Calculez la médiane dans les deux situations suivantes (résultats à une interrogation).

a)
Note 5 6 7 8 9 10 11 12 13 14 15
Nb étudiants 1 3 9 4 3 1 4 1 2 1 3
b)
Note 5 6 7 8 9 10 11 12 13 14 15
Nb étudiants 1 3 8 4 3 1 4 1 3 6 3

24) Calculez la médiane des données ci-dessous.

a)
𝑿𝒊 𝑵𝒊
0 2
1 4
2 4
3 7
4 3

b)

𝑿𝒊 𝑵𝒊
18 6
19 10
20 4
21 2
22 2

Page 38
MK121 – Statistiques Descriptives

Les quantiles : paramètres de position

Budget
cadeau (€)
67,44
74,79
81,02
81,68
81,87
𝑄1 ∈ [81,87 ; 89,66]
89,66
90,42
90,56
92,56
96,52
96,77
96,85
97,53
101,47
107,99
108,59
110,58
125,70
128,80
144,08

Les quantiles sont une généralisation de la médiane. Pour rappel, la médiane 𝑚 est une valeur
censée diviser la population en deux parties, avec 50% des résultats avant la médiane et 50%
des résultats après.

Mais rien ne nous oblige à nous arrêter à une découpe de la population en deux parties égales!

Nous pourrions choisir de la découper en 4 parties contenant chacune 25% des données. Les
valeurs qui permettent cette découpe sont les quartiles 𝑄1, 𝑄2 et 𝑄3 , qui correspondent
respectivement aux proportions cumulées 25%, 50% et 75%. Le second quartile, 𝑄2 , n’est rien
d’autre que la médiane 𝑚.

Quantile (ou percentile) d’ordre 𝜶. Les quartiles sont des cas particuliers de la notion de
quantile. De manière générale, nous parlons de quantile d’ordre 𝜶 (0 ≤ 𝛼 ≤ 1) pour désigner
la valeur 𝑄𝑢𝛼 telle que
• Il y ait une proportion 𝛼 des données situées avant 𝑄𝑢𝛼 et
• Il y ait une proportion (1 − 𝛼) des données situées après 𝑄𝑢𝛼 .

Par exemple, le premier quartile peut-être n’importe quelle valeur comprise entre 81,87 et
89,66.

Page 39
MK121 – Statistiques Descriptives

Notation Signification
𝑄1 , 𝑄2 , 𝑄3 Les quartiles (𝑄2 = 𝑚) situés à 25%, 50% et 75%
𝑄𝑢𝛼 Le quantile d’ordre 𝛼 situé à (𝛼 × 100) %

Pratiquement le calcul de ceux-ci est sujet à discussion. En effet, il existe diverses méthodes
permettant leur calcul. Mais celles-ci ne sont pas nécessairement équivalentes. Deux
méthodes différentes pourraient donner des valeurs de quantile différentes. Toutefois, toutes
ces méthodes ont du sens.

Exercices (paramètres de position)


25) Déterminez le mode, la moyenne et la médiane pour les données suivantes.

a) 2 4 5 5 6 6 6 6 7
8 8 8 9 9 10 10 11
b)
𝑿𝒊 𝑵𝒊
2 4
3 5
4 8
5 0
6 4
7 3

26) Un magasin de chaussures étudie les ventes effectuées au cours d’une semaine, et plus
particulièrement les pointures de chaque paire vendue. Voici les résultats de cette observation.
Calculez le mode, la moyenne et la médiane. Lequel des trois paramètres est le plus significatif
pour le responsable du magasin qui doit choisir quelle pointure commander pour renouveler son
stock ?

Pointure 37 38 39 40 41 42 43 44 45
Nb ventes 6 5 6 5 8 5 4 2 2

27) Un physicien réalise une expérience pratique sur la dilatation des métaux en mesurant (aussi
précisément que possible) un bâtonnet de fer chauffé à 60°. Pour éviter les erreurs de lecture et
les variations dues aux conditions de l’expérience, il répète celle-ci 6 fois. Voici les mesures qu’il
obtient : 10,321 cm, 10,324 cm, 10,323 cm, 10,324 cm, 10,325 cm, 10,327 cm. Calculez le mode,
la moyenne et la médiane. Lequel des trois paramètres est le plus significatif dans ce cas-ci ?

28) Le tableau suivant reprend le taux d’intérêts (en %) des dépôts d’épargne proposés par
20 banques. Construisez le tableau de distribution puis trouvez le mode, la moyenne et la médiane.
Interprétez ensuite (par une courte phrase) chacun de ces résultats.

4 6 7 4 10 8 7 5 7 5
5 9 6 5 4 7 5 8 5 6

29) On a observé les taux de chômage (en pourcentage de la population active) dans 24 secteurs
d’activité. Voici les résultats obtenus. Dressez le tableau de distribution, puis calculez et interprétez
le mode, la moyenne, la médiane et le 3ème quartile.

8 8 9 8 9 8 9 8 14 8 8 9
6 11 6 9 9 8 8 9 14 9 11 10

Page 40
MK121 – Statistiques Descriptives

30) En étudiant le Q.I. de 480 enfants de 5 ans, on a obtenu les résultats suivants. Calculez et
interprétez le mode, la moyenne, la médiane et le quantile d’ordre 0,8.

QI 70 74 78 82 86 90 94 98 102 106 110 114 118 122 126


Nombre
4 9 16 28 45 80 66 77 54 38 27 18 11 5 2
d’enfants

31) On a demandé aux employés d’une petite entreprise d’indiquer leur salaire mensuel brut. Trois
personnes ont répondu 2 000 €, cinq personnes ont répondu 2 500 € et deux personnes 3 000 €.
Que valent le mode, la moyenne et la médiane ?

Si on ajoute le salaire du patron de l’entreprise (10 000 €), que deviennent ces paramètres ? Quels
sont les paramètres qui sont très sensibles aux valeurs extrêmes et ceux qui le sont moins ?

32) Un professeur termine la correction d’un examen coté sur 100. La moyenne de la classe est de 65
points.
a) Comme les questions étaient particulièrement difficiles, il décide d’ajouter 5 points à tout le
monde. Que devient la moyenne ?
b) Comme le cours vaut 2 crédits, il doit encoder les points sur un maximum de 20. Que devient
la moyenne ?

Page 41
MK121 – Statistiques Descriptives

5. Paramètres de dispersion
Les paramètres de position présentés dans le module précédent permettent de résumer un
ensemble de données en une valeur : celle qui revient le plus souvent (le mode), celle qui
sépare les résultats en deux groupes de même taille (la médiane) ou celle qui approxime au
mieux l’ensemble des résultats (la moyenne).

La moyenne, aussi significative soit-elle, ne permet pas de savoir comment les données sont
distribuées autour d’elles : sont-elles toutes agglutinées tout près de la valeur centrale ou, au
contraire, sont-elles éparpillées à bonne distance de celle-ci ?

Considérons la situation suivante, voici les résultats sur 20 pour deux étudiants ayant présenté
les mêmes 11 examens.

Albert 9 9 9 9 10 10 10 11 11 11 11
Bernard 0 2 4 6 8 10 12 14 16 18 20

Dans le premier cas, toutes les valeurs sont fort proches de 10 (entre 9 et 11) alors que, dans
le second cas, les valeurs s’étalent sur tout l’intervalle de 0 à 20. Or, les deux étudiants ont
chacun la même moyenne de 10/20. C’est pour déceler ce genre de différence qu’on introduit
les paramètres de dispersion.

L’étendue : paramètre de dispersion


La mesure la plus intuitive de la dispersion est sans doute l’étendue des données. Il s’agit tout
simplement de la « longueur » sur laquelle les valeurs s’étendent, à savoir la différence entre
la valeur maximale observée et la valeur minimale observée. Ainsi, dans l’exemple donné ci-
dessus, le premier échantillon (Albert) a une étendue de 2 alors que le second (Bernard) a une
étendue de 20.

L’étendue permet de savoir à quel point les données s’éloignent de la moyenne et de


connaître l’intervalle de valeurs qu’elles recouvrent, mais ce paramètre n’apporte aucune
information sur la manière dont les résultats se répartissent au sein de cet intervalle : les
données pourraient être éparpillées de manière régulière ou toutes concentrées en un même
endroit avec quelques valeurs extrêmes.

L’intervalle interquartile : paramètre de dispersion


Écart interquartile

25% 𝑸𝟏 25% 𝑸𝟐 25% 𝑸𝟑 25%

Nous définissons également l’écart interquartile comme la distance entre le premier et le


troisième quartile, c’est-à-dire 𝑄3 − 𝑄1. C’est la longueur de l’intervalle central dans lequel on
retrouve 50% des résultats, les résultats les plus « centraux ».

Page 42
MK121 – Statistiques Descriptives

Travailler sur l’intervalle interquartile, nous permet d’écarter les valeurs extrêmes qui peuvent
perturber les conclusions. Une valeur est dite extrême si elle se trouve en dehors de
l’intervalle [𝑄1 − 1,5 × (𝑄3 − 𝑄1 ), 𝑄3 + 1,5 × (𝑄3 − 𝑄1 )].

EXEMPLE

Supposons que 𝑄1 = 15 et 𝑄3 = 25. Dès lors toutes valeurs à l’extérieur de l’intervalle


[15 − 1,5 × (25 − 15), 25 + 1,5 × (25 − 15)] = [0,40] sera jugées comme une valeur
extrême.

La boîte de dispersion (box plot)


La boîte de dispersion est un résumé graphique reprenant les informations suivantes : le
minimum et le maximum de l’échantillon, sa médiane, ses quartiles et son écart interquartile.
Toutes ces valeurs sont repérées sur une droite représentant les valeurs possibles.

Elle prend la forme d’une boîte rectangulaire s’étendant du premier quartile au troisième
quartile et divisée en deux par un repère situé au niveau de la médiane, le tout accompagné
d’un « T » à gauche indiquant le minimum et d’un « T » à droite indiquant le maximum.

Cette boîte de dispersion permet de comparer des populations différentes.

médiane 𝑚 Maximum
Non extrême
Minimum
Non extrême

valeurs

1er quartile 𝑄1 3e quartile 𝑄3

XLSTAT nous permettra de construire aisément ce graphique. Le minimum et le maximum


seront identifiés par un point noir. Nous visualiserons également sur le graphique la moyenne
à l’aide d’une croix. Nous pourrons aussi identifier les valeurs extrêmes s’il y en a car dans ce
cas les « moustaches » ne seront plus le minimum et/ou le maximum.

Page 43
MK121 – Statistiques Descriptives

EXEMPLE 4 DE LA DÉPENSE DES ADHÉRENTS AU CLUB DE SPORT :

Box plot (Age)


80

70

60
Dépense (€)

50

40

30

20

10

Si nous voulons comparer la distribution de la dépense en fonction de l’état civil, nous


obtenons :

Box plots
80
Dépense | Célibataire Dépense | Marié(e)

70

60
Dépense (€)

50

40

30

20

10 Dépense | Cohabitant(e) Dépense | Divorcé(e) Dépense | Veuf(ve)

Page 44
MK121 – Statistiques Descriptives

Exercices
33) Voici un graphique représentant le prix dépensé pour faire un plein de carburant pour quatre
tranches d’âge :

Les affirmations suivantes sont-elles exactes ? Si oui, justifiez, sinon, corrigez !


a) 50% des 18-30 dépensent entre 20 € et 80 €
b) 50% des + de 65 dépensent plus de 75 €.
c) Les 18-30 ans ont la distribution la plus symétrique par rapport à la médiane

34) Sur un site de vente en ligne, on a procédé à une enquête afin de mieux cibler la clientèle. Nous
avons obtenu les distributions suivantes (montant de la facture en fonction du sexe) :

Box plots
280

260
Montant Facture |
240 M

220

200

180

160

140

120

100 Montant Facture |


F

Les affirmations suivantes sont-elles exactes ? Si oui, justifiez, sinon, corrigez !


a) 50% des femmes ont une facture de maximum 149,75€
b) 25% des hommes dépensent plus de 172€
c) En moyenne, les femmes sont plus dépensières que les hommes

Page 45
MK121 – Statistiques Descriptives

35) Nous avons relevé le budget soirée en fonction du quartier d’habitation de la population d’un
village. Voici ce relevé sous forme de box-plot.

Budget en fonction du quartier


70
X1 | Le quartier des villas X1 | Le quartier du château X1 | Le vieux quartier

60

50

40

30

20

10

0 X1 | Le nouveaux lotissement X1 | Le quartier du bois X1 | Le quartier du moulin

Quelle proposition est fausse ?

a) Les budgets des habitants du vieux quartier ne présentent pas de valeurs extrêmes.
b) 50% des habitants du quartier du bois ont un budget inférieur à leur budget moyen.
c) 75% des habitants du quartier des villas ont un budget supérieur à 35€.
d) Ce sont les habitants du quartier du moulin qui présentent la variabilité la plus grande.
e) En moyenne, les habitants du quartier des villas comptent dépenser plus que les autres.

Page 46
MK121 – Statistiques Descriptives

36) Nous avons relevé le temps d’un match de tennis en fonction de la discipline et représenté ces
données sous forme de box plot.

170
Temps de match | Double Temps de match | Simple
homme homme

150

130

110

90

70

Temps de match | Double Temps de match | Simple


femme femme
50

Laquelle de ces propositions est fausse :


a) En moyenne, le temps de match est plus élevé en simple femme.
b) Le double femme présente une distribution parfaitement symétrique.
c) Il y a un participant du simple homme qui affectionne les matchs expéditifs.
d) 50% des joueurs de double homme passent entre 87 minutes et 110 minutes sur le cours.

37) On a relevé le budget loisir annuel d’une population de 80 personnes. Voici ce relevé :

10 256 405 470 550 670 780 990


25 274 409 473 552 680 794 996
150 290 410 480 580 684 810 1002
160 310 415 482 584 695 845 1045
162 320 428 490 590 705 852 1200
163 325 438 496 600 712 867 1250
170 362 440 503 604 715 890 1300
185 384 452 508 628 746 904 1480
200 400 453 510 654 750 905 1956
250 402 458 512 658 758 908 2458

Déterminer s’il y a des valeurs extrêmes.

Page 47
MK121 – Statistiques Descriptives

38) Que pouvez-vous dire au sujet de ce graphique ?

40

35

30

25
Score

20

15

10

a) Ce type de graphique n’existe pas car il superpose des points et un boxplot.


b) Ce graphique est un boxplot, mais il est impossible car il manque une moustache.
c) Ce graphique est possible, mais il y a une erreur dans le calcul de la moyenne. En effet, il est
impossible que celle-ci soit en dehors du rectangle vert.
d) Ce graphique est issu des données suivantes :
Score 2 3 4 6 6 7 8 10 10 10 11 12 12 30 35 40

La variance et l’écart-type : paramètres de dispersion


Pour savoir à quel point les données 𝑋𝑖 de la population s’éloignent de la moyenne 𝜇𝑋 , nous
aurions pu nous intéresser aux écarts |𝑋𝑖 − 𝜇𝑋 |. Nous aurions pu alors calculer la moyenne de
tous ces écarts afin de savoir, « en moyenne », à quel point les résultats s’éloignent de 𝜇𝑋 .

Malheureusement, d’un point de vue mathématique, les valeurs absolues ne permettent pas
les développements nécessaires aux parties plus avancées des statistiques. Alors, plutôt que
de considérer la moyenne des écarts entre les données et 𝜇𝑋 , nous nous intéressons plutôt à
la moyenne des carrés de ces écarts.

L’écart entre une donnée 𝑋𝑖 et la moyenne 𝜇𝑋 vaut |𝑋𝑖 − 𝜇𝑋 |. Si nous calculons le carré de cet
écart, nous pouvons oublier la valeur absolue : cela donne (𝑋𝑖 − 𝜇𝑋 )2. La moyenne des carrés
des écarts, que nous appelons la variance, vaut donc
𝑁
1
𝜎𝑋2 = ∑(𝑋𝑖 − 𝜇𝑋 )2
𝑁
𝑖=1

Page 48
MK121 – Statistiques Descriptives

Plus les données sont dispersées autour de la moyenne, plus elles sont hétérogènes et plus la
variance est grande.

La variance est une notion fondamentale en statistique qui est fréquemment utilisée. Elle ne
s’exprime pas dans les mêmes unités que les données mais dans les unités au carré !

Pour revenir à une valeur plus proche de la « moyenne des écarts » et interpréter la dispersion
des données, nous calculons la racine carrée de la variance, qu’on appelle l’écart-type.

𝑁
1
𝜎𝑋 = √𝜎𝑋2 = √ ∑(𝑋𝑖 − 𝜇𝑋 )2
𝑁
𝑖=1

Comment interpréter cet écart-type ? Sa valeur dans l’absolu ne donne aucune indication. Un
écart-type doit être comparé à d’autres valeurs.

Nous pourrons comparer des écarts-types issus de différentes populations. Pourvu que nous
travaillions sur le même type de données et dans la même unité.

Nous pourrons aussi comparer l’écart-type à la moyenne en utilisant le coefficient de


variation
𝜎𝑋
𝐶𝑉𝑋 = (𝑒𝑥𝑝𝑟𝑖𝑚é 𝑒𝑛 𝑝𝑜𝑢𝑟𝑐𝑒𝑛𝑡𝑠)
𝜇𝑋
Plus le coefficient de variation est élevé, plus les données sont dispersées autours de la
moyenne. Nous admettrons qu’un coefficient de variation en-dessous de 30% indique des
données homogènes et donc une moyenne représentative de la population. A l’inverse, si ce
coefficient dépasse 30%, les données seront dispersées et la moyenne sera donc très délicate
à interpréter. Nous pourrons ainsi comparer différentes distributions de données qui ne sont
pas forcément exprimées dans la même unité. Par exemple, comparer la distribution des
salaires dans une entreprise belge (€) et dans une entreprise britannique (£).

Notation Signification Calcul


𝑁
1
𝜎𝑋2 la variance 𝜎𝑋2 = ∑(𝑋𝑖 − 𝜇𝑋 )2
𝑁
𝑖=1

𝑁
1
𝜎𝑋 l'écart-type 𝜎𝑋 = √𝜎𝑋2 = √ ∑(𝑋𝑖 − 𝜇𝑋 )2
𝑁
𝑖=1

𝜎𝑋
𝐶𝑉𝑋 Le coefficient de variation 𝐶𝑉𝑋 =
𝜇𝑋

Avec Excel, nous utiliserons les formules =VAR.P.N(plages de données) et


=[Link](plage de données).

Page 49
MK121 – Statistiques Descriptives

Si nous reprenons les deux exemples des points aux examens, nous pouvons calculer leur
variance pas à pas comme suit.

𝑿𝒊 9 9 9 9 10 10 10 11 11 11 11
A 𝑋𝑖 − 𝜇𝑋 -1 -1 -1 -1 0 0 0 1 1 1 1 Somme
(𝑋𝑖 − 𝜇𝑋 )2 1 1 1 1 0 0 0 1 1 1 1 8
𝒀𝒊 0 2 4 6 8 10 12 14 16 18 20
B 𝒀𝒊 − 𝜇𝑌 -10 -8 -6 -4 -2 0 2 4 6 8 10 Somme
2 100 64 36 16 4 0 4 16 36 64 100 440
(𝑌𝑖 − 𝜇𝑌 )

Pour Albert, nous trouvons une variance de 8/11 = 0,73 et un écart-type de 0,85 avec une
moyenne de 10.

Pour Bernard, nous obtenons une variance de 440/11 = 40 et un écart-type de 6,32 avec une
moyenne de 10.

L’écart-type, beaucoup plus grand dans le second cas, montre bien que les cotes de Bernard
sont plus dispersées que celles d’Albert.

Ce qui est confirmé par les coefficients de variation, pour Albert 8,5% contre 63,2% pour
Bernard.

Prenons un autre exemple de deux produits distincts dont on relève le prix dans divers
magasins dans ce cas il s’agira d’un jouet et d’un smartphone.

Jouet (€) 10,00 9,00 12,00 8,50 10,50


Smartphone (€) 150,00 149,00 152,00 148,50 150,50

Si nous comparons les moyennes, nous situerons les valeurs d’une population par rapport à
celles de l’autre. Cela permet de voir si l’un des produits est significativement plus cher que
l’autre ou si leurs prix sont « en moyenne » similaires. Ici le prix du jouet a une moyenne de
10 euros et celui du smartphone 150 euros. Ce qui nous amène à conclure que le jouet est
moins cher que le smartphone.

Si nous comparons les variances (ou les écarts-types), nous verrons à quel distance les
résultats s’éloignent de la moyenne. Si les variances sont quasiment identiques, cela signifie
que les fourchettes de prix pour les deux produits sont de même taille. Ici, les variances sont
identiques (1,5 €2) et donc les écarts-types aussi (1,22 €). La « fourchette des prix » a la même
taille dans les deux cas. Cependant, comme le smartphone coûte beaucoup plus cher que le
jouet, cette fourchette indique en fait une variabilité beaucoup plus grande pour le prix du
jouet que pour le prix du smartphone.

Considérons les coefficients de variation. Pour le jouet, nous obtenons un coefficient de


variation valant 12,25% alors que pour le smartphone, nous avons un coefficient de variation
de 0,8%. Nous pouvons donc conclure que le prix du jouet a beaucoup plus de variabilité que
le prix du smartphone.

Page 50
MK121 – Statistiques Descriptives

DANS L’EXEMPLE 3
Nombre Nombre
Calcul Calcul
d’enfants d’employés
0 13 0 (0 − 2,9125)2 × 13 = 110,27
1 11 11 (1 − 2,9125)2 × 11 = 40,23
2 13 26 10,82
3 10 30 0,08
4 9 36 10,64
5 14 70 61,01
6 10 60 95,33
Total 80 233 328,39

233
La moyenne est de = 2,9125 enfants par employé.
80

328,39
La variance est de = 4,10 enfants².
80

328,39
L’écart-type est de √ = 2,03 enfants.
80

2,03
Le coefficient de variation est de 2,9125 = 69,56%.

La distribution de nombre d’enfants n’est pas homogène, la moyenne n’est pas


représentative. Les observations sont fortement dispersées.

Exercices
39) On a relevé les températures en degrés Celsius suivantes ces 10 derniers jours : 12°, 25°, 14°, 13°,
24°, 23°, 28°, 16°, 17°, 20°.
a) Calculez la moyenne, la variance, l’écart-type et le coefficient de variation.
b) Calculez en degrés Fahrenheit la moyenne, la variance, l’écart-type et le coefficient de
9
variation sachant que la formule pour passer en Fahrenheit est 𝑡𝐹 = ( ) 𝑡𝐶 + 32.
5
c) Pour chaque paramètre, trouvez le lien entre le paramètres calculé en degrés Celsius et celui
calculé en degrés Fahrenheit

40) Une étude portant sur les chiffres d’affaires en Belgique et aux USA de diverses entreprises
implantées dans les deux pays a révélé les résultats suivants. Y a-t-il plus de variabilité en Belgique
ou aux États-Unis ?

Belgique États-Unis
CA moyen 1 566 569,98 € $ 1 212 046,41
Écart-type 475 832,76 € $ 368 149,14

Page 51
MK121 – Statistiques Descriptives

41) Le graphique suivant reprend le nombre de spams par heure reçus par les employés d’une grande
entreprise. Calculez la moyenne, le mode, la médiane, la variance et l’écart-type de cette variable.

Spam
150
137
100 98
100

Effectif
58 60
50
15 26
5 1
0
1 2 3 4 5 6 7 8 9
Spams

42) Une enquête auprès des chômeurs se rendant au Forem de Saint-Servais leur demandait
d’indiquer approximativement depuis combien de jours ils étaient au chômage. Quatre réponses
étaient proposées : 120 (choisie par 10 chômeurs), 150 (choisie par 40 chômeurs), 180 (choisie par
20 chômeurs) et 240 (choisie par 5 chômeurs).
a) Dressez le tableau de distribution complet.
b) Calculez l’écart-type de cette population.
c) Déterminez son coefficient de variation.
d) Chacun de ces chômeurs a reçu une allocation de 10€ par jour. Si on étudie le total des
allocations perçues par chacun de ces chômeurs, quel écart-type obtiendra-t-on ? Et quel
coefficient de variation ?
e) On suppose maintenant que chacun des chômeurs a dû payer une taxe forfaitaire de 80€ sur
le total des allocations perçues. Si on étudie la somme nette perçue par les chômeurs (en
décomptant donc cette taxe), quel écart-type obtiendra-t-on ? Et quel coefficient de
variation ?

Page 52
MK121 – Statistiques Descriptives

6. En résumé

Ordonner :
tableau de
distribution

Représenter la
distribution

Synthétiser par
des paramètres

Interpréter

Page 53
MK121 – Statistiques Descriptives

CHAPITRE 3 : STATISTIQUE DESCRIPTIVE


BIVARIÉE POUR UNE POPULATION
1. Introduction
Nous allons maintenant nous intéresser à l’étude simultanée de deux variables (𝑋 et 𝑌),
observées sur la même population. L’objectif étant de mettre en évidence des éventuelles
relations entre ces deux variables.

EXEMPLES

• Le sexe et la couleur préférée.


• Le niveau d’étude et le niveau de satisfaction d’un service client.
• La cylindrée et le type de carburant d’un parc automobile.
• Le kilométrage annuel et le type de carburant d’un parc automobile.
• La cote en statistiques et la cote en langue des étudiants des 1°Marketing.
• Le poids et la taille des étudiants de l’I.E.S.N.

Comme nous le montrent les exemples précédents, nous pouvons croiser des variables de
même type et également de type différent. C’est précisément la nature des deux variables
croisées qui va nous amener à des méthodes de calcul et des représentations différentes.

2. Deux variables qualitatives


Lorsque nous étudions deux variables qualitatives, il est commode de présenter les résultats
sous forme d’une table de contingence.

Représentation des données : la table de contingence


Le tableau de contingence comporte 𝑝 lignes et 𝑞 colonnes, les modalités (𝑋𝑖 ) de la variable 𝑋
apparaissent en ligne et les modalités (𝑌𝑗 ) de la variable 𝑌 apparaissent en colonne. A
l’intérieur du tableau nous trouvons les effectifs conjoints (𝑁𝑖𝑗 ) de la modalité 𝑋𝑖 et de la
modalité 𝑌𝑗 . Le total de la ligne 𝑖 est noté 𝑁𝑖∗ et le total de la colonne 𝑗 est noté 𝑁∗𝑗 . Dès lors,
en marge de ce tableau, nous retrouvons la distribution de chacune des variables prise
séparément. Ce que nous appellerons la distribution marginale. Mais, ce tableau nous permet
surtout de connaître la distribution d’une des deux variables observées sur une sous-
population définie par une des modalités d’une autre variable. Ce que nous appellerons la
distribution conditionnelle.

Page 54
MK121 – Statistiques Descriptives

𝑌 𝑌1 ⋯ 𝑌𝑗 ⋯ 𝑌𝑞 Total
𝑋

𝑋1 𝑁11 ⋯ 𝑁1𝑗 ⋯ 𝑁1𝑞 𝑁1∗


Effectifs
conditionnels de
⋯ ⋯ ⋯ ⋯ ⋯ ⋯ ⋯
𝑌 sous 𝑋𝑖

𝑋𝑖 𝑁𝑖1 ⋯ 𝑁𝑖𝑗 ⋯ 𝑁𝑖𝑞 𝑁𝑖∗

⋯ ⋯ ⋯ ⋯ ⋯ ⋯ ⋯

𝑋𝑝 𝑁𝑝1 ⋯ 𝑁𝑝𝑗 ⋯ 𝑁𝑝𝑞 𝑁𝑝∗


Effectifs
marginaux de 𝑌
Total 𝑁∗1 ⋯ 𝑁∗𝑗 ⋯ 𝑁∗𝑞 𝑁

Effectifs conditionnels de Effectifs marginaux de 𝑋


𝑋 sous 𝑌𝑗

EXEMPLE

Une entreprise comptant 804 employés a demandé à un institut de statistiques de dresser un


tableau reprenant l’état-civil de ses employées et leur place dans l’entreprise.

Cadre Directeur Formateur Ouvrier Secrétaire Total


Célibataire 43 31 37 50 34 195
Divorcé 46 41 43 49 56 235
Marié 33 44 36 36 40 189
Veuf 44 46 34 34 27 185
Total 166 162 150 169 157 804

Nous observons :

• 43 personnes qui sont célibataires et qui sont des cadres.


• 195 personnes célibataires.
• 162 directeurs.
• 33 personnes mariées parmi les 166 cadres.

Page 55
MK121 – Statistiques Descriptives

Le tableau de contingence en fréquence


Ce même tableau peut évidemment s’exprimer en fréquence (ou pourcentage). Il suffit
évidemment de diviser chaque effectif par l’effectif total 𝑁.

EXEMPLE
Cadre Directeur Formateur Ouvrier Secrétaire Total
Célibataire 5,35 3,86 4,60 6,22 4,23 24,25
Divorcé 5,72 5,10 5,35 6,10 6,97 29,23
Marié 4,10 5,47 4,48 4,48 4,98 23,51
Veuf 5,47 5,72 4,23 4,23 3,36 23,01
Total 20,65 20,15 18,66 21,02 19,53 100

Représentation graphique du tableau de contingence


Celle-ci n’est pas réalisable à la main, mais peut s’effectuer facilement par ordinateur. Il s’agit
d’une vue 3D du tableau.

EXEMPLE

Vue 3D du tableau de contingence

60

50

40

30

20

10

Célibataire
Divorcé
Marié
Veuf

Lignes Colonnes

Page 56
MK121 – Statistiques Descriptives

Les profils-lignes et profils-colonnes


Les tableaux précédents ne permettent pas d’illustrer de façon simple les distributions
conditionnelles. En effet, si nous reprenons notre exemple parmi les 166 cadres, il y en a 33
33
qui sont mariés. La proportion est donc de 166 = 19,88%. Nous allons devoir dresser ce que
nous appellerons un profil-ligne et un profil-colonne. Le profil-ligne représentant la
distribution conditionnelle (en fréquence ou pourcentage) de la variable 𝑌 sous chacune des
modalités de 𝑋. Et le profil-colonne représentant la distribution conditionnelle (en fréquence
ou pourcentage) de la variable 𝑋 sous chacune des modalités de 𝑌.

PROFILS-LIGNES

𝑋 𝑌 𝑌1 ⋯ 𝑌𝑗 ⋯ 𝑌𝑞 Total
𝑁11 𝑁1𝑗 𝑁1𝑞
𝑋1 ⋯ ⋯ 100%
𝑁1∗ 𝑁1∗ 𝑁1∗
⋯ ⋯ ⋯ ⋯ ⋯ ⋯ ⋯
𝑁𝑖1 𝑁𝑖𝑗 𝑁𝑖𝑞
𝑋𝑖 ⋯ ⋯ 100%
𝑁𝑖∗ 𝑁𝑖∗ 𝑁𝑖∗
⋯ ⋯ ⋯ ⋯ ⋯ ⋯ ⋯
𝑁𝑝1 𝑁𝑝𝑗 𝑁𝑝𝑞
𝑋𝑝 ⋯ ⋯ 100%
𝑁𝑝∗ 𝑁𝑝∗ 𝑁𝑝∗
𝑁∗1 𝑁∗𝑗 𝑁∗𝑞
Total ⋯ ⋯ 100%
𝑁 𝑁 𝑁

PROFILS-COLONNES

𝑋 𝑌 𝑌1 ⋯ 𝑌𝑗 ⋯ 𝑌𝑞 Total
𝑁11 𝑁1𝑗 𝑁1𝑞 𝑁1∗
𝑋1 ⋯ ⋯
𝑁∗1 𝑁∗𝑗 𝑁∗𝑞 𝑁
⋯ ⋯ ⋯ ⋯ ⋯ ⋯ ⋯
𝑁𝑖1 𝑁𝑖𝑗 𝑁𝑖𝑞 𝑁𝑖∗
𝑋𝑖 ⋯ ⋯
𝑁∗1 𝑁∗𝑗 𝑁∗𝑞 𝑁
⋯ ⋯ ⋯ ⋯ ⋯ ⋯ ⋯
𝑁𝑝𝑗 𝑁𝑝𝑞 𝑁𝑝∗
𝑋𝑝 𝑁𝑝1 /𝑁∗1 ⋯ ⋯
𝑁∗𝑗 𝑁∗𝑞 𝑁
Total 100% ⋯ 100% ⋯ 100% 100%

EXEMPLE

Voici les profils-lignes de notre exemple ainsi qu’une représentation graphique de ceux-ci.

Cadre Directeur Formateur Ouvrier Secrétaire Total


Célibataire 22,05 15,90 18,97 25,64 17,44 100
Divorcé 19,57 17,45 18,30 20,85 23,83 100
Marié 17,46 23,28 19,05 19,05 21,16 100
Veuf 23,78 24,87 18,38 18,38 14,60 100
Total 20,65 20,15 18,66 21,02 19,53 100

Page 57
MK121 – Statistiques Descriptives

Total

Veuf Cadre
Directeur
Marié
Formateur
Divorcé Ouvrier
Secrétaire
Célibataire

0% 20% 40% 60% 80% 100%

Voici les profils-colonnes de notre exemple ainsi qu’une représentation graphique de ceux-
ci.

Cadre Directeur Formateur Ouvrier Secrétaire Total


Célibataire 25,90 19,14 24,67 29,59 21,66 24,25
Divorcé 27,71 25,31 28,67 29,00 35,67 29,23
Marié 19,88 27,16 24,00 21,30 25,48 23,50
Veuf 26,51 28,40 22,67 20,12 17,20 23,01
Total 100 100 100 100 100 100

Total

Secrétaire
Célibataire
Ouvrier
Divorcé
Formateur Marié
Directeur Veuf

Cadre

0% 20% 40% 60% 80% 100%

Nous constatons donc par exemple que 15,90% des célibataires occupent une place de
directeur et que 28,40% des directeurs sont veufs.

Page 58
MK121 – Statistiques Descriptives

Exercices
1) Un gérant de centre de fitness a relevé la partie du corps que ses abonnés travaillent en priorité
en fonction du sexe.

Abdos- Bras Pecto


Jambes
Fessiers Epaule Dos
Féminin 31 38 21 27
Masculin 29 31 25 33

Donnez les proportions de :


a) Membres qui sont des femmes et qui travaillent les jambes.
b) Membres qui sont des hommes et qui travaillent les bras et les épaules.
c) Membres féminins travaillant les jambes.
d) Membres masculins travaillant les bras et les épaules.
e) Membres travaillant les jambes qui sont des femmes.
f) Membres travaillant les bras et les épaules qui sont des hommes

Indépendance entre deux variables qualitatives


Le concept d’indépendance définit statistiquement l’absence de lien. Les deux variables seront
statistiquement indépendantes si et seulement si tous les profils-lignes (ou profils-colonnes)
sont égaux. En effet, si tous les profils-lignes sont égaux ; cela signifie que la distribution des
individus selon les modalités de 𝑌 est la même, quelle que soit la modalité de 𝑋 considérée.
Autrement dit, les modalités de 𝑋 n’ont pas d’influence sur la distribution de 𝑌. Le même
raisonnement pouvant se tenir dans le cas d’égalité des profils-colonnes. Ce cas est le cas
extrême, il serait plus efficace de se doter d’une mesure de cette indépendance. Cette mesure
est appelée l’indice 𝝌𝟐 (khi-deux ou khi-carré).

Nous allons évaluer l'écart entre la situation observée (la table de contingence dont on
dispose) et l'état de non liaison entre les deux variables. Nous définissons donc des effectifs
attendus calculés de la manière suivante : 𝐴𝑖𝑗 = 𝑁𝑖∗ 𝑁∗𝑗 /𝑁
2
(𝐴 −𝑁 )
On définit ensuite l’indice khi-carré 2
𝜒 = ∑𝑝𝑖=1 ∑𝑞𝑗=1 𝑖𝑗 𝑖𝑗
𝐴𝑖𝑗

Il s’agit de la somme des carrés de tous les écarts rapportés aux effectifs attendus.

Cet indice est toujours une valeur positive et il est d’autant plus grand que la liaison entre les
deux variables est forte. Malheureusement, il dépend des dimensions de la table étudiée, ainsi
que de la taille de l'échantillon observé (ce n'est pas un coefficient intrinsèque). Nous
tenterons d’en améliorer son interprétation dans le chapitre de statistiques inférentielles.

Toutefois, afin de palier à ce problème nous pouvons calculer l’indice de Cramer de la façon
suivante :

𝜒2

𝑁 × min (𝑝 − 1; 𝑞 − 1)

Page 59
MK121 – Statistiques Descriptives

Ce coefficient est toujours compris entre 0 et 1. Une valeur 0 signifiant l’indépendance et 1 la


dépendance parfaite entre les deux variables. Il sera donné sous forme d’un pourcentage.

EXEMPLE

Tableau des observés

Cadre Directeur Formateur Ouvrier Secrétaire Total


Célibataire 43 31 37 50 34 195
Divorcé 46 41 43 49 56 235
Marié 33 44 36 36 40 189
Veuf 44 46 34 34 27 185
Total 166 162 150 169 157 804

Calcul des attendus

Cadre Directeur Formateur Ouvrier Secrétaire Total


Célibataire 40,261 39,291 36,381 40,989 38,078 195
Divorcé 48,520 47,351 43,843 49,397 45,889 235
Marié 39,022 38,082 35,261 39,728 36,907 189
Veuf 38,197 37,276 34,515 38,887 36,126 185
Total 166 162 150 169 157 804

195×162 235×169
804 804
195 162
Car :Pr(𝑐é𝑙𝑖𝑏𝑎𝑡𝑎𝑖𝑟𝑒) = 804 𝑒𝑡 Pr(𝑑𝑖𝑟𝑒𝑐𝑡𝑒𝑢𝑟) = 804 ⇒ Pr(𝑐é𝑙𝑖𝑏𝑎𝑡𝑎𝑖𝑟𝑒 𝑒𝑡 𝑑𝑖𝑟𝑒𝑐𝑡𝑒𝑢𝑟) =
162 195 162 195
× 804 et donc parmi 804 personnes, on peut s’attendre à observer 804 × 804 × 804
804
personnes célibataires et directeurs.

Calcul du 𝜒 2 par cases

Cadre Directeur Formateur Ouvrier Secrétaire Total


Célibataire 0,186 1,750 0,011 1,981 0,437 4,364
Divorcé 0,131 0,852 0,016 0,003 2,228 3,230
Marié 0,929 0,920 0,015 0,350 0,259 2,474
Veuf 0,882 2,042 0,008 0,614 2,305 5,850
Total 2,128 5,563 0,050 2,948 5,229 15,918

(39,291 − 31)2 (49,397 − 49)2


39,291 49,397

Page 60
MK121 – Statistiques Descriptives

Nous pouvons remarquer que selon les modalités de la variable 𝑌, c’est la modalité directeur
qui possède le plus fort indice, à l’opposé la modalité formateur possède un indice très faible.

Calcul de l’indice de Cramer

15,918 15,918
√ =√ = 0,08123 = 8,12%
804 × min (4 − 1; 5 − 1) 804 × 3

Nous pouvons donc conclure que l’état civil influence à raison de 8,12% la place dans
l’entreprise. Cette influence est faible.

Exercices
2) Calculez l’indice 𝜒 2 et l’indice de Cramer pour les données de l’exercice précédent. Et tirez-en les
conclusions adéquates.

3) Les élèves d’une grande implantation primaire ont dû répondre à une enquête de satisfaction
concernant les repas proposés au réfectoire (variable 𝑋) et les différents modules de jeux présents
dans la cour (variable 𝑌). Calculez l’indice 𝜒 2 et l’indice de Cramer pour cette enquête de
satisfaction. Et tirez-en les conclusions adéquates.

Réfectoire Jeux Bien Excellent Insatisfaisant Satisfaisant Très Bien


Bien 30 34 39 26 30
Excellent 33 39 29 22 32
Insatisfaisant 33 41 33 33 34
Satisfaisant 21 26 27 38 30
Très Bien 38 33 35 37 31

Page 61
MK121 – Statistiques Descriptives

3. Une variable qualitative et une variable


quantitative (discrète ou continue)
Nous allons maintenant nous intéresser à la distribution d’une variable quantitative 𝑌 en
fonction d’une variable qualitative 𝑋. Par exemple, le nombre de kilomètres parcourus par an
en fonction du type de carburant, la cote à l’examen de statistique en fonction de la section.
Il est donc possible de calculer tous les paramètres de position et de dispersion dans chacune
des modalités de 𝑋.

Moyenne et Variance
Nous calculerons la moyenne et la variance marginale (calculée sur l’ensemble des individus
de la population), ainsi que des moyennes et variances conditionnelles (calculées sur les sous-
populations définies par les modalités de la variable qualitative).

La moyenne marginale sera notée 𝜇𝑌 tandis que les moyennes conditionnelles se noteront
2
𝜇𝑌|𝑋=𝑋𝑖 . De même pour les variances 𝜎𝑌2 et 𝜎𝑌|𝑋=𝑋 𝑖
.

EXEMPLE

Voici pour notre entreprise la durée moyenne des réunions auxquelles doivent assister les
employés.

Durée en minutes Population Cadre Directeur Formateur Ouvrier Secrétaire


Nb. d'observations 804 166 162 150 169 157
Moyenne 20,31 20,42 20,25 20,15 20,94 19,72
Variance (n) 130,38 138,16 115,34 121,66 149,56 124,55
Ecart-type (n) 11,42 11,75 10,74 11,03 12,23 11,16

Nous constatons étrangement que la moyenne est la plus élevée pour les ouvriers.
2
Ici : 𝜇𝑌|𝑋=𝐶𝑎𝑑𝑟𝑒 = 20,42 𝑚𝑖𝑛𝑢𝑡𝑒𝑠 𝑒𝑡 𝜎𝑌|𝑋=𝑜𝑢𝑣𝑟𝑖𝑒𝑟 = 149,56 𝑚𝑖𝑛𝑢𝑡𝑒𝑠²

Lien entre moyenne marginale et moyennes conditionnelles


Le lien entre les deux est assez simple. En effet, la moyenne marginale est la moyenne
pondérée de toutes les moyennes conditionnelles.
𝑝
1
𝜇𝑌 = ∑ 𝑁𝑖∗ × 𝜇𝑌|𝑋=𝑋𝑖
𝑁
𝑖=1

EXEMPLE
1
(166 × 20,42 + 162 × 20,25 + 150 × 20,15 + 169 × 20,94 + 157 × 19,72) =
804
20,31 𝑚𝑖𝑛𝑢𝑡𝑒𝑠

Page 62
MK121 – Statistiques Descriptives

Lien entre variance marginale et variances conditionnelles


Cette relation est ici plus complexe. En effet, la variance marginale est la somme de la variance
intergroupe et de la variance intragroupe.
𝑝 𝑝
1 2 1 2
𝜎𝑌2 = ∑ 𝑁𝑖∗ × (𝜇𝑌|𝑋=𝑋𝑖 − 𝜇𝑌 ) + ∑ 𝑁𝑖∗ × 𝜎𝑌|𝑋=𝑋
𝑁 𝑁 𝑖
𝑖=1 𝑖=1

Le premier terme, la variance intergroupe, exprime la variation entre les groupes, chacun
étant caractérisé par sa moyenne. Il s’agit de la variance pondérée des moyennes
conditionnelles

Le deuxième terme, la variance intragroupe, exprime la variation à l’intérieur de chaque


groupe. Il s’agit de la moyenne pondérée des variances conditionnelles.

EXEMPLE
1
• 𝑉𝑎𝑟 𝑖𝑛𝑡𝑒𝑟 = (166 × (20,42 − 20,31)2 + 162 × (20,245 − 20,31)2 +
804
150 × (20,15 − 20,31)2 + 169 × (20,94 − 20,31)2 + 157 × (19,72 − 20,31)2 ) =
0,16
1
• 𝑉𝑎𝑟 𝑖𝑛𝑡𝑟𝑎 = 804 (166 × 138,16 + 162 × 115,34 + 150 × 121,66 +
169 × 149,56 + 157 × 124,55) = 130,22

La somme des deux donne bien la variance marginale : 130,38 minutes².

Nous constatons que la variance intergroupe est très faible, ce qui signifie qu’il y a peu (ou
pas) de variation d’une modalité à l’autre.

Interprétation
La variance intergroupe mesure la variabilité des groupes (modalités) entre eux. Imaginons
que chaque groupe (modalité) est représenté par un cercle, la variance intergroupe mesurera
la distance moyenne entre les cercles.

Variance intergroupe petite

Page 63
MK121 – Statistiques Descriptives

Variance intergroupe grande

La variance intragroupe mesure la variabilité moyenne des groupes (modalités). Imaginons


que chaque groupe (modalité) est représenté par un cercle, la variance intragroupe mesurera
la grandeur moyenne des cercles.

Variance intragroupe petite

Variance intragroupe grande

Page 64
MK121 – Statistiques Descriptives

Corrélation
Une variable 𝑌 est statistiquement non corrélée à la variable 𝑋, si les moyennes
conditionnelles calculées sur toutes les sous-populations définies par les modalités de 𝑋 sont
toutes égales et sont égales à la moyenne marginale.

Au contraire plus les moyennes conditionnelles varient d’une modalité à l’autre et plus nous
pourrons considérer un lien fort entre les deux variables. La mesure de cette variation entre
les moyennes conditionnelles est la variance intergroupe. Comme il n’est pas évident
d’interpréter ce résultat, nous définissons le rapport de corrélation comme étant :

𝑣𝑎𝑟𝑖𝑎𝑛𝑐𝑒 𝑖𝑛𝑡𝑒𝑟𝑔𝑟𝑜𝑢𝑝𝑒
𝜂𝑌|𝑋 = √ (𝑒𝑥𝑝𝑟𝑖𝑚é 𝑒𝑛 𝑝𝑜𝑢𝑟𝑐𝑒𝑛𝑡𝑎𝑔𝑒𝑠)
𝑣𝑎𝑟𝑖𝑎𝑛𝑐𝑒 𝑚𝑎𝑟𝑔𝑖𝑛𝑎𝑙𝑒

Plus il est élevé et plus il y a de variation de la variable 𝑌 en fonction des modalités de la


variable 𝑋.

EXEMPLE

0,16
𝜂𝑌|𝑋 = √ = 0,035 = 3,5%
130,38

La variation de la durée des réunions est très faible d’un statut à l’autre. Cette variation n’est
expliquée qu’à 3,5% par le statut.

Exercices
4) Le gérant de la salle de fitness a également relevé pour les filles et les garçons le temps (en heures
par semaine) qu’ils viennent à la salle.

Féminin Masculin
N 117 118
Moyenne 5,21 12,3
Variance 1,25 6,2

a) Calculez la moyenne et la variance marginale.


b) Calculez le rapport de corrélation et tirez-en les conclusions adéquates.

5) En fonction de leur appréciation des repas du réfectoire, le directeur de l’école a calculé les
moyennes et variances conditionnelles pour la somme (en €) dépensée par jour dans ce fameux
réfectoire.

Insatisfaisant Satisfaisant Bien Très Bien Excellent


N 174 142 159 174 155
Moyenne 0,75 0,8 1,5 2,1 3,6
Variance 0,16 0,26 0,18 0,21 0,15

a) Calculez la moyenne et la variance marginale.


b) Calculez le rapport de corrélation et tirez-en les conclusions adéquates.

Page 65
MK121 – Statistiques Descriptives

6) Voici les cotes de statistiques de la classe 1°CP S en fonction du sexe.

Féminin Masculin
10 12
13 7
14 9
8 14
6 16
4 1
7 3
14 8
12
3
5
a) Calculez les moyennes et variances marginale et conditionnelles.
b) Calculez le rapport de corrélation et tirez-en les conclusions adéquates.

Graphes
La meilleure représentation graphique possible est de représenter les boîtes à moustaches de
la variable quantitative dans chacune des modalités de la variable qualitative. Cette
représentation devant s’effectuer sur un système d’axe commun à toutes les boîtes.

Box plots
40

35
Durée des réunions (minutes)

30

25

20

15

10

0
Population Cadre Directeur Formateur Ouvrier Secrétaire

Page 66
MK121 – Statistiques Descriptives

4. Deux variables quantitatives


Quand on étudie deux variables quantitatives, on
peut se demander si leurs valeurs évoluent dans
le même sens, dans des sens opposés, ou de
manière indépendante. Autrement dit, si l’un des
caractères augmente, le second augmente-t-il
également ? Ou diminue-t-il ?

Pour répondre à cette question, on peut se baser


sur les nuages de points. Le graphique ci-contre
(source : Wikipédia) a été réalisé lors de l’étude
des éruptions d’un geyser américain (le « Old
Faithful »). Pour chaque éruption, on a examiné
deux caractères : 𝑋, la durée de l’éruption et 𝑌,
le temps de calme qui a suivi l’éruption (le délai
avant l’éruption suivante).

Le graphique tend à indiquer que plus une


éruption a duré longtemps, plus la période
de calme qui a suivi a été longue.
Autrement dit, plus 𝑋 est grand, plus 𝑌 l’est
également : les deux caractères varient
dans le même sens.

Le second graphique, à gauche, représente


l’espérance de vie des femmes (en année)
en fonction du taux de natalité (nombre de
naissances par 1000 habitants) dans divers
pays. Ici, plus 𝑋 est grand (plus le taux de
natalité est grand) et plus 𝑌 est petit (plus
l’espérance de vie des femmes est limitée).

Les deux caractères varient dans des sens


différents.

Finalement, dans le troisième nuage de


points présenté, il semble qu’il n’y ait aucun
lien évident entre les caractères 𝑋 et 𝑌
étudiés.

Page 67
MK121 – Statistiques Descriptives

La covariance
Formellement, pour étudier le sens de la variation de deux caractères 𝑋 et 𝑌, on se réfère aux
moyennes 𝜇𝑋 et 𝜇𝑌 et on observe comment les différentes données recueillies (à savoir les 𝑋𝑖
et les 𝑌𝑖 ) s’y rapportent. Plus précisément, pour chaque individu 𝑖, on examine le signe des
expressions 𝑋𝑖 − 𝜇𝑋 et 𝑌𝑖 − 𝜇𝑌 .

Si 𝑋𝑖 − 𝜇𝑋 est positif (c’est-à-dire si 𝑋𝑖 > 𝜇𝑋 ), cela signifie que l’individu a une valeur en 𝑋 plus
grande que la moyenne. Dans ce cas-là, si 𝑌𝑖 − 𝜇𝑌 est également positif (c’est-à-dire si 𝑌𝑖 >
𝜇𝑌 ), l’individu a également une valeur en 𝑌 plus grande que la moyenne : pour cet individu,
les données indiquent que 𝑋 et 𝑌 varient dans le même sens. Par contre, si 𝑌 − 𝜇𝑌 est négatif
(c’est-à-dire si 𝑌𝑖 < 𝜇𝑌 ), les données indiquent que 𝑋 et 𝑌 varient dans des sens différents. On
pourrait mener une réflexion similaire dans le cas où 𝑋𝑖 − 𝜇𝑋 est négatif.

EXEMPLE

90

80
(𝑋𝑖 − 𝜇𝑋 ) < 0
70
(𝑌𝑖 − 𝜇𝑌 ) > 0 (𝑋𝑖 − 𝜇𝑋 ) > 0

60 (𝑌𝑖 − 𝜇𝑌 ) > 0

50

40

(𝑋𝑖 − 𝜇𝑋 ) < 0
30
(𝑋𝑖 − 𝜇𝑋 ) > 0
(𝑌𝑖 − 𝜇𝑌 ) < 0
20 Point moyen (𝜇𝑋 , 𝜇𝑌 ) (𝑌𝑖 − 𝜇𝑌 ) < 0

10
0 5 10 15 20 25

On peut résumer la situation ainsi :


• Si 𝑋𝑖 − 𝜇𝑋 et 𝑌𝑖 − 𝜇𝑌 sont de même signe (tous les deux positifs ou tous les deux négatifs),
les caractères 𝑋 et 𝑌 semblent évoluer dans le même sens.
• Si 𝑋𝑖 − 𝜇𝑋 et 𝑌𝑖 − 𝜇𝑌 sont de signe différent, les caractères 𝑋 et 𝑌 semblent évoluer dans
des sens différents.

On pourrait encore condenser cette observation en étudiant le signe du produit

(𝑋𝑖 − 𝜇𝑋 ) × (𝑌𝑖 − 𝜇𝑌 ).

Page 68
MK121 – Statistiques Descriptives

De manière générale, si ce produit est positif pour un grand nombre d’individus, les caractères
𝑋 et 𝑌 évoluent dans le même sens. Et si ce produit est négatif, les caractères évoluent dans
des directions différentes.

Comme il faut considérer tous les individus de la population, on s’intéressera à la moyenne de


ces produits, c’est-à-dire à la covariance
𝑁
1
Cov𝑋𝑌 = ∑(𝑋𝑖 − 𝜇𝑋 ) × (𝑌𝑖 − 𝜇𝑌 )
𝑁
𝑖=1

Pour résumer les observations réalisées ci-dessus, on peut retenir que :


• Une covariance positive Cov𝑋𝑌 > 0 indique que les caractères 𝑋 et 𝑌 évoluent dans le
même sens ;
• Une covariance négative Cov𝑋𝑌 < 0 indique que les caractères 𝑋 et 𝑌 évoluent dans des
sens contraires ;
• Une covariance nulle/proche de 0 ne permet pas d’affirmer quoi que ce soit au sujet des
sens d’évolution de 𝑋 et de 𝑌.

Page 69
MK121 – Statistiques Descriptives

EXEMPLE

Un club de jogging relève pour ses 20 membres leur poids et leur dépense calorique sur une
longue sortie en endurance.

(𝑿𝒊 − 𝝁𝑿 ) ×
Poids 𝑿 Kcal 𝒀 𝑿𝒊 − 𝝁 𝑿 𝒀𝒊 − 𝝁𝒀 (𝑿𝒊 − 𝝁𝑿 )𝟐 (𝒀𝒊 − 𝝁𝒀 )𝟐
(𝒀𝒊 − 𝝁𝒀 )
70 1819,8 5,45 273,749 1491,9321 29,7025 74938,515
75 1758,08 10,45 212,029 2215,7031 109,2025 44956,297
75 1660,76 10,45 114,709 1198,7091 109,2025 13158,155
92 1836,48 27,45 290,429 7972,2761 753,5025 84349,004
73 1729,03 8,45 182,979 1546,1726 71,4025 33481,314
94 2129,72 29,45 583,669 17189,052 867,3025 340669,5
75 1884,94 10,45 338,889 3541,3901 109,2025 114845,75
70 1690,12 5,45 144,069 785,17605 29,7025 20755,877
88 1932,28 23,45 386,229 9057,0701 549,9025 149172,84
48 1095,32 -16,55 -450,731 7459,5981 273,9025 203158,43
47 1255,15 -17,55 -290,901 5105,3126 308,0025 84623,392
60 1371,25 -4,55 -174,801 795,34455 20,7025 30555,39
47 1243,04 -17,55 -303,011 5317,8431 308,0025 91815,666
60 1289,36 -4,55 -256,691 1167,9441 20,7025 65890,269
45 1314,94 -19,55 -231,111 4518,2201 382,2025 53412,294
53 1310,58 -11,55 -235,471 2719,6901 133,4025 55446,592
51 1390,7 -13,55 -155,351 2105,0061 183,6025 24133,933
55 1401,5 -9,55 -144,551 1380,4621 91,2025 20894,992
58 1392,22 -6,55 -153,831 1007,5931 42,9025 23663,977
55 1415,75 -9,55 -130,301 1244,3746 91,2025 16978,351
1291 30921,02 77818,869 4484,95 1546900,5

Poids Kcal

1291 30921,02
Moyenne =64,55 kg = 1546,051 Kcal
20 20

4484,95 1546900,5
Ecart-type √ = 14,97 kg √ = 278,10 Kcal
20 20

77818,869
= 3890,94 kg×Kcal
Covariance 20
Les deux variables évoluent donc dans le même sens.

Page 70
MK121 – Statistiques Descriptives

Le modèle linéaire
Si nous reprenons l’exemple précédent, nous remarquons que les points du nuage de points
sont quasiment alignés. Mathématiquement, cela revient à dire que l’équation qui lie les
valeurs de 𝑌 et de 𝑋 s’écrit 𝑌 = 𝛼𝑋 + 𝛽 pour certains réels 𝛼 et 𝛽.

Distribution des Kcal en fonction du poids

2500

2000

1500
Kcal

1000

500

0
0 10 20 30 40 50 60 70 80 90 100
Poids

Nous allons donc dans un premier temps calculer un coefficient de corrélation linéaire
permettant de mesurer le lien linéaire entre les deux variables. Dans un deuxième temps nous
donnerons l’équation d’une droite (appelée droite des moindres carrés) établissant cette
relation.

Le coefficient de corrélation linéaire


On définit le coefficient de corrélation linéaire entre les variables 𝑋 et 𝑌 par la formule
suivante : la covariance des deux variables divisée par le produit de leurs écarts-types.
Cov𝑋𝑌
𝜌𝑋𝑌 =
𝜎𝑋 𝜎𝑌
Comme les écarts-types sont des valeurs positives, le coefficient de corrélation 𝜌𝑋𝑌 a le même
signe que la covariance. On peut donc immédiatement en déduire que :
• 𝜌𝑋𝑌 > 0 signifie que les caractères 𝑋 et 𝑌 varient dans le même sens ;
• 𝜌𝑋𝑌 < 0 signifie que les caractères 𝑋 et 𝑌 varient dans des sens opposés.

Mais le coefficient de corrélation linéaire permet également d’en apprendre plus au sujet du
lien éventuel entre les variables 𝑋 et 𝑌, et plus particulièrement de voir si ce lien est de nature
linéaire.

Page 71
MK121 – Statistiques Descriptives

Voici quelques nuages de points et les valeurs des coefficients de corrélation linéaire
correspondants (source : [Link]).

𝜌𝑋𝑌 = 0.3
𝜌𝑋𝑌 = 0.7
𝜌𝑋𝑌 = 0

𝜌𝑋𝑌 = −0.7 𝜌𝑋𝑌 = −0.3


𝜌𝑋𝑌 = 0

On peut prouver que la valeur du coefficient de corrélation linéaire est toujours comprise
entre -1 et 1. Sur les nuages de points ci-dessus, on peut observer que, plus 𝜌𝑋𝑌 est proche de
1 ou de -1, plus les points se condensent en une droite. À l’inverse, plus 𝜌𝑋𝑌 est proche de 0
et plus les points sont « dispersés ».

De manière générale, on peut distinguer 5 situations possibles (dont les limites sont plus ou
moins floues) :
• Si −1 ≤ 𝜌𝑋𝑌 < −0,7, les variables 𝑌 et 𝑋 ont un lien (très) proche du linéaire et varient en
sens opposés.
• Si −0,7 ≤ 𝜌𝑋𝑌 < −0,3, les variables 𝑌 et 𝑋 varient en sens opposés mais leur lien n’est
pas clairement linéaire.
• Si −0,3 ≤ 𝜌𝑋𝑌 ≤ 0,3, on ne peut pas dire grand-chose quant à l’existence d’une relation
linéaire.
• Si 0,3 < 𝜌𝑋𝑌 ≤ 0,7, les variables 𝑌 et 𝑋 varient dans le même sens mais leur lien n’est pas
clairement linéaire.
• Si 0,7 < 𝜌𝑋𝑌 ≤ 1, les variables 𝑌 et 𝑋 varient dans le même sens et possèdent un lien (très)
proche du linéaire.

Les nuages de points suivants (source : Wikipédia) illustrent graphiquement l’interprétation


qu’on peut réaliser des diverses valeurs que 𝜌𝑋𝑌 peut prendre (entre -1 et 1).

Page 72
MK121 – Statistiques Descriptives

EXEMPLE
3890,94
Dans notre exemple précédent, nous avons 𝜌𝑋𝑌 = 14,97×278,10 = 0,9342. Nous pouvons
parler d’un lien linéaire fort entre le poids et le nombre de calories dépensées.

REMARQUES

Tout d’abord, le coefficient de corrélation linéaire n’a pas de lien direct avec la pente de la
droite liant 𝑋 et 𝑌 : il indique seulement si les divers points (𝑋𝑖 , 𝑌𝑖 ) du nuage de points sont
« bien alignés », mais pas vraiment dans quelle direction. Le seul indicateur est le signe de
𝜌𝑋𝑌 , une valeur proche de 1 indiquant une pente positive (droite qui « monte ») et une valeur
proche de -1 indiquant une pente négative (droite qui « descend »). Mais, dans tous les cas, si
le nuage de points forme une droite quasi-parfaite, le coefficient de corrélation sera proche
de -1 ou de 1, quelle que soit la pente de la droite.

Finalement, il faut rester prudent dans le cas où le coefficient de corrélation linéaire est proche
de 0. Cela ne signifie pas qu’il n’y a pas de lien entre 𝑋 et 𝑌 mais seulement qu’il n’y a a pas
de lien linéaire apparent. Les liens autres que linéaires ne sont pas repérés par le coefficient
de corrélation linéaire, comme le montrent les exemples suivants, où 𝜌𝑋𝑌 = 0.

La droite des moindres carrés


Si le coefficient de corrélation linéaire est proche de 1 en valeur absolue (c’est-à-dire s’il est
proche de -1 ou de 1), on peut supposer qu’il existe un lien linéaire entre les variables 𝑋 et 𝑌.
Mathématiquement, cela signifie qu’il est possible de décrire ce lien sous la forme d’une
équation de droite 𝑌 = 𝛼𝑋 + 𝛽.

Comme il est très rare que les points du nuage de points forment une droite parfaite (c’est-à-
dire qu’ils soient parfaitement alignés), le problème revient à trouver la droite qui « colle au
mieux » à ces points. La notion de « coller au mieux » est vague et pourrait être définie de
plusieurs manières. La plupart du temps, on utilise la définition dite « des moindres carrés ».

Si on dispose d’une droite censée approximer un nuage de points, on peut mesurer sa


précision (sa pertinence) en examinant les écarts entre les points et la droite. Plus
précisément, pour chacun des points (𝑋𝑖 , 𝑌𝑖 ), on va observer la différence entre 𝑌𝑖 , la véritable
valeur, et l’approximation que la droite donne pour 𝑋𝑖 (la valeur prédite 𝑌 ̂𝑖 = 𝑓(𝑋𝑖 )).

Page 73
MK121 – Statistiques Descriptives

Graphiquement, cela revient à mesurer, pour chaque point, la longueur des segments (le
résidu) présentés en rouge sur la représentation ci-dessous.

Dans la méthode des moindres carrés, on va


jauger de la pertinence d’une droite donnée en
calculant la somme des carrés de tous ces
écarts. Le but du jeu est évidemment de
trouver une droite pour laquelle cette somme
est la plus petite possible : plus la somme est
petite, plus les écarts sont petits et mieux la
droite « colle » aux points. Cette définition tire
son nom du fait qu’on va tenter de minimiser,
d’amoindrir la somme des carrés des écarts.

L’étude des moindres carrés aboutit à la


formule suivante, donnant l’équation de la « droite des moindres carrés », aussi appelé droite
de régression linéaire.
𝐶𝑜𝑣𝑋𝑌
𝑌 = 𝛼𝑋 + 𝛽 𝑜ù 𝛼 = 𝑒𝑡 𝛽 = 𝜇𝑌 − 𝛼 𝜇𝑋
𝜎𝑋2

La définition de beta nous montre que cette droite passera par le point moyen (𝜇𝑋 , 𝜇𝑌 ).

EXEMPLE
3890,94
Pour nos joggeurs, 𝛼= = 17,3511 𝑒𝑡 𝛽 = 1546,041 − 17,3511 × 64,55 =
14,972
426,037. La droite de régression linéaire expliquant les calories dépensées en fonction du
poids est donc 𝑌 = 17,3511𝑋 + 426,037.

Exercices
7) Pendant dix années, un marchand de parapluies a noté le nombre de jours de pluie pendant l’été
ainsi que le nombre de parapluies vendus pendant cette même période. Il a rassemblé les résultats
obtenus dans le tableau suivant.

Année 2005 2006 2007 2008 2009 2010 2011 2012 2013 2014
Jours de pluie 42 26 16 12 25 35 6 36 21 13
Ventes 325 252 150 118 213 337 55 278 178 132

a) Calculez le nombre de jours de pluie moyen sur ces 10 étés.


b) Calculez le nombre de parapluies vendus en moyenne au cours de ces 10 étés.
c) Calculez les variances et écarts-types de ces distributions.
d) Calculez la covariance et le coefficient de corrélation et interprétez-les.
e) Déterminez l’équation de la droite de régression linéaire.
f) Calculez le coefficient de détermination.
g) Estimez le nombre de ventes qui seront réalisées au cours d’un été comportant exactement
30 jours de pluie. Est-ce une bonne approximation ?

Page 74
MK121 – Statistiques Descriptives

8) Afin de comparer l’efficacité de deux aliments pour bovins appelés X et Y, on a nourri 8 vaches
avec du X pendant un mois puis avec du Y pendant 1 mois et on a mesuré leur production
quotidienne moyenne de lait (en kg). Voici les résultats obtenus.

Vache 1 2 3 4 5 6 7 8
Avec X 27,6 23,4 25,2 28,2 28,8 25,8 27,0 27,0
Avec Y 28,8 25,6 26,4 28 31,2 27,2 28,8 28

a) Calculez les moyennes, variances et écarts-types des deux caractères.


b) Calculez la covariance et le coefficient de corrélation.
c) Les valeurs calculées au point b permettent-elles de conclure que le produit Y est plus efficace
que le produit X ?
d) Calculez l’équation de la droite de régression.
e) D’après cette équation, combien pourrait produire une vache actuellement nourrie avec du
produit X et donnant 30 kg de lait par jour si on utilisait plutôt du produit Y ?

9) Une étude sur la quantité de déchets ménagers produits par les habitants d’une commune
wallonne a donné les résultats suivants, exprimés en fonction du nombre de membres composant
les ménages.

Nb membres 1 2 3 4 5 6 7
Déchets (kg/an) 123 152 178 209 255 300 349

a) Écrivez l’équation de la droite de régression linéaire exprimant la quantité de déchets produits


par année en fonction de la composition du ménage.
b) En vous basant sur ce modèle, estimez la quantité de déchets produit par un ménage de
9 personnes.
c) Le modèle linéaire est-il pertinent ? Justifiez votre réponse.

10) En analysant la comptabilité nationale d’un petit pays européen, on observe les dépenses de
consommation et le revenu national à prix courants exprimés en milliards d’Euros. L’étude porte
sur 10 années.

Revenu national 88 92 96 103 111 119 126 129 132 134


Consommation 64 66 70 72 78 81 85 86 88 90

a) Calculez l’équation de la droite de régression.


b) Estimez la consommation pour la 11e année sachant que le revenu national sera de 140
milliards d’Euros.
c) Est-ce une bonne approximation ?

Page 75
MK121 – Statistiques Descriptives

Les autres modèles


Le modèle linéaire n’est pas le seul. En effet, celui-ci n’a de sens que si la valeur de 𝜌𝑋𝑌 est
proche de 1 ou de -1. D’autres modèles sont possibles :

• Le modèle exponentielle 𝑌 = 𝛽 𝛼 𝑋
• Le modèle allotropique 𝑌 = 𝛽 𝑋 𝛼
• En général, 𝑌 = 𝑓(𝑋)

Des modèles multiples peuvent également exister :

• 𝑌 = 𝛼1 𝑋 + 𝛼2 𝑍 + 𝛼3 𝑈 + ⋯ … . . +𝛽
• 𝑌 = 𝛽 𝑋 𝛼1 𝑍 𝛼2 𝑈 𝛼3 … ….
• En général, 𝑌 = 𝑓(𝑋, 𝑍, 𝑈, … )

L’efficacité (ou pertinence) de ce type de modèle se calculera via le coefficient de


détermination.

Le coefficient de détermination
Le coefficient de détermination (𝝆𝟐 ) va nous permettre de mesurer l’efficacité d’un modèle.
Ce coefficient va calculer le pourcentage de la variance de 𝑌 expliquée par 𝑋, selon notre
modèle. Il est important de noter que ce coefficient peut se calculer pour tous les modèles
possibles, pas uniquement le linéaire.

Pour ce faire, nous devons d’abord définir deux éléments : les valeurs prédites et les résidus.

Supposons un modèle : 𝑌 = 𝑓(𝑋)

Les valeurs 𝑌̂𝑖 = 𝑓(𝑋𝑖 ) sont appelées les valeurs prédites. Les valeurs 𝐸𝑖 = 𝑌𝑖 − 𝑌
̂𝑖 sont
appelées les résidus.

Le coefficient de détermination vaut :

1 𝑁 2
∑𝑖=1 𝐸𝑖
𝜌2 = 1 − 𝑁
𝜎𝑌2

Il se calcule donc comme 100% moins le rapport entre la moyenne des résidus au carré et la
variance de 𝑌.

Celui-ci s’exprime en pourcentage et est toujours compris entre 0 et 1. Il permet d’exprimer


le pouvoir prédictif du modèle, plus il est proche de 1 plus ce pouvoir est fort. Un 𝜌2 de 0,8
veut dire que 80% de la variabilité de 𝑌 est expliquée par la variable 𝑋.

Dans le cas de la régression linéaire, il se calcule simplement en élevant le coefficient


de corrélation linéaire au carré.

Page 76
MK121 – Statistiques Descriptives

EXEMPLE
𝟐
Poids 𝑿 Kcal 𝒀 𝒀̂𝒊 𝑬𝟐𝒊 = (𝒀𝒊 − 𝒀̂𝒊 )
70 1819,8 1640,61456 32107,4221
75 1758,08 1727,37012 943,096814
75 1660,76 1727,37012 4436,9079
92 1836,48 2022,33902 34543,5752
73 1729,03 1692,66789 1322,20268
94 2129,72 2057,04124 5282,20166
75 1884,94 1727,37012 24828,2675
70 1690,12 1640,61456 2450,78864
88 1932,28 1952,93457 426,611361
48 1095,32 1258,8901 26755,1774
47 1255,15 1241,53899 185,259664
60 1371,25 1467,10344 9187,88219
47 1243,04 1241,53899 2,25303885
60 1289,36 1467,10344 31592,7309
45 1314,94 1206,83676 11686,3097
53 1310,58 1345,64566 1229,6004
51 1390,7 1310,94343 6361,10971
55 1401,5 1380,34788 447,412095
58 1392,22 1432,40122 1614,53024
55 1415,75 1380,34788 1253,30996
1291 30921,02 196656,649
1
×196656,649
2 20
Dès lors, 𝜌 = 1 − = 0,8728. Selon ce modèle, 87,28% de la variabilité des
278,102
kilocalories dépensées est expliquée par le poids du coureur. On constate que dans ce cas la
valeur trouvée est bien le carré de 0,9342 coefficient de corrélation linéaire calculé
précédemment.

Page 77
MK121 – Statistiques Descriptives

EXEMPLE

La valeur acquise pour un placement à un taux fixe de 2% dépend évidemment de la somme


placée et de la durée (en années) du placement. Nous avons relevé cette valeur acquise pour
4 capitaux différents, en tenant compte des frais appliqués tout au long du placement. Le
modèle proposé est 𝐶𝑎𝑝𝑖𝑡𝑎𝑙 𝑎𝑐𝑞𝑢𝑖𝑠 = 𝐶𝑎𝑝𝑖𝑡𝑎𝑙 𝑑𝑒 𝑏𝑎𝑠𝑒 × (1,02)𝐷𝑢𝑟é𝑒 . Calculons le
coefficient de détermination pour ce modèle1.

Capital de Capital
Durée Prédiction Résidus Résidus²
base acquis

1000 1 1005 1020,00 -15,00 225,00


2000 3 2080 2122,42 -42,42 1799,12
2500 2 2530 2601,00 -71,00 5041,00
5000 6 5500 5630,81 -130,81 17111,80
24176,92

La moyenne et la variance du capital acquis sont de 2778,75€ et de 11030872,27€². Le


1
×24176,92
coefficient de détermination est : 𝜌2 = 1 − 11030872,27
4
= 99,95%. Selon ce modèle, le capital
placé et la durée expliquent donc 99,95% de la variabilité du capital acquis.

Exercices
11) Marcel s’inquiète du rendement de sa chaudière. Il a dès lors effectué 5 mesures de température
(°C) de son eau en fonction du temps (minutes) pendant lequel il a laissé couler son robinet. Voici
les données :

Temps 1 2 3 4 5
Température 2,5 5 10 18 40

Le modèle proposé pour exprimer la température en fonction du temps est :

𝑇𝑒𝑚𝑝é𝑟𝑎𝑡𝑢𝑟𝑒 = 1,2 × 2𝑡𝑒𝑚𝑝𝑠 . Ce modèle peut-il être jugé comme pertinent ?

12) Lors d’un placement, les banques exigent des frais de gestion. On a relevé pour 5 banques, le taux
en application et le capital acquis au bout de 5 années de placement pour un capital de base de
1000€. Voici les données :

Taux Capital
1 1120
2 1100
3 1140
4 1200
5 1260

Le modèle proposé pour exprimer le capital acquis en fonction du taux est :

1 Cette formule sera explicitée en Mathématiques Financières.

Page 78
MK121 – Statistiques Descriptives

𝑇𝑎𝑢𝑥 5
𝐶𝑎𝑝𝑖𝑡𝑎𝑙 = 1000 × (1 + ) . Ce modèle peut-il être jugé comme pertinent ?
100

13) Nos 20 joggeurs ont également relevé leur fréquence cardiaque moyenne lors de leur effort. Voici
les données :

Poids FC Moy
70 185
75 190
75 188
92 230
73 185
94 225
75 195
70 180
88 220
48 150
47 140
60 165
47 145
60 165
45 140
53 150
51 149
55 150
58 155
55 150
a) Calculez le coefficient de corrélation linéaire et l’équation de la droite de régression linéaire
exprimant la fréquence cardiaque en fonction du poids.
b) Calculez le coefficient de détermination.
c) Un programme informatique propose le modèle suivant : 𝑌 = 87,67 × 1,01 𝑋 . Ce modèle
est-il plus performant que celui que vous avez trouvé au point a)

14) Une entreprise informatique a relevé chez dix de ses clients le nombre de pannes réseau (sur un
mois) et le nombre d’appareils installés. Voici les résultats de leur étude.

Nb pannes 2 4 6 7 10 11 14 15 20 21
Nb d’appareils 24 31 40 39 55 53 61 65 78 64

a) Donnez un modèle linéaire estimant le nombre de pannes en fonction du nombre d’appareils.


b) Donnez une approximation du nombre de pannes auxquels il faut s’attendre pour une
installation de 100 appareils.
c) Cette approximation est-elle judicieuse ? Justifiez.
d) Un autre modèle propose 𝑁𝑏 𝑝𝑎𝑛𝑛𝑒𝑠 = 1,0551 × 1,0428𝑁𝑏 𝑎𝑝𝑝𝑎𝑟𝑒𝑖𝑙𝑠 . Ce modèle est-il plus
efficace que le linéaire trouvé ?
e) Si oui, donnez une nouvelle approximation pour le point b).

Page 79
MK121 – Statistiques Descriptives

CHAPITRE 4 : L’ESTIMATION DES


PARAMÈTRES
Compte tenu de la grande taille des populations et de la difficulté, voire de l’impossibilité,
d’accéder à tous les individus composant cette population, on doit donc se contenter de
résultats obtenus sur une partie de cette population, c’est-à-dire un échantillon. Les résultats
sont-ils identiques à ceux que l’on aurait enregistrés sur la population ? Probablement pas,
mais nous pouvons espérer qu’ils soient proches des valeurs réelles inconnues sur la
population.

Estimer consiste donc, à partir des observations effectuées sur un échantillon, à attribuer des
valeurs numériques aux différents paramètres de la population dont est extrait l’échantillon.

1. Les estimateurs
Ne pouvant pas calculer la vraie valeur du paramètre sur la population, nous devons donc
construire un outil permettant d’estimer au mieux ce paramètre à partir de l’échantillon. C’est
ce que nous appellerons un estimateur.

L’estimateur prend une valeur empirique sur l’échantillon, valeur qui n’est qu’une estimation
de la vraie valeur sur la population. De plus cette valeur dépendra du choix de l’échantillon.
Avec un autre échantillon, l’estimateur prendrait une autre valeur. L’estimateur suivra une
certaine loi de probabilité (que nous aborderons dans la suite de ce cours). La distribution des
différentes valeurs prises par cet estimateur en fonction du choix de l’échantillon est ce que
l’on appelle la distribution d’échantillonnage.

Un estimateur de qualité doit vérifier trois propriétés :

• Il est sans biais.


• Il est efficace.
• Il est convergent.

Un estimateur est dit sans biais, si la moyenne de toutes les valeurs calculées sur tous les
échantillons de même taille est égale à la vraie valeur.

Un estimateur est efficace, si sa dispersion autour de la vraie valeur est faible.

Un estimateur est convergent, s’il donne une valeur qui se rapproche de la vraie valeur à
mesure que la taille de l’échantillon croît.

Page 80
MK121 – Statistiques Descriptives

2. L’estimation ponctuelle
La valeur numérique prise par l’estimateur sur l’échantillon est ce que nous appellerons
l’estimation ponctuelle. Au vu des propriétés, nous devons choisir le meilleur estimateur
possible. Voici un tableau reprenant pour chaque paramètre l’estimateur correspondant. Par
principe, les données de l’échantillon seront notées en minuscule et les estimateurs seront
notés en lettre romaine et plus en lettre grecque. Dans le cas où le paramètre n’avait pas de
notation précise, il en est de même pour l’estimateur. Certains estimateurs se calculent de
manière identique aux paramètres sur la population, mais ce ne sera pas le cas de tous.

Paramètre Population Echantillon Estimateur

Taille 𝑁 𝑛

Proportion 𝜋𝑋 𝑓𝑋

𝑛
1
Moyenne 𝜇𝑋 𝑥̅ = ∑ 𝑥𝑖
𝑛
𝑖=1
𝑛
1
Variance 𝜎𝑋2 𝑠𝑋2 = ∑(𝑥𝑖 − 𝑥̅ )2
𝑛−1
𝑖=1

Ecart-type √𝜎𝑋2 𝑠𝑋 = √𝑠𝑋2

𝑠𝑋
Coefficient de variation 𝐶𝑉 𝐶𝑉 =
𝑥̅
𝑝 𝑞 2
2
(𝑛𝑖𝑗 − 𝑎𝑖𝑗 )
Indice 𝜒 𝜒2 𝑐2 = ∑ ∑
𝑎𝑖𝑗
𝑖=1 𝑗=1

𝑐2
Indice de Cramer Indice de Cramer √
𝑛 × min (𝑝 − 1; 𝑞 − 1)

Moyenne conditionnelle 𝜇𝑌|𝑋=𝑋𝑖 𝑦̅𝑌|𝑋=𝑥𝑖

2 2
Variance conditionnelle 𝜎𝑌|𝑋=𝑋 𝑖
𝑠𝑌|𝑋=𝑥 𝑖

𝑝
1
Variance intergroupe Var inter ∑ 𝑛𝑖 × (𝑦̅𝑋=𝑥𝑖 − 𝑦̅)2
𝑛−1
𝑖=1

Page 81
MK121 – Statistiques Descriptives

𝑝
1 2
Variance intragroupe Var intra ∑(𝑛𝑖 − 1) × 𝑠𝑌|𝑋=𝑥
𝑛−1 𝑖
𝑖=1

𝑣𝑎𝑟 𝑖𝑛𝑡𝑒𝑟
Rapport de corrélation 𝜂𝑌|𝑋 ê𝑌|𝑋 = √
𝑣𝑎𝑟 𝑚𝑎𝑟𝑔𝑖𝑛𝑎𝑙𝑒
𝑛
1
Covariance 𝐶𝑜𝑣𝑋𝑌 𝐶𝑜𝑣(𝑋, 𝑌) = ∑(𝑥𝑖 − 𝑥̅ ) × (𝑦𝑖 − 𝑦̅)
𝑛−1
𝑖=1

Coefficient de 𝐶𝑜𝑣(𝑋, 𝑌)
𝜌𝑋𝑌 𝑟=
corrélation linéaire 𝑠𝑋 × 𝑠𝑌
1
Coefficient de ∑𝑛𝑖=1 𝑒𝑖2
𝜌 2 2
𝑅 =1− 𝑛 − 1
détermination 𝑠𝑌2

Pente de la droite de 𝐶𝑜𝑣(𝑋, 𝑌)


𝛼 𝑎=
régression linéaire 𝑠𝑋2

Ordonnée à l’origine de
la droite de régression 𝛽 𝑏 = 𝑦̅ − 𝑎 × 𝑥̅
linéaire

La grande majorité des estimateurs se calcule de la même manière que les paramètres, il y a
juste un changement de notation. Attention le respect de cette notation est très important, il
nous permet de savoir où l’on se trouve (population ou échantillon). Les changements de
méthode apparaissent sur tous les estimateurs liés à la variance. En effet, la division ne
s’effectue pas par la taille de l’échantillon, mais par la taille de celui-ci diminuée d’un.

En pratique, nous travaillerons toujours sur un échantillon. Il faudra donc utiliser ces
estimateurs.

Page 82
MK121 – Statistiques Descriptives

Exercices
1) Un échantillon de 10 étudiants de 1°CP et 1°MK a été prélevé. Sur cet échantillon, nous avons
observé la cote en statistiques et en langue.

Statistiques Langue
5 10
4 6
16 15
12 13
4 2
8 10
6 6
14 9
11 12
10 10

a) Estimez la cote moyenne dans les deux matières.


b) Estimez la variance, l’écart-type et le coefficient de variation pour les deux matières.
c) Estimez la covariance et le coefficient de corrélation linéaire.
d) Estimez l’équation de la droite de régression linéaire.

2) Nous avons également observé sur un échantillon de 7 étudiants en 1°CP et 6 étudiants en 1°MK
la cote en statistique.

1°CP 5 4 16 12 4 8 6
1°MK 14 11 10 16 4 1

a) Estimez les moyennes, variances et écarts-types conditionnelles.


b) Estimez les variances inter et intra groupe, ainsi que le rapport de corrélation.

3. L’estimation par intervalle de confiance (95%)


Nous pouvons espérer que l’estimation ponctuelle vue ci-dessus soit raisonnablement proche
de la vraie valeur du paramètre sur la population. Nous pouvons même préciser cette
proximité en construisant un intervalle, appelé intervalle de confiance, dans lequel il y a une
probabilité (95%) de trouver la vraie valeur.

L’intervalle de confiance
Un intervalle de confiance est une fourchette de valeur (borne inférieure et borne supérieure)
qui possède une certaine probabilité, appelée niveau de confiance, de contenir la vraie valeur.
Nous travaillerons cette année avec un niveau de confiance de 95%.

Si l’intervalle de confiance pour un paramètre 𝜃 est [𝑎 ; 𝑏], alors on peut dire

𝑃(𝑎 ≤ 𝜃 ≤ 𝑏) = 95%

Page 83
MK121 – Statistiques Descriptives

Il y a 95% de chance que le paramètre dans notre population cible soit compris entre 𝑎 et 𝑏.

EXEMPLE 1

Un échantillon de 5000 belges nous permet de trouver une estimation ponctuelle du salaire
moyen à 1800€. L’intervalle de confiance construit à 95% de confiance donnera une
fourchette comprise entre 1600€ et 2000€. Nous pouvons donc croire avec 95% de certitude
que le salaire moyen la population belge se trouve dans cette fourchette.

EXEMPLE 2

Ce même échantillon nous apprend que 13% des personnes vivent en dessous du seuil de
pauvreté. Un intervalle de confiance construit à 95% de cconfiance donnera une fourchette
comprise entre 12,06% et 13,94%. Nous pouvons donc croire avec 95% de certitude que dans
la population belge la proportion de personnes sous le seuil de pauvreté se trouve dans cette
fourchette.

La marge d’erreur
Pour les paramètres de moyenne et de proportion, la construction de l’intervalle est toujours
symétrique par rapport à l’estimation.

• La borne inférieure est obtenue en déduisant une certaine quantité à l’estimation.


• La borne supérieure est obtenue en ajoutant cette même quantité à l’estimation.

Cette quantité est appelée la marge d’erreur.

EXEMPLES

Les marges d’erreurs pour nos deux exemples sont respectivement de 200€ et de 0,94%.

Page 84
MK121 – Statistiques Descriptives

Dans le cadre d’une proportion, une marge d’erreur supérieure à 3% est jugée non acceptable.
L’estimation ponctuelle n’est donc pas suffisamment proche de la vraie valeur.

Dans le cadre d’une moyenne, il n’y a pas de règle précise établie. Toutefois, il faut toujours
relativiser celle-ci. Une marge d’erreur de valeur 100 pour une estimation ponctuelle de 500
est grande, alors que cette même marge d’erreur pour une estimation ponctuelle de 50000
est petite.

Exercices
3) Pour les intervalles de confiance suivants (95%) donnez la marge d’erreur et l’estimation
ponctuelle observée sur l’échantillon.

a) [15,2% ; 16,8%]
b) [52,42€ ; 84,16€]
c) [24,21% ; 27,64%]
d) [152,64 mètres ; 174,12 mètres]

Page 85
MK121 – Statistiques Descriptives

Calcul de la marge d’erreur pour une proportion à 95% de


confiance
La marge d’erreur dépendra de :

• La taille de l’échantillon
• L’estimation ponctuelle

Pour un confiance de 95%, elle se calculera de la façon suivante :

√𝑓 × (1 − 𝑓)
1,96 ×
√𝑛

REMARQUE

La constante de 1,96 est liée au niveau de confiance de 95%

EXEMPLE

Une étude a relevé pour un échantillon de 1000 belges le degré d’intérêt pour un projet de
fontaine à eau dans une école, en voici le tri à plat.

Intérêt Effectif Fréquence Marge d'erreur


Intéressé 240 24% 2,65%
Neutre 550 55% 3,08%
Pas intéressé 210 21% 2,52%

√0,55 × (1 − 0,55)
1,96 ×
√1000

Observons le tableau suivant, reprenant la valeur de la marge d’erreur pour différentes


estimations et tailles d’échantillon.

Marge d'erreur Marge d'erreur Marge d'erreur


Estimation
n=100 n=500 n=1000
10% 5,88% 2,63% 1,86%
20% 7,84% 3,51% 2,48%
30% 8,98% 4,02% 2,84%
40% 9,60% 4,29% 3,04%
50% 9,80% 4,38% 3,10%
60% 9,60% 4,29% 3,04%
70% 8,98% 4,02% 2,84%
80% 7,84% 3,51% 2,48%
90% 5,88% 2,63% 1,86%

Page 86
MK121 – Statistiques Descriptives

Nous constatons que la marge d’erreur diminue au plus la taille de l’échantillon augmente.
Et qu’elle est symétrique par rapport à une estimation de 50%. C’est en effet, pour cette
estimation de 50% qu’elle sera maximale.

Exercices
4) Calculer l’intervalle de confiance (95%) pour les données suivantes d’un échantillon :

a) Une estimation de 24,2% et un échantillon de taille 142.


b) Une estimation de 81,7% et un échantillon de taille 423.

5) Combien de personnes faudrait-il interroger pour que la marge d’erreur (95%) maximale soit de
2,5% ?

Page 87
MK121 – Statistiques Descriptives

Calcul de la marge d’erreur pour une moyenne à 95% de


confiance
La marge d’erreur dépendra de :

• La taille de l’échantillon
• L’estimation ponctuelle de la moyenne et de l’écart-type

Pour un confiance de 95%, elle se calculera de la façon suivante :


𝑠
𝑡𝑛 ×
√𝑛

Contrairement à la proportion, la constante dépendant du niveau de confiance changera en


fonction de la taille de l’échantillon. Le petit tableau suivant nous donne quelques valeurs
possibles.
n 𝒕𝒏
20 2,093
40 2,023
60 2,001
80 1,990
100 1,984
120 1,980
140 1,977
160 1,975
180 1,973
200 1,972
220 1,971
240 1,970
260 1,969
280 1,969
300 1,968
320 1,967
340 1,967
360 1,967
380 1,966
400 1,966
420 1,966
440 1,965
460 1,965
480 1,965
500 1,965
520 1,965
540 1,964
560 1,964
580 1,964
600 1,964

Page 88
MK121 – Statistiques Descriptives

REMARQUES

Au plus la taille de l’échantillon augmente, au plus la constante se rapproche de la valeur de


1,96.
Au plus la taille de l’échantillon augmente, au plus la marge d’erreur diminuera.
Au plus les valeurs seront dispersées (écart-type grand), au plus la marge d’erreur sera grande.

Exercices
6) Calculer l’intervalle de confiance (95%) pour les données suivantes d’un échantillon :

a) Une moyenne et un écart-type estimés de respectivement 150,54€ et 12,16€ et un


échantillon de taille 140.
b) Une moyenne et un écart-type estimés de respectivement 1240,25 minutes et 512,23
minutes et un échantillon de taille 540.

Page 89
MK121 – Statistiques Descriptives

CHAPITRE 5 : COMMUNIQUER LES


RÉSULTATS
Dans les chapitres précédents, nous avons appris à calculer, à représenter et à interpréter
divers paramètres et graphiques. Toutefois, si nous nous plaçons dans une optique de
communication des résultats, il reste encore beaucoup de questions en suspens :

• Comment communiquer au mieux ceux-ci ?


• Quel(s) paramètre(s) faut-il calculer et exposer afin de résumé au mieux les données ?
• Quel(s) graphique(s) est le plus adéquat au vue des résultats ?
• Quel(s) paramètre(s) ou graphique(s) sera le plus facilement compréhensible pour le
public vers lequel nous nous adressons ?
• Quel(s) paramètre(s) choisir en vue de l’établissement d’un plan marketing ?
• Etc.

Toutes ces questions n’ont malheureusement pas de réponse unique. Celle-ci peut même être
très subjective. Nous allons cependant essayer d’y répondre au mieux en nous basant sur tout
ce que nous avons appris dans cette première partie du cours.

Ce chapitre est donc uniquement composé d’exercices de réflexion sous forme de réponses à
choix multiple.

Exercices
1) Quels paramètres utiliser pour résumer au mieux les observations récoltées à la question : « Quelle
marque de cigarettes fumez-vous ? »

a) Moyenne et variance
b) Médiane et écart-type
c) Mode et écart interquartile
d) Mode et fréquence
e) Médiane et coefficient de variation
f) Toutes les propositions sont correctes
g) Aucune proposition n’est correcte

2) Quels paramètres utiliser pour résumer au mieux les observations récoltées à la question :
« Comment vous sentez-vous ce matin ? » Extrêmement mal, très mal, mal, moyennement bien,
bien, très bien, extrêmement bien.

a) Moyenne et variance
b) Mode et fréquence cumulée
c) Médiane et écart-type
d) Mode et écart interquartile
e) Médiane et coefficient de variation
f) Toutes les propositions sont correctes
g) Aucune proposition n’est correcte

Page 90
MK121 – Statistiques Descriptives

3) Quels graphiques utiliser pour résumer au mieux les observations récoltées à la question : « Quel
score espérez-vous obtenir à une épreuve de mémoire sachant que les scores vont de 0 à 200? »

a) Histogramme ou boxplot
b) Diagramme en barre ou boxplot
c) Diagramme en tartes ou boxplot
d) Fonction de répartition ou diagramme en barre
e) Histogramme ou Diagramme en tarte
f) Toutes les propositions sont correctes
g) Aucune proposition n’est correcte

4) Quels paramètres utiliser pour résumer au mieux les observations récoltées à la question : « Quel
est votre budget pour une nouvelle voiture? » Sachant que notre population compte 3 personnes
désireuses d’acheter une Rolls Royce.

a) Moyenne et variance
b) Mode et fréquence cumulée
c) Médiane et écart interquartile
d) Mode et écart-type
e) Médiane et coefficient de variation
f) Toutes les propositions sont correctes
g) Aucune proposition n’est correcte

5) Un thérapeute de couples interroge ceux-ci afin de connaître le temps qu’ils consacrent à une
activité commune. Les propositions de réponses étant :

• 0 heure par semaine


• Entre 0 et 2 heures par semaine
• Entre 2 et 4 heures par semaine
• Entre 4 et 6 heures par semaine
• Plus de 6 heures par semaines

Quels paramètres le thérapeute doit utiliser pour communiquer au mieux les observations récoltées ?

a) Moyenne et médiane
b) Moyenne et écart-type
c) Mode et écart interquartile
d) Variance et coefficient de variation
e) Premier et troisième quartile
f) Toutes les propositions sont correctes
g) Aucune proposition n’est correcte

6) Un professeur de français aimerait tester le vocabulaire des élèves en décrochage scolaire de son
établissement. Il effectue un test dont le score sera une valeur entre 0 et 100. Il s’attend
évidemment à obtenir des notes basses et uniformes. Quels paramètres le professeur doit utiliser
pour communiquer au mieux les observations récoltées ?

a) Coefficient de variation et moyenne


b) Moyenne et écart-type
c) Médiane et étendue
d) Minimum et maximum
e) Toutes les propositions sont correctes
f) Aucune proposition n’est correcte

Page 91
MK121 – Statistiques Descriptives

7) Afin de pouvoir informer au mieux les demandeurs d’emploi, le Forem souhaite identifier les
secteurs portant actuellement le plus grand nombre d’offres d’emploi. Après récolte des données,
les différentes offres sont triées en 10 grands secteurs d’activités. Quels paramètres ou graphiques
le Forem doit utiliser pour communiquer au mieux les observations récoltées ?

a) Moyenne et écart-type
b) Histogramme et moyenne
c) Mode et médiane
d) Boxplot et variance
e) Toutes les propositions sont correctes
f) Aucune proposition n’est correcte

8) Une personne chargée d’études de marché analyse les préférences des personnes en termes de
parfums. Elle développe donc une enquête dans laquelle les personnes interrogées évalueront sur
une échelle de 1 à 10 le parfum concerné. Elle estime qu’un score supérieur ou égal à 8 témoigne
d’une appréciation acceptable du produit. Quels paramètres ou graphiques doit-elle utiliser pour
communiquer au mieux les observations récoltées ?

a) Diagramme en barres et tableau de fréquence


b) Variance et coefficient de variation
c) Moyenne et mode
d) Etendue et histogramme
e) Toutes les propositions sont correctes
f) Aucune proposition n’est correcte

9) Une secrétaire doit encoder les fiches descriptives de chacun des employés d’une entreprise. Vu
le grand nombre d’encodage, elle craint des erreurs d’encodage dues à la fatigue. Quels
paramètres ou graphiques peut-elle utiliser afin de se rendre compte de la présence éventuelle de
valeurs extrêmes au niveau de l’âge dues à une erreur d’encodage.

a) Histogramme et médiane
b) Ecart interquartile et mode
c) Moyenne et diagramme en tarte
d) Boxplot et étendue
e) Toutes les propositions sont correctes
f) Aucune proposition n’est correcte

10) Un psychiatre a demandé à l’un de ses patients de noter chaque jour son état émotionnel sur
échelle allant de -5 à 5. Lors de l’analyse des résultats, il se demande si le patient a utilisé les valeurs
possibles de son échelle. Quels paramètres ou graphiques peut lui donner cette information ?

a) Mode et étendue
b) Diagramme en barres et tableau de fréquence
c) Moyenne et écart-type
d) Boxplot et médiane
e) Toutes les propositions sont correctes
f) Aucune proposition n’est correcte

Page 92
MK121 – Statistiques Descriptives

11) Un directeur d’établissement secondaire aimerait connaître parmi ses rhétoriciens, la proportion
de ceux-ci qui ne continueront pas d’étude, celle de ceux qui se dirigeront vers une Haute Ecole et
la proportion de ceux qui se dirigeront vers l’Université. Quels paramètres ou graphiques doit-il
utiliser afin de visualiser au mieux les résultats ?

a) Coefficient de variation et mode


b) Moyenne et écart-type
c) Diagramme en barres et mode
d) Fonction de répartition et tableau de fréquence
e) Toutes les propositions sont correctes
f) Aucune proposition n’est correcte

12) Une étude aimerait savoir si « l’amour des Mathématiques » est influencé par le sexe de la
personne. On réalise trois études sur trois populations différentes, voici les tableaux de
contingence récoltés :

a) Population 1
Aime les N’aime pas les
Mathématiques Mathématiques

500 500
Fille
500 500
Garçon
b) Population 2
Aime les N’aime pas les
Mathématiques Mathématiques

700 300
Fille
300 700
Garçon
c) Population 3
Aime les N’aime pas les
Mathématiques Mathématiques

1000 0
Fille
0 1000
Garçon

Sans les calculer, classez les indices de Cramer dans l’ordre croissant et donnez sa valeur si cela est
faisable.

13) La même étude a relevé le résultat en fonction du sexe obtenu lors d’un test mathématique (sur
100). Voici les moyennes conditionnelles de nos trois populations.

a) Population 1
Fille Garçon
Moyenne 65 65
b) Population 2
Fille Garçon
Moyenne 85 45

Page 93
MK121 – Statistiques Descriptives

c) Population 3
Fille Garçon
Moyenne 75 55

Sans les calculer, classez les indices de corrélation dans l’ordre croissant et donnez sa valeur si
cela est faisable.

14) Une grande firme de pralines propose quatre types de packaging différents pour ses ballotins de
250g. Malheureusement, cela lui coûte cher, elle décide donc de mener une enquête auprès de
ses clients afin de connaître l’importance que ceux-ci accordent au packaging. Elle aimerait donc
savoir si le client change de packaging en fonction du but de l’achat (pour offrir à des proches, pour
offrir à des amis, par gourmandise, etc.). Quels paramètres ou graphiques doit-elle utiliser afin de
communiquer au mieux les résultats ?

a) Diagramme en tarte et coefficient de variation


b) Indice de Cramer et tableau de contingence
c) Indice de corrélation et moyenne
d) Nuage de points et 𝜒 2 par case
e) Toutes les propositions sont correctes
f) Aucune proposition n’est correcte

15) Un psychologue travaille actuellement à vérifier si la consommation régulière d’alcool chez les
jeunes influence leur résultat scolaire. Il interroge un échantillon de 500 étudiants en leur posant
les deux questions suivantes :

• « Combien de fois par semaine consommez-vous de l’alcool ? » Jamais, entre une et


deux fois, entre trois et quatre fois, entre cinq et six fois, au moins sept fois.
• « Quelle était votre moyenne globale lors de votre dernier bulletin ? »
Quels paramètres doit-il utiliser afin de communiquer au mieux les résultats ?

a) Tableau de fréquence et mode


b) Coefficient de corrélation et droite des moindres carrés
c) Indice de corrélation et moyennes conditionnelles
d) Indice de Cramer et 𝜒 2 par case
e) Toutes les propositions sont correctes
f) Aucune proposition n’est correcte

16) Les étudiants ayant du mal à fournir une réponse exacte à la deuxième question. Le psychologue
change celle-ci en : « Quel était votre grade lors de votre dernier bulletin ? »

Quels paramètres doit-il utiliser afin de communiquer au mieux les résultats ?

a) Tableau de fréquence et mode


b) Coefficient de corrélation et droite des moindres carrés
c) Indice de corrélation et moyennes conditionnelles
d) Indice de Cramer et 𝜒 2 par case
e) Toutes les propositions sont correctes
f) Aucune proposition n’est correcte

17) Par contre, il se rend compte qu’une centaine des étudiants interrogés est capable de lui donner
avec précision non seulement leur moyenne globale du dernier bulletin, mais également leur
consommation hebdomadaire d’alcool en litres.

Page 94
MK121 – Statistiques Descriptives

18) Quels paramètres doit-il utiliser afin de communiquer au mieux les résultats ?

a) Tableau de fréquence et mode


b) Coefficient de corrélation et droite des moindres carrés
c) Indice de corrélation et moyennes conditionnelles
d) Indice de Cramer et 𝜒 2 par case
e) Toutes les propositions sont correctes
f) Aucune proposition n’est correcte

19) Lors de la rentrée universitaire, il a été décidé de répartir les étudiants dans les classes en
fonctions de leur niveau en Mathématiques. Niveau basé sur un test (sur 100) réalisé lors de
l’inscription de ceux-ci. Les professeurs de Langue crient au scandale. Car eux aussi ont réalisé un
test (sur 100) lors de l’inscription des étudiants, et aimeraient également en tenir compte dans
l’élaboration des classes. Quels paramètres faut-il utiliser afin de d’apaiser les craintes des
professeurs de Langue ou au contraire leur donner raison ?

a) Tableau de fréquence et mode


b) Coefficient de corrélation et droite des moindres carrés
c) Indice de corrélation et moyennes conditionnelles
d) Indice de Cramer et 𝜒 2 par case
e) Toutes les propositions sont correctes
f) Aucune proposition n’est correcte

20) Le coefficient de corrélation a donc été calculé, celui-ci est de -0,85. Que devons-nous faire ?

a) Faire des classes en fonction du résultat en Mathématiques et en faire d’autres en fonction


du résultat en Langue.
b) Garder les classes telles qu’elles sont faites en fonction des points en Mathématiques. Les
classes faibles en Mathématiques seront également faibles en Langue.
c) Garder les classes telles qu’elles sont faites en fonction des points en Mathématiques. Mais
en tenant compte que les classes faibles en Mathématiques seront les classes fortes en
Langue.

Page 95
MK121 – Statistiques Descriptives

21) Des chercheurs aimeraient savoir si les personnes possédant un QI élevé ont une bonne culture
générale. Ils soumettent quatre échantillons représentatifs de quatre populations différentes à un
test de QI (su 100) et à un test de culture générale (sur 100). Les nuages de points observés sont
les suivants :

Nuage de points échantillon 1 (Test culture Nuage de points échantillon 2 (Test culture
générale vs Test de QI) générale vs Test de QI)
32,1 70

32 60
Test culture générale

Test culture générale


31,9 50

31,8 40

31,7 30

31,6 20

31,5 10

31,4 0
20 40 60 80 100 20 40 60 80 100
Test de QI Test de QI

Nuage de points échantillon 3 (Test culture Nuage de points échantillon 4 (Test culture
générale vs Test de QI) générale vs Test de QI)
45 50
40
Test culture générale
Test culture générale

35 45

30
40
25
20
35
15
10 30
5
0 25
20 40 60 80 100 20 40 60 80 100
Test de QI Test de QI

Pour chacun des échantillons, choisissez quel type modèle serait le plus adéquat.

a) Modèle linéaire
b) Modèle exponentielle
c) Modèle logarithmique
d) Pas de modèle existant

Page 96
MK211 – Prise en main de Xlstat

PARTIE 2 :
PRISE EN MAIN DE XLSTAT
CHAPITRE 1 : LES DONNÉES BRUTES
Après la récolte des informations, le statisticien dispose de données brutes : une valeur pour
chaque individu de l’échantillon. Le logiciel de sondage nous fournit les données au format
Excel. Dans ce dernier, chaque colonne représente une variable et chaque ligne un individu.

EXEMPLE
Nombre Poids Taille
Nom Sexe Etat civil Age(ans) d'enfants (kg) (cm) Pointure Intérêt
Bob Masculin Veuf 34 4 79 124 45 Oui
Julia Féminin Célibataire 68 0 35 206 44 Non
Valérie Féminin Divorcé 82 1 134 40 Non
Monique Féminin Célibataire 50 4 66 173 47 Non
Georges Masculin Marié 65 3 82 169 32 Oui
Arthur Masculin Divorcé 4 64 188 35 Non
Albert Masculin Divorcé 74 3 56 211 40 Oui
Jérémy Masculin Marié 73 6 43 170 41 Non
Gertrude Féminin Célibataire 45 3 29 206 46 Non
Irène Féminin Marié 49 0 69 201 46 Non
Firmin Masculin Veuf 45 1 49 149 45 Non
Luc Masculin Veuf 43 5 71 127 43 Non
Lucie Féminin Veuf 34 0 109 144 45 Oui
Charlotte Féminin Célibataire 32 0 80 209 40 Non
Caroline Féminin Célibataire 22 3 68 128 48 Oui
Elines Féminin Veuf 57 3 54 164 44 Oui
Charles Masculin Veuf 70 4 99 120 48 Oui
Henry Masculin Divorcé 25 6 20 175 45 Oui

Afin de traiter ces données, nous utiliserons les logiciels Excel et Xlstat.

Page 97
MK211 – Prise en main de Xlstat

CHAPITRE 2 : LOGICIEL XLSTAT


XLSTAT est un logiciel se présentant comme une sorte d’upgrade d’Excel. En effet, il apparaît
sous la forme d’un onglet supplémentaire dans la barre des menus d’Excel. Les données, ainsi
que les résultats (calculs, graphiques, interprétations, etc.) seront donc placés dans une feuille
Excel et pourront dès lors être manipulés de la même façon que d’autres données Excel. Par
exemple, la mise en forme d’un graphique se fera via Excel. Cela s’avère à la fois très pratique
et intuitif, et se base donc sur des manipulations bien connues de tous.

Le site XLSTAT ([Link] propose des tutoriels pour les différents calculs,
ainsi que des fichiers de données. Il existe également une chaîne YouTube :
[Link] Le but ici est
d’apprendre à manipuler les options de base de XLSTAT : préparation, description,
visualisation et modélisation des données. Pour chaque manipulation, des tutoriels vidéo sont
postés sur le portail. Des vidéos supplémentaires reprenant les différentes notions théoriques
sont également disponibles et peuvent être visionnées le cas échéant.

CHAPITRE 3 : PRÉPARATION DES


DONNÉES2
1. Données Manquantes
Les données manquantes se produisent lorsqu’aucune valeur de données n’est représentée
pour une variable pour une observation donnée. Les données manquantes sont courantes et
peuvent avoir un effet significatif sur l'inférence, les performances de prédiction ou toute
autre utilisation faite avec les données.

Des données manquantes peuvent exister dans les données en raison d'une « omission de
réponse » pour l'observation donnée. Dans cette situation, aucune information n'est fournie
pour un individu ou pour plusieurs éléments. Certaines variables sont plus susceptibles d'avoir
une « omission de réponse » que d'autres. Par exemple, les données concernant le revenu
sont souvent manquantes.

2 Tous les exemples se trouvent sur le fichier « Préparations des données »

Page 98
MK211 – Prise en main de Xlstat

Présentation des données manquantes dans les données


brutes
Dans les données brutes, les données manquantes sont représentées par des cellules vides.

Nombre Poids Taille


Nom Sexe Etat civil Age(ans) d'enfants (kg) (cm) Pointure Intérêt
Bob Masculin Veuf 34 4 79 124 45 Oui
Julia Féminin Célibataire 68 0 35 206 44 Non
Valérie Féminin Divorcé 82 1 134 40 Non
Monique Féminin Célibataire 50 4 66 173 47 Non
Georges Masculin Marié 65 3 82 169 32 Oui
Arthur Masculin Divorcé 4 64 188 35 Non
Albert Masculin Divorcé 74 3 56 211 40 Oui
Jérémy Masculin Marié 73 6 43 170 41 Non
Gertrude Féminin Célibataire 45 3 29 206 46 Non
Irène Féminin Marié 49 0 69 201 46 Non
Firmin Masculin Veuf 45 1 49 149 45 Non
Luc Masculin Veuf 43 5 71 127 43 Non
Lucie Féminin Veuf 34 0 109 144 45 Oui
Charlotte Féminin Célibataire 32 0 80 209 40 Non
Caroline Féminin Célibataire 22 3 68 128 48 Oui
Elines Féminin Veuf 57 3 54 164 44 Oui
Charles Masculin Veuf 70 4 99 120 48 Oui
Henry Masculin Divorcé 25 6 20 175 45 Oui

Nous ne connaissons pas l’âge d’Arthur, ni le poids de Valérie.

Il existe 3 types des données manquantes :

• Si ce qui a amené à ce qu'une donnée soit manquante ne dépend d'aucune variable


observable et d'aucun paramètre non observable, alors les données manquent
complètement aléatoirement (MCAR). Le fait qu'une donnée manque est alors
considéré comme dû au hasard. Dans ce cas, les analyses effectuées sont non biaisées.
Ce cas est très rare et difficile à prouver.
Exemple : un bug informatique.
• Si ce qui a amené à ce qu'une donnée soit manquante est lié à la valeur d'une variable
externe mais pas aux valeurs de la variable ayant des données manquantes, alors les
données manquent aléatoirement (MAR). C'est le cas le plus classique.
Exemple : certains individus de veulent pas donner leur poids.
• Si les données manquent pour une raison particulière, alors les données manquent
non aléatoirement (NMAR).
Exemple : des questions filtres (certaines questions ne concernent que certaines
personnes dans un questionnaire, les autres personnes sont manquantes).
Celles-ci peuvent donc avoir des conséquences sur notre analyse. Il nous faut donc pouvoir les
identifier et les traiter avant de débuter l’analyse.

Page 99
MK211 – Prise en main de Xlstat

Traitement des données manquantes


Nous utiliserons XLSTAT afin de traiter celles-ci. Le logiciel nous propose les méthodes
suivantes en fonction du type de variable :

Pour des données quantitatives, XLSTAT vous permet de :

• Supprimer les observations ayant des données manquantes.


• Utiliser une imputation par la moyenne de chaque variable.
• Utiliser une approche de plus proche voisin.
• Remplacer les valeurs manquantes par une valeur numérique donnée.
• Utiliser l'algorithme NIPALS.
• Utiliser une méthode d'imputation multiple utilisant les MCMC (Markov Chain Monte
Carlo).
• Utiliser l'algorithme EM (Expectation Maximisation) pour des données suivant une loi
normale multivariée.

Pour des données qualitatives, XLSTAT vous permet de :

• Supprimer les observations ayant des données manquantes.


• Utiliser une imputation par le mode de chaque variable.
• Utiliser une méthode de plus proche voisin.
• Remplacer les valeurs manquantes par une valeur textuelle donnée.
• Utiliser l'algorithme NIPALS.

Dans ce cours, nous nous contenterons des 3 premières options pour les deux types de
variables.

EXERCICES

Le traitement des données manquantes peut s’effectuer de trois façons différentes. Pour les
cas suivants, cochez la (les) méthode(s) envisageables. Des données manquantes
apparaissent dans :

1) Une variable poids sur une population de taille 500


o Supprimer les données manquantes
o Remplacer par le mode ou la moyenne
o Le plus proche voisin

2) Une variable état civil sur une population de taille 1000

o Supprimer les données manquantes


o Remplacer par le mode ou la moyenne
o Le plus proche voisin

Page 100
MK211 – Prise en main de Xlstat

3) Une variable taille sur un échantillon de taille 20

o Supprimer les données manquantes


o Remplacer par le mode ou la moyenne
o Le plus proche voisin

4) Une variable emploi sur un échantillon de taille 15

o Supprimer les données manquantes


o Remplacer par le mode ou la moyenne
o Le plus proche voisin

5) Une variable nombre d’heures de sport par semaine suite à une question filtre
« Etes-vous sportif ? »

o Supprimer les données manquantes


o Remplacer par le mode ou la moyenne
o Le plus proche voisin

6) Une variable binaire (Oui-Non)

o Supprimer les données manquantes


o Remplacer par le mode ou la moyenne
o Le plus proche voisin

7) Une variable reprenant une couleur pour laquelle on constate (sur les données non
manquantes) que le rouge et le bleu sont majoritaires et à une quasi-égalité en
termes d’effectif.

o Supprimer les données manquantes


o Remplacer par le mode ou la moyenne
o Le plus proche voisin

Page 101
MK211 – Prise en main de Xlstat

2. Gestion des Données


La gestion des données nous permet d’agencer les données brutes différemment et
également d’observer certains phénomènes. XLSTAT propose 8 outils de gestion des données :

Dédoublonner
Il est parfois nécessaire de dédoublonner un tableau de données : certaines observations
peuvent être présentes plusieurs fois (on parle alors de doublons) suite à la fusion de plusieurs
sources de données, ou suite à des erreurs de saisie.

Grouper
Le groupement est utile lorsque vous voulez agréger des données. Imaginez par exemple le
cas d'un tableau contenant des enregistrements de ventes (une colonne pour l'identifiant
client, et une colonne avec le montant de la vente) que vous voudriez agréger pour avoir une
ligne par client, avec l'identifiant du client et le montant total des ventes pour ce client. XLSTAT
vous permet d'obtenir ce tableau en quelques secondes. La somme n'est que l'une des six
possibilités proposées.

Joindre
La jointure est une opération courante en gestion de base de données. Elle permet de
fusionner « horizontalement » deux tables sur la base d'une information commune
dénommée la clef. Par exemple, imaginez que vous avez mesuré quelques indicateurs
chimiques sur 150 sites. Ensuite, vous voulez ajouter l'information géographique sur ces
mêmes sites où les données ont été recueillies. Votre table d'informations géographiques
contient l'information sur 1000 sites, y compris les 150 sites étudiés. Afin d'éviter le travail
fastidieux de fusionner manuellement les deux tables, une jointure permet d'obtenir en
quelques secondes la table fusionnée qui comprend à la fois les données recueillies et
l'information géographique. On distingue deux types de jointure :

• Jointure interne : la table fusionnée comprend uniquement les clefs communes aux
deux tables de départ.
• Jointure externe : la table fusionnée comprend une ligne par clef, qu'elle soit présente
dans une seule des tables de départ ou dans les deux.
Filtrer (Garder/Supprimer)
Cet outil vous permet de sélectionner un tableau et de créer un nouveau tableau qui
comprend (Garder) ou exclut (Supprimer) les lignes pour lesquelles la valeur, dans une colonne
donnée, correspond à une valeur contenue dans une liste sélectionnée par l'utilisateur.

Page 102
MK211 – Prise en main de Xlstat

Empiler/Désempiler
Cet outil permet de transformer un tableau organisé sous forme d'une colonne par groupe en
deux colonnes l'une associée à la valeur de la variable et la seconde au groupe associé.
L'opération inverse (désempiler) est aussi possible.

3. Codage
Le codage permet de recoder toutes les modalités d’une variable en une seule fois. Il nous
évite donc d’utiliser l’option remplacer d’Excel.

4. Convertir3
Le convertir présent dans Excel permet non seulement de convertir le format de plusieurs
cellules mais surtout de casser des cellules en plusieurs cellules.

Si nous posons une question en laissant la possibilité de choisir plusieurs réponses. Les
réponses cochées par l’individu se trouveront dans une seule et même cellule, séparées par
une virgule ou un point-virgule.

EXEMPLE

Nous interrogeons cinq personnes afin de connaître la (ou les) couleur(s) qu’elles préfèrent
pour une voiture. Les réponses enregistrées sont les suivantes :

Observation Couleurs
Obs 1 Vert ; Rouge
Bleu ; Blanc;
Obs 2
Rouge
Obs 3 Noir ; Gris
Obs 4 Noir
Obs 5 Rouge ; Noir

Le « convertir » va effectuer une casse au niveau du point-virgule.

Observation Couleurs
Obs 1 Vert Rouge
Obs 2 Bleu Blanc Rouge
Obs 3 Noir Gris
Obs 4 Noir
Obs 5 Rouge Noir

3 Option Excel

Page 103
MK211 – Prise en main de Xlstat

Il est ensuite facile de revenir à une seule colonne.

Couleurs
Vert
Bleu
Noir
Noir
Rouge
Rouge
Blanc
Gris

Noir

Rouge

5. Exercices Xlstat
CLIENTS 1 PARTIR DU FICHIER CLIENTS
1) Obtenez un tableau de données dans lequel toutes les données manquantes auront été
supprimées.

2) Faites de même en gardant les 80 données de votre population. Utilisez la méthode de la


moyenne et du mode. Vous travaillerez avec ce tableau dans la suite.
3) Utilisez la fonction moyenne d’Excel afin d’obtenir une cote moyenne sur 5 pour la
variable appréciation SAV.
4) Dédoublonnez la variable nombre d’enfants.
5) Donnez la proportion de clients possédant
a) Plus de 4 enfants.

b) Moins de 3 enfants.
6) En utilisant la fonction moyenne d’Excel,

a) Donnez la moyenne d’âge des hommes et des femmes.

b) Donnez le poids moyen des célibataires.


7) En moyenne, dans quelle profession l’appréciation du produit est-elle la plus petite ?

Page 104
MK211 – Prise en main de Xlstat

SOCIÉTÉS 1 PARTIR DU FICHIER SOCIÉTÉS


1) Calculez la proportion de sociétés achetant des pièces de rechange.

2) Calculez la proportion de demande en logiciel.

3) En utilisant la fonction « [Link] », calculez le nombre de sociétés wallonnes ayant besoin de main
d’œuvre.

Page 105
MK211 – Prise en main de Xlstat

CHAPITRE 4 : VISUALISATION DES


DONNÉES
SOCIÉTÉS 2 PARTIR DU FICHIER SOCIÉTÉS
1) Donnez un tableau recensé du type de société et représentez cette variable sous forme d’un
diagramme en secteur et d’un diagramme en bâtons.

2) Faites de même pour le secteur d’activité en fonction de la région.


3) Représentez le nombre de commandes sous forme d’un diagramme en bâtons.
4) Représentez la dépense de la dernière année sous forme de fréquence cumulée.
5) Donnez une valeur approximative de la dépense maximale de 40% des sociétés.

CLIENTS 2 PARTIR DE L’EX 2 DU FICHIER CLIENTS 1


1) Faites un tableau recensé du poids et de la taille en 10 intervalles d’amplitude égale.

2) Que constatez-vous pour la taille ?

3) Quelle action doit-être envisagée ?

4) Refaites vos tableaux recensés précédents en tenant compte de ce qui vient d’être observé.
Utilisez la méthode de la moyenne.

5) Répartissez l’âge en classes définies comme étant : [20,30[ ; [30,50[ ; [50,60[et [60,90]. Et donnez
l’âge moyen des clients entre 50 et 60 ans.

6) Donnez la proportion de femme et d’homme dont la dépense en produit de luxe est

a) Strictement inférieure à 420€.

b) Supérieure ou égale à 450€.

Page 106
MK211 – Prise en main de Xlstat

CHAPITRE 5 : DESCRIPTION DES


DONNÉES
1. Descriptive univariée sur une population
CLIENTS 3 PARTIR DE L’EX 9 DU FICHIER CLIENTS 2
1) Calculez le minimum, le maximum, l’amplitude, la médiane, les quartiles, la moyenne, la variance,
l’écart-type et le coefficient de variation pour le temps d’achat (en ligne et en magasin).
Représentez également les box Plot sur un même graphique.

2) Calculez la dépense maximal en produit de base de 65% de notre population.

3) Calculez et représentez sur la box plot la dépense minimale en produit de luxe de 22% de notre
population.

SOCIÉTÉS 3 PARTIR DU FICHIER SOCIÉTÉS


1) Calculez le minimum, le maximum, l’amplitude, la médiane, les quartiles, la moyenne, la variance,
l’écart-type et le coefficient de variation pour la dépense par commande lors de la dernière année.

2) Interprétez le CV calculé à l’exercice précédent.

3) Calculez la moyenne, la variance, l’écart-type et le coefficient de variation pour la dépense de la


dernière année et pour la dépense cumulée.

2. Descriptive bivariée sur une population


SOCIÉTÉS 4 PARTIR DU FICHIER SOCIÉTÉS
1) Calculez le pourcentage de SA en Flandre et de SARL en Wallonie.

2) Calculez le pourcentage d’influence du secteur d’activité sur le fait de demander une livraison.

3) Calculez le pourcentage d’influence de la région sur le kilométrage en cas de livraison.

4) Calculez le pourcentage d’influence de la région sur la dépense cumulée.

5) Calculez le pourcentage d’influence du type d’achat sur la dépense de la dernière année.


Reprenez les manipulations déjà effectuées dans sociétés 1.

CLIENTS 4 PARTIR DE L’EX 9 DU FICHIER CLIENTS 2


1) Calculez la dépense moyenne pour le produit de base, ainsi que pour le produit de luxe en
fonction du sexe.

2) Faites de même en fonction de la profession.

3) Donnez le pourcentage d’influence du sexe, ainsi que de la profession pour ces 2 dépenses.

Page 107
MK211 – Prise en main de Xlstat

1) Représentez un nuage de points exprimant le temps d’achat en ligne (minutes) en fonction du


temps d’achat en magasin (minutes). Que constatez-vous ?

2) Comment pouvez-vous rendre la différence observée plus visible ?

3) Donner un modèle linéaire pour les filles et un modèle linéaire pour les garçons. Ces deux
modèles sont-ils pertinents ?

4) Par minute supplémentaire passée en magasin, un homme passe ………… en …… sur internet.

5) Trouvez un modèle adéquat exprimant le nombre d’articles achetés en fonction du temps passé

a) Pour des achats en ligne.

b) Pour des achats en magasin.

3. Estimation sur un échantillon


IESN 1 PARTIR DU FICHIER IESN
1) Estimez pour notre échantillon le pourcentage :

a) D’étudiant(e)s en Comptabilité.

b) De futurs marketeurs qui sont des filles.

c) De futurs automaticiens qui sont des garçons.

d) De garçons qui sont inscrits en Droit.

e) De filles qui sont inscrites en Informatique de Gestion.

2) Estimez le pourcentage d’étudiants dans chacune des sections et représentez le tout par un
graphique adéquat.

3) Calculez et interprétez un intervalle de confiance pour les données précédentes pour une
confiance à 95%.

4) Créez un tableau recensé pour le nombre d’heures de travail en semaine et pour le nombre
d’heures de travail le week-end.

5) En moyenne, dans quelle section les étudiants travaillent-ils le plus en semaine (le week-end) ?

6) Estimez le temps

a) Maximum de travail en semaine de 30% de notre échantillon.

b) Minimum de travail en semaine de 80% de notre échantillon.

7) Faites de même mais pour chaque section.

8) Estimez et critiquez pour notre échantillon, le pourcentage d’influence du sexe sur le choix de la
section.

9) Estimez et critiquez pour notre échantillon, le pourcentage d’influence du bloc sur le fait d’être en
kot ou pas.

Page 108
MK211 – Prise en main de Xlstat

10) La section influence-t-elle le nombre d’heures de travail le week-end ? Si oui, à combien de


pourcents ?

AUTO 1 A PARTIR DU FICHIER AUTO


1) Estimez le pourcentage de véhicules diesels dans notre échantillon.

2) Il y a 90% de chance que la population représentée par notre échantillon contienne entre …. et
…… % de voitures essences.

3) En moyenne, il y a 95% de chance que la population représentée par notre échantillon parcoure
entre ……. et ……… km par an.

4) Calculez un intervalle (95%) pour le pourcentage de variation du nombre de kilomètres effectués


par an au sein de notre population.

5) Créez la variable différence de budgets entre voiture neuve et voiture d’occasion.

a) Estimez en sa moyenne et interprétez celle-ci.

b) Estimez la variance de celle-ci.

c) Estimez les variances et la covariance (utilisez la fonction « [Link] » d’Excel pour


les deux variables initiales.

d) Trouvez le lien entre la donnée du point b) et celles du point c).

e) A quelle formule mathématique bien connue cela vous fait-il penser ?

6) Vérifiez que les voitures diesels de notre échantillon parcourent en moyenne le plus grand nombre
de kilomètres par an.

7) Estimez le pourcentage d’influence du type de carburant sur le nombre de kilomètres parcourus


par an.

8) Estimez le budget voiture neuve de

a) Maximum de 72% de notre échantillon.

b) Minimum de 64% de notre échantillon.

9) Représentez les budgets voiture neuve et voiture d’occasion sous forme d’un histogramme
comportant 10 classes et sous forme d’une fonction de répartition.

Page 109
MK211 – Prise en main de Xlstat

CHAPITRE 6 : REDRESSEMENT
D’ENQUÊTE
1. Définition et principe
Dans la théorie des sondages, le redressement constitue un point très important. Il arrive
souvent que l'on possède un certain nombre de variables qualitatives, dites auxiliaires, dont
on connaît la répartition sur l'ensemble de la population étudiée. On veut alors se servir de
ces variables afin de redresser un sondage et ainsi d'obtenir des répartitions comparables pour
la population et l'échantillon. La recherche de ces poids de sondage utilise des méthodes
statistiques avancées.

XLSTAT vous propose quatre méthodes de calcul des poids de redressement dont la méthode
raking ratio (Deming et Stefan, 1940).

Soit un échantillon de taille n sur une population dont on connaît la taille N. On effectue un
sondage sur cet échantillon en incluant dans ce sondage un certain nombre de variables
auxiliaires dont on connaît la répartition sur la population globale. Les méthodes de
redressements vont permettre par des algorithmes itératifs de trouver les poids adaptés afin
que l'échantillon « ressemble » le plus possible à la population.

Chaque individu de notre échantillon se verra donc attribué un poids pour remettre
l’échantillon à l’échelle de la population.

C’est l’échantillon qui est remis à l’échelle de la population et non l’inverse. De ce fait
la somme des poids sera toujours égale à la taille de la population.

Méthode de redressement d’un sondage dans XLSTAT


Les quatre méthodes de redressement d’une enquête présentes dans XLSTAT sont :

• Méthode raking ratio


• Méthode logit : celle-ci correspond à la méthode raking ratio en fixant des contraintes
de bornes sur les poids
• Méthode linéaire
• Méthode linéaire tronquée : celle-ci correspond à la méthode linéaire avec des bornes
sur les poids
Ces méthodes sont basées sur le même algorithme développé par Deville, Särndall et Sautory
(1993) et doivent aboutir à des résultats proches. La principale différence réside dans la
fonction à optimiser.

Résultats du redressement d'un sondage dans XLSTAT


XLSTAT vous propose les résultats suivants:

Page 110
MK211 – Prise en main de Xlstat

• Poids finaux : Tableau contenant les poids redressés obtenus par la méthode
sélectionnée. On peut aussi visualiser les rapports de poids et les variables auxiliaires
initiales.
• Statistiques descriptives (après redressement) : Tableau affichant pour toutes les
modalités des variables auxiliaires les statistiques descriptives obtenues après le
redressement : l'effectif et le pourcentage dans l'échantillon, les sommes marginales
dans la population (effectif et pourcentage).
• Liste des combinaisons : Ensemble des combinaisons des modalités des variables
auxiliaires présentes dans l'échantillon. Pour chaque combinaison, l'effectif et le
rapport de poids sont donnés.
• Détails des itérations : Tableau présentant les détails des itérations de l'algorithme
d'estimation des poids. Les lambdas sont les multiplicateurs de Lagrange et le critère
d'arrêt est défini dans la partie description de cette aide.
Encodage sur XLSTAT 4

• Variable(s) qualitative(s) caractérisant notre échantillon (une variable par colonne).


• Répartition de(s) variable(s) qualitative(s) au sein de la population (une variable par
colonne). Ordre de(s) variable(s) dans le même ordre que le(s) variable(s) de
l’échantillon.
• Effectifs de chaque modalité au sein de la population (dans l’ordre alphabétique des
modalité).
• Proportions de chaque modalité au sein de la population (dans l’ordre alphabétique
des modalités). Taille de la population.

4 Voir tutos vidéos correspondants.

Page 111
MK211 – Prise en main de Xlstat

2. Cas spécifique de l’estimation de la moyenne


et la variance5
Moyenne
La moyenne devient donc une moyenne pondérée par les poids issus du redressement. Elle
s’estime donc comme :
𝑛
1
𝑥̅ = ∑ 𝑤𝑖 × 𝑥𝑖
𝑊
𝑖=1

Où 𝑤𝑖 est le poids correspondant à l’observation 𝑥𝑖 et 𝑊 est la somme des poids.

EXEMPLE

Soit un échantillon de taille dix redresser pour les variables sexe et âge d’une population de
taille 1000.

Voici le budget mensuel abonnement téléphonique.

Poids
Budget (€) finaux Calcul
120 120,3 14436
80 141,26 11300,8
56 141,26 7910,56
84 110,5 9282 110,5 × 84
110 120,3 13233
153 110,5 16906,5
128 110,5 14144
130 62,3 8099 62,3 × 99
99 62,3 6167,7
64 20,78 1329,92
1000 102809,48
102809,48
La moyenne peut donc être estimée à 𝑥̅ = = 102,81 €.
1000

5 Fichier redressement en exemple

Page 112
MK211 – Prise en main de Xlstat

Variance
L’estimation de la variance va aussi être pondérée. Mais il faudra également tenir compte du
fait que nous utilisons une moyenne estimée. Nous effectuerons le calcul suivant :

2
∑𝑛𝑖=1 𝑤𝑖 × (𝑥𝑖 − 𝑥̅ )2
𝑠 =
𝑊
𝑊− 𝑛

La différence avec la méthode que nous connaissons bien est la valeur du diviseur.

EXEMPLE

Reprenons les données de l’exemple précédent

Poids
Budget (€) finaux Calcul
120 120,3 35550,33
80 141,26 73493,68
56 141,26 309518,66
84 110,5 39094,52 110,5 × (84 − 102,81)2
110 120,3 6219,94
153 110,5 278359,26
128 110,5 70119,13
130 62,3 46059,91
62,3 × (99 − 102,81)2
99 62,3 904,11
64 20,78 31298,33
1000 890617,86
890617,86
La variance peut donc être estimée à 𝑠 2 = 1000 = 98,96 €2 .
1000−
10

Page 113
MK211 – Prise en main de Xlstat

Variance inter et Variance intra


Cette adaptation dans l’estimation de la variance de notre échantillon influencera aussi les
variances conditionnelles et donc les variances inter et intra. Voici un exemple, reprenant
l’observation du budget annuel téléphonie en fonction du sexe pour un échantillon de 100
individus issus d’une population de taille 500 avec une répartition égale fille/garçon.

Budget Budget
Statistique Budget (€)
Fille (€) Garçon (€)
Nb. d'observations 100 37 63
W-W/n 495 243,24 246,03
Somme des poids 500 250 250
Moyenne 1010,13 1015,13 1005,13
Variance (n-1) 8103,10 8682,81 7667,70

Somme
Moyenne 1010,13 253783,72 251283,73 505067,45

Variance intra 8077,84 2112035,99 1886497,14 3998533,13


Variance inter 25,25 6249,93 6249,93 12499,86

• 250 × 1015,13

505067,45
• 500

• 246,03 × 7667,70

3998533,13
• 495

• 250 × (1005,13 − 1010,13)2

12499,86
• 495

Page 114
MK211 – Prise en main de Xlstat

3. Exercices
STUDHELP 1 PARTIR DU FICHIER STUDHELP

Le fichier Studhelp reprend les données d’une enquête réalisée en 2017 au sein de l’IESN pour
un échantillon de 240 étudiants en vue de l’implantation d’un service d’aide (cours
particuliers, tutos vidéos en ligne, syllabus, etc.) aux étudiants.

Effectuez un redressement de l’échantillon sur les variables section et bloc à partir des
données de la populations présentées en feuille 2 de fichier.

Une fois celui-ci effectué, réalisez les exercices suivants en tenant compte de ce redressement.

10) Donnez un tableau recensé et un graphique en secteur illustrant le niveau d’intérêt pour
l’échange de notes.
11) Faites de même avec le type de cours particuliers (par un prof, un étudiant ou les deux).
12) Représentez ce dernier tableau sous forme d’un tableau de contingence (croiser cours prof
et cours étudiant)
13) Estimez le minimum, le maximum, l’amplitude, la médiane, les quartiles, la moyenne, la
variance, l’écart-type et le coefficient de variation pour les budgets livre notes de cours et
livre exercices. Représentez également les Box Plot sur un même graphique.
14) Estimez le budget maximum que 95% de notre échantillon accorde pour un cours
particulier donné par un enseignant. Ainsi que le budget minimum que 90% de notre
échantillon accorde pour un cours particulier donné par un enseignant.
15) Estimez le pourcentage d’influence du sexe sur le choix de la section.
16) Estimez le pourcentage d’influence du bloc sur le budget cours particulier donné par un
étudiant.

Page 115
MK211 – Probabilités

PARTIE 3 : PROBABILITÉS
Les probabilités et les statistiques sont deux domaines qui sont étroitement liés mais, en
même temps, diamétralement opposés.

La théorie des probabilités vise à calculer « la chance » (ou la malchance) qu’un événement a
de se produire. Elle s’intéresse par exemple à des questions telles que « Si je lance une pièce
de monnaie, quelle chance a-t-elle de retomber avec le côté face en l’air ? », dont la réponse
standard est 1/2 : « une chance sur deux ».

Dans le cadre de la théorie des probabilités, on suppose qu’on connaît les règles qui régissent
le hasard et on les utilise pour produire une réponse. Ainsi, si on suppose que la pièce est
déséquilibrée et qu’elle a deux fois plus de chances de retomber du côté pile que du côté face,
la réponse est toute autre.

À l’opposé, les statistiques, elles, s’intéressent avant tout aux résultats. En statistiques, on
observe ce qui se passe lorsqu’on répète une expérience plusieurs fois de suite. Par exemple,
pour analyser une pièce, on la lance 100 fois de suite et on compte combien de fois elle tombe
sur pile et combien de fois elle tombe sur face.

Les statistiques ne supposent pas qu’on connaisse les règles propres à la pièce : on ne sait pas
si elle est bien équilibrée ou pas. Au lieu de cela, on observe les résultats puis, éventuellement,
on en tire des conclusions au sujet de la pièce. Par exemple, si les résultats des 100 lancers
sont 49 fois pile et 51 fois face, on va sans doute conclure que la pièce est bien équilibrée.

Ainsi, schématiquement, dans le cadre des probabilités, on suppose qu’on connaît les règles
sous-jacentes et on émet des prédictions quant à ce qui peut se produire. On travaille dès lors
sur toute la population. À l’inverse, en statistiques, on examine ce qui se produit puis,
éventuellement, on tente d’en déduire (induire serait un mot plus juste) les règles. On travaille
donc sur un échantillon.

Nous allons mettre les deux notions en rapport par le biais de l’intervalle de confiance (Bloc
1) et ensuite en développant la notion de Statistique Inférentielle. Que nous aborderons dans
la quatrième partie de ce cours.

Page 116
MK211 – Probabilités

CHAPITRE 1 : L’ESTIMATION PAR


INTERVALLE DE CONFIANCE
Rappel
Nous avons vu en bloc 1 le calcul de l’intervalle de confiance pour une proportion et une
moyenne à un niveau de confiance de 95%. Mais ce niveau de confiance peut être soit
augmenter, soit diminuer. Que va devenir notre marche d’erreur dans ce cas-là ? La fameuse
constante de 1,96 va probablement changer, mais comment la recalculer à chaque fois ? C’est
ici que la notion de probabilité et de variable aléatoire va intervenir.

En général, nous pouvons redéfinir l’intervalle de confiance pour un niveau de confiance


quelconque de la façon suivante : un intervalle de confiance est une fourchette de valeur
(borne inférieure et borne supérieure) qui possède une certaine probabilité, appelée niveau
de confiance, de contenir la vraie valeur. Ce niveau de confiance s’exprime à partir d’une
incertitude notée 𝛼.

Si l’intervalle de confiance pour un paramètre 𝜃 est [𝑎 ; 𝑏], alors on peut dire

𝑃(𝑎 ≤ 𝜃 ≤ 𝑏) = 1 − 𝛼

Il y a (1 − 𝛼) % de chance que le paramètre dans notre population cible soit compris entre 𝑎
et 𝑏.

Ce niveau de confiance est une probabilité, il correspond au pourcentage de chance que la


vraie valeur se trouve dans notre intervalle. Il est plus souvent défini par son niveau
d’incertitude 𝛼: une incertitude de 5% correspond à une confiance de 95%, une incertitude de
1% correspond à une confiance de 99%, etc.

Les conventions font en sorte qu’une incertitude de 10% est le maximum permis. La plupart
des instituts de statistiques travaillent avec une incertitude de 5%. Mais cela peut dépendre
du domaine dans lequel la démarche s’effectue. En effet, en médicine, il est préférable de
travailler avec une incertitude de 1% voire de 0,1% ; par contre, en management, une
incertitude 5% voire 10% sera tolérée.

Exercice
1) Sur un échantillon de 400 namurois, nous avons relevé que 25% de cet échantillon ne participe pas
aux fêtes de Wallonie. Reliez l’intervalle de confiance construit avec le bon niveau de confiance.

[19,96% ; 30,04%] O O 90%

[21,44% ; 28,56%] O O 95%

[20,76% ; 29,24%] O O 98%

Page 117
MK211 – Probabilités

CHAPITRE 2 :
LES VARIABLES ALÉATOIRES
Nous venons de voir que le calcul des bornes de l’intervalle de confiance est étroitement lié
au niveau de confiance fixé. Ce niveau de confiance étant une probabilité, nous allons essayer
ici de bien comprendre la notion de variable aléatoire qui interviendra dans le calcul de ces
bornes.

Dans une expérience aléatoire, il arrive que l’on ne soit pas intéressé par la totalité des
résultats, mais uniquement par la valeur numérique d’une quantité attachée à cette
expérience. Ainsi, pour analyser la qualité d’un processus de fabrication, on se contente le
plus souvent de compter le nombre de pièces défectueuses parmi les pièces fabriquées.

Nous allons donc nous intéresser à la probabilité, pourcentage de « chance », qu’un certain
type de résultat apparaisse.

Une variable aléatoire prend une valeur en fonction du résultat de l’expérience aléatoire à
laquelle elle est liée.

EXEMPLES

On lance deux dés. On note X « somme des points obtenus ». X est une variable aléatoire qui
peut prendre des valeurs allant de 2 à 12.

On regarde la durée de vie en secondes des ampoules fabriquées par une grande marque.
La variable aléatoire X « durée de vie des ampoules » peut prendre des valeurs comprises dans
l’intervalle [0, +∞[ .

REMARQUE

Une variable aléatoire n’est rien d’autre que la généralisation à la population d’une variable
statistique quantitative.

Page 118
MK211 – Probabilités

1. Variables aléatoires discrètes


Une V.A. discrète est une V.A. qui peut prendre un nombre fini ou dénombrable de valeurs.
Sa loi de probabilité est caractérisée par les valeurs (𝑥𝑖 ) et par les probabilités que la variable
prenne ces valeurs (𝑝𝑖 = 𝑃(𝑋 = 𝑥𝑖 )).

EXEMPLE

Un étudiant présente deux examens, la probabilité qu’il réussisse le premier est de 0,3 et la
probabilité qu’il réussisse le second est de 0,3 s’il rate le premier et de 0,6 s’il réussit le
premier. Ecrivons la V.A. X « nombre d’examen(s) réussi(s) ». X peut valoir 0, 1 ou 2.

Calculons les probabilités :

𝑃(𝑋 = 0) = 0.7 × 0.7 = 0.49


𝑃(𝑋 = 1) = 0.3 × 0.4 + 0.7 × 0.3 = 0.33
𝑃(𝑋 = 2) = 0.3 × 0.6 = 0.18

La loi de probabilité se représente par le tableau suivant :

𝒙𝒊 𝒑𝒊
0 0,49
1 0,33
2 0,18

REMARQUE
∑𝑛𝑖=1 𝑝𝑖 = 1, le tableau obtenu est l’analogue du tableau de distribution en statistique
descriptive.

2. Espérance et Variance d’une variable aléatoire


discrète
La variable aléatoire pouvant être vue comme la généralisation à la population de la variable
statistique. Les notions de moyenne et d’écart-type (avec les mêmes interprétations) peuvent
donc également se généraliser.

L’espérance
L’espérance (ou moyenne) représentera la valeur moyenne obtenue lors d’une infinité de
répétitions de l’expérience aléatoire. Elle se calcule par la formule :
𝑛

𝐸(𝑋) = ∑ 𝑥𝑖 𝑝𝑖
𝑖=1

Page 119
MK211 – Probabilités

EXEMPLE

Voici le dos d’un billet de Subito :

Le plan des lots est une façon cachée d’écrire la loi de


probabilité de la variable aléatoire « gain brut au
Subito ». En effet, il suffit de diviser la première colonne
par 1 million afin d’obtenir la probabilité correspondante
à chaque gain, et de rajouter le gain nul et sa probabilité
correspondante. L’espérance se calculera comme suit :
1
(1 ∗ 25000 + 10 ∗ 2500 + 400 ∗ 250 + 1000 ∗
1000000
25 + 3000 ∗ 12,50 + 30000 ∗ 5 + 160000 ∗ 2,50) =
0,7625 €

En moyenne, la loterie nationale dépense 0,7625€ par joueur de Subito. Le billet coûte 1,25€,
ce qui fait un bénéfice de 0,4875€ par joueur.

La variance
Elle permettra de mesurer la dispersion des valeurs autour de l’espérance (ou moyenne). Elle
se calcule par la formule :
2
𝑉𝑎𝑟 (𝑋) = 𝐸 [(𝑋 − 𝐸(𝑋)) ] = 𝐸(𝑋 2 ) − 𝐸 2 (𝑋)

EXEMPLE
1
La variance pour le billet de Subito est de : (1 ∗ 250002 + 10 ∗ 25002 + 400 ∗
1000000
2502 + 1000 ∗ 252 + 3000 ∗ 12.502 + 30000 ∗ 52 + 160000 ∗ 2.502 ) − 0.76252 =
714.76 €2 Il est bien entendu plus logique de calculer l’écart-type en effectuant la racine
carrée de la variance afin d’avoir une valeur interprétable. Ce qui nous donne un écart-type
(noté 𝜎 ) 26.73 €.

Exercices
1) Dans un pays au régime totalitaire, on avait organisé la politique de natalité suivante :
toute femme devra mettre au monde jusqu’à la naissance d’un garçon. Afin de prévenir
une surpopulation, le nombre d’enfants est limité à 4 (même si 4 filles) et toute naissance
postérieure à celle d’un garçon est interdite.
c) Ecrivez la V.A. « nombre d’enfants ».

d) Cette politique est-elle bien adaptée ?


2) Une tombola a été organisée à l’occasion de la fête de l’école : on a vendu les 52 cartes
d’un jeu, et dans un autre jeu une main innocente a ensuite tiré une carte. Celui qui
possède la même carte gagne 50€. Ceux qui possèdent une carte de même force gagnent
8 €. Ceux qui possèdent une carte de même couleur (cœur, carreau, trèfle et pique)
gagnent 1.2€.

Page 120
MK211 – Probabilités

e) Définissez la V.A. « gain brut à la tombola ».

f) Quel doit-être le prix de participation à cette tombola, si on souhaite un bénéfice net


global de 100€ minimum ?
3) Une œuvre philanthropique a émis 90 000 billets de tombola numérotés de 10 000 à 99
999. Les prix sont les suivants :
• Billet gagnant : 100 000.00€
• Lots de consolations : 4 derniers chiffres corrects : 5 000.00€, 3 derniers chiffres
corrects : 500.00€, 2 derniers chiffres corrects : surprise d’une valeur de 5.00€.
g) Donner la loi de distribution et l’espérance de la variable aléatoire « gain brut ».

h) Quel doit être au minimum le prix d’un billet si on veut que l’opération soit rentable ?

3. Variables aléatoires continues


Une V.A. continue est une V.A. qui peut prendre un nombre infini de valeurs. Elle est
caractérisée par une fonction 𝑓(𝑥) appelée densité de probabilité telle que
+∞

∫ 𝑓(𝑥) 𝑑𝑥 = 1
−∞

La probabilité que la V.A. prenne une valeur comprise entre a et b se calculera donc par
𝑏
l’intégrale de la fonction de densité sur l’intervalle [𝑎; 𝑏] ∶ 𝑃(𝑎 ≤ 𝑋 ≤ 𝑏) = ∫𝑎 𝑓(𝑥) 𝑑𝑥

REMARQUE

Une intégrale valant 1 veut dire que l’aire située en-dessous de la courbe vaut 1. Ce qui était
le cas avec le polygone des fréquences dans le cours de statistiques descriptives.

PROPRIÉTÉ(S)

Vu que la probabilité revient à calculer une aire sous la courbe, on a :

𝑃(𝑋 = 𝑎) = 0

𝑃(𝑋 < 𝑎) = 𝑃(𝑋 ≤ 𝑎)

𝑃(𝑋 > 𝑎) = 𝑃(𝑋 ≥ 𝑎) = 1 − 𝑃(𝑋 ≤ 𝑎)

𝑃(𝑎 ≤ 𝑋 ≤ 𝑏) = 𝑃(𝑋 ≤ 𝑏) − 𝑃(𝑋 ≤ 𝑎)

Page 121
MK211 – Probabilités

EXEMPLE

Un programme génère un nombre aléatoire entre 0 et 10. Dès lors, chaque nombre entre 0
et 10 ayant la même probabilité d’être généré, la fonction de répartition est donc une
1
fonction constante telle que 𝑓(𝑥) = 10 𝑎𝑣𝑒𝑐 0 ≤ 𝑥 ≤ 10

0,12

0,10

0,08

0,06

0,04

0,02

0,00
0 2 4 6 8 10 12

1
La probabilité que le programme génère une valeur supérieure à 6 est 𝑃(𝑋 ≥ 6) = 4 × 10 =
0,4.

Page 122
MK211 – Probabilités

4. Espérance et Variance d’une variable aléatoire


continue
Comme pour les V.A. discrètes, il est possible de calculer et d’interpréter leur espérance et
variance. Le calcul s’effectuant comme suit :
+∞

𝐸(𝑋) = ∫ 𝑥 𝑓(𝑥) 𝑑𝑥
−∞

2
𝑉𝑎𝑟(𝑋) = 𝐸 [(𝑋 − 𝐸(𝑋)) ] = 𝐸(𝑋 2 ) − 𝐸 2 (𝑋)

EXEMPLE
10 1
L’espérance pour notre programme informatique est 𝐸(𝑋) = ∫0 𝑥 × 10 𝑑𝑥 = 5.
10 1
La variance est Var(𝑋) = ∫0 𝑥 2 × 10 𝑑𝑥 − 52 = 8,33 et donc l’écart-type est 𝜎 = 2,8867.

Exercice
1) La somme qu’une personne est prête à donner pour une marche parrainée de 10
kilomètres est une variable aléatoire continue prenant des valeurs dans l’intervalle
]0€, 10€] dont la fonction de répartition est la suivante :

1/6

1/12

Calculez la probabilité que la somme donnée par une personne soit :

a) Inférieure à 3€.
b) Comprise entre 3€ et 7€.
c) Supérieure à 8€.
d) Entre 1,5€ et 9€.

Page 123
MK211 – Probabilités

5. La loi Normale 𝑵(𝝁, 𝝈)


Définition
La loi normale, ou Gaussienne, est une V.A. continue dont la densité de probabilité est :

1 −(𝑥−𝜇)2
𝑓(𝑥) = 𝑒 2𝜎2
𝜎√2𝜋
Avec µ la moyenne et σ l’écart-type de la V.A.

La courbe de densité de la loi normale est centrée sur sa moyenne et sa concavité est
influencée par la valeur de son écart-type. De façon générale, pour une variable 𝑋 =
𝑁(𝜇; 𝜎), on peut admettre les probabilités suivantes :

𝑃(𝜇 − 𝜎 ≤ 𝑋 ≤ 𝜇 + 𝜎) = 68%

𝑃(𝜇 − 2𝜎 ≤ 𝑋 ≤ 𝜇 + 2𝜎) = 95%

𝑃(𝜇 − 3𝜎 ≤ 𝑋 ≤ 𝜇 + 3𝜎) = 99,7%

Page 124
MK211 – Probabilités

Exemples

LE PANNEAU DE GALTON

L’INDICE DE MASSE CORPORELLE

Page 125
MK211 – Probabilités

L’I.M.C. de la population mondiale est donc distribué suivant une loi normale. La majorité des
personnes se trouvent proches de la moyenne. Par contre, les cas d’obésité et d’anorexie
restent des cas rares. Mais ces cas deviennent de moins en moins rares avec le temps.

Par exemple, pour l’année 2000, nous pouvons remarquer que peu de personne se trouvaient
au-delà de 32 (à peu près 10 %). En revanche nous observons une prévision nettement plus
élevée en 2040 (à peu près 40%).

L’HEURE DE REPAS

La loi normale reste une modélisation du phénomène. Dans ce cas, on constate que les heures
de l’apéritif, du dîner, du goûter, du déjeuner et du petit-déjeuner peuvent être modélisées
par une loi normale. Ce qui n’est pas le cas pour l’heure de l’en-cas.

Calcul de la probabilité avec Excel


Le calcul de la probabilité et des quantiles pour une loi Normale peut s’effectuer facilement
dans Excel grâce aux fonctions [Link].N. et [Link].N. Nous vous
renvoyons à l’aide d’Excel pour l’utilisation de celle-ci.

Calcul de la probabilité avec XLSTAT


Bien que nous aborderons les manipulations de XLSTAT dans la prochaine partie, nous
anticipons ici son utilisation dans le cadre du calcul des probabilités d’une loi Normale. Nous
vous renvoyons aux tutoriels vidéos concernant celle-ci.

Page 126
MK211 – Probabilités

EXEMPLE

Soit une V.A. 𝑋 ≡ 𝑁(34; 2)

𝑃(𝑋 ≤ 38) = 0,9772

𝑃(𝑋 ≤ 𝑥) = 0,8 ⇔ 𝑥 = 35,6832

La normalisation
La normalisation d’une variable consiste à lui soustraire sa moyenne et à diviser le tout par
l’écart-type. On obtient ainsi une variable de moyenne 0 et d’écart-type 1.

CALCUL DE LA PROBABILITÉ POUR UNE NORMALE EN UTILISANT LA


NORMALISATION

La normalisation consiste donc à faire le calcul suivant :

𝑋−𝜇
𝑆𝑜𝑖𝑡 𝑋 ≡ 𝑁(𝜇, 𝜎), 𝑎𝑙𝑜𝑟𝑠 ≡𝑍
𝜎
Où 𝑍 ≡ 𝑁(0; 1)

Le résultat obtenu est donc une normale de moyenne 0 et d’écart-type 1, celle-ci sera très
souvent utilisée dans la suite du cours.

EXEMPLE 1

Soit une V.A. 𝑋 ≡ 𝑁(34; 2)


𝑋 − 34 38 − 34
𝑃(𝑋 ≤ 38) = 𝑃 ( ≤ ) = 𝑃(𝑍 ≤ 2) = 0,9772
2 2

𝑥 − 34 𝑥 − 34
𝑃(𝑋 ≤ 𝑥) = 0,8 ⇔ 𝑃 (𝑍 ≤ ) = 0,8 ⇔ = 0,8416 ⇔ 𝑥 = 35,6832
2 2

EXEMPLE 2

En pratique, il est difficile de connaître avec exactitude la moyenne et l’écart-type d’une


population. Toutefois, lorsque celle-ci est distribuée suivant une loi normale, ces deux
paramètres peuvent être déterminés à partir de données en termes de distribution. Prenons
l’exemple simplifié6 suivant où la moyenne est inconnue et l’écart-type est connu.

6 Ici, un des deux paramètres est connu.

Page 127
MK211 – Probabilités

La taille d’une population est distribuée suivant une loi normale de moyenne inconnue et
d’écart-type de 15 cm. La proportion de personnes au sein de ma population mesurant moins
de 2 mètres est de 90%. Que vaut cette moyenne ?

𝑋 ≡ 𝑁(𝜇, 15) 𝑒𝑡 𝑃(𝑋 ≤ 200) = 0,9

200 − 𝜇
𝑃 (𝑍 ≤ ) = 0,9
15
200 − 𝜇
= 1,28 ⇔ 𝜇 = 180,78𝑐𝑚
15

Exercices
1) Le temps de réaction à un stimulus est une V.A. normale de moyenne 15 secondes et
d’écart-type 3 secondes. Trouvez la probabilité que le temps de réaction d’une personne
choisie au hasard soit supérieur à 20 secondes.
2) Supposons que le temps mis par la police locale pour se rendre sur les lieux d’un vol soit
distribué normalement avec une moyenne égale à 5 minutes et un écart-type de 2
minutes.
a) Quelle est la probabilité, que pour le prochain vol, la police arrive dans les 4 minutes ?
b) Quelle est la probabilité de voir la police arriver plus de 10 minutes après avoir été
prévenue d’un vol ?
c) La police vient d’être prévenue d’un vol, quelle est la probabilité qu’elle arrive sur les
lieux de ce vol dans un laps de temps compris entre 4 et 8 minutes ?
d) En dessous de quel laps de temps peut-on situer 75% des interventions ?
3) Supposons que le montant consacré par les ménages à leurs vacances d’été soit distribué
normalement avec un écart-type de 1 000.00€. Supposons également que 20% des
ménages consacrent plus de 3 500.00€ à ces vacances d’été.
a) Que dépense en moyenne un ménage pour ses vacances d’été ?
b) Quel est le pourcentage des ménages qui consacrent moins de 2 500.00€ à leurs
vacances d’été ?
c) Quelle est la probabilité qu’un ménage choisi au hasard ait un budget vacances d’été
qui s’écarte de plus de 15% du budget moyen ?
4) Un examen écrit est corrigé par deux professeurs Sato et Tournesol. Sato a corrigé deux
fois plus de copies que Tournesol et la distribution de ces cotes est une normale de
moyenne 10 et de variance 4 ; tandis que celle de Tournesol est une normale de moyenne
11 et de variance 9. Quelle est la probabilité qu’un étudiant choisi au hasard ait obtenu
une cote inférieure à 7 ?
5) Le Q.I. d’une certaine catégorie de travailleurs est une V.A. N(100,10). Dans cette
catégorie, on considère comme ”exceptionnel” d’avoir un Q.I. supérieur à 115. Trouvez la
probabilit

Page 128
MK211 – Probabilités

a) Qu’un travailleur soit ”exceptionnel”.


b) Que sur 25 personnes, il y en ait exactement 5 ”exceptionnelles”
6) La cote moyenne à un examen final était de 72 (sur 100) et l’écart-type valait 8. La
distribution des résultats était normale. On décide de distribuer des prix aux meilleurs
étudiants de telle sorte que seulement 10% des étudiants obtiennent un prix. A partir de
quelle cote doit-on donner un prix?
7) En vue de récolter des fonds pour un montant de 250 000 000€ destinés à la construction
d’un parc de loisir, un état comptant 5 millions de ménages décide d’un impôt
supplémentaire d’un montant de 250€ par ménage disposant d’un certain revenu. Quel
est le montant de ce revenu, si on sait que le revenu des ménages est distribué
normalement avec une moyenne de 20 000€ et un écart-type de 10 000€ ?
8) Lors d’un examen, un professeur a constaté que la moyenne et l’écart-type des cotes (sur
20) étaient respectivement de 11 et de 4. Calculez la probabilité que la cote d’un étudiant
pris au hasard soit comprise entre 8 et 14, si on suppose que les cotes sont distribuées
normalement.
9) Ce même professeur constate qu’il met en moyenne 8 minutes pour corriger une copie et
qu’une fois sur quatre 10 minutes ne lui suffisent pas pour la correction. Donnez l’écart-
type du temps de correction, en supposant que celui-ci est distribué normalement.
10) Le temps de réalisation du gros œuvre d’une maison est distribué normalement avec un
écart-type de 10 jours. Sachant que dans 25% des cas cela prend moins de 60 jours, quel
est le temps moyen (en jour) nécessaire à la réalisation du gros œuvre ?
11) Le poids d’une population est distribué suivant une loi normale de moyenne et d’écart-
type inconnus. Calculez ces deux paramètres sachant que 25% de la population pèse moins
de 55kg et que 60% de la population pèse moins de 96kg.
12) Le temps d’étude (en heure) des étudiants durant les jours de la semaine suit une loi
normale moyenne et d’écart-type inconnus. Calculez ces deux paramètres sachant que
30% des étudiants travaillent moins d’une heure les jours de semaine et que 5% des
étudiants travaillent plus de 4 heures les jours de semaine.
13) Une firme constate que le temps d’une publicité télévisuelle est distribué normalement
avec un écart-type de 20 secondes. Et qu’une fois sur quatre, ce temps est inférieur à 1
minute (60 secondes)
a) Calculez la moyenne.
b) Calculez la probabilité que ce temps soit compris entre 1 minute 10 secondes et 1
minute 30 secondes.
c) Une publicité est dite pertinente si sa durée est justement comprise entre 1 minute
10 secondes et 1 minute 30 secondes. Sur une diffusion de 15 publicités, donnez la
probabilité qu’il y en ait exactement 8 qui soient pertinentes.

Page 129
MK211 – Probabilités

6. Autres lois continues


Même si elle est la plus usitée la loi Normale n’est pas la seule loi continue, il en existe une
multitude. Toutes présentes sur Excel ou XLSTAT. La suite de ce cours nécessite l’utilisation de
deux autres V.A. continues. Celles-ci sont toutes obtenues à partir d’opérations sur une ou
plusieurs V.A. normales réduites.

Loi Chi-carré 𝝌𝟐𝒌


Est une somme de k V.A. normales centrées réduites élevées au carré, elle a comme
paramètre k son degré de liberté, et est positive. 𝜒𝑘2 = ∑𝑘𝑖=1 𝑍𝑖2

Loi Student 𝒕𝒌
Est le quotient d’une loi normale centrée réduite par la racine carrée d’une loi chi carré à k
𝑍
degrés de liberté divisée par k. 𝑡𝑘 =
2
√𝜒𝑘
𝑘

Graphiquement, on gardera comme pour la normale une forme de cloche. En effet,


lim 𝑡𝑘 = 𝑍
𝑘→+∞

Page 130
MK211 – Probabilités

CHAPITRE 3 :
CALCUL DE L’INTERVALLE DE CONFIANCE
1. Intervalle de confiance pour une proportion
√𝑓 × (1 − 𝑓) √𝑓 × (1 − 𝑓)
𝜋 ∈ [𝑓 − 𝑧 1−𝛼/2 ; 𝑓 + 𝑧 1−𝛼/2 ]
√𝑛 √𝑛
Marge d’erreur
𝛼
𝑃 (𝑍 ≤ 𝑧1−𝛼 ) = 1 − où 𝑍 est la normale réduite (𝜇 = 0 et 𝜎 = 1).
2 2

EXEMPLE

Construisons l’intervalle de confiance à 95% de confiance pour une proportion estimée de


24% sur un échantillon de 1000 individus.

𝛼 = 5%, 𝑓 = 24%, 𝑛 = 1000

√0,24 × (1 − 0,24) √0,24 × (1 − 0,24)


𝜋 ∈ [0,24 − 1,96 ; 0,24 + 1,96 ]
√1000 √1000
𝜋 ∈ [0,24 − 0,0265 ; 0,24 + 0,0265]

𝜋 ∈ [21,35% ; 26,65%]

Page 131
MK211 – Probabilités

2. Intervalle de confiance pour une moyenne


𝑠 𝑠
𝜇 ∈ [𝑥̅ − 𝑡𝑛−1, 1−𝛼/2 ; 𝑥̅ + 𝑡𝑛−1, 1−𝛼/2 ]
√𝑛 √𝑛
Marge d’erreur
𝛼
𝑃 (𝑡𝑛−1 ≤ 𝑡𝑛−1, 1−𝛼/2 ) = 1 − 2 où 𝑡𝑛−1 est une Student à 𝑛 − 1 degrés de liberté.

EXEMPLE

Construisons l’intervalle de confiance à 90% de confiance pour un budget moyen estimée à


1500€ et un écart-type estimé à 200 € sur un échantillon de 400 individus.

𝛼 = 10%, 𝑥̅ = 1500€, 𝑠 = 200€, 𝑛 = 400

200 200
𝜇 ∈ [1500 − 1,65 ; 1500 + 1,65 ]
√400 √400
𝜇 ∈ [1500 − 16,5 ; 1500 + 16,5]

𝜇 ∈ [1483,50 € ; 1516,50 €]

Page 132
MK211 – Probabilités

3. Intervalle de confiance pour une variance


(𝑛 − 1) × 𝑠 2 (𝑛 − 1) × 𝑠 2
2
𝜎 ∈[ 2 ; 2 ]
𝜒𝑛−1, 1−𝛼/2 𝜒𝑛−1, 𝛼/2

Ici, pas de notion de marge d’erreur.

2 2 𝛼 2 2 𝛼
𝑃 (𝜒𝑛−1 ≤ 𝜒𝑛−1, 1−
𝛼) = 1 − et 𝑃 (𝜒𝑛−1 ≤ 𝜒𝑛−1, 𝛼) =
2 2 2 2

2
où 𝜒𝑛−1 est une khi² à 𝑛 − 1 degrés de libertés.

EXEMPLE

Construisons l’intervalle de confiance à 98% de confiance pour la variance du budget de


l’exemple précédent.

𝛼 = 2%, 𝑠 = 200€, 𝑛 = 400

2
(400 − 1) × 2002 (400 − 1) × 2002
𝜎 ∈[ ; ]
467,64 336,24
𝜎 2 ∈ [34128,82 €2 ; 47466,10 €2 ]

𝜎 ∈ [184,74 € ; 217, 87€]

Page 133
M211 – Statistiques Inférentielles

PARTIE 4 :
STATISTIQUE INFÉRENTIELLE,
LES TESTS STATISTIQUES
Les tests statistiques autrement appelés tests d’hypothèses permettent d’accepter/rejeter
une hypothèse bien précise sur la population en assumant des risques d’erreur.

CHAPITRE 1 :
LES TESTS D’HYPOTHÈSES
1. La formulation des hypothèses

Page 134
MK211 – Statistiques inférentielles

Une hypothèse statistique est toute affirmation (vraie ou fausse) relative à la population de
laquelle est extrait l'échantillon d'observations. Une hypothèse statistique se traduit par un
énoncé relatif soit à la forme de la loi de probabilité d'une variable aléatoire, soit à la valeur
d'un ou de plusieurs paramètres de cette loi. Si, sur base de la supposition qu'une hypothèse
donnée est vraie, nous trouvons que les résultats sur un échantillon aléatoire diffèrent de
manière notable de ceux que nous pouvions espérer dans le cadre de cette hypothèse, nous
dirons que ces différences sont significatives et nous serons enclins à rejeter l'hypothèse.
Cette décision d'accepter ou de rejeter une hypothèse se prendra sur la base de l'information
contenue dans l'échantillon. Le plus souvent, cette information sera condensée dans une
statistique dont la loi de probabilité sera entièrement spécifiée à partir des hypothèses.

Cette hypothèse de test sera notée 𝐻0 (En général, absence de différence ou de relation). A
celle-ci s’opposera une hypothèse alternative notée 𝐻𝑎 (En général, existence de différence
ou de relation)

EXEMPLES
1. La proportion de chômeurs pour le mois de septembre était de 4,25 %. A l’heure actuelle,
le chiffre est 4,32% pour un échantillon de 200 belges.
• Question : Le taux de chômage a-t-il augmenté ?
• Hypothèse nulle : 𝐻0 : 𝜋 = 4,25
• Hypothèse alternative : 𝐻𝑎 : 𝜋 > 4,25
2. Une chaîne de fabrication produit théoriquement en moyenne 500 pièces à la minute. Une
observation faite durant 20 minutes, nous apprend que celle-ci produit 480 pièces en
moyenne à la minute.
• Question : La chaîne de fabrication fonctionne-t-elle toujours correctement ?
• Hypothèse nulle : 𝐻0 : 𝜇 = 500
• Hypothèse alternative : 𝐻𝑎 : 𝜇 ≠ 500
3. Un produit est vendu théoriquement 10€. Une lecture rapide des publicités nous montre
que sur 10 magasins ce produit se vend en moyenne à 9,40€.
• Question : Le prix a-t-il augmenté ?
• Hypothèse nulle : 𝐻0 : 𝜇 = 10
• Hypothèse alternative : 𝐻𝑎 : 𝜇 < 10
4. Un dé est lancé 1200 fois et les résultats de ces 1200 lancers sont enregistrés.
• Question : Le dé est-il pipé ?
• Hypothèse nulle : 𝐻0 : 𝑝𝑟𝑜𝑏𝑎𝑏𝑖𝑙𝑖𝑡é 𝑑𝑒 𝑐ℎ𝑎𝑞𝑢𝑒 𝑓𝑎𝑐𝑒 𝑒𝑠𝑡 𝑑𝑒 1/6
• Hypothèse alternative : 𝐻𝑎 : 𝑙𝑎 𝑝𝑟𝑜𝑏𝑎𝑏𝑖𝑙𝑖𝑡é 𝑑𝑒 𝑐ℎ𝑎𝑞𝑢𝑒 𝑓𝑎𝑐𝑒 𝑛′ 𝑒𝑠𝑡 𝑝𝑎𝑠 𝑑𝑒 1/6
5. Les résultats de l’examen de statistiques sont observés pour les classes A de 1°Compta et
1°Marketing. Le taux d’échec en 1°CP A est de 40% et de 50% en 1°MK A.
• Question : Le taux d’échec est-il plus faible en Comptabilité ?
• Hypothèse nulle : 𝐻0 : 𝜋𝐶𝑃 = 𝜋𝑀𝐾
• Hypothèse alternative : 𝐻𝑎 : 𝜋𝐶𝑃 < 𝜋𝑀𝐾

Page 135
MK211 – Statistiques inférentielles

Test unilatéral ou Test bilatéral


En fonction de l’hypothèse alternative le test sera dit soit :

• Unilatéral Droit : 𝐻𝑎 est de type >


• Unilatéral Gauche : 𝐻𝑎 est de type <
• Bilatéral : 𝐻𝑎 est de type ≠
REMARQUE

Des tests de forme tels que le test sur le dé est un test unilatéral droit.

2. Choix du test approprié :


Test paramétrique Vs Test non paramétrique
En fonction du type d’hypothèses formulées, le test à utiliser sera différent.

Il faut avant tout différencier deux types de tests : les tests paramétriques et les tests non
paramétriques. Les tests paramétriques sont valables uniquement sous certaines conditions
(forme particulière de distribution des données, …) à vérifier avant de pouvoir les exécuter,
les tests non paramétriques n’ont quant à eux pas besoin de répondre à certaines conditions
pour pouvoir être exécutés.

• Un test non paramétrique est donc valable dans un plus grand nombre de cas. Il est
plus robuste.
• Un test paramétrique doit répondre à certaines conditions, toutefois ses résultats
seront plus fiables. Il est plus puissant.

Nous préférerons donc un test paramétrique à un test non paramétrique. Toutefois, si les
conditions de test ne sont pas remplies, nous pourrons alors remplacer celui-ci par le test non
paramétrique équivalent.

3. La statistique de test
Chaque test (paramétrique ou non paramétrique) utilise une statistique de test liée à une
variable aléatoire continue particulière. Le type de variable aléatoire dépendra du type de test
mais également des résultats observés.

EXEMPLE

Test z pour une proportion (exemple n°1). La statistique de test est ici une normale réduite (Z)
𝑓−𝜋0
calculée de la façon suivante : 𝜋 (1−𝜋0 )
√ 0
𝑛

Page 136
MK211 – Statistiques inférentielles

4. Choix du seuil de risque alpha


Le processus du test nous amènera à soit accepter, soit refuser notre hypothèse 𝐻0 . Nous
pouvons nous retrouver dans les quatre cas de figures suivants :

𝐻0 est vraie 𝐻0 est fausse

Accepter
𝐻0

Refuser
𝐻0

Deux types d’erreur sont donc possibles :

• Accepter l’hypothèse alors qu’elle est fausse : c’est l’erreur de type 2, pouvant être
exprimée par une probabilité. Elle est la probabilité complémentaire de ce que l’on
appelle la puissance du test. Notre version de XLSTAT, ne nous permet pas de la
calculer.
• Refuser l’hypothèse alors qu’elle est vraie : c’est l’erreur de type 1, pouvant être
exprimée par une probabilité appelée la p-valeur. C’est le calcul de cette p-valeur qui
sera effectué dans notre test et qui nous permettra de conclure et interpréter celui-ci.
Nous allons donc choisir un seuil de risque maximum pour cette erreur de type 1. Ce seuil sera
noté 𝛼 et appelé niveau de signification.

REMARQUE

Le seuil sera au maximum de 10% et est généralement fixé à 5%. Mais des cas, comme des
expérimentations médicales, travailleront avec un risque de 1%, voire 0,5%.

Page 137
MK211 – Statistiques inférentielles

5. Exécution du test
Le test consiste à calculer :

Statistique de test Test unilatéral Test unilatéral


Test bilatéral
𝑋 gauche droit

Valeur observée 𝑥𝑜𝑏𝑠 Application de la formule de la statistique de test

Valeur Critique 𝜃 𝑃(𝑋 ≤ 𝜃) = 𝛼 𝑃(−𝜃 ≤ 𝑋 ≤ 𝜃) = 1 − 𝛼 𝑃(𝑋 ≥ 𝜃) = 𝛼

P-valeur 𝑃(𝑋 ≤ 𝑥𝑜𝑏𝑠 ) 2 × 𝑃(𝑋 ≥ |𝑥𝑜𝑏𝑠 | ) 𝑃(𝑋 ≥ 𝑥𝑜𝑏𝑠 )

EXEMPLE

Prenons l’exemple n°1 ci-dessus

𝐻0 : 𝜋 = 4,25
𝐻𝑎 : 𝜋 > 4,25

Estimation de 𝑓 = 4,32% pour un échantillon de taille 𝑛 = 200. Nous travaillerons avec un


𝑓−𝜋0
seuil 𝛼 = 5%. La statistique de test est une normale réduite 𝑍 ≅ 𝜋 (1−𝜋 )
√ 0 0
𝑛

0,0432−0,0425
Valeur observée = = 0,04907
0,0425 (1−0,0425)

200

Valeur Critique 𝑃(𝑍 ≥ 𝜃) = 0,05 ⇔ 𝜃 = 1,645

p-valeur = 𝑃(𝑍 ≥ 0,0487) = 48,04%

Page 138
MK211 – Statistiques inférentielles

6. Interprétation du résultat et réponse à la


question
Méthode de la p-valeur
Nous avons calculé la p-valeur. Si notre p-valeur une fois calculée s’avère être supérieure à
notre seuil, le risque de se tromper en rejetant notre hypothèse est alors plus important que
la limite que nous nous étions fixée. Nous ne pourrons dès lors pas la refuser et devrons la
conserver. A contrario, si celle-ci est inférieure, le risque est alors moins important que le
risque limite, nous pourrons dès lors la refuser.

• Si p-valeur < 𝛼 , on rejette l’hypothèse 𝐻0 et on accepte 𝐻𝑎 en prenant un risque p-


valeur de se tromper.
• Si p-valeur > 𝛼 , on doit théoriquement calculer la puissance du test. Si cette puissance
est élevée (>0,95), on accepte l’hypothèse 𝐻0 et on rejette 𝐻𝑎 avec un risque (1-
puissance) de se tromper. Si la puissance est faible (<0,95), on ne peut rien conclure.
Le calcul de cette puissance étant très complexe, nous conserverons toujours
l’hypothèse 𝐻0 dans ce cas.
EXEMPLE

La p-valeur est de 48,06%, elle est donc supérieure au 5%. On ne peut pas rejeter l’hypothèse
𝐻0 . On ne peut donc pas conclure à un taux de chômage inchangé.

Méthode de la valeur critique


Les hypothèses peuvent se reformuler comme une différence égale à 0. Plus simplement soit
cette différence est non significative (𝐻0 ), soit elle est significative (𝐻𝑎 ).

• La valeur critique est donc le seuil critique à dépasser pour que cette différence soit
significative.
• La valeur observée est donc le calcul de cette significativité.

• Le test est unilatéral gauche (<) : si 𝑥𝑜𝑏𝑠 < 𝜃, alors on rejette 𝐻0 .


• Le test est bilatéral (≠) : si la |𝑥𝑜𝑏𝑠 | > 𝜃, alors on rejette 𝐻0 .
• Le test est unilatéral droit (>) : si la 𝑥𝑜𝑏𝑠 > 𝜃, alors on rejette 𝐻0 .
EXEMPLE

La différence entre la proportion de notre population et la valeur de 4,32% est-elle


significative ? Elle sera significative au-delà de 1,645, or la valeur observée est plus petite,
donc ce n’est pas significatif.

Page 139
M211 – Statistiques Inférentielles

7. Statistique de test en fonction du paramètre testé

Nom du test 𝑯𝟎 Statistique de test Remarques

Test de valeur

𝑓 − 𝜋0
Test de valeur pour une 𝑍≅
𝜋 = 𝜋0 𝑛 ≥ 20
proportion √𝜋0 (1 − 𝜋0 )
𝑛

𝜇 = 𝜇0 𝑥̅ − 𝜇0 𝑛 ≥ 20
Test de valeur pour une moyenne 𝑡𝑛−1 ≅ 𝑠
𝑛−1 Nous supposons la normalité de
√𝑛 l’échantillon.

Test de comparaison

𝑓𝐴 − 𝑓𝐵 − 𝜋0 𝑛𝐴 𝑒𝑡 𝑛𝐵 ≥ 20
Test de comparaison pour 2
𝑍≅
proportions à échantillons 𝜋𝐴 − 𝜋𝐵 = 𝜋0 𝑓𝐴 (1 − 𝑓𝐴 ) 𝑓𝐵 (1 − 𝑓𝐵 ) Indépendance entre les 2 sous-
indépendants √ +
𝑛𝐴 𝑛𝐵 échantillons

Page 140
MK211 – Statistiques inférentielles

𝑥𝐴 − ̅̅̅
̅̅̅ 𝑥𝐵 − 𝜇0 𝑛 ≥ 20
𝑡𝑛−1 = 𝑠∗ Nous supposons la normalité de
Test de comparaison pour 2 √𝑛 la différence des 2 sous-
moyennes à échantillons 𝜇𝐴 − 𝜇𝐵 = 𝜇0
Où 𝑠∗ est l’estimation de l’écart- échantillon.
appariés
type de la différence des 2
Il s’agit d’un test de valeur sur la
variables
différence des 2 variables.

Test de forme

𝑛 ≥ 20

Tous les totaux du tableau de


contingence > 5
Les 2 variables sont 2
Test d’indépendance 𝜒(𝑝−1)×(𝑞−1) ≅ 𝑘ℎ𝑖² 80% des effectifs du tableau de
indépendantes
contingence > 5

Ce test est un test unilatéral


droit.

Page 141
M211 – Statistiques Inférentielles

8. Exemples et Exercices
Exemples

TEST DE VALEUR POUR UNE MOYENNE

Reprenons l’exemple de la machine de production.

𝐻0 : 𝜇 = 500

𝐻𝑎 : 𝜇 ≠ 500

𝑛 = 20 𝑒𝑡 𝑥̅ = 480
Supposons que la distribution suit une loi normale et que l’écart-type de notre échantillon est
estimé à 40,5.
480 − 500
𝑥𝑜𝑏𝑠 = = −2,2085
40,5
√20
𝑃(−𝜃 ≤ 𝑡19 ≤ 𝜃) = 0,95 ⇔ 𝑃(𝑡19 ≤ 𝜃) = 0,975 ⇔ 𝜃 = 2,093

𝑃𝑣𝑎𝑙𝑒𝑢𝑟 = 2 × 𝑃(𝑡19 ≥ |−2,2085|) = 2 × 𝑃(𝑡19 ≥ 2,2085) = 2 × 0.01985 = 3,97%

Conclusion : Nous rejetons l’hypothèse nulle. Au vue de cet échantillon, nous pouvons affirmer
que la machine ne fonctionne plus convenablement.

TEST DE COMPARAISON POUR 2 PROPORTIONS À ÉCHANTILLONS


INDÉPENDANTS

Reprenons l’exemple du taux d’échec entre les CP et les MK.

𝐻0 : 𝜋𝐶𝑃 = 𝜋𝑀𝐾

𝐻𝑎 : 𝜋𝐶𝑃 < 𝜋𝑀𝐾

𝑛𝐶𝑃 = 25, 𝑛𝑀𝐾 = 28, 𝑓𝐶𝑃 = 40% 𝑒𝑡 𝑓𝑀𝐾 = 50%


La différence des 2 proportions est donc ici égale à 0:
0,4 − 0,5 − 0
𝑥𝑜𝑏𝑠 = = −0,7346
√0,4(1 − 0,4) + 0,5(1 − 0,5)
25 28
𝑃(𝑍 ≤ 𝜃) = 0,05 ⇔ 𝜃 = −1,6448

𝑃𝑣𝑎𝑙𝑒𝑢𝑟 = 𝑃(𝑍 ≤ −0,7346) = 23,13%


Conclusion : Nous ne pouvons pas rejeter l’hypothèse. Au vue de ces 2 échantillons, nous ne
pouvons pas affirmer que le taux d’échec est plus important en Marketing.

Page 142
MK211 – Statistiques inférentielles

TEST DE COMPARAISON POUR 2 MOYENNES À ÉCHANTILLONS APPARIÉS


Lors d’une enquête sur une nouvelle plateforme de streaming, nous avons demandé
l’intention de prix pour l’abonnement basic ainsi que pour l’abonnement premium. Les
personnes ayant répondus aux deux questions sont au nombre de 425 et nous ont donné des
moyennes respectives de 20,4€/mois et de 37,2€/mois. Ce qui nous donne une différence
estimée à 16,8€/mois. L’écart-type estimé pour cette différence étant de 3,25€/mois.
Pouvons-nous envisager une différence entre les 2 prix de l’ordre de 15€/mois ou supérieure.

𝐻0 : 𝜇𝑃𝑟𝑒𝑚𝑖𝑢𝑚 − 𝜇𝐵𝑎𝑠𝑖𝑐 = 15

𝐻0 : 𝜇𝑃𝑟𝑒𝑚𝑖𝑢𝑚 − 𝜇𝐵𝑎𝑠𝑖𝑐 > 15

Calculons nos différents éléments :


37,2 − 20,4 − 15
𝑥𝑜𝑏𝑠 = = 11,4178
3,25
√425
𝑃(𝑡424 ≥ 𝜃) = 0,05 ⇔ 𝜃 = 1,6485

𝑃𝑣𝑎𝑙𝑒𝑢𝑟 = 𝑃(𝑡424 ≥ 11,4178) < 0,0001

Conclusion : Nous devons rejeter l’hypothèse nulle. Nous pouvons donc pas établir un écart
de l’ordre de 15€/mois entre le prix des 2 abonnements.

TEST D’INDÉPENDANCE ENTRE 2 VARIABLES


Nous aimerions savoir si la tranche d’âge influence le type d’achat en matière téléphone
portable. Voici le tableau de contingence illustrant ce croisement :

Apple Samsung Xiaomi Google Autres Total


Moins de 18 ans 52 10 5 21 9 97
Entre 18 ans et 30 ans 45 15 2 20 5 87
Entre 31 ans et 45 ans 42 22 15 15 8 102
Entre 46 ans et 65 ans 25 32 10 28 4 99
Plus de 65 ans 15 21 9 19 10 74
Total 179 100 41 103 36 459

Le khi² total est de 54,58 et un V Cramer estimé à 17,24%. Ce qui montre une influence mais
relativement légère. En est-il de même pour notre population ?

Les conditions de test sont bien remplies : tous les totaux sont supérieurs à 5, et au moins
80% (21 sur 25, 82%) des effectifs sont supérieur à 5.

𝑥𝑜𝑏𝑠 = 54,58
2
𝑃(𝜒16 ≥ 𝜃) = 0.05 ⇔ 26,30
2
𝑃𝑣𝑎𝑙𝑒𝑢𝑟 = 𝑃(𝜒16 ≥ 54,58) < 0,0001
Conclusion : Nous devons rejeter l’hypothèse. Cet échantillon nous permet de conclure à une
dépendance entre les deux variables au sein de notre population.

Page 143
MK211 – Statistiques inférentielles

Exercices
1) Un professeur estime que 70% de ses étudiants réussiront l’examen de fin d’année, alors
que ses collègues sont plus pessimistes. Il interroge 25 élèves au hasard : 16 ont un résultat
supérieur à la moitié. Au seuil 𝛼 = 4%, à qui cette expérience donne-t-elle raison ?
2)
a) Sur 25 personnes choisies au hasard, 8 ont les yeux bleus. Ces observations
confirment-elles l’hypothèse selon laquelle une personne sur quatre a les yeux
bleus (𝛼 = 5%)?
b) Sur 300 personnes interrogées choisies au hasard, 96 ont les yeux bleus. Que pouvons-
nous en conclure (𝛼 = 5%)?
c) Comparer les deux conclusions.
3) Dans une enquête sur les fumeurs, un expérimentateur trouve que parmi 100 hommes, il
y a 22 fumeurs et parmi 100 femmes, il y en a 18. Peut-il affirmer, au seuil 𝛼 = 3%, qu’il y
a moins de femmes qui fument que les hommes ?
4) Tenons compte des données suivantes reprenant le prix de 2 produits dans 25 points de
vente.

Prix pour Prix pour


produit A produit B
101,02 131,65
84,48 167,43
125,43 170,71
115,14 129,30
121,53 152,64
89,24 179,94
125,43 120,81
110,44 163,13
112,88 135,94
125,78 145,36
134,87 158,85
154,41 183,42
84,39 127,81
159,33 174,45
128,93 187,00
120,72 119,07
167,79 156,75
99,64 156,63
125,40 141,12
121,74 168,36
113,77 136,56
113,67 129,25
144,86 111,27
93,09 142,99
59,45 142,16

Page 144
MK211 – Statistiques inférentielles

En supposant que les distributions suivent une loi normale, et un seuil 𝛼 = 5%, pouvons-nous
croire à une différence moyenne de 30€ entre les deux produits ?

5) Nous considérons habituellement que le poids des bébés à la naissance est en moyenne
de 3,4 kg. Nous suspectons cependant que dans le cas où la maman est diabétique, cette
moyenne soit plus élevée. Sur 25 enfants nés de mère diabétique, nous observons un poids
moyen de 3,64 kg pour un écart-type de 0,5kg. Au seuil 𝛼 = 5%, pouvons-nous conclure
que notre idée est juste ?
6) Deux groupes A et B se composent respectivement de 100 et 300 personnes atteintes
d’une certaine maladie. Un sérum est donné au groupe A mais pas au groupe B. Pour le
reste, ils suivent le même traitement. Au bout de celui-ci, nous constatons que
respectivement 75 et 195 personnes guérissent de la maladie. Au seuil 𝛼 = 1%, pouvons-
nous conclure que le sérum est efficace ?
7) Sur un échantillon de 250 étudiants, nous observons que 120 seraient enclins à acheter
notre produit. Tandis que sur un échantillon de 250 personnes ayant un travail, ce nombre
monte à 200. Pouvons-nous conclure à écart entre ces deux proportions de l’ordre de 30%
(𝛼 = 10%) ?
8) Nous aimerions savoir si le nombre de crédits réussis en Bac 1 pourrait être influencer par
le fait de kotter ou pas. Voici le croisement réalisé sur un échantillon d’étudiants de Bac 2
choisis aléatoirement.

Moins de Entre 30 et Entre 45 et Entre 55 et


60 crédits Total
30 crédits 44 crédits 54 crédits 59 crédits
Kotteur 45 10 24 26 32 137
Non kotteur 42 12 28 19 33 134
Total 87 22 52 45 65 271

Effectuer le test adéquat pour un seuil 𝛼 = 7%

Page 145
M311 – Statistiques Inférentielles

CHAPITRE 2 : EXERCICES DE RAPPEL


Exercices généraux sur les tests

FORMULATION DES HYPOTHÈSES


1) Objectif général du sondage : Etudier l’évolution de la population belge en 2020 en fonction de leur état civil, de leur sexe et de leur âge.

Données de notre enquête sur un échantillon de 80 personnes au 01 septembre 2020 :


Khi² par case (Etat civil / Sexe) :
Statistique Age Age | Féminin Age | Masculin
Nb. d'observations 80 42 38 Féminin Masculin Total
Minimum 20,000 20,000 25,000 Célibataire 0,573 0,634 1,207
Maximum 85,000 82,000 85,000 Divorcé 0,096 0,106 0,202
Moyenne 50,325 48,095 52,789 Marié 0,048 0,053 0,101
Variance (n-1) 334,020 307,796 360,225
Veuf 0,372 0,411 0,783
Ecart-type (n-1) 18,276 17,544 18,980
Total 1,089 1,204 2,293

Statistique\Variable Etat civil Etat civil | Féminin Etat civil | Masculin


Nb. d'observations 80 42 38
Mode Marié Marié Veuf
Mode (effectif) 27 15 12
Modalités Célibataire Divorcé Marié Veuf Célibataire Divorcé Marié Veuf Célibataire Divorcé Marié Veuf
Effectif par modalité 15 17 27 21 10 8 15 9 5 9 12 12
Fréquence par modalité (%) 18,75 21,25 33,75 26,25 23,81 19,05 35,71 21,43 13,16 23,68 31,58 31,58

Page 146
M311 – Statistiques Inférentielles

Pour les tests suivants cochez les hypothèses correctement formulées.

Tests de valeurs7

Objectif : La proportion de personne veuve a-t-elle changée depuis 2019 ?

o 𝐻0 : 𝜋𝑉𝑒𝑢𝑓 = 6,08%
𝐻𝑎 : 𝜋𝑣𝑒𝑢𝑓 ≠ 6,08%

o 𝐻0 : 𝜋𝑉𝑒𝑢𝑓 = 26,25%
𝐻𝑎 : 𝜋𝑉𝑒𝑢𝑓 ≠ 26,25%

Objectif : L’âge moyen a-t-il augmenté ou diminué par rapport à 2019 ?

o 𝐻0 : 𝜇â𝑔𝑒 = 40,35
𝐻𝑎 : 𝜇â𝑔𝑒 > 40,35

o 𝐻0 : 𝜇â𝑔𝑒 = 50,325
𝐻𝑎 : 𝜇â𝑔𝑒 < 50,325

Tests de comparaison

Objectif : La proportion de personnes mariées est-elle identique au sein de chaque sexe, ou au


contraire il y -a-t-il un sexe pour lequel cette proportion est plus grande ?

o 𝐻0 : 𝜋 𝑚𝑎𝑟𝑖é𝑒|𝑓 = 𝜋𝑚𝑎𝑟𝑖é|ℎ
𝐻𝑎 : 𝜋𝑚𝑎𝑟𝑖é𝑒|𝑓 < 𝜋𝑚𝑎𝑟𝑖é|ℎ

o 𝐻0 : 𝜋 𝑚𝑎𝑟𝑖é𝑒|𝑓 = 𝜋𝑚𝑎𝑟𝑖é|ℎ
𝐻𝑎 : 𝜋𝑚𝑎𝑟𝑖é𝑒|𝑓 > 𝜋𝑚𝑎𝑟𝑖é|ℎ

o 𝐻0 : 𝜋𝑚𝑎𝑟𝑖é𝑒|𝑓 = 𝜋𝑚𝑎𝑟𝑖é|ℎ
𝐻𝑎 : 𝜋𝑚𝑎𝑟𝑖é𝑒|𝑓 ≠ 𝜋𝑚𝑎𝑟𝑖é|ℎ

Objectif : En moyenne, il y a-t-il un sexe plus âgé que l’autre ?

o 𝐻0 : 𝜇â𝑔𝑒 𝑓𝑒𝑚𝑚𝑒𝑠 = 𝜇â𝑔𝑒 ℎ𝑜𝑚𝑚𝑒𝑠


𝐻𝑎 : 𝜇â𝑔𝑒 𝑓𝑒𝑚𝑚𝑒𝑠 > 𝜇â𝑔𝑒 ℎ𝑜𝑚𝑚𝑒𝑠

o 𝐻0 : 𝜇â𝑔𝑒 𝑓𝑒𝑚𝑚𝑒𝑠 = 𝜇â𝑔𝑒 ℎ𝑜𝑚𝑚𝑒𝑠


𝐻𝑎 : 𝜇â𝑔𝑒 𝑓𝑒𝑚𝑚𝑒𝑠 < 𝜇â𝑔𝑒 ℎ𝑜𝑚𝑚𝑒𝑠

7 Les données concernant la population de référence (2019) se trouve à la fin de cet énoncé.
Page 147
MK311 – Statistique Inférentielle

Objectif : Quantifier la différence entre la proportion d’hommes divorcés et de femmes divorcées ?

o 𝐻0 : 𝜋 𝑑𝑖𝑣𝑜𝑟𝑐é|ℎ − 𝜋 𝑑𝑖𝑣𝑜𝑟𝑐é𝑒|𝑓 = 4%
𝐻𝑎 : 𝜋 𝑑𝑖𝑣𝑜𝑟𝑐é|ℎ − 𝜋 𝑑𝑖𝑣𝑜𝑟𝑐é𝑒|𝑓 > 4%

o 𝐻0 : 𝜋 𝑑𝑖𝑣𝑜𝑟𝑐é|ℎ − 𝜋𝑑𝑖𝑣𝑜𝑟𝑐é𝑒|𝑓 = 4%
𝐻𝑎 : 𝜋𝑑𝑖𝑣𝑜𝑟𝑐é|ℎ − 𝜋𝑑𝑖𝑣𝑜𝑟𝑐é𝑒|𝑓 < 4%

Objectif : Comparaison des modalités de la variable état-civil.

o 𝐻0 : 𝜋𝑑𝑖𝑣𝑜𝑟𝑐é = 𝜋𝑚𝑎𝑟𝑖é
𝐻𝑎 : 𝜋𝑑𝑖𝑣𝑜𝑟𝑐é ≠ 𝜋𝑚𝑎𝑟𝑖é

o 𝐻0 : 𝜋𝑑𝑖𝑣𝑜𝑟𝑐é = 𝜋𝑚𝑎𝑟𝑖é = 𝜋𝑣𝑒𝑢𝑓 = 𝜋𝐶é𝑙𝑖𝑏𝑎𝑡𝑎𝑖𝑟𝑒


𝐻𝑎 : 𝐴𝑢 𝑚𝑜𝑖𝑛𝑠 𝑢𝑛𝑒 𝑒𝑠𝑡 𝑑𝑖𝑓𝑓é𝑟𝑒𝑛𝑡𝑒 𝑑𝑒𝑠 𝑎𝑢𝑡𝑟𝑒𝑠

o 𝐻0 : 𝜋𝑑𝑖𝑣𝑜𝑟𝑐é = 𝜋𝑚𝑎𝑟𝑖é = 𝜋𝑣𝑒𝑢𝑓 = 𝜋𝐶é𝑙𝑖𝑏𝑎𝑡𝑎𝑖𝑟𝑒


𝐻𝑎 : 𝐸𝑙𝑙𝑒𝑠 𝑠𝑜𝑛𝑡 𝑡𝑜𝑢𝑡𝑒𝑠 𝑑𝑖𝑓𝑓é𝑟𝑒𝑛𝑡𝑒𝑠

Tests de forme

Objectif : Pouvons-nous parler d’indépendance entre deux variables ?

o 𝐻0 : 𝐿𝑒 𝑠𝑒𝑥𝑒 𝑒𝑡 𝑙′â𝑔𝑒 𝑠𝑜𝑛𝑡 𝑖𝑛𝑑é𝑝𝑒𝑛𝑑𝑎𝑛𝑡𝑠


𝐻𝑎 : 𝐿𝑒 𝑠𝑒𝑥𝑒 𝑒𝑡 𝑙 ′ â𝑔𝑒 𝑠𝑜𝑛𝑡 𝑑é𝑝𝑒𝑛𝑑𝑎𝑛𝑡𝑠

o 𝐻0 : 𝐿𝑒 𝑠𝑒𝑥𝑒 𝑒𝑡 𝑙 ′ é𝑡𝑎𝑡 𝑐𝑖𝑣𝑖𝑙 𝑠𝑜𝑛𝑡 𝑖𝑛𝑑é𝑝𝑒𝑛𝑑𝑎𝑛𝑡𝑠


𝐻𝑎 : 𝐿𝑒 𝑠𝑒𝑥𝑒 𝑒𝑡 𝑙 ′ é𝑡𝑎𝑡 𝑐𝑖𝑣𝑖𝑙 𝑠𝑜𝑛𝑡 𝑑é𝑝𝑒𝑛𝑑𝑎𝑛𝑡𝑠

Données de référence pour la population belge au 01 janvier 2019 :

• L’âge moyen est de 40,35 ans.


• L’âge moyen des femmes est de 41,6 ans et l’âge moyen des hommes est de 39 ans.
• La répartition homme-femme est de 49% - 51%.
• Sexe et état-civil en proportion :

Célibataire Marié Veuf Divorcé Total


Femmes 22,171 18,883 4,843 4,959 50,856
Hommes 25,006 18,882 1,241 4,015 49,144
Total 47,178 37,766 6,083 8,973 100,000

Page 148
MK311 – Statistique Inférentielle

LIEN VALEUR CRITIQUE-VALEUR OBSERVÉE ET P-VALEUR EN FONCTION D’ALPHA


2) Voici les données d’un test appelé test z pour une proportion :

• L’échantillon est de taille 𝑛 = 500


• La valeur observée 𝑓 = 60%
• 𝐻0 : 𝜋 = 57%
𝐻𝑎 : 𝜋 > 57%
Effectuez le test et donnez-en la conclusion pour 𝛼 = 5%.

3) Voici les données d’un t-test sur une moyenne :

• Une moyenne et un écart-type observé de : 𝑥̅ = 50,325 𝑒𝑡 𝑠𝑛−1 = 18,276


• L’échantillon est de taille 𝑛 = 80
• 𝐻0 : 𝜇 = 52
𝐻𝑎 : 𝜇 < 52
Effectuez le test et donnez-en la conclusion pour 𝛼 = 5%.

BILATÉRAL VS UNILATÉRAL
4) Vrai ou Faux ?
Si un test bilatéral rejette l’hypothèse nulle, alors le test unilatéral correspondant la rejette
également.
o Vrai
o Faux
Si un test unilatéral rejette l’hypothèse nulle, alors le test bilatéral correspondant la rejette
également.
o Vrai
o Faux
Si un test bilatéral accepte l’hypothèse nulle, alors le test unilatéral correspondant l’accepte
également.
o Vrai
o Faux
Si un test unilatéral accepte l’hypothèse nulle, alors le test bilatéral correspondant l’accepte
également.
o Vrai
o Faux

Page 149
MK311 – Statistique Inférentielle

ECHANTILLONS INDÉPENDANTS VS ECHANTILLONS APPAR IÉS


• Si les valeurs d'un échantillon influencent les valeurs de l'autre, les échantillons sont
dépendants.
• Si les valeurs d'un échantillon n'apportent aucune information concernant celles de
l'autre, les échantillons sont indépendants.

5) Pour les cas suivants, donnez le type d’échantillons :

On observe 2 groupes de patients (des malades et des sains) afin de connaître leur réaction à
un certain médicament.
o Indépendants
o Appariés
On observe le budget moyen loisirs des femmes et celui des hommes, afin de savoir qui
dépense le plus.
o Indépendants
o Appariés
On observe le budget moyen loisirs et le budget moyen alimentation, afin d’identifier le plus
petit budget.
o Indépendants
o Appariés
On observe la réaction à 2 médicaments sur un échantillon de 50 patients.
o Indépendants
o Appariés
On observe l’âge des enfants et l’âge des adultes se rendant dans un magasin, afin de
comparer leur moyenne.
o Indépendants
o Appariés
On observe l’âge d’une mère et de son enfant, afin de comparer leur moyenne.
o Indépendants
o Appariés
On observe le nombre de personnes intéressées par un produit et par un second.
o Indépendants
o Appariés
On observe le nombre d’étudiants intéressés par notre produit et le nombre d’enseignants
intéressés par notre produit.
o Indépendants
o Appariés

Page 150
MK311 – Statistique Inférentielle

CHAPITRE 3 : APPLICATION DES


DIFFÉRENTS TESTS
Nous allons maintenant regarder chacun de ces tests. Nous partirons d’un sondage réalisé à
l’IESN sur un échantillon de 240 étudiants. Sondage portant sur l’implantation au sein de
l’école, d’un centre d’aide aux études « Studhelp ». Ce centre géré par des étudiants
proposera :

• Un échange et un partage de notes de cours via un système en ligne.


• La publication et la vente de livres reprenant des notes de cours, des exercices
solutionnés, etc.
• La mise en place de cours particuliers payants.
• La réalisation et la diffusion de tutoriels vidéo via une chaîne internet payante
(15€/mois).

La formulation des questions apparaîtra clairement pour chacun des tests. Elles sont toutes
basées sur l’intérêt et le budget de la population pour les différents services proposés. Toutes
les variables observées lors de ce sondage ont été définies en fonction de ces différentes
questions. Nous avons bien suivi la démarche expliquée sur la page précédente.

Les données du sondage, ainsi que tous les tests se trouvent dans un fichier Excel
(«Studhelp »). Pour chaque test, nous formulerons la question, les hypothèses, la conclusion
et autres remarques si nécessaires. La démarche XLSTAT sera expliquée et exécutée au cours.
Elle se trouve également sur les vidéos. Tous les tests seront effectués avec un seuil de
signification 𝛼 = 5%.

Voici les différentes questions posées lors de ce sondage :

• Dans quelle section êtes-vous inscrit ?


• Dans quel bloc êtes-vous inscrit ?
• Quel est votre âge ?
• Quel est votre sexe ?
• Etes-vous intéressé par un système d’échange de notes ?
o Oui
o Non
• Si oui, vous êtes intéressé par :
o Prêter mes notes.
o Bénéficier des notes des autres étudiants.
o Les deux.
• Etes-vous intéressé par l’achat de livres reprenant les notes de cours ?
o Oui
o Non
• Si oui, quel budget êtes-vous prêt à mettre pour ce type de livres ?

Page 151
MK311 – Statistique Inférentielle

• Etes-vous intéressé par l’achat de livres reprenant des exercices, ainsi que leurs
solutions ?
o Oui
o Non
• Si oui, quel budget êtes-vous prêt à mettre pour ce type de livres?
• Etes-vous intéressé par la possibilité d’avoir des cours particuliers ?
o Oui, si donnés par un enseignant.
o Oui, si donnés par un étudiant.
o Oui, quel que soit le professeur.
o Non
• Si oui, quel budget êtes-vous prêt à mettre pour une heure de cours donnée par un
enseignant ?
• Si oui, quel budget êtes-vous prêt à mettre pour une heure de cours donnée par un
étudiant ?
• Nous proposerons trois types différents de tutoriels vidéo : des tutoriels vidéo sur les cours
théoriques, des tutoriels vidéo sur la réalisation d’exercices et des tutoriels vidéo sur la
méthode de travail. Pour chaque type différent de tutoriel, à partir de quelle limite de
temps (en minutes) jugez-vous celui-ci trop long et donc inefficace ?
• Cours théorique : …..
• Exercices : …..
• Méthode de travail : …..
• Le prix de l’abonnement de 15€ par mois pour la chaîne internet, vous semble :
o Trop bon marché.
o Correct.
o Trop cher.

Page 152
MK311 – Statistique Inférentielle

1. Tests sur les variables qualitatives


Comparaison d'une proportion observée avec une proportion
théorique-test de valeur pour une proportion 8

EXEMPLE 1

L’hébergement du site proposant l’échange de notes sera gratuit si


au moins la moitié des étudiants participe à cet échange. Peut-on
espérer ne rien dépenser ?

Proportion d’étudiants interrogés intéressés f=44,17%

𝐻0 : 𝜋 = 0,5 ⇔ 𝜋 − 0,5 = 0

𝐻𝑎 : 𝜋 < 0,5 ⇔ 𝜋 − 0,5 < 0

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


inférieur à 3,06%.

Nous devons rejeter celle-ci. L’hébergement du site sera dès lors


payant.

L’échantillon doit être de taille supérieure à 20.

2 statistiques de test sont proposées :

𝑓−𝜋
• 𝑍≡ proportion test
𝜋(1−𝜋)

𝑛
𝑓−𝜋
• 𝑍≡ effectif
𝑓(1−𝑓)

𝑛

La première doit être utilisée lorsque la différence supposée n’est


pas égale à 0.

La correction de continuité proposée apporte plus de précision.

8 Paramétrique

Page 153
MK311 – Statistique Inférentielle

EXEMPLE 2

Les responsables espèrent avoir trouvé le juste prix pour


l’abonnement aux tutoriels. Ils espèrent dès lors que un tiers des
étudiants trouvent ce prix correct.

Proportion d’étudiants interrogés jugeant le prix correct f=35,84%.

1
𝐻0 : 𝜋 =
3
1
𝐻𝑎 : 𝜋 >
3

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


de 22,56%.

Nous conservons donc celle-ci, il y a donc dans notre population un


tiers des étudiants qui jugent le prix correct.

L’échantillon doit être de taille supérieure à 20.

Page 154
MK311 – Statistique Inférentielle

Si nous posons une question en laissant la possibilité de choisir plusieurs


réponses, la taille de notre échantillon augmente. La proportion se calculera
donc par rapport à cette nouvelle taille et non par rapport à la taille de
l’échantillon initial.

EXEMPLE

Nous interrogeons cinq personnes afin de connaître la (ou les) couleur(s) qu’elles préfèrent
pour une voiture. Les réponses enregistrées sont les suivantes :

Observation Couleurs
Obs 1 Vert ; Rouge
Bleu ; Blanc;
Obs 2
Rouge
Obs 3 Noir ; Gris
Obs 4 Noir
Obs 5 Rouge ; Noir

Nous n’avons pas cinq réponses, mais bien dix. La taille de notre échantillon est donc de dix,
3
la proportion de Noir est donc de 10 = 30%.

Une méthode simple pour revenir à un tableau comportant une seule colonne avec une
modalité par ligne est :

Premièrement : Sous l’onglet Données d’Excel, utiliser « convertir » et suivre les instructions.
Cela permettra d’avoir une modalité par cellule.

Observation Couleurs
Obs 1 Vert Rouge
Obs 2 Bleu Blanc Rouge
Obs 3 Noir Gris
Obs 4 Noir
Obs 5 Rouge Noir

Page 155
MK311 – Statistique Inférentielle

Deuxièmement : coller la deuxième colonne à la suite de la première colonne et faire de


même avec les suivantes.

Couleurs
Vert
Bleu
Noir
Noir
Rouge
Rouge
Blanc
Gris

Noir

Rouge

Troisièmement : supprimer les cellules vides.

Couleurs
Vert
Bleu
Noir
Noir
Rouge
Rouge
Blanc
Gris
Noir
Rouge

Page 156
MK311 – Statistique Inférentielle

Comparaison de 2 proportions observées (échantillons


indépendants) 9

EXEMPLE 1

L’intérêt pour l’échange de notes est-il plus grand en fonction du


sexe ?

Sur les 78 (𝑛1 ) filles interrogées 𝑓1 =51,28% sont intéressées, sur 162
(𝑛2 ) garçons interrogés 𝑓2 =40,74% sont intéressés.

𝐻0 : 𝜋é𝑡𝑢𝑑𝑖𝑎𝑛𝑡𝑒𝑠 = 𝜋é𝑡𝑢𝑑𝑖𝑎𝑛𝑡𝑠 ⇔ 𝜋é𝑡𝑢𝑑𝑖𝑎𝑛𝑡𝑒𝑠 − 𝜋é𝑡𝑢𝑑𝑖𝑎𝑛𝑡𝑠 = 0

𝐻𝑎 : 𝜋é𝑡𝑢𝑑𝑖𝑎𝑛𝑡𝑒𝑠 > 𝜋é𝑡𝑢𝑑𝑖𝑎𝑛𝑡𝑠 ⇔ 𝜋é𝑡𝑢𝑑𝑖𝑎𝑛𝑡𝑒𝑠 − 𝜋é𝑡𝑢𝑑𝑖𝑎𝑛𝑡𝑠 > 0

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


de 8,07%.

Nous conservons dès lors celle-ci. Les étudiantes ne sont pas plus
intéressées par l’échange de notes que les étudiants.

Notre p-valeur n’est pas très éloignée de notre seuil


significatif, ce résultat est donc à prendre avec un peu de recul.

Les 2 échantillons doivent être de taille supérieure à 20 et


indépendants.

2 statistiques de test sont proposées :

𝑓1 −𝑓2
• 𝑍≡ 𝑓 (1−𝑓1 ) 𝑓2 (1−𝑓2 )
√ 1 +
𝑛1 𝑛2
𝑓1 −𝑓2
• 𝑍≡ 1 1
√𝑓𝑚𝑜𝑦𝑒𝑛 (1−𝑓𝑚𝑜𝑦𝑒𝑛 )(𝑛 +𝑛 )
1 2

La première est la plus utilisée.

9 Paramétrique

Page 157
MK311 – Statistique Inférentielle

EXEMPLE 2

Quantifions l’écart entre la proportion d’étudiants du bloc 1 et du


bloc 2 intéressés par des livres de notes théoriques ?

Sur les 64 (𝑛1 ) étudiants du bloc 1 interrogés 𝑓1 =43,75% sont


intéressés, sur 96 (𝑛2 ) étudiants du bloc 2 interrogés 𝑓2 =54,17%
sont intéressés. On observe 10,42% d’écart.

𝐻0 : 𝜋𝑏𝑙𝑜𝑐2 − 𝜋𝑏𝑙𝑜𝑐1 = 0,1

𝐻𝑎 : 𝜋𝑏𝑙𝑜𝑐2 − 𝜋𝑏𝑙𝑜𝑐1 ≠ 0,1

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


de 100,00%.

Nous devons donc conserver celle-ci. Il y a donc 10% d’écart entre


nos deux proportions au sein des blocs 1 et 2 de l’IESN. Un système
de parrainage des étudiants du bloc 1 par les étudiants du bloc 2
serait donc peut-être une bonne idée, afin que les nouveaux
étudiants se rendent compte de l’importance d’avoir des notes
théoriques correctes.

Les 2 échantillons doivent être de taille supérieure à 20 et


indépendants.

La p-valeur calculée est ici de 100%. En effet, l’écart observé ici est
très proche de l’écart théorique.

Page 158
MK311 – Statistique Inférentielle

Comparaison de plusieurs proportions observées (échantillons


indépendants) 10

EXEMPLE 1

La proportion d’étudiants intéressés par l’échange de notes est-il


identique au sein de chaque bloc ?

Non Oui Total


Bloc 1 53,13 46,88 100
Bloc 2 56,25 43,75 100
Bloc 3 57,50 42,50 100
Total 55,83 44,17 100

Indice de Cramer pour l’échantillon = 3,46%

𝐻0 : 𝜋𝑏𝑙𝑜𝑐1 = 𝜋𝑏𝑙𝑜𝑐2 = 𝜋𝑏𝑙𝑜𝑐3

𝐻𝑎 : 𝐼𝑙 𝑦 𝑎 𝑎𝑢 𝑚𝑜𝑖𝑛𝑠 𝑢𝑛𝑒 𝑝𝑟𝑜𝑝𝑜𝑟𝑡𝑖𝑜𝑛 𝑑𝑖𝑓𝑓é𝑟𝑒𝑛𝑡𝑒 𝑑𝑒𝑠 𝑎𝑢𝑡𝑟𝑒𝑠

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


de 86,62%.

Nous conservons dès lors celle-ci. La proportion d’étudiants


intéressés par l’échange de notes est identique au sein de chaque
bloc. Il faut donc prévoir 3 espaces de stockage identiques sur le site
d’échange de notes. Nous pouvons également affirmer que le bloc
n’influence pas l’intérêt pour cet échange de notes.

10 Paramétrique

Page 159
MK311 – Statistique Inférentielle

Les échantillons doivent être de taille supérieure à 20 et


indépendants.

Il s’agit ici d’un test unilatéral droit. On regarde si la différence entre


les proportions observées et les proportions théoriques est nulle ou
supérieure à zéro.

Les résultats du test du Khi² (on teste ici l’indépendance entre le bloc
et l’intérêt. S’il y a indépendance alors le bloc n’influence pas
l’intérêt, on peut donc croire à une répartition homogène. S’il n’y a
pas indépendance, alors le bloc influence l’intérêt, il y aura donc des
répartitions différentes) sont affichés en premier si l'option
correspondante a été activée. Pour le test du Khi² et la méthode
Monte Carlo, la p-value est comparée au niveau de signification afin
de valider ou non l'hypothèse nulle.

Les résultats obtenus à partir des simulations Monte Carlo seront


d'autant plus proches des résultats du test du Khi² que les effectifs
totaux et le nombre de simulations sont élevés. La différence se
manifeste au niveau de la valeur critique et de la p-value.

La procédure de Marascuilo permet d'identifier quelles sont les


proportions responsables de l'éventuel rejet de l'hypothèse nulle.
Dans la colonne « Significatif » on peut identifier quelles proportions
sont significativement différentes deux à deux.

Page 160
MK311 – Statistique Inférentielle

EXEMPLE 2

Nous aimerions savoir également si la proportion d’étudiants


intéressés par des cours particuliers donnés par un enseignant est
identique quel que soit l’âge.

En fonction de l’âge, nous avons bien des échantillons indépendants,


mais ceux-ci ne sont pas tous de taille supérieure à 20. Il a donc fallu
dans un premier temps regrouper certains étudiants interrogés.
Nous avons ainsi créé une classe de jeunes (≤ 18) et une classe de
vieux (≥ 24).

Oui, Oui, les Oui,


Non enseignant deux étudiant Total
19 16,00 40,00 20,00 24,00 100
20 26,92 26,92 23,08 23,08 100
21 4,44 51,11 31,11 13,33 100
22 25,00 8,33 25,00 41,67 100
23 28,00 8,00 16,00 48,00 100
Jeune 25,00 33,33 33,33 8,33 100
Vieux 35,00 25,00 0,00 40,00 100
Total 20,83 30,83 22,50 25,83 100

Indice de Cramer pour l’échantillon = 25,99%

𝐻0 : 𝐿𝑒𝑠 𝑝𝑟𝑜𝑝𝑜𝑟𝑡𝑖𝑜𝑛𝑠 𝑠𝑜𝑛𝑡 é𝑔𝑎𝑙𝑒𝑠 𝑒𝑛𝑡𝑟𝑒 𝑒𝑙𝑙𝑒𝑠

𝐻𝑎 : 𝐼𝑙 𝑦 𝑎 𝑎𝑢 𝑚𝑜𝑖𝑛𝑠 𝑢𝑛𝑒 𝑝𝑟𝑜𝑝𝑜𝑟𝑡𝑖𝑜𝑛 𝑑𝑖𝑓𝑓é𝑟𝑒𝑛𝑡𝑒 𝑑𝑒𝑠 𝑎𝑢𝑡𝑟𝑒𝑠

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


inférieur à 0,02%.

Nous pouvons dès lors rejeter celle-ci et affirmer que les proportions
ne sont pas identiques en fonction de l’âge. La procédure de
Marascuilo nous permet de cerner au mieux cet intérêt en fonction
de l’âge.

Page 161
MK311 – Statistique Inférentielle

Les échantillons doivent être de taille supérieure à 20 et


indépendants.

Procédure de Marascuilo.

Contraste Valeur Valeur critique Significatif


|p(19) - p(20)| 0,131 0,329 Non
|p(19) - p(21)| 0,111 0,361 Non
|p(19) - p(22)| 0,317 0,317 Non
|p(19) - p(23)| 0,320 0,312 Oui
|p(19) - p(Jeune)| 0,067 0,421 Non
|p(19) - p(Vieux)| 0,150 0,422 Non
|p(20) - p(21)| 0,242 0,343 Non
|p(20) - p(22)| 0,186 0,296 Non
|p(20) - p(23)| 0,189 0,291 Non
|p(20) - p(Jeune)| 0,064 0,405 Non
|p(20) - p(Vieux)| 0,019 0,407 Non
|p(21) - p(22)| 0,428 0,332 Oui
|p(21) - p(23)| 0,431 0,327 Oui
|p(21) - p(Jeune)| 0,178 0,432 Non
|p(21) - p(Vieux)| 0,261 0,434 Non
|p(22) - p(23)| 0,003 0,278 Non
|p(22) - p(Jeune)| 0,250 0,396 Non
|p(22) - p(Vieux)| 0,167 0,398 Non
|p(23) - p(Jeune)| 0,253 0,392 Non
|p(23) - p(Vieux)| 0,170 0,394 Non
|p(Jeune) - p(Vieux)| 0,083 0,484 Non

Echantillon Proportion Groupes


23 0,080 A
22 0,083 A B
Vieux 0,250 A B C
20 0,269 A B C
Jeune 0,333 A B C
19 0,400 B C
21 0,511 C

Page 162
MK311 – Statistique Inférentielle

Comparaison de 2 proportions observées (échantillons


dépendants ou appariés) – test de Mc Nemar 11

EXEMPLE 1

Parmi les étudiants intéressés par l’échange de notes, les


proportions d’étudiants comptant prêter celles-ci et d’étudiants
comptant en bénéficier sont-elles identiques ?

Un tableau de contingence reprenant ces données doit être réalisé.

Bénéfice Bénéfice Total


Prêter 40 34 74
Prêter 32 134 166
Total 72 168 240

𝐻0 : 𝜋𝑝𝑟ê𝑡𝑒𝑟 = 𝜋𝑏é𝑛é𝑓𝑖𝑐𝑖𝑒𝑟

𝐻𝑎 : 𝜋𝑝𝑟ê𝑡𝑒𝑟 ≠ 𝜋𝑏é𝑛é𝑓𝑖𝑐𝑖𝑒𝑟

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


de 90,20%.

Nous conservons dès lors celle-ci. Les deux proportions étant


identiques au sein de l’IESN, l’accès au site d’échange ne sera donc
pas payant.

La taille de l’échantillon doit être supérieure à 20.

La variable est toujours une variable binaire. Si pas, il faut la


transformer en variable binaire. Il est toujours plus simple de créer
le tableau de contingence avant de faire le test. Nous aurions pu
partir de 2 variables : intérêt pour prêter (oui-non) et intérêt pour
bénéficier (oui-non) et faire le tableau de contingence à partir de là.

La p-valeur peut être exacte ou asymptotique, la valeur exacte est


plus fiable mais prend plus de temps.

Attention : Traitement 1 correspond toujours à la 1° ligne et


Traitement 2 correspond toujours à la 1° colonne.

11 Non paramétrique

Page 163
MK311 – Statistique Inférentielle

EXEMPLE 2

La proportion d’étudiants intéressés par des livres sur les notes de


cours est-elle plus grande ou plus petite que la proportion
d’étudiants intéressés par des livres sur des exercices
supplémentaires ?
Effectifs observés (Intérêt livre notes de cours en ligne /
Intérêt livre exercices en colonne) :

Non Oui Total


Non 48 72 120
Oui 58 62 120
Total 106 134 240

𝐻0 : 𝜋𝑛𝑜𝑡𝑒𝑠 = 𝜋𝑒𝑥𝑒𝑟𝑐𝑖𝑐𝑒𝑠

𝐻𝑎 : 𝜋𝑛𝑜𝑡𝑒𝑠 < 𝜋𝑒𝑥𝑒𝑟𝑐𝑖𝑐𝑒𝑠

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


de 12,71%.

Nous conservons dès lors celle-ci. Les deux proportions sont donc
égales. L’idéal sera donc de prévoir pour chaque cours, au minimum,
un livre de notes de cours et un livre d’exercices. Même si les besoins
en fonction du cours peuvent être différents.

La taille de l’échantillon doit être supérieure à 20.

Dans un tableau de contingence, XLSTAT classera toujours les


modalités par ordre alphabétique. Il testera donc ici le non intérêt.
Nous avons donc dû réaliser un test unilatéral droit, alors que celui-
ci est écrit comme un unilatéral gauche.

Attention : Traitement 1 correspond toujours à la 1° ligne et


Traitement 2 correspond toujours à la 1° colonne.

Traitement 2 Total
Traitement 1 Effectif du
traitement 1

Total Effectif du Taille de


traitement 2 l’échantillon

Page 164
MK311 – Statistique Inférentielle

Comparaison de plusieurs proportions observées (échantillons


dépendants ou appariés) – Q de Cochran 12

EXEMPLE 1

La proportion d’étudiants intéressés par l’échange de notes, les


livres sur les notes de cours et les livres d’exercices est-elle la
même ?

Variable Modalités Effectifs %


Intérêt échange de notes Non 134 55,833
Oui 106 44,167
Intérêt livre de cours Non 120 50,000
Oui 120 50,000
Intérêt livre exercices Non 106 44,167
Oui 134 55,833

𝐻0 : 𝐿𝑒𝑠 𝑝𝑟𝑜𝑝𝑜𝑟𝑡𝑖𝑜𝑛𝑠 𝑠𝑜𝑛𝑡 é𝑔𝑎𝑙𝑒𝑠 𝑒𝑛𝑡𝑟𝑒 𝑒𝑙𝑙𝑒𝑠

𝐻𝑎 : 𝐼𝑙 𝑦 𝑎 𝑎𝑢 𝑚𝑜𝑖𝑛𝑠 𝑢𝑛𝑒 𝑝𝑟𝑜𝑝𝑜𝑟𝑡𝑖𝑜𝑛 𝑑𝑖𝑓𝑓é𝑟𝑒𝑛𝑡𝑒 𝑑𝑒𝑠 𝑎𝑢𝑡𝑟𝑒𝑠

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


inférieur à 3,95%.

Nous rejetons dès lors celle-ci. Les proportions ne sont pas égales. Il
faut donc prévoir des informations détaillées de chacune et non une
information générale du projet.

La taille de l’échantillon doit être supérieure à 20.

La variable est toujours une variable binaire.

Procédure de Sheskin.

Echantillon Fréquence Groupes


Intérêt échange de notes 0,442 A
Intérêt livre notes de cours 0,500 A B
Intérêt livre exercices 0,558 B

12 Non paramétrique

Page 165
MK311 – Statistique Inférentielle

Pour le cas précédent, nous avons posé trois questions distinctes :

• Etes-vous intéressé par un système d’échange de notes ?


o Oui
o Non
• Etes-vous intéressé par l’achat de livres reprenant les notes de cours ?
o Oui
o Non
• Etes-vous intéressé par l’achat de livres reprenant des exercices, ainsi que leurs
solutions ?
o Oui
o Non

Cela peut très vite devenir lourd dans notre sondage. Nous pourrions dès lors ne poser qu’une
seule question en donnant la possibilité de répondre à plusieurs modalités.

• Parmi les propositions suivantes, vous êtes intéressé par :


o Un système d’échange de notes.
o L’achat de livres reprenant les notes de cours.
o L’achat de livres reprenant des exercices, ainsi que leurs solutions.

Les données s’agenceront dès lors comme la première colonne du tableau ci-dessous :

Intérêt échange Intérêt livre Intérêt livre


Intérêt pour
de notes notes de cours exercices
Echange de notes ; Livres d'exercices Oui Non Oui
Echange de notes Oui Non Non
Echange de notes ; Livres notes de
Oui Oui Non
cours
Echange de notes ; Livres notes de
Oui Oui Oui
cours ; Livre d'exercices
Echange de notes ; Livres notes de
Oui Oui Oui
cours ; Livre d'exercices
Echange de notes ; Livres notes de
Oui Oui Non
cours
Livres d'exercices Non Non Oui
Livres notes de cours Non Oui Non
Non Non Non
Livres d'exercices Non Non Oui

Il nous faudra dès lors réorganiser nos données en trois variables binaires (colonnes 2 à 4). Ce
travail est fastidieux mais peut se faire assez rapidement, à condition d’être méthodique. Une
recherche effectuée sur chaque modalité permet d’afficher les lignes où celle-ci se trouve. Il
suffit par la suite d’encoder manuellement des oui sur les lignes correspondantes de notre
modalité.

Page 166
MK311 – Statistique Inférentielle

EXEMPLE 2

Les proportions des modalités d’avis sur le prix des tutoriels est-elle
la même ?

Variable Modalités Effectifs %


Trop cher (1-0) 0 160 66,667
1 80 33,333
Correct (1-0) 0 154 64,167
1 86 35,833
Trop bon marché (1-0) 0 166 69,167
1 74 30,833

𝐻0 : 𝐿𝑒𝑠 𝑝𝑟𝑜𝑝𝑜𝑟𝑡𝑖𝑜𝑛𝑠 𝑠𝑜𝑛𝑡 é𝑔𝑎𝑙𝑒𝑠 𝑒𝑛𝑡𝑟𝑒 𝑒𝑙𝑙𝑒𝑠

𝐻𝑎 : 𝐼𝑙 𝑦 𝑎 𝑎𝑢 𝑚𝑜𝑖𝑛𝑠 𝑢𝑛𝑒 𝑝𝑟𝑜𝑝𝑜𝑟𝑡𝑖𝑜𝑛 𝑑𝑖𝑓𝑓é𝑟𝑒𝑛𝑡𝑒 𝑑𝑒𝑠 𝑎𝑢𝑡𝑟𝑒𝑠

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


de 63,76%.

Nous conservons dès lors celle-ci. Les proportions sont égales. Le


prix semble donc bien ajusté.

La taille de l’échantillon doit être supérieure à 20.

La variable est toujours une variable binaire.

Transformation en trois variables binaires. A partir de cette unique


variable, nous en créons trois :

• Trop cher (Oui-Non) (1-0)


• Correct (Oui-Non) (1-0)
• Trop bon marché (Oui-Non) (1-0)

Il suffit d’utiliser la fonction « Remplacer » d’Excel.

Page 167
MK311 – Statistique Inférentielle

2. Tests de forme ou de relation pour des


variables qualitatives ou quantitatives
Comparaison de proportions observées à des proportions
théoriques-test d’ajustement 13

EXEMPLE 1

Notre échantillon est-il représentatif de la population IESN en


terme de bloc ?

Fréquence
Effectif par par modalité Proportion
Modalités modalité (%) théorique
Bloc 1 64,000 26,667 0,300
Bloc 2 96,000 40,000 0,400
Bloc 3 80,000 33,333 0,300

𝐻0 : 𝑎𝑑é𝑞𝑢𝑎𝑡𝑖𝑜𝑛 𝑒𝑛𝑡𝑟𝑒 𝑙𝑎 𝑝𝑜𝑝𝑢𝑙𝑎𝑡𝑖𝑜𝑛 𝑒𝑡 𝑙𝑒 𝑚𝑜𝑑è𝑙𝑒

𝐻𝑎 : 𝑛𝑜𝑛 𝑎𝑑é𝑞𝑢𝑎𝑡𝑖𝑜𝑛 𝑒𝑛𝑡𝑟𝑒 𝑙𝑎 𝑝𝑜𝑝𝑢𝑙𝑎𝑡𝑖𝑜𝑛 𝑒𝑡 𝑙𝑒 𝑚𝑜𝑑è𝑙𝑒

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


de 41,11%.

Nous devons dès lors conserver celle-ci. Notre échantillon est


représentatif en terme de bloc. Toute comparaison d’un bloc par
rapport à un autre sera dès lors judicieuse.
La taille de l’échantillon doit être supérieure à 20.

Ce test s’appelle aussi le test d’ajustement du 𝜒 2 . Il est conseillé de


veiller à ce que l'effectif de chacune des classes ne soit pas inférieur
à 5.

La méthode Monte Carlo proposée en option apporte une légère


correction sur les données, mais donne la même conclusion.

13 Paramétrique

Page 168
MK311 – Statistique Inférentielle

EXEMPLE 2

Notre échantillon est-il représentatif de la population IESN en terme


de section ?

Fréquence
par modalité Proportion
Modalités (%) théorique
Automatique 5,833 7,400
Comptabilité 25,000 22,360
Droit 5,833 14,220
Informatique de gestion 20,833 13,420
Marketing 24,167 26,960
Régendat en sciences économiques 0,833 0,690
Régendat économie familiale et sociale 1,667 2,170
Technologie de l'informatique 15,833 12,780

𝐻0 : 𝑎𝑑é𝑞𝑢𝑎𝑡𝑖𝑜𝑛 𝑒𝑛𝑡𝑟𝑒 𝑙𝑎 𝑝𝑜𝑝𝑢𝑙𝑎𝑡𝑖𝑜𝑛 𝑒𝑡 𝑙𝑒 𝑚𝑜𝑑è𝑙𝑒

𝐻𝑎 : 𝑛𝑜𝑛 𝑎𝑑é𝑞𝑢𝑎𝑡𝑖𝑜𝑛 𝑒𝑛𝑡𝑟𝑒 𝑙𝑎 𝑝𝑜𝑝𝑢𝑙𝑎𝑡𝑖𝑜𝑛 𝑒𝑡 𝑙𝑒 𝑚𝑜𝑑è𝑙𝑒

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


inférieur à 0,05%.

Nous devons dès lors rejeter celle-ci. Notre échantillon n’est pas
représentatif en termes de section.

Si toutefois, nous sommes certains de la représentativité de notre


échantillon en terme de section, cela signifie que la répartition a
évolué.

La taille de l’échantillon doit être supérieure à 20.

Page 169
MK311 – Statistique Inférentielle

Un test Q de Cochran effectué à partir d’une seule variable (voir le


2°exemple) revient à faire un test d’ajustement sur cette variable pour des
proportions théoriques égales. Chacune de ces proportions étant de
100%/(le nombre de modalité).

Un test d’ajustement n’a de sens qu’à partir du moment où la variable


étudiée présente au moins 3 modalités.

Page 170
MK311 – Statistique Inférentielle

Test d’association entre deux variables qualitatives -test


d’indépendance-test du 𝝌𝟐 14

EXEMPLE 1

L’intérêt pour l’échange de notes est-il indépendant du bloc dans


lequel l’étudiant est inscrit ?

Travail sur les données brutes ou sur un tableau de contingence

Indice de Cramer pour l’échantillon = 3,46%

𝐻0 : 𝐼𝑛𝑑é𝑝𝑒𝑛𝑑𝑎𝑛𝑐𝑒 𝑒𝑛𝑡𝑟𝑒 𝑙 ′ 𝑖𝑛𝑡é𝑟ê𝑡 𝑒𝑡 𝑙𝑒 𝑏𝑙𝑜𝑐

𝐻𝑎 : 𝑁𝑜𝑛 𝑖𝑛𝑑é𝑝𝑒𝑛𝑑𝑎𝑛𝑐𝑒 𝑒𝑛𝑡𝑟𝑒 𝑙 ′ 𝑖𝑛𝑡é𝑟ê𝑡 𝑒𝑡 𝑙𝑒 𝑏𝑙𝑜𝑐

Le risque de rejeter l'hypothèse nulle𝐻0 alors qu'elle est vraie est de


86,62%.

Nous conservons dès lors celle-ci. Et pouvons affirmer qu’au sein de


l’IESN le bloc n’influence pas l’intérêt pour l’échange de notes. Ce
résultat est cohérent avec celui obtenu pour le premier exemple
d’égalité de plusieurs proportions pour échantillons indépendants.

Il s’agit d’un test unilatéral droit. La valeur observée est la valeur de


l’indice 𝜒 2 calculé dans les parties précédentes du cours. Il est ici
inférieur à la valeur critique. La différence entre les valeurs
attendues et les valeurs observées est non significative.

Les conditions suivantes doivent être remplies :

• n est supérieur ou égal à 20


• Aucune somme marginale n'est inférieure à 5
• Au moins 80% des effectifs sont supérieurs à 5

14 Test de corrélation/association

Page 171
MK311 – Statistique Inférentielle

EXEMPLE 2

L’intérêt de l’échange de notes est-il indépendant de la section ?

Indice de Cramer pour l’échantillon = 30,73%

𝐻0 : 𝐼𝑛𝑑é𝑝𝑒𝑛𝑑𝑎𝑛𝑐𝑒 𝑒𝑛𝑡𝑟𝑒 𝑙′𝑖𝑛𝑡é𝑟ê𝑡 𝑒𝑡 𝑙𝑎 𝑠𝑒𝑐𝑡𝑖𝑜𝑛

𝐻𝑎 : 𝑁𝑜𝑛 𝑖𝑛𝑑é𝑝𝑒𝑛𝑑𝑎𝑛𝑐𝑒 𝑒𝑛𝑡𝑟𝑒 𝑙′𝑖𝑛𝑡é𝑟ê𝑡 𝑒𝑡 𝑙𝑎 𝑠𝑒𝑐𝑡𝑖𝑜𝑛

Par le G² de Wilks, le risque de rejeter l'hypothèse nulle 𝐻0 alors


qu'elle est vraie est inférieur à 0,01%.

Nous devons dès lors rejeter celle-ci. La section influence donc


l’intérêt pour l’échange de notes.

Les conditions ne sont pas remplies pour un test 𝜒 2 (message


d’erreur affiché dans la feuille de calcul).

Des effectifs théoriques plus petits que 5 ont été détectés. Pour
utiliser le test du Khi² s'appuyant sur l'approximation par la loi du
Khi², les effectifs théoriques ne doivent pas être inférieurs à 5.

C’est donc le résultat des autres tests qui doit être pris en compte.

Page 172
MK311 – Statistique Inférentielle

Comparaison de deux distributions-Kolmogorov-Smirnov 15

EXEMPLE 1

La limite de temps pour un tutoriel sur la théorie est-elle répartie de


façon analogue chez les étudiants et chez les étudiantes ?

Fonctions de répartition (Limite temps théorie |


Masculin - Limite temps théorie | Féminin)
1
0,9
0,8
Fréquence cumulée

0,7
0,6
0,5
0,4
0,3
0,2
0,1
0
0 2 4 6 8 10 12
Limite temps théorie | Masculin - Limite temps théorie |
Féminin

Limite temps théorie | Masculin


Limite temps théorie | Féminin

𝐻0 : 𝑑𝑖𝑠𝑡𝑟𝑖 𝑡𝑒𝑚𝑝𝑠 é𝑡𝑢𝑑𝑖𝑎𝑛𝑡𝑠 = 𝑑𝑖𝑠𝑡𝑟𝑖 𝑡𝑒𝑚𝑝𝑠 é𝑡𝑢𝑑𝑖𝑎𝑛𝑡𝑒𝑠

𝐻𝑎 : 𝑑𝑖𝑠𝑡𝑟𝑖 𝑡𝑒𝑚𝑝𝑠 é𝑡𝑢𝑑𝑖𝑎𝑛𝑡𝑠 ≠ 𝑑𝑖𝑠𝑡𝑟𝑖 𝑡𝑒𝑚𝑝𝑠 é𝑡𝑢𝑑𝑖𝑎𝑛𝑡𝑒𝑠

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


inférieur à 0,88%.

Nous devons dès lors rejeter celle-ci. Les 2 distributions ne sont pas
semblables.

15 Non paramétrique

Page 173
MK311 – Statistique Inférentielle

Les 2 échantillons doivent être de taille supérieure à 20 et


indépendants.

La comparaison se fait toujours entre deux modalités. Nous


comparons ici l’entièreté de la distribution. En quelque sorte, nous
testons si les quantiles sont identiques.

Dans le cas d’un format de données « une colonne par variable » le


numéro des échantillons est déterminé par ordre alphabétique.
Dans notre exemple, les filles sont l’échantillon 1. Si on préfère fixer
nous-même le numéro de l’échantillon, il faudra désempiler au
préalable et sélectionner un format de données « une colonne par
échantillon ».

Page 174
MK311 – Statistique Inférentielle

EXEMPLE 2

La limite de temps pour un tutoriel sur des exercices est-elle répartie


de façon analogue dans les blocs pris deux à deux ?

Voir fichier Excel

𝐻0 : 𝑑𝑖𝑠𝑡𝑟𝑖𝑏𝑢𝑡𝑖𝑜𝑛 𝑏𝑙𝑜𝑐 (1, 2, 3) = 𝑑𝑖𝑠𝑡𝑟𝑖𝑏𝑢𝑡𝑖𝑜𝑛 𝑏𝑙𝑜𝑐(1, 2, 3)

𝐻𝑎 : 𝑑𝑖𝑠𝑡𝑟𝑖𝑏𝑢𝑡𝑖𝑜𝑛 𝑏𝑙𝑜𝑐(1, 2, 3) ≠ 𝑑𝑖𝑠𝑡𝑟𝑖𝑏𝑢𝑡𝑖𝑜𝑛 𝑏𝑙𝑜𝑐(1, 2, 3)

Variable Bloc 1-Bloc 2 Bloc 1-Bloc 3 Bloc 2-Bloc 3


Limite temps exercices 0,099 0,012 0,503

Nous constatons une différence significative entre le bloc 1 et le


bloc 3.

Les 2 échantillons doivent être de taille supérieure à 20 et


indépendants.

Les comparaisons sont effectuées deux à deux.

Page 175
MK311 – Statistique Inférentielle

Tests de normalité 16

La normalité est une condition importante à la réalisation de test sur les moyennes, il est donc
nécessaire de s’assurer de cette hypothèse. En effet, la normalité permettra d’exécuter un
test paramétrique (réputé plus puissant). Il est donc important de tout mettre en œuvre, afin
qu’une variable suive une distribution normale. Ce genre de test n’apporte pas vraiment
d’interprétation. Mais ils seront un préalable à tout test portant sur les moyennes.

La condition pour appliquer ces tests étant : la taille de l’échantillon doit être supérieure à
20.

XLSTAT propose quatre tests pour tester la normalité d'un échantillon :

• Le test de Shapiro-Wilk bien adapté aux échantillons de moins de 5000 observations ;


• Le test d'Anderson-Darling proposé par Stephens (1974) est une modification du test
de Kolmogorov-Smirnov adaptée à plusieurs lois dont la loi normale, pour le cas où les
paramètres de la loi ne sont pas connus et doivent donc être estimés ;
• Le test de Lilliefors est une modification du test de Kolmogorov-Smirnov adapté au cas
de la normalité dans le cas où les paramètres de la loi, la moyenne et la variance, ne
sont pas connus et doivent donc être estimés ;
• Le test de Jarque-Bera qui est d'autant plus performant que le nombre de données est
important.

Afin de vérifier visuellement si un échantillon suit une loi normale, il est possible d'utiliser les
graphiques P-P et les graphiques Q-Q :

• Graphiques P-P (loi normale) : les graphiques Probabilité-Probabilité (P-P plots en


anglais) permettent de comparer la fonction de répartition empirique d'un échantillon
à celle d'un échantillon distribué suivant une loi normale de même moyenne et même
variance. Si l'échantillon suit une loi normale, les points doivent être confondus avec
la première bissectrice du plan.
• Graphiques Q-Q (loi normale) : les graphiques Quantile-Quantile (Q-Q plots en anglais)
permettent de comparer les quantiles de l'échantillon à ceux d'un échantillon distribué
suivant une loi normale de même moyenne et même variance. Si l'échantillon suit une
loi normale, les points doivent être confondus avec la première bissectrice du plan.

Nous effectuerons ici des tests de normalité nécessaires à certains exemples du point suivant.

16 Description des données

Page 176
MK311 – Statistique Inférentielle

EXEMPLE 1

La limite de temps pour un tutoriel sur la théorie est-elle répartie


normalement ?

𝐻0 : 𝑎𝑑é𝑞𝑢𝑎𝑡𝑖𝑜𝑛 𝑒𝑛𝑡𝑟𝑒 𝑙𝑎 𝑝𝑜𝑝𝑢𝑙𝑎𝑡𝑖𝑜𝑛 𝑒𝑡 𝑢𝑛𝑒 𝑛𝑜𝑟𝑚𝑎𝑙𝑒

𝐻𝑎 : 𝑛𝑜𝑛 𝑎𝑑é𝑞𝑢𝑎𝑡𝑖𝑜𝑛 𝑒𝑛𝑡𝑟𝑒 𝑙𝑎 𝑝𝑜𝑝𝑢𝑙𝑎𝑡𝑖𝑜𝑛 𝑒𝑡 𝑢𝑛𝑒 𝑛𝑜𝑟𝑚𝑎𝑙𝑒

Shapiro- Anderson-
Variable\Test Lilliefors Jarque-Bera
Wilk Darling
Limite temps
0,120 0,076 0,011 0,574
théorie

3 tests sur 4 nous amènent à conserver l’hypothèse de normalité.

La majorité l’emportera.

Page 177
MK311 – Statistique Inférentielle

EXEMPLE 2

La limite de temps pour un tutoriel sur les exercices est-elle répartie


normalement ?

𝐻0 : 𝑎𝑑é𝑞𝑢𝑎𝑡𝑖𝑜𝑛 𝑒𝑛𝑡𝑟𝑒 𝑙𝑎 𝑝𝑜𝑝𝑢𝑙𝑎𝑡𝑖𝑜𝑛 𝑒𝑡 𝑢𝑛𝑒 𝑛𝑜𝑟𝑚𝑎𝑙𝑒

𝐻𝑎 : 𝑛𝑜𝑛 𝑎𝑑é𝑞𝑢𝑎𝑡𝑖𝑜𝑛 𝑒𝑛𝑡𝑟𝑒 𝑙𝑎 𝑝𝑜𝑝𝑢𝑙𝑎𝑡𝑖𝑜𝑛 𝑒𝑡 𝑢𝑛𝑒 𝑛𝑜𝑟𝑚𝑎𝑙𝑒

Shapiro- Anderson- Jarque-


Variable\Test Lilliefors
Wilk Darling Bera
Limite temps exercices < 0,0001 < 0,0001 < 0,0001 < 0,0001
log(Limite temps exercices) 0,163 0,156 0,113 0,409

La variable d’origine ne suit pas une distribution normale, par contre


le logarithme de celle-ci suit une distribution normale.

Page 178
MK311 – Statistique Inférentielle

Les graphiques P-P plots (ci-dessous) pour les deux variables confirment ce résultat.

P-P plot (Limite temps exercices)


1

Fonction de répartition théorique 0,9

0,8

0,7

0,6

0,5

0,4

0,3

0,2

0,1

0
0 0,1 0,2 0,3 0,4 0,5 0,6 0,7 0,8 0,9 1
Fonction de répartition empirique

P-P plot (log(Limite temps exercices))


1

0,9
Fonction de répartition théorique

0,8

0,7

0,6

0,5

0,4

0,3

0,2

0,1

0
0 0,1 0,2 0,3 0,4 0,5 0,6 0,7 0,8 0,9 1
Fonction de répartition empirique

Page 179
MK311 – Statistique Inférentielle

EXEMPLE 3

Le budget pour un livre sur des notes de cours est-il réparti


normalement au sein de chaque bloc ?

Attention : présence de données manquantes

𝐻0 : 𝑎𝑑é𝑞𝑢𝑎𝑡𝑖𝑜𝑛 𝑒𝑛𝑡𝑟𝑒 𝑙𝑎 𝑝𝑜𝑝𝑢𝑙𝑎𝑡𝑖𝑜𝑛 𝑒𝑡 𝑢𝑛𝑒 𝑛𝑜𝑟𝑚𝑎𝑙𝑒

𝐻𝑎 : 𝑛𝑜𝑛 𝑎𝑑é𝑞𝑢𝑎𝑡𝑖𝑜𝑛 𝑒𝑛𝑡𝑟𝑒 𝑙𝑎 𝑝𝑜𝑝𝑢𝑙𝑎𝑡𝑖𝑜𝑛 𝑒𝑡 𝑢𝑛𝑒 𝑛𝑜𝑟𝑚𝑎𝑙𝑒

Shapiro- Anderson Jarque-


Variable\Test Wilk -Darling Lilliefors Bera
Budget livre notes de cours |
Bloc 1 0,369 0,495 0,486 0,515
Budget livre notes de cours |
Bloc 2 0,223 0,399 0,231 0,067
Budget livre notes de cours |
Bloc 3 0,606 0,436 0,499 0,620

Ce budget suit donc une distribution normale au sein de chaque


bloc. Attention, il ne s’agit pas forcément de la même distribution.

Page 180
MK311 – Statistique Inférentielle

Un test de normalité sur une variable discrète est systématiquement inutile.


En effet, comparer une variable statistique discrète à une variable aléatoire
continue est incohérent. Il est donc primordial d’avoir un maximum de
variables continues dans un sondage.

Nous donnerons toujours raison à la majorité. Toutefois, des cas litigieux peuvent apparaître.

EXEMPLE 1

Shapiro- Anderson- Jarque-


Variable\Test Lilliefors
Wilk Darling Bera
Var1 0,072 0,002 0,011 0,374

Deux tests acceptent la normalité. Toutefois, le premier test présente une p-valeur proche de
notre seuil. Dès lors, nous refuserons la normalité.

EXEMPLE2

Shapiro- Anderson- Jarque-


Variable\Test Lilliefors
Wilk Darling Bera
Var2 0,0472 0,326 0,031 0,574

Deux tests acceptent la normalité avec une p-valeur élevée. Et le premier test présente une
p-valeur proche de notre seuil. Dès lors, nous accepterons la normalité.

Page 181
MK311 – Statistique Inférentielle

3. Tests sur les variables quantitatives


Il va falloir ici être plus prudent. Soit les données respecteront certaines conditions, soit elles
ne les respecteront pas. Dans le premier cas, nous pourrons effectuer un test paramétrique.
Dans le second cas, nous transformerons les données pour essayer qu’elles respectent les
conditions, nous pourrons alors utiliser un test paramétrique. Si après transformation, elles
ne respectent toujours pas les conditions, nous ferons le test non paramétrique
correspondant.

Paramétrique Vs. Non Paramétrique


Comme nous l’avons déjà dit au chapitre 1 de cette partie, un test paramétrique est plus
puissant alors qu’un test non paramétrique est lui plus robuste. Cette différence prend tout
son sens dans le cas de tests sur des moyennes. En effet, dans ce cas le test non paramétrique
proposera toujours une alternative au test paramétrique dans le cas où la normalité de la
population n’est pas présente. Ceci nous montre donc le caractère robuste du test non
paramétrique. Par contre, le test non paramétrique est en fait un test exécuté sur les rangs
moyens et non directement sur les moyennes. En clair, un test paramétrique prendra en
compte les valeurs observées de notre échantillon, tandis qu’un test non paramétrique
prendra lui en compte le rang de celles-ci. Nous entendons par rang, la place de la valeur
lorsque celles-ci sont classées par ordre croissant.

EXEMPLE

Supposons un échantillon de taille 5 comprenant les valeurs suivantes : 10, 5, 2, 20 et 15. Le


test non paramétrique travaillera avec les données suivantes : 3, 2, 1, 5 et 4. Dans le cas d’ex-
aequo, il attribuera la moyenne des rangs. Dès lors si les valeurs observées sont : 10, 5, 5, 20
et 5, les rangs seront : 4, 2, 2, 5 et 2. Car la valeur 5 est de rang 1, 2 et 3, ce qui donne une
moyenne de rang de 2.

Ceci explique donc le caractère de puissance d’un test paramétrique. Celui-ci sera donc plus
précis car il se basera sur les données réelles.

Page 182
MK311 – Statistique Inférentielle

Comparaison d'une moyenne observée avec une moyenne


théorique-test de valeur pour une moyenne 17

Test de valeur
pour une
moyenne
observée

La population ne
La population suit
suit pas une
une distribution
distribution
normale
normale

La variable
La variable
transformée ne
transformée suit
suit pas une loi
une loi normale
normale.

Test t ou z sur la Test t ou z sur la Test des rangs


variable initiale nouvelle variable signés de Wilcoxon
(paramétrique) (paramétrique) pour 1 échantillon
(non paramétrique)

17 Paramétrique ou Non paramétrique

Page 183
MK311 – Statistique Inférentielle

EXEMPLE 1

Les psychopédagogues estiment qu’au-delà de 4 minutes un tutoriel


vidéo sur de la théorie devient inefficace. Les étudiants de l’IESN
sont-ils en accord avec cette affirmation ?

La variable suit une distribution normale, voir précédemment. Nous


pouvons utiliser le test paramétrique.

Limite temps Limite temps Limite temps


Statistique
théorie exercices méthode
Nb. d'observations 240 240 240
Moyenne 5,009 21,557 5,008
Variance (n-1) 3,720 979,783 4,008
Ecart-type (n-1) 1,929 31,301 2,002

𝐻0 : 𝜇 = 4

𝐻𝑎 : 𝜇 > 4

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


inférieur à 0,01%.

Nous devons dès lors rejeter celle-ci. Les étudiants de l’IESN


estiment que cette limite de 4 minutes peut être dépassée.

La taille de l’échantillon doit être supérieure à 20.

On peut soit utiliser un z-test ou un t-test. La valeur observée est


identique dans les deux cas, la valeur critique et la p-valeur sont
légèrement différentes. En théorie, le z-test ne peut être utilisé que
pour un échantillon de taille supérieure à 30 et lorsque la variance
de la population est connue. Cette dernière étant estimée par sa
valeur dans l’échantillon, il est donc préférable de toujours choisir le
t-test.
𝑥̅ −𝜇
La statistique de test est 𝑍 𝑜𝑢 𝑡𝑛−1 ≡ 𝑠𝑛−1
√𝑛

Page 184
MK311 – Statistique Inférentielle

EXEMPLE 2

Les psychopédagogues estiment qu’au-delà de 25 minutes un


tutoriel vidéo sur des exercices devient inefficace. Les étudiants de
l’IESN sont-ils en accord avec cette affirmation ?

La variable ne suit pas une distribution normale, voir


précédemment, mais son logarithme suit une distribution normale.
Nous utiliserons le test paramétrique sur cette nouvelle variable.

Limite temps Limite temps Limite temps


Statistique
théorie exercices méthode
Nb. d'observations 240 240 240
Moyenne 5,009 21,557 5,008
Variance (n-1) 3,720 979,783 4,008
Ecart-type (n-1) 1,929 31,301 2,002

𝐻0 : 𝜇 = log (25)

𝐻𝑎 : 𝜇 < log (25)

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


inférieur à 0,01%.

Nous devons dès lors rejeter celle-ci. Les étudiants de l’IESN


estiment que ce temps limite doit être inférieur à 25 minutes.

La taille de l’échantillon doit être supérieure à 20.

La valeur de référence est devenue 1,4 = log(25).

Page 185
MK311 – Statistique Inférentielle

EXEMPLE 3

Les psychopédagogues estiment qu’au-delà de 6 minutes un tutoriel


vidéo sur des méthodes de travail devient inefficace. Les étudiants
de l’IESN sont-ils en accord avec cette affirmation ?

La variable et son logarithme ne suivent pas une distribution


normale, voir précédemment. En effet, celles-ci sont des variables
discrètes. Nous utiliserons le test non paramétrique. Nous testons
donc si la médiane est de 6 minutes.

Limite Limite Limite


Statistique temps temps temps
théorie exercices méthode
Nb. d'obs 240 240 240
Médiane 4,840 11,379 5,000
Moyenne 5,009 21,557 5,008
Variance (n-1) 3,720 979,783 4,008
Ecart-type (n-1) 1,929 31,301 2,002

𝐻0 : 𝑚é𝑑𝑖𝑎𝑛𝑒 = 6

𝐻𝑎 : 𝑚é𝑑𝑖𝑎𝑛𝑒 < 6

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


inférieur à 0,01%.

Nous devons dès lors rejeter celle-ci. La moitié des étudiants de


l’IESN estiment que la durée maximum pour ce type de tutoriels est
inférieure à 6 minutes.

La taille de l’échantillon doit être supérieure à 20.

La boîte de dialogue indique médiane et non moyenne. Car un test


non paramétrique se base sur la répartition des valeurs observées
et non sur la valeur exacte des paramètres.

En termes de communication, la conclusion obtenue ici n’est pas


idéale. Il est en effet plus porteur de dire « la médiane est de… ».
Nous pourrions dès lors relancer le test avec une autre valeur de
référence.

Page 186
MK311 – Statistique Inférentielle

Comparaison 18 de 2 moyennes observées (échantillons


indépendants 19)

Comparaison de 2
moyennes
observées

Les populations Les populations ne


suivent une suivent pas une
distribution normale distribution normale

Les variances sont Les variances sont


égales (Test F) différentes (Test F)

Test de Mann-
Test t ou z Test de Cochran-Cox Withney
(paramétrique) (paramétrique) (non paramétrique)

18Paramétrique ou Non paramétrique


19Il s’agit donc d’une comparaison entre deux moyennes conditionnelles. On teste donc l’indice de
corrélation.

Page 187
MK311 – Statistique Inférentielle

EXEMPLE 1

Le budget moyen pour un livre de notes de cours est-il plus ou moins


élevé dans le bloc 1 que dans le bloc 2 ? Et si oui, de combien
d’euros ?

Le budget de chaque échantillon suit une distribution normale.

2
2 2
𝜎𝑏𝑙𝑜𝑐1
𝐻0 : 𝜎𝑏𝑙𝑜𝑐1 = 𝜎𝑏𝑙𝑜𝑐2 ⇔ 2 =1
𝜎𝑏𝑙𝑜𝑐2

2
2 2
𝜎𝑏𝑙𝑜𝑐1
𝐻𝑎 : 𝜎𝑏𝑙𝑜𝑐1 ≠ 𝜎𝑏𝑙𝑜𝑐2 ⇔ 2 ≠1
𝜎𝑏𝑙𝑜𝑐2

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


de 18,29%. Nous pouvons dès lors conclure à une égalité des
variances.

Obs. sans
données
Variable manquantes Moyenne Ecart-type
Bloc 1 28 20,327 5,896
Bloc 2 52 28,926 4,752

Rapport de Corrélation pour les 3 blocs = 73,12%

𝐻0 : 𝜇𝑏𝑙𝑜𝑐1 − 𝜇𝑏𝑙𝑜𝑐2 = −10 𝑜𝑢 𝜇𝑏𝑙𝑜𝑐2 − 𝜇𝑏𝑙𝑜𝑐1 = 10

𝐻𝑎 : 𝜇𝑏𝑙𝑜𝑐1 − 𝜇𝑏𝑙𝑜𝑐2 > −10 𝑜𝑢 𝜇𝑏𝑙𝑜𝑐2 − 𝜇𝑏𝑙𝑜𝑐1 < 10

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


de 12,60%.

Nous devons dès lors conserver celle-ci. En moyenne, les étudiants


du bloc 2 seraient prêts à payer 10€ en plus que les étudiants du bloc
1. Cela confirme de nouveau que les étudiants du bloc 1 ne sont pas
conscients de l’importance des notes cours.

Page 188
MK311 – Statistique Inférentielle

Les 2 échantillons doivent être de taille supérieure à 20 et


indépendants.

Le test d’égalité des variances teste le rapport de celles-ci et non leur


différence. Il faut donc avoir un rapport supposé de 1.

La variable bloc possédant plus de deux modalités, il faut au


préalable désempiler celle-ci, et choisir un format de données « une
colonne par échantillon ».

Page 189
MK311 – Statistique Inférentielle

EXEMPLE 2

Le budget moyen pour un livre de notes de cours est-il plus ou moins


élevé dans le bloc 1 que dans le bloc 3 ? Et si oui, de combien
d’euros ?

Les 2 échantillons suivent une distribution normale.

2
2 2
𝜎𝑏𝑙𝑜𝑐1
𝐻0 : 𝜎𝑏𝑙𝑜𝑐1 = 𝜎𝑏𝑙𝑜𝑐3 ⇔ 2 =1
𝜎𝑏𝑙𝑜𝑐3

2
2 2
𝜎𝑏𝑙𝑜𝑐1
𝐻𝑎 : 𝜎𝑏𝑙𝑜𝑐1 ≠ 𝜎𝑏𝑙𝑜𝑐3 ⇔ 2 ≠1
𝜎𝑏𝑙𝑜𝑐3

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


inférieur à 0,01%. Nous pouvons dès lors conclure à une différence
des variances.

Obs. sans
données
Variable manquantes Moyenne Ecart-type
Bloc 1 28 20,327 5,896
Bloc 3 40 44,119 13,176

Rapport de Corrélation pour les 3 blocs = 73,12%

𝐻0 : 𝜇𝑏𝑙𝑜𝑐1 − 𝜇𝑏𝑙𝑜𝑐3 = −20 𝑜𝑢 𝜇𝑏𝑙𝑜𝑐3 − 𝜇𝑏𝑙𝑜𝑐2 = 20

𝐻𝑎 : 𝜇𝑏𝑙𝑜𝑐1 − 𝜇𝑏𝑙𝑜𝑐3 < −20 𝑜𝑢 𝜇𝑏𝑙𝑜𝑐3 − 𝜇𝑏𝑙𝑜𝑐1 > 20

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


de 5,69%.

Nous devons dès lors conserver celle-ci. En moyenne, les étudiants


du bloc 3 seraient prêts à payer 20€ en plus que les étudiants du bloc
1. Cela confirme de nouveau que les étudiants du bloc 1 ne sont pas
conscients de l’importance des notes cours.

Page 190
MK311 – Statistique Inférentielle

Les 2 échantillons doivent être de taille supérieure à 20 et


indépendants.

La p-valeur obtenue est ici très proche de notre seuil. Il en est de


même pour la valeur observée qui est quasiment égale à la valeur
critique. Il serait dès lors justifié de refaire le test avec une différence
supposée autre que 20€.

Page 191
MK311 – Statistique Inférentielle

EXEMPLE 3

Le budget moyen pour un livre d’exercices est-il plus ou moins élevé


dans le bloc 2 que dans le bloc 3 ? Et si oui, de combien d’euros ?

Shapiro- Anderson Jarque-


Variable\Test Wilk -Darling Lilliefors Bera
Budget livre exercices |
0,075 0,126 0,333 0,371
Bloc 1
Budget livre exercices |
0,002 0,006 0,021 0,149
Bloc 2
Budget livre exercices |
0,000 < 0,0001 0,001 0,070
Bloc 3

Les budgets des 2 échantillons ne suivent pas une distribution


normale.

Budget livre Budget livre Budget livre


Statistique exercices | exercices | exercices |
Bloc 1 Bloc 2 Bloc 3
Nb. d'observations 64 96 80
Médiane 57,000 55,000 38,000
Moyenne 54,412 52,370 44,261
Variance (n-1) 326,795 327,181 346,153
Ecart-type (n-1) 18,077 18,088 18,605

Rapport de Corrélation pour les 3 blocs = 23,17%

𝐻0 : 𝜇̃𝑏𝑙𝑜𝑐2 − 𝜇̃𝑏𝑙𝑜𝑐3 = 10

𝐻𝑎 : 𝜇̃𝑏𝑙𝑜𝑐2 − 𝜇̃𝑏𝑙𝑜𝑐3 ≠ 10

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


de 92,66%.

Nous devons dès lors conserver celle-ci. Le budget médian du bloc 2


est de 10€ plus élevé que le budget médian du bloc 3.
Les 2 échantillons doivent être de taille supérieure à 20 et
indépendants.

Le test s’effectuant sur les positions et non sur les valeurs exactes, il
est plus prudent d’effectuer un test bilatéral.
Nous indiquons 𝜇̃ dans les hypothèses, afin de montrer que le test
s’effectue sur les positions et non les valeurs.

Page 192
MK311 – Statistique Inférentielle

Comparaison de deux moyennes observées (échantillons


dépendants ou appariés) 20

Comparaison de 2
moyennes
observées

La différence ne
La différence suit
suit pas une
une distribution
distribution
normale
normale

Test t ou z sur les Test de Wilcoxon


2 échantillons ou Test du signe
(paramétrique) (non paramétrique)

20 Paramétrique ou Non paramétrique

Page 193
MK311 – Statistique Inférentielle

EXEMPLE 1

Peut-on croire que le budget moyen pour un cours particulier donné


par un enseignant est de 20€ supérieur au budget moyen pour un
cours particulier donné par un étudiant ?

Anderson-
Variable\Test Shapiro-Wilk Darling Lilliefors Jarque-Bera
Différence 0,942 0,923 0,930 0,773

La différence des budgets suit une distribution normale.

Variable Observations Moyenne Ecart-type


Budget cours enseignant 54 34,037 6,404

Budget cours étudiant 54 13,710 9,700

𝐻0 : 𝜇𝑒𝑛𝑠 − 𝜇é𝑡𝑢 = 20

𝐻𝑎 : 𝜇𝑒𝑛𝑠 − 𝜇é𝑡𝑢 ≠ 20

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


de 77,47%.

Nous devons dès lors conserver celle-ci. Les étudiants paieraient 20€
en plus pour un cours particulier donné par un enseignant.

La taille de l’échantillon doit être supérieure à 20.

Il s’agit en fait d’un t Test sur la différence des prix.

Page 194
MK311 – Statistique Inférentielle

EXEMPLE 2

Peut-on croire qu’en moyenne le temps limite pour un tutoriel


d’exercices doit être plus ou moins élevé (si oui de combien) que
pour un tutoriel sur la méthode de travail ?

Variable\Tes Anderson-
t Shapiro-Wilk Darling Lilliefors Jarque-Bera
Différence < 0,0001 < 0,0001 < 0,0001 < 0,0001

La différence de temps ne suit pas une distribution normale.


Limite Limite
Statistique temps temps
exercices méthode
Nb. d'observations 240 240
Médiane 11,379 5,000
Moyenne 21,557 5,008
Variance (n-1) 979,783 4,008
Ecart-type (n-1) 31,301 2,002

𝐻0 : 𝜇̃𝑒𝑥𝑜𝑠 − 𝜇̃𝑚é𝑡ℎ𝑜𝑑𝑒 = 6

𝐻𝑎 : 𝜇̃𝑒𝑥𝑜𝑠 − 𝜇̃𝑚é𝑡ℎ𝑜𝑑𝑒 ≠ 6

Le risque de rejeter l'hypothèse nulle 𝐻0 alors qu'elle est vraie est


de 84,65%. Nous devons dès lors conserver celle-ci. Il y a un écart de
6 minutes entre le temps médian pour un tuto d’exercices et un tuto
méthode de travail.

Page 195
MK311 – Statistique Inférentielle

La taille de l’échantillon doit être supérieure à 20.

Deux tests sont proposés :

• Le test du signe
• Le test de Wilcoxon signé

Cet exemple illustre la faiblesse d’un test non-paramétrique. Au vu


des observations, la différence de 15 semble plus cohérente que
celle de 9. Or, elle amène à un rejet de l’hypothèse nulle. Cela
s’expliquant par le fait que le test non paramétrique utilisé dans le
cas présent test les rangs et non les données elles-mêmes.

Le test s’effectuant sur les positions et non sur les valeurs exactes, il
est plus prudent d’effectuer un test bilatéral.

Nous indiquons 𝜇̃ dans les hypothèses, afin de montrer que le test


s’effectue sur les positions et non les valeurs.

De plus, ces deux tests peuvent amener à des conclusions


totalement opposées. Le problème vient du fait que chacun travaille
différemment.

Le test du signe étudie uniquement le signe de la différence entre


les rangs de chaque point du nuage de points. Une observation
(𝑥1 , 𝑦1 ) de rang (10,5) et une observation (𝑥2 , 𝑦2 ) de rang (20,10)
seront traitées de la même façon. En effet, la différence des rangs
est positive pour les deux points. Or, elle est deux fois plus grande
pour le deuxième. Le test de Wilcoxon signé tiendra compte de la
valeur de cet écart. Et les deux points seront dès lors traités
différemment.

En conclusion, dans le cas où les deux tests conduisent à des


conclusions différentes, il sera toujours plus prudent de faire
confiance au test de Wilcoxon signé.

Page 196
M311 – Statistiques Inférentielles

4. Résumé des différents tests


Les tests affichés sont les tests les plus couramment utilisés en statistique. Ils sont tous disponibles dans XLSTAT. La liste n’est cependant pas
exhaustive. D’autres situations / tests existent.

Conditions de validité
Equivalents
(tests paramétriques)
Question Données Hypothèse nulle Exemple Tests paramétriques non-
Codes en bas du
paramétriques
tableau
Une proportion Comparaison d’une
Comparaison d'une
observée et son effectif proportion de couleur
proportion observée Test Z pour une
associé 𝜋 = 𝜋0 d’yeux à une proportion 5
avec une proportion proportion
Une proportion théorique dans un
théorique
théorique échantillon
Comparaison de 2
Comparaison des
proportions observées Test Z pour 2
Effectif des 2 catégories 𝜋1 = 𝜋2 proportions de 2 couleurs 1;4
(échantillons proportions
d'yeux dans un échantillon
indépendants)
Comparaison de
plusieurs proportions Comparaison des
Effectif de chaque Comparaison de k
observées 𝜋1 = 𝜋2 = ⋯ = 𝜋𝑘 proportions de 3 couleurs 1;4
catégorie proportions
(échantillons d'yeux dans un échantillon
indépendants)
Comparaison de 2 Comparaison de la
proportions observées proportion de oui à un 1° Test de
Effectif des 2 catégories 𝜋1 = 𝜋2 5
(échantillons projet et de oui à un McNemar
dépendants) 2°projet

Page 197
MK311 – Statistique Inférentielle

Comparaison de k
Comparaison de la
proportions observées Effectif de chaque
𝜋1 = 𝜋2 = ⋯ = 𝜋𝑘 proportion de oui à 3 5 Q de Cochran
(échantillons catégorie
projets
dépendants)

Comparaison de Proportions
Proportion théorique et
proportions observées observées = Test d'ajustement
effectif associés à Vérifier si un dé est pipé 5
à des proportions proportions multinomial
chaque catégorie
théoriques théoriques

Test exact de
Test d'association Variable 1 et La présence d'un attribut
Khi² sur un tableau Fisher ou
entre deux variables Tableau de contingence variable 2 sont est-elle liée à la présence 1;6
de contingence méthode de
qualitatives indépendantes d'un autre attribut ?
Monte Carlo
Tests de normalité
d'une série de mesures L'échantillon suit La distribution observée
Mesures sur un
(peuvent être utilisés une distribution s'écarte-t-elle d'une Tests de normalité 5
échantillon
pour tester les normale distribution normale ?
conditions 2 et 7)
Les deux
Comparer deux Mesures d'une variable Les distributions de salaire
échantillons suivent Kolmogorov-
distributions quantitative sur deux sont-elles différentes 1;4
la même Smirnov
observées échantillons entre ces deux régions ?
distribution

Page 198
MK311 – Statistique Inférentielle

Comparaison d'une Mesures sur 1


Comparaison à une norme
moyenne observée échantillon Test t et z pour un Rangs signés de
𝜇 = 𝜇0 de notes d’étudiants 2;5
avec une tendance Moyenne théorique échantillon Wilcoxon
d’une classe
théorique (1 nombre)

Comparaison de deux Si 3, alors Test t et z


Comparaison de notes
positions* observées Mesures sur 2 pour 2 échantillons.
𝜇1 = 𝜇2 d'étudiants entre deux 1;2;4 Mann-Whitney
(échantillons échantillons Si non 3 ; alors Test
classes
indépendants) de Cochran-Cox
Comparaison de deux Comparaison du taux
positions* observées Deux séries de mesures d'hémoglobine moyen
Test t et z pour 2 Wilcoxon ou
(échantillons quanti sur les mêmes 𝜇1 = 𝜇2 avant / après l'application 5;7
échantillons Test du signe
dépendants ou individus d'un traitement sur un
appariés) groupe de patients
Comparaison de 2 Comparaison de la Comparaison des
variances (peut être Mesures sur deux dispersion naturelle de la variances de 2
𝜎12 = 𝜎22 1;2;4
utilisé pour tester échantillons taille de 2 variétés d'un échantillons
condition 3) fruit Test F

*Les positions sont les moyennes (tests paramétriques) ou les rangs moyens (équivalents non-paramétriques)

Page 199
MK311 – Statistique Inférentielle

Conditions de validité des tests paramétriques

Les conditions de validité suggérées sont uniquement des pistes qui peuvent changer en fonction du type de données et des domaines
d'application spécifiques. Il est vivement recommandé de se référer aux recommandations propres à vos domaines.

1) Les mesures sont indépendantes.

2) Chaque population suit une distribution normale (vérifier ou assumer).

3) Les populations ont des variances égales.

4) Au moins 20 individus par échantillon, ou normalité des populations de chaque échantillon assumée.

5) Au moins 20 individus dans l'échantillon (recommandé).

6) Pas d'effectifs théoriques inférieurs à 5 dans les cases du tableau.

7) Les différences entre séries suivent des distributions normales.

Page 200
MK311 – Statistique Inférentielle

5. Exercices
Ces exercices vous permettent de vous familiariser avec les tests et les manipulations
correspondantes. Ils permettent aussi de vous donner des idées en vue de votre dossier. Il
n’est pas obligatoire de tous les effectuer. Les solutions de ceux-ci sont disponibles sur
Moodle.

Exercices sur les tests de variable(s) qualitative(s)


Pour les questions suivantes :
a) Formulez un test adéquat.
b) Exécutez ce test.
c) Donnez une conclusion claire de ce test.

En vous servant des données de l’enquête correspondante.

RÉSULTATS SPORT (𝜶=5%)

1) Peut-on croire à une augmentation ou à une diminution du nombre de sportifs ?

2) Peut-on croire à une augmentation ou à une diminution du nombre de sportifs pratiquant du sport
au moins cinq fois par semaine ? Si oui, estimez cette diminution ou augmentation.

3) La proportion de femmes sportives est-elle différente de la proportion d’hommes sportifs ? Si oui,


à combien peut-on estimer cette différence ?

4) La proportion de femmes sportives pratiquant du sport une à deux fois semaine est-elle plus
grande ou plus petite que la proportion d’hommes sportifs pratiquant du sport une à deux fois
semaine ? Si oui, à combien peut-on estimer cet écart ?

5) Réalisez le même type de comparaison pour les autres fréquences de pratique sportive.

6) La proportion de sportifs pratiquant du sport le week-end est-elle plus petite ou plus grande que
la proportion de sportifs pratiquant du sport en semaine ?

7) La proportion de sportifs pratiquant du sport la journée est-elle plus petite ou plus grande que la
proportion de sportifs pratiquant du sport en soirée ?

8) La proportion de personnes sportives est-elle identique dans chaque province ? Si non, mettez en
évidence les différences existantes.

9) La proportion de personnes sportives pratiquant leur sport exclusivement en semaine est-elle


identique dans chaque situation professionnelle ? Si non, mettez en évidence les différences
existantes.

10) La proportion de personnes sportives pratiquant leur sport exclusivement en soirée est-elle
identique dans chaque état civil ? Si non, mettez en évidence les différences existantes.

11) Les différentes raisons pour lesquelles les personnes font du sport, sont-elles réparties
équitablement ? Si non, mettez en évidence les différences existantes.

12) Les différentes raisons pour lesquelles les personnes utilisent un cardio, sont-elles réparties
équitablement ? Si non, mettez en évidence les différences existantes.

Page 201
MK311 – Statistique Inférentielle

13) Est-il cohérent de faire ces mêmes tests avec les raisons pour lesquelles on ne pratique pas de
sport et pour lesquelles on n’utilise pas de cardio ? Oui ou non, pourquoi ?

RÉSULTATS IESN (𝜶 = 𝟐%)

1) Peut-on croire à une augmentation ou à une diminution de l’effectif dans les sections Comptabilité
et Marketing?

2) Peut-on croire à un statu quo de la catégorie technique ?

3) La proportion d’étudiants de Marketing venant en voiture est-elle identique à cette même


proportion pour les Comptabilité ?

4) La proportion d’étudiantes qui sont en kot est-elle plus grande ou plus petite que la proportion
d’étudiants qui sont en kot ?

5) La proportion d’étudiants ayant réussi 60 crédits et plus est-elle la même dans chaque section ?

6) La proportion d’étudiants en kot est-elle la même dans chaque bloc ?

7) La proportion de cotes valant 5 attribuée à l’état général du local classe est-elle plus ou moins
grande que la proportion de cotes valant 5 attribuées au local étudiants ?

8) Les proportions de cotes valant 1 sont-elles identiques au niveau de la propreté des différents
locaux ? ne tenez pas compte de la zone fumeur.

9) La proportion d’étudiants qui sont en kot est-elle inférieure ou supérieure à la proportion


d’étudiants venant à l’école par un moyen de locomotion non motorisé ?

RÉSULTATS AUTO (𝜶 = 𝟓%)

1) Le nombre de voitures diesel a-t-il augmenté ou diminué par rapport à 2016 ?

2) Au vu des données européennes de 2012, le groupe PSA est-il stable ?

3) La préférence pour une boîte de vitesses automatique est-elle identique pour les 2 sexes ?

4) La proportion de voitures à plus de 5 places est-elle plus importante chez les personnes mariées
que chez les célibataires ? Si oui, quelle est cette différence ?

5) Les voitures Diesel sont réparties identiquement au sein de chaque province ?

6) Peut-on croire que le nombre de véhicules équipés d’un GPS est identique au nombre de véhicules
équipés d’une aide au stationnement ?

7) Peut-on croire à une différence entre le nombre de personnes qui utilisent toujours leur voiture
pour se rendre au travail et celles qui l’utilisent toujours pour se rendre en vacances ?

8) Les points d’intérêts en vue d’un achat futur ont-ils tous des proportions identiques pour la
réponse « Très important » ? Si ce n’est pas le cas, lesquels ont des proportions significativement
proches ?

Page 202
MK311 – Statistique Inférentielle

Exercices sur les tests de forme


Pour les questions suivantes :

a) Formulez un test adéquat.


b) Exécutez ce test.
c) Donnez une conclusion claire de ce test.

En vous servant des données de l’enquête correspondante.

RÉSULTATS SPORT (𝜶=5%)

1) La répartition de la fréquence par semaine à laquelle les sportifs font du sport correspond-t-elle à
la répartition de la population belge ?

2) La répartition des sports correspond-t-elle à la répartition théorique pour la Wallonie et Bruxelles ?


Nous pouvons fusionner les sports n’apparaissant pas dans la donnée théorique dans une
catégorie « Autre ».

3) Peut-on croire à une indépendance entre le sexe et la fréquence par semaine à laquelle les
personnes pratiquent leur sport ?

4) Peut-on croire à une indépendance entre le niveau d’études et le moment de la journée où les
personnes pratiquent leur sport ?

5) Peut-on croire à une indépendance entre la situation professionnelle et le moment de la semaine


à laquelle les personnes pratiquent leur sport ?

6) Peut-on croire à une indépendance entre l’âge et la raison pour laquelle les personnes ne
pratiquent pas de sport ?

7) Le budget cotisation est-il distribué identiquement entre les hommes et les femmes ?

8) Faites de même pour les autres budgets.

9) Existe-t-il des provinces où le budget cotisation est distribué de manière analogue ?

10) Existe-t-il des situations professionnelles où le budget principal est distribué de manière
analogue ?

11) Testez la normalité pour toutes nos variables quantitatives.

Page 203
MK311 – Statistique Inférentielle

RÉSULTATS IESN (𝜶 = 𝟐%)

1) La répartition de notre échantillon correspond-elle à la répartition de la population I.E.S.N. ?

2) Peut-on croire à une indépendance entre le sexe et la section choisie ?

3) Peut-on croire à une indépendance entre la section et l’appréciation du décret Marcourt ?

4) Le nombre d’heures de travail en semaine est-il réparti de la même façon entre les filles et les
garçons ?

5) Le nombre d’heures de travail le week-end est-il réparti différemment entre la section


Comptabilité et la section Technique de l’Informatique ?

6) L’âge suit-il une distribution normale ?

7) Le nombre d’heures de travail en semaine suit-il une distribution normale ?

RÉSULTATS AUTO (𝜶 = 𝟓%)

1) Peut-on croire à une indépendance entre la profession et l’achat du véhicule (neuf, occasion,
etc.) ?

2) Peut-on croire à une indépendance entre l’état civil et le type de véhicule ?

3) Peut-on croire à une indépendance entre l’âge de la voiture et la profession ?

4) Le kilométrage annuel est-il distribué identiquement entre les voitures neuves et les voitures
d’occasion ?

5) Ce kilométrage annuel suit-il une distribution normale ?

Page 204
MK311 – Statistique Inférentielle

Exercices sur les tests de variable(s) quantitative(s)


Pour les questions suivantes :

a) Formulez un test adéquat.


b) Exécutez ce test.
c) Donnez une conclusion claire de ce test.

En vous servant des données de l’enquête correspondante.

RÉSULTATS SPORT (𝜶=5%)

1) La cotisation moyenne à un club de sport a-t-elle augmenté ou diminué ?

2) Lorsqu’une variable ne suit pas la distribution d’une loi normale, il est possible (si les observations
sont strictement positives) d’opérer un changement de variable Box-Cox qui fera en sorte que
celle-ci suive la distribution d’une loi normale. Pour une valeur d’un paramètre 𝜆, soit défini par
l’utilisateur, soit optimisé par XLSTAT, la transformation est :

𝑥𝜆 − 1
𝐵𝑜𝑥𝐶𝑜𝑥(𝑥, 𝜆) = { 𝜆 𝑠𝑖 𝜆 ≠ 0
log(𝑥) 𝑠𝑖 𝜆 = 0

Utilisez ce procédé pour la question suivante, afin d’effectuer un test paramétrique :

En moyenne, un appareil cardiofréquencemètre coûte 160€ ; ce prix a-t-il augmenté ou diminué ?

3) La fréquence cardiaque minimale est-elle identique chez les hommes et chez les femmes ?

4) Même question pour la fréquence cardiaque maximale ?

5) Le budget principal des femmes est-il en moyenne plus élevé ou moins élevé que celui des
hommes ? Si oui, à combien peut-on estimer cet écart ?

6) Le budget secondaire des célibataires est-il en moyenne plus élevé ou moins élevé que celui des
personnes mariées ? Si oui, à combien peut-on estimer cet écart ?

7) En moyenne, l’écart entre le budget principal et le budget secondaire est de ………..

8) La fréquence de réserve est définie comme la différence entre la fréquence cardiaque maximale
et la minimale ? Peut-on affirmer qu’en moyenne celle-ci est de 100 BPM ? Répondez à cette
question en utilisant deux tests différents.

9) Peut-on croire qu’en moyenne le budget secondaire est similaire au budget cotisation ? Si non,
évaluez cette différence.

Page 205
MK311 – Statistique Inférentielle

RÉSULTATS IESN (𝜶 = 𝟐%)

1) Peut-on croire que l’âge moyen des étudiants est de 20 ans ?

2) Peut-on espérer que les étudiants travaillent en moyenne plus de 2 heures en semaine ?

3) Le nombre d’heures de travail le week-end des filles est-il plus ou moins élevé que celui des
garçons ? S’il y a une différence, donnez un ordre de grandeur pour celle-ci.

4) Les étudiants en Informatique de Gestion sont-ils plus ou moins tatillons sur l’accessibilité à
Internet que les étudiants en Comptabilité ?

5) Peut-on estimer une différence moyenne de pointure entre les étudiants mesurant entre 150 cm
et 160 cm et les étudiants mesurant entre 190 cm et 200 cm ? Si oui, laquelle ?

6) Les étudiants travaillent-ils plus ou moins le week-end qu’en semaine ?

7) La cote moyenne du secrétariat général est-elle identique à celle du secrétariat des étudiants ?
Attention aux échantillons.

8) La cote moyenne pour la propreté des classes est-elle similaire à la cote moyenne pour la propreté
des couloirs ?

RÉSULTATS AUTO (𝜶 = 𝟓%)

1) Peut-on croire à des modifications sur la cylindrée des véhicules ?

2) Le nombre de kilomètres parcourus par an est-il en évolution ?

3) On dit toujours que les personnes possédant un véhicule diesel parcourent plus de kilomètres que
les personnes possédant un véhicule essence. Est-ce bien le cas ?

4) Les SUV coûtent-ils plus ou moins cher que les Monospace ?

5) A combien peut-on estimer la différence entre le budget pour un véhicule neuf et le budget pour
un véhicule d’occasion ?

Page 206
MK311 – Statistique Inférentielle

6. Données relatives aux exercices


Pratique sportive de la population belge au 01/09/2019

Les deux tiers de la population belge peut se revendiquer comme sportive

Répartition de la fréquence de la pratique sportive par


semaine en Belgique
Une à deux fois 60,7%

Trois à quatre fois 26,1%

Au moins cinq fois 13,2%

En moyenne, la cotisation à un club de sport est de 120€ par an.


Le nombre total d’affiliés en Wallonie et à Bruxelles est de 1 250 623.

Page 207
MK311 – Statistique Inférentielle

Population I.E.S.N. au 01/09/2017 21

% de la
% de la
Bloc Total population
section
totale
AU 1 69 3,65% 49,29%
2 41 2,17% 29,29%
3 30 1,59% 21,43%
140 7,40% 100,00%
TI 1 118 6,24% 48,76%
2 59 3,12% 24,38%
3 65 3,44% 26,86%
242 12,79% 100,00%
NSEFS 1 18 0,95% 43,90%
2 17 0,90% 41,46%
3 6 0,32% 14,63%
41 2,17% 100,00%
NSECO 1 3 0,16% 23,08%
2 6 0,32% 46,15%
3 4 0,21% 30,77%
13 0,69% 100,00%
IG 1 131 6,92% 51,57%
2 69 3,65% 27,17%
3 54 2,85% 21,26%
254 13,42% 100,00%
MK 1 252 13,32% 49,41%
2 134 7,08% 26,27%
3 124 6,55% 24,31%
510 26,96% 100,00%
DR 1 100 5,29% 37,17%
2 95 5,02% 35,32%
3 74 3,91% 27,51%
269 14,22% 100,00%
CP 1 203 10,73% 47,99%
CF 2 91 4,81% 21,51%
CG 2 28 1,48% 6,62%
CF 3 79 4,18% 18,68%
CG 3 22 1,16% 5,20%
423 22,36% 100,00%
TOTAL 1892
Technique 382 20,19%
Pédagogique 54 2,85%
Economique 1456 76,96%

21La section Sécurité et Système n’existait pas encore et la section et le régendat en Sciences
Economiques existait encore.

Page 208
MK311 – Statistique Inférentielle

Parc automobile belge en 2018

Voitures Effectif % Cylindrées Essence Diesel Total


Essence 2199038 38,50% Moyenne 1395,17495 1726,97711 1597,81019
Diesel 3424592 59,95% Variance 155705,589 128998,429 165569,001
LPG 17238 0,30% Ecart-type 394,595475 359,163513 406,901709
Electrique 4368 0,08% CV 28,28% 20,80% 25,47%
Hybride 66825 1,17%
5712061 100%

Répartition du parc automobile par province


Province de Namur
4,23%
Province de Brabant Région de
Province de wallon Bruxelles-
Luxembourg 3,68% Capitale
2,49% 9,16%

Province de Liège
9,27% Province d’Anvers
16,07%
Province de Hainaut
11,26% Province de Limbourg
8,18%
Province de Flandre
occidentale Province de Flandre
10,64% Province de Brabant orientale
flamand 12,67%
12,35%

Page 209
MK311 – Statistique Inférentielle

Age Effectif %
0 332321 5,82%
1 447136 7,83%
2 433771 7,59%
En moyenne, la distance parcourue par an est de 15 151km.
3 421234 7,37%
4 396543 6,94%
5 434132 7,60%
6 395151 6,92%
7 334407 5,85%
8 343001 6,00%
9 312267 5,47%
10 290080 5,08%
11 237276 4,15%
12 214948 3,76%
13 172184 3,01%
14 151199 2,65%
15 123897 2,17%
16 115207 2,02%
17 et + 557307 9,76%
5712061 100,00%

Page 210
Annexe

ANNEXE

Paramètre Population Echantillon Estimateur

Taille 𝑁 𝑛

Rapport entre un effectif Rapport entre un effectif


Proportion 𝜋𝑋 𝑓𝑋 observé
Observé et la taille de la
population et la taille de l’échantillon

Modalité ou valeur la plus Modalité ou valeur la plus


Mode Mode Mode
fréquente fréquente

Valeur maximale de 50% Valeur maximale de 50%


Médiane Médiane des observations de la Médiane des observations de
population l’échantillon

𝑁 Moyenne des valeurs 𝑛 Moyenne des valeurs


1 1
Moyenne 𝜇𝑋 = ∑ 𝑋𝑖 observées sur une 𝑥̅ = ∑ 𝑥𝑖 observées sur un
𝑁 𝑛
𝑖=1 population 𝑖=1 échantillon

Page 211
Annexe

Mesure moyenne de la dispersion des valeurs autour de la moyenne (en unité au carré)

𝑁
Moyenne des distances au 𝑛
Estimation de la moyenne
1 carré entre les valeurs 1 des distances au carré
Variance 𝜎𝑋2 = ∑(𝑋𝑖 − 𝜇𝑋 )2 𝑠𝑋2 = ∑(𝑥𝑖 − 𝑥̅ )2
𝑁 d’une population et sa 𝑛−1 entre les valeurs d’un
𝑖=1 𝑖=1
moyenne échantillon et sa moyenne

Mesure moyenne de la dispersion des valeurs autour de la moyenne (dans l’unité initiale)

Racine carrée de la Racine carrée de la


Ecart-type √𝜎𝑋2 √𝑠𝑋2
variance variance estimée

Mesure de la variation des valeurs en pourcentage

Coefficient de 𝜎𝑋 Rapport de l’écart-type à 𝑠𝑋 Rapport de l’écart-type


𝐶𝑉 = 𝐶𝑉 =
variation 𝜇𝑋 la moyenne 𝑥̅ estimé à la moyenne

Indice de l’indépendance entre deux variables qualitatives


𝑝 𝑞 2 𝑝 𝑞 2
(𝑁𝑖𝑗 − 𝐴𝑖𝑗 ) Somme des carrés relatifs (𝑛𝑖𝑗 − 𝑎𝑖𝑗 ) Somme des carrés relatifs
2
Indice 𝜒 𝜒2 = ∑ ∑ des écarts entre 2
𝑐 = ∑∑ des écarts entre
𝐴𝑖𝑗 𝑎𝑖𝑗
𝑖=1 𝑗=1 observations et attendus 𝑖=1 𝑗=1 observations et attendus

Page 212
Annexe

Pourcentage d’influence d’une variable qualitative sur une autre variable qualitative.

Racine carrée du rapport Racine carrée du rapport


𝜒2 𝑐2
Indice de Cramer √ entre l’indice et la taille du √ entre l’indice et la taille du
𝑁 × min (𝑝 − 1; 𝑞 − 1) tableau 𝑛 × min (𝑝 − 1; 𝑞 − 1) tableau

Paramètres d’une variable quantitative relatifs aux modalités d’une variable qualitative

Moyenne Moyenne de chaque sous- Moyenne de chaque sous-


𝜇𝑌|𝑋=𝑋𝑖 𝑦̅𝑋=𝑥𝑖
conditionnelle population échantillon

Variance 2 Variance de chaque sous- 2 Variance estimée de


𝜎𝑌|𝑋=𝑋 𝑠𝑌|𝑋=𝑥
conditionnelle 𝑖 population 𝑖 chaque sous-échantillon

Mesure de la variabilité entre modalité d’une variable qualitative


𝑝
1 𝑝 Variance pondérée
Variance ∑ 𝑁𝑖∗ × (𝜇𝑌|𝑋=𝑋𝑖 Variance pondérée des 1
𝑁 ∑ 𝑛𝑖 (𝑦̅𝑋=𝑥𝑖 − 𝑦̅)2 estimée des moyennes
intergroupe 𝑖=1 moyennes conditionnelles 𝑛−1
2 𝑖=1 conditionnelles
− 𝜇𝑌 )

Page 213
Annexe

Mesure la variabilité moyenne des modalités d’une variable qualitative


𝑝 𝑝 Moyenne pondérée
Variance 1 2 Moyenne pondérée des 1 2
∑ 𝑁𝑖∗ × 𝜎𝑌|𝑋=𝑋 ∑(𝑛𝑖 − 1) 𝑠𝑌|𝑋=𝑥 estimée des variances
intragroupe 𝑁 𝑖 variances conditionnelles 𝑛−1 𝑖
𝑖=1 𝑖=1 conditionnelles

Pourcentage d’influence d’une variable qualitative sur une variable quantitative

Racine carrée du rapport Racine carrée du rapport


Rapport de 𝑣𝑎𝑟 𝑖𝑛𝑡𝑒𝑟 𝑣𝑎𝑟 𝑖𝑛𝑡𝑒𝑟
𝜂𝑌|𝑋 =√ relatif de la variance inter ê𝑌|𝑋 =√ relatif de la variance inter
corrélation 𝑣𝑎𝑟 𝑚𝑎𝑟𝑔𝑖𝑛𝑎𝑙𝑒 𝑣𝑎𝑟 𝑚𝑎𝑟𝑔𝑖𝑛𝑎𝑙𝑒
de la population de l’échantillon

Mesure d’un lien croissant ou décroissant entre deux variables quantitatives (positif ou négatif)

Moyenne estimée des


Moyenne des produits des
𝑁
𝑛 produits des différences
1 différences entre les 1
Covariance 𝐶𝑜𝑣𝑋𝑌 =
𝑁
∑(𝑋𝑖 − 𝜇𝑋 ) × (𝑌𝑖 − 𝜇𝑌 ) 𝐶𝑜𝑣(𝑋, 𝑌) = ∑(𝑥𝑖 − 𝑥̅ )(𝑦𝑖 − 𝑦̅) entre les valeurs
𝑖=1 valeurs observées et leur 𝑛−1
𝑖=1 observées et leur
moyenne respective
moyenne respective

Page 214
Annexe

Mesure de l’exactitude du modèle linéaire (entre -1 et 1)

𝐶𝑜𝑣𝑋𝑌 Rapport de la covariance


Coefficient de Rapport de la covariance 𝐶𝑜𝑣(𝑋, 𝑌)
𝜌𝑋𝑌 = 𝑟= estimée au produit des
corrélation linéaire 𝜎𝑋 𝜎𝑌 au produit des écarts types 𝑠𝑋 𝑠𝑌
écarts types estimés

Pourcentage de variabilité d’une variable quantitative expliquée par une autre variable
quantitative dans le modèle choisi

Complémentaire du Complémentaire du
Coefficient de ∑𝑛𝑖=1 𝐸𝑖2 rapport de la moyenne des ∑𝑛𝑖=1 𝑒𝑖2 rapport de la moyenne des
𝜌2 = 1 − 𝑅2 = 1 −
détermination 𝑁 𝜎𝑌2 résidus au carré à la (𝑛 − 1)𝑠𝑌2 résidus au carré à la
variance variance estimée

Paramètres du modèle linéaire

Rapport de la covariance
Pente de la droite 𝐶𝑜𝑣𝑋𝑌 Rapport de la covariance 𝐶𝑜𝑣(𝑋, 𝑌) estimée et de la variance
de régression 𝛼= et de la variance de la 𝑎=
𝜎𝑋2 𝑠𝑋2 estimée de la variable
linéaire variable explicative
explicative

Ordonnée à
l’origine de la La droite passera par le La droite passera par le
𝛽 = 𝜇𝑌 − 𝛼 𝜇 𝑋 𝑏 = 𝑦̅ − 𝑎 𝑥̅
droite de point moyen point moyen
régression linéaire

Page 215
Annexe

BIBLIOGRAPHIE
Corinne Hahn Méthodes statistiques appliquées au management, 2ème édition. Pearson.

Naresh Malhotra. Etudes Marketing. Pearson.

Bernard Grais. Statistique descriptive. Dunod.

Bernard Py. La statistique sans formule mathématique. Pearson.

Brigitte Tribout. Statistique pour économistes et gestionnaires. Pearson.

Alain Baccini. Statistique descriptive élémentaire. Publications de l’Institut de


Mathématiques de Toulouse.

Alain Baccini. Statistique descriptive multidimensionnelle. Publications de l’Institut de


Mathématiques de Toulouse.

XLSTAT. Aide XLSTAT 2020. Addinsoft.

Page 216

Vous aimerez peut-être aussi