Variable quantitative et variable qualitative
On peut travailler avec le jeu de données tiré de l’enquête ”Histoire
de vie” inclus dans l’extension (package) questionr.
On commence donc par charger l’extension, le jeu de données, et à le
renommer en un nom plus court pour gagner un peu de temps de
saisie au clavier.
library(questionr)
data(hdv2003)
d < − hdv2003
Besma Ayed (Faculté des Sciences de Monastir)
Atelier statistiques avec R 287 / 310 10 décembre 2024 287 / 310
Représentation graphique
Croiser une variable quantitative et une variable qualitative, c’est
essayer de voir si les valeurs de la variable quantitative se répartissent
différemment selon la catégorie d’appartenance de la variable
qualitative.
Pour cela, l’idéal est de commencer par une représentation graphique
de type ”boı̂te à moustache” à l’aide de la fonction boxplot.
Par exemple, si on veut visualiser la répartition des âges selon la
pratique ou non d’un sport, on va utiliser la syntaxe suivante :
Besma Ayed (Faculté des Sciences de Monastir)
Atelier statistiques avec R 288 / 310 10 décembre 2024 288 / 310
Besma Ayed (Faculté des Sciences de Monastir)
Atelier statistiques avec R 289 / 310 10 décembre 2024 289 / 310
L’interprétation d’un boxplot est la suivante :
Les bords inférieurs et supérieurs du carré central représentent le
premier et le troisième quartile de la variable représentée sur l’axe
vertical. On a donc 50% de nos observations dans cet intervalle.
Le trait horizontal dans le carré représente la médiane.
Enfin, des ”moustaches” s’étendent de chaque côté du carré,
jusqu’aux valeurs minimales et maximales, avec une exception : si des
valeurs sont éloignées du carré de plus de 1, 5 fois l’écart interquartile
(la hauteur du carré), alors on les représente sous forme de points
(symbolisant des valeurs considérées comme ”extrêmes”).
Dans le graphique ci-dessus, on voit que ceux qui ont pratiqué un
sport au cours des douze derniers mois ont l’air d’être sensiblement
plus jeunes que les autres.
Besma Ayed (Faculté des Sciences de Monastir)
Atelier statistiques avec R 290 / 310 10 décembre 2024 290 / 310
On peut comparer certains indicateurs (moyenne, médiane) d’une
variable quantitative selon les modalités d’une variable qualitative.
Si on reprend l’exemple précédent, on peut calculer la moyenne d’âge
pour ceux qui pratiquent un sport et pour ceux qui n’en pratiquent
pas.
Une première méthode pour cela est d’extraire de notre population
autant de sous-populations qu’il y a de modalités dans la variable
qualitative.
On peut le faire notamment avec la fonction filter du package dplyr.
On commence par charger dplyr (en l’ayant préalablement installé) :
library(dplyr)
Puis on applique filter pour créer deux sous-populations, stockées
dans deux nouveaux tableaux de données.
Besma Ayed (Faculté des Sciences de Monastir)
Atelier statistiques avec R 291 / 310 10 décembre 2024 291 / 310
Besma Ayed (Faculté des Sciences de Monastir)
Atelier statistiques avec R 292 / 310 10 décembre 2024 292 / 310
Une autre possibilité est d’utiliser la fonction tapply, qui prend en
paramètre une variable quantitative, une variable qualitative et une
fonction, puis applique automatiquement la fonction aux valeurs de la
variables quantitative pour chaque niveau de la variable qualitative :
Besma Ayed (Faculté des Sciences de Monastir)
Atelier statistiques avec R 293 / 310 10 décembre 2024 293 / 310
Tests statistiques
Un des tests les plus connus est le test du t de Student, qui permet
de tester si les moyennes de deux sous-populations peuvent être
considérées comme différentes.
Un test t s’effectue à l’aide de la fonction [Link](). Ainsi, on peut
tester l’hypothèse d’égalité des âges moyens selon la pratique ou non
d’un sport avec la commande suivante :
Besma Ayed (Faculté des Sciences de Monastir)
Atelier statistiques avec R 294 / 310 10 décembre 2024 294 / 310
Le résultat du test est significatif, avec un p extrêmement petit, et on peut
rejeter l’hypothèse H0 d’égalité des moyennes des deux groupes.
Le test nous donne même un intervalle de confiance à 95% pour la valeur
de la différence entre les deux moyennes.
Besma Ayed (Faculté des Sciences de Monastir)
Atelier statistiques avec R 295 / 310 10 décembre 2024 295 / 310
le test t s’applique normalement à des distributions normales.
On peut se faire un premier aperçu visuel de cette normalité en
traçant les histogrammes des deux répartitions :
Besma Ayed (Faculté des Sciences de Monastir)
Atelier statistiques avec R 296 / 310 10 décembre 2024 296 / 310
Besma Ayed (Faculté des Sciences de Monastir)
Atelier statistiques avec R 297 / 310 10 décembre 2024 297 / 310
Besma Ayed (Faculté des Sciences de Monastir)
Atelier statistiques avec R 298 / 310 10 décembre 2024 298 / 310
Si l’âge dans le groupe des non sportifs se rapproche d’une
distribution normale, celui des sportifs en semble assez éloigné
On peut tester cette normalité à l’aide du test de Shapiro-Wilk et de
la fonction [Link]
Besma Ayed (Faculté des Sciences de Monastir)
Atelier statistiques avec R 299 / 310 10 décembre 2024 299 / 310
Besma Ayed (Faculté des Sciences de Monastir)
Atelier statistiques avec R 300 / 310 10 décembre 2024 300 / 310
Le test est significatif dans les deux cas et rejette l’hypothèse d’une
normalité des deux distributions.
Dans ce cas on peut faire appel à un test non-paramétrique, qui ne
fait donc pas d’hypothèses sur les lois de distribution des variables
testées, en l’occurrence le test des rangs de Wilcoxon, à l’aide de la
fonction [Link]() :
Besma Ayed (Faculté des Sciences de Monastir)
Atelier statistiques avec R 301 / 310 10 décembre 2024 301 / 310
La valeur p étant à nouveau extrêmement petite, on peut rejeter
l’hypothèse d’indépendance et considérer que les distributions des âges
dans les deux sous-populations sont différentes.
Besma Ayed (Faculté des Sciences de Monastir)
Atelier statistiques avec R 302 / 310 10 décembre 2024 302 / 310