TP 1 – Manipulation, Visualisation & Prétraitement
des Données
Ce TP a pour but d'entraîner les étudiants à explorer, manipuler et préparer un jeu de données réel
en vue d'une utilisation dans un algorithme de machine Learning (non inclus ici).
1. Compréhension du Dataset:
Question 1 : Combien de lignes et de colonnes contient ce dataset ?
Question 2 : Listez toutes les colonnes et, pour chacune, identifiez :
Le type de donnée (catégorielle ou numérique)
Quelle est la distribution des données numériques (moyenne, médiane, écart-type) ?
Y a-t-il des corrélations fortes entre certaines variables numériques ?Utilisez une
heatmap de la matrice de corrélation
Question 3 : Y a-t-il des valeurs manquantes dans ce dataset ?
Question 4 : Y a-t-il des valeurs dupliquées dans les lignes ? Si oui, combien, et comment peut-on
les traiter ?
Question 5 : Identifie-s’il y a des outliers (valeurs extrêmes) dans les colonnes numériques.
Où les suspecte-t-on ?
Quelle méthode peut-on utiliser pour les détecter ?
2. Manipulation et visualisation de données :
Question 6 : Y a-t-il des colonnes à supprimer ? Justifiez votre choix.
Question 7 : Faites une analyse bivariée entre le revenu annuel et le score de dépense
Quel graphique utiliser ?
Que pouvez-vous en déduire sur le comportement des clients ?
Question 8 : Affichez la répartition des genres. Est-elle équilibrée ? Que peut-on en conclure pour
une future analyse ?
Question 9 : Tracez un boxplot pour la variable “Annual Income (k$)”.
Voyez-vous des outliers ?
Quelle est la dispersion des revenus ?
3. Prétraitement de données :
Question 10 : Supprimer les colonnes (ID, Ever_Married, Var_1)
Question 11 : Supprimer les duplicates que vous avez identifiez dans la question 4.
Question 12 : Traiter les Outliers (Identifie en question 5) en utilisant la méthode IQR
Question 13 : Imputer les valeurs manquantes.
Question 14 : Normaliser les variables numériques
Question 15 : Encoder les données catégorielles (Label encoder / One Hot Encoder ?)