0% ont trouvé ce document utile (0 vote)
41 vues2 pages

Prétraitement et Visualisation de Données

Ce TP vise à former les étudiants à la manipulation et à la préparation de données pour le machine learning. Il aborde des questions sur la compréhension du dataset, la manipulation et la visualisation des données, ainsi que le prétraitement des données. Les étudiants doivent analyser des aspects tels que les valeurs manquantes, les outliers, et effectuer des visualisations pour mieux comprendre les données.

Transféré par

ouss.muste
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
41 vues2 pages

Prétraitement et Visualisation de Données

Ce TP vise à former les étudiants à la manipulation et à la préparation de données pour le machine learning. Il aborde des questions sur la compréhension du dataset, la manipulation et la visualisation des données, ainsi que le prétraitement des données. Les étudiants doivent analyser des aspects tels que les valeurs manquantes, les outliers, et effectuer des visualisations pour mieux comprendre les données.

Transféré par

ouss.muste
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

TP 1 – Manipulation, Visualisation & Prétraitement

des Données
Ce TP a pour but d'entraîner les étudiants à explorer, manipuler et préparer un jeu de données réel
en vue d'une utilisation dans un algorithme de machine Learning (non inclus ici).

1. Compréhension du Dataset:

Question 1 : Combien de lignes et de colonnes contient ce dataset ?

Question 2 : Listez toutes les colonnes et, pour chacune, identifiez :


 Le type de donnée (catégorielle ou numérique)

 Quelle est la distribution des données numériques (moyenne, médiane, écart-type) ?

 Y a-t-il des corrélations fortes entre certaines variables numériques ?Utilisez une
heatmap de la matrice de corrélation

Question 3 : Y a-t-il des valeurs manquantes dans ce dataset ?

Question 4 : Y a-t-il des valeurs dupliquées dans les lignes ? Si oui, combien, et comment peut-on
les traiter ?

Question 5 : Identifie-s’il y a des outliers (valeurs extrêmes) dans les colonnes numériques.
 Où les suspecte-t-on ?

 Quelle méthode peut-on utiliser pour les détecter ?

2. Manipulation et visualisation de données :

Question 6 : Y a-t-il des colonnes à supprimer ? Justifiez votre choix.

Question 7 : Faites une analyse bivariée entre le revenu annuel et le score de dépense
 Quel graphique utiliser ?

 Que pouvez-vous en déduire sur le comportement des clients ?

Question 8 : Affichez la répartition des genres. Est-elle équilibrée ? Que peut-on en conclure pour
une future analyse ?

Question 9 : Tracez un boxplot pour la variable “Annual Income (k$)”.


 Voyez-vous des outliers ?

 Quelle est la dispersion des revenus ?

3. Prétraitement de données :

Question 10 : Supprimer les colonnes (ID, Ever_Married, Var_1)


Question 11 : Supprimer les duplicates que vous avez identifiez dans la question 4.
Question 12 : Traiter les Outliers (Identifie en question 5) en utilisant la méthode IQR
Question 13 : Imputer les valeurs manquantes.
Question 14 : Normaliser les variables numériques
Question 15 : Encoder les données catégorielles (Label encoder / One Hot Encoder ?)

Vous aimerez peut-être aussi