Module : Intelligence Artificielle Master : 2I2S
TP2 : Pré-traitement des données
Objectifs
• Comprendre l’importance du pré-traitement des données.
• Identifier et corriger les problèmes liés aux données brutes.
• Appliquer les principales techniques de nettoyage avec Orange Data Mining.
• Préparer un dataset propre et exploitable pour l’analyse.
1. Chargement et exploration initiale du dataset
• Widgets : File → Data Table → Feature Statistics
• Afficher le dataset.
• Identifier :
1. Le nombre d’instances
2. Les types de variables
3. Présence de valeurs manquantes
4. Valeurs minimales et maximales
2. Identification des types d’erreurs
• Repérer :
1. Valeurs impossibles (ex : Revenu négatif)
2. Catégories mal orthographiées
3. Valeurs manquantes
4. Doublons
3. Gestion des valeurs manquantes
Comprendre le pattern
• Expliquer brièvement :
1. MCAR : Missing Completely At Random
2. MPAR : Missing Partially At Random
3. MNAR : Missing Not At Random
Traitement
• Widgets :
▪ Select Rows
Pr. LOUDIYI LAMGHAFRI Aya 1
Module : Intelligence Artificielle Master : 2I2S
▪ Select Columns
▪ Impute
▪ Feature Statistics
• Activités :
1. Observer le nombre de valeurs manquantes par variable.
2. Tester différentes méthodes et comparer les effets sur le dataset.
▪ Suppression de lignes
▪ Remplacement par moyenne / médiane (variables numériques)
▪ Remplacement par mode (variables catégorielles)
▪ Suppression de variables
4. Nettoyage des données incohérentes
• Widgets :
▪ Edit Domain
▪ Data Table
▪ Unique
• Activités :
1. Uniformiser les catégories de Type_Contrat ("CDI", "cdi", "C.D.I").
2. Supprimer les doublons.
5. Détection des valeurs aberrantes
• Widgets :
▪ Box Plot
▪ Scatter Plot
• Activités :
1. Visualiser Revenu_Mensuel et Score_Engagement.
2. Identifier les valeurs éloignées du reste.
3. Décider :
▪ Supprimer
▪ Transformer
▪ Conserver avec justification
6. Transformation des données
• Widget : Preprocess
Pr. LOUDIYI LAMGHAFRI Aya 2
Module : Intelligence Artificielle Master : 2I2S
• Activités :
1. Appliquer la normalisation
2. Appliquer la standardisation.
2. Observer les changements de distribution.
7. Encodage des variables catégorielles
• Widget : Continuize
• Activités :
1. Appliquer Label Encoding.
2. Tester One-Hot Encoding.
3. Observer l’impact sur le nombre de variables.
8. Sélection et réduction des variables
• Widgets :
▪ Rank
▪ Select Columns
• Activités :
1. Identifier les variables les moins informatives.
2. Supprimer les variables inutiles.
Pr. LOUDIYI LAMGHAFRI Aya 3