0% ont trouvé ce document utile (0 vote)
2 vues3 pages

TP2: Pré-Traitement Des Données: Objectifs

Le TP2 sur le pré-traitement des données vise à comprendre son importance et à appliquer des techniques de nettoyage avec Orange Data Mining. Les étapes incluent l'exploration initiale du dataset, l'identification et la gestion des valeurs manquantes, le nettoyage des incohérences, la détection des valeurs aberrantes, la transformation des données, l'encodage des variables catégorielles, et la sélection des variables. L'objectif final est de préparer un dataset propre et exploitable pour l'analyse.

Transféré par

kawtar.chicha
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
2 vues3 pages

TP2: Pré-Traitement Des Données: Objectifs

Le TP2 sur le pré-traitement des données vise à comprendre son importance et à appliquer des techniques de nettoyage avec Orange Data Mining. Les étapes incluent l'exploration initiale du dataset, l'identification et la gestion des valeurs manquantes, le nettoyage des incohérences, la détection des valeurs aberrantes, la transformation des données, l'encodage des variables catégorielles, et la sélection des variables. L'objectif final est de préparer un dataset propre et exploitable pour l'analyse.

Transféré par

kawtar.chicha
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Module : Intelligence Artificielle Master : 2I2S

TP2 : Pré-traitement des données


Objectifs

• Comprendre l’importance du pré-traitement des données.


• Identifier et corriger les problèmes liés aux données brutes.
• Appliquer les principales techniques de nettoyage avec Orange Data Mining.
• Préparer un dataset propre et exploitable pour l’analyse.

1. Chargement et exploration initiale du dataset

• Widgets : File → Data Table → Feature Statistics


• Afficher le dataset.
• Identifier :
1. Le nombre d’instances
2. Les types de variables
3. Présence de valeurs manquantes
4. Valeurs minimales et maximales

2. Identification des types d’erreurs

• Repérer :
1. Valeurs impossibles (ex : Revenu négatif)
2. Catégories mal orthographiées
3. Valeurs manquantes
4. Doublons

3. Gestion des valeurs manquantes

Comprendre le pattern

• Expliquer brièvement :
1. MCAR : Missing Completely At Random
2. MPAR : Missing Partially At Random
3. MNAR : Missing Not At Random

Traitement

• Widgets :
▪ Select Rows

Pr. LOUDIYI LAMGHAFRI Aya 1


Module : Intelligence Artificielle Master : 2I2S

▪ Select Columns
▪ Impute
▪ Feature Statistics
• Activités :
1. Observer le nombre de valeurs manquantes par variable.
2. Tester différentes méthodes et comparer les effets sur le dataset.
▪ Suppression de lignes
▪ Remplacement par moyenne / médiane (variables numériques)
▪ Remplacement par mode (variables catégorielles)
▪ Suppression de variables

4. Nettoyage des données incohérentes

• Widgets :
▪ Edit Domain
▪ Data Table
▪ Unique
• Activités :
1. Uniformiser les catégories de Type_Contrat ("CDI", "cdi", "C.D.I").
2. Supprimer les doublons.

5. Détection des valeurs aberrantes

• Widgets :
▪ Box Plot
▪ Scatter Plot
• Activités :
1. Visualiser Revenu_Mensuel et Score_Engagement.
2. Identifier les valeurs éloignées du reste.
3. Décider :
▪ Supprimer
▪ Transformer
▪ Conserver avec justification

6. Transformation des données

• Widget : Preprocess

Pr. LOUDIYI LAMGHAFRI Aya 2


Module : Intelligence Artificielle Master : 2I2S

• Activités :
1. Appliquer la normalisation
2. Appliquer la standardisation.
2. Observer les changements de distribution.

7. Encodage des variables catégorielles

• Widget : Continuize
• Activités :
1. Appliquer Label Encoding.
2. Tester One-Hot Encoding.
3. Observer l’impact sur le nombre de variables.

8. Sélection et réduction des variables

• Widgets :
▪ Rank
▪ Select Columns
• Activités :
1. Identifier les variables les moins informatives.
2. Supprimer les variables inutiles.

Pr. LOUDIYI LAMGHAFRI Aya 3

Vous aimerez peut-être aussi