Filière : 4IIR Machine Learning
Exercice complet : Prétraitement de données RH
Contexte
Une entreprise souhaite analyser les performances de ses employés à partir de données internes.
Cependant, le jeu de données contient plusieurs erreurs, incohérences et valeurs manquantes
qu’il faut corriger avant toute analyse.
Expérience Heures Score Salaire
ID Nom Âge Diplôme Département
(années) Formation Performance (DH)
1 Sara 25 2.0 Licence Finance 20 78 6000
2 Mehdi 28 4.0 Master RH 25 85 7500
3 Rania 35 NaN Doctorat IT 18 92 11000
4 Omar 30 3.5 licence IT NaN 80 NaN
5 Hajar 40 10.0 Master marketing 300 88 9500
6 Ali 27 2.5 Licence Finance 22 0 6700
7 Nada 33 7.0 Master RH 27 90 7200
8 Karim 45 12.0 Doctorat Marketing 35 95 12000
9 Lina 26 "2" Licence Finance 21 76 6100
10 Rachid 29 NaN Lic. IT 19 83 7000
11 Salma NaN 9.0 master Marketing NaN 87 9000
12 Salma NaN 9.0 master Marketing NaN 87 9000
13 Imane 31 4.0 Master rh 26 -5 8500
14 Yassine 55 1.5 NaN RH 50 130 15000
15 Adil 24 0.5 Licence Finance None NaN 5800
Inspection et nettoyage initial
• Identifiez les valeurs manquantes, doublons, et erreurs de frappe dans les colonnes.
• Supprimez les doublons.
• Corrigez les incohérences dans les colonnes Diplôme et Département (ex. "licence" →
"Licence", "rh" → "RH", "marketing" → "Marketing").
• Remplacez les valeurs "None" ou entre guillemets (ex. "2") par de vraies valeurs
numériques ou NaN.
Traitement des valeurs manquantes
• Pour Âge, remplacez les valeurs manquantes par la moyenne.
• Pour Expérience, remplacez les valeurs manquantes par la médiane.
• Pour Heures Formation, remplacez les valeurs manquantes par la médiane.
1
Filière : 4IIR Machine Learning
• Pour Score Performance, remplacez les valeurs manquantes par la moyenne.
• Pour Diplôme, remplacez les NaN par la modalité la plus fréquente.
Détection et traitement des valeurs aberrantes
• Corrigez les valeurs extrêmes :
o Heures Formation = 300 doit être corrigé (il s’agit probablement d’une erreur de
saisie, remplacez par la moyenne du groupe “Marketing”).
o Score Performance = -5 ou 130 sont aberrants : corrigez selon les bornes plausibles
(0–100).
• Vérifiez également si Âge et Expérience ont des valeurs logiques (ex. pas d’expérience
négative ou > âge).
Transformation des variables catégorielles
• Appliquez un One-Hot Encoding sur les variables :
o Diplôme (Licence, Master, Doctorat)
o Département (Finance, RH, IT, Marketing)
Normalisation et préparation du dataset
• Normalisez les colonnes :
o Âge, Expérience, Heures Formation, Salaire, Score Performance
o en utilisant la méthode Min-Max scaling :
o Supprimez la colonne ID et conservez Score Performance comme variable cible.