0% ont trouvé ce document utile (0 vote)
39 vues2 pages

Prétraitement des données RH en ML

L'entreprise souhaite analyser les performances de ses employés à partir de données internes, mais le jeu de données présente des erreurs, incohérences et valeurs manquantes. Un processus de prétraitement est proposé, incluant l'identification et la correction des erreurs, le traitement des valeurs manquantes, la détection des valeurs aberrantes, et la transformation des variables catégorielles. Enfin, les données seront normalisées et préparées pour l'analyse, en conservant le Score Performance comme variable cible.

Transféré par

aya bounar
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
39 vues2 pages

Prétraitement des données RH en ML

L'entreprise souhaite analyser les performances de ses employés à partir de données internes, mais le jeu de données présente des erreurs, incohérences et valeurs manquantes. Un processus de prétraitement est proposé, incluant l'identification et la correction des erreurs, le traitement des valeurs manquantes, la détection des valeurs aberrantes, et la transformation des variables catégorielles. Enfin, les données seront normalisées et préparées pour l'analyse, en conservant le Score Performance comme variable cible.

Transféré par

aya bounar
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Filière : 4IIR Machine Learning

Exercice complet : Prétraitement de données RH


Contexte
Une entreprise souhaite analyser les performances de ses employés à partir de données internes.
Cependant, le jeu de données contient plusieurs erreurs, incohérences et valeurs manquantes
qu’il faut corriger avant toute analyse.

Expérience Heures Score Salaire


ID Nom Âge Diplôme Département
(années) Formation Performance (DH)
1 Sara 25 2.0 Licence Finance 20 78 6000
2 Mehdi 28 4.0 Master RH 25 85 7500
3 Rania 35 NaN Doctorat IT 18 92 11000
4 Omar 30 3.5 licence IT NaN 80 NaN
5 Hajar 40 10.0 Master marketing 300 88 9500
6 Ali 27 2.5 Licence Finance 22 0 6700
7 Nada 33 7.0 Master RH 27 90 7200
8 Karim 45 12.0 Doctorat Marketing 35 95 12000
9 Lina 26 "2" Licence Finance 21 76 6100
10 Rachid 29 NaN Lic. IT 19 83 7000
11 Salma NaN 9.0 master Marketing NaN 87 9000
12 Salma NaN 9.0 master Marketing NaN 87 9000
13 Imane 31 4.0 Master rh 26 -5 8500
14 Yassine 55 1.5 NaN RH 50 130 15000
15 Adil 24 0.5 Licence Finance None NaN 5800

Inspection et nettoyage initial


• Identifiez les valeurs manquantes, doublons, et erreurs de frappe dans les colonnes.
• Supprimez les doublons.
• Corrigez les incohérences dans les colonnes Diplôme et Département (ex. "licence" →
"Licence", "rh" → "RH", "marketing" → "Marketing").
• Remplacez les valeurs "None" ou entre guillemets (ex. "2") par de vraies valeurs
numériques ou NaN.

Traitement des valeurs manquantes


• Pour Âge, remplacez les valeurs manquantes par la moyenne.
• Pour Expérience, remplacez les valeurs manquantes par la médiane.
• Pour Heures Formation, remplacez les valeurs manquantes par la médiane.

1
Filière : 4IIR Machine Learning

• Pour Score Performance, remplacez les valeurs manquantes par la moyenne.


• Pour Diplôme, remplacez les NaN par la modalité la plus fréquente.

Détection et traitement des valeurs aberrantes


• Corrigez les valeurs extrêmes :
o Heures Formation = 300 doit être corrigé (il s’agit probablement d’une erreur de
saisie, remplacez par la moyenne du groupe “Marketing”).
o Score Performance = -5 ou 130 sont aberrants : corrigez selon les bornes plausibles
(0–100).
• Vérifiez également si Âge et Expérience ont des valeurs logiques (ex. pas d’expérience
négative ou > âge).

Transformation des variables catégorielles


• Appliquez un One-Hot Encoding sur les variables :
o Diplôme (Licence, Master, Doctorat)
o Département (Finance, RH, IT, Marketing)

Normalisation et préparation du dataset


• Normalisez les colonnes :
o Âge, Expérience, Heures Formation, Salaire, Score Performance
o en utilisant la méthode Min-Max scaling :
o Supprimez la colonne ID et conservez Score Performance comme variable cible.

Vous aimerez peut-être aussi