Prétraitement des données
Le prétraitement des données est une étape essentielle en Machine Learning, car les
données brutes sont souvent incomplètes, incohérentes ou mal structurées. L’objectif est de
les nettoyer et de les transformer pour garantir de bonnes performances des modèles.
1. Importance du prétraitement
Les données proviennent de sources variées (texte, audio, vidéo, capteurs…) et ne sont pas
directement exploitables. Le prétraitement permet de :
● Corriger les erreurs
● Gérer les valeurs manquantes
● Traiter les valeurs aberrantes
● Transformer les données pour les rendre compatibles avec les algorithmes
Cette phase est souvent la plus longue d’un projet.
2. Notions de base
Les variables se divisent en :
● Qualitatives :
○ Nominales (pas d’ordre : sexe, couleur…)
○ Ordinales (ordre : niveaux d’étude, satisfaction…)
● Quantitatives :
○ Discrètes (valeurs entières : nombre d’appels…)
○ Continues (mesures : poids, temps…)
3. Techniques de prétraitement des données
Technique Sous-catégorie Description Méthodes / Détails
1. Data Gestion des Traiter les données • Suppression des lignes
Cleaning valeurs absentes pour éviter les
• Suppression des colonnes (si >30% manquantes)
manquantes biais et erreurs
• Imputation : moyenne, médiane, mode, KNN,
d’analyse. méthodes ML
Suppression des Éliminer les • Détection + suppression automatique
doublons enregistrements
répétés.
Gestion des Identifier les valeurs très • Détection par IQR (Q1–Q3)
valeurs éloignées du reste des
• Suppression
aberrantes données.
• Imputation
(outliers)
• Transformation logarithmique (si valeur légitime)
2. Data Normalisation Ramener les valeurs à • Formule Min–Max : (x − min) / (max − min)
Transformation une même échelle entre
0 et 1.
Standardisation Centrer les données • Formule Z-score : (x − μ) / σ
autour de 0 avec un
écart-type de 1.
Encodage des Rendre les catégories • One-Hot Encoding (pour nominales)
variables exploitables par les
• Label Encoding (pour ordinales)
qualitatives algorithmes.