0% ont trouvé ce document utile (0 vote)
6 vues2 pages

Prétraitement des données en Machine Learning

Le prétraitement des données est crucial en Machine Learning pour nettoyer et transformer des données brutes souvent incomplètes ou mal structurées. Il implique la correction des erreurs, la gestion des valeurs manquantes et aberrantes, ainsi que la transformation des données pour les rendre compatibles avec les algorithmes. Les techniques incluent le nettoyage des données, la normalisation, la standardisation et l'encodage des variables qualitatives.

Transféré par

Bhyry Loussayef
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
6 vues2 pages

Prétraitement des données en Machine Learning

Le prétraitement des données est crucial en Machine Learning pour nettoyer et transformer des données brutes souvent incomplètes ou mal structurées. Il implique la correction des erreurs, la gestion des valeurs manquantes et aberrantes, ainsi que la transformation des données pour les rendre compatibles avec les algorithmes. Les techniques incluent le nettoyage des données, la normalisation, la standardisation et l'encodage des variables qualitatives.

Transféré par

Bhyry Loussayef
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Prétraitement des données

Le prétraitement des données est une étape essentielle en Machine Learning, car les
données brutes sont souvent incomplètes, incohérentes ou mal structurées. L’objectif est de
les nettoyer et de les transformer pour garantir de bonnes performances des modèles.

1. Importance du prétraitement

Les données proviennent de sources variées (texte, audio, vidéo, capteurs…) et ne sont pas
directement exploitables. Le prétraitement permet de :

●​ Corriger les erreurs


●​ Gérer les valeurs manquantes
●​ Traiter les valeurs aberrantes
●​ Transformer les données pour les rendre compatibles avec les algorithmes

Cette phase est souvent la plus longue d’un projet.

2. Notions de base

Les variables se divisent en :

●​ Qualitatives :​

○​ Nominales (pas d’ordre : sexe, couleur…)


○​ Ordinales (ordre : niveaux d’étude, satisfaction…)​

●​ Quantitatives :​

○​ Discrètes (valeurs entières : nombre d’appels…)


○​ Continues (mesures : poids, temps…)

3. Techniques de prétraitement des données

Technique Sous-catégorie Description Méthodes / Détails

1. Data Gestion des Traiter les données • Suppression des lignes


Cleaning valeurs absentes pour éviter les
• Suppression des colonnes (si >30% manquantes)
manquantes biais et erreurs
• Imputation : moyenne, médiane, mode, KNN,
d’analyse. méthodes ML
Suppression des Éliminer les • Détection + suppression automatique
doublons enregistrements
répétés.

Gestion des Identifier les valeurs très • Détection par IQR (Q1–Q3)
valeurs éloignées du reste des
• Suppression
aberrantes données.
• Imputation
(outliers)
• Transformation logarithmique (si valeur légitime)

2. Data Normalisation Ramener les valeurs à • Formule Min–Max : (x − min) / (max − min)
Transformation une même échelle entre
0 et 1.

Standardisation Centrer les données • Formule Z-score : (x − μ) / σ


autour de 0 avec un
écart-type de 1.

Encodage des Rendre les catégories • One-Hot Encoding (pour nominales)


variables exploitables par les
• Label Encoding (pour ordinales)
qualitatives algorithmes.

Vous aimerez peut-être aussi