Université Alioune Diop de Bambey
Traitement et Analyse
de Données
õ PREPROCESSING Ô
ª Tacko CISS
{ 2025-2026
Master 1 Systèmes d’Information
Sommaire
1 Introduction au Preprocessing
2 Comprendre les Données
3 Exploration des Données
4 Données Aberrantes (Outliers)
5 Encodage des Variables
6 Résumé
ª Tacko CISS – M1 SI Preprocessing 2 / 24
Qu’est-ce que le Preprocessing ?
Définition
Le preprocessing (prétraitement) est l’ensemble des techniques appliquées aux données brutes
pour les rendre exploitables par les algorithmes de Machine Learning.
. Problèmes courants : ¥ Solutions :
Données incomplètes Nettoyage
Formats incohérents Transformation
Valeurs aberrantes Encodage
Variables non numériques Normalisation
ª Tacko CISS – M1 SI Preprocessing 3 / 24
Pourquoi le Preprocessing est crucial ?
Garbage In q Garbage Out
Æ Modèle ML
Données de mauvaise qualité Prédictions erronées
Statistique importante
60-80% du temps d’un projet Data Science est consacré au preprocessing !
ª Tacko CISS – M1 SI Preprocessing 4 / 24
Pipeline de Machine Learning
õ
o ¢ Ç
Données
Preprocessing Entraînement Évaluation Déploiement
Brutes
60-80% du temps
ª Tacko CISS – M1 SI Preprocessing 5 / 24
De l’Information à la Donnée
Structuration õ Analyse ¡
Information Donnée Indicateur
Information Donnée Indicateur
Fait brut non structuré Fait structuré Donnée contextualisée
"Il fait chaud" Temp = 35°C +5°C vs moyenne
ª Tacko CISS – M1 SI Preprocessing 6 / 24
Types de Variables
Variables
Qualitatives Quantitatives
Nominales Ordinales Discrètes Continues
Couleur, Pays Taille S/M/L Âge, Nb enfants Poids, Taille
ª Tacko CISS – M1 SI Preprocessing 7 / 24
Structures de Données en Python
Scalaire
O DataFrame
Une seule valeur : 42
Tableau avec noms de colonnes
(Pandas en Python)
Vecteur (1D)
Liste de valeurs : [1, 2, 3, 4]
ò Tenseur (nD)
b Matrice (2D) Structure multidimensionnelle
(Images, Vidéos)
Tableau lignes × colonnes
ª Tacko CISS – M1 SI Preprocessing 8 / 24
Première Exploration avec Pandas
Fonctions essentielles
[Link]() Afficher les premières lignes
[Link]() Types et valeurs non-nulles
[Link]() Statistiques descriptives
[Link] Dimensions (lignes, colonnes)
[Link]().sum() Compter les valeurs manquantes
Exemple
print(f"Lignes: {[Link][0]}, Colonnes: {[Link][1]}")
ª Tacko CISS – M1 SI Preprocessing 9 / 24
Valeurs Manquantes
Traitements possibles
Types de manquants
Suppression des lignes
MCAR : Aléatoire complet
Imputation (moyenne, médiane)
MAR : Aléatoire conditionnel
Imputation par modèle
MNAR : Non aléatoire
Valeur spéciale (-1, "Unknown")
Attention
Toujours analyser le pattern des valeurs manquantes avant de décider !
ª Tacko CISS – M1 SI Preprocessing 10 / 24
Qu’est-ce qu’un Outlier ?
Définition
Une donnée aberrante est une observation qui s’écarte significativement des autres
observations du jeu de données.
q Erreurs . Naturelles v Intéressantes
Erreur de saisie Événement rare Fraude
Bug technique Cas exceptionnel Anomalie
À corriger À conserver À étudier
ª Tacko CISS – M1 SI Preprocessing 11 / 24
Exemple : Erreur de Saisie
Employé Salaire (€) Statut
Alice 2 500 Normal
Bob 3 200 Normal
Charlie 320 000 - Outlier !
David 2 800 Normal
Analyse
Charlie gagne 320 000€ au lieu de 3 200€
$ Erreur de saisie (un zéro en trop)
$ Action : Corriger la valeur
ª Tacko CISS – M1 SI Preprocessing 12 / 24
Méthode 1 : Règle de l’IQR
Formule
Une valeur est aberrante si elle est en dehors de :
[Q1 − 1.5 × IQR ; Q3 + 1.5 × IQR]
où IQR = Q3 − Q1 (écart interquartile)
Exemple numérique
Q1 = 13, Q3 = 21
IQR = 21 − 13 = 8
Bornes : [1; 33]
Outlier Q1 Q3
Valeur 85 → Outlier !
ª Tacko CISS – M1 SI Preprocessing 13 / 24
Méthode 2 : Z-Score
Formule
x −µ
Z=
σ
Si |Z | > 3 alors c’est un Outlier
Interprétation
Le Z-score mesure combien d’écarts-types séparent une valeur de la moyenne.
|Z | < 1 : Valeur proche de la moyenne
1 < |Z | < 2 : Valeur modérément éloignée
2 < |Z | < 3 : Valeur éloignée
|Z | > 3 : Outlier probable
ª Tacko CISS – M1 SI Preprocessing 14 / 24
Traitement des Outliers
Stratégie Quand ? Méthode
Suppression Erreurs évidentes Filtrer le DataFrame
Winsorisation Limiter l’impact Capper aux bornes
Log transform Asymétrie forte Transformation log
Imputation Remplacer Médiane ou moyenne
Règle d’or
. Ne jamais supprimer automatiquement tous les outliers !
Toujours analyser et comprendre avant de décider.
ª Tacko CISS – M1 SI Preprocessing 15 / 24
Pourquoi Encoder ?
Problème
Les algorithmes de Machine Learning ne comprennent que les nombres !
✗ ✓
"Rouge", "Vert" Æ ML 0, 1, 2...
Solution
Transformer les variables catégorielles en valeurs numériques via l’encodage.
ª Tacko CISS – M1 SI Preprocessing 16 / 24
Label Encoding
Principe
Attribuer un entier unique à chaque catégorie.
Original Encodé
Bac 0
Licence 1 Code Python
Master 2 from [Link] import
Doctorat 3 LabelEncoder
le = LabelEncoder()
df[’col_enc’] =
✓Adapté pour le.fit_transform(df[’col’])
Variables ordinales
(avec ordre naturel)
ª Tacko CISS – M1 SI Preprocessing 17 / 24
Attention au Label Encoding !
Danger avec les variables nominales
Si on encode les couleurs : Rouge=0, Vert=1, Bleu=2
L’algorithme peut interpréter :
Bleu > Vert > Rouge ✗
Rouge + Vert = Bleu ✗
Ce qui n’a aucun sens !
$ Solution : Utiliser One-Hot Encoding pour les variables nominales
ª Tacko CISS – M1 SI Preprocessing 18 / 24
One-Hot Encoding
Principe
Créer une colonne binaire (0/1) pour chaque catégorie.
Avant : Après :
Couleur Rouge Bleu Vert
Rouge 1 0 0
Bleu 0 1 0
Vert 0 0 1
Rouge 1 0 0
Code Python
df_encoded = pd.get_dummies(df, columns=[’couleur’])
ª Tacko CISS – M1 SI Preprocessing 19 / 24
Comparaison des Méthodes d’Encodage
Critère Label Encoding One-Hot
Type de variable Ordinale Nominale
Nb de colonnes 1 n catégories
Ordre artificiel Oui ✗ Non ✓
Mémoire Faible ✓ Élevée ✗
Exemple Taille S/M/L Couleur, Pays
Règle simple
Variable avec ordre naturel ⇒ Label Encoding
Variable sans ordre ⇒ One-Hot Encoding
ª Tacko CISS – M1 SI Preprocessing 20 / 24
Les 5 Piliers du Preprocessing
® M
o Ð
Valeurs Trans- Enrichis-
Nettoyage Encodage
Manquantes formation sement
ª Tacko CISS – M1 SI Preprocessing 21 / 24
Points Clés à Retenir
1 Le preprocessing est crucial : 60-80% du temps d’un projet ML
2 Garbage in, garbage out : Qualité données = Qualité modèle
3 Types de variables : Qualitatives vs Quantitatives
4 Explorer avant d’agir : Toujours visualiser et décrire
5 Outliers : Analyser avant de supprimer (IQR, Z-score)
6 Encodage : Label (ordinal) vs One-Hot (nominal)
7 Documenter : Garder une trace des décisions
ª Tacko CISS – M1 SI Preprocessing 22 / 24
Checklist Preprocessing
Û Exploration : { Traitement :
✓ Structure des données ✓ Imputation des manquants
✓ Types de variables ✓ Gestion des outliers
✓ Valeurs manquantes ✓ Encodage des catégories
✓ Distributions ✓ Normalisation/Scaling
✓ Outliers ✓ Feature engineering
ª Tacko CISS – M1 SI Preprocessing 23 / 24
Merci pour votre attention !
® Questions ?
ª Tacko CISSMaster 1 Systèmes d’Information
Université Alioune Diop de Bambey – 2025-2026