0% ont trouvé ce document utile (0 vote)
48 vues47 pages

Prétraitement des données en IA

Transféré par

sidikiensias
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
48 vues47 pages

Prétraitement des données en IA

Transféré par

sidikiensias
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Pré-traitement des données

Pr. Mohamed LAZAAR


[Link]@[Link]

Ingenierie Intelligence Artificielle (2IA)


ENSIAS - Université Mohammed V - Rabat

2024/2025

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 1 / 47


Plan

1 Organisation

2 Introduction

3 Visualisation des données

4 Nettoyage des données

5 Sélection de caractéristiques

6 Réduction de la dimensionnalité

7 Données déséquilibrées

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 2 / 47


Plan

1 Organisation

2 Introduction

3 Visualisation des données

4 Nettoyage des données

5 Sélection de caractéristiques

6 Réduction de la dimensionnalité

7 Données déséquilibrées

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 3 / 47


Organisation

Prérequis:
• Notions de statistique
• Analyse de données
• Programmation Python

Mode d’Evaluation:
• Examen (40%)
• TPs & Projet (60%);

Calendrier:
• Chaque Vendredi
• 2h CM & 2h TPs

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 4 / 47


Projets

Objectif du projet est de réaliser un système d’aide à la décision


permettant de mettre en pratique les concepts du cours dans un domaine
de l’Intelligence Artificielle :
• Le projet se divisera en 4 parties:
1 Identifier les besoins et Définir le cahier des charges;
2 Mettre en oeuvre les étapes de prétraitement des données;
3 Trouver un modèle de machine Learning qui présente une meilleure
généralisation;
4 Rédiger un rapport et Communiquer oralement le Projet.
• Nombre d’étudiants par projet est 4.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 5 / 47


Objectifs du cours

Ce cours vous permet d’apprendre les techniques de prétraitement des


données
• L’importance de la préparation des données pour les projets
d’apprentissage automatique.
• La préparation des données de manière à éviter les fuites de données.
• L’identification et la gestion des problèmes liés aux données
désordonnées, telles que les valeurs aberrantes et les valeurs
manquantes.
• L’identification et la suppression des variables d’entrée non
pertinentes et redondantes.
• La transformation des variables d’entrée.
• La projection des variables dans un espace de dimension inférieure.
• L’équilibrage des données est essentiel pour obtenir des performances
optimales..

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 6 / 47


Plan

1 Organisation

2 Introduction

3 Visualisation des données

4 Nettoyage des données

5 Sélection de caractéristiques

6 Réduction de la dimensionnalité

7 Données déséquilibrées

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 7 / 47


Course Outline

1 Organisation

2 Introduction

3 Visualisation des données

4 Nettoyage des données

5 Sélection de caractéristiques

6 Réduction de la dimensionnalité

7 Données déséquilibrées

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 8 / 47


Généralités

• Le prétraitement des données peut être la partie la plus importante


d’un projet d’apprentissage automatique.
• C’est la partie qui prend le plus de temps, même si elle semble être le
sujet le moins discuté.
• Le prétraitement des données, parfois appelée préparation des
données, consiste à transformer des données brutes en une forme
appropriée pour la modélisation.
• Il est essentiel de mettre les données en contexte pour pouvoir les
convertir en connaissances exploitables et éliminer les biais résultant
d’une mauvaise qualité des données.
• L’objectif de cette étape cruciale est de transformer des données:
• pour l’analyse statistique,
• pour le reporting business
• ou pour l’entrainement de modèles d’apprentissage automatique.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 9 / 47


Généralités

• Les algorithmes d’apprentissage automatique nécessitent que les


données d’entrée soient des nombres, et la plupart des
implémentations d’algorithmes maintiennent cette attente.
• Si les données contiennent des types de données et des valeurs qui ne
sont pas des nombres, comme des étiquettes, vous devrez changer les
données en nombres.
• De plus, des algorithmes d’apprentissage automatique spécifiques ont
des attentes concernant les types de données, l’échelle, la distribution
de probabilité et les relations entre les variables d’entrée, et vous
devrez peut-être modifier les données pour répondre à ces attentes.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 10 / 47


Généralités

• La plus part des data scientists reconnaissent que la préparation des


données est la partie la plus fastidieuse de leur travail.
• Les décisions efficaces et précises ne peuvent être prises qu’avec des
données ”propres”.
• La préparation des données permet d’obtenir les résultats suivants :
• Corriger les erreurs rapidement : Une préparation des données efficace
facilite la détection des erreurs avant le traitement des données.
• Obtenir des données de grande qualité : Le nettoyage et reformatage
des datasets garantissent que toutes les données utilisées dans les
analyses seront de grande qualité.
• Prendre des décisions plus avisées : Lorsque les données sont de
meilleure qualité et qu’elles peuvent être traitées et analysées plus
rapidement et plus efficacement, les décisions internes sont également
plus rapides, plus efficaces et de meilleure qualité.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 11 / 47


Diversité des données
• SI transactionnels et la BI d’une entreprise
• Bases de données de production
• Entrepôt de données (datawerhouses) CRM
• Transaction d’achats et de ventes
• Processus de gestion (ERP)
• Entrepôts de données comportementales
• Logs
• Objets connectés
• Réseaux sociaux
• Données géographiques
• Points d’intérêt
• Données socio-économiques
• Données météorologiques
• Open data
• Bases de données commerciales (data market)
• ...
Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 12 / 47
Diversité des formats

• Fichiers classiques
• Fichiers textuels standards
• Fichiers au format objet (JSON, XML,. . . )
• Shapefile (SIG)
• Fichiers Multimédia
• Bases de données relationnelles
• Bases NoSQL
• ...

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 13 / 47


Introduction
Diversité de la qualité

• Exhaustivité
• Complétude de la liste d’enregistrements.
• Complétude du renseignement des champs de chacun des
enregistrements.
• Granularité
• Degrés de finesse des données; qu’elles soient spatiales, temporelles ou
sociales.
• Exactitude
• Fiable
• Exacte
• Redondante
• Fraicheur
• Dernière MAJ

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 14 / 47


Exploration des données

• Première phase dans l’analyse de données.


• Nécessite des indicateurs statistiques (moyenne, médiane, variance,...).
• Nécessite aussi un système visuel humain.
• Enquête sur les données
• Saisies à la main ou automatique
• Enregistrement effectués sur plusieurs étapes
• Référentiels utilisés
• Unités de mesures
• =⇒ Les données devrait faire l’objet d’une documentation complète
qui spécifie leur provenance, les formats, ect...
• Utilise les statistiques descriptive
• Tableaux croisés dynamiques

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 15 / 47


Filtrer les données(1)

• Cette étape consiste à éliminer toutes les informations que l’on ne


souhaite pas conserver telles quelles.
• Ces informations peuvent être erronées, inexactes, induire des erreurs
ou simplement être sans intérêt pour la suite de l’analyse ou la
modélisation.
• Le filtrage des données va consister à identifier toutes les valeurs que
l’on souhaite retirer ou corriger:
• Pour chaque champ on détecte les types ou la syntaxe attendus
(numéro postal, tel, email, IP, URL,. . . ) et on identifie les valeurs qui
ne s’y conforment pas.
• On recherche les valeurs numériques aberrantes.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 16 / 47


Filtrer les données (2)

• Une fois ces valeurs détectées, différentes actions sont envisageables:


• Supprimer la valeur en question et la laisser sans valeur (null).
• Supprimer la ligne entière incriminée.
• Créer une autre variable binaire supplémentaire (flag) qui indique si la
valeur est conforme à ce que l’on attendait.
• Remplacer la valeur par la moyenne, la médiane ou la valeur la plus
courante.
• Remplacer la valeur par la valeur précédente ou pour autant que les
données soient ordonnées.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 17 / 47


Transformer les données(1)

• La phase de préparation des données peut également consister à


manipuler, modifier voire créer des nouvelles informations à partir des
information disponibles.
• Séparation et extraction
• La troncature de variable consiste à ne retenir que certaines parties
d’une chaine de caractères.
• La séparation en éléments consiste procéder à une analyse syntaxique
pour transformer une chaine de caractères une liste de chaines plus
courtes dont chacun représente la valeur d’une variable.
• Extraire un élément particulier d’une chaine comme un nombre, une
adresse e-mail.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 18 / 47


Transformer les données(2)
• Agrégation :cette étape consiste à regrouper ou assembler plusieurs
valeurs en une seule.
• Juxtaposition, avec ou sans séparateur, chainage avec compteur pour
compter le nombre d’apparitions de certaines éléments.
• Calculs de moyenne, de somme, de médiane, de maximum, de
minimum, de quantité à partir d’une série numérique.
• Identification de l’élément le plus fréquent ou le moins fréquent d’une
liste.
• Transformation
• Toutes les transformations sur les dates: changement de fuseau horaire,
extraction d’une heure, du jour de semaine du mois ou d la différence
entre deux date.
• Toutes les opérations qui consistent à réorganiser les données ou à les
agréger par catégories pertinentes.
• Copie de valeurs sur plusieurs lignes ou colonnes, ainsi pour les valeurs
manquantes, on pourra recopier par exemple la dernière valeur
disponible.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 19 / 47


Enrichir les données (1)

• Croisement les données existantes avec des nouvelles informations,


parfois extérieures à l’entreprise.
• Géographique
• Le géocodage consiste à affecter des coordonnées géographiques à une
adresse. La qualité des données ainsi enrichies dépendra à la fois de la
précision et du taux de réussite.
• Le géocodage inversé, c’est l’opération inverse, c.à.d. l’attribution
d’une adresse à un couple de coordonnées géographiques.
• La résolution d’adresse IP consiste à convertir l’adresse IP d’un
internaute en coordonnées géographiques, même si cela reste
approximatif.
• Temporels
• Déterminer si une date se trouve dans une période de vacances scolaire.
• Déterminer si une date correspond à un jour férié dans un pays donnée.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 20 / 47


Enrichir les données (2)

• Socio-économique
• Associer des indicateurs sur la population à une zone géographique.
• Associer des informations juridiques et financières au nom d’une
entreprise
• Jointure sur chaines de caractères
• Jointure exacte et jointure approximative.
• Géographiques
• Rapprocher deux éléments géographiques proches.
• Temporelles
• Associer deux éléments proche dans le temps dans le sens où ils ont eu
lui le même mois/jour ou la même heure.
• Multiples
• Effectuer une jointure sur plusieurs champs simultanément.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 21 / 47


Processus de Machine Learning

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 22 / 47


Préparation des données

Pour un projet de modélisation prédictive, tel qu’une classification ou une


régression, les données brutes ne peuvent généralement pas être utilisées
directement. Cela est dû à des raisons telles que :
• Les algorithmes d’apprentissage automatique nécessitent que les
données soient des nombres.
• Certains algorithmes d’apprentissage automatique imposent des
exigences sur les données.
• Le bruit statistique et les erreurs dans les données peuvent devoir être
corrigés.
• Des relations non linéaires complexes peuvent être extraites des
données.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 23 / 47


Préparation des données

Pour un projet de modélisation prédictive, tel qu’une classification ou une


régression, les données brutes ne peuvent généralement pas être utilisées
directement. Cela est dû à des raisons telles que :
• Les algorithmes d’apprentissage automatique nécessitent que les
données soient des nombres.
• Certains algorithmes d’apprentissage automatique imposent des
exigences sur les données.
• Le bruit statistique et les erreurs dans les données peuvent devoir être
corrigés.
• Des relations non linéaires complexes peuvent être extraites des
données.
⇒ La préparation des données est définie comme la transformation des
données brutes en une forme plus adaptée à la modélisation.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 24 / 47


Préparation des données
Les principales tâches peuvent être utiliser ou explorer lors de l’étape de
préparation des données sont:
• Visualisation des données: l’exploration visuelle et interactive de
données de toutes volumétries, natures (structurées ou non
structurées).
• Nettoyage des données : identifier et corriger les erreurs ou les
erreurs dans les données.
• Sélection des caractéristiques : identification des variables d’entrée
les plus pertinentes pour la tâche.
• Transformations de données : modification de l’échelle ou de la
distribution des variables.
• Ingénierie des caractéristques : dérivation de nouvelles variables à
partir des données disponibles.
• Réduction de la dimensionnalité : création de projections
compactes des données.
Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 25 / 47
Techniques de préparation des données

L’étape avant la préparation des données consiste à définir le problème.


Dans le cadre de la définition du problème, cela peut impliquer de
nombreuses sous-tâches, telles que :
• Collectez les données du domaine.
• Discutez le projet avec des experts.
• Sélectionnez les variables à utiliser comme entrées et sorties pour un
modèle prédictif.
• Passez en revue les données qui ont été collectées.
• Résumez les données collectées à l’aide de méthodes statistiques.
• Visualisez les données collectées graphiquement.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 26 / 47


Techniques de préparation des données
Les informations connues sur les données peuvent être utilisées pour
sélectionner et configurer les méthodes de préparation des données.
Par exemple,
• les graphiques des données peuvent aider à identifier si une variable a
des valeurs aberrantes.
• Cela peut aider dans les opérations de nettoyage des données.
• Il peut également fournir un aperçu de la distribution de probabilité
qui est à la base de les données.
• Cela peut aider à déterminer si des transformations de données qui
modifient la distribution de probabilité d’une variable seraient
appropriées.
• Les méthodes statistiques, telles que les statistiques descriptives,
peuvent être utilisées pour déterminer si des opérations de mise à
l’échelle peuvent être nécessaires.
• Les tests d’hypothèses statistiques peuvent être utilisés pour
déterminer si une variable correspond à une distribution de probabilité
donnée
Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 27 / 47
Techniques de préparation des données

Les informations connues sur les données peuvent être utilisées pour
sélectionner et configurer les méthodes de préparation des données.
Par exemple,
• Sélectionnez une métrique de performance pour évaluer la
compétence prédictive du modèle.
• Sélectionnez une procédure d’évaluation de modèle.
• Sélectionnez les algorithmes à évaluer.
• Ajustez les hyperparamètres de l’algorithme.
• Combinez des modèles prédictifs en ensembles.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 28 / 47


Techniques de préparation des données

• La modélisation prédictive implique l’apprentissage à partir de


données.
• Les données font référence à des exemples ou des cas du domaine qui
caractérisent le problème que vous souhaitez résoudre.
• Dans l’apprentissage supervisé, les données sont composées
d’exemples où chaque exemple a un élément d’entrée qui sera fourni à
un modèle et un élément de sortie ou cible que le modèle est censé
prédire.
• La classification est un exemple de problème d’apprentissage supervisé
où la cible est une étiquette, et la régression est un exemple de
problème d’apprentissage supervisé où la cible est un nombre.
• Les données d’entrée peuvent avoir plusieurs formes, telles qu’une
image, une série chronologique, du texte, une vidéo, etc.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 29 / 47


Techniques de préparation des données
• Ligne: Un seul exemple du domaine, souvent appelé instance,
exemple ou échantillon en apprentissage automatique.
• Colonne: Une propriété unique enregistrée pour chaque exemple,
souvent appelée variable ou caractéristiques dans l’apprentissage
automatique.
• Variables d’entrée : colonnes de l’ensemble de données fournies à
un modèle afin de faire une prédiction.
• Variable de sortie : colonne de l’ensemble de données à prédire par
un modèle.
• Les colonnes utilisées pour l’entrée du modèle sont appelées variables
d’entrée et la colonne qui contient la cible à prédire est appelée
variable de sortie.
• Les lignes utilisées pour entraı̂ner un modèle sont appelées jeu de
données d’apprentissage et les lignes utilisées pour évaluer le modèle
sont appelées jeu de données de test.
Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 30 / 47
Nettoyage des données

• Le nettoyage des données implique la résolution de problèmes ou


d’erreurs systématiques dans les données désordonnées.
• Le nettoyage des données le plus utile implique une expertise
approfondie du domaine et pourrait impliquer l’identification et le
traitement d’observations spécifiques qui peuvent être incorrectes.
• Il existe de nombreuses raisons pour lesquelles les données peuvent
avoir des valeurs incorrectes, telles qu’une erreur de frappe, une
corruption, une duplication, etc.
• L’expertise du domaine peut permettre d’identifier des observations
manifestement erronées car différentes de ce qui est attendu, comme
la superficie d’un appartement de 20 millimètres.
• Une fois que des observations désordonnées, bruyantes, corrompues
ou erronées sont identifiées, elles peuvent être traitées.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 31 / 47


Nettoyage des données

Il existe des opérations générales de nettoyage des données qui peuvent


être effectuées, telles que :
• Utiliser des statistiques pour définir des données normales et identifier
les valeurs aberrantes
• Identifier les colonnes qui ont la même valeur ou aucune variance et
les supprimer.
• Identifier les lignes de données en double et les supprimer.
• Marquage des valeurs vides comme manquantes.
• Imputation des valeurs manquantes à l’aide de statistiques ou d’un
modèle appris

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 32 / 47


Nettoyage des données

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 33 / 47


Sélection de caractéristiques

• La sélection de caractéristiques fait référence aux techniques de


sélection d’un sous-ensemble de caractéristiques d’entrée les plus
pertinentes pour la variable cible qui est prédite.
• Ceci est important car des variables d’entrée non pertinentes et
redondantes peuvent distraire ou induire en erreur les algorithmes
d’apprentissage, entraı̂nant éventuellement une baisse des
performances prédictives.
• De plus, il est souhaitable de développer des modèles en utilisant
uniquement les données nécessaires pour faire une prédiction, par ex.
privilégier le modèle le plus simple possible et le plus performant.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 34 / 47


Sélection de caractéristiques

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 35 / 47


Transformations de données

• Les transformations de données sont utilisées pour modifier le type ou


la distribution des variables de données.
• Les transformations peuvent appliquées aux variables d’entrée et de
sortie.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 36 / 47


Transformations de données

• Discrétisation : encoder une variable numérique en tant que variable


ordinale
• Ordinale : encoder une variable catégorielle en une variable entière
• binaire : encoder une variable catégorielle en variables binaires
• Normalisation : mettre une variable à l’échelle dans la plage 0 et 1
• Standardisation : mettez une variable à l’échelle en une gaussienne
standard
• Puissance : modifiez la distribution d’une variable pour qu’elle soit
plus gaussienne
• Quantile : imposer une distribution de probabilité telle qu’uniforme ou
gaussienne

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 37 / 47


Transformations de données

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 38 / 47


Ingénierie des caractéristiques

• L’ingénierie des caractéristiques fait référence au processus de création


de nouvelles variables d’entrée à partir des données disponibles.
• L’ingénierie de nouvelles caractéristiques est très spécifique à des
données et types de données.
• Il nécessite souvent la collaboration d’un expert du domaine pour
aider à identifier de nouvelles fonctionnalités qui pourraient être
construit à partir des données.
• Il existe plusieurs techniques:
1 Ajout d’une variable d’indicateur booléen pour certains états.
2 Ajout d’un groupe ou d’une statistique récapitulative globale, telle
qu’une moyenne.
3 Ajout de nouvelles variables pour chaque composant d’une variable
composée, comme une date-heure.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 39 / 47


Ingénierie des caractéristiques

• L’ingénierie des caractéristiques fait référence au processus de création


de nouvelles variables d’entrée à partir des données disponibles.
• L’ingénierie de nouvelles caractéristiques est très spécifique à des
données et types de données.
• Il nécessite souvent la collaboration d’un expert du domaine pour
aider à identifier de nouvelles fonctionnalités qui pourraient être
construit à partir des données.
• Il existe plusieurs techniques:
1 Ajout d’une variable d’indicateur booléen pour certains états.
2 Ajout d’un groupe ou d’une statistique récapitulative globale, telle
qu’une moyenne.
3 Ajout de nouvelles variables pour chaque composant d’une variable
composée, comme une date-heure.

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 40 / 47


Ingénierie des caractéristiques

• Le nombre d’entités en entrée pour un jeu de données peut être


considéré comme la dimensionnalité des données.
• La sélection des fonctionnalités consiste à créer une projection des
données dans un espace de dimension inférieure qui préserve toujours
les propriétés les plus importantes des données d’origine.
• Contrairement à la sélection de caractéristiques, les variables dans les
données projetées ne sont pas directement liées aux variables d’entrée
d’origine, ce qui rend la projection difficile à interpréter.
• Plusieurs approhes de réduction de la dimensionnalité:
1 Analyse des composants principaux.
2 Décomposition en valeur singulière.
3 Analyse discriminante linéaire
4 Self-Organizing Maps (SOM)

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 41 / 47


Ingénierie des caractéristiques

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 42 / 47


Plan

1 Organisation

2 Introduction

3 Visualisation des données

4 Nettoyage des données

5 Sélection de caractéristiques

6 Réduction de la dimensionnalité

7 Données déséquilibrées

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 43 / 47


Plan

1 Organisation

2 Introduction

3 Visualisation des données

4 Nettoyage des données

5 Sélection de caractéristiques

6 Réduction de la dimensionnalité

7 Données déséquilibrées

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 44 / 47


Plan

1 Organisation

2 Introduction

3 Visualisation des données

4 Nettoyage des données

5 Sélection de caractéristiques

6 Réduction de la dimensionnalité

7 Données déséquilibrées

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 45 / 47


Plan

1 Organisation

2 Introduction

3 Visualisation des données

4 Nettoyage des données

5 Sélection de caractéristiques

6 Réduction de la dimensionnalité

7 Données déséquilibrées

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 46 / 47


Plan

1 Organisation

2 Introduction

3 Visualisation des données

4 Nettoyage des données

5 Sélection de caractéristiques

6 Réduction de la dimensionnalité

7 Données déséquilibrées

Pr. M. LAZAAR (ENSIAS) Pré-traitement des données Cours M.3.6.2 47 / 47

Vous aimerez peut-être aussi