0% ont trouvé ce document utile (0 vote)
19 vues22 pages

Préparation des données en Machine Learning

Le document présente un aperçu de la préparation des données pour l'apprentissage automatique, en se concentrant sur des exemples tels que Spotify pour la prédiction des préférences musicales. Il décrit les étapes de collecte, nettoyage, transformation et fractionnement des données, ainsi que les types de données et des applications pratiques. Des ensembles de données populaires et des techniques de nettoyage sont également abordés pour garantir la qualité des données utilisées dans les modèles d'apprentissage automatique.

Transféré par

Razane Salem
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
19 vues22 pages

Préparation des données en Machine Learning

Le document présente un aperçu de la préparation des données pour l'apprentissage automatique, en se concentrant sur des exemples tels que Spotify pour la prédiction des préférences musicales. Il décrit les étapes de collecte, nettoyage, transformation et fractionnement des données, ainsi que les types de données et des applications pratiques. Des ensembles de données populaires et des techniques de nettoyage sont également abordés pour garantir la qualité des données utilisées dans les modèles d'apprentissage automatique.

Transféré par

Razane Salem
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Machine Learning

Siwar BEN GAMRA

Direction Générale des Etudes Technologiques

Institut Supérieur des Etudes Technologiques de


Kélibia

Année universitaire
2023 - 2024

Siwar BEN GAMRA Machine Learning 1 / 22


Préparation des données
Problématique & Introduction

Spotify: Préparation minutieuse des données pour


l’apprentissage automatique
Prédire avec précision les préférences d’écoute des utilisateurs
Proposer des recommandations musicales hautement
personnalisées

Siwar BEN GAMRA Machine Learning 2 / 22


Préparation des données
Processus de préparation de données

1 Collecte de données
2 Nettoyage des données
3 Transformation des données
4 Fractionnement des données

Siwar BEN GAMRA Machine Learning 3 / 22


Préparation des données
Types de données

1 Données structurées
Organiser d’une manière spécifique, généralement sous forme
de tableau ou de feuille de calcul
Exemples
Informations à partir de bases de données ou de systèmes transactionnels

2 Données non structurées


Ne pas suivre les modèles de données conventionnels
Exemples
Images, Vidéos et les enregistrements audio
3 Données semi-structurées
Ne pas suivre un modèle de données tabulaire
Contenir des éléments structurels
Exemples
Données aux formats XML ou JSON
Siwar BEN GAMRA Machine Learning 4 / 22
Préparation des données
Stratégie de collecte de données

Collecte de données à partir de sources internes (entrepôt de


données)
Transactions de vente
Interactions avec les clients
Données provenant de plateformes de médias sociaux
etc.
Collecte de données à partir de sources externes
Des portails de données gouvernementaux
Des référentiels de données universitaires
Des communautés de partage de données, telles que Kaggle,
UCI Machine Learning Repository ou Google Dataset Search
etc.

Siwar BEN GAMRA Machine Learning 5 / 22


Préparation des données
Stratégie de collecte de données

Web scraping: extraire des données de sites Web à l’aide


d’outils automatisés
critiques de produits,
articles de presse,
médias sociaux.
Enquêtes: collecter des points de données spécifiques auprès
d’un public cible spécifique.
informations sur les préférences,
information sur le comportement des utilisateurs.

Siwar BEN GAMRA Machine Learning 6 / 22


Préparation des données
Applications d’apprentissage automatique (1/4)

Application: Prédiction du comportement ou des performances


d’un joueur dans divers contextes
Utiliser la régression linéaire comme modèle prédictif
Objectif: Prédire le score d’un joueur en fonction de variables
telles que le temps de jeu, le niveau d’expérience, le nombre
de parties jouées, etc.
Données: temps de jeu, niveau d’expérience, nombre de
parties jouées et score.

Siwar BEN GAMRA Machine Learning 7 / 22


Préparation des données
Application d’apprentissage automatique (2/4)

Classifier des espèces d’iris


Supposons qu’un ou une botaniste en herbe souhaite
distinguer diverses espèces d’iris.
Les scientifiques ont collecté un certain nombre de mesures
associées à chaque iris: la longueur et la largeur des pétales,
ainsi que la longueur et la largeur des sépales (en centimètres).

Siwar BEN GAMRA Machine Learning 8 / 22


Préparation des données
Application d’apprentissage automatique (3/4)

Utiliser les données inclus dans le module datasets de


scikit-learn
Scikit-learn: Bibliothèque d’apprentissage automatique en
python.
Charger les données en appelant la fonction load iris

Siwar BEN GAMRA Machine Learning 9 / 22


Préparation des données
Application d’apprentissage automatique (4/4)

Aperçu de la description

La valeur de features names est une liste de chaı̂nes qui


fournit une description de chaque caractéristique

Siwar BEN GAMRA Machine Learning 10 / 22


Préparation des données
Exemples d’ensembles de données populaires (1/3)

ImageNet
Ensemble de données d’images annotées (14,197,122 images
dont 1,034,908 images sont annotées avec des BB, 1000
classes, etc.)
Le ImageNet Large Scale Visual Recognition Challenge
(ILSVRC) utilise cet ensemble de données depuis 2010 comme
référence pour la classification des images.

Siwar BEN GAMRA Machine Learning 11 / 22


Préparation des données
Exemples d’ensembles de données populaires (2/3)

CIFAR-10
Ensemble de données de l’Institut canadien de recherches
avancées (CIFAR-10) est une collection d’images
Faible résolution des images: tester rapidement des algorithmes
60,000 images couleurs, 10 classes (avions, camions, navires,
chevaux, etc.)

Siwar BEN GAMRA Machine Learning 12 / 22


Préparation des données
Exemples d’ensembles de données populaires (3/3)

Jeopardy (traitement ou analyse de texte)


200 000 questions de l’émission de télévision (Par exemple, si
la réponse est ”La capitale de la France,” la question correcte
serait ”Qu’est-ce que Paris ?”)
Désignations de catégorie et de valeur, champs de question et
de réponse ainsi que les tours
LJ Speech Dataset (traitement automatique de la parole)
Enregistrements audio de textes enregistrés par un locuteur
natif de l’anglais
Ces enregistrements sont souvent utilisés pour entraı̂ner des
modèles de synthèse vocale basés sur l’apprentissage
automatique
Chaque enregistrement audio est associé à son texte
correspondant
Disponible en libre accès pour la recherche académique et le
développement de logiciels

Siwar BEN GAMRA Machine Learning 13 / 22


Préparation des données I
Nettoyage de données

Problème des valeurs omises


Des échantillons (enregistrements) avec des caractéristiques
(attributs) sans valeurs.

Causes
Mauvais fonctionnement de l’équipement
Incohérences avec d’autres données et donc supprimées
Non saisies car non (ou mal) comprises
Considérées peu importantes au moment de la saisie
Solutions
Suppression
Saisie manuelle
Remplacement par une constante globale. Par exemple,
“inconnu” pour les valeurs nominales ou “0” pour les valeurs
numériques.
Siwar BEN GAMRA Machine Learning 14 / 22
Préparation des données II
Nettoyage de données

Remplacement par la moyenne dans le cas des valeurs


numériques, en préférence de la même classe.
Remplacement par la valeur la plus fréquente dans le cas des
valeurs nominales.
Remplacement par la valeur la plus probable.

Siwar BEN GAMRA Machine Learning 15 / 22


Préparation des données
Nettoyage de données

Problème des Échantillons dupliqués


Des échantillons (enregistrements) ...

Supprimer les échantillons dupliqués

Bruit dans les données


Bruit= erreur ou variance aléatoire d’une variable mesurée
Causes
Instrument de mesure défectueux
Problème de saisie
Problème de transmission
Solutions
Binning ou Bucketing (groupement des données par classe).
Clustering pour détecter les exceptions
Lisser les données
Siwar BEN GAMRA Machine Learning 16 / 22
Préparation des données
Transformation des données

Discrétisation
La discrétisation est le fait de convertir les caractéristiques
numériques en caractéristiques nominales.
Elle est utilisée pour simplifier l’exploitation des données dans
certains types d’algorithmes.

Exemple
Trouver une fonction entre la latitude et le prix d’une maison

Siwar BEN GAMRA Machine Learning 17 / 22


Préparation des données
Transformation des données

Diviser la plage de latitude sur 11 parties (si on veut plus de


précision, on peut augmenter le nombre des parties)
Les valeurs vont être représentées par une étiquette entre 1 et 11.
Par exemple, latitude 37.4 => 6

Manipuler des valeurs numériques: représenter chaque valeur


comme un vecteur de 11 booléens (0 ou 1).
Par exemple: latitude 37.4 => [0, 0, 0, 0, 0, 1, 0, 0, 0, 0, 0]
Siwar BEN GAMRA Machine Learning 18 / 22
Préparation des données
Transformation des données

Normalisation par Mise à l’échelle min-max


La mise en échelle min-max transforme chaque valeur
numérique x vers une autre valeur x ′ ∈ [0, 1] en utilisant la
valeur minimale et la valeur maximale dans les données.
Cette normalisation conserve la distance proportionnelle entre
les valeurs d’une caractéristique.

Siwar BEN GAMRA Machine Learning 19 / 22


Préparation des données
Transformation des données

Binarisation
Vérifier si la fréquence d’une caractéristique a dépassé un
certain seuil a ou non.
Pas besoin de fréquences (nombre d’occurrences) d’une
caractéristique pour créer un modèle
Besoin de Savoir si cette caractéristique a apparue une fois au
moins pour un échantillon.

Siwar BEN GAMRA Machine Learning 20 / 22


Préparation des données
Fractionnement des données

Apprentissage supervisé
Il ne faut pas entraı̂ner et tester votre modèle sur les mêmes
données
Le système doit être tester sur des données qu’il n’a pas
encore rencontré (généraliser!)

Fractionnement
Diviser l’ensemble de données sur deux sous-ensembles:
Données d’entraı̂nement avec une majorité des échantillons
(70-80%)
Données de test avec une minorité des échantillons (30-20%)

Siwar BEN GAMRA Machine Learning 21 / 22


Préparation des données
Fractionnement des données

Conditions
Les données de test sont suffisantes pour avoir des résultats
significatifs
Les données de test sont représentatives. Il ne faut pas
prendre un ensemble avec des caractéristiques différentes de
celles des données d’entraı̂nement.

Siwar BEN GAMRA Machine Learning 22 / 22

Vous aimerez peut-être aussi