0% ont trouvé ce document utile (0 vote)
2 vues36 pages

Introduction

Le document présente une introduction au Data Mining, abordant des concepts clés tels que l'informatique opérationnelle et décisionnelle, ainsi que les étapes et techniques du Data Mining. Il décrit également les types de données, les transformations nécessaires et les applications dans divers domaines comme le marketing et la finance. Enfin, il mentionne les bibliothèques Python couramment utilisées pour la manipulation et l'analyse de données.

Transféré par

ilyas.elmazghi
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
2 vues36 pages

Introduction

Le document présente une introduction au Data Mining, abordant des concepts clés tels que l'informatique opérationnelle et décisionnelle, ainsi que les étapes et techniques du Data Mining. Il décrit également les types de données, les transformations nécessaires et les applications dans divers domaines comme le marketing et la finance. Enfin, il mentionne les bibliothèques Python couramment utilisées pour la manipulation et l'analyse de données.

Transféré par

ilyas.elmazghi
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Introduction au Data Mining

Pr. Nabila ZRIRA


zrira@[Link]

Année universitaire: 2025-2026


Evaluation
TP
20%

ASSUIDUITE EXAMEN
20% 60%

2
Plan

✓Introduction
✓K plus proche voisin
✓Regroupement
✓Régression
✓Réseaux de neurones artificiels

3
Informatique opérationnelle

Informatique opérationnelle (production) :

✓ Gère les processus métier et les opérations quotidiennes.

✓ Englobe les systèmes transactionnels, les ERP (Enterprise Resource Planning), les CRM (Customer
Relationship Management), et d'autres outils nécessaires au bon fonctionnement des activités
d’une entreprise.

✓ Se focalise sur la rapidité, l’efficacité et l’automatisation des tâches répétitives.

✓ Exemples : gestion des stocks, suivi des commandes, gestion de la paie, comptabilité.

4
Informatique décisionnelle

Informatique décisionnelle (stratégique) :

✓ Transforme les données en informations utiles pour la prise de décision.

✓ Utilise des outils comme les entrepôts de données (Data Warehouse), les tableaux de bord
analytiques, et les algorithmes de Data Mining.

✓ Aide les dirigeants et analystes à anticiper les tendances et optimiser les stratégies.

✓ Exemples : analyse des ventes, prévisions de la demande, reporting financier, extraction de


connaissances à partir des BD, visualisation des données multidimensionnelles.

5
Informatique décisionnelle vs opérationnelle

L’informatique opérationnelle gère l’exécution des activités en temps réel, tandis que l’informatique
décisionnelle analyse et synthétise les données pour aider à la prise de décisions stratégiques.

Exemple : Un site e-commerce utilise l’informatique opérationnelle pour traiter les commandes et
gérer les livraisons, tandis que l’informatique décisionnelle analyse les ventes pour recommander
des promotions et anticiper la demande.

6
Data Warehouse

Un Data Warehouse (entrepôt de données) est un système de stockage et de gestion des données
conçu pour faciliter l’analyse et la prise de décision. Il centralise, nettoie et structure des données
provenant de différentes sources afin de permettre des analyses efficaces et rapides.

7
Data Warehouse
Avantages d’un Data Warehouse :

✓ Améliore la prise de décision grâce à des analyses précises.

✓ Permet une vue unifiée et cohérente des données de l’entreprise.

✓ Optimise les performances des requêtes analytiques.

✓ Favorise l’historisation et l’analyse des tendances.

8
Statistique

✓ Statistique est une discipline scientifique ayant pour objectif de rassembler et d’étudier des données
chiffrées recueillies sur un sujet afin d’en tirer des informations.

✓ Elle fait partie des sciences du hasard et son histoire est très liée à celle de la théorie des
probabilités.

✓ Elle était utilisée, par exemple, par les États pour connaître leur population (richesse, activité, etc.)
afin d’établir les impôts.

✓ Pour caractériser et résumer des tableaux de données, les outils utilisés sont variés : représentation
graphique (carte géographique, histogramme, etc.), valeurs typiques (qui deviendront plus tard des
paramètres de positionnement, de dispersion et de forme), ajustement, corrélation, indices.

9
Statistique

Au début des années 1900, on voit se développer une nouvelle discipline scientifique à part entière : la
statistique mathématique qui cherche à inférer à partir des données la loi sous-jacente à ces
observations. Parmi les principales méthodes développées en statistique, on peut citer :

✓ les méthodes d’estimation

✓ les tests d’hypothèses

✓ la régression

✓ la discrimination

✓ l’analyse de la variance

10
Data Mining
A la croisée de la statistique et de l’informatique décisionnelle, le Data Mining (ou exploration de
données) est un processus d’analyse avancée qui consiste à extraire des connaissances, tendances et
modèles cachés dans de grandes quantités de données. Il utilise des techniques statistiques, des
algorithmes d’intelligence artificielle et d’apprentissage automatique (machine learning) pour
transformer des données brutes en informations exploitables.

✓ Découverte automatique : Détecte des relations et tendances inconnues dans les données.

✓ Traitement de grands volumes : Analyse des bases de données massives (Big Data).

✓ Techniques avancées : Utilise des algorithmes de classification, segmentation, prédiction, etc.

✓ Prise de décision améliorée : Aide les entreprises à optimiser leurs stratégies.

11
Étapes du Data Mining

1. Collecte et préparation des données : Nettoyage, transformation et intégration des données.

2. Exploration et sélection des variables : Identification des attributs pertinents.

3. Choix et application des algorithmes : Utilisation de modèles adaptés aux objectifs d’analyse.

4. Interprétation et validation : Vérification des résultats et ajustements éventuels.

5. Visualisation et exploitation : Présentation des résultats sous forme de graphiques et tableaux pour
faciliter la prise de décision.

12
Domaines d’application du Data Mining
Marketing :
✓ Segmentation des clients pour des campagnes ciblées
✓ Optimisation des campagnes publicitaires
✓ Personnalisation et recommandations
Finance :
✓ Détection de fraudes bancaires
✓ Prévision des marchés financiers
E-commerce :
✓ Recommandation de produits basée sur l’historique d’achats
Santé :
✓ Analyse des dossiers médicaux pour prédire des maladies
✓ Développement des médicaments
13
Types de données

Variables

Quantitative Temporelle Qualitative

Discrète Continue Temporelle Ordinale Nominale Binaire

- Nombre - Précipitation - Temps - Taille - Genre


d’enfants - Surface - Jour vestimentaire - Couleur
- Age - Mois - Niveau - Ville d’origine
-Nombre de
- Taille - Année d’études - Type de
pièces d’une
- Poids - Préférences culture
maison
- Kilométrage - Département
- Profession

14
Types de données
Données structurées :
✓ Stockées dans des bases de données relationnelles (SQL)
✓ Organisées sous forme de tableaux avec lignes et colonnes
✓ Faciles à interroger avec SQL

Données semi-structurées :
✓ Ne suivent pas un format strict mais possèdent une certaine organisation
✓ Utilisent des balises ou des métadonnées
✓ Stockées sous formats comme XML, JSON, ou NoSQL

Données non structurées :


✓ Données brutes, difficiles à organiser sous forme de tableau
✓ Incluent du texte, des images, des vidéos, des sons
✓ Requiert des techniques avancées (NLP, Computer Vision) pour être analysées

15
Transformation de données : Quantitative-Quantitative

Pour rendre homogènes plusieurs variables quantitatives, les transformations les plus utilisées sont
le centrage qui soustrait la moyenne à chaque valeur, la réduction qui divise chaque valeur par
l’écart-type ou encore le centrage-réduction qui enchaîne ces deux transformations.

𝑋−𝜇
Centrer-réduire 𝑍=
𝜎

16
Transformation de données : Quantitative-Qualitative

✓ Les principales méthodes statistiques supposent que les variables sont toutes de même type.
Or, généralement, les données comportent à la fois des variables quantitatives et qualitatives.

✓ Il est alors nécessaire d’effectuer des transformations pour obtenir des variables de même
nature.

✓ Pour transformer une variable quantitative en variable qualitative, la méthode la plus utilisée
consiste à découper l’ensemble d’arrivée de la variable quantitative en un ensemble de m
intervalles consécutifs.

17
Transformation de données : Quantitative-Qualitative

On obtient alors une variable qualitative ordinale à m modalités. La difficulté porte sur la définition de ce
découpage. Plusieurs techniques peuvent être utilisées :

✓ découpage défini a priori : par exemple, on remplace l’âge par une des valeurs 1, 2, 3 ou 4 suivant les
intervalles : 0–18 ans, 19–40 ans, 41–65 ans, plus de 65 ans

✓ découpage défini en utilisant la « forme » de l’histogramme (recherche de modes)

✓ découpage en intervalles de même longueur : il suffit de préciser le nombre d’intervalles et les bornes

✓ découpage en intervalles d’effectifs égaux : il suffit de préciser le nombre d’intervalles

18
Transformation de données : Qualitative-Binaire

Encodage Binaire (Dummy Encoding) : Cette méthode transforme une catégorie en deux valeurs
binaires (0 ou 1).

Personne Genre (Initial) Genre (Binaire)


A Homme 1
B Femme 0
C Homme 1
D Femme 0

19
Transformation de données : Qualitative-Binaire

One-Hot Encoding (Encodage à Plusieurs Colonnes) : Lorsqu'une variable qualitative a plus de deux
catégories, on utilise l’encodage One-Hot, qui crée plusieurs colonnes avec des 0 et 1.

Personne Niveau d’éducation Primaire (0/1) Secondaire (0/1) Universitaire (0/1)

A Primaire 1 0 0

B Secondaire 0 1 0

C Universitaire 0 0 1

D Secondaire 0 1 0

20
Transformation de données

Encodage Label Encoding (Numérotation des catégories) : On remplace chaque catégorie par un
numéro, mais cela introduit un ordre artificiel qui peut biaiser les modèles linéaires.

Personne Couleur Encodage


A Rouge 0
B Bleu 1
C Vert 2

NB : Ici, la valeur numérique ne représente pas une vraie relation entre les couleurs. Cette méthode
est utilisée principalement pour des algorithmes comme les arbres de décision (qui ne supposent pas
de relation d’ordre).

21
Description des données

Description monodimensionnelle des données quantitatives :

✓ La moyenne

✓ La médiane

✓ Les quartiles

✓ L’écart type

✓ Histogramme

✓ Estimation de la densité par la méthode des noyaux

✓ Diagramme en boîte

22
Description des données

Description bidimensionnelle des données quantitatives :

✓ Covariance et corrélation

✓ Histogramme bidimensionnel

✓ Estimation de la densité

23
Description des données

Description des données qualitatives :

✓ Diagramme en barres

✓ Camembert

24
Principales techniques du Data Mining

Classification : Attribution de catégories aux données (ex : détection de spam).

Clustering (Segmentation) : Regroupement d’individus aux comportements similaires (ex :


segmentation client).

Règles d’association : Identification de relations entre les données (ex : produits fréquemment
achetés ensemble).

Régression : Prédiction de valeurs continues (ex : prévisions de ventes).

Détection d’anomalies : Identification de fraudes ou comportements inhabituels.

25
Techniques d’apprentissage

Linear Regression Hierarchical


Ensemble Gaussian Mixture
GLM
Methods Hidden Markov
Regression Model
Neural Neural Networks
Networks SVR, GPR Clustering

Decision Trees K-means


Random Forest Fuzzy C-Means

Apprentissage
Supervised
Learning
Unupervised
Learning
Neural
Networks

Support Dimensionality
Vector Classification
Value reduction
Machines
iteration Temporal
difference Latent
Reinforcement Principal
Nearest Dirichlet
Discriminant learning Component Analysis
Neighbors
Analysis Analysis
Naïve Bayes Markov decision State- Action- Reward Singular Value
process State-Action: Sarsa () Decomposition

26
Techniques d’apprentissage : domaines d’application

Targetted
Population Estimating life
marketing
growth prediction expectancy
Recommender
Regression Customer system
Market
Adversting popularity segmentation
forecasting Clustering
prediction
Weather
forecasting
Apprentissage
Supervised
Learning
Unupervised
Learning
Big data
visualization

Diagnostics
Dimensionality
Classification reduction
Robot Game
Image navigation AI
classification Reinforcement
Feature Meaningful
learning Learning compression
elicitation
Customer Identity fraud tasks
retention detection Real-time Structure
decisions Skill acquisition discovery

27
Apprentissage supervisé vs. non supervisé
Etant donné : Les données d’apprentissage : 𝑥1 , 𝑦1 , … , 𝑥𝑛 , 𝑦𝑛 / 𝑥𝑖 𝞊 𝑅𝑑 et 𝑦𝑖 est le label/etiquette.
Exemple x1 → x11 x12 … x1d y1  Etiquette
… … … … … …
Exemple xi → xi1 xi2 … xid yi  Etiquette
… … … … … …
Exemple xn → xn1 xn2 … xnd yn  Etiquette

Fruit Longueur Largeur Poids Etiquette


Fruit 1 165 38 172 Banane
Fruit 2 218 39 230 Banane
Fruit 3 76 80 145 Orange
Fruit 4 145 35 150 Banane
Fruit 5 90 88 160 Orange

Fruit n … … … … 28
Apprentissage supervisé vs. non supervisé

Fruit Longueur Largeur Poids


Fruit 1 165 38 172
Fruit 2 218 39 230
Fruit 3 76 80 145
Fruit 4 145 35 150
Fruit 5 90 88 160

Fruit n … … …

- Apprentissage non supervisé: apprentissage d'un modèle à partir de données non étiquetées.

- Apprentissage supervisé: apprentissage d'un modèle à partir de données étiquetées.

29
Apprentissage supervisé vs. non supervisé
Étant donné: l’ensemble d’apprentissage 𝑥1 , 𝑥2 , … , 𝑥𝑛 (sans étiquettes)
Afficher la structure cachée derrière les 𝑥
Exemple: clustering

Méthodes: K-means, Gaussian Mixtures, Hierarchical Clustering, Spectral Clustering

30
Bibliothèques utilisées

Python est le langage le plus utilisé dans la science des données. Il est possible de se contenter sur des
fonctionnalités de ce langage ou bien d’utiliser un ensemble de bibliothèques open source qui facilitent la
manipulation des données. Parmi ces bibliothèques, on trouve :

Calcul Manipulation Base de Apprentissage


Visualisation Big Data Web scraping
scientifique des données données automatique
• NumPy • Pandas • Matplotlib • Spark • MongoDB • Scrapy • Scikit-learn
• SciPy • Seaborn • Hadoop • SQLite • Beautiful • Keras
• PostgreSQL Soup • TensorFlow
• Pytorch

31
NumPy

✓ NumPy (Numerical Python) est une bibliothèque très puissante pour le calcul scientifique.

✓ Elle offre de nombreuses fonctionnalités effectuant des opérations sur des tableaux (n-arrays) et des matrices en Python.

Pourquoi utiliser NumPy ?

✓ Elle permet un calcul mathématique des matrices et des tableaux rapide et efficace.

✓ Les tableaux NumPy occupent moins de mémoire et d’espace de stockage par rapport aux tableaux classiques de Python.

Par exemple, la multiplication de deux matrices de taille 1000 x 1000 en :

✓ Python prend > 10 min

✓ Numpy prend ~0.03 secondes

Installation :

pip install numpy

32
Pandas

Pandas est une bibliothèque open source essentielle pour le langage de programmation Python, conçue
pour la manipulation et l'analyse de données. Elle fournit des structures de données puissantes et flexibles,
notamment le DataFrame, qui rendent le travail avec des données structurées (tabulaires) intuitif et
efficace.

Installation :
pip install pandas

33
Matplotlib

Matplotlib est une bibliothèque Python open source fondamentale permettant de créer une grande variété
de visualisations de données statiques, animées et interactives. Elle produit des figures de qualité
professionnelle dans de nombreux formats et sur de multiples plateformes, et constitue un outil essentiel
pour les data scientists et les chercheurs.

Installation :

pip install matplotlib

34
Seaborn

Seaborn est une puissante bibliothèque Python permettant de créer des graphiques statistiques informatifs
et attrayants. Basée sur Matplotlib, elle s'intègre parfaitement aux structures de données Pandas,
simplifiant ainsi la visualisation et l'exploration des données.

Installation :

pip install seaborn

35
Scikit learn

Scikit-learn est une bibliothèque d'apprentissage automatique libre et open source pour le langage de
programmation Python. Elle propose divers algorithmes de classification, de régression et de clustering,
notamment les machines à vecteurs de support, les forêts aléatoires, le gradient boosting, les k-means. Elle
est conçue pour interagir avec les bibliothèques numériques et scientifiques Python NumPy et SciPy.

Installation :
pip install -U scikit-learn

36

Vous aimerez peut-être aussi