Introduction au Data Mining
Pr. Nabila ZRIRA
zrira@[Link]
Année universitaire: 2025-2026
Evaluation
TP
20%
ASSUIDUITE EXAMEN
20% 60%
2
Plan
✓Introduction
✓K plus proche voisin
✓Regroupement
✓Régression
✓Réseaux de neurones artificiels
3
Informatique opérationnelle
Informatique opérationnelle (production) :
✓ Gère les processus métier et les opérations quotidiennes.
✓ Englobe les systèmes transactionnels, les ERP (Enterprise Resource Planning), les CRM (Customer
Relationship Management), et d'autres outils nécessaires au bon fonctionnement des activités
d’une entreprise.
✓ Se focalise sur la rapidité, l’efficacité et l’automatisation des tâches répétitives.
✓ Exemples : gestion des stocks, suivi des commandes, gestion de la paie, comptabilité.
4
Informatique décisionnelle
Informatique décisionnelle (stratégique) :
✓ Transforme les données en informations utiles pour la prise de décision.
✓ Utilise des outils comme les entrepôts de données (Data Warehouse), les tableaux de bord
analytiques, et les algorithmes de Data Mining.
✓ Aide les dirigeants et analystes à anticiper les tendances et optimiser les stratégies.
✓ Exemples : analyse des ventes, prévisions de la demande, reporting financier, extraction de
connaissances à partir des BD, visualisation des données multidimensionnelles.
5
Informatique décisionnelle vs opérationnelle
L’informatique opérationnelle gère l’exécution des activités en temps réel, tandis que l’informatique
décisionnelle analyse et synthétise les données pour aider à la prise de décisions stratégiques.
Exemple : Un site e-commerce utilise l’informatique opérationnelle pour traiter les commandes et
gérer les livraisons, tandis que l’informatique décisionnelle analyse les ventes pour recommander
des promotions et anticiper la demande.
6
Data Warehouse
Un Data Warehouse (entrepôt de données) est un système de stockage et de gestion des données
conçu pour faciliter l’analyse et la prise de décision. Il centralise, nettoie et structure des données
provenant de différentes sources afin de permettre des analyses efficaces et rapides.
7
Data Warehouse
Avantages d’un Data Warehouse :
✓ Améliore la prise de décision grâce à des analyses précises.
✓ Permet une vue unifiée et cohérente des données de l’entreprise.
✓ Optimise les performances des requêtes analytiques.
✓ Favorise l’historisation et l’analyse des tendances.
8
Statistique
✓ Statistique est une discipline scientifique ayant pour objectif de rassembler et d’étudier des données
chiffrées recueillies sur un sujet afin d’en tirer des informations.
✓ Elle fait partie des sciences du hasard et son histoire est très liée à celle de la théorie des
probabilités.
✓ Elle était utilisée, par exemple, par les États pour connaître leur population (richesse, activité, etc.)
afin d’établir les impôts.
✓ Pour caractériser et résumer des tableaux de données, les outils utilisés sont variés : représentation
graphique (carte géographique, histogramme, etc.), valeurs typiques (qui deviendront plus tard des
paramètres de positionnement, de dispersion et de forme), ajustement, corrélation, indices.
9
Statistique
Au début des années 1900, on voit se développer une nouvelle discipline scientifique à part entière : la
statistique mathématique qui cherche à inférer à partir des données la loi sous-jacente à ces
observations. Parmi les principales méthodes développées en statistique, on peut citer :
✓ les méthodes d’estimation
✓ les tests d’hypothèses
✓ la régression
✓ la discrimination
✓ l’analyse de la variance
10
Data Mining
A la croisée de la statistique et de l’informatique décisionnelle, le Data Mining (ou exploration de
données) est un processus d’analyse avancée qui consiste à extraire des connaissances, tendances et
modèles cachés dans de grandes quantités de données. Il utilise des techniques statistiques, des
algorithmes d’intelligence artificielle et d’apprentissage automatique (machine learning) pour
transformer des données brutes en informations exploitables.
✓ Découverte automatique : Détecte des relations et tendances inconnues dans les données.
✓ Traitement de grands volumes : Analyse des bases de données massives (Big Data).
✓ Techniques avancées : Utilise des algorithmes de classification, segmentation, prédiction, etc.
✓ Prise de décision améliorée : Aide les entreprises à optimiser leurs stratégies.
11
Étapes du Data Mining
1. Collecte et préparation des données : Nettoyage, transformation et intégration des données.
2. Exploration et sélection des variables : Identification des attributs pertinents.
3. Choix et application des algorithmes : Utilisation de modèles adaptés aux objectifs d’analyse.
4. Interprétation et validation : Vérification des résultats et ajustements éventuels.
5. Visualisation et exploitation : Présentation des résultats sous forme de graphiques et tableaux pour
faciliter la prise de décision.
12
Domaines d’application du Data Mining
Marketing :
✓ Segmentation des clients pour des campagnes ciblées
✓ Optimisation des campagnes publicitaires
✓ Personnalisation et recommandations
Finance :
✓ Détection de fraudes bancaires
✓ Prévision des marchés financiers
E-commerce :
✓ Recommandation de produits basée sur l’historique d’achats
Santé :
✓ Analyse des dossiers médicaux pour prédire des maladies
✓ Développement des médicaments
13
Types de données
Variables
Quantitative Temporelle Qualitative
Discrète Continue Temporelle Ordinale Nominale Binaire
- Nombre - Précipitation - Temps - Taille - Genre
d’enfants - Surface - Jour vestimentaire - Couleur
- Age - Mois - Niveau - Ville d’origine
-Nombre de
- Taille - Année d’études - Type de
pièces d’une
- Poids - Préférences culture
maison
- Kilométrage - Département
- Profession
14
Types de données
Données structurées :
✓ Stockées dans des bases de données relationnelles (SQL)
✓ Organisées sous forme de tableaux avec lignes et colonnes
✓ Faciles à interroger avec SQL
Données semi-structurées :
✓ Ne suivent pas un format strict mais possèdent une certaine organisation
✓ Utilisent des balises ou des métadonnées
✓ Stockées sous formats comme XML, JSON, ou NoSQL
Données non structurées :
✓ Données brutes, difficiles à organiser sous forme de tableau
✓ Incluent du texte, des images, des vidéos, des sons
✓ Requiert des techniques avancées (NLP, Computer Vision) pour être analysées
15
Transformation de données : Quantitative-Quantitative
Pour rendre homogènes plusieurs variables quantitatives, les transformations les plus utilisées sont
le centrage qui soustrait la moyenne à chaque valeur, la réduction qui divise chaque valeur par
l’écart-type ou encore le centrage-réduction qui enchaîne ces deux transformations.
𝑋−𝜇
Centrer-réduire 𝑍=
𝜎
16
Transformation de données : Quantitative-Qualitative
✓ Les principales méthodes statistiques supposent que les variables sont toutes de même type.
Or, généralement, les données comportent à la fois des variables quantitatives et qualitatives.
✓ Il est alors nécessaire d’effectuer des transformations pour obtenir des variables de même
nature.
✓ Pour transformer une variable quantitative en variable qualitative, la méthode la plus utilisée
consiste à découper l’ensemble d’arrivée de la variable quantitative en un ensemble de m
intervalles consécutifs.
17
Transformation de données : Quantitative-Qualitative
On obtient alors une variable qualitative ordinale à m modalités. La difficulté porte sur la définition de ce
découpage. Plusieurs techniques peuvent être utilisées :
✓ découpage défini a priori : par exemple, on remplace l’âge par une des valeurs 1, 2, 3 ou 4 suivant les
intervalles : 0–18 ans, 19–40 ans, 41–65 ans, plus de 65 ans
✓ découpage défini en utilisant la « forme » de l’histogramme (recherche de modes)
✓ découpage en intervalles de même longueur : il suffit de préciser le nombre d’intervalles et les bornes
✓ découpage en intervalles d’effectifs égaux : il suffit de préciser le nombre d’intervalles
18
Transformation de données : Qualitative-Binaire
Encodage Binaire (Dummy Encoding) : Cette méthode transforme une catégorie en deux valeurs
binaires (0 ou 1).
Personne Genre (Initial) Genre (Binaire)
A Homme 1
B Femme 0
C Homme 1
D Femme 0
19
Transformation de données : Qualitative-Binaire
One-Hot Encoding (Encodage à Plusieurs Colonnes) : Lorsqu'une variable qualitative a plus de deux
catégories, on utilise l’encodage One-Hot, qui crée plusieurs colonnes avec des 0 et 1.
Personne Niveau d’éducation Primaire (0/1) Secondaire (0/1) Universitaire (0/1)
A Primaire 1 0 0
B Secondaire 0 1 0
C Universitaire 0 0 1
D Secondaire 0 1 0
20
Transformation de données
Encodage Label Encoding (Numérotation des catégories) : On remplace chaque catégorie par un
numéro, mais cela introduit un ordre artificiel qui peut biaiser les modèles linéaires.
Personne Couleur Encodage
A Rouge 0
B Bleu 1
C Vert 2
NB : Ici, la valeur numérique ne représente pas une vraie relation entre les couleurs. Cette méthode
est utilisée principalement pour des algorithmes comme les arbres de décision (qui ne supposent pas
de relation d’ordre).
21
Description des données
Description monodimensionnelle des données quantitatives :
✓ La moyenne
✓ La médiane
✓ Les quartiles
✓ L’écart type
✓ Histogramme
✓ Estimation de la densité par la méthode des noyaux
✓ Diagramme en boîte
22
Description des données
Description bidimensionnelle des données quantitatives :
✓ Covariance et corrélation
✓ Histogramme bidimensionnel
✓ Estimation de la densité
23
Description des données
Description des données qualitatives :
✓ Diagramme en barres
✓ Camembert
24
Principales techniques du Data Mining
Classification : Attribution de catégories aux données (ex : détection de spam).
Clustering (Segmentation) : Regroupement d’individus aux comportements similaires (ex :
segmentation client).
Règles d’association : Identification de relations entre les données (ex : produits fréquemment
achetés ensemble).
Régression : Prédiction de valeurs continues (ex : prévisions de ventes).
Détection d’anomalies : Identification de fraudes ou comportements inhabituels.
25
Techniques d’apprentissage
Linear Regression Hierarchical
Ensemble Gaussian Mixture
GLM
Methods Hidden Markov
Regression Model
Neural Neural Networks
Networks SVR, GPR Clustering
Decision Trees K-means
Random Forest Fuzzy C-Means
Apprentissage
Supervised
Learning
Unupervised
Learning
Neural
Networks
Support Dimensionality
Vector Classification
Value reduction
Machines
iteration Temporal
difference Latent
Reinforcement Principal
Nearest Dirichlet
Discriminant learning Component Analysis
Neighbors
Analysis Analysis
Naïve Bayes Markov decision State- Action- Reward Singular Value
process State-Action: Sarsa () Decomposition
26
Techniques d’apprentissage : domaines d’application
Targetted
Population Estimating life
marketing
growth prediction expectancy
Recommender
Regression Customer system
Market
Adversting popularity segmentation
forecasting Clustering
prediction
Weather
forecasting
Apprentissage
Supervised
Learning
Unupervised
Learning
Big data
visualization
Diagnostics
Dimensionality
Classification reduction
Robot Game
Image navigation AI
classification Reinforcement
Feature Meaningful
learning Learning compression
elicitation
Customer Identity fraud tasks
retention detection Real-time Structure
decisions Skill acquisition discovery
27
Apprentissage supervisé vs. non supervisé
Etant donné : Les données d’apprentissage : 𝑥1 , 𝑦1 , … , 𝑥𝑛 , 𝑦𝑛 / 𝑥𝑖 𝞊 𝑅𝑑 et 𝑦𝑖 est le label/etiquette.
Exemple x1 → x11 x12 … x1d y1 Etiquette
… … … … … …
Exemple xi → xi1 xi2 … xid yi Etiquette
… … … … … …
Exemple xn → xn1 xn2 … xnd yn Etiquette
Fruit Longueur Largeur Poids Etiquette
Fruit 1 165 38 172 Banane
Fruit 2 218 39 230 Banane
Fruit 3 76 80 145 Orange
Fruit 4 145 35 150 Banane
Fruit 5 90 88 160 Orange
…
Fruit n … … … … 28
Apprentissage supervisé vs. non supervisé
Fruit Longueur Largeur Poids
Fruit 1 165 38 172
Fruit 2 218 39 230
Fruit 3 76 80 145
Fruit 4 145 35 150
Fruit 5 90 88 160
…
Fruit n … … …
- Apprentissage non supervisé: apprentissage d'un modèle à partir de données non étiquetées.
- Apprentissage supervisé: apprentissage d'un modèle à partir de données étiquetées.
29
Apprentissage supervisé vs. non supervisé
Étant donné: l’ensemble d’apprentissage 𝑥1 , 𝑥2 , … , 𝑥𝑛 (sans étiquettes)
Afficher la structure cachée derrière les 𝑥
Exemple: clustering
Méthodes: K-means, Gaussian Mixtures, Hierarchical Clustering, Spectral Clustering
30
Bibliothèques utilisées
Python est le langage le plus utilisé dans la science des données. Il est possible de se contenter sur des
fonctionnalités de ce langage ou bien d’utiliser un ensemble de bibliothèques open source qui facilitent la
manipulation des données. Parmi ces bibliothèques, on trouve :
Calcul Manipulation Base de Apprentissage
Visualisation Big Data Web scraping
scientifique des données données automatique
• NumPy • Pandas • Matplotlib • Spark • MongoDB • Scrapy • Scikit-learn
• SciPy • Seaborn • Hadoop • SQLite • Beautiful • Keras
• PostgreSQL Soup • TensorFlow
• Pytorch
31
NumPy
✓ NumPy (Numerical Python) est une bibliothèque très puissante pour le calcul scientifique.
✓ Elle offre de nombreuses fonctionnalités effectuant des opérations sur des tableaux (n-arrays) et des matrices en Python.
Pourquoi utiliser NumPy ?
✓ Elle permet un calcul mathématique des matrices et des tableaux rapide et efficace.
✓ Les tableaux NumPy occupent moins de mémoire et d’espace de stockage par rapport aux tableaux classiques de Python.
Par exemple, la multiplication de deux matrices de taille 1000 x 1000 en :
✓ Python prend > 10 min
✓ Numpy prend ~0.03 secondes
Installation :
pip install numpy
32
Pandas
Pandas est une bibliothèque open source essentielle pour le langage de programmation Python, conçue
pour la manipulation et l'analyse de données. Elle fournit des structures de données puissantes et flexibles,
notamment le DataFrame, qui rendent le travail avec des données structurées (tabulaires) intuitif et
efficace.
Installation :
pip install pandas
33
Matplotlib
Matplotlib est une bibliothèque Python open source fondamentale permettant de créer une grande variété
de visualisations de données statiques, animées et interactives. Elle produit des figures de qualité
professionnelle dans de nombreux formats et sur de multiples plateformes, et constitue un outil essentiel
pour les data scientists et les chercheurs.
Installation :
pip install matplotlib
34
Seaborn
Seaborn est une puissante bibliothèque Python permettant de créer des graphiques statistiques informatifs
et attrayants. Basée sur Matplotlib, elle s'intègre parfaitement aux structures de données Pandas,
simplifiant ainsi la visualisation et l'exploration des données.
Installation :
pip install seaborn
35
Scikit learn
Scikit-learn est une bibliothèque d'apprentissage automatique libre et open source pour le langage de
programmation Python. Elle propose divers algorithmes de classification, de régression et de clustering,
notamment les machines à vecteurs de support, les forêts aléatoires, le gradient boosting, les k-means. Elle
est conçue pour interagir avec les bibliothèques numériques et scientifiques Python NumPy et SciPy.
Installation :
pip install -U scikit-learn
36