Cours M1 MDB – Outils d'analyse et de pilotage des
affaires
Module 2 –le processus d’étude ou Datamining (fouille
des données)
Objectif du module :
Etablir le processus global d’une étude quantitative, de la
collecte des données à la diffusion des résultats.
Auteur : Hugues Fournel
Leçon : OAP_M2 1
Définition (s)
Datamining = fouille des données =
ensemble du processus d’extraction de
connaissances à partir de données contenues dans
une base de données.
Ce n’est qu’un élément du processus de
transformation des données en connaissance.
2
Démarche de gestion des connaissances
ni ng
tami
t da
e
q ues
i
tist
Sta
Utilisation de
la connaissance
aine
do m Identification
u
io nd de relations
n s
ré he Enrichissement
omp des variables
C
Qualification Information Information
des données découverte exploitée
Sélection des
données
Données
sources Données Données Données
cibles Validées transformées
3
Le processus de data mining
processus en plusieurs étapes :
poser le problème
la recherche des données
la sélection des données pertinentes
le nettoyage des données
les actions sur les variables
la recherche du modèle
l’évaluation du résultat
l’intégration de la connaissance
4
1 - Poser le problème
Objectif :
exposer le problème
définir :
• les objectifs,
• le résultat attendu
• les moyens de mesurer le succès
La Formulation du problème :
découper le problème complexe en sous problèmes de
complexité moindre et collecter les données nécessaires
au traitement de chacun des sous problèmes
=> Etablir un cahier des charges ou contrat d’étude
5
1 - Poser le problème (2)
Définir les différents acteurs :
Le « Client »
Les bénéficiaires
Les utilisateurs
Préciser les moyens
Moyens humains
Moyens financiers
Temps
Les résultats attendus
démarche d’analyse critique des processus liés à l’exploitation des
résultats. Comment pourra-t-on utiliser les résultats de l’étude ?
(Cf gestion de projet)
6
2 - La recherche de données
Objectif :
Déterminer la structure générale des données ainsi que les
règles utilisées pour les constituer
Actions :
Identifier les informations exploitables
Vérifier leur qualité
Vérifier leur facilité d’accès.
7
2.1 L’investigation
La recherche d’une sélection optimale des données est
le point central d’un processus de datamining.
À l’aide d’experts du domaine (sans avoir une
démarche système expert)
Cette structuration des données doit :
Clarifier les associations qui existent entre données,
Préciser leurs contenus sémantiques
Définir les regroupements fréquemment utilisés
Les valeurs seuil ou aberrantes
Pour réduire la taille du problème en isolant les
éléments les plus pertinents.
8
2.2 La réduction des dimensions
Par l’étude, on tente de réduire la complexité initiale
afin d’en déduire un modèle général et robuste
Cette réduction porte sur :
Le nombre de variables
Le nombre de modalités ou cas (ex dates)
Utilisation des corrélations
Mais attention à la réduction arbitraire
Ex : comment regrouper les catégories socio-
professionnelles en ensemble homogène ?
9
3-La sélection des données pertinentes
Le meilleur moyen de créer un modèle est de rechercher des
évènements similaires dans le passé.
Il faut constituer (à partir des données de l’entreprise) la source
d’information qui va permettre de construire l’apprentissage.
Représente une charge de travail considérable (jusqu'à 80% du
temps)
surtout si les informations de l’entreprise sont peu
structurées, hétérogènes et obsolètes.
La présence d’un data warehouse facilitera bien entendu cette
phase.
10
3-La sélection des données pertinentes
Le meilleur moyen de créer un modèle est de rechercher des
évènements similaires dans le passé.
Il faut constituer (à partir des données de l’entreprise) la source
d’information qui va permettre de construire l’apprentissage.
Représente une charge de travail considérable (jusqu'à 80% du
temps)
surtout si les informations de l’entreprise sont peu
structurées, hétérogènes et obsolètes.
La présence d’un data warehouse facilitera bien entendu cette
phase.
11
3.1 Sélection des individus
3.1.1 Echantillon ou exhaustivité
Ce choix dépend de plusieurs facteurs
Outils utilisés (méthodes et puissance machine)
Budget alloué
Niveau de fiabilité recherché
Nombre de données initiales
Tendances générales -> Echantillon représentatif
Analyse sur population spécifique -> extraction par quotas
Etude sur des segments étroits -> Echantillon plus
important voir exhaustif
12
3.2 Mode de création de l’échantillon
Deux types de méthodes : méthodes aléatoires ou méthode
des quotas
Méthode des quotas :
Pas de base de sondage
Mode de collecte n’est pas aléatoire pur (exemple enquête par tel à
partir du botin)
Cas des enquêtes d’opinion
Permet de réduire le risque de n’interroger que les personnes
présentes chez elles
Dans le cas d’études à partir de données de l’entreprise
(datamining) on préférera les méthodes aléatoires
13
les méthodes aléatoires (Cf cours de L3)
Tirage aléatoire simple
Avec stratification :
Sondage en grappe
Valider la représentativité de l’échantillon ou redresser les
résultats.
La question de la taille de l’échantillon …
14
4 - Le nettoyage des données
Objectif : corriger ou contourner les inexactitudes ou les
erreurs qui se sont glissées dans les données
Les valeurs manquantes :
Une donnée manquante se défini comme l’absence d’observation
pour un individu à une variable.
Les valeurs aberrantes
Une valeur aberrante est une valeur manifestement très différente
des autres
La détection
Le traitement
15
Valeur aberrante : la détection
Examen visuel
visualisation des distributions statistiques ou du graphe dans le cas
d’études de chronique.
Définir un espace entre la moyenne et un certain nombre
d’écart type et d’étudier (visualiser) les observations
sortant de cet intervalle
Pour les variables qualitatives, l’examen des tris à plat sera
nécessaire.
Conduire l’étude sur plusieurs variables
Utilisation de l’analyse multidimensionnelle
Une valeur nulle peut être une valeur aberrante (ou
manquante)
16
Valeur aberrante : Le traitement
Ne rien faire (c’est pas le bon choix)
Supprimer la valeur (si la méthode statistique utilisée par la
suite accepte les valeurs manquantes)
Supprimer l’individu
Utiliser une méthode de repondération
Imputer une nouvelle valeur comme par exemple imputer
la valeur moyenne
Imputer une valeur conditionnelle ou un score
17
5 - Les actions sur les variables
C’est transformer les variables pour faciliter leur exploitation
par les outils de modélisation
Transformation monovariable :
La normalisation : modification de l’unité de mesure
Centrage/réduction
Calcul de taux
Transformation logarithmique
Regroupement des valeurs en classe (classe d’âge)
Transformation des dates en durées exemple le calcul de
l’ancienneté du client
Conversion des données géographiques en coordonnées
Utilisation du géocodage pour intégrer les contraintes de proximité
géographique
18
Transformations multivariables
C’est la combinaison de plusieurs variables élémentaires en
une variable agrégée
Les ratios : mise en relation de deux indicateurs
Les fréquences : agrégation des données sur des périodes
de temps et calcul du nombre de fois où l’opération
apparaît. Exemple de la fréquence mensuelle d’achat du produit.
Les tendances : exemple, calcul entre deux périodes d’un taux de
variation.
Les combinaisons linéaires, non linaires : des experts du
domaine calculent des indicateurs en combinant des
données primaires. exemple : (loyer-charges)/surface
19
6 - La recherche du modèle
La phase de modélisation consiste à extraire la connaissance
utile d’un ensemble de données et à les présenter sous
forme synthétique
6 – 1 L’élaboration des bases
La modélisation suit les étapes représentées dans le schéma
suivant :
20
Base de
données
1 : Echantillonnage ou extraction
Base
d’étude
2 : Création des bases
Base
d’apprentissage Base de
test
5:
3 : Modélisation
validation
4 : application sur la base
du modèle de test ou
à la base de test itération de la
Modèle modélisation
Validation
6-2 Les algorithmes de calcul
Le choix des algorithmes de calcul est déterminant
pour :
la performance du modèle
le type de restitution des résultats
son adéquation avec les objectifs de l’étude.
Les trois objectifs :
Décrire un ensemble de données
Rassembler des individus en groupes homogènes
Expliquer une variable
22
Présentation des techniques statistiques selon leur objectif
Fonction ou Exemple de
Type de variables méthodes
Objectif
Descriptif : Variables numériques ou ordinales ACP
Résumer l'information
en minimisant Deux variables qualitatives
AFC
la déperdition
et repérer les Trois variables qualitatives ou plus
dimensions cachées
ACM
Classer des individus Nombre de groupes fixé Analyse
Constituer des typologique
groupes d'individus Classification
Nombre de groupes n’est pas fixé
aussi similaires hiérarchique
que possibles
Variables quantitatives Régression multiple
Expliquer Variable à expliquer qualitative
Expliquer une et variables explicatives numérique Analyse discriminante
variable par
plusieurs autres Variable à expliquer qualitative Arbres de décision
et variables explicatives qualitatives
7 - L’évaluation du résultat
L’évaluation du résultat s’effectue à deux niveaux :
Au niveau de la base d’apprentissage
La plupart des techniques possèdent leur propre batterie de
critères de mesure de la qualité
On cherchera, par différents « réglages » à améliorer ces
critères.
Au niveau de la base de test :
Pour estimer la qualité du modèle : sa capacité à
déterminer correctement, sur des cas nouveaux, les valeurs
qu’il est censé avoir appris à calculer sur la base de
d’apprentissage
Pour mesurer sa performance (matrice de comparaison
situation réelle / situation prévue)
24
8-L’intégration de la connaissance
La connaissance ne sert à rien tant qu’elle n’est pas
convertie en décision puis en action.
L’intégration consiste à implanter le modèle ou ses
résultats dans les systèmes informatiques ou dans les
processus de l’entreprise.
C’est la transition du domaine des études au domaine
opérationnel.
On dressera également un bilan du déroulement des étapes
précédentes. (exemple, amélioration des données,…)
25
9 - Conclusion
Rappel des différentes étapes d’un processus de datamining :
1) poser le problème
2) la recherche des données
3) la sélection des données pertinentes
4) le nettoyage des données
5) les actions sur les variables
6) la recherche du modèle
7) l’évaluation du résultat
8) l’intégration de la connaissance
Ce processus, linéaire en théorie, est dans la pratique sujet à
des itérations. Par exemple «retourner» chercher des données
suite à l’opération de nettoyage
26
27