0% ont trouvé ce document utile (0 vote)
4 vues19 pages

Introduction à la fouille de données

Le chapitre traite de la fouille de données, un processus itératif permettant d'extraire des connaissances à partir de grands ensembles de données. Il souligne l'importance de la qualité des données, des objectifs de prédiction et de description, ainsi que des techniques de fouille de données. La fouille de données est essentielle dans divers domaines, y compris les affaires et la sécurité, pour découvrir des tendances et des modèles significatifs.

Transféré par

David Tshiler
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
4 vues19 pages

Introduction à la fouille de données

Le chapitre traite de la fouille de données, un processus itératif permettant d'extraire des connaissances à partir de grands ensembles de données. Il souligne l'importance de la qualité des données, des objectifs de prédiction et de description, ainsi que des techniques de fouille de données. La fouille de données est essentielle dans divers domaines, y compris les affaires et la sécurité, pour découvrir des tendances et des modèles significatifs.

Transféré par

David Tshiler
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

CHAPITRE 1: DATA MINING

OBJECTIFS DU CHAPITRE

• Comprendre la nécessité d'analyser de grands ensembles de données complexes et riches


en informations.
• Identifier les objectifs et les tâches principales du processus de fouille de données.
• Décrire les origines de la technologie de fouille de données.
• Reconnaître le caractère itératif d'un processus de fouille de données et spécifier ses
étapes de base.
• Expliquer l'influence de la qualité des données sur un processus de fouille de données.
• Établir la relation entre l'entreposage de données et la fouille de données.
• Discuter des concepts de big data et de science des données.

INTRODUCTION

La science moderne et l'ingénierie reposent sur l'utilisation de modèles de premier principe pour
décrire les systèmes physiques, biologiques et sociaux. Une telle approche commence par un
modèle scientifique de base, tel que les lois du mouvement de Newton ou les équations de
Maxwell en électromagnétisme, puis construit sur eux diverses applications en génie mécanique
ou électrique. Dans cette approche, les données expérimentales sont utilisées pour vérifier les
modèles de premier principe sous-jacents et estimer certains des paramètres qui sont difficiles
ou parfois impossibles à mesurer directement. Cependant, dans de nombreux domaines, les
premiers principes sous-jacents sont inconnus, ou les systèmes étudiés sont trop complexes pour
être formalisés mathématiquement. Avec l'utilisation croissante des ordinateurs, une grande
quantité de données est générée par de tels systèmes. En l'absence de modèles de premier
principe, ces données facilement disponibles peuvent être utilisées pour dériver des modèles en
estimant des relations utiles entre les variables d'un système (c'est-à-dire, des dépendances
d'entrée-sortie inconnues). Ainsi, il y a actuellement un changement de paradigme des
modélisations classiques et des analyses basées sur les premiers principes au développement de
modèles et des analyses correspondantes directement à partir des données.

Nous nous sommes habitués progressivement au fait qu'il existe d'énormes volumes de données
remplissant nos ordinateurs, réseaux et vies. Les agences gouvernementales, les institutions
scientifiques et les entreprises ont toutes consacré d'énormes ressources à la collecte et au
stockage de données. En réalité, seule une petite partie de ces données ne sera jamais utilisée
parce que, dans de nombreux cas, les volumes sont simplement trop importants à gérer ou les
structures de données elles-mêmes sont trop compliquées pour être analysées efficacement.
Comment cela pourrait-il arriver ? La raison principale est que l'effort initial pour créer un
ensemble de données est souvent axé sur des problèmes tels que l'efficacité de stockage ; il
n'inclut pas de plan sur la manière dont les données seront éventuellement utilisées et analysées.
La nécessité de comprendre de grands ensembles de données complexes et riches en
informations est commune à pratiquement tous les domaines d'activité, de la science et de
l'ingénierie. Dans le monde des affaires, les données d'entreprise et client sont de plus en plus
reconnues comme un atout stratégique. La capacité à extraire des connaissances utiles cachées
dans ces données et à agir sur ces connaissances devient de plus en plus importante dans le
monde concurrentiel d'aujourd'hui. Tout le processus d'application d'une méthodologie
informatique, y compris de nouvelles techniques, pour découvrir des connaissances à partir de
données est appelé fouille de données.
La fouille de données est un processus itératif dans lequel le progrès est défini par la découverte,
soit par des méthodes automatiques, soit par des méthodes manuelles. La fouille de données est
la plus utile dans un scénario d'analyse exploratoire dans lequel il n'y a pas de notions
prédéterminées sur ce qui constituera un résultat "intéressant". La fouille de données consiste à
rechercher de nouvelles informations précieuses et non triviales dans de grands volumes de
données. C'est un effort coopératif entre les humains et les ordinateurs. Les meilleurs résultats
sont obtenus en équilibrant les connaissances des experts humains dans la description des
problèmes et des objectifs avec les capacités de recherche des ordinateurs.
En pratique, les deux principaux objectifs de la fouille de données sont généralement la
prédiction et la description. La prédiction consiste à utiliser certaines variables ou champs de
l'ensemble de données pour prédire les valeurs inconnues ou futures d'autres variables d'intérêt.
La description, en revanche, se concentre sur la recherche de motifs décrivant les données qui
peuvent être interprétés par les humains.
Par conséquent, il est possible de mettre les activités de fouille de données dans l'une des deux
catégories suivantes :
1. La fouille de données prédictive, qui produit le modèle du système décrit par l'ensemble
de données donné, ou
2. La fouille de données descriptive, qui produit de nouvelles informations non triviales
basées sur l'ensemble de données disponible.
À l'extrémité prédictive du spectre, l'objectif de la fouille de données est de produire un modèle,
exprimé sous forme de code exécutable, qui peut être utilisé pour effectuer une classification,
une prédiction, une estimation ou d'autres tâches similaires. D'autre part, à l'extrémité
descriptive du spectre, l'objectif est de comprendre le système analysé en découvrant des motifs
et des relations dans de grands ensembles de données. L'importance relative de la prédiction et
de la description pour des applications spécifiques de fouille de données peut varier
considérablement.
Les objectifs de prédiction et de description sont atteints en utilisant des techniques de fouille
de données, expliquées plus tard, pour les tâches de fouille de données primaires suivantes :

1. Classification -
Découverte d'une fonction d'apprentissage prédictive qui classe un élément de données dans
l'une des plusieurs classes prédéfinies.

2. Régression -
Découverte d'une fonction d'apprentissage prédictive, qui mappe un élément de données à une
variable de prédiction réelle.

3. Regroupement -
Une tâche descriptive courante dans laquelle on cherche à identifier un ensemble fini de
catégories ou de regroupements pour décrire les données.
4. Résumé
- Une tâche descriptive supplémentaire qui implique des méthodes pour trouver une description
compacte pour un ensemble (ou sous-ensemble) de données.

5. Modélisation de dépendance
Trouver un modèle local qui décrit les dépendances significatives entre les variables ou entre les
valeurs d'une caractéristique dans un ensemble de données ou dans une partie d'un ensemble
de données.

6. Détection de changement et de déviation –


Découverte des changements les plus significatifs dans l'ensemble de données.
L'approche plus formelle, avec interprétation graphique des tâches de fouille de données pour
des ensembles de données complexes et volumineux et des exemples illustratifs, est donnée
dans les paragraphes suivant. Les classifications et définitions introductives actuelles sont
données ici uniquement pour donner au lecteur une idée du large spectre de problèmes et de
tâches qui peuvent être résolus en utilisant la technologie de fouille de données.
Le succès d'une mission de fouille de données dépend largement de la quantité d'énergie, de
connaissance et de créativité que le concepteur y investit. En essence, la fouille de données est
comme résoudre un puzzle. Les pièces individuelles du puzzle ne sont pas des structures
complexes en elles-mêmes. Prises collectivement, cependant, elles peuvent constituer des
systèmes très élaborés. En essayant de dénouer ces systèmes, vous serez probablement frustré,
commencerez à forcer les pièces ensemble et serez généralement agacé par tout le processus ;
mais une fois que vous saurez comment travailler avec les pièces, vous réaliserez que ce n'était
pas vraiment si difficile au départ. La même analogie peut être appliquée à la fouille de données.
Au début, les concepteurs du processus de fouille de données ne connaissent probablement pas
grand-chose sur les sources de données ; s'ils le faisaient, ils ne seraient probablement pas
intéressés par la réalisation de fouilles de données. Individuellement, les données semblent
simples, complètes et explicables. Mais collectivement, elles prennent une toute nouvelle
apparence qui est intimidante et difficile à comprendre, comme le puzzle. Par conséquent, être
analyste et concepteur dans un processus de fouille de données nécessite, en plus d'une
connaissance professionnelle approfondie, une pensée créative et une volonté de voir les
problèmes sous un jour différent.
La fouille de données est l'un des domaines en plus forte croissance de l'industrie informatique.
Autrefois un petit domaine d'intérêt au sein de l'informatique et des statistiques, il s'est
rapidement étendu pour devenir un domaine à part entière. Une des plus grandes forces de la
fouille de données se reflète dans sa large gamme de méthodologies et de techniques qui
peuvent être appliquées à un ensemble de problèmes. Étant donné que la fouille de données est
une activité naturelle à réaliser sur de grands ensembles de données, l'un des plus grands
marchés cibles est l'ensemble de la communauté de l'entreposage de données, des data marts
et du soutien à la décision, englobant des professionnels des industries telles que la vente au
détail, la fabrication, les télécommunications, les soins de santé, l'assurance et le transport. Dans
le monde des affaires, la fouille de données peut être utilisée pour découvrir de nouvelles
tendances d'achat, planifier des stratégies d'investissement et détecter les dépenses non
autorisées dans le système comptable. Elle peut améliorer les campagnes marketing, et les
résultats peuvent être utilisés pour fournir aux clients un soutien et une attention plus ciblés. Les
techniques de fouille de données peuvent être appliquées aux problèmes de réingénierie des
processus métier, où l'objectif est de comprendre les interactions et les relations entre les
pratiques commerciales et les organisations.
De nombreuses unités de maintien de l'ordre et unités d'enquête spéciales, dont la mission est
d'identifier les activités frauduleuses et de découvrir les tendances criminelles, ont également
utilisé avec succès la fouille de données. Par exemple, ces méthodologies peuvent aider les
analystes à identifier des schémas de comportement critiques, les interactions de
communication des organisations de narcotrafiquants, les transactions monétaires de
blanchiment d'argent et d'opérations d'initiés, les déplacements des tueurs en série et le ciblage
des contrebandiers aux passages frontaliers. Les techniques de fouille de données ont également
été utilisées par des personnes de la communauté du renseignement qui gèrent de nombreuses
grandes sources de données dans le cadre des activités relatives aux questions de sécurité
nationale. L'appendice B du livre donne un bref aperçu des applications commerciales typiques
de la technologie de fouille de données aujourd'hui. Malgré un niveau considérable de sur-hype
et de mauvaise utilisation stratégique, la fouille de données n'a pas seulement perduré mais s'est
également développée et adaptée pour une utilisation pratique dans le monde des affaires.

PROCESSUS DE FOUILLE DE DONNÉES

Sans essayer de couvrir toutes les approches possibles et toutes les différentes opinions sur la
fouille de données en tant que discipline, commençons par une définition possible, suffisamment
large, de la fouille de données :
La fouille de données est un processus de découverte de divers modèles, résumés et valeurs
dérivées à partir d'une collection donnée de données.
Le mot "processus" est très important ici. Même dans certains environnements professionnels,
on croit que la fouille de données consiste simplement à choisir et à appliquer un outil
informatique pour correspondre au problème présenté et obtenir automatiquement une
solution. Il s'agit d'une idée fausse basée sur une idéalisation artificielle du monde. Il existe
plusieurs raisons pour lesquelles cela est incorrect. Une raison est que la fouille de données n'est
pas simplement une collection d'outils isolés, chacun totalement différent de l'autre et attendant
d'être associé au problème. Une deuxième raison réside dans l'idée de correspondance d'un
problème à une technique. Très rarement, une question de recherche est formulée suffisamment
précisément pour qu'une application simple et unique de la méthode suffise. En fait, ce qui se
passe dans la pratique, c'est que la fouille de données devient un processus itératif. On étudie
les données, on les examine à l'aide d'une technique analytique, on décide de les regarder d'une
autre manière, peut-être on les modifie, puis on revient au début et on applique une autre
technique d'analyse des données, en obtenant des résultats meilleurs ou différents. Cela peut
aller et venir plusieurs fois ; chaque technique est utilisée pour sonder légèrement différents
aspects des données - pour poser une question légèrement différente des données. Ce qui est
essentiellement décrit ici, c'est un voyage de découverte qui rend la fouille de données moderne
passionnante. Néanmoins, la fouille de données n'est pas une application aléatoire de méthodes
et d'outils statistiques, d'apprentissage automatique et autres. Ce n'est pas une marche aléatoire
dans l'espace des techniques analytiques mais un processus soigneusement planifié et considéré
pour décider de ce qui sera le plus utile, prometteur et révélateur.
Il est important de réaliser que le problème de la découverte ou de l'estimation de dépendances
à partir de données ou de la découverte de données totalement nouvelles n'est qu'une partie de
la procédure expérimentale générale utilisée par les scientifiques, les ingénieurs et d'autres qui
appliquent des étapes standard pour tirer des conclusions des données. La procédure
expérimentale générale adaptée aux problèmes de fouille de données implique les étapes
suivantes :

1. Énoncer le problème et formuler l'hypothèse


La plupart des études de modélisation basées sur des données sont réalisées dans un domaine
d'application particulier. Par conséquent, la connaissance et l'expérience spécifiques au domaine
sont généralement nécessaires pour formuler un énoncé de problème significatif.
Malheureusement, de nombreuses études d'application ont tendance à se concentrer sur la
technique de fouille de données au détriment d'un énoncé de problème clair. À cette étape, un
modélisateur spécifie généralement un ensemble de variables pour la dépendance inconnue et,
si possible, une forme générale de cette dépendance comme hypothèse initiale. Il peut y avoir
plusieurs hypothèses formulées pour un seul problème à cette étape. La première étape
nécessite l'expertise combinée d'un domaine d'application et d'un modèle de fouille de données.
En pratique, cela signifie généralement une interaction étroite entre l'expert en fouille de
données et l'expert en application. Dans les applications de fouille de données réussies, cette
coopération ne s'arrête pas dans la phase initiale ; elle se poursuit pendant tout le processus de
fouille de données.

2. Collecter les données


Cette étape concerne la manière dont les données sont générées et collectées. En général, il
existe deux possibilités distinctes. La première est lorsque le processus de génération de données
est sous le contrôle d'un expert (modélisateur) : cette approche est connue sous le nom
d'expérience conçue. La deuxième possibilité est lorsque l'expert ne peut pas influencer le
processus de génération de données : c'est ce qu'on appelle l'approche observationnelle. Un
cadre d'observation, à savoir, la génération aléatoire de données, est supposé dans la plupart
des applications de fouille de données. Généralement, la distribution d'échantillonnage est
complètement inconnue après la collecte des données, ou elle est partiellement et implicitement
donnée dans la procédure de collecte de données. Il est très important, cependant, de
comprendre comment la collecte de données affecte sa distribution théorique, car une telle
connaissance a priori peut être très utile pour la modélisation et, plus tard, pour l'interprétation
finale des résultats. De plus, il est important de s'assurer que les données utilisées pour estimer
un modèle et les données utilisées ultérieurement pour tester et appliquer un modèle
proviennent de la même distribution d'échantillonnage, inconnue. Si tel n'est pas le cas, le
modèle estimé ne peut pas être utilisé avec succès dans une application finale des résultats.

3. Prétraiter les données


Dans le cadre d'une configuration d'observation, les données sont généralement "collectées" à
partir des bases de données existantes, des entrepôts de données et des data marts. Le
prétraitement des données inclut généralement au moins deux tâches courantes :
(a) Détection (et suppression) des valeurs aberrantes
Les valeurs aberrantes sont des valeurs de données inhabituelles qui ne sont pas conformes à la
plupart des observations. Généralement, les valeurs aberrantes résultent d'erreurs de mesure et
d'erreurs de codage et d'enregistrement et, parfois, sont des valeurs naturelles anormales. De
tels échantillons non représentatifs peuvent affecter sérieusement le modèle produit plus tard.
Il existe deux stratégies pour traiter les valeurs aberrantes :
(i) Détecter et éventuellement supprimer les valeurs aberrantes dans le cadre de la phase de
prétraitement.
(ii) Développer des méthodes de modélisation robustes qui sont insensibles aux valeurs
aberrantes.
(b) Mise à l'échelle, encodage et sélection des caractéristiques
Le prétraitement des données comprend plusieurs étapes telles que la mise à l'échelle des
variables et différents types d'encodage. Par exemple, une caractéristique avec la plage [0, 1] et
l'autre avec la plage [–100, 1000] n'auront pas le même poids dans la technique appliquée ; elles
influenceront également différemment les résultats de la fouille de données finaux. Par
conséquent, il est recommandé de les mettre à l'échelle et de donner le même poids à ces deux
caractéristiques pour une analyse ultérieure. De plus, les méthodes d'encodage spécifiques à
l'application réalisent généralement une réduction de dimensionnalité en fournissant un plus
petit nombre de caractéristiques informatives pour la modélisation des données ultérieure.
Ces deux classes de tâches de prétraitement ne doivent pas être considérées comme
complètement indépendantes des autres phases de la fouille de données. Dans chaque itération
du processus de fouille de données, toutes les activités, ensemble, pourraient définir des
ensembles de données nouveaux et améliorés pour les itérations suivantes. En général, une
bonne méthode de prétraitement fournit une représentation optimale pour une technique de
fouille de données en incorporant des connaissances a priori sous forme de mise à l'échelle et
d'encodage spécifiques à l'application. Plus sur ces techniques et la phase de prétraitement est
discuté dans le chapitre suivant.

4. Identifier les modèles


Cette étape consiste à appliquer un ou plusieurs algorithmes de fouille de données pour extraire
des structures à partir des données. Un aspect critique de l'application de la fouille de données
est de choisir une technique appropriée pour identifier les modèles et les structures dans les
données. Ceci est une question très difficile et dépend de plusieurs facteurs : la complexité et le
type de données, la forme du modèle recherché, le bruit et la dimensionnalité des données, la
quantité d'informations a priori disponibles, et d'autres. Une approche possible pour la sélection
d'une méthode de fouille de données est de choisir celle qui est la plus couramment utilisée pour
des problèmes similaires et de comparer les résultats avec d'autres techniques possibles. En
général, plus d'un algorithme de fouille de données est utilisé pour sonder différents aspects des
données - pour poser une question légèrement différente des données.

5. Évaluer les modèles


Le but de cette étape est de déterminer si les structures et les modèles découverts par les
techniques de fouille de données sont en fait valides et utiles. Pour ce faire, il est nécessaire de
définir un critère d'évaluation approprié qui correspond au but de la tâche de fouille de données.
Par exemple, dans le cas de la classification, le critère de performance peut être le pourcentage
de classes correctement classées dans un ensemble de données de test. Il est important de noter
que la tâche d'évaluation peut nécessiter une réévaluation des hypothèses initiales. Parfois, la
phase de validation des résultats de la fouille de données peut fournir de nouvelles informations
qui peuvent être utilisées pour reformuler ou redéfinir l'hypothèse initiale, le problème de
recherche et même les techniques de fouille de données. Par exemple, une validation formelle
de l'exactitude des résultats de la classification peut révéler des classes inattendues qui n'ont pas
été envisagées dans l'énoncé initial du problème. Une autre raison de la réévaluation de
l'hypothèse initiale peut être que les résultats de la fouille de données ne sont pas aussi bons que
prévu ou que la qualité des données est insuffisante pour les techniques de fouille de données
choisies.

6. Présentation des connaissances


La dernière étape du processus de fouille de données est de présenter les connaissances
découvertes à l'utilisateur. Les résultats de la fouille de données peuvent être présentés sous de
nombreuses formes, selon la nature des résultats, les préférences de l'utilisateur, et les normes
de communication de la communauté scientifique. Les méthodes formelles, telles que l'écriture
d'un rapport technique ou scientifique, sont très courantes dans la pratique. Dans certaines
applications, cependant, il peut être préférable d'utiliser des formes plus informelles, telles que
la production de graphiques, de diagrammes et de visualisations, ou même de démonstrations
de modèles. En général, il est important de fournir des moyens permettant à l'utilisateur de
comprendre les résultats de la fouille de données, de les interpréter correctement et de les
utiliser pour prendre des décisions.

DU RECUEIL DE DONNÉES AU PRÉTRAITEMENT DES DONNÉES

Alors que nous entrons dans l'ère de l'information numérique, le problème de la surcharge de
données se profile devant nous de manière menaçante. Notre capacité à analyser et à
comprendre des ensembles de données massifs est loin derrière notre capacité à collecter et à
stocker les données. Les avancées récentes dans les technologies informatiques, de
communication et de stockage numérique, associées au développement de technologies
d'acquisition de données à haut débit, ont rendu possible la collecte et le stockage d'incroyables
volumes de données. Les vastes bases de données d'informations numériques sont
omniprésentes.
Les données provenant de la caisse enregistreuse du magasin du quartier, du dispositif
d'autorisation de carte de crédit de votre banque, des dossiers dans le cabinet de votre médecin,
des motifs de vos appels téléphoniques et de nombreuses autres applications génèrent des flux
d'enregistrements numériques archivés dans d'énormes bases de données commerciales. Les
systèmes informatiques complexes, les réseaux de communication et les systèmes électriques,
par exemple, sont équipés de capteurs et de dispositifs de mesure qui recueillent et stockent une
variété de données pour les surveiller, les contrôler et améliorer leur fonctionnement. Les
scientifiques se situent à l'extrémité supérieure de la machinerie de collecte de données
d'aujourd'hui, utilisant des données de différentes sources, des plateformes de télédétection à
la sonde microscopique des détails cellulaires. Les instruments scientifiques peuvent facilement
générer des téraoctets de données en peu de temps et les stocker dans l'ordinateur. Un exemple
en est les centaines de téraoctets de données d'ADN, de séquences de protéines et d'expression
génique que les chercheurs en sciences biologiques ont recueillies à des taux en augmentation
constante. L'ère de l'information, avec l'expansion de l'Internet, a entraîné une croissance
exponentielle des sources d'information et également des unités de stockage d'informations.
Il existe un fossé qui se creuse rapidement entre les capacités de collecte et d'organisation des
données et la capacité d'analyser les données. Les technologies matérielles et de base de
données actuelles permettent un stockage et un accès aux données efficaces, peu coûteux et
fiables. Cependant, que ce soit dans le domaine des affaires, de la médecine, des sciences ou du
gouvernement, les ensembles de données eux-mêmes, sous leur forme brute, ont peu de valeur
directe. Ce qui a de la valeur, c'est la connaissance qui peut être déduite des données et mise à
profit. Par exemple, la base de données marketing d'une entreprise de biens de consommation
peut fournir des connaissances sur la corrélation entre les ventes de certains articles et certains
groupes démographiques. Cette connaissance peut être utilisée pour introduire de nouvelles
campagnes marketing ciblées avec un retour financier prévisible, par opposition à des campagnes
non ciblées.
Le fond du problème est que la taille et la dimensionnalité des données sont trop importantes
pour une analyse et une interprétation manuelle, voire même pour certaines analyses semi-
automatiques basées sur l'ordinateur. Un scientifique ou un gestionnaire d'entreprise peut
travailler efficacement avec quelques centaines ou milliers d'enregistrements. L'exploitation
efficace de millions de points de données, chacun décrit avec des dizaines ou des centaines de
caractéristiques, est une autre affaire. Imaginez l'analyse de téraoctets de données d'images du
ciel avec des milliers d'images haute résolution photographiques (23 040 × 23 040 pixels par
image) ou des bases de données génomiques humaines avec des milliards de composants.
En théorie, les "big data" peuvent conduire à des conclusions beaucoup plus solides, mais en
pratique, de nombreuses difficultés se posent.
Quelles sont les solutions ? Travailler plus dur. Oui, mais jusqu'à quand pouvez-vous continuer,
car les limites sont très proches. Embaucher un assistant. Peut-être, si vous pouvez vous le
permettre. Ignorer les données. Mais alors vous n'êtes pas compétitif sur le marché. La seule
solution réelle sera de remplacer les méthodologies classiques d'analyse et d'interprétation des
données (à la fois manuelles et basées sur l'ordinateur) par une nouvelle technologie de fouille
de données.
En théorie, la plupart des méthodes de fouille de données devraient être heureuses avec de
grands ensembles de données. Les grands ensembles de données ont le potentiel de fournir des
informations plus précieuses. Si la fouille de données est une recherche à travers un espace de
possibilités, alors les grands ensembles de données suggèrent beaucoup plus de possibilités à
énumérer et à évaluer. Le potentiel d'augmentation de l'énumération et de la recherche est
contrebalancé par des limitations pratiques. Outre la complexité computationnelle des
algorithmes de fouille de données travaillant avec de grands ensembles de données, une
recherche plus exhaustive peut également augmenter le risque de trouver certaines solutions de
faible probabilité qui s'évaluent bien pour l'ensemble de données donné, mais qui peuvent ne
pas répondre aux attentes futures.
ENTREPÔTS DE DONNÉES

Bien que l'existence d'un entrepôt de données ne soit pas une condition préalable à la fouille de
données, dans la pratique, la tâche de la fouille de données, en particulier pour certaines grandes
entreprises, est grandement facilitée par l'accès à un entrepôt de données. Un objectif principal
d'un entrepôt de données est d'augmenter l'"intelligence" d'un processus de décision et la
connaissance des personnes impliquées dans ce processus. Par exemple, la capacité des
responsables marketing de produits à examiner plusieurs dimensions de la performance des
ventes d'un produit — par région, par type de ventes et par démographie des clients — peut
permettre de meilleures initiatives promotionnelles, une production accrue ou de nouvelles
décisions en matière d'inventaire et de distribution de produits. Il convient de noter que les
entreprises moyennes travaillent avec des moyennes. Les superstars se distinguent en prêtant
attention aux détails. Ils peuvent avoir besoin de découper les données de différentes manières
pour obtenir une compréhension plus approfondie de leur organisation et pour permettre des
améliorations possibles. Pour entreprendre ces processus, les utilisateurs doivent savoir quelles
données existent, où elles se trouvent et comment y accéder.
Un entrepôt de données signifie des choses différentes pour différentes personnes. Certaines
définitions se limitent aux données ; d'autres font référence aux personnes, aux processus, aux
logiciels, aux outils et aux données. Une des définitions globales est la suivante :
L'entrepôt de données est une collection de bases de données intégrées et orientées par sujet
conçues pour soutenir les fonctions de prise de décision (DSF), où chaque unité de données est
pertinente pour un certain moment dans le temps.
Sur la base de cette définition, un entrepôt de données peut être considéré comme le référentiel
d'une organisation de données, mis en place pour soutenir la prise de décision stratégique. La
fonction de l'entrepôt de données est de stocker les données historiques d'une organisation de
manière intégrée, reflétant les différents aspects de l'organisation et des affaires. Les données
dans un entrepôt ne sont jamais mises à jour mais utilisées uniquement pour répondre aux
requêtes des utilisateurs finaux qui sont généralement des décideurs. En général, les entrepôts
de données sont énormes, stockant des milliards d'enregistrements. Dans de nombreux cas, une
organisation peut avoir plusieurs entrepôts de données locaux ou départementaux souvent
appelés data marts. Un data mart est un entrepôt de données qui a été conçu pour répondre aux
besoins d'un groupe spécifique d'utilisateurs. Il peut être grand ou petit, en fonction du domaine
d'application.
À cette époque précoce de l'évolution des entrepôts de données, il n'est pas surprenant de
constater que de nombreux projets échouent en raison de la mécompréhension fondamentale
de ce qu'est un entrepôt de données. Ce qui est surprenant, c'est la taille et l'ampleur de ces
projets. De nombreuses entreprises commettent l'erreur de ne pas définir exactement ce qu'est
un entrepôt de données, les problèmes commerciaux qu'il résoudra et les utilisations auxquelles
il sera destiné. Deux aspects d'un entrepôt de données sont les plus importants pour une
meilleure compréhension de son processus de conception : le premier est les types spécifiques
(classification) de données stockées dans un entrepôt de données, et le second est l'ensemble de
transformations utilisées pour préparer les données dans leur forme finale de manière à ce
qu'elles soient utiles à la prise de décision.
Pour préparer les types de données dans un entrepôt de données, les types fondamentaux de
transformation des données sont normalisés. Il existe quatre principaux types de
transformations, et chacun a ses propres caractéristiques :

1. Transformations simples —
Ces transformations sont les éléments constitutifs de toutes les autres transformations plus
complexes. Cette catégorie comprend la manipulation de données axée sur un champ à la fois,
sans tenir compte de ses valeurs dans les champs associés. Des exemples incluent le changement
du type de données d'un champ ou le remplacement d'une valeur de champ encodée par une
valeur décodée.

2. Nettoyage et rectification —
Ces transformations garantissent un formatage et une utilisation cohérents d'un champ ou de
groupes de champs associés. Cela peut inclure un formatage approprié des informations
d'adresse, par exemple. Cette classe de transformations comprend également des vérifications
des valeurs valides dans un champ particulier, généralement en vérifiant la plage ou en
choisissant parmi une liste énumérée.
3. Intégration —
Il s'agit d'un processus consistant à prendre des données opérationnelles à partir d'une ou de
plusieurs sources et à les mapper, champ par champ, sur une nouvelle structure de données dans
l'entrepôt de données. Le problème de l'identifiant commun est l'un des problèmes d'intégration
les plus difficiles dans la construction d'un entrepôt de données. Essentiellement, cette situation
se produit lorsqu'il existe de multiples sources système pour les mêmes entités et qu'il n'y a pas
de moyen clair d'identifier ces entités comme étant les mêmes. C'est un problème difficile, et
dans de nombreux cas, il ne peut pas être résolu de manière automatisée. Il nécessite souvent
des algorithmes sophistiqués pour associer des correspondances probables. Un autre scénario
d'intégration de données complexe survient lorsqu'il existe de multiples sources pour le même
élément de données. En réalité, il est courant que certaines de ces valeurs soient contradictoires,
et résoudre un conflit n'est pas un processus direct. Tout aussi difficile que d'avoir des valeurs
contradictoires est de ne pas avoir de valeur pour un élément de données dans un entrepôt. Tous
ces problèmes et les solutions automatiques ou semi-automatiques correspondantes sont
toujours dépendants du domaine.

4. Agrégation et résumé —
Il s'agit de méthodes de condensation des instances de données trouvées dans l'environnement
opérationnel en moins d'instances dans l'environnement d'entrepôt. Bien que les termes
agrégation et résumé soient souvent utilisés de manière interchangeable dans la littérature, nous
pensons qu'ils ont légèrement des significations différentes dans le contexte de l'entrepôt de
données. Le résumé est une simple addition de valeurs le long d'une ou de plusieurs dimensions
de données, par exemple, l'addition des ventes quotidiennes pour produire les ventes
mensuelles. L'agrégation fait référence à l'addition de différents éléments commerciaux dans un
total commun ; elle est très dépendante du domaine. Par exemple, l'agrégation consiste à ajouter
les ventes quotidiennes de produits et les ventes mensuelles de conseil pour obtenir le total
mensuel combiné.
Ces transformations sont la principale raison pour laquelle nous préférons un entrepôt comme
source de données pour un processus de fouille de données. Si l'entrepôt de données est
disponible, la phase de prétraitement dans la fouille de données est significativement réduite,
voire parfois éliminée. N'oubliez pas que cette préparation des données est la phase la plus
chronophage. Bien que la mise en œuvre d'un entrepôt de données soit une tâche complexe,
décrite dans de nombreux manuels avec beaucoup de détails, dans ce texte, nous donnons
seulement les caractéristiques de base.
Un processus de développement d'entrepôt de données en trois étapes est résumé par les étapes
de base suivantes :

1. Modélisation —
En termes simples, comprendre les processus métier, les besoins en informations de ces
processus et les décisions qui sont actuellement prises dans ces processus.

2. Construction —
Établir des exigences pour les outils qui conviennent aux types de prise en charge de décision
nécessaires pour le processus métier ciblé ; créer un modèle de données qui aide à définir plus
précisément les besoins en informations ; et décomposer les problèmes en spécifications de
données et le magasin de données réel, qui, sous sa forme finale, représentera soit un data mart
soit un entrepôt de données plus complet.

3. Déploiement —
Mettre en œuvre, relativement tôt dans l'ensemble du processus, la nature des données à
entreposer et les divers outils d'intelligence d'affaires à utiliser ; et commencer par la formation
des utilisateurs. La phase de déploiement contient explicitement un moment pendant lequel les
utilisateurs explorent à la fois le référentiel (pour comprendre les données qui sont et doivent
être disponibles) et les premières versions du véritable entrepôt de données. Cela peut conduire
à une évolution de l'entrepôt de données, qui consiste à ajouter plus de données, à étendre les
périodes historiques ou à revenir à l'étape de construction pour étendre la portée de l'entrepôt
de données via un modèle de données.
La fouille de données représente l'une des principales applications pour les entrepôts de
données, puisque la seule fonction d'un entrepôt de données est de fournir des informations aux
utilisateurs finaux pour le soutien à la décision. Contrairement à d'autres outils de requête et
systèmes d'application, le processus de fouille de données fournit à un utilisateur final la capacité
d'extraire des informations cachées et non triviales. De telles informations, bien que plus difficiles
à extraire, peuvent offrir de plus grands avantages commerciaux et scientifiques et produire des
rendements plus élevés sur les investissements en "entrepôts de données et fouille de données".
En quoi la fouille de données diffère-t-elle des autres applications typiques d'un entrepôt de
données, telles que les langages de requête structurés (SQL) et les outils de traitement analytique
en ligne (OLAP), qui sont également appliqués aux entrepôts de données ? SQL est un langage de
base de données relationnelle standard qui est bon pour les requêtes imposant certains types de
contraintes sur les données de la base de données afin d'extraire une réponse. En revanche, les
méthodes de fouille de données sont bonnes pour les requêtes exploratoires, essayant d'extraire
des informations cachées, pas si évidentes. SQL est utile lorsque nous savons exactement ce que
nous cherchons et que nous pouvons le décrire formellement. Nous utiliserons des méthodes de
fouille de données lorsque nous ne savons que vaguement ce que nous cherchons. Par
conséquent, ces deux classes d'applications d'entrepôts de données sont complémentaires.

DU BIG DATA À LA SCIENCE DES DONNÉES

Nous vivons à l'ère du tsunami des données où une énorme quantité de données est
continuellement générée, chaque jour à une échelle croissante. Cette croissance exponentielle
des données potentiellement précieuses, amplifiée par Internet, les médias sociaux,
l'informatique en nuage, la variété des capteurs et les nouveaux types de dispositifs mobiles, est
souvent appelée Big Data. Des études récentes estiment une augmentation des données créées
annuellement passant d'environ 1,2 zettaoctet en 2010 à 40 zettaoctets en 2020. Si c'est un
nouveau concept pour le lecteur, cela signifie ce qui suit : 1 zettaoctet = 103 exaoctets = 106
pétaoctets. Les Big Data peuvent être principalement générées par cinq types principaux de
sources de données :
• Les données opérationnelles proviennent des systèmes transactionnels traditionnels, où
l'hypothèse est qu'elles incluent la surveillance des données en continu provenant souvent d'un
grand nombre de capteurs.
• Les données sombres sont une grande quantité de données que vous possédez déjà, mais que
vous n'utilisez pas dans les processus de décision actuels ; elles peuvent inclure des e-mails, des
contrats et divers rapports écrits.
• Les données commerciales sont disponibles sur le marché et peuvent être achetées auprès de
certaines entreprises, de médias sociaux spécialisés ou même d'organisations
gouvernementales.
• Les données sociales proviennent de Twitter, Facebook et d'autres médias sociaux généraux et
sont des exemples de la croissance rapide des données.
• Les données publiques telles que les données économiques, sociodémographiques.
Les Big Data pourraient être une nouvelle infrastructure pour les progrès de la recherche
médicale, la sécurité mondiale, les solutions de logistique et de transport, et l'identification des
activités terroristes et également pour faire face à des problèmes socio-économiques et
environnementaux. Mais en même temps, ils présentent de grands défis liés au stockage, à la
recherche, à la capture, à l'analyse, au partage et à la visualisation de données. Les entreprises,
les gouvernements et les universités investissent des sommes importantes pour relever ces défis,
pour en savoir plus sur Big Data, et pour former des scientifiques de données.
La science des données est un champ interdisciplinaire qui combine des outils et des techniques
de statistique, d'informatique et de visualisation pour gérer et analyser des ensembles de
données massifs et complexes afin d'en extraire des connaissances utiles. Les scientifiques de
données travaillent souvent avec des données brutes non structurées extraites de sources Big
Data et les transforment en données structurées utilisables. Ensuite, ils utilisent une variété de
techniques d'analyse de données, y compris l'apprentissage automatique et l'exploration de
données, pour découvrir des modèles, des tendances et des relations dans les données. Enfin, ils
communiquent leurs découvertes aux parties prenantes à l'aide de visualisations de données et
de rapports. La science des données joue un rôle crucial dans de nombreux domaines,
notamment la recherche médicale, les sciences sociales, la finance, le marketing, la logistique et
bien d'autres encore. Avec la croissance exponentielle des données dans le monde entier, la
demande de scientifiques de données qualifiés est en augmentation. De nombreuses universités
proposent maintenant des programmes de sciences des données à tous les niveaux d'études, du
premier cycle au doctorat.
En résumé, Big Data est un domaine en pleine croissance qui offre de nombreuses opportunités
passionnantes dans de nombreux domaines. La science des données est un outil essentiel pour
gérer et analyser les Big Data et extraire des connaissances utiles. Si vous êtes intéressé par les
Big Data et la science des données, il existe de nombreuses ressources disponibles pour vous
aider à en savoir plus et à développer vos compétences dans ce domaine passionnant.

Vous aimerez peut-être aussi