上海复旦大学
Hmida HMIDA 25 septembre 2023
2
Définitions
Data Analysis/Analytics
Wikipedia
“... the process of inspecting, cleaning, transforming, and modeling data with the goal of
discovering useful information, suggesting conclusions, and supporting decision-
making.”
Big Data
Oxford
“setsof information that are too large or too complex to handle, analyse or use with
standard methods”
Gartner
“Big data is high-volume, high-velocity and high-variety information assets that demand
cost-effective, innovative forms of information processing for enhanced insight and
decision making.”
3
Data Analytics
Inspection, nettoyage, transformation et
modélisation des données
Découverte d’informations pertinentes
Aide à la décision
4
Pourquoi maintenant ?
Explosion du volume de données
“Between the dawn of civilization and 2003, we only created five exabytes of information;
now we’re creating that amount every two days.” (E. Schmidt Google)
Chaque jour, nous générons 2,5 trillions d’octets de données
90% des données dans le monde ont été créées au cours des deux dernières années
90% des données générées sont non structurées
Source:
Capteurs utilisés pour collecter les informations climatiques
Messages sur les médias sociaux
Images numériques et vidéos publiées en ligne
Enregistrements transactionnels d’achat en ligne
Signaux GPS de téléphones mobiles
Données appelées Big Data ou Données Massives
5
[Link]
6
Big Data Vs (IBM)
7
Données et Big Data
Types
Modèles
Flat
Relationnel
NoSQL : Document, Clé/Valeur, Colonnes, Graphe
8
Données et Big Data (2)
Données au repos (Data at Rest)
Données stockées dans un emplacement physique tel que le disque dur d'un
serveur ou dans un data center
Suit le flux d'analyse des données classique : Stocker > Analyser > Notifier >
Agir
Données en mouvement (Data in Motion)
Données dynamiques nécessitant un traitement en temps réel sans lequel
elles deviennent inutiles ou obsolètes
L'analyse et l'action doivent avoir lieu rapidement ou il est trop tard
Le flux d'analyse des données est le suivant : Analyser > Agir > Notifier >
Stocker
9
Défis
Stocker ce volume de données dans les ressources disponibles ?
Accéder aux données rapidement ?
Combiner les différents formats ?
Traiter ces données d'une manière performante, tolérante aux pannes et
flexible ?
Extraire les connaissances de façon interactive et rentable ?
Besoins :
Utilisation efficace des ressources
Plus de ressources :
CPU, RAM, Storage, Network
10
Approche traditionnelle
Les besoins métier guident la conception de la solution
Le responsable métier définit les besoins
: Quelles questions doit-on poser?
De nouvelles
exigences nécessitent
une nouvelle IT conçoit une solution avec
un ensemble de structures
conception et
et fonctionnalités
construction
Le responsable métier exécute les
requêtes pour répondre aux questions
– encore et encore
11
Approche Big Data
Les sources d’information guident la découverte créative
Le responsable métier et IT
identifient les sources de données
disponibles
De nouvelles idées
conduisent à l’intégration
de technologies
traditionnelles
Le responsable métier détermine les
questions à poser en explorant les
données et relations entre elles IT fournit une plateforme
qui permet une
exploration créative de
toutes les
données disponibles
12
Big Data Analytics
Knowledge - Wisdom -
Data - Données Information
Connaissance Décision
Processus d'analyse des données
Collecte des données : processus de localisation des données,
puis d'évaluation de leur volume au regard du volume requis
pour l'analyse.
Préparation des données : étape pouvant comprendre de
nombreuses tâches destinées à convertir les données dans
un format compatible avec l'outil d'analyse.
Sélection d'un modèle : étape incluant le choix d'une
technique d'analyse propre à apporter les réponses les plus
probantes compte tenu des données disponibles.
Analyse des données : processus consistant à appliquer le
modèle d'analyse aux données et à déterminer si ce modèle
et si les données analysées sont fiables. Avez-vous pu
répondre à la question avec l'outil sélectionné ?
Présentation des résultats : processus consistant à
communiquer les résultats aux décideurs.
Prise de décision : les responsables de l'entreprise modifient
leur stratégie globale en fonction des informations obtenues.
Le processus recommence à zéro avec la collecte des
données.
14
CRISP-DM
15
CRISP-DM (2)
Business understanding Data understanding Data preparation Modeling Evaluation
Root mean squared
Regression
Start Explore error (RMSE)
data No Linear regression Mean squared error
Collect data Positive probability
Yes
statistics
Understand the ...
Feature description
business background
Logistic regression Inter-cluster
and assess
requirements. Distribution feature KNN algorithm difference
Classification
Naive Bayes Intra-cluster similarity
Structural analysis
No Yes SVM algorithm Business compliance
Are the
..
Build a model
requirements ... Decision tree
specified?
Neural network Support
Clean
Confidence
data ...
Convert data ...
Clustering
K-means algorithm RMSE
Yes Hierarchical clustering Mean squared error
No Are the
... Positive probability
requirements
statistics
met?
...
Association
FP-growth
Apriori
... Apply analysis
results
16
Big Data Analytics vs BI
17
Intégration des approches
18
Domaines d’application
19
Applications
- Calculer le temps d’arrivée
- Utilise les conditions du traffic pendant une fenêtre de temps
- Prédiction des achats en se basant sur l’historique des clients
- Les clics, l’ajout au panier
- Anticiper la livraison
- Recommandation de produits
- Recommandation de films
- Analyser les données climatiques archivées
- Prédire le temps
20
Applications (2)
- Analyse des conversation sur les réseaux sociaux au moment du
lancement du Iphone 5 en 2012
- Lancement du Galaxy S3 en 2013 (Best Smartphone award)
- Coupe du monde 2014
- Capteurs dans le protège-tibia
- Analyse du comportement des joueurs
- Simulation de situations de jeu
- Blue C.R.U.S.H. (Crime Reduction Utilizing Statistical History)
- Il s’agit d’envoyer les policiers dans les « hot spots »
- le nombre de meurtres et de cambriolages a diminué de 36% à Memphis.
- Le vol de véhicules motorisés a chuté de 55% !
21
Data Science – Data Scientist
Science de données
Englobe les activités, outils et méthodes qui permettent d’exploiter les
données dans tous les domaines (science, médecine, marketing …)
Data Scientist :
On associe trois compétences fortes chez un data scientist :
les méthodes mathématiques et statistiques,
la programmation,
la compréhension des enjeux métier.
On distingue deux catégories de data scientists :
Data Architect : définir la plateforme technique et les solutions logicielles adaptées.
Data Analyst : prendront la suite en appliquant des algorithmes prédictifs
22
Outils et frameworks
Outils Ingestion and Storage
Estuary
Processing Nifi
Batch Kafka
• Hadoop Kudu
Stream Parquet
• Spark ML
• Strom Spark MLlib
• Flink Tensorflow
Querying Singa
Hive DataViz
Kibana
Presto
Grafana
Kylin
Observable
GraphQL Tableau
23
Outils et frameworks
Plateformes Cloud
GCP, MS Azure, AWS, Oracle
Cloudera
Databricks
Qubole
Alteryx
24
Big Data and AI Landscape
[Link]
25
Objectifs et plan
Analyser et manipuler différents types de données :
Multi dimensionnelle
Graphe
Structurée ou non
Utiliser plusieurs modèles de calcul/traitement :
MapReduce
Streams / online algorithms
Exploiter les frameworks Big Data :
Hadoop
Spark
26
Objectifs et plan
Résoudre des problèmes réels :
Systèmes de recommandations
Détection de Spams
Détection de fraudes
Connaître des algorithmes pour l’analyse de données :
Apprentissage supervisé
Programmation Dynamique
Hashing
27
Sources et Bibliographie
Cours :
Cours de Big Data, Stéphane Vialle, Centrale Supélec
Cours de Big Data, Lilia Sfaxi, INSAT
Technologies pour le Big Data, Minyar Sassi Hidri, ENIT
Livres :
Big Data Analytics, David Loshim (2013)
Practical Big Data Analytics, Nataraj Dasgupta (2018)
Web :
[Link]
[Link]