Cours Big Data
Cours Big Data
Partie 2
5. Framework Hadoop
6. Framework Spark
Partie 3
7. Web scraping
2
Partie 1
1. Introduction à Big data
3
1. Introduction à Big data
a. Notion Big data
• La notion de Big Data est un concept s’étant popularisé en 2012 pour traduire le fait que les entreprises
sont confrontées à des volumes de données à traiter de plus en plus considérables et présentant un fort
enjeux commercial et marketing.
• Ces Grosses Données en deviennent difficiles à travailler avec des outils classiques de gestion de base
de données.
• Il s’agit donc d’un ensemble de technologies, d’architecture, d’outils et de procédures permettant à une
organisation de très rapidement capter, traiter et analyser de larges quantités et contenus hétérogènes et
changeants, et d’en extraire les informations pertinentes à un coût accessible.
4
1. Introduction à Big data
a. Notion Big data
Afin de mieux comprendre le Big Data, IBM a inventé le système des quatre V. Ils représentent
les quatre dimensions du Big Data : Volume, Vélocité, Variété et Véracité.
5
1. Introduction à Big data
a. Notion Big data
Volume
Le fait que le Big Data représente un volume important de données n'a naturellement rien d'étonnant.
L'on estime que nous créons chaque jour 2,4 trillions de gigabits de données. Ce constat est
naturellement lié au gigantesque réseau de téléphonie mobile. Les messages SMS et WhatsApp, les
photos, les vidéos et les nombreuses applications contribuent à faire augmenter significativement le
Big Data.
Une telle croissance du volume de données entraîne également une augmentation des besoins en
nouveaux systèmes de gestion de bases de données et en personnel IT. L'on s'attend à ce que d'ici
deux ans, des millions de nouveaux emplois vont se créer dans le secteur de l'IT afin de faire face au
flux de Big Data.
6
1. Introduction à Big data
a. Notion Big data
Vélocité
La vélocité, ou vitesse, fait référence à l'énorme rapidité avec laquelle les données sont générées et
traitées. Jusqu'il y a quelques années, traiter les bonnes données et faire remonter à la surface les
bonnes informations prenait beaucoup de temps.
Aujourd'hui, les données sont disponibles en temps réel. Cela ne s'explique pas uniquement par la
vitesse de l'Internet, mais aussi par la présence du Big Data.
Plus nous créons des données, plus il nous faut de méthodes pour les analyser, ce qui augmente
parallèlement le nombre de données à observer.
7
1. Introduction à Big data
a. Notion Big data
Variété
La vitesse élevée et le volume important vont de pair avec la diversité de forme des données. En effet, les
solutions IT intelligentes sont aujourd'hui disponibles pour tous les secteurs, du milieu médical au milieu de
la construction en passant par celui de l'entreprise. par exemple dossiers médicaux électroniques dans le
domaine des soins de santé, qui représentent plusieurs milliards de gigabits de données. des vidéos
YouTube, des messages Facebook et des articles de blog. Lorsque, dans le futur, toutes les parties du
monde auront accès à l'Internet, la quantité et la variété des données ne feront qu'augmenter encore.
8
1. Introduction à Big data
a. Notion Big data
Véracité
L'authenticité du Big Data reste un obstacle. Les données sont rapidement obsolètes et de nombreuses
informations qui sont partagées via l'Internet et les réseaux sociaux ne sont pas forcément correctes.
Ainsi, de nombreux responsables et directeurs d’entreprise n'osent pas prendre de décision sur la base
du Big Data.
Organiser et valoriser les données adéquates donnent aux scientifiques de données et aux spécialistes
ICT énormément de travail. Il est très important qu'ils trouvent ici leurs repères. Lorsque le Big Data est
utilisé et organisé comme il se doit, il peut se révéler très précieux dans notre vie.
9
1. Introduction à Big data
a. Notion Big data
10
1. Introduction à Big data a. Notion Big data
11
1. Introduction à Big data
a. Notion Big data
Variabilité
La variabilité quand on parle de Big Data fait référence à plusieurs choses. Tout d’abord c’est le
nombre d’incohérences dans les données. Celles-ci doivent être détectées par des techniques de
détection d’anomalies et de valeurs aberrantes pour faciliter la creation d’analyse significative.
Les mégadonnées sont également variables en raison de la diversité de dimensions résultant de
multiples types et sources de données. La variabilité peut également faire référence à la vitesse
incohérente à laquelle les données volumineuses sont chargées dans votre base de données.
12
1. Introduction à Big data
a. Notion Big data
Visualisation
Une autre caractéristique du Big Data est la difficulté à les visualiser.
Les logiciels de visualisation de données volumineuses actuels sont confrontés à des problèmes techniques
en raison des limitations de la technologie en mémoire, de leur faible évolutivité, de leur fonctionnalité et de
leur temps de réponse. Il est impossible de vous fier aux graphiques traditionnels lorsque vous essayez de
tracer un milliard de points de données. Il est donc nécessaire d’avoir différentes manières de représenter
des données. Telles que la mise en cluster de données ou l’utilisation de cartes d’arbres, de sunbursts, de
coordonnées parallèles, de diagrammes de réseau circulaires ou de cônes.
Si on associe cela avec la multitude de composante résultant de la variété et de la vélocité des données
massives et des relations complexes qui les lient, il est possible de voir qu’il n’est pas si simple de créer une
visualisation significative.
13
1. Introduction à Big data
a. Notion Big data
Validité
Similaire à la véracité, la validité fait référence à la précision et à la correction des données pour
l’usage auquel elles sont destinées. Selon Forbes, environ 60% du temps d’un scientifique est
consacré au nettoyage de ses données avant de pouvoir effectuer une analyse. L’avantage de
l’analyse des données massives est aussi primordiale que celui des données sous-jacentes. Vous
devez donc avoir de bonnes pratiques. De gouvernance des données pour garantir une qualité des
données cohérente, des définitions communes et des métadonnées.
14
1. Introduction à Big data
a. Notion Big data
Volatilité
Quel âge doivent avoir vos données pour qu’elles soient considérées comme non pertinentes, historiques
ou obsolete? Combien de temps faut-il conserver les données? Avant l’ere big data, en general on
stockait les données indéfiniment. Quelques téraoctets de données ne pouvaient pas engendrer de
dépenses de stockage élevées.
En raison de la vitesse et du volume de ces données massives, leur volatilité doit être soigneusement
prise en compte. Il est maintenant fondamental d’établir des règles pour la disponibilité et à la mise à jour
des données afin de garantir une récupération rapide des informations en cas de besoin.
15
1. Introduction à Big data
a. Notion Big data
Vulnérabilité
Le Big Data apporte de nouveaux problèmes de sécurité. Après tout, une violation de données avec Big
Data est une grande violation. Est-ce que quelqu’un se souvient de l’infâme AshleyMadison en 2015?
Malheureusement, il y a quotidiennement des violations de données massives. Un exemple, rapporté par
CRN: en mai 2016, « un pirate informatique appelé Peace a posté des données sur le web sombre pour
les vendre, qui auraient inclus des informations sur 167 millions de comptes LinkedIn et … 360 millions
d’e-mails et de mots de passe pour les utilisateurs de MySpace ».
16
1. Introduction à Big data
a. Notion Big data
valeur
Dernier point, mais pas des moindre, est bien évidemment la Valeur. Les autres caractéristiques du Big
Data n’ont pas de sens si vous ne tirez pas de valeur commerciale de ces données.
Les Données massives offrent une valeur substantielle: comprendre mieux vos clients. Les cibler en
conséquence, optimiser les processus et améliorer les performances de la machine ou de l’entreprise.
Avant de vous lancer dans une stratégie Big Data, vous devez comprendre le potentiel et les
caractéristiques les plus difficiles.
17
a. Notion Big data
1. Introduction à Big data
18
1. Introduction à Big data
b. Exemples et applications en big data
19
1. Introduction à Big data
b. Exemples et applications en big data
Des jeunes informaticiens venus de Google et de Facebook…dans un projet data reposant sur 3 piliers :
[Link]élations prédictive des votes en fonction de l'historique de résultats électifs précédents par
zone géographique : données aussi disponibles publiquement ;
3. Corrélations avec les sondages d'opinion et les études ad hoc réalisés afin de connaître les
thèmes de "bascule" propres à influencer le vote des électeurs indéterminés en fonction des zones
d'habitat.
20
1. Introduction à Big data
b. Exemples et applications en big data
il devient plus facile aux militants de savoir exactement où et à qui s'adresser, dans quelle maison au
sein de quel quartier de tel état, avec quels revenus et quelles préoccupations prédominantes.
21
1. Introduction à Big data
b. Exemples et applications en big data
Aux États-Unis, la Securities Exchange Commission (SEC) utilise le Big Data pour surveiller l’activité des
marchés financiers. Elle utilise actuellement l’analyse de réseau et les processeurs de langage naturel
pour détecter les activités commerciales illégales sur les marchés financiers.
22
1. Introduction à Big data
b. Exemples et applications en big data
23
1. Introduction à Big data
b. Exemples et applications en big data
L’Éducation
par exemple, l’Université de Tasmanie. Cette université australienne comptant plus de 26 000 étudiants a
déployé un système d’apprentissage et de gestion qui suit, entre autres, le moment où un étudiant se
connecte au système, le temps passé sur les différentes pages, ainsi que la progression globale d’un étudiant
dans le temps.
le Big Data dans l’Éducation est également utilisé pour mesurer l’efficacité des enseignants afin de garantir
une expérience agréable tant pour les élèves que pour les enseignants eux-même.
24
1. Introduction à Big data
b. Exemples et applications en big data
25
1. Introduction à Big data
b. Exemples et applications en big data
Amazon
Amazon, société de commerce en ligne, fait partie de ces structures qui font appel au Big Data pour
orienter leur stratégie commerciale. Pour ce faire, elle stocke toutes les informations relatives à ses
clients afin de définir leurs parcours d’achat et de voir leurs préférences.
La data collectée est ensuite utilisée dans des algorithmes de publicité sur les réseaux sociaux,
par exemple. De la sorte, Amazon peut vous suggérer des produits en particulier, améliorer
l’expérience client ainsi que ses services.
En l’occurrence, vous avez peut-être déjà remarqué que si vous voulez ajouter un produit à votre
panier, Amazon vous recommande automatiquement d’autres produits liés ou vous propose des
suggestions d’éléments qui sont fréquemment achetés avec ce même produit.
En effet, Amazon utilise le Big Data pour générer des recommandations afin de faciliter les achats
immédiats de ses clients, tout en augmentant l’expérience d’achat dans sa globalité.
26
1. Introduction à Big data
b. Exemples et applications en big data
Apple
Le géant Apple fait partie des plus expérimentés en matière d’utilisation des technologies Big Data.
L’analyse des données disponibles lui permet de prendre de nombreuses décisions stratégiques. En
effet, cette data est utilisée par la structure afin d’envisager la meilleure approche à avoir auprès des
consommateurs concernant ses nouveaux produits ou services.
Apple se sert également du Big Data afin de concevoir ses applications. Par le traitement du Big Data,
Apple comprend comment les gens utilisent ses applications au quotidien et peut alors modifier les
conceptions à venir afin de s’adapter aux préférences des clients.
Autre exemple, si vous prenez la montre d’Apple, vous noterez qu’outre le fait d’être une montre et de
donner l’heure, elle est aussi capable de collecter les données de ses utilisateurs. Cette montre suit
l’ensemble de vos activités de la journée. Cette data sert inévitablement à l’entreprise, qui peut alors
mieux vous comprendre et améliorer ses services.
27
1. Introduction à Big data
b. Exemples et applications en big data
Google
Google se sert des mégadonnées afin de comprendre ce que ses utilisateurs attendent de la
marque. Pour ce faire, la société se base sur différents paramètres tels que l’historique de vos recherches,
vos emplacements, les tendances, et bien d’autres.
Google associe ces renseignements à différents algorithmes ou à des estimations plus complexes afin de
vous afficher des résultats de recherche les plus pertinents possible, de sorte à répondre parfaitement à vos
besoins.
28
1. Introduction à Big data
b. Exemples et applications en big data
Spotify
Spotify fait également partie de ces entreprises qui utilisent le Big Data. C’est d’ailleurs une société
entièrement axée sur les données. Spotify traite des informations telles que la durée de lecture des
chansons, l’endroit où elles sont diffusées ainsi que le type d’appareil utilisé afin de fournir à l’industrie
de la technologie musicale des données précieuses pour améliorer l’expérience des auditeurs.
En outre, Spotify a récemment développé Spotify for Artists afin de donner accès aux artistes à la data de
sorte qu’ils améliorent leur promotion et leur renommée. Enfin, Spotify utilise le Big Data pour comprendre
les goûts de ses utilisateurs, développer du contenu personnalisé et améliorer ses actions marketing par le
biais de publicités ciblées.
29
1. Introduction à Big data
b. Exemples et applications en big data
Facebook
Si Facebook est capable de vous rappeler les dates d’anniversaire ou les anniversaires d’amitié, ce n’est
pas un hasard. Au contraire, c’est grâce à son utilisation du Big Data que l’entreprise tend à constamment
améliorer l’expérience de ses utilisateurs.
Grâce à la data qu’elle traite, Facebook est, en effet, capable de créer de courtes vidéos qui regroupent
d’anciennes photos, par exemple. Et pour cause, la reconnaissance d’images est l’une des technologies
Big Data adoptées par Facebook. Ainsi, Facebook évalue chaque donnée et vous offre de meilleurs services
à chaque fois que vous vous connectez.
30
1. Introduction à Big data
b. Exemples et applications en big data
Instagram
Instagram utilise le Big Data afin de se développer continuellement. Grâce au travail du Big Data, qui
récolte vos informations, la société peut vous suggérer du contenu susceptible de vous plaire. Ce
n’est pas un hasard si vous voyez donc constamment le même type d’images.
Par un traitement très affiné du Big Data, l’entreprise est capable de comprendre vos goûts et de savoir
qui sont ses utilisateurs afin d’améliorer sa croissance.
31
1. Introduction à Big data
b. Exemples et applications en big data
Starbucks
Starbucks est une marque mondialement reconnue pour son café. Le Big Data lui est utile pour collecter
les informations d’un client lorsqu’il utilise son application mobile afin de passer une commande. En
fonction des éléments recueillis, et par un traitement efficace du Big Data, vous pouvez avoir des
propositions de produits personnalisés.
En outre, Starbucks se sert également du Big Data pour améliorer son menu en fonction des
préférences de ses clients. Ces données servent également à créer des campagnes marketing ciblées et
des promotions particulièrement appropriées. Grâce au Big Data, Starbucks est également capable de
sélectionner avec soin les meilleurs emplacements pour ses enseignes, ainsi que les futures mises à jour
de son menu.
32
1. Introduction à Big data
b. Exemples et applications en big data
Netflix
Netflix compte des millions d’abonnées. Grâce au Big Data, et au traitement des données de ses
clients, Netflix est capable de recommander des films à ses utilisateurs, en fonction de leurs
recherches antérieures. De ce fait, la quasi-totalité de l’activité du téléspectateur est basée sur
des suggestions personnalisées.
33
1. Introduction à Big data
b. Exemples et applications en big data
McDonalds
Enfin, McDonald’s, célèbre chaîne de restauration rapide, a également adopté la technologie Big Data.
Grâce au traitement des données, elle améliore l’expérience globale de ses clients. Lorsqu’un
utilisateur se sert de son application mobile afin de commander un repas, ses données sont stockées
et utilisées pour créer des recommandations, des offres ou des promotions ultra-personnalisées.
Grâce au Big Data, McDonald’s est aussi capable de prévoir le trafic en magasin, ses interactions
avec les clients, ainsi que les modèles de commande. La société est même capable de savoir à
quelle heure les clients sont les plus susceptibles de venir au Drive afin de maximiser le travail de ses
équipes en préparant les commandes à l’avance, notamment.
34
1. Introduction à Big data
b. Exemples et applications économiques en big data
35
ANALYSE DES COMPORTEMENTS DE
CONSOMMATION
Utilisation des données pour comprendre les habitudes d'achat
Exemples : cartes de fidélité, transactions en ligne, réseaux sociaux
PRÉVISION ÉCONOMIQUE
Amélioration des modèles économiques traditionnels
Utilisation des données en temps réel pour affiner les prévisions
ANALYSE DES MARCHÉS FINANCIERS
Utilisation par les banques et les investisseurs
Algorithmes pour détecter des motifs cachés
OPTIMISATION DES POLITIQUES PUBLIQUES
Utilisation des données pour concevoir et évaluer les politiques
Exemples : infrastructures de transport, impact des politiques sociales
ÉTUDES DE LA CONCURRENCE
Évaluation de la compétitivité sur les marchés
Surveillance des actions des concurrents
LUTTE CONTRE LA FRAUDE FISCALE
Détection des comportements frauduleux
Identification des incohérences et des modèles suspects
ANALYSE DES CHAÎNES D’APPROVISIONNEMENT
Optimisation des chaînes d'approvisionnement
Réduction des coûts et amélioration de l'efficacité
Partie 1
2. Concepts importants du domaine big data
43
1. Concepts importants du domaine big data
La Data Science
La Data Science est un terme que certains utilisent comme synonyme de Data Analytics, d’autres
considèrent que la Data Science, littéralement science de la donnée, regroupe l’analytique (Data
Analytics), l’apprentissage automatique (Machine Learning), l’exploration de données (Data
Mining), l’Intelligence Artificielle (IA) et tout un ensemble de méthodes mathématiques et
informatiques.
La Data Science consiste à mettre au point des séries d’algorithmes à partir de règles mathématiques
et statistiques (ou de Machine Learning) afin de délivrer des solutions. Ces techniques peuvent
s’appuyer sur l’analyse d’image, l’analyse de textes (text-mining), l’étude de corrélation entre capteurs,
etc.
Le lien entre les deux apparaît alors : afin d’analyser les amas de données, le Big Data repose sur les
algorithmes développés par la Data Science.
44
1. Concepts importants du domaine big data
Data Mining
Le terme Data Mining peut être traduit par forage de données. Le Data Mining consiste à forer, explorer
ou encore fouiller les données. Contrairement à l’analyse conventionnelle (Data Analytics) qui fournit des
informations uniquement à partir des éléments connus, le Data Mining permet d’établir des associations
et relations entre les données (on parle de patterns) qui sont cachées ou non évidentes, très souvent en
brassant de grands volumes de données réparties sur plusieurs bases de données relationnelles. Ces
patterns permettent d’obtenir des informations exploitables à la prise de décision.
Le Data Mining est un composant essentiel du Data Analytics avancé et du Big Data Analytics. Une des
formes du Data Mining est l’analyse prédictive.
45
1. Concepts importants du domaine big data
Data Warehouse, Datamart et Data Lake.
La multiplication des bases de données ainsi que le besoin croissant en analyse a poussé la création
des entrepôts de données (Data Warehouse en anglais) qui centralisent les données et facilitent leur
gestion.
Plutôt que de requêter sur les bases de données opérationnelles (risque de baisse de performance), on
applique les traitements d’analyse sur une base de données constituée et administrée dans cet objectif.
Les logiciels de BI qui intègre un Data Warehouse rendent ainsi possible l’accès libre à l’ensemble des
données.
Le Datamart est un sous-ensemble du Data Warehouse ; si le Data Warehouse est le référentiel central
de toutes les données, le Datamart adresse les besoins d’un groupe unique d’utilisateurs et est par
conséquent organisé pour la recherche de données selon un mode unique.
Le Data Lake (lac de données en français) est une forme de stockage propre au Big Data permettant
de stocker dans un lieu unique des données brutes ou très peu transformées et de natures variées
(données structurées, semi structurées et non structurées) et de permettre l’application de traitement
d’analytique Big Data.
46
1. Concepts importants du domaine big data
Le machine learning (ML)
Le machine learning (ML) est une forme d’intelligence artificielle (IA) qui est axée sur la création de
systèmes qui apprennent, ou améliorent leurs performances, en fonction des données qu’ils traitent.
L’intelligence artificielle est un terme large qui désigne des systèmes ou des machines simulant une
forme d'intelligence humaine.
Exemples d’applications:
• les banques, achet en ligne en utilisant les médias sociaux, des algorithmes de machine learning entrent en
jeu pour optimiser, fluidifier et sécuriser notre expérience.
• ciblage des clients avec la segmentation
• Le pouvoir de la prédiction dans différents domaines: gestion des stocks, maintenance
47
Partie 1
3. Bases de données vs
informatique décisionnelle
48
3. Bases de données vs informatique décisionnelle
Une base de données est une collection de données organisées. Par exemple, une base de données peut
regrouper toutes les informations sur les clients ou sur les transactions.
Une base de données est généralement associée à un système de gestion de base de données (SGBD)
qui est responsable du stockage et de la gestion des données.
• Microsoft Access
• Microsoft SQL Server
• MySQL
• Oracle Database
• MariaDB
• MySQL Workbench
• MongoDB
• PostgreSQL
49
3. Bases de données vs informatique décisionnelle
OLAP
OLTP
le système OLAP est aussi appelé « système
L’OLTP est un traitement transactionnel en décisionnel ». Il est utilisé dans le pilotage de
ligne (anglais Online transaction processing) l’entreprise. Grâce à ce système, le chef
qui sert à effectuer des modifications d’entreprise dispose d’une vision transversale
d’informations en temps réel. de son entreprise.
L’objectif de l’utilisation d’un tel système est de
pouvoir insérer, et interpréter pour des besoins
divers, les données de la base de données, en
toute sécurité.
50
3. Bases de données vs informatique décisionnelle
OLTP et OLAP sont deux bases de données qui, on l’a vu, répondent à des objectifs et
des besoins bien définis. Dans le cas d’une utilisation quotidienne le chef d’entreprise,
va utiliser l’ OLTP pour répondre à la question « Nombre de vente du produit A » . Et
l’ OLAP, va permettre de croiser les données et répondra à la question « Nombre de
vente du produit A, par le vendeur B dans la région C et l’année N-2«
51
3. Bases de données vs informatique décisionnelle
52
3. Bases de données vs informatique décisionnelle
En règle générale, les données de la BI sont stockées dans des data warehouses, ou des data marts.
53
3. Bases de données vs informatique décisionnelle
BI c’est de nombreux algorithmes, souvent issus des statistiques et de l’Intelligence Artificielle, permettant d’extraire
des informations à partir de données brutes sont arrivés à maturité. Ces algorithmes sont regroupés dans des
logiciels de fouille de données (Data Mining) et permettent la recherche d’informations nouvelles ou cachées à
partir de données. • Le système informatique basé sur l’entrepôt de données est appelé Système d’Information
Décisionnel ou Système d’entrepôt de données. Il peut intégrer des TBE.
54
3. Bases de données vs informatique décisionnelle
Architecture d’un Système d’Information Décisionnel
55
1. Introduction à Big data
56
3. Bases de données vs informatique décisionnelle
Le reporting
le reporting est un rapport bien défini et simple d'analyse. Il rassemble les données
récupérées provenant de différentes sources de qualité. Dans un sens plus large, le
reporting de la Business Intelligence est aussi la présentation de ces données sous forme
simplifiée et la plus compréhensible possible pour vos collaborateurs.
57
1. Introduction à Big data
58
3. Bases de données vs informatique décisionnelle
Tableau de bord
59
3. Bases de données vs informatique décisionnelle
Les tableaux de bord d’indicateur de performance clé sont des outils qui regroupent les
sources de données et montrant les performances de votre entreprise par rapport à vos
indicateurs de performance clés (KPI) key performance indicator)
Exemples :
Efficacité du marketing
Service clientèle •Performances des mots-clés
•Score de satisfaction des clients •Temps moyen passé sur une page
•Coût par intervention •Taux de conversion
•Délai de première réponse •Score moyen des prospects
•Taux de fidélisation des clients •Taux de fréquentation du site web
•Temps de résolution moyen
60
1. Introduction à Big data
[Link]
[Link]
61
3. Bases de données vs informatique décisionnelle
[Link]
[Link]
62
Partie 1
4. Informatique décisionnelle vs big data
63
4. Informatique décisionnelle vs big data
64
4. Informatique décisionnelle vs big data
Les principales différences entre BI et Big Data
BI Big data
Rôle livrer des rapports pertinents en allant collecter, intégrer et analyser une
chercher l’information directement à la quantité astronomique de données
source. hétérogènes en un temps record.
Sources les informations dans les équipements les données dans des environnements à
opérationnels de l’entreprise la fois internes et externes, ce qui rend
l’intégration plus complexe.
Type de des données internes à l’entreprise, aux des données à la fois structurées et non
données formats forcément moins variés. structurées, de différentes sources
65
4. Informatique décisionnelle vs big data
Les principales différences entre BI et Big Data
BI Big data
Utilisation des événements passés et s’appuie sur l’évolution des
des informations actuelles données pour prédire les
pour orienter les décisions tendances futures.
des managers
Stockage un serveur central un système de fichiers
Les informations sont distribués. La sauvegarde
placées dans un data se fait alors sur plusieurs
warehouse serveurs
66
4. Informatique décisionnelle vs big data
67
4. Informatique décisionnelle vs big data
Transformer la Business intelligence avec le Big Data
Conclusion
70
5. Hadoop
Local
Distribué 71
5. Hadoop
Hadoop est une plateforme (framework) open source conçue pour stoker et
réaliser d'une façon distribuée des traitements sur des volumes de données
massives, de l'ordre de plusieurs pétaoctets.
72
5. Hadoop
Hadoop Distributed File System (HDFS) : un système de fichiers distribués qui permet de
stocker de très gros volumes de données sur un grand nombre de machines équipées de
matériel.
Hadoop Common: il contient les bibliothèques et les utilitaires nécessaires aux autres modules
Hadoop.
Hadoop YARN (Yet Another Resource Negociator): cette plateforme permet de gérer les
ressources informatiques du cluster et les utilise pour la planification des applications des
utilisateurs. Le YARN (Yet Another Resource Negotiator) permet de gérer les ressources pour
les processus effectués sur la plateforme
Hadoop MapReduce: est un framework logiciel de traitement parallèle. Il regroupe deux étapes.
L’étape Map permet de récupérer des entrées pour les répartir en sous-problèmes plus petits et
les distribuer sur les autres nœuds. Par la suite, le nœud master combine les réponses à tous les
sous-problèmes pour produire un résultat. 75
5. Hadoop
76
5. Hadoop
Architecture HDFS
1. NameNode
2. Secondary
Namenode
Trois composants
majeurs :
3. Datanode
77
5. Hadoop
Architecture HDFS
78
5. Hadoop
3 – Datanode : contient les blocs de données appelés Workers. En effet, il stocke les blocs de
données lui-mêmes. Il y a un DataNode pour chaque machine au sein du cluster.
79
5. Hadoop
80
5. Hadoop
81
5. Hadoop
83
5. Hadoop
84
5. Hadoop
85
Partie 2
6. Framework Spark
86
6. Framework Spark
Apache Spark est un framework de traitements Big Data open source construit
pour effectuer des analyses sophistiquées et conçu pour la rapidité et la facilité
d’utilisation. Celui-ci a originellement été développé par AMPLab, de
l’Université UC Berkeley, en 2009 et passé open source sous forme de projet
Apache en 2010.
Spark présente plusieurs avantages par rapport aux autres technologies big
data et MapReduce comme Hadoop.
87
6. Framework Spark
88
6. Framework Spark
Cette performance extraordinaire lui vient des RDD, Resilient Distributed Datasets.
89
6. Framework Spark
Le RDD est une « collection » (au sens Scala du terme) d’éléments partitionnés
et répartis entre les nœuds du cluster et accessible uniquement en lecture-
seule.
Il agit comme une abstraction de partage de données dans un cluster.
90
6. Framework Spark
Hadoop vs Spark
La méthode utilisée par Spark pour traiter les données fait qu’il est beaucoup
plus rapide que MapReduce. Alors que MapReduce fonctionne en étapes,
Spark peut travailler sur la totalité des données en une seule fois. Spark
exécute la totalité des opérations d'analyse de données en mémoire et en
temps quasi réel : « Spark lit les données au niveau du cluster, effectue toutes
les opérations d’analyses nécessaires, écrit les résultats au niveau du cluster,
91
6. Framework Spark
Hadoop vs Spark
Hadoop vs Spark
Hadoop est résilient aux pannes ou aux défaillances du système, car
les données sont écrites sur le disque après chaque opération. Mais
Spark offre la même résilience intégrée du fait que les objets de
données sont stockés dans ce qu'on appelle des ensembles de
données distribués résilients (RDD) répartis sur le cluster de données.
93
6. Framework Spark
Spark
Un RDD est la représentation Spark d’un tableau de données. C’est une
collection d’éléments que l’on peut utiliser pour contenir des tuples, des
dictionnaires, des listes…
94
6. Framework Spark
On distingue deux types d’opérations avec Spark : les transformations et les actions.
Spark
Actions
take : Renvoie les n premiers éléments du dataset, n étant un argument
takeSample : Renvoie n éléments sélectionnés aléatoirement dans le
dataset
saveAsTextFile : Sauvegarde le dataset sous forme de fichier texte
saveAsSequenceFile : Sauvegarde le dataset sous forme de fichier
Hadoop SequenceFile (cette option est plus restrictive quant au dataset
qu’il est possible de sauvegarder sous cette forme)
99
6. Framework Spark
Pandas DataFrame
Pandas est une bibliothèque Python open source basée sur la bibliothèque NumPy. Il s’agit d’un
package Python qui vous permet de manipuler des données numériques et des séries
chronologiques à l’aide d’une variété de structures de données et d’opérations..
Pandas DataFrame
Avantages :
Désavantages:
- manipuler des données telles que
La manipulation devient
l’indexation, le changement de nom, le complexe lorsque nous utilisons
tri, la fusion de trames de données. un énorme jeu de données.
Le temps de traitement peut
-La mise à jour, l’ajout et la suppression
être lent pendant la
de colonnes sont assez faciles avec
manipulation.
Pandas.
-manipuler plusieurs formats de fichiers
Le temps de traitement est trop élevé
en raison de la fonction intégrée.
101
6. Framework Spark
Étincelle DataFrame
Spark est un système de calcul en cluster. Comparé à d’autres systèmes
informatiques en cluster (tels que Hadoop), il est plus rapide. Il dispose d’API de
haut niveau Python, Scala et Java.
Dans Spark, écrire des tâches parallèles est simple.
Spark est le projet Apache le plus actif à l’heure actuelle, traitant un grand
nombre d’ensembles de données. Spark est écrit en Scala et fournit des API en
Python, Scala, Java et R.
102
6. Framework Spark
Étincelle DataFrame
Avantages : Désavantages:
Spark propose une API facile à utiliser pour Pas de processus d’optimisation
l’exploitation d’un grand ensemble de données. automatique
Il prend non seulement en charge « MAP » et « Très peu d’algorithmes.
réduire », l’apprentissage automatique (ML), les Problème de petits fichiers
algorithmes de graphes, les données en continu,
les requests SQL, etc.
Spark utilise la mémoire (RAM) pour le calcul.
Il propose 80 opérateurs de haut niveau pour
développer des applications parallèles. 103
6. Framework Spark
104
6. Framework Spark
105
Partie 2
7. Web Scraping
106
7. Web Scraping
Le Web scraping est utilisé pour une multitude de tâches. Il permet par ex. de récolter rapidement des
données de contact ou des informations spécifiques.
Dans le domaine professionnel, le Web scraping est souvent utilisé pour accéder à des avantages par
rapport à des concurrents.
Le harvesting de données permet à une société de consulter tous les produits d’un concurrent et de
les comparer avec ses propres produits.
107
7. Web Scraping
Le Web scraping est-il légal ?
Le scraping n’est pas toujours légal et les « scrapers » doivent tout d’abord respecter les droits
d’auteur des sites Internet.
Pour certaines boutiques en ligne et prestataires, le Web scraping a des conséquences très
négatives, par ex. lorsque le classement d’une page est affecté par des agrégateurs. Aussi n’est-il
pas rare de voir une entreprise poursuivre en justice un comparateur afin de mettre un terme au
Web scraping.
108
7. Web Scraping
Le scraping est donc légal lorsque les données extraites sont librement
accessibles par des tiers sur le Web.
Il faut:
•Consultez et respectez les droits d’auteur. Lorsque les données sont
protégées par des droits d’auteur, elles ne peuvent pas être publiées à un
autre endroit.
•Les exploitants de site Internet sont en droit d’installer des processus
techniques empêchant le Web scraping.
•Lorsque l’utilisation des données est liée à une connexion utilisateur ou à
un contrat d’utilisation, ces données ne doivent pas faire l’objet d’un Web
scraping.
109
7. Web Scraping
Comment bloquer le Web scraping ?
• Le fichier [Link] est par exemple utilisé pour bloquer les robots des
moteurs de recherche. empêcher le scraping automatique.
• Exemple [Link]
• Les adresses IP des robots peuvent également être bloquées. Il est
possible de masquer les coordonnées et les informations personnelles de
façon ciblée.
111
7. Web Scraping
Les APIs permettent d’utiliser un service web sans passer par l’interface utilisateur,
simplement en codant. Les données sont souvent retournées sous forme d’un
JSON – données structurées.
112
7. Web Scrapping
113
7. Web Scraping
[Link]
etape-par-etape#
114