0% ont trouvé ce document utile (0 vote)
2 vues114 pages

Cours Big Data

Transféré par

Sarra Mrabti
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
2 vues114 pages

Cours Big Data

Transféré par

Sarra Mrabti
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

INTRODUCTION BIG DATA

M2 INAE/ SEMESTRE 1 Amdouni Hajer


2024-2025 ESSECT
1
PLAN
Partie 1
1. Introduction à Big data
2. Concepts importants du domaine big data
3. Bases de données vs informatique décisionnelle
4. Informatique décisionnelle vs big data

Partie 2

5. Framework Hadoop
6. Framework Spark

Partie 3
7. Web scraping
2
Partie 1
1. Introduction à Big data

3
1. Introduction à Big data
a. Notion Big data

• La notion de Big Data est un concept s’étant popularisé en 2012 pour traduire le fait que les entreprises
sont confrontées à des volumes de données à traiter de plus en plus considérables et présentant un fort
enjeux commercial et marketing.

• Ces Grosses Données en deviennent difficiles à travailler avec des outils classiques de gestion de base
de données.

• Il s’agit donc d’un ensemble de technologies, d’architecture, d’outils et de procédures permettant à une
organisation de très rapidement capter, traiter et analyser de larges quantités et contenus hétérogènes et
changeants, et d’en extraire les informations pertinentes à un coût accessible.

4
1. Introduction à Big data
a. Notion Big data

Afin de mieux comprendre le Big Data, IBM a inventé le système des quatre V. Ils représentent
les quatre dimensions du Big Data : Volume, Vélocité, Variété et Véracité.

5
1. Introduction à Big data
a. Notion Big data

Volume
Le fait que le Big Data représente un volume important de données n'a naturellement rien d'étonnant.
L'on estime que nous créons chaque jour 2,4 trillions de gigabits de données. Ce constat est
naturellement lié au gigantesque réseau de téléphonie mobile. Les messages SMS et WhatsApp, les
photos, les vidéos et les nombreuses applications contribuent à faire augmenter significativement le
Big Data.
Une telle croissance du volume de données entraîne également une augmentation des besoins en
nouveaux systèmes de gestion de bases de données et en personnel IT. L'on s'attend à ce que d'ici
deux ans, des millions de nouveaux emplois vont se créer dans le secteur de l'IT afin de faire face au
flux de Big Data.

6
1. Introduction à Big data
a. Notion Big data

Vélocité
La vélocité, ou vitesse, fait référence à l'énorme rapidité avec laquelle les données sont générées et
traitées. Jusqu'il y a quelques années, traiter les bonnes données et faire remonter à la surface les
bonnes informations prenait beaucoup de temps.

Aujourd'hui, les données sont disponibles en temps réel. Cela ne s'explique pas uniquement par la
vitesse de l'Internet, mais aussi par la présence du Big Data.

Plus nous créons des données, plus il nous faut de méthodes pour les analyser, ce qui augmente
parallèlement le nombre de données à observer.

7
1. Introduction à Big data
a. Notion Big data

Variété
La vitesse élevée et le volume important vont de pair avec la diversité de forme des données. En effet, les
solutions IT intelligentes sont aujourd'hui disponibles pour tous les secteurs, du milieu médical au milieu de
la construction en passant par celui de l'entreprise. par exemple dossiers médicaux électroniques dans le
domaine des soins de santé, qui représentent plusieurs milliards de gigabits de données. des vidéos
YouTube, des messages Facebook et des articles de blog. Lorsque, dans le futur, toutes les parties du
monde auront accès à l'Internet, la quantité et la variété des données ne feront qu'augmenter encore.

8
1. Introduction à Big data
a. Notion Big data

Véracité
L'authenticité du Big Data reste un obstacle. Les données sont rapidement obsolètes et de nombreuses
informations qui sont partagées via l'Internet et les réseaux sociaux ne sont pas forcément correctes.
Ainsi, de nombreux responsables et directeurs d’entreprise n'osent pas prendre de décision sur la base
du Big Data.

Organiser et valoriser les données adéquates donnent aux scientifiques de données et aux spécialistes
ICT énormément de travail. Il est très important qu'ils trouvent ici leurs repères. Lorsque le Big Data est
utilisé et organisé comme il se doit, il peut se révéler très précieux dans notre vie.

9
1. Introduction à Big data
a. Notion Big data

10
1. Introduction à Big data a. Notion Big data

11
1. Introduction à Big data
a. Notion Big data

Variabilité
La variabilité quand on parle de Big Data fait référence à plusieurs choses. Tout d’abord c’est le
nombre d’incohérences dans les données. Celles-ci doivent être détectées par des techniques de
détection d’anomalies et de valeurs aberrantes pour faciliter la creation d’analyse significative.
Les mégadonnées sont également variables en raison de la diversité de dimensions résultant de
multiples types et sources de données. La variabilité peut également faire référence à la vitesse
incohérente à laquelle les données volumineuses sont chargées dans votre base de données.

12
1. Introduction à Big data
a. Notion Big data

Visualisation
Une autre caractéristique du Big Data est la difficulté à les visualiser.
Les logiciels de visualisation de données volumineuses actuels sont confrontés à des problèmes techniques
en raison des limitations de la technologie en mémoire, de leur faible évolutivité, de leur fonctionnalité et de
leur temps de réponse. Il est impossible de vous fier aux graphiques traditionnels lorsque vous essayez de
tracer un milliard de points de données. Il est donc nécessaire d’avoir différentes manières de représenter
des données. Telles que la mise en cluster de données ou l’utilisation de cartes d’arbres, de sunbursts, de
coordonnées parallèles, de diagrammes de réseau circulaires ou de cônes.
Si on associe cela avec la multitude de composante résultant de la variété et de la vélocité des données
massives et des relations complexes qui les lient, il est possible de voir qu’il n’est pas si simple de créer une
visualisation significative.
13
1. Introduction à Big data
a. Notion Big data

Validité
Similaire à la véracité, la validité fait référence à la précision et à la correction des données pour
l’usage auquel elles sont destinées. Selon Forbes, environ 60% du temps d’un scientifique est
consacré au nettoyage de ses données avant de pouvoir effectuer une analyse. L’avantage de
l’analyse des données massives est aussi primordiale que celui des données sous-jacentes. Vous
devez donc avoir de bonnes pratiques. De gouvernance des données pour garantir une qualité des
données cohérente, des définitions communes et des métadonnées.

14
1. Introduction à Big data
a. Notion Big data

Volatilité
Quel âge doivent avoir vos données pour qu’elles soient considérées comme non pertinentes, historiques
ou obsolete? Combien de temps faut-il conserver les données? Avant l’ere big data, en general on
stockait les données indéfiniment. Quelques téraoctets de données ne pouvaient pas engendrer de
dépenses de stockage élevées.
En raison de la vitesse et du volume de ces données massives, leur volatilité doit être soigneusement
prise en compte. Il est maintenant fondamental d’établir des règles pour la disponibilité et à la mise à jour
des données afin de garantir une récupération rapide des informations en cas de besoin.

15
1. Introduction à Big data
a. Notion Big data

Vulnérabilité
Le Big Data apporte de nouveaux problèmes de sécurité. Après tout, une violation de données avec Big
Data est une grande violation. Est-ce que quelqu’un se souvient de l’infâme AshleyMadison en 2015?
Malheureusement, il y a quotidiennement des violations de données massives. Un exemple, rapporté par
CRN: en mai 2016, « un pirate informatique appelé Peace a posté des données sur le web sombre pour
les vendre, qui auraient inclus des informations sur 167 millions de comptes LinkedIn et … 360 millions
d’e-mails et de mots de passe pour les utilisateurs de MySpace ».

16
1. Introduction à Big data
a. Notion Big data

valeur
Dernier point, mais pas des moindre, est bien évidemment la Valeur. Les autres caractéristiques du Big
Data n’ont pas de sens si vous ne tirez pas de valeur commerciale de ces données.
Les Données massives offrent une valeur substantielle: comprendre mieux vos clients. Les cibler en
conséquence, optimiser les processus et améliorer les performances de la machine ou de l’entreprise.
Avant de vous lancer dans une stratégie Big Data, vous devez comprendre le potentiel et les
caractéristiques les plus difficiles.

17
a. Notion Big data
1. Introduction à Big data

18
1. Introduction à Big data
b. Exemples et applications en big data

Un bon traitement des données disponibles permet à n’importe quelle entreprise de :


•prendre les meilleures décisions commerciales ;
•avoir une meilleure connaissance du marché et de ses clients ;
•améliorer l’efficacité de l’ensemble de ses services (commerciaux, marketing, gestion des risques, etc.) ;
•anticiper les tendances des consommateurs ;
•fournir des produits ou des services sur mesure aux clients, etc.

19
1. Introduction à Big data
b. Exemples et applications en big data

La victoire d’Obama en 2012

Des jeunes informaticiens venus de Google et de Facebook…dans un projet data reposant sur 3 piliers :

1. Agrégation de données sociodémographiques et nominatives sur une base géographique


: disponibles dans le cadre du projet Open Data Gov ;

[Link]élations prédictive des votes en fonction de l'historique de résultats électifs précédents par
zone géographique : données aussi disponibles publiquement ;

3. Corrélations avec les sondages d'opinion et les études ad hoc réalisés afin de connaître les
thèmes de "bascule" propres à influencer le vote des électeurs indéterminés en fonction des zones
d'habitat.

20
1. Introduction à Big data
b. Exemples et applications en big data

La victoire d’Obama en 2012

En fonction de ce mash-up de données obtenu en interconnectant diverses sources et en les mettant en


relation avec à la clé la construction d’un algorithme ad hoc comportant des règles de filtrage territorial,
de scoring en fonction des profils de votants-habitants,

il devient plus facile aux militants de savoir exactement où et à qui s'adresser, dans quelle maison au
sein de quel quartier de tel état, avec quels revenus et quelles préoccupations prédominantes.

21
1. Introduction à Big data
b. Exemples et applications en big data

Banques et valeurs mobilières


•alerte précoce en cas de fraude aux titres,
•détection des fraudes à la carte,
•projection sur le risque de crédit,
•visibilité des transactions,
•transformation des données clients,
•analyse sociale pour les transactions, les opérations informatiques et la conformité aux politiques
informatiques.

Aux États-Unis, la Securities Exchange Commission (SEC) utilise le Big Data pour surveiller l’activité des
marchés financiers. Elle utilise actuellement l’analyse de réseau et les processeurs de langage naturel
pour détecter les activités commerciales illégales sur les marchés financiers.

22
1. Introduction à Big data
b. Exemples et applications en big data

Communications, médias et divertissement


•La collecte, l’analyse et l’utilisation des informations sur les consommateurs.
•Tirer parti du contenu des médias mobiles et sociaux
•Comprendre les modèles d’utilisation du contenu médiatique en temps réel
Les organisations de ce secteur analysent simultanément les données des clients et les données
comportementales pour créer des profils détaillés de clients qui peuvent être utilisés pour :
•Créer du contenu pour différents publics cibles,
•Recommander du contenu à la demande,
•Mesurer les performances du contenu.

23
1. Introduction à Big data
b. Exemples et applications en big data

L’Éducation
par exemple, l’Université de Tasmanie. Cette université australienne comptant plus de 26 000 étudiants a
déployé un système d’apprentissage et de gestion qui suit, entre autres, le moment où un étudiant se
connecte au système, le temps passé sur les différentes pages, ainsi que la progression globale d’un étudiant
dans le temps.

le Big Data dans l’Éducation est également utilisé pour mesurer l’efficacité des enseignants afin de garantir
une expérience agréable tant pour les élèves que pour les enseignants eux-même.

24
1. Introduction à Big data
b. Exemples et applications en big data

Fournisseurs de soins de santé


Certains hôpitaux utilisent les données collectées à partir d’une application mobile, provenant de
millions de patients, pour permettre aux médecins de mettre en place des soins basés sur des preuves
plutôt que d’administrer plusieurs tests médicaux/laboratoires à tous les patients qui se rendent à
l’hôpital. Une batterie de tests est efficace, mais elle est aussi très coûteuse.

25
1. Introduction à Big data
b. Exemples et applications en big data

Qui utilise le Big Data ?

Amazon
Amazon, société de commerce en ligne, fait partie de ces structures qui font appel au Big Data pour
orienter leur stratégie commerciale. Pour ce faire, elle stocke toutes les informations relatives à ses
clients afin de définir leurs parcours d’achat et de voir leurs préférences.
La data collectée est ensuite utilisée dans des algorithmes de publicité sur les réseaux sociaux,
par exemple. De la sorte, Amazon peut vous suggérer des produits en particulier, améliorer
l’expérience client ainsi que ses services.
En l’occurrence, vous avez peut-être déjà remarqué que si vous voulez ajouter un produit à votre
panier, Amazon vous recommande automatiquement d’autres produits liés ou vous propose des
suggestions d’éléments qui sont fréquemment achetés avec ce même produit.

En effet, Amazon utilise le Big Data pour générer des recommandations afin de faciliter les achats
immédiats de ses clients, tout en augmentant l’expérience d’achat dans sa globalité.

26
1. Introduction à Big data
b. Exemples et applications en big data

Apple

Le géant Apple fait partie des plus expérimentés en matière d’utilisation des technologies Big Data.
L’analyse des données disponibles lui permet de prendre de nombreuses décisions stratégiques. En
effet, cette data est utilisée par la structure afin d’envisager la meilleure approche à avoir auprès des
consommateurs concernant ses nouveaux produits ou services.
Apple se sert également du Big Data afin de concevoir ses applications. Par le traitement du Big Data,
Apple comprend comment les gens utilisent ses applications au quotidien et peut alors modifier les
conceptions à venir afin de s’adapter aux préférences des clients.
Autre exemple, si vous prenez la montre d’Apple, vous noterez qu’outre le fait d’être une montre et de
donner l’heure, elle est aussi capable de collecter les données de ses utilisateurs. Cette montre suit
l’ensemble de vos activités de la journée. Cette data sert inévitablement à l’entreprise, qui peut alors
mieux vous comprendre et améliorer ses services.

27
1. Introduction à Big data
b. Exemples et applications en big data

Google
Google se sert des mégadonnées afin de comprendre ce que ses utilisateurs attendent de la
marque. Pour ce faire, la société se base sur différents paramètres tels que l’historique de vos recherches,
vos emplacements, les tendances, et bien d’autres.
Google associe ces renseignements à différents algorithmes ou à des estimations plus complexes afin de
vous afficher des résultats de recherche les plus pertinents possible, de sorte à répondre parfaitement à vos
besoins.

28
1. Introduction à Big data
b. Exemples et applications en big data

Spotify
Spotify fait également partie de ces entreprises qui utilisent le Big Data. C’est d’ailleurs une société
entièrement axée sur les données. Spotify traite des informations telles que la durée de lecture des
chansons, l’endroit où elles sont diffusées ainsi que le type d’appareil utilisé afin de fournir à l’industrie
de la technologie musicale des données précieuses pour améliorer l’expérience des auditeurs.
En outre, Spotify a récemment développé Spotify for Artists afin de donner accès aux artistes à la data de
sorte qu’ils améliorent leur promotion et leur renommée. Enfin, Spotify utilise le Big Data pour comprendre
les goûts de ses utilisateurs, développer du contenu personnalisé et améliorer ses actions marketing par le
biais de publicités ciblées.

29
1. Introduction à Big data
b. Exemples et applications en big data

Facebook
Si Facebook est capable de vous rappeler les dates d’anniversaire ou les anniversaires d’amitié, ce n’est
pas un hasard. Au contraire, c’est grâce à son utilisation du Big Data que l’entreprise tend à constamment
améliorer l’expérience de ses utilisateurs.
Grâce à la data qu’elle traite, Facebook est, en effet, capable de créer de courtes vidéos qui regroupent
d’anciennes photos, par exemple. Et pour cause, la reconnaissance d’images est l’une des technologies
Big Data adoptées par Facebook. Ainsi, Facebook évalue chaque donnée et vous offre de meilleurs services
à chaque fois que vous vous connectez.

30
1. Introduction à Big data
b. Exemples et applications en big data

Instagram
Instagram utilise le Big Data afin de se développer continuellement. Grâce au travail du Big Data, qui
récolte vos informations, la société peut vous suggérer du contenu susceptible de vous plaire. Ce
n’est pas un hasard si vous voyez donc constamment le même type d’images.
Par un traitement très affiné du Big Data, l’entreprise est capable de comprendre vos goûts et de savoir
qui sont ses utilisateurs afin d’améliorer sa croissance.

31
1. Introduction à Big data
b. Exemples et applications en big data

Starbucks
Starbucks est une marque mondialement reconnue pour son café. Le Big Data lui est utile pour collecter
les informations d’un client lorsqu’il utilise son application mobile afin de passer une commande. En
fonction des éléments recueillis, et par un traitement efficace du Big Data, vous pouvez avoir des
propositions de produits personnalisés.
En outre, Starbucks se sert également du Big Data pour améliorer son menu en fonction des
préférences de ses clients. Ces données servent également à créer des campagnes marketing ciblées et
des promotions particulièrement appropriées. Grâce au Big Data, Starbucks est également capable de
sélectionner avec soin les meilleurs emplacements pour ses enseignes, ainsi que les futures mises à jour
de son menu.

32
1. Introduction à Big data
b. Exemples et applications en big data

Netflix
Netflix compte des millions d’abonnées. Grâce au Big Data, et au traitement des données de ses
clients, Netflix est capable de recommander des films à ses utilisateurs, en fonction de leurs
recherches antérieures. De ce fait, la quasi-totalité de l’activité du téléspectateur est basée sur
des suggestions personnalisées.

33
1. Introduction à Big data
b. Exemples et applications en big data

McDonalds
Enfin, McDonald’s, célèbre chaîne de restauration rapide, a également adopté la technologie Big Data.
Grâce au traitement des données, elle améliore l’expérience globale de ses clients. Lorsqu’un
utilisateur se sert de son application mobile afin de commander un repas, ses données sont stockées
et utilisées pour créer des recommandations, des offres ou des promotions ultra-personnalisées.
Grâce au Big Data, McDonald’s est aussi capable de prévoir le trafic en magasin, ses interactions
avec les clients, ainsi que les modèles de commande. La société est même capable de savoir à
quelle heure les clients sont les plus susceptibles de venir au Drive afin de maximiser le travail de ses
équipes en préparant les commandes à l’avance, notamment.

34
1. Introduction à Big data
b. Exemples et applications économiques en big data

35
ANALYSE DES COMPORTEMENTS DE
CONSOMMATION
Utilisation des données pour comprendre les habitudes d'achat
Exemples : cartes de fidélité, transactions en ligne, réseaux sociaux
PRÉVISION ÉCONOMIQUE
Amélioration des modèles économiques traditionnels
Utilisation des données en temps réel pour affiner les prévisions
ANALYSE DES MARCHÉS FINANCIERS
Utilisation par les banques et les investisseurs
Algorithmes pour détecter des motifs cachés
OPTIMISATION DES POLITIQUES PUBLIQUES
Utilisation des données pour concevoir et évaluer les politiques
Exemples : infrastructures de transport, impact des politiques sociales
ÉTUDES DE LA CONCURRENCE
Évaluation de la compétitivité sur les marchés
Surveillance des actions des concurrents
LUTTE CONTRE LA FRAUDE FISCALE
Détection des comportements frauduleux
Identification des incohérences et des modèles suspects
ANALYSE DES CHAÎNES D’APPROVISIONNEMENT
Optimisation des chaînes d'approvisionnement
Réduction des coûts et amélioration de l'efficacité
Partie 1
2. Concepts importants du domaine big data

43
1. Concepts importants du domaine big data
La Data Science

La Data Science est un terme que certains utilisent comme synonyme de Data Analytics, d’autres
considèrent que la Data Science, littéralement science de la donnée, regroupe l’analytique (Data
Analytics), l’apprentissage automatique (Machine Learning), l’exploration de données (Data
Mining), l’Intelligence Artificielle (IA) et tout un ensemble de méthodes mathématiques et
informatiques.

La Data Science consiste à mettre au point des séries d’algorithmes à partir de règles mathématiques
et statistiques (ou de Machine Learning) afin de délivrer des solutions. Ces techniques peuvent
s’appuyer sur l’analyse d’image, l’analyse de textes (text-mining), l’étude de corrélation entre capteurs,
etc.
Le lien entre les deux apparaît alors : afin d’analyser les amas de données, le Big Data repose sur les
algorithmes développés par la Data Science.

44
1. Concepts importants du domaine big data
Data Mining

Le terme Data Mining peut être traduit par forage de données. Le Data Mining consiste à forer, explorer
ou encore fouiller les données. Contrairement à l’analyse conventionnelle (Data Analytics) qui fournit des
informations uniquement à partir des éléments connus, le Data Mining permet d’établir des associations
et relations entre les données (on parle de patterns) qui sont cachées ou non évidentes, très souvent en
brassant de grands volumes de données réparties sur plusieurs bases de données relationnelles. Ces
patterns permettent d’obtenir des informations exploitables à la prise de décision.
Le Data Mining est un composant essentiel du Data Analytics avancé et du Big Data Analytics. Une des
formes du Data Mining est l’analyse prédictive.

45
1. Concepts importants du domaine big data
Data Warehouse, Datamart et Data Lake.

La multiplication des bases de données ainsi que le besoin croissant en analyse a poussé la création
des entrepôts de données (Data Warehouse en anglais) qui centralisent les données et facilitent leur
gestion.

Plutôt que de requêter sur les bases de données opérationnelles (risque de baisse de performance), on
applique les traitements d’analyse sur une base de données constituée et administrée dans cet objectif.
Les logiciels de BI qui intègre un Data Warehouse rendent ainsi possible l’accès libre à l’ensemble des
données.

Le Datamart est un sous-ensemble du Data Warehouse ; si le Data Warehouse est le référentiel central
de toutes les données, le Datamart adresse les besoins d’un groupe unique d’utilisateurs et est par
conséquent organisé pour la recherche de données selon un mode unique.
Le Data Lake (lac de données en français) est une forme de stockage propre au Big Data permettant
de stocker dans un lieu unique des données brutes ou très peu transformées et de natures variées
(données structurées, semi structurées et non structurées) et de permettre l’application de traitement
d’analytique Big Data.
46
1. Concepts importants du domaine big data
Le machine learning (ML)

Le machine learning (ML) est une forme d’intelligence artificielle (IA) qui est axée sur la création de
systèmes qui apprennent, ou améliorent leurs performances, en fonction des données qu’ils traitent.

L’intelligence artificielle est un terme large qui désigne des systèmes ou des machines simulant une
forme d'intelligence humaine.
Exemples d’applications:
• les banques, achet en ligne en utilisant les médias sociaux, des algorithmes de machine learning entrent en
jeu pour optimiser, fluidifier et sécuriser notre expérience.
• ciblage des clients avec la segmentation
• Le pouvoir de la prédiction dans différents domaines: gestion des stocks, maintenance

47
Partie 1
3. Bases de données vs
informatique décisionnelle

48
3. Bases de données vs informatique décisionnelle

Une base de données est une collection de données organisées. Par exemple, une base de données peut
regrouper toutes les informations sur les clients ou sur les transactions.

Une base de données est généralement associée à un système de gestion de base de données (SGBD)
qui est responsable du stockage et de la gestion des données.

• Microsoft Access
• Microsoft SQL Server
• MySQL
• Oracle Database
• MariaDB
• MySQL Workbench
• MongoDB
• PostgreSQL
49
3. Bases de données vs informatique décisionnelle

Les systèmes informatiques peuvent se subdiviser en deux. On retrouve le système transactionnel


OLTP et le système analytique OLAP.

OLAP
OLTP
le système OLAP est aussi appelé « système
L’OLTP est un traitement transactionnel en décisionnel ». Il est utilisé dans le pilotage de
ligne (anglais Online transaction processing) l’entreprise. Grâce à ce système, le chef
qui sert à effectuer des modifications d’entreprise dispose d’une vision transversale
d’informations en temps réel. de son entreprise.
L’objectif de l’utilisation d’un tel système est de
pouvoir insérer, et interpréter pour des besoins
divers, les données de la base de données, en
toute sécurité.

50
3. Bases de données vs informatique décisionnelle

OLTP et OLAP sont deux bases de données qui, on l’a vu, répondent à des objectifs et
des besoins bien définis. Dans le cas d’une utilisation quotidienne le chef d’entreprise,
va utiliser l’ OLTP pour répondre à la question « Nombre de vente du produit A » . Et
l’ OLAP, va permettre de croiser les données et répondra à la question « Nombre de
vente du produit A, par le vendeur B dans la région C et l’année N-2«

51
3. Bases de données vs informatique décisionnelle

Système d’Aide à la Décision (SAD)

Application informatique permettant d’aider dans le processus de prise de décision en vue de


résoudre des problèmes semi ou non structurés,

Différents système d’Aide à la Décision


• DSS (Decision support system), système d’aide à • ES (Expert system), système expert
la décision • KMS (knowledge Management systems), système à base
• ERP (Enterprise Resource Program), de connaissances
•CRM (Customer Relationship Management), gestion • EIS (Executive Information systems), Dashboard en
de la relation client français Système d’information pour dirigeant, tableau de
• SCM (Supply Chain Management), gestion de la bord électronique
chaîne d’approvisionnement

52
3. Bases de données vs informatique décisionnelle

La Business Intelligence (BI ) ou l’informatique décisionnelle: l’ensemble des technologies


permettant aux entreprises d’analyser les données au profit
de leurs prises de décisions.

En règle générale, les données de la BI sont stockées dans des data warehouses, ou des data marts.

→ dans ce cas on stocke que des données structurées

53
3. Bases de données vs informatique décisionnelle

BI c’est de nombreux algorithmes, souvent issus des statistiques et de l’Intelligence Artificielle, permettant d’extraire
des informations à partir de données brutes sont arrivés à maturité. Ces algorithmes sont regroupés dans des
logiciels de fouille de données (Data Mining) et permettent la recherche d’informations nouvelles ou cachées à
partir de données. • Le système informatique basé sur l’entrepôt de données est appelé Système d’Information
Décisionnel ou Système d’entrepôt de données. Il peut intégrer des TBE.

54
3. Bases de données vs informatique décisionnelle
Architecture d’un Système d’Information Décisionnel

55
1. Introduction à Big data

56
3. Bases de données vs informatique décisionnelle

Le reporting
le reporting est un rapport bien défini et simple d'analyse. Il rassemble les données
récupérées provenant de différentes sources de qualité. Dans un sens plus large, le
reporting de la Business Intelligence est aussi la présentation de ces données sous forme
simplifiée et la plus compréhensible possible pour vos collaborateurs.

57
1. Introduction à Big data

Tableau de bord électronique

TBE est un instrument d'aide à la décision qui mesure la performance afin de


mieux évaluer le chemin parcouru et le chemin restant à parcourir pour accéder
aux objectifs de performance.

58
3. Bases de données vs informatique décisionnelle

Tableau de bord

59
3. Bases de données vs informatique décisionnelle

Les tableaux de bord d’indicateur de performance clé

Les tableaux de bord d’indicateur de performance clé sont des outils qui regroupent les
sources de données et montrant les performances de votre entreprise par rapport à vos
indicateurs de performance clés (KPI) key performance indicator)

Exemples :
Efficacité du marketing
Service clientèle •Performances des mots-clés
•Score de satisfaction des clients •Temps moyen passé sur une page
•Coût par intervention •Taux de conversion
•Délai de première réponse •Score moyen des prospects
•Taux de fidélisation des clients •Taux de fréquentation du site web
•Temps de résolution moyen
60
1. Introduction à Big data

Modèles de tableau de bord


[Link]

[Link]

[Link]

61
3. Bases de données vs informatique décisionnelle

Documentation Microsoft Soft power bi

[Link]

Lien téléchargement power BI


Microsoft Power BI Desktop

[Link]

Application : Microsoft TP power BI

62
Partie 1
4. Informatique décisionnelle vs big data

63
4. Informatique décisionnelle vs big data

Bien que le Big Data et le Business intelligence soient deux


technologies utilisées pour analyser les données afin d’aider
les entreprises dans le processus décisionnel, il existe des
différences entre les deux. Ils diffèrent dans leur façon de
travailler autant que dans le type de données qu’ils analysent.

64
4. Informatique décisionnelle vs big data
Les principales différences entre BI et Big Data

BI Big data
Rôle livrer des rapports pertinents en allant collecter, intégrer et analyser une
chercher l’information directement à la quantité astronomique de données
source. hétérogènes en un temps record.

Sources les informations dans les équipements les données dans des environnements à
opérationnels de l’entreprise la fois internes et externes, ce qui rend
l’intégration plus complexe.

Type de des données internes à l’entreprise, aux des données à la fois structurées et non
données formats forcément moins variés. structurées, de différentes sources

65
4. Informatique décisionnelle vs big data
Les principales différences entre BI et Big Data

BI Big data
Utilisation des événements passés et s’appuie sur l’évolution des
des informations actuelles données pour prédire les
pour orienter les décisions tendances futures.
des managers
Stockage un serveur central un système de fichiers
Les informations sont distribués. La sauvegarde
placées dans un data se fait alors sur plusieurs
warehouse serveurs
66
4. Informatique décisionnelle vs big data

67
4. Informatique décisionnelle vs big data
Transformer la Business intelligence avec le Big Data

Face à une croissance impressionnante des données, les entreprises se


retrouvent face à un challenge technique de taille : continuer à valoriser les
data, tout en intégrant une quantité toujours plus grande d'informations.

La solution ? Réussir à concilier BI et Big Data.


Leur combinaison permet:
- d’augmenter les sources d’informations disponibles,
- de dépasser le cadre, souvent restreint, de l’organisation.
- Les entreprises ont par conséquent accès à un plus grand nombre
d’informations qui représentent de façon plus précise la réalité de leur
marché.
68
4. Informatique décisionnelle vs big data

L’installation de fonctionnalités Big Data sur les plateformes BI offre à


l’entreprise un reporting en temps réel. Un avantage considérable lorsqu’il s’agit
de réagir face à des anomalies de sécurité ou à un afflux de visiteurs sur votre
site web.

Conclusion

Les deux concepts possèdent donc des approches différentes mais


complémentaires : la technologie Big Data s’apparente à une extension naturelle
de la BI. L’occasion pour l'informatique décisionnelle de gagner en souplesse et
en efficacité.
69
Partie 2
5. Framework Hadoop

70
5. Hadoop

Big data manipule des milliers de nœuds et des pétaoctets de données


Un système de fichiers distribué permet le partage de fichiers à plusieurs clients au
travers du réseau informatique. Contrairement à un système de fichiers local.

Core Core Core Core Core

Local

Core Core Core Core Core Core

Distribué 71
5. Hadoop

High-Availability Distributedb Oject-Oriented Platform

• Hadoop est est la principale plateforme du Big Data.

Hadoop est une plateforme (framework) open source conçue pour stoker et
réaliser d'une façon distribuée des traitements sur des volumes de données
massives, de l'ordre de plusieurs pétaoctets.

72
5. Hadoop

 En 2004, Google publie un article présentant ses opérations analytiques sur un


grand cluster de serveurs, le MapReduce, ainsi que son système de fichier en
cluster: le projet Hadoop.
 En 2006, Yahoo avec le projet Nutch poursuit les premiers travaux de Google en
termes de traitement et de stockage de données distribuées.
 En 2008, Yahoo proposa Hadoop sous la forme d’un projet open source.
 En 2011, Hadoop en sa version 1.0.0
 En 2012, la communauté open source lance Hadoop 2.0
 2016, la version 3.0.0-alpha1 73
5. Hadoop

Hadoop est constitué de deux grandes parties :

– Distributed Programing Framework


– Hadoop Distibuted File System – HDFS : - MapReduce : destiné pour le traitement
destiné pour le stockage distribué des données distribué des données.
74
5. Hadoop
Les modules du framework Hadoop sont:

 Hadoop Distributed File System (HDFS) : un système de fichiers distribués qui permet de
stocker de très gros volumes de données sur un grand nombre de machines équipées de
matériel.

 Hadoop Common: il contient les bibliothèques et les utilitaires nécessaires aux autres modules
Hadoop.

 Hadoop YARN (Yet Another Resource Negociator): cette plateforme permet de gérer les
ressources informatiques du cluster et les utilise pour la planification des applications des
utilisateurs. Le YARN (Yet Another Resource Negotiator) permet de gérer les ressources pour
les processus effectués sur la plateforme
 Hadoop MapReduce: est un framework logiciel de traitement parallèle. Il regroupe deux étapes.
L’étape Map permet de récupérer des entrées pour les répartir en sous-problèmes plus petits et
les distribuer sur les autres nœuds. Par la suite, le nœud master combine les réponses à tous les
sous-problèmes pour produire un résultat. 75
5. Hadoop

Le HDFS permet de distribuer les données et de faire des traitements


performants sur ces données grâce au MapReduce en distribuant une opération
sur plusieurs nœuds afin de la paralléliser

Grâce au framework MapReduce, il permet de traiter les immenses quantités de


données. Plutôt que de devoir déplacer les données vers un réseau pour
procéder au traitement, MapReduce permet de déplacer directement le
logiciel de traitement vers les données.

76
5. Hadoop
Architecture HDFS

1. NameNode
2. Secondary
Namenode

Trois composants
majeurs :

3. Datanode

77
5. Hadoop
Architecture HDFS

• Une architecture de machines HDFS (aussi appelée cluster HDFS) repose


sur trois types de composants majeurs :

1─ NameNode (noeud de nom) : un service central (généralement appelé aussi


maître) qui s'occupe de gérer l'état du système de fichiers. Il maintient
l'arborescence du système de fichiers et les métadonnées de l'ensemble des
fichiers et répertoires d'un système Hadoop.

78
5. Hadoop

2- Secondary Namenode : Le Namenode dans l'architecture Hadoop est avant un point


unique de défaillance (Single Point of Failure en anglais). Maintenant Si ce service est arrêté, il
n'y a pas un moyen de pouvoir extraire les blocs d'un fichier donné. Son fonctionnement est
relativement simple puisque le Namenode secondaire vérifie périodiquement l'état du Namenode
principal et copie les métadonnées. Si le Namenode principal est indisponible, le Namenode
secondaire prend sa place.

3 – Datanode : contient les blocs de données appelés Workers. En effet, il stocke les blocs de
données lui-mêmes. Il y a un DataNode pour chaque machine au sein du cluster.

79
5. Hadoop

Présentation Map Reduce

Pour exécuter un problème large de manière distribuée, il faut pouvoir


découper le problème en plusieurs problèmes de taille réduite à exécuter sur
chaque machine du cluster (stratégie algorithmique dite du divide and conquer
/ diviser pour régner).

• MapReduce est un paradigme (un modèle) visant à généraliser les


approches existantes pour produire une approche unique applicable à tous
les problèmes.

80
5. Hadoop

MapReduce est un modèle de programmation popularisé par Google. Il est


principalement utilisé pour la manipulation et le traitement d’un nombre
important de données au sein d’un cluster de nœuds.
MapReduce consiste en deux fonctions map() et reduce().

81
5. Hadoop

MapReduce définit deux opérations distinctes à effectuer sur les données


d'entrée:

• La première, MAP, le nœud analyse un problème, le découpe en sous-


problèmes, et le délègue à d'autres nœuds (qui peuvent en faire de
même récursivement). Les sous-problèmes sont ensuite traités par les
différents nœuds à l'aide de la fonction Map qui à un couple (clé, valeur)
associe un ensemble de nouveaux couples (clé, valeur) :

• La seconde, REDUCE, va appliquer un traitement à toutes les valeurs de


chacune des clefs distinctes produite par l'opération MAP. où les nœuds les
plus bas font remonter leurs résultats au nœud parent qui les avait sollicités.
82
5. Hadoop

On distingue donc 4 étapes distinctes dans un traitement MapReduce:


• Découper (split) les données d'entrée en plusieurs fragments.
• Mapper chacun de ces fragments pour obtenir des couples (clef ; valeur).
• Grouper (shuffle) ces couples (clef ; valeur) par clef.
• Réduire (reduce) les groupes indexés par clef en une forme finale, avec une
valeur pour chacune des clefs distinctes.

83
5. Hadoop

84
5. Hadoop

85
Partie 2
6. Framework Spark

86
6. Framework Spark

Apache Spark est un framework de traitements Big Data open source construit
pour effectuer des analyses sophistiquées et conçu pour la rapidité et la facilité
d’utilisation. Celui-ci a originellement été développé par AMPLab, de
l’Université UC Berkeley, en 2009 et passé open source sous forme de projet
Apache en 2010.
Spark présente plusieurs avantages par rapport aux autres technologies big
data et MapReduce comme Hadoop.

87
6. Framework Spark

Spark propose un framework complet et unifié pour répondre aux besoins de


traitements Big Data pour divers jeux de données, divers par leur nature (texte,
graphe, etc.) aussi bien que par le type de source (batch ou flux temps-réel).
Ensuite, Spark permet à des applications sur clusters Hadoop d’être exécutées
jusqu’à 100 fois plus vite en mémoire, 10 fois plus vite sur disque.

88
6. Framework Spark

Cette performance extraordinaire lui vient des RDD, Resilient Distributed Datasets.

Resilient Distributed Dataset (Table Distribuée et Résiliente ou Jeu de données


résilient et distribué) est une abstraction distribuée en mémoire qui permet aux
développeurs d’effectuer des calculs parallèles en mémoire sur un cluster de
façon complètement tolérante aux pannes. Le RDD a été crée pour résoudre le
problème que pose les algorithmes itératifs et les calculs intéractifs au
MapReduce.

89
6. Framework Spark

Le RDD est une « collection » (au sens Scala du terme) d’éléments partitionnés
et répartis entre les nœuds du cluster et accessible uniquement en lecture-
seule.
Il agit comme une abstraction de partage de données dans un cluster.

90
6. Framework Spark

Hadoop vs Spark
La méthode utilisée par Spark pour traiter les données fait qu’il est beaucoup
plus rapide que MapReduce. Alors que MapReduce fonctionne en étapes,
Spark peut travailler sur la totalité des données en une seule fois. Spark
exécute la totalité des opérations d'analyse de données en mémoire et en
temps quasi réel : « Spark lit les données au niveau du cluster, effectue toutes
les opérations d’analyses nécessaires, écrit les résultats au niveau du cluster,
91
6. Framework Spark
Hadoop vs Spark

Hadoop comprend un composant Spark n’a pas de système de gestion


de stockage HDFS et un outil de de fichiers propre, ce qui veut dire qu’il
traitement appelé MapReduce. De faut lui associer un système de fichiers
fait, il n’est pas nécessaire de faire - soit HDFS, soit celui d’une autre plate-
appel à Spark pour traiter ses forme de données dans le cloud.
données Hadoop. Et inversement, il Le couplage Spark Hadoop, fonctionne
est possible d’utiliser Spark sans très bien
faire intervenir Hadoop. 92
6. Framework Spark

Hadoop vs Spark
Hadoop est résilient aux pannes ou aux défaillances du système, car
les données sont écrites sur le disque après chaque opération. Mais
Spark offre la même résilience intégrée du fait que les objets de
données sont stockés dans ce qu'on appelle des ensembles de
données distribués résilients (RDD) répartis sur le cluster de données.

93
6. Framework Spark

Spark
Un RDD est la représentation Spark d’un tableau de données. C’est une
collection d’éléments que l’on peut utiliser pour contenir des tuples, des
dictionnaires, des listes…

C’est elle qui rend possible la mise en cache de résultats intermédiaires


dans la RAM et la réalisation d’opérations en parallèle tout en tolérant de
potentielles erreurs sur le cluster, assurant donc la rapidité et la cohérence
des opérations.

94
6. Framework Spark

Spark Transformation et actions

On distingue deux types d’opérations avec Spark : les transformations et les actions.

Une transformation crée un nouveau dataset à partir d’un dataset existant.,


les données et les résultats des transformations restent sur leurs serveurs
respectifs.
Une action est une opération permettant à l’utilisateur de récupérer un
résultat. Une action est généralement effectuée à la suite de plusieurs
transformations et puisque qu’une action génère un résultat.
95
6. Framework Spark

Spark Les principales opérations

map : Applique une fonction à chaque élément de départ et crée un nouveau


dataset avec les résultats
filter : Applique une fonction à chaque élément de départ et crée un nouveau
dataset contenant uniquement les éléments pour lesquels la fonction a renvoyé
True
flatmap : Idem que map, mais la fonction appliquée peut renvoyer plusieurs
éléments en sortie pour un élément en entrée (ex. : texte en entrée, liste de
mots en sortie)
96
6. Framework Spark

Spark Les principales opérations


sample : Crée un dataset en sélectionnant aléatoirement une fraction des
éléments de départ
union : Réalise l’union de deux datasets (garde les éléments communs aux
deux datasets, en supprimant les doublons). Crée un nouveau dataset avec le
résultat de cette union
distinct : Crée un dataset en omettant les doublons parmi les éléments de
départ
groupByKey : Crée un dataset dans lequel les éléments de départ
partageant une valeur commune dans une colonne donnée sont regroupés
97
6. Framework Spark
Spark
Actions
reduce : Applique une fonction de réduction à un dataset, réduisant ce
dataset à une seule ligne (ex. : la somme des chiffres contenus dans les
colonnes du dataset). Cette fonction doit être associative et commutative !
collect : Permet simplement de lancer l’évaluation effective des
transformations en amont. Utile après une transformation filter par
exemple, si le résultat obtenu est suffisamment petit pour être stocké sur
une seule machine
count : Compte le nombre d’éléments dans le dataset
first : Renvoie le premier élément du dataset
98
6. Framework Spark

Spark
Actions
take : Renvoie les n premiers éléments du dataset, n étant un argument
takeSample : Renvoie n éléments sélectionnés aléatoirement dans le
dataset
saveAsTextFile : Sauvegarde le dataset sous forme de fichier texte
saveAsSequenceFile : Sauvegarde le dataset sous forme de fichier
Hadoop SequenceFile (cette option est plus restrictive quant au dataset
qu’il est possible de sauvegarder sous cette forme)
99
6. Framework Spark

Spark DataFrame vs Pandas DataFrame

Pandas DataFrame

Pandas est une bibliothèque Python open source basée sur la bibliothèque NumPy. Il s’agit d’un
package Python qui vous permet de manipuler des données numériques et des séries
chronologiques à l’aide d’une variété de structures de données et d’opérations..

Pandas DataFrame est une structure de données tabulaire bidimensionnelle à taille


variable potentiellement hétérogène avec des axes étiquetés (lignes et colonnes).
100
6. Framework Spark

Pandas DataFrame
Avantages :
Désavantages:
- manipuler des données telles que
La manipulation devient
l’indexation, le changement de nom, le complexe lorsque nous utilisons
tri, la fusion de trames de données. un énorme jeu de données.
Le temps de traitement peut
-La mise à jour, l’ajout et la suppression
être lent pendant la
de colonnes sont assez faciles avec
manipulation.
Pandas.
-manipuler plusieurs formats de fichiers
Le temps de traitement est trop élevé
en raison de la fonction intégrée.
101
6. Framework Spark

Étincelle DataFrame
Spark est un système de calcul en cluster. Comparé à d’autres systèmes
informatiques en cluster (tels que Hadoop), il est plus rapide. Il dispose d’API de
haut niveau Python, Scala et Java.
Dans Spark, écrire des tâches parallèles est simple.
Spark est le projet Apache le plus actif à l’heure actuelle, traitant un grand
nombre d’ensembles de données. Spark est écrit en Scala et fournit des API en
Python, Scala, Java et R.
102
6. Framework Spark

Étincelle DataFrame

Avantages : Désavantages:
Spark propose une API facile à utiliser pour  Pas de processus d’optimisation
l’exploitation d’un grand ensemble de données. automatique
Il prend non seulement en charge « MAP » et «  Très peu d’algorithmes.
réduire », l’apprentissage automatique (ML), les  Problème de petits fichiers
algorithmes de graphes, les données en continu,
les requests SQL, etc.
Spark utilise la mémoire (RAM) pour le calcul.
Il propose 80 opérateurs de haut niveau pour
développer des applications parallèles. 103
6. Framework Spark

Spark DataFrame vs Pandas DataFrame

Étincelle DataFrame Pandas DataFrame


Spark DataFrame prend en charge la parallélisation. Pandas DataFrame ne prend pas en charge la
parallélisation.
Spark DataFrame a plusieurs nodes. Pandas DataFrame a un node unique.
Il suit l’exécution différée, ce qui signifie qu’une tâche Il suit Eager Execution, ce qui signifie que la tâche est
n’est pas exécutée tant qu’une action n’est pas exécutée immédiatement.
effectuée.
Les opérations complexes sont difficiles à réaliser par Les opérations complexes sont plus faciles à effectuer
rapport à Pandas DataFrame. par rapport à Spark DataFrame.

104
6. Framework Spark

Spark DataFrame vs Pandas DataFrame

Étincelle DataFrame Pandas DataFrame


Spark DataFrame est distribué et, par conséquent, le Pandas DataFrame n’est pas distribué et, par
traitement dans Spark DataFrame est plus rapide conséquent, le traitement dans Pandas DataFrame
pour une grande quantité de données. sera plus lent pour une grande quantité de données.
Spark DataFrame assure la tolérance aux pannes. Pandas DataFrame n’assure pas la tolérance aux
pannes. Nous devons mettre en œuvre notre propre
cadre pour l’assurer.

105
Partie 2
7. Web Scraping

106
7. Web Scraping

Le Web scraping est utilisé pour une multitude de tâches. Il permet par ex. de récolter rapidement des
données de contact ou des informations spécifiques.

Dans le domaine professionnel, le Web scraping est souvent utilisé pour accéder à des avantages par
rapport à des concurrents.

Le harvesting de données permet à une société de consulter tous les produits d’un concurrent et de
les comparer avec ses propres produits.
107
7. Web Scraping
Le Web scraping est-il légal ?

Le scraping n’est pas toujours légal et les « scrapers » doivent tout d’abord respecter les droits
d’auteur des sites Internet.

Pour certaines boutiques en ligne et prestataires, le Web scraping a des conséquences très
négatives, par ex. lorsque le classement d’une page est affecté par des agrégateurs. Aussi n’est-il
pas rare de voir une entreprise poursuivre en justice un comparateur afin de mettre un terme au
Web scraping.

108
7. Web Scraping

Le scraping est donc légal lorsque les données extraites sont librement
accessibles par des tiers sur le Web.

Il faut:
•Consultez et respectez les droits d’auteur. Lorsque les données sont
protégées par des droits d’auteur, elles ne peuvent pas être publiées à un
autre endroit.
•Les exploitants de site Internet sont en droit d’installer des processus
techniques empêchant le Web scraping.
•Lorsque l’utilisation des données est liée à une connexion utilisateur ou à
un contrat d’utilisation, ces données ne doivent pas faire l’objet d’un Web
scraping.
109
7. Web Scraping
Comment bloquer le Web scraping ?

• Le fichier [Link] est par exemple utilisé pour bloquer les robots des
moteurs de recherche. empêcher le scraping automatique.
• Exemple [Link]
• Les adresses IP des robots peuvent également être bloquées. Il est
possible de masquer les coordonnées et les informations personnelles de
façon ciblée.

• renseigner les données sensibles telles que les numéros de


téléphone sous forme d’image ou de CSS ce qui complique le
scraping de données.
110
7. Web Scraping
Comment bloquer le Web scraping ?

• Par ailleurs, il existe de nombreux prestataires payants


fournissant des services anti-robot pouvant mettre en place un
pare-feu. Les Google Search Console permettent également de
mettre en place des notifications informant les exploitants de
sites Internet lorsque leurs données font l’objet d’un Web
scraping.

111
7. Web Scraping

L’extraction de données sur internet peut être réalisée de plusieurs


manières différentes, notamment par le biais d’APIs.

Les APIs permettent d’utiliser un service web sans passer par l’interface utilisateur,
simplement en codant. Les données sont souvent retournées sous forme d’un
JSON – données structurées.

Les APIs permettent de nombreuses choses comme interconnecter différents outils


et faire correspondre des données entre eux par exemple.

112
7. Web Scrapping

Il existe de nombreux cas d’usages aux APIs.

Cependant les APIs trouvent rapidement leurs limites.


En effet, les développeurs font souvent face à de fortes limitations en terme
d’usage ou même en terme de fonctionnalités.

le web scraping va permettre à un développeur d’utiliser un service, d’extraire des


données sans aucune limitation (sauf site très protégé).

113
7. Web Scraping

Web Scraping en utilisant Python : Un guide étape par étape

[Link]
etape-par-etape#

114

Vous aimerez peut-être aussi