0% ont trouvé ce document utile (0 vote)
7 vues21 pages

Introduction au Big Data et ses enjeux

Le document présente une introduction au concept de Big Data, soulignant l'explosion de la quantité de données générées, principalement non structurées, et la nécessité de nouvelles technologies pour les traiter. Il décrit les trois V du Big Data (volume, variété, vélocité) ainsi que deux approches de traitement des données : le traitement par lots et le traitement de flux. Enfin, il évoque l'écosystème du Big Data, incluant divers outils et technologies pour le stockage, l'analyse et le traitement des données.

Transféré par

ahmedabdelkefi.123
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
7 vues21 pages

Introduction au Big Data et ses enjeux

Le document présente une introduction au concept de Big Data, soulignant l'explosion de la quantité de données générées, principalement non structurées, et la nécessité de nouvelles technologies pour les traiter. Il décrit les trois V du Big Data (volume, variété, vélocité) ainsi que deux approches de traitement des données : le traitement par lots et le traitement de flux. Enfin, il évoque l'écosystème du Big Data, incluant divers outils et technologies pour le stockage, l'analyse et le traitement des données.

Transféré par

ahmedabdelkefi.123
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Big Data

Chapitre 1: Introduc2on générale


Contexte
• Quantité de données générées
chaque minute

• Quelques chiffres étonnants…

Mohamed KOUBAA 2
Big Data, pourquoi?
• D’où vient ce concept du “big data”?
• Est-ce seulement le “pe2t” data qui est devenu “big”?
• Simplement plus de data?

• Quelques pistes:
• Explosion de la disponibilité des données
• Augmenta2on de la capacité de stockage
• Augmenta2on de la capacité d’analyse

Mohamed KOUBAA 3
Disponibilié des données
• La quantité de données digitales double tous les deux ans.
• En d’autres termes, on a produit autant de données digitales ces 2
dernières années que tout ce qui a été produit auparavant.

Mohamed KOUBAA 4
Disponibilié des données
• 90% des données générées sont non structurées
• Source:
• Capteurs u2lisés pour collecter les informa2ons clima2ques
• Messages sur les réseaux sociaux
• Images numériques et vidéos publiées en ligne
• Enregistrements transac2onnels d’achat en ligne
• Signaux GPS de téléphones mobiles
• …
• Données appellées Big Data ou données massives

Mohamed KOUBAA 5
Disponibilié des données

Mohamed KOUBAA 6
Capacité de stockage
• Entre 2000 et 2006, la
capacité des disques a
augmenté par 10x alors
que le prix par Gb a chuté
du même ra2o

• Une augmenta2on de
100x à prix constant

Mohamed KOUBAA 7
Capacité d’analyse
• La loi de moore en
ac2on depuis 35 ans

• Plus récemment, la
capacité d’analyse
augmente grâce à
l’ajout de coeurs dans
les unités centrales

Mohamed KOUBAA 8
Big Data, pourquoi?
• Augmenta2on exponen2elle de la quan2té de données non structurées
• Email, chat, blog, web, musique, photo, vidéo, etc.
• Augmenta2on de la capacité de stockage et d’analyse
• L’u2lisa2on de plusieurs machines en parallèle devient accessible
• Les technologies existantes ne sont pas conçues pour ingérer ces données
• Base de données rela2onnelles (tabulaires), mainframes, tableurs (Excel), etc.
• De “nouvelles” technologies et techniques d’analyse sont nécessaires
• “Google File System” - Google 2003
• “MapReduce: Simplified Data Processing on Large Clusters” - Google, 2004
• Hadoop: circa 2006
• D’où le“Big Data”: pas strictement plus de data...
Mohamed KOUBAA 9
Applica=ons
• Santé • Machine learning, Deep Learning
• Educa2on • Recommendation
• Mooc (Massive Open Online Course) • Netflix, Hopper
• Commerce de détail • Urbanisme
• Amazon, wallmart • Gouvernement
• Biologie • Média
• Génomique • Journalisme de données
• Science, recherche fondamentale • Fraude (détection/ prévention)

Mohamed KOUBAA 10
Big Data
• Défini2on:
“Le Big Data (ou méga données) représente les collec6ons de données
caractérisées par un volume, une vélocité et une variété si grands que
leurs transforma6ons en valeur u6lisable requiert l’u6lisa6on de
technologies et de méthodes analy6ques spécifiques”

Mohamed KOUBAA 11
Big Data 3V
• Volume :
• Quan2té de données (L’ordre des PO)
• Variété :
• Différents formats de données (Structurées: 20%
ou non structurées : 80%)
• Texte, CSV, XML, JSON, Binaires, BDR, etc ...
• Vélocité :
• Fréquence de l’arrivé des données
• Exemple : (Twiter)
Chaque seconde environ 5 900 tweets sont expédiés
sur le site de micro-blogging Twiuer. Cela représente
504 millions de tweets par jour ou 184 milliards par an.
Ceue masse d'informa2on vient alimenter le flot
d'informa2ons ("big data") publiée par l'humanité
chaque jour sur internet.
Mohamed KOUBAA 12
Big Data 5V
• Volume
• Variété
• Vélocité : Fréquence de l’arrivé des données
• Véracité
• Fiabilité et la crédibilité des données collectées
(Sources Fiable)
• Valeur
• Profit et connaissances que l’on peut extraire de
ces données
• Transformer les données en valeurs

Mohamed KOUBAA 13
Exemple de problème: Compagnie aérienne

Mohamed KOUBAA 14
Ordre de mesure de stockage
• 1 caractère => 1 octet Youa octet
• 1 Page de texte =>30 ko (1ko=1024 o)
• 1 Morceau de musique => 5Mo (1Mo=1024 ko)
Zeua octet
• 1 Film de 2H => 1Go (1Go=1024 Mo) Exa octet
• 6 Millions de Livres => 1 To (1To=1024 Go) Peta octet
• 2 Millard de Photos Rés Moyenne => 1 Po (1 Po=1024 To) Tera octet
• Toutes les infos produites jusqu’à 2003 => 5 ExaO
(1Eo=1024 Po) Giga octet
• Données produites en 2011 => 1,8 ZetaO (1Zo=1024 Eo) Mega octet
• En 2013 le plus grand data center au monde est capable kilo octet
de traiter 1 YouaO (1Yo=1024 Zo)
octet
bit

Mohamed KOUBAA 15
Besoins fonc=onnels
• Explosion de la quan2té de données générées par:
• Les applica2ons: réseaux sociaux, applica2ons web mobiles, objets
connectés, logs etc…
• Il est nécessaire de chercher les moyens qui permeuent:
• Transmeure et diffuser les données entre les appli distribuées
(Brokers : RabbitMQ, Ac2veMQ, Ka}a)
• Stocker et sécuriser les données d’une manière distribuée
(Hadoop HDFS, NoSQL : Cassandra, MongoDb, Hbase, Elas2c Search, etc..
• Traiter et Analyser les données d’une manière distribuée en vue d’en
extraire la connaissance pour des prises de décisions
• Big Data Processing : Batch Processing (Map Reduce, Spark) et Stream
Processing ) ( Spark, Ka}a Stream, Flink, Storm, Samza)
• Data Mining, Machines Learning (TensorFlow, DeepLearning4J, Weka,
etc...) pour l’extrac2on de la connaissance
• Analyser et Visualiser les indicateurs de prises de décisions
• Big Data visualisa2on Tools

Mohamed KOUBAA 16
Batch Processing/ Stream proceesing
• Batch Processing (Traitement par lots):
• Traitement de blocs de données déjà stockés sur une
période donnée.
• Par exemple, traiter toutes les transac2ons
effectuées par une entreprise financière en une
semaine.
• Ces données con2ennent des millions
d’enregistrements pour chaque jour pouvant être
stockés sous forme de fichiers textes (CSV) ou
d’enregistrements stockées dans HDFS, SGBD SQL,
NoSQL, etc.
• Exemple de Framework:
• MapReduce
• Spark

Mohamed KOUBAA 17
Batch Processing/ Stream proceesing
• StreamProcessing (Traitement de flux):
• Contrairement au traitement par lots où les
données sont liées avec un début et une fin
• Le Stream Processing est des2né au traitement de
flux de données sans fin arrivant en temps réel de
façon con2nue pendant des jours, des mois, des
années et à jamais.
• Le traitement de flux nous permet de traiter les
données en temps réel
• Le traitement de flux permet d'introduire des
données dans des ou2ls d'analyse dès qu’elles sont
générées et d'obtenir des résultats d'analyse
instantanés.

Mohamed KOUBAA 18
Batch Processing/ Stream proceesing
• Stream processing : 2 approches pour meure en
place un Framework Streaming:
• Na2ve Streaming (Real Time Processing)
• Chaque enregistrement entrant est traité dès
son arrivée, sans auendre les autres.
• Exemples: Storm, Flink, Ka}a Streams,
Samza.
• Micro Batch Processing (Micro Batching)
• Les enregistrements entrants toutes les
quelques secondes sont mis en lots, puis
traités en un seul mini-lot avec un délai de
quelques secondes.
• Exemples: Spark Streaming, Storm-Trident.

Mohamed KOUBAA 19
Ecosystème du Big Data
L’écosystème du Big data s’est élargi avec beaucoup d’ou2ls comme :
• Stream Processing :
• Apache Storm : Framework de calcul et de traitement distribué de flux de données (Stream Processing)
• Apache Flink : Framework de calcul et de traitement distribué de flux distribués (Stream Processing)
• Apache Spark : Framework de traitement distribué de données Big data (Alterna2ve de Map Reduce) et de Stream Processing
• Apache KaJa Streams : Plateforme de Streaming de données en temps réel entre les applica2ons distribuées et Système de Messagerie
applica2ve

• Apache Zookeeper : Système de de ges2on de configura2on des systèmes distribués pour assurer la coordina2on entre les nœuds.
• SQBD NoSQL :
• Apache Hbase : SGBD NoSQL, distribué (Stockage structuré pour les grandes tables)
• MangoDB : SGBD NoSQL (Not Only SQL) : Les données sont stockées d’une manière distribuée dans plusieurs nœuds sous forme de documents
au format JSON
• Cassandra : est un système de ges2on de base de données (SGBD) de type NoSQLconçu pour gérer des quan2tés massives de données sur un
grand nombre de serveurs, assurant une haute disponibilité en éliminant les point de défaillance unique
• ElasQcSearch : Moteur de recherche distribué et mul2-en2té à travers une interface REST.

• Hazelcast : Cache mémoire distribué, SGBD NoSQL en mémoire, Système de Messagerie applica2ve

Mohamed KOUBAA 20
Ecosystème du Big Data
• Apache Pig: Plateforme de haut niveau de créa2on d’applica2ons MapReduce
(Langage Pig La2n qui ressemble à SQL) au lieu d’écrire du code Java.
• Apache Hive: Infrastructure d’entrepot de données pour l’analyse et le requêtage
avec un langage proche de SQL
• Apache Phoenix: Moteur de Base de donnée rela2onnel qui repose sur Hbase
• Apache Impala: Moteur de requêtes SQL de cloudera pour un système basé sur
HDFS et Hbase
• Apache Flume : Système de collecte et d’analyse des fichiers logs
• Apache Sqoop: Ou2ls sur ligne de commandes pour transférer les données entre
les SGBD rela2onnels et Hadoop.
• Apache Oozie : ou2l d’ordonnancement des flux de Hadoop
Mohamed KOUBAA 21

Vous aimerez peut-être aussi