Le big data ou les données massives, désigne les ressources d'informations dont les
caractéristiques en termes de volume, de vélocité et de variété imposent
l’utilisation de technologies et de méthodes analytiques particulières pour créer
de la valeur.
les 3 V du big data :
Volume : La masse de données générées par les entreprises et les personnes augmente
chaque jour de façon exponentielle. L'unité pour la mesurer
est progressivement passée du pétaoctet (1015 octets) à l'exaoctet (1018 octets)
puis au zettaoctet (1021 octets).
Vélocité : Plus nombreuses, les données sont aussi créées selon des fréquences de
plus en plus réduites. Pour ne pas perdre de leur valeur,
elles doivent être collectées et partagées au plus vite. Pour répondre à ce défi,
la puissance de calcul et les outils d'analyse du big data
permettent de tendre vers la notion de temps réel.
( rapidité des données qui sont crées, analysées et utilisées)
Variété : Textes, photos, vidéos, données IoT, fichiers de logs, flux de réseaux
sociaux… Les données collectées sont de nature très variée.
Les outils d’indexation et de traitement du big data doivent prendre cette grande
diversité de données structurées et non structurées.
les données structurées : CSV / excel / word
les données semi-structurées : json / xml
les données non structurées : vidéo / image / audio
------------------------------------------------------
modele de données structurées : relation ( données relationnelles)
=> schéma
=> chaque relation a un schéma définissant les types de ses colonnes
trés couteux
----------------------------------
modele de données semi- structurées ( on definit les schemas ultierement ): les
fichiers log, les fichier JSON ...
-----------------------------
modele de données non structurées ( pas de schéma ): une seule colonne de type
binaire ou chaine de caracteres
les données fama eli sous forme de graph eli houma akther données complexes
yesta3mlouh fel marketing généralement ( mathalan cible
chniya yheb / mathalan fel réseaux sociaux aka l'algo li yokhrejlek selon chniyaa
inti t7eb wel recherche mte3ek
__________________________________________________________________________________
En plus des V de Volume, Variété et Vélocité, deux nouveaux "V" permettent de mieux
cerner les contours du big data :
Véracité : Cette propriété renvoie à la notion de la confiance placée en la donnée.
C'est-à-dire à la qualité de l'information, à son intégrité,
à la fiabilité de la source. L'objectif est d'écarter les données qui ne sont pas
viables, par leur format ou leur origine.
Valeur : Un projet big data n'a de sens que s'il permet de créer de la valeur en
améliorant un produit ou en personnalisant un service.
Les données brutes ont souvent peu d'intérêt. La création de valeur passe par leur
enrichissement, en croisant, par exemple, des données structurées
d'une entreprise et des données non structurées externes.
extraire le gain ( ken les données li yjiboulek reb7 )
-----------------------------------------------------------------------------------
-------------------------------------------------
scale of data : augmentation au niveau de données
uncertainty of data : on n'est pas sur que tous les data sont fiables donc on doit
faire filtrage pour avoir
que les données de bonne qualité et on se debarasse des données qui ne sont pas
pertinentes
___________________________________________________________________________________
__________________________________________________
processus big data
- collecte des données
- data preprocessing ( filtrage et nettoyage / data reduction) => ETL
- data storage ( les données sont pretes à etre stockées )
- data processing ( traitement de données )
- data visualization ( visualiser les données en charte graphique et stat )
- data analysis ( clustering analysis / regression / association )
- decision making => lezem des experts qui vont prendre des décisions
_______________________________________________
la science de données : extraction intelligentes et efficace des connaissances
tlem des données ywali 3andek des infos (knowledge)
plusieurs knowledges => intelligence
Data scientist : un nouveau métier du big data, il doit avoir
une competence forte f science mathématique (lezem ykoun behi fel math w stat) et
programmation
et business understanding
fama zouz : data architect (yhadher le plan) w fama data analysist (il applique
les algos)
différence entre les 2 termes :
donnée : pas de traitement
information : c'est une donnée traitée
___________________________________________________________________________________
__________________________________________________
marketing prédictif : des prévisions basées sur des données collectées et des
probabilités
enta9alna men journal wel printing w tawa nahkiw 3al marketing digital wel
marketing predictive
----------------
connaitre le client en etapes :
- définir les objectifs
- mettre en oeuvre les best practice
- analyser le marché et l'environnement
- gérer une base de données solide qui décrit les clients et prospects
( les services clients / les cadeaux / les trafics point de vente / carte
fidelité .. )
- apprendre de ses clients ( data mining )
___________________________________________________________________________________
___________________________________________________
la connaissance d'un client : qui ? socio-demog / que pensent les clients ? données
psycho / que font les clients ? comportemental
=> objectif : proposer le bon produit au bon moment au bon endroit et au bon client
-----------------------------------------------------------------------------------
---------------------------------------------------
chniya el mochkla mta3 les données qui sont massives ?
el mochkla eli ynajmou yzidou fel couts mta3 matieriel, logiciel...
w lezem des nouvelles competences pour agir en cas de challenge
les projets analyse big data lezemhom des experts
challenge : sécurité khater les données bou fadhou7 kima localisation, les
transactions bancaires etc..
___________________________________________________________________________________
____________________________________________________
écosystème hadoop : est un framework opensource pour le traitement
de grande quantité de données distribuées, developé par apache
le travail est partagé sur plusieurs clusters.
kbal : DFS ( distributed file system ) : lkol enregistré fi serveur wehed
3ibara plusieurs serveurs f serveur wehed
tawa wala nahkiw 3ala hadoop
hadoop : -stockage et traitement de big data
-divise les données en plusieurs parties pour les stocker sur
plusieurs machines. + tolérance aux pannes
les atouts de hadoop : - gestion de défaillance au niveau de stockage ou traitement
les noeud ki yti7 en panne yet3awedh b noeud ekher
- la sécurité : famech perte de données (khater fama copie)
- la montée en charge fama peak wala le, le systeme dima yekhdem b meme performance
- le cout reduit car hadoop est opensource, w les données sont traitées à faible
cout
- la complexité réduite
les caractéristiques de hadoop :
- hadoop mayesla7ch lel requetes de temps reel, khater yekhdem
par lot, des données hors ligne
ecosysteme fih
mapreduce / hdfs ...
HBase : une famille de BDD non relationnelle orienté colonne dynamique
kima tnajem tkhadem relationnel fel ecosysteme hadoop m3a el nosql
HDFS : snede9 kol sandou9 tchouf 9adeh donnée yarfa3 fih ( stockage de données)
mapreduce framework (traitement de données): algo ynajem ya3mel traitement parallel
de données
map y9asem w reduce ylem
Oozie : planificateur et manager du workflow hadoop ( gérer le flux de travail)
Pig : langage de traitement de données non structurées avec des scripts de haut
niveau
Hive : data warehouse avec interface SQL( pour les données structurées et semi)
Hue: front end graphique pour le cluster
Mahout : biblio d'apprentissage automatique
HBase : est utilisé pour le traitement des flux de données en temps réel
principe de mapreduce et hdfs: diviser les données, les sauvegarder sur une
collection de machines
(clusters), traiter les données directement la ou elles sont stockées
(+) tnajem tzid 9ad mat7eb machinet lel cluster ( scale out = scalabilité
horizontale) 9ad matzid test7A9 noeud tnajem thot
(-) cout plus élévé : augmenter la capacité en ajoutant des ressources à une seule
machine ( scale up = scalabilité verticale)
connexion du HDFS à partir des outils
sqoop : l'importation/ export de données structurées
flume : l'importation/export de données non structurées
vendeurs de distribution : cloudera, mapr, hortonworks, IBM ...
___________________________________________________________________________________
___________________________________________________________________________________
_
HDFS
objectifs : - garantir l'intégrité des données malgré une défaillance système
- permettre un traitement rapide des fichiers d'une grande taille (GB et plus)
- HDFS est moins adapté à bcp de fichiers d'une petite taille ( yetelhe bel
fichiers de grande taille )
- HDFS rapproche la lecture de la localisation des fichiers pour minimiser le
trafic réseau,
améliorer la performance et exploiter la répartition des données sur plusieurs
nœuds.
Le NameNode ne stocke pas les données elles-mêmes, mais les métadonnées concernant
l'organisation des fichiers dans HDFS. Les types de métadonnées gérées par le
NameNode incluent :
Liste de fichiers : Le NameNode contient la liste des fichiers présents dans le
système de fichiers HDFS.
Liste de blocs pour chaque fichier : Les fichiers dans HDFS sont divisés en blocs
(par défaut, la taille d'un bloc est de 64 MB), et le NameNode conserve une liste
indiquant comment chaque fichier est découpé en blocs.
Liste des DataNodes pour chaque bloc : HDFS distribue les blocs de fichiers sur
différents nœuds de données (DataNodes). Le NameNode suit sur quels DataNodes
chaque bloc est stocké.
Attributs de fichiers : Ces attributs incluent des informations telles que le temps
d'accès, les permissions et le facteur de réplication (le nombre de copies d'un
bloc stockées sur différents nœuds).
Fichier log : Le NameNode enregistre les événements importants comme la création ou
suppression de fichiers dans un fichier journal.
Enregistrement de création et suppression de fichiers : Toutes les opérations sur
les fichiers, telles que la création et la suppression, sont enregistrées pour
garder une trace des changements effectués.
- le role de datanode dans HDFS est de stocker les blocs de fichiers