0% ont trouvé ce document utile (0 vote)
7 vues99 pages

Module 1 BigData CloudComputing

Le document présente les fondamentaux du Big Data et du Cloud Computing, en soulignant l'importance de la collecte, du stockage et de l'analyse des données pour la prise de décision. Il décrit les caractéristiques clés du Big Data, telles que le volume, la vélocité, la variété et la véracité, ainsi que les types de données et les technologies associées. Enfin, il aborde le processus ETL (Extract, Transform, Load) nécessaire pour rendre les données exploitables.

Transféré par

mdior9073
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
7 vues99 pages

Module 1 BigData CloudComputing

Le document présente les fondamentaux du Big Data et du Cloud Computing, en soulignant l'importance de la collecte, du stockage et de l'analyse des données pour la prise de décision. Il décrit les caractéristiques clés du Big Data, telles que le volume, la vélocité, la variété et la véracité, ainsi que les types de données et les technologies associées. Enfin, il aborde le processus ETL (Extract, Transform, Load) nécessaire pour rendre les données exploitables.

Transféré par

mdior9073
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Chapitre 1

Les fondamentaux
du Big Data et du Cloud Computing

Formatrice: Mously DIAW


L’histoire cachée
Introduction au Big
derrière
Data etvos
au données
Cloud Computing

Imaginez ...

Un matin, vous ouvrez votre application Spotify. Avant même que vous ne choisissiez une chanson, elle vous propose exactement la
playlist dont vous aviez envie.

Vous allez sur Netflix : il vous recommande un film pile dans votre humeur du moment.

Vous prenez votre téléphone : Google Maps vous avertit qu’il y a des embouteillages avant même que vous ne partiez.

A dakar, le marché Sandaga s’anime, les vendeurs enregistrent des paiements via mobile money, les bus Tata tracent leur trajet en
temps réel grâce au GPS, les jeunes scrollent sur TikTok, et dans les hôpitaux, les médecins saisissent des dossiers numériques.

Rien de magique là-dedans. Juste… des données. Des milliards de données qui circulent, se croisent, s’analysent, et surtout racontent
une histoire : la vôtre, la mienne, celle du monde entier.

Mais ces données, il faut les collecter, les stocker, les analyser et surtout en tirer du sens. Et c’est là qu’interviennent deux révolutions :
Le Big Data, cette capacité à gérer une quantité colossale d’informations, toujours plus rapides, variées, et souvent non structurées.
Le Cloud Computing, qui permet à n’importe quelle entreprise, école ou start-up de disposer de la puissance de calcul d’un Google
ou d’un Amazon… sans posséder un seul serveur.
Introduction au Big Data et au Cloud Computing

Aujourd’hui, les entreprises, les gouvernements, les ONG, les start-ups cherchent toutes à transformer ces données en décisions :
Comment prévoir les ventes d’un produit avant même qu’il ne sorte ?
Comment anticiper une épidémie à partir des recherches Google ?
Comment analyser les flux de mobilité pour améliorer les transports ?
Comment comprendre les comportements des clients à partir de milliards de transactions ?

Pour répondre à ces questions, on a besoin de nouvelles compétences et de nouvelles technologies : c’est tout le sens du Big Data
et du Cloud Computing.

Dans ce cours, nous allons :


Identifier les enjeux et problématiques liés au Big Data
Comprendre les principales caractéristiques du Big Data
Explorer les technologies clés comme Hadoop, Spark ou AWS
Découvrir comment le Cloud permet d’analyser et de stocker ces masses d’informations sans posséder d’infrastructures coûteuses
Et surtout, comprendre comment ces outils peuvent servir le développement, la recherche et la prise de décision
INITIATION AU BIG DATA
Les sources et types de données
Les fondamentaux du Big Data
Les avantages et dangers du Big Data
Les différentes étapes de l'ingénierie de données
Les outils et technologies de l'ingénierie de données
L'émergence du Big Data

Depuis quelques années, les données se sont multipliées à la vitesse de l’éclair.

L'explosion quantitative des données numériques a obligé les chercheurs à trouver de nouvelles manières de voir
et d’analyser le monde. Il s’agit de découvrir de nouveaux ordres de grandeur concernant la capture, la recherche,
le partage, le stockage, l’analyse et la présentation des données. Ainsi est né le « Big Data » (années 1997).

Inventé par les géants du web, le Big Data se présente comme une solution dessinée pour permettre à tout le
monde d’accéder en temps réel à des bases de données massives.

Il s’agit notamment d’un Volume de données considérable à traiter, une grande Variété d’informations (venant de
diverses sources, non-structurées, organisées, Open…), et un certain niveau de Vélocité à atteindre, autrement dit
de fréquence de création, collecte et partage de ces données.
BIG DATA
Les sources et types de données
Sources de données
Il y a principalement 4 sources de données de types différents:

Les « logs » des sites web Les « insights » des médias sociaux

Tout site web génère une quantité importante de Les médias sociaux sont devenus de véritables
données, appelées "logs", qui enregistrent chaque baromètres de l'opinion publique. Les données qu'ils
interaction d'un utilisateur avec le site. Ces logs sont génèrent, souvent appelées "social media insights",
une mine d'or d'informations précieuses pour les offrent une vision en temps réel de ce que les
entreprises souhaitant comprendre le comportement internautes pensent d'une marque, d'un produit ou
de leurs visiteurs et optimiser leur présence en ligne. d'un service.

Les « third party data » L’Open data

Les entreprises spécialisées dans la data ont développé Ce sont des données rendues publiques par les
des méthodes pour collecter d'immenses quantités de administrations, les entreprises ou les organisations,
données sur les internautes, appelées "third party data" et qui peuvent être librement réutilisées par tout un
ou données comportementales tierces. Ces données, chacun. Ces données, souvent issues de sources
récoltées via des formulaires, des cookies et d'autres diverses (statistiques publiques, données
traceurs, ... Au-delà des classiques informations géographiques, données économiques, etc.), offrent
d’identité (sexe, âge, CSP…), il est maintenant beaucoup un potentiel immense pour l'innovation, la recherche
plus efficace de mesurer les comportements (navigation, et le développement de nouveaux services.
configuration matérielle, temps passé sur les pages…).
Les différents types de données
Données structurées

Les données structurées, structured data en anglais, sont organisées de manière


spécifique, généralement dans des tableaux ou des bases de données relationnelles.
Elles suivent un schéma prédéfini (colonnes, lignes, types de données, etc.) et sont
facilement accessibles et analysables à l’aide de langages comme SQL.

Exemples :
Bases de données relationnelles (MySQL, Oracle)
Feuilles de calcul Excel
Données CRM (ID, noms, âge, adresses, contacts)
Les différents types de données
Données non structurées

Les données non structurées, unstructured data en anglais, ne suivent aucun schéma
fixe ou préétabli. Elles ne peuvent pas être facilement organisées dans des bases de
données relationnelles traditionnelles. Leur analyse et leur gestion sont plus
complexes, nécessitant souvent des outils spécialisés pour extraire les informations.
Elles représentent la majorité des données du Big Data (80-90%)

Exemples :
Emails, documents, journaux
Images, vidéos, fichiers audio
Publications ou commentaires sur les réseaux sociaux
Données issues de capteurs IoT
Les différents types de données
Données semi-structurées

Les données semi-structurées se trouvent à mi-chemin entre les données structurées


et non structurées. Elles n’ont pas un schéma fixe comme les données structurées,
mais contiennent des étiquettes ou des balises qui les rendent plus faciles à
organiser et analyser que les données non structurées. Ces données sont souvent
stockées dans des formats comme JSON ou XML.

Par exemple, si vous prenez une photo à partir d'un smartphone, elle aura des attributs
structurés comme la géolocalisation, l'ID de l'appareil et l'horodatage. Après les avoir
enregistrées, vous pouvez attribuer des balises aux images telles que « animal de compagnie
» ou « chien » pour fournir une structure.

Exemples :
Fichiers XML/JSON, API
Emails avec champs spécifiques (sujet, expéditeur)
Données des réseaux sociaux avec hashtags et mentions
Logs de serveurs avec balises

Exemple: données JSON


Les différents types de données
Résumé
Catégorie Données structurées Données non structurées

Pas de modèle de données prédéfini


Modèles de données prédéfinis Il peut s’agir de texte, d’images, de son, de
Caractéristiques
Une recherche facile vidéo ou d’autres formats
Une recherche difficile

Applications
Bases de données relationnelles Bases de données NoSQL
Réside à
Entrepôts de données Entrepôts de données (Data warehouse)
Lacs de données (Data lake)

Humains ou machines (estimée 0 80% des


Générée par Humains ou machines
données d’une entreprise)

Systèmes de réservation des Traitement de texte


compagnies aériennes Logiciel de présentation
Applications
Contrôle des stocks Clients de messagerie électronique
typiques
Systèmes CRM Outils de visualisation ou d’édition des
Systèmes ERP médias
Données semi-structurées : mélange des
Dates Fichiers texte
Numéros de téléphone Rapports
deux, offrant une flexibilité tout en
Numéros de sécurité sociale Messages électroniques permettant une certaine organisation.
Exemples Numéros de cartes de crédit Fichiers audio
Noms et adresses des clients Fichiers vidéo
Noms et numéros des produits Images
Informations sur les transactions Imagerie de surveillance
Comment les données deviennent exploitables ?
Avant d’analyser ou de modéliser, il faut d’abord préparer les données.
L’ETL (Extract - Transform - Load) est le processus qui permet d’extraire, transformer et charger les données afin de les rendre exploitables.

E = Extract (Extraction)
On récupère les données depuis différentes sources :
bases de données (SQL, Oracle, PostgreSQL…),
fichiers plats (Excel, CSV, JSON…),
APIs, capteurs, logs, ou plateformes en ligne (CRM, ERP, réseaux sociaux…).

T = Transform (Transformation)
On nettoie, structure et enrichit les données pour qu’elles deviennent
exploitables.
Cela comprend :
la suppression des doublons,
la gestion des valeurs manquantes,
la normalisation des formats (dates, devises, etc.),
le calcul de nouveaux indicateurs, La principale différence entre ETL et ELT est le moment et
la jointure entre plusieurs tables. l’emplacement de la couche de transformation.
Dans ETL, la transformation des données brutes se produit
avant qu’elles n’atteignent l’entrepôt de données.
L = Load (Chargement) Dans ELT, la transformation se produit dans l’entrepôt de
On charge les données transformées dans un entrepôt ou une base de données après que les données brutes y ont déjà été
données centrale appelée Data Warehouse (ou Data Lake dans le Big Data). déposées. Dans cette approche, les données brutes et
transformées vivent dans l’entrepôt de données.
BIG DATA
Définition & caractéristiques
Qu’est ce que le Big Data?

Le Big Data, mégadonnées ou données massives en français, fait référence à des


ensembles de données extrêmement volumineux et complexes qui ne peuvent pas être
traités efficacement avec les outils et méthodes traditionnels de gestion de données.

Ces données peuvent être structurées, semi-structurées ou non structurées, et


proviennent de nombreuses sources : réseaux sociaux, transactions, capteurs,
appareils connectés, applications, etc.

Ces données peuvent être analysées pour en tirer des enseignements et utilisées dans
des projets d’apprentissage automatique (Machine Learning) et d’autres applications
analytiques avancées.

Le Big Data peut être utilisé pour améliorer les opérations et performances, fournir un
meilleur service à la clientèle et créer des campagnes de marketing personnalisées,
identifier les facteurs de risque des maladie, aider à diagnostiquer les maladies chez
les patients et surveiller les réseaux électriques et prévenir les pannes. Par exemple,
le Big Data peut fournir aux entreprises des informations précieuses sur leurs clients,
qui peuvent ensuite être utilisées pour affiner les techniques de marketing afin
d’augmenter l’engagement des clients et les taux de conversion.
“Plus vous en savez sur une chose ou une
Ainsi, le Big Data constitue un levier majeur pour la décision stratégique et
situation, plus vous pouvez faire des prédictions
l’innovation.
fiables sur ce qui se passera à l’avenir.”
Les défis du Big Data ont conduit au développement de technologies innovantes pour
gérer efficacement d'immenses volumes de données: Hadoop, Spark, solutions cloud
(AWS, GCP, Azure, etc.). Ces technologies permettent aux entreprises de stocker, gérer
et analyser des données massives de manière plus efficace.
Les 5 principes essentiels qui définissent le Big Data

Voici les 5 principales caractéristiques du Big Data : 5V


Caractéristiques du Big Data - Volume

Volume: faire face à une croissance exponentielle

Il se réfère à la quantité massive de données générées


chaque jour, qui peuvent être structurées, semi-
structurées ou non structurées. Le Big Data implique la
gestion de téraoctets, voire de pétaoctets, de données,
nécessitant des outils et des technologies de stockage
et de traitement spécifiques.

Selon IBM, une moyenne de 2,5 quintillions de bytes de


données sont créés chaque jour, soit environ 2,3
trillions (1000 milliards) de gigabytes.

Big Data : unités de mesure


1 ko = 1 kilooctet = mille octets Sources: Data Age 2025, Nov 2018
1Mo = 1 mégaoctet = un million d'octets *Un zettaoctet équivaut à 1000 milliards de gigaoctets
1Go = 1 gigaoctet = un milliard d'octets
1 To = 1 téraoctet = un billion d'octets
1 Po = 1 pétaoctet = un billiard d'octets
1 Eo = 1 exaoctet = un trillion d'octets
1 Zo = 1 zettaoctet = un trilliard d'octets
Caractéristiques du Big Data - Vélocité

Vélocité: intégrer l’information vitesse grand V


Evolution du Nombre d'utilisateurs actifs de Facebook dans le monde
Elle se réfère à la vitesse à laquelle les données sont
générées et doivent être traitées. Avec l'avènement de
l'Internet des Objets (IoT) et des réseaux sociaux, les
données sont générées en temps réel, ce qui nécessite des
technologies de traitement de données en temps réel,
telles que l'informatique en mémoire ou le traitement
parallèle.

#Utilisateurs actifs en janvier 2023 :


Facebook : 2,91 milliards (3,1 milliards en 2027)
Youtube: 2,6 milliards
WhatsApp: 2 milliards
Instagram : 1,22 milliards
TikTok: 1 millard
Twitter : 433 millions
LinkedIn : 575 millions
Source: [Link]
Information additionnelle: étude réalisée sur les utilisateurs mondiaux de facebook entre Q3 2008 à Q4 2022
Caractéristiques du Big Data - Variété

Données structurées

Variété: collecter des données de toutes sortes

La variété se réfère à la diversité des types de données,


tels que les données structurées (ex: formulaires, notes,
...), les données semi-structurées (ex: emails organisés Données semi-structurées
par topic, tweets organisés par hashtag, ...) et les
données non structurées (ex: texte, les images et les
vidéos). Le Big Data implique le traitement de ces
différents types de données, souvent provenant de
sources différentes (réseaux sociaux, capteurs IoT, logs,
transactions, etc).

Données non-structurées
Caractéristiques du Big Data - Véracité

Véracité: construire sur du solide

Elle se réfère à la qualité des données, incluant leur exactitude, leur fiabilité et
leur pertinence. C'est le degré de confiance que l'on peut accorder aux données.

Le Big Data provient de sources très diverses et non contrôlées (réseaux sociaux,
capteurs défectueux, saisie humaine), ce qui introduit souvent du bruit, des
erreurs, des données incomplètes ou contradictoires.

Question clé : Est-ce que je peux faire confiance à cette source de données ? Les
données sont-elles exactes et exemptes de biais ?

L’enjeu : S’assurer que les données que vous utilisez sont propres et
représentatives de la réalité. Des données de faible véracité conduiront à des
analyses et des décisions erronées.
En résumé : la donnée existe, mais
Exemple : n’est pas forcément vraie.
Un capteur de température qui transmet des valeurs clairement aberrantes
(50°C) a une faible véracité.
Fake news ou informations trompeuses
Une base client contient plusieurs doublons pour le même individu
Caractéristiques du Big Data - Valeur

Valeur: connaître, cibler, optimiser, améliorer, ...

Elle fait référence à l'utilité des données dans la prise de


décision et est directement liée à ce que les entreprises
peuvent faire avec les données qu’elles collectent.
L'objectif principal du Big Data est d'extraire des
informations utiles et pertinentes à partir des données
afin de prendre des décisions éclairées. Cela nécessite
une analyse approfondie des données et une
compréhension de leur contexte afin d'optimiser les
processus et d'améliorer les performances de l'entreprise.

Les entreprises peuvent utiliser les mêmes outils Big Data


pour collecter et analyser les données, mais la manière
dont elles en tirent de la valeur doit leur être propre.
Caractéristiques du Big Data - Vulnérabilité

Vulnérabilité: protéger, anticiper, sécuriser

Le Big Data s’accompagne de risques accrus de sécurité et


de confidentialité :
Cyberattaques et fuites de données,
Traitement de données personnelles sensibles,
Exposition sur le dark web.

Exemple : en 2016, un pirate nommé Peace a mis en vente


sur le dark web des données issues de 167 millions de
comptes LinkedIn et 360 millions d’utilisateurs MySpace.

Enjeu : renforcer la sécurité, le chiffrement et la


conformité (RGPD, lois sur la protection des données).
Caractéristiques du Big Data - Validité

Validité : nettoyer, fiabiliser, normaliser

La validité mesure : si les données respectent le format, la plage des valeurs, le type
et les règles que vous avez définis.

Question clé : Cette donnée respecte-t-elle le bon format, le type attendu et les
contraintes logiques ?

Selon Forbes, près de 60 % du temps d’un data scientist est consacré au nettoyage et
à la préparation des données avant toute analyse.

Enjeu : garantir des données justes, cohérentes et exploitables.

Exemple :
Un champ de date qui contient du texte au lieu du format AAAA-MM-JJ n'est pas En résumé : la donnée est vraie,
valide. mais pas forcément utile.
Un champ de revenu qui contient une valeur négative n'est pas valide selon les
règles commerciale
Une adresse e-mail valide syntaxiquement ([Link]@...) mais qui n’existe
plus → l'information est non vrace (elle ne correspond pas à une boîte mail
réelle)
Une personne peut indiquer son âge comme "150 ans". C'est un nombre valide,
mais ce n'est pas une information crédible.
Caractéristiques du Big Data - Volatilité

Volatilité : conserver, archiver, actualiser.

La volatilité concerne la durée de vie des données :


Combien de temps une donnée reste-t-elle pertinente avant de devenir
obsolète ou historique ? Combien de temps faut-il conserver les données?

Avant l’ere big data, en general on stockait les données indéfiniment.


Quelques téraoctets de données ne pouvaient pas engendrer de dépenses
de stockage élevées.

En raison de la vitesse et du volume de ces données massives, leur volatilité


doit être soigneusement prise en compte. Il est maintenant fondamental
d’établir des règles pour la disponibilité et à la mise à jour des données afin
de garantir une récupération rapide des informations en cas de besoin.

Enjeu : éviter la surcharge d’information et garantir la disponibilité des


données réellement utiles.
Caractéristiques du Big Data - Variabilité

Variabilité : Adapter, ajuster, comprendre

décrit les incohérences et fluctuations dans les données ou leur


structure. Les formats et les significations peuvent changer dans le
temps, rendant l’analyse plus complexe.

Exemple : un même champ “revenu” peut désigner un salaire


mensuel à une date, puis un revenu annuel à une autre.

Enjeu : adapter les modèles et pipelines de données aux


changements de structure et de sens.
Caractéristiques du Big Data - Visibilité

Visibilité : visualiser, explorer, interpréter.

Une autre caractéristique du Big Data est la difficulté à les visualiser.

Le Big Data pose le défi de la visualisation (dashboards, cartes,


graphes): comment représenter efficacement une masse de données
hétérogènes et en constante évolution ?

Les outils de visualisation doivent permettre d’explorer ces données


complexes pour mieux les comprendre et les interpréter.

Enjeu : rendre les données accessibles et compréhensibles à tous


(décideurs, analystes, citoyens) afin de faciliter la prise de décision.
BIG DATA
Avantages et exemples
Quelques avantages du Big Data

prendre les meilleures décisions commerciales ;

avoir une meilleure connaissance du marché et de ses clients ;

améliorer l’efficacité de l’ensemble de ses services (commerciaux,


marketing, achats, gestion des risques, etc.) ;

anticiper les tendances des consommateurs ;

fournir des produits ou des services sur mesure aux clients;

améliorer sa réputation en ligne;


Qui utilise le Big Data ? Quelques exemples de succès

Amazon Apple Facebook


elle stocke toutes les informations relatives Apple se sert également du Big Data afin de Grâce à la data qu’elle traite, Facebook est
à ses clients afin de définir leurs parcours concevoir ses applications. Par le traitement capable de créer de courtes vidéos qui
d’achat et de voir leurs préférences. du Big Data, Apple comprend comment les regroupent d’anciennes photos susceptibles
De la sorte, Amazon peut vous suggérer des gens utilisent ses applications au quotidien et de vous plaire. Et pour cause, la
produits en particulier, améliorer peut alors modifier les conceptions à venir reconnaissance d’images est l’une des
l’expérience client ainsi que ses services. afin de s’adapter aux préférences des clients. technologies Big Data adoptées par Facebook.

Google Netflix Starbucks


Google se sert des mégadonnées afin de Netflix compte des millions d’abonnées. Starbucks est une marque mondialement
comprendre ce que ses utilisateurs attendent Grâce au Big Data, et au traitement des reconnue pour son café.
de la marque. Pour ce faire, la société se base données de ses clients, Netflix est capable Starbucks se sert du Big Data pour améliorer
sur différents paramètres tels que l’historique de recommander des films à ses utilisateurs, son menu en fonction des préférences de ses
de vos recherches, vos emplacements, les en fonction de leurs recherches antérieures. clients. Ces données servent également à créer
tendances, et bien d’autres. des campagnes marketing ciblées et des
promotions particulièrement appropriées
Quel est l’avenir du Big Data ?

Le Big Data change la donne dans de nombreux domaines et


continuera indubitablement à se développer.

Au-delà de 2024, l'avenir du big data est sur le point de remodeler


profondément les industries et la vie quotidienne. Imaginez un monde
où les informations basées sur les données sont profondément ancrées
dans chaque décision, qu'elle soit banale ou complexe.

La quantité de données disponibles va continuer à augmenter et la


technologie d’analyse deviendra plus avancée. Le Big Data est l’un des
éléments qui vont façonner l’avenir de l’humanité. Cette évolution
promet une société plus intelligente, où les décisions seront guidées
par des analyses de données approfondies, tout en respectant des
principes éthiques stricts. L'enjeu sera de tirer parti de la puissance
du Big Data tout en préservant les valeurs humaines fondamentales.

En résumé, l’avenir du Big Data sera marqué par une intégration plus
poussée de l’IA (Intelligence Artificielle), des analyses en temps réel,
une montée des préoccupations éthiques et légales, et des innovations
pour gérer les volumes massifs de données dans des environnements
de plus en plus complexes
BIG DATA
Les dangers
Les risques du Big Data

Risque de déshumanisation: toutes ces informations collectées


peuvent donner le sentiment au client qu’il ne peut rien cacher à
cette nouvelle science. Cela peut s’avérer perturbant, voire pire,
intrusif.
Les risques du Big Data

Risque de déshumanisation: toutes ces informations collectées


peuvent donner le sentiment au client qu’il ne peut rien cacher à
cette nouvelle science. Cela peut s’avérer perturbant, voire pire,
intrusif.

Fuite de données: le risque zéro n’existe pas. Un autre danger lié


au Big Data est que des tiers mettent la main sur des informations
sensibles. En 2020, on estime que nous produisons 2,5 quintillions
d'octets de données par jour. Néanmoins, les hackers et les cyber-
attackers peuvent cibler ces données pour les vendre sur le
DarkNet. La sécurité et la confidentialité des données stockées
mises à mal par les risques d'espionnage numérique.
Les risques du Big Data

Risque de déshumanisation: toutes ces informations collectées


peuvent donner le sentiment au client qu’il ne peut rien cacher à
cette nouvelle science. Cela peut s’avérer perturbant, voire pire,
intrusif.

Fuite de données: le risque zéro n’existe pas. Un autre danger lié


au Big Data est que des tiers mettent la main sur des informations
sensibles. En 2020, on estime que nous produisons 2,5 quintillions
d'octets de données par jour. Néanmoins, les hackers et les cyber-
attackers peuvent cibler ces données pour les vendre sur le
DarkNet. La sécurité et la confidentialité des données stockées
mises à mal par les risques d'espionnage numérique.

Ingérence politique: L'élection présidentielle américaine de 2016


et le référendum sur le Brexit de 2016 au Royaume-Uni sont les
exemples les plus évidents d'utilisation abusive des Big Data. Le
cabinet Cambridge Analytica a utilisé des informations recueillies
illégalement sur Facebook pour éclairer les stratégies de
communication des deux scrutins. Leur impact a façonné la scène
politique mondiale depuis lors.
Les risques du Big Data

Risque de déshumanisation: toutes ces informations collectées Problème d'éthique: Ces technologies sont entachées de préjugés
peuvent donner le sentiment au client qu’il ne peut rien cacher à raciaux (et, dans certains cas, de préjugés sexistes). Le logiciel de
cette nouvelle science. Cela peut s’avérer perturbant, voire pire, reconnaissance faciale d'Amazon, Rekognition, en est un excellent
intrusif. exemple. En 2018, le logiciel a incorrectement identifié 28 membres
du Congrès américain comme étant des criminels condamnés.
Fuite de données: le risque zéro n’existe pas. Un autre danger lié
au Big Data est que des tiers mettent la main sur des informations
sensibles. En 2020, on estime que nous produisons 2,5 quintillions
d'octets de données par jour. Néanmoins, les hackers et les cyber-
attackers peuvent cibler ces données pour les vendre sur le
DarkNet. La sécurité et la confidentialité des données stockées
mises à mal par les risques d'espionnage numérique.

Ingérence politique: L'élection présidentielle américaine de 2016


et le référendum sur le Brexit de 2016 au Royaume-Uni sont les
exemples les plus évidents d'utilisation abusive des Big Data. Le
cabinet Cambridge Analytica a utilisé des informations recueillies
illégalement sur Facebook pour éclairer les stratégies de
communication des deux scrutins. Leur impact a façonné la scène
politique mondiale depuis lors.
Les risques du Big Data

Risque de déshumanisation: toutes ces informations collectées Problème d'éthique: Ces technologies sont entachées de préjugés
peuvent donner le sentiment au client qu’il ne peut rien cacher à raciaux (et, dans certains cas, de préjugés sexistes). Le logiciel de
cette nouvelle science. Cela peut s’avérer perturbant, voire pire, reconnaissance faciale d'Amazon, Rekognition, en est un excellent
intrusif. exemple. En 2018, le logiciel a incorrectement identifié 28 membres
du Congrès américain comme étant des criminels condamnés.
Fuite de données: le risque zéro n’existe pas. Un autre danger lié
au Big Data est que des tiers mettent la main sur des informations Mauvaise qualité/analyse: une mauvaise analyse peut mal vous
sensibles. En 2020, on estime que nous produisons 2,5 quintillions orienter et vous faire prendre de mauvaises décisions.
d'octets de données par jour. Néanmoins, les hackers et les cyber-
attackers peuvent cibler ces données pour les vendre sur le
DarkNet. La sécurité et la confidentialité des données stockées
mises à mal par les risques d'espionnage numérique.

Ingérence politique: L'élection présidentielle américaine de 2016


et le référendum sur le Brexit de 2016 au Royaume-Uni sont les
exemples les plus évidents d'utilisation abusive des Big Data. Le
cabinet Cambridge Analytica a utilisé des informations recueillies
illégalement sur Facebook pour éclairer les stratégies de
communication des deux scrutins. Leur impact a façonné la scène
politique mondiale depuis lors.
Les risques du Big Data

Risque de déshumanisation: toutes ces informations collectées Problème d'éthique et biais algorithmique: Ces technologies sont
peuvent donner le sentiment au client qu’il ne peut rien cacher à entachées de préjugés raciaux (et, dans certains cas, de préjugés
cette nouvelle science. Cela peut s’avérer perturbant, voire pire, sexistes). Le logiciel de reconnaissance faciale d'Amazon,
intrusif. Rekognition, en est un excellent exemple. En 2018, le logiciel a
incorrectement identifié 28 membres du Congrès américain comme
Fuite de données: le risque zéro n’existe pas. Un autre danger lié étant des criminels condamnés.
au Big Data est que des tiers mettent la main sur des informations
sensibles. En 2020, on estime que nous produisons 2,5 quintillions Mauvaise qualité/analyse: une mauvaise analyse peut mal vous
d'octets de données par jour. Néanmoins, les hackers et les cyber- orienter et vous faire prendre de mauvaises décisions.
attackers peuvent cibler ces données pour les vendre sur le
DarkNet. La sécurité et la confidentialité des données stockées Discrimination & surveillance: utilisation des données pour
mises à mal par les risques d'espionnage numérique. discriminer certains groupes (prix, assurances, emploi, etc.). Le
gouvernement chinois a lancé un système de crédit social. Ce
Ingérence politique: L'élection présidentielle américaine de 2016 système est lié au dossier permanent de chaque citoyen et vise à
et le référendum sur le Brexit de 2016 au Royaume-Uni sont les promouvoir le bon comportement des citoyens. Les "bons"
exemples les plus évidents d'utilisation abusive des Big Data. Le citoyens, par exemple ceux qui font des dons à des œuvres
cabinet Cambridge Analytica a utilisé des informations recueillies caritatives ou qui paient leurs factures à temps, recevront un crédit
illégalement sur Facebook pour éclairer les stratégies de qu'ils pourront échanger contre des billets d'avion ou de train de
communication des deux scrutins. Leur impact a façonné la scène première classe. Les "mauvais" citoyens, par exemple ceux qui ont
politique mondiale depuis lors. commis des infractions au code de la route ou qui n'ont pas payé
leurs dettes, pourraient être dissuadés d'agir, par exemple en
ralentissant leur connexion à l'internet ou en réduisant leur accès à
l'enseignement privé.
Big data et données personnelles

Évidemment, lorsqu’une entreprise utilise et traite les données de ses prospects


et clients, un certain nombre de lois de protection de la vie privée entre en jeu.

On pense évidemment au RGPD (Règlement Général sur la Protection des


Données, entré en vigueur en mai 2018), que les organisations doivent strictement
respecter si l’entreprise est basée en France ou en Union Européenne en général,
et pour toutes les données concernant les personnes vivant dans ces régions. Ce
règlement européen oblige de demander expressément à vos utilisateurs leur
consentement avant de récolter et traiter leurs données personnelles.

Indépendamment de la taille ou de la localisation, toute organisation recueillant,


traitant et conservant des données personnelles de citoyens au sein de l'Union
Européenne doit être conforme au RGPD.

Les pénalités financières en cas de non-conformité sont drastiques, sans parler


des répercussions et des conséquences sur la réputation de l’entreprise.

Pour faire face à ces risques, bien que le Big Data présente de nombreux avantages et opportunités, il
est crucial de développer des cadres éthiques et réglementaires solides, d'investir dans la sécurité des
données, et de promouvoir une utilisation responsable et transparente du Big Data.
Big data et données personnelles

CDP - Commission de Protection des Données Personnelles

La CDP est une autorité administrative indépendante du Sénégal, créée par la loi n°2008-12
du 25 janvier 2008.

Elle est chargée de veiller à la protection des données personnelles et au respect de la vie
privée des citoyens à l’ère du numérique.

En résumé : la CDP est le “gendarme sénégalais des données personnelles”.


Elle s’assure que les entreprises, les administrations et les particuliers traitent les
données personnelles de façon légale, loyale et sécurisée.

Mission Description

Donner son accord avant qu’une entreprise ou institution collecte ou traite des données personnelles
Autoriser les traitements de données
(ex : fichiers clients, base RH, vidéosurveillance).
Garantir que les données (noms, emails, numéros, images, etc.) ne soient pas utilisées à mauvais
Protéger les citoyens
escient.
Informer et sensibiliser Expliquer au public leurs droits sur la vie privée numérique.

Contrôler et sanctionner Vérifier la conformité des entreprises et infliger des amendes en cas de violation.

Coopérer à l’international Collaborer avec d’autres autorités africaines et mondiales de protection des données.
Big data et données personnelles

Principes clés à respecter :


Transparence sur la collecte et l'utilisation des données
Obtention du consentement explicite des individus
Minimisation des données collectées
Sécurisation des données
Respect des droits des personnes (accès, rectification, effacement, etc.)

Techniques de protection :
Anonymisation des données pour supprimer les informations identifiantes
Pseudonymisation pour réduire les risques d'identification
Contrôles d'accès stricts aux données

Bonnes pratiques :
Cartographier les données personnelles traitées
Mettre en place des processus de protection des données dès la conception
Former et sensibiliser les équipes aux enjeux de protection des données
BIG DATA
Les métiers
Les métiers du Big Data

Autres profils:

Business Analyst
Machine Learning Engineer
Chief Data officer
Head of data / Data manager
DevOps/Cloud Engineer
Big Data Architect
Big Data Administrator
Big Data Developer
Big Data Tech Lead

Ces métiers sont très recherchés, avec de bonnes perspectives


d'évolution et des salaires attractifs. Ils nécessitent généralement
un niveau Bac+5 en informatique ou data science, avec des
compétences techniques pointues et une bonne compréhension
des enjeux business.
BIG DATA
Les défis et outils
Fonctionnement du Big Data

Collection Stockage
De par son immensité, la collecte des Toujours de par leur volume, les données ne
données est automatisée, et nécessite peuvent être stockées dans des systèmes
la mise en place de processus adéquats classiques. De ce besoin sont nées les
immenses fermes de données, que l’on
connaît sous le nom de « data centers ».

Analyse Traitement
Même s’il s’agit de la dernière étape, l’analyse est le
but premier du Big Data — à quoi bon avoir des Qu’elles soient structurées, non structurées ou
données si nous ne leur donnons pas de sens ? semi-structurées, les données ne se laissent pas
Ainsi, une fois les données collectées, stockées et lire d’elles-mêmes. Beaucoup de datasets, en
nettoyées, elles vont être analysées afin de faire fonction du but final de leur usage, doivent être
émerger des tendances et répondre à des questions. nettoyés des résultats parasites — également
Les résultats peuvent être des descriptions, des appelés « noise ».
diagnostics, des analyses prédictives
Les outils du Big Data

Le Big Data repose sur un écosystème d'outils et de technologies variés, chacun ayant une fonction spécifique
dans le traitement et l'analyse de grandes quantités de données.

Le choix des outils dépend de nombreux facteurs, tels que le volume des données, la nature des données, les
objectifs de l'analyse et les compétences de l'équipe. Il est souvent nécessaire de combiner plusieurs outils
pour construire une solution de Big Data complète.
Introduction à Hadoop

Historique:
Hadoop a été développé par Yahoo! en 2006, inspiré par le système Google File
System (GFS).
Il a été open-source en 2008 et est rapidement devenu populaire grâce à sa
simplicité et sa scalabilité.

Architecture:
C'est l'un des frameworks les plus connus pour le stockage et le traitement distribué de
grandes quantités de données. Il est composé de plusieurs modules, dont :
HDFS (Hadoop Distributed File System) pour le stockage et divise les données en
blocs répartis sur plusieurs nœuds pour un accès parallèle

MapReduce pour le traitement parallèle

Hadoop utilise également d'autres composants, tels que YARN (Yet Another Resource
Negotiator) pour la gestion des ressources et HBase pour le stockage de données NoSQL.

Fonctionnement:
Les données sont stockées dans HDFS sous forme de fichiers découpés en blocs.
MapReduce divise les tâches de traitement en sous-taches exécutées simultanément
sur plusieurs machines (noeuds).
Les résultats intermédiaires sont stockés dans HDFS, puis combinés pour produire le
résultat final.
Introduction à Spark

Apache Spark est un framework open-source conçu pour le traitement distribué de


données massives (Big Data). Développé initialement par l'Université de Californie à
Berkeley, il a été conçu pour améliorer les limitations de Hadoop MapReduce en matière
de vitesse et de flexibilité.

Il est devenu un outil incontournable dans le monde du Big Data grâce à sa flexibilité, sa
performance et sa facilité d'utilisation, utilisé pour une grande variété de tâches
analytiques allant du traitement par lots (batch) aux flux en temps réel (real time).

Composants de Spark
Spark Core : fournit les fonctions de base pour le traitement distribué et l'API de RDD
(Resilient Distributed Dataset). Les RDD sont des ensembles de données distribués sur
plusieurs nœuds qui peuvent être manipulés en parallèle.
Spark SQL: permet de manipuler des données structurées avec des requêtes SQL.
Spark Streaming: conçu pour traiter les flux de données en temps réel
MLlib: bibliothèque d'algorithmes d'apprentissage automatique distribués. MLlib permet
aux data scientists de former des modèles sur de très grandes quantités de données.
GraphX: module pour le traitement de graphes distribués, qui permet de manipuler et
d'analyser des données en graphes (par exemple, des réseaux sociaux ou des relations
entre objets)
Les outils de stockage: Bases de données NoSQL

Pour prendre en charge les immenses volumes de données, les stocker et les
analyser, il est impératif de s’en remettre à de nouvelles solutions.
Une base de données NoSQL est une base de données « non relationnelle ».

NoSQL: signifie “Not Only SQL”, ces bases de données non relationnelles
sont conçues pour gérer des données structurées, semi-structurées et non
structurées. Elles offrent une grande flexibilité et une haute disponibilité.
MongoDB: une base de documents populaire, idéale pour les données
semi-structurées et non structurées.
Cassandra: une base de colonnes hautement disponible et scalable,
souvent utilisée pour les applications à faible latence et à haute
disponibilité, telles que les applications de streaming de données.
HBase: une base de données NoSQL construite sur HDFS pour stocker des
données massives en colonnes, utilisée pour les applications nécessitant des
écritures et des lectures en temps réel.
Les outils d'analyse

SQL: bien que conçu pour les bases de données relationnelles, SQL
est largement utilisé pour interroger les données stockées dans des
systèmes Big Data.
Python: langage de programmation polyvalent, utilisé pour une
grande variété de tâches dans le domaine du Big Data, notamment
l'analyse de données, le machine learning et la visualisation.
R: langage et un environnement logiciel pour le calcul statistique et
graphique. Il est particulièrement populaire dans le domaine de la
data science.
Tableau: outil de visualisation de données qui permet de créer des
tableaux de bord interactifs et des graphiques personnalisés.
Power BI: solution d'analyse de données développée par Microsoft,
qui permet de transformer les données en informations visuelles,
interactives et exploitables
Les outils de machine learning

L'analyse de Big Data est souvent couplée au Machine Learning pour


extraire des insights, prédire des comportements futurs et
d'automatiser des tâches complexes. Voici une sélection des
principaux outils de Machine Learning utilisés dans le contexte du Big
Data:

TensorFlow: bibliothèque open-source développée par Google


pour la création et le déploiement de modèles de machine
learning.
Scikit-learn: librairie Python offrant une large gamme
d'algorithmes de machine learning.
PyTorch: Une autre bibliothèque Python populaire pour la
recherche en deep learning.
Spark MLlib: bibliothèque de machine learning intégrée à Spark,
offrant une large gamme d'algorithmes pour la régression, la
classification, le clustering, etc.

Ces outils permettent de développer et déployer efficacement des


modèles de machine learning sur des données massives, en tirant
parti des capacités de calcul distribué.
Les outils de cloud computing

Le Cloud Computing offre des solutions puissantes et scalables pour le traitement des données Big Data. Il permet
de stocker, traiter et analyser des volumes massifs de données de manière flexible et évolutive. Les principaux
acteurs sont:

AWS: Amazon Web Services propose une large gamme de services Big Data, tels que EMR (Elastic MapReduce),
Redshif, Athena, SageMaker, ...
Azure: Microsoft Azure offre également des services Big Data, tels que HDInsight et Databricks.
Google Cloud Platform (GCP): Google propose des services Big Data tels que BigQuery, Dataproc, Vertex AI, ....

Le choix entre ces plateformes dépend souvent des besoins spécifiques du projet, de l'expertise de l'équipe, et
des autres services cloud déjà utilisés par l'entreprise. Chaque plateforme offre des fonctionnalités uniques qui
peuvent être plus ou moins adaptées selon les cas d'usage.
BIG DATA
Bases de données NoSQL
L'histoire de NoSQL

Le terme et le concept NoSQL, Not Only SQL, furent inventés en 1998 par Carl Strozz, afin de désigner sa base de
données relationnelle légère et open source. Ce concept a ensuite été adopté et popularisé par les GAFAM tels que
Google, Facebook ou Amazon confrontés à d’immenses volumes de données. Les bases de données relationnelles étaient
devenues trop lentes.

Plutôt que de mettre à jour leur équipement informatique pour accroître les performances des RDBMS (Relational
Database Management System), les géants de la technologie ont choisi de distribuer la charge sur de multiples serveurs
hôtes. C’est la méthode dite du “scaling out”. Les bases de données NoSQL sont idéales pour le scaling-out, puisqu’elles
sont non relationnelles.

En l’an 2000, la base de données graphique Neo4j fut lancée. Ce fut ensuite le tour de la Google Bigtable, en 2004, puis
CouchDB en 2005. L’histoire des bases de données NoSQL fut aussi marquée par Amazon Dynamo en 2007.

Puis, en 2008, Facebook rend open source la base de données non-relationnelle qu’elle utilise en interne : Cassandra.
Cet outil devient la référence des databases NoSQL, et remet le terme NoSQL sous le feu des projecteurs en lui donnant
son sens et sa popularité actuelle.
Les caractéristiques de NoSQL

Les bases de données NoSQL se distinguent des bases relationnelles classiques (comme MySQL ou PostgreSQL) car elles ne
reposent pas sur le modèle de tables avec colonnes fixes.
Elles permettent de stocker et gérer des données non structurées ou semi-structurées sans avoir besoin de normalisation ni
de schéma rigide.

Autrement dit, on peut y enregistrer des données très différentes les unes des autres, ce qui offre une grande flexibilité.

Une autre force des bases NoSQL est qu’elles ne nécessitent pas un langage de requête complexe comme le SQL.
L’accès et la manipulation des données se font souvent via des API simples, utilisant des formats courants comme JSON et des
protocoles HTTP REST, très proches du fonctionnement des applications web modernes.

Les bases NoSQL sont aussi conçues pour être distribuées : elles peuvent fonctionner sur plusieurs serveurs en même temps.
Cela leur permet de gérer de très grands volumes de données et d’assurer une haute disponibilité, même en cas de panne
d’un serveur.
Elles privilégient souvent la scalabilité et la rapidité plutôt qu’une stricte conformité au modèle ACID (atomicité, cohérence,
isolation, durabilité), typique des bases relationnelles.

En résumé, les bases NoSQL sont flexibles, évolutives et adaptées aux environnements Big Data, où les données sont
massives, variées et en constante évolution.

Les bases de données NoSQL sont disponibles dans différents types en fonction de leur modèle de données, dont les
principaux sont document, clé-valeur, orientée colonnes et graphique.
Types de bases de données NoSQL

Orientée clé–valeur (Key–value)


Une base de données clé–valeur est la forme la plus simple des
bases NoSQL. Les données y sont stockées, dans un tableau de hash
où chaque clé est unique, sous forme de paires : clé → valeur

Chaque clé est unique et permet d’accéder rapidement à sa valeur


correspondante, un peu comme un dictionnaire ou une table de
hachage (hash table).
La valeur peut être de n’importe quel type : une chaîne de
caractères, un nombre, une liste, un objet JSON ou même un fichier
binaire.
Principe de fonctionnement
La clé sert d’identifiant unique
La valeur contient l’information associée (ex : le profil, les préférences ou la session d’un utilisateur)
L’accès à la donnée est direct et très rapide, sans jointure ni schéma complexe

Exemples Cas d’usage


Redis Caches en mémoire, sessions utilisateurs,
Riak stockage de préférences, e-commerce (panier,
Amazon état utilisateur)
DynamoDB
Types de bases de données NoSQL

Orientée clé–valeur (Key–value)


Exemple d’application : Amazon DynamoDB, au coeur des Applications
Temps Réel à Échelle Globale
DynamoDB, service managé d’Amazon Web Services, alimente des
applications critiques comme [Link] et Twitch. Conçue pour
absorber plus d’un million de requêtes par seconde avec une latence
inférieure à 10 ms, cette base clé-valeur gère les paniers d’achats, les
sessions utilisateur et les leaderboards de jeux vidéo en temps réel.
Son architecture garantit une disponibilité de 99,999 % grâce à la
réplication synchrone des données sur au moins trois centres de
données. Un cas d’usage emblématique concerne les ventes flash : lors
du Prime Day 2024, DynamoDB a traité 89 millions de
transactions/minute tout en maintenant des coûts 40 % inférieurs à une
architecture relationnelle classique.

Elles présentent les caractéristiques suivantes :


Structure simple et performances élevées
Scalabilité horizontale excellente
Fonctionnalités de requêtage limitées
Pas de relation entre les données

Si vous répondez oui aux questions suivantes vous avez probablement besoin de choisir ce type de base de données :
La rapidité d’accès est-elle une priorité absolue ?
Mon application nécessite-t-elle principalement un système de cache ou de gestion de sessions ?
Types de bases de données NoSQL

Orientée colonnes (Wide-column store)


Les bases de données orientées colonnes inversent “notre logique
classique” de classement des données par ligne.

Sur l’image (à droite) nous avons l’habitude de créer un tableau avec


sur chaque ligne toutes les informations relatives à un élément
(personne, produits, transactions, ...). En divisant les colonnes en
plusieurs tableaux qu’on va relier entre eux (ici par l’ID), les bases de
données orientées colonnes obtiennent des performances de lecture
exceptionnelles sur des données massives.

Contrairement aux bases relationnelles, les colonnes sont regroupées


par familles de colonnes, et chaque ligne peut contenir un nombre de
colonnes différent.

Exemple d’application : Google BigTable, pilier des services cloud de Google à


l’échelle Planétaire
Développé en interne dès 2004, Google BigTable alimente des services critiques
comme Google Analytics, Google Earth et Google Search. Conçu pour manipuler des Exemples
pétaoctets de données distribuées sur des clusters globaux, ce système combine le Apache Cassandra
modèle orienté colonnes avec un indexage temporel, permettant des mises à jour HBase
en temps réel sur des milliards d’entrées. ScyllaDB
Pour l’application Google Earth, BigTable gère les tuiles cartographiques et les
métadonnées associées (résolution, source d’acquisition), avec des latences Cas d’usage
inférieures à 10 ms pour 99 % des requêtes. La compression avancée des colonnes
Données temporelles, IoT, temps réel, monitoring,
réduit l’espace de stockage de 40% comparé à une approche relationnelle avec un
stockage en ligne classique. messagerie instantanée
Types de bases de données NoSQL

Orientée colonnes (Wide-column store)


Les bases de données orientées colonnes inversent “notre logique classique” de
classement des données par ligne.

Sur l’image (à droite) nous avons l’habitude de créer un tableau avec sur chaque
ligne toutes les informations relatives à un étudiant. En divisant les colonnes en
plusieurs tableaux qu’on va relier entre eux (ici par l’ID), les bases de données
orientées colonnes obtiennent des performances de lecture exceptionnelles sur
des données massives.

Ces bases privilégient la cohérence (Consistency) et la tolérance au


partitionnement (Partition tolerance).

Exemple d’application : Google BigTable, pilier des services cloud de Google à


l’échelle Planétaire
Développé en interne dès 2004, Google BigTable alimente des services critiques
comme Google Analytics, Google Earth et Google Search. Conçu pour manipuler des
pétaoctets de données distribuées sur des clusters globaux, ce système combine le Exemples
modèle orienté colonnes avec un indexage temporel, permettant des mises à jour Apache Cassandra
en temps réel sur des milliards d’entrées. HBase
Pour l’application Google Earth, BigTable gère les tuiles cartographiques et les ScyllaDB
métadonnées associées (résolution, source d’acquisition), avec des latences
inférieures à 10 ms pour 99 % des requêtes. La compression avancée des colonnes Cas d’usage
réduit l’espace de stockage de 40% comparé à une approche relationnelle avec un Données temporelles, IoT, temps réel, monitoring,
stockage en ligne classique.
messagerie instantanée
Types de bases de données NoSQL

Orientée document (Document store)


Une base de données orientée documents stocke les informations sous
forme de documents, généralement au format JSON (JavaScript Object
Notation) ou un format équivalent.
Chaque document contient des paires champ-valeur : un champ correspond
à une clé (le nom de l’attribut), et une valeur peut être de type varié - texte,
nombre, booléen, tableau ou même un autre objet.

Ce modèle offre une grande flexibilité, car chaque document peut avoir sa
propre structure sans qu’un schéma fixe soit imposé.

Les bases orientées documents sont donc particulièrement adaptées aux


données semi-structurées (ex. formulaires, profils utilisateurs, logs
d’applications) et aux données non structurées.

Elles permettent également de représenter des structures imbriquées ou


hiérarchiques, facilitant la modélisation de relations complexes entre les
données sans recourir à des jointures comme dans le modèle relationnel.

Exemples
Cas d’usage
MongoDB
Applications web, profils utilisateurs, logs, catalogues produits,
CouchDB
blogs, forums, CMS (Content Management System), API
Firebase Firestore
ElasticSearch
RavenDB
Types de bases de données NoSQL

Orientée graphe (Graph database)


Les bases de données graphes permettent de modéliser des relations
complexes entre entités. Elles transforment vos données en nœuds et
relations pour des requêtes qui explorent les connexions avec une efficacité
impossible à atteindre dans d'autres modèles.

Avec ces bases de données il devient facile de créer des requêtes de type :
Je voudrais compter le nombre de personnes qui sont mariées, et qui
vivent à une même adresse, mais seul l’une des personnes du couple est
propriétaire de cette adresse.

Ces bases de données sont très utilisées pour la recommandation, par


exemple :
Mame et Alexandre aiment la chanson “One” du groupe Metallica, Mame
écoute également la chanson “Chop Suey!” du groupe System of a Down,
Alexandre a donc de grandes chances d'apprécier aussi cette chanson.

Exemples de bases orientées graphe Cas d’usage


Neo4j Réseaux sociaux, recommandation, fraude,
ArangoDB cartographie, supply chain (logistique), ressources
JanusGraph humaines (analyser les relations entre équipes ou
Amazon Neptune projets)
Azure Cosmos DB
Comment choisir entre les bases de données
relationnelles (SQL) et non relationnelles (NoSQL) ?

Bases de données NoSQL ou non relationnelles Bases de données SQL ou relationnelles

Traitement de données relationnelles présentant des exigences logiques et


Traitement de données volumineuses, non liées, indéterminées ou évoluant
discrètes identifiables à l’avance.
rapidement.
Schéma devant être conservé et synchronisé entre l’application et la base de
Données sans schéma ou avec schéma dicté par l’application.
IDÉAL POUR : données.
Applications pour lesquelles le niveau de performance et la disponibilité
Systèmes hérités conçus pour les structures relationnelles.
importent plus que la cohérence.
Applications impliquant des requêtes complexes ou des transactions à
Applications Always On utilisées partout dans le monde.
plusieurs lignes.
Applications mobiles.
Analyses en temps réel.
Comptabilité, finances et systèmes bancaires.
Gestion de contenu.
SCÉNARIOS : Systèmes de gestion des stocks.
Personnalisation.
Systèmes de gestion des transactions.
Applications IoT.
Migration de base de données.

MISE À L’ÉCHELLE :
Mise à l’échelle horizontale des données avec partage entre serveurs. Mise à l’échelle verticale des données en augmentant la charge du serveur.
(slide suivante pour plus de détails)

Type de base de données : tables de lignes, groupées en relations.


Types de bases de données : bases de données clé-valeur, de documents, en
Utilise le langage SQL (Structured Query Language).
MODÈLE DE DONNÉES : colonnes et graphiques.
Stockage des données sous forme de lignes dans les tables ; données
Stockage des données en fonction du type de base de données.
associées stockées séparément et jointes pour les requêtes complexes.
Scaling vertical vs scaling horizontal

Le scaling (ou mise à l’échelle) désigne la capacité d’un système à augmenter ses ressources pour traiter davantage
de charge ou de données.

Vertical scaling (scale-up) : on augmente la puissance d’une Horizontal scaling (scale-out) : on ajoute plusieurs machines (serveurs
seule machine : plus de CPU, plus de RAM, ou un disque plus ou nœuds) qui travaillent ensemble.
rapide.
Avantages :
Avantages : Scalabilité quasi infinie
Simple à mettre en œuvre Tolérance aux pannes (si un serveur tombe, les autres continuent)
Pas besoin de modifier le code de l’application Idéal pour le Big Data, les bases NoSQL (Cassandra, MongoDB, ...)
Convient aux bases SQL classiques (MySQL, PostgreSQL…)
Limites :
Limites : Architecture plus complexe à mettre en place
Capacité maximale limitée (on ne peut pas agrandir Besoin d’un système de répartition de charge (load balancer)
indéfiniment un serveur) Synchronisation et cohérence plus difficiles à gérer
Coût rapidement élevé
Si le serveur tombe, tout s’arrête

Les systèmes Big Data et Cloud modernes privilégient le scaling horizontal pour sa résilience et sa scalabilité quasi infinie.
Comment choisir entre SQL et NoSQL ?

Le choix entre SQL (bases relationnelles) et NoSQL dépend principalement de la structure des données et des besoins du projet.

Quand choisir SQL ? Quand choisir NoSQL ?

=> Utilise une base SQL lorsque : => Choisis NoSQL lorsque :
Les données sont structurées et normalisées (ex. finance, Les données sont non structurées ou très variables (ex.
comptabilité). profils utilisateurs, réseaux sociaux).
Tu as besoin de relations claires entre les tables et de Le projet nécessite une lecture rapide et flexible sans passer
jointures complexes. par des jointures.
La validité du typage et la cohérence des données sont Tu gères de grands volumes de données (Big Data) ou un flux
essentielles. continu.
Tu effectues souvent des écritures précises (ex. mise à jour Ton système est distribué sur plusieurs serveurs (scalabilité
d’une ligne spécifique). horizontale).

SQL est idéal pour les projets stables, bien structurés et NoSQL est adapté aux environnements flexibles, évolutifs et
nécessitant une forte intégrité des données. orientés performance (applications web, temps réel, Big Data).
Data warehouse vs data lake vs data lakehouse
Aspect Data Warehouse Data Lake Data Lakehouse

Type de données Structurées (OLAP) Structurées, semi-structurées, non structurées (OLAP, OLTP) Structurées, semi-structurées, non structurées (OLAP, OLTP)

Schéma en lecture (schema-on-read), stockage sous forme de Schéma flexible, supporte les modèles en écriture et en
Modèle de schéma Schéma en écriture (schema-on-write)
fichiers plats lecture avec support ACID (Atomicité, Cohérence, Isolation,
Durabilité)
Format de stockage Formats optimisés pour l'analytique (Parquet, ORC) Formats variés (JSON, XML, CSV, Avro, Parquet, ORC) Formats optimisés pour l'analytique et le ML (Parquet, ORC,
Delta Lake, Hudi, Iceberg)

Stockage Stockage SAN/NAS haute performance, disques SSD Stockage distribué et scalable Stockage scalable et performant, supporte le stockage cloud
hybride
Mécanismes Indexation avancée (B-trees, bitmap indexes) Indexation limitée, basé sur les métadonnées Indexation avancée avec support des index secondaires et
d’indexation des structures de données adaptatives
Performance des Haute performance avec optimisation des requêtes SQL, Variable, dépend de l'outil utilisé Haute performance avec optimisations intégrées
requêtes indexes, partitions

Stockage Stockage SAN/NAS haute performance, disques SSD Stockage distribué et scalable Stockage scalable et performant, supporte le stockage cloud
hybride
Gestion des Catalogues de données robustes Catalogues de données rudimentaires ou externes Catalogues de données intégrés et avancés
métadonnées

Sécurité et gouvernance Sécurité au niveau des colonnes et des lignes, audits, Sécurité et gouvernance variées, nécessitant des Sécurité et gouvernance unifiées, avec contrôle d'accès fin
contrôle d'accès basé sur les rôles configurations supplémentaires

Pipeline de données ETL (Extract, Transform, Load) ELT (Extract, Load, Transform) ELT/ETL hybrides avec support des workflows de streaming
et batch

Conformité et audits Fort soutien pour la conformité réglementaire (GDPR, Varie, dépend des outils et configurations supplémentaires Conformité et audits intégrés avec logs d'audit détaillés et
HIPAA) avec des fonctionnalités de traçabilité et d'audit pour la conformité traçabilité des données (GDPR, HIPAA, CCPA)

Cohérence et intégrité Transactions ACID, contrôle de version, gestion des Cohérence éventuelle, dépend des systèmes de fichiers Transactions ACID, gestion des versions de données, prise
anomalies distribués en charge des transactions multi-table (Delta Lake, Iceberg)

Utilisateurs cibles Analystes de données, spécialistes BI, décideurs Data scientists, ingénieurs de données, analystes Utilisateurs mixtes : analystes de données, data scientists,
exploratoiress ingénieurs de données, décideurs

Utilisation typique Rapports, BI, analyses historiques Analyses exploratoires, Machine Learning, Big Data BI, Machine Learning, analyses en temps réel, stockage
unifié

Coût Élevé en raison du stockage et des performances Bas, stockage de grande capacité à faible coût Modéré, avec un coût optimisé pour la performance et la
optimisées capacité
Data warehouse vs data lake vs data lakehouse Modèle d’architecture

Un Data Mart (ou magasin de données) est une sous-partie d’un Data Warehouse destinée à répondre aux besoins spécifiques d’un département, centré sur un domaine
particulier (marketing, finance, ventes, ressources humaines, etc.).
Data warehouse vs data lake vs data lakehouse

En résumé

Un Data Warehouse est un système centralisé de gestion et de stockage de données conçu pour collecter,
consolider et analyser de grandes quantités de données structurées provenant de diverses sources.
Exemple d’outils : Snowflake, Redshift, BigQuery, Vertica, ...

Data Lake →Pour stocker tout, brut, sans limite de format. Exemple d’outils : Snowflake, Redshift
Exemple d’outils : S3, HDFS, Databricks Delta Storage Layer, Azure Data Lake Storage (ADLS), GCS, ...

Data Lakehouse → Pour unifier les deux mondes (Data Warehouse et Data Lake) : structure + flexibilité.
Exemple d’outils : Databricks, Delta Lake, Snowflake Unistore, Google BigLake, AWS Lake Formation +
Athena, Dremio, Apache Iceberg, ...

Exemple

Une entreprise comme Jumia :


stocke les logs e-commerce et images produits dans un Data Lake (S3) ;
alimente ses dashboards marketing avec un Data Warehouse (Snowflake) ;
centralise tout sur un Lakehouse Databricks pour relier BI et IA dans un même environnement.
CLOUD COMPUTING
Qu'est-ce que le Cloud Computing ?

Le Cloud Computing, ou l''informatique en nuage, est l'utilisation de la


puissance des ordinateurs en ligne, du stockage des bases de
données et d'autres ressources (comme des réseaux, des logiciels, des
serveurs, des outils IA, etc.) pour améliorer et accélérer les processus
de traitement sur Internet (dans le cloud). Cela signifie que les
utilisateurs finaux peuvent accéder aux logiciels et aux applications,
peu importe où ils se trouvent.

L'informatique en nuage est la fourniture à la demande de ressources


informatiques sur internet avec une tarification à l'usage.

Au lieu d'acheter, de posséder et d'entretenir des centres de données


et des serveurs physiques, vous pouvez accéder à des services
technologiques, tels que la puissance de calcul, le stockage et les
bases de données, en fonction de vos besoins, auprès d'un
fournisseur de services en nuage tel qu'Amazon Web Services (AWS),
Google Cloud Plateform (GCP), Microsoft Azure, etc.
Caractéristiques essentielles

Avant le cloud computing, les entreprises achetaient et maintenaient une infrastructure informatique sur site. Bien que les
économies aient été à l'origine de la transition initiale vers le cloud, de nombreuses entreprises trouvent que l'infrastructure
cloud offre de nombreux avantages.

Voici les 5 caractéristiques essentielles du cloud computing selon le NIST (National Institute of Standards and Technology) :

Libre-service à la demande: les utilisateurs peuvent accéder aux ressources cloud de façon autonome, sans intervention du
fournisseur de services.

Accès réseau étendu: les services sont accessibles via le réseau (internet) depuis divers appareils clients avec une connexion
internet.
Mutualisation des ressources: Les ressources du fournisseur (stockage, puissance de calcul, etc.) sont mutualisées pour servir
plusieurs clients.

Flexibilité rapide: les capacités peuvent être augmentées ou diminuées rapidement et automatiquement selon la demande.

Service mesuré: l'utilisation des ressources est mesurée précisément et la facturation est basée sur l’usage réel (pay-as-use).
Les fournisseurs cloud proposent des métriques d'utilisation détaillées qui sont utilisées pour communiquer les coûts
d'utilisation au client.

Ces caractéristiques permettent une grande flexibilité, une optimisation des coûts et une évolutivité qui sont au cœur des
avantages du cloud computing.
Les avantages du Cloud Computing

Mise en œuvre rapide Réduction des coûts Flexibilité et Évolutivité


Finis les coûts initiaux arbitraires, les entreprises Les ressources informatiques peuvent être
Il suffit aux entreprises de s'inscrire et d'utiliser peuvent commencer à utiliser des applications ajustées en temps réel pour répondre aux
les applications dans le Cloud : c'est instantané. immédiatement. fluctuations de la charge de travail.
Même les applications d'entreprise les plus Les entreprise payent uniquement pour les
complètes sont opérationnelles en l'espace de ressources qu’elles utilisent, ce qui évite les Il est facile d'augmenter ou de réduire
seulement quelques jours ou semaines, au lieu investissements initiaux importants dans du automatiquement les ressources selon les
de plusieurs mois ou années. matériel (pay-per-use). besoins avec un accès à un large éventail de
technologies.

Pas de maintenance Accessibilité depuis partout Sécurité améliorée

Appliquer des correctifs, mettre à niveau et tester Les applications Cloud sont conçues pour être Les grandes sociétés perdent en moyenne 265
des applications peut occuper l'équipe accessibles partout en toute sécurité et depuis ordinateurs portables par an. Si les données
informatique plusieurs jours par mois. Grâce aux n'importe quel appareil connecté. qu'ils contiennent sont confidentielles, le risque
applications Cloud, ce fardeau disparaît. de sécurité est sérieux.
En effet, tout est géré dans le Cloud et votre Avec les applications Cloud, les données sont
personnel est libre de se consacrer à de stockées de manière sécurisée dans le Cloud. Un
nouveaux projets et d'innover. ordinateur portable perdu n'est donc plus un
problème majeur.
Pourquoi rejoindre le Cloud ?

De plus en plus d'entreprises déplacent leurs activités informatiques dans le Cloud pour tirer parti de ses
nombreux avantages. Par nature, le Cloud est un outil qui change la donne pour quatre raisons :

Facilité : peu d'efforts de gestion et de maintenance sont nécessaires de la part de l'entreprise.

Efficacité : l'informatique traditionnelle sur site exigeait des investissements réguliers, la capacité pouvant
difficilement être adaptée. Le Cloud Computing fournit quant à lui une meilleure efficacité puisque les
ressources sont partagées entre les clients.

Accès : les applications et services Cloud sont accessibles partout : il suffit d'avoir un appareil doté d'une
connexion Internet.

Capacité : le Cloud n'a pas de limite de taille, les entreprises n'ont donc aucun souci à se faire en matière
de capacité.

Ces avantages revêtent une importance considérable dans un monde où le travail de bureau laisse la place au
travail à distance et où l'utilisation des appareils mobiles prend le dessus sur l'informatique de bureau.
Le Cloud est il sécurisé ?

Le Cloud élimine de façon efficace bon nombre d'inquiétudes en matière de


sécurité puisqu'il a l'avantage d'être hors site. Les catastrophes, les cambrioleurs
et les employés mécontents ne disposent d'aucun accès aux serveurs physiques
qui constituent le Cloud.

La plupart des fournisseurs de services Cloud garantissent que l'accès aux


données est surveillé avec soin et investissent massivement dans la sécurité de
leurs infrastructures, en d'autres termes, que personne ne pourra s'emparer de
fichiers confidentiels sur une clé USB.

Malgré tout, il convient d'apporter une attention particulière aux normes de


sécurité proposées par les fournisseurs de services Cloud (notamment avec des
mesures de sécurisation de la transmission et du stockage des données), ainsi
qu'à la sécurité physique des data centers des fournisseurs de services Cloud
afin de contrôler les droits d'accès des employés.

La sécurité du cloud est une responsabilité partagée entre le fournisseur et


l'utilisateur. Il est important de bien comprendre et respecter ce partage des
responsabilités (car une mauvaise configuration peut créer des vulnérabilités).
Les inconvénients du cloud computing

Bien que le cloud computing offre de nombreux avantages, il présente également quelques inconvénients qu'il est important de
connaître avant de prendre une décision.

1. Dépendance à la connexion Internet: le cloud computing nécessite une connexion internet stable et rapide. Une panne de
connexion peut entraîner des interruptions de service.
2. Problèmes de sécurité et de confidentialité: bien que les fournisseurs de cloud mettent en place des mesures de sécurité
robustes, il existe toujours un risque de piratage ou de perte de données. La responsabilité de la sécurité est partagée entre le
fournisseur et le client.
3. Manque de contrôle: en utilisant le cloud, les entreprises externalisent une partie de leur infrastructure informatique. Cela
signifie qu'elles ont moins de contrôle sur les systèmes sous-jacents (serveurs, logiciels) par rapport à une solution on-premise
et doivent faire confiance aux fournisseurs pour la maintenance et la gestion.
4. Disponibilité des services: si le fournisseur rencontre des problèmes, cela peut impacter l'activité de l'entreprise. Bien que
rares, ces interruptions peuvent entraîner des arrêts d’activité pour les entreprises qui dépendent entièrement du cloud. La
pérennité du service dépend de la stabilité du fournisseur cloud choisi.
5. Dépendance vis-à-vis des fournisseurs: une fois que vous avez migré vos données et vos applications vers le cloud, il peut être
difficile et coûteux de changer de fournisseur en raison des différences de formats et de technologies.
6. Coûts cachés potentiels: les coûts peuvent augmenter rapidement si vous ne surveillez pas attentivement votre consommation
de ressources.
7. Problèmes de latence et de performance: les applications nécessitant des performances élevées ou une faible latence peuvent
être affectées par les services cloud, en particulier si le centre de données est géographiquement éloigné ou si l'infrastructure
du fournisseur est saturée.
8. Questions légales et réglementaires: selon les régions et les législations locales, les entreprises peuvent être soumises à des
restrictions sur l’endroit où les données peuvent être stockées. Le respect des normes de confidentialité (comme le RGPD en
Europe) peut devenir un défi dans le cloud.

Ces inconvénients doivent être soigneusement évalués par les entreprises avant d'adopter une solution cloud.
Recommandations

Pour minimiser les risques liés au cloud computing, il est recommandé de:

Choisir un fournisseur de cloud réputé: privilégier les fournisseurs qui ont une expérience reconnue en
matière de sécurité et de conformité, s'assurer que le fournisseur cloud respecte les réglementations
applicables, maintenir une documentation détaillée sur la conformité

Mettre en place des mesures de sécurité supplémentaires: chiffrer les données sensibles, mettre en place une
gestion robuste des clés de chiffrement, contrôler , surveiller et auditer régulièrement les accès, etc.

Optimiser les coûts: mettre en place des alertes pour éviter les mauvaises surprises, assurer vous que les
ressources cloud sont utilisées de manière efficace et que les services inutilisés sont désactivés.

Plan de continuité et de reprise: évaluer les options de migration vers un autre fournisseur ou vers une
solution on-premise (lorsque celles-ci sont hébergées et maintenues par le propre service informatique de
l'entreprise) en cas de besoin, développer et tester régulièrement des plans de reprise après sinistre.

Sécurité des applications: effectuer des tests de sécurité réguliers pour identifier et corriger les vulnérabilités.

Formation et sensibilisation: former le personnel sur les risques liés au cloud et les bonnes pratiques, assurer
que les équipes IT sont bien formées sur les technologies cloud et les nouvelles menaces.
Les fournisseurs de cloud
Les principaux fournisseurs de cloud
Les principaux fournisseurs de cloud

Fort de ses 33 % de part de marché, Amazon est celui qui domine l’offre cloud depuis le tout début ...

Les autres fournisseurs, comme Google, Microsoft et IBM, ont une plus faible part de marché mais une croissance
plus forte. Ce qui est logique quand on y pense : il est plus facile d'avoir une grosse croissance quand on est petit
que quand on est déjà très gros.

J'ai déjà personnellement essayé les clouds de Google et de Microsoft Azure en plus d'AWS. Ils offrent des services
concurrents intéressants, mais ne rivalisent pas en termes de diversité de l'offre. En clair : AWS profite du fait qu'il
était le premier sur le marché pour continuer à innover et fournir de nouveaux services.

Les entreprises choisissent de combiner les services cloud de différents fournisseurs pour répondre à leurs
différentes exigences plutôt que de choisir un seul fournisseur pour tout. Dans la plupart des cas, choisir de
travailler avec plusieurs fournisseurs cloud aide les entreprises à choisir les meilleures fonctionnalités cloud
pour leurs propres besoins. Par exemple, différents fournisseurs peuvent se spécialiser dans certains domaines
tels que l'analyse de données et les services d'IA, ou proposer une meilleure compatibilité avec les anciens
environnements ou des options de calcul plus larges.
D'où vient le cloud ?

Pour faire face à la demande qui grandissait de jour en jour, Amazon


a dû apprendre à standardiser et automatiser la gestion des dizaines
de milliers de serveurs répartis dans les quatre coins du monde. Ils ont
rapidement réalisé l’avantage économique et technologique que
procurerait cette innovation aux entreprises.

Le service AWS est maintenant composé de millions de serveurs dans


le monde, eux-mêmes répartis dans de multiples datacenters qui lui
appartiennent : aux États-Unis, en Irlande, en Asie... Ces datacenters
ont poussé comme des champignons ces dernières années.

Les datacenters d’AWS dans le monde


D'où vient le cloud ?

Mais la différence est que vous ne savez pas quel est le serveur qui
répond aux requêtes. Parfois, le serveur change dans la journée et
vous n’êtes pas au courant, mais ça n’est pas grave : ce qui compte,
c’est que votre site fonctionne toujours !

L’intérêt de ce fonctionnement, c’est que vous n’avez plus à vous


préoccuper des problèmes physiques des machines. Si un disque dur
tombe en panne, ce n'est pas à vous d'aller le remplacer.

Voilà comment le cloud (ou cloud computing) est né. Cela n’a rien de
magique : il y a toujours des serveurs, des processeurs, de la mémoire
et des disques durs. Sauf qu’au lieu de vous louer un serveur précis
avec son numéro de série, on vous loue « la puissance d’un serveur ».

Le cloud est généralement matérialisé par un nuage qui dit « Vous ne voyez
pas ce qu’il y a à l’intérieur mais ne vous inquiétez pas, ça fonctionne ». Soyons Les datacenters d’AWS dans le monde
un peu critiques toutefois : les problèmes, même s’ils sont rares, peuvent
toujours survenir. Amazon, Google et Microsoft ont tous les trois connu des
ennuis avec leur infrastructure de cloud, qui parfois n’a pas fonctionné
pendant plusieurs heures à cause d’un gros bug technique.

Heureusement, cela reste rare, mais il faut quand même le savoir !


En quoi consiste la responsabilité partagée ?
Vous l’aurez compris, la force d’AWS, et de tout service Cloud, est de décharger le client de la gestion des couches basses
du parc informatique.

Très bien, mais que se passe-t-il lors d’une panne ou d’une faille de sécurité ?

Eh bien, cela dépend du service AWS utilisé, ainsi que du type de panne dont il est question. On parle ainsi d’un modèle de
responsabilité partagée.

La responsabilité d’AWS diffère d’un service à un autre(par exemple, entre Amazon S3 et Amazon RDS). La règle d’or à
retenir est que si vous avez la main dessus, c’est à votre charge.

Le principe de responsabilité partagée chez AWS


En résumé

La force du cloud réside dans la flexibilité qu’il offre aux développeurs.


On ne loue plus une machine pour une durée fixe. On loue uniquement
la puissance de calcul dont on a besoin.

Le cloud repose toujours sur des machines physiques. On délègue tout


simplement leur gestion à un tiers.

La responsabilité du fournisseur de cloud diffère selon le service


proposé. Plus on contrôle les briques du services, plus on étend notre
responsabilité.

Cloud Computing Architecture


CLOUD COMPUTING
Les types de cloud
Les types de cloud: Introduction

Il existe trois principaux types de Cloud Computing :


Cloud public: Il s'agit du modèle le plus courant. Les ressources
informatiques sont partagées par plusieurs clients sur une
infrastructure maintenue par un fournisseur tiers (AWS, Azure, GCP).

Cloud privé: infrastructure dédiée à une seule organisation. Il peut


être hébergé sur site ou dans un centre de données tiers.

Cloud hybride: combine les avantages du cloud public et du cloud


privé. Il permet de migrer certaines applications vers le cloud public
tout en conservant d'autres applications sur une infrastructure privée

Cloud Communautaire: l'infrastructure est partagée entre plusieurs


organisations ayant des besoins similaires (par exemple, les hôpitaux,
les universités, les banques). Les clouds communautaires, plus récents
que les clouds privés, publics ou hybrides, ont vu leur popularité
croître avec l'essor du travail en ligne pendant la pandémie.
Les types de cloud

Cloud public
Dans un cloud public, les données de l’entreprise sont stockées
sur un serveur distant, qui n’appartient pas à l’entreprise. Dans
ce cas, les services de cloud sont fournis par un prestataire
extérieur via l'internet. Microsoft Azure, Google Cloud Platform
(GCP), Amazon Web Services (AWS), Alibaba Cloud et IBM Cloud
sont les principaux fournisseurs de cloud public.
Des services d'intelligence artificielle aux outils de
développement en passant par les capacités de stockage et de
calcul pour pratiquement toutes les charges de travail, les
solutions de cloud public aident les entreprises à exploiter les
technologies de pointe et à se développer à l'échelle mondiale
sans devoir assurer les coûts ni la main-d'œuvre nécessaires
par elles-mêmes.
De plus en plus, les fournisseurs de cloud public proposent des
services cloud dans les data centers de leurs clients, ce qui
rend les notions d'emplacement et de propriété obsolètes.
Les types de cloud

Cloud privé
Avec le cloud privé, les données sont hébergées sur le serveur
de l’entreprise, qui est géré par cette dernière ou être hébergé
par un fournisseur de services tiers. L’avantage du cloud privé
est une sécurité accrue, les données étant protégées par le
système de sécurité informatique de l’entreprise.

Le cloud privé géré: ce type de cloud est créé et utilisé par les
clients, tandis qu'il est déployé, configuré et géré par un
fournisseur tiers
Le cloud privé dédié est un cloud réservé à des utilisateurs
particuliers d’une seule organisation. Par exemple, un service
de comptabilité peut disposer de son propre cloud réservé au
sein du cloud privé de l'entreprise.

Avantages: meilleur contrôle, sécurité renforcée,


personnalisation complète.
Inconvénients: coûts plus élevés, gestion plus complexe.
Les types de cloud

Cloud hybride
Le cloud hybride peut se définir comme un environnement
composé de plusieurs cloud public et privé.

Certaines applications ou données sensibles peuvent être


maintenues dans un cloud privé, tandis que les autres services
utilisent le cloud public pour la flexibilité et les coûts réduits.

Avantages : flexibilité, sécurité accrue pour les données


sensibles, coûts optimisés.
Inconvénients : complexité dans la gestion et l'intégration
des deux environnements.
Les types de cloud

Cloud public Cloud hybride


Dans un cloud public, les données de l’entreprise sont stockées sur un Le cloud hybride peut se définir comme un environnement composé de
serveur distant, qui n’appartient pas à l’entreprise. Dans ce cas, les services plusieurs cloud public et privé connectés entre eux. Le cloud public peut
de cloud sont fournis par un prestataire extérieur. Alibaba Cloud, Microsoft être utilisé pour certaines tâches, et le cloud privé pour d’autres.
Azure, Google Cloud Plateform (GCP), Amazon Web Services (AWS) et IBM
Cloud sont les principaux fournisseurs de cloud public.

De plus en plus, les fournisseurs de cloud public proposent des services


cloud dans les data centers de leurs clients, ce qui rend les notions
d'emplacement et de propriété obsolètes

Cloud privé Mutli cloud


Avec le cloud privé, les données sont hébergées sur le serveur de Souvent confondu avec le cloud hybride, le multicloud s’appuie sur
l’entreprise, qui est géré par cette dernière. L’avantage du cloud privé est plusieurs services cloud et sur plusieurs fournisseurs de cloud, public ou
une sécurité accrue, les données étant protégées par le système de sécurité privé. Tous les clouds hybrides sont par définition des multiclouds, même
informatique de l’entreprise. si l’inverse n’est pas toujours vrai.

Le cloud privé géré: ce type de cloud est créé et utilisé par les clients, Un environnement multicloud peut exister intentionnellement (pour un
tandis qu'il est déployé, configuré et géré par un fournisseur tiers meilleur contrôle des données sensibles ou comme espace de stockage
Le cloud privé dédié est un cloud réservé à des utilisateurs particuliers de redondant pour améliorer la récupération après sinistre) ou par hasard
l’entreprise. Par exemple, un service de comptabilité peut disposer de son
propre cloud réservé au sein du cloud privé de l'entreprise.
CLOUD COMPUTING
Les types de service
Types de services Cloud: Introduction

L'adoption du cloud est de plus en plus populaire, car de plus en plus


d'entreprises remplacent les coûts initiaux et la maintenance à long terme
des serveurs physiques et de l'infrastructure sur site par les ressources de
calcul évolutives, flexibles et à la demande du cloud.

Quels sont les principaux types de modèles de cloud computing et comment


savoir lequel est le plus adapté à vos besoins ?

Il existe plusieurs types de services cloud, y compris une infrastructure, des


plates-formes et des applications logicielles. Les modèles de service cloud ne
s'excluent pas mutuellement, et vous pouvez choisir d'en utiliser plusieurs en
combinaison, voire tous en même temps.
Voici les trois principaux modèles de service cloud :

IaaS (Infrastructure as a Service): offre des ressources informatiques de


base à la demande, telles que des serveurs virtuels, du stockage et des
réseaux
PaaS (Platform as a Service): fournit une plateforme pour développer,
tester et déployer des applications sans avoir à gérer l'infrastructure
sous-jacente
SaaS (Software as a Service): propose des applications logicielles
accessibles via un navigateur web.
Types de services Cloud: Part de marché

Cloud public: SaaS, part de marché (2019)

Cloud public: part de marché (2019 - 2022)

Cloud public: IaaS, part de marché (2019)

Source: [Link]
Types de services Cloud

IaaS
Dans le cas de Cloud Computing de type IaaS (Infrastructure
as a Service), l’ensemble de l’infrastructure informatique est
hébergée et gérée par un prestataire extérieur, aussi bien la
partie logicielle que matérielle.

L'utilisateur qui loue l'infrastructure peut y accéder au


moyen d'une API ou d'un tableau de bord. L'utilisateur gère
le système d'exploitation, les applications et les solutions
de middleware, tandis que le fournisseur prend en charge le
matériel, le réseau, les disques durs, le système de
stockage, les serveurs et la résolution des pannes et
problèmes matériels.

C’est une solution souvent adoptée par les entreprises ne


disposant pas des moyens suffisants pour déployer leur
propre infrastructure.

Exemples: AWS EC2, Google Compute Engine, Digital Ocean


Droplets, Microsoft Azure Storage, IBM Cloud, ...

Cas d’utilisation :
Développement et test d'applications.
Hébergement de sites Web.
Sauvegarde et récupération de données.
Types de services Cloud

PaaS
Le PaaS (Platform as a Service) permet aux entreprises de
disposer d’un environnement complet afin de développer
leurs propres applications sans avoir à gérer les
infrastructures sous-jacentes.

Avec le PaaS, le matériel et la plateforme logiciel-application


sont fournis et gérés par un prestataire de services cloud
externe. L'utilisateur doit se charger lui-même de la gestion de
l'application exécutée sur la plateforme, ainsi que des
données dont l'application dépend.

D'abord destiné aux développeurs et aux programmeurs, le


PaaS offre à l'utilisateur une plateforme cloud partagée pour
le développement et la gestion d'applications.

Exemples: Google App Engine, AWS Lambda, Heroku, SAP Cloud,


Windows Azure, …

Cas d’utilisation :
Développement d'applications mobiles et web.
Hébergement de microservices.
Développement d'applications big data.
Types de services Cloud

SaaS
Dans le cas du SaaS (Software as a Service), les collaborateurs
de l’entreprise accèdent aux logiciels dont ils ont besoin par
le biais d’une interface distante.

La résolution des problèmes éventuels et les autres tâches de


maintenance logicielle sont prises en charge par le prestataire
extérieur. Les mises à jour logicielles sont prises en charge
pour l'utilisateur, qui peut se connecter aux applications cloud
via un tableau de bord ou une API.

Il n’y a donc plus besoin d’installer ces applications


individuellement sur chaque poste de l’entreprise. Ainsi, vous
pouvez améliorer les méthodes d'accès au logiciel pour tout
un groupe ou une équipe.

Exemples: Google Apps, Microsoft Dynamics CRM, IBM Watson


Assistant, Salesforce, Workday, Slack, Zendesk, Office 365,
DocuSign…

Cas d’utilisation :
Logiciels de gestion de la relation client (CRM).
Outils de collaboration et de productivité.
Solutions de gestion des ressources humaines (HR).
Cloud Computing: types de services

Autres Types de Services Complémentaires

Functions as a Service (FaaS): permet aux développeurs de déployer du code sans avoir à se
soucier de la gestion des serveurs. Le fournisseur de cloud exécute et gère automatiquement le
code en réponse à des événements.
Exemples: AWS Lambda, Azure Functions, Google Cloud Functions.
Avantages: Pas de gestion de serveur, exécution basée sur des événements, facturation à
l'usage réel.

DBaaS (Database as a Service) : Ce service se concentre sur la gestion de bases de données.


Exemples: MongoDB, Cassandra, RDS, Redshift, BigQuery.
Avantages: Facilité de gestion, accessibilité, performance optimisée, support de divers types de
bases de données

Backend as a Service (BaaS): offre des services backend prêts à l'emploi pour les applications,
comme les bases de données, les authentifications utilisateur et les notifications push
Exemples: Firebase, Backendless.
Avantages: facilité de développement d’applications mobiles ou web sans gérer le backend.
Types de services Cloud: exemples
Quels sont les métiers du cloud computing ?

Le cloud computing est aujourd’hui en pleine croissance. Les fortes demandes des entreprises ont pour corollaire un
besoin accru d’experts ayant des compétences liées à l’analyse des informations et aux problématiques
d’hébergement web.

En voici une liste non exhaustive :


Architecte Cloud: concevoir et mettre en œuvre l'architecture cloud d'une entreprise
Ingénieur Cloud: assurer la mise en œuvre, la configuration et la gestion des infrastructures cloud.
Administrateur Cloud: gèrer au quotidien les environnements cloud, assurer la disponibilité et les performances
des services, gérer mes accès et la sécurité
Développeur de Cloud: créer et déployer des applications sur les plateformes cloud, maitriser les technologies
cloud (conteneurs, microservices, etc.)
Consultant Cloud: aider les entreprises à migrer vers le cloud, à optimiser leurs coûts et à tirer le meilleur parti
de leurs investissements cloud
Spécialistes en DevOps: automatiser les processus de développement et de déploiement des applications cloud.
Expert en sécurité Cloud: assurer la sécurité des données et applications dans le cloud, gérer la conformité
réglementaire, définir et mettre en place les politiques de sécurité
Formateur Cloud: enseigner les compétences cloud aux professionnels et aux étudiants, proposer des formations
sur les outils et services cloud.

Si cet univers du traitement, de la gestion des données internet et des outils de stockage vous passionne, n’attendez
plus et formez-vous !
BIG DATA ET CLOUD
Quelle est la relation entre
Big data et cloud computing ?
Big Data et Cloud Computing

Comme vous pouvez le constater, les possibilités sont infinies


lorsque nous combinons le Big Data et le Cloud Computing ! Si nous
n'avions que le Big Data, nous aurions des données massives qui
ont une valeur potentielle énorme. L'utilisation de nos ordinateurs
pour les analyser serait soit impossible, soit peu pratique en
raison du temps que cela prendrait.
Le terme "Big Data" fait référence aux
grands ensembles de données collectées,
tandis que le terme "Cloud Computing" Cependant, le Cloud Computing permet d'utiliser une
désigne le mécanisme qui recueille ces infrastructure de pointe et de ne payer que pour le temps et
données à distance et effectue toutes les l'énergie que nous utilisons ! Le développement d'applications est
opérations spécifiées sur ces données. également alimenté par le Big Data. Sans Big Data, il y aurait
beaucoup moins d'applications aujourd'hui, car elles ne seraient
pas vraiment nécessaires. Souvent, les Big Data sont collectées et
analysées par les applications du cloud !

En bref, les services du Cloud Computing existent en grande partie


grâce aux Big Data. De même, si nous collectons des Big Data, c'est
uniquement parce que nous disposons de services capables de les
collecter, de les accueillir et de les traiter. Les deux sont en
parfaite adéquation, car l'un n'existerait pas sans l'autre !
Big Data et Cloud Computing

Le cloud fournit l'infrastructure évolutive et les ressources de


calcul nécessaires pour stocker et traiter les grands volumes de
données du Big Data.

Le Big Data requiert des capacités de stockage et de traitement


que le cloud peut offrir de manière flexible et évolutive.

Cas d'utilisation du Big Data et du Cloud Computing


Analyse de données: Extraire des insights précieux à partir de
grandes quantités de données.
Intelligence Artificielle: Entraîner et déployer des modèles de
machine learning à grande échelle.
Internet des objets (IoT): Traiter et analyser les données générées
par les objets connectés.
Marketing personnalisé: Cibler les clients avec des offres
personnalisées en fonction de leurs comportements et
préférences.
Détection de fraudes: Identifier les activités frauduleuses dans les
transactions financières.
Ressources
[Link]
[Link]
[Link]
[Link]
Ww1CQKJxyIRSdxSGSHCU9fUkAQZuwtDW4TzE0&irgwc=1&utm_medium=partners&utm_source=impact&utm_campaign=245992&utm_content=b2c
[Link]
[Link]
[Link]
[Link]
[Link]
[Link]
[Link]
[Link]
[Link]
[Link]
[Link]
[Link]
[Link]
[Link]
[Link]
[Link]
[Link]
[Link]
[Link]
lakehouse#:~:text=Contrairement%20%C3%A0%20un%20Data%20Warehouse,agilit%C3%A9%20dans%20leur%20utilisation%20ult%C3%A9rieure.

Vous aimerez peut-être aussi