Hadoop (8 points) D.
Création automatique d’instances de sauvegarde
pour les services critiques afin de permettre une bas-
1. Quel était l’objectif initial de la conception d’Apache Ha-
cule rapide en cas de panne du service principal.
doop ?
E. Envoi périodique, par les DataNodes, de Heart-
A. Gestion de base de données relationnelle. beats au NameNode pour déclarer qu’ils sont ac-
B. Traitement massif par lot pour analyser des tifs.
données web.
7. Quel est l’objectif principal de l’opération de checkpointing
C. Support pour des applications de messagerie instan- dans HDFS ?
tanée.
A. Accélérer le démarrage de la machine en réduisant le
D. Hébergement de sites web.
temps nécessaire pour relire le EditLog.
2. Quels sont les deux principaux inconvénients du design ini- B. Éviter d’avoir un trop grand EditLog, ce qui facilite-
tial d’Hadoop qui ont conduit au développement de YARN ? rait le traitement par le NameNode.
A. Couplage fort du modèle de programmation C. Recréer l’état actuel du système de fichiers en
avec l’infrastructure de gestion des ressources cas de défaillance du NameNode.
B. Absence de sécurité des données D. Augmenter la capacité de stockage des données sur
C. Manque de support pour le streaming en temps réel le NameNode en libérant de l’espace disque.
D. Faible capacité de stockage 8. Quand le processus de checkpoint est-il généralement dé-
E. Traitement centralisé des flux de contrôle des clenché dans HDFS ?
tâches A. Lorsque le NameNode reçoit un nombre spécifique de
3. Que permet la nouvelle architecture YARN par rapport à requêtes de lecture.
l’architecture Hadoop originale ? B. Après une certaine période de temps ou un cer-
A. Elle améliore exclusivement la sécurité des données. tain nombre de transactions dans le EditLog.
B. Elle permet le traitement en temps réel des données. C. Immédiatement après chaque mise à jour du système
C. Elle découple le modèle de programmation de de fichiers.
l’infrastructure de gestion des ressources. D. Lorsque le DataNode signale une perte de données.
D. Elle réduit la taille des données à traiter. 9. Quel rôle joue le Secondary NameNode dans le processus
4. Quelle est la fonction principale du ResourceManager (RM) de checkpointing ?
dans YARN ? A. Il met à jour les fichiers de métadonnées en temps
A. Exécuter des tâches au niveau de chaque Worker. réel.
B. Stocker des données dans HDFS. B. Il fusionne le EditLog avec la FsImage et envoie
la nouvelle FsImage au NameNode.
C. Arbitrer les ressources parmi différentes appli-
cations en compétition dans le cluster. C. Il gère les demandes de lecture et d’écriture des utili-
sateurs pendant le checkpointing.
D. Coordonner l’exécution d’une application dans le
cluster. D. Il optimise le processus de recherche de données par
le NameNode en organisant les métadonnées.
5. Comment YARN améliore-t-il l’utilisation des ressources
par rapport à l’approche originale de Hadoop ? 10. Quelles sont les différences principales entre le Secondary
NameNode (2NN) et le Standby NameNode (SbNN) dans
A. En segmentant les données de manière dynamique HDFS ? (plusieurs réponses possibles)
pour optimiser le traitement parallèle sans tenir
compte de la localité des données. A. Le SbNN ajoute la haute disponibilité (HA) en
étant constamment à jour avec les changements
B. En augmentant automatiquement la quantité de mé-
du système de fichiers.
moire disponible pour chaque tâche sans égard pour
les besoins spécifiques de chaque application. B. Le 2NN remplace le Primary NameNode en cas de
panne, contrairement au SbNN.
C. En automatisant le processus de réplication des don-
nées pour optimiser la bande passante entre les C. Le SbNN est utilisé pour créer des checkpoints mais
nœuds. ne garantit pas la haute disponibilité.
D. En intégrant un système de cache intelligent pour ré- D. Les DataNodes envoient les emplacements des blocs
duire la latence des accès disque. et les heartbeats uniquement au 2NN.
E. En traitant les ressources du cluster comme un E. Le SbNN récupère rapidement en cas de panne
continuum discrétisé et en fournissant un mo- car son état est similaire à celui du NameNode
dèle de ressources flexible. principal.
6. Quels sont les mécanismes implémentés dans Hadoop pour 11. Parmi les propositions suivantes, laquelle n’est PAS une rai-
assurer la tolérance aux pannes ? (plusieurs réponses cor- son d’introduire YARN dans l’écosystème de Hadoop ?
rectes) A. Séparation de la gestion des ressources de celle des
A. Réplication automatique des données sur plu- traitements
sieurs nœuds dans le cluster pour garantir la dis- B. Possibilité d’intégrer de nouvelles solutions de traite-
ponibilité des données en cas de défaillance d’un ment à HDFS
nœud. C. Diminution partielle des responsabilités de la ma-
B. Mise en œuvre d’un système de vote majoritaire pour chine Master
décider quelle version d’une donnée est correcte en D. Optimisation des performances d’exécution des
cas de divergence entre les nœuds. différents NameNode.
C. Utilisation d’un algorithme de consensus distribué 12. Quelle affirmation décrit le mieux la transition de l’utilisa-
pour la gestion des métadonnées et la coordination tion des slots dans Hadoop 1 à l’utilisation des containers
des tâches entre les nœuds. dans YARN ?
1
A. Les slots permettaient une allocation flexible des res- C. Hadoop utilise le disque pour le stockage des
sources pour différents types de charges de travail, données intermédiaires, tandis que Spark réa-
tandis que les containers assignent des ressources de lise des calculs en mémoire pour accélérer le
manière rigide. traitement.
B. Hadoop 1 utilisait des slots prédéfinis pour Map D. Hadoop est principalement utilisé pour l’apprentis-
et Reduce tasks, tandis que YARN remplace cette sage automatique tandis que Spark est conçu pour le
approche par des containers pour une gestion traitement par lots.
plus dynamique et flexible des ressources. 18. Quelles sont les principales utilisations de Hadoop et Spark
C. Les containers dans YARN ont été introduits pour dans le traitement des données ?
augmenter la capacité de traitement des données et A. Hadoop est mieux adapté pour le traitement en strea-
réduire les délais de calcul par rapport aux slots dans ming ; Spark est optimisé pour le traitement par lots.
Hadoop 1.
B. Hadoop est principalement utilisé pour le sto-
D. YARN a conservé le concept des slots de Hadoop 1 ckage de données et le traitement par lots ; Spark
mais a augmenté leur nombre pour permettre une est utilisé pour les traitements par lots et en
plus grande parallélisation des tâches. streaming.
13. Quel rôle jouent les DataNodes dans l’architecture Ha- C. Spark ne peut traiter que des données structurées ;
doop ? Hadoop est conçu pour des données non structurées.
A. Exécuter les tâches de MapReduce sur les données. D. Hadoop est optimisé pour les analyses en temps réel ;
B. Stocker les méta-données nécessaires pour organiser Spark est utilisé seulement pour le machine learning.
les fichiers. 19. En matière de tolérance aux fautes, comment Hadoop et
C. Sauvegarder les données utiles réparties sur plu- Spark gèrent-ils la récupération de données ?
sieurs nœuds. A. Hadoop utilise le checkpointing ; Spark utilise
D. Coordonner la distribution et le traitement des don- le mécanisme de lineage pour reconstruire les
nées. données perdues.
14. En quoi consiste la stratégie de réplication de HDFS pour B. Spark utilise des checkpoints sur le système de fi-
garantir la tolérance aux pannes ? chiers distribué ; Hadoop utilise la réplication.
A. Répliquer chaque bloc de données uniquement dans C. Hadoop et Spark utilisent tous les deux exclusive-
le même Datacenter pour accélérer l’accès. ment le modèle de calcul MapReduce pour garantir
B. Stocker une seule copie de chaque bloc de données la tolérance aux fautes.
pour économiser l’espace de stockage. D. Spark reconstruit les données perdues à partir de la
C. Répliquer chaque bloc de données sur trois Da- mémoire vive ; Hadoop les récupère à partir de copies
taNodes différents selon la politique de Rack de sauvegarde.
Awareness. 20. Qu’est-ce qui définit l’immutabilité dans Spark ?
D. Utiliser un système de fichiers centralisé pour main- A. Les RDD peuvent être modifiés sur place pour opti-
tenir toutes les copies des données. miser l’utilisation de la mémoire.
15. Quel est le rôle des TaskTrackers dans l’architecture Ha- B. Les données des RDD peuvent être mises à jour en
doop originale ? temps réel pour refléter les mises à jour des données
A. Gérer la file d’attente des travaux et répartir les en continu.
tâches. C. Les transformations appliquées aux RDD modifient
B. Exécuter les tâches Map et Reduce attribuées directement l’ensemble de données d’origine.
par le JobTracker. D. Les RDD sont des structures de données write-
C. Stocker les données utilisées et générées par les tra- once, read-many qui ne changent pas une fois
vaux MapReduce. créées.
D. Surveiller l’état et la santé des DataNodes dans le 21. Quelle affirmation décrit le mieux le concept de lignée (li-
cluster. neage) dans Spark ?
16. Comment Hadoop assure-t-il la tolérance aux pannes pour A. Permet de suivre l’historique des opérations de char-
les métadonnées stockées par le NameNode ? gement de données.
A. Par le checkpoint régulier et la sauvegarde des B. Fait référence à la séquence d’opérations appli-
métadonnées à travers le Secondary NameNode. quées pour reconstruire les partitions perdues.
B. En utilisant une base de données SQL traditionnelle C. Type particulier de partitionnement des données qui
pour stocker toutes les métadonnées. permet d’optimiser l’utilisation du réseau.
C. En répliquant les métadonnées sur chaque DataNode D. Mécanisme de persistance périodique des données
du cluster. sur le disque.
D. Le NameNode ne stocke pas de métadonnées, rédui- 22. Quelle est la principale raison pour laquelle Spark utilise la
sant ainsi le risque de perte de données. lazy evaluation ?
A. Améliorer la précision de l’analyse des données en
traitant les données au dernier moment.
Hadoop vs. Spark (6 points)
B. Renforcer les mesures de sécurité en retardant les cal-
17. Comment les architectures de Hadoop et Spark diffèrent- culs jusqu’à ce qu’ils soient absolument nécessaires.
elles principalement ? C. Réduire la charge de calcul en n’exécutant les
A. Hadoop utilise un stockage en mémoire tandis que transformations que lorsqu’une action est appe-
Spark repose sur le stockage sur disque. lée.
B. Hadoop traite les données en micro-batches tandis D. Augmenter la vitesse de sérialisation des données en
que Spark effectue des traitements par lots. retardant tous les calculs.
2
23. Comment Spark atteint-il la tolérance aux pannes avec les Architectures Big Data (6 points)
RDD ?
29. Quelles sont les caractéristiques distinctives de la Lambda
A. En utilisant le checkpointing pour sauvegarder toutes
Architecture ? (plusieurs réponses possibles)
les données sur le disque à intervalles réguliers.
B. En répliquant les données sur plusieurs nœuds pour A. Séparation des données en couches chaudes et
éviter les pertes de données. froides pour une analyse efficace.
C. En reconstruisant les partitions de données per- B. Utilisation unique du traitement en streaming pour
dues à l’aide des informations de lignée. gérer les données.
D. En sauvegardant fréquemment l’état des calculs dans C. Intégration d’une couche de traitement par lots
une base de données centrale. et d’une couche de traitement de flux pour des
24. Quelles sont les opérations qui peuvent être effectuées sur résultats rapides et complets.
les RDD dans Spark ? D. Emploi d’un seul type de stockage de données pour
A. Les opérations incluent des transformations simplifier la gestion.
comme map et filter, et des actions comme count E. Centralisation de toutes les données et traitements
et collect. pour simplifier la surveillance et le débogage.
B. Seules les opérations de type SQL peuvent être effec- 30. En quoi consiste la Kappa Architecture par rapport à la
tuées sur les RDD. Lambda Architecture ?
C. Les RDD prennent en charge les mutations sur place A. Elle élimine la couche de traitement par lots en
telles que l’ajout ou la mise à jour. faveur d’un traitement de flux unifié.
D. Les RDD peuvent être directement modifiés par des B. Elle introduit une troisième couche de traitement
systèmes externes pour des mises à jour en temps pour les données historiques.
réel. C. Elle utilise des systèmes de stockage différents pour
25. Quand un développeur Spark utilise-t-il les méthodes per- le traitement en temps réel et par lots.
sist() ou cache() ? D. Elle nécessite des capacités de calcul intensives pour
A. Lorsque le développeur souhaite supprimer le RDD toutes les données en temps réel.
de la mémoire après utilisation.
31. Quel est le but principal de l’architecture Data Lake ?
B. Lorsque le RDD doit être stocké sur le disque unique-
ment et non en mémoire. A. Conserver des données non structurées et struc-
C. Pour optimiser la réutilisation des résultats in- turées pour des analyses diverses et approfon-
termédiaires en les stockant en mémoire ou sur dies.
disque. B. Stocker des données structurées uniquement pour
D. Pour forcer le calcul immédiat d’un RDD et rejeter sa une analyse rapide.
lignée. C. Séparer les données en différents silos pour améliorer
26. Comment récupérer les partitions RDD perdues ? la sécurité.
A. En demandant des copies de sauvegarde aux nœuds D. Répliquer les données entre plusieurs environne-
voisins du cluster. ments pour garantir une tolérance aux pannes.
B. Par une intervention manuelle de l’utilisateur de 32. Que caractérise le mieux une architecture Lakehouse ?
Spark pour reconstruire les données perdues. A. La combinaison des caractéristiques des data
C. En utilisant les fonctions de réplication d’un système lakes et des data warehouses pour supporter des
de fichiers distribués. analyses complexes.
D. Grâce aux informations de lignage, ce qui per- B. Un système exclusivement basé sur des data lakes
met à Spark de recalculer uniquement les parti- sans capacités d’entreposage de données.
tions perdues. C. Un nouveau type de base de données graphique spé-
27. Quelle définition est la plus appropriée pour les transfor- cialisée dans l’analyse sémantique.
mations et les actions dans Spark ? D. L’utilisation de data warehouses traditionnels en pa-
A. Transformations : modifient les RDD ; Actions : ren- rallèle avec des data lakes.
voient les résultats finaux aux pilotes.
Pour chacune des définitions suivantes, déterminer la structure
B. Transformations : opérations paresseuses qui
qui s’applique le mieux : (A) : Data Lake, (B) : Data Lakehouse,
définissent de nouveaux RDD ; Actions : dé-
(C) : Data Warehouse ou (D) : Toutes
clenchent des calculs et renvoient des résultats.
C. Actions : modifient les données contenues dans les 33. Les données les plus denses (C)
RDD ; Transformations : renvoient de nouveaux en- 34. Les données les plus structurées (C)
sembles de données. 35. La meilleure compatibilité avec les outils de visualisation
D. Les transformations et les actions sont des termes in- (C)
terchangeables dans la programmation Spark.
36. La meilleure flexibilité face aux différents traitements (A)
28. Quelle affirmation décrit le mieux la fonctionnalité de per-
sistence dans Apache Spark ? 37. Problème de consistance de données (A)
A. La conservation des RDD dans une base de données 38. Capacité à voyager dans le temps (D)
externe pour garantir leur durabilité. 39. Un accès optimisé à la fois aux données chaudes et froides
B. L’enregistrement automatique des RDD sur le disque (B)
après chaque transformation. 40. Meilleure ingestion de données brutes, mais difficulté d’ex-
C. La possibilité de maintenir les RDD en mémoire traction d’informations (A)
entre différentes actions pour améliorer les per-
formances.
D. Le stockage systématique des RDD sur un système de ♣ Bon travail
fichiers distribué pour une utilisation ultérieure.