REPUBLIQUE TUNISIENNE
Ministère de l'Enseignement Supérieur et de la Recherche Scientifique
Université de Carthage
Institut National des Sciences Appliquées et de Technologie
Devoir Surveillé Examen Session principale
Session de contrôle
Matière : Big Data Semestre : 1
Enseignant(s) : Lilia Sfaxi Date : 12/03/2022
Filière(s) : GL4 Durée : 1h
Barème : Documents : autorisés
Nombre de pages : 7 + 1 page de réponse non autorisés
Répondez aux questions sur la feuille de réponse fournie.
Une seule réponse correcte pour chaque question.
Colorez le cercle entièrement avec votre crayon/stylo foncé
Une heure, 50 questions.
1. Qu’est-ce que l’ingestion de données?
A. La collecte et consommation de données à l’arrivée.
B. Le traitement des données en streaming.
C. L’exportation des données vers des bases volumineuses.
D. L’affichage des données dans un dashboard.
2. Qu’est-ce que la cohérence ajustable?
A. Le fait que la cohérence s’ajuste au nombre de copies des données.
B. Le fait que la coordination est assurée entre les copies des données.
C. Le fait que le niveau de cohérence peut être défini au niveau de la requête.
D. Le fait que la cohérence s’ajuste au nombre de machines dans le cluster.
3. Qu’est-ce que le Polyglot Programming?
A. Le fait d’utiliser la programmation par aspects dans les applications Big Data.
B. La possibilité d’utiliser plusieurs langages de programmation dans la même application.
C. Le fait que les données utilisées dans les applications soient polyglottes.
D. Le fait que, pour un système donné, il est possible d’utiliser plusieurs types de bases de
données.
4. Que dit la propriété CAP?
A. La consistance, disponibilité et tolérance au partitionnement ne peuvent pas avoir lieu en
même temps.
B. Les systèmes Big Data doivent assurer à la fois la consistance, disponibilité et tolérance au
partitionnement.
C. Les seuls systèmes qui peuvent assurer la coordination, disponibilité et partage sont les
systèmes Big Data.
D. La coordination, disponibilité et partage doivent avoir lieu en même temps dans n’importe
quel système.
1
REPUBLIQUE TUNISIENNE
Ministère de l'Enseignement Supérieur et de la Recherche Scientifique
Université de Carthage
Institut National des Sciences Appliquées et de Technologie
5. Quelle affirmation est correcte??
A. La colocalité veut dire déplacer les données vers le traitement au lieu de déplacer le
traitement vers les données.
B. La colocalité veut dire déplacer le traitement vers les données au lieu de déplacer les
données vers le traitement.
C. La colocalité veut dire que toutes les données doivent être localisées sur la même
machine.
D. La colocalité veut dire que tous les traitements doivent être localisés sur la même machine.
6. Quelle propriété n’est PAS définie dans les systèmes BASE?
A. Basically Available.
B. Adjustable Consistency.
C. Soft-State.
D. Eventual Consistency.
7. Avec quel langage Spark est-il développé?
A. Java
B. Python
C. R
D. Scala
8. Avec quels langages est-il possible de créer des applications sur Spark?
A. Java et Scala.
B. Python et R.
C. Scala et Python.
D. Java, Scala, Python et R.
9. Le format d'abstraction de base de Spark est _____.
A. DStream.
B. RDD.
C. DataFrame.
D. Dataset.
10. Lequel des composants suivants ne fait pas partie de l'écosystème Spark?
A. Sqoop.
B. MLLib.
C. GraphX.
D. Aucun des trois ne fait partie de l'écosystème Spark.
11. Les transformations sur un RDD sont exécutées immédiatement.
A. Faux
B. Vrai
2
REPUBLIQUE TUNISIENNE
Ministère de l'Enseignement Supérieur et de la Recherche Scientifique
Université de Carthage
Institut National des Sciences Appliquées et de Technologie
12. Pourquoi les RDDs sont-ils immuables?
A. Pour gagner de l'espace en mémoire.
B. Pour accélérer le traitement.
C. Pour pouvoir les récupérer en cas de perte.
D. Pour éliminer les données inutiles.
13. Qu'est-ce que la lignée dans Spark?
A. Un graphe représentant l'enchaînement des RDDs créés
B. Le fait que les RDDs ne sont créés qu'à la dernière minute
C. Une structure distribuée en mémoire permettant de représenter les données d'un fichier.
D. La valeur retournée suite à l'exécution d'un calcul sur un RDD.
14. Qu'est-ce qui est vrai pour les RDDs?
A. C'est un paradigme de programmation.
B. C'est une collection immuable d'objets.
C. C'est une base de données.
D. C'est un fichier.
15. Qu'est-ce qui représente une limitation de Spark?
A. L'utilisation des évaluations paresseuses ralentit son exécution.
B. Il n'est pas tolérent aux fautes.
C. Il est coûteux en termes de consommation mémoire.
D. Sa communauté est limitée.
16. Que font les executors de Spark?
A. lancent des traitements et stockent des données pour les applications.
B. allouent les ressources nécessaires pour l'exécution de plusieurs tâches.
C. orchestrent les connexions entrantes venant des utilisateurs.
D. communiquent avec les noeuds du cluster pour jouer le rôle d'orchestrateurs.
17. Que veut dire le deuxième D de RDD?
A. Dataset
B. Distributed
C. Dataframe
D. Data
18. Quelle affirmation n'est pas correcte concernant Hadoop et Spark?
A. Les deux sont des plateformes de traitement de données.
B. Les deux sont des environnements de traitement distribué.
C. Les deux fournissent leurs propres systèmes de fichiers.
D. Les deux utilisent des APIs open-source pour faire le lien entre différents outils.
3
REPUBLIQUE TUNISIENNE
Ministère de l'Enseignement Supérieur et de la Recherche Scientifique
Université de Carthage
Institut National des Sciences Appliquées et de Technologie
19. Quelle caractéristique de Spark le rend plus performant que Hadoop Map Reduce?
A. Support des différents langages tels que Scala, Java, Python, etc.
B. Utilisation d'un moteur d'exécution de DAG (Direct Acyclic Graph) et le traitement en
mémoire
C. Les RDDs qui sont immuables et tolérants aux fautes.
D. Rien. Spark n’est pas plus performant que Map Reduce.
20. Quelle commande utilisons-nous pour vérifier si tous les démons de Spark sont
entrain de s’exécuter ?
A. fsck
B. distcp
C. spark ls
D. jps
21. Quelles caractéristique n'est pas associée aux RDD?
A. Immuables.
B. Distribués.
C. Uniques.
D. En mémoire.
22. Quelles opérations ne sont pas supportées par le framework Spark?
A. Traitement en streaming pûr.
B. Traitement en batch.
C. Traitement Machine Learning.
D. Traitement de graphes.
23. Quels gestionnaires de ressources est-ce que Spark supporte?
A. Standalone Cluster Manager
B. MESOS
C. YARN
D. Toutes les réponses sont correctes
24. Spark utilise l'architecture _____?
A. Master-Worker
B. Client-Server
C. Pipe-Filter
D. Ring.
25. Toutes les propositions suivantes sont correctes pour décrire Spark, SAUF _____.
A. Open Source
B. Supporte le traitement à la volée
C. Permet le stockage des données massives
D. Utilise l'approche distribuée.
26. Que permet de faire la commande docker run?
A. Démarrer un contenaire endormi
B. Exécuter une commande shell sur le contenaire
C. Créer un contenaire docker à partir d'une image
4
REPUBLIQUE TUNISIENNE
Ministère de l'Enseignement Supérieur et de la Recherche Scientifique
Université de Carthage
Institut National des Sciences Appliquées et de Technologie
D. Arrêter un contenaire en marche.
27. Que permet de faire la commande spark-submit?
A. Soumettre un fichier à HDFS pour qu'il soit utilisé dans une commande Spark.
B. Lancer un traitement sur l'une des machines Worker.
C. Créer un RDD à partir d'un fichier enregistré sur le disque.
D. Lancer un job Spark en lui fournissant le code à exécuter.
28. Avec quels langages est-il possible de créer des applications Map Reduce sur
Hadoop ?
A. Java
B. Python
C. C++
D. Toutes les réponses sont correctes.
29. Comparé aux bases de données relationnelles, Hadoop HDFS _____.
A. fournit une meilleure intégrité des données.
B. est plus performant pour réaliser des traitements par lot sur un grand volume de données.
C. exécute les transactions ACID
D. est adéquat pour des accès directs vers les données
30. Dans une configuration de haute disponibilité du NameNode, si le noeud actif
échoue, quel noeud pourra prendre sa place?
A. Secondary Name Node
B. Backup Node
C. Standby NameNode
D. Checkpoint Node.
31. Hadoop utilise l'architecture _____.
A. Master-Worker
B. Client-Server
C. Pipe-Filter
D. Ring
32. Le framework Hadoop est écrit en?
A. Python
B. C++
C. Scala
D. Java
33. Le noeud responsable du checkpointing dans Hadoop (1) télécharge la FsImage et le
EditLog du NameNode, puis (2) les fusionne, ensuite (3) sauvegarde la FsImage
modifiée _____.?
A. Sur le disque
B. Dans un Journal Node
C. En la renvoyant au Name Node actif.
5
REPUBLIQUE TUNISIENNE
Ministère de l'Enseignement Supérieur et de la Recherche Scientifique
Université de Carthage
Institut National des Sciences Appliquées et de Technologie
34. Lequel de ces éléments ne fait PAS partie de l'écosystème de Hadoop??
A. Sqoop
B. HBase
C. Cassandra
D. MongoDB.
35. Quel commentaire est faux à propos de Hadoop?
A. Hadoop fait partie du projet Apache
B. Hadoop peut exécuter tous les types de traitements Big Data
C. Hadoop peut s'exécuter sur des machines banalisées
D. Hadoop est un projet Open-Source
36. Quel fichier de configuration contient les paramètres des démons HDFS?
A. [Link]
B. [Link]
C. [Link]
D. Aucune des réponses n'est correcte
37. Quel fichier de configuration contient les paramètres des démons NodeManager et
Resource Manager?
A. [Link]
B. [Link]
C. [Link]
D. Aucune des réponses n'est correcte.
38. Quelle technologie peut être utilisée pour appliquer des algorithmes de Machine
Learning sur Hadoop?
A. Hive
B. Pig
C. HBase
D. Mahoot.
39. Quels types de données est-ce que Hadoop peut gérer?
A. Structurées
B. Non-structurées
C. Semi-structurées
D. Toutes les autres réponses.
40. Sur quelles plateformes Hadoop peut-il s'exécuter?
A. Les systèmes UNIX-like
B. Il est cross-platformes
C. Il n'a pas besoin d'un système d'exploitation
D. Uniquement sur Docker.
41. Toutes les propositions suivantes sont correctes pour décrire Hadoop, SAUF _____.
6
REPUBLIQUE TUNISIENNE
Ministère de l'Enseignement Supérieur et de la Recherche Scientifique
Université de Carthage
Institut National des Sciences Appliquées et de Technologie
A. Open Source
B. Temps réel
C. Basé sur Java
D. Utilise l'approche distribuée
42. Le DStream est la structure utilisé pour _____.
A. Spark Streaming
B. Spark Batch
C. Hadoop Map Reduce
D. MLlib.
43. Quelle technologie tournant au dessus de HDFS, permet de fournir des capacités
semblables à celles de Google BigTable à Hadoop?
A. HBase
B. Hive
C. Pig
D. HCatalog.
44. Quelle opération n’est pas disponible sur Spark ?
A. Map
B. Reduce
C. Shuffle
D. Sort
45. Quel V n’est pas utilisé pour qualifier les données Big Data ?
A. Validité
B. Venue
C. Variabilité
D. Viscosité
46. Que se passe-t-il si le nombre de reducers est mis à 0 dans Hadoop ?
A. Seule l’opération Reduce aura lieu
B. Seule l’opération Map aura lieu
C. Le résultat du Reduce sera le résultat final
D. Un seul reducer s’exécutera par défaut.
47. Lesquelles des phases suivantes se produisent simultanément ?
A. Shuffle et Map
B. Shuffle et Sort
C. Reduce et Sort
48. Lesquelles des phases suivantes se produisent simultanément ?
A. Copier des fichiers du système de fichiers local vers HDFS.
B. Copier des fichiers ou des répertoires du système de fichiers local vers HDFS
C. Copier des fichiers de HDFS vers le système de fichiers local
7
REPUBLIQUE TUNISIENNE
Ministère de l'Enseignement Supérieur et de la Recherche Scientifique
Université de Carthage
Institut National des Sciences Appliquées et de Technologie
D. Copier des fichiers ou des répertoires du HDFS vers le système de fichiers local.
49. Quelle est la séquence d’exécution correcte du flux des données dans MapReduce ?
(a) InputFormat (b) Mapper (c) Combiner (d) Reducer (e) Partitionner (f) Outputformat
A. abcdfe
B. acdefb
C. abcdef
D. abcedf
50. A quel moment au plus tôt la méthode reduce d'un Reducer donné peut-elle être
appelée ?
A. Dès qu'au moins un Mapper a fini de traiter les enregistrements.
B. Cela dépend du InputFormat utilisé pour le travail.
C. Pas avant que tous les Mapper aient fini de traiter les enregistrements.
D. Dès qu'un Mapper a émis au moins un enregistrement.