0% ont trouvé ce document utile (0 vote)
48 vues8 pages

Examen Big Data - Université de Carthage

Ce document est un devoir surveillé d'examen sur le Big Data, comprenant 50 questions à choix multiples. Les questions portent sur des concepts clés tels que l'ingestion de données, la cohérence ajustable, le Polyglot Programming, et les différences entre Hadoop et Spark. L'examen est destiné aux étudiants de l'Institut National des Sciences Appliquées et de Technologie de l'Université de Carthage.

Transféré par

no one
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
48 vues8 pages

Examen Big Data - Université de Carthage

Ce document est un devoir surveillé d'examen sur le Big Data, comprenant 50 questions à choix multiples. Les questions portent sur des concepts clés tels que l'ingestion de données, la cohérence ajustable, le Polyglot Programming, et les différences entre Hadoop et Spark. L'examen est destiné aux étudiants de l'Institut National des Sciences Appliquées et de Technologie de l'Université de Carthage.

Transféré par

no one
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

REPUBLIQUE TUNISIENNE

Ministère de l'Enseignement Supérieur et de la Recherche Scientifique


Université de Carthage
Institut National des Sciences Appliquées et de Technologie

Devoir Surveillé Examen Session principale


Session de contrôle
Matière : Big Data Semestre : 1
Enseignant(s) : Lilia Sfaxi Date : 12/03/2022
Filière(s) : GL4 Durée : 1h
Barème : Documents : autorisés
Nombre de pages : 7 + 1 page de réponse non autorisés

Répondez aux questions sur la feuille de réponse fournie.


Une seule réponse correcte pour chaque question.
Colorez le cercle entièrement avec votre crayon/stylo foncé
Une heure, 50 questions.

1. Qu’est-ce que l’ingestion de données?


A. La collecte et consommation de données à l’arrivée.
B. Le traitement des données en streaming.
C. L’exportation des données vers des bases volumineuses.
D. L’affichage des données dans un dashboard.

2. Qu’est-ce que la cohérence ajustable?


A. Le fait que la cohérence s’ajuste au nombre de copies des données.
B. Le fait que la coordination est assurée entre les copies des données.
C. Le fait que le niveau de cohérence peut être défini au niveau de la requête.
D. Le fait que la cohérence s’ajuste au nombre de machines dans le cluster.

3. Qu’est-ce que le Polyglot Programming?


A. Le fait d’utiliser la programmation par aspects dans les applications Big Data.
B. La possibilité d’utiliser plusieurs langages de programmation dans la même application.
C. Le fait que les données utilisées dans les applications soient polyglottes.
D. Le fait que, pour un système donné, il est possible d’utiliser plusieurs types de bases de
données.

4. Que dit la propriété CAP?


A. La consistance, disponibilité et tolérance au partitionnement ne peuvent pas avoir lieu en
même temps.
B. Les systèmes Big Data doivent assurer à la fois la consistance, disponibilité et tolérance au
partitionnement.
C. Les seuls systèmes qui peuvent assurer la coordination, disponibilité et partage sont les
systèmes Big Data.
D. La coordination, disponibilité et partage doivent avoir lieu en même temps dans n’importe
quel système.

1
REPUBLIQUE TUNISIENNE
Ministère de l'Enseignement Supérieur et de la Recherche Scientifique
Université de Carthage
Institut National des Sciences Appliquées et de Technologie

5. Quelle affirmation est correcte??


A. La colocalité veut dire déplacer les données vers le traitement au lieu de déplacer le
traitement vers les données.
B. La colocalité veut dire déplacer le traitement vers les données au lieu de déplacer les
données vers le traitement.
C. La colocalité veut dire que toutes les données doivent être localisées sur la même
machine.
D. La colocalité veut dire que tous les traitements doivent être localisés sur la même machine.

6. Quelle propriété n’est PAS définie dans les systèmes BASE?


A. Basically Available.
B. Adjustable Consistency.
C. Soft-State.
D. Eventual Consistency.

7. Avec quel langage Spark est-il développé?


A. Java
B. Python
C. R
D. Scala

8. Avec quels langages est-il possible de créer des applications sur Spark?
A. Java et Scala.
B. Python et R.
C. Scala et Python.
D. Java, Scala, Python et R.

9. Le format d'abstraction de base de Spark est _____.


A. DStream.
B. RDD.
C. DataFrame.
D. Dataset.

10. Lequel des composants suivants ne fait pas partie de l'écosystème Spark?
A. Sqoop.
B. MLLib.
C. GraphX.
D. Aucun des trois ne fait partie de l'écosystème Spark.

11. Les transformations sur un RDD sont exécutées immédiatement.


A. Faux
B. Vrai

2
REPUBLIQUE TUNISIENNE
Ministère de l'Enseignement Supérieur et de la Recherche Scientifique
Université de Carthage
Institut National des Sciences Appliquées et de Technologie

12. Pourquoi les RDDs sont-ils immuables?


A. Pour gagner de l'espace en mémoire.
B. Pour accélérer le traitement.
C. Pour pouvoir les récupérer en cas de perte.
D. Pour éliminer les données inutiles.

13. Qu'est-ce que la lignée dans Spark?


A. Un graphe représentant l'enchaînement des RDDs créés
B. Le fait que les RDDs ne sont créés qu'à la dernière minute
C. Une structure distribuée en mémoire permettant de représenter les données d'un fichier.
D. La valeur retournée suite à l'exécution d'un calcul sur un RDD.

14. Qu'est-ce qui est vrai pour les RDDs?


A. C'est un paradigme de programmation.
B. C'est une collection immuable d'objets.
C. C'est une base de données.
D. C'est un fichier.

15. Qu'est-ce qui représente une limitation de Spark?


A. L'utilisation des évaluations paresseuses ralentit son exécution.
B. Il n'est pas tolérent aux fautes.
C. Il est coûteux en termes de consommation mémoire.
D. Sa communauté est limitée.

16. Que font les executors de Spark?


A. lancent des traitements et stockent des données pour les applications.
B. allouent les ressources nécessaires pour l'exécution de plusieurs tâches.
C. orchestrent les connexions entrantes venant des utilisateurs.
D. communiquent avec les noeuds du cluster pour jouer le rôle d'orchestrateurs.

17. Que veut dire le deuxième D de RDD?


A. Dataset
B. Distributed
C. Dataframe
D. Data

18. Quelle affirmation n'est pas correcte concernant Hadoop et Spark?


A. Les deux sont des plateformes de traitement de données.
B. Les deux sont des environnements de traitement distribué.
C. Les deux fournissent leurs propres systèmes de fichiers.
D. Les deux utilisent des APIs open-source pour faire le lien entre différents outils.

3
REPUBLIQUE TUNISIENNE
Ministère de l'Enseignement Supérieur et de la Recherche Scientifique
Université de Carthage
Institut National des Sciences Appliquées et de Technologie

19. Quelle caractéristique de Spark le rend plus performant que Hadoop Map Reduce?
A. Support des différents langages tels que Scala, Java, Python, etc.
B. Utilisation d'un moteur d'exécution de DAG (Direct Acyclic Graph) et le traitement en
mémoire
C. Les RDDs qui sont immuables et tolérants aux fautes.
D. Rien. Spark n’est pas plus performant que Map Reduce.

20. Quelle commande utilisons-nous pour vérifier si tous les démons de Spark sont
entrain de s’exécuter ?
A. fsck
B. distcp
C. spark ls
D. jps
21. Quelles caractéristique n'est pas associée aux RDD?
A. Immuables.
B. Distribués.
C. Uniques.
D. En mémoire.

22. Quelles opérations ne sont pas supportées par le framework Spark?


A. Traitement en streaming pûr.
B. Traitement en batch.
C. Traitement Machine Learning.
D. Traitement de graphes.

23. Quels gestionnaires de ressources est-ce que Spark supporte?


A. Standalone Cluster Manager
B. MESOS
C. YARN
D. Toutes les réponses sont correctes

24. Spark utilise l'architecture _____?


A. Master-Worker
B. Client-Server
C. Pipe-Filter
D. Ring.

25. Toutes les propositions suivantes sont correctes pour décrire Spark, SAUF _____.
A. Open Source
B. Supporte le traitement à la volée
C. Permet le stockage des données massives
D. Utilise l'approche distribuée.

26. Que permet de faire la commande docker run?


A. Démarrer un contenaire endormi
B. Exécuter une commande shell sur le contenaire
C. Créer un contenaire docker à partir d'une image
4
REPUBLIQUE TUNISIENNE
Ministère de l'Enseignement Supérieur et de la Recherche Scientifique
Université de Carthage
Institut National des Sciences Appliquées et de Technologie

D. Arrêter un contenaire en marche.

27. Que permet de faire la commande spark-submit?


A. Soumettre un fichier à HDFS pour qu'il soit utilisé dans une commande Spark.
B. Lancer un traitement sur l'une des machines Worker.
C. Créer un RDD à partir d'un fichier enregistré sur le disque.
D. Lancer un job Spark en lui fournissant le code à exécuter.

28. Avec quels langages est-il possible de créer des applications Map Reduce sur
Hadoop ?
A. Java
B. Python
C. C++
D. Toutes les réponses sont correctes.

29. Comparé aux bases de données relationnelles, Hadoop HDFS _____.


A. fournit une meilleure intégrité des données.
B. est plus performant pour réaliser des traitements par lot sur un grand volume de données.
C. exécute les transactions ACID
D. est adéquat pour des accès directs vers les données

30. Dans une configuration de haute disponibilité du NameNode, si le noeud actif


échoue, quel noeud pourra prendre sa place?
A. Secondary Name Node
B. Backup Node
C. Standby NameNode
D. Checkpoint Node.

31. Hadoop utilise l'architecture _____.


A. Master-Worker
B. Client-Server
C. Pipe-Filter
D. Ring

32. Le framework Hadoop est écrit en?


A. Python
B. C++
C. Scala
D. Java

33. Le noeud responsable du checkpointing dans Hadoop (1) télécharge la FsImage et le


EditLog du NameNode, puis (2) les fusionne, ensuite (3) sauvegarde la FsImage
modifiée _____.?
A. Sur le disque
B. Dans un Journal Node
C. En la renvoyant au Name Node actif.

5
REPUBLIQUE TUNISIENNE
Ministère de l'Enseignement Supérieur et de la Recherche Scientifique
Université de Carthage
Institut National des Sciences Appliquées et de Technologie

34. Lequel de ces éléments ne fait PAS partie de l'écosystème de Hadoop??


A. Sqoop
B. HBase
C. Cassandra
D. MongoDB.

35. Quel commentaire est faux à propos de Hadoop?


A. Hadoop fait partie du projet Apache
B. Hadoop peut exécuter tous les types de traitements Big Data
C. Hadoop peut s'exécuter sur des machines banalisées
D. Hadoop est un projet Open-Source

36. Quel fichier de configuration contient les paramètres des démons HDFS?
A. [Link]
B. [Link]
C. [Link]
D. Aucune des réponses n'est correcte

37. Quel fichier de configuration contient les paramètres des démons NodeManager et
Resource Manager?
A. [Link]
B. [Link]
C. [Link]
D. Aucune des réponses n'est correcte.

38. Quelle technologie peut être utilisée pour appliquer des algorithmes de Machine
Learning sur Hadoop?
A. Hive
B. Pig
C. HBase
D. Mahoot.

39. Quels types de données est-ce que Hadoop peut gérer?


A. Structurées
B. Non-structurées
C. Semi-structurées
D. Toutes les autres réponses.

40. Sur quelles plateformes Hadoop peut-il s'exécuter?


A. Les systèmes UNIX-like
B. Il est cross-platformes
C. Il n'a pas besoin d'un système d'exploitation
D. Uniquement sur Docker.

41. Toutes les propositions suivantes sont correctes pour décrire Hadoop, SAUF _____.
6
REPUBLIQUE TUNISIENNE
Ministère de l'Enseignement Supérieur et de la Recherche Scientifique
Université de Carthage
Institut National des Sciences Appliquées et de Technologie

A. Open Source
B. Temps réel
C. Basé sur Java
D. Utilise l'approche distribuée

42. Le DStream est la structure utilisé pour _____.


A. Spark Streaming
B. Spark Batch
C. Hadoop Map Reduce
D. MLlib.

43. Quelle technologie tournant au dessus de HDFS, permet de fournir des capacités
semblables à celles de Google BigTable à Hadoop?
A. HBase
B. Hive
C. Pig
D. HCatalog.

44. Quelle opération n’est pas disponible sur Spark ?


A. Map
B. Reduce
C. Shuffle
D. Sort

45. Quel V n’est pas utilisé pour qualifier les données Big Data ?
A. Validité
B. Venue
C. Variabilité
D. Viscosité

46. Que se passe-t-il si le nombre de reducers est mis à 0 dans Hadoop ?


A. Seule l’opération Reduce aura lieu
B. Seule l’opération Map aura lieu
C. Le résultat du Reduce sera le résultat final
D. Un seul reducer s’exécutera par défaut.

47. Lesquelles des phases suivantes se produisent simultanément ?


A. Shuffle et Map
B. Shuffle et Sort
C. Reduce et Sort

48. Lesquelles des phases suivantes se produisent simultanément ?


A. Copier des fichiers du système de fichiers local vers HDFS.
B. Copier des fichiers ou des répertoires du système de fichiers local vers HDFS
C. Copier des fichiers de HDFS vers le système de fichiers local
7
REPUBLIQUE TUNISIENNE
Ministère de l'Enseignement Supérieur et de la Recherche Scientifique
Université de Carthage
Institut National des Sciences Appliquées et de Technologie

D. Copier des fichiers ou des répertoires du HDFS vers le système de fichiers local.

49. Quelle est la séquence d’exécution correcte du flux des données dans MapReduce ?
(a) InputFormat (b) Mapper (c) Combiner (d) Reducer (e) Partitionner (f) Outputformat
A. abcdfe
B. acdefb
C. abcdef
D. abcedf

50. A quel moment au plus tôt la méthode reduce d'un Reducer donné peut-elle être
appelée ?
A. Dès qu'au moins un Mapper a fini de traiter les enregistrements.
B. Cela dépend du InputFormat utilisé pour le travail.
C. Pas avant que tous les Mapper aient fini de traiter les enregistrements.
D. Dès qu'un Mapper a émis au moins un enregistrement.

Vous aimerez peut-être aussi