0% ont trouvé ce document utile (0 vote)
3 vues4 pages

TEST1

Le document est un devoir surveillé sur les bases de données massives, centré sur Hadoop et le modèle MapReduce. Il contient des questions à choix multiples et un problème pratique sur la détermination des anagrammes à partir d'une liste de mots. Les étudiants doivent démontrer leur compréhension des concepts Hadoop, HDFS et MapReduce à travers des exercices et des schémas.

Transféré par

me
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
3 vues4 pages

TEST1

Le document est un devoir surveillé sur les bases de données massives, centré sur Hadoop et le modèle MapReduce. Il contient des questions à choix multiples et un problème pratique sur la détermination des anagrammes à partir d'une liste de mots. Les étudiants doivent démontrer leur compréhension des concepts Hadoop, HDFS et MapReduce à travers des exercices et des schémas.

Transféré par

me
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

lOMoARcPSD|59332879

Ds big data Novembre 2023 final

Big Data (Institut Supérieur des Etudes Technologiques de Zaghouan)

messages.pdf_cover_qr_code_label

messages.studocu_not_sponsored_or_endorsed_by_college
messages.downloaded_by
lOMoARcPSD|59332879

Nom ……………………………Prénom…………………………………Classe………..
-----------------------------------------------------------------------------------------------------------------
Devoir surveillé
Unité d’enseignement : Bases de Données Classes : DSI31 et DSI32
Massives
Durée : 1 Heure Nombre de pages : 3
Date : 09/11/2023 Heure de début : 9 H00
Proposé par : Ons Ben Rejeb et Yosra Kassis Documents Autorisés : NON
NB :
- Le détail du calcul de tous les exercices doit figurer dans la feuille de réponse
- Il vous est demandé d’apporter un soin particulier à la présentation de votre copie.
- Merci de rendre la feuille du QCM
QCM (06 points)

1) Parmi ces caractéristiques, une seule ne correspond pas à HADOOP, laquelle ?

o Open source
o Temps réel
o Basé sur le langage java
o Approche de calcul distribué

2) Quel est le rôle du namenode sous HDFS ?

o Coordination des jobs mapreduce


o Gestion des stocks dans les noeuds
o Gestion d’accès aux fichiers par les utilisateurs
o Report périodique du statut des datanodes

3) Quelle est la phrase correcte concernant HDFS ?

o Accès aléatoire aux données en lecture et en écriture


o Les données peuvent être crées, modifiées ou supprimées
o L’accès aux données se fait via mapreduce
o Les données sont découpées en fichiers de petite taille

4) Quel est le nombre de réplicas pour HDFS ?


o 2
o 3
o 4
o 5
5) Quel est le rôle du jobTracker dans mapreduce ?
o Exécute les tâches mapreduce
o Garde le traitement proche des données (dans le même nœud)
o Reporte le statut des datanodes
o Gère le stockage
Page 1 / 3

messages.downloaded_by
lOMoARcPSD|59332879

NE RIEN ECRIRE ICI

------------------------------------------------------------------------------------------------------------------------------

6) Le mécanisme qui permet d’éviter la perte de données sous HDFS est :

o La réplication
o La partition
o La scalabilité
o Yarn

7) JobTracker fonctionne sur le :

o NameNode
o DataNode
o NameNode secondaire
o DataNode secondaire

8) Qu’est ce qui rend l’accès par des requêtes SQL à HADOOP difficile

o Les données hadoop sont structurées


o Les données sont situées dans un système de fichier dsitribué
o Les données sont de différents formats
o Hadoop requière un schéma prédéfini

9) Lequel de ces éléments est responsable de la réplication des données dans


HADOOP ?
o Task Tracker
o Job Tracker
o NameNode
o DataNode

10) Quand Hadoop est-il utile ?

o Lorsque toutes les données sont non structurées


o Lorsque les traitements peuvent être effectués en parallèle
o Lorsque l’application requiert un accès aux données à faible latence
o Lorsque l’application nécessite un accès aléatoire aux données

11) Où sont stockés les fichiers de sortie de la tâche Reduce ?

o Dans un entrepôt de données


o En mémoire
o Dans le DataNode
o Dans le système de fichiers Linux

12) HDFS est un système de fichier :


o Distribué
o Redondé
o Centralisé
Page 2 / 3

messages.downloaded_by
lOMoARcPSD|59332879

Problème: Les anagrammes (14 points)

Dans cet exercice nous allons suivre le modèle MapReduce pour déterminer à partir
d’une liste de mots lesquels sont des anagrammes.
Une anagramme: Un mot est une anagramme d’un autre mot si leurs lettres sont
identiques.
Exemples :
- Aimer et Marie sont des anagrammes, Melon et Lemon sont des anagrammes.

On dispose d’un fichier contenant une liste de mots de la langue française (Taille
fichier = 580 MO). On souhaite déterminer quels mots sont des anagrammes.

Questions
1) Combien de nœuds au minimum avons-nous besoin dans notre cluster Hadoop afin de
stocker le fichier. Expliquer (1pt)
2) Donner dans un schéma de la répartition des différents blocs du fichier sur les
différents data nodes du cluster. (2pts)
3) Quelle est la solution proposée par Hadoop pour assurer la disponibilité des données?
(1pt)
4) Si le disque du NameNode (NN) est défaillant, les données seront perdues. Quelle est
la solution trouvée par Hadoop pour résoudre ce problème ? (1pt)
5) Dans le cas où le disque dur de l’un des data nodes tombe en panne, quelle est la
réaction du système Hadoop? (1pt)
6) Quelles sont les quatre étapes nécessaires du modèle MapReduce ? (1pt)
7) Proposer un schéma qui récapitule le processus de recherche des anagrammes en
respectant le modèle MapReduce, en spécifiant l’entrée et la sortie de chaque étape des
quatre étapes précédentes. (6pts).
Note : On suppose qu’on dispose de cette fonction :
✓ String [Link](chaine) qui permet de trier une chaine de caractères (par
ordre alphabétique).

8) Qu’est ce que vous proposez pour optimiser l’étape de reduce pour que la charge ne
soit pas prise par un seul datanode ? (1pt)

Bon Travail

Page 3 / 3

messages.downloaded_by

Vous aimerez peut-être aussi