0% ont trouvé ce document utile (0 vote)
2 vues10 pages

Big Data

Le document est un examen de Big Data pour le Master 2 MIAGE IPM, comprenant des questions sur les concepts fondamentaux des SGBD et des algorithmes comme Map-Reduce et Spark. Les questions évaluent la compréhension des propriétés des Big Data, des systèmes de gestion de bases de données (SGBD) et des modèles de distribution de données. L'examen est structuré en plusieurs exercices, chacun visant à tester les connaissances théoriques et pratiques des étudiants.
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
2 vues10 pages

Big Data

Le document est un examen de Big Data pour le Master 2 MIAGE IPM, comprenant des questions sur les concepts fondamentaux des SGBD et des algorithmes comme Map-Reduce et Spark. Les questions évaluent la compréhension des propriétés des Big Data, des systèmes de gestion de bases de données (SGBD) et des modèles de distribution de données. L'examen est structuré en plusieurs exercices, chacun visant à tester les connaissances théoriques et pratiques des étudiants.
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Année universitaire 2018-2019

MASTER 2 MIAGE IPM


Semestre 3 Session 2

Lundi 8 Juillet 2019

Big Data

1 Heure

Cours de F. Ravat

Aucun document autorisé – Mettre vos initiales dans chaque pied de page

Nom Prénom : Note

Exercice 1 : connaissances

Pour chacune des questions suivantes, vous pouvez sélectionner la réponse 0 si aucune réponse est adaptée
à la question OU vous pouvez sélectionner un ou plusieurs chiffres (1, 2, 3 ou 4), chacun d'eux correspondant
à une réponse. La notation est la suivante :
• 1 point pour une bonne réponse
• 0 si aucune réponse
• 0.5 pour une réponse incomplète
• -1 point pour une réponse fausse

Page 1 sur 10
Questions Réponses

0 1 2 3 4

1 Sélectionner dans la liste ci-dessous uniquement des propriétés des Big Data
correspondant aux 3V initiaux

1. Valeur / Value
2. Volume / Volume
3. Véracité / Veracity
4. Validation / Validation
2 Dans l'écosystème de HADOOP, HIVE est

1. Un SGBD orienté colonnes


2. UN SGBD orienté documents
3. Un ETL
4. Un langage de scripting
3 Cypher est un langage du SGBD

1. MongoDB
2. Cassandra
3. NEO4J
4. HBASE
4 Dans une BD relationnelles Maitre/Esclave

1. Toutes les écritures se font sur tous les sites


2. Les lectures se font sur le maitre
3. Il y a égalité entre les sites
4. Toutes les lectures se font sur les BD esclaves
5 UN SGBD orienté Document

1. Repose sur le concept de graphes


2. Repose sur le concept de structure arborescente
3. Repose sur le principe de colonne
4. Repose sur le principe de tables
6 Dans une base de données relationnelles réparties

1. L'allocation des données n'est pas transparente à l'utilisateur final


2. Il n'y a pas égalité entre les sites du système réparti
3. La BD est vue et manipulée comme une BD centralisée par l'utilisateur
4. Il n'y a qu'un seul SGBD
7 ACID

1. Correspond aux propriétés des SGBD NOSQL


2. Permet de caractériser un système réparti
3. Permet de spécifier les caractéristiques des BIG DATA
4. Permet, entre autres, de caractériser l'isolation d'une transaction dans un
SGBD relationnelles

Page 2 sur 10
Questions Réponses

0 1 2 3 4

8 Tout SGBD NOSQL

1. Offre une plus grande flexibilité dans la gestion des données qu'un SGBD
relationnelles
2. Repose sur des schémas de données dynamiques
3. Est principalement centré sur la consistance des données
4. Supporte des transactions ACID
9 Le modèle de données d'un SGBD NOSQL peut être

1. Orienté ligne
2. Orienté documents
3. Clé-schéma
4. Orienté graphe
10 Dans un SGBD clé-valeur

1. Chaque objet est identifié par une clé unique


2. Une valeur peut contenir une structure contenant des clés et des valeurs
3. Le modèle de données est considéré comme complexe
4. Peut être implanté à l'aide de Mongo DB
11 Un SGBD orienté Document

1. Est adapté pour une application de réseaux sociaux


2. Peut contenir plus de données qu'un SGBD clé-valeur
3. Peut contenir plus de données qu'un SGBD orienté colonnes
4. Peut être implanté à l'aide de NEO4J
12 Le SGBD NOSQL qui permet de gérer les données les plus complexes est

1. Un SGBD orienté graphe


2. Un SGBD orienté document
3. Un SGBD orienté colonne
4. Un SGBD clé-valeur
13 La distribution de HADOOP peut s’effectuer avec

1. Hortonworks
2. Cloudera qui est une solution sur le cloud
3. Microsoft Cortana Analytics qui est une solution on Premise
4. SPARK
14 Le SGBD NOSQL qui permet de gérer la plus grosse volumétrie de données est :

1. Un SGBD orienté graphe


2. Un SGBD orienté document
3. Un SGBD orienté colonne
4. Un SGBD clé-valeur

Page 3 sur 10
Questions Réponses

0 1 2 3 4

15 Le SGBD NOSQL qui offre le moins de fonctionnalités pour développer une


application est :

1. Un SGBD orienté graphe


2. Un SGBD orienté document
3. Un SGBD orienté colonne
4. Un SGBD clé-valeur
16 Quels sont les concepts que l'on peut trouver dans le SGBD CASSANDRA

1. Super Column
2. Column Familly
3. CQL
4. Cypher
17 Les modèles de distribution de données des SGBD NOSQL peuvent être

1. Single server
2. Multiple servers
3. Peer to Peer Replication
4. Multiple sharding
18 MongoDB repose sur

1. Un modèle de données clé-valeur


2. Un modèle de données pouvant être normalisé
3. Un modèle de donnés pouvant être imbriqué
4. Un modèle de données orienté colonne
19 HDFS est :

1. Un SGBD NOSQL
2. Un modèle de données d'un SGBD NOSQL
3. Un modèle de distribution de données d'un SGBD NOSQL
4. Un composant de NEO4J
20 HBASE est un

1. Système de gestion distribuée de fichiers


2. Composant du framework HADOOP
3. Un SGBD NOSQL de la même famille que NEO4J
4. Un SGBD NOSQL de la même famille que CASSANDRA
21 La commande MATCH appartient au langage

1. SQL
2. MQL
3. CQL
4. CYPHER
22 Dans les modèles de distribution des données des SGBD NOSQL, le sharding

1. Repose sur un seul serveur


2. Accepte la duplication de données
3. Répartit les données sur plusieurs serveurs
4. Repose sur le principe Maitre escalve

Page 4 sur 10
Questions Réponses

0 1 2 3 4

23 Dans HADOOP, l'outil qui permet d'écrire des commandes équivalentes à SQL est :

1. HDFS
2. MAP-REDUCE
3. SQOOP
4. Hive
24 Le théorème CAP

1. Défini les propriétés d'un système réparti


2. Est spécifique à l'environnement HADOOP
3. Est un modèle de données NOSQL
4. Est un modèle de distribution de données d'un SGBD NOSQL
25 Sélectionner les SGBD orientés colonne

1. HBASE
2. Cassandra
3. Oriented DB
4. Oracle
26 D'après le théorème CAP, un SGBD relationnel est

1. CA
2. CP
3. AP
4. CAP
27 D'après le théorème CAP, un SGBD NOSQL peut être :

1. CA
2. CP
3. AP
4. CAP
28 Le principe BASE est associé

1. Aux SGBD NOSQL


2. A MAP-REDUCE
3. A HADOOP
4. Au cloud computing
29 Dans HADOOP, HDFS est

1. L'équivalent d'un ETL


2. Un système de fichiers centralisé
3. Un système de fichiers distribué
4. Une SGBD NOSQL orienté colonne
30 Donner tous les types de cloud dans la liste ci-dessous

1. Public Cloud
2. Private Cloud
3. Hybrid Cloud
4. Community Cloud

Page 5 sur 10
Page 6 sur 10
Année universitaire 2018-2019

Big Data
Cours de A. Berro

Aucun document autorisé – Mettre vos initiales dans chaque pied de page

Nom Prénom : Note

Exercice Map - Reduce

Un réseau social comportant de très nombreuses personnes enregistre la liste de celles-ci et de leurs amis
sur la forme d’un fichier texte. Chaque ligne du fichier commence par l’identifiant de la personne. Celui-ci est
suivi des identifiants de chacun de ses amis. Dans l’exemple ci-dessous, la personne 7 a les personnes 18, 45
et 34 comme amies et réciproquement, 18, 45 et 34 ont 7 comme amie.
7 18 45 34
18 45 7 1

1. Expliquez le fonctionnement d’un programme Map-Reduce.


2. Pour chaque couple de personnes, expliquez comment obtenir à l’aide l’algorithme Map-Reduce
la liste des personnes amies en commun.
3. Généralisez l’algorithme précédent afin de pouvoir connaitre la liste des personnes amies en
commun de n personnes.

Page 7 sur 10
Page 8 sur 10
Page 9 sur 10
Question de cours - Spark

Ecrivez le graphe acyclique orienté ("Directed Acyclic Graph") permettant de réaliser un programme qui
compte dans un texte le nombre d’occurrences de chaque mot contenant la chaine de caractère « par » ?
Vous donnerez une explication de chaque transformation et/ou action effectuée sur les RDD.

Page 10 sur 10

Vous aimerez peut-être aussi