0% ont trouvé ce document utile (0 vote)
4 vues1 page

Introduction au Big Data et Hadoop

Le document présente une série de questions et réponses sur HDFS, Hadoop, et les bases de données NoSQL, abordant des concepts tels que la scalabilité, la tolérance aux pannes, et les commandes spécifiques pour interagir avec Hive et HBase. Il souligne également les cas d'utilisation du Big Data et les caractéristiques des systèmes NoSQL. Enfin, il mentionne Apache Spark comme un outil d'analyse rapide pour le traitement des données.

Transféré par

meziou.ferouk2
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
4 vues1 page

Introduction au Big Data et Hadoop

Le document présente une série de questions et réponses sur HDFS, Hadoop, et les bases de données NoSQL, abordant des concepts tels que la scalabilité, la tolérance aux pannes, et les commandes spécifiques pour interagir avec Hive et HBase. Il souligne également les cas d'utilisation du Big Data et les caractéristiques des systèmes NoSQL. Enfin, il mentionne Apache Spark comme un outil d'analyse rapide pour le traitement des données.

Transféré par

meziou.ferouk2
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

‭Question 10‬ ‭Question 17‬ ‭Question 23‬

‭Question 1‬ ‭Parmi les caractéristiques suivantes, lesquelles décrivent correctement HDFS ?‬


‭Scalable‬ ‭Parmi les fonctionnalités suivantes, lesquelles sont spécifiquement offertes par HDFS 2.0 ?‬ ‭Quelle utilité fournit une interface en ligne de commande pour Hive ?‬
‭Pourquoi utilise-t-on le Big Data ?‬ ‭Tolérant aux pannes‬ ‭Haute disponibilité du NameNode.‬ ‭Hive shell‬
‭Distribué‬ ‭Le‬‭Federated NameNode‬‭.‬
‭Pour prendre des décisions stratégiques basées sur des données en temps réel.‬ ‭Un système de fichiers partagé à haut débit.‬ ‭(‬‭Hive shell‬‭est l'interface CLI qui permet d'exécuter des commandes Hive.)‬
‭(HDFS est conçu pour être‬‭scalable‬‭,‬‭distribué‬‭, et‬‭résilient aux pannes‬‭.)‬
‭Pour analyser de grands volumes de données et en extraire des informations utiles.‬ ‭Question 11‬
‭(HDFS 2.0 a introduit des améliorations comme la‬‭haute disponibilité du NameNode‬‭et le‬‭Federated‬ ‭Question 24‬
‭Quelle opération n'est pas permise par HDFS (Hadoop Distributed File System) ?‬
‭NameNode‬‭pour gérer plusieurs NameNodes indépendants.)‬
‭Question 2‬ ‭Modification‬ ‭Quelle commande Hive permet de lister les tables d'une base de données ?‬
‭(HDFS‬‭ne permet pas la modification‬‭des fichiers après leur écriture. On peut seulement les‬‭créer,‬
‭Question 18‬ ‭SHOW TABLES‬
‭Quels sont les cas d'utilisation du Big Data ?‬ ‭lire, copier et supprimer‬‭.)‬
‭Analyser les données de santé pour identifier des tendances épidémiologiques.‬ ‭Question 12‬ ‭Quelle commande permet de copier un fichier '[Link]' vers le dossier /user/cloudera dans‬ ‭(Cette commande affiche toutes les tables disponibles dans la base de données active.)‬
‭Détecter des fraudes dans les transactions financières.‬ ‭Quel mécanisme permet l'accès aux données dans HDFS pour effectuer des traitements distribués à‬ ‭HDFS ?‬
‭Question 3‬ ‭grande échelle ?‬ ‭hdfs dfs -put [Link] /user/cloudera/‬ ‭Question 25‬
‭Parmi les propositions suivantes, quelles sont les caractéristiques du Big Data basées sur les 5V ?‬ ‭MapReduce‬
‭Vélocité‬ ‭(MapReduce est le modèle de calcul distribué utilisé par Hadoop pour traiter‬‭de grandes quantités de‬ ‭(La commande‬‭hdfs dfs -put‬‭permet d’envoyer un fichier local vers‬‭HDFS‬‭.)‬ ‭Quelle commande HBase est utilisée pour ajouter des données dans une table ?‬
‭Volume‬ ‭données‬‭.)‬ ‭put‬
‭(Les 5V du Big Data sont :‬‭Volume, Vélocité, Variété, Véracité, et Valeur‬‭.)‬ ‭Question 13‬ ‭Question 19‬
‭(En‬‭HBase‬‭, la commande‬‭put‬‭est utilisée pour‬‭insérer des données‬‭dans une table.)‬
‭Question 4‬ ‭Quelles sont les tâches effectuées par le NameNode dans HDFS ?‬
‭Comment Hadoop garantit-il la fiabilité des données ?‬ ‭Gérer l'espace de noms et les métadonnées du système de fichiers.‬ ‭Quelle commande devrait être utilisée pour répertorier le contenu du répertoire‬
‭Question 26‬
‭La réplication des données.‬ ‭Maintenir le FsImage et l'EditLog.‬ ‭racine dans HDFS ?‬
‭Question 5‬ ‭Réguler l'accès des clients aux fichiers.‬
‭hdfs dfs -ls /‬ ‭En HBase, à quoi sert la commande 'count' ?‬
‭Hadoop adopte une approche particulière pour le traitement des données. Quelle est cette approche ?‬ ‭(Le‬‭NameNode‬‭est le maître du système HDFS. Il gère l’espace de noms, les métadonnées, et‬
‭Pour compter le nombre de lignes dans une table‬
‭Amener le traitement aux données.‬ ‭contrôle l’accès des clients aux fichiers.)‬ ‭(Cette commande‬‭liste le contenu‬‭du répertoire racine dans HDFS.)‬
‭Question 6‬ ‭Question 14‬ ‭(La commande‬‭count‬‭en‬‭HBase‬‭permet de‬‭compter le nombre total de lignes‬‭dans une table.)‬
‭Hadoop présente certaines limites. Parmi les propositions suivantes, lesquelles ne sont pas adaptées‬ ‭Comment peut-on étendre la capacité d'un cluster Hadoop ?‬ ‭Question 20‬
‭à Hadoop ?‬ ‭En ajoutant de nouveaux nœuds‬‭DataNode‬‭et‬‭NameNode‬‭au cluster.‬ ‭Question 27‬
‭Traitement de nombreux petits fichiers.‬ ‭(Ajouter des nœuds‬‭DataNode‬‭permet d'augmenter la capacité de stockage et la puissance de calcul‬ ‭Dans le modèle de programmation MapReduce, quelles tâches sont effectuées par l'étape Reduce ?‬
‭Calculs intensifs avec peu de données.‬ ‭du cluster.)‬ ‭Les données sont agrégées par les nœuds de travail.‬ ‭À quoi sert la commande 'scan' dans HBase ?‬
‭(Hadoop est optimisé pour le traitement de‬‭grands volumes de données‬‭et non pour de‬‭nombreux‬ ‭Question 15‬ ‭Pour afficher les données dans une table HBase‬
‭petits fichiers‬‭ou des‬‭calculs intensifs avec peu de données‬‭.)‬ ‭Que se passe-t-il lorsqu'un DataNode devient indisponible dans un système Hadoop ?‬ ‭(L'étape‬‭Reduce‬‭consiste à‬‭agréger et traiter les données‬‭après leur transformation par l'étape‬
‭Le système détecte la panne, marque le DataNode comme indisponible, puis réplique les blocs de‬ ‭Map‬‭.)‬ ‭(La commande‬‭scan‬‭en‬‭HBase‬‭permet d'afficher les données stockées dans une table.)‬
‭Question 7‬
‭Qu'est-ce qui rend l'accès SQL aux données Hadoop difficile ?‬ ‭données sur d'autres DataNodes.‬
‭(HDFS est conçu pour être tolérant aux pannes. Lorsqu’un‬‭DataNode‬‭tombe en panne, Hadoop le‬ ‭Question 21‬ ‭Question 28‬
‭Les données sont situées sur un système de fichiers distribué.‬
‭Les données sont dans de nombreux formats.‬ ‭détecte et réplique les données pour assurer la disponibilité.)‬
‭Quel langage est utilisé par Pig pour écrire des scripts de traitement de données sur la plateforme‬ ‭Quelle déclaration à propos de NoSQL est correcte ?‬
‭(Hadoop utilise‬‭HDFS‬‭, un système de fichiers distribué, ce qui complique l'accès SQL traditionnel.)‬ ‭C'est une technologie de base de données qui n'utilise pas le modèle relationnel traditionnel.‬
‭Hadoop ?‬
‭Question 8‬ ‭Pig Latin‬
‭Quel outil de l'écosystème Hadoop permet de gérer des données structurées à l'aide d'un langage‬ ‭Question 16‬ ‭(Les bases de données‬‭NoSQL‬‭sont conçues pour gérer de grandes quantités de données sans‬
‭similaire à SQL ?‬ ‭Quel est l'impact d'une défaillance du NameNode dans HDFS ?‬ ‭(Pig utilise‬‭Pig Latin‬‭, un langage de haut niveau permettant d'écrire des scripts pour traiter des‬ ‭utiliser un modèle relationnel traditionnel.)‬
‭Hive‬ ‭Interruption du service et impossibilité d'accéder aux données, bien que les données restent intactes sur‬ ‭données massives.)‬
‭(Hive est un outil qui permet d'utiliser‬‭un langage similaire à SQL‬‭pour interroger des données dans‬ ‭les DataNodes.‬
‭Hadoop.)‬ ‭Question 22‬
‭(Si le‬‭NameNode‬‭est indisponible, les données restent stockées sur les‬‭DataNodes‬‭, mais il est‬
‭impossible d’y accéder tant que le‬‭NameNode‬‭n'est pas restauré.)‬ ‭Quelle commande Hive est utilisée pour interroger une table ?‬
‭Question 9‬
‭SELECT‬
‭Quel outil de l'écosystème Hadoop offre une interface web graphique permettant d'interagir facilement‬
‭avec Hive, Pig, et d'autres composants ?‬
‭(Hive utilise une syntaxe similaire à‬‭SQL‬‭, et‬‭SELECT‬‭permet d'interroger des données dans une‬
‭Hue‬
‭table.)‬
‭(Hue est une interface web qui facilite l'utilisation de‬‭Hive, Pig, et d'autres outils Hadoop‬‭.)‬

‭Question 29‬

‭Quelles sont les caractéristiques des bases de données NoSQL ? (Choisissez toutes les bonnes‬
‭réponses)‬
‭Peuvent stocker des données de types différents au sein du même système‬
‭Offrent une grande souplesse dans la gestion des structures de données‬
‭Ne suivent pas un schéma fixe‬

‭(Les bases de données‬‭NoSQL‬‭sont flexibles, capables de gérer des‬‭données non structurées‬‭et‬


‭semi-structurées‬‭, et n'imposent pas un schéma fixe comme les bases de données‬
‭relationnelles.)‬

‭Question 30‬

‭Parmi les outils d'analyse suivants, lequel est généralement reconnu comme le plus rapide pour le‬
‭traitement des données ?‬
‭Spark‬

‭(‬‭Apache Spark‬‭est plus rapide que‬‭Hive‬‭et‬‭Pig‬‭car il traite les données‬‭en mémoire‬‭au lieu de les‬
‭stocker sur disque.)‬

Vous aimerez peut-être aussi