0% ont trouvé ce document utile (0 vote)
3 vues1 page

Comp

Le document présente une comparaison entre Spark et Hadoop, soulignant que Spark offre un cadre unifié pour le traitement de Big Data, permettant des performances jusqu'à 100 fois plus rapides en mémoire. Il explique également que Spark nécessite l'intégration de divers outils pour des cas d'utilisation spécifiques et que les workflows de traitement doivent être exprimés en patterns MapReduce. Enfin, il aborde les défis liés à l'exécution séquentielle des jobs MapReduce dans des scénarios plus complexes.

Transféré par

Rim Achour
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
3 vues1 page

Comp

Le document présente une comparaison entre Spark et Hadoop, soulignant que Spark offre un cadre unifié pour le traitement de Big Data, permettant des performances jusqu'à 100 fois plus rapides en mémoire. Il explique également que Spark nécessite l'intégration de divers outils pour des cas d'utilisation spécifiques et que les workflows de traitement doivent être exprimés en patterns MapReduce. Enfin, il aborde les défis liés à l'exécution séquentielle des jobs MapReduce dans des scénarios plus complexes.

Transféré par

Rim Achour
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Big Data

Contenu Analytics__5ERP-BI1
Calendrier Annonces Discussions Carnet de notes 2 Messages Groupes Réussites
× Comparaison
Flux entre
d'activité
Spark et Hadoop
Contenu du cours
Filtrer
Corps enseignant du cours
Page de
Afficher tout
l'établissement Nesrine BOUAZIZI
Supports des séances en ligne
ENSEIGNANT
Spark
Rim ACHOUR

Important
• propose un framework complet et unifié pour répondre aux besoins de traitements Big Data pour divers jeux de données, divers par leur nature (texte, graphe,
etc.) aussi bien que par le type de source (batch ou flux temps-réel).
A propos du Module Détails et actions
Activité • permet à des applications sur clusters Hadoop d’être exécutées jusqu’à 100 fois plus vite en mémoire, 10 fois plus vite sur disque.
• permet d’écrire rapidement RSE__5ERP-BI1
des applications en Java, Scala ou Python Annuaire
22 sept. 2025
Échéance dépassée : Vérifiez vos acquis d'apprentissage ! Ignorer Afficher tous les membres de
Cours Date d'échéance : 19/09/2024 23:59 (UTC+1)
votre cours
Chapitre 1 - Introduction
Présence
Calendrier Hadoop et Spark RSE__5ERP-BI1
10 sept. 2025 Afficher votre présence
Échéance dépassée : Quelle contribution de votre pays aux Ignorer
Hadoop ODD ? Manuels et outils
Messages Comparaison entre Spark et Hadoop
Date d'échéance : 09/07/2024 23:59 (UTC+1)
Afficher les outils du cours et de
• technologie de traitement de données depuis 10 ans
l'établissement
• la solution de
Les fonctionnalités de choix
Spark pour le traitement de gros volumes de données.
Notes RSE__5ERP-BI1
10 sept. 2025
MapReduce Échéance dépassée : Vérifiez vos acquis d'apprentissage ! Ignorer
Date d'échéance : 09/07/2024 23:59 (UTC+1)
Assist L’écosystème Spark
• Chaque étape d’un workflow de traitement étant constituée d’une phase de Map et d’une phase de Reduce, il est nécessaire d’exprimer tous les cas d’utilisation
sous forme de patterns MapReduce pour tirer profit de cette solution.
RSE__5ERP-BI1
Outils • Les données22en
Architecture sortie
sept. 2025de l’exécution de chaque étape doivent être stockées sur système de fichier distribué avant que l’étape suivante commence. Cette
Échéance dépassée : Quel est le périmètre de la RSE ? Ignorer
approche a tendance à être peu rapide à cause de la réplication et du stockage sur disque.
Date d'échéance : 12/09/2024 23:59 (UTC+1)

Déconnexion Exécution d’un


Hadoop job spark
nécessite l’intégration de plusieurs outils pour les différents cas d’utilisation big data (comme Mahout pour le Machine Learning et Storm pour le traitement par
flux). RSE__5ERP-BI1
28 sept. 2025
Confidentialité Échéance dépassée : Testez vos connaissances ! Ignorer
Installation spark
Si on souhaite mettre en place quelque chose de plus complexe, on doit enchaîner une série de jobs MapReduce et les exécuter séquentiellement, chacun de ces jobs
Conditions générales Date d'échéance : 28/09/2024 23:59 (UTC+1)

Vous aimerez peut-être aussi