0% ont trouvé ce document utile (0 vote)
4 vues8 pages

Introduction à Spark en Java 8

Le rapport présente un TP sur l'utilisation d'Apache Spark pour des traitements batch et en streaming, ainsi que son intégration avec Hadoop et YARN. Il décrit le déploiement d'applications Spark sur un cluster Hadoop via Docker et illustre la soumission d'un job Spark, mettant en avant la robustesse de Spark pour gérer des workloads massifs. En conclusion, le TP démontre l'efficacité de Spark dans le big data et ouvre des perspectives pour des applications avancées comme le traitement de flux et l'apprentissage automatique.

Transféré par

basma.moujane
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
4 vues8 pages

Introduction à Spark en Java 8

Le rapport présente un TP sur l'utilisation d'Apache Spark pour des traitements batch et en streaming, ainsi que son intégration avec Hadoop et YARN. Il décrit le déploiement d'applications Spark sur un cluster Hadoop via Docker et illustre la soumission d'un job Spark, mettant en avant la robustesse de Spark pour gérer des workloads massifs. En conclusion, le TP démontre l'efficacité de Spark dans le big data et ouvre des perspectives pour des applications avancées comme le traitement de flux et l'apprentissage automatique.

Transféré par

basma.moujane
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd

Rapport du TP 8 : spark

Réalisé par : Encadré par :

Moujane Basma NAJAH SAID


1. Objectifs du TP

Utiliser Apache Spark pour réaliser des traitements par lot (batch) et en streaming.

Découvrir l’intégration de Spark avec Hadoop et YARN.

Déployer des applications Spark sur un cluster Hadoop via Docker.

2.1. Lancement du Cluster Hadoop avec Docker

Démarrage des conteneurs :

Initialisation des services Hadoop :

3.1. Code Spark en Scala

Exécution dans Spark-Shell :


Fichiers générés : part-00000 et part-00001 avec le décompte des mots.

4. Spark Batch en Java

4.1. Création du Projet Maven


5. Génération du JAR

Resultat :Lancement du code dans local:


La partie 1:
Lancement du code sur le cluster
Nous avons créé un fichier JAR contenant notre programme MapReduce, que nous avons ensuite
copié dans un conteneur Docker afin de l’exécuter dans l’environnement Hadoop.
Resultat:

La partie 2:
Explication:

Cette section illustre la procédure de soumission d'un job Spark sur un cluster YARN en mode
cluster. La commande spark-submit est utilisée pour configurer les paramètres d'exécution,
incluant la classe principale de l'application, l'allocation des ressources (mémoire et CPU),
ainsi que les chemins des données d'entrée et de sortie. À l'issue du traitement, les résultats
sont validés et stockés avec succès dans HDFS, attestant du bon déroulement du job et de
l'efficacité du traitement distribué. Ce cas d'usage met en lumière la robustesse de Spark
dans la gestion de workloads massifs, tout en soulignant son intégration harmonieuse avec
l'écosystème Hadoop pour le stockage et la gestion des données à grande échelle.

Conclusion :

Ce TP a offert une introduction pratique à la programmation avec Apache Spark en Java. À


travers l’exemple emblématique du WordCount, nous avons exploré les étapes clés :
chargement des données depuis HDFS, transformation et analyse via les RDDs (Resilient
Distributed Datasets), puis sauvegarde des résultats.

L’expérience a également mis en lumière les modes d’exécution de Spark, notamment son
déploiement sur un cluster YARN, démontrant son aptitude à gérer des calculs distribués à
large échelle.

En synthèse, Spark se positionne comme un outil incontournable pour le big data, alliant
performance élevée, ergonomie et interopérabilité avec l’écosystème Hadoop. Ce travail
ouvre des perspectives vers des applications avancées telles que le traitement de flux en
temps réel, l’apprentissage automatique avec MLlib, ou l’exploration de données via Spark
SQL, renforçant son utilité dans des scénarios analytiques complexes.

Vous aimerez peut-être aussi