Guide rapide PySpark 3.0 et API
Guide rapide PySpark 3.0 et API
0
Qu'est-ce qu'Apache Spark ? Catalogue PySpark ([Link]) • Fonction Distribuée
‒pourChaque()
• Framework de calcul en cluster open source • cacheTable() ‒pourChaquePartition()
• Entièrement évolutif et tolérant aux pannes • viderLeCache()
• API simples pour Python, SQL, Scala et R • creerTable() Transformations de DataFrame PySpark
• Flux continus et applications par lots • createExternalTable() • Données groupées
• Bibliothèques intégrées pour l'accès aux données, le streaming, • currentDatabase ‒cube()
intégration des données, traitement des graphes, et • dropTempView() ‒groupBy()
analyse avancée / apprentissage automatique • listerBasesDeDonnées() ‒pivot()
• listTables() ‒cogroupe()
SparkTerminology • listerFonctions() • Statistiques
• listerColonnes() ‒approxQuantile()
• Pilote : le processus local qui gère le • isCached() ‒corr()
session spark et résultats retournés • recoverPartitions() ‒compter()
• Travailleurs : nœuds informatiques qui effectuent • actualiserTableau() ‒cov()
calcul parallèle • rafraîchirParChemin() ‒tableau croisé
• Exécuteurs : processus sur les nœuds de travail • registerFunction() ‒décrire()
qui effectue le calcul parallèle • setCurrentDatabase() ‒freqItems()
• Action : soit une instruction de retour • uncacheTable() ‒résumé()
quelque chose au conducteur ou pour afficher des données
API des sources de données PySpark • Contrôle de colonne / cellule
un système de fichiers ou une base de données ‒drop() # supprime des colonnes
• Lecteur d'entrée / Source de streaming ‒fillna() #alias pour [Link]()
• La transformation : c'est tout ce qui n'est pas un ([Link], [Link])
action et sont effectuées de manière paresseuse ‒select(), selectExpr()
‒charger() ‒avecColonne()
• Carte : indique les opérations qui peuvent s'exécuter dans un ‒schéma() ‒avecColonneRenommée()
mode indépendante des lignes ‒table() ‒colRegex()
• Écrivain de sortie / Système de streaming
• Réduire : indique des opérations qui ont • Contrôle de ligne
dépendances intra-ligne ([Link], [Link])
‒bucketBy() ‒asc()
• Le mélange : c'est le mouvement des données de ‒insérerDans() ‒asc_nulls_first()
exécuteurs pour exécuter une opération de réduction ‒asc_nulls_last()
‒mode()
• RDD : Jeu de données distribué redondant est ‒modeDeSortie() # diffusion ‒desc()
le format de données en mémoire héritée ‒partitionnerPar() ‒desc_nulls_first()
• DataFrame : un objet orienté flexible
‒sauvegarder() ‒desc_nulls_last()
‒enregistrerCommeTable() ‒distinct()
structure de données qui a une ligne/colonne ‒trierPar() ‒dropDuplicates()
schéma ‒démarrer() # streaming ‒dropna() #alias pour [Link]
• Ensemble de données : une structure de données semblable à un DataFrame
‒déclencher() # diffusion ‒filtrer()
qui n'a pas de schéma de lignes/colonnes • Entrée / Sortie commune ‒limite()
‒csv() • Triage
Bibliothèques Spark ‒format() ‒asc()
• ML est la bibliothèque d'apprentissage automatique avec ‒jdbc() ‒asc_nulls_first()
outils pour les statistiques, la caractérisation, l'évaluation, ‒json() ‒asc_nulls_last()
parquet()
classification, clustering, frequent item ‒option(), options() ‒desc()
exploitation minière, régression et recommandation
‒orc() ‒desc_nulls_first()
• GraphFrames / GraphX:is the graph ‒texte() ‒desc_nulls_last()
bibliothèque d'analytique ‒trier()/ordonnerPar()
• Le Streaming Structuré : est la bibliothèque qui Streaming structuré ‒trierDansLesPartitions()
gère le streaming en temps réel via des micro- • RequêteDeFlux • Échantillonnage
‒échantillon()
lots et DataFrames non bornés ‒awaitTermination() ‒échantillonPar()
‒exception()
Types de données Spark ‒expliquer() ‒randomSplit()
• {"Strings":"Chaînes"} ‒pour chacun() • Transformations NA (Null/Manquant)
TypeChaine ‒pourChaqueLot() ‒[Link]()
• Dates / Heures ‒id ‒[Link]()
‒TypeDeDate ‒isActive ‒[Link]()
TypeHorodatage ‒lastProgress • Mise en cache / Point de contrôle / Pipelining
• Numérique ‒name ‒point de contrôle()
TypeDécimal ‒traiterTousLesDisponibles() ‒pointDeContrôleLocal()
TypeDouble ‒recentProgress ‒persist(), unpersist()
TypeFlottant ‒runId ‒avecFiligrane() # streaming
ByteType ‒status ‒toDF()
TypeEntier ‒arrêter()
GestionnaireDeRequêtesDeFlux ([Link]) ‒transformer()
TypeLong • • Rejoindre
TypeCourt actif
• Types complexes ‒attendreTouteTerminaison() ‒diffuser()
‒get() ‒joindre()
TypeTableau ‒crossJoin()
‒MapType ‒réinitialiserTerminé()
‒TypeDeStructure ‒saufTout()
‒StructField Actions de DataFrame PySpark ‒indice()
• Autre • Sortie locale (conducteur) ‒intersect(),intersectAll()
TypeBooléen ‒collect() ‒soustraire()
TypeBinaire ‒montrer() ‒union()
Type null (Aucun) ‒toJSON() ‒unionParNom()
‒toLocalIterator() • Pandas Python
Session PySpark (spark) ‒toPandas() ‒appliquer()
• [Link]() ‒prendre() ‒pandas_udf()
• [Link]() ‒queue( ‒mapInPandas()
• [Link] • Status Actions ‒applyInPandas()
• [Link]() ‒colonnes() • SQL
[Link]() ‒expliquer() ‒créerVueTemporaireGlobale()
• ‒estLocal()
• [Link]() ‒estEnStreaming()
‒createOrReplaceGlobalTempView()
• [Link]() ‒printSchema() ‒createOrReplaceTempView()
• [Link]() ‒types ‒createTempView()
• Contrôle de partition ‒registerJavaFunction()
‒repartition() ‒enregistrerJavaUDAF()
‒repartitionnerParPlage()
‒coalesce()