0% ont trouvé ce document utile (0 vote)
6 vues2 pages

Guide rapide PySpark 3.0 et API

Ce document résume les concepts clés et les API de PySpark 3.0. Il couvre les fondamentaux de Spark tels que les RDD, les DataFrames et les Datasets. Il aborde également les modules PySpark pour SQL, le streaming, l'apprentissage automatique et le traitement de graphes. Enfin, il résume les transformations et actions courantes des DataFrames pour manipuler les données ainsi que les fonctionnalités de Spark SQL.

Traduit par

ScribdTranslations
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
6 vues2 pages

Guide rapide PySpark 3.0 et API

Ce document résume les concepts clés et les API de PySpark 3.0. Il couvre les fondamentaux de Spark tels que les RDD, les DataFrames et les Datasets. Il aborde également les modules PySpark pour SQL, le streaming, l'apprentissage automatique et le traitement de graphes. Enfin, il résume les transformations et actions courantes des DataFrames pour manipuler les données ainsi que les fonctionnalités de Spark SQL.

Traduit par

ScribdTranslations
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Guide de Référence Rapide PySpark 3.

0
Qu'est-ce qu'Apache Spark ? Catalogue PySpark ([Link]) • Fonction Distribuée
‒pourChaque()
• Framework de calcul en cluster open source • cacheTable() ‒pourChaquePartition()
• Entièrement évolutif et tolérant aux pannes • viderLeCache()
• API simples pour Python, SQL, Scala et R • creerTable() Transformations de DataFrame PySpark
• Flux continus et applications par lots • createExternalTable() • Données groupées
• Bibliothèques intégrées pour l'accès aux données, le streaming, • currentDatabase ‒cube()
intégration des données, traitement des graphes, et • dropTempView() ‒groupBy()
analyse avancée / apprentissage automatique • listerBasesDeDonnées() ‒pivot()
• listTables() ‒cogroupe()
SparkTerminology • listerFonctions() • Statistiques
• listerColonnes() ‒approxQuantile()
• Pilote : le processus local qui gère le • isCached() ‒corr()
session spark et résultats retournés • recoverPartitions() ‒compter()
• Travailleurs : nœuds informatiques qui effectuent • actualiserTableau() ‒cov()
calcul parallèle • rafraîchirParChemin() ‒tableau croisé
• Exécuteurs : processus sur les nœuds de travail • registerFunction() ‒décrire()
qui effectue le calcul parallèle • setCurrentDatabase() ‒freqItems()
• Action : soit une instruction de retour • uncacheTable() ‒résumé()
quelque chose au conducteur ou pour afficher des données
API des sources de données PySpark • Contrôle de colonne / cellule
un système de fichiers ou une base de données ‒drop() # supprime des colonnes
• Lecteur d'entrée / Source de streaming ‒fillna() #alias pour [Link]()
• La transformation : c'est tout ce qui n'est pas un ([Link], [Link])
action et sont effectuées de manière paresseuse ‒select(), selectExpr()
‒charger() ‒avecColonne()
• Carte : indique les opérations qui peuvent s'exécuter dans un ‒schéma() ‒avecColonneRenommée()
mode indépendante des lignes ‒table() ‒colRegex()
• Écrivain de sortie / Système de streaming
• Réduire : indique des opérations qui ont • Contrôle de ligne
dépendances intra-ligne ([Link], [Link])
‒bucketBy() ‒asc()
• Le mélange : c'est le mouvement des données de ‒insérerDans() ‒asc_nulls_first()
exécuteurs pour exécuter une opération de réduction ‒asc_nulls_last()
‒mode()
• RDD : Jeu de données distribué redondant est ‒modeDeSortie() # diffusion ‒desc()
le format de données en mémoire héritée ‒partitionnerPar() ‒desc_nulls_first()
• DataFrame : un objet orienté flexible
‒sauvegarder() ‒desc_nulls_last()
‒enregistrerCommeTable() ‒distinct()
structure de données qui a une ligne/colonne ‒trierPar() ‒dropDuplicates()
schéma ‒démarrer() # streaming ‒dropna() #alias pour [Link]
• Ensemble de données : une structure de données semblable à un DataFrame
‒déclencher() # diffusion ‒filtrer()
qui n'a pas de schéma de lignes/colonnes • Entrée / Sortie commune ‒limite()
‒csv() • Triage
Bibliothèques Spark ‒format() ‒asc()
• ML est la bibliothèque d'apprentissage automatique avec ‒jdbc() ‒asc_nulls_first()
outils pour les statistiques, la caractérisation, l'évaluation, ‒json() ‒asc_nulls_last()
parquet()
classification, clustering, frequent item ‒option(), options() ‒desc()
exploitation minière, régression et recommandation
‒orc() ‒desc_nulls_first()
• GraphFrames / GraphX:is the graph ‒texte() ‒desc_nulls_last()
bibliothèque d'analytique ‒trier()/ordonnerPar()
• Le Streaming Structuré : est la bibliothèque qui Streaming structuré ‒trierDansLesPartitions()
gère le streaming en temps réel via des micro- • RequêteDeFlux • Échantillonnage
‒échantillon()
lots et DataFrames non bornés ‒awaitTermination() ‒échantillonPar()
‒exception()
Types de données Spark ‒expliquer() ‒randomSplit()
• {"Strings":"Chaînes"} ‒pour chacun() • Transformations NA (Null/Manquant)
TypeChaine ‒pourChaqueLot() ‒[Link]()
• Dates / Heures ‒id ‒[Link]()
‒TypeDeDate ‒isActive ‒[Link]()
TypeHorodatage ‒lastProgress • Mise en cache / Point de contrôle / Pipelining
• Numérique ‒name ‒point de contrôle()
TypeDécimal ‒traiterTousLesDisponibles() ‒pointDeContrôleLocal()
TypeDouble ‒recentProgress ‒persist(), unpersist()
TypeFlottant ‒runId ‒avecFiligrane() # streaming
ByteType ‒status ‒toDF()
TypeEntier ‒arrêter()
GestionnaireDeRequêtesDeFlux ([Link]) ‒transformer()
TypeLong • • Rejoindre
TypeCourt actif
• Types complexes ‒attendreTouteTerminaison() ‒diffuser()
‒get() ‒joindre()
TypeTableau ‒crossJoin()
‒MapType ‒réinitialiserTerminé()
‒TypeDeStructure ‒saufTout()
‒StructField Actions de DataFrame PySpark ‒indice()
• Autre • Sortie locale (conducteur) ‒intersect(),intersectAll()
TypeBooléen ‒collect() ‒soustraire()
TypeBinaire ‒montrer() ‒union()
Type null (Aucun) ‒toJSON() ‒unionParNom()
‒toLocalIterator() • Pandas Python
Session PySpark (spark) ‒toPandas() ‒appliquer()
• [Link]() ‒prendre() ‒pandas_udf()
• [Link]() ‒queue( ‒mapInPandas()
• [Link] • Status Actions ‒applyInPandas()
• [Link]() ‒colonnes() • SQL
[Link]() ‒expliquer() ‒créerVueTemporaireGlobale()
• ‒estLocal()
• [Link]() ‒estEnStreaming()
‒createOrReplaceGlobalTempView()
• [Link]() ‒printSchema() ‒createOrReplaceTempView()
• [Link]() ‒types ‒createTempView()
• Contrôle de partition ‒registerJavaFunction()
‒repartition() ‒enregistrerJavaUDAF()
‒repartitionnerParPlage()
‒coalesce()

➢ Solutions de migration ➢ Conseil technique


[Link]
➢ Solutions analytiques ➢ Éducation
Guide de référence rapide PySpark 3.0
Fonctions de DataFrame PySpark • Date & Time • Collections (Arrays & Maps)
‒ajouter_mois() ‒tableau()
• Agrégations ([Link]()) ‒date_actuelle() ‒array_contains()
‒agg() ‒current_timestamp() ‒array_distinct()
‒approx_count_distinct() ‒date_add(), date_sub() ‒array_except()
‒compter() ‒format_date() ‒array_intersect()
‒compterDistinct() ‒date_trunc() ‒array_join()
‒moyenne()
‒datediff() ‒array_max(), array_min()
‒min(), max() ‒jourdeSemaine() ‒position_du_tableau()
‒premier(), dernier()
‒jourdumois() ‒array_remove()
‒grouper() ‒jourdelannée() ‒array_repeat()
‒grouping_id() ‒from_unixtime() ‒array_sort()
‒kurtosis() ‒from_utc_timestamp() ‒array_union()
‒asymétrie() ‒heure() ‒superposition_des_tableaux()
‒écarttype() ‒dernier_jour(),prochain_jour()
‒écart_type_pop()
‒arrays_zip()
minute() ‒creer_carte()
‒stddev_samp() ‒mois() ‒element_at()
‒somme() ‒mois_entre() ‒aplatir()
‒sommeDistinct() ‐quart() ‒map_concat()
‒var_pop() ‒seconde() ‒map_entries()
‒var_samp() ‒à_date() ‒map_from_arrays()
‒variance() ‒to_timestamp() ‒map_from_entries()
• Opérateurs de colonne
‒to_utc_timestamp() ‒map_keys()
‒alias() ‒trunc() ‒map_values()
entre() ‒timestamp_unix() ‒séquence()
contient() ‒semaineannée() ‒mélanger()
‒eqNullSafe() ‒fenêtre() ‒taille()
‒isNull(), isNotNull() ‒year() ‒tranche()
‒isin() Chaine ‒trier_tableau()
‒isnan() •
‒concat() • Conversion
‒comme() ‒concat_ws() ‒base64(), unbase64()
‒rlike() ‒format_string() ‒bin()
‒getItem() ‒initcap() ‒cast()
‒getField() ‒instr() ‒conv()
‒startswith(), endswith() ‒longueur() ‒encode(), decode()
Mathématiques de base
• ‒levenshtein() ‒from_avro(), to_avro()
‒abs() ‒localiser() ‒from_csv(), to_csv()
‒exp(), expm1() ‒lower(), upper() ‒from_json(), to_json()
‒factorielle() ‒lpad(), rpad() ‒get_json_object()
‒plancher(), plafond()
‒plus grand(),moins grand() ‒ltrim(), rtrim() ‒hex(), unhex()
‒superposer()
‒pow() ‒regexp_extract() Agrégats Fenêtrés PySpark
‒round(), bround() ‒regexp_replace() • Opérateurs de fenêtre
‒rand() ‒répéter() ‒sur()
‒randn() ‒reverse() • Spécification de fenêtre
‒sqrt(), cbrt() ‒soundex() ‒orderBy()
‒log(), log2(), log10(), log1p() ‒split() ‒partitionnerPar()
‒signum() ‒sous-chaîne() ‒intervalleEntre()
• Trigonométrie ‒substring_index() ‒rowsBetween()
‒cos(), cosh(), acos() ‒traduire() • Fonctions de classement
‒degrés() ‒trim() ‒ntile()
‒hypot() Hashes ‒percentRank()
‒radians() •
‒crc32() ‒rang(), rangDense()
‒sin(), sinh(), asin() ‒hash() ‒numéro_de_ligne()
‒tan(), tanh(), atan(), atan2() ‒md5() • Fonctions analytiques
• Statistiques multivariées ‒sha1(), sha2() ‒cume_dist()
‒corr() ‒xxhash64() ‒lag(), lead()
‒covar_pop() Spécial • Fonctions d'agrégation
‒covar_samp() •
‒col() ‒Toutes les fonctions d'agrégation listées
• Logique conditionnelle
‒expr() • Exemple de spécification de fenêtre
‒coalescer() ‒nom_fichier_entree() de [Link] import Window
‒nanvl() ‒lit() windowSpec = \
sinon() ‒id_en_croissance_monotone() Fenêtre
‒quand() ‒spark_partition_id() .partitionBy(...) \
• Mise en forme .orderBy(...)
‒format_string() .rowsBetween(début, fin) # Spécification de fenêtre ROW
‒formater_nombre() # ou
• Création de ligne .rangeBetween(début, fin) #RANGE Spécification de fenêtre
‒explode(), explode_outer()
‒posexplode(), posexplode_outer() # exemple d'utilisation dans une transformation de DataFrame
• Inférence de schéma [Link]('rang',rank(...).over(windowSpec)
‒schema_de_csv()
‒schéma_de_json()
©WiseWithData 2020-Version 3.0-0622

➢ Solutions de migration ➢ Consultation technique


[Link]
➢ Solutions analytiques ➢ Éducation

Vous aimerez peut-être aussi