0% menganggap dokumen ini bermanfaat (0 suara)
2 tayangan1 halaman

Panduan Dasar PySpark untuk DataFrame

Dokumen ini menjelaskan dasar-dasar penggunaan PySpark dan Spark SQL untuk mengelola data terstruktur, termasuk cara membuat DataFrame, melakukan operasi seperti menghapus duplikat, grup, filter, dan mengubah kolom. Selain itu, dokumen ini juga mencakup cara membaca dan menulis data dari/ke berbagai format file seperti JSON dan Parquet. Pengguna juga diajarkan cara menjalankan kueri SQL dan mengelola nilai yang hilang dalam dataset.

Diterjemahkan oleh

ScribdTranslations
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd
0% menganggap dokumen ini bermanfaat (0 suara)
2 tayangan1 halaman

Panduan Dasar PySpark untuk DataFrame

Dokumen ini menjelaskan dasar-dasar penggunaan PySpark dan Spark SQL untuk mengelola data terstruktur, termasuk cara membuat DataFrame, melakukan operasi seperti menghapus duplikat, grup, filter, dan mengubah kolom. Selain itu, dokumen ini juga mencakup cara membaca dan menulis data dari/ke berbagai format file seperti JSON dan Parquet. Pengguna juga diajarkan cara menjalankan kueri SQL dan mengelola nilai yang hilang dalam dataset.

Diterjemahkan oleh

ScribdTranslations
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd

PythonUntukIlmuDataPengingat NilaiDuplikat GroupBy

>>> df = [Link]()
PySpark - Dasar-Dasar SQL >>> [Link]("usia")\
.hitung()
Keolmpokkabnedrasakranusia,hitunganggota
didalamgrup
Kueri .tampilkan()

>>> dari [Link] import fungsi sebagai F


Pilih
Saringan
>>> [Link]("firstName").show() TampilkansemuaentridifirstNamekolom >>> [Link](df["umur"]>24).show() Saring entri umur, hanya simpan
>>> [Link]("namaDepan", "namaBelakang") \
PySpark & Spark SQL .show()
TampilkansemuaentridifirstName , usia
itu
catatanyangnilainyaadalah>24
>>> [Link]("namaDepan",
Spark SQL adalah modul Apache Spark untuk "age", dantipe
Urutkan
bekerjadengandataterstruktur. meledakkan("nomorTelepon")
.alias("informasiKontak") \
>>>[Link]([Link]()).collect()
.select("[Link]",
MenginisialisasiSparkSession "firstName",
>>> [Link]("umur", ascending=False).collect()
>>>[Link](["usia","kota"],ascending=[0,1])\
Sebuah SparkSession dapat digunakan untuk membuat DataFrame, mendaftarkan DataFrame sebagai tabel, usia .kumpulkan()
.tampilkan()
eksekusi SQLdi atas tabel, tabel cache, dan baca file parquet. >>> [Link](df["firstName"], df["age"] + 1) Tampilkan semua entri di firstName dan
age , .tampilkan() tambah
1 keentridariusia
>>> dari [Link] import SparkSession >>> [Link](df['umur'] > 24).tampilkan() Tampilkansemuaentridimanaage>24 Nilai yang Hilang & Mengganti Nilai
>>> spark = SparkSession \ Kapan
.builder \ >>> [Link]("firstName", TunjukkanfirstNamedan0atau1tergantung
.appName("Contoh dasar Python Spark SQL") \ >>> [Link](50).tampilkan()Ganti nilai null
[Link]([Link] > 30, 1) \ diusia>30 >>> [Link]().tampilkan() Kembalikanbarudfmenghapus baris dengan nilai null
.config("[Link]","some-value") \ .lainnya(0))\ >>> [Link] \ Kembalikanbarudfmenggantisatunilaidengan
.dapatAtauBuat() .tampilkan() .gantikan(10, 20) \yang lain
>>> df[[Link]("Jane","Boris")] TunjukkanfirstNamejikadalamopsiyangdiberikan
.tampilkan()
MembuatDataFrames Seperti
.collect()

FromRDDs
>>> [Link]("firstName", TampilkanfirstName,dannamaBelakangadalah
[Link]("Smith")\TRUEjikanamaBelakangsepertiSmith
Repartisi
.tampilkan()
>>> dari [Link] import * Dimulai dengan - Diakhiri dengan >>>[Link](10) dfdengan10partisi
>>> [Link]("firstName", TunjukkanfirstName,dan BENARjika .rdd \
InferSchema .getNumPartitions()
>>> sc = [Link] [Link] lastNamedimulaidenganSm
>>> df dengan1partisi
>>> baris = [Link]("[Link]") .startswith("Sm") \
.tampilkan() [Link](1).[Link]()
>>> parts = [Link](lambda l: [Link](",")) >>> [Link]([Link]("th"))\Show last names ending in
>>> orang = [Link](lambda p: Row(nama=p[0], usia=int(p[1]))) th .tampilkan() Menjalankan SQLQueries Secara Programatis
>>> peopledf = [Link](orang) Ssubstring
TentukanSkema >>> [Link]([Link](1, 3) \ KembalikansubstringdarifirstName Mendaftarkan DataFrame sebagai Tampilan
>>> orang = [Link](lambda p: Row(nama=p[0], .alias("nama") \
age=int(p[1].strip()))) .koleksi() [Link]("orang")
>>> schemaString ="name age" Antara >>>[Link]("customer")
>>> [Link]([Link](22, 24)) \ Tampilkanage:values areTRUEjika antara >>>[Link]("customer")
>>>fields = [StructField(nama_field, StringType(), True) .tampilkan() 22dan24
untuk field_name dalam [Link]()
>>> skema = StructType(fields) QueryViews
>>> [Link](people, schema).show() Tambahkan, Perbarui & Hapus Kolom >>> df5 = [Link]("SELECT * FROM customer").show()
+--------+---+
| name|age| >>> peopledf2 = [Link]("SELECT * FROM global_temp.people")\
+--------+---+
| Saya|28|
MenambahkanKolom .tampilkan()
| Filip|29|
|Jonathan|30| >>> df = [Link]('kota',[Link]) \
+--------+---+ .withColumn('kodePos',[Link]) \
Dari Sumber Data Spark .withColumn('state',[Link]) \
.withColumn('streetAddress',[Link]) \
Keluaran
JSON .withColumn('telePhoneNumber',
meledakkan([Link])) \
StrukturData
>>> df = [Link]("[Link]") .withColumn('jenisTelepon',
>>>[Link]() >>> rdd1 = [Link] Konversidfke dalam RDD
+--------------------+---+---------+--------+-------------------- meledakkan([Link]) >>> [Link]().first() KonversidfmenjadiRDDstring
| address|age|firstName |lastName|
+ phoneNumber| >>> [Link]() KembalikanisidfasPandas
+--------------------+---+---------+--------+--------------------
+
MemperbaruiKolom DataFrame
|[New York,10021,N...| 25| John Smith|[[212555-1234,ho...
|[New York,10021,N...| 21| Jane Doe|[[322888-1234,ho...]| >>> df = [Link]('telePhoneNumber','phoneNumber') Tulis & Simpan ke File
+--------------------+---+---------+--------+--------------------
+ MenghapusKolom >>> [Link]("firstName","city")\
.tulis \
>>> df2 = [Link]("[Link]", format="json")
File Parquet >>> df = [Link]("alamat","nomorTelepon") .simpan("[Link]")
>>> df3 = [Link]("[Link]") >>> df = [Link]([Link]).drop([Link]) >>> [Link]("firstName","age") \
.tulis \
BerkasTXT .save("[Link]",format="json")
InspectData
>>> [Link] Kembalikandfnamakolomdantipedata >>> [Link]().show() Hitung statistik ringkasan Menghentikan SparkSession
>>> [Link]() Tampilkankontendaridf >>> [Link] Kembalikankolom-kolomdaridf
Kembalikanpertama n baris >>> [Link]() Hitungjumlahbarisdidf >>> [Link]()
>>> [Link]()
>>>[Link]() Kembalikanbarispertama >>> [Link]().count() Hitungjumlahbarisyangberbedadidf
>>> [Link](2) Kembalikanbarispertama >>> [Link]() Cetakskemadaridf
>>> [Link] Kembalikanskemadaridf >>> [Link]() Cetakrencana(logisdanfisik)

Anda mungkin juga menyukai