0% menganggap dokumen ini bermanfaat (0 suara)
2 tayangan1 halaman

Panduan Dasar PySpark untuk DataFrame

Dokumen ini adalah lembar curang untuk menggunakan Python dan PySpark dalam data sains, mencakup berbagai fungsi seperti penghapusan duplikasi, pengelompokan, pemilihan, penyaringan, dan pengurutan data. Selain itu, dokumen ini menjelaskan cara membuat DataFrame, menjalankan kueri SQL, dan mengelola kolom dalam DataFrame. Terdapat juga contoh penggunaan untuk membaca dan menyimpan data dalam format JSON dan Parquet.

Diterjemahkan oleh

ScribdTranslations
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd
0% menganggap dokumen ini bermanfaat (0 suara)
2 tayangan1 halaman

Panduan Dasar PySpark untuk DataFrame

Dokumen ini adalah lembar curang untuk menggunakan Python dan PySpark dalam data sains, mencakup berbagai fungsi seperti penghapusan duplikasi, pengelompokan, pemilihan, penyaringan, dan pengurutan data. Selain itu, dokumen ini menjelaskan cara membuat DataFrame, menjalankan kueri SQL, dan mengelola kolom dalam DataFrame. Terdapat juga contoh penggunaan untuk membaca dan menyimpan data dalam format JSON dan Parquet.

Diterjemahkan oleh

ScribdTranslations
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd

Lembar Curang Python untuk Data Sains

NilaiDuplikat GroupBy
>>> df = [Link]()
PySpark - Dasar-Dasar SQL >>> [Link]("umur")\
.count()
Keolmpokkabnedrasakranusia,countthemembers
didalamkelompok

Kueri .show()

>>> dari [Link] import functions sebagai F


Pilih
Saring
>>> [Link]("firstName").tampilkan() TampilkansemuaentridifirstNamekolom >>> [Link](df["age"]>24).show() Filter entri usia, hanya simpan
>>> [Link]("namaDepan","namaBelakang") \
PySpark & Spark SQL .tampilkan()
TampilkansemuaentridifirstName , usia
itu
rekamanyangnilainyaadalah>24
>>> [Link]("firstName",
Spark SQL adalah modul Apache Spark untuk "age", dantipe
Urutkan
workingwithstructureddata. meledakkan("nomorTelepon") \
.alias("contactInfo")) \
>>>[Link]([Link]()).collect()
.select("[Link]",
Menginisialisasi SparkSession "firstName",
>>> [Link]("umur", ascending=False).collect()
>>>[Link](["umur","kota"],ascending=[0,1])\
SparkSession dapat digunakan untuk membuat DataFrame, mendaftarkan DataFrame sebagai tabel, "age") \ .kumpulkan()
.tampilkan()
eksekusi SQLdi atas tabel, tabel cache, dan baca file parquet. >>> [Link](df["firstName"],df["age"] + 1) Tampilkan semua entri di firstName dan
age , .show() tambahkan
1 keentridariage
>>> dari [Link] impor SparkSession
>>> spark = SparkSession \
>>> [Link](df['age'] > 24).show()
Kapan
Tampilkansemuaentridimanaage>24 Mengatasi & Mengganti Nilai
.builder \ >>> [Link]("namaDepan", TampilkanfirstNamedan0atau1tergantung
.appName("Python Spark SQL basic example") \ >>> [Link](50).tampilkan()Ganti nilai null
[Link]([Link] > 30, 1) \ diusia>30 > [Link]().show() Kembalikanbarudfmenghapus baris dengan nilai nol
.config("[Link]","some-value") \ .sebaliknya(0))\
.getOrCreate() >>> [Link] \ Kembalibarudfmenggantisatunilaidengan
.tampilkan() .gantikan(10, 20) \lain
>>> df[[Link]("Jane", "Boris")] TampilkanfirstNamejikadalamopsiyangdiberikan
.show()
MembuatDataFrames Seperti
.kumpulkan()

DariRDDs
>>> [Link]("namaDepan", TunjukkanfirstName,dan lastNameis
[Link]("Smith")) \TRUEjika lastName mirip Smith
Pereciptaan Ulang
.tampilkan()
>>> dari [Link] import * MulaiDengan-AkhirDengan >>>[Link](10) dfdengan10partisi
>>> [Link]("firstName", TampilkanfirstName,dan BENARjika .rdd \
InferSchema .getNumPartitions()
>>> sc = [Link] [Link] lastNamemulaidenganSm
>>> df dengan1partisi
>>> baris = [Link]("[Link]") .startswith("Sm") \
.tampilkan() [Link](1).[Link]()
>>> parts = [Link](lambda l: [Link](",")) >>> [Link]([Link]("th"))\Tampilkan nama belakang yang diakhiri dengan
>>> people = [Link](lambda p:Row(name=p[0],age=int(p[1]))) th .tampilkan() Menjalankan SQLQueries Secara Programatik
peopledf = [Link](orang) Ssubstring
TentukanSkema >>> [Link]([Link](1, 3) \ KembalikansubstringdarifirstName Mendaftar DataFrame sebagai Tampilan
>>> orang = [Link](lambda p: Row(nama=p[0], .alias("name")
usia=int(p[1].strip()))) .kumpulkan() >>>[Link]("people")
>>> schemaString ="name age" Antara >>>[Link]("customer")
>>> [Link]([Link](22, 24)) \ Tampilkanage:values areTRUEjika di antara
>>>fields = [StructField(nama_field, StringType(), True) >>>[Link]("customer")
.tampilkan() 22dan24
untuk field_name dalam [Link]()]
>>> skema = StructType(fields) QueryViews
>>> [Link](people, schema).show()
+--------+---+
Tambah, Perbarui & Hapus Kolom >>> df5 = [Link]("SELECT * FROM customer").show()
| name|age| >>> peopledf2 = [Link]("SELECT * FROM global_temp.people")\
+--------+---+
| Saya|28|
MenambahkanKolom .tampilkan()
| Filip|29|
|Jonathan|30| >>> df = [Link]('kota', [Link]) \
+--------+---+ .withColumn('kodePos',[Link]) \
Dari Sumber Data Spark .withColumn('state',[Link]) \
.withColumn('streetAddress',[Link]) \
Keluaran
JSON .withColumn('telePhoneNumber',
meledakkan([Link])) \
StrukturData
>>> df = [Link]("[Link]") .withColumn('tipeTelepon',
>>>[Link]() >>> rdd1 = [Link] Ubahdfke dalam RDD
+--------------------+---+---------+--------+-------------------- meledakkan([Link])) >>> [Link]().first() KonversidfkedalamRDDstring
| address|age|firstName |lastName|
+ phoneNumber| >>> [Link]() KembalikankontendfasPandas
+--------------------+---+---------+--------+--------------------
+
Memperbarui Kolom DataFrame
|[New York,10021,N...| 25| John Smith|[[212555-1234,ho...
|[New York,10021,N...| 21| Jane| Doe|[[322888-1234,ho...| >>> df = [Link]('telePhoneNumber','phoneNumber') Tulis & Simpan ke File
+--------------------+---+---------+--------+--------------------
+ MenghapusKolom >>> [Link]("firstName","kota")\
.tulis \
>>> df2 = [Link]("[Link]", format="json")
BerbagaiJenisParquet >>> df = [Link]("alamat","nomorTelepon") .save("[Link]")
>>> df3 = [Link]("[Link]") >>> df = [Link]([Link]).drop([Link]) >>> [Link]("firstName","age") \
.tulis \
Berkas TXT .simpan("[Link]", format="json")
PeriksaData
>>> [Link] Kembalidfnamakolomdantipedata >>> [Link]().tampilkan() Hitung statistik ringkasan MenghentikanSparkSession
>>> [Link]() Tampilkankontendaridf >>> [Link] Kembalikan kolom daridf
Kembalikanpertama n rows >>> [Link]() Hitungjumlahbarisdidf >>> [Link]()
>>> [Link]()
>>>[Link]() Kembalikanbarispertama >>> [Link]().hitung() Hitungjumlahbarisyangberbedadidf
>>> [Link](2) Kembalikanbarispertama >>> [Link]() Cetakskemadaridf
>>> [Link] Kembalikanskemadaridf >>> [Link]() Cetakrencana(logisdanfisik)

Anda mungkin juga menyukai