0% menganggap dokumen ini bermanfaat (0 suara)
4 tayangan1 halaman

Panduan Dasar PySpark untuk DataFrame

Dokumen ini adalah lembar curang untuk menggunakan Python dan PySpark dalam ilmu data, mencakup berbagai fungsi seperti pengelompokan, pemilihan, penyaringan, dan manipulasi DataFrame. Terdapat juga contoh kode untuk menjalankan SQL queries, mengelola nilai yang hilang, dan menyimpan data ke dalam berbagai format. Selain itu, dokumen ini menjelaskan cara membuat dan mengelola SparkSession serta DataFrames dari berbagai sumber data.

Diterjemahkan oleh

ScribdTranslations
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd
0% menganggap dokumen ini bermanfaat (0 suara)
4 tayangan1 halaman

Panduan Dasar PySpark untuk DataFrame

Dokumen ini adalah lembar curang untuk menggunakan Python dan PySpark dalam ilmu data, mencakup berbagai fungsi seperti pengelompokan, pemilihan, penyaringan, dan manipulasi DataFrame. Terdapat juga contoh kode untuk menjalankan SQL queries, mengelola nilai yang hilang, dan menyimpan data ke dalam berbagai format. Selain itu, dokumen ini menjelaskan cara membuat dan mengelola SparkSession serta DataFrames dari berbagai sumber data.

Diterjemahkan oleh

ScribdTranslations
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd

Lembar Curang Python untuk Ilmu Data

NilaiDuplikat Pengelompokan
>>> df = [Link]()
PySpark - Dasar-Dasar SQL >>> [Link]("usia")\
.count() \
Keolmpokkabnedrasakranusia,hitunganggotanya
didalamkelompok

Kueri .tampilkan()

>>> dari [Link] import functions sebagai F


Pilih
Saring
>>> [Link]("firstName").show() TampilkansemuaentridalamfirstNamekolom >>> [Link](df["age"]>24).show() Filter entri umur, hanya simpan
>>> [Link]("namaDepan","namaBelakang") \
PySpark & Spark SQL .tampilkan()
TampilkansemuaentridifirstName , usia
itu
catatanyangnilainyaadalah>24
>>> [Link]("firstName",
Spark SQL adalah modul Apache Spark untuk "age", dantipe
Urutkan
bekerjadengandataterstruktur. meledakkan("nomorTelepon") \
.alias("contactInfo")) \
>>>[Link]([Link]()).collect()
.select("[Link]",
MenginisialisasiSparkSession "firstName",
>>> [Link]("umur", ascending=False).collect()
>>>[Link](["usia","kota"],ascending=[0,1])\
Sebuah SparkSession dapat digunakan untuk membuat DataFrame, mendaftarkan DataFrame sebagai tabel, "age") \ .kumpulkan()
.tampilkan()
execute SQLover tables, cache tables, and read parquet files. >>> [Link](df["firstName"], df["age"] + 1) Tampilkan semua entri di firstName dan
age , .tampilkan() tambah
1 keentridariusia
>>> dari [Link] import SparkSession >>> [Link](df['age'] > 24).show() Tampilkansemuaentridimanaage>24 Mengganti & Mengisi Nilai yang Hilang
>>> spark = SparkSession \ Kapan
.builder \ >>> [Link]("firstName", TampilkanfirstNamedan0atau1tergantung
.appName("Contoh dasar Python Spark SQL") \ >>> [Link](50).tampilkan()Ganti nilai null
[Link]([Link] > 30, 1) diusia>30 >>> [Link]().tampilkan() Kembalikanyangbarudfmenghilangkan baris dengan nilai null
.config("[Link]","some-value") \ .lainnya(0))\ >>> [Link] Kembalikanbarudfmenggantikansatunilaidengan
.getOrCreate() .show() .ganti(10, 20) \lain
>>> df[[Link]("Jane","Boris")] TampilkanfirstNamejikadalamopsiyangdiberikan
.tampilkan()
MembuatDataFrames Seperti
.kumpulkan()

DariRDDs
>>> [Link]("firstName", TampilkanfirstName,dan lastNameis
[Link]("Smith")) \TRUEiflastNameis likeSmith
Repartisi
.tampilkan()
>>> dari [Link] import * Dimulai-dari-Akhir-dari >>>[Link](10) dfdengan10partisi
>>> [Link]("namaDepan", TunjukkanfirstName,dan BENARjika .rdd \
InferSchema .getNumPartitions()
>>> sc = [Link] [Link] lastNamemulaidenganSm
>>> df dengan1partisi
>>> garis = [Link]("[Link]") .startswith("Sm") \
.tampilkan() [Link](1).[Link]()
>>> parts = [Link](lambda l: [Link](",")) >>> [Link]([Link]("th"))\Tampilkan nama belakang yang diakhiri dengan
>>> orang = [Link](lambda p: Row(nama=p[0], umur=int(p[1]))) th .show() Menjalankan SQLQueries Secara Programatis
>>> peopledf = [Link](people) Ssubstring
TentukanSkema >>> [Link]([Link](1, 3) \ KembalikansubstringdarifirstName Mendaftarkan DataFrame sebagai Tampilan
>>> orang = [Link](lambda p: Baris(nama=p[0], .alias("nama") \
age=int(p[1].strip()))) .kumpulkan() >>>[Link]("people")
>>> schemaString ="name age" Antara >>>[Link]("customer")
>>> [Link]([Link](22, 24)) \ Tampilkanage:values areTRUEjika antara
>>>fields = [StructField(field_name, StringType(), True) >>>[Link]("customer")
.tampilkan() 22dan24
untuk field_name dalam [Link]()]
>>> skema = TipeStruktur(kolom) TanyaTampilan
>>> [Link](orang, skema).show() Tambahkan, Perbarui & Hapus Kolom >>> df5 = [Link]("SELECT * FROM customer").show()
+--------+---+
| name|age| peopledf2 = [Link]("PILIH * DARI global_temp.people")
+--------+---+
| Mine|28|
MenambahkanKolom .tampilkan()
| Filip|29|
|Jonathan|30| >>> df = [Link]('kota', [Link]) \
+--------+---+ .withColumn('kodePos',[Link]) \
Dari Sumber Data Spark .withColumn('state',[Link]) \
.withColumn('streetAddress',[Link]) \
Keluaran
JSON .withColumn('nomorTelepon',
meledakkan([Link])) \
Struktur Data
>>> df = [Link]("[Link]") .withColumn('tipeTelepon',
>>>[Link]() >>> rdd1 = [Link] Konversidfmenjadi RDD
+--------------------+---+---------+--------+-------------------- meledakkan([Link])) >>> [Link]().first() KonversidfmenjadiRDDstring
| address|age|firstName |lastName|
+ phoneNumber| >>> [Link]() KembalikankontendfasPandas
+--------------------+---+---------+--------+--------------------
+
MemperbaruiKolom DataFrame
|[New York,10021,N...| 25| John Smith|[[212555-1234,ho...]
|[New York,10021,N...| 21| Jane Doe|[[322888-1234,ho...| >>> df = [Link]('telePhoneNumber','phoneNumber') Tulis & Simpan ke File
+--------------------+---+---------+--------+--------------------
+ MenghapusKolom >>> [Link]("namaDepan","kota")\
.tulis
>>> df2 = [Link]("[Link]", format="json")
File Parquet >>> df = [Link]("alamat","nomorTelepon") .simpan("[Link]")
>>> df3 = [Link]("[Link]") >>> df = [Link]([Link]).drop([Link]) >>> [Link]("firstName","age") \
.write \
File TXT .save("[Link]",format="json")
DataInspeksi
>>> [Link] Kembalidfnamakolomdantipedata >>> [Link]().tampilkan() Hitung statistik ringkasan MenghentikanSparkSession
>>> [Link]() Tampilkankontendaridf >>> [Link] Kembalikan kolom daridf
Kembalikanyangpertama >>> [Link]() Hitungjumlahbarisdalamdf >>> [Link]()
>>> [Link]() n baris
>>>[Link]() Kembalikanbarispertama >>> [Link]().count() Hitungjumlahbarisyangberbedadidf
>>> [Link](2) Kembalikanbarispertama >>> [Link]() Cetakskemadaridf
>>> skema df Kembalikanskemadaridf >>> [Link]() Cetakrencana(logisdanfisik)

Anda mungkin juga menyukai