0% menganggap dokumen ini bermanfaat (0 suara)
5 tayangan1 halaman

Panduan Dasar PySpark untuk Ilmu Data

PySpark dan Spark SQL memungkinkan kerja dengan data terstruktur di Apache Spark. Sebuah SparkSession dapat digunakan untuk membuat DataFrame, mendaftarkan mereka sebagai tabel, mengeksekusi kueri SQL pada tabel, dan banyak lagi. Operasi SQL umum termasuk memilih kolom, memfilter baris, mengagregasi, mengurutkan, menangani nilai null, dan membagi ulang DataFrame. DataFrame dapat didaftarkan sebagai tampilan untuk menjalankan kueri SQL secara programatik terhadap mereka.

Diterjemahkan oleh

ScribdTranslations
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd
0% menganggap dokumen ini bermanfaat (0 suara)
5 tayangan1 halaman

Panduan Dasar PySpark untuk Ilmu Data

PySpark dan Spark SQL memungkinkan kerja dengan data terstruktur di Apache Spark. Sebuah SparkSession dapat digunakan untuk membuat DataFrame, mendaftarkan mereka sebagai tabel, mengeksekusi kueri SQL pada tabel, dan banyak lagi. Operasi SQL umum termasuk memilih kolom, memfilter baris, mengagregasi, mengurutkan, menangani nilai null, dan membagi ulang DataFrame. DataFrame dapat didaftarkan sebagai tampilan untuk menjalankan kueri SQL secara programatik terhadap mereka.

Diterjemahkan oleh

ScribdTranslations
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd

Peta Pijakan Python untuk Ilmu DataDuplicateValues GroupBy

>>> df = [Link]()
PySpark - Dasar-Dasar SQL >>> [Link]("usia")\
.count() \
Keolmpokkabnedrasakranusiahitungjumlahanggota
didalamkelompok

{"Queries":"Kueri"} .tampilkan()

>>> dari [Link] import functions sebagai F


Pilih
Saring
>>> [Link]("firstName").show() TampilkansemuaentridifirstNamekolom >>> [Link](df["age"]>24).show()Saring entri usia, hanya simpan
>>> [Link]("firstName","lastName") \
PySpark & Spark SQL .tampilkan()
TampilkansemuaentridifirstName , usia
itu
catatanyangnilainyaadalahlebih dari 24
>>> [Link]("firstName",
Spark SQL adalah modul Apache Spark untuk "age", dantipe
Urutkan
bekerjadengandataterstruktur. meledakkan("nomorTelepon") \
.alias("contactInfo")) \
>>>[Link]([Link]()).collect()
.select("[Link]",
Menginisialisasi SparkSession "firstName",
>>> [Link]("usia", ascending=False).collect()
>>>[Link](["usia","kota"],ascending=[0,1])\
SparkSession dapat digunakan untuk membuat DataFrame, mendaftarkan DataFrame sebagai tabel, "age") \ .kumpulkan()
.show()
jalankan SQLdi atas tabel, tabel cache, dan baca file parquet. >>> [Link](df["firstName"], df["age"] + 1) Tampilkan semua entri di firstName dan
age , .show() tambahkan
1 keentridariusia
>>> dari [Link] import SparkSession >>> [Link](df['age'] > 24).show() Tampilkansemuaentridimanaage>24 Nilai yang Hilang & Mengganti Nilai
>>> spark = SparkSession \ Ketika
.builder \ >>> [Link]("firstName", TampilkanfirstNamedan0atau1tergantung
.appName("Contoh dasar Python Spark SQL") \ >>> [Link](50).tampilkan()Gantikan nilai null
[Link]([Link] > 30, 1) \ diusia>30 >>> [Link]().show() Kembalibarudfmenghapus baris dengan nilai null
.config("[Link]","some-value") \ .lainnya(0)) >>> [Link] Kembalikanbarudfmenggantisatunilaidengan
.getOrCreate() .tampilkan() .replace(10, 20) \lainnya
>>> df[[Link]("Jane","Boris")] TampilkanfirstNamejikadalamopsiyangdiberikan
.tampilkan()
MembuatDataFrames Suka
.kumpulkan()

DariRDD
>>> [Link]("firstName", TunjukkanfirstName,and lastNameis
[Link]("Smith")) TRUEjikanamaBelakangsepertisimth
Repartisi
.tampilkan()
>>> dari [Link] import * MulaiDengan-AkhiriDengan >>>[Link](10) dfdengan10partisi
>>> [Link]("namaDepan", TampilkanfirstName,dan BENARjika .rdd \
InferSchema .getNumPartitions()
>>> sc = [Link] [Link] \ lastNamemulaidenganSm
>>> df dengan1partisi
>>> baris = [Link]("[Link]") .startswith("Sm")) \
.tampilkan() [Link](1).[Link]()
>>> parts = [Link](lambda l: [Link](",")) >>> [Link]([Link]("th"))\Tampilkan nama belakang yang diakhiri dengan
>>> orang = [Link](lambda p: Row(nama=p[0], umur=int(p[1]))) th .tampilkan() Menjalankan SQLQueries Secara Programatis
>>> peopledf = [Link](people) Ssubstring
TentukanSkema >>> [Link]([Link](1, 3) \ KembalikansubstringdarifirstName Mendaftarkan DataFrame sebagai Tampilan
>>> orang = [Link](lambda p: Row(nama=p[0], .alias("name") \
umur=int(p[1].strip()))) .kumpulkan() >>>[Link]("people")
>>> schemaString ="name age" Antara >>>[Link]("customer")
>>> [Link]([Link](22, 24)) \ Tampilkanage:values areTRUEjika di antara
>>>[Link]("customer")
>>>fields = [StructField(nama_field, StringType(), True) .tampilkan() 22dan24
untuk field_name dalam [Link]()
>>> skema = StructType(fields) TanyaTampilan
>>> [Link](orang, skema).tampilkan()
+--------+---+
Tambah, Perbarui & Hapus Kolom >>> df5 = [Link]("SELECT * FROM customer").show()
| name|age| >>> peopledf2 = [Link]("PILIH * DARI global_temp.people")\
+--------+---+
| Kepunyaanku|28|
Menambahkan Kolom .tampilkan()
| Filip|29|
|Jonathan|30| >>> df = [Link]('kota', [Link]) \
+--------+---+ .withColumn('kodePos',[Link]) \
Dari Sumber Data Spark .withColumn('state',[Link]) \
.withColumn('streetAddress',[Link]) \
Keluaran
JSON .withColumn('telePhoneNumber',
explode([Link])) \
Struktur Data
>>> df = [Link]("[Link]") .withColumn('jenisTelepon',
>>>[Link]() >>> rdd1 = [Link] Konversidfke dalam RDD
+--------------------+---+---------+--------+-------------------- meledakkan([Link])) >>> [Link]().first() UbahdfmenjadiRDDstring
| address|age|firstName |lastName|
+ phoneNumber| >>> [Link]() KembalikanisidfasPandas
+--------------------+---+---------+--------+--------------------
+
MemperbaruiKolom DataFrame
|[New York,10021,N...| 25| John Smith|[[212555-1234,ho...|
|[New York,10021,N...| 21| Jane Doe|[[322888-1234,ho...| >>> df = [Link]('telePhoneNumber','phoneNumber') Tulis & Simpan ke Berkas
+--------------------+---+---------+--------+--------------------
+ MenghapusKolom >>> [Link]("firstName","city")\
.tulis
>>> df2 = [Link]("[Link]", format="json")
Berkas Parquet >>> df = [Link]("alamat", "nomorTelepon") .save("[Link]")
>>> df3 = [Link]("[Link]") >>> df = [Link]([Link]).drop([Link]) >>> [Link]("namaDepan", "umur") \
.tulis \
BerkasTXT .save("[Link]", format="json")
PeriksaData
>>> [Link] Kembalidfnamakolomdantipedata >>> [Link]().show() Hitung statistik ringkasan MenghentikanSparkSession
>>> [Link]() Tampilkankontendaridf >>> [Link] Kembalikan kolom daridf
Kembalikanyangpertama >>> [Link]() Hitungjumlahbarisdidf >>> [Link]()
>>> [Link]() n baris
>>>[Link]() Kembalikanbarispertama >>> [Link]().count() Hitungjumlahbarisyangberbedadalamdf
>>> [Link](2) Kembalikanbarispertama >>> [Link]() Cetakskemadaridf
>>> [Link] Kembalikanskemadaridf >>> [Link]() Cetakrencana(logisdanfisik)

Anda mungkin juga menyukai