0% menganggap dokumen ini bermanfaat (0 suara)
4 tayangan1 halaman

Panduan Dasar PySpark untuk DataFrame

Spark SQL memungkinkan bekerja dengan data terstruktur di Apache Spark. Sebuah SparkSession dapat digunakan untuk membuat DataFrame, mendaftarkannya sebagai tabel, dan menjalankan kueri SQL pada tabel tersebut. Operasi SQL umum seperti memilih kolom, memfilter baris, mengagregasi, dan menggabungkan dapat dilakukan pada DataFrame/tabel. Nilai null dapat dihapus, diisi, atau diganti. DataFrame juga dapat dipartisi ulang atau disimpan dalam memori untuk meningkatkan kinerja.

Diterjemahkan oleh

ScribdTranslations
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd
0% menganggap dokumen ini bermanfaat (0 suara)
4 tayangan1 halaman

Panduan Dasar PySpark untuk DataFrame

Spark SQL memungkinkan bekerja dengan data terstruktur di Apache Spark. Sebuah SparkSession dapat digunakan untuk membuat DataFrame, mendaftarkannya sebagai tabel, dan menjalankan kueri SQL pada tabel tersebut. Operasi SQL umum seperti memilih kolom, memfilter baris, mengagregasi, dan menggabungkan dapat dilakukan pada DataFrame/tabel. Nilai null dapat dihapus, diisi, atau diganti. DataFrame juga dapat dipartisi ulang atau disimpan dalam memori untuk meningkatkan kinerja.

Diterjemahkan oleh

ScribdTranslations
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd

PythonUntukIlmuDataCheatSheet Nilai Duplikat Kelompokkan berdasarkan

>>> df = [Link]() >>> [Link]("usia")\ Kumpulkan berdasarkanusiahitung anggotanya


PySpark - Dasar-Dasar SQL .count() \ di dalam kelompok
.tampilkan()
Pelajari Python untuk ilmu data Secara Interaktifdi [Link] Kueri
>>> dari [Link] import fungsi sebagai F
Pilih Saring
>>> [Link]("namaDepan").show() Tampilkan semua entri difirstName kolom >>> [Link](df["age"]>24).show() Filter entri umur, hanya simpan yang
>>> [Link]("namaDepan", "namaBelakang") \ catatan yang nilainya adalah24
PySpark & Spark SQL .tampilkan()
>>> [Link]("namaPertama", Tampilkan semua entri difirstName, age
Spark SQL adalah modul Apache Spark untuk dantipe
bekerja dengan data terstruktur.
"age",
meledakkan("nomorTelepon") \ Urutkan
.alias("informasiKontak") \
.select("[Link]", >>> [Link]([Link]()).collect()
Menginisialisasi SparkSession "firstName",
"age") \
>>> [Link]("age", ascending=False).collect()
>>> [Link](["umur","kota"],ascending=[0,1])\
Sebuah SparkSession dapat digunakan untuk membuat DataFrame, mendaftarkan DataFrame sebagai tabel, .tampilkan() .mengumpulkan()
jalankan SQL di atas tabel, tabel cache, dan baca file parquet. Tampilkan semua entri di firstName dan age,
.show() tambahkan1ke entri dariage
>>> dari [Link] import SparkSession >>> [Link](df['age'] > 24).show() Tampilkan semua entri di manausia >24 Nilai yang Hilang & Mengganti Nilai
>>> spark = SparkSession Kapan
.builder \ >>> [Link]("namaDepan", TampilkanfirstNamedan 0 atau 1 tergantung
.appName("Python Spark SQL basic example") \ >>> [Link].fill(50).tampilkan()Ganti nilai null
[Link]([Link] > 30, 1) \ padausia >30
.config("[Link]fi[Link]","some-value") \ >>> [Link]().tampilkan()Return new dfmengabaikan baris dengan nilai null
.lainnya(0)) \ >>> [Link] Kembalikan barudfmengganti satu nilai dengan
.getAtauBuat() .tampilkan() .gantikan(10, 20) \lainnya
>>> df[[Link]("Jane","Boris")] TunjukkanfirstNamejika dalam pilihan yang diberikan
.tampilkan()
Membuat DataFrame Suka
.kumpulkan()

Dari RDD
>>> [Link]("namaPertama", TampilkanfirstName, dan lastNameis
[Link]("Smith") TRUE jika lastName mirip dengan Smith Pemisahan kembali
.tampilkan()
>>> dari [Link] import * Startswith - Endswith >>> [Link](10) dfdengan 10 partisi
>>> [Link]("namaDepan", TampilkanfirstName, dan BENARjika .rdd \
Infer Skema .getNumPartitions()
[Link] lastName dimulai denganSm
>>> sc = [Link] >>> [Link](1).[Link]() df dengan 1 partisi
>>> lines = [Link]("[Link]") .startswith("Sm") \
.tampilkan()
>>> bagian = [Link](lambda l: [Link](",")) >>> [Link]([Link]("th"))\Tampilkan nama belakang yang berakhiran th
>>>orang=[Link](lambdap:Row(nama=p[0],usia=int(p[1])))
peopledf = [Link](orang)
.tampilkan() Menjalankan Kuery SQL Secara Programatik
Substr
Tentukan Skema >>> [Link]([Link](1, 3) \ Kembalikan substring darifirstName
Mendaftar DataFrame sebagai Tampilan
>>> orang = [Link](lambda p: Row(nama=p[0], .alias("nama") \
age=int(p[1].strip()))) .kumpulkan() >>> [Link]("people")
>>> schemaString ="name age" Antara >>> [Link]("customer")
fields = [StructField(field_name, StringType(), True) untuk >>> [Link]([Link](22, 24)) \ Tunjukkanage:values areTRUEjika antara >>> [Link]("customer")
nama_field dalam [Link]()] .tampilkan() 22 dan24
>>> skema = StructType(field) Tampilan Kuery
>>> [Link](orang, skema).show()
+--------+---+
Menambahkan, Memperbarui & Menghapus Kolom
| name|age| >>> df5 = [Link]("SELECT * FROM customer").show()
+--------+---+ >>> peopledf2 = [Link]("SELECT * FROM global_temp.people")\
| Mine| 28| Menambahkan Kolom .show()
| Filip| 29|
|Jonathan| 30|
+--------+---+ >>> df = [Link]('kota',[Link]) \
.withColumn('kodePos',[Link]) \
Dari Sumber Data Spark .withColumn('state',[Link]) \ Keluaran
.withColumn('streetAddress',[Link]) \
JSON .withColumn('telePhoneNumber',
meledakkan([Link])) \
Struktur Data
>>> df = [Link]("[Link]") .withColumn('jenisTelepon',
>>> [Link]() >>> rdd1 = [Link] Konversidfke dalam RDD
+--------------------+---+---------+--------+--------------------+ meledak([Link])) >>> [Link]().first() Konversidfmenjadi RDD string
| address|age|firstName |lastName| phoneNumber|
+--------------------+---+---------+--------+--------------------+ >>> [Link]() Kembalikan isi dfas Pandas
|[New York,10021,N...| 25| John| Smith|[[212 555-1234,ho...|
|[New York,10021,N...| 21| Jane| Doe|[[322 888-1234,ho...|
Updating Columns DataFrame
+--------------------+---+---------+--------+--------------------+
>>> df2 = [Link]("[Link]", format="json")
>>> df = [Link]('telePhoneNumber','phoneNumber') Tulis & Simpan ke Berkas
File Parquet Menghapus Kolom >>> [Link]("firstName","city")\
>>> df3 = [Link]("[Link]") .tulis \
Berkas TXT >>> df = [Link]("alamat", "nomorTelepon") .simpan("[Link]")
>>> df4 = [Link]("[Link]") >>> df = [Link]([Link]).drop([Link]) >>> [Link]("firstName","age") \
.tulis
.save("[Link]", format="json")
Periksa Data
>>> [Link] Kembalidfnama kolom dan tipe data >>> [Link]().tampilkan() Hitung statistik ringkasan Menghentikan SparkSession
>>> [Link]() Tampilkan konten daridf >>> [Link] Kembalikan kolom daridf
Kembalikan pertaman baris >>> [Link]() Hitung jumlah baris didf >>> [Link]()
>>> [Link]()
>>> [Link]() Kembalikan baris pertama >>> [Link]().count() Hitung jumlah baris yang berbeda didf
>>> [Link](2) Kembalikan n baris pertama >>> [Link]() Cetak skema daridf DataCamp
>>> [Link] Kembalikan skema daridf >>> [Link]() Cetak rencana (logis dan fisik) Pelajari Python untuk Ilmu Data Secara Interaktif

Anda mungkin juga menyukai