Panduan Dasar PySpark untuk DataFrame
Panduan Dasar PySpark untuk DataFrame
NilaiDuplikat Pengelompokan
>>> df = [Link]()
PySpark - Dasar-Dasar SQL >>> [Link]("usia")\
.count() \
Keolmpokkabnedrasakranusia,hitunganggotanya
didalamkelompok
Kueri .tampilkan()
DariRDDs
>>> [Link]("firstName", TampilkanfirstName,dan lastNameis
[Link]("Smith")) \TRUEiflastNameis likeSmith
Repartisi
.tampilkan()
>>> dari [Link] import * Dimulai-dari-Akhir-dari >>>[Link](10) dfdengan10partisi
>>> [Link]("namaDepan", TunjukkanfirstName,dan BENARjika .rdd \
InferSchema .getNumPartitions()
>>> sc = [Link] [Link] lastNamemulaidenganSm
>>> df dengan1partisi
>>> garis = [Link]("[Link]") .startswith("Sm") \
.tampilkan() [Link](1).[Link]()
>>> parts = [Link](lambda l: [Link](",")) >>> [Link]([Link]("th"))\Tampilkan nama belakang yang diakhiri dengan
>>> orang = [Link](lambda p: Row(nama=p[0], umur=int(p[1]))) th .show() Menjalankan SQLQueries Secara Programatis
>>> peopledf = [Link](people) Ssubstring
TentukanSkema >>> [Link]([Link](1, 3) \ KembalikansubstringdarifirstName Mendaftarkan DataFrame sebagai Tampilan
>>> orang = [Link](lambda p: Baris(nama=p[0], .alias("nama") \
age=int(p[1].strip()))) .kumpulkan() >>>[Link]("people")
>>> schemaString ="name age" Antara >>>[Link]("customer")
>>> [Link]([Link](22, 24)) \ Tampilkanage:values areTRUEjika antara
>>>fields = [StructField(field_name, StringType(), True) >>>[Link]("customer")
.tampilkan() 22dan24
untuk field_name dalam [Link]()]
>>> skema = TipeStruktur(kolom) TanyaTampilan
>>> [Link](orang, skema).show() Tambahkan, Perbarui & Hapus Kolom >>> df5 = [Link]("SELECT * FROM customer").show()
+--------+---+
| name|age| peopledf2 = [Link]("PILIH * DARI global_temp.people")
+--------+---+
| Mine|28|
MenambahkanKolom .tampilkan()
| Filip|29|
|Jonathan|30| >>> df = [Link]('kota', [Link]) \
+--------+---+ .withColumn('kodePos',[Link]) \
Dari Sumber Data Spark .withColumn('state',[Link]) \
.withColumn('streetAddress',[Link]) \
Keluaran
JSON .withColumn('nomorTelepon',
meledakkan([Link])) \
Struktur Data
>>> df = [Link]("[Link]") .withColumn('tipeTelepon',
>>>[Link]() >>> rdd1 = [Link] Konversidfmenjadi RDD
+--------------------+---+---------+--------+-------------------- meledakkan([Link])) >>> [Link]().first() KonversidfmenjadiRDDstring
| address|age|firstName |lastName|
+ phoneNumber| >>> [Link]() KembalikankontendfasPandas
+--------------------+---+---------+--------+--------------------
+
MemperbaruiKolom DataFrame
|[New York,10021,N...| 25| John Smith|[[212555-1234,ho...]
|[New York,10021,N...| 21| Jane Doe|[[322888-1234,ho...| >>> df = [Link]('telePhoneNumber','phoneNumber') Tulis & Simpan ke File
+--------------------+---+---------+--------+--------------------
+ MenghapusKolom >>> [Link]("namaDepan","kota")\
.tulis
>>> df2 = [Link]("[Link]", format="json")
File Parquet >>> df = [Link]("alamat","nomorTelepon") .simpan("[Link]")
>>> df3 = [Link]("[Link]") >>> df = [Link]([Link]).drop([Link]) >>> [Link]("firstName","age") \
.write \
File TXT .save("[Link]",format="json")
DataInspeksi
>>> [Link] Kembalidfnamakolomdantipedata >>> [Link]().tampilkan() Hitung statistik ringkasan MenghentikanSparkSession
>>> [Link]() Tampilkankontendaridf >>> [Link] Kembalikan kolom daridf
Kembalikanyangpertama >>> [Link]() Hitungjumlahbarisdalamdf >>> [Link]()
>>> [Link]() n baris
>>>[Link]() Kembalikanbarispertama >>> [Link]().count() Hitungjumlahbarisyangberbedadidf
>>> [Link](2) Kembalikanbarispertama >>> [Link]() Cetakskemadaridf
>>> skema df Kembalikanskemadaridf >>> [Link]() Cetakrencana(logisdanfisik)