Panduan Dasar PySpark untuk DataFrame
Panduan Dasar PySpark untuk DataFrame
NilaiDuplikat GroupBy
>>> df = [Link]()
PySpark - Dasar-Dasar SQL >>> [Link]("umur")\
.count()
Keolmpokkabnedrasakranusia,countthemembers
didalamkelompok
Kueri .show()
DariRDDs
>>> [Link]("namaDepan", TunjukkanfirstName,dan lastNameis
[Link]("Smith")) \TRUEjika lastName mirip Smith
Pereciptaan Ulang
.tampilkan()
>>> dari [Link] import * MulaiDengan-AkhirDengan >>>[Link](10) dfdengan10partisi
>>> [Link]("firstName", TampilkanfirstName,dan BENARjika .rdd \
InferSchema .getNumPartitions()
>>> sc = [Link] [Link] lastNamemulaidenganSm
>>> df dengan1partisi
>>> baris = [Link]("[Link]") .startswith("Sm") \
.tampilkan() [Link](1).[Link]()
>>> parts = [Link](lambda l: [Link](",")) >>> [Link]([Link]("th"))\Tampilkan nama belakang yang diakhiri dengan
>>> people = [Link](lambda p:Row(name=p[0],age=int(p[1]))) th .tampilkan() Menjalankan SQLQueries Secara Programatik
peopledf = [Link](orang) Ssubstring
TentukanSkema >>> [Link]([Link](1, 3) \ KembalikansubstringdarifirstName Mendaftar DataFrame sebagai Tampilan
>>> orang = [Link](lambda p: Row(nama=p[0], .alias("name")
usia=int(p[1].strip()))) .kumpulkan() >>>[Link]("people")
>>> schemaString ="name age" Antara >>>[Link]("customer")
>>> [Link]([Link](22, 24)) \ Tampilkanage:values areTRUEjika di antara
>>>fields = [StructField(nama_field, StringType(), True) >>>[Link]("customer")
.tampilkan() 22dan24
untuk field_name dalam [Link]()]
>>> skema = StructType(fields) QueryViews
>>> [Link](people, schema).show()
+--------+---+
Tambah, Perbarui & Hapus Kolom >>> df5 = [Link]("SELECT * FROM customer").show()
| name|age| >>> peopledf2 = [Link]("SELECT * FROM global_temp.people")\
+--------+---+
| Saya|28|
MenambahkanKolom .tampilkan()
| Filip|29|
|Jonathan|30| >>> df = [Link]('kota', [Link]) \
+--------+---+ .withColumn('kodePos',[Link]) \
Dari Sumber Data Spark .withColumn('state',[Link]) \
.withColumn('streetAddress',[Link]) \
Keluaran
JSON .withColumn('telePhoneNumber',
meledakkan([Link])) \
StrukturData
>>> df = [Link]("[Link]") .withColumn('tipeTelepon',
>>>[Link]() >>> rdd1 = [Link] Ubahdfke dalam RDD
+--------------------+---+---------+--------+-------------------- meledakkan([Link])) >>> [Link]().first() KonversidfkedalamRDDstring
| address|age|firstName |lastName|
+ phoneNumber| >>> [Link]() KembalikankontendfasPandas
+--------------------+---+---------+--------+--------------------
+
Memperbarui Kolom DataFrame
|[New York,10021,N...| 25| John Smith|[[212555-1234,ho...
|[New York,10021,N...| 21| Jane| Doe|[[322888-1234,ho...| >>> df = [Link]('telePhoneNumber','phoneNumber') Tulis & Simpan ke File
+--------------------+---+---------+--------+--------------------
+ MenghapusKolom >>> [Link]("firstName","kota")\
.tulis \
>>> df2 = [Link]("[Link]", format="json")
BerbagaiJenisParquet >>> df = [Link]("alamat","nomorTelepon") .save("[Link]")
>>> df3 = [Link]("[Link]") >>> df = [Link]([Link]).drop([Link]) >>> [Link]("firstName","age") \
.tulis \
Berkas TXT .simpan("[Link]", format="json")
PeriksaData
>>> [Link] Kembalidfnamakolomdantipedata >>> [Link]().tampilkan() Hitung statistik ringkasan MenghentikanSparkSession
>>> [Link]() Tampilkankontendaridf >>> [Link] Kembalikan kolom daridf
Kembalikanpertama n rows >>> [Link]() Hitungjumlahbarisdidf >>> [Link]()
>>> [Link]()
>>>[Link]() Kembalikanbarispertama >>> [Link]().hitung() Hitungjumlahbarisyangberbedadidf
>>> [Link](2) Kembalikanbarispertama >>> [Link]() Cetakskemadaridf
>>> [Link] Kembalikanskemadaridf >>> [Link]() Cetakrencana(logisdanfisik)