0% menganggap dokumen ini bermanfaat (0 suara)
3 tayangan24 halaman

Pandas: Panduan Lengkap DataFrame Python

Dokumen ini menjelaskan tentang pustaka Pandas dalam Python yang digunakan untuk analisis dan manipulasi data, dengan penekanan pada struktur DataFrame. Tutorial ini mencakup cara menginstal Pandas, membaca berbagai jenis file seperti Excel, CSV, dan SQL, serta melakukan operasi dasar seperti memilih, menghapus, dan mengurutkan data. Selain itu, dokumen ini juga menjelaskan cara mengekspor DataFrame ke format lain seperti Excel, CSV, SQL, JSON, dan HTML.

Diterjemahkan oleh

ScribdTranslations
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd
0% menganggap dokumen ini bermanfaat (0 suara)
3 tayangan24 halaman

Pandas: Panduan Lengkap DataFrame Python

Dokumen ini menjelaskan tentang pustaka Pandas dalam Python yang digunakan untuk analisis dan manipulasi data, dengan penekanan pada struktur DataFrame. Tutorial ini mencakup cara menginstal Pandas, membaca berbagai jenis file seperti Excel, CSV, dan SQL, serta melakukan operasi dasar seperti memilih, menghapus, dan mengurutkan data. Selain itu, dokumen ini juga menjelaskan cara mengekspor DataFrame ke format lain seperti Excel, CSV, SQL, JSON, dan HTML.

Diterjemahkan oleh

ScribdTranslations
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd

Pandas dan Python

Pandas adalah sebuah pustaka sumber terbuka dari Python yang menyediakan analisis dan
manipulasi data dipemrograman dalam Python.
Ini adalah pustaka yang sangat menjanjikan untuk representasi data, penyaringan, dan pemrograman.
statistik. Bagian yang paling penting di pandas adalah DataFrame di mana menyimpan dan bermain
dengan data.

Dalam tutorial ini, Anda akan belajar apa itu DataFrame, bagaimana cara membuatnya dari berbagai sumber,
cara mengekspornya ke berbagai hasil dan bagaimana memanipulasi datanya.

Instal pandas
Anda dapat menginstal pandas di Pythonmenggunakan pipJalankan perintah berikut di cmd:
pip instal pandas

Selain itu, Anda dapat menginstal pandas menggunakan conda seperti ini:

condainstallpandas

Membaca file Excel


Anda dapat membaca dari file Excel menggunakan metode read_excel() dari pandas. Untuk ini,
Anda perlu mengimpor satu modul lagi yang disebut xlrd.

Instal xlrd menggunakan pip:


pipinstalxlrd

Contoh berikut menunjukkan cara membaca dari sebuah lembar Excel:

1. Kami membuat lembar Excel dengan konten berikut:

2. Impor modul pandas.


imporpandas
3. Kami akan memberikan nama file Excel dan nomor sheet yang kami butuhkan
baca data ke metode read_excel().
pandas.read_excel('[Link]','Sheet1')
Fragmen sebelumnya akan menghasilkan hasil berikut:
Jika Anda memeriksa jenis keluaran menggunakan kata kunci type, itu akan memberi Anda hasil berikut:

<kelas'[Link]'>
Hasil ini disebut DataFrame! Itu adalah unit dasar dari pandas yang akan kita gunakan.
mencoba sampai akhir tutorial.
DataFrame adalah struktur berdimensi 2 yang diberi label di mana kita dapat menyimpan
data dari berbagai jenis. DataFrame mirip dengan tabel SQL atau lembar kerja
Excel.

Mengimpor berkas CSV


Untuk membaca file CSV, Anda dapat menggunakan metode read_csv() dari pandas.

Impor modul pandas:

impor pandas
Sekarang panggil metode read_csv () dengan cara berikut:

pandas.baca_csv('[Link]')
[Link] memiliki konten berikut:
Kode akan menghasilkan DataFrame berikut:

Membaca sebuah file teks


Kita juga dapat menggunakan metode read_csv dari pandas untuk membaca dari file teks;
Pertimbangkan contoh berikut:

impor pandas

pandas.read_csv('[Link]')
El [Link] tiene el siguiente formato:
Hasil dari kode di atas akan:

File teks ini diperlakukan sebagai file CSV karena kita memiliki elemen yang dipisahkan
memisahkan. Berkas tersebut juga bisa menggunakan pemisah lain, seperti titik koma, sebuah
tabulador, dll.

Misalkan kita memiliki pemisah tabulasi dan file terlihat seperti ini:
Ketika pemisahnya adalah satu tabulasi, kita akan mendapatkan hasil berikut:

Karena pandas tidak mengetahui delimiter, terjemahkan tabulator ke \ t.

Untuk mendefinisikan karakter tabulasi sebagai pemisah, berikan argumen delimiter dari
cara ini:

pandas.read_csv('[Link]', delimiter='\t')
Sekarang keluaran akan menjadi:

Sepertinya sudah benar sekarang.


Belajar SQL
Anda dapat menggunakan metode read_sql() dari pandas untuk membaca dari basis data SQL. Ini
buktikan dalam contoh berikut:

impor sqlite3

impor pandas

con = [Link]('[Link]')

pandas.read_sql('pilih * dari Karyawan', con)


Dalam contoh ini, kita terhubung ke sebuahbasis data SQLite3yang memiliki tabel bernama
"Empleado". Menggunakan metode read_sql() dari pandas, kita mengirimkan sebuah kueri dan sebuah objek dari
koneksi ke metode read_sql(). Query mengambil semua data dari tabel.
Tabel karyawan kami terlihat seperti berikut:

Saat Anda menjalankan kode di atas, outputnya akan seperti berikut:


Pilih kolom
Misalkan kita memiliki tiga kolom di tabel Karyawan dengan cara berikut:

Untuk memilih kolom dari tabel, kami akan menjalankan kueri berikut:

pilih Nama, Pekerjaan dari Karyawan


Pernyataan kode pandas akan sebagai berikut:
pandas.read_sql('select Name, JobfromEmployee', con)

Kita juga bisa memilih satu kolom dari sebuah tabel dengan mengakses DataFrame a.
Pertimbangkan contoh berikut:

x = pandas.read_sql('select*fromEmployee', con)

x['Name']
Hasilnya akan sebagai berikut:

Pilih baris berdasarkan nilai


Pertama, kami akan membuat DataFrame dari mana kami akan memilih baris.

Untuk membuat DataFrame, pertimbangkan kode berikut:

impor pandas

frame_data = {'name': ['James','Jason','Rogers'],'age': [18,20,22],'job': ['Assistant','Manager',


Petugas

df = [Link](frame_data)
Dalam kode ini, kami membuat DataFrame dengan tiga kolom dan tiga baris menggunakan metode
DataFrame () dari pandas. Hasilnya akan menjadi sebagai berikut:

Untuk memilih satu baris sesuai dengan nilainya, jalankan pernyataan berikut

[Link][df['name'] =='Jason']
[Link] [] atau [Link] [] adalah sebuah array boolean yang dapat digunakan untuk mengakses baris atau
kolom berdasarkan nilai atau label. Dalam kode di atas, akan mencari baris di mana
nama sama dengan Jason.

Keluaran akan menjadi:

Pilih baris berdasarkan indeks


Untuk memilih baris berdasarkan indeksnya, kita bisa menggunakan operator pemotongan (:) atau yang lainnya.
arreglo [Link] [].

Pertimbangkan kode berikut:

>>> frame_data = {'name': ['James','Jason','Rogers'],'age': [18,20,22],'job': ['Assistant','Manager',


'Clerk']}

>>> df = [Link](frame_data)
Kita buat sebuah DataFrame. Sekarang kita akan mengakses sebuah baris menggunakan [Link] []:

>>> [Link][1]
Seperti yang bisa kamu lihat, kami telah mengambil satu baris. Kami bisa melakukan hal yang sama menggunakan operator
segmentasi dengan cara berikut:

>>> df[1:2]

Mengubah jenis kolom


Tipe data dari sebuah kolom dapat diubah menggunakan atribut astype() dari
DataFrame. Untuk memeriksa jenis data dari kolom-kolom, kita menggunakan atribut dtypes dari
DataFrame.

>>> [Link]
Keluaran akan menjadi:

Sekarang untuk mengubah tipe data dari satu ke yang lain:

>>> [Link] = [Link](str)


Kami mencari kolom 'name' dari DataFrame kami dan mengubah tipe datanya dari objek
sebuah rangkaian karakter.

Menerapkan fungsi pada kolom / baris


Untuk menerapkan fungsi pada kolom atau baris, Anda dapat menggunakan metode apply() dari
DataFrame.

Pertimbangkan contoh berikut:

>>> frame_data = {'A': [1,2,3],'B': [18,20,22],'C': [54,12,13]}


>>> df = [Link](frame_data)
Kami membuat DataFrame dan menambahkan nilai tipe integer di baris. Untuk menerapkan sebuah
fungsi, misalnya, akar kuadrat pada nilai, kita akan mengimpor modulnumpypara
gunakan fungsi sqrt dengan cara ini:
>>>import numpy as np

>>>[Link]([Link])
Keluaran akan menjadi sebagai berikut:

Untuk menerapkan fungsi penjumlahan, kodenya adalah:

>>> [Link]([Link])

Untuk menerapkan fungsi pada kolom tertentu, Anda dapat menentukan kolom dari
bentuk berikutnya:

>>>df['A'].apply([Link])

Mengurutkan nilai / mengurutkan berdasarkan kolom


Untuk mengurutkan nilai dalam sebuah DataFrame, gunakan metode sort_values() dari DataFrame.

Buat DataFrame dengan nilai bulat:

>>> frame_data = {'A': [23,12,30],'B': [18,20,22],'C': [54,112,13]}

>>> df = [Link](frame_data)
Sekarang untuk mengurutkan nilai:

>>> df.sort_values(by=['A'])
Keluarnya akan:
Metode sort_values() memiliki atribut 'by' yang diperlukan. Dalam kode di atas,
nilai diurutkan berdasarkan kolom A. Untuk mengurutkan berdasarkan beberapa kolom, kodenya adalah
berikut:

>>> df.sort_values(by=['A','B'])
Jika Anda ingin mengurutkan dalam urutan menurun, atur atribut ascending dari set_values ke
Salah dengan cara berikut:

>>>df.sort_values(by=['A'], ascending=False)
Keluaran akan menjadi:

Menghapus / Menghilangkan duplikat


Untuk menghapus baris duplikat dari DataFrame, gunakan metode drop_duplicates().
DataFrame.

Pertimbangkan contoh berikut:

>>> frame_data = {'name': ['James','Jason','Rogers','Jason'],'age': [18,20,22,20],'job': ['Assistant',


["Manajer","Petugas","Manajer"]

>>> df = [Link](frame_data)
Di sini kami membuat DataFrame dengan satu baris yang duplikat. Untuk memeriksa apakah ada baris yang duplikat di
gunakan metode duplicated() dari DataFrame.

>>> [Link]()
Hasilnya akan menjadi:

Dapat dilihat bahwa baris terakhir adalah duplikat. Untuk menghapus baris ini, jalankan yang berikut ini
baris kode:

>>> df.hapus_duplikat()
Sekarang hasilnya akan:

Menghapus duplikat berdasarkan kolom


Terkadang, kita memiliki data di mana nilai kolomnya sama dan kita ingin
menghapusnya. Kita dapat menghapus satu baris per kolom dengan memberikan nama kolom yang
kita harus menghapus.

Misalnya, kita memiliki DataFrame berikut:

>>> frame_data = {'name': ['James','Jason','Rogers','Jason'],'age': [18,20,22,21],'job': ['Assistant',


["Manajer","Karyawan","Pegawai"]

>>> df = [Link](frame_data)
Di sini Anda dapat melihat bahwa Jason muncul dua kali. Jika Anda ingin menghapus duplikat berdasarkan kolom,
cukup masukkan nama kolom dengan cara berikut:

>>> df.drop_duplicates(['nama'])
El resultado será como el siguiente:

Menghapus kolom
Untuk menghapus kolom atau baris lengkap, kita dapat menggunakan metode drop() dari DataFrame
menentukan nama kolom atau baris.

Pertimbangkan contoh berikut:

>>> [Link](['pekerjaan'], axis=1)


Dalam baris kode ini, kita menghapus kolom yang disebut "job". Argumen dari
eje sangat diperlukan di sini. Jika nilai dari eje adalah 1, itu berarti kita ingin menghapus kolom, jika
valor del eje es 0 significa que la fila se eliminará. En valores de eje, 0 es para índice y 1
kolom-kolom.

Hasilnya akan:
Menghapus baris
Kita dapat menggunakan metode drop () untuk menghapus satu baris dengan melewatkan indeks baris tersebut.

Misalkan kita memiliki DataFrame berikut:

>>> frame_data = {'name': ['James','Jason','Rogers'],'age': [18,20,22],'job': ['Assistant','Manager',


Pekerja

>>> df = [Link](frame_data)
Untuk menghapus baris dengan indeks 0 di mana nama adalah James, usia adalah 18 dan pekerjaan
Anda asisten, gunakan kode berikut:

>>> [Link]([0])

Kita akan membuat DataFrame di mana indeksnya adalah nama-nama:

>>> frame_data = {'name': ['James','Jason','Rogers'],'age': [18,20,22],'job': ['Assistant','Manager',


Petugas

>>> df = [Link](frame_data, index = ['James','Jason','Rogers'])

Sekarang kita bisa menghapus baris dengan nilai tertentu. Misalnya, jika kita ingin menghapus sebuah
baris di mana nama adalah Rogers, maka kodenya adalah:

>>> [Link](['Rogers'])
Keluaran akan menjadi:

Anda juga dapat menghapus sejumlaj baris dengan cara berikut:


>>>[Link]([Link][[0, 1]])
Ini akan menghapus baris dari indeks 0 hingga 1 dan hanya akan menyisakan satu baris karena DataFrame kita
terdiri dari 3 baris:

Jika Anda ingin menghapus baris terakhir dari DataFrame dan tidak tahu berapa total jumlah barisnya,
Anda dapat menggunakan pengindeksan negatif seperti yang ditunjukkan di bawah ini:

>>>[Link]([Link][-1])
-1 menghapus baris terakhir. Dengan cara yang sama -2 akan menghapus 2 baris terakhir dan seterusnya.

Menjumlahkan kolom
Anda dapat menggunakan metode sum() dari DataFrame untuk menjumlahkan elemen-elemen di kolom.

Misalkan kita memiliki DataFrame berikut:

>>> frame_data = {'A': [23,12,12],'B': [18,18,22],'C': [13,112,13]}

>>> df = [Link](frame_data)
Sekarang untuk menjumlahkan elemen-elemen di kolom A, gunakan baris kode berikut:

>>> df['A'].jumlah()

Anda juga bisa menggunakan metode apply() dari DataFrame dan mengirimkan metode penjumlahan dari
numpy untuk menjumlahkan nilai.

Menghitung nilai unik


Untuk menghitung nilai unik dalam suatu kolom, Anda bisa menggunakan metode nunique() dari
DataFrame.

Misalkan kita memiliki DataFrame seperti di bawah ini:


>>> frame_data = {'A': [23,12,12],'B': [18,18,22],'C': [13,112,13]}

>>> df = [Link](frame_data)
Untuk menghitung nilai unik di kolom A:

>>> df['A'].nunique()

Seperti yang bisa kamu lihat, kolom A hanya memiliki 2 nilai unik 23 dan 12 dan yang lainnya 12 adalah sebuah
duplikat, itulah sebabnya kita memiliki 2 di output.

Jika Anda ingin menghitung semua nilai di sebuah kolom, Anda dapat menggunakan metode count() dari
cara berikut:

>>> df['A'].hitung()

Antrian subset
Untuk memilih subset dari DataFrame, Anda dapat menggunakan tanda kurung.

Misalnya, kita memiliki DataFrame yang berisi beberapa bilangan bulat. Kita dapat memilih atau
mencari subkumpulan dari satu baris dengan cara ini:

df.[mulai:jumlah]
Titik awal akan dimasukkan dalam himpunan bagian, tetapi titik berhenti tidak termasuk.
contoh, untuk memilih 3 baris mulai dari baris pertama, Anda akan menulis:

>>> df[0:3]
Keluaran akan menjadi:

Kode tersebut berarti memulai dari baris pertama yaitu 0 dan memilih 3 baris.

Dengan cara yang sama, untuk memilih 2 baris pertama, Anda akan menulis:
numpy

Mengurutkan nilai / mengurutkan berdasarkan kolom


>>> frame_data = {'name': ['James','Jason','Rogers'],'age': [18,20,22],'job': ['Assistant','Manager',
Petugas

>>> df = [Link](frame_data)

>>> df.to_excel("[Link]","Sheet1")
Berkas Excel akan terlihat seperti berikut:

Menulis ke file CSV


Dengan cara yang sama, untuk menulis DataFrame ke CSV, Anda dapat menggunakan metode to_csv()
seperti yang ditunjukkan dalam baris kode berikut.

>>> df.to_csv("[Link]")
Berkas keluaran akan seperti berikut:
Menulis ke SQL
Untuk menulis data ke SQL, kita bisa menggunakan metode to_sql().

Pertimbangkan contoh berikut:

importsqlite3

imporpandas

con = [Link]('[Link]')

frame_data = {'name': ['James','Jason','Rogers'],'age': [18,20,22],'job': ['Assistant','Manager',


'Clerk']}

df = [Link](frame_data)

df.to_sql('users', con)
Dalam kode ini, kami membuat koneksi dengan database sqlite3. Kemudian kami membuat sebuah
DataFrame dengan tiga baris dan tiga kolom.

Akhirnya, kami menggunakan metode to_sql dari DataFrame kami (df) dan mengirimkan nama
tabel tempat data akan disimpan bersama dengan objek koneksi.
La base de datos SQL se verá de la siguiente forma:

Menulis ke JSON
Anda bisa menggunakan metode to_json() dari DataFrame untuk menulis ke file JSON.

Ini dibuktikan dengan contoh berikut:

>>> df.to_json("[Link]")
Dalam baris kode ini, nama file JSON diberikan sebagai argumen. File
DataFrame akan disimpan dalam berkas JSON. Berkas akan memiliki konten sebagai berikut:
Menulis ke dalam file HTML
Anda dapat menggunakan metode to_html() dari DataFrame untuk membuat file HTML dengan
konten dari DataFrame.

Pertimbangkan contoh berikut:

>>> df.to_html("[Link]")
File hasil akan memiliki konten berikut:

Ketika Anda membuka file HTML di browser, itu akan terlihat seperti ini:
Bekerja dengan pandas sangat mudah. Ini seperti bekerja dengan lembar kerja Excel! DataFrame Pandas
ini adalah perpustakaan yang sangat fleksibel yang bisa kamu gunakan.

Anda mungkin juga menyukai