Pandas: Panduan Lengkap DataFrame Python
Pandas: Panduan Lengkap DataFrame Python
Pandas adalah sebuah pustaka sumber terbuka dari Python yang menyediakan analisis dan
manipulasi data dipemrograman dalam Python.
Ini adalah pustaka yang sangat menjanjikan untuk representasi data, penyaringan, dan pemrograman.
statistik. Bagian yang paling penting di pandas adalah DataFrame di mana menyimpan dan bermain
dengan data.
Dalam tutorial ini, Anda akan belajar apa itu DataFrame, bagaimana cara membuatnya dari berbagai sumber,
cara mengekspornya ke berbagai hasil dan bagaimana memanipulasi datanya.
Instal pandas
Anda dapat menginstal pandas di Pythonmenggunakan pipJalankan perintah berikut di cmd:
pip instal pandas
Selain itu, Anda dapat menginstal pandas menggunakan conda seperti ini:
condainstallpandas
<kelas'[Link]'>
Hasil ini disebut DataFrame! Itu adalah unit dasar dari pandas yang akan kita gunakan.
mencoba sampai akhir tutorial.
DataFrame adalah struktur berdimensi 2 yang diberi label di mana kita dapat menyimpan
data dari berbagai jenis. DataFrame mirip dengan tabel SQL atau lembar kerja
Excel.
impor pandas
Sekarang panggil metode read_csv () dengan cara berikut:
pandas.baca_csv('[Link]')
[Link] memiliki konten berikut:
Kode akan menghasilkan DataFrame berikut:
impor pandas
pandas.read_csv('[Link]')
El [Link] tiene el siguiente formato:
Hasil dari kode di atas akan:
File teks ini diperlakukan sebagai file CSV karena kita memiliki elemen yang dipisahkan
memisahkan. Berkas tersebut juga bisa menggunakan pemisah lain, seperti titik koma, sebuah
tabulador, dll.
Misalkan kita memiliki pemisah tabulasi dan file terlihat seperti ini:
Ketika pemisahnya adalah satu tabulasi, kita akan mendapatkan hasil berikut:
Untuk mendefinisikan karakter tabulasi sebagai pemisah, berikan argumen delimiter dari
cara ini:
pandas.read_csv('[Link]', delimiter='\t')
Sekarang keluaran akan menjadi:
impor sqlite3
impor pandas
con = [Link]('[Link]')
Untuk memilih kolom dari tabel, kami akan menjalankan kueri berikut:
Kita juga bisa memilih satu kolom dari sebuah tabel dengan mengakses DataFrame a.
Pertimbangkan contoh berikut:
x = pandas.read_sql('select*fromEmployee', con)
x['Name']
Hasilnya akan sebagai berikut:
impor pandas
df = [Link](frame_data)
Dalam kode ini, kami membuat DataFrame dengan tiga kolom dan tiga baris menggunakan metode
DataFrame () dari pandas. Hasilnya akan menjadi sebagai berikut:
Untuk memilih satu baris sesuai dengan nilainya, jalankan pernyataan berikut
[Link][df['name'] =='Jason']
[Link] [] atau [Link] [] adalah sebuah array boolean yang dapat digunakan untuk mengakses baris atau
kolom berdasarkan nilai atau label. Dalam kode di atas, akan mencari baris di mana
nama sama dengan Jason.
>>> df = [Link](frame_data)
Kita buat sebuah DataFrame. Sekarang kita akan mengakses sebuah baris menggunakan [Link] []:
>>> [Link][1]
Seperti yang bisa kamu lihat, kami telah mengambil satu baris. Kami bisa melakukan hal yang sama menggunakan operator
segmentasi dengan cara berikut:
>>> df[1:2]
>>> [Link]
Keluaran akan menjadi:
>>>[Link]([Link])
Keluaran akan menjadi sebagai berikut:
>>> [Link]([Link])
Untuk menerapkan fungsi pada kolom tertentu, Anda dapat menentukan kolom dari
bentuk berikutnya:
>>>df['A'].apply([Link])
>>> df = [Link](frame_data)
Sekarang untuk mengurutkan nilai:
>>> df.sort_values(by=['A'])
Keluarnya akan:
Metode sort_values() memiliki atribut 'by' yang diperlukan. Dalam kode di atas,
nilai diurutkan berdasarkan kolom A. Untuk mengurutkan berdasarkan beberapa kolom, kodenya adalah
berikut:
>>> df.sort_values(by=['A','B'])
Jika Anda ingin mengurutkan dalam urutan menurun, atur atribut ascending dari set_values ke
Salah dengan cara berikut:
>>>df.sort_values(by=['A'], ascending=False)
Keluaran akan menjadi:
>>> df = [Link](frame_data)
Di sini kami membuat DataFrame dengan satu baris yang duplikat. Untuk memeriksa apakah ada baris yang duplikat di
gunakan metode duplicated() dari DataFrame.
>>> [Link]()
Hasilnya akan menjadi:
Dapat dilihat bahwa baris terakhir adalah duplikat. Untuk menghapus baris ini, jalankan yang berikut ini
baris kode:
>>> df.hapus_duplikat()
Sekarang hasilnya akan:
>>> df = [Link](frame_data)
Di sini Anda dapat melihat bahwa Jason muncul dua kali. Jika Anda ingin menghapus duplikat berdasarkan kolom,
cukup masukkan nama kolom dengan cara berikut:
>>> df.drop_duplicates(['nama'])
El resultado será como el siguiente:
Menghapus kolom
Untuk menghapus kolom atau baris lengkap, kita dapat menggunakan metode drop() dari DataFrame
menentukan nama kolom atau baris.
Hasilnya akan:
Menghapus baris
Kita dapat menggunakan metode drop () untuk menghapus satu baris dengan melewatkan indeks baris tersebut.
>>> df = [Link](frame_data)
Untuk menghapus baris dengan indeks 0 di mana nama adalah James, usia adalah 18 dan pekerjaan
Anda asisten, gunakan kode berikut:
>>> [Link]([0])
Sekarang kita bisa menghapus baris dengan nilai tertentu. Misalnya, jika kita ingin menghapus sebuah
baris di mana nama adalah Rogers, maka kodenya adalah:
>>> [Link](['Rogers'])
Keluaran akan menjadi:
Jika Anda ingin menghapus baris terakhir dari DataFrame dan tidak tahu berapa total jumlah barisnya,
Anda dapat menggunakan pengindeksan negatif seperti yang ditunjukkan di bawah ini:
>>>[Link]([Link][-1])
-1 menghapus baris terakhir. Dengan cara yang sama -2 akan menghapus 2 baris terakhir dan seterusnya.
Menjumlahkan kolom
Anda dapat menggunakan metode sum() dari DataFrame untuk menjumlahkan elemen-elemen di kolom.
>>> df = [Link](frame_data)
Sekarang untuk menjumlahkan elemen-elemen di kolom A, gunakan baris kode berikut:
>>> df['A'].jumlah()
Anda juga bisa menggunakan metode apply() dari DataFrame dan mengirimkan metode penjumlahan dari
numpy untuk menjumlahkan nilai.
>>> df = [Link](frame_data)
Untuk menghitung nilai unik di kolom A:
>>> df['A'].nunique()
Seperti yang bisa kamu lihat, kolom A hanya memiliki 2 nilai unik 23 dan 12 dan yang lainnya 12 adalah sebuah
duplikat, itulah sebabnya kita memiliki 2 di output.
Jika Anda ingin menghitung semua nilai di sebuah kolom, Anda dapat menggunakan metode count() dari
cara berikut:
>>> df['A'].hitung()
Antrian subset
Untuk memilih subset dari DataFrame, Anda dapat menggunakan tanda kurung.
Misalnya, kita memiliki DataFrame yang berisi beberapa bilangan bulat. Kita dapat memilih atau
mencari subkumpulan dari satu baris dengan cara ini:
df.[mulai:jumlah]
Titik awal akan dimasukkan dalam himpunan bagian, tetapi titik berhenti tidak termasuk.
contoh, untuk memilih 3 baris mulai dari baris pertama, Anda akan menulis:
>>> df[0:3]
Keluaran akan menjadi:
Kode tersebut berarti memulai dari baris pertama yaitu 0 dan memilih 3 baris.
Dengan cara yang sama, untuk memilih 2 baris pertama, Anda akan menulis:
numpy
>>> df = [Link](frame_data)
>>> df.to_excel("[Link]","Sheet1")
Berkas Excel akan terlihat seperti berikut:
>>> df.to_csv("[Link]")
Berkas keluaran akan seperti berikut:
Menulis ke SQL
Untuk menulis data ke SQL, kita bisa menggunakan metode to_sql().
importsqlite3
imporpandas
con = [Link]('[Link]')
df = [Link](frame_data)
df.to_sql('users', con)
Dalam kode ini, kami membuat koneksi dengan database sqlite3. Kemudian kami membuat sebuah
DataFrame dengan tiga baris dan tiga kolom.
Akhirnya, kami menggunakan metode to_sql dari DataFrame kami (df) dan mengirimkan nama
tabel tempat data akan disimpan bersama dengan objek koneksi.
La base de datos SQL se verá de la siguiente forma:
Menulis ke JSON
Anda bisa menggunakan metode to_json() dari DataFrame untuk menulis ke file JSON.
>>> df.to_json("[Link]")
Dalam baris kode ini, nama file JSON diberikan sebagai argumen. File
DataFrame akan disimpan dalam berkas JSON. Berkas akan memiliki konten sebagai berikut:
Menulis ke dalam file HTML
Anda dapat menggunakan metode to_html() dari DataFrame untuk membuat file HTML dengan
konten dari DataFrame.
>>> df.to_html("[Link]")
File hasil akan memiliki konten berikut:
Ketika Anda membuka file HTML di browser, itu akan terlihat seperti ini:
Bekerja dengan pandas sangat mudah. Ini seperti bekerja dengan lembar kerja Excel! DataFrame Pandas
ini adalah perpustakaan yang sangat fleksibel yang bisa kamu gunakan.