Bootcamp Sesi 4
BELAJAR PYTHON
DATA SCIENCE
@ o y u s e p
PYTHON LIBRARY
INTRODUCTION
Python Library atau pustaka Python adalah kumpulan modul dan paket yang menyediakan fungsionalitas tambahan yang
tidak ada dalam pustaka standar Python. Pustaka ini memungkinkan pengguna untuk melakukan berbagai tugas spesifik
tanpa harus menulis kode dari awal. Modul adalah satuan kode yang dapat diimpor ke dalam program Python, sementara
paket adalah koleksi modul yang dikelompokkan bersama dalam satu direktori.
Menghemat Waktu dan Usaha & Konsistensi dan Keandalan
Contoh: NumPy menyediakan fungsi matematika yang efisien,
Pandas memudahkan manipulasi data, dan Matplotlib
membantu membuat grafik.
Ketersediaan Dokumentasi dan Komunitas
Contoh: Dokumentasi resmi Pandas dan forum diskusi Stack
Overflow.
MANFAAT LIBRARY
KEMUDAHAN DALAM PYTHON
Kemudahan Penggunaan
Python dikenal dengan sintaksisnya yang sederhana dan mudah dibaca. Pustaka Python dirancang
untuk mempertahankan kesederhanaan ini, sehingga pengguna baru maupun berpengalaman
dapat dengan cepat memanfaatkannya.
Contoh: Membaca file CSV dengan Pandas hanya memerlukan satu baris kode (pd.read_csv('[Link]')).
Kemudahan Instalasi
Pustaka Python dapat diinstal dengan mudah menggunakan pip, manajer paket Python. Proses
instalasi ini biasanya hanya memerlukan satu perintah di terminal atau command prompt.
Contoh: pip install numpy pandas matplotlib seaborn
MANFAAT LIBRARY
KEMUDAHAN DALAM PYTHON
Kompatibilitas dan Dukungan Platform
Pustaka Python tersedia dan didukung di berbagai platform (Windows, macOS, Linux). Hal ini
memastikan bahwa kode Anda dapat dijalankan di berbagai lingkungan tanpa banyak perubahan.
Contoh: Pustaka seperti OpenCV untuk pemrosesan gambar dan video yang dapat digunakan di
berbagai sistem operasi.
Ekosistem yang Luas
Python memiliki ekosistem pustaka yang sangat luas yang mencakup hampir semua aspek
komputasi, dari analisis data, pembelajaran mesin, pengembangan web, hingga pengembangan
permainan.
Contoh: TensorFlow dan Keras untuk deep learning, Flask dan Django untuk pengembangan web.
JENIS-JENIS
LIBRARY DATA SCIENCE
Dalam data science, Python adalah salah satu bahasa yang paling populer karena memiliki ekosistem
pustaka yang luas dan kuat. Berikut adalah beberapa pustaka Python yang sering digunakan dalam data
science
NumPy:
Deskripsi: NumPy (Numerical Python) adalah pustaka dasar untuk komputasi ilmiah dengan Python.
Ini menyediakan objek array multidimensi yang kuat, serta fungsi untuk melakukan operasi
matematika pada array tersebut.
Fitur Utama: Array multidimensi, operasi matematis dasar, fungsi aljabar linier, transformasi Fourier.
Instalasi: pip install numpy
import numpy as np
arr = [Link]([1, 2, 3, 4, 5])
print([Link]())
PENGENALAN PANDAS
PANDAS
Pandas adalah salah satu perpustakaan yang paling penting dalam ekosistem Python untuk
pengolahan data, dan telah menjadi alat yang sangat berharga bagi bisnis dalam
mengeksplorasi, membersihkan, dan menganalisis data
PANDAS
Pandas adalah pustaka Python yang sangat populer untuk manipulasi dan analisis data. Ini
menyediakan struktur data fleksibel yang disebut DataFrame, yang memungkinkan Anda
bekerja dengan data tabular dengan cara yang intuitif dan efisien.
PENGENALAN
PANDAS
Struktur Data di Pandas
Series: Struktur data 1D seperti array yang dapat diindeks.
DataFrame: Struktur data 2D seperti tabel yang dapat diindeks dengan baris dan kolom.
Instalasi Pandas
Untuk menginstal Pandas, Anda dapat menggunakan pip:
pip install pandas
MENGGUNAKAN
PANDAS
Membaca dan Menulis Data
Pandas mendukung berbagai format file untuk membaca dan menulis data, seperti CSV, Excel, SQL, dan JSON.
Membaca Data dari File CSV:
import pandas as pd
# Membaca data dari file CSV
data = pd.read_csv('[Link]')
print([Link]())
Note : jangan lupa upload file csv ke
google colab
PENGENALAN MATPLOTLIB
Matplotlib adalah pustaka untuk membuat visualisasi data dalam bentuk grafik. Ini
memungkinkan Anda membuat berbagai jenis grafik, seperti grafik garis, histogram, scatter
plot, dan banyak lagi.
Fitur Utama: Grafik 2D, kustomisasi grafik, integrasi dengan Pandas dan NumPy.
Instalasi: pip install matplotlib
Contoh Penggunaan
import [Link] as plt
[Link]([1, 2, 3, 4])
[Link]('some numbers')
[Link]()
PENGENALAN MATPLOTLIB
PENGENALAN SEABORN
Seaborn adalah pustaka visualisasi data yang dibangun di atas Matplotlib. Ini menyediakan
antarmuka tingkat tinggi untuk menggambar grafik statistik yang menarik dan informatif.
Fitur Utama: Grafik statistik, peta panas, scatter plot dengan regresi, visualisasi distribusi.
Instalasi: pip install seaborn
Contoh Penggunaan:
import seaborn as sns
df = sns.load_dataset('tips')
[Link](x='total_bill', y='tip', data=df)
[Link]()
PENGENALAN SEABORN
LIBRARY PYTHON DATA SCIENCE
Pustaka-pustaka ini adalah alat yang sangat berguna bagi para data scientist untuk melakukan
berbagai tugas mulai dari manipulasi data, analisis statistik, visualisasi data, hingga
pembangunan model pembelajaran mesin. Setiap pustaka memiliki kekuatan dan kegunaan
spesifik, sehingga sering digunakan secara bersama-sama untuk memaksimalkan kemampuan
analisis dan pemodelan data.
EXPLORASI
DATA
Eksplorasi Data
Sebelum menganalisis data, kita perlu memahami struktur dan karakteristiknya. Pandas
menyediakan berbagai fungsi untuk mengeksplorasi data seperti `head()`, `info()`, dan `describe()
Contoh:
# Menampilkan beberapa baris pertama data
print([Link]())
# Menampilkan informasi tentang data
print([Link]())
# Menampilkan ringkasan statistik data
print([Link]())
PEMBERSIHAN
DATA
Data dalam bisnis sering kali tidak sempurna dan perlu dibersihkan sebelum dapat dianalisis. Pandas
menyediakan berbagai alat untuk membersihkan dan merapikan data, termasuk mengelola nilai-
nilai yang hilang dan menduplikasi baris.
Contoh:
# Menghapus baris dengan nilai yang hilang
[Link](inplace=True)
# Menghapus duplikat baris
data.drop_duplicates(inplace=True)
OPERASI DASAR
PANDAS Struktur Data: Series dan DataFrame
# Membuat Series dari list
series = [Link]([1, 2, 3, 4, 5])
print(series)
Menulis Data ke File CSV
# Menulis DataFrame ke file CSV # Membuat DataFrame dari dictionary
data.to_csv('[Link]', index=False) data = {
'Name': ['Alice', 'Bob', 'Charlie'],
Mengakses Kolom: 'Age': [25, 30, 35],
# Mengakses kolom 'Name' 'City': ['New York', 'Los Angeles',
print(df['Name']) 'Chicago']
}
Mengakses Baris df = [Link](data)
# Mengakses baris pertama print(df)
print([Link][0])
OPERASI DASAR
PANDAS Struktur Data: Series dan DataFrame
# Membuat Series dari list
series = [Link]([1, 2, 3, 4, 5])
print(series)
Menulis Data ke File CSV
# Menulis DataFrame ke file CSV # Membuat DataFrame dari dictionary
data.to_csv('[Link]', index=False) data = {
'Name': ['Alice', 'Bob', 'Charlie'],
Mengakses Kolom: 'Age': [25, 30, 35],
# Mengakses kolom 'Name' 'City': ['New York', 'Los Angeles',
print(df['Name']) 'Chicago']
}
Mengakses Baris df = [Link](data)
# Mengakses baris pertama print(df)
print([Link][0])
OPERASI DASAR
PANDAS
Mengganti Nilai Missing
# Mengganti nilai missing dengan nilai tertentu
[Link](0, inplace=True)
Statistik Deskriptif
# Mendapatkan statistik deskriptif
print([Link]())
VISUALISASI DATA
PANDAS
Pandas menyediakan antarmuka yang mudah untuk
membuat grafik menggunakan Matplotlib.
Membuat Grafik Garis: Membuat Grafik Bar
# Membuat grafik garis dari DataFrame # Membuat grafik bar dari DataFrame
[Link](kind='line', x='Name', y='Age') [Link](kind='bar', x='Name', y='Age')
[Link]('Grafik Garis Umur') [Link]('Grafik Bar Umur')
[Link]('Nama') [Link]('Nama')
[Link]('Umur') [Link]('Umur')
[Link]() [Link]()
CONTOH KASUS:
ANALISIS DATA
Penjelasan Struktur Dataset:
CostumerID: Identitas Pelanggan
Umur: Usia Pelanggan.
Income: Pendapatan tahunan individu
Kategori: kategori level pendapatan
Setelah menyalin data di atas ke file [Link], Anda dapat menjalankan
skrip Python yang telah disediakan untuk membaca, memanipulasi, dan
memvisualisasikan data.
import pandas as pd
import [Link] as plt
# Membaca data dari file CSV
data = pd.read_csv('customer_data.csv')
CONTOH KASUS: # Menampilkan 5 baris pertama
print([Link]())
ANALISIS DATA # Mengganti nilai missing dengan 0 (jika ada)
[Link](0, inplace=True)
# Menampilkan statistik deskriptif
print([Link]())
CustomerID Umur Income Kategori
# Memfilter data untuk usia di atas 30
filtered_data = data[data['Umur'] > 30]
1 19 5000000 Besar
print(filtered_data)
2 20 4000000 Besar
# Membuat grafik distribusi usia
3 23 3000000 Cukup data['Umur'].plot(kind='hist', title='Distribusi Umur')
[Link]('Umur')
4 28 1500000 Kecil [Link]()
5 22 1900000 Kecil # Membuat scatter plot umur vs pendapatan
[Link](kind='scatter', x='Umur', y='Income', title='Umur vs
6 30 4000000 Besar Pendapatan')
[Link]('Umur')
7 50 3200000 Cukup [Link]('Pendapatan')
[Link]()
8 32 3000000 Cukup
# Membuat bar plot untuk kategori
9 31 1000000 Kecil data['Kategori'].value_counts().plot(kind='bar', title='Jumlah Customer
per Kategori')
10 41 500000 Kurang [Link]('Kategori')
[Link]('Jumlah')
[Link]()
PENJELASAN CODE
Membaca data dari file CSV:
data = pd.read_csv('customer_data.csv'): Membaca file CSV ke dalam DataFrame Pandas.
Menampilkan 5 baris pertama:
print([Link]()): Menampilkan 5 baris pertama dari DataFrame.
Mengganti nilai missing dengan 0 (jika ada):
[Link](0, inplace=True): Mengganti nilai yang hilang dengan 0.
Menampilkan statistik deskriptif:
print([Link]()): Menampilkan statistik deskriptif dari DataFrame.
Memfilter data untuk usia di atas 30:
filtered_data = data[data['Umur'] > 30]: Memfilter data untuk customer yang berusia di atas 30 tahun.
print(filtered_data): Menampilkan data yang telah difilter
Membuat grafik distribusi usia:
data['Umur'].plot(kind='hist', title='Distribusi Umur'): Membuat histogram untuk distribusi umur.
[Link]('Umur'): Memberikan label pada sumbu x.
[Link](): Menampilkan grafik.
PENJELASAN CODE
Membuat scatter plot umur vs pendapatan:
[Link](kind='scatter', x='Umur', y='Income', title='Umur vs Pendapatan'): Membuat scatter plot untuk
umur vs pendapatan.
[Link]('Umur'): Memberikan label pada sumbu x.
[Link]('Pendapatan'): Memberikan label pada sumbu y.
[Link](): Menampilkan grafik.
Membuat bar plot untuk kategori:
data['Kategori'].value_counts().plot(kind='bar', title='Jumlah Customer per Kategori'): Membuat bar plot
untuk jumlah customer per kategori.
[Link]('Kategori'): Memberikan label pada sumbu x.
[Link]('Jumlah'): Memberikan label pada sumbu y.
[Link](): Menampilkan grafik.