0% menganggap dokumen ini bermanfaat (0 suara)
17 tayangan23 halaman

Sesi 4-Belajar Python Data Science

Dokumen ini menjelaskan tentang pustaka Python yang digunakan dalam data science, termasuk NumPy, Pandas, Matplotlib, dan Seaborn. Pustaka-pustaka ini menyediakan fungsionalitas untuk manipulasi data, analisis statistik, dan visualisasi, serta kemudahan instalasi dan penggunaan. Contoh penggunaan dan langkah-langkah untuk membaca, membersihkan, dan menganalisis data juga disertakan.

Diunggah oleh

dfiairfani
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd
0% menganggap dokumen ini bermanfaat (0 suara)
17 tayangan23 halaman

Sesi 4-Belajar Python Data Science

Dokumen ini menjelaskan tentang pustaka Python yang digunakan dalam data science, termasuk NumPy, Pandas, Matplotlib, dan Seaborn. Pustaka-pustaka ini menyediakan fungsionalitas untuk manipulasi data, analisis statistik, dan visualisasi, serta kemudahan instalasi dan penggunaan. Contoh penggunaan dan langkah-langkah untuk membaca, membersihkan, dan menganalisis data juga disertakan.

Diunggah oleh

dfiairfani
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd

Bootcamp Sesi 4

BELAJAR PYTHON
DATA SCIENCE

@ o y u s e p
PYTHON LIBRARY
INTRODUCTION
Python Library atau pustaka Python adalah kumpulan modul dan paket yang menyediakan fungsionalitas tambahan yang
tidak ada dalam pustaka standar Python. Pustaka ini memungkinkan pengguna untuk melakukan berbagai tugas spesifik
tanpa harus menulis kode dari awal. Modul adalah satuan kode yang dapat diimpor ke dalam program Python, sementara
paket adalah koleksi modul yang dikelompokkan bersama dalam satu direktori.

Menghemat Waktu dan Usaha & Konsistensi dan Keandalan


Contoh: NumPy menyediakan fungsi matematika yang efisien,
Pandas memudahkan manipulasi data, dan Matplotlib
membantu membuat grafik.

Ketersediaan Dokumentasi dan Komunitas


Contoh: Dokumentasi resmi Pandas dan forum diskusi Stack
Overflow.
MANFAAT LIBRARY
KEMUDAHAN DALAM PYTHON
Kemudahan Penggunaan
Python dikenal dengan sintaksisnya yang sederhana dan mudah dibaca. Pustaka Python dirancang
untuk mempertahankan kesederhanaan ini, sehingga pengguna baru maupun berpengalaman
dapat dengan cepat memanfaatkannya.
Contoh: Membaca file CSV dengan Pandas hanya memerlukan satu baris kode (pd.read_csv('[Link]')).

Kemudahan Instalasi
Pustaka Python dapat diinstal dengan mudah menggunakan pip, manajer paket Python. Proses
instalasi ini biasanya hanya memerlukan satu perintah di terminal atau command prompt.
Contoh: pip install numpy pandas matplotlib seaborn
MANFAAT LIBRARY
KEMUDAHAN DALAM PYTHON
Kompatibilitas dan Dukungan Platform
Pustaka Python tersedia dan didukung di berbagai platform (Windows, macOS, Linux). Hal ini
memastikan bahwa kode Anda dapat dijalankan di berbagai lingkungan tanpa banyak perubahan.
Contoh: Pustaka seperti OpenCV untuk pemrosesan gambar dan video yang dapat digunakan di
berbagai sistem operasi.

Ekosistem yang Luas


Python memiliki ekosistem pustaka yang sangat luas yang mencakup hampir semua aspek
komputasi, dari analisis data, pembelajaran mesin, pengembangan web, hingga pengembangan
permainan.
Contoh: TensorFlow dan Keras untuk deep learning, Flask dan Django untuk pengembangan web.
JENIS-JENIS
LIBRARY DATA SCIENCE
Dalam data science, Python adalah salah satu bahasa yang paling populer karena memiliki ekosistem
pustaka yang luas dan kuat. Berikut adalah beberapa pustaka Python yang sering digunakan dalam data
science

NumPy:
Deskripsi: NumPy (Numerical Python) adalah pustaka dasar untuk komputasi ilmiah dengan Python.
Ini menyediakan objek array multidimensi yang kuat, serta fungsi untuk melakukan operasi
matematika pada array tersebut.
Fitur Utama: Array multidimensi, operasi matematis dasar, fungsi aljabar linier, transformasi Fourier.
Instalasi: pip install numpy

import numpy as np
arr = [Link]([1, 2, 3, 4, 5])
print([Link]())
PENGENALAN PANDAS

PANDAS
Pandas adalah salah satu perpustakaan yang paling penting dalam ekosistem Python untuk
pengolahan data, dan telah menjadi alat yang sangat berharga bagi bisnis dalam
mengeksplorasi, membersihkan, dan menganalisis data

PANDAS
Pandas adalah pustaka Python yang sangat populer untuk manipulasi dan analisis data. Ini
menyediakan struktur data fleksibel yang disebut DataFrame, yang memungkinkan Anda
bekerja dengan data tabular dengan cara yang intuitif dan efisien.
PENGENALAN
PANDAS
Struktur Data di Pandas
Series: Struktur data 1D seperti array yang dapat diindeks.
DataFrame: Struktur data 2D seperti tabel yang dapat diindeks dengan baris dan kolom.

Instalasi Pandas
Untuk menginstal Pandas, Anda dapat menggunakan pip:
pip install pandas
MENGGUNAKAN
PANDAS
Membaca dan Menulis Data
Pandas mendukung berbagai format file untuk membaca dan menulis data, seperti CSV, Excel, SQL, dan JSON.

Membaca Data dari File CSV:

import pandas as pd

# Membaca data dari file CSV


data = pd.read_csv('[Link]')
print([Link]())

Note : jangan lupa upload file csv ke


google colab
PENGENALAN MATPLOTLIB
Matplotlib adalah pustaka untuk membuat visualisasi data dalam bentuk grafik. Ini
memungkinkan Anda membuat berbagai jenis grafik, seperti grafik garis, histogram, scatter
plot, dan banyak lagi.

Fitur Utama: Grafik 2D, kustomisasi grafik, integrasi dengan Pandas dan NumPy.
Instalasi: pip install matplotlib

Contoh Penggunaan

import [Link] as plt


[Link]([1, 2, 3, 4])
[Link]('some numbers')
[Link]()
PENGENALAN MATPLOTLIB
PENGENALAN SEABORN
Seaborn adalah pustaka visualisasi data yang dibangun di atas Matplotlib. Ini menyediakan
antarmuka tingkat tinggi untuk menggambar grafik statistik yang menarik dan informatif.

Fitur Utama: Grafik statistik, peta panas, scatter plot dengan regresi, visualisasi distribusi.
Instalasi: pip install seaborn
Contoh Penggunaan:

import seaborn as sns


df = sns.load_dataset('tips')
[Link](x='total_bill', y='tip', data=df)
[Link]()
PENGENALAN SEABORN
LIBRARY PYTHON DATA SCIENCE
Pustaka-pustaka ini adalah alat yang sangat berguna bagi para data scientist untuk melakukan
berbagai tugas mulai dari manipulasi data, analisis statistik, visualisasi data, hingga
pembangunan model pembelajaran mesin. Setiap pustaka memiliki kekuatan dan kegunaan
spesifik, sehingga sering digunakan secara bersama-sama untuk memaksimalkan kemampuan
analisis dan pemodelan data.
EXPLORASI
DATA
Eksplorasi Data
Sebelum menganalisis data, kita perlu memahami struktur dan karakteristiknya. Pandas
menyediakan berbagai fungsi untuk mengeksplorasi data seperti `head()`, `info()`, dan `describe()

Contoh:
# Menampilkan beberapa baris pertama data
print([Link]())

# Menampilkan informasi tentang data


print([Link]())

# Menampilkan ringkasan statistik data


print([Link]())
PEMBERSIHAN
DATA
Data dalam bisnis sering kali tidak sempurna dan perlu dibersihkan sebelum dapat dianalisis. Pandas
menyediakan berbagai alat untuk membersihkan dan merapikan data, termasuk mengelola nilai-
nilai yang hilang dan menduplikasi baris.

Contoh:
# Menghapus baris dengan nilai yang hilang
[Link](inplace=True)

# Menghapus duplikat baris


data.drop_duplicates(inplace=True)
OPERASI DASAR
PANDAS Struktur Data: Series dan DataFrame
# Membuat Series dari list
series = [Link]([1, 2, 3, 4, 5])
print(series)
Menulis Data ke File CSV
# Menulis DataFrame ke file CSV # Membuat DataFrame dari dictionary
data.to_csv('[Link]', index=False) data = {
'Name': ['Alice', 'Bob', 'Charlie'],
Mengakses Kolom: 'Age': [25, 30, 35],
# Mengakses kolom 'Name' 'City': ['New York', 'Los Angeles',
print(df['Name']) 'Chicago']
}
Mengakses Baris df = [Link](data)
# Mengakses baris pertama print(df)
print([Link][0])
OPERASI DASAR
PANDAS Struktur Data: Series dan DataFrame
# Membuat Series dari list
series = [Link]([1, 2, 3, 4, 5])
print(series)
Menulis Data ke File CSV
# Menulis DataFrame ke file CSV # Membuat DataFrame dari dictionary
data.to_csv('[Link]', index=False) data = {
'Name': ['Alice', 'Bob', 'Charlie'],
Mengakses Kolom: 'Age': [25, 30, 35],
# Mengakses kolom 'Name' 'City': ['New York', 'Los Angeles',
print(df['Name']) 'Chicago']
}
Mengakses Baris df = [Link](data)
# Mengakses baris pertama print(df)
print([Link][0])
OPERASI DASAR
PANDAS
Mengganti Nilai Missing
# Mengganti nilai missing dengan nilai tertentu
[Link](0, inplace=True)

Statistik Deskriptif
# Mendapatkan statistik deskriptif
print([Link]())
VISUALISASI DATA
PANDAS
Pandas menyediakan antarmuka yang mudah untuk
membuat grafik menggunakan Matplotlib.

Membuat Grafik Garis: Membuat Grafik Bar


# Membuat grafik garis dari DataFrame # Membuat grafik bar dari DataFrame
[Link](kind='line', x='Name', y='Age') [Link](kind='bar', x='Name', y='Age')
[Link]('Grafik Garis Umur') [Link]('Grafik Bar Umur')
[Link]('Nama') [Link]('Nama')
[Link]('Umur') [Link]('Umur')
[Link]() [Link]()
CONTOH KASUS:
ANALISIS DATA

Penjelasan Struktur Dataset:


CostumerID: Identitas Pelanggan
Umur: Usia Pelanggan.
Income: Pendapatan tahunan individu
Kategori: kategori level pendapatan

Setelah menyalin data di atas ke file [Link], Anda dapat menjalankan


skrip Python yang telah disediakan untuk membaca, memanipulasi, dan
memvisualisasikan data.
import pandas as pd
import [Link] as plt

# Membaca data dari file CSV


data = pd.read_csv('customer_data.csv')

CONTOH KASUS: # Menampilkan 5 baris pertama


print([Link]())

ANALISIS DATA # Mengganti nilai missing dengan 0 (jika ada)


[Link](0, inplace=True)

# Menampilkan statistik deskriptif


print([Link]())

CustomerID Umur Income Kategori


# Memfilter data untuk usia di atas 30
filtered_data = data[data['Umur'] > 30]
1 19 5000000 Besar
print(filtered_data)
2 20 4000000 Besar
# Membuat grafik distribusi usia
3 23 3000000 Cukup data['Umur'].plot(kind='hist', title='Distribusi Umur')
[Link]('Umur')
4 28 1500000 Kecil [Link]()

5 22 1900000 Kecil # Membuat scatter plot umur vs pendapatan


[Link](kind='scatter', x='Umur', y='Income', title='Umur vs
6 30 4000000 Besar Pendapatan')
[Link]('Umur')
7 50 3200000 Cukup [Link]('Pendapatan')
[Link]()
8 32 3000000 Cukup
# Membuat bar plot untuk kategori
9 31 1000000 Kecil data['Kategori'].value_counts().plot(kind='bar', title='Jumlah Customer
per Kategori')
10 41 500000 Kurang [Link]('Kategori')
[Link]('Jumlah')
[Link]()
PENJELASAN CODE
Membaca data dari file CSV:
data = pd.read_csv('customer_data.csv'): Membaca file CSV ke dalam DataFrame Pandas.

Menampilkan 5 baris pertama:


print([Link]()): Menampilkan 5 baris pertama dari DataFrame.

Mengganti nilai missing dengan 0 (jika ada):


[Link](0, inplace=True): Mengganti nilai yang hilang dengan 0.

Menampilkan statistik deskriptif:


print([Link]()): Menampilkan statistik deskriptif dari DataFrame.

Memfilter data untuk usia di atas 30:


filtered_data = data[data['Umur'] > 30]: Memfilter data untuk customer yang berusia di atas 30 tahun.
print(filtered_data): Menampilkan data yang telah difilter

Membuat grafik distribusi usia:


data['Umur'].plot(kind='hist', title='Distribusi Umur'): Membuat histogram untuk distribusi umur.
[Link]('Umur'): Memberikan label pada sumbu x.
[Link](): Menampilkan grafik.
PENJELASAN CODE
Membuat scatter plot umur vs pendapatan:
[Link](kind='scatter', x='Umur', y='Income', title='Umur vs Pendapatan'): Membuat scatter plot untuk
umur vs pendapatan.
[Link]('Umur'): Memberikan label pada sumbu x.
[Link]('Pendapatan'): Memberikan label pada sumbu y.
[Link](): Menampilkan grafik.

Membuat bar plot untuk kategori:


data['Kategori'].value_counts().plot(kind='bar', title='Jumlah Customer per Kategori'): Membuat bar plot
untuk jumlah customer per kategori.
[Link]('Kategori'): Memberikan label pada sumbu x.
[Link]('Jumlah'): Memberikan label pada sumbu y.
[Link](): Menampilkan grafik.

Anda mungkin juga menyukai