EXPLORATORY
DATA ANALISIS
Data Science XI PPLG
Vickky Listyaningsih, [Link].,[Link].
Pengertian EDA
Exploratory Data Analysis (EDA) merupakan
tahapan pada proses analisis data dan
menjadi suatu tahapan yang sangat
menentukan seberapa baik analisa data
selanjutnya akan dihasilkan.
Komponen EDA
O Preprocessing (missing values, outlier)
O Perhitungan berbagai nilai statistic dasar
O Visualisasi
O Penyusunan hipotesis (dugaan awal)
O Pemeriksaan asumsi
O Story telling
O Reporting
Tujuan EDA
O Mendapatkan asumsi hipotesis untuk
menentukan algoritma yang akan
digunakan
O Rekomendasi penambahan data
Pengertian Data Preprocessing
Data Preprocessing merupakan suatu proses
mengubah data mentah menjadi data yang
siap untuk bahan training model machine
learning.
Prepocessing
O Kunci utama dalam mendapatkan model
data science yang valid dan reliable
O Preprocessing yang berbeda akan
menghasilkan kesimpulan/insight yang
berbeda
Mengapa Perlu Preprocessing?
O Data di dunia nyata biasanya tidak
sebersih/indah data di buku akademik
O Tidak lengkap : hanya agregat, kurang
variabel penting
O Analisa pada data yang tidak
dipreprocessing biasanya menghasilkan
insight yang kurang tepat
Garbage in, Garbage Out
(American Proverb)
Tahapan Data Preprocessing :
1. Data Cleaning (Missing value,
Inconsistent, Duplikasi)
2. Mendeteksi Outlier
3. Mengubah kategorikal data dalam bentuk
numeric
4. Scaling, Normalisasi, Standarisasi jika
diperlukan
5. Feature Selection/Dimensionality
Reduction
1. Data Cleaning
Data Cleaning adalah proses membersihkan
data.
a. Missing value adalah nilai yang hilang
b. Inconsistensi adalah nilai yang tidak
konsisten
c. Duplikasi adalah nilai yang sama, harus
kita hilangkan untuk efisiensi
2. Outlier
Outlier adalah data yang nilainya berbeda
pada umumnya
3. Mengubah kategorikal data
menjadi numerik
Data dalam machine learning harus berupa
numerik jadi data string harus diubah dalam
bentuk numeric
4. Scaling, Normalisasi,
Standarisasi jika diperlukan
a. Scaling adalah mengubah rentang data
menjadi 0-1
b. Normalisasi adalah mengubah data
menjadi distribusi normal misalnya logistic
regression
c. Standarisasi adalah mengubah data
dalam bentuk standar
5. Feature Selection dan
Dimensionality Reduction
a. Feature Selection adalah memilih feature
yang memiliki korelasi kuat dengan output
b. Dimensionality Reduction adalah
mengompres dimensi data
Buka colabs
Masukkan dataset [Link]
TUGAS
O Lakukan cleaning data pada dataset di grup
sesuai langkah2 di atas