0% menganggap dokumen ini bermanfaat (0 suara)
5 tayangan4 halaman

Machine Learning - Flowchart

Dokumen ini adalah panduan langkah demi langkah untuk memproses dan menganalisis dataset menggunakan teknik machine learning. Proses mencakup pembersihan data, feature engineering, pemodelan, dan evaluasi model. Selain itu, terdapat penanganan untuk masalah seperti multikolinieritas, data imbalance, dan overfitting.

Diunggah oleh

Puguh J Nugroho
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd
0% menganggap dokumen ini bermanfaat (0 suara)
5 tayangan4 halaman

Machine Learning - Flowchart

Dokumen ini adalah panduan langkah demi langkah untuk memproses dan menganalisis dataset menggunakan teknik machine learning. Proses mencakup pembersihan data, feature engineering, pemodelan, dan evaluasi model. Selain itu, terdapat penanganan untuk masalah seperti multikolinieritas, data imbalance, dan overfitting.

Diunggah oleh

Puguh J Nugroho
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd

Start

Masukkan dataset
Download
Import Semua ke dalam variable
Dataset dan
Library yang dengan
tempatkan di work
dibutuhkan menggunakan
repository
pandas

Buka, baca dan


pahami data
- print(data)
- print([Link]()
-print([Link]())

Yes Type data yang


Dist. Ada duplikat No
Ada null? Label Konsisten? tidak lazim?
normal? kolom? misal timestamp

No
Yes Yes
No No

Yes

Gunakan Feature
Gunakan Mean Gunakan Median Engineering 1:
- Gabung kolom
- Ubah Tipe Data

Cek Lineplot dan


Boxplot
Linear, Log. Regr.
Distribusi
KNN, LDA Outlier
Normal?
SVM, K-means
Yes Yes
??

No Yes No

- Log Transformation
- Square Root - IQR
- Box-Cox Transform - Winsorization
- Yeo-Johnson - Z-Score
Quantile Transform

Apakah ada:
1. Dua fitur yang sangat
berkorelasi (Multikolinieritas)?
2. Bisa menggunakan domain
expertise?
3. Fitur yang dapat dibuang?

Apakah ada data Apakah terdapat


Apakah ada dua Apakah bisa
yang imbalance data leakage (fitur
No fitur yang sangat menggunakan No
(misal 99% yang memberi
berkorelasi domain
normal, 1 % tahu jawaban
(Multikolinieritas)? expertise?
penipuan) kepada model)

Yes Yes Yes Yes

Buat fitur baru Gunakan Pastikan tidak


yang dapat Oversampling ada fitur yang
Gabungkan fitur
mempermudah (SMOTE) memberi tahukan
menjadi satu
model untuk atau jawaban kepada
menganalisa Undersampling model
Cleaned Data

apakah datanya
Buat ordinal order
klasifikasi dan
sesuai fitur
mempunyai
urutan?

Pisahkan target
dan fitur

Buat pipeline atau feature engineering


dengan scaler, one hot encoder, min-max
scaler, label encoder

Buat Model
sesuai dengan
tujuan
permodelan
Evaluasi

Evaluasi model dengan:


Buat analisis residual ** Untuk Regresi: Uji dengan
Analisis fitur dengan: dengan : r2, mse, rmse, mae Buat Learning memasukkan
Lakukan K-Fold
- feature importance : Curve data baru atau
Cross Validation
-shap values/ LIME - buat scatter plot ** Untuk Klasifikasi: dummy
-buat histogram plot accuracy, recall, f1 score, Confusion
Matrix, ROC-AUC Curve

Jika overfitting (Skor training bagus, skor validation buruk), maka


- kurangi fitur
Jika Grafik residual membentuk pola - Buat fitur lebih sederhana
(Error tidak acak, membentuk corong - Lakukan Dimensionality Reduction (PCA)
Jika feature importance tidak
atau kurva), maka: - Tambahkan Regularization
masuk akal, maka:
- Log Transformasi pada variabel
- Data Leakage
target Jika Underfitting(Skor Training dan Validation sama-sama Rendah), maka:
- Multikolinieritas
- Cek outliers - Buat Fitur baru (feature creation)
- Cek missing features (kurang fitur) - Lakukan Transformasi
- Gunakan algoritma yang lebih kompleks, misal dari Linear Regression ke Random Forest

Jika Confusion Matrix Buruk pada Salah Satu Kelas (Misal: Model jago menebak "Sehat", tapi
gagal total menebak "Sakit"), maka:
- Class Imbalance: Anda perlu melakukan SMOTE (Oversampling) atau Undersampling
- Threshold Adjustment: Cek apakah Anda perlu menggeser ambang batas probabilitas
klasifikasi.

save model dan


Finish
scaler

Anda mungkin juga menyukai