Start
Masukkan dataset
Download
Import Semua ke dalam variable
Dataset dan
Library yang dengan
tempatkan di work
dibutuhkan menggunakan
repository
pandas
Buka, baca dan
pahami data
- print(data)
- print([Link]()
-print([Link]())
Yes Type data yang
Dist. Ada duplikat No
Ada null? Label Konsisten? tidak lazim?
normal? kolom? misal timestamp
No
Yes Yes
No No
Yes
Gunakan Feature
Gunakan Mean Gunakan Median Engineering 1:
- Gabung kolom
- Ubah Tipe Data
Cek Lineplot dan
Boxplot
Linear, Log. Regr.
Distribusi
KNN, LDA Outlier
Normal?
SVM, K-means
Yes Yes
??
No Yes No
- Log Transformation
- Square Root - IQR
- Box-Cox Transform - Winsorization
- Yeo-Johnson - Z-Score
Quantile Transform
Apakah ada:
1. Dua fitur yang sangat
berkorelasi (Multikolinieritas)?
2. Bisa menggunakan domain
expertise?
3. Fitur yang dapat dibuang?
Apakah ada data Apakah terdapat
Apakah ada dua Apakah bisa
yang imbalance data leakage (fitur
No fitur yang sangat menggunakan No
(misal 99% yang memberi
berkorelasi domain
normal, 1 % tahu jawaban
(Multikolinieritas)? expertise?
penipuan) kepada model)
Yes Yes Yes Yes
Buat fitur baru Gunakan Pastikan tidak
yang dapat Oversampling ada fitur yang
Gabungkan fitur
mempermudah (SMOTE) memberi tahukan
menjadi satu
model untuk atau jawaban kepada
menganalisa Undersampling model
Cleaned Data
apakah datanya
Buat ordinal order
klasifikasi dan
sesuai fitur
mempunyai
urutan?
Pisahkan target
dan fitur
Buat pipeline atau feature engineering
dengan scaler, one hot encoder, min-max
scaler, label encoder
Buat Model
sesuai dengan
tujuan
permodelan
Evaluasi
Evaluasi model dengan:
Buat analisis residual ** Untuk Regresi: Uji dengan
Analisis fitur dengan: dengan : r2, mse, rmse, mae Buat Learning memasukkan
Lakukan K-Fold
- feature importance : Curve data baru atau
Cross Validation
-shap values/ LIME - buat scatter plot ** Untuk Klasifikasi: dummy
-buat histogram plot accuracy, recall, f1 score, Confusion
Matrix, ROC-AUC Curve
Jika overfitting (Skor training bagus, skor validation buruk), maka
- kurangi fitur
Jika Grafik residual membentuk pola - Buat fitur lebih sederhana
(Error tidak acak, membentuk corong - Lakukan Dimensionality Reduction (PCA)
Jika feature importance tidak
atau kurva), maka: - Tambahkan Regularization
masuk akal, maka:
- Log Transformasi pada variabel
- Data Leakage
target Jika Underfitting(Skor Training dan Validation sama-sama Rendah), maka:
- Multikolinieritas
- Cek outliers - Buat Fitur baru (feature creation)
- Cek missing features (kurang fitur) - Lakukan Transformasi
- Gunakan algoritma yang lebih kompleks, misal dari Linear Regression ke Random Forest
Jika Confusion Matrix Buruk pada Salah Satu Kelas (Misal: Model jago menebak "Sehat", tapi
gagal total menebak "Sakit"), maka:
- Class Imbalance: Anda perlu melakukan SMOTE (Oversampling) atau Undersampling
- Threshold Adjustment: Cek apakah Anda perlu menggeser ambang batas probabilitas
klasifikasi.
save model dan
Finish
scaler