PROJECT TASK- WEEK 7
Divisi Python Machine Learning – Vinix7 (PT. Vinix Seven Aurum)
Latar Belakang Proyek
Klien F&B kita baru saja mengakuisisi sebuah Roastery. Saat ini, proses penilaian
kualitas biji kopi masih dilakukan secara manual oleh para Q-Grader, yang mana
prosesnya sangat lambat dan rawan subjektivitas
Klien meminta kita membangun sebuah model Machine Learning yang bisa
memprediksi kategori kualitas kopi secara otomatis berdasarkan parameter sensor
mesin roasting dan teknik seduhan. Data dari sensor IoT kita sering kali kotor, dan model
biasanya akan underfitatau overfit. Saya menugaskan kalian untuk membangun pipeline
yang rapi dan memeras potensi maksimal dari model tersebut menggunakan teknik
validasi dan tuning yang presisi.
Teknis Proyek
Sebagai ML Engineer, tugas Anda adalah membangun Machine Learning Pipeline yang
utuh.
Data Preparation & Sklearn Pipeline
- Sensor mesin IoT kita terkadang mengalami error sehingga ada data numerik yang
kosong (Null), dan algoritma kita tidak bisa memproses data teks pada kolom
'Jenis Biji' secara langsung.
- Bangun sebuah Pipeline dari Scikit-Learn yang berisi langkah Imputasi (mengisi
data kosong), Encoding (mengubah teks menjadi angka), dan Scaling
(menyamakan rentang skala angka).
- Gabungkan tahapan prapemrosesan ini ke dalam satu Pipeline yang menyatu
dengan algoritma pilihan Anda.
Pembangunan Base Model
- Latih Pipeline Anda menggunakan algoritma dengan hyperparameter default
bawaan library.
- Catat metrik evaluasinya. (Kemungkinan besar hasilnya tidak akan optimal pada
data pengujian).
Hyperparameter Tuning & Validasi
- Gunakan teknik K-Fold Cross Validation untuk memastikan model Anda stabil
dan terhindar dari Data Leakage.
- Lakukan pencarian parameter terbaik menggunakan GridSearchCV atau
RandomizedSearchCV.
Komparasi & Analisis
- Bandingkan performa metrik Base Model vs Tuned Model.
- Analisis apakah Base Model Anda sebelumnya mengalami Overfitting atau
Underfitting, dan buktikan bagaimana parameter baru hasil tuning berhasil
memitigasi masalah tersebut.
Laporan
Sesuai prosedur operasi standar, kumpulkan hasil kerja Anda dalam bentuk 1 file PDF
dengan susunan berikut.
Identitas & Akses Kode
• Nama Kelompok & Nama Lengkap.
• Tautan (Link) Google Colab.
Laporan Teknis (Komparasi Metrik)
• Tampilkan Screenshot atau Tabel matriks evaluasi (Accuracy/Precision/Recall)
dari Base Model.
• Tampilkan Screenshot atau Tabel matriks evaluasi dari Tuned Model.
• Sebutkan secara eksplisit Best Parameters yang berhasil ditemukan oleh
pencarian Grid/Random Search Anda.
Analisis Bisnis (Bias-Variance Tradeoff)
• Berikan penjelasan analitis ala konsultan (maksimal 2 paragraf) kepada jajaran
manajemen: Mengapa model awal Anda kurang tangguh (underfit/overfit), dan
mengapa parameter baru yang ditemukan ini membuat klasifikasi kualitas kopi
menjadi jauh lebih akurat dan aman untuk diterapkan di pabrik sesungguhnya.
Indikator Penilaian
- Ketersediaan Link.
- Data Preparation & Sklearn Pipeline (20%): Peserta berhasil membangun alur
Pipeline yang tepat sasaran (Imputasi untuk Null, OneHotEncoder untuk
kategorikal, dan Scaler untuk numerik) tanpa terjadi Data Leakage.
- Implementasi Base Model (10%): Keberhasilan melatih Pipeline dasar dan
menampilkan evaluasi awalnya.
- Penerapan Cross-Validation (20%): Kode menunjukkan penggunaan algoritma
validasi silang (seperti K-Fold CV) yang benar dalam memvalidasi metrik model.
- Eksekusi Hyperparameter Tuning (20%): Implementasi Grid Search atau Random
Search dilakukan dengan mendefinisikan ruang pencarian (parameter grid) yang
logis.
- Kualitas Analisis & Pemahaman Bisnis (30%): Narasi di Halaman 3 (PDF) berhasil
membedah fenomena Bias-Variance Tradeoff dengan bahasa bisnis yang
meyakinkan, serta memberikan justifikasi kuat mengapa Tuned Model siap di-
deploy.