SUPERVISED LEARNING
CLASSIFICATION
with Case Study
Angga Aditya Permana
DAFTAR ISI
• TENTANG MACHINE LEARNING
• ALGORITMA DALAM MACHINE LEARNING
• APA ITU KLASIFIKASI
• PENGENALAN ALGORITMA KNN
• LANGKAH KERJA KNN
• STUDI KASUS KLASIFIKASI
• KESIMPULAN
TENTANG MACHINE LEARNING
Definisi :
Sub-bidang dari AI yang berfokus pada
pengembangan algoritma yang
memungkinkan komputer untuk belajar
dari data dan membuat prediksi atau
keputusan tanpa diprogram secara
eksplisit.
TENTANG MACHINE LEARNING
Jenis Jenis Machine Learning
ALGORITMA DALAM MACHINE LEARNING
Supervised Learning
( Classification )
• K-Nearest Neighbors (KNN)
• Decision Tree
• Support Vector Machine (SVM)
• Naive Bayes
Support Vector Machine (SVM)
ALGORITMA DALAM MACHINE LEARNING
Unsupervised Learning
( Clustering )
• K-Means Clustering
• PCA (Principal Component Analysis)
APA ITU
KLASIFIKASI?
Definisi umum:
cara pengelompokan dan pengkategorian
yang didasarkan pada ciri-ciri tertentu.
Definisi dalam machine learning:
cara komputer untuk "mengelompokkan"
sesuatu berdasarkan contoh yang sudah
ada. Kita melatih komputer menggunakan
data sehingga komputer bisa "belajar"
mengenali dan mengelompokkan hal-hal
baru.
ANALOGINYA
Diberi Data
Gambar
Apel Kondisi Apel Kondisi
Segar Busuk
ANALOGINYA
diberi test
uji
Test Test
1 2
PENGENALAN
ALGORITMA KNN
KNN (K-Nearest Neighbors) adalah salah satu
algoritma machine learning yang paling
sederhana dan mudah dipahami.
Algoritma ini tidak memerlukan pelatihan
sebelumnya. Proses klasifikasi dilakukan
saat ada data baru!
KNN bekerja dengan cara mencari sejumlah K
tetangga terdekat dari suatu data baru, lalu
menentukan label (kategori) berdasarkan
mayoritas tetangga terdekat tersebut.
ANALOGI SIMPEL TENTANG KNN
“TELL ME ABOUT YOUR FRIENDS (WHO YOUR NEIGHBORS ARE) AND I
WILL TELL YOU WHO YOU ARE”
LANGKAH KERJA
KNN
1 Pilih Jumlah Tetangga Terdekat (K).
Hitung Jarak Antara Titik Data Baru dan
2 Semua Titik Data Lainnya
3 Pilih K Titik Terdekat
Lakukan Voting Mayoritas (Untuk Klasifikasi)
4 atau rata-rata (untuk regresi)
STUDI KASUS
CLASSIFICATION
Langkah-langkah:
1. Pengumpulan Dataset
[Link] (Eksplorasi Analisis Data)
[Link] Proses Data
[Link] Fitur
[Link] Data (Train-Test Split)
[Link] & Pelatihan Model
[Link] Hyperparameter
[Link] Model
PENGUMPULAN
DATASET
dataset yang kita gunakan dalam klasifikasi adalah iris
dataset dari library sklearn
contoh kodingan
dalam python
untuk mengimport
dataset iris
dataset ini bisa langsung di import
menggunakan python apabila anda sudah
menginstall scikit learn
EDA
EKSPLORASI ANALISIS DATA
Proses awal dalam analisis data yang bertujuan untuk memahami
karakteristik, struktur, dan pola dari dataset sebelum memodelkan atau
melakukan analisis lanjutan.
EDA
EKSPLORASI ANALISIS DATA
Mengetahui struktur tipe datanya Untuk mengetahui nilai distribusi
untuk setiap fitur dan target setiap data
Untuk melihat jumlah data yang kosong
untuk setiap fitur dan target
Mengetahui nama fitur nya apa saja, dan
targetnya apa saja
PRA PROSES
DATA
Pra-processing data adalah tahap ketiga dalam pemrosesan
data yang bertujuan untuk membersihkan dan mempersiapkan
data mentah sehingga siap digunakan dalam model atau
analisis. Ini adalah langkah penting karena data mentah
biasanya tidak sempurna—mungkin mengandung missing
values, data duplikat, outliers, atau format yang tidak konsisten.
karena dataset iris tergolong dataset bawaan yang sudah dibersihkan, kita
tidak perlu melakukan pra processing data
PEMILIHAN FITUR
Proses memilih subset dari fitur (atau variabel) yang paling relevan
atau signifikan dari dataset untuk digunakan dalam pembuatan
model machine learning. Tujuan utama dari feature selection adalah
meningkatkan performa model, mengurangi kompleksitas, serta
menghindari overfitting.
karena dataset yang kita gunakan kecil, kita akan menggunakan
semua fitur untuk memprediksi jenis iris.
PEMBAGIAN DATA
Dataset dibagi menjadi dua bagian: data latih dan data uji. Biasanya,
proporsi 70-80% untuk data latih dan 20-30% untuk data uji. Pembagian
ini penting untuk memastikan model yang dilatih dapat dievaluasi dengan
baik pada data yang belum pernah dilihat sebelumnya.
contoh cara membagi test size 0.2 artinya kita
data latih dan data uji ingin data uji sebanyak 20%
dalam python dan data latih 80%
PEMODELAN
Pemodelan
menentukan algoritma yang digunakan untuk mengenali
pola dalam data ataupun membuat sebuah prediksi
import algoritma model
menentukan n
neighbor
TUNING PARAMETER
Proses untuk mengoptimalkan model
agar hasilnya lebih baik.
Output
Output
TUNING PARAMETER
Kurva
KESIMPULAN
classification
Cara Kerja
THANK YOU