Data Mining Project
Student Name : M. Fitratul Iman
Student ID : 19.11.2809
Course : Data Mining
Lecturer : Arif dwi laksito, [Link]
Title : Implementasi algoritma decision tree menggunakan
dataset Pima Indians Diabetes Database
Januari 2022
1. Introduction
1.1
1.2 AIMS AND OBJECTIVES
Dengan meningkatnya jumlah penderita penyakit diabetes di india diperlukan
suatu sistem keamanan pendeteksi serangan yang dapat mengklasifikasikan
serangan dengan cepat, serta dapat mengolah data dalam skala besar. Salah satu
metode untuk pengolahan data denganskala besar yaitu dengan data mining.
Data mining adalah proses yang menggunakan satu atau lebih teknik Machine
Learninguntuk menganalisis dan mengekstrak pengetahuan secara otomatis.
Dalam kasus di dunia penelitian, banyak teknik dalam data mining yang dapat
digunakan, diantaranya yaitu teknik klasifikasi. Klasifikasi merupakan bentuk dasar
dari analisis data. Decision Tree menjadi salah satu teknik yang terkenal dalam
data mining dan merupakan salah satu yang populer metodenya dalam proses
pengambilan keputusan suatu kasus dimana dari metode tersebut diperoleh
kriteria entropi, keuntungan informasi dan rasio keuntungan. Project ini akan
membahas klasifikasi data dengan menggunakan algoritma Decision Tree, dimana
data tersebut berasal dari Institut Nasional Diabetes dan Penyakit Pencernaan dan
Ginjal. Tujuan dari kumpulan data adalah untuk memprediksi secara diagnostik
apakah pasien menderita diabetes atau tidak, berdasarkan pengukuran diagnostik
tertentu yang termasuk dalam kumpulan data. Beberapa kendala ditempatkan pada
pemilihan contoh ini dari database yang lebih besar. Secara khusus, semua pasien di
sini adalah wanita berusia minimal 21 tahun dari keturunan Pima India. Dataset
terdiri dari beberapa variabel prediktor medis (independen) dan satu variabel target
(dependen), Hasil. Variabel bebas meliputi jumlah kehamilan yang dialami pasien,
BMI, kadar insulin, usia, dan sebagainya. data tersebut dilakukan proses klasifikasi
dengan menggunakan algoritma Decision Tree, lalu diperoleh hasil Precission
0,78 serta didapatkan nilai recall tertinggi sebesar 76% dan tingkat akurasi
sebesar 99.86% sehingga model klasifikasi dengan menggunakan algoritma Decision
Treelebih baik saat diterapkan pada dataset tersebut.
2. TECHNOLOGY BASIS
2.1 Dataset
Pima Indians Diabetes Database, Dataset ini terdiri dari beberapa variabel prediktor
medis dan satu variabel target, Hasil. Variabel prediktor meliputi jumlah kehamilan yang
dialami pasien, BMI, kadar insulin, usia, dan sebagainya.
2.2 Algorithm
Decission Tree dalam konteks data mining mengarah pada aturan dari pohon
struktur, algortima dari decisson tree secara otomatis akan menentukan variabel yang
terpenting berdasarkan kemampuan mereka menyortir data menjadi output kategori
atau kelas yang benar. Algortima Decision Tree juga termasuk dalam teknik
klasifikasi Supervised Learning.
3. METHODS AND APPROACH
3.1 Project Flow
3.2 Modules