Tugas Sesi 9 Analisis Data
3420033-Alvito Rahmat Indrawan
Data Mining
Case: Sebuah asuransi kesehatan ingin memprediksi segmen orang-orang yang
memiliki potensi untuk terkena serangan jantung, maka prediksi tersebut perlu
dilakukan dengan metode K Means Clustering dengan variable jenis kelamin, berat
badan dan tingkat kolesterol dari masing-masing pasien.
Step 1:
Input Dataset Chapter06 dan rename. Data ini berisikan variable yang dibutuhkan
untuk analisa seperti jenis kelamin, berat badan, dan tingkat kolesterol.
Step 2:
Input Operator K-means, hubungkan dataset dengan operator K-means dan ubah K
value menjadi 4.
Step 3:
Sambungkan operator K-means ke result di ujung kanan dan proses data dengan
menekan tombol Play untuk mendapatkan result.
Result:
Berikut adalah result dari hasil analisa data yang sudah dilakukan. Dapat dilihat
bahwa segmen yang berpotensi paling tinggi terkena serangan jantung adalah
segmen 2 dikarenakan berat badan yang paling tinggi, karena semakin tinggi berat
badan semakin tinggi juga potensi serangan jantung. Begitu pula dengan tingkat
kolesterol, segmen 2 memiliki tingkat kolesterol paling tinggi. Dan segmen 2 ini
cenderung didominasi oleh gender pria.
Maka pihak asuransi bisa melakukan pandekatan dan menargetkan campaign
mereka kepada orang-orang dari segmen 2.
Discriminant Analysis
Case: terdapat sebuah akademi olahraga yang memiliki banyak calon atlet untuk
dibina. Pihak akademi olahraga ini ingin mengetahui potensi dari masing-masing
calon atlet untuk memprediksi dan mengarahkan calon atletnya ke arah olahraga
yang tepat agar menghasilkan atlet-atlet berkualitas.
Step 1:
Input dataset chapter07 Training, data ini berisikan data para atlet yang pernah
dilatih di akademi olahraga ini di masa lampau.
Step 2:
Input 2 Filter Examples untuk memfilter variable Decision_Making, isi condition class
dari kedua filter dengan attribute value filter, salah satu filter diisi dengan parameter
string Decision_Making >=3 dan satunya diisi Decision_Making <=100, karena nilai
Decision Making yang diperhitungkan hanya dari nilai 3 sampai 100
Step 3:
Input operator set role, isi target role dengan label dan isi attribute name dengan
Prime Sport, karena variable yang akan diprediksi adalah Prime Sport
Step 4:
Input operator LDA (Linear Discriminant Analysis) untuk menganalisa data Training
Step 5:
Proses data dengan menekan tombol play untuk melihat result dari hasil LDA dari
data Training
Result LDA Training:
Berikut adalah hasil dari LDA untuk data Training yang berisikan persentase jumlah
atlet dari masing-masing cabang olahraga di masa lampau yang pernah dilatih oleh
akademi olahraga ini.
Step 6:
Input data Scoring yang berisikan data para calon atlet saat ini yang akan dianalisa
oleh akademi olahraga untuk mengetahui potensi yang bisa diarahkan dari masing-
masing calon atlet.
Step 7:
Input Filter Examples sama seperti di step 2, karena nilai Decision Making yang
diperhitungkan hanya dari nilai 3 sampai 100
Step 8:
Input Apply Model dan pindahkan konektor dari LDA menjadi melalui Apply Model
terlebih dahulu sebelum langsung terhubung ke Result
Step 9:
Proses data dengan menekan tombol Play untuk melihat Result
Result:
Hasil dari analisa menunjukkan cabang olahraga utama yang bisa diarahkan untuk
masing-masing calon atlet yang terdapat di kolom Prediction Prime Sport. Dengan
mengacu pada hasil data tersebut akademi olahraga bisa mengarahkan calon atlet
dengan tepat dan menghasilkan calon-calon atlet yang berkualitas sesuai dengan
potensi dan kapasitasnya masing-masing. Dengan menghasilkan atlet-atlet
berkualitas bisa meningkatkan prestasi serta kredibilitas dari akademi olahraga
tersebut dan menambah kemungkinan akademi olahraga ini bisa lebih laku dan
dikenal banyak orang.
Logistic Regression
Case: pihak asuransi kesehatan memiliki data pasien yang pernah terkena serangan
jantung, dan mereka ingin menganalisa untuk mengetahui pasien mana saja yang
berpotensi terkena serangan jantung untuk kedua kalinya.
Step 1:
Input Dataset Chapter09 Training dan Scoring
Step 2:
Input Operator Set Role dan sambungkan dengan Data Training, pilih label pada
target role dan 2nd_Heart_Attack pada attribute name.
Step 3:
Input Operator Logistic Regression dan sambungkan dengan Set Role.
Step 4:
Input Operator Apply Model dan sambungkan dari Logistic Regression dan Data
Scoring, lalu bisa langsung disambungkan ke result.
Step 5:
Proses data dengan menekan tombol Play untuk mendapatkan Result.
Result:
Pada Result bisa langsung dilihat hasil analisa dari masing-masing pasien apakah
mereka berpotensi untuk terkena serangan jantung kedua kalinya pada kolom
Prediction.
Dengan hasil analisa tersebut pihak asuransi kesehatan bisa melakukan approach
dan menargetkan campaign mereka kepada pasien-pasien yang berpotensi terkena
serangan jantung kedua kali dengan tujuan untuk menyelamatkan kesehatan pasien
tersebut dan meminimalisir biaya tanggungan pihak asuransi kesehatan untuk
pasien tersebut.