0% menganggap dokumen ini bermanfaat (0 suara)
17 tayangan7 halaman

Panduan SKLearn: Dataframe & Model ML

Dokumen ini menjelaskan berbagai teknik pemodelan machine learning menggunakan library SKLearn, termasuk pembagian dataset, validasi silang, dan penggunaan model Decision Tree, Linear Regression, dan Logistic Regression. Setiap bagian memberikan langkah-langkah praktis untuk mempersiapkan data, melatih model, dan mengevaluasi akurasi. Contoh kode disertakan untuk membantu pemahaman dan implementasi teknik-teknik tersebut.

Diunggah oleh

carolus.dewanto
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd
0% menganggap dokumen ini bermanfaat (0 suara)
17 tayangan7 halaman

Panduan SKLearn: Dataframe & Model ML

Dokumen ini menjelaskan berbagai teknik pemodelan machine learning menggunakan library SKLearn, termasuk pembagian dataset, validasi silang, dan penggunaan model Decision Tree, Linear Regression, dan Logistic Regression. Setiap bagian memberikan langkah-langkah praktis untuk mempersiapkan data, melatih model, dan mengevaluasi akurasi. Contoh kode disertakan untuk membantu pemahaman dan implementasi teknik-teknik tersebut.

Diunggah oleh

carolus.dewanto
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd

01.

Konversi Pandas Dataframe

# library
import pandas as pd
df = pd.read_csv('california_housing_train.csv')
[Link]()

02 SKLearn Train Test Split

Tujuan

Pada codelab ini kita akan belajar membagi dataset menggunakan fungsi Train Test Split dari
library SKLearn.

Tahapan Latihan

1.​ Persiapkan dataset ke dalam Notebook.


2.​ Import library SKLearn.
3.​ Buat variabel untuk menampung data training dan data testing.
4.​ Panggil fungsi train_test_split().

# library
import sklearn
from sklearn import datasets

# load iris dataset


iris = datasets.load_iris()

# pisahkan atribut dan label pada iris dataset


x=[Link]
y=[Link]

# library
from sklearn.model_selection import train_test_split

# membagi dataset menjadi training dan testing


x_train, x_test, y_train, y_test = train_test_split(x, y, test_size=0.2, random_state=1)

# menghitung panjang/jumlah data pada x_test


len(x_test)
03. SKLearn Cross Validation Split

# libray
import sklearn
from sklearn import datasets

# load iris dataset


iris = datasets.load_iris()

# bagi atribut dan target, assign ke dalam variable x, y


x=[Link]
y=[Link]

# libray
from sklearn.model_selection import cross_val_score
from sklearn import tree

clf = [Link]()
# mengevaluasi performa model dengan cross_val_score
scores = cross_val_score(clf, x, y, cv=5)
scores

04. Sklearn Decision Tree ([Link])

# libray
import pandas as pd
import warnings

# Suppress all warnings


[Link]("ignore")

# membaca file [Link]


iris = pd.read_csv('[Link]')

# melihat informasi dataset pada 5 baris pertama


[Link]()

# Melihat informasi dataset


[Link]()

# melihat informasi dataset pada 5 baris pertama


[Link]()
[Link]
# menghilangkan kolom yang tidak penting
[Link]('Id',axis=1,inplace=True)

[Link]()

# memisahkan atribut dan label


X = iris[['SepalLengthCm', 'SepalWidthCm', 'PetalLengthCm', 'PetalWidthCm' ]]
y = iris['Species']

# Membagi dataset menjadi data latih & data uji


from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.1, random_state=123)

# libray
from [Link] import DecisionTreeClassifier

# membuat model Decision Tree


tree_model = DecisionTreeClassifier()

# melatih model dengan menggunakan data latih


tree_model = tree_model.fit(X_train, y_train)

# Evaluasi Model
from [Link] import accuracy_score

y_pred = tree_model.predict(X_test)

acc_secore = round(accuracy_score(y_pred, y_test), 3)


print('Accuracy: ', acc_secore)

# prediksi model dengan tree_model.predict([[SepalLength, SepalWidth, PetalLength,


PetalWidth]])
print(tree_model.predict([[6.2, 3.4, 5.4, 2.3]])[0])

#library
from [Link] import export_graphviz
export_graphviz(
tree_model,
out_file = "iris_tree.dot",
feature_names = ['SepalLengthCm', 'SepalWidthCm', 'PetalLengthCm', 'PetalWidthCm'],
class_names = ['Iris-setosa', 'Iris-versicolor', 'Iris-virginica' ],
rounded= True,
filled =True)
05. SKLearn Linear Regressio
Latihan SKLearn Linear Regression

Tujuan

Pada latihan kali ini kita akan memprediksi harga rumah berdasarkan jumlah kamar.

Tahapan Latihan

1.​ Impor library yang dibutuhkan.


2.​ Buat dataset dummy dengan Numpy Array.
3.​ Buat plot dari model.

Codelab

Pertama kita mengimpor library yang diperlukan. Lalu buat data dummy menggunakan numpy
array.

# library

import numpy as np

#buat data jumlah kamar

bedrooms = [Link]([1,1,2,2,3,4,4,5,5,5])

#data harga rumah. asumsi dalam dollar

house_price = [Link]([15000, 18000, 27000, 34000, 50000, 68000, 65000, 81000,85000,

Selanjutnya, kita bisa mencoba menampilkan data tersebut dalam bentuk scatter plot. Jumlah kamar
pada sumbu X adalah variabel independen dan harga rumah pada sumbu Y adalah variabel
dependen.

# menampilkan scatter plot dari dataset


import [Link] as plt
%matplotlib inline

[Link](bedrooms, house_price)
Lalu pada cell berikutnya, kita bisa mulai melatih model kita dengan memanggil fungsi
[Link]() pada data kita. Fungsi ini untuk melatih model regresi linier dari library
SKLearn.

from sklearn.linear_model import LinearRegression

# latih model dengan Linear [Link]()


bedrooms = [Link](-1, 1)
linreg = LinearRegression()
[Link](bedrooms, house_price)

Terakhir kita bisa melihat bagaimana model kita menyesuaikan dengan data yang kita miliki dengan
membuat plot dari model kita.

# menampilkan plot hubungan antara jumlah kamar dengan harga rumah


[Link](bedrooms, house_price)
[Link](bedrooms, [Link](bedrooms))
Model regresi linier adalah salah satu model machine learning yang paling sederhana. Model ini
memiliki kompleksitas rendah dan bekerja sangat baik pada dataset yang memiliki hubungan linier.
Jadi, ketika Anda menemui masalah yang terlihat memiliki hubungan linier, regresi linier dapat
menjadi pilihan pertama sebagai model untuk dikembangkan.

06. SKLearn Logistic Regression (Social_Network_Ads.csv)

Tujuan
Pada latihan ini kita akan menggunakan logistic regression untuk memprediksi apakah seseorang
akan membeli setelah melihat iklan sebuah produk.

Tahapan Latihan
Tahapan yang dilalui dalam latihan kali ini adalah sebagai berikut:

1.​ Ubah dataset menjadi Dataframe.


2.​ Hapus kolom 'User ID'.
3.​ Pisahkan atribut dan label.
4.​ Latih model Logistic Regression.
5.​ Evaluasi akurasi model.
Codelab Dataset untuk latihan bisa Anda unduh pada tautan berikut
[Link] Seperti biasa, unggah dataset
Social_Network_Ads pada session storage Google Colab.

Setelah kita mengunggah berkas data pada Colab kita akan mengubah dataset menjadi dataframe
Pandas. Jangan lupa untuk mengimpor library dasar dan menyesuaikan path/lokasi datanya ya.

Anda mungkin juga menyukai