01.
Konversi Pandas Dataframe
# library
import pandas as pd
df = pd.read_csv('california_housing_train.csv')
[Link]()
02 SKLearn Train Test Split
Tujuan
Pada codelab ini kita akan belajar membagi dataset menggunakan fungsi Train Test Split dari
library SKLearn.
Tahapan Latihan
1. Persiapkan dataset ke dalam Notebook.
2. Import library SKLearn.
3. Buat variabel untuk menampung data training dan data testing.
4. Panggil fungsi train_test_split().
# library
import sklearn
from sklearn import datasets
# load iris dataset
iris = datasets.load_iris()
# pisahkan atribut dan label pada iris dataset
x=[Link]
y=[Link]
# library
from sklearn.model_selection import train_test_split
# membagi dataset menjadi training dan testing
x_train, x_test, y_train, y_test = train_test_split(x, y, test_size=0.2, random_state=1)
# menghitung panjang/jumlah data pada x_test
len(x_test)
03. SKLearn Cross Validation Split
# libray
import sklearn
from sklearn import datasets
# load iris dataset
iris = datasets.load_iris()
# bagi atribut dan target, assign ke dalam variable x, y
x=[Link]
y=[Link]
# libray
from sklearn.model_selection import cross_val_score
from sklearn import tree
clf = [Link]()
# mengevaluasi performa model dengan cross_val_score
scores = cross_val_score(clf, x, y, cv=5)
scores
04. Sklearn Decision Tree ([Link])
# libray
import pandas as pd
import warnings
# Suppress all warnings
[Link]("ignore")
# membaca file [Link]
iris = pd.read_csv('[Link]')
# melihat informasi dataset pada 5 baris pertama
[Link]()
# Melihat informasi dataset
[Link]()
# melihat informasi dataset pada 5 baris pertama
[Link]()
[Link]
# menghilangkan kolom yang tidak penting
[Link]('Id',axis=1,inplace=True)
[Link]()
# memisahkan atribut dan label
X = iris[['SepalLengthCm', 'SepalWidthCm', 'PetalLengthCm', 'PetalWidthCm' ]]
y = iris['Species']
# Membagi dataset menjadi data latih & data uji
from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.1, random_state=123)
# libray
from [Link] import DecisionTreeClassifier
# membuat model Decision Tree
tree_model = DecisionTreeClassifier()
# melatih model dengan menggunakan data latih
tree_model = tree_model.fit(X_train, y_train)
# Evaluasi Model
from [Link] import accuracy_score
y_pred = tree_model.predict(X_test)
acc_secore = round(accuracy_score(y_pred, y_test), 3)
print('Accuracy: ', acc_secore)
# prediksi model dengan tree_model.predict([[SepalLength, SepalWidth, PetalLength,
PetalWidth]])
print(tree_model.predict([[6.2, 3.4, 5.4, 2.3]])[0])
#library
from [Link] import export_graphviz
export_graphviz(
tree_model,
out_file = "iris_tree.dot",
feature_names = ['SepalLengthCm', 'SepalWidthCm', 'PetalLengthCm', 'PetalWidthCm'],
class_names = ['Iris-setosa', 'Iris-versicolor', 'Iris-virginica' ],
rounded= True,
filled =True)
05. SKLearn Linear Regressio
Latihan SKLearn Linear Regression
Tujuan
Pada latihan kali ini kita akan memprediksi harga rumah berdasarkan jumlah kamar.
Tahapan Latihan
1. Impor library yang dibutuhkan.
2. Buat dataset dummy dengan Numpy Array.
3. Buat plot dari model.
Codelab
Pertama kita mengimpor library yang diperlukan. Lalu buat data dummy menggunakan numpy
array.
# library
import numpy as np
#buat data jumlah kamar
bedrooms = [Link]([1,1,2,2,3,4,4,5,5,5])
#data harga rumah. asumsi dalam dollar
house_price = [Link]([15000, 18000, 27000, 34000, 50000, 68000, 65000, 81000,85000,
Selanjutnya, kita bisa mencoba menampilkan data tersebut dalam bentuk scatter plot. Jumlah kamar
pada sumbu X adalah variabel independen dan harga rumah pada sumbu Y adalah variabel
dependen.
# menampilkan scatter plot dari dataset
import [Link] as plt
%matplotlib inline
[Link](bedrooms, house_price)
Lalu pada cell berikutnya, kita bisa mulai melatih model kita dengan memanggil fungsi
[Link]() pada data kita. Fungsi ini untuk melatih model regresi linier dari library
SKLearn.
from sklearn.linear_model import LinearRegression
# latih model dengan Linear [Link]()
bedrooms = [Link](-1, 1)
linreg = LinearRegression()
[Link](bedrooms, house_price)
Terakhir kita bisa melihat bagaimana model kita menyesuaikan dengan data yang kita miliki dengan
membuat plot dari model kita.
# menampilkan plot hubungan antara jumlah kamar dengan harga rumah
[Link](bedrooms, house_price)
[Link](bedrooms, [Link](bedrooms))
Model regresi linier adalah salah satu model machine learning yang paling sederhana. Model ini
memiliki kompleksitas rendah dan bekerja sangat baik pada dataset yang memiliki hubungan linier.
Jadi, ketika Anda menemui masalah yang terlihat memiliki hubungan linier, regresi linier dapat
menjadi pilihan pertama sebagai model untuk dikembangkan.
06. SKLearn Logistic Regression (Social_Network_Ads.csv)
Tujuan
Pada latihan ini kita akan menggunakan logistic regression untuk memprediksi apakah seseorang
akan membeli setelah melihat iklan sebuah produk.
Tahapan Latihan
Tahapan yang dilalui dalam latihan kali ini adalah sebagai berikut:
1. Ubah dataset menjadi Dataframe.
2. Hapus kolom 'User ID'.
3. Pisahkan atribut dan label.
4. Latih model Logistic Regression.
5. Evaluasi akurasi model.
Codelab Dataset untuk latihan bisa Anda unduh pada tautan berikut
[Link] Seperti biasa, unggah dataset
Social_Network_Ads pada session storage Google Colab.
Setelah kita mengunggah berkas data pada Colab kita akan mengubah dataset menjadi dataframe
Pandas. Jangan lupa untuk mengimpor library dasar dan menyesuaikan path/lokasi datanya ya.