Memanggil liblary yang dibutuhkan dalam data analysis:
import pandas as pd
import numpy as np
import [Link] as plt
import seaborn as sns
pd.set_option('display.max_columns', None)
Panggil Dataset
Untuk pemanggilan langsung dari web :
url =
"[Link]
data"
column_names = ['age', 'workclass', 'fnlwgt', 'education',
'education_num', 'marital_status', 'occupation', 'relationship',
'race', 'sex', 'capital_gain', 'capital_loss', 'hours_per_week',
'native_country', 'income']
df = pd.read_csv(url, names=column_names, skipinitialspace=True,
na_values="?")
[Link](5)
Pemanggilan melalui drive yang terdapat pada google drive
perlu diperhatikan, jika menggunakan google drive sebagai tempat untuk meletakkan dataset, maka
gunakan dua script berikut ini untuk mendefinisikan lokasi file dan menghubungkan google drive
dengan colab.
Mendefinisikan variabel lokasi drive
# Define the variable
folder_name = "/content/drive/My Drive/Colab Notebooks"
membuat penghubung google drive dan colab.
from [Link] import drive
[Link]('/content/drive', force_remount=True)
import sys
[Link](f'{folder_name}')
memuat dataset
column_names = ['age', 'workclass', 'fnlwgt', 'education',
'education_num', 'marital_status', 'occupation', 'relationship',
'race', 'sex', 'capital_gain', 'capital_loss', 'hours_per_week',
'native_country', 'income']
df =pd.read_csv(f'{folder_name}/[Link]',
sep=',',names=column_names, skipinitialspace=True, na_values="?")
[Link](5)
hasil pemanggilan Dataset
Lakukan Pembacaan dataset
[Link]()
Pembacaan dataset terkait nilai yang hilang
missing_values = [Link]().sum()
print("\nJumlah missing value per kolom:")
print(missing_values)
hasilnya akan terlihat seperti berikut ini :
menghitung persentase nilai yang hilang
missing_percentage = (missing_values / len(df)) * 100
print("\nPersentase missing value per kolom:")
print(missing_percentage)
Kegiatan Menelaah Data
Membaca deskrpsi data
[Link]()
Membaca deskripsi data untuk data dalam bentuk Teks ( object)
[Link](include=['object'])
df['income'].value_counts(normalize=True)
Melakukan visualisasi Distribusi
numeric_features = df.select_dtypes(include=[[Link]]).columns
df[numeric_features].hist(figsize=(15, 10))
plt.tight_layout()
[Link]()
untuk data bersifat objek ( kategorikal)
categorical_features = df.select_dtypes(include=['object']).columns
for feature in categorical_features:
[Link](figsize=(10, 5))
df[feature].value_counts().plot(kind='bar')
[Link](f'Distribution of {feature}')
[Link]('Count')
[Link](feature)
[Link](rotation=45)
[Link]()
analisis korelasi
correlation_matrix = df[numeric_features].corr()
[Link](figsize=(12, 10))
[Link](correlation_matrix, annot=True, cmap='coolwarm')
[Link]('Correlation Matrix of Numeric Features')
[Link]()
Analisis Hubungan Target Variabel
for feature in numeric_features:
[Link](figsize=(10, 6))
[Link](x='income', y=feature, data=df)
[Link](f'{feature} vs Income')
[Link]()
Analisis untuk nilai kategorikal dengan target
for feature in categorical_features:
if feature != 'income':
[Link](figsize=(18, 6))
df_temp = [Link]([feature, 'income']).size().unstack()
df_temp_perc = df_temp.div(df_temp.sum(axis=1), axis=0)
df_temp_perc.plot(kind='bar', stacked=True)
[Link](f'{feature} vs Income')
[Link](feature)
[Link]('Percentage')
[Link](title='Income', loc='upper right')
[Link](rotation=45)
[Link]()
identifikasi Outlier
[Link](figsize=(15, 10))
df[numeric_features].boxplot()
[Link]('Box Plots of Numeric Features')
[Link](rotation=90)
[Link]()