0% menganggap dokumen ini bermanfaat (0 suara)
3 tayangan5 halaman

Praktikum Machine Learning: Error dan Data Handling

Dokumen ini berisi materi praktikum Machine Learning yang mencakup error handling, visualisasi data, identifikasi nilai hilang, dan penghapusan duplikasi data. Setiap materi dilengkapi dengan penjelasan mengenai penggunaan library dan teknik yang digunakan untuk analisis data. Selain itu, terdapat penjelasan tentang pentingnya persiapan data untuk model machine learning dan penyimpanan data real-time.

Diunggah oleh

zuzutiktok09
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd
0% menganggap dokumen ini bermanfaat (0 suara)
3 tayangan5 halaman

Praktikum Machine Learning: Error dan Data Handling

Dokumen ini berisi materi praktikum Machine Learning yang mencakup error handling, visualisasi data, identifikasi nilai hilang, dan penghapusan duplikasi data. Setiap materi dilengkapi dengan penjelasan mengenai penggunaan library dan teknik yang digunakan untuk analisis data. Selain itu, terdapat penjelasan tentang pentingnya persiapan data untuk model machine learning dan penyimpanan data real-time.

Diunggah oleh

zuzutiktok09
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd

Nama : Mochamad Rafly Adryansyah Permana

Kelas : IF22D
Matkul : Machine Learning
NIM : 22416255201011

1. Materi Praktikum 1 : Error Handling: (Selesaikan mandiri) : Tambahkan error


handling untuk menangani kemungkinan masalah seperti waktu koneksi yang lama
atau data yang tidak sesuai dengan format yang diharapkan.
Gambar :

Penjelasan : 1. Library yang digunakan untuk ngambil data JSON dari suatu
API yaitu menggunakan Library Request
2. Untuk mengambil json harus disediakan link json yang berisi
data yang akan dikelola
3. Error handling disini berfungsi untuk koneksi API, tangani
error seperti timeout, dan menjalankan program dengan lancar

2. Materi Praktikum 2 : Visualisasi Data: Gunakan matplotlib atau seaborn untuk


membuat visualisasi sederhana seperti di bawah :
Gambar : #Code
#Outputnya

Penjelasan : 1. Code diatas dibuat untuk menampilkan visualisasi dalam


bentuk histogram yang mencakup seluruh data dari kolom
numerik agar memudahkan analisis pada pola data

3. Materi Praktikum 2 : Heatmap Gunakan heatmap untuk mencari fitur-fitur yang saling
berkorelasi tinggi. Tujuan nya mempertimbangkan penghapusan atau penggabungan
fitur untuk meningkatkan kualitas model analisis atau prediksi.
Gambar : # Code

#Output
Penjelasan : Gambar diatas menunjukkan hubungan antar variabel numerik yang
ada di dataset, dan nilai yang mendekati 1 atau -1 menunjukkan
kolerasi yang kuat

4. Materi Praktikum 3 : Mengidentifikasi Nilai Hilang (Missing Value). Berikan solusi


untuk menangani nilai yang hilang di kolom misal dengan rata-rata.
Gambar : # Code

#Output
Penjelasan : Gambar diatas menunjukan sebelum melangkah ke proses
selanjutnya, dilakukan pengecekan terhadap data untuk memastikan
tidak adanya nilai yang hilang. Hasil diatas menunjukkan sama dan
tidak ada data yang kosong

5. Materi Praktikum 3 : Menangani Duplikasi Data. Deteksi duplikasi data berdasarkan


seluruh kolom. Hapus baris yang duplikat.
Gambar : # Code

# Output

Penjelasan : Dalam tahap ini data diidentifikasi untuk melihat duplikasi


menggunakan fungsi duplicated() dari library pandas. Hasilnya tidak
terdapat baris data yang sama pada dataset yang artinya seluruh data
yang dikelola bersifat unik
6. Materi Praktikum 3 : Gunakan teknik Custom Mapping untuk mengubah nilai-nilai
kategori di kolom selain label yang memiliki data string menjadi angka.
Gambar :

Penjelasan : dalam tahap pelatihan model, proses ini penting dilakukan untuk
mempersiapkan data agar semua variabel siap diproses oleh agoritma
machine learning

7. Materi Praktikum 4 : Tambahkan fitur seperti menyimpan data real-time ke dalam file
CSV atau database.
Gambar : # Code

#Output

Penjelasan : Dari gambar lokasi penyimpanan yaitu menggunakan csv pada


google collab

Common questions

Didukung oleh AI

A heatmap visualizes the correlations between features by showing the relationship between numerical variables. Values close to 1 or -1 indicate strong correlations, which can be considered for feature removal or combination to reduce dimensionality and improve model performance. This step is crucial to refine the features before building predictive models .

Handling missing values is essential to ensure data completeness and accuracy before analysis. Missing data can lead to skewed results or erroneous conclusions if not addressed. Common approaches include replacing missing values with the mean of the column, which helps in maintaining the balance and reliability of the data for subsequent processes .

Detecting and resolving duplicate data involves using functions like `duplicated()` from libraries such as Pandas, which helps identify identical rows across specified columns. Once duplicates are identified, they are removed to ensure data unique properties within the dataset, facilitating more accurate data analysis and model training .

Transforming categorical data into numerical values using custom mapping is crucial because most machine learning algorithms require numerical input. This conversion allows algorithms to process all variables uniformly, enhancing computational efficiency and ensuring that the model accurately interprets the data's underlying patterns without biases associated with categorical distinctions .

Error handling is implemented to manage potential issues such as connection timeouts and to ensure the program runs smoothly without interruption. It addresses the problem of long connection times and data that doesn't match the expected format by providing mechanisms to catch and resolve these errors, thereby maintaining data integrity and operational stability .

Real-time data storage enhances machine learning workflows by providing immediate access to fresh data, allowing for dynamic model updates and timely predictions. Common technologies for real-time storage include CSV files for simple applications or databases for more complex scenarios, often utilizing platforms like Google Collaboratory for efficient storage management and accessibility in collaborative environments .

Anda mungkin juga menyukai