0% menganggap dokumen ini bermanfaat (0 suara)
352 tayangan85 halaman

Pengantar Data Sains: Oleh: Mohammad Sofyan S. Thayf

Diunggah oleh

dondi
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd
0% menganggap dokumen ini bermanfaat (0 suara)
352 tayangan85 halaman

Pengantar Data Sains: Oleh: Mohammad Sofyan S. Thayf

Diunggah oleh

dondi
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd

Pengantar Data Sains

oleh: Mohammad Sofyan S. Thayf


© Sofyan Thayf, 2023

Data sains, atau yang juga dikenal sebagai ilmu data atau data analytics, telah menjadi salah
satu bidang yang paling penting dalam dunia industri modern. Dalam era digital yang semakin
maju, banyak perusahaan dan organisasi telah mengumpulkan jumlah data yang besar dari
berbagai sumber, seperti media sosial, transaksi bisnis, sensor IoT (Internet of Thing), dan lain-
lain. Data ini sangat berharga bagi perusahaan karena dapat memberikan wawasan dan
pemahaman yang lebih dalam tentang perilaku pelanggan, tren pasar, dan efisiensi operasional.

Namun, jumlah data yang besar dan kompleks tersebut membutuhkan metode analisis yang
tepat agar bisa memberikan manfaat maksimal. Inilah peran penting dari data sains. Data sains
mencakup sejumlah teknik analisis statistik dan matematika, seperti machine learning, big data
analytics, dan data mining, yang dapat digunakan untuk menganalisis data dan mengekstrak
informasi yang berharga. Dengan menerapkan teknik ini, perusahaan dapat mengambil
keputusan yang lebih tepat waktu dan cerdas, mengoptimalkan operasional, meningkatkan
produktivitas, dan mengurangi biaya.

Oleh karena itu, penggunaan data sains telah menjadi suatu keharusan dalam dunia industri.
Perusahaan yang ingin tetap bersaing dan mengembangkan diri di pasar global harus dapat
memanfaatkan data mereka secara efektif. Selain itu, data sains juga telah menjadi karir yang
menjanjikan, dengan semakin banyaknya permintaan untuk profesional data sains yang terampil
dan terlatih.

© Sofyan Thayf, 2023 Page | 1


Daftar Isi
1. Pengertian Data Sains .................................................................................................................................... 5

Pengertian Data Sains .................................................................................................................................... 5

Peran Data Sains dalam Bisnis dan Industri ........................................................................................... 6

Tren Pemanfaatan Data Sains ..................................................................................................................... 8

Data Saintis ......................................................................................................................................................... 8

Referensi ........................................................................................................................................................... 11

2. Big Data ............................................................................................................................................................ 13

Pengertian dan Karakteristik Big Data .................................................................................................. 13

Data Terstruktur dan Tidak Terstruktur ................................................................................................ 16

Teknologi untuk Pengolahan Big Data ................................................................................................. 17

Problem dan Isu Seputar Big Data ......................................................................................................... 18

Referensi ........................................................................................................................................................... 19

3. Metodologi dalam Data Sains .................................................................................................................. 21

Langkah-langkah dalam Data Sains ....................................................................................................... 21

Metode Pengumpulan Data...................................................................................................................... 22

Data Cleaning dan Preprocessing........................................................................................................... 23

Explorasi Data ................................................................................................................................................. 23

Referensi ........................................................................................................................................................... 24

4. Dasar Statistika............................................................................................................................................... 26

Konsep Statistika ........................................................................................................................................... 26

Statistik Deskriptif ......................................................................................................................................... 26

Statistik Inferensi ........................................................................................................................................... 27

Pengukuran Pemusatan dan Penyebaran Data ................................................................................. 28

Pemusatan Data.............................................................................................................................. 28

Penyebaran Data ............................................................................................................................ 30

© Sofyan Thayf, 2023 Page | 2


Skewness dan Kurtosis ................................................................................................................. 32

Grafik dan Histogram .................................................................................................................................. 35

Referensi ........................................................................................................................................................... 36

5. Model-model Data Sains ........................................................................................................................... 38

Certainty dan Uncertainty ......................................................................................................................... 38

Probabilitas ...................................................................................................................................................... 38

Regresi dan Korelasi..................................................................................................................................... 39

Analisis Klaster dan Klasifikasi .................................................................................................................. 40

Referensi ........................................................................................................................................................... 41

6. Data Mining..................................................................................................................................................... 43

Pengertian dan Konsep Data Mining .................................................................................................... 43

Metode Data Mining.................................................................................................................................... 44

Model dalam Data Mining ......................................................................................................................... 46

Tools Data Mining......................................................................................................................................... 47

Referensi ........................................................................................................................................................... 49

7. Pengantar Machine learning ..................................................................................................................... 51

Konsep Dasar Machine learning.............................................................................................................. 51

Supervised dan Unsupervised Learning ............................................................................................... 53

Supervised learning ....................................................................................................................... 53

Unsupervised learning.................................................................................................................. 53

Model-model Machine learning.............................................................................................................. 54

Referensi ........................................................................................................................................................... 56

8. Visualisasi Data .............................................................................................................................................. 57

Pengertian dan Tujuan Visualisasi Data................................................................................................ 57

Jenis-jenis Visualisasi Data......................................................................................................................... 58

Strategi Pembuatan Visualisasi Data ..................................................................................................... 63

Metode dan Tools Visualisasi Data ........................................................................................................ 64

© Sofyan Thayf, 2023 Page | 3


Referensi ........................................................................................................................................................... 66

9. Konsep Database .......................................................................................................................................... 68

Pengertian Database.................................................................................................................................... 68

Pemodelan Database ................................................................................................................................... 69

Struktur Database ......................................................................................................................................... 71

Database Relasional ..................................................................................................................................... 72

Structured Query Language ...................................................................................................................... 73

NoSQL ............................................................................................................................................................... 76

Referensi ........................................................................................................................................................... 77

10. Pemrograman dalam Data Sains ............................................................................................................. 79

Pengertian Pemrograman .......................................................................................................................... 79

Pemrograman untuk Data Sains.............................................................................................................. 80

Pemrograman Python .................................................................................................................. 81

Pemrograman R .............................................................................................................................. 81

Pemilihan Python atau R ............................................................................................................. 82

Strategi Data Saintis Pemula..................................................................................................................... 83

Referensi ........................................................................................................................................................... 84

© Sofyan Thayf, 2023 Page | 4


1. Pengertian Data Sains

Pengertian Data Sains


Data sains adalah kumpulan fakta, angka, atau informasi yang telah diorganisir dan dianalisis
untuk digunakan dalam pemecahan masalah dan pengambilan keputusan di berbagai bidang
ilmu pengetahuan dan teknologi.

Berikut adalah pengertian data sains menurut beberapa sumber:

1. Menurut Inmon (2005), data sains adalah kumpulan data yang sangat besar, baik struktur
maupun tidak struktur, yang berasal dari berbagai sumber dan digunakan untuk membuat
analisis yang mendalam.
2. Menurut Anderson (2008), data sains adalah tentang mengeksplorasi data dan menggali
wawasan baru darinya, serta menemukan pola dan keterkaitan yang belum diketahui
sebelumnya.
3. Menurut Davenport dan Patil (2012), data sains melibatkan teknologi, matematika, dan
bisnis dalam menemukan, menafsirkan, dan mengkomunikasikan informasi yang terdapat
dalam data.
4. Menurut Wibowo (2018), data sains adalah proses pengumpulan, pengolahan, dan analisis
data yang bertujuan untuk menghasilkan informasi yang dapat digunakan untuk
pengambilan keputusan yang lebih baik.
5. Menurut Larose dan Larose (2019), data sains merupakan upaya untuk menggali
pengetahuan baru dan berguna dari data, termasuk cara-cara untuk memproses data,
menganalisisnya, dan menginterpretasikan hasilnya.

Dari pengertian-pengertian menurut para ahli di atas, dapat disimpulkan bahwa data sains
adalah proses pengumpulan, pengolahan, dan analisis data yang dilakukan untuk menghasilkan
informasi yang berguna dalam pemecahan masalah dan pengambilan keputusan di berbagai
bidang ilmu pengetahuan dan teknologi.

Di sisi lain, data sains adalah aplikasi pengolahan data dengan menggunakan metode-metode
matematika, statistika, dan teknik komputer untuk mendapatkan wawasan atau pemahaman
yang lebih dalam tentang data yang dihasilkan oleh berbagai sumber, baik itu dari sumber alami
maupun buatan manusia. Dalam konteks ini, data sains memberikan konteks pada data dengan
menyajikan informasi dan wawasan yang lebih dalam mengenai data tersebut. Data yang
dikumpulkan dan diproses dengan menggunakan metode-metode sains ini kemudian

© Sofyan Thayf, 2023 Page | 5


digunakan untuk membuat keputusan bisnis yang lebih baik, memperbaiki proses operasional,
mengidentifikasi tren pasar, dan memecahkan masalah lainnya yang dihadapi perusahaan.

Dengan penggunaan data sains, perusahaan dapat memperoleh pemahaman yang lebih baik
mengenai pelanggan, persaingan di pasar, preferensi dan perilaku pembelian, serta faktor-faktor
lain yang mempengaruhi bisnis mereka. Data sains juga memungkinkan perusahaan untuk
mengambil keputusan yang lebih baik, mengoptimalkan proses operasional mereka, dan
memprediksi perilaku pasar di masa depan. Oleh karena itu, penggunaan data sains sangat
penting bagi perusahaan modern dalam upaya meningkatkan keunggulan kompetitif mereka di
pasar.

Peran Data Sains dalam Bisnis dan Industri


Data sains atau data science memegang peran penting dalam bisnis dan industri modern karena
dapat membantu organisasi untuk membuat keputusan yang lebih baik dan efektif. Dengan
menggunakan data sains, perusahaan dapat mengidentifikasi tren pasar, memahami perilaku
konsumen, meningkatkan efisiensi operasional, dan mengoptimalkan pengambilan keputusan
berdasarkan bukti.

Beberapa contoh penggunaan data sains dalam bisnis dan industri antara lain:

1. Analisis risiko keuangan: Dalam industri keuangan, data sains digunakan untuk memprediksi
risiko kredit dan risiko pasar, serta untuk memperbaiki kepatuhan terhadap peraturan.
2. Pengembangan produk: Data sains dapat membantu perusahaan untuk mengembangkan
produk baru atau memperbarui produk yang sudah ada dengan mempelajari preferensi
konsumen, permintaan pasar, dan analisis tren.
3. Peningkatan efisiensi produksi: Dalam industri manufaktur, data sains digunakan untuk
meningkatkan efisiensi produksi dengan mengoptimalkan rantai pasokan, memperbaiki
kualitas produk, dan mengurangi biaya operasional.
4. Pelayanan pelanggan: Data sains digunakan dalam industri layanan pelanggan untuk
memahami kebutuhan pelanggan dan meningkatkan kepuasan pelanggan.
5. Analisis risiko lingkungan: Dalam industri energi dan sumber daya alam, data sains
digunakan untuk mengidentifikasi risiko lingkungan dan mengembangkan strategi
keberlanjutan.

Beberapa contoh penerapan data sains pada beberapa perusahaan layanan yang dikenal
masyarakat, antara lain:

1. Netflix, merupakan salah satu platform streaming film dan serial TV yang paling populer di
dunia. Netflix menggunakan data sains untuk menganalisis perilaku penonton dan
menawarkan rekomendasi film dan acara TV yang dipersonalisasi untuk setiap pengguna.

© Sofyan Thayf, 2023 Page | 6


Netflix juga menggunakan data sains untuk memprediksi performa dan popularitas acara TV
baru.
2. Amazon, adalah salah satu toko online terbesar di dunia. Amazon menggunakan data sains
untuk menganalisis perilaku konsumen dan menawarkan rekomendasi produk yang
dipersonalisasi. Amazon juga menggunakan data sains untuk memperbaiki pengiriman dan
logistik.
3. Airbnb, adalah platform penyewaan penginapan online yang populer di seluruh dunia.
Airbnb menggunakan data sains untuk menganalisis perilaku penyewa dan memberikan
rekomendasi penginapan yang dipersonalisasi. Airbnb juga menggunakan data sains untuk
memperbaiki sistem penilaian dan keamanan pengguna.
4. Grab, perusahaan transportasi online ini menggunakan data sains untuk menentukan harga
yang tepat bagi para pengemudi dan pelanggan, memperkirakan waktu tiba, dan
mengoptimalkan rute perjalanan.
5. Spotify, layanan streaming musik ini menggunakan data sains untuk merekomendasikan
lagu dan playlist kepada pengguna berdasarkan preferensi musik mereka dan perilaku
mendengarkan mereka.
6. Gojek, perusahaan transportasi online ini menggunakan data sains untuk mengatur
algoritma yang memungkinkan pelanggan mendapatkan pengemudi dalam waktu yang
tepat, memperkirakan waktu kedatangan, serta menentukan rute perjalanan yang terbaik.

Airbnb adalah salah satu perusahaan yang memanfaatkan data sains secara ekstensif dalam
pengambilan keputusan bisnis. Dalam beberapa tahun terakhir, Airbnb telah menginvestasikan
sumber daya yang signifikan dalam pengumpulan, pemrosesan, dan analisis data untuk
membantu mengembangkan strategi dan produk mereka. Contoh konkret dari penerapan data
sains pada Airbnb adalah:

1. Mempelajari perilaku pengguna dan preferensi mereka dalam menggunakan platform


Airbnb, misalnya dengan menganalisis data dari pencarian, pemesanan, dan ulasan
pengguna untuk menemukan pola dan tren.
2. Memprediksi permintaan dan harga, menggunakan algoritma machine learning untuk
memprediksi tingkat permintaan untuk tujuan tertentu pada waktu tertentu, dan
menyesuaikan harga sesuai dengan prediksi tersebut.
3. Menawarkan rekomendasi yang disesuaikan dengan kebutuhan pengguna, seperti daftar
tujuan wisata yang cocok dengan preferensi pengguna atau penginapan yang sesuai dengan
preferensi dan anggaran pengguna.

Peran data sains dalam pengambilan keputusan bisnis Airbnb sangat penting dan merupakan
salah satu faktor yang memungkinkan Airbnb untuk bertahan dan tumbuh menjadi salah satu
perusahaan paling sukses di industri pariwisata dan perjalanan. Meskipun sempat mengalami
penurunan akibat pandemi COVID-19, tetapi AirBnb berhasil beradaptasi dan memperluas
layanannya untuk tetap bertahan. Saat ini, AirBnb menyediakan lebih dari 7 juta akomodasi di

© Sofyan Thayf, 2023 Page | 7


seluruh dunia dan terus berkembang dengan menghadirkan fitur dan layanan baru bagi
penggunanya.

Tren Pemanfaatan Data Sains


Penggunaan data sains saat ini terus meningkat dan menjadi semakin penting dalam berbagai
industri dan sektor, seperti teknologi, kesehatan, pemasaran, keuangan, dan lain-lain. Beberapa
tren terkini dalam penggunaan data sains antara lain:

1. Machine learning dan AI: Penggunaan teknologi machine learning dan kecerdasan buatan
semakin berkembang, dan memungkinkan organisasi untuk melakukan analisis data yang
lebih canggih dan kompleks.
2. Big data: Data semakin melimpah dan beragam, dan perusahaan perlu memiliki kemampuan
untuk mengelola, menganalisis, dan memanfaatkannya secara efektif.
3. Cloud computing: Cloud computing memungkinkan organisasi untuk menyimpan,
mengelola, dan menganalisis data secara lebih efisien dan efektif.
4. Data visualisasi: Visualisasi data semakin penting, karena memungkinkan pengambilan
keputusan yang lebih cepat dan tepat dengan memudahkan pemahaman atas data yang
kompleks.
5. Penggunaan data untuk keamanan siber: Data sains dapat digunakan untuk mengidentifikasi
dan mencegah ancaman keamanan siber, termasuk melindungi data dan infrastruktur
perusahaan.
6. Penggunaan data untuk kecerdasan bisnis: Data sains dapat membantu organisasi
memahami pelanggan dan pasar mereka dengan lebih baik, dan memungkinkan
pengambilan keputusan bisnis yang lebih baik dan tepat.

Tren penggunaan data sains saat ini juga semakin meningkat dengan semakin terjangkaunya
teknologi untuk mengumpulkan, menyimpan, dan menganalisis data. Perusahaan-perusahaan
besar seperti Google, Amazon, dan Facebook telah berinvestasi dalam bidang data sains untuk
membantu mereka mengumpulkan dan menganalisis data pelanggan mereka. Demikian pula,
banyak organisasi dan lembaga pemerintah juga memanfaatkan data sains untuk meningkatkan
keputusan dan kinerja mereka.

Data Saintis
Data scientist atau data saintis adalah profesional yang bertanggung jawab untuk mengekstrak
wawasan atau informasi yang berharga dari data yang tersedia. Mereka memiliki kemampuan
untuk menganalisis data, mengembangkan model matematika dan statistik, dan menggunakan
teknologi terbaru untuk mengatasi masalah bisnis dan keilmuan.

© Sofyan Thayf, 2023 Page | 8


Data scientist sering bekerja dengan data besar, yang dapat berupa data struktural atau tidak
terstruktur, dan mereka menggunakan teknik pengolahan data seperti pemrosesan bahasa
alami, machine learning, dan analisis data untuk menghasilkan pemahaman yang berharga dari
data tersebut. Mereka juga memiliki kemampuan untuk membaca dan menginterpretasikan data
dan menerapkan pengetahuan mereka untuk memecahkan masalah kompleks dan merumuskan
solusi.

Tugas seorang data scientist termasuk:

1. Mengumpulkan data dari berbagai sumber dan memprosesnya menjadi format yang dapat
digunakan untuk analisis.
2. Menganalisis data untuk mengidentifikasi pola, tren, dan anomali yang dapat memberikan
wawasan bisnis atau ilmiah.
3. Mengembangkan model statistik dan matematika untuk memprediksi hasil atau
mengoptimalkan proses.
4. Menggunakan teknologi terbaru seperti machine learning dan pemrosesan bahasa alami
untuk mengotomatisasi proses analisis dan meningkatkan efisiensi.
5. Menerapkan pengetahuan statistik, matematika, dan teknologi informasi untuk memecahkan
masalah yang kompleks.

Data scientist sering bekerja di berbagai sektor seperti bisnis, teknologi informasi, kesehatan,
pemerintahan, dan ilmu pengetahuan. Mereka harus memiliki keterampilan analisis yang kuat,
pemahaman yang baik tentang teknologi informasi dan pemodelan matematika, dan
kemampuan untuk berkomunikasi dengan jelas dan efektif dengan berbagai pemangku
kepentingan.

Referensi yang dapat digunakan untuk mempelajari lebih lanjut tentang data scientist atau data
saintis adalah buku-buku teks, artikel, dan kursus online di bidang analisis data, machine
learning, dan statistik.

Peran dan penghargaan terhadap data saintis juga terus berkembang seiring dengan kemajuan
teknologi dan semakin meningkatnya penggunaan data dalam berbagai bidang. Para data
saintis diakui sebagai aset yang sangat penting dalam organisasi dan perusahaan karena
kemampuan mereka untuk memanfaatkan data secara efektif dan efisien untuk mengambil
keputusan yang baik.

Karir data saintis saat ini sangat menjanjikan dan berkembang pesat seiring dengan
pertumbuhan besar-besaran data dalam berbagai sektor. Dalam beberapa tahun terakhir,
permintaan untuk data scientist telah meningkat pesat di berbagai industri, termasuk teknologi,
perbankan, kesehatan, pemerintahan, dan lainnya.

© Sofyan Thayf, 2023 Page | 9


Perbandingan Salary Pekerja Data di US tahun 2022
Sumber: [Link]

Menurut laporan McKinsey Global Institute, diperkirakan bahwa pada tahun 2024, AS akan
memiliki kekurangan sekitar 140.000 sampai 190.000 data scientist dan 1,5 juta manajer data
yang mampu menerapkan analisis data dalam pengambilan keputusan bisnis. Kekurangan ini
memberikan peluang besar bagi para profesional yang ingin membangun karir di bidang ini.

Banyak perusahaan saat ini mencari data scientist yang memiliki keahlian dalam analisis data,
pemodelan matematika, dan pemrograman, serta kemampuan untuk menghasilkan wawasan
bisnis dari data. Selain itu, data scientist juga harus memiliki kemampuan untuk berkomunikasi
dengan jelas dan efektif dengan berbagai pemangku kepentingan dalam organisasi.

Perkembangan teknologi dan inovasi terus mendorong pertumbuhan data scientist sebagai karir
yang penting dan menjanjikan. Terdapat juga berbagai jenjang karir yang dapat dijalani oleh
seorang data scientist, seperti data analyst, data engineer, data architect, data scientist lead,
data science manager, atau bahkan CDO (Chief Data Officer).

Beberapa penghargaan terkenal yang diberikan kepada data saintis di antaranya adalah
penghargaan Nobel dalam bidang ekonomi dan penghargaan Turing dalam bidang komputer.
Selain itu, para data saintis juga diakui dalam berbagai bidang lain seperti ilmu sosial,
kedokteran, keuangan, dan lain-lain.

Berikut adalah beberapa referensi yang dapat memberikan informasi lebih lanjut tentang
perkembangan karir data scientist saat ini:

© Sofyan Thayf, 2023 Page | 10


1. "The Fastest-Growing Jobs of This Decade Are in Healthcare, Engineering, and Data Science"
(Forbes, 2022) - Artikel ini membahas tentang perkembangan karir data scientist dan
mengapa menjadi salah satu dari pekerjaan tercepat yang tumbuh di dekade ini.
2. "The Hottest Jobs in Data Science Right Now" (DataCamp, 2022) - Artikel ini memberikan
informasi tentang beberapa posisi data scientist yang paling dicari saat ini, seperti data
engineer, data analyst, dan data science manager.
3. "The Future of Data Science Jobs: 5 Exciting Predictions" (Springboard, 2022) - Artikel ini
meramalkan beberapa tren yang akan memengaruhi perkembangan karir data scientist di
masa depan, seperti peningkatan permintaan untuk spesialisasi dalam data ethics dan
peningkatan penggunaan teknologi kecerdasan buatan.
4. "State of Data Science & Machine learning 2022" (Kaggle, 2022) - Laporan ini memberikan
gambaran tentang keadaan saat ini dari industri data science dan machine learning,
termasuk tren dalam bidang ini dan keterampilan yang paling dicari oleh perusahaan.
5. "Data Science Career Guide: A Comprehensive Playbook for Aspiring Data Scientists"
(Springboard, 2022) - Panduan ini memberikan informasi tentang keterampilan dan alat
yang dibutuhkan untuk memulai karir di bidang data science, serta jalur karir yang tersedia
dan peluang yang ada.

Referensi
Anderson, C. (2008). The end of theory: The data deluge makes the scientific method obsolete.
Wired, 16(7), 16-07.

Chen, C. (2018). Data science in business and industry. Journal of Business Research, 88, 428-436.

Chen, H., Chiang, R. H., & Storey, V. C. (2012). Business intelligence and analytics: From big data
to big impact. MIS quarterly, 36(4), 1165-1188.

Davenport, T. H., & Patil, D. J. (2012). Data scientist: The sexiest job of the 21st century. Harvard
business review, 90(10), 70-76.

Inmon, W. H. (2005). Building the Data Warehouse. John Wiley & Sons.

Larose, D. T., & Larose, C. D. (2019). Discovering Knowledge in Data: An Introduction to Data
mining. John Wiley & Sons.

Marr, B. (2016). Big data: Using smart big data, analytics and metrics to make better decisions
and improve performance. John Wiley & Sons.

Provost, F., & Fawcett, T. (2013). Data science for business: what you need to know about data
mining and data-analytic thinking. O'Reilly Media, Inc.

Wibowo, A. (2018). Pengantar Data Science dan Machine learning. Elex Media Komputindo.

© Sofyan Thayf, 2023 Page | 11


[Link]

[Link]

[Link]

[Link]
science/

[Link]

[Link]

[Link]

[Link]

[Link]

© Sofyan Thayf, 2023 Page | 12


2. Big Data

Pengertian dan Karakteristik Big Data


Pengertian Big data menurut beberapa sumber:

1. Menurut Doug Laney (2001), yang merupakan seorang analis teknologi senior di Gartner,
Inc., Big data terdiri dari tiga dimensi, yaitu Volume, Velocity, dan Variety. Volume adalah
jumlah data yang sangat besar, Velocity adalah kecepatan pertumbuhan data, dan Variety
adalah beragamnya jenis data.
2. Menurut Viktor Mayer-Schönberger dan Kenneth Cukier (2013), Big data adalah istilah yang
digunakan untuk menggambarkan kumpulan data yang sangat besar dan kompleks yang
sulit dikelola dengan menggunakan perangkat lunak tradisional.
3. Menurut Mark van Rijmenam (2013), Big data adalah kumpulan data yang sangat besar,
kompleks, dan beragam yang memerlukan teknologi tinggi untuk dianalisis sehingga dapat
menghasilkan informasi dan wawasan yang bermanfaat.
4. Menurut Bernard Marr (2015), Big data adalah kumpulan data yang sangat besar dan
kompleks yang dapat digunakan untuk mengidentifikasi pola dan tren, dan memberikan
wawasan yang berharga untuk mendukung pengambilan keputusan bisnis.
5. Menurut SAS Institute Menurut SAS Institute (2012), perusahaan yang fokus pada software
analitik, Big data adalah istilah yang digunakan untuk mendeskripsikan kumpulan data yang
sangat besar yang memerlukan teknologi khusus untuk dianalisis, diproses, dan dipetakan
menjadi informasi yang berguna.

Sederhananya, big data adalah istilah yang merujuk pada volume besar data yang dihasilkan
oleh berbagai sumber seperti sensor, media sosial, transaksi bisnis, dan sebagainya. Data yang
dihasilkan bersifat heterogen, terstruktur maupun tidak terstruktur, serta membutuhkan alat dan
teknologi khusus untuk menganalisis dan mengolahnya. Karena volume dan kekompleksannya,
big data menuntut kemampuan komputasi yang kuat dan metode analisis data yang lebih
canggih.

Big data berasal dari berbagai sumber seperti:

1. Perangkat IoT (Internet of Things) yang terus bertambah: IoT merujuk pada jaringan
perangkat elektronik yang terhubung ke internet dan saling berkomunikasi satu sama lain.
Contohnya adalah kendaraan otonom, sensor lingkungan, perangkat medis, dan banyak lagi.
2. Perangkat mobile: Penggunaan smartphone dan tablet telah meningkat pesat dalam
beberapa tahun terakhir, sehingga banyak data yang dihasilkan dari penggunaan aplikasi,
panggilan, pesan teks, dan lainnya.

© Sofyan Thayf, 2023 Page | 13


3. Media sosial: Sosial media seperti Facebook, Twitter, Instagram, dan YouTube menghasilkan
sejumlah besar data dalam bentuk posting, komentar, foto, video, dan lainnya.
4. Teknologi cloud: Perusahaan yang menggunakan teknologi cloud seperti Amazon Web
Services, Google Cloud, dan Microsoft Azure memungkinkan organisasi untuk menyimpan,
mengelola, dan menganalisis data dalam skala besar.
5. Transaksi bisnis: Bisnis melakukan transaksi seperti penjualan, pembelian, dan pemesanan
dalam skala besar setiap hari. Semua data transaksi ini dikumpulkan dan dapat digunakan
untuk analisis bisnis.

Gambar 1 The Explosion of Data


Sumber: [Link]

Big data memiliki lima karateristik yang disebut sebagai karakteristik 5V, yang melekat pada
data yang sangat besar dan kompleks. Kelima karakteristik tersebut adalah:

1. Volume: Merupakan karakteristik yang paling mendasar dari Big data, yaitu jumlah data
yang sangat besar dan terus bertambah secara eksponensial. Jumlah data ini bisa mencapai
petabyte atau bahkan exabyte.
2. Velocity: Karakteristik kecepatan, yaitu kemampuan untuk menghasilkan dan memproses
data secara cepat. Data dalam jumlah besar dapat diproduksi dengan kecepatan tinggi dari
berbagai sumber, seperti sensor, perangkat mobile, atau platform media sosial.
3. Variety: Karakteristik keragaman data, yaitu jenis data yang sangat beragam dari berbagai
sumber, baik terstruktur maupun tidak terstruktur. Data jenis ini dapat berupa teks, gambar,
video, audio, atau data terstruktur seperti database.

© Sofyan Thayf, 2023 Page | 14


4. Veracity: Karakteristik kebenaran data, yaitu kualitas data yang dapat dipercaya. Dalam Big
data, data yang tidak akurat, tidak lengkap, atau tidak terpercaya dapat mempengaruhi hasil
analisis dan keputusan bisnis.
5. Value: Karakteristik nilai data, yaitu kemampuan untuk menghasilkan nilai dari data. Big data
dapat memberikan wawasan bisnis yang berharga, seperti tren pasar, perilaku konsumen,
atau prediksi risiko keuangan.

Gambar 2 Karsakteristik 5V Big data

Big data memiliki peran penting dalam data sains karena volume, kecepatan, dan keragaman
data yang besar membuat data sains menjadi semakin kompleks dan sulit untuk dianalisis
dengan metode konvensional. Dengan memanfaatkan big data, para ilmuwan dan analis dapat
menggabungkan data dari berbagai sumber dan memprosesnya menggunakan teknologi yang
lebih canggih untuk mendapatkan wawasan yang lebih mendalam dan akurat.

Big data memungkinkan peneliti atau praktisi data sains untuk mengakses, menyimpan, dan
menganalisis data dalam jumlah yang sangat besar dan beragam. Hal ini memungkinkan mereka
untuk menemukan pola-pola yang mungkin tidak terlihat dengan menggunakan metode
analisis tradisional. Selain itu, big data juga memungkinkan pengembangan model prediktif
yang lebih akurat untuk memprediksi perilaku konsumen atau fenomena sosial yang kompleks.

Dalam konteks data sains, big data dapat membantu dalam berbagai hal, seperti:

1. Meningkatkan akurasi prediksi: Dengan mengumpulkan data yang lebih banyak dan
beragam, analis dapat meningkatkan akurasi prediksi yang dihasilkan oleh model data.
© Sofyan Thayf, 2023 Page | 15
2. Mendukung pengambilan keputusan: Big data dapat membantu dalam proses pengambilan
keputusan dengan memberikan wawasan yang lebih mendalam dan akurat tentang tren dan
pola yang terkait dengan suatu topik atau isu.
3. Menemukan korelasi yang tidak terlihat: Big data dapat membantu menemukan korelasi
antara data yang sebelumnya tidak terlihat, sehingga memberikan pemahaman yang lebih
baik tentang hubungan antara koleksi data yang ada

Data Terstruktur dan Tidak Terstruktur


Data adalah kumpulan fakta atau angka yang digunakan sebagai dasar untuk membuat
keputusan atau mendapatkan informasi. Berdasarkan format, cara penyimpanan dan
strukturnya, data dapat dibagi menjadi tiga jenis utama, yakni:

1. Data Terstruktur
Data terstruktur adalah data yang tersusun dalam format yang terorganisir dengan jelas dan
memiliki skema atau struktur yang ditentukan sebelumnya. Setiap elemen data dalam
struktur memiliki tipe data yang sama. Jenis data ini biasanya disimpan dalam format tabel
atau file relasional. Contoh data terstruktur termasuk data pelanggan, data produk, dan data
penjualan.
2. Data Tidak Terstruktur
Data tidak terstruktur adalah data yang tidak memiliki format atau struktur yang jelas. Data
ini seringkali berbentuk teks, gambar, suara, atau video, dan tidak memiliki skema atau
struktur yang tetap. Data ini sangat sulit untuk diproses secara otomatis tanpa alat atau
teknologi yang tepat. Contoh data tidak terstruktur meliputi email, tweet, posting media
sosial, dokumen teks, rekaman video, dan suara.
3. Data Semi Terstruktur
Data semi terstruktur adalah data yang memiliki karakteristik dari kedua jenis data
sebelumnya. Data ini memiliki struktur yang tidak konsisten, tidak teratur, dan memiliki
format yang bervariasi, namun juga memiliki beberapa elemen yang memiliki skema atau
struktur yang jelas. Contoh data semi terstruktur meliputi HTML, XML, JSON, dan dokumen
PDF.

Semakin besar keberagaman dan kompleksitas data, semakin sulit pula memproses data
tersebut. Oleh karena itu, data yang telah terstruktur secara baik dan sistematis lebih mudah
untuk dikelola dan diolah, sementara data yang tidak terstruktur memerlukan teknik khusus
untuk mengelolanya. Namun, data tidak terstruktur dapat memberikan informasi berharga yang
tidak dapat ditemukan pada data terstruktur, sehingga keduanya memiliki nilai penting dalam
analisis data.

© Sofyan Thayf, 2023 Page | 16


Gambar 3 Kecenderungan Pertumbuhan Data yang semakin unstructured

Teknologi untuk Pengolahan Big Data


Analisis data skala besar (big data) adalah sebuah proses pengumpulan, pengolahan, dan
analisis data yang sangat besar, terstruktur dan tak terstruktur, yang tidak dapat ditangani oleh
perangkat lunak pengolahan data tradisional. Untuk melakukan analisis data skala besar,
diperlukan arsitektur sistem yang dapat menangani volume data yang besar, beragam, dan
bervariasi dengan kecepatan tinggi. Arsitektur sistem yang dirancang untuk big data harus dapat
mengatasi tantangan yang dihadapi, seperti kecepatan akses data yang tinggi, skalabilitas,
ketersediaan, dan keamanan.

Data yang tergolong sebagai big data dapat mencapai ratusan terabytes atau bahkan petabytes,
sehingga memerlukan sistem dan infrastruktur yang mampu menangani volume data yang
besar tersebut. Selain itu, big data seringkali terdiri dari beragam jenis data yang berasal dari
berbagai sumber, seperti data terstruktur dan tidak terstruktur, data streaming, data sosial
media, dan sebagainya, sehingga memerlukan teknologi khusus untuk mengintegrasikan dan
mengelola data tersebut. Selain itu, tools tersebut juga memungkinkan analisis data secara real-
time, analisis prediktif, dan visualisasi data yang kompleks. Dengan demikian, tools khusus untuk
big data sangat penting untuk mempermudah pengelolaan, analisis, dan ekstraksi informasi
yang berharga dari big data.

© Sofyan Thayf, 2023 Page | 17


Arsitektur sistem big data biasanya terdiri dari beberapa komponen, seperti sistem penyimpanan
data terdistribusi, sistem manajemen data, sistem pengolahan data, dan alat analisis data.
Berikut adalah beberapa contoh tools dan teknologi yang digunakan untuk pengolahan big
data:

1. Apache Hadoop

Apache Hadoop adalah platform open-source yang digunakan untuk menyimpan dan mengolah
big data. Hadoop terdiri dari dua komponen utama yaitu Hadoop Distributed File System (HDFS)
dan MapReduce. Hadoop dapat digunakan untuk mengolah data yang sangat besar dengan
kecepatan yang cukup tinggi.

2. Apache Spark

Apache Spark adalah platform open-source yang digunakan untuk mengolah big data secara
real-time. Spark dapat digunakan untuk melakukan pemrosesan data secara streaming, analisis
data, dan machine learning.

3. NoSQL databases

NoSQL databases adalah teknologi database yang dirancang untuk mengelola data yang sangat
besar dan kompleks. Beberapa contoh NoSQL databases adalah MongoDB, Cassandra, dan
Couchbase.

4. Apache Kafka

Apache Kafka adalah platform open-source yang digunakan untuk mengirim dan menerima
data secara real-time. Kafka dapat digunakan untuk menghubungkan berbagai sistem dan
aplikasi yang terpisah dan mengirim data secara cepat dan efisien.

5. TensorFlow

TensorFlow adalah platform open-source yang digunakan untuk melakukan analisis data dan
machine learning. TensorFlow dapat digunakan untuk membuat model machine learning yang
kompleks dan digunakan dalam berbagai aplikasi.

Problem dan Isu Seputar Big Data


Karena karakteristiknya, terdapat beberapa isu utama yang terkait dengan big data, antara lain:

1. Keamanan Data: Dalam lingkungan big data, jumlah data yang dihasilkan sangat besar dan
terus meningkat. Hal ini mengakibatkan risiko keamanan data yang lebih besar, seperti
kerentanan terhadap peretasan, pencurian data dan serangan siber.

© Sofyan Thayf, 2023 Page | 18


2. Kualitas Data: Big data terdiri dari berbagai sumber, termasuk data internal dan eksternal.
Sebagian besar data ini tidak terstruktur dan sering kali tidak bersih. Oleh karena itu, kualitas
data sering menjadi isu utama dalam big data.
3. Volume Data: Volume data yang dihasilkan dari sumber yang berbeda sangat besar dan
terus meningkat. Oleh karena itu, pengelolaan data, penyimpanan dan pengolahan menjadi
masalah yang kompleks.
4. Integrasi Data: Big data dapat berasal dari berbagai sumber yang berbeda dan formatnya
seringkali tidak seragam. Integrasi data menjadi isu penting dalam big data karena
perusahaan harus mengintegrasikan data dari berbagai sumber untuk menghasilkan
wawasan yang berguna.
5. Privacy Data: Big data terkait dengan isu privasi data karena jumlah data yang besar dapat
menyimpan informasi pribadi yang sensitif. Ini mengakibatkan masalah privasi dan
perlindungan data, seperti kebijakan privasi, regulasi, dan undang-undang tentang
pengumpulan dan penggunaan data.
6. Analisis Data: Analisis data adalah komponen utama dari big data, dan banyak perusahaan
menghadapi tantangan dalam mengolah dan menganalisis data. Data yang sangat besar
dan tidak terstruktur membutuhkan alat dan teknologi baru untuk pengolahan dan analisis.

Referensi
Katal, A., Wazid, M., & Goudar, R. H. (2013). Big data: Issues, challenges, tools and good
practices. In Contemporary Computing (pp. 404-417). Springer.

Lakshman, A., & Malik, P. (2010). Cassandra: a decentralized structured storage system. ACM
SIGOPS Operating Systems Review, 44(2), 35-40.

Laney, D. (2001). 3D Data Management: Controlling Data Volume, Velocity, and Variety. Gartner.

Manyika, J., Chui, M., Brown, B., Bughin, J., Dobbs, R., Roxburgh, C., & Byers, A. H. (2011). Big
data: The next frontier for innovation, competition, and productivity. McKinsey Global Institute.

Marr, B. (2015). Big data: Using Smart Big data, Analytics and Metrics to Make Better Decisions
and Improve Performance. John Wiley & Sons.

Mayer-Schönberger, V., & Cukier, K. (2013). Big data: A Revolution That Will Transform How We
Live, Work, and Think. Houghton Mifflin Harcourt.

Olston, C., Reed, B., Srivastava, U., Kumar, R., & Tomkins, A. (2008). Pig latin: a not-so-foreign
language for data processing. Proceedings of the 2008 ACM SIGMOD international conference
on Management of data, 1099-1110.

Panigrahi, S., & Sahu, S. (2017). Big data Analytics with R and Hadoop. Auerbach Publications.

© Sofyan Thayf, 2023 Page | 19


Provost, F., & Fawcett, T. (2013). Data Science for Business: What You Need to Know about Data
mining and Data-Analytic Thinking. O'Reilly Media, Inc.

SAS Institute Inc. (2012). Big data Analytics. SAS Institute Inc.

Thusoo, A., Sarma, J. S., Jain, N., Shao, Z., Chakka, P., Anthony, S., ... & Murthy, R. (2009). Hive: a
warehousing solution over a map-reduce framework. Proceedings of the VLDB Endowment, 2(2),
1626-1629.

Van Rijmenam, M. (2013). Think Bigger: Developing a Successful Big data Strategy for Your
Business. AMACOM.

White, T. (2015). Hadoop: The definitive guide. O'Reilly Media, Inc.

Zaharia, M., Chowdhury, M., Franklin, M. J., Shenker, S., & Stoica, I. (2010). Spark: Cluster
computing with working sets. HotCloud, 10(10-10), 95.

Zikopoulos, P., Eaton, C., deRoos, D., Deutsch, T., & Lapis, G. (2011). Understanding Big data:
Analytics for Enterprise Class Hadoop and Streaming Data. McGraw Hill Professional.

Apache Hadoop: [Link]

Apache Spark: [Link]

NoSQL databases: [Link]

Apache Kafka: [Link]

TensorFlow: [Link]

© Sofyan Thayf, 2023 Page | 20


3. Metodologi dalam Data Sains

Langkah-langkah dalam Data Sains


Data sains adalah bidang yang melibatkan berbagai tahapan dan metode dalam pengumpulan,
analisis, dan interpretasi data. Berikut adalah beberapa langkah-langkah umum dalam data
sains:

1. Identifikasi masalah atau pertanyaan yang ingin dijawab: Tujuan utama dari pengumpulan
dan analisis data adalah untuk menyelesaikan suatu masalah atau menjawab suatu
pertanyaan yang berhubungan dengan bidang tertentu. Pertanyaan penelitian adalah kunci
untuk memperoleh wawasan yang berharga dari data. Pertanyaan penelitian dalam data
sains mengarahkan analisis data dan membantu mengidentifikasi pola dan tren yang
tersembunyi dalam data. Penting untuk menetapkan pertanyaan penelitian yang jelas dan
terfokus dalam data sains, karena ini dapat membantu menghindari kebingungan dan
kehilangan fokus dalam analisis data. Sebagai contoh, pertanyaan penelitian dalam data
sains mungkin termasuk:
1. Bagaimana pengaruh variabel X terhadap variabel Y?
2. Apakah ada pola atau tren yang tersembunyi dalam data?
3. Bagaimana cara mengoptimalkan hasil dalam kasus A atau B?
4. Bagaimana memprediksi hasil berdasarkan variabel tertentu?
2. Pengumpulan data: Pengumpulan data adalah proses pengumpulan informasi yang relevan
dan dapat digunakan untuk menjawab pertanyaan penelitian dalam data sains, data dapat
dikumpulkan dari berbagai sumber, termasuk database, survei, sensor, dan sumber data
lainnya.
Dalam beberapa kasus, pengumpulan data dapat terus dilakukan sebagai bagian dari proses
pengambilan keputusan bisnis yang kontinu. Dalam pengumpulan data, penting untuk
memastikan bahwa data yang dikumpulkan akurat, relevan, dan terkini. Selain itu, data yang
dikumpulkan harus disimpan dengan aman dan terorganisir sehingga dapat diakses dan
dianalisis dengan mudah.
3. Data Pre-processing: Langkah ini melibatkan pembersihan data, transformasi data,
penghilangan duplikat, dan penghapusan data yang tidak relevan atau salah. Proses data
pre-processing merupakan tahap penting dalam analisis data, karena memastikan data yang
digunakan untuk analisis berkualitas dan akurat. Tanpa melakukan preprocessing, data yang
digunakan untuk analisis mungkin tidak akurat atau tidak lengkap, dan ini dapat
mempengaruhi hasil analisis dan kesimpulan yang diambil dari data. Dengan melakukan
data preprocessing yang benar, analisis data dapat menghasilkan hasil yang lebih akurat dan
berguna.

© Sofyan Thayf, 2023 Page | 21


4. Analisis data: Data dianalisis dengan menggunakan berbagai teknik analisis statistik dan
matematika, seperti regresi, korelasi, clustering, klasifikasi, dan visualisasi data. Dalam
menjawab pertanyaan penelitian dalam data sains, diperlukan pemahaman yang kuat
tentang matematika, statistik, dan teknik analisis data. Selain itu, teknologi dan alat analisis
data modern seperti machine learning, data mining, dan analisis prediktif dapat digunakan
untuk membantu menjawab pertanyaan penelitian dengan lebih efektif
5. Interpretasi hasil: Setelah analisis selesai, hasilnya harus diinterpretasikan dan diterjemahkan
ke dalam bahasa yang dapat dipahami oleh non-ahli.
6. Mengambil tindakan: Hasil dari analisis data harus digunakan untuk membuat keputusan
bisnis atau tindakan lainnya.
7. Evaluasi: Setelah tindakan diambil, hasilnya harus dievaluasi untuk mengetahui efektivitasnya
dan memastikan bahwa masalah atau pertanyaan yang telah diidentifikasi telah terpecahkan.

Metode Pengumpulan Data


Metode pengumpulan data adalah cara untuk mengumpulkan informasi atau data yang
dibutuhkan untuk menjawab pertanyaan atau memecahkan masalah tertentu. Ada banyak
metode pengumpulan data yang dapat digunakan, tergantung pada jenis informasi yang ingin
dikumpulkan dan tujuan dari pengumpulan data tersebut. Beberapa metode pengumpulan data
yang umum digunakan adalah:

1. Survei, merupakan salah satu metode yang paling umum digunakan dalam pengumpulan
data. Metode ini melibatkan penggunaan kuesioner atau wawancara untuk mengumpulkan
data dari responden.
2. Observasi, melibatkan pengamatan langsung terhadap suatu fenomena atau perilaku yang
diamati. Metode ini dapat dilakukan dengan cara terstruktur atau tidak terstruktur.
3. Studi kasus, melibatkan analisis mendalam terhadap satu atau beberapa kasus untuk
memahami fenomena atau masalah tertentu.
4. Eksperimen, melibatkan manipulasi variabel tertentu untuk melihat bagaimana itu
mempengaruhi variabel lain. Metode ini umumnya digunakan dalam penelitian ilmiah.
5. Analisis data sekunder, metode ini melibatkan penggunaan data yang sudah ada untuk
menjawab pertanyaan atau memecahkan masalah tertentu. Data sekunder dapat berasal dari
sumber seperti publikasi, catatan, atau database.

Dalam beberapa kasus, pengumpulan data dapat terus dilakukan sebagai bagian dari proses
pengambilan keputusan bisnis yang kontinu. Dalam pengumpulan data, penting untuk
memastikan bahwa data yang dikumpulkan akurat, relevan, dan terkini. Selain itu, data yang
dikumpulkan harus disimpan dengan aman dan terorganisir sehingga dapat diakses dan
dianalisis dengan mudah.

© Sofyan Thayf, 2023 Page | 22


Data Cleaning dan Preprocessing
Data cleaning dan preprocessing merupakan proses penting dalam Data Sains untuk memastikan
kualitas data yang akan digunakan dalam analisis. Data yang kotor atau tidak terstruktur dapat
menghasilkan hasil yang tidak akurat atau bahkan salah. Oleh karena itu, data cleaning dan
preprocessing sangat penting dilakukan sebelum data dianalisis.

Proses data cleaning dan preprocessing terdiri dari beberapa tahap, di antaranya:

1. Integration: Tahap ini adalah proses penggabungan beberapa data dari sumber yang
berbeda menjadi satu dataset yang terintegrasi. Hal ini dilakukan untuk memastikan bahwa
data yang digunakan dalam analisis benar-benar representatif dan lengkap.
2. Cleaning: Tahap ini adalah proses membersihkan data dari nilai yang tidak valid, outlier, atau
duplikasi. Hal ini dilakukan untuk memastikan bahwa data yang digunakan dalam analisis
akurat dan relevan.
3. Transformation: Tahap ini adalah proses mengubah format data menjadi format yang lebih
mudah untuk diproses. Contohnya adalah mengubah format tanggal dari teks menjadi
bentuk tanggal yang dapat diproses oleh program.
4. Reduction: Tahap ini adalah proses mengurangi jumlah data menjadi jumlah yang lebih kecil
tetapi tetap mewakili data yang asli. Hal ini dilakukan untuk mempercepat proses analisis.
5. Discretization: Mengubah data kontinu menjadi diskrit dengan menggunakan teknik seperti
binning dimana data kontinu yang memiliki rentang nilai yang besar dipecah menjadi
beberapa interval yang lebih kecil atau kategori dengan rentang nilai yang lebih kecil.

Setelah proses data cleaning dan preprocessing selesai dilakukan, data siap untuk digunakan
dalam proses analisis lebih lanjut.

Explorasi Data
Explorasi data adalah tahap melakukan proses analisis data yang bertujuan untuk mengerti dan
memahami karakteristik data, termasuk di dalamnya menemukan pola atau relasi yang
tersembunyi di dalam data. Explorasi data juga membantu dalam mengidentifikasi data yang
kurang lengkap, tidak akurat atau tidak relevan, sehingga memudahkan dalam pengambilan
keputusan.

Proses explorasi data dilakukan dengan memanfaatkan teknik dan metode statistik, visualisasi
data, dan teknik-teknik data mining seperti clustering dan association rule mining.

Beberapa langkah umum dalam proses explorasi data adalah sebagai berikut:

© Sofyan Thayf, 2023 Page | 23


1. Menentukan tujuan analisis data
2. Memahami karakteristik data seperti tipe data, distribusi data, dan variabilitas data
3. Melakukan visualisasi data untuk membantu memahami pola atau tren dalam data
4. Melakukan pemrosesan data untuk membersihkan atau mengisi data yang hilang
5. Mengekstraksi informasi dari data dengan menggunakan teknik-teknik data mining seperti
clustering dan association rule mining
6. Mengevaluasi hasil explorasi data dan menentukan langkah selanjutnya.

Beberapa metode yang umum digunakan dalam explorasi data antara lain:

1. Statistik deskriptif: Metode ini digunakan untuk menggambarkan data secara numerik.
Beberapa statistik deskriptif yang umum digunakan antara lain rata-rata, median, modus,
deviasi standar, kuartil, dan persentil.
2. Visualisasi data: Metode ini digunakan untuk menampilkan data dalam bentuk grafik atau
diagram, sehingga memudahkan pemahaman dan interpretasi data. Beberapa jenis
visualisasi data yang umum digunakan antara lain histogram, box plot, scatter plot, line chart,
dan heat map.
3. Clustering: Metode ini digunakan untuk mengelompokkan data berdasarkan kemiripan fitur
atau atribut. Beberapa teknik clustering yang umum digunakan antara lain k-means,
hierarchical clustering, dan density-based clustering.
4. Association rule mining: Metode ini digunakan untuk menemukan hubungan atau pola
tersembunyi dalam data. Beberapa teknik association rule mining yang umum digunakan
antara lain Apriori dan FP-Growth.
5. Text mining: Metode ini digunakan untuk menganalisis data berupa teks, seperti dokumen
atau tweet. Beberapa teknik text mining yang umum digunakan antara lain sentiment
analysis, topic modeling, dan named entity recognition.

Referensi
Babbie, E. R. (2010). The practice of social research. Belmont, CA: Wadsworth.

Fraenkel, J. R., Wallen, N. E., & Hyun, H. H. (2012). How to design and evaluate research in
education. New York: McGraw-Hill.

Han, J., Kamber, M., & Pei, J. (2012). Data mining: concepts and techniques. Elsevier.

Hastie, T., Tibshirani, R., & Friedman, J. (2009). The Elements of Statistical Learning: Data mining,
Inference, and Prediction (2nd ed.). Springer.

Jain, R., & Dubey, V. N. (2016). Data preprocessing in data mining. Handbook of statistics, 35,
163-178.

© Sofyan Thayf, 2023 Page | 24


Kelleher, Janey, B., & Tierney, B. (2018). Data Science An Introduction. CRC Press.

Peng, R. D. (2015). Exploratory data analysis with R. Springer.

Provost, F., & Fawcett, T. (2013). Data science for business: What you need to know about data
mining and data-analytic thinking. O'Reilly Media, Inc.

VanderPlas, J. (2016). Python data science handbook: Essential tools for working with data.
O'Reilly Media, Inc.

Witten, I. H., Frank, E., & Hall, M. A. (2016). Data mining: practical machine learning tools and
techniques. Morgan Kaufmann.

© Sofyan Thayf, 2023 Page | 25


4. Dasar Statistika

Konsep Statistika
Statistik deskriptif adalah metode statistik yang digunakan untuk menggambarkan dan
merangkum data secara statistik. Statistik deskriptif digunakan untuk memberikan gambaran
umum tentang pola dan karakteristik data dengan menggambarkan data secara numerik atau
grafis. Dengan menggunakan statistik deskriptif, kita dapat menganalisis data secara sederhana
dan mudah dimengerti, yang kemudian dapat membantu kita dalam mengambil keputusan.

Statistik Deskriptif
Statistik deskriptif adalah metode statistik yang digunakan untuk menggambarkan dan
merangkum data secara statistik. Statistik deskriptif digunakan untuk memberikan gambaran
umum tentang pola dan karakteristik data dengan menggambarkan data secara numerik atau
grafis. Dengan menggunakan statistik deskriptif, kita dapat menganalisis data secara sederhana
dan mudah dimengerti, yang kemudian dapat membantu kita dalam mengambil keputusan.

Statistik deskriptif memiliki peran penting dalam data sains karena memungkinkan kita untuk
memahami data dengan lebih baik. Dalam praktiknya, statistik deskriptif digunakan untuk
memberikan ringkasan tentang data yang kita miliki, seperti nilai rata-rata, median, modus,
deviasi standar, dan lain sebagainya. Dengan memahami statistik deskriptif, kita dapat
memahami karakteristik data kita secara lebih rinci dan membuat keputusan yang lebih tepat.

Dalam pengolahan data, statistik deskriptif sering digunakan untuk melakukan analisis
eksploratif. Misalnya, ketika kita memulai sebuah proyek data, kita mungkin ingin melakukan
analisis deskriptif pada dataset yang kita miliki untuk mendapatkan pemahaman yang lebih baik
tentang variabel-variabel yang ada di dalamnya. Dengan menggunakan statistik deskriptif, kita
dapat mengidentifikasi nilai-nilai ekstrem, melihat persebaran variabel, menentukan korelasi
antara variabel, dan sebagainya.

Statistik deskriptif mencakup beberapa ukuran statistik yang berbeda, seperti:

1. Ukuran Pemusatan Data


Ukuran pemusatan data adalah statistik yang digunakan untuk menggambarkan pusat data.
Beberapa contoh ukuran pemusatan data antara lain mean, median, dan modus.
2. Ukuran Penyebaran Data

© Sofyan Thayf, 2023 Page | 26


Ukuran penyebaran data adalah statistik yang digunakan untuk menggambarkan seberapa
jauh data tersebar. Beberapa contoh ukuran penyebaran data antara lain rentang, variansi,
dan simpangan baku.
3. Ukuran Kemiringan Data
Ukuran kemiringan data adalah statistik yang digunakan untuk menggambarkan simetri atau
kemiringan data. Beberapa contoh ukuran kemiringan data antara lain skewness dan kurtosis.
4. Ukuran Persebaran Data
Ukuran persebaran data adalah statistik yang digunakan untuk menggambarkan seberapa
rapat data tersebar. Beberapa contoh ukuran persebaran data antara lain kuartil dan
persentil.

Statistik Inferensi
Cabang lain dari ilmu statistik adalah statistik inferensi dimana statistik inferensi adalah metode
untuk menyimpulkan atau membuat generalisasi tentang populasi berdasarkan data yang
diperoleh dari sampel. Statistik inferensi digunakan untuk membuat prediksi, menguji hipotesis,
dan mengevaluasi apakah suatu hasil signifikan secara statistik, sementara statistik deskriptif
hanya memberikan gambaran tentang data yang ada, tanpa menyimpulkan apapun tentang
populasi yang lebih besar. Kedua jenis statistik ini sangat penting dalam data sains, dan
seringkali digunakan bersama-sama untuk mendapatkan pemahaman yang lebih lengkap
tentang data dan informasi yang tersedia.

Dalam statistik inferensi, kita dapat menguji hipotesis atau membuat perkiraan tentang
karakteristik populasi. Sebagai contoh, kita dapat menggunakan statistik inferensi untuk menguji
apakah terdapat perbedaan yang signifikan antara dua kelompok atau untuk membuat
perkiraan tentang rata-rata penghasilan penduduk di suatu negara.

Terdapat beberapa metode yang umum digunakan untuk mengambil kesimpulan dari sampel
terhadap populasi. Berikut adalah beberapa di antaranya:

1. Confidence interval (Interval kepercayaan): merupakan rentang nilai yang diberikan untuk
suatu parameter populasi dengan tingkat kepercayaan tertentu. Metode ini digunakan untuk
menentukan seberapa akurat suatu sampel dalam menggambarkan populasi.
2. Hypothesis testing (Uji hipotesis): merupakan prosedur yang digunakan untuk menentukan
apakah ada perbedaan yang signifikan antara sampel dan populasi. Metode ini dilakukan
dengan membuat suatu hipotesis nol (null hypothesis) dan hipotesis alternatif (alternative
hypothesis), kemudian menguji kebenaran dari hipotesis nol tersebut.
3. Regression analysis (Analisis regresi): merupakan metode yang digunakan untuk
menentukan hubungan antara satu atau beberapa variabel independen dengan variabel

© Sofyan Thayf, 2023 Page | 27


dependen. Metode ini dapat digunakan untuk memprediksi nilai variabel dependen
berdasarkan nilai variabel independen.
4. Analysis of variance (ANOVA): merupakan metode statistik yang digunakan untuk
membandingkan rata-rata dari tiga atau lebih kelompok. Metode ini digunakan untuk
menentukan apakah ada perbedaan yang signifikan antara kelompok-kelompok tersebut.

Pengukuran Pemusatan dan Penyebaran Data


Pengukuran pemusatan dan penyebaran data adalah teknik statistik deskriptif yang digunakan
untuk memahami bagaimana data terdistribusi. Dalam statistik, terdapat dua metode umum
untuk mengukur pemusatan data, yaitu mean (rata-rata) dan median. Sedangkan untuk
mengukur penyebaran data, terdapat empat metode umum, yaitu jangkauan (range), simpangan
baku (standard deviation), varians, dan rentang antarkuartil (interquartile range).

Pemusatan Data

1. Mean (rata-rata): Mean adalah nilai tengah dari data, dan diperoleh dengan menjumlahkan
semua data dan kemudian membaginya dengan jumlah data. Mean digunakan sebagai
pengukur pemusatan data ketika data memiliki distribusi normal atau hampir normal.

dimana m = mean

Contoh:
Data: 20, 21, 22, 23, 24, 25, 26, 27, 28 (9 data)
Mean = (20+21+22+23+24+25+26+27+28) / 9 = 24

2. Median: Median adalah nilai tengah dari data ketika data diurutkan dari yang terkecil hingga
yang terbesar. Median digunakan sebagai pengukur pemusatan data ketika data memiliki
distribusi yang asimetris atau memiliki nilai ekstrem yang signifikan.
Contoh:
Data: 20, 21, 22, 23, 24, 25, 26, 27, 28
Median = 24

Dalam contoh dengan data yang sama, nilai mean dan median terihat sama, tetapi perlu
diingat bahwa mean tidak selalu sama dengan median. Mean (rata-rata) dihitung dengan
menjumlahkan semua data dan kemudian membagi jumlah tersebut dengan banyaknya
data. Sedangkan median adalah nilai tengah dari data yang telah diurutkan.

© Sofyan Thayf, 2023 Page | 28


Jika data memiliki distribusi normal (simetris), maka mean dan median akan sama. Namun,
jika distribusi data asimetris, seperti distribusi data yang condong ke satu sisi (skewed), maka
mean dan median akan berbeda. Pada distribusi yang condong ke sisi positif, median akan
lebih kecil dari mean, sedangkan pada distribusi yang condong ke sisi negatif, median akan
lebih besar dari mean.

Sebagai contoh, jika kita memiliki data sebagai berikut: 1, 2, 3, 4, 5, 100.


mean = (1+2+3+4+5+100)/6 = 19,17 dan
median = 3,5.
Dalam hal ini, data memiliki distribusi yang condong ke sisi positif sehingga nilai mean lebih
besar dari nilai median.

3. Modus: Modus adalah nilai yang paling sering muncul dalam sebuah kumpulan data.
Contoh penggunaan modus adalah pada saat menghitung tinggi badan murid di sebuah
kelas, dimana kita ingin mengetahui tinggi badan yang paling sering dimiliki oleh murid-
murid di kelas tersebut.
Misalkan data tinggi badan siswa di kelas tersebut adalah sebagai berikut:
160, 155, 165, 170, 165, 160, 165, 158, 165, 170
Maka, modus dari data tersebut adalah 165, karena angka 165 muncul paling sering

4. Kuartil: Kuartil merupakan titik yang membagi data ke dalam empat bagian yang sama
besar. Kuartil pertama atau Q1 membagi data menjadi 25% terbawah, kuartil kedua atau Q2
membagi data menjadi 50% atau median, dan kuartil ketiga atau Q3 membagi data menjadi
75% teratas.
Berikut contoh perhitungan kuartil dengan data sederhana:
Data = 1, 3, 4, 6, 7, 9, 10, 11, 13, 15

1. Q1: menghitung nilai yang berada di posisi ke-25% data, maka:


25% x 10 data = 2,5
Nilai pada posisi 2 dan 3 adalah 3 dan 4, maka: Q1 = (3+4)/2 = 3,5

2. Q2: menghitung nilai yang berada di posisi ke-50% data atau median, maka:
Median = (nilai ke-5 + nilai ke-6)/2 = (9+10)/2 = 9,5

3. Q3: menghitung nilai yang berada di posisi ke-75% data, maka:


75% x 10 data = 7,5
Nilai pada posisi 7 dan 8 adalah 11 dan 13, maka: Q3 = (11+13)/2 = 12

Sehingga nilai kuartil pada data tersebut adalah:


Q1 = 3,5

© Sofyan Thayf, 2023 Page | 29


Q2 = 9,5
Q3 = 12

Penyebaran Data

1. Jangkauan (range): Jangkauan adalah selisih antara nilai maksimum dan nilai minimum
dalam data. Jangkauan digunakan sebagai pengukur penyebaran data yang sederhana
namun rentan terhadap nilai ekstrem yang signifikan.
Contoh:
Data: 20, 21, 22, 23, 24, 25, 26, 27, 28 (9 data)
Range = 28-20 = 8

2. Simpangan baku (standard deviation): Simpangan baku adalah pengukuran yang mengukur
seberapa jauh data tersebar dari rata-ratanya. Simpangan baku digunakan sebagai pengukur
penyebaran data yang paling umum dan dapat digunakan pada distribusi normal atau tidak
normal. Simpangan baku dihitung dengan cara menghitung selisih antara setiap data
dengan rata-rata, kemudian mengkuadratkannya, menjumlahkan hasilnya, kemudian dibagi
dengan jumlah data dikurangi 1, dan akar kuadrat dari hasilnya.

dimana:
 = simpangan baku
N = jumlah data
xi = nilai data
µ = mean

Misalkan terdapat data sebagai berikut: 1, 3, 5, 7, 9


Langkah-langkah perhitungan simpangan baku adalah sebagai berikut:
1. Hitung rata-rata data
rata-rata = (1 + 3 + 5 + 7 + 9) / 5 = 5

2. Hitung selisih antara setiap data dengan rata-rata, kemudian kuadratkan


(1 - 5)² = 16
(3 - 5)² = 4
(5 - 5)² = 0
(7 - 5)² = 4
(9 - 5)² = 16

© Sofyan Thayf, 2023 Page | 30


3. Jumlahkan hasil kuadrat di atas
16 + 4 + 0 + 4 + 16 = 40

4. Bagi hasil penjumlahan dengan jumlah data dikurangi 1


40 / (5 - 1) = 10

5. Hitung akar kuadrat dari hasil pembagian di atas


√10 ≈ 3,16

Jadi, simpangan baku dari data di atas adalah sekitar 3,16.

3. Varians: Varians adalah pengukuran yang mengukur seberapa jauh data tersebar dari rata-
ratanya dengan cara menghitung rata-rata perbedaan kuadrat antara setiap nilai data dan
nilai rata-ratanya. Varians adalah ukuran yang digunakan untuk mengukur variabilitas data
dalam sampel.

Misalkan terdapat data nilai ujian matematika 6 siswa, yaitu: 5, 6, 7, 8, 9, 10


Maka langkah-langkah untuk menghitung varians dari data tersebut adalah sebagai berikut:

1. Hitung nilai rata-rata dari data, yaitu dengan menjumlahkan semua nilai dan
membaginya dengan jumlah data:
(5 + 6 + 7 + 8 + 9 + 10) / 6 = 7.5
Jadi, rata-rata nilai ujian matematika siswa tersebut adalah 7.5.

2. Hitung selisih antara setiap nilai dan rata-rata, lalu kuadratkan hasilnya:
(5 - 7.5)2 = 6.25
(6 - 7.5)2 = 2.25
(7 - 7.5)2 = 0.25
(8 - 7.5)2 = 0.25
(9 - 7.5)2 = 2.25
(10 - 7.5)2 = 6.25

3. Jumlahkan hasil kuadrat selisih tersebut:


6.25 + 2.25 + 0.25 + 0.25 + 2.25 + 6.25 = 17.5

4. Hitung varians dengan cara membagi hasil penjumlahan kuadrat selisih tersebut dengan
jumlah data:
17.5 / 6 = 2.92

© Sofyan Thayf, 2023 Page | 31


4. Rentang antar kuartil (interquartile range): Rentang antar kuartil adalah selisih antara kuartil
atas dan kuartil bawah dalam data. Rentang antar kuartil digunakan sebagai pengukur
penyebaran data yang lebih tahan terhadap nilai ekstrem daripada jangkauan.

Misalkan kita memiliki data sebagai berikut: 2, 5, 7, 8, 10, 12, 15, 18, 20, 25
Langkah-langkah perhitungan rentang antar kuartil:

1. Urutkan data dari yang terkecil hingga yang terbesar:


2, 5, 7, 8, 10, 12, 15, 18, 20, 25

2. Tentukan kuartil pertama (Q1) dan kuartil ketiga (Q3):

Q1 = 6.5

Q3 = 18

3. Hitung rentang antar kuartil:

Q3 - Q1 = 18 - 6.5 = 11.5

Sehingga, rentang antar kuartil dari data tersebut adalah 11.5.

Skewness dan Kurtosis

Skewness dan Kurtosis adalah ukuran statistik yang digunakan untuk menggambarkan bentuk
distribusi data. Skewness mengukur seberapa simetris atau tidak simetris distribusi data,
sedangkan kurtosis mengukur seberapa tajam atau rata distribusi data. Skewness dan kurtosis
sering digunakan dalam analisis data untuk memahami bagaimana data tersebar dan apakah
terdapat anomali dalam data tersebut. Oleh karena itu, kedua ukuran ini dapat membantu
dalam pengambilan keputusan di berbagai bidang seperti bisnis, keuangan, kesehatan, dan lain
sebagainya.

Skewness mengukur seberapa simetris atau tidak simetris distribusi data terhadap nilai tengah
(mean atau median). Jika skewness bernilai nol, maka distribusi data dianggap simetris,
sedangkan jika skewness bernilai positif, maka distribusi data cenderung lebih condong ke kanan
(lebih banyak nilai yang besar), dan jika skewness bernilai negatif, maka distribusi data
cenderung lebih condong ke kiri (lebih banyak nilai yang kecil).

Dalam data sains, skewness dapat digunakan untuk memahami distribusi data dan melihat
apakah data cenderung condong ke kiri (negatif skewness), normal, atau condong ke kanan
(positif skewness). Hal ini dapat membantu dalam pemilihan model statistik dan dalam
mengambil keputusan bisnis.

© Sofyan Thayf, 2023 Page | 32


Gambar 4 Grafik Skewness
Sumber: [Link]

Sebagai contoh, dalam analisis harga rumah, skewness dapat membantu dalam memahami
distribusi harga rumah dan melihat apakah harga cenderung lebih tinggi atau lebih rendah dari
rata-rata. Jika distribusi harga cenderung skewness negatif, maka dapat dikatakan bahwa harga
rumah lebih banyak yang rendah daripada yang tinggi. Sebaliknya, jika distribusi harga
cenderung skewness positif, maka dapat dikatakan bahwa harga rumah lebih banyak yang tinggi
daripada yang rendah.

Dengan demikian, skewness memiliki peran yang penting dalam analisis data sains untuk
memahami distribusi data dan membantu dalam pengambilan keputusan.

Skewness dapat dihitung menggunakan rumus sebagai berikut:

di mana:
Xi = nilai data ke-i
N = jumlah data
X̅ = mean data
 = simpangan baku data
Nilai skewness dapat berada dalam rentang -3 hingga 3. Nilai skewness sebesar nol
menunjukkan distribusi data simetris, sedangkan nilai skewness positif menunjukkan distribusi
data condong ke kanan dan nilai skewness negatif menunjukkan distribusi data condong ke kiri.

Kurtosis adalah suatu ukuran yang digunakan untuk mengukur tinggi rendahnya puncak kurva
distribusi data yang sedang diobservasi, dibandingkan dengan kurva normal (disebut distribusi
normal atau Gaussian). Konsep ini sering digunakan dalam statistik untuk menggambarkan

© Sofyan Thayf, 2023 Page | 33


karakteristik distribusi data. Distribusi data yang memiliki nilai kurtosis tinggi memiliki puncak
yang lebih tinggi dan ekor yang lebih berat dibandingkan dengan distribusi normal, sedangkan
distribusi data yang memiliki nilai kurtosis rendah memiliki puncak yang lebih rendah dan ekor
yang lebih ringan dibandingkan dengan distribusi normal.

Jika nilai kurtosis adalah 0, maka distribusi data dianggap normal. Jika nilai kurtosis lebih kecil
dari 0, maka distribusi data dianggap rata dan distribusi data tersebut memiliki nilai-nilai yang
lebih terdistribusi pada bagian ekor distribusi. Jika nilai kurtosis lebih besar dari 0, maka
distribusi data dianggap tajam dan distribusi data tersebut memiliki nilai-nilai yang lebih
terdistribusi pada bagian puncak atau pusat distribusi.

Kurtosis dapat dihitung menggunakan rumus sebagai berikut:

di mana:
Kurt = Kurtosis
µ4 = momen keempat dari data
4 = simpangan baku data

Nilai kurtosis dihitung dengan menghitung momen keempat dari data dan membaginya dengan
kuadrat simpangan baku. Jika nilai kurtosis sama dengan 3, artinya distribusi data tersebut
adalah distribusi normal. Jika nilai kurtosis lebih besar dari 3, maka distribusi data tersebut lebih
tinggi dan lebih berat ekornya dibandingkan dengan distribusi normal (disebut leptokurtik),
sedangkan jika nilai kurtosis kurang dari 3, maka distribusi data tersebut memiliki puncak yang
lebih rendah dan ekor yang lebih ringan dibandingkan dengan distribusi normal (disebut
platykurtik).

Contoh kurtosis pada data sederhana: misalkan terdapat sebuah dataset yang berisi nilai-nilai: 2,
4, 5, 6, 7, 8, 10. Jika dihitung menggunakan rumus, maka akan diperoleh nilai kurtosis sebesar -
0.68, yang menunjukkan bahwa distribusi data tersebut lebih rendah puncaknya dan lebih
ringan ekornya dibandingkan dengan distribusi normal.

Momen keempat adalah salah satu ukuran statistik yang mengukur kurtosis atau tingkat
kecuraman distribusi suatu data. Momen keempat dikenal juga sebagai kurtosis tingkat
keempat, dan dihitung dengan cara menghitung perbedaan antara kuadrat skewness dan tiga
kali kuadrat deviasi standar, kemudian membaginya dengan kuadrat varians.

Secara matematis, rumus untuk momen keempat adalah sebagai berikut:

di mana:

© Sofyan Thayf, 2023 Page | 34


μ40 = momen keempat
X = variabel acak
μ = rata-rata dari variabel acak X
E = operator harapan

Jika momen keempat positif, maka distribusi data memiliki puncak yang lebih tajam (leptokurtik)
daripada distribusi normal. Sebaliknya, jika momen keempat negatif, maka distribusi data lebih
datar (platykurtik) daripada distribusi normal.

Grafik dan Histogram


Grafik dan histogram adalah alat visual yang digunakan dalam analisis data untuk
menggambarkan informasi dengan cara yang mudah dipahami. Grafik adalah representasi visual
dari data, sementara histogram adalah jenis grafik yang digunakan untuk menggambarkan
distribusi frekuensi dari data numerik.

Grafik dapat digunakan untuk menggambarkan berbagai jenis data, seperti data kategorikal dan
data numerik. Contoh grafik yang umum digunakan meliputi diagram batang, diagram
lingkaran, diagram garis, dan scatter plot. Grafik dapat membantu pengguna untuk memahami
hubungan antara variabel dan memvisualisasikan data dengan cara yang mudah dipahami.

Histogram adalah grafik yang menunjukkan distribusi frekuensi dari suatu data numerik.
Biasanya data numerik dikelompokkan ke dalam beberapa interval, yang kemudian dihitung
frekuensi munculnya data dalam masing-masing interval. Kemudian, interval ditampilkan pada
sumbu horizontal dan frekuensi ditampilkan pada sumbu vertikal, dan ditunjukkan sebagai
balok-balok yang saling bersebelahan. Histogram sangat berguna untuk memahami distribusi
data dan melihat apakah ada kecondongan atau pola dalam data.

Sebagai contoh, pada gambar menunjukkan distribusi frekwensi dari data nilai ujian dari 20
siswa (A-T), dan histogram dibuat dengan pengelompokan range nilai siswa

© Sofyan Thayf, 2023 Page | 35


Gambar 5. Contoh Histogram

Sumber: [Link]

Grafik memiliki peranan penting dalam analisis data sains karena dapat membantu dalam
memvisualisasikan dan memahami pola data. Dengan melihat grafik, kita dapat mengidentifikasi
pola data yang mungkin tidak terlihat dari sekadar melihat tabel atau angka-angka data mentah.
Grafik juga dapat membantu kita mengidentifikasi anomali atau nilai yang tidak biasa dalam
data. Selain itu, grafik juga dapat membantu dalam mengkomunikasikan hasil analisis secara
efektif kepada orang lain, seperti dalam presentasi atau laporan.

Referensi
Agresti, A., & Finlay, B. (2008). Statistical methods for the social sciences. Pearson.

De Veaux, R. D., Velleman, P. F., & Bock, D. E. (2009). Stats: Data and Models (3rd ed.). Pearson.

Groebner, D. F., Shannon, P. W., & Fry, P. C. (2018). Business statistics: A decision-making
approach. Pearson.

Gupta, S. P. (2008). Statistical methods. Sultan Chand & Sons.

James, G., Witten, D., Hastie, T., & Tibshirani, R. (2013). An introduction to statistical learning
(Vol. 112). New York: Springer.

© Sofyan Thayf, 2023 Page | 36


Kelleher, J. D., & Tierney, B. (2018). Data Science An Introduction. CRC Press.

Kutner, M. H., Nachtsheim, C. J., Neter, J., and Li, W. (2004). Applied Linear Statistical Models (5th
ed.). McGraw-Hill.

McClave, J. T., Benson, P. G., & Sincich, T. (2014). Statistics for Business and Economics. Pearson.

Montgomery, D.C., Peck, E.A., and Vining, G.G. (2012). Introduction to Linear Regression Analysis
(5th ed.). John Wiley & Sons, Inc.

O’Connell, B. (2006). Practical data analysis with JMP. SAS Institute.

OpenStax. (2019). Inferential Statistics. Diakses pada 9 Februari 2023, dari


[Link]

P. Bruce and A. Bruce, Practical Statistics for Data Scientists: 50 Essential Concepts, 1st ed.
O'Reilly Media, Inc., 2017.

PennState Eberly College of Science. (n.d.). Inferential Statistics. Diakses pada 9 Februari 2023,
dari [Link]

Ross, S.M. (2010). Introduction to Probability and Statistics for Engineers and Scientists, Fourth
Edition. Wiley

Stevens, J. P. (2009). Applied Multivariate Statistics for the Social Sciences (5th ed.). Routledge.

Triola, M. F. (2018). Elementary statistics. Pearson.

Tufte, E. R. (2001). The visual display of quantitative information. Cheshire, CT: Graphics Press.

Utami, H., & Pujilestari, Y. (2019). Statistika inferensial dan deskriptif dengan aplikasi SPSS.
Yogyakarta: Deepublish.

Walpole, R. E., Myers, R. H., Myers, S. L., & Ye, K. (2011). Probability & statistics for engineers &
scientists (9th ed.). Boston: Pearson.

Wickham, H. (2010). A layered grammar of graphics. Journal of Computational and Graphical


Statistics, 19(1), 3-28.

Wickham, H. (2016). ggplot2: Elegant Graphics for Data Analysis. Springer International
Publishing.

© Sofyan Thayf, 2023 Page | 37


5. Model-model Data Sains

Certainty dan Uncertainty


Certainty dan uncertainty (ketidakpastian) adalah dua konsep dalam statistik dan ilmu data
yang sering digunakan untuk menggambarkan seberapa yakin kita tentang suatu informasi atau
hasil. Certainty merujuk pada tingkat keyakinan atau kepastian yang tinggi dalam suatu
informasi atau hasil. Ini berarti bahwa kita merasa sangat yakin bahwa informasi atau hasil
tersebut benar. Sementara itu, uncertainty (ketidakpastian) merujuk pada tingkat ketidakpastian
atau ketidakjelasan dalam suatu informasi atau hasil. Ini berarti bahwa kita tidak yakin atau tidak
yakin apakah informasi atau hasil tersebut benar.

Dalam analisis data, uncertainty sering kali timbul karena adanya ketidakpastian dalam data
atau karena adanya faktor-faktor yang tidak dapat diukur yang memengaruhi hasil analisis.
Untuk mengatasi ketidakpastian ini, berbagai teknik seperti pengujian hipotesis dan analisis
sensitivitas dapat digunakan untuk mengukur tingkat ketidakpastian dan memperkirakan
seberapa akurat hasil analisis.

Model-model dalam kasus yang bersifat certainty adalah model yang digunakan untuk
memprediksi hasil yang pasti atau hampir pasti terjadi. Beberapa model yang umum digunakan
dalam kasus ini antara lain: regresi Linier, regresi logistik, klasifikasi

Dalam kasus yang bersifat uncertainty , terdapat beberapa model yang dapat digunakan dalam
data sains, di antaranya: model regresi, probabilitas, klasifikasi, clustering, dan ascociation

Probabilitas
Model probabilitas adalah suatu teknik statistik yang digunakan untuk memodelkan fenomena
yang tidak pasti. Model ini didasarkan pada teori probabilitas, di mana kejadian acak memiliki
probabilitas tertentu yang terkait dengan setiap nilai yang mungkin. Model probabilitas banyak
digunakan dalam berbagai bidang, termasuk ilmu pengetahuan, teknik, bisnis, dan keuangan.
Prinsip kerja model probabilitas didasarkan pada aturan probabilitas, yaitu sebuah metode
matematika yang digunakan untuk mengukur kemungkinan terjadinya suatu kejadian.

Model probabilitas biasanya menggunakan data yang dikumpulkan dari observasi atau
eksperimen yang telah dilakukan sebelumnya. Dari data tersebut, model probabilitas akan
mengekstrak informasi mengenai karakteristik data dan pola yang terdapat di dalamnya.
Kemudian, model probabilitas akan menggunakan informasi tersebut untuk menghasilkan

© Sofyan Thayf, 2023 Page | 38


prediksi atau estimasi mengenai kemungkinan terjadinya suatu kejadian atau hasil yang akan
muncul pada data yang belum diketahui.

Probabilitas dapat digunakan untuk mengukur tingkat kepastian dalam suatu kejadian atau
situasi. Apabila probabilitas suatu kejadian adalah 1, maka kejadian tersebut pasti terjadi atau
termasuk dalam certainty . Sebaliknya, jika probabilitas suatu kejadian adalah 0, maka kejadian
tersebut pasti tidak terjadi atau termasuk dalam certainty .

Namun, pada umumnya kejadian atau situasi yang terjadi di dunia nyata tidak selalu dapat
dipastikan dengan tingkat kepastian yang tinggi. Oleh karena itu, probabilitas juga digunakan
untuk mengukur tingkat ketidakpastian atau uncertainty dalam suatu kejadian atau situasi.
Semakin rendah probabilitas suatu kejadian, semakin tinggi tingkat uncertainty dari kejadian
tersebut.

Beberapa contoh model probabilitas yang populer termasuk distribusi normal, distribusi
Poisson, dan distribusi eksponensial. Setiap model probabilitas memiliki karakteristik tertentu
yang memungkinkan para ahli untuk menentukan kemungkinan terjadinya suatu kejadian
berdasarkan data yang tersedia.

Regresi dan Korelasi


Regresi dan korelasi adalah teknik statistik yang digunakan untuk mengukur hubungan antara
dua variabel. Regresi digunakan untuk memprediksi nilai dari satu variabel (variabel dependen)
berdasarkan nilai dari variabel lain (variabel independen). Sementara korelasi digunakan untuk
mengukur seberapa kuat hubungan antara dua variabel tersebut. Regresi dan korelasi sering
digunakan dalam berbagai disiplin ilmu, seperti ekonomi, sosiologi, psikologi, dan ilmu-ilmu
alam. Dalam data sains, teknik ini juga sering digunakan untuk menganalisis data dan
membangun model prediktif.

Contoh dari regresi adalah ketika kita ingin memprediksi harga rumah berdasarkan ukuran dan
lokasi. Di sisi lain, contoh dari korelasi adalah ketika kita ingin mengetahui apakah ada
hubungan antara tinggi badan dan berat badan seseorang.

Jenis-jenis model regresi yang umum digunakan adalah:

1. Regresi Linier Sederhana: Model ini digunakan ketika hanya ada satu variabel independen
(X) yang digunakan untuk memprediksi variabel dependen (Y).
2. Regresi Linier Berganda: Model ini digunakan ketika dua atau lebih variabel independen (X1,
X2, X3, dst) digunakan untuk memprediksi variabel dependen (Y).
3. Regresi Nonlinear: Model ini digunakan ketika hubungan antara variabel independen dan
dependen tidak linier. Contoh model regresi nonlinear adalah model logistik dan model
eksponensial.

© Sofyan Thayf, 2023 Page | 39


4. Regresi Logistik: Model ini digunakan ketika variabel dependen adalah variabel biner (0 atau
1). Model ini sering digunakan dalam analisis prediktif di bidang bisnis dan pemasaran.
5. Regresi Poisson: Model ini digunakan ketika variabel dependen adalah variabel hitung.
Model ini sering digunakan dalam analisis data frekuensi, seperti jumlah klaim asuransi atau
jumlah kecelakaan lalu lintas.
6. Regresi Cox: Model ini digunakan ketika variabel dependen adalah waktu kejadian
(misalnya, waktu hingga kematian atau waktu hingga pemulihan). Model ini sering
digunakan dalam analisis risiko dan keuangan.

Model korelasi mengukur hubungan antara dua variabel dan dapat membantu dalam
memahami apakah ada ketergantungan antara keduanya. Jenis-jenis model korelasi antara lain:

1. Korelasi Pearson: Ini adalah jenis korelasi yang paling umum digunakan dan mengukur
hubungan linier antara dua variabel numerik. Korelasi Pearson menghasilkan koefisien
korelasi antara -1 hingga 1, dengan nilai 1 menunjukkan korelasi positif sempurna dan -1
menunjukkan korelasi negatif sempurna.
2. Korelasi Spearman: Jenis korelasi ini mengukur hubungan monotonic antara dua variabel
numerik atau ordinal. Korelasi Spearman memperhitungkan urutan variabel, bukan nilainya,
dan menghasilkan koefisien korelasi antara -1 hingga 1.
3. Korelasi Kendall: Jenis korelasi ini mirip dengan korelasi Spearman dalam hal mengukur
hubungan monotonic antara dua variabel. Namun, Korelasi Kendall lebih sensitif terhadap
perubahan pada nilai-nilai yang memiliki urutan rendah.
4. Partial correlation: Korelasi parsial mengukur hubungan antara dua variabel ketika efek dari
satu atau lebih variabel kontrol dihilangkan.
5. Canonical correlation: Jenis korelasi ini mengukur hubungan antara dua set variabel yang
saling bergantung. Canonical correlation dapat membantu dalam menjelaskan hubungan
antara dua set variabel.

Analisis Klaster dan Klasifikasi


Analisis klaster dan klasifikasi adalah teknik-teknik dalam analisis data untuk mengelompokkan
objek atau data menjadi kelompok-kelompok yang saling berhubungan berdasarkan kemiripan
atau perbedaan karakteristik tertentu. Meskipun keduanya memiliki tujuan yang sama, yaitu
mengelompokkan objek atau data, tetapi cara kerjanya berbeda.

Analisis klaster (cluster analysis) adalah teknik yang digunakan untuk mengelompokkan objek
atau data berdasarkan kemiripannya dalam satu kelompok atau lebih. Kelompok yang dihasilkan
dari analisis klaster umumnya dibuat berdasarkan jarak antara objek atau data dalam ruang data
atau jarak antara vektor karakteristiknya.

© Sofyan Thayf, 2023 Page | 40


Sedangkan klasifikasi (classification) adalah teknik yang digunakan untuk mengelompokkan
objek atau data berdasarkan aturan atau kriteria tertentu yang sudah ditentukan sebelumnya.
Klasifikasi dilakukan dengan menghitung kemungkinan objek atau data termasuk ke dalam
suatu kelompok tertentu berdasarkan model atau pola yang sudah ada. Model klasifikasi tidak
hanya cocok untuk kasus certainty (pasti). Model klasifikasi juga dapat digunakan untuk kasus
uncertainty (ketidakpastian), di mana kita tidak dapat memprediksi hasil dengan pasti. Pada
kasus ini, model klasifikasi dapat memberikan probabilitas atau tingkat keyakinan dalam
mengklasifikasikan data ke dalam kelas tertentu. Dalam kasus seperti ini, kita dapat
menggunakan model probabilistik seperti Regresi Logistik atau Naive Bayes Classifier untuk
memodelkan probabilitas kelas berdasarkan fitur yang diberikan.

Contoh penggunaan analisis klaster adalah dalam pengelompokkan konsumen berdasarkan


perilaku pembelian mereka, pengelompokkan karyawan berdasarkan kemampuan dan kinerja
mereka, dan pengelompokkan produk berdasarkan karakteristiknya. Sedangkan contoh
penggunaan klasifikasi adalah dalam pengenalan pola wajah, klasifikasi dokumen berdasarkan
topiknya, dan klasifikasi email spam atau tidak spam.

Beberapa model dalam analisis klaster dan klasifikasi antara lain:

1. K-Means Clustering: Model ini digunakan untuk mengelompokkan data ke dalam K


kelompok yang berbeda berdasarkan jarak antara setiap titik data. Setiap kelompok
memiliki rata-rata sentroid atau pusat.
2. Hierarchical Clustering: Model ini juga digunakan untuk mengelompokkan data, tetapi
secara bertahap dan hierarkis. Model ini membagi data ke dalam subkelompok yang
semakin kecil dengan berdasarkan jarak antara titik data. Subkelompok tersebut kemudian
digabungkan secara hierarkis hingga mencapai satu kelompok utama.
3. Decision Trees: Model ini digunakan untuk memprediksi kelas atau nilai suatu variabel
berdasarkan kumpulan aturan atau keputusan. Model ini membagi data menjadi
subkelompok berdasarkan fitur-fitur yang relevan, kemudian membuat keputusan
berdasarkan fitur tersebut. Model ini cocok digunakan untuk data yang memiliki variabel
diskrit.
4. Naive Bayes Classification: Model ini digunakan untuk memprediksi probabilitas suatu kelas
berdasarkan nilai fitur yang diberikan. Model ini mengasumsikan bahwa fitur-fitur yang
diberikan saling independen. Model ini sangat cepat dan efisien dalam pengolahan data.

Referensi
Witten, I. H., Frank, E., & Hall, M. A. (2016). Data mining: Practical machine learning tools and
techniques. Morgan Kaufmann.

© Sofyan Thayf, 2023 Page | 41


Hastie, T., Tibshirani, R., & Friedman, J. (2009). The elements of statistical learning: Data mining,
inference, and prediction. Springer Science & Business Media.

James, G., Witten, D., Hastie, T., & Tibshirani, R. (2013). An Introduction to Statistical Learning:
With Applications in R. Springer.

Walpole, R. E., Myers, R. H., Myers, S. L., & Ye, K. (2011). Probability & statistics for engineers &
scientists. Pearson.

Douglas C. Montgomery, Elizabeth A. Peck, dan G. Geoffrey Vining. (2012). Introduction to Linear
Regression Analysis. New York: Wiley.

Gareth James, Daniela Witten, Trevor Hastie, dan Robert Tibshirani. (2013). An Introduction to
Statistical Learning. New York: Springer.

Gupta, R. D., & Kapoor, N. (2017). Fundamentals of Mathematical Statistics. Sultan Chand &
Sons.

Hair, J. F., Black, W. C., Babin, B. J., & Anderson, R. E. (2019). Multivariate Data Analysis (8th ed.).
Cengage Learning.

J. L. Devore, Probability and Statistics for Engineering and the Sciences, 8th edition, Cengage
Learning, 2012.

R. Neter, M. Kutner, C. Nachtsheim, and W. Wasserman, Applied Linear Statistical Models, 4th
edition, McGraw-Hill/Irwin, 1996.

Han, J., Kamber, M., & Pei, J. (2011). Data mining: concepts and techniques. Morgan Kaufmann.

James, G., Witten, D., Hastie, T., & Tibshirani, R. (2013). An introduction to statistical learning
(Vol. 112). New York: Springer.

Jain, A. K., Murty, M. N., & Flynn, P. J. (1999). Data clustering: a review. ACM Computing Surveys
(CSUR), 31(3), 264-323.

Han, J., & Kamber, M. (2006). Data mining: concepts and techniques. Morgan Kaufmann.

© Sofyan Thayf, 2023 Page | 42


6. Data Mining

Pengertian dan Konsep Data Mining


Data mining adalah proses menemukan pola-pola menarik atau informasi yang berguna dari
data dalam jumlah besar atau kompleks. Data mining melibatkan berbagai teknik dan algoritma
untuk mengekstrak informasi yang berharga dari data yang telah dikumpulkan, baik itu dalam
bentuk terstruktur atau tidak terstruktur. Tujuan dari Data mining adalah untuk memahami data
dengan lebih baik dan mengambil keputusan yang lebih baik berdasarkan informasi yang
ditemukan.

Data mining merupakan salah satu teknik yang dapat digunakan untuk mengolah dan
menganalisis big data. Tujuan utama dari data mining adalah menemukan pola-pola menarik
atau informasi yang berguna dari data yang telah dikumpulkan, yang terkadang sulit untuk
ditemukan secara manual. Dalam hal ini, data mining digunakan untuk mengekstrak
pengetahuan atau informasi dari big data yang tidak dapat diolah secara manual.

Dalam prakteknya, data mining pada big data melibatkan penggunaan teknik-teknik seperti
clustering, klasifikasi, regresi, analisis asosiasi, dan lain-lain. Teknik-teknik ini dapat diterapkan
pada big data untuk memahami tren, pola, dan perilaku dalam data. Hal ini membantu dalam
pengambilan keputusan bisnis yang lebih baik, seperti meningkatkan efisiensi operasional,
memperbaiki layanan pelanggan, meningkatkan kualitas produk, dan lain sebagainya.

Terdapat beberapa langkah dalam melakukan data mining, di antaranya adalah sebagai berikut:

1. Memahami tujuan bisnis dan masalah yang ingin dipecahkan. Langkah pertama dalam
melakukan data mining adalah memahami tujuan bisnis dan masalah yang ingin dipecahkan.
Hal ini akan membantu memfokuskan analisis dan memastikan bahwa hasil yang dihasilkan
dapat memberikan manfaat yang bermanfaat bagi bisnis.
2. Memilih data yang akan digunakan. Langkah selanjutnya adalah memilih data yang akan
digunakan dalam analisis. Data yang dipilih harus berkualitas dan relevan dengan tujuan
bisnis dan masalah yang ingin dipecahkan. Data juga harus disimpan dan diorganisir dengan
baik agar dapat diakses dengan mudah.
3. Memproses data. Setelah data dipilih, langkah selanjutnya adalah memproses data tersebut.
Proses ini meliputi pembersihan data (misalnya, menghapus data yang hilang atau duplikat),
penggabungan data dari berbagai sumber, transformasi data (misalnya, mengubah data
menjadi format yang tepat), dan pemilihan fitur (misalnya, memilih variabel yang paling
relevan dalam analisis).

© Sofyan Thayf, 2023 Page | 43


4. Memilih teknik data mining yang sesuai. Ada berbagai teknik data mining yang dapat
digunakan, termasuk klasifikasi, regresi, klastering, dan asosiasi. Pemilihan teknik yang tepat
tergantung pada jenis data dan tujuan bisnis.
5. Membangun model data mining. Setelah teknik data mining dipilih, model data mining
harus dibangun. Proses ini melibatkan penggunaan algoritma untuk menganalisis data dan
membangun model yang dapat digunakan untuk memprediksi atau mengidentifikasi pola
dalam data.
6. Evaluasi model data mining. Setelah model dibangun, model harus dievaluasi untuk
memastikan bahwa model tersebut akurat dan dapat digunakan secara efektif. Evaluasi
model meliputi pengujian dengan data yang belum pernah dilihat sebelumnya, pengujian
sensitivitas, dan pengujian spesifisitas.
7. Implementasi model data mining. Setelah model dievaluasi dan disetujui, langkah terakhir
adalah mengimplementasikan model data mining. Hal ini melibatkan penggunaan model
untuk memecahkan masalah bisnis atau untuk tujuan ilmiah.
8. Memantau dan mengevaluasi model data mining secara berkala. Setelah model
diimplementasikan, perlu dipantau secara berkala untuk memastikan bahwa model tersebut
masih akurat dan sesuai dengan kebutuhan bisnis. Jika tidak, model harus disesuaikan atau
diperbarui sesuai kebutuhan.

Machine learning erat kaitannya dengan data mining karena keduanya merupakan bagian dari
analisis data yang menggunakan metode-metode komputasi untuk mengekstraksi informasi
dari data. Dalam data mining, teknik machine learning sering digunakan untuk membangun
model prediktif. Model prediktif dapat digunakan untuk memprediksi nilai yang tidak diketahui
dalam data, misalnya prediksi klasifikasi (kelas yang dimiliki data) atau regresi (nilai numerik).
Machine learning dapat membantu untuk meningkatkan akurasi prediksi dan memperbaiki
model dengan menambahkan data baru.

Selain itu, machine learning juga dapat digunakan untuk menjalankan tugas-tugas lain dalam
data mining, seperti klastering (mengelompokkan data ke dalam kelompok yang serupa),
reduksi dimensi (mengurangi jumlah variabel yang digunakan), dan asosiasi (mencari hubungan
antar variabel).

Dalam keseluruhan, machine learning dan data mining bekerja sama untuk menghasilkan
informasi yang berguna dari data. Machine learning membantu mengoptimalkan model dan
menghasilkan prediksi yang akurat, sedangkan data mining membantu mengidentifikasi pola
yang tersembunyi dan mengekstrak pengetahuan yang berguna dari data. Keduanya saling
melengkapi dan menjadi bagian yang penting dalam dunia analisis data.

Metode Data Mining


Metode statistik memainkan peran penting dalam data mining, karena banyak teknik dan
algoritma data mining didasarkan pada konsep dan metode statistik. Metode statistik digunakan

© Sofyan Thayf, 2023 Page | 44


untuk merumuskan model dan hipotesis dari data yang telah dikumpulkan, yang dapat
membantu memahami hubungan dan pola dalam data.

Dalam data mining, metode statistik digunakan untuk mengolah data dalam jumlah besar dan
kompleks, sehingga dapat menghasilkan informasi yang lebih baik dan mendalam tentang data
tersebut. Metode ini juga membantu memvalidasi hasil data mining dan meningkatkan
kepercayaan pada kesimpulan yang ditarik dari data tersebut.

Beberapa contoh metode statistik yang penting dalam data mining adalah:

1. Analisis deskriptif: Metode ini digunakan untuk menggambarkan data dan menghasilkan
statistik ringkasan tentang data, seperti mean, median, dan mode. Analisis deskriptif sering
digunakan untuk memahami distribusi data dan mengidentifikasi pencilan (outlier) dan
kecacatan (missing value) pada data.
2. Analisis inferensial: Metode ini digunakan untuk menguji hipotesis dan membuat prediksi
berdasarkan data yang ada. Analisis inferensial sering digunakan untuk menguji apakah
terdapat hubungan atau perbedaan antara variabel dalam data.
3. Analisis regresi: Metode ini digunakan untuk membangun model matematika yang dapat
digunakan untuk memprediksi nilai variabel target berdasarkan nilai variabel input tertentu.
Analisis regresi sering digunakan dalam data mining untuk memprediksi nilai penjualan,
harga saham, dan lain-lain.
4. Analisis multivariat: Metode ini digunakan untuk memahami hubungan antara beberapa
variabel. Analisis multivariat sering digunakan dalam data mining untuk memahami faktor-
faktor yang mempengaruhi perilaku konsumen, analisis pasar, dan lain-lain.
5. Analisis korelasi: Metode ini digunakan untuk mengidentifikasi hubungan antara dua atau
lebih variabel dalam data. Analisis korelasi sering digunakan untuk memahami hubungan
antara variabel input dan output dalam model data mining.

Berikut adalah beberapa metode populer yang digunakan dalam data mining dan contoh
penerapannya:

1. Regresi, merupakan metode statistik yang digunakan untuk membangun model matematika
yang dapat memprediksi nilai variabel target berdasarkan variabel input tertentu. Contoh
penerapannya dalam data mining adalah untuk memprediksi harga saham berdasarkan
variabel input seperti kinerja perusahaan, kondisi ekonomi, dan faktor-faktor lainnya (Luo,
2018).
2. Pohon Keputusan, adalah metode klasifikasi yang digunakan untuk membangun model
yang memprediksi nilai variabel target berdasarkan beberapa atribut input. Contoh
penerapannya dalam data mining adalah untuk memprediksi apakah seorang pelanggan
akan membeli produk tertentu berdasarkan atribut seperti usia, jenis kelamin, dan perilaku
pembelian sebelumnya (Han et al., 2011).
3. Jaringan Syaraf Tiruan, merupakan model matematika yang meniru cara kerja otak manusia
dalam mengambil keputusan. Contoh penerapannya dalam data mining adalah untuk
memprediksi apakah suatu transaksi adalah fraud atau tidak, berdasarkan pola transaksi
sebelumnya (Witten & Frank, 2016).

© Sofyan Thayf, 2023 Page | 45


4. Analisis Klastering, adalah metode yang digunakan untuk mengelompokkan data menjadi
beberapa kelompok berdasarkan kemiripan fitur. Contoh penerapannya dalam data mining
adalah untuk mengelompokkan pelanggan berdasarkan perilaku pembelian mereka,
sehingga perusahaan dapat memahami preferensi dan kebutuhan pelanggan yang berbeda
(Tan et al., 2018).
5. Asosiasi, metode yang digunakan untuk mengidentifikasi hubungan antara beberapa
variabel. Contoh penerapannya dalam data mining adalah untuk mengidentifikasi pola
pembelian pelanggan, seperti apakah pelanggan yang membeli produk A juga cenderung
membeli produk B (Hastie et al., 2009).

Model dalam Data Mining


Model data mining adalah representasi matematika dari pola atau hubungan dalam data yang
dihasilkan oleh algoritma data mining. Model data mining digunakan untuk memprediksi nilai
variabel target berdasarkan variabel input tertentu atau untuk mengidentifikasi pola atau
hubungan tertentu dalam data.

Model data mining biasanya dibangun menggunakan teknik pembelajaran mesin seperti regresi,
klasifikasi, klastering, dan asosiasi. Model-data mining yang baik harus memiliki kemampuan
untuk:

1. Akurasi prediksi yang tinggi


2. Kesederhanaan (tidak terlalu rumit dan mudah diinterpretasikan)
3. Kemampuan untuk memperkirakan kinerja di masa depan

Beberapa contoh model data mining yang populer adalah pohon keputusan, jaringan syaraf
tiruan, regresi linier, regresi logistik, dan analisis klastering.

Model data mining digunakan dalam berbagai aplikasi, seperti pengenalan pola dalam gambar
dan suara, deteksi anomali dalam data keamanan, analisis risiko kredit, dan pengelolaan rantai
pasokan.

Dalam pengembangan model data mining, pemilihan variabel yang signifikan, teknik
pengolahan data yang tepat, dan evaluasi model yang baik merupakan faktor penting untuk
memastikan model data mining yang dihasilkan memenuhi tujuan bisnis atau ilmiah yang
diinginkan.

Berikut adalah beberapa contoh terapan model-model data mining:

1. Klasifikasi - model ini digunakan untuk memprediksi kelas dari suatu data. Contohnya adalah
prediksi apakah seseorang akan membeli produk tertentu atau tidak. Salah satu contoh
penerapannya adalah dalam studi yang dilakukan oleh Gao, Li, dan Li (2020) untuk
memprediksi kecenderungan pelanggan terhadap pembelian produk online.
2. Regresi - model ini digunakan untuk memprediksi nilai numerik suatu variabel dari variabel
lain. Contohnya adalah memprediksi harga rumah berdasarkan luas tanah, lokasi, dan fitur-

© Sofyan Thayf, 2023 Page | 46


fitur lainnya. Salah satu contoh penerapannya adalah dalam studi yang dilakukan oleh
Sahadevan, et al. (2020) untuk memprediksi kualitas air minum di India menggunakan teknik
regresi logistik.
3. Klastering - model ini digunakan untuk mengelompokkan data ke dalam kelompok yang
serupa berdasarkan kesamaan karakteristik. Contohnya adalah klastering konsumen
berdasarkan perilaku pembelian mereka. Salah satu contoh penerapannya adalah dalam
studi yang dilakukan oleh Cheng dan Cui (2021, p.1863-1872) untuk mengklaster data
keuangan.
4. Asosiasi - model ini digunakan untuk menemukan hubungan antara variabel. Contohnya
adalah menemukan hubungan antara pembelian produk tertentu dengan produk lain. Salah
satu contoh penerapannya adalah dalam studi yang dilakukan oleh Khan, Zia, dan Ullah
(2018, p. 6-10) untuk menemukan hubungan antara perilaku sosial media dan kemampuan
belajar siswa.

Tools Data Mining


Tools atau perangkat lunak data mining dibutuhkan untuk membantu para analis data dalam
melakukan proses data mining dengan lebih efisien dan efektif. Beberapa alasan mengapa tools
data mining penting antara lain:

1. Mempermudah analis data - Tools data mining menyediakan antarmuka grafis dan berbagai
fitur yang memudahkan analis data dalam mengakses, mengeksplorasi, dan memanipulasi
data.
2. Menyediakan berbagai algoritma data mining - Tools data mining menyediakan berbagai
algoritma data mining yang dapat digunakan untuk melakukan berbagai tugas analisis data,
seperti klasifikasi, regresi, klastering, dan lain-lain.
3. Mempercepat proses analisis - Tools data mining dapat mempercepat proses analisis data
dengan menyediakan fitur-fitur seperti integrasi dengan berbagai sumber data, pemrosesan
data secara otomatis, dan visualisasi data.
4. Mendukung pengambilan keputusan - Tools data mining dapat membantu analis data
dalam memahami pola-pola dan tren dalam data, sehingga dapat digunakan sebagai dasar
dalam pengambilan keputusan yang lebih baik.

Penguasaan tools data mining sangat penting bagi data saintis karena tools tersebut dapat
membantu dalam menganalisis dan mengolah data dengan lebih efisien dan akurat. Dalam
dunia bisnis dan industri, data mining digunakan untuk memprediksi perilaku konsumen,
mengidentifikasi tren pasar, dan memperoleh wawasan tentang bisnis. Sementara itu, dalam
bidang ilmiah, data mining dapat membantu dalam memperoleh informasi penting dari data
yang dihasilkan dari berbagai eksperimen atau pengamatan.

Beberapa alasan mengapa penguasaan tools data mining penting bagi data saintis antara lain:

© Sofyan Thayf, 2023 Page | 47


1. Efisiensi - Tools data mining dapat membantu data saintis dalam mengolah data dengan
lebih efisien dan cepat. Dengan menggunakan tools data mining, data saintis dapat
melakukan berbagai tugas analisis data seperti pemrosesan data, visualisasi data, dan
pemodelan data dengan lebih mudah dan cepat.
2. Akurasi - Tools data mining dapat membantu dalam mengurangi kesalahan manusia dan
meningkatkan akurasi hasil analisis data. Dengan menggunakan algoritma data mining yang
tepat, data saintis dapat menghasilkan model prediksi atau klasifikasi yang akurat dan
bermanfaat.
3. Wawasan - Tools data mining dapat membantu dalam menghasilkan wawasan baru dari
data yang telah dikumpulkan. Dengan menggunakan tools data mining, data saintis dapat
menemukan pola-pola atau korelasi yang tidak terlihat sebelumnya, sehingga dapat
membantu dalam mengambil keputusan yang lebih baik.
4. Menghemat waktu dan biaya - Tools data mining dapat membantu dalam menghemat
waktu dan biaya dalam proses analisis data. Dengan menggunakan tools data mining, data
saintis dapat menghemat waktu yang dibutuhkan untuk mengumpulkan, mengolah, dan
menganalisis data. Selain itu, tools data mining juga dapat membantu dalam mengurangi
biaya yang dibutuhkan untuk melakukan tugas analisis data.

Dengan menggunakan tools data mining, para analis data dapat lebih mudah dan cepat
melakukan analisis data dengan menggunakan berbagai algoritma data mining, sehingga dapat
menghasilkan informasi dan pengetahuan baru dari data yang dapat digunakan untuk berbagai
kepentingan, seperti pengambilan keputusan, peramalan, dan optimasi.

Seiring dengan perkembangan teknologi, tools data mining juga semakin berkembang dan
menawarkan fitur-fitur yang lebih canggih dan inovatif, sehingga dapat membantu analis data
dalam menghadapi tantangan dan memanfaatkan potensi yang lebih besar dari data yang
tersedia.

Berikut adalah beberapa tools atau perangkat lunak yang digunakan dalam data mining:

1. RapidMiner ([Link] adalah perangkat lunak open source yang


menyediakan platform data mining yang lengkap dan mudah digunakan. RapidMiner
menyediakan berbagai algoritma data mining, termasuk klasifikasi, regresi, klastering, dan
lain-lain. RapidMiner juga mendukung integrasi dengan berbagai sumber data dan alat
analisis.
2. KNIME ([Link]) adalah perangkat lunak open source yang juga menyediakan
platform data mining yang lengkap. KNIME memiliki antarmuka grafis yang mudah
digunakan, dan mendukung berbagai algoritma data mining, termasuk klasifikasi, regresi,
klastering, dan lain-lain. KNIME juga mendukung integrasi dengan berbagai sumber data
dan alat analisis.
3. IBM SPSS ([Link] adalah perangkat lunak data
mining yang terkenal dan banyak digunakan. IBM SPSS menyediakan berbagai algoritma
data mining, termasuk klasifikasi, regresi, klastering, dan lain-lain. IBM SPSS juga mendukung
integrasi dengan berbagai sumber data dan alat analisis.

© Sofyan Thayf, 2023 Page | 48


4. SAS ([Link] perangkat lunak data
mining dan analisis data yang terkenal dan banyak digunakan di berbagai industri. SAS
menyediakan berbagai algoritma data mining, termasuk klasifikasi, regresi, klastering, dan
lain-lain. SAS juga mendukung integrasi dengan berbagai sumber data dan alat analisis.
5. Python - Python adalah bahasa pemrograman yang populer dan banyak digunakan dalam
data mining. Python menyediakan berbagai library dan framework untuk data mining,
termasuk Scikit-Learn ([Link] TensorFlow ([Link]
PyTorch ([Link] dan Keras ([Link]
6. Orange ([Link] adalah salah satu tools open-source data mining yang populer
dan digunakan oleh para analis data untuk melakukan berbagai tugas data mining seperti
pemrosesan data, klastering, klasifikasi, regresi, visualisasi data, dan lain-lain. Orange
menyediakan antarmuka grafis yang mudah digunakan dan berbagai fitur seperti integrasi
dengan berbagai sumber data, pemrosesan data secara otomatis, dan visualisasi data.

Gambar 6 Analisis citra dengan deep-network embedding pada Orange data mining.
Sumber: [Link]

Referensi
Caruana, R., & Niculescu-Mizil, A. (2006). An empirical comparison of supervised learning
algorithms. Proceedings of the 23rd international conference on Machine learning.

© Sofyan Thayf, 2023 Page | 49


Cheng, J., & Cui, J. (2021). Clustering of financial time series data using k-means algorithm.
Journal of Intelligent & Fuzzy Systems, 41(2).

Gao, C., Li, C., & Li, H. (2020). Online shopping behavior prediction using machine learning
algorithms. Journal of Ambient Intelligence and Humanized Computing, 11(12).

Han, J., Kamber, M., & Pei, J. (2011). Data mining: Concepts and Techniques (3rd ed.). Morgan
Kaufmann.

Hastie, T., Tibshirani, R., & Friedman, J. (2009). The Elements of Statistical Learning: Data mining,
Inference, and Prediction (2nd ed.). Springer.

Ian H. Witten, Eibe Frank, Mark A. Hall. 2016. Data mining: Practical Machine learning Tools and
Techniques. Morgan Kaufmann Publishers.

Jiawei Han, Micheline Kamber, Jian Pei. 2012. Data mining: Concepts and Techniques. Morgan
Kaufmann Publishers.

Khan, M. A., Zia, A., & Ullah, R. (2018). The impact of social media usage on the learning ability of
students. International Journal of Computer Applications, 179(45).

Larose, D. T. (2014). Discovering Knowledge in Data: An Introduction to Data mining (2nd ed.).
Wiley.

Luo, S. (2018). The application of data mining in stock market prediction. Journal of Business and
Economics, 9(1).

Pang-Ning Tan, Michael Steinbach, Vipin Kumar. 2006. Introduction to Data mining. Addison-
Wesley.

Sahadevan, S., Kumar, P. R., & Ayyasamy, P. M. (2020). Drinking water quality assessment and
prediction using machine learning algorithms. Sustainable Computing: Informatics and Systems,
27, 100382.

Tan, P. N., Steinbach, M., & Kumar, V. (2018). Introduction to Data mining (2nd ed.). Pearson.

Witten, I. H., & Frank, E. (2016). Data mining: Practical Machine learning Tools and Techniques.
Morgan Kaufmann.

© Sofyan Thayf, 2023 Page | 50


7. Pengantar Machine learning

Konsep Dasar Machine learning


Machine learning adalah teknologi yang memungkinkan sistem komputer untuk belajar dari
data dan pengalaman untuk meningkatkan kinerjanya dari waktu ke waktu tanpa perlu
diprogram secara eksplisit. Teknologi ini bertujuan untuk memungkinkan komputer untuk
mengambil keputusan atau melakukan tugas tanpa harus diprogram secara eksplisit.

Berikut adalah pandangan beberapa ahli tentang machine learning:

1. Tom M. Mitchell, dari Carnegie Mellon University, mendefinisikan machine learning sebagai
"kemampuan komputer untuk belajar tanpa diprogram secara eksplisit".
2. Arthur Samuel, penemu istilah "machine learning", mengatakan bahwa itu adalah "bidang
studi yang memberikan komputer kemampuan untuk belajar tanpa diberi instruksi secara
eksplisit".
3. Ian Goodfellow, Yoshua Bengio, dan Aaron Courville, dalam buku mereka "Deep Learning",
mendefinisikan machine learning sebagai "cabang dari kecerdasan buatan yang mempelajari
algoritma statistik untuk membuat prediksi atau keputusan yang didasarkan pada data".
4. Michael I. Jordan dan Thomas M. Mitchell, dalam artikel mereka "Machine learning: Trends,
Perspectives, and Prospects", menjelaskan machine learning sebagai "proses pembelajaran
melalui penggunaan data dan kemudian memperbaiki kinerja model berdasarkan umpan
balik".
5. Ethem Alpaydin, dalam bukunya "Introduction to Machine learning", menyatakan bahwa
machine learning adalah "cabang dari kecerdasan buatan yang bertujuan untuk
mengembangkan algoritma dan model yang dapat mempelajari pola dari data dan
membuat prediksi atau keputusan tanpa diprogram secara eksplisit".

Secara umum, para ahli mendefinisikan machine learning sebagai teknologi atau metode yang
memungkinkan komputer untuk belajar dari data dan pengalaman untuk meningkatkan
kinerjanya dari waktu ke waktu tanpa perlu diprogram secara eksplisit.

Machine learning adalah salah satu metode yang digunakan dalam data sains untuk
mengidentifikasi pola dan membuat prediksi atau keputusan berdasarkan data. Dalam data
sains, machine learning digunakan untuk membangun model prediksi yang dapat membantu
memecahkan masalah dan membuat keputusan yang lebih akurat.

Contoh penggunaan machine learning dalam data sains adalah dalam analisis data besar (big
data), analisis citra medis, pengenalan suara, analisis sentimen, dan masih banyak lagi. Machine

© Sofyan Thayf, 2023 Page | 51


learning memungkinkan para ahli data sains untuk mengekstraksi informasi yang berharga dari
data yang besar dan rumit, dan membantu dalam pengambilan keputusan yang lebih baik.

Dalam kesimpulannya, machine learning dan data sains saling terkait dan saling melengkapi.
Machine learning merupakan salah satu teknologi yang digunakan dalam data sains untuk
mengambil wawasan atau pengetahuan dari data.

Mekanisme dalam pengembangan dan penerapan machine learning secara umum dapat
dijelaskan dalam beberapa langkah dasar berikut:

1. Data Preparation: Langkah pertama dalam machine learning adalah mengumpulkan dan
mempersiapkan data. Data tersebut dapat berasal dari berbagai sumber, seperti basis data,
file teks, atau data yang dihasilkan oleh sensor atau perangkat. Data ini kemudian diproses,
dipisahkan menjadi set pelatihan dan set pengujian, dan dibersihkan untuk memastikan
kualitas dan integritasnya.
2. Feature Extraction: Setelah data dipersiapkan, langkah selanjutnya adalah mengekstraksi fitur
(feature) yang relevan. Fitur adalah karakteristik atau atribut dalam data yang dapat
digunakan untuk memprediksi hasil yang diinginkan. Pada tahap ini, fitur-fitur ini dipilih dan
diproses agar dapat digunakan dalam model machine learning.
3. Model Selection: Setelah fitur-fitur yang relevan telah ditentukan, langkah selanjutnya adalah
memilih model machine learning yang tepat. Model machine learning adalah algoritma yang
dapat mempelajari pola dalam data dan digunakan untuk memprediksi hasil yang
diinginkan. Beberapa contoh model machine learning yang umum digunakan meliputi
Regresi Linear, K-Nearest Neighbor (KNN), Naive Bayes, Decision Tree, Random Forest, dan
Neural Networks.
4. Training: Setelah model machine learning dipilih, langkah selanjutnya adalah melatih model
dengan menggunakan set pelatihan. Model dipelajari dengan menghitung parameter
internalnya (misalnya, bobot dalam jaringan saraf) untuk menentukan pola dalam data
pelatihan.
5. Validasi: Setelah model dilatih, langkah selanjutnya adalah menguji model dengan
menggunakan set pengujian untuk menentukan seberapa akurat model tersebut. Model
dievaluasi dengan menggunakan metrik performa seperti akurasi, presisi, recall, F1-score,
dan lain-lain.
6. Deployment: Setelah model diuji dan dinilai akurat, langkah terakhir dalam machine learning
adalah menerapkan model pada data yang belum dikenal. Model dapat digunakan untuk
membuat prediksi atau keputusan berdasarkan fitur yang diketahui.

Secara umum, langkah-langkah di atas mencakup mekanisme umum machine learning, di mana
model machine learning dipelajari dari data dan digunakan untuk memprediksi hasil yang
diinginkan.

© Sofyan Thayf, 2023 Page | 52


Supervised dan Unsupervised Learning
Supervised learning dan unsupervised learning adalah dua jenis utama dari machine learning.
Berikut ini penjelasan lebih detail mengenai masing-masing jenis

Supervised learning

Supervised learning adalah jenis machine learning yang memanfaatkan data yang sudah diberi
label sebelumnya. Pada supervised learning, algoritma belajar untuk memetakan input ke output
berdasarkan contoh-contoh yang sudah diberi label. Algoritma belajar untuk memahami pola
atau hubungan antara input dan output, sehingga dapat memprediksi output yang tepat dari
input yang belum pernah dilihat sebelumnya. Beberapa contoh dari aplikasi supervised learning
adalah klasifikasi, regresi, dan deteksi anomali.

Contoh penerapan Supervised Learning:

1. Klasifikasi gambar: Model machine learning dapat dipelajari untuk mengenali objek dalam
gambar berdasarkan label yang sudah diberikan. Contohnya seperti pengenalan wajah
manusia, pengenalan jenis bunga, atau identifikasi objek dalam citra medis seperti MRI atau
CT-scan.
2. Analisis sentimen: Model machine learning dapat dipelajari untuk mengenali sentimen dalam
teks seperti positif, negatif, atau netral. Contohnya dalam aplikasi pemantauan media sosial
atau analisis feedback pelanggan.

Unsupervised learning

Unsupervised learning adalah jenis machine learning yang memanfaatkan data yang tidak diberi
label sebelumnya. Pada unsupervised learning, algoritma belajar untuk memetakan input ke
output tanpa adanya contoh yang sudah diberi label. Algoritma belajar untuk memahami pola
atau hubungan antara data untuk mengelompokkan data ke dalam kelompok atau klaster yang
serupa. Beberapa contoh dari aplikasi unsupervised learning adalah clustering, reduksi dimensi,
dan association rule mining.

Contoh penerapan Unsupervised Learning:

1. Klastering: Model machine learning dapat dipelajari untuk mengelompokkan data pelanggan
atau pengguna berdasarkan perilaku dan preferensi mereka tanpa adanya label. Contohnya
dalam analisis data penjualan atau data web analytics.
2. Reduksi dimensi: Model machine learning dapat dipelajari untuk mengekstraksi fitur penting
dari data yang memiliki dimensi yang tinggi. Contohnya dalam pemrosesan citra atau teks.

© Sofyan Thayf, 2023 Page | 53


3. Association rule mining: Model machine learning dapat dipelajari untuk menemukan asosiasi
atau hubungan yang tersembunyi dalam data. Contohnya dalam analisis asosiasi konsumen
atau pola pembelian.

Model-model Machine learning


Model adalah salah satu komponen kunci dalam machine learning. Model dalam machine
learning adalah representasi matematis dari proses belajar mesin yang dilakukan pada data.
Model digunakan untuk mempelajari hubungan antara fitur (features) dan target (output) pada
data pelatihan, sehingga model dapat melakukan prediksi pada data baru.

Model memegang peran penting dalam machine learning karena model yang baik dapat
memberikan prediksi yang akurat dan berguna pada data baru. Ada beberapa tipe model dalam
Machine learning, seperti Regresi Linier, Decision Tree, Random Forest, Neural Networks, dan
lain-lain. Setiap jenis model memiliki kekuatan dan kelemahan masing-masing, dan pemilihan
model yang tepat bergantung pada karakteristik data dan tujuan pembelajaran mesin.

Proses pembuatan model dalam machine learning melibatkan beberapa tahap, yaitu:

1. Persiapan data: Data perlu dipersiapkan dan dibersihkan sebelum digunakan untuk
melatih model.
2. Pemilihan fitur: Fitur (features) yang paling penting dan relevan perlu dipilih untuk
melatih model.
3. Pembuatan model: Model dipilih dan dibuat untuk belajar dari data pelatihan.
4. Evaluasi model: Model dievaluasi untuk mengetahui performanya, seperti akurasi, presisi,
recall, dan lain-lain.
5. Penyempurnaan model: Model dapat diperbaiki atau dioptimalkan untuk meningkatkan
performanya.

Setelah model dilatih pada data pelatihan, model tersebut dapat digunakan untuk melakukan
prediksi pada data baru. Prediksi yang akurat dapat membantu dalam pengambilan keputusan,
identifikasi pola, dan prediksi peristiwa di masa depan.

Berikut adalah beberapa jenis model machine learning yang umum digunakan:

1. Regresi Linear (Linear Regression)


Model regresi linear digunakan untuk memprediksi nilai numerik berdasarkan kumpulan fitur
yang diberikan. Model ini bekerja dengan menghitung hubungan linier antara variabel
independen (fitur) dan variabel dependen (nilai yang ingin diprediksi). Contohnya,
memprediksi harga rumah berdasarkan luas tanah, jumlah kamar tidur, lokasi, dan fitur
lainnya. (Witten, Hastie, Tibshirani, 2013)

© Sofyan Thayf, 2023 Page | 54


2. K-Nearest Neighbor (KNN)
Model KNN digunakan untuk memprediksi kelas atau label suatu objek berdasarkan kelas
objek sekitarnya. Model ini bekerja dengan menentukan kelas objek berdasarkan mayoritas
dari k-nearest neighbor terdekat di sekitarnya. Contohnya, klasifikasi gambar berdasarkan
objek yang terlihat dalam gambar (Alpaydin, 2010).
3. Naive Bayes: Model
Naive Bayes digunakan untuk memprediksi kelas atau label suatu objek berdasarkan
probabilitas kelas pada fitur yang diberikan. Model ini bekerja dengan menghitung
probabilitas kelas pada setiap fitur dan mengambil kelas dengan probabilitas tertinggi.
Contohnya, klasifikasi email sebagai spam atau tidak berdasarkan isi pesan (Alpaydin, 2010).
4. Decision Tree:
Model Decision Tree digunakan untuk memprediksi kelas atau label suatu objek berdasarkan
aturan keputusan yang dibuat dari fitur yang diberikan. Model ini bekerja dengan membagi
data menjadi subkelompok berdasarkan aturan keputusan yang dibuat, dan terus membagi
hingga mencapai kondisi berhenti. Contohnya, memprediksi apakah seseorang akan
membeli produk tertentu berdasarkan usia, pendapatan, dan kebiasaan belanja (Hastie,
Tibshirani, Friedman, 2009).
5. Neural Networks:
Model Neural Networks adalah jaringan saraf tiruan yang digunakan untuk mempelajari pola
kompleks dalam data dan memprediksi hasil yang diinginkan. Model ini bekerja dengan
menghitung output dari setiap neuron dalam jaringan berdasarkan input dan bobot yang
diberikan, dan menggunakan fungsi aktivasi untuk menghasilkan output akhir. Contohnya,
klasifikasi gambar berdasarkan objek yang terlihat dalam gambar (Goodfellow, Bengio,
Courville, 2016).

Dalam kesimpulannya, model adalah elemen penting dalam Machine learning karena model
yang baik dapat memberikan prediksi yang akurat pada data baru dan membantu dalam
pengambilan keputusan. Model dipilih berdasarkan karakteristik data dan tujuan pembelajaran
mesin.

Berikut adalah beberapa referensi publikasi penelitian terbaru yang menerapkan machine
learning:

1. A Deep Learning-Based Diagnosis of Diabetic Retinopathy using Retinal Images (2021) -


Penelitian ini menggunakan machine learning untuk melakukan diagnosis penyakit
retinopati diabetik berdasarkan gambar retina. Hasil penelitian menunjukkan bahwa metode
deep learning yang digunakan memiliki tingkat akurasi yang tinggi dalam mendiagnosis
penyakit tersebut. (Sumber: [Link]
2. A Machine learning Approach for Predicting and Optimizing the Efficiency of Solar Cells (2021)
- Penelitian ini menggunakan machine learning untuk memprediksi dan mengoptimalkan
efisiensi sel surya. Hasil penelitian menunjukkan bahwa metode machine learning yang

© Sofyan Thayf, 2023 Page | 55


digunakan dapat meningkatkan efisiensi sel surya hingga 8%. (Sumber:
[Link]
3. Machine learning-Based Detection of COVID-19 from Chest X-Ray Images: A Survey and
Comparative Study (2021) - Penelitian ini melakukan survei dan studi perbandingan terhadap
metode machine learning yang digunakan dalam mendeteksi COVID-19 dari gambar sinar-X
dada. Hasil penelitian menunjukkan bahwa metode machine learning yang digunakan
memiliki tingkat akurasi yang tinggi dalam mendeteksi COVID-19. (Sumber:
[Link]
4. Machine learning-Based Prediction of Power Generation in Wind Farms (2021) - Penelitian ini
menggunakan machine learning untuk memprediksi produksi listrik dari farm angin. Hasil
penelitian menunjukkan bahwa metode machine learning yang digunakan dapat
meningkatkan akurasi prediksi produksi listrik dari farm angin. (Sumber:
[Link]
5. Machine learning-Based Prediction of Water Quality Parameters in Aquaculture Ponds (2021)
- Penelitian ini menggunakan machine learning untuk memprediksi parameter kualitas air di
kolam budidaya ikan. Hasil penelitian menunjukkan bahwa metode machine learning yang
digunakan dapat meningkatkan akurasi prediksi parameter kualitas air di kolam budidaya
ikan. (Sumber: [Link]

Referensi
Alpaydin, E. (2010). Introduction to machine learning (2nd ed.). Cambridge, MA: MIT Press.

Bishop, C. M. (2006). Pattern Recognition and Machine learning. Springer.

Goodfellow, I., Bengio, Y., & Courville, A. (2016). Deep Learning. MIT Press.

Inference, and Prediction. Springer.

James, G., Witten, D., Hastie, T., & Tibshirani, R. (2013). An Introduction to Statistical Learning:
With Applications in R. Springer.

Jordan, M. I., & Mitchell, T. M. (2015). Machine learning: Trends, perspectives, and prospects.
Science, 349(6245), 255-260.

Kelleher, J. D., Tierney, B., & Tierney, B. (2018). Data Science An Introduction. CRC Press.

© Sofyan Thayf, 2023 Page | 56


8. Visualisasi Data

Pengertian dan Tujuan Visualisasi Data


Visualisasi data adalah suatu teknik untuk mengkomunikasikan informasi dan ide dengan cara
memvisualisasikan data dan informasi menjadi bentuk grafis seperti diagram, grafik, peta, atau
animasi. Tujuan utama dari visualisasi data adalah untuk membantu manusia memahami data
yang kompleks dan besar dengan cara yang lebih mudah dipahami dan lebih mudah
diinterpretasikan. Visualisasi data dapat membantu kita melihat pola, hubungan, dan trend yang
mungkin tidak terlihat saat melihat data mentah.

Visualisasi data digunakan dalam berbagai bidang ilmu, seperti statistik, ilmu sosial, biologi,
ekonomi, dan banyak lagi. Beberapa contoh aplikasi visualisasi data dalam data sains termasuk:

1. Identifikasi pola dalam data: Visualisasi data dapat membantu mengidentifikasi pola dalam
data yang mungkin tidak terlihat dengan mudah dalam bentuk tabel atau daftar angka
mentah.
2. Analisis tren: Visualisasi data dapat membantu mengidentifikasi tren dan perubahan dalam
data dari waktu ke waktu.
3. Pengambilan keputusan: Visualisasi data dapat membantu para pengambil keputusan
memahami implikasi dari keputusan yang diambil berdasarkan data.
4. Komunikasi hasil penelitian: Visualisasi data dapat membantu para peneliti dan analis data
untuk mengkomunikasikan hasil penelitian mereka secara efektif kepada khalayak yang lebih
luas.

Pentingnya visualisasi data dalam data sains sangat penting, karena data sains sering kali
kompleks dan sulit diinterpretasikan jika hanya dilihat dalam bentuk tabel atau angka-angka
mentah. Dengan menggunakan teknik visualisasi data, kita dapat:

1. Menemukan pola dan hubungan: Visualisasi data dapat membantu kita menemukan pola
dan hubungan yang tidak terlihat saat melihat data mentah.
2. Menyederhanakan kompleksitas: Visualisasi data dapat membantu kita menyederhanakan
kompleksitas data dengan menerjemahkannya menjadi bentuk yang lebih mudah dipahami.
3. Meningkatkan pemahaman: Visualisasi data dapat membantu kita memahami data dengan
lebih baik dan cepat, karena kita dapat melihat data dalam bentuk visual yang dapat dengan
mudah dicerna.
4. Meningkatkan efektivitas pengambilan keputusan: Dengan visualisasi data yang tepat, kita
dapat membuat keputusan yang lebih baik dan lebih cepat, karena kita dapat melihat data
dengan cara yang lebih intuitif dan dapat memahami implikasi dari keputusan yang diambil.

© Sofyan Thayf, 2023 Page | 57


Dalam data sains, visualisasi data juga sangat penting untuk mengkomunikasikan hasil
penelitian atau analisis data kepada orang lain, baik itu kepada rekan sejawat, pemangku
kepentingan, atau publik. Visualisasi data yang efektif dapat membantu kita memperoleh
dukungan dan pengakuan untuk hasil penelitian atau analisis data yang kita lakukan.

Jenis-jenis Visualisasi Data


Visualisasi data dapat dibagi menjadi beberapa kategori dan jenis-jenis yang berbeda
tergantung pada tujuan dan konteksnya. Berikut ini adalah beberapa kategori dan jenis-jenis
visualisasi data yang umum digunakan:

Gambar 7 Chart visualisasi yang umum digunakan


Sumber: [Link]

1. Grafik Bar atau Batang, digunakan untuk membandingkan nilai numerik atau kategorikal.
Grafik bar vertikal menampilkan kategori pada sumbu horizontal dan nilai numerik pada
sumbu vertikal, sedangkan grafik bar horizontal menampilkan nilai numerik pada sumbu
horizontal dan kategori pada sumbu vertikal.
2. Grafik Garis, digunakan untuk menunjukkan perubahan nilai numerik atau kuantitatif pada
periode waktu tertentu. Grafik garis menampilkan data sebagai serangkaian titik yang
terhubung oleh garis.
3. Grafik Pie, digunakan untuk membandingkan proporsi data kategori. Grafik ini menampilkan
data sebagai potongan lingkaran, dengan setiap bagian mewakili proporsi data yang
berbeda.

© Sofyan Thayf, 2023 Page | 58


4. Heat Map, digunakan untuk menunjukkan konsentrasi data dalam suatu wilayah atau pada
interval tertentu. Grafik ini menampilkan data sebagai warna yang berbeda dalam sebuah
grid atau matriks.
5. Scatter Plot, digunakan untuk menunjukkan hubungan antara dua variabel numerik. Grafik
ini menampilkan data sebagai titik pada sebuah koordinat kartesian.
6. Box Plot, digunakan untuk menunjukkan distribusi data numerik. Grafik ini menampilkan
data sebagai kotak yang mewakili kuartil pertama, median, dan kuartil ketiga, serta garis
yang menunjukkan rentang data.
7. Histogram, digunakan untuk menunjukkan distribusi frekuensi dari data numerik. Grafik ini
menampilkan data sebagai balok yang mewakili frekuensi setiap interval data.
8. Tree Map, digunakan untuk menunjukkan hierarki dan proporsi data kategori. Grafik ini
menampilkan data sebagai kotak yang lebih besar atau lebih kecil tergantung pada proporsi
data.
9. Word Cloud, digunakan untuk menunjukkan frekuensi kata dalam sebuah teks. Grafik ini
menampilkan kata-kata yang paling sering muncul dalam teks dengan ukuran yang
berbeda-beda.

Terdapat pula jenis-jenis grafik yang advanced dalam visualisasi data, yaitu jenis grafik yang
lebih kompleks dan canggih dibandingkan dengan grafik standar. Grafik ini memungkinkan kita
untuk menganalisis data dengan lebih detail dan mendalam. Berikut adalah beberapa tipe dan
contoh grafik advanced dalam visualisasi data:

1. Choropleth Map, digunakan untuk menunjukkan distribusi data spasial pada peta. Grafik ini
menampilkan data sebagai wilayah atau daerah dengan warna yang berbeda-beda
tergantung pada nilai data pada setiap wilayah. Contohnya adalah peta yang menunjukkan
indeks kebahagiaan atau tingkat pengangguran pada setiap wilayah.

Gambar 8 Choropleth Map


(sumber: [Link]

© Sofyan Thayf, 2023 Page | 59


2. Network Diagram, digunakan untuk menunjukkan hubungan antara dua atau lebih entitas.
Grafik ini menampilkan data sebagai simpul atau node yang terhubung oleh garis atau
sambungan yang menunjukkan hubungan atau koneksi antar simpul. Contohnya adalah
diagram yang menunjukkan hubungan antara anggota suatu organisasi atau jaringan sosial.

Gambar 9 Network Diagram


Sumber: [Link]

3. Radar Chart, digunakan untuk menunjukkan perbandingan antara beberapa variabel


numerik pada satu entitas. Grafik ini menampilkan data sebagai serangkaian garis atau
lingkaran yang mewakili nilai variabel numerik pada setiap sumbu. Contohnya adalah grafik
yang menunjukkan skor pada berbagai kategori dalam tes psikologis.

Gambar 10 Radar Chart


[Link]

© Sofyan Thayf, 2023 Page | 60


4. Bubble Chart, digunakan untuk menunjukkan perbandingan antara tiga variabel numerik.
Grafik ini menampilkan data sebagai titik-titik yang mewakili nilai pada sumbu horizontal
dan vertikal, serta ukuran dari setiap titik yang mewakili nilai variabel ketiga. Contohnya
adalah grafik yang menunjukkan perbandingan antara populasi, PDB, dan tingkat
pengangguran pada beberapa negara.

Gambar 11 Bubble Chart


[Link]

5. Sankey Diagram, digunakan untuk menunjukkan aliran atau keterkaitan antara beberapa
entitas. Grafik ini menampilkan data sebagai panah atau garis yang mewakili arus data dari
satu entitas ke entitas lainnya. Contohnya adalah diagram yang menunjukkan aliran lalu
lintas di kota atau arus energi dalam suatu sistem.

Gambar 12 Sankey Diagram


Sumber: [Link]

© Sofyan Thayf, 2023 Page | 61


6. Stream Graph, digunakan untuk menunjukkan perubahan data pada periode waktu tertentu.
Grafik ini menampilkan data sebagai serangkaian kurva yang bertumpuk pada sumbu
horizontal dan menunjukkan perubahan data pada periode waktu tertentu. Contohnya
adalah grafik yang menunjukkan perubahan tingkat penjualan atau kinerja keuangan pada
suatu perusahaan.

Gambar 13 Stream Graph


[Link]

Itulah beberapa kategori dan jenis-jenis visualisasi data yang umum digunakan. Pemilihan jenis
visualisasi data yang tepat tergantung pada beberapa faktor, seperti tujuan visualisasi, jenis data
yang akan ditampilkan, ukuran data, dan audiens yang akan melihat visualisasi. Berikut adalah
beberapa strategi pemilihan jenis grafik untuk visualisasi data:

1. Pertimbangkan tujuan visualisasi, pastikan bahwa tujuan visualisasi data sudah jelas. Apakah
Anda ingin menunjukkan perubahan data seiring waktu, perbandingan antara beberapa
variabel, atau distribusi data pada suatu area? Pemilihan jenis grafik yang tepat akan
memastikan bahwa pesan visual disampaikan dengan jelas.
2. Pertimbangkan jenis data yang akan ditampilkan, misalnya, data kategorikal seperti jenis
kelamin atau kategori produk biasanya ditampilkan menggunakan grafik batang atau pie
chart. Sedangkan data numerik seperti nilai-nilai pengukuran biasanya ditampilkan
menggunakan grafik garis atau scatter plot.
3. Pertimbangkan ukuran data yang juga mempengaruhi pemilihan jenis grafik. Jika data yang
akan ditampilkan terdiri dari beberapa titik data, maka grafik scatter plot mungkin lebih
cocok. Namun, jika data tersebut terdiri dari ribuan titik data, maka grafik scatter plot
mungkin menjadi terlalu padat. Pada kasus seperti ini, heatmap atau density plot mungkin
lebih cocok.

© Sofyan Thayf, 2023 Page | 62


4. Pertimbangkan audiens yang akan melihat visualisasi. Jika audiens Anda adalah para ahli di
bidang data, grafik yang lebih kompleks seperti network diagram atau chord diagram
mungkin cocok. Namun, jika audiens Anda adalah orang awam, grafik yang lebih sederhana
seperti bar chart atau line chart mungkin lebih mudah dipahami.

Strategi Pembuatan Visualisasi Data


Strategi visualisasi data merujuk pada serangkaian langkah dan prinsip yang digunakan dalam
proses membuat visualisasi data yang efektif dan bermakna. Berikut ini adalah beberapa strategi
visualisasi data yang dapat membantu Anda membuat visualisasi data yang efektif:

1. Kenali audiens Anda, ketahui siapa yang akan melihat visualisasi data Anda dan identifikasi
tujuan mereka untuk melihat visualisasi data tersebut. Ini akan membantu Anda memilih tipe
visualisasi data yang tepat dan fokus pada informasi yang relevan dan bermakna bagi
audiens Anda.
2. Fokus pada pesan utama, identifikasi pesan utama yang ingin Anda sampaikan dan fokus
pada itu. Gunakan visualisasi data untuk memperkuat pesan Anda, bukan sebagai pengganti
pesan.
3. Gunakan visualisasi yang yang tepat untuk data yang ingin Anda tampilkan. Misalnya,
gunakan diagram batang untuk membandingkan kuantitas, atau gunakan grafik garis untuk
menunjukkan perubahan dalam data dari waktu ke waktu.
4. Pertimbangkan desain visual, pastikan desain visualisasi data Anda memudahkan audiens
Anda memahami informasi yang ingin Anda sampaikan. Gunakan warna, ukuran, dan tata
letak dengan bijak dan konsisten.
5. Sederhanakan visualisasi data Anda, jangan terlalu rumit dalam membuat visualisasi data.
Visualisasi data yang terlalu rumit dapat membingungkan audiens dan membuat mereka
kehilangan fokus pada pesan utama yang ingin Anda sampaikan.
6. Berikan konteks pada visualisasi data Anda. Misalnya, berikan keterangan tentang satuan
pengukuran, sumber data, atau kisaran waktu.
7. Uji visualisasi data Anda, pastikan visualisasi data Anda dapat diuji dan diinterpretasikan oleh
orang lain. Uji visualisasi data Anda dengan audiens yang berbeda untuk mendapatkan
umpan balik dan saran untuk perbaikan.

Dalam menerapkan strategi visualisasi data, pastikan untuk mempertimbangkan konteks dari
data dan audiens yang Anda targetkan. Dengan memahami pesan utama yang ingin Anda
sampaikan dan memilih jenis visualisasi data yang tepat, Anda dapat membuat visualisasi data
yang efektif dan bermakna bagi audiens Anda.

Penguasaan skill untuk visualisasi data sangat penting dalam berbagai bidang, terutama dalam
data sains. Penguasaan skill untuk visualisasi data melibatkan beberapa hal yang perlu dipelajari

© Sofyan Thayf, 2023 Page | 63


dan dikuasai. Berikut ini adalah beberapa skill yang perlu dipelajari untuk menguasai visualisasi
data:

1. Memahami konsep-konsep visualisasi data: Anda perlu memahami konsep-konsep dasar


seperti jenis-jenis visualisasi data, bagaimana memilih visualisasi data yang tepat untuk
setiap jenis data, dan bagaimana membuat visualisasi data yang efektif dan informatif.
2. Penguasaan alat untuk visualisasi data: Anda perlu menguasai alat-alat yang digunakan
untuk membuat visualisasi data seperti Microsoft Excel, Tableau, Python, R, dan sebagainya.
3. Pemahaman matematika dan statistik: Anda perlu memahami konsep dasar matematika dan
statistik seperti probabilitas, distribusi, regresi, dan sebagainya, sehingga dapat memahami
data yang akan divisualisasikan dengan baik.
4. Pemahaman desain grafis: Anda perlu memahami konsep-konsep dasar desain grafis seperti
pemilihan warna, tata letak, kontras, dan sebagainya untuk dapat membuat visualisasi data
yang menarik dan mudah dipahami.
5. Kemampuan analisis data: Anda perlu mampu menganalisis data dengan baik sehingga
dapat memahami data yang akan divisualisasikan dengan lebih baik.
6. Pemahaman konteks data: Anda perlu memahami konteks dari data yang akan
divisualisasikan sehingga dapat menentukan jenis visualisasi data yang tepat.

Untuk menguasai skill untuk visualisasi data, Anda dapat mempelajari berbagai sumber referensi
seperti buku, kursus online, tutorial, dan sebagainya. Selain itu, praktik juga sangat penting
untuk menguasai keterampilan ini. Cobalah untuk membuat visualisasi data pada proyek-proyek
yang berbeda atau dengan menggunakan data yang berbeda sehingga Anda dapat menguji
dan meningkatkan keterampilan Anda.

Metode dan Tools Visualisasi Data


Penggunaan metode dan tools yang tepat sangat penting dalam membuat visualisasi data yang
efektif. Berikut adalah beberapa alasan mengapa penggunaan metode dan tools yang tepat
sangat penting dalam membuat visualisasi data:

1. Mempermudah pemahaman data: Penggunaan metode dan tools yang tepat dapat
membantu memperjelas data dan membuat informasi yang disajikan lebih mudah dipahami
oleh audiens.
2. Menghemat waktu dan biaya: Penggunaan metode dan tools yang tepat dapat membantu
menghemat waktu dan biaya dalam proses pembuatan visualisasi data. Metode dan tools
yang efisien dapat membantu menghemat waktu dalam proses pengolahan data dan
memungkinkan pembuat visualisasi untuk fokus pada informasi yang paling penting.
3. Menyediakan pengalaman yang lebih interaktif: Penggunaan tools yang tepat dapat
membantu pembuat visualisasi data menyediakan pengalaman yang lebih interaktif dan

© Sofyan Thayf, 2023 Page | 64


menarik bagi audiens. Hal ini dapat membantu meningkatkan keterlibatan dan minat
audiens dalam informasi yang disajikan.
4. Memperlihatkan data secara efektif: Penggunaan metode dan tools yang tepat dapat
membantu memperlihatkan data secara efektif dan memperjelas informasi yang disajikan. Ini
dapat membantu pembuat visualisasi untuk menyajikan data dengan cara yang paling
efektif untuk tujuan tertentu.

Dengan menggunakan metode dan tools yang tepat, pembuat visualisasi data dapat
memastikan bahwa data disajikan dengan cara yang paling efektif untuk audiens dan tujuan
tertentu. Hal ini dapat membantu meningkatkan pemahaman dan keterlibatan audiens dalam
informasi yang disajikan.

Berikut adalah beberapa metode dan teknik pembuatan visualisasi data yang sering digunakan:

1. Visual Encoding, adalah teknik dasar dalam pembuatan visualisasi data yang mengonversi
data ke bentuk visual seperti garis, titik, atau warna. Visual encoding biasanya digunakan
untuk menunjukkan perbandingan, hubungan, dan distribusi data.
2. Chart Types, ada banyak jenis chart atau grafik yang dapat digunakan untuk menampilkan
data, seperti bar chart, line chart, pie chart, dan scatter plot. Pemilihan chart type yang tepat
tergantung pada jenis data dan informasi yang ingin disampaikan.
3. Scaling, adalah teknik yang digunakan untuk menyesuaikan rentang data ke skala visual
yang tepat. Scaling juga dapat digunakan untuk menyesuaikan interval nilai pada sumbu,
menyesuaikan ukuran mark, atau mengubah warna.
4. Labeling, adalah teknik yang digunakan untuk memberikan informasi tambahan pada
visualisasi data. Labeling dapat digunakan untuk menambahkan informasi pada sumbu,
judul, mark, atau menunjukkan sumber data.
5. Interactivity, adalah teknik yang digunakan untuk memberikan pengalaman yang lebih
dinamis pada visualisasi data. Interaktivitas dapat berupa hover, klik, atau zoom, yang
memungkinkan audiens untuk melihat data lebih detail atau mengeksplorasi data dari
berbagai sudut pandang.
6. Design Principles, penerapan prinsip-prinsip desain grafis dapat digunakan untuk
meningkatkan estetika dan kejelasan visualisasi data. Prinsip-prinsip ini meliputi penggunaan
warna yang tepat, penggunaan tipografi yang konsisten, dan mempertimbangkan
penggunaan ruang kosong.
7. Storytelling, pembuatan visualisasi data dapat dikemas menjadi sebuah cerita, di mana
audiens dapat mengikuti plot dan mengerti pesan yang ingin disampaikan. Storytelling
melibatkan penggunaan narasi, visual, dan interaktivitas untuk membantu audiens
memahami data secara holistik.

Metode dan teknik di atas dapat digunakan untuk membuat visualisasi data yang informatif dan
mudah dipahami. Pemilihan teknik yang tepat tergantung pada jenis data, tujuan visualisasi, dan
audiens yang akan melihat visualisasi.

© Sofyan Thayf, 2023 Page | 65


Sementara itu, tools visualisasi data yang terbaik akan tergantung pada kebutuhan dan
preferensi individu atau tim. Berikut ini beberapa contoh tools visualisasi data yang dapat
digunakan, mulai dari yang paling sederhana hingga yang lebih canggih:

1. Microsoft Excel, adalah tools visualisasi data yang paling sederhana, yang biasanya sudah
tersedia di komputer dan dapat digunakan untuk membuat grafik dan tabel sederhana. Excel
juga mudah digunakan dan sangat familiar bagi banyak orang.
2. Google Sheets, sama seperti Excel, Google Sheets adalah aplikasi spreadsheet gratis yang
dapat digunakan untuk membuat grafik dan tabel sederhana. Google Sheets juga memiliki
fitur kolaborasi yang memungkinkan tim untuk bekerja bersama pada satu file.
3. Tableau Public, adalah aplikasi visualisasi data yang populer dan mudah digunakan. Aplikasi
ini menyediakan fitur drag-and-drop yang memungkinkan pengguna untuk membuat
visualisasi data yang menarik dengan cepat dan mudah. Tableau Public juga memungkinkan
pengguna untuk mempublikasikan visualisasi secara online.
4. Power BI, adalah aplikasi visualisasi data buatan Microsoft yang terintegrasi dengan berbagai
sumber data. Aplikasi ini menawarkan berbagai fitur canggih, termasuk machine learning,
yang memungkinkan pengguna untuk membuat visualisasi data yang lebih kompleks.
5. [Link], adalah library JavaScript yang sangat fleksibel dan dapat digunakan untuk membuat
visualisasi data yang sangat canggih dan interaktif. Namun, penggunaan [Link] memerlukan
keahlian pemrograman dan pemahaman yang kuat tentang teknologi web.
6. Python Libraries, ada banyak library Python yang dapat digunakan untuk membuat
visualisasi data, seperti Matplotlib, Seaborn, Plotly, dan Bokeh. Python sangat populer di
kalangan ilmu data dan machine learning, sehingga library ini sangat berguna bagi mereka
yang sudah memahami bahasa pemrograman Python.

Ini hanya beberapa contoh tools visualisasi data yang tersedia. Masih banyak lagi tools
visualisasi data yang dapat digunakan, tergantung pada kebutuhan dan preferensi individu atau
tim. Pilihan tools yang tepat harus didasarkan pada jenis data yang diproses dan tujuan
visualisasi data yang ingin dicapai.

Referensi
Abela, B. (2010). Advanced Presentations by Design: Creating Communication that Drives Action.
John Wiley & Sons.

Alberto Cairo, "The Functional Art: An Introduction to Information Graphics and Visualization"
(New Riders, 2012).

Alberto Cairo, The Truthful Art: Data, Charts, and Maps for Communication (New Riders, 2016).

Cole Nussbaumer Knaflic, "Storytelling with Data: A Data Visualization Guide for Business
Professionals" (Wiley, 2015).

© Sofyan Thayf, 2023 Page | 66


[Link] documentation: [Link]

Edward Tufte, "Envisioning Information" (Graphics Press, 1990).

Edward Tufte, The Visual Display of Quantitative Information (Graphics Press, 2001).

Hadley Wickham, ggplot2: Elegant Graphics for Data Analysis (Springer, 2009).

Heer, J., & Bostock, M. (2010). Crowdsourcing graphical perception: using mechanical turk to
assess visualization design. Proceedings of the SIGCHI Conference on Human Factors in
Computing Systems, 203-212.

Nathan Yau, "Data Points: Visualization That Means Something" (Wiley, 2013).

Nathan Yau, Visualize This: The FlowingData Guide to Design, Visualization, and Statistics (Wiley,
2011).

Segaran, T. (2007). Programming collective intelligence: building smart web 2.0 applications.
O'Reilly Media.

Stephen Few, "Show Me the Numbers: Designing Tables and Graphs to Enlighten" (Analytics
Press, 2012).

Wickham, H., & Grolemund, G. (2017). R for Data Science: Import, Tidy, Transform, Visualize, and
Model Data. O'Reilly Media.

© Sofyan Thayf, 2023 Page | 67


9. Konsep Database

Pengertian Database
Database atau basis data adalah kumpulan data yang disimpan secara teratur dan terstruktur di
dalam komputer, sehingga memungkinkan pengguna untuk mengakses, mengelola, dan
mengambil informasi dengan lebih mudah dan efisien. Basis data ini terdiri dari berbagai jenis
data, seperti teks, gambar, suara, angka, dan informasi lainnya yang dapat digunakan untuk
tujuan tertentu.

Basis data biasanya digunakan dalam berbagai jenis aplikasi, seperti sistem manajemen
perusahaan, aplikasi perbankan, sistem manajemen pergudangan, sistem manajemen stok, dan
lain-lain. Basis data dapat membantu organisasi untuk mempercepat proses pengambilan
keputusan dan meningkatkan efisiensi operasional, karena memungkinkan pengguna untuk
dengan cepat mencari, memperbarui, dan menganalisis data dengan lebih mudah dan akurat.

Kapabilitas basis data mencakup kemampuan untuk mengelola, menyimpan, dan mengakses
data dengan efisien dan efektif. Berikut adalah beberapa kapabilitas utama yang dimiliki oleh
basis data:

1. Pemodelan Data: Basis data memiliki kemampuan untuk memodelkan data dengan berbagai
cara, seperti dengan menggunakan diagram entity-relationship (ER) atau model data
relasional. Pemodelan data ini membantu dalam mengorganisir data secara terstruktur,
sehingga memudahkan dalam pengolahan data.
2. Penyimpanan Data: Basis data dapat menyimpan data dalam format yang terstruktur dan
terorganisir dengan baik, seperti tabel atau entitas, yang dapat diakses dengan mudah oleh
pengguna. Sistem basis data juga dapat menangani volume data yang besar dan
memastikan bahwa data tersimpan dengan aman dan terlindungi.
3. Pemrosesan Data: Basis data memungkinkan pengguna untuk melakukan operasi
pengolahan data, seperti pencarian, penyaringan, dan pengurutan data. Basis data juga
dapat menangani operasi agregat, seperti menjumlahkan data atau menghitung rata-rata
data.
4. Integrasi Data: Basis data dapat mengintegrasikan data dari berbagai sumber yang berbeda,
seperti sistem informasi perusahaan, aplikasi bisnis, dan sumber data publik. Integrasi data
ini memungkinkan pengguna untuk menggabungkan data dari berbagai sumber yang
berbeda dan menghasilkan wawasan baru yang berguna.

Dalam data sains, basis data digunakan untuk menyimpan dan mengelola data yang
berhubungan dengan suatu topik atau masalah tertentu. Basis data membantu dalam
pengumpulan data yang terstruktur dan terorganisir dengan baik, sehingga memudahkan dalam
mengakses dan menganalisis data. Basis data juga memungkinkan pengguna untuk

© Sofyan Thayf, 2023 Page | 68


mengintegrasikan data dari berbagai sumber yang berbeda, sehingga memperkaya analisis dan
interpretasi data.

Dalam praktiknya, penggunaan basis data dalam data sains melibatkan proses pengolahan data
yang meliputi pembersihan data, penggabungan data, penggalian data, analisis data, dan
visualisasi data. Basis data juga memainkan peran penting dalam pengelolaan data yang
berhubungan dengan privasi dan keamanan, sehingga memastikan bahwa data yang digunakan
dalam analisis adalah aman dan terlindungi.

Dengan kata lain, basis data memainkan peran kunci dalam data sains dengan memungkinkan
pengguna untuk mengumpulkan, mengelola, dan menganalisis data secara efektif dan efisien.

Pemodelan Database
Pemodelan data dalam database adalah proses merancang dan memodelkan struktur data
dalam database. Tujuannya adalah untuk mengorganisir data dalam bentuk yang terstruktur dan
mudah dipahami, serta memudahkan pengolahan data di dalam database.

Dalam pemodelan data dikenal beberapa komponen utama, yaitu:

1. Entitas: Objek atau konsep yang memiliki atribut atau sifat tertentu. Entitas biasanya
merepresentasikan objek di dunia nyata seperti produk, pelanggan, atau pesanan.
2. Atribut: Karakteristik atau sifat dari entitas. Misalnya, produk dapat memiliki atribut seperti
nama, deskripsi, harga, dan stok.
3. Relasi: Hubungan antara entitas yang menunjukkan bagaimana entitas saling terkait dalam
dunia nyata.
4. Kardinalitas: Jumlah entitas yang terlibat dalam suatu relasi. Misalnya, sebuah pesanan dapat
memiliki kardinalitas satu ke banyak dengan produk, yang berarti setiap pesanan dapat
berisi banyak produk.

Gambar 14 Entitas, Atribut, Relasi dan Kardinalitas

Untuk memahami konsep entitas, atribut, relasi dan kardinalitas, Gambar 14 dapat dijelaskan
sebagai berikut:

© Sofyan Thayf, 2023 Page | 69


1. Terdapat dua entitas yaitu Student (siswa, mahasiswa) dan Course (kelas, mata kuliah)
2. Entitas Student memiliki tiga atribut: ID, Name dan Program
3. Entitas Course memiliki dua atribut: ID Course dan Subject
4. Student mendaftar (enroll) pada Course sehingga terbentuk relasi antara Student dengan
Course
5. Satu atau lebih (notasi 1..* = minimal satu sampai tak hingga) Student dapat enroll pada
Course yang sama merupakan kardinalitas
6. Satu atau lebih Course dapat diikuti (di-enroll) oleh satu Student yang sama merupakan
kardinalitas
7. Kardinalitas dari relasi enroll disebut sebagai relasi banyak-ke-banyak atau many-to-many
(banyak Student dengan banyak Course)

Untuk memudahkan pemodelan data untuk database, diagram seperti pada Gambar 14 tidak
digunakan, karena penggambarannya terlalu kompleks dan rumit, dan akan menyulitkan jika
melibatkan banyak entitas dengan berbagai atribut dan relasinya. Untuk itu digunakan Entity
Relationship Diagram (ERD).

Entity Relationship Diagram (ERD) adalah sebuah model data yang menggambarkan hubungan
antara entitas dalam suatu sistem. ERD merupakan alat yang penting dalam desain basis data
karena memungkinkan kita untuk merepresentasikan dan memvisualisasikan struktur dari basis
data dengan jelas dan mudah dimengerti. ERD dapat membantu dalam merancang,
memperbarui, atau mengoptimalkan basis data, serta dapat meminimalkan kesalahan dalam
pengembangan basis data. ERD juga dapat membantu dalam berkomunikasi dengan
stakeholder lainnya tentang struktur dan konten dari basis data.

Jika model pada Gambar 14 digambarkan dengan menggunakan ERD maka akan seperti pada
Gambar 15

Gambar 15 Entity Relationship Diagram

© Sofyan Thayf, 2023 Page | 70


Gambar 16 Contoh ERD sebuah rancangan sistem yang kompleks
Sumber: [Link]

Struktur Database
Struktur database merujuk pada cara data disimpan dan diorganisir dalam basis data. Struktur
ini terdiri dari beberapa komponen, termasuk tabel, kolom, baris, kunci, dan relasi. Berikut
adalah penjelasan lebih rinci tentang masing-masing komponen dalam struktur database:

1. Tabel, adalah kumpulan data yang terdiri dari baris dan kolom yang saling terkait. Setiap
tabel dalam basis data terdiri dari nama tabel, daftar kolom, dan baris data. Pada prinsipnya,
tabel adalah implementasi dari entitas dari model data
2. Kolom, dalam tabel adalah bagian dari tabel yang berisi informasi atau data spesifik. Kolom
diidentifikasi dengan nama kolom dan tipe data yang sesuai. Kolom pada prinsipnya adalah
implementasi dari atribut-atribut entitas dalam rancangan model data.
3. Baris, dalam tabel adalah rekaman data tunggal dalam tabel. Setiap baris harus memuat data
yang sama jumlahnya dengan kolom yang terkait. Baris merupakan representasi sejumlah
individu dari entitas yang sama
4. Kunci, adalah pengidentifikasi unik untuk setiap baris dalam tabel. Ada dua jenis kunci dalam
basis data: kunci utama (primary key) dan kunci asing (foreign key).
a. Kunci Utama: Kunci utama adalah kolom atau kombinasi kolom yang unik untuk
setiap baris dalam tabel. Kunci utama digunakan untuk mengidentifikasi setiap baris
dengan cara yang unik, sehingga memudahkan proses pengambilan data dari tabel.

© Sofyan Thayf, 2023 Page | 71


b. Kunci Asing: Kunci asing adalah kolom atau kombinasi kolom dalam sebuah tabel
yang mengacu pada kunci utama dalam tabel lain. Kunci asing digunakan untuk
membangun relasi antara tabel.

Gambar 17 Entitas dan atributnya dalam tabel database


Sumber: [Link]

Database Relasional
Database relasional adalah jenis database yang menggunakan model data relasional. Model
data relasional didasarkan pada konsep relasi antara tabel dalam database, yang terdiri dari
baris dan kolom. Setiap tabel dalam database relasional memiliki satu atau lebih kolom yang
didefinisikan sebagai kunci utama (primary key) yang dapat digunakan untuk mengidentifikasi
setiap baris dalam tabel tersebut.

Dalam database relasional, hubungan antara tabel ditentukan oleh kunci asing (foreign key),
yang merujuk ke kunci utama di tabel lain. Dengan menggunakan kunci asing, data dapat
digabungkan dari beberapa tabel untuk membentuk suatu hasil yang lebih besar.

Contoh sederhana dari database relasional adalah database toko online. Tabel-tabel dalam
database toko online dapat termasuk tabel pelanggan, tabel produk, dan tabel pesanan. Tabel
pelanggan akan memiliki kolom-kolom seperti ID pelanggan, nama, alamat, dan sebagainya,
sementara tabel produk akan memiliki kolom-kolom seperti ID produk, nama produk, harga,
dan sebagainya. Tabel pesanan kemudian akan menghubungkan tabel pelanggan dan produk
menggunakan kunci asing, dengan kolom-kolom seperti ID pesanan, ID pelanggan, ID produk,
jumlah, dan sebagainya.

Database relasional sangat umum digunakan dalam bisnis dan industri karena kemampuannya
untuk menyimpan, mengelola, dan mengambil data yang terstruktur. Manajemen data yang
terorganisir dan relasi antara data yang terdefinisi dengan baik dapat memudahkan pengguna
dalam mengakses dan menganalisis data secara efektif dan efisien. Beberapa contoh perangkat
lunak database relasional yang populer termasuk MySQL, PostgreSQL, Oracle, dan Microsoft
SQL Server.
© Sofyan Thayf, 2023 Page | 72
Pembahasan sebelumnya tentang pemodelan data dan struktur database, merujuk pada konsep
database relasional

Database relasional sangat handal dalam menangani data yang besar dan kompleks, namun
juga memiliki sejumlah kelemahan. Berikut adalah beberapa keunggulan dan kelemahan dari
database relasional:

Keunggulan:

1. Data terstruktur: Database relasional menggunakan tabel untuk mengorganisir data,


sehingga data dapat diorganisir dengan baik dan mudah dipahami.
2. Data terkait dengan baik: Database relasional dapat menangani banyak data terkait dengan
baik dan menyimpan hubungan antara data dengan baik.
3. Kemudahan dalam manipulasi data: Database relasional memungkinkan pengguna untuk
melakukan manipulasi data dengan mudah dan cepat menggunakan perintah SQL.
4. Konsistensi data: Database relasional memastikan bahwa data konsisten dengan definisi
database.

Kelemahan:

1. Skalabilitas: Ketika database relasional tumbuh, performa dapat menjadi masalah karena
kompleksitas relasi antara tabel.
2. Pengelolaan data yang sulit: Database relasional memerlukan pengelolaan yang rumit dan
mungkin memerlukan lebih banyak waktu untuk mengelola dan memperbaiki database.
3. Biaya: Database relasional umumnya lebih mahal dibandingkan dengan database non-
relasional, terutama ketika skala datanya besar dan memerlukan banyak server.
4. Keterbatasan dalam penyimpanan data semi-struktur: Database relasional kurang cocok
untuk menyimpan data semi-struktur, seperti dokumen yang disimpan dalam format JSON
atau XML.

Meskipun demikian, database relasional masih menjadi pilihan yang populer di industri dan
bisnis karena kemampuannya untuk mengelola data terstruktur dengan baik dan
memungkinkan adanya pengaturan relasi antara data. Namun, dengan munculnya jenis
database baru seperti database NoSQL dan NewSQL, sekarang banyak organisasi yang
mempertimbangkan alternatif lain untuk kebutuhan database mereka.

Structured Query Language


Structured Query Language (SQL) adalah bahasa pemrograman yang digunakan untuk
mengakses, mengelola, dan mengorganisir data dalam sebuah database relasional. SQL adalah
bahasa standar untuk manajemen basis data relasional, yang berarti hampir semua sistem
manajemen basis data relasional mendukung SQL.

SQL digunakan untuk melakukan berbagai tugas dalam database, termasuk:

© Sofyan Thayf, 2023 Page | 73


1. Membuat, memperbarui, dan menghapus tabel dan kolom dalam database.
2. Memasukkan, menghapus, memperbarui, dan mengambil data dari tabel dalam database.
3. Membuat kueri atau pertanyaan terhadap database untuk mencari atau memfilter data
berdasarkan kriteria tertentu.
4. Membuat indeks untuk mempercepat pencarian data.
5. Menetapkan hak akses pengguna ke database.

SQL digunakan dalam berbagai aplikasi seperti aplikasi web, sistem manajemen inventaris,
sistem manajemen kepegawaian, sistem manajemen pelanggan, dan banyak lagi. SQL juga
digunakan oleh administrator database dan pengembang untuk melakukan tugas seperti
pemeliharaan, backup, dan pemulihan database.

SQL memiliki banyak fitur dan perintah yang dapat memungkinkan pengguna mengelola dan
mengakses data dalam database dengan lebih efektif dan efisien. Namun, SQL juga dapat
menjadi kompleks dan memerlukan pemahaman yang kuat tentang bahasa dan struktur
database untuk menggunakan secara efektif. Oleh karena itu, orang sering membutuhkan
pelatihan dan pengalaman untuk menguasai SQL.

DDL (Data Definition Language) dan DML (Data Manipulation Language) adalah dua kelompok
perintah SQL yang digunakan untuk mengelola dan memanipulasi struktur dan data dalam
sebuah database relasional.

DDL adalah kelompok perintah SQL yang digunakan untuk membuat, mengubah, dan
menghapus struktur database, seperti tabel, kolom, indeks, dan constraint. Perintah DDL
mencakup CREATE, ALTER, dan DROP. Contoh perintah DDL:

1. CREATE TABLE: CREATE TABLE digunakan untuk membuat sebuah tabel baru. Contohnya,
untuk membuat tabel "customers" dengan kolom "id", "name", "email", dan "phone", Anda
dapat menggunakan perintah berikut:
CREATE TABLE customers (
id INT PRIMARY KEY,
name VARCHAR(255),
email VARCHAR(255),
phone VARCHAR(20)
);

2. ALTER TABLE: ALTER TABLE digunakan untuk mengubah struktur tabel yang sudah ada.
Contohnya, untuk menambahkan kolom "address" ke tabel "customers", Anda dapat
menggunakan perintah berikut:
ALTER TABLE customers ADD COLUMN address VARCHAR(255);

3. DROP TABLE: DROP TABLE digunakan untuk menghapus sebuah tabel dari database.
Contohnya, untuk menghapus tabel "customers" dari database, Anda dapat menggunakan
perintah berikut:
DROP TABLE customers;

© Sofyan Thayf, 2023 Page | 74


4. CREATE INDEX: CREATE INDEX digunakan untuk membuat sebuah indeks pada satu atau
beberapa kolom dalam sebuah tabel. Contohnya, untuk membuat sebuah indeks pada
kolom "email" dalam tabel "customers", Anda dapat menggunakan perintah berikut:
CREATE INDEX idx_customers_email ON customers (email);

Dalam semua contoh di atas, perintah DDL dieksekusi untuk mendefinisikan struktur database,
yaitu tabel, kolom, indeks, dan constraint. Perintah DDL tidak memanipulasi data dalam tabel,
melainkan digunakan untuk membuat atau mengubah struktur tabel sesuai dengan kebutuhan
aplikasi.

DML adalah kelompok perintah SQL yang digunakan untuk memanipulasi data dalam tabel,
seperti memasukkan, menghapus, dan memperbarui data. Perintah DML mencakup INSERT,
UPDATE, DELETE, dan SELECT. Contoh perintah DML:

1. SELECT: SELECT digunakan untuk menampilkan data dari satu atau beberapa tabel dalam
database. Contohnya, untuk menampilkan semua data dari tabel "customers", Anda dapat
menggunakan perintah berikut:
SELECT * FROM customers;

2. INSERT: INSERT digunakan untuk menambahkan data baru ke dalam sebuah tabel.
Contohnya, untuk menambahkan data pelanggan baru ke dalam tabel "customers", Anda
dapat menggunakan perintah berikut:
INSERT INTO customers (name, email, phone) VALUES ('John Doe',
'johndoe@[Link]', '555-1234');

3. UPDATE: UPDATE digunakan untuk mengubah data yang sudah ada di dalam sebuah tabel.
Contohnya, untuk mengubah nomor telepon pelanggan dengan ID 1234 menjadi "555-
5678", Anda dapat menggunakan perintah berikut:

UPDATE customers SET phone = '555-5678' WHERE id = 1234;

4. DELETE: DELETE digunakan untuk menghapus data dari sebuah tabel. Contohnya, untuk
menghapus data pelanggan dengan ID 5678 dari tabel "customers", Anda dapat
menggunakan perintah berikut:
DELETE FROM customers WHERE id = 5678;

Keduanya (DDL dan DML) adalah komponen kunci dalam SQL dan digunakan dalam kombinasi
untuk membangun aplikasi yang bergantung pada database. DDL dan DML harus digunakan
dengan hati-hati, karena dapat memengaruhi struktur dan data dalam database secara
signifikan.

© Sofyan Thayf, 2023 Page | 75


NoSQL
NoSQL (Not Only SQL) adalah pendekatan baru dalam desain database yang tidak terbatas oleh
struktur relasional tradisional dan menawarkan fleksibilitas dan skala yang lebih besar dalam
pengolahan data. Database NoSQL dirancang untuk menangani data yang sangat besar, sangat
terdistribusi, dan sangat heterogen yang sering ditemukan dalam aplikasi modern seperti
jejaring sosial, e-commerce, dan game.

Beberapa karakteristik utama dari database NoSQL meliputi:

1. Fleksibilitas, tidak mengharuskan struktur data yang tetap seperti database relasional
tradisional.
2. Skalabilitas, dapat dengan mudah ditingkatkan secara horizontal untuk menangani volume
data yang sangat besar.
3. Keterdistribusian, mendukung sistem terdistribusi dengan replikasi dan partisi data di
seluruh jaringan.
4. Kinerja tinggi, dirancang untuk memproses data dalam skala besar dengan cepat dan efisien.

Beberapa contoh dari jenis database NoSQL termasuk:

1. Document databases, database yang mengelola dokumen dalam format JSON, XML, atau
BSON.
2. Key-value stores, database yang menyimpan data dalam bentuk pasangan key-value.
3. Column-family stores, database yang menyimpan data dalam format kolom, seperti tabel
spreadsheet.
4. Graph databases, database yang dirancang untuk menyimpan dan mengelola data terkait
dalam bentuk grafik.

Berikut beberapa contoh produk NoSQL:

1. MongoDB: Salah satu database NoSQL paling populer dan sering digunakan, MongoDB
adalah sebuah document database yang dirancang untuk menyimpan dan mengelola data
dalam format dokumen JSON. MongoDB dapat digunakan untuk berbagai keperluan seperti
penyimpanan data, caching, dan pengindeksan.
2. Cassandra: Merupakan sebuah database NoSQL kolom keluarga, yang terkenal untuk
kemampuan skala yang tinggi dan performa baca-tulis yang cepat. Cassandra sering
digunakan dalam aplikasi big data dan Internet of Things (IoT).
3. Couchbase: Database NoSQL yang dirancang untuk menggabungkan keunggulan dari
model database dokument dan key-value store. Couchbase dapat digunakan untuk aplikasi
berbasis data yang sangat terdistribusi dan membutuhkan performa tinggi.

© Sofyan Thayf, 2023 Page | 76


4. Neo4j: Salah satu contoh database NoSQL yang digunakan untuk graph database. Neo4j
menyediakan struktur data grafik yang kuat, dengan kemampuan untuk menyimpan
hubungan antara objek yang rumit.
5. Amazon DynamoDB: Salah satu layanan database NoSQL yang ditawarkan oleh Amazon
Web Services (AWS), DynamoDB adalah sebuah key-value database yang dirancang untuk
skala dan performa tinggi.

Sebagaimana sistem database relasional yangmemiliki keunggulan dan juga kelemahan, berikut
adalah beberapa keunggulan dan kelemahan dari database NoSQL:

Keunggulan:

1. Skalabilitas: NoSQL dirancang untuk dapat dengan mudah di skalakan secara horizontal,
yang memungkinkan pengguna untuk menambahkan lebih banyak node atau server untuk
meningkatkan kapasitas penyimpanan dan kinerja.
2. Kinerja tinggi: Database NoSQL dirancang untuk kinerja tinggi dalam pengolahan data
dalam skala besar.
3. Fleksibilitas data: NoSQL memungkinkan penyimpanan data semi-struktur atau tidak
terstruktur, yang membuatnya lebih fleksibel dalam menangani data yang tidak cocok
dengan format tabel relasional tradisional.
4. Biaya yang lebih rendah: Database NoSQL memungkinkan pengguna untuk menghemat
biaya hardware dan administrasi database, karena skala horizontal memungkinkan untuk
menggunakan server murah yang mudah diakses dan dielola.

Kelemahan:

1. Kurangnya standardisasi: Dibandingkan dengan database relasional, NoSQL tidak memiliki


standar industri dan kurangnya interoperabilitas antara produk NoSQL yang berbeda.
2. Kompleksitas desain: Desain database NoSQL yang lebih fleksibel memerlukan pemahaman
yang lebih mendalam tentang struktur data, dan proses desain dapat menjadi lebih
kompleks dan sulit dipahami.
3. Kurangnya dukungan: Produk NoSQL mungkin memiliki kurangnya dukungan dari vendor
dan komunitas open-source, dan beberapa produk yang kurang populer mungkin tidak
memiliki dokumentasi dan dukungan yang memadai.
4. Terbatasnya kemampuan kueri: Karena struktur data yang lebih fleksibel, query dalam
NoSQL mungkin tidak sekuat dan sekompleks dalam database relasional. Beberapa jenis
query seperti join dan grouping mungkin tidak didukung atau sulit dilakukan pada NoSQL.

Referensi
Amazon Web Services. (2023). Amazon DynamoDB. Diakses pada 18 Februari 2023, dari
[Link]

Amazon Web Services. (2023). What is NoSQL? Diakses pada 18 Februari 2023, dari
[Link]
© Sofyan Thayf, 2023 Page | 77
Apache Cassandra. (2023). Cassandra. Diakses pada 18 Februari 2023, dari
[Link]

Codd, E. F. (1970). A Relational Model of Data for Large Shared Data Banks. Communications of
the ACM, 13(6), 377-387.

Connolly, T., & Begg, C. (2014). Database systems: a practical approach to design,
implementation, and management. Pearson Education Limited.

Couchbase. (2023). Couchbase. Diakses pada 18 Februari 2023, dari


[Link]

Date, C. J. (2004). An introduction to database systems (Vol. 1). Pearson Education.

Elmasri, R., & Navathe, S. B. (2010). Fundamentals of database systems. Pearson Education.

MongoDB. (2023). What is NoSQL? Diakses pada 18 Februari 2023, dari


[Link]

Neo4j. (2023). Neo4j. Diakses pada 18 Februari 2023, dari [Link]

Oracle Corporation. (2021). SQL Language Reference. Diakses pada 18 Februari 2023, dari
[Link]

Redmond, E., & Wilson, J. R. (2012). Seven databases in seven weeks: a guide to modern
databases and the NoSQL movement. Pragmatic Bookshelf.

Sadalage, P. J., & Fowler, M. (2012). NoSQL Distilled: A Brief Guide to the Emerging World of
Polyglot Persistence. Addison-Wesley Professional.

Silberschatz, A., Korth, H. F., & Sudarshan, S. (2010). Database System Concepts. McGraw-Hill
Education.

W3Schools. SQL Tutorial. Diakses pada 18 Februari 2023, dari


[Link]

W3Schools. SQL Tutorial. Diakses pada 18 Februari 2023, dari


[Link]

© Sofyan Thayf, 2023 Page | 78


10. Pemrograman dalam Data Sains

Pengertian Pemrograman
Pemrograman (Programming), dalam hal ini adalah pemrograman komputer, adalah suatu
proses menciptakan perangkat lunak (software) yang dapat mengeksekusi berbagai tugas dan
fungsi sesuai dengan kebutuhan. Pemrograman melibatkan penggunaan bahasa pemrograman
untuk membuat kode atau instruksi yang dapat dijalankan oleh komputer. Proses pemrograman
mencakup perencanaan, merancang, menulis kode, menguji, dan memelihara aplikasi atau
program yang dibuat. Kode yang dihasilkan dari pemrograman akan mengontrol perilaku dan
tampilan perangkat lunak, serta dapat diubah atau diperbaiki sesuai kebutuhan.

Tujuan utama dari pemrograman adalah untuk menciptakan solusi untuk masalah yang dihadapi
oleh pengguna, baik itu untuk kebutuhan bisnis, akademis, hiburan, atau lainnya. Dalam era
digital saat ini, pemrograman sangat penting dalam mengembangkan teknologi dan sistem
yang dapat membantu meningkatkan efisiensi dan produktivitas dalam berbagai bidang.

Ada banyak bahasa pemrograman yang dapat digunakan untuk menciptakan perangkat lunak,
seperti C, C++, Java, Python, Ruby, dan masih banyak lagi. Masing-masing bahasa
pemrograman memiliki kelebihan dan kekurangan sendiri-sendiri, dan dipilih berdasarkan jenis
program yang akan dibuat dan kemampuan pengguna dalam menggunakan bahasa
pemrograman tersebut.

Pemrograman sangat erat kaitannya dengan data sains karena pemrograman digunakan untuk
memproses, menganalisis, dan memvisualisasikan data dalam bidang data sains. Pemrograman
memungkinkan para ilmuwan data untuk mengembangkan algoritma, membuat model
prediktif, dan menghasilkan visualisasi data yang bermanfaat untuk memahami dan
mengekstrak informasi dari data.

Sangat penting bagi para ilmuwan data untuk menguasai pemrograman komputer. Dalam dunia
data sains, pemrograman komputer digunakan untuk mengelola, menganalisis, dan
memvisualisasikan data. Dengan menguasai pemrograman komputer, para ilmuwan data dapat
mengembangkan algoritma dan program yang dapat memproses data dengan lebih efektif,
menghasilkan model prediktif yang lebih akurat, serta memvisualisasikan data dengan lebih jelas
dan informatif.

Selain itu, dengan menguasai pemrograman komputer, para ilmuwan data dapat
mengotomatisasi tugas-tugas analisis data, sehingga mereka dapat lebih efisien dalam bekerja.
Para ilmuwan data juga dapat memodifikasi atau mengembangkan ulang algoritma atau
program yang sudah ada untuk memenuhi kebutuhan analisis data yang lebih spesifik.

© Sofyan Thayf, 2023 Page | 79


Data sains dengan memanfaatkan teknik pemrograman, selain memiliki keunggulan juga
memiliki kelemahan. Berikut adalah beberapa kelebihan dan kelemahan atau kekurangan dalam
melakukan programming pada data sains:

Kelebihan:

1. Efisiensi dalam pengolahan dan analisis data: Dengan programming, data dapat diolah dan
dianalisis dengan lebih cepat dan efisien daripada menggunakan perangkat lunak yang
sudah jadi.
2. Fleksibilitas dalam pemrosesan data: Dalam programming, Anda dapat menyesuaikan
pemrosesan data dengan kebutuhan Anda. Anda dapat menggabungkan beberapa teknik
analisis dan pemrosesan data untuk menghasilkan hasil yang lebih baik.
3. Kemampuan untuk membuat algoritma kustom: Dalam programming, Anda dapat membuat
algoritma kustom untuk memecahkan masalah yang spesifik. Algoritma kustom dapat
dibangun dari awal atau dimodifikasi dari algoritma yang sudah ada.
4. Reproduktibilitas analisis: Programming memungkinkan analisis dapat direproduksi dengan
mudah dan diperbarui secara teratur.

Kekurangan:

1. Butuh waktu untuk belajar: Programming membutuhkan waktu untuk mempelajari bahasa
pemrograman dan teknik pemrosesan data.
2. Memerlukan hardware yang cukup baik: Pengolahan data besar memerlukan hardware yang
cukup baik seperti CPU dan RAM yang cukup besar.
3. Memerlukan pengetahuan matematika yang cukup: Programming untuk data sains
memerlukan pemahaman matematika yang cukup baik, seperti statistik dan kalkulus.
4. Perlu memperbarui program: Perkembangan dalam teknologi data sains dan bahasa
pemrograman yang digunakan berubah dengan cepat, sehingga perlu untuk memperbarui
program dengan teratur.

Saat mempertimbangkan kelebihan dan kekurangan, penting untuk memperhatikan kebutuhan


spesifik dalam proyek data sains yang sedang dijalankan. Programming pada data sains akan
memberikan manfaat besar dalam hal efisiensi, fleksibilitas, dan reproduktibilitas analisis, namun
memerlukan pengetahuan, waktu, dan perangkat yang sesuai.

Pemrograman untuk Data Sains


Python dan R adalah dua bahasa pemrograman yang paling sering digunakan dalam data sains.
Kedua bahasa ini memungkinkan para ilmuwan data untuk memproses data dengan efisien dan
membangun model prediktif yang akurat. Python biasanya lebih populer untuk memproses data
besar, sementara R biasanya lebih populer untuk analisis statistik.

© Sofyan Thayf, 2023 Page | 80


Pemrograman Python

Python adalah salah satu bahasa pemrograman yang paling populer dalam data sains. Python
menawarkan banyak library dan framework yang berguna untuk pemrosesan data, visualisasi,
dan pembuatan model machine learning. Berikut adalah beberapa library Python yang populer
untuk data sains:

1. NumPy: library Python untuk pemrosesan data numerik yang cepat dan efisien, termasuk
operasi matriks dan statistik dasar.
2. Pandas: library Python untuk manipulasi dan analisis data yang memungkinkan untuk
membaca, menulis, dan memanipulasi data dalam berbagai format, seperti CSV, Excel, dan
SQL.
3. Matplotlib: library Python untuk visualisasi data yang memungkinkan membuat berbagai
jenis plot, seperti scatter plot, line plot, dan histogram.
4. Seaborn: library Python yang memungkinkan membuat plot yang lebih indah dan informatif
daripada Matplotlib.
5. Scikit-Learn: library Python untuk pembelajaran mesin yang memungkinkan membuat model
machine learning, seperti regresi, klasifikasi, dan klastering.
6. TensorFlow: library Python untuk deep learning yang memungkinkan membuat model
neural network yang kompleks.
7. Keras: library Python untuk deep learning yang memungkinkan membuat model neural
network yang lebih mudah.

Python juga memiliki banyak tools untuk mempermudah pemrograman data sains, seperti
Jupyter Notebook, Spyder, dan PyCharm. Jupyter Notebook adalah lingkungan pengembangan
interaktif yang memungkinkan membuat, berbagi, dan mempresentasikan kode Python dalam
format yang interaktif dan mudah dibaca. Spyder adalah IDE (Integrated Development
Environment) untuk Python yang khusus untuk pemrograman data sains. PyCharm adalah IDE
Python yang lebih umum dan mendukung banyak bahasa pemrograman.

Pemrograman R

R juga merupakan bahasa pemrograman yang populer untuk data sains dan statistik. R
menyediakan banyak paket (packages) dan fungsi untuk analisis data, visualisasi, dan
pembuatan model machine learning. Berikut adalah beberapa paket R yang populer untuk data
sains:

1. ggplot2: paket R untuk visualisasi data yang memungkinkan membuat berbagai jenis plot,
seperti scatter plot, line plot, dan histogram.
2. dplyr: paket R untuk manipulasi data yang memungkinkan untuk membaca, menulis, dan
memanipulasi data dalam berbagai format, seperti CSV, Excel, dan SQL.

© Sofyan Thayf, 2023 Page | 81


3. tidyr: paket R untuk penyusunan kembali data (data tidying) yang memungkinkan untuk
mengubah bentuk data dari bentuk lebar (wide format) menjadi bentuk panjang (long
format) dan sebaliknya.
4. caret: paket R untuk pembelajaran mesin yang memungkinkan membuat model machine
learning, seperti regresi, klasifikasi, dan klastering.
5. randomForest: paket R untuk pembelajaran mesin yang memungkinkan membuat model
random forest, yang merupakan metode ensemble learning yang menggabungkan beberapa
pohon keputusan.
6. Shiny: paket R untuk pembuatan aplikasi web interaktif yang memungkinkan untuk
mempresentasikan data dan model machine learning dalam bentuk yang interaktif.

R juga memiliki banyak IDE (Integrated Development Environment) yang populer untuk
pemrograman data sains, seperti RStudio dan Jupyter Notebook. RStudio adalah IDE R yang
populer dan mendukung banyak fitur untuk pemrograman data sains, seperti debugging,
version control, dan project management. Jupyter Notebook adalah lingkungan pengembangan
interaktif yang memungkinkan membuat, berbagi, dan mempresentasikan kode R dalam format
yang interaktif dan mudah dibaca.

Pemilihan Python atau R

Python dan R keduanya sangat populer di kalangan data saintis dan analis data sebagai bahasa
pemrograman untuk pemrosesan dan analisis data. Kedua bahasa pemrograman ini memiliki
kelebihan dan kekurangan masing-masing yang dapat dipertimbangkan sebelum memilih
bahasa pemrograman yang cocok untuk tujuan tertentu. Berikut adalah perbandingan Python
dan R sebagai panduan untuk memilih:

1. Kemampuan: Python memiliki kemampuan yang lebih luas dan dapat digunakan untuk
berbagai macam tujuan, seperti pengembangan web, pemrograman aplikasi, dan
pembuatan game. Sementara itu, R dirancang khusus untuk analisis data dan statistik.
2. Ketersediaan paket: Python memiliki lebih banyak paket (libraries) yang tersedia untuk
pengolahan data dan machine learning, seperti NumPy, Pandas, dan Scikit-learn. Namun, R
memiliki lebih banyak paket yang didesain khusus untuk analisis data dan statistik, seperti
ggplot2 dan dplyr.
3. Kegunaan: Jika tujuan utama adalah membuat visualisasi data dan menganalisis data dalam
lingkungan statistik, R mungkin menjadi pilihan yang lebih baik. Namun, jika tujuan utama
adalah membuat model machine learning dan mengembangkan aplikasi web yang
kompleks, maka Python mungkin menjadi pilihan yang lebih baik.
4. Kemudahan penggunaan: Python lebih mudah dipelajari dan lebih intuitif untuk pemula.
Sementara itu, R memiliki kurva belajar yang lebih tinggi dan lebih sulit dipahami oleh
pemula.
5. Komunitas: Keduanya memiliki komunitas pengguna yang besar dan aktif. Namun, Python
memiliki komunitas yang lebih besar dan luas, sehingga lebih banyak sumber daya yang
tersedia untuk dipelajari.

© Sofyan Thayf, 2023 Page | 82


6. Kinerja: Python memiliki keunggulan dalam kinerja, terutama dalam hal memproses data
besar dan kompleks. Namun, R dapat bekerja lebih cepat dalam analisis data dan visualisasi
data.

Pilihan antara Python dan R tergantung pada kebutuhan dan preferensi individu. Jika fokus
utama adalah pada pengolahan data dan analisis statistik, R mungkin menjadi pilihan yang lebih
baik. Namun, jika fokus utama adalah pada pengembangan aplikasi web dan model machine
learning, Python mungkin menjadi pilihan yang lebih baik.

Strategi Data Saintis Pemula


Telah dipaparkan di awal bab ini, bahwa sangat penting bagi para ilmuwan data untuk
menguasai pemrograman komputer. Dengan menguasai pemrograman komputer, para ilmuwan
data dapat mengembangkan algoritma dan program yang dapat memproses data dengan lebih
efektif, menghasilkan model prediktif yang lebih akurat, serta memvisualisasikan data dengan
lebih jelas dan informatif.

Berikut adalah beberapa strategi yang bisa dipakai oleh data saintis pemula untuk mempelajari
pemrograman data sains:

1. Mulailah dengan bahasa pemrograman yang relatif mudah dipelajari, seperti Python atau R.
Kedua bahasa ini sangat populer di kalangan data saintis dan memiliki banyak sumber daya
belajar yang tersedia.
2. Pelajari dasar-dasar pemrograman, termasuk konsep seperti variabel, tipe data, loop, dan
fungsi. Memahami konsep-konsep ini sangat penting sebelum mempelajari bahasa
pemrograman tertentu.
3. Pelajari paket (libraries) khusus untuk pengolahan data dan analisis statistik, seperti NumPy
dan Pandas di Python, atau ggplot2 dan dplyr di R. Paket-paket ini akan membantu
memudahkan dan mempercepat proses pengolahan dan analisis data.
4. Mengikuti kursus online atau tutorial yang tersedia secara gratis, seperti di Coursera, edX,
atau Udacity. Kursus ini bisa membantu mempercepat pembelajaran dan memberikan
sertifikat yang dapat digunakan sebagai referensi saat melamar pekerjaan.
5. Praktekkan dan terapkan apa yang dipelajari dengan cara membuat project sederhana
seperti membuat grafik visualisasi data, analisis statistik sederhana, atau membangun model
machine learning sederhana. Hal ini akan membantu meningkatkan pemahaman dan
kemampuan dalam menggunakan bahasa pemrograman untuk pengolahan data dan
analisis statistik.
6. Ikuti komunitas data saintis dan forum online seperti Kaggle, GitHub, atau Stack Overflow.
Komunitas ini bisa membantu dalam belajar dan memecahkan masalah serta mendapatkan
referensi sumber belajar yang baik.
7. Baca buku tentang data sains dan pemrograman seperti Data Science from Scratch oleh Joel
Grus, Python for Data Analysis oleh Wes McKinney, atau R for Data Science oleh Hadley

© Sofyan Thayf, 2023 Page | 83


Wickham. Buku-buku ini dapat membantu mendapatkan pemahaman yang lebih mendalam
tentang pemrograman data sains.
8. Dengan strategi di atas, data saintis pemula dapat mempelajari pemrograman data sains
secara efektif dan efisien. Namun, yang paling penting adalah konsistensi dan dedikasi
dalam pembelajaran. Selalu berlatih dan mencoba hal-hal baru untuk terus
mengembangkan kemampuan dan meningkatkan pemahaman.

Referensi
Grolemund, G., & Wickham, H. (2017). R for Data Science: Import, Tidy, Transform, Visualize, and
Model Data. O'Reilly Media, Inc.

Hadley Wickham, ggplot2: Elegant Graphics for Data Analysis, Springer, 2009.

Hadley Wickham, R for Data Science, O'Reilly Media, 2017.

Jake VanderPlas, Python Data Science Handbook: Essential Tools for Working with Data, O'Reilly
Media, 2016.

John R. Hubbard, Programming for Mathematicians, Springer, 2014. ISBN: 978-3319054114

Kelleher, J. D., Tierney, B., & Tierney, B. (2018). Data science an introduction. Chapman and
Hall/CRC.

Kevin J. Walchko, Machine learning in Robotics: Intelligent Machines for the Future, Packt
Publishing, 2020.

Max Kuhn, Kjell Johnson, Applied Predictive Modeling, Springer, 2013.

McKinney, W., et al. (2011). "Data Structures for Statistical Computing in Python". Proceedings of
the 9th Python in Science Conference. 3.

R. L. Krutz and R. D. Vines, Cloud Security: A Comprehensive Guide to Secure Cloud Computing,
Wiley, 2010. ISBN: 978-0470589870

Robert Sedgewick, Kevin Wayne, Algorithms, Addison-Wesley Professional, 2011. ISBN: 978-
0321573513

W. Richard Stevens, Stephen A. Rago, Advanced Programming in the UNIX Environment,


Addison-Wesley Professional, 2013. ISBN: 978-0321637734

Wes McKinney, Python for Data Analysis: Data Wrangling with Pandas, NumPy, and IPython,
O'Reilly Media, 2012.

Yanchang Zhao, R and Data mining: Examples and Case Studies, Academic Press, 2012.

[Link]

[Link]

© Sofyan Thayf, 2023 Page | 84


© Sofyan Thayf, 2023 Page | 85

Common questions

Didukung oleh AI

Big data memerlukan strategi visualisasi data yang efektif untuk mendapatkan wawasan dari data yang kompleks dan beragam, mempermudah interpretasi informasi, dan menyederhanakan analisis data dalam skala besar . Visualisasi data membantu mengurangi beban mental dalam membedah data dan mendukung pengambilan keputusan yang berbasis data .

Model regresi dan analisis klaster merupakan dua teknik yang digunakan dalam data mining. Regresi fokus pada model prediktif untuk memprediksi nilai numerik berdasarkan variabel lain, sementara analisis klaster mengelompokkan data ke dalam kelompok berdasarkan kesamaan tertentu tanpa prediksi langsung . Keduanya digunakan untuk mendapatkan wawasan yang berbeda dari data dan dapat saling melengkapi dalam analisis yang lebih komprehensif .

Supervised learning menggunakan dataset yang sudah diberi label untuk melatih algoritma agar dapat memprediksi atau mengklasifikasikan data baru, sedangkan unsupervised learning bekerja dengan data yang tidak diberi label untuk menemukan pola atau struktur tersembunyi tanpa panduan manual .

Evaluasi model machine learning penting untuk memastikan akurasi dan efektivitas model sebelum diimplementasikan . Proses ini melibatkan pengujian dengan data yang belum pernah dilihat sebelumnya untuk menentukan kemampuan model dalam membuat prediksi yang akurat dan mendasar .

Pemilihan jenis visualisasi data harus mempertimbangkan tujuan visualisasi, jenis data yang akan ditampilkan, ukuran data, dan audiens yang akan melihat visualisasi . Hal ini memastikan bahwa pesan visual disampaikan dengan jelas dan efektif .

Labeling dalam visualisasi data adalah teknik untuk menambahkan informasi pada visualisasi, seperti judul, penjelasan sumbu, atau sumber data . Ini digunakan untuk memberikan konteks lebih baik kepada audiens, meningkatkan kejelasan, dan membantu pemahaman terhadap data yang ditampilkan .

Visualisasi data menyederhanakan kompleksitas data, meningkatkan pemahaman, dan membantu dalam pengambilan keputusan yang lebih cepat dan baik. Ini terjadi karena data dapat dilihat dengan cara yang lebih intuitif dan lebih mudah dipahami . Visualisasi data yang efektif juga dapat mengkomunikasikan hasil analisis kepada pemangku kepentingan untuk mendapatkan dukungan dan pengakuan .

Metode pengolahan big data, termasuk clustering, klasifikasi, regresi, dan analisis asosiasi, membantu perusahaan memahami tren, pola, dan perilaku dalam data . Informasi ini digunakan untuk meningkatkan efisiensi operasional dengan memperbaiki layanan pelanggan, meningkatkan kualitas produk, dan membuat keputusan bisnis lebih baik .

Data sains penting karena membantu perusahaan mengumpulkan dan menganalisis data besar dari berbagai sumber seperti media sosial, transaksi bisnis, dan sensor IoT untuk memahami perilaku pelanggan, tren pasar, dan meningkatkan efisiensi operasional . Dengan data sains, perusahaan dapat membuat keputusan lebih tepat waktu dan cerdas, mengoptimalkan operasi, meningkatkan produktivitas, serta mengurangi biaya .

Data mining dan machine learning saling melengkapi dalam analisis data. Data mining digunakan untuk mengidentifikasi pola tersembunyi dalam data besar dan kompleks, sementara machine learning sering digunakan dalam data mining untuk membangun model prediktif . Machine learning membantu meningkatkan akurasi prediksi dan optimalisasi model, sedangkan data mining melakukan ekstraksi pengetahuan berharga dari data .

Anda mungkin juga menyukai