Pengantar Data Sains: Oleh: Mohammad Sofyan S. Thayf
Pengantar Data Sains: Oleh: Mohammad Sofyan S. Thayf
Data sains, atau yang juga dikenal sebagai ilmu data atau data analytics, telah menjadi salah
satu bidang yang paling penting dalam dunia industri modern. Dalam era digital yang semakin
maju, banyak perusahaan dan organisasi telah mengumpulkan jumlah data yang besar dari
berbagai sumber, seperti media sosial, transaksi bisnis, sensor IoT (Internet of Thing), dan lain-
lain. Data ini sangat berharga bagi perusahaan karena dapat memberikan wawasan dan
pemahaman yang lebih dalam tentang perilaku pelanggan, tren pasar, dan efisiensi operasional.
Namun, jumlah data yang besar dan kompleks tersebut membutuhkan metode analisis yang
tepat agar bisa memberikan manfaat maksimal. Inilah peran penting dari data sains. Data sains
mencakup sejumlah teknik analisis statistik dan matematika, seperti machine learning, big data
analytics, dan data mining, yang dapat digunakan untuk menganalisis data dan mengekstrak
informasi yang berharga. Dengan menerapkan teknik ini, perusahaan dapat mengambil
keputusan yang lebih tepat waktu dan cerdas, mengoptimalkan operasional, meningkatkan
produktivitas, dan mengurangi biaya.
Oleh karena itu, penggunaan data sains telah menjadi suatu keharusan dalam dunia industri.
Perusahaan yang ingin tetap bersaing dan mengembangkan diri di pasar global harus dapat
memanfaatkan data mereka secara efektif. Selain itu, data sains juga telah menjadi karir yang
menjanjikan, dengan semakin banyaknya permintaan untuk profesional data sains yang terampil
dan terlatih.
Referensi ........................................................................................................................................................... 11
Referensi ........................................................................................................................................................... 19
Referensi ........................................................................................................................................................... 24
4. Dasar Statistika............................................................................................................................................... 26
Pemusatan Data.............................................................................................................................. 28
Referensi ........................................................................................................................................................... 36
Probabilitas ...................................................................................................................................................... 38
Referensi ........................................................................................................................................................... 41
6. Data Mining..................................................................................................................................................... 43
Referensi ........................................................................................................................................................... 49
Unsupervised learning.................................................................................................................. 53
Referensi ........................................................................................................................................................... 56
Pengertian Database.................................................................................................................................... 68
NoSQL ............................................................................................................................................................... 76
Referensi ........................................................................................................................................................... 77
Pemrograman R .............................................................................................................................. 81
Referensi ........................................................................................................................................................... 84
1. Menurut Inmon (2005), data sains adalah kumpulan data yang sangat besar, baik struktur
maupun tidak struktur, yang berasal dari berbagai sumber dan digunakan untuk membuat
analisis yang mendalam.
2. Menurut Anderson (2008), data sains adalah tentang mengeksplorasi data dan menggali
wawasan baru darinya, serta menemukan pola dan keterkaitan yang belum diketahui
sebelumnya.
3. Menurut Davenport dan Patil (2012), data sains melibatkan teknologi, matematika, dan
bisnis dalam menemukan, menafsirkan, dan mengkomunikasikan informasi yang terdapat
dalam data.
4. Menurut Wibowo (2018), data sains adalah proses pengumpulan, pengolahan, dan analisis
data yang bertujuan untuk menghasilkan informasi yang dapat digunakan untuk
pengambilan keputusan yang lebih baik.
5. Menurut Larose dan Larose (2019), data sains merupakan upaya untuk menggali
pengetahuan baru dan berguna dari data, termasuk cara-cara untuk memproses data,
menganalisisnya, dan menginterpretasikan hasilnya.
Dari pengertian-pengertian menurut para ahli di atas, dapat disimpulkan bahwa data sains
adalah proses pengumpulan, pengolahan, dan analisis data yang dilakukan untuk menghasilkan
informasi yang berguna dalam pemecahan masalah dan pengambilan keputusan di berbagai
bidang ilmu pengetahuan dan teknologi.
Di sisi lain, data sains adalah aplikasi pengolahan data dengan menggunakan metode-metode
matematika, statistika, dan teknik komputer untuk mendapatkan wawasan atau pemahaman
yang lebih dalam tentang data yang dihasilkan oleh berbagai sumber, baik itu dari sumber alami
maupun buatan manusia. Dalam konteks ini, data sains memberikan konteks pada data dengan
menyajikan informasi dan wawasan yang lebih dalam mengenai data tersebut. Data yang
dikumpulkan dan diproses dengan menggunakan metode-metode sains ini kemudian
Dengan penggunaan data sains, perusahaan dapat memperoleh pemahaman yang lebih baik
mengenai pelanggan, persaingan di pasar, preferensi dan perilaku pembelian, serta faktor-faktor
lain yang mempengaruhi bisnis mereka. Data sains juga memungkinkan perusahaan untuk
mengambil keputusan yang lebih baik, mengoptimalkan proses operasional mereka, dan
memprediksi perilaku pasar di masa depan. Oleh karena itu, penggunaan data sains sangat
penting bagi perusahaan modern dalam upaya meningkatkan keunggulan kompetitif mereka di
pasar.
Beberapa contoh penggunaan data sains dalam bisnis dan industri antara lain:
1. Analisis risiko keuangan: Dalam industri keuangan, data sains digunakan untuk memprediksi
risiko kredit dan risiko pasar, serta untuk memperbaiki kepatuhan terhadap peraturan.
2. Pengembangan produk: Data sains dapat membantu perusahaan untuk mengembangkan
produk baru atau memperbarui produk yang sudah ada dengan mempelajari preferensi
konsumen, permintaan pasar, dan analisis tren.
3. Peningkatan efisiensi produksi: Dalam industri manufaktur, data sains digunakan untuk
meningkatkan efisiensi produksi dengan mengoptimalkan rantai pasokan, memperbaiki
kualitas produk, dan mengurangi biaya operasional.
4. Pelayanan pelanggan: Data sains digunakan dalam industri layanan pelanggan untuk
memahami kebutuhan pelanggan dan meningkatkan kepuasan pelanggan.
5. Analisis risiko lingkungan: Dalam industri energi dan sumber daya alam, data sains
digunakan untuk mengidentifikasi risiko lingkungan dan mengembangkan strategi
keberlanjutan.
Beberapa contoh penerapan data sains pada beberapa perusahaan layanan yang dikenal
masyarakat, antara lain:
1. Netflix, merupakan salah satu platform streaming film dan serial TV yang paling populer di
dunia. Netflix menggunakan data sains untuk menganalisis perilaku penonton dan
menawarkan rekomendasi film dan acara TV yang dipersonalisasi untuk setiap pengguna.
Airbnb adalah salah satu perusahaan yang memanfaatkan data sains secara ekstensif dalam
pengambilan keputusan bisnis. Dalam beberapa tahun terakhir, Airbnb telah menginvestasikan
sumber daya yang signifikan dalam pengumpulan, pemrosesan, dan analisis data untuk
membantu mengembangkan strategi dan produk mereka. Contoh konkret dari penerapan data
sains pada Airbnb adalah:
Peran data sains dalam pengambilan keputusan bisnis Airbnb sangat penting dan merupakan
salah satu faktor yang memungkinkan Airbnb untuk bertahan dan tumbuh menjadi salah satu
perusahaan paling sukses di industri pariwisata dan perjalanan. Meskipun sempat mengalami
penurunan akibat pandemi COVID-19, tetapi AirBnb berhasil beradaptasi dan memperluas
layanannya untuk tetap bertahan. Saat ini, AirBnb menyediakan lebih dari 7 juta akomodasi di
1. Machine learning dan AI: Penggunaan teknologi machine learning dan kecerdasan buatan
semakin berkembang, dan memungkinkan organisasi untuk melakukan analisis data yang
lebih canggih dan kompleks.
2. Big data: Data semakin melimpah dan beragam, dan perusahaan perlu memiliki kemampuan
untuk mengelola, menganalisis, dan memanfaatkannya secara efektif.
3. Cloud computing: Cloud computing memungkinkan organisasi untuk menyimpan,
mengelola, dan menganalisis data secara lebih efisien dan efektif.
4. Data visualisasi: Visualisasi data semakin penting, karena memungkinkan pengambilan
keputusan yang lebih cepat dan tepat dengan memudahkan pemahaman atas data yang
kompleks.
5. Penggunaan data untuk keamanan siber: Data sains dapat digunakan untuk mengidentifikasi
dan mencegah ancaman keamanan siber, termasuk melindungi data dan infrastruktur
perusahaan.
6. Penggunaan data untuk kecerdasan bisnis: Data sains dapat membantu organisasi
memahami pelanggan dan pasar mereka dengan lebih baik, dan memungkinkan
pengambilan keputusan bisnis yang lebih baik dan tepat.
Tren penggunaan data sains saat ini juga semakin meningkat dengan semakin terjangkaunya
teknologi untuk mengumpulkan, menyimpan, dan menganalisis data. Perusahaan-perusahaan
besar seperti Google, Amazon, dan Facebook telah berinvestasi dalam bidang data sains untuk
membantu mereka mengumpulkan dan menganalisis data pelanggan mereka. Demikian pula,
banyak organisasi dan lembaga pemerintah juga memanfaatkan data sains untuk meningkatkan
keputusan dan kinerja mereka.
Data Saintis
Data scientist atau data saintis adalah profesional yang bertanggung jawab untuk mengekstrak
wawasan atau informasi yang berharga dari data yang tersedia. Mereka memiliki kemampuan
untuk menganalisis data, mengembangkan model matematika dan statistik, dan menggunakan
teknologi terbaru untuk mengatasi masalah bisnis dan keilmuan.
1. Mengumpulkan data dari berbagai sumber dan memprosesnya menjadi format yang dapat
digunakan untuk analisis.
2. Menganalisis data untuk mengidentifikasi pola, tren, dan anomali yang dapat memberikan
wawasan bisnis atau ilmiah.
3. Mengembangkan model statistik dan matematika untuk memprediksi hasil atau
mengoptimalkan proses.
4. Menggunakan teknologi terbaru seperti machine learning dan pemrosesan bahasa alami
untuk mengotomatisasi proses analisis dan meningkatkan efisiensi.
5. Menerapkan pengetahuan statistik, matematika, dan teknologi informasi untuk memecahkan
masalah yang kompleks.
Data scientist sering bekerja di berbagai sektor seperti bisnis, teknologi informasi, kesehatan,
pemerintahan, dan ilmu pengetahuan. Mereka harus memiliki keterampilan analisis yang kuat,
pemahaman yang baik tentang teknologi informasi dan pemodelan matematika, dan
kemampuan untuk berkomunikasi dengan jelas dan efektif dengan berbagai pemangku
kepentingan.
Referensi yang dapat digunakan untuk mempelajari lebih lanjut tentang data scientist atau data
saintis adalah buku-buku teks, artikel, dan kursus online di bidang analisis data, machine
learning, dan statistik.
Peran dan penghargaan terhadap data saintis juga terus berkembang seiring dengan kemajuan
teknologi dan semakin meningkatnya penggunaan data dalam berbagai bidang. Para data
saintis diakui sebagai aset yang sangat penting dalam organisasi dan perusahaan karena
kemampuan mereka untuk memanfaatkan data secara efektif dan efisien untuk mengambil
keputusan yang baik.
Karir data saintis saat ini sangat menjanjikan dan berkembang pesat seiring dengan
pertumbuhan besar-besaran data dalam berbagai sektor. Dalam beberapa tahun terakhir,
permintaan untuk data scientist telah meningkat pesat di berbagai industri, termasuk teknologi,
perbankan, kesehatan, pemerintahan, dan lainnya.
Menurut laporan McKinsey Global Institute, diperkirakan bahwa pada tahun 2024, AS akan
memiliki kekurangan sekitar 140.000 sampai 190.000 data scientist dan 1,5 juta manajer data
yang mampu menerapkan analisis data dalam pengambilan keputusan bisnis. Kekurangan ini
memberikan peluang besar bagi para profesional yang ingin membangun karir di bidang ini.
Banyak perusahaan saat ini mencari data scientist yang memiliki keahlian dalam analisis data,
pemodelan matematika, dan pemrograman, serta kemampuan untuk menghasilkan wawasan
bisnis dari data. Selain itu, data scientist juga harus memiliki kemampuan untuk berkomunikasi
dengan jelas dan efektif dengan berbagai pemangku kepentingan dalam organisasi.
Perkembangan teknologi dan inovasi terus mendorong pertumbuhan data scientist sebagai karir
yang penting dan menjanjikan. Terdapat juga berbagai jenjang karir yang dapat dijalani oleh
seorang data scientist, seperti data analyst, data engineer, data architect, data scientist lead,
data science manager, atau bahkan CDO (Chief Data Officer).
Beberapa penghargaan terkenal yang diberikan kepada data saintis di antaranya adalah
penghargaan Nobel dalam bidang ekonomi dan penghargaan Turing dalam bidang komputer.
Selain itu, para data saintis juga diakui dalam berbagai bidang lain seperti ilmu sosial,
kedokteran, keuangan, dan lain-lain.
Berikut adalah beberapa referensi yang dapat memberikan informasi lebih lanjut tentang
perkembangan karir data scientist saat ini:
Referensi
Anderson, C. (2008). The end of theory: The data deluge makes the scientific method obsolete.
Wired, 16(7), 16-07.
Chen, C. (2018). Data science in business and industry. Journal of Business Research, 88, 428-436.
Chen, H., Chiang, R. H., & Storey, V. C. (2012). Business intelligence and analytics: From big data
to big impact. MIS quarterly, 36(4), 1165-1188.
Davenport, T. H., & Patil, D. J. (2012). Data scientist: The sexiest job of the 21st century. Harvard
business review, 90(10), 70-76.
Inmon, W. H. (2005). Building the Data Warehouse. John Wiley & Sons.
Larose, D. T., & Larose, C. D. (2019). Discovering Knowledge in Data: An Introduction to Data
mining. John Wiley & Sons.
Marr, B. (2016). Big data: Using smart big data, analytics and metrics to make better decisions
and improve performance. John Wiley & Sons.
Provost, F., & Fawcett, T. (2013). Data science for business: what you need to know about data
mining and data-analytic thinking. O'Reilly Media, Inc.
Wibowo, A. (2018). Pengantar Data Science dan Machine learning. Elex Media Komputindo.
[Link]
[Link]
[Link]
science/
[Link]
[Link]
[Link]
[Link]
[Link]
1. Menurut Doug Laney (2001), yang merupakan seorang analis teknologi senior di Gartner,
Inc., Big data terdiri dari tiga dimensi, yaitu Volume, Velocity, dan Variety. Volume adalah
jumlah data yang sangat besar, Velocity adalah kecepatan pertumbuhan data, dan Variety
adalah beragamnya jenis data.
2. Menurut Viktor Mayer-Schönberger dan Kenneth Cukier (2013), Big data adalah istilah yang
digunakan untuk menggambarkan kumpulan data yang sangat besar dan kompleks yang
sulit dikelola dengan menggunakan perangkat lunak tradisional.
3. Menurut Mark van Rijmenam (2013), Big data adalah kumpulan data yang sangat besar,
kompleks, dan beragam yang memerlukan teknologi tinggi untuk dianalisis sehingga dapat
menghasilkan informasi dan wawasan yang bermanfaat.
4. Menurut Bernard Marr (2015), Big data adalah kumpulan data yang sangat besar dan
kompleks yang dapat digunakan untuk mengidentifikasi pola dan tren, dan memberikan
wawasan yang berharga untuk mendukung pengambilan keputusan bisnis.
5. Menurut SAS Institute Menurut SAS Institute (2012), perusahaan yang fokus pada software
analitik, Big data adalah istilah yang digunakan untuk mendeskripsikan kumpulan data yang
sangat besar yang memerlukan teknologi khusus untuk dianalisis, diproses, dan dipetakan
menjadi informasi yang berguna.
Sederhananya, big data adalah istilah yang merujuk pada volume besar data yang dihasilkan
oleh berbagai sumber seperti sensor, media sosial, transaksi bisnis, dan sebagainya. Data yang
dihasilkan bersifat heterogen, terstruktur maupun tidak terstruktur, serta membutuhkan alat dan
teknologi khusus untuk menganalisis dan mengolahnya. Karena volume dan kekompleksannya,
big data menuntut kemampuan komputasi yang kuat dan metode analisis data yang lebih
canggih.
1. Perangkat IoT (Internet of Things) yang terus bertambah: IoT merujuk pada jaringan
perangkat elektronik yang terhubung ke internet dan saling berkomunikasi satu sama lain.
Contohnya adalah kendaraan otonom, sensor lingkungan, perangkat medis, dan banyak lagi.
2. Perangkat mobile: Penggunaan smartphone dan tablet telah meningkat pesat dalam
beberapa tahun terakhir, sehingga banyak data yang dihasilkan dari penggunaan aplikasi,
panggilan, pesan teks, dan lainnya.
Big data memiliki lima karateristik yang disebut sebagai karakteristik 5V, yang melekat pada
data yang sangat besar dan kompleks. Kelima karakteristik tersebut adalah:
1. Volume: Merupakan karakteristik yang paling mendasar dari Big data, yaitu jumlah data
yang sangat besar dan terus bertambah secara eksponensial. Jumlah data ini bisa mencapai
petabyte atau bahkan exabyte.
2. Velocity: Karakteristik kecepatan, yaitu kemampuan untuk menghasilkan dan memproses
data secara cepat. Data dalam jumlah besar dapat diproduksi dengan kecepatan tinggi dari
berbagai sumber, seperti sensor, perangkat mobile, atau platform media sosial.
3. Variety: Karakteristik keragaman data, yaitu jenis data yang sangat beragam dari berbagai
sumber, baik terstruktur maupun tidak terstruktur. Data jenis ini dapat berupa teks, gambar,
video, audio, atau data terstruktur seperti database.
Big data memiliki peran penting dalam data sains karena volume, kecepatan, dan keragaman
data yang besar membuat data sains menjadi semakin kompleks dan sulit untuk dianalisis
dengan metode konvensional. Dengan memanfaatkan big data, para ilmuwan dan analis dapat
menggabungkan data dari berbagai sumber dan memprosesnya menggunakan teknologi yang
lebih canggih untuk mendapatkan wawasan yang lebih mendalam dan akurat.
Big data memungkinkan peneliti atau praktisi data sains untuk mengakses, menyimpan, dan
menganalisis data dalam jumlah yang sangat besar dan beragam. Hal ini memungkinkan mereka
untuk menemukan pola-pola yang mungkin tidak terlihat dengan menggunakan metode
analisis tradisional. Selain itu, big data juga memungkinkan pengembangan model prediktif
yang lebih akurat untuk memprediksi perilaku konsumen atau fenomena sosial yang kompleks.
Dalam konteks data sains, big data dapat membantu dalam berbagai hal, seperti:
1. Meningkatkan akurasi prediksi: Dengan mengumpulkan data yang lebih banyak dan
beragam, analis dapat meningkatkan akurasi prediksi yang dihasilkan oleh model data.
© Sofyan Thayf, 2023 Page | 15
2. Mendukung pengambilan keputusan: Big data dapat membantu dalam proses pengambilan
keputusan dengan memberikan wawasan yang lebih mendalam dan akurat tentang tren dan
pola yang terkait dengan suatu topik atau isu.
3. Menemukan korelasi yang tidak terlihat: Big data dapat membantu menemukan korelasi
antara data yang sebelumnya tidak terlihat, sehingga memberikan pemahaman yang lebih
baik tentang hubungan antara koleksi data yang ada
1. Data Terstruktur
Data terstruktur adalah data yang tersusun dalam format yang terorganisir dengan jelas dan
memiliki skema atau struktur yang ditentukan sebelumnya. Setiap elemen data dalam
struktur memiliki tipe data yang sama. Jenis data ini biasanya disimpan dalam format tabel
atau file relasional. Contoh data terstruktur termasuk data pelanggan, data produk, dan data
penjualan.
2. Data Tidak Terstruktur
Data tidak terstruktur adalah data yang tidak memiliki format atau struktur yang jelas. Data
ini seringkali berbentuk teks, gambar, suara, atau video, dan tidak memiliki skema atau
struktur yang tetap. Data ini sangat sulit untuk diproses secara otomatis tanpa alat atau
teknologi yang tepat. Contoh data tidak terstruktur meliputi email, tweet, posting media
sosial, dokumen teks, rekaman video, dan suara.
3. Data Semi Terstruktur
Data semi terstruktur adalah data yang memiliki karakteristik dari kedua jenis data
sebelumnya. Data ini memiliki struktur yang tidak konsisten, tidak teratur, dan memiliki
format yang bervariasi, namun juga memiliki beberapa elemen yang memiliki skema atau
struktur yang jelas. Contoh data semi terstruktur meliputi HTML, XML, JSON, dan dokumen
PDF.
Semakin besar keberagaman dan kompleksitas data, semakin sulit pula memproses data
tersebut. Oleh karena itu, data yang telah terstruktur secara baik dan sistematis lebih mudah
untuk dikelola dan diolah, sementara data yang tidak terstruktur memerlukan teknik khusus
untuk mengelolanya. Namun, data tidak terstruktur dapat memberikan informasi berharga yang
tidak dapat ditemukan pada data terstruktur, sehingga keduanya memiliki nilai penting dalam
analisis data.
Data yang tergolong sebagai big data dapat mencapai ratusan terabytes atau bahkan petabytes,
sehingga memerlukan sistem dan infrastruktur yang mampu menangani volume data yang
besar tersebut. Selain itu, big data seringkali terdiri dari beragam jenis data yang berasal dari
berbagai sumber, seperti data terstruktur dan tidak terstruktur, data streaming, data sosial
media, dan sebagainya, sehingga memerlukan teknologi khusus untuk mengintegrasikan dan
mengelola data tersebut. Selain itu, tools tersebut juga memungkinkan analisis data secara real-
time, analisis prediktif, dan visualisasi data yang kompleks. Dengan demikian, tools khusus untuk
big data sangat penting untuk mempermudah pengelolaan, analisis, dan ekstraksi informasi
yang berharga dari big data.
1. Apache Hadoop
Apache Hadoop adalah platform open-source yang digunakan untuk menyimpan dan mengolah
big data. Hadoop terdiri dari dua komponen utama yaitu Hadoop Distributed File System (HDFS)
dan MapReduce. Hadoop dapat digunakan untuk mengolah data yang sangat besar dengan
kecepatan yang cukup tinggi.
2. Apache Spark
Apache Spark adalah platform open-source yang digunakan untuk mengolah big data secara
real-time. Spark dapat digunakan untuk melakukan pemrosesan data secara streaming, analisis
data, dan machine learning.
3. NoSQL databases
NoSQL databases adalah teknologi database yang dirancang untuk mengelola data yang sangat
besar dan kompleks. Beberapa contoh NoSQL databases adalah MongoDB, Cassandra, dan
Couchbase.
4. Apache Kafka
Apache Kafka adalah platform open-source yang digunakan untuk mengirim dan menerima
data secara real-time. Kafka dapat digunakan untuk menghubungkan berbagai sistem dan
aplikasi yang terpisah dan mengirim data secara cepat dan efisien.
5. TensorFlow
TensorFlow adalah platform open-source yang digunakan untuk melakukan analisis data dan
machine learning. TensorFlow dapat digunakan untuk membuat model machine learning yang
kompleks dan digunakan dalam berbagai aplikasi.
1. Keamanan Data: Dalam lingkungan big data, jumlah data yang dihasilkan sangat besar dan
terus meningkat. Hal ini mengakibatkan risiko keamanan data yang lebih besar, seperti
kerentanan terhadap peretasan, pencurian data dan serangan siber.
Referensi
Katal, A., Wazid, M., & Goudar, R. H. (2013). Big data: Issues, challenges, tools and good
practices. In Contemporary Computing (pp. 404-417). Springer.
Lakshman, A., & Malik, P. (2010). Cassandra: a decentralized structured storage system. ACM
SIGOPS Operating Systems Review, 44(2), 35-40.
Laney, D. (2001). 3D Data Management: Controlling Data Volume, Velocity, and Variety. Gartner.
Manyika, J., Chui, M., Brown, B., Bughin, J., Dobbs, R., Roxburgh, C., & Byers, A. H. (2011). Big
data: The next frontier for innovation, competition, and productivity. McKinsey Global Institute.
Marr, B. (2015). Big data: Using Smart Big data, Analytics and Metrics to Make Better Decisions
and Improve Performance. John Wiley & Sons.
Mayer-Schönberger, V., & Cukier, K. (2013). Big data: A Revolution That Will Transform How We
Live, Work, and Think. Houghton Mifflin Harcourt.
Olston, C., Reed, B., Srivastava, U., Kumar, R., & Tomkins, A. (2008). Pig latin: a not-so-foreign
language for data processing. Proceedings of the 2008 ACM SIGMOD international conference
on Management of data, 1099-1110.
Panigrahi, S., & Sahu, S. (2017). Big data Analytics with R and Hadoop. Auerbach Publications.
SAS Institute Inc. (2012). Big data Analytics. SAS Institute Inc.
Thusoo, A., Sarma, J. S., Jain, N., Shao, Z., Chakka, P., Anthony, S., ... & Murthy, R. (2009). Hive: a
warehousing solution over a map-reduce framework. Proceedings of the VLDB Endowment, 2(2),
1626-1629.
Van Rijmenam, M. (2013). Think Bigger: Developing a Successful Big data Strategy for Your
Business. AMACOM.
Zaharia, M., Chowdhury, M., Franklin, M. J., Shenker, S., & Stoica, I. (2010). Spark: Cluster
computing with working sets. HotCloud, 10(10-10), 95.
Zikopoulos, P., Eaton, C., deRoos, D., Deutsch, T., & Lapis, G. (2011). Understanding Big data:
Analytics for Enterprise Class Hadoop and Streaming Data. McGraw Hill Professional.
TensorFlow: [Link]
1. Identifikasi masalah atau pertanyaan yang ingin dijawab: Tujuan utama dari pengumpulan
dan analisis data adalah untuk menyelesaikan suatu masalah atau menjawab suatu
pertanyaan yang berhubungan dengan bidang tertentu. Pertanyaan penelitian adalah kunci
untuk memperoleh wawasan yang berharga dari data. Pertanyaan penelitian dalam data
sains mengarahkan analisis data dan membantu mengidentifikasi pola dan tren yang
tersembunyi dalam data. Penting untuk menetapkan pertanyaan penelitian yang jelas dan
terfokus dalam data sains, karena ini dapat membantu menghindari kebingungan dan
kehilangan fokus dalam analisis data. Sebagai contoh, pertanyaan penelitian dalam data
sains mungkin termasuk:
1. Bagaimana pengaruh variabel X terhadap variabel Y?
2. Apakah ada pola atau tren yang tersembunyi dalam data?
3. Bagaimana cara mengoptimalkan hasil dalam kasus A atau B?
4. Bagaimana memprediksi hasil berdasarkan variabel tertentu?
2. Pengumpulan data: Pengumpulan data adalah proses pengumpulan informasi yang relevan
dan dapat digunakan untuk menjawab pertanyaan penelitian dalam data sains, data dapat
dikumpulkan dari berbagai sumber, termasuk database, survei, sensor, dan sumber data
lainnya.
Dalam beberapa kasus, pengumpulan data dapat terus dilakukan sebagai bagian dari proses
pengambilan keputusan bisnis yang kontinu. Dalam pengumpulan data, penting untuk
memastikan bahwa data yang dikumpulkan akurat, relevan, dan terkini. Selain itu, data yang
dikumpulkan harus disimpan dengan aman dan terorganisir sehingga dapat diakses dan
dianalisis dengan mudah.
3. Data Pre-processing: Langkah ini melibatkan pembersihan data, transformasi data,
penghilangan duplikat, dan penghapusan data yang tidak relevan atau salah. Proses data
pre-processing merupakan tahap penting dalam analisis data, karena memastikan data yang
digunakan untuk analisis berkualitas dan akurat. Tanpa melakukan preprocessing, data yang
digunakan untuk analisis mungkin tidak akurat atau tidak lengkap, dan ini dapat
mempengaruhi hasil analisis dan kesimpulan yang diambil dari data. Dengan melakukan
data preprocessing yang benar, analisis data dapat menghasilkan hasil yang lebih akurat dan
berguna.
1. Survei, merupakan salah satu metode yang paling umum digunakan dalam pengumpulan
data. Metode ini melibatkan penggunaan kuesioner atau wawancara untuk mengumpulkan
data dari responden.
2. Observasi, melibatkan pengamatan langsung terhadap suatu fenomena atau perilaku yang
diamati. Metode ini dapat dilakukan dengan cara terstruktur atau tidak terstruktur.
3. Studi kasus, melibatkan analisis mendalam terhadap satu atau beberapa kasus untuk
memahami fenomena atau masalah tertentu.
4. Eksperimen, melibatkan manipulasi variabel tertentu untuk melihat bagaimana itu
mempengaruhi variabel lain. Metode ini umumnya digunakan dalam penelitian ilmiah.
5. Analisis data sekunder, metode ini melibatkan penggunaan data yang sudah ada untuk
menjawab pertanyaan atau memecahkan masalah tertentu. Data sekunder dapat berasal dari
sumber seperti publikasi, catatan, atau database.
Dalam beberapa kasus, pengumpulan data dapat terus dilakukan sebagai bagian dari proses
pengambilan keputusan bisnis yang kontinu. Dalam pengumpulan data, penting untuk
memastikan bahwa data yang dikumpulkan akurat, relevan, dan terkini. Selain itu, data yang
dikumpulkan harus disimpan dengan aman dan terorganisir sehingga dapat diakses dan
dianalisis dengan mudah.
Proses data cleaning dan preprocessing terdiri dari beberapa tahap, di antaranya:
1. Integration: Tahap ini adalah proses penggabungan beberapa data dari sumber yang
berbeda menjadi satu dataset yang terintegrasi. Hal ini dilakukan untuk memastikan bahwa
data yang digunakan dalam analisis benar-benar representatif dan lengkap.
2. Cleaning: Tahap ini adalah proses membersihkan data dari nilai yang tidak valid, outlier, atau
duplikasi. Hal ini dilakukan untuk memastikan bahwa data yang digunakan dalam analisis
akurat dan relevan.
3. Transformation: Tahap ini adalah proses mengubah format data menjadi format yang lebih
mudah untuk diproses. Contohnya adalah mengubah format tanggal dari teks menjadi
bentuk tanggal yang dapat diproses oleh program.
4. Reduction: Tahap ini adalah proses mengurangi jumlah data menjadi jumlah yang lebih kecil
tetapi tetap mewakili data yang asli. Hal ini dilakukan untuk mempercepat proses analisis.
5. Discretization: Mengubah data kontinu menjadi diskrit dengan menggunakan teknik seperti
binning dimana data kontinu yang memiliki rentang nilai yang besar dipecah menjadi
beberapa interval yang lebih kecil atau kategori dengan rentang nilai yang lebih kecil.
Setelah proses data cleaning dan preprocessing selesai dilakukan, data siap untuk digunakan
dalam proses analisis lebih lanjut.
Explorasi Data
Explorasi data adalah tahap melakukan proses analisis data yang bertujuan untuk mengerti dan
memahami karakteristik data, termasuk di dalamnya menemukan pola atau relasi yang
tersembunyi di dalam data. Explorasi data juga membantu dalam mengidentifikasi data yang
kurang lengkap, tidak akurat atau tidak relevan, sehingga memudahkan dalam pengambilan
keputusan.
Proses explorasi data dilakukan dengan memanfaatkan teknik dan metode statistik, visualisasi
data, dan teknik-teknik data mining seperti clustering dan association rule mining.
Beberapa langkah umum dalam proses explorasi data adalah sebagai berikut:
Beberapa metode yang umum digunakan dalam explorasi data antara lain:
1. Statistik deskriptif: Metode ini digunakan untuk menggambarkan data secara numerik.
Beberapa statistik deskriptif yang umum digunakan antara lain rata-rata, median, modus,
deviasi standar, kuartil, dan persentil.
2. Visualisasi data: Metode ini digunakan untuk menampilkan data dalam bentuk grafik atau
diagram, sehingga memudahkan pemahaman dan interpretasi data. Beberapa jenis
visualisasi data yang umum digunakan antara lain histogram, box plot, scatter plot, line chart,
dan heat map.
3. Clustering: Metode ini digunakan untuk mengelompokkan data berdasarkan kemiripan fitur
atau atribut. Beberapa teknik clustering yang umum digunakan antara lain k-means,
hierarchical clustering, dan density-based clustering.
4. Association rule mining: Metode ini digunakan untuk menemukan hubungan atau pola
tersembunyi dalam data. Beberapa teknik association rule mining yang umum digunakan
antara lain Apriori dan FP-Growth.
5. Text mining: Metode ini digunakan untuk menganalisis data berupa teks, seperti dokumen
atau tweet. Beberapa teknik text mining yang umum digunakan antara lain sentiment
analysis, topic modeling, dan named entity recognition.
Referensi
Babbie, E. R. (2010). The practice of social research. Belmont, CA: Wadsworth.
Fraenkel, J. R., Wallen, N. E., & Hyun, H. H. (2012). How to design and evaluate research in
education. New York: McGraw-Hill.
Han, J., Kamber, M., & Pei, J. (2012). Data mining: concepts and techniques. Elsevier.
Hastie, T., Tibshirani, R., & Friedman, J. (2009). The Elements of Statistical Learning: Data mining,
Inference, and Prediction (2nd ed.). Springer.
Jain, R., & Dubey, V. N. (2016). Data preprocessing in data mining. Handbook of statistics, 35,
163-178.
Provost, F., & Fawcett, T. (2013). Data science for business: What you need to know about data
mining and data-analytic thinking. O'Reilly Media, Inc.
VanderPlas, J. (2016). Python data science handbook: Essential tools for working with data.
O'Reilly Media, Inc.
Witten, I. H., Frank, E., & Hall, M. A. (2016). Data mining: practical machine learning tools and
techniques. Morgan Kaufmann.
Konsep Statistika
Statistik deskriptif adalah metode statistik yang digunakan untuk menggambarkan dan
merangkum data secara statistik. Statistik deskriptif digunakan untuk memberikan gambaran
umum tentang pola dan karakteristik data dengan menggambarkan data secara numerik atau
grafis. Dengan menggunakan statistik deskriptif, kita dapat menganalisis data secara sederhana
dan mudah dimengerti, yang kemudian dapat membantu kita dalam mengambil keputusan.
Statistik Deskriptif
Statistik deskriptif adalah metode statistik yang digunakan untuk menggambarkan dan
merangkum data secara statistik. Statistik deskriptif digunakan untuk memberikan gambaran
umum tentang pola dan karakteristik data dengan menggambarkan data secara numerik atau
grafis. Dengan menggunakan statistik deskriptif, kita dapat menganalisis data secara sederhana
dan mudah dimengerti, yang kemudian dapat membantu kita dalam mengambil keputusan.
Statistik deskriptif memiliki peran penting dalam data sains karena memungkinkan kita untuk
memahami data dengan lebih baik. Dalam praktiknya, statistik deskriptif digunakan untuk
memberikan ringkasan tentang data yang kita miliki, seperti nilai rata-rata, median, modus,
deviasi standar, dan lain sebagainya. Dengan memahami statistik deskriptif, kita dapat
memahami karakteristik data kita secara lebih rinci dan membuat keputusan yang lebih tepat.
Dalam pengolahan data, statistik deskriptif sering digunakan untuk melakukan analisis
eksploratif. Misalnya, ketika kita memulai sebuah proyek data, kita mungkin ingin melakukan
analisis deskriptif pada dataset yang kita miliki untuk mendapatkan pemahaman yang lebih baik
tentang variabel-variabel yang ada di dalamnya. Dengan menggunakan statistik deskriptif, kita
dapat mengidentifikasi nilai-nilai ekstrem, melihat persebaran variabel, menentukan korelasi
antara variabel, dan sebagainya.
Statistik Inferensi
Cabang lain dari ilmu statistik adalah statistik inferensi dimana statistik inferensi adalah metode
untuk menyimpulkan atau membuat generalisasi tentang populasi berdasarkan data yang
diperoleh dari sampel. Statistik inferensi digunakan untuk membuat prediksi, menguji hipotesis,
dan mengevaluasi apakah suatu hasil signifikan secara statistik, sementara statistik deskriptif
hanya memberikan gambaran tentang data yang ada, tanpa menyimpulkan apapun tentang
populasi yang lebih besar. Kedua jenis statistik ini sangat penting dalam data sains, dan
seringkali digunakan bersama-sama untuk mendapatkan pemahaman yang lebih lengkap
tentang data dan informasi yang tersedia.
Dalam statistik inferensi, kita dapat menguji hipotesis atau membuat perkiraan tentang
karakteristik populasi. Sebagai contoh, kita dapat menggunakan statistik inferensi untuk menguji
apakah terdapat perbedaan yang signifikan antara dua kelompok atau untuk membuat
perkiraan tentang rata-rata penghasilan penduduk di suatu negara.
Terdapat beberapa metode yang umum digunakan untuk mengambil kesimpulan dari sampel
terhadap populasi. Berikut adalah beberapa di antaranya:
1. Confidence interval (Interval kepercayaan): merupakan rentang nilai yang diberikan untuk
suatu parameter populasi dengan tingkat kepercayaan tertentu. Metode ini digunakan untuk
menentukan seberapa akurat suatu sampel dalam menggambarkan populasi.
2. Hypothesis testing (Uji hipotesis): merupakan prosedur yang digunakan untuk menentukan
apakah ada perbedaan yang signifikan antara sampel dan populasi. Metode ini dilakukan
dengan membuat suatu hipotesis nol (null hypothesis) dan hipotesis alternatif (alternative
hypothesis), kemudian menguji kebenaran dari hipotesis nol tersebut.
3. Regression analysis (Analisis regresi): merupakan metode yang digunakan untuk
menentukan hubungan antara satu atau beberapa variabel independen dengan variabel
Pemusatan Data
1. Mean (rata-rata): Mean adalah nilai tengah dari data, dan diperoleh dengan menjumlahkan
semua data dan kemudian membaginya dengan jumlah data. Mean digunakan sebagai
pengukur pemusatan data ketika data memiliki distribusi normal atau hampir normal.
dimana m = mean
Contoh:
Data: 20, 21, 22, 23, 24, 25, 26, 27, 28 (9 data)
Mean = (20+21+22+23+24+25+26+27+28) / 9 = 24
2. Median: Median adalah nilai tengah dari data ketika data diurutkan dari yang terkecil hingga
yang terbesar. Median digunakan sebagai pengukur pemusatan data ketika data memiliki
distribusi yang asimetris atau memiliki nilai ekstrem yang signifikan.
Contoh:
Data: 20, 21, 22, 23, 24, 25, 26, 27, 28
Median = 24
Dalam contoh dengan data yang sama, nilai mean dan median terihat sama, tetapi perlu
diingat bahwa mean tidak selalu sama dengan median. Mean (rata-rata) dihitung dengan
menjumlahkan semua data dan kemudian membagi jumlah tersebut dengan banyaknya
data. Sedangkan median adalah nilai tengah dari data yang telah diurutkan.
3. Modus: Modus adalah nilai yang paling sering muncul dalam sebuah kumpulan data.
Contoh penggunaan modus adalah pada saat menghitung tinggi badan murid di sebuah
kelas, dimana kita ingin mengetahui tinggi badan yang paling sering dimiliki oleh murid-
murid di kelas tersebut.
Misalkan data tinggi badan siswa di kelas tersebut adalah sebagai berikut:
160, 155, 165, 170, 165, 160, 165, 158, 165, 170
Maka, modus dari data tersebut adalah 165, karena angka 165 muncul paling sering
4. Kuartil: Kuartil merupakan titik yang membagi data ke dalam empat bagian yang sama
besar. Kuartil pertama atau Q1 membagi data menjadi 25% terbawah, kuartil kedua atau Q2
membagi data menjadi 50% atau median, dan kuartil ketiga atau Q3 membagi data menjadi
75% teratas.
Berikut contoh perhitungan kuartil dengan data sederhana:
Data = 1, 3, 4, 6, 7, 9, 10, 11, 13, 15
2. Q2: menghitung nilai yang berada di posisi ke-50% data atau median, maka:
Median = (nilai ke-5 + nilai ke-6)/2 = (9+10)/2 = 9,5
Penyebaran Data
1. Jangkauan (range): Jangkauan adalah selisih antara nilai maksimum dan nilai minimum
dalam data. Jangkauan digunakan sebagai pengukur penyebaran data yang sederhana
namun rentan terhadap nilai ekstrem yang signifikan.
Contoh:
Data: 20, 21, 22, 23, 24, 25, 26, 27, 28 (9 data)
Range = 28-20 = 8
2. Simpangan baku (standard deviation): Simpangan baku adalah pengukuran yang mengukur
seberapa jauh data tersebar dari rata-ratanya. Simpangan baku digunakan sebagai pengukur
penyebaran data yang paling umum dan dapat digunakan pada distribusi normal atau tidak
normal. Simpangan baku dihitung dengan cara menghitung selisih antara setiap data
dengan rata-rata, kemudian mengkuadratkannya, menjumlahkan hasilnya, kemudian dibagi
dengan jumlah data dikurangi 1, dan akar kuadrat dari hasilnya.
dimana:
= simpangan baku
N = jumlah data
xi = nilai data
µ = mean
3. Varians: Varians adalah pengukuran yang mengukur seberapa jauh data tersebar dari rata-
ratanya dengan cara menghitung rata-rata perbedaan kuadrat antara setiap nilai data dan
nilai rata-ratanya. Varians adalah ukuran yang digunakan untuk mengukur variabilitas data
dalam sampel.
1. Hitung nilai rata-rata dari data, yaitu dengan menjumlahkan semua nilai dan
membaginya dengan jumlah data:
(5 + 6 + 7 + 8 + 9 + 10) / 6 = 7.5
Jadi, rata-rata nilai ujian matematika siswa tersebut adalah 7.5.
2. Hitung selisih antara setiap nilai dan rata-rata, lalu kuadratkan hasilnya:
(5 - 7.5)2 = 6.25
(6 - 7.5)2 = 2.25
(7 - 7.5)2 = 0.25
(8 - 7.5)2 = 0.25
(9 - 7.5)2 = 2.25
(10 - 7.5)2 = 6.25
4. Hitung varians dengan cara membagi hasil penjumlahan kuadrat selisih tersebut dengan
jumlah data:
17.5 / 6 = 2.92
Misalkan kita memiliki data sebagai berikut: 2, 5, 7, 8, 10, 12, 15, 18, 20, 25
Langkah-langkah perhitungan rentang antar kuartil:
Q1 = 6.5
Q3 = 18
Q3 - Q1 = 18 - 6.5 = 11.5
Skewness dan Kurtosis adalah ukuran statistik yang digunakan untuk menggambarkan bentuk
distribusi data. Skewness mengukur seberapa simetris atau tidak simetris distribusi data,
sedangkan kurtosis mengukur seberapa tajam atau rata distribusi data. Skewness dan kurtosis
sering digunakan dalam analisis data untuk memahami bagaimana data tersebar dan apakah
terdapat anomali dalam data tersebut. Oleh karena itu, kedua ukuran ini dapat membantu
dalam pengambilan keputusan di berbagai bidang seperti bisnis, keuangan, kesehatan, dan lain
sebagainya.
Skewness mengukur seberapa simetris atau tidak simetris distribusi data terhadap nilai tengah
(mean atau median). Jika skewness bernilai nol, maka distribusi data dianggap simetris,
sedangkan jika skewness bernilai positif, maka distribusi data cenderung lebih condong ke kanan
(lebih banyak nilai yang besar), dan jika skewness bernilai negatif, maka distribusi data
cenderung lebih condong ke kiri (lebih banyak nilai yang kecil).
Dalam data sains, skewness dapat digunakan untuk memahami distribusi data dan melihat
apakah data cenderung condong ke kiri (negatif skewness), normal, atau condong ke kanan
(positif skewness). Hal ini dapat membantu dalam pemilihan model statistik dan dalam
mengambil keputusan bisnis.
Sebagai contoh, dalam analisis harga rumah, skewness dapat membantu dalam memahami
distribusi harga rumah dan melihat apakah harga cenderung lebih tinggi atau lebih rendah dari
rata-rata. Jika distribusi harga cenderung skewness negatif, maka dapat dikatakan bahwa harga
rumah lebih banyak yang rendah daripada yang tinggi. Sebaliknya, jika distribusi harga
cenderung skewness positif, maka dapat dikatakan bahwa harga rumah lebih banyak yang tinggi
daripada yang rendah.
Dengan demikian, skewness memiliki peran yang penting dalam analisis data sains untuk
memahami distribusi data dan membantu dalam pengambilan keputusan.
di mana:
Xi = nilai data ke-i
N = jumlah data
X̅ = mean data
= simpangan baku data
Nilai skewness dapat berada dalam rentang -3 hingga 3. Nilai skewness sebesar nol
menunjukkan distribusi data simetris, sedangkan nilai skewness positif menunjukkan distribusi
data condong ke kanan dan nilai skewness negatif menunjukkan distribusi data condong ke kiri.
Kurtosis adalah suatu ukuran yang digunakan untuk mengukur tinggi rendahnya puncak kurva
distribusi data yang sedang diobservasi, dibandingkan dengan kurva normal (disebut distribusi
normal atau Gaussian). Konsep ini sering digunakan dalam statistik untuk menggambarkan
Jika nilai kurtosis adalah 0, maka distribusi data dianggap normal. Jika nilai kurtosis lebih kecil
dari 0, maka distribusi data dianggap rata dan distribusi data tersebut memiliki nilai-nilai yang
lebih terdistribusi pada bagian ekor distribusi. Jika nilai kurtosis lebih besar dari 0, maka
distribusi data dianggap tajam dan distribusi data tersebut memiliki nilai-nilai yang lebih
terdistribusi pada bagian puncak atau pusat distribusi.
di mana:
Kurt = Kurtosis
µ4 = momen keempat dari data
4 = simpangan baku data
Nilai kurtosis dihitung dengan menghitung momen keempat dari data dan membaginya dengan
kuadrat simpangan baku. Jika nilai kurtosis sama dengan 3, artinya distribusi data tersebut
adalah distribusi normal. Jika nilai kurtosis lebih besar dari 3, maka distribusi data tersebut lebih
tinggi dan lebih berat ekornya dibandingkan dengan distribusi normal (disebut leptokurtik),
sedangkan jika nilai kurtosis kurang dari 3, maka distribusi data tersebut memiliki puncak yang
lebih rendah dan ekor yang lebih ringan dibandingkan dengan distribusi normal (disebut
platykurtik).
Contoh kurtosis pada data sederhana: misalkan terdapat sebuah dataset yang berisi nilai-nilai: 2,
4, 5, 6, 7, 8, 10. Jika dihitung menggunakan rumus, maka akan diperoleh nilai kurtosis sebesar -
0.68, yang menunjukkan bahwa distribusi data tersebut lebih rendah puncaknya dan lebih
ringan ekornya dibandingkan dengan distribusi normal.
Momen keempat adalah salah satu ukuran statistik yang mengukur kurtosis atau tingkat
kecuraman distribusi suatu data. Momen keempat dikenal juga sebagai kurtosis tingkat
keempat, dan dihitung dengan cara menghitung perbedaan antara kuadrat skewness dan tiga
kali kuadrat deviasi standar, kemudian membaginya dengan kuadrat varians.
di mana:
Jika momen keempat positif, maka distribusi data memiliki puncak yang lebih tajam (leptokurtik)
daripada distribusi normal. Sebaliknya, jika momen keempat negatif, maka distribusi data lebih
datar (platykurtik) daripada distribusi normal.
Grafik dapat digunakan untuk menggambarkan berbagai jenis data, seperti data kategorikal dan
data numerik. Contoh grafik yang umum digunakan meliputi diagram batang, diagram
lingkaran, diagram garis, dan scatter plot. Grafik dapat membantu pengguna untuk memahami
hubungan antara variabel dan memvisualisasikan data dengan cara yang mudah dipahami.
Histogram adalah grafik yang menunjukkan distribusi frekuensi dari suatu data numerik.
Biasanya data numerik dikelompokkan ke dalam beberapa interval, yang kemudian dihitung
frekuensi munculnya data dalam masing-masing interval. Kemudian, interval ditampilkan pada
sumbu horizontal dan frekuensi ditampilkan pada sumbu vertikal, dan ditunjukkan sebagai
balok-balok yang saling bersebelahan. Histogram sangat berguna untuk memahami distribusi
data dan melihat apakah ada kecondongan atau pola dalam data.
Sebagai contoh, pada gambar menunjukkan distribusi frekwensi dari data nilai ujian dari 20
siswa (A-T), dan histogram dibuat dengan pengelompokan range nilai siswa
Sumber: [Link]
Grafik memiliki peranan penting dalam analisis data sains karena dapat membantu dalam
memvisualisasikan dan memahami pola data. Dengan melihat grafik, kita dapat mengidentifikasi
pola data yang mungkin tidak terlihat dari sekadar melihat tabel atau angka-angka data mentah.
Grafik juga dapat membantu kita mengidentifikasi anomali atau nilai yang tidak biasa dalam
data. Selain itu, grafik juga dapat membantu dalam mengkomunikasikan hasil analisis secara
efektif kepada orang lain, seperti dalam presentasi atau laporan.
Referensi
Agresti, A., & Finlay, B. (2008). Statistical methods for the social sciences. Pearson.
De Veaux, R. D., Velleman, P. F., & Bock, D. E. (2009). Stats: Data and Models (3rd ed.). Pearson.
Groebner, D. F., Shannon, P. W., & Fry, P. C. (2018). Business statistics: A decision-making
approach. Pearson.
James, G., Witten, D., Hastie, T., & Tibshirani, R. (2013). An introduction to statistical learning
(Vol. 112). New York: Springer.
Kutner, M. H., Nachtsheim, C. J., Neter, J., and Li, W. (2004). Applied Linear Statistical Models (5th
ed.). McGraw-Hill.
McClave, J. T., Benson, P. G., & Sincich, T. (2014). Statistics for Business and Economics. Pearson.
Montgomery, D.C., Peck, E.A., and Vining, G.G. (2012). Introduction to Linear Regression Analysis
(5th ed.). John Wiley & Sons, Inc.
P. Bruce and A. Bruce, Practical Statistics for Data Scientists: 50 Essential Concepts, 1st ed.
O'Reilly Media, Inc., 2017.
PennState Eberly College of Science. (n.d.). Inferential Statistics. Diakses pada 9 Februari 2023,
dari [Link]
Ross, S.M. (2010). Introduction to Probability and Statistics for Engineers and Scientists, Fourth
Edition. Wiley
Stevens, J. P. (2009). Applied Multivariate Statistics for the Social Sciences (5th ed.). Routledge.
Tufte, E. R. (2001). The visual display of quantitative information. Cheshire, CT: Graphics Press.
Utami, H., & Pujilestari, Y. (2019). Statistika inferensial dan deskriptif dengan aplikasi SPSS.
Yogyakarta: Deepublish.
Walpole, R. E., Myers, R. H., Myers, S. L., & Ye, K. (2011). Probability & statistics for engineers &
scientists (9th ed.). Boston: Pearson.
Wickham, H. (2016). ggplot2: Elegant Graphics for Data Analysis. Springer International
Publishing.
Dalam analisis data, uncertainty sering kali timbul karena adanya ketidakpastian dalam data
atau karena adanya faktor-faktor yang tidak dapat diukur yang memengaruhi hasil analisis.
Untuk mengatasi ketidakpastian ini, berbagai teknik seperti pengujian hipotesis dan analisis
sensitivitas dapat digunakan untuk mengukur tingkat ketidakpastian dan memperkirakan
seberapa akurat hasil analisis.
Model-model dalam kasus yang bersifat certainty adalah model yang digunakan untuk
memprediksi hasil yang pasti atau hampir pasti terjadi. Beberapa model yang umum digunakan
dalam kasus ini antara lain: regresi Linier, regresi logistik, klasifikasi
Dalam kasus yang bersifat uncertainty , terdapat beberapa model yang dapat digunakan dalam
data sains, di antaranya: model regresi, probabilitas, klasifikasi, clustering, dan ascociation
Probabilitas
Model probabilitas adalah suatu teknik statistik yang digunakan untuk memodelkan fenomena
yang tidak pasti. Model ini didasarkan pada teori probabilitas, di mana kejadian acak memiliki
probabilitas tertentu yang terkait dengan setiap nilai yang mungkin. Model probabilitas banyak
digunakan dalam berbagai bidang, termasuk ilmu pengetahuan, teknik, bisnis, dan keuangan.
Prinsip kerja model probabilitas didasarkan pada aturan probabilitas, yaitu sebuah metode
matematika yang digunakan untuk mengukur kemungkinan terjadinya suatu kejadian.
Model probabilitas biasanya menggunakan data yang dikumpulkan dari observasi atau
eksperimen yang telah dilakukan sebelumnya. Dari data tersebut, model probabilitas akan
mengekstrak informasi mengenai karakteristik data dan pola yang terdapat di dalamnya.
Kemudian, model probabilitas akan menggunakan informasi tersebut untuk menghasilkan
Probabilitas dapat digunakan untuk mengukur tingkat kepastian dalam suatu kejadian atau
situasi. Apabila probabilitas suatu kejadian adalah 1, maka kejadian tersebut pasti terjadi atau
termasuk dalam certainty . Sebaliknya, jika probabilitas suatu kejadian adalah 0, maka kejadian
tersebut pasti tidak terjadi atau termasuk dalam certainty .
Namun, pada umumnya kejadian atau situasi yang terjadi di dunia nyata tidak selalu dapat
dipastikan dengan tingkat kepastian yang tinggi. Oleh karena itu, probabilitas juga digunakan
untuk mengukur tingkat ketidakpastian atau uncertainty dalam suatu kejadian atau situasi.
Semakin rendah probabilitas suatu kejadian, semakin tinggi tingkat uncertainty dari kejadian
tersebut.
Beberapa contoh model probabilitas yang populer termasuk distribusi normal, distribusi
Poisson, dan distribusi eksponensial. Setiap model probabilitas memiliki karakteristik tertentu
yang memungkinkan para ahli untuk menentukan kemungkinan terjadinya suatu kejadian
berdasarkan data yang tersedia.
Contoh dari regresi adalah ketika kita ingin memprediksi harga rumah berdasarkan ukuran dan
lokasi. Di sisi lain, contoh dari korelasi adalah ketika kita ingin mengetahui apakah ada
hubungan antara tinggi badan dan berat badan seseorang.
1. Regresi Linier Sederhana: Model ini digunakan ketika hanya ada satu variabel independen
(X) yang digunakan untuk memprediksi variabel dependen (Y).
2. Regresi Linier Berganda: Model ini digunakan ketika dua atau lebih variabel independen (X1,
X2, X3, dst) digunakan untuk memprediksi variabel dependen (Y).
3. Regresi Nonlinear: Model ini digunakan ketika hubungan antara variabel independen dan
dependen tidak linier. Contoh model regresi nonlinear adalah model logistik dan model
eksponensial.
Model korelasi mengukur hubungan antara dua variabel dan dapat membantu dalam
memahami apakah ada ketergantungan antara keduanya. Jenis-jenis model korelasi antara lain:
1. Korelasi Pearson: Ini adalah jenis korelasi yang paling umum digunakan dan mengukur
hubungan linier antara dua variabel numerik. Korelasi Pearson menghasilkan koefisien
korelasi antara -1 hingga 1, dengan nilai 1 menunjukkan korelasi positif sempurna dan -1
menunjukkan korelasi negatif sempurna.
2. Korelasi Spearman: Jenis korelasi ini mengukur hubungan monotonic antara dua variabel
numerik atau ordinal. Korelasi Spearman memperhitungkan urutan variabel, bukan nilainya,
dan menghasilkan koefisien korelasi antara -1 hingga 1.
3. Korelasi Kendall: Jenis korelasi ini mirip dengan korelasi Spearman dalam hal mengukur
hubungan monotonic antara dua variabel. Namun, Korelasi Kendall lebih sensitif terhadap
perubahan pada nilai-nilai yang memiliki urutan rendah.
4. Partial correlation: Korelasi parsial mengukur hubungan antara dua variabel ketika efek dari
satu atau lebih variabel kontrol dihilangkan.
5. Canonical correlation: Jenis korelasi ini mengukur hubungan antara dua set variabel yang
saling bergantung. Canonical correlation dapat membantu dalam menjelaskan hubungan
antara dua set variabel.
Analisis klaster (cluster analysis) adalah teknik yang digunakan untuk mengelompokkan objek
atau data berdasarkan kemiripannya dalam satu kelompok atau lebih. Kelompok yang dihasilkan
dari analisis klaster umumnya dibuat berdasarkan jarak antara objek atau data dalam ruang data
atau jarak antara vektor karakteristiknya.
Referensi
Witten, I. H., Frank, E., & Hall, M. A. (2016). Data mining: Practical machine learning tools and
techniques. Morgan Kaufmann.
James, G., Witten, D., Hastie, T., & Tibshirani, R. (2013). An Introduction to Statistical Learning:
With Applications in R. Springer.
Walpole, R. E., Myers, R. H., Myers, S. L., & Ye, K. (2011). Probability & statistics for engineers &
scientists. Pearson.
Douglas C. Montgomery, Elizabeth A. Peck, dan G. Geoffrey Vining. (2012). Introduction to Linear
Regression Analysis. New York: Wiley.
Gareth James, Daniela Witten, Trevor Hastie, dan Robert Tibshirani. (2013). An Introduction to
Statistical Learning. New York: Springer.
Gupta, R. D., & Kapoor, N. (2017). Fundamentals of Mathematical Statistics. Sultan Chand &
Sons.
Hair, J. F., Black, W. C., Babin, B. J., & Anderson, R. E. (2019). Multivariate Data Analysis (8th ed.).
Cengage Learning.
J. L. Devore, Probability and Statistics for Engineering and the Sciences, 8th edition, Cengage
Learning, 2012.
R. Neter, M. Kutner, C. Nachtsheim, and W. Wasserman, Applied Linear Statistical Models, 4th
edition, McGraw-Hill/Irwin, 1996.
Han, J., Kamber, M., & Pei, J. (2011). Data mining: concepts and techniques. Morgan Kaufmann.
James, G., Witten, D., Hastie, T., & Tibshirani, R. (2013). An introduction to statistical learning
(Vol. 112). New York: Springer.
Jain, A. K., Murty, M. N., & Flynn, P. J. (1999). Data clustering: a review. ACM Computing Surveys
(CSUR), 31(3), 264-323.
Han, J., & Kamber, M. (2006). Data mining: concepts and techniques. Morgan Kaufmann.
Data mining merupakan salah satu teknik yang dapat digunakan untuk mengolah dan
menganalisis big data. Tujuan utama dari data mining adalah menemukan pola-pola menarik
atau informasi yang berguna dari data yang telah dikumpulkan, yang terkadang sulit untuk
ditemukan secara manual. Dalam hal ini, data mining digunakan untuk mengekstrak
pengetahuan atau informasi dari big data yang tidak dapat diolah secara manual.
Dalam prakteknya, data mining pada big data melibatkan penggunaan teknik-teknik seperti
clustering, klasifikasi, regresi, analisis asosiasi, dan lain-lain. Teknik-teknik ini dapat diterapkan
pada big data untuk memahami tren, pola, dan perilaku dalam data. Hal ini membantu dalam
pengambilan keputusan bisnis yang lebih baik, seperti meningkatkan efisiensi operasional,
memperbaiki layanan pelanggan, meningkatkan kualitas produk, dan lain sebagainya.
Terdapat beberapa langkah dalam melakukan data mining, di antaranya adalah sebagai berikut:
1. Memahami tujuan bisnis dan masalah yang ingin dipecahkan. Langkah pertama dalam
melakukan data mining adalah memahami tujuan bisnis dan masalah yang ingin dipecahkan.
Hal ini akan membantu memfokuskan analisis dan memastikan bahwa hasil yang dihasilkan
dapat memberikan manfaat yang bermanfaat bagi bisnis.
2. Memilih data yang akan digunakan. Langkah selanjutnya adalah memilih data yang akan
digunakan dalam analisis. Data yang dipilih harus berkualitas dan relevan dengan tujuan
bisnis dan masalah yang ingin dipecahkan. Data juga harus disimpan dan diorganisir dengan
baik agar dapat diakses dengan mudah.
3. Memproses data. Setelah data dipilih, langkah selanjutnya adalah memproses data tersebut.
Proses ini meliputi pembersihan data (misalnya, menghapus data yang hilang atau duplikat),
penggabungan data dari berbagai sumber, transformasi data (misalnya, mengubah data
menjadi format yang tepat), dan pemilihan fitur (misalnya, memilih variabel yang paling
relevan dalam analisis).
Machine learning erat kaitannya dengan data mining karena keduanya merupakan bagian dari
analisis data yang menggunakan metode-metode komputasi untuk mengekstraksi informasi
dari data. Dalam data mining, teknik machine learning sering digunakan untuk membangun
model prediktif. Model prediktif dapat digunakan untuk memprediksi nilai yang tidak diketahui
dalam data, misalnya prediksi klasifikasi (kelas yang dimiliki data) atau regresi (nilai numerik).
Machine learning dapat membantu untuk meningkatkan akurasi prediksi dan memperbaiki
model dengan menambahkan data baru.
Selain itu, machine learning juga dapat digunakan untuk menjalankan tugas-tugas lain dalam
data mining, seperti klastering (mengelompokkan data ke dalam kelompok yang serupa),
reduksi dimensi (mengurangi jumlah variabel yang digunakan), dan asosiasi (mencari hubungan
antar variabel).
Dalam keseluruhan, machine learning dan data mining bekerja sama untuk menghasilkan
informasi yang berguna dari data. Machine learning membantu mengoptimalkan model dan
menghasilkan prediksi yang akurat, sedangkan data mining membantu mengidentifikasi pola
yang tersembunyi dan mengekstrak pengetahuan yang berguna dari data. Keduanya saling
melengkapi dan menjadi bagian yang penting dalam dunia analisis data.
Dalam data mining, metode statistik digunakan untuk mengolah data dalam jumlah besar dan
kompleks, sehingga dapat menghasilkan informasi yang lebih baik dan mendalam tentang data
tersebut. Metode ini juga membantu memvalidasi hasil data mining dan meningkatkan
kepercayaan pada kesimpulan yang ditarik dari data tersebut.
Beberapa contoh metode statistik yang penting dalam data mining adalah:
1. Analisis deskriptif: Metode ini digunakan untuk menggambarkan data dan menghasilkan
statistik ringkasan tentang data, seperti mean, median, dan mode. Analisis deskriptif sering
digunakan untuk memahami distribusi data dan mengidentifikasi pencilan (outlier) dan
kecacatan (missing value) pada data.
2. Analisis inferensial: Metode ini digunakan untuk menguji hipotesis dan membuat prediksi
berdasarkan data yang ada. Analisis inferensial sering digunakan untuk menguji apakah
terdapat hubungan atau perbedaan antara variabel dalam data.
3. Analisis regresi: Metode ini digunakan untuk membangun model matematika yang dapat
digunakan untuk memprediksi nilai variabel target berdasarkan nilai variabel input tertentu.
Analisis regresi sering digunakan dalam data mining untuk memprediksi nilai penjualan,
harga saham, dan lain-lain.
4. Analisis multivariat: Metode ini digunakan untuk memahami hubungan antara beberapa
variabel. Analisis multivariat sering digunakan dalam data mining untuk memahami faktor-
faktor yang mempengaruhi perilaku konsumen, analisis pasar, dan lain-lain.
5. Analisis korelasi: Metode ini digunakan untuk mengidentifikasi hubungan antara dua atau
lebih variabel dalam data. Analisis korelasi sering digunakan untuk memahami hubungan
antara variabel input dan output dalam model data mining.
Berikut adalah beberapa metode populer yang digunakan dalam data mining dan contoh
penerapannya:
1. Regresi, merupakan metode statistik yang digunakan untuk membangun model matematika
yang dapat memprediksi nilai variabel target berdasarkan variabel input tertentu. Contoh
penerapannya dalam data mining adalah untuk memprediksi harga saham berdasarkan
variabel input seperti kinerja perusahaan, kondisi ekonomi, dan faktor-faktor lainnya (Luo,
2018).
2. Pohon Keputusan, adalah metode klasifikasi yang digunakan untuk membangun model
yang memprediksi nilai variabel target berdasarkan beberapa atribut input. Contoh
penerapannya dalam data mining adalah untuk memprediksi apakah seorang pelanggan
akan membeli produk tertentu berdasarkan atribut seperti usia, jenis kelamin, dan perilaku
pembelian sebelumnya (Han et al., 2011).
3. Jaringan Syaraf Tiruan, merupakan model matematika yang meniru cara kerja otak manusia
dalam mengambil keputusan. Contoh penerapannya dalam data mining adalah untuk
memprediksi apakah suatu transaksi adalah fraud atau tidak, berdasarkan pola transaksi
sebelumnya (Witten & Frank, 2016).
Model data mining biasanya dibangun menggunakan teknik pembelajaran mesin seperti regresi,
klasifikasi, klastering, dan asosiasi. Model-data mining yang baik harus memiliki kemampuan
untuk:
Beberapa contoh model data mining yang populer adalah pohon keputusan, jaringan syaraf
tiruan, regresi linier, regresi logistik, dan analisis klastering.
Model data mining digunakan dalam berbagai aplikasi, seperti pengenalan pola dalam gambar
dan suara, deteksi anomali dalam data keamanan, analisis risiko kredit, dan pengelolaan rantai
pasokan.
Dalam pengembangan model data mining, pemilihan variabel yang signifikan, teknik
pengolahan data yang tepat, dan evaluasi model yang baik merupakan faktor penting untuk
memastikan model data mining yang dihasilkan memenuhi tujuan bisnis atau ilmiah yang
diinginkan.
1. Klasifikasi - model ini digunakan untuk memprediksi kelas dari suatu data. Contohnya adalah
prediksi apakah seseorang akan membeli produk tertentu atau tidak. Salah satu contoh
penerapannya adalah dalam studi yang dilakukan oleh Gao, Li, dan Li (2020) untuk
memprediksi kecenderungan pelanggan terhadap pembelian produk online.
2. Regresi - model ini digunakan untuk memprediksi nilai numerik suatu variabel dari variabel
lain. Contohnya adalah memprediksi harga rumah berdasarkan luas tanah, lokasi, dan fitur-
1. Mempermudah analis data - Tools data mining menyediakan antarmuka grafis dan berbagai
fitur yang memudahkan analis data dalam mengakses, mengeksplorasi, dan memanipulasi
data.
2. Menyediakan berbagai algoritma data mining - Tools data mining menyediakan berbagai
algoritma data mining yang dapat digunakan untuk melakukan berbagai tugas analisis data,
seperti klasifikasi, regresi, klastering, dan lain-lain.
3. Mempercepat proses analisis - Tools data mining dapat mempercepat proses analisis data
dengan menyediakan fitur-fitur seperti integrasi dengan berbagai sumber data, pemrosesan
data secara otomatis, dan visualisasi data.
4. Mendukung pengambilan keputusan - Tools data mining dapat membantu analis data
dalam memahami pola-pola dan tren dalam data, sehingga dapat digunakan sebagai dasar
dalam pengambilan keputusan yang lebih baik.
Penguasaan tools data mining sangat penting bagi data saintis karena tools tersebut dapat
membantu dalam menganalisis dan mengolah data dengan lebih efisien dan akurat. Dalam
dunia bisnis dan industri, data mining digunakan untuk memprediksi perilaku konsumen,
mengidentifikasi tren pasar, dan memperoleh wawasan tentang bisnis. Sementara itu, dalam
bidang ilmiah, data mining dapat membantu dalam memperoleh informasi penting dari data
yang dihasilkan dari berbagai eksperimen atau pengamatan.
Beberapa alasan mengapa penguasaan tools data mining penting bagi data saintis antara lain:
Dengan menggunakan tools data mining, para analis data dapat lebih mudah dan cepat
melakukan analisis data dengan menggunakan berbagai algoritma data mining, sehingga dapat
menghasilkan informasi dan pengetahuan baru dari data yang dapat digunakan untuk berbagai
kepentingan, seperti pengambilan keputusan, peramalan, dan optimasi.
Seiring dengan perkembangan teknologi, tools data mining juga semakin berkembang dan
menawarkan fitur-fitur yang lebih canggih dan inovatif, sehingga dapat membantu analis data
dalam menghadapi tantangan dan memanfaatkan potensi yang lebih besar dari data yang
tersedia.
Berikut adalah beberapa tools atau perangkat lunak yang digunakan dalam data mining:
Gambar 6 Analisis citra dengan deep-network embedding pada Orange data mining.
Sumber: [Link]
Referensi
Caruana, R., & Niculescu-Mizil, A. (2006). An empirical comparison of supervised learning
algorithms. Proceedings of the 23rd international conference on Machine learning.
Gao, C., Li, C., & Li, H. (2020). Online shopping behavior prediction using machine learning
algorithms. Journal of Ambient Intelligence and Humanized Computing, 11(12).
Han, J., Kamber, M., & Pei, J. (2011). Data mining: Concepts and Techniques (3rd ed.). Morgan
Kaufmann.
Hastie, T., Tibshirani, R., & Friedman, J. (2009). The Elements of Statistical Learning: Data mining,
Inference, and Prediction (2nd ed.). Springer.
Ian H. Witten, Eibe Frank, Mark A. Hall. 2016. Data mining: Practical Machine learning Tools and
Techniques. Morgan Kaufmann Publishers.
Jiawei Han, Micheline Kamber, Jian Pei. 2012. Data mining: Concepts and Techniques. Morgan
Kaufmann Publishers.
Khan, M. A., Zia, A., & Ullah, R. (2018). The impact of social media usage on the learning ability of
students. International Journal of Computer Applications, 179(45).
Larose, D. T. (2014). Discovering Knowledge in Data: An Introduction to Data mining (2nd ed.).
Wiley.
Luo, S. (2018). The application of data mining in stock market prediction. Journal of Business and
Economics, 9(1).
Pang-Ning Tan, Michael Steinbach, Vipin Kumar. 2006. Introduction to Data mining. Addison-
Wesley.
Sahadevan, S., Kumar, P. R., & Ayyasamy, P. M. (2020). Drinking water quality assessment and
prediction using machine learning algorithms. Sustainable Computing: Informatics and Systems,
27, 100382.
Tan, P. N., Steinbach, M., & Kumar, V. (2018). Introduction to Data mining (2nd ed.). Pearson.
Witten, I. H., & Frank, E. (2016). Data mining: Practical Machine learning Tools and Techniques.
Morgan Kaufmann.
1. Tom M. Mitchell, dari Carnegie Mellon University, mendefinisikan machine learning sebagai
"kemampuan komputer untuk belajar tanpa diprogram secara eksplisit".
2. Arthur Samuel, penemu istilah "machine learning", mengatakan bahwa itu adalah "bidang
studi yang memberikan komputer kemampuan untuk belajar tanpa diberi instruksi secara
eksplisit".
3. Ian Goodfellow, Yoshua Bengio, dan Aaron Courville, dalam buku mereka "Deep Learning",
mendefinisikan machine learning sebagai "cabang dari kecerdasan buatan yang mempelajari
algoritma statistik untuk membuat prediksi atau keputusan yang didasarkan pada data".
4. Michael I. Jordan dan Thomas M. Mitchell, dalam artikel mereka "Machine learning: Trends,
Perspectives, and Prospects", menjelaskan machine learning sebagai "proses pembelajaran
melalui penggunaan data dan kemudian memperbaiki kinerja model berdasarkan umpan
balik".
5. Ethem Alpaydin, dalam bukunya "Introduction to Machine learning", menyatakan bahwa
machine learning adalah "cabang dari kecerdasan buatan yang bertujuan untuk
mengembangkan algoritma dan model yang dapat mempelajari pola dari data dan
membuat prediksi atau keputusan tanpa diprogram secara eksplisit".
Secara umum, para ahli mendefinisikan machine learning sebagai teknologi atau metode yang
memungkinkan komputer untuk belajar dari data dan pengalaman untuk meningkatkan
kinerjanya dari waktu ke waktu tanpa perlu diprogram secara eksplisit.
Machine learning adalah salah satu metode yang digunakan dalam data sains untuk
mengidentifikasi pola dan membuat prediksi atau keputusan berdasarkan data. Dalam data
sains, machine learning digunakan untuk membangun model prediksi yang dapat membantu
memecahkan masalah dan membuat keputusan yang lebih akurat.
Contoh penggunaan machine learning dalam data sains adalah dalam analisis data besar (big
data), analisis citra medis, pengenalan suara, analisis sentimen, dan masih banyak lagi. Machine
Dalam kesimpulannya, machine learning dan data sains saling terkait dan saling melengkapi.
Machine learning merupakan salah satu teknologi yang digunakan dalam data sains untuk
mengambil wawasan atau pengetahuan dari data.
Mekanisme dalam pengembangan dan penerapan machine learning secara umum dapat
dijelaskan dalam beberapa langkah dasar berikut:
1. Data Preparation: Langkah pertama dalam machine learning adalah mengumpulkan dan
mempersiapkan data. Data tersebut dapat berasal dari berbagai sumber, seperti basis data,
file teks, atau data yang dihasilkan oleh sensor atau perangkat. Data ini kemudian diproses,
dipisahkan menjadi set pelatihan dan set pengujian, dan dibersihkan untuk memastikan
kualitas dan integritasnya.
2. Feature Extraction: Setelah data dipersiapkan, langkah selanjutnya adalah mengekstraksi fitur
(feature) yang relevan. Fitur adalah karakteristik atau atribut dalam data yang dapat
digunakan untuk memprediksi hasil yang diinginkan. Pada tahap ini, fitur-fitur ini dipilih dan
diproses agar dapat digunakan dalam model machine learning.
3. Model Selection: Setelah fitur-fitur yang relevan telah ditentukan, langkah selanjutnya adalah
memilih model machine learning yang tepat. Model machine learning adalah algoritma yang
dapat mempelajari pola dalam data dan digunakan untuk memprediksi hasil yang
diinginkan. Beberapa contoh model machine learning yang umum digunakan meliputi
Regresi Linear, K-Nearest Neighbor (KNN), Naive Bayes, Decision Tree, Random Forest, dan
Neural Networks.
4. Training: Setelah model machine learning dipilih, langkah selanjutnya adalah melatih model
dengan menggunakan set pelatihan. Model dipelajari dengan menghitung parameter
internalnya (misalnya, bobot dalam jaringan saraf) untuk menentukan pola dalam data
pelatihan.
5. Validasi: Setelah model dilatih, langkah selanjutnya adalah menguji model dengan
menggunakan set pengujian untuk menentukan seberapa akurat model tersebut. Model
dievaluasi dengan menggunakan metrik performa seperti akurasi, presisi, recall, F1-score,
dan lain-lain.
6. Deployment: Setelah model diuji dan dinilai akurat, langkah terakhir dalam machine learning
adalah menerapkan model pada data yang belum dikenal. Model dapat digunakan untuk
membuat prediksi atau keputusan berdasarkan fitur yang diketahui.
Secara umum, langkah-langkah di atas mencakup mekanisme umum machine learning, di mana
model machine learning dipelajari dari data dan digunakan untuk memprediksi hasil yang
diinginkan.
Supervised learning
Supervised learning adalah jenis machine learning yang memanfaatkan data yang sudah diberi
label sebelumnya. Pada supervised learning, algoritma belajar untuk memetakan input ke output
berdasarkan contoh-contoh yang sudah diberi label. Algoritma belajar untuk memahami pola
atau hubungan antara input dan output, sehingga dapat memprediksi output yang tepat dari
input yang belum pernah dilihat sebelumnya. Beberapa contoh dari aplikasi supervised learning
adalah klasifikasi, regresi, dan deteksi anomali.
1. Klasifikasi gambar: Model machine learning dapat dipelajari untuk mengenali objek dalam
gambar berdasarkan label yang sudah diberikan. Contohnya seperti pengenalan wajah
manusia, pengenalan jenis bunga, atau identifikasi objek dalam citra medis seperti MRI atau
CT-scan.
2. Analisis sentimen: Model machine learning dapat dipelajari untuk mengenali sentimen dalam
teks seperti positif, negatif, atau netral. Contohnya dalam aplikasi pemantauan media sosial
atau analisis feedback pelanggan.
Unsupervised learning
Unsupervised learning adalah jenis machine learning yang memanfaatkan data yang tidak diberi
label sebelumnya. Pada unsupervised learning, algoritma belajar untuk memetakan input ke
output tanpa adanya contoh yang sudah diberi label. Algoritma belajar untuk memahami pola
atau hubungan antara data untuk mengelompokkan data ke dalam kelompok atau klaster yang
serupa. Beberapa contoh dari aplikasi unsupervised learning adalah clustering, reduksi dimensi,
dan association rule mining.
1. Klastering: Model machine learning dapat dipelajari untuk mengelompokkan data pelanggan
atau pengguna berdasarkan perilaku dan preferensi mereka tanpa adanya label. Contohnya
dalam analisis data penjualan atau data web analytics.
2. Reduksi dimensi: Model machine learning dapat dipelajari untuk mengekstraksi fitur penting
dari data yang memiliki dimensi yang tinggi. Contohnya dalam pemrosesan citra atau teks.
Model memegang peran penting dalam machine learning karena model yang baik dapat
memberikan prediksi yang akurat dan berguna pada data baru. Ada beberapa tipe model dalam
Machine learning, seperti Regresi Linier, Decision Tree, Random Forest, Neural Networks, dan
lain-lain. Setiap jenis model memiliki kekuatan dan kelemahan masing-masing, dan pemilihan
model yang tepat bergantung pada karakteristik data dan tujuan pembelajaran mesin.
Proses pembuatan model dalam machine learning melibatkan beberapa tahap, yaitu:
1. Persiapan data: Data perlu dipersiapkan dan dibersihkan sebelum digunakan untuk
melatih model.
2. Pemilihan fitur: Fitur (features) yang paling penting dan relevan perlu dipilih untuk
melatih model.
3. Pembuatan model: Model dipilih dan dibuat untuk belajar dari data pelatihan.
4. Evaluasi model: Model dievaluasi untuk mengetahui performanya, seperti akurasi, presisi,
recall, dan lain-lain.
5. Penyempurnaan model: Model dapat diperbaiki atau dioptimalkan untuk meningkatkan
performanya.
Setelah model dilatih pada data pelatihan, model tersebut dapat digunakan untuk melakukan
prediksi pada data baru. Prediksi yang akurat dapat membantu dalam pengambilan keputusan,
identifikasi pola, dan prediksi peristiwa di masa depan.
Berikut adalah beberapa jenis model machine learning yang umum digunakan:
Dalam kesimpulannya, model adalah elemen penting dalam Machine learning karena model
yang baik dapat memberikan prediksi yang akurat pada data baru dan membantu dalam
pengambilan keputusan. Model dipilih berdasarkan karakteristik data dan tujuan pembelajaran
mesin.
Berikut adalah beberapa referensi publikasi penelitian terbaru yang menerapkan machine
learning:
Referensi
Alpaydin, E. (2010). Introduction to machine learning (2nd ed.). Cambridge, MA: MIT Press.
Goodfellow, I., Bengio, Y., & Courville, A. (2016). Deep Learning. MIT Press.
James, G., Witten, D., Hastie, T., & Tibshirani, R. (2013). An Introduction to Statistical Learning:
With Applications in R. Springer.
Jordan, M. I., & Mitchell, T. M. (2015). Machine learning: Trends, perspectives, and prospects.
Science, 349(6245), 255-260.
Kelleher, J. D., Tierney, B., & Tierney, B. (2018). Data Science An Introduction. CRC Press.
Visualisasi data digunakan dalam berbagai bidang ilmu, seperti statistik, ilmu sosial, biologi,
ekonomi, dan banyak lagi. Beberapa contoh aplikasi visualisasi data dalam data sains termasuk:
1. Identifikasi pola dalam data: Visualisasi data dapat membantu mengidentifikasi pola dalam
data yang mungkin tidak terlihat dengan mudah dalam bentuk tabel atau daftar angka
mentah.
2. Analisis tren: Visualisasi data dapat membantu mengidentifikasi tren dan perubahan dalam
data dari waktu ke waktu.
3. Pengambilan keputusan: Visualisasi data dapat membantu para pengambil keputusan
memahami implikasi dari keputusan yang diambil berdasarkan data.
4. Komunikasi hasil penelitian: Visualisasi data dapat membantu para peneliti dan analis data
untuk mengkomunikasikan hasil penelitian mereka secara efektif kepada khalayak yang lebih
luas.
Pentingnya visualisasi data dalam data sains sangat penting, karena data sains sering kali
kompleks dan sulit diinterpretasikan jika hanya dilihat dalam bentuk tabel atau angka-angka
mentah. Dengan menggunakan teknik visualisasi data, kita dapat:
1. Menemukan pola dan hubungan: Visualisasi data dapat membantu kita menemukan pola
dan hubungan yang tidak terlihat saat melihat data mentah.
2. Menyederhanakan kompleksitas: Visualisasi data dapat membantu kita menyederhanakan
kompleksitas data dengan menerjemahkannya menjadi bentuk yang lebih mudah dipahami.
3. Meningkatkan pemahaman: Visualisasi data dapat membantu kita memahami data dengan
lebih baik dan cepat, karena kita dapat melihat data dalam bentuk visual yang dapat dengan
mudah dicerna.
4. Meningkatkan efektivitas pengambilan keputusan: Dengan visualisasi data yang tepat, kita
dapat membuat keputusan yang lebih baik dan lebih cepat, karena kita dapat melihat data
dengan cara yang lebih intuitif dan dapat memahami implikasi dari keputusan yang diambil.
1. Grafik Bar atau Batang, digunakan untuk membandingkan nilai numerik atau kategorikal.
Grafik bar vertikal menampilkan kategori pada sumbu horizontal dan nilai numerik pada
sumbu vertikal, sedangkan grafik bar horizontal menampilkan nilai numerik pada sumbu
horizontal dan kategori pada sumbu vertikal.
2. Grafik Garis, digunakan untuk menunjukkan perubahan nilai numerik atau kuantitatif pada
periode waktu tertentu. Grafik garis menampilkan data sebagai serangkaian titik yang
terhubung oleh garis.
3. Grafik Pie, digunakan untuk membandingkan proporsi data kategori. Grafik ini menampilkan
data sebagai potongan lingkaran, dengan setiap bagian mewakili proporsi data yang
berbeda.
Terdapat pula jenis-jenis grafik yang advanced dalam visualisasi data, yaitu jenis grafik yang
lebih kompleks dan canggih dibandingkan dengan grafik standar. Grafik ini memungkinkan kita
untuk menganalisis data dengan lebih detail dan mendalam. Berikut adalah beberapa tipe dan
contoh grafik advanced dalam visualisasi data:
1. Choropleth Map, digunakan untuk menunjukkan distribusi data spasial pada peta. Grafik ini
menampilkan data sebagai wilayah atau daerah dengan warna yang berbeda-beda
tergantung pada nilai data pada setiap wilayah. Contohnya adalah peta yang menunjukkan
indeks kebahagiaan atau tingkat pengangguran pada setiap wilayah.
5. Sankey Diagram, digunakan untuk menunjukkan aliran atau keterkaitan antara beberapa
entitas. Grafik ini menampilkan data sebagai panah atau garis yang mewakili arus data dari
satu entitas ke entitas lainnya. Contohnya adalah diagram yang menunjukkan aliran lalu
lintas di kota atau arus energi dalam suatu sistem.
Itulah beberapa kategori dan jenis-jenis visualisasi data yang umum digunakan. Pemilihan jenis
visualisasi data yang tepat tergantung pada beberapa faktor, seperti tujuan visualisasi, jenis data
yang akan ditampilkan, ukuran data, dan audiens yang akan melihat visualisasi. Berikut adalah
beberapa strategi pemilihan jenis grafik untuk visualisasi data:
1. Pertimbangkan tujuan visualisasi, pastikan bahwa tujuan visualisasi data sudah jelas. Apakah
Anda ingin menunjukkan perubahan data seiring waktu, perbandingan antara beberapa
variabel, atau distribusi data pada suatu area? Pemilihan jenis grafik yang tepat akan
memastikan bahwa pesan visual disampaikan dengan jelas.
2. Pertimbangkan jenis data yang akan ditampilkan, misalnya, data kategorikal seperti jenis
kelamin atau kategori produk biasanya ditampilkan menggunakan grafik batang atau pie
chart. Sedangkan data numerik seperti nilai-nilai pengukuran biasanya ditampilkan
menggunakan grafik garis atau scatter plot.
3. Pertimbangkan ukuran data yang juga mempengaruhi pemilihan jenis grafik. Jika data yang
akan ditampilkan terdiri dari beberapa titik data, maka grafik scatter plot mungkin lebih
cocok. Namun, jika data tersebut terdiri dari ribuan titik data, maka grafik scatter plot
mungkin menjadi terlalu padat. Pada kasus seperti ini, heatmap atau density plot mungkin
lebih cocok.
1. Kenali audiens Anda, ketahui siapa yang akan melihat visualisasi data Anda dan identifikasi
tujuan mereka untuk melihat visualisasi data tersebut. Ini akan membantu Anda memilih tipe
visualisasi data yang tepat dan fokus pada informasi yang relevan dan bermakna bagi
audiens Anda.
2. Fokus pada pesan utama, identifikasi pesan utama yang ingin Anda sampaikan dan fokus
pada itu. Gunakan visualisasi data untuk memperkuat pesan Anda, bukan sebagai pengganti
pesan.
3. Gunakan visualisasi yang yang tepat untuk data yang ingin Anda tampilkan. Misalnya,
gunakan diagram batang untuk membandingkan kuantitas, atau gunakan grafik garis untuk
menunjukkan perubahan dalam data dari waktu ke waktu.
4. Pertimbangkan desain visual, pastikan desain visualisasi data Anda memudahkan audiens
Anda memahami informasi yang ingin Anda sampaikan. Gunakan warna, ukuran, dan tata
letak dengan bijak dan konsisten.
5. Sederhanakan visualisasi data Anda, jangan terlalu rumit dalam membuat visualisasi data.
Visualisasi data yang terlalu rumit dapat membingungkan audiens dan membuat mereka
kehilangan fokus pada pesan utama yang ingin Anda sampaikan.
6. Berikan konteks pada visualisasi data Anda. Misalnya, berikan keterangan tentang satuan
pengukuran, sumber data, atau kisaran waktu.
7. Uji visualisasi data Anda, pastikan visualisasi data Anda dapat diuji dan diinterpretasikan oleh
orang lain. Uji visualisasi data Anda dengan audiens yang berbeda untuk mendapatkan
umpan balik dan saran untuk perbaikan.
Dalam menerapkan strategi visualisasi data, pastikan untuk mempertimbangkan konteks dari
data dan audiens yang Anda targetkan. Dengan memahami pesan utama yang ingin Anda
sampaikan dan memilih jenis visualisasi data yang tepat, Anda dapat membuat visualisasi data
yang efektif dan bermakna bagi audiens Anda.
Penguasaan skill untuk visualisasi data sangat penting dalam berbagai bidang, terutama dalam
data sains. Penguasaan skill untuk visualisasi data melibatkan beberapa hal yang perlu dipelajari
Untuk menguasai skill untuk visualisasi data, Anda dapat mempelajari berbagai sumber referensi
seperti buku, kursus online, tutorial, dan sebagainya. Selain itu, praktik juga sangat penting
untuk menguasai keterampilan ini. Cobalah untuk membuat visualisasi data pada proyek-proyek
yang berbeda atau dengan menggunakan data yang berbeda sehingga Anda dapat menguji
dan meningkatkan keterampilan Anda.
1. Mempermudah pemahaman data: Penggunaan metode dan tools yang tepat dapat
membantu memperjelas data dan membuat informasi yang disajikan lebih mudah dipahami
oleh audiens.
2. Menghemat waktu dan biaya: Penggunaan metode dan tools yang tepat dapat membantu
menghemat waktu dan biaya dalam proses pembuatan visualisasi data. Metode dan tools
yang efisien dapat membantu menghemat waktu dalam proses pengolahan data dan
memungkinkan pembuat visualisasi untuk fokus pada informasi yang paling penting.
3. Menyediakan pengalaman yang lebih interaktif: Penggunaan tools yang tepat dapat
membantu pembuat visualisasi data menyediakan pengalaman yang lebih interaktif dan
Dengan menggunakan metode dan tools yang tepat, pembuat visualisasi data dapat
memastikan bahwa data disajikan dengan cara yang paling efektif untuk audiens dan tujuan
tertentu. Hal ini dapat membantu meningkatkan pemahaman dan keterlibatan audiens dalam
informasi yang disajikan.
Berikut adalah beberapa metode dan teknik pembuatan visualisasi data yang sering digunakan:
1. Visual Encoding, adalah teknik dasar dalam pembuatan visualisasi data yang mengonversi
data ke bentuk visual seperti garis, titik, atau warna. Visual encoding biasanya digunakan
untuk menunjukkan perbandingan, hubungan, dan distribusi data.
2. Chart Types, ada banyak jenis chart atau grafik yang dapat digunakan untuk menampilkan
data, seperti bar chart, line chart, pie chart, dan scatter plot. Pemilihan chart type yang tepat
tergantung pada jenis data dan informasi yang ingin disampaikan.
3. Scaling, adalah teknik yang digunakan untuk menyesuaikan rentang data ke skala visual
yang tepat. Scaling juga dapat digunakan untuk menyesuaikan interval nilai pada sumbu,
menyesuaikan ukuran mark, atau mengubah warna.
4. Labeling, adalah teknik yang digunakan untuk memberikan informasi tambahan pada
visualisasi data. Labeling dapat digunakan untuk menambahkan informasi pada sumbu,
judul, mark, atau menunjukkan sumber data.
5. Interactivity, adalah teknik yang digunakan untuk memberikan pengalaman yang lebih
dinamis pada visualisasi data. Interaktivitas dapat berupa hover, klik, atau zoom, yang
memungkinkan audiens untuk melihat data lebih detail atau mengeksplorasi data dari
berbagai sudut pandang.
6. Design Principles, penerapan prinsip-prinsip desain grafis dapat digunakan untuk
meningkatkan estetika dan kejelasan visualisasi data. Prinsip-prinsip ini meliputi penggunaan
warna yang tepat, penggunaan tipografi yang konsisten, dan mempertimbangkan
penggunaan ruang kosong.
7. Storytelling, pembuatan visualisasi data dapat dikemas menjadi sebuah cerita, di mana
audiens dapat mengikuti plot dan mengerti pesan yang ingin disampaikan. Storytelling
melibatkan penggunaan narasi, visual, dan interaktivitas untuk membantu audiens
memahami data secara holistik.
Metode dan teknik di atas dapat digunakan untuk membuat visualisasi data yang informatif dan
mudah dipahami. Pemilihan teknik yang tepat tergantung pada jenis data, tujuan visualisasi, dan
audiens yang akan melihat visualisasi.
1. Microsoft Excel, adalah tools visualisasi data yang paling sederhana, yang biasanya sudah
tersedia di komputer dan dapat digunakan untuk membuat grafik dan tabel sederhana. Excel
juga mudah digunakan dan sangat familiar bagi banyak orang.
2. Google Sheets, sama seperti Excel, Google Sheets adalah aplikasi spreadsheet gratis yang
dapat digunakan untuk membuat grafik dan tabel sederhana. Google Sheets juga memiliki
fitur kolaborasi yang memungkinkan tim untuk bekerja bersama pada satu file.
3. Tableau Public, adalah aplikasi visualisasi data yang populer dan mudah digunakan. Aplikasi
ini menyediakan fitur drag-and-drop yang memungkinkan pengguna untuk membuat
visualisasi data yang menarik dengan cepat dan mudah. Tableau Public juga memungkinkan
pengguna untuk mempublikasikan visualisasi secara online.
4. Power BI, adalah aplikasi visualisasi data buatan Microsoft yang terintegrasi dengan berbagai
sumber data. Aplikasi ini menawarkan berbagai fitur canggih, termasuk machine learning,
yang memungkinkan pengguna untuk membuat visualisasi data yang lebih kompleks.
5. [Link], adalah library JavaScript yang sangat fleksibel dan dapat digunakan untuk membuat
visualisasi data yang sangat canggih dan interaktif. Namun, penggunaan [Link] memerlukan
keahlian pemrograman dan pemahaman yang kuat tentang teknologi web.
6. Python Libraries, ada banyak library Python yang dapat digunakan untuk membuat
visualisasi data, seperti Matplotlib, Seaborn, Plotly, dan Bokeh. Python sangat populer di
kalangan ilmu data dan machine learning, sehingga library ini sangat berguna bagi mereka
yang sudah memahami bahasa pemrograman Python.
Ini hanya beberapa contoh tools visualisasi data yang tersedia. Masih banyak lagi tools
visualisasi data yang dapat digunakan, tergantung pada kebutuhan dan preferensi individu atau
tim. Pilihan tools yang tepat harus didasarkan pada jenis data yang diproses dan tujuan
visualisasi data yang ingin dicapai.
Referensi
Abela, B. (2010). Advanced Presentations by Design: Creating Communication that Drives Action.
John Wiley & Sons.
Alberto Cairo, "The Functional Art: An Introduction to Information Graphics and Visualization"
(New Riders, 2012).
Alberto Cairo, The Truthful Art: Data, Charts, and Maps for Communication (New Riders, 2016).
Cole Nussbaumer Knaflic, "Storytelling with Data: A Data Visualization Guide for Business
Professionals" (Wiley, 2015).
Edward Tufte, The Visual Display of Quantitative Information (Graphics Press, 2001).
Hadley Wickham, ggplot2: Elegant Graphics for Data Analysis (Springer, 2009).
Heer, J., & Bostock, M. (2010). Crowdsourcing graphical perception: using mechanical turk to
assess visualization design. Proceedings of the SIGCHI Conference on Human Factors in
Computing Systems, 203-212.
Nathan Yau, "Data Points: Visualization That Means Something" (Wiley, 2013).
Nathan Yau, Visualize This: The FlowingData Guide to Design, Visualization, and Statistics (Wiley,
2011).
Segaran, T. (2007). Programming collective intelligence: building smart web 2.0 applications.
O'Reilly Media.
Stephen Few, "Show Me the Numbers: Designing Tables and Graphs to Enlighten" (Analytics
Press, 2012).
Wickham, H., & Grolemund, G. (2017). R for Data Science: Import, Tidy, Transform, Visualize, and
Model Data. O'Reilly Media.
Pengertian Database
Database atau basis data adalah kumpulan data yang disimpan secara teratur dan terstruktur di
dalam komputer, sehingga memungkinkan pengguna untuk mengakses, mengelola, dan
mengambil informasi dengan lebih mudah dan efisien. Basis data ini terdiri dari berbagai jenis
data, seperti teks, gambar, suara, angka, dan informasi lainnya yang dapat digunakan untuk
tujuan tertentu.
Basis data biasanya digunakan dalam berbagai jenis aplikasi, seperti sistem manajemen
perusahaan, aplikasi perbankan, sistem manajemen pergudangan, sistem manajemen stok, dan
lain-lain. Basis data dapat membantu organisasi untuk mempercepat proses pengambilan
keputusan dan meningkatkan efisiensi operasional, karena memungkinkan pengguna untuk
dengan cepat mencari, memperbarui, dan menganalisis data dengan lebih mudah dan akurat.
Kapabilitas basis data mencakup kemampuan untuk mengelola, menyimpan, dan mengakses
data dengan efisien dan efektif. Berikut adalah beberapa kapabilitas utama yang dimiliki oleh
basis data:
1. Pemodelan Data: Basis data memiliki kemampuan untuk memodelkan data dengan berbagai
cara, seperti dengan menggunakan diagram entity-relationship (ER) atau model data
relasional. Pemodelan data ini membantu dalam mengorganisir data secara terstruktur,
sehingga memudahkan dalam pengolahan data.
2. Penyimpanan Data: Basis data dapat menyimpan data dalam format yang terstruktur dan
terorganisir dengan baik, seperti tabel atau entitas, yang dapat diakses dengan mudah oleh
pengguna. Sistem basis data juga dapat menangani volume data yang besar dan
memastikan bahwa data tersimpan dengan aman dan terlindungi.
3. Pemrosesan Data: Basis data memungkinkan pengguna untuk melakukan operasi
pengolahan data, seperti pencarian, penyaringan, dan pengurutan data. Basis data juga
dapat menangani operasi agregat, seperti menjumlahkan data atau menghitung rata-rata
data.
4. Integrasi Data: Basis data dapat mengintegrasikan data dari berbagai sumber yang berbeda,
seperti sistem informasi perusahaan, aplikasi bisnis, dan sumber data publik. Integrasi data
ini memungkinkan pengguna untuk menggabungkan data dari berbagai sumber yang
berbeda dan menghasilkan wawasan baru yang berguna.
Dalam data sains, basis data digunakan untuk menyimpan dan mengelola data yang
berhubungan dengan suatu topik atau masalah tertentu. Basis data membantu dalam
pengumpulan data yang terstruktur dan terorganisir dengan baik, sehingga memudahkan dalam
mengakses dan menganalisis data. Basis data juga memungkinkan pengguna untuk
Dalam praktiknya, penggunaan basis data dalam data sains melibatkan proses pengolahan data
yang meliputi pembersihan data, penggabungan data, penggalian data, analisis data, dan
visualisasi data. Basis data juga memainkan peran penting dalam pengelolaan data yang
berhubungan dengan privasi dan keamanan, sehingga memastikan bahwa data yang digunakan
dalam analisis adalah aman dan terlindungi.
Dengan kata lain, basis data memainkan peran kunci dalam data sains dengan memungkinkan
pengguna untuk mengumpulkan, mengelola, dan menganalisis data secara efektif dan efisien.
Pemodelan Database
Pemodelan data dalam database adalah proses merancang dan memodelkan struktur data
dalam database. Tujuannya adalah untuk mengorganisir data dalam bentuk yang terstruktur dan
mudah dipahami, serta memudahkan pengolahan data di dalam database.
1. Entitas: Objek atau konsep yang memiliki atribut atau sifat tertentu. Entitas biasanya
merepresentasikan objek di dunia nyata seperti produk, pelanggan, atau pesanan.
2. Atribut: Karakteristik atau sifat dari entitas. Misalnya, produk dapat memiliki atribut seperti
nama, deskripsi, harga, dan stok.
3. Relasi: Hubungan antara entitas yang menunjukkan bagaimana entitas saling terkait dalam
dunia nyata.
4. Kardinalitas: Jumlah entitas yang terlibat dalam suatu relasi. Misalnya, sebuah pesanan dapat
memiliki kardinalitas satu ke banyak dengan produk, yang berarti setiap pesanan dapat
berisi banyak produk.
Untuk memahami konsep entitas, atribut, relasi dan kardinalitas, Gambar 14 dapat dijelaskan
sebagai berikut:
Untuk memudahkan pemodelan data untuk database, diagram seperti pada Gambar 14 tidak
digunakan, karena penggambarannya terlalu kompleks dan rumit, dan akan menyulitkan jika
melibatkan banyak entitas dengan berbagai atribut dan relasinya. Untuk itu digunakan Entity
Relationship Diagram (ERD).
Entity Relationship Diagram (ERD) adalah sebuah model data yang menggambarkan hubungan
antara entitas dalam suatu sistem. ERD merupakan alat yang penting dalam desain basis data
karena memungkinkan kita untuk merepresentasikan dan memvisualisasikan struktur dari basis
data dengan jelas dan mudah dimengerti. ERD dapat membantu dalam merancang,
memperbarui, atau mengoptimalkan basis data, serta dapat meminimalkan kesalahan dalam
pengembangan basis data. ERD juga dapat membantu dalam berkomunikasi dengan
stakeholder lainnya tentang struktur dan konten dari basis data.
Jika model pada Gambar 14 digambarkan dengan menggunakan ERD maka akan seperti pada
Gambar 15
Struktur Database
Struktur database merujuk pada cara data disimpan dan diorganisir dalam basis data. Struktur
ini terdiri dari beberapa komponen, termasuk tabel, kolom, baris, kunci, dan relasi. Berikut
adalah penjelasan lebih rinci tentang masing-masing komponen dalam struktur database:
1. Tabel, adalah kumpulan data yang terdiri dari baris dan kolom yang saling terkait. Setiap
tabel dalam basis data terdiri dari nama tabel, daftar kolom, dan baris data. Pada prinsipnya,
tabel adalah implementasi dari entitas dari model data
2. Kolom, dalam tabel adalah bagian dari tabel yang berisi informasi atau data spesifik. Kolom
diidentifikasi dengan nama kolom dan tipe data yang sesuai. Kolom pada prinsipnya adalah
implementasi dari atribut-atribut entitas dalam rancangan model data.
3. Baris, dalam tabel adalah rekaman data tunggal dalam tabel. Setiap baris harus memuat data
yang sama jumlahnya dengan kolom yang terkait. Baris merupakan representasi sejumlah
individu dari entitas yang sama
4. Kunci, adalah pengidentifikasi unik untuk setiap baris dalam tabel. Ada dua jenis kunci dalam
basis data: kunci utama (primary key) dan kunci asing (foreign key).
a. Kunci Utama: Kunci utama adalah kolom atau kombinasi kolom yang unik untuk
setiap baris dalam tabel. Kunci utama digunakan untuk mengidentifikasi setiap baris
dengan cara yang unik, sehingga memudahkan proses pengambilan data dari tabel.
Database Relasional
Database relasional adalah jenis database yang menggunakan model data relasional. Model
data relasional didasarkan pada konsep relasi antara tabel dalam database, yang terdiri dari
baris dan kolom. Setiap tabel dalam database relasional memiliki satu atau lebih kolom yang
didefinisikan sebagai kunci utama (primary key) yang dapat digunakan untuk mengidentifikasi
setiap baris dalam tabel tersebut.
Dalam database relasional, hubungan antara tabel ditentukan oleh kunci asing (foreign key),
yang merujuk ke kunci utama di tabel lain. Dengan menggunakan kunci asing, data dapat
digabungkan dari beberapa tabel untuk membentuk suatu hasil yang lebih besar.
Contoh sederhana dari database relasional adalah database toko online. Tabel-tabel dalam
database toko online dapat termasuk tabel pelanggan, tabel produk, dan tabel pesanan. Tabel
pelanggan akan memiliki kolom-kolom seperti ID pelanggan, nama, alamat, dan sebagainya,
sementara tabel produk akan memiliki kolom-kolom seperti ID produk, nama produk, harga,
dan sebagainya. Tabel pesanan kemudian akan menghubungkan tabel pelanggan dan produk
menggunakan kunci asing, dengan kolom-kolom seperti ID pesanan, ID pelanggan, ID produk,
jumlah, dan sebagainya.
Database relasional sangat umum digunakan dalam bisnis dan industri karena kemampuannya
untuk menyimpan, mengelola, dan mengambil data yang terstruktur. Manajemen data yang
terorganisir dan relasi antara data yang terdefinisi dengan baik dapat memudahkan pengguna
dalam mengakses dan menganalisis data secara efektif dan efisien. Beberapa contoh perangkat
lunak database relasional yang populer termasuk MySQL, PostgreSQL, Oracle, dan Microsoft
SQL Server.
© Sofyan Thayf, 2023 Page | 72
Pembahasan sebelumnya tentang pemodelan data dan struktur database, merujuk pada konsep
database relasional
Database relasional sangat handal dalam menangani data yang besar dan kompleks, namun
juga memiliki sejumlah kelemahan. Berikut adalah beberapa keunggulan dan kelemahan dari
database relasional:
Keunggulan:
Kelemahan:
1. Skalabilitas: Ketika database relasional tumbuh, performa dapat menjadi masalah karena
kompleksitas relasi antara tabel.
2. Pengelolaan data yang sulit: Database relasional memerlukan pengelolaan yang rumit dan
mungkin memerlukan lebih banyak waktu untuk mengelola dan memperbaiki database.
3. Biaya: Database relasional umumnya lebih mahal dibandingkan dengan database non-
relasional, terutama ketika skala datanya besar dan memerlukan banyak server.
4. Keterbatasan dalam penyimpanan data semi-struktur: Database relasional kurang cocok
untuk menyimpan data semi-struktur, seperti dokumen yang disimpan dalam format JSON
atau XML.
Meskipun demikian, database relasional masih menjadi pilihan yang populer di industri dan
bisnis karena kemampuannya untuk mengelola data terstruktur dengan baik dan
memungkinkan adanya pengaturan relasi antara data. Namun, dengan munculnya jenis
database baru seperti database NoSQL dan NewSQL, sekarang banyak organisasi yang
mempertimbangkan alternatif lain untuk kebutuhan database mereka.
SQL digunakan dalam berbagai aplikasi seperti aplikasi web, sistem manajemen inventaris,
sistem manajemen kepegawaian, sistem manajemen pelanggan, dan banyak lagi. SQL juga
digunakan oleh administrator database dan pengembang untuk melakukan tugas seperti
pemeliharaan, backup, dan pemulihan database.
SQL memiliki banyak fitur dan perintah yang dapat memungkinkan pengguna mengelola dan
mengakses data dalam database dengan lebih efektif dan efisien. Namun, SQL juga dapat
menjadi kompleks dan memerlukan pemahaman yang kuat tentang bahasa dan struktur
database untuk menggunakan secara efektif. Oleh karena itu, orang sering membutuhkan
pelatihan dan pengalaman untuk menguasai SQL.
DDL (Data Definition Language) dan DML (Data Manipulation Language) adalah dua kelompok
perintah SQL yang digunakan untuk mengelola dan memanipulasi struktur dan data dalam
sebuah database relasional.
DDL adalah kelompok perintah SQL yang digunakan untuk membuat, mengubah, dan
menghapus struktur database, seperti tabel, kolom, indeks, dan constraint. Perintah DDL
mencakup CREATE, ALTER, dan DROP. Contoh perintah DDL:
1. CREATE TABLE: CREATE TABLE digunakan untuk membuat sebuah tabel baru. Contohnya,
untuk membuat tabel "customers" dengan kolom "id", "name", "email", dan "phone", Anda
dapat menggunakan perintah berikut:
CREATE TABLE customers (
id INT PRIMARY KEY,
name VARCHAR(255),
email VARCHAR(255),
phone VARCHAR(20)
);
2. ALTER TABLE: ALTER TABLE digunakan untuk mengubah struktur tabel yang sudah ada.
Contohnya, untuk menambahkan kolom "address" ke tabel "customers", Anda dapat
menggunakan perintah berikut:
ALTER TABLE customers ADD COLUMN address VARCHAR(255);
3. DROP TABLE: DROP TABLE digunakan untuk menghapus sebuah tabel dari database.
Contohnya, untuk menghapus tabel "customers" dari database, Anda dapat menggunakan
perintah berikut:
DROP TABLE customers;
Dalam semua contoh di atas, perintah DDL dieksekusi untuk mendefinisikan struktur database,
yaitu tabel, kolom, indeks, dan constraint. Perintah DDL tidak memanipulasi data dalam tabel,
melainkan digunakan untuk membuat atau mengubah struktur tabel sesuai dengan kebutuhan
aplikasi.
DML adalah kelompok perintah SQL yang digunakan untuk memanipulasi data dalam tabel,
seperti memasukkan, menghapus, dan memperbarui data. Perintah DML mencakup INSERT,
UPDATE, DELETE, dan SELECT. Contoh perintah DML:
1. SELECT: SELECT digunakan untuk menampilkan data dari satu atau beberapa tabel dalam
database. Contohnya, untuk menampilkan semua data dari tabel "customers", Anda dapat
menggunakan perintah berikut:
SELECT * FROM customers;
2. INSERT: INSERT digunakan untuk menambahkan data baru ke dalam sebuah tabel.
Contohnya, untuk menambahkan data pelanggan baru ke dalam tabel "customers", Anda
dapat menggunakan perintah berikut:
INSERT INTO customers (name, email, phone) VALUES ('John Doe',
'johndoe@[Link]', '555-1234');
3. UPDATE: UPDATE digunakan untuk mengubah data yang sudah ada di dalam sebuah tabel.
Contohnya, untuk mengubah nomor telepon pelanggan dengan ID 1234 menjadi "555-
5678", Anda dapat menggunakan perintah berikut:
4. DELETE: DELETE digunakan untuk menghapus data dari sebuah tabel. Contohnya, untuk
menghapus data pelanggan dengan ID 5678 dari tabel "customers", Anda dapat
menggunakan perintah berikut:
DELETE FROM customers WHERE id = 5678;
Keduanya (DDL dan DML) adalah komponen kunci dalam SQL dan digunakan dalam kombinasi
untuk membangun aplikasi yang bergantung pada database. DDL dan DML harus digunakan
dengan hati-hati, karena dapat memengaruhi struktur dan data dalam database secara
signifikan.
1. Fleksibilitas, tidak mengharuskan struktur data yang tetap seperti database relasional
tradisional.
2. Skalabilitas, dapat dengan mudah ditingkatkan secara horizontal untuk menangani volume
data yang sangat besar.
3. Keterdistribusian, mendukung sistem terdistribusi dengan replikasi dan partisi data di
seluruh jaringan.
4. Kinerja tinggi, dirancang untuk memproses data dalam skala besar dengan cepat dan efisien.
1. Document databases, database yang mengelola dokumen dalam format JSON, XML, atau
BSON.
2. Key-value stores, database yang menyimpan data dalam bentuk pasangan key-value.
3. Column-family stores, database yang menyimpan data dalam format kolom, seperti tabel
spreadsheet.
4. Graph databases, database yang dirancang untuk menyimpan dan mengelola data terkait
dalam bentuk grafik.
1. MongoDB: Salah satu database NoSQL paling populer dan sering digunakan, MongoDB
adalah sebuah document database yang dirancang untuk menyimpan dan mengelola data
dalam format dokumen JSON. MongoDB dapat digunakan untuk berbagai keperluan seperti
penyimpanan data, caching, dan pengindeksan.
2. Cassandra: Merupakan sebuah database NoSQL kolom keluarga, yang terkenal untuk
kemampuan skala yang tinggi dan performa baca-tulis yang cepat. Cassandra sering
digunakan dalam aplikasi big data dan Internet of Things (IoT).
3. Couchbase: Database NoSQL yang dirancang untuk menggabungkan keunggulan dari
model database dokument dan key-value store. Couchbase dapat digunakan untuk aplikasi
berbasis data yang sangat terdistribusi dan membutuhkan performa tinggi.
Sebagaimana sistem database relasional yangmemiliki keunggulan dan juga kelemahan, berikut
adalah beberapa keunggulan dan kelemahan dari database NoSQL:
Keunggulan:
1. Skalabilitas: NoSQL dirancang untuk dapat dengan mudah di skalakan secara horizontal,
yang memungkinkan pengguna untuk menambahkan lebih banyak node atau server untuk
meningkatkan kapasitas penyimpanan dan kinerja.
2. Kinerja tinggi: Database NoSQL dirancang untuk kinerja tinggi dalam pengolahan data
dalam skala besar.
3. Fleksibilitas data: NoSQL memungkinkan penyimpanan data semi-struktur atau tidak
terstruktur, yang membuatnya lebih fleksibel dalam menangani data yang tidak cocok
dengan format tabel relasional tradisional.
4. Biaya yang lebih rendah: Database NoSQL memungkinkan pengguna untuk menghemat
biaya hardware dan administrasi database, karena skala horizontal memungkinkan untuk
menggunakan server murah yang mudah diakses dan dielola.
Kelemahan:
Referensi
Amazon Web Services. (2023). Amazon DynamoDB. Diakses pada 18 Februari 2023, dari
[Link]
Amazon Web Services. (2023). What is NoSQL? Diakses pada 18 Februari 2023, dari
[Link]
© Sofyan Thayf, 2023 Page | 77
Apache Cassandra. (2023). Cassandra. Diakses pada 18 Februari 2023, dari
[Link]
Codd, E. F. (1970). A Relational Model of Data for Large Shared Data Banks. Communications of
the ACM, 13(6), 377-387.
Connolly, T., & Begg, C. (2014). Database systems: a practical approach to design,
implementation, and management. Pearson Education Limited.
Elmasri, R., & Navathe, S. B. (2010). Fundamentals of database systems. Pearson Education.
Oracle Corporation. (2021). SQL Language Reference. Diakses pada 18 Februari 2023, dari
[Link]
Redmond, E., & Wilson, J. R. (2012). Seven databases in seven weeks: a guide to modern
databases and the NoSQL movement. Pragmatic Bookshelf.
Sadalage, P. J., & Fowler, M. (2012). NoSQL Distilled: A Brief Guide to the Emerging World of
Polyglot Persistence. Addison-Wesley Professional.
Silberschatz, A., Korth, H. F., & Sudarshan, S. (2010). Database System Concepts. McGraw-Hill
Education.
Pengertian Pemrograman
Pemrograman (Programming), dalam hal ini adalah pemrograman komputer, adalah suatu
proses menciptakan perangkat lunak (software) yang dapat mengeksekusi berbagai tugas dan
fungsi sesuai dengan kebutuhan. Pemrograman melibatkan penggunaan bahasa pemrograman
untuk membuat kode atau instruksi yang dapat dijalankan oleh komputer. Proses pemrograman
mencakup perencanaan, merancang, menulis kode, menguji, dan memelihara aplikasi atau
program yang dibuat. Kode yang dihasilkan dari pemrograman akan mengontrol perilaku dan
tampilan perangkat lunak, serta dapat diubah atau diperbaiki sesuai kebutuhan.
Tujuan utama dari pemrograman adalah untuk menciptakan solusi untuk masalah yang dihadapi
oleh pengguna, baik itu untuk kebutuhan bisnis, akademis, hiburan, atau lainnya. Dalam era
digital saat ini, pemrograman sangat penting dalam mengembangkan teknologi dan sistem
yang dapat membantu meningkatkan efisiensi dan produktivitas dalam berbagai bidang.
Ada banyak bahasa pemrograman yang dapat digunakan untuk menciptakan perangkat lunak,
seperti C, C++, Java, Python, Ruby, dan masih banyak lagi. Masing-masing bahasa
pemrograman memiliki kelebihan dan kekurangan sendiri-sendiri, dan dipilih berdasarkan jenis
program yang akan dibuat dan kemampuan pengguna dalam menggunakan bahasa
pemrograman tersebut.
Pemrograman sangat erat kaitannya dengan data sains karena pemrograman digunakan untuk
memproses, menganalisis, dan memvisualisasikan data dalam bidang data sains. Pemrograman
memungkinkan para ilmuwan data untuk mengembangkan algoritma, membuat model
prediktif, dan menghasilkan visualisasi data yang bermanfaat untuk memahami dan
mengekstrak informasi dari data.
Sangat penting bagi para ilmuwan data untuk menguasai pemrograman komputer. Dalam dunia
data sains, pemrograman komputer digunakan untuk mengelola, menganalisis, dan
memvisualisasikan data. Dengan menguasai pemrograman komputer, para ilmuwan data dapat
mengembangkan algoritma dan program yang dapat memproses data dengan lebih efektif,
menghasilkan model prediktif yang lebih akurat, serta memvisualisasikan data dengan lebih jelas
dan informatif.
Selain itu, dengan menguasai pemrograman komputer, para ilmuwan data dapat
mengotomatisasi tugas-tugas analisis data, sehingga mereka dapat lebih efisien dalam bekerja.
Para ilmuwan data juga dapat memodifikasi atau mengembangkan ulang algoritma atau
program yang sudah ada untuk memenuhi kebutuhan analisis data yang lebih spesifik.
Kelebihan:
1. Efisiensi dalam pengolahan dan analisis data: Dengan programming, data dapat diolah dan
dianalisis dengan lebih cepat dan efisien daripada menggunakan perangkat lunak yang
sudah jadi.
2. Fleksibilitas dalam pemrosesan data: Dalam programming, Anda dapat menyesuaikan
pemrosesan data dengan kebutuhan Anda. Anda dapat menggabungkan beberapa teknik
analisis dan pemrosesan data untuk menghasilkan hasil yang lebih baik.
3. Kemampuan untuk membuat algoritma kustom: Dalam programming, Anda dapat membuat
algoritma kustom untuk memecahkan masalah yang spesifik. Algoritma kustom dapat
dibangun dari awal atau dimodifikasi dari algoritma yang sudah ada.
4. Reproduktibilitas analisis: Programming memungkinkan analisis dapat direproduksi dengan
mudah dan diperbarui secara teratur.
Kekurangan:
1. Butuh waktu untuk belajar: Programming membutuhkan waktu untuk mempelajari bahasa
pemrograman dan teknik pemrosesan data.
2. Memerlukan hardware yang cukup baik: Pengolahan data besar memerlukan hardware yang
cukup baik seperti CPU dan RAM yang cukup besar.
3. Memerlukan pengetahuan matematika yang cukup: Programming untuk data sains
memerlukan pemahaman matematika yang cukup baik, seperti statistik dan kalkulus.
4. Perlu memperbarui program: Perkembangan dalam teknologi data sains dan bahasa
pemrograman yang digunakan berubah dengan cepat, sehingga perlu untuk memperbarui
program dengan teratur.
Python adalah salah satu bahasa pemrograman yang paling populer dalam data sains. Python
menawarkan banyak library dan framework yang berguna untuk pemrosesan data, visualisasi,
dan pembuatan model machine learning. Berikut adalah beberapa library Python yang populer
untuk data sains:
1. NumPy: library Python untuk pemrosesan data numerik yang cepat dan efisien, termasuk
operasi matriks dan statistik dasar.
2. Pandas: library Python untuk manipulasi dan analisis data yang memungkinkan untuk
membaca, menulis, dan memanipulasi data dalam berbagai format, seperti CSV, Excel, dan
SQL.
3. Matplotlib: library Python untuk visualisasi data yang memungkinkan membuat berbagai
jenis plot, seperti scatter plot, line plot, dan histogram.
4. Seaborn: library Python yang memungkinkan membuat plot yang lebih indah dan informatif
daripada Matplotlib.
5. Scikit-Learn: library Python untuk pembelajaran mesin yang memungkinkan membuat model
machine learning, seperti regresi, klasifikasi, dan klastering.
6. TensorFlow: library Python untuk deep learning yang memungkinkan membuat model
neural network yang kompleks.
7. Keras: library Python untuk deep learning yang memungkinkan membuat model neural
network yang lebih mudah.
Python juga memiliki banyak tools untuk mempermudah pemrograman data sains, seperti
Jupyter Notebook, Spyder, dan PyCharm. Jupyter Notebook adalah lingkungan pengembangan
interaktif yang memungkinkan membuat, berbagi, dan mempresentasikan kode Python dalam
format yang interaktif dan mudah dibaca. Spyder adalah IDE (Integrated Development
Environment) untuk Python yang khusus untuk pemrograman data sains. PyCharm adalah IDE
Python yang lebih umum dan mendukung banyak bahasa pemrograman.
Pemrograman R
R juga merupakan bahasa pemrograman yang populer untuk data sains dan statistik. R
menyediakan banyak paket (packages) dan fungsi untuk analisis data, visualisasi, dan
pembuatan model machine learning. Berikut adalah beberapa paket R yang populer untuk data
sains:
1. ggplot2: paket R untuk visualisasi data yang memungkinkan membuat berbagai jenis plot,
seperti scatter plot, line plot, dan histogram.
2. dplyr: paket R untuk manipulasi data yang memungkinkan untuk membaca, menulis, dan
memanipulasi data dalam berbagai format, seperti CSV, Excel, dan SQL.
R juga memiliki banyak IDE (Integrated Development Environment) yang populer untuk
pemrograman data sains, seperti RStudio dan Jupyter Notebook. RStudio adalah IDE R yang
populer dan mendukung banyak fitur untuk pemrograman data sains, seperti debugging,
version control, dan project management. Jupyter Notebook adalah lingkungan pengembangan
interaktif yang memungkinkan membuat, berbagi, dan mempresentasikan kode R dalam format
yang interaktif dan mudah dibaca.
Python dan R keduanya sangat populer di kalangan data saintis dan analis data sebagai bahasa
pemrograman untuk pemrosesan dan analisis data. Kedua bahasa pemrograman ini memiliki
kelebihan dan kekurangan masing-masing yang dapat dipertimbangkan sebelum memilih
bahasa pemrograman yang cocok untuk tujuan tertentu. Berikut adalah perbandingan Python
dan R sebagai panduan untuk memilih:
1. Kemampuan: Python memiliki kemampuan yang lebih luas dan dapat digunakan untuk
berbagai macam tujuan, seperti pengembangan web, pemrograman aplikasi, dan
pembuatan game. Sementara itu, R dirancang khusus untuk analisis data dan statistik.
2. Ketersediaan paket: Python memiliki lebih banyak paket (libraries) yang tersedia untuk
pengolahan data dan machine learning, seperti NumPy, Pandas, dan Scikit-learn. Namun, R
memiliki lebih banyak paket yang didesain khusus untuk analisis data dan statistik, seperti
ggplot2 dan dplyr.
3. Kegunaan: Jika tujuan utama adalah membuat visualisasi data dan menganalisis data dalam
lingkungan statistik, R mungkin menjadi pilihan yang lebih baik. Namun, jika tujuan utama
adalah membuat model machine learning dan mengembangkan aplikasi web yang
kompleks, maka Python mungkin menjadi pilihan yang lebih baik.
4. Kemudahan penggunaan: Python lebih mudah dipelajari dan lebih intuitif untuk pemula.
Sementara itu, R memiliki kurva belajar yang lebih tinggi dan lebih sulit dipahami oleh
pemula.
5. Komunitas: Keduanya memiliki komunitas pengguna yang besar dan aktif. Namun, Python
memiliki komunitas yang lebih besar dan luas, sehingga lebih banyak sumber daya yang
tersedia untuk dipelajari.
Pilihan antara Python dan R tergantung pada kebutuhan dan preferensi individu. Jika fokus
utama adalah pada pengolahan data dan analisis statistik, R mungkin menjadi pilihan yang lebih
baik. Namun, jika fokus utama adalah pada pengembangan aplikasi web dan model machine
learning, Python mungkin menjadi pilihan yang lebih baik.
Berikut adalah beberapa strategi yang bisa dipakai oleh data saintis pemula untuk mempelajari
pemrograman data sains:
1. Mulailah dengan bahasa pemrograman yang relatif mudah dipelajari, seperti Python atau R.
Kedua bahasa ini sangat populer di kalangan data saintis dan memiliki banyak sumber daya
belajar yang tersedia.
2. Pelajari dasar-dasar pemrograman, termasuk konsep seperti variabel, tipe data, loop, dan
fungsi. Memahami konsep-konsep ini sangat penting sebelum mempelajari bahasa
pemrograman tertentu.
3. Pelajari paket (libraries) khusus untuk pengolahan data dan analisis statistik, seperti NumPy
dan Pandas di Python, atau ggplot2 dan dplyr di R. Paket-paket ini akan membantu
memudahkan dan mempercepat proses pengolahan dan analisis data.
4. Mengikuti kursus online atau tutorial yang tersedia secara gratis, seperti di Coursera, edX,
atau Udacity. Kursus ini bisa membantu mempercepat pembelajaran dan memberikan
sertifikat yang dapat digunakan sebagai referensi saat melamar pekerjaan.
5. Praktekkan dan terapkan apa yang dipelajari dengan cara membuat project sederhana
seperti membuat grafik visualisasi data, analisis statistik sederhana, atau membangun model
machine learning sederhana. Hal ini akan membantu meningkatkan pemahaman dan
kemampuan dalam menggunakan bahasa pemrograman untuk pengolahan data dan
analisis statistik.
6. Ikuti komunitas data saintis dan forum online seperti Kaggle, GitHub, atau Stack Overflow.
Komunitas ini bisa membantu dalam belajar dan memecahkan masalah serta mendapatkan
referensi sumber belajar yang baik.
7. Baca buku tentang data sains dan pemrograman seperti Data Science from Scratch oleh Joel
Grus, Python for Data Analysis oleh Wes McKinney, atau R for Data Science oleh Hadley
Referensi
Grolemund, G., & Wickham, H. (2017). R for Data Science: Import, Tidy, Transform, Visualize, and
Model Data. O'Reilly Media, Inc.
Hadley Wickham, ggplot2: Elegant Graphics for Data Analysis, Springer, 2009.
Jake VanderPlas, Python Data Science Handbook: Essential Tools for Working with Data, O'Reilly
Media, 2016.
Kelleher, J. D., Tierney, B., & Tierney, B. (2018). Data science an introduction. Chapman and
Hall/CRC.
Kevin J. Walchko, Machine learning in Robotics: Intelligent Machines for the Future, Packt
Publishing, 2020.
McKinney, W., et al. (2011). "Data Structures for Statistical Computing in Python". Proceedings of
the 9th Python in Science Conference. 3.
R. L. Krutz and R. D. Vines, Cloud Security: A Comprehensive Guide to Secure Cloud Computing,
Wiley, 2010. ISBN: 978-0470589870
Robert Sedgewick, Kevin Wayne, Algorithms, Addison-Wesley Professional, 2011. ISBN: 978-
0321573513
Wes McKinney, Python for Data Analysis: Data Wrangling with Pandas, NumPy, and IPython,
O'Reilly Media, 2012.
Yanchang Zhao, R and Data mining: Examples and Case Studies, Academic Press, 2012.
[Link]
[Link]
Big data memerlukan strategi visualisasi data yang efektif untuk mendapatkan wawasan dari data yang kompleks dan beragam, mempermudah interpretasi informasi, dan menyederhanakan analisis data dalam skala besar . Visualisasi data membantu mengurangi beban mental dalam membedah data dan mendukung pengambilan keputusan yang berbasis data .
Model regresi dan analisis klaster merupakan dua teknik yang digunakan dalam data mining. Regresi fokus pada model prediktif untuk memprediksi nilai numerik berdasarkan variabel lain, sementara analisis klaster mengelompokkan data ke dalam kelompok berdasarkan kesamaan tertentu tanpa prediksi langsung . Keduanya digunakan untuk mendapatkan wawasan yang berbeda dari data dan dapat saling melengkapi dalam analisis yang lebih komprehensif .
Supervised learning menggunakan dataset yang sudah diberi label untuk melatih algoritma agar dapat memprediksi atau mengklasifikasikan data baru, sedangkan unsupervised learning bekerja dengan data yang tidak diberi label untuk menemukan pola atau struktur tersembunyi tanpa panduan manual .
Evaluasi model machine learning penting untuk memastikan akurasi dan efektivitas model sebelum diimplementasikan . Proses ini melibatkan pengujian dengan data yang belum pernah dilihat sebelumnya untuk menentukan kemampuan model dalam membuat prediksi yang akurat dan mendasar .
Pemilihan jenis visualisasi data harus mempertimbangkan tujuan visualisasi, jenis data yang akan ditampilkan, ukuran data, dan audiens yang akan melihat visualisasi . Hal ini memastikan bahwa pesan visual disampaikan dengan jelas dan efektif .
Labeling dalam visualisasi data adalah teknik untuk menambahkan informasi pada visualisasi, seperti judul, penjelasan sumbu, atau sumber data . Ini digunakan untuk memberikan konteks lebih baik kepada audiens, meningkatkan kejelasan, dan membantu pemahaman terhadap data yang ditampilkan .
Visualisasi data menyederhanakan kompleksitas data, meningkatkan pemahaman, dan membantu dalam pengambilan keputusan yang lebih cepat dan baik. Ini terjadi karena data dapat dilihat dengan cara yang lebih intuitif dan lebih mudah dipahami . Visualisasi data yang efektif juga dapat mengkomunikasikan hasil analisis kepada pemangku kepentingan untuk mendapatkan dukungan dan pengakuan .
Metode pengolahan big data, termasuk clustering, klasifikasi, regresi, dan analisis asosiasi, membantu perusahaan memahami tren, pola, dan perilaku dalam data . Informasi ini digunakan untuk meningkatkan efisiensi operasional dengan memperbaiki layanan pelanggan, meningkatkan kualitas produk, dan membuat keputusan bisnis lebih baik .
Data sains penting karena membantu perusahaan mengumpulkan dan menganalisis data besar dari berbagai sumber seperti media sosial, transaksi bisnis, dan sensor IoT untuk memahami perilaku pelanggan, tren pasar, dan meningkatkan efisiensi operasional . Dengan data sains, perusahaan dapat membuat keputusan lebih tepat waktu dan cerdas, mengoptimalkan operasi, meningkatkan produktivitas, serta mengurangi biaya .
Data mining dan machine learning saling melengkapi dalam analisis data. Data mining digunakan untuk mengidentifikasi pola tersembunyi dalam data besar dan kompleks, sementara machine learning sering digunakan dalam data mining untuk membangun model prediktif . Machine learning membantu meningkatkan akurasi prediksi dan optimalisasi model, sedangkan data mining melakukan ekstraksi pengetahuan berharga dari data .