0% menganggap dokumen ini bermanfaat (0 suara)
3 tayangan21 halaman

STORAGE Edited

Dokumen ini membahas pentingnya penyimpanan dalam rekayasa data, termasuk pemilihan jenis file, kompresi, dan strategi partisi yang tepat untuk meningkatkan produktivitas dan kecepatan. Berbagai jenis file seperti Parquet, Avro, ORC, CSV, dan JSON dijelaskan, bersama dengan pertimbangan dalam memilih antara SQL dan NoSQL. Selain itu, aspek keamanan, kepatuhan, skalabilitas, dan ketersediaan juga ditekankan sebagai faktor penting dalam pengelolaan penyimpanan data.

Diunggah oleh

bocah edan
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd
0% menganggap dokumen ini bermanfaat (0 suara)
3 tayangan21 halaman

STORAGE Edited

Dokumen ini membahas pentingnya penyimpanan dalam rekayasa data, termasuk pemilihan jenis file, kompresi, dan strategi partisi yang tepat untuk meningkatkan produktivitas dan kecepatan. Berbagai jenis file seperti Parquet, Avro, ORC, CSV, dan JSON dijelaskan, bersama dengan pertimbangan dalam memilih antara SQL dan NoSQL. Selain itu, aspek keamanan, kepatuhan, skalabilitas, dan ketersediaan juga ditekankan sebagai faktor penting dalam pengelolaan penyimpanan data.

Diunggah oleh

bocah edan
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd

STORAGE

CHAPTER 4
Pendahuluan
• Storage atau penyimpanan adalah salah satu bagian yang sering
diabaikan dalam rekayasa data.
• Sebagai data engineer, penting/wajib untuk mengetahui hal ikhwal
tentang storage, yaitu:
1. Rekayasa data sering kali dimulai dan diakhiri dengan file.
2. Ada beberapa jenis file yang umum digunakan di semua
rekayasa data.
3. Memahami kelebihan dan kekurangan berbagai jenis file adalah
hal yang penting.
4. Penyimpanan memainkan peran besar dalam big data.
Mengapa harus memahami storage?
• Pemilihan jenis file dan kompresi apa yang paling sesuai dengan kebutuhan
data dan pola akses serta harus dieksplorasi sebelumnya, bukan sekadar
“memilih” sesuatu karena mudah digunakan.
• Seorang data engineer yang mengetahui cara terbaik menata penyimpanan
file sangatlah berharga di era peralihan tipe data warehouse yang menggunakan
data lake.
• Banyak yang mengabaikan aspek storage, padahal begitu banyak yang perlu
dipelajari untuk peningkatan produktivitas dan kecepatan yang dapat
diperoleh dari aspek pemilihan penyimpanan file dan strategi partisi yang
tepat.
• Pengelolaan dan desain penyimpanan data yang baik adalah elemen kunci dalam
pengembangan dan pengoperasian solusi analitik dan bisnis yang sukses. Ini
memungkinkan organisasi untuk mengelola, menganalisis, dan memanfaatkan
data mereka secara efektif untuk mendukung pengambilan keputusan yang lebih
baik dan inovasi bisnis.
Konsep dasar penyimpanan
Berikut adalah enam dasar penyimpanan yang perlu dipahami oleh
setiap data engineer dalam mengerjakan pipeline, yaitu:
• Pola akses.
• SQL/NoSQL vs file.
• Jenis file.
• Kompresi.
• Lokasi penyimpanan.
• Partisi.
Pola Akses
Pola akses data menentukan bagaimana pengguna dan sistem
mengakses data untuk memenuhi kebutuhan bisnis. Hal ini mencakup
beberapa hal yang harus diingat yaitu:
• Berapa banyak sistem yang memerlukan akses ke lapisan
penyimpanan data?
• Seberapa sering sistem mengakses penyimpanan data?
• Berapa banyak data yang akan dibaca oleh sistem?
• Berapa banyak logika yang akan diterapkan oleh sistem tersebut
pada data?
• Bagaimana sistem secara teknis mengakses data?
Database SQL/NoSQL vs file (1/2)
Jika kita bekerja pada data berukuran kecil < 100 GB , bersifat
relasional dan transaksional dan memiliki banyak fitur dan kemudahan
penggunaan maka basis data tradisional merupakan hal yang telah
digunakan selama beberapa decade melalui SQL.
Pertimbangan memilih data menggunakan SQL :
• Apakah datanya tabular dan relasional?
• Volume data yang masuk maupun yang keluar
• Apakah data berupa struktur?
Database SQL/NoSQL vs file (2/2)
• Penyimpanan data yang tidak terstruktur dalam jumlah besar seperti
dokumen dapat dilakukan dengan NoSQL seperti MongoDB dan
DynamoDB.
Pertimbangan menggunakan data NoSQL :
• Volume request data yang tinggi.
• Ketersediaan data hampir real-time.
• Struktur data tipe dokumen.
Jenis File
Jenis file yang dipilih sebagai lapisan penyimpanan memiliki dampak
besar pada performa, hal yang menjadi pertimbangan dalam memilih
jenis file, adalah:
• Kompresi data
• Kegunaan jenis file
• Dukungan skema tipe data
• Penyimpanan baris (untuk menyisipkan dan membaca)
• Penyimpanan kolom (untuk analitik dan komputasi)
Jenis file
Berikut adalah jenis file yang sering ditemukan dalam pekerjaan data
engineering:
• parquet
• Avro
• Orc
• csv
• json
Jenis File (Parquet)
Parquet atau Apache Parquet adalah format file open source untuk
menyimpan data berorientasi kolom yang dirancang untuk penyimpanan dan
pengambilan data secara efisien.
Manfaat :
• Baik untuk data besar dalam bentuk apa pun (tabel data terstruktur,
gambar, video, dokumen).
• Menghemat ruang penyimpanan di cloud dengan menggunakan kompresi
kolom yang sangat efisien, dan skema pengodean yang fleksibel untuk
kolom dengan tipe data yang berbeda.
• Peningkatan throughput (penempatan) dan kinerja data dengan
menggunakan teknik seperti melewatkan data, di mana kueri yang
mengambil nilai kolom tertentu tidak perlu membaca seluruh baris data.
Jenis file (Avro)
Format data open source yang memaketkan data serial dengan skema
data dalam file yang sama. karakteristik :
• Lebih cepat dimuat. Data dapat dibaca secara paralel, meskipun blok
data dikompresi.
• Tidak memerlukan pengetikan atau serialisasi.
• Lebih mudah diurai karena tidak ditemukan masalah encoding dalam
format lain seperti ASCII.
• Saat Anda memuat file Avro ke BigQuery, skema tabel otomatis
diambil dari data sumber yang mendeskripsikan formatnya sendiri.
Jenis File (ORC)
format data berorientasi kolom open source yang banyak digunakan di
ekosistem Apache Hadoop.
karakteristik :
• File ORC terdiri dari Stripes…. kelompok data baris.
• Mendukung tipe data seperti “datetime, desimal, dan tipe
kompleks (struct, list, map)
• File dapat memiliki index yang Membantu dalam mencari baris dan
melewati grup baris saat menjadi pembaca
Jenis File (CSV)
File teks dengan semacam pemisah/pembatas antar nilai, biasanya
digunakan koma “,”, atau karakter |
Karakteristik :
• Tidak memiliki skema
• Tanpa kompresi
• Tanpa header
• Cocok untuk data kecil
Jenis File (JSON)
Sering digunakan untuk konfigurasi bukan sebagai jenis penyimpanan
utama.
Karakteristik :
• Baik untuk skema hirarki yang tidak teratur
• Tidak untuk data dalam jumlah besar
• Tidak menyediakan partisi
• Tidak mendukung kompresi
Kompresi
• Salah satu teknik untuk mengubah ukuran suatu File dari yang
berukuran besar menjadi berukuran kecil untuk mengoptimalisasi
penggunaan memori.
• kompresi dilakukan untuk menghemat ruang penyimpanan sehingga
dapat menekan biaya dalam penyimpanan.
Jenis kompresi file:
• gzip
• Tar
• snappy
• zip
Lokasi penyimpanan (1/2)
Lokasi penyimpanan dapat berupa :
- System file HDFS dan Hadoop yang telah menjadi salah satu kerangka
kerja paling populer untuk analisis Big Data namun telah dianggap
ketinggalan jaman untuk saat ini.
- Penyimpanan cloud yang disediakan oleh AWS, GCP, dan Azure
dapat dipertimbangkan karena kelebihannya:
1. ketersediaan tinggi dan akses dari mana saja
2. Tidak ada lagi network mount dan drive yang perlu
dipusingkan
Lokasi penyimpanan (2/2)
Namun selain kelebihan terdapat kerumitan/kekurangan penggunaan
cloud, yaitu:
• Mahir menggunakan antarmuka baris perintah CLI yang disediakan
oleh penyedia cloud
• Memahami paket dan library yang disediakan oleh perusahaan
cloud, seperti paket Python boto3
• Banyak opsi penyimpanan cloud yang populer, seperti s3, hanya
mengenakan biaya sepersekian sen per GB yang disimpan,
namun yang tidak disebutkan adalah biaya untuk membaca dan
menulis data tersebut.
Partisi (1/2)
• Salah satu fitur utama dari tools atau framework big data
• Merupakan pengelompokan data secara spesifik berdasarkan
kebutuhan bisnis.
Dampak positif yang akan diperoleh dengan partisi:
• mencegah program membaca seluruh direktori penyimpanan.
• memecah data secara logis.
• meningkatkan kinerja dan mengurangi biaya (lebih sedikit
membaca).
Partisi (2/2)
Dampak negative yang perlu diwaspadai dalam melakukan partisi:
• struktur data yang tidak fleksibel
• Proses Komputasi Tidak Efisien, Semakin banyak partisi berarti
semakin banyak proses yang mengantri
Hal Penting lainnya
Selain yang telah disebutkan di atas ada beberapa hal penting lainnya
yang juga perlu untuk diketahui dan dipertimbangkan:
• Keamanan dan kepatuhan data, penting untuk memperhatikan
keamanan dan kepatuhan data dalam penyimpanan bisnis, termasuk
enkripsi data, manajemen akses pengguna, audit log, kepatuhan
privasi data (seperti GDPR, CCPA), dan kepatuhan peraturan industri
yang relevan.
• Skalabilitas dan Ketersediaan, infrastruktur penyimpanan harus dapat
diskalakan secara horizontal atau vertikal sesuai kebutuhan bisnis.
Ketersediaan yang tinggi (high availability) juga penting untuk
memastikan akses terhadap data tanpa gangguan.
TERIMA KASIH

Anda mungkin juga menyukai