Tutorial Lengkap Apache Spark
Tutorial Lengkap Apache Spark
Apache Spark adalah mesin analitik data. Seri Tutorial Spark ini membahas Dasar-dasar Apache Spark dan
Spark MLlib, GraphX, Streaming, SQL dengan penjelasan mendetail dan contoh.
Berikut adalah gambaran umum tentang konsep dan contoh yang akan kami bahas dalam Apache Spark ini.
Tutorial
Spark Core
Spark Core adalah kerangka dasar dari Apache Spark. Ini berisi Pengatur Tugas Terdistribusi, Penjadwal Pekerjaan dan
Penangani fungsionalitas I/O dasar. Ini mengekspos komponen-komponen ini dan fungsionalitasnya melalui API yang tersedia.
dalam bahasa pemrograman Java, Python, Scala dan R.
Install Spark di Mac OS– Tutorial untuk menginstal Apache Spark di komputer dengan Mac OS.
Siapkan Proyek Java dengan Apache Spark– Tutorial Apache Spark untuk menyiapkan Proyek Java di Eclipse dengan Apache Spark
Perpustakaan dan mulai.
Spark Shell adalah shell interaktif yang memungkinkan kita mengakses API Spark. Spark menyediakan shell dalam dua pemrograman
Scala dan Python.
Scala Spark Shell– Tutorial untuk memahami penggunaan ScalaSpark Shell dengan Contoh Penghitungan Kata.
Shell Spark Python– Tutorial untuk memahami penggunaan Python Spark Shell dengan Contoh Hitung Kata.
Siapkan Apache Spark untuk berjalan dalam mode cluster Mandiri
Contoh Aplikasi Spark menggunakan Pythonuntuk memulai dengan pemrograman Aplikasi Spark.
Konfigurasi Ekosistem Apache Spark
Konfigurasi Aplikasi Spark– Tutorial Apache Spark untuk belajar cara mengonfigurasi Aplikasi Spark seperti jumlah
Inti Driver Spark, Master Spark, Mode Penyebaran, dll.
Mengonfigurasi Lingkungan Spark
Konfigurasi Pencatat
RDD Spark
Spark dibangun di atas RDD (Basis Data Terdistribusi Tahan Banting). RDD adalah kerangka kerja yang memberikan Spark kemampuan untuk
lakukan pemrosesan data paralel di kluster. Kita akan melalui Transformasi dan Tindakan RDD berikut.
Tentang Spark RDD
Buat RDD Spark
Cetak Elemen RDD
Baca file teks ke RDD Spark
Spark – Baca banyak file teks ke dalam satu RDD
Spark – RDD dengan objek kelas kustom
Peta RDD Spark
Pengurangan RDD Spark
Spark RDD FlatMap
Filter RDD Spark
Spark RDD Distinct
Spark RDD dengan Objek Kelas Kustom
Spark RDD foreachuntuk mengiterasi setiap elemen dari Dataset Terdistribusi.
Baca File JSON ke RDD
DataSet Spark
Baca File JSON ke DataSet Spark
Tulis DataSet Spark ke File JSON
Tambahkan kolom baru ke DataSet Spark
Gabungkan Dataset Spark
Klasifikasi menggunakan Regresi LogistikTutorial Apache Spark untuk memahami penggunaan Regresi Logistik di Spark
MLlib.
Klasifikasi menggunakan Naive Bayes– Tutorial Apache Spark untuk memahami penggunaan Naive Bayes Classifier di Spark
MLlib.
Regresi Generalisasi
Regresi Survival
Pohon Keputusan– Tutorial Apache Spark untuk memahami penggunaan Algoritma Pohon Keputusan di Spark MLlib.
Hutan Acak– Tutorial Apache Spark untuk memahami penggunaan algoritma Random Forest dalam Spark MLlib.
Pohon Peningkatan Gradasi
Rekomendasi menggunakan Alternating Least Squares (ALS)
Pengelompokan menggunakan KMeans– Panduan Apache Spark untuk memahami penggunaan Algoritma KMean di Spark MLlib untuk
Pengelompokan.
Pengelompokan menggunakan Campuran Gaussian
Ketika Apache Software Foundation memulai Hadoop, ia memiliki dua ide penting untuk implementasi:
MapReduce dan sistem penyimpanan skala keluar. Dengan data institusional, data sensor (IOT), data jejaring sosial
dll., yang tumbuh secara eksponensial, ada kebutuhan untuk menyimpan sejumlah besar data dengan biaya yang sangat sedikit. Jawabannya
adalah HDFS (Hadoop Distributed File System). Untuk memproses dan menganalisis jumlah besar ini
Informasi dari HDFS dengan sangat efisien, Apache Hadoop melihat kebutuhan akan mesin baru yang disebut MapReduce.
Dan segera MapReduce telah menjadi satu-satunya cara pemrosesan dan analisis data dengan Ekosistem Hadoop.
MapReduce menjadi satu-satunya pilihan, segera menyebabkan evolusi mesin baru untuk memproses dan menganalisis data sebesar itu.
toko informasi. Dan Apache Spark telah menjadi salah satu mesin menarik dari yang berkembang.
Spark awalnya dirancang dan dikembangkan oleh para pengembang di Berkeley AMPLab. Untuk memanfaatkan
komunitas terbuka yang luas di Apache dan membawa Spark kepada semua yang tertarik dalam analisis data, para pengembang telah
mendonasikan kode sumber ke Apache Software Foundation dan Apache Spark lahir. Oleh karena itu, Apache Spark adalah sebuah
proyek sumber terbuka dari Apache Software Foundation.
Hadoop vs Spark
Pemrosesan Data
Hadoop hanya mampu melakukan pemrosesan batch.
Framework memori fleksibel Apache Spark memungkinkannya untuk bekerja dengan data batch dan streaming waktu nyata.
Ini membuatnya cocok untuk analitik big data dan pemrosesan waktu nyata. Oleh karena itu Apache Spark dibuat, terus menerus
proses data streaming, penilaian ulang model dan menyampaikan hasil secara real-time dimungkinkan dalam big data
ekosistem.
Penanganan Pekerjaan
Dalam Hadoop, seseorang harus membagi seluruh pekerjaan mereka menjadi pekerjaan-pekerjaan kecil dan menghubungkannya bersama-sama untuk berjalan seiring.
MapReduce. Juga, API sulit untuk dipahami. Ini membuat pembangunan pekerjaan MapReduce yang memerlukan pemrosesan lama menjadi sulit.
sulit.
Di Spark, API dirancang dengan baik oleh para pengembang untuk para pengembang dan melakukan pekerjaan yang luar biasa dalam mempertahankannya.
Sederhana. Spark memungkinkan Anda menjelaskan seluruh pekerjaan dan menangani pekerjaan tersebut dengan sangat efisien untuk dieksekusi dalam bentuk paralel.
Spark selain sistem file terdistribusi, juga mendukung penggunaan basis data yang sangat populer seperti
MySQL, PostgreSQL, dll., dengan bantuan perpustakaan SQL-nya.
Mesin Apache Spark cepat untuk pemrosesan data skala besar dan memiliki fitur-fitur mencolok berikut:
Kecepatan Tinggi
Spark menjalankan program lebih cepat daripada Hadoop MapReduce: 100 kali lebih cepat dengan in-memory dan 10 kali lebih cepat dengan
memori disk
Kemudahan Penggunaan
Spark menyediakan lebih dari 80 operasi tingkat tinggi untuk membangun aplikasi paralel dengan mudah.
Kemudahan Pemrograman
Program Spark dapat dikembangkan menggunakan berbagai bahasa pemrograman sepertiJava, Scala, Python, R.
Tumpukan Perpustakaan
Spark menggabungkan SQL, Streaming, dan komputasi GrafdMLlib(Pembelajaran Mesin) bersama-sama untuk membawa masuk
generalisasi untuk aplikasi.
Lingkungan Berjalan
Spark dapat dijalankan di: mesin mandiri dalam mode kluster, Hadoop, Apache Mesos atau di cloud.
Apache Spark bekerja pada arsitektur master-slave. Ketika seorang klien mengirimkan kode aplikasi spark ke Spark
Pengemudi, Pengemudi Spark secara implisit mengubah transformasi dan tindakan menjadi (DAG) Graf Acyclic Terarah dan
mengirimkannya ke Penjadwal DAG (Selama konversi ini ke DAG, juga melakukan optimasi seperti jalur-pipa
transformasi). Sekarang, penjadwal DAG mengubah grafik logis (DAG) menjadi rencana tindakan fisik yang berisi tahap-tahap
tugas-tugas. Tugas-tugas ini dikemas untuk dikirim ke kluster.
Pengelola Cluster memantau sumber daya yang tersedia di cluster. Begitu Driver telah membuat dan mengemas
tugas, ia bernegosiasi dengan Manajer Kluster untuk node Pekerja. Setelah negosiasi (yang mengakibatkan alokasi
manajer klaster meluncurkan eksekutor di node pekerja dan membiarkan
pengemudi tahu tentang Eksekutor di Pekerja. Berdasarkan penempatan Eksekutor dan kemampuan jangkauannya
data, Driver mendistribusikan tugas kepada mereka. Setelah Executors siap untuk memulai tugas, mereka mendaftar
diri mereka sendiri dengan Driver, sehingga Driver dapat memiliki pandangan penuh tentang Executors dan memantau mereka selama tugas
pelaksanaan. Beberapa tugas tergantung pada data keluaran dari tugas lainnya. Dalam skenario seperti itu, Driver adalah
bertanggung jawab untuk menjadwalkan tugas-tugas masa depan ini di lokasi yang sesuai berdasarkan lokasi di mana data mungkin didapatkan
Saat Aplikasi Spark berjalan di driver, ia menampilkan informasi melalui Antarmuka Web kepada pengguna. Setelah
SparkContext telah dihentikan, para Executor akan diakhiri.
1. Layanan Keuangan
Mengidentifikasi transaksi yang fraudulent dan beradaptasi dengan teknik penipuan baru serta memperbarui model secara real-time adalah
diperlukan.
Dalam mengidentifikasi pola pembelian pelanggan terhadap saham dan membuat prediksi untuk penjualan saham, dll.
2. Pasar Ritel Online
Raksasa ritel online seperti Alibaba, Amazon, eBay menggunakan Spark untuk analitik pelanggan seperti merekomendasikan produk berdasarkan
sejarah penelusuran produk yang dibeli, pencatatan transaksi, dll.
3. Analisis Pengeluaran
Concur menggunakan spark untuk personalisasi dan analisis perjalanan dan pengeluaran.
Sekian banyak perusahaan dan organisasi yang menggunakan Apache Spark. Seluruh daftar tersediadi sini.
Ringkasan
Artikel ini memberikan pengantar yang baik tentang apa itu Apache Spark; fitur-fitur Apache Spark; nya
perbedaan dengan Apache Spark; modul apa saja yang ada di Apache Spark; berbagai operasi yang tersedia di
modul-modul dan akhirnya beberapa kasus penggunaan dalam waktu nyata.
Spark RDD
⊩ RDD Spark
⊩ Spark Parallelize
Spark Dataset
⊩ Pemodelan Topik
Spark SQL