0% menganggap dokumen ini bermanfaat (0 suara)
8 tayangan6 halaman

Tutorial Lengkap Apache Spark

Dokumen ini adalah tutorial lengkap tentang Apache Spark, mencakup dasar-dasar, RDD, DataSet, MLlib, dan perbandingan dengan Hadoop. Tutorial ini juga menjelaskan fitur-fitur utama Spark, arsitektur runtime, dan berbagai kasus penggunaan dalam industri. Selain itu, terdapat panduan instalasi dan pengaturan untuk berbagai platform dan bahasa pemrograman.

Diterjemahkan oleh

ScribdTranslations
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd
0% menganggap dokumen ini bermanfaat (0 suara)
8 tayangan6 halaman

Tutorial Lengkap Apache Spark

Dokumen ini adalah tutorial lengkap tentang Apache Spark, mencakup dasar-dasar, RDD, DataSet, MLlib, dan perbandingan dengan Hadoop. Tutorial ini juga menjelaskan fitur-fitur utama Spark, arsitektur runtime, dan berbagai kasus penggunaan dalam industri. Selain itu, terdapat panduan instalasi dan pengaturan untuk berbagai platform dan bahasa pemrograman.

Diterjemahkan oleh

ScribdTranslations
Hak Cipta
© All Rights Reserved
Kami menangani hak cipta konten dengan serius. Jika Anda merasa konten ini milik Anda, ajukan klaim di sini.
Format Tersedia
Unduh sebagai PDF, TXT atau baca online di Scribd

Tutorial Apache Spark

Apache Spark adalah mesin analitik data. Seri Tutorial Spark ini membahas Dasar-dasar Apache Spark dan
Spark MLlib, GraphX, Streaming, SQL dengan penjelasan mendetail dan contoh.

Tutorial Apache Spark

Berikut adalah gambaran umum tentang konsep dan contoh yang akan kami bahas dalam Apache Spark ini.
Tutorial

Spark Core
Spark Core adalah kerangka dasar dari Apache Spark. Ini berisi Pengatur Tugas Terdistribusi, Penjadwal Pekerjaan dan
Penangani fungsionalitas I/O dasar. Ini mengekspos komponen-komponen ini dan fungsionalitasnya melalui API yang tersedia.
dalam bahasa pemrograman Java, Python, Scala dan R.

Untuk memulai dengan konsep dasar Apache Spark dan pengaturannya:

Install Spark di Mac OS– Tutorial untuk menginstal Apache Spark di komputer dengan Mac OS.
Siapkan Proyek Java dengan Apache Spark– Tutorial Apache Spark untuk menyiapkan Proyek Java di Eclipse dengan Apache Spark
Perpustakaan dan mulai.
Spark Shell adalah shell interaktif yang memungkinkan kita mengakses API Spark. Spark menyediakan shell dalam dua pemrograman
Scala dan Python.
Scala Spark Shell– Tutorial untuk memahami penggunaan ScalaSpark Shell dengan Contoh Penghitungan Kata.
Shell Spark Python– Tutorial untuk memahami penggunaan Python Spark Shell dengan Contoh Hitung Kata.
Siapkan Apache Spark untuk berjalan dalam mode cluster Mandiri
Contoh Aplikasi Spark menggunakan Pythonuntuk memulai dengan pemrograman Aplikasi Spark.
Konfigurasi Ekosistem Apache Spark
Konfigurasi Aplikasi Spark– Tutorial Apache Spark untuk belajar cara mengonfigurasi Aplikasi Spark seperti jumlah
Inti Driver Spark, Master Spark, Mode Penyebaran, dll.
Mengonfigurasi Lingkungan Spark
Konfigurasi Pencatat

RDD Spark
Spark dibangun di atas RDD (Basis Data Terdistribusi Tahan Banting). RDD adalah kerangka kerja yang memberikan Spark kemampuan untuk
lakukan pemrosesan data paralel di kluster. Kita akan melalui Transformasi dan Tindakan RDD berikut.
Tentang Spark RDD
Buat RDD Spark
Cetak Elemen RDD
Baca file teks ke RDD Spark
Spark – Baca banyak file teks ke dalam satu RDD
Spark – RDD dengan objek kelas kustom
Peta RDD Spark
Pengurangan RDD Spark
Spark RDD FlatMap
Filter RDD Spark
Spark RDD Distinct
Spark RDD dengan Objek Kelas Kustom
Spark RDD foreachuntuk mengiterasi setiap elemen dari Dataset Terdistribusi.
Baca File JSON ke RDD

DataSet Spark
Baca File JSON ke DataSet Spark
Tulis DataSet Spark ke File JSON
Tambahkan kolom baru ke DataSet Spark
Gabungkan Dataset Spark

Spark MLlib – Tutorial Apache Spark


Penjelasan rinci dengan contoh untuk setiap yang tersediapembelajaran mesinalgoritma disediakan di bawah ini :

Klasifikasi menggunakan Regresi LogistikTutorial Apache Spark untuk memahami penggunaan Regresi Logistik di Spark
MLlib.
Klasifikasi menggunakan Naive Bayes– Tutorial Apache Spark untuk memahami penggunaan Naive Bayes Classifier di Spark
MLlib.
Regresi Generalisasi
Regresi Survival
Pohon Keputusan– Tutorial Apache Spark untuk memahami penggunaan Algoritma Pohon Keputusan di Spark MLlib.
Hutan Acak– Tutorial Apache Spark untuk memahami penggunaan algoritma Random Forest dalam Spark MLlib.
Pohon Peningkatan Gradasi
Rekomendasi menggunakan Alternating Least Squares (ALS)
Pengelompokan menggunakan KMeans– Panduan Apache Spark untuk memahami penggunaan Algoritma KMean di Spark MLlib untuk

Pengelompokan.
Pengelompokan menggunakan Campuran Gaussian

Pemodelan Topik di Sparkmenggunakan Kondisi Dirichlet Tersembunyi


Itemset yang Sering
Aturan Asosiasi
Penambangan Pola Berurutan

Bagaimana Spark masuk ke dalam Ekosistem Big Data

Ketika Apache Software Foundation memulai Hadoop, ia memiliki dua ide penting untuk implementasi:
MapReduce dan sistem penyimpanan skala keluar. Dengan data institusional, data sensor (IOT), data jejaring sosial
dll., yang tumbuh secara eksponensial, ada kebutuhan untuk menyimpan sejumlah besar data dengan biaya yang sangat sedikit. Jawabannya
adalah HDFS (Hadoop Distributed File System). Untuk memproses dan menganalisis jumlah besar ini
Informasi dari HDFS dengan sangat efisien, Apache Hadoop melihat kebutuhan akan mesin baru yang disebut MapReduce.
Dan segera MapReduce telah menjadi satu-satunya cara pemrosesan dan analisis data dengan Ekosistem Hadoop.
MapReduce menjadi satu-satunya pilihan, segera menyebabkan evolusi mesin baru untuk memproses dan menganalisis data sebesar itu.
toko informasi. Dan Apache Spark telah menjadi salah satu mesin menarik dari yang berkembang.

Spark awalnya dirancang dan dikembangkan oleh para pengembang di Berkeley AMPLab. Untuk memanfaatkan
komunitas terbuka yang luas di Apache dan membawa Spark kepada semua yang tertarik dalam analisis data, para pengembang telah
mendonasikan kode sumber ke Apache Software Foundation dan Apache Spark lahir. Oleh karena itu, Apache Spark adalah sebuah
proyek sumber terbuka dari Apache Software Foundation.

Hadoop vs Spark

Berikut adalah beberapa perbedaan antara Hadoop dan Spark:

Pemrosesan Data
Hadoop hanya mampu melakukan pemrosesan batch.

Framework memori fleksibel Apache Spark memungkinkannya untuk bekerja dengan data batch dan streaming waktu nyata.
Ini membuatnya cocok untuk analitik big data dan pemrosesan waktu nyata. Oleh karena itu Apache Spark dibuat, terus menerus
proses data streaming, penilaian ulang model dan menyampaikan hasil secara real-time dimungkinkan dalam big data
ekosistem.

Penanganan Pekerjaan

Dalam Hadoop, seseorang harus membagi seluruh pekerjaan mereka menjadi pekerjaan-pekerjaan kecil dan menghubungkannya bersama-sama untuk berjalan seiring.

MapReduce. Juga, API sulit untuk dipahami. Ini membuat pembangunan pekerjaan MapReduce yang memerlukan pemrosesan lama menjadi sulit.

sulit.

Di Spark, API dirancang dengan baik oleh para pengembang untuk para pengembang dan melakukan pekerjaan yang luar biasa dalam mempertahankannya.
Sederhana. Spark memungkinkan Anda menjelaskan seluruh pekerjaan dan menangani pekerjaan tersebut dengan sangat efisien untuk dieksekusi dalam bentuk paralel.

Dukungan untuk basis data yang ada


Hadoop hanya dapat memproses data yang ada dalam sistem file terdistribusi (HDFS).

Spark selain sistem file terdistribusi, juga mendukung penggunaan basis data yang sangat populer seperti
MySQL, PostgreSQL, dll., dengan bantuan perpustakaan SQL-nya.

Fitur Apache Spark

Mesin Apache Spark cepat untuk pemrosesan data skala besar dan memiliki fitur-fitur mencolok berikut:

Kecepatan Tinggi
Spark menjalankan program lebih cepat daripada Hadoop MapReduce: 100 kali lebih cepat dengan in-memory dan 10 kali lebih cepat dengan

memori disk

Kemudahan Penggunaan

Spark menyediakan lebih dari 80 operasi tingkat tinggi untuk membangun aplikasi paralel dengan mudah.

Kemudahan Pemrograman
Program Spark dapat dikembangkan menggunakan berbagai bahasa pemrograman sepertiJava, Scala, Python, R.

Tumpukan Perpustakaan
Spark menggabungkan SQL, Streaming, dan komputasi GrafdMLlib(Pembelajaran Mesin) bersama-sama untuk membawa masuk
generalisasi untuk aplikasi.

Dukungan untuk sumber data


Spark dapat mengakses data di HDFS, HBase, Cassandra, Tachyon, Hive, dan sumber data Hadoop mana pun.

Lingkungan Berjalan
Spark dapat dijalankan di: mesin mandiri dalam mode kluster, Hadoop, Apache Mesos atau di cloud.

Arsitektur Runtime Apache Spark

Apache Spark bekerja pada arsitektur master-slave. Ketika seorang klien mengirimkan kode aplikasi spark ke Spark
Pengemudi, Pengemudi Spark secara implisit mengubah transformasi dan tindakan menjadi (DAG) Graf Acyclic Terarah dan
mengirimkannya ke Penjadwal DAG (Selama konversi ini ke DAG, juga melakukan optimasi seperti jalur-pipa
transformasi). Sekarang, penjadwal DAG mengubah grafik logis (DAG) menjadi rencana tindakan fisik yang berisi tahap-tahap
tugas-tugas. Tugas-tugas ini dikemas untuk dikirim ke kluster.

Pengelola Cluster memantau sumber daya yang tersedia di cluster. Begitu Driver telah membuat dan mengemas
tugas, ia bernegosiasi dengan Manajer Kluster untuk node Pekerja. Setelah negosiasi (yang mengakibatkan alokasi
manajer klaster meluncurkan eksekutor di node pekerja dan membiarkan
pengemudi tahu tentang Eksekutor di Pekerja. Berdasarkan penempatan Eksekutor dan kemampuan jangkauannya
data, Driver mendistribusikan tugas kepada mereka. Setelah Executors siap untuk memulai tugas, mereka mendaftar
diri mereka sendiri dengan Driver, sehingga Driver dapat memiliki pandangan penuh tentang Executors dan memantau mereka selama tugas
pelaksanaan. Beberapa tugas tergantung pada data keluaran dari tugas lainnya. Dalam skenario seperti itu, Driver adalah
bertanggung jawab untuk menjadwalkan tugas-tugas masa depan ini di lokasi yang sesuai berdasarkan lokasi di mana data mungkin didapatkan

cached atau disimpan.

Saat Aplikasi Spark berjalan di driver, ia menampilkan informasi melalui Antarmuka Web kepada pengguna. Setelah
SparkContext telah dihentikan, para Executor akan diakhiri.

Penggunaan Apache Spark


Apache Spark digunakan untuk menyelesaikan beberapa masalah produksi waktu nyata yang menarik dan berikut adalah
beberapa skenario:

1. Layanan Keuangan
Mengidentifikasi transaksi yang fraudulent dan beradaptasi dengan teknik penipuan baru serta memperbarui model secara real-time adalah
diperlukan.
Dalam mengidentifikasi pola pembelian pelanggan terhadap saham dan membuat prediksi untuk penjualan saham, dll.
2. Pasar Ritel Online
Raksasa ritel online seperti Alibaba, Amazon, eBay menggunakan Spark untuk analitik pelanggan seperti merekomendasikan produk berdasarkan
sejarah penelusuran produk yang dibeli, pencatatan transaksi, dll.
3. Analisis Pengeluaran
Concur menggunakan spark untuk personalisasi dan analisis perjalanan dan pengeluaran.

Sekian banyak perusahaan dan organisasi yang menggunakan Apache Spark. Seluruh daftar tersediadi sini.

Ringkasan

Artikel ini memberikan pengantar yang baik tentang apa itu Apache Spark; fitur-fitur Apache Spark; nya
perbedaan dengan Apache Spark; modul apa saja yang ada di Apache Spark; berbagai operasi yang tersedia di
modul-modul dan akhirnya beberapa kasus penggunaan dalam waktu nyata.

Pelajari Apache Spark

⊩ Tutorial Apache Spark

⊩ Instal Spark di Ubuntu

⊩ Instal Spark di Mac OS

⊩ Scala Spark Shell - Example

⊩ Python Spark Shell - PySpark

⊩ Siapkan Proyek Java dengan Spark

⊩ Aplikasi Spark Scala - Contoh WordCountmple

⊩ Aplikasi Spark Python

⊩ Rencana Eksekusi DAG & Fisik Spark

⊩ Siapkan Kluster Spark

⊩ Konfigurasi Ekosistem Spark

⊩ Konfigurasi Aplikasi Spark

⊩ Pengelola Kluster Spark

Spark RDD

⊩ RDD Spark

⊩ Spark RDD - Cetak Konten RDD

⊩ Spark RDD - foreach


⊩ Spark RDD - Buat RDD

⊩ Spark Parallelize

⊩ Spark RDD - Baca File Teks ke RDD

⊩ Spark RDD - Baca Beberapa Berkas Teks menjadi Satu RDD

⊩ Spark RDD - Membaca File JSON ke RDD

⊩ Spark RDD - Mengandung Objek Kelas Kustom

⊩ Spark RDD - Peta

⊩ Spark RDD - FlatMap

⊩ Spark RDD - Filter

⊩ Spark RDD - Distinct

⊩ Spark RDD - Reduce

Spark Dataset

⊩ Spark - Baca file JSON ke Dataset

⊩ Spark - Tulis Dataset ke file JSON

⊩ Spark - Tambah Kolom BarumntoDdataset

⊩ Spark - Menggabungkan Dataset

Spark MLlib (Pustaka Pembelajaran Mesin)

⊩ Tutorial Spark MLlib

⊩ KMeans Klustering & Klasifikasi

⊩ DecsayaKlasifikasi Pohon Keputusan

⊩ Klasifikasi Hutan Acak

⊩ Klasifikasi Naive Bayes

⊩ Klasifikasi Regresi Logistik

⊩ Pemodelan Topik

Spark SQL

⊩ Tutorial Spark SQL

⊩ Spark SQL - Memuat file JSON dan menjalankan kueri SQL

Nyalakan Orang Lain

⊩ Pertanyaan Wawancara Spark

Anda mungkin juga menyukai