All Products
Search
Document Center

E-MapReduce:Ikhtisar komponen

Last Updated:Jun 17, 2026

EMR menyediakan komponen open source dan komponen hasil pengembangan sendiri yang mencakup pengembangan data, mesin komputasi, layanan data, manajemen sumber daya, penyimpanan data, serta integrasi data. Anda dapat memilih dan mengonfigurasi komponen sesuai kebutuhan.

Catatan

Jika komponen yang ingin Anda gunakan tidak tersedia saat pembuatan kluster atau hanya tersedia untuk pengguna eksisting, Anda dapat menginstal dan mengelolanya sendiri.

EMR terdiri atas komponen open source, komponen hasil pengembangan sendiri, produk Alibaba Cloud terintegrasi, dan manajemen kluster. Lihat diagram arsitektur layanan untuk daftar lengkap komponen data besar beserta kasus penggunaannya.

Pengembangan data

Lapisan pengembangan data menyediakan alat visual dan manajemen kode untuk pengumpulan, pembersihan, pemodelan, analisis, serta penjadwalan tugas data. Lapisan ini membantu perusahaan mengelola dan memanfaatkan aset datanya secara efisien.

Untuk pengembangan data di EMR, Anda dapat menggunakan produk Alibaba Cloud DataWorks. Detailnya sebagai berikut:

Nama Produk

Deskripsi

Dokumentasi Umum

DataWorks

DataWorks menyediakan integrasi data end-to-end, pengembangan, tata kelola, manajemen kualitas, O&M, dan kontrol keamanan. Produk ini cocok untuk skenario yang memerlukan integrasi dan tata kelola data kompleks.

Untuk menggunakan komponen pengembangan data open source, Anda dapat memilih Hue dan Superset:

Jenis komponen

Nama Komponen

Deskripsi

Dokumentasi Umum

Open source

Hue

Hue hanya tersedia untuk pengguna eksisting.

Hue adalah antarmuka web open source untuk berinteraksi dengan ekosistem Apache Hadoop.

Hue

Superset

Superset hanya tersedia untuk pengguna eksisting.

Superset adalah alat visualisasi data yang menyediakan fitur visualisasi dan Dasbor yang kaya.

Superset

Mesin komputasi

EMR mendukung mesin komputasi utama untuk pemrosesan batch, analisis interaktif, pemrosesan aliran, dan pembelajaran mesin. Mesin-mesin ini mengubah struktur dan logika data agar memenuhi persyaratan berbagai skenario data besar.

Jenis komponen

Nama komponen

Deskripsi

Dokumentasi terkait

Open source

Spark

Spark adalah mesin pemrosesan data besar yang cepat dan serbaguna, menyediakan komputasi in-memory serta mendukung pemrosesan batch, pemrosesan real-time, pembelajaran mesin, dan komputasi graf.

Hive

Hive adalah alat gudang data berbasis Hadoop yang menyediakan HiveQL, bahasa kueri mirip SQL, untuk menyimpan, mengkueri, dan menganalisis data berskala besar di Hadoop.

StarRocks

StarRocks adalah database Pemrosesan Paralel Masif (MPP) generasi berikutnya yang berkecepatan tinggi, mendukung analisis multidimensi Pemrosesan Analitik Online (OLAP), kueri konkurensi tinggi, dan analitik real-time.

Doris

Doris adalah database analitik real-time berkinerja tinggi yang sangat cocok untuk analisis laporan, kueri ad hoc, dan akselerasi kueri terfederasi untuk data lake.

ClickHouse

ClickHouse adalah sistem manajemen database berorientasi kolom open source yang dirancang untuk Pemrosesan Analitik Online (OLAP) yang efisien dan kueri cepat pada dataset berskala masif.

Trino

Trino, sebelumnya dikenal sebagai PrestoSQL, adalah mesin kueri SQL terdistribusi open source yang cocok untuk kueri analitik interaktif.

Flink

Flink adalah mesin pemrosesan aliran yang mendukung pemrosesan aliran data real-time berskala besar.

Presto

Presto, juga dikenal sebagai PrestoDB, adalah mesin kueri SQL terdistribusi yang fleksibel dan skalabel, cocok untuk kueri analitik interaktif.

Tez

Apache Tez adalah framework pemrosesan data besar terdistribusi yang menyediakan model eksekusi Grafik Asiklik Terarah (DAG) yang efisien dan fleksibel. Komponen ini terutama berfungsi sebagai pengganti MapReduce untuk mengoptimalkan kinerja kueri dan pemrosesan batch.

Tez

Phoenix

Phoenix adalah lapisan tengah SQL yang dibangun di atas HBase, memungkinkan Anda menggunakan sintaks SQL standar untuk mengkueri dan mengelola data yang disimpan di HBase.

Phoenix

Impala

Impala hanya tersedia untuk pengguna eksisting.

Impala menyediakan kueri SQL berkinerja tinggi dengan latensi rendah untuk data yang disimpan di Apache Hadoop.

Kudu

Kudu hanya tersedia untuk pengguna eksisting.

Kudu adalah manajer penyimpanan berorientasi kolom terdistribusi dan skalabel yang menyediakan operasi baca/tulis acak berlatensi rendah serta analitik data yang efisien.

Druid

Druid hanya tersedia untuk pengguna eksisting.

Druid adalah sistem analitik real-time terdistribusi berbasis memori untuk kueri interaktif cepat pada dataset berskala besar.

Druid

Layanan data

Lapisan layanan data menyediakan enkripsi data, kontrol akses, kueri data, akses data, dan kemampuan API untuk meningkatkan keamanan data, kinerja operasional, serta efisiensi analisis di lingkungan data besar.

Jenis komponen

Nama Komponen

Deskripsi

Dokumentasi terkait

Open source

Ranger

Ranger adalah framework manajemen keamanan terpusat untuk pengelolaan izin dan audit di ekosistem Hadoop.

Kerberos

Kerberos adalah protokol autentikasi identitas yang menggunakan teknologi kunci simetris untuk menyediakan verifikasi identitas bagi layanan lain dan mendukung Single Sign-On (SSO).

OpenLDAP

OpenLDAP adalah implementasi open source dari protokol LDAP untuk mengelola dan menyimpan informasi pengguna serta sumber daya. Komponen ini menyediakan fitur manajemen pengguna dan autentikasi identitas.

OpenLDAP

Kyuubi

Kyuubi adalah gerbang SQL terdistribusi multi-penyewa yang menyederhanakan analisis data dan pemrosesan kueri dengan menyediakan layanan kueri SQL dan lainnya untuk mesin kueri data lake.

Zookeeper

ZooKeeper adalah layanan koordinasi terdistribusi untuk mengelola tugas-tugas penting dalam aplikasi terdistribusi, seperti konfigurasi, sinkronisasi, dan penamaan. Layanan ini menyediakan solusi manajemen kluster yang konsisten, berkinerja tinggi, dan andal.

Knox

Knox adalah gerbang API REST yang menyederhanakan akses aman ke Hadoop dan komponen terkait sekaligus menyediakan autentikasi identitas dan kontrol akses terpadu.

Knox

Livy

Livy adalah layanan yang berinteraksi dengan Spark melalui antarmuka REST atau pustaka klien RPC.

Livy

Kafka Manager

Kafka Manager hanya tersedia untuk pengguna eksisting.

Kafka Manager adalah alat manajemen kluster untuk Kafka yang menyediakan antarmuka web untuk mengelola dan memantau kluster Kafka.

Kafka Manager

Pengembangan sendiri

DLF-Auth

DLF-Auth disediakan oleh Data Lake Formation (DLF) dan memungkinkan kontrol akses detail halus terhadap database, tabel, kolom, dan fungsi yang dikelola oleh DLF, sehingga memungkinkan manajemen izin data terpadu pada data lake.

DLF-Auth

Manajemen sumber daya

Lapisan manajemen sumber daya menyediakan penjadwalan dan alokasi sumber daya yang efisien, memungkinkan penjadwalan tugas otomatis, alokasi sumber daya cerdas, serta skalabilitas elastis kluster guna meningkatkan efisiensi dan keandalan pemrosesan data besar.

Jenis komponen

Nama Komponen

Deskripsi

Dokumentasi terkait

Open source

YARN

YARN adalah sistem manajemen sumber daya untuk Hadoop yang menjadwalkan dan mengelola sumber daya kluster. YARN mendukung eksekusi berbagai jenis tugas komputasi terdistribusi pada sumber daya kluster bersama.

Penyimpanan data

Lapisan penyimpanan data mendukung penyimpanan terdistribusi untuk data terstruktur maupun tidak terstruktur. Anda dapat memilih metode penyimpanan yang sesuai dengan kebutuhan mesin komputasi Anda.

Jenis komponen

Nama Komponen

Deskripsi

Dokumentasi Umum

Pengembangan sendiri

OSS-HDFS

OSS-HDFS adalah solusi penyimpanan objek yang kompatibel dengan antarmuka Hadoop Distributed File System (HDFS), memungkinkan tugas komputasi data besar mengakses data di Alibaba Cloud OSS secara langsung menggunakan protokol HDFS standar.

JindoCache

JindoCache adalah solusi cache terdistribusi yang mempercepat akses data berskala besar dengan menyimpan blok data di memori guna meningkatkan kinerja baca dan mengurangi beban pada sistem penyimpanan dasar.

ESS

ESS hanya tersedia untuk pengguna eksisting. Pengguna baru sebaiknya menggunakan komponen Celeborn.

ESS adalah komponen ekstensi berbasis Shuffle yang mengoptimalkan masalah baca/tulis Shuffle.

ESS

JindoData

JindoData hanya tersedia untuk pengguna eksisting. Pengguna baru sebaiknya menggunakan komponen JindoCache.

JindoData adalah suite akselerasi penyimpanan data lake hasil pengembangan sendiri untuk ekosistem data besar dan AI. Komponen ini menyediakan solusi akselerasi akses komprehensif untuk sistem penyimpanan data lake utama dari Alibaba Cloud dan industri.

JindoData

SmartData

SmartData hanya tersedia untuk pengguna eksisting. Pengguna baru sebaiknya menggunakan komponen OSS-HDFS.

SmartData adalah komponen EMR hasil pengembangan sendiri yang menyediakan optimasi penyimpanan terpadu, optimasi cache, akselerasi komputasi, dan ekstensi fitur penyimpanan untuk mesin komputasi EMR. Komponen ini mencakup akses data, tata kelola data, dan keamanan data.

SmartData (hanya tersedia untuk pengguna eksisting)

Open source

Paimon

Paimon adalah format penyimpanan data lake terpadu untuk aliran dan batch yang mendukung penulisan throughput tinggi dan kueri latensi rendah.

Hudi

Hudi adalah format penyimpanan data lake yang mendukung pembaruan dan penghapusan data pada sistem file Hadoop serta mengonsumsi perubahan data.

Iceberg

Iceberg adalah format tabel data lake open source yang menyediakan operasi baca/tulis berkinerja tinggi serta manajemen metadata.

DeltaLake

DeltaLake adalah lapisan penyimpanan data open source. Komponen ini menyediakan transaksi atomicity, consistency, isolation, dan durability (ACID), pemrosesan metadata yang skalabel, serta pemrosesan aliran dan batch terpadu.

HDFS

Hadoop Distributed File System (HDFS) adalah sistem file terdistribusi untuk menyimpan dataset berskala besar. Sistem ini memiliki toleransi kesalahan tinggi dan throughput tinggi, serta menyimpan data secara redundan di beberapa node kluster.

HBase

HBase adalah database open source berorientasi kolom terdistribusi yang dibangun di atas sistem file Hadoop. Database ini menyediakan akses baca/tulis acak berlatensi rendah serta penyimpanan yang sangat andal untuk dataset berskala besar.

Celeborn

Celeborn adalah layanan yang memproses data antara guna meningkatkan stabilitas, fleksibilitas, dan kinerja mesin data besar.

Celeborn

HBASE-HDFS

HBASE-HDFS adalah HDFS. Dalam skenario pemisahan komputasi dan penyimpanan, komponen ini menggunakan HBASE-HDFS lokal untuk menyimpan data Write-Ahead Logging (WAL).

HBASE-HDFS

Alluxio

Alluxio hanya tersedia untuk pengguna eksisting.

Alluxio adalah teknologi orkestrasi data open source untuk analitik data dan AI berbasis cloud yang menyediakan lapisan akses data terpadu yang mendukung berbagai sistem penyimpanan dasar.

Alluxio

Integrasi data

Lapisan integrasi data menyediakan transfer data batch, pemrosesan aliran pesan real-time, dan pengumpulan log terdistribusi untuk meningkatkan efisiensi transfer data dan keandalan pengumpulan.

Jenis komponen

Nama komponen

Deskripsi

Dokumen Umum

Open source

Flume

Flume adalah sistem terdistribusi, andal, dan sangat tersedia untuk mengumpulkan, menggabungkan, dan memindahkan aliran log data dalam jumlah besar ke penyimpanan data terpusat.

Sqoop

Sqoop adalah alat untuk mentransfer data secara efisien antara Hadoop dan database relasional. Alat ini mendukung operasi impor dan ekspor data berskala besar.

Kafka

Kafka hanya tersedia untuk pengguna eksisting.

Kafka adalah platform streaming event terdistribusi open source dengan throughput tinggi, latensi rendah, dan Persistensi, yang banyak digunakan untuk pemrosesan aliran data real-time dan aplikasi pipa data.

Referensi