All Products
Search
Document Center

E-MapReduce:Impala

Last Updated:Jun 23, 2026

Impala menyediakan kueri SQL berkinerja tinggi dan latensi rendah untuk data yang disimpan di Apache Hadoop. Impala mendukung kueri real-time menggunakan perintah SELECT, JOIN, dan fungsi agregat pada data di HDFS atau HBase.

Informasi latar belakang

Impala menggunakan metadata, sintaksis SQL (Hive SQL), dan driver ODBC yang sama seperti Apache Hive, sehingga menyediakan platform yang familiar dan terpadu untuk kueri batch maupun real-time.

Catatan

Jika Anda menggunakan komponen Impala, hapus partisi tabel Hive melalui perintah Impala atau Hive. Jangan menghapus direktori partisi secara langsung dari sistem file karena tindakan tersebut akan membuat tabel tidak tersedia.

Keunggulan

Berbeda dengan MapReduce, Impala menggunakan mesin kueri terdistribusi untuk mengakses data secara langsung, mirip dengan relational database management system (RDBMS). Bergantung pada jenis kueri dan konfigurasi, Impala dapat beberapa orde lebih cepat daripada Hive.

Impala menawarkan keunggulan berikut dibandingkan solusi SQL-on-Hadoop lainnya:

  • Pemrosesan lokal pada node data menghindari bottleneck jaringan.

  • Menghilangkan overhead dari konversi format data yang mahal.

  • Menggunakan metastore tunggal, terbuka, dan terpadu.

  • Seluruh data dapat langsung dikueri tanpa perlu menunggu proses extract, transform, and load (ETL).

  • Memanfaatkan seluruh perangkat keras baik untuk kueri Impala maupun task MapReduce.

  • Memperluas kapasitas menggunakan satu pool komputer.

Untuk informasi lebih lanjut tentang Impala, lihat Apache Impala.

Arsitektur

Gambar berikut menunjukkan arsitektur Impala di E-MapReduce.Impala

Impala terdiri atas komponen-komponen berikut:

  • Impalad

    Ditempatkan pada core dan task node. Mendukung skala keluar dan skala-masuk.

    Impala Daemon (Impalad) adalah komponen inti Impala. Komponen ini berjalan di setiap node, membaca dan menulis file data, serta menerima kueri dari perintah impala-shell, Hue, Java Database Connectivity (JDBC), atau ODBC. Impalad memaralelkan kueri, mendistribusikan beban kerja di seluruh kluster, dan mengembalikan hasil lokal ke node koordinator.

  • Statestored

    Ditempatkan pada mesin master-1-1 di node master.

    Layanan Statestore berjalan sebagai proses Statestored. Layanan ini memantau kesehatan semua proses Impalad di kluster dan menyiarkan statusnya. Jika suatu proses Impalad menjadi tidak tersedia karena kegagalan node, masalah jaringan, atau gangguan perangkat lunak, Statestore memberi tahu semua proses Impalad lainnya agar kueri baru tidak dikirim ke node yang tidak tersedia tersebut.

  • Catalogd

    Ditempatkan pada mesin master-1-1 di node master.

    Catalogd menyinkronkan perubahan metadata dari proses Impalad mana pun ke semua proses Impalad lainnya di kluster. Karena semua permintaan melewati Statestore, jalankan Statestore dan Catalogd pada node yang sama.