All Products
Search
Document Center

E-MapReduce:Alur data dan riwayat akses dengan ekstensi SparkSQL

Last Updated:Jul 18, 2026

E-MapReduce Hook mengumpulkan alur data dan frekuensi akses dari pekerjaan SparkSQL. Anda dapat menggunakan Data Lake Formation (DLF) untuk melacak jumlah akses tabel dan partisi, atau DataWorks untuk mengelola alur data.

Prasyarat

Diperlukan DataLake atau kluster kustom dengan layanan Spark. Untuk informasi selengkapnya, lihat Buat kluster.

Batasan

  • EMR-HOOK tidak mendukung pengumpulan informasi SQL dari pekerjaan di lingkungan gateway yang dideploy secara kustom dengan EMR-CLI.

  • Pada versi EMR sebelum 5.16.0 dan 3.50.0, pengaturan parameter hive.exec.post.hooks (untuk Hive) dan spark.sql.queryExecutionListeners (untuk Spark) tidak disinkronkan ke node gateway. Mulai versi EMR 5.16.0 ke atas dan 3.50.0 ke atas, pengaturan tersebut disinkronkan ke node gateway. Versi-versi ini juga memperkenalkan parameter hive_aux_jars_path_gateway_only, yang memungkinkan Anda menggunakan file JAR ekstensi kustom secara independen pada node gateway.

Catatan penggunaan

  • Pada versi E-MapReduce sebelum EMR-5.14.0 dan EMR-3.48.0, E-MapReduce Hook diaktifkan secara default.

    Anda dapat mengaktifkan E-MapReduce Hook secara manual pada kluster kustom yang menjalankan EMR-3.44 karena secara default dinonaktifkan. Untuk informasi selengkapnya, lihat FAQ.

  • Pada versi E-MapReduce EMR-5.14.0 ke atas dan EMR-3.48.0 ke atas, E-MapReduce Hook dinonaktifkan secara default, sehingga Anda harus mengaktifkannya secara manual.

Prosedur

  1. Buka halaman Services kluster Anda.

    1. Login ke Konsol E-MapReduce.

    2. Di bilah navigasi atas, pilih Wilayah dan kelompok sumber daya sesuai kebutuhan Anda.

    3. Di halaman EMR on ECS, temukan kluster target lalu klik Services di kolom Services.

  2. Konfigurasikan E-MapReduce Hook.

    1. Di halaman Services, temukan layanan Spark2 atau Spark3 lalu klik Configure.

    2. Di halaman Configure, pada tab yang sesuai, edit atau tambahkan parameter berikut untuk E-MapReduce Hook.

      Tab

      Parameter

      Deskripsi

      spark-defaults.conf

      spark.sql.queryExecutionListeners

      Menangkap informasi SQL dari layanan Spark untuk alur data dan frekuensi akses.

      • Untuk mengaktifkan E-MapReduce Hook, atur parameter ini ke com.aliyun.emr.meta.spark.listener.EMRQueryLogger.

      • Untuk menonaktifkan E-MapReduce Hook, biarkan nilai parameter kosong.

      hive-site.xml

      dlf.emrhook.webtracking

      Menentukan apakah akan melaporkan frekuensi akses. Nilai yang valid:

      • true: diaktifkan.

      • false: dinonaktifkan.

      Catatan

      Jika Anda menonaktifkan E-MapReduce Hook, halaman Data Overview untuk tabel data di Konsol Data Lake Formation (DLF) tidak akan lagi menampilkan data untuk File Visits within Last Day, File Visits within Last Seven Days, dan File Visits within Last 30 Days.

    3. Simpan konfigurasi.

      1. Di halaman Configure, klik Save.

      2. Pada kotak dialog yang muncul, masukkan alasan di bidang Execution Reason lalu klik Save.

  3. Mulai ulang layanan Spark.

    1. Di halaman Configure, pilih More > Restart.

    2. Pada kotak dialog yang muncul, masukkan alasan di bidang Execution Reason lalu klik OK.

    3. Pada kotak dialog Confirm, klik OK.

  4. Lihat ikhtisar data dan alur data.

    • Lihat Data Overview di Data Lake Formation (DLF). Untuk informasi selengkapnya, lihat Ikhtisar data tabel.

    • Lihat alur data di DataWorks. Untuk informasi selengkapnya, lihat Analisis alur data.

FAQ

Bagaimana cara mengaktifkan E-MapReduce Hook untuk kluster kustom yang berjalan di EMR-3.44?

Di tab Configure untuk layanan Spark, edit parameter berikut dan ikuti petunjuk untuk menerapkan perubahan.

Tab

Parameter

Modifikasi

spark-defaults.conf

spark.driver.extraClassPath

Tambahkan /opt/apps/EMRHOOK/emrhook-1.1.5/spark-hook-1.1.5-spark30.jar ke nilai parameter.

spark.executor.extraClassPath

Dokumen terkait

Untuk mengonfigurasi E-MapReduce Hook untuk layanan Hive, lihat Gunakan ekstensi Hive untuk mencatat alur data dan riwayat akses.