All Products
Search
Document Center

DataWorks:Praktik terbaik untuk konfigurasi kluster DataWorks pada EMR

Last Updated:Aug 21, 2026

DataWorks memungkinkan Anda mendaftarkan kluster EMR DataLake sebagai Mesin komputasi EMR. Anda kemudian dapat membuat node untuk layanan seperti Hive, MapReduce, Presto, dan Spark SQL, sehingga dapat mengonfigurasi alur kerja, menjadwalkan pekerjaan, serta mengelola metadata untuk tugas EMR Anda. Topik ini mencakup praktik terbaik untuk mengonfigurasi kluster DataLake agar menjalankan tugas EMR di DataWorks.

Latar Belakang

  • Saat menjalankan tugas EMR di DataWorks, Anda dapat menggunakan berbagai komponen EMR, masing-masing dengan konfigurasi optimalnya sendiri. Untuk informasi selengkapnya, lihat Konfigurasi komponen EMR.

  • Opsi penyimpanan metadata yang tersedia untuk tugas EMR Anda bergantung pada mode ruang kerja DataWorks Anda. Untuk informasi selengkapnya, lihat Pilih solusi penyimpanan metadata.

Lihat Panduan pengguna DataWorks pada EMR untuk proses pengembangan dan pertimbangan utama saat menggunakan kluster DataLake dengan pekerjaan EMR di DataWorks.

Konfigurasi komponen EMR

  • Kyuubi

    Untuk lingkungan produksi, kami merekomendasikan mengatur memori untuk kyuubi_java_opts ke 10g atau lebih tinggi dan untuk kyuubi_beeline_opts ke 2g atau lebih tinggi.

  • Spark

    • Secara default, komponen Spark memiliki alokasi memori yang kecil. Anda dapat menambahkan pengaturan memori ke perintah spark-submit untuk menyesuaikan alokasi tersebut sesuai dengan beban kerja Anda.

    • Sesuaikan properti Spark berikut dengan ukuran klaster EMR Anda: spark.driver.memory, spark.driver.memoryOverhead, dan spark.executor.memory.

    Penting
    • Di DataWorks, lineage hanya didukung untuk node EMR Hive, EMR Spark, dan EMR Spark SQL. Meskipun node EMR Hive mendukung lineage tingkat tabel dan tingkat kolom, node berbasis Spark hanya mendukung lineage tingkat tabel.

    • Untuk Spark, hanya Spark 2.x yang mendukung lineage. Spark 3.x tidak didukung.

    Untuk informasi selengkapnya tentang konfigurasi Spark, lihat Spark Memory Management.

  • HDFS

    Berdasarkan ukuran kluster EMR Anda, sesuaikan parameter HDFS berikut ke nilai yang sesuai: hadoop_namenode_heapsize, hadoop_datanode_heapsize, hadoop_secondary_namenode_heapsize, dan hadoop_namenode_opts.

Pemilihan penyimpanan metadata

Untuk mengisolasi lingkungan pengembangan dari lingkungan produksi dalam ruang kerja DataWorks mode standar, Anda harus mendaftarkan dua kluster EMR yang berbeda di bagian SettingCenter > Data Sources DataWorks: satu untuk lingkungan pengembangan dan satu untuk lingkungan produksi. Selain itu, untuk isolasi data, Anda harus menyimpan metadata kedua kluster tersebut di database ApsaraDB RDS yang terpisah.