DataWorks memungkinkan Anda mendaftarkan kluster EMR DataLake sebagai Mesin komputasi EMR. Anda kemudian dapat membuat node untuk layanan seperti Hive, MapReduce, Presto, dan Spark SQL, sehingga dapat mengonfigurasi alur kerja, menjadwalkan pekerjaan, serta mengelola metadata untuk tugas EMR Anda. Topik ini mencakup praktik terbaik untuk mengonfigurasi kluster DataLake agar menjalankan tugas EMR di DataWorks.
Latar Belakang
-
Saat menjalankan tugas EMR di DataWorks, Anda dapat menggunakan berbagai komponen EMR, masing-masing dengan konfigurasi optimalnya sendiri. Untuk informasi selengkapnya, lihat Konfigurasi komponen EMR.
-
Opsi penyimpanan metadata yang tersedia untuk tugas EMR Anda bergantung pada mode ruang kerja DataWorks Anda. Untuk informasi selengkapnya, lihat Pilih solusi penyimpanan metadata.
Lihat Panduan pengguna DataWorks pada EMR untuk proses pengembangan dan pertimbangan utama saat menggunakan kluster DataLake dengan pekerjaan EMR di DataWorks.
Konfigurasi komponen EMR
-
Kyuubi
Untuk lingkungan produksi, kami merekomendasikan mengatur memori untuk
kyuubi_java_optske 10g atau lebih tinggi dan untukkyuubi_beeline_optske 2g atau lebih tinggi. -
Spark
-
Secara default, komponen Spark memiliki alokasi memori yang kecil. Anda dapat menambahkan pengaturan memori ke perintah
spark-submituntuk menyesuaikan alokasi tersebut sesuai dengan beban kerja Anda. -
Sesuaikan properti Spark berikut dengan ukuran klaster EMR Anda:
spark.driver.memory,spark.driver.memoryOverhead, danspark.executor.memory.
Penting-
Di DataWorks, lineage hanya didukung untuk node EMR Hive, EMR Spark, dan EMR Spark SQL. Meskipun node EMR Hive mendukung lineage tingkat tabel dan tingkat kolom, node berbasis Spark hanya mendukung lineage tingkat tabel.
-
Untuk Spark, hanya Spark 2.x yang mendukung lineage. Spark 3.x tidak didukung.
Untuk informasi selengkapnya tentang konfigurasi Spark, lihat Spark Memory Management.
-
-
HDFS
Berdasarkan ukuran kluster EMR Anda, sesuaikan parameter HDFS berikut ke nilai yang sesuai:
hadoop_namenode_heapsize,hadoop_datanode_heapsize,hadoop_secondary_namenode_heapsize, danhadoop_namenode_opts.
Pemilihan penyimpanan metadata
Untuk mengisolasi lingkungan pengembangan dari lingkungan produksi dalam ruang kerja DataWorks mode standar, Anda harus mendaftarkan dua kluster EMR yang berbeda di bagian DataWorks: satu untuk lingkungan pengembangan dan satu untuk lingkungan produksi. Selain itu, untuk isolasi data, Anda harus menyimpan metadata kedua kluster tersebut di database ApsaraDB RDS yang terpisah.