All Products
Search
Document Center

DataWorks:Node CDH MR

Last Updated:Apr 24, 2026

Di DataWorks, Anda dapat membuat node CDH MR (MapReduce) untuk memproses kumpulan data dalam skala besar. Topik ini menjelaskan cara mengonfigurasi dan menggunakan node CDH MR di DataWorks.

Prasyarat

  • Anda telah membuat kluster Alibaba Cloud CDH dan mengaitkannya dengan ruang kerja DataWorks. Untuk informasi selengkapnya, lihat Associate a CDH compute engine.

  • (Opsional, untuk pengguna RAM) Pengguna RAM untuk pengembangan task telah ditambahkan ke ruang kerja yang sesuai dan diberikan peran Development atau Workspace Administrator. Peran Workspace Administrator memiliki izin yang luas, jadi berikan dengan hati-hati. Untuk informasi lebih lanjut tentang penambahan anggota, lihat Add members to a workspace.

    Catatan

    Jika Anda menggunakan Akun Alibaba Cloud, Anda dapat melewati langkah ini.

  • Anda telah mengonfigurasi sumber data Hive di DataWorks dan memverifikasi bahwa sumber data tersebut lulus uji konektivitas. Untuk informasi selengkapnya, lihat Manage data sources.

Create a CDH JAR resource

Anda dapat mengunggah paket JAR task Anda ke DataWorks, lalu menjadwalkannya untuk dijalankan secara berkala sebagai task CDH Spark.

  1. Untuk informasi selengkapnya, lihat Resource management. Anda dapat mengunggah paket JAR dari mesin lokal ke direktori penyimpanan untuk resource JAR. Klik Upload untuk mengunggah resource JAR tersebut.

  2. Pilih path penyimpanan, sumber data, dan kelompok sumber daya.

  3. Klik Save.

Create a node

Untuk petunjuknya, lihat Create a node.

Develop the node

Pada halaman editor node CDH MR, lakukan langkah-langkah berikut.

  1. Buka node CDH MR yang telah dibuat dan tetap berada di halaman pengeditan kode.

  2. Di panel navigasi sebelah kiri, temukan resource yang ingin Anda referensikan di bawah Resource Management, klik kanan, lalu pilih Reference Resource.

  3. Setelah resource direferensikan, jika muncul pernyataan dalam format ##@resource_reference{""} pada halaman pengeditan kode node CDH, artinya resource telah berhasil direferensikan. Selanjutnya, jalankan perintah berikut untuk mengeksekusi task tersebut. Informasi nama paket resource, bucket, dan path dalam perintah ini hanya contoh. Gantilah dengan informasi aktual Anda.

##@resource_reference{"onaliyun_mr_wordcount-1.0-SNAPSHOT.jar"}
onaliyun_mr_wordcount-1.0-SNAPSHOT.jar cn.apache.hadoop.onaliyun.examples.EmrWordCount oss://onaliyun-bucket-2/cdh/datas/wordcount02/inputs oss://onaliyun-bucket-2/cdh/datas/wordcount02/outputs

Debug the node

  1. Pada bagian Compute Resource di Run Configuration, konfigurasikan compute resource dan kelompok sumber daya.

    1. Untuk Compute Resource, pilih kluster CDH yang telah Anda daftarkan di DataWorks.

    2. Untuk Resource Group, pilih kelompok sumber daya penjadwalan yang telah lulus uji konektivitas dengan sumber data. Untuk informasi selengkapnya, lihat Network connectivity solutions.

  2. Di bilah alat di bagian atas editor node, klik Run.

Langkah selanjutnya

  • Configure node scheduling: Jika Anda perlu menjalankan node secara berkala, konfigurasikan Scheduling Policy-nya di panel Scheduling Settings di sebelah kanan.

  • Publish a node: Untuk menjalankan task di lingkungan produksi, klik ikon image untuk memublikasikan node tersebut. Node hanya akan dijalankan sesuai jadwal setelah dipublikasikan ke lingkungan produksi.

  • Task O&M: Setelah task dipublikasikan, Anda dapat memantau status eksekusi berkala-nya di Operation Center. Untuk informasi selengkapnya, lihat Get started with Operation Center.