All Products
Search
Document Center

DataWorks:Kaitkan sumber daya komputasi CDH

Last Updated:Aug 26, 2026

Kaitkan kluster Cloudera Distribution for Hadoop (CDH) dengan ruang kerja DataWorks Anda sebagai sumber daya komputasi untuk sinkronisasi data dan pengembangan.

Prasyarat

  • Pengguna RAM harus merupakan anggota ruang kerja dan memiliki peran administrator ruang kerja.

  • Kluster CDH telah diterapkan.

    Catatan

    DataWorks mendukung kluster CDH yang diterapkan di luar ECS Alibaba Cloud, asalkan lingkungan penerapan terhubung ke VPC Alibaba Cloud. Biasanya, Anda dapat menggunakan metode konektivitas jaringan untuk sumber data on-premises guna membangun koneksi yang stabil.

  • Kelompok sumber daya telah dikaitkan dengan ruang kerja, dan konektivitas jaringan telah diverifikasi.

Batasan

  • Wilayah: Fitur ini tersedia di Tiongkok (Beijing), Tiongkok (Shanghai), Tiongkok (Shenzhen), Tiongkok (Hangzhou), Tiongkok (Zhangjiakou), Tiongkok (Chengdu), dan Jerman (Frankfurt).

  • Izin:

    Operator

    Izin yang diperlukan

    Akun Alibaba Cloud

    Tidak diperlukan izin tambahan.

    Pengguna RAM/Peran RAM

    • Hanya anggota ruang kerja dengan peran O&M, peran administrator ruang kerja, atau izin AliyunDataWorksFullAccess yang dapat membuat sumber daya komputasi. Untuk informasi lebih lanjut tentang cara memberikan izin, lihat Berikan izin administrator ruang kerja kepada pengguna.

Buka halaman daftar sumber daya komputasi

  1. Masuk ke Konsol DataWorks. Di panel navigasi sebelah kiri, alihkan ke wilayah target dan klik More > Management Center. Pilih ruang kerja Anda dari daftar drop-down dan klik Go to Management Center.

  2. Di panel navigasi sebelah kiri, klik Computing Resources untuk membuka halaman daftar sumber daya komputasi.

Kaitkan sumber daya komputasi CDH

Di halaman sumber daya komputasi, konfigurasikan dan kaitkan sumber daya komputasi CDH.

  1. Pilih jenis sumber daya komputasi.

    1. Klik Associate Computing Resources untuk membuka halaman Associate Computing Resources.

    2. Di halaman Associate Computing Resources, pilih CDH sebagai jenis sumber daya komputasi. Halaman konfigurasi Associate CDH Computing Resource akan muncul.

  2. Konfigurasikan sumber daya komputasi CDH.

    Di halaman Associate CDH Computing Resource, konfigurasikan parameter berikut.

    Parameter

    Deskripsi

    Cluster Version

    Pilih versi kluster yang ingin Anda daftarkan.

    DataWorks telah mendukung CDH 5.16.2, CDH 6.1.1, CDH 6.2.1, CDH 6.3.2, dan CDP 7.1.7 secara bawaan, dengan semua versi komponen dalam informasi koneksi kluster bersifat tetap. Jika tidak ada versi tersebut yang sesuai dengan kebutuhan Anda, pilih Custom Version dan konfigurasikan versi komponen sesuai kebutuhan.

    Catatan
    • Komponen yang diperlukan bervariasi tergantung versi kluster dan akan ditampilkan di halaman konfigurasi.

    • Jika Anda mendaftarkan kluster dengan Custom Version, hanya kelompok sumber daya eksklusif lama untuk penjadwalan yang didukung. Setelah pendaftaran, Anda harus submit a ticket untuk meminta dukungan teknis menginisialisasi lingkungan.

    Cluster Name

    Pilih nama kluster yang telah didaftarkan di ruang kerja lain untuk memuat konfigurasinya, atau tentukan nama kustom untuk membuat konfigurasi baru.

    Cluster Connection Information

    Hive connection information

    Digunakan untuk mengirimkan pekerjaan Hive ke kluster.

    • HiveServer2 configuration format: jdbc:hive2://<host>:<port>/<database>

    • Metastore configuration format: thrift://<host>:<port>

    Cara memperoleh parameter: Untuk informasi lebih lanjut, lihat Peroleh informasi kluster CDH atau CDP dan konfigurasikan konektivitas jaringan.

    Pemilihan versi komponen: Sistem secara otomatis mendeteksi versi komponen untuk kluster saat ini.

    Catatan

    Jika Anda menggunakan kelompok sumber daya serverless untuk mengakses komponen CDH melalui nama domain, Anda harus mengonfigurasi resolusi otoritatif untuk nama domain tersebut dan menetapkan cakupan efektifnya di PrivateZone DNS Alibaba Cloud.

    Impala connection information

    Digunakan untuk mengirimkan pekerjaan Impala.

    Configuration format: jdbc:impala://<host>:<port>/<schema>.

    Spark connection information

    Pilih versi Spark default dan konfigurasikan koneksi.

    Yarn connection information

    Konfigurasi untuk mengirimkan tugas dan melihat detail tugas.

    • Yarn.Resourcemanager.Address configuration format: http://<host>:<port>

      Catatan

      Alamat pengiriman untuk tugas Spark atau MapReduce.

    • Jobhistory.Webapp.Address configuration format: http://<host>:<port2>

      Catatan

      Alamat UI web JobHistory Server untuk melihat detail tugas yang telah selesai.

    MapReduce connection information

    Pilih versi MapReduce default dan konfigurasikan koneksi.

    Presto connection information

    Digunakan untuk mengirimkan pekerjaan Presto.

    JDBC address information configuration format: jdbc:presto://<host>:<port>/<catalog>/<schema>

    Catatan

    Ini bukan komponen CDH default. Konfigurasikan komponen ini sesuai kebutuhan.

    Cluster Configuration File

    Configure core-site file

    Berisi konfigurasi global untuk pustaka Hadoop Core, seperti pengaturan I/O umum untuk HDFS dan MapReduce.

    Unggah file ini untuk menjalankan tugas Spark atau MapReduce.

    Configure hdfs-site file

    Berisi konfigurasi terkait HDFS, seperti ukuran blok data, jumlah replika, dan nama path.

    Configure mapred-site file

    Mengonfigurasi parameter MapReduce seperti mode eksekusi dan perilaku penjadwalan.

    Unggah file ini untuk menjalankan tugas MapReduce.

    Configure yarn-site file

    Berisi semua konfigurasi terkait daemon YARN, seperti pengaturan lingkungan untuk resource manager, node manager, dan waktu proses aplikasi.

    Unggah file ini jika Anda berencana menjalankan tugas Spark atau MapReduce atau menggunakan Kerberos untuk pemetaan akun.

    Configure hive-site file

    Mengonfigurasi parameter Hive seperti informasi koneksi database, pengaturan Hive Metastore, dan mesin eksekusi.

    Unggah file ini jika Anda memilih Kerberos sebagai jenis pemetaan akun.

    Configure spark-defaults file

    Menentukan konfigurasi tugas Spark default seperti ukuran memori dan inti CPU. Aplikasi Spark menerapkan pengaturan ini pada waktu proses.

    Unggah file ini untuk menjalankan tugas Spark.

    Configure config.properties file

    Berisi konfigurasi terkait server Presto, seperti properti global untuk coordinator dan node pekerja di kluster Presto.

    Unggah file ini jika Anda menggunakan komponen Presto dan memilih OPEN LDAP atau Kerberos sebagai jenis pemetaan akun.

    Configure presto.jks file

    Menyimpan sertifikat keamanan (kunci privat dan sertifikat kunci publik) untuk komunikasi terenkripsi SSL/TLS antar proses Presto.

    Default Access Identity

    Untuk menggunakan identitas yang dikaitkan dengan akun kluster yang dipetakan, buka halaman Computing Resources, lalu di tab Account Mappings, tetapkan pemetaan identitas kluster.

    • Lingkungan pengembangan: Anda dapat menggunakan akun kluster atau akun kluster yang dipetakan dari pelaksana tugas.

    • Lingkungan produksi: Anda dapat menggunakan akun kluster, akun kluster yang dipetakan dari pemilik tugas, akun kluster yang dipetakan dari Akun Alibaba Cloud, atau akun kluster yang dipetakan dari Pengguna RAM.

    Computing Resource Instance Name

    Tentukan nama kustom untuk instans sumber daya komputasi. Pada waktu proses, Anda dapat memilih sumber daya komputasi untuk suatu tugas berdasarkan nama ini.

  3. Klik Confirm untuk menyelesaikan konfigurasi.

Inisialisasi kelompok sumber daya

Saat Anda mendaftarkan kluster untuk pertama kalinya atau mengubah konfigurasi layanan kluster (seperti core-site.xml), inisialisasi kelompok sumber daya untuk memastikan kluster tersebut dapat diakses oleh CDH setelah Anda mengonfigurasi konektivitas jaringan.

  1. Di halaman Computing Resources, temukan sumber daya komputasi CDH yang telah Anda buat. Di pojok kanan atas, klik Initialize Resource Group.

  2. Klik Initialize di samping kelompok sumber daya yang ingin Anda gunakan. Setelah kelompok sumber daya diinisialisasi, klik Determine.

(Opsional) Konfigurasikan antrian sumber daya YARN

Di halaman Computing Resources, temukan kluster CDH yang telah Anda kaitkan. Di tab YARN Resource Queue, klik Edit YARN Resource Queue untuk menetapkan antrian sumber daya YARN khusus bagi tugas di modul yang berbeda.

(Opsional) Konfigurasikan parameter Spark

Anda dapat menetapkan parameter Spark khusus untuk tugas di modul yang berbeda.

  1. Di halaman Computing Resources, temukan kluster CDH yang telah Anda kaitkan.

  2. Di tab Spark-related Parameter, klik Edit Spark Parameters untuk membuka halaman tempat Anda dapat mengedit parameter Spark untuk kluster CDH.

  3. Anda dapat mengonfigurasi informasi properti Spark dengan mengklik tombol Add di bawah modul dan memasukkan Spark Property Name dan Spark Property Value.

(Opsional) Konfigurasikan pengaturan host

Pengiriman tugas dapat gagal ketika kelompok sumber daya serverless DataWorks terhubung ke kluster CDH yang diaktifkan Kerberos.

Hal ini terjadi karena Kerberos bergantung pada hostname untuk otentikasi. Jika DNS tidak dapat menguraikan alamat IP kluster ke hostname yang terdaftar di Kerberos, otentikasi akan gagal.

Fitur konfigurasi host memungkinkan Anda menentukan pemetaan statis IP ke hostname untuk sumber daya komputasi CDH. DataWorks memprioritaskan pemetaan ini saat mengakses kluster, sehingga memastikan otentikasi Kerberos berhasil.

  1. Temukan sumber daya komputasi CDH yang ingin Anda konfigurasi dan klik Host Configuration.

  2. Di kotak dialog yang muncul, masukkan hubungan pemetaan dalam format alamat IP hostname. Masukkan hanya satu pemetaan per baris.

  3. Klik OK untuk menyimpan konfigurasi.

  4. Setelah disimpan, informasi hostname yang dikonfigurasi akan muncul di kartu sumber daya komputasi, yang menegaskan bahwa konfigurasi telah aktif.

Penting
  • Persyaratan format: alamat IP dan hostname harus dipisahkan oleh satu atau beberapa spasi.

  • Kelengkapan konfigurasi: Konfigurasikan pemetaan yang benar untuk semua node penting yang terlibat dalam otentikasi Kerberos dan eksekusi tugas, seperti NameNode, ResourceManager, dan NodeManager.

  • Cakupan: Konfigurasi host ini hanya berlaku untuk sumber daya komputasi saat ini, bukan untuk sumber daya lain di ruang kerja.

Langkah selanjutnya

Setelah Anda mengonfigurasi sumber daya komputasi CDH, gunakan node terkait CDH di Data Studio untuk pengembangan data.