Jika Anda telah men-deploy kluster CDH dan ingin menggunakan DataWorks untuk menjalankan tugas Hive, seperti kueri data atau pemrosesan data batch, Anda dapat menggunakan node CDH Hive. Topik ini menjelaskan cara mengonfigurasi dan menggunakan node tersebut.
Prasyarat
-
Anda telah membuat kluster Alibaba Cloud CDH dan mengaitkannya dengan ruang kerja DataWorks. Untuk informasi selengkapnya, lihat Associate a CDH compute engine.
PentingAnda telah menginstal komponen Hive pada kluster CDH dan mengonfigurasi informasi koneksi Hive saat mengaitkan kluster tersebut.
-
(Opsional, untuk pengguna RAM) Pengguna RAM untuk pengembangan tugas telah ditambahkan ke ruang kerja yang sesuai dan diberikan peran Development atau Workspace Administrator. Peran Workspace Administrator memiliki izin yang luas, jadi berikan dengan hati-hati. Untuk informasi selengkapnya tentang penambahan anggota, lihat Add members to a workspace.
CatatanJika Anda menggunakan Akun Alibaba Cloud, Anda dapat melewati langkah ini.
-
Anda telah mengonfigurasi sumber data Hive di DataWorks dan memverifikasi bahwa sumber data tersebut lulus uji konektivitas. Untuk informasi selengkapnya, lihat Manage data sources.
Batasan
Jenis tugas ini dapat dijalankan pada serverless resource groups (direkomendasikan) atau kelompok sumber daya eksklusif lama untuk penjadwalan.
Create a node
Untuk petunjuknya, lihat Create a node.
Develop the node
Tulis kode tugas Anda di editor SQL. Anda dapat mendefinisikan variabel dalam kode menggunakan format ${variable_name}. Kemudian, di panel kanan halaman pengeditan node, tetapkan nilai variabel tersebut pada bagian Scheduling Parameters di panel Scheduling Settings. Hal ini memungkinkan Anda untuk secara dinamis pass parameter ke kode selama penjadwalan. Untuk informasi selengkapnya tentang parameter penjadwalan, lihat Sources and expressions of scheduling parameters. Kode berikut memberikan contohnya.
SHOW TABLES;
SELECT * FROM userinfo ;
-- Ini dapat digunakan bersama parameter penjadwalan.
SELECT '${var}'; Debug the node
-
Pada tab Run Configuration, di bagian Compute Resource, konfigurasikan Compute Resource dan Resource Group.
-
Untuk Compute Resource, pilih kluster CDH yang telah Anda daftarkan di DataWorks.
-
Untuk Resource Group, pilih kelompok sumber daya penjadwalan yang telah lulus uji konektivitas dengan sumber data. Untuk informasi selengkapnya, lihat Network connectivity solutions.
-
-
Pada bilah alat di bagian atas halaman pengeditan node, klik Run untuk menjalankan tugas.
Langkah berikutnya
Configure node scheduling: Jika Anda perlu menjalankan node secara berkala, konfigurasikan Scheduling Policy-nya di panel Scheduling Settings di sebelah kanan.
Publish a node: Untuk menjalankan tugas di lingkungan produksi, klik ikon
untuk memublikasikan node. Node hanya akan dijalankan sesuai jadwal setelah dipublikasikan ke lingkungan produksi.Task O&M: Setelah tugas dipublikasikan, Anda dapat memantau status eksekusi berkala di Operation Center. Untuk informasi selengkapnya, lihat Get started with Operation Center.