All Products
Search
Document Center

DataWorks:Node CDH Spark SQL

Last Updated:Aug 21, 2026

Spark SQL adalah mesin kueri terdistribusi yang memproses data terstruktur secara efisien. Di DataWorks, Anda dapat menggunakan node CDH Spark SQL untuk mengembangkan, menjadwalkan, dan mengintegrasikan tugas CDH Spark SQL dengan pekerjaan lainnya. Topik ini menjelaskan cara mengonfigurasi dan menggunakan node CDH Spark SQL.

Prasyarat

  • Anda telah membuat kluster Alibaba Cloud CDH dan mengaitkannya dengan ruang kerja DataWorks. Untuk informasi selengkapnya, lihat Associate a CDH compute engine.

    Penting

    Anda telah menginstal komponen Spark pada kluster CDH dan mengonfigurasi informasi terkait Spark saat mengikat kluster.

  • (Opsional, untuk pengguna RAM) Pengguna RAM untuk pengembangan tugas telah ditambahkan ke ruang kerja yang sesuai dan diberikan peran Development atau Workspace Administrator. Peran Workspace Administrator memiliki izin yang luas, jadi berikan dengan hati-hati. Untuk informasi selengkapnya tentang penambahan anggota, lihat Add members to a workspace.

    Catatan

    Jika Anda menggunakan Akun Alibaba Cloud, Anda dapat melewati langkah ini.

  • Anda telah mengonfigurasi sumber data Hive di DataWorks dan memverifikasi bahwa sumber data tersebut lulus uji konektivitas. Untuk informasi selengkapnya, lihat Manage data sources.

Create a node

Untuk petunjuknya, lihat Create a node.

Develop the node

Tulis kode tugas Anda di editor SQL. Anda dapat mendefinisikan variabel dalam kode dengan format ${variable_name}, lalu memberikan nilai untuk variabel tersebut di bagian Scheduling Parameters pada panel Scheduling Settings. Hal ini memungkinkan Anda untuk secara dinamis pass parameter ke kode selama eksekusi terjadwal. Untuk informasi selengkapnya tentang parameter penjadwalan, lihat Sources and expressions of scheduling parameters. Kode berikut memberikan contoh:

CREATE TABLE IF NOT EXISTS test_spark.test_lineage_table_f1 (`id` BIGINT, `name` STRING)
PARTITIONED BY (`ds` STRING);
CREATE TABLE IF NOT EXISTS test_spark.test_lineage_table_t2 AS SELECT * FROM test_spark.test_lineage_table_f1;
INSERT INTO test_spark.test_lineage_table_t2 SELECT id,${var} FROM test_spark.test_lineage_table_f1;
Catatan
  • Contoh ini membuat tabel test_lineage_table_f1 dan test_lineage_table_t2 di database test_spark serta menyalin data dari tabel test_lineage_table_f1 ke tabel test_lineage_table_t2. Contoh ini hanya sebagai referensi. Untuk penggunaan aktual, gantilah lingkungan database dengan milik Anda sendiri.

  • Parameter ${var} diatur ke bidang name.

Debug the node

  1. Pada bagian Compute Resource di Run Configuration, konfigurasikan Compute Resource dan Resource Group.

    1. Untuk Compute Resource, pilih nama kluster CDH yang telah Anda daftarkan di DataWorks.

    2. Untuk Resource group, pilih kelompok sumber daya penjadwalan yang telah lulus uji konektivitas ke sumber data. Untuk informasi selengkapnya, lihat Network Connectivity Solution.

  2. Pada bilah alat di bagian atas editor node, klik Run.

Langkah berikutnya

  • Configure node scheduling: Jika Anda perlu menjalankan node secara berkala, konfigurasikan Scheduling Policy-nya di panel Scheduling Settings di sebelah kanan.

  • Publish a node: Untuk menjalankan tugas di lingkungan produksi, klik ikon image untuk memublikasikan node. Node hanya akan dijalankan sesuai jadwal setelah dipublikasikan ke lingkungan produksi.

  • Task O&M: Setelah tugas dipublikasikan, pantau eksekusi berkala-nya di Operation Center. Untuk informasi selengkapnya, lihat Get started with Operation Center.