Spark SQL adalah mesin kueri terdistribusi yang memproses data terstruktur secara efisien. Di DataWorks, Anda dapat menggunakan node CDH Spark SQL untuk mengembangkan, menjadwalkan, dan mengintegrasikan tugas CDH Spark SQL dengan pekerjaan lainnya. Topik ini menjelaskan cara mengonfigurasi dan menggunakan node CDH Spark SQL.
Prasyarat
-
Anda telah membuat kluster Alibaba Cloud CDH dan mengaitkannya dengan ruang kerja DataWorks. Untuk informasi selengkapnya, lihat Associate a CDH compute engine.
PentingAnda telah menginstal komponen Spark pada kluster CDH dan mengonfigurasi informasi terkait Spark saat mengikat kluster.
-
(Opsional, untuk pengguna RAM) Pengguna RAM untuk pengembangan tugas telah ditambahkan ke ruang kerja yang sesuai dan diberikan peran Development atau Workspace Administrator. Peran Workspace Administrator memiliki izin yang luas, jadi berikan dengan hati-hati. Untuk informasi selengkapnya tentang penambahan anggota, lihat Add members to a workspace.
CatatanJika Anda menggunakan Akun Alibaba Cloud, Anda dapat melewati langkah ini.
-
Anda telah mengonfigurasi sumber data Hive di DataWorks dan memverifikasi bahwa sumber data tersebut lulus uji konektivitas. Untuk informasi selengkapnya, lihat Manage data sources.
Create a node
Untuk petunjuknya, lihat Create a node.
Develop the node
Tulis kode tugas Anda di editor SQL. Anda dapat mendefinisikan variabel dalam kode dengan format ${variable_name}, lalu memberikan nilai untuk variabel tersebut di bagian Scheduling Parameters pada panel Scheduling Settings. Hal ini memungkinkan Anda untuk secara dinamis pass parameter ke kode selama eksekusi terjadwal. Untuk informasi selengkapnya tentang parameter penjadwalan, lihat Sources and expressions of scheduling parameters. Kode berikut memberikan contoh:
CREATE TABLE IF NOT EXISTS test_spark.test_lineage_table_f1 (`id` BIGINT, `name` STRING)
PARTITIONED BY (`ds` STRING);
CREATE TABLE IF NOT EXISTS test_spark.test_lineage_table_t2 AS SELECT * FROM test_spark.test_lineage_table_f1;
INSERT INTO test_spark.test_lineage_table_t2 SELECT id,${var} FROM test_spark.test_lineage_table_f1;
-
Contoh ini membuat tabel
test_lineage_table_f1dantest_lineage_table_t2di databasetest_sparkserta menyalin data dari tabeltest_lineage_table_f1ke tabeltest_lineage_table_t2. Contoh ini hanya sebagai referensi. Untuk penggunaan aktual, gantilah lingkungan database dengan milik Anda sendiri. -
Parameter
${var}diatur ke bidangname.
Debug the node
-
Pada bagian Compute Resource di Run Configuration, konfigurasikan Compute Resource dan Resource Group.
-
Untuk Compute Resource, pilih nama kluster CDH yang telah Anda daftarkan di DataWorks.
-
Untuk Resource group, pilih kelompok sumber daya penjadwalan yang telah lulus uji konektivitas ke sumber data. Untuk informasi selengkapnya, lihat Network Connectivity Solution.
-
-
Pada bilah alat di bagian atas editor node, klik Run.
Langkah berikutnya
-
Configure node scheduling: Jika Anda perlu menjalankan node secara berkala, konfigurasikan Scheduling Policy-nya di panel Scheduling Settings di sebelah kanan.
-
Publish a node: Untuk menjalankan tugas di lingkungan produksi, klik ikon
untuk memublikasikan node. Node hanya akan dijalankan sesuai jadwal setelah dipublikasikan ke lingkungan produksi. -
Task O&M: Setelah tugas dipublikasikan, pantau eksekusi berkala-nya di Operation Center. Untuk informasi selengkapnya, lihat Get started with Operation Center.