Node Flink JAR Batch memungkinkan Anda menjalankan pekerjaan batch Flink dengan mengirimkan paket JAR. Di DataWorks, Anda memilih resource Flink JAR yang telah diunggah sebagai titik masuk pekerjaan, mengonfigurasi kelas titik masuk dan parameter penjadwalan, lalu mengembangkan serta menerbitkan pekerjaan pemrosesan data batch skala besar. Topik ini menjelaskan cara mengembangkan dan mengonfigurasi node Flink JAR Batch di DataWorks.
Prasyarat
Anda telah melakukan bind compute resource untuk Realtime Compute for Apache Flink di Management Center. Untuk informasi selengkapnya, lihat Bind a fully managed Flink compute resource.
Anda telah mengunggah resource Flink JAR. Untuk informasi selengkapnya, lihat Flink resources and functions.
Anda telah membuat node Flink JAR Batch. Untuk informasi selengkapnya, lihat Create a node for a scheduling workflow.
Pengguna RAM atau role RAM untuk DataWorks memerlukan izin API berikut untuk memanggil API Realtime Compute for Apache Flink. Izin ini diperlukan untuk mengirimkan dan menerapkan node ke kluster Flink. Untuk informasi selengkapnya, lihat Add permissions.
{ "Version": "1", "Statement": [ { "Effect": "Allow", "Action": ["stream:CreateDeployment", "stream:UpdateDeployment", "stream:GetDeployment", "stream:DeleteDeployment"], "Resource": ["*"] } ] }
Batasan
Hanya kelompok sumber daya Serverless yang didukung. Kelompok sumber daya penjadwalan dedicated lama tidak didukung.
Langkah 1: Konfigurasikan node Flink JAR Batch
Pada halaman pengeditan node Flink JAR Batch, konfigurasikan parameter berikut.
Konfigurasikan parameter utama
Di panel kiri halaman pengeditan node, konfigurasikan parameter berikut.
Parameter | Deskripsi |
JAR file | Wajib diisi. Dari daftar drop-down, pilih resource Flink JAR yang telah diunggah di Resource Management. |
Entry point class | Kelas titik masuk program. Jika paket JAR tidak menentukan kelas main, Anda harus memberikan path lengkap kelas titik masuk tersebut. |
Entry point main arguments | Argumen yang diteruskan ke metode main. Anda dapat memasukkan beberapa argumen. |
Additional dependency files | Dari daftar drop-down, pilih resource Flink File yang telah diunggah untuk digunakan sebagai dependensi tambahan. Catatan Jika target deployment untuk compute resource Flink adalah Session cluster, file dependensi tambahan tidak berlaku. |
Konfigurasikan penjadwalan
Di panel kanan Scheduling Settings, konfigurasikan parameter berikut.
Flink resource information
Parameter | Deskripsi |
Flink cluster | Nama compute resource Flink yang sepenuhnya dikelola yang telah di-bind di Management Center. |
Flink engine version | Pilih versi engine yang diperlukan. |
Resource Group | Pilih Serverless resource group yang berada dalam jaringan yang sama dengan kluster Flink. |
JobManager CPU | Untuk operasi yang stabil, JobManager memerlukan minimal 0,5 core CPU dan memori 2 GiB. Konfigurasi yang direkomendasikan adalah 1 core CPU dan memori 4 GiB. Nilai maksimum adalah 16 core CPU. |
JobManager memory | Ukuran memori JobManager memengaruhi penjadwalan dan manajemen tugas. Ukuran memori yang direkomendasikan berkisar antara 2 GiB hingga 64 GiB. |
TaskManager CPU | Konfigurasi CPU TaskManager memengaruhi kemampuan pemrosesan tugasnya. Kami merekomendasikan konfigurasi minimal 0,5 core CPU dan memori 2 GiB. Untuk performa optimal, konfigurasikan 1 core CPU dan memori 4 GiB. Nilai maksimum adalah 16 core CPU. |
TaskManager memory | Ukuran memori TaskManager menentukan kapasitas dan performa pemrosesan datanya. Ukuran memori harus minimal 2 GiB dan dapat diatur hingga maksimum 64 GiB. |
Concurrency | Menentukan jumlah tugas yang dapat dijalankan secara paralel dalam pekerjaan Flink. Pilih Automatic Inference agar sistem secara otomatis menentukan tingkat parallelisme berdasarkan karakteristik pekerjaan. |
Maximum number of slots | Jumlah maksimum slot yang dapat digunakan oleh pekerjaan. Parameter ini membatasi konsumsi resource pekerjaan. |
Number of slots per TaskManager | Jumlah slot per TaskManager menentukan berapa banyak tugas yang dapat dijalankan secara paralel. |
Scheduling parameters
Anda dapat mengonfigurasi parameter penjadwalan di bagian Scheduling Parameters untuk mengaktifkan penerusan parameter dinamis dalam eksekusi terjadwal. Untuk informasi lebih lanjut tentang cara menggunakan parameter penjadwalan, lihat Sources and expressions of scheduling parameters.
Untuk informasi tentang konfigurasi penjadwalan lainnya, termasuk Flink Runtime Parameters, Scheduling Policy, Scheduling Time, dan Scheduling Dependencies, lihat detail konfigurasi di Flink SQL Batch node.
Setelah menyelesaikan konfigurasi, klik Save untuk menyimpan tugas node.
Langkah 2: Jalankan node Flink JAR Batch
Anda harus menerbitkan tugas ke O&M Center sebelum dapat dijalankan. Ikuti petunjuk di layar untuk menerbitkan node Flink JAR Batch. Untuk informasi selengkapnya, lihat Publish a node or workflow. Setelah node diterbitkan, Anda dapat melihat status instans periodiknya di O&M Center.