All Products
Search
Document Center

Realtime Compute for Apache Flink:Aktifkan penyetelan kinerja otomatis

Last Updated:Jul 25, 2026

Realtime Compute for Apache Flink menyediakan dua mode penyetelan otomatis—Autopilot dan scheduled tuning—untuk mengurangi kebutuhan manajemen sumber daya manual. Penyetelan manual memerlukan alokasi sumber daya sebelum pekerjaan dimulai, penyesuaian alokasi selama eksekusi guna memaksimalkan pemanfaatan, serta respons terhadap tekanan balik (backpressure) atau lonjakan latensi. Kedua mode ini mengotomatiskan keputusan tersebut sehingga pekerjaan Anda tetap efisien tanpa intervensi konstan.

Pilih mode penyetelan

Tuning mode Gunakan saat Cara kerja Referensi
Autopilot Workload bervariasi atau tidak dapat diprediksi, dan Anda ingin sistem merespons secara otomatis terhadap perubahan CPU, memori, atau latensi. Sistem terus-menerus memantau metrik langsung dan menyesuaikan parallelism, CPU, serta memori tanpa intervensi manual. Aktifkan dan konfigurasikan Autopilot
Scheduled tuning Traffic mengikuti pola yang dapat diprediksi (misalnya, puncak harian dan jam sepi), dan Anda dapat merencanakan perubahan sumber daya sebelumnya. Anda menentukan paket sumber daya berbasis waktu. Sistem menerapkannya pada waktu pemicu yang telah dikonfigurasi. Konfigurasikan dan terapkan rencana penyetelan terjadwal
Catatan Kedua mode saling eksklusif. Nonaktifkan mode yang aktif sebelum beralih ke mode lainnya.

Batasan dan pertimbangan

Unaligned checkpointing: Parallelism pekerjaan tidak dapat diubah saat unaligned checkpointing diaktifkan.

Session clusters: Autopilot tidak didukung untuk pekerjaan yang berjalan pada session clusters.

Pekerjaan berbasis YAML: Penyetelan otomatis tidak didukung untuk pekerjaan yang dikembangkan menggunakan YAML.

Parallelism yang di-hardcode: Jangan hardcode parallelism dalam pekerjaan Flink SQL dengan konektor kustom atau dalam pekerjaan DataStream API. Nilai yang di-hardcode akan menggantikan konfigurasi penyetelan otomatis.

Paket sumber daya maksimum: Maksimal 20 paket sumber daya dapat dibuat.

Rencana yang saling eksklusif: Hanya satu rencana penyetelan terjadwal yang dapat diterapkan dalam satu waktu. Hentikan rencana aktif sebelum menerapkan rencana lainnya.

Restart pekerjaan: Penyetelan otomatis dapat menyebabkan pekerjaan restart, sehingga konsumsi data terhenti sesaat.

Catatan Untuk Ververica Runtime (VVR) 8.0.1 dan versi lebih baru, sistem terlebih dahulu mencoba pembaruan konfigurasi dinamis sebelum melakukan restart deployment. Pembaruan dinamis mengurangi downtime hingga 30%–98% dibandingkan restart penuh. Saat ini, hanya job parallelism yang dapat diperbarui secara dinamis. Untuk detailnya, lihat Dynamic configuration updates.

Perilaku modifikasi sumber daya: Saat penyetelan otomatis menerapkan perubahan, sistem membandingkan konfigurasi sebelum dan sesudah untuk menentukan metode pembaruan. Jika melibatkan perubahan CPU atau memori, deployment akan direstart. Jika hanya parallelism yang berubah, pembaruan dinamis diterapkan untuk meminimalkan downtime.

Hambatan kinerja: Autopilot tidak menyelesaikan semua hambatan kinerja streaming. Autopilot bekerja paling baik ketika traffic berubah secara mulus, tidak ada kesenjangan data (data skew), dan throughput operator meningkat secara linear seiring peningkatan parallelism. Di luar kondisi tersebut, Anda mungkin mengalami:

  • Gagal mengubah parallelism, atau pekerjaan berulang kali restart tanpa mencapai keadaan stabil.

  • Penurunan kinerja pada fungsi skalar yang didefinisikan pengguna (UDF), fungsi agregat yang didefinisikan pengguna (UDAF), atau user-defined table-valued function (UDTF).

Masalah sistem eksternal: Autopilot tidak mendeteksi masalah pada sistem eksternal. Jika sistem eksternal gagal atau merespons lambat, Autopilot mungkin meningkatkan parallelism pekerjaan, sehingga menambah beban pada sistem yang sudah tertekan. Masalah umum pada sistem eksternal meliputi:

  • Jumlah partisi DataHub yang tidak mencukupi atau throughput rendah pada ApsaraMQ for RocketMQ.

  • Kinerja operator sink yang rendah.

  • Deadlock pada database ApsaraDB RDS.

Aktifkan dan konfigurasikan Autopilot

Strategi Autopilot

Pilih strategi berdasarkan karakteristik workload Anda:

Strategy Paling cocok untuk Cara kerja
Adaptive strategy (disarankan) Workload variabel, sensitivitas latensi tinggi, kesenjangan data, atau distribusi beban tidak merata. Terus-menerus menyesuaikan konfigurasi sumber daya berdasarkan metrik real-time, merespons cepat terhadap perubahan permintaan.
Stable strategy Workload stabil dan dapat diprediksi, di mana restart mahal dan konvergensi ke rencana tetap lebih disukai. Menargetkan paket sumber daya tetap atau terjadwal untuk seluruh siklus eksekusi pekerjaan. Setelah konfigurasi konvergen, sistem menghasilkan paket sumber daya yang dapat Anda simpan dan gunakan kembali. Restart pekerjaan atau hot update akan mengatur ulang proses konvergensi.

Prosedur

  1. Buka halaman konfigurasi Autopilot.

    1. Login ke Konsol Realtime Compute for Apache Flink.

    2. Temukan ruang kerja target dan klik Console di kolom Actions.

    3. Di panel navigasi kiri, pilih O&M > Deployments, lalu klik nama deployment target.

    4. Di tab Resources, pilih subtab Autopilot Mode.

  2. Nyalakan Autopilot. Autopilot Mode Applying muncul di bawah tab Resources. Untuk menonaktifkan Autopilot, matikan toggle atau klik Turn Off Autopilot.

  3. Di bagian Configurations, klik Edit, pilih strategi, dan konfigurasikan parameter.

    (Disarankan) Adaptive strategy

    Parameter adaptive strategy

    Parameter Deskripsi
    Max CPU Jumlah maksimum core CPU yang dapat digunakan oleh pekerjaan. Default: 64 core.
    Max Memory Memori maksimum yang dapat digunakan oleh pekerjaan. Default: 256 GiB.
    Max Parallelism Parallelism pekerjaan maksimum. Default: 1.024. Saat diintegrasikan dengan ApsaraMQ for Kafka, Message Queue, Simple Log Service, atau layanan message queue lainnya, sistem secara otomatis membatasi nilai ini sesuai jumlah partisi jika nilai yang dikonfigurasi melebihi jumlah tersebut.
    Min Parallelism Parallelism pekerjaan minimum. Default: 1.
    Scale Up Rules Kondisi yang memicu skalabilitas vertikal (scale-up). Terpenuhinya salah satu kondisi saja sudah cukup untuk memicu aksi. Kondisi yang dapat dikonfigurasi: <br>- Delay tetap di atas ambang batas selama durasi tertentu. <br>- Rata-rata laju sibuk (busy rate) suatu operator tetap di atas ambang batas selama durasi tertentu. <br>- Utilisasi memori TaskManager tetap di atas ambang batas selama durasi tertentu. <br>- Terjadi error kehabisan memori (OOM). <br>- Waktu yang dihabiskan TaskManager atau JobManager untuk pengumpulan sampah (garbage collection) per detik tetap di atas ambang batas selama durasi tertentu. <br>
    Catatan

    Tetapkan ambang batas berdasarkan data historis atau mulai dengan nilai yang lebih longgar lalu perketat seiring waktu. Persentase ambang batas berkisar antara 0–100%. Menetapkan durasi yang tepat membantu menyaring fluktuasi singkat dan mencegah scale-up akibat lonjakan sementara. OOM hanya dapat diaktifkan atau dinonaktifkan—tidak memerlukan ambang batas.

    Scale Down Rules Kondisi yang memicu skala turun (scale-down). Terpenuhinya salah satu kondisi saja sudah cukup untuk memicu aksi. Kondisi yang dapat dikonfigurasi: <br>- Rata-rata laju sibuk (busy rate) suatu operator tetap di bawah ambang batas selama durasi tertentu. <br>- Utilisasi memori TaskManager tetap di bawah ambang batas selama durasi tertentu.
    Advanced Rules Saat ini sedang dalam pengujian dan belum tersedia secara umum. Hubungi kami untuk mengaktifkan aturan lanjutan.

    Stable strategy

    Parameter stable strategy

    Parameter Deskripsi
    Cooldown Minutes Interval minimum antara restart yang dipicu Autopilot. Default: 10 menit.
    Max CPU Jumlah maksimum core CPU yang dapat digunakan oleh pekerjaan. Default: 16 core.
    Max Memory Memori maksimum yang dapat digunakan oleh pekerjaan. Default: 64 GiB.
    Max Delay Delay sumber maksimum yang diizinkan. Default: 1 menit.
    More Configurations Parameter lanjutan (lihat tabel di bawah).

    Stable strategy: parameter lanjutan

    Parameter Deskripsi Default
    mem.scale-down.interval Interval minimum antara skala turun memori. Saat utilisasi memori tetap di bawah ambang batas yang ditetapkan dalam jendela ini, sistem menyesuaikan atau merekomendasikan pengurangan memori. 4 jam
    parallelism.scale.max Parallelism maksimum. -1 berarti tidak terbatas. Saat diintegrasikan dengan ApsaraMQ for Kafka, Message Queue, Simple Log Service, atau layanan message queue lainnya, sistem secara otomatis membatasi nilai ini sesuai jumlah partisi. -1
    parallelism.scale.min Parallelism minimum. 1
    delay-detector.scale-up.threshold Delay sumber maksimum yang diizinkan sebelum memicu skalabilitas vertikal. Jika kapasitas pemrosesan tidak mencukupi sehingga delay mencapai nilai ini, sistem meningkatkan parallelism atau memutus rantai operator untuk meningkatkan throughput. 1 menit
    slot-usage-detector.scale-up.threshold Ambang batas atas laju penggunaan sumber daya komputasi/IO untuk operator non-sumber. Flink meningkatkan parallelism saat rasio waktu pemrosesan operator tetap di atas nilai ini. 0,8
    slot-usage-detector.scale-down.threshold Ambang batas bawah laju penggunaan sumber daya komputasi/IO untuk operator non-sumber. Flink mengurangi parallelism saat rasio waktu pemrosesan operator tetap di bawah nilai ini. 0,2
    slot-usage-detector.scale-up.sample-interval Interval pengambilan sampel laju sibuk operator non-sumber oleh Flink dan membandingkannya dengan ambang batas scale-up dan scale-down. 3 menit
    resources.memory-scale-up.max Ukuran memori maksimum TaskManager dan JobManager. Saat TaskManager dan JobManager menjalankan Autopilot atau meningkatkan parallelism, batas atas memori adalah 16 GiB. 16 GiB
  4. Klik Save.

Simpan paket sumber daya

Saat pekerjaan yang menggunakan stable strategy mencapai konvergensi, sistem menghasilkan paket sumber daya yang dapat Anda simpan dan terapkan. Tersedia dua jenis rencana:

Jenis rencana Deskripsi Apa yang terjadi saat diterapkan
Fixed resource plan Satu konfigurasi sumber daya tanpa dimensi waktu. Konfigurasi sumber daya deployment diperbarui dengan nilai yang disimpan dan diterapkan saat start berikutnya.
Scheduled plan (pratinjau publik) Beberapa konfigurasi sumber daya, masing-masing terkait dengan periode waktu tertentu. Mode penyetelan secara otomatis beralih ke scheduled tuning. Sumber daya tidak disesuaikan setelah pekerjaan berjalan stabil.

Untuk menyimpan dan menerapkan fixed resource plan:

Di banner Autopilot Mode Applying, klik Details. Di panel yang muncul, atur Recommended Plan menjadi Specified resource lalu klik Save. Di dialog konfirmasi, klik Confirm.

Untuk menyimpan dan menerapkan scheduled plan:

Lihat Save and apply a scheduled plan.

Konfigurasikan dan terapkan rencana penyetelan terjadwal

Buat dan terapkan rencana terjadwal

  1. Buka halaman konfigurasi rencana terjadwal.

    1. Login ke Konsol Realtime Compute for Apache Flink.

    2. Temukan ruang kerja target dan klik Console di kolom Actions.

    3. Di panel navigasi kiri, pilih O&M > Deployments, lalu klik nama deployment target.

    4. Di tab Resources, pilih subtab Scheduled Mode.

  2. Klik New Plan.

  3. Di bagian Resource Setting panel New Plan, konfigurasikan rencana:

    • Trigger Period: Pilih No Repeat, Every Day, Every Week, atau Every Month. Untuk periode mingguan atau bulanan, tentukan tanggal penerapan rencana.

    • Trigger Time: Atur waktu penerapan rencana.

    • Mode: Pilih Basic atau Expert. Untuk detailnya, lihat Configure job resources.

    • Parameter lainnya: Lihat Runtime parameter configuration.

  4. (Opsional) Klik New Resource Setting Period untuk menambahkan lebih banyak periode waktu ke rencana dan konfigurasikan waktu pemicu serta pengaturan sumber dayanya.

    Penting

    Interval antara waktu pemicu harus melebihi 30 menit.

  5. Di bagian Resource Plans subtab Scheduled Mode, temukan rencana tersebut dan klik Apply di kolom Actions.

Simpan dan terapkan rencana terjadwal

Saat pekerjaan yang menggunakan stable strategy Autopilot mencapai konvergensi, sistem secara otomatis menghasilkan rencana terjadwal berdasarkan penggunaan sumber daya yang diamati. Anda dapat melihat, memodifikasi, menyimpan, dan menerapkan rencana ini.

  1. Buka halaman konfigurasi Autopilot.

    1. Login ke Konsol Realtime Compute for Apache Flink.

    2. Temukan ruang kerja target dan klik Console di kolom Actions.

    3. Di panel navigasi kiri, pilih O&M > Deployments, lalu klik nama deployment target.

    4. Klik tab Resources.

  2. Di banner Autopilot Mode Applying, klik Details. Di panel yang muncul, atur Recommended Plan menjadi Scheduled plan.

  3. Konfigurasikan rencana:

    Aksi Deskripsi Catatan
    Tentukan Max Change Count Atur jumlah maksimum perubahan sumber daya yang diterapkan pada rencana terjadwal. Rentang yang diizinkan: 2–5.
    Klik Merge time periods Gabungkan periode waktu berdasarkan jumlah maksimum perubahan yang ditentukan. Skalakan sumber daya naik atau turun sebelum menggabungkan agar sesuai dengan kebutuhan bisnis Anda.
  4. Tinjau dan modifikasi konfigurasi sumber daya hasil penggabungan. Untuk detailnya, lihat Configure job resources.

  5. Klik Save di pojok kiri bawah.

  6. Di kotak dialog, masukkan Scheduled plan name atau pilih Apply this plan immediately, lalu klik Confirm. Setelah rencana diterapkan, mode penyetelan secara otomatis beralih ke scheduled tuning. Autopilot berhenti menyesuaikan sumber daya setelah pekerjaan berjalan stabil.

Contoh

Contoh ini menggunakan pola traffic harian: jam sibuk dari pukul 09.00.00 hingga 19.00.00 dengan 30 unit komputasi (CUs), dan jam sepi dari pukul 19.00.00 hingga 09.00.00 hari berikutnya dengan 10 CUs. Konfigurasi scheduled tuning adalah sebagai berikut.

Panel konfigurasi scheduled tuning Morning Peak and Evening Peak berisi dua aturan dengan parameter sumber daya yang sama: CPU Job Manager 1 core, Memori 4 GiB; CPU Task Manager 1 core, Memori 4 GiB; Slot Count per TaskManager sebanyak 4; System Checkpoint Interval 0,1 dtk; Minimum Interval antara dua system checkpoint 0,1 dtk; State Data Expiration Time 0 jam; Flink Restart Strategy adalah failure-rate.

Langkah berikutnya

  • Gunakan fitur diagnostik deployment cerdas untuk memantau kesehatan deployment dan memastikan stabilitas bisnis. Untuk detailnya, lihat Perform intelligent job diagnostics.

  • Tingkatkan kinerja deployment Flink SQL melalui konfigurasi deployment dan optimasi kueri. Untuk detailnya, lihat Optimize Flink SQL.