All Products
Search
Document Center

Realtime Compute for Apache Flink:Konfigurasikan pemantauan dan peringatan

Last Updated:Aug 07, 2026

Realtime Compute for Apache Flink mendukung layanan pemantauan dan peringatan dari CloudMonitor (layanan gratis) atau Application Real-Time Monitoring Service (ARMS). Konfigurasikan peringatan metrik untuk pekerjaan, peringatan event untuk pekerjaan, dan peringatan untuk alur kerja guna segera mengidentifikasi serta menangani exception. Topik ini menjelaskan cara mengonfigurasi pemantauan dan peringatan menggunakan layanan pemantauan yang berbeda.

Batasan

  • Pemantauan dan peringatan tidak dapat dikonfigurasi untuk pekerjaan Flink yang dikirim ke kluster Session saat penerapan.

  • Pemantauan dan peringatan saat ini tidak didukung untuk pekerjaan batch.

  • ARMS tidak mendukung peringatan alur kerja. Namun, Anda tetap dapat mengonfigurasinya menggunakan CloudMonitor (layanan gratis).

Panduan konfigurasi

Berdasarkan jenis layanan pemantauan yang digunakan oleh ruang kerja Anda (Periksa jenis layanan pemantauan), pilih metode konfigurasi yang sesuai:

Ganti jenis layanan pemantauan

Anda dapat beralih antar jenis layanan pemantauan untuk memenuhi kebutuhan bisnis yang berbeda.

Di Konsol Manajemen, pada kolom Actions untuk ruang kerja target, klik More untuk beralih ke jenis layanan pemantauan lainnya.

Catatan

Baca catatan tentang pergantian jenis layanan dengan cermat. Anda hanya dapat melanjutkan konfigurasi setelah memilih kotak centang konfirmasi.

Konfigurasikan pemantauan dan peringatan menggunakan CloudMonitor

Konfigurasi peringatan metrik

Penting

Hanya Akun Alibaba Cloud yang membeli ruang kerja, serta Pengguna RAM dan Peran RAM di bawah akun tersebut yang memiliki izin namespace, yang dapat mengonfigurasi peringatan di CloudMonitor.

  1. Masuk ke Konsol Cloud Monitor.

  2. Pada panel navigasi kiri, pilih Alerts > Alert Rules.

  3. Klik Create Alert Rule dan konfigurasikan parameter.

  4. Parameter

    Deskripsi

    Product

    Realtime Compute for Apache Flink

    Resource Scope

    Pilih Instance. Aturan peringatan berlaku untuk ruang kerja tertentu dari Realtime Compute for Apache Flink.

    Associated Resources

    Klik Add Instance, pilih ruang kerja di wilayah target (Bagaimana cara melihat informasi seperti ID ruang kerja?), lalu klik OK.

    Rule Description

    Klik Add Rule > Simple Metric atau Composite Metric untuk membuka panel Set Rule Description.

    Panel ini mencakup beberapa tingkat peringatan: Critical, Warn (memberi notifikasi melalui SMS, email, dan webhook), dan Info (memberi notifikasi melalui email dan webhook). Untuk setiap tingkat, Anda dapat mengatur kondisi ambang batas. Misalnya, nilai rata-rata >= ambang batas tertentu selama 3 periode berturut-turut, dengan 1 periode = 1 menit.

    Pada bagian Dimension, Anda dapat mengonfigurasi namespace (nama namespace Flink) dan deploymentID (deployment ID pada tab Configuration pekerjaan Flink) untuk menentukan pekerjaan yang akan dipantau.

    Catatan
    • Jika daftar drop-down namespace dan deploymentID kosong, Anda dapat memasukkan nilainya secara manual.

    • Jika Anda membiarkan bidang ini kosong, semua pekerjaan di semua namespace akan dipantau.

    Catatan

Konfigurasi peringatan event (termasuk alur kerja)

Penting

Hanya Akun Alibaba Cloud yang membeli ruang kerja, serta Pengguna RAM dan Peran RAM di bawah akun tersebut yang memiliki izin namespace, yang dapat mengonfigurasi peringatan atau berlangganan event di CloudMonitor.

Peringatan event pekerjaan

Berlangganan peringatan event sistem untuk pekerjaan dengan mengonfigurasi kondisi. Konfigurasi batch untuk peringatan event didukung.

  1. Masuk ke Konsol Cloud Monitor.

  2. Pada panel navigasi kiri, pilih Event Center > Event Subscription.

  3. Pada tab Subscription Policy, klik Create Subscription Policy.

  4. Di halaman Create Subscription Policy, konfigurasikan parameter. Untuk informasi selengkapnya mengenai parameter tersebut, lihat Mengelola langganan event (direkomendasikan).

    • Subscription Type: System Event.

    • Product: Pilih Realtime Compute for Apache Flink.

    • Event Name: Mendukung event Job Run Failed (tidak didukung saat menggunakan layanan pemantauan ARMS), Post-mortem Processing for ECS Downtime, dan Impact of Proactive O&M on ECS.

    • Event Content: Anda dapat menentukan pekerjaan atau mengonfigurasi peringatan batch dengan memasukkan informasi Flink berikut dalam konten event.

      • Workspace ID: Konfigurasikan peringatan event untuk semua pekerjaan di semua namespace di bawah ruang kerja target. Untuk melihat Workspace ID, lihat Bagaimana cara melihat informasi seperti ID ruang kerja?.

      • Namespace Name: Konfigurasikan peringatan event untuk semua pekerjaan di namespace target.

      • Deployment Job Name: Konfigurasikan peringatan event untuk pekerjaan tertentu. Pisahkan beberapa nama pekerjaan dengan koma (,). Jika ada pekerjaan dengan nama yang sama di bawah akun Anda, gunakan DeploymentID sebagai gantinya.

      • DeploymentID: Konfigurasikan peringatan event untuk pekerjaan tertentu. Pisahkan beberapa ID dengan koma (,). Anda dapat menemukan ID ini pada tab Configuration halaman pekerjaan Flink sebagai deployment ID.

    Catatan

    Jika Anda tidak mengatur Application Group, Message, atau Event Resource, langganan berlaku untuk semua ruang kerja dalam akun Anda.

Peringatan event alur kerja

Berlangganan peringatan event sistem untuk alur kerja Flink dengan mengonfigurasi kondisi. Konfigurasi batch untuk peringatan event didukung. Untuk informasi lebih lanjut tentang alur kerja, lihat Kelola alur kerja.

  1. Dapatkan ID resource node alur kerja.

    1. Masuk ke Konsol Cloud Monitor.

    2. Pada panel navigasi kiri, pilih Event Center > System Event.

    3. Pada tab Event Monitoring, atur Product ke Realtime Compute for Apache Flink dan Event Name ke Workflow Task Status Change, lalu klik Filter by source.

    4. Temukan ID resource node alur kerja di bawah ini.

      Pada halaman Event Monitoring, pilih Realtime Compute for Apache Flink dari daftar drop-down Product. Di daftar event, temukan catatan dengan nama event flink:Workflow:TaskStateChange Workflow Task Status Change. Anda dapat melihat ID resource node alur kerja di kolom Resource.

      Format resource adalah acs:flink:cn-hangzhou:<AlibabaCloudAccountId>:resourceId/workspaceId/<workspaceId-namespaceId>#workflowDefinitionName/<workflowDefinitionName>#taskDefinitionName/<taskDefinitionName>. Anda juga dapat menggunakan format ini untuk langsung membuat ID resource untuk node alur kerja Anda.

      Parameter

      Deskripsi

      <AlibabaCloudAccountIdOfWorkspace>

      ID akun Alibaba Cloud yang memiliki ruang kerja Flink.

      <workspaceId-namespaceId>

      Kombinasi dari workspaceId dan namespaceId, digabungkan dengan tanda hubung (-).

      workspaceId: ID ruang kerja. Untuk informasi lebih lanjut, lihat Manajemen dan operasi ruang kerja.

      namespaceId: Nama namespace.

      <workflowDefinitionName>

      Nama alur kerja.

      <taskDefinitionName>

      Nama node alur kerja.

      Catatan

      Umumnya terdapat penundaan beberapa menit sebelum event perubahan status alur kerja muncul di CloudMonitor.

  2. Berlangganan notifikasi event.

    1. Pada panel navigasi kiri, pilih Event Center > Event Subscription.

    2. Pada tab Subscription Policy, klik Create Subscription Policy.

    3. Pada halaman Create Subscription Policy, atur parameter kebijakan langganan. Untuk informasi selengkapnya mengenai parameter tersebut, lihat Mengelola langganan event (disarankan).

      • Subscription Type: System Event.

      • Product: Pilih Realtime Compute for Apache Flink.

      • Event Name: Pilih Workflow Task Status Change.

      • Event Content: Mendukung pemasukan parameter seperti toState: FAILED (alur kerja gagal), toState: SUCCESS (alur kerja berhasil), dan fromState: SCHEDULED, toState: RUNNING (status alur kerja berubah dari dijadwalkan menjadi berjalan).

      • Event Resource: Masukkan ID resource alur kerja yang diperoleh pada Langkah 1. Pisahkan beberapa ID dengan koma (,).

      • Event Type, Event Level, Application Group: Jangan atur apa pun.

Konfigurasikan pemantauan dan peringatan menggunakan ARMS

Konfigurasi peringatan metrik

Catatan

Pemantauan multi-metrik di ARMS hanya didukung melalui PromQL kustom. Untuk metode konfigurasi yang lebih sederhana, gunakan konfigurasi peringatan metrik CloudMonitor.

Konfigurasikan satu pekerjaan (Konsol Manajemen)

Anda dapat membuat aturan peringatan baru untuk pekerjaan target, atau membuat templat aturan peringatan lalu menggunakannya untuk membuat peringatan bagi pekerjaan target. Hal ini dapat mempercepat konfigurasi pemantauan dan peringatan.

Catatan

Konsol Pengembangan hanya menampilkan event peringatan dari 48 jam terakhir. Untuk melihat event peringatan yang lebih lama, buka Alert Management di konsol ARMS.

  1. Buka halaman konfigurasi peringatan.

    1. Masuk ke Konsol Manajemen dan klik Console pada kolom Actions untuk ruang kerja target.

    2. Pada halaman O&M > Deployments, klik nama pekerjaan target.

    3. Klik tab Alarm.

  2. Pada tab Alert Rules, pilih Add Rule > Custom Rule.

    Anda juga dapat memilih Add Rule > Create Rule by Template. Dengan menambahkan dan menggunakan templat peringatan, Anda dapat membuat aturan peringatan secara langsung atau dengan sedikit modifikasi, sehingga mempercepat proses konfigurasi.

  3. Masukkan informasi aturan peringatan.

    Kategori

    Parameter

    Deskripsi

    Rule

    Name

    Harus dimulai dengan huruf dan hanya boleh berisi huruf kecil, angka, dan garis bawah (_). Panjangnya dibatasi antara 3 hingga 64 karakter.

    Description

    Catatan tentang aturan tersebut.

    Content

    Konfigurasikan kondisi yang memicu peringatan. Sistem membandingkan nilai metrik yang ditentukan dengan ambang batas pada interval tertentu. Jika hasilnya memenuhi kondisi, peringatan akan dipicu secara otomatis.

    • Metric:

      • Restart Count in 1 Minute: Jumlah kali Manajer Pekerjaan melakukan restart dalam 1 menit.

      • Checkpoint Count in 5 Minutes: Jumlah checkpoint yang berhasil dalam 5 menit.

      • Emit Delay: Latensi bisnis, yaitu selisih waktu antara saat data dihasilkan dan saat data meninggalkan operator Source. Satuannya detik.

        Penting

        Waktu pembuatan data bergantung pada stempel waktu yang dicatat di sistem eksternal. Jika sistem eksternal tidak memiliki stempel waktu, atau jika stempel waktu tersebut salah ditulis, nilai Emit Delay akan tidak akurat dan tidak mencerminkan latensi sebenarnya. Konfigurasikan peringatan dengan beberapa metrik untuk menentukan event sebenarnya. Untuk informasi lebih lanjut, lihat Contoh dan templat konfigurasi yang direkomendasikan untuk pemantauan dan peringatan.

      • IN RPS: Jumlah catatan input per detik. Satuannya catatan/detik.

      • OUT RPS: Jumlah catatan output per detik. Satuannya catatan/detik.

      • Source Idle Time: Waktu sumber tidak memproses data. Satuannya milidetik.

      • Job Failed: Pekerjaan gagal.

    • Time Difference: Panjang jendela waktu data historis yang diperiksa sistem mundur untuk setiap pemeriksaan. Satuannya menit.

    • Comparator: Mendukung >= dan <=.

    • Threshold: Nilai untuk dibandingkan dengan metrik.

      • Jika Anda memilih operator >=, sistem menggunakan nilai MAX dari sumbu vertikal. Jika nilai maksimum dalam selisih waktu >= ambang batas, aturan peringatan dipicu.

      • Jika Anda memilih operator <=, sistem menggunakan nilai MIN dari sumbu vertikal. Jika nilai minimum dalam selisih waktu <= ambang batas, aturan peringatan dipicu.

    Sebagai contoh, asumsikan Anda memantau metrik "Checkpoint Count in 5 Minutes". Selisih waktu diatur ke 10 menit, ambang batasnya 2, dan operatornya "<=".

    Setiap menit, sistem memeriksa data historis dari 10 menit terakhir. Jika menemukan interval 5 menit di mana jumlah checkpoint yang berhasil kurang dari atau sama dengan 2, sistem akan memicu peringatan.

    Effective Period

    Waktu ketika pemantauan peringatan aktif. Anda dapat menentukannya agar hanya aktif pada siang hari (09.00–18.00). Secara default, aktif sepanjang hari.

    Alarm Rate

    Kirim peringatan hanya sekali dalam jumlah menit berkelanjutan tertentu. Mendukung 1 menit hingga 1440 menit (24 jam).

    Notification Method

    Notification Method

    Anda dapat memilih beberapa metode notifikasi. Metode yang didukung adalah:

    • DingTalk

    • Email

    • SMS

    • Webhook

    • Telepon

      Pastikan nomor telepon penerima telah diverifikasi. Jika tidak, metode ini tidak akan berfungsi. Anda dapat mengklik Notification object management di bawah. Jika kolom Phone untuk kontak target pada tab kontak menunjukkan Unverified, klik untuk menyelesaikan verifikasi.

    Penting

    Pastikan Anda telah membuat dan menambahkan kontak notifikasi yang tersedia. Jika tidak, notifikasi peringatan akan gagal. Misalnya, jika Anda memilih DingTalk sebagai metode notifikasi, pilih DingTalk dan tambahkan kontak notifikasi DingTalk bertipe chatbot DingTalk.

    Notification Object

    Anda dapat memberi notifikasi ke beberapa kontak sekaligus. Anda dapat memilih atau mencari kontak. Sebelum memilih kontak, Anda harus mengklik Notification object management di sebelah kanan untuk membuatnya. Untuk informasi lebih lanjut, lihat Manajemen dan operasi ruang kerja.

    Alarm Noise Reduction

    Klik Advanced Settings, lalu Anda dapat mengaktifkan sakelar Alarm Noise Reduction.

    Setelah Anda mengaktifkan pengurangan kebisingan peringatan, peringatan tidak akan dikirim untuk skenario di mana pekerjaan dapat pulih dengan cepat, seperti failover jangka pendek yang dipicu oleh penjadwalan kluster atau penyetelan otomatis. Peringatan hanya dikirim ketika kondisi ambang batas yang Anda tetapkan terpenuhi secara berkelanjutan.

    No Data Alarms

    Klik Advanced Settings, lalu Anda dapat mengaktifkan sakelar No Data Alarms dan memasukkan informasi waktu tanpa data berkelanjutan.

    Setelah Anda mengaktifkan fitur ini, sistem memantau skenario di mana tidak ada data pemantauan yang dilaporkan. Jika tidak ada data yang dilaporkan dalam periode waktu yang dipilih, peringatan akan dipicu. Tidak adanya data pemantauan biasanya dilaporkan ketika JobManager abnormal, pekerjaan berhenti secara tak terduga, atau tautan pelaporan mengalami gangguan.

  4. Klik OK.

    Aturan peringatan yang disimpan diaktifkan secara default dan muncul dalam daftar aturan peringatan. Anda dapat memilih untuk menghentikan, mengedit, atau menghapusnya.

Konfigurasikan satu atau beberapa pekerjaan (konsol ARMS)

Penting

Jika Anda mengubah nama pekerjaan di konsol Flink, aturan peringatan apa pun yang dikonfigurasi di konsol ARMS berdasarkan nama pekerjaan asli akan menjadi tidak valid. Anda harus memilih ulang pekerjaan yang telah diganti namanya dan mengonfigurasi peringatan agar berlaku.

  1. Masuk ke Konsol Manajemen.

  2. Pada kolom Actions untuk ruang kerja target, pilih More > Monitoring Indicator Configuration untuk menuju konsol ARMS.

    Nama ruang kerja, ID ruang kerja, dan nama instance Prometheus yang sesuai ditampilkan di bagian atas.

    Panel navigasi kiri mencakup Dashboard List, Service Discovery, Metric Management, Alert Rules, dan Settings. Status agen ditampilkan di kanan atas. Pada tab Metrics halaman Service Discovery, Anda dapat memfilter metrik berdasarkan nama pekerjaan, jenis metrik, dan kondisi lainnya. Daftar metrik menampilkan nama metrik, nama pekerjaan, jenis metrik, dan informasi lainnya.

  3. Klik Alert Rules di sebelah kiri untuk membuat aturan peringatan.

    • Check Type: Mendukung peringatan metrik melalui ambang batas statis dan PromQL kustom (tidak termasuk metrik peringatan yang sudah didukung oleh Flink).

    • Filter Conditions: Konfigurasi peringatan batch didukung. Untuk Namespace, masukkan nama namespace. Memilih semua menunjukkan semua namespace di ruang kerja. Untuk Create Deployment, masukkan deployment ID pekerjaan target di namespace (ditemukan pada tab Configuration pekerjaan Flink). Memilih semua menunjukkan semua pekerjaan di namespace.

    Untuk informasi lebih lanjut tentang parameter konfigurasi, lihat Buat aturan peringatan Prometheus. Anda juga dapat membuat templat aturan peringatan Prometheus. Untuk informasi lebih lanjut, lihat Buat templat aturan peringatan Prometheus.

Konfigurasi peringatan event

Hanya event kegagalan pekerjaan yang didukung. Konfigurasikan ini dengan memilih aturan Job Failed di konfigurasi peringatan metrik. Peringatan event lainnya saat ini tidak didukung. Anda dapat mengonfigurasinya melalui konfigurasi peringatan event CloudMonitor.

FAQ

Cara memeriksa jenis layanan pemantauan untuk ruang kerja

Anda memilih jenis layanan pemantauan saat mengaktifkan ruang kerja. Setelah diaktifkan, pada halaman O&M > Deployments, klik nama pekerjaan target. Jika terdapat tab Alarm, ruang kerja tersebut menggunakan layanan pemantauan Prometheus bayar sesuai penggunaan (ARMS). Jika tidak, berarti menggunakan layanan pemantauan gratis (CloudMonitor).

Cara menambahkan chatbot DingTalk untuk peringatan di Konsol Pengembangan

  1. Tambahkan chatbot DingTalk kustom dan dapatkan alamat webhook-nya. Untuk informasi lebih lanjut, lihat Tambahkan chatbot DingTalk kustom dan dapatkan alamat webhook-nya.

    Penting

    Untuk Security Settings, Anda harus memilih minimal Custom Keywords, dan minimal satu kata kunci harus diatur ke alert agar menerima informasi peringatan.

  2. Tambahkan kontak notifikasi.

    1. Pada halaman O&M > Deployments, klik nama pekerjaan target, lalu klik tab Alarm.

    2. Pilih Add Rule > Custom Rule atau Create Rule by Template.

    3. Pada halaman Create Rule atau Create Rule Template, klik Notification object management.

  3. Pada tab DingTalk, klik Add DingTalk.

    Masukkan Name dan Path chatbot DingTalk, lalu klik Submit.

  4. Kembali ke halaman Create Rule atau Create Rule Template dari Langkah 2. Atur Notification Method ke DingTalk, dan untuk Notification Object, pilih chatbot DingTalk yang sesuai.

    Untuk deskripsi parameter lain dalam aturan peringatan, lihat Konfigurasikan satu pekerjaan (Konsol Manajemen).

  5. Klik OK.

Cara membuat webhook di Konsol Pengembangan

  1. Pada halaman Alert Template atau Rule Information, klik Notification object management.

  2. Pada tab Webhook, klik Add Webhook.

  3. Pada halaman Add Webhook, masukkan informasi webhook.

    Parameter

    Deskripsi

    Name

    Wajib diisi. Nama webhook.

    URL

    Wajib diisi. Alamat layanan web.

    Headers

    Opsional. Header permintaan, digunakan untuk menyimpan informasi cookie dan token. Formatnya key: value.

    Catatan

    Pastikan terdapat spasi setelah titik dua yang memisahkan key dan value.

    Params

    Opsional. Parameter permintaan. Formatnya key: value.

    Catatan

    Pastikan terdapat spasi setelah titik dua yang memisahkan key dan value.

    Body

    Wajib diisi. Badan permintaan, digunakan untuk menyimpan parameter dan data POST.

    Anda dapat menggunakan placeholder $content dalam string Body untuk mengeluarkan konten peringatan.

  4. Klik OK.

Dokumen terkait

  • Realtime Compute for Apache Flink memungkinkan Anda memilih antara CloudMonitor (layanan gratis) atau Pemantauan Prometheus ARMS untuk menyediakan fungsi pemantauan dan peringatan pekerjaan. Untuk perbandingan detail fitur, biaya, dan lainnya, lihat Perbandingan fitur antara layanan peringatan CloudMonitor dan ARMS.

  • ARMS mendukung konfigurasi fitur seperti kebijakan eskalasi, dan penjadwalan. Untuk informasi lebih lanjut, lihat Kebijakan eskalasi, dan tutorial praktik terkait.

  • CloudMonitor mendukung penerimaan notifikasi peringatan melalui grup DingTalk, grup Lark, dan lainnya. Untuk detail konfigurasi, lihat Metode notifikasi peringatan.

  • Untuk informasi lebih lanjut tentang metrik pemantauan yang didukung, lihat Metrik pemantauan.

  • Anda dapat menonaktifkan pemantauan dan peringatan atau membuang metrik tertentu (saat menggunakan ARMS) untuk menghemat biaya. Anda dapat melanjutkan pengumpulan metrik nanti jika diperlukan. Untuk operasi spesifik, lihat Buang atau pulihkan metrik pemantauan.