Realtime Compute for Apache Flink mendukung layanan pemantauan dan peringatan dari CloudMonitor (layanan gratis) atau Application Real-Time Monitoring Service (ARMS). Konfigurasikan peringatan metrik untuk pekerjaan, peringatan event untuk pekerjaan, dan peringatan untuk alur kerja guna segera mengidentifikasi serta menangani exception. Topik ini menjelaskan cara mengonfigurasi pemantauan dan peringatan menggunakan layanan pemantauan yang berbeda.
Batasan
-
Pemantauan dan peringatan tidak dapat dikonfigurasi untuk pekerjaan Flink yang dikirim ke kluster Session saat penerapan.
-
Pemantauan dan peringatan saat ini tidak didukung untuk pekerjaan batch.
-
ARMS tidak mendukung peringatan alur kerja. Namun, Anda tetap dapat mengonfigurasinya menggunakan CloudMonitor (layanan gratis).
Panduan konfigurasi
Berdasarkan jenis layanan pemantauan yang digunakan oleh ruang kerja Anda (Periksa jenis layanan pemantauan), pilih metode konfigurasi yang sesuai:
-
Layanan pemantauan gratis (CloudMonitor)
-
Konfigurasi peringatan metrik: Konfigurasikan peringatan berdasarkan perubahan nilai metrik, seperti CPU, latensi, dan volume data. Mendukung konfigurasi untuk satu atau beberapa pekerjaan.
-
Konfigurasi peringatan event (termasuk alur kerja): Konfigurasikan peringatan berdasarkan terjadinya event, seperti kegagalan pekerjaan. Mendukung konfigurasi untuk event pekerjaan dan alur kerja.
-
-
Layanan pemantauan ARMS
-
Konfigurasi peringatan metrik: Konfigurasikan peringatan berdasarkan perubahan nilai metrik (mendukung enam metrik inti). Mendukung konfigurasi untuk satu atau beberapa pekerjaan.
-
Konfigurasi peringatan event: Hanya event kegagalan pekerjaan yang didukung. Peringatan event lainnya saat ini tidak didukung. Anda dapat mengonfigurasinya melalui konfigurasi peringatan event CloudMonitor.
-
Ganti jenis layanan pemantauan
Anda dapat beralih antar jenis layanan pemantauan untuk memenuhi kebutuhan bisnis yang berbeda.
Di Konsol Manajemen, pada kolom Actions untuk ruang kerja target, klik More untuk beralih ke jenis layanan pemantauan lainnya.
Baca catatan tentang pergantian jenis layanan dengan cermat. Anda hanya dapat melanjutkan konfigurasi setelah memilih kotak centang konfirmasi.
Konfigurasikan pemantauan dan peringatan menggunakan CloudMonitor
Konfigurasi peringatan metrik
Hanya Akun Alibaba Cloud yang membeli ruang kerja, serta Pengguna RAM dan Peran RAM di bawah akun tersebut yang memiliki izin namespace, yang dapat mengonfigurasi peringatan di CloudMonitor.
-
Masuk ke Konsol Cloud Monitor.
-
Pada panel navigasi kiri, pilih .
-
Klik Create Alert Rule dan konfigurasikan parameter.
-
Parameter
Deskripsi
Product
Realtime Compute for Apache Flink
Resource Scope
Pilih Instance. Aturan peringatan berlaku untuk ruang kerja tertentu dari Realtime Compute for Apache Flink.
Associated Resources
Klik Add Instance, pilih ruang kerja di wilayah target (Bagaimana cara melihat informasi seperti ID ruang kerja?), lalu klik OK.
Rule Description
Klik Add Rule > Simple Metric atau Composite Metric untuk membuka panel Set Rule Description.
Panel ini mencakup beberapa tingkat peringatan: Critical, Warn (memberi notifikasi melalui SMS, email, dan webhook), dan Info (memberi notifikasi melalui email dan webhook). Untuk setiap tingkat, Anda dapat mengatur kondisi ambang batas. Misalnya, nilai rata-rata >= ambang batas tertentu selama 3 periode berturut-turut, dengan 1 periode = 1 menit.
Pada bagian Dimension, Anda dapat mengonfigurasi namespace (nama namespace Flink) dan deploymentID (deployment ID pada tab Configuration pekerjaan Flink) untuk menentukan pekerjaan yang akan dipantau.
Catatan-
Jika daftar drop-down namespace dan deploymentID kosong, Anda dapat memasukkan nilainya secara manual.
-
Jika Anda membiarkan bidang ini kosong, semua pekerjaan di semua namespace akan dipantau.
Catatan-
Di lingkungan produksi, peringatan metrik tunggal mudah menyebabkan false positive atau false negative. Peringatan metrik komposit dapat lebih akurat mencerminkan exception bisnis. Untuk informasi lebih lanjut, lihat Contoh dan templat konfigurasi yang direkomendasikan untuk pemantauan dan peringatan.
-
Untuk informasi lebih lanjut tentang parameter lainnya, lihat Buat aturan peringatan.
-
Konfigurasi peringatan event (termasuk alur kerja)
Hanya Akun Alibaba Cloud yang membeli ruang kerja, serta Pengguna RAM dan Peran RAM di bawah akun tersebut yang memiliki izin namespace, yang dapat mengonfigurasi peringatan atau berlangganan event di CloudMonitor.
Peringatan event pekerjaan
Berlangganan peringatan event sistem untuk pekerjaan dengan mengonfigurasi kondisi. Konfigurasi batch untuk peringatan event didukung.
-
Masuk ke Konsol Cloud Monitor.
-
Pada panel navigasi kiri, pilih .
-
Pada tab Subscription Policy, klik Create Subscription Policy.
-
Di halaman Create Subscription Policy, konfigurasikan parameter. Untuk informasi selengkapnya mengenai parameter tersebut, lihat Mengelola langganan event (direkomendasikan).
-
Subscription Type: System Event.
-
Product: Pilih Realtime Compute for Apache Flink.
-
Event Name: Mendukung event Job Run Failed (tidak didukung saat menggunakan layanan pemantauan ARMS), Post-mortem Processing for ECS Downtime, dan Impact of Proactive O&M on ECS.
-
Event Content: Anda dapat menentukan pekerjaan atau mengonfigurasi peringatan batch dengan memasukkan informasi Flink berikut dalam konten event.
-
Workspace ID: Konfigurasikan peringatan event untuk semua pekerjaan di semua namespace di bawah ruang kerja target. Untuk melihat Workspace ID, lihat Bagaimana cara melihat informasi seperti ID ruang kerja?.
-
Namespace Name: Konfigurasikan peringatan event untuk semua pekerjaan di namespace target.
-
Deployment Job Name: Konfigurasikan peringatan event untuk pekerjaan tertentu. Pisahkan beberapa nama pekerjaan dengan koma (
,). Jika ada pekerjaan dengan nama yang sama di bawah akun Anda, gunakan DeploymentID sebagai gantinya. -
DeploymentID: Konfigurasikan peringatan event untuk pekerjaan tertentu. Pisahkan beberapa ID dengan koma (
,). Anda dapat menemukan ID ini pada tab Configuration halaman pekerjaan Flink sebagai deployment ID.
-
CatatanJika Anda tidak mengatur Application Group, Message, atau Event Resource, langganan berlaku untuk semua ruang kerja dalam akun Anda.
-
Peringatan event alur kerja
Berlangganan peringatan event sistem untuk alur kerja Flink dengan mengonfigurasi kondisi. Konfigurasi batch untuk peringatan event didukung. Untuk informasi lebih lanjut tentang alur kerja, lihat Kelola alur kerja.
-
Dapatkan ID resource node alur kerja.
-
Masuk ke Konsol Cloud Monitor.
-
Pada panel navigasi kiri, pilih .
-
Pada tab Event Monitoring, atur Product ke Realtime Compute for Apache Flink dan Event Name ke Workflow Task Status Change, lalu klik Filter by source.
-
Temukan ID resource node alur kerja di bawah ini.
Pada halaman Event Monitoring, pilih Realtime Compute for Apache Flink dari daftar drop-down Product. Di daftar event, temukan catatan dengan nama event flink:Workflow:TaskStateChange Workflow Task Status Change. Anda dapat melihat ID resource node alur kerja di kolom Resource.
Format resource adalah
acs:flink:cn-hangzhou:<AlibabaCloudAccountId>:resourceId/workspaceId/<workspaceId-namespaceId>#workflowDefinitionName/<workflowDefinitionName>#taskDefinitionName/<taskDefinitionName>. Anda juga dapat menggunakan format ini untuk langsung membuat ID resource untuk node alur kerja Anda.Parameter
Deskripsi
<AlibabaCloudAccountIdOfWorkspace>ID akun Alibaba Cloud yang memiliki ruang kerja Flink.
<workspaceId-namespaceId>Kombinasi dari
workspaceIddannamespaceId, digabungkan dengan tanda hubung (-).workspaceId: ID ruang kerja. Untuk informasi lebih lanjut, lihat Manajemen dan operasi ruang kerja.namespaceId: Nama namespace.<workflowDefinitionName>Nama alur kerja.
<taskDefinitionName>Nama node alur kerja.
CatatanUmumnya terdapat penundaan beberapa menit sebelum event perubahan status alur kerja muncul di CloudMonitor.
-
-
Berlangganan notifikasi event.
-
Pada panel navigasi kiri, pilih .
-
Pada tab Subscription Policy, klik Create Subscription Policy.
-
Pada halaman Create Subscription Policy, atur parameter kebijakan langganan. Untuk informasi selengkapnya mengenai parameter tersebut, lihat Mengelola langganan event (disarankan).
-
Subscription Type: System Event.
-
Product: Pilih Realtime Compute for Apache Flink.
-
Event Name: Pilih Workflow Task Status Change.
-
Event Content: Mendukung pemasukan parameter seperti
toState: FAILED(alur kerja gagal),toState: SUCCESS(alur kerja berhasil), danfromState: SCHEDULED, toState: RUNNING(status alur kerja berubah dari dijadwalkan menjadi berjalan). -
Event Resource: Masukkan ID resource alur kerja yang diperoleh pada Langkah 1. Pisahkan beberapa ID dengan koma (
,). -
Event Type, Event Level, Application Group: Jangan atur apa pun.
-
-
Konfigurasikan pemantauan dan peringatan menggunakan ARMS
Konfigurasi peringatan metrik
Pemantauan multi-metrik di ARMS hanya didukung melalui PromQL kustom. Untuk metode konfigurasi yang lebih sederhana, gunakan konfigurasi peringatan metrik CloudMonitor.
Konfigurasikan satu pekerjaan (Konsol Manajemen)
Anda dapat membuat aturan peringatan baru untuk pekerjaan target, atau membuat templat aturan peringatan lalu menggunakannya untuk membuat peringatan bagi pekerjaan target. Hal ini dapat mempercepat konfigurasi pemantauan dan peringatan.
Konsol Pengembangan hanya menampilkan event peringatan dari 48 jam terakhir. Untuk melihat event peringatan yang lebih lama, buka Alert Management di konsol ARMS.
-
Buka halaman konfigurasi peringatan.
-
Masuk ke Konsol Manajemen dan klik Console pada kolom Actions untuk ruang kerja target.
-
Pada halaman , klik nama pekerjaan target.
-
Klik tab Alarm.
-
-
Pada tab Alert Rules, pilih .
Anda juga dapat memilih . Dengan menambahkan dan menggunakan templat peringatan, Anda dapat membuat aturan peringatan secara langsung atau dengan sedikit modifikasi, sehingga mempercepat proses konfigurasi.
-
Masukkan informasi aturan peringatan.
Kategori
Parameter
Deskripsi
Rule
Name
Harus dimulai dengan huruf dan hanya boleh berisi huruf kecil, angka, dan garis bawah (_). Panjangnya dibatasi antara 3 hingga 64 karakter.
Description
Catatan tentang aturan tersebut.
Content
Konfigurasikan kondisi yang memicu peringatan. Sistem membandingkan nilai metrik yang ditentukan dengan ambang batas pada interval tertentu. Jika hasilnya memenuhi kondisi, peringatan akan dipicu secara otomatis.
-
Metric:
-
Restart Count in 1 Minute: Jumlah kali Manajer Pekerjaan melakukan restart dalam 1 menit.
-
Checkpoint Count in 5 Minutes: Jumlah checkpoint yang berhasil dalam 5 menit.
-
Emit Delay: Latensi bisnis, yaitu selisih waktu antara saat data dihasilkan dan saat data meninggalkan operator Source. Satuannya detik.
PentingWaktu pembuatan data bergantung pada stempel waktu yang dicatat di sistem eksternal. Jika sistem eksternal tidak memiliki stempel waktu, atau jika stempel waktu tersebut salah ditulis, nilai Emit Delay akan tidak akurat dan tidak mencerminkan latensi sebenarnya. Konfigurasikan peringatan dengan beberapa metrik untuk menentukan event sebenarnya. Untuk informasi lebih lanjut, lihat Contoh dan templat konfigurasi yang direkomendasikan untuk pemantauan dan peringatan.
-
IN RPS: Jumlah catatan input per detik. Satuannya catatan/detik.
-
OUT RPS: Jumlah catatan output per detik. Satuannya catatan/detik.
-
Source Idle Time: Waktu sumber tidak memproses data. Satuannya milidetik.
-
Job Failed: Pekerjaan gagal.
-
-
Time Difference: Panjang jendela waktu data historis yang diperiksa sistem mundur untuk setiap pemeriksaan. Satuannya menit.
-
Comparator: Mendukung >= dan <=.
-
Threshold: Nilai untuk dibandingkan dengan metrik.
-
Jika Anda memilih operator >=, sistem menggunakan nilai MAX dari sumbu vertikal. Jika nilai maksimum dalam selisih waktu >= ambang batas, aturan peringatan dipicu.
-
Jika Anda memilih operator <=, sistem menggunakan nilai MIN dari sumbu vertikal. Jika nilai minimum dalam selisih waktu <= ambang batas, aturan peringatan dipicu.
-
Sebagai contoh, asumsikan Anda memantau metrik "Checkpoint Count in 5 Minutes". Selisih waktu diatur ke 10 menit, ambang batasnya 2, dan operatornya "<=".
Setiap menit, sistem memeriksa data historis dari 10 menit terakhir. Jika menemukan interval 5 menit di mana jumlah checkpoint yang berhasil kurang dari atau sama dengan 2, sistem akan memicu peringatan.
Effective Period
Waktu ketika pemantauan peringatan aktif. Anda dapat menentukannya agar hanya aktif pada siang hari (09.00–18.00). Secara default, aktif sepanjang hari.
Alarm Rate
Kirim peringatan hanya sekali dalam jumlah menit berkelanjutan tertentu. Mendukung 1 menit hingga 1440 menit (24 jam).
Notification Method
Notification Method
Anda dapat memilih beberapa metode notifikasi. Metode yang didukung adalah:
-
DingTalk
-
Email
-
SMS
-
Webhook
-
Telepon
Pastikan nomor telepon penerima telah diverifikasi. Jika tidak, metode ini tidak akan berfungsi. Anda dapat mengklik Notification object management di bawah. Jika kolom Phone untuk kontak target pada tab kontak menunjukkan Unverified, klik untuk menyelesaikan verifikasi.
PentingPastikan Anda telah membuat dan menambahkan kontak notifikasi yang tersedia. Jika tidak, notifikasi peringatan akan gagal. Misalnya, jika Anda memilih DingTalk sebagai metode notifikasi, pilih DingTalk dan tambahkan kontak notifikasi DingTalk bertipe chatbot DingTalk.
Notification Object
Anda dapat memberi notifikasi ke beberapa kontak sekaligus. Anda dapat memilih atau mencari kontak. Sebelum memilih kontak, Anda harus mengklik Notification object management di sebelah kanan untuk membuatnya. Untuk informasi lebih lanjut, lihat Manajemen dan operasi ruang kerja.
Alarm Noise Reduction
Klik Advanced Settings, lalu Anda dapat mengaktifkan sakelar Alarm Noise Reduction.
Setelah Anda mengaktifkan pengurangan kebisingan peringatan, peringatan tidak akan dikirim untuk skenario di mana pekerjaan dapat pulih dengan cepat, seperti failover jangka pendek yang dipicu oleh penjadwalan kluster atau penyetelan otomatis. Peringatan hanya dikirim ketika kondisi ambang batas yang Anda tetapkan terpenuhi secara berkelanjutan.
No Data Alarms
Klik Advanced Settings, lalu Anda dapat mengaktifkan sakelar No Data Alarms dan memasukkan informasi waktu tanpa data berkelanjutan.
Setelah Anda mengaktifkan fitur ini, sistem memantau skenario di mana tidak ada data pemantauan yang dilaporkan. Jika tidak ada data yang dilaporkan dalam periode waktu yang dipilih, peringatan akan dipicu. Tidak adanya data pemantauan biasanya dilaporkan ketika JobManager abnormal, pekerjaan berhenti secara tak terduga, atau tautan pelaporan mengalami gangguan.
-
-
Klik OK.
Aturan peringatan yang disimpan diaktifkan secara default dan muncul dalam daftar aturan peringatan. Anda dapat memilih untuk menghentikan, mengedit, atau menghapusnya.
Konfigurasikan satu atau beberapa pekerjaan (konsol ARMS)
Jika Anda mengubah nama pekerjaan di konsol Flink, aturan peringatan apa pun yang dikonfigurasi di konsol ARMS berdasarkan nama pekerjaan asli akan menjadi tidak valid. Anda harus memilih ulang pekerjaan yang telah diganti namanya dan mengonfigurasi peringatan agar berlaku.
-
Masuk ke Konsol Manajemen.
-
Pada kolom Actions untuk ruang kerja target, pilih untuk menuju konsol ARMS.
Nama ruang kerja, ID ruang kerja, dan nama instance Prometheus yang sesuai ditampilkan di bagian atas.
Panel navigasi kiri mencakup Dashboard List, Service Discovery, Metric Management, Alert Rules, dan Settings. Status agen ditampilkan di kanan atas. Pada tab Metrics halaman Service Discovery, Anda dapat memfilter metrik berdasarkan nama pekerjaan, jenis metrik, dan kondisi lainnya. Daftar metrik menampilkan nama metrik, nama pekerjaan, jenis metrik, dan informasi lainnya.
-
Klik Alert Rules di sebelah kiri untuk membuat aturan peringatan.
-
Check Type: Mendukung peringatan metrik melalui ambang batas statis dan PromQL kustom (tidak termasuk metrik peringatan yang sudah didukung oleh Flink).
-
Filter Conditions: Konfigurasi peringatan batch didukung. Untuk Namespace, masukkan nama namespace. Memilih semua menunjukkan semua namespace di ruang kerja. Untuk Create Deployment, masukkan deployment ID pekerjaan target di namespace (ditemukan pada tab Configuration pekerjaan Flink). Memilih semua menunjukkan semua pekerjaan di namespace.
Untuk informasi lebih lanjut tentang parameter konfigurasi, lihat Buat aturan peringatan Prometheus. Anda juga dapat membuat templat aturan peringatan Prometheus. Untuk informasi lebih lanjut, lihat Buat templat aturan peringatan Prometheus.
-
Konfigurasi peringatan event
Hanya event kegagalan pekerjaan yang didukung. Konfigurasikan ini dengan memilih aturan Job Failed di konfigurasi peringatan metrik. Peringatan event lainnya saat ini tidak didukung. Anda dapat mengonfigurasinya melalui konfigurasi peringatan event CloudMonitor.
FAQ
Cara menambahkan chatbot DingTalk untuk peringatan di Konsol Pengembangan
Cara membuat webhook di Konsol Pengembangan
Dokumen terkait
-
Realtime Compute for Apache Flink memungkinkan Anda memilih antara CloudMonitor (layanan gratis) atau Pemantauan Prometheus ARMS untuk menyediakan fungsi pemantauan dan peringatan pekerjaan. Untuk perbandingan detail fitur, biaya, dan lainnya, lihat Perbandingan fitur antara layanan peringatan CloudMonitor dan ARMS.
-
ARMS mendukung konfigurasi fitur seperti kebijakan eskalasi, dan penjadwalan. Untuk informasi lebih lanjut, lihat Kebijakan eskalasi, dan tutorial praktik terkait.
-
CloudMonitor mendukung penerimaan notifikasi peringatan melalui grup DingTalk, grup Lark, dan lainnya. Untuk detail konfigurasi, lihat Metode notifikasi peringatan.
-
Untuk informasi lebih lanjut tentang metrik pemantauan yang didukung, lihat Metrik pemantauan.
-
Anda dapat menonaktifkan pemantauan dan peringatan atau membuang metrik tertentu (saat menggunakan ARMS) untuk menghemat biaya. Anda dapat melanjutkan pengumpulan metrik nanti jika diperlukan. Untuk operasi spesifik, lihat Buang atau pulihkan metrik pemantauan.