All Products
Search
Document Center

Managed Service for Prometheus:Buat aturan peringatan untuk instans Prometheus

Last Updated:Aug 19, 2026

Ketika metrik Prometheus melebihi ambang batas yang ditentukan atau menunjukkan pola abnormal, notifikasi tepat waktu dapat mencegah insiden memburuk. Aturan peringatan Prometheus ARMS memungkinkan Anda menetapkan kondisi pada metrik apa pun—baik dengan memilih metrik preset maupun menulis kueri PromQL kustom—dan mengarahkan notifikasi ke tim Anda melalui pesan teks, email, panggilan suara, chatbot DingTalk, chatbot WeCom, atau webhook.

Prasyarat

Anda telah terhubung ke Prometheus. Untuk informasi selengkapnya, lihat:

Entri

  1. Masuk ke Konsol Managed Service for Prometheus.

  2. Di panel navigasi sebelah kiri, klik View Alert Rules.

  3. Pada halaman Prometheus Alert Rules, klik Create Prometheus Alert Rule.

Buat aturan peringatan Prometheus berdasarkan ambang batas statis

Jenis pemeriksaan ambang batas statis menyediakan metrik peringatan yang telah ditentukan sebelumnya. Anda dapat memilih metrik ini untuk membuat aturan peringatan secara cepat.

  1. Pada halaman Create Prometheus Alert Rule, konfigurasikan parameter peringatan berikut.

    Parameter

    Deskripsi

    Contoh

    Alert Name

    Nama peringatan.

    prod-cluster-container-cpu-alert

    Check Type

    Pilih Static threshold.

    Static threshold

    Prometheus Instance

    Pilih instans Prometheus tempat Anda ingin membuat peringatan.

    Production Cluster

    Alert Group

    Pilih grup peringatan.

    Tipe Prometheus yang berbeda mendukung grup peringatan yang berbeda. Opsi grup peringatan yang tersedia berubah sesuai dengan tipe instans Prometheus yang dipilih.

    Kubernetes Workloads

    Alert Metric

    Pilih metrik yang ingin Anda konfigurasikan untuk peringatan. Setiap grup peringatan berkaitan dengan metrik yang berbeda.

    Container CPU utilization

    Alert Condition

    Tentukan kondisi yang memicu event peringatan berdasarkan konten yang telah ditentukan dari metrik peringatan.

    Kondisi peringatan terpenuhi ketika penggunaan CPU kontainer greater than 80%.

    Filter Condition

    Tentukan cakupan aturan peringatan berdasarkan metrik peringatan. Event peringatan dipicu ketika sumber daya apa pun yang memenuhi kondisi filter memenuhi aturan peringatan.

    Kondisi filter berikut tersedia:

    • Traverse: Aturan peringatan berlaku untuk semua sumber daya dalam instans Prometheus saat ini. Traverse adalah kondisi filter default.

    • Equal To: Setelah memilih kondisi ini, masukkan nama sumber daya tertentu. Aturan peringatan hanya berlaku untuk sumber daya tersebut. Anda tidak dapat memasukkan beberapa nama sumber daya.

    • Not Equal To: Setelah memilih kondisi ini, masukkan nama sumber daya tertentu. Aturan peringatan berlaku untuk semua sumber daya kecuali yang ditentukan. Anda tidak dapat memasukkan beberapa nama sumber daya.

    • Match Regular Expression: Setelah memilih kondisi ini, masukkan ekspresi reguler untuk mencocokkan nama sumber daya sesuai kebutuhan. Aturan peringatan berlaku untuk semua sumber daya yang cocok dengan ekspresi reguler tersebut.

    • Do Not Match Regular Expression: Setelah memilih kondisi ini, masukkan ekspresi reguler untuk mencocokkan nama sumber daya sesuai kebutuhan. Aturan peringatan mengecualikan semua sumber daya yang cocok dengan ekspresi reguler tersebut.

    Catatan
    • Setelah mengatur kondisi filter, area Data Preview akan muncul.

    • Kondisi filter tidak boleh melebihi 300 karakter.

    Traverse

    Data Preview

    Area Data Preview menampilkan pernyataan Prometheus Query Language (PromQL) yang sesuai dengan kondisi peringatan. Area ini juga menampilkan nilai metrik pemantauan sebagai kurva deret waktu.

    Secara default, hanya nilai real-time dari satu sumber daya yang ditampilkan. Anda dapat memilih sumber daya target dan rentang waktu di kotak filter area ini untuk melihat nilai dari sumber daya dan rentang waktu yang berbeda.

    Catatan
    • Ambang batas peringatan ditampilkan sebagai garis lurus merah pada kurva deret waktu. Bagian kurva yang memenuhi ambang batas peringatan ditampilkan dalam warna merah tua, sedangkan bagian yang tidak memenuhi ditampilkan dalam warna biru.

    • Arahkan kursor ke kurva deret waktu untuk melihat detail sumber daya pada titik waktu tertentu.

    • Pilih rentang waktu pada kurva deret waktu untuk melihat kurva periode tersebut.

    None

    Duration

    • Jika kondisi peringatan terpenuhi, event peringatan dipicu segera: Event peringatan dipicu jika ada titik data yang memenuhi ambang batas.

    • Event peringatan dipicu hanya setelah kondisi peringatan bertahan selama N menit: Event peringatan dipicu hanya jika durasi pemenuhan ambang batas lebih besar dari atau sama dengan N menit.

    Anda tidak dapat mengonfigurasi durasi dalam satuan detik. Ini merupakan keterbatasan produk dan merupakan perilaku yang diharapkan.

    1

    Alert Level

    Sesuaikan tingkat peringatan. Tingkat peringatan default adalah Default. Tingkat keparahan meningkat dari Default, P4, P3, P2, hingga P1.

    Default

    Alert Content

    Informasi peringatan yang diterima pengguna. Anda dapat menggunakan sintaks templat Go untuk menyesuaikan variabel parameter dalam konten peringatan.

    Namespace: {{$labels.namespace}} / Pod: {{$labels.pod_name}} / Container: {{$labels.container}} CPU utilization {{$labels.metrics_params_opt_label_value}} {{$labels.metrics_params_value}}%, Current value: {{ printf "%.2f" $value }}%

    Alert Notification

    • Simple Mode: Anda dapat mengatur Notification Receiver, Notification Period, dan Whether to Resend Notifications.

    • Standard Mode:

      • Do not specify a notification policy: Jika memilih opsi ini, setelah membuat aturan peringatan, Anda dapat membuat kebijakan notifikasi baru di halaman Notification Policy dan menentukan aturan pencocokan serta kondisi pencocokan, seperti nama aturan peringatan, untuk mencocokkan aturan peringatan tersebut. Ketika aturan peringatan dipicu dan menghasilkan event peringatan, informasi peringatan dikirim ke kontak atau grup kontak yang ditentukan dalam kebijakan notifikasi. Untuk informasi selengkapnya, lihat Notification policies.

      • Specify a notification policy: Jika memilih opsi ini, ARMS secara otomatis menambahkan aturan pencocokan ke kebijakan notifikasi yang sesuai. Konten aturan pencocokan adalah ID aturan peringatan, yang ditampilkan sebagai nama aturan peringatan. Hal ini memastikan bahwa event peringatan yang dihasilkan oleh aturan peringatan saat ini dicocokkan oleh kebijakan notifikasi yang dipilih.

      Penting

      Menentukan kebijakan notifikasi secara cepat hanya memastikan bahwa event peringatan dari aturan peringatan saat ini dicocokkan oleh kebijakan notifikasi yang dipilih dan menghasilkan peringatan yang sesuai. Namun, event dari aturan peringatan saat ini juga dapat dicocokkan oleh kebijakan notifikasi lain yang dikonfigurasi dengan pencocokan kabur, yang juga menghasilkan peringatan. Hubungan antara event peringatan dan kebijakan notifikasi bersifat pemetaan banyak-ke-banyak.

    Do not specify a notification rule

    Advanced Settings

    Alert Check Interval

    Interval sistem memeriksa aturan peringatan untuk menentukan apakah data memenuhi kondisi peringatan. Nilai default adalah 1 menit, dan minimum adalah 1 menit. Bahkan jika Anda memasukkan nilai kurang dari 1 menit, misalnya 15 detik, sistem tetap melakukan pemeriksaan setiap 1 menit. Ini merupakan keterbatasan produk dan merupakan perilaku yang diharapkan.

    1

    Check after data is complete

    • Yes

    • No

    Yes

    Tags

    Tentukan tag untuk peringatan. Tag dapat digunakan sebagai opsi untuk aturan pencocokan kebijakan notifikasi.

    None

    Annotations

    Tentukan anotasi untuk peringatan.

    None

  2. Setelah menyelesaikan konfigurasi, klik Save. Di halaman daftar aturan peringatan Prometheus, Anda dapat melihat status aturan peringatan saat ini.

    Jika Status aturan peringatan adalah Automatic Interruption, edit aturan peringatan untuk mengatasi penyebab gangguan tersebut. Lalu, klik Start, dan di kotak dialog yang muncul, klik Confirm. Jika Anda tidak dapat menyelesaikan masalah tersebut, hubungi tim fitur peringatan ARMS di DingTalk (ID: d9j_rg9e4062f) untuk bantuan.

    Aturan peringatan dapat terganggu secara otomatis karena alasan berikut:

    • Kueri aturan mengembalikan lebih dari 1.500 hasil.

    • Tidak ada penerima notifikasi yang dikonfigurasi dalam sistem manajemen peringatan.

    • Instans Prometheus telah di-uninstall atau tidak tersedia.

Buat aturan peringatan Prometheus menggunakan kueri PromQL kustom

Untuk memantau metrik yang tidak tercakup oleh ambang batas statis yang telah dikonfigurasi sebelumnya, buat aturan peringatan dengan kueri Prometheus Query Language (PromQL) kustom.

  1. Pada halaman Create Prometheus Alert Rule, atur parameter peringatan berikut.

    Parameter

    Deskripsi

    Contoh

    Alert Name

    Nama peringatan.

    Pod CPU usage is greater than 8%

    Check Type

    Atur ke Custom PromQL query.

    Custom PromQL query

    Prometheus Instance

    Pilih instans Prometheus tempat Anda ingin membuat peringatan.

    None

    Reference Alert Group

    Pilih grup peringatan.

    Tipe Prometheus yang berbeda mendukung grup peringatan yang berbeda. Opsi grup peringatan yang tersedia berubah sesuai dengan tipe instans Prometheus yang dipilih.

    Kubernetes Workload

    Reference Alert Metric

    Opsional. Metrik referensi menyediakan konfigurasi PromQL kustom untuk metrik umum. Pilih metrik serupa untuk mengisi bidang secara otomatis. Lalu, modifikasi konfigurasi sesuai kebutuhan.

    Parameter Reference Metric secara otomatis memfilter metrik peringatan yang didukung berdasarkan tipe instans Prometheus yang dipilih.

    Pod disk usage alert

    Custom PromQL Statement

    Gunakan pernyataan PromQL untuk menetapkan ekspresi aturan peringatan.

    Namespace: {{$labels.namespace}}/Pod: {{$labels.pod_name}}/Disk device: {{$labels.device}} usage exceeds 90%, current value {{ printf "%.2f" $value }}%max(container_fs_usage_bytes{pod!="", namespace!="arms-prom",namespace!="monitoring"}) by (pod_name, namespace, device)/max(container_fs_limit_bytes{pod!=""}) by (pod_name,namespace, device) * 100 > 90

    Data Preview

    Area Data Preview menampilkan pernyataan Prometheus Query Language (PromQL) yang sesuai dengan kondisi peringatan. Area ini juga menampilkan nilai metrik pemantauan sebagai kurva deret waktu.

    Secara default, hanya nilai real-time dari satu sumber daya yang ditampilkan. Anda dapat memilih sumber daya target dan rentang waktu di kotak filter area ini untuk melihat nilai dari sumber daya dan rentang waktu yang berbeda.

    Catatan
    • Arahkan kursor ke kurva deret waktu untuk melihat detail sumber daya pada titik data tertentu.

    • Pilih rentang waktu pada kurva untuk melihat deret waktu periode tersebut.

    None

    Duration

    • Peringatan dipicu segera jika ada titik data yang memenuhi ambang batas.

    • Peringatan dipicu hanya jika kondisi bertahan selama N menit berturut-turut.

    Mengonfigurasi durasi dalam satuan detik tidak didukung. Ini merupakan keterbatasan produk dan merupakan perilaku yang diharapkan.

    1

    Alert Level

    Sesuaikan tingkat peringatan. Tingkat peringatan default adalah Default. Tingkat keparahan meningkat dari Default, P4, P3, P2, hingga P1.

    Default

    Alert Content

    Informasi peringatan yang diterima pengguna. Gunakan sintaks templat Go untuk menyesuaikan variabel parameter dalam konten peringatan.

    Contoh berikut menunjukkan templat untuk peringatan restart pod. Ini membantu Anda mengonfigurasi konten notifikasi yang mudah dibaca:

    Namespace: {{$labels.namespace}}/Pod: {{$labels.pod_name}} restarted more than {{ $labels.metrics_params_value}} times in {{$labels.metrics_params_time}} minutes. Current restarts: {{ $value }}

    Namespace: {{$labels.namespace}}/Pod: {{$labels.pod_name}}/Disk device: {{$labels.device}} usage exceeds 90%, current value {{ printf "%.2f" $value }}%

    Alert Notification

    • Simple Mode: Anda dapat mengatur Notification Receiver, Notification Period, dan Whether to Resend Notifications.

    • Standard Mode:

      • Do not specify a notification policy: Jika memilih opsi ini, setelah membuat aturan peringatan, Anda dapat membuat kebijakan notifikasi baru di halaman Notification Policy dan menentukan aturan pencocokan serta kondisi pencocokan, seperti nama aturan peringatan, untuk mencocokkan aturan peringatan tersebut. Ketika aturan peringatan dipicu dan menghasilkan event peringatan, informasi peringatan dikirim ke kontak atau grup kontak yang ditentukan dalam kebijakan notifikasi. Untuk informasi selengkapnya, lihat Notification policies.

      • Specify a notification policy: Jika memilih opsi ini, ARMS secara otomatis menambahkan aturan pencocokan ke kebijakan notifikasi yang sesuai. Konten aturan pencocokan adalah ID aturan peringatan, yang ditampilkan sebagai nama aturan peringatan. Hal ini memastikan bahwa event peringatan yang dihasilkan oleh aturan peringatan saat ini dicocokkan oleh kebijakan notifikasi yang dipilih.

      Penting

      Menentukan kebijakan notifikasi secara cepat hanya memastikan bahwa event peringatan dari aturan peringatan saat ini dicocokkan oleh kebijakan notifikasi yang dipilih dan menghasilkan peringatan yang sesuai. Namun, event dari aturan peringatan saat ini juga dapat dicocokkan oleh kebijakan notifikasi lain yang dikonfigurasi dengan pencocokan kabur, yang juga menghasilkan peringatan. Hubungan antara event peringatan dan kebijakan notifikasi bersifat pemetaan banyak-ke-banyak.

    Do not specify a notification rule

    Advanced Settings

    Alert Check Period

    Interval, dalam menit, untuk memeriksa aturan peringatan. Nilai minimum adalah 1 menit. Jika Anda memasukkan nilai kurang dari 1 menit, misalnya 15 detik, sistem tetap memeriksa setiap 1 menit. Ini merupakan keterbatasan produk dan merupakan perilaku yang diharapkan.

    1

    Check After Data Is Complete

    • Yes

    • No

    Yes

    Tags

    Tentukan tag untuk peringatan. Tag dapat digunakan sebagai opsi untuk aturan pencocokan kebijakan notifikasi.

    None

    Annotations

    Tentukan anotasi untuk peringatan.

    None

  2. Setelah mengonfigurasi parameter, klik Save. Di halaman daftar aturan peringatan Prometheus, Anda dapat melihat status aturan peringatan tersebut.

    Jika Status aturan peringatan adalah Automatic Interruption, edit kembali aturan tersebut berdasarkan alasan yang diberikan. Lalu, klik Start dan klik Confirm di kotak dialog yang muncul. Jika Anda tidak dapat menyelesaikan gangguan tersebut, hubungi akun layanan fitur peringatan ARMS (d9j_rg9e4062f) untuk bantuan.

    Aturan peringatan dapat terganggu secara otomatis karena alasan berikut:

    • Kueri aturan mengembalikan lebih dari 1.500 hasil.

    • Tidak ada penerima notifikasi yang dikonfigurasi dalam sistem manajemen peringatan.

    • Instans Prometheus telah di-uninstall atau tidak tersedia.

Kelola aturan peringatan

  • Untuk peringatan yang dibuat di halaman Alerting Rules Konsol Managed Service for Prometheus, seperti peringatan ambang batas statis dan peringatan Prometheus Query Language (PromQL) kustom, Anda dapat mengedit, mengaktifkan (untuk peringatan dalam status Stopped), menonaktifkan (untuk peringatan dalam status Running), menghapus, dan menyalin peringatan tersebut, serta melihat riwayat event-nya.

  • Untuk peringatan yang dihasilkan di konsol Produk Alibaba Cloud lainnya, Anda dapat melihat riwayat event peringatan atau kembali ke daftar peringatan produk yang sesuai.

Setelah Anda memodifikasi aturan peringatan, event peringatan yang belum dipulihkan tetap dipicu berdasarkan aturan sebelumnya. Aturan baru hanya berlaku untuk pemicu peringatan berikutnya setelah Anda mengklaim dan menyelesaikan event yang belum dipulihkan di halaman Alert Sending History.

FAQ

Mengapa notifikasi pemulihan peringatan tertunda?

Sistem memiliki penundaan bawaan untuk mencegah negatif palsu akibat keterlambatan pelaporan agen. Selama setiap pemeriksaan, mesin peringatan meninjau data dari 10 menit terakhir. Peringatan dikonfirmasi telah pulih hanya setelah jendela waktu ini berlalu, bahkan jika metrik tidak lagi memenuhi kondisi peringatan.

  • Waktu pemulihan: Notifikasi pemulihan dikirim sekitar 10 menit setelah metrik berhenti memicu peringatan.

  • Detail mekanisme: Prometheus tidak memiliki fitur pemulihan otomatis bawaan. Fitur ini bergantung pada mekanisme deteksi ARMS.

Apa yang harus saya lakukan jika kebijakan notifikasi hilang setelah menerapkan templat aturan peringatan?

Penyebab: Templat aturan peringatan tidak berisi pengaturan kebijakan notifikasi. Saat Anda menerapkan ulang templat, ID aturan mungkin berubah. Hal ini menyebabkan kebijakan notifikasi asli gagal karena tidak dapat lagi mencocokkan label _aliyun_arms_alert_rule_id.

Solusi: Buka Alert Management > Notification Policy dan temukan kebijakan yang terpengaruh. Di bagian Dispatch Conditions, gunakan label yang lebih stabil seperti alertname atau nama kluster cluster untuk mengaitkan ulang aturan, alih-alih menggunakan ID aturan.

Apa yang harus saya lakukan jika saya masih menerima peringatan duplikat setelah mengubah ekspresi peringatan menjadi meningkat?

Penyebab: Jika kebijakan notifikasi Anda dikonfigurasi untuk mengirim ulang notifikasi setiap N menit dan diatur ke pemulihan manual, sistem akan terus menghasilkan event peringatan baru selama metrik memenuhi kondisi ekspresi baru.

Solusi: Modifikasi kebijakan notifikasi. Ubah pengaturan notifikasi ulang menjadi 'Notify only on the first trigger' atau beralih ke mode 'Automatic recovery'. Pastikan juga ekspresi baru telah disimpan dan aktif.

Bagaimana cara memecahkan masalah aturan peringatan Prometheus yang tidak memiliki data atau tidak dipicu setelah dikonfigurasi?

Ikuti langkah-langkah berikut untuk menyelidiki:

  1. Periksa komponen: Pastikan komponen kube-state-metrics telah diinstal di kluster ACK Anda. Jika belum diinstal, instal komponen tersebut. Periksa status komponen Prometheus. Jika perlu, instal ulang komponen ack-arms-prometheus.

  2. Verifikasi riwayat pemicu: Klik Alert History di samping aturan untuk memeriksa catatan pemicu. Tidak adanya catatan menunjukkan bahwa kondisi aturan tidak terpenuhi. Kemungkinan penyebabnya termasuk nama metrik salah, data kosong, atau rentang waktu kueri tidak valid. Jika catatan ada tetapi tidak ada notifikasi yang dikirim, periksa aturan pengiriman di kebijakan notifikasi Anda. Pastikan label, nama kluster, dan kondisi lainnya sesuai dengan kriteria dalam aturan pengiriman.

  3. Rekomendasi: Gunakan templat peringatan terverifikasi terbaru dari Alibaba Cloud. Hal ini membantu mencegah positif palsu atau peringatan yang gagal dipicu, yang dapat terjadi dengan templat lama.

  4. Periksa sintaksis: Jika Anda melihat error halaman, periksa ekspresi reguler dalam kueri PromQL Anda. Ekspresi kosong, seperti {pvc=~}, tidak valid dan akan menyebabkan error. Perbaiki menjadi {pvc=~".*"} atau nilai spesifik.

Apakah ada biaya untuk peringatan memori pod dari pemantauan Prometheus pada kluster ACS?

Ya. Kluster ACS mendukung pemantauan dan peringatan untuk metrik memori pod. Anda dikenai biaya untuk peringatan yang dikirim melalui pesan teks dan panggilan suara. Peringatan yang dikirim melalui DingTalk Robot dan Webhook tidak dikenai biaya.