Buat aturan peringatan untuk memantau aplikasi dan layanan Anda. Saat kondisi terpenuhi, Cloud Monitor akan memberi tahu Anda melalui kontak, chatbot, webhook, atau integrasi aksi.
Prasyarat
-
Anda telah mengaktifkan layanan pemantauan observabilitas yang diperlukan, seperti Prometheus, Pemantauan Aplikasi, dan Log Service.
-
Anda telah membuat kontak notifikasi.
Buat aturan peringatan
-
Masuk ke Konsol Cloud Monitor 2.0. Di panel navigasi sebelah kiri, pilih All Features > Alert Center.
-
Pada halaman Alert Center, pilih Alert management > Alert rules.
-
Pada halaman Alert rules, klik Create alert rule.
-
Pada panel Create alert rule, konfigurasikan parameter berikut.
-
Rule name: Nama untuk mengidentifikasi aturan peringatan.
-
Monitoring type: Jenis layanan atau resource yang akan dipantau.
-
Managed Service for Prometheus/Cloud Synthetic Monitoring
Parameter
Description
Data Source Type
Sumber data pemantauan.
Region
Wilayah tempat sumber data berada.
Prometheus instance
Instans tempat aturan peringatan diterapkan.
Detection condition definition method
Custom PromQL: Buat kueri custom PromQL. Contoh Penggunaan Fungsi PromQL.
Configure based on predefined metrics:
-
Metric group: Pilih grup metrik.
-
Metric: Pilih metrik.
-
Detection condition: Tetapkan kondisi deteksi dengan menentukan operator perbandingan dan nilai. p50, p75, p90, dan p99 merepresentasikan persentil.
-
PromQL preview: Pratinjau kueri PromQL untuk metrik yang telah ditentukan.
Severity level
Tetapkan tingkat keparahan untuk aturan peringatan.
-
P1: Critical: Masalah yang memengaruhi ketersediaan layanan inti dengan dampak luas.
-
P2: Error: Kegagalan layanan sebagian yang memengaruhi ketersediaan.
-
P3: Warning: Potensi masalah yang dapat menyebabkan error layanan atau memengaruhi bisnis Anda.
-
P4: Information: Event prioritas rendah. Tingkat default.
Duration
Berapa lama suatu kondisi harus bertahan sebelum peringatan dipicu. Mencegah alarm palsu akibat fluktuasi sesaat.
Alert detection period
Interval eksekusi aturan peringatan. Nilai default adalah 60 detik, artinya pemeriksaan dilakukan sekali per menit.
Content
Anda dapat menggunakan sintaks templat Go untuk menyesuaikan isi pesan peringatan. Contoh: Namespace: {{$labels.namespace}} / Pod: {{$labels.pod_name}} / Container: {{$labels.container}} CPU usage {{$labels.metrics_params_opt_label_value}} {{$labels.metrics_params_value}}%, Current value {{ printf "%.2f" $value }}%
Labels
Pasangan kunci-nilai kustom untuk mengkategorikan dan memfilter aturan peringatan. Contoh:
env: productiondanteam: sre.Annotations
Informasi tambahan untuk aturan peringatan, seperti deskripsi panjang atau tautan runbook. Contoh:
description: CPU usage is highdanrunbook_url: https://wiki.xxx.com/runbook\. -
-
Application Monitoring
Parameter
Description
Data Source Type
Jenis sumber data.
Region
Wilayah tempat sumber data berada.
Application
Aplikasi yang akan dipantau.
Metric group
Grup metrik untuk aplikasi tersebut.
Interface name
Metode pencocokan antarmuka: Traverse, Equals, Not Equals, Regex Match, Regex Not Match, atau No Dimension.
Interface call type
Detection condition method
Single condition:
-
Tetapkan rentang waktu menjadi Last
NMinutes, jenis panggilan, metode perhitungan, dan operator perbandingan. -
Tetapkan ambang batas untuk berbagai tingkat keparahan: Critical, Error, Warning, dan Information.
Multiple conditions:
-
Multi-alert trigger rule: Pilih Any condition is met atau All conditions are met.
-
Detection condition 1: Parameter yang sama seperti kondisi tunggal.
-
Add detection condition: Tambahkan lebih banyak kondisi sesuai kebutuhan.
-
Severity level: Nilai yang valid: P1: Critical, P2: Error, P3: Warning, dan P4: Information.
Alert detection period
Interval eksekusi aturan peringatan. Nilai default adalah 60 detik, artinya pemeriksaan dilakukan sekali per menit.
Content
Isi notifikasi peringatan yang dapat disesuaikan.
Tags
Pasangan kunci-nilai kustom untuk mengkategorikan dan memfilter aturan peringatan. Contoh:
env: productiondanteam: sre.Annotations
Informasi tambahan untuk aturan peringatan, seperti deskripsi panjang atau tautan runbook. Contoh:
description: CPU usage is highdanrunbook_url: https://wiki.xxx.com/runbook\. -
-
Large model observability
Parameter
Description
Data Source Type
Jenis sumber data, yang secara otomatis diatur ke UModel.
Entity Type
Jenis entitas yang akan dipantau.
Metric set
Kumpulan metrik yang akan dievaluasi, seperti metrik operasional aplikasi AI, metrik model GenAI, atau metrik traffic aplikasi AI.
Detection condition
Tetapkan ambang batas yang memicu peringatan.
Severity level
Tingkat keparahan peringatan. Nilai yang valid adalah P1: Critical, P2: Error, P3: Warning, dan P4: Information.
Duration
Durasi kondisi harus bertahan sebelum peringatan dipicu.
Alert detection period
Interval eksekusi aturan peringatan. Nilai default adalah 60 detik, artinya pemeriksaan dilakukan sekali per menit.
Content
Isi notifikasi peringatan yang dapat disesuaikan.
Tags
Pasangan kunci-nilai kustom untuk mengkategorikan dan memfilter aturan peringatan. Contoh:
env: productiondanteam: sre.Annotations
Informasi tambahan untuk aturan peringatan, seperti deskripsi panjang atau tautan runbook. Contoh:
description: CPU usage is highdanrunbook_url: https://wiki.xxx.com/runbook\. -
Container Insights/ECS Insights/Hologres Insights/AI Training Service Insights/Database Insights
Parameter
Description
Data Source Type
Sumber data pemantauan.
Region
Wilayah tempat sumber data berada.
Prometheus instance
Instans tempat aturan peringatan diterapkan.
Detection condition definition method
Custom PromQL: Buat kueri custom PromQL. Contoh Penggunaan Fungsi PromQL.
Configure based on predefined metrics:
-
Metric group: Pilih grup metrik.
-
Metric: Pilih metrik.
-
Detection condition: Tetapkan kondisi deteksi dengan menentukan operator perbandingan dan nilai.
-
PromQL preview: Pratinjau kueri PromQL untuk metrik yang telah ditentukan.
Severity level
Tetapkan tingkat keparahan untuk aturan peringatan.
-
P1: Critical
-
P2: Error
-
P3: Warning
-
P4: Information
Duration
Durasi kondisi harus bertahan sebelum peringatan dipicu.
Alert detection period
Interval eksekusi aturan peringatan. Nilai default adalah 60 detik, artinya pemeriksaan dilakukan sekali per menit.
Run detection after data is complete
Pilih metode deteksi.
Content
Anda dapat menggunakan sintaks templat Go untuk menyesuaikan isi pesan peringatan. Contoh: Namespace: {{$labels.namespace}} / Pod: {{$labels.pod_name}} / Container: {{$labels.container}} CPU usage {{$labels.metrics_params_opt_label_value}} {{$labels.metrics_params_value}}%, current value {{ printf "%.2f" $value }}%
Tags
Pasangan kunci-nilai kustom untuk mengkategorikan dan memfilter aturan peringatan. Contoh:
env: productiondanteam: sre.Annotations
Informasi tambahan untuk aturan peringatan, seperti deskripsi panjang atau tautan runbook. Contoh:
description: CPU usage is highdanrunbook_url: https://wiki.xxx.com/runbook\. -
-
Log Audit
Parameter
Description
Select template
ActionTrail: Pilih templat ActionTrail.
Host audit: Pilih templat audit host.
Container audit: Pilih templat audit kontainer.
Query and statistics
Single query: Lakukan kueri dengan mengonfigurasi parameter terkait log.
Set operation: Konfigurasikan operasi himpunan pada beberapa kumpulan resource.
Detection Logic
Tambahkan kondisi dan tetapkan metode pencocokan data serta tingkat keparahan.
Severity level
Nilai yang valid: Critical, Error, Warning, dan Information.
Consecutive hits
Tentukan jumlah kali berturut-turut kondisi harus terpenuhi untuk memicu peringatan.
Alert detection period
Interval eksekusi aturan peringatan. Nilai default adalah 60 detik, artinya pemeriksaan dilakukan sekali per menit.
Tags
Pasangan kunci-nilai kustom untuk mengkategorikan dan memfilter aturan peringatan. Contoh:
env: productiondanteam: sre.Annotations
Informasi tambahan untuk aturan peringatan, seperti deskripsi panjang atau tautan runbook. Contoh:
description: CPU usage is highdanrunbook_url: https://wiki.xxx.com/runbook\. -
Log Service: Parameter yang sama dengan jenis pemantauan Log Audit.
-
-
Alert notification.
-
Notification recipient: Penerima yang akan diberi tahu saat peringatan dipicu.
-
Contact: Kontak individu yang akan diberi tahu.
-
Contact group: Kelompok kontak yang akan diberi tahu.
-
DingTalk: Mengirim peringatan ke chatbot grup DingTalk.
-
WeCom: Mengirim peringatan ke chatbot WeCom.
-
Lark: Mengirim peringatan ke chatbot Lark.
-
Slack: Mengirim peringatan menggunakan Slack.
-
Custom webhook: Mengirim peringatan menggunakan webhook kustom.
-
-
Integrate with ARMS alert management: Integrasi dengan Application Real-Time Monitoring Service (ARMS) untuk mengelola siklus hidup peringatan.
CatatanEvent peringatan dikirim ke pusat O&M Peringatan ARMS secara default. Konfigurasikan notifikasi di sana.
-
Action integration: Layanan yang dipicu untuk respons insiden otomatis, seperti Log Service, antrian pesan ringan, Function Compute, dan layanan pihak ketiga seperti PagerDuty dan webhook.
-
Notification silence period: Waktu tunggu sebelum mengirim ulang notifikasi untuk peringatan yang belum terselesaikan. Nilai yang valid: 1, 5, 10, 15, 30, dan 50 menit, serta 1, 3, 6, 12, dan 24 jam.
CatatanContoh: Dengan Notification silence period diatur ke 12 hours, Cloud Monitor akan mengirim ulang notifikasi setelah 12 jam jika peringatan masih berlangsung.
-
Effective period: Jendela waktu saat aturan peringatan aktif. Notifikasi hanya dikirim selama periode ini.
Catatan-
Peringatan yang dipicu di luar periode efektif dicatat dalam riwayat tetapi tidak menghasilkan notifikasi.
-
Periode notifikasi dapat diatur dalam rentang 24 jam dan dapat mencakup hari berikutnya, misalnya dari pukul 23.00 hingga 01.00 pada hari berikutnya.
-
-
-
Kelola aturan peringatan
-
Halaman Alert Rules mencantumkan semua aturan peringatan dengan informasi berikut.
Parameter
Description
Alert status
Status saat ini dari aturan. Nilai yang valid:
- Ok: Tidak ada kondisi peringatan yang terpicu.
- Alarm: Kondisi peringatan terpicu, peringatan aktif.
- NoData: Tidak tersedia data pemantauan.
Rule name/ID
Nama tampilan dan pengenal unik (UUID) aturan peringatan.
Enabled status
Apakah aturan diaktifkan. Aturan yang diaktifkan dievaluasi sesuai interval yang dikonfigurasi; aturan yang dinonaktifkan tidak dievaluasi.
Service source
Layanan tempat aturan diterapkan.
-
Anda dapat mencari aturan peringatan menggunakan parameter berikut:
-
Monitoring type
-
Rule name/ID
-
Alert status
-
Enabled status
-
More filters: Cari berdasarkan tag atau notification contact.
-
Jika cakupan resource aturan peringatan default sistem diatur ke semua resource, Anda tidak dapat langsung mengubah cakupan resource untuk mengecualikan instans tertentu setelah aturan dibuat.
Untuk mengecualikan resource tertentu, lakukan langkah-langkah berikut:
-
Pada halaman Alert rules, temukan aturan default sistem target dan klik More > Duplicate di kolom Actions.
-
Pada kotak dialog Create alert rule, pilih tab Prometheus instance atau Aggregate view di pemilih sumber data, lalu pilih resource spesifik yang ingin Anda pantau.
-
Klik OK untuk menyimpan aturan baru.
-
Di kolom Actions aturan default sistem asli, klik More > Delete untuk menghapus aturan asli, atau matikan sakelar Enabled status di baris aturan untuk menonaktifkannya.
CatatanJika Anda tidak menghapus atau menonaktifkan aturan asli, resource yang sama akan memicu dua peringatan saat ambang batas tercapai.
Saat Anda mengedit aturan peringatan yang dimigrasikan dari Cloud Monitor 1.0, notifikasi peringatan hanya mendukung kelompok kontak lama. Anda tidak dapat memilih Notification Recipient yang dibuat di Cloud Monitor 2.0. Cloud Monitor 1.0 menggunakan kelompok kontak peringatan, sedangkan Cloud Monitor 2.0 menggunakan penerima notifikasi dan kebijakan notifikasi. Kedua sistem ini independen dan tidak saling kompatibel. Untuk menggunakan Notification Recipient, buat aturan peringatan baru di konsol Cloud Monitor 2.0.
-
Edit: Untuk mengedit aturan peringatan, pilih aturan tersebut dan klik edit di kolom actions, modifikasi aturan, lalu klik OK.
-
Enable/Disable: Alihkan sakelar di kolom enabled status.
-
Delete: Klik delete
di kolom actions.PeringatanTindakan ini tidak dapat dibatalkan. Lakukan dengan hati-hati.