在警示管理中,可以通過建立警示規則,制定特定應用的警示。當警示規則被觸發時,系統會產生相應的警示事件,通過指定的通知方式向警示連絡人、機器人、自訂Webhook和行動整合預案等方式,發送警示資訊,以提醒您採取必要的解決措施。
前提條件
已開通相應的可觀測監控服務(如Prometheus、應用監控、Log Service等)。
已建立通知對象。
建立警示規則
登入CloudMonitor2.0控制台,選擇左側導覽列所有功能 - 警示中心。
在警示中心頁面,選擇警示管理 - 警示規則。
在警示規則列表頁面,單擊建立警示規則。
在建立警示規則面板中,設定警示規則相關參數。
規則名稱:警示規則的顯示名稱,用於標識該規則。建議使用有意義的名稱便於管理。
監控類型:根據需求選擇警示規則的監控類型。
可觀測監控Prometheus版/雲撥測
參數
描述
資料來源類型
所屬目標監控類型的資料來源。
地區
資料來源的地區。
Prometheus執行個體
根據選擇目標執行個體設定警示規則。
檢測條件定義方式
自訂PromQL:根據您的需求可以自訂 PromQL查詢文法。請參見PromQL函數使用樣本。
基於預定義指標配置:
指標分組:選擇指標分組。
指標:選擇指標。
檢測條件:通過設定比較符和個數,設定檢測條件(其中p50、p75、p90、p99表示百分位元)。
PromQL 預覽:預覽預定義的指標PromQL語句。
嚴重等級
設定警示規則嚴重等級。
P1: 緊急:用於影響核心業務可用性,影響範圍很大的重大問題。
P2: 錯誤:用於部分業務出錯,會對系統可用性造成一定影響的問題。
P3: 警告:用於可能導致業務出錯或受影響的問題。
P4: 普通:用於需要通知但優先順序較低的情境。預設層級。
期間
設定警示的期間。表示資料持續多長時間滿足條件後才觸發警示,避免瞬時波動導致的誤判。
警示檢測周期
設定警示檢測周期的時間。警示規則的執行循環。預設值為 60 秒,即每分鐘檢查一次。
內容
使用Go template文法自訂警報資訊內容。例如:命名空間:{{$labels.namespace}} / Pod: {{$labels.pod_name}} / 容器:{{$labels.container}} CPU使用率{{$labels.metrics_params_opt_label_value}} {{$labels.metrics_params_value}}%, 當前值{{ printf "%.2f" $value }}%
標籤
使用者自訂的索引值對標籤,用於警示規則的分類和篩選。例如:
env: production、team: sre。註解
警示規則的擴充資訊,用於儲存長文本描述或 Runbook 連結。例如:
description: CPU使用率過高、runbook_url: https://wiki.xxx.com/runbook\。應用監控
參數
描述
資料來源類型
目標監控類型的資料來源類型。
地區
資料來源的地區。
應用
選擇設定警示規則的應用執行個體。
指標分組
選擇應用指標的分組。
介面名稱
選擇介面匹配方式,如:遍曆、等於、不等於、正則匹配、正則不匹配、無維度。
介面調用類型
檢測條件方式
單條件:
設定最近
N分鐘,調用類型和計算的方式,選擇比較符。設定不同層級的數量,緊急、錯誤、警告、普通。
多條件:
多警示觸發規則:選擇觸發警示規則的條件方式,可以任意滿足條件或者同時滿足條件。
檢測條件1:可以參考以上單條件參數設定。
添加檢測條件:可以根據需求添加多組的檢測條件。
嚴重等級:根據需求選擇等級,包括了P1: 緊急、P2: 錯誤、P3: 警告、P4: 普通。
警示檢測周期
設定警示檢測周期的時間。警示規則的執行循環。預設值為 60 秒,即每分鐘檢查一次。
內容
自訂警報資訊內容。
標籤
使用者自訂的索引值對標籤,用於警示規則的分類和篩選。例如:
env: production、team: sre。註解
警示規則的擴充資訊,用於儲存長文本描述或 Runbook 連結。例如:
description: CPU使用率過高、runbook_url: https://wiki.xxx.com/runbook\。大模型可觀測
參數
描述
資料來源類型
UModel
實體類型
選擇設定警示規則的實體類型。
指標集
選擇指標集,包含AI 應用操作指標,GenAI模型指標,AI應用流量指標。
檢測條件
設定檢測觸發條件閾值。
嚴重等級
根據需求選擇等級,包括了P1: 緊急、P2: 錯誤、P3: 警告、P4: 普通。
期間
設定警示的期間。
警示檢測周期
設定警示檢測周期的時間。警示規則的執行循環。預設值為 60 秒,即每分鐘檢查一次。
內容
自訂警報資訊內容。
標籤
使用者自訂的索引值對標籤,用於警示規則的分類和篩選。例如:
env: production、team: sre。註解
警示規則的擴充資訊,用於儲存長文本描述或 Runbook 連結。例如:
description: CPU使用率過高、runbook_url: https://wiki.xxx.com/runbook\。容器洞察/ECS 洞察/Hologres 洞察/AI訓練服務洞察/資料庫洞察
參數
描述
資料來源類型
所屬目標監控類型的資料來源。
地區
資料來源的地區。
Prometheus執行個體
根據選擇目標執行個體設定警示規則。
檢測條件定義方式
自訂PromQL:根據您的需求可以自訂 PromQL查詢文法。請參見PromQL函數使用樣本。
基於預定義指標配置:
指標分組:選擇指標分組。
指標:選擇指標。
檢測條件:通過設定比較符和個數,設定檢測條件。
PromQL 預覽:預覽預定義的指標PromQL語句。
嚴重等級
設定警示規則嚴重等級。
P1: 緊急
P2: 錯誤
P3: 警告
P4: 普通
期間
設定警示的期間。
警示檢測周期
設定警示檢測周期的時間。警示規則的執行循環。預設值為 60 秒,即每分鐘檢查一次。
資料完成後再檢測
選擇檢測方式。
內容
使用Go template文法自訂警報資訊內容。例如:命名空間:{{$labels.namespace}} / Pod: {{$labels.pod_name}} / 容器:{{$labels.container}} CPU使用率{{$labels.metrics_params_opt_label_value}} {{$labels.metrics_params_value}}%, 當前值{{ printf "%.2f" $value }}%
標籤
使用者自訂的索引值對標籤,用於警示規則的分類和篩選。例如:
env: production、team: sre。註解
警示規則的擴充資訊,用於儲存長文本描述或 Runbook 連結。例如:
description: CPU使用率過高、runbook_url: https://wiki.xxx.com/runbook\。日誌審計
參數
描述
選擇模板
Action Trail:根據需求選擇Action Trail模板。
主機審計:根據需求選擇主機審計模板。
容器審計:根據需求選擇容器審計模板。
查詢統計
單查詢:通過設定日誌相關資訊單項查詢。
集合操作:設定集合操作的方式,可以添加多組資源。
檢測判定
根據需求可以添加多組條件,設定匹配資料的方式和嚴重等級。
嚴重等級
根據需求選擇警示層級,包括緊急、錯誤、警告、普通。
連續次數
設定連續滿足條件多少次,觸發警示。
警示檢測周期
自訂設定警示檢測的周期是多少時間。警示規則的執行循環,預設值為 60 秒,即每分鐘檢查一次。
標籤
使用者自訂的索引值對標籤,用於警示規則的分類和篩選。例如:
env: production、team: sre。註解
警示規則的擴充資訊,用於儲存長文本描述或 Runbook 連結。例如:
description: CPU使用率過高、runbook_url: https://wiki.xxx.com/runbook\。Log Service:請參考本文檔監控類型(日誌審計)配置參數說明。
設定警示通知。
通知對象:根據您的需求,可以選擇一個或者多個通知對象方式,觸發警示後接收警示資訊。
連絡人:直接指定接收警示的人員。
聯絡組:指定一組連絡人接收警示。
DingTalk:通過DingTalk群機器人發送警示。
企業微信:通過企業微信機器人發送警示。
飛書:通過飛書機器人發送警示。
Slack:通過 Slack 發送警示。
自訂Webhook:通過自訂 HTTP 回調發送警示。
整合到 ARMS 警示管理:根據需求選擇是或者否。
說明警示事件預設會發送到 ARMS 警示營運中心,如需設定警示通知,請前往 ARMS 警示營運中心進行配置。
行動整合:選擇特定的雲產品或者第三方服務,處理警示後續的事務,如:Log Service、輕量訊息佇列、Function Compute和第三方服務pagerDuty、Webhook。
通道沉默周期:警示發生後未恢複正常,間隔多久重複發送一次警示通知。取值:1、5、10、15、30、50分鐘,1、3、6、12、24小時。
說明例如:當通道沉默周期選擇12小時時,如果警示未恢複正常,則間隔12小時後,CloudMonitor會再次發送警示通知。
生效時間:警示規則的生效時間。警示規則僅在生效期內才會發送警示通知。
說明當警示規則不在生效期時,不會發送警示通知,但是警示記錄仍然會顯示在警示歷史列表中。
通知時間支援24小時內,可跨天,例如23:00 至 第二天01:00
管理警示規則
在警示規則列表頁面,可以查看所有已建立的警示規則,主要資訊如下:
欄位
說明
警示狀態
規則當前的狀態。取值:
- 無警示(Ok):監控資料正常,未觸發警示條件。
- 警示中(Alarm):監控資料已觸發警示條件,警示進行中中。
- 無資料(NoData):沒有擷取到監控資料。
規則名稱/ID
警示規則的顯示名稱和唯一識別碼(UUID)。
啟停狀態
規則是否啟用。啟用的規則會按配置的周期執行檢查,禁用的規則不執行。
業務來源
規則所屬的產品類型。
可以通過如下警示參數,搜尋目標警示規則。
監控類型
規則名稱ID
警示狀態
啟停狀態
更多篩選:可以使用添加標籤和添加通知對象方式搜尋。
資源範圍選取為全部資源的系統預設警示規則,建立後無法直接修改關聯資源範圍以排除特定執行個體。如需排除特定資源,可複製該規則並在新規則中指定需監控的資源:
在警示規則列表頁面,找到目標系統預設規則,單擊操作列中的更多 > 複製。
在建立警示規則對話方塊中,通過資料來源選取器選擇Prometheus執行個體或彙總檢視頁簽,選擇需監控的指定資源。
單擊確定,儲存新規則。
在原系統預設規則的操作列中,單擊更多 > 刪除,刪除原規則;或通過規則行的啟停狀態開關禁用原規則。
說明未刪除或未禁用原規則時,同一資源觸發閾值會產生兩條警示。
編輯從CloudMonitor 1.0 遷移的警示規則時,警示通知僅支援舊式聯絡組 (
ContactGroups),無法選擇 2.0 建立的通知對象。1.0 使用警示聯絡組,2.0 使用通知對象和通知策略,兩套系統不互連。建議在 2.0 控制台重新建立警示規則,新規則支援選擇通知對象。編輯:選擇目標警示規則,單擊右側操作列中的編輯,在對話方塊中修改資訊,單擊確定。
啟用/禁用:選擇目標警示規則,在啟停狀態列通過按鈕控制。
刪除:選擇目標警示規則,單擊右側操作列中的表徵圖
刪除。警告刪除後無法恢複,請謹慎操作。