全部產品
Search
文件中心

Cloud Monitor:警示規則

更新時間:Aug 19, 2026

在警示管理中,可以通過建立警示規則,制定特定應用的警示。當警示規則被觸發時,系統會產生相應的警示事件,通過指定的通知方式向警示連絡人、機器人、自訂Webhook和行動整合預案等方式,發送警示資訊,以提醒您採取必要的解決措施。

前提條件

  • 已開通相應的可觀測監控服務(如Prometheus、應用監控、Log Service等)。

  • 已建立通知對象

建立警示規則

  1. 登入CloudMonitor2.0控制台,選擇左側導覽列所有功能 - 警示中心

  2. 警示中心頁面,選擇警示管理 - 警示規則

  3. 警示規則列表頁面,單擊建立警示規則

  4. 建立警示規則面板中,設定警示規則相關參數。

    1. 規則名稱:警示規則的顯示名稱,用於標識該規則。建議使用有意義的名稱便於管理。

    2. 監控類型:根據需求選擇警示規則的監控類型。

      • 可觀測監控Prometheus版/雲撥測

        參數

        描述

        資料來源類型

        所屬目標監控類型的資料來源。

        地區

        資料來源的地區。

        Prometheus執行個體

        根據選擇目標執行個體設定警示規則。

        檢測條件定義方式

        自訂PromQL:根據您的需求可以自訂 PromQL查詢文法。請參見PromQL函數使用樣本

        基於預定義指標配置

        • 指標分組:選擇指標分組。

        • 指標:選擇指標。

        • 檢測條件:通過設定比較符和個數,設定檢測條件(其中p50、p75、p90、p99表示百分位元)。

        • PromQL 預覽:預覽預定義的指標PromQL語句。

        嚴重等級

        設定警示規則嚴重等級。

        • P1: 緊急:用於影響核心業務可用性,影響範圍很大的重大問題。

        • P2: 錯誤:用於部分業務出錯,會對系統可用性造成一定影響的問題。

        • P3: 警告:用於可能導致業務出錯或受影響的問題。

        • P4: 普通:用於需要通知但優先順序較低的情境。預設層級。

        期間

        設定警示的期間。表示資料持續多長時間滿足條件後才觸發警示,避免瞬時波動導致的誤判。

        警示檢測周期

        設定警示檢測周期的時間。警示規則的執行循環。預設值為 60 秒,即每分鐘檢查一次。

        內容

        使用Go template文法自訂警報資訊內容。例如:命名空間:{{$labels.namespace}} / Pod: {{$labels.pod_name}} / 容器:{{$labels.container}} CPU使用率{{$labels.metrics_params_opt_label_value}} {{$labels.metrics_params_value}}%, 當前值{{ printf "%.2f" $value }}%

        標籤

        使用者自訂的索引值對標籤,用於警示規則的分類和篩選。例如:env: productionteam: sre

        註解

        警示規則的擴充資訊,用於儲存長文本描述或 Runbook 連結。例如:description: CPU使用率過高runbook_url: https://wiki.xxx.com/runbook\

      • 應用監控

        參數

        描述

        資料來源類型

        目標監控類型的資料來源類型。

        地區

        資料來源的地區。

        應用

        選擇設定警示規則的應用執行個體。

        指標分組

        選擇應用指標的分組。

        介面名稱

        選擇介面匹配方式,如:遍曆等於不等於正則匹配正則不匹配無維度

        介面調用類型

        檢測條件方式

        單條件

        • 設定最近 N 分鐘,調用類型和計算的方式,選擇比較符。

        • 設定不同層級的數量,緊急錯誤警告普通

        多條件

        • 多警示觸發規則:選擇觸發警示規則的條件方式,可以任意滿足條件或者同時滿足條件

        • 檢測條件1:可以參考以上單條件參數設定。

        • 添加檢測條件:可以根據需求添加多組的檢測條件。

        • 嚴重等級:根據需求選擇等級,包括了P1: 緊急P2: 錯誤P3: 警告P4: 普通

        警示檢測周期

        設定警示檢測周期的時間。警示規則的執行循環。預設值為 60 秒,即每分鐘檢查一次。

        內容

        自訂警報資訊內容。

        標籤

        使用者自訂的索引值對標籤,用於警示規則的分類和篩選。例如:env: productionteam: sre

        註解

        警示規則的擴充資訊,用於儲存長文本描述或 Runbook 連結。例如:description: CPU使用率過高runbook_url: https://wiki.xxx.com/runbook\

      • 大模型可觀測

        參數

        描述

        資料來源類型

        UModel

        實體類型

        選擇設定警示規則的實體類型。

        指標集

        選擇指標集,包含AI 應用操作指標,GenAI模型指標,AI應用流量指標。

        檢測條件

        設定檢測觸發條件閾值。

        嚴重等級

        根據需求選擇等級,包括了P1: 緊急P2: 錯誤P3: 警告P4: 普通

        期間

        設定警示的期間。

        警示檢測周期

        設定警示檢測周期的時間。警示規則的執行循環。預設值為 60 秒,即每分鐘檢查一次。

        內容

        自訂警報資訊內容。

        標籤

        使用者自訂的索引值對標籤,用於警示規則的分類和篩選。例如:env: productionteam: sre

        註解

        警示規則的擴充資訊,用於儲存長文本描述或 Runbook 連結。例如:description: CPU使用率過高runbook_url: https://wiki.xxx.com/runbook\

      • 容器洞察/ECS 洞察/Hologres 洞察/AI訓練服務洞察/資料庫洞察

        參數

        描述

        資料來源類型

        所屬目標監控類型的資料來源。

        地區

        資料來源的地區。

        Prometheus執行個體

        根據選擇目標執行個體設定警示規則。

        檢測條件定義方式

        自訂PromQL:根據您的需求可以自訂 PromQL查詢文法。請參見PromQL函數使用樣本

        基於預定義指標配置

        • 指標分組:選擇指標分組。

        • 指標:選擇指標。

        • 檢測條件:通過設定比較符和個數,設定檢測條件。

        • PromQL 預覽:預覽預定義的指標PromQL語句。

        嚴重等級

        設定警示規則嚴重等級。

        • P1: 緊急

        • P2: 錯誤

        • P3: 警告

        • P4: 普通

        期間

        設定警示的期間。

        警示檢測周期

        設定警示檢測周期的時間。警示規則的執行循環。預設值為 60 秒,即每分鐘檢查一次。

        資料完成後再檢測

        選擇檢測方式。

        內容

        使用Go template文法自訂警報資訊內容。例如:命名空間:{{$labels.namespace}} / Pod: {{$labels.pod_name}} / 容器:{{$labels.container}} CPU使用率{{$labels.metrics_params_opt_label_value}} {{$labels.metrics_params_value}}%, 當前值{{ printf "%.2f" $value }}%

        標籤

        使用者自訂的索引值對標籤,用於警示規則的分類和篩選。例如:env: productionteam: sre

        註解

        警示規則的擴充資訊,用於儲存長文本描述或 Runbook 連結。例如:description: CPU使用率過高runbook_url: https://wiki.xxx.com/runbook\

      • 日誌審計

        參數

        描述

        選擇模板

        Action Trail:根據需求選擇Action Trail模板。

        主機審計:根據需求選擇主機審計模板。

        容器審計:根據需求選擇容器審計模板。

        查詢統計

        單查詢:通過設定日誌相關資訊單項查詢。

        集合操作:設定集合操作的方式,可以添加多組資源。

        檢測判定

        根據需求可以添加多組條件,設定匹配資料的方式和嚴重等級。

        嚴重等級

        根據需求選擇警示層級,包括緊急錯誤警告普通

        連續次數

        設定連續滿足條件多少次,觸發警示。

        警示檢測周期

        自訂設定警示檢測的周期是多少時間。警示規則的執行循環,預設值為 60 秒,即每分鐘檢查一次。

        標籤

        使用者自訂的索引值對標籤,用於警示規則的分類和篩選。例如:env: productionteam: sre

        註解

        警示規則的擴充資訊,用於儲存長文本描述或 Runbook 連結。例如:description: CPU使用率過高runbook_url: https://wiki.xxx.com/runbook\

      • Log Service:請參考本文檔監控類型(日誌審計)配置參數說明。

    3. 設定警示通知

      • 通知對象:根據您的需求,可以選擇一個或者多個通知對象方式,觸發警示後接收警示資訊。

        • 連絡人:直接指定接收警示的人員。

        • 聯絡組:指定一組連絡人接收警示。

        • DingTalk:通過DingTalk群機器人發送警示。

        • 企業微信:通過企業微信機器人發送警示。

        • 飛書:通過飛書機器人發送警示。

        • Slack:通過 Slack 發送警示。

        • 自訂Webhook:通過自訂 HTTP 回調發送警示。

      • 整合到 ARMS 警示管理:根據需求選擇是或者否。

        說明

        警示事件預設會發送到 ARMS 警示營運中心,如需設定警示通知,請前往 ARMS 警示營運中心進行配置。

      • 行動整合:選擇特定的雲產品或者第三方服務,處理警示後續的事務,如:Log Service、輕量訊息佇列、Function Compute和第三方服務pagerDuty、Webhook。

      • 通道沉默周期:警示發生後未恢複正常,間隔多久重複發送一次警示通知。取值:1、5、10、15、30、50分鐘,1、3、6、12、24小時。

        說明

        例如:當通道沉默周期選擇12小時時,如果警示未恢複正常,則間隔12小時後,CloudMonitor會再次發送警示通知。

      • 生效時間:警示規則的生效時間。警示規則僅在生效期內才會發送警示通知。

        說明
        • 當警示規則不在生效期時,不會發送警示通知,但是警示記錄仍然會顯示在警示歷史列表中。

        • 通知時間支援24小時內,可跨天,例如23:00 至 第二天01:00

管理警示規則

  1. 警示規則列表頁面,可以查看所有已建立的警示規則,主要資訊如下:

    欄位

    說明

    警示狀態

    規則當前的狀態。取值:

    - 無警示(Ok):監控資料正常,未觸發警示條件。

    - 警示中(Alarm):監控資料已觸發警示條件,警示進行中中。

    - 無資料(NoData):沒有擷取到監控資料。

    規則名稱/ID

    警示規則的顯示名稱和唯一識別碼(UUID)。

    啟停狀態

    規則是否啟用。啟用的規則會按配置的周期執行檢查,禁用的規則不執行。

    業務來源

    規則所屬的產品類型。

  2. 可以通過如下警示參數,搜尋目標警示規則。

    • 監控類型

    • 規則名稱ID

    • 警示狀態

    • 啟停狀態

    • 更多篩選:可以使用添加標籤添加通知對象方式搜尋。

  • 資源範圍選取為全部資源的系統預設警示規則,建立後無法直接修改關聯資源範圍以排除特定執行個體。如需排除特定資源,可複製該規則並在新規則中指定需監控的資源:

    1. 警示規則列表頁面,找到目標系統預設規則,單擊操作列中的更多 > 複製

    2. 建立警示規則對話方塊中,通過資料來源選取器選擇Prometheus執行個體彙總檢視頁簽,選擇需監控的指定資源。

    3. 單擊確定,儲存新規則。

    4. 在原系統預設規則的操作列中,單擊更多 > 刪除,刪除原規則;或通過規則行的啟停狀態開關禁用原規則。

    說明

    未刪除或未禁用原規則時,同一資源觸發閾值會產生兩條警示。

  • 編輯從CloudMonitor 1.0 遷移的警示規則時,警示通知僅支援舊式聯絡組 (ContactGroups),無法選擇 2.0 建立的通知對象。1.0 使用警示聯絡組,2.0 使用通知對象和通知策略,兩套系統不互連。建議在 2.0 控制台重新建立警示規則,新規則支援選擇通知對象

  • 編輯:選擇目標警示規則,單擊右側操作列中的編輯,在對話方塊中修改資訊,單擊確定

  • 啟用/禁用:選擇目標警示規則,在啟停狀態列通過按鈕控制。

  • 刪除:選擇目標警示規則,單擊右側操作列中的表徵圖image刪除

    警告

    刪除後無法恢複,請謹慎操作。