當您需要監控各雲產品資源的使用方式時,可以建立警示規則。如果資源的監控指標達到警示條件,CloudMonitor自動發送警示通知,協助您及時得知異常監控資料,並快速處理。
操作步驟
-
在左側導覽列,選擇。
-
在警示規則頁面,單擊建立警示規則。
-
在建立警示規則面板,設定警示規則相關參數。
樣本:為Elastic Compute Service全部執行個體的CPU使用率設定警示規則,當CPU使用率的最大閾值大於等於85%,且連續3個周期達到警示條件時,給報警聯繫人組內的所有警示連絡人發送警示通知(通知方式為:郵件+WebHook)。
-
產品選擇Elastic Compute Service,資源範圍選擇全部資源。
-
設定規則條件。
-
單擊添加規則,在下滑菜單中選擇合適的指標類型。
-
在添加規則描述面板,輸入規則名稱,指標類型選擇簡單指標,監控指標選擇,在緊急地區,觸發條件選擇連續3個周期(1周期=1分鐘),設定最大值大於等於85%。
-
單擊確定。
-
ECS CPU監控指標說明
設定監控指標時,監控指標下拉式清單中會同時出現(ECS)CPU使用率和(Agent)cpu.total兩個CPU相關指標,兩者的採集來源和適用情境不同,請根據實際需求選擇:
屬性
(ECS)CPU使用率
(Agent)cpu.total
指標名
CPUUtilizationcpu_total監控類型
基礎監控
作業系統監控(Agent)
採集來源
宿主機直接採集
CloudMonitor外掛程式採集
是否需要外掛程式
否
是
採集周期
60/300/3600秒
15/60/900秒
適用情境
快速配置通用CPU警示
精準CPU監控和異常排查
(ECS)CPU使用率由宿主機直接採集,無需安裝外掛程式,適合快速配置通用CPU警示。(Agent)cpu.total由CloudMonitor外掛程式採集,需在ECS執行個體上安裝CloudMonitor外掛程式,適合需要精準CPU使用率資料或排查CPU異常的情境。
表 1. 警示規則相關參數說明
參數
說明
產品
CloudMonitor可管理的雲產品名稱。例如:雲資料庫RDS版。
資源範圍
警示規則作用的資源範圍。取值:
-
全部資源:警示規則作用於指定雲產品的全部資源上,對於新加入的資源生效。
-
應用分組:警示規則作用於指定雲產品的指定應用分組內的全部資源上,對於新加入的資源生效。
-
執行個體:警示規則作用於指定雲產品的指定資源上。
同一執行個體可能同時被多個不同資源範圍的警示規則覆蓋。例如,一個執行個體既在全部資源範圍內,又在某個應用分組中。每個警示規則獨立評估和觸發,互不影響,不會因規則重疊產生優先順序覆蓋或衝突。
規則描述
警示規則的主體。當監控資料滿足警示條件時,觸發警示規則。規則描述的設定方法如下:
-
單擊添加規則,在下滑菜單中選擇合適的指標類型。
-
在添加規則描述面板,先輸入規則名稱,再設定規則條件。
-
簡單指標:先選擇監控指標,再為其設定閾值和警示層級。
警示層級採用升級(Escalations)模型。閾值達到某個層級時,系統僅觸發該層級警示,不會連帶觸發其他層級。例如:閾值直接達到緊急時,僅觸發緊急警示,不會同時觸發普通和警告警示。
-
組合指標:先選擇警示層級,再配置多指標警示描述為兩個或兩個以上的監控指標設定警示條件。
說明如果設定了多個指標警示規則,則目標資源必須在每個指標上均有資料,只有在滿足條件後才能夠正常觸發警示。例如:在多指標警示規則中,如果包含公網的監控指標,而ECS主機資源並未配置公網IP,則將無法正常觸發警示。
-
表達式:先選擇警示層級,再配置警示運算式。
-
智能閾值:關於智能閾值的更多資訊,請參見概覽和建立智能閾值警示規則。
-
警示層級決定了警示發生時的通知方式。僅緊急層級支援電話通知。警告和普通層級不支援電話通知。不同警示層級支援的通知方式如下:
警示層級
通知方式
緊急(緊急)
郵件+WebHook
警告(警告)
郵件+WebHook
普通(普通)
郵件+WebHook
說明關於如何設定複雜的運算式警示條件,請參見警示規則運算式說明。
通道沉默周期
警示發生後未恢複正常,間隔多久重複發送一次警示通知。取值:5分鐘、15分鐘、30分鐘、60分鐘、3小時、6小時、12小時和24小時。
某監控指標達到警示閾值時發送警示,如果監控指標在通道沉默周期內持續超過警示閾值,在通道沉默周期內不會重複發送警示通知;如果監控指標在通道沉默周期後仍未恢複正常,則CloudMonitor再次發送警示通知。
例如:當通道沉默周期選擇12小時,如果警示未恢複正常,則間隔12小時後,CloudMonitor會再次發送警示通知。
生效時間
警示規則的生效時間。警示規則僅在生效期內才會發送警示通知。
說明當警示規則不在生效期時,不會發送警示通知,但是警示記錄仍然會顯示在警示歷史列表中。
報警聯繫人組
發送警示的連絡人群組。
應用分組的警示通知會發送給該警示連絡人群組中的警示連絡人。警示連絡人群組是一組警示連絡人,可以包含一個或多個警示連絡人。
關於如何建立警示連絡人和警示連絡人群組,請參見建立警示連絡人或警示連絡人群組。
標籤
警示規則的標籤。包括標籤名稱和標籤值。
說明您最多可設定6組標籤。
警示回調
公網可訪問的URL,用於接收CloudMonitor通過POST請求推送的警示資訊。目前僅支援HTTP協議。關於如何設定警示回調,請參見使用閾值警示回調。
當您需要測試警示回調地址的連通性時,可以執行以下操作。
-
單擊回調地址正後方的測試。
在WebHook測試面板,您可以通過Webhook返回的狀態代碼和測試結果詳情對警示回調地址的連通性進行判斷和排查。
說明您還可以設定Webhook的回調模版類型:和語言:,再次單擊測試,擷取對應的測試結果詳情。
-
單擊關閉。
說明單擊進階設定,可設定該參數。
警示規則引發後僅支援發送通知(簡訊、郵件、Webhook、DingTalk機器人等)和聯動其他雲端服務(Auto Scaling、Function Compute、Log Service等),不支援自動執行隔絕或阻斷動作(如自動修改 OSS 許可權、自動下線 ECS 執行個體等)。如需實現自動化阻斷,可通過 Webhook 回調結合營運編排服務 OOS 或Function Compute自訂處理邏輯。
Auto Scaling
如果您開啟Auto Scaling開關,當警示發生時,會觸發相應的伸縮規則。您需要設定Auto Scaling的地區、Auto Scaling組和Auto Scaling規則。
說明單擊進階設定,可設定該參數。
Log Service
如果您開啟Log Service開關,當警示發生時,會將警示資訊發送至Log Service的日誌庫。您需要設定Log Service的地區、ProjectName/和Logstore。
關於如何建立Project和LogStore,請參見使用LoongCollector採集並分析ECS文本日誌。
說明單擊進階設定,可設定該參數。
輕量訊息佇列(原 MNS)— topic
如果您開啟輕量訊息佇列(原 MNS)— topic開關,當警示發生時,會將警示資訊發送至Message Service的主題。您需要設定Message Service的地區和主題。
關於如何建立主題,請參見建立主題。
說明單擊進階設定,可設定該參數。
函數計算
如果您開啟函數計算開關,當警示發生時,會將警示通知發送至Function Compute進行格式處理。您需要設定Function Compute的地區、服務和函數。
關於如何建立服務和函數,請參見快速建立函數。
說明單擊進階設定,可設定該參數。
無數據警示處理方法
無監控資料時警示的處理方式。取值:
-
不做任何處理(預設值)
-
發送無數據警示
-
視為正常
部分雲產品指標(例如雲訊息佇列 RocketMQ 版的限流相關指標)在指標值為 0 時不上報監控資料,此時CloudMonitor顯示為無資料而非正常。指標有資料但未達到警示閾值時,警示規則狀態為正常;指標值為 0 導致資料未上報時,警示規則狀態為無資料。您可以在執行個體監控警示頁面查看執行個體維度實際資料,確認指標是否確實未上報資料。
當警示規則引發無資料警示時,CloudMonitor按照規則中配置的最高警示層級發送通知。例如:規則配置了緊急、警告、普通三個層級,無資料警示按緊急層級通知;規則僅配置了普通層級,則按普通層級通知。
說明單擊進階設定,可設定該參數。
刪除警示資源後,關聯該資源的警示規則會被自動清除。例如:警示規則的資源範圍指定為某個 ECS 執行個體,該執行個體被刪除後,關聯該執行個體的警示規則會立即清除,不再產生新的警示記錄。
如需管理關聯了已到期資源的警示規則,請參見關聯了已到期資源的警示規則。
-
-
單擊確認。