通過CloudMonitor即時監測雲訊息佇列 Kafka 版的執行個體、Topic、Group 資源狀態。當監控項資料超過設定閾值時,CloudMonitor通過電話、簡訊、郵件、DingTalk機器人等方式發送警示通知,協助及時應對異常情況。
監控項
監控項的資料彙總周期為 1 分鐘,即每分鐘計算一次,資料為該周期內的平均值。
監控項的資料延時約 1 分鐘。
雲訊息佇列 Kafka 版在CloudMonitor的 Namespace 為 acs_kafka,ProductCategory 為 kafka,共包含 39 個監控項(適用於 V2 預留執行個體版本),按資源類型分為執行個體級、ConsumerGroup 級和 Topic 級。
執行個體級監控項
監控項名稱 | Metric ID | Dimensions | 單位 |
執行個體生產請求 TP50 大小 |
| instanceId | Byte |
執行個體生產請求 TP999 大小 |
| instanceId | Byte |
執行個體 CPU 使用率 |
| instanceId | % |
執行個體消費限流隊列大小 |
| instanceId | count |
執行個體高可用切換事件 |
| instanceId | count |
執行個體公網讀取頻寬(節點維度) |
| instanceId, node_name | bit/s |
執行個體公網讀取頻寬使用率(節點維度) |
| instanceId, node_name | % |
執行個體公網寫入頻寬(節點維度) |
| instanceId, node_name | bit/s |
執行個體公網寫入頻寬使用率(節點維度) |
| instanceId, node_name | % |
執行個體最大串連數 |
| instanceId | count |
執行個體最大公網串連數 |
| instanceId | count |
執行個體最大讀 IOPS(Input/Output Operations Per Second) |
| instanceId | count/s |
執行個體最大寫 IOPS |
| instanceId | count/s |
生產流量在執行個體規格佔比 |
| instanceId | % |
消費流量在執行個體規格佔比 |
| instanceId | % |
執行個體生產限流隊列大小 |
| instanceId | count |
執行個體 Rebalance 耗時 |
| instanceId | ms |
執行個體當前串連總數 |
| instanceId | count |
執行個體當前公網串連總數 |
| instanceId | count |
分區在執行個體規格佔比 |
| instanceId | % |
執行個體磁碟使用率(顯示執行個體各節點中磁碟使用率的最大值) |
| instanceId | % |
執行個體公網讀取頻寬 |
| instanceId | bit/s |
執行個體公網寫入頻寬 |
| instanceId | bit/s |
執行個體業務實際流入流量 |
| instanceId | B/s |
執行個體訊息生產條數 |
| instanceId | count/s |
執行個體業務實際流出流量 |
| instanceId | B/s |
執行個體訊息發送次數 |
| instanceId | count/s |
執行個體訊息消費次數 |
| instanceId | count/s |
ConsumerGroup 級監控項
監控項名稱 | Metric ID | Dimensions | 單位 |
Group 消費條數 |
| instanceId, consumerGroup | count/min |
Group 在某 Topic 消費條數 |
| instanceId, consumerGroup, topic | count/min |
Group 最近一條消費耗時 |
| instanceId, consumerGroup, topic | ms |
Group 訊息堆積總量 |
| instanceId, consumerGroup | count |
Group 在某 Topic 訊息堆積量 |
| instanceId, consumerGroup, topic | count |
Topic 級監控項
監控項名稱 | Metric ID | Dimensions | 單位 |
Topic 訊息流程入流量 |
| instanceId, topic | B/s |
Topic 訊息生產條數 |
| instanceId, topic | count/s |
Topic 訊息流程出流量 |
| instanceId, topic | B/s |
Topic 消費與生產流量比 |
| instanceId, topic | % |
Topic 訊息發送次數 |
| instanceId, topic | count/s |
Topic 訊息消費次數 |
| instanceId, topic | count/s |
消費類監控指標依賴用戶端提交消費位點:Group 訊息堆積總量(
message_accumulation)等消費相關監控指標,依賴用戶端主動提交消費位點(Offset)。若用戶端未正確提交位點(例如未啟用自動認可或手動提交失敗),監控資料將無法準確反映實際消費進度,可能出現堆積量虛高、觸發警示誤判等情況。請確保消費用戶端已正確配置消費位點提交機制。判斷是否發生限流應查看限流隊列大小指標:如需判斷是否觸發了服務端限流,請關注執行個體消費限流隊列大小(
InstanceFetchThrottleQueueSizeV2)和執行個體生產限流隊列大小(InstanceProduceThrottleQueueSizeV2)指標。僅當該類指標值大於 0 時,才表示實際發生了限流並可能影響業務;少量流量超限通常有彈性緩衝,不會立即影響業務。流量使用率類指標反映節點級使用方式,注意秒級與分鐘級的差異:生產流量在執行個體規格佔比(
InstanceMessageInputRatioV2)等流量使用率類指標,反映的是節點層級的流量使用方式。由於 Kafka 預設採用 3 副本且發送能力在各節點間均分,當流量出現傾斜(例如定時聚批發送導致發送峰值集中),即使執行個體整體平均速率未達規格上限,單節點秒級流量也可能瞬間超標,導致相關指標顯示偏高。此外,監控圖表展示的是分鐘級平滑資料,而實際限流觸發基於秒級採集,二者存在差異,請結合限流隊列大小指標綜合判斷。
計費說明
使用CloudMonitor功能雲訊息佇列 Kafka 版不收取費用。
前提條件
建立服務關聯角色
角色名稱:AliyunServiceRoleForAlikafka
角色策略名稱稱:AliyunServiceRolePolicyForAlikafka
許可權說明:允許雲訊息佇列 Kafka 版使用該角色訪問相關服務(CloudMonitor和 ARMS 服務)以完成CloudMonitor相關功能。
具體文檔說明:服務關聯角色。
查看CloudMonitor資料
在概览頁面的资源分布地區,選擇地區。
在实例列表頁面,單擊目標執行個體名稱。
在左側導覽列,選擇。
在云监控頁面,單擊报警规则頁簽,單擊要查看監控資料的資源頁簽,找到要查看監控資料的資源,單擊其右側操作列的云监控,設定時間範圍,查看監控資料。
頁面會自動顯示當前資源所有的監控項圖表。
設定警示規則
在CloudMonitor頁面,單擊警示規則,選擇執行個體、Topic 或 Group 資源頁簽,設定警示規則。
頁面將跳轉至CloudMonitor控制台的创建报警规则面板。
在创建报警规则面板按提示設定規則和通知資訊,然後單擊确定。具體參數設定,請參見建立警示規則。
規則建立成功後,在报警规则頁簽中可查看新建立的規則,確認狀態為已啟用。
樣本:為 Group 訊息積壓配置DingTalk機器人警示
如需在 Group 消費堆積量超出閾值時,將警示通知發送到DingTalk機器人,請按以下步驟操作。
前提條件:已在CloudMonitor控制台將DingTalk機器人添加為警示連絡人或連絡人群組。如尚未配置,請先登入CloudMonitor控制台,完成DingTalk機器人連絡人的添加。
登入雲訊息佇列 Kafka 版控制台,在左側導覽列選擇。
在云监控頁面,單擊报警规则頁簽,再單擊 Group 子頁簽。
找到需要配置警示的目標 Group,單擊其操作列的创建报警规则。
頁面將在新視窗開啟CloudMonitor控制台的警示規則建立頁面。
在CloudMonitor控制台的警示規則建立頁面,配置以下關鍵參數:
監控指標:選擇 MessageAccumulationV3(Group 訊息堆積量,單位:count)。
警示條件:設定訊息堆積量的統計周期和警示閾值(例如:統計周期 1 分鐘,堆積量連續 N 次超過閾值時觸發警示)。
通知方式:在通知連絡人或連絡人群組中,勾選已配置的DingTalk機器人連絡人。
單擊確認,完成警示規則建立。
返回雲訊息佇列 Kafka 版控制台,在报警规则頁簽中查看新建立的規則,確認状态列顯示為已启用。
查看警示資訊
在CloudMonitor頁面,單擊警示規則,然後單擊要查看警示資訊的資源(執行個體、Topic 或 Group)頁簽。
找到具體的資源名稱,單擊操作列的报警规则。
在關聯的警示規則面板,選擇目標警示規則,單擊其操作列的详情,支援查看、啟用/禁用、刪除警示規則,以及查看警示歷史。
常見問題
Q:CloudMonitor是否支援 CPU、記憶體及日均寫入量統計?
A:
CPU 和記憶體監控:雲訊息佇列 Kafka 版的云监控不直接提供 CPU 和記憶體監控指標。如需監控底層系統資源使用方式,請參考 Prometheus 監控方案,詳情請參見本文末尾"相關文檔"中的 Prometheus 監控文檔。
日均寫入量統計:云监控不提供直接的日均寫入量統計視圖,可通過以下方式估算:
控制台查看(近似估算):在執行個體詳情的 Topic 管理頁面,查看目標 Topic 的監控資訊中的寫入流量(B/s);或在云监控頁面查看執行個體業務實際流入流量(
instance_message_input,單位 B/s)和執行個體訊息生產條數(instance_message_num_input,單位 count/s),根據時間範圍內的平均值乘以時間長度估算日寫入量。Prometheus 監控(精細查詢):通過 Prometheus 監控查詢
instance_message_input(bytes/s)和instance_message_num_input(個/秒)等執行個體級指標,利用 Prometheus 的時序彙總函式統計指定時間段內的累計寫入量。詳情請參見本文末尾"相關文檔"中的 Prometheus 監控文檔。API 查詢(精確估算):使用 QueryMessage API 按時間戳記查詢消費位點,通過起始時間和終止時間的位點差值精確估算該時間段內的寫入訊息量。
相關文檔
執行個體的 Prometheus 監控資料,請參見Prometheus監控。
關於監控警示的更多常見問題,請參見監控警示問題。