全部產品
Search
文件中心

ApsaraMQ for Kafka:CloudMonitor

更新時間:Jul 22, 2026

通過CloudMonitor即時監測雲訊息佇列 Kafka 版的執行個體、Topic、Group 資源狀態。當監控項資料超過設定閾值時,CloudMonitor通過電話、簡訊、郵件、DingTalk機器人等方式發送警示通知,協助及時應對異常情況。

監控項

說明
  • 監控項的資料彙總周期為 1 分鐘,即每分鐘計算一次,資料為該周期內的平均值。

  • 監控項的資料延時約 1 分鐘。

雲訊息佇列 Kafka 版在CloudMonitor的 Namespace 為 acs_kafka,ProductCategory 為 kafka,共包含 39 個監控項(適用於 V2 預留執行個體版本),按資源類型分為執行個體級、ConsumerGroup 級和 Topic 級。

執行個體級監控項

監控項名稱

Metric ID

Dimensions

單位

執行個體生產請求 TP50 大小

InstanceBatchSizeTP50V2

instanceId

Byte

執行個體生產請求 TP999 大小

InstanceBatchSizeTP999V2

instanceId

Byte

執行個體 CPU 使用率

InstanceCpuUsageV2

instanceId

%

執行個體消費限流隊列大小

InstanceFetchThrottleQueueSizeV2

instanceId

count

執行個體高可用切換事件

InstanceHAEventV2

instanceId

count

執行個體公網讀取頻寬(節點維度)

InstanceInternetRxRateByNode

instanceId, node_name

bit/s

執行個體公網讀取頻寬使用率(節點維度)

InstanceInternetRxUtilizationByNode

instanceId, node_name

%

執行個體公網寫入頻寬(節點維度)

InstanceInternetTxRateByNode

instanceId, node_name

bit/s

執行個體公網寫入頻寬使用率(節點維度)

InstanceInternetTxUtilizationByNode

instanceId, node_name

%

執行個體最大串連數

InstanceMaxConnection

instanceId

count

執行個體最大公網串連數

InstanceMaxInternetConnection

instanceId

count

執行個體最大讀 IOPS(Input/Output Operations Per Second)

InstanceMaxReadIOPSV2

instanceId

count/s

執行個體最大寫 IOPS

InstanceMaxWriteIOPSV2

instanceId

count/s

生產流量在執行個體規格佔比

InstanceMessageInputRatioV2

instanceId

%

消費流量在執行個體規格佔比

InstanceMessageOutputRatioV2

instanceId

%

執行個體生產限流隊列大小

InstanceProduceThrottleQueueSizeV2

instanceId

count

執行個體 Rebalance 耗時

InstanceRebalanceTimeV2

instanceId

ms

執行個體當前串連總數

InstanceTotalConnection

instanceId

count

執行個體當前公網串連總數

InstanceTotalInternetConnection

instanceId

count

分區在執行個體規格佔比

PartitionInstanceRatioV2

instanceId

%

執行個體磁碟使用率(顯示執行個體各節點中磁碟使用率的最大值)

instance_disk_capacity

instanceId

%

執行個體公網讀取頻寬

instance_internet_rx.rate

instanceId

bit/s

執行個體公網寫入頻寬

instance_internet_tx.rate

instanceId

bit/s

執行個體業務實際流入流量

instance_message_input

instanceId

B/s

執行個體訊息生產條數

instance_message_num_input

instanceId

count/s

執行個體業務實際流出流量

instance_message_output

instanceId

B/s

執行個體訊息發送次數

instance_reqs_input

instanceId

count/s

執行個體訊息消費次數

instance_reqs_output

instanceId

count/s

ConsumerGroup 級監控項

監控項名稱

Metric ID

Dimensions

單位

Group 消費條數

group_message_num_output

instanceId, consumerGroup

count/min

Group 在某 Topic 消費條數

group_message_num_output_onetopic

instanceId, consumerGroup, topic

count/min

Group 最近一條消費耗時

group_topic_accumulation_consume_cost_time

instanceId, consumerGroup, topic

ms

Group 訊息堆積總量

message_accumulation

instanceId, consumerGroup

count

Group 在某 Topic 訊息堆積量

message_accumulation_onetopic

instanceId, consumerGroup, topic

count

Topic 級監控項

監控項名稱

Metric ID

Dimensions

單位

Topic 訊息流程入流量

topic_message_input

instanceId, topic

B/s

Topic 訊息生產條數

topic_message_num_input

instanceId, topic

count/s

Topic 訊息流程出流量

topic_message_output

instanceId, topic

B/s

Topic 消費與生產流量比

topic_message_output_input_ratio

instanceId, topic

%

Topic 訊息發送次數

topic_reqs_input

instanceId, topic

count/s

Topic 訊息消費次數

topic_reqs_output

instanceId, topic

count/s

說明
  • 消費類監控指標依賴用戶端提交消費位點:Group 訊息堆積總量(message_accumulation)等消費相關監控指標,依賴用戶端主動提交消費位點(Offset)。若用戶端未正確提交位點(例如未啟用自動認可或手動提交失敗),監控資料將無法準確反映實際消費進度,可能出現堆積量虛高、觸發警示誤判等情況。請確保消費用戶端已正確配置消費位點提交機制。

  • 判斷是否發生限流應查看限流隊列大小指標:如需判斷是否觸發了服務端限流,請關注執行個體消費限流隊列大小(InstanceFetchThrottleQueueSizeV2)和執行個體生產限流隊列大小(InstanceProduceThrottleQueueSizeV2)指標。僅當該類指標值大於 0 時,才表示實際發生了限流並可能影響業務;少量流量超限通常有彈性緩衝,不會立即影響業務。

  • 流量使用率類指標反映節點級使用方式,注意秒級與分鐘級的差異:生產流量在執行個體規格佔比(InstanceMessageInputRatioV2)等流量使用率類指標,反映的是節點層級的流量使用方式。由於 Kafka 預設採用 3 副本且發送能力在各節點間均分,當流量出現傾斜(例如定時聚批發送導致發送峰值集中),即使執行個體整體平均速率未達規格上限,單節點秒級流量也可能瞬間超標,導致相關指標顯示偏高。此外,監控圖表展示的是分鐘級平滑資料,而實際限流觸發基於秒級採集,二者存在差異,請結合限流隊列大小指標綜合判斷。

計費說明

使用CloudMonitor功能雲訊息佇列 Kafka 版不收取費用。

前提條件

建立服務關聯角色

  • 角色名稱:AliyunServiceRoleForAlikafka

  • 角色策略名稱稱:AliyunServiceRolePolicyForAlikafka

  • 許可權說明:允許雲訊息佇列 Kafka 版使用該角色訪問相關服務(CloudMonitor和 ARMS 服務)以完成CloudMonitor相關功能。

  • 具體文檔說明:服務關聯角色。

查看CloudMonitor資料

  1. 登入雲訊息佇列 Kafka 版控制台。

  2. 在概览頁面的资源分布地區,選擇地區。

  3. 在实例列表頁面,單擊目標執行個體名稱。

  4. 在左側導覽列,選擇可觀測 > CloudMonitor。

  5. 在云监控頁面,單擊报警规则頁簽,單擊要查看監控資料的資源頁簽,找到要查看監控資料的資源,單擊其右側操作列的云监控,設定時間範圍,查看監控資料。

    頁面會自動顯示當前資源所有的監控項圖表。

設定警示規則

  1. 在CloudMonitor頁面,單擊警示規則,選擇執行個體、Topic 或 Group 資源頁簽,設定警示規則。

    頁面將跳轉至CloudMonitor控制台的创建报警规则面板。

  2. 在创建报警规则面板按提示設定規則和通知資訊,然後單擊确定。具體參數設定,請參見建立警示規則。

  3. 規則建立成功後,在报警规则頁簽中可查看新建立的規則,確認狀態為已啟用。

樣本:為 Group 訊息積壓配置DingTalk機器人警示

如需在 Group 消費堆積量超出閾值時,將警示通知發送到DingTalk機器人,請按以下步驟操作。

說明

前提條件:已在CloudMonitor控制台將DingTalk機器人添加為警示連絡人或連絡人群組。如尚未配置,請先登入CloudMonitor控制台,完成DingTalk機器人連絡人的添加。

  1. 登入雲訊息佇列 Kafka 版控制台,在左側導覽列選擇可觀測 > 云监控。

  2. 在云监控頁面,單擊报警规则頁簽,再單擊 Group 子頁簽。

  3. 找到需要配置警示的目標 Group,單擊其操作列的创建报警规则。

    頁面將在新視窗開啟CloudMonitor控制台的警示規則建立頁面。

  4. 在CloudMonitor控制台的警示規則建立頁面,配置以下關鍵參數:

    • 監控指標:選擇 MessageAccumulationV3(Group 訊息堆積量,單位:count)。

    • 警示條件:設定訊息堆積量的統計周期和警示閾值(例如:統計周期 1 分鐘,堆積量連續 N 次超過閾值時觸發警示)。

    • 通知方式:在通知連絡人或連絡人群組中,勾選已配置的DingTalk機器人連絡人。

  5. 單擊確認,完成警示規則建立。

  6. 返回雲訊息佇列 Kafka 版控制台,在报警规则頁簽中查看新建立的規則,確認状态列顯示為已启用。

查看警示資訊

  1. 在CloudMonitor頁面,單擊警示規則,然後單擊要查看警示資訊的資源(執行個體、Topic 或 Group)頁簽。

  2. 找到具體的資源名稱,單擊操作列的报警规则。

  3. 在關聯的警示規則面板,選擇目標警示規則,單擊其操作列的详情,支援查看、啟用/禁用、刪除警示規則,以及查看警示歷史。

常見問題

Q:CloudMonitor是否支援 CPU、記憶體及日均寫入量統計?

A:

  • CPU 和記憶體監控:雲訊息佇列 Kafka 版的云监控不直接提供 CPU 和記憶體監控指標。如需監控底層系統資源使用方式,請參考 Prometheus 監控方案,詳情請參見本文末尾"相關文檔"中的 Prometheus 監控文檔。

  • 日均寫入量統計:云监控不提供直接的日均寫入量統計視圖,可通過以下方式估算:

    • 控制台查看(近似估算):在執行個體詳情的 Topic 管理頁面,查看目標 Topic 的監控資訊中的寫入流量(B/s);或在云监控頁面查看執行個體業務實際流入流量(instance_message_input,單位 B/s)和執行個體訊息生產條數(instance_message_num_input,單位 count/s),根據時間範圍內的平均值乘以時間長度估算日寫入量。

    • Prometheus 監控(精細查詢):通過 Prometheus 監控查詢 instance_message_input(bytes/s)和 instance_message_num_input(個/秒)等執行個體級指標,利用 Prometheus 的時序彙總函式統計指定時間段內的累計寫入量。詳情請參見本文末尾"相關文檔"中的 Prometheus 監控文檔。

    • API 查詢(精確估算):使用 QueryMessage API 按時間戳記查詢消費位點,通過起始時間和終止時間的位點差值精確估算該時間段內的寫入訊息量。

相關文檔