可觀測監控 Prometheus 版可通過配置接入參數主動拉取Kafka的效能指標,實現對其健全狀態的即時監控和資料分析。
前提條件
Container Service環境
-
已開通可觀測監控Prometheus版。具體操作,請參見Prometheus 執行個體計費。
-
已建立Kubernetes叢集。具體操作,請參見建立ACK託管叢集。
-
已開通阿里雲資源中心。具體操作,請參見開通資源中心。
ECS(VPC)
-
已開通可觀測監控Prometheus版。具體操作,請參見Prometheus 執行個體計費。
-
已建立ECS執行個體。具體操作,請參見通過控制台使用ECS執行個體(快捷版)。
-
已開通阿里雲資源中心。具體操作,請參見開通資源中心。
接入Kafka
登入Prometheus控制台,在左側導覽列單擊接入中心。
-
單擊Kafka卡片,然後根據控制台指引完成組件接入。下面對重點配置項進行說明。
Container Service環境
配置項
說明
Pod 選擇標籤
部署JMX Agent時,為Pod配置的標籤和標籤值,可觀測監控 Prometheus 版通過此標籤進行服務發現(Service Discovery)。詳細資料,請參見如何部署和配置Kafka JMX Agent。
Metric 採集間隔
監控資料擷取時間間隔,預設15s。
ECS(VPC)
配置項
說明
Kafka 叢集名稱
每次接入,需使用不同的叢集名稱,以防止指標重複採集導致大盤展示錯誤。
服务地址
可以使用Kafka Broker的IP或DNS地址,多個Broker地址之間使用英文半形逗號或分號來分隔。
如:192.168.0.1:9092,10.0.11.123:9092
開啟 SASL
選擇Kafka服務端是否使用SASL。
SASL 使用者名稱
如果開啟SASL,則需要填寫對應的使用者名稱。
SASL 密碼
如果開啟SASL,則需要填寫對應的使用者密碼。
SASL 方法
選擇SASL方法,目前支援plain、scram-sha512和scram-sha256。
開啟 TLS
選擇Kafka服務端是否使用TLS。
忽略 TLS 安全校正
如果Kafka服務端開啟TLS,且是自我簽署憑證,則選擇忽略TLS安全校正。
Metric 採集間隔
監控資料擷取時間間隔,預設15s。
自定义标签
通過自訂標籤向Prometheus收集的指標中添加自訂索引值對標籤,便於在使用Grafana等工具時對這些指標進行細粒度的組織、查詢、監控和分析。更多資訊,請參見VPC環境主機監控自訂標籤注入指標。
說明標籤名不能包含特殊字元,如短劃線(-)、半形句號(.)、百分比符號(%)等,這些字元在Prometheus中有特殊含義。
注入的標籤需要是Prometheus允許的有效Key-Value標籤格式。
查看Kafka組件狀態
已接入的組件可單擊Prometheus控制台左側導覽列中的接入管理查看。接入管理頁麵包括已接入環境、已接入組件和大盤查詢頁簽,您可以查看Targets、指標、大盤、警示等資訊。
Targets
您可以在該頁簽查看整合預設Job發現的Targets列表。
Targets 頁面以列表形式展示各採集任務的 Endpoint、State、Labels、Last Scrape、Scrape Duration、Error 等資訊。當某個 Target 的 State 為 DOWN(紅色標籤)時,Error 列會顯示具體的錯誤原因,例如 connection refused,表示目標端點不可達,需要檢查對應執行個體的服務連接埠是否正常監聽。
指標採集
您可以在該頁簽查看具體的指標資訊並對指標進行廢棄配置。具體操作,請參見配置廢棄指標。
在指標採集頁簽下選擇自訂採集,可查看已配置的採集工作清單,包含名稱、job名稱、所屬組件、服務發現方式、採集路徑、採集間隔等資訊。例如kafka和ecs-node-exporter任務,服務發現方式為kubernetes_sd_configs,採集路徑為/metrics,採集間隔為15s。每個任務支援關閉、查看配置、刪除操作,也可通過新增按鈕添加新的採集任務。
大盤列表
您可以單擊大盤名稱,查看對應Grafana大盤。
在大盤 Tab 頁中,可通過搜尋方塊按大盤名稱搜尋,或按標籤(如 Kafka)篩選。表格展示大盤名稱與對應標籤,例如預設包含 Kafka Basic 大盤。
以 Prometheus Agent 大盤為例,頂部提供 job、instance、agent 三個篩選下拉框。大盤包含以下面板:Agent 運行狀態(預期副本數、運行副本數、Targets 數量、Series 抓取總量)、Agent 發現/抓取異常(Job 服務發現異常數、Job 抓取異常數、Targets 抓取異常數)、Agent 下發配置異常(sendConfig 異常、sendTargets 異常)、Agent 採集處理異常(基礎指標採集異常 Job 數量等)、Agent 運行版本,以及底部 Agent 狀態總覽 表格,展示 agent 名稱、heartbeat、Targets、Series、writeArms、pod_name、memoryUsed、memoryLimit、cpuUsed、cpuLimit 等指標。
相關文檔
-
對關鍵計量配置警示規則,即時監控指標的效能健康狀態,以便在指標異常狀態時能及時發現並處理。具體操作,請參見建立Prometheus警示規則。
-
使用Prometheus監控Kafka的更多操作,請參見如何使用Prometheus監控Kafka。