可觀測監控 Prometheus 版可通過配置接入參數主動拉取Elasticsearch的效能指標,實現對其健全狀態的即時監控和資料分析。
前提條件
Container Service環境
-
已開通可觀測監控Prometheus版。具體操作,請參見Prometheus 執行個體計費。
-
已建立Kubernetes叢集。具體操作,請參見建立ACK託管叢集。
-
已開通阿里雲資源中心。具體操作,請參見開通資源中心。
ECS(VPC)
-
已開通可觀測監控Prometheus版。具體操作,請參見Prometheus 執行個體計費。
-
已建立ECS執行個體。具體操作,請參見通過控制台使用ECS執行個體(快捷版)。
-
已開通阿里雲資源中心。具體操作,請參見開通資源中心。
接入Elasticsearch
登入Prometheus控制台,在左側導覽列單擊接入中心。
-
單擊Elasticsearch卡片,然後根據控制台指引完成組件接入。下面對重點配置項進行說明。
Container Service環境
配置項
說明
Elasticsearch 服務網域名稱
支援以下三類Elasticsearch服務網域名稱:
-
Elasticsearch的叢集內訪問地址(例如:elasticsearch-server.namespace)
-
服務所處叢集內網IP地址
-
服務所處公網的IPv4地址
Elasticsearch 服務連接埠
Elasticsearch的連接埠號碼,例如:9200。
Elasticsearch 登入使用者名稱
Elasticsearch的登入使用者名稱。
Elasticsearch 登入密碼
Elasticsearch的登入密碼。
Metric 採集間隔(單位/秒)
監控資料擷取時間間隔,預設15s。
ECS(VPC)
配置項
說明
Elasticsearch 服務網域名稱
支援以下三類Elasticsearch服務網域名稱:
-
Elasticsearch的叢集內訪問地址(例如:elasticsearch-server.namespace)
-
服務所處叢集內網IP地址
-
服務所處公網的IPv4地址
Elasticsearch 服務連接埠
Elasticsearch的連接埠號碼,例如9200。
Elasticsearch 登入使用者名稱
Elasticsearch的登入使用者名稱。
Elasticsearch 登入密碼
Elasticsearch的登入密碼。
Metric 採集間隔(單位/秒)
監控資料擷取時間間隔,預設15s。
自定义标签
通過自訂標籤向Prometheus收集的指標中添加自訂索引值對標籤,便於在使用Grafana等工具時對這些指標進行細粒度的組織、查詢、監控和分析。更多資訊,請參見VPC環境主機監控自訂標籤注入指標。
說明標籤名不能包含特殊字元,如短劃線(-)、半形句號(.)、百分比符號(%)等,這些字元在Prometheus中有特殊含義。
注入的標籤需要是Prometheus允許的有效Key-Value標籤格式。
-
查看Elasticsearch狀態
已接入的組件可單擊Prometheus控制台左側導覽列中的接入管理查看。接入管理頁麵包括已接入環境、已接入組件和大盤查詢頁簽,您可以查看Targets、指標、大盤、警示等資訊。
Targets
您可以在該頁簽查看整合預設Job發現的Targets列表。
該頁面提供All和Unhealthy兩個篩選Tab,列表中每個Target條目顯示執行個體名稱及健康狀態,格式為(x/x up)。紅色狀態如(0/1 up)表示不健康,黑色狀態如(1/1 up)表示健康。
指標採集
您可以在該頁簽查看具體的指標資訊並對指標進行廢棄配置。具體操作,請參見配置廢棄指標。
在指標採集頁簽左側導航中選擇自訂採集,可查看已建立的自訂採集工作清單。列表包含名稱、job名稱、所屬組件、服務發現方式、採集路徑、採集間隔和操作列。單擊右上方新增可添加自訂採集任務,每個任務支援關閉、查看配置和刪除操作。
大盤
您可以單擊大盤名稱,查看對應Grafana大盤。Grafana 的 Elasticsearch Overview 儀錶盤頁面頂部提供 Interval、Cluster、Node name、Source of metrics 等篩選條件。KPI 地區展示 Cluster health、CPU usage Avg.、JVM memory used Avg.、Nodes、Data nodes、Pending tasks 等指標,Shards 地區展示 Active primary shards、Active shards、Initializing shards、Relocating shards、Delayed shards、Unassigned shards 等分區指標。當所有指標均顯示為 N/A 或無資料時,表明監控資料未被採集到。頁面下方包含 JVM Garbage Collection、Translog、Breakers、CPU and Memory、Disk and Network、Documents、Thread Pool、Caches、Segments 等可摺疊的詳細監控面板。
警示規則
您可以在該頁簽查看Prometheus警示。如果您需要建立Prometheus警示規則,請參見建立Prometheus警示規則。Elasticsearch ECS 叢集預設包含以下5條警示規則:ElasticsearchProcessNotRunning、SystemCPUHigh、ElasticsearchClusterNotHealthy、ElasticsearchPoolJVMHigh、ElasticsearchTooFewNodesRunning,警示分組均為 elasticsearch-ECS-Common,等級為預設,狀態均為運行中。每條規則支援編輯、停止、複製及查看警示事件操作。
相關文檔
組件接入後,您可以對關鍵計量配置警示規則,即時監控指標的效能健康狀態,以便在指標異常狀態時能及時發現並處理。具體操作,請參見建立Prometheus警示規則。