全部產品
Search
文件中心

Elasticsearch:配置叢集警示

更新時間:May 10, 2026

Elasticsearch叢集運行過程中,叢集狀態異常、節點磁碟使用率過高等問題會直接影響服務可用性。通過配置監控警示,可以即時感知叢集異常並及時處理。Elasticsearch支援一鍵警示和CloudMonitor自訂警示兩種方式。

開啟一鍵警示

一鍵警示由CloudMonitor提供,預設關閉。開啟後,系統自動建立以下警示規則,作用於當前帳號下的全部Elasticsearch執行個體:

  • 叢集狀態異常

  • 節點磁碟使用率異常(>75%)

  • 節點JVM Heap異常(>85%)

  1. 登入Elasticsearch控制台

  2. 在左側導覽列,單擊Elasticsearch執行個體

  3. Elasticsearch執行個體頁面,單擊一鍵警示

  4. 一鍵警示對話方塊中,單擊前往開啟

    說明

    如果介面顯示前往關閉,表明一鍵警示功能已開啟,無需繼續執行以下操作。

  5. 在CloudMonitor控制台中,開啟Elasticsearch服務的一鍵警示開關。

  6. (可選)返回Elasticsearch控制台,驗證一鍵警示是否已開啟。

    1. Elasticsearch執行個體頁面,單擊目標執行個體ID。

    2. 在左側導覽列,選擇 監控與日誌 > 叢集監控

    3. 單擊基礎監控頁簽,在頁面右上方查看一鍵警示的狀態。

      如果一鍵警示已開啟狀態,表示一鍵警示已生效。

配置CloudMonitor警示

一鍵警示提供的規則為固定模板,如果需要自訂監控指標、警示閾值和通知方式,可通過CloudMonitor建立自訂警示規則。

  1. 進入CloudMonitor控制台

  2. 在左側導覽列,選擇警示服務 > 报警规则

  3. 單擊建立警示

  4. 建立警示頁面,設定警示規則。

    以下樣本配置叢集狀態、節點磁碟使用率、節點堆記憶體使用量率三個組合指標的警示規則。未提及的參數保持預設,詳細參數說明請參見建立警示規則

    參數

    說明

    產品

    選擇 Elasticsearch

    資源範圍

    選擇 執行個體

    關聯資源

    添加待監控的執行個體。

    規則描述

    單擊 添加規則 > 組合指標 ,在 添加規則描述 面板中配置以下參數:

    • 指標類型:選擇組合指標

    • 報警級別:選擇告警(Warn)

    • 多指標警示描述

      說明

      本文樣本此處配置三個監控指標,單擊添加指標即可新增指標描述。

      • 指標一:選擇叢集ID > 叢集狀態,並配置監控值>=2。

      • 指標二:選擇nodeName > 節點磁盤使用率,並配置平均值>=75%。

      • 指標三:選擇nodeName > 節點堆記憶體使用量率_ES業務,並配置平均值>=85%。

    • 多指標關係:選擇有一個滿足條件就警示(||)

    • 報警閾值觸發次數:選擇連續3個周期(1周期=1分鐘)

    您也可以通過配置單指標警示規則實現磁碟水位警示,詳細資料請參見配置磁碟警示樣本

    报警联系人组

    選擇已建立的警示連絡人群組。如未建立,請參見建立警示連絡人或警示連絡人群組

    規則描述的詳細配置如下:

    參數

    配置說明

    指標類型

    選擇 組合指標

    報警級別

    選擇 告警(Warn)

    多指標警示描述

    單擊 添加指標 新增指標描述,配置以下三個監控指標:

    • 指標一:選擇 叢集ID > 叢集狀態 ,配置監控值>=2。

    • 指標二:選擇 nodeName > 節點磁盤使用率 ,配置平均值>=75%。

    • 指標三:選擇 nodeName > 節點堆記憶體使用量率_ES業務 ,配置平均值>=85%。

    多指標關係

    選擇 有一個滿足條件就警示(||)

    報警閾值觸發次數

    選擇 連續3個周期(1周期=1分鐘)

    如需配置單指標警示規則(例如磁碟水位警示),請參見配置磁碟警示樣本

    開啟進階設定,可在警示回調中填寫公網可訪問的URL,CloudMonitor會將警示資訊通過POST請求推送到該地址。目前僅支援HTTP協議,詳細資料請參見使用閾值警示回調

    配置警示規則時,可參考以下監控指標選擇需要監控的專案。更多資訊,請參見指標含義與異常處理建議

    監控項

    必要性

    建議閾值

    說明

    叢集狀態

    必選

    監控值>=2

    叢集狀態Green、Yellow、Red分別對應數值0.00、1.00、2.00。{#234fde02deqpn}配置警示指標時按數值大小設定。

    節點磁碟使用率(%)

    必選

    平均值>=75%

    不超過80%。

    節點HeapMemory使用率(%)

    必選

    平均值>=85%

    不超過90%。在規則描述中顯示為 節點堆記憶體使用量率_ES業務

    節點CPU使用率(%)

    可選

    平均值>=95%

    -

    節點Load_1m

    可選

    以CPU核心數的80%為參考值

    -

    叢集查詢QPS(Count/Second)

    可選

    以實際測試結果為參考

    -

    叢集寫入QPS(Count/Second)

    可選

    以實際測試結果為參考

    -

    FullGc次數(個)

    可選

    數值不為0時異常

    -

    Exception次數(個)

    可選

    數值不為0時異常

    -

    快照狀態

    可選

    數值為2時異常

    數值為-1或0時正常。

  5. 單擊確認

    警示規則建立後,當監控指標觸發警示條件時,警示連絡人群組中的成員會收到警示通知。

配置磁碟警示樣本

磁碟水位警示是最常用的單指標警示情境。當節點磁碟使用率超過閾值時,需要及時擴容或清理資料,避免磁碟寫滿導致服務不可用。

按照配置CloudMonitor警示的步驟建立警示規則,在規則描述中選擇添加規則 >簡單指標 ,參數配置樣本如下。

參數

樣本

规则名称

磁碟水位警示

指標類型

選擇簡單指標

監控指標

選擇nodeName > 節點磁盤使用率

閾值及警示層級

  • 緊急:連續3個周期的平均值 >= 80%

  • 警告:連續3個周期的平均值 >= 75%

  • 普通:連續3個周期的平均值 >= 70%

監控圖表預覽

監控指標的監控圖表預覽效果。