Lindorm搜尋引擎提供全方位監控警示能力,即時追蹤索引狀態、查詢延遲與資源水位,智能預警保障搜尋服務穩定高效。
搜尋引擎監控 指標
Lindorm搜尋引擎CPU總使用率
該指標由CPU user(進程佔用)、CPU system(系統佔用)和CPU wio(I/O等待)三部分總和組成。當總使用率長時間超過90%時,下發到搜尋引擎的讀寫請求易排隊,導致回應時間(RT)增加且輸送量受限;CPU瓶頸下,即使增加用戶端並發,服務端效能也無法提升。
CPU升高通常源於讀寫請求量增加或大查詢(表現為CPU user大幅上漲),或在I/O密集型情境如分詞查詢(CPU wio顯著上升)。建議可結合監控排查以下情況:
-
業務讀寫請求量是否有上漲,主要關注節點維度服務側指標中的寫入TPS和查詢QPS。
-
業務查詢模式是否有變化,進而導致下發了大查詢,主要關注節點維度服務側指標中的 Query階段延遲和Fetch階段延遲。
對於延遲不敏感情境,優先監控search線程rejected和write線程rejected詳情。這兩個監控指標直接反映請求隊列滿導致的拒絕,對於用戶端而言則反映為讀寫請求的失敗。建議警示應聚焦長時間非零狀態而非短暫峰值。
Lindorm搜尋引擎記憶體反壓
Lindorm搜尋引擎服務端在執行請求前,會基於當前JVM記憶體使用量情況和請求大小評估記憶體是否足夠。如果剩餘記憶體不足,且執行Full GC也無法釋放足夠空間,請求將被拒絕。節點維度服務側指標-整體記憶體反壓次數監控大盤直接反映這種拒絕的頻率。類似讀寫線程拒絕的情況,如果用戶端突發流量減少或大查詢停止,系統通過記憶體回收逐步恢複JVM記憶體水位,反壓頻率會下降直至歸零。因此,警示建議是監測該指標是否長時間保持在非零狀態。
業務讀寫查詢延遲
該指標位於節點維度業務側指標 search延遲/bulk寫入延遲,直接反映用戶端調用search/bulk API 查詢/寫入Lindorm搜尋引擎時的請求響應RT情況(包括mean和p99)。對於查詢/寫入延遲敏感的業務情境,可以通過如下警示模板配置業務側通過search/bulk介面查詢/寫入服務端的mean或p99延遲警示。
建立搜尋引擎警示規則
登入Lindorm管理主控台。在左上方選擇執行個體所屬的地區。在实例列表頁,單擊目標執行個體ID或者目標執行個體所在行操作列的管理。
-
在左側導覽列單擊报警配置,進入 Lindorm 警示列表 頁面,可以查看執行個體的警示規則。
-
單擊建立Lindorm警示規則。
-
在建立Lindorm警示規則頁面配置以下參數。
參數
說明
告警名称
警示的名稱。
检测类型
選擇靜態閾值。
Lindorm叢集
需要建立警示的Lindorm執行個體,即當前執行個體。
告警分组
選擇
Lindorm-搜尋引擎3.0。警示指標
有多個可選,包含等Lindorm搜尋引擎CPU總使用率、Lindorm搜尋引擎記憶體反壓、業務讀寫查詢延遲等。
在警示條件中設定閾值,例如大於 0 時滿足警示條件。