Lindorm流引擎任務在運行中可能發生資料處理延遲或任務狀態異常,需訂閱相關警示以便及時響應。本文介紹如何配置和訂閱流引擎警示項。
流引擎監控指標
Job 延遲警示
任務延遲警示的核心指標為:CurrentEmitEventTimeLag = EmitTime - EventTime,即Source Operator的處理時間與該記錄的EventTime時間的差值。
流引擎Job 重啟次數警示
任務重啟次數的核心指標為:JobNumRestarts。該項閾值配置需要小於任務的最大重試次數,例如任務最大重試次數為30,此時任務重啟次數警示的閾值可以為20左右。
建立流引擎警示規則
登入Lindorm管理主控台。在左上方選擇執行個體所屬的地區。在实例列表頁,單擊目標執行個體ID或者目標執行個體所在行操作列的管理。
-
在左側導覽列單擊报警配置可以查看執行個體的警示規則。進入 Lindorm 警示列表 頁面。
-
單擊建立Lindorm警示規則。
-
在建立Lindorm警示規則頁面配置以下參數。
參數
說明
警示名稱
警示的名稱。
檢測類型
選擇靜態閾值。
Lindorm叢集
需要建立警示的Lindorm執行個體,即當前執行個體。
警示分組
選擇
Lindorm-流引擎。警示指標
主要有Job 延遲警示和流引擎Job 重啟次數警示兩個。
其中警示條件可設定觸發閾值,例如 Job 延遲警示的條件為延遲大於
60秒時滿足警示條件。篩選條件預設為無篩選。