開啟節點自愈後,ACK會自動監測例外狀況事件,並在靈駿節點發生底層事件故障時調用靈駿審批營運操作能力完成修複。啟用該功能需先開啟靈駿節點池的託管能力。
節點自愈啟用入口
ACK支援在建立節點池或修改存量節點池的託管配置時,開啟節點自愈功能並定義自愈規則。自愈規則可通過自愈規則頁面進行管理,配置指引參見下文自愈規則配置說明。
白名單功能。請聯絡技術服務團隊啟用。
不支援專屬雲地區。
方式一:建立節點池時配置
方式二:存量節點池中配置
啟用後,可在頁面,進行規則的集中新增與管理。
在ACK叢集列表頁面,單擊目的地組群名稱,在叢集詳情頁左側導覽列,選擇。
按照頁面提示,單擊建立自愈規則建立新規則,或在規則列表管理已有規則。
自愈規則配置說明
注意事項如下:
故障按優先順序處理。高優先順序的維修類故障優先執行修複;低優先順序的重啟類故障延後執行,直至高優先順序故障處理完畢。
自訂損毀修復流程中,任意步驟開啟人工介入後,請及時完成授權,否則ACK將暫停執行當前及後續流程,節點可能停留在受損狀態。
開啟節點自愈後 ,ACK自動監測例外狀況事件,並在靈駿節點發生底層故障時,調用審批營運能力進行修複。您需要密切關注靈駿節點自身的健全狀態及其在ACK叢集中的節點狀態,避免業務持續受損。
1. 進入自愈規則配置入口
通過節點池建立或配置介面,或在自愈規則頁面單擊建立自愈規則,進入建立自愈規則面板。
按照頁面提示,配置規則名稱並完成規則的建立:
節點池類型:選擇靈駿節點池。
子規則配置:單擊添加子規則,根據設定精靈完成a. 選擇故障和b. 自訂損毀修復流程。
注意事項:仔細閱讀頁面注意事項。
2. 配置子規則
a. 選擇故障
節點自愈通過監測靈駿節點上報的CloudMonitor事件發現故障,並調用靈駿審批營運操作能力完成修複。
故障類型與修複行為:
故障名稱 | 靈駿事件名稱 | Kubernetes Condition | 故障說明 | 修複行為 |
靈駿節點底層硬體異常 | Node.HardwareFault.HOST:Inquiring resourceType: Node |
| 靈駿節點發生硬體故障,需進行維修。維修完成後,節點本機資料可能丟失。若您將容器運行時及 kubelet 目錄掛載至本地碟,請在維修結束後將該節點從 ACK 叢集節點列表中移除再重新加入。 | 維修靈駿節點。 重要 靈駿節點維修過程中,本地碟資料可能丟失,請提前備份。 優先順序:高 |
靈駿節點底層異常 | Node.FaultNeedReboot.HOST:Inquiring resourceType: Node |
| 靈駿節點發生故障,建議儘快重啟節點以嘗試修複。 | 重新啟動靈駿節點。 優先順序:中 |
b. 自訂損毀修復流程
以下修複流程均支援人工介入,通過節點標籤(Label)授權完成。開啟後,ACK 將在獲得授權確認後再執行操作。
配置項 | 說明 |
節點隔離 | 故障節點被標記為不可調度(即設定 |
節點排水 | 開啟前,請先開啟節點隔離 ACK 逐個驅逐故障節點上啟動並執行工作負載。節點排水預設逾時時間為300秒,可按需調整。
|
自動修複 | ACK 執行故障類型所對應的修複動作。詳見故障類型與修複行為。 |
解除節點隔離 | 開啟前,請先開啟節點隔離 節點恢複為可調度狀態(即設定 若節點在進入修複流程前已處於不可調度狀態,本步驟不會將其恢複為可調度狀態。 |
節點自愈事件
靈駿節點池開啟託管配置並關聯自愈規則後,ACK會將本叢集的靈駿節點故障事件轉換為Kubernetes Event和 Condition,並透出節點自愈進度相關的Kubernetes Event。
常見自愈流程事件
事件(Reason) | 層級 | 說明 |
DetectedLingJungCMSEvent | Warning | 檢測到靈駿節點故障事件,或故障事件狀態有更新。 |
RepairPlanCreated | Warning | 自愈計劃已建立。 |
WaitingApproveProcedure | Warning | 當前流程需要人工授權,事件訊息中包含需授權的操作及授權方式。 |
RepairPlanProcedureWaitingForApproval | Warning | 授權標籤已添加到節點標籤。 |
RepairPlanStatusUpdated | Normal | 自愈計劃狀態更新,記錄當前執行的流程及執行結果。 |
ApproveLingjunOperation | Normal | 已授權靈駿管控面執行修複操作。 |
NodeNotRecovery | Warning | 修複完成後每30分鐘檢測一次節點狀態。若節點未恢複,則觸發此事件。 |
RepairPlanCompleted | Warning | 自愈計劃結束,事件訊息中顯示自愈成功或失敗。 |
特殊情境事件
在部分情境下,可能涉及如下事件。
事件(Reason) | 層級 | 說明 |
NodeRecoveryNeedSilence | Normal | 本節點上一次自愈計劃執行成功,但當前故障類型與上次自愈計劃不同,系統將等待 10 分鐘靜默期後,再建立新的自愈計劃。 |
NodeRecoveryHasProcessed | Warning | 當前故障已被最近一次自愈成功處理,但節點實際未恢複,需人工介入排查。 |
RepairPlanFailed | Warning | 當前故障對應的自愈計劃執行失敗,節點未恢複,需人工介入排查。 |
RepairPlanStatusUpdateFailed | Warning | 自愈計劃狀態更新失敗。 |
AddInquiringLabelFailed | Normal | 授權Label設定失敗,自愈流程中止。 |
配置警示
開啟節點自愈後,請務必開啟警示管理功能,啟用叢集節點池營運事件警示規則集和叢集節點自愈警示規則集,在異常情況發生時自動接收警示通知並及時響應。
規則集啟用操作,請參見Container Service警示管理。
> 開啟託管(未啟用託管)或託管配置(已啟用託管),按照頁面提示完成自愈規則的建立和節點自愈的啟用。