本文匯總了RDS Custom支援的系統事件(包括計劃內營運事件、非預期營運事件等),並為各系統事件提供處理建議。
RDS Custom事件Code和CloudMonitor事件名稱的格式
為了便於您通過系統事件建立自動化營運機制,RDS Custom系統事件會同步至CloudMonitor(CloudMonitor),同一事件的RDS Custom事件Code、CloudMonitor事件名稱遵循了一定的命名格式,格式如下:
RDS Custom事件Code:包括事件起因、對資源的影響的資訊,格式為
<事件起因>.<對資源的影響>。CloudMonitor事件名稱:包括資源類型、事件起因、對資源的影響、事件狀態的資訊,格式為
<資源類型>:<事件起因>.<對資源的影響>:<事件狀態>。
並非所有RDS Custom事件Code和CloudMonitor事件名稱都會包括所有資訊,例如CloudMonitor事件名稱Disk:ErrorDetected:Executing代表磁碟已經出現損壞,因此無需包括對資源後續影響的資訊。
計劃內營運事件
在執行個體作業系統內部進行重啟操作時,無法使事件對應的維護動作生效。因此,本文涉及的重啟執行個體操作指的是通過RDS Custom控制台或調用API方式進行,具體操作,請參見重啟執行個體或RebootRCInstance。
事件Code | 事件名稱 | 事件等級 | CloudMonitor事件名稱 | 事件說明和影響 | 使用者側處理建議 |
SystemMaintenance.Reboot | 因系統維護執行個體重啟 | 嚴重 |
| 阿里雲檢測到RDS Custom執行個體所在的底層宿主機存在潛在的軟硬體故障風險,該風險會導致RDS Custom執行個體重啟,且該風險尚未直接成為故障,在系統維護計劃執行時間前24~48小時發送該系統事件。 說明 故障風險包括:
| 說明 建議您關注事件的狀態變化,如果重啟執行個體後事件的狀態沒有發生變化,說明該事件響應失敗,風險還未解除,建議您稍後選擇一個合適的時間(建議與本次操作間隔12小時以上)重啟執行個體,以規避該風險。 |
SystemMaintenance.Stop | 因系統維護執行個體停止 | 嚴重 |
| 阿里雲檢測到RDS Custom執行個體的底層宿主機存在潛在的軟硬體故障風險,該風險會導致RDS Custom執行個體關機並停止,且該風險尚未直接成為故障,在系統維護計劃執行前的24~48小時內發送該系統事件。 | |
SystemMaintenance.Redeploy | 因系統維護執行個體重新部署 | 嚴重 |
| 阿里雲檢測到RDS Custom執行個體的底層宿主機存在潛在的軟硬體故障風險,該風險會導致RDS Custom執行個體重新部署,且該風險尚未直接成為故障,在系統維護計劃執行時間前24~48小時發送該系統事件。 重要 使用了本地SSD盤或者本地HDD盤的執行個體會重新初始化資料盤,本地碟上的資料會被清空。 | 建議您完成準備工作,包括修改/etc/fstab設定檔、備份資料等,然後根據需要選擇一種回應程式式:
說明 建議您關注事件的狀態變化,如果重新部署執行個體後事件的狀態沒有發生變化,說明該事件響應失敗,風險還未解除,建議您稍後選擇一個合適的時間(建議與本次操作間隔12小時以上)重新部署,以規避該風險。 |
SystemFailure.Redeploy | 因系統錯誤執行個體重新部署 | 嚴重 |
| 當阿里雲識別到RDS Custom執行個體因底層宿主機出現了軟硬體故障需要重新部署本地碟執行個體時,立即發送該系統事件。 說明 僅依賴宿主機硬體的執行個體支援此類事件,例如掛載本地碟或支援SGX加密計算的執行個體。 | 建議您完成準備工作,包括修改/etc/fstab設定檔、備份資料等,然後根據需要選擇一種回應程式式:
|
SystemMaintenance.CleanReleasedDisks | 執行個體需清理已釋放雲端硬碟的配置資訊 | 警告 |
| 當阿里雲識別到RDS Custom執行個體的作業系統中存在因欠費被釋放的一塊或多塊雲端硬碟的配置資訊時,發送該系統事件。 | 建議您選擇合適的時間,授權阿里雲清理已釋放雲端硬碟的配置資訊。 重要 阿里雲會在您授權的指定時間對該執行個體進行關機,然後對雲端硬碟進行清理,清理完成後再次開機。 |
非預期營運事件
事件Code | 事件名稱 | 事件等級 | CloudMonitor事件名稱 | 事件說明和影響 | 使用者側處理建議 |
SystemFailure.Reboot | 因系統錯誤執行個體重啟 | 嚴重 |
| 當阿里雲識別到RDS Custom執行個體因底層宿主機出現了非預期的軟硬體故障(如CPU、記憶體硬體損壞等)被重啟時,立即發送該系統事件。 | 建議您等待執行個體自動重啟完成,然後檢查執行個體和應用是否正常。 重啟過程中,阿里雲會將該執行個體遷移到其他健康的宿主機上。 |
InstanceFailure.Reboot | 執行個體因作業系統錯誤需重啟 | 嚴重 |
| 當阿里雲識別到RDS Custom執行個體因作業系統內部出現宕機,包括OOM、藍屏、卡死、不停列印串口日誌或核心panic問題時,立即發送該系統事件。 | 建議您等待執行個體自動重啟完成,然後檢查執行個體和應用是否正常。 您可以開啟作業系統的Kdump服務,排查崩潰原因,避免再次引發同類問題。具體操作,請參見Linux執行個體如何開啟Kdump服務。 |
SystemFailure.Stop | 因系統錯誤執行個體停止 | 嚴重 |
| 當阿里雲識別到RDS Custom執行個體因底層宿主機出現了軟硬體故障(如CPU、記憶體硬體損壞等)被關機時,立即發送該系統事件。 | 建議您等待執行個體自動停止完成,然後啟動執行個體。 啟動執行個體時,阿里雲會將該執行個體遷移到其他健康的宿主機上。 |
SystemFailure.Delete | 因執行個體建立失敗賬單自動取消 | 嚴重 |
| 當阿里雲識別到RDS Custom執行個體在建立,雖然下單成功但是執行個體建立失敗,立即發送該系統事件。 | 建議您等待系統自動釋放執行個體,通常在建立失敗五分鐘內自動釋放。 說明 如果您已經完成訂單支付,在執行個體釋放後會收到相應的退款。 |
InstanceFailure.PerformanceImpact | 因執行個體錯誤執行個體效能受損 | 警告 |
| 執行個體內部發生了不可預期的異常(例如GuestOS核心hang),導致該執行個體的效能受損時,立即發送該系統事件。 | 建議您登入執行個體定位異常原因並處理異常,處理異常後關注該系統事件的狀態。如果該系統事件不再持續報出,代表已消除效能受損。 |