全部產品
Search
文件中心

:RDS Custom系統事件匯總

更新時間:Jul 25, 2025

本文匯總了RDS Custom支援的系統事件(包括計劃內營運事件、非預期營運事件等),並為各系統事件提供處理建議。

RDS Custom事件Code和CloudMonitor事件名稱的格式

為了便於您通過系統事件建立自動化營運機制,RDS Custom系統事件會同步至CloudMonitor(CloudMonitor),同一事件的RDS Custom事件Code、CloudMonitor事件名稱遵循了一定的命名格式,格式如下:

  • RDS Custom事件Code:包括事件起因、對資源的影響的資訊,格式為<事件起因>.<對資源的影響>

  • CloudMonitor事件名稱:包括資源類型、事件起因、對資源的影響、事件狀態的資訊,格式為<資源類型>:<事件起因>.<對資源的影響>:<事件狀態>

說明

並非所有RDS Custom事件Code和CloudMonitor事件名稱都會包括所有資訊,例如CloudMonitor事件名稱Disk:ErrorDetected:Executing代表磁碟已經出現損壞,因此無需包括對資源後續影響的資訊。

計劃內營運事件

重要

在執行個體作業系統內部進行重啟操作時,無法使事件對應的維護動作生效。因此,本文涉及的重啟執行個體操作指的是通過RDS Custom控制台或調用API方式進行,具體操作,請參見重啟執行個體RebootRCInstance

事件Code

事件名稱

事件等級

CloudMonitor事件名稱

事件說明和影響

使用者側處理建議

SystemMaintenance.Reboot

因系統維護執行個體重啟

嚴重

  • Instance:SystemMaintenance.Reboot:Inquiring:因系統維護執行個體需重啟問詢中

  • Instance:SystemMaintenance.Reboot:Scheduled:因系統維護執行個體重啟計劃中

  • Instance:SystemMaintenance.Reboot:Executing:因系統維護執行個體重啟執行中

  • Instance:SystemMaintenance.Reboot:Executed:因系統維護執行個體重啟已完成

  • Instance:SystemMaintenance.Reboot:Avoided:因系統維護執行個體重啟已規避

  • Instance:SystemMaintenance.Reboot:Failed:因系統維護執行個體重啟失敗

  • Instance:SystemMaintenance.Reboot:Canceled:因系統維護執行個體重啟已取消

阿里雲檢測到RDS Custom執行個體所在的底層宿主機存在潛在的軟硬體故障風險,該風險會導致RDS Custom執行個體重啟,且該風險尚未直接成為故障,在系統維護計劃執行時間前24~48小時發送該系統事件。

說明

故障風險包括:

  • 類型1:宿主機存在隱患風險

  • 類型2:執行個體GPU裝置不可用

手動重啟執行個體

說明

建議您關注事件的狀態變化,如果重啟執行個體後事件的狀態沒有發生變化,說明該事件響應失敗,風險還未解除,建議您稍後選擇一個合適的時間(建議與本次操作間隔12小時以上)重啟執行個體,以規避該風險。

SystemMaintenance.Stop

因系統維護執行個體停止

嚴重

  • Instance:SystemMaintenance.Stop:Scheduled:因系統維護執行個體停止計劃中

  • Instance:SystemMaintenance.Stop:Executing:因系統維護執行個體停止執行中

  • Instance:SystemMaintenance.Stop:Executed:因系統維護執行個體停止已完成

  • Instance:SystemMaintenance.Stop:Avoided:因系統維護執行個體停止已規避

  • Instance:SystemMaintenance.Stop:Failed:因系統維護執行個體停止失敗

  • Instance:SystemMaintenance.Stop:Canceled:因系統維護執行個體停止已取消

阿里雲檢測到RDS Custom執行個體的底層宿主機存在潛在的軟硬體故障風險,該風險會導致RDS Custom執行個體關機並停止,且該風險尚未直接成為故障,在系統維護計劃執行前的24~48小時內發送該系統事件。

手動重啟執行個體

SystemMaintenance.Redeploy

因系統維護執行個體重新部署

嚴重

  • Instance:SystemMaintenance.Redeploy:Inquiring:因系統維護執行個體需重新部署問詢中

  • Instance:SystemMaintenance.Redeploy:Scheduled:因系統維護執行個體重新部署計劃中

  • Instance:SystemMaintenance.Redeploy:Executing:因系統維護執行個體重新部署執行中

  • Instance:SystemMaintenance.Redeploy:Executed:因系統維護執行個體重新部署已完成

  • Instance:SystemMaintenance.Redeploy:Avoided:因系統維護執行個體重新部署已規避

  • Instance:SystemMaintenance.Redeploy:Canceled:因系統維護執行個體重新部署已取消

阿里雲檢測到RDS Custom執行個體的底層宿主機存在潛在的軟硬體故障風險,該風險會導致RDS Custom執行個體重新部署,且該風險尚未直接成為故障,在系統維護計劃執行時間前24~48小時發送該系統事件。

重要

使用了本地SSD盤或者本地HDD盤的執行個體會重新初始化資料盤,本地碟上的資料會被清空。

建議您完成準備工作,包括修改/etc/fstab設定檔、備份資料等,然後根據需要選擇一種回應程式式:

說明

建議您關注事件的狀態變化,如果重新部署執行個體後事件的狀態沒有發生變化,說明該事件響應失敗,風險還未解除,建議您稍後選擇一個合適的時間(建議與本次操作間隔12小時以上)重新部署,以規避該風險。

SystemFailure.Redeploy

因系統錯誤執行個體重新部署

嚴重

  • Instance:SystemFailure.Redeploy:Inquiring:因系統錯誤執行個體需重新部署問詢中

  • Instance:SystemFailure.Redeploy:Executing:因系統錯誤執行個體重新部署執行中

  • Instance:SystemFailure.Redeploy:Executed:因系統錯誤執行個體重新部署已完成

  • Instance:SystemFailure.Redeploy:Avoided:因系統錯誤執行個體重新部署已規避

  • Instance:SystemFailure.Redeploy:Canceled:因系統錯誤執行個體重新部署已取消

當阿里雲識別到RDS Custom執行個體因底層宿主機出現了軟硬體故障需要重新部署本地碟執行個體時,立即發送該系統事件。

說明

僅依賴宿主機硬體的執行個體支援此類事件,例如掛載本地碟或支援SGX加密計算的執行個體。

建議您完成準備工作,包括修改/etc/fstab設定檔、備份資料等,然後根據需要選擇一種回應程式式:

SystemMaintenance.CleanReleasedDisks

執行個體需清理已釋放雲端硬碟的配置資訊

警告

  • Instance:SystemMaintenance.CleanReleasedDisks.Inquiring:執行個體需清理已釋放雲端硬碟的配置資訊問詢中

  • Instance:SystemMaintenance.CleanReleasedDisks.Executing:執行個體需清理已釋放雲端硬碟的配置資訊執行中

  • Instance:SystemMaintenance.CleanReleasedDisks.Executed:執行個體需清理已釋放雲端硬碟的配置資訊已完成

  • Instance:SystemMaintenance.CleanReleasedDisks.Failed:執行個體需清理已釋放雲端硬碟的配置資訊已失敗

當阿里雲識別到RDS Custom執行個體的作業系統中存在因欠費被釋放的一塊或多塊雲端硬碟的配置資訊時,發送該系統事件。

建議您選擇合適的時間,授權阿里雲清理已釋放雲端硬碟的配置資訊。

重要

阿里雲會在您授權的指定時間對該執行個體進行關機,然後對雲端硬碟進行清理,清理完成後再次開機。

非預期營運事件

事件Code

事件名稱

事件等級

CloudMonitor事件名稱

事件說明和影響

使用者側處理建議

SystemFailure.Reboot

因系統錯誤執行個體重啟

嚴重

  • Instance:SystemFailure.Reboot:Executing:因系統錯誤執行個體重啟開始

  • Instance:SystemFailure.Reboot:Executed:因系統錯誤執行個體重啟結束

  • Instance:SystemFailure.Reboot:Failed:因系統錯誤執行個體重啟失敗

當阿里雲識別到RDS Custom執行個體因底層宿主機出現了非預期的軟硬體故障(如CPU、記憶體硬體損壞等)被重啟時,立即發送該系統事件。

建議您等待執行個體自動重啟完成,然後檢查執行個體和應用是否正常。

重啟過程中,阿里雲會將該執行個體遷移到其他健康的宿主機上。

InstanceFailure.Reboot

執行個體因作業系統錯誤需重啟

嚴重

  • Instance:InstanceFailure.Reboot:Scheduled:執行個體因作業系統錯誤需重啟計劃中

  • Instance:InstanceFailure.Reboot:Executing:執行個體因作業系統錯誤需重啟開始

  • Instance:InstanceFailure.Reboot:Executed:執行個體因作業系統錯誤需重啟結束

  • Instance:InstanceFailure.Reboot:Avoided:執行個體因作業系統錯誤需重啟已規避

當阿里雲識別到RDS Custom執行個體因作業系統內部出現宕機,包括OOM、藍屏、卡死、不停列印串口日誌或核心panic問題時,立即發送該系統事件。

建議您等待執行個體自動重啟完成,然後檢查執行個體和應用是否正常。

您可以開啟作業系統的Kdump服務,排查崩潰原因,避免再次引發同類問題。具體操作,請參見Linux執行個體如何開啟Kdump服務

SystemFailure.Stop

因系統錯誤執行個體停止

嚴重

  • Instance:SystemFailure.Stop:Executing:因系統錯誤執行個體開始停止

  • Instance:SystemFailure.Stop:Executed:因系統錯誤執行個體已停止

當阿里雲識別到RDS Custom執行個體因底層宿主機出現了軟硬體故障(如CPU、記憶體硬體損壞等)被關機時,立即發送該系統事件。

建議您等待執行個體自動停止完成,然後啟動執行個體。

啟動執行個體時,阿里雲會將該執行個體遷移到其他健康的宿主機上。

SystemFailure.Delete

因執行個體建立失敗賬單自動取消

嚴重

  • Instance:SystemFailure.Delete:Executing:因執行個體建立失敗賬單開始自動取消

  • Instance:SystemFailure.Delete:Executed:因執行個體建立失敗賬單已自動取消

  • Instance:SystemFailure.Delete:Avoided:因執行個體建立失敗賬單自動取消已規避

當阿里雲識別到RDS Custom執行個體在建立,雖然下單成功但是執行個體建立失敗,立即發送該系統事件。

建議您等待系統自動釋放執行個體,通常在建立失敗五分鐘內自動釋放。

說明

如果您已經完成訂單支付,在執行個體釋放後會收到相應的退款。

InstanceFailure.PerformanceImpact

因執行個體錯誤執行個體效能受損

警告

  • Instance:InstanceFailure.PerformanceImpact:Executing

  • Instance:InstanceFailure.PerformanceImpact:Executed

執行個體內部發生了不可預期的異常(例如GuestOS核心hang),導致該執行個體的效能受損時,立即發送該系統事件。

建議您登入執行個體定位異常原因並處理異常,處理異常後關注該系統事件的狀態。如果該系統事件不再持續報出,代表已消除效能受損。

相關文檔

RDS Custom簡介