Este tópico resume os eventos de sistema compatíveis com o RDS Custom, incluindo eventos de manutenção programada e não programada, e apresenta sugestões de tratamento para cada evento.
Formato dos códigos de evento do RDS Custom e nomes de evento do CloudMonitor
Para ajudar você a estabelecer mecanismos automatizados de manutenção por meio de eventos de sistema, o RDS Custom sincroniza seus eventos com o CloudMonitor. Os códigos de evento do RDS Custom e os nomes de evento correspondentes no CloudMonitor seguem formatos de nomenclatura específicos:
Código de evento do RDS Custom: Inclui informações sobre a causa do evento e o impacto nos recursos, no formato
<event cause>.<impact on resources>.Nome do evento no CloudMonitor: Inclui informações sobre o tipo de recurso, causa do evento, impacto nos recursos e status do evento, no formato
<resource type>:<event cause>.<impact on resources>:<event status>.
Nem todos os códigos de evento do RDS Custom e nomes de evento do CloudMonitor incluem todas as informações. Por exemplo, o nome do evento no CloudMonitor Disk:ErrorDetected:Executing indica detecção de corrupção de disco; portanto, informações sobre impactos subsequentes nos recursos são desnecessárias.
Eventos de O&M programados
Ao reiniciar uma instância pelo sistema operacional, as ações de manutenção correspondentes ao evento não entram em vigor. Portanto, as operações de reinicialização de instância mencionadas neste tópico referem-se a operações realizadas pelo console do RDS Custom ou por chamadas de API. Para mais informações, consulte Reiniciar uma instância ou RebootRCInstance.
Código do evento | Nome do evento | Nível do evento | Nome do evento no CloudMonitor | Descrição e impacto do evento | Sugestões de tratamento |
SystemMaintenance.Reboot | Reinicialização da instância devido à manutenção do sistema | Crítico |
| O Alibaba Cloud detectou riscos potenciais de falha de software ou hardware no host onde a instância RDS Custom está implantada. Esses riscos podem causar a reinicialização da instância. O risco ainda não se tornou uma falha direta. Este evento de sistema é enviado de 24 a 48 horas antes do horário programado para a manutenção. Nota Os riscos de falha incluem:
| Reinicie a instância manualmente. Nota Monitore as alterações de status do evento. Se o status não mudar após a reinicialização da instância, a resposta ao evento falhou e o risco persiste. Recomendamos reiniciar a instância em um momento adequado posteriormente (preferencialmente mais de 12 horas após esta operação) para mitigar o risco. |
SystemMaintenance.Stop | Parada da instância devido à manutenção do sistema | Crítico |
| O Alibaba Cloud detectou riscos potenciais de falha de software ou hardware no host onde a instância RDS Custom está implantada. Esses riscos podem causar o desligamento e a parada da instância. O risco ainda não se tornou uma falha direta. Este evento de sistema é enviado de 24 a 48 horas antes do horário programado para a manutenção. | |
SystemMaintenance.Redeploy | Reimplantação da instância devido à manutenção do sistema | Crítico |
| O Alibaba Cloud detectou riscos potenciais de falha de software ou hardware no host onde a instância RDS Custom está implantada. Esses riscos podem causar a reimplantação da instância. O risco ainda não se tornou uma falha direta. Este evento de sistema é enviado de 24 a 48 horas antes do horário programado para a manutenção. Importante Instâncias que utilizam discos SSD locais ou discos HDD locais terão seus discos de dados reinicializados, e os dados nos discos locais serão excluídos. | Conclua os preparativos, incluindo a modificação do arquivo de configuração /etc/fstab e o backup dos dados. Em seguida, escolha um dos seguintes métodos de resposta conforme sua necessidade:
Nota Monitore as alterações de status do evento. Se o status não mudar após a reimplantação da instância, a resposta ao evento falhou e o risco persiste. Recomendamos reimplantar a instância em um momento adequado posteriormente (preferencialmente mais de 12 horas após esta operação) para mitigar o risco. |
SystemFailure.Redeploy | Reimplantação da instância devido a erro do sistema | Crítico |
| Quando o Alibaba Cloud identifica que uma instância RDS Custom precisa ser reimplantada devido a falhas de software ou hardware no host subjacente, este evento de sistema é enviado imediatamente. Nota Apenas instâncias dependentes do hardware do host suportam este tipo de evento, como instâncias com discos locais conectados ou instâncias que suportam computação criptografada SGX. | Conclua os preparativos, incluindo a modificação do arquivo de configuração /etc/fstab e o backup dos dados. Em seguida, escolha um dos seguintes métodos de resposta conforme sua necessidade:
|
SystemMaintenance.CleanReleasedDisks | Limpeza necessária de informações de configuração de discos liberados na instância | Aviso |
| Este evento de sistema é enviado quando o Alibaba Cloud identifica que o sistema operacional de uma instância RDS Custom contém informações de configuração de um ou mais discos liberados devido a pagamentos atrasados. | Escolha um horário adequado para autorizar o Alibaba Cloud a limpar as informações de configuração dos discos liberados. Importante O Alibaba Cloud desligará a instância no horário especificado na autorização, limpará os discos e iniciará a instância novamente. |
Eventos de O&M não programados
Código do evento | Nome do evento | Nível do evento | Nome do evento no CloudMonitor | Descrição e impacto do evento | Sugestões de tratamento |
SystemFailure.Reboot | Reinicialização da instância devido a erro do sistema | Crítico |
| Quando o Alibaba Cloud identifica que uma instância RDS Custom foi reiniciada devido a falhas inesperadas de software ou hardware (como danos físicos na CPU ou memória) no host subjacente, este evento de sistema é enviado imediatamente. | Aguarde a reinicialização automática da instância e verifique se a instância e os aplicativos estão funcionando normalmente. Durante o processo de reinicialização, o Alibaba Cloud migrará a instância para outro host íntegro. |
InstanceFailure.Reboot | Reinicialização necessária da instância devido a erro do sistema operacional | Crítico |
| Quando o Alibaba Cloud identifica que uma instância RDS Custom travou devido a problemas internos do sistema operacional, incluindo falta de memória, tela azul, congelamento, impressão contínua de log da porta serial ou kernel panic, este evento de sistema é enviado imediatamente. | Aguarde a reinicialização automática da instância e verifique se a instância e os aplicativos estão funcionando normalmente. Ative o serviço Kdump no sistema operacional para solucionar a causa do travamento e evitar problemas semelhantes no futuro. Para mais informações, consulte Como ativar o serviço Kdump para instâncias Linux. |
SystemFailure.Stop | Parada da instância devido a erro do sistema | Crítico |
| Quando o Alibaba Cloud identifica que uma instância RDS Custom foi desligada devido a falhas de software ou hardware (como danos físicos na CPU ou memória) no host subjacente, este evento de sistema é enviado imediatamente. | Aguarde a parada automática da instância e inicie-a novamente. Ao iniciar a instância, o Alibaba Cloud a migrará para outro host íntegro. |
SystemFailure.Delete | Fatura cancelada automaticamente devido à falha na criação da instância | Crítico |
| Quando o Alibaba Cloud identifica que uma instância RDS Custom teve o pedido realizado com sucesso, mas falhou ao ser criada, este evento de sistema é enviado imediatamente. | Aguarde o sistema liberar a instância automaticamente, o que geralmente ocorre dentro de cinco minutos após a falha na criação. Nota Se você já pagou pelo pedido, receberá um reembolso após a liberação da instância. |
InstanceFailure.PerformanceImpact | Desempenho da instância degradado devido a erro na instância | Aviso |
| Quando ocorre uma exceção inesperada dentro da instância (como um hang do kernel do GuestOS) que degrada o desempenho da instância, este evento de sistema é enviado imediatamente. | Faça login na instância para identificar e resolver a exceção e monitore o status deste evento de sistema. Se o evento deixar de ser reportado, isso indica que a degradação de desempenho foi resolvida. |