Identifique e responda a cenários de manutenção e eventos do sistema para instâncias ECS com discos locais.
Visualizar e monitorar eventos do sistema
-
Visualizar eventos do sistema:
-
Visualize eventos no console do ECS ou usando a CLI do Alibaba Cloud. Consulte Consultar e tratar eventos.
-
Visualize eventos no console do CloudMonitor. Consulte Visualizar eventos do sistema.
-
Monitorar eventos do sistema:
Configure notificações de eventos para monitorar alterações no ambiente subjacente e automatizar respostas de manutenção.
-
Configure regras de alerta no CloudMonitor. Consulte Assinar notificações de eventos do sistema.
-
Use um chatbot do DingTalk. Consulte Enviar notificações de eventos com um chatbot do DingTalk.
-
Para instâncias ECS Bare Metal, instale o plug-in xdragon_hardware_detect_plugin para verificar periodicamente a integridade do disco local. Consulte Instalar o plug-in de monitoramento.
Cenários comuns de manutenção e eventos do sistema relacionados
A figura a seguir mostra cenários comuns de manutenção e eventos do sistema relacionados para instâncias com discos locais.
Personalize o método de recuperação automática modificando os atributos de manutenção da instância. Por exemplo, se definido como reimplantação automática, a instância entra em um cenário de reimplantação por padrão durante a recuperação automática. Consulte Modificar atributos de manutenção da instância.
Consulte as seções a seguir para obter detalhes sobre cada cenário:
Antes da manutenção, garanta a disponibilidade do serviço e faça backup dos seus dados. Por exemplo, alterne o tráfego na camada de aplicação, remova a instância ECS de uma instância do Server Load Balancer (SLB) e faça backup dos dados do disco.
Cenário ①
Tratar um evento SystemMaintenance.Reboot:
-
Receba uma notificação de que sua instância está programada para reinicialização.
-
Responda ao evento conforme necessário.
-
Para alterar a janela de tempo programada, consulte Modificar horário de reinicialização programada.
-
Reinicie a instância dentro da janela de operação do usuário. Consulte Reiniciar uma instância.
nullReinicie a instância pelo console do ECS ou chamando a API RebootInstance. Reiniciar de dentro do sistema operacional não tem efeito.
-
Aguarde o sistema reiniciar automaticamente a instância.
-
-
Verifique se a instância e suas aplicações estão funcionando conforme esperado.
Para os estados do evento SystemMaintenance.Reboot, consulte Resumo de eventos do sistema. Para diagramas de transição de estado, consulte Estados e janelas de eventos do sistema.
Cenário ②
Tratar um evento SystemMaintenance.Redeploy:
-
Receba uma notificação de que sua instância com disco local está programada para reimplantação.
-
Conclua as tarefas de pré-requisito, como modificar o arquivo /etc/fstab e fazer backup dos dados.
Consulte a seção Pré-requisitos de Reimplantar instância.
-
Responda ao evento.
Após fazer backup dos dados, responda ao evento para acionar a migração da instância e a substituição do disco local. Consulte Reimplantar instância.
nullA reimplantação de uma instância com disco local migra a instância para um novo host e reinicializa o disco local. Todos os dados no disco local são apagados.
-
Verifique se a instância e suas aplicações estão funcionando conforme esperado e sincronize os dados conforme necessário.
Para os estados do evento SystemMaintenance.Redeploy, consulte Resumo de eventos do sistema. Para diagramas de transição de estado, consulte Estados e janelas de eventos do sistema.
Cenário ③
Tratar um evento SystemFailure.Reboot:
-
O sistema reinicia automaticamente a instância.
-
Você recebe uma notificação de que a instância está sendo reiniciada.
A instância está sendo reiniciada automaticamente. Nenhuma ação é necessária.
-
Verifique se a instância e suas aplicações estão funcionando conforme esperado.
Para os estados do evento SystemFailure.Reboot, consulte Resumo de eventos do sistema. Para diagramas de transição de estado, consulte Estados e janelas de eventos do sistema.
Cenário ④
Tratar um evento SystemFailure.Redeploy:
-
Receba uma notificação de que sua instância com disco local está programada para reimplantação.
-
Conclua as tarefas de pré-requisito, como modificar o arquivo /etc/fstab e fazer backup dos dados.
Consulte a seção Pré-requisitos de Reimplantar instância.
-
Responda ao evento conforme necessário.
Após fazer backup dos dados, responda ao evento para acionar a migração da instância e a substituição do disco local. Consulte Reimplantar instância.
nullA reimplantação de uma instância com disco local migra a instância para um novo host e reinicializa o disco local. Todos os dados no disco local são apagados.
-
Verifique se a instância e suas aplicações estão funcionando conforme esperado e sincronize os dados conforme necessário.
Para os estados do evento SystemFailure.Redeploy, consulte Resumo de eventos do sistema. Para diagramas de transição de estado, consulte Estados e janelas de eventos do sistema.
Cenário ⑤
No Cenário ⑤, você pode reimplantar a instância em outro host ou substituir apenas o disco danificado. Ao substituir um disco danificado:
-
Nem todos os discos podem ser isolados. O isolamento só é possível quando a operação do evento do sistema inclui isolamento de disco.
-
O isolamento e o reparo de disco são operações independentes. O isolamento é um pré-requisito para o reparo, mas não garante que o reparo seja possível. Nem todas as instâncias suportam reparo de disco local. Você pode iniciar um reparo somente após receber uma notificação de recuperação de disco do Alibaba Cloud.
-
A reimplantação restaura rapidamente a disponibilidade do disco local, mas apaga todos os dados nos discos locais. Consulte Reimplantar instância.
-
A substituição de um disco danificado preserva os dados em outros discos locais. O fluxo de trabalho:
-
Receba notificações sobre uma falha de disco e isolamento programado.
-
Conclua as tarefas de pré-requisito, como modificar o arquivo /etc/fstab e fazer backup dos dados.
-
Se o evento do sistema incluir um evento de isolamento de disco, responda para autorizar o isolamento.
-
Se o evento do sistema incluir um evento de reinicialização, reinicie a instância.
-
O Alibaba Cloud remove o disco danificado, insere um novo e envia uma notificação de recuperação de disco.
-
Se o evento do sistema incluir um evento de recuperação de disco, responda para autorizar a recuperação.
-
Se o evento do sistema incluir um evento de reinicialização, reinicie a instância.
nullA substituição de um disco danificado requer cooperação entre você e o Alibaba Cloud. Consulte Isolar/reparar discos locais e Isolar discos locais danificados (CLI).
A figura a seguir mostra os estados de evento suportados e as transições para substituição de disco danificado.
-
Cenário ⑥
No Cenário ⑥, você pode reimplantar a instância em outro host ou realizar um reparo no local. Ao realizar um reparo no local:
-
Um reparo no local não pode garantir 100% de integridade dos dados ou taxa de sucesso. Faça backup dos dados críticos antes de autorizar o reparo.
-
O reparo com parada não é suportado em todas as instâncias com discos locais.
-
Durante o reparo, a instância não pode ser iniciada, mas a cobrança continua.
-
O ciclo de reparo no local é de 14 dias úteis. Você pode encerrar o reparo reimplantando ou liberando a instância.
-
A reimplantação restaura rapidamente a disponibilidade do disco local, mas apaga todos os dados nos discos locais. Consulte Reimplantar instância.
-
O fluxo de trabalho de reparo no local:
-
Receba uma notificação de evento do sistema sobre um reparo no local para sua instância com disco local.
-
Responda ao evento conforme necessário.
-
Dentro da janela de operação do usuário, pare a instância e autorize o reparo.
-
Aguarde o sistema parar automaticamente a instância e realizar o reparo.
-
-
O Alibaba Cloud repara o hardware do host e envia um evento de conclusão de reparo.
-
Verifique se a instância e suas aplicações estão funcionando conforme esperado e sincronize os dados conforme necessário.
-
Para os estados do evento SystemMaintenance.StopAndRepair, consulte Resumo de eventos do sistema. Para diagramas de transição de estado, consulte Estados e janelas de eventos do sistema.
Referências
Chame a API AcceptInquiredSystemEvent para aceitar a operação padrão de um evento do sistema e autorizar a execução.