Os eventos de sistema do ECS notificam você sobre tarefas de O&M, exceções de recursos e alterações de status — como migração ou reinicializações de manutenção da instância — para que você possa agir antes que a disponibilidade seja afetada.
Formatos dos códigos de evento do ECS e dos nomes de evento do CloudMonitor
Os eventos de sistema do ECS são sincronizados com o CloudMonitor, permitindo fluxos de trabalho de O&M automatizados. Os códigos de evento e os nomes de evento do CloudMonitor seguem estes formatos:
-
Códigos de evento do ECS:
<Causa do evento>.<Impacto no recurso>. -
Nomes de evento do CloudMonitor:
<Tipo de recurso>:<Causa do evento>.<Impacto no recurso>:<Status do evento>.
Nem todos os códigos de evento incluem todos os campos. Por exemplo, Disk:ErrorDetected:Executing omite o campo de impacto porque o dano ao disco em si é o impacto.
A tabela a seguir lista exemplos de códigos de evento do ECS e nomes de evento do CloudMonitor.
Se o código de evento do ECS for Undefined, o evento não aparece no console do ECS e não pode ser tratado pelo console ou pela OpenAPI.
|
Categoria |
Exemplo de código de evento do ECS |
Exemplo de nome de evento do Cloud Monitor |
Descrição |
|
Eventos de O&M programados |
SystemMaintenance.Reboot |
Instance:SystemMaintenance.Reboot:Inquiring |
|
|
Eventos de O&M inesperados |
ErrorDetected |
Disk:ErrorDetected:Executing |
|
|
Eventos de alteração de ciclo de vida |
Snapshot:CreateSnapshotCompleted |
Snapshot:CreateSnapshotCompleted |
|
Eventos de O&M programados
Reiniciar uma instância pelo sistema operacional não aplica a ação de manutenção. Todas as operações de reinicialização neste tópico referem-se a reinicializações realizadas no console do ECS ou por meio de uma operação da OpenAPI. Consulte Reiniciar uma instância ou RebootInstance.
|
Código do evento |
Nome do evento |
Nível de gravidade do evento |
Nome do evento do CloudMonitor |
Descrição e impacto do evento |
Recomendações |
|
SystemMaintenance.Reboot |
Reinicialização da instância por manutenção do sistema |
Crítico |
|
A Alibaba Cloud detecta um risco potencial de falha no host que pode causar a reinicialização da instância. O risco ainda não se tornou uma falha real. Este evento é enviado de 24 a 48 horas antes da manutenção programada. null
Os riscos de falha incluem:
|
Opções de resposta:
null
|
|
SystemMaintenance.Stop |
Parada da instância por manutenção do sistema |
Crítico |
|
Enviado de 24 a 48 horas antes da manutenção programada quando a Alibaba Cloud detecta um risco potencial de falha no host que pode desligar a instância. O risco ainda não se tornou uma falha real. |
Opções de resposta:
null
Você pode modificar as propriedades de manutenção da instância para especificar a ação padrão para eventos de O&M. Consulte Modificar propriedades de manutenção da instância. |
|
SystemMaintenance.Redeploy |
Reimplantação da instância por manutenção do sistema |
Crítico |
|
Enviado de 24 a 48 horas antes da manutenção programada quando a Alibaba Cloud detecta um risco potencial de falha no host que pode exigir a reimplantação da instância. O risco ainda não se tornou uma falha real. null
Para uma instância que usa SSDs locais ou HDDs locais, os discos de dados são reinicializados e os dados nos discos locais são apagados. |
Faça backup dos dados e modifique /etc/fstab. Em seguida, responda conforme necessário:
null
|
|
SystemMaintenance.IsolateErrorDisk |
Isolamento de disco danificado por manutenção do sistema |
Crítico |
|
Enviado imediatamente quando a Alibaba Cloud detecta dano de software ou hardware em um disco local de uma instância do ECS. null
O procedimento para lidar com um disco local danificado varia conforme o tipo de instância. Para alguns tipos de instância, a instância precisa ser reiniciada para isolar o disco danificado. Para outros tipos de instância, o disco danificado pode ser isolado e reparado online. |
Faça backup dos dados e modifique /etc/fstab. Em seguida, autorize o isolamento do disco em um horário apropriado. O disco é isolado online sem reiniciar a instância. null
|
|
SystemMaintenance.ReInitErrorDisk |
Reinicialização de disco danificado por manutenção do sistema |
Crítico |
|
Enviado imediatamente após a Alibaba Cloud detectar dano de software ou hardware em um disco local e substituí-lo. Isso geralmente ocorre dentro de cinco dias úteis após você autorizar o isolamento do disco. null
O procedimento para lidar com um disco local danificado varia conforme o tipo de instância. Para alguns tipos de instância, a instância precisa ser reiniciada para isolar o disco danificado. Para outros tipos de instância, o disco danificado pode ser isolado e reparado online. |
Autorize a restauração do disco em um horário apropriado. O disco é restaurado online sem reiniciar a instância. null
|
|
SystemMaintenance.RebootAndIsolateErrorDisk |
Reinicialização da instância e isolamento de disco danificado por manutenção do sistema |
Crítico |
|
Enviado imediatamente quando a Alibaba Cloud detecta dano de software ou hardware em um disco local e não consegue isolar o disco online. null
O procedimento para lidar com um disco local danificado varia conforme o tipo de instância. Para alguns tipos de instância, a instância precisa ser reiniciada para isolar o disco danificado. Para outros tipos de instância, o disco danificado pode ser isolado e reparado online. |
Autorize o isolamento do disco em um horário apropriado e reinicie a instância. O disco é isolado offline, exigindo uma reinicialização. null
|
|
SystemMaintenance.RebootAndReInitErrorDisk |
Reinicialização da instância e reinicialização de disco danificado por manutenção do sistema |
Crítico |
|
Enviado imediatamente quando a Alibaba Cloud detecta dano de software ou hardware em um disco local e não consegue restaurá-lo online. null
O procedimento para lidar com um disco local danificado varia conforme o tipo de instância. Para alguns tipos de instância, a instância precisa ser reiniciada para isolar o disco danificado. Para outros tipos de instância, o disco danificado pode ser isolado e reparado online. |
Autorize a restauração do disco em um horário apropriado e reinicie a instância. O disco é restaurado offline, exigindo uma reinicialização. null
|
|
SystemMaintenance.StopAndRepair |
Evento de reparo local para uma instância com discos locais |
Crítico |
|
Enviado de 48 a 168 horas antes da manutenção programada quando a Alibaba Cloud detecta um risco de falha de hardware no host. |
Autorize o reparo ou a reimplantação da instância com discos locais em um horário apropriado. |
|
SystemMaintenance.CleanReleasedDisks |
Evento de limpeza após falha de hot-plug de EBS |
Aviso |
|
Enviado quando a Alibaba Cloud detecta informações de configuração de discos em nuvem liberados (liberados devido a pagamentos em atraso) no sistema operacional de uma instância do ECS. |
Autorize a Alibaba Cloud a limpar as informações de configuração dos discos em nuvem liberados em um horário apropriado. null
A Alibaba Cloud desliga a instância no horário que você especificar, limpa os discos e, em seguida, inicia a instância novamente. |
Eventos de O&M inesperados
|
Código do evento |
Nome do evento |
Nível de gravidade do evento |
Nome do evento do Cloud Monitor |
Descrição e impacto do evento |
Sugestão de tratamento |
|
SystemFailure.Reboot |
Reinicialização da instância por erro de sistema |
Crítico |
|
Uma instância ECS foi reinicializada devido a uma falha inesperada de software ou hardware no host. Causas comuns:
|
Aguarde a reinicialização automática da instância e, em seguida, verifique se a instância e suas aplicações estão funcionando corretamente. Durante a reinicialização, o Alibaba Cloud migra a instância para um host íntegro. null
Você pode modificar as propriedades de manutenção da instância para especificar a ação padrão para eventos de O&M. Consulte Modificar propriedades de manutenção da instância. |
|
InstanceFailure.Reboot |
Reinicialização da instância necessária por erro do sistema operacional |
Crítico |
|
Enviado imediatamente quando o Alibaba Cloud detecta que uma instância ECS está inativa por um problema interno do SO, como erro de falta de memória (OOM), blue screen, congelamento, impressão contínua de log na porta serial ou kernel panic. |
Aguarde a reinicialização automática da instância e, em seguida, verifique se a instância e suas aplicações estão funcionando corretamente. Você pode ativar o serviço Kdump no sistema operacional para identificar a causa da falha e evitar que problemas semelhantes ocorram novamente. Para mais informações, consulte Ativar o serviço Kdump em uma instância Linux ou Ativar o recurso Kernel Memory Dump em uma instância Windows. |
|
SystemFailure.Stop |
Parada da instância por erro de sistema |
Crítico |
|
Enviado imediatamente quando o Alibaba Cloud detecta que uma instância ECS foi desligada por falha do host, como dano de hardware na CPU ou memória. |
Aguarde a parada da instância e, em seguida, inicie-a. Ao iniciar a instância, o Alibaba Cloud a migra para um host íntegro. null
Você pode modificar as propriedades de manutenção da instância para especificar a ação padrão para eventos de O&M. Consulte Modificar propriedades de manutenção da instância. |
|
SystemFailure.Redeploy |
Reimplantação da instância por erro de sistema |
Crítico |
|
Enviado imediatamente quando o Alibaba Cloud detecta que uma instância com discos locais precisa ser reimplantada por falha do host. null
Esse tipo de evento é compatível apenas com instâncias que dependem de hardware do host, como instâncias com discos locais conectados ou que suportam computação confidencial baseada em SGX. |
Faça backup dos dados e modifique o /etc/fstab. Em seguida, responda conforme necessário:
null
Você pode modificar as propriedades de manutenção da instância para especificar a ação padrão para eventos de O&M. Consulte Modificar propriedades de manutenção da instância. |
|
SystemFailure.Delete |
Cancelamento automático de cobrança por falha na criação da instância |
Crítico |
|
Enviado imediatamente quando um pedido de criação de instância é bem-sucedido, mas a instância não é criada. |
Aguarde o sistema liberar a instância. A instância normalmente é liberada em até cinco minutos após a falha na criação. null
Se você pagou pelo pedido, receberá um reembolso após a liberação da instância. Para aumentar a taxa de sucesso na criação de instâncias:
|
|
ErrorDetected |
Alerta de dano em disco local |
Crítico |
|
Enviado imediatamente quando o Alibaba Cloud detecta dano inesperado de software ou hardware em um disco local, impedindo leituras e gravações. |
Faça backup dos dados e modifique o /etc/fstab. Em seguida, isole e restaure o disco danificado no momento apropriado. As operações compatíveis variam de acordo com o tipo de instância:
null
|
|
Stalled |
Desempenho do disco gravemente afetado |
Crítico |
|
Enviado imediatamente quando o Alibaba Cloud detecta um I/O hang em um disco em nuvem conectado a uma instância ECS, afetando gravemente o desempenho do disco e impedindo leituras e gravações. |
Isole as operações de leitura/gravação no disco em nuvem na camada de aplicação, ou remova temporariamente a instância do SLB. |
Eventos de migração de instância por atualização de infraestrutura
|
Código do evento |
Nome do evento |
Nível de gravidade do evento |
Nome do evento do Cloud Monitor |
Descrição e impacto do evento |
Sugestão de tratamento |
|
SystemUpgrade.Migrate |
Migração de instância necessária por atualização de infraestrutura |
Crítico |
Undefined |
Quando o Alibaba Cloud atualiza a infraestrutura física, instâncias na região e zona afetadas podem precisar de migração. Este evento é enviado antecipadamente. |
Visualize os detalhes do evento no console do ECS e migre a instância conforme indicado. Consulte Migração de instância por atualização de infraestrutura. |
Eventos de restrição de desempenho de instância com intermitência
|
Código do evento |
Nome do evento |
Nível de gravidade do evento |
Nome do evento do Cloud Monitor |
Descrição e impacto do evento |
Sugestão de tratamento |
|
Instance:BurstablePerformanceRestricted |
O desempenho da instância com intermitência está restrito |
Aviso |
Instance:BurstablePerformanceRestricted: O desempenho da instância com intermitência está restrito |
Enviado imediatamente quando os créditos de CPU acumulados de uma instância com intermitência se esgotam. |
Opções de resposta:
Para personalizar o limite de notificação (por exemplo, alertar quando os créditos de CPU forem inferiores a 10 por 10 minutos consecutivos), defina uma regra de alerta baseada em limite no CloudMonitor. Consulte Monitorar instâncias com intermitência. |
Eventos de alteração de status
|
Código do evento |
Nome do evento |
Nível de gravidade do evento |
Nome do evento do Cloud Monitor |
Descrição e impacto do evento |
Sugestão de tratamento |
|
Instance:PreemptibleInstanceInterruption |
Notificação de interrupção de instância spot |
Aviso |
Instance:PreemptibleInstanceInterruption: Notificação de interrupção de instância spot |
Enviado 5 minutos antes de uma instância spot ser recuperada. |
Recomendações:
|
|
Instance:ModifyInstanceSpec.Reboot |
Reinicialização da instância necessária para que a alteração do tipo de instância entre em vigor |
Crítico |
|
Após uma alteração do tipo de instância, a instância precisa ser reiniciada para que a nova configuração entre em vigor. Se você não reiniciar dentro de sete dias, o sistema reiniciará a instância de forma forçada. |
Recomendações:
|
|
Instance:PerformanceModeChange |
Alternância de modo de desempenho de instância com intermitência |
Aviso |
Instance:PerformanceModeChange: Alternância de modo de desempenho de instância com intermitência |
Gerado quando uma instância com intermitência alterna entre o modo ilimitado e o modo padrão. |
Para acompanhar este evento, inscreva-se nas notificações de eventos de sistema no CloudMonitor. |
|
Instance:StateChange |
Notificação de alteração de status da instância |
Informação |
Instance:StateChange: Notificação de alteração de status da instância |
Gerado quando o status da instância muda, por exemplo, de Running para Stopping ou de Stopping para Stopped. |
Para acompanhar este evento, inscreva-se nas notificações de eventos de sistema no CloudMonitor. |
|
Instance:AutoReactivateCompleted |
Conclusão de reinicialização automática |
Informação |
Instance:AutoReactivateCompleted: Reativação automática concluída |
Gerado quando você paga a fatura em atraso e a instância reinicia automaticamente. |
Para acompanhar este evento, inscreva-se nas notificações de eventos de sistema no CloudMonitor. |
|
Instance:LiveMigrationAcrossDDH |
Migração dinâmica de instância entre hosts dedicados |
Informação |
Instance:LiveMigrationAcrossDDH: Migração dinâmica de instância entre hosts dedicados |
Gerado quando uma instância passa por migração dinâmica. |
Para acompanhar este evento, inscreva-se nas notificações de eventos de sistema no CloudMonitor. |
|
Disk:DiskOperationCompleted |
Operação de disco concluída |
Informação |
Disk:DiskOperationCompleted: Operação de disco concluída |
Gerado quando um disco de pagamento conforme o uso é anexado ou desanexado manualmente. |
Para acompanhar este evento, inscreva-se nas notificações de eventos de sistema no CloudMonitor. |
|
Disk:ConvertToPostpaidCompleted |
Disco convertido para pagamento conforme o uso |
Informação |
Disk:ConvertToPostpaidCompleted: Disco convertido para pagamento conforme o uso |
Gerado quando um disco de assinatura é convertido para pagamento conforme o uso. |
Para acompanhar este evento, inscreva-se nas notificações de eventos de sistema no CloudMonitor. |
|
Snapshot:CreateSnapshotCompleted |
Snapshot de disco criado |
Informação |
Snapshot:CreateSnapshotCompleted: Snapshot de disco criado |
Gerado quando um snapshot de disco é criado. |
Para acompanhar este evento, inscreva-se nas notificações de eventos de sistema no CloudMonitor. |
|
Snapshot:SnapshotDeleted |
Evento de exclusão de snapshot concluída |
Informação |
Snapshot:SnapshotDeleted: Evento de exclusão de snapshot concluída |
Gerado quando um snapshot manual ou automático é excluído. |
Nenhuma |
Eventos de risco de desempenho de instância
|
Código do evento |
Nome do evento |
Nível de gravidade do evento |
Nome do evento do Cloud Monitor |
Descrição e impacto do evento |
Sugestão de tratamento |
|
Instance:CPUPerformanceReachLimit |
O desempenho de CPU da instância atinge o limite máximo do tipo de instância |
Aviso |
Instance:CPUPerformanceReachLimit:Executed : O desempenho de CPU da instância atinge o limite máximo do tipo de instância |
O Alibaba Cloud detecta que a utilização de CPU da instância atingiu 100% ou o limite máximo do seu tipo de instância. null
O evento é enviado se o limite máximo de CPU definido para o tipo de instância for atingido duas vezes nos últimos três minutos. |
O uso sustentado de CPU no limite do tipo de instância pode afetar seus negócios. Ajuste sua configuração conforme necessário. Consulte Descobrir e solucionar problemas da instância. |
|
Instance:StoragePerformanceReachLimit |
O desempenho de armazenamento da instância atinge o limite máximo do tipo de instância |
Aviso |
Instance:StoragePerformanceReachLimit:Executed : O desempenho de armazenamento da instância atinge o limite máximo do tipo de instância |
O Alibaba Cloud detecta que a largura de banda do disco ou IOPS da instância atingiu o limite máximo do seu tipo de instância. Exemplos:
null
Este evento não é compatível com instâncias ECS de gerações anteriores à Geração 6. O evento é enviado se o limite máximo de desempenho de armazenamento definido para o tipo de instância for atingido duas vezes nos últimos três minutos. |
O uso sustentado de desempenho de armazenamento no limite do tipo de instância pode afetar seus negócios. Ajuste sua configuração conforme necessário. Consulte Descobrir e solucionar problemas da instância. |
|
Instance:NetworkPerformanceReachLimit |
O desempenho de rede da instância atinge o limite máximo do tipo de instância |
Aviso |
Instance:NetworkPerformanceReachLimit:Executed : O desempenho de rede da instância atinge o limite máximo do tipo de instância |
O Alibaba Cloud detecta que o desempenho de rede da instância atingiu o limite máximo do seu tipo de instância. Exemplos:
null
O evento é enviado se o limite máximo de desempenho de rede definido para o tipo de instância for atingido duas vezes nos últimos três minutos. |
O uso sustentado de desempenho de rede no limite do tipo de instância pode afetar seus negócios. Ajuste sua configuração conforme necessário. Consulte Descobrir e solucionar problemas da instância. |
|
Instance:StatusCheckFailed |
Falha na verificação de status da instância |
Aviso |
|
O Alibaba Cloud detecta uma exceção de conectividade na instância. Exemplos:
|
Exceção de conectividade detectada. Solucione o problema imediatamente. Consulte Diagnosticar conectividade de rede. |