Os eventos de sistema do RDS Custom são definidos pela Alibaba Cloud para registrar e notificar informações sobre recursos em nuvem, como status de execução de tarefas de O&M, exceções de recursos e alterações de status. Por meio desses eventos, você obtém dados sobre riscos e exceções nos recursos do RDS Custom, incluindo expiração de instância, migração devido a atualizações subjacentes ou reinicialização por manutenção do sistema. Assim, é possível responder e tratar os eventos de sistema prontamente, evitando impactos nos negócios causados pela redução de disponibilidade ou desempenho dos recursos do RDS Custom.
expiração de instância,
Casos de uso
-
Notificação de riscos e exceções
A Alibaba Cloud exibe eventos de sistema (como reinicializações por manutenção, expiração de instância e outros eventos que podem afetar a disponibilidade e o desempenho dos recursos) no console do RDS Custom. Alguns eventos importantes também são enviados por e-mail e mensagens internas. Você pode responder a esses eventos no console do RDS Custom ou via OpenAPI. Recomendamos que você responda prontamente aos eventos de sistema para evitar impactos nos negócios.
Por exemplo, quando uma instância por assinatura está prestes a parar devido à expiração, o console do RDS Custom exibe um lembrete destacado para que você renove a instância, evitando assim o impacto nos negócios causado pela paralisação.
-
O&M automatizado
Os eventos de sistema exibidos no console do RDS Custom possuem estados definidos, o que facilita a distinção do status de execução das tarefas de O&M correspondentes. As alterações de status desses eventos são sincronizadas com o CloudMonitor, ajudando você a criar um mecanismo de O&M automatizado. Para mais informações sobre os estados dos eventos, consulte Estados de eventos de sistema do RDS Custom.
NotaCada estado de evento corresponde a um nome de evento no CloudMonitor. Por exemplo, o código de evento do RDS Custom InstanceFailure.Reboot suporta os estados Executing e Executed, que correspondem aos nomes de evento do CloudMonitor Instance:InstanceFailure.Reboot:Executing e Instance:InstanceFailure.Reboot:Executed.
Os eventos de alteração de status incluem alguns eventos de sistema não exibidos no console do RDS Custom, como mudanças no status de execução da instância e interrupções de instâncias preemptíveis. Não é possível responder diretamente a esses eventos no console do RDS Custom ou via OpenAPI. O RDS Custom não define estados para eles, mas, quando ocorrem, ainda são reportados ao CloudMonitor, permitindo que você crie um sistema de O&M automatizado orientado a eventos conforme suas necessidades.
Por exemplo, eventos de alteração de status são acionados quando você inicia ou para instâncias ECS. Esses eventos não indicam riscos ou exceções. Caso deseje registrar suas operações no sistema, configure notificações de eventos para essas alterações e utilize o recurso de callback de alerta para gravar as informações de início e parada das instâncias nos logs de operação.
Tipos de eventos de sistema
Os eventos de sistema podem ser classificados nas seguintes categorias com base em suas causas.
Categoria | Descrição | Exibido na Central de Eventos do RDS Custom |
Eventos de O&M agendados | A Alibaba Cloud pode precisar atualizar o software do host por motivos de segurança ou para prever e tratar riscos de falha no hardware e software subjacentes. Se a execução das tarefas de O&M correspondentes puder afetar a disponibilidade dos recursos do RDS Custom ou causar degradação de desempenho, a Alibaba Cloud informará antecipadamente sobre o horário de execução, objetos afetados, impactos e outras informações. Você pode responder a esses eventos durante o período agendado, optando por tratá-los em horários de baixa atividade empresarial para evitar impactos nos períodos de pico. Nota Os eventos de O&M agendados, também conhecidos como eventos de O&M proativo, baseiam-se na experiência de O&M da Alibaba Cloud em milhões de servidores, na capacidade de atender dezenas de milhares de grandes clientes empresariais e nos algoritmos avançados de aprendizado de máquina da Alibaba DAMO Academy para prever e tratar riscos de falha no hardware ou software subjacente. Quando os riscos de falha do host não podem ser evitados, a Alibaba Cloud notifica os usuários afetados do RDS Custom antecipadamente por meio de eventos de O&M agendados, fornecendo um tempo de buffer para a troca de negócios. Se os usuários não responderem antecipadamente aos eventos de O&M agendados, quando ocorrerem riscos de falha, as instâncias do RDS Custom poderão ficar indisponíveis ou reiniciar. | Sim |
Eventos de O&M inesperados | Esta categoria de eventos de sistema é acionada quando instâncias ECS reiniciam ou ficam indisponíveis devido a problemas inesperados, como kernel panic, erros de falta de memória ou falhas de hardware ou software nos hosts subjacentes. A Alibaba Cloud envia eventos de O&M inesperados prontamente, restaura a disponibilidade dos recursos do RDS Custom o mais rápido possível e notifica você sobre o status de execução das tarefas de O&M correspondentes. Nota Eventos de O&M inesperados geralmente referem-se a situações em que instâncias do RDS Custom tornam-se subitamente indisponíveis ou reiniciam devido a falhas imprevisíveis no host subjacente ou problemas como erros de kernel no sistema operacional da instância.
| Sim |
Gravidades de eventos de sistema
Os eventos de sistema recebem as seguintes gravidades com base em seus impactos na operação normal das instâncias:
Crítico: Eventos críticos podem resultar na indisponibilidade da instância e devem ser tratados o mais rápido possível. Por exemplo, um evento crítico é acionado quando recursos são liberados devido a pagamento atrasado ou quando uma instância é reimplantada devido a um erro.
Aviso: Eventos de aviso impactam seus negócios. Por exemplo, esse tipo de evento ocorre quando uma instância escalável não consegue ultrapassar sua linha de base de desempenho. Preste muita atenção a esses eventos ou trate-os no momento apropriado.
Informação: A decisão de monitorar estes eventos é opcional. Um exemplo comum é a criação de um snapshot de disco.
Estados e janelas de eventos de sistema
Os eventos de sistema exibidos no console definem estados conforme descrito na tabela a seguir.
|
Estado |
Propriedade |
Descrição |
|
Inquiring |
Transitório |
O sistema está consultando e aguardando sua autorização. Após a autorização, o evento entra no estado Executing. |
|
Scheduled |
Transitório |
A tarefa de O&M está agendada para execução, mas ainda não começou. Quando a execução iniciar, o evento entrará no estado Executing. |
|
Executing |
Transitório |
A tarefa de O&M relacionada ao evento de sistema está sendo executada. |
|
Executed |
Estável |
A tarefa de O&M relacionada ao evento de sistema foi concluída. |
|
Avoided |
Estável |
Os impactos do evento de sistema foram prevenidos porque você migrou a instância afetada dentro da janela de operação do usuário. |
|
Failed |
Estável |
A tarefa de O&M relacionada ao evento de sistema falhou. |
|
Canceled |
Estável |
A tarefa de O&M relacionada ao evento de sistema foi cancelada automaticamente. |
A figura a seguir mostra as transições típicas entre os estados dos eventos.
Os eventos de sistema incluem as seguintes janelas.
-
Janela de operação do usuário
A janela de operação do usuário de um evento de sistema começa quando o evento é enviado e termina no momento em que a tarefa de O&M relacionada é executada conforme agendado. Você pode tratar o evento manualmente dentro dessa janela ou aguardar o tratamento automático pelo sistema. Observe os seguintes pontos sobre a duração das janelas de operação do usuário:
-
Na maioria dos casos, a janela de operação do usuário para um evento de O&M agendado varia de 24 a 48 horas.
NotaA duração das janelas de operação do usuário é ilimitada para eventos de sistema no estado Inquiring. As tarefas de O&M relacionadas só podem começar após você autorizar a execução.
Geralmente, eventos de sistema de O&M inesperados causados por falhas ou operações não autorizadas não possuem janela de operação do usuário.
Para eventos indicando que instâncias por assinatura estão prestes a expirar, a janela é de 3 dias.
Nos eventos que sinalizam a iminente paralisação de instâncias pay-as-you-go por pagamentos em atraso, a janela dura menos de 1 hora.
-
-
Janela de execução do evento
A janela de execução de um evento de sistema começa quando a tarefa de O&M relacionada é iniciada e termina quando a tarefa é concluída. Considere os seguintes pontos sobre a duração das janelas de execução:
Em eventos como recuperação de falhas, a janela é de até 10 minutos.
Eventos de O&M inesperados decorrentes de falhas ou operações não autorizadas apresentam uma janela de execução curta.
Operações
Operação | Descrição e referência |
Compreender eventos de sistema | Para aprender sobre eventos de sistema e entender os nomes, gravidades, cenários de uso, limites, estados e formatos de nome, consulte este tópico. |
Visualize eventos de sistema |
|
Tratar eventos de sistema | Para alguns eventos importantes (como aqueles que afetam a disponibilidade dos recursos do RDS Custom ou causam degradação de desempenho), recomendamos que você responda prontamente através do console ou OpenAPI e os trate de acordo com as recomendações para evitar impactos nas operações comerciais. |
Monitorar eventos de sistema | Para garantir a estabilidade das operações comerciais nas instâncias do RDS Custom e implementar O&M automatizado, recomendamos configurar notificações de eventos para monitorar alterações no ambiente subjacente. Após configurar as notificações, o sistema utiliza os métodos especificados para enviar alertas a você. Para configurar regras de alerta através do CloudMonitor e receber notificações de eventos, consulte Usar o CloudMonitor para assinar notificações de eventos do RDS Custom. |