A central de eventos do Network Intelligence Service (NIS) envia alertas proativos para identificar riscos, visualizar recursos potencialmente afetados e evitar interrupções nos negócios.
Casos de uso
Os eventos do NIS registram e notificam sobre recursos de rede em nuvem, incluindo execução de tarefas de O&M, problemas com recursos e alterações de status.
-
Notificações de riscos e problemas
Quando um evento compromete a disponibilidade ou o desempenho de uma instância — como degradação de desempenho por uso além das especificações, indisponibilidade de serviço devido à perda de pacotes no link do ISP ou alerta de instância prestes a expirar — a Alibaba Cloud envia o evento para a central de eventos no console do NIS. Responda prontamente para evitar interrupções nos negócios.
-
O&M automatizado
Cada evento no console do NIS possui um status definido para rastrear tarefas relacionadas de O&M do sistema. Quando um evento é gerado ou seu status muda, o sistema o reporta ao CloudMonitor, permitindo criar um sistema de O&M automatizado orientado a eventos.
Limitações
O NIS não oferece suporte ao recurso de eventos para famílias de instâncias indisponíveis para compra. Para obter mais informações, consulte os anúncios de fim de venda de cada serviço em nuvem.
Conceitos básicos
Tipos de evento
Os eventos registram informações sobre recursos de rede em nuvem e são categorizados por causa da seguinte forma:
|
Categoria |
Descrição |
Exemplo |
|
Evento de problema |
Evento excepcional que já causou impacto nos negócios e permanece no estado In Progress há sete dias. |
|
|
Evento de risco |
Evento excepcional que pode causar impacto nos negócios e permanece no estado In Progress há sete dias. |
|
Níveis de evento
Os eventos classificam-se nos seguintes níveis conforme o impacto nas operações da instância:
Critical: Impacto significativo que exige ação imediata para evitar indisponibilidade da instância.
Warn: Impacto moderado. Monitore o evento enquanto persistir ou trate-o no momento apropriado.
Info: Nenhuma ação imediata necessária.
Para obter mais informações sobre códigos, nomes, descrições e ações recomendadas para eventos, consulte Resumo de eventos.
Resumo de eventos
As tabelas a seguir listam os eventos compatíveis com o NIS e as ações recomendadas para cada um.
Eventos de problema não oferecem suporte a monitoramento para instâncias CLB de recursos compartilhados.
Eventos de problema
|
Código do evento |
Nome do evento |
Nível do evento |
Nome do evento no CloudMonitor |
Nome da métrica no CloudMonitor |
Descrição e impacto |
Regras de alerta |
Ação recomendada |
|
Instância voltada para a Internet |
|||||||
|
problem-internetBandwidthOverlimit |
Perda de pacotes devido ao excesso de uso de largura de banda |
Critical |
Perda de pacotes devido ao excesso de uso de largura de banda da instância |
|
O uso de largura de banda de uma instância voltada para a Internet excedeu sua especificação, causando perda de pacotes. Instâncias voltadas para a Internet incluem instâncias de elastic IP address (EIP), planos de largura de banda e instâncias de Classic Load Balancer (CLB). |
Critical: O uso de largura de banda excede frequentemente o limite nos últimos 10 minutos, causando perda de pacotes. |
Atualize a instância para aumentar a largura de banda de pico. |
|
Gateway NAT |
|||||||
|
problem-nat-sessionOverLimit |
Queda de conexão causada por excesso de sessões NAT |
Critical |
Queda de conexão causada por excesso de sessões NAT |
|
A contagem de sessões no gateway NAT excede sua especificação, fazendo novas sessões falharem com taxa de perda de pacotes acima de 100 pacotes/s. |
Critical: O número de sessões simultâneas excede frequentemente o limite nos últimos 10 minutos e a taxa de perda de pacotes supera 100 pacotes/s. |
Atualize a especificação ou use várias instâncias de gateway NAT. Para obter mais informações, consulte Gerenciar cotas do NAT Gateway, Gateway NAT da Internet e Criar e gerenciar uma instância de VPC NAT Gateway. |
|
problem-nat-sessionNewOverLimit |
Queda de conexão causada por excesso de novas sessões NAT |
Critical |
Queda de conexão causada por excesso de novas sessões NAT |
|
A taxa de novas sessões no gateway NAT excede sua especificação, fazendo novas sessões falharem com taxa de perda de pacotes acima de 100 pacotes/s. |
Critical: O número de novas sessões excede frequentemente o limite nos últimos 10 minutos e a taxa de perda de pacotes supera 100 pacotes/s. |
|
|
problem-nat-portAllocationError |
Falha na alocação de portas de origem SNAT |
Critical |
Falha na alocação de portas de origem SNAT |
|
Poucos EIPs ou endereços IP configurados para o gateway NAT causam falha na alocação de porta de origem com taxa de perda de pacotes acima de 10 pacotes/s. Nota
Não é possível criar uma assinatura para este evento. |
Critical: A alocação de porta de origem falha frequentemente nos últimos 10 minutos e a taxa de perda de pacotes supera 10 pacotes/s. |
Adicione mais EIPs ou endereços IP associados à instância do gateway NAT. Para obter mais informações, consulte Criar e gerenciar uma instância de VPC NAT Gateway. |
|
problem-nat-datapathUnavailable |
Caminho de dados do gateway NAT indisponível |
Critical |
Caminho de dados do gateway NAT indisponível |
Não aplicável (evento de disponibilidade do sistema) |
O caminho de dados do gateway NAT está indisponível. A disponibilidade foi de 0% nos últimos 10 minutos, afetando todo o tráfego. Isso pode decorrer de um evento no nível da plataforma. Os engenheiros da Alibaba Cloud trabalham para resolver o problema. |
Critical: A disponibilidade do gateway NAT foi de 0% nos últimos 10 minutos. |
Se você implantou vários gateways NAT para alta disponibilidade, alterne para outro gateway NAT. Para obter mais informações, consulte Implantar vários gateways NAT para implementar alta disponibilidade. Caso contrário, entre em contato com os engenheiros da Alibaba Cloud para obter o progresso mais recente da recuperação. |
|
problem-nat-datapathDegraded |
Caminho de dados do gateway NAT degradado |
Critical |
Caminho de dados do gateway NAT degradado |
Não aplicável (evento de disponibilidade do sistema) |
O caminho de dados do gateway NAT está degradado. A disponibilidade ficou abaixo de 80% nos últimos 10 minutos, afetando mais de 20% do tráfego. Isso pode decorrer de um evento no nível da plataforma causando descarte de pacotes. Os engenheiros da Alibaba Cloud trabalham para resolver o problema. |
Critical: A disponibilidade do gateway NAT foi inferior a 80% nos últimos 10 minutos, causando perda de pacotes. |
|
|
Classic Load Balancer (CLB) |
|||||||
|
problem-clb-connectionOverLimit |
Novas conexões descartadas devido ao excesso de sessões CLB |
Critical |
Novas conexões descartadas devido ao excesso de sessões CLB |
|
A contagem de conexões novas ou simultâneas em uma instância CLB excede sua especificação, causando falha em novas sessões com alta taxa de conexões descartadas. |
Critical: O número de sessões simultâneas excede frequentemente o limite nos últimos 10 minutos, causando perda de pacotes. |
Atualize a instância ou alterne para uma instância de Network Load Balancer (NLB) ou Application Load Balancer (ALB). Para obter mais informações, consulte Gerenciar cotas do CLB. Para detalhes sobre os produtos NLB e ALB, consulte O que é Network Load Balancer (NLB)? e O que é Application Load Balancer (ALB)?. |
|
problem-clb-bandwidthOverLimit |
Perda de pacotes devido ao excesso de uso de largura de banda do CLB |
Critical |
Perda de pacotes devido ao excesso de uso de largura de banda do CLB |
|
O tráfego de uma instância CLB excede sua especificação de largura de banda, causando perda de pacotes. |
Critical: O uso de largura de banda excede frequentemente a especificação nos últimos 10 minutos e a taxa de descarte supera 100 bps. |
Atualize a especificação da instância. Para obter mais informações, consulte Ajustar as especificações de instâncias com desempenho garantido. |
|
problem-clb-connectionFail |
Aumento abrupto em conexões CLB com falha |
Critical |
Aumento abrupto em conexões CLB com falha |
Não suportado pelo CloudMonitor |
A contagem de conexões com falha na instância CLB aumentou abruptamente. As possíveis causas incluem especificação do servidor backend excedida, alta carga ou exceção de serviço. |
Critical: O número de novas conexões com falha para a instância CLB aumentou abruptamente nos últimos 10 minutos. Um alerta é acionado se todas as condições a seguir forem atendidas: Condição 1: O número de conexões com falha supera 100/s. Condição 2: O número de conexões com falha aumenta 30% em comparação com a janela anterior de 10 minutos. Condição 3: Com base em uma linha de base inteligente aprendida a partir de dados históricos, o número de conexões com falha excede continuamente o limite superior da linha de base em mais de 30% dentro de um período de 10 minutos. |
Dependendo da causa, atualize a especificação do servidor backend, atualize a especificação do CLB ou verifique o status do serviço backend. Para obter mais informações, consulte Gerenciar cotas do CLB. |
|
NLB |
|||||||
|
problem-nlb-connectionFail |
Aumento abrupto em conexões NLB com falha |
Critical |
Aumento abrupto em conexões NLB com falha |
Não suportado pelo CloudMonitor |
A contagem de conexões com falha em um endereço IP virtual (VIP) da instância NLB aumentou abruptamente por 10 minutos consecutivos. Possíveis causas:
|
Critical: Um alerta é acionado se o número de conexões com falha na instância NLB atender a todas as condições a seguir: Condição 1: Dentro de uma janela de monitoramento de 610 segundos, o número de conexões com falha excede a linha de base de previsão inteligente em mais de 100% por 3 minutos consecutivos. Condição 2: Dentro de uma janela de monitoramento de 610 segundos, o número de conexões com falha aumenta 50% ou mais em comparação com a hora anterior por 7 minutos consecutivos. Condição 3: Dentro de uma janela de monitoramento de 610 segundos, o número de conexões com falha é igual ou superior a 1.000 por 8 minutos consecutivos. |
Verifique se os recursos do servidor backend ou o status do serviço estão normais. |
|
problem-nlb-newConnectionSurge |
Novas conexões NLB descartadas |
Critical |
Novas conexões NLB descartadas |
|
Devido a um aumento repentino de novas conexões, o VIP da instância NLB descarta continuamente solicitações de nova conexão em intervalos de milissegundos ou segundos. |
Critical: Um alerta é acionado se o número de conexões na instância NLB atender a todas as condições a seguir: Condição 1: Em 10 minutos, há mais de 8 pontos de dados onde o número de conexões descartadas pelo VIP por segundo supera 0. Condição 2: Em 10 minutos, há mais de 8 pontos de dados onde o número de novas conexões estabelecidas pelo VIP por segundo é inferior a 200.000. |
Distribua o tráfego entre várias instâncias NLB ou entre em contato com seu gerente de conta para solicitar um aumento de cota. |
|
problem-nlb-newConnectionOverLimit |
Excesso de novas conexões NLB |
Critical |
Excesso de novas conexões NLB |
|
A contagem de novas conexões no VIP da instância NLB excedeu o limite de dimensionamento automático para um único VIP, causando o descarte contínuo de solicitações de nova conexão. |
Critical: Um alerta é acionado se o número de conexões na instância NLB atender a todas as condições a seguir: Condição 1: Em 10 minutos, há mais de 8 pontos de dados onde o número de conexões descartadas pelo VIP por segundo supera 0. Condição 2: Em 10 minutos, há mais de 8 pontos de dados onde o número de novas conexões estabelecidas pelo VIP por segundo é igual ou superior a 200.000. |
|
|
problem-nlb-concurrentConnectionOverLimit |
Excesso de conexões simultâneas NLB |
Critical |
Excesso de conexões simultâneas NLB |
|
A contagem de conexões simultâneas no VIP da instância NLB excedeu o limite de dimensionamento automático para um único VIP, causando o descarte contínuo de solicitações de nova conexão. |
Critical: Um alerta é acionado se o número de conexões na instância NLB atender a todas as condições a seguir: Condição 1: Em 10 minutos, há mais de 8 pontos de dados onde o número de conexões descartadas pelo VIP por segundo supera 0. Condição 2: Em 10 minutos, há mais de 8 pontos de dados onde o número máximo de conexões simultâneas no VIP supera 5.000.000. |
|
|
ALB |
|||||||
|
problem-alb-intranetBandwidthOverLimit |
Perda de pacotes devido ao excesso de uso de largura de banda privada de instâncias ALB |
Critical |
Perda de pacotes devido ao excesso de uso de largura de banda privada de instâncias ALB |
Não suportado pelo CloudMonitor |
A largura de banda de saída ou entrada no VIP da instância ALB atingiu seu limite. Cada VIP resolvido a partir de um nome de domínio ALB possui um limite de largura de banda. |
Critical: Em 10 minutos, há mais de 8 pontos de dados onde o tráfego descartado pela instância ALB supera 100 bps. |
Adicione um registro CNAME para a instância ALB. Para obter mais informações, consulte Adicionar um registro CNAME para uma instância ALB. |
|
problem-alb-sessionOverLimit |
Novas conexões descartadas devido ao excesso de sessões ALB |
Critical |
Novas conexões descartadas devido ao excesso de sessões ALB |
|
A contagem de conexões novas ou simultâneas no VIP da instância ALB excede o limite, causando falha em novas sessões. Cada VIP resolvido a partir de um nome de domínio ALB possui um limite de novas conexões. |
Critical: Em 10 minutos, há mais de 8 pontos de dados onde o número de conexões descartadas pela instância ALB por segundo supera 0. |
|
|
problem-alb-qpsOverLimit |
Código de erro 503 retornado porque o QPS excede o limite |
Critical |
Código de erro 503 retornado porque o QPS excede o limite |
Não suportado pelo CloudMonitor |
O queries per second (QPS) no VIP da instância ALB atingiu o limite do VIP. Cada VIP resolvido a partir de um nome de domínio ALB possui um limite de QPS. |
Critical: Em 10 minutos, há mais de 8 pontos de dados onde o número de solicitações descartadas por segundo supera 200 qps e, por 10 minutos consecutivos, o número de solicitações descartadas por segundo aumenta 30% ou mais em comparação com 7 minutos antes. |
|
|
Cloud Enterprise Network (CEN) |
|||||||
|
problem-cen-routeOverLimit |
Excesso de rotas CEN |
Critical |
Excesso de rotas CEN |
Não aplicável (métrica baseada em evento) |
A cota de rotas do CEN foi excedida, podendo causar problemas de rede. |
Critical: A cota de rotas do CEN foi excedida, causando problemas de rede. |
Atualize o Transit Router (TR). Para obter mais informações, consulte Atualizar um transit router básico para um transit router empresarial. |
|
TR |
|||||||
|
problem-cen-vpcAttachBandwidthOverLimit |
Perda de pacotes devido ao excesso de largura de banda da conexão VPC |
Critical |
Perda de pacotes devido ao excesso de largura de banda da conexão VPC |
Não suportado pelo CloudMonitor |
O tráfego de um transit router do CEN excede a especificação de largura de banda, causando perda de pacotes. |
Critical: Em 10 minutos, há mais de 5 pontos de dados onde a taxa de perda de pacotes de entrada supera 0. |
Aumente o limite de largura de banda. Para obter mais informações, consulte Gerenciar cotas do CEN. |
|
problem-cen-peerAttachBandwidthOverLimit |
Perda de pacotes devido ao excesso de largura de banda da conexão inter-regional |
Critical |
Perda de pacotes devido ao excesso de largura de banda da conexão inter-regional |
|
O tráfego de um transit router do CEN excede a especificação de largura de banda, causando perda de pacotes. |
Critical: Um alerta é acionado se o tráfego real da instância TR atender a todas as condições a seguir: Condição 1: Em 10 minutos, há mais de 8 pontos de dados onde a utilização de pico de largura de banda de saída é igual ou superior a 90%. Condição 2: Em 10 minutos, há mais de 8 pontos de dados onde a taxa de descarte de pacotes por limitação de taxa de saída supera 100 pps. |
Aumente o limite de largura de banda. Para obter mais informações, consulte Gerenciar cotas do CEN. |
Eventos de risco
|
Código do evento |
Nome do evento |
Nível do evento |
Nome do evento no CloudMonitor |
Nome da métrica no CloudMonitor |
Descrição e impacto |
Regras de alerta |
Ação recomendada |
|
Instância voltada para a Internet |
|||||||
|
risk-internetPacketLoss |
Risco de perda de pacotes no link da Internet |
Warn |
Risco de perda de pacotes no link da Internet |
Não aplicável (evento de sondagem de link da Internet) |
A sondagem detectou perda de pacotes no link físico da Alibaba Cloud {Region} para {Country} - {Area} - {ISP}. O tráfego neste link em sua conta pode sofrer instabilidade. |
Critical: Um alerta é acionado se qualquer uma das condições a seguir for atendida: Condição 1: A taxa de perda de pacotes detectada de um link de ISP de nível regional supera 50%. Condição 2: Perda de pacotes é detectada em um link de ISP de nível nacional e a largura de banda média do tráfego neste link em sua conta é igual ou superior a 0,05 Mbps nos últimos 10 minutos. Nota
Warn: A taxa de perda de pacotes do link da Internet é inferior a 50% e a largura de banda média supera 0,5 Mbps nos últimos 10 minutos. |
Verifique se a largura de banda da instância neste link atende aos seus requisitos de negócios (consulte os dados de 5 tuplas na análise de tráfego). Se houver um problema, considere migrar serviços críticos para outra região. Caso contrário, ignore este alerta. |
|
risk-internetBandwidthOverlimit |
Risco de perda de pacotes devido ao excesso de uso de largura de banda |
Warn |
Risco de perda de pacotes devido ao excesso de uso de largura de banda |
|
Dados históricos indicam probabilidade >90% de o uso de largura de banda da instância exceder sua especificação. |
Warn: Há probabilidade superior a 90% de o tráfego exceder a especificação em determinado momento, causando perda de pacotes. |
Monitore o uso. Se a especificação for excedida, considere atualizar a especificação da instância. |
|
VPN Gateway |
|||||||
|
risk-vpn-bpsOverLimit |
Risco de excesso de uso de largura de banda VPN |
Warn |
Risco de excesso de uso de largura de banda VPN |
|
A utilização de largura de banda da instância VPN excedeu 90% três vezes nos últimos 10 minutos. |
Warn: Em 10 minutos, há mais de 3 pontos de dados onde a utilização de largura de banda supera 90%. |
|
|
risk-vpn-bgpRouteLimit |
Risco de excesso de rotas BGP |
Warn |
Risco de excesso de rotas BGP |
Não suportado pelo CloudMonitor |
A contagem de rotas dinâmicas BGP aprendidas pela instância VPN excedeu 90% de sua cota de rotas BGP nos últimos 10 minutos. |
Warn: Em 10 minutos, há mais de 1 ponto de dados onde a utilização de rotas supera 90%. |
Monitore o uso de rotas BGP. Se a cota estiver quase cheia, considere a agregação de rotas no VPN Gateway par com base no seu plano de rede. |
|
Express Connect |
|||||||
|
risk-ec-physicalConnectionFail |
Falha no circuito ou porta do Express Connect |
Warn |
Falha no circuito ou porta do Express Connect |
Não aplicável (evento de status de link) |
Uma falha no circuito físico do Express Connect do ISP ou uma falha na porta do dispositivo causou interrupção de serviço. |
Warn: A taxa de tráfego de entrada (do data center para a VPC) da instância VBR é monitorada com granularidade de minuto. Um alerta é acionado se todas as condições a seguir forem atendidas: Condição 1: 3 ≤ número de eventos de porta do Express Connect inativa < 20. Condição 2: A porta do Express Connect fica inativa por mais de 2 pontos de dados consecutivos. Condição 3: Nem todas as portas do Express Connect estão em estado inativo. |
Entre em contato com seu gerente de negócios para obter assistência. |
|
risk-ec-bgpRouterFail |
Falha na conexão BGP |
Warn |
Falha na conexão BGP |
Não aplicável (evento de status de conexão BGP) |
Uma falha de conectividade de rede no circuito físico do Express Connect ou uma configuração BGP anormal causou falha na conexão BGP e perda de rota. |
Warn: Um alerta é acionado se o status da conexão BGP mudar de Connected para qualquer outro estado. |
Entre em contato com seu gerente de negócios para obter assistência. |
|
risk-ec-inTrafficDroppedToZero |
Queda abrupta no tráfego de entrada do VBR |
Warn |
Queda abrupta no tráfego de entrada do VBR |
|
Uma falha no circuito físico do Express Connect do ISP ou uma falha na porta do dispositivo causou queda abrupta no tráfego de entrada do roteador de borda virtual (VBR). |
Warn: A taxa de tráfego de entrada (do data center para a VPC) da instância VBR é monitorada com granularidade de minuto. Um alerta é acionado se todas as condições a seguir forem atendidas: Condição 1: Por 3 minutos consecutivos, a taxa por minuto cai ≥ 99% em comparação com a taxa média dos 7 minutos anteriores. Condição 2: Por 3 minutos consecutivos, o valor absoluto da queda da taxa por minuto é ≥ 1 Mbps em comparação com a taxa média dos 7 minutos anteriores. Condição 3: Por 3 minutos consecutivos, o valor absoluto da queda da taxa por minuto é ≥ 0,5 Mbps em comparação com as taxas médias dos 15, 30 e 60 minutos anteriores. Condição 4 (Alerta de linha de base inteligente): Uma linha de base inteligente aprende os padrões históricos da taxa de tráfego de entrada da instância VBR para prever uma faixa estável para o próximo ciclo. Se a taxa cair abaixo do limite inferior previsto em ≥ 99% por 2 minutos consecutivos dentro de um período de 3 minutos quando o ciclo começar, isso é considerado uma queda anormal. |
Verifique se este é um comportamento normal de tráfego de negócios ou se ocorreu um failover de verificação de integridade. Se seus negócios forem impactados, entre em contato com seu gerente de negócios para obter assistência. |
|
risk-ec-outTrafficDroppedToZero |
Queda abrupta no tráfego de saída do VBR |
Warn |
Queda abrupta no tráfego de saída do VBR |
|
Uma falha no circuito físico do Express Connect do ISP ou uma falha na porta do dispositivo causou queda abrupta no tráfego de saída do VBR. |
Warn: A taxa de tráfego de saída (da VPC para o data center) da instância VBR é monitorada com granularidade de minuto. Um alerta é acionado se todas as condições a seguir forem atendidas: Condição 1: Por 3 minutos consecutivos, a taxa por minuto cai ≥ 99% em comparação com a taxa média dos 7 minutos anteriores. Condição 2: Por 3 minutos consecutivos, o valor absoluto da queda da taxa por minuto é ≥ 1 Mbps em comparação com a taxa média dos 7 minutos anteriores. Condição 3: Por 3 minutos consecutivos, o valor absoluto da queda da taxa por minuto é ≥ 0,5 Mbps em comparação com as taxas médias dos 15, 30 e 60 minutos anteriores. Condição 4 (Alerta de linha de base inteligente): Uma linha de base inteligente aprende os padrões históricos da taxa de tráfego de saída da instância VBR para prever uma faixa estável para o próximo ciclo. Se a taxa cair abaixo do limite inferior previsto em ≥ 99% por 2 minutos consecutivos dentro de um período de 3 minutos quando o ciclo começar, isso é considerado uma queda anormal. |
Verifique se este é um comportamento normal de tráfego de negócios ou se ocorreu um failover de verificação de integridade. Se seus negócios forem impactados, entre em contato com seu gerente de negócios para obter assistência. |
Operações relacionadas
|
Ações |
Descrição e referências |
|
Visualizar eventos |
Visualize os eventos das seguintes maneiras:
|
|
Assinar eventos |
Assine eventos no CloudMonitor para receber notificações sobre novos eventos e atualizações de status por telefone, mensagem de texto ou e-mail. Para obter mais informações, consulte Configurar assinaturas de eventos do NIS. |
|
Tratar eventos |
Após visualizar um evento, resolva o problema com base nas recomendações fornecidas. Para obter mais informações, consulte Resumo de eventos. |