Configure alertas para detectar falhas em linhas dedicadas rapidamente e minimizar o impacto nos negócios.
Contexto
Quando uma linha dedicada falha, a área de negócios geralmente detecta perda de pacotes ou inacessibilidade imediatamente. A integridade e a agilidade das configurações de alerta determinam se você consegue identificar exceções a tempo e iniciar o processo de resposta a emergências.
O Express Connect utiliza o CloudMonitor para fornecer recursos de alerta e oferece suporte aos dois tipos de alerta a seguir:
Regras de alerta: Alertas baseados em limiares de métricas. Adequados para monitoramento rotineiro de limiares em métricas quantitativas, como status de up/down e volume de tráfego. É necessário definir os limiares manualmente.
Eventos de sistema: Assinaturas baseadas em eventos. Eventos de sistema são falhas ou exceções identificadas pela Alibaba Cloud por meio de uma análise abrangente de várias métricas de backend, como falhas de BGP, BFD DOWN e quedas de tráfego de VBR. Não é necessário definir limiares, prontos para uso imediato.
Configurações essenciais de alerta
Recomendamos configurar os seguintes alertas essenciais.
1. Falhas na porta física
Defina as configurações abaixo para a porta física alvo ao Adicionar uma regra de alerta:
Product: Express Connect - Physical Connections.
-
Metric: PhysicalConnectionStatus
Period: 1 consecutive period (1 period = 1 minute).
Threshold: Status < 1, indica falha na porta física.
2. Exceções de tráfego de VBR
Configure os parâmetros a seguir ao Assinar eventos de sistema:
Products: Network Intelligence Service.
-
Event name: risk-ec-inTrafficDroppedToZero ou risk-ec-outTrafficDroppedToZero.
3. Exceções de tráfego de ECR
Aplique as configurações abaixo para o ECR alvo ao Adicionar uma regra de alerta. Por exemplo, se o tráfego histórico de saída do ECR para um TR específico permanecer estável acima de 100 Mbps 24 horas por dia, considere um valor monitorado < 1 Mbps como uma queda de tráfego:
Product: Express Connect Router.
-
Metric: TR Instance -> RateOutFromECRToTR.
Period: 1 consecutive period (1 period = 1 minute).
Threshold: Monitored value < 1 Mbps (Este é apenas um exemplo. Defina um limiar de alerta adequado com base na largura de banda real do tráfego).
Dimension: Selecione a região e o TR alvos.
4. Exceções de BGP e BFD
Estabeleça as configurações a seguir ao Assinar eventos de sistema:
Product: Network Intelligence Service.
-
Event name:
risk-ec-bgpRouterFail: Se o estado da conexão BGP mudar de Connected para outro estado, a transmissão de tráfego será afetada.
Notification of BFD in Down: Uma exceção no estado do BFD afeta a transmissão de tráfego.
5. Perda de pacotes de sondagem de tráfego
Especifique as configurações abaixo para a tarefa de sondagem alvo ao Adicionar uma regra de alerta:
Product: New Sitemonitor.
-
Metric: Packet loss rate
Period: 1 consecutive period (1 period = 1 minute).
Threshold: Average = 100%.
6. Exceções de verificação de integridade (em cenários sem ECR)
Nota: A Verificação de integridade aplica-se apenas a cenários sem ECR, incluindo VBR conectada diretamente a uma VPC (conexão superior da VBR, não habilitada por padrão) ou VBR conectada diretamente a um TR.
Preencha as configurações a seguir para a tarefa de sondagem alvo ao Adicionar uma regra de alerta:
Product: Express Connect - VBR.
-
Metric: VbrHealthyCheckLossPercent.
Period: 1 consecutive period (1 period = 1 minute).
Threshold: Monitored value = 100%.
Procedimento
Adicionar uma regra de alerta
-
Acesse a página de configuração de regras de alerta. Dependendo do recurso alvo:
-
Porta física ou Virtual Border Router (VBR):
Na coluna Monitoring da porta física alvo/VBR alvo, clique em
para abrir a caixa de diálogo Monitoring.No canto superior direito da caixa de diálogo Monitoring, clique em Set Alarm para acessar o console do CloudMonitor. A caixa de diálogo Create Alert Rule-Configure Rule Description aparecerá automaticamente.
-
Express Connect Router (ECR):
No console do CloudMonitor, na coluna ECR alvo, clique em Monitoring Charts em Actions.
Em seguida, no canto superior direito da página do gráfico, clique em Create Alert Rule. A caixa de diálogo Create Alert Rule-Configure Rule Description aparecerá automaticamente.
-
Sondagem de tráfego:
No console do CloudMonitor, na página Serviço de Alerta - Regras de Alerta, clique em Create Alert Rule.
Na caixa de diálogo Create Alert Rule: defina Product como Site Monitor; defina Resource Range como Instances e, em Associated Resources, clique em Add Instance para selecionar a tarefa de sondagem de tráfego alvo; em Rule Description, clique em Add Rule -> Simple Metric para abrir a caixa de diálogo Configure Rule Description.
-
Verificação de integridade:
No console do CloudMonitor, na página Serviço de Alerta - Regras de Alerta, clique em Create Alert Rule.
Na caixa de diálogo Create Alert Rule: defina Product como Express Connect - VBR; defina Resource Range como Instances e, em Associated Resources, clique em Add Instance para selecionar a VBR alvo; em Rule Description, clique em Add Rule -> Simple Metric para abrir a caixa de diálogo Configure Rule Description.
-
-
Na caixa de diálogo Configure Rule Description:
Alert Rule: Insira um nome significativo, como xxx exception.
Metric Type: Mantenha o padrão Simple Metric.
-
Metric: Selecione os Monitoring indicators alvo com base nas Configurações essenciais de alerta e defina o Period e o Threshold na seção Critical de Threshold and Alert Level.
Após concluir a configuração, clique em OK.
-
Na caixa de diálogo Create Alert Rule:
Mute Period: Após o envio de uma notificação de alerta, o mesmo alerta não será reenviado repetidamente dentro do período especificado, mesmo que continue sendo acionado. O período padrão é de 24 horas, o que significa que cada alerta é enviado no máximo uma vez a cada 24 horas.
Alert Contact Group: Selecione o grupo alvo na lista suspensa. Se a lista estiver vazia, Crie contatos de alerta e grupos de contatos de alerta primeiro.
Após concluir a configuração, clique em Confirm.
Assinar eventos de sistema
Acesse a página de Assinatura de Eventos do CloudMonitor e clique em Create Subscription Policy.
-
Na página Create Subscription Policy:
Basic information: Insira um Name significativo, como xxx exception.
Alert Subscription: Defina o Subscription Type como System Events, selecione o Product e o Event name alvo com base nas Configurações essenciais de alerta para o Subscription Scope e mantenha as demais configurações como padrão.
Combined Noise Reduction: Mantenha a configuração padrão.
Notification: Selecione a Notification Configuration alvo na lista suspensa. Se a lista estiver vazia, Crie uma política de notificação primeiro.
Push and Integration: Deixe este campo vazio.
Clique em Submit na parte inferior da página.
Verificar alertas
Após concluir as configurações deste tópico, recomendamos realizar um simulado de alerta regularmente para verificar se o grupo de contatos, os canais de notificação e a cadeia de resposta de plantão permanecem válidos. Isso evita que as configurações de alerta sejam esquecidas após a implementação e garante que os alertas funcionem corretamente.
O exemplo a seguir utiliza um simulado de falha em linha dedicada física para verificar a eficácia do alerta:
Um simulado de falha coloca o recurso testado em um estado artificial de falha ao desligá-lo. Certifique-se de ter configurado redundância para o recurso do simulado. Caso contrário, os negócios podem ser interrompidos.
Acesse a página de Simulado de Falha e clique em Failure Drill.
-
Na página Failure Drill,
Create Task: Selecione a região onde a porta física alvo está localizada.
Create Task: Selecione Region, selecione a porta física alvo no lado inferior esquerdo e mova-a para o painel Selected instances à direita clicando na seta.
Drill Resource: Selecione Express Connect Circuit.
Drill Mode: Selecione uma duração aceitável. Neste tópico, usamos 5 minutos como exemplo.
Após confirmar as configurações, clique em Start Now.
-
Quando a mensagem Drill Duration for exibida, clique em OK para confirmar as informações básicas da tarefa de simulado.
O status do simulado muda primeiro para The failure drill task is created. e depois entra no estado View Details.
-
Depois que o status mudar para Starting, os In Drill receberão um alerta. Veja abaixo um exemplo de alerta por e-mail:
ECR traffic exception
Time: 2026-05-22 10:26:49
Alert level: Critical
Instance name: [instanceId=ecr-fih7, nodeRegion=eu-central-1, nodeId=tr-gw8m]
Instance details: instanceId = ecr-fih**;
nodeRegion = eu-central-1;
userId = 11081**;
nodeId = tr-gw8**;
Metric: Outbound rate from ECR to TR
Alert condition: Triggered 1 consecutive time. Current value < 1 Mibit/s
Current value: 0 bit/s
Data details: __ts__=177**,
__count__=1,
instanceId=ecr-fih7sr**,
nodeRegion=eu-central-1,
Value=0,
nodeId=tr-gw8m**,
userId=1108**,
timestamp=1779**,
Duration: 1 minute,
Alert rule: Outbound rate from ECR to TR < 1Mbps.
BGP status alert
[CloudMonitor] ** triggered 4 alerts. Highest level: CRITICAL.
User: Dear (110811)
Start time: 2026-05-21 23:03:31 CST
Last trigger time: 2026-05-21 23:14:43 CST
Alert suppression: Direct notification
Policy rule: **
Related alert events:
CRITICAL 2026-05-21 23:14:43 CST
Service name: Network Intelligence Service
Instance name: vbr-gw**
Affected resources: acs:EC:eu-central-1:11081:instance/vbr-gw822
Region: Germany 1 (Frankfurt) (eu-central-1)
Event name: BGP connection fault. Description: Serviços de nuvem suportados e seus eventos de sistema
Event content: impact : {"EC":["vbr-gw8**"]}
description : Express Connect: vbr-gw822e BGP connection fault caused by a physical network connectivity failure or BGP configuration exception, resulting in route loss. BGP details: bgpGroupId:bgpg-gw8ns, bgpPeerId:bgp-gw8hw**. We recommend that you contact your account manager.
event_time : 2026-05-21T15:14:00Z
Traffic probing
Dear user xxx, hello:
Site monitoring instance: taskName=alert, address=172.16.0.1. A packet loss alert was triggered at 2026-05-22 10:26:58. The average value is 100% and the duration is 0 minutes.
Rule details: Alert rule xxx. The 1-minute statistical value of the packet loss rate met the expression average == 100% for 1 consecutive time.
Health check
[CloudMonitor] Dear xxxx, xxx-Express Connect-Physical Connection triggered an alert
Time: 2026-05-22 10:29:08
Alert level: Critical
Instance name: [a-idc]
Instance details: instanceId = vbr-gw8v**;
userId = 1108**;
Metric: VBR health check packet loss rate
Alert condition: Triggered 3 consecutive times. Current value == 100%
Current value: 100%
Data details: __ts__=1779416910000,
__count__=1,
instanceId=vbr-gw8v**,
Value=100,
userId=11081**,
timestamp=1779416820000,
Duration: 4 minutes,
Alert rule: 6. Health check exceptions (in scenarios without ECR))
Se o alerta da regra não for acionado, confirme primeiro se as informações de contato do contato de alerta são válidas e, em seguida, verifique as alterações nas métricas:
Na coluna da regra de alerta alvo, clique em In Drill em Alert Contacts.
No painel Modify, clique no ícone de edição
no extremo direito de Actions para abrir o painel Modify Alert Rule.No painel Rule Description, visualize as tendências das métricas em Configure Rule Description para verificar se as métricas correspondem ao Configure Rule Description e ao Chart Preview do alerta.
Documentos relacionados
CloudMonitor - Regras de alerta: Crie e gerencie regras de alerta.
CloudMonitor - Eventos de sistema: Visualize e gerencie eventos de sistema.
Eventos de sistema do NIS: Vários eventos de sistema relacionados ao Express Connect pertencem ao produto NIS. Consulte as definições detalhadas das regras dos eventos de sistema relacionados ao Express Connect neste documento.