Todos os produtos
Search
Central de documentação

Express Connect:Detect leased line faults in a timely manner through monitoring, alerts, and events

Última atualização: Jul 08, 2026

Configure alertas para detectar falhas em linhas dedicadas rapidamente e minimizar o impacto nos negócios.

Contexto

Quando uma linha dedicada falha, a área de negócios geralmente detecta perda de pacotes ou inacessibilidade imediatamente. A integridade e a agilidade das configurações de alerta determinam se você consegue identificar exceções a tempo e iniciar o processo de resposta a emergências.

O Express Connect utiliza o CloudMonitor para fornecer recursos de alerta e oferece suporte aos dois tipos de alerta a seguir:

  • Regras de alerta: Alertas baseados em limiares de métricas. Adequados para monitoramento rotineiro de limiares em métricas quantitativas, como status de up/down e volume de tráfego. É necessário definir os limiares manualmente.

  • Eventos de sistema: Assinaturas baseadas em eventos. Eventos de sistema são falhas ou exceções identificadas pela Alibaba Cloud por meio de uma análise abrangente de várias métricas de backend, como falhas de BGP, BFD DOWN e quedas de tráfego de VBR. Não é necessário definir limiares, prontos para uso imediato.

Configurações essenciais de alerta

Recomendamos configurar os seguintes alertas essenciais.

1. Falhas na porta física

Defina as configurações abaixo para a porta física alvo ao Adicionar uma regra de alerta:

  • Product: Express Connect - Physical Connections.

  • Metric: PhysicalConnectionStatus

    • Period: 1 consecutive period (1 period = 1 minute).

    • Threshold: Status < 1, indica falha na porta física.

2. Exceções de tráfego de VBR

Configure os parâmetros a seguir ao Assinar eventos de sistema:

  • Products: Network Intelligence Service.

  • Event name: risk-ec-inTrafficDroppedToZero ou risk-ec-outTrafficDroppedToZero.

    Clique para visualizar a definição da regra risk-ec-inTrafficDroppedToZero

    Monitore a taxa de entrada por minuto do IDC para a VPC na instância de VBR. Um alerta será acionado se todas as condições a seguir forem atendidas:

    Condição 1: Durante 3 minutos consecutivos, a taxa cai ≥ 99% em comparação com a taxa média dos 7 minutos anteriores em cada minuto.

    Condição 2: Durante 3 minutos consecutivos, a queda absoluta na taxa em relação à média dos 7 minutos anteriores em cada minuto é ≥ 1 Mbps.

    Condição 3: Durante 3 minutos consecutivos, a queda absoluta na taxa em relação à média dos 15, 30 e 60 minutos anteriores em cada minuto é ≥ 0,5 Mbps.

    Condição 4 (alerta de linha de base inteligente): Ao aprender os padrões periódicos da taxa de entrada da instância de VBR, o sistema prevê a faixa estável da taxa de entrada para o próximo ciclo. Se a taxa romper o limite inferior da faixa prevista em ≥ 99% por 2 minutos dentro de uma janela de 3 minutos no início do ciclo, uma queda anômala será detectada.

    A regra de saída segue a mesma definição. Para mais informações, consulte a documentação do NIS: Central de eventos.

3. Exceções de tráfego de ECR

Aplique as configurações abaixo para o ECR alvo ao Adicionar uma regra de alerta. Por exemplo, se o tráfego histórico de saída do ECR para um TR específico permanecer estável acima de 100 Mbps 24 horas por dia, considere um valor monitorado < 1 Mbps como uma queda de tráfego:

  • Product: Express Connect Router.

  • Metric: TR Instance -> RateOutFromECRToTR.

    • Period: 1 consecutive period (1 period = 1 minute).

    • Threshold: Monitored value < 1 Mbps (Este é apenas um exemplo. Defina um limiar de alerta adequado com base na largura de banda real do tráfego).

  • Dimension: Selecione a região e o TR alvos.

4. Exceções de BGP e BFD

Estabeleça as configurações a seguir ao Assinar eventos de sistema:

  • Product: Network Intelligence Service.

  • Event name:

    • risk-ec-bgpRouterFail: Se o estado da conexão BGP mudar de Connected para outro estado, a transmissão de tráfego será afetada.

    • Notification of BFD in Down: Uma exceção no estado do BFD afeta a transmissão de tráfego.

5. Perda de pacotes de sondagem de tráfego

Especifique as configurações abaixo para a tarefa de sondagem alvo ao Adicionar uma regra de alerta:

  • Product: New Sitemonitor.

  • Metric: Packet loss rate

    • Period: 1 consecutive period (1 period = 1 minute).

    • Threshold: Average = 100%.

6. Exceções de verificação de integridade (em cenários sem ECR)

Nota: A Verificação de integridade aplica-se apenas a cenários sem ECR, incluindo VBR conectada diretamente a uma VPC (conexão superior da VBR, não habilitada por padrão) ou VBR conectada diretamente a um TR.

Preencha as configurações a seguir para a tarefa de sondagem alvo ao Adicionar uma regra de alerta:

  • Product: Express Connect - VBR.

  • Metric: VbrHealthyCheckLossPercent.

    • Period: 1 consecutive period (1 period = 1 minute).

    • Threshold: Monitored value = 100%.

Procedimento

Adicionar uma regra de alerta

  1. Acesse a página de configuração de regras de alerta. Dependendo do recurso alvo:

    • Porta física ou Virtual Border Router (VBR):

      1. Na coluna Monitoring da porta física alvo/VBR alvo, clique em image para abrir a caixa de diálogo Monitoring.

      2. No canto superior direito da caixa de diálogo Monitoring, clique em Set Alarm para acessar o console do CloudMonitor. A caixa de diálogo Create Alert Rule-Configure Rule Description aparecerá automaticamente.

    • Express Connect Router (ECR):

      1. No console do CloudMonitor, na coluna ECR alvo, clique em Monitoring Charts em Actions.

      2. Em seguida, no canto superior direito da página do gráfico, clique em Create Alert Rule. A caixa de diálogo Create Alert Rule-Configure Rule Description aparecerá automaticamente.

    • Sondagem de tráfego:

      1. No console do CloudMonitor, na página Serviço de Alerta - Regras de Alerta, clique em Create Alert Rule.

      2. Na caixa de diálogo Create Alert Rule: defina Product como Site Monitor; defina Resource Range como Instances e, em Associated Resources, clique em Add Instance para selecionar a tarefa de sondagem de tráfego alvo; em Rule Description, clique em Add Rule -> Simple Metric para abrir a caixa de diálogo Configure Rule Description.

    • Verificação de integridade:

      1. No console do CloudMonitor, na página Serviço de Alerta - Regras de Alerta, clique em Create Alert Rule.

      2. Na caixa de diálogo Create Alert Rule: defina Product como Express Connect - VBR; defina Resource Range como Instances e, em Associated Resources, clique em Add Instance para selecionar a VBR alvo; em Rule Description, clique em Add Rule -> Simple Metric para abrir a caixa de diálogo Configure Rule Description.

  2. Na caixa de diálogo Configure Rule Description:

    • Alert Rule: Insira um nome significativo, como xxx exception.

    • Metric Type: Mantenha o padrão Simple Metric.

    • Metric: Selecione os Monitoring indicators alvo com base nas Configurações essenciais de alerta e defina o Period e o Threshold na seção Critical de Threshold and Alert Level.

      Após concluir a configuração, clique em OK.

  3. Na caixa de diálogo Create Alert Rule:

    • Mute Period: Após o envio de uma notificação de alerta, o mesmo alerta não será reenviado repetidamente dentro do período especificado, mesmo que continue sendo acionado. O período padrão é de 24 horas, o que significa que cada alerta é enviado no máximo uma vez a cada 24 horas.

    • Alert Contact Group: Selecione o grupo alvo na lista suspensa. Se a lista estiver vazia, Crie contatos de alerta e grupos de contatos de alerta primeiro.

    Após concluir a configuração, clique em Confirm.

Assinar eventos de sistema

  1. Acesse a página de Assinatura de Eventos do CloudMonitor e clique em Create Subscription Policy.

  2. Na página Create Subscription Policy:

    1. Basic information: Insira um Name significativo, como xxx exception.

    2. Alert Subscription: Defina o Subscription Type como System Events, selecione o Product e o Event name alvo com base nas Configurações essenciais de alerta para o Subscription Scope e mantenha as demais configurações como padrão.

    3. Combined Noise Reduction: Mantenha a configuração padrão.

    4. Notification: Selecione a Notification Configuration alvo na lista suspensa. Se a lista estiver vazia, Crie uma política de notificação primeiro.

    5. Push and Integration: Deixe este campo vazio.

    Clique em Submit na parte inferior da página.

Verificar alertas

Após concluir as configurações deste tópico, recomendamos realizar um simulado de alerta regularmente para verificar se o grupo de contatos, os canais de notificação e a cadeia de resposta de plantão permanecem válidos. Isso evita que as configurações de alerta sejam esquecidas após a implementação e garante que os alertas funcionem corretamente.

O exemplo a seguir utiliza um simulado de falha em linha dedicada física para verificar a eficácia do alerta:

Aviso

Um simulado de falha coloca o recurso testado em um estado artificial de falha ao desligá-lo. Certifique-se de ter configurado redundância para o recurso do simulado. Caso contrário, os negócios podem ser interrompidos.

  1. Acesse a página de Simulado de Falha e clique em Failure Drill.

  2. Na página Failure Drill,

    • Create Task: Selecione a região onde a porta física alvo está localizada.

    • Create Task: Selecione Region, selecione a porta física alvo no lado inferior esquerdo e mova-a para o painel Selected instances à direita clicando na seta.

    • Drill Resource: Selecione Express Connect Circuit.

    • Drill Mode: Selecione uma duração aceitável. Neste tópico, usamos 5 minutos como exemplo.

    • Após confirmar as configurações, clique em Start Now.

  3. Quando a mensagem Drill Duration for exibida, clique em OK para confirmar as informações básicas da tarefa de simulado.

    • O status do simulado muda primeiro para The failure drill task is created. e depois entra no estado View Details.

    • Depois que o status mudar para Starting, os In Drill receberão um alerta. Veja abaixo um exemplo de alerta por e-mail:

      ECR traffic exception

      Time: 2026-05-22 10:26:49

      Alert level: Critical

      Instance name: [instanceId=ecr-fih7, nodeRegion=eu-central-1, nodeId=tr-gw8m]

      Instance details: instanceId = ecr-fih**;

      nodeRegion = eu-central-1;

      userId = 11081**;

      nodeId = tr-gw8**;

      Metric: Outbound rate from ECR to TR

      Alert condition: Triggered 1 consecutive time. Current value < 1 Mibit/s

      Current value: 0 bit/s

      Data details: __ts__=177**,

      __count__=1,

      instanceId=ecr-fih7sr**,

      nodeRegion=eu-central-1,

      Value=0,

      nodeId=tr-gw8m**,

      userId=1108**,

      timestamp=1779**,

      Duration: 1 minute,

      Alert rule: Outbound rate from ECR to TR &lt; 1Mbps.

      BGP status alert

      [CloudMonitor] ** triggered 4 alerts. Highest level: CRITICAL.

      User: Dear (110811)

      Start time: 2026-05-21 23:03:31 CST

      Last trigger time: 2026-05-21 23:14:43 CST

      Alert suppression: Direct notification

      Policy rule: **

      Related alert events:

      CRITICAL 2026-05-21 23:14:43 CST

      Service name: Network Intelligence Service

      Instance name: vbr-gw**

      Affected resources: acs:EC:eu-central-1:11081:instance/vbr-gw822

      Region: Germany 1 (Frankfurt) (eu-central-1)

      Event name: BGP connection fault. Description: Serviços de nuvem suportados e seus eventos de sistema

      Event content: impact : {"EC":["vbr-gw8**"]}

      description : Express Connect: vbr-gw822e BGP connection fault caused by a physical network connectivity failure or BGP configuration exception, resulting in route loss. BGP details: bgpGroupId:bgpg-gw8ns, bgpPeerId:bgp-gw8hw**. We recommend that you contact your account manager.

      event_time : 2026-05-21T15:14:00Z

      Traffic probing

      Dear user xxx, hello:

      Site monitoring instance: taskName=alert, address=172.16.0.1. A packet loss alert was triggered at 2026-05-22 10:26:58. The average value is 100% and the duration is 0 minutes.

      Rule details: Alert rule xxx. The 1-minute statistical value of the packet loss rate met the expression average == 100% for 1 consecutive time.

      Health check

      [CloudMonitor] Dear xxxx, xxx-Express Connect-Physical Connection triggered an alert

      Time: 2026-05-22 10:29:08

      Alert level: Critical

      Instance name: [a-idc]

      Instance details: instanceId = vbr-gw8v**;

      userId = 1108**;

      Metric: VBR health check packet loss rate

      Alert condition: Triggered 3 consecutive times. Current value == 100%

      Current value: 100%

      Data details: __ts__=1779416910000,

      __count__=1,

      instanceId=vbr-gw8v**,

      Value=100,

      userId=11081**,

      timestamp=1779416820000,

      Duration: 4 minutes,

      Alert rule: 6. Health check exceptions (in scenarios without ECR))

Se o alerta da regra não for acionado, confirme primeiro se as informações de contato do contato de alerta são válidas e, em seguida, verifique as alterações nas métricas:

  1. Na coluna da regra de alerta alvo, clique em In Drill em Alert Contacts.

  2. No painel Modify, clique no ícone de edição image no extremo direito de Actions para abrir o painel Modify Alert Rule.

  3. No painel Rule Description, visualize as tendências das métricas em Configure Rule Description para verificar se as métricas correspondem ao Configure Rule Description e ao Chart Preview do alerta.

Documentos relacionados