全部产品
Search
文档中心

高速通道:通过监控/告警/事件及时感知专线故障

更新时间:Jul 08, 2026

可通过配置告警,及时感知专线故障,降低业务影响。

背景信息

专线发生故障时,业务侧通常会立即感知到丢包或不可达。告警配置是否完整、是否及时,决定了您能否及时发现异常并启动应急流程。

高速通道当前依赖云监控产品提供告警能力,支持两种类型的告警:

  • 报警规则:基于 指标(Metric)阈值 的报警。适合 up/down 状态、流量值等量化指标的常态化阈值监控,需手动定义阈值。

  • 系统事件:基于 事件(Event) 的订阅。系统事件是阿里云通过对后台多项指标综合分析后,识别出的一次故障或异常,例如 BGP 故障、BFD DOWN、VBR 流量陡降,无需自定义阈值,开箱即用 。

关键告警配置

建议配置如下关键告警。

1. 物理端口故障

按照如下配置,针对目标物理端口添加报警规则

  • 产品高速通道-物理端口

  • 监控指标物理专线状态

    • 周期连续1个周期(1周期=1分钟)

    • 阈值Status < 1,对应物理端口故障。

2. VBR流量异常

按照如下配置,订阅系统事件

  • 产品网络智能服务

  • 事件名称VBR入方向流量陡降VBR出方向流量陡降

    单击查看 VBR入方向流量陡降 规则定义

    监控分钟级的VBR实例IDC到VPC方向流入速率,若同时满足以下条件,则触发告警。

    条件一:持续3分钟,每分钟环比前7分钟的平均速率下跌≥99%;

    条件二:持续3分钟,每分钟环比前7分钟的平均速率下跌绝对值≥1 Mbps;

    条件三:持续3分钟,每分钟环比前15、30和60分钟的平均速率下跌绝对值≥0.5 Mbps;

    条件四(智能基线告警):通过学习VBR实例的历史流入速率周期性规律,预测下一周期流入速率稳定区间,若在周期到达时,3分钟内持续2分钟突破预测区间下限≥99%,则判定为异常下跌。

    出方向规则定义同理,详见NIS文档:事件中心

3. ECR流量异常

针对目标ECR添加报警规则。例如ECR流出到特定TR的历史流量带宽7x24小时稳定在100Mbps以上,那么可将 监控值 < 1Mbps 视为流量跌停:

  • 产品高速通道-专线网关

  • 监控指标转发路由器(TR)实例监控 -> ECR到TR方向流出速率

    • 周期连续1个周期(1周期=1分钟)

    • 阈值监控值 < 1Mbps (此处仅为示例,请按照实际传输的流量带宽设置合理的告警阈值)。

  • 维度:选择目标地域和目标TR。

4. BGP和BFD异常

按照如下配置,订阅系统事件

  • 产品网络智能服务

  • 事件名称

    • BGP连接故障:BGP连接状态从已连接变成其他状态,会影响流量传输。

    • BFD状态DOWN通知:BFD状态异常,影响流量传输。

5. 流量探测丢包

按照如下配置,针对目标探测任务添加报警规则

  • 产品站点监控

  • 监控指标丢包率

    • 周期连续1个周期(1周期=1分钟)

    • 阈值平均值 = 100%

6. 健康检查异常(无ECR的场景)

注意:健康检查仅针对无ECR的场景,包括 VBR直连VPC(即VBR上连,默认不开放) VBR直连TR

按照如下配置,针对目标探测任务添加报警规则

  • 产品高速通道-边界路由器

  • 监控指标VBR健康检查丢包率

    • 周期连续1个周期(1周期=1分钟)

    • 阈值监控值 = 100%

操作步骤

添加报警规则

  1. 前往报警规则配置页。根据不同的目标资源:

    • 物理端口边界路由器VBR

      1. 目标物理端口/目标VBR监控列,单击对应的监控图标image打开监控弹窗。

      2. 监控弹窗的右上角,单击预警设置跳转到云监控控制台,页面会自动打开创建报警规则-设置规则描述弹窗。

    • 专线网关ECR

      1. 在云监控控制台目标ECR操作列,单击监控图表

      2. 然后在图表页面右上角单击创建报警规则,页面会自动打开创建报警规则-设置规则描述弹窗。

    • 流量探测

      1. 在云监控控制台报警服务-报警规则页面,单击创建报警规则

      2. 创建报警规则弹窗中:选择产品站点监控资源范围实例,并在关联资源中单击添加实例选择目标流量探测任务;规则描述中单击添加规则 -> 简单指标,打开设置规则描述弹窗。

    • 健康检查

      1. 在云监控控制台报警服务-报警规则页面,单击创建报警规则

      2. 创建报警规则弹窗中:选择产品高速通道-边界路由器资源范围实例,并在关联资源中单击添加实例选择目标VBR;规则描述中单击添加规则 -> 简单指标,打开设置规则描述弹窗。

  2. 设置规则描述弹窗中:

    • 规则名称:设置有意义的名称,例如xxx异常

    • 指标类型:保持默认的简单指标

    • 监控指标:根据关键告警配置选择目标监控指标,并在阈值及报警级别紧急区块中设置周期阈值

      设置完毕后,单击确定

  3. 创建报警规则弹窗中:

    • 通道沉默周期:告警通知发送后,在设定时长内,同一条告警即使持续触发也不再重复发送。默认24小时,即同一告警每24小时最多通知一次。

    • 报警联系人组:下拉选择目标组。若下拉框为空,请先创建报警联系人和报警联系人组

    设置完毕后,单击确认

订阅系统事件

  1. 前往云监控事件订阅页面,单击创建订阅策略

  2. 创建订阅策略页面:

    1. 基本信息:输入有意义的名称,例如xxx异常

    2. 报警订阅订阅类型选择系统事件订阅范围根据关键告警配置选择目标产品事件名称,其他项保持默认不填。

    3. 合并降噪:保持默认。

    4. 通知:下拉选择目标通知配置。若为空请先创建通知配置策略

    5. 推送与集成:保持默认不填。

    最后单击页面底部的提交

验证告警

完成本文配置后,建议定期做一次告警演练,验证联系组、通知渠道、值班响应链路是否仍然有效,避免告警配置完即遗忘,确保告警生效。

下面以物理专线故障演练为例,验证告警有效性:

警告

故障演练会通过将被演练的资源关闭,使资源处于人工构造的故障状态,请确保您已将演练资源进行冗余配置,否则会导致业务中断。

  1. 前往故障演练页面,单击创建任务

  2. 创建任务页面,

    • 地域:选择目标物理端口所在的地域。

    • 演练资源:选择物理专线,然后选中下方左侧的目标物理端口,通过单击箭头挪到右侧已选择实例面板中。

    • 演练方式:选择立即开始

    • 演练时长:选择实际可接受的时长,本文以5分钟为例。

    • 确认无误后,单击确定

  3. 显示创建故障演练任务成功后,单击查看详情确认演练任务的基本信息。

    • 演练状态会先变为开始中,然后进入演练中状态。

    • 状态进入演练中后,报警联系人将收到告警信息。邮件方式的告警信息示例:

      ECR流量异常

      时间: 2026-05-22 10:26:49

      报警级别: 紧急

      实例名称: [instanceId=ecr-fih7************,nodeRegion=eu-central-1,nodeId=tr-gw8m************]

      实例详情: instanceId = ecr-fih************;

      nodeRegion = eu-central-1;

      userId = 11081************;

      nodeId = tr-gw8************;

      监控指标: ECR到TR方向流出速率

      报警条件: 连续满足1次 当前值<1 Mibit/s

      当前值: 0bit/s

      数据详情: __ts__=177************,

      __count__=1,

      instanceId=ecr-fih7sr************,

      nodeRegion=eu-central-1,

      Value=0,

      nodeId=tr-gw8m************,

      userId=1108************,

      timestamp=1779************,

      持续时间: 1分钟,

      告警规则: [ECR到TR方向流出速率<1Mbps](ECR到TR方向流出速率<1Mbps)。

      BGP状态告警

      【云监控】************下发生4次报警,最高级别 CRITICAL。

      用户: 尊敬的************一(110811************)

      开始时间: 2026-05-21 23:03:31 CST

      最近触发时间: 2026-05-21 23:14:43 CST

      报警抑制: 直接通知

      策略规则: ************

      相关报警事件:

      CRITICAL 2026-05-21 23:14:43 CST

      服务名称: 网络智能服务

      实例名称: vbr-gw************

      影响资源: acs:EC:eu-central-1:11081************:instance/vbr-gw822************

      地域: 德国1(法兰克福)(eu-central-1)

      事件名称: BGP连接故障 说明: 支持的云产品及其系统事件

      事件内容: impact : {"EC":["vbr-gw8************"]}

      description : 高速通道:vbr-gw822e************物理网络连通性故障或BGP配置异常导致BGP连接故障导致路由丢失。BGP相关信息为 bgpGroupId:bgpg-gw8ns************,bgpPeerId:bgp-gw8hw************,建议联系商务经理处理。

      event_time : 2026-05-21T15:14:00Z

      流量探测

      尊敬的用户xxx ,您好:

      站点监控实例:taskName=alert,address=172.16.0.1,丢包率于2026-05-22 10:26:58发生告警,平均值为100%,持续时间0分钟。

      规则详情:报警规则xxx,丢包率的1分钟统计值,连续1次满足表达式平均值==100 %

      健康检查

      【云监控】尊敬的xxxx , xxx-高速通道-专线连接 发生告警

      时间: 2026-05-22 10:29:08

      报警级别: 紧急

      实例名称: [a-idc]

      实例详情: instanceId = vbr-gw8v************;

      userId = 1108************;

      监控指标: VBR健康检查丢包率

      报警条件: 连续满足3次 当前值==100 %

      当前值: 100%

      数据详情: __ts__=1779416910000,

      __count__=1,

      instanceId=vbr-gw8v************,

      Value=100,

      userId=11081************,

      timestamp=1779416820000,

      持续时间: 4分钟,

      告警规则: [6. 健康检查异常(无ECR的场景)](6. 健康检查异常(无ECR的场景))

如果报警规则类的告警未触发,请先确认报警联系人的联系方式有效,再确认指标变化:

  1. 目标报警规则操作列,单击修改

  2. 修改报警规则滑窗中,单击规则描述最右侧的编辑图标image,打开设置规则描述滑窗。

  3. 设置规则描述滑窗中,查看监控图表预览中的指标趋势,确认指标是否匹配报警周期阈值

相关文档