可通过配置告警,及时感知专线故障,降低业务影响。
背景信息
专线发生故障时,业务侧通常会立即感知到丢包或不可达。告警配置是否完整、是否及时,决定了您能否及时发现异常并启动应急流程。
高速通道当前依赖云监控产品提供告警能力,支持两种类型的告警:
报警规则:基于 指标(Metric)阈值 的报警。适合 up/down 状态、流量值等量化指标的常态化阈值监控,需手动定义阈值。
系统事件:基于 事件(Event) 的订阅。系统事件是阿里云通过对后台多项指标综合分析后,识别出的一次故障或异常,例如 BGP 故障、BFD DOWN、VBR 流量陡降,无需自定义阈值,开箱即用 。
关键告警配置
建议配置如下关键告警。
1. 物理端口故障
按照如下配置,针对目标物理端口添加报警规则:
产品:高速通道-物理端口。
监控指标:物理专线状态
周期: 连续1个周期(1周期=1分钟)。
阈值:Status < 1,对应物理端口故障。
2. VBR流量异常
按照如下配置,订阅系统事件:
产品:网络智能服务。
事件名称:VBR入方向流量陡降或VBR出方向流量陡降。
3. ECR流量异常
针对目标ECR添加报警规则。例如ECR流出到特定TR的历史流量带宽7x24小时稳定在100Mbps以上,那么可将 监控值 < 1Mbps 视为流量跌停:
产品:高速通道-专线网关。
监控指标:转发路由器(TR)实例监控 -> ECR到TR方向流出速率 。
周期: 连续1个周期(1周期=1分钟)。
阈值:监控值 < 1Mbps (此处仅为示例,请按照实际传输的流量带宽设置合理的告警阈值)。
维度:选择目标地域和目标TR。
4. BGP和BFD异常
按照如下配置,订阅系统事件:
产品:网络智能服务。
事件名称:
BGP连接故障:BGP连接状态从已连接变成其他状态,会影响流量传输。
BFD状态DOWN通知:BFD状态异常,影响流量传输。
5. 流量探测丢包
按照如下配置,针对目标探测任务添加报警规则:
产品:站点监控。
监控指标:丢包率
周期:连续1个周期(1周期=1分钟)。
阈值:平均值 = 100%。
6. 健康检查异常(无ECR的场景)
注意:健康检查仅针对无ECR的场景,包括 VBR直连VPC(即VBR上连,默认不开放) 或 VBR直连TR。
按照如下配置,针对目标探测任务添加报警规则:
产品:高速通道-边界路由器。
监控指标:VBR健康检查丢包率。
周期:连续1个周期(1周期=1分钟)。
阈值:监控值 = 100%。
操作步骤
添加报警规则
前往报警规则配置页。根据不同的目标资源:
物理端口 或 边界路由器VBR:
专线网关ECR:
在云监控控制台目标ECR的操作列,单击监控图表。
然后在图表页面右上角单击创建报警规则,页面会自动打开创建报警规则-设置规则描述弹窗。
流量探测:
在云监控控制台报警服务-报警规则页面,单击创建报警规则。
在创建报警规则弹窗中:选择产品为站点监控;资源范围为实例,并在关联资源中单击添加实例选择目标流量探测任务;规则描述中单击添加规则 -> 简单指标,打开设置规则描述弹窗。
健康检查:
在云监控控制台报警服务-报警规则页面,单击创建报警规则。
在创建报警规则弹窗中:选择产品为高速通道-边界路由器;资源范围为实例,并在关联资源中单击添加实例选择目标VBR;规则描述中单击添加规则 -> 简单指标,打开设置规则描述弹窗。
在设置规则描述弹窗中:
规则名称:设置有意义的名称,例如xxx异常。
指标类型:保持默认的简单指标。
监控指标:根据关键告警配置选择目标监控指标,并在阈值及报警级别的紧急区块中设置周期、阈值。
设置完毕后,单击确定。
在创建报警规则弹窗中:
通道沉默周期:告警通知发送后,在设定时长内,同一条告警即使持续触发也不再重复发送。默认24小时,即同一告警每24小时最多通知一次。
报警联系人组:下拉选择目标组。若下拉框为空,请先创建报警联系人和报警联系人组。
设置完毕后,单击确认。
订阅系统事件
验证告警
完成本文配置后,建议定期做一次告警演练,验证联系组、通知渠道、值班响应链路是否仍然有效,避免告警配置完即遗忘,确保告警生效。
下面以物理专线故障演练为例,验证告警有效性:
故障演练会通过将被演练的资源关闭,使资源处于人工构造的故障状态,请确保您已将演练资源进行冗余配置,否则会导致业务中断。
前往故障演练页面,单击创建任务。
在创建任务页面,
地域:选择目标物理端口所在的地域。
演练资源:选择物理专线,然后选中下方左侧的目标物理端口,通过单击箭头挪到右侧已选择实例面板中。
演练方式:选择立即开始。
演练时长:选择实际可接受的时长,本文以5分钟为例。
确认无误后,单击确定。
显示创建故障演练任务成功后,单击查看详情确认演练任务的基本信息。
演练状态会先变为开始中,然后进入演练中状态。
状态进入演练中后,报警联系人将收到告警信息。邮件方式的告警信息示例:
ECR流量异常
时间: 2026-05-22 10:26:49
报警级别: 紧急
实例名称: [instanceId=ecr-fih7************,nodeRegion=eu-central-1,nodeId=tr-gw8m************]
实例详情: instanceId = ecr-fih************;
nodeRegion = eu-central-1;
userId = 11081************;
nodeId = tr-gw8************;
监控指标: ECR到TR方向流出速率
报警条件: 连续满足1次 当前值<1 Mibit/s
当前值: 0bit/s
数据详情: __ts__=177************,
__count__=1,
instanceId=ecr-fih7sr************,
nodeRegion=eu-central-1,
Value=0,
nodeId=tr-gw8m************,
userId=1108************,
timestamp=1779************,
持续时间: 1分钟,
告警规则: [ECR到TR方向流出速率<1Mbps](ECR到TR方向流出速率<1Mbps)。
BGP状态告警
【云监控】************下发生4次报警,最高级别 CRITICAL。
用户: 尊敬的************一(110811************)
开始时间: 2026-05-21 23:03:31 CST
最近触发时间: 2026-05-21 23:14:43 CST
报警抑制: 直接通知
策略规则: ************
相关报警事件:
CRITICAL 2026-05-21 23:14:43 CST
服务名称: 网络智能服务
实例名称: vbr-gw************
影响资源: acs:EC:eu-central-1:11081************:instance/vbr-gw822************
地域: 德国1(法兰克福)(eu-central-1)
事件名称: BGP连接故障 说明: 支持的云产品及其系统事件
事件内容: impact : {"EC":["vbr-gw8************"]}
description : 高速通道:vbr-gw822e************物理网络连通性故障或BGP配置异常导致BGP连接故障导致路由丢失。BGP相关信息为 bgpGroupId:bgpg-gw8ns************,bgpPeerId:bgp-gw8hw************,建议联系商务经理处理。
event_time : 2026-05-21T15:14:00Z
流量探测
尊敬的用户xxx ,您好:
站点监控实例:taskName=alert,address=172.16.0.1,丢包率于2026-05-22 10:26:58发生告警,平均值为100%,持续时间0分钟。
规则详情:报警规则xxx,丢包率的1分钟统计值,连续1次满足表达式平均值==100 %
健康检查
【云监控】尊敬的xxxx , xxx-高速通道-专线连接 发生告警
时间: 2026-05-22 10:29:08
报警级别: 紧急
实例名称: [a-idc]
实例详情: instanceId = vbr-gw8v************;
userId = 1108************;
监控指标: VBR健康检查丢包率
报警条件: 连续满足3次 当前值==100 %
当前值: 100%
数据详情: __ts__=1779416910000,
__count__=1,
instanceId=vbr-gw8v************,
Value=100,
userId=11081************,
timestamp=1779416820000,
持续时间: 4分钟,
告警规则: [6. 健康检查异常(无ECR的场景)](6. 健康检查异常(无ECR的场景))
如果报警规则类的告警未触发,请先确认报警联系人的联系方式有效,再确认指标变化:
在目标报警规则的操作列,单击修改。
在修改报警规则滑窗中,单击规则描述最右侧的编辑图标
,打开设置规则描述滑窗。在设置规则描述滑窗中,查看监控图表预览中的指标趋势,确认指标是否匹配报警周期和阈值。