全部產品
Search
文件中心

Express Connect:通過監控/警示/事件及時感知專線故障

更新時間:Oct 09, 2026

可通過配置警示,及時感知專線故障,降低業務影響。

背景資訊

專線發生故障時,業務側通常會立即感知到丟包或不可達。警示配置是否完整、是否及時,決定了您能否及時發現異常並啟動應急流程。

Express Connect當前依賴CloudMonitor產品提供警示能力,支援兩種類型的警示:

  • 警示規則:基於 指標(Metric)閾值 的警示。適合 up/down 狀態、流量值等量化指標的常態化閾值監控,需手動定義閾值。

  • 系統事件:基於 事件(Event) 的訂閱。系統事件是阿里雲通過對後台多項指標綜合分析後,識別出的一次故障或異常,例如 BGP 故障、BFD DOWN、VBR 流量陡降,無需自訂閾值,開箱即用 。

關鍵警示配置

建議配置如下關鍵警示。

1. 物理連接埠故障

按照如下配置,針對目標物理連接埠添加警示規則:

  • 產品:Express Connect-物理連接埠。

  • 監控指標:物理专线状态

    • 周期: 連續1個周期(1周期=1分鐘)。

    • 閾值:Status < 1,對應物理連接埠故障。

2. VBR流量異常

按照如下配置,訂閱系統事件:

  • 產品:网络智能服务。

  • 事件名稱:VBR入方向流量陡降或VBR出方向流量陡降。

    單擊查看 VBR入方向流量陡降 規則定義

    監控分鐘級的VBR執行個體IDC到VPC方向流入速率,若同時滿足以下條件,則觸發警示。

    條件一:持續3分鐘,每分鐘環比前7分鐘的平均速率下跌≥99%;

    條件二:持續3分鐘,每分鐘環比前7分鐘的平均速率下跌絕對值≥1 Mbps;

    條件三:持續3分鐘,每分鐘環比前15、30和60分鐘的平均速率下跌絕對值≥0.5 Mbps;

    條件四(智能基準警示):通過學習VBR執行個體的歷史流入速率周期性規律,預測下一周期流入速率穩定區間,若在周期到達時,3分鐘內持續2分鐘突破預測區間下限≥99%,則判定為異常下跌。

    出方向規則定義同理,詳見NIS文檔:事件中心。

3. ECR流量異常

針對目標ECR添加警示規則。例如ECR流出到特定TR的歷史流量頻寬7x24小時穩定在100Mbps以上,那麼可將 監控值 < 1Mbps 視為流量跌停:

  • 產品:高速通道-专线网关。

  • 監控指標:轉發路由器(TR)實例監控 -> ECR到TR方向流出速率 。

    • 周期: 連續1個周期(1周期=1分鐘)。

    • 閾值:監控值 < 1Mbps (此處僅為樣本,請按照實際傳輸的流量頻寬設定合理的警示閾值)。

  • 維度:選擇目標地區和目標TR。

4. BGP和BFD異常

按照如下配置,訂閱系統事件:

  • 產品:网络智能服务。

  • 事件名稱:

    • BGP连接故障:BGP串連狀態從已串連變成其他狀態,會影響流量傳輸。

    • BFD狀態DOWN通知:BFD狀態異常,影響流量傳輸。

5. 流量探測丟包

按照如下配置,針對目標探測任務添加警示規則:

  • 產品:網站監控。

  • 監控指標:丟包率

    • 周期:連續1個周期(1周期=1分鐘)。

    • 閾值:平均值 = 100%。

6. 健全狀態檢查異常(無ECR的情境)

注意:健全狀態檢查僅針對無ECR的情境,包括 VBR直連VPC(即VBR上連,已停售) 或 VBR直連TR。

按照如下配置,針對目標探測任務添加警示規則:

  • 產品:Express Connect-邊界路由器。

  • 監控指標:VBR健全狀態檢查丟包率。

    • 周期:連續1個周期(1周期=1分鐘)。

    • 閾值:監控值 = 100%。

操作步驟

添加警示規則

  1. 前往警示規則配置頁。根據不同的目標資源:

    • 物理連接埠 或 邊界路由器VBR:

      1. 在目標物理連接埠/目標VBR的监控列,單擊對應的監控表徵圖image開啟监控彈窗。

      2. 在监控彈窗的右上方,單擊預警設定跳轉到CloudMonitor控制台,頁面會自動開啟建立警示規則-修改規則描述彈窗。

    • 專線網關ECR:

      1. 在CloudMonitor控制台目標ECR的操作列,單擊監控圖表。

      2. 然後在圖表頁面右上方單擊建立警示規則,頁面會自動開啟建立警示規則-修改規則描述彈窗。

    • 流量探測:

      1. 在CloudMonitor控制台警示服務-警示規則頁面,單擊建立警示規則。

      2. 在建立警示規則彈窗中:選擇產品為網站監控;資源範圍為執行個體,並在關聯資源中單擊添加執行個體選擇目標流量探測任務;規則描述中單擊添加規則 -> 簡單指標,開啟修改規則描述彈窗。

    • 健全狀態檢查:

      1. 在CloudMonitor控制台警示服務-警示規則頁面,單擊建立警示規則。

      2. 在建立警示規則彈窗中:選擇產品為Express Connect-邊界路由器;資源範圍為執行個體,並在關聯資源中單擊添加執行個體選擇目標VBR;規則描述中單擊添加規則 -> 簡單指標,開啟修改規則描述彈窗。

  2. 在修改規則描述彈窗中:

    • 規則名稱:設定有意義的名稱,例如xxx異常。

    • 指標類型:保持預設的簡單指標。

    • 監控指標:根據關鍵警示配置選擇目標監控指標,並在閾值及報警級別的緊急區塊中設定周期、閾值。

      設定完畢後,單擊確定。

  3. 在建立警示規則彈窗中:

    • 通道沉默周期:警示通知發送後,在設定時間長度內,同一條警示即使持續觸發也不再重複發送。預設24小時,即同一警示每24小時最多通知一次。

    • 報警聯繫人組:下拉選擇目標組。若下拉框為空白,請先建立警示連絡人和警示連絡人群組。

    設定完畢後,單擊確認。

訂閱系統事件

  1. 前往CloudMonitor事件訂閱頁面,單擊創建訂閱策略。

  2. 在創建訂閱策略頁面:

    1. 基本信息:輸入有意義的名稱,例如xxx異常。

    2. 報警訂閱:訂閱類型選擇系統事件,訂閱範圍根據關鍵警示配置選擇目標產品和事件名稱,其他項保持預設不填。

    3. 合併降噪:保持預設。

    4. 通知:下拉選擇目標通知配置。若為空白請先建立通知配置策略。

    5. 推送與集成:保持預設不填。

    最後單擊頁面底部的提交。

驗證警示

完成本文配置後,建議定期做一次警示演練,驗證聯絡組、通知渠道、值班響應鏈路是否仍然有效,避免警示配置完即遺忘,確保警示生效。

下面以物理專線故障演練為例,驗證警示有效性:

警告

故障演練會通過將被演練的資源關閉,使資源處於人工構造的故障狀態,請確保您已將演練資源進行冗餘配置,否則會導致業務中斷。

  1. 前往故障演练頁面,單擊创建任务。

  2. 在创建任务頁面,

    • 地域:選擇目標物理連接埠所在的地區。

    • 演练资源:選擇物理专线,然後選中下方左側的目標物理連接埠,通過單擊箭頭挪到右側已選擇執行個體面板中。

    • 演练方式:選擇立即开始。

    • 演练时长:選擇實際可接受的時間長度,本文以5分鐘為例。

    • 確認無誤後,單擊確定。

  3. 顯示创建故障演练任务成功後,單擊查看详情確認演練任務的基本資料。

    • 演練狀態會先變為开始中,然後進入演练中狀態。

    • 狀態進入演练中後,警示連絡人將收到警示資訊。郵件方式的警示資訊樣本:

      ECR流量異常

      時間:2026-05-22 10:26:49

      警示層級:緊急

      執行個體名稱:[instanceId=ecr-fih7************,nodeRegion=eu-central-1,nodeId=tr-gw8m************]

      執行個體詳情:instanceId = ecr-fih************;

      nodeRegion = eu-central-1;

      userId = 11081************;

      nodeId = tr-gw8************;

      監控指標:ECR到TR方向流出速率

      警示條件:連續滿足1次 當前值<1 Mibit/s

      當前值:0bit/s

      資料詳情:__ts__=177************,

      __count__=1,

      instanceId=ecr-fih7sr************,

      nodeRegion=eu-central-1,

      Value=0,

      nodeId=tr-gw8m************,

      userId=1108************,

      timestamp=1779************,

      期間:1分鐘,

      警示規則:ECR到TR方向流出速率<1Mbps。

      BGP狀態警示

      【CloudMonitor】************下發生4次警示,最進階別 CRITICAL。

      使用者:尊敬的************一(110811************)

      開始時間:2026-05-21 23:03:31 CST

      最近觸發時間:2026-05-21 23:14:43 CST

      警示抑制:直接通知

      策略規則:************

      相關警示事件:CRITICAL 2026-05-21 23:14:43 CST

      服務名稱:網路智慧型服務

      執行個體名稱:vbr-gw************

      影響資源:acs:EC:eu-central-1:11081************:instance/vbr-gw822************

      地區:德國1(法蘭克福)(eu-central-1)

      事件名稱:BGP串連故障 說明: 支援的雲產品及其系統事件

      事件內容:impact : {"EC":["vbr-gw8************"]}

      description:Express Connect:vbr-gw822e************物理網路連通性故障或BGP配置異常導致BGP串連故障導致路由丟失。BGP相關資訊為 bgpGroupId:bgpg-gw8ns************,bgpPeerId:bgp-gw8hw************,建議聯絡商務經理處理。

      event_time:2026-05-21T15:14:00Z

      流量探測

      尊敬的使用者xxx ,您好:

      網站監控執行個體:taskName=alert,address=172.16.0.1,丟包率於2026-05-22 10:26:58發生警示,平均值為100%,期間0分鐘。

      規則詳情:警示規則xxx,丟包率的1分鐘統計值,連續1次滿足運算式平均值==100 %

      健全狀態檢查

      【CloudMonitor】尊敬的xxxx , xxx-Express Connect-專線串連 發生警示

      時間: 2026-05-22 10:29:08

      警示層級:緊急

      執行個體名稱:[a-idc]

      執行個體詳情:instanceId = vbr-gw8v************;

      userId = 1108************;

      監控指標:VBR健全狀態檢查丟包率

      警示條件:連續滿足3次 當前值==100 %

      當前值:100%

      資料詳情:__ts__=1779416910000,

      __count__=1,

      instanceId=vbr-gw8v************,

      Value=100,

      userId=11081************,

      timestamp=1779416820000,

      期間:4分鐘,

      警示規則:xx規則

如果警示規則類的警示未觸發,請先確認警示連絡人的連絡方式有效,再確認指標變化:

  1. 在目標警示規則的操作列,單擊修改。

  2. 在修改警示規則滑窗中,單擊規則描述最右側的編輯表徵圖image,開啟修改規則描述滑窗。

  3. 在修改規則描述滑窗中,查看監控圖表預覽中的指標趨勢,確認指標是否匹配警示周期和閾值。

相關文檔