アラートを設定することで、専用回線の障害をタイムリーに検出し、ビジネスへの影響を最小限に抑えることができます。
背景情報
専用回線に障害が発生すると、通常、ビジネス側ではすぐにパケット損失や到達不能性が検出されます。アラート設定が完全かつタイムリーであるかどうかが、異常を迅速に検出し、緊急対応プロセスを開始できるかを左右します。
Express Connect は CloudMonitor を利用してアラート機能を提供しており、以下の 2 種類のアラートをサポートしています。
アラートルール:メトリックのしきい値に基づくアラートです。アップ/ダウン状態やトラフィック量などの定量的メトリックの定期的なしきい値監視に適しています。しきい値は手動で定義する必要があります。
システムイベント:イベントに基づくサブスクリプションです。システムイベントは、BGP 障害、BFD ダウン、Virtual Border Router (VBR) のトラフィック低下など、Alibaba Cloud が複数のバックエンドメトリックを総合的に分析して特定した障害や異常です。しきい値を定義する必要はなく、すぐに利用できます。
主要なアラート設定
以下の主要なアラートを設定することを推奨します。
1. 物理ポートの障害
対象の物理ポートに対して、アラートルールを追加する際に、以下の設定を行います。
製品:Express Connect - 物理ポート。
モニタリングメトリック: PhysicalConnectionStatus
サイクル:1 連続期間 (1 期間 = 1 分)。
しきい値:ステータス < 1。これは物理ポートの障害を示します。
2. VBR トラフィックの異常
システムイベントをサブスクライブする際に、以下の設定を行います。
プロダクト: Network Intelligence Service。
イベント名: risk-ec-inTrafficDroppedToZero または risk-ec-outTrafficDroppedToZero。
3. ECR トラフィックの異常
対象の Express Connect Router (ECR) に対して アラートルールを追加する際に、以下の設定を行います。例えば、ECR から特定の Transit Router (TR) への過去のアウトバウンドトラフィックが 24 時間 365 日安定して 100 Mbps を超えている場合、監視値が 1 Mbps 未満になることをトラフィックの低下と見なすことができます。
製品: Express Connect Router。
モニタリングメトリック: 転送ルーター (TR) インスタンスモニタリング -> ECR から TR 方向のアウトバウンドレート.
サイクル:1 連続期間 (1 期間 = 1 分)。
しきい値:監視値 < 1 Mbps (これは一例です。実際のトラフィック帯域幅に基づいて、合理的なアラートのしきい値を設定してください)。
ディメンション:対象のリージョンと対象の TR を選択します。
4. BGP および BFD の異常
システムイベントをサブスクライブする際に、以下の設定を行います。
製品:Network Intelligence Service。
イベント名:
risk-ec-bgpRouterFail:BGP 接続状態が Connected から他の状態に変化した場合、トラフィック伝送に影響が出ます。
BFD ステータス DOWN 通知:BFD 状態の異常はトラフィック伝送に影響を与えます。
5. トラフィックプロービングのパケット損失
対象のプロービングタスクに対して アラートルールを追加する際に、以下の設定を行います。
製品:New Sitemonitor。
モニタリングメトリック:パケット損失率
サイクル:1 連続期間 (1 期間 = 1 分)。
しきい値: 平均値 = 100%。
6. ヘルスチェックの異常 (ECR を使用しないシナリオ)
注:ヘルスチェックは、VBR が VPC に直接接続されている (VBR-to-VPC、提供終了)、または VBR が TR に直接接続されているなど、ECR を使用しないシナリオにのみ適用されます。
対象のプロービングタスクに対して アラートルールを追加する際に、以下の設定を行います。
製品: ExpressConnect-VBR。
モニタリングメトリック: VBR 正常性チェックのパケット損失率。
サイクル:1 連続期間 (1 期間 = 1 分)。
しきい値:監視値 = 100%。
操作手順
アラートルールの追加
アラートルール設定ページに移動します。対象のリソースに応じて操作が異なります。
物理ポートまたは Virtual Border Router (VBR):
Express Connect Router (ECR):
CloudMonitor コンソールの ターゲット ECR 列で、アクション の モニタリングチャート をクリックします。
次に、チャートページの右上隅で アラームルールを作成 をクリックします。アラームルールを作成-ルールの説明の変更 ダイアログが自動的に表示されます。
トラフィックプロービング:
CloudMonitor コンソールの アラートサービス - アラートルール ページで、アラームルールを作成 をクリックします。
アラームルールを作成 ダイアログで、製品 を サイトモニター に、リソース を インスタンスリスト に設定し、関連リソース で インスタンスの追加 をクリックしてターゲットのトラフィックプロービングタスクを選択します。ルールの内容 で、ルールの追加 -> シンプルインジケーター をクリックして ルールの説明の変更 ダイアログを開きます。
ヘルスチェック:
CloudMonitor コンソールの アラートサービス - アラートルール ページで、アラームルールを作成 をクリックします。
アラームルールを作成 ダイアログで、製品 を ExpressConnect-VBR に設定します。リソース を インスタンスリスト に設定し、関連リソース で インスタンスの追加 をクリックしてターゲット VBR を選択します。ルールの内容 で ルールの追加 -> シンプルインジケーター をクリックして、ルールの説明の変更 ダイアログを開きます。
ルールの説明の変更 ダイアログでは、
アラームルール名:xxx の異常など、分かりやすい名前を入力します。
インジケータータイプ: デフォルトの シンプルインジケーター のままにします。
モニタリングメトリック: 主要なアラート設定に基づいて モニタリング指標 を選択し、しきい値とアラームレベル の 緊急事態 セクションで サイクル と しきい値 を設定します。
構成が完了したら、確認 をクリックします。
アラームルールを作成 ダイアログでは:
チャンネル沈黙サイクル → ミュートサイクル:アラート通知が送信された後、アラートが継続的にトリガーされても、指定された期間内は同じアラートが繰り返し送信されません。デフォルトの期間は 24 時間で、各アラートは 24 時間に最大 1 回送信されることを意味します。
アラーム連絡先グループ:ドロップダウンリストから対象のグループを選択します。ドロップダウンリストが空の場合は、まず「アラート連絡先とアラートグループの作成」を行ってください。
構成完了後、OK をクリックします。
システムイベントのサブスクライブ
CloudMonitor の イベントサブスクリプション ページに移動し、サブスクリプションポリシーの作成 をクリックします。
サブスクリプションポリシーの作成 ページで:
基本情報:xxx 例外など、分かりやすい名前を入力します。
アラームサブスクリプション: サブスクリプションタイプ を システムイベント に設定し、サブスクリプションスコープ には 主要なアラート設定 に基づいて、対象の 製品 と イベント名 を選択し、その他の設定はデフォルトのままにします。
複合ノイズリダクション:デフォルト設定のままにします。
通知:ドロップダウンリストから対象の 通知設定 を選択します。リストが空の場合は、まず 通知ポリシーを作成 してください。
プッシュと統合:このフィールドは空のままにします。
ページの下部にある送信をクリックします。
アラートの検証
このトピックの設定が完了したら、定期的にアラート訓練を実施して、連絡先グループ、通知チャネル、オンコール対応チェーンが有効であることを確認することを推奨します。これにより、設定後にアラート設定が忘れ去られるのを防ぎ、アラートが確実に機能するようにします。
以下の例では、物理専用回線の障害訓練を使用してアラートの有効性を検証します。
障害訓練では、訓練対象のリソースをシャットダウンすることで人為的に障害状態にします。訓練リソースに冗長性が設定されていることを確認してください。そうでない場合、ビジネスが中断される可能性があります。
故障ドリル ページに移動し、タスクの作成 をクリックします。
タスクの作成 ページで、
リージョン:対象の物理ポートが配置されているリージョンを選択します。
ドリル用リソース: Express Connect 回線 を選択します。次に、左下で対象の物理ポートを選択し、矢印をクリックして右側の [選択済みインスタンス] パネルに移動します。
ドリルの方法:今すぐ始める を選択します。
ドリル期間:許容できる期間を選択します。このトピックでは、例として 5 分を使用します。
設定を確認したら、OK をクリックします。
障害ドリルタスクが作成されました が表示されたら、詳細の表示 をクリックしてドリルタスクの基本情報を確認します。
ドリルステータスは、まず 開始中 に変わり、次に ドリル中 状態になります。
ステータスがドリル中 に変更されると、アラーム送信先 はアラートを受信します。以下に E メールアラートの例を示します。
ECR トラフィック異常
時間:2026-05-22 10:26:49
アラートレベル: 重大
インスタンス名: [instanceId=ecr-fih7************, nodeRegion=eu-central-1, nodeId=tr-gw8m************]
インスタンス詳細: instanceId = ecr-fih************;
nodeRegion = eu-central-1;
userId = 11081************;
nodeId = tr-gw8************;
メトリック: ECR から TR へのアウトバウンドレート
アラート条件: 1 回連続でトリガーされました。現在の値 < 1 Mibit/s
現在の値: 0 bit/s
データ詳細: __ts__=177************,
__count__=1,
instanceId=ecr-fih7sr************,
nodeRegion=eu-central-1,
Value=0,
nodeId=tr-gw8m************,
userId=1108************,
timestamp=1779************,
期間: 1 分、
アラートルール: [ECR から TR へのアウトバウンドレート < 1Mbps](ECR から TR へのアウトバウンドレート < 1Mbps)。
BGP ステータスアラート
[CloudMonitor] ************ が 4 件のアラートをトリガーしました。最高レベル:CRITICAL。
ユーザー: ************ 様 (110811************)
開始時刻: 2026-05-21 23:03:31 CST
最終トリガー時刻: 2026-05-21 23:14:43 CST
アラート抑制: 直接通知
ポリシールール: ************
関連アラートイベント:
CRITICAL 2026-05-21 23:14:43 CST
サービス名: Network Intelligence Service
インスタンス名: vbr-gw************
影響を受けるリソース: acs:EC:eu-central-1:11081************:instance/vbr-gw822************
リージョン:ドイツ (フランクフルト) (eu-central-1)
イベント名: BGP 接続障害。説明:サポートされているクラウドサービスとそのシステムイベント
イベント内容: impact : {"EC":["vbr-gw8************"]}
description : Express Connect:vbr-gw822e************ の BGP 接続障害は、物理的なネットワーク接続の障害または BGP 設定の異常によって発生し、ルート損失を引き起こします。BGP 詳細:bgpGroupId:bgpg-gw8ns************, bgpPeerId:bgp-gw8hw************。アカウントマネージャーにお問い合わせいただくことを推奨します。
event_time : 2026-05-21T15:14:00Z
トラフィックプロービング
ユーザー xxx 様
サイト監視インスタンス:taskName=alert, address=172.16.0.1。2026-05-22 10:26:58 にパケット損失アラートがトリガーされました。平均値は 100% で、持続時間は 0 分です。
ルール詳細:アラートルール xxx。パケット損失率の 1 分間の統計値が、式「average == 100%」に 1 回連続で一致しました。
ヘルスチェック
[CloudMonitor] xxxx 様、xxx-Express Connect-物理接続がアラートをトリガーしました
時間:2026-05-22 10:29:08
アラートレベル: 重大
インスタンス名: [a-idc]
インスタンス詳細: instanceId = vbr-gw8v************;
userId = 1108************;
メトリック: VBR ヘルスチェックパケット損失率
アラート条件: 3 回連続でトリガーされました。現在の値 == 100%
現在の値: 100%
データ詳細: __ts__=1779416910000,
__count__=1,
instanceId=vbr-gw8v************,
Value=100,
userId=11081************,
timestamp=1779416820000,
期間: 4 分、
アラートルール: [6. ヘルスチェックの異常 (ECR を使用しないシナリオ)](6. ヘルスチェックの異常 (ECR を使用しないシナリオ))
アラートルールのアラートがトリガーされない場合は、まずアラート連絡先の連絡先情報が有効であることを確認し、次にメトリックの変更を確認します。
ターゲットアラートルール 列で、Modify を アクション 列でクリックします。
アラームルールの変更 ペインで、ルールの内容 の右端にある編集アイコン
をクリックして ルールの説明の変更 ペインを開きます。ルールの説明の変更 ペインで、チャートプレビュー でメトリクスの傾向を表示し、メトリックがアラートの サイクル と しきい値 に一致するかどうかを確認します。
関連ドキュメント
CloudMonitor - アラートルール:アラートルールの作成と管理。
CloudMonitor - システムイベント:システムイベントの表示と管理。
NIS システムイベント:Express Connect に関連する複数のシステムイベントは、NIS プロダクトに属します。このドキュメントでは、Express Connect 関連のシステムイベントの詳細なルール定義を確認できます。