Network Intelligence Service (NIS) のイベントセンターは、プロアクティブなアラートを通知することで、リスクの特定、影響を受ける可能性のあるリソースの確認、ビジネスの中断の防止に役立ちます。
ユースケース
Alibaba Cloud は、O&M タスクの実行ステータス、リソースの問題、リソースステータスの変更など、クラウドネットワークリソースに関する通知を記録・送信するために、NIS でイベントを定義しています。
リスクと問題の通知
仕様を超える使用によるパフォーマンス低下、ISP リンクでのパケット損失によるサービス利用不可、インスタンスの有効期限が近いことを示すアラートなど、インスタンスの可用性やパフォーマンスを損なうイベントが発生した場合、Alibaba Cloud はイベントを NIS コンソールのイベントセンターにプッシュします。リソースの可用性やパフォーマンスの低下によるビジネスの中断を防ぐため、これらのイベントに迅速に対応してください。
O&M の自動化
NIS コンソールに表示される各イベントにはステータスが定義されており、関連するシステム O&M タスクの実行状況の追跡に役立ちます。イベントが生成されるか、そのステータスが変更されると、システムはそれを CloudMonitor に報告します。これにより、ビジネス要件に基づいて、イベント駆動型の自動化された O&M システムを構築できます。
制限事項
Network Intelligence Service (NIS) は、販売終了となったインスタンスファミリーのイベント機能をサポートしていません。詳細については、「各クラウドサービスの販売終了に関するお知らせ」をご参照ください。
基本
イベントタイプ
イベントは Alibaba Cloud によって定義され、クラウドネットワークリソースに関する情報を記録し、通知を送信します。原因に基づき、イベントは次のように分類されます:
カテゴリ | 説明 | 例 |
問題イベント | すでにビジネスへの影響を引き起こし、7 日間 進行中 の状態が続いている例外的なイベント。 |
|
リスクイベント | ビジネスへの影響を引き起こす可能性があり、7 日間 進行中 の状態が続いている例外的なイベント。 |
|
イベントレベル
インスタンスの正常な動作に与える影響に基づいて、イベントは次のレベルに分類されます:
クリティカル:重大な影響を及ぼします。インスタンスが利用できなくなるのを防ぐために、即時の対応が必要です。
警告:中程度の影響を及ぼします。イベントが継続している間は監視するか、適切なタイミングで対応する必要があります。
情報:これらのイベントは情報提供を目的としており、即時の対応は必要ありません。
詳細については、「イベントの概要」をご参照ください。
イベントの概要
このセクションでは、NIS がサポートするイベントをまとめ、各イベントの推奨アクションを示します。
問題イベントは、共有リソース型 CLB インスタンスのモニタリングに対応していません。
問題イベント
イベントコード | イベント名 | イベントレベル | CloudMonitor イベント名 | CloudMonitor メトリック名 | 説明と影響 | アラートルール | 推奨アクション |
インターネット向けインスタンス | |||||||
problem-internetBandwidthOverlimit | 帯域幅使用量の超過によるパケット損失 | クリティカル | インスタンス帯域幅使用量の超過によるパケット損失 |
| インターネット向けインスタンスの実際の帯域幅使用量が仕様を超えたため、パケット損失が発生しています。 インターネット向けインスタンスには、Elastic IP アドレス (EIP) インスタンス、帯域幅プラン、クラシックロードバランサー (CLB) インスタンスが含まれます。 | クリティカル: 過去 10 分間で帯域幅使用量が頻繁に制限を超え、パケット損失が発生しています。 | インスタンスをアップグレードして、ピーク帯域幅を増やしてください。 |
NAT ゲートウェイ | |||||||
problem-nat-sessionOverLimit | NAT セッションの超過による接続ドロップ | クリティカル | NAT セッションの超過による接続ドロップ |
| NAT ゲートウェイのセッション数が仕様を超えたため、新規セッションの確立に失敗し、パケット損失率が 100 パケット/秒を超えています。 | クリティカル: 過去 10 分間で同時セッション数が頻繁に制限を超え、パケット損失率が 100 パケット/秒を超えています。 | 仕様をアップグレードするか、複数の NAT ゲートウェイインスタンスを使用してください。詳細については、NAT ゲートウェイのクォータを管理する、インターネット NAT ゲートウェイ、VPC NAT Gateway インスタンスの作成と管理をご参照ください。 |
problem-nat-sessionNewOverLimit | 新規 NAT セッションの超過による接続ドロップ | クリティカル | 新規 NAT セッションの超過による接続ドロップ |
| NAT ゲートウェイの新規セッション率が仕様を超えたため、新規セッションの確立に失敗し、パケット損失率が 100 パケット/秒を超えています。 | クリティカル: 過去 10 分間で新規セッション数が頻繁に制限を超え、パケット損失率が 100 パケット/秒を超えています。 | |
problem-nat-portAllocationError | SNAT 送信元ポートの割り当て失敗 | クリティカル | SNAT 送信元ポートの割り当て失敗 |
| NAT ゲートウェイインスタンスに設定された EIP または IP アドレスが少なすぎるため、送信元ポートの割り当てに失敗し、パケット損失率が 10 パケット/秒を超えています。 説明 このイベントのサブスクリプションは作成できません。 | クリティカル: 過去 10 分間で送信元ポートの割り当てが頻繁に失敗し、パケット損失率が 10 パケット/秒を超えています。 | NAT ゲートウェイインスタンスに関連付けられた EIP または IP アドレスを追加してください。詳細については、VPC NAT Gateway インスタンスの作成と管理をご参照ください。 |
problem-nat-datapathUnavailable | NAT Gateway のデータパスが利用不可 | クリティカル | NAT Gateway のデータパスが利用不可 | 該当なし (システム可用性イベント) | NAT ゲートウェイのデータパスが利用できません。過去 10 分間で NAT ゲートウェイの可用性が 0% だったため、すべてのトラフィックが影響を受け、NAT ゲートウェイが機能していません。これはプラットフォームレベルのイベントが原因である可能性があります。Alibaba Cloud のエンジニアが問題の解決に取り組んでいます。 | クリティカル: 過去 10 分間で NAT ゲートウェイの可用性が 0% でした。 | 高可用性のために複数の NAT ゲートウェイをデプロイしている場合は、別の NAT ゲートウェイに切り替えることを推奨します。詳細については、複数の NAT ゲートウェイをデプロイして高可用性を実現するをご参照ください。それ以外の場合は、Alibaba Cloud のエンジニアに連絡して最新の復旧状況を確認してください。 |
problem-nat-datapathDegraded | NAT Gateway のデータパスが劣化 | クリティカル | NAT Gateway のデータパスが劣化 | 該当なし (システム可用性イベント) | NAT ゲートウェイのデータパスが劣化しています。過去 10 分間で NAT ゲートウェイの可用性が 80% を下回ったため、20% 以上のトラフィックが影響を受け、NAT ゲートウェイが正常に機能していません。これはプラットフォームレベルのイベントが原因でパケット損失が発生している可能性があります。Alibaba Cloud のエンジニアが問題の解決に取り組んでいます。 | クリティカル: 過去 10 分間で NAT ゲートウェイの可用性が 80% 未満となり、パケット損失が発生しています。 | |
クラシックロードバランサー (CLB) | |||||||
problem-clb-connectionOverLimit | CLB セッションの超過による新規接続のドロップ | クリティカル | CLB セッションの超過による新規接続のドロップ |
| CLB インスタンスの新規接続数または同時接続数が仕様を超えたため、新規セッションの確立に失敗し、接続のドロップ率が高くなっています。 | クリティカル: 過去 10 分間で同時セッション数が頻繁に制限を超え、パケット損失が発生しています。 | インスタンスをアップグレードするか、Network Load Balancer (NLB) または Application Load Balancer (ALB) インスタンスに切り替えてください。 詳細については、CLB クォータの管理をご参照ください。NLB および ALB の製品詳細については、Network Load Balancer (NLB) とはおよびApplication Load Balancer (ALB) とはをご参照ください。 |
problem-clb-bandwidthOverLimit | CLB 帯域幅使用量の超過によるパケット損失 | クリティカル | CLB 帯域幅使用量の超過によるパケット損失 |
| CLB インスタンスの実際のトラフィックが帯域幅仕様を超えたため、パケット損失が発生しています。 | クリティカル: 過去 10 分間で帯域幅使用量が頻繁に仕様を超え、ドロップ率が 100 bps を超えています。 | インスタンスの仕様をアップグレードしてください。詳細については、パフォーマンス保証型インスタンスの仕様を調整するをご参照ください。 |
problem-clb-connectionFail | CLB 接続失敗の急増 | クリティカル | CLB 接続失敗の急増 | CloudMonitor でサポートされていません | CLB インスタンスの接続失敗数が急増しています。これは、バックエンドサーバーの仕様を超過している、ロードが高すぎる、またはサービスに例外が発生していることが原因である可能性があります。 | クリティカル: 過去 10 分間で CLB インスタンスの新規接続失敗数が急増しています。次のすべての条件を満たす場合にアラートがトリガーされます。 条件 1: 接続失敗数が 100/秒を超えている。 条件 2: 接続失敗数が前の 10 分間と比較して 30% 増加している。 条件 3: 履歴データから学習したインテリジェントベースラインに基づき、10 分間で接続失敗数がベースラインの上限を 30% 以上継続的に超えている。 | 原因に応じて、バックエンドサーバーの仕様をアップグレードする、CLB の仕様をアップグレードする、またはバックエンドサービスのステータスを確認してください。 詳細については、CLB クォータの管理をご参照ください。 |
NLB | |||||||
problem-nlb-connectionFail | NLB 接続失敗の急増 | クリティカル | NLB 接続失敗の急増 | CloudMonitor でサポートされていません | NLB インスタンスの仮想 IP アドレス (VIP) での接続失敗数が 10 分間連続して急増しています。考えられる原因は次のとおりです。
| クリティカル: NLB インスタンスの接続失敗数が次のすべての条件を満たす場合にアラートがトリガーされます。 条件 1: 610 秒のモニタリングウィンドウ内で、接続失敗数がインテリジェント予測ベースラインを 100% 超える状態が 3 分間連続しています。 条件 2: 610 秒のモニタリングウィンドウ内で、接続失敗数が前の 1 時間と比較して 50% 以上増加した状態が 7 分間連続しています。 条件 3: 610 秒のモニタリングウィンドウ内で、接続失敗数が 1,000 以上の状態が 8 分間連続しています。 | バックエンドサーバーのリソースまたはサービスステータスが正常かどうかを確認してください。 |
problem-nlb-newConnectionSurge | NLB 新規接続のドロップ | クリティカル | NLB 新規接続のドロップ |
| 新規接続の急増により、NLB インスタンスの VIP がミリ秒または秒間隔で新規接続リクエストを継続的にドロップしています。 | クリティカル: NLB インスタンスの接続数が次のすべての条件を満たす場合にアラートがトリガーされます。 条件 1: 10 分以内に、VIP が秒間にドロップした接続数が 0 を超えるデータポイントが 8 個超あります。 条件 2: 10 分以内に、VIP が秒間に確立した新規接続数が 200,000 未満のデータポイントが 8 個超あります。 |
複数の NLB インスタンスにトラフィックを分散するか、アカウントマネージャーに連絡してクォータの増加を申請してください。 |
problem-nlb-newConnectionOverLimit | NLB 新規接続の超過 | クリティカル | NLB 新規接続の超過 |
| NLB インスタンスの VIP の新規接続数が単一 VIP の自動スケーリング制限を超えたため、新規接続リクエストが継続的にドロップされています。 | クリティカル: NLB インスタンスの接続数が次のすべての条件を満たす場合にアラートがトリガーされます。 条件 1: 10 分以内に、VIP が秒間にドロップした接続数が 0 を超えるデータポイントが 8 個超あります。 条件 2: 10 分以内に、VIP が秒間に確立した新規接続数が 200,000 以上のデータポイントが 8 個超あります。 | |
problem-nlb-concurrentConnectionOverLimit | NLB 同時接続の超過 | クリティカル | NLB 同時接続の超過 |
| NLB インスタンスの VIP の同時接続数が単一 VIP の自動スケーリング制限を超えたため、新規接続リクエストが継続的にドロップされています。 | クリティカル: NLB インスタンスの接続数が次のすべての条件を満たす場合にアラートがトリガーされます。 条件 1: 10 分以内に、VIP が秒間にドロップした接続数が 0 を超えるデータポイントが 8 個超あります。 条件 2: 10 分以内に、VIP の最大同時接続数が 5,000,000 を超えるデータポイントが 8 個超あります。 | |
ALB | |||||||
problem-alb-intranetBandwidthOverLimit | ALB インスタンスのプライベート帯域幅使用量の超過によるパケット損失 | クリティカル | ALB インスタンスのプライベート帯域幅使用量の超過によるパケット損失 | CloudMonitor でサポートされていません | ALB インスタンスの VIP アドレスのアウトバウンドまたはインバウンド帯域幅が制限に達しています。ALB ドメイン名から解決される単一の VIP には帯域幅制限があります。 | クリティカル: 10 分以内に、ALB インスタンスがドロップしたトラフィックが 100 bps を超えるデータポイントが 8 個超あります。 | ALB インスタンスに CNAME レコードを追加してください。詳細については、ALB インスタンスに CNAME レコードを追加するをご参照ください。 |
problem-alb-sessionOverLimit | ALB セッションの超過による新規接続のドロップ | クリティカル | ALB セッションの超過による新規接続のドロップ |
| ALB インスタンスの VIP アドレスの新規接続数または同時接続数が制限を超えたため、新規セッションの確立に失敗しています。ALB ドメイン名から解決される単一の VIP には新規接続制限があります。 | クリティカル: 10 分以内に、ALB インスタンスが秒間にドロップした接続数が 0 を超えるデータポイントが 8 個超あります。 | |
problem-alb-qpsOverLimit | QPS が制限を超えたため 503 エラーコードが返される | クリティカル | QPS が制限を超えたため 503 エラーコードが返される | CloudMonitor でサポートされていません | ALB インスタンスの VIP アドレスの秒間クエリ数 (QPS) が VIP 制限に達しています。ALB ドメイン名から解決される単一の VIP には QPS 制限があります。 | クリティカル: 10 分以内に、秒間にドロップされたリクエスト数が 200 qps を超えるデータポイントが 8 個超あり、かつ 10 分間連続して、秒間にドロップされたリクエスト数が 7 分前と比較して 30% 以上増加しています。 | |
Cloud Enterprise Network (CEN) | |||||||
problem-cen-routeOverLimit | CEN ルートの超過 | クリティカル | CEN ルートの超過 | 該当なし (イベントベースのメトリック) | CEN ルートのクォータを超えているため、ネットワークの問題が発生する可能性があります。 | クリティカル: CEN ルートのクォータを超えており、ネットワークの問題が発生しています。 | トランジットルーター (TR) をアップグレードしてください。詳細については、基本トランジットルーターをエンタープライズトランジットルーターにアップグレードするをご参照ください。 |
TR | |||||||
problem-cen-vpcAttachBandwidthOverLimit | VPC 接続帯域幅の超過によるパケット損失 | クリティカル | VPC 接続帯域幅の超過によるパケット損失 | CloudMonitor でサポートされていません | トランジットルーターの実際のトラフィックが帯域幅仕様を超えたため、パケット損失が発生しています。 | クリティカル: 10 分以内に、インバウンドパケット損失率が 0 を超えるデータポイントが 5 個超あります。 | 帯域幅制限を増やしてください。詳細については、CEN クォータの管理をご参照ください。 |
problem-cen-peerAttachBandwidthOverLimit | リージョン間接続帯域幅の超過によるパケット損失 | クリティカル | リージョン間接続帯域幅の超過によるパケット損失 |
| トランジットルーターの実際のトラフィックが帯域幅仕様を超えたため、パケット損失が発生しています。 | クリティカル: TR インスタンスの実際のトラフィックが次のすべての条件を満たす場合にアラートがトリガーされます。 条件 1: 10 分以内に、ピークアウトバウンド帯域幅使用率が 90% 以上のデータポイントが 8 個超あります。 条件 2: 10 分以内に、アウトバウンドレート制限パケットドロップ率が 100 pps を超えるデータポイントが 8 個超あります。 | 帯域幅制限を増やしてください。詳細については、CEN クォータの管理をご参照ください。 |
リスクイベント
イベントコード | イベント名 | イベントレベル | CloudMonitor イベント名 | CloudMonitor メトリクス名 | 説明と影響 | アラートルール | 推奨アクション |
インターネット向けインスタンス | |||||||
risk-internetPacketLoss | インターネットリンクのパケット損失リスク | 警告 | Risk of Internet link packet loss | 該当なし (インターネットリンクのプローブイベント) | プローブにより、Alibaba Cloud {Region} から {Country} - {Area} - {ISP} への物理リンクでパケット損失が検出されました。お客様のアカウントで、このリンク上のトラフィックにジッターが発生する可能性があります。 | クリティカル:次のいずれかの条件を満たす場合にアラートがトリガーされます: 条件 1:リージョンレベルの ISP リンクで検出されたパケット損失率が 50% を超えている。 条件 2:国レベルの ISP リンクでパケット損失が検出され、かつ過去 10 分間におけるお客様のアカウント内のこのリンク上のトラフィックの平均帯域幅が 0.05 Mbps 以上である。 説明
警告:インターネットリンクのパケット損失率が 50% 未満で、かつ過去 10 分間の平均帯域幅が 0.5 Mbps を超えています。 | このリンク上のインスタンス帯域幅がビジネス要件を満たしているかどうかを確認してください (トラフィック分析の 5 タプルデータを参照できます)。問題がある場合は、重要なサービスを別のリージョンに移行することを検討してください。問題がない場合は、このアラートを無視できます。 |
risk-internetBandwidthOverlimit | 帯域幅使用量の超過によるパケット損失リスク | 警告 | Packet loss risk due to excess bandwidth usage |
| 過去のデータは、インスタンスの帯域幅使用量が仕様を超過する確率が 90% を超えることを示しています。 | 警告:特定の時点でトラフィックが仕様を超過してパケット損失が発生する確率が 90% を超えています。 | 使用状況をモニタリングしてください。仕様を超過した場合は、インスタンス仕様のアップグレードを検討してください。 |
VPN Gateway | |||||||
risk-vpn-bpsOverLimit | VPN の帯域幅使用量の超過リスク | 警告 | Risk of excess VPN bandwidth usage |
| 過去 10 分間に、VPN Gateway インスタンスの帯域幅使用率が 90% を超えるデータポイントが 3 つを超えて観測されました。 | 警告:10 分以内に、帯域幅使用率が 90% を超えるデータポイントが 3 つを超えています。 |
|
risk-vpn-bgpRouteLimit | BGP ルート数の超過リスク | 警告 | Risk of excess BGP routes | CloudMonitor ではサポートされていません | 過去 10 分間に VPN Gateway インスタンスが学習した BGP 動的ルート数が、インスタンスの BGP ルートクォータの 90% を超過しました。 | 警告:10 分以内に、ルート使用率が 90% を超えるデータポイントが 1 つを超えています。 | BGP ルートの使用状況をモニタリングしてください。クォータがほぼ上限に達している場合は、ネットワーク計画に基づいてピア VPN Gateway でルート集約を検討してください。 |
Express Connect | |||||||
risk-ec-physicalConnectionFail | Express Connect 回線またはポート障害 | 警告 | Express Connect circuit or port failure | 該当なし (リンクステータスイベント) | ISP の物理 Express Connect 回線の障害、またはデバイスのポート障害により、サービス中断が発生します。 | 警告:VBR インスタンスのインバウンドトラフィックレート (データセンターから VPC) を、分単位の粒度でモニタリングします。次のすべての条件を満たす場合にアラートがトリガーされます: 条件 1:3 ≤ Express Connect ポートダウンイベント数 < 20。 条件 2:Express Connect ポートが 2 つを超える連続データポイントでダウンしている。 条件 3:すべての Express Connect ポートがダウン状態ではない。 | 担当のビジネスマネージャーにお問い合わせください。 |
risk-ec-bgpRouterFail | BGP 接続障害 | 警告 | BGP connection failure | 該当なし (BGP 接続ステータスイベント) | 物理 Express Connect 回線でのネットワーク接続障害、または BGP 設定の異常により、BGP 接続障害とルート損失が発生します。 | 警告:BGP 接続ステータスが Connected から他の状態に変化した場合にアラートがトリガーされます。 | 担当のビジネスマネージャーにお問い合わせください。 |
risk-ec-inTrafficDroppedToZero | VBR のインバウンドトラフィックの急減 | 警告 | Sharp drop in inbound VBR traffic |
| ISP の物理 Express Connect 回線の障害、またはデバイスのポート障害により、仮想ボーダールーター (VBR) のインバウンドトラフィックが急減します。 | 警告:VBR インスタンスのインバウンドトラフィックレート (データセンターから VPC) を、分単位の粒度でモニタリングします。次のすべての条件を満たす場合にアラートがトリガーされます: 条件 1:3 分間連続で、分あたりのレートが直前 7 分間の平均レートと比較して 99% 以上低下している。 条件 2:3 分間連続で、分あたりのレート低下の絶対値が直前 7 分間の平均レートと比較して 1 Mbps 以上である。 条件 3:3 分間連続で、分あたりのレート低下の絶対値が直前 15、30、60 分間の平均レートと比較して 0.5 Mbps 以上である。 条件 4 (インテリジェントベースラインアラート):インテリジェントベースラインが VBR インスタンスのインバウンドトラフィックレートの過去のパターンを学習し、次のサイクルにおける安定範囲を予測します。サイクル開始から 3 分以内に、レートが予測された下限を 99% 以上下回る状態が 2 分間連続した場合、異常な低下と見なします。 | これが通常のビジネストラフィックの挙動か、ヘルスチェックによる切り替えが発生したかを確認してください。ビジネスに影響がある場合は、担当のビジネスマネージャーにお問い合わせください。 |
risk-ec-outTrafficDroppedToZero | VBR のアウトバウンドトラフィックの急減 | 警告 | Sharp drop in outbound VBR traffic |
| ISP の物理 Express Connect 回線の障害、またはデバイスのポート障害により、VBR のアウトバウンドトラフィックが急減します。 | 警告:VBR インスタンスのアウトバウンドトラフィックレート (VPC からデータセンター) を、分単位の粒度でモニタリングします。次のすべての条件を満たす場合にアラートがトリガーされます: 条件 1:3 分間連続で、分あたりのレートが直前 7 分間の平均レートと比較して 99% 以上低下している。 条件 2:3 分間連続で、分あたりのレート低下の絶対値が直前 7 分間の平均レートと比較して 1 Mbps 以上である。 条件 3:3 分間連続で、分あたりのレート低下の絶対値が直前 15、30、60 分間の平均レートと比較して 0.5 Mbps 以上である。 条件 4 (インテリジェントベースラインアラート):インテリジェントベースラインが VBR インスタンスのアウトバウンドトラフィックレートの過去のパターンを学習し、次のサイクルにおける安定範囲を予測します。サイクル開始から 3 分以内に、レートが予測された下限を 99% 以上下回る状態が 2 分間連続した場合、異常な低下と見なします。 | これが通常のビジネストラフィックの挙動か、ヘルスチェックによる切り替えが発生したかを確認してください。ビジネスに影響がある場合は、担当のビジネスマネージャーにお問い合わせください。 |
関連操作
アクション | 説明と参照先 |
イベントの表示 | 次の方法でイベントを表示できます。
|
イベントのサブスクリプション | CloudMonitor でイベントをサブスクライブできます。サブスクライブ後、新しいイベントやステータスの更新について、電話、テキストメッセージ、またはメールで通知します。詳細については、「NIS イベントサブスクリプションの設定」をご参照ください。 |
イベントの処理 | イベントを表示した後、推奨事項に基づいて問題を解決できます。詳細については、「イベントの概要」をご参照ください。 |