インスタンスのヘルス診断、システムイベント、メトリクス、アラートを使用して、ビジネスに影響が出る前に Elastic Compute Service (ECS) インスタンスの問題を検出し、解決します。
システムイベントへの迅速な対処
システムは、O&M アクションを実行したり、インスタンスの運用に影響を与える可能性のある問題を検出したりすると、システムイベントを送信します。各イベントには、推奨されるアクションとタイムラインが含まれています。インスタンスの再起動や停止などの問題がビジネスに影響を与えるのを防ぐために、システムイベントには迅速に対処してください。詳細については、「ECS システムイベントの概要」をご参照ください。
次の図は、まもなく期限切れとなるサブスクリプションインスタンスに関するシステムイベントの例です。
[メッセージセンター] で、ECS の有効期限、製品 O&M、および ECS 障害通知の内部メッセージを有効にします。そうしないと、ECS コンソールでシステムイベントを受信できなくなります。次の図に設定ページを示します。
インスタンスメトリクスの表示
Alibaba Cloud は、リアルタイムおよび過去のインスタンスメトリクスを収集して表示します。これらのメトリクスを使用して、インスタンスが正常に実行されているかどうかを判断できます。たとえば、CPU 使用率が一貫して高い場合は、異常なプロセスまたはインスタンスのスペック不足を示している可能性があります。
インスタンスメトリックは、ECS コンソールのインスタンス詳細ページの [モニタリング] タブ、または CloudMonitor コンソールのホストモニタリングページで表示できます。詳細については、「インスタンスのモニタリング情報を表示する」および「ホストモニタリングの概要」をご参照ください。
-
ECS コンソールのインスタンス詳細ページのメトリクス:
-
CPU 使用率、ディスクの読み書きステータス、パケット数などのコンピューティング、ストレージ、ネットワークリソースの使用状況。
-
バーストパフォーマンスインスタンスの CPU クレジット使用量。

-
-
CloudMonitor コンソールのホストモニタリングページの [OS モニタリング] タブのメトリクス:
-
CPU 使用率、ディスクの読み書きステータス、パケット数などのコンピューティング、ストレージ、ネットワークリソースの使用状況。
-
インスタンス内のアクティブプロセス情報。
-
GPU コンピューティング型インスタンスの GPU メモリ使用量。

-
アラート通知の設定
特定のイベントまたはインスタンスのメトリクスに対して CloudMonitor のアラート ルールを設定できます。イベントが発生するか、メトリクスが異常になると、CloudMonitor はメールなどの方法で連絡先に通知します。詳細については、「ECS システムイベント通知のサブスクライブ」および「ECS インスタンスのアラートルールの設定」をご参照ください。
次の図は、イベントのアラート ルールの例です。

次の図は、インスタンスメトリクスのアラート ルールの例です。
