リソースクォータを使用すると、GPU、CPU、メモリのメトリックを提供することでリソースの状態をモニタリングできます。アラートルールを設定すると、CPU 使用率がしきい値を超えるなど、リソースメトリックに異常が発生した際にシステムから通知が送信されます。CloudMonitor および ARMS を使用して、モニタリングデータを表示したり、アラートを設定したり、メトリックをサブスクライブしたりできます。
前提条件
モニタリングとアラートを設定する前に、リソースクォータを作成しておく必要があります。詳細については、「リソースクォータの概要」をご参照ください。
メトリック
PAI-Quota は、GPU、CPU、メモリ、ディスク、ネットワークリソースのメトリックを提供します。これらのメトリックは、クォータ単位またはノード単位で表示できます。すべてのメトリックの完全な一覧と詳細な説明については、「PAI-Quota メトリック」をご参照ください。
クォータ別
メトリック | 説明 |
GPU コンピュート使用率 (クォータ単位) | クォータの GPU コンピュート使用率です。 |
GPU メモリ使用率 (クォータ単位) | クォータの GPU メモリ使用率です。 |
スケジュール済み GPU 数 (クォータ単位) | クォータのスケジュール済み GPU の数です。 |
GPU 総数 (クォータ単位) | クォータの GPU 総数です。 |
GPU デバイス電力 (クォータ単位) | クォータの GPU デバイス消費電力です。 |
スケジュール済み CPU 数 (クォータ単位) | クォータのスケジュール済み CPU コア数です。 |
CPU 総数 (クォータ単位) | クォータの CPU コア総数です。 |
CPU 使用率 (クォータ単位) | クォータの CPU 使用率 (%) です。 |
メモリ使用率 (クォータ単位) | クォータのメモリ使用率 (%) です。 |
その他のメトリックについては、「PAI-Quota メトリック」をご参照ください。 | |
ノード単位
メトリック | 説明 |
GPU コンピュート使用率 (ノード単位) | ノードの GPU コンピュート使用率です。 |
GPU メモリ使用率 (ノード単位) | ノードの GPU メモリ使用率です。 |
スケジュール済み GPU 数 (ノード単位) | ノードのスケジュール済み GPU の数です。 |
GPU 総数 (ノード単位) | ノードの GPU 総数です。 |
GPU デバイス電力 (ノード単位) | ノードの GPU デバイス消費電力です。 |
スケジュール済み CPU 数 (ノード単位) | ノードのスケジュール済み CPU コア数です。 |
CPU 総数 (ノード単位) | ノードの CPU コア総数です。 |
CPU 使用率 (ノード単位) | ノードの CPU 使用率 (%) です。 |
メモリ使用率 (ノード単位) | ノードのメモリ使用率 (%) です。 |
その他のメトリックについては、「PAI-Quota メトリック」をご参照ください。 | |
モニタリングダッシュボードの表示
PAI コンソール にログインします。リソースクォータの詳細ページで、[モニタリング] タブをクリックしてモニタリングデータを表示します。
モニタリングページには、GPU、CPU、メモリ、ネットワーク、ディスクのメトリックが表示されます。これらのメトリックは、クォータ単位またはノード単位で表示できます。注記:モニタリングデータは最大 30 日間保持されます。
[詳細] をクリックして、表示するパフォーマンスメトリクスを選択します。また、優先度に基づいてメトリックをドラッグして並べ替えることもできます。
ダッシュボードでは、選択したエリアを拡大表示したり、拡大を元に戻したり、ビューをリセットしたり、チャートデータをダウンロードしたりできます。
チャート同期を有効にすると、ズームやパン操作がすべてのチャートに同時に適用され、異なるビューを簡単に比較できるようになります。
1 行に表示するチャートの数をカスタマイズできます。
CloudMonitor の使用
CloudMonitor は Alibaba Cloud サービスで、ご利用のリソースをモニタリングします。CloudMonitor を使用して PAI-Quota のモニタリングデータを表示したり、アラートを設定したり、API を通じてメトリックデータをサブスクライブしてカスタムダッシュボードを構築したりできます。詳細については、「CloudMonitor とは」をご参照ください。
課金
CloudMonitor の使用には料金が発生します。請求明細については、「CloudMonitor 課金」をご参照ください。
モニタリングデータの表示
-
Cloud Monitor コンソール にログインします。
-
左側のナビゲーションウィンドウで、 を選択します。
[クラウドサービスモニタリング] ページで、[PAI-Quota] を選択します。検索ボックスで、リソースクォータ名 を選択または検索します。対応するモニタリングチャートがページ下部に表示されます。
モニタリングチャートでは、以下の操作が可能です。
モニタリングディメンションの切り替え:メトリックを クォータ 単位または ノード 単位で表示できます。
時間範囲の切り替え:1 時間、3 時間、6 時間、12 時間、1 日、3 日、7 日、14 日、または カスタム の時間範囲を選択できます。
拡大表示:チャート右上隅の拡大アイコン
をクリックして詳細を表示します。
モニタリングとアラートの設定
アラート機能を使用して、リソースクォータ内のリソース使用量をモニタリングし、アラートルールを設定できます。リソース使用量が変動して指定されたしきい値を超えた場合、システムからアラートが送信されます。アラートを設定するには、次の手順を実行します。
ステップ 1:アラート連絡先の設定
-
Cloud Monitor コンソール にログインします。
-
左側のナビゲーションウィンドウで、 を選択します。
[アラート連絡先] タブで、[連絡先の作成] をクリックし、連絡先の名前、電話番号、メールアドレス、または Webhook URL を入力して、[確認] をクリックします。
[アラート連絡先グループ] タブで、[連絡先グループの作成] をクリックし、グループ名を入力し、既存のアラート連絡先をグループに追加してから、[確認] をクリックします。
ステップ 2:アラートルールの設定
-
CloudMonitor コンソール の左側のナビゲーションウィンドウで、クラウドリソース監視 > クラウドサービス監視 を選択します。
クラウドプロダクトモニタリング ページで、PAI-Quota を検索して移動します。
[PAI-Quota] ページで、ご利用のサービスが配置されているリージョンを選択し、[アラートルールの作成] をクリックします。
[アラートルールの作成] パネルで、以下のパラメーターを設定し、[確認] をクリックします。
パラメーター
説明
プロダクト
アラートルールを適用するプロダクトです。[PAI-Quota] を選択します。
リソース範囲
アラートルールの適用範囲です。有効値:すべてのリソース、インスタンス。
すべてのリソース:いずれかのリソースがアラートルールの条件を満たすと、アラート通知が送信されます。
インスタンス:関連リソース(リソースクォータ ID)を選択します。選択したインスタンスのいずれかがアラート条件を満たした場合にのみ、アラートがトリガーされます。
ルールの説明
アラートをトリガーする条件です。アラートルールの設定方法の詳細については、「アラートルールの作成」をご参照ください。
ミュート期間
未解決のアラートに対して通知を再送信する間隔です。
有効期間
アラートルールがアクティブになる期間です。
アラート連絡先グループ
アラート通知を受信する連絡先グループです。アラート連絡先が割り当てられているグループを選択します。
タグ
アラートルールのカスタムタグで、タグキーとタグ値で構成されます。
[PAI-Quota] ページで、[アラートルールの表示] をクリックして、作成済みのアラートルールの詳細を表示したり、アラート履歴を確認したり、ルールを変更したりできます。
API オペレーションを使用してアラートを設定することも可能です。これらのオペレーションを使用すると、アラート履歴を表示したり、アラートテンプレートを管理したり、アラートルールおよび連絡先を設定したりできます。詳細については、「アラート」をご参照ください。
メトリックのサブスクライブ
CloudMonitor は API サービスを提供しており、リソースクォータのメトリックおよびデータをサブスクライブできます。このサービスを使用して、独自のモニタリングシステムおよびダッシュボードを構築できます。詳細については、「クラウドプロダクトモニタリング」をご参照ください。
|
API |
説明 |
|
指定されたメトリックの最新のモニタリングデータを照会します。 |
|
|
指定されたクラウドサービスの指定されたメトリックのモニタリングデータを照会します。 |
|
|
指定されたクラウドサービスのメトリックのモニタリングデータを照会します。 |
|
|
利用可能なメトリックとそのメタデータの一覧を取得します。 |
|
|
時系列メトリックを提供するクラウドサービスの一覧を取得します。 |
|
|
指定されたクラウドサービスの指定されたメトリックの最新のモニタリングデータを照会し、その後そのメトリックのソートされたモニタリングデータを照会します。 |
次の例は、DescribeMetricList オペレーションを呼び出して、指定されたメトリックのメトリックデータを照会する方法を示しています。
PAI-Quota メトリック ページに移動します。
対象メトリックの 操作 列で、メトリックデータの取得 をクリックします。
OpenAPI Explorer で、以下の主要パラメーターを設定し、他のパラメーターはデフォルト設定を使用します。パラメーターの詳細については、「DescribeMetricList」をご参照ください。
パラメーター
説明
Namespace
acs_pai_quotaに設定します。MetricName
照会するメトリックの名前です。例:
QUOTA_CPU_REQUEST。StartTime
照会の時間範囲の開始時刻です。例:2024-05-15 00:00:00。
EndTime
クエリの時間範囲の終了時刻です。例: 2024-05-28 00:00:00。
説明期間は 31 日を超えることはできません。
パラメーターを設定したら、[呼び出しの開始] をクリックして、指定された時間範囲のメトリックデータを表示します。
ARMS の使用
Application Real-Time Monitoring Service (ARMS) は Alibaba Cloud ネイティブの可観測性プラットフォームです。ARMS を使用して PAI-Quota のカスタム Grafana ダッシュボードを作成し、Prometheus アラートルールを設定して、リソースクォータメトリックを完全にモニタリングできます。詳細については、「Application Real-Time Monitoring Service (ARMS) とは」をご参照ください。
課金
ARMS の使用には料金が発生します。請求明細については、「ARMS 課金」をご参照ください。
モニタリングデータの統合
手順:
-
ARMS コンソール にログインします。
左側のナビゲーションウィンドウで、[インテグレーションセンター] をクリックします。
[インテグレーションセンター] ページで、左側の [AI] タブをクリックし、[Alibaba Cloud PAI-Quota] をクリックします。
(オプション)表示されるパネルで、モニタリングダッシュボードをプレビューしたり、収集されたメトリックおよびアラートルールテンプレートを確認したりできます。
プレビュー
[プレビュー] タブをクリックして、メトリックダッシュボードを表示します。
メトリック
[メトリック] タブをクリックして、収集されたメトリックの一覧を表示します。
アラートルールテンプレート
[アラートルールテンプレート] タブをクリックして、事前定義されたアラートルールテンプレートを表示します。
パネルの [統合の開始] タブで、以下のパラメーターを設定し、[確認] をクリックします。
パラメーター
説明
データストレージのリージョン
データを保存するリージョンを選択します。
統合名
統合の名前を入力します。
モニタリングデータの統合には約 1~2 分かかります。
インストールが完了したら、[統合管理] をクリックして、統合された環境の詳細を表示できます。
Grafana ダッシュボードの表示
ARMS コンソール にログインします。左側のナビゲーションウィンドウで、[統合管理] を選択します。[統合済み環境] タブで、[クラウドサービス環境] を選択し、環境名をクリックします。
[コンポーネント管理] タブの [コンポーネントタイプ] セクションで、[ダッシュボード] をクリックして、組み込みの Grafana ダッシュボードを表示します。
ダッシュボード名をクリックして、モニタリングダッシュボードを表示します。
Prometheus アラートの設定
Prometheus を使用してモニタリングアラートを設定できます。手順:
ARMS コンソール にログインします。左側のナビゲーションウィンドウで、[統合管理] を選択します。[統合済み環境] タブで、[クラウドサービス環境] を選択し、環境名をクリックします。
[コンポーネント管理] ページの [コンポーネントタイプ] セクションで、[アラートルール] をクリックして、組み込みのアラートルールを表示します。
組み込みルールはアラートイベントを生成しますが、デフォルトでは通知は送信されません。通知を受信するには、以下のいずれかの方法を使用します。
通知ポリシーを設定して、アラートイベントのマッチングルールを定義します。ルールがトリガーされると、システムは選択した方法で指定された受信者にアラートメッセージを送信します。詳細については、「通知ポリシー」をご参照ください。
アラートルールを編集して、通知方法を設定します。
Prometheus アラートルールの編集ページでは、アラート条件、持続時間、内容、通知方法をカスタマイズできます。詳細については、「Prometheus アラートルールの作成」をご参照ください。
よくある質問
誤操作または支払い遅延により、従量課金の PAI-DSW インスタンスにすでに発生した料金について、Alibaba Cloud は免除または返金を行いますか?
従量課金インスタンスの課金は、インスタンスが作成された時点で開始されます。すでに発生した料金は免除または返金できません。
これ以上の課金を停止するには、PAI コンソール の DSW ページにアクセスして、インスタンスを停止または削除してください。インスタンスを削除する前に、保持したいデータを必ずバックアップしてください。
アカウント残高を速やかにチャージしてください。支払いが遅延すると、従量課金サービスが中断されたり、インスタンスがリリースされたり、データが失われたりする可能性があります。
PAI コンソールに表示される GPU インスタンスの単位価格が、実際に請求された価格と一致しないのはなぜですか?
ecs.gn6v-c8g1.8xlarge などの一部のインスタンスタイプでは、課金は分単位で計算されます。コンソールに表示される時間単位の単価が、分単位の料金から換算された請求額と一致しない場合、これはコンソールの表示上の問題である可能性があります。実際の請求書の金額が正式なものです。
OpenAPI を使用して、コンソールに表示される価格と一致するリアルタイムのインスタンス価格を取得するにはどうすればよいですか?
現在、OpenAPI はコンソールに表示される価格と一致するリアルタイムのインスタンス価格の照会をサポートしていません。API が返す価格はリスト価格であり、リアルタイムデータではありません。API を使用してコンソールに表示されるリアルタイム価格を取得することはできません。