Cloud Monitor は、Cloud Monitor エージェントを介して Elastic Compute Service (ECS) インスタンスから GPU メトリクスを収集します。アラートルールを作成することで、メトリクスが設定されたしきい値を超えたときに通知を受け取ることができます。
前提条件
-
GPU 高速化 ECS インスタンスが作成され、GPU ドライバーがインストールされていること。GPUインスタンスの作成
説明GPU ドライバーをインストールする前に Cloud Monitor エージェントをインストールした場合は、その後エージェントを再起動する必要があります。C++ 版 Cloud Monitor エージェントの再起動方法
-
Cloud Monitor エージェントが ECS インスタンスにインストールされていること。Cloud Monitor エージェントのインストール
メトリクス
GPU メトリクスは、GPU、インスタンス、およびアプリケーション グループの各レベルで使用できます。次の表に、利用可能なメトリクスを示します。
|
メトリクス |
単位 |
メトリック名 |
ディメンション |
|
(エージェント) GPU デコーダー使用率 |
% |
gpu_decoder_utilization |
userId, instanceId, gpuId |
|
(エージェント) GPU エンコーダー使用率 |
% |
gpu_encoder_utilization |
userId, instanceId, gpuId |
|
(エージェント) GPU 温度 |
°C |
gpu_temperature |
userId, instanceId, gpuId |
|
(エージェント) GPU 使用率 |
% |
gpu_utilization |
userId, instanceId, gpuId |
|
(エージェント) GPU メモリ空き領域 |
Byte |
gpu_memory_freespace |
userId, instanceId, gpuId |
|
(エージェント) GPU メモリ空き容量率 |
% |
gpu_memory_free_utilization |
userId, instanceId, gpuId |
|
(エージェント) GPU メモリ使用領域 |
Byte |
gpu_memory_usedspace |
userId, instanceId, gpuId |
|
(エージェント) GPU メモリ使用率 |
% |
gpu_memory_utilization |
userId, instanceId, gpuId |
|
(エージェント) GPU 消費電力 |
W |
gpu_power_readings_power_draw |
userId, instanceId, gpuId |
|
(エージェント) インスタンスレベルのデコーダー使用率 |
% |
instance_gpu_decoder_utilization |
userId, instanceId |
|
(エージェント) インスタンスレベルのエンコーダー使用率 |
% |
instance_gpu_encoder_utilization |
userId, instanceId |
|
(エージェント) インスタンスレベルの GPU 温度 |
°C |
instance_gpu_temperature |
userId, instanceId |
|
(エージェント) インスタンスレベルの GPU 使用率 |
% |
instance_gpu_utilization |
userId, instanceId |
|
(エージェント) インスタンスレベルの GPU メモリ空き領域 |
Byte |
instance_gpu_memory_freespace |
userId, instanceId |
|
(エージェント) インスタンスレベルの GPU メモリ空き容量率 |
% |
instance_gpu_memory_free_utilization |
userId, instanceId |
|
(エージェント) インスタンスレベルの GPU メモリ使用領域 |
Byte |
instance_gpu_memory_usedspace |
userId, instanceId |
|
(エージェント) インスタンスレベルの GPU メモリ使用率 |
% |
instance_gpu_memory_utilization |
userId, instanceId |
|
(エージェント) インスタンスレベルの GPU 消費電力 |
W |
instance_gpu_power_readings_power_draw |
userId, instanceId |
instance_gpu_decoder_utilization や instance_gpu_temperature などのインスタンスレベルのメトリクスの場合:
-
平均値:インスタンス上のすべての GPU にわたる平均値です。たとえば、値が 'a' と 'b' の 2 つの GPU の場合、(a + b) / 2 となります。
-
最大値:インスタンス上のすべての GPU のうち最も高い値です。たとえば、値が 'a' と 'b' の 2 つの GPU の場合、max(a, b) となります。
-
最小値:インスタンス上のすべての GPU のうち最も低い値です。たとえば、値が 'a' と 'b' の 2 つの GPU の場合、min(a, b) となります。
GPU モニタリングデータの表示
CloudMonitor コンソール にログインします。
-
左側のナビゲーションウィンドウで、 を選択します。
-
ホストのモニタリング ページで、対象のインスタンスの名前をクリックするか、その 操作 列にある モニタリングチャート をクリックします。
-
GPUモニタリング タブをクリックします。
GPUモニタリング タブには、ホストの GPU モニタリンググラフが表示されます。
GPU メトリクスはアラート機能にも対応しています。ホストのアラートルールの作成やアラートの表示が可能です。