CloudMonitor は、CloudMonitor エージェントを使用して、ご利用の Elastic Compute Service (ECS) インスタンスから GPU メトリックを収集します。これらのメトリックに対してアラートルールを作成することもできます。メトリック値が設定したしきい値を超えると、CloudMonitor はアラートを送信し、GPU のステータスとパフォーマンスの追跡に役立ちます。
前提条件
GPU アクセラレーションコンピューティング最適化 ECS インスタンスを作成し、GPU ドライバーをインストール済みであること。詳細については、「GPU インスタンスの作成」をご参照ください。
説明GPU ドライバーをインストールする前に CloudMonitor エージェントをインストールした場合は、CloudMonitor エージェントを再起動する必要があります。詳細については、「C++ 版 CloudMonitor エージェントの再起動方法」をご参照ください。
ECS インスタンスに CloudMonitor エージェントをインストール済みであること。詳細については、「CloudMonitor エージェントのインストール」をご参照ください。
メトリック
GPU、インスタンス、およびアプリケーショングループごとに GPU メトリックを表示できます。利用可能な GPU メトリックを次の表に示します。
メトリック | 単位 | メトリック名 | ディメンション |
(エージェント) GPU デコーダー使用率 | % | gpu_decoder_utilization | userId, instanceId, gpuId |
(エージェント) GPU エンコーダー使用率 | % | gpu_encoder_utilization | userId, instanceId, gpuId |
(エージェント) GPU 温度 | °C | gpu_temperature | userId, instanceId, gpuId |
(エージェント) GPU 使用率 | % | gpu_utilization | userId, instanceId, gpuId |
(エージェント) GPU メモリ空き領域 | Byte | gpu_memory_freespace | userId, instanceId, gpuId |
(エージェント) GPU メモリ空き領域使用率 | % | gpu_memory_free_utilization | userId, instanceId, gpuId |
(エージェント) GPU メモリ使用済み領域 | Byte | gpu_memory_usedspace | userId, instanceId, gpuId |
(エージェント) GPU メモリ使用率 | % | gpu_memory_utilization | userId, instanceId, gpuId |
(エージェント) GPU 消費電力 | W | gpu_power_readings_power_draw | userId, instanceId, gpuId |
(エージェント) インスタンスレベルのデコーダー使用率 | % | instance_gpu_decoder_utilization | userId, instanceId |
(エージェント) インスタンスレベルのエンコーダー使用率 | % | instance_gpu_encoder_utilization | userId, instanceId |
(エージェント) インスタンスレベルの GPU 温度 | °C | instance_gpu_temperature | userId, instanceId |
(エージェント) インスタンスレベルの GPU 使用率 | % | instance_gpu_utilization | userId, instanceId |
(エージェント) インスタンスレベルの GPU メモリ空き領域 | Byte | instance_gpu_memory_freespace | userId, instanceId |
(エージェント) インスタンスレベルの GPU メモリ空き領域使用率 | % | instance_gpu_memory_free_utilization | userId, instanceId |
(エージェント) インスタンスレベルの GPU メモリ使用済み領域 | Byte | instance_gpu_memory_usedspace | userId, instanceId |
(エージェント) インスタンスレベルの GPU メモリ使用率 | % | instance_gpu_memory_utilization | userId, instanceId |
(エージェント) インスタンスレベルの GPU 消費電力 | W | instance_gpu_power_readings_power_draw | userId, instanceId |
`instance_gpu_decoder_utilization` や `instance_gpu_temperature` などのインスタンスレベルのメトリックについて:
平均値:ECS インスタンス上のすべての GPU にわたる平均メトリック値。たとえば、ECS インスタンスにメトリック値が 'a' と 'b' の 2 つの GPU がある場合、平均値は (a + b) / 2 です。
最大値:ECS インスタンス上のすべての GPU の中で最も高いメトリック値。たとえば、ECS インスタンスにメトリック値が 'a' と 'b' の 2 つの GPU がある場合、最大値は max(a, b) です。
最小値:ECS インスタンス上のすべての GPU の中で最も低いメトリック値。たとえば、ECS インスタンスにメトリック値が 'a' と 'b' の 2 つの GPU がある場合、最小値は min(a, b) です。
GPU モニタリングデータの表示
-
CloudMonitor コンソールにログインします。
左側のナビゲーションウィンドウで、 を選択します。
ホスト監視 ページで、ターゲットインスタンスの名前をクリックするか、操作 列の モニタリングチャート をクリックします。
GPU 監視 タブをクリックします。
GPU 監視 タブで、ホストの GPU のモニタリングチャートを表示できます。
GPU メトリックのアラートルールを作成したり、アラートを表示したりすることもできます。詳細については、「ホストのアラートルールの作成」および「アラートの表示」をご参照ください。