すべてのプロダクト
Search
ドキュメントセンター

Platform For AI:Prometheus による EAS 推論サービスの監視

最終更新日:Aug 25, 2026

CloudMonitor 2.0 のインテグレーションセンターを使用して、PAI-EAS 推論サービスおよびリソースグループのメトリクスを Managed Service for Prometheus にインポートします。PromQL でメトリクスをクエリし、Grafana などの外部モニタリングシステムに接続します。

課金

CloudMonitor 2.0 のインテグレーションセンターで [PAI-EAS 推論サービスメトリクス] と [PAI-EAS リソースグループメトリクス] を有効にすると、以下の料金が発生します。

ステップ 1:EAS 監視メトリクスの有効化

  1. CloudMonitor 2.0 コンソールにログインし、対象のワークスペースを選択して、左側のナビゲーションペインでアクセスセンターをクリックします。

  2. アクセスセンター ページで、検索ボックスで「PAI-EAS」を検索し、結果カードをクリックします。

  3. データソースとして [PAI-EAS 推論サービスメトリクス][PAI-EAS リソースグループメトリクス] を選択します。

    重要

    高度な監視メトリクスには、推論フレームワークメトリクス (vLLM または SGLang)、GPU コンピューティングメトリクス、PAI-EAS ゲートウェイメトリクス、サービスレベルおよびテナントレベルの統計、推論アプリケーションのカスタムメトリクス (custom_ プレフィックス付き) が含まれます。詳細については、「EAS サービスおよびリソースグループメトリクス」をご参照ください。サポートされているリージョンは、北京、上海、杭州、ウランチャブ、シンガポール、河源です。追加のリージョンを有効にするには、チケットを送信してください。

    高度な監視メトリクスを有効にすることで、Grafana ダッシュボードの構築やカスタムアラートの設定が可能になります。

  4. 統合はバックグラウンドで自動的に実行され、約 1~2 分かかります。インテグレーション管理 をクリックして統合ステータスを表示し、統合が完了していることを確認します。

ステップ 2:Prometheus データソース情報の取得

CloudMonitor 2.0 は、EAS 監視メトリクスを保存するための Prometheus インスタンスを作成します。デフォルトの保存場所は RegionShare:{{workspaceName}}:{{regionId}} です。{{workspaceName}} はワークスペース名、{{regionId}} はリージョン ID を表します。

Prometheus API を通じて監視データを取得するには、この Prometheus インスタンスのリージョンとアクセス URL を取得する必要があります。

  1. インテグレーション管理 タブに切り替えます。統合設定リストで、表示したい統合の横にある展開アイコンをクリックします。

  2. 展開された項目で、[PAI-EAS 推論サービスメトリクス] または [PAI-EAS リソースグループメトリクス] を見つけて、統合コンポーネント、ステータス、リージョンを確認します。

  3. [操作] 列で [データソース] をクリックし、Prometheus サービスのリージョンとアクセス URL を確認します。

ステップ 3:メトリクスのクエリと探索

Prometheus サービスのメトリクスエクスプローラーまたは PromQL クエリを使用して、EAS 監視メトリクスを探索します。

  • CloudMonitor のメトリクス名は AliyunLearn_eas プレフィックスを使用します。これらは CloudMonitor の EAS メトリクス定義に対応していますが、より豊富なタグ情報が含まれています。

  • 高度な監視メトリクスについては、「EAS 高度な監視メトリクス」をご参照ください。

  1. ステップ 2 の [データソース] ページで、インスタンス ID をクリックして [Prometheus サービス] 詳細ページに移動します。

  2. メトリックの探索 タブで、EAS サービスのメトリクス詳細を確認できます。

    方法

    説明

    メトリクスをフィルタリングして詳細を表示

    1. メトリックの探索 タブで、クエリビルダー内の[メトリックエクスプローラー]をクリックします。

    2. 検索ボックスに AliyunLearn などのメトリクスキーワードを入力し、ドロップダウンリストから対象のメトリクス (CPU コア使用量、CPU 使用率、GPU メモリ使用率など) を選択します。

    3. [操作] 列で探索アイコンをクリックしてフィルター条件を設定し、追加アイコンをクリックしてメトリクスをクエリボックスに追加します。

    4. [クエリの実行] をクリックして、メトリクス傾向グラフを表示します。

    PromQL 式を使用したメトリクスのクエリ

    例えば、全サービスの合計 QPS をクエリするには、次の手順を実行します。

    1. sum(AliyunLearn_eas_qps_total) を入力します。 (PromQL 構文については、「メトリクスデータのクエリと分析構文」をご参照ください)

    2. [クエリの実行] をクリックして、現在のリージョンにおける全 EAS サービスの合計 QPS の傾向を表示します。

ステップ 4:Grafana ダッシュボードの使用

デフォルトの Grafana ダッシュボードの表示

CloudMonitor 2.0 には、デフォルトの Grafana ダッシュボードが用意されています。

  1. Prometheus サービスの詳細ページのナビゲーションペインで、[Dashboard List] をクリックします。

  2. ダッシュボード名をクリックして、組み込みの Grafana ダッシュボードを表示します。

説明

[Provisioning] の統合ポリシーから [Dashboard] タブに切り替えることもできます。

パネルの追加

デフォルトの Grafana ダッシュボードに、グローバル QPS パネルを追加します。Grafana の詳細については、「Managed Service for Grafana」をご参照ください。

  1. ダッシュボードの詳細ページで、右上の [Add panel] ボタン image をクリックし、表示されるダイアログで [Add a new panel] をクリックします。

  2. パネル編集ページの右側で、チャートタイプを [Stat] に切り替えます。

  3. ページ左下で、[Data source]${datasource} に切り替えます。

  4. クエリエリアで、右側の [code] に切り替えます。[Metrics browser] のテキストボックスに PromQL クエリ sum(AliyunLearn_eas_eas_qps_total) を入力し、[Run queries] をクリックします。

  5. しきい値を調整して、値の範囲ごとに表示色を設定します。チャートのプレビューが表示されたら、[Apply] をクリックして設定を保存します。

ステップ 5:アラートルールの設定

Prometheus インスタンス詳細ページでは、組み込みのアラートルールを表示できます。すべての組み込みアラートルールは P2 レベルで、初期状態は [停止済み] です。

  1. Prometheus サービス詳細ページの左側のナビゲーションペインで、[アラートルール] をクリックします。

  2. アラートルールページで、プリセットされたアラートルールを確認します。ルールを有効にするには、[有効/無効] ステータスを変更します。通知設定を変更するには、[編集] をクリックします。

デフォルトテンプレートがニーズに合わない場合は、[アラートルールの作成] をクリックして、カスタムアラートルールを作成します。パラメーターの説明については、「アラートルール」をご参照ください。

付録:EAS の高度な監視メトリクス

説明

以下のメトリクスは、ステップ 1 で高度な監視メトリクスが有効になっている場合にのみ利用できます。

サービスインスタンスメトリクス

メトリック

説明

メトリックタグ (ディメンション)

カテゴリ

タイプ

単位

収集期間 (s)

instance_cpu_count

サービスインスタンスの CPU 数

instance,resource_type

CPU

ゲージ

count

60

instance_gpu_count

サービスインスタンスの GPU 数

instance,resource_type

GPU

ゲージ

count

60

instance_cpu_usage

サービスインスタンスの CPU 使用量

instance

CPU

ゲージ

core

60

instance_user_cpu_usage

サービスインスタンスのユーザープロセス CPU 使用量

instance

CPU

ゲージ

core

60

instance_system_cpu_usage

サービスインスタンスのシステムプロセス CPU 使用量

instance

CPU

ゲージ

core

60

instance_cpu_util

サービスインスタンスの CPU 使用率

instance

CPU

ゲージ

%

60

instance_memory_rss_usage

サービスインスタンスのメモリ使用量

instance

メモリ

ゲージ

byte

60

instance_memory_cache_usage

サービスインスタンスのメモリキャッシュ使用量

instance

メモリ

ゲージ

byte

60

instance_memory_total

サービスインスタンスの総メモリ

instance

メモリ

ゲージ

byte

60

instance_memory_util

サービスインスタンスのメモリ使用率

instance

メモリ

ゲージ

%

60

instance_response

サービスインスタンスへのリクエスト数

instance

リクエスト

カウンター

count

60

instance_gpu_util

サービスインスタンスの GPU 使用率

instance

GPU

ゲージ

%

60

instance_gpu_memory_usage

サービスインスタンスの GPU メモリ使用量

instance

GPU

ゲージ

MiB

60

instance_gpu_memory_total

サービスインスタンスの総 GPU メモリ

instance

GPU

ゲージ

MiB

60

instance_gpu_memory_util

サービスインスタンスの GPU メモリ使用率

instance

GPU

ゲージ

%

60

instance_gpu_memory_bandwidth_limit

サービスインスタンスの GPU メモリ帯域幅制限

instance

GPU

ゲージ

bytes/second

60

instance_gpu_temperature

サービスインスタンスの GPU 温度

instance

GPU

ゲージ

°C

60

instance_gpu_slow_temperature

サービスインスタンスの GPU スロットリング温度

instance

GPU

ゲージ

°C

60

instance_gpu_shut_temperature

サービスインスタンスの GPU シャットダウン温度

instance

GPU

ゲージ

°C

60

instance_gpu_nvswitch_error

サービスインスタンスの NVSwitch の致命的なエラー数

instance

GPU

ゲージ

count

60

instance_gpu_nvswitch_non_fatal_error

サービスインスタンスの NVSwitch の非致命的エラー数

instance

GPU

ゲージ

count

60

instance_gpu_ecc_total_vol_sbe

サービスインスタンスの単一ビット揮発性 ECC エラー総数

instance

GPU

カウンター

count

60

instance_gpu_ecc_total_vol_dbe

サービスインスタンスの二重ビット揮発性 ECC エラー総数

instance

GPU

カウンター

count

60

instance_gpu_ecc_total_agg_sbe

サービスインスタンスの単一ビット集計 (永続) ECC エラー総数

instance

GPU

カウンター

count

60

instance_gpu_ecc_total_agg_dbe

サービスインスタンスの二重ビット集計 (永続) ECC エラー総数

instance

GPU

カウンター

count

60

instance_gpu_remap_fail

サービスインスタンスの行リマッピング失敗数

instance

GPU

ゲージ

count

60

instance_gpu_remap_pending

サービスインスタンスの行リマッピング保留数

instance

GPU

ゲージ

count

60

instance_gpu_pcie_replay_counter

サービスインスタンスの PCIe リプレイカウンター

instance

GPU

ゲージ

count

60

instance_gpu_pcie_transmit_measure_by_dcgm

サービスインスタンスの DCGM による PCIe 送信レート

instance

GPU

ゲージ

bytes/second

60

instance_gpu_pcie_receive_measure_by_dcgm

サービスインスタンスの DCGM による PCIe 受信レート

instance

GPU

ゲージ

bytes/second

60

instance_gpu_graphics_engine_util

サービスインスタンスのグラフィックスエンジン使用率

instance

GPU

ゲージ

ratio (0~1)

60

instance_gpu_sm_util

サービスインスタンスのストリーミングマルチプロセッサ (SM) 使用率

instance

GPU

ゲージ

ratio (0~1)

60

instance_gpu_dram_active

サービスインスタンスにおいてデバイスメモリインターフェイスがデータの送受信をアクティブに行っている時間の割合

instance

GPU

ゲージ

ratio (0~1)

60

instance_gpu_tensortflops_used

サービスインスタンスの Tensor パイプラインによる TFLOPS 演算の回数

instance

GPU

ゲージ

count

60

instance_gpu_memory_bandwidth_used

サービスインスタンスのメモリ帯域幅使用量

instance

GPU

ゲージ

bytes/second

60

instance_gpu_sm_clock

サービスインスタンスの SM クロック周波数

instance

GPU

ゲージ

MHz

60

instance_gpu_sm_occupancy

サービスインスタンスの SM 上に常駐するワープの割合

instance

GPU

ゲージ

ratio (0~1)

60

instance_gpu_fp32tflops_used

サービスインスタンスの FP32 パイプラインによる TFLOPS 演算の回数

instance

GPU

ゲージ

count

60

instance_gpu_fp16tflops_used

サービスインスタンスの FP16 パイプラインによる TFLOPS 演算の回数

instance

GPU

ゲージ

count

60

instance_gpu_pipe_fp32_active

サービスインスタンスにおける FP32 パイプラインのアクティブサイクルの割合

instance

GPU

ゲージ

ratio (0~1)

60

instance_gpu_pipe_fp16_active

サービスインスタンスにおける FP16 パイプラインのアクティブサイクルの割合

instance

GPU

ゲージ

ratio (0~1)

60

instance_gpu_pipe_tensor_active

サービスインスタンスにおける Tensor パイプラインのアクティブサイクルの割合

instance

GPU

ゲージ

ratio (0~1)

60

instance_gpu_power_usage

サービスインスタンスの GPU の消費電力

instance

GPU

ゲージ

watts

60

instance_accelerator_power_usage

サービスインスタンスのアクセラレータの消費電力

instance

GPU

ゲージ

milliwatts

60

instance_gpu_mem_copy_util

サービスインスタンスのメモリコピー使用率

instance

GPU

ゲージ

%

60

instance_gpu_health_count

サービスインスタンスの GPU のヘルスステータス総数

instance

GPU

ゲージ

count

60

instance_gpu_lost_card_num

サービスインスタンスの VM で失われた GPU 数

instance

GPU

ゲージ

count

60

instance_gpu_driver_hang

サービスインスタンスの GPU ドライバーハング数

instance

GPU

ゲージ

count

60

instance_gpu_profile_status

サービスインスタンスの Amperf プロファイリングステータス

instance

GPU

ゲージ

count

60

instance_gpu_uncorrectable_ecc

サービスインスタンスの訂正不能 ECC エラー数

instance

GPU

ゲージ

count

60

instance_gpu_xid_cnt

サービスインスタンスの Xid エラー数

instance

GPU

ゲージ

count

60

instance_gpu_fatal_xid_error

サービスインスタンスの致命的な Xid エラーの数

instance

GPU

ゲージ

count

60

instance_gpu_kernel_err_cnt

サービスインスタンスのカーネルログからの非 Xid エラー数

instance

GPU

ゲージ

count

60

instance_qps

サービスインスタンスの 1 秒あたりのリクエスト数

instance

リクエスト

ゲージ

count

60

instance_traffic

サービスインスタンスのトラフィック

instance

リクエスト

ゲージ

bps

60

instance_avg_latency

サービスインスタンスのリクエストの平均応答時間

instance

リクエスト

ゲージ

ms

60

instance_tpxx_latency

サービスインスタンスの TOPXX リクエスト応答時間

instance

リクエスト

ゲージ

ms

60

instance_traffic_in

サービスインスタンスのインバウンドトラフィック

instance

リクエスト

ゲージ

bps

60

instance_traffic_out

サービスインスタンスのアウトバウンドトラフィック

instance

リクエスト

ゲージ

bps

60

instance_tcp_connections

サービスインスタンスの TCP 接続数

instance

リクエスト

ゲージ

count

60

サービスメトリクス

メトリック

説明

メトリックタグ (ディメンション)

カテゴリ

タイプ

単位

収集期間 (s)

service_replicas

サービスインスタンス数

service

Meta

Gauge

count

60

service_pending_replicas

保留中のサービスインスタンス数

service

Meta

Gauge

count

60

service_available_replicas

実行中のサービスインスタンス数

service

Meta

Gauge

count

60

service_replicas_with_resource_type

サービスインスタンス数 (resource type タグ付き)

service

Meta

Gauge

count

60

service_cpu_count

サービスに割り当てられた合計 CPU 数

service

CPU

Gauge

core

60

service_cpu_count_with_resource_type

サービスの合計 CPU 数 (resource type タグ付き)

service

CPU

Gauge

core

60

service_gpu_count_with_resource_type

サービスの合計 GPU 数 (resource type タグ付き)

service

GPU

Gauge

count

60

service_rps_status_2xx

サービスの 2XX 応答数

service

Request

Gauge

count

60

service_rps_status_4xx

サービスの 4XX 応答数

service

Request

Gauge

count

60

service_rps_status_5xx

サービスの 5XX 応答数

service

Request

Gauge

count

60

service_rps_status_2xx_ratio

サービスの 2XX 応答率

service

Request

Gauge

%

60

service_rps_status_4xx_ratio

サービスの 4XX 応答率

service

Request

Gauge

%

60

service_rps_status_5xx_ratio

サービスの 5XX 応答率

service

Request

Gauge

%

60

service_qps

サービスの 1 秒あたりのリクエスト数

service

Request

Gauge

count

60

service_avg_latency

サービスの平均リクエストレイテンシー

service

Request

Gauge

ms

60

service_tpxx_latency

サービスの TOPXX リクエストレイテンシー

service

Request

Gauge

ms

60

service_tp100_latency

サービスの TOP100 リクエストレイテンシー

service

Request

Gauge

ms

60

service_traffic_in

サービスのインバウンドトラフィック

service

Network

Gauge

bps

60

service_traffic_out

サービスのアウトバウンドトラフィック

service

Network

Gauge

bps

60

service_cpu_usage

サービスの CPU 使用量

service

CPU

Gauge

core

60

service_user_cpu_usage

サービスのユーザープロセス CPU 使用量

service

CPU

Gauge

core

60

service_system_cpu_usage

サービスのシステムプロセス CPU 使用量

service

CPU

Gauge

core

60

service_cpu_util

サービスの CPU 使用率

service

CPU

Gauge

%

60

service_memory_rss_usage

サービスの物理メモリ (RSS) 使用量

service

Memory

Gauge

byte

60

service_memory_cache_usage

サービスのメモリキャッシュ使用量

service

Memory

Gauge

byte

60

service_memory_total

サービスの総メモリ

service

Memory

Gauge

byte

60

service_memory_util

サービスのメモリ使用率

service

Memory

Gauge

%

60

service_gpu_util

サービスの GPU 使用率

service

GPU

Gauge

%

60

service_gpu_memory_usage

サービスの GPU メモリ使用量

service

GPU

Gauge

MiB

60

service_gpu_memory_total

サービスの総 GPU メモリ

service

GPU

Gauge

MiB

60

service_gpu_memory_util

サービスの GPU メモリ使用率

service

GPU

Gauge

%

60

service_gpu_memory_bandwidth_limit

サービスの GPU メモリ帯域幅制限

service

GPU

Gauge

bytes/second

60

service_gpu_temperature

サービスの GPU 温度

service

GPU

Gauge

°C

60

service_gpu_slow_temperature

サービスの GPU スロットリング温度

service

GPU

Gauge

°C

60

service_gpu_shut_temperature

サービスの GPU シャットダウン温度

service

GPU

Gauge

°C

60

service_gpu_nvswitch_error

サービスの NVSwitch 致命的なエラー数

service

GPU

Gauge

count

60

service_gpu_nvswitch_non_fatal_error

サービスの NVSwitch 非致命的なエラー数

service

GPU

Gauge

count

60

service_gpu_ecc_total_vol_sbe

サービスの 1 ビット揮発性 ECC エラーの総数

service

GPU

Counter

count

60

service_gpu_ecc_total_vol_dbe

サービスの 2 ビット揮発性 ECC エラーの総数

service

GPU

Counter

count

60

service_gpu_ecc_total_agg_sbe

サービスの 1 ビット集計 (永続) ECC エラーの総数

service

GPU

Counter

count

60

service_gpu_ecc_total_agg_dbe

サービスの 2 ビット集計 (永続) ECC エラーの総数

service

GPU

Counter

count

60

service_gpu_remap_fail

サービスの行リマッピング失敗数

service

GPU

Gauge

count

60

service_gpu_remap_pending

サービスの行リマッピングの保留数

service

GPU

Gauge

count

60

service_gpu_pcie_replay_counter

サービスの PCIe リプレイカウンター

service

GPU

Gauge

count

60

service_gpu_pcie_transmit_measure_by_dcgm

DCGM によるサービスの PCIe 送信レート

service

GPU

Gauge

bytes/second

60

service_gpu_pcie_receive_measure_by_dcgm

DCGM によるサービスの PCIe 受信レート

service

GPU

Gauge

bytes/second

60

service_gpu_graphics_engine_util

サービスのグラフィックスエンジン使用率

service

GPU

Gauge

ratio (0-1)

60

service_gpu_sm_util

サービスのストリーミングマルチプロセッサ (SM) 使用率

service

GPU

Gauge

ratio (0-1)

60

service_gpu_dram_active

サービスにおいて、デバイスメモリインターフェイスがアクティブにデータを送受信している時間の割合

service

GPU

Gauge

ratio (0-1)

60

service_gpu_tensortflops_used

サービスの Tensor パイプラインで使用された TFLOPS 値

service

GPU

Gauge

TFLOPS

60

service_gpu_memory_bandwidth_used

サービスのメモリ帯域幅使用量

service

GPU

Gauge

bytes/second

60

service_gpu_sm_clock

サービスの SM クロック周波数

service

GPU

Gauge

MHz

60

service_gpu_sm_occupancy

サービスの SM に常駐するワープの割合

service

GPU

Gauge

ratio (0-1)

60

service_gpu_fp32tflops_used

サービスの FP32 パイプラインで使用された TFLOPS 値

service

GPU

Gauge

TFLOPS

60

service_gpu_fp16tflops_used

サービスの FP16 パイプラインで使用された TFLOPS 値

service

GPU

Gauge

TFLOPS

60

service_gpu_pipe_fp32_active

サービスの FP32 パイプラインのアクティブサイクルの割合

service

GPU

Gauge

ratio (0-1)

60

service_gpu_pipe_fp16_active

サービスの FP16 パイプラインのアクティブサイクルの割合

service

GPU

Gauge

ratio (0-1)

60

service_gpu_pipe_tensor_active

サービスの Tensor パイプラインのアクティブサイクルの割合

service

GPU

Gauge

ratio (0-1)

60

service_gpu_power_usage

サービスの GPU 電力使用量

service

GPU

Gauge

watts

60

service_accelerator_power_usage

サービスのアクセラレータ電力使用量

service

GPU

Gauge

milliwatts

60

service_gpu_mem_copy_util

サービスのメモリコピー使用率

service

GPU

Gauge

%

60

service_gpu_health_count

サービスの GPU 正常性ステータスの総数

service

GPU

Gauge

count

60

service_gpu_lost_card_num

サービスの VM 内で失われた GPU 数

service

GPU

Gauge

count

60

service_gpu_driver_hang

サービスの GPU ドライバーのハング数

service

GPU

Gauge

count

60

service_gpu_profile_status

サービスの Amperf プロファイリングステータス

service

GPU

Gauge

count

60

service_gpu_uncorrectable_ecc

サービスの訂正不可能な ECC エラー数

service

GPU

Gauge

count

60

service_gpu_xid_cnt

サービスの Xid エラー数

service

GPU

Gauge

count

60

service_gpu_fatal_xid_error

サービスの致命的な Xid エラー数

service

GPU

Gauge

count

60

service_gpu_kernel_err_cnt

サービスのカーネルログ内の非 Xid エラー数

service

GPU

Gauge

count

60

service_tcp_connections

サービスの TCP 接続数

service

Network

Gauge

count

60

service_gateway_requests

llm-gateway: ゲートウェイの現在の受信リクエスト数

service

Request

Gauge

count

60

service_gateway_pending_requests

llm-gateway: ゲートウェイでバッファ中のリクエスト数

service

Request

Gauge

count

60

service_llm_ttft_max

llm-gateway: LLM ストリーミングリクエストの最初のトークンまでの時間 (TTFT) の最大値

service

Request

Gauge

ms

60

service_llm_ttft_min

llm-gateway: LLM ストリーミングリクエストの最初のトークンまでの時間 (TTFT) の最小値

service

Request

Gauge

ms

60

service_llm_ttft_mean

llm-gateway: LLM ストリーミングリクエストの最初のトークンまでの時間 (TTFT) の平均値

service

Request

Gauge

ms

60

service_llm_ttft_percent

llm-gateway: LLM ストリーミングリクエストの最初のトークンまでの時間 (TTFT) のパーセンタイル

service

Request

Gauge

ms

60

service_llm_tpot_max

llm-gateway: LLM ストリーミングリクエストの出力トークンあたりの時間 (TPOT) の最大値

service

Request

Gauge

ms

60

service_llm_tpot_min

llm-gateway: LLM ストリーミングリクエストの出力トークンあたりの時間 (TPOT) の最小値

service

Request

Gauge

ms

60

service_llm_tpot_mean

llm-gateway: LLM ストリーミングリクエストの出力トークンあたりの時間 (TPOT) の平均値

service

Request

Gauge

ms

60

service_llm_tpot_percent

llm-gateway: LLM ストリーミングリクエストの出力トークンあたりの時間 (TPOT) のパーセンタイル

service

Request

Gauge

ms

60

service_endpoint_llm_waiting_requests

llm-gateway: LLM 推論エンジンでキューイングされているリクエスト数

service

Request

Gauge

count

60

service_endpoint_llm_running_requests

llm-gateway: LLM 推論エンジンで処理中のリクエスト数

service

Request

Gauge

count

60

service_endpoint_llm_gpu_cache_usage

llm-gateway: LLM 推論エンジンの GPU KV キャッシュ使用率

service

Request

Gauge

%

60

service_endpoint_llm_tps_in

llm-gateway: LLM エンジンの 1 秒あたりの入力トークン数

service

Request

Gauge

count

60

service_endpoint_llm_tps_out

llm-gateway: LLM エンジンの 1 秒あたりの出力トークン数

service

Request

Gauge

count

60

リソースグループメトリック

メトリック

説明

メトリックタグ (ディメンション)

カテゴリ

タイプ

単位

収集期間 (秒)

resource_instance_cpu_util

リソースグループインスタンスの CPU 使用率

instance_id

リソースインスタンス

Gauge

%

60

resource_instance_memory_total

リソースグループインスタンスの合計メモリ

instance_id

リソースインスタンス

Gauge

byte

60

resource_instance_memory_used

リソースグループインスタンスのメモリ使用量

instance_id

リソースインスタンス

Gauge

byte

60

resource_instance_memory_util

リソースグループインスタンスのメモリ使用率

instance_id

リソースインスタンス

Gauge

%

60

resource_instance_memory_cache

リソースグループインスタンスのメモリキャッシュ使用量

instance_id

リソースインスタンス

Gauge

byte

60

resource_instance_memory_free

リソースグループインスタンスの空きメモリ

instance_id

リソースインスタンス

Gauge

byte

60

resource_instance_traffic_in

リソースグループインスタンスのインバウンドトラフィック

instance_id

リソースインスタンス

Gauge

bytes/second

60

resource_instance_traffic_out

リソースグループインスタンスのアウトバウンドトラフィック

instance_id

リソースインスタンス

Gauge

bytes/second

60

resource_instance_disk_used

リソースグループインスタンスのディスク使用量

instance_id

リソースインスタンス

Gauge

byte

60

resource_instance_disk_total

リソースグループインスタンスの合計ディスク容量

instance_id

リソースインスタンス

Gauge

byte

60

resource_instance_disk_util

リソースグループインスタンスのディスク使用量

instance_id

リソースインスタンス

Gauge

byte

60

resource_instance_tcp_established

リソースグループインスタンスの確立済み TCP 接続数

instance_id

リソースインスタンス

Gauge

count

60

resource_instance_tcp_time_wait

リソースグループインスタンスの TIME_WAIT 状態の TCP 接続数

instance_id

リソースインスタンス

Gauge

count

60

resource_instance_gpu_util

リソースグループインスタンスの GPU 使用率

instance_id

リソースインスタンス

Gauge

%

60

resource_instance_gpu_memory_usage

リソースグループインスタンスの GPU メモリ使用量

instance_id

リソースインスタンス

Gauge

MiB

60

resource_instance_gpu_memory_total

リソースグループインスタンスの合計 GPU メモリ

instance_id

リソースインスタンス

Gauge

MiB

60

resource_instance_gpu_memory_util

リソースグループインスタンスの GPU メモリ使用率

instance_id

リソースインスタンス

Gauge

%

60

resource_cpu_util

リソースグループの CPU 使用率

resource

リソース

Gauge

%

60

resource_memory_total

リソースグループの合計メモリ

resource

リソース

Gauge

byte

60

resource_memory_used

リソースグループのメモリ使用量

resource

リソース

Gauge

byte

60

resource_memory_util

リソースグループのメモリ使用率

resource

リソース

Gauge

%

60

resource_memory_cache

リソースグループのメモリキャッシュ使用量

resource

リソース

Gauge

byte

60

resource_memory_free

リソースグループの空きメモリ

resource

リソース

Gauge

byte

60

resource_traffic_in

リソースグループのインバウンドトラフィック

resource

リソース

Gauge

bytes/second

60

resource_traffic_out

リソースグループのアウトバウンドトラフィック

resource

リソース

Gauge

bytes/second

60

resource_disk_used

リソースグループのディスク使用量

resource

リソース

Gauge

byte

60

resource_disk_total

リソースグループの合計ディスク容量

resource

リソース

Gauge

byte

60

resource_disk_util

リソースグループのディスク使用量

resource

リソース

Gauge

byte

60

resource_tcp_established

リソースグループの確立済み TCP 接続数

resource

リソース

Gauge

count

60

resource_tcp_time_wait

リソースグループの TIME_WAIT 状態の TCP 接続数

resource

リソース

Gauge

count

60

resource_gpu_util

リソースグループの GPU 使用率

resource

リソース

Gauge

%

60

resource_gpu_memory_usage

リソースグループの GPU メモリ使用量

resource

リソース

Gauge

MiB

60

resource_gpu_memory_total

リソースグループの合計 GPU メモリ

resource

リソース

Gauge

MiB

60

resource_gpu_memory_util

リソースグループの GPU メモリ使用率

resource

リソース

Gauge

%

60