すべてのプロダクト
Search
ドキュメントセンター

Application Real-Time Monitoring Service:パフォーマンス分析

最終更新日:Sep 05, 2026

大規模言語モデル (LLM) アプリケーション用の Python エージェントをインストールすると、Application Real-Time Monitoring Service (ARMS) はアプリケーションのモニタリングを開始します。パフォーマンス分析 ページでは、モデル呼び出し数、モデルの平均呼び出し時間、モデル呼び出しエラー数などの情報を表示できます。

前提条件

LLM アプリケーションにエージェントがインストールされている必要があります。詳細については、「LLM アプリケーションまたは推論サービスを ARMS に接続」をご参照ください。

LLM アプリケーションのパフォーマンス分析

  1. ARMS コンソールにログインします。左側のナビゲーションペインで、LLM アプリケーション監視 > アプリケーションリスト の順に選択します。

  2. アプリケーションリスト ページの上部でリージョンを選択し、対象アプリケーションの名前をクリックします。

  3. 上部メニューで [Performance analysis] をクリックします。

    パネル

    説明

    モデル呼び出し数

    指定した期間内の大規模言語モデルの呼び出し数。

    モデルの平均呼び出し時間

    指定した期間内の大規模言語モデルの呼び出しの平均所要時間。

    モデル呼び出しエラー数

    指定した期間内の大規模言語モデルの呼び出しの失敗数。

    モデル呼び出し数/分

    1分あたりの大規模言語モデルの呼び出し数。

    モデルの平均呼び出し時間/分

    1分あたりの大規模言語モデルの呼び出しの平均所要時間。

    モデル呼び出しエラー数/分

    1分あたりの大規模言語モデルの呼び出しの失敗数。

    モデルの P99 レイテンシー/分

    1分あたりの大規模言語モデルの呼び出しの P99 レイテンシー。これは、呼び出しの 99% がこの値未満で完了することを意味します。

    最初のパケットまでの平均時間/分

    大規模言語モデルから最初のデータパケットを受信するまでの平均時間。

    最初のパケットまでの P99 時間/分

    大規模言語モデルから最初のデータパケットを受信するまでの P99 時間。

    呼び出し数上位 5 モデル

    呼び出し数が最も多い上位 5 モデル (降順) 。

    平均呼び出し時間上位 5 モデル

    平均呼び出し時間が最も長い上位 5 モデル (降順) 。

    呼び出しエラー数上位 5 モデル

    呼び出しエラー数が最も多い上位 5 モデル (降順) 。

関連トピック