大規模言語モデル (LLM) アプリケーション用の Python エージェントをインストールすると、Application Real-Time Monitoring Service (ARMS) はアプリケーションのモニタリングを開始します。パフォーマンス分析 ページでは、モデル呼び出し数、モデルの平均呼び出し時間、モデル呼び出しエラー数などの情報を表示できます。
前提条件
LLM アプリケーションにエージェントがインストールされている必要があります。詳細については、「LLM アプリケーションまたは推論サービスを ARMS に接続」をご参照ください。
LLM アプリケーションのパフォーマンス分析
-
ARMS コンソールにログインします。左側のナビゲーションペインで、 の順に選択します。
-
アプリケーションリスト ページの上部でリージョンを選択し、対象アプリケーションの名前をクリックします。
-
上部メニューで [Performance analysis] をクリックします。
パネル
説明
モデル呼び出し数
指定した期間内の大規模言語モデルの呼び出し数。
モデルの平均呼び出し時間
指定した期間内の大規模言語モデルの呼び出しの平均所要時間。
モデル呼び出しエラー数
指定した期間内の大規模言語モデルの呼び出しの失敗数。
モデル呼び出し数/分
1分あたりの大規模言語モデルの呼び出し数。
モデルの平均呼び出し時間/分
1分あたりの大規模言語モデルの呼び出しの平均所要時間。
モデル呼び出しエラー数/分
1分あたりの大規模言語モデルの呼び出しの失敗数。
モデルの P99 レイテンシー/分
1分あたりの大規模言語モデルの呼び出しの P99 レイテンシー。これは、呼び出しの 99% がこの値未満で完了することを意味します。
最初のパケットまでの平均時間/分
大規模言語モデルから最初のデータパケットを受信するまでの平均時間。
最初のパケットまでの P99 時間/分
大規模言語モデルから最初のデータパケットを受信するまでの P99 時間。
呼び出し数上位 5 モデル
呼び出し数が最も多い上位 5 モデル (降順) 。
平均呼び出し時間上位 5 モデル
平均呼び出し時間が最も長い上位 5 モデル (降順) 。
呼び出しエラー数上位 5 モデル
呼び出しエラー数が最も多い上位 5 モデル (降順) 。