大規模言語モデル (LLM) アプリケーションに Python エージェントをインストールすると、Application Real-Time Monitoring Service (ARMS) はアプリケーションのモニタリングを開始します。[Overview] ページでは、モデル呼び出し数、トークン使用量、トレース数、セッション数など、LLM アプリケーションの主要なメトリクスを表示できます。
前提条件
LLM アプリケーションにエージェントがインストールされている必要があります。詳細については、「ARMS への LLM アプリケーションまたは推論サービスの接続」をご参照ください。
LLM アプリケーションの概要
ARMS コンソールにログインします。左側のナビゲーションウィンドウで、 を選択します。
[Application list] ページで、ページ上部のリージョンを選択し、対象アプリケーションの名前をクリックします。
上部メニューで [Overview] をクリックします。
ダッシュボード

パネル | 説明 |
モデル呼び出し数 | 選択した時間範囲内にアプリケーションが LLM を呼び出した回数です。 |
トークン使用量 | 選択した時間範囲内にアプリケーションが消費したトークン数です。 |
トレース数 | 選択した時間範囲内にアプリケーションが生成したトレース数です。 |
スパン数 | 選択した時間範囲内にアプリケーションが生成したスパン数です。 |
セッション数 | 選択した時間範囲内にアプリケーションが開始したセッション数です。 |
ユーザー数 | 選択した時間範囲内にアプリケーションと対話したユニークユーザーの総数です。 |
オペレーションタイプ分布 |
|
リクエストあたりの平均 LLM 呼び出し数 | 1 分間隔で計算した、リクエストあたりの平均 LLM 呼び出し数です。 |
リクエスト数の傾向 | LLM アプリケーションへのリクエスト数を分単位で追跡します。 |
モデル呼び出しランキング | アプリケーションで最も頻繁に呼び出される LLM のトップ 5 をリスト表示します。 |
リクエスト数によるユーザーランキング | アプリケーションで最も多くのリクエストを行ったユーザーのトップ 5 をリスト表示します。 |
セッション数の傾向 | LLM アプリケーションのセッション数を分単位で追跡します。 |
サポートされているプロダクトとサンプリングレートの設定
ARMS コンソールの LLM アプリケーションモニタリングのエントリは、AI エージェント可観測性 に名称変更されました。このエントリをクリックすると、Cloud Monitor 2.0 コンソールにリダイレクトされます。Alibaba Cloud では、ARMS アプリケーションモニタリングと CMS の AI アプリケーション可観測性が LLM 呼び出しトレース分析をサポートしています。
サンプリングレートを設定するには、ARMS コンソールにログインします。左側のナビゲーションウィンドウで [System Management] > [Application Configuration Template] を選択し、sampler.rate パラメーターを変更します。デフォルト値は 100 で、これは完全なサンプリングを意味します。
Python エージェントは、langchain、dify、dashscope、openai、llamaindex などの LLM フレームワークの自動インストルメンテーションをサポートしています。Python エージェントのリソースオーバーヘッドについては、「ARMS Python エージェントのパフォーマンステストレポート」をご参照ください。