すべてのプロダクト
Search
ドキュメントセンター

Application Real-Time Monitoring Service:概要

最終更新日:Aug 19, 2026

大規模言語モデル (LLM) アプリケーションに Python エージェントをインストールすると、Application Real-Time Monitoring Service (ARMS) はアプリケーションのモニタリングを開始します。[Overview] ページでは、モデル呼び出し数、トークン使用量、トレース数、セッション数など、LLM アプリケーションの主要なメトリクスを表示できます。

前提条件

LLM アプリケーションにエージェントがインストールされている必要があります。詳細については、「ARMS への LLM アプリケーションまたは推論サービスの接続」をご参照ください。

LLM アプリケーションの概要

  1. ARMS コンソールにログインします。左側のナビゲーションウィンドウで、[LLM Application Monitoring] > [Application list] を選択します。

  2. [Application list] ページで、ページ上部のリージョンを選択し、対象アプリケーションの名前をクリックします。

  3. 上部メニューで [Overview] をクリックします。

ダッシュボード

image

パネル

説明

モデル呼び出し数

選択した時間範囲内にアプリケーションが LLM を呼び出した回数です。

トークン使用量

選択した時間範囲内にアプリケーションが消費したトークン数です。

トレース数

選択した時間範囲内にアプリケーションが生成したトレース数です。

スパン数

選択した時間範囲内にアプリケーションが生成したスパン数です。

セッション数

選択した時間範囲内にアプリケーションが開始したセッション数です。

ユーザー数

選択した時間範囲内にアプリケーションと対話したユニークユーザーの総数です。

オペレーションタイプ分布
  • チェーン:LLM を他のコンポーネントと接続して複雑なタスクを実行するツールです。チェーンには、リトリーブ、埋め込み、LLM 呼び出し、さらにはネストされた他のチェーンが含まれる場合があります。

  • 埋め込み:埋め込みモデルを使用してテキストをベクトル表現に変換するなどのプロセスです。これにより、類似性検索で関連コンテキストを見つけることができます。

  • リトリーバー:ベクトルストレージまたはデータベースにアクセスしてデータを取得する操作です。これは通常、LLM に提供されるコンテキストを補足して、応答の精度と関連性を向上させるために使用します。

  • リランカー:特定のクエリに対する関連性に基づいて一連の入力ドキュメントを並べ替える操作です。LLM のコンテキストとして使用するために、最も関連性の高い上位 K 件のドキュメントを返す場合があります。

  • LLM:大規模言語モデルの呼び出しです。たとえば、SDK または API 経由で LLM を呼び出し、推論またはテキスト生成を実行します。

  • ツール:計算機や天気 API などの外部ツールを呼び出して、現在の天気などの特定の情報を取得する操作です。

  • エージェント:インテリジェントエージェントであり、LLM の推論を使用して次のアクションを決定する複雑なチェーンです。最終的な回答に段階的に到達するために、LLM とツールへの複数回の呼び出しが含まれる場合があります。

  • タスク:アプリケーション内のカスタムのユーザー定義メソッドです。たとえば、ローカル関数を呼び出して特定のロジックを適用します。

リクエストあたりの平均 LLM 呼び出し数

1 分間隔で計算した、リクエストあたりの平均 LLM 呼び出し数です。

リクエスト数の傾向

LLM アプリケーションへのリクエスト数を分単位で追跡します。

モデル呼び出しランキング

アプリケーションで最も頻繁に呼び出される LLM のトップ 5 をリスト表示します。

リクエスト数によるユーザーランキング

アプリケーションで最も多くのリクエストを行ったユーザーのトップ 5 をリスト表示します。

セッション数の傾向

LLM アプリケーションのセッション数を分単位で追跡します。

サポートされているプロダクトとサンプリングレートの設定

ARMS コンソールの LLM アプリケーションモニタリングのエントリは、AI エージェント可観測性 に名称変更されました。このエントリをクリックすると、Cloud Monitor 2.0 コンソールにリダイレクトされます。Alibaba Cloud では、ARMS アプリケーションモニタリングと CMS の AI アプリケーション可観測性が LLM 呼び出しトレース分析をサポートしています。

サンプリングレートを設定するには、ARMS コンソールにログインします。左側のナビゲーションウィンドウで [System Management] > [Application Configuration Template] を選択し、sampler.rate パラメーターを変更します。デフォルト値は 100 で、これは完全なサンプリングを意味します。

Python エージェントは、langchain、dify、dashscope、openai、llamaindex などの LLM フレームワークの自動インストルメンテーションをサポートしています。Python エージェントのリソースオーバーヘッドについては、「ARMS Python エージェントのパフォーマンステストレポート」をご参照ください。

関連ドキュメント