すべてのプロダクト
Search
ドキュメントセンター

Application Real-Time Monitoring Service:vLLM/SGLang 推論エンジンの可観測性

最終更新日:Sep 19, 2026

アプリケーションモニタリングの Python エージェントには、vLLM および SGLang 推論エンジンの可観測性を実現する vLLM/SGLang プラグインが含まれています。

説明

Application Real-Time Monitoring Service (ARMS) は、現在 vLLM/SGLang フレームワーク の可観測性のみをサポートしています。

操作手順

ステップ 1: 環境変数の準備

export ARMS_APP_NAME=xxx   # Elastic Algorithm Service (EAS) アプリケーションの名前
export ARMS_REGION_ID=xxx   # Alibaba Cloud アカウントのリージョン ID
export ARMS_LICENSE_KEY=xxx   # Alibaba Cloud のライセンスキー
export APSARA_APM_MODEL_SERVICE_FRAMEWORK=xxx # モデルサービングフレームワークのタイプ。有効な値: 1. vLLM-v0、2. vLLM-v1、3. SGLang

ステップ 2: 推論エンジンコマンドの変更

  1. 推論エンジンの 実行コマンド を変更します。

    次の例では、DeepSeek-R1-Distill-Qwen-7B モデルを使用します。

    元の vLLM コマンド:

    gpu_count=$(nvidia-smi --query-gpu=count --format=csv,noheader | wc -l);vllm serve /model_dir --host 0.0.0.0 --port 8000 --root-path '/' --trust-remote-code --gpu-memory-utilization 0.95 --max-model-len 32768 --tensor-parallel-size $gpu_count --served-model-name DeepSeek-R1-Distill-Qwen-7B

    ARMS 可観測性を追加した変更後の vLLM コマンド:

    gpu_count=$(nvidia-smi --query-gpu=count --format=csv,noheader | wc -l);export PIP_INDEX_URL=http://mirrors.cloud.aliyuncs.com/pypi/simple;export PIP_TRUSTED_HOST=mirrors.cloud.aliyuncs.com;export APSARA_APM_MODEL_SERVICE_FRAMEWORK=vLLM-v1;pip3 install aliyun-bootstrap;ARMS_REGION_ID=cn-hangzhou aliyun-bootstrap -a install;ARMS_APP_NAME=qwq32 ARMS_LICENSE_KEY=it0kjz0oxz@3115ad****** ARMS_REGION_ID=cn-hangzhou aliyun-instrument vllm serve /model_dir --host 0.0.0.0 --port 8000 --root-path '/' --trust-remote-code --gpu-memory-utilization 0.95 --max-model-len 32768 --tensor-parallel-size $gpu_count --served-model-name DeepSeek-R1-Distill-Qwen-7B

    変更内容は以下の通りです。

    1. PyPI リポジトリを設定します。必要に応じて調整できます。

      export PIP_INDEX_URL=http://mirrors.cloud.aliyuncs.com/pypi/simple;export PIP_TRUSTED_HOST=mirrors.cloud.aliyuncs.com;
    2. 推論エンジンのタイプを設定します。

      export APSARA_APM_MODEL_SERVICE_FRAMEWORK=vLLM-v1;
    3. エージェントインストーラーをダウンロードします。

      pip3 install aliyun-bootstrap;
    4. インストーラーを使用してエージェントをインストールします。

      cn-hangzhou をご利用のリージョンに置き換えてください。

      ARMS_REGION_ID=cn-hangzhou aliyun-bootstrap -a install;

    元の SGLang コマンド:

    python -m sglang.launch_server --model-path /model_dir

    ARMS 可観測性を追加した変更後の SGLang コマンド:

    export PIP_INDEX_URL=http://mirrors.cloud.aliyuncs.com/pypi/simple;export PIP_TRUSTED_HOST=mirrors.cloud.aliyuncs.com;export APSARA_APM_MODEL_SERVICE_FRAMEWORK=SGLang;pip3 install aliyun-bootstrap;ARMS_REGION_ID=cn-hangzhou aliyun-bootstrap -a install;ARMS_APP_NAME=qwq32 ARMS_LICENSE_KEY=it0kjz0oxz@3115ad****** ARMS_REGION_ID=cn-hangzhou aliyun-instrument python -m sglang.launch_server --model-path /model_dir

    変更内容は以下の通りです。

    1. PyPI リポジトリを設定します。必要に応じて調整できます。

      export PIP_INDEX_URL=http://mirrors.cloud.aliyuncs.com/pypi/simple; export PIP_TRUSTED_HOST=mirrors.cloud.aliyuncs.com;
    2. 推論エンジンのタイプを設定します。

      export APSARA_APM_MODEL_SERVICE_FRAMEWORK=SGLang;
    3. エージェントインストーラーをダウンロードします。

      pip3 install aliyun-bootstrap;
    4. インストーラーを使用してエージェントをインストールします。

      cn-hangzhou をご利用のリージョンに置き換えてください。

      ARMS_REGION_ID=cn-hangzhou aliyun-bootstrap -a install;
  2. [Update] をクリックします。

サポートされるシナリオ

ARMS は、vLLM および SGLang の公式バージョンのみをサポートしています。変更されたバージョンはサポートされていません。サポートされているバージョンのリストについては、「LLM サービス」をご参照ください。

シナリオ

vLLM-v0

vLLM-v1

SGLang

Chat/Completion 呼び出し

サポート

サポート

サポート

埋め込み呼び出し

サポート

サポート

未サポート

リランク呼び出し

未サポート

サポート

未サポート

KV キャッシュ転送時間

未サポート

サポート

サポート

トークナイザー/デトークナイザーの実行時間

未サポート

サポート

サポート

よくある質問

vLLM フレームワークのログに TraceID を含めるにはどうすればよいですか?

vLLM フレームワークのログに TraceID を含めるには、以下の環境変数を設定します。

export OTEL_PYTHON_LOG_CORRELATION=true
export OTEL_PYTHON_LOG_LEVEL=info
export OTEL_PYTHON_LOG_FORMAT="%(asctime)s %(levelname)s [%(name)s] [%(filename)s:%(lineno)d] [trace_id=%(otelTraceID)s span_id=%(otelSpanID)s resource.service.name=%(otelServiceName)s trace_sampled=%(otelTraceSampled)s] - %(message)s"
export VLLM_LOGGING_PREFIX="[%(filename)s:%(lineno)d] [trace_id=%(otelTraceID)s span_id=%(otelSpanID)s resource.service.name=%(otelServiceName)s trace_sampled=%(otelTraceSampled)s]"

次に、vLLM フレームワークの起動コマンドに --enable-log-requests 起動パラメーターを追加して、リクエストレベルのログを出力します。

関連ドキュメント