アプリケーションモニタリングの Python エージェントには、vLLM および SGLang 推論エンジンの可観測性を実現する vLLM/SGLang プラグインが含まれています。
Application Real-Time Monitoring Service (ARMS) は、現在 vLLM/SGLang フレームワーク の可観測性のみをサポートしています。
操作手順
ステップ 1: 環境変数の準備
export ARMS_APP_NAME=xxx # Elastic Algorithm Service (EAS) アプリケーションの名前
export ARMS_REGION_ID=xxx # Alibaba Cloud アカウントのリージョン ID
export ARMS_LICENSE_KEY=xxx # Alibaba Cloud のライセンスキー
export APSARA_APM_MODEL_SERVICE_FRAMEWORK=xxx # モデルサービングフレームワークのタイプ。有効な値: 1. vLLM-v0、2. vLLM-v1、3. SGLangステップ 2: 推論エンジンコマンドの変更
推論エンジンの 実行コマンド を変更します。
次の例では、DeepSeek-R1-Distill-Qwen-7B モデルを使用します。
元の vLLM コマンド:
gpu_count=$(nvidia-smi --query-gpu=count --format=csv,noheader | wc -l);vllm serve /model_dir --host 0.0.0.0 --port 8000 --root-path '/' --trust-remote-code --gpu-memory-utilization 0.95 --max-model-len 32768 --tensor-parallel-size $gpu_count --served-model-name DeepSeek-R1-Distill-Qwen-7BARMS 可観測性を追加した変更後の vLLM コマンド:
gpu_count=$(nvidia-smi --query-gpu=count --format=csv,noheader | wc -l);export PIP_INDEX_URL=http://mirrors.cloud.aliyuncs.com/pypi/simple;export PIP_TRUSTED_HOST=mirrors.cloud.aliyuncs.com;export APSARA_APM_MODEL_SERVICE_FRAMEWORK=vLLM-v1;pip3 install aliyun-bootstrap;ARMS_REGION_ID=cn-hangzhou aliyun-bootstrap -a install;ARMS_APP_NAME=qwq32 ARMS_LICENSE_KEY=it0kjz0oxz@3115ad****** ARMS_REGION_ID=cn-hangzhou aliyun-instrument vllm serve /model_dir --host 0.0.0.0 --port 8000 --root-path '/' --trust-remote-code --gpu-memory-utilization 0.95 --max-model-len 32768 --tensor-parallel-size $gpu_count --served-model-name DeepSeek-R1-Distill-Qwen-7B変更内容は以下の通りです。
PyPI リポジトリを設定します。必要に応じて調整できます。
export PIP_INDEX_URL=http://mirrors.cloud.aliyuncs.com/pypi/simple;export PIP_TRUSTED_HOST=mirrors.cloud.aliyuncs.com;推論エンジンのタイプを設定します。
export APSARA_APM_MODEL_SERVICE_FRAMEWORK=vLLM-v1;エージェントインストーラーをダウンロードします。
pip3 install aliyun-bootstrap;インストーラーを使用してエージェントをインストールします。
cn-hangzhouをご利用のリージョンに置き換えてください。ARMS_REGION_ID=cn-hangzhou aliyun-bootstrap -a install;
元の SGLang コマンド:
python -m sglang.launch_server --model-path /model_dirARMS 可観測性を追加した変更後の SGLang コマンド:
export PIP_INDEX_URL=http://mirrors.cloud.aliyuncs.com/pypi/simple;export PIP_TRUSTED_HOST=mirrors.cloud.aliyuncs.com;export APSARA_APM_MODEL_SERVICE_FRAMEWORK=SGLang;pip3 install aliyun-bootstrap;ARMS_REGION_ID=cn-hangzhou aliyun-bootstrap -a install;ARMS_APP_NAME=qwq32 ARMS_LICENSE_KEY=it0kjz0oxz@3115ad****** ARMS_REGION_ID=cn-hangzhou aliyun-instrument python -m sglang.launch_server --model-path /model_dir変更内容は以下の通りです。
PyPI リポジトリを設定します。必要に応じて調整できます。
export PIP_INDEX_URL=http://mirrors.cloud.aliyuncs.com/pypi/simple; export PIP_TRUSTED_HOST=mirrors.cloud.aliyuncs.com;推論エンジンのタイプを設定します。
export APSARA_APM_MODEL_SERVICE_FRAMEWORK=SGLang;エージェントインストーラーをダウンロードします。
pip3 install aliyun-bootstrap;インストーラーを使用してエージェントをインストールします。
cn-hangzhouをご利用のリージョンに置き換えてください。ARMS_REGION_ID=cn-hangzhou aliyun-bootstrap -a install;
[Update] をクリックします。
サポートされるシナリオ
ARMS は、vLLM および SGLang の公式バージョンのみをサポートしています。変更されたバージョンはサポートされていません。サポートされているバージョンのリストについては、「LLM サービス」をご参照ください。
シナリオ | vLLM-v0 | vLLM-v1 | SGLang |
Chat/Completion 呼び出し | サポート | サポート | サポート |
埋め込み呼び出し | サポート | サポート | 未サポート |
リランク呼び出し | 未サポート | サポート | 未サポート |
KV キャッシュ転送時間 | 未サポート | サポート | サポート |
トークナイザー/デトークナイザーの実行時間 | 未サポート | サポート | サポート |
よくある質問
vLLM フレームワークのログに TraceID を含めるにはどうすればよいですか?
vLLM フレームワークのログに TraceID を含めるには、以下の環境変数を設定します。
export OTEL_PYTHON_LOG_CORRELATION=true
export OTEL_PYTHON_LOG_LEVEL=info
export OTEL_PYTHON_LOG_FORMAT="%(asctime)s %(levelname)s [%(name)s] [%(filename)s:%(lineno)d] [trace_id=%(otelTraceID)s span_id=%(otelSpanID)s resource.service.name=%(otelServiceName)s trace_sampled=%(otelTraceSampled)s] - %(message)s"
export VLLM_LOGGING_PREFIX="[%(filename)s:%(lineno)d] [trace_id=%(otelTraceID)s span_id=%(otelSpanID)s resource.service.name=%(otelServiceName)s trace_sampled=%(otelTraceSampled)s]"次に、vLLM フレームワークの起動コマンドに --enable-log-requests 起動パラメーターを追加して、リクエストレベルのログを出力します。
関連ドキュメント
vLLM および SGLang で収集されるスパンとメトリクス: 収集されるデータの完全なリストを記載しています。
vLLM および SGLang の収集設定: 収集スイッチ、トレース収集精度、入出力収集、メトリクス収集、エンジントラブルシューティングの設定項目について説明します。
同時実行性分析を使用した vLLM および SGLang アプリケーションの診断: エンジンの同時実行性分析機能について紹介します。