すべてのプロダクト
Search
ドキュメントセンター

Container Compute Service:inference-nv-pytorch 26.05

最終更新日:May 28, 2026

このトピックでは、inference-nv-pytorch 26.05 のリリースノートについて説明します。

主な特徴とバグ修正

主な特徴

  • バージョン 26.05 以降、CUDA 12.8 のサポートは終了しました。CUDA 13.0 のイメージのみが利用可能です。

    • CUDA 13.0 イメージは、amd64 と aarch64 の両方のアーキテクチャをサポートしています。

  • vLLM イメージでは、Torch が 2.11.0 に、vLLM が v0.20.2 にアップグレードされました。

  • SGLang イメージでは、Torch が 2.11.0 に、SGLang が v0.5.11 にアップグレードされました。

バグ修正

なし。

内容

イメージ名

inference-nv-pytorch

タグ

26.05-vllm0.20.2-pytorch2.11-cu130-20260513-serverless

26.05-sglang0.5.11-pytorch2.11-cu130-20260513-serverless

サポートされているアーキテクチャ

amd64

aarch64

amd64

aarch64

ユースケース

大規模モデル推論

大規模モデル推論

大規模モデル推論

大規模モデル推論

フレームワーク

pytorch

pytorch

pytorch

pytorch

要件

NVIDIA ドライバーリリース 580 以降

NVIDIA ドライバーリリース 580 以降

NVIDIA ドライバーリリース 580 以降

NVIDIA ドライバーリリース 580 以降

システムコンポーネント

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.11.0

  • CUDA 13.0.2

  • NCCL 2.29.7

  • diffusers 0.38.0

  • flash_attn 2.8.3

  • flash_attn_3 3.0.0

  • flashinfer-python 0.6.8

  • imageio-ffmpeg 0.6.0

  • ray 2.55.1

  • transformers 5.8.1

  • triton 3.6.0

  • torchvision 0.26.0

  • vllm 0.20.2

  • xfuser 0.4.5

  • xgrammar 0.2.0

  • ljperf 0.1.0+d0e4a408

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.11.0

  • CUDA 13.0.2

  • NCCL 2.29.7

  • flash_attn 2.8.4

  • flashinfer-python 0.6.8

  • transformers 4.57.6

  • vllm 0.20.2

  • triton 3.6.0

  • torchvision 0.26.0

  • xgrammar 0.1.33

  • ljperf 0.1.0+477686c5

  • ray 2.55.1

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.11.0

  • CUDA 13.0.2

  • NCCL 2.29.7

  • diffusers 0.38.0

  • decord 0.6.0

  • flash_attn 2.8.3

  • flash_attn_3 3.0.0

  • flashinfer-python 0.6.8

  • imageio-ffmpeg 0.6.0

  • ray 2.55.1

  • transformers 5.6.0

  • sgl-kernel 0.4.2

  • sglang 0.5.11

  • xgrammar 0.1.32

  • triton 3.6.0

  • torchao 0.17.0

  • torchaudio 2.11.0

  • torchvision 0.26.0

  • xfuser 0.4.5

  • ljperf 0.1.0+d0e4a408

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.11.0

  • CUDA 13.0.2

  • NCCL 2.29.7

  • diffusers 0.38.0

  • decord2 3.3.0

  • flash_attn 2.8.4

  • flashinfer-python 0.6.8

  • imageio-ffmpeg 0.6.0

  • ray 2.55.1

  • transformers 5.6.0

  • sgl-kernel 0.4.2

  • sglang 0.5.11

  • xgrammar 0.1.32

  • triton 3.6.0

  • torchao 0.17.0

  • torchaudio 2.11.0

  • torchvision 0.26.0

  • xfuser 0.4.5

  • ljperf 0.1.0+477686c5

アセット

パブリックイメージ

CUDA 13.0 アセット

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.05-vllm0.20.2-pytorch2.11-cu130-20260513-serverless

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.05-sglang0.5.11-pytorch2.11-cu130-20260513-serverless

VPC イメージ

説明

これらのイメージは ACS および EGS のマルチテナント向けです。EGS の専用環境では使用しないでください。

ドライバー要件

  • CUDA 13.0:NVIDIA ドライバーリリース 580 以降が必要です

クイックスタート

この例では、Docker を使用して inference-nv-pytorch イメージをプルし、Qwen2.5-7B-Instruct モデルで推論サービスをテストする方法を示します。

説明

ACS で inference-nv-pytorch イメージを使用するには、コンソールの [Create Workload] ページで [Artifacts Center] からイメージを選択します。YAML ファイルでイメージリファレンスを指定することもできます。詳細については、ACS GPU リソースを使用したモデル推論サービスの構築に関する次のトピックをご参照ください。

  1. 推論コンテナイメージをプルします。

    docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  2. ModelScope からオープンソースモデルをダウンロードします。

    pip install modelscope
    cd /mnt
    modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct
  3. 次のコマンドを実行してコンテナに入ります。

    docker run -d -t --network=host --privileged --init --ipc=host \
    --ulimit memlock=-1 --ulimit stack=67108864  \
    -v /mnt/:/mnt/ \
    egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  4. vLLM の対話機能の推論テストを実行します。

    1. サーバーサービスを開始します。

      python3 -m vllm.entrypoints.openai.api_server \
      --model /mnt/Qwen2.5-7B-Instruct \
      --trust-remote-code --disable-custom-all-reduce \
      --tensor-parallel-size 1
    2. クライアントでテストします。

      curl http://localhost:8000/v1/chat/completions \
          -H "Content-Type: application/json" \
          -d '{
          "model": "/mnt/Qwen2.5-7B-Instruct",  
          "messages": [
          {"role": "system", "content": "You are a friendly AI assistant."},
          {"role": "user", "content": "Introduce deep learning."}
          ]}'

      vLLM の使用方法の詳細については、「vLLM」をご参照ください。

既知の問題

  • このイメージは deepgpu-comfyui プラグインをサポートしていません。