Tous les produits
Search
Centre de documentation

Container Compute Service:inference-nv-pytorch 26.07

Dernière mise à jour :Aug 28, 2026

La version inference-nv-pytorch 26,07 met à niveau vLLM vers la version v0.25.1 et SGLang vers la version v0.5.15.post1, et ajoute le support des architectures amd64 et aarch64.

Principales fonctionnalités et corrections de bugs

Principales fonctionnalités

  • L'image vLLM est mise à niveau vers vLLM v0.25.1.

  • L'image SGLang est mise à niveau vers SGLang v0.5.15.post1.

  • Les images vLLM et SGLang prennent en charge les architectures amd64 et aarch64.

Corrections de bugs

Aucune

Contenu

Nom de l'image

inference-nv-pytorch

Tag

26.07-vllm0.25.1-pytorch2.11-cu130-20260723-serverless

26.07-sglang0.5.15.post1-pytorch2.11-cu130-20260715-serverless

Architectures prises en charge

amd64

aarch64

amd64

aarch64

Scénario

Inférence de grands modèles

Inférence de grands modèles

Inférence de grands modèles

Inférence de grands modèles

Framework

pytorch

pytorch

pytorch

pytorch

Prérequis

Version du pilote NVIDIA >= 580

Version du pilote NVIDIA >= 580

Version du pilote NVIDIA >= 580

Version du pilote NVIDIA >= 580

Composants système

  • Ubuntu 24.04.3 LTS

  • Python 3.12.7

  • CUDA 13.0

  • NCCL 2.30.7-1

  • torch 2.11.0

  • torchvision 0.26.0

  • torchaudio 2.11.0

  • triton 3.7.1

  • Transformers 5.14.1

  • deep_ep 2.1.0+dd758ca

  • flash_attn 2.8.3

  • flash_attn_3 3.0.0

  • flashinfer-python 0.6.13

  • flashinfer-cubin 0.6.13

  • flash_mla 1.0.0+b7643bd

  • mooncake 0.3.11.post1

  • nvshmem 3.7.1

  • xgrammar 0.2.3

  • vLLM 0.25.1

  • ray 2.56.1

  • ljperf 0.1.0+d0e4a408

  • numpy 2.3.5

  • Ubuntu 24.04

  • Python 3.12.7

  • CUDA 13.0.2

  • NCCL 2.30.7-1

  • torch 2.11.0

  • torchvision 0.26.0

  • torchaudio 2.11.0

  • torchao 0.17.0

  • triton 3.6.0

  • Transformers 5.12.1

  • diffusers 0.39.0

  • decord 3.4.0

  • deep_ep 2.1.0

  • imageio-ffmpeg 0.6.0

  • flash_attn 2.8.3

  • flash_attn_3 3.0.0

  • flashinfer-python 0.6.13

  • flash_mla 1.0.0

  • mooncake 0.3.11.post1

  • nvshmem 3.7.1

  • xgrammar 0.2.3

  • vLLM 0.25.1

  • ray 2.56.0

  • xfuser 0.4.5

  • ljperf 0.1.0+477686c5

  • Ubuntu 24.04

  • Python 3.12

  • CUDA 13.0.2

  • NCCL 2.30.7-1

  • torch 2.11.0

  • torchvision 0.26.0

  • torchaudio 2.11.0

  • torchao 0.17.0

  • triton 3.6.0

  • Transformers 5.12.1

  • diffusers 0.39.0

  • decord 0.6.0

  • deep_ep 2.1.0

  • imageio-ffmpeg 0.6.0

  • flash_attn 2.8.3

  • flash_attn_3 3.0.0

  • flash-attn-4 4.0.0b15

  • flashinfer-python 0.6.12

  • flash_mla 1.0.0

  • mooncake 0.3.11.post1

  • nvshmem 3.7.1

  • xgrammar 0.2.1

  • sgl-kernel 0.4.4

  • sglang 0.5.15.post1

  • ray 2.56.0

  • xfuser 0.4.5

  • ljperf 0.1.0+d0e4a408

  • Ubuntu 24.04

  • Python 3.12

  • CUDA 13.0.2

  • NCCL 2.30.7-1

  • torch 2.11.0

  • torchvision 0.26.0

  • torchaudio 2.11.0

  • torchao 0.17.0

  • triton 3.6.0

  • transformers 5.12.1

  • diffusers 0.39.0

  • decord 3.4.0

  • deep_ep 2.1.0

  • imageio-ffmpeg 0.6.0

  • flash_attn 2.8.3

  • flash_attn_3 3.0.0

  • flash-attn-4 4.0.0b15

  • flashinfer-python 0.6.12

  • flash_mla 1.0.0

  • mooncake 0.3.11.post1

  • nvshmem 3.7.1

  • xgrammar 0.2.1

  • sgl-kernel 0.4.4

  • sglang 0.5.15.post1

  • ray 2.56.0

  • xfuser 0.4.5

  • ljperf 0.1.0+477686c5

Ressource

Images publiques

Ressource CUDA 13.0

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.07-vllm0.25.1-pytorch2.11-cu130-20260723-serverless

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.07-sglang0.5.15.post1-pytorch2.11-cu130-20260715-serverless

Images VPC

Pour extraire rapidement les images de conteneur ACS AI dans un VPC, remplacez l'URI de ressource de l'image de conteneur AI spécifiée egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/{image:tag} par acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag}.

  • {region-id} : l'ID de région du produit ACS. Par exemple, cn-beijing et cn-wulanchabu.

  • {image:tag} : le nom et le tag de l'image de conteneur AI. Par exemple, inference-nv-pytorch:25.10-vllm0.11.0-pytorch2.8-cu128-20251028-serverless et training-nv-pytorch:25.10-serverless.

Remarque

Ces images sont destinées aux environnements multi-locataires ACS et EGS. Ne les utilisez pas dans les environnements dédiés EGS.

Prérequis du pilote

  • CUDA 13.0 : version du pilote NVIDIA ≥ 580

Démarrage rapide

Cet exemple montre comment extraire l'image inference-nv-pytorch à l'aide de Docker et tester le service d'inférence avec le modèle Qwen2,5-7B-Instruct.

Remarque

Pour utiliser l'image inference-nv-pytorch dans ACS, sélectionnez l'image depuis le centre des artefacts sur la page Créer une charge de travail dans la console. Vous pouvez également spécifier la référence de l'image dans un fichier YAML. Pour plus d'informations, consultez les rubriques suivantes concernant la création de services d'inférence de modèles avec les ressources GPU ACS :

  1. Extrayez l'image du conteneur d'inférence.

    docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  2. Téléchargez le modèle open source depuis ModelScope.

    pip install modelscope
    cd /mnt
    modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct
  3. Exécutez la commande suivante pour entrer dans le conteneur.

    docker run -d -t --network=host --privileged --init --ipc=host \
    --ulimit memlock=-1 --ulimit stack=67108864  \
    -v /mnt/:/mnt/ \
    egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  4. Exécutez un test d'inférence pour la fonctionnalité conversationnelle vLLM.

    1. Démarrez le service serveur.

      python3 -m vllm.entrypoints.openai.api_server \
      --model /mnt/Qwen2.5-7B-Instruct \
      --trust-remote-code --disable-custom-all-reduce \
      --tensor-parallel-size 1
    2. Effectuez un test sur le client.

      curl http://localhost:8000/v1/chat/completions \
          -H "Content-Type: application/json" \
          -d '{
          "model": "/mnt/Qwen2.5-7B-Instruct",  
          "messages": [
          {"role": "system", "content": "You are a friendly AI assistant."},
          {"role": "user", "content": "Introduce deep learning."}
          ]}'

      Pour plus d'informations sur l'utilisation de vLLM, consultez vLLM.

Problèmes connus

  • Les images de cette version ne prennent pas en charge le plugin deepgpu-comfyui.