Tous les produits
Search
Centre de documentation

Container Compute Service:inference-nv-pytorch 25.11

Dernière mise à jour :Aug 28, 2026

Ce document présente les notes de version d'inference-nv-pytorch 25,11.

Fonctionnalités clés et corrections de bugs

Fonctionnalités clés

  • Cette version fournit des images pour deux versions de CUDA : CUDA 12.8 et CUDA 13.0.

    • L'image CUDA 12.8 prend en charge uniquement l'architecture amd64.

    • L'image CUDA 13.0 est compatible avec les architectures amd64 et aarch64 .

  • Mise à niveau de PyTorch vers la version 2.9.0.

  • Mise à niveau de deepgpu-comfyui vers la version 1.3.2 et du composant d'optimisation deepgpu-torch vers la version 0.1.12+torch2.9.0cu128 dans l'image CUDA 12.8.

  • Mise à niveau de vLLM vers la version v0.11.2 et de SGLang vers la version v0.5.5.post3 dans les images CUDA 12.8 et CUDA 13.0.

Corrections de bugs

Aucune

Contenu

Nom de l'image

inference-nv-pytorch

Tag de l'image

25.11-vllm0.11.1-pytorch2.9-cu128-20251120-serverless

25.11-sglang0.5.5.post3-pytorch2.9-cu128-20251121-serverless

25.11-vllm0.11.1-pytorch2.9-cu130-20251120-serverless

25.11-sglang0.5.5.post3-pytorch2.9-cu130-20251121-serverless

Architecture prise en charge

amd64

amd64

amd64

aarch64

amd64

aarch64

Cas d'utilisation

Inférence de grands modèles

Inférence de grands modèles

Inférence de grands modèles

Inférence de grands modèles

Inférence de grands modèles

Inférence de grands modèles

Framework

pytorch

pytorch

pytorch

pytorch

pytorch

pytorch

Prérequis

Version du pilote NVIDIA >= 570

Version du pilote NVIDIA >= 570

Version du pilote NVIDIA >= 580

Version du pilote NVIDIA >= 580

Version du pilote NVIDIA >= 580

Version du pilote NVIDIA >= 580

Composants système

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.9.0+cu128

  • CUDA 12.8

  • diffusers 0.35.2

  • deepgpu-comfyui 1.3.2

  • deepgpu-torch 0.1.12+torch2.9.0cu128

  • flash_attn 2.8.3

  • flashinfer-python 0.5.2

  • imageio 2.37.2

  • imageio-ffmpeg 0.6.0

  • ray 2.51.1

  • transformers 4.57.1

  • triton 3.4.0

  • torchaudio 2.8.0+cu128

  • torchvision 0.24.0+cu128

  • vllm 0.11.1

  • xfuser 0.4.5

  • xgrammar 0.1.25

  • ljperf 0.1.0+477686c5

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.9.0+cu128

  • CUDA 12.8

  • diffusers 0.35.2

  • decord 0.6.0

  • decord2 2.0.0

  • deepgpu-comfyui 1.3.2

  • deepgpu-torch 0.1.12+torch2.9.0cu128

  • flash_attn 2.8.3

  • flash_mla 1.0.0+1408756

  • flashinfer-python 0.5.2

  • imageio 2.37.2

  • imageio-ffmpeg 0.6.0

  • ray 2.51.1

  • transformers 4.57.1

  • sgl-kernel 0.3.17.post1

  • sglang 0.5.5.post3

  • xgrammar 0.1.25

  • triton 3.5.0

  • torchao 0.9.0

  • torchaudio 2.8.0+cu128

  • torchvision 0.24.0+cu128

  • xfuser 0.4.5

  • ljperf 0.1.0+477686c5

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.9.0+cu130

  • CUDA 13.0.2

  • diffusers 0.35.2

  • flash_attn 2.8.3

  • flashinfer-python 0.5.2

  • imageio 2.37.2

  • imageio-ffmpeg 0.6.0

  • ray 2.51.1

  • transformers 4.57.1

  • triton 3.5.0

  • torchaudio 2.9.0+cu130

  • torchvision 0.24.0+cu130

  • vllm 0.11.2

  • xfuser 0.4.5

  • xgrammar 0.1.25

  • ljperf 0.1.0+d0e4a408

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.9.0+cu130

  • CUDA 13.0.2

  • diffusers 0.35.2

  • flash_attn 2.8.3

  • flashinfer-python 0.5.2

  • transformers 4.57.1

  • ray 2.51.1

  • vllm 0.11.1

  • triton 3.5.0

  • torchaudio 2.9.0

  • torchvision 0.24.0

  • xfuser 0.4.5

  • xgrammar 0.1.25

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.9.0+cu130

  • CUDA 13.0.2

  • diffusers 0.35.2

  • decord 0.6.0

  • decord2 2.0.0

  • flash_attn 2.8.3

  • flashinfer-python 0.5.2

  • imageio 2.37.2

  • imageio-ffmpeg 0.6.0

  • ray 2.51.1

  • transformers 4.57.1

  • sgl-kernel 0.3.17.post1

  • sglang 0.5.5.post3

  • xgrammar 0.1.25

  • triton 3.5.0

  • torchao 0.9.0

  • torchaudio 2.9.0

  • torchvision 0.24.0

  • xfuser 0.4.5

  • ljperf 0.1.0+d0e4a408

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.9.0+cu130

  • CUDA 13.0.2

  • diffusers 0.35.2

  • decord2 2.0.0

  • flashinfer-python 0.5.2

  • imageio 2.37.2

  • flash_attn 2.8.3

  • imageio-ffmpeg 0.6.0

  • transformers 4.57.1

  • sgl-kernel 0.3.17.post1

  • sglang 0.5.5.post3

  • xgrammar 0.1.25

  • triton 3.5.0

  • torchao 0.9.0

  • torchaudio 2.9.0

  • torchvision 0.24.0

  • xfuser 0.4.5

Ressources

Images publiques

Ressources CUDA 12.8

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.11-vllm0.11.1-pytorch2.9-cu128-20251120-serverless

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.11-sglang0.5.5.post3-pytorch2.9-cu128-20251121-serverless

Ressources CUDA 13.0

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.11-vllm0.11.1-pytorch2.9-cu130-20251120-serverless

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.11-sglang0.5.5.post3-pytorch2.9-cu130-20251121-serverless

Images VPC

Toutes les images de conteneurs ACS AI, existantes et nouvelles, du référentiel egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun prennent en charge le téléchargement IN-VPC.

Remplacez l'hôte de registre public dans l'URI de votre image par l'endpoint VPC spécifique à la région.

Composant de l'URI

Réseau public

IN-VPC

Hôte du registre

egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com

acs-registry-vpc.{region-id}.cr.aliyuncs.com

Référentiel

egslingjun

egslingjun (inchangé)

Image et tag

{image:tag}

{image:tag} (inchangé)

Remplacez {region-id} par l'ID de la région où s'exécute votre service ACS. Par exemple :

Région

ID de région

Chine (Pékin)

cn-beijing

Chine (Ulanqab)

cn-wulanchabu

Pour consulter la liste complète des régions prises en charge, reportez-vous à la rubrique Régions.

Exemples de valeurs {image:tag} :

  • inference-nv-pytorch:25.10-vllm0.11.0-pytorch2.8-cu128-20251028-serverless

  • training-nv-pytorch:25.10-serverless

Remarque

Ces images sont destinées aux environnements ACS et Lingjun multi-locataires. Elles ne conviennent pas aux environnements Lingjun mono-locataire.

Prérequis relatifs aux pilotes

  • CUDA 12.8 : version du pilote NVIDIA >= 570

  • CUDA 13.0 : version du pilote NVIDIA >= 580

Démarrage rapide

L'exemple suivant montre comment télécharger une image inference-nv-pytorch à l'aide de Docker et tester un service d'inférence avec le modèle Qwen2,5-7B-Instruct.

Remarque

Pour utiliser une image inference-nv-pytorch dans ACS, sélectionnez-la depuis la page Artifact Center de la console lors de la création d'une charge de travail, ou spécifiez la référence de l'image dans un fichier YAML. Pour plus d'informations, consultez les rubriques suivantes relatives à la création d'un service d'inférence de modèle utilisant la puissance de calcul GPU d'ACS :

  1. Téléchargez l'image de conteneur d'inférence.

    docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  2. Téléchargez le modèle open source depuis ModelScope.

    pip install modelscope
    cd /mnt
    modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct
  3. Exécutez la commande suivante pour démarrer le conteneur et y accéder.

    docker run -it --rm --gpus all --network=host --privileged --init --ipc=host \
    --ulimit memlock=-1 --ulimit stack=67108864  \
    -v /mnt/:/mnt/ \
    egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  4. Testez la fonctionnalité d'inférence de chat vLLM.

    1. Démarrez le serveur.

      python3 -m vllm.entrypoints.openai.api_server \
      --model /mnt/Qwen2.5-7B-Instruct \
      --trust-remote-code --disable-custom-all-reduce \
      --tensor-parallel-size 1
    2. Envoyez une requête de test depuis le client.

      curl http://localhost:8000/v1/chat/completions \
          -H "Content-Type: application/json" \
          -d '{
          "model": "/mnt/Qwen2.5-7B-Instruct",  
          "messages": [
          {"role": "system", "content": "You are a friendly AI assistant."},
          {"role": "user", "content": "Introduce deep learning."}
          ]}'

      Pour plus d'informations sur vLLM, consultez la documentation vLLM.

Problèmes connus

  • Le plug-in deepgpu-comfyui, qui accélère la génération vidéo pour les modèles Wanx, est compatible uniquement avec les types d'instances GN8IS, G49E et G59.