Tous les produits
Search
Centre de documentation

Container Compute Service:inference-nv-pytorch 26.01

Dernière mise à jour :Aug 28, 2026

La version inference-nv-pytorch 26,01 fournit des images de conteneur pour l'inférence de grands modèles sur les formats de produit ACS et Lingjun multi-locataire. Utilisez ces notes de version pour choisir un tag d'image, vérifier les composants système inclus dans chaque image et consulter la version du pilote NVIDIA requise.

Principales fonctionnalités et corrections de bogues

Principales fonctionnalités

  • Fournit des images pour deux versions de CUDA : CUDA 12.8 et CUDA 13.0.

    • L'image CUDA 12.8 prend en charge uniquement l'architecture amd64.

    • L'image CUDA 13.0 prend en charge les architectures amd64 et aarch64.

  • Dans l'image CUDA 12.8, deepgpu-comfyui passe à la version 1.4.1 et le composant d'optimisation deepgpu-torch à la version 0.1.18+torch2.9.0cu128.

  • Dans les images CUDA 12.8 et CUDA 13.0, vLLM passe à la version v0.14.0 et SGLang à la version v0.5.7.

Corrections de bogues

Aucune.

Contenu

Nom de l'image

inference-nv-pytorch

inference-nv-pytorch

inference-nv-pytorch

inference-nv-pytorch

inference-nv-pytorch

inference-nv-pytorch

Tag

26.01-vllm0.14.0-pytorch2.9-cu128-20260121-serverless

26.01-sglang0.5.7-pytorch2.9-cu128-20260113-serverless

26.01-vllm0.14.0-pytorch2.9-cu130-20260123-serverless

26.01-vllm0.14.0-pytorch2.9-cu130-20260123-serverless

26.01-sglang0.5.7-pytorch2.9-cu130-20260113-serverless

26.01-sglang0.5.7-pytorch2.9-cu130-20260113-serverless

Architecture prise en charge

amd64

amd64

amd64

aarch64

amd64

aarch64

Scénario d'application

inférence de grands modèles

inférence de grands modèles

inférence de grands modèles

inférence de grands modèles

inférence de grands modèles

inférence de grands modèles

Framework

pytorch

pytorch

pytorch

pytorch

pytorch

pytorch

Prérequis

Version du pilote NVIDIA >= 570

Version du pilote NVIDIA >= 570

Version du pilote NVIDIA >= 580

Version du pilote NVIDIA >= 580

Version du pilote NVIDIA >= 580

Version du pilote NVIDIA >= 580

Composants système

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.9.1

  • CUDA 12.8

  • diffusers 0.36.0

  • deepgpu-comfyui 1.4.1

  • deepgpu-torch 0.1.18+torch2.9.0cu128

  • flash_attn 2.8.3

  • flashinfer-python 0.5.3

  • imageio 2.37.2

  • imageio-ffmpeg 0.6.0

  • ray 2.53.0

  • transformers 4.57.6

  • triton 3.5.1

  • torchaudio 2.9.1

  • torchvision 0.24.1

  • vllm 0.14.0

  • xfuser 0.4.5

  • xgrammar 0.1.27

  • ljperf 0.1.0+477686c5

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.9.1+cu128

  • CUDA 12.8

  • torchaudio 2.9.1+128

  • torchvision 0.24.1+128

  • diffusers 0.36.0

  • decord 0.6.0

  • decord2 3.0.0

  • deepgpu-comfyui 1.4.1

  • deepgpu-torch 0.1.18+torch2.9.0cu128

  • flash_attn 2.8.3

  • flash_mla 1.0.0+1408756

  • flashinfer-python 0.5.3

  • imageio 2.37.2

  • imageio-ffmpeg 0.6.0

  • ray 2.53.0

  • transformers 4.57.1

  • sgl-kernel 0.3.20

  • sglang 0.5.7

  • xgrammar 0.1.27

  • triton 3.5.1

  • torchao 0.9.0

  • xfuser 0.4.5

  • ljperf 0.1.0+477686c5

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.9.1+cu130

  • CUDA 13.0.2

  • diffusers 0.36.0

  • flash_attn 2.8.3

  • flashinfer-python 0.5.3

  • imageio 2.37.2

  • imageio-ffmpeg 0.6.0

  • ray 2.53.1

  • transformers 4.57.6

  • triton 3.5.0

  • torchaudio 2.9.1+cu130

  • torchvision 0.24.1+cu130

  • vllm 0.14.0

  • xfuser 0.4.5

  • xgrammar 0.1.27

  • ljperf 0.1.0+d0e4a408

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.9.1+cu130

  • CUDA 13.0.2

  • diffusers 0.36.0

  • flash_attn 2.8.3

  • flashinfer-python 0.5.3

  • transformers 4.57.6

  • ray 2.53.0

  • vllm 0.14.0

  • triton 3.5.1

  • torchaudio 2.9.1+cu130

  • torchvision 2.9.1+cu130

  • xfuser 0.4.5

  • xgrammar 0.1.27

  • ljperf 0.1.0+477686c5

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.9.1+cu130

  • CUDA 13.0.2

  • diffusers 0.36.0

  • decord 0.6.0

  • decord2 3.0.0

  • flash_attn 2.8.3

  • flashinfer-python 0.5.3

  • imageio 2.37.2

  • imageio-ffmpeg 0.6.0

  • ray 2.53.0

  • transformers 4.57.1

  • sgl-kernel 0.3.20

  • sglang 0.5.7

  • xgrammar 0.1.27

  • triton 3.5.1

  • torchao 0.9.0

  • torchaudio 2.9.1

  • torchvision 0.24.1+cu130

  • xfuser 0.4.5

  • ljperf 0.1.0+d0e4a408

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.9.1+cu130

  • CUDA 13.0.2

  • diffusers 0.36.0

  • decord2 3.0.0

  • flash_attn 2.8.3

  • flashinfer-python 0.5.3

  • imageio 2.37.2

  • imageio-ffmpeg 0.6.0

  • transformers 4.57.1

  • sgl-kernel 0.3.20

  • sglang 0.5.7

  • xgrammar 0.1.27

  • triton 3.5.1

  • torchao 0.9.0

  • torchaudio 2.9.1

  • torchvision 0.24.1

  • xfuser 0.4.5

Prérequis relatifs au pilote

  • CUDA 12.8 : version du pilote NVIDIA >= 570

  • CUDA 13.0 : version du pilote NVIDIA >= 580

Ressources

Images publiques

Ressources CUDA 12.8

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.01-vllm0.14.0-pytorch2.9-cu128-20260121-serverless

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.01-sglang0.5.7-pytorch2.9-cu128-20260113-serverless

Ressources CUDA 13.0

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.01-vllm0.14.0-pytorch2.9-cu130-20260123-serverless

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.01-sglang0.5.7-pytorch2.9-cu130-20260113-serverless

Images VPC

Remplacez l'URI de ressource d'image de conteneur IA egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/{image:tag} spécifié dans le fichier YAML de la console ACS par acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag} afin de télécharger rapidement les images de conteneur IA PG1 via le VPC.

  • {region-id} correspond à la région disponible dans laquelle votre service ACS est activé, par exemple cn-beijing et cn-wulanchabu.

  • {image:tag} représente le nom et le tag de l'image.

Ces images s'appliquent au format de produit ACS et au format de produit Lingjun multi-locataire. Elles ne sont pas compatibles avec le format de produit Lingjun mono-locataire. N'utilisez pas ces images dans un environnement Lingjun mono-locataire.

Démarrage rapide

L'exemple suivant montre comment télécharger l'image inference-nv-pytorch uniquement à l'aide de Docker et tester le service d'inférence avec le modèle Qwen2,5-7B-Instruct.

Pour utiliser l'image inference-nv-pytorch dans ACS, sélectionnez-la depuis la page Artifact Center lors de la création d'une charge de travail dans la console, ou spécifiez la référence de l'image dans un fichier YAML. Pour plus d'informations, consultez les rubriques suivantes relatives à la construction de services d'inférence de modèles et à l'accélération des charges de travail de modèles à l'aide de la puissance de calcul GPU ACS :

  1. Téléchargez l'image de conteneur d'inférence. Remplacez [tag] par un tag d'image répertorié dans le tableau Contenu ou dans la section Images publiques de cette rubrique.

    docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  2. Téléchargez le modèle open source depuis ModelScope.

    pip install modelscope
    cd /mnt
    modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct
  3. Exécutez la commande suivante pour entrer dans le conteneur.

    docker run -it --rm --gpus all --network=host --privileged --init --ipc=host \
    --ulimit memlock=-1 --ulimit stack=67108864  \
    -v /mnt/:/mnt/ \
    egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  4. Exécutez un test d'inférence sur la fonctionnalité de chat vLLM.

    1. Démarrez le service côté serveur.

      python3 -m vllm.entrypoints.openai.api_server \
      --model /mnt/Qwen2.5-7B-Instruct \
      --trust-remote-code --disable-custom-all-reduce \
      --tensor-parallel-size 1
    2. Exécutez le test sur le client.

      curl http://localhost:8000/v1/chat/completions \
          -H "Content-Type: application/json" \
          -d '{
          "model": "/mnt/Qwen2.5-7B-Instruct",  
          "messages": [
          {"role": "system", "content": "You are a friendly AI assistant."},
          {"role": "user", "content": "Introduce deep learning."}
          ]}'

Pour plus d'informations sur l'utilisation de vLLM, consultez le dépôt du projet.

Problèmes connus

  • Le plugin deepgpu-comfyui pour l'accélération de la génération vidéo du modèle Wanx prend actuellement en charge uniquement les types d'instance GN8IS, G49E et G59.