Tous les produits
Search
Centre de documentation

Container Compute Service:inference-nv-pytorch 26.03

Dernière mise à jour :Aug 24, 2026

Cette rubrique présente les notes de version pour inference-nv-pytorch 26,03.

Fonctionnalités principales et corrections de bugs

Fonctionnalités principales

  • Cette version fournit des images pour CUDA 12.8 et CUDA 13.0 :

    • L'image CUDA 12.8 prend uniquement en charge l'architecture amd64.

    • L'image CUDA 13.0 prend en charge les architectures amd64 et aarch64.

  • Cette version met à jour vLLM vers la version v0.17.1 et ajoute la prise en charge du modèle Qwen3,5.

Corrections de bugs

Aucune.

Contenu

Nom de l'image

inference-nv-pytorch

Tag

26.03-vllm0.17.1-pytorch2.10-cu128-20260317-serverless

26.03-vllm0.17.1-pytorch2.10-cu130-20260317-serverless

Architecture prise en charge

amd64

amd64

aarch64

Cas d'utilisation

inférence de grands modèles

inférence de grands modèles

inférence de grands modèles

Framework

PyTorch

PyTorch

PyTorch

Prérequis

Version du pilote NVIDIA >= 570

Version du pilote NVIDIA >= 580

Version du pilote NVIDIA >= 580

Composants système

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.10.0

  • CUDA 12.8

  • NCCL 2.29.7

  • diffusers 0.37.0

  • flash_attn 2.8.4

  • flash_attn_3 3.0.0

  • flashinfer-python 0.6.4

  • imageio-ffmpeg 0.6.0

  • ray 2.54.0

  • transformers 4.57.6

  • triton 3.6.0

  • torchaudio 2.10.0

  • torchvision 0.25.0

  • vllm 0.17.1

  • xfuser 0.4.5

  • xgrammar 0.1.29

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.10.0+cu130

  • CUDA 13.0.2

  • NCCL 2.29.7

  • diffusers 0.37.0

  • flash_attn 2.8.4

  • flash_attn_3 3.0.0

  • flashinfer-python 0.6.4

  • imageio-ffmpeg 0.6.0

  • ray 2.54.0

  • transformers 4.57.6

  • triton 3.6.0

  • torchaudio 2.10.0+cu130

  • torchvision 0.25.0+cu130

  • vllm 0.17.1

  • xfuser 0.4.5

  • xgrammar 0.1.29

  • ljperf 0.1.0+d0e4a408

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.10.0+cu130

  • CUDA 13.0.2

  • NCCL 2.29.7

  • flash_attn 2.8.4

  • flashinfer-python 0.6.4

  • transformers 4.57.6

  • ray 2.54.0

  • vllm 0.17.1

  • triton 3.6.0

  • torchaudio 2.10.0+cu130

  • torchvision 0.25.0+cu130

  • xgrammar 0.1.29

  • ljperf 0.1.0+477686c5

Ressources

Image publique

Ressource CUDA 12.8

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.03-vllm0.17.1-pytorch2.10-cu128-20260317-serverless

Ressource CUDA 13.0

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.03-vllm0.17.1-pytorch2.10-cu130-20260317-serverless

Image VPC

Toutes les images de conteneur ACS AI existantes et nouvelles du dépôt egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun prennent en charge le tirage via VPC (IN-VPC).

Remplacez l'hôte du registre public dans l'URI de votre image par le point de terminaison VPC spécifique à la région.

Composant URI

Réseau public

IN-VPC

Hôte du registre

egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com

acs-registry-vpc.{region-id}.cr.aliyuncs.com

Dépôt

egslingjun

egslingjun (inchangé)

Image et tag

{image:tag}

{image:tag} (inchangé)

Remplacez {region-id} par l'ID de la région où s'exécute votre service ACS. Par exemple :

Région

ID de région

Chine (Pékin)

cn-beijing

Chine (Ulanqab)

cn-wulanchabu

Pour obtenir la liste complète des régions prises en charge, consultez la rubrique Régions.

Exemples de valeurs {image:tag} :

  • inference-nv-pytorch:25.10-vllm0.11.0-pytorch2.8-cu128-20251028-serverless

  • training-nv-pytorch:25.10-serverless

Remarque

Ces images sont destinées aux environnements AI Computing Service (ACS) et Lingjun multi-locataires. Elles ne sont pas prises en charge dans les environnements Lingjun mono-locataires.

Prérequis relatifs au pilote

  • CUDA 12.8 : version du pilote NVIDIA >= 570

  • CUDA 13.0 : version du pilote NVIDIA >= 580

Démarrage rapide

L'exemple suivant montre comment tirer l'image inference-nv-pytorch à l'aide de Docker et tester le service d'inférence avec le modèle Qwen2,5-7B-Instruct.

Remarque

Pour utiliser l'image inference-nv-pytorch dans AI Computing Service (ACS), sélectionnez-la depuis la page du référentiel d'artefacts lors de la création d'une charge de travail dans la console, ou spécifiez la référence de l'image dans un fichier YAML. Pour plus d'informations, consultez les rubriques suivantes sur la construction de services d'inférence de modèles avec la puissance de calcul GPU ACS :

  1. Tirez l'image du conteneur d'inférence.

    docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  2. Téléchargez le modèle open source depuis ModelScope.

    pip install modelscope
    cd /mnt
    modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct
  3. Exécutez la commande suivante pour entrer dans le conteneur.

    docker run -it --rm --gpus all --network=host --privileged --init --ipc=host \
    --ulimit memlock=-1 --ulimit stack=67108864  \
    -v /mnt/:/mnt/ \
    egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  4. Exécutez un test d'inférence pour vérifier la fonctionnalité de complétion de chat vLLM.

    1. Démarrez le service côté serveur.

      python3 -m vllm.entrypoints.openai.api_server \
      --model /mnt/Qwen2.5-7B-Instruct \
      --trust-remote-code --disable-custom-all-reduce \
      --tensor-parallel-size 1
    2. Exécutez un test côté client.

      curl http://localhost:8000/v1/chat/completions \
          -H "Content-Type: application/json" \
          -d '{
          "model": "/mnt/Qwen2.5-7B-Instruct",  
          "messages": [
          {"role": "system", "content": "You are a friendly AI assistant."},
          {"role": "user", "content": "Introduce deep learning."}
          ]}'

      Pour plus d'informations, consultez la documentation vLLM.

Problèmes connus

  • Cette image ne prend pas en charge le plugin deepgpu-comfyui.