Tous les produits
Search
Centre de documentation

Container Compute Service:inference-nv-pytorch 25.09

Dernière mise à jour :Aug 12, 2026

Ce document présente les notes de version d'inference-nv-pytorch 25.09.

Fonctionnalités principales et corrections de bugs

Fonctionnalités principales

  • Cette version met à jour PyTorch vers la version 2.8.0.

  • Cette version met à jour vLLM vers la version v0.10.2.

  • Cette version met à jour SGLang vers la version v0.5.2.

  • Cette version met à jour deepgpu-comfyui vers la version 1.2.1 et le composant d'optimisation deepgpu-torch vers la version 0.1.1+torch2.8.0cu128.

Corrections de bugs

Aucune.

Contenu

inference-nv-pytorch

inference-nv-pytorch

Tag

25.09-vllm0.10.2-pytorch2.8-cu128-20250922-serverless

25.09-sglang0.5.2-pytorch2.8-cu128-20250917-serverless

Scénarios

Inférence de grands modèles

Inférence de grands modèles

Framework

PyTorch

PyTorch

Prérequis

NVIDIA Driver release >= 570

NVIDIA Driver release >= 570

Composants système

  • Ubuntu 24.04

  • Python 3.12

  • PyTorch 2.8.0

  • CUDA 12.8

  • diffusers 0.35.1

  • deepgpu-comfyui 1.2.1

  • deepgpu-torch 0.1.1+torch2.8.0cu128

  • flash_attn 2.8.3

  • flashinfer-python 0.3.1

  • imageio 2.37.0

  • imageio-ffmpeg 0.6.0

  • ray 2.49.1

  • transformers 4.56.1

  • triton 3.4.0

  • vllm 0.10.2

  • xformers 0.0.32.post1

  • xfuser 0.4.4

  • xgrammar 0.1.23

  • ljperf 0.1.0+477686c5

  • Ubuntu 24.04

  • Python 3.12

  • PyTorch 2.8.0

  • CUDA 12.8

  • decord 0.6.0

  • diffusers 0.35.1

  • deepgpu-comfyui 1.2.1

  • deepgpu-torch 0.1.1+torch2.8.0cu128

  • flash_attn 2.8.3

  • flash_mla 1.0.0+261330b

  • flashinfer-python 0.3.1

  • imageio 2.37.0

  • imageio-ffmpeg 0.6.0

  • transformers 4.56.1

  • sgl-kernel 0.3.9

  • sglang 0.5.2

  • xgrammar 0.1.24

  • triton 3.4.0

  • torchao 0.9.0

  • torchaudio 2.8.0

  • xfuser 0.4.4

  • ljperf 0.1.0+477686c5

Ressources

Image publique

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.09-vllm0.10.2-pytorch2.8-cu128-20250922-serverless

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.09-sglang0.5.2-pytorch2.8-cu128-20250917-serverless

Image VPC

acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag}
Remplacez {region-id} par l'ID de la région où votre service Alibaba Cloud Container Compute Service (ACS) est activé (par exemple, cn-beijing ou cn-wulanchabu ).
Remplacez {image:tag} par le nom et le tag de l'image.
Remarque

Les images inference-nv-pytorch:25.03-vllm0.8.2-pytorch2.6-cu124-20250328-serverless et inference-nv-pytorch:25.03-sglang0.4.4.post1-pytorch2.5-cu124-20250327-serverless sont compatibles uniquement avec les déploiements multi-locataires ACS et Lingjun. Elles ne sont pas compatibles avec les déploiements mono-locataire Lingjun.

Remarque

Les images inference-nv-pytorch:25.09-vllm0.10.2-pytorch2.8-cu128-20250922-serverless et inference-nv-pytorch:25.09-sglang0.5.2-pytorch2.8-cu128-20250917-serverless sont destinées aux produits multi-locataires ACS et Lingjun. Elles ne s'appliquent pas aux produits mono-locataire Lingjun.

Prérequis du pilote

NVIDIA Driver release >= 570

Démarrage rapide

L'exemple suivant montre comment récupérer l'image inference-nv-pytorch avec Docker et tester le service d'inférence avec le modèle Qwen2.5-7B-Instruct.

Remarque

Pour utiliser l'image inference-nv-pytorch dans AI Computing Service (ACS), sélectionnez-la depuis la page Artifact Center lors de la création d'une charge de travail, ou spécifiez la référence de l'image dans un fichier YAML. Pour plus d'informations, consultez les rubriques suivantes sur la création de services d'inférence de modèles avec le calcul GPU ACS :

  1. Récupérez l'image du conteneur d'inférence.

    docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  2. Téléchargez le modèle open source au format ModelScope.

    pip install modelscope
    cd /mnt
    modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct
  3. Exécutez la commande suivante pour accéder au conteneur.

    docker run -it --rm --gpus all --network=host --privileged --init --ipc=host \
    --ulimit memlock=-1 --ulimit stack=67108864  \
    -v /mnt/:/mnt/ \
    egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  4. Testez l'inférence pour vérifier la fonctionnalité de chat de vLLM.

    1. Démarrez le serveur.

      python3 -m vllm.entrypoints.openai.api_server \
      --model /mnt/Qwen2.5-7B-Instruct \
      --trust-remote-code --disable-custom-all-reduce \
      --tensor-parallel-size 1
    2. Lancez un test côté client.

      curl http://localhost:8000/v1/chat/completions \
          -H "Content-Type: application/json" \
          -d '{
          "model": "/mnt/Qwen2.5-7B-Instruct",  
          "messages": [
          {"role": "system", "content": "You are a friendly AI assistant."},
          {"role": "user", "content": "Tell me about deep learning."}
          ]}'

      Pour plus d'informations sur l'utilisation de vLLM, consultez la documentation vLLM.

Problèmes connus

  • Le plugin deepgpu-comfyui, qui accélère la génération vidéo pour les modèles Wanx, prend uniquement en charge les instances GN8IS et G49E.