Tous les produits
Search
Centre de documentation

Container Compute Service:inference-nv-pytorch 25.06

Dernière mise à jour :Aug 12, 2026

Cette version met à jour vLLM vers la v0.9.0.1 et SGLang vers la v0.4.7. Elle introduit également le plug-in deepgpu-comfyui pour accélérer l'inférence ComfyUI sur les GPU L20. Consultez cette rubrique pour vérifier les modifications, vous assurer que votre environnement respecte les prérequis en matière de pilotes et exécuter le guide de démarrage rapide afin de valider l'image.

Nouveautés

Fonctionnalités principales

  • vLLM passe à la version v0.9.0.1.

  • SGLang passe à la version v0.4.7.

  • Le plug-in deepgpu-comfyui accélère désormais les services ComfyUI sur les GPU L20 pour l'inférence des modèles Wan2.1 et FLUX. Les performances augmentent de 8 % à 40 % par rapport à PyTorch.

Corrections de bogues

Aucune.

Composants système

Cette version comprend deux variantes d'images : l'une basée sur vLLM, l'autre sur SGLang. Le tableau ci-dessous détaille leurs tags d'image, les cas d'usage ciblés ainsi que les versions des composants inclus.

**Image vLLM** **Image SGLang**
Tag d'image 25.06-vllm0.9.0.1-pytorch2.7-cu128-20250609-serverless 25.06-sglang0.4.7-pytorch2.7-cu128-20250611-serverless
Cas d'usage Raisonnement LLM Inférence LLM
Framework PyTorch PyTorch
Prérequis pilote NVIDIA >= 570 >= 550
Ubuntu 24,04 22,04
Python 3,12 3,10
Torch 2.7.1+cu128 2.7.1+cu128
CUDA 12.8 12.8
NCCL 2.27.3 2.27.3
accelerate 1.7.0 1.7.0
diffusers 0.33.1 0.33.1
deepgpu-comfyui 1.1.5 1.1.5
deepgpu-torch 0.0.21+torch2.7.0cu128 0.0.21+torch2.7.0cu128
flash_attn 2.7.4.post1 2.7.4.post1
flash_mla 1.0.0+9edee0c
flashinfer-python 0.2.6.post1
imageio 2.37.0 2.37.0
imageio-ffmpeg 0.6.0 0.6.0
ray 2.46.0 2.46.0
transformers 4.52.4 4.52.3
vllm 0.9.0.2.dev0+g5fbbfe9a4.d20250609
sgl-kernel 0.1.7
sglang 0.4.7
xgrammar 0.1.19 0.1.19
triton 3.3.1 3.3.1
torchao 0.9.0

Accès aux images

Images publiques

Récupérez l'une ou l'autre des images directement depuis le registre public :

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.06-vllm0.9.0.1-pytorch2.7-cu128-20250609-serverless

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.06-sglang0.4.7-pytorch2.7-cu128-20250611-serverless

Images VPC

Pour un accès via VPC, utilisez le modèle d'adresse suivant :

acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag}

Remplacez {region-id} par l'ID de la région où votre service ACS est activé, par exemple cn-beijing ou cn-wulanchabu. Remplacez ensuite {image:tag} par le nom et le tag de l'image souhaitée.

Important

La récupération des images via VPC est disponible uniquement dans la région Chine (Pékin).

Important

Les deux images (25.06-vllm0.9.0.1-pytorch2.7-cu128-20250609-serverless et 25.06-sglang0.4.7-pytorch2.7-cu128-20250611-serverless) sont compatibles avec les services ACS et les services FLUX multi-locataires. Elles ne sont en revanche pas compatibles avec les services FLUX mono-locataire.

Prérequis relatifs aux pilotes

Les deux images nécessitent CUDA 12.8. La version minimale du pilote NVIDIA varie selon l'image utilisée :

Image Version minimale du pilote NVIDIA
Image vLLM 570
Image SGLang 550

Guide de démarrage rapide

L'exemple ci-dessous montre comment récupérer l'image inference-nv-pytorch avec Docker et exécuter un test d'inférence à l'aide du modèle Qwen2.5-7B-Instruct.

Pour utiliser l'image inference-nv-pytorch dans ACS, sélectionnez-la depuis la page du centre d'artefacts lors de la création de charges de travail, ou spécifiez-la dans un fichier YAML. Pour plus de détails, consultez :
Utiliser la puissance de calcul GPU d'ACS pour déployer un service d'inférence de modèle à partir d'un modèle distillé DeepSeek
Utiliser la puissance de calcul GPU d'ACS pour déployer un service d'inférence de modèle basé sur la version complète de DeepSeek
Utiliser la puissance de calcul GPU d'ACS pour déployer un service d'inférence de modèle distribué basé sur la version complète de DeepSeek
  1. Récupérez l'image du conteneur d'inférence.

    docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  2. Téléchargez le modèle Qwen2.5-7B-Instruct depuis ModelScope.

    pip install modelscope
    cd /mnt
    modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct
  3. Démarrez le conteneur.

    docker run -d -t --network=host --privileged --init --ipc=host \
    --ulimit memlock=-1 --ulimit stack=67108864 \
    -v /mnt/:/mnt/ \
    egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  4. Exécutez le test d'inférence.

    1. Lancez le serveur API vLLM.

      python3 -m vllm.entrypoints.openai.api_server \
      --model /mnt/Qwen2.5-7B-Instruct \
      --trust-remote-code --disable-custom-all-reduce \
      --tensor-parallel-size 1
    2. Envoyez une requête de test depuis le client.

      curl http://localhost:8000/v1/chat/completions \
          -H "Content-Type: application/json" \
          -d '{
          "model": "/mnt/Qwen2.5-7B-Instruct",
          "messages": [
          {"role": "system", "content": "You are a friendly AI assistant."},
          {"role": "user", "content": "Please introduce deep learning."}
          ]}'

      Pour plus d'informations sur vLLM, consultez vLLM.

Problèmes connus

  • Le plug-in deepgpu-comfyui prend uniquement en charge les instances GN8IS pour l'accélération de la génération vidéo basée sur le modèle Wanx.