Tous les produits
Search
Centre de documentation

Container Compute Service:inference-nv-pytorch 25.07

Dernière mise à jour :Aug 12, 2026

Cette version met à niveau vLLM, SGLang et deepgpu-comfyui, et corrige un bug d'inférence multi-nœuds affectant les déploiements DeepSeek-R1.

Nouveautés

Mises à niveau des frameworks

Framework Version
vLLM v0.9.2
SGLang v0.4.9.post1
deepgpu-comfyui v1.1.7

Correction de bug

L'exécution du modèle DeepSeek-R1 dans une configuration multi-nœuds (deux machines) avec vLLM 0.9.2 provoquait une erreur PPMissingLayer. Cette version intègre la correction issue de la PR upstream #20665, ce qui permet l'inférence distribuée sur des clusters multi-nœuds sans correctif manuel.

Spécifications des images

Cette version propose deux variantes d'image, toutes deux conçues pour l'inférence de grands modèles de langage (LLM) sous PyTorch avec CUDA 12.8.

**Image vLLM** **Image SGLang**
Tag de l'image 25.07-vllm0.9.2-pytorch2.7-cu128-20250714-serverless 25.07-sglang0.4.9-pytorch2.7-cu128-20250710-serverless
Cas d'utilisation Inférence LLM Inférence LLM
Framework PyTorch PyTorch
Prérequis pilote NVIDIA Driver ≥570 NVIDIA Driver ≥570

Composants système — Image vLLM

Composant Version
Ubuntu 24,04
Python 3.12
Torch 2.7.1+cu128
CUDA 12.8
NCCL 2.27.5
accelerate 1.8.1
diffusers 0.34.0
deepgpu-comfyui 1.1.7
deepgpu-torch 0.0.24+torch2.7.0cu128
flash_attn 2.8.1
imageio 2.37.0
imageio-ffmpeg 0.6.0
ray 2.47.1
transformers 4.53.1
vllm 0.9.3.dev0+ga5dd03c1e.d20250709
xgrammar 0.1.19
triton 3.3.1

Composants système — Image SGLang

Composant Version
Ubuntu 24,04
Python 3.12
Torch 2.7.1+cu128
CUDA 12.8
NCCL 2.27.5
accelerate 1.8.1
diffusers 0.34.0
deepgpu-comfyui 1.1.7
deepgpu-torch 0.0.24+torch2.7.0cu128
flash_attn 2.8.1
flash_mla 1.0.0+9edee0c
flashinfer-python 0.2.7.post1
imageio 2.37.0
imageio-ffmpeg 0.6.0
transformers 4.53.0
sgl-kernel 0.2.4
sglang 0.4.9.post1
xgrammar 0.1.20
triton 3.3.1
torchao 0.9.0

Accès aux images

Images publiques

Récupérez l'une ou l'autre des images directement depuis le registre public :

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.07-vllm0.9.2-pytorch2.7-cu128-20250714-serverless

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.07-sglang0.4.9-pytorch2.7-cu128-20250710-serverless

Images VPC

Pour réduire la latence lors de la récupération au sein d'un Virtual Private Cloud (VPC), utilisez l'adresse suivante :

acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag}

Remplacez {region-id} par l'identifiant de la région où votre service Alibaba Cloud Container Compute Service (ACS) est activé (par exemple, cn-beijing ou cn-wulanchabu), et {image:tag} par le nom de l'image et son tag.

Important

La récupération d'images via VPC n'est actuellement prise en charge que dans la région Chine (Pékin).

Remarque

Ces deux images sont compatibles avec les clusters ACS et les clusters multilocataires Lingjun. Elles ne sont pas prises en charge sur les clusters monolocataires Lingjun.

Prérequis pilotes

Les images CUDA 12.8 nécessitent NVIDIA Driver 570 ou version ultérieure.

Démarrage rapide

Cet exemple montre comment récupérer l'image vLLM, télécharger le modèle Qwen2.5-7B-Instruct et exécuter un test d'inférence.

Remarque

Pour les déploiements ACS, sélectionnez l'image depuis l'Artifact Center dans la console ou spécifiez-la dans votre configuration YAML. Consultez les guides suivants pour obtenir les instructions complètes de déploiement de bout en bout :

  1. Récupérez l'image.

    docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  2. Téléchargez le modèle depuis ModelScope.

    pip install modelscope
    cd /mnt
    modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct
  3. Lancez le conteneur.

    docker run -d -t --network=host --privileged --init --ipc=host \
      --ulimit memlock=-1 --ulimit stack=67108864 \
      -v /mnt/:/mnt/ \
      egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  4. Démarrez le serveur d'inférence vLLM.

    python3 -m vllm.entrypoints.openai.api_server \
      --model /mnt/Qwen2.5-7B-Instruct \
      --trust-remote-code --disable-custom-all-reduce \
      --tensor-parallel-size 1
  5. Envoyez une requête de test depuis le client.

    curl http://localhost:8000/v1/chat/completions \
      -H "Content-Type: application/json" \
      -d '{
        "model": "/mnt/Qwen2.5-7B-Instruct",
        "messages": [
          {"role": "system", "content": "You are a friendly AI assistant."},
          {"role": "user", "content": "Please introduce deep learning."}
        ]
      }'

    Pour plus d'informations, consultez la documentation vLLM.

Problèmes connus

Le plugin deepgpu-comfyui pour la génération vidéo avec le modèle Wanx prend uniquement en charge les types d'instances gn8is.