Cette version met à niveau vLLM, SGLang et deepgpu-comfyui, et corrige un bug d'inférence multi-nœuds affectant les déploiements DeepSeek-R1.
Nouveautés
Mises à niveau des frameworks
| Framework | Version |
|---|---|
| vLLM | v0.9.2 |
| SGLang | v0.4.9.post1 |
| deepgpu-comfyui | v1.1.7 |
Correction de bug
L'exécution du modèle DeepSeek-R1 dans une configuration multi-nœuds (deux machines) avec vLLM 0.9.2 provoquait une erreur PPMissingLayer. Cette version intègre la correction issue de la PR upstream #20665, ce qui permet l'inférence distribuée sur des clusters multi-nœuds sans correctif manuel.
Spécifications des images
Cette version propose deux variantes d'image, toutes deux conçues pour l'inférence de grands modèles de langage (LLM) sous PyTorch avec CUDA 12.8.
| **Image vLLM** | **Image SGLang** | |
|---|---|---|
| Tag de l'image | 25.07-vllm0.9.2-pytorch2.7-cu128-20250714-serverless |
25.07-sglang0.4.9-pytorch2.7-cu128-20250710-serverless |
| Cas d'utilisation | Inférence LLM | Inférence LLM |
| Framework | PyTorch | PyTorch |
| Prérequis pilote | NVIDIA Driver ≥570 | NVIDIA Driver ≥570 |
Composants système — Image vLLM
| Composant | Version |
|---|---|
| Ubuntu | 24,04 |
| Python | 3.12 |
| Torch | 2.7.1+cu128 |
| CUDA | 12.8 |
| NCCL | 2.27.5 |
| accelerate | 1.8.1 |
| diffusers | 0.34.0 |
| deepgpu-comfyui | 1.1.7 |
| deepgpu-torch | 0.0.24+torch2.7.0cu128 |
| flash_attn | 2.8.1 |
| imageio | 2.37.0 |
| imageio-ffmpeg | 0.6.0 |
| ray | 2.47.1 |
| transformers | 4.53.1 |
| vllm | 0.9.3.dev0+ga5dd03c1e.d20250709 |
| xgrammar | 0.1.19 |
| triton | 3.3.1 |
Composants système — Image SGLang
| Composant | Version |
|---|---|
| Ubuntu | 24,04 |
| Python | 3.12 |
| Torch | 2.7.1+cu128 |
| CUDA | 12.8 |
| NCCL | 2.27.5 |
| accelerate | 1.8.1 |
| diffusers | 0.34.0 |
| deepgpu-comfyui | 1.1.7 |
| deepgpu-torch | 0.0.24+torch2.7.0cu128 |
| flash_attn | 2.8.1 |
| flash_mla | 1.0.0+9edee0c |
| flashinfer-python | 0.2.7.post1 |
| imageio | 2.37.0 |
| imageio-ffmpeg | 0.6.0 |
| transformers | 4.53.0 |
| sgl-kernel | 0.2.4 |
| sglang | 0.4.9.post1 |
| xgrammar | 0.1.20 |
| triton | 3.3.1 |
| torchao | 0.9.0 |
Accès aux images
Images publiques
Récupérez l'une ou l'autre des images directement depuis le registre public :
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.07-vllm0.9.2-pytorch2.7-cu128-20250714-serverlessegslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.07-sglang0.4.9-pytorch2.7-cu128-20250710-serverless
Images VPC
Pour réduire la latence lors de la récupération au sein d'un Virtual Private Cloud (VPC), utilisez l'adresse suivante :
acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag}
Remplacez {region-id} par l'identifiant de la région où votre service Alibaba Cloud Container Compute Service (ACS) est activé (par exemple, cn-beijing ou cn-wulanchabu), et {image:tag} par le nom de l'image et son tag.
La récupération d'images via VPC n'est actuellement prise en charge que dans la région Chine (Pékin).
Ces deux images sont compatibles avec les clusters ACS et les clusters multilocataires Lingjun. Elles ne sont pas prises en charge sur les clusters monolocataires Lingjun.
Prérequis pilotes
Les images CUDA 12.8 nécessitent NVIDIA Driver 570 ou version ultérieure.
Démarrage rapide
Cet exemple montre comment récupérer l'image vLLM, télécharger le modèle Qwen2.5-7B-Instruct et exécuter un test d'inférence.
Pour les déploiements ACS, sélectionnez l'image depuis l'Artifact Center dans la console ou spécifiez-la dans votre configuration YAML. Consultez les guides suivants pour obtenir les instructions complètes de déploiement de bout en bout :
-
Récupérez l'image.
docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Téléchargez le modèle depuis ModelScope.
pip install modelscope cd /mnt modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct -
Lancez le conteneur.
docker run -d -t --network=host --privileged --init --ipc=host \ --ulimit memlock=-1 --ulimit stack=67108864 \ -v /mnt/:/mnt/ \ egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Démarrez le serveur d'inférence vLLM.
python3 -m vllm.entrypoints.openai.api_server \ --model /mnt/Qwen2.5-7B-Instruct \ --trust-remote-code --disable-custom-all-reduce \ --tensor-parallel-size 1 -
Envoyez une requête de test depuis le client.
curl http://localhost:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "/mnt/Qwen2.5-7B-Instruct", "messages": [ {"role": "system", "content": "You are a friendly AI assistant."}, {"role": "user", "content": "Please introduce deep learning."} ] }'Pour plus d'informations, consultez la documentation vLLM.
Problèmes connus
Le plugin deepgpu-comfyui pour la génération vidéo avec le modèle Wanx prend uniquement en charge les types d'instances gn8is.