Cette version met à jour vLLM vers la v0.9.0.1 et SGLang vers la v0.4.7. Elle introduit également le plug-in deepgpu-comfyui pour accélérer l'inférence ComfyUI sur les GPU L20. Consultez cette rubrique pour vérifier les modifications, vous assurer que votre environnement respecte les prérequis en matière de pilotes et exécuter le guide de démarrage rapide afin de valider l'image.
Nouveautés
Fonctionnalités principales
vLLM passe à la version v0.9.0.1.
SGLang passe à la version v0.4.7.
Le plug-in deepgpu-comfyui accélère désormais les services ComfyUI sur les GPU L20 pour l'inférence des modèles Wan2.1 et FLUX. Les performances augmentent de 8 % à 40 % par rapport à PyTorch.
Corrections de bogues
Aucune.
Composants système
Cette version comprend deux variantes d'images : l'une basée sur vLLM, l'autre sur SGLang. Le tableau ci-dessous détaille leurs tags d'image, les cas d'usage ciblés ainsi que les versions des composants inclus.
| **Image vLLM** | **Image SGLang** | |
|---|---|---|
| Tag d'image | 25.06-vllm0.9.0.1-pytorch2.7-cu128-20250609-serverless |
25.06-sglang0.4.7-pytorch2.7-cu128-20250611-serverless |
| Cas d'usage | Raisonnement LLM | Inférence LLM |
| Framework | PyTorch | PyTorch |
| Prérequis pilote NVIDIA | >= 570 | >= 550 |
| Ubuntu | 24,04 | 22,04 |
| Python | 3,12 | 3,10 |
| Torch | 2.7.1+cu128 | 2.7.1+cu128 |
| CUDA | 12.8 | 12.8 |
| NCCL | 2.27.3 | 2.27.3 |
| accelerate | 1.7.0 | 1.7.0 |
| diffusers | 0.33.1 | 0.33.1 |
| deepgpu-comfyui | 1.1.5 | 1.1.5 |
| deepgpu-torch | 0.0.21+torch2.7.0cu128 | 0.0.21+torch2.7.0cu128 |
| flash_attn | 2.7.4.post1 | 2.7.4.post1 |
| flash_mla | — | 1.0.0+9edee0c |
| flashinfer-python | — | 0.2.6.post1 |
| imageio | 2.37.0 | 2.37.0 |
| imageio-ffmpeg | 0.6.0 | 0.6.0 |
| ray | 2.46.0 | 2.46.0 |
| transformers | 4.52.4 | 4.52.3 |
| vllm | 0.9.0.2.dev0+g5fbbfe9a4.d20250609 | — |
| sgl-kernel | — | 0.1.7 |
| sglang | — | 0.4.7 |
| xgrammar | 0.1.19 | 0.1.19 |
| triton | 3.3.1 | 3.3.1 |
| torchao | — | 0.9.0 |
Accès aux images
Images publiques
Récupérez l'une ou l'autre des images directement depuis le registre public :
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.06-vllm0.9.0.1-pytorch2.7-cu128-20250609-serverlessegslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.06-sglang0.4.7-pytorch2.7-cu128-20250611-serverless
Images VPC
Pour un accès via VPC, utilisez le modèle d'adresse suivant :
acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag}
Remplacez {region-id} par l'ID de la région où votre service ACS est activé, par exemple cn-beijing ou cn-wulanchabu. Remplacez ensuite {image:tag} par le nom et le tag de l'image souhaitée.
La récupération des images via VPC est disponible uniquement dans la région Chine (Pékin).
Les deux images (25.06-vllm0.9.0.1-pytorch2.7-cu128-20250609-serverless et 25.06-sglang0.4.7-pytorch2.7-cu128-20250611-serverless) sont compatibles avec les services ACS et les services FLUX multi-locataires. Elles ne sont en revanche pas compatibles avec les services FLUX mono-locataire.
Prérequis relatifs aux pilotes
Les deux images nécessitent CUDA 12.8. La version minimale du pilote NVIDIA varie selon l'image utilisée :
| Image | Version minimale du pilote NVIDIA |
|---|---|
| Image vLLM | 570 |
| Image SGLang | 550 |
Guide de démarrage rapide
L'exemple ci-dessous montre comment récupérer l'image inference-nv-pytorch avec Docker et exécuter un test d'inférence à l'aide du modèle Qwen2.5-7B-Instruct.
Pour utiliser l'image inference-nv-pytorch dans ACS, sélectionnez-la depuis la page du centre d'artefacts lors de la création de charges de travail, ou spécifiez-la dans un fichier YAML. Pour plus de détails, consultez :
Utiliser la puissance de calcul GPU d'ACS pour déployer un service d'inférence de modèle à partir d'un modèle distillé DeepSeek
Utiliser la puissance de calcul GPU d'ACS pour déployer un service d'inférence de modèle basé sur la version complète de DeepSeek
Utiliser la puissance de calcul GPU d'ACS pour déployer un service d'inférence de modèle distribué basé sur la version complète de DeepSeek
-
Récupérez l'image du conteneur d'inférence.
docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Téléchargez le modèle Qwen2.5-7B-Instruct depuis ModelScope.
pip install modelscope cd /mnt modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct -
Démarrez le conteneur.
docker run -d -t --network=host --privileged --init --ipc=host \ --ulimit memlock=-1 --ulimit stack=67108864 \ -v /mnt/:/mnt/ \ egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Exécutez le test d'inférence.
-
Lancez le serveur API vLLM.
python3 -m vllm.entrypoints.openai.api_server \ --model /mnt/Qwen2.5-7B-Instruct \ --trust-remote-code --disable-custom-all-reduce \ --tensor-parallel-size 1 -
Envoyez une requête de test depuis le client.
curl http://localhost:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "/mnt/Qwen2.5-7B-Instruct", "messages": [ {"role": "system", "content": "You are a friendly AI assistant."}, {"role": "user", "content": "Please introduce deep learning."} ]}'Pour plus d'informations sur vLLM, consultez vLLM.
-
Problèmes connus
Le plug-in deepgpu-comfyui prend uniquement en charge les instances GN8IS pour l'accélération de la génération vidéo basée sur le modèle Wanx.