Cette version met à jour vLLM vers la version v0.8.5 et SGLang vers la version v0.4.6.post1, tous deux compatibles avec PyTorch 2.6.0 et prenant en charge les modèles Qwen3.
Nouveautés
Mises à jour
vLLM est mis à niveau vers la version v0.8.5
La version PyTorch de l'image SGLang est mise à niveau vers 2.6.0
SGLang est mis à niveau vers la version v0.4.6.post1
Ajouts
Prise en charge des modèles Qwen3 pour les images vLLM et SGLang
Corrections de bugs
Aucune
Détails des images
Les deux images sont conçues pour l'inférence LLM sur PyTorch avec CUDA 12.4 et nécessitent une version du pilote NVIDIA supérieure ou égale à 550.
| Image vLLM | Image SGLang | |
|---|---|---|
| Tag | 25.04-vllm0.8.5-pytorch2.6-cu124-20250430-serverless |
25.04-sglang0.4.6.post1-pytorch2.6-cu124-20250430-serverless |
| Scénario | Inférence LLM | Inférence LLM |
| Framework | pytorch | pytorch |
| Configuration requise pour le pilote | Version du pilote NVIDIA >= 550 | Version du pilote NVIDIA >= 550 |
| Ubuntu | 22.04 | 22.04 |
| Python | 3.10 | 3.10 |
| Torch | 2.6.0+cu124 | 2.6.0+cu124 |
| CUDA | 12.4 | 12.4 |
| ACCL-N | 2.23.4.12 | 2.23.4.12 |
| accelerate | 1.6.0 | — |
| diffusers | 0.33.1 | — |
| flash_attn | 2.7.4.post1 | — |
| flashinfer-python | — | 0.2.3 |
| transformer / transformers | 4.51.3 | 4.51.1 |
| vllm | 0.8.5 | — |
| sglang | — | 0.4.6.post1 |
| sgl-kernel | — | 0.1.0 |
| ray | 2.43.0 | — |
| triton | 3.2.0 | 3.2.0 |
| xgrammar | 0.1.18 | 0.1.17 |
Registre d'images
Réseau public
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.04-vllm0.8.5-pytorch2.6-cu124-20250430-serverless
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.04-sglang0.4.6.post1-pytorch2.6-cu124-20250430-serverless
VPC
acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag}
Remplacez {region-id} par la région où votre service ACS est activé, par exemple cn-beijing ou cn-wulanchabu. Remplacez {image:tag} par le nom de l'image et son tag.
Le téléchargement d'images via VPC n'est actuellement pris en charge que dans la région Chine (Pékin).
Les images 25.04-vllm0.8.5-pytorch2.6-cu124-20250430-serverless et 25.04-sglang0.4.6.post1-pytorch2.6-cu124-20250430-serverless sont compatibles avec la forme de produit ACS et la forme de produit multi-locataire de Lingjun. Elles ne sont pas compatibles avec la forme de produit mono-locataire de Lingjun.
Démarrage rapide
L'exemple suivant télécharge l'image inference-nv-pytorch et exécute un test d'inférence en utilisant le modèle Qwen2.5-7B-Instruct avec vLLM.
Pour utiliser l'image inference-nv-pytorch dans ACS, sélectionnez l'image depuis la page du centre d'artefacts de la console lors de la création de vos charges de travail, ou spécifiez l'image dans un fichier YAML. Pour plus de détails, consultez :
-
Téléchargez l'image du conteneur d'inférence.
docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Téléchargez un modèle open source au format ModelScope.
pip install modelscope cd /mnt modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct -
Démarrez le conteneur.
docker run -d -t --network=host --privileged --init --ipc=host \ --ulimit memlock=-1 --ulimit stack=67108864 \ -v /mnt/:/mnt/ \ egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Démarrez le serveur API vLLM à l'intérieur du conteneur.
python3 -m vllm.entrypoints.openai.api_server \ --model /mnt/Qwen2.5-7B-Instruct \ --trust-remote-code --disable-custom-all-reduce \ --tensor-parallel-size 1 -
Envoyez une requête de test depuis le client.
curl http://localhost:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "/mnt/Qwen2.5-7B-Instruct", "messages": [ {"role": "system", "content": "You are a friendly AI assistant."}, {"role": "user", "content": "Please introduce deep learning."} ]}'Pour plus d'informations sur l'utilisation de vLLM, consultez la documentation vLLM.
Problèmes connus
Aucun