La version 25.05 d'inference-nv-pytorch met à niveau la pile logicielle de l'image vLLM vers Ubuntu 24.04, Python 3.12, CUDA 12.8 et vLLM v0.8.5.post1. Elle met également à jour SGLang vers la version v0.4.6.post4 dans l'image SGLang.
Nouveautés
Fonctionnalités principales
Image vLLM : mise à niveau vers Ubuntu 24.04, Python 3.12, CUDA 12.8 et vLLM v0.8.5.post1.
Image SGLang : mise à jour de SGLang vers la version v0.4.6.post4.
Corrections de bogues
Aucune.
Contenu des images
Le tableau suivant présente les deux images incluses dans cette version ainsi que leurs composants système.
inference-nv-pytorch | inference-nv-pytorch | |
Tag |
|
|
Scenario | Inférence LLM | Inférence LLM |
Framework | PyTorch | PyTorch |
Driver requirement | Pilote NVIDIA >= 570 | Pilote NVIDIA >= 550 |
System components |
|
|
Ces deux images sont compatibles avec les services ACS et les services multi-locataires Lingjun, mais pas avec les services mono-locataires Lingjun.
Ressources
Images réseau public
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.05-vllm0.8.5.post1-pytorch2.7-cu128-20250513-serverless
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.05-sglang0.4.6.post4-pytorch2.6-cu124-20250513-serverless
Image VPC
acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag}
Remplacez les espaces réservés par les valeurs appropriées :
| Espace réservé | Description | Exemple |
|---|---|---|
{region-id} |
Région où votre service ACS est activé | cn-beijing, cn-wulanchabu |
{image:tag} |
Nom et tag de l'image | inference-nv-pytorch:25.05-vllm0.8.5.post1-pytorch2.7-cu128-20250513-serverless |
Actuellement, vous pouvez récupérer les images VPC uniquement dans la région Chine (Pékin).
Prérequis relatifs aux pilotes
Images CUDA 12.8 : version du pilote NVIDIA >= 570
Images CUDA 12.4 : version du pilote NVIDIA >= 550
Prise en main rapide
L'exemple suivant montre comment récupérer l'image inference-nv-pytorch avec Docker et exécuter un test d'inférence à l'aide du modèle Qwen2.5-7B-Instruct.
Pour utiliser l'image inference-nv-pytorch dans ACS, sélectionnez-la depuis la page du centre d'artefacts dans la console lors de la création de charges de travail, ou spécifiez-la dans un fichier YAML. Pour plus d'informations, consultez :
-
Récupérez l'image du conteneur d'inférence.
docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Téléchargez le modèle Qwen2.5-7B-Instruct depuis ModelScope.
pip install modelscope cd /mnt modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct -
Démarrez le conteneur.
docker run -d -t --network=host --privileged --init --ipc=host \ --ulimit memlock=-1 --ulimit stack=67108864 \ -v /mnt/:/mnt/ \ egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Lancez le serveur vLLM et testez l'inférence.
-
Démarrez le serveur.
python3 -m vllm.entrypoints.openai.api_server \ --model /mnt/Qwen2.5-7B-Instruct \ --trust-remote-code --disable-custom-all-reduce \ --tensor-parallel-size 1 -
Envoyez une requête de test depuis le client.
curl http://localhost:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "/mnt/Qwen2.5-7B-Instruct", "messages": [ {"role": "system", "content": "You are a friendly AI assistant."}, {"role": "user", "content": "Please introduce deep learning."} ]}'Pour plus d'informations sur l'utilisation de vLLM, consultez vLLM.
-
Problèmes connus
Aucun.