Notes de version d'inference-nv-pytorch 25.08.
Fonctionnalités principales et corrections de bugs
Fonctionnalités principales
Mise à niveau de vLLM vers la version v0.10.0.
Mise à niveau de SGLang vers la version v0.4.10.post2.
Corrections de bugs
Aucune.
Contenu
|
inference-nv-pytorch |
inference-nv-pytorch |
|
|
Tag |
25.08-vllm0.10.0-pytorch2.7-cu128-20250811-serverless |
25.08-sglang0.4.10.post2-pytorch2.7-cu128-20250808-serverless |
|
Scénario d'application |
Inférence de grands modèles |
Inférence de grands modèles |
|
Framework |
pytorch |
pytorch |
|
Prérequis |
NVIDIA Driver release >= 570 |
NVIDIA Driver release >= 570 |
|
Composants système |
|
|
Ressources
Images publiques
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.08-vllm0.10.0-pytorch2.7-cu128-20250811-serverless
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.08-sglang0.4.10.post2-pytorch2.7-cu128-20250808-serverless
Image VPC
acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag}
Remplacez{region-id}par l'ID de la région où votre service Alibaba Cloud Container Compute Service (ACS) est activé (par exemple,cn-beijingoucn-wulanchabu).
Remplacez {image:tag} par le nom et le tag de l'image.
Les images inference-nv-pytorch:25.03-vllm0.8.2-pytorch2.6-cu124-20250328-serverless et inference-nv-pytorch:25.03-sglang0.4.4.post1-pytorch2.5-cu124-20250327-serverless sont compatibles uniquement avec les déploiements ACS et Lingjun multi-tenant. Elles ne sont pas compatibles avec les déploiements Lingjun single-tenant.
Les images inference-nv-pytorch:25.08-vllm0.10.0-pytorch2.7-cu128-20250811-serverless et inference-nv-pytorch:25.08-sglang0.4.10.post2-pytorch2.7-cu128-20250808-serverless conviennent aux déploiements ACS et Lingjun multi-tenant. Elles ne sont pas compatibles avec les déploiements Lingjun single-tenant.
Prérequis relatifs au pilote
NVIDIA Driver release >= 570
Démarrage rapide
Cet exemple montre comment utiliser Docker pour récupérer l'image inference-nv-pytorch et tester son service d'inférence avec le modèle Qwen2.5-7B-Instruct.
Pour utiliser l'image inference-nv-pytorch dans ACS, sélectionnez-la sur la page Artifact Center lors de la création d'une charge de travail dans la console, ou spécifiez l'image dans un fichier YAML. Pour plus d'informations, consultez les rubriques suivantes :
-
Récupérez l'image du conteneur d'inférence.
docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Téléchargez le modèle open source au format ModelScope.
pip install modelscope cd /mnt modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct -
Exécutez la commande suivante pour démarrer le conteneur et y accéder.
docker run -it --rm --gpus all --network=host --privileged --init --ipc=host \ --ulimit memlock=-1 --ulimit stack=67108864 \ -v /mnt/:/mnt/ \ egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Testez la fonctionnalité d'inférence conversationnelle de vLLM.
-
Démarrez le serveur.
python3 -m vllm.entrypoints.openai.api_server \ --model /mnt/Qwen2.5-7B-Instruct \ --trust-remote-code --disable-custom-all-reduce \ --tensor-parallel-size 1 -
Testez le service côté client.
curl http://localhost:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "Qwen/Qwen2.5-7B-Instruct", "messages": [ {"role": "system", "content": "You are a friendly AI assistant."}, {"role": "user", "content": "Tell me about deep learning."} ]}'Pour plus d'informations, consultez vLLM.
-
Problèmes connus
Le plug-in deepgpu-comfyui, qui accélère la génération vidéo pour le modèle Wanx, prend actuellement en charge uniquement les instances GN8IS et G49E.