La version inference-nv-pytorch 26,07 met à niveau vLLM vers la version v0.25.1 et SGLang vers la version v0.5.15.post1, et ajoute le support des architectures amd64 et aarch64.
Principales fonctionnalités et corrections de bugs
Principales fonctionnalités
L'image vLLM est mise à niveau vers vLLM v0.25.1.
L'image SGLang est mise à niveau vers SGLang v0.5.15.post1.
Les images vLLM et SGLang prennent en charge les architectures amd64 et aarch64.
Corrections de bugs
Aucune
Contenu
|
Nom de l'image |
inference-nv-pytorch |
|||
|
Tag |
26.07-vllm0.25.1-pytorch2.11-cu130-20260723-serverless |
26.07-sglang0.5.15.post1-pytorch2.11-cu130-20260715-serverless |
||
|
Architectures prises en charge |
amd64 |
aarch64 |
amd64 |
aarch64 |
|
Scénario |
Inférence de grands modèles |
Inférence de grands modèles |
Inférence de grands modèles |
Inférence de grands modèles |
|
Framework |
pytorch |
pytorch |
pytorch |
pytorch |
|
Prérequis |
Version du pilote NVIDIA >= 580 |
Version du pilote NVIDIA >= 580 |
Version du pilote NVIDIA >= 580 |
Version du pilote NVIDIA >= 580 |
|
Composants système |
|
|
|
|
Ressource
Images publiques
Ressource CUDA 13.0
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.07-vllm0.25.1-pytorch2.11-cu130-20260723-serverless
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.07-sglang0.5.15.post1-pytorch2.11-cu130-20260715-serverless
Images VPC
Pour extraire rapidement les images de conteneur ACS AI dans un VPC, remplacez l'URI de ressource de l'image de conteneur AI spécifiée egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/{image:tag} par acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag}.
{region-id}: l'ID de région du produit ACS. Par exemple,cn-beijingetcn-wulanchabu.{image:tag}: le nom et le tag de l'image de conteneur AI. Par exemple,inference-nv-pytorch:25.10-vllm0.11.0-pytorch2.8-cu128-20251028-serverlessettraining-nv-pytorch:25.10-serverless.
Ces images sont destinées aux environnements multi-locataires ACS et EGS. Ne les utilisez pas dans les environnements dédiés EGS.
Prérequis du pilote
CUDA 13.0 : version du pilote NVIDIA ≥ 580
Démarrage rapide
Cet exemple montre comment extraire l'image inference-nv-pytorch à l'aide de Docker et tester le service d'inférence avec le modèle Qwen2,5-7B-Instruct.
Pour utiliser l'image inference-nv-pytorch dans ACS, sélectionnez l'image depuis le centre des artefacts sur la page Créer une charge de travail dans la console. Vous pouvez également spécifier la référence de l'image dans un fichier YAML. Pour plus d'informations, consultez les rubriques suivantes concernant la création de services d'inférence de modèles avec les ressources GPU ACS :
-
Extrayez l'image du conteneur d'inférence.
docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Téléchargez le modèle open source depuis ModelScope.
pip install modelscope cd /mnt modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct -
Exécutez la commande suivante pour entrer dans le conteneur.
docker run -d -t --network=host --privileged --init --ipc=host \ --ulimit memlock=-1 --ulimit stack=67108864 \ -v /mnt/:/mnt/ \ egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Exécutez un test d'inférence pour la fonctionnalité conversationnelle vLLM.
-
Démarrez le service serveur.
python3 -m vllm.entrypoints.openai.api_server \ --model /mnt/Qwen2.5-7B-Instruct \ --trust-remote-code --disable-custom-all-reduce \ --tensor-parallel-size 1 -
Effectuez un test sur le client.
curl http://localhost:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "/mnt/Qwen2.5-7B-Instruct", "messages": [ {"role": "system", "content": "You are a friendly AI assistant."}, {"role": "user", "content": "Introduce deep learning."} ]}'Pour plus d'informations sur l'utilisation de vLLM, consultez vLLM.
-
Problèmes connus
Les images de cette version ne prennent pas en charge le plugin deepgpu-comfyui.