Cette rubrique présente les notes de version d'inference-nv-pytorch 26.05.
Fonctionnalités principales et corrections de bugs
Fonctionnalités principales
-
À partir de la version 26.05, CUDA 12.8 n'est plus pris en charge. Seules les images pour CUDA 13.0 sont disponibles.
L'image CUDA 13.0 prend en charge les architectures amd64 et aarch64.
Dans l'image vLLM, Torch passe à la version 2.11.0 et vLLM à la version v0.20.2.
Dans l'image SGLang, Torch passe à la version 2.11.0 et SGLang à la version v0.5.11.
Corrections de bugs
Aucune.
Contenu
Nom de l'image | inference-nv-pytorch | |||
Tag | 26.05-vllm0.20.2-pytorch2.11-cu130-20260513-serverless | 26.05-sglang0.5.11-pytorch2.11-cu130-20260513-serverless | ||
Architecture prise en charge | amd64 | aarch64 | amd64 | aarch64 |
Cas d'utilisation | Inférence de grands modèles | Inférence de grands modèles | Inférence de grands modèles | Inférence de grands modèles |
Framework | pytorch | pytorch | pytorch | pytorch |
Prérequis | Pilote NVIDIA version 580 ou ultérieure | Pilote NVIDIA version 580 ou ultérieure | Pilote NVIDIA version 580 ou ultérieure | Pilote NVIDIA version 580 ou ultérieure |
Composants système |
|
|
|
|
Ressource
Image publique
Ressource CUDA 13.0
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.05-vllm0.20.2-pytorch2.11-cu130-20260513-serverless
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.05-sglang0.5.11-pytorch2.11-cu130-20260513-serverless
Image VPC
Ces images sont destinées aux environnements multi-locataires ACS et EGS. Ne les utilisez pas dans des environnements EGS dédiés.
Prérequis relatifs aux pilotes
CUDA 13.0 : pilote NVIDIA version 580 ou ultérieure requis
Démarrage rapide
Cet exemple explique comment récupérer l'image inference-nv-pytorch avec Docker et tester le service d'inférence à l'aide du modèle Qwen2.5-7B-Instruct.
Pour utiliser l'image inference-nv-pytorch dans ACS, sélectionnez-la depuis l'Artifacts Center sur la page Create Workload de la console. Vous pouvez également spécifier la référence de l'image dans un fichier YAML. Pour plus d'informations, consultez les rubriques suivantes sur la création de services d'inférence de modèles avec des ressources GPU ACS :
-
Récupérez l'image du conteneur d'inférence.
docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Téléchargez le modèle open source depuis ModelScope.
pip install modelscope cd /mnt modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct -
Exécutez la commande suivante pour accéder au conteneur.
docker run -d -t --network=host --privileged --init --ipc=host \ --ulimit memlock=-1 --ulimit stack=67108864 \ -v /mnt/:/mnt/ \ egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Testez la fonctionnalité conversationnelle de vLLM.
-
Démarrez le service serveur.
python3 -m vllm.entrypoints.openai.api_server \ --model /mnt/Qwen2.5-7B-Instruct \ --trust-remote-code --disable-custom-all-reduce \ --tensor-parallel-size 1 -
Effectuez un test côté client.
curl http://localhost:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "/mnt/Qwen2.5-7B-Instruct", "messages": [ {"role": "system", "content": "You are a friendly AI assistant."}, {"role": "user", "content": "Introduce deep learning."} ]}'Pour plus d'informations sur l'utilisation de vLLM, consultez vLLM.
-
Problèmes connus
Cette image ne prend pas en charge le plugin deepgpu-comfyui.