Cette rubrique présente les notes de version d'inference-nv-pytorch 26.04.
Nouvelles fonctionnalités et corrections de bugs
Nouvelles fonctionnalités
-
Cette version fournit des images pour deux versions de CUDA : CUDA 12,8 et CUDA 13,0.
Les images CUDA 12,8 sont destinées uniquement à l'architecture amd64.
Les images CUDA 13,0 prennent en charge les architectures amd64 et aarch64.
Dans les images vLLM, Torch passe à la version 2.10.0 et vLLM à la version v0.19.0.
Pour les images SGLang, Torch est mis à jour vers la version 2.10.0 et SGLang vers la version v0.5.10.post1.
Corrections de bugs
Aucune correction de bug n'est incluse dans cette version.
Contenu
Nom de l'image | inference-nv-pytorch | |||||
Tag | 26.04-vllm0.19.0-pytorch2.10-cu128-20260421-serverless | 26.04-sglang0.5.10.post1-pytorch2.10-cu128-20260421-serverless | 26.04-vllm0.19.0-pytorch2.10-cu130-20260415-serverless | 26.04-sglang0.5.10.post1-pytorch2.10-cu130-20260415-serverless | ||
Architecture prise en charge | amd64 | amd64 | amd64 | aarch64 | amd64 | aarch64 |
Cas d'utilisation | Inférence de grands modèles | Inférence de grands modèles | Inférence de grands modèles | Inférence de grands modèles | Inférence de grands modèles | Inférence de grands modèles |
Framework | pytorch | pytorch | pytorch | pytorch | pytorch | pytorch |
Prérequis | NVIDIA Driver release >= 570 | NVIDIA Driver release >= 570 | NVIDIA Driver release >= 580 | NVIDIA Driver release >= 580 | NVIDIA Driver release >= 580 | NVIDIA Driver release >= 580 |
Composants système |
|
|
|
|
|
|
Ressource
Image publique
Ressource CUDA12.8
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.04-vllm0.19.0-pytorch2.10-cu128-20260421-serverless
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.04-sglang0.5.10.post1-pytorch2.10-cu128-20260421-serverless
Ressource CUDA13.0
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.04-vllm0.19.0-pytorch2.10-cu130-20260415-serverless
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.04-sglang0.5.10.post1-pytorch2.10-cu130-20260415-serverless
Image VPC
Ces images sont destinées aux environnements multi-locataires ACS et EGS. Ne les utilisez pas dans des environnements EGS dédiés.
Prérequis du pilote
CUDA12.8 : NVIDIA Driver release >= 570
CUDA13.0 : NVIDIA Driver release >= 580
Démarrage rapide
Cet exemple explique comment récupérer l'image inference-nv-pytorch via Docker et tester le service d'inférence avec le modèle Qwen2.5-7B-Instruct.
Pour utiliser l'image inference-nv-pytorch dans ACS, sélectionnez l'image depuis l'Artifacts Center sur la page Create Workload de la console. Vous pouvez également spécifier la référence de l'image dans un fichier YAML. Pour plus d'informations, consultez les rubriques suivantes concernant la création de services d'inférence de modèles avec des ressources GPU ACS :
-
Récupérez l'image du conteneur d'inférence.
docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Téléchargez le modèle open source depuis ModelScope.
pip install modelscope cd /mnt modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct -
Exécutez la commande suivante pour accéder au conteneur.
docker run -d -t --network=host --privileged --init --ipc=host \ --ulimit memlock=-1 --ulimit stack=67108864 \ -v /mnt/:/mnt/ \ egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Effectuez un test d'inférence pour la fonctionnalité conversationnelle vLLM.
-
Démarrez le service serveur.
python3 -m vllm.entrypoints.openai.api_server \ --model /mnt/Qwen2.5-7B-Instruct \ --trust-remote-code --disable-custom-all-reduce \ --tensor-parallel-size 1 -
Testez depuis le client.
curl http://localhost:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "/mnt/Qwen2.5-7B-Instruct", "messages": [ {"role": "system", "content": "You are a friendly AI assistant."}, {"role": "user", "content": "Introduce deep learning."} ]}'Pour plus d'informations sur l'utilisation de vLLM, consultez vLLM.
-
Problèmes connus
L'image actuelle ne prend pas en charge le plug-in deepgpu-comfyui.
La version de pilote 550.90.07 pour le type d'instance ACS GU8TF prend en charge les images utilisant CUDA 13,0.