Cette rubrique présente les notes de version pour inference-nv-pytorch 26,03.
Fonctionnalités principales et corrections de bugs
Fonctionnalités principales
-
Cette version fournit des images pour CUDA 12.8 et CUDA 13.0 :
L'image CUDA 12.8 prend uniquement en charge l'architecture amd64.
L'image CUDA 13.0 prend en charge les architectures amd64 et aarch64.
Cette version met à jour vLLM vers la version v0.17.1 et ajoute la prise en charge du modèle Qwen3,5.
Corrections de bugs
Aucune.
Contenu
Nom de l'image | inference-nv-pytorch | ||
Tag | 26.03-vllm0.17.1-pytorch2.10-cu128-20260317-serverless | 26.03-vllm0.17.1-pytorch2.10-cu130-20260317-serverless | |
Architecture prise en charge | amd64 | amd64 | aarch64 |
Cas d'utilisation | inférence de grands modèles | inférence de grands modèles | inférence de grands modèles |
Framework | PyTorch | PyTorch | PyTorch |
Prérequis | Version du pilote NVIDIA >= 570 | Version du pilote NVIDIA >= 580 | Version du pilote NVIDIA >= 580 |
Composants système |
|
|
|
Ressources
Image publique
Ressource CUDA 12.8
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.03-vllm0.17.1-pytorch2.10-cu128-20260317-serverless
Ressource CUDA 13.0
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.03-vllm0.17.1-pytorch2.10-cu130-20260317-serverless
Image VPC
Toutes les images de conteneur ACS AI existantes et nouvelles du dépôt egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun prennent en charge le tirage via VPC (IN-VPC).
Remplacez l'hôte du registre public dans l'URI de votre image par le point de terminaison VPC spécifique à la région.
|
Composant URI |
Réseau public |
IN-VPC |
|
Hôte du registre |
|
|
|
Dépôt |
|
|
|
Image et tag |
|
|
Remplacez {region-id} par l'ID de la région où s'exécute votre service ACS. Par exemple :
|
Région |
ID de région |
|
Chine (Pékin) |
|
|
Chine (Ulanqab) |
|
Pour obtenir la liste complète des régions prises en charge, consultez la rubrique Régions.
Exemples de valeurs {image:tag} :
inference-nv-pytorch:25.10-vllm0.11.0-pytorch2.8-cu128-20251028-serverlesstraining-nv-pytorch:25.10-serverless
Ces images sont destinées aux environnements AI Computing Service (ACS) et Lingjun multi-locataires. Elles ne sont pas prises en charge dans les environnements Lingjun mono-locataires.
Prérequis relatifs au pilote
CUDA 12.8 : version du pilote NVIDIA >= 570
CUDA 13.0 : version du pilote NVIDIA >= 580
Démarrage rapide
L'exemple suivant montre comment tirer l'image inference-nv-pytorch à l'aide de Docker et tester le service d'inférence avec le modèle Qwen2,5-7B-Instruct.
Pour utiliser l'image inference-nv-pytorch dans AI Computing Service (ACS), sélectionnez-la depuis la page du référentiel d'artefacts lors de la création d'une charge de travail dans la console, ou spécifiez la référence de l'image dans un fichier YAML. Pour plus d'informations, consultez les rubriques suivantes sur la construction de services d'inférence de modèles avec la puissance de calcul GPU ACS :
-
Tirez l'image du conteneur d'inférence.
docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Téléchargez le modèle open source depuis ModelScope.
pip install modelscope cd /mnt modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct -
Exécutez la commande suivante pour entrer dans le conteneur.
docker run -it --rm --gpus all --network=host --privileged --init --ipc=host \ --ulimit memlock=-1 --ulimit stack=67108864 \ -v /mnt/:/mnt/ \ egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Exécutez un test d'inférence pour vérifier la fonctionnalité de complétion de chat vLLM.
-
Démarrez le service côté serveur.
python3 -m vllm.entrypoints.openai.api_server \ --model /mnt/Qwen2.5-7B-Instruct \ --trust-remote-code --disable-custom-all-reduce \ --tensor-parallel-size 1 -
Exécutez un test côté client.
curl http://localhost:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "/mnt/Qwen2.5-7B-Instruct", "messages": [ {"role": "system", "content": "You are a friendly AI assistant."}, {"role": "user", "content": "Introduce deep learning."} ]}'Pour plus d'informations, consultez la documentation vLLM.
-
Problèmes connus
Cette image ne prend pas en charge le plugin deepgpu-comfyui.