La version inference-nv-pytorch 26,01 fournit des images de conteneur pour l'inférence de grands modèles sur les formats de produit ACS et Lingjun multi-locataire. Utilisez ces notes de version pour choisir un tag d'image, vérifier les composants système inclus dans chaque image et consulter la version du pilote NVIDIA requise.
Principales fonctionnalités et corrections de bogues
Principales fonctionnalités
-
Fournit des images pour deux versions de CUDA : CUDA 12.8 et CUDA 13.0.
L'image CUDA 12.8 prend en charge uniquement l'architecture amd64.
L'image CUDA 13.0 prend en charge les architectures amd64 et aarch64.
Dans l'image CUDA 12.8, deepgpu-comfyui passe à la version 1.4.1 et le composant d'optimisation deepgpu-torch à la version 0.1.18+torch2.9.0cu128.
Dans les images CUDA 12.8 et CUDA 13.0, vLLM passe à la version v0.14.0 et SGLang à la version v0.5.7.
Corrections de bogues
Aucune.
Contenu
Nom de l'image | inference-nv-pytorch | inference-nv-pytorch | inference-nv-pytorch | inference-nv-pytorch | inference-nv-pytorch | inference-nv-pytorch |
Tag | 26.01-vllm0.14.0-pytorch2.9-cu128-20260121-serverless | 26.01-sglang0.5.7-pytorch2.9-cu128-20260113-serverless | 26.01-vllm0.14.0-pytorch2.9-cu130-20260123-serverless | 26.01-vllm0.14.0-pytorch2.9-cu130-20260123-serverless | 26.01-sglang0.5.7-pytorch2.9-cu130-20260113-serverless | 26.01-sglang0.5.7-pytorch2.9-cu130-20260113-serverless |
Architecture prise en charge | amd64 | amd64 | amd64 | aarch64 | amd64 | aarch64 |
Scénario d'application | inférence de grands modèles | inférence de grands modèles | inférence de grands modèles | inférence de grands modèles | inférence de grands modèles | inférence de grands modèles |
Framework | pytorch | pytorch | pytorch | pytorch | pytorch | pytorch |
Prérequis | Version du pilote NVIDIA >= 570 | Version du pilote NVIDIA >= 570 | Version du pilote NVIDIA >= 580 | Version du pilote NVIDIA >= 580 | Version du pilote NVIDIA >= 580 | Version du pilote NVIDIA >= 580 |
Composants système |
|
|
|
|
|
|
Prérequis relatifs au pilote
CUDA 12.8 : version du pilote NVIDIA >= 570
CUDA 13.0 : version du pilote NVIDIA >= 580
Ressources
Images publiques
Ressources CUDA 12.8
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.01-vllm0.14.0-pytorch2.9-cu128-20260121-serverless
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.01-sglang0.5.7-pytorch2.9-cu128-20260113-serverless
Ressources CUDA 13.0
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.01-vllm0.14.0-pytorch2.9-cu130-20260123-serverless
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:26.01-sglang0.5.7-pytorch2.9-cu130-20260113-serverless
Images VPC
Remplacez l'URI de ressource d'image de conteneur IA egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/{image:tag} spécifié dans le fichier YAML de la console ACS par acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag} afin de télécharger rapidement les images de conteneur IA PG1 via le VPC.
Où
{region-id}correspond à la région disponible dans laquelle votre service ACS est activé, par exemple cn-beijing et cn-wulanchabu.{image:tag}représente le nom et le tag de l'image.
Ces images s'appliquent au format de produit ACS et au format de produit Lingjun multi-locataire. Elles ne sont pas compatibles avec le format de produit Lingjun mono-locataire. N'utilisez pas ces images dans un environnement Lingjun mono-locataire.
Démarrage rapide
L'exemple suivant montre comment télécharger l'image inference-nv-pytorch uniquement à l'aide de Docker et tester le service d'inférence avec le modèle Qwen2,5-7B-Instruct.
Pour utiliser l'image inference-nv-pytorch dans ACS, sélectionnez-la depuis la page Artifact Center lors de la création d'une charge de travail dans la console, ou spécifiez la référence de l'image dans un fichier YAML. Pour plus d'informations, consultez les rubriques suivantes relatives à la construction de services d'inférence de modèles et à l'accélération des charges de travail de modèles à l'aide de la puissance de calcul GPU ACS :
-
Accélérer la génération vidéo Wan 2.1 à l'aide de DeepGPU
Pour télécharger l'image et exécuter un test d'inférence avec Docker, procédez comme suit :
-
Téléchargez l'image de conteneur d'inférence. Remplacez
[tag]par un tag d'image répertorié dans le tableau Contenu ou dans la section Images publiques de cette rubrique.docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Téléchargez le modèle open source depuis ModelScope.
pip install modelscope cd /mnt modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct -
Exécutez la commande suivante pour entrer dans le conteneur.
docker run -it --rm --gpus all --network=host --privileged --init --ipc=host \ --ulimit memlock=-1 --ulimit stack=67108864 \ -v /mnt/:/mnt/ \ egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Exécutez un test d'inférence sur la fonctionnalité de chat vLLM.
-
Démarrez le service côté serveur.
python3 -m vllm.entrypoints.openai.api_server \ --model /mnt/Qwen2.5-7B-Instruct \ --trust-remote-code --disable-custom-all-reduce \ --tensor-parallel-size 1 -
Exécutez le test sur le client.
curl http://localhost:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "/mnt/Qwen2.5-7B-Instruct", "messages": [ {"role": "system", "content": "You are a friendly AI assistant."}, {"role": "user", "content": "Introduce deep learning."} ]}'
-
Pour plus d'informations sur l'utilisation de vLLM, consultez le dépôt du projet.
Problèmes connus
Le plugin deepgpu-comfyui pour l'accélération de la génération vidéo du modèle Wanx prend actuellement en charge uniquement les types d'instance GN8IS, G49E et G59.