Ce document présente les notes de version des images inference-nv-pytorch 25.10.
Nouveautés
Fonctionnalités clés
-
Deux images sont désormais disponibles pour différentes versions de CUDA :
L'image CUDA 12.8 prend en charge uniquement l'architecture amd64.
L'image CUDA 13.0 est compatible avec les architectures amd64 et aarch64 .
Dans l'image CUDA 12.8,
deepgpu-comfyuipasse à la version 1.3.0 et le composant d'optimisationdeepgpu-torchest mis à niveau vers la version 0.1.6+torch2.8.0cu128.Dans l'image CUDA 13.0, PyTorch passe à la version 2.9.0.
Les images CUDA 12.8 et CUDA 13.0 intègrent toutes deux vLLM en version v0.11.0 et SGLang en version v0.5.4.
Corrections de bugs
Cette version ne contient aucune correction de bug.
Contenu
|
inference-nv-pytorch |
||||||
|
Tag |
25.10-vllm0.11.0-pytorch2.8-cu128-20251028-serverless |
25.10-sglang0.5.4-pytorch2.8-cu128-20251027-serverless |
25.10-vllm0.11.0-pytorch2.9-cu130-20251028-serverless |
25.10-sglang0.5.4-pytorch2.9-cu130-20251028-serverless |
||
|
Architectures prises en charge |
amd64 |
amd64 |
amd64 |
aarch64 |
amd64 |
aarch64 |
|
Cas d'utilisation |
Inférence de grands modèles |
Inférence de grands modèles |
Inférence de grands modèles |
Inférence de grands modèles |
Inférence de grands modèles |
Inférence de grands modèles |
|
Framework |
PyTorch |
PyTorch |
PyTorch |
PyTorch |
PyTorch |
PyTorch |
|
Prérequis |
NVIDIA Driver release >= 570 |
NVIDIA Driver release >= 570 |
NVIDIA Driver release >= 580 |
NVIDIA Driver release >= 580 |
NVIDIA Driver release >= 580 |
NVIDIA Driver release >= 580 |
|
Composants système |
|
|
|
|
|
|
Ressources
Images publiques
CUDA 12.8
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.10-vllm0.11.0-pytorch2.8-cu128-20251028-serverless
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.10-sglang0.5.4-pytorch2.8-cu128-20251027-serverless
CUDA 13.0
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.10-vllm0.11.0-pytorch2.9-cu130-20251028-serverless
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.10-sglang0.5.4-pytorch2.9-cu130-20251028-serverless
Image VPC
acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag}
Remplacez{region-id}par l'ID de la région où votre service Alibaba Cloud Container Compute Service (ACS) est activé (par exemple,cn-beijingoucn-wulanchabu).
Remplacez {image:tag} par le nom et le tag de l'image.
Les images inference-nv-pytorch:25.03-vllm0.8.2-pytorch2.6-cu124-20250328-serverless et inference-nv-pytorch:25.03-sglang0.4.4.post1-pytorch2.5-cu124-20250327-serverless sont compatibles uniquement avec les déploiements ACS et Lingjun multi-tenant. Elles ne sont pas compatibles avec les déploiements Lingjun single-tenant.
Prérequis relatifs aux pilotes
CUDA 12.8 : nécessite NVIDIA Driver release 570 ou ultérieur.
CUDA 13.0 : nécessite NVIDIA Driver release 580 ou ultérieur.
Démarrage rapide
L'exemple suivant montre comment récupérer l'image inference-nv-pytorch avec Docker et tester le service d'inférence avec le modèle Qwen2.5-7B-Instruct.
Pour plus d'informations sur la création de services d'inférence de modèles utilisant la puissance de calcul GPU d'Alibaba Cloud Container Service, consultez les rubriques suivantes :
-
Récupérez l'image du conteneur d'inférence.
docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Téléchargez le modèle open source au format ModelScope.
pip install modelscope cd /mnt modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct -
Exécutez la commande suivante pour démarrer le conteneur et y accéder.
docker run -it --rm --gpus all --network=host --privileged --init --ipc=host \ --ulimit memlock=-1 --ulimit stack=67108864 \ -v /mnt/:/mnt/ \ egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag] -
Testez l'inférence pour valider la fonctionnalité de chat vLLM.
-
Démarrez le serveur.
python3 -m vllm.entrypoints.openai.api_server \ --model /mnt/Qwen2.5-7B-Instruct \ --trust-remote-code --disable-custom-all-reduce \ --tensor-parallel-size 1 -
Envoyez une requête de test depuis le client.
curl http://localhost:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "/mnt/Qwen2.5-7B-Instruct", "messages": [ {"role": "system", "content": "You are a friendly AI assistant."}, {"role": "user", "content": "Tell me about deep learning."} ]}'Pour plus d'informations sur vLLM, consultez vLLM.
-
Problèmes connus
Le plugin
deepgpu-comfyui, qui accélère la génération vidéo du modèle Wan, ne prend actuellement en charge que les types d'instances GN8IS et G49E.