Tous les produits
Search
Centre de documentation

Container Compute Service:inference-nv-pytorch 25.08

Dernière mise à jour :Aug 12, 2026

Notes de version d'inference-nv-pytorch 25.08.

Fonctionnalités principales et corrections de bugs

Fonctionnalités principales

  • Mise à niveau de vLLM vers la version v0.10.0.

  • Mise à niveau de SGLang vers la version v0.4.10.post2.

Corrections de bugs

Aucune.

Contenu

inference-nv-pytorch

inference-nv-pytorch

Tag

25.08-vllm0.10.0-pytorch2.7-cu128-20250811-serverless

25.08-sglang0.4.10.post2-pytorch2.7-cu128-20250808-serverless

Scénario d'application

Inférence de grands modèles

Inférence de grands modèles

Framework

pytorch

pytorch

Prérequis

NVIDIA Driver release >= 570

NVIDIA Driver release >= 570

Composants système

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.7.1+cu128

  • CUDA 12.8

  • NCCL 2.27.5

  • diffusers 0.34.0

  • deepgpu-comfyui 1.1.7

  • deepgpu-torch 0.0.24+torch2.7.0cu128

  • flash_attn 2.8.2

  • imageio 2.37.0

  • imageio-ffmpeg 0.6.0

  • ray 2.48.0

  • transformers 4.55.0

  • triton 3.3.1

  • vllm 0.10.0

  • xformers 0.0.31

  • xfuser 0.4.4

  • xgrammar 0.1.21

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.7.1+cu128

  • CUDA 12.8

  • NCCL 2.27.5

  • diffusers 0.34.0

  • deepgpu-comfyui 1.1.7

  • deepgpu-torch 0.0.24+torch2.7.0cu128

  • flash_attn 2.8.2

  • flash_mla 1.0.0+41b611f

  • flashinfer-python 0.2.9rc2

  • imageio 2.37.0

  • imageio-ffmpeg 0.6.0

  • transformers 4.54.1

  • sgl-kernel 0.2.8

  • sglang 0.4.10.post2

  • xgrammar 0.1.22

  • triton 3.3.1

  • torchao 0.9.0

Ressources

Images publiques

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.08-vllm0.10.0-pytorch2.7-cu128-20250811-serverless

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.08-sglang0.4.10.post2-pytorch2.7-cu128-20250808-serverless

Image VPC

acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag}
Remplacez {region-id} par l'ID de la région où votre service Alibaba Cloud Container Compute Service (ACS) est activé (par exemple, cn-beijing ou cn-wulanchabu ).
Remplacez {image:tag} par le nom et le tag de l'image.
Remarque

Les images inference-nv-pytorch:25.03-vllm0.8.2-pytorch2.6-cu124-20250328-serverless et inference-nv-pytorch:25.03-sglang0.4.4.post1-pytorch2.5-cu124-20250327-serverless sont compatibles uniquement avec les déploiements ACS et Lingjun multi-tenant. Elles ne sont pas compatibles avec les déploiements Lingjun single-tenant.

Remarque

Les images inference-nv-pytorch:25.08-vllm0.10.0-pytorch2.7-cu128-20250811-serverless et inference-nv-pytorch:25.08-sglang0.4.10.post2-pytorch2.7-cu128-20250808-serverless conviennent aux déploiements ACS et Lingjun multi-tenant. Elles ne sont pas compatibles avec les déploiements Lingjun single-tenant.

Prérequis relatifs au pilote

NVIDIA Driver release >= 570

Démarrage rapide

Cet exemple montre comment utiliser Docker pour récupérer l'image inference-nv-pytorch et tester son service d'inférence avec le modèle Qwen2.5-7B-Instruct.

Remarque

Pour utiliser l'image inference-nv-pytorch dans ACS, sélectionnez-la sur la page Artifact Center lors de la création d'une charge de travail dans la console, ou spécifiez l'image dans un fichier YAML. Pour plus d'informations, consultez les rubriques suivantes :

  1. Récupérez l'image du conteneur d'inférence.

    docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  2. Téléchargez le modèle open source au format ModelScope.

    pip install modelscope
    cd /mnt
    modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct
  3. Exécutez la commande suivante pour démarrer le conteneur et y accéder.

    docker run -it --rm --gpus all --network=host --privileged --init --ipc=host \
    --ulimit memlock=-1 --ulimit stack=67108864  \
    -v /mnt/:/mnt/ \
    egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  4. Testez la fonctionnalité d'inférence conversationnelle de vLLM.

    1. Démarrez le serveur.

      python3 -m vllm.entrypoints.openai.api_server \
      --model /mnt/Qwen2.5-7B-Instruct \
      --trust-remote-code --disable-custom-all-reduce \
      --tensor-parallel-size 1
    2. Testez le service côté client.

      curl http://localhost:8000/v1/chat/completions \
          -H "Content-Type: application/json" \
          -d '{
          "model": "Qwen/Qwen2.5-7B-Instruct",  
          "messages": [
          {"role": "system", "content": "You are a friendly AI assistant."},
          {"role": "user", "content": "Tell me about deep learning."}
          ]}'

      Pour plus d'informations, consultez vLLM.

Problèmes connus

  • Le plug-in deepgpu-comfyui, qui accélère la génération vidéo pour le modèle Wanx, prend actuellement en charge uniquement les instances GN8IS et G49E.