Tous les produits
Search
Centre de documentation

Container Compute Service:inference-nv-pytorch 25.05

Dernière mise à jour :Aug 12, 2026

La version 25.05 d'inference-nv-pytorch met à niveau la pile logicielle de l'image vLLM vers Ubuntu 24.04, Python 3.12, CUDA 12.8 et vLLM v0.8.5.post1. Elle met également à jour SGLang vers la version v0.4.6.post4 dans l'image SGLang.

Nouveautés

Fonctionnalités principales

  • Image vLLM : mise à niveau vers Ubuntu 24.04, Python 3.12, CUDA 12.8 et vLLM v0.8.5.post1.

  • Image SGLang : mise à jour de SGLang vers la version v0.4.6.post4.

Corrections de bogues

Aucune.

Contenu des images

Le tableau suivant présente les deux images incluses dans cette version ainsi que leurs composants système.

inference-nv-pytorch

inference-nv-pytorch

Tag

25.05-vllm0.8.5.post1-pytorch2.7-cu128-20250513-serverless

25.05-sglang0.4.6.post4-pytorch2.6-cu124-20250513-serverless

Scenario

Inférence LLM

Inférence LLM

Framework

PyTorch

PyTorch

Driver requirement

Pilote NVIDIA >= 570

Pilote NVIDIA >= 550

System components

  • Ubuntu 24.04

  • Python 3.12

  • Torch 2.7.0+cu128

  • CUDA 12.8

  • NCCL 2.26.5

  • transformer 4.51.3

  • vllm 0.8.5.post2.dev0+g3015d5634.d20250513.cu128

  • ray 2.46.0

  • triton 3.3.0

  • xgrammar 0.1.18

  • Ubuntu 22.04

  • Python 3.10

  • Torch 2.6.0+cu124

  • CUDA 12.4

  • NCCL 2.26.5

  • accelerate 1.6.0

  • transformers 4.51.1

  • triton 3.2.0

  • xgrammar 0.1.19

  • flashinfer-python 0.2.5

  • sglang 0.4.6.post4

  • sgl-kernel 0.1.2.post1

Remarque

Ces deux images sont compatibles avec les services ACS et les services multi-locataires Lingjun, mais pas avec les services mono-locataires Lingjun.

Ressources

Images réseau public

egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.05-vllm0.8.5.post1-pytorch2.7-cu128-20250513-serverless
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.05-sglang0.4.6.post4-pytorch2.6-cu124-20250513-serverless

Image VPC

acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag}

Remplacez les espaces réservés par les valeurs appropriées :

Espace réservé Description Exemple
{region-id} Région où votre service ACS est activé cn-beijing, cn-wulanchabu
{image:tag} Nom et tag de l'image inference-nv-pytorch:25.05-vllm0.8.5.post1-pytorch2.7-cu128-20250513-serverless
Important

Actuellement, vous pouvez récupérer les images VPC uniquement dans la région Chine (Pékin).

Prérequis relatifs aux pilotes

  • Images CUDA 12.8 : version du pilote NVIDIA >= 570

  • Images CUDA 12.4 : version du pilote NVIDIA >= 550

Prise en main rapide

L'exemple suivant montre comment récupérer l'image inference-nv-pytorch avec Docker et exécuter un test d'inférence à l'aide du modèle Qwen2.5-7B-Instruct.

  1. Récupérez l'image du conteneur d'inférence.

    docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  2. Téléchargez le modèle Qwen2.5-7B-Instruct depuis ModelScope.

    pip install modelscope
    cd /mnt
    modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct
  3. Démarrez le conteneur.

    docker run -d -t --network=host --privileged --init --ipc=host \
    --ulimit memlock=-1 --ulimit stack=67108864 \
    -v /mnt/:/mnt/ \
    egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  4. Lancez le serveur vLLM et testez l'inférence.

    1. Démarrez le serveur.

      python3 -m vllm.entrypoints.openai.api_server \
      --model /mnt/Qwen2.5-7B-Instruct \
      --trust-remote-code --disable-custom-all-reduce \
      --tensor-parallel-size 1
    2. Envoyez une requête de test depuis le client.

      curl http://localhost:8000/v1/chat/completions \
          -H "Content-Type: application/json" \
          -d '{
          "model": "/mnt/Qwen2.5-7B-Instruct",
          "messages": [
          {"role": "system", "content": "You are a friendly AI assistant."},
          {"role": "user", "content": "Please introduce deep learning."}
          ]}'

      Pour plus d'informations sur l'utilisation de vLLM, consultez vLLM.

Problèmes connus

Aucun.