Tous les produits
Search
Centre de documentation

Container Compute Service:inference-nv-pytorch 25.04

Dernière mise à jour :Aug 12, 2026

Cette version met à jour vLLM vers la version v0.8.5 et SGLang vers la version v0.4.6.post1, tous deux compatibles avec PyTorch 2.6.0 et prenant en charge les modèles Qwen3.

Nouveautés

Mises à jour

  • vLLM est mis à niveau vers la version v0.8.5

  • La version PyTorch de l'image SGLang est mise à niveau vers 2.6.0

  • SGLang est mis à niveau vers la version v0.4.6.post1

Ajouts

  • Prise en charge des modèles Qwen3 pour les images vLLM et SGLang

Corrections de bugs

Aucune

Détails des images

Les deux images sont conçues pour l'inférence LLM sur PyTorch avec CUDA 12.4 et nécessitent une version du pilote NVIDIA supérieure ou égale à 550.

Image vLLM Image SGLang
Tag 25.04-vllm0.8.5-pytorch2.6-cu124-20250430-serverless 25.04-sglang0.4.6.post1-pytorch2.6-cu124-20250430-serverless
Scénario Inférence LLM Inférence LLM
Framework pytorch pytorch
Configuration requise pour le pilote Version du pilote NVIDIA >= 550 Version du pilote NVIDIA >= 550
Ubuntu 22.04 22.04
Python 3.10 3.10
Torch 2.6.0+cu124 2.6.0+cu124
CUDA 12.4 12.4
ACCL-N 2.23.4.12 2.23.4.12
accelerate 1.6.0
diffusers 0.33.1
flash_attn 2.7.4.post1
flashinfer-python 0.2.3
transformer / transformers 4.51.3 4.51.1
vllm 0.8.5
sglang 0.4.6.post1
sgl-kernel 0.1.0
ray 2.43.0
triton 3.2.0 3.2.0
xgrammar 0.1.18 0.1.17

Registre d'images

Réseau public

egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.04-vllm0.8.5-pytorch2.6-cu124-20250430-serverless

egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.04-sglang0.4.6.post1-pytorch2.6-cu124-20250430-serverless

VPC

acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag}

Remplacez {region-id} par la région où votre service ACS est activé, par exemple cn-beijing ou cn-wulanchabu. Remplacez {image:tag} par le nom de l'image et son tag.

Important

Le téléchargement d'images via VPC n'est actuellement pris en charge que dans la région Chine (Pékin).

Remarque

Les images 25.04-vllm0.8.5-pytorch2.6-cu124-20250430-serverless et 25.04-sglang0.4.6.post1-pytorch2.6-cu124-20250430-serverless sont compatibles avec la forme de produit ACS et la forme de produit multi-locataire de Lingjun. Elles ne sont pas compatibles avec la forme de produit mono-locataire de Lingjun.

Démarrage rapide

L'exemple suivant télécharge l'image inference-nv-pytorch et exécute un test d'inférence en utilisant le modèle Qwen2.5-7B-Instruct avec vLLM.

  1. Téléchargez l'image du conteneur d'inférence.

    docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  2. Téléchargez un modèle open source au format ModelScope.

    pip install modelscope
    cd /mnt
    modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct
  3. Démarrez le conteneur.

    docker run -d -t --network=host --privileged --init --ipc=host \
    --ulimit memlock=-1 --ulimit stack=67108864 \
    -v /mnt/:/mnt/ \
    egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  4. Démarrez le serveur API vLLM à l'intérieur du conteneur.

    python3 -m vllm.entrypoints.openai.api_server \
    --model /mnt/Qwen2.5-7B-Instruct \
    --trust-remote-code --disable-custom-all-reduce \
    --tensor-parallel-size 1
  5. Envoyez une requête de test depuis le client.

    curl http://localhost:8000/v1/chat/completions \
        -H "Content-Type: application/json" \
        -d '{
        "model": "/mnt/Qwen2.5-7B-Instruct",
        "messages": [
        {"role": "system", "content": "You are a friendly AI assistant."},
        {"role": "user", "content": "Please introduce deep learning."}
        ]}'

    Pour plus d'informations sur l'utilisation de vLLM, consultez la documentation vLLM.

Problèmes connus

Aucun