Tous les produits
Search
Centre de documentation

Container Compute Service:inference-nv-pytorch 25.02

Dernière mise à jour :Aug 12, 2026

Ce document présente les notes de version d'inference-nv-pytorch 25.02.

Fonctionnalités principales et corrections de bugs

Fonctionnalités principales

  • Mise à jour de vLLM vers la version v0.7.2.

  • Prise en charge de SGLang v0.4.3.post2.

  • Prise en charge des modèles DeepSeek.

Corrections de bugs

Aucune correction pour cette version.

Contenu

Cas d'utilisation

Inférence LLM

Framework

PyTorch

Prérequis

Pilote NVIDIA version >= 550

Composants système

  • Ubuntu 22.04

  • Python 3.10

  • Torch 2.5.1

  • CUDA 12.4

  • transformers 4.48.3

  • triton 3.1.0

  • ray 2.42.1

  • vllm 0.7.2

  • sgl-kernel 0.0.3.post6

  • sglang 0.4.3.post2

  • flashinfer-python 0.2.1.post2

  • ACCL-N 2.23.4.11

Ressources

Image publique

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:25.02-vllm0.7.2-sglang0.4.3.post2-pytorch2.5-cuda12.4-20250305-serverless

Image VPC

acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag}
Remplacez {region-id} par l'ID de la région où votre service Alibaba Cloud Container Compute Service (ACS) est activé (par exemple, cn-beijing ou cn-wulanchabu ).
Remplacez {image:tag} par le nom et le tag de l'image.
Remarque

Les images inference-nv-pytorch:25.03-vllm0.8.2-pytorch2.6-cu124-20250328-serverless et inference-nv-pytorch:25.03-sglang0.4.4.post1-pytorch2.5-cu124-20250327-serverless sont compatibles uniquement avec les déploiements ACS et Lingjun multi-tenant. Elles ne sont pas compatibles avec les déploiements Lingjun single-tenant.

Remarque
  • L'image inference-nv-pytorch:25.02-vllm0.7.2-sglang0.4.3.post2-pytorch2.5-cuda12.4-20250305-serverless est conçue pour les environnements ACS et Lingjun multi-tenant. Elle ne convient pas aux environnements Lingjun single-tenant.

  • L'image inference-nv-pytorch:25.02-vllm0.7.2-sglang0.4.3.post2-pytorch2.5-cuda12.4-20250305 est destinée aux scénarios Lingjun single-tenant.

Prérequis relatifs au pilote

Pilote NVIDIA version >= 550

Démarrage rapide

Cet exemple explique comment récupérer l'image inference-nv-pytorch avec Docker et tester le service d'inférence sur le modèle Qwen2.5-7B-Instruct.

Remarque

Pour utiliser l'image inference-nv-pytorch dans ACS, sélectionnez-la depuis la page du centre d'artefacts de la console lors de la création d'une charge de travail, ou spécifiez la référence de l'image dans un fichier YAML. Pour plus d'informations, consultez les rubriques suivantes concernant la création d'un service d'inférence de modèle DeepSeek à l'aide de la puissance de calcul GPU d'ACS :

  1. Récupérez l'image du conteneur d'inférence.

    docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  2. Téléchargez le modèle open source au format ModelScope.

    pip install modelscope
    cd /mnt
    modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B-Instruct
  3. Exécutez la commande suivante pour démarrer le conteneur et y accéder.

    docker run -it --rm --gpus all --network=host --privileged --init --ipc=host \
    --ulimit memlock=-1 --ulimit stack=67108864  \
    -v /mnt/:/mnt/ \
    egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/inference-nv-pytorch:[tag]
  4. Testez la fonctionnalité d'inférence conversationnelle de vLLM.

    1. Démarrez le serveur.

      python3 -m vllm.entrypoints.openai.api_server \
      --model /mnt/Qwen2.5-7B-Instruct \
      --trust-remote-code --disable-custom-all-reduce \
      --tensor-parallel-size 1
    2. Testez le service depuis le client.

      curl http://localhost:8000/v1/chat/completions \
          -H "Content-Type: application/json" \
          -d '{
          "model": "/mnt/Qwen2.5-7B-Instruct",  
          "messages": [
          {"role": "system", "content": "You are a friendly AI assistant."},
          {"role": "user", "content": "Please introduce deep learning."}
          ]}'

      Pour plus d'informations sur l'utilisation de vLLM, consultez vLLM.

Problèmes connus