全部產品
Search
文件中心

Container Compute Service:training-nv-pytorch 26.07

更新時間:Aug 01, 2026

本文介紹training-nv-pytorch 26.07版本發布記錄。

Main Features and Bug Fix Lists

Main Features

  • PyTorch及其相關組件升級至 2.12.1、Triton升級至 3.7.1。

  • 訓練相關組件Transformer Engine 升級至2.16.1、Megatron-Core 升級至0.18.2、Transformers 升級至5.12.1,合入社區功能和對應issues。

  • 推理相關組件vLLM 升級至 0.24.0、FlashInfer 升級至 0.6.12,合入社區功能和對應issues。

Bug Fixes

Contents

鏡像名稱

training-nv-pytorch

Tag

26.07-serverless

應用情境

訓練/推理

架構

pytorch

Requirements

NVIDIA Driver release >= 580

NVIDIA Driver release >= 580

Supported Architectures

amd64

aarch64

核心組件

  • Ubuntu: 24.04

  • Python: 3.12.7+gc

  • CUDA: 13.0

  • perf: 5.4.30

  • gdb: 15.1

  • torch: 2.12.1+ali.12.nv25.10

  • triton: 3.7.1

  • transformer_engine: 2.16.1+c9877beb

  • deepspeed: 0.18.8+ali

  • flash_attn: 2.8.3

  • flash_attn_3: 3.0.0

  • transformers: 5.12.1

  • grouped_gemm: 1.1.4

  • accelerate: 1.11.0+ali

  • diffusers: 0.34.0

  • mmengine: 0.10.3

  • mmcv: 2.1.0

  • mmdet: 3.3.0

  • opencv-python-headless: 4.11.0.86

  • ultralytics: 8.3.96

  • timm: 1.0.28

  • vllm: 0.24.0

  • flashinfer-python: 0.6.12

  • peft: 0.19.1

  • megatron-core: 0.18.2

  • Ubuntu: 24.04

  • Python: 3.12.7+gc

  • CUDA: 13.0

  • gdb: 15.1

  • torch: 2.12.1+ali.12.nv25.10

  • triton: 3.7.1

  • transformer_engine: 2.16.1+c9877beb

  • deepspeed: 0.18.8+ali

  • flash_attn: 2.8.3

  • transformers: 5.12.1

  • grouped_gemm: 1.1.4

  • accelerate: 1.11.0+ali

  • diffusers: 0.34.0

  • mmengine: 0.10.3

  • mmcv: 2.1.0

  • mmdet: 3.3.0

  • opencv-python-headless: 4.11.0.86

  • ultralytics: 8.3.96

  • timm: 1.0.28

  • vllm: 0.24.0

  • flashinfer-python: 0.6.12

  • peft: 0.19.1

  • megatron-core: 0.18.2

Assets

公網鏡像

CUDA 13.0.2(Driver >=580, amd64 & aarch64 )

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/training-nv-pytorch:26.07-serverless

VPC鏡像

將指定的AI容器鏡像Asset URIegslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/{image:tag}替換為acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag}即可在VPC內快速拉取ACS AI容器鏡像。

  • {region-id}:ACS產品開服地區的地區ID。例如:cn-beijingcn-wulanchabu等。

  • {image:tag}:AI容器鏡像的名稱和Tag。例如:inference-nv-pytorch:25.10-vllm0.11.0-pytorch2.8-cu128-20251028-serverlesstraining-nv-pytorch:25.10-serverless等。

說明

Tag為yy.mm-serverless(例如26.07-serverless)的鏡像適用於ACS產品形態、靈駿多租產品形態;靈駿單租產品形態可以使用Tag為yy.mm(例如26.07)的鏡像。

Driver Requirements

Key Features and Enhancements

PyTorch編譯最佳化

PyTorch 2.0引入的編譯最佳化能力在單卡小規模下通常可以獲得顯著的收益,但是在LLM訓練中需要引入顯存最佳化、FSDP/DeepSpeed等分布式架構,導致torch.compile()無法簡單地獲得收益或者存在負收益:

  • 在DeepSpeed架構下控制通訊的顆粒度,協助編譯器擷取更完整的計算圖,做更大範圍的編譯最佳化

  • 最佳化版本的PyTorch:

    • 最佳化PyTorch編譯器前端,確保在計算圖中出現任意graph break的情況下仍能正常編譯

    • 強化模式比對以及dynamic shape能力,提高編譯後代碼效能

ACCL通訊庫

ACCL是阿里針對靈駿產品自研的高效能網路通訊庫,針對GPU情境提供ACCL-N版本。ACCL-N是阿里雲基於英偉達NCCL定製後提供的高效能通訊庫,在完全相容NCCL的基礎上,修複了官方NCCL版本的一些BUG,並進行了效能和穩定性相關的最佳化。

Quick Start

以下樣本內容僅通過Docker方式拉取training-nv-pytorch鏡像。

說明

在ACS中使用training-nv-pytorch鏡像需要通過控制台建立工作負載介面的製品中心頁面選取,或者通過YAML檔案指定鏡像引用。

1. 選擇鏡像

docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/training-nv-pytorch:[tag]

2. 啟動容器

鏡像中內建了模型訓練工具,以此說明啟動容器和運行訓練任務的步驟。

LLM類

# 啟動容器並進入
docker run -it --gpus=all --ipc=host --net=host egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/training-nv-pytorch:[tag]

# Dense: Qwen3.5-4B LoRA 冒煙
NPROC_PER_NODE=2 CUDA_VISIBLE_DEVICES=0,1 \
swift sft --model Qwen/Qwen3.5-4B --tuner_type lora \
    --dataset 'AI-ModelScope/alpaca-gpt4-data-zh#500' \
    --split_dataset_ratio 0.01 --num_train_epochs 1 \
    --target_modules all-linear --attn_impl flash_attn \
    --deepspeed zero2 --max_length 2048 --output_dir output

# MoE 用例:Qwen/Qwen3.5-35B-A3B
NPROC_PER_NODE=8 CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 \
megatron sft --model Qwen/Qwen3.5-35B-A3B \
    --dataset 'AI-ModelScope/alpaca-gpt4-data-zh#500' \
    --split_dataset_ratio 0.01 --num_train_epochs 1 --finetune true \
    --expert_model_parallel_size 8 --moe_grouped_gemm true \
    --micro_batch_size 1 --global_batch_size 8 \
    --recompute_granularity full --recompute_method uniform --recompute_num_layers 1 \
    --attention_backend flash --max_length 2048 \
    --output_dir megatron_output/Qwen3.5-35B-A3B

3. 使用建議

  • 鏡像中的改動涉及Pytorch、DeepSpeed等庫,請勿重裝。

  • DeepSpeed配置中的zero_optimization.stage3_prefetch_bucket_size留空或者auto

Known Issues