本文介紹training-nv-pytorch 26.07版本發布記錄。
Main Features and Bug Fix Lists
Main Features
PyTorch及其相關組件升級至 2.12.1、Triton升級至 3.7.1。
訓練相關組件Transformer Engine 升級至2.16.1、Megatron-Core 升級至0.18.2、Transformers 升級至5.12.1,合入社區功能和對應issues。
推理相關組件vLLM 升級至 0.24.0、FlashInfer 升級至 0.6.12,合入社區功能和對應issues。
Bug Fixes
無
Contents
鏡像名稱 | training-nv-pytorch | |
Tag | 26.07-serverless | |
應用情境 | 訓練/推理 | |
架構 | pytorch | |
Requirements | NVIDIA Driver release >= 580 | NVIDIA Driver release >= 580 |
Supported Architectures | amd64 | aarch64 |
核心組件 |
|
|
Assets
公網鏡像
CUDA 13.0.2(Driver >=580, amd64 & aarch64 )
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/training-nv-pytorch:26.07-serverless
VPC鏡像
將指定的AI容器鏡像Asset URIegslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/{image:tag}替換為acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag}即可在VPC內快速拉取ACS AI容器鏡像。
{region-id}:ACS產品開服地區的地區ID。例如:cn-beijing、cn-wulanchabu等。{image:tag}:AI容器鏡像的名稱和Tag。例如:inference-nv-pytorch:25.10-vllm0.11.0-pytorch2.8-cu128-20251028-serverless、training-nv-pytorch:25.10-serverless等。
Tag為yy.mm-serverless(例如26.07-serverless)的鏡像適用於ACS產品形態、靈駿多租產品形態;靈駿單租產品形態可以使用Tag為yy.mm(例如26.07)的鏡像。
Driver Requirements
26.07 Release 支援CUDA 13.0.2;其中CUDA 13.0.2 需要NVIDIA驅動程式版本580或更高版本。有關支援的驅動程式的完整列表,請參見CUDA 應用程式相容性。更多資訊,請參見 CUDA 相容性和升級。
Key Features and Enhancements
PyTorch編譯最佳化
PyTorch 2.0引入的編譯最佳化能力在單卡小規模下通常可以獲得顯著的收益,但是在LLM訓練中需要引入顯存最佳化、FSDP/DeepSpeed等分布式架構,導致torch.compile()無法簡單地獲得收益或者存在負收益:
-
在DeepSpeed架構下控制通訊的顆粒度,協助編譯器擷取更完整的計算圖,做更大範圍的編譯最佳化
-
最佳化版本的PyTorch:
-
最佳化PyTorch編譯器前端,確保在計算圖中出現任意graph break的情況下仍能正常編譯
-
強化模式比對以及dynamic shape能力,提高編譯後代碼效能
-
ACCL通訊庫
ACCL是阿里針對靈駿產品自研的高效能網路通訊庫,針對GPU情境提供ACCL-N版本。ACCL-N是阿里雲基於英偉達NCCL定製後提供的高效能通訊庫,在完全相容NCCL的基礎上,修複了官方NCCL版本的一些BUG,並進行了效能和穩定性相關的最佳化。
Quick Start
以下樣本內容僅通過Docker方式拉取training-nv-pytorch鏡像。
在ACS中使用training-nv-pytorch鏡像需要通過控制台建立工作負載介面的製品中心頁面選取,或者通過YAML檔案指定鏡像引用。
1. 選擇鏡像
docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/training-nv-pytorch:[tag]2. 啟動容器
鏡像中內建了模型訓練工具,以此說明啟動容器和運行訓練任務的步驟。
LLM類
# 啟動容器並進入
docker run -it --gpus=all --ipc=host --net=host egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/training-nv-pytorch:[tag]
# Dense: Qwen3.5-4B LoRA 冒煙
NPROC_PER_NODE=2 CUDA_VISIBLE_DEVICES=0,1 \
swift sft --model Qwen/Qwen3.5-4B --tuner_type lora \
--dataset 'AI-ModelScope/alpaca-gpt4-data-zh#500' \
--split_dataset_ratio 0.01 --num_train_epochs 1 \
--target_modules all-linear --attn_impl flash_attn \
--deepspeed zero2 --max_length 2048 --output_dir output
# MoE 用例:Qwen/Qwen3.5-35B-A3B
NPROC_PER_NODE=8 CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 \
megatron sft --model Qwen/Qwen3.5-35B-A3B \
--dataset 'AI-ModelScope/alpaca-gpt4-data-zh#500' \
--split_dataset_ratio 0.01 --num_train_epochs 1 --finetune true \
--expert_model_parallel_size 8 --moe_grouped_gemm true \
--micro_batch_size 1 --global_batch_size 8 \
--recompute_granularity full --recompute_method uniform --recompute_num_layers 1 \
--attention_backend flash --max_length 2048 \
--output_dir megatron_output/Qwen3.5-35B-A3B3. 使用建議
鏡像中的改動涉及Pytorch、DeepSpeed等庫,請勿重裝。
DeepSpeed配置中的
zero_optimization.stage3_prefetch_bucket_size留空或者auto。
Known Issues
無