training-nv-pytorch 26.07 は、モデルのトレーニングと推論のためのコンテナイメージです。このトピックでは、このイメージのリリースハイライト、イメージ仕様、および使用を開始する方法について説明します。
リリースハイライト
主な機能
PyTorchと関連コンポーネントを 2.12.1 に、Tritonを 3.7.1 にアップグレードしました。トレーニングコンポーネント:
Transformer Engineを 2.16.1 に、Megatron-Coreを 0.18.2 に、Transformersを 5.12.1 にアップグレードしました。コミュニティの機能と関連する修正がマージされています。推論コンポーネント:
vLLMを 0.24.0 に、FlashInferを 0.6.12 にアップグレードしました。コミュニティの機能と関連する修正がマージされています。
バグ修正
なし
主な機能と拡張
PyTorch コンパイルの最適化
PyTorch 2.0 で導入された torch.compile() は、小規模なシングル GPU のワークロードで大きな効果を発揮することがよくあります。しかし、LLM のトレーニングは GPU メモリの最適化と FSDP や DeepSpeed などの分散フレームワークに依存するため、torch.compile() では限定的な利点しか得られないか、パフォーマンスを低下させる可能性があります。
-
DeepSpeed フレームワークでの通信粒度の制御。これにより、コンパイラがより完全な計算グラフをキャプチャし、より広範なコンパイル最適化を適用できます。
-
最適化された PyTorch ビルドの使用:
-
PyTorch コンパイラのフロントエンドが改善され、計算グラフでグラフブレークが発生した場合でもコンパイルが成功するようになりました。
-
パターンマッチングと動的シェイプのサポートが強化され、コンパイル後のパフォーマンスが向上しました。
-
DeepSpeed フレームワークで通信の粒度を制御します。これにより、コンパイラはより完全な計算グラフを捉え、より広範なコンパイル最適化を適用できるようになります。
最適化された PyTorch ビルドを使用します:
The PyTorch compiler frontend is improved to ensure that compilation succeeds even if a graph break occurs in the compute graph.
Pattern matching and dynamic shape support are strengthened to improve post-compilation performance.
ACCL
ACCL は、Lingjun 向けに構築された Alibaba Cloud の高性能な通信ライブラリです。ACCL-N は GPU に特化したバージョンです。ACCL-N は、NVIDIA NCCL をカスタマイズした高性能な通信ライブラリです。NCCL と完全に互換性があり、アップストリームの NCCL リリースの問題を修正し、パフォーマンスと安定性を向上させています。
イメージ仕様
次の表に、training-nv-pytorch 26.07 イメージの仕様を示します。
項目 | 値 |
イメージ名 | training-nv-pytorch |
タグ | 26.07-serverless |
シナリオ | トレーニングと推論 |
フレームワーク | PyTorch |
NVIDIA ドライバー要件 | 580 以降 |
対応アーキテクチャ | amd64、aarch64 |
コアコンポーネント
amd64
Ubuntu: 24.04
Python: 3.12.7+gc
CUDA: 13.0.2
perf: 5.4.30
gdb: 15.1
torch: 2.12.1+ali.12.nv25.10
triton: 3.7.1
transformer_engine: 2.16.1+c9877bebdeepspeed: 0.18.8+aliflash_attn: 2.8.3flash_attn_3: 3.0.0transformers: 5.12.1
grouped_gemm: 1.1.4accelerate: 1.11.0+ali
diffusers: 0.34.0
mmengine: 0.10.3
mmcv: 2.1.0
mmdet: 3.3.0
opencv-python-headless: 4.11.0.86ultralytics: 8.3.96
timm: 1.0.28
vllm: 0.24.0
flashinfer-python: 0.6.12peft: 0.19.1
megatron-core: 0.18.2
aarch64
Ubuntu: 24.04
Python: 3.12.7+gc
CUDA: 13.0.2
gdb: 15.1
torch: 2.12.1+ali.12.nv25.10
triton: 3.7.1
transformer_engine: 2.16.1+c9877bebdeepspeed: 0.18.8+aliflash_attn: 2.8.3transformers: 5.12.1
grouped_gemm: 1.1.4accelerate: 1.11.0+ali
diffusers: 0.34.0
mmengine: 0.10.3
mmcv: 2.1.0
mmdet: 3.3.0
opencv-python-headless: 4.11.0.86ultralytics: 8.3.96
timm: 1.0.28
vllm: 0.24.0
flashinfer-python: 0.6.12peft: 0.19.1
megatron-core: 0.18.2
ドライバー要件
training-nv-pytorch 26.07 は CUDA 13.0.2 をサポートしており、NVIDIA ドライバー 580 以降が必要です。サポートされているドライバーの完全なリストについては、CUDA Application Compatibility をご参照ください。詳細については、CUDA Compatibility and Upgrades をご参照ください。
イメージ
パブリックイメージ
CUDA 13.0.2 (ドライバー 580 以降、amd64 および aarch64)
egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/training-nv-pytorch:26.07-serverless
VPC イメージ
VPC 内で Container Compute Service (ACS) の AI コンテナイメージを迅速にプルするには、指定された AI コンテナイメージのアセット URI egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/{image:tag} を acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag} に置き換えてください。
{region-id}:ACS の リージョンID です。例:cn-beijing、cn-wulanchabu。{image:tag}:AI コンテナイメージの名前とタグです。例:inference-nv-pytorch:25.10-vllm0.11.0-pytorch2.8-cu128-20251028-serverless、training-nv-pytorch:25.10-serverless。
yy.mm-serverless (例:26.07-serverless) タグが付いたイメージは、Alibaba Cloud Container Compute Service (ACS) および Lingjun のマルチテナントデプロイメントに適用されます。Lingjun のシングルテナントデプロイメントの場合は、yy.mm (例:26.07) タグが付いたイメージを使用してください。
クイックスタート
ACS (推奨) で training-nv-pytorch イメージを使用するには、コンソールでワークロードを作成する際に [Artifact Center] ページからイメージを選択するか、YAML ファイルでイメージを指定してください。
次の例では、Docker を使用して training-nv-pytorch イメージをプルし、コンテナを起動してトレーニング例を実行する方法を示します。
作業を開始する前に、NVIDIA ドライバー 580 以降がインストールされていることを確認してください。詳細については、「ドライバー要件」をご参照ください。
1. イメージのプル
[tag] を、お使いの製品に適用されるイメージタグに置き換えてください。ACS および Lingjun マルチテナント製品の場合は 26.07-serverless、Lingjun シングルテナント製品の場合は 26.07 です。
docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/training-nv-pytorch:[tag]2. コンテナの起動
このイメージには、組み込みのモデルトレーニングツールが含まれています。次の例では、コンテナを起動し、トレーニングタスクを実行します。
LLM ワークロード
# コンテナを起動して入ります
docker run -it --gpus=all --ipc=host --net=host egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/training-nv-pytorch:[tag]
# Dense: Qwen3.5-4B LoRA スモークテスト
NPROC_PER_NODE=2 CUDA_VISIBLE_DEVICES=0,1 \
swift sft --model Qwen/Qwen3.5-4B --tuner_type lora \
--dataset 'AI-ModelScope/alpaca-gpt4-data-zh#500' \
--split_dataset_ratio 0.01 --num_train_epochs 1 \
--target_modules all-linear --attn_impl flash_attn \
--deepspeed zero2 --max_length 2048 --output_dir output
# MoE の例: Qwen/Qwen3.5-35B-A3B
NPROC_PER_NODE=8 CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 \
megatron sft --model Qwen/Qwen3.5-35B-A3B \
--dataset 'AI-ModelScope/alpaca-gpt4-data-zh#500' \
--split_dataset_ratio 0.01 --num_train_epochs 1 --finetune true \
--expert_model_parallel_size 8 --moe_grouped_gemm true \
--micro_batch_size 1 --global_batch_size 8 \
--recompute_granularity full --recompute_method uniform --recompute_num_layers 1 \
--attention_backend flash --max_length 2048 \
--output_dir megatron_output/Qwen3.5-35B-A3B3. 使用上の推奨事項
このイメージには、
PyTorchやDeepSpeedなどのライブラリの修正版が含まれています。これらのライブラリを再インストールしないでください。DeepSpeedの設定では、zero_optimization.stage3_prefetch_bucket_sizeを空にするか、autoに設定してください。
既知の問題
なし