すべてのプロダクト
Search
ドキュメントセンター

Container Compute Service:training-nv-pytorch 26.07

最終更新日:Aug 29, 2026

training-nv-pytorch 26.07 は、モデルのトレーニングと推論のためのコンテナイメージです。このトピックでは、このイメージのリリースハイライト、イメージ仕様、および使用を開始する方法について説明します。

リリースハイライト

主な機能

  • PyTorch と関連コンポーネントを 2.12.1 に、Triton を 3.7.1 にアップグレードしました。

  • トレーニングコンポーネント: Transformer Engine を 2.16.1 に、Megatron-Core を 0.18.2 に、Transformers を 5.12.1 にアップグレードしました。コミュニティの機能と関連する修正がマージされています。

  • 推論コンポーネント: vLLM を 0.24.0 に、FlashInfer を 0.6.12 にアップグレードしました。コミュニティの機能と関連する修正がマージされています。

バグ修正

なし

主な機能と拡張

PyTorch コンパイルの最適化

PyTorch 2.0 で導入された torch.compile() は、小規模なシングル GPU のワークロードで大きな効果を発揮することがよくあります。しかし、LLM のトレーニングは GPU メモリの最適化と FSDP や DeepSpeed などの分散フレームワークに依存するため、torch.compile() では限定的な利点しか得られないか、パフォーマンスを低下させる可能性があります。

  • DeepSpeed フレームワークでの通信粒度の制御。これにより、コンパイラがより完全な計算グラフをキャプチャし、より広範なコンパイル最適化を適用できます。

  • 最適化された PyTorch ビルドの使用:

    • PyTorch コンパイラのフロントエンドが改善され、計算グラフでグラフブレークが発生した場合でもコンパイルが成功するようになりました。

    • パターンマッチングと動的シェイプのサポートが強化され、コンパイル後のパフォーマンスが向上しました。

DeepSpeed フレームワークで通信の粒度を制御します。これにより、コンパイラはより完全な計算グラフを捉え、より広範なコンパイル最適化を適用できるようになります。

最適化された PyTorch ビルドを使用します:

  • The PyTorch compiler frontend is improved to ensure that compilation succeeds even if a graph break occurs in the compute graph.

  • Pattern matching and dynamic shape support are strengthened to improve post-compilation performance.

ACCL

ACCL は、Lingjun 向けに構築された Alibaba Cloud の高性能な通信ライブラリです。ACCL-N は GPU に特化したバージョンです。ACCL-N は、NVIDIA NCCL をカスタマイズした高性能な通信ライブラリです。NCCL と完全に互換性があり、アップストリームの NCCL リリースの問題を修正し、パフォーマンスと安定性を向上させています。

イメージ仕様

次の表に、training-nv-pytorch 26.07 イメージの仕様を示します。

項目

イメージ名

training-nv-pytorch

タグ

26.07-serverless

シナリオ

トレーニングと推論

フレームワーク

PyTorch

NVIDIA ドライバー要件

580 以降

対応アーキテクチャ

amd64、aarch64

コアコンポーネント

amd64

  • Ubuntu: 24.04

  • Python: 3.12.7+gc

  • CUDA: 13.0.2

  • perf: 5.4.30

  • gdb: 15.1

  • torch: 2.12.1+ali.12.nv25.10

  • triton: 3.7.1

  • transformer_engine: 2.16.1+c9877beb

  • deepspeed: 0.18.8+ali

  • flash_attn: 2.8.3

  • flash_attn_3: 3.0.0

  • transformers: 5.12.1

  • grouped_gemm: 1.1.4

  • accelerate: 1.11.0+ali

  • diffusers: 0.34.0

  • mmengine: 0.10.3

  • mmcv: 2.1.0

  • mmdet: 3.3.0

  • opencv-python-headless: 4.11.0.86

  • ultralytics: 8.3.96

  • timm: 1.0.28

  • vllm: 0.24.0

  • flashinfer-python: 0.6.12

  • peft: 0.19.1

  • megatron-core: 0.18.2

aarch64

  • Ubuntu: 24.04

  • Python: 3.12.7+gc

  • CUDA: 13.0.2

  • gdb: 15.1

  • torch: 2.12.1+ali.12.nv25.10

  • triton: 3.7.1

  • transformer_engine: 2.16.1+c9877beb

  • deepspeed: 0.18.8+ali

  • flash_attn: 2.8.3

  • transformers: 5.12.1

  • grouped_gemm: 1.1.4

  • accelerate: 1.11.0+ali

  • diffusers: 0.34.0

  • mmengine: 0.10.3

  • mmcv: 2.1.0

  • mmdet: 3.3.0

  • opencv-python-headless: 4.11.0.86

  • ultralytics: 8.3.96

  • timm: 1.0.28

  • vllm: 0.24.0

  • flashinfer-python: 0.6.12

  • peft: 0.19.1

  • megatron-core: 0.18.2

ドライバー要件

  • training-nv-pytorch 26.07 は CUDA 13.0.2 をサポートしており、NVIDIA ドライバー 580 以降が必要です。サポートされているドライバーの完全なリストについては、CUDA Application Compatibility をご参照ください。詳細については、CUDA Compatibility and Upgrades をご参照ください。

イメージ

パブリックイメージ

CUDA 13.0.2 (ドライバー 580 以降、amd64 および aarch64)

  • egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/training-nv-pytorch:26.07-serverless

VPC イメージ

VPC 内で Container Compute Service (ACS) の AI コンテナイメージを迅速にプルするには、指定された AI コンテナイメージのアセット URI egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/{image:tag}acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag} に置き換えてください。

  • {region-id}:ACS の リージョンID です。例:cn-beijingcn-wulanchabu

  • {image:tag}:AI コンテナイメージの名前とタグです。例:inference-nv-pytorch:25.10-vllm0.11.0-pytorch2.8-cu128-20251028-serverlesstraining-nv-pytorch:25.10-serverless

yy.mm-serverless (例:26.07-serverless) タグが付いたイメージは、Alibaba Cloud Container Compute Service (ACS) および Lingjun のマルチテナントデプロイメントに適用されます。Lingjun のシングルテナントデプロイメントの場合は、yy.mm (例:26.07) タグが付いたイメージを使用してください。

クイックスタート

ACS (推奨) で training-nv-pytorch イメージを使用するには、コンソールでワークロードを作成する際に [Artifact Center] ページからイメージを選択するか、YAML ファイルでイメージを指定してください。

次の例では、Docker を使用して training-nv-pytorch イメージをプルし、コンテナを起動してトレーニング例を実行する方法を示します。

作業を開始する前に、NVIDIA ドライバー 580 以降がインストールされていることを確認してください。詳細については、「ドライバー要件」をご参照ください。

1. イメージのプル

[tag] を、お使いの製品に適用されるイメージタグに置き換えてください。ACS および Lingjun マルチテナント製品の場合は 26.07-serverless、Lingjun シングルテナント製品の場合は 26.07 です。

docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/training-nv-pytorch:[tag]

2. コンテナの起動

このイメージには、組み込みのモデルトレーニングツールが含まれています。次の例では、コンテナを起動し、トレーニングタスクを実行します。

LLM ワークロード

# コンテナを起動して入ります
docker run -it --gpus=all --ipc=host --net=host egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/training-nv-pytorch:[tag]

# Dense: Qwen3.5-4B LoRA スモークテスト
NPROC_PER_NODE=2 CUDA_VISIBLE_DEVICES=0,1 \
swift sft --model Qwen/Qwen3.5-4B --tuner_type lora \
    --dataset 'AI-ModelScope/alpaca-gpt4-data-zh#500' \
    --split_dataset_ratio 0.01 --num_train_epochs 1 \
    --target_modules all-linear --attn_impl flash_attn \
    --deepspeed zero2 --max_length 2048 --output_dir output

# MoE の例: Qwen/Qwen3.5-35B-A3B
NPROC_PER_NODE=8 CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 \
megatron sft --model Qwen/Qwen3.5-35B-A3B \
    --dataset 'AI-ModelScope/alpaca-gpt4-data-zh#500' \
    --split_dataset_ratio 0.01 --num_train_epochs 1 --finetune true \
    --expert_model_parallel_size 8 --moe_grouped_gemm true \
    --micro_batch_size 1 --global_batch_size 8 \
    --recompute_granularity full --recompute_method uniform --recompute_num_layers 1 \
    --attention_backend flash --max_length 2048 \
    --output_dir megatron_output/Qwen3.5-35B-A3B

3. 使用上の推奨事項

  • このイメージには、PyTorchDeepSpeed などのライブラリの修正版が含まれています。これらのライブラリを再インストールしないでください。

  • DeepSpeed の設定では、zero_optimization.stage3_prefetch_bucket_size を空にするか、auto に設定してください。

既知の問題

なし