すべてのプロダクト
Search
ドキュメントセンター

Container Compute Service:training-nv-pytorch 25.12

最終更新日:Aug 29, 2026

本トピックでは、training-nv-pytorch 25.12 イメージのリリースノートについて説明します。このイメージは、ACS および Lingjun マルチテナント環境でのトレーニングおよび推論ジョブ用の PyTorch 環境を提供します。本リリースでは、vLLM および flashinfer-python をアップグレードし、異なる CUDA および NVIDIA ドライバーバージョンを対象とした 2 つのバリアントを公開しています。

サポートされている環境

training-nv-pytorch 25.12 イメージは、ACS および Lingjun マルチテナント環境でサポートされています。

重要

このイメージは、Lingjun シングルテナントデプロイメントではサポートされていません。

主な機能とバグ修正

主な機能

  • vLLM を 0.12.0 に、flashinfer-python を 0.5.3 にアップグレードしました。

バグ修正

なし。

イメージ仕様

次の表は、2 つの training-nv-pytorch 25.12 イメージの仕様を示しています。各タグで必要なドライバーバージョンおよび CPU アーキテクチャの参照情報としてご利用ください。

項目

25.12-cu130-serverless

25.12-cu128-serverless

イメージ名

training-nv-pytorch

training-nv-pytorch

ユースケース

トレーニング / 推論

トレーニング / 推論

フレームワーク

PyTorch

PyTorch

要件

NVIDIA ドライバー 580 以降

NVIDIA ドライバー 575 以降

サポートされているアーキテクチャ

amd64 および aarch64

amd64

コアコンポーネント

次の表は、各イメージのコアコンポーネントとコンポーネントバージョンを示しています。

コンポーネント

25.12-cu130-serverless

25.12-cu128-serverless

Ubuntu

24.04

24.04

Python

3.12.7+gc

3.12.7+gc

CUDA

13.0.2

12.8.0

perf

5.4.30

5.4.30

gdb

15.0.50.20240403-git

15.0.50.20240403-git

torch

2.9.0+ali.10.nv25.10

2.8.0.9+nv25.3

triton

3.5.0

3.4.0

transformer_engine

2.9.0+70f53666

2.9.0+70f53666

deepspeed

0.18.1+ali

0.18.1+ali

flash_attn

2.8.3

2.8.3

flash_attn_3

not found

3.0.0b1

transformers

4.57.1+ali

4.57.1+ali

grouped_gemm

1.1.4

1.1.4

accelerate

1.11.0+ali

1.11.0+ali

diffusers

0.34.0

0.34.0

mmengine

0.10.3

0.10.3

mmcv

2.1.0

2.1.0

mmdet

3.3.0

3.3.0

opencv-python-headless

4.11.0.86

4.11.0.86

ultralytics

8.3.96

8.3.96

timm

1.0.22

1.0.22

vllm

0.12.0+cu130

0.12.0+cu128

flashinfer-python

0.5.3

0.5.3

pytorch-dynamic-profiler

0.24.11

0.24.11

peft

0.16.0

0.16.0

ray

2.52.1

2.52.1

megatron-core

0.14.0

0.14.0

アセット

パブリックイメージ

training-nv-pytorch 25.12 の各 CUDA バージョンは、それぞれ独自のイメージアドレスで公開されています。各イメージで必要なドライバーバージョンおよび CPU アーキテクチャについては、イメージ仕様セクションをご参照ください。

CUDA バージョン

イメージアドレス

13.0.2

egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/training-nv-pytorch:25.12-cu130-serverless

12.8.0

egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/training-nv-pytorch:25.12-cu128-serverless

VPC イメージ

ACS コンソールの YAML ファイルで指定されている AI コンテナイメージアセット URI egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/{image:tag}acs-registry-vpc.{region-id}.cr.aliyuncs.com/egslingjun/{image:tag} に置き換えることで、VPC 経由で PG1 AI コンテナイメージを迅速にプルできます。

  • {region-id} は、ACS がアクティブ化されている利用可能なリージョン (cn-beijing や cn-wulanchabu など) です。

  • {image:tag} は、イメージの名前とタグです。

ドライバー要件

training-nv-pytorch 25.12 は 2 つの CUDA バージョンをサポートしており、それぞれで要求される最小 NVIDIA ドライバーバージョンが異なります。CUDA 13.0.2 には NVIDIA ドライバー 580 以降、CUDA 12.8.0 には NVIDIA ドライバー 575 以降が必要です。サポートされているドライバーの完全なリストについては、「CUDA Application Compatibility トピック」をご参照ください。ドライバーの互換性の詳細については、「CUDA Compatibility and Upgrades」をご参照ください。

主な機能と機能強化

PyTorch コンパイルの最適化

PyTorch 2.0 で導入された torch.compile() は、小規模なシングル GPU のワークロードで大きな効果を発揮することがよくあります。しかし、LLM のトレーニングは GPU メモリの最適化と FSDP や DeepSpeed などの分散フレームワークに依存するため、torch.compile() では限定的な利点しか得られないか、パフォーマンスを低下させる可能性があります。

  • DeepSpeed フレームワークでの通信粒度の制御。これにより、コンパイラがより完全な計算グラフをキャプチャし、より広範なコンパイル最適化を適用できます。

  • 最適化された PyTorch ビルドの使用:

    • PyTorch コンパイラのフロントエンドが改善され、計算グラフでグラフブレークが発生した場合でもコンパイルが成功するようになりました。

    • パターンマッチングと動的シェイプのサポートが強化され、コンパイル後のパフォーマンスが向上しました。

これらの最適化により、8B パラメーターの LLM トレーニングでは、通常、エンドツーエンドのスループットが約 20% 向上します。

再計算のための GPU メモリの最適化

大規模なパフォーマンスデータ (さまざまなモデル、クラスター、トレーニングパラメーター設定、ベンチマーク中に収集された GPU メモリ使用率などのシステムメトリクスを含む) に基づいて構築された GPU メモリオーバーヘッドの予測モデルは、最適なアクティベーション再計算レイヤー数を推奨します。このアプローチは PyTorch に統合されており、最小限の労力で GPU メモリの最適化によるパフォーマンス向上を実現できます。この機能は、DeepSpeed フレームワークでサポートされるようになりました。

E2E パフォーマンス向上の評価

クラウドネイティブ AI パフォーマンス評価および分析ツール (CNP) を使用し、主流のオープンソースモデルおよびフレームワーク構成で、標準ベースイメージに対する包括的なエンドツーエンド (E2E) パフォーマンス比較を行いました。アブレーションスタディにより、各最適化コンポーネントがモデルトレーニング全体のパフォーマンスにどの程度貢献しているかをさらに評価しました。

イテレーション全体での本イメージとベースイメージの比較

image.png

コア GPU コンポーネントの E2E パフォーマンス貢献度分析

マルチノード GPU クラスタ上でバージョン 25.12 を実行し、以下の構成で E2E トレーニングパフォーマンスを評価しました。

  • Base: NGC PyTorch イメージです。

  • ACS AI イメージ (Base + ACCL): ACCL 通信ライブラリを使用したベースイメージです。

  • ACS AI イメージ (AC2 + ACCL): ACCL を使用した AC2 BaseOS で、最適化は有効化されていません。

  • ACS AI イメージ (AC2 + ACCL + CompilerOpt): ACCL を使用した AC2 BaseOS で、torch compile 最適化のみが有効化されています。

  • ACS AI イメージ (AC2 + ACCL + CompilerOpt + CkptOpt): ACCL を使用した AC2 BaseOS で、torch compile と選択的勾配チェックポイント最適化の両方が有効化されています。

    image.png

クイックスタート

次の例は、Docker を使用して training-nv-pytorch イメージをプルし、トレーニングジョブを実行する方法を示しています。

説明

ACS で training-nv-pytorch イメージを使用するには、コンソールでワークロードを作成する際に [アーティファクトセンター] ページでイメージを選択するか、YAML ファイルでイメージを参照します。

使用上の推奨事項

training-nv-pytorch イメージを実行する際は、以下の制限と設定があります。

  • バンドルされたライブラリ: PyTorch や DeepSpeed などのライブラリを再インストールしないでください。このイメージには、これらのライブラリの修正版が含まれています。

  • DeepSpeed 構成: DeepSpeed 構成では、zero_optimization.stage3_prefetch_bucket_size を空のままにするか、auto に設定してください。

  • ネットワークインターフェイス: このイメージに組み込まれている NCCL_SOCKET_IFNAME 環境変数を、シナリオに基づいて調整してください。

    • 単一の Pod がトレーニングまたは推論ジョブ用に 1、2、4、または 8 個の GPU を要求する場合は、NCCL_SOCKET_IFNAME=eth0 に設定してください。これは、このイメージのデフォルト構成です。

    • 単一の Pod がトレーニングまたは推論ジョブ用にノード上のすべての 16 個の GPU を要求する場合は、高性能ネットワーク (HPN) を使用できます。この場合、NCCL_SOCKET_IFNAME=hpn0 に設定してください。

1. イメージのプル

環境の NVIDIA ドライバーバージョンと CPU アーキテクチャを確認してから、次のコマンドを実行してイメージをプルします。

docker pull egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/training-nv-pytorch:[tag]

[tag] を公開されているタグのいずれかに置き換えます。

  • 25.12-cu130-serverless: CUDA 13.0.2、NVIDIA ドライバー 580 以降が必要で、amd64 および aarch64 をサポートします。

  • 25.12-cu128-serverless: CUDA 12.8.0、NVIDIA ドライバー 575 以降が必要で、amd64 のみをサポートします。

2. コンパイルおよび再計算の最適化を有効化

コンパイルの最適化を有効化

transformers の TrainingArguments クラスで、次のフィールドを設定します。

training_args = TrainingArguments(
    bf16=True,
    gradient_checkpointing=True,
    torch_compile=True
)

再計算のための GPU メモリの最適化を有効化

次の環境変数を設定します。

export CHECKPOINT_OPTIMIZATION=true

3. コンテナの起動

ljperf モデルトレーニングツールがイメージに組み込まれています。次のコマンドは、ljperf を使用してコンテナを起動し、トレーニングジョブを実行します。

LLM

# コンテナを起動して入る
docker run --rm -it --ipc=host --net=host  --privileged egslingjun-registry.cn-wulanchabu.cr.aliyuncs.com/egslingjun/training-nv-pytorch:[tag]
# トレーニングデモを実行
ljperf benchmark --model deepspeed/llama3-8b

既知の問題

本リリースの CUDA 13.0.2 イメージで flash_attn_3 (fa3) を直接コンパイルするとエラーが返されます。これは コミュニティの既知の問題です。コアコンポーネントの表では、25.12-cu130-serverless イメージの flash_attn_3 は not found と記載されています。