Deep Learning Containers (DLC) は Kubernetes 上で動作し、分散深層学習ワークロードに対応したすぐに使用できるトレーニング環境を提供します。クラスターを構成することなく、PyTorch、TensorFlow、Megatron などのフレームワークを使用して、GPU および Lingjun AI Compute リソース上でトレーニングジョブをすぐに実行できます。
主なメリット
多様なコンピューティングリソース
Lingjun AI Compute および汎用コンピューティングリソース上で動作します。ECS、ECI、Shenlong ベアメタル、Lingjun ベアメタルインスタンスなどが含まれます。これらのリソースタイプを横断する異種コンピューティングスケジューリングをサポートします。
幅広いフレームワークサポート
Megatron、DeepSpeed、PyTorch、TensorFlow、MPI、XGBoost など、10 以上のトレーニングフレームワークでクラスターをセットアップすることなくジョブを実行できます。DLC は複数の事前構築済みイメージを提供し、カスタムランタイム環境もサポートします。コンソール、SDK、または CLI からジョブを実行できます。
高い安定性
大規模モデルのトレーニングにおいて、DLC は独自の AIMaster フォールトトレランスエンジン、EasyCKPT 高性能チェックポイントフレームワーク、SanityCheck ヘルス検出、自動ノード修復により、コンピューティング損失を削減し、トレーニングの安定性を向上させます。
高いパフォーマンス
独自の AI トレーニング高速化フレームワークは、データ並列、パイプライン並列、オペレーター分割などの複数の並列化戦略をサポートし、自動戦略検索とメモリ最適化を提供します。トポロジー対応スケジューリング、勾配グループ融合、混合精度通信と組み合わせることで、DLC は分散トレーニングの効率を向上させます。大規模モデルの事前トレーニング、継続トレーニング、アライメントワークロードに適しています。
ユースケース
データ前処理:カスタムランタイム環境を使用してオフライン並列前処理を実行し、トレーニングデータの準備を簡素化します。
大規模分散トレーニング:複数のオープンソース深層学習フレームワークを使用して、数千のノードで同時にトレーニングを実行し、トレーニング時間を大幅に短縮します。
オフライン推論:DLC でオフライン推論ジョブを実行し、アイドル時の GPU 使用率を向上させます。
リソースタイプ
PAI (Platform for AI) は、コンピューティング要件に応じて選択できる 2 種類のリソースタイプを提供します。
Lingjun AI Compute:大規模モデルのトレーニング用に設計された高性能コンピューティングリソースで、超大規模深層学習ワークロードをサポートします。大規模モデルのトレーニング、自動運転、大量のコンピューティングを必要とする科学研究に適しています。
汎用コンピューティング:標準的なトレーニングワークロードに対応する柔軟なリソースで、さまざまな規模とタイプの機械学習タスクをサポートします。
Lingjun AI Compute と汎用コンピューティングリソースの両方で、以下の使用モードを利用できます。
リソースクォータ:長期的で安定したトレーニングニーズに対して、サブスクリプション で Lingjun または汎用コンピューティングリソースを購入します。
パブリックリソース:ジョブ実行時にオンデマンドで Lingjun または汎用コンピューティングリソースを使用し、従量課金で請求されます。事前購入は不要です。
スポットインスタンス:Lingjun AI Compute は、低コストで AI コンピューティング容量を利用できるスポットインスタンスを提供します。
主な機能
ジョブの作成と管理
トレーニングジョブの作成:コンソール、SDK、または CLI からトレーニングジョブを実行し、イメージ、データセット、リソースタイプ、起動コマンドを設定します。
ジョブの詳細表示:基本的なジョブ情報、リソースビュー、操作ログを表示します。
トレーニングジョブの管理:ジョブの停止、クローン、共有、スクリプト生成、削除を実行します。
オフラインスケジューリングの設定:データまたはハイパーパラメータが更新されたときに、増分トレーニングおよびモデルチューニング用の DLC ジョブを自動的に実行します。
ストレージの設定:Object Storage Service (OSS)、Apsara File Storage NAS (NAS)、Cloud Parallel File Storage (CPFS) をマウントまたは設定します。
ジョブの監視と通知
トレーニングジョブ分析レポートの表示:TensorBoard でトレーニングメトリクスと分析レポートを視覚化します。
CloudMonitor または ARMS によるジョブの監視:DLC ジョブのリソース使用状況を表示するか、アラートルールを設定します。
通知の設定:PAI (Platform for AI) ワークスペースのイベントセンターで通知ルールを作成し、ジョブステータスの変更をリアルタイムで追跡します。
ネットワークおよび通信の高速化
RDMA の設定:Lingjun AI Compute リソースを使用する際に、高性能な RDMA (Remote Direct Memory Access) ネットワークを設定し、ノード間通信を高速化します。
ACCL:Alibaba Cloud 独自の高性能集団通信ライブラリ:Alibaba Cloud のネットワーク特性と大規模モデルの通信パターンに最適化された高性能集団通信であり、障害診断と自己修復機能を内蔵しています。
パブリック NAT ゲートウェイによるインターネットアクセス速度の向上:インスタンスが配置されている VPC 用にパブリック NAT ゲートウェイを作成し、SNAT を設定することで、インスタンスが専用パブリックゲートウェイを介して高速でインターネットにアクセスできるようにします。
コストの最適化
スポットインスタンス:Lingjun スポットインスタンスを使用して DLC ジョブを作成し、低コストで AI コンピューティング容量を利用します。
遊休リソースの使用:他のクォータからのアイドル容量を使用する低優先度のコンピューティングジョブを実行し、通常のワークロードに影響を与えることなく、リソース使用率を向上させ、トレーニングコストを削減します。
弾力性とフォールトトレランス
自動フォールトトレランス:AIMaster がジョブステータスを監視し、障害を自動的に検出して復旧します。
ヘルスチェック:トレーニング開始前にリソースの正常性を検出し、障害のあるノードを自動的に隔離します。
EasyCKPT:PyTorch 大規模モデルトレーニング用の無損失モデルチェックポイントと復旧を提供し、チェックポイントからの再開をサポートします。
PerfTracker:オンラインパフォーマンス分析と診断:各ワーカーから CUDA カーネル関数、Python 関数実行記録、ハードウェアメトリクスをリアルタイムで収集し、分析レポートを自動生成して、低速ノード、ボトルネック関数、ハングを特定します。
課金
DLC は主にコンピューティングリソースに対して課金されます。
コンピューティングリソースタイプ | 課金方式 | 課金対象 | 課金ルール | 課金停止条件 |
パブリックリソース | 従量課金 | DLC ジョブの実行時間 (ジョブがパブリックリソースを占有する時間)。 |
|
|
AI コンピューティングリソース (汎用コンピューティングおよび Lingjun AI Compute) | サブスクリプション | 詳細については、「AI コンピューティングリソースの課金」をご参照ください。 | 詳細については、「AI コンピューティングリソースの課金」をご参照ください。 | 該当なし |
詳細については、「DLC の課金」をご参照ください。
クイックスタート
MNIST 手書き数字認識の例を使用して、DLC で単一ノード単一 GPU または複数ノード複数 GPU の分散トレーニングを実行する方法を学習できます。詳細については、「Deep Learning Containers (DLC) の使用開始」をご参照ください。
サポートを受ける
DLC FAQ:ジョブの開始または停止の失敗、課金に関する質問、トレーニングエラーなどの問題については、「DLC FAQ」をご参照ください。
PAI (Platform for AI) AI アシスタント (Xiao PAI):Xiao PAI は、PAI (Platform for AI) 製品スイート全体に関する質問に回答し、ガイダンスを提供します。DSW インスタンス、DLC ジョブ、EAS サービスの運用診断をサポートし、障害原因を自動的に特定して次のステップを推奨します。

関連ドキュメント
トレーニングジョブの作成:コンソール、SDK、または CLI からトレーニングジョブを実行し、主要なパラメータの設定方法を学習できます。
DLC のユースケース:実用的な例を通じて DLC の使用方法を学習できます。