すべてのプロダクト
Search
ドキュメントセンター

Platform For AI:DLC の概要

最終更新日:Aug 07, 2026

Deep Learning Containers (DLC) は Kubernetes 上で動作し、分散深層学習ワークロードに対応したすぐに使用できるトレーニング環境を提供します。クラスターを構成することなく、PyTorch、TensorFlow、Megatron などのフレームワークを使用して、GPU および Lingjun AI Compute リソース上でトレーニングジョブをすぐに実行できます。

主なメリット

  • 多様なコンピューティングリソース

    Lingjun AI Compute および汎用コンピューティングリソース上で動作します。ECS、ECI、Shenlong ベアメタル、Lingjun ベアメタルインスタンスなどが含まれます。これらのリソースタイプを横断する異種コンピューティングスケジューリングをサポートします。

  • 幅広いフレームワークサポート

    Megatron、DeepSpeed、PyTorch、TensorFlow、MPI、XGBoost など、10 以上のトレーニングフレームワークでクラスターをセットアップすることなくジョブを実行できます。DLC は複数の事前構築済みイメージを提供し、カスタムランタイム環境もサポートします。コンソール、SDK、または CLI からジョブを実行できます。

  • 高い安定性

    大規模モデルのトレーニングにおいて、DLC は独自の AIMaster フォールトトレランスエンジン、EasyCKPT 高性能チェックポイントフレームワーク、SanityCheck ヘルス検出、自動ノード修復により、コンピューティング損失を削減し、トレーニングの安定性を向上させます。

  • 高いパフォーマンス

    独自の AI トレーニング高速化フレームワークは、データ並列、パイプライン並列、オペレーター分割などの複数の並列化戦略をサポートし、自動戦略検索とメモリ最適化を提供します。トポロジー対応スケジューリング、勾配グループ融合、混合精度通信と組み合わせることで、DLC は分散トレーニングの効率を向上させます。大規模モデルの事前トレーニング、継続トレーニング、アライメントワークロードに適しています。

ユースケース

  • データ前処理:カスタムランタイム環境を使用してオフライン並列前処理を実行し、トレーニングデータの準備を簡素化します。

  • 大規模分散トレーニング:複数のオープンソース深層学習フレームワークを使用して、数千のノードで同時にトレーニングを実行し、トレーニング時間を大幅に短縮します。

  • オフライン推論:DLC でオフライン推論ジョブを実行し、アイドル時の GPU 使用率を向上させます。

リソースタイプ

PAI (Platform for AI) は、コンピューティング要件に応じて選択できる 2 種類のリソースタイプを提供します。

  • Lingjun AI Compute:大規模モデルのトレーニング用に設計された高性能コンピューティングリソースで、超大規模深層学習ワークロードをサポートします。大規模モデルのトレーニング、自動運転、大量のコンピューティングを必要とする科学研究に適しています。

  • 汎用コンピューティング:標準的なトレーニングワークロードに対応する柔軟なリソースで、さまざまな規模とタイプの機械学習タスクをサポートします。

Lingjun AI Compute と汎用コンピューティングリソースの両方で、以下の使用モードを利用できます。

  • リソースクォータ:長期的で安定したトレーニングニーズに対して、サブスクリプション で Lingjun または汎用コンピューティングリソースを購入します。

  • パブリックリソース:ジョブ実行時にオンデマンドで Lingjun または汎用コンピューティングリソースを使用し、従量課金で請求されます。事前購入は不要です。

  • スポットインスタンス:Lingjun AI Compute は、低コストで AI コンピューティング容量を利用できるスポットインスタンスを提供します。

主な機能

ジョブの作成と管理

  • トレーニングジョブの作成:コンソール、SDK、または CLI からトレーニングジョブを実行し、イメージ、データセット、リソースタイプ、起動コマンドを設定します。

  • ジョブの詳細表示:基本的なジョブ情報、リソースビュー、操作ログを表示します。

  • トレーニングジョブの管理:ジョブの停止、クローン、共有、スクリプト生成、削除を実行します。

  • オフラインスケジューリングの設定:データまたはハイパーパラメータが更新されたときに、増分トレーニングおよびモデルチューニング用の DLC ジョブを自動的に実行します。

  • ストレージの設定:Object Storage Service (OSS)、Apsara File Storage NAS (NAS)、Cloud Parallel File Storage (CPFS) をマウントまたは設定します。

ジョブの監視と通知

ネットワークおよび通信の高速化

コストの最適化

  • スポットインスタンス:Lingjun スポットインスタンスを使用して DLC ジョブを作成し、低コストで AI コンピューティング容量を利用します。

  • 遊休リソースの使用:他のクォータからのアイドル容量を使用する低優先度のコンピューティングジョブを実行し、通常のワークロードに影響を与えることなく、リソース使用率を向上させ、トレーニングコストを削減します。

弾力性とフォールトトレランス

  • 自動フォールトトレランス:AIMaster がジョブステータスを監視し、障害を自動的に検出して復旧します。

  • ヘルスチェック:トレーニング開始前にリソースの正常性を検出し、障害のあるノードを自動的に隔離します。

  • EasyCKPT:PyTorch 大規模モデルトレーニング用の無損失モデルチェックポイントと復旧を提供し、チェックポイントからの再開をサポートします。

  • PerfTracker:オンラインパフォーマンス分析と診断:各ワーカーから CUDA カーネル関数、Python 関数実行記録、ハードウェアメトリクスをリアルタイムで収集し、分析レポートを自動生成して、低速ノード、ボトルネック関数、ハングを特定します。

課金

DLC は主にコンピューティングリソースに対して課金されます。

コンピューティングリソースタイプ

課金方式

課金対象

課金ルール

課金停止条件

パブリックリソース

従量課金

DLC ジョブの実行時間 (ジョブがパブリックリソースを占有する時間)。

請求額 = ノード数 × (単価 / 60) × 実行時間 (分)

  • DLC ジョブが完了した場合。

  • DLC ジョブのステータスが「停止」に変更された場合。

AI コンピューティングリソース (汎用コンピューティングおよび Lingjun AI Compute)

サブスクリプション

詳細については、「AI コンピューティングリソースの課金」をご参照ください。

詳細については、「AI コンピューティングリソースの課金」をご参照ください。

該当なし

詳細については、「DLC の課金」をご参照ください。

クイックスタート

MNIST 手書き数字認識の例を使用して、DLC で単一ノード単一 GPU または複数ノード複数 GPU の分散トレーニングを実行する方法を学習できます。詳細については、「Deep Learning Containers (DLC) の使用開始」をご参照ください。

サポートを受ける

  • DLC FAQ:ジョブの開始または停止の失敗、課金に関する質問、トレーニングエラーなどの問題については、「DLC FAQ」をご参照ください。

  • PAI (Platform for AI) AI アシスタント (Xiao PAI):Xiao PAI は、PAI (Platform for AI) 製品スイート全体に関する質問に回答し、ガイダンスを提供します。DSW インスタンス、DLC ジョブ、EAS サービスの運用診断をサポートし、障害原因を自動的に特定して次のステップを推奨します。

    image

関連ドキュメント