すべてのプロダクト
Search
ドキュメントセンター

Platform For AI:LLMの継続的な事前トレーニング

最終更新日:Sep 11, 2026

PAI-QuickStart を使用して、ドメイン固有またはタスク固有の改善のために Qwen2 モデルの継続的な事前トレーニングを実行します。

継続的な事前トレーニング用のデータ準備

継続的な事前トレーニングでは、Pai-Megatron-Patch ツールキットを使用します。このツールキットは、Megatron-LM アクセラレーション技術を適用して大規模言語モデル (LLM) および視覚言語モデル (VLM) をトレーニングします。

Pai-Megatron-Patch では、事前トレーニングデータを MMAP フォーマットで用意する必要があります。MMAP フォーマットは事前トークン化済みのフォーマットであり、大規模データセットの読み込み時間を短縮します。生データを MMAP フォーマットに変換するには、データ変換チュートリアルまたは PAI-Designer の「テキストデータをmmapフォーマットに変換」コンポーネントを使用してください。出力ファイルは dataset.bin および dataset.idx という名前にする必要があります。 PAI では、試用のためのサンプルデータセットを提供しています。

wget https://atp-modelzoo-wlcb-pai.oss-cn-wulanchabu.aliyuncs.com/release/models/pai-megatron-patch/llama3-datasets/wudao_llama3bpe_content_document.bin
wget https://atp-modelzoo-wlcb-pai.oss-cn-wulanchabu.aliyuncs.com/release/models/pai-megatron-patch/llama3-datasets/wudao_llama3bpe_content_document.idx
mv wudao_llama3bpe_content_document.bin dataset.bin
mv wudao_llama3bpe_content_document.idx dataset.idx

PAI-QuickStart を使用した継続的な事前トレーニング

データの準備が完了したら、PAI-QuickStart で継続的な事前トレーニングを実行します。この手順では、Qwen2-72B を例として使用します。

  1. モデルギャラリーページに移動します。

    1. PAI コンソールにログインします。

    2. 左上隅でリージョンを選択します。

    3. 左側のナビゲーションペインで、ワークスペース一覧 を選択し、ワークスペース名をクリックします。

    4. 左側のナビゲーションペインで、クイックスタート > [モデルギャラリー]を選択します。

  2. モデルギャラリーページで [Qwen2-72B-Base (Megatron-CPT)] をクリックします。

  3. モデルの詳細 ページで、[トレーニング] をクリックします。以下の設定を構成します。

    • [Training output]: 出力を NAS データセットに設定します (データセットの作成)。Megatron チェックポイントは、出力ディレクトリの checkpoint サブフォルダに保存されます。

    • [Compute resources]: 4 ノードにまたがる最低 32 基の A100/A800/H100/H800 (80 GB) GPU。

    • [Hyperparameters]: データセットとコンピューティングリソースに基づいて調整するか、デフォルト値を使用します。

      パラメータ

      デフォルト値

      タイプ

      説明

      job_name

      qwen2-72b-cpt

      string

      トレーニングタスクのタイプ。変更しないでください。

      batch_size

      1

      int

      イテレーションごとに GPU ごとに処理されるデータサンプル数。

      global_batch_size

      32

      int

      イテレーションごとにすべての GPU で処理されるサンプルの合計数。batch_size * GPU 数に等しくなります。

      learning_rate

      5e-5

      float

      学習率。

      min_learning_rate

      5e-6

      float

      最小学習率。

      sequence_length

      1024

      int

      テキストシーケンスの長さ。

      pad_length

      128

      int

      テキストシーケンスのパディング長。

      save_interval

      50

      int

      チェックポイント間のトレーニングイテレーション数。

      train_tokens

      1638400

      int

      トレーニングの合計トークン数。イテレーションごとに消費されるトークン数 = global_batch_size * sequence_length

      warmup_tokens

      163840

      int

      ウォームアップフェーズの合計トークン数。

  4. [Train] をクリックします。PAI-QuickStart がトレーニングを開始し、タスクのステータスとログが表示されます。

(オプション) モデルチェックポイントの Hugging Face フォーマットへの変換

Qwen2-72B の事前トレーニングでは、Megatron Dense Checkpoint フォーマットが出力されます。Hugging Face フォーマットに変換するには、Megatron-Core モデルフォーマット変換を使用してください。