PAI-QuickStart を使用して、ドメイン固有またはタスク固有の改善のために Qwen2 モデルの継続的な事前トレーニングを実行します。
継続的な事前トレーニング用のデータ準備
継続的な事前トレーニングでは、Pai-Megatron-Patch ツールキットを使用します。このツールキットは、Megatron-LM アクセラレーション技術を適用して大規模言語モデル (LLM) および視覚言語モデル (VLM) をトレーニングします。
Pai-Megatron-Patch では、事前トレーニングデータを MMAP フォーマットで用意する必要があります。MMAP フォーマットは事前トークン化済みのフォーマットであり、大規模データセットの読み込み時間を短縮します。生データを MMAP フォーマットに変換するには、データ変換チュートリアルまたは PAI-Designer の「テキストデータをmmapフォーマットに変換」コンポーネントを使用してください。出力ファイルは dataset.bin および dataset.idx という名前にする必要があります。 PAI では、試用のためのサンプルデータセットを提供しています。
wget https://atp-modelzoo-wlcb-pai.oss-cn-wulanchabu.aliyuncs.com/release/models/pai-megatron-patch/llama3-datasets/wudao_llama3bpe_content_document.bin
wget https://atp-modelzoo-wlcb-pai.oss-cn-wulanchabu.aliyuncs.com/release/models/pai-megatron-patch/llama3-datasets/wudao_llama3bpe_content_document.idx
mv wudao_llama3bpe_content_document.bin dataset.bin
mv wudao_llama3bpe_content_document.idx dataset.idx
PAI-QuickStart を使用した継続的な事前トレーニング
データの準備が完了したら、PAI-QuickStart で継続的な事前トレーニングを実行します。この手順では、Qwen2-72B を例として使用します。
-
モデルギャラリーページに移動します。
-
PAI コンソールにログインします。
-
左上隅でリージョンを選択します。
-
左側のナビゲーションペインで、ワークスペース一覧 を選択し、ワークスペース名をクリックします。
-
左側のナビゲーションペインで、クイックスタート > [モデルギャラリー]を選択します。
-
-
モデルギャラリーページで [Qwen2-72B-Base (Megatron-CPT)] をクリックします。
-
モデルの詳細 ページで、[トレーニング] をクリックします。以下の設定を構成します。
-
[Training output]: 出力を NAS データセットに設定します (データセットの作成)。Megatron チェックポイントは、出力ディレクトリの
checkpointサブフォルダに保存されます。 -
[Compute resources]: 4 ノードにまたがる最低 32 基の A100/A800/H100/H800 (80 GB) GPU。
-
[Hyperparameters]: データセットとコンピューティングリソースに基づいて調整するか、デフォルト値を使用します。
パラメータ
デフォルト値
タイプ
説明
job_name
qwen2-72b-cpt
string
トレーニングタスクのタイプ。変更しないでください。
batch_size
1
int
イテレーションごとに GPU ごとに処理されるデータサンプル数。
global_batch_size
32
int
イテレーションごとにすべての GPU で処理されるサンプルの合計数。
batch_size* GPU 数に等しくなります。learning_rate
5e-5
float
学習率。
min_learning_rate
5e-6
float
最小学習率。
sequence_length
1024
int
テキストシーケンスの長さ。
pad_length
128
int
テキストシーケンスのパディング長。
save_interval
50
int
チェックポイント間のトレーニングイテレーション数。
train_tokens
1638400
int
トレーニングの合計トークン数。イテレーションごとに消費されるトークン数 =
global_batch_size*sequence_length。warmup_tokens
163840
int
ウォームアップフェーズの合計トークン数。
-
-
[Train] をクリックします。PAI-QuickStart がトレーニングを開始し、タスクのステータスとログが表示されます。
(オプション) モデルチェックポイントの Hugging Face フォーマットへの変換
Qwen2-72B の事前トレーニングでは、Megatron Dense Checkpoint フォーマットが出力されます。Hugging Face フォーマットに変換するには、Megatron-Core モデルフォーマット変換を使用してください。