大規模言語モデル (LLM) のデプロイとファインチューニングに必要な GPU メモリは、パラメータ数、精度、シーケンス長などの要因によって異なります。このトピックの計算ツールを使用すると、必要な GPU メモリを迅速に見積もり、適切な GPU 仕様を選択できます。
1. GPU メモリの簡易カリキュレーター
説明
このトピックでは、一般的な計算方法に基づき、LLM のデプロイとファインチューニングに必要な GPU メモリを見積もります。実際の GPU メモリ使用量は、モデルのネットワーク構造やアルゴリズムの違いにより、異なる場合があります。
DeepSeek-R1-671B などの混合エキスパート (MoE) モデルの場合、671B のモデルパラメーターをすべてロードする必要があります。しかし、推論中に活性化されるのは 37B のパラメーターのみです。したがって、37B のパラメーター数に基づいて活性化値の GPU メモリを計算する必要があります。
モデルのファインチューニング中、モデルパラメーター、活性化値、および勾配は通常、16 ビット精度で保存されます。Adam/AdamW オプティマイザーが使用され、その状態は 32 ビット精度で保存されます。