すべてのプロダクト
Search
ドキュメントセンター

Platform For AI:モデル圧縮

最終更新日:Aug 06, 2026

モデル圧縮は、量子化などの技術を使用して、予測パフォーマンスを維持しながらモデルサイズと計算量を削減します。GPU メモリが限られている場合や、デプロイコストを削減する場合に有効です。

概要

PAI-モデルギャラリーは、重みのみの量子化テクノロジーに基づくモデル量子化をサポートしています。MinMax-8Bit または MinMax-4Bit 戦略を使用して、浮動小数点パラメーターを 8 ビットまたは 4 ビットの整数表現に量子化します。これにより、優れたパフォーマンスを維持しながら、モデルサイズと GPU メモリ使用量を削減できます。

モデルの圧縮

  1. 圧縮可能なモデルをフィルタリングします。[モデルギャラリー] ページで、左側の [サポートされる操作] フィルターから [Compression] を選択すると、圧縮可能なモデルのみが表示されます。

    image

  2. 対象のモデルカードで [Compression] をクリックして、圧縮タスクを設定します。主要なパラメーターについては、以下をご参照ください。その他のパラメーターは、必要に応じて設定してください。

    パラメーター

    説明

    圧縮方法

    現在、重みのみの量子化テクノロジーに基づく モデル量子化 方法のみがサポートされています。この方法は、モデルの重みパラメーターをより低いビット幅に変換し、推論時の GPU メモリ使用量を削減します。

    圧縮戦略

    • MinMax-8Bit:Min-Max スケーリング法を使用して、モデルを 8 ビットの整数表現に量子化します。

    • MinMax-4Bit:Min-Max スケーリング法を使用して、モデルを 4 ビットの整数表現に量子化します。

  3. 設定完了後、圧縮 をクリックします。ページが タスク詳細 ページにリダイレクトされ、圧縮ジョブの基本情報、リアルタイムステータス、およびジョブログを表示できます。

    圧縮ジョブは、PAI-Model Gallery > タスク管理 > 圧縮タスク でも利用可能です。

モデルのデプロイ

圧縮ジョブが成功すると、モデル詳細ページの右上隅にあるデプロイメントをクリックして、圧縮されたモデルをデプロイします。 サービスの呼び出しについては、「共有ゲートウェイ (パブリック/VPC) 経由でサービスを呼び出す」をご参照ください。

モデルの評価

モデルのデプロイ後、圧縮の効果を確認するために評価を実施します。詳細については、「モデル評価 (ModelEval)」をご参照ください。