All Products
Search
Document Center

Platform For AI:Kompresi model

Last Updated:Aug 06, 2026

Kompresi model menggunakan teknik seperti kuantisasi untuk mengurangi ukuran dan kompleksitas komputasi model sambil mempertahankan performa prediksi. Teknik ini berguna saat memori GPU terbatas atau untuk menekan biaya penerapan.

Pendahuluan

PAI-Model Gallery mendukung kuantisasi model berdasarkan teknologi Weight-only Quantization. Teknologi ini menerapkan strategi MinMax-8Bit atau MinMax-4Bit untuk mengkuantisasi parameter floating-point menjadi representasi integer 8-bit atau 4-bit, sehingga mengurangi ukuran model dan penggunaan memori GPU tanpa mengorbankan performa secara signifikan.

Kompres model

  1. Filter model yang dapat dikompres. Pada halaman Model Gallery, pilih Compression dari filter Supported operations di sebelah kiri untuk menampilkan hanya model yang mendukung kompresi.

    image

  2. Klik Compression pada kartu model target untuk mengonfigurasi pekerjaan kompresi. Parameter utama dijelaskan di bawah ini; konfigurasikan parameter lain sesuai kebutuhan.

    Parameter

    Deskripsi

    Compression method

    Hanya metode model quantization berbasis teknologi Weight-only Quantization yang saat ini didukung. Metode ini mengonversi parameter bobot model ke lebar bit yang lebih rendah, sehingga mengurangi penggunaan memori GPU selama inferensi.

    Compression strategy

    • MinMax-8Bit: Menggunakan metode penskalaan min-max untuk mengkuantisasi model ke representasi integer 8-bit.

    • MinMax-4Bit: Menggunakan metode penskalaan min-max untuk mengkuantisasi model ke representasi integer 4-bit.

  3. Setelah konfigurasi selesai, klik Compression. Halaman akan dialihkan ke halaman Task details, tempat Anda dapat melihat informasi dasar pekerjaan kompresi, status real-time, dan log pekerjaan.

    Pekerjaan kompresi juga tersedia di bawah PAI-Model Gallery > Job Management > Compression Jobs

Terapkan model

Setelah pekerjaan kompresi berhasil, klik Deploy di pojok kanan atas halaman detail model untuk menerapkan model yang telah dikompres. Untuk informasi tentang cara memanggil layanan, lihat Invoke service via shared gateway (public/VPC).

Evaluasi model

Setelah model diterapkan, evaluasi model tersebut untuk memeriksa dampak kompresi. Untuk detailnya, lihat Model evaluation (ModelEval).