Tous les produits
Search
Centre de documentation

Platform For AI:Compression de modèle

Dernière mise à jour :Aug 09, 2026

La compression de modèle utilise des techniques telles que la quantification pour réduire la taille du modèle et sa complexité de calcul, tout en préservant les performances de prédiction. Cette approche s'avère utile lorsque la mémoire GPU est limitée ou pour diminuer les coûts de déploiement.

Introduction

PAI-Model Gallery prend en charge la quantification de modèle basée sur la technologie Weight-only Quantization. Elle utilise les stratégies MinMax-8Bit ou MinMax-4Bit pour convertir les paramètres en virgule flottante en représentations entières 8 bits ou 4 bits. Ce procédé réduit la taille du modèle et l'utilisation de la mémoire GPU, tout en maintenant de bonnes performances.

Compresser le modèle

  1. Filtrez les modèles compressibles. Sur la page Model Gallery, sélectionnez Compression dans le filtre Supported operations situé à gauche pour afficher uniquement les modèles compressibles.

    image

  2. Cliquez sur Compression sur la fiche du modèle cible pour configurer la tâche de compression. Les principaux paramètres sont décrits ci-dessous. Configurez les autres paramètres selon vos besoins.

    Paramètre

    Description

    Méthode de compression

    Seule la méthode de quantification de modèle basée sur la technologie Weight-only Quantization est actuellement prise en charge. Elle convertit les poids du modèle vers des largeurs de bits inférieures, ce qui réduit l'utilisation de la mémoire GPU lors de l'inférence.

    Stratégie de compression

    • MinMax-8Bit : utilise la méthode de mise à l'échelle min-max pour quantifier le modèle en une représentation entière 8 bits.

    • MinMax-4Bit : utilise la méthode de mise à l'échelle min-max pour quantifier le modèle en une représentation entière 4 bits.

  3. Une fois la configuration terminée, cliquez sur Compression. La page redirige vers la page Task details, où vous pouvez consulter les informations de base de la tâche de compression, son statut en temps réel ainsi que les journaux de la tâche.

    La tâche de compression est également disponible sous PAI-Model Gallery > Job Management > Compression Jobs

Déployer le modèle

Une fois la tâche de compression réussie, cliquez sur Deploy dans le coin supérieur droit de la page des détails du modèle pour déployer le modèle compressé. Pour plus d'informations sur l'appel du service, consultez la rubrique Appeler le service via la passerelle partagée (public/VPC).

Évaluer le modèle

Après le déploiement du modèle, évaluez-le pour vérifier les effets de la compression. Pour plus de détails, consultez la rubrique Évaluation de modèle (ModelEval).