ModelEval est l'outil d'évaluation de modèles de PAI. Utilisez-le pour benchmarker les grands modèles de langage sur des jeux de données publics faisant autorité ou sur vos propres jeux de données métier. Obtenez des scores quantitatifs pour orienter la sélection de modèle, le fine-tuning et la gestion des versions de modèle.
Démarrage rapide
Exécutez votre première évaluation en 5 minutes : utilisez le jeu de données CMMLU pour mesurer les capacités de compréhension et de raisonnement en langue chinoise de Qwen3-4B.
Dans la PAI console, choisissez Model Application > Model Evaluation (ModelEval) dans le volet de navigation de gauche.
Sur la page Model Evaluation, cliquez sur Create Task.
-
Configurez les paramètres suivants :
-
Basic Configuration : Les champs Task name et Result Output Path sont générés automatiquement. Acceptez les valeurs par défaut ou modifiez-les selon vos besoins.
RemarqueSi l'espace de travail ne dispose pas de chemin de stockage OSS par défaut, sélectionnez manuellement un chemin de sortie.
Evaluation Mode Configuration: sélectionnez Single Model Online Evaluation.
Evaluation Object Configurations : Pour Evaluation Object, sélectionnez Public Model. Dans la liste déroulante Public Model, recherchez et sélectionnez Qwen3-4B.
Evaluation Method Configuration : Sélectionnez Public Dataset Evaluation. Dans la liste des jeux de données, sélectionnez CMMLU.
-
Resource Configuration : Sélectionnez Single node - Standard.
Resource Type : Sélectionnez General Computing.
Source : Sélectionnez Public Resources.
Job Resource : Sélectionnez un type d'instance GPU, par exemple
ecs.gn7i-c8g1.2xlarge(24 Go).-
Si le type d'instance sélectionné n'est plus disponible, choisissez une autre instance GPU.
-
-
Cliquez sur OK en bas de la page. La page de détails de la tâche s'ouvre.
Lorsque le statut de la tâche passe à Succeeded, ouvrez l'onglet Evaluation Report pour consulter les scores de
Qwen3-4Bsur le jeu de données CMMLU.
Configuration des évaluations
Configuration du mode d'évaluation
ModelEval prend en charge trois modes d'évaluation. Choisissez le mode adapté à votre cas d'utilisation.
|
Evaluation Mode |
Description |
|
Single Model Online Evaluation |
Attribue un score à la sortie d'inférence d'un seul modèle. |
|
Dual-Model Arena |
Exécute l'inférence en ligne sur les deux modèles en utilisant les mêmes questions et compare leurs réponses afin d'identifier le modèle le plus performant. |
|
Dual-Model Offline Competition |
Compare deux modèles à l'aide d'un jeu de données questions-réponses préconstitué afin d'identifier le modèle le plus performant. |
Configuration de la cible d'évaluation
ModelEval prend en charge quatre cibles d'évaluation. Choisissez en fonction de l'emplacement de déploiement de votre modèle ou service.
|
Evaluation Target |
Description |
Cas d'utilisation |
|
Public Model |
Modèles issus de PAI Model Gallery |
Benchmarker les LLM open source grand public |
|
Custom Model |
Modèles personnalisés enregistrés dans Important
Assurez-vous que le modèle est compatible avec le framework vLLM. |
Évaluer des modèles fine-tunés ou personnalisés |
|
PAI-EAS Service |
Un service d'inférence en ligne PAI-EAS (Elastic Algorithm Service) déployé |
Évaluer des services de modèle en production |
|
Custom Services |
Tout service de modèle disposant d'une API compatible OpenAI |
Évaluer des services de modèle tiers ou auto-hébergés |
Configuration de la méthode d'évaluation
Utilisez des jeux de données personnalisés, des jeux de données publics ou une combinaison des deux.
Évaluation sur jeu de données personnalisé
Utilisez votre propre jeu de données pour obtenir des résultats d'évaluation reflétant des scénarios métier concrets.
Format du jeu de données : JSONL (encodage UTF-8, un objet JSON par ligne).
Téléchargement : Téléchargez le fichier du jeu de données vers OSS (Object Storage Service) et saisissez son chemin OSS sur la page de configuration.
|
Evaluation Method |
General NLP Metric Evaluation |
Multi-Metric Evaluation with LLM-as-a-Judge |
|
Objectif |
Pour les questions disposant de réponses de référence, cette métrique mesure la similarité textuelle entre la sortie du modèle et la réponse attendue. À utiliser pour les tâches de traduction, de résumé et de question-réponse sur base de connaissances. |
Lorsque les questions n'ont pas de réponse unique correcte — comme dans le cas de dialogues ouverts ou de génération de contenu — un modèle juge puissant attribue un score à la qualité des réponses du modèle. |
|
Format du jeu de données |
Chaque objet JSON doit inclure un champ
|
Chaque objet JSON doit inclure un champ
|
|
Métriques |
|
Le système envoie la |
Évaluation sur jeu de données public
Utilisez des jeux de données standards de l'industrie pour benchmarker votre modèle par rapport à des points de référence établis.
Objectif : Comparaisons pour la sélection de modèle, tests de benchmark avant mise en production et évaluation générale des capacités.
Configuration : Sélectionnez Public Dataset Evaluation, puis choisissez un ou plusieurs jeux de données dans la liste.
-
Jeux de données pris en charge :
LiveCodeBench : Capacité de traitement du code.
Math500 : Raisonnement mathématique (500 problèmes de compétition mathématique de haute difficulté).
AIME25 : Raisonnement mathématique basé sur les problèmes AIME 2025.
AIME24 : Raisonnement mathématique basé sur les problèmes AIME 2024.
CMMLU : Compréhension linguistique multithématique en chinois.
MMLU : Compréhension linguistique multithématique en anglais.
C-Eval : Évaluation complète des capacités linguistiques en chinois.
GSM8K : Raisonnement mathématique.
HellaSwag : Raisonnement de bon sens.
TruthfulQA : Évaluation de la véracité.
Gestion des tâches
Sur la page Model Evaluation, gérez les tâches d'évaluation.
View Report : Pour les tâches dont le statut est Succeeded, cliquez sur ce bouton pour afficher le rapport d'évaluation détaillé.
Compare : Sélectionnez 2 à 5 tâches terminées et cliquez sur Compare pour comparer leurs scores côte à côte.
Stop : Arrêtez une tâche In operation. Cette action est irréversible : la tâche ne peut pas être reprise et les ressources de calcul consommées ne sont pas remboursées.
Delete : Supprime l'enregistrement de la tâche. Cette action ne peut pas être annulée.
Facturation
ModelEval facture les éléments suivants :
Ressources de calcul
|
Resource Type |
Méthode de facturation |
Élément facturé |
Règle de facturation |
|
Ressources publiques |
Paiement à l'utilisation |
Durée d'exécution réelle |
Pour connaître les prix des instances, consultez les informations tarifaires dans la console. |
|
Quota de ressource |
Abonnement (prépayé) |
Nombre et durée des instances de nœud achetées |
Achetez des ressources dédiées à l'avance. Les frais sont basés sur le nombre d'instances de nœud et la durée de l'abonnement. Pour plus de détails, consultez Facturation des ressources de calcul IA. |
Modèle juge
Des frais supplémentaires s'appliquent si vous utilisez l'évaluation par modèle juge. Pour les détails tarifaires, consultez Tarification du service PAI Token.