Tous les produits
Search
Centre de documentation

Platform For AI:Model evaluation (ModelEval)

Dernière mise à jour :Aug 09, 2026

ModelEval est l'outil d'évaluation de modèles de PAI. Utilisez-le pour benchmarker les grands modèles de langage sur des jeux de données publics faisant autorité ou sur vos propres jeux de données métier. Obtenez des scores quantitatifs pour orienter la sélection de modèle, le fine-tuning et la gestion des versions de modèle.

Démarrage rapide

Exécutez votre première évaluation en 5 minutes : utilisez le jeu de données CMMLU pour mesurer les capacités de compréhension et de raisonnement en langue chinoise de Qwen3-4B.

  1. Dans la PAI console, choisissez Model Application > Model Evaluation (ModelEval) dans le volet de navigation de gauche.

  2. Sur la page Model Evaluation, cliquez sur Create Task.

  3. Configurez les paramètres suivants :

    • Basic Configuration : Les champs Task name et Result Output Path sont générés automatiquement. Acceptez les valeurs par défaut ou modifiez-les selon vos besoins.

      Remarque

      Si l'espace de travail ne dispose pas de chemin de stockage OSS par défaut, sélectionnez manuellement un chemin de sortie.

    • Evaluation Mode Configuration: sélectionnez Single Model Online Evaluation.

    • Evaluation Object Configurations : Pour Evaluation Object, sélectionnez Public Model. Dans la liste déroulante Public Model, recherchez et sélectionnez Qwen3-4B.

    • Evaluation Method Configuration : Sélectionnez Public Dataset Evaluation. Dans la liste des jeux de données, sélectionnez CMMLU.

    • Resource Configuration : Sélectionnez Single node - Standard.

      • Resource Type : Sélectionnez General Computing.

      • Source : Sélectionnez Public Resources.

      • Job Resource : Sélectionnez un type d'instance GPU, par exemple ecs.gn7i-c8g1.2xlarge (24 Go).

      • Si le type d'instance sélectionné n'est plus disponible, choisissez une autre instance GPU.
  4. Cliquez sur OK en bas de la page. La page de détails de la tâche s'ouvre.

    Lorsque le statut de la tâche passe à Succeeded, ouvrez l'onglet Evaluation Report pour consulter les scores de Qwen3-4B sur le jeu de données CMMLU.

Configuration des évaluations

Configuration du mode d'évaluation

ModelEval prend en charge trois modes d'évaluation. Choisissez le mode adapté à votre cas d'utilisation.

Evaluation Mode

Description

Single Model Online Evaluation

Attribue un score à la sortie d'inférence d'un seul modèle.

Dual-Model Arena

Exécute l'inférence en ligne sur les deux modèles en utilisant les mêmes questions et compare leurs réponses afin d'identifier le modèle le plus performant.

Dual-Model Offline Competition

Compare deux modèles à l'aide d'un jeu de données questions-réponses préconstitué afin d'identifier le modèle le plus performant.

Configuration de la cible d'évaluation

ModelEval prend en charge quatre cibles d'évaluation. Choisissez en fonction de l'emplacement de déploiement de votre modèle ou service.

Evaluation Target

Description

Cas d'utilisation

Public Model

Modèles issus de PAI Model Gallery

Benchmarker les LLM open source grand public

Custom Model

Modèles personnalisés enregistrés dans AI Asset Management > Model

Important

Assurez-vous que le modèle est compatible avec le framework vLLM.

Évaluer des modèles fine-tunés ou personnalisés

PAI-EAS Service

Un service d'inférence en ligne PAI-EAS (Elastic Algorithm Service) déployé

Évaluer des services de modèle en production

Custom Services

Tout service de modèle disposant d'une API compatible OpenAI

Évaluer des services de modèle tiers ou auto-hébergés

Configuration de la méthode d'évaluation

Utilisez des jeux de données personnalisés, des jeux de données publics ou une combinaison des deux.

Évaluation sur jeu de données personnalisé

Utilisez votre propre jeu de données pour obtenir des résultats d'évaluation reflétant des scénarios métier concrets.

  • Format du jeu de données : JSONL (encodage UTF-8, un objet JSON par ligne).

  • Téléchargement : Téléchargez le fichier du jeu de données vers OSS (Object Storage Service) et saisissez son chemin OSS sur la page de configuration.

Evaluation Method

General NLP Metric Evaluation

Multi-Metric Evaluation with LLM-as-a-Judge

Objectif

Pour les questions disposant de réponses de référence, cette métrique mesure la similarité textuelle entre la sortie du modèle et la réponse attendue. À utiliser pour les tâches de traduction, de résumé et de question-réponse sur base de connaissances.

Lorsque les questions n'ont pas de réponse unique correcte — comme dans le cas de dialogues ouverts ou de génération de contenu — un modèle juge puissant attribue un score à la qualité des réponses du modèle.

Format du jeu de données

Chaque objet JSON doit inclure un champ question et un champ answer (vérité terrain).

{"question": "What is the capital of France?", "answer": "Paris"}

Chaque objet JSON doit inclure un champ question. Le champ answer est facultatif.

{"question": "Describe the history of artificial intelligence."}

Métriques

  • ROUGE (ROUGE-1, ROUGE-2, ROUGE-L) : Métrique basée sur le rappel qui mesure la proportion de la vérité terrain couverte par la sortie du modèle.

  • BLEU (BLEU-1, BLEU-2, BLEU-3, BLEU-4) : Métrique basée sur la précision qui mesure la proximité entre la sortie du modèle et la vérité terrain.

Le système envoie la question et la sortie du modèle au modèle juge, qui attribue un score à la réponse selon plusieurs dimensions telles que la pertinence, l'exactitude et la fluidité.

Évaluation sur jeu de données public

Utilisez des jeux de données standards de l'industrie pour benchmarker votre modèle par rapport à des points de référence établis.

  • Objectif : Comparaisons pour la sélection de modèle, tests de benchmark avant mise en production et évaluation générale des capacités.

  • Configuration : Sélectionnez Public Dataset Evaluation, puis choisissez un ou plusieurs jeux de données dans la liste.

  • Jeux de données pris en charge :

    • LiveCodeBench : Capacité de traitement du code.

    • Math500 : Raisonnement mathématique (500 problèmes de compétition mathématique de haute difficulté).

    • AIME25 : Raisonnement mathématique basé sur les problèmes AIME 2025.

    • AIME24 : Raisonnement mathématique basé sur les problèmes AIME 2024.

    • CMMLU : Compréhension linguistique multithématique en chinois.

    • MMLU : Compréhension linguistique multithématique en anglais.

    • C-Eval : Évaluation complète des capacités linguistiques en chinois.

    • GSM8K : Raisonnement mathématique.

    • HellaSwag : Raisonnement de bon sens.

    • TruthfulQA : Évaluation de la véracité.

Gestion des tâches

Sur la page Model Evaluation, gérez les tâches d'évaluation.

  • View Report : Pour les tâches dont le statut est Succeeded, cliquez sur ce bouton pour afficher le rapport d'évaluation détaillé.

  • Compare : Sélectionnez 2 à 5 tâches terminées et cliquez sur Compare pour comparer leurs scores côte à côte.

  • Stop : Arrêtez une tâche In operation. Cette action est irréversible : la tâche ne peut pas être reprise et les ressources de calcul consommées ne sont pas remboursées.

  • Delete : Supprime l'enregistrement de la tâche. Cette action ne peut pas être annulée.

Facturation

ModelEval facture les éléments suivants :

Ressources de calcul

Resource Type

Méthode de facturation

Élément facturé

Règle de facturation

Ressources publiques

Paiement à l'utilisation

Durée d'exécution réelle

Billing amount = (unit price / 60) × service duration (minutes)

Pour connaître les prix des instances, consultez les informations tarifaires dans la console.

Quota de ressource

Abonnement (prépayé)

Nombre et durée des instances de nœud achetées

Achetez des ressources dédiées à l'avance. Les frais sont basés sur le nombre d'instances de nœud et la durée de l'abonnement. Pour plus de détails, consultez Facturation des ressources de calcul IA.

Modèle juge

Des frais supplémentaires s'appliquent si vous utilisez l'évaluation par modèle juge. Pour les détails tarifaires, consultez Tarification du service PAI Token.