Tous les produits
Search
Centre de documentation

Platform For AI:Évaluation de modèle

Dernière mise à jour :Aug 26, 2026

Évaluez les modèles de langage de grande taille (LLM) à l'aide de jeux de données personnalisés ou de benchmarks publics tels que MMLU et C-Eval afin de quantifier et de comparer les performances des modèles.

Vue d'ensemble

L'évaluation de modèle prend en charge deux approches :

  • Évaluation par jeu de données personnalisé

    • Évaluation basée sur des règles : mesure la similarité entre les prédictions du modèle et les réponses de référence à l'aide des métriques ROUGE et BLEU.

    • Évaluation par modèle juge : utilise un modèle juge issu du service Token Service pour noter les sorties du modèle élément par élément. Cette approche est particulièrement adaptée aux scénarios de questions-réponses ouvertes et complexes.

  • Évaluation par jeu de données public

    • Évalue les modèles par rapport à des jeux de données publics conformes aux standards industriels, notamment MMLU, TriviaQA, HellaSwag, GSM8K, C-Eval et TruthfulQA.

    • Génère des scores de référence alignés sur les normes d'évaluation du secteur.

Modèles pris en charge : tous les types de modèles HuggingFace AutoModelForCausalLM sont pris en charge.

Cas d'utilisation

Recourez à l'évaluation de modèle pour :

  • Benchmarking de modèle : évaluer les capacités générales d'un modèle à l'aide de jeux de données publics et comparer les résultats avec ceux des modèles ou des références de l'industrie.

  • Évaluation spécifique à un domaine : tester un modèle dans un domaine précis et comparer les performances du modèle pré-entraîné avec celles du modèle affiné afin de mesurer l'application des connaissances métier.

  • Tests de non-régression : constituer un ensemble de tests de non-régression pour évaluer les performances du modèle dans des scénarios métier réels et déterminer s'il répond aux exigences de production.

Facturation

  • Frais de stockage OSS : s'appliquent au stockage des jeux de données d'évaluation et des résultats. Consultez la rubrique Facturation OSS.

  • Frais des tâches d'évaluation DLC : s'appliquent à l'exécution des tâches d'évaluation. Consultez la rubrique Facturation DLC.

  • Évaluation par modèle juge : consultez la rubrique Tarification du service PAI Token.

Préparation des données

L'évaluation de modèle prend en charge les jeux de données personnalisés et publics, y compris C-Eval.

  • Jeux de données publics :

    PAI met à disposition les jeux de données publics suivants : MMLU, TriviaQA, HellaSwag, GSM8K, C-Eval et TruthfulQA. Consultez la console pour obtenir la liste actualisée. Sélectionnez n'importe quel jeu de données pour l'utiliser directement.

  • Jeux de données personnalisés :

    Préparez un fichier d'évaluation personnalisé au format JSONL et téléchargez-le sur OSS. Créez ensuite un jeu de données personnalisé. Pour plus d'informations, consultez les rubriques Télécharger des fichiers OSS et Créer et gérer des jeux de données. Le format du fichier est le suivant :

    Utilisez question pour la colonne des questions et answer pour la colonne des réponses de référence. Vous pouvez également modifier ces mappages de colonnes sur la page d'évaluation. Si vous n'avez besoin que de l'évaluation par modèle juge, la colonne answer est facultative.

    {"question": "Did ancient China invent papermaking?", "answer": "Yes"}
    {"question": "Did ancient China invent gunpowder?", "answer": "Yes"}

    Exemple de fichier : eval.jsonl

Évaluer un modèle

image

Étape 1 : Sélectionner un modèle

  1. Accédez à la page Model Gallery.

    1. Connectez-vous à la console PAI.

    2. Dans le volet de navigation de gauche, cliquez sur Workspaces, puis sélectionnez votre espace de travail cible.

    3. Dans le volet de navigation de gauche, choisissez QuickStart>Model Gallery.

  2. Recherchez un modèle prenant en charge l'évaluation.

    • Filtrez les modèles évaluables depuis Models. Dans la zone de filtre Supported Operations, sélectionnez Evaluate pour n'afficher que les modèles évaluables.

    • Évaluez un modèle affiné. Les modèles affinés conservent leur capacité d'évaluation. Sur la page Model Gallery, cliquez sur Job Management>Training Jobs, puis cliquez sur le nom de la tâche pour ouvrir la page des détails de la tâche. Le bouton Evaluate apparaît dans le coin supérieur droit.

Étape 2 : Configurer la tâche d'évaluation

Configurez la tâche d'évaluation en sélectionnant un jeu de données, en définissant les hyperparamètres et, si nécessaire, en activant l'évaluation par modèle juge.

  1. Configurez les paramètres de base :

    • Job Name : nom unique généré automatiquement.

    • Result Output Path : chemin OSS où les résultats d'évaluation sont stockés.

    • Tag : utilisé pour la recherche multidimensionnelle des ressources, les opérations par lot et l'allocation des coûts.

  2. Configurez la méthode d'évaluation :

    • Evaluation Method : choisissez Custom Dataset Evaluation ou Public Dataset Evaluation.

      • Public Dataset Evaluation :

        • Utilise des jeux de données open source couvrant plusieurs domaines (tels que les mathématiques et le codage) pour fournir une évaluation complète des capacités des LLM. Des scores plus élevés indiquent de meilleures performances du modèle.

        • Plusieurs jeux de données peuvent être sélectionnés simultanément. GSM8K, TriviaQA et HellaSwag sont des jeux de données volumineux et peuvent nécessiter des temps d'évaluation plus longs.

      • Custom Dataset Evaluation : spécifiez les colonnes des questions et des réponses de référence pour votre jeu de données personnalisé. Si vous n'avez besoin que de l'évaluation par modèle juge, la colonne des réponses de référence peut rester vide.

        • Dataset Source : choisissez Select OSS File ou Select an existing dataset..

        • Evaluation Method : sélectionnez une ou plusieurs des méthodes d'évaluation suivantes :

          • General NLP Metric Evaluation : calcule la similarité textuelle entre les prédictions du modèle et les réponses de référence à l'aide des métriques ROUGE et BLEU. Adapté aux scénarios comportant des réponses définitives. Le jeu de données doit inclure des paires question-réponse.

          • Multi-Metric Evaluation with LLM-as-a-Judge : note automatiquement les réponses du modèle à l'aide d'un modèle juge, avec prise en charge de métriques personnalisées. Adapté aux réponses complexes ou ouvertes. Le jeu de données peut contenir uniquement des questions, ou des paires question-réponse.

  3. Configurez les ressources de calcul :

    • Resource Type : les types de ressources pris en charge varient selon le modèle. Reportez-vous à la console pour connaître les options disponibles.

    • Source : choisissez parmi les ressources publiques, les quotas de ressources ou les ressources spot.

Une fois tous les paramètres configurés, cliquez sur OK pour soumettre la tâche. Vous êtes redirigé vers la page des détails de la tâche. Une fois la tâche terminée, cliquez sur Evaluation Report pour consulter le rapport d'évaluation.

Étape 3 : Consulter les résultats d'évaluation

Une fois la tâche terminée, reportez-vous à la section Consulter les résultats d'évaluation ci-dessous pour savoir comment afficher les résultats d'une tâche unique, comparer plusieurs tâches d'évaluation et interpréter les scores.

Consulter les résultats d'évaluation

Liste des tâches d'évaluation

Sur la page Model Gallery, cliquez sur Job Management, puis basculez vers l'onglet Evaluation Jobs.

La page des tâches d'évaluation affiche une liste contenant le nom de la tâche, le mode d'évaluation, l'objet d'évaluation, le type d'objet d'évaluation, l'état, l'heure de création et l'heure de mise à jour. Cliquez sur Create Task pour créer une tâche d'évaluation. Chaque tâche permet d'effectuer les opérations View Report, Stop et Delete. Vous pouvez également sélectionner plusieurs tâches d'évaluation de modèle unique pour effectuer une Comparison des résultats.

Résultats d'une tâche unique

Sur la page de la liste des tâches d'évaluation, cliquez sur View Report dans la colonne Actions correspondant à la tâche. La page des détails de la tâche s'ouvre et affiche les scores d'évaluation du modèle sur les jeux de données personnalisés et publics dans la section Evaluation report.

Résultats de l'évaluation par jeu de données personnalisé

  • Évaluation basée sur des règles :

    • Calcule la similarité entre la sortie du modèle et les réponses de référence à l'aide de méthodes standard de correspondance de texte NLP. Des valeurs plus élevées indiquent de meilleures performances du modèle.

    • Adapté à l'évaluation de l'adaptation d'un modèle à un domaine spécifique à l'aide de données propres à ce domaine.

    • Un graphique radar affiche les scores du modèle sur les 13 métriques ROUGE et BLEU. Pour les définitions des métriques, consultez l'Annexe : Référence des métriques.

  • Évaluation par modèle juge :

    • Utilise un LLM pour évaluer la qualité des sorties au niveau sémantique. Des valeurs moyennes et médianes plus élevées, associées à un écart-type plus faible, indiquent de meilleures performances du modèle. Cette approche est plus précise que la correspondance textuelle basée sur des règles.

    • Un tableau présente les métriques statistiques suivantes issues des scores du modèle juge :

      • Mean : score moyen attribué par le modèle juge (hors scores invalides), sur une échelle de 1 à 5. Des valeurs plus élevées indiquent de meilleures réponses.

      • Median : score médian attribué par le modèle juge (hors scores invalides), sur une échelle de 1 à 5. Des valeurs plus élevées indiquent de meilleures réponses.

      • Standard deviation : écart-type des scores du modèle juge (hors scores invalides). Lorsque la moyenne et la médiane sont égales, un écart-type plus faible indique une meilleure cohérence du modèle.

      • Skewness : asymétrie de la distribution des scores du modèle juge (hors scores invalides). Une asymétrie positive indique une queue plus longue à droite (extrémité des scores élevés) ; une asymétrie négative indique une queue plus longue à gauche (extrémité des scores faibles).

  • Les détails de l'évaluation question par question issus du fichier d'évaluation sont également affichés en bas de la page.

Le tableau Judge Evaluation Details en bas de la page contient les colonnes Question, Reference Answer, Model Answer, JudgeScore et JudgeReason. Vous pouvez cliquer sur le bouton Export dans le coin supérieur droit pour télécharger les données d'évaluation.

Résultats de l'évaluation par jeu de données public

Si la tâche d'évaluation a utilisé des jeux de données publics, un graphique radar affiche les scores du modèle sur ces jeux de données.

  • Le graphique de gauche présente les scores du modèle par domaine. Chaque domaine peut inclure plusieurs jeux de données. Pour les jeux de données appartenant au même domaine, les scores sont moyennés pour produire le score du domaine.

  • Le graphique de droite affiche les scores du modèle sur chaque jeu de données public individuel. Reportez-vous à la documentation officielle de chaque jeu de données pour connaître son périmètre d'évaluation.

Sous le graphique radar se trouve le tableau des résultats d'évaluation contenant les colonnes suivantes : Domain, Domain Score, Subdivision, Dataset Name, Language et Subdivision Score. Le bouton Export situé dans le coin supérieur droit du tableau vous permet d'exporter les données d'évaluation.

Comparer plusieurs tâches d'évaluation

Pour comparer les résultats de plusieurs modèles, sélectionnez les tâches d'évaluation sur le côté gauche de la page de la liste des tâches d'évaluation, puis cliquez sur Compare dans le coin supérieur droit.

Comparaison par jeu de données personnalisé

La page de comparaison des résultats d'évaluation contient les onglets Custom Dataset Evaluation Results et Public Dataset Evaluation Results. Dans les résultats d'évaluation par jeu de données personnalisé, le contenu suivant est affiché :

  • Judge Evaluation Results : un tableau comparant les métriques Mean, Median, StandardDeviation et Skewness entre les modèles.

  • General Metric Evaluation Results : un graphique radar comparant les performances des modèles sur les dimensions bleu-1 à bleu-4, ainsi que rouge-1/2/l f, p et r.

  • Tableau de données métriques détaillées listant les valeurs spécifiques pour chaque métrique ROUGE et BLEU par modèle, avec un bouton Export dans le coin inférieur droit.

Comparaison par jeu de données public

Sous l'onglet Public Dataset Evaluation Results, des graphiques radar et des tableaux de données comparent les résultats d'évaluation de qwen1,5-7b-chat et qwen1,5-1,8b-chat. Les graphiques radar montrent la répartition des scores par domaines (Multilingual, Reasoning, Safety) et par jeux de données (C-Eval, HellaSwag, TruthfulQA). qwen1,5-7b-chat surpasse qwen1,5-1,8b-chat sur toutes les dimensions. Scores par jeu de données :

  • qwen1,5-7b-chat : C-Eval 0,680, TruthfulQA 0,576, HellaSwag 0,772

  • qwen1,5-1,8b-chat : C-Eval 0,557, TruthfulQA 0,406, HellaSwag 0,601

Références

Vous pouvez également évaluer des modèles à l'aide du SDK Python PAI. Consultez les notebooks suivants :

Annexe : Référence des métriques

Cette annexe fournit des définitions détaillées pour chaque métrique utilisée dans l'évaluation basée sur des règles des jeux de données personnalisés.

Métriques ROUGE

Les métriques ROUGE mesurent la similarité entre les prédictions du modèle et les réponses de référence.

  • Les métriques ROUGE-N calculent le chevauchement des N-grammes (séquences consécutives de N mots). ROUGE-1 et ROUGE-2 sont les plus largement utilisées, mesurant respectivement le chevauchement des unigrammes (1-gramme) et des bigrammes (2-grammes).

  • ROUGE-L repose sur la plus longue sous-séquence commune (LCS).

  • Suffixes des métriques : -p (précision), -r (rappel), -f (score F).

Metric

Description

rouge-1-p

Proportion d'unigrammes dans le résumé système qui correspondent aux unigrammes du résumé de référence.

rouge-1-r

Proportion d'unigrammes dans le résumé de référence qui apparaissent dans le résumé système.

rouge-1-f

Moyenne harmonique de rouge-1-p et rouge-1-r.

rouge-2-p

Proportion de bigrammes dans le résumé système qui correspondent aux bigrammes du résumé de référence.

rouge-2-r

Proportion de bigrammes dans le résumé de référence qui apparaissent dans le résumé système.

rouge-2-f

Moyenne harmonique de rouge-2-p et rouge-2-r.

rouge-l-p

Rapport entre la longueur de la LCS et la longueur de la sortie système (précision).

rouge-l-r

Rapport entre la longueur de la LCS et la longueur de la réponse de référence (rappel).

rouge-l-f

Moyenne harmonique de rouge-l-p et rouge-l-r.

Métriques BLEU

Bilingual Evaluation Understudy (BLEU) est une métrique largement utilisée pour évaluer la qualité de la traduction automatique. Elle attribue un score en mesurant le chevauchement des N-grammes entre la sortie du modèle et les réponses de référence.

Metric

Description

bleu-1

Mesure le chevauchement des unigrammes.

bleu-2

Mesure le chevauchement des bigrammes.

bleu-3

Mesure le chevauchement des trigrammes (3-grammes).

bleu-4

Mesure le chevauchement des 4-grammes.