カスタムデータセットまたは MMLU や C-Eval などのパブリックベンチマークを使用して、大規模言語モデル (LLM) を評価し、モデルのパフォーマンスを定量化して比較します。
概要
モデル評価は、2 つの評価アプローチをサポートします。
-
カスタムデータセット評価
ルールベース評価:ROUGE および BLEU メトリックを使用して、モデルの予測と参照回答間の類似性を測定します。
ジャッジモデル評価:Token Service のジャッジモデルを使用して、モデルの出力を項目ごとにスコアリングします。このアプローチは、オープンエンドで複雑な質問応答シナリオに最適です。
-
パブリックデータセット評価
MMLU、TriviaQA、HellaSwag、GSM8K、C-Eval、TruthfulQA などの業界標準のパブリックデータセットに対してモデルを評価します。
業界の評価基準に準拠したベンチマークスコアを生成します。
サポート対象モデル:すべての HuggingFace AutoModelForCausalLM モデルタイプをサポートします。
ユースケース
モデル評価は、以下の目的で使用します。
モデルのベンチマーク:パブリックデータセットに対してモデルの汎用的な能力を評価し、その結果を業界のモデルやベースラインと比較します。
ドメイン固有の評価:特定のドメインでモデルをテストし、事前学習済みモデルとファインチューニング済みモデルのパフォーマンスを比較して、モデルがドメイン知識をどの程度適用できているかを評価します。
リグレッションテスト:リグレッションテストセットを構築して、実際のビジネスシナリオにおけるモデルのパフォーマンスを評価し、モデルが本番環境の基準を満たしているかどうかを判断します。
課金
OSS ストレージ料金:評価データセットと結果の保存に適用されます。詳細については、「OSS の課金」をご参照ください。
DLC 評価ジョブ料金:評価ジョブの実行に適用されます。詳細については、「DLC の課金」をご参照ください。
ジャッジモデル評価:料金については、「PAI Token Service の料金」をご参照ください。
データ準備
モデル評価は、カスタムデータセットと、C-Eval を含むパブリックデータセットの両方をサポートします。
-
パブリックデータセット:
PAI は、MMLU、TriviaQA、HellaSwag、GSM8K、C-Eval、TruthfulQA といったパブリックデータセットを提供します。現在のリストについては、コンソールをご確認ください。いずれかのデータセットを選択すると、直接使用できます。
-
カスタムデータセット:
JSONL 形式でカスタム評価ファイルを準備し、OSS にアップロードします。その後、カスタムデータセットを作成します。詳細については、「OSS ファイルのアップロード」および「データセットの作成と管理」をご参照ください。ファイル形式は次のとおりです。
質問列には
questionを、参照回答列にはanswerを使用します。これらの列マッピングは、評価ページで変更することもできます。ジャッジモデル評価のみが必要な場合、answer列は省略可能です。{"question": "Did ancient China invent papermaking?", "answer": "Yes"} {"question": "Did ancient China invent gunpowder?", "answer": "Yes"}サンプルファイル:eval.jsonl
モデルの評価
ステップ 1:モデルの選択
-
モデルギャラリーページに移動します。
PAI コンソールにログインします。
左側メニューで ワークスペース一覧 をクリックし、対象のワークスペースを選択します。
左側メニューで、クイックスタート > [Model Gallery] を選択します。
-
評価をサポートするモデルを見つけます。
モデルカタログ から評価可能なモデルをフィルタリングします。サポートされる操作 フィルターエリアで 評価 を選択すると、評価可能なモデルのみが表示されます。
ファインチューニング済みモデルを評価します。ファインチューニング済みモデルは評価機能を保持しています。モデルギャラリーページで、タスク管理 > トレーニングジョブ をクリックし、ジョブ名をクリックしてジョブ詳細ページを開きます。右上隅に 評価 ボタンが表示されます。
ステップ 2:評価タスクの設定
データセットの選択、ハイパーパラメータの設定、およびオプションでジャッジモデル評価を有効にすることで、評価タスクを設定します。
-
基本パラメータを設定します。
[タスク名]:自動生成される一意の名前です。
[結果出力パス]:評価結果を保存する OSS パスです。
[タグ]:多次元のリソース検索、一括操作、コスト配分に使用します。
-
評価方法を設定します。
-
[評価方式]:カスタムデータセットの評価 または パブリックデータセットの評価 を選択します。
-
[パブリックデータセットの評価]:
オープンソースのデータセット (数学やコーディングなど) を使用して、LLM の総合的な能力を評価します。スコアが高いほど、モデルのパフォーマンスが優れていることを示します。
複数のデータセットを同時に選択できます。GSM8K、TriviaQA、HellaSwag は大規模なデータセットであるため、評価に時間がかかる場合があります。
-
[カスタムデータセットの評価]:カスタムデータセットの質問列と参照回答列を指定します。ジャッジモデル評価のみが必要な場合、参照回答列は省略可能です。
[データセットのソース]:OSS ファイルの選択 または 既存のデータセットの選択 を選択します。
-
[評価メソッド]:以下の評価方法のいずれか、または両方を選択します。
[汎用 NLP 指標評価]:ROUGE および BLEU メトリックを使用して、モデルの予測と参照回答の間のテキストの類似性を計算します。明確な回答があるシナリオに適しています。データセットには、質問と回答のペアを含める必要があります。
[ジャッジモデルによる多指標評価]:ジャッジモデルを使用してモデルの回答を自動的にスコアリングし、カスタムメトリックをサポートします。複雑な回答やオープンエンドな回答に適しています。データセットには、質問のみ、または質問と回答のペアを含めることができます。
-
-
-
コンピューティングリソースを設定します。
[リソースタイプ]:サポートされるリソースタイプはモデルによって異なります。利用可能なオプションについては、コンソールをご参照ください。
[リソースのソース]:パブリックリソース、リソースクォータ、またはスポットリソースから選択します。
すべてのパラメータを設定した後、OK をクリックしてタスクを送信します。タスク詳細ページにリダイレクトされます。タスクが完了したら、評価レポート をクリックして評価レポートを表示します。
ステップ 3:評価結果の表示
タスクが完了したら、単一タスクの結果の表示、複数の評価タスクの比較、スコアの解釈方法について、以下の「評価結果の表示」をご参照ください。
評価結果の表示
評価タスクリスト
モデルギャラリーページで タスク管理 をクリックし、評価ジョブ タブに切り替えます。
評価タスクページには、タスク名、評価モード、評価オブジェクト、評価オブジェクトタイプ、ステータス、作成時刻、更新時刻を含むタスクリストが表示されます。[Create Task] をクリックして評価タスクを作成します。各タスクは レポートの表示、[Stop]、[Delete] の操作をサポートします。複数の単一モデル評価タスクを選択して、[Comparison] で結果を比較することもできます。
単一タスクの結果
評価タスクリストページで、対象タスクの [Actions] 列にある レポートの表示 をクリックします。タスク詳細ページが開き、[Evaluation report] セクションにカスタムデータセットとパブリックデータセットに対するモデルの評価スコアが表示されます。
カスタムデータセット評価の結果
-
ルールベース評価:
標準的な NLP テキストマッチング手法を使用して、モデルの出力と参照回答の間の類似性を計算します。値が高いほど、モデルのパフォーマンスが優れていることを示します。
ドメイン固有のデータを使用して、モデルが特定のドメインにどの程度適応しているかを評価するのに適しています。
レーダーチャートには、13 の ROUGE および BLEU メトリックにわたるモデルのスコアが表示されます。メトリックの定義については、「付録:メトリックリファレンス」をご参照ください。
-
ジャッジモデル評価:
LLM を使用して、セマンティックレベルで出力の品質を評価します。平均値と中央値が高く、標準偏差が低いほど、モデルのパフォーマンスが優れていることを示します。このアプローチは、ルールベースのテキストマッチングよりも正確です。
-
テーブルには、ジャッジモデルのスコアから得られる以下の統計メトリックが表示されます。
Mean:ジャッジモデルによって割り当てられた平均スコア (無効なスコアを除く) で、1〜5 のスケールです。値が高いほど、回答が優れていることを示します。
Median:ジャッジモデルによって割り当てられた中央値 (無効なスコアを除く) で、1〜5 のスケールです。値が高いほど、回答が優れていることを示します。
Standard deviation:ジャッジモデルのスコアの標準偏差 (無効なスコアを除く) です。平均値と中央値が等しい場合、標準偏差が低いほど、モデルの一貫性が高いことを示します。
Skewness:ジャッジモデルのスコア分布の歪度 (無効なスコアを除く) です。正の歪度は右側 (高スコア側) の裾が長いことを示し、負の歪度は左側 (低スコア側) の裾が長いことを示します。
評価ファイルからの質問ごとの評価詳細もページ下部に表示されます。
ページ下部にある [Judge Evaluation Details] テーブルには、[Question]、[Reference Answer]、[Model Answer]、[JudgeScore]、[JudgeReason] の列があります。右上隅の [Export] ボタンをクリックすると、評価データをダウンロードできます。
パブリックデータセット評価の結果
評価タスクでパブリックデータセットが使用された場合、レーダーチャートにそれらのデータセットに対するモデルのスコアが表示されます。
左側のチャートには、ドメイン別のモデルのスコアが表示されます。各ドメインには複数のデータセットが含まれる場合があります。同じドメイン内のデータセットについては、スコアを平均してドメインスコアを算出します。
右側のチャートには、個々のパブリックデータセットに対するモデルのスコアが表示されます。各データセットの評価範囲については、それぞれの公式ドキュメントをご参照ください。
レーダーチャートの下には、[Domain]、[Domain Score]、[Subdivision]、[Dataset Name]、[Language]、[Subdivision Score] の列を含む評価結果テーブルがあります。テーブルの右上隅にある [Export] ボタンをクリックすると、評価データをエクスポートできます。
複数評価タスクの比較
複数のモデルの結果を比較するには、評価タスクリストページの左側で評価タスクを選択し、右上隅の [Compare] をクリックします。
カスタムデータセットの比較
評価結果比較ページには、[Custom Dataset Evaluation Results] タブと [Public Dataset Evaluation Results] タブがあります。カスタムデータセット評価の結果には、以下の内容が表示されます。
ジャッジ評価結果:モデル間で Mean、Median、StandardDeviation、Skewness のメトリックを比較するテーブル。
一般メトリック評価結果:bleu-1 から bleu-4、rouge-1/2/l の f、p、r の各次元にわたるモデルのパフォーマンスを比較するレーダーチャート。
モデルごとの各 ROUGE および BLEU メトリックの具体的な値を示す詳細なメトリックデータテーブル。右下隅に [Export] ボタンがあります。
パブリックデータセットの比較
[Public Dataset Evaluation Results] タブには、[qwen1.5-7b-chat] と [qwen1.5-1.8b-chat] の評価結果を比較するレーダーチャートとデータテーブルが表示されます。レーダーチャートは、ドメイン (Multilingual、Reasoning、Safety) およびデータセット (C-Eval、HellaSwag、TruthfulQA) にわたるスコア分布を示します。qwen1.5-7b-chat は、すべての次元で qwen1.5-1.8b-chat を上回っています。データセットのスコア:
qwen1.5-7b-chat:C-Eval 0.680、TruthfulQA 0.576、HellaSwag 0.772
qwen1.5-1.8b-chat:C-Eval 0.557、TruthfulQA 0.406、HellaSwag 0.601
関連ドキュメント
PAI Python SDK を使用してモデルを評価することもできます。以下のノートブックをご参照ください。
付録:メトリックリファレンス
この付録では、カスタムデータセットのルールベース評価で使用する各メトリックの詳細な定義を説明します。
ROUGE メトリック
ROUGE メトリックは、モデルの予測と参照回答の間の類似性を測定します。
ROUGE-N メトリックは、N-gram (N 個の単語の連続したシーケンス) の重複を計算します。ROUGE-1 と ROUGE-2 は最も広く使用されており、それぞれユニグラム (1-gram) とバイグラム (2-gram) の重複を測定します。
ROUGE-L は、最長共通部分列 (LCS) に基づいています。
メトリックのサフィックス:-p (適合率)、-r (再現率)、-f (F値)。
|
メトリック |
説明 |
|
rouge-1-p |
システム要約内のユニグラムのうち、参照要約内のユニグラムと一致するものの割合。 |
|
rouge-1-r |
参照要約内のユニグラムのうち、システム要約内に出現するものの割合。 |
|
rouge-1-f |
rouge-1-p と rouge-1-r の調和平均。 |
|
rouge-2-p |
システム要約内のバイグラムのうち、参照要約内のバイグラムと一致するものの割合。 |
|
rouge-2-r |
参照要約内のバイグラムのうち、システム要約内に出現するものの割合。 |
|
rouge-2-f |
rouge-2-p と rouge-2-r の調和平均。 |
|
rouge-l-p |
LCS の長さとシステム出力の長さの比率 (適合率)。 |
|
rouge-l-r |
LCS の長さと参照回答の長さの比率 (再現率)。 |
|
rouge-l-f |
rouge-l-p と rouge-l-r の調和平均。 |
BLEU メトリック
Bilingual Evaluation Understudy (BLEU) は、機械翻訳の品質を評価するために広く使用されているメトリックです。モデルの出力と参照回答の間の N-gram の重複を測定することでスコアリングします。
|
メトリック |
説明 |
|
bleu-1 |
ユニグラムの重複を測定します。 |
|
bleu-2 |
バイグラムの重複を測定します。 |
|
bleu-3 |
トライグラム (3-gram) の重複を測定します。 |
|
bleu-4 |
4-gram の重複を測定します。 |