Model Gallery的模型評測功能支援使用自訂資料集和公開資料集(如MMLU、C-Eval等)評測大語言模型(LLM)的能力,協助您量化對比不同模型的表現。
功能概述
模型評測功能支援從兩個維度評測大語言模型:
自訂資料集評測
基於規則的評測:使用ROUGE和BLEU指標來衡量模型預測與標準答案之間的相似性。
裁判模型評測:使用Token服務提供的球證模型對模型輸出進行逐題評分,特別適用於開放式和複雜的問答情境。
公開資料集評測
在行業標準的公開資料集上評測模型(如MMLU、TriviaQA、HellaSwag、GSM8K、C-Eval、TruthfulQA)。
提供與行業評測標準一致的基準分數。
支援的模型:目前支援所有HuggingFace AutoModelForCausalLM模型類型。
使用情境
以下是模型評測的典型使用情境:
模型基準測試:使用公開資料集評測模型通用能力,與行業模型或基準進行比較。
特定領域能力評測:將模型應用於特定領域,比較預訓練模型和微調模型在不同領域的效能,評測模型應用領域知識的能力。
模型迴歸測試:構建迴歸測試集,評測模型在實際業務情境中的效能,確定模型是否符合生產標準。
計費說明
OSS儲存費用:用於儲存評測資料集和結果。請參見OSS計費說明。
DLC評測任務費用:用於運行評測任務。請參見DLC計費說明。
球證模型評測:參見PAI Token服務計費說明。
資料準備
模型評測功能支援基於自訂資料集和公開資料集(例如C-Eval)完成評測。
公開資料集:
目前PAI維護了MMLU、TriviaQA、HellaSwag、GSM8K、C-Eval、TruthfulQA等多個公開資料集,以頁面實際展示為準,可直接選擇使用。
自訂資料集:
需提供JSONL格式的自訂評測檔案,可自行上傳至OSS,並建立自訂資料集,詳情參見上傳OSS檔案和建立及管理資料集。檔案格式如下:
使用
question標識問題列,answer標識答案列,也可以在評測頁面選擇指定列。如果僅需要自訂資料集-球證模型評測,則answer列選填。{"question": "中國發明了造紙術,是否正確?", "answer": "正確"} {"question": "中國發明了火藥,是否正確?", "answer": "正確"}檔案樣本:eval.jsonl
工作流程
步驟一:選定模型
進入Model Gallery頁面。
登入PAI控制台。
在左側導覽列單擊工作空间列表,選擇並進入目標工作空間。
在左側導覽列選擇快速开始 > Model Gallery,進入Model Gallery頁面。
尋找可評測的模型。
從模型广场篩選可評測模型。在支持操作篩選區域選擇评测即可過濾出可評測的模型。
評測二次訓練的模型。對於支援評測的模型,其二次訓練後的模型也支援評測。在Model Gallery頁面單擊左上方任务管理 > 训练任务,單擊目標任務名稱任務詳情頁,右上方可看到评测按鈕。
步驟二:配置評測任務
支援選擇公開資料集或自訂資料集完成評測,支援設定超參數,支援球證模型評測,支援選擇多個公開資料集。
配置基礎參數:
任务名称:自動產生的唯一名稱。
结果输出路径:評測結果儲存的OSS路徑。
标签:用於對資源進行多維度尋找、定位、大量操作、分賬。
配置評測方式:
评测方式:支援自定义数据集评测或公开数据集评测。
公开数据集评测:
使用涵蓋各個領域(如數學、編碼)的開源評測資料集,為LLM提供全面的能力評測,分數越高表示模型效能越好。
可同時選擇多個。其中GSM8K、TriviaQA、HellaSwag資料集較大,任務所需時間預計較長。
自定义数据集评测:自訂資料集支援指定問題和參考答案列,其中如果僅需要球證模型評測,則參考答案列可空。
数据集来源:支援选择OSS文件和选择现有数据集。
评测方法:可同時選擇如下兩種方法。
通用NLP指标评测:計算模型預測結果與參考答案的文本相似性,包括ROUGE、BLEU等指標。適用於有確定答案的情境,資料集需提供【問題-答案】對。
基于裁判员模型的多指标评测:使用球證模型對模型答案進行自動評分,支援自訂指標。適用於複雜答案或答案不唯一的情境,資料集可只提供【問題】,也可提供【問題-答案】對。
配置運行資源:
资源类型:不同模型支援的資源類型不一樣,請以頁面展示為準。
资源来源:可選擇公用資源、資源配額或者競價資源。
參數配置完成後,單擊确定提交任務,頁面將自動跳轉到任務詳情頁面。等待任務執行成功,單擊评测报告,即可查看評測報告。

步驟三:查看評測結果
任務完成後,參見下文查看評測結果,瞭解如何查看單任務結果、對比多個評測任務,以及如何解讀各項得分。
查看評測結果
評測工作清單
在Model Gallery頁面,單擊任务管理,然後切換到评测任务標籤頁。

單任務結果
在評測工作清單頁,單擊目標評測任務操作列下的查看报告,即可進入評測任務詳情頁,在詳情頁評測報告一欄會展示模型在自訂資料集和公開資料集上的評測得分。
自訂資料集評測結果頁面
通用指標評測:
使用標準NLP文本匹配方法,計算模型輸出與標準答案之間的相似性,數值越高表示模型效能越好。
適用於使用特定領域資料評測模型對特定情境的適配度。
通過雷達圖展示該模型在ROUGE和BLEU系列指標(共13個)上的得分。各指標含義詳見附錄:評測指標說明。
球證模型評測:
利用大語言模型的優勢在語義層面評測輸出品質。均值和中位元越高,標準差越低,表示模型效能越好。與簡單的文本匹配相比,能更準確地評測輸出品質。
通過列表展示球證模型評分的統計指標:
Mean:表示球證大模型對模型產生結果打分的平均值(不含無效打分),最低值1,最大值5,越大表示模型回答越好。
Median:表示球證大模型對模型產生結果打分的中位元(不含無效打分),最低值1,最大值5,越大表示模型回答越好。
StandardDeviation:表示球證大模型對模型產生結果打分的標準差(不含無效打分),在均值和中位元相同情況下,標準差越小,模型越好。
Skewness:表示球證大模型打分結果的分布偏度(不含無效打分),正偏度表示分布右側(高分段)有較長尾部;負偏度則表示左側(低分段)有較長尾部。
此外還會在頁面底部展示評測檔案中每條資料的評測詳情。

公開資料集評測結果頁面
如果評測任務選擇了公開資料集,則在雷達圖展示該模型在公開資料集上的得分。
左側圖片展示了模型在不同領域的得分情況。每個領域可能會有多個與之相關的資料集,對屬於同一領域的資料集,我們會把模型在這些資料集上的評測得分取均值,作為領域得分。
右側圖片展示模型在各個公開資料集的得分情況。每個公開資料集的評測範圍見資料集官方介紹。

多評測任務對比
當需要對比多個模型的評測結果時,可以將它們在彙總在一個頁面上展示,以便於比較效果。具體操作為在評測工作清單頁左側選擇想要對比的模型評測任務,右上方點擊對比,進入對比頁面:

自訂資料集對比結果

公開資料集對比結果

相關文檔
除了控制台頁面,也可以通過PAI Python SDK使用模型評測功能,詳情參考如下NoteBook:
附錄:評測指標說明
本附錄提供自訂資料集通用指標評測中各指標的詳細定義。
ROUGE 指標
ROUGE系列指標衡量模型預測與標準答案的相似性。
rouge-n類指標計算N-gram(連續的N個詞)的重疊度。其中rouge-1和rouge-2是最常用的,分別是unigram(1-gram)和bigram(2-gram)的重疊度。
rouge-l指標基於最長公用子序列(LCS)。
各指標尾碼:-p(精確率)、-r(召回率)、-f(F-score)。
指標 | 說明 |
rouge-1-p | 系統摘要中的unigram與參考摘要中的unigram匹配的比例。 |
rouge-1-r | 參考摘要中的unigram在系統摘要中出現的比例。 |
rouge-1-f | rouge-1-p和rouge-1-r的調和平均數。 |
rouge-2-p | 系統摘要中的bigram與參考摘要中的bigram匹配的比例。 |
rouge-2-r | 參考摘要中的bigram在系統摘要中出現的比例。 |
rouge-2-f | rouge-2-p和rouge-2-r的調和平均數。 |
rouge-l-p | LCS長度與系統輸出長度之比(精確率)。 |
rouge-l-r | LCS長度與參考答案長度之比(召回率)。 |
rouge-l-f | rouge-l-p和rouge-l-r的調和平均數。 |
BLEU 指標
BLEU(Bilingual Evaluation Understudy)是一種流行的評測機器翻譯品質的指標,通過測量模型輸出與參考答案之間的N-gram重疊度來評分。
指標 | 含義 |
bleu-1 | 考察unigram的匹配。 |
bleu-2 | 考察bigram的匹配。 |
bleu-3 | 考察trigram(連續三個詞)的匹配。 |
bleu-4 | 考察4-gram的匹配。 |