全部產品
Search
文件中心

Alibaba Cloud Model Studio:模型評測

更新時間:Aug 26, 2026

模型評測是百鍊 Model Studio 平台提供的模型品質評估工具,支援通過自訂評測維度量化評估大語言模型表現,協助您完成模型選型、調優驗證和能力對比。

什麼是模型評測

模型評測是百鍊 Model Studio 平台提供的模型品質驗證工具。通過自訂評測維度和評分方式,您可以量化評估大語言模型在特定業務情境下的表現,擷取可對比的評測結果。

image

使用情境

模型評測適用於以下情境:

  • 模型選型:在多個候選模型之間對比評分,選擇最適合業務需求的模型。
  • 調優驗證:對模型進行Prompt 調優或微調後,通過評測驗證效果是否提升。
  • 量化評估:將模型輸出品質轉化為可度量的評分指標,替代主觀判斷。
  • 持續監控:定期執行評測任務,跟蹤模型能力在版本迭代中的變化趨勢。

評分方式

模型評測支援 5 種評分方式,覆蓋自動評分和人工評分兩大類:

  • LLM 數值打分:由裁判模型按評分器 Prompt 給出數值評分(如 0-5 分),適用於需要精細量化的情境。
  • LLM 分類打分:由裁判模型按評分器 Prompt 將輸出歸入預定義分類(如 Pass/Fail),適用於二元或多標籤判定。
  • 字串匹配:將模型輸出與參考答案進行精確比較(相等、包含、開頭匹配、結尾匹配等),適用於有唯一標準答案的情境。
  • 文本相似性:使用演算法(ROUGE-L、BLEU、Cosine、Fuzzy、Accuracy)計算模型輸出與參考答案的相似程度,適用於文本產生品質評估。
  • 人工分類打分:由人工標註員對模型輸出進行分類判定,適用於自動評分難以覆蓋的主觀評估情境。

支援評測的模型包括千問系列商業模型、千問開源模型、通義法睿等,具體可用模型以控制台被評測模型下拉式清單為準。

5 種評分方式的概覽對比如下:

評分方式

評分來源

適用情境

成本

LLM 數值打分

裁判模型

語義理解、開放式評估

中等

LLM 分類打分

裁判模型

二元判定(安全性/正確性)

中等

字串匹配

規則

有唯一標準答案的情境

極低

文本相似性

演算法

翻譯、摘要品質評估

人工分類打分

人工標註員

創意性評估、主觀判斷

前提條件與限制

評測全流程為:建立評測維度準備評測資料建立評測任務查看評測結果

使用模型評測前,請確認以下條件:

模型評測僅支援通過控制台操作,不提供 API 或 SDK 調用方式。

重要

Qwen3 系列模型暫不支援以思考模式(Thinking Mode)進行評測。如需評測 Qwen3 模型,請關閉思考模式後再建立評測任務。

準備評測資料

評測資料是評測任務的輸入,決定了模型在哪些問題上被評估。百鍊支援兩種資料來源:評測資料集(提前準備的測試問題)和推理結果集(模型已產生的推理結果)。

資料格式說明

評測資料集包含以下欄位:

  • Prompt(必填):發送給被評測模型的輸入問題,每條資料必須包含此欄位。
  • Completion(可選):參考答案,供評分方式(如字串匹配、文本相似性)與模型輸出進行比對。
  • Output(僅推理結果集):模型已產生的輸出內容。使用推理結果集時,評測任務直接對 Output 評分,不再調用被評測模型。

資料集類型必須為评测集。訓練集類型的資料集無法用於評測任務,建立資料集時請在数据集类型中選擇评测集

警告建立資料集時,資料集類型必須選擇評測集。如果誤選為訓練集,該資料集將無法在評測任務中使用,且資料集類型建立後不可修改,需重新建立。

評測資料的欄位說明如下:

欄位

是否必填

說明

使用情境

Prompt

必填

發送給被評測模型的輸入問題

所有評測方式

Completion

可選

參考答案,用於與模型輸出比對

字串匹配、文本相似性

Output

僅推理結果集

模型已產生的輸出內容

複用已有推理結果時

資料量建議

資料量直接影響評測結果的可靠性,建議根據評測目標選擇合適的資料規模:

  • 快速驗證(50-100 條):適用於 Prompt 調優後的快速效果確認,可在較短時間內完成評測。
  • 標準評測(200-500 條):適用於模型選型和正式評測,覆蓋更多情境,結果更具代表性。
  • 深度評測(500 條以上):適用於對評測精度要求較高的情境,可全面覆蓋業務問題分布。

編寫 Prompt 時,建議覆蓋業務中的典型情境和邊界情況,避免集中在單一類型的問題上。每條 Prompt 應明確、具體,便於評估模型在實際使用中的表現。

建立資料集

按照以下步驟在控制台建立評測資料集:

  1. 登入百鍊控制台
  2. 在左側導覽列選擇数据管理 > 資料集管理
  3. 單擊创建数据集
  4. 填寫数据集名称,在数据集类型中選擇评测集
  5. 上傳資料檔案或手動添加資料條目,確保每條資料至少包含 Prompt 欄位。
  6. 單擊确定完成建立。
image

建立評測維度

評測維度定義了對模型輸出的評分標準。每個維度綁定一種評分方式,評測任務執行時按照維度配置對每條資料逐一評分。

重要評測維度評分方式在建立後不可更改。如需使用其他評分方式,請建立評測維度。

選擇評分方式

百鍊支援以下 5 種評分模式(詳見什麼是模型評測),各方式的關鍵參數如下:

LLM 數值打分:裁判模型依據評分器 Prompt 輸出數值評分。評分範圍預設 0-5(最小值 0,最大值可自訂),通過閾值預設 3.0(得分 ≥ 閾值視為通過)。裁判模型推薦選擇千問-Max(qwen-max),其評分穩定性和判別力較優。

LLM 分類打分:裁判模型依據評分器 Prompt 將輸出歸入預定義分類標籤。您需要配置至少兩個分類標籤(如 Pass 和 Fail),並指定哪些標籤視為"通過"。通過標籤與未通過標籤不可有交集。

說明配置分類標籤時,通過標籤與未通過標籤必須互斥。例如,Pass 和 Fail 不能同時被標記為通過標籤,否則系統將拒絕建立。

字串匹配:將模型輸出與 Completion 參考答案進行字串比較,不涉及裁判模型。支援的匹配規則包括:相等、不相等、包含、以...開頭、以...結尾。

文本相似性:使用演算法計算模型輸出與 Completion 參考答案的相似性得分,不涉及裁判模型。支援的演算法包括:ROUGE-L(召回導向)、BLEU(精確率導向)、Cosine(語義相似性)、Fuzzy(模糊比對)、Accuracy(精確匹配率)。

人工分類打分:評分由標註員人工完成而非裁判模型。參數配置與 LLM 分類打分類似,需定義分類標籤和通過標籤。

各評分方式的配置參數說明如下(部分參數僅在特定評分方式下顯示):

參數

說明

是否必填

取值說明

維度名稱

評測維度標識名稱

不超過 20 字元

維度描述

維度文字說明

不超過 100 字元

評分方式

決定如何評估模型輸出

5 種評分方式之一,建立後不可更改

裁判模型

對模型輸出進行評分的 LLM

LLM 打分時必選

推薦千問-Max(qwen-max)

評分器 Prompt

指導裁判模型評分的指令

LLM 打分時必填

支援變數 ${prompt}/${output}/${completion}

評分範圍

數值打分的分值區間

LLM 數值打分時必填

預設 0-5,最大值可自訂

通過閾值

得分大於等於閾值視為通過

LLM 數值打分時必填

預設 3.0,支援 0.1 步長

分類標籤

預定義的分類標籤

分類打分時必填

至少兩個標籤,通過與未通過不可重疊

相似性演算法

計算文本相似性的演算法

文本相似性時必選

ROUGE-L / BLEU / Cosine / Fuzzy / Accuracy

相似性閾值

相似性得分的及格線

文本相似性時必填

ROUGE-L 推薦 0.4-0.6,BLEU 推薦 0.3-0.5

標註指南

指導標註員評判的說明

人工分類時可選

自訂文字說明

配置評分器Prompt

LLM 數值打分和 LLM 分類打分方式需要配置評分器 Prompt,用於指導裁判模型如何評分。您可以選擇平台預置的 Prompt 模板,也可以編寫自訂 Prompt。

評分器 Prompt 支援以下三個變數,評測執行時自動替換為實際資料:

  • ${prompt}:當前資料條目的 Prompt 輸入內容。
  • ${output}:被評測模型對該 Prompt 產生的輸出內容。
  • ${completion}:該資料條目的 Completion 參考答案(如有)。

自訂 Prompt 時,需明確告知裁判模型評分維度判定標準、輸出格式和評分範圍,以獲得穩定的評分結果。更多 Prompt 編寫技巧請參見Prompt 最佳實務

建立維度操作步驟

  1. 登入百鍊控制台,在左側導覽列選擇模型评测 > 评测维度
  2. 單擊创建评测维度
  3. 填寫维度名称(不超過 20 字元)和维度描述(不超過 100 字元)。
  4. 評分方式中選擇一種評分方式,並配置對應參數。
  5. 如選擇 LLM 打分方式,在裁判模型中選擇模型(推薦千問-Max),並配置評分器 Prompt。
  6. 單擊确定完成建立。建立後評分方式不可更改,如需使用其他評分方式,請建立維度。
image

各評分方式的詳細配置參數和使用建議,請參見選擇評分方式

建立評測任務

評測任務將被評測模型、評測資料和評測維度組合在一起執行。任務執行時,平台將資料集中的每條 Prompt 發送給被評測模型擷取輸出,再按關聯的評測維度逐一評分。

配置評測任務參數

  1. 登入百鍊控制台,在左側導覽列選擇模型评测 > 评测任务
  2. 單擊创建评测任务
  3. 填寫任务名称(不超過 50 字元,預設名稱格式為"評測_目前時間")。
  4. 被評測模型中選擇一個或多個模型。下拉式清單中灰色顯示的模型表示當前不支援評測,無法選擇。
  5. 選擇数据来源:選擇评测数据集推理结果集,並關聯已建立的資料集(詳見準備評測資料)。
  6. 评测维度地區關聯一個或多個已建立的評測維度。如果清空已選維度,熱門排行榜關聯設定將同時自動清除。
  7. 如需設定 System Prompt,在對應地區填寫。單擊确定提交任務。

重要評測任務提交後,被評測模型不可更換。如需評測其他模型,請建立新的評測任務。

image

System Prompt與評分器Prompt

評測任務中涉及兩種 Prompt,作用對象不同:

  • System Prompt:在評測任務中配置,發送給被評測模型作為系統指令。用於設定被評測模型的角色、輸出格式或行為約束,影響模型的輸出結果。
  • 評分器Prompt:在評測維度中配置,發送給裁判模型作為評分依據。用於指導裁判模型如何對被評測模型的輸出進行評分,僅 LLM 打分方式使用。

兩者互不影響:System Prompt 控制"被評測模型輸出什麼",評分器 Prompt 控制"裁判模型如何評分"。

對比項

System Prompt

評分器 Prompt

配置位置

評測任務中配置

評測維度中配置

作用對象

被評測模型

裁判模型

用途

設定模型角色、輸出格式或行為約束

指導裁判模型如何對輸出評分

是否必填

可選

LLM 打分方式時必填

費用歸屬

計入被評測模型推理費用

計入裁判模型評分費用

熱門排行榜參與設定

建立評測任務時,可以設定該任務的結果是否參與熱門排行榜排名。開啟後,任務完成時評測結果將自動匯入熱門排行榜,與其他模型的評測結果進行對比展示。

排行榜頁面入口建立評測任務時,系統會自動填滿熱門排行榜關聯的評測維度和資料集,您只需選擇被評測模型即可提交任務。

查看評測結果

任務提交後,您可以在評測工作清單中跟蹤任務狀態並查看評測結果。

登入百鍊控制台,在左側導覽列選擇模型评测 > 评测任务

任務狀態

評測任務的狀態變化如下:

  • WAITING:任務已提交,等待執行。
  • RUNNING:任務正在執行中,平台正在調用模型並評分。
  • FINISH:任務執行完成,所有資料已評分,可查看結果。
  • FAILED:任務執行失敗,通常由模型調用異常或資料格式問題導致。
  • ABORTED:任務被手動終止。

各狀態下的可執行操作詳見管理評測資源

查看評測資料與統計

任務狀態為 FINISH 後,單擊任務名稱進入結果詳情頁,包含以下兩個 Tab:

  • 数据明细:逐條展示每條資料的 Prompt、模型輸出和各維度評分,便於定位模型在具體問題上的表現。
  • 指标统计:展示各評測維度綜合得分和通過率。數值型維度顯示平均分和通過率,分類型維度顯示各分類標籤的分布佔比圖。
image

結果下載與分析

僅狀態為FINISH的任務支援結果下載。在評測任務詳情頁,單擊下載結果可匯出完整評測資料。

分析評測結果時,建議關注以下方面:

  • 對比不同模型在同一維度上的得分差異,確定各模型的優勢領域。
  • 篩選低分資料條目,分析模型在哪些類型的問題上表現不佳。
  • 關注通過率指標:通過率反映模型在該維度上達到基準線的比例,是模型選型的核心參考。
  • 如同一模型多次評測,可對比不同時期的得分變化,追蹤模型調優效果。

使用熱門排行榜對比模型

熱門排行榜用於在相同評測維度下對比多個模型的表現,以排名形式直觀展示各模型的優劣。每個熱門排行榜綁定一組評測維度,將多個評測任務的結果匯聚到同一張排名表中,協助您快速完成模型選型決策。

建立熱門排行榜

  1. 登入百鍊控制台,在左側導覽列選擇模型评测 > 排行榜
  2. 單擊创建排行榜
  3. 填寫排行榜名称(不超過 50 字元)。
  4. 评测维度中選擇一個或多個已建立的評測維度。熱門排行榜建立後綁定的評測維度不可修改,請謹慎選擇。
  5. 單擊确定完成建立。

image

添加評測任務到熱門排行榜

熱門排行榜建立後,您可以通過兩種方式向熱門排行榜添加評測任務:

  • 從熱門排行榜建立新任務:在熱門排行榜詳情頁單擊创建评测任务,系統自動鎖定該熱門排行榜綁定的評測維度並關聯熱門排行榜,您只需選擇被評測模型和資料集。
  • 從已完成任務中選擇:在熱門排行榜詳情頁單擊添加评测任务,在彈出的列表中勾選狀態為 FINISH 且包含該熱門排行榜評測維度歷史任務。已綁定到當前熱門排行榜的任務複選框置灰,不可取消。

每個熱門排行榜最多添加 50 個評測任務。

熱門排行榜結果說明

熱門排行榜以表格形式展示所有已新增工作的排名結果,包含以下列:

  • 排名:按熱門排行榜得分從高到低排列,前三名分別以金色、銀色、銅色標識。
  • 任务名称:評測任務的名稱,單擊可跳轉到任務詳情。
  • 模型:該任務使用的被評測模型名稱。
  • 排行榜得分:取值範圍 0-100,由該任務在熱門排行榜綁定維度上的評分歸一化得出。評測中的任務得分顯示為虛線(-),待評測完成後自動更新。
  • [評測維度名稱]:顯示該任務在熱門排行榜綁定維度上的原始評分。
  • 操作:支援查看任務詳情或從熱門排行榜移除該任務。

熱門排行榜得分隨評測任務進度即時更新。當任務狀態變為 FINISH 後,排名將自動重新整理。

人工標註評測

人工標註評測適用於創意性評估、專業品質審核等需要主觀判斷的情境。當自動評分方式無法準確衡量模型輸出品質時,您可以建立包含人工分類打分維度評測任務,由標註員對模型輸出逐條進行人工判定。

登入百鍊控制台,在左側導覽列選擇模型评测 > 评测任务

標註模式

人工標註支援 3 種模式,適用於不同的評定目標:

單條標註

單條標註(base)模式對每條資料的模型輸出逐條評分,標註員為每條輸出選擇一個分類標籤。適用於需要對每條輸出獨立打分的情境,例如逐條檢查模型回答的準確性或安全性。

對比標註

對比標註(PK)模式將兩個模型對同一條 Prompt 的輸出並排展示,標註員對兩個輸出進行排序判定(如 A 優於 B)。適用於模型之間的直接對比選型,協助快速確定哪個模型在特定情境下表現更優。

應用標註

應用標註(app)模式在實際應用情境下評估模型輸出的品質,標註員結合業務上下文進行判定。適用於應用層級的端到端效果評估,重點關注模型輸出在實際商務程序中的可用性。

3 種標註模式的對比如下:

標註模式

說明

適用情境

單條標註(base)

對每條模型輸出逐條評分

需要對每條輸出獨立打分

對比標註(PK)

兩個模型輸出並排比較排序

模型之間直接對比選型

應用標註(app)

在應用情境下評估模型輸出

端到端效果評估

標註操作步驟

  1. 建立評測任務流程建立任務,關聯一個評分方式為人工分類打分的評測維度(詳見建立評測維度)。
  2. 任務建立後進入任務詳情頁,選擇评测数据 Tab。
  3. 在資料列表的操作列中,單擊标注按鈕,進入標註頁面。
  4. 查看模型輸出內容,根據判定標準為該條資料選擇分類標籤,單擊提交完成當前條目的標註。
  5. 逐條完成所有資料的標註。當所有資料標註完成後,任務狀態自動變為FINISH

image

標籤設計建議

標籤設計的品質直接影響標註結果的可靠性,建議遵循以下原則:

  • 標籤應覆蓋所有可能的模型輸出情況,避免標註員遇到無法歸類的輸出。
  • 使用簡潔明確的分類詞作為標籤名稱,降低標註員的理解成本。
  • 安排多名標註員對同一批資料交叉標註,檢驗標註一致性。如一致性偏低,需檢查標籤定義是否存在歧義並最佳化判定標準。

管理評測資源

評測任務、評測維度和熱門排行榜建立後,您可以在控制台對這些資源進行管理操作。部分操作無法復原,請謹慎執行。

登入百鍊控制台,在左側導覽列選擇模型评测

評測任務管理

模型评测 > 评测任务列表頁,您可以對評測任務執行以下操作:

  • 搜尋、篩選和排序:通過任務名稱搜尋,按狀態篩選,按建立時間排序,快速定位目標任務。這些操作僅影響列表展示,不改變任務資料。
  • 終止任務:僅狀態為RUNNING的任務支援終止。單擊终止後任務狀態變為ABORTED,此操作無法復原。
  • 刪除任務:狀態為FINISHFAILEDABORTED的任務支援刪除。刪除後任務資料和評測結果將永久清除,此操作無法復原。
  • 下載結果:僅狀態為FINISH的任務支援下載評測結果(詳見查看評測結果)。

各任務狀態下的可執行操作匯總如下:

任務狀態

可執行操作

無法復原提醒

WAITING

無(任務排隊中)

-

RUNNING

終止

終止後狀態變為 ABORTED,不可恢複

FINISH

查看結果、下載結果、刪除

刪除後資料永久清除

FAILED

刪除

刪除後資料永久清除

ABORTED

刪除

刪除後資料永久清除

評測維度管理

模型评测 > 评测维度列表頁,您可以編輯維度描述或刪除維度。

刪除評測維度時,如該維度已被熱門排行榜綁定,熱門排行榜中基於該維度評分資料將被清除。請在刪除前確認是否有熱門排行榜正在使用該維度。

熱門排行榜管理

模型评测 > 排行榜列表頁,您可以執行以下操作:

  • 刪除熱門排行榜:刪除熱門排行榜後,熱門排行榜資料將永久清除,但已添加到熱門排行榜的評測任務本身不受影響。
  • 移除任務:在熱門排行榜詳情頁,您可以將評測任務從熱門排行榜中移除。移除操作僅影響熱門排行榜展示,評測任務本身及其結果不會被刪除。

警告以下操作無法復原,執行前請確認:刪除評測任務將永久清除任務資料和評測結果;終止任務後無法恢複執行;刪除評測維度將同時清除熱門排行榜中基於該維度評分資料。

計費說明

模型評測產生的費用由兩部分構成:被評測模型的推理費用和裁判模型的評分費用。瞭解計費規則有助於您合理規劃評測規模和控製成本。

費用構成

被評測模型推理費用:按 token 計費,計算公式為cost = input_tokens x input_price + output_tokens x output_price。其中 input_tokens 包含 System Prompt 和每條資料的 Prompt,output_tokens 為模型產生的回答。各模型的具體單價以 Model Studio 控制台為準。

裁判模型評分費用:僅在使用LLM 數值打分LLM 分類打分評分方式時產生。裁判模型對每條資料進行評分時消耗的 token 按該裁判模型的定價計費,具體價格以 Model Studio 控制台為準。

使用字串匹配文本相似性評分方式時,評分過程不涉及裁判模型調用,因此不產生評分費用。

說明字串匹配和文本相似性評分方式不調用裁判模型,不產生評分費用,僅收取被評測模型的推理費用。對於有明確標準答案的評測情境,優先選擇這兩種方式可顯著降低評測成本。

對於獨立部署(經過微調並部署上線)的模型,評測時不額外收取推理費用,僅按已有的部署費用計算。

下表匯總了各評分方式的費用構成:

評分方式

被評測模型推理費用

裁判模型評分費用

費用構成

LLM 數值打分

按 token 計費

按 token 計費

推理 + 評分

LLM 分類打分

按 token 計費

按 token 計費

推理 + 評分

字串匹配

按 token 計費

僅推理

文本相似性

按 token 計費

僅推理

人工分類打分

按 token 計費

無(人工成本另計)

推理 + 人工

費用估算樣本

以下樣本展示使用 qwen-plus 模型對 100 條資料進行 LLM 數值打分評測的費用估算過程(單價為示意,請以控制台實際顯示為準):

  • 假設每條資料平均 input_tokens = 500、output_tokens = 200。
  • 被評測模型推理費用 = 100 x (500 x input_price + 200 x output_price)。
  • 裁判模型評分費用 = 100 x (裁判模型每次評分消耗的 token x 裁判模型單價)。
  • 總費用 = 被評測模型推理費用 + 裁判模型評分費用。

成本最佳化策略

  • 分階段評測:先用 50-100 條資料進行小規模驗證,確認評測維度和資料品質符合預期後,再擴大到完整資料集進行正式評測。
  • 規則評估優先:字串匹配和文本相似性不產生裁判模型費用,成本最低。對於有明確標準答案的情境,優先使用規則評估方式。
  • 儲存推理結果集複用:將模型推理結果儲存為推理結果集,後續評測可直接使用已有結果,免去重複調用模型推理的費用。

常見問題

評測結果不符合預期怎麼辦?

問題:評測任務完成後,模型評分與實際體驗存在明顯偏差,或評分結果不合理。

請依次檢查以下方面:

  • 檢查測試資料代表性:確認評測資料集是否覆蓋了業務中的典型情境和邊界情況,資料量過少或分布偏差會導致評分不具代表性。
  • 審查評分器 Prompt 清晰度:確認評分器 Prompt 是否明確描述了評分標準和判定依據,模糊的 Prompt 會導致裁判模型評分不穩定。
  • 調整評分範圍和閾值:過窄的評分範圍(如 0-2)可能導致評分區分度不足,適當擴大範圍(如 0-10)可提升評分精度。
  • 更換裁判模型:不同裁判模型的評分能力有差異,推薦使用千問-Max(qwen-max)擷取更穩定的評分結果。

評分過於集中怎麼辦?

問題:多條資料的評分集中在同一個分數或分類標籤上,缺少區分度。

評分過於集中通常由以下原因導致,請逐一排查:

  • 細化判定標準:在評分器 Prompt 中為每個分數檔添加明確的判定條件和樣本,使裁判模型能夠區分不同品質層次的輸出。
  • 增加資料多樣性:在評測資料集中加入邊界樣本和異常樣本,避免所有 Prompt 難度過於一致。
  • 更換裁判模型:推理能力更強的裁判模型(如千問-Max)能更好地遵循評分器 Prompt 中的細粒度判定標準。

不同評測維度結果相互矛盾怎麼理解?

問題:同一個模型在不同評測維度上的得分差異較大,甚至出現在一個維度上表現優秀、另一個維度上表現較差的情況。

這是正常現象。不同評測維度評估的是模型能力的不同方面(如準確性、流暢度、邏輯性),模型在不同能力方面的表現本身存在差異。建議根據業務優先順序對各維度評分進行加權決策,而非要求模型在所有維度上均表現最優。

模型頻繁輸出過時或無關內容怎麼辦?

問題:模型的輸出與參考答案無關,或包含過時資訊,導致評測得分偏低。

這通常表明模型的知識覆蓋不足或訓練資料存在滯後。建議考慮引入知識庫為模型補充領域知識,通過檢索增強產生(RAG)方式提升模型在特定領域的輸出品質。

使用評測時有哪些常見誤區?

問題:初次使用模型評測功能時,容易混淆概念或誤操作導致評測結果異常。

以下是常見誤區和正確做法:

  • System Prompt 不等於評分器 Prompt:System Prompt 在評測任務中配置,發送給被評測模型;評分器 Prompt 在評測維度中配置,發送給裁判模型(詳見建立評測任務)。兩者作用對象不同,請勿混淆。
  • Pass/Fail 等分類標籤不可重疊:在 LLM 分類打分或人工分類打分的維度中,通過標籤與未通過標籤必須互斥,同一個標籤不能同時屬於兩組。
  • 獨立部署模型不額外計費:經過微調並部署上線的模型在評測時不額外收取推理費用(詳見計費說明)。
  • 資料集類型限制:評測任務僅支援评测集類型的資料集。如果選擇了訓練集類型的資料集,系統會拒絕建立評測任務。