模型評測是百鍊 Model Studio 平台提供的模型品質評估工具,支援通過自訂評測維度量化評估大語言模型表現,協助您完成模型選型、調優驗證和能力對比。
什麼是模型評測
模型評測是百鍊 Model Studio 平台提供的模型品質驗證工具。通過自訂評測維度和評分方式,您可以量化評估大語言模型在特定業務情境下的表現,擷取可對比的評測結果。
使用情境
模型評測適用於以下情境:
- 模型選型:在多個候選模型之間對比評分,選擇最適合業務需求的模型。
- 調優驗證:對模型進行Prompt 調優或微調後,通過評測驗證效果是否提升。
- 量化評估:將模型輸出品質轉化為可度量的評分指標,替代主觀判斷。
- 持續監控:定期執行評測任務,跟蹤模型能力在版本迭代中的變化趨勢。
評分方式
模型評測支援 5 種評分方式,覆蓋自動評分和人工評分兩大類:
- LLM 數值打分:由裁判模型按評分器 Prompt 給出數值評分(如 0-5 分),適用於需要精細量化的情境。
- LLM 分類打分:由裁判模型按評分器 Prompt 將輸出歸入預定義分類(如 Pass/Fail),適用於二元或多標籤判定。
- 字串匹配:將模型輸出與參考答案進行精確比較(相等、包含、開頭匹配、結尾匹配等),適用於有唯一標準答案的情境。
- 文本相似性:使用演算法(ROUGE-L、BLEU、Cosine、Fuzzy、Accuracy)計算模型輸出與參考答案的相似程度,適用於文本產生品質評估。
- 人工分類打分:由人工標註員對模型輸出進行分類判定,適用於自動評分難以覆蓋的主觀評估情境。
支援評測的模型包括千問系列商業模型、千問開源模型、通義法睿等,具體可用模型以控制台被評測模型下拉式清單為準。
5 種評分方式的概覽對比如下:
評分方式 | 評分來源 | 適用情境 | 成本 |
|---|---|---|---|
LLM 數值打分 | 裁判模型 | 語義理解、開放式評估 | 中等 |
LLM 分類打分 | 裁判模型 | 二元判定(安全性/正確性) | 中等 |
字串匹配 | 規則 | 有唯一標準答案的情境 | 極低 |
文本相似性 | 演算法 | 翻譯、摘要品質評估 | 低 |
人工分類打分 | 人工標註員 | 創意性評估、主觀判斷 | 高 |
前提條件與限制
評測全流程為:建立評測維度 → 準備評測資料 → 建立評測任務 → 查看評測結果。
使用模型評測前,請確認以下條件:
- 登入阿里雲帳號並完成實名認證。
- 已開通百鍊 Model Studio 服務。開通地址:https://modelstudio.console.alibabacloud.com。
- 如使用 RAM 使用者操作,需主帳號授予相應許可權。
模型評測僅支援通過控制台操作,不提供 API 或 SDK 調用方式。
重要
Qwen3 系列模型暫不支援以思考模式(Thinking Mode)進行評測。如需評測 Qwen3 模型,請關閉思考模式後再建立評測任務。
準備評測資料
評測資料是評測任務的輸入,決定了模型在哪些問題上被評估。百鍊支援兩種資料來源:評測資料集(提前準備的測試問題)和推理結果集(模型已產生的推理結果)。
資料格式說明
評測資料集包含以下欄位:
- Prompt(必填):發送給被評測模型的輸入問題,每條資料必須包含此欄位。
- Completion(可選):參考答案,供評分方式(如字串匹配、文本相似性)與模型輸出進行比對。
- Output(僅推理結果集):模型已產生的輸出內容。使用推理結果集時,評測任務直接對 Output 評分,不再調用被評測模型。
資料集類型必須為评测集。訓練集類型的資料集無法用於評測任務,建立資料集時請在数据集类型中選擇评测集。
警告建立資料集時,資料集類型必須選擇評測集。如果誤選為訓練集,該資料集將無法在評測任務中使用,且資料集類型建立後不可修改,需重新建立。
評測資料的欄位說明如下:
欄位 | 是否必填 | 說明 | 使用情境 |
|---|---|---|---|
Prompt | 必填 | 發送給被評測模型的輸入問題 | 所有評測方式 |
Completion | 可選 | 參考答案,用於與模型輸出比對 | 字串匹配、文本相似性 |
Output | 僅推理結果集 | 模型已產生的輸出內容 | 複用已有推理結果時 |
資料量建議
資料量直接影響評測結果的可靠性,建議根據評測目標選擇合適的資料規模:
- 快速驗證(50-100 條):適用於 Prompt 調優後的快速效果確認,可在較短時間內完成評測。
- 標準評測(200-500 條):適用於模型選型和正式評測,覆蓋更多情境,結果更具代表性。
- 深度評測(500 條以上):適用於對評測精度要求較高的情境,可全面覆蓋業務問題分布。
編寫 Prompt 時,建議覆蓋業務中的典型情境和邊界情況,避免集中在單一類型的問題上。每條 Prompt 應明確、具體,便於評估模型在實際使用中的表現。
建立資料集
按照以下步驟在控制台建立評測資料集:
- 登入百鍊控制台。
- 在左側導覽列選擇数据管理 > 資料集管理。
- 單擊创建数据集。
- 填寫数据集名称,在数据集类型中選擇评测集。
- 上傳資料檔案或手動添加資料條目,確保每條資料至少包含 Prompt 欄位。
- 單擊确定完成建立。
建立評測維度
評測維度定義了對模型輸出的評分標準。每個維度綁定一種評分方式,評測任務執行時按照維度配置對每條資料逐一評分。
重要評測維度評分方式在建立後不可更改。如需使用其他評分方式,請建立評測維度。
選擇評分方式
百鍊支援以下 5 種評分模式(詳見什麼是模型評測),各方式的關鍵參數如下:
LLM 數值打分:裁判模型依據評分器 Prompt 輸出數值評分。評分範圍預設 0-5(最小值 0,最大值可自訂),通過閾值預設 3.0(得分 ≥ 閾值視為通過)。裁判模型推薦選擇千問-Max(qwen-max),其評分穩定性和判別力較優。
LLM 分類打分:裁判模型依據評分器 Prompt 將輸出歸入預定義分類標籤。您需要配置至少兩個分類標籤(如 Pass 和 Fail),並指定哪些標籤視為"通過"。通過標籤與未通過標籤不可有交集。
說明配置分類標籤時,通過標籤與未通過標籤必須互斥。例如,Pass 和 Fail 不能同時被標記為通過標籤,否則系統將拒絕建立。
字串匹配:將模型輸出與 Completion 參考答案進行字串比較,不涉及裁判模型。支援的匹配規則包括:相等、不相等、包含、以...開頭、以...結尾。
文本相似性:使用演算法計算模型輸出與 Completion 參考答案的相似性得分,不涉及裁判模型。支援的演算法包括:ROUGE-L(召回導向)、BLEU(精確率導向)、Cosine(語義相似性)、Fuzzy(模糊比對)、Accuracy(精確匹配率)。
人工分類打分:評分由標註員人工完成而非裁判模型。參數配置與 LLM 分類打分類似,需定義分類標籤和通過標籤。
各評分方式的配置參數說明如下(部分參數僅在特定評分方式下顯示):
參數 | 說明 | 是否必填 | 取值說明 |
|---|---|---|---|
維度名稱 | 評測維度標識名稱 | 是 | 不超過 20 字元 |
維度描述 | 維度文字說明 | 是 | 不超過 100 字元 |
評分方式 | 決定如何評估模型輸出 | 是 | 5 種評分方式之一,建立後不可更改 |
裁判模型 | 對模型輸出進行評分的 LLM | LLM 打分時必選 | 推薦千問-Max(qwen-max) |
評分器 Prompt | 指導裁判模型評分的指令 | LLM 打分時必填 | 支援變數 ${prompt}/${output}/${completion} |
評分範圍 | 數值打分的分值區間 | LLM 數值打分時必填 | 預設 0-5,最大值可自訂 |
通過閾值 | 得分大於等於閾值視為通過 | LLM 數值打分時必填 | 預設 3.0,支援 0.1 步長 |
分類標籤 | 預定義的分類標籤 | 分類打分時必填 | 至少兩個標籤,通過與未通過不可重疊 |
相似性演算法 | 計算文本相似性的演算法 | 文本相似性時必選 | ROUGE-L / BLEU / Cosine / Fuzzy / Accuracy |
相似性閾值 | 相似性得分的及格線 | 文本相似性時必填 | ROUGE-L 推薦 0.4-0.6,BLEU 推薦 0.3-0.5 |
標註指南 | 指導標註員評判的說明 | 人工分類時可選 | 自訂文字說明 |
配置評分器Prompt
LLM 數值打分和 LLM 分類打分方式需要配置評分器 Prompt,用於指導裁判模型如何評分。您可以選擇平台預置的 Prompt 模板,也可以編寫自訂 Prompt。
評分器 Prompt 支援以下三個變數,評測執行時自動替換為實際資料:
${prompt}:當前資料條目的 Prompt 輸入內容。${output}:被評測模型對該 Prompt 產生的輸出內容。${completion}:該資料條目的 Completion 參考答案(如有)。
自訂 Prompt 時,需明確告知裁判模型評分維度判定標準、輸出格式和評分範圍,以獲得穩定的評分結果。更多 Prompt 編寫技巧請參見Prompt 最佳實務。
建立維度操作步驟
- 登入百鍊控制台,在左側導覽列選擇模型评测 > 评测维度。
- 單擊创建评测维度。
- 填寫维度名称(不超過 20 字元)和维度描述(不超過 100 字元)。
- 在評分方式中選擇一種評分方式,並配置對應參數。
- 如選擇 LLM 打分方式,在裁判模型中選擇模型(推薦千問-Max),並配置評分器 Prompt。
- 單擊确定完成建立。建立後評分方式不可更改,如需使用其他評分方式,請建立維度。
各評分方式的詳細配置參數和使用建議,請參見選擇評分方式。
建立評測任務
評測任務將被評測模型、評測資料和評測維度組合在一起執行。任務執行時,平台將資料集中的每條 Prompt 發送給被評測模型擷取輸出,再按關聯的評測維度逐一評分。
配置評測任務參數
- 登入百鍊控制台,在左側導覽列選擇模型评测 > 评测任务。
- 單擊创建评测任务。
- 填寫任务名称(不超過 50 字元,預設名稱格式為"評測_目前時間")。
- 在被評測模型中選擇一個或多個模型。下拉式清單中灰色顯示的模型表示當前不支援評測,無法選擇。
- 選擇数据来源:選擇评测数据集或推理结果集,並關聯已建立的資料集(詳見準備評測資料)。
- 在评测维度地區關聯一個或多個已建立的評測維度。如果清空已選維度,熱門排行榜關聯設定將同時自動清除。
- 如需設定 System Prompt,在對應地區填寫。單擊确定提交任務。
重要評測任務提交後,被評測模型不可更換。如需評測其他模型,請建立新的評測任務。
System Prompt與評分器Prompt
評測任務中涉及兩種 Prompt,作用對象不同:
- System Prompt:在評測任務中配置,發送給被評測模型作為系統指令。用於設定被評測模型的角色、輸出格式或行為約束,影響模型的輸出結果。
- 評分器Prompt:在評測維度中配置,發送給裁判模型作為評分依據。用於指導裁判模型如何對被評測模型的輸出進行評分,僅 LLM 打分方式使用。
兩者互不影響:System Prompt 控制"被評測模型輸出什麼",評分器 Prompt 控制"裁判模型如何評分"。
對比項 | System Prompt | 評分器 Prompt |
|---|---|---|
配置位置 | 評測任務中配置 | 評測維度中配置 |
作用對象 | 被評測模型 | 裁判模型 |
用途 | 設定模型角色、輸出格式或行為約束 | 指導裁判模型如何對輸出評分 |
是否必填 | 可選 | LLM 打分方式時必填 |
費用歸屬 | 計入被評測模型推理費用 | 計入裁判模型評分費用 |
熱門排行榜參與設定
建立評測任務時,可以設定該任務的結果是否參與熱門排行榜排名。開啟後,任務完成時評測結果將自動匯入熱門排行榜,與其他模型的評測結果進行對比展示。
從排行榜頁面入口建立評測任務時,系統會自動填滿熱門排行榜關聯的評測維度和資料集,您只需選擇被評測模型即可提交任務。
查看評測結果
任務提交後,您可以在評測工作清單中跟蹤任務狀態並查看評測結果。
登入百鍊控制台,在左側導覽列選擇模型评测 > 评测任务。
任務狀態
評測任務的狀態變化如下:
- WAITING:任務已提交,等待執行。
- RUNNING:任務正在執行中,平台正在調用模型並評分。
- FINISH:任務執行完成,所有資料已評分,可查看結果。
- FAILED:任務執行失敗,通常由模型調用異常或資料格式問題導致。
- ABORTED:任務被手動終止。
各狀態下的可執行操作詳見管理評測資源。
查看評測資料與統計
任務狀態為 FINISH 後,單擊任務名稱進入結果詳情頁,包含以下兩個 Tab:
- 数据明细:逐條展示每條資料的 Prompt、模型輸出和各維度評分,便於定位模型在具體問題上的表現。
- 指标统计:展示各評測維度綜合得分和通過率。數值型維度顯示平均分和通過率,分類型維度顯示各分類標籤的分布佔比圖。
結果下載與分析
僅狀態為FINISH的任務支援結果下載。在評測任務詳情頁,單擊下載結果可匯出完整評測資料。
分析評測結果時,建議關注以下方面:
- 對比不同模型在同一維度上的得分差異,確定各模型的優勢領域。
- 篩選低分資料條目,分析模型在哪些類型的問題上表現不佳。
- 關注通過率指標:通過率反映模型在該維度上達到基準線的比例,是模型選型的核心參考。
- 如同一模型多次評測,可對比不同時期的得分變化,追蹤模型調優效果。
使用熱門排行榜對比模型
熱門排行榜用於在相同評測維度下對比多個模型的表現,以排名形式直觀展示各模型的優劣。每個熱門排行榜綁定一組評測維度,將多個評測任務的結果匯聚到同一張排名表中,協助您快速完成模型選型決策。
建立熱門排行榜
- 登入百鍊控制台,在左側導覽列選擇模型评测 > 排行榜。
- 單擊创建排行榜。
- 填寫排行榜名称(不超過 50 字元)。
- 在评测维度中選擇一個或多個已建立的評測維度。熱門排行榜建立後綁定的評測維度不可修改,請謹慎選擇。
- 單擊确定完成建立。

添加評測任務到熱門排行榜
熱門排行榜建立後,您可以通過兩種方式向熱門排行榜添加評測任務:
- 從熱門排行榜建立新任務:在熱門排行榜詳情頁單擊创建评测任务,系統自動鎖定該熱門排行榜綁定的評測維度並關聯熱門排行榜,您只需選擇被評測模型和資料集。
- 從已完成任務中選擇:在熱門排行榜詳情頁單擊添加评测任务,在彈出的列表中勾選狀態為 FINISH 且包含該熱門排行榜評測維度歷史任務。已綁定到當前熱門排行榜的任務複選框置灰,不可取消。
每個熱門排行榜最多添加 50 個評測任務。
熱門排行榜結果說明
熱門排行榜以表格形式展示所有已新增工作的排名結果,包含以下列:
- 排名:按熱門排行榜得分從高到低排列,前三名分別以金色、銀色、銅色標識。
- 任务名称:評測任務的名稱,單擊可跳轉到任務詳情。
- 模型:該任務使用的被評測模型名稱。
- 排行榜得分:取值範圍 0-100,由該任務在熱門排行榜綁定維度上的評分歸一化得出。評測中的任務得分顯示為虛線(-),待評測完成後自動更新。
- [評測維度名稱]:顯示該任務在熱門排行榜綁定維度上的原始評分。
- 操作:支援查看任務詳情或從熱門排行榜移除該任務。
熱門排行榜得分隨評測任務進度即時更新。當任務狀態變為 FINISH 後,排名將自動重新整理。
人工標註評測
人工標註評測適用於創意性評估、專業品質審核等需要主觀判斷的情境。當自動評分方式無法準確衡量模型輸出品質時,您可以建立包含人工分類打分維度評測任務,由標註員對模型輸出逐條進行人工判定。
登入百鍊控制台,在左側導覽列選擇模型评测 > 评测任务。
標註模式
人工標註支援 3 種模式,適用於不同的評定目標:
單條標註
單條標註(base)模式對每條資料的模型輸出逐條評分,標註員為每條輸出選擇一個分類標籤。適用於需要對每條輸出獨立打分的情境,例如逐條檢查模型回答的準確性或安全性。
對比標註
對比標註(PK)模式將兩個模型對同一條 Prompt 的輸出並排展示,標註員對兩個輸出進行排序判定(如 A 優於 B)。適用於模型之間的直接對比選型,協助快速確定哪個模型在特定情境下表現更優。
應用標註
應用標註(app)模式在實際應用情境下評估模型輸出的品質,標註員結合業務上下文進行判定。適用於應用層級的端到端效果評估,重點關注模型輸出在實際商務程序中的可用性。
3 種標註模式的對比如下:
標註模式 | 說明 | 適用情境 |
|---|---|---|
單條標註(base) | 對每條模型輸出逐條評分 | 需要對每條輸出獨立打分 |
對比標註(PK) | 兩個模型輸出並排比較排序 | 模型之間直接對比選型 |
應用標註(app) | 在應用情境下評估模型輸出 | 端到端效果評估 |
標註操作步驟
- 按建立評測任務流程建立任務,關聯一個評分方式為人工分類打分的評測維度(詳見建立評測維度)。
- 任務建立後進入任務詳情頁,選擇评测数据 Tab。
- 在資料列表的操作列中,單擊标注按鈕,進入標註頁面。
- 查看模型輸出內容,根據判定標準為該條資料選擇分類標籤,單擊提交完成當前條目的標註。
- 逐條完成所有資料的標註。當所有資料標註完成後,任務狀態自動變為FINISH。

標籤設計建議
標籤設計的品質直接影響標註結果的可靠性,建議遵循以下原則:
- 標籤應覆蓋所有可能的模型輸出情況,避免標註員遇到無法歸類的輸出。
- 使用簡潔明確的分類詞作為標籤名稱,降低標註員的理解成本。
- 安排多名標註員對同一批資料交叉標註,檢驗標註一致性。如一致性偏低,需檢查標籤定義是否存在歧義並最佳化判定標準。
管理評測資源
評測任務、評測維度和熱門排行榜建立後,您可以在控制台對這些資源進行管理操作。部分操作無法復原,請謹慎執行。
登入百鍊控制台,在左側導覽列選擇模型评测。
評測任務管理
在模型评测 > 评测任务列表頁,您可以對評測任務執行以下操作:
- 搜尋、篩選和排序:通過任務名稱搜尋,按狀態篩選,按建立時間排序,快速定位目標任務。這些操作僅影響列表展示,不改變任務資料。
- 終止任務:僅狀態為RUNNING的任務支援終止。單擊终止後任務狀態變為ABORTED,此操作無法復原。
- 刪除任務:狀態為FINISH、FAILED或ABORTED的任務支援刪除。刪除後任務資料和評測結果將永久清除,此操作無法復原。
- 下載結果:僅狀態為FINISH的任務支援下載評測結果(詳見查看評測結果)。
各任務狀態下的可執行操作匯總如下:
任務狀態 | 可執行操作 | 無法復原提醒 |
|---|---|---|
WAITING | 無(任務排隊中) | - |
RUNNING | 終止 | 終止後狀態變為 ABORTED,不可恢複 |
FINISH | 查看結果、下載結果、刪除 | 刪除後資料永久清除 |
FAILED | 刪除 | 刪除後資料永久清除 |
ABORTED | 刪除 | 刪除後資料永久清除 |
評測維度管理
在模型评测 > 评测维度列表頁,您可以編輯維度描述或刪除維度。
刪除評測維度時,如該維度已被熱門排行榜綁定,熱門排行榜中基於該維度評分資料將被清除。請在刪除前確認是否有熱門排行榜正在使用該維度。
熱門排行榜管理
在模型评测 > 排行榜列表頁,您可以執行以下操作:
- 刪除熱門排行榜:刪除熱門排行榜後,熱門排行榜資料將永久清除,但已添加到熱門排行榜的評測任務本身不受影響。
- 移除任務:在熱門排行榜詳情頁,您可以將評測任務從熱門排行榜中移除。移除操作僅影響熱門排行榜展示,評測任務本身及其結果不會被刪除。
警告以下操作無法復原,執行前請確認:刪除評測任務將永久清除任務資料和評測結果;終止任務後無法恢複執行;刪除評測維度將同時清除熱門排行榜中基於該維度評分資料。
計費說明
模型評測產生的費用由兩部分構成:被評測模型的推理費用和裁判模型的評分費用。瞭解計費規則有助於您合理規劃評測規模和控製成本。
費用構成
被評測模型推理費用:按 token 計費,計算公式為cost = input_tokens x input_price + output_tokens x output_price。其中 input_tokens 包含 System Prompt 和每條資料的 Prompt,output_tokens 為模型產生的回答。各模型的具體單價以 Model Studio 控制台為準。
裁判模型評分費用:僅在使用LLM 數值打分或LLM 分類打分評分方式時產生。裁判模型對每條資料進行評分時消耗的 token 按該裁判模型的定價計費,具體價格以 Model Studio 控制台為準。
使用字串匹配或文本相似性評分方式時,評分過程不涉及裁判模型調用,因此不產生評分費用。
說明字串匹配和文本相似性評分方式不調用裁判模型,不產生評分費用,僅收取被評測模型的推理費用。對於有明確標準答案的評測情境,優先選擇這兩種方式可顯著降低評測成本。
對於獨立部署(經過微調並部署上線)的模型,評測時不額外收取推理費用,僅按已有的部署費用計算。
下表匯總了各評分方式的費用構成:
評分方式 | 被評測模型推理費用 | 裁判模型評分費用 | 費用構成 |
|---|---|---|---|
LLM 數值打分 | 按 token 計費 | 按 token 計費 | 推理 + 評分 |
LLM 分類打分 | 按 token 計費 | 按 token 計費 | 推理 + 評分 |
字串匹配 | 按 token 計費 | 無 | 僅推理 |
文本相似性 | 按 token 計費 | 無 | 僅推理 |
人工分類打分 | 按 token 計費 | 無(人工成本另計) | 推理 + 人工 |
費用估算樣本
以下樣本展示使用 qwen-plus 模型對 100 條資料進行 LLM 數值打分評測的費用估算過程(單價為示意,請以控制台實際顯示為準):
- 假設每條資料平均 input_tokens = 500、output_tokens = 200。
- 被評測模型推理費用 = 100 x (500 x input_price + 200 x output_price)。
- 裁判模型評分費用 = 100 x (裁判模型每次評分消耗的 token x 裁判模型單價)。
- 總費用 = 被評測模型推理費用 + 裁判模型評分費用。
成本最佳化策略
- 分階段評測:先用 50-100 條資料進行小規模驗證,確認評測維度和資料品質符合預期後,再擴大到完整資料集進行正式評測。
- 規則評估優先:字串匹配和文本相似性不產生裁判模型費用,成本最低。對於有明確標準答案的情境,優先使用規則評估方式。
- 儲存推理結果集複用:將模型推理結果儲存為推理結果集,後續評測可直接使用已有結果,免去重複調用模型推理的費用。
常見問題
評測結果不符合預期怎麼辦?
問題:評測任務完成後,模型評分與實際體驗存在明顯偏差,或評分結果不合理。
請依次檢查以下方面:
- 檢查測試資料代表性:確認評測資料集是否覆蓋了業務中的典型情境和邊界情況,資料量過少或分布偏差會導致評分不具代表性。
- 審查評分器 Prompt 清晰度:確認評分器 Prompt 是否明確描述了評分標準和判定依據,模糊的 Prompt 會導致裁判模型評分不穩定。
- 調整評分範圍和閾值:過窄的評分範圍(如 0-2)可能導致評分區分度不足,適當擴大範圍(如 0-10)可提升評分精度。
- 更換裁判模型:不同裁判模型的評分能力有差異,推薦使用千問-Max(qwen-max)擷取更穩定的評分結果。
評分過於集中怎麼辦?
問題:多條資料的評分集中在同一個分數或分類標籤上,缺少區分度。
評分過於集中通常由以下原因導致,請逐一排查:
- 細化判定標準:在評分器 Prompt 中為每個分數檔添加明確的判定條件和樣本,使裁判模型能夠區分不同品質層次的輸出。
- 增加資料多樣性:在評測資料集中加入邊界樣本和異常樣本,避免所有 Prompt 難度過於一致。
- 更換裁判模型:推理能力更強的裁判模型(如千問-Max)能更好地遵循評分器 Prompt 中的細粒度判定標準。
不同評測維度結果相互矛盾怎麼理解?
問題:同一個模型在不同評測維度上的得分差異較大,甚至出現在一個維度上表現優秀、另一個維度上表現較差的情況。
這是正常現象。不同評測維度評估的是模型能力的不同方面(如準確性、流暢度、邏輯性),模型在不同能力方面的表現本身存在差異。建議根據業務優先順序對各維度評分進行加權決策,而非要求模型在所有維度上均表現最優。
模型頻繁輸出過時或無關內容怎麼辦?
問題:模型的輸出與參考答案無關,或包含過時資訊,導致評測得分偏低。
這通常表明模型的知識覆蓋不足或訓練資料存在滯後。建議考慮引入知識庫為模型補充領域知識,通過檢索增強產生(RAG)方式提升模型在特定領域的輸出品質。
使用評測時有哪些常見誤區?
問題:初次使用模型評測功能時,容易混淆概念或誤操作導致評測結果異常。
以下是常見誤區和正確做法: