全部产品
Search
文档中心

大模型服务平台百炼:模型评测

更新时间:Aug 26, 2026

模型评测是百炼 Model Studio 平台提供的模型质量评估工具,支持通过自定义评测维度量化评估大语言模型表现,帮助您完成模型选型、调优验证和能力对比。

什么是模型评测

模型评测是百炼 Model Studio 平台提供的模型质量验证工具。通过自定义评测维度和评分方式,您可以量化评估大语言模型在特定业务场景下的表现,获取可对比的评测结果。

image

使用场景

模型评测适用于以下场景:

  • 模型选型:在多个候选模型之间对比评分,选择最适合业务需求的模型。
  • 调优验证:对模型进行Prompt 调优或微调后,通过评测验证效果是否提升。
  • 量化评估:将模型输出质量转化为可度量的评分指标,替代主观判断。
  • 持续监控:定期执行评测任务,跟踪模型能力在版本迭代中的变化趋势。

评分方式

模型评测支持 5 种评分方式,覆盖自动评分和人工评分两大类:

  • LLM 数值打分:由裁判模型按评分器 Prompt 给出数值评分(如 0-5 分),适用于需要精细量化的场景。
  • LLM 分类打分:由裁判模型按评分器 Prompt 将输出归入预定义分类(如 Pass/Fail),适用于二元或多标签判定。
  • 字符串匹配:将模型输出与参考答案进行精确比较(相等、包含、开头匹配、结尾匹配等),适用于有唯一标准答案的场景。
  • 文本相似度:使用算法(ROUGE-L、BLEU、Cosine、Fuzzy、Accuracy)计算模型输出与参考答案的相似程度,适用于文本生成质量评估。
  • 人工分类打分:由人工标注员对模型输出进行分类判定,适用于自动评分难以覆盖的主观评估场景。

支持评测的模型包括千问系列商业模型、千问开源模型、通义法睿等,具体可用模型以控制台被评测模型下拉列表为准。

5 种评分方式的概览对比如下:

评分方式

评分来源

适用场景

成本

LLM 数值打分

裁判模型

语义理解、开放式评估

中等

LLM 分类打分

裁判模型

二元判定(安全性/正确性)

中等

字符串匹配

规则

有唯一标准答案的场景

极低

文本相似度

算法

翻译、摘要质量评估

人工分类打分

人工标注员

创意性评估、主观判断

前提条件与限制

评测全流程为:创建评测维度准备评测数据创建评测任务查看评测结果

使用模型评测前,请确认以下条件:

模型评测仅支持通过控制台操作,不提供 API 或 SDK 调用方式。

重要

Qwen3 系列模型暂不支持以思考模式(Thinking Mode)进行评测。如需评测 Qwen3 模型,请关闭思考模式后再创建评测任务。

准备评测数据

评测数据是评测任务的输入,决定了模型在哪些问题上被评估。百炼支持两种数据来源:评测数据集(提前准备的测试问题)和推理结果集(模型已生成的推理结果)。

数据格式说明

评测数据集包含以下字段:

  • Prompt(必填):发送给被评测模型的输入问题,每条数据必须包含此字段。
  • Completion(可选):参考答案,供评分方式(如字符串匹配、文本相似度)与模型输出进行比对。
  • Output(仅推理结果集):模型已生成的输出内容。使用推理结果集时,评测任务直接对 Output 评分,不再调用被评测模型。

数据集类型必须为评测集。训练集类型的数据集无法用于评测任务,创建数据集时请在数据集类型中选择评测集

警告创建数据集时,数据集类型必须选择评测集。如果误选为训练集,该数据集将无法在评测任务中使用,且数据集类型创建后不可修改,需重新创建。

评测数据的字段说明如下:

字段

是否必填

说明

使用场景

Prompt

必填

发送给被评测模型的输入问题

所有评测方式

Completion

可选

参考答案,用于与模型输出比对

字符串匹配、文本相似度

Output

仅推理结果集

模型已生成的输出内容

复用已有推理结果时

数据量建议

数据量直接影响评测结果的可靠性,建议根据评测目标选择合适的数据规模:

  • 快速验证(50-100 条):适用于 Prompt 调优后的快速效果确认,可在较短时间内完成评测。
  • 标准评测(200-500 条):适用于模型选型和正式评测,覆盖更多场景,结果更具代表性。
  • 深度评测(500 条以上):适用于对评测精度要求较高的场景,可全面覆盖业务问题分布。

编写 Prompt 时,建议覆盖业务中的典型场景和边界情况,避免集中在单一类型的问题上。每条 Prompt 应明确、具体,便于评估模型在实际使用中的表现。

创建数据集

按照以下步骤在控制台创建评测数据集:

  1. 登录百炼控制台
  2. 在左侧导航栏选择数据管理 > 数据集管理
  3. 单击创建数据集
  4. 填写数据集名称,在数据集类型中选择评测集
  5. 上传数据文件或手动添加数据条目,确保每条数据至少包含 Prompt 字段。
  6. 单击确定完成创建。
image

创建评测维度

评测维度定义了对模型输出的评分标准。每个维度绑定一种评分方式,评测任务执行时按照维度配置对每条数据逐一评分。

重要评测维度的评分方式在创建后不可更改。如需使用其他评分方式,请新建评测维度。

选择评分方式

百炼支持以下 5 种评分模式(详见什么是模型评测),各方式的关键参数如下:

LLM 数值打分:裁判模型依据评分器 Prompt 输出数值评分。评分范围默认 0-5(最小值 0,最大值可自定义),通过阈值默认 3.0(得分 ≥ 阈值视为通过)。裁判模型推荐选择千问-Max(qwen-max),其评分稳定性和判别力较优。

LLM 分类打分:裁判模型依据评分器 Prompt 将输出归入预定义分类标签。您需要配置至少两个分类标签(如 Pass 和 Fail),并指定哪些标签视为"通过"。通过标签与未通过标签不可有交集。

说明配置分类标签时,通过标签与未通过标签必须互斥。例如,Pass 和 Fail 不能同时被标记为通过标签,否则系统将拒绝创建。

字符串匹配:将模型输出与 Completion 参考答案进行字符串比较,不涉及裁判模型。支持的匹配规则包括:相等、不相等、包含、以...开头、以...结尾。

文本相似度:使用算法计算模型输出与 Completion 参考答案的相似度得分,不涉及裁判模型。支持的算法包括:ROUGE-L(召回导向)、BLEU(精确率导向)、Cosine(语义相似度)、Fuzzy(模糊匹配)、Accuracy(精确匹配率)。

人工分类打分:评分由标注员人工完成而非裁判模型。参数配置与 LLM 分类打分类似,需定义分类标签和通过标签。

各评分方式的配置参数说明如下(部分参数仅在特定评分方式下显示):

参数

说明

是否必填

取值说明

维度名称

评测维度的标识名称

不超过 20 字符

维度描述

维度的文字说明

不超过 100 字符

评分方式

决定如何评估模型输出

5 种评分方式之一,创建后不可更改

裁判模型

对模型输出进行评分的 LLM

LLM 打分时必选

推荐千问-Max(qwen-max)

评分器 Prompt

指导裁判模型评分的指令

LLM 打分时必填

支持变量 ${prompt}/${output}/${completion}

评分范围

数值打分的分值区间

LLM 数值打分时必填

默认 0-5,最大值可自定义

通过阈值

得分大于等于阈值视为通过

LLM 数值打分时必填

默认 3.0,支持 0.1 步长

分类标签

预定义的分类标签

分类打分时必填

至少两个标签,通过与未通过不可重叠

相似度算法

计算文本相似度的算法

文本相似度时必选

ROUGE-L / BLEU / Cosine / Fuzzy / Accuracy

相似度阈值

相似度得分的及格线

文本相似度时必填

ROUGE-L 推荐 0.4-0.6,BLEU 推荐 0.3-0.5

标注指南

指导标注员评判的说明

人工分类时可选

自定义文字说明

配置评分器Prompt

LLM 数值打分和 LLM 分类打分方式需要配置评分器 Prompt,用于指导裁判模型如何评分。您可以选择平台预置的 Prompt 模板,也可以编写自定义 Prompt。

评分器 Prompt 支持以下三个变量,评测执行时自动替换为实际数据:

  • ${prompt}:当前数据条目的 Prompt 输入内容。
  • ${output}:被评测模型对该 Prompt 生成的输出内容。
  • ${completion}:该数据条目的 Completion 参考答案(如有)。

自定义 Prompt 时,需明确告知裁判模型评分维度的判定标准、输出格式和评分范围,以获得稳定的评分结果。更多 Prompt 编写技巧请参见Prompt 最佳实践

创建维度的操作步骤

  1. 登录百炼控制台,在左侧导航栏选择模型评测 > 评测维度
  2. 单击创建评测维度
  3. 填写维度名称(不超过 20 字符)和维度描述(不超过 100 字符)。
  4. 评分方式中选择一种评分方式,并配置对应参数。
  5. 如选择 LLM 打分方式,在裁判模型中选择模型(推荐千问-Max),并配置评分器 Prompt。
  6. 单击确定完成创建。创建后评分方式不可更改,如需使用其他评分方式,请新建维度。
image

各评分方式的详细配置参数和使用建议,请参见选择评分方式

创建评测任务

评测任务将被评测模型、评测数据和评测维度组合在一起执行。任务执行时,平台将数据集中的每条 Prompt 发送给被评测模型获取输出,再按关联的评测维度逐一评分。

配置评测任务参数

  1. 登录百炼控制台,在左侧导航栏选择模型评测 > 评测任务
  2. 单击创建评测任务
  3. 填写任务名称(不超过 50 字符,默认名称格式为"评测_当前时间")。
  4. 被评测模型中选择一个或多个模型。下拉列表中灰色显示的模型表示当前不支持评测,无法选择。
  5. 选择数据来源:选择评测数据集推理结果集,并关联已创建的数据集(详见准备评测数据)。
  6. 评测维度区域关联一个或多个已创建的评测维度。如果清空已选维度,排行榜关联设置将同时自动清除。
  7. 如需设置 System Prompt,在对应区域填写。单击确定提交任务。

重要评测任务提交后,被评测模型不可更换。如需评测其他模型,请创建新的评测任务。

image

System Prompt与评分器Prompt

评测任务中涉及两种 Prompt,作用对象不同:

  • System Prompt:在评测任务中配置,发送给被评测模型作为系统指令。用于设定被评测模型的角色、输出格式或行为约束,影响模型的输出结果。
  • 评分器Prompt:在评测维度中配置,发送给裁判模型作为评分依据。用于指导裁判模型如何对被评测模型的输出进行评分,仅 LLM 打分方式使用。

两者互不影响:System Prompt 控制"被评测模型输出什么",评分器 Prompt 控制"裁判模型如何评分"。

对比项

System Prompt

评分器 Prompt

配置位置

评测任务中配置

评测维度中配置

作用对象

被评测模型

裁判模型

用途

设定模型角色、输出格式或行为约束

指导裁判模型如何对输出评分

是否必填

可选

LLM 打分方式时必填

费用归属

计入被评测模型推理费用

计入裁判模型评分费用

排行榜参与设置

创建评测任务时,可以设置该任务的结果是否参与排行榜排名。开启后,任务完成时评测结果将自动汇入排行榜,与其他模型的评测结果进行对比展示。

排行榜页面入口创建评测任务时,系统会自动填充排行榜关联的评测维度和数据集,您只需选择被评测模型即可提交任务。

查看评测结果

任务提交后,您可以在评测任务列表中跟踪任务状态并查看评测结果。

登录百炼控制台,在左侧导航栏选择模型评测 > 评测任务

任务状态

评测任务的状态变化如下:

  • WAITING:任务已提交,等待执行。
  • RUNNING:任务正在执行中,平台正在调用模型并评分。
  • FINISH:任务执行完成,所有数据已评分,可查看结果。
  • FAILED:任务执行失败,通常由模型调用异常或数据格式问题导致。
  • ABORTED:任务被手动终止。

各状态下的可执行操作详见管理评测资源

查看评测数据与统计

任务状态为 FINISH 后,单击任务名称进入结果详情页,包含以下两个 Tab:

  • 数据明细:逐条展示每条数据的 Prompt、模型输出和各维度评分,便于定位模型在具体问题上的表现。
  • 指标统计:展示各评测维度的综合得分和通过率。数值型维度显示平均分和通过率,分类型维度显示各分类标签的分布占比图。
image

结果下载与分析

仅状态为FINISH的任务支持结果下载。在评测任务详情页,单击下载结果可导出完整评测数据。

分析评测结果时,建议关注以下方面:

  • 对比不同模型在同一维度上的得分差异,确定各模型的优势领域。
  • 筛选低分数据条目,分析模型在哪些类型的问题上表现不佳。
  • 关注通过率指标:通过率反映模型在该维度上达到基准线的比例,是模型选型的核心参考。
  • 如同一模型多次评测,可对比不同时期的得分变化,追踪模型调优效果。

使用排行榜对比模型

排行榜用于在相同评测维度下对比多个模型的表现,以排名形式直观展示各模型的优劣。每个排行榜绑定一组评测维度,将多个评测任务的结果汇聚到同一张排名表中,帮助您快速完成模型选型决策。

创建排行榜

  1. 登录百炼控制台,在左侧导航栏选择模型评测 > 排行榜
  2. 单击创建排行榜
  3. 填写排行榜名称(不超过 50 字符)。
  4. 评测维度中选择一个或多个已创建的评测维度。排行榜创建后绑定的评测维度不可修改,请谨慎选择。
  5. 单击确定完成创建。

image

添加评测任务到排行榜

排行榜创建后,您可以通过两种方式向排行榜添加评测任务:

  • 从排行榜创建新任务:在排行榜详情页单击创建评测任务,系统自动锁定该排行榜绑定的评测维度并关联排行榜,您只需选择被评测模型和数据集。
  • 从已完成任务中选择:在排行榜详情页单击添加评测任务,在弹出的列表中勾选状态为 FINISH 且包含该排行榜评测维度的历史任务。已绑定到当前排行榜的任务复选框置灰,不可取消。

每个排行榜最多添加 50 个评测任务。

排行榜结果说明

排行榜以表格形式展示所有已添加任务的排名结果,包含以下列:

  • 排名:按排行榜得分从高到低排列,前三名分别以金色、银色、铜色标识。
  • 任务名称:评测任务的名称,单击可跳转到任务详情。
  • 模型:该任务使用的被评测模型名称。
  • 排行榜得分:取值范围 0-100,由该任务在排行榜绑定维度上的评分归一化得出。评测中的任务得分显示为短横线(-),待评测完成后自动更新。
  • [评测维度名称]:显示该任务在排行榜绑定维度上的原始评分。
  • 操作:支持查看任务详情或从排行榜移除该任务。

排行榜得分随评测任务进度实时更新。当任务状态变为 FINISH 后,排名将自动刷新。

人工标注评测

人工标注评测适用于创意性评估、专业质量审核等需要主观判断的场景。当自动评分方式无法准确衡量模型输出质量时,您可以创建包含人工分类打分维度的评测任务,由标注员对模型输出逐条进行人工判定。

登录百炼控制台,在左侧导航栏选择模型评测 > 评测任务

标注模式

人工标注支持 3 种模式,适用于不同的评估目标:

单条标注

单条标注(base)模式对每条数据的模型输出逐条评分,标注员为每条输出选择一个分类标签。适用于需要对每条输出独立打分的场景,例如逐条检查模型回答的准确性或安全性。

对比标注

对比标注(PK)模式将两个模型对同一条 Prompt 的输出并排展示,标注员对两个输出进行排序判定(如 A 优于 B)。适用于模型之间的直接对比选型,帮助快速确定哪个模型在特定场景下表现更优。

应用标注

应用标注(app)模式在实际应用场景下评估模型输出的质量,标注员结合业务上下文进行判定。适用于应用级别的端到端效果评估,重点关注模型输出在实际业务流程中的可用性。

3 种标注模式的对比如下:

标注模式

说明

适用场景

单条标注(base)

对每条模型输出逐条评分

需要对每条输出独立打分

对比标注(PK)

两个模型输出并排比较排序

模型之间直接对比选型

应用标注(app)

在应用场景下评估模型输出

端到端效果评估

标注操作步骤

  1. 创建评测任务流程新建任务,关联一个评分方式为人工分类打分的评测维度(详见创建评测维度)。
  2. 任务创建后进入任务详情页,选择评测数据 Tab。
  3. 在数据列表的操作列中,单击标注按钮,进入标注页面。
  4. 查看模型输出内容,根据判定标准为该条数据选择分类标签,单击提交完成当前条目的标注。
  5. 逐条完成所有数据的标注。当所有数据标注完成后,任务状态自动变为FINISH

image

标签设计建议

标签设计的质量直接影响标注结果的可靠性,建议遵循以下原则:

  • 标签应覆盖所有可能的模型输出情况,避免标注员遇到无法归类的输出。
  • 使用简洁明确的分类词作为标签名称,降低标注员的理解成本。
  • 安排多名标注员对同一批数据交叉标注,检验标注一致性。如一致性偏低,需检查标签定义是否存在歧义并优化判定标准。

管理评测资源

评测任务、评测维度和排行榜创建后,您可以在控制台对这些资源进行管理操作。部分操作不可逆,请谨慎执行。

登录百炼控制台,在左侧导航栏选择模型评测

评测任务管理

模型评测 > 评测任务列表页,您可以对评测任务执行以下操作:

  • 搜索、筛选和排序:通过任务名称搜索,按状态筛选,按创建时间排序,快速定位目标任务。这些操作仅影响列表展示,不改变任务数据。
  • 终止任务:仅状态为RUNNING的任务支持终止。单击终止后任务状态变为ABORTED,此操作不可逆。
  • 删除任务:状态为FINISHFAILEDABORTED的任务支持删除。删除后任务数据和评测结果将永久清除,此操作不可逆。
  • 下载结果:仅状态为FINISH的任务支持下载评测结果(详见查看评测结果)。

各任务状态下的可执行操作汇总如下:

任务状态

可执行操作

不可逆提醒

WAITING

无(任务排队中)

-

RUNNING

终止

终止后状态变为 ABORTED,不可恢复

FINISH

查看结果、下载结果、删除

删除后数据永久清除

FAILED

删除

删除后数据永久清除

ABORTED

删除

删除后数据永久清除

评测维度管理

模型评测 > 评测维度列表页,您可以编辑维度描述或删除维度。

删除评测维度时,如该维度已被排行榜绑定,排行榜中基于该维度的评分数据将被清除。请在删除前确认是否有排行榜正在使用该维度。

排行榜管理

模型评测 > 排行榜列表页,您可以执行以下操作:

  • 删除排行榜:删除排行榜后,排行榜数据将永久清除,但已添加到排行榜的评测任务本身不受影响。
  • 移除任务:在排行榜详情页,您可以将评测任务从排行榜中移除。移除操作仅影响排行榜展示,评测任务本身及其结果不会被删除。

警告以下操作不可逆,执行前请确认:删除评测任务将永久清除任务数据和评测结果;终止任务后无法恢复执行;删除评测维度将同时清除排行榜中基于该维度的评分数据。

计费说明

模型评测产生的费用由两部分构成:被评测模型的推理费用和裁判模型的评分费用。了解计费规则有助于您合理规划评测规模和控制成本。

费用构成

被评测模型推理费用:按 token 计费,计算公式为cost = input_tokens x input_price + output_tokens x output_price。其中 input_tokens 包含 System Prompt 和每条数据的 Prompt,output_tokens 为模型生成的回答。各模型的具体单价以 Model Studio 控制台为准。

裁判模型评分费用:仅在使用LLM 数值打分LLM 分类打分评分方式时产生。裁判模型对每条数据进行评分时消耗的 token 按该裁判模型的定价计费,具体价格以 Model Studio 控制台为准。

使用字符串匹配文本相似度评分方式时,评分过程不涉及裁判模型调用,因此不产生评分费用。

说明字符串匹配和文本相似度评分方式不调用裁判模型,不产生评分费用,仅收取被评测模型的推理费用。对于有明确标准答案的评测场景,优先选择这两种方式可显著降低评测成本。

对于独立部署(经过微调并部署上线)的模型,评测时不额外收取推理费用,仅按已有的部署费用计算。

下表汇总了各评分方式的费用构成:

评分方式

被评测模型推理费用

裁判模型评分费用

费用构成

LLM 数值打分

按 token 计费

按 token 计费

推理 + 评分

LLM 分类打分

按 token 计费

按 token 计费

推理 + 评分

字符串匹配

按 token 计费

仅推理

文本相似度

按 token 计费

仅推理

人工分类打分

按 token 计费

无(人工成本另计)

推理 + 人工

费用估算示例

以下示例展示使用 qwen-plus 模型对 100 条数据进行 LLM 数值打分评测的费用估算过程(单价为示意,请以控制台实际显示为准):

  • 假设每条数据平均 input_tokens = 500、output_tokens = 200。
  • 被评测模型推理费用 = 100 x (500 x input_price + 200 x output_price)。
  • 裁判模型评分费用 = 100 x (裁判模型每次评分消耗的 token x 裁判模型单价)。
  • 总费用 = 被评测模型推理费用 + 裁判模型评分费用。

成本优化策略

  • 分阶段评测:先用 50-100 条数据进行小规模验证,确认评测维度和数据质量符合预期后,再扩大到完整数据集进行正式评测。
  • 规则评估优先:字符串匹配和文本相似度不产生裁判模型费用,成本最低。对于有明确标准答案的场景,优先使用规则评估方式。
  • 保存推理结果集复用:将模型推理结果保存为推理结果集,后续评测可直接使用已有结果,免去重复调用模型推理的费用。

常见问题

评测结果不符合预期怎么办?

问题:评测任务完成后,模型评分与实际体验存在明显偏差,或评分结果不合理。

请依次检查以下方面:

  • 检查测试数据代表性:确认评测数据集是否覆盖了业务中的典型场景和边界情况,数据量过少或分布偏差会导致评分不具代表性。
  • 审查评分器 Prompt 清晰度:确认评分器 Prompt 是否明确描述了评分标准和判定依据,模糊的 Prompt 会导致裁判模型评分不稳定。
  • 调整评分范围和阈值:过窄的评分范围(如 0-2)可能导致评分区分度不足,适当扩大范围(如 0-10)可提升评分精度。
  • 更换裁判模型:不同裁判模型的评分能力有差异,推荐使用千问-Max(qwen-max)获取更稳定的评分结果。

评分过于集中怎么办?

问题:多条数据的评分集中在同一个分数或分类标签上,缺少区分度。

评分过于集中通常由以下原因导致,请逐一排查:

  • 细化判定标准:在评分器 Prompt 中为每个分数档添加明确的判定条件和示例,使裁判模型能够区分不同质量层次的输出。
  • 增加数据多样性:在评测数据集中加入边界样本和异常样本,避免所有 Prompt 难度过于一致。
  • 更换裁判模型:推理能力更强的裁判模型(如千问-Max)能更好地遵循评分器 Prompt 中的细粒度判定标准。

不同评测维度的结果相互矛盾怎么理解?

问题:同一个模型在不同评测维度上的得分差异较大,甚至出现在一个维度上表现优秀、另一个维度上表现较差的情况。

这是正常现象。不同评测维度评估的是模型能力的不同方面(如准确性、流畅度、逻辑性),模型在不同能力方面的表现本身存在差异。建议根据业务优先级对各维度评分进行加权决策,而非要求模型在所有维度上均表现最优。

模型频繁输出过时或无关内容怎么办?

问题:模型的输出与参考答案无关,或包含过时信息,导致评测得分偏低。

这通常表明模型的知识覆盖不足或训练数据存在滞后。建议考虑引入知识库为模型补充领域知识,通过检索增强生成(RAG)方式提升模型在特定领域的输出质量。

使用评测时有哪些常见误区?

问题:初次使用模型评测功能时,容易混淆概念或误操作导致评测结果异常。

以下是常见误区和正确做法:

  • System Prompt 不等于评分器 Prompt:System Prompt 在评测任务中配置,发送给被评测模型;评分器 Prompt 在评测维度中配置,发送给裁判模型(详见创建评测任务)。两者作用对象不同,请勿混淆。
  • Pass/Fail 等分类标签不可重叠:在 LLM 分类打分或人工分类打分的维度中,通过标签与未通过标签必须互斥,同一个标签不能同时属于两组。
  • 独立部署模型不额外计费:经过微调并部署上线的模型在评测时不额外收取推理费用(详见计费说明)。
  • 数据集类型限制:评测任务仅支持评测集类型的数据集。如果选择了训练集类型的数据集,系统会拒绝创建评测任务。