模型评测是百炼 Model Studio 平台提供的模型质量评估工具,支持通过自定义评测维度量化评估大语言模型表现,帮助您完成模型选型、调优验证和能力对比。
什么是模型评测
模型评测是百炼 Model Studio 平台提供的模型质量验证工具。通过自定义评测维度和评分方式,您可以量化评估大语言模型在特定业务场景下的表现,获取可对比的评测结果。
使用场景
模型评测适用于以下场景:
- 模型选型:在多个候选模型之间对比评分,选择最适合业务需求的模型。
- 调优验证:对模型进行Prompt 调优或微调后,通过评测验证效果是否提升。
- 量化评估:将模型输出质量转化为可度量的评分指标,替代主观判断。
- 持续监控:定期执行评测任务,跟踪模型能力在版本迭代中的变化趋势。
评分方式
模型评测支持 5 种评分方式,覆盖自动评分和人工评分两大类:
- LLM 数值打分:由裁判模型按评分器 Prompt 给出数值评分(如 0-5 分),适用于需要精细量化的场景。
- LLM 分类打分:由裁判模型按评分器 Prompt 将输出归入预定义分类(如 Pass/Fail),适用于二元或多标签判定。
- 字符串匹配:将模型输出与参考答案进行精确比较(相等、包含、开头匹配、结尾匹配等),适用于有唯一标准答案的场景。
- 文本相似度:使用算法(ROUGE-L、BLEU、Cosine、Fuzzy、Accuracy)计算模型输出与参考答案的相似程度,适用于文本生成质量评估。
- 人工分类打分:由人工标注员对模型输出进行分类判定,适用于自动评分难以覆盖的主观评估场景。
支持评测的模型包括千问系列商业模型、千问开源模型、通义法睿等,具体可用模型以控制台被评测模型下拉列表为准。
5 种评分方式的概览对比如下:
评分方式 | 评分来源 | 适用场景 | 成本 |
|---|---|---|---|
LLM 数值打分 | 裁判模型 | 语义理解、开放式评估 | 中等 |
LLM 分类打分 | 裁判模型 | 二元判定(安全性/正确性) | 中等 |
字符串匹配 | 规则 | 有唯一标准答案的场景 | 极低 |
文本相似度 | 算法 | 翻译、摘要质量评估 | 低 |
人工分类打分 | 人工标注员 | 创意性评估、主观判断 | 高 |
前提条件与限制
评测全流程为:创建评测维度 → 准备评测数据 → 创建评测任务 → 查看评测结果。
使用模型评测前,请确认以下条件:
- 已注册阿里云账号并完成实名认证。
- 已开通百炼 Model Studio 服务。开通地址:https://modelstudio.console.alibabacloud.com。
- 如使用 RAM 用户操作,需主账号授予相应权限。
模型评测仅支持通过控制台操作,不提供 API 或 SDK 调用方式。
重要
Qwen3 系列模型暂不支持以思考模式(Thinking Mode)进行评测。如需评测 Qwen3 模型,请关闭思考模式后再创建评测任务。
准备评测数据
评测数据是评测任务的输入,决定了模型在哪些问题上被评估。百炼支持两种数据来源:评测数据集(提前准备的测试问题)和推理结果集(模型已生成的推理结果)。
数据格式说明
评测数据集包含以下字段:
- Prompt(必填):发送给被评测模型的输入问题,每条数据必须包含此字段。
- Completion(可选):参考答案,供评分方式(如字符串匹配、文本相似度)与模型输出进行比对。
- Output(仅推理结果集):模型已生成的输出内容。使用推理结果集时,评测任务直接对 Output 评分,不再调用被评测模型。
数据集类型必须为评测集。训练集类型的数据集无法用于评测任务,创建数据集时请在数据集类型中选择评测集。
警告创建数据集时,数据集类型必须选择评测集。如果误选为训练集,该数据集将无法在评测任务中使用,且数据集类型创建后不可修改,需重新创建。
评测数据的字段说明如下:
字段 | 是否必填 | 说明 | 使用场景 |
|---|---|---|---|
Prompt | 必填 | 发送给被评测模型的输入问题 | 所有评测方式 |
Completion | 可选 | 参考答案,用于与模型输出比对 | 字符串匹配、文本相似度 |
Output | 仅推理结果集 | 模型已生成的输出内容 | 复用已有推理结果时 |
数据量建议
数据量直接影响评测结果的可靠性,建议根据评测目标选择合适的数据规模:
- 快速验证(50-100 条):适用于 Prompt 调优后的快速效果确认,可在较短时间内完成评测。
- 标准评测(200-500 条):适用于模型选型和正式评测,覆盖更多场景,结果更具代表性。
- 深度评测(500 条以上):适用于对评测精度要求较高的场景,可全面覆盖业务问题分布。
编写 Prompt 时,建议覆盖业务中的典型场景和边界情况,避免集中在单一类型的问题上。每条 Prompt 应明确、具体,便于评估模型在实际使用中的表现。
创建数据集
按照以下步骤在控制台创建评测数据集:
- 登录百炼控制台。
- 在左侧导航栏选择数据管理 > 数据集管理。
- 单击创建数据集。
- 填写数据集名称,在数据集类型中选择评测集。
- 上传数据文件或手动添加数据条目,确保每条数据至少包含 Prompt 字段。
- 单击确定完成创建。
创建评测维度
评测维度定义了对模型输出的评分标准。每个维度绑定一种评分方式,评测任务执行时按照维度配置对每条数据逐一评分。
重要评测维度的评分方式在创建后不可更改。如需使用其他评分方式,请新建评测维度。
选择评分方式
百炼支持以下 5 种评分模式(详见什么是模型评测),各方式的关键参数如下:
LLM 数值打分:裁判模型依据评分器 Prompt 输出数值评分。评分范围默认 0-5(最小值 0,最大值可自定义),通过阈值默认 3.0(得分 ≥ 阈值视为通过)。裁判模型推荐选择千问-Max(qwen-max),其评分稳定性和判别力较优。
LLM 分类打分:裁判模型依据评分器 Prompt 将输出归入预定义分类标签。您需要配置至少两个分类标签(如 Pass 和 Fail),并指定哪些标签视为"通过"。通过标签与未通过标签不可有交集。
说明配置分类标签时,通过标签与未通过标签必须互斥。例如,Pass 和 Fail 不能同时被标记为通过标签,否则系统将拒绝创建。
字符串匹配:将模型输出与 Completion 参考答案进行字符串比较,不涉及裁判模型。支持的匹配规则包括:相等、不相等、包含、以...开头、以...结尾。
文本相似度:使用算法计算模型输出与 Completion 参考答案的相似度得分,不涉及裁判模型。支持的算法包括:ROUGE-L(召回导向)、BLEU(精确率导向)、Cosine(语义相似度)、Fuzzy(模糊匹配)、Accuracy(精确匹配率)。
人工分类打分:评分由标注员人工完成而非裁判模型。参数配置与 LLM 分类打分类似,需定义分类标签和通过标签。
各评分方式的配置参数说明如下(部分参数仅在特定评分方式下显示):
参数 | 说明 | 是否必填 | 取值说明 |
|---|---|---|---|
维度名称 | 评测维度的标识名称 | 是 | 不超过 20 字符 |
维度描述 | 维度的文字说明 | 是 | 不超过 100 字符 |
评分方式 | 决定如何评估模型输出 | 是 | 5 种评分方式之一,创建后不可更改 |
裁判模型 | 对模型输出进行评分的 LLM | LLM 打分时必选 | 推荐千问-Max(qwen-max) |
评分器 Prompt | 指导裁判模型评分的指令 | LLM 打分时必填 | 支持变量 ${prompt}/${output}/${completion} |
评分范围 | 数值打分的分值区间 | LLM 数值打分时必填 | 默认 0-5,最大值可自定义 |
通过阈值 | 得分大于等于阈值视为通过 | LLM 数值打分时必填 | 默认 3.0,支持 0.1 步长 |
分类标签 | 预定义的分类标签 | 分类打分时必填 | 至少两个标签,通过与未通过不可重叠 |
相似度算法 | 计算文本相似度的算法 | 文本相似度时必选 | ROUGE-L / BLEU / Cosine / Fuzzy / Accuracy |
相似度阈值 | 相似度得分的及格线 | 文本相似度时必填 | ROUGE-L 推荐 0.4-0.6,BLEU 推荐 0.3-0.5 |
标注指南 | 指导标注员评判的说明 | 人工分类时可选 | 自定义文字说明 |
配置评分器Prompt
LLM 数值打分和 LLM 分类打分方式需要配置评分器 Prompt,用于指导裁判模型如何评分。您可以选择平台预置的 Prompt 模板,也可以编写自定义 Prompt。
评分器 Prompt 支持以下三个变量,评测执行时自动替换为实际数据:
${prompt}:当前数据条目的 Prompt 输入内容。${output}:被评测模型对该 Prompt 生成的输出内容。${completion}:该数据条目的 Completion 参考答案(如有)。
自定义 Prompt 时,需明确告知裁判模型评分维度的判定标准、输出格式和评分范围,以获得稳定的评分结果。更多 Prompt 编写技巧请参见Prompt 最佳实践。
创建维度的操作步骤
- 登录百炼控制台,在左侧导航栏选择模型评测 > 评测维度。
- 单击创建评测维度。
- 填写维度名称(不超过 20 字符)和维度描述(不超过 100 字符)。
- 在评分方式中选择一种评分方式,并配置对应参数。
- 如选择 LLM 打分方式,在裁判模型中选择模型(推荐千问-Max),并配置评分器 Prompt。
- 单击确定完成创建。创建后评分方式不可更改,如需使用其他评分方式,请新建维度。
各评分方式的详细配置参数和使用建议,请参见选择评分方式。
创建评测任务
评测任务将被评测模型、评测数据和评测维度组合在一起执行。任务执行时,平台将数据集中的每条 Prompt 发送给被评测模型获取输出,再按关联的评测维度逐一评分。
配置评测任务参数
- 登录百炼控制台,在左侧导航栏选择模型评测 > 评测任务。
- 单击创建评测任务。
- 填写任务名称(不超过 50 字符,默认名称格式为"评测_当前时间")。
- 在被评测模型中选择一个或多个模型。下拉列表中灰色显示的模型表示当前不支持评测,无法选择。
- 选择数据来源:选择评测数据集或推理结果集,并关联已创建的数据集(详见准备评测数据)。
- 在评测维度区域关联一个或多个已创建的评测维度。如果清空已选维度,排行榜关联设置将同时自动清除。
- 如需设置 System Prompt,在对应区域填写。单击确定提交任务。
重要评测任务提交后,被评测模型不可更换。如需评测其他模型,请创建新的评测任务。
System Prompt与评分器Prompt
评测任务中涉及两种 Prompt,作用对象不同:
- System Prompt:在评测任务中配置,发送给被评测模型作为系统指令。用于设定被评测模型的角色、输出格式或行为约束,影响模型的输出结果。
- 评分器Prompt:在评测维度中配置,发送给裁判模型作为评分依据。用于指导裁判模型如何对被评测模型的输出进行评分,仅 LLM 打分方式使用。
两者互不影响:System Prompt 控制"被评测模型输出什么",评分器 Prompt 控制"裁判模型如何评分"。
对比项 | System Prompt | 评分器 Prompt |
|---|---|---|
配置位置 | 评测任务中配置 | 评测维度中配置 |
作用对象 | 被评测模型 | 裁判模型 |
用途 | 设定模型角色、输出格式或行为约束 | 指导裁判模型如何对输出评分 |
是否必填 | 可选 | LLM 打分方式时必填 |
费用归属 | 计入被评测模型推理费用 | 计入裁判模型评分费用 |
排行榜参与设置
创建评测任务时,可以设置该任务的结果是否参与排行榜排名。开启后,任务完成时评测结果将自动汇入排行榜,与其他模型的评测结果进行对比展示。
从排行榜页面入口创建评测任务时,系统会自动填充排行榜关联的评测维度和数据集,您只需选择被评测模型即可提交任务。
查看评测结果
任务提交后,您可以在评测任务列表中跟踪任务状态并查看评测结果。
登录百炼控制台,在左侧导航栏选择模型评测 > 评测任务。
任务状态
评测任务的状态变化如下:
- WAITING:任务已提交,等待执行。
- RUNNING:任务正在执行中,平台正在调用模型并评分。
- FINISH:任务执行完成,所有数据已评分,可查看结果。
- FAILED:任务执行失败,通常由模型调用异常或数据格式问题导致。
- ABORTED:任务被手动终止。
各状态下的可执行操作详见管理评测资源。
查看评测数据与统计
任务状态为 FINISH 后,单击任务名称进入结果详情页,包含以下两个 Tab:
- 数据明细:逐条展示每条数据的 Prompt、模型输出和各维度评分,便于定位模型在具体问题上的表现。
- 指标统计:展示各评测维度的综合得分和通过率。数值型维度显示平均分和通过率,分类型维度显示各分类标签的分布占比图。
结果下载与分析
仅状态为FINISH的任务支持结果下载。在评测任务详情页,单击下载结果可导出完整评测数据。
分析评测结果时,建议关注以下方面:
- 对比不同模型在同一维度上的得分差异,确定各模型的优势领域。
- 筛选低分数据条目,分析模型在哪些类型的问题上表现不佳。
- 关注通过率指标:通过率反映模型在该维度上达到基准线的比例,是模型选型的核心参考。
- 如同一模型多次评测,可对比不同时期的得分变化,追踪模型调优效果。
使用排行榜对比模型
排行榜用于在相同评测维度下对比多个模型的表现,以排名形式直观展示各模型的优劣。每个排行榜绑定一组评测维度,将多个评测任务的结果汇聚到同一张排名表中,帮助您快速完成模型选型决策。
创建排行榜
- 登录百炼控制台,在左侧导航栏选择模型评测 > 排行榜。
- 单击创建排行榜。
- 填写排行榜名称(不超过 50 字符)。
- 在评测维度中选择一个或多个已创建的评测维度。排行榜创建后绑定的评测维度不可修改,请谨慎选择。
- 单击确定完成创建。

添加评测任务到排行榜
排行榜创建后,您可以通过两种方式向排行榜添加评测任务:
- 从排行榜创建新任务:在排行榜详情页单击创建评测任务,系统自动锁定该排行榜绑定的评测维度并关联排行榜,您只需选择被评测模型和数据集。
- 从已完成任务中选择:在排行榜详情页单击添加评测任务,在弹出的列表中勾选状态为 FINISH 且包含该排行榜评测维度的历史任务。已绑定到当前排行榜的任务复选框置灰,不可取消。
每个排行榜最多添加 50 个评测任务。
排行榜结果说明
排行榜以表格形式展示所有已添加任务的排名结果,包含以下列:
- 排名:按排行榜得分从高到低排列,前三名分别以金色、银色、铜色标识。
- 任务名称:评测任务的名称,单击可跳转到任务详情。
- 模型:该任务使用的被评测模型名称。
- 排行榜得分:取值范围 0-100,由该任务在排行榜绑定维度上的评分归一化得出。评测中的任务得分显示为短横线(-),待评测完成后自动更新。
- [评测维度名称]:显示该任务在排行榜绑定维度上的原始评分。
- 操作:支持查看任务详情或从排行榜移除该任务。
排行榜得分随评测任务进度实时更新。当任务状态变为 FINISH 后,排名将自动刷新。
人工标注评测
人工标注评测适用于创意性评估、专业质量审核等需要主观判断的场景。当自动评分方式无法准确衡量模型输出质量时,您可以创建包含人工分类打分维度的评测任务,由标注员对模型输出逐条进行人工判定。
登录百炼控制台,在左侧导航栏选择模型评测 > 评测任务。
标注模式
人工标注支持 3 种模式,适用于不同的评估目标:
单条标注
单条标注(base)模式对每条数据的模型输出逐条评分,标注员为每条输出选择一个分类标签。适用于需要对每条输出独立打分的场景,例如逐条检查模型回答的准确性或安全性。
对比标注
对比标注(PK)模式将两个模型对同一条 Prompt 的输出并排展示,标注员对两个输出进行排序判定(如 A 优于 B)。适用于模型之间的直接对比选型,帮助快速确定哪个模型在特定场景下表现更优。
应用标注
应用标注(app)模式在实际应用场景下评估模型输出的质量,标注员结合业务上下文进行判定。适用于应用级别的端到端效果评估,重点关注模型输出在实际业务流程中的可用性。
3 种标注模式的对比如下:
标注模式 | 说明 | 适用场景 |
|---|---|---|
单条标注(base) | 对每条模型输出逐条评分 | 需要对每条输出独立打分 |
对比标注(PK) | 两个模型输出并排比较排序 | 模型之间直接对比选型 |
应用标注(app) | 在应用场景下评估模型输出 | 端到端效果评估 |
标注操作步骤
- 按创建评测任务流程新建任务,关联一个评分方式为人工分类打分的评测维度(详见创建评测维度)。
- 任务创建后进入任务详情页,选择评测数据 Tab。
- 在数据列表的操作列中,单击标注按钮,进入标注页面。
- 查看模型输出内容,根据判定标准为该条数据选择分类标签,单击提交完成当前条目的标注。
- 逐条完成所有数据的标注。当所有数据标注完成后,任务状态自动变为FINISH。

标签设计建议
标签设计的质量直接影响标注结果的可靠性,建议遵循以下原则:
- 标签应覆盖所有可能的模型输出情况,避免标注员遇到无法归类的输出。
- 使用简洁明确的分类词作为标签名称,降低标注员的理解成本。
- 安排多名标注员对同一批数据交叉标注,检验标注一致性。如一致性偏低,需检查标签定义是否存在歧义并优化判定标准。
管理评测资源
评测任务、评测维度和排行榜创建后,您可以在控制台对这些资源进行管理操作。部分操作不可逆,请谨慎执行。
登录百炼控制台,在左侧导航栏选择模型评测。
评测任务管理
在模型评测 > 评测任务列表页,您可以对评测任务执行以下操作:
- 搜索、筛选和排序:通过任务名称搜索,按状态筛选,按创建时间排序,快速定位目标任务。这些操作仅影响列表展示,不改变任务数据。
- 终止任务:仅状态为RUNNING的任务支持终止。单击终止后任务状态变为ABORTED,此操作不可逆。
- 删除任务:状态为FINISH、FAILED或ABORTED的任务支持删除。删除后任务数据和评测结果将永久清除,此操作不可逆。
- 下载结果:仅状态为FINISH的任务支持下载评测结果(详见查看评测结果)。
各任务状态下的可执行操作汇总如下:
任务状态 | 可执行操作 | 不可逆提醒 |
|---|---|---|
WAITING | 无(任务排队中) | - |
RUNNING | 终止 | 终止后状态变为 ABORTED,不可恢复 |
FINISH | 查看结果、下载结果、删除 | 删除后数据永久清除 |
FAILED | 删除 | 删除后数据永久清除 |
ABORTED | 删除 | 删除后数据永久清除 |
评测维度管理
在模型评测 > 评测维度列表页,您可以编辑维度描述或删除维度。
删除评测维度时,如该维度已被排行榜绑定,排行榜中基于该维度的评分数据将被清除。请在删除前确认是否有排行榜正在使用该维度。
排行榜管理
在模型评测 > 排行榜列表页,您可以执行以下操作:
- 删除排行榜:删除排行榜后,排行榜数据将永久清除,但已添加到排行榜的评测任务本身不受影响。
- 移除任务:在排行榜详情页,您可以将评测任务从排行榜中移除。移除操作仅影响排行榜展示,评测任务本身及其结果不会被删除。
警告以下操作不可逆,执行前请确认:删除评测任务将永久清除任务数据和评测结果;终止任务后无法恢复执行;删除评测维度将同时清除排行榜中基于该维度的评分数据。
计费说明
模型评测产生的费用由两部分构成:被评测模型的推理费用和裁判模型的评分费用。了解计费规则有助于您合理规划评测规模和控制成本。
费用构成
被评测模型推理费用:按 token 计费,计算公式为cost = input_tokens x input_price + output_tokens x output_price。其中 input_tokens 包含 System Prompt 和每条数据的 Prompt,output_tokens 为模型生成的回答。各模型的具体单价以 Model Studio 控制台为准。
裁判模型评分费用:仅在使用LLM 数值打分或LLM 分类打分评分方式时产生。裁判模型对每条数据进行评分时消耗的 token 按该裁判模型的定价计费,具体价格以 Model Studio 控制台为准。
使用字符串匹配或文本相似度评分方式时,评分过程不涉及裁判模型调用,因此不产生评分费用。
说明字符串匹配和文本相似度评分方式不调用裁判模型,不产生评分费用,仅收取被评测模型的推理费用。对于有明确标准答案的评测场景,优先选择这两种方式可显著降低评测成本。
对于独立部署(经过微调并部署上线)的模型,评测时不额外收取推理费用,仅按已有的部署费用计算。
下表汇总了各评分方式的费用构成:
评分方式 | 被评测模型推理费用 | 裁判模型评分费用 | 费用构成 |
|---|---|---|---|
LLM 数值打分 | 按 token 计费 | 按 token 计费 | 推理 + 评分 |
LLM 分类打分 | 按 token 计费 | 按 token 计费 | 推理 + 评分 |
字符串匹配 | 按 token 计费 | 无 | 仅推理 |
文本相似度 | 按 token 计费 | 无 | 仅推理 |
人工分类打分 | 按 token 计费 | 无(人工成本另计) | 推理 + 人工 |
费用估算示例
以下示例展示使用 qwen-plus 模型对 100 条数据进行 LLM 数值打分评测的费用估算过程(单价为示意,请以控制台实际显示为准):
- 假设每条数据平均 input_tokens = 500、output_tokens = 200。
- 被评测模型推理费用 = 100 x (500 x input_price + 200 x output_price)。
- 裁判模型评分费用 = 100 x (裁判模型每次评分消耗的 token x 裁判模型单价)。
- 总费用 = 被评测模型推理费用 + 裁判模型评分费用。
成本优化策略
- 分阶段评测:先用 50-100 条数据进行小规模验证,确认评测维度和数据质量符合预期后,再扩大到完整数据集进行正式评测。
- 规则评估优先:字符串匹配和文本相似度不产生裁判模型费用,成本最低。对于有明确标准答案的场景,优先使用规则评估方式。
- 保存推理结果集复用:将模型推理结果保存为推理结果集,后续评测可直接使用已有结果,免去重复调用模型推理的费用。
常见问题
评测结果不符合预期怎么办?
问题:评测任务完成后,模型评分与实际体验存在明显偏差,或评分结果不合理。
请依次检查以下方面:
- 检查测试数据代表性:确认评测数据集是否覆盖了业务中的典型场景和边界情况,数据量过少或分布偏差会导致评分不具代表性。
- 审查评分器 Prompt 清晰度:确认评分器 Prompt 是否明确描述了评分标准和判定依据,模糊的 Prompt 会导致裁判模型评分不稳定。
- 调整评分范围和阈值:过窄的评分范围(如 0-2)可能导致评分区分度不足,适当扩大范围(如 0-10)可提升评分精度。
- 更换裁判模型:不同裁判模型的评分能力有差异,推荐使用千问-Max(qwen-max)获取更稳定的评分结果。
评分过于集中怎么办?
问题:多条数据的评分集中在同一个分数或分类标签上,缺少区分度。
评分过于集中通常由以下原因导致,请逐一排查:
- 细化判定标准:在评分器 Prompt 中为每个分数档添加明确的判定条件和示例,使裁判模型能够区分不同质量层次的输出。
- 增加数据多样性:在评测数据集中加入边界样本和异常样本,避免所有 Prompt 难度过于一致。
- 更换裁判模型:推理能力更强的裁判模型(如千问-Max)能更好地遵循评分器 Prompt 中的细粒度判定标准。
不同评测维度的结果相互矛盾怎么理解?
问题:同一个模型在不同评测维度上的得分差异较大,甚至出现在一个维度上表现优秀、另一个维度上表现较差的情况。
这是正常现象。不同评测维度评估的是模型能力的不同方面(如准确性、流畅度、逻辑性),模型在不同能力方面的表现本身存在差异。建议根据业务优先级对各维度评分进行加权决策,而非要求模型在所有维度上均表现最优。
模型频繁输出过时或无关内容怎么办?
问题:模型的输出与参考答案无关,或包含过时信息,导致评测得分偏低。
这通常表明模型的知识覆盖不足或训练数据存在滞后。建议考虑引入知识库为模型补充领域知识,通过检索增强生成(RAG)方式提升模型在特定领域的输出质量。
使用评测时有哪些常见误区?
问题:初次使用模型评测功能时,容易混淆概念或误操作导致评测结果异常。
以下是常见误区和正确做法: