全部产品
Search
文档中心

人工智能平台 PAI:开通服务及在线体验

更新时间:Jul 10, 2026

针对初级使用者,PAI提供了简单易用的Web界面,便于体验。您无需编程或准备数据集,只需输入问题和模型回答,即可一键生成评测结果。同时,在线体验也支持高级配置调整,以获得更精准的评测。

前提条件

开通PAI

开通服务

  1. 登录PAI控制台,在左侧导航栏,选择模型应用 > 模型评测(ModelEval)

  2. 单击PAI裁判员模型,然后单击立即开通,按照控制台操作指引,开通模型服务。

  3. 开通后,即可在概览页面查看Host和Token访问参数,以及调用量等详情。

在线体验

  1. 登录PAI控制台,在左侧导航栏,选择模型应用 > 模型评测(ModelEval)

  2. 单击PAI裁判员模型,切换到在线体验页签,根据如下说明,配置相关参数。

    1. 评测内容

      参数

      说明

      评测模型

      支持以下两种模型:

      • pai-judge:模型规模较小,性价比更高。

      • pai-judge-plus:模型规模较大,推理效果更好。

      评测模式

      支持2种评测模式:

      • 单模型评测:适合单个模型的回答评测,生成打分结果。

      • 双模型竞技:对比两个模型在相同问题下的表现,选出效果更好的模型。

      评测问题

      输入待评测的问题。

      模型回答

      输入评测问题相对应的模型回答。

      • 单模型:输入一个模型回答。

      • 双模型:输入两个模型回答。

      参考答案

      输入已知的参考答案。

      对于确定性问题、数学类问题、翻译等场景,参考答案可以提升评测准确度。

    2. (可选)高级配置

      参数

      说明

      评测场景

      问题场景

      场景包含文本改写、角色扮演、代码生成修改与分析等,每种场景具有不同的评测标准,能够帮助裁判员模型打分更加准确。

      系统会根据您输入的问题自动分类场景,您也可以手动指定问题场景。

      场景描述

      问题场景对应的描述。

      评测标准

      问题场景对应的评测标准,可自定义内容。

      评测分数

      评分范围

      自定义裁判员模型打分的分数值。

      取值范围:[2, 10]

      分档含义

      每个分数值的含义。

      生成参数

      Temperature

      控制生成文本的随机性。值越小,模型输出越保守,值越大,模型输出更加多样化。

      取值范围:[0, 2)

      Top_p

      控制候选词的选择范围。模型会从累计概率达到Top_p值的词的集合中随机选择下一个词。

      取值范围:[0, 1]

  3. 单击评测,在评测结果页签会流式返回裁判员模型的输出结果。您可以对结果进行反馈,以帮助我们改进裁判员模型的效果。

    Prompt预览页签,在线体验的参数会自动代入到Prompt模板中,您可以查看完整的Prompt,从而更好地理解裁判员模型的工作原理。

  4. 您也可以单击随机示例,页面会自动填充参数,帮助您快速体验裁判员模型能力。