全部产品
Search
文档中心

AI 安全护栏:防护配置

更新时间:Sep 17, 2026

检测项配置用于管理 AI 安全护栏的检测服务和防护维度。本文介绍如何在控制台查看 Service 列表、启用防护维度、配置检测规则和词库。

操作步骤

  1. 登录AI 安全护栏产品控制台。

  2. 在左侧导航栏,选择防护配置 > 模型防护。

    若您此前在「检测项配置」中进行相关操作,对应功能现位于防护配置 > 模型防护,操作路径以当前控制台为准。

    模型防护列表展示当前可用的 Service,包括:

    • AI输入内容安全检测(query_security_check_intl):检测用户输入给大模型的文本内容。

    • AI生成内容安全检测(response_security_check_intl):检测大模型生成的文本内容。

    • AIGC输入图片安全检测(img_query_security_check_intl):检测用户输入的图片内容。

    • AIGC输出图片安全检测(img_response_security_check_intl):检测大模型生成的图片内容。

  3. 在目标 Service 的操作列,单击配置,进入该 Service 的配置页面。

  4. 在防护维度区域,查看当前 Service 支持的检测能力。每个防护维度以卡片形式展示,通过卡片上的开关启用或关闭对应功能。

    文本类 Service 支持以下防护维度:

    • 内容合规:检测色情、暴力、政治等不良内容,默认启用。

    • 敏感内容检测:检测可能泄露的个人信息或企业敏感数据。

    • 提示词攻击检测:检测旨在绕过大模型安全限制的恶意提示词。

    • 恶意URL(公测中):扫描大模型内容中的恶意链接。

    • 模型幻觉(公测中):检测大模型生成的虚假或不准确信息。启用该维度后,在通过多模态实时审核 API 调用时,还需在请求参数中传入 referenceContent(用于与待检测内容进行对比的参考内容),否则不会返回模型幻觉检测结果。参数说明与请求示例请参见多模态实时审核API接入指南。

    说明

    启用敏感内容检测或提示词攻击检测时,请关注弹框提示,该功能将单独计费。更多信息请参见开通与计费概述。

  5. 词库设置:在模型防护列表中,对文本类 Service 单击设置词库(仅检测模态为文本的 Service 显示该按钮),设定词库进行加黑或加白操作。在防护配置中仅可将已有词库、图库或代答库关联到具体 Service;如需创建、编辑或删除这些库,请前往知识库管理页面,其中词库操作入口为知识库管理 > 词库管理。具体方案请参考词库管理。

配置管理

在该 Service 的配置页面,单击防护维度卡片上的配置管理,可配置该维度下每个风险标签的检测开关和细分规则。

以AI输入内容安全检测(query_security_check_intl)为例,在模型防护列表中单击操作栏的配置。

  1. 在防护维度区域,单击目标维度卡片(如内容合规)上的配置管理。

  2. 选择需要调整的检测类型,单击编辑进入编辑模式,修改对应检测状态。

  3. 单击保存。新配置的检测范围约 2~5 分钟生效并应用于生产环境。

    说明

    策略调整延时说明

    由于策略调整存在延时,在配置修改后立即测试可能出现结果不一致或误拦截的情况(如手机号误拦)。建议在策略调整后等待一段时间再重新发起请求进行测试验证,以确认最新策略是否生效。

常见问题

敏感数据检测中,脱敏、阻断、观察三种处置方式有什么区别?

在敏感数据检测的配置中,可以为每个敏感数据标签设置以下三种处置方式:

  • 脱敏:对检测到的敏感数据进行掩码处理后再输出。例如,手机号码会显示为 1**********8,既能标识数据格式,又不会泄露完整信息。

  • 阻断:直接拦截请求,不输出内容或返回拦截信息。适用于对敏感数据零容忍的场景。

  • 观察:仅进行检测记录,不会产生任何拦截行为,正常输出内容。适用于测试阶段或仅需了解敏感数据分布的场景。

RAM 用户是否可以各自独立管理 AI 安全护栏的配置项?

AI 安全护栏的配置项(如检测规则、词库等)由主账号统一管理,RAM 用户无法各自独立配置。所有 RAM 用户共享同一套防护策略与配额,配置变更需由主账号(或具备相应权限的 RAM 用户)在控制台操作。每个 RAM 用户仅能通过授权的权限调用 API。