本文向您介绍如何在AI安全护栏产品控制台进行词库管理与设置。
词库管理
如果您需要定制私有化的审核规则,可以通过如下步骤创建词库,设置有风险的违规关键词或者在检测文本前需要过滤掉的关键词,然后配置匹配关键词的检测规则。
-
在左侧导航栏,选择页面,按照如下步骤配置词库。
-
在词库管理页签,单击创建词库。
-
在创建词库面板中,按要求填写词库信息。
1、支持多个关键词采用与或非逻辑组合成一个关键词,如关键词“微信&兼职”表示只有同时出现以上两个词时才命中,“&”表示与关系,“~”表示非(排除)关系,配置关键词时“&”必须在“~”之前。
2、每个关键词以换行来分隔,单个词不超过50字。
3、最多 1000 行,如需一次增加超过 1000 行,请使用上传文件导入。
4、同一个账号下总共支持添加 10万个词,最多可创建 20个词库。
-
单击确定按钮。
如果词库创建失败,会有具体的提示信息,您可以根据提示重新创建。
-
词库设置
-
在页面,选择目标服务,单击右侧操作列设置词库。
-
根据需求,选择词库黑名单页签或者词库白名单页签进行词库设置
-
词库黑名单设置:通过添加词库按钮新增加黑词库,通过取消加黑按钮取消对该条词库的加黑设置。
-
bizType 参数匹配:通过 API 调用文本审核时,请确认请求参数中的
bizType值与控制台配置的词库关联对象一致。默认业务场景下使用字符串"default",其他自定义业务场景使用实际配置的字符串值,避免因参数不匹配导致词库未生效。 -
策略关联检查:创建词库后,还需按本文「词库设置」章节的步骤,在检测项配置页面将词库关联到对应服务规则的黑名单或白名单中。仅创建词库不会自动应用到检测策略,必须完成关联配置后词库才会生效。
-
生效时效说明:词库配置保存后约 1 分钟内生效并应用于生产环境。若配置完成后立即测试未见预期结果,请等待数据同步完成后重新验证。
-
黑样本拦截:对于无明显违规特征但业务上确需拦截的图片或文本,建议通过控制台添加黑样本进行拦截,以辅助模型学习业务特性,提升特定场景下的检测精准度。
-
反馈机制:若遇到特定请求(RequestId)检测不准确(如应拦截但未拦截、或存在误报),除自行配置词库外,还可通过控制台提交反馈,后端团队将进行策略调整。调整完成后,请重新测试验证检测结果。
-
词库白名单设置:通过添加词库按钮新增加白词库,通过取消加白按钮取消对该条词库的加白设置。
-
关键词格式要求:添加包含特殊符号的关键词(如网址链接、邮箱地址、域名)时,必须将特殊符号替换为"&"后再添加。例如:CSDN 链接应配置为"blog&csdn&net",邮箱域名应配置为"139&com",网站域名应配置为"phicotek&com"。
-
检测项开关配合:如果关键词加白后仍被识别为广告或联系方式,可能是因为检测项配置中特定标签下的检测开关仍处于开启状态(如"pt_to_contact"标签下的网址链接检测、邮箱检测)。此时需在检测项配置页面找到对应标签并关闭相关检测开关,或确保白名单关键词格式正确且已生效。
-
切词不准优化:针对因切词不准导致的误判,建议将完整短语(如"八九年级所有知识点")作为独立一行填入自定义白名单中,确保无禁用字符;或根据业务需求配置相似文本库。
词库黑名单说明
命中词库的任何一个关键词只要与待审核文本匹配成功后,使用API调用文本审核增强版时
labels会返回C_customized(用户库命中,表示命中您创建的词库)。该场景主要是检测待审核文本中是否存在违规风险。例如,设置的命中词库中的关键词为小额贷款、上门服务。此时,待审核的文本为本校小额贷款,安全、快捷、方便、无抵押,随机随贷,当天放款,上门服务,那么进行文本风险检测时,会匹配到小额贷款和上门服务关键词。使用API调用文本审核增强版时返回参数
labels的值除了返回内置的标签外(如果匹配到会返回,否则不返回),还会返回C_customized。词库创建完成后,请确认以下事项以保证词库正常生效:
对于无法通过词库配置覆盖的检测不准确问题,可通过以下方式辅助模型调优:
词库白名单说明
忽略词库的任何一个关键词只要与待审核文本匹配成功后,先进行忽略再检测。该场景主要是对一些关键词加入白名单,不需要检测。
例如,设置的忽略词库中的关键词为方便、快捷。此时,待审核的文本为本校小额贷款,安全、快捷、方便、无抵押,随机随贷,当天放款,上门服务,那么方便、快捷先被忽略掉,只对本校小额贷款,安全、无抵押,随机随贷,当天放款,上门服务进行文本风险检测。
配置白名单时,请注意以下特殊场景:
-
-
待完成词库黑名单或词库白名单的新增/删除操作后,点击确认,即完成对该条服务规则的词库设置操作。
常见问题
系统内置默认词库是否支持查看或导出?
AI安全护栏的系统内置默认词库(包括官方违规词库、黑名单词典等)不对外提供明细,不支持直接查看具体内容或导出。系统内置词库会定期自动更新,但具体更新时间不确定。如有个性化审核需求,请前往控制台词库管理页面,自行创建并维护自定义关键词词库。
为什么文本中包含敏感词但检测结果返回无风险?
可能原因如下:
-
该词汇在当前检测策略中未被定义为违规,例如广告法极限词"最强"本身无违规风险。
-
切词不准导致关键词未被命中。
-
后端策略调整存在短暂延迟。
如需拦截此类内容,请在控制台词库管理页面创建自定义黑词库,将相关关键词(如"最强"、"灌水"、"捞经验"等)添加至黑名单,并确保词库已关联到当前使用的审核策略(参见本文「词库设置」章节)。注意审核结果同步可能存在短暂延迟,配置后请稍后重新测试验证。
如何拦截灌水、刷帖等无意义但不违规的内容?
内容安全默认策略主要识别涉黄、涉政、辱骂等违规内容,"灌水""捞经验"等无意义评论通常不会被自动拦截。若需拦截,建议在控制台词库管理页面配置自定义词库或相似文本库,将常见灌水语句加入关键词黑名单,并将识别结果设置为风险名单或疑似名单。
词库白名单是否支持正则表达式及大小写敏感?
黑名单与白名单均不支持正则表达式,仅支持精确匹配及本文已述的逻辑组合符(&、~)。具体说明如下:
-
词库对字母大小写不敏感,配置时只需添加一种形式(如全小写或首字母大写)即可覆盖所有大小写组合,无需重复添加不同大小写变体。
-
支持多个关键词通过与或非逻辑组合成一个关键词。例如,关键词“微信&兼职”表示两个词同时出现才命中;
&表示与关系,~表示非(排除)关系,配置关键词时&必须在~之前。 -
每个关键词以换行分隔,单个词不超过 50 字。
-
最多 1000 行,如需一次添加超过 1000 行,请使用上传文件导入。
-
同一账号下总共支持添加 10 万个词,最多可创建 20 个词库。
分隔式脏话漏检怎么处理?加白后仍被拦截(黑白名单冲突)怎么处理?
分隔式脏话(如“**,你,妈妈”)漏检,以及白名单关键词仍被黑名单拦截,属于词库匹配的边界场景,可通过以下方式处置:
-
分隔式脏话漏检:建议将分隔式表达中的各部分作为独立关键词,分别添加至自定义黑名单词库。例如,“**,你,妈妈”可拆分为“**”、“你”、“妈妈”三个独立关键词添加。
-
黑白名单冲突:当合规词(如“处女座”)加入白名单后仍被黑名单拦截时,可在黑名单中使用排除逻辑(
~)收窄规则范围。例如,将黑名单关键词改为处女~处女座,把合规词“处女座”排除在外。 -
风险标签启用:对于分隔式脏话检测,可开启“低俗”类目下的
inappropriate_oral风险标签,该标签专门用于识别口语化、分隔式的低俗表达。 -
生效时效说明:以上配置均需等待生效后再验证。特殊符号处理与检测项开关配合,请参见本文「词库设置」章节。