本文向您介绍如何在AI安全护栏产品控制台进行词库管理与设置、代答库管理与设置。
词库管理
如果您需要定制私有化的审核规则,可以通过如下步骤创建词库,设置有风险的违规关键词或者在检测文本前需要过滤掉的关键词,然后配置匹配关键词的检测规则。
-
在左侧导航栏,选择页面,按照如下步骤配置词库。
-
在词库管理页签,单击创建词库。
-
在创建词库面板中,按要求填写词库信息。
1、支持多个关键词采用与或非逻辑组合成一个关键词,如关键词“微信&兼职”表示只有同时出现以上两个词时才命中,“&”表示与关系,“~”表示非(排除)关系,配置关键词时“&”必须在“~”之前。
2、每个关键词以换行来分隔,单个词不超过50字。
3、最多 1000 行,如需一次增加超过 1000 行,请使用上传文件导入。
4、同一个账号下总共支持添加 10万个词,最多可创建 20个词库。
-
单击确定按钮。
如果词库创建失败,会有具体的提示信息,您可以根据提示重新创建。
-
词库设置
-
在页面,选择目标服务,单击右侧操作列设置词库。
-
根据需求,选择词库黑名单页签或者词库白名单页签进行词库设置
-
词库黑名单设置:通过添加词库按钮新增加黑词库,通过取消加黑按钮取消对该条词库的加黑设置。
-
bizType 参数匹配:通过 API 调用文本审核时,请确认请求参数中的
bizType值与控制台配置的词库关联对象一致。默认业务场景下使用字符串"default",其他自定义业务场景使用实际配置的字符串值,避免因参数不匹配导致词库未生效。 -
策略关联检查:创建词库后,还需按本文「词库设置」章节的步骤,在检测项配置页面将词库关联到对应服务规则的黑名单或白名单中。仅创建词库不会自动应用到检测策略,必须完成关联配置后词库才会生效。
-
生效时效说明:词库配置保存后约 1 分钟内生效并应用于生产环境。若配置完成后立即测试未见预期结果,请等待数据同步完成后重新验证。
-
黑样本拦截:对于无明显违规特征但业务上确需拦截的图片或文本,建议通过控制台添加黑样本进行拦截,以辅助模型学习业务特性,提升特定场景下的检测精准度。
-
反馈机制:若遇到特定请求(RequestId)检测不准确(如应拦截但未拦截、或存在误报),除自行配置词库外,还可通过控制台提交反馈,后端团队将进行策略调整。调整完成后,请重新测试验证检测结果。
-
词库白名单设置:通过添加词库按钮新增加白词库,通过取消加白按钮取消对该条词库的加白设置。
-
关键词格式要求:添加包含特殊符号的关键词(如网址链接、邮箱地址、域名)时,必须将特殊符号替换为"&"后再添加。例如:CSDN 链接应配置为"blog&csdn&net",邮箱域名应配置为"139&com",网站域名应配置为"phicotek&com"。
-
检测项开关配合:如果关键词加白后仍被识别为广告或联系方式,可能是因为检测项配置中特定标签下的检测开关仍处于开启状态(如"pt_to_contact"标签下的网址链接检测、邮箱检测)。此时需在检测项配置页面找到对应标签并关闭相关检测开关,或确保白名单关键词格式正确且已生效。
-
切词不准优化:针对因切词不准导致的误判,建议将完整短语(如"八九年级所有知识点")作为独立一行填入自定义白名单中,确保无禁用字符;或根据业务需求配置相似文本库。
词库黑名单说明
命中词库的任何一个关键词只要与待审核文本匹配成功后,使用API调用文本审核增强版时
labels会返回C_customized(用户库命中,表示命中您创建的词库)。该场景主要是检测待审核文本中是否存在违规风险。例如,设置的命中词库中的关键词为小额贷款、上门服务。此时,待审核的文本为本校小额贷款,安全、快捷、方便、无抵押,随机随贷,当天放款,上门服务,那么进行文本风险检测时,会匹配到小额贷款和上门服务关键词。使用API调用文本审核增强版时返回参数
labels的值除了返回内置的标签外(如果匹配到会返回,否则不返回),还会返回C_customized。词库创建完成后,请确认以下事项以保证词库正常生效:
对于无法通过词库配置覆盖的检测不准确问题,可通过以下方式辅助模型调优:
词库白名单说明
忽略词库的任何一个关键词只要与待审核文本匹配成功后,先进行忽略再检测。该场景主要是对一些关键词加入白名单,不需要检测。
例如,设置的忽略词库中的关键词为方便、快捷。此时,待审核的文本为本校小额贷款,安全、快捷、方便、无抵押,随机随贷,当天放款,上门服务,那么方便、快捷先被忽略掉,只对本校小额贷款,安全、无抵押,随机随贷,当天放款,上门服务进行文本风险检测。
配置白名单时,请注意以下特殊场景:
-
-
待完成词库黑名单或词库白名单的新增/删除操作后,点击确认,即完成对该条服务规则的词库设置操作。
代答库管理
内容合规支持根据风险标签自定义配置代答库及代答内容。
-
在左侧导航栏,选择。
-
在代答库管理页签,支持对代答库及代答库中的答案进行增加或修改。
-
单击创建代答库,填写代答库名称。可选择批量添加答案或上传文件导入,也可选择先建库,后面再添加答案
-
在代答库名称列表,单击操作列管理进入代答库答案维护页面。
-
单击添加,支持批量添加答案。
-
支持对该代答库中的答案进行增删改操作。
-
代答库配置
-
在左侧导航栏,选择。
-
在检测项配置列表页面,以AI输入内容安全检测(query_security_check)为例,单击操作列管理
-
选择需要调整的检测类型,以广告内容检测为例。
-
单击编辑进入编辑模式,修改自定义配置代答库配置。
-
在代答库选配列,可选择已创建的代答库,也可单击增加代答库新增代答库。单个标签,最多支持配置三个代答库。
-
单击保存,保存新配置的自定义代答库。新配置的自定义代答库约1分钟内生效并应用于生产环境。
-
常见问题
系统内置默认词库是否支持查看或导出?
AI安全护栏的系统内置默认词库(包括官方违规词库、黑名单词典等)不对外提供明细,不支持直接查看具体内容或导出。系统内置词库会定期自动更新,但具体更新时间不确定。如有个性化审核需求,请前往控制台词库管理页面,自行创建并维护自定义关键词词库。
为什么文本中包含敏感词但检测结果返回无风险?
可能原因如下:
-
该词汇在当前检测策略中未被定义为违规,例如广告法极限词"最强"本身无违规风险。
-
切词不准导致关键词未被命中。
-
后端策略调整存在短暂延迟。
如需拦截此类内容,请在控制台词库管理页面创建自定义黑词库,将相关关键词(如"最强"、"灌水"、"捞经验"等)添加至黑名单,并确保词库已关联到当前使用的审核策略(参见本文「词库设置」章节)。注意审核结果同步可能存在短暂延迟,配置后请稍后重新测试验证。
如何拦截灌水、刷帖等无意义但不违规的内容?
内容安全默认策略主要识别涉黄、涉政、辱骂等违规内容,"灌水""捞经验"等无意义评论通常不会被自动拦截。若需拦截,建议在控制台词库管理页面配置自定义词库或相似文本库,将常见灌水语句加入关键词黑名单,并将识别结果设置为风险名单或疑似名单。