词库管理

更新时间:
复制 MD 格式

本文向您介绍如何在AI安全护栏产品控制台进行词库管理与设置、代答库管理与设置

词库管理

如果您需要定制私有化的审核规则,可以通过如下步骤创建词库,设置有风险的违规关键词或者在检测文本前需要过滤掉的关键词,然后配置匹配关键词的检测规则。

  1. 登录AI安全护栏产品控制台

  2. 在左侧导航栏,选择防护配置 > 词库管理页面,按照如下步骤配置词库。

    1. 词库管理页签,单击创建词库

    2. 创建词库面板中,按要求填写词库信息。

      1、支持多个关键词采用与或非逻辑组合成一个关键词,如关键词“微信&兼职”表示只有同时出现以上两个词时才命中,“&”表示与关系,“~”表示非(排除)关系,配置关键词时“&”必须在“~”之前。

      2、每个关键词以换行来分隔,单个词不超过50字。

      3、最多 1000 行,如需一次增加超过 1000 行,请使用上传文件导入。

      4、同一个账号下总共支持添加 10万个词,最多可创建 20个词库。

    3. 单击确定按钮。

      如果词库创建失败,会有具体的提示信息,您可以根据提示重新创建。

词库设置

  1. 防护配置 > 模型防护页面,选择目标服务,单击右侧操作设置词库

  2. 根据需求,选择词库黑名单页签或者词库白名单页签进行词库设置

    • 词库黑名单设置:通过添加词库按钮新增加黑词库,通过取消加黑按钮取消对该条词库的加黑设置。

    • 词库黑名单说明

      命中词库的任何一个关键词只要与待审核文本匹配成功后,使用API调用文本审核增强版时labels会返回C_customized(用户库命中,表示命中您创建的词库)。该场景主要是检测待审核文本中是否存在违规风险。

      例如,设置的命中词库中的关键词为小额贷款上门服务。此时,待审核的文本为本校小额贷款,安全、快捷、方便、无抵押,随机随贷,当天放款,上门服务,那么进行文本风险检测时,会匹配到小额贷款上门服务关键词。使用API调用文本审核增强版时返回参数labels的值除了返回内置的标签外(如果匹配到会返回,否则不返回),还会返回C_customized

      词库创建完成后,请确认以下事项以保证词库正常生效:

      1. bizType 参数匹配:通过 API 调用文本审核时,请确认请求参数中的 bizType 值与控制台配置的词库关联对象一致。默认业务场景下使用字符串 "default",其他自定义业务场景使用实际配置的字符串值,避免因参数不匹配导致词库未生效。

      2. 策略关联检查:创建词库后,还需按本文「词库设置」章节的步骤,在检测项配置页面将词库关联到对应服务规则的黑名单或白名单中。仅创建词库不会自动应用到检测策略,必须完成关联配置后词库才会生效。

      3. 生效时效说明:词库配置保存后约 1 分钟内生效并应用于生产环境。若配置完成后立即测试未见预期结果,请等待数据同步完成后重新验证。

      对于无法通过词库配置覆盖的检测不准确问题,可通过以下方式辅助模型调优:

      1. 黑样本拦截:对于无明显违规特征但业务上确需拦截的图片或文本,建议通过控制台添加黑样本进行拦截,以辅助模型学习业务特性,提升特定场景下的检测精准度。

      2. 反馈机制:若遇到特定请求(RequestId)检测不准确(如应拦截但未拦截、或存在误报),除自行配置词库外,还可通过控制台提交反馈,后端团队将进行策略调整。调整完成后,请重新测试验证检测结果。

    • 词库白名单设置:通过添加词库按钮新增加白词库,通过取消加白按钮取消对该条词库的加白设置。

    • 词库白名单说明

      忽略词库的任何一个关键词只要与待审核文本匹配成功后,先进行忽略再检测。该场景主要是对一些关键词加入白名单,不需要检测。

      例如,设置的忽略词库中的关键词为方便快捷。此时,待审核的文本为本校小额贷款,安全、快捷、方便、无抵押,随机随贷,当天放款,上门服务,那么方便快捷先被忽略掉,只对本校小额贷款,安全、无抵押,随机随贷,当天放款,上门服务进行文本风险检测。

      配置白名单时,请注意以下特殊场景:

      1. 关键词格式要求:添加包含特殊符号的关键词(如网址链接、邮箱地址、域名)时,必须将特殊符号替换为"&"后再添加。例如:CSDN 链接应配置为"blog&csdn&net",邮箱域名应配置为"139&com",网站域名应配置为"phicotek&com"。

      2. 检测项开关配合:如果关键词加白后仍被识别为广告或联系方式,可能是因为检测项配置中特定标签下的检测开关仍处于开启状态(如"pt_to_contact"标签下的网址链接检测、邮箱检测)。此时需在检测项配置页面找到对应标签并关闭相关检测开关,或确保白名单关键词格式正确且已生效。

      3. 切词不准优化:针对因切词不准导致的误判,建议将完整短语(如"八九年级所有知识点")作为独立一行填入自定义白名单中,确保无禁用字符;或根据业务需求配置相似文本库。

  3. 待完成词库黑名单词库白名单的新增/删除操作后,点击确认,即完成对该条服务规则的词库设置操作。

代答库管理

内容合规支持根据风险标签自定义配置代答库及代答内容。

  1. 登录AI安全护栏产品控制台

  2. 在左侧导航栏,选择防护配置 > 词库管理

  3. 代答库管理页签,支持对代答库及代答库中的答案进行增加或修改。

    1. 单击创建代答库,填写代答库名称。可选择批量添加答案上传文件导入,也可选择先建库,后面再添加答案

    2. 在代答库名称列表,单击操作管理进入代答库答案维护页面。

    3. 单击添加,支持批量添加答案

    4. 支持对该代答库中的答案进行增删改操作。

代答库配置

  1. 在左侧导航栏,选择防护配置 > 模型防护 > 管理

  2. 检测项配置列表页面,以AI输入内容安全检测(query_security_check)为例,单击操作管理

    • 选择需要调整的检测类型,以广告内容检测为例。

    • 单击编辑进入编辑模式,修改自定义配置代答库配置。

    • 代答库选配列,可选择已创建的代答库,也可单击增加代答库新增代答库。单个标签,最多支持配置三个代答库。

    • 单击保存,保存新配置的自定义代答库。新配置的自定义代答库约1分钟内生效并应用于生产环境。

常见问题

系统内置默认词库是否支持查看或导出?

AI安全护栏的系统内置默认词库(包括官方违规词库、黑名单词典等)不对外提供明细,不支持直接查看具体内容或导出。系统内置词库会定期自动更新,但具体更新时间不确定。如有个性化审核需求,请前往控制台词库管理页面,自行创建并维护自定义关键词词库。

为什么文本中包含敏感词但检测结果返回无风险?

可能原因如下:

  1. 该词汇在当前检测策略中未被定义为违规,例如广告法极限词"最强"本身无违规风险。

  2. 切词不准导致关键词未被命中。

  3. 后端策略调整存在短暂延迟。

如需拦截此类内容,请在控制台词库管理页面创建自定义黑词库,将相关关键词(如"最强"、"灌水"、"捞经验"等)添加至黑名单,并确保词库已关联到当前使用的审核策略(参见本文「词库设置」章节)。注意审核结果同步可能存在短暂延迟,配置后请稍后重新测试验证。

如何拦截灌水、刷帖等无意义但不违规的内容?

内容安全默认策略主要识别涉黄、涉政、辱骂等违规内容,"灌水""捞经验"等无意义评论通常不会被自动拦截。若需拦截,建议在控制台词库管理页面配置自定义词库或相似文本库,将常见灌水语句加入关键词黑名单,并将识别结果设置为风险名单疑似名单