检测项配置用于管理 AI 安全护栏的检测服务和防护维度。本文介绍如何在控制台查看 Service 列表、启用防护维度、配置检测规则和词库。
操作步骤
登录AI 安全护栏产品控制台。
在左侧导航栏,选择。
检测项配置列表展示当前可用的 Service,包括:
AI 输入内容安全检测_pro 版(query_security_check_pro):检测用户输入给大模型的文本内容。
AI 输出内容安全检测_pro 版(response_security_check_pro):检测大模型生成的文本内容。
AIGC输入图片安全检测(img_query_security_check):检测用户输入的图片内容。
AIGC输出图片安全检测(img_response_security_check):检测大模型生成的图片内容。
在目标 Service 的操作列,单击管理,进入 Service 管理页面。
在防护维度区域,查看当前 Service 支持的检测能力。每个防护维度以卡片形式展示,通过卡片上的开关启用或关闭对应功能。
文本类 Service 支持以下防护维度:
内容合规:检测色情、暴力、政治等不良内容,默认启用。
敏感内容检测:检测可能泄露的个人信息或企业敏感数据。
提示词攻击检测:检测旨在绕过大模型安全限制的恶意提示词。
恶意URL(公测中):扫描大模型内容中的恶意链接。
模型幻觉(公测中):检测大模型生成的虚假或不准确信息。
说明启用敏感内容检测或提示词攻击检测时,请关注弹框提示,该功能将单独计费。更多信息请参见开通与计费概述。
词库设置:在检测项配置列表中,对文本类 Service 设定词库进行加黑或加白操作。具体方案请参考词库管理。
配置管理
在 Service 管理页面,单击防护维度卡片上的配置管理,可配置该维度下每个风险标签的检测开关和细分规则。
以AI 输入内容安全检测_pro 版(query_security_check_pro)为例,在检测项配置列表中单击操作栏的管理。
在防护维度区域,单击目标维度卡片(如内容合规)上的配置管理。
选择需要调整的检测类型,单击编辑进入编辑模式,修改对应检测状态。
说明基准规则与独立规则的更新机制区别
直接使用基准规则:检测能力会随官方更新自动同步最新版本,无需手动调整。
通过复制 Service 创建的独立规则:基准规则更新不会自动同步到已复制的独立规则中,独立规则保留原有配置。若需使用最新策略,需手动编辑同步。复制 Service 时,新 Service 的配置(包括计费方式、可设置项以及自定义词库配置情况)与所复制的 Service 一致。
单击保存。新配置的检测范围约 2~5 分钟生效并应用于生产环境。
说明策略调整延时说明
由于策略调整存在延时,在配置修改后立即测试可能出现结果不一致或误拦截的情况(如手机号误拦)。建议在策略调整后等待一段时间再重新发起请求进行测试验证,以确认最新策略是否生效。
常见问题
敏感数据检测中,脱敏、阻断、观察三种处置方式有什么区别?
在敏感数据检测的配置中,可以为每个敏感数据标签设置以下三种处置方式:
脱敏:对检测到的敏感数据进行掩码处理后再输出。例如,手机号码
13812345678会显示为1**********8,既能标识数据格式,又不会泄露完整信息。阻断:直接拦截请求,不输出内容或返回拦截信息。适用于对敏感数据零容忍的场景。
观察:仅进行检测记录,不会产生任何拦截行为,正常输出内容。适用于测试阶段或仅需了解敏感数据分布的场景。
RAM 用户是否可以各自独立管理 AI 安全护栏的配置项?
AI 安全护栏的配置项(如检测规则、词库等)由主账号统一管理,RAM 用户无法各自独立配置。所有 RAM 用户共享同一套防护策略与配额,配置变更需由主账号(或具备相应权限的 RAM 用户)在控制台操作。每个 RAM 用户仅能通过授权的权限调用 API。
如何关闭 AI 安全护栏的日志功能以停止扣费?
在检测项配置页面中,将日志服务选项设置为关闭,即可关闭日志功能并停止产生相关费用。
操作路径:登录 AI 安全护栏控制台,在左侧导航栏选择防护配置 > 模型防护(或Agent 实时防护)> 检测项配置,在目标 Service 的操作列单击管理,进入 Service 管理页面后,找到日志服务开关并将其关闭。
二维码和灌水内容被正确识别但希望放行,如何处理?
如果二维码和灌水内容被正确识别,但希望在特定场景下放行这些内容,可以在控制台对应防护维度的配置管理中关闭相关风险标签来实现放行。
若关闭标签后仍无法满足业务需求,可提交工单申请后端调整。
AI 安全护栏模型漏判修复后是否需要调整风险阈值?
模型漏判修复与分值阈值无关,不需要调整阈值或恢复高风险设置。系统会自动应用修复后的检测能力,无需额外操作。