AI Red Teaming
AI 应用部署到生产环境之前,需要验证模型和智能体是否存在提示词注入、数据泄露等安全风险。AI Red Teaming 是云安全中心 Agent 安全中心下的安全评估功能,对AI 模型和 AI 智能体执行安全评估,识别潜在攻击面和漏洞。
功能概述
AI Red Teaming可用于检测接入的 AI 模型和 AI 智能体(Agent)是否存在安全风险。通过添加检测对象,可以对 AI 服务进行安全评估,识别潜在的攻击面和安全漏洞。同时提供合规测试报告,可以用于备案前的自测等功能,帮助企业以攻促防,构建可信的 AI 安全防线。
支持的检测对象:
AI 模型:检测 OpenAI 兼容或 Anthropic 兼容的 AI 模型服务,检测通过 API 接入的大语言模型是否存在提示词注入、数据泄露等安全风险。
AI 智能体:检测部署在阿里云百炼、Dify、PAI 等平台上的智能体应用的安全性。
检测结果说明:当前仅支持报告下载,不支持自动处理,不会同步至Agent 风险列表中。
前提条件
已开通Agent安全中心付费版实例。具体操作,请参见购买和退订Agent安全中心。
添加检测对象
登录云安全中心控制台。
在左侧导航栏选择Agent 安全中心>AI Red Teaming.
在 AI Red Teaming 列表上方,单击添加检测对象。
在目标信息页面,配置以下参数。配置完成后,单击下一步进入连接参数配置。
参数
说明
目标名称
自定义名称,用于标识和管理检测对象。
描述
可选。输入检测对象的描述信息。
目标类型
AI 模型:用于兼容 OpenAI 或 Anthropic 接口的模型服务。
AI 智能体:适用于部署在阿里云百炼、Dify 等平台上的智能体应用。
说明选择不同类型后,后续步骤的参数配置会相应变化。
接入方式
仅当目标类型为AI 模型时显示。
OpenAI 兼容:适用于兼容 OpenAI Chat Completions API 格式的模型服务,如阿里云百炼、Azure OpenAI 及各种开源模型部署。
Anthropic 兼容:适用于兼容 Anthropic Messages API 格式的模型服务。
快捷接入
仅当目标类型为AI 智能体时显示。支持的平台有:阿里云百炼、Dify、Agent Run、PAI、AgentKit 等。
在连接参数页签,根据目标类型,填写连接参数。配置完成后,单击下一步进入连接验证。
AI 模型参数
参数
说明
流式输出
是否启用流式输出。默认启用。
API地址
AI 模型的 API 地址。
如阿里云百炼的 OpenAI 兼容 API 地址为
https://dashscope.aliyuncs.com/compatible-mode/v1。API Key
用于认证的访问密钥。
如阿里云百炼用户可在百炼控制台的 API Key 管理页面创建 API Key。
模型名称
待测试的模型名称。阿里云百炼示例:
qwen-plus、qwen-max。平台
从下拉列表中选择 AI 模型所属平台,如阿里云百炼。
AI 智能体参数
基础参数
参数
说明
流式输出
是否启用流式输出。
重要PAI 默认开启流式输出,不支持关闭。
API地址
智能体的 API 地址。
PAI:格式为
http://{uid}.{region}.pai-eas.aliyuncs.com/api/predict/{serviceName}/run,将 {uid}/{region}/{serviceName} 替换为实际的PAI-EAS服务配置。阿里云百炼:
https://dashscope.aliyuncs.com/api/v1/apps/{appId}/completion,其中{appId}为百炼应用ID。Dify:格式为http://{host}/v1/chat-messages,将 {host} 替换为实际的Dify服务地址。
Agent Run:格式为
https://{workspaceId}.agentrun-data.{region}.aliyuncs.com/agent-runtimes/{agentName}/endpoints/Default/invocations/openai/v1/chat/completions,将 {workspaceId}/{region}/{agentName} 替换为实际的Agent Run配置。AgentKit:格式
https://{id}.apigateway-{region}.volceapi.com/invoke,将 {id} 和 {region} 替换为实际的 Agent Kit 网关配置。
API Key
用于认证的访问密钥。
如阿里云百炼用户可在百炼控制台的 API Key 管理页面创建 API Key。
模型名称
仅 PAI 平台时显示,填写模型名称。
高级设置(可选)
参数
说明
HTTP方法
请求方法:GET、POST 或 PUT。默认 POST。
认证方式
选择认证方式:无、Bearer Token 或自定义 Header。
认证头名称
仅认证方式为自定义 Header 时显示。填写自定义认证头名称。
超时时间
请求超时时间,单位毫秒。默认 30000。
请求模版
请求体模版,按平台预设。
JSONPath
响应解析路径,按平台预设。
请求头
自定义请求头,JSON 格式。
在验证连接页签,确认已配置的目标详情后,单击连通性测试,验证配置的参数能否连接到 AI 服务。
重要仅在连通性测试通过后才能单击保存,如测试失败,检查 API 地址、API Key 和模型名称是否正确。
连通性测试并不真正执行检测任务,仅进行网络连接、API Key、API地址校验。
测试中:按钮显示加载动画。
测试通过:按钮变为成功状态,保存按钮变为可用。
测试失败:在连接测试失败提示区域可查看失败原因。若因网络等原因导致失败,可单击重试按钮,重新测试。
配置检测任务
单击目标检测对象操作列的
下的配置检测任务。在配置检测任务面板选择扫描模式:
扫描模式
说明
适用场景
安全检测(默认)
基于红队经验的AI Red Teaming智能体安全对抗测试。
适用于安全对抗测试。
合规检查
基于TC260的关键词和题库,满足备案合规测评需要。
适用于备案合规自测。
单击确定保存配置。
执行检测
当检测状态为准备中、排队中或检测中时,检测按钮不可用,需等待上一次检测完成。
默认扫描模式为安全检测。
选择检测对象:
单个检测:单击目标检测对象操作列的检测。
批量检测:勾选多个检测对象后,单击 AI Red Teaming 列表下方的检测。
确认对话框中,单击确定。
检测任务创建成功后,列表自动刷新,检测状态将更新。
查看检测任务及报告
单击目标检测对象操作列的检测记录或单击检测次数列的数字。
在检测记录面板可查看检测信息,支持按扫描模式和扫描进度查询。
名称
说明
扫描任务编号
检测任务的唯一编号。
扫描模式
安全检测或合规检查。
扫描发起时间
检测任务的开始时间。
扫描完成时间
检测任务的完成时间。
扫描任务进度
任务执行进度,运行中时显示完成百分比。
风险等级
该次检测发现的风险等级。
查看报告:检测完成,单击任务操作列的查看报告,可查看智能体或模型的安全评估报告。包含概览、安全评分、攻击分布、风险矩阵、攻击手法分析、攻击意图分析、攻击案例详情、安全建议。
下载报告:检测完成,单击任务操作列的
下的下载报告,可将安全报告下载到本地保存。下载命中数据:检测完成,单击任务操作列的
下的下载命中数据,可下载命中的样本数据(csv格式)。
停止或删除检测任务
单击目标检测对象操作列的
下的检测记录或单击检测次数列的数字。在检测记录面板,单击目标任务操作列的停止或删除。
操作
适用范围
执行效果
停止
仅未完成的任务
终止扫描,保留检测记录。
删除
所有状态的任务
终止扫描,并删除检测记录。
管理检测对象
修改检测对象
在 AI Red Teaming 列表页,单击目标检测对象操作列的
下的配置对象。在配置对象面板中,支持修改流式输出开关、API地址、API Key以及高级设置。参数说明,参见连接参数。
修改完成后,单击连通性测试验证新配置。
重要如测试失败,检查修改后的 API 地址、API Key 和模型名称是否正确,确认无误后重试。
测试通过后,单击确定保存修改。
删除检测对象
选择检测对象:
单个检测:单击目标检测对象操作列的
下删除。批量检测:勾选多个检测对象后,单击 AI Red Teaming 列表下方的删除。
确认对话框中,单击确定。
删除成功后,该检测对象从列表中移除。
计费说明
计费单位:按扫描次数收费,每检测一次计为1次。
累计方式:若同一对象检测多次,则按实际执行次数累计收费。
示例:对阿里云百炼的AI智能体,执行检测10次,将计为 10 次。
计费生效条件:仅在检测任务成功完成时产生费用。若检测任务执行失败或中止,则不计费。
收费标准:¥1,000/次 。
若当前账户已欠费或主动退订Agent安全中心,系统将在实例释放后,根据数据清除规则,对历史数据进行清理。
常见问题
连通性测试失败怎么办?
如果 AI 模型类型的检测对象连通性测试失败,排查以下原因:
网络不通:确认当前地域的云安全中心能够访问 AI 模型的 API 地址。如果 AI 模型部署于私有网络,需要配置网络连通策略。
API Key 无效或过期:确认 API Key 有效且未过期,可以尝试使用 curl 命令手动调用 API 确认。
模型名称错误:确认模型名称与 AI 模型服务提供商提供的名称一致。
API 地址格式错误:确认 API 地址 URL 正确且可访问。