评估发现了 bad case(badcase),调优也有了方向,接下来的问题是:怎么证明一次优化真的有效?改 Prompt、换模型、调参数,任何改动都可能产生“变好了”的错觉,但回归测试里的其他题目可能悄悄变差。答案是实验:用数据集里的题目反复回测,用分数验证改动效果。
AgentLoop 数据飞轮实践系列 · 第 4 篇 / 共 5 篇 上一篇:《AgentLoop 数据飞轮实践(三):评估 —— 从黄金指标到 Rubric》| 下一篇:《AgentLoop 数据飞轮实践(五):经验库 —— 自动挖掘经验资产,消融实验验证真实收益》
实验能力回答三个问题:这次改动对这几道题效果如何(实验计划)?怎么安全地测到部署在内网的 Agent(离线实验平台)?怎么让分数稳定可信、并且知道分数为什么变(实验大盘 + 题目级 Rubric)。
一、实验计划:数据集 + 评估器 + 变量映射
对评估结果不满意时,即可通过实验对数据集里的题目重新回测。创建实验计划时指定数据集,勾选评估器,并配置变量映射:

图 1:实验计划:指定数据集与评估器

图 2:变量映射:内置变量与数据集字段对应
变量映射解决的是“评估器用哪个变量”的问题——和评估任务里的字段映射是同一个思路,只是这次的数据来源是实验:
一边是实验的内置变量:实验的
input、实验的output、实验的轨迹。另一边是数据集里的原始内容:例如
expected output就存储在数据集里,可以再加一个变量映射把它传给评估器,让评估器对照标准答案进行评估。除内置变量外,还可以添加自定义变量标记实验上下文,例如本次测试的版本号、实验记录 ID,或任意自定义的 KV 对。版本号尤其重要——后续实验大盘需要对比“不同版本的分数差异”,没有版本标记就无从对比。
实验计划配置完成后,可以获取一份本地执行代码——这是离线实验平台的入口,单次实验通过离线实验平台运行,用于验证本次改动的效果。
二、离线实验平台:部署在客户内网
实验要访问的是客户自己的 Agent。Agent 往往部署在公司内网、仅内网可访问:云端平台无法直接访问,把数据搬出去测试又不现实。针对这类部署形态,AgentLoop 提供离线实验平台,直接部署在客户公司内网,就近访问本地 Agent。通过创建本地实验计划,并在目标本地实验计划中获取本地实验配置,使用自定义执行完成:

图 3:离线实验平台

图 4:离线实验平台架构:云端控制台 ↔ 内网实验平台 ↔ 本地 Agent
这一架构的分工清晰:云端负责存储实验记录、展示大盘,实验记录提交到云端后,在 AgentLoop 控制台可随时查看;内网平台负责执行实验,它既能出网访问 AgentLoop 云端,又能在内网直接调用本地 Agent。实验在内网完成执行,无需将数据搬出测试。
平台配置:连接 AgentLoop 云端
第一件事是让内网平台连接 AgentLoop 云端,配置Settings:
绑定 AgentSpace:配置要测试、管理哪个智能体空间(AgentSpace)的实验,以及对应的地域(region)。
Endpoint 与 VPC:使用默认值即可;如需访问其他地域,修改为对应地域的 Endpoint。
AccessKey(AK/SK):该 AccessKey 需要能够访问云端 AgentLoop 的全部功能,即具备 AgentLoop FullAccess(读写)权限。建议申请一个专用 AccessKey 保存在本地,专门用于离线实验——权限专用、用途单一,出现问题时便于排查。
填写完成后测试链接,确认能够连通 AgentLoop 云端平台,再进入下一步。
连接本地 Agent
第二件事是连接本地的 Agent。新建一个连接——本地平台可以同时连接多个 Agent,每个 Agent 都能单独执行一轮测试:
连接时需要一段自定义调用代码。平台提供的默认代码假设 Agent 的 API 是无状态的——发送一个请求、获取一个响应。但大部分 Agent 是有状态的:例如演示中的客服 Agent 基于 Claude Agent SDK 开发,需要先创建一个 Session,获取 Session ID,再向该 Session ID 发送消息,最后生成响应。如果默认代码不满足需求,将调用代码修改为“创建 Session → 发送消息 → 获取响应”的逻辑;如果本地有特殊连接方式,同样在这段代码中适配。
保存后,发起一个单题测试验证连通性,例如询问“我的位置在哪里”:
Agent 正常响应(“我无法获取您的实际位置信息”),即说明链路打通。本地访问延时较高属于正常现象,等待响应返回即可;连通后即可发起实验。
三、定时调度与 Launch History
单次实验用于验证改动效果,定时调度则把回测变成日常。将实验配置为每 5 分钟调度一次:选择对应的实验计划、为调度命名(例如“每五分钟回归一次”)、设置周期与间隔、选择目标 Agent,即可创建定时任务(生产环境通常配置为每天回归):
在 Launch History 中可以查看每一次触发记录(例如两次触发的实验得分分别为 51 分和 56 分)。本地平台与 AgentLoop 控制台(平台侧)的数据保持同步——两侧看到的实验记录一致。
四、实验大盘与分数分析
回测结果直接在实验记录中查看。演示中两道题的单题得分分别为 0.25 和 0.5(满分 1):第一题“AgentLoop 有哪些功能”的回答缺少 Rubric 要求的多项能力点,仅得 0.25;第二题“AgentLoop 如何做评估”的回答相对完善,但仍有多个 Rubric 项未命中,得 0.5。评估结果中可以看到多次评估的趋势——多次评估之间存在浮动,查看均值更客观;还可以看到评估过程使用了哪些 Rubric、逐项检查命中了什么、缺少什么。低分精确指出了下一轮调优需要补齐的能力点。
每个实验计划都会自动创建一个实验大盘:

图 5:实验大盘:整体分数与变化趋势
大盘提供整体分数、分数变化趋势与明细,还支持按题目下钻,查看单题的分数变化——直观感知对 Agent 的优化是否有效。每天回测一次,分数变低立刻可见;调优完成后立即测试,改进也立刻可见。
为消除单次评估的浮动,可以按时间窗口计算均值(例如每 1 小时或每 5 分钟一个窗口)。
分数分析有一套值得记住的方法论:
分数变低要及时关注:这可能是 Agent 真的退化了。
先排查 Rubric 定义:如果同一版本多次评估的分数不稳、频繁波动,通常不是 Agent 发生了变化,而是 Rubric 定义模糊——标准不明确,分数自然浮动。此时应优化评估器的 Rubric。
再看版本差异:确认评估器没有问题后,如果同一版本内分数稳定、不同版本之间存在差异,才是版本带来的真实差异。
这套排查顺序避免了最常见的误判:把“尺子不准”当成“东西变差”。
五、题目级 Rubric:一个关键实践
流程跑通之后,演示又做了一项重要优化。从线上现场抓取 bad case 时,用户问题非常发散,无法制定一个具体的 Rubric 来判定回答好坏,因此在线评估使用通用标准。实验则不同:bad case 抓取出来之后,已经知道具体的用户问题。“如何做评估”和“有哪些功能”两道题的评估标准并不相同,如果用同一套 Rubric 评估两道题,优化时会失去方向——每道题该达标的点完全不同。
演示中最初为了简化快速接入,把两道题的 Rubric 写在了同一个评估器里——这种写法对实验并不友好。理论上的正确做法是把 Rubric 定义到题目级别,每道题绑定自己的评估标准:

图 6:题目级 Rubric:按题目绑定评估标准
具体做法分四步:
整理每道题的 Rubric:把题目 A 的 Rubric 复制出来,其中包含每一项功能的细项、单项判定、概念边界与扣分项;题目 B 同理。
数据集 schema 加列:数据集的 schema 中原本没有 Rubric 字段,在字段管理中新增一列
text类型的rubric字段,保存 schema,然后把每道题的 Rubric(评分规则、原子能力、计算公式)分别写入对应题目。评估器改造:为评估器新增一个
rubric变量,让评估器按传入的 Rubric 进行评估,并输出合法的 JSON——包含rubric_id、score、reason、item_scores等字段。实验侧绑定:将实验配置中的 Rubric 选项,改为从数据集的 Rubric 读取。
改造之后,每道题按自己的标准被评估,实验分数才真正具有指导意义——哪道题得分低,就补齐哪道题对应的能力点。改造完成后,重新发起一次实验,在评估结果中逐项核对每道题的评估过程,确认各题均按其自身绑定的 Rubric 进行评估。
六、小结
环节 | 关键点 |
实验计划 | 数据集 + 评估器 + 变量映射(内置变量 ↔ 数据集字段),可添加版本号等自定义变量 |
离线实验平台 | 部署在客户内网;配置 AgentSpace、地域、AccessKey;连接本地 Agent |
调用代码 | 有状态 Agent 先创建 Session,再发送消息 |
定时调度 | 每 5 分钟或每天回归;Launch History 与平台侧数据同步 |
实验大盘 | 整体分数、趋势、窗口均值、按题目下钻 |
分数方法论 | 分数低先排查 Rubric 定义,稳定后再对比版本差异 |
题目级 Rubric | Rubric 绑定到数据集题目,评估器输出结构化 JSON |
后续步骤
手工调优闭环(数据接入 → 评估 → 实验)跑通之后,剩余的环节是全自动化:经验库从历史轨迹中自动挖掘经验资产,Agent 安装一个 Skill 即可召回。实际效果如何,消融实验将给出答案——下一篇:《(五)经验库:自动挖掘经验资产,消融实验验证真实收益》。