配置改动后,仅靠手动抽查难以判断智能体是否仍然稳定。用测试用例覆盖回复质量、对话流程和分支行为,把每次改动的验证结果沉淀下来,反复回归。
适用场景
测试用例将一次性的判断变成可重复验证的结果。每次发布前,以及任何涉及提示词、对话流、变量、知识库、工具的改动后,都应运行关联回归用例。
常用用例
类型 | 用途 | 通过标准示例 |
模型下一句回复 | 验证某轮客户输入后的回复和分支行为 | 身份正确、表达符合意图、无错误承诺、没有不该触发的动作 |
创建一条好用例
每条用例至少写清以下内容:
客户输入或完整对话:保留足以复现问题的上下文。
预期逻辑:描述通过标准,文案可观察、可判断,不写"表现自然"这类模糊描述。
预期正确回复:智能体应如何回复。
不应发生:不能重复追问、错误承诺、误转人工或误调用工具。
通过标准:可观察、可判断,不写"表现自然"这类模糊描述。
操作步骤
在智能体详情页切换到测试页签。

在测试用例页签,可以手动创建用例,或从线上通话、文本调试中保存。
手动创建用例:

在文本调试中对智能体回复打标:

在线上对话中对智能体回复打标:

勾选目标用例,点击批量运行,填写批次名称和说明后开始运行。运行时使用当前最新的草稿版本回测。

切换到运行记录页签,先看整体通过率,再查看失败项的实际对话、预期和失败原因。
对于未通过的用例,可以使用AI自迭代功能,或者在当前草稿中做最小修复,重新运行原失败项及关联回归集。
AI自迭代
AI自迭代适用于已有明确失败用例的优化。系统会在新的调试分支中,复现失败、分析原因、生成优化方案并回归验证。
AI自迭代不会自动改写正式版本、发布或上线。
适用条件
当前批次中存在已完成但未通过的用例,且需要定位或优化智能体配置。
预期结果已经确认正确。系统会以用例的预期结果为标准迭代。
操作步骤
在运行记录中打开原始测试批次;有失败用例时,点击 AI 自迭代。

系统创建调试分支,并依次完成失败复现、根因诊断、多轮优化提示词策略和回归运行。
优化期间可以离开页面。原批次会被锁定,避免同时重复操作。
迭代完成后,在运行记录中查看当前步骤、优化轮次、处理用例、剩余时间和每轮结论。
查看迭代报告并决定是否采纳
完成后,系统会生成「迭代批次」和关联调试分支。报告会展示原批次与迭代批次的通过率、问题归因与优化方向、原提示词和优化后提示词的对比,以及已修复和仍失败的用例。

逐条核对改动是否符合业务规则、合规要求、变量与工具约束和预期话术。仍失败的用例需要人工继续处理,不应直接忽略。确认可用后选择 保存到调试分支;不采纳则选择 放弃调试分支。保存到调试分支只代表保留优化草稿,后续仍需走分支、版本和发布流程。
