当 Agent 运行过程中遇到鉴权失败、速率限制、网络超时等中断问题时,手动排查日志效率低且容易遗漏。Agent 诊断基于 Agent 观测采集的数据,自动检测会话中的各类中断事件,并按实例维度生成健康评分,帮助快速定位问题根因并采取修复措施。
功能概述
Agent 诊断是 Agent 观测能力的延伸,在查看Agent执行轨迹功能采集 Token 消耗与执行轨迹的基础上,额外采集 Agent 会话级中断事件,按实例维度生成诊断结果。Agent 诊断与轨迹查看共用同一数据源(SLS),开启轨迹采集后即同时具备诊断能力。诊断功能主要提供以下能力:
自动检测 Agent 运行过程中的 10 种中断类型(如鉴权错误、速率限制、网络超时等)。
按实例和 Agent 维度生成 0~100 的健康评分,量化 Agent 运行健康度。
提供中断事件详情,便于快速定位问题根因。
诊断数据存储于 SLS,最大查询时间范围为 7 天,超过 7 天的数据将自动删除。
使用限制
限制类型 | 说明 |
地域限制 | 仅支持中国内地与中国香港地域。 |
操作系统限制(x86 架构) | Alibaba Cloud Linux 2、Alibaba Cloud Linux 3、Alibaba Cloud Linux 4、Ubuntu 22.04、Ubuntu 24.04。 |
实例限制 | 仅适用于运行 cosh 或 Openclaw 应用的实例。 |
数据保留 | 诊断数据存储于 SLS,最多保留 7 天,超过 7 天的数据将自动删除。 |
其他限制 | 暂不支持 Coding Plan 的 Token 统计。如果是 Coding Plan,输入输出 Token 计数可能为 0。 |
发起诊断
开始前,确保已完成以下准备:
已通过操作系统控制台的组件配置创建 Agent 观测配置,并勾选开启 agent 观测功能与开启轨迹采集。
SysOM 组件版本为 3.14 或更高版本。如果版本低于 3.14,请先通过组件配置页面更新 SysOM 组件。
已通过实例纳管与节点监控将目标实例纳管,并关联了开启 Agent 观测的配置。
完成准备后,按以下步骤发起诊断:
登录操作系统控制台。
从左侧导航栏选择。
设置页面顶部的查询条件:

时间范围:选择需要查询的时间范围,支持快捷选择(1 小时、24 小时、7 天)。
实例 ID:从下拉框选择需要诊断的 ECS 实例。
数据来源:从下拉框选择该实例上的特定 Agent 应用。
单击发起诊断,并确认诊断参数。

参数
说明
实例 ID
选择需要诊断的 ECS 实例。
数据来源筛选
选择该实例所选时间范围内出现过的 Agent 应用。不选择则诊断该实例上的全部 Agent。
时间范围
支持快捷选择(1 小时、24 小时、7 天)或自定义起止时间,最大不超过 7 天。
确认参数后提交,系统将向诊断历史列表添加一条新的诊断任务。
诊断历史列表中每条记录包含创建时间、实例、时间范围、状态、健康分、问题数和操作信息。任务完成后,单击操作列的详情查看诊断结果。
查看诊断详情
诊断历史列表中,单击目标诊断任务操作列的详情,进入诊断详情页。诊断详情页包含以下区域:
摘要卡片

摘要卡片展示该诊断任务的整体结论,包含以下信息:
健康分:0~100 的整数评分,按区间显示不同颜色和评级,具体算法详见健康分说明。
健康分区间
颜色
评级
≥ 90
绿色
健康
70~89
蓝色
良好
50~69
橙色
警告
< 50
红色
严重
总会话数/总对话数:所选实例和 Agent 诊断时间范围内的会话和对话数量。
问题计数:总问题数、未解决数、严重问题数、高级问题数。
诊断元信息:实例、Agent、时间范围、任务创建时间。
筛选栏
通过筛选栏可按条件过滤事件列表中的中断事件:
严重程度:按严重、高、中、低筛选。
问题类型:按具体的中断类型筛选,详见问题类型说明。
事件列表

事件列表展示所有被识别为中断的事件,默认按发生时间倒序排列。每条事件记录包含以下字段:
字段 | 说明 |
发生时间 | 中断事件的发生时间。 |
问题类型 | 中断类型标签,通过彩色标签区分。 |
严重程度 | 事件的严重等级。 |
Agent | 发生中断的 Agent 应用名称。 |
会话 ID | 中断发生时所在的会话标识。 |
状态 | 事件当前的处理状态。 |
操作 | 单击详情查看事件的完整信息。 |
事件详情

事件列表中,单击目标事件操作列的详情,从右侧滑出事件详情抽屉,展示该中断事件的具体信息,便于定位问题原因并采取修复措施。
问题类型说明
Agent 诊断可识别以下 10 种中断类型:
问题类型 | 含义 |
Agent 崩溃 | Agent 进程运行时突然消失。仅当打断活跃对话时计入健康分扣分,空闲时崩溃不扣分。 |
鉴权错误 | API Key 无效或权限不足。 |
速率限制 | LLM API 被限流。 |
网络超时 | 网关超时,请求未到达 LLM。 |
服务不可用 | LLM 服务过载或宕机。 |
上下文溢出 | 请求超过模型上下文长度限制。 |
安全过滤 | LLM 安全策略拦截了输出。 |
SSE 截断 | SSE 流缺少正常终止标志。 |
Token 限制 | 输出达到 max_tokens 上限被截断。 |
LLM 错误 | 其他 LLM 调用错误。 |
健康分说明
健康分范围为 0~100,反映 Agent 诊断时间段内的运行健康度。
计算公式:
健康分 = 100 - min(100,加权扣分 / 总会话数 × 100)扣分权重:
严重程度 | 扣分权重 |
严重 | 10 分 |
高 | 5 分 |
中 | 2 分 |
低 | 1 分 |
核心原则:只有实际影响用户对话的中断才扣分。Agent 崩溃仅当打断活跃对话时计入扣分(空闲时崩溃不扣分);其余 9 种问题类型均发生于 LLM 调用过程,对用户必然有影响,始终扣分。