在规模化 GPU 集群运维场景中,GPU 硬件故障、驱动异常、NVLink 链路问题等会直接阻断模型训练与推理任务。基于弹性计算 Agent 的定时任务与 IM 渠道集成能力,可以实现企业级 GPU 实例的主动健康巡检。当巡检发现异常时,Agent 会将诊断结果自动推送到运维群(以飞书为例),运维人员可直接在群内以对话方式完成远程排查、一键修复及系统事件响应;同时支持日常随时 @ 机器人完成资源盘点与即时诊断。
方案架构与流程
-
周期巡检:弹性计算 Agent 按预设调度周期,对指定范围的 GPU 集群自动执行 12 项健康诊断。
-
异常推送:发现异常后,Agent 将诊断结果与建议的修复方案推送到指定 IM 运维群(飞书 / 钉钉 / 企业微信)。
-
群内对话:运维人员在群内 @ 机器人或引用消息回复,Agent 结合巡检上下文继续定位、给出可执行指令。
-
闭环修复:确认建议后,运维人员在群内直接下发修复指令,由 Agent 完成一键修复或响应 ECS 系统事件,控制台状态同步更新。
诊断能力一览
弹性计算 Agent 内置 12 项 GPU 专项诊断能力,覆盖以下两大类故障根因:
-
A. 驱动与软件组件类(3 项):主要为系统内软件配置问题,支持在群内下发指令自助修复(如驱动或组件安装/升级)。
-
B. GPU 硬件 / 固件 / 底层故障类(9 项):涉及硬件、固件、显存、链路等底层异常,通常需结合 ECS 系统事件响应、择时重启或实例迁移来恢复。
|
分类 |
诊断项 |
能发现的问题 |
典型影响 |
|
A 驱动/组件 |
GPU 驱动未安装 |
GPU 驱动尚未安装 |
无法使用 GPU 卡 |
|
A 驱动/组件 |
GPU 驱动版本不匹配 |
驱动版本与操作系统内核版本不匹配 |
无法正常使用 GPU 卡 |
|
A 驱动/组件 |
FabricManager 组件异常 |
FabricManager 加载异常(常因与 Tesla 驱动版本不一致) |
无法正常使用 GPU 卡 |
|
B 硬件/固件 |
GPU 掉卡(DeviceLost) |
硬件故障导致掉卡 |
该 GPU 卡不可用 |
|
B 硬件/固件 |
GPU 电源线异常 |
GPU 卡电源线连接异常 |
该 GPU 卡不可用 |
|
B 硬件/固件 |
显存 ECC 错误 |
GPU 显存出现 ECC(纠错/不可纠错)错误 |
部分业务运行异常 |
|
B 硬件/固件 |
NVLink 异常 |
GPU 之间 NVLink 状态异常 |
GPU 异常 |
|
B 硬件/固件 |
Xid 错误 |
GPU 硬件/驱动加载出现 Xid 错误 |
GPU 卡工作异常 |
|
B 硬件/固件 |
NVXid 软硬件风险 |
Xid 检查发现软、硬件风险 |
GPU 卡无法正常使用 |
|
B 硬件/固件 |
RmInitAdapter 失败 |
加载过程出现 "RmInitAdapter failed" |
GPU 卡工作异常 |
|
B 硬件/固件 |
infoROM 损坏 |
出现 "infoROM is corrupted at gpu" |
GPU 卡工作异常 |
|
B 硬件/固件 |
Info ROM 版本异常 |
GPU 固件 Info ROM 版本异常 |
无法正常使用 GPU 卡 |
前提条件
在开始配置前,请确保满足以下条件:
-
已开通弹性计算 Agent 服务。首次访问 弹性计算 Agent 控制台,勾选服务协议并单击 立即开通。
-
账号下存在需要巡检的 GPU 实例。
-
已拥有企业或组织的 IM 平台管理员或开发者权限(本文以飞书为例;钉钉、企业微信等平台配置流程类似,详见 配置 IM 渠道)。
操作步骤
步骤一:创建飞书应用(机器人)
-
登录 飞书开发者后台,单击 使用模板一键创建智能体应用。
-
在模板页单击 立即创建,系统将自动生成应用。请记录并妥善保存 App ID 与 App Secret,后续步骤配置渠道时需填入。
如需在外部群使用该机器人,请进行以下配置:
-
在左侧「应用发布」分组下,单击 版本管理与发布,配置版本信息。在 对外共享 区域勾选 允许机器人被添加到外部群中使用。如需支持外部用户与机器人单聊,还可勾选 允许外部用户与机器人单聊。
-
配置完成后单击 保存,并按飞书流程提交审核和发布。
飞书应用配置的详细说明以飞书官方最新文档为准,本文仅列出与弹性计算 Agent 集成必需的关键项。
步骤二:在控制台配置飞书 IM 渠道
-
进入 弹性计算 Agent 控制台,在控制台左下角,单击 。
-
单击 添加 IM 渠道,在弹窗中配置以下参数:
-
单击 确定 保存,系统将自动完成回调地址验证。验证通过即表示 IM 渠道可用。
机器人在 IM 群内的操作权限由关联的 RAM 角色决定。建议为 IM 渠道关联具备运维操作权限的 RAM 角色,以便在群内直接完成异常修复、事件响应等运维动作。详见 权限配置。
步骤三:验证机器人连通性并拉群
-
在飞书客户端登录目标企业/组织账号(需与步骤一创建应用的租户一致)。
-
在飞书中搜索步骤一创建的机器人,直接发起 1v1 单聊对话,确认机器人已具备基础交互能力。
-
进入目标运维群,单击群右上角 ... 图标,单击 添加机器人,搜索并添加刚创建的机器人。
-
在群内 @ 机器人发送一条测试消息(例如:
你好),确认机器人已能正常响应群消息。
步骤四:创建 GPU 健康巡检定时任务
-
进入弹性计算 Agent 控制台,在左侧导航栏单击 。
-
找到 GPU 资源健康巡检 模版,单击 新建定时任务。
-
在 新建定时任务 弹窗中完成参数配置:
-
资源范围:选择需要巡检的 GPU 实例范围,支持按地域、标签、实例 ID 等维度灵活筛选。
-
调度周期:配置巡检频次,推荐每 2 小时或每 4 小时执行一次,可根据业务窗口自定义。
-
通知渠道:先开启 IM 渠道,然后选择步骤二配置的飞书渠道,并从下拉列表中选择目标群组。
选择目标群组时,需要先在群里 @ 过一次机器人(详见步骤三),群组 ID 才会出现在下拉列表中。
-
-
单击保存完成创建。任务将按调度周期自动执行。您可在 已配置任务 页签查看任务卡片状态,在 执行记录 页签查看历次执行结果与日志。
创建完成后建议在任务卡片上单击 立即执行 触发一次测试,验证巡检范围、诊断项及群通知是否正常送达。
巡检任务会将异常的资源发布为待响应事件,客户业务系统也可以选择订阅事件的方式感知异常,并在自建运维平台中进行响应处理。这种场景下可以不开启 IM 渠道,避免重复消息。
步骤五:在 IM 群内查看结果并闭环处理异常
定时任务触发后,Agent 会将巡检异常的设备明细及一键修复方案自动推送至 IM 运维群。运维人员无需登录控制台,直接在群内引用或回复消息即可完成全流程闭环处置:
1. 异常定位与一键修复
运维人员在群内直接回复 Agent,Agent 会结合巡检上下文进一步定位并给出修复方案。
对话示例:
-
列出本次巡检异常的实例明细 -
诊断 i-bp1xxxxxxx 的 GPU 异常原因
确认建议后直接在群内下发修复指令,由 Agent 执行底层运维操作:
-
修复所有问题 -
帮我修复
2. 响应系统运维事件
针对底层硬件维护、系统重启等阿里云主动运维事件引起的 GPU 异常,Agent 会在巡检结果中给出关联事件信息,支持直接在群内确认并响应。
对话示例:
-
查看 i-bp1xxxxxxx 的未处理系统事件 -
接受 i-bp1xxxxxxx 的运维事件
事件响应完成后,Agent 会将执行结果回传至群聊,同时 ECS 控制台的系统事件状态将自动同步更新。
其他场景:日常即时运维(@ 机器人)
除定时推送外,运维人员可随时在 IM 群内 @ 机器人,下发即席运维与咨询指令:
-
资源盘点:
统计本账号 ECS 实例总数并按地域分组 -
单机诊断:
诊断 i-bp1xxxxxxx 的当前健康状态 -
产品咨询:针对 GPU 规格、驱动兼容性等问题,随时向 Agent 提问获取标准知识答复。
费用参考
GPU 巡检以 Credits 计量。单实例基础巡检约消耗 1 个 Credit(约 0.05 元),未来会新增 GPU 深度巡检模式。
以 100 台 GPU 实例的规模为例,成本预估如下:
|
实例数量 |
单次巡检成本 |
每 2 小时一次(日成本) |
每 4 小时一次(日成本) |
|
100 台 |
约 5 元 |
约 60 元 |
约 30 元 |
上述费用仅供参考,实际以控制台计量数据为准。
您可在弹性计算 Agent 控制台左下角,单击 ,实时查看总 Credits、已消耗 Credits、剩余额度与消耗趋势。详见 计费说明。