除了自然语言问答,EMR AI助手还内置了12个专家技能,分别面向慢查询、执行计划、资源水位、数据导入、物化视图等运维场景。本文介绍各专家技能的命令、解决什么问题、需要您提供哪些信息,帮助您在遇到问题时快速选对技能。
专家技能与自然语言问答的区别
直接用自然语言提问时,AI助手需要先识别您的意图,再决定读取哪些数据。选择专家技能相当于提前告诉AI助手"按哪套方法排查",AI助手会按该场景固定的诊断路径收集证据,输出结构也更稳定。
因此,问题类型已经明确时(例如确定是导入失败),建议直接选择对应技能;现象不清楚时(例如只知道业务变慢),先用自然语言描述,让AI助手判断方向。
调用方式
在AI助手的对话窗口中,通过斜杠命令调用专家技能。两种方式都可以:
输入斜杠(
/)调出技能菜单,从列表中选择需要的技能。直接输入完整命令,例如
/slow-sql,再补充实例、时间范围等信息。
命令后面用@指定目标实例,再跟上问题描述。完整格式如下:
/技能命令 @实例名 问题描述
技能菜单中展示的技能范围与账号权限和实例类型有关,实际可用技能以对话窗口中的菜单为准。
专家技能列表
各专家技能的命令和适用范围如下。
命令 | 技能 | 解决什么问题 | 需要您提供的信息 | 输出内容 |
| 慢查询分析 | 找出指定时间段内最慢的SQL,并判断主要瓶颈在SQL写法、表设计、资源竞争还是数据倾斜。 | 实例、时间范围。已有目标SQL或Query ID时一并提供。 | 慢SQL排名、瓶颈分类、优化建议。 |
| Profile诊断 | 分析单条SQL的Query Profile(查询执行详情),定位到具体算子级别的耗时来源。 | Query ID或Profile内容,以及对应的SQL文本。 | 各阶段耗时、瓶颈算子及证据、验证方法。 |
| 资源诊断 | 分析CPU、内存、磁盘和IO水位异常,判断压力来自查询、导入、Compaction(数据合并)还是节点异常。 | 实例、时间范围、观察到的业务现象。 | 资源消耗来源、关联任务、处置建议。 |
| Compaction诊断 | 定位版本堆积、Compaction失败以及受影响的表和分区。 | 告警时间、涉及的表或分区、Compaction Score。 | 堆积范围、原因判断、低风险处置动作。 |
| 建表设计 | 为新表选择表模型、分区、分桶和排序键。 | 查询模式、写入方式、数据量与增长预期。 | 建表方案,包含表模型、分区、分桶和排序键。 |
| SQL调优 | 改写已知的慢SQL,优化执行计划。 | SQL文本、相关表结构,有Profile时一并提供。 | 改写建议、预期收益、改动风险。 |
| 数据导入 | 排查导入失败、延迟和吞吐不达预期的问题。 | 导入方式、任务名称、报错信息。 | 错误分类、链路定位、修复建议。 |
| 物化视图 | 分析物化视图刷新失败、状态失效和查询未命中的原因。 | 物化视图名称、基表、查询SQL、刷新记录。 | 状态判断、刷新问题定位、命中优化建议。 |
| 实例巡检 | 对实例做一次多维度体检,适合周期巡检、变更前检查和故障后复核。 | 实例、需要重点检查的范围。 | 健康评分、风险项、优化清单。 |
| 连接诊断 | 排查客户端连接实例失败的问题。 | 客户端类型、连接入口、报错信息、网络环境。 | 按网络、认证、权限分层给出的结论。 |
| Catalog排查 | 排查湖仓Catalog配置和外表访问异常。 | Catalog类型、配置内容、报错信息。 | 按元数据、存储、权限分层的排查结论。 |
| 异常事件 | 分析错误日志和异常事件,判断影响范围。 | 错误摘要、发生时间、实例。 | 影响范围、原因判断、下一步动作。 |
按现象选择技能
如果不确定该用哪个技能,可以按下表从现象反查。
您遇到的现象 | 建议使用的技能 |
业务反馈查询变慢,但不清楚是哪些SQL。 | 慢查询分析( |
已定位到某条SQL慢,需要知道慢在哪一步。 | 先用Profile诊断( |
CPU、内存或磁盘水位突然升高。 | 资源诊断( |
收到Compaction相关告警,或写入后查询变慢。 | Compaction诊断( |
导入任务失败、报错或延迟变大。 | 数据导入( |
物化视图没有按预期刷新,或查询没有命中物化视图。 | 物化视图( |
客户端或BI工具连不上实例。 | 连接诊断( |
查询Iceberg、Hive等外表报错。 | Catalog排查( |
准备上新业务,需要确认表怎么建。 | 建表设计( |
变更前后需要做一次实例体检。 | 实例巡检( |
日志中出现大量报错,但不确定影响范围。 | 异常事件( |
只知道业务受影响,看不出属于哪一类问题。 | 先用自然语言描述现象,由AI助手判断方向。 |
提问方法
同一个技能,给出的信息越完整,结论越具体。建议按以下顺序组织问题。
输入技能命令,例如
/slow-sql。用
@指定目标实例,避免多实例场景下上下文混淆。给出明确的时间范围,例如"2026-08-06 10:00到11:00",而不是"最近"、"刚才"。
补充关键证据:SQL文本、Query ID、Profile、错误摘要、任务名称或告警名称。
说明期望的输出,例如要求区分确定结论和待验证假设,或要求给出验证方法。
下表是几个可以直接参考的提问示例,其中<INSTANCE_NAME>替换为您的实例名。
场景 | 提问示例 |
慢查询分析 |
|
Profile诊断 |
|
资源诊断 |
|
导入排障 |
|
湖仓排查 |
|
实例巡检 |
|
AI助手基于实例的实际运行数据分析,同一个问题在不同时间点提问,结论可能不同。排查过程中建议保留Query ID、时间范围等关键信息,便于后续复核。
如何判断诊断结论是否可用
一份可以用于运维决策的诊断输出,通常包含以下内容。如果输出中缺少某一项,可以在对话中继续追问。
分析对象:本次分析针对哪个实例、哪段时间、哪个任务、哪条SQL或哪个告警。
证据来源:结论依据的是Query Profile、监控指标、日志、任务执行记录还是实例配置。
根因判断:区分已确认的结论和还需要验证的假设。
处理建议:区分可以直接执行的低风险动作和需要审批的高风险变更。
风险提示:说明建议动作的影响范围、回滚方式和不适用的场景。
后续动作:需要继续使用哪个专家技能,或需要人工检查哪些内容。
使用限制
AI助手输出诊断结论和建议,不会自动修改实例配置、扩缩容或重启实例。涉及生产变更的操作需要您确认后按变更流程执行。
AI助手在当前账号的授权范围内读取运维数据。RAM用户需要主账号完成授权,详情请参见EMR AI助手快速入门。
诊断依据以系统表、Query Profile、监控指标、任务执行记录和错误摘要等运维数据为主,不用于分析业务表中的明细数据。
不要在对话中输入密码、AccessKey、SecretKey、Token、Cookie、Webhook密钥或未脱敏的业务数据。
常见问题
AI助手会自动修改实例配置吗?
不会。AI助手只输出诊断结论和建议。配置修改、扩缩容、重启、权限调整等动作需要您确认后自行执行。
一个问题应该用哪个技能?
问题类型明确时直接选对应技能,参见按现象选择技能。不确定时先用自然语言描述现象,AI助手会判断方向并给出下一步建议。
技能菜单里找不到某个技能怎么办?
技能菜单展示的范围与账号权限和实例类型有关。确认账号已获得对应实例的操作权限后重新打开菜单。仍然找不到时,可以先用自然语言描述问题,AI助手会按相近的诊断路径分析。
如何提高诊断准确率?
提供明确的实例、时间范围、问题现象、SQL或Query ID、错误摘要,以及业务的正常基线数据。信息越完整,越容易形成可验证的结论。
诊断结论可以直接执行吗?
低风险动作(例如调整查询写法、补充统计信息)可以先在测试环境验证后执行。涉及扩缩容、参数变更、重启等高风险动作,需要结合实际监控数据人工复核,并按生产变更流程审批。