EMR AI助手是阿里云EMR提供的智能运维与开发辅助服务。本文介绍AI助手的核心优势、功能模块、覆盖场景以及版本与规格。
功能概述
EMR AI助手是阿里云EMR提供的智能运维与开发辅助服务。基于大语言模型,AI助手可连接您的EMR集群/实例,理解集群/实例状态和监控数据,为您提供从问答咨询、性能诊断、健康巡检到主动推送的全栈AI运维能力,成为您的7×24大数据专家。AI助手现已同时支持EMR Serverless StarRocks与EMR Serverless Spark:在StarRocks实例诊断与运维之外,还提供Spark作业诊断与运维管理能力,可在同一入口按产品维度切换使用。
核心优势
连接真实集群,而非通用问答
AI助手直接连接您的StarRocks实例与Serverless Spark工作空间,可读取系统表、查询Profile、监控指标、作业日志与队列资源等运行时数据。所有诊断和建议基于集群的真实状态生成,而非基于通用知识的泛化回答。
从被动应答到主动运维
AI助手不仅在您提问时工作。通过配置智能日报、巡检报告和告警推送(含Spark巡检日报、Spark Workspace定期巡检等),AI助手可7×24持续监控集群状态,主动发现问题并推送到钉钉/飞书,无需人工值守。
多入口覆盖,随时可用
支持通过EMR控制台、钉钉/飞书IM通道、API接口多种方式接入,融入您现有的运维工作流,无需切换工具。
功能模块
AI助手包含以下核心功能模块:
对话窗口
控制台内置的AI对话界面,支持与AI助手进行多轮对话交互。
支持自然语言提问,AI助手自动识别意图并连接集群进行分析。
支持上下文多轮对话,可在一次会话中逐步深入排查问题。
对话历史自动保存,可随时回顾之前的诊断记录。
支持选择关联实例,对不同实例不同场景进行分析。
支持在Serverless StarRocks与Serverless Spark之间切换产品,针对不同产品进行问答与诊断。
支持选择专家技能,一键调用专项诊断流程。StarRocks内置性能诊断、开发助手、运维管理、湖仓排障四类专家技能,Spark内置作业诊断、运维管理两类专家技能。
任务中心
管理AI助手的定时任务和历史执行记录,支持按产品维度(Serverless StarRocks / Serverless Spark)分别查看和管理任务。
任务配置:
配置智能日报的推送时间和频率。
配置巡检报告的执行周期。
配置慢SQL告警的阈值和推送规则。
StarRocks内置3项定时任务(全量健康巡检、运行中SQL巡检、历史慢SQL巡检)和6项告警任务(CheckPoint异常告警、Compaction异常告警、机器负载异常告警、Routine Load异常告警、物化视图异常告警、查询延迟异常告警)。
Spark内置5项系统定时任务(Spark Workspace定期巡检、Spark巡检日报推送、Spark慢任务专家、Spark失败作业诊断汇总、Spark队列资源巡检)。
支持启用/暂停/删除任务,支持设置触发阈值。
执行记录:
查看所有任务的历史执行结果。
查看每次日报/巡检/告警的完整内容。
按时间、类型、状态筛选记录。
执行失败时可查看失败原因。
IM配置
将AI助手接入企业IM工具,团队成员在工作群内即可直接使用。
支持钉钉、飞书、企业微信接入。
配置对应群组的Webhook地址和签名密钥。
API/SDK对接
支持通过API/SDK,将EMR AI助手能力内置于您的企业平台和自动化运维流程中,详情请参见通过API调用EMR AI助手。
覆盖场景(Serverless StarRocks)
性能诊断
当集群出现延迟飙升、查询超时、资源打满等问题时,AI助手可快速定位根因并给出修复方案。
场景 | AI助手能做什么 | 示例问题 |
慢查询定位 | 分析TOP SQL,按耗时/CPU/扫描行数多维排序 | "最近有什么慢查询?" |
执行计划分析 | 深度分析Query Profile,定位算子级瓶颈 | "这条查询跑了30秒,帮我看下Profile" |
资源瓶颈诊断 | 分析CPU/内存/磁盘/IO使用状态,识别热点 | "CPU突然飙到100%了" |
Compaction积压 | 分析版本堆积、写入放大,给出参数调优建议 | "版本数告警了,怎么处理?" |
集群运维
覆盖日常巡检、弹性伸缩、配置管理等运维操作。
场景 | AI助手能做什么 | 示例问题 |
健康巡检 | 8维度全面体检,输出健康评分和优化建议 | "帮我做一次全面体检" |
弹性伸缩 | 分析历史负载,评估是否需要扩缩容 | "大促前需不需要加节点?" |
连接诊断 | 排查连接失败、超时、白名单问题 | "应用突然连不上集群了" |
配置调优 | 对比最佳实践,推荐参数调整 | "Compaction线程数应该设多少?" |
实例管理 | 查看实例信息、版本、账号权限等 | "当前实例是什么规格?" |
异常排查
场景 | AI助手能做什么 | 示例问题 |
报错诊断 | 匹配已知问题库,提供修复方案 | "报了这个错怎么办?" |
节点故障 | 分析BE/FE崩溃原因,给出恢复步骤 | "BE挂了什么原因?" |
OOM分析 | 定位内存消耗源头,给出参数调整建议 | "查询报OOM了" |
导入失败 | 分析导入错误原因,给出修复方案 | "Stream Load报错了" |
主动运维
AI助手可按计划自动执行分析任务,并将结果推送到IM通道。
推送类型 | 触发方式 | 推送内容 |
智能日报 | 每日定时 | 集群健康评分 + 异常事件诊断 + 趋势对比 + 优化建议 |
巡检报告 | 每周定时 | 8维度健康评分 + 全量检查 + 优化建议清单 |
告警推送 | 监控事件触发 | 告警详情 + AI根因诊断 + 建议操作 |
慢SQL告警 | 阈值触发 | 慢SQL详情 + Profile分析 + 优化SQL |
所有定时任务和推送记录均可在任务中心中查看和管理。
咨询答疑
场景 | AI助手能做什么 | 示例问题 |
产品使用 | 基于StarRocks最新文档回答使用问题 | "物化视图怎么创建?" |
最佳实践 | 提供建表、导入、查询优化等最佳实践 | "分桶数怎么选?" |
功能咨询 | 解答StarRocks功能特性和适用场景 | "Colocate Join什么场景下用?" |
生态对接 | Paimon/Iceberg/Fluss/Kafka等外部数据源接入指导 | "怎么配置Paimon Catalog?" |
开发辅助
场景 | AI助手能做什么 | 示例问题 |
建表设计 | 根据查询模式推荐分区分桶策略、排序键、索引配置 | "日均5亿行订单表怎么建?" |
SQL优化 | SQL改写、Join策略调整、谓词下推验证 | "帮我优化这条SQL" |
数据导入 | 生成Stream Load/Routine Load/Broker Load方案 | "Kafka数据怎么实时导入?" |
物化视图 | 创建建议、刷新策略配置、状态检查与异常修复 | "这个报表查询能用MV加速吗?" |
覆盖场景(Serverless Spark)
作业诊断
当Spark作业出现耗时超预期、执行失败、性能劣化等问题时,AI助手可快速定位原因并给出优化建议。
场景 | AI助手能做什么 | 示例问题 |
慢作业分析 | 按耗时、CU消耗和数据扫描量定位TOP慢作业,区分长期稳定与真实劣化,给出优化顺序 | "最近24小时哪些作业最耗CU?" |
失败作业诊断 | 分析失败或异常作业的日志、退出码、OOM等信息,按失败族聚类给出根因与修复建议 | "这个作业为什么失败了?" |
相似作业对比 | 对比周期性相似作业的历史运行,识别性能劣化 | "今天的作业为什么比昨天慢?" |
运维管理
覆盖资源诊断、工作空间巡检等日常运维操作。
场景 | AI助手能做什么 | 示例问题 |
资源诊断 | 分析队列CU水位、资源等待、作业排队原因 | "作业一直在排队是什么原因?" |
工作空间巡检 | 全面巡检队列水位、作业成功率、CU消耗趋势,输出巡检报告 | "帮我对Workspace做一次巡检" |
主动运维
AI助手可按计划自动执行Spark分析任务,并将结果推送到IM通道。
推送类型 | 触发方式 | 推送内容 |
Spark巡检日报 | 每日定时 | 前一天Workspace巡检日报摘要与报告链接 |
Spark Workspace定期巡检 | 定期定时 | Workspace稳定性、性能、成本与用量的可追溯HTML报告 |
慢作业/失败作业汇总 | 每日定时 | TOP慢作业优化顺序、失败作业族根因结论与修复建议 |
队列资源巡检提示 | 每日定时+阈值触发 | 队列CU水位、持续未运行作业、近7日CU增长超阈值提示 |
所有Spark定时任务和推送记录均可在任务中心中查看和管理。
版本与规格
每个用户提供100万免费Token额度,可直接体验。免费额度用尽后,可开通按量付费,按实际消耗的Token用量结算,计费规则请参见EMR AI助手按量计费说明。
额度与功能规格按账号维度统一计算,Serverless StarRocks与Serverless Spark场景共用同一Token额度与功能规格。
快速上手指引请参见EMR AI助手快速入门。
声明
本服务输出内容由人工智能模型生成,我们无法完全保证本服务模型的安全、可靠、可用和持续稳定及生成内容的合规、完整和准确。生成内容不代表阿里云立场和观点。我们将不断提升服务质量,但不承诺服务的可用性和可靠性,并不对您使用本服务的结果负责。请谨慎判断生成内容,不过度依赖。若您根据生成内容作出的判断或行为导致您、其他用户或阿里云遭受任何损失或损害,您将承担全部责任和后果。
您的所有使用行为由您自行负责,请确保您发布、上传、链接或通过服务提供的任何内容合法合规,不损害社会公共秩序,不侵犯他人合法权益,不编造或传播虚假信息等。
使用本服务的诊断功能需要收集诊断实例的相关数据,包括您数据库实例的基本信息、系统表内容、实例的监控指标、事件和日志中的关键错误信息,以及Spark工作空间的作业运行信息、队列与资源指标等。
常见问题
Q:AI助手会读取我的业务数据吗?
A:AI助手仅读取集群的系统表(如information_schema)、Query Profile、监控指标等运维数据,用于诊断和分析。不会读取您的业务表数据内容。
Q:AI助手的操作权限如何管控?
A:AI助手的操作范围受RAM权限控制。当前以只读诊断和分析为主,写操作(如配置变更)需要您在对话中明确确认后才会执行。
Q:Token额度用完了会怎样?
A:Token额度用完后,AI助手将暂停服务,您可以开启超量计费。建议关注控制台中的额度使用情况,及时调整。
Q:多个实例如何管理?
A:一个AI助手订阅可关联同账号下的多个StarRocks实例及Serverless Spark工作空间。在对话中指定实例或工作空间名即可切换分析目标。定时任务可分别为每个实例或工作空间配置独立的推送规则。
Q:定时任务执行失败了怎么办?
A:在任务中心的执行记录中可查看失败原因。常见原因包括:实例处于停机状态、IM通道连接断开、Token额度不足。修复问题后任务会在下次触发时自动恢复。