数据集成的任务配置、非结构化数据处理和运维排障通常需要大量人工操作——单表同步配置需要 15–30 分钟,整库迁移动辄数天,告警排障需在多个监控界面之间反复切换。DataWorks 数据集成 AI Native 能力(DI Agent)将这些工作流升级为自然语言驱动的对话式交互,只需用一句话描述需求,Agent 即可自动完成从意图理解到执行的全流程。
DI Agent 是 Data Agent 在数据集成场景的垂直能力集,覆盖对话式任务配置、多模态数据处理、ChatDB 数据问答、智能诊断、周期巡检和 IM 频道集成六大能力。与传统 GUI 模式(参见数据集成概述)相比,DI Agent 以自然语言对话替代表单配置,支持单表离线、单表实时、整库离线、整库实时四类同步任务的统一管理。
核心能力
能力 | 适用场景 | 核心价值 |
对话式任务配置 | 新建或管理同步任务时不想逐项填写表单 | 一句话描述需求,Agent 自动完成数据源识别、字段映射、调度配置和发布上线 |
AI 数据处理(多模态 ETL) | 需要对图片、视频、音频、文档等非结构化数据进行批量 AI 处理 | 将大模型作为 ETL 算子嵌入流水线,支持任意数据来源的数据(结构化、非结构化)进行处理,并写入任意数据去向,如OSS/Mysql等读取处理后写入MaxCompute/Hologres/DLF等 |
ChatDB 数据问答与管理 | 快速查询已接入数据源的数据,或建库建表、修改表结构 | 用业务语言提问即可获得元信息和分析结果,对话完成 DDL 操作 |
AI 诊断 | 同步任务告警后需快速定位根因 | Agent 自动聚合多维日志和监控指标,定位根因并给出修复方案 |
智能周期巡检 | 全量同步链路缺乏系统性健康检查 | 按可配置周期主动扫描,生成结构化健康日报,问题在业务感知前被发现 |
IM 频道集成 | 不想打开控制台,希望直接通过 IM 操作 | 通过钉钉、微信、飞书与 Agent 交互,完成状态查询、诊断和任务管理 |
开通 DI Agent
进入 DataWorks 数据集成控制台。
从左侧导航栏找到AI Native下的Data Agent。
若当前账号尚未开通Data Agent,可根据界面指引进行购买,购买成功后即可进入数据集成 Data Agent界面。
首次使用数据集成Data Agent时,需要在对话框下方指定一个Serverless资源组,若无资源组,需要新建Serverless资源组。
首次提问后,DataWorks会为您生成Data Agent实例,以下我们简称数据集成Data Agent为DI Agent。
计费说明
使用 DI Agent 涉及以下两项费用:
费用类型 | 说明 |
Token 费用 | DI Agent 自身使用的大模型 Token 消耗费用,与 Data Agent 计费完全一致(DI Agent 本身是 Data Agent 的一部分)。计费说明参见:Data Agent 费用。 |
Serverless 资源组费用 | 每个 Agent 实例占用 Serverless 资源组的计算资源,按量付费,1 个 Agent 实例占 1 CU。默认 1 小时不使用自动停机,停机后不再产生资源组费用。 |
使用场景
对话式任务配置
能力说明
DI Agent 支持通过自然语言创建和管理单表离线、单表实时、整库离线、整库实时四类同步任务。无需逐项填写数据源、字段映射、调度策略等表单配置,只需描述同步需求,Agent 即可完成从意图理解到发布上线的全流程。主要能力包括:
自然语言建任务:用一句话描述同步需求(如"把 RDS 订单库整库实时同步到 Hologres,按天分区"),Agent 自动完成数据源识别、Schema 探测、字段映射、资源组分配和调度策略配置。
意图理解与多轮对话:Agent 能理解模糊或不完整的需求描述,通过追问补全关键参数(如分区策略、增量条件),确保生成的任务配置准确可用。
任务全生命周期管理:支持通过对话完成任务的编辑、暂停、恢复、删除和重跑,覆盖任务从创建到下线的完整生命周期。
批量任务操作:支持一次对话同时创建或修改多个同步任务,适用于整库迁移、批量调整调度策略等规模化场景。
使用示例
以下示例演示如何通过对话创建一个同步任务:
进入 DI Agent 对话界面。
输入同步需求,例如:"把 RDS 订单库整库实时同步到 Hologres,按天分区"。
Agent 自动探测源端 Schema,展示待同步表清单,确认后继续。
Agent 自动完成字段映射、资源组分配和调度策略配置。
预览任务配置摘要,确认无误后发布上线。
查看任务运行状态,验证数据已正常同步。
AI 数据处理(多模态 ETL)
能力说明
DI Agent 支持将大模型推理能力作为 ETL 算子嵌入数据流水线,对来源数据中的结构化数据,以及非结构化数据(图片、视频、音频、文档等)进行批量 AI 处理(识别、分类打标、转写、翻译、摘要、向量化等,以及自定义处理逻辑),处理结果直接写入所有数据集成支持去向(如 MaxCompute、Hologres 或 DLF 数据湖等),让各种数据得以合适的格式进入企业数据资产体系。主要能力包括:
自然语言定义处理逻辑:用自然语言描述处理意图(如"识别图片中的商品类别并输出标签"),Agent 自动生成对应的处理 Pipeline 配置。
三段式 Pipeline 编排:Agent 自动编排 Source → Transform(大模型推理)→ Sink 流水线,无需额外编写脚本或搭建推理服务。
结果直写各种目的端:比如处理结果直接写入 MaxCompute、Hologres 或 DLF 数据湖,无需额外搬运。
数据 Embedding:支持对处理后的数据进行向量化并写入指定存储端,便于后续 RAG 使用。
批量与周期运行:支持百万级文件的批量处理,可配置定时周期运行以持续增量处理新增数据。
使用示例
以下示例演示如何处理 OSS 中的商品图片并将结果写入 MaxCompute:
进入 AI 数据处理功能入口。
输入处理需求,例如:"读取AWS S3 bucket 下的商品图片 → 调用大模型识别分类标签 → 结果写入 MySQL 表"。
Agent 自动编排三段式 Pipeline:Source(S3)→ Transform(大模型推理)→ Sink(MySQL)。
ChatDB 自动识别目标表,生成对应 SQL。
查看返回的图表结果(折线图/柱状图等自动匹配)。
若需要对特征工程数据库中的数据,进行Embedding向量化至Hologres中,以便做RAG使用。可以用自然语言定义Embedding:"继续做Embedding → 调用大模型进行向量化 → 结果写入 Hologres 表"。
Agent 自动编排三段式 Pipeline:Source(MySQL)→ Transform(大模型向量化)→ Sink(Hologres)。
ChatDB 自动识别目标表,生成对应 SQL。
查看返回的结果。
ChatDB 数据问答与管理
ChatDB 复用 DataWorks 数据集成已接入的 80+ 数据源连接器(MySQL、Oracle、Kafka、MaxCompute、Hologres、MongoDB、OSS 等),已接入的数据源不仅是同步任务的源端和目标端,同时也是可对话的分析对象。无需记忆表名和字段名,用业务语言提问即可获得数据源元信息和业务分析结果。主要能力包括:
业务语言即问即答:用业务语言直接提问(如"最近 7 天订单趋势"),Agent 自动翻译为精确查询并返回结果。
多轮追问与图表化洞察:支持在初始结果基础上继续追问细化分析(如"按地区拆分""只看 TOP 10"),查询结果自动匹配可视化图表(折线图、柱状图、饼图等)。
建库建表:通过对话完成数据库和表的创建,Agent 根据业务描述自动生成建表 DDL(字段类型、主键、索引、分区策略等),支持在 80+ 数据源上直接执行。
表结构变更:支持对已有表进行字段增删改、类型调整、索引维护等操作,用业务语言描述意图即可(如"给订单表加一个物流状态字段"),Agent 自动映射为对应的 ALTER 语句并执行。
查询数据源库表结构及业务含义
ChatDB 支持通过自然语言探索数据库元数据并解读业务含义。指定目标数据源后,Agent 自动连接并逐层展开库、表、字段的完整结构信息,包括表名、字段类型、主外键关系、索引约束等元数据细节。Agent 还会结合表名、字段命名及数据特征解读库表的业务含义,帮助快速理解每张表的用途、字段代表的业务概念及表间关联关系。
适用场景:新接手陌生系统需要快速了解数据全貌,以及跨团队协作时非技术人员需要理解数据结构。
数据源样例数据预览
ChatDB 支持通过自然语言查看任意表的样例数据。指定目标表后,Agent 自动拉取具有代表性的数据样本并加以说明,无需编写 SQL 即可直观确认表中存储的数据内容和格式。
适用场景:快速验证数据内容、了解字段实际取值,以及帮助非技术人员在跨团队协作中理解数据含义。
统计分析图表展示
ChatDB 支持自然语言驱动的数据分析与可视化。描述分析意图(例如"查看最近三个月各品类的销售趋势"或"对比各区域的订单占比"),Agent 自动定位数据源、生成查询逻辑,并将分析结果以折线图、柱状图、饼图等图表形式呈现,无需编写 SQL 或使用专业可视化工具。
适用场景:业务人员快速验证经营假设,以及技术团队排查问题时即时获取趋势数据。
库表结构诊断与优化建议
ChatDB 支持智能诊断指定数据源的库表结构。Agent 自动扫描目标数据库的表结构设计,从命名规范、字段类型选择、索引覆盖、主外键完整性、冗余字段、分区策略等维度审查,识别潜在的设计缺陷,并给出具体的优化建议和改进方向。
适用场景:新建库表的设计评审、存量系统的技术债务梳理,以及数据库性能问题的根因排查。
数据库性能排查和优化
ChatDB 支持数据库性能诊断与慢 SQL 根因分析。描述性能问题或指定目标数据源后,Agent 自动分析导致查询缓慢的各类因素,包括全表扫描、索引失效、JOIN 顺序不合理、子查询嵌套过深、数据类型隐式转换、统计信息过期、锁竞争与热点表等常见性能瓶颈,并结合实际执行计划说明每条慢 SQL 的根因,给出索引调整、查询改写、表结构重构等针对性优化建议。
适用场景:线上突发性能故障的应急排查,以及日常巡检中对潜在慢查询的主动治理。
AI 诊断
能力说明
收到同步任务告警后,可在 Agent 对话界面描述问题或粘贴告警信息,Agent 自动聚合任务日志、资源监控指标、源端数据库状态等多维度信息,定位根因并给出修复方案,将排障时长从小时级缩短到分钟级。每次诊断结果自动归档为知识库条目,下次同类问题直接匹配已有解法,不因人员轮换而从零排查。主要能力包括:
多维信息聚合:自动采集并关联任务日志、资源监控指标、源端数据库状态、网络带宽等多维度信息,在一个视图内呈现完整上下文。
根因定位:基于聚合信息自动分析故障根因(如 CU 不足、源端锁表、网络带宽瓶颈、配置错误等),给出明确结论。
修复方案推荐与一键执行:定位根因后给出可操作的修复建议(扩容资源组、重启实例、调整并发度等),确认后支持一键执行。
经验自动沉淀:每次诊断结果自动归档为知识库条目,下次同类问题直接匹配已有解法。
使用示例
告警触发后,进入 Agent 对话界面,描述问题或粘贴告警信息。
Agent 自动聚合任务日志、资源监控指标、源端状态等多维信息。
Agent 输出根因分析报告(如:CU 不足导致消费速率低于生产速率)。
Agent 给出修复方案建议(如:扩容资源组 CU 配额或重启失败实例),确认后执行修复。
智能周期巡检
能力说明
DI Agent 支持按可配置周期主动扫描全量同步链路的运行状态,将运维模式从被动响应转为主动治理。巡检结果以结构化报表呈现,高风险任务按影响范围和紧急程度排列优先级,每项附带具体操作建议和预期收益评估。主要能力包括:
可配置巡检周期:支持每小时、每天、每周和仅手动四种巡检频率,适应不同业务对健康检查实时性的要求。
全量链路主动扫描:Agent 按周期自动扫描全量同步链路的运行状态,主动发现潜在风险,无需人工逐项检查。
结构化健康日报:巡检结果包含关键指标概览、异常任务清单和风险等级评估,运维团队可在 3 分钟内掌握整体健康状况。
优先级排列与操作建议:高风险任务按影响范围和紧急程度排列优先级,每项附带具体操作建议和预期收益评估。
使用示例
进入智能巡检配置页面,选择巡检周期(每小时、每天或每周)。
配置巡检范围(全量链路或指定项目空间/资源组)。
Agent 按周期自动执行巡检,生成结构化日报。
查看日报中的关键指标概览和高风险任务清单,按优先级处理风险项。
IM 频道集成
DI Agent 支持接入日常使用的 IM 消息频道(钉钉、微信、飞书等),无需打开 DataWorks 控制台即可完成状态查询、故障诊断、任务启停和巡检报告推送等操作。配置方式如下:
打开 Agent 界面,找到消息导航栏的频道配置。
添加对应 IM 频道的应用,填入应用配置信息。
单击运行使配置生效。
配置完成后,即可在 IM 端直接与 DI Agent 交互。
后续步骤
Data Agent 概述:了解 DataWorks Data Agent 的整体能力和使用方式。
数据集成概述:了解传统 GUI 模式下的数据集成基础概念和操作方式。