数据集成 DI Agent

更新时间:
复制 MD 格式

数据集成的任务配置、非结构化数据处理和运维排障通常需要大量人工操作——单表同步配置需要 15–30 分钟,整库迁移动辄数天,告警排障需在多个监控界面之间反复切换。DataWorks 数据集成 AI Native 能力(DI Agent)将这些工作流升级为自然语言驱动的对话式交互,只需用一句话描述需求,Agent 即可自动完成从意图理解到执行的全流程。

DI Agent 是 Data Agent 在数据集成场景的垂直能力集,覆盖对话式任务配置、多模态数据处理、ChatDB 数据问答、智能诊断、周期巡检和 IM 频道集成六大能力。与传统 GUI 模式(参见数据集成概述)相比,DI Agent 以自然语言对话替代表单配置,支持单表离线、单表实时、整库离线、整库实时四类同步任务的统一管理。

核心能力

能力

适用场景

核心价值

对话式任务配置

新建或管理同步任务时不想逐项填写表单

一句话描述需求,Agent 自动完成数据源识别、字段映射、调度配置和发布上线

AI 数据处理(多模态 ETL)

需要对图片、视频、音频、文档等非结构化数据进行批量 AI 处理

将大模型作为 ETL 算子嵌入流水线,支持任意数据来源的数据(结构化、非结构化)进行处理,并写入任意数据去向,如OSS/Mysql等读取处理后写入MaxCompute/Hologres/DLF

ChatDB 数据问答与管理

快速查询已接入数据源的数据,或建库建表、修改表结构

用业务语言提问即可获得元信息和分析结果,对话完成 DDL 操作

AI 诊断

同步任务告警后需快速定位根因

Agent 自动聚合多维日志和监控指标,定位根因并给出修复方案

智能周期巡检

全量同步链路缺乏系统性健康检查

按可配置周期主动扫描,生成结构化健康日报,问题在业务感知前被发现

IM 频道集成

不想打开控制台,希望直接通过 IM 操作

通过钉钉、微信、飞书与 Agent 交互,完成状态查询、诊断和任务管理

开通 DI Agent

  1. 进入 DataWorks 数据集成控制台

  2. 从左侧导航栏找到AI Native下的Data Agent。

  3. 若当前账号尚未开通Data Agent,可根据界面指引进行购买,购买成功后即可进入数据集成 Data Agent界面。

  4. 首次使用数据集成Data Agent时,需要在对话框下方指定一个Serverless资源组,若无资源组,需要新建Serverless资源组

  5. 首次提问后,DataWorks会为您生成Data Agent实例,以下我们简称数据集成Data AgentDI Agent

计费说明

使用 DI Agent 涉及以下两项费用:

费用类型

说明

Token 费用

DI Agent 自身使用的大模型 Token 消耗费用,与 Data Agent 计费完全一致(DI Agent 本身是 Data Agent 的一部分)。计费说明参见:Data Agent 费用

Serverless 资源组费用

每个 Agent 实例占用 Serverless 资源组的计算资源,按量付费,1 个 Agent 实例占 1 CU。默认 1 小时不使用自动停机,停机后不再产生资源组费用。

使用场景

对话式任务配置

能力说明

DI Agent 支持通过自然语言创建和管理单表离线、单表实时、整库离线、整库实时四类同步任务。无需逐项填写数据源、字段映射、调度策略等表单配置,只需描述同步需求,Agent 即可完成从意图理解到发布上线的全流程。主要能力包括:

  • 自然语言建任务:用一句话描述同步需求(如"把 RDS 订单库整库实时同步到 Hologres,按天分区"),Agent 自动完成数据源识别、Schema 探测、字段映射、资源组分配和调度策略配置。

  • 意图理解与多轮对话:Agent 能理解模糊或不完整的需求描述,通过追问补全关键参数(如分区策略、增量条件),确保生成的任务配置准确可用。

  • 任务全生命周期管理:支持通过对话完成任务的编辑、暂停、恢复、删除和重跑,覆盖任务从创建到下线的完整生命周期。

  • 批量任务操作:支持一次对话同时创建或修改多个同步任务,适用于整库迁移、批量调整调度策略等规模化场景。

使用示例

以下示例演示如何通过对话创建一个同步任务:

  1. 进入 DI Agent 对话界面。

  2. 输入同步需求,例如:"把 RDS 订单库整库实时同步到 Hologres,按天分区"。

  3. Agent 自动探测源端 Schema,展示待同步表清单,确认后继续。

  4. Agent 自动完成字段映射、资源组分配和调度策略配置。

  5. 预览任务配置摘要,确认无误后发布上线。

  6. 查看任务运行状态,验证数据已正常同步。

AI 数据处理(多模态 ETL)

能力说明

DI Agent 支持将大模型推理能力作为 ETL 算子嵌入数据流水线,对来源数据中的结构化数据,以及非结构化数据(图片、视频、音频、文档等)进行批量 AI 处理(识别、分类打标、转写、翻译、摘要、向量化等,以及自定义处理逻辑),处理结果直接写入所有数据集成支持去向(如 MaxCompute、Hologres 或 DLF 数据湖等),让各种数据得以合适的格式进入企业数据资产体系。主要能力包括:

  • 自然语言定义处理逻辑:用自然语言描述处理意图(如"识别图片中的商品类别并输出标签"),Agent 自动生成对应的处理 Pipeline 配置。

  • 三段式 Pipeline 编排:Agent 自动编排 Source → Transform(大模型推理)→ Sink 流水线,无需额外编写脚本或搭建推理服务。

  • 结果直写各种目的端:比如处理结果直接写入 MaxCompute、Hologres 或 DLF 数据湖,无需额外搬运。

  • 数据 Embedding:支持对处理后的数据进行向量化并写入指定存储端,便于后续 RAG 使用。

  • 批量与周期运行:支持百万级文件的批量处理,可配置定时周期运行以持续增量处理新增数据。

使用示例

以下示例演示如何处理 OSS 中的商品图片并将结果写入 MaxCompute:

  1. 进入 AI 数据处理功能入口。

  2. 输入处理需求,例如:"读取AWS S3 bucket 下的商品图片 → 调用大模型识别分类标签 → 结果写入 MySQL 表"。

  3. Agent 自动编排三段式 Pipeline:Source(S3)→ Transform(大模型推理)→ Sink(MySQL)。

  4. ChatDB 自动识别目标表,生成对应 SQL。

  5. 查看返回的图表结果(折线图/柱状图等自动匹配)。

  6. 若需要对特征工程数据库中的数据,进行Embedding向量化至Hologres中,以便做RAG使用。可以用自然语言定义Embedding:"继续做Embedding → 调用大模型进行向量化 → 结果写入 Hologres 表"。

  7. Agent 自动编排三段式 Pipeline:Source(MySQL)→ Transform(大模型向量化)→ Sink(Hologres)。

  8. ChatDB 自动识别目标表,生成对应 SQL。

  9. 查看返回的结果。

ChatDB 数据问答与管理

ChatDB 复用 DataWorks 数据集成已接入的 80+ 数据源连接器(MySQL、Oracle、Kafka、MaxCompute、Hologres、MongoDB、OSS 等),已接入的数据源不仅是同步任务的源端和目标端,同时也是可对话的分析对象。无需记忆表名和字段名,用业务语言提问即可获得数据源元信息和业务分析结果。主要能力包括:

  • 业务语言即问即答:用业务语言直接提问(如"最近 7 天订单趋势"),Agent 自动翻译为精确查询并返回结果。

  • 多轮追问与图表化洞察:支持在初始结果基础上继续追问细化分析(如"按地区拆分""只看 TOP 10"),查询结果自动匹配可视化图表(折线图、柱状图、饼图等)。

  • 建库建表:通过对话完成数据库和表的创建,Agent 根据业务描述自动生成建表 DDL(字段类型、主键、索引、分区策略等),支持在 80+ 数据源上直接执行。

  • 表结构变更:支持对已有表进行字段增删改、类型调整、索引维护等操作,用业务语言描述意图即可(如"给订单表加一个物流状态字段"),Agent 自动映射为对应的 ALTER 语句并执行。

查询数据源库表结构及业务含义

ChatDB 支持通过自然语言探索数据库元数据并解读业务含义。指定目标数据源后,Agent 自动连接并逐层展开库、表、字段的完整结构信息,包括表名、字段类型、主外键关系、索引约束等元数据细节。Agent 还会结合表名、字段命名及数据特征解读库表的业务含义,帮助快速理解每张表的用途、字段代表的业务概念及表间关联关系。

适用场景:新接手陌生系统需要快速了解数据全貌,以及跨团队协作时非技术人员需要理解数据结构。

数据源样例数据预览

ChatDB 支持通过自然语言查看任意表的样例数据。指定目标表后,Agent 自动拉取具有代表性的数据样本并加以说明,无需编写 SQL 即可直观确认表中存储的数据内容和格式。

适用场景:快速验证数据内容、了解字段实际取值,以及帮助非技术人员在跨团队协作中理解数据含义。

统计分析图表展示

ChatDB 支持自然语言驱动的数据分析与可视化。描述分析意图(例如"查看最近三个月各品类的销售趋势"或"对比各区域的订单占比"),Agent 自动定位数据源、生成查询逻辑,并将分析结果以折线图、柱状图、饼图等图表形式呈现,无需编写 SQL 或使用专业可视化工具。

适用场景:业务人员快速验证经营假设,以及技术团队排查问题时即时获取趋势数据。

库表结构诊断与优化建议

ChatDB 支持智能诊断指定数据源的库表结构。Agent 自动扫描目标数据库的表结构设计,从命名规范、字段类型选择、索引覆盖、主外键完整性、冗余字段、分区策略等维度审查,识别潜在的设计缺陷,并给出具体的优化建议和改进方向。

适用场景:新建库表的设计评审、存量系统的技术债务梳理,以及数据库性能问题的根因排查。

数据库性能排查和优化

ChatDB 支持数据库性能诊断与慢 SQL 根因分析。描述性能问题或指定目标数据源后,Agent 自动分析导致查询缓慢的各类因素,包括全表扫描、索引失效、JOIN 顺序不合理、子查询嵌套过深、数据类型隐式转换、统计信息过期、锁竞争与热点表等常见性能瓶颈,并结合实际执行计划说明每条慢 SQL 的根因,给出索引调整、查询改写、表结构重构等针对性优化建议。

适用场景:线上突发性能故障的应急排查,以及日常巡检中对潜在慢查询的主动治理。

AI 诊断

能力说明

收到同步任务告警后,可在 Agent 对话界面描述问题或粘贴告警信息,Agent 自动聚合任务日志、资源监控指标、源端数据库状态等多维度信息,定位根因并给出修复方案,将排障时长从小时级缩短到分钟级。每次诊断结果自动归档为知识库条目,下次同类问题直接匹配已有解法,不因人员轮换而从零排查。主要能力包括:

  • 多维信息聚合:自动采集并关联任务日志、资源监控指标、源端数据库状态、网络带宽等多维度信息,在一个视图内呈现完整上下文。

  • 根因定位:基于聚合信息自动分析故障根因(如 CU 不足、源端锁表、网络带宽瓶颈、配置错误等),给出明确结论。

  • 修复方案推荐与一键执行:定位根因后给出可操作的修复建议(扩容资源组、重启实例、调整并发度等),确认后支持一键执行。

  • 经验自动沉淀:每次诊断结果自动归档为知识库条目,下次同类问题直接匹配已有解法。

使用示例

  1. 告警触发后,进入 Agent 对话界面,描述问题或粘贴告警信息。

  2. Agent 自动聚合任务日志、资源监控指标、源端状态等多维信息。

  3. Agent 输出根因分析报告(如:CU 不足导致消费速率低于生产速率)。

  4. Agent 给出修复方案建议(如:扩容资源组 CU 配额或重启失败实例),确认后执行修复。

智能周期巡检

能力说明

DI Agent 支持按可配置周期主动扫描全量同步链路的运行状态,将运维模式从被动响应转为主动治理。巡检结果以结构化报表呈现,高风险任务按影响范围和紧急程度排列优先级,每项附带具体操作建议和预期收益评估。主要能力包括:

  • 可配置巡检周期:支持每小时、每天、每周和仅手动四种巡检频率,适应不同业务对健康检查实时性的要求。

  • 全量链路主动扫描:Agent 按周期自动扫描全量同步链路的运行状态,主动发现潜在风险,无需人工逐项检查。

  • 结构化健康日报:巡检结果包含关键指标概览、异常任务清单和风险等级评估,运维团队可在 3 分钟内掌握整体健康状况。

  • 优先级排列与操作建议:高风险任务按影响范围和紧急程度排列优先级,每项附带具体操作建议和预期收益评估。

使用示例

  1. 进入智能巡检配置页面,选择巡检周期(每小时、每天或每周)。

  2. 配置巡检范围(全量链路或指定项目空间/资源组)。

  3. Agent 按周期自动执行巡检,生成结构化日报。

  4. 查看日报中的关键指标概览和高风险任务清单,按优先级处理风险项。

IM 频道集成

DI Agent 支持接入日常使用的 IM 消息频道(钉钉、微信、飞书等),无需打开 DataWorks 控制台即可完成状态查询、故障诊断、任务启停和巡检报告推送等操作。配置方式如下:

  1. 打开 Agent 界面,找到消息导航栏的频道配置。

  2. 添加对应 IM 频道的应用,填入应用配置信息。

  3. 单击运行使配置生效。

  4. 配置完成后,即可在 IM 端直接与 DI Agent 交互。

后续步骤