工作流是对数据集中非结构化数据进行自动化处理的核心功能。通过在工作流中编排多个算子,您可以构建从数据输入、处理到输出的完整数据加工链路,实现对音频、视频、图片、文本、文档等多种类型数据的批量处理。
概述
数据集为非结构化数据提供结构化的元数据描述(如评价维度、情感极性、佐证片段);工作流则作为用户可自定义的可视化编排工具,整合复杂的转化步骤,将来源数据集中数据经算子加工后的结果写入目标数据集,最终沉淀为可分析的结构化资产。工作流分为离线工作流和实时工作流。
实时工作流面向非结构化数据处理场景,提供事件驱动的自动化能力。该方案有效解决了离线时效性不高、在线系统集成困难的问题,助力企业实现数据价值的即时释放。
工作流由一个或多个算子按顺序组成,每个算子负责一项特定的数据处理任务。上游算子的输出可作为下游算子的输入,形成数据处理的流水线。工作流的大致使用流程为:新建工作流任务 > 添加并配置算子 > 配置工作流任务属性 > 运行工作流 > 提交工作流。
工作流页面由顶部操作栏、算子库、画布区、右侧信息面板和底部状态栏五个部分组成。

区块 | 说明 |
①顶部操作栏 |
|
②算子库 | 算子库面板提供所有可用的算子,支持通过关键词搜索或按分类标签筛选。支持打开或收起算子库。算子按功能类型分为以下类别:
您可以将算子从算子库中拖入画布区进行使用。 |
③画布区 | 画布区是工作流的主要编辑区域,将算子从左侧算子库拖入画布后,通过连线将多个算子串联,即可构建完整的数据处理流程。画布底部提供缩放控制工具,支持调整画布显示比例。画布中的算子支持运行、复制和删除操作。
|
④信息面板 |
|
⑤底部状态栏 |
|