创建及管理工作流

更新时间:
复制 MD 格式

前提条件

  • 当前实例购买非结构化数据功能后,方可使用离线工作流。

  • 当前实例购买非结构化数据功能-标准版+高级拓展包,方可使用实时工作流和在线工作流。

使用限制

  • 当前工作流仅支持在Basic项目下创建。

  • 实时工作流暂不支持不停服升级。

  • 在线工作流暂不支持不停服升级,升级期间工作流API存在约10分钟的调用不可用时间。更新在线工作流后,最长需要3分钟方可在生产环境生效。

权限说明

除项目管理员和开发者外,当项目中成员拥有数据处理-编辑权限时,支持在本项目中新建、编辑、删除、移动工作流以及获取锁;拥有数据处理-执行权限时,支持在本项目中运行、提交、下线、下线并删除工作流。

背景信息

当前Dataphin支持三种方式创建工作流:普通创建工作流、上传开发脚本创建工作流、使用CreateWorkFolwByJson OpenAPI创建工作流。

创建工作流

  1. 在Dataphin首页的顶部菜单栏中,选择研发 > 数据研发。

  2. 在开发页面的顶部菜单栏选择项目。

  3. 在左侧导航栏中选择数据处理 > 工作流,在工作流列表中单击image图标,打开新建工作流对话框,配置以下参数。

    参数

    描述

    名称

    填写工作流名称,支持任意字符,最长不超过256个字符。

    调度类型

    选择管道的调度类型。调度类型包括:

    • 周期性节点:指需定期执行的任务。

    • 手动节点:指没有依赖关系,需手动触发的任务。

    • 实时节点:事件驱动的任务。

    • 在线节点:以HTTP API形式提供同步或异步在线服务的任务。

    描述

    填写工作流的简单描述,512个字符以内。

    选择目录

    选择任务所存放的目录。

    若未创建目录,您可以新建文件夹,操作方法如下:

    1. 在页面左侧工作流列表上方单击image图标,打开新建文件夹对话框。

    2. 在新建文件夹对话框中输入文件夹名称并根据需要选择目录位置。

    3. 单击确定。

  4. 单击确定,完成工作流创建。

    工作流创建完成后,即可在工作流画布中使用各算子对数据集中各类型数据进行处理。

上传开发脚本创建工作流

  1. 在Dataphin首页的顶部菜单栏中,选择研发 > 数据研发。

  2. 在开发页面的顶部菜单栏选择项目。

  3. 在左侧导航栏中选择数据处理 > 工作流,在工作流列表上方单击image图标,打开上传工作流开发脚本对话框。

  4. 上传工作流开发脚本对话框中除了上传工作流所需的JSON文件外,其他参数同普通新建工作流,详情请参见普通创建工作流。

管理工作流

  1. 在Dataphin首页的顶部菜单栏中,选择研发 > 数据研发。

  2. 在开发页面的顶部菜单栏选择项目。

  3. 在左侧导航栏中选择数据处理 > 工作流,在工作流列表中单击目标工作流,可在画布中查看及编辑该工作流。工作流支持的其他操作如下。

    操作

    说明

    运行

    • 离线工作流:单击运行时,若剩余Credit小于等于100,则可能导致工作流运行失败,建议先购买资源包后再试;若剩余Credit小于等于0,则工作流运行失败。若工作流运行过程中Credit余额不足,为保证任务前期产生的计算记录不丢失,工作流不会立即终止,系统允许本次任务可额外使用4000credits。

    • 实时工作流:单击运行后,可设置最大运行时长,默认为10分钟。运行时,有界流将在数据消费完成后自动终止;无界流则需手动停止,或在达到最长运行时长后自动结束。同一工作流同一时刻仅支持运行1个实例。

      实时工作流任务在运行中将持续消耗Credit(包含资源Credit和算子Credit),若剩余Credit小于等于0,系统将发送告警通知,工作流继续运行;若剩余Credit负值达到-4000~-5000,工作流将立即终止,系统将提交当前Kafka位点,需购买资源包后手动重启工作流,从提交的位点继续消费。

    • 在线工作流:支持以实际请求参数触发调试运行,请求参数自动从绑定的API数据集版本同步。在画布顶部操作栏中单击运行,在参数填写对话框中填写各参数实际值后启动运行,运行后可在画布底部的运行结果面板中查看运行信息。同一工作流同一时刻仅允许运行1个调试实例,调试运行将消耗Credi,消耗详情同实时工作流。

      说明
      • 未填写必填参数时将阻断运行。

      • 在填写各参数实际值时,支持将其保存为预设(每个工作流最多保存10组预设值),方便反复调试。

    提交

    在画布顶部操作栏中单击提交,查看本次提交的对象与前置检查结果并填写提交备注,检查全部通过后单击确定并提交。各检查项详情请参见工作流提交说明。

    在线工作流提交成功后,系统自动将其注册为所绑定API数据集版本的后端,即可在开发环境中测试调用。

    去运维

    工作流任务提交至生产环境后,单击去运维可跳转至运维中心的任务列表,系统自动通过当前工作流的任务ID进行精确搜索,帮助您快速定位对应的运维任务。

    说明

    在线工作流不支持去运维操作。

    调用(仅在线工作流)

    在线工作流发布至生产环境后,方可对外提供HTTP API服务;绑定的API数据集发布至生产环境后,工作流方可发布。发布后业务方可通过HTTP协议调用其绑定的API,调用方式同数据服务API。同步调用模式下,系统在工作流执行完成后直接返回业务响应;异步调用模式下,系统先返回task_id,调用方需通过数据服务的异步状态查询接口轮询任务状态并获取结果。

    下线并删除

    已提交的工作流支持下线并删除。

    在线工作流下线后状态变更为已下线,其绑定的API数据集保持已发布状态,但该版本的绑定状态变更为绑定失效,此时调用该版本API将返回503错误;重新提交并发布后可恢复服务。

    删除

    草稿态的工作流支持直接删除,已提交的工作需先下线再删除,删除后不可恢复。

    在线工作流删除后,其绑定的API数据集版本的绑定状态回到未绑定,可重新绑定新的在线工作流。