读数据集算子从指定数据集读取数据,作为实时工作流的数据源。本文介绍读数据集算子的配置方法。
前提条件
当前实例购买非结构化数据功能-标准版+高级拓展包,且当前项目已绑定实时计算引擎后,方可使用实时工作流。
已完成实时工作流的创建,详细创建步骤请参见创建工作流。
使用限制
读数据集当前仅支持在实时工作流中使用。
权限说明
Basic项目的项目管理员、开发者、分析师以及拥有数据集-使用权限的自定义项目角色,可在算子的输入和输出数据集中使用该项目下的所有数据集。
操作步骤
在Dataphin首页的顶部菜单栏中,选择研发 > 数据研发。
在开发页面的顶部菜单栏选择项目。
在左侧导航栏中选择数据处理 > 工作流,在左侧工作流列表中单击目标实时工作流,打开工作流画布。创建实时工作流后,系统将自动在画布中添加读数据集算子,该算子将作为DAG中的根节点。单击画布中的读数据集算子,并在右侧读数据集面板中配置以下参数。
参数
描述
步骤名称
输入当前算子名称,支持任意字符,不超过256个字符。
输入配置
数据集
选择需处理的数据集,仅可选择当前项目中数据集使用场景为实时的数据集,且必须为表数据集和混合数据集。数据集选择完成后还需选择其版本,默认为该数据集最新版本。
字段信息
选中数据集及其版本后,下方字段信息中展示该数据集的全部字段,包含字段的字段名、类型和说明。
配置完成后,单击画布顶部菜单栏中的保存,保存此次配置。
单个算子配置完成后,可继续为其选择上游或下游算子来完成完整工作流的配置。
下游算子的输入及输出配置
下游算子输入配置
来源字段:仅可选择上游算子实际的输出字段。若所选来源字段在上游输出中不存在,系统将会报错。
下游算子输出配置
输出目标:默认开启传递下游算子,不可关闭。同时,默认开启写入数据集,即开启数据集的输出配置。
加载策略:当数据集选择离线数据集(元数据存储类型为PostgreSQL)时,可选择追加策略、主键冲突时更新。若所选输出数据集的元数据表中存在主键,则默认选择主键冲突时更新;若不存在主键,则默认选择追加数据。
追加数据:直接向目标表新增追加数据,当主键/约束冲突时,会提示错误。
主键冲突时更新:当主键/约束冲突时,会先删除整行主键重复的旧数据,再插入新数据。