读数据集

更新时间:
复制 MD 格式

读数据集算子从指定数据集读取数据,作为实时工作流的数据源。本文介绍读数据集算子的配置方法。

前提条件

  • 当前实例购买非结构化数据功能-标准版+高级拓展包,且当前项目已绑定实时计算引擎后,方可使用实时工作流。

  • 已完成实时工作流的创建,详细创建步骤请参见创建工作流

使用限制

读数据集当前仅支持在实时工作流中使用。

权限说明

Basic项目的项目管理员、开发者、分析师以及拥有数据集-使用权限的自定义项目角色,可在算子的输入和输出数据集中使用该项目下的所有数据集。

操作步骤

  1. Dataphin首页的顶部菜单栏中,选择研发 > 数据研发

  2. 开发页面的顶部菜单栏选择项目

  3. 在左侧导航栏中选择数据处理 > 工作流,在左侧工作流列表中单击目标实时工作流,打开工作流画布。创建实时工作流后,系统将自动在画布中添加读数据集算子,该算子将作为DAG中的根节点。单击画布中的读数据集算子,并在右侧读数据集面板中配置以下参数。

    参数

    描述

    步骤名称

    输入当前算子名称,支持任意字符,不超过256个字符。

    输入配置

    数据集

    选择需处理的数据集,仅可选择当前项目中数据集使用场景为实时的数据集,且必须为表数据集混合数据集。数据集选择完成后还需选择其版本,默认为该数据集最新版本。

    字段信息

    选中数据集及其版本后,下方字段信息中展示该数据集的全部字段,包含字段的字段名、类型和说明。

  4. 配置完成后,单击画布顶部菜单栏中的保存,保存此次配置。

    单个算子配置完成后,可继续为其选择上游或下游算子来完成完整工作流的配置。

下游算子的输入及输出配置

  • 下游算子输入配置

    来源字段:仅可选择上游算子实际的输出字段。若所选来源字段在上游输出中不存在,系统将会报错。

  • 下游算子输出配置

    • 输出目标:默认开启传递下游算子,不可关闭。同时,默认开启写入数据集,即开启数据集的输出配置。

    • 加载策略:当数据集选择离线数据集(元数据存储类型为PostgreSQL)时,可选择追加策略主键冲突时更新。若所选输出数据集的元数据表中存在主键,则默认选择主键冲突时更新;若不存在主键,则默认选择追加数据。

      • 追加数据:直接向目标表新增追加数据,当主键/约束冲突时,会提示错误。

      • 主键冲突时更新:当主键/约束冲突时,会先删除整行主键重复的旧数据,再插入新数据。