单租户多引擎模式下新建计算源

更新时间:
复制 MD 格式

前提条件

  • 创建离线计算源前,已创建相应类型集群。单租户多引擎模式下仅支持引用指定集群创建离线计算源,集群创建详情请参见单租户多引擎模式下新建集群

  • 创建实时计算源前,需已选择相应类型的实时计算引擎。

操作步骤

  1. Dataphin首页的顶部菜单栏中,选择规划 > 计算源

  2. 计算源页面,单击新增计算源,在新建计算源页面,配置以下参数。

    单租户多引擎模式下仅支持通过引用指定集群配置计算源,不同配置方式所支持的配置项有所不同。

    • 计算源基本信息

      参数

      描述

      计算源类型

      离线计算源仅可选择已有集群对应类型的计算源,离线和实时计算源类型包含:

      • MaxCompute

      • AnalyticDB for PostgreSQL

      • Aliyun EMR 3.x

      • Aliyun EMR 5.x

      • CDH 5.x

      • CDH 6.x

      • Cloudera Data Platform 7.x

      • 华为FusionInsight 8.x

      • 亚信DP 5.3

      • StarRocks

      • Databricks

      • Amazon EMR

      • SelectDB

      • Doris

      • GaussDB(DWS)

      • 星环TDH 6.x

      • 星环TDH 9.3.x

      • 星环ArgoDB

      • Lindorm(计算引擎)

      • Hologres

      • OushuDB

      • Aliyun EMR Serverless Spark

      • Flink

      • Ververica Flink

      • FusionInsight Flink

      计算源名称

      命名规则如下:

      • 只能包含中文、英文、数字、下划线(_)、短划线(-)、英文句号(.)、at(@)、波浪线(~)、半角单引号('')、半角圆括号(())和空格。

      • 长度不能超过64个字符。

      集群

      离线计算源需选择所选计算源类型对应已创建的集群。

      数据湖表格式

      默认关闭,开启后,可选择数据湖表格式。

      • 当计算引擎为Cloudera Data Platform 7.x时,表格式支持Hudi

      • 当计算引擎为Aliyun EMR 5.x时,表格式支持IcebergPaimon

      说明

      仅当计算源类型为Cloudera Data Platform 7.xAliyun EMR 5.x时,支持配置此项。

      计算源描述

      对计算源的简单描述,长度128个字符以内。

    • 计算源的其他配置

      Hadoop

      Hadoop包含CDH5.xCDH6.xCloudera Data Platform 7.xAliyun EMR 3.xAliyun EMR 5.x亚信DP 5.3华为FusionInsight 8.x计算源。

      多引擎模式下Hadoop计算源的队列信息配置、Hive计算引擎配置、Spark Jar服务配置、Spark SQL服务配置、Impala任务配置同单引擎模式下引用集群方式创建Hadoop计算源的配置,详情请参见Hadoop计算源

      MaxCompute

      参数

      描述

      MaxCompute项目

      当认证方式选择为RAM角色代理时,可选择MaxCompute项目

      选择或填写MaxCompute项目,选项列表中仅展示所填写AccessKey对应用户在控制台上可见的项目,可手动输入其他项目名或前往MaxCompute控制台创建。

      说明

      此处为MaxCompute项目名称,非DataWorks工作空间名称。

      MaxCompute控制台左上角切换地域后,即可在项目管理页签查看到具体的MaxCompute项目名

      image..png

      是否外部项目

      选择是否为外部项目,默认为非外部项目,若选中,即为外部项目。

      说明
      • 集成任务不支持读写MaxCompute外部项目中的数据。

      • 不支持利用Hologres引擎对MaxCompute外部项目的查询进行加速。

      • 不支持从MaxCompute元数据获取外部项目表的存储量。

      • 资源不支持存储健康分及存储量。

      计算项目

      选择或填写计算项目,此处仅展示所填写AccessKey对应用户在控制台上可见的项目,可手动输入其他项目名或前往MaxCompute控制台创建。

      MaxCompute项目为外部项目时,需设置作为计算资源的MaxCompute项目。

      AnalyticDB for PostgreSQL、OushuDB

      参数

      描述

      JDBC URL

      默认为所选集群中配置的JDBC URL,不支持修改。

      DataBase

      支持选择或输入DataBase。

      Schema

      选择或填写计算引擎数据库对应的Schema连接信息。

      优先级任务队列

      支持采用默认执行用户自定义

      • 采用默认执行用户:使用所选集群中配置的默认执行用户。

      • 自定义:包含最高优先级高优先级中优先级低优先级最低优先级五种优先级。每个优先级均支持选择采用集群默认执行用户自定义,选择自定义时需输入执行用户名密码

        说明

        AnalyticDB for PostgreSQL中,使用资源队列进行优先级管理。若需自建优先级任务队列,需提前在AnalyticDB for PostgreSQL中创建各个优先级对应的用户名和密码。

      StarRocks、SelectDB、Doris

      参数

      描述

      JDBC URL

      默认为所选集群中配置的JDBC URL,不支持修改。

      Catalog

      可选择Default CatalogExternal Catalog

      • Default Catalog:用于管理集群中的内部数据。

      • External Catalog:支持从该集群下所有的外部Catalog中选择,或手动输入Catalog。

      DataBase

      可选择所选Catalog下的所有DataBase,同时支持输入DataBase。

      认证用户

      可选择与集群一致自定义,默认为与集群一致。当选择自定义时,还需输入鉴权用户名密码,为保证任务正常执行,请确保用户有所需数据权限。

      任务资源组

      可通过资源组进行资源的隔离,并通过分类器将任务匹配到资源组。Datpahin支持为不同优先级的任务指定资源组名称,在任务运行时自动设置任务的资源组从而达到不同任务的资源分配和隔离。

      • 采用默认执行用户:使用所选集群中配置的默认执行用户。

      • 自定义:包含最高优先级高优先级中优先级低优先级最低优先级五种优先级,每个优先级均需输入资源组名称。

      Lindorm(计算引擎)

      • Lindorm计算引擎配置

        参数

        描述

        JDBC URL

        配置Lindorm(计算引擎)的JDBC URL地址。获取地址,请参见查看连接地址

        database

        填写Lindorm(计算引擎)计算引擎的数据库名称。

      • Lindorm资源组设置

        多引擎模式下Lindorm资源组设置同单引擎模式,详情请参见Lindorm资源组设置

      GaussDB(DWS)、Hologres

      参数

      描述

      JDBC URL

      默认为所选集群中的JDBC URL,不支持修改。

      Schema

      填写计算引擎数据库对应的Schema连接信息。

      Databricks

      多引擎模式下Databricks计算源的计算配置同单引擎模式,详情请参见计算配置

      Amazon EMR

      多引擎模式下Amazon EMR计算源的计算配置同单引擎模式,详情请参见计算配置

      Aliyun EMR Serverless Spark

      参数

      描述

      链接配置

      工作空间

      所选集群中所选中的工作空间,此处不支持修改。

      Catalog

      选择Catalog,可选项包含所选集群中所有的Catalog。

      Schema

      选择Schema,可选项包含所选Catalog中所有Schema。

      Gateway配置

      生产任务默认Gateway

      选择生产任务的默认Gateway,可选项包含所选集群中已添加的Gateway。鼠标悬停在Gateway名称上,查看对应Gateway的状态、规格、Spark引擎版本、Kyuubi Service引擎版本、队列名称、访问方式、高可用副本数。

      其他任务Gateway

      优先级任务Gateway

      默认选择生产任务默认Gateway,选择自定义时,还需选择每种优先级的Gateway。

      星环TDH 6.x、星环TDH9.3.x、星环ArgoDB

      参数

      描述

      JDBC URL

      所选集群中配置的JDBC URL,不支持修改。

      Database

      选择数据库,可选项中包含所选集群下的所有数据库。

      执行用户

      可选择引用集群配置单独配置,若选择引用集群配置,则下方执行用户仅展示集群中的配置;若选择单独配置,下方执行用户名支持手动输入。

      开发环境任务的执行用户

      配置开发环境的任务的执行用户名。

      周期性调度的任务的执行用户

      配置周期性调度任务的执行用户名。

      优先级任务队列

      支持选择采用默认执行用户自定义两种方式优先级执行的用户。

      选择了自定义后,您需要配置不同优先级执行任务的用户名。

      说明

      优先级队列是通过在Hadoop集群上创建不同的Yarn队列来分配资源。对应不同的任务的优先级,把相关的优先级的任务发送到对应的Yarn的队列来执行。

      Flink、Ververica Flink、FusionInsight Flink

      多引擎模式下Flink、Ververica Flink、FusionInsight Flink计算源的配置同单引擎模式,详情请参见新建Flink计算源新建Ververica Flink计算源新建FusionInsight Flink计算源

  3. 单击测试连接,测试连接的计算源。

  4. 测试连接成功后,单击提交