创建及管理数据集

更新时间:
复制 MD 格式

前提条件

当前实例购买非结构化数据功能后,方可使用数据集功能。

使用限制

当前数据集仅支持在Basic项目下创建。

权限说明

除项目管理员和开发者外,当项目中成员拥有数据处理-编辑权限时,支持在本项目中新建、编辑、删除、移动数据集以及获取锁、新建数据集版本;拥有数据处理-执行权限时,支持在本项目中提交数据集。

创建数据集

  1. 在Dataphin首页的顶部菜单栏中,选择研发 > 数据研发。

  2. 在开发页面的顶部菜单栏选择项目。

  3. 在左侧导航栏中选择数据处理 > 数据集,在数据集列表中单击image图标,打开新建数据集页签,根据不同使用场景,配置不同参数。

    离线

    参数

    描述

    基本信息

    名称

    输入当前数据集的名称,支持任意字符,不超过256个字符。

    使用场景

    选择离线。

    数据集类型

    可选择文件数据集、表数据集、混合数据集,默认为文件数据集。

    对象存储类型、元数据存储类型

    • 对象存储类型:当选择文件数据集、混合数据集时,当前支持使用OSS或Amazon S3类型的数据源。

    • 元数据存储类型:当选择表数据集、混合数据集时,需要配置用于解释数据集的元数据表,当前元数据存储类型可选择PostgreSQL、Milvus或Lindorm(宽表)数据源。

    内容类型

    可选择文本、图片、音频或视频。

    目录

    选择当前数据集所存放的目录。

    若未创建目录,您可以新建文件夹,操作方法如下:

    1. 在页面左侧计算任务列表上方单击image图标,打开新建文件夹对话框。

    2. 在新建文件夹对话框中输入文件夹名称并根据需要选择目录位置。

    3. 单击确定。

    负责人

    选择当前数据集的负责人,可选项中包含当前租户中所有成员,默认为当前登录用户。

    主题域(非必选)

    选择当前数据集所在的主题域,可选项中包含当前项目所属板块下的所有主题域。

    描述(非必填)

    输入当前数据集的相关描述,支持任意字符,不超过2000个字符。

    版本配置

    版本

    当前数据集的版本,新建时默认为V1。

    描述(非必填)

    输入当前数据集版本的相关描述,支持任意字符,不超过2000个字符。

    文件存储

    说明

    文件数据集和混合数据集,支持配置文件存储。

    数据源

    可选择与对象存储类型一致的数据源,即当对象存储类型为OSS或Amazon S3时,可选项中包含当前租户下对应类型的所有数据源(仅生产数据源)。

    生产路径

    唯一生产数据源的目录路径。

    重要

    若数据源在Bucket下已限定具体目录,则仅可选择此目录下的子目录。

    挂载路径

    输入挂载路径,支持英文字母、数字、下划线(_)和短划线(-),固定路径前缀为/mnt/data/。

    元数据存储

    说明

    表数据集和混合数据集,支持配置元数据存储。

    数据源

    可选择与元数据存储类型一致的数据源,即当元数据存储类型为PostgreSQL/Milvus/Lindorm(宽表)时,可选项中包含当前租户下的所有PostgreSQL/Milvus/Lindorm(宽表引擎-MySQL)数据源(仅生产数据源)。

    生产database/schema

    可选项中包含所选生产数据源下的Database/Schema。

    存储至

    可选择存储至新建表或已有表。

    表名称

    • 存储至新建表:输入表名称,支持小写英文字母、数字和下划线(_),且必须以小写英文字母开头,不超过64个字符。

    • 存储至已有表:选择所选数据源Database/Schema下的表,支持按表名称关键字进行搜索。

      说明

      选择已有表后,系统将自动把所选表的字段添加至表结构的字段列表中,且不支持修改字段名称、字段类型和字段描述、不支持设置或取消主键。同时,不支持以从表引入、编辑DDL、添加字段的方式填写表结构。您可单击重新加载表结构,重新读取完整表结构。

    表结构

    支持从表引入、编辑DDL、添加字段三种方式填写表结构。

    • 从表引入:单击从表引入,在添加字段 从表引入对话框中,选择数据源、Schema和来源表后,在下方字段列表中选择多个字段后单击添加。

      其中数据源支持选择当前租户下与元数据存储类型一致的数据源,不限于当前数据集所选的数据源。Schema可选择所选数据源下的Schema,如果不选则默认为数据源中配置的Schema。

    • 编辑DDL:单击编辑DDL,编辑DDL对话框中展示当前表单字段的DDL语句,您可在此基础上进行编辑。

    • 添加字段:单击添加字段,在表结构中新增一行空白字段,您需自行配置。

    以任意方式完成字段添加后,您可对字段名称、字段类型、是否主键、是否URL(仅混合数据集支持配置)以及字段说明进行配置。

    • 字段名称:仅支持小写英文字母、数字和下划线(_),且必须以小写英文字母开头,不超过64个字符。

    • 字段类型:元数据存储类型不同,支持的字段类型不同。

      PostgreSQL

      字段类型支持文本、数值、日期时间、boolean、json、向量及其他类型。

      当字段类型为向量-vector时,可单击向量配置,为当前字段进行模型和索引配置。

      说明

      若所选元数据存储数据源未安装Vector插件,则不支持使用向量-vector类型。

      • Embedding模型、输出维度:可选择智能应用管理 > 模型配置中模型类型包含向量且已启用的模型。输出维度根据所选模型下拉选择。

      • 创建索引:是否创建索引,默认选择为是,若选择否,则不支持配置以下参数。

      • 索引类型:可选择IVFFlat或HNSW。不同索引类型需配置不同字段,详情请参见。

      • 相似度类型:可选择COSINE(余弦)、L2(欧式距离)或IP(内积)。

      Milvus

      字段类型支持数值、密集向量、VARCHAR、JSON、ARRAY、二进制向量及稀疏向量类型。

      • 当选择字段类型为VARCHAR时,需输入最大长度,可输入1~65535间的整数。

      • 当选择字段类型为密集向量(非INT8_VECTOR)时,可单击向量配置,为当前字段进行模型和索引配置。

        • Embedding模型、输出维度:可选择智能应用管理 > 模型配置中模型类型包含向量且已启用的模型。输出维度根据所选模型下拉选择。

        • 创建索引:是否创建索引,默认选择为是,若选择否,则不支持配置以下参数。

        • 索引类型:可选择AUTOINDEX、FLAT、IVF_FLAT、IVF_SQ8、IVF_PQ、IVF_RABITQ、HNSW、HNSW_SQ、HNSW_PQ、HNSW_PRQ、DISKANN、SCANN、AISAQ。不同索引类型需配置不同字段,详情请参见。

        • 相似度类型:可选择COSINE(余弦)、L2(欧式距离)或IP(内积)。

      Lindorm(宽表)

      字段类型支持文本、数值、日期时间、boolean及二进制类型。

    • 主键:

      • 元数据存储类型为PostgreSQL时,全表仅支持设置一个单字段主键,且该字段必须为数值型或文本型。

      • 元数据存储类型为Milvus时,全表仅支持设置一个单字段主键,且该字段必须为INT64或VARCHAR类型。

      • 元数据存储类型为Lindorm(宽表)时,全表支持设置多个字段为主键(即组合主键)。

    • 是否URL:仅混合数据集支持配置,且仅文本类型字段可设置为URL。

    • 字段说明(非必填):输入对当前字段的相关说明,支持任意字符,不超过1024个字符。

    实时

    参数

    描述

    基本信息

    名称

    输入当前数据集的名称,支持任意字符,不超过256个字符。

    使用场景

    选择实时。

    数据集类型

    可选择表数据集或混合数据集,默认为表数据集。

    对象存储类型、元数据存储类型

    • 对象存储类型:当选择混合数据集时,当前支持使用OSS类型的数据源。

    • 元数据存储类型:当选择表数据集、混合数据集时,需要配置用于解释数据集的元数据表,当前仅支持实时元表。

    内容类型

    可选择文本、图片、音频或视频。

    目录

    选择当前数据集所存放的目录。

    若未创建目录,您可以新建文件夹,操作方法如下:

    1. 在页面左侧计算任务列表上方单击image图标,打开新建文件夹对话框。

    2. 在新建文件夹对话框中输入文件夹名称并根据需要选择目录位置。

    3. 单击确定。

    负责人

    选择当前数据集的负责人,可选项中包含当前租户中所有成员,默认为当前登录用户。

    主题域(非必选)

    选择当前数据集所在的主题域,可选项中包含当前项目所属板块下的所有主题域。

    描述(非必填)

    输入当前数据集的相关描述,支持任意字符,不超过2000个字符。

    版本配置

    版本

    当前数据集的版本,新建时默认为V1。

    描述(非必填)

    输入当前数据集版本的相关描述,支持任意字符,不超过2000个字符。

    文件存储

    说明

    仅混合数据集,支持配置文件存储。

    数据源

    可选择与对象存储类型一致的数据源,即当对象存储类型为OSS时,可选项中包含当前租户下对应类型的所有数据源(仅生产数据源)。

    生产路径

    唯一生产数据源的目录路径。

    重要

    若数据源在Bucket下已限定具体目录,则仅可选择此目录下的子目录。

    挂载路径

    输入挂载路径,支持英文字母、数字、下划线(_)和短划线(-),固定路径前缀为/mnt/data/。

    元数据存储

    说明

    表数据集和混合数据集,支持配置元数据存储。

    数据源类型

    可选择与元数据存储类型一致的数据源,即当元数据存储类型为Kafka时,可选项中包含当前租户下的所有Kafka数据源(仅生产数据源)。

    元表

    支持跨项目选择已提交的Flink实时元表,选择后系统将校验当前用户是否拥有所有元表的读写权限。对于仅支持读取的元表(即禁止写入操作),当工作流向其写入数据时将报错。

    表结构

    选择元表后,表结构将从实时元表同步,字段由元表定义,仅支持查看。您可单击重新加载表结构,获取当前最新字段列表。

    在线

    参数

    描述

    基本信息

    名称

    请输入数据集名称,支持中文、英文、数字及下划线(_),须以中文或英文开头,长度为4~100个字符。

    使用场景

    选择在线。需先完成API网关初始化后,方可选择该使用场景,初始化入口为数据服务 > 服务管理 > 网络配置。

    API ID

    新建时不可修改,提交后系统将自动生成ID。

    数据服务项目

    本API所属的数据服务项目,决定调用鉴权、限流、计量归属。默认为平台内置项目非结构化在线服务项目。若当前实例未购买数据服务增值模块,则不可修改;购买后可下拉选择当前租户下的其他数据服务项目。

    API分组

    选择API网关中的分组,决定路由前缀与鉴权策略。

    数据集类型

    默认为数据集API,不可修改。

    内容类型

    可选择文本、图片、音频或视频。

    目录

    选择当前数据集所存放的目录。

    若未创建目录,您可以新建文件夹,操作方法如下:

    1. 在页面左侧计算任务列表上方单击image图标,打开新建文件夹对话框。

    2. 在新建文件夹对话框中输入文件夹名称并根据需要选择目录位置。

    3. 单击确定。

    负责人

    选择当前数据集的负责人,可选项中包含当前租户中所有成员,默认为当前登录用户。

    主题域(非必选)

    选择当前数据集所在的主题域,可选项中包含当前项目所属板块下的所有主题域。

    数据集描述(非必填)

    输入当前数据集的相关描述,支持任意字符,不超过1024个字符。

    API基础配置

    版本

    当前数据集的版本,新建时默认为V1。

    版本描述(非必填)

    输入当前数据集版本的相关描述,支持任意字符,不超过128个字符。

    协议

    当前支持HTTP协议。

    操作类型

    可选择单条查询(GET)或多条查询(LIST),分别表示调用API时返回单条记录或多条记录列表。创建后不支持修改。

    调用模式

    可选择同步或异步,默认为异步。同步调用将实时返回执行结果;异步调用将返回TaskId,您需通过异步状态查询接口获取执行结果。

    执行超时时间

    用于监控后端工作流的执行时长,仅调用模式为异步时需配置。默认为60秒,支持1~7200秒(2小时)的正整数。

    超时时间

    用于监控API调用的最大时长。同步默认为3秒,支持3~60秒的正整数;异步默认为600秒,支持3~7200秒(2小时)的正整数。

    文件存储

    说明

    默认关闭。开启后可将请求参数、返回参数中的URL字段映射为对象存储中的文件路径,供下游算子直接读写;关闭时请求参数、返回参数的是否URL不支持选中。

    对象存储类型

    当前支持使用OSS或Amazon S3类型的数据源。

    数据源

    可选择与对象存储类型一致的数据源,即当对象存储类型为OSS或Amazon S3时,可选项中包含当前租户下对应类型的所有数据源(仅生产数据源)。

    生产路径

    唯一生产数据源的目录路径。

    重要

    若数据源在Bucket下已限定具体目录,则仅可选择此目录下的子目录。

    挂载路径

    输入挂载路径,支持英文字母、数字、下划线(_)和短划线(-),固定路径前缀为/mnt/data/。

    请求参数

    参数名称

    仅支持英文字母、数字和下划线(_),且在同一项目下同一API中,参数名称唯一。

    参数类型

    可选择STRING、INT、LONG、DOUBLE、FLOAT、BOOLEAN或DATE。

    默认值(非必填)

    调用方未传入该参数时使用的值。

    示例(非必填)

    输入该参数的取值示例,用于API文档与调用测试。

    描述(非必填)

    输入对当前参数的相关说明。

    是否必填

    调用当前API时是否必须传入该参数,选中后代表该参数为必填。

    是否URL

    该参数的取值是否为文件URL,仅开启文件存储后支持选中。

    返回参数

    参数名称

    命名规范同请求参数。调用模式为异步时,系统将自动预置task_id和status参数。

    参数类型

    参数类型同请求参数。

    示例(非必填)

    输入该参数的取值示例,用于API文档。

    描述(非必填)

    输入对当前参数的相关说明。

    是否URL

    该参数的取值是否为文件URL,仅开启文件存储后支持选中。

  4. 完成配置后,单击提交。

    提交时,系统将自动执行对象检查和权限检查,您可在提交详情对话框中查看详情。更多信息请参见。

附录:不同索引类型相关配置

说明
  • 当元数据存储类型为Milvus、字段类型选择为密集向量(非INT8_VECTOR)时,支持向量配置。

  • 当元数据存储类型为PostgreSQL、字段类型为向量时,支持向量配置。

  • 在向量配置中,当创建索引选择是时,需根据不同索引类型配置不同字段。Milvus支持全部索引类型,PostgreSQL仅支持IVF_FLAT和HNSW索引类型。

索引类型

相关字段

IVF_FLAT

nlist:划分数据集的蔟数,支持[1,65536]间的整数,默认为128。

IVF_SQ8 

IVF_PQ

  • nlist:划分数据集的蔟数,支持[1,65536]间的整数,默认为128。

  • m:乘积量化的子向量数(需能整除向量维度,且为整数)。

  • nbits:每个子向量的量化位数,支持[1,16]间的整数,默认为8。

IVF_RABITQ

  • nlist:划分数据集的蔟数,支持[1,65536]间的整数,默认为128。

  • refine(非必选):是否启用细化过程并存储细化后的数据,默认关闭。

  • refine_type:开启refine后,需定义细化时所使用的数据精度,可选择SQ6、SQ8、BF16、FP16、FP32。默认为SQ8。

HNSW 

  • M:每个节点的最大连接数,支持[2,2048]间的整数,默认为30。

  • efConstruction:构建索引时的搜索宽度,支持[1,♾️]间的整数,默认为360。

HNSW_SQ

  • M:每个节点的最大连接数,支持[2,2048]间的整数,默认为30。

  • efConstruction:构建索引时的搜索宽度,支持[1,♾️]间的整数,默认为360。

  • sq_type:标量量化类型,可选择SQ6、SQ8、BF16、FP16、FP32。默认为SQ8。

  • refine:是否启用细化过程来提升精度,默认关闭。

  • refine_type:开启refine后,需定义细化时所使用的数据精度,可选择SQ6、SQ8、BF16、FP16、FP32。默认为SQ8。

HNSW_PQ

  • M:每个节点的最大连接数,支持[2,2048]间的整数,默认为30。

  • efConstruction:构建索引时的搜索宽度,支持[1,♾️]间的整数,默认为360。

  • m:乘积量化的子向量数(需能整除向量维度,且为整数)。

  • nbits:每个子向量的量化位数,支持[1,16]间的整数,默认为8。

  • refine:是否启用细化过程来提升精度,默认关闭。

  • refine_type:开启refine后,需定义细化时所使用的数据精度,可选择SQ6、SQ8、BF16、FP16、FP32。默认为SQ8。

HNSW_PRQ 

SCANN

  • nlist:划分数据集的蔟数,支持[1,65536]间的整数,默认为128。

  • with_raw_data:是否在索引中保留原始向量用于精排。

AISAQ

  • max_degree:图中每个节点的最大连接数,支持[1,512]间的整数,默认为56。

  • search_list_size:构建时搜索近邻的候选池大小,支持[1,512]间的整数,默认为100。

  • pg_code_budget_gb_ratio:PQ压缩率(相对于原始数据的比例),支持[0.0,0.25]间的小数,默认为0.125。

AUTOINDEX

FlAT

DISKANN

-

管理数据集

  1. 在Dataphin首页的顶部菜单栏中,选择研发 > 数据研发。

  2. 在开发页面的顶部菜单栏选择项目。

  3. 在左侧导航栏中选择数据处理 > 数据集,在数据集列表单击目标数据集,可查看该数据集的详细信息,若数据集包含多个版本,您可单击不同版本页签查看各版本信息。数据集支持的其他操作如下。

    操作

    说明

    查看数据集信息

    • 离线、实时数据集:可查看数据集的基本信息,包括数据集类型、存储类型(仅文件数据集和混合数据集)、内容类型、负责人、创建时间和描述;在各版本页签中可查看该版本的文件存储(仅文件数据集和混合数据集)和元数据存储(仅表数据集和混合数据集)。

    • API数据集:可查看数据集的基本信息,包括API ID、所属数据服务项目、API分组、数据集类型、内容类型、负责人和创建时间等。此外,还可在各版本页签中查看该版本的API基础配置、文件存储、请求参数和返回参数,以及被引用的工作流。

      被引用的工作流区域展示绑定当前版本的在线工作流信息,包括工作流名称(单击可跳转至工作流画布配置页)、状态、绑定状态、负责人、描述及最近发布时间,API数据集版本与在线工作流为1:1绑定,每个版本最多展示1条记录。

    编辑数据集基本信息

    单击数据集页签顶部菜单栏中的编辑,编辑其基本信息。

    • 离线、实时数据集:不支持修改数据集类型、对象存储类型、元数据存储类型、内容类型和负责人,其他可修改参数说明同新建操作。

    • API数据集:不支持修改使用场景、API ID、数据集类型和数据服务项目,其他可修改参数说明同新建操作。

    image

    编辑数据集版本

    在数据集页签的数据集版本中单击编辑,可编辑对应版本的描述和挂载路径。

    API数据集编辑版本时仅支持修改版本描述,其他配置不支持修改,如需调整请新建数据集版本。

    image

    新建数据集版本

    单击数据集页签下的新建数据集版本,可选择基于最新版本新建或新建空白版本,各参数说明同新建操作。

    删除版本

    当数据集存储多个版本时,支持删除版本,但至少需保留一个版本。若目标版本存在对象引用时,则不支持删除。

    删除API数据集的某一版本时,若该版本的绑定状态为BOUND(已绑定),需先下线并删除绑定的在线工作流;删除版本后,网关中对应版本的路由一并清除,不影响同一数据集的其他版本。

    删除数据集

    在左侧数据集目录中,单击目标数据集后的更多图标,并选择删除。在弹出的对话框中填写备注后,单击确定并提交。

    说明
    • 当数据集存在对象引用时,不支持删除,需先解除引用。

    • API数据集仅支持删除,不提供下线操作。当存在处于BOUND(已绑定)状态的在线工作流时不允许删除,需先下线并删除引用的工作流。