数据集

更新时间:
复制 MD 格式

前提条件

当前实例购买非结构化数据功能后,方可使用数据集功能。

使用限制

当前数据集仅支持在Basic项目下创建。

权限说明

项目管理员开发者外,当项目中成员拥有数据处理-编辑权限时,支持在本项目中新建、编辑、删除、移动数据集以及获取锁、新建数据集版本;拥有数据处理-执行权限时,支持在本项目中提交数据集。

创建数据集

  1. Dataphin首页的顶部菜单栏中,选择研发 > 数据研发

  2. 开发页面的顶部菜单栏选择项目

  3. 在左侧导航栏中选择数据处理 > 数据集,在数据集列表中单击image图标,打开新建数据集页签,根据不同使用场景,配置不同参数。

    离线

    参数

    描述

    基本信息

    名称

    输入当前数据集的名称,支持任意字符,不超过256个字符。

    使用场景

    选择离线

    数据集类型

    可选择文件数据集表数据集混合数据集,默认为文件数据集。

    对象存储类型元数据存储类型

    • 对象存储类型:当选择文件数据集混合数据集时,当前仅支持使用OSS类型的数据源。

    • 元数据存储类型:当选择表数据集混合数据集时,需要配置用于解释数据集的元数据表,当前元数据存储类型可选择PostgreSQLMilvusLindorm(宽表)数据源。

    内容类型

    可选择文本图片音频视频

    目录

    选择当前数据集所存放的目录。

    若未创建目录,您可以新建文件夹,操作方法如下:

    1. 在页面左侧计算任务列表上方单击image图标,打开新建文件夹对话框。

    2. 新建文件夹对话框中输入文件夹名称并根据需要选择目录位置。

    3. 单击确定

    负责人

    选择当前数据集的负责人,可选项中包含当前租户中所有成员,默认为当前登录用户。

    主题域(非必选)

    选择当前数据集所在的主题域,可选项中包含当前项目所属板块下的所有主题域。

    描述(非必填)

    输入当前数据集的相关描述,支持任意字符,不超过2000个字符。

    版本配置

    版本

    当前数据集的版本,新建时默认为V1。

    描述(非必填)

    输入当前数据集版本的相关描述,支持任意字符,不超过2000个字符。

    文件存储

    说明

    文件数据集混合数据集,支持配置文件存储。

    数据源

    可选择与对象存储类型一致的数据源,即当对象存储类型为OSS时,可选项中包含当前租户下的所有OSS数据源(仅生产数据源)。

    生产路径

    唯一生产数据源的目录路径。

    重要

    若数据源在Bucket下已限定具体目录,则仅可选择此目录下的子目录。

    挂载路径

    输入挂载路径,支持英文字母、数字、下划线(_)和短划线(-),固定路径前缀为/mnt/data/

    元数据存储

    说明

    表数据集混合数据集,支持配置元数据存储。

    数据源

    可选择与元数据存储类型一致的数据源,即当元数据存储类型为PostgreSQL/Milvus/Lindorm(宽表)时,可选项中包含当前租户下的所有PostgreSQL/Milvus/Lindorm(宽表引擎-MySQL)数据源(仅生产数据源)。

    生产database/schema

    可选项中包含所选生产数据源下的Database/Schema。

    存储至

    可选择存储至新建表已有表

    表名称

    • 存储至新建表:输入表名称,支持小写英文字母、数字和下划线(_),且必须以小写英文字母开头,不超过64个字符。

    • 存储至已有表:选择所选数据源Database/Schema下的表,支持按表名称关键字进行搜索。

      说明

      选择已有表后,系统将自动把所选表的字段添加至表结构的字段列表中,且不支持修改字段名称、字段类型和字段描述、不支持设置或取消主键。同时,不支持以从表引入、编辑DDL、添加字段的方式填写表结构。您可单击重新加载表结构,重新读取完整表结构。

    表结构

    支持从表引入编辑DDL添加字段三种方式填写表结构。

    • 从表引入:单击从表引入,在添加字段 从表引入对话框中,选择数据源Schema来源表后,在下方字段列表中选择多个字段后单击添加

      其中数据源支持选择当前租户下与元数据存储类型一致的数据源,不限于当前数据集所选的数据源。Schema可选择所选数据源下的Schema,如果不选则默认为数据源中配置的Schema。

    • 编辑DDL:单击编辑DDL编辑DDL对话框中展示当前表单字段的DDL语句,您可在此基础上进行编辑。

    • 添加字段:单击添加字段,在表结构中新增一行空白字段,您需自行配置。

    以任意方式完成字段添加后,您可对字段名称字段类型、是否主键是否URL以及字段说明进行配置。

    • 字段名称:仅支持小写英文字母、数字和下划线(_),且必须以小写英文字母开头,不超过64个字符。

    • 字段类型:元数据存储类型不同,支持的字段类型不同。

      PostgreSQL

      字段类型支持文本数值日期时间booleanjson向量其他类型。

      当字段类型为向量-vector时,可单击向量配置,为当前字段进行模型和索引配置。

      • Embedding模型输出维度:可选择智能应用管理 > 模型配置中模型类型包含向量已启用的模型。输出维度根据所选模型下拉选择。

      • 创建索引:是否创建索引,默认选择为,若选择,则不支持配置以下参数。

      • 索引类型:可选择IVFFlatHNSW 。不同索引类型需配置不同字段,详情请参见附录:不同索引类型相关配置

      • 相似度类型:可选择COSINE(余弦)L2(欧式距离)IP(内积)

      Milvus

      字段类型支持数值密集向量VARCHARJSONARRAY二进制向量稀疏向量类型。

      • 当选择字段类型为VARCHAR时,需输入最大长度,可输入1~65535间的整数。

      • 当选择字段类型为密集向量(非INT8_VECTOR)时,可单击向量配置,为当前字段进行模型和索引配置。

        • Embedding模型输出维度:可选择智能应用管理 > 模型配置中模型类型包含向量已启用的模型。输出维度根据所选模型下拉选择。

        • 创建索引:是否创建索引,默认选择为,若选择,则不支持配置以下参数。

        • 索引类型:可选择AUTOINDEXFLATIVF_FLATIVF_SQ8IVF_PQIVF_RABITQHNSWHNSW_SQHNSW_PQHNSW_PRQDISKANNSCANNAISAQ。不同索引类型需配置不同字段,详情请参见附录:不同索引类型相关配置

        • 相似度类型:可选择COSINE(余弦)L2(欧式距离)IP(内积)

      Lindorm(宽表)

      字段类型支持文本数值日期时间boolean二进制类型。

    • 主键

      • 元数据存储类型为PostgreSQL时,全表仅支持设置一个单字段主键,且该字段必须为数值型文本型

      • 元数据存储类型为Milvus时,全表仅支持设置一个单字段主键,且该字段必须为INT64VARCHAR类型。

      • 元数据存储类型为Lindorm(宽表)时,全表支持设置多个字段为主键(即组合主键)。

    • 是否URL:仅文本类型字段可设置为URL。

    • 字段说明(非必填):输入对当前字段的相关说明,支持任意字符,不超过1024个字符。

    实时

    参数

    描述

    基本信息

    名称

    输入当前数据集的名称,支持任意字符,不超过256个字符。

    使用场景

    选择实时

    数据集类型

    可选择表数据集混合数据集,默认为表数据集。

    对象存储类型元数据存储类型

    • 对象存储类型:当选择混合数据集时,当前仅支持使用OSS类型的数据源。

    • 元数据存储类型:当选择表数据集混合数据集时,需要配置用于解释数据集的元数据表,当前仅支持实时元表

    内容类型

    可选择文本图片音频视频

    目录

    选择当前数据集所存放的目录。

    若未创建目录,您可以新建文件夹,操作方法如下:

    1. 在页面左侧计算任务列表上方单击image图标,打开新建文件夹对话框。

    2. 新建文件夹对话框中输入文件夹名称并根据需要选择目录位置。

    3. 单击确定

    负责人

    选择当前数据集的负责人,可选项中包含当前租户中所有成员,默认为当前登录用户。

    主题域(非必选)

    选择当前数据集所在的主题域,可选项中包含当前项目所属板块下的所有主题域。

    描述(非必填)

    输入当前数据集的相关描述,支持任意字符,不超过2000个字符。

    版本配置

    版本

    当前数据集的版本,新建时默认为V1。

    描述(非必填)

    输入当前数据集版本的相关描述,支持任意字符,不超过2000个字符。

    文件存储

    说明

    混合数据集,支持配置文件存储。

    数据源

    可选择与对象存储类型一致的数据源,即当对象存储类型为OSS时,可选项中包含当前租户下的所有OSS数据源(仅生产数据源)。

    生产路径

    唯一生产数据源的目录路径。

    重要

    若数据源在Bucket下已限定具体目录,则仅可选择此目录下的子目录。

    挂载路径

    输入挂载路径,支持英文字母、数字、下划线(_)和短划线(-),固定路径前缀为/mnt/data/

    元数据存储

    说明

    表数据集混合数据集,支持配置元数据存储。

    数据源类型

    可选择与元数据存储类型一致的数据源,即当元数据存储类型为Kafka时,可选项中包含当前租户下的所有Kafka数据源(仅生产数据源)。

    元表

    支持跨项目选择已提交的Flink实时元表,选择后系统将校验当前用户是否拥有所有元表的读写权限。对于仅支持读取的元表(即禁止写入操作),当工作流向其写入数据时将报错。

    表结构

    选择元表后,表结构将从实时元表同步,字段由元表定义,仅支持查看。您可单击重新加载表结构,获取当前最新字段列表。

  4. 完成配置后,单击提交

    提交时,系统将自动执行对象检查和权限检查,您可在提交详情对话框中查看详情。

    • 对象检查将检查数据源是否存在、文件存储路径是否存在以及元数据存储至所选表的表是否存在,若其中有一项不存在则提交失败。

    • 权限检查将检查是否拥有所选数据源的执行权限,若无权限则提交失败。

附录:不同索引类型相关配置

说明
  • 当元数据存储类型为Milvus、字段类型选择为密集向量(非INT8_VECTOR)时,支持向量配置。

  • 当元数据存储类型为PostgreSQL、字段类型为向量时,支持向量配置。

  • 在向量配置中,当创建索引选择时,需根据不同索引类型配置不同字段。Milvus支持全部索引类型PostgreSQL仅支持IVF_FLATHNSW索引类型。

索引类型

相关字段

IVF_FLAT

nlist:划分数据集的蔟数,支持[1,65536]间的整数,默认为128。

IVF_SQ8 

IVF_PQ

  • nlist:划分数据集的蔟数,支持[1,65536]间的整数,默认为128。

  • m:乘积量化的子向量数(需能整除向量维度,且为整数)。

  • nbits:每个子向量的量化位数,支持[1,16]间的整数,默认为8。

IVF_RABITQ

  • nlist:划分数据集的蔟数,支持[1,65536]间的整数,默认为128。

  • refine(非必选):是否启用细化过程并存储细化后的数据,默认关闭。

  • refine_type:开启refine后,需定义细化时所使用的数据精度,可选择SQ6SQ8BF16FP16FP32。默认为SQ8。

HNSW 

  • M:每个节点的最大连接数,支持[2,2048]间的整数,默认为30。

  • efConstruction:构建索引时的搜索宽度,支持[1,♾️]间的整数,默认为360。

HNSW_SQ

  • M:每个节点的最大连接数,支持[2,2048]间的整数,默认为30。

  • efConstruction:构建索引时的搜索宽度,支持[1,♾️]间的整数,默认为360。

  • sq_type:标量量化类型,可选择SQ6SQ8BF16FP16FP32。默认为SQ8。

  • refine:是否启用细化过程来提升精度,默认关闭。

  • refine_type:开启refine后,需定义细化时所使用的数据精度,可选择SQ6SQ8BF16FP16FP32。默认为SQ8。

HNSW_PQ

  • M:每个节点的最大连接数,支持[2,2048]间的整数,默认为30。

  • efConstruction:构建索引时的搜索宽度,支持[1,♾️]间的整数,默认为360。

  • m:乘积量化的子向量数(需能整除向量维度,且为整数)。

  • nbits:每个子向量的量化位数,支持[1,16]间的整数,默认为8。

  • refine:是否启用细化过程来提升精度,默认关闭。

  • refine_type:开启refine后,需定义细化时所使用的数据精度,可选择SQ6SQ8BF16FP16FP32。默认为SQ8。

HNSW_PRQ 

SCANN

  • nlist:划分数据集的蔟数,支持[1,65536]间的整数,默认为128。

  • with_raw_data:是否在索引中保留原始向量用于精排。

AISAQ

  • max_degree:图中每个节点的最大连接数,支持[1,512]间的整数,默认为56。

  • search_list_size:构建时搜索近邻的候选池大小,支持[1,512]间的整数,默认为100。

  • pg_code_budget_gb_ratio:PQ压缩率(相对于原始数据的比例),支持[0.0,0.25]间的小数,默认为0.125。

AUTOINDEX

FlAT

DISKANN

-

管理数据集

  1. Dataphin首页的顶部菜单栏中,选择研发 > 数据研发

  2. 开发页面的顶部菜单栏选择项目

  3. 在左侧导航栏中选择数据处理 > 数据集,在数据集列表单击目标数据集,可查看该数据集的详细信息,若数据集包含多个版本,您可单击不同版本页签查看各版本信息。数据集支持的其他操作如下。

    操作

    说明

    编辑数据集基本信息

    单击数据集页签顶部菜单栏中的编辑,编辑其基本信息,不支持修改数据集类型、对象存储类型、元数据存储类型、内容类型和负责人,其他可修改参数说明同新建操作。image

    编辑数据集版本

    在数据集页签的数据集版本中单击编辑,可编辑对应版本的描述和挂载路径。image

    新建数据集版本

    单击数据集页签下的新建数据集版本,可选择基于最新版本新建新建空白版本,各参数说明同新建操作。

    删除版本

    当数据集存储多个版本时,支持删除版本,但至少需保留一个版本。若目标版本存在对象引用时,则不支持删除。