前提条件
当前实例购买非结构化数据功能后,方可使用数据集功能。
使用限制
当前数据集仅支持在Basic项目下创建。
权限说明
除项目管理员和开发者外,当项目中成员拥有数据处理-编辑权限时,支持在本项目中新建、编辑、删除、移动数据集以及获取锁、新建数据集版本;拥有数据处理-执行权限时,支持在本项目中提交数据集。
创建数据集
在Dataphin首页的顶部菜单栏中,选择研发 > 数据研发。
在开发页面的顶部菜单栏选择项目。
在左侧导航栏中选择数据处理 > 数据集,在数据集列表中单击
图标,打开新建数据集页签,根据不同使用场景,配置不同参数。离线
参数
描述
基本信息
名称
输入当前数据集的名称,支持任意字符,不超过256个字符。
使用场景
选择离线。
数据集类型
可选择文件数据集、表数据集、混合数据集,默认为文件数据集。
对象存储类型、元数据存储类型
对象存储类型:当选择文件数据集、混合数据集时,当前支持使用OSS或Amazon S3类型的数据源。
元数据存储类型:当选择表数据集、混合数据集时,需要配置用于解释数据集的元数据表,当前元数据存储类型可选择PostgreSQL、Milvus或Lindorm(宽表)数据源。
内容类型
可选择文本、图片、音频或视频。
目录
选择当前数据集所存放的目录。
若未创建目录,您可以新建文件夹,操作方法如下:
在页面左侧计算任务列表上方单击
图标,打开新建文件夹对话框。在新建文件夹对话框中输入文件夹名称并根据需要选择目录位置。
单击确定。
负责人
选择当前数据集的负责人,可选项中包含当前租户中所有成员,默认为当前登录用户。
主题域(非必选)
选择当前数据集所在的主题域,可选项中包含当前项目所属板块下的所有主题域。
描述(非必填)
输入当前数据集的相关描述,支持任意字符,不超过2000个字符。
版本配置
版本
当前数据集的版本,新建时默认为V1。
描述(非必填)
输入当前数据集版本的相关描述,支持任意字符,不超过2000个字符。
文件存储
说明文件数据集和混合数据集,支持配置文件存储。
数据源
可选择与对象存储类型一致的数据源,即当对象存储类型为OSS或Amazon S3时,可选项中包含当前租户下对应类型的所有数据源(仅生产数据源)。
生产路径
唯一生产数据源的目录路径。
重要若数据源在Bucket下已限定具体目录,则仅可选择此目录下的子目录。
挂载路径
输入挂载路径,支持英文字母、数字、下划线(_)和短划线(-),固定路径前缀为
/mnt/data/。元数据存储
说明表数据集和混合数据集,支持配置元数据存储。
数据源
可选择与元数据存储类型一致的数据源,即当元数据存储类型为PostgreSQL/Milvus/Lindorm(宽表)时,可选项中包含当前租户下的所有PostgreSQL/Milvus/Lindorm(宽表引擎-MySQL)数据源(仅生产数据源)。
生产database/schema
可选项中包含所选生产数据源下的Database/Schema。
存储至
可选择存储至新建表或已有表。
表名称
存储至新建表:输入表名称,支持小写英文字母、数字和下划线(_),且必须以小写英文字母开头,不超过64个字符。
存储至已有表:选择所选数据源Database/Schema下的表,支持按表名称关键字进行搜索。
说明选择已有表后,系统将自动把所选表的字段添加至表结构的字段列表中,且不支持修改字段名称、字段类型和字段描述、不支持设置或取消主键。同时,不支持以从表引入、编辑DDL、添加字段的方式填写表结构。您可单击重新加载表结构,重新读取完整表结构。
表结构
支持从表引入、编辑DDL、添加字段三种方式填写表结构。
从表引入:单击从表引入,在添加字段 从表引入对话框中,选择数据源、Schema和来源表后,在下方字段列表中选择多个字段后单击添加。
其中数据源支持选择当前租户下与元数据存储类型一致的数据源,不限于当前数据集所选的数据源。Schema可选择所选数据源下的Schema,如果不选则默认为数据源中配置的Schema。
编辑DDL:单击编辑DDL,编辑DDL对话框中展示当前表单字段的DDL语句,您可在此基础上进行编辑。
添加字段:单击添加字段,在表结构中新增一行空白字段,您需自行配置。
以任意方式完成字段添加后,您可对字段名称、字段类型、是否主键、是否URL(仅混合数据集支持配置)以及字段说明进行配置。
字段名称:仅支持小写英文字母、数字和下划线(_),且必须以小写英文字母开头,不超过64个字符。
字段类型:元数据存储类型不同,支持的字段类型不同。
PostgreSQL
字段类型支持文本、数值、日期时间、boolean、json、向量及其他类型。
当字段类型为向量-vector时,可单击向量配置,为当前字段进行模型和索引配置。
说明若所选元数据存储数据源未安装Vector插件,则不支持使用向量-vector类型。
Embedding模型、输出维度:可选择智能应用管理 > 模型配置中模型类型包含向量且已启用的模型。输出维度根据所选模型下拉选择。
创建索引:是否创建索引,默认选择为是,若选择否,则不支持配置以下参数。
索引类型:可选择IVFFlat或HNSW。不同索引类型需配置不同字段,详情请参见。
相似度类型:可选择COSINE(余弦)、L2(欧式距离)或IP(内积)。
Milvus
字段类型支持数值、密集向量、VARCHAR、JSON、ARRAY、二进制向量及稀疏向量类型。
当选择字段类型为VARCHAR时,需输入最大长度,可输入1~65535间的整数。
当选择字段类型为密集向量(非INT8_VECTOR)时,可单击向量配置,为当前字段进行模型和索引配置。
Embedding模型、输出维度:可选择智能应用管理 > 模型配置中模型类型包含向量且已启用的模型。输出维度根据所选模型下拉选择。
创建索引:是否创建索引,默认选择为是,若选择否,则不支持配置以下参数。
索引类型:可选择AUTOINDEX、FLAT、IVF_FLAT、IVF_SQ8、IVF_PQ、IVF_RABITQ、HNSW、HNSW_SQ、HNSW_PQ、HNSW_PRQ、DISKANN、SCANN、AISAQ。不同索引类型需配置不同字段,详情请参见。
相似度类型:可选择COSINE(余弦)、L2(欧式距离)或IP(内积)。
Lindorm(宽表)
字段类型支持文本、数值、日期时间、boolean及二进制类型。
主键:
元数据存储类型为PostgreSQL时,全表仅支持设置一个单字段主键,且该字段必须为数值型或文本型。
元数据存储类型为Milvus时,全表仅支持设置一个单字段主键,且该字段必须为INT64或VARCHAR类型。
元数据存储类型为Lindorm(宽表)时,全表支持设置多个字段为主键(即组合主键)。
是否URL:仅混合数据集支持配置,且仅文本类型字段可设置为URL。
字段说明(非必填):输入对当前字段的相关说明,支持任意字符,不超过1024个字符。
实时
参数
描述
基本信息
名称
输入当前数据集的名称,支持任意字符,不超过256个字符。
使用场景
选择实时。
数据集类型
可选择表数据集或混合数据集,默认为表数据集。
对象存储类型、元数据存储类型
对象存储类型:当选择混合数据集时,当前支持使用OSS类型的数据源。
元数据存储类型:当选择表数据集、混合数据集时,需要配置用于解释数据集的元数据表,当前仅支持实时元表。
内容类型
可选择文本、图片、音频或视频。
目录
选择当前数据集所存放的目录。
若未创建目录,您可以新建文件夹,操作方法如下:
在页面左侧计算任务列表上方单击
图标,打开新建文件夹对话框。在新建文件夹对话框中输入文件夹名称并根据需要选择目录位置。
单击确定。
负责人
选择当前数据集的负责人,可选项中包含当前租户中所有成员,默认为当前登录用户。
主题域(非必选)
选择当前数据集所在的主题域,可选项中包含当前项目所属板块下的所有主题域。
描述(非必填)
输入当前数据集的相关描述,支持任意字符,不超过2000个字符。
版本配置
版本
当前数据集的版本,新建时默认为V1。
描述(非必填)
输入当前数据集版本的相关描述,支持任意字符,不超过2000个字符。
文件存储
说明仅混合数据集,支持配置文件存储。
数据源
可选择与对象存储类型一致的数据源,即当对象存储类型为OSS时,可选项中包含当前租户下对应类型的所有数据源(仅生产数据源)。
生产路径
唯一生产数据源的目录路径。
重要若数据源在Bucket下已限定具体目录,则仅可选择此目录下的子目录。
挂载路径
输入挂载路径,支持英文字母、数字、下划线(_)和短划线(-),固定路径前缀为
/mnt/data/。元数据存储
说明表数据集和混合数据集,支持配置元数据存储。
数据源类型
可选择与元数据存储类型一致的数据源,即当元数据存储类型为Kafka时,可选项中包含当前租户下的所有Kafka数据源(仅生产数据源)。
元表
支持跨项目选择已提交的Flink实时元表,选择后系统将校验当前用户是否拥有所有元表的读写权限。对于仅支持读取的元表(即禁止写入操作),当工作流向其写入数据时将报错。
表结构
选择元表后,表结构将从实时元表同步,字段由元表定义,仅支持查看。您可单击重新加载表结构,获取当前最新字段列表。
在线
参数
描述
基本信息
名称
请输入数据集名称,支持中文、英文、数字及下划线(_),须以中文或英文开头,长度为4~100个字符。
使用场景
选择在线。需先完成API网关初始化后,方可选择该使用场景,初始化入口为数据服务 > 服务管理 > 网络配置。
API ID
新建时不可修改,提交后系统将自动生成ID。
数据服务项目
本API所属的数据服务项目,决定调用鉴权、限流、计量归属。默认为平台内置项目非结构化在线服务项目。若当前实例未购买数据服务增值模块,则不可修改;购买后可下拉选择当前租户下的其他数据服务项目。
API分组
选择API网关中的分组,决定路由前缀与鉴权策略。
数据集类型
默认为数据集API,不可修改。
内容类型
可选择文本、图片、音频或视频。
目录
选择当前数据集所存放的目录。
若未创建目录,您可以新建文件夹,操作方法如下:
在页面左侧计算任务列表上方单击
图标,打开新建文件夹对话框。在新建文件夹对话框中输入文件夹名称并根据需要选择目录位置。
单击确定。
负责人
选择当前数据集的负责人,可选项中包含当前租户中所有成员,默认为当前登录用户。
主题域(非必选)
选择当前数据集所在的主题域,可选项中包含当前项目所属板块下的所有主题域。
数据集描述(非必填)
输入当前数据集的相关描述,支持任意字符,不超过1024个字符。
API基础配置
版本
当前数据集的版本,新建时默认为V1。
版本描述(非必填)
输入当前数据集版本的相关描述,支持任意字符,不超过128个字符。
协议
当前支持HTTP协议。
操作类型
可选择单条查询(GET)或多条查询(LIST),分别表示调用API时返回单条记录或多条记录列表。创建后不支持修改。
调用模式
可选择同步或异步,默认为异步。同步调用将实时返回执行结果;异步调用将返回TaskId,您需通过异步状态查询接口获取执行结果。
执行超时时间
用于监控后端工作流的执行时长,仅调用模式为异步时需配置。默认为60秒,支持1~7200秒(2小时)的正整数。
超时时间
用于监控API调用的最大时长。同步默认为3秒,支持3~60秒的正整数;异步默认为600秒,支持3~7200秒(2小时)的正整数。
文件存储
说明默认关闭。开启后可将请求参数、返回参数中的URL字段映射为对象存储中的文件路径,供下游算子直接读写;关闭时请求参数、返回参数的是否URL不支持选中。
对象存储类型
当前支持使用OSS或Amazon S3类型的数据源。
数据源
可选择与对象存储类型一致的数据源,即当对象存储类型为OSS或Amazon S3时,可选项中包含当前租户下对应类型的所有数据源(仅生产数据源)。
生产路径
唯一生产数据源的目录路径。
重要若数据源在Bucket下已限定具体目录,则仅可选择此目录下的子目录。
挂载路径
输入挂载路径,支持英文字母、数字、下划线(_)和短划线(-),固定路径前缀为
/mnt/data/。请求参数
参数名称
仅支持英文字母、数字和下划线(_),且在同一项目下同一API中,参数名称唯一。
参数类型
可选择STRING、INT、LONG、DOUBLE、FLOAT、BOOLEAN或DATE。
默认值(非必填)
调用方未传入该参数时使用的值。
示例(非必填)
输入该参数的取值示例,用于API文档与调用测试。
描述(非必填)
输入对当前参数的相关说明。
是否必填
调用当前API时是否必须传入该参数,选中后代表该参数为必填。
是否URL
该参数的取值是否为文件URL,仅开启文件存储后支持选中。
返回参数
参数名称
命名规范同请求参数。调用模式为异步时,系统将自动预置
task_id和status参数。参数类型
参数类型同请求参数。
示例(非必填)
输入该参数的取值示例,用于API文档。
描述(非必填)
输入对当前参数的相关说明。
是否URL
该参数的取值是否为文件URL,仅开启文件存储后支持选中。
完成配置后,单击提交。
提交时,系统将自动执行对象检查和权限检查,您可在提交详情对话框中查看详情。更多信息请参见。
附录:不同索引类型相关配置
当元数据存储类型为Milvus、字段类型选择为密集向量(非INT8_VECTOR)时,支持向量配置。
当元数据存储类型为PostgreSQL、字段类型为向量时,支持向量配置。
在向量配置中,当创建索引选择是时,需根据不同索引类型配置不同字段。Milvus支持全部索引类型,PostgreSQL仅支持IVF_FLAT和HNSW索引类型。
索引类型 | 相关字段 |
IVF_FLAT | nlist:划分数据集的蔟数,支持[1,65536]间的整数,默认为128。 |
IVF_SQ8 | |
IVF_PQ |
|
IVF_RABITQ |
|
HNSW |
|
HNSW_SQ |
|
HNSW_PQ |
|
HNSW_PRQ | |
SCANN |
|
AISAQ |
|
AUTOINDEX FlAT DISKANN | - |
管理数据集
在Dataphin首页的顶部菜单栏中,选择研发 > 数据研发。
在开发页面的顶部菜单栏选择项目。
在左侧导航栏中选择数据处理 > 数据集,在数据集列表单击目标数据集,可查看该数据集的详细信息,若数据集包含多个版本,您可单击不同版本页签查看各版本信息。数据集支持的其他操作如下。
操作
说明
查看数据集信息
离线、实时数据集:可查看数据集的基本信息,包括数据集类型、存储类型(仅文件数据集和混合数据集)、内容类型、负责人、创建时间和描述;在各版本页签中可查看该版本的文件存储(仅文件数据集和混合数据集)和元数据存储(仅表数据集和混合数据集)。
API数据集:可查看数据集的基本信息,包括API ID、所属数据服务项目、API分组、数据集类型、内容类型、负责人和创建时间等。此外,还可在各版本页签中查看该版本的API基础配置、文件存储、请求参数和返回参数,以及被引用的工作流。
被引用的工作流区域展示绑定当前版本的在线工作流信息,包括工作流名称(单击可跳转至工作流画布配置页)、状态、绑定状态、负责人、描述及最近发布时间,API数据集版本与在线工作流为1:1绑定,每个版本最多展示1条记录。
编辑数据集基本信息
单击数据集页签顶部菜单栏中的编辑,编辑其基本信息。
离线、实时数据集:不支持修改数据集类型、对象存储类型、元数据存储类型、内容类型和负责人,其他可修改参数说明同新建操作。
API数据集:不支持修改使用场景、API ID、数据集类型和数据服务项目,其他可修改参数说明同新建操作。

编辑数据集版本
在数据集页签的数据集版本中单击编辑,可编辑对应版本的描述和挂载路径。
API数据集编辑版本时仅支持修改版本描述,其他配置不支持修改,如需调整请新建数据集版本。

新建数据集版本
单击数据集页签下的新建数据集版本,可选择基于最新版本新建或新建空白版本,各参数说明同新建操作。
删除版本
当数据集存储多个版本时,支持删除版本,但至少需保留一个版本。若目标版本存在对象引用时,则不支持删除。
删除API数据集的某一版本时,若该版本的绑定状态为BOUND(已绑定),需先下线并删除绑定的在线工作流;删除版本后,网关中对应版本的路由一并清除,不影响同一数据集的其他版本。
删除数据集
在左侧数据集目录中,单击目标数据集后的更多图标,并选择删除。在弹出的对话框中填写备注后,单击确定并提交。
说明当数据集存在对象引用时,不支持删除,需先解除引用。
API数据集仅支持删除,不提供下线操作。当存在处于BOUND(已绑定)状态的在线工作流时不允许删除,需先下线并删除引用的工作流。
