训练集与评测集

更新时间:
复制 MD 格式

数据集是模型训练与评测的基础,阿里云百炼数据管理功能可以帮助您高效地创建和管理数据集。

数据集概述

阿里云百炼数据管理功能对您业务空间下所有大模型相关数据集进行统一管理。数据集分为训练集(用于模型调优,支持 SFT/DPO/CPT)和评测集(用于模型评测两类。

训练集支持4种训练场景:文本生成、多模态理解、图生视频(首帧)、图生视频(首尾帧);评测集仅支持文本生成场景。数据集类型创建后不可变更,请根据下游用途谨慎选择。

数据集名称最长50字符(支持中文、英文、数字、下划线、连字符和点),描述最长200字符。不支持创建或发布空数据集。数据集创建数量无限制,导入数据量无上限。

DPO/CPT 训练方法、云存储挂载仅支持北京地域。

训练方法与场景

训练集支持三种训练方法,适用场景和最低数据量要求不同:

  • SFT(监督微调):指令微调,使模型学会解决特定任务。建议数据量上千条。全部站点可用。

  • DPO(直接偏好优化):偏好对齐训练。建议数据量上百条。

  • CPT(持续预训练):领域知识注入。建议数据量至少 5000 万 Token。不支持草稿状态和数据继承。

CPT 和图生视频训练集不支持草稿状态,创建时只能立即发布;SFT 和 DPO 文本生成训练集支持先存为草稿再发布。

训练方法

用途

推荐数据量

站点可用性

草稿支持

SFT

监督微调(指令微调)

上千条

全部站点

支持

DPO

直接偏好优化(偏好对齐)

上百条

北京地域

支持

CPT

持续预训练(领域知识)

5000万 Token

北京地域

不支持

导入方式

数据集支持三种导入方式,适用场景和前置条件不同:

  • 本地上传:无前置条件,直接上传本地文件,适合小批量数据。

  • OSS 导入:需在目标 Bucket 添加标签 bailian-datahub-access=read,适合大批量数据。评测集不支持此方式。

  • 日志回流:从 SLS 推理日志自动提取训练数据,需授权服务关联角色,形成推理→数据→微调增强回路。

日志回流仅支持最近 30 天内的日志,单次导入上限 10 万条,且需指定 API Key 和模型筛选条件。

导入数据自动启用 OSS 服务端加密(SSE-OSS,AES256)。日志回流可用。完整受限项见数据集概述。

导入方式

前置条件

适用场景

评测集支持

本地上传

小批量数据

支持

OSS 导入

Bucket 标签 bailian-datahub-access=read

大批量数据

不支持

日志回流

授权 + API Key/模型筛选

从推理日志构建训练数据

支持

警告

日志回流需先授权服务关联角色,且仅支持最近 30 天内的日志,单次导入上限 10 万条。

数据准备

准备高质量数据是模型调优效果的关键。各训练方式(SFT/DPO/CPT 文本生成)的推荐数据量详见调优数据上传规则

多模态理解和图生视频训练集暂无官方推荐数据量,建议根据实际场景准备充足样本。

数据格式与模板

各训练场景(SFT 文本/多模态理解(图/视频→文本)、DPO、CPT、评测集)的数据文件格式规格详见调优数据上传规则

建议在数据管理创建数据集页面下载对应场景的数据模板,按模板结构准备数据可避免导入失败。

数据多样性和扩充策略请参考模型调优文档。评测集应准备一份数据不重叠的独立集合,用于客观评估模型泛化能力。

创建数据集

创建数据集前需满足以下前提条件:已开通百炼服务;OSS 导入需在目标 Bucket 添加标签 bailian-datahub-access=read;日志回流需授权服务关联角色。

数据管理 > 数据集列表页,点击新增数据集,按以下步骤操作:

  1. 填写数据集名称(最长50字符)和描述(最长200字符,可选)。

  2. 选择数据集类型:训练集评测集(创建后不可变更)。

  3. 选择训练场景:文本生成、多模态理解、图生视频(首帧)、图生视频(首尾帧)。评测集仅支持文本生成。

  4. 选择训练方法:SFT、DPO、CPT。

  5. 选择存储位置:平台 OSS 存储(免费,无数据量上限)或云存储挂载(评测集不可用)。

  6. 选择导入方式并上传数据:本地上传、OSS 导入、日志回流(详见下方分 Tab 说明)。

  7. 配置发布选项:草稿立即发布。CPT 和图生视频训练集不支持草稿,只能立即发布。

  8. 点击提交完成创建。

三种导入方式的操作在不同 Tab 中进行,各 Tab 的字段和操作不同。SFT 文本生成和 DPO 文本生成训练集支持同时上传多个文件。

参数

说明

是否必填

取值说明

数据集名称

数据集标识

true

最长50字符,中文/英文/数字/下划线/连字符/点

数据集描述

数据集说明

最长200字符

数据集类型

训练集或评测集,创建后不可变更

true

训练集/评测集

训练场景

数据适用的训练场景

true

文本生成/多模态理解/图生视频(首帧)/图生视频(首尾帧)

训练方法

训练算法类型

true

SFT/DPO/CPT

存储位置

数据集存储方式

true

平台OSS存储/云存储挂载

导入方式

数据导入来源

true

本地上传/OSS导入/日志回流

发布配置

草稿或立即发布

true

草稿/立即发布(CPT和图生视频不支持草稿)

重要

CPT 和图生视频训练集不支持草稿状态,创建时只能立即发布。

image

本地上传

点击上传文件选择本地数据文件,SFT 文本生成和 DPO 文本生成支持多文件上传。文件格式需符合场景要求(详见数据准备章节),导入数据自动启用 SSE-OSS 加密。

OSS 导入

在目标 Bucket 添加标签 bailian-datahub-access=read 后,选择 Bucket 并指定数据文件路径。适合大批量数据导入,评测集不支持此方式。

日志回流

需先授权服务关联角色。选择 API Key 和模型,筛选最近 30 天内的推理日志(单次上限 10 万条),系统自动从日志提取训练数据,形成推理→数据→微调增强回路。完整操作细节请参考日志回流专篇。

版本管理

同一数据集可有多个独立版本,版本号自动递增。在数据集详情页点击新增版本可创建新版本。

新增版本时需选择数据继承策略:

  • 继承模式:基于上一版本数据增量修改,适合小幅迭代。

  • 新建模式:重新导入全部数据,适合大规模更新。

CPT 训练集不支持数据继承,每次新增版本均需新建数据。

草稿状态的数据集版本可用于数据处理(数据清洗和数据增强),提升数据质量后再发布。

说明

CPT 训练集不支持数据继承,每次新增版本均需新建数据。

数据集管理

数据管理 > 数据集列表页可查看所有数据集,支持按类型(训练集/评测集)筛选和按名称搜索。导入中的数据集每 5 秒自动刷新状态,无需手动刷新。

发布与删除

发布操作不可逆,发布后的版本不可再编辑。已发布版本的删除同样不可逆,仅草稿版本可删除;删除整个数据集会移除其下所有版本,操作均不可恢复,请谨慎执行。

编辑与导出

仅草稿版本可在线编辑(可编辑 Prompt/Completion 内容),已发布版本编辑功能不可用。导出数据集时各类型格式不同:SFT 训练集导出为 jsonl,多模态训练集导出为 zip,评测集导出为 xlsx,不支持导出空数据集。

image

重要

发布和删除操作均不可逆。已发布版本不可再编辑,仅草稿版本可删除,请谨慎执行。

计费说明

数据管理功能本身免费,但数据集存储和下游资源会产生费用,具体以百炼计费页面为准。

  • 平台 OSS 存储:费用以百炼计费页面为准。

  • 云存储挂载:费用归属用户自有 OSS 账单。

  • 日志回流:产生的 SLS 费用归属 SLS 产品账单。

建议在使用前查阅百炼计费文档了解最新价格。

下一步

数据集创建并发布后,可用于以下下游场景:

  • 训练集发布后用于模型调优(SFT/DPO/CPT)。

  • 评测集发布后用于模型评测

  • 草稿和已发布数据集均可用于数据处理(数据清洗和增强)。

如需了解日志回流的完整操作细节(授权流程、筛选逻辑),请参考日志回流专篇。

数据集 CRUD 当前仅支持控制台操作;模型调优 API 可通过 training_file_ids 参数引用已发布的训练集 ID。