调优数据上传规则

更新时间:
复制 MD 格式

介绍文本生成模型调优数据的格式规格、打包要求、大小与数量限制及 API 上传配额,帮助用户按训练方式构造并上传合规的 SFT/DPO/CPT 训练数据。

概述

本文档阐述文本生成模型调优数据的格式规格、打包要求、大小与数量限制及 API 上传配额。适用范畴为文本生成模型调优(text/image/video → text),涵盖纯文本 SFT/DPO/CPT、千问 VL 图片与视频理解、视频抽帧、工具调用(function calling)与深度思考(thinking)。视频生成模型调优(image → video)不属于本范畴。

数据集类型(训练集或评测集)创建后不可变更。各训练方式与元素的支持情况详见训练方式与元素支持矩阵,各组合的格式构造规则见下文对应章节。

警告

发布与删除操作不可逆:已发布版本不可再编辑,仅草稿版本可删除或在线编辑;数据集类型创建后不可变更。切换类型、场景或训练方式会清空已上传文件。

管理类操作(创建参数、版本管理、评测集管理规则、导入方式选型、数据清洗、安全合规)引导到同级文档,详见训练集与评测集模型调优简介等。建议在创建数据集页面下载对应场景的数据模板,按模板结构准备数据可避免导入失败。

数据集构建建议(推荐数据规模、多样性与均衡、数据扩充策略)详见模型调优简介-数据集构建技巧

训练方式与元素支持矩阵

训练集支持 SFT、DPO、CPT 三种训练方法,各训练方式与元素的支持情况见下文矩阵表。调优推荐顺序为 CPT(可选)→ SFT → DPO(可选),三者递进非互斥。

地域可用性:

  • SFT、本地上传、日志回流、API 上传、多模态数据格式全地域支持。

  • DPO、CPT、OSS 导入、云存储挂载仅支持北京地域。

训练方式与元素的支持矩阵如下:

训练方式

文本生成

图片输入

视频输入(qwen3.5+)

工具调用(qwen3.5+)

深度思考

SFT

DPO

CPT

评测集

训练方法 SFT/DPO/CPT 字段定义详见模型调优简介

SFT 文本格式

SFT 文本生成训练数据采用 jsonl 文件格式,基于 ChatML messages 多轮结构。

  • 支持 system、user、assistant 三种角色,content 字段为 [{text: "…"}] 数组。

  • 单文件大小上限 200 MB。

  • 一个数据集可混合不同格式行——每条记录独立选格式,无需统一为单一格式。

  • 可选格式:普通对话、深度思考、工具调用、工具与思考组合(见下方标签页样例)。

SFT 文本生成支持以下样例格式,各样例的完整 JSON 结构见对应标签页:

普通 ChatML

普通 ChatML 格式样例(system/user/assistant 多轮对话):

{
  "messages": [
    {"role": "system", "content": [{"text": "系统输入1"}]},
    {"role": "user", "content": [{"text": "用户输入1"}]},
    {"role": "assistant", "content": [{"text": "期望的模型输出1"}]},
    {"role": "user", "content": [{"text": "用户输入2"}]},
    {"role": "assistant", "content": [{"text": "期望的模型输出2"}]}
  ]
}

深度思考(thinking)

深度思考(thinking)格式样例(思考标签放最后一条 assistant,前后换行必须保留):

{
  "messages": [
    {"role": "system", "content": [{"text": "系统输入1"}]},
    {"role": "user", "content": [{"text": "用户输入1"}]},
    {"role": "assistant", "content": [{"text": "模型输出1"}]},
    {"role": "user", "content": [{"text": "用户输入2"}]},
    {"role": "assistant", "content": [{"text": "<think>\n期望的思考内容2\n</think>\n\n期望的输出2"}]}
  ]
}

深度思考内容用 <think>…</think> 标签包裹,置于 assistant 输出文本内(与最终答复同属最后一条 assistant 的 content)。规则:

  • 只能放在最后一条 assistant 输出中;中间的 assistant 输出不加思考标签。

  • 思考标签前后的换行符必须保留。

  • 若训练样本设置模型不输出思考标签,训练完成后不建议再开启思考模式调用。

工具调用(function calling)

工具调用(function calling)格式样例(tools 定义 + messages 多轮含 tool 角色,tool_call_id 一一对应):

{
  "tools": [
    {
      "type": "function",
      "function": {
        "name": "get_weather",
        "description": "查询指定城市的实时天气",
        "parameters": {
          "type": "object",
          "properties": {
            "city": {"type": "string", "description": "城市名称,例如:北京"}
          },
          "required": ["city"]
        }
      }
    }
  ],
  "messages": [
    {"role": "user", "content": [{"text": "帮我查一下北京的天气"}]},
    {
      "role": "assistant",
      "content": [{"text": "好的,我来帮您查询北京的天气。"}],
      "tool_calls": [
        {
          "id": "call_3a11c1ba883b41b6a4e0cb",
          "type": "function",
          "function": {
            "name": "get_weather",
            "arguments": "{\"city\": \"北京\"}"
          }
        }
      ]
    },
    {"role": "tool", "tool_call_id": "call_3a11c1ba883b41b6a4e0cb", "content": [{"text": "{\"city\": \"北京\", \"weather\": \"晴\", \"temperature\": \"25℃\"}"}]},
    {"role": "assistant", "content": [{"text": "北京今天天气晴朗,气温 25℃,适合出行。"}]}
  ]
}

工具字段说明

工具调用(function calling)模式在 messages 多轮结构基础上增加 tools 定义与 tool_calls/role:tool 机制,字段约束如下:

  • tools:工具定义数组,每项含 type:"function" 与 function{name, description, parameters};parameters 为 JSON Schema(含 type/properties/required)。

  • messages:多轮对话数组,角色含 user、assistant、tool。

  • content:多模态内容数组,可含 image、text、video 等项(与多模态理解格式一致)。

  • assistant.tool_calls:模型生成的工具调用数组,含 id、type:"function"、function{name, arguments};arguments 为 JSON 字符串。

  • role:"tool":工具返回,tool_call_id 必须与对应 tool_calls[].id 一一对应,content 内为工具返回结果。

多轮对话最后一条通常为 assistant 基于工具返回的最终答复。

loss_weight 字段约束:

  • 邀测参数,取值范围 0.0 至 1.0,数值越大表示该行在训练时的相对重要性越高。

  • SFT 思考模型仅最后一条 assistant 行支持 loss_weight。

  • 如需使用请联系商务经理。

百炼不支持 OpenAI 的 name、weight 参数,所有 assistant 输出都会被训练。从 OpenAI/Azure 迁移的训练数据不可携带 name/weight 字段。

数据多样性与均衡性建议:各场景数据数量应相对均衡,数据比例符合实际场景比例,避免某一类数据过多导致模型偏向于学习该类特征,影响泛化能力。

工具与思考组合

工具与思考组合格式样例(工具调用与深度思考同时出现,思考标签与 tool_calls 在同一条 assistant):

{
  "tools": [
    {
      "type": "function",
      "function": {
        "name": "get_weather",
        "description": "查询指定城市的实时天气",
        "parameters": {
          "type": "object",
          "properties": {
            "city": {"type": "string", "description": "城市名称,例如:北京"}
          },
          "required": ["city"]
        }
      }
    }
  ],
  "messages": [
    {
      "role": "user",
      "content": [
        {"text": "帮我查一下北京的天气"}
      ]
    },
    {
      "role": "assistant",
      "content": [
        {"text": "<think>\n用户询问北京天气,调用 get_weather 工具获取实时数据\n</think>\n"}
      ],
      "tool_calls": [
        {
          "id": "call_3a11c1ba883b41b6a4e0cb",
          "type": "function",
          "function": {
            "name": "get_weather",
            "arguments": "{\"city\": \"北京\"}"
          }
        }
      ]
    },
    {
      "role": "tool",
      "tool_call_id": "call_3a11c1ba883b41b6a4e0cb",
      "content": [
        {"text": "{\"city\": \"北京\", \"weather\": \"晴\", \"temperature\": \"25℃\"}"}
      ]
    },
    {
      "role": "assistant",
      "content": [
        {"text": "北京今天天气晴朗,气温 25℃,适合出行。"}
      ]
    }
  ]
}

评测集格式

评测集仅服务文本生成场景,与 SFT/DPO/CPT 训练方式无关——DPO/CPT 训练后的模型同样使用文本生成评测集进行评测,不区分训练方式。

评测集规格:

  • 文件格式 xlsx,列结构见控制台下载模板。

  • 入库方式:本地上传、日志回流;不支持对象存储(OSS)导入与云存储挂载。

  • 仅草稿版本支持在线编辑(Prompt/Completion),已发布版本不可编辑。

日志回流入库限制:

  • 支持日志范围为最近 30 天内。

  • 单次导入上限 10 万条。

  • 需授权服务关联角色并指定 API Key 与模型筛选条件。

  • 训练集仅 SFT 文本生成场景可用(评测集文本生成亦支持)。

日志回流导入方式详情见日志回流

评测集应准备数据不重叠的独立集合,用于客观评估模型泛化能力。评测集管理规则详见训练集与评测集

SFT 图片输入

SFT 图片训练数据用于千问 VL 多模态理解(控制台 UI 选项为「图片理解」)场景,采用 zip 压缩包格式,包含 data.jsonl 训练文本数据文件与图片文件。data.jsonl 须置于压缩包根目录,data.jsonl 中每条训练数据的 messages 采用 content 数组结构,数组项含图片字段(image)与文本字段(text)。推荐使用单层目录结构,打包规则详见多模态压缩包打包规则

图片准入限制如下:

  • 单张图片宽度和高度均不超过 1024 px。

  • 单张图片不超过 10 MB。

  • 支持格式:bmp、jpeg、jpg、png、tif、tiff、webp。

resized_width 与 resized_height 为可选的目标缩放控制参数,用于指定图片目标缩放尺寸,非图片准入上限。图片准入上限为宽高不超过 1024 px、单张不超过 10 MB。图片准入具体数值以控制台实际展示为准。

SFT 图片训练样例见下文标签页:

图片加文本

图片加文本格式样例(content 数组含图片项与文本项):

{
  "messages": [
    {"role": "system", "content": [{"text": "系统输入"}]},
    {
      "role": "user",
      "content": [
        {"text": "用户输入1"},
        {"image": "图像文件名1.jpg", "resized_width": 200, "resized_height": 200}
      ]
    },
    {"role": "assistant", "content": [{"text": "期望的模型输出1"}]}
  ]
}

图片加思考

图片加思考格式样例(规则见SFT 文本格式):

{
  "messages": [
    {"role": "system", "content": [{"text": "系统输入"}]},
    {
      "role": "user",
      "content": [
        {"text": "这张图片是什么?"},
        {"image": "image1.jpg"}
      ]
    },
    {
      "role": "assistant",
      "content": [
        {"text": "<think>\n图片为城市风景,需进一步分析\n</think>\n\n该图片为北京天安门广场。"}
      ]
    }
  ]
}

图片加工具

图片加工具格式样例(含图片多模态 content 项与工具调用机制,JSON 逐字保留):

{
  "tools": [
    {
      "type": "function",
      "function": {
        "name": "get_weather",
        "description": "查询指定城市的实时天气",
        "parameters": {
          "type": "object",
          "properties": {
            "city": {"type": "string", "description": "城市名称,例如:北京"}
          },
          "required": ["city"]
        }
      }
    }
  ],
  "messages": [
    {
      "role": "user",
      "content": [
        {"image": "beijing.jpeg"},
        {"text": "这张图片是哪个城市?帮我查一下它现在的天气"}
      ]
    },
    {
      "role": "assistant",
      "content": [
        {"text": "我需要通过图片判断图片归属的城市"}
      ],
      "tool_calls": [
        {
          "id": "call_3a11c1ba883b41b6a4e0cb",
          "type": "function",
          "function": {
            "name": "get_weather",
            "arguments": "{\"city\": \"北京\"}"
          }
        }
      ]
    },
    {
      "role": "tool",
      "tool_call_id": "call_3a11c1ba883b41b6a4e0cb",
      "content": [
        {"text": "{\"city\": \"北京\", \"weather\": \"晴\", \"temperature\": \"25℃\"}"}
      ]
    },
    {
      "role": "assistant",
      "content": [
        {"text": "北京今天天气晴朗,气温 25℃,适合出行。"}
      ]
    }
  ]
}

多模态理解定义详见模型调优简介

SFT 视频输入

SFT 视频训练数据用于千问 VL 多模态理解场景,仅 qwen3.5 及以后的 VL 模型支持。支持两种视频输入模式:

  • 视频文件路径模式:video 字段为字符串(如 "video1.mp4"),由平台处理抽帧。适用于使用完整视频文件的场景。

  • 图片帧列表模式:video 字段为图片文件名列表(如 ["0.jpg","1.jpg"]),用户自行准备帧序列。适用于已有抽帧图片的场景。

说明

训练数据中的图片与视频须同时满足模型调用的输入限制(如图像分辨率、视频时长、帧率等),调用限制详见视觉理解模型使用限制

两种模式的字段对比与样例见下文:

字段/参数

视频文件路径模式

图片帧列表模式

video

str(视频文件路径,必填)

List[str](图片帧列表,必填)

sample_fps

不适用

float([0.1, 10],默认 2.0,可选)

fps

float([0.1, 10],默认 2.0,可选)

不适用

resized_width

int(缩放宽度,可选)

int(缩放宽度,可选)

resized_height

int(缩放高度,可选)

int(缩放高度,可选)

video_start

float(截取起始时间,可选)

不适用

video_end

float(截取结束时间,可选)

不适用

视频文件路径模式

视频文件路径模式格式样例(video 字段为视频文件路径字符串):

{
  "messages": [
    {"role": "system", "content": [{"text": "系统输入"}]},
    {
      "role": "user",
      "content": [
        {"text": "用户输入1"},
        {"video": "视频文件名1.mp4", "fps": 3.0, "resized_width": 200, "resized_height": 200, "video_start": 0.0, "video_end": 3.0}
      ]
    },
    {"role": "assistant", "content": [{"text": "期望的模型输出1"}]}
  ]
}

图片帧列表模式

图片帧列表模式格式样例(video 为帧列表,含 sample_fps):

{
  "messages": [
    {"role": "system", "content": [{"text": "系统输入"}]},
    {
      "role": "user",
      "content": [
        {"text": "用户输入2"},
        {"video": ["0.jpg", "1.jpg", "2.jpg", "3.jpg"], "sample_fps": 5.0, "resized_width": 200, "resized_height": 200}
      ]
    },
    {"role": "assistant", "content": [{"text": "期望的模型输出2"}]}
  ]
}

视频加思考

视频加思考格式样例,思考标签规则详见SFT 文本生成训练数据

{
  "messages": [
    {"role": "system", "content": [{"text": "系统输入"}]},
    {
      "role": "user",
      "content": [
        {"text": "这段视频讲了什么?"},
        {"video": "video1.mp4"}
      ]
    },
    {
      "role": "assistant",
      "content": [
        {"text": "<think>\n视频内容为城市夜景,包含交通场景\n</think>\n\n该视频展示夜间城市交通。"}
      ]
    }
  ]
}

DPO 文本格式

DPO 文本生成训练数据采用 jsonl 格式,基于 ChatML messages 多轮结构,额外含 chosen 与 rejected 两条对比的 assistant 输出,用于偏好对齐训练。messages 内的所有内容均作为输入,DPO 用于训练模型对最后一条 user 输入的正负反馈。messages 多轮结构规则见SFT 文本格式

针对深度思考内容,chosen 或 rejected 的 assistant 输出可使用思考标签包裹,思考标签只能放最后一条 assistant 行,规则见SFT 文本格式

loss_weight 邀测参数支持 chosen 模块,取值范围 0.0 至 1.0,数值越大训练重要性越高,需联系商务经理,详见SFT 文本格式

DPO 场景的工具调用数据支持情况待确认(source 文档未给出 DPO+tool 格式段,需产品确认),工具字段说明见SFT 文本格式

DPO 训练数据单文件大小上限为 200 MB,与 SFT 文本生成一致。DPO 定义详见模型调优简介,草稿与发布操作见训练集与评测集

DPO 文本生成训练数据样例见下文代码块:

  • 普通 chosen/rejected 对比:两条对比的 assistant 输出。

  • 思考标签结构:深度思考内容用思考标签包裹。

普通 chosen/rejected 对比格式样例(两条对比的 assistant 输出):

{
  "messages": [
    {"role": "system", "content": [{"text": "系统输入"}]},
    {"role": "user", "content": [{"text": "用户输入1"}]},
    {"role": "assistant", "content": [{"text": "模型输出1"}]},
    {"role": "user", "content": [{"text": "用户输入2"}]},
    {"role": "assistant", "content": [{"text": "模型输出2"}]},
    {"role": "user", "content": [{"text": "用户输入3"}]}
  ],
  "chosen": {"role": "assistant", "content": [{"text": "赞同的模型期望输出3"}]},
  "rejected": {"role": "assistant", "content": [{"text": "反对的模型期望输出3"}]}
}

思考标签格式样例(深度思考内容用思考标签包裹,放最后 assistant):

{
  "messages": [
    {"role": "system", "content": [{"text": "系统输入"}]},
    {"role": "user", "content": [{"text": "用户输入1"}]},
    {"role": "assistant", "content": [{"text": "模型输出1"}]},
    {"role": "user", "content": [{"text": "用户输入2"}]}
  ],
  "chosen": {"role": "assistant", "content": [{"text": "<think>期望的模型思考内容</think>期望的模型输出"}]},
  "rejected": {"role": "assistant", "content": [{"text": "反对的模型期望输出2"}]}
}

CPT 文本格式

CPT 文本生成训练数据采用 jsonl 纯文本格式,每行一个 jsonl 对象,结构为 {text},text 字段为纯文本内容。messages 多轮结构规则见SFT 文本格式

CPT 训练数据约束:

  • 建议至少 5000 万 Token,单文件大小上限 300 MB。

  • 不支持草稿状态与数据继承,每次新增版本均需新建数据并立即发布。

CPT 定义详见模型调优简介,版本管理与数据继承操作见训练集与评测集。CPT 纯文本样例完整 JSON 结构见下文代码块。

各训练方式版本新增时的数据继承策略如下(CPT 不支持继承已有数据,每次新增版本均需新建):

数据继承策略

SFT

DPO

CPT

继承已有数据

创建新数据

支持(强制新建)

{text} 纯文本格式样例(每行一个 jsonl 纯文本对象):

{
  "text": "文本内容"
}

多模态压缩包打包规则

多模态理解训练数据以 zip 压缩包形式通过新增数据集页面上传,打包须满足以下约束:

  • 压缩包最大支持 2 GB。

  • 包内文件夹与文件名允许的字符集为 ASCII 字母(a-z、A-Z)、数字(0-9)、下划线(_)、连字符(-)。

  • 训练文本数据文件固定为 data.jsonl,必须位于压缩包根目录——确保压缩后打开 zip 文件直接看到 data.jsonl,外层不能再包裹文件夹。

图片或视频文件名应在压缩包内全局唯一,即使分布在不同文件夹中。data.jsonl 内只需声明文件名而非文件路径——正确示例:image1.jpg;错误示例:jpg_folder/image1.jpg。

云存储挂载不支持 zip 压缩包。使用云存储挂载加载数据集时,须将未经压缩的数据集文件夹整体上传到 OSS Bucket,通过 MountStorage 的 file_path 指定 data.jsonl 文件路径;包含多文件时只需指定 data.jsonl 路径,其余同目录文件自动挂载。云存储挂载详见使用 API 进行模型调优

命名示例与目录结构见下文代码块。云存储挂载授权操作见在控制台进行模型调优,OSS 导入 Bucket 标签打标操作见训练集与评测集

# 单层目录(推荐)
Trainingdata_vl.zip
  |--- data.jsonl        # 必须在根目录,外层不再包裹文件夹
  |--- image1.png
  |--- video1.mp4

# data.jsonl 内声明文件名(非路径)
# 正确:image1.jpg
# 错误:jpg_folder/image1.jpg

前往控制台新增数据集页面上传多模态压缩包并完成打包校验。

文件大小与数量限制

本地上传文件大小与数量上限按训练方式分场景设定,详见下文分场景表。图片准入限制见SFT 图片输入,评测集格式限制见评测集格式,日志回流入库限制见评测集格式

max_length 取值区间 500 至 131072 为训练序列长度配置参数,非上传准入上限。单条训练数据上传准入大小上限源文档未给出数值,以控制台页面展示为准。

本地上传文件大小与数量上限按训练方式分场景设定,推荐数据量为最低建议值:

训练方式/场景

单文件大小上限

文件数量上限(maxCount)

推荐数据量

SFT 文本生成

200 MB

10(默认)

至少上千条

DPO 文本生成

200 MB

10(默认)

至少上百条

多模态(zip)

2 GB

1

根据实际场景准备充足样本

CPT 文本生成

300 MB

1

至少 5000 万 Token

文件名(不含后缀)

≤120 字符且不重名

扩展名

须在 supportedExtension 列表

API 上传配额

通过 DashScope API 上传调优文件(用途标记为模型调优)的配额见下文配额表。控制台创建数据集时,File API 列表最多支持 10 个文件合并注册;通过 API 上传的调优文件在控制台模型调优页面与 API 调用中均可见可用。

云存储挂载加载数据集的约束:

  • 通过 MountStorage 的 file_path 指定 data.jsonl 根目录清单路径,不支持 zip 压缩包。

  • 选择云存储挂载存储位置时强制立即发布,不支持草稿状态。

  • 挂载前需授权百炼服务访问 OSS 数据。

超限承接与加密:

  • 单文件超过 300 MB:走云存储挂载或多模态 ZIP 2 GB 通道。

  • 总配额超额:删除历史文件释放空间。

  • 导入数据自动启用 OSS 服务端加密(SSE-OSS,AES256)。

API 调用、认证、SDK、错误码、MountStorage 字段细节见使用 API 进行模型调优

API 上传调优文件配额如下:

配额项

限制值

说明

单文件大小

不超过 300 MB

调优文件(模型调优用途)

有效文件总空间

100 GB

未删除文件累计

有效文件总数量

10000 个

未删除文件累计

文件存储时长

无时间限制

不自动过期

File API 列表上限

10 个

控制台创建数据集时合并注册

OSS 导入与云存储挂载的差异对比如下:

维度

OSS 导入

云存储挂载

前置条件

百炼数据访问授权标签

授权百炼服务访问 OSS 数据

数据形态

单个或批量文件

未经压缩的数据集文件夹整体(不支持 zip)

入口

数据管理 > 新增数据集 > OSS 导入

模型调优 > 创建训练任务 > 数据配置 > 数据集挂载

版本草稿

支持草稿与立即发布

强制立即发布(不支持草稿)

评测集✓

上传校验与常见错误

新增数据集页面本地上传文件时,前端校验会拒绝不符合准入规则的文件并弹出提示。常见校验拒绝与上传出错场景见下文折叠项:

【截图:report/creates/2026-07-28-第1批/text-generation-tuning-data-upload-rules/screenshots/cn-create-dataset-import-upload.png — alt:新增数据集页面数据上传区,显示存储位置(平台OSS存储/云存储挂载)、导入方式(本地上传/从OSS导入/日志回流)、本地上传限制(0/10、200MB、jsonl/xls/xlsx)及发布配置(立即发布/保存为草稿)。caption:新增数据集页数据上传区与本地上传准入限制】

问题:上传文件时前端提示文件数量超过上限,文件被拒绝上传。

定位:maxCount 按训练方式设定——SFT/DPO 文本默认 10,多模态 zip 与 CPT 为 1。上传文件数超过对应训练方式的上限即被前端拒绝。

处置:按以下方式调整后重传:

  1. 核对当前训练方式对应的 maxCount 上限,详见文件大小与数量限制

  2. 减少文件数至上限内;多模态数据合并为单个 zip,CPT 数据合并为单个 jsonl。

  3. 文件数仍超限时拆分为多个数据集分批上传。

问题:文件名(不含后缀)长度超过 120 字符,前端拒绝上传。

定位:文件名不含后缀上限 120 字符,且须仅含 ASCII 字母、数字、下划线、连字符。

处置:按以下方式调整后重传:

  1. 重命名文件,使文件名(不含后缀)缩短至 120 字符以内。

  2. 仅使用 a-z/A-Z/0-9/_/- 字符,去除中文及其他非 ASCII 字符。

  3. 多模态压缩包内文件名还须全局唯一。

问题:文件名(不含后缀比对)重复,前端拒绝上传。

定位:同一数据集内文件名不含后缀须唯一,比对时忽略扩展名。

处置:按以下方式调整后重传:

  1. 排查重名文件,重命名使其不含后缀部分唯一。

  2. 同名不同扩展名的文件(如 image.jpg 与 image.png)也会被判重名,须同时区分。

  3. 多模态 zip 内文件名须全局唯一,即使分布在不同文件夹。

问题:单文件大小超过对应训练方式上限,前端拒绝上传。

定位:单文件大小上限按训练方式分场景——SFT/DPO 文本 200 MB、多模态 zip 2 GB、CPT 300 MB。

处置:按以下方式调整后重传:

  1. 核对文件大小是否超过对应训练方式上限。

  2. 拆分 jsonl 为多个文件分批上传(SFT/DPO);CPT 数据拆分需新建多个数据集。

  3. 单文件超 300 MB 的承接方式见API 上传配额

问题:文件扩展名不在 supportedExtension 列表,前端弹出 warning 并拒绝上传。

定位:扩展名须在支持列表内——文本训练用 jsonl,评测集用 xlsx,多模态图片支持 bmp/jpeg/jpg/png/tif/tiff/webp,多模态视频支持 mp4 等格式。

处置:按以下方式调整后重传:

  1. 核对文件扩展名是否在对应场景的支持列表内。

  2. 将文件转换为支持的扩展名后重新打包上传。

  3. 多模态 zip 内图片与视频扩展名须逐一符合,否则整包导入失败。

问题:OSS 上传过程中文件被置为 error 状态,上传未完成。

定位:常见原因为 Bucket 标签缺失、百炼服务访问 OSS 授权异常或文件格式不符。

处置:按以下方式排查后重试:

  1. 核对 OSS Bucket 已添加百炼数据访问授权标签。

  2. 确认已授权百炼服务访问 OSS 数据。

  3. 检查 data.jsonl 与文件格式符合打包规则后重试上传,详见多模态压缩包打包规则

不可逆操作风险提示:

  • 发布与删除操作均不可逆;已发布版本不可再编辑,仅草稿版本可删除或在线编辑。

  • 数据集类型(训练集/评测集)创建后不可变更、不可互换,选错需新建数据集重新导入全部数据。

  • 切换数据集类型、训练场景、训练方式时会清空已上传文件并重置存储位置与导入方式。

验证集自动切分会从训练集中随机抽取 10% 数据作为验证集,减少实际训练数据量。小数据集建议选择独立验证集,验证集配置操作见在控制台进行模型调优

建议先下载对应场景的数据模板,按模板结构准备数据可避免导入失败,数据模板下载建议见概述。常见问题排障详见下文折叠项。草稿数据清洗与增强操作见数据清洗或增强,安全合规数据领域见0 代码强化大模型安全合规能力

上传校验失败时,可前往控制台新增数据集页面核对文件格式与准入规则。