请求参数 请求头(Headers) Content-Type string (必选)
固定值:application/json
Authorization string (必选)
API Key 鉴权,格式为Bearer sk-xxxx。
请求体(Request Body) model string (必选)
指定调优所用的基准模型。当前仅支持:
training_type string (必选)
微调类型,当前仅支持efficient_sft(高效微调)。
hyper_parameters object (必选)
超参数配置 。CosyVoice 调优涉及两个子网络,两者已解耦、可独立调整:
LM(Language Model):将文本转为离散语音 token 的自回归语言模型,对韵律影响较大。超参以 lm_* 前缀区分。
FM(Flow Matching):将语音 token 还原为 Mel 谱的流匹配模型,对音色还原度影响较大。超参以 fm_* 前缀区分。
超参数属性
lm_max_epoch int (必选)
LM 调优轮次(epoch 数)。推荐值:60。取值范围:[1, 2147483647]。
lm_step int (必选)
LM 保存 checkpoint 的步长(每多少个 epoch 保存一次)。推荐值:5。取值范围:[1, 2147483647]。
lm_num int (必选)
LM 保留的 checkpoint 数量上限。推荐值:3。取值范围:[1, 2147483647]。
lm_batch_size int (必选)
LM 批次大小(batch size)。推荐值:1000。取值范围:[1, 2147483647]。
fm_max_epoch int (必选)
FM 调优轮次(epoch 数)。推荐值:100。取值范围:[1, 2147483647]。
fm_step int (必选)
FM 保存 checkpoint 的步长(每多少个 epoch 保存一次)。推荐值:10。取值范围:[1, 2147483647]。
fm_num int (必选)
FM 保留的 checkpoint 数量上限。推荐值:3。取值范围:[1, 2147483647]。
fm_batch_size int (必选)
FM 批次大小(batch size)。推荐值:2000。取值范围:[1, 2147483647]。
training_datasets Array of Dataset (条件必选)
训练集文件列表。与 training_file_ids 二选一,若使用 training_file_ids 则无需传此参数。仅支持挂载一个训练文件。
Dataset 结构
data_source_type string (必选)
数据源类型,可选值:
oss_mount(挂载 OSS 文件)
file_id(由文件管理服务 API 上传的文件)
mount_storage object (条件必选)
数据源类型为 oss_mount 时必填。OSS 挂载信息。
属性
region string (必选)
要挂载的 OSS Bucket 所属地域。支持北京(cn-beijing)和新加坡(ap-southeast-1)。
bucket string (必选)
要挂载的 OSS Bucket 名称。
file_path string (必选)
要挂载的 OSS 文件路径(object key)。对包含多个文件的数据集,使用其 data.jsonl 的文件路径。与使用 file_id 的方式不同,需要将未经压缩的数据集文件夹整体上传到 OSS,不支持 zip 文件。
file_id string (条件必选)
数据源类型为 file_id 时必填。文件 ID,由上传文件 API 产生。
validation_datasets Array of Dataset (可选)
验证集文件列表。结构同training_datasets。
与 validation_file_ids 二选一。若两者均不提供,系统会从训练集中自动划分。
training_file_ids array[string] (条件必选)
训练集文件 ID 数组,可传入多个 ID。与 training_datasets 二选一,若使用 training_datasets 则无需传此参数。文件 ID 通过上传文件 API 获取。
validation_file_ids array[string] (可选)
验证集文件 ID 数组,可传入多个 ID。与 validation_datasets 二选一,若使用 validation_datasets 则无需传此参数。若两者均不提供,系统会从训练集中自动划分。文件 ID 通过上传文件 API 获取。
job_name string (可选)
调优任务名称。
model_name string (可选)
调优完成后的模型名称。
使用 file_id 的数据集 curl --location 'https://dashscope.aliyuncs.com/api/v1/fine-tunes' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"model": "cosyvoice-v3-flash",
"training_datasets": [
{
"data_source_type": "file_id",
"file_id": "<替换为训练数据集的 file_id>"
}
],
"hyper_parameters": {
"lm_max_epoch": 60,
"lm_step": 5,
"lm_num": 3,
"lm_batch_size": 1000,
"fm_max_epoch": 100,
"fm_step": 10,
"fm_num": 3,
"fm_batch_size": 2000
},
"training_type": "efficient_sft"
}'
使用 OSS 挂载的数据集 curl --location 'https://dashscope.aliyuncs.com/api/v1/fine-tunes' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"model": "cosyvoice-v3-flash",
"training_datasets": [
{
"data_source_type": "oss_mount",
"mount_storage": {
"region": "cn-beijing",
"bucket": "example_bucket",
"file_path": "dataset/data.jsonl"
}
}
],
"hyper_parameters": {
"lm_max_epoch": 60,
"lm_step": 5,
"lm_num": 3,
"lm_batch_size": 1000,
"fm_max_epoch": 100,
"fm_step": 10,
"fm_num": 3,
"fm_batch_size": 2000
},
"training_type": "efficient_sft"
}'