查询和管理模型部署任务,包括查询部署详情、列举部署、修改部署限流、扩缩容和删除部署。
前提条件
-
您已经阅读了模型部署和使用 API 进行模型部署的相关内容,掌握了模型部署的使用方法,并熟悉了在阿里云百炼平台上进行模型部署的基本步骤。
-
已配置百炼的 API-KEY, 请参考获取API Key。
查询模型部署任务
地址
GET https://dashscope.aliyuncs.com/api/v1/deployments/{deployed_model}
请求示例
通过以下命令可以查询指定专属服务的详细信息:
curl "https://dashscope.aliyuncs.com/api/v1/deployments/qwen-plus-202305099980-fac9-sample" \
--header "Authorization: Bearer ${DASHSCOPE_API_KEY}" \
--header 'Content-Type: application/json'
请求参数
|
参数 |
类型 |
传参方式 |
必选 |
说明 |
|
deployed_model |
String |
path |
是 |
新模型的唯一标识,可通过创建部署或列举部署接口获取。 |
响应示例
命令执行完成后,返回如下结果:
{
"request_id": "66a855f0-a6fe-4b05-9786-fb30c7c6782d",
"output": {
"deployed_model": "emo-35b3f106-sample01",
"gmt_create": "2025-06-17T11:00:38",
"gmt_modified": "2025-06-17T11:06:13",
"status": "RUNNING",
"model_name": "emo",
"base_model": "emo",
"base_capacity": 1,
"capacity": 1,
"ready_capacity": 1,
"workspace_id": "llm-v71tlv3***",
"charge_type": "post_paid",
"creator": "175805416***",
"modifier": "175805416***"
}
}
响应参数
请参考创建模型部署任务的响应参数。
列举部署
地址
GET https://dashscope.aliyuncs.com/api/v1/deployments
请求示例
通过以下命令可以获取专属服务列表:
curl "https://dashscope.aliyuncs.com/api/v1/deployments?page_no=1&page_size=100" \
--header "Authorization: Bearer ${DASHSCOPE_API_KEY}" \
--header 'Content-Type: application/json'
请求参数
|
参数 |
类型 |
传参方式 |
必选 |
说明 |
|
page_no |
Number |
query |
否 |
页码,默认值为1。 |
|
page_size |
Number |
query |
否 |
页大小,默认为50,最大值为200,最小值为1。 |
响应示例
命令执行完成后,返回以下结果:
{
"request_id": "7efdd3a7-a90d-96c6-b477-70055d59edf7",
"output": {
"page_no": 1,
"page_size": 10,
"total": 1,
"deployments": [
{
"deployed_model": "emo-35b3f106-sample01",
"gmt_create": "2025-06-17T11:00:38",
"gmt_modified": "2025-06-17T11:06:13",
"status": "RUNNING",
"model_name": "emo",
"base_model": "emo",
"base_capacity": 1,
"capacity": 1,
"ready_capacity": 1,
"workspace_id": "llm-v71tlv3d***",
"charge_type": "post_paid",
"creator": "175805416***",
"modifier": "175805416***"
}
]
}
}
响应参数
请参考创建模型部署任务的响应参数。
修改部署限流
仅模型单元部署方式的部分模型支持修改设置 rpm 和 tpm。
地址
PUT https://dashscope.aliyuncs.com/api/v1/deployments/{deployed_model}/update
请求示例
通过以下命令可以修改指定部署的限流设置:
curl -X PUT "https://dashscope.aliyuncs.com/api/v1/deployments/{deployed_model}/update" \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"rpm_limit": 1000,
"tpm_limit": 200
}'
请求参数
|
参数 |
类型 |
传参方式 |
必选 |
说明 |
|
deployed_model |
String |
path |
是 |
新模型的唯一标识,可通过创建部署或列举部署接口获取。 |
|
rpm_limit |
Number |
body |
至少填写一个参数 |
Requests per minute,每分钟请求数。 |
|
tpm_limit |
Number |
body |
Token per minute,每分钟 Token 使用量。 |
响应示例
命令执行完成后,返回如下结果:
{
"request_id": "1d121fd9-876c-40ad-bc40-a9e68ef3b986",
"output":
{
"deployed_model": "qwen-plus-2025-12-01-b6d61c71",
"gmt_create": "2026-01-07T13:52:44",
"gmt_modified": "2026-01-07T14:01:41",
"status": "PENDING",
"model_name": "qwen-plus-2025-12-01",
"base_model": "qwen-plus-2025-12-01",
"base_capacity": 4,
"capacity": 4,
"ready_capacity": 0,
"workspace_id": "llm-8v53e*******",
"charge_type": "post_paid",
"creator": "16542902******",
"modifier": "16542902********",
"plan": "mu",
"model_unit_spec": "MU1",
"enable_thinking": true,
"max_context_length": 1,
"rpm_limit": 1000,
"tpm_limit": 200
}
}
响应参数
请参考创建模型部署任务的响应参数。
部署扩缩容
通过更新操作调整专属服务使用的资源单元数量。
地址
PUT https://dashscope.aliyuncs.com/api/v1/deployments/{deployed_model}/scale
请求示例
通过以下命令可以将指定的服务进行扩缩容:
curl --request PUT "https://dashscope.aliyuncs.com/api/v1/deployments/emo-35b3f106-sample01/scale" \
--header "Authorization: Bearer ${DASHSCOPE_API_KEY}" \
--header 'Content-Type: application/json' \
--data '{
"capacity":2
}'
请求参数
|
参数 |
类型 |
传参方式 |
必选 |
说明 |
|
|
deployed_model |
String |
path |
是 |
新模型的唯一标识,可通过创建部署或列举部署接口获取。 |
|
|
capacity |
Number |
body |
条件必选 |
仅 具体支持情况请参考:模型单元部署的功能支持情况。 |
更新之后,模型所使用的资源单元。必须是 |
|
ptu_capacity |
Object |
body |
条件必选 |
仅 具体支持情况请参考:PTU部署的功能支持情况。 |
当设置 样例: |
|
ptu_capacity.input_tpm |
Number |
body |
所有模型支持,input token pre-minute,部署的模型每分钟支持的最大输入 Token 量。 |
||
|
ptu_capacity.output_tpm |
Number |
body |
所有模型支持,output token pre-minute,部署的模型每分钟支持的最大输出 Token 量。 |
||
|
ptu_capacity.thinking_output_tpm |
Number |
body |
部分模型支持,thinking output token pre-minute,部署的模型每分钟支持的预置思考最大输出 Token 量。 |
||
响应示例
命令执行完成后,返回以下结果:
{
"request_id": "6c6b7676-3fea-423b-bc26-c9e2337e1142",
"output": {
"deployed_model": "emo-35b3f106-sample01",
"gmt_create": "2025-06-17T11:00:38",
"gmt_modified": "2025-06-17T11:42:02.311",
"status": "UPDATING",
"model_name": "emo",
"base_model": "emo",
"base_capacity": 1,
"capacity": 2,
"ready_capacity": 1,
"workspace_id": "llm-v71tlv3dezezp2en",
"charge_type": "post_paid",
"creator": "17580541***",
"modifier": "17580541***"
}
}
响应参数
请参考创建模型部署任务的响应参数。
删除部署
地址
DELETE https://dashscope.aliyuncs.com/api/v1/deployments/{deployed_model}
请求示例
通过以下命令可以删除指定的部署任务。
curl --request DELETE "https://dashscope.aliyuncs.com/api/v1/deployments/emo-35b3f106-sample01" \
--header "Authorization: Bearer ${DASHSCOPE_API_KEY}" \
--header 'Content-Type: application/json'
请求参数
|
参数 |
类型 |
传参方式 |
必选 |
说明 |
|
deployed_model |
String |
path |
是 |
新模型的唯一标识,可通过创建部署或列举部署接口获取。 |
响应示例
命令执行完成后,返回以下结果:
{
"request_id": "5378b78b-8564-481f-a3e0-580e551df22c",
"output": {
"deployed_model": "emo-35b3f106-sample01",
"gmt_create": "2025-06-17T11:00:38",
"gmt_modified": "2025-06-17T11:42:02",
"status": "DELETING",
"model_name": "emo",
"base_model": "emo",
"base_capacity": 1,
"capacity": 2,
"ready_capacity": 1,
"workspace_id": "llm-v71tlv3***",
"charge_type": "post_paid",
"creator": "175805416***",
"modifier": "175805416***"
}
}
响应参数
请参考创建模型部署任务的响应参数。
异常响应
响应示例
{
"request_id": "ca218d57-b91b-46b2-bd35-c41c6287bcf4",
"message": "Model: qwen-plus-20230703-cx7f not found!",
"code": "NotFound"
}
响应参数
|
字段 |
类型 |
描述 |
|
request_id |
String |
本次请求的系统唯一码。 |
|
code |
String |
错误码。 |
|
message |
String |
错误信息。 |
当请求出错时,可能返回以下错误:
|
错误码 |
错误信息 |
错误原因 |
|
NotFound |
Model: xxx not found! |
|
|
Conflict |
Deployed model xxx already exists, please specify a suffix. |
创建部署任务时使用了已使用过的suffix。 |
|
InvalidParameter |
Invalid capacity (xx), capacity must be larger than or equal to 0 and multiples of 1 and less than 1000! |
创建/更新部署任务时指定了无效的算力单元数量。 |