吞吐预留(原 TPM 预留)为指定模型锁定专属推理容量,确保业务高峰期不受公共限流影响。本文介绍如何创建、接入和管理吞吐预留。
功能概述
通过 TPM(Tokens Per Minute)预留,您可以为指定模型锁定专属的推理吞吐量,预留容量内的调用不受公共资源限流影响。
- 容量保障:预留的 TPM 容量为您的业务专属,不与其他用户共享。
- 专属模型 code:创建 吞吐预留后,系统自动生成专属模型 code,您需要将 API 请求中的
model参数替换为该 code。 - 溢出策略:创建时可选超额处理方式——自动溢出至按量计费(默认,业务不中断)或仅使用预留容量(超出返回 429,不产生额外费用)。
- 叠加容量包:在已有预留基础上追加购买容量实例,新实例沿用同一专属模型 code,叠加后预留总容量相应增加。详见管理操作。
方案对比与选型
百炼为推理调用提供多种容量与计费方案,常见包括按量付费、资源包与节省计划、吞吐预留、PTU 专属部署。不同方案在计费单位、容量保障强度、超额处理方式与接入改动上各有侧重,本节帮助您根据业务诉求选择合适的方案。
方案 | 计费单位 | 容量保障 | 适用场景 | 超额处理 | 代码改动 |
|---|---|---|---|---|---|
按量付费 | 按 token | 无(共享公共池) | 流量波动大/短期 | 自动服务,受公共限流 | 无需改动 |
资源包/节省计划 | 预付费额度 | 承诺用量折扣(非专属容量) | 费用优化 | 超出转按量 | 无需改动 |
吞吐预留 | 按 kTPM 预付费 | 专属容量刚性兑付 | 流量可预估、不能接受限流 | 可选:自动溢出按量(默认)/仅预留容量返回429 | 替换 model 参数即可 |
PTU(模型部署) | 按 kTPM 预付费 | 专属部署实例 | 高吞吐高性能 | 可选:自动溢出按量(默认)/仅PTU容量返回429 | 替换 model 参数即可 |
支持的模型
价格以控制台为准,表格仅供参考。
华北2(北京)
模型名称 | 预付费-按天 | |
|---|---|---|
输入(万TPM·天) | 输出(千TPM·天) | |
Qwen3.8-Max | ¥121.00 | ¥36.29 |
Qwen3.7-Flash-2026-07-15 联系商务经理开通 | ¥2.00 | ¥0.81 |
Qwen3.7-Max-2026-05-20 | ¥121.00 | ¥36.29 |
Qwen3.7-Plus-2026-05-26 | ¥20.20 | ¥8.06 |
Qwen3.6-Flash-2026-04-16 | ¥12.10 | ¥7.26 |
GLM-5.3 | ¥80.60 | ¥28.22 |
GLM-5.2 | ¥80.60 | ¥28.22 |
GLM-5.1 | ¥60.50 | ¥24.19 |
DeepSeek-v4-Flash | ¥10.10 | ¥2.02 |
DeepSeek-v4-Flash-0731 | ¥30.20 | ¥9.07 |
DeepSeek-v4-Pro | ¥121.00 | ¥24.19 |
DeepSeek-v4-Pro-0813 | ¥90.70 | ¥27.22 |
Kimi-K2.6 | ¥65.50 | ¥27.22 |
新加坡
模型名称 | 预付费-按天 | |
|---|---|---|
输入(万TPM·天) | 输出(千TPM·天) | |
Qwen3.8-Max | ¥151.10 | ¥45.32 |
Qwen3.7-Flash-2026-07-15 联系商务经理开通 | ¥2.30 | ¥0.98 |
Qwen3.7-Max-2026-05-20 | ¥188.90 | ¥56.66 |
Qwen3.7-Plus-2026-05-26 | ¥30.20 | ¥12.09 |
Qwen3.6-Flash-2026-04-16 | ¥18.90 | ¥11.33 |
GLM-5.3 | ¥102.90 | ¥32.34 |
GLM-5.2 | ¥105.80 | ¥33.24 |
GLM-5.1 | ¥105.80 | ¥33.24 |
DeepSeek-v4-Flash | ¥15.10 | ¥3.02 |
DeepSeek-v4-Flash-0731 | ¥31.40 | ¥9.43 |
DeepSeek-v4-Pro | ¥181.30 | ¥36.26 |
DeepSeek-v4-Pro-0813 | ¥94.30 | ¥28.29 |
计费与使用说明
-
部署成功即开始计费,预留容量内的调用不额外收费。
-
预付费一次性支付,从购买成功起连续生效。详细费用以百炼控制台为准。
-
付费周期「按天」按自然日计算,即从实例生效时刻起至次日 00:00:00 止,而非从购买时刻起连续 24 小时。例如,16:00 购买的 1 天预留,当天 00:00 到期(有效时长约 8 小时)。建议在一天开始时购买,或开启到期自动续费以避免服务中断。
-
缩容与退订退费:已使用部分按 1.2 倍系数结算,本规则即 PTU 预付费订单的提前终止退费规则。直接引用公式:
退款 = max(0, 降量部分预付费 - (降量部分预付费 × 已用时长/购买时长 × 1.2))退款金额小于 0 时按 0 计算,不退还额外费用。
-
溢出策略为「自动溢出」时:超出保障额度自动降级为标准按量计费,服务不中断,可在详情页超额降级统计查看降级次数;为「仅使用预留容量」时:超出返回 429,不产生额外费用。
-
服务到期后 2 小时内:实例仍为运行中,可继续调用,可续费;到期后 2~14 小时:实例已停止,不可调用,仍可续费;到期 14 小时后:实例已删除,不可恢复。
点击此处查看 各模型容量换算参数
部分模型支持长输入阶梯系数和缓存折扣,容量计算器会自动应用这些参数。具体如下:
模型 | 输入长度上限 | 缓存折扣 | 长输入阶梯系数 |
|---|---|---|---|
Qwen3.8-max | 1 Million | 0.125 | 无阶梯(1.0) |
Qwen3.6-flash-2026-04-16 | 256K | 不支持缓存 | 无阶梯(1.0) |
其他 Qwen 系列 | 256K | 0.2(缓存命中部分按 20% 折算容量) | 无阶梯(1.0) |
glm-5.2 | 1 Million | 0.25(缓存命中部分按 25% 折算容量) | 无阶梯(1.0) |
GLM-5.3 | 1 Million | 0.25(缓存命中部分按 25% 折算容量) | 无阶梯(1.0) |
glm-5.1 | 200K | 0.2(缓存命中部分按 20% 折算容量) | [0, 32K):输入 1.0 / 输出 1.0 |
DeepSeek-v4-Pro-0813 | 1 Million | 0.1(缓存命中部分按 10% 折算容量) | 无阶梯(1.0) |
DeepSeek-v4-Pro | 256K | 0.08(缓存命中部分按 8% 折算容量) | 无阶梯(1.0) |
DeepSeek-v4-Flash-0731 | 1 Million | 0.1(缓存命中部分按 10% 折算容量) | 无阶梯(1.0) |
DeepSeek-v4-Flash | 256K | 0.2(缓存命中部分按 20% 折算容量) | 无阶梯(1.0) |
Kimi-K2.6 | 256K | 0.2(缓存命中部分按 20% 折算容量) | 无阶梯(1.0) |
创建 吞吐预留
前提条件:已开通百炼模型服务,已创建业务空间。登录百炼控制台,单击创建 吞吐预留。
在创建吞吐预留页面,依次填写预留名称、选择模型、付费周期、输入 TPM、输出 TPM、购买时长、到期自动续费及溢出策略等参数,页面右侧提供 TPM 容量计算器辅助估算。
重要创建 吞吐预留需一次性支付预付费用。建议先使用 TPM 容量计算器估算所需 TPM,确认费用后再提交。
-
填写以下参数:
参数
说明
必填
取值说明
预留名称
自定义名称,便于识别。
是
≤ 50 个字符
选择模型
选择需要预留容量的模型。提交后自动生成专属模型 code。
是
仅支持已开放 吞吐预留的模型,以控制台展示为准。
性能模式
推理性能档位,决定容量的输出速率。
是
标准模式(与标准 API 相同 TPS)/ 高速模式(即 PTU 模型部署,相比标准 API 有 1.5~2 倍 TPS 提升)
付费周期
计费周期。
是
按天
输入TPM
预留的输入吞吐量,单位 kTPM(1 kTPM = 1,000 Tokens/分钟)。
是
起步和步长因模型而异,以控制台展示为准。
输出TPM
预留的输出吞吐量,单位 kTPM。
是
起步和步长因模型而异,以控制台展示为准。
购买时长
预留的有效时长。
是
在输入框中输入天数,支持 1~30、60、90、120、365 天。
到期自动续费
到期前一天 08:00 自动扣款续费。默认开启。
否
开启 / 关闭
单次续费时长
每次自动续费的时长。
否
在输入框中输入天数,取值范围与购买时长一致。
溢出策略
预留容量耗尽时,超出部分请求的处理方式。
是
自动溢出至按 token 付费(默认,超出转按量、业务不中断)/ 仅使用预留容量(超出返回 429、不产生额外费用)
-
确认参数后单击立即购买,在费用确认弹窗中核对费用,单击确认支付。
-
在 吞吐预留详情页的概览页签,找到专属模型 code,单击复制。
-
将 API 请求中的
model参数替换为复制的专属模型 code:前提条件:已创建 吞吐预留实例且状态为运行中。
说明GLM-5.2 的
thinking_budget参数(限制思考长度)在调用时不生效。
# 短时间内请求量快速拉升时,系统需要短暂预热以匹配所需算力
# 预热期间部分请求可能出现延迟波动,预热完成后恢复稳定。
# 请做好请求排队或重试机制。
import dashscope
response = dashscope.Generation.call(
api_key="your-api-key",
model="your-dedicated-model-code", # 替换为专属模型 code
messages=[{"role": "user", "content": "你好"}],
)
print(response.output.text)
# 短时间内请求量快速拉升时,系统需要短暂预热以匹配所需算力
# 预热期间部分请求可能出现延迟波动,预热完成后恢复稳定。
# 请做好请求排队或重试机制。
curl -X POST https://dashscope.aliyuncs.com/compatible-mode/v1/chat/completions \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"your-dedicated-model-code","messages":[{"role":"user","content":"你好"}]}'
TPM 容量计算器
创建页面右侧提供 TPM 容量计算器,帮助您根据业务负载估算需要购买的 TPM 额度。填写以下参数后,计算器自动输出推荐的输入 TPM 和输出 TPM。
参数 | 说明 | 对结果的影响 |
|---|---|---|
每分钟请求数(RPM) | 业务高峰期每分钟发送的请求数。 | RPM 越大,建议购买的输入和输出 TPM 同比增大。 |
平均输入长度(token) | 每条请求的平均输入 token 数。 | 输入越长,所处阶梯越高,系数越大,建议购买的输入 TPM 越高。不同模型的阶梯边界不同,以控制台实际展示为准。 |
平均输出长度(token) | 每条请求的平均输出 token 数。 | 输出越长,系数可能越大,建议购买的输出 TPM 越高。 |
缓存命中率 | 请求中重复前缀被缓存命中的比例。实际命中率取决于请求内容的重复程度,以运行结果为准。 | 命中率越高,输入容量消耗越慢,建议购买的输入 TPM 越低。仅影响输入 TPM,不影响输出 TPM。 |
查看与管理
前往百炼控制台,在预留列表页。列表以模型卡片形式展示所有预留实例,支持按模型、时间、状态筛选。
在吞吐预留页,每个模型卡片展示生效预留数、已预留输入/输出 TPM、峰值占比;预留列表表格含预留 ID、输入/输出 TPM、状态、付费方式·到期时间等列,支持按模型、时间、状态筛选。
预留详情
单击目标模型卡片进入详情页,包含以下 3 个页签:
概览
概览页签 展示以下内容:
- 基本信息:预留名称、专属模型 code(可复制)、基础模型、输入/输出容量。
- 统计卡片(近 7 天):生效预留数、TPM 总量与峰值用量、平均利用率。
- 使用率趋势:可切换输入/输出方向,展示预留容量线和实际用量。
- 超额降级统计:展示超出预留容量后被降级处理的次数(仅「自动溢出」策略下产生降级)。
监控
提供详细的运行监控数据:利用率、配额用量(输入/输出)、配额内/外调用次数、缓存命中量。更多详细信息请参考:模型监控。
API 接入
展示专属模型 code 和调用示例。
管理操作
在预留列表页的目标卡片或详情页中,可对预留实例执行以下管理操作:
叠加容量包
吞吐预留页统一管理 TPM 预留与 PTU(预置吞吐单元)两类容量实例,叠加容量包对两者均适用。在预留列表页目标卡片的「生效中的容量实例」区域,单击叠加容量包,可在现有预留基础上追加购买容量实例。叠加后,该预留的总容量为基础预留与所有叠加容量包容量之和,专属模型 code 保持不变,API 调用无需改动。
弹窗顶部展示基础预留的以下信息:
- 专属模型 code、基础模型、性能模式(标准模式/高速模式)、溢出策略:沿用基础预留,不可更改。
- 已有容量包:当前已叠加的容量包个数。
填写以下购买参数:
参数 | 说明 | 必填 | 取值说明 |
|---|---|---|---|
付费周期 | 叠加容量包的计费周期。高速模式可选后付费或预付费,标准模式仅预付费。 | 是 | 后付费/按小时 / 预付费/按天(标准模式仅 预付费/按天) |
输入容量 | 叠加的输入吞吐量,单位 kTPM。 | 是 | 起步 10 kTPM,步长 10 kTPM。 |
输出容量 | 叠加的输出吞吐量,单位 kTPM。 | 是 | 起步 1 kTPM,步长 1 kTPM。 |
购买时长 | 叠加容量包的有效时长。仅预付费/按天需填写,后付费/按小时按实际时长计费、无需填写。 | 是 | 1~30、60、90、120、365 天。 |
到期自动续费 | 仅预付费/按天适用。到期前一天 08:00 自动扣款续费。 | 否 | 开启 / 关闭 |
说明一个 Model Code 下最多存在一个未删除的后付费(按小时)容量实例:若已有后付费实例,则叠加容量包的付费周期只能选预付费/按天。
底部显示输入预留、输出预留费用与合计,确认后单击确认购买。购买成功后,新容量实例进入「生效中的容量实例」列表,预留总容量相应增加。
扩缩容

单击扩缩容,在弹窗中调整输入 TPM 和输出 TPM。
说明输入 TPM 和输出 TPM 支持调整为 0:归 0 后不再产生容量费用,且专属模型 code 继续保留,避免因到期或退订导致 code 失效。但归 0 属于减配,已使用部分按 1.2 倍系数结算退费(详见上方计费与使用说明)。
续费
单击续订,选择续费时长并完成支付。如已开启到期自动续费,系统在到期前一天 08:00 自动扣款续费。
退订
单击退订,系统跳转至费用中心完成退订流程。
重要退订不可恢复。退订后专属模型 code 失效,已有请求将回退至公共资源处理。退订时已使用部分按 1.2 倍系数结算退费,详见上方公式。
预留实例状态说明
服务到期后 2 小时内为运行中,2~14 小时转为已停止,14 小时后转为已释放并最终删除。
状态 | 说明 |
|---|---|
运行中 | 正常运行,可使用专属模型 code 调用。 |
待生效 | 已创建,等待生效。 |
变配中 | 正在执行扩缩容,期间服务不中断。 |
已停止 | 因欠费等原因停止,续费后可恢复。 |
已释放 | 到期未续费或退订完成,资源已释放,不可恢复。 |
常见问题
Q: 超出预留容量时会怎样?
取决于创建时选择的溢出策略:「自动溢出」策略下,超出预留容量的请求自动降级为按量计费,服务不中断,可在详情页概览页签 的超额降级统计查看降级次数和时间,频繁降级时建议扩容;「仅使用预留容量」策略下,超出请求返回 429 错误,不产生额外费用,频繁 429 时建议扩容。
Q: 专属模型 code 怎么获取?
创建 吞吐预留后,系统自动生成专属模型 code。在 吞吐预留详情页的概览页签 可复制该 code。必须将 API 请求中的 model 参数替换为此 code 才能使用预留容量。
Q: 预留到期后会怎样?
预留到期后,专属模型 code 失效,后续请求自动回退到公共资源处理(按量计费)。建议提前开启到期自动续费避免服务影响。
Q: 如何判断是否需要扩容?
在详情页概览页签 查看 TPM 用量趋势图和超额降级统计。如果利用率持续接近 100% 或频繁出现降级,建议扩容输入/输出 TPM。
Q: 购买「1 天」预留,实际有效时长是多少?
「按天」按自然日计算,有效期为实例生效时刻至次日 00:00:00,而非从购买时刻起连续 24 小时。例如,16:00 购买,当天 00:00 到期,有效时长约 8 小时。如需完整一天的容量,建议在一天开始时购买,或开启到期自动续费以连续保障服务。