吞吐预留(原 TPM 预留)为指定模型锁定专属推理容量,确保业务高峰期不受公共限流影响。本文介绍如何创建、接入和管理吞吐预留。
功能概述
通过 TPM(Tokens Per Minute)预留,您可以为指定模型锁定专属的推理吞吐量,预留容量内的调用不受公共资源限流影响。
- 容量保障:预留的 TPM 容量为您的业务专属,不与其他用户共享。
- 专属模型 code:创建 吞吐预留后,系统自动生成专属模型 code,您需要将 API 请求中的
model参数替换为该 code。 - 溢出策略:创建时可选超额处理方式——自动溢出至按量计费(默认,业务不中断)或仅使用预留容量(超出返回 429,不产生额外费用)。
- 叠加容量包:在已有预留基础上追加购买容量实例,新实例沿用同一专属模型 code,叠加后预留总容量相应增加。详见管理操作。
- 8 小时时段预留:标准模式下可选预付费(按 8 小时时段),固定 8 小时、立即生效,适用于负载集中于特定时段的场景。详见吞吐预留计费。
方案对比与选型
百炼为推理调用提供多种容量与计费方案,常见包括按量付费、资源包与节省计划、吞吐预留、PTU 专属部署。不同方案在计费单位、容量保障强度、超额处理方式与接入改动上各有侧重,本节帮助您根据业务诉求选择合适的方案。
方案 | 计费单位 | 容量保障 | 适用场景 | 超额处理 | 代码改动 |
|---|---|---|---|---|---|
按量付费 | 按 token | 无(共享公共池) | 流量波动大/短期 | 自动服务,受公共限流 | 无需改动 |
资源包/节省计划 | 预付费额度 | 承诺用量折扣(非专属容量) | 费用优化 | 超出转按量 | 无需改动 |
吞吐预留 | 按 kTPM 预付费 | 专属容量刚性兑付 | 流量可预估、不能接受限流 | 可选:自动溢出按量(默认)/仅预留容量返回429 | 替换 model 参数即可 |
PTU(模型部署) | 按 kTPM 预付费 | 专属部署实例 | 高吞吐高性能 | 可选:自动溢出按量(默认)/仅PTU容量返回429 | 替换 model 参数即可 |
支持的模型
价格详见吞吐预留计费。
华北2(北京)
- Qwen3.8-Max
- Qwen3.7-Flash-2026-07-15
- Qwen3.7-Max-2026-05-20
- Qwen3.7-Plus-2026-05-26
- Qwen3.6-Flash-2026-04-16
- GLM-5.3
- GLM-5.2
- GLM-5.1
- DeepSeek-v4-Flash
- DeepSeek-v4-Flash-0731
- DeepSeek-v4-Pro
- DeepSeek-v4-Pro-0813
- Kimi-K2.6
新加坡
- Qwen3.8-Max
- Qwen3.7-Flash-2026-07-15
- Qwen3.7-Max-2026-05-20
- Qwen3.7-Plus-2026-05-26
- Qwen3.6-Flash-2026-04-16
- GLM-5.3
- GLM-5.2
- GLM-5.1
- DeepSeek-v4-Flash
- DeepSeek-v4-Flash-0731
- DeepSeek-v4-Pro
- DeepSeek-v4-Pro-0813
计费与使用说明
重要完整的计费规则、价格、扩缩容与退订退费、自动续费、容量换算等,详见吞吐预留计费。
- 部署成功即开始计费,预留容量内的调用不额外收费;预付费一次性支付,从购买成功起连续生效,详细费用以百炼控制台为准。
- 8 小时时段预留(按 8 小时时段付费)的计费规则与售卖约束,详见吞吐预留计费。
- 溢出策略为「自动溢出」时:超出降级为标准按量计费,服务不中断,可在详情页超额降级统计查看降级次数;为「仅使用预留容量」时:超出返回 429,不产生额外费用。
- 服务到期后 2 小时内实例仍可调用、可续费;2~14 小时已停止、不可调用仍可续费;14 小时后已释放、不可恢复。(按天预留口径;8 小时时段预留不适用此宽限,详见8 小时时段预留计费)
创建 吞吐预留
前提条件:已开通百炼模型服务,已创建业务空间。登录百炼控制台,单击创建 吞吐预留。
在创建吞吐预留页面,依次填写预留名称、选择模型、付费周期、输入 TPM、输出 TPM、购买时长、到期自动续费及溢出策略等参数,页面右侧提供 TPM 容量计算器辅助估算。
重要创建 吞吐预留需一次性支付预付费用。建议先使用 TPM 容量计算器估算所需 TPM,确认费用后再提交。
-
填写以下参数:
参数
说明
必填
取值说明
预留名称
自定义名称,便于识别。
是
≤ 50 个字符
选择模型
选择需要预留容量的模型。提交后自动生成专属模型 code。
是
仅支持已开放 吞吐预留的模型,以控制台展示为准。
性能模式
推理性能档位,决定单实例吞吐能力。
是
标准模式(与标准 API 相同 TPS)/ 高速模式(即 PTU 模型部署,相比标准 API 有 1.5~2 倍 TPS 提升)
付费周期
计费周期。
是
按天;按 8 小时时段(仅标准模式,固定 8 小时、立即生效,详见吞吐预留计费)
输入TPM
预留的输入吞吐量,单位 kTPM(1 kTPM = 1,000 Tokens/分钟)。
是
起步和步长因模型而异,以控制台展示为准。
输出TPM
预留的输出吞吐量,单位 kTPM。
是
起步和步长因模型而异,以控制台展示为准。
购买时长
预留的有效时长。
是
在输入框中输入天数,支持 1~30、60、90、120、365 天。
到期自动续费
到期前 1 天自动扣款续费(执行规则详见吞吐预留计费)。默认开启。按 8 小时时段不支持续订,该参数不适用。
否
开启 / 关闭
单次续费时长
每次自动续费的时长。
否
在输入框中输入天数,取值范围与购买时长一致。
溢出策略
预留容量耗尽时,超出部分请求的处理方式。
是
自动溢出至按 token 付费(默认,超出转按量、业务不中断)/ 仅使用预留容量(超出返回 429、不产生额外费用)
-
确认参数后单击立即购买,在费用确认弹窗中核对费用,单击确认支付。
-
在 吞吐预留详情页的概览页签,找到专属模型 code,单击复制。
-
将 API 请求中的
model参数替换为复制的专属模型 code:前提条件:已创建 吞吐预留实例且状态为运行中。
说明GLM-5.2 的
thinking_budget参数(限制思考长度)在调用时不生效。
# 短时间内请求量快速拉升时,系统需要短暂预热以匹配所需算力
# 预热期间部分请求可能出现延迟波动,预热完成后恢复稳定。
# 请做好请求排队或重试机制。
import dashscope
response = dashscope.Generation.call(
api_key="your-api-key",
model="your-dedicated-model-code", # 替换为专属模型 code
messages=[{"role": "user", "content": "你好"}],
)
print(response.output.text)
# 短时间内请求量快速拉升时,系统需要短暂预热以匹配所需算力
# 预热期间部分请求可能出现延迟波动,预热完成后恢复稳定。
# 请做好请求排队或重试机制。
curl -X POST https://dashscope.aliyuncs.com/compatible-mode/v1/chat/completions \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"your-dedicated-model-code","messages":[{"role":"user","content":"你好"}]}'
选择按 8 小时时段付费周期后,创建页面展开 8 小时时段容量配置区:生效窗口只读展示(起点按购买时刻向下取整至当前整点、不可自定义,固定 8 小时,可跨自然日;不足 1 小时按 1 小时计算),并实时展示供给状态;下单时刻须在每日 22:00–次日 00:00 内方可购买(00:00–22:00 间不可下单),时段到期后容量自动失效、不适用 2h/14h 宽限,详见8 小时时段预留计费。
TPM 容量计算器
创建页面右侧提供 TPM 容量计算器,帮助您根据业务负载估算需要购买的 TPM 额度。填写以下参数后,计算器自动输出推荐的输入 TPM 和输出 TPM。
参数 | 说明 | 对结果的影响 |
|---|---|---|
每分钟请求数(RPM) | 业务高峰期每分钟发送的请求数。 | RPM 越大,建议购买的输入和输出 TPM 同比增大。 |
平均输入长度(token) | 每条请求的平均输入 token 数。 | 输入越长,所处阶梯越高,系数越大,建议购买的输入 TPM 越高。不同模型的阶梯边界不同,以控制台实际展示为准。 |
平均输出长度(token) | 每条请求的平均输出 token 数。 | 输出越长,系数可能越大,建议购买的输出 TPM 越高。 |
缓存命中率 | 请求中重复前缀被缓存命中的比例。实际命中率取决于请求内容的重复程度,以运行结果为准。 | 命中率越高,输入容量消耗越慢,建议购买的输入 TPM 越低。仅影响输入 TPM,不影响输出 TPM。 |
查看与管理
前往百炼控制台,在预留列表页。列表以模型卡片形式展示所有预留实例,支持按模型、时间、状态筛选。
在吞吐预留页,每个模型卡片展示生效预留数、已预留输入/输出 TPM、峰值占比;预留列表表格含预留 ID、输入/输出 TPM、状态、付费方式(按天、按 8 小时时段、按小时等)·到期时间等列,支持按模型、时间、状态筛选。
预留详情
单击目标模型卡片进入详情页,包含以下 3 个页签:
概览

- 基本信息:预留名称、专属模型 code(可复制)、基础模型、输入/输出容量。
- 统计卡片(近 7 天):生效预留数、TPM 总量与峰值用量、平均利用率。
- 使用率趋势:可切换输入/输出方向,展示预留容量线和实际用量。
- 超额降级统计:展示超出预留容量后被降级处理的次数(仅「自动溢出」策略下产生降级)。
监控
提供详细的运行监控数据:利用率、配额用量(输入/输出)、配额内/外调用次数、缓存命中量;按 8 小时时段预留另展示该 8 小时窗口内的包利用率。更多详细信息请参考:模型监控。

API 接入
展示专属模型 code 和调用示例。

管理操作
在预留列表页的目标卡片或详情页中,可对预留实例执行以下管理操作。8 小时时段预留实例不支持扩缩容与续退订(时段到期后容量自动失效)。
叠加容量包
吞吐预留页统一管理 TPM 预留与 PTU(预置吞吐单元)两类容量实例,叠加容量包对两者均适用。在预留列表页目标卡片的「生效中的容量实例」区域,单击叠加容量包,可在现有预留基础上追加购买容量实例。叠加后,该预留的总容量为基础预留与所有叠加容量包容量之和,专属模型 code 保持不变,API 调用无需改动。
弹窗顶部展示基础预留的以下信息:
- 专属模型 code、基础模型、性能模式(标准模式/高速模式)、溢出策略:沿用基础预留,不可更改。
- 已有容量包:当前已叠加的容量包个数。
填写以下购买参数:
参数 | 说明 | 必填 | 取值说明 |
|---|---|---|---|
付费周期 | 叠加容量包的计费周期受基础预留付费方式约束:基础预付费则仅可选预付费叠加包,基础后付费则可选预付费或后付费叠加包。高速模式可选后付费或预付费,标准模式仅预付费(按天或按 8 小时时段)。 | 是 | 后付费/按小时 / 预付费/按天 / 预付费/按 8 小时时段(仅标准模式,窗口内增容、窗口外失效,规则详见吞吐预留计费) |
输入容量 | 叠加的输入吞吐量,单位 kTPM。 | 是 | 起步 10 kTPM,步长 10 kTPM。 |
输出容量 | 叠加的输出吞吐量,单位 kTPM。 | 是 | 起步 1 kTPM,步长 1 kTPM。 |
购买时长 | 叠加容量包的有效时长。仅预付费/按天需填写,后付费/按小时按实际时长计费、无需填写。 | 是 | 1~30、60、90、120、365 天。 |
到期自动续费 | 仅预付费/按天适用。到期前 1 天自动扣款续费(执行规则详见吞吐预留计费)。 | 否 | 开启 / 关闭 |
说明一个 Model Code 下最多存在一个未删除的后付费(按小时)容量实例:若已有后付费实例,则叠加容量包的付费周期只能选预付费/按天。
底部显示输入预留、输出预留费用与合计,确认后单击确认购买。购买成功后,新容量实例进入「生效中的容量实例」列表,预留总容量相应增加。
扩缩容

单击扩缩容,在弹窗中调整输入 TPM 和输出 TPM。
说明输入 TPM 和输出 TPM 支持调整为 0:归 0 后不再产生容量费用,且专属模型 code 继续保留,避免因到期或退订导致 code 失效。但归 0 属于减配,已使用部分按 1.2 倍系数结算退费(详见吞吐预留计费)。
续费
单击续订,选择续费时长并完成支付。如已开启到期自动续费,系统在到期前 1 天自动扣款续费(执行规则详见吞吐预留计费)。
退订
单击退订,系统跳转至费用中心完成退订流程。
重要退订不可恢复。退订后专属模型 code 失效,已有请求将回退至公共资源处理。退订时已使用部分按 1.2 倍系数结算退费,详见吞吐预留计费。
预留实例状态说明
服务到期后 2 小时内为运行中,2~14 小时转为已停止,14 小时后转为已过期并最终删除。
状态 | 说明 |
|---|---|
运行中 | 正常运行,可使用专属模型 code 调用。 |
待生效 | 已创建,等待生效。 |
变配中 | 正在执行扩缩容,期间服务不中断。 |
已停止 | 因欠费等原因停止,续费后可恢复。 |
已过期 | 到期且未续费,资源已释放。 |
已取消 | 退订完成,不可恢复。 |
常见问题
Q: 超出预留容量时会怎样?
取决于创建时选择的溢出策略:「自动溢出」策略下,超出预留容量的请求自动降级为按量计费,服务不中断,可在详情页概览页签 的超额降级统计查看降级次数和时间,频繁降级时建议扩容;「仅使用预留容量」策略下,超出请求返回 429 错误,不产生额外费用,频繁 429 时建议扩容。
Q: 专属模型 code 怎么获取?
创建 吞吐预留后,系统自动生成专属模型 code。在 吞吐预留详情页的概览页签 可复制该 code。必须将 API 请求中的 model 参数替换为此 code 才能使用预留容量。
Q: 预留到期后会怎样?
预留到期后,专属模型 code 失效,后续请求自动回退到公共资源处理(按量计费)。建议提前开启到期自动续费避免服务影响。
Q: 如何判断是否需要扩容?
在详情页概览页签 查看 TPM 用量趋势图和超额降级统计。如果利用率持续接近 100% 或频繁出现降级,建议扩容输入/输出 TPM。