独占算力部署提供独占吞吐(DTU)与模型单元(MU)两种方案,以独占 GPU 资源为指定模型提供性能和吞吐保障。DTU 面向新发布模型(按输入/输出 TPM×时长计费),MU 用于已有模型(按模型单元数量×时长计费)。本文介绍两种方案的功能、计费方式、使用流程与支持模型。
概述
独占算力部署为指定模型提供独占 GPU 资源与性能保障,支持基础模型与自定义模型部署。百炼提供两种独占算力方案:
- DTU(Dedicated Throughput Unit,独占吞吐):按 Input/Output TPM 售卖,提供更直接的吞吐保障。全托管推理服务,底层独占 GPU 资源由平台运维。
- 模型单元(MU,Model Unit):按使用时长与模型单元数量配置算力,资源独占。支持自定义性能指标、PD 分离计算模式。计费粒度为模型单元数量×时长。
DTU 与 MU 按模型适用区分:新发布模型采用 DTU(按输入/输出 TPM 计量),已有模型沿用 MU(按模型单元数量计量)。两者均提供独占算力、资源隔离与微调模型部署能力。新购部署时若模型支持 DTU 则优先选择 DTU。
两种方案共有的能力:
- 独占 GPU 资源,推理环境与其他用户物理隔离。
- 支持基础模型和自定义模型(百炼微调模型或用户上传模型)部署。
- 平台负责底层运维,无需管理 GPU。
- 不主动设 RPM/TPM 上限,流量受实际承载力限制。
方案选型
百炼为推理调用提供多种容量与计费方案。DTU 适用于需要独占部署、微调模型部署、低延迟高并发或数据隔离的场景。各方案的对比如下表所示。
Token 按量、PTU 等全部计费方式的完整对比详见模型部署主表。
对比维度 | DTU | PTU | Token 按量 | PAI/灵骏 |
|---|---|---|---|---|
特点 | 独占算力 + 微调模型 | 吞吐保障 + 低延迟 | 弹性灵活、零门槛 | 自定义运行时 |
资源隔离 | 物理隔离 | 逻辑隔离 | 共享公池 | 物理隔离 |
微调模型 | 全参 + LoRA | 不支持 | LoRA | 支持 |
自定义框架 | 不支持 | 不支持 | 不支持 | 支持 |
计费模式 | TPM 额度 × 时长 | TPM 额度 × 时长 | Token 用量 | GPU × 时长 |
计费规则
DTU 计费
DTU 按输入 TPM 和输出 TPM 分别计费,采用预付费(按月)模式。各模型有固定的输入/输出基准 TPM(见下表),购买时需为基准 TPM 的整数倍。输入和输出各至少购买基准 TPM(1 倍),生产环境建议各购买 2 倍以上。
费用由后端根据模型、输入/输出 TPM、服务区域和购买时长计算。各模型的输入/输出单价与月总价如下表所示,输入/输出单价按 kTPM·月计价,月总价为输入输出各 1 倍基准 TPM 的合计,微调模型的价格与对应基础模型相同,具体以控制台实际展示为准。
MU 计费
费用 = 使用时长(小时)× 模型单元数量 × 模型单元单价
"模型单元单价"在后付费场景下取下表"小时单价"列;预付费按月计费时,公式改为 包月数 × 模型单元数量 × 月单价。
- 预付费购买的首月,如在首月内提前退订,日单价(≈ 月单价 / 30)将按 1.2 倍计费(不满一天按一天计费)
说明模型单元-后付费方式的算力资源先买到先得。如购买不成功会全额退款。
支持模型与价格
DTU 价格表与性能基准
新加坡
模型 | 基准输入(TPM) | 基准输出(TPM) | 输入单价(USD/kTPM·月) | 输出单价(USD/kTPM·月) | 月总价(USD) |
|---|---|---|---|---|---|
qwen3.7-plus-2026-05-26 | 1,192,000 | 148,000 | 37 | 295 | 87,764 |
1,372,000 | 170,000 | 32 | 257 | 87,594 | |
660,000 | 124,000 | 66 | 352 | 87,208 | |
704,000 | 132,000 | 62 | 331 | 87,340 |
各模型在标准工况下的性能参考数据如下表所示,以控制台实际展示为准。
以下性能参考数据均在缓存命中率为 0% 的条件下测得。实际使用中,随着缓存命中率提升,模型性能也会相应提高。
模型 | 输入长度 | 输出长度 | 缓存命中率 | 首字延迟(ms) | 每token延迟(ms) |
|---|---|---|---|---|---|
qwen3.7-plus-2026-05-26 | 16,000 | 2,000 | 0 | 888 | 10 |
16,000 | 2,000 | 0 | 2,418 | 15 | |
2,600 | 500 | 0 | 819 | 14 | |
2,600 | 500 | 0 | 970 | 13 |
其中 qwen3.8-27b 当前需白名单开通,其余模型为新加坡正式站点。
MU 价格表
新加坡
文本生成
模型 | 基准输入(TPM) | 基准输出(TPM) | 输入单价(USD/kTPM·月) | 输出单价(USD/kTPM·月) | 月总价(USD) |
|---|---|---|---|---|---|
qwen3.7-plus-2026-05-26 | 1,192,000 | 148,000 | 37 | 295 | 87,764 |
1,372,000 | 170,000 | 32 | 257 | 87,594 | |
660,000 | 124,000 | 66 | 352 | 87,208 | |
704,000 | 132,000 | 62 | 331 | 87,340 |
多模态
模型 | 输入长度 | 输出长度 | 缓存命中率 | 首字延迟(ms) | 每token延迟(ms) |
|---|---|---|---|---|---|
qwen3.7-plus-2026-05-26 | 16,000 | 2,000 | 0 | 888 | 10 |
16,000 | 2,000 | 0 | 2,418 | 15 | |
2,600 | 500 | 0 | 819 | 14 | |
2,600 | 500 | 0 | 970 | 13 |
模型类型:
- Instruct - 模型部署后以非思考模式进行推理。
华北2(北京)
文本生成
千问
模型名称 | 模型代码 | 模型单元规格 | 小时单价(美元) 最小计费:分钟 | 包月单价(美元) 最小计费:天 |
|---|---|---|---|---|
千问3.8-27B | qwen3.8-27b | MU9 x 4 | 美元28.056 | 美元13,532.096 |
千问3.7-Plus-2026-05-26 | qwen3.7-plus-2026-05-26 | MU2 x 8 | 美元69.312 | 美元33,044.72 |
MU3 x 8 | 美元150.72 | 美元72,577.152 | ||
千问3.6-35B-A3B | qwen3.6-35b-a3b | MU1 x 8 | 美元59.408 | 美元28,734.256 |
MU2 x 8 | 美元69.312 | 美元33,044.72 | ||
MU3 x 8 | 美元150.72 | 美元72,577.152 | ||
MU8 x 1 | 美元6.464 | 美元3,080.477 | ||
MU9 x 1 | 美元7.014 | 美元3,383.024 | ||
千问3.6-27B | qwen3.6-27b | MU9 x 1 | 美元7.014 | 美元3,383.024 |
千问3.6-Flash-2026-04-16 | qwen3.6-flash-2026-04-16 | MU1 x 2 | 美元14.852 | 美元7,183.564 |
MU3 x 8 | 美元150.72 | 美元72,577.152 | ||
千问3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | MU1 x 8 MU1 x 16(PD分离模式) | 美元59.408 PD分离模式:美元118.816 | 美元28,734.256 PD分离模式:美元57,468.512 |
MU2 x 8 | 美元69.312 | 美元33,044.72 | ||
千问3.5-397B-A17B | qwen3.5-397b-a17b | MU3 x 8 MU3 x 16(PD分离模式) | 美元150.72 PD分离模式:美元301.44 | 美元72,577.152 PD分离模式:美元145,154.304 |
MU6 x 16 | 美元55.008 | 美元26,599.92 | ||
千问3.5-122B-A10B | qwen3.5-122b-a10b | MU1 x 4 | 美元29.704 | 美元14,367.128 |
MU6 x 16 | 美元55.008 | 美元26,599.92 | ||
千问3.5-35B-A3B | qwen3.5-35b-a3b | MU1 x 2 | 美元14.852 | 美元7,183.564 |
MU2 x 8 | 美元69.312 | 美元33,044.72 | ||
MU3 x 8 | 美元150.72 | 美元72,577.152 | ||
MU9 x 1 | 美元7.014 | 美元3,383.024 | ||
千问3.5-27B | qwen3.5-27b | MU2 x 8 | 美元69.312 | 美元33,044.72 |
MU3 x 8 | 美元150.72 | 美元72,577.152 | ||
MU8 x 1 | 美元6.464 | 美元3,080.477 | ||
MU9 x 1 | 美元7.014 | 美元3,383.024 | ||
千问3.5-9B | qwen3.5-9b | MU1 x 2 | 美元14.852 | 美元7,183.564 |
MU2 x 8 | 美元69.312 | 美元33,044.72 | ||
千问3.5-Flash-2026-02-23 | qwen3.5-flash-2026-02-23 | MU1 x 2 | 美元14.852 | 美元7,183.564 |
千问3.5-Plus-2026-02-15 | qwen3.5-plus-2026-02-15 | MU1 x 8 MU1 x 16(PD分离模式) | 美元59.408 PD分离模式:美元118.816 | 美元28,734.256 PD分离模式:美元57,468.512 |
MU2 x 8 | 美元69.312 | 美元33,044.72 | ||
MU3 x 8 MU3 x 16(PD分离模式) | 美元150.72 PD分离模式:美元301.44 | 美元72,577.152 PD分离模式:美元145,154.304 | ||
千问3-235B-A22B-Instruct-2507 | qwen3-235b-a22b-instruct-2507 | MU1 x 4 | 美元29.704 | 美元14,367.128 |
MU2 x 8 | 美元69.312 | 美元33,044.72 | ||
MU3 x 8 | 美元150.72 | 美元72,577.152 | ||
千问3-32B | qwen3-32b | MU6 x 16 | 美元55.008 | 美元26,599.92 |
千问3-30B-A3B-Thinking-2507 | qwen3-30b-a3b-thinking-2507 | MU1 x 2 | 美元14.852 | 美元7,183.564 |
千问3-4B | qwen3-4b | MU1 x 2 | 美元14.852 | 美元7,183.564 |
MU5 x 1 | 美元2.888 | 美元1,394.329 | ||
千问3-Embedding-0.6B | qwen3-embedding-0.6b | MU5 x 1 | 美元2.888 | 美元1,394.329 |
MU6 x 1 | 美元3.438 | 美元1,662.495 | ||
千问3-MoE-Rerank-0.6B | qwen3-moe-rerank-0.6b | MU5 x 1 | 美元2.888 | 美元1,394.329 |
千问3-Rerank-0.6B | qwen3-rerank-0.6b | MU5 x 1 | 美元2.888 | 美元1,394.329 |
MU6 x 1 | 美元3.438 | 美元1,662.495 | ||
千问3-Max-2025-09-23 | qwen3-max-2025-09-23 | MU2 x 8 | 美元69.312 | 美元33,044.72 |
MU3 x 8 | 美元150.72 | 美元72,577.152 | ||
千问3-Rerank | qwen3-rerank | MU5 x 1 | 美元2.888 | 美元1,394.329 |
千问2.5-开源版-72B | qwen2.5-72b-instruct | MU1 x 8 | 美元59.408 | 美元28,734.256 |
千问2.5-开源版-14B | qwen2.5-14b-instruct | MU1 x 2 | 美元14.852 | 美元7,183.564 |
千问2.5-开源版-7B | qwen2.5-7b-instruct | MU1 x 2 | 美元14.852 | 美元7,183.564 |
MU5 x 1 | 美元2.888 | 美元1,394.329 | ||
千问-Plus-2025-07-28 | qwen-plus-2025-07-28 | MU1 x 4 MU1 x 16(PD分离模式) | 美元29.704 PD分离模式:美元118.816 | 美元14,367.128 PD分离模式:美元57,468.512 |
千问-Plus-2025-12-01 | qwen-plus-2025-12-01 | MU1 x 4 | 美元29.704 | 美元14,367.128 |
Qwen-Plus-Character-2025-11-06 | qwen-plus-character-2025-11-06 | MU1 x 4 | 美元29.704 | 美元14,367.128 |
GLM
模型名称 | 模型代码 | 模型单元规格 | 小时单价(美元) 最小计费:分钟 | 包月单价(美元) 最小计费:天 |
|---|---|---|---|---|
GLM-5.1 | glm-5.1 | MU2 x 8 | 美元69.312 | 美元33,044.72 |
MU3 x 16(PD分离模式) | PD分离模式:美元301.44 | PD分离模式:美元145,154.304 | ||
MU6 x 16 | 美元55.008 | 美元26,599.92 | ||
GLM-5 | glm-5 | MU3 x 16(PD分离模式) | PD分离模式:美元301.44 | PD分离模式:美元145,154.304 |
GLM-4.7 | glm-4.7 | MU6 x 32(PD分离模式) | PD分离模式:美元110.016 | PD分离模式:美元53,199.84 |
DeepSeek
模型名称 | 模型代码 | 模型单元规格 | 小时单价(美元) 最小计费:分钟 | 包月单价(美元) 最小计费:天 |
|---|---|---|---|---|
DeepSeek-v4-Flash | deepseek-v4-flash | MU1 x 8 | 美元59.408 | 美元28,734.256 |
MU3 x 8 | 美元150.72 | 美元72,577.152 | ||
DeepSeek-v3.2 | deepseek-v3.2 | MU2 x 16(PD分离模式) | PD分离模式:美元138.624 | PD分离模式:美元66,089.44 |
其他模型
模型名称 | 模型代码 | 模型单元规格 | 小时单价(美元) 最小计费:分钟 | 包月单价(美元) 最小计费:天 |
|---|---|---|---|---|
Kimi-K2.5 | kimi-k2.5 | MU2 x 8 | 美元69.312 | 美元33,044.72 |
多模态
千问VL
模型名称 | 模型代码 | 模型单元规格 | 小时单价(美元) 最小计费:分钟 | 包月单价(美元) 最小计费:天 |
|---|---|---|---|---|
千问3-VL-235B-A22B-Thinking | qwen3-vl-235b-a22b-thinking | MU1 x 8 | 美元59.408 | 美元28,734.256 |
MU2 x 8 | 美元69.312 | 美元33,044.72 | ||
MU3 x 8 | 美元150.72 | 美元72,577.152 | ||
千问3-VL-32B-Instruct | qwen3-vl-32b-instruct | MU2 x 8 | 美元69.312 | 美元33,044.72 |
MU3 x 8 | 美元150.72 | 美元72,577.152 | ||
千问3-VL-8B-Instruct | qwen3-vl-8b-instruct | MU1 x 2 | 美元14.852 | 美元7,183.564 |
MU5 x 1 | 美元2.888 | 美元1,394.329 | ||
千问3-VL-4B-Instruct | qwen3-vl-4b-instruct | MU1 x 2 | 美元14.852 | 美元7,183.564 |
千问3-VL-2B-Instruct | qwen3-vl-2b-instruct | MU5 x 1 | 美元2.888 | 美元1,394.329 |
千问3-VL-Embedding-2B | qwen3-vl-embedding-2b | MU5 x 1 | 美元2.888 | 美元1,394.329 |
千问3-VL-Flash-2025-10-15 | qwen3-vl-flash-2025-10-15 | MU1 x 4 | 美元29.704 | 美元14,367.128 |
千问3-VL-Plus-2025-09-23 | qwen3-vl-plus-2025-09-23 | MU1 x 4 | 美元29.704 | 美元14,367.128 |
千问VL-Max-2025-08-13 | qwen-vl-max-2025-08-13 | MU6 x 4 | 美元13.752 | 美元6,649.98 |
千问Omni
模型名称 | 模型代码 | 模型单元规格 | 小时单价(美元) 最小计费:分钟 | 包月单价(美元) 最小计费:天 |
|---|---|---|---|---|
千问3.5-Omni-Flash | qwen3.5-omni-flash | MU8 x 1 | 美元6.464 | 美元3,080.477 |
MU9 x 1 | 美元7.014 | 美元3,383.024 |
模型类型:
- Instruct - 模型部署后以非思考模式进行推理。
- Thinking - 模型部署后以思考模式进行推理。
部署创建
DTU 创建部署
使用 DTU 前需在控制台开通 DTU 功能并申请资源额度。开通后在百炼控制台专属部署页面选择目标模型,计费方式选择 DTU 即可创建部署。
警告DTU 部署暂不支持通过 API 创建与管理,请在百炼控制台完成开通、创建、扩缩容与续费等操作。
通用模型部署的基础流程详见专属部署概述。
创建部署的表单字段如下表所示。
参数 | 说明 | 是否必填 | 取值说明 |
|---|---|---|---|
服务名称 | 部署服务的名称 | 是 | 自定义 |
模型 | 部署的目标模型 | 是 | 下拉选择 |
部署模版 | 部署架构 | 否 | 下拉选择,默认选第一个 |
付费类型 | 计费方式 | 是 | 预付费(按月) |
输入吞吐额度 | 购买的输入 TPM 容量 | 是 | 基准输入 TPM 的整数倍(kTPM) |
输出吞吐额度 | 购买的输出 TPM 容量 | 是 | 基准输出 TPM 的整数倍(kTPM) |
购买时长 | 购买周期 | 是 | 1-12(整数,月) |
自动续费 | 到期自动续费 | 否 | 开/关 |
单次续费时长 | 开启自动续费时必填 | 是 | 1-12(整数,月) |
MU 部署配置
模型单元
配置内容 | 配置详情 |
|---|---|
服务名称 | 自定义部署服务的名称。 |
选择模型 | 选择要部署的模型,包括平台预置模型和已调优的模型。 |
模型单元类型 | 选择部署规格,不同规格对应不同的算力和性能。 |
部署副本数 | 设置初始部署副本数量,影响服务的并发处理能力。 |
部署模版 | 选择部署模版(如"单机部署"),不同模版对应不同的资源配置方案。仅在模型单元计费模式下可用。 |
配置模型推理模式 | 部分模型在以模型单元方式部署时,可配置推理模式、最长上下文等。
|
最长上下文 | 部分模型的模型单元部署模式支持该设置。最长上下文长度基于模型类型。 |
服务限流 | 部分模型的模型单元部署模式支持该设置,可限制模型调用的 RPM、TPM。 |
容量规划
DTU 按输入/输出 TPM 售卖,所购 TPM 即每分钟可处理的最大 token 量。容量规划的目标是:依据业务峰值 token 需求推算需购买的倍数,再通过压测验证实际可承载的并发与延迟是否达标。各模型的基准输入/输出 TPM 与标准工况性能参考见上方表格。
建议使用 evalscope 等压测工具,按真实业务场景(输入/输出长度、并发数、延迟要求)压测,再对照定价表确定购买倍数。
容量规划方法
- 梳理业务峰值指标:典型请求的输入/输出 token 长度、目标并发数,以及对首字延迟(TTFT)和每 token 生成延迟(TPOT)的要求。
- 估算峰值吞吐需求:峰值输入 TPM ≈ 并发数 × 单请求输入长度 ÷ 单请求处理时长(分钟);峰值输出 TPM ≈ 并发数 × 单请求输出长度 ÷ 单请求生成时长(分钟)。
- 计算购买倍数:输入倍数 = ⌈峰值输入 TPM ÷ 基准输入 TPM⌉,输出倍数 = ⌈峰值输出 TPM ÷ 基准输出 TPM⌉;DTU 输入与输出需同增同减,取两者较大值作为最终倍数。
- 压测验证:按计算倍数购买后,用 evalscope 在目标工况下复测,确认实际吞吐与延迟满足业务要求。若延迟偏高,可在 TPM 余量内提高并发以提升有效吞吐。
如对延迟要求不严格,可在不超过所购 TPM 上限的前提下,通过提高并发数提升实际吞吐量。
业务测算示例:
某模型基准输入 656K TPM、基准输出 82K TPM。经业务峰值梳理,峰值输入约 1,300K TPM、峰值输出约 160K TPM。计算倍数:输入 ⌈1300÷656⌉=2、输出 ⌈160÷82⌉=2,取较大值 2 倍,购买输入 1,312K TPM(656K×2)+ 输出 164K TPM(82K×2);随后用 evalscope 在峰值工况压测,确认延迟达标。若业务量翻倍,峰值输入约 2,600K、输出约 320K,则输入 ⌈2600÷656⌉=4、输出 ⌈320÷82⌉=4,需购买 4 倍:输入 2,624K TPM(656K×4)+ 输出 328K TPM(82K×4),并复测。
测算公式:
购买倍数 = max(⌈峰值输入 TPM ÷ 基准输入 TPM⌉, ⌈峰值输出 TPM ÷ 基准输出 TPM⌉)
扩缩容与续费退订
DTU 扩缩容与续费退订
部署列表展示已购买的输入/输出 TPM 额度,详情页展示 TPM 容量详情。
扩缩容:在部署列表中点击「扩缩容」修改输入/输出 TPM 容量。扩容显示需补交金额,缩容显示预计退款金额。输入和输出需同增或同减,不能一增一减。仅运行中的部署可操作。
续费:预付费包月到期可续费,详情页续费按钮进入续费流程,支持自动续费开关与单次续费时长。
退订:预付费包月支持提前退订,已使用部分按 1.2 倍系数结算退费,详见降配退款规则说明。退订不可恢复,退订后独占资源释放、服务停止。
MU 扩缩容与续费
- 模型单元(按时长):点击扩缩容按钮,自助、手动调节实例数量(副本数)。还可通过操作列的伸缩配置按钮,配置自动伸缩策略(包括伸缩阈值、最小/最大副本数、定时伸缩等)。
- 续费:预付费包月服务可续费延长服务时间,支持自动续费。
- 退订:预付费购买的首月内提前退订,日单价按 1.2 倍计费;详见降配退款规则说明。
常见问题
DTU 部署和 Token 按量计费有什么区别?Token 按量计费在共享资源池上按 token 用量计费;DTU 为独占 GPU 资源,按输入/输出 TPM 计费,适合需要稳定吞吐和独占部署的场景。
DTU 部署支持哪些计费方式?仅支持预付费(按月)计费。
如何查看已购 TPM 的使用情况?在百炼控制台专属部署的部署列表和详情页可查看已购的输入/输出 TPM 额度,详见专属部署概述。