全部产品
Search
文档中心

大模型服务平台百炼:DTU 独占算力部署

更新时间:Sep 16, 2026

独占算力部署提供独占吞吐(DTU)与模型单元(MU)两种方案,以独占 GPU 资源为指定模型提供性能和吞吐保障。DTU 面向新发布模型(按输入/输出 TPM×时长计费),MU 用于已有模型(按模型单元数量×时长计费)。本文介绍两种方案的功能、计费方式、使用流程与支持模型。

概述

独占算力部署为指定模型提供独占 GPU 资源与性能保障,支持基础模型与自定义模型部署。百炼提供两种独占算力方案:

  • DTU(Dedicated Throughput Unit,独占吞吐):按 Input/Output TPM 售卖,提供更直接的吞吐保障。全托管推理服务,底层独占 GPU 资源由平台运维。
  • 模型单元(MU,Model Unit):按使用时长与模型单元数量配置算力,资源独占。支持自定义性能指标、PD 分离计算模式。计费粒度为模型单元数量×时长。

DTU 与 MU 按模型适用区分:新发布模型采用 DTU(按输入/输出 TPM 计量),已有模型沿用 MU(按模型单元数量计量)。两者均提供独占算力、资源隔离与微调模型部署能力。新购部署时若模型支持 DTU 则优先选择 DTU。

两种方案共有的能力:

  • 独占 GPU 资源,推理环境与其他用户物理隔离。
  • 支持基础模型和自定义模型(百炼微调模型或用户上传模型)部署。
  • 平台负责底层运维,无需管理 GPU。
  • 不主动设 RPM/TPM 上限,流量受实际承载力限制。

通用模型部署流程详见专属部署概述预置吞吐

方案选型

百炼为推理调用提供多种容量与计费方案。DTU 适用于需要独占部署、微调模型部署、低延迟高并发或数据隔离的场景。各方案的对比如下表所示。

Token 按量、PTU 等全部计费方式的完整对比详见模型部署主表。

对比维度

DTU

PTU

Token 按量

PAI/灵骏

特点

独占算力 + 微调模型

吞吐保障 + 低延迟

弹性灵活、零门槛

自定义运行时

资源隔离

物理隔离

逻辑隔离

共享公池

物理隔离

微调模型

全参 + LoRA

不支持

LoRA

支持

自定义框架

不支持

不支持

不支持

支持

计费模式

TPM 额度 × 时长

TPM 额度 × 时长

Token 用量

GPU × 时长

计费规则

DTU 计费

DTU 按输入 TPM 和输出 TPM 分别计费,采用预付费(按月)模式。各模型有固定的输入/输出基准 TPM(见下表),购买时需为基准 TPM 的整数倍。输入和输出各至少购买基准 TPM(1 倍),生产环境建议各购买 2 倍以上。

费用由后端根据模型、输入/输出 TPM、服务区域和购买时长计算。各模型的输入/输出单价与月总价如下表所示,输入/输出单价按 kTPM·月计价,月总价为输入输出各 1 倍基准 TPM 的合计,微调模型的价格与对应基础模型相同,具体以控制台实际展示为准。

MU 计费

费用 = 使用时长(小时)× 模型单元数量 × 模型单元单价

"模型单元单价"在后付费场景下取下表"小时单价"列;预付费按月计费时,公式改为 包月数 × 模型单元数量 × 月单价

  • 预付费购买的首月,如在首月内提前退订,日单价(≈ 月单价 / 30)将按 1.2 倍计费(不满一天按一天计费)

说明模型单元-后付费方式的算力资源先买到先得。如购买不成功会全额退款。

支持模型与价格

DTU 价格表与性能基准

新加坡

模型

基准输入(TPM)

基准输出(TPM)

输入单价(USD/kTPM·月)

输出单价(USD/kTPM·月)

月总价(USD)

qwen3.7-plus-2026-05-26

1,192,000

148,000

37

295

87,764

1,372,000

170,000

32

257

87,594

660,000

124,000

66

352

87,208

704,000

132,000

62

331

87,340

各模型在标准工况下的性能参考数据如下表所示,以控制台实际展示为准。

以下性能参考数据均在缓存命中率为 0% 的条件下测得。实际使用中,随着缓存命中率提升,模型性能也会相应提高。

模型

输入长度

输出长度

缓存命中率

首字延迟(ms)

每token延迟(ms)

qwen3.7-plus-2026-05-26

16,000

2,000

0

888

10

16,000

2,000

0

2,418

15

2,600

500

0

819

14

2,600

500

0

970

13

其中 qwen3.8-27b 当前需白名单开通,其余模型为新加坡正式站点。

MU 价格表

新加坡

文本生成

模型

基准输入(TPM)

基准输出(TPM)

输入单价(USD/kTPM·月)

输出单价(USD/kTPM·月)

月总价(USD)

qwen3.7-plus-2026-05-26

1,192,000

148,000

37

295

87,764

1,372,000

170,000

32

257

87,594

660,000

124,000

66

352

87,208

704,000

132,000

62

331

87,340

多模态

模型

输入长度

输出长度

缓存命中率

首字延迟(ms)

每token延迟(ms)

qwen3.7-plus-2026-05-26

16,000

2,000

0

888

10

16,000

2,000

0

2,418

15

2,600

500

0

819

14

2,600

500

0

970

13

模型类型:

  • Instruct - 模型部署后以非思考模式进行推理。

华北2(北京)

文本生成

千问

模型名称

模型代码

模型单元规格

小时单价(美元)

最小计费:分钟

包月单价(美元)

最小计费:天

千问3.8-27B

qwen3.8-27b

MU9 x 4

美元28.056

美元13,532.096

千问3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

MU2 x 8

美元69.312

美元33,044.72

MU3 x 8

美元150.72

美元72,577.152

千问3.6-35B-A3B

qwen3.6-35b-a3b

MU1 x 8

美元59.408

美元28,734.256

MU2 x 8

美元69.312

美元33,044.72

MU3 x 8

美元150.72

美元72,577.152

MU8 x 1

美元6.464

美元3,080.477

MU9 x 1

美元7.014

美元3,383.024

千问3.6-27B

qwen3.6-27b

MU9 x 1

美元7.014

美元3,383.024

千问3.6-Flash-2026-04-16

qwen3.6-flash-2026-04-16

MU1 x 2

美元14.852

美元7,183.564

MU3 x 8

美元150.72

美元72,577.152

千问3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

MU1 x 8

MU1 x 16(PD分离模式)

美元59.408

PD分离模式:美元118.816

美元28,734.256

PD分离模式:美元57,468.512

MU2 x 8

美元69.312

美元33,044.72

千问3.5-397B-A17B

qwen3.5-397b-a17b

MU3 x 8

MU3 x 16(PD分离模式)

美元150.72

PD分离模式:美元301.44

美元72,577.152

PD分离模式:美元145,154.304

MU6 x 16

美元55.008

美元26,599.92

千问3.5-122B-A10B

qwen3.5-122b-a10b

MU1 x 4

美元29.704

美元14,367.128

MU6 x 16

美元55.008

美元26,599.92

千问3.5-35B-A3B

qwen3.5-35b-a3b

MU1 x 2

美元14.852

美元7,183.564

MU2 x 8

美元69.312

美元33,044.72

MU3 x 8

美元150.72

美元72,577.152

MU9 x 1

美元7.014

美元3,383.024

千问3.5-27B

qwen3.5-27b

MU2 x 8

美元69.312

美元33,044.72

MU3 x 8

美元150.72

美元72,577.152

MU8 x 1

美元6.464

美元3,080.477

MU9 x 1

美元7.014

美元3,383.024

千问3.5-9B

qwen3.5-9b

MU1 x 2

美元14.852

美元7,183.564

MU2 x 8

美元69.312

美元33,044.72

千问3.5-Flash-2026-02-23

qwen3.5-flash-2026-02-23

MU1 x 2

美元14.852

美元7,183.564

千问3.5-Plus-2026-02-15

qwen3.5-plus-2026-02-15

MU1 x 8

MU1 x 16(PD分离模式)

美元59.408

PD分离模式:美元118.816

美元28,734.256

PD分离模式:美元57,468.512

MU2 x 8

美元69.312

美元33,044.72

MU3 x 8

MU3 x 16(PD分离模式)

美元150.72

PD分离模式:美元301.44

美元72,577.152

PD分离模式:美元145,154.304

千问3-235B-A22B-Instruct-2507

qwen3-235b-a22b-instruct-2507

MU1 x 4

美元29.704

美元14,367.128

MU2 x 8

美元69.312

美元33,044.72

MU3 x 8

美元150.72

美元72,577.152

千问3-32B

qwen3-32b

MU6 x 16

美元55.008

美元26,599.92

千问3-30B-A3B-Thinking-2507

qwen3-30b-a3b-thinking-2507

MU1 x 2

美元14.852

美元7,183.564

千问3-4B

qwen3-4b

MU1 x 2

美元14.852

美元7,183.564

MU5 x 1

美元2.888

美元1,394.329

千问3-Embedding-0.6B

qwen3-embedding-0.6b

MU5 x 1

美元2.888

美元1,394.329

MU6 x 1

美元3.438

美元1,662.495

千问3-MoE-Rerank-0.6B

qwen3-moe-rerank-0.6b

MU5 x 1

美元2.888

美元1,394.329

千问3-Rerank-0.6B

qwen3-rerank-0.6b

MU5 x 1

美元2.888

美元1,394.329

MU6 x 1

美元3.438

美元1,662.495

千问3-Max-2025-09-23

qwen3-max-2025-09-23

MU2 x 8

美元69.312

美元33,044.72

MU3 x 8

美元150.72

美元72,577.152

千问3-Rerank

qwen3-rerank

MU5 x 1

美元2.888

美元1,394.329

千问2.5-开源版-72B

qwen2.5-72b-instruct

MU1 x 8

美元59.408

美元28,734.256

千问2.5-开源版-14B

qwen2.5-14b-instruct

MU1 x 2

美元14.852

美元7,183.564

千问2.5-开源版-7B

qwen2.5-7b-instruct

MU1 x 2

美元14.852

美元7,183.564

MU5 x 1

美元2.888

美元1,394.329

千问-Plus-2025-07-28

qwen-plus-2025-07-28

MU1 x 4

MU1 x 16(PD分离模式)

美元29.704

PD分离模式:美元118.816

美元14,367.128

PD分离模式:美元57,468.512

千问-Plus-2025-12-01

qwen-plus-2025-12-01

MU1 x 4

美元29.704

美元14,367.128

Qwen-Plus-Character-2025-11-06

qwen-plus-character-2025-11-06

MU1 x 4

美元29.704

美元14,367.128

GLM

模型名称

模型代码

模型单元规格

小时单价(美元)

最小计费:分钟

包月单价(美元)

最小计费:天

GLM-5.1

glm-5.1

MU2 x 8

美元69.312

美元33,044.72

MU3 x 16(PD分离模式)

PD分离模式:美元301.44

PD分离模式:美元145,154.304

MU6 x 16

美元55.008

美元26,599.92

GLM-5

glm-5

MU3 x 16(PD分离模式)

PD分离模式:美元301.44

PD分离模式:美元145,154.304

GLM-4.7

glm-4.7

MU6 x 32(PD分离模式)

PD分离模式:美元110.016

PD分离模式:美元53,199.84

DeepSeek

模型名称

模型代码

模型单元规格

小时单价(美元)

最小计费:分钟

包月单价(美元)

最小计费:天

DeepSeek-v4-Flash

deepseek-v4-flash

MU1 x 8

美元59.408

美元28,734.256

MU3 x 8

美元150.72

美元72,577.152

DeepSeek-v3.2

deepseek-v3.2

MU2 x 16(PD分离模式)

PD分离模式:美元138.624

PD分离模式:美元66,089.44

其他模型

模型名称

模型代码

模型单元规格

小时单价(美元)

最小计费:分钟

包月单价(美元)

最小计费:天

Kimi-K2.5

kimi-k2.5

MU2 x 8

美元69.312

美元33,044.72

多模态

千问VL

模型名称

模型代码

模型单元规格

小时单价(美元)

最小计费:分钟

包月单价(美元)

最小计费:天

千问3-VL-235B-A22B-Thinking

qwen3-vl-235b-a22b-thinking

MU1 x 8

美元59.408

美元28,734.256

MU2 x 8

美元69.312

美元33,044.72

MU3 x 8

美元150.72

美元72,577.152

千问3-VL-32B-Instruct

qwen3-vl-32b-instruct

MU2 x 8

美元69.312

美元33,044.72

MU3 x 8

美元150.72

美元72,577.152

千问3-VL-8B-Instruct

qwen3-vl-8b-instruct

MU1 x 2

美元14.852

美元7,183.564

MU5 x 1

美元2.888

美元1,394.329

千问3-VL-4B-Instruct

qwen3-vl-4b-instruct

MU1 x 2

美元14.852

美元7,183.564

千问3-VL-2B-Instruct

qwen3-vl-2b-instruct

MU5 x 1

美元2.888

美元1,394.329

千问3-VL-Embedding-2B

qwen3-vl-embedding-2b

MU5 x 1

美元2.888

美元1,394.329

千问3-VL-Flash-2025-10-15

qwen3-vl-flash-2025-10-15

MU1 x 4

美元29.704

美元14,367.128

千问3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

MU1 x 4

美元29.704

美元14,367.128

千问VL-Max-2025-08-13

qwen-vl-max-2025-08-13

MU6 x 4

美元13.752

美元6,649.98

千问Omni

模型名称

模型代码

模型单元规格

小时单价(美元)

最小计费:分钟

包月单价(美元)

最小计费:天

千问3.5-Omni-Flash

qwen3.5-omni-flash

MU8 x 1

美元6.464

美元3,080.477

MU9 x 1

美元7.014

美元3,383.024

模型类型:

  • Instruct - 模型部署后以非思考模式进行推理。
  • Thinking - 模型部署后以思考模式进行推理。

部署创建

DTU 创建部署

使用 DTU 前需在控制台开通 DTU 功能并申请资源额度。开通后在百炼控制台专属部署页面选择目标模型,计费方式选择 DTU 即可创建部署。

警告DTU 部署暂不支持通过 API 创建与管理,请在百炼控制台完成开通、创建、扩缩容与续费等操作。

通用模型部署的基础流程详见专属部署概述

创建部署的表单字段如下表所示。

参数

说明

是否必填

取值说明

服务名称

部署服务的名称

自定义

模型

部署的目标模型

下拉选择

部署模版

部署架构

下拉选择,默认选第一个

付费类型

计费方式

预付费(按月)

输入吞吐额度

购买的输入 TPM 容量

基准输入 TPM 的整数倍(kTPM)

输出吞吐额度

购买的输出 TPM 容量

基准输出 TPM 的整数倍(kTPM)

购买时长

购买周期

1-12(整数,月)

自动续费

到期自动续费

开/关

单次续费时长

开启自动续费时必填

1-12(整数,月)

MU 部署配置

模型单元

配置内容

配置详情

服务名称

自定义部署服务的名称。

选择模型

选择要部署的模型,包括平台预置模型和已调优的模型。

模型单元类型

选择部署规格,不同规格对应不同的算力和性能。

部署副本数

设置初始部署副本数量,影响服务的并发处理能力。

部署模版

选择部署模版(如"单机部署"),不同模版对应不同的资源配置方案。仅在模型单元计费模式下可用。

配置模型推理模式

部分模型在以模型单元方式部署时,可配置推理模式、最长上下文等。

  • Instruct - 模型部署后以非思考模式进行推理。

  • Thinking - 模型部署后以思考模式进行推理。

最长上下文

部分模型的模型单元部署模式支持该设置。最长上下文长度基于模型类型。

服务限流

部分模型的模型单元部署模式支持该设置,可限制模型调用的 RPM、TPM。

容量规划

DTU 按输入/输出 TPM 售卖,所购 TPM 即每分钟可处理的最大 token 量。容量规划的目标是:依据业务峰值 token 需求推算需购买的倍数,再通过压测验证实际可承载的并发与延迟是否达标。各模型的基准输入/输出 TPM 与标准工况性能参考见上方表格。

建议使用 evalscope 等压测工具,按真实业务场景(输入/输出长度、并发数、延迟要求)压测,再对照定价表确定购买倍数。

容量规划方法

  1. 梳理业务峰值指标:典型请求的输入/输出 token 长度、目标并发数,以及对首字延迟(TTFT)和每 token 生成延迟(TPOT)的要求。
  2. 估算峰值吞吐需求:峰值输入 TPM ≈ 并发数 × 单请求输入长度 ÷ 单请求处理时长(分钟);峰值输出 TPM ≈ 并发数 × 单请求输出长度 ÷ 单请求生成时长(分钟)。
  3. 计算购买倍数:输入倍数 = ⌈峰值输入 TPM ÷ 基准输入 TPM⌉,输出倍数 = ⌈峰值输出 TPM ÷ 基准输出 TPM⌉;DTU 输入与输出需同增同减,取两者较大值作为最终倍数。
  4. 压测验证:按计算倍数购买后,用 evalscope 在目标工况下复测,确认实际吞吐与延迟满足业务要求。若延迟偏高,可在 TPM 余量内提高并发以提升有效吞吐。

如对延迟要求不严格,可在不超过所购 TPM 上限的前提下,通过提高并发数提升实际吞吐量。

业务测算示例:

某模型基准输入 656K TPM、基准输出 82K TPM。经业务峰值梳理,峰值输入约 1,300K TPM、峰值输出约 160K TPM。计算倍数:输入 ⌈1300÷656⌉=2、输出 ⌈160÷82⌉=2,取较大值 2 倍,购买输入 1,312K TPM(656K×2)+ 输出 164K TPM(82K×2);随后用 evalscope 在峰值工况压测,确认延迟达标。若业务量翻倍,峰值输入约 2,600K、输出约 320K,则输入 ⌈2600÷656⌉=4、输出 ⌈320÷82⌉=4,需购买 4 倍:输入 2,624K TPM(656K×4)+ 输出 328K TPM(82K×4),并复测。

测算公式:

购买倍数 = max(⌈峰值输入 TPM ÷ 基准输入 TPM⌉, ⌈峰值输出 TPM ÷ 基准输出 TPM⌉)

扩缩容与续费退订

DTU 扩缩容与续费退订

部署列表展示已购买的输入/输出 TPM 额度,详情页展示 TPM 容量详情。

扩缩容:在部署列表中点击「扩缩容」修改输入/输出 TPM 容量。扩容显示需补交金额,缩容显示预计退款金额。输入和输出需同增或同减,不能一增一减。仅运行中的部署可操作。

续费:预付费包月到期可续费,详情页续费按钮进入续费流程,支持自动续费开关与单次续费时长。

退订:预付费包月支持提前退订,已使用部分按 1.2 倍系数结算退费,详见降配退款规则说明。退订不可恢复,退订后独占资源释放、服务停止。

MU 扩缩容与续费

  • 模型单元(按时长):点击扩缩容按钮,自助、手动调节实例数量(副本数)。还可通过操作列的伸缩配置按钮,配置自动伸缩策略(包括伸缩阈值、最小/最大副本数、定时伸缩等)。
  • 续费:预付费包月服务可续费延长服务时间,支持自动续费。
  • 退订:预付费购买的首月内提前退订,日单价按 1.2 倍计费;详见降配退款规则说明

常见问题

DTU 部署和 Token 按量计费有什么区别?

Token 按量计费在共享资源池上按 token 用量计费;DTU 为独占 GPU 资源,按输入/输出 TPM 计费,适合需要稳定吞吐和独占部署的场景。

DTU 部署支持哪些计费方式?

仅支持预付费(按月)计费。

如何查看已购 TPM 的使用情况?

在百炼控制台专属部署的部署列表和详情页可查看已购的输入/输出 TPM 额度,详见专属部署概述