全部產品
Search
文件中心

Alibaba Cloud Model Studio:DTU 獨佔算力部署

更新時間:Sep 23, 2026

獨佔算力部署提供獨佔吞吐(DTU)與模型單元(MU)兩種方案,以獨佔 GPU 資源為指定模型提供效能和吞吐保障。DTU 面向新發布模型(按輸入/輸出 TPM×時長計費),MU 用於已有模型(按模型單元數量×時長計費)。本文介紹兩種方案的功能、計費方式、使用流程與支援模型。

概述

獨佔算力部署為指定模型提供獨佔 GPU 資源與效能保障,支援基礎模型與自訂模型部署。百煉提供兩種獨佔算力方案:

  • DTU(Dedicated Throughput Unit,獨佔吞吐):按 Input/Output TPM 販售,提供更直接的吞吐保障。全託管推理服務,底層獨佔 GPU 資源由平台運維。
  • 模型單元(MU,Model Unit):按使用時長與模型單元數量配置算力,資源獨佔。支援自訂效能指標、PD 分離計算模式。計費粒度為模型單元數量×時長。

DTU 與 MU 按模型適用區分:新發布模型採用 DTU(按輸入/輸出 TPM 計量),已有模型沿用 MU(按模型單元數量計量)。兩者均提供獨佔算力、資源隔離與微調模型部署能力。新購部署時若模型支援 DTU 則優先選擇 DTU。

兩種方案共有的能力:

  • 獨佔 GPU 資源,推理環境與其他使用者實體隔離。
  • 支援基礎模型和自訂模型(百煉微調模型或使用者上傳模型)部署。
  • 平台負責底層運維,無需管理 GPU。
  • 不主動設 RPM/TPM 上限,流量受實際承載力限制。

通用模型部署流程詳見專屬部署概述與預置吞吐。

方案選型

百煉為推理呼叫提供多種容量與計費方案。DTU 適用於需要獨佔部署、微調模型部署、低延遲高併發或資料隔離的場景。各方案的對比如下表所示。

Token 按量、PTU 等全部計費方式的完整對比詳見模型部署主表。

比較維度

DTU

PTU

Token 按量

PAI/靈駿

特點

獨佔算力 + 微調模型

吞吐量保障 + 低延遲

彈性靈活、零門檻

自訂執行環境

資源隔離

實體隔離

邏輯隔離

共享公池

實體隔離

微調模型

全參 + LoRA

不支援

LoRA

支援

自訂框架

不支援

不支援

不支援

支援

計費模式

TPM 額度 × 時長

TPM 額度 × 時長

Token 用量

GPU × 時長

計費規則

DTU 計費

DTU 按輸入 TPM 和輸出 TPM 分別計費,採用預付費(按月)模式。各模型有固定的輸入/輸出基準 TPM(見下表),購買時需為基準 TPM 的整數倍。輸入和輸出各至少購買基準 TPM(1 倍),生產環境建議各購買 2 倍以上。

費用由後端根據模型、輸入/輸出 TPM、服務區域和購買時長計算。各模型的輸入/輸出單價與月總價如下表所示,輸入/輸出單價按 kTPM·月計價,月總價為輸入輸出各 1 倍基準 TPM 的合計,微調模型的價格與對應基礎模型相同,具體以控制台實際展示為準。

MU 計費

费用 = 使用时长(小时)× 模型单元数量 × 模型单元单价

"模型單元單價"在後付費場景下取下表"小時單價"列;預付費按月計費時,公式改為 包月數 × 模型單元數量 × 月單價。

  • 預付費購買的首月,如在首月內提前退訂,日單價(≈ 月單價 / 30)將按 1.2 倍計費(不滿一天按一天計費)

說明模型單元-後付費方式的算力資源先買到先得。如購買不成功會全額退款。

支援模型與價格

DTU 價格表與效能基準

新加坡

模型

基準輸入(TPM)

基準輸出(TPM)

輸入單價(USD/kTPM·月)

輸出單價(USD/kTPM·月)

月總價(USD)

qwen3.7-plus-2026-05-26

1,192,000

148,000

37

295

87,764

1,372,000

170,000

32

257

87,594

660,000

124,000

66

352

87,208

704,000

132,000

62

331

87,340

各模型在標準工況下的效能參考資料如下表所示,以控制台實際展示為準。

以下效能參考資料均在快取命中率為 0% 的條件下測得。實際使用中,隨著快取命中率提升,模型效能也會相應提高。

模型

輸入長度

輸出長度

快取命中率

首字延遲(ms)

每token延遲(ms)

qwen3.7-plus-2026-05-26

16,000

2,000

0

888

10

16,000

2,000

0

2,418

15

2,600

500

0

819

14

2,600

500

0

970

13

其中 qwen3.8-27b 當前需白名單開通,其餘模型為新加坡正式站點。

MU 價格表

新加坡

文字生成

模型

基準輸入(TPM)

基準輸出(TPM)

輸入單價(USD/kTPM·月)

輸出單價(USD/kTPM·月)

月總價(USD)

qwen3.7-plus-2026-05-26

1,192,000

148,000

37

295

87,764

1,372,000

170,000

32

257

87,594

660,000

124,000

66

352

87,208

704,000

132,000

62

331

87,340

多模態

模型

輸入長度

輸出長度

快取命中率

首字延遲(ms)

每token延遲(ms)

qwen3.7-plus-2026-05-26

16,000

2,000

0

888

10

16,000

2,000

0

2,418

15

2,600

500

0

819

14

2,600

500

0

970

13

模型類型:

  • Instruct - 模型部署後以非思考模式進行推理。

华北2(北京)

文字生成

千問

模型名稱

模型代碼

模型單元規格

小時單價(美元)

最小計費:分鐘

包月單價(美元)

最小計費:天

千問3.8-27B

qwen3.8-27b

MU9 x 4

美元28.056

美元13,532.096

千問3.7-Plus-2026-05-26

qwen3.7-plus-2026-05-26

MU2 x 8

美元69.312

美元33,044.72

MU3 x 8

美元150.72

美元72,577.152

千問3.6-35B-A3B

qwen3.6-35b-a3b

MU1 x 8

美元59.408

美元28,734.256

MU2 x 8

美元69.312

美元33,044.72

MU3 x 8

美元150.72

美元72,577.152

MU8 x 1

美元6.464

美元3,080.477

MU9 x 1

美元7.014

美元3,383.024

千問3.6-27B

qwen3.6-27b

MU9 x 1

美元7.014

美元3,383.024

千問3.6-Flash-2026-04-16

qwen3.6-flash-2026-04-16

MU1 x 2

美元14.852

美元7,183.564

MU3 x 8

美元150.72

美元72,577.152

千問3.6-Plus-2026-04-02

qwen3.6-plus-2026-04-02

MU1 x 8

MU1 x 16(PD分離模式)

美元59.408

PD分離模式:美元118.816

美元28,734.256

PD分離模式:美元57,468.512

MU2 x 8

美元69.312

美元33,044.72

千問3.5-397B-A17B

qwen3.5-397b-a17b

MU3 x 8

MU3 x 16(PD分離模式)

美元150.72

PD分離模式:美元301.44

美元72,577.152

PD分離模式:美元145,154.304

MU6 x 16

美元55.008

美元26,599.92

千問3.5-122B-A10B

qwen3.5-122b-a10b

MU1 x 4

美元29.704

美元14,367.128

MU6 x 16

美元55.008

美元26,599.92

千問3.5-35B-A3B

qwen3.5-35b-a3b

MU1 x 2

美元14.852

美元7,183.564

MU2 x 8

美元69.312

美元33,044.72

MU3 x 8

美元150.72

美元72,577.152

MU9 x 1

美元7.014

美元3,383.024

千問3.5-27B

qwen3.5-27b

MU2 x 8

美元69.312

美元33,044.72

MU3 x 8

美元150.72

美元72,577.152

MU8 x 1

美元6.464

美元3,080.477

MU9 x 1

美元7.014

美元3,383.024

千問3.5-9B

qwen3.5-9b

MU1 x 2

美元14.852

美元7,183.564

MU2 x 8

美元69.312

美元33,044.72

千問3.5-Flash-2026-02-23

qwen3.5-flash-2026-02-23

MU1 x 2

美元14.852

美元7,183.564

千問3.5-Plus-2026-02-15

qwen3.5-plus-2026-02-15

MU1 x 8

MU1 x 16(PD分離模式)

美元59.408

PD分離模式:美元118.816

美元28,734.256

PD分離模式:美元57,468.512

MU2 x 8

美元69.312

美元33,044.72

MU3 x 8

MU3 x 16(PD分離模式)

美元150.72

PD分離模式:美元301.44

美元72,577.152

PD分離模式:美元145,154.304

千問3-235B-A22B-Instruct-2507

qwen3-235b-a22b-instruct-2507

MU1 x 4

美元29.704

美元14,367.128

MU2 x 8

美元69.312

美元33,044.72

MU3 x 8

美元150.72

美元72,577.152

千問3-32B

qwen3-32b

MU6 x 16

美元55.008

美元26,599.92

千問3-30B-A3B-Thinking-2507

qwen3-30b-a3b-thinking-2507

MU1 x 2

美元14.852

美元7,183.564

千問3-4B

qwen3-4b

MU1 x 2

美元14.852

美元7,183.564

MU5 x 1

美元2.888

美元1,394.329

千問3-Embedding-0.6B

qwen3-embedding-0.6b

MU5 x 1

美元2.888

美元1,394.329

MU6 x 1

美元3.438

美元1,662.495

千問3-MoE-Rerank-0.6B

qwen3-moe-rerank-0.6b

MU5 x 1

美元2.888

美元1,394.329

千問3-Rerank-0.6B

qwen3-rerank-0.6b

MU5 x 1

美元2.888

美元1,394.329

MU6 x 1

美元3.438

美元1,662.495

千問3-Max-2025-09-23

qwen3-max-2025-09-23

MU2 x 8

美元69.312

美元33,044.72

MU3 x 8

美元150.72

美元72,577.152

千問3-Rerank

qwen3-rerank

MU5 x 1

美元2.888

美元1,394.329

千問2.5-開源版-72B

qwen2.5-72b-instruct

MU1 x 8

美元59.408

美元28,734.256

千問2.5-開源版-14B

qwen2.5-14b-instruct

MU1 x 2

美元14.852

美元7,183.564

千問2.5-開源版-7B

qwen2.5-7b-instruct

MU1 x 2

美元14.852

美元7,183.564

MU5 x 1

美元2.888

美元1,394.329

千問-Plus-2025-07-28

qwen-plus-2025-07-28

MU1 x 4

MU1 x 16(PD分離模式)

美元29.704

PD分離模式:美元118.816

美元14,367.128

PD分離模式:美元57,468.512

千問-Plus-2025-12-01

qwen-plus-2025-12-01

MU1 x 4

美元29.704

美元14,367.128

Qwen-Plus-Character-2025-11-06

qwen-plus-character-2025-11-06

MU1 x 4

美元29.704

美元14,367.128

GLM

模型名稱

模型代碼

模型單元規格

小時單價(美元)

最小計費:分鐘

包月單價(美元)

最小計費:天

GLM-5.1

glm-5.1

MU2 x 8

美元69.312

美元33,044.72

MU3 x 16(PD分離模式)

PD分離模式:美元301.44

PD分離模式:美元145,154.304

MU6 x 16

美元55.008

美元26,599.92

GLM-5

glm-5

MU3 x 16(PD分離模式)

PD分離模式:美元301.44

PD分離模式:美元145,154.304

GLM-4.7

glm-4.7

MU6 x 32(PD分離模式)

PD分離模式:美元110.016

PD分離模式:美元53,199.84

DeepSeek

模型名稱

模型代碼

模型單元規格

小時單價(美元)

最小計費:分鐘

包月單價(美元)

最小計費:天

DeepSeek-v4-Flash

deepseek-v4-flash

MU1 x 8

美元59.408

美元28,734.256

MU3 x 8

美元150.72

美元72,577.152

DeepSeek-v3.2

deepseek-v3.2

MU2 x 16(PD分離模式)

PD分離模式:美元138.624

PD分離模式:美元66,089.44

其他模型

模型名稱

模型代碼

模型單元規格

小時單價(美元)

最小計費:分鐘

包月單價(美元)

最小計費:天

Kimi-K2.5

kimi-k2.5

MU2 x 8

美元69.312

美元33,044.72

多模態

千問VL

模型名稱

模型代碼

模型單元規格

小時單價(美元)

最小計費:分鐘

包月單價(美元)

最小計費:天

千問3-VL-235B-A22B-Thinking

qwen3-vl-235b-a22b-thinking

MU1 x 8

美元59.408

美元28,734.256

MU2 x 8

美元69.312

美元33,044.72

MU3 x 8

美元150.72

美元72,577.152

千問3-VL-32B-Instruct

qwen3-vl-32b-instruct

MU2 x 8

美元69.312

美元33,044.72

MU3 x 8

美元150.72

美元72,577.152

千問3-VL-8B-Instruct

qwen3-vl-8b-instruct

MU1 x 2

美元14.852

美元7,183.564

MU5 x 1

美元2.888

美元1,394.329

千問3-VL-4B-Instruct

qwen3-vl-4b-instruct

MU1 x 2

美元14.852

美元7,183.564

千問3-VL-2B-Instruct

qwen3-vl-2b-instruct

MU5 x 1

美元2.888

美元1,394.329

千問3-VL-Embedding-2B

qwen3-vl-embedding-2b

MU5 x 1

美元2.888

美元1,394.329

千問3-VL-Flash-2025-10-15

qwen3-vl-flash-2025-10-15

MU1 x 4

美元29.704

美元14,367.128

千問3-VL-Plus-2025-09-23

qwen3-vl-plus-2025-09-23

MU1 x 4

美元29.704

美元14,367.128

千問VL-Max-2025-08-13

qwen-vl-max-2025-08-13

MU6 x 4

美元13.752

美元6,649.98

千問Omni

模型名稱

模型代碼

模型單元規格

小時單價(美元)

最小計費:分鐘

包月單價(美元)

最小計費:天

千問3.5-Omni-Flash

qwen3.5-omni-flash

MU8 x 1

美元6.464

美元3,080.477

MU9 x 1

美元7.014

美元3,383.024

模型類型:

  • Instruct - 模型部署後以非思考模式進行推理。
  • Thinking - 模型部署後以思考模式進行推理。

部署建立

DTU 建立部署

使用 DTU 前需在控制台開通 DTU 功能並申請資源額度。開通後在百煉控制台专属部署頁面選擇目標模型,計費方式選擇 DTU 即可建立部署。

警告DTU 部署暫不支援透過 API 建立與管理,請在百煉控制台完成開通、建立、擴縮容與續費等操作。

通用模型部署的基礎流程詳見专属部署概述。

建立部署的表單欄位如下表所示。

參數

說明

是否必填

取值說明

服务名称

部署服務的名稱

是

自訂

模型

部署的目標模型

是

下拉式選單選擇

部署模版

部署架構

否

下拉式選單選擇,預設選第一個

付费类型

計費方式

是

預付費(按月)

输入吞吐额度

購買的輸入 TPM 容量

是

基準輸入 TPM 的整數倍(kTPM)

输出吞吐额度

購買的輸出 TPM 容量

是

基準輸出 TPM 的整數倍(kTPM)

购买时长

購買週期

是

1-12(整數,月)

自动续费

到期自動續約

否

開/關

单次续费时长

開啟自動續約時必填

是

1-12(整數,月)

MU 部署配置

模型單元

配置內容

配置詳情

服務名稱

自訂部署服務的名稱。

選擇模型

選擇要部署的模型,包括平台預置模型和已調優的模型。

模型單元類型

選擇部署規格,不同規格對應不同的算力和效能。

部署副本數

設定初始部署副本數量,影響服務的併發處理能力。

部署範本

選擇部署範本(如「单机部署」),不同範本對應不同的資源配置方案。僅在模型單元計費模式下可用。

配置模型推理模式

部分模型在以模型單元方式部署時,可配置推理模式、最長上下文等。

  • Instruct - 模型部署後以非思考模式進行推理。

  • Thinking - 模型部署後以思考模式進行推理。

最長上下文

部分模型的模型單元部署模式支援該設定。最長上下文長度基於模型類型。

服務限流

部分模型的模型單元部署模式支援該設定,可限制模型呼叫的 RPM、TPM。

容量規劃

DTU 按輸入/輸出 TPM 販售,所購 TPM 即每分鐘可處理的最大 token 量。容量規劃的目標是:依據業務峰值 token 需求推算需購買的倍數,再透過壓測驗證實際可承載的併發與延遲是否達標。各模型的基準輸入/輸出 TPM 與標準工況效能參考見上方表格。

建議使用 evalscope 等壓測工具,按真實業務場景(輸入/輸出長度、併發數、延遲要求)壓測,再對照定價表確定購買倍數。

容量規劃方法

  1. 梳理業務峰值指標:典型請求的輸入/輸出 token 長度、目標併發數,以及對首字延遲(TTFT)和每 token 生成延遲(TPOT)的要求。
  2. 估算峰值吞吐需求:峰值輸入 TPM ≈ 併發數 × 單請求輸入長度 ÷ 單請求處理時長(分鐘);峰值輸出 TPM ≈ 併發數 × 單請求輸出長度 ÷ 單請求生成時長(分鐘)。
  3. 計算購買倍數:輸入倍數 = ⌈峰值輸入 TPM ÷ 基準輸入 TPM⌉,輸出倍數 = ⌈峰值輸出 TPM ÷ 基準輸出 TPM⌉;DTU 輸入與輸出需同增同減,取兩者較大值作為最終倍數。
  4. 壓測驗證:按計算倍數購買後,用 evalscope 在目標工況下複測,確認實際吞吐與延遲滿足業務要求。若延遲偏高,可在 TPM 餘量內提高併發以提升有效吞吐。

如對延遲要求不嚴格,可在不超過所購 TPM 上限的前提下,透過提高併發數提升實際吞吐量。

業務測算範例:

某模型基準輸入 656K TPM、基準輸出 82K TPM。經業務峰值梳理,峰值輸入約 1,300K TPM、峰值輸出約 160K TPM。計算倍數:輸入 ⌈1300÷656⌉=2、輸出 ⌈160÷82⌉=2,取較大值 2 倍,購買輸入 1,312K TPM(656K×2)+ 輸出 164K TPM(82K×2);隨後用 evalscope 在峰值工況壓測,確認延遲達標。若業務量翻倍,峰值輸入約 2,600K、輸出約 320K,則輸入 ⌈2600÷656⌉=4、輸出 ⌈320÷82⌉=4,需購買 4 倍:輸入 2,624K TPM(656K×4)+ 輸出 328K TPM(82K×4),並複測。

計算公式:

购买倍数 = max(⌈峰值输入 TPM ÷ 基准输入 TPM⌉, ⌈峰值输出 TPM ÷ 基准输出 TPM⌉)

擴縮容與續費退訂

DTU 擴縮容與續費退訂

部署列表展示已購買的輸入/輸出 TPM 額度,詳情頁展示 TPM 容量詳情。

擴縮容:在部署列表中點擊「扩缩容」修改輸入/輸出 TPM 容量。擴容顯示需補交金額,縮容顯示預計退款金額。輸入和輸出需同增或同減,不能一增一減。僅執行中的部署可操作。

續費:預付費包月到期可續費,詳情頁續費按鈕進入續費流程,支援自動續費開關與單次續費時長。

退訂:預付費包月支援提前退訂,已使用部分按 1.2 倍係數結算退費,詳見降配退款規則說明。退訂不可恢復,退訂後獨佔資源釋放、服務停止。

MU 擴縮容與續費

  • 模型單元(按時長):點擊扩缩容按鈕,自助、手動調節執行個體數量(副本數)。還可透過操作欄的伸縮配置按鈕,配置自動伸縮策略(包括伸縮閾值、最小/最大副本數、定時伸縮等)。
  • 續費:預付費包月服務可續費延長服務時間,支援自動續費。
  • 退訂:預付費購買的首月內提前退訂,日單價按 1.2 倍計費;詳見降配退款規則說明。

常見問題

DTU 部署和 Token 按量計費有什麼區別?

Token 按量計費在共享資源池上按 token 用量計費;DTU 為獨佔 GPU 資源,按輸入/輸出 TPM 計費,適合需要穩定吞吐和獨佔部署的場景。

DTU 部署支援哪些計費方式?

僅支援預付費(按月)計費。

如何檢視已購 TPM 的使用情況?

在百煉控制台专属部署的部署列表和詳情頁可檢視已購的輸入/輸出 TPM 額度,詳見专属部署概述。