全部產品
Search
文件中心

Alibaba Cloud Model Studio:預置吞吐長輸入與緩衝

更新時間:Aug 26, 2026

本文介紹 PTU(預置吞吐)部署的長輸入和首碼緩衝能力,包括額度消耗規則、 預置吞吐額度計算機 使用方法和 API 響應欄位說明。

功能概述

PTU 部署支援長輸入請求(部分模型最高 200K token)和首碼緩衝,通過階梯容量係數和緩衝折扣靈活管理額度消耗。

核心能力:

  • 長輸入支援:部分模型支援超過 32K token 的輸入,超出部分按更高的階梯係數折算 TPM(每分鐘 Token 數)消耗,詳見額度消耗規則
  • 首碼緩衝優惠:部分模型支援首碼緩衝,命中緩衝的輸入 token 按折扣係數消耗額度(具體折扣率因模型而異),可降低多輪對話和重複首碼情境的額度消耗。
  • 溢出策略:建立 PTU 時可選——自動溢出至隨用隨付(預設,業務不中斷)或僅使用 PTU 容量(超出返回 429、不產生額外費用)。輸入超過模型上限(千問 128K / DeepSeek 64K)仍自動轉為隨用隨付。

重要自動溢出策略下轉為隨用隨付後,費用按對應模型的隨用隨付單價計算(僅使用 PTU 容量策略下超出返回 429、不產生額外費用)。建議通過預置吞吐額度計算機合理規劃 PTU 額度,避免意外費用。

常見於長文件剖析(合約、研報摘要)和多輪對話(客服、編程助手)等輸入超 32K token 的情境。

關於 PTU 部署的基礎概念和購買方式,請參見模型部署簡介。關於首碼緩衝的工作原理,請參見上下文緩衝

額度消耗規則

長輸入階梯係數和緩衝折扣按模型不同,以下為當前支援的模型參數:

模型

輸入長度上限

緩衝折扣

長輸入階梯係數

qwen3.8-Max

1 Million

0.125(快取命中部分按 12.5% 折算容量)

無階梯(1.0)

qwen3.7-plus-2026-05-26

1 Million

0.2(快取命中部分按 20% 折算容量)

無階梯(1.0)

qwen3.7-flash-2026-07-15

1 Million

0.2(快取命中部分按 20% 折算容量)

[0, 32K):輸入 1.0 / 輸出 1.0
(32K, 256K]:輸入 3.0 / 輸出 3.0

(256K, 1Million]:輸入 6.0 / 輸出 6.0

glm-5.2

1 Million

0.25(快取命中部分按 25% 折算容量)

無階梯(1.0)

glm-5.1

200K

0.2(快取命中部分按 20% 折算容量)

[0, 32K):輸入 1.0 / 輸出 1.0
(32K, 200K]:輸入 1.33 / 輸出 1.17

deepseek-v4-pro

256K

0.08(快取命中部分按 8% 折算容量)

無階梯(1.0)

deepseek-v4-flash-0731

1 Million

0.2(快取命中部分按 20% 折算容量)

無階梯(1.0)

其他模型

以控制台為準

以控制台為準

無階梯(1.0)

計算樣本(以 glm-5.1 為例)

情境 1:短輸入(10K token,無緩衝)
  輸入消耗:10K × 1.0 = 10KTPM

情境 2:長輸入(50K token,無緩衝)
  輸入消耗:32K × 1.0 + 18K × 1.33 = 55.94 KTPM
  輸出消耗(假設 1K token):1K × 1.17 = 1.17 KTPM

情境 3:長輸入 + 快取命中(50K token,前 30K 命中緩衝)
  緩衝部分輸入(前 30K,均在 [0,32K) 階梯內):
    30K × 1.0 × 0.2 = 6  KTPM
  非緩衝部分輸入(後 20K):
    2K × 1.0 + 18K × 1.33 = 25.94 KTPM
  輸入合計 = 31.940 KTPM(比無緩衝節省 43%)

使用預置吞吐額度計算機估算額度

說明建議在建立或擴容前使用計算機評估長輸入情境的額度需求,避免額度不足導致請求轉為隨用隨付。購買上限以控制台實際展示為準。

前提條件:已開通百鍊服務並具備 PTU 部署許可權。登入百鍊控制台,在模型部署 > 建立部署頁面(或在已有部署詳情頁單擊擴容),選擇可部署的PTU(預置吞吐)模型後,展開預置吞吐額度計算機

image

預置吞吐額度計算機根據業務負載自動推薦額度。填寫以下參數後,計算機輸出建議購買的輸入 KTPM 和輸出 KTPM。

參數

說明

對結果的影響

每分鐘請求數(RPM)

業務高峰期每分鐘的請求數。

RPM 越大,建議購買輸入 KTPM 和輸出 KTPM 同比增大。

平均輸入長度(token)

每條請求的平均輸入 token 數。

輸入越長,所處階梯越高,係數越大,建議購買輸入 KTPM 越高。不同模型的階梯邊界不同,以控制台實際展示為準。

平均輸出長度(token)

每條請求的平均輸出 token 數。

輸出越長,係數可能越大,建議購買輸出 KTPM 越高。

快取命中率(%)

請求中重複首碼被快取命中的比例。實際命中率取決於請求內容的重複程度,以運行結果為準。

命中率越高,輸入容量消耗越慢,建議購買輸入 KTPM 越低。僅影響輸入 KTPM,不影響輸出 KTPM。

API 響應欄位說明

PTU 部署的 API 響應包含以下額度相關欄位,用於標識計費方式和額度消耗:

欄位

類型

說明

service_tier

String

響應體頂層欄位(所有 API 格式一致)。值為 ptu-standard 表示使用 PTU 額度;值為 default 或不返回表示隨用隨付

provisioned_tokens

Integer

折算後實際消耗的 PTU 額度 token 數(已含階梯係數和緩衝折扣)

cached_tokens

Integer

首碼快取命中的 token 數,詳見上下文緩衝

不同 API 格式下上述欄位的 JSON 路徑存在差異:

OpenAI Chat 相容

欄位

JSON 路徑

說明

cached_tokens

usage.prompt_tokens_details.cached_tokens

輸入側快取命中數

provisioned_tokens

usage.prompt_tokens_details.provisioned_tokens

輸入側 PTU 額度消耗

provisioned_tokens

usage.completion_tokens_details.provisioned_tokens

輸出側 PTU 額度消耗

OpenAI Responses

欄位

JSON 路徑

說明

cached_tokens

usage.input_tokens_details.cached_tokens

輸入側快取命中數

provisioned_tokens

usage.input_tokens_details.provisioned_tokens

輸入側 PTU 額度消耗

provisioned_tokens

usage.output_tokens_details.provisioned_tokens

輸出側 PTU 額度消耗

Anthropic 相容

欄位

JSON 路徑

說明

provisioned_tokens

usage.prompt_tokens_details.provisioned_tokens

輸入側 PTU 額度消耗

provisioned_tokens

usage.output_tokens_details.provisioned_tokens

輸出側 PTU 額度消耗

說明Anthropic 相容格式暫不返回 cached_tokens 欄位,可通過 provisioned_tokens 間接判斷緩衝效果。

DashScope

欄位

JSON 路徑

說明

cached_tokens

usage.prompt_tokens_details.cached_tokens

輸入側快取命中數

provisioned_tokens

usage.prompt_tokens_details.provisioned_tokens

輸入側 PTU 額度消耗

provisioned_tokens

usage.completion_tokens_details.provisioned_tokens

輸出側 PTU 額度消耗

各欄位的完整定義和取值範圍,請參見API 參考文檔

監控與驗證

PTU 部署的運行監控通過百鍊平台的模型監控功能實現,支援查看以下與長輸入和緩衝相關的指標:

  • PTU 利用率:輸入/輸出/思考模式輸出三條獨立曲線。長輸入情境下階梯係數會使利用率超過 100%,屬於正常現象。
  • Token 用量與快取命中:包含 cached_tokens 資料數列,可查看快取命中量佔總輸入的比例。
  • 配額內/外調用次數:瞭解超出 PTU 額度後的請求佔比(自動溢出策略下轉為隨用隨付,僅使用 PTU 容量策略下返回 429)。

更多監控指標和操作方式,請參見模型監控

常見問題

Q: 超出 PTU 額度時會怎樣?

取決於建立時選擇的溢出策略:「自動溢出」策略下,請求自動轉為隨用隨付,API 響應中 service_tier 欄位不返回或返回 default,同時回應標頭包含 x-dashscope-ptu-overflow:true,業務不會中斷;「僅使用 PTU 容量」策略下,超出請求返回 429 錯誤,不產生額外費用。

Q: 單次輸入超過模型上限時會怎樣?

千問系列模型輸入上限為 128K token,DeepSeek 系列為 64K token。超過上限的請求同樣自動轉為隨用隨付。

Q: 如何確認緩衝是否生效?

檢查 API 響應中 cached_tokens 欄位,值大於 0 表示首碼快取命中。快取命中部分按模型對應的折扣係數消耗額度(具體折扣率見額度消耗規則)。也可在控制台監控頁面的 Token 用量圖表中查看趨勢。

Q: cached_tokens 始終為 0,緩衝未生效怎麼辦?

常見原因:請求間的輸入首碼不一致(如 System Message 變化)、兩次請求間隔超過緩衝有效期間、輸入 token 數不足以觸發緩衝。排查方法和緩衝使用限制詳見上下文緩衝

Q: 利用率為什麼超過 100%?

部分模型(如 glm-5.1)的長輸入階梯係數使實際額度消耗高於原始 token 數。利用率 = 折算後消耗 ÷ 購買額度。超過 100% 表示消耗速度超過購買額度,超出部分按溢出策略處理(自動溢出則轉為隨用隨付、不影響服務可用性;僅使用 PTU 容量則返回 429)。