本文介紹 PTU(預置吞吐)部署的長輸入和首碼緩衝能力,包括額度消耗規則、 預置吞吐額度計算機 使用方法和 API 響應欄位說明。
功能概述
PTU 部署支援長輸入請求(部分模型最高 200K token)和首碼緩衝,通過階梯容量係數和緩衝折扣靈活管理額度消耗。
核心能力:
- 長輸入支援:部分模型支援超過 32K token 的輸入,超出部分按更高的階梯係數折算 TPM(每分鐘 Token 數)消耗,詳見額度消耗規則。
- 首碼緩衝優惠:部分模型支援首碼緩衝,命中緩衝的輸入 token 按折扣係數消耗額度(具體折扣率因模型而異),可降低多輪對話和重複首碼情境的額度消耗。
- 溢出策略:建立 PTU 時可選——自動溢出至隨用隨付(預設,業務不中斷)或僅使用 PTU 容量(超出返回 429、不產生額外費用)。輸入超過模型上限(千問 128K / DeepSeek 64K)仍自動轉為隨用隨付。
重要自動溢出策略下轉為隨用隨付後,費用按對應模型的隨用隨付單價計算(僅使用 PTU 容量策略下超出返回 429、不產生額外費用)。建議通過預置吞吐額度計算機合理規劃 PTU 額度,避免意外費用。
常見於長文件剖析(合約、研報摘要)和多輪對話(客服、編程助手)等輸入超 32K token 的情境。
關於 PTU 部署的基礎概念和購買方式,請參見模型部署簡介。關於首碼緩衝的工作原理,請參見上下文緩衝。
額度消耗規則
長輸入階梯係數和緩衝折扣按模型不同,以下為當前支援的模型參數:
模型 | 輸入長度上限 | 緩衝折扣 | 長輸入階梯係數 |
|---|---|---|---|
qwen3.8-Max | 1 Million | 0.125(快取命中部分按 12.5% 折算容量) | 無階梯(1.0) |
qwen3.7-plus-2026-05-26 | 1 Million | 0.2(快取命中部分按 20% 折算容量) | 無階梯(1.0) |
qwen3.7-flash-2026-07-15 | 1 Million | 0.2(快取命中部分按 20% 折算容量) | [0, 32K):輸入 1.0 / 輸出 1.0 (256K, 1Million]:輸入 6.0 / 輸出 6.0 |
glm-5.2 | 1 Million | 0.25(快取命中部分按 25% 折算容量) | 無階梯(1.0) |
glm-5.1 | 200K | 0.2(快取命中部分按 20% 折算容量) | [0, 32K):輸入 1.0 / 輸出 1.0 |
deepseek-v4-pro | 256K | 0.08(快取命中部分按 8% 折算容量) | 無階梯(1.0) |
deepseek-v4-flash-0731 | 1 Million | 0.2(快取命中部分按 20% 折算容量) | 無階梯(1.0) |
其他模型 | 以控制台為準 | 以控制台為準 | 無階梯(1.0) |
計算樣本(以 glm-5.1 為例)
情境 1:短輸入(10K token,無緩衝)
輸入消耗:10K × 1.0 = 10KTPM
情境 2:長輸入(50K token,無緩衝)
輸入消耗:32K × 1.0 + 18K × 1.33 = 55.94 KTPM
輸出消耗(假設 1K token):1K × 1.17 = 1.17 KTPM
情境 3:長輸入 + 快取命中(50K token,前 30K 命中緩衝)
緩衝部分輸入(前 30K,均在 [0,32K) 階梯內):
30K × 1.0 × 0.2 = 6 KTPM
非緩衝部分輸入(後 20K):
2K × 1.0 + 18K × 1.33 = 25.94 KTPM
輸入合計 = 31.940 KTPM(比無緩衝節省 43%)
使用預置吞吐額度計算機估算額度
說明建議在建立或擴容前使用計算機評估長輸入情境的額度需求,避免額度不足導致請求轉為隨用隨付。購買上限以控制台實際展示為準。
前提條件:已開通百鍊服務並具備 PTU 部署許可權。登入百鍊控制台,在模型部署 > 建立部署頁面(或在已有部署詳情頁單擊擴容),選擇可部署的PTU(預置吞吐)模型後,展開預置吞吐額度計算機。
預置吞吐額度計算機根據業務負載自動推薦額度。填寫以下參數後,計算機輸出建議購買的輸入 KTPM 和輸出 KTPM。
參數 | 說明 | 對結果的影響 |
|---|---|---|
每分鐘請求數(RPM) | 業務高峰期每分鐘的請求數。 | RPM 越大,建議購買輸入 KTPM 和輸出 KTPM 同比增大。 |
平均輸入長度(token) | 每條請求的平均輸入 token 數。 | 輸入越長,所處階梯越高,係數越大,建議購買輸入 KTPM 越高。不同模型的階梯邊界不同,以控制台實際展示為準。 |
平均輸出長度(token) | 每條請求的平均輸出 token 數。 | 輸出越長,係數可能越大,建議購買輸出 KTPM 越高。 |
快取命中率(%) | 請求中重複首碼被快取命中的比例。實際命中率取決於請求內容的重複程度,以運行結果為準。 | 命中率越高,輸入容量消耗越慢,建議購買輸入 KTPM 越低。僅影響輸入 KTPM,不影響輸出 KTPM。 |
API 響應欄位說明
PTU 部署的 API 響應包含以下額度相關欄位,用於標識計費方式和額度消耗:
欄位 | 類型 | 說明 |
|---|---|---|
| String | 響應體頂層欄位(所有 API 格式一致)。值為 |
| Integer | 折算後實際消耗的 PTU 額度 token 數(已含階梯係數和緩衝折扣) |
| Integer | 首碼快取命中的 token 數,詳見上下文緩衝 |
不同 API 格式下上述欄位的 JSON 路徑存在差異:
OpenAI Chat 相容
欄位 | JSON 路徑 | 說明 |
|---|---|---|
|
| 輸入側快取命中數 |
|
| 輸入側 PTU 額度消耗 |
|
| 輸出側 PTU 額度消耗 |
OpenAI Responses
欄位 | JSON 路徑 | 說明 |
|---|---|---|
|
| 輸入側快取命中數 |
|
| 輸入側 PTU 額度消耗 |
|
| 輸出側 PTU 額度消耗 |
Anthropic 相容
欄位 | JSON 路徑 | 說明 |
|---|---|---|
|
| 輸入側 PTU 額度消耗 |
|
| 輸出側 PTU 額度消耗 |
說明Anthropic 相容格式暫不返回 cached_tokens 欄位,可通過 provisioned_tokens 間接判斷緩衝效果。
DashScope
欄位 | JSON 路徑 | 說明 |
|---|---|---|
|
| 輸入側快取命中數 |
|
| 輸入側 PTU 額度消耗 |
|
| 輸出側 PTU 額度消耗 |
各欄位的完整定義和取值範圍,請參見API 參考文檔。
監控與驗證
PTU 部署的運行監控通過百鍊平台的模型監控功能實現,支援查看以下與長輸入和緩衝相關的指標:
- PTU 利用率:輸入/輸出/思考模式輸出三條獨立曲線。長輸入情境下階梯係數會使利用率超過 100%,屬於正常現象。
- Token 用量與快取命中:包含
cached_tokens資料數列,可查看快取命中量佔總輸入的比例。 - 配額內/外調用次數:瞭解超出 PTU 額度後的請求佔比(自動溢出策略下轉為隨用隨付,僅使用 PTU 容量策略下返回 429)。
更多監控指標和操作方式,請參見模型監控。
常見問題
Q: 超出 PTU 額度時會怎樣?
取決於建立時選擇的溢出策略:「自動溢出」策略下,請求自動轉為隨用隨付,API 響應中 service_tier 欄位不返回或返回 default,同時回應標頭包含 x-dashscope-ptu-overflow:true,業務不會中斷;「僅使用 PTU 容量」策略下,超出請求返回 429 錯誤,不產生額外費用。
Q: 單次輸入超過模型上限時會怎樣?
千問系列模型輸入上限為 128K token,DeepSeek 系列為 64K token。超過上限的請求同樣自動轉為隨用隨付。
Q: 如何確認緩衝是否生效?
檢查 API 響應中 cached_tokens 欄位,值大於 0 表示首碼快取命中。快取命中部分按模型對應的折扣係數消耗額度(具體折扣率見額度消耗規則)。也可在控制台監控頁面的 Token 用量圖表中查看趨勢。
Q: cached_tokens 始終為 0,緩衝未生效怎麼辦?
常見原因:請求間的輸入首碼不一致(如 System Message 變化)、兩次請求間隔超過緩衝有效期間、輸入 token 數不足以觸發緩衝。排查方法和緩衝使用限制詳見上下文緩衝。
Q: 利用率為什麼超過 100%?
部分模型(如 glm-5.1)的長輸入階梯係數使實際額度消耗高於原始 token 數。利用率 = 折算後消耗 ÷ 購買額度。超過 100% 表示消耗速度超過購買額度,超出部分按溢出策略處理(自動溢出則轉為隨用隨付、不影響服務可用性;僅使用 PTU 容量則返回 429)。