按模型 Token 使用量計費的部署方式,僅支援 LoRA 微調模型,不使用不計費,適用於調優後模型效果驗證及對併發和延遲要求不高的低成本場景。
概述
按 Token 用量計費(不使用不計費),僅支援部分經過 LoRA 高效微調的模型,適用於調優後模型效果驗證及對併發和延遲要求不高的低成本場景。該模式下吞吐量/併發量和生成速度均由平台預設,使用者不可調整。
說明計費方式在服務建立後無法變更。如需切換,必須下線已部署模型後重新部署,詳見模型部署簡介。
計費規則
费用 = 模型输入 Token 数 × 模型输入单价 + 模型输出 Token 数 × 模型输出单价(最小计费单位:1 token)
- 僅當對下列基礎模型完成 SFT 高效訓練(即 LoRA 高效微調,API 部署時 plan 取值為 lora)並得到自訂模型後,才支援按模型 Token 使用量計費。
支援模型與價格
新加坡
基礎模型 | 模型代碼 | 輸入 $/百萬 Token | 輸出 $/百萬 Token |
|---|---|---|---|
Qwen3-14B | qwen3-14b | 非思考模式:$0.35 思考模式:$0.35 | 非思考模式:$1.4 思考模式:$4.2 |
北京
基礎模型 | 模型代碼 | 輸入 $/百萬 Token | 輸出 $/百萬 Token |
|---|---|---|---|
Qwen3-14B | qwen3-14b | 非思考模式:$0.144 思考模式:$0.144 | 非思考模式:$0.574 思考模式:$1.434 |
LoRA 部署
Token 按量部署僅支援 LoRA 微調模型,API 建立時 plan 取值為 lora。capacity 參數設定無效但必須填寫;如需擴縮容,請前往百煉专属部署控制台填寫表單申請。
透過 API 建立部署的完整範例見API 部署指南。
擴容
按 Token 用量計費的部署,擴容需在控制台提交申請表單,等待人工審核,不支援自助擴縮容。
常見問題
Q: 一個月不使用會怎樣?
按 Token 用量計費的部署,一個月內不使用將自動釋放。
Q: 如何切換到其他計費方式?
只能下線原有資源,再透過需要的計費方式建立新資源。詳見模型部署簡介。