全部產品
Search
文件中心

Alibaba Cloud Model Studio:Token 按量部署

更新時間:Sep 23, 2026

按模型 Token 使用量計費的部署方式,僅支援 LoRA 微調模型,不使用不計費,適用於調優後模型效果驗證及對併發和延遲要求不高的低成本場景。

概述

按 Token 用量計費(不使用不計費),僅支援部分經過 LoRA 高效微調的模型,適用於調優後模型效果驗證及對併發和延遲要求不高的低成本場景。該模式下吞吐量/併發量和生成速度均由平台預設,使用者不可調整。

說明計費方式在服務建立後無法變更。如需切換,必須下線已部署模型後重新部署,詳見模型部署簡介。

計費規則

费用 = 模型输入 Token 数 × 模型输入单价 + 模型输出 Token 数 × 模型输出单价(最小计费单位:1 token)

  • 僅當對下列基礎模型完成 SFT 高效訓練(即 LoRA 高效微調,API 部署時 plan 取值為 lora)並得到自訂模型後,才支援按模型 Token 使用量計費。

支援模型與價格

新加坡

基礎模型

模型代碼

輸入

$/百萬 Token

輸出

$/百萬 Token

Qwen3-14B

qwen3-14b

非思考模式:$0.35

思考模式:$0.35

非思考模式:$1.4

思考模式:$4.2

北京

基礎模型

模型代碼

輸入

$/百萬 Token

輸出

$/百萬 Token

Qwen3-14B

qwen3-14b

非思考模式:$0.144

思考模式:$0.144

非思考模式:$0.574

思考模式:$1.434

LoRA 部署

Token 按量部署僅支援 LoRA 微調模型,API 建立時 plan 取值為 lora。capacity 參數設定無效但必須填寫;如需擴縮容,請前往百煉专属部署控制台填寫表單申請。

透過 API 建立部署的完整範例見API 部署指南。

擴容

按 Token 用量計費的部署,擴容需在控制台提交申請表單,等待人工審核,不支援自助擴縮容。

常見問題

Q: 一個月不使用會怎樣?

按 Token 用量計費的部署,一個月內不使用將自動釋放。

Q: 如何切換到其他計費方式?

只能下線原有資源,再透過需要的計費方式建立新資源。詳見模型部署簡介。