全部产品
Search
文档中心

大模型服务平台百炼:Token 按量部署

更新时间:Sep 16, 2026

按模型 Token 使用量计费的部署方式,仅支持 LoRA 微调模型,不使用不计费,适用于调优后模型效果验证及对并发和延迟要求不高的低成本场景。

概述

按 Token 用量计费(不使用不计费),仅支持部分经过 LoRA 高效微调的模型,适用于调优后模型效果验证及对并发和延迟要求不高的低成本场景。该模式下吞吐/并发和生成速度均由平台预置,用户不可调。

说明计费方式在服务创建后无法更改。如需切换,必须下线已部署模型后重新部署,详见模型部署简介

计费规则

费用 = 模型输入 Token 数 × 模型输入单价 + 模型输出 Token 数 × 模型输出单价(最小计费单位:1 token)

  • 仅当对下列基础模型完成 SFT 高效训练(即 LoRA 高效微调,API 部署时 plan 取值为 lora)并得到自定义模型后,才支持按模型 Token 使用量计费。

支持模型与价格

新加坡

基础模型

模型代码

输入

$/百万Token

输出

$/百万Token

Qwen3-14B

qwen3-14b

非思考模式:$0.35

思考模式:$0.35

非思考模式:$1.4

思考模式:$4.2

北京

基础模型

模型代码

输入

$/百万Token

输出

$/百万Token

Qwen3-14B

qwen3-14b

非思考模式:$0.144

思考模式:$0.144

非思考模式:$0.574

思考模式:$1.434

LoRA 部署

Token 按量部署仅支持 LoRA 微调模型,API 创建时 plan 取值为 loracapacity 参数设置无效但必须填写;如需扩缩容,请前往百炼专属部署控制台填写表单申请。

通过 API 创建部署的完整示例见API 部署指南

扩容

按 Token 用量计费的部署,扩容需在控制台提交申请表单,等待人工审核,不支持自助扩缩容。

常见问题

Q: 一个月不使用会怎样?

按 Token 用量计费的部署,一个月内不使用将自动释放。

Q: 如何切换到其他计费方式?

只能下线原有资源,再通过需要的计费方式创建新资源。详见模型部署简介