PAI Token服务提供开源和闭源大模型的调用能力,并无缝集成于PAI模型评测、模型蒸馏、DSW、FeatureStore、多模态数据处理等产品能力中,按Token用量计费。
PAI Token 服务开通
服务开通条件:
主账号:可直接开通服务。
RAM账号:可通过如下方式使用服务。
方式一:联系主账号,或具有
AliyunPAIFullAccess权限策略或modelservice:*权限的账号开通服务,开通后RAM账号即可使用。方式二:被授予
AliyunPAIFullAccess权限策略或modelservice:*权限后,RAM账号即可开通服务。
服务开通方式:
登录PAI控制台,在左侧菜单栏单击快速开始 > Token服务,然后单击立即开通。
计费规则
开通PAI Token服务时默认同步开通按量付费(后付费)功能,按用户输入和输出的Token数目计费,即按实际用量结算费用,先使用,后付费。
计费规则:按量费用 = 输入 Token 数量 × 输入单价 + 输出 Token 数量 × 输出单价
缓存折扣:针对命中上下文缓存的请求,其输入Token享有折扣,详见附录:上下文缓存折扣
文本生成-千问
千问Max
计费规则:按输入Token和输出Token计费。
华北2(北京)
模型 ID(Model ID) | 模式 | 单次请求的输入Token数 | 输入单价(每百万Token) | 输出单价(每百万Token) 思维链+回答 |
qwen3.8-max | 非思考和思考模式 | 0<Token≤1M | $1.98 | $5.9412 |
qwen3.7-max | 非思考和思考模式 | 0<Token≤1M | $1.98 | $5.9412 |
新加坡
模型 ID(Model ID) | 服务部署范围 | 模式 | 单次请求的输入Token数 | 输入单价(每百万Token) | 输出单价(每百万Token) 思维链+回答 |
qwen3.8-max | 国际 | 非思考和思考模式 | 0<Token≤1M | $2.4 | $7.2 |
qwen3.7-max | 国际 | 非思考和思考模式 | 0<Token≤1M | $3 | $9 |
德国(法兰克福)
模型 ID(Model ID) | 服务部署范围 | 模式 | 单次请求的输入Token数 | 输入单价(每百万Token) | 输出单价(每百万Token) 思维链+回答 |
qwen3.8-max | 全球 | 非思考和思考模式 | 0<Token≤1M | $1.98 | $5.9412 |
qwen3.7-max | 全球 | 非思考和思考模式 | 0<Token≤1M | $1.98 | $5.9412 |
日本(东京)
模型 ID(Model ID) | 服务部署范围 | 模式 | 单次请求的输入Token数 | 输入单价(每百万Token) | 输出单价(每百万Token) 思维链+回答 |
qwen3.8-max | 全球 | 非思考和思考模式 | 0<Token≤1M | $1.98 | $5.9412 |
qwen3.7-max | 全球 | 非思考和思考模式 | 0<Token≤1M | $1.98 | $5.9412 |
千问Plus
计费规则:按输入Token和输出Token计费。
华北2(北京)
模型 ID(Model ID) | 单次请求的输入Token范围 | 输入单价(每百万Token) | 输出单价(每百万Token) | |
非思考模式 | 思考模式(思维链+回答) | |||
qwen3.7-plus | 0<Token≤256K | $0.3444 | $1.3764 | $1.3764 |
256K<Token≤1M | $1.032 | $4.128 | $4.128 | |
qwen3.6-plus | 0<Token≤256K | $0.3312 | $1.9812 | $1.9812 |
256K<Token≤1M | $1.3212 | $7.9224 | $7.9224 | |
qwen3.5-plus | 0<Token≤128K | $0.138 | $0.8256 | $0.8256 |
128K<Token≤256K | $0.3444 | $2.064 | $2.064 | |
256K<Token≤1M | $0.6876 | $4.128 | $4.128 | |
新加坡
模型 ID(Model ID) | 服务部署范围 | 单次请求的输入Token范围 | 输入单价 (每百万Token) | 输出单价 (每百万Token) | |
非思考模式 | 思考模式(思维链+回答) | ||||
qwen3.7-plus | 国际 | 0<Token≤256K | $0.48 | $1.92 | $1.92 |
256K<Token≤1M | $1.44 | $5.76 | $5.76 | ||
qwen3.6-plus | 国际 | 0<Token≤256K | $0.6 | $3.6 | $3.6 |
256K<Token≤1M | $2.4 | $7.2 | $7.2 | ||
qwen3.5-plus | 国际 | 0<Token≤256K | $0.48 | $2.88 | $2.88 |
256K<Token≤1M | $0.6 | $3.6 | $3.6 | ||
德国(法兰克福)
模型 ID(Model ID) | 服务部署范围 | 单次请求的输入Token范围 | 输入单价(每百万Token) | 输出单价(每百万Token) | |
非思考模式 | 思考模式(思维链+回答) | ||||
qwen3.7-plus | 全球 | 0<Token≤256K | $0.3444 | $1.3764 | $1.3764 |
256K<Token≤1M | $1.032 | $4.128 | $4.128 | ||
qwen3.6-plus | 全球 | 0<Token≤256K | $0.3312 | $1.9812 | $1.9812 |
256K<Token≤1M | $1.3212 | $7.9224 | $7.9224 | ||
qwen3.5-plus | 全球 | 0<Token≤128K | $0.138 | $0.8256 | $0.8256 |
128K<Token≤256K | $0.3444 | $2.064 | $2.064 | ||
256K<Token≤1M | $0.6876 | $4.128 | $4.128 | ||
日本(东京)
模型 ID(Model ID) | 服务部署范围 | 单次请求的输入Token范围 | 输入单价(每百万Token) | 输出单价(每百万Token) | |
非思考模式 | 思考模式(思维链+回答) | ||||
qwen3.7-plus | 全球 | 0<Token≤256K | $0.3444 | $1.3764 | $1.3764 |
256K<Token≤1M | $1.032 | $4.128 | $4.128 | ||
qwen3.6-plus | 全球 | 0<Token≤256K | $0.3312 | $1.9812 | $1.9812 |
256K<Token≤1M | $1.3212 | $7.9224 | $7.9224 | ||
千问Flash
计费规则:按输入Token和输出Token计费。
华北2(北京)
模型 ID(Model ID) | 模式 | 单次请求的输入Token数 | 输入单价(每百万Token) | 输出单价(每百万Token) 思维链+回答 |
qwen3.7-flash | 非思考和思考模式 | 0<Token≤32K | $0.0336 | $0.132 |
32K<Token≤256K | $0.0996 | $0.396 | ||
256K<Token≤1M | $0.198 | $0.792 | ||
qwen3.6-flash | 非思考和思考模式 | 0<Token≤256K | $0.198 | $1.188 |
256K<Token≤1M | $0.792 | $4.7532 | ||
qwen3.5-flash | 非思考和思考模式 | 0<Token≤128K | $0.0348 | $0.3444 |
128K<Token≤256K | $0.138 | $1.3764 | ||
256K<Token≤1M | $0.2064 | $2.064 |
新加坡
模型 ID(Model ID) | 服务部署范围 | 模式 | 单次请求的输入Token数 | 输入单价(每百万Token) | 输出单价(每百万Token) 思维链+回答 |
qwen3.7-flash | 国际 | 非思考和思考模式 | 0<Token≤32K | $0.036 | $0.156 |
32K<Token≤256K | $0.12 | $0.48 | |||
256K<Token≤1M | $0.24 | $0.96 | |||
qwen3.6-flash | 国际 | 非思考和思考模式 | 0<Token≤256K | $0.3 | $1.8 |
256K<Token≤1M | $1.2 | $4.8 | |||
qwen3.5-flash | 国际 | 非思考和思考模式 | 0<Token≤1M | $0.12 | $0.48 |
德国(法兰克福)
模型 ID(Model ID) | 服务部署范围 | 模式 | 单次请求的输入Token数 | 输入单价(每百万Token) | 输出单价(每百万Token) 思维链+回答 |
qwen3.7-flash | 全球 | 非思考和思考模式 | 0<Token≤32K | $0.0336 | $0.132 |
32K<Token≤256K | $0.0996 | $0.396 | |||
256K<Token≤1M | $0.198 | $0.792 | |||
qwen3.6-flash | 全球 | 非思考和思考模式 | 0<Token≤256K | $0.198 | $1.188 |
256K<Token≤1M | $0.792 | $4.7532 | |||
qwen3.5-flash | 全球 | 非思考和思考模式 | 0<Token≤128K | $0.0348 | $0.3444 |
128K<Token≤256K | $0.138 | $1.3764 | |||
256K<Token≤1M | $0.2064 | $2.064 |
日本(东京)
模型 ID(Model ID) | 服务部署范围 | 模式 | 单次请求的输入Token数 | 输入单价(每百万Token) | 输出单价(每百万Token) 思维链+回答 |
qwen3.7-flash | 全球 | 非思考和思考模式 | 0<Token≤32K | $0.0336 | $0.132 |
32K<Token≤256K | $0.0996 | $0.396 | |||
256K<Token≤1M | $0.198 | $0.792 | |||
qwen3.6-flash | 全球 | 非思考和思考模式 | 0<Token≤256K | $0.198 | $1.188 |
256K<Token≤1M | $0.792 | $4.7532 |
千问Omni
计费规则:按输入Token和输出Token计费。
华北2(北京)
模型 ID(Model ID) | 输入单价(每百万Token) | 输出单价(每百万Token) | ||
文本/图片/视频 | 音频 | 文本 多模态输入 | 文本+音频 仅音频计费 | |
qwen3.5-omni-plus | $1.152 | $8.748 | $6.6 | $35.148 |
qwen3.5-omni-flash | $0.36 | $2.976 | $2.196 | $11.88 |
新加坡
模型 ID(Model ID) | 服务部署范围 | 输入单价(每百万Token) | 输出单价(每百万Token) | ||
文本/图片/视频 | 音频 | 文本 多模态输入 | 文本+音频 仅音频计费 | ||
qwen3.5-omni-plus | 国际 | $1.68 | $13.2 | $9.96 | $52.8 |
qwen3.5-omni-flash | 国际 | $0.48 | $3.6 | $2.64 | $14.28 |
文本生成-第三方模型
DeepSeek
计费规则:按输入Token和输出Token计费。
华北2(北京)
模型 ID(Model ID) | 输入单价(每百万Token) | 输出单价(每百万Token) 思维链+回答 |
deepseek-v4-pro | $1.98 | $3.9612 |
deepseek-v4-flash-0731 | $0.1656 | $0.33 |
deepseek-v4-flash | $0.1656 | $0.33 |
新加坡
模型 ID(Model ID) | 服务部署范围 | 输入单价(每百万Token) | 输出单价(每百万Token) 思维链+回答 |
deepseek-v4-pro | 国际 | $2.88 | $5.76 |
deepseek-v4-flash-0731 | 国际 | $0.24 | $0.48 |
deepseek-v4-flash | 国际 | $0.24 | $0.48 |
德国(法兰克福)
模型 ID(Model ID) | 服务部署范围 | 输入单价(每百万Token) | 输出单价(每百万Token) 思维链+回答 |
deepseek-v4-pro | 全球 | $1.98 | $3.9612 |
deepseek-v4-flash-0731 | 全球 | $0.1656 | $0.33 |
deepseek-v4-flash | 全球 | $0.1656 | $0.33 |
日本(东京)
模型 ID(Model ID) | 服务部署范围 | 输入单价(每百万Token) | 输出单价(每百万Token) 思维链+回答 |
deepseek-v4-pro | 全球 | $1.98 | $3.9612 |
deepseek-v4-flash-0731 | 全球 | $0.1656 | $0.33 |
deepseek-v4-flash | 全球 | $0.1656 | $0.33 |
Kimi
计费规则:按输入Token和输出Token计费。
华北2(北京)
模型 ID(Model ID) | 模式 | 输入单价(每百万Token) | 输出单价(每百万Token) |
kimi-k2.7-code | 仅思考模式 | $1.0728 | $4.4556 |
kimi-k2.6 | 非思考和思考模式 | $1.07268 | $4.45572 |
新加坡
模型 ID(Model ID) | 服务部署范围 | 模式 | 输入单价(每百万Token) | 输出单价(每百万Token) |
kimi-k2.7-code | 国际 | 仅思考模式 | $1.14 | $4.8 |
德国(法兰克福)
模型 ID(Model ID) | 服务部署范围 | 模式 | 输入单价(每百万Token) | 输出单价(每百万Token) |
kimi-k2.7-code | 全球 | 仅思考模式 | $1.0728 | $4.4556 |
GLM
计费规则:按输入Token和输出Token计费。
华北2(北京)
模型 ID(Model ID) | 模式 | 单次请求的输入Token数 | 输入单价(每百万Token) | 输出单价(每百万Token) 思维链和回答 |
glm-5.2 | 非思考和思考模式 | 不区分阶梯 | $1.32 | $4.6212 |
glm-5.1 | 非思考和思考模式 | 0<Token≤32K | $0.99 | $3.9612 |
32K<Token≤200K | $1.32 | $4.6212 | ||
glm-5 | 非思考和思考模式 | 0<Token≤32K | $0.6876 | $3.096 |
32K<Token≤198K | $1.032 | $3.7848 |
新加坡
模型 ID(Model ID) | 服务部署范围 | 模式 | 单次请求的输入Token数 | 输入单价(每百万Token) | 输出单价(每百万Token) 思维链和回答 |
glm-5.2 | 国际 | 非思考和思考模式 | 不区分阶梯 | $1.68 | $5.28 |
glm-5.1 | 国际 | 非思考和思考模式 | 0<Token≤200K | $1.68 | $5.28 |
德国(法兰克福)
模型 ID(Model ID) | 服务部署范围 | 模式 | 单次请求的输入Token数 | 输入单价(每百万Token) | 输出单价(每百万Token) 思维链和回答 |
glm-5.2 | 全球 | 非思考和思考模式 | 不区分阶梯 | $1.32 | $4.6212 |
glm-5.1 | 全球 | 非思考和思考模式 | 0<Token≤32K | $0.99 | $3.9612 |
32K<Token≤200K | $1.32 | $4.6212 |
日本(东京)
模型 ID(Model ID) | 服务部署范围 | 模式 | 单次请求的输入Token数 | 输入单价(每百万Token) | 输出单价(每百万Token) 思维链和回答 |
glm-5.1 | 全球 | 非思考和思考模式 | 0<Token≤32K | $0.99 | $3.9612 |
32K<Token≤200K | $1.32 | $4.6212 |
图像生成
计费规则:按输入图像和成功生成的 图像张数 计费。未说明输入图像价格的模型,输入不计费,仅输出计费。
计费公式:费用 = 输入图像单价 × 输入的图像张数 + 输出图像单价 × 输出的图像张数。
千问图像生成与编辑
按输入输出的图像张数计费
华北2(北京)
模型 ID(Model ID) | 输出图像分辨率 | 输入单价 | 输出单价 |
qwen-image-3.0-pro | 1k | $0.0033/张 | $0.041256/张 |
2k | $0.0825132/张 | ||
qwen-image-3.0 | 1k | $0.0033/张 | $0.0297048/张 |
2k | $0.0297048/张 |
新加坡
模型 ID(Model ID) | 服务部署范围 | 输出图像分辨率 | 输入单价 | 输出单价 |
qwen-image-3.0-pro | 国际 | 1k | $0.0036/张 | $0.048/张 |
2k | $0.09/张 | |||
qwen-image-3.0 | 国际 | 1k | $0.0036/张 | $0.036/张 |
2k | $0.036/张 |
德国(法兰克福)
模型 ID(Model ID) | 服务部署范围 | 输出图像分辨率 | 输入单价 | 输出单价 |
qwen-image-3.0-pro | 全球 | 1k | $0.0033/张 | $0.041256/张 |
2k | $0.0825132/张 | |||
qwen-image-3.0 | 全球 | 1k | $0.0033/张 | $0.0297048/张 |
2k | $0.0297048/张 |
日本(东京)
模型 ID(Model ID) | 服务部署范围 | 输出图像分辨率 | 输入单价 | 输出单价 |
qwen-image-3.0-pro | 全球 | 1k | $0.0033/张 | $0.041256/张 |
2k | $0.0825132/张 | |||
qwen-image-3.0 | 全球 | 1k | $0.0033/张 | $0.0297048/张 |
2k | $0.0297048/张 |
千问文生图
仅输出计费
华北2(北京)
模型 ID(Model ID) | 输出单价 |
qwen-image-2.0-pro | $0.0860112/张 |
qwen-image-2.0 | $0.0344052/张 |
新加坡
模型 ID(Model ID) | 服务部署范围 | 输出单价 |
qwen-image-2.0-pro | 国际 | $0.09/张 |
qwen-image-2.0 | 国际 | $0.042/张 |
视频生成
计费规则:输入不计费,输出计费。输出按成功生成的 视频秒数 计费。
计费公式:费用 = 视频单价 × 输出的视频时长(单位:秒)。
HappyHorse-文生视频
仅输出计费
华北2(北京)
模型 ID(Model ID) | 输出视频分辨率 | 输出单价 |
happyhorse-1.1-t2v | 480P | $0.074262/秒 |
720P | $0.1485228/秒 | |
1080P | $0.1980312/秒 |
新加坡
模型 ID(Model ID) | 服务部署范围 | 输出视频分辨率 | 输出单价 |
happyhorse-1.1-t2v | 国际 | 480P | $0.084/秒 |
720P | $0.168/秒 | ||
1080P | $0.216/秒 |
德国(法兰克福)
模型 ID(Model ID) | 服务部署范围 | 输出视频分辨率 | 输出单价 |
happyhorse-1.1-t2v | 全球 | 480P | $0.074262/秒 |
720P | $0.1485228/秒 | ||
1080P | $0.1980312/秒 |
HappyHorse-图生视频-基于首帧
仅输出计费
华北2(北京)
模型 ID(Model ID) | 输出视频分辨率 | 输出单价 |
happyhorse-1.1-i2v | 480P | $0.074262/秒 |
720P | $0.1485228/秒 | |
1080P | $0.1980312/秒 |
新加坡
模型 ID(Model ID) | 服务部署范围 | 输出视频分辨率 | 输出单价 |
happyhorse-1.1-i2v | 国际 | 480P | $0.084/秒 |
720P | $0.168/秒 | ||
1080P | $0.216/秒 |
德国(法兰克福)
模型 ID(Model ID) | 服务部署范围 | 输出视频分辨率 | 输出单价 |
happyhorse-1.1-i2v | 全球 | 480P | $0.074262/秒 |
720P | $0.1485228/秒 | ||
1080P | $0.1980312/秒 |
万相3.0-视频生成
计费规则:输入视频和输出视频均计费,按视频秒数计费。
计费公式:计费时长 = 输入视频时长 + 输出视频时长。
华北2(北京)
模型 ID(Model ID) | 输出视频分辨率 | 输入和输出单价 |
wan3.0-video | 480P | $0.0495072/秒 |
720P | $0.0990156/秒 | |
1080P | $0.19803/秒 |
新加坡
模型 ID(Model ID) | 服务部署范围 | 输出视频分辨率 | 输入和输出单价 |
wan3.0-video | 国际 | 480P | $0.06/秒 |
720P | $0.12/秒 | ||
1080P | $0.24/秒 |
万相-文生视频
仅输出计费
华北2(北京)
模型 ID(Model ID) | 输出视频分辨率 | 输出单价 |
wan2.7-t2v | 720P | $0.1032144/秒 |
1080P | $0.1720236/秒 |
新加坡
模型 ID(Model ID) | 服务部署范围 | 输出视频分辨率 | 输出单价 |
wan2.7-t2v | 国际 | 720P | $0.12/秒 |
1080P | $0.18/秒 |
万相-图生视频
仅输出计费
华北2(北京)
模型 ID(Model ID) | 输出视频类型 | 输出视频分辨率 | 输出单价 |
wan2.7-i2v | 有声视频 | 720P | $0.1032144/秒 |
1080P | $0.1720236/秒 |
新加坡
模型 ID(Model ID) | 服务部署范围 | 输出视频类型 | 输出视频分辨率 | 输出单价 |
wan2.7-i2v | 国际 | 有声视频 | 720P | $0.12/秒 |
1080P | $0.18/秒 |
文本向量
计费规则:按输入Token计费,输出不计费。
华北2(北京)
模型 ID(Model ID) | 输入单价(每百万Token) |
text-embedding-v4 | $0.0864 |
新加坡
模型 ID(Model ID) | 输入单价(每百万Token) |
text-embedding-v4 | $0.084 |
多模态向量
计费规则:按输入Token计费,输出不计费。
华北2(北京)
模型 ID(Model ID) | 输入单价(每百万Token) |
qwen3-vl-embedding | 图片/视频:$0.3096 文本:$0.12 |
新加坡
模型 ID(Model ID) | 服务部署范围 | 输入单价(每百万输入Token) |
tongyi-embedding-vision-plus | 国际 | $0.108 |
tongyi-embedding-vision-flash | 国际 | 图片/视频:$0.036 文本:$0.108 |
排序模型
文本排序模型
计费规则:按输入Token计费,输出不计费。
华北2(北京)
模型 ID(Model ID) | 输入单价(每百万Token) |
qwen3-rerank | 文本输入:$0.0828 |
新加坡
模型 ID(Model ID) | 服务部署范围 | 输入单价(每百万Token) |
qwen3-rerank | 国际 | $0.12 |
附录:上下文缓存折扣
项目 | 显式缓存 | 隐式缓存 |
用于创建缓存Token计费 | 输入 Token 单价的125% | 输入 Token 单价的100% |
命中缓存的输入 Token 计费 | 输入 Token 单价的10% | 输入 Token 单价的20% |
常见问题
Q:PAI Token服务支持节省计划吗,百炼的节省计划可用于PAI Token服务吗?
PAI Token服务暂不支持节省计划,且百炼中的节省计划无法用于PAI Token服务。