您可通过部署获得独立的、资源专享的推理服务,以满足您对高并发、低延迟等不同性能的业务需求。
计费方式
部署前可以在模型部署控制台查看不同模型的预估每小时费用。
说明计费方式在服务创建后无法更改。如需切换,必须下线已经部署的模型后再重新部署。
预置吞吐(PTU,Provisioned Throughput Unit) (高吞吐;高性能) | 模型单元 (自定义性能指标;资源隔离) | Token 用量 (调优后按量计费/效果验证) | |||
|---|---|---|---|---|---|
定义 | 通过平台预留资源,保障特定TPM 吞吐能力的模型部署方式;在保障额度内不限速。 | 按使用时长与模型单元数量配置算力,资源独占的模型部署方式。 | 以每次调用产生的输入 Token 与输出 Token 作为用量计量依据的模型部署方式。 | ||
优势 |
|
| 不使用不计费。 | ||
支持模型 | 部分预置模型 | 部分预置模型与所有调优后模型 | 部分经过 LoRA 调优后的模型 | ||
使用场景 |
|
| 调优后模型效果验证 | ||
计费图示 |
|
|
| ||
计费方式 | 按使用时长和预置吞吐 随用随付、包天 | 按使用时长和模型单元数量 随用随付、包月 | 按模型 Token 使用量 随用随付 | ||
扩缩容方式 | 自助增减吞吐量 | 自助增减模型单元数量 | 在控制台提交申请,等待人工审核。 | ||
产品约束 |
| 预付费购买后,若在首月内提前退订,日单价(≈ 月单价 / 30)将按 1.2 倍计费 |
| ||
如需查看单次调用的 Token 使用量及调用次数历史统计,请前往:模型监控。
计费详情
按使用时长计费(预置吞吐)
费用 = 使用时长 × (输入 TPM 单价 × 输入 TPM + 输出 TPM 单价 × 输出 TPM)
后付费按小时计算:使用时长单位为小时,单价取下表"持续 1 小时"列;预付费按天计算:使用时长单位为天,单价取下表"持续 1 天"列。
- 预付费订单支付后实时生效,有效期 N 天至第 N 天 23:59 结束。若在 22:00 后下单,到期日将自动顺延1天。
- 预付费订单到期后,将延后2小时停止服务,停止后资源保留14小时后释放。
- 预付费订单无法提前终止服务。
- 后付费时,如果账户欠费,部署的资源将继续保留并计费 24 小时,在这 24 小时内服务仍可正常使用。超过 24 小时后系统停止计费,模型部署进入欠费状态,底层资源将被删除,但模型部署任务仍会保留。补足欠费后,系统将重新分配资源并恢复使用(恢复后继续产生费用)。如果您不希望继续产生费用,可删除模型部署任务,删除成功后将不再计费。
当模型输入超过最长输入 Token 时,相关调用将自动切换为当前模型的按量付费模式;超出购买的 TPM 量时,按创建时选择的溢出策略处理(「自动溢出」切换为按量付费,「仅使用 PTU 容量」返回 429)。此时,推理性能可能下降,将受业务空间中当前快照模型的公共流量的管控,费用按模型调用(按量付费)标准计收。
- 此时(仅「自动溢出」策略下),调用 API 返回 Header 将包含:
x-dashscope-ptu-overflow:true。 - TPM 统计请前往:模型监控。
缩容场景(降配)的具体降费退费规则请参考:降配退款规则说明。
说明PTU 部署支持长输入阶梯容量系数和缓存折扣,详见预置吞吐长输入与缓存。
新加坡
千问
模型名称 | 模型代码 | 最长输入Token | 后付费输入 Per 10K TPM/小时 | 后付费输出 Per 1K TPM/小时 | 预付费输入 Per 10K TPM/天 | 预付费输出 Per 1K TPM/天 |
|---|---|---|---|---|---|---|
千问3.8-Max | qwen3.8-max | 1M | $4.8 | $1.44 | $57.6 | $17.28 |
千问3.7-Flash-2026-07-15 联系商务经理开通 | qwen3.7-flash-2026-07-15 | 128K | $0.072 | $0.031 | $0.864 | $0.374 |
千问3.7-Max-2026-05-20 | qwen3.7-max-2026-05-20 | 256K | $1.92 | $1.8 | $72 | $21.6 |
千问3.7-Plus-2026-05-26 | qwen3.7-plus-2026-05-26 | 256K | $0.96 | $0.384 | $11.52 | $4.608 |
千问3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | 128K | $1.2 | $0.72 | $14.4 | $8.64 |
千问3.5-Plus-2026-04-20 | qwen3.5-plus-2026-04-20 | 128K | $0.96 | $0.576 | $11.52 | $6.912 |
DeepSeek
模型名称 | 模型代码 | 最长输入Token | 后付费输入 Per 10K TPM/小时 | 后付费输出 Per 1K TPM/小时 | 预付费输入 Per 10K TPM/天 | 预付费输出 Per 1K TPM/天 |
|---|---|---|---|---|---|---|
DeepSeek-v4-Flash | deepseek-v4-flash | 256K | $0.72 | $0.144 | $8.64 | $1.728 |
DeepSeek-v4-Flash-0731 | deepseek-v4-flash-0731 | 64K | $1.44 | $0.288 | $17.28 | $3.456 |
DeepSeek-v4-Pro | deepseek-v4-pro | 256K | $0.96 | $1.728 | $103.68 | $20.736 |
千问VL
模型名称 | 模型代码 | 最长输入Token | 后付费输入 Per 10K TPM/小时 | 后付费输出 Per 1K TPM/小时 | 预付费输入 Per 10K TPM/天 | 预付费输出 Per 1K TPM/天 |
|---|---|---|---|---|---|---|
千问3-VL-Plus-2025-09-23 | qwen3-vl-plus-2025-09-23 | 128K | $0.48 | $0.384 | $5.76 | $4.608 |
GLM
模型名称 | 模型代码 | 最长输入Token | 后付费输入 Per 10K TPM/小时 | 后付费输出 Per 1K TPM/小时 | 预付费输入 Per 10K TPM/天 | 预付费输出 Per 1K TPM/天 |
|---|---|---|---|---|---|---|
GLM-5.2 | glm-5.2 | 1M | $5.04 | $1.584 | $60.48 | $19.008 |
华北2(北京)
千问
模型名称 | 模型代码 | 最长输入Token | 后付费输入 Per 10K TPM/小时 | 后付费输出 Per 1K TPM/小时 | 预付费输入 Per 10K TPM/天 | 预付费输出 Per 1K TPM/天 |
|---|---|---|---|---|---|---|
千问3.8-Max | qwen3.8-max | 1M | $3.96 | $1.188 | $47.53 | $14.258 |
千问3.7-Flash-2026-07-15 联系商务经理开通 | qwen3.7-flash-2026-07-15 | 128K | $0.066 | $0.026 | $0.792 | $0.317 |
千问3.7-Max-2026-05-20 | qwen3.7-max-2026-05-20 | 256K | $3.96 | $1.188 | $47.53 | $14.258 |
千问3.7-Plus-2026-05-26 | qwen3.7-plus-2026-05-26 | 256K | $0.66 | $0.264 | $7.92 | $3.168 |
千问3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | 128K | $0.67 | $0.066 | $7.93 | $4.753 |
千问3.5-Plus-2026-04-20 | qwen3.5-plus-2026-04-20 | 128K | $0.26 | $0.16 | $3.17 | $1.9 |
千问3-Max-2025-09-23 | qwen3-max-2025-09-23 | 128K | $1.11 | $0.45 | $13.32 | $5.4 |
千问-Flash-2025-07-28 | qwen-flash-2025-07-28 | 128K | $0.06 | $0.06 | $0.72 | $0.72 |
千问-Plus-2025-12-01 | qwen-plus-2025-12-01 | 128K | $0.28 | 非思考:$0.07 思考:$0.28 | $3.36 | 非思考:$0.84 思考:$3.36 |
DeepSeek
模型名称 | 模型代码 | 最长输入Token | 后付费输入 Per 10K TPM/小时 | 后付费输出 Per 1K TPM/小时 | 预付费输入 Per 10K TPM/天 | 预付费输出 Per 1K TPM/天 |
|---|---|---|---|---|---|---|
DeepSeek-v4-Flash | deepseek-v4-flash | 256K | $0.5 | $0.099 | $5.94 | $1.188 |
DeepSeek-v4-Flash-0731 | deepseek-v4-flash-0731 | 64K | $0.99 | $0.198 | $11.88 | $2.376 |
DeepSeek-v4-Pro | deepseek-v4-pro | 256K | $5.94 | $1.188 | $71.3 | $14.26 |
DeepSeek-v3 | deepseek-v3 | 64K | $0.99 | $0.396 | $11.9 | $4.75 |
千问VL
模型名称 | 模型代码 | 最长输入Token | 后付费输入 Per 10K TPM/小时 | 后付费输出 Per 1K TPM/小时 | 预付费输入 Per 10K TPM/天 | 预付费输出 Per 1K TPM/天 |
|---|---|---|---|---|---|---|
千问3-VL-Plus-2025-09-23 | qwen3-vl-plus-2025-09-23 | 128K | $0.35 | $0.35 | $4.2 | $4.2 |
GLM
模型名称 | 模型代码 | 最长输入Token | 后付费输入 Per 10K TPM/小时 | 后付费输出 Per 1K TPM/小时 | 预付费输入 Per 10K TPM/天 | 预付费输出 Per 1K TPM/天 |
|---|---|---|---|---|---|---|
GLM-5.2 | glm-5.2 | 1M | $3.96 | $1.386 | $47.53 | $16.635 |
按使用时长计费(模型单元)
费用 = 使用时长(小时)× 模型单元数量 × 模型单元单价
"模型单元单价"在后付费场景下取下表"小时单价"列;预付费按月计费时,公式改为 包月数 × 模型单元数量 × 月单价。
- 预付费购买的首月,如在首月内提前退订,日单价(≈ 月单价 / 30)将按 1.2 倍计费(不满一天按一天计费)
说明模型单元-后付费方式的算力资源先买到先得。如购买不成功会全额退款。
新加坡
文本生成
模型名称 | 模型代码 | 模型单元规格 | 小时单价($) 最小计费:分钟 | 包月单价($) 最小计费:天 |
|---|---|---|---|---|
千问3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | MU1 x 8 | $88 | $41,832 |
千问3.5-397B-A17B | qwen3.5-397b-a17b | MU2 x 8 | $112 | $52,392 |
千问3.5-122B-A10B | qwen3.5-122b-a10b | MU2 x 8 | $112 | $52,392 |
千问3.5-27B | qwen3.5-27b | MU1 x 2 | $22 | $10,458 |
千问3.5-9B | qwen3.5-9b | MU1 x 2 | $22 | $10,458 |
GLM-5.1 | glm-5.1 | MU2 x 8 | $112 | $52,392 |
MU3 x 8 | $216 | $102,696 | ||
DeepSeek-v4-Flash | deepseek-v4-flash | MU2 x 8 | $112 | $52,392 |
Qwen-Plus-Character-2025-11-06 | qwen-plus-character-2025-11-06 | MU1 x 4 | $44 | $20,916 |
多模态
模型名称 | 模型代码 | 模型单元规格 | 小时单价($) 最小计费:分钟 | 包月单价($) 最小计费:天 |
|---|---|---|---|---|
千问3-VL-32B-Instruct | qwen3-vl-32b-instruct | MU2 x 8 | $112 | $52,392 |
模型类型:
- Instruct - 模型部署后以非思考模式进行推理。
华北2(北京)
文本生成
千问
模型名称 | 模型代码 | 模型单元规格 | 小时单价($) 最小计费:分钟 | 包月单价($) 最小计费:天 |
|---|---|---|---|---|
千问3.6-35B-A3B | qwen3.6-35b-a3b | MU1 x 8 | $59.408 | $28,734.256 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 | $150.72 | $72,577.152 | ||
MU8 x 1 | $6.464 | $3,080.477 | ||
MU9 x 1 | $7.014 | $3,383.024 | ||
千问3.6-27B | qwen3.6-27b | MU9 x 1 | $7.014 | $3,383.024 |
千问3.6-Flash-2026-04-16 | qwen3.6-flash-2026-04-16 | MU1 x 2 | $14.852 | $7,183.564 |
MU3 x 8 | $150.72 | $72,577.152 | ||
千问3.6-Plus-2026-04-02 | qwen3.6-plus-2026-04-02 | MU1 x 8 MU1 x 16(PD分离模式) | $59.408 PD分离模式:$118.816 | $28,734.256 PD分离模式:$57,468.512 |
千问3.5-397B-A17B | qwen3.5-397b-a17b | MU3 x 8 MU3 x 16(PD分离模式) | $150.72 PD分离模式:$301.44 | $72,577.152 PD分离模式:$145,154.304 |
MU6 x 16 | $55.008 | $26,599.92 | ||
千问3.5-122B-A10B | qwen3.5-122b-a10b | MU1 x 4 | $29.704 | $14,367.128 |
MU6 x 16 | $55.008 | $26,599.92 | ||
千问3.5-35B-A3B | qwen3.5-35b-a3b | MU1 x 2 | $14.852 | $7,183.564 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 | $150.72 | $72,577.152 | ||
MU9 x 1 | $7.014 | $3,383.024 | ||
千问3.5-27B | qwen3.5-27b | MU2 x 8 | $69.312 | $33,044.72 |
MU3 x 8 | $150.72 | $72,577.152 | ||
MU8 x 1 | $6.464 | $3,080.477 | ||
MU9 x 1 | $7.014 | $3,383.024 | ||
千问3.5-9B | qwen3.5-9b | MU1 x 2 | $14.852 | $7,183.564 |
MU2 x 8 | $69.312 | $33,044.72 | ||
千问3.5-Flash-2026-02-23 | qwen3.5-flash-2026-02-23 | MU1 x 2 | $14.852 | $7,183.564 |
千问3.5-Plus-2026-02-15 | qwen3.5-plus-2026-02-15 | MU1 x 8 MU1 x 16(PD分离模式) | $59.408 PD分离模式:$118.816 | $28,734.256 PD分离模式:$57,468.512 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 MU3 x 16(PD分离模式) | $150.72 PD分离模式:$301.44 | $72,577.152 PD分离模式:$145,154.304 | ||
千问3-235B-A22B-Instruct-2507 | qwen3-235b-a22b-instruct-2507 | MU1 x 4 | $29.704 | $14,367.128 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 | $150.72 | $72,577.152 | ||
千问3-32B | qwen3-32b | MU6 x 16 | $55.008 | $26,599.92 |
千问3-30B-A3B-Thinking-2507 | qwen3-30b-a3b-thinking-2507 | MU1 x 2 | $14.852 | $7,183.564 |
千问3-4B | qwen3-4b | MU1 x 2 | $14.852 | $7,183.564 |
MU5 x 1 | $2.888 | $1,394.329 | ||
千问3-Embedding-0.6B | qwen3-embedding-0.6b | MU5 x 1 | $2.888 | $1,394.329 |
MU6 x 1 | $3.438 | $1,662.495 | ||
千问3-MoE-Rerank-0.6B | qwen3-moe-rerank-0.6b | MU5 x 1 | $2.888 | $1,394.329 |
千问3-Rerank-0.6B | qwen3-rerank-0.6b | MU5 x 1 | $2.888 | $1,394.329 |
MU6 x 1 | $3.438 | $1,662.495 | ||
千问3-Max-2025-09-23 | qwen3-max-2025-09-23 | MU2 x 8 | $69.312 | $33,044.72 |
MU3 x 8 | $150.72 | $72,577.152 | ||
千问3-Rerank | qwen3-rerank | MU5 x 1 | $2.888 | $1,394.329 |
千问2.5-开源版-72B | qwen2.5-72b-instruct | MU1 x 8 | $59.408 | $28,734.256 |
千问2.5-开源版-14B | qwen2.5-14b-instruct | MU1 x 2 | $14.852 | $7,183.564 |
千问2.5-开源版-7B | qwen2.5-7b-instruct | MU1 x 2 | $14.852 | $7,183.564 |
MU5 x 1 | $2.888 | $1,394.329 | ||
千问-Plus-2025-07-28 | qwen-plus-2025-07-28 | MU1 x 4 MU1 x 16(PD分离模式) | $29.704 PD分离模式:$118.816 | $14,367.128 PD分离模式:$57,468.512 |
千问-Plus-2025-12-01 | qwen-plus-2025-12-01 | MU1 x 4 | $29.704 | $14,367.128 |
Qwen-Plus-Character-2025-11-06 | qwen-plus-character-2025-11-06 | MU1 x 4 | $29.704 | $14,367.128 |
GLM
模型名称 | 模型代码 | 模型单元规格 | 小时单价($) 最小计费:分钟 | 包月单价($) 最小计费:天 |
|---|---|---|---|---|
GLM-5.1 | glm-5.1 | MU2 x 8 | $69.312 | $33,044.72 |
MU3 x 16(PD分离模式) | PD分离模式:$301.44 | PD分离模式:$145,154.304 | ||
MU6 x 16 | $55.008 | $26,599.92 | ||
GLM-5 | glm-5 | MU3 x 16(PD分离模式) | PD分离模式:$301.44 | PD分离模式:$145,154.304 |
GLM-4.7 | glm-4.7 | MU6 x 32(PD分离模式) | PD分离模式:$110.016 | PD分离模式:$53,199.84 |
DeepSeek
模型名称 | 模型代码 | 模型单元规格 | 小时单价($) 最小计费:分钟 | 包月单价($) 最小计费:天 |
|---|---|---|---|---|
DeepSeek-v4-Flash | deepseek-v4-flash | MU1 x 8 | $59.408 | $28,734.256 |
MU3 x 8 | $150.72 | $72,577.152 | ||
DeepSeek-v3.2 | deepseek-v3.2 | MU2 x 16(PD分离模式) | PD分离模式:$138.624 | PD分离模式:$66,089.44 |
其他模型
模型名称 | 模型代码 | 模型单元规格 | 小时单价($) 最小计费:分钟 | 包月单价($) 最小计费:天 |
|---|---|---|---|---|
Kimi-K2.5 | kimi-k2.5 | MU2 x 8 | $69.312 | $33,044.72 |
多模态
千问VL
模型名称 | 模型代码 | 模型单元规格 | 小时单价($) 最小计费:分钟 | 包月单价($) 最小计费:天 |
|---|---|---|---|---|
千问3-VL-235B-A22B-Thinking | qwen3-vl-235b-a22b-thinking | MU1 x 8 | $59.408 | $28,734.256 |
MU2 x 8 | $69.312 | $33,044.72 | ||
MU3 x 8 | $150.72 | $72,577.152 | ||
千问3-VL-32B-Instruct | qwen3-vl-32b-instruct | MU2 x 8 | $69.312 | $33,044.72 |
MU3 x 8 | $150.72 | $72,577.152 | ||
千问3-VL-8B-Instruct | qwen3-vl-8b-instruct | MU1 x 2 | $14.852 | $7,183.564 |
MU5 x 1 | $2.888 | $1,394.329 | ||
千问3-VL-4B-Instruct | qwen3-vl-4b-instruct | MU1 x 2 | $14.852 | $7,183.564 |
千问3-VL-2B-Instruct | qwen3-vl-2b-instruct | MU5 x 1 | $2.888 | $1,394.329 |
千问3-VL-Embedding-2B | qwen3-vl-embedding-2b | MU5 x 1 | $2.888 | $1,394.329 |
千问3-VL-Flash-2025-10-15 | qwen3-vl-flash-2025-10-15 | MU1 x 4 | $29.704 | $14,367.128 |
千问3-VL-Plus-2025-09-23 | qwen3-vl-plus-2025-09-23 | MU1 x 4 | $29.704 | $14,367.128 |
千问VL-Max-2025-08-13 | qwen-vl-max-2025-08-13 | MU6 x 4 | $13.752 | $6,649.98 |
千问Omni
模型名称 | 模型代码 | 模型单元规格 | 小时单价($) 最小计费:分钟 | 包月单价($) 最小计费:天 |
|---|---|---|---|---|
千问3.5-Omni-Flash | qwen3.5-omni-flash | MU8 x 1 | $6.464 | $3,080.477 |
MU9 x 1 | $7.014 | $3,383.024 |
模型类型:
- Instruct - 模型部署后以非思考模式进行推理。
- Thinking - 模型部署后以思考模式进行推理。
按模型 Token 使用量
费用 = 模型输入 Token 数 × 模型输入单价 + 模型输出 Token 数 × 模型输出单价(最小计费单位:1 token)
- 仅当对下列基础模型完成 SFT 高效训练(即 LoRA 高效微调,API 部署时 plan 取值为 lora)并得到自定义模型后,才支持按模型 Token 使用量计费。
新加坡
基础模型 | 模型代码 | 输入 $/百万Token | 输出 $/百万Token |
|---|---|---|---|
千问3-14B | qwen3-14b | 非思考模式:$0.35 思考模式:$0.35 | 非思考模式:$1.4 思考模式:$4.2 |
北京
基础模型 | 模型代码 | 输入 $/百万Token | 输出 $/百万Token |
|---|---|---|---|
千问3.5-27B | qwen3.5-27b | <128K $0.086 128K-256K $0.258 | <128K $0.688 128K-256K $2.064 |
千问3-32B | qwen3-32b | 非思考模式:$0.287 思考模式:$0.287 | 非思考模式:$1.147 思考模式:$2.868 |
千问3-14B | qwen3-14b | 非思考模式:$0.144 思考模式:$0.144 | 非思考模式:$0.574 思考模式:$1.434 |
千问3-8B | qwen3-8b | 非思考模式:$0.072 思考模式:$0.072 | 非思考模式:$0.287 思考模式:$0.717 |
千问3-VL-8B-Instruct | qwen3-vl-8b-instruct | $0.072 | $0.287 |
如果需要部署更多模型,请参考此解决方案并结合具体业务需求选择最适合的部署方案。
部署方法
您可以在控制台上部署模型,请参考以下操作步骤:
如果提示权限不足,请参考:部署时提示权限不足怎么办?
|
|
| |
模型部署成功后将产生费用。 |
部署配置
模型单元
配置内容 | 配置详情 |
|---|---|
服务名称 | 自定义部署服务的名称。 |
选择模型 | 选择要部署的模型,包括平台预置模型和已调优的模型。 |
模型单元类型 | 选择部署规格,不同规格对应不同的算力和性能。 |
部署副本数 | 设置初始部署副本数量,影响服务的并发处理能力。 |
部署模版 | 选择部署模版(如"单机部署"),不同模版对应不同的资源配置方案。仅在模型单元计费模式下可用。 |
配置模型推理模式 | 部分模型在以模型单元方式部署时,可配置推理模式、最长上下文等。
|
最长上下文 | 部分模型的模型单元部署模式支持该设置。最长上下文长度基于模型类型。 |
服务限流 | 部分模型的模型单元部署模式支持该设置,可限制模型调用的 RPM、TPM。 |
部署列表页
部署成功后,您可以在部署列表页查看和管理所有部署服务。列表页包含以下信息:
- 服务名称:部署服务的名称,单击可查看部署详情。
- 模型名称:部署使用的模型。
- 模型Code:模型部署成功后生成的唯一标识,用于 API 调用时指定模型。
- 部署状态/事件状态:包括待部署、部署中、运行中、部署失败、下线中、服务暂停、已停止、删除中、退订停服/欠费停服、停服恢复中、运行中(变配中)、运行中(变配失败)等状态。
- 计费方式:当前部署服务的计费方式。
- 部署详情:模型单元类型、副本数等配置信息。
- 限流详情:展示当前部署服务的 RPM(每分钟请求数)、TPM(每分钟 Token 数)等限流配置。
- 服务时间:展示部署服务的创建时间与到期时间。
- 操作:根据部署状态和计费方式,可执行更新、监控、扩缩容、续费、下线、删除、体验等操作。
部署后调用
模型部署成功后,支持通过 OpenAI 兼容、Dashscope及Assistant SDK进行调用。
在调用已部署成功的模型时,model的取值应为模型部署成功后的模型code。请前往模型部署控制台界面获取模型code。
import os
import dashscope
messages = [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "你是谁?"},
]
dashscope.base_http_api_url = 'https://dashscope-intl.aliyuncs.com/api/v1'
response = dashscope.Generation.call(
# 若没有配置环境变量,请用百炼API Key将下一行替换为:api_key="sk-xxx",
api_key=os.getenv("DASHSCOPE_API_KEY"),
model="qwen3-max-xxx-xxx", # 请替换为模型部署成功后的code
messages=messages,
result_format="message",
enable_thinking=False,
)
print(response)
import os
from openai import OpenAI
client = OpenAI(
# 若没有配置环境变量,请用百炼API Key将下一行替换为:api_key="sk-xxx",
api_key=os.getenv('DASHSCOPE_API_KEY'),
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
completion = client.chat.completions.create(
model="qwen3-max-xxx-xxx", # 请替换为模型部署成功后的code
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "你是谁?"},
],
extra_body={"enable_thinking": False},
)
print(completion)
部署服务扩缩容
- 预置吞吐(按时长):点击扩缩容按钮,自助、手动调节实例数量。具体降费退费规则请参考:降配退款规则说明。
- 模型单元(按时长):点击扩缩容按钮,自助、手动调节实例数量。
此外,您还可以通过操作列的伸缩配置按钮,配置自动伸缩策略(包括伸缩阈值、最小/最大副本数、定时伸缩等)。
部署服务下线
前往模型部署控制台,找到要停止的部署服务,根据计费类型点击对应操作:
- 模型单元预付费:点击下线并确认。
- 后付费:点击删除并确认。
操作完成后将不再产生计费。
其他操作
除下线外,部署列表页的操作列还支持以下操作:
- 更新:更新已部署服务的模型版本,支持全部更新或分批更新(金丝雀发布)。
- 删除:按量付费服务可直接删除,停止计费。
- 续费:预付费服务可续费延长服务时间,支持自动续费。
- 购买容量包:为预置吞吐部署购买容量包。
常见问题
可以上传和部署自己的模型吗?
暂不支持上传和部署自有模型,建议您持续关注阿里云百炼最新动态。
此外,阿里云人工智能平台 PAI 提供了部署自有模型的功能,您可以参考PAI-LLM大语言模型部署了解部署方法。
部署时提示权限不足怎么办?
-
如果显示“缺少该模块的权限”,请确保您的账号在该业务空间的权限管理页面中拥有模型部署-操作权限。
如果无法正常操作,请联系您的组织或 IT 管理员添加相关权限或代为检查权限问题。
-
如果部署时报错“xx业务空间没有部署xx模型的权限”,请前往百炼的业务空间管理页面,为对应业务空间添加对应模型的部署权限。
API 调用报错:
Workspace xxx does not have deployment privilege for model xxxx。
如果提示权限不足,请联系您的组织或 IT 管理员添加相关权限或代为操作。




