Implante modelos pré-treinados da plataforma ou seus próprios modelos ajustados para obter um serviço de inferência independente e dedicado. Esse serviço atende a necessidades de negócios que exigem alta concorrência, baixa latência e outros requisitos de desempenho.
É possível implantar modelos pré-treinados da plataforma ou seus próprios modelos
Métodos de faturamento
Antes de implantar um modelo, visualize o custo horário estimado para diferentes modelos no Model Deployment console .
Não é possível alterar o método de faturamento após a criação do serviço. Para mudar o método de faturamento, cancele a publicação do modelo implantado e implante-o novamente.
|
Provisioned Throughput (PTU) (Alto throughput e alto desempenho) |
Model Unit (Métricas de desempenho personalizadas e isolamento de recursos) |
Token Usage (Pagamento conforme o uso para modelos ajustados e validação de desempenho) |
|||
|
Definição |
Método de implantação de modelos que reserva recursos da plataforma para garantir um throughput específico de Tokens por Minuto (TPM). Nenhum limite de taxa é aplicado dentro da cota garantida. |
Método de implantação de modelos que aloca poder computacional com base na duração do uso e na quantidade de unidades de modelo. Os recursos são dedicados. |
Método de implantação de modelos em que o uso é medido com base nos tokens de entrada e saída de cada chamada de API. |
||
|
Vantagens |
|
|
Sem cobrança se não houver uso. |
||
|
Modelos suportados |
Alguns modelos pré-treinados |
Alguns modelos pré-treinados e todos os modelos ajustados |
Alguns modelos ajustados com LoRA |
||
|
Cenários |
|
|
Validação do desempenho de um modelo ajustado |
||
|
Diagrama de faturamento |
|
|
|
||
|
Método de faturamento |
Cobrança baseada na duração do uso e no throughput provisionado. Suporta pagamento conforme o uso e assinatura diária. |
Cobrança baseada na duração do uso e na quantidade de unidades de modelo. Suporta pagamento conforme o uso e assinatura mensal. |
Uso de tokens por modelo Suporta pagamento conforme o uso. |
||
|
Método de dimensionamento |
Aumente ou diminua o throughput manualmente. |
Aumente ou diminua a quantidade de unidades de modelo manualmente. |
Envie uma solicitação no console e aguarde a revisão manual. |
||
|
Restrições do produto |
|
Para assinaturas, caso você cancele dentro do primeiro mês, o preço unitário diário (≈ preço unitário mensal / 30) será cobrado com uma taxa de 1,2 vezes o preço padrão. |
|
||
Para visualizar o uso de tokens e o histórico de chamadas de uma única invocação, acesse Model Monitoring.
Detalhes de faturamento
Instruções
Leia o conteúdo em inglês para compreender O QUE precisa ser comunicado
Escreva o texto em português do Brasil DO ZERO — esqueça a estrutura das frases em inglês
Preserve toda a formatação markdown, blocos de código, links e imagens exatamente como estão
Tags xref (
<a data-tag="xref" ...>texto</a>) — preserve A TAG INTEIRA com todos os atributos na ordem e capitalização originais, traduza APENAS o texto visível entre > eAplique todas as regras específicas do idioma rigorosamente
Aplique as regras de stopwords com tolerância zero
Use o modo imperativo em passos numerados e listas de procedimentos
Garanta a consistência terminológica — o mesmo termo deve ter a mesma tradução em todo o documento
Varie os inícios de frase em listas e tabelas — nenhum início deve se repetir 3 ou mais vezes
-
Retorne APENAS o documento markdown em português do Brasil, sem explicações
Faturamento por tempo (Provisioned Throughput)
Custo = Duração do uso × (Preço unitário de TPM de entrada × TPM de entrada + Preço unitário de TPM de saída × TPM de saída)
No método de pagamento conforme o uso, a cobrança é feita por hora e o preço unitário segue as tarifas horárias da tabela abaixo. Já na modalidade de assinatura, o faturamento ocorre diariamente, com base nas tarifas diárias apresentadas na mesma tabela.
Os pedidos de assinatura entram em vigor imediatamente após o pagamento. Uma assinatura de N dias permanece válida até as 23:59 do N-ésimo dia. Caso o pedido seja realizado após as 22:00, a data de expiração é prorrogada automaticamente por um dia.
Após a expiração de um pedido de assinatura, o serviço é interrompido depois de um período de carência de 2 horas. Com a interrupção do serviço, os recursos são mantidos por 14 horas e, em seguida, liberados.
Não é possível encerrar pedidos de assinatura antecipadamente.
No pagamento conforme o uso, se houver pagamentos em atraso na sua conta, os recursos implantados permanecem ativos e continuam sendo cobrados por 24 horas, período em que o serviço segue disponível. Passadas essas 24 horas, o sistema interrompe o faturamento e a implantação do modelo entra em estado de inadimplência. Os recursos subjacentes são excluídos, mas a tarefa de implantação do modelo é preservada. Após quitar o valor pendente, o sistema realoca os recursos, restaura o serviço e retoma a cobrança. Para parar de gerar encargos, exclua a tarefa de implantação do modelo. O faturamento cessa assim que a exclusão for concluída com sucesso.
Se a entrada do modelo exceder o máximo de tokens de entrada ou o TPM adquirido, a chamada muda automaticamente para o modo de pagamento conforme o uso para o modelo atual. Nesse cenário, o desempenho da inferência pode diminuir e ficará sujeito ao controle de tráfego público do snapshot model atual no workspace. Os Custos são cobrados com base no padrão de invocação de modelo (pagamento conforme o uso).
Nessa situação, a chamada de API retorna um cabeçalho contendo
x-dashscope-ptu-overflow:true.Para visualizar estatísticas de TPM, acesse Model Monitoring.
Para consultar as regras específicas de reembolso em cenários de scale-in (downgrades), consulte Regras de reembolso para downgrades.
Qwen
DeepSeek
Qwen-VL
Mais modelos
Singapura
Qwen
Nome do modelo
Código do modelo
Máximo de tokens de entrada
Entrada (pagamento conforme o uso)
Por 10k TPM/hora
Saída (pagamento conforme o uso)
Por 1k TPM/hora
Entrada (assinatura)
Por 10k TPM/dia
Saída (assinatura)
Por 1k TPM/dia
Qwen3.7-Max-2026-05-20
qwen3.7-max-2026-05-20
256K
$6
$1,8
$72
$21,6
Qwen3.7-Plus-2026-05-26
qwen3.7-plus-2026-05-26
256K
$0,96
$0,384
$11,52
$4,608
Qwen3.6-Plus-2026-04-02
qwen3.6-plus-2026-04-02
128K
$1,2
$0,72
$14,4
$8,64
Qwen3.5-Plus-2026-04-20
qwen3.5-plus-2026-04-20
128K
$0,96
$0,576
$11,52
$6,912
DeepSeek
Nome do modelo
Código do modelo
Máximo de tokens de entrada
Entrada (pagamento conforme o uso)
Por 10k TPM/hora
Saída (pagamento conforme o uso)
Por 1k TPM/hora
Entrada (assinatura)
Por 10k TPM/dia
Saída (assinatura)
Por 1k TPM/dia
DeepSeek-v4-Flash
deepseek-v4-flash
256K
$0,72
$0,144
$8,64
$1,728
DeepSeek-v4-Pro
deepseek-v4-pro
256K
$8,64
$1,728
$103,68
$20,736
DeepSeek-v3.2
deepseek-v3.2
64K
$2,05
$0,616
$24,62
$7,387
Qwen-VL
Nome do modelo
Código do modelo
Máximo de tokens de entrada
Entrada (pagamento conforme o uso)
Por 10k TPM/hora
Saída (pagamento conforme o uso)
Por 1k TPM/hora
Entrada (assinatura)
Por 10k TPM/dia
Saída (assinatura)
Por 1k TPM/dia
Qwen3-VL-Plus-2025-09-23
qwen3-vl-plus-2025-09-23
128K
$0,48
$0,384
$5,76
$4,608
Mais modelos
Nome do modelo
Código do modelo
Máximo de tokens de entrada
Entrada (pagamento conforme o uso)
Por 10k TPM/hora
Saída (pagamento conforme o uso)
Por 1k TPM/hora
Entrada (assinatura)
Por 10k TPM/dia
Saída (assinatura)
Por 1k TPM/dia
GLM-5.1
glm-5.1
64K
$5,04
$1,584
$64,8
$19,008
China (Pequim)
Qwen
Nome do modelo
Código do modelo
Máximo de tokens de entrada
Entrada (pagamento conforme o uso)
Por 10k TPM/hora
Saída (pagamento conforme o uso)
Por 1k TPM/hora
Entrada (assinatura)
Por 10k TPM/dia
Saída (assinatura)
Por 1k TPM/dia
Qwen3.7-Max-2026-05-20
qwen3.7-max-2026-05-20
256K
$3,96
$1,188
$47,53
$14,258
Qwen3.7-Plus-2026-05-26
qwen3.7-plus-2026-05-26
256K
$0,66
$0,264
$7,92
$3,168
Qwen3.6-Plus-2026-04-02
qwen3.6-plus-2026-04-02
128K
$0,67
$0,397
$7,93
$4,753
Qwen3.5-Plus-2026-04-20
qwen3.5-plus-2026-04-20
128K
$0,26
$0,16
$3,17
$1,9
Qwen3-Max-2025-09-23
qwen3-max-2025-09-23
128K
$1,11
$0,45
$13,32
$5,4
Qwen-Flash-2025-07-28
qwen-flash-2025-07-28
128K
$0,06
$0,06
$0,72
$0,72
Qwen-Plus-2025-12-01
qwen-plus-2025-12-01
128K
$0,28
Modo sem raciocínio: $0,07
Modo de raciocínio: $0,28
$3,36
Modo sem raciocínio: $0,84
Modo de raciocínio: $3,36
DeepSeek
Nome do modelo
Código do modelo
Máximo de tokens de entrada
Entrada (pagamento conforme o uso)
Por 10k TPM/hora
Saída (pagamento conforme o uso)
Por 1k TPM/hora
Entrada (assinatura)
Por 10k TPM/dia
Saída (assinatura)
Por 1k TPM/dia
DeepSeek-v4-Flash
deepseek-v4-flash
256K
$0,5
$0,099
$5,94
$1,188
DeepSeek-v4-Pro
deepseek-v4-pro
256K
$5,94
$1,188
$71,3
$14,26
DeepSeek-v3.2
deepseek-v3.2
64K
$1,04
$0,16
$12,48
$1,92
DeepSeek-v3
deepseek-v3
64K
$0,99
$0,396
$11,9
$4,75
Qwen-VL
Nome do modelo
Código do modelo
Máximo de tokens de entrada
Entrada (pagamento conforme o uso)
Por 10k TPM/hora
Saída (pagamento conforme o uso)
Por 1k TPM/hora
Entrada (assinatura)
Por 10k TPM/dia
Saída (assinatura)
Por 1k TPM/dia
Qwen3-VL-Plus-2025-09-23
qwen3-vl-plus-2025-09-23
128K
$0,35
$0,35
$4,2
$4,2
Mais modelos
Nome do modelo
Código do modelo
Máximo de tokens de entrada
Entrada (pagamento conforme o uso)
Por 10k TPM/hora
Saída (pagamento conforme o uso)
Por 1k TPM/hora
Entrada (assinatura)
Por 10k TPM/dia
Saída (assinatura)
Por 1k TPM/dia
GLM-5.1
glm-5.1
64K
$2,97
$1,19
$35,65
$14,26
Faturamento por tempo (Model Unit)
Custo = Duração de uso (horas) × Quantidade de Model Units × Preço da Model Unit
No método de pagamento conforme o uso, o "Preço da Model Unit" corresponde ao "Preço por hora" indicado na tabela abaixo. Para assinaturas mensais, a fórmula é: Quantidade de meses × Quantidade de Model Units × Preço mensal.
Em assinaturas, caso você cancele durante o primeiro mês, o preço unitário diário (≈ preço unitário mensal / 30) será cobrado com um multiplicador de 1,2 sobre a tarifa padrão. Períodos de uso inferiores a um dia são faturados como um dia inteiro.
NotaNo método de pagamento conforme o uso por Model Unit, os recursos de poder computacional são alocados por ordem de chegada. Se a compra não for concluída com sucesso, o reembolso integral será emitido automaticamente.
Geração de texto
Qwen
Nome do modelo
Código do modelo
Especificação da unidade de modelo
Preço por hora (CNY)
Unidade mínima de faturamento: minuto
Preço mensal (CNY)
Unidade mínima de faturamento: dia
Qwen3.7-Plus-2026-05-26
qwen3.7-plus-2026-05-26
MU3 x 8
CNY 1,096
CNY 527,752
Qwen3.6-35B-A3B
qwen3.6-35b-a3b
MU8 x 1
CNY 47
CNY 22,400
MU9 x 1
CNY 51
CNY 24,600
Qwen3.6-27B
qwen3.6-27b
MU9 x 1
CNY 51
CNY 24,600
Qwen3.6-Flash-2026-04-16
qwen3.6-flash-2026-04-16
MU1 x 2
CNY 108
CNY 52,236
Qwen3.6-Plus-2026-04-02
qwen3.6-plus-2026-04-02
MU1 x 8
MU1 x 16 (modo de separação PD)
CNY 432
Modo de separação PD: CNY 864
CNY 208,944
Modo de separação PD: CNY 417,888
Qwen3.5-397B-A17B
qwen3.5-397b-a17b
MU2 x 8
CNY 504
CNY 240,288
MU3 x 8
MU3 x 16 (modo de separação PD)
CNY 1,096
Modo de separação PD: CNY 2,192
CNY 527,752
Modo de separação PD: CNY 1,055,504
MU6 x 16
CNY 400
CNY 193,424
Qwen3.5-122B-A10B
qwen3.5-122b-a10b
MU1 x 4
CNY 216
CNY 104,472
MU2 x 8
CNY 504
CNY 240,288
MU6 x 16
CNY 400
CNY 193,424
MU9 x 2
CNY 102
CNY 49,200
Qwen3.5-35B-A3B
qwen3.5-35b-a3b
MU1 x 2
CNY 108
CNY 52,236
MU2 x 8
CNY 504
CNY 240,288
MU8 x 1
CNY 47
CNY 22,400
MU9 x 1
CNY 51
CNY 24,600
Qwen3.5-27B
qwen3.5-27b
MU9 x 1
CNY 51
CNY 24,600
Qwen3.5-9B
qwen3.5-9b
MU8 x 1
CNY 47
CNY 22,400
MU9 x 1
CNY 51
CNY 24,600
Qwen3.5-Flash-2026-02-23
qwen3.5-flash-2026-02-23
MU1 x 2
CNY 108
CNY 52,236
Qwen3.5-Plus-2026-02-15
qwen3.5-plus-2026-02-15
MU1 x 16 (modo de separação PD)
Modo de separação PD: CNY 864
Modo de separação PD: CNY 417,888
MU3 x 8
MU3 x 16 (modo de separação PD)
CNY 1,096
Modo de separação PD: CNY 2,192
CNY 527,752
Modo de separação PD: CNY 1,055,504
Qwen3-235B-A22B-Instruct-2507
qwen3-235b-a22b-instruct-2507
MU1 x 4
CNY 216
CNY 104,472
MU2 x 8
CNY 504
CNY 240,288
Qwen3-Next-80B-A3B-Instruct
qwen3-next-80b-a3b-instruct
MU1 x 2
CNY 108
CNY 52,236
Qwen3-32B
qwen3-32b
MU1 x 4
CNY 216
CNY 104,472
MU6 x 4
CNY 100
CNY 48,356
Qwen3-30B-A3B
qwen3-30b-a3b
MU9 x 2
CNY 102
CNY 49,200
Qwen3-30B-A3B-Instruct-2507
qwen3-30b-a3b-instruct-2507
MU1 x 4
CNY 216
CNY 104,472
MU2 x 8
CNY 504
CNY 240,288
Qwen3-8B
qwen3-8b
MU1 x 2
CNY 108
CNY 52,236
MU2 x 2
CNY 126
CNY 60,072
MU5 x 1
CNY 21
CNY 10,139
Qwen3-4B
qwen3-4b
MU1 x 2
CNY 108
CNY 52,236
MU5 x 1
CNY 21
CNY 10,139
Qwen3-1.7B
qwen3-1.7b
MU1 x 2
CNY 108
CNY 52,236
MU5 x 1
CNY 21
CNY 10,139
Qwen3-Embedding-0.6B
qwen3-embedding-0.6b
MU5 x 1
CNY 21
CNY 10,139
MU6 x 1
CNY 25
CNY 12,089
Qwen3-MoE-Rerank-0.6B
qwen3-moe-rerank-0.6b
MU5 x 1
CNY 21
CNY 10,139
Qwen3-Rerank-0.6B
qwen3-rerank-0.6b
MU5 x 1
CNY 21
CNY 10,139
MU6 x 1
CNY 25
CNY 12,089
Qwen3-Max-2025-09-23
qwen3-max-2025-09-23
MU2 x 8
CNY 504
CNY 240,288
MU3 x 8
CNY 1,096
CNY 527,752
Qwen3-Rerank
qwen3-rerank
MU5 x 1
CNY 21
CNY 10,139
Qwen2.5-72B
qwen2.5-72b-instruct
MU1 x 4
CNY 216
CNY 104,472
Qwen2.5-Open-Source-32B
qwen2.5-32b-instruct
MU1 x 4
CNY 216
CNY 104,472
Qwen2.5-open-source-14B
qwen2.5-14b-instruct
MU1 x 2
CNY 108
CNY 52,236
Qwen2.5-7B
qwen2.5-7b-instruct
MU1 x 2
CNY 108
CNY 52,236
MU5 x 1
CNY 21
CNY 10,139
Qwen2.5-3B
qwen2.5-3b-instruct
MU5 x 1
CNY 21
CNY 10,139
Qwen-Flash-2025-07-28
qwen-flash-2025-07-28
MU1 x 4
CNY 216
CNY 104,472
Qwen-Plus-2025-07-28
qwen-plus-2025-07-28
MU1 x 4
MU1 x 16 (modo de separação PD)
CNY 216
Modo de separação PD: CNY 864
CNY 104,472
Modo de separação PD: CNY 417,888
Qwen-Plus-2025-12-01
qwen-plus-2025-12-01
MU1 x 4
CNY 216
CNY 104,472
GLM
Nome do modelo
Código do modelo
Especificação da unidade de modelo
Preço por hora (CNY)
Unidade mínima de faturamento: minuto
Preço mensal (CNY)
Unidade mínima de faturamento: dia
GLM-5.1
glm-5.1
MU2 x 8
MU2 x 16 (modo de separação PD)
CNY 504
Modo de separação PD: CNY 1,008
CNY 240,288
Modo de separação PD: CNY 480,576
MU3 x 16 (modo de separação PD)
Modo de separação PD: CNY 2,192
Modo de separação PD: CNY 1,055,504
MU6 x 16
CNY 400
CNY 193,424
GLM-5
glm-5
MU3 x 16 (modo de separação PD)
Modo de separação PD: CNY 2,192
Modo de separação PD: CNY 1,055,504
GLM-4.7
glm-4.7
MU6 x 32 (modo de separação PD)
Modo de separação PD: CNY 800
Modo de separação PD: CNY 386,848
DeepSeek
Nome do modelo
Código do modelo
Especificação da unidade de modelo
Preço por hora (CNY)
Unidade mínima de faturamento: minuto
Preço mensal (CNY)
Unidade mínima de faturamento: dia
DeepSeek-v4-Flash
deepseek-v4-flash
MU1 x 8
CNY 432
CNY 208,944
DeepSeek-v3.2
deepseek-v3.2
MU2 x 16 (modo de separação PD)
Modo de separação PD: CNY 1,008
Modo de separação PD: CNY 480,576
Mais modelos
Nome do modelo
Código do modelo
Especificação da unidade de modelo
Preço por hora (CNY)
Unidade mínima de faturamento: minuto
Preço mensal (CNY)
Unidade mínima de faturamento: dia
MiniMax-M2.5
MiniMax-M2.5
MU1 x 16 (modo de separação PD)
Modo de separação PD: CNY 864
Modo de separação PD: CNY 417,888
Kimi-K2.5
kimi-k2.5
MU2 x 8
CNY 504
CNY 240,288
Tipos de modelo:
Instruct - O modelo implantado executa inferência no modo sem raciocínio.
Thinking - O modelo implantado executa inferência no modo de raciocínio.
Tipos de implantação de modelo:
-
Modo de separação PD - Reduz a latência do primeiro token e melhora o throughput.
Neste modo de implantação, o processo de inferência do modelo divide as etapas de cálculo do primeiro token (Prefill) e dos tokens subsequentes (Decode) para execução em nós de computação diferentes.
Multimodal
Qwen-VL
Nome do modelo
Código do modelo
Especificação da unidade de modelo
Preço por hora (CNY)
Unidade mínima de faturamento: minuto
Preço mensal (CNY)
Unidade mínima de faturamento: dia
Qwen3-VL-235B-A22B-Instruct
qwen3-vl-235b-a22b-instruct
MU1 x 4
CNY 216
CNY 104,472
Qwen3-VL-235B-A22B-Thinking
qwen3-vl-235b-a22b-thinking
MU1 x 4
CNY 216
CNY 104,472
Qwen3-VL-32B-Instruct
qwen3-vl-32b-instruct
MU2 x 8
CNY 504
CNY 240,288
Qwen3-VL-8B-Instruct
qwen3-vl-8b-instruct
MU1 x 2
CNY 108
CNY 52,236
Qwen3-VL-4B-Instruct
qwen3-vl-4b-instruct
MU1 x 2
CNY 108
CNY 52,236
Qwen3-VL-2B-Instruct
qwen3-vl-2b-instruct
MU5 x 1
CNY 21
CNY 10,139
Qwen3-VL-Embedding-2B
qwen3-vl-embedding-2b
MU5 x 1
CNY 21
CNY 10,139
Qwen3-VL-Flash-2025-10-15
qwen3-vl-flash-2025-10-15
MU1 x 4
CNY 216
CNY 104,472
Qwen3-VL-Plus-2025-09-23
qwen3-vl-plus-2025-09-23
MU1 x 4
CNY 216
CNY 104,472
Qwen-VL-Max-2025-08-13
qwen-vl-max-2025-08-13
MU6 x 4
CNY 100
CNY 48,356
Qwen-VL-OCR-2025-11-20
qwen-vl-ocr-2025-11-20
MU6 x 4
CNY 100
CNY 48,356
Qwen Omni
Nome do modelo
Código do modelo
Especificação da unidade de modelo
Preço por hora (CNY)
Unidade mínima de faturamento: minuto
Preço mensal (CNY)
Unidade mínima de faturamento: dia
Qwen3.5-Omni-Flash
qwen3.5-omni-flash
MU8 x 1
CNY 47
CNY 22,400
MU9 x 1
CNY 51
CNY 24,600
Qwen3.5-Omni-Plus
qwen3.5-omni-plus
MU9 x 8
CNY 408
CNY 196,800
Tipos de modelo:
Instruct - O modelo implantado executa inferência no modo sem raciocínio.
Thinking - O modelo implantado executa inferência no modo de raciocínio.
Instruct/Thinking - Você pode escolher se deseja ativar o modo de raciocínio ao implantar o modelo.
Síntese de fala
CosyVoice
Nome do modelo
Código do modelo
Especificação da unidade de modelo
Preço por hora (CNY)
Preço mensal (CNY)
cosyvoice-v3-flash
cosyvoice-v3-flash
MU5
CNY 21
CNY 10,139
Singapura
Geração de texto
Nome do modelo
Código do modelo
Especificação da unidade de modelo
Preço por hora ($)
Unidade mínima de faturamento: minuto
Preço mensal ($)
Unidade mínima de faturamento: dia
Qwen3.6-Plus-2026-04-02
qwen3.6-plus-2026-04-02
MU1 x 8
$88
$41,832
Qwen3.5-39B-A17B
qwen3.5-397b-a17b
MU2 x 8
$112
$52,392
Qwen3.5-35B-A3B
qwen3.5-35b-a3b
MU2 x 8
$112
$52,392
Qwen3-32B
qwen3-32b
MU1 x 4
$44
$20,916
MU2 x 8
$112
$52,392
Qwen3-14B
qwen3-14b
MU1 x 4
$44
$20,916
GLM-5.1
glm-5.1
MU2 x 8
$112
$52,392
DeepSeek-V4-Flash
deepseek-v4-flash
MU1 x 8
$88
$41,832
Multimodal
Nome do modelo
Código do modelo
Especificação da unidade de modelo
Preço por hora ($)
Unidade mínima de faturamento: minuto
Preço mensal ($)
Unidade mínima de faturamento: dia
Qwen3-VL-32B-Instruct
qwen3-vl-32b-instruct
MU2 x 8
$112
$52,392
Qwen3-VL-8B-Instruct
qwen3-vl-8b-instruct
MU1 x 2
$22
$10,458
Tipos de modelo:
Instruct - O modelo implantado executa inferência no modo sem raciocínio.
China (Pequim)
Geração de texto
Qwen
Nome do modelo
Código do modelo
Especificação da unidade de modelo
Preço por hora ($)
Unidade mínima de faturamento: minuto
Preço mensal ($)
Unidade mínima de faturamento: dia
Qwen3.7-Plus-2026-05-26
qwen3.7-plus-2026-05-26
MU3 x 8
$150.72
$72,577.152
Qwen3.6-35B-A3B
qwen3.6-35b-a3b
MU8 x 1
$6.464
$3,080.477
MU9 x 1
$7.014
$3,383.024
Qwen3.6-27B
qwen3.6-27b
MU9 x 1
$7.014
$3,383.024
Qwen3.6-Flash-2026-04-16
qwen3.6-flash-2026-04-16
MU1 x 2
$14.852
$7,183.564
Qwen3.6-Plus-2026-04-02
qwen3.6-plus-2026-04-02
MU1 x 8
$59.408
$28,734.256
Qwen3.5-397B-A17B
qwen3.5-397b-a17b
MU2 x 8
$69.312
$33,044.72
MU3 x 8
$150.72
$72,577.152
MU6 x 16
$55.008
$26,599.92
Qwen3.5-122B-A10B
qwen3.5-122b-a10b
MU1 x 4
$29.704
$14,367.128
MU2 x 8
$69.312
$33,044.72
MU6 x 16
$55.008
$26,599.92
MU9 x 2
$14.028
$6,766.048
Qwen3.5-35B-A3B
qwen3.5-35b-a3b
MU1 x 2
$14.852
$7,183.564
MU2 x 8
$69.312
$33,044.72
MU8 x 1
$6.464
$3,080.477
MU9 x 1
$7.014
$3,383.024
Qwen3.5-27B
qwen3.5-27b
MU9 x 1
$7.014
$3,383.024
Qwen3.5-9B
qwen3.5-9b
MU8 x 1
$6.464
$3,080.477
MU9 x 1
$7.014
$3,383.024
Qwen3.5-Flash-2026-02-23
qwen3.5-flash-2026-02-23
MU1 x 2
$14.852
$7,183.564
Qwen3.5-Plus-2026-02-15
qwen3.5-plus-2026-02-15
MU1 x 8
$59.408
$28,734.256
MU3 x 8
$150.72
$72,577.152
Qwen3-235B-A22B-Instruct
qwen3-235b-a22b-instruct-2507
MU1 x 4
$29.704
$14,367.128
MU2 x 8
$69.312
$33,044.72
Qwen3-Next-80B-A3B-Instruct
qwen3-next-80b-a3b-instruct
MU1 x 2
$14.852
$7,183.564
Qwen3-32B
qwen3-32b
MU1 x 4
$29.704
$14,367.128
MU6 x 4
$13.752
$6,649.98
Qwen3-30B-A3B
qwen3-30b-a3b
MU9 x 2
$14.028
$6,766.048
Qwen3-30B-A3B-Instruct-2507
qwen3-30b-a3b-instruct-2507
MU1 x 4
$29.704
$14,367.128
MU2 x 8
$69.312
$33,044.72
Qwen3-8B
qwen3-8b
MU1 x 2
$14.852
$7,183.564
MU2 x 2
$17.328
$8,261.18
MU5 x 1
$2.888
$1,394.329
Qwen3-4B
qwen3-4b
MU1 x 2
$14.852
$7,183.564
MU5 x 1
$2.888
$1,394.329
Qwen3-1.7B
qwen3-1.7b
MU1 x 2
$14.852
$7,183.564
MU5 x 1
$2.888
$1,394.329
Qwen3-Max-2025-09-23
qwen3-max-2025-09-23
MU2 x 8
$69.312
$33,044.72
MU3 x 8
$150.72
$72,577.152
Qwen2.5-72B
qwen2.5-72b-instruct
MU1 x 4
$29.704
$14,367.128
Qwen2.5-32B
qwen2.5-32b-instruct
MU1 x 4
$29.704
$14,367.128
Qwen2.5-14B
qwen2.5-14b-instruct
MU1 x 2
$14.852
$7,183.564
Qwen2.5-7B
qwen2.5-7b-instruct
MU1 x 2
$14.852
$7,183.564
MU5 x 1
$2.888
$1,394.329
Qwen2.5-3B-Instruct
qwen2.5-3b-instruct
MU5 x 1
$2.888
$1,394.329
Qwen-Flash-2025-07-28
qwen-flash-2025-07-28
MU1 x 4
$29.704
$14,367.128
Qwen-Plus-2025-07-28
qwen-plus-2025-07-28
MU1 x 4
$29.704
$14,367.128
Qwen-Plus-2025-12-01
qwen-plus-2025-12-01
MU1 x 4
$29.704
$14,367.128
GLM
Nome do modelo
Código do modelo
Especificação da unidade de modelo
Preço por hora ($)
Unidade mínima de faturamento: minuto
Preço mensal ($)
Unidade mínima de faturamento: dia
GLM-5.1
glm-5.1
MU2 x 8
$69.312
$33,044.72
MU3 x 8
$150.72
$72,577.152
MU6 x 16
$55.008
$26,599.92
GLM-5
glm-5
MU3 x 8
$150.72
$72,577.152
GLM-4.7
glm-4.7
MU6 x 16
$55.008
$26,599.92
DeepSeek
Nome do modelo
Código do modelo
Especificação da unidade de modelo
Preço por hora ($)
Unidade mínima de faturamento: minuto
Preço mensal ($)
Unidade mínima de faturamento: dia
DeepSeek-V4-Flash
deepseek-v4-flash
MU1 x 8
$59.408
$28,734.256
DeepSeek-V3.2
deepseek-v3.2
MU2 x 8
$69.312
$33,044.72
Outros modelos
Nome do modelo
Código do modelo
Especificação da unidade de modelo
Preço por hora ($)
Unidade mínima de faturamento: minuto
Preço mensal ($)
Unidade mínima de faturamento: dia
MiniMax-M2.5
MiniMax-M2.5
MU1 x 8
$59.408
$28,734.256
Kimi-K2.5
kimi-k2.5
MU2 x 8
$69.312
$33,044.72
Multimodal
Qwen-VL
Nome do modelo
Código do modelo
Especificação da unidade de modelo
Preço por hora ($)
Unidade mínima de faturamento: minuto
Preço mensal ($)
Unidade mínima de faturamento: dia
Qwen3-VL-235B-A22B-Instruct
qwen3-vl-235b-a22b-instruct
MU1 x 4
$29.704
$14,367.128
Qwen3-VL-235B-A22B-Thinking
qwen3-vl-235b-a22b-thinking
MU1 x 4
$29.704
$14,367.128
Qwen3-VL-32B-Instruct
qwen3-vl-32b-instruct
MU2 x 8
$69.312
$33,044.72
Qwen3-VL-8B-Instruct
qwen3-vl-8b-instruct
MU1 x 2
$14.852
$7,183.564
Qwen3-VL-Flash-2025-10-15
qwen3-vl-flash-2025-10-15
MU1 x 4
$29.704
$14,367.128
Qwen3-VL-Plus-2025-09-23
qwen3-vl-plus-2025-09-23
MU1 x 4
$29.704
$14,367.128
Qwen-VL-Max-2025-08-13
qwen-vl-max-2025-08-13
MU6 x 4
$13.752
$6,649.98
Qwen-VL-OCR-2025-11-20
qwen-vl-ocr-2025-11-20
MU6 x 4
$13.752
$6,649.98
Qwen Omni
Nome do modelo
Código do modelo
Especificação da unidade de modelo
Preço por hora ($)
Unidade mínima de faturamento: minuto
Preço mensal ($)
Unidade mínima de faturamento: dia
Qwen3.5-Omni-Flash
qwen3.5-omni-flash
MU8 x 1
$6.464
$3,080.477
MU9 x 1
$7.014
$3,383.024
Qwen3.5-Omni-Plus
qwen3.5-omni-plus
MU9 x 8
$56.112
$27,064.192
Tipos de modelo:
Instruct - O modelo implantado executa inferência no modo sem raciocínio.
Thinking - O modelo implantado executa inferência no modo de raciocínio.
Por uso de tokens do modelo
Custo = Número de Tokens de Entrada × Preço Unitário de Entrada + Número de Tokens de Saída × Preço Unitário de Saída (Unidade mínima de faturamento: 1 token)
O faturamento por uso de tokens do modelo só está disponível após a conclusão do Supervised Fine-Tuning (SFT) para os seguintes foundation models e a obtenção de um modelo personalizado.
Qwen
Qwen-VL
Singapore
Foundation model
Código do modelo
Entrada
$/1k tokens
Saída
$/1k tokens
Qwen3-14B
qwen3-14b
$0,00035
Modo sem raciocínio: $0,0014
Modo de raciocínio: $0,0042
Para implantar mais modelos, consulte esta solução e escolha o plano de implantação mais adequado às necessidades do seu negócio.
Método de implantação
Para implantar modelos no console, siga estas etapas:
Se você receber um erro de permissão, consulte O que fazer se eu receber um erro de permissão durante a implantação?
|
|
|
|
Importante
As cobranças são geradas após a implantação bem-sucedida do modelo. |
Configuração de implantação
Model unit
|
Configuração |
Detalhes |
|
Service Name |
Nome personalizado do serviço de implantação. |
|
Select Model |
Selecione o modelo a ser implantado, incluindo modelos pré-treinados da plataforma e modelos ajustados (fine-tuned). |
|
Model Unit Type |
Selecione a especificação de implantação. Especificações diferentes correspondem a diferentes capacidades de computação e desempenho. |
|
Number of Replicas |
Defina o número inicial de réplicas de implantação, o que afeta a capacidade de processamento simultâneo do serviço. |
|
Deployment Template |
Selecione um modelo de implantação, como "Single-Machine Deployment". Modelos diferentes correspondem a planos distintos de configuração de recursos. Esta opção está disponível apenas no modo de faturamento por model unit. |
|
Configure Model Inference Mode |
Ao implantar alguns modelos usando o método Model Unit, é possível configurar o modo de inferência, o comprimento máximo de contexto e outras definições.
|
|
Maximum Context |
Esta configuração é compatível com o modo de implantação Model Unit para alguns modelos. O comprimento máximo de contexto depende do tipo de modelo. |
|
Service Throttling |
Esta definição é suportada no modo de implantação Model Unit de determinados modelos. Permite limitar o RPM e o TPM das chamadas ao modelo. |
Página da lista de implantações
Após uma implantação bem-sucedida, visualize e gerencie todos os serviços implantados na página da lista de implantações. A página contém as seguintes informações:
Service Name: Nome do serviço de implantação. Clique no nome para visualizar os detalhes da implantação.
Model Name: Modelo utilizado na implantação.
Model Code: Identificador exclusivo gerado após a implantação bem-sucedida do modelo. Utilizado para especificar o modelo nas chamadas de API.
Deployment Status/Event Status: Inclui estados como Pending Deployment, Deploying, Running, Deployment Failed, Unpublishing, Service Paused, Stopped, Deleting, Unsubscribed/Overdue, Resuming, Running (Upgrading/Downgrading) e Running (Upgrade/Downgrade Failed).
Billing Method: Método de faturamento atual do serviço de implantação.
Deployment Details: Informações de configuração, como tipo de model unit e número de réplicas.
Rate Limiting Details: Exibe a configuração de limitação de taxa do serviço de implantação atual, como requisições por minuto (RPM) e tokens por minuto (TPM).
Service Time: Mostra os horários de criação e expiração do serviço de implantação.
Operation: Dependendo do status da implantação e do método de faturamento, execute operações como Update, Monitoring, Scaling, Renewal, Unpublish, Delete e Experience.
Chamadas pós-implantação
Após a implantação bem-sucedida de um modelo, chame-o usando Compatível com OpenAI, Dashscope e Assistant SDK.
Ao chamar um modelo implantado com sucesso, o valor de model deve ser o code do modelo gerado após a implantação. Acesse o Model Deployment console para obter o Model Code.

DashScope
import os
import dashscope
messages = [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Who are you?"},
]
dashscope.base_http_api_url = 'https://dashscope-intl.aliyuncs.com/api/v1'
response = dashscope.Generation.call(
# If the environment variable is not configured, replace the next line with: api_key="sk-xxx",
api_key=os.getenv("DASHSCOPE_API_KEY"),
model="qwen3-max-xxx-xxx", # Replace with the code generated after the model is successfully deployed
messages=messages,
result_format="message",
enable_thinking=False,
)
print(response)
Interface compatível com OpenAI
import os
from openai import OpenAI
client = OpenAI(
# If the environment variable is not configured, replace the next line with: api_key="sk-xxx",
api_key=os.getenv('DASHSCOPE_API_KEY'),
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
completion = client.chat.completions.create(
model="qwen3-max-xxx-xxx", # Replace with the code generated after the model is successfully deployed
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Who are you?"},
],
extra_body={"enable_thinking": False},
)
print(completion)
Dimensionar serviços de implantação
Provisioned Throughput (Baseado em tempo): Clique no botão Scaling para ajustar manualmente o número de instâncias. Para regras específicas de reembolso em downgrades, consulte Regras de reembolso para downgrades.
Model Unit (Baseado em tempo): Clique no botão Scaling para ajustar manualmente o número de instâncias.
Também é possível clicar no botão Scaling Configuration na coluna Operation para configurar políticas de dimensionamento automático, incluindo limiares de dimensionamento, número mínimo/máximo de réplicas e dimensionamento agendado.
Despublicar um serviço
Acesse o Model Deployment console, localize o serviço de implantação a ser interrompido e clique na operação correspondente com base no método de faturamento:
Model Unit (Assinatura): Clique em Deactivate e confirme.
Pagamento conforme o uso: Clique em Delete e confirme.
O faturamento é interrompido após a conclusão da operação.

Outras operações
Além de despublicar, a coluna Operation na página da lista de implantações suporta as seguintes operações:
Update: Atualize a versão do modelo de um serviço implantado. A atualização pode ser feita de uma só vez ou em lotes (canary release).
Delete: Serviços de pagamento conforme o uso podem ser excluídos diretamente para interromper o faturamento.
Renewal: Serviços de assinatura podem ser renovados para estender o tempo de serviço. A renovação automática é suportada.
Purchase Capacity Package: Adquira um pacote de capacidade para uma implantação de provisioned throughput.
Perguntas frequentes
Posso carregar e implantar meus próprios modelos?
Atualmente, não há suporte para carregar e implantar seus próprios modelos. Recomendamos acompanhar as últimas atualizações do Alibaba Cloud Model Studio.
Além disso, o Alibaba Cloud Platform for AI (PAI) oferece funcionalidade para implantar seus próprios modelos. Para mais informações, consulte Implantação de modelos de linguagem grande PAI-LLM.
O que fazer se eu receber um erro de permissão durante a implantação?
-
Se você vir a mensagem "You do not have the required permissions for this module", verifique se sua conta possui a permissão Model Deployment - Operation na página de gerenciamento de permissões do workspace.

Caso não consiga realizar a operação, entre em contato com sua organização ou administrador de TI para adicionar as permissões necessárias ou verificar problemas de permissão.
-
Se a implantação falhar com o erro "Workspace xxx does not have deployment privilege for model xxxx", acesse a página Workspace Management no Model Studio e adicione a permissão de implantação do modelo correspondente ao workspace.
Erro de chamada de API:
Workspace xxx does not have deployment privilege for model xxxx.

Se receber um erro de permissão, contate sua organização ou administrador de TI para adicionar as permissões necessárias ou executar a operação em seu nome.




