Todos os produtos
Search
Central de documentação

Alibaba Cloud Model Studio:Model deployment

Última atualização: Jul 08, 2026

Implante modelos pré-treinados da plataforma ou seus próprios modelos ajustados para obter um serviço de inferência independente e dedicado. Esse serviço atende a necessidades de negócios que exigem alta concorrência, baixa latência e outros requisitos de desempenho.

É possível implantar modelos pré-treinados da plataforma ou seus próprios modelos

ajustados

Métodos de faturamento

Antes de implantar um modelo, visualize o custo horário estimado para diferentes modelos no Model Deployment console .
Nota

Não é possível alterar o método de faturamento após a criação do serviço. Para mudar o método de faturamento, cancele a publicação do modelo implantado e implante-o novamente.

Provisioned Throughput (PTU)

(Alto throughput e alto desempenho)

Model Unit

(Métricas de desempenho personalizadas e isolamento de recursos)

Token Usage

(Pagamento conforme o uso para modelos ajustados e validação de desempenho)

Definição

Método de implantação de modelos que reserva recursos da plataforma para garantir um throughput específico de Tokens por Minuto (TPM). Nenhum limite de taxa é aplicado dentro da cota garantida.

Método de implantação de modelos que aloca poder computacional com base na duração do uso e na quantidade de unidades de modelo. Os recursos são dedicados.

Método de implantação de modelos em que o uso é medido com base nos tokens de entrada e saída de cada chamada de API.

Vantagens

  1. Oferece capacidade de throughput estável, menor latência e maior previsibilidade de recursos para ambientes de produção com alta carga.

  2. Em comparação ao faturamento por uso de tokens, os Tokens por Segundo (TPS) costumam ser de 1,5 a 2,0 vezes maiores.

  3. Compatível com renovação automática.

  1. Permite personalizar métricas de desempenho, como latência e throughput.

  2. Compatível com renovação automática.

Sem cobrança se não houver uso.

Modelos suportados

Alguns modelos pré-treinados

Alguns modelos pré-treinados e todos os modelos ajustados

Alguns modelos ajustados com LoRA

Cenários

  1. Atendimento ao cliente inteligente para aplicativo bancário (tráfego estável, exige garantia de experiência simultânea).

  2. Moderação de conteúdo em tempo real para plataforma de mídia social (requer processamento estável de tarefas previsíveis em pipeline).

  3. API de tradução em nuvem pública (fornece garantia de serviço básico para usuários do plano padrão).

  1. Modelo grande ajustado especificamente para e-commerce (implante um modelo privado e escale horizontalmente de forma manual durante promoções).

  2. Modelo de triagem molecular para empresa farmacêutica (exige recursos dedicados para tarefas de longa duração).

  3. Simulação de direção autônoma (requer computação contínua de longo prazo).

Validação do desempenho de um modelo ajustado

Diagrama de faturamento

image

image

image

Método de faturamento

Cobrança baseada na duração do uso e no throughput provisionado.

Suporta pagamento conforme o uso e assinatura diária.

Cobrança baseada na duração do uso e na quantidade de unidades de modelo.

Suporta pagamento conforme o uso e assinatura mensal.

Uso de tokens por modelo

Suporta pagamento conforme o uso.

Método de dimensionamento

Aumente ou diminua o throughput manualmente.

Aumente ou diminua a quantidade de unidades de modelo manualmente.

Envie uma solicitação no console e aguarde a revisão manual.

Restrições do produto

  1. A assinatura tem faturamento diário. Não há reembolso por rescisão antecipada.

  2. Se o uso exceder o throughput adquirido dentro de uma unidade de tempo, o serviço mudará automaticamente para o serviço de invocação de modelo fornecido pelo Model Studio.

Para assinaturas, caso você cancele dentro do primeiro mês, o preço unitário diário (≈ preço unitário mensal / 30) será cobrado com uma taxa de 1,2 vezes o preço padrão.

  1. Suporta apenas alguns modelos ajustados com LoRA.

  2. Os recursos são liberados automaticamente se não forem utilizados por um mês.

Para visualizar o uso de tokens e o histórico de chamadas de uma única invocação, acesse Model Monitoring.

Detalhes de faturamento

Instruções

  1. Leia o conteúdo em inglês para compreender O QUE precisa ser comunicado

  2. Escreva o texto em português do Brasil DO ZERO — esqueça a estrutura das frases em inglês

  3. Preserve toda a formatação markdown, blocos de código, links e imagens exatamente como estão

  4. Tags xref (<a data-tag="xref" ...>texto</a>) — preserve A TAG INTEIRA com todos os atributos na ordem e capitalização originais, traduza APENAS o texto visível entre > e

  5. Aplique todas as regras específicas do idioma rigorosamente

  6. Aplique as regras de stopwords com tolerância zero

  7. Use o modo imperativo em passos numerados e listas de procedimentos

  8. Garanta a consistência terminológica — o mesmo termo deve ter a mesma tradução em todo o documento

  9. Varie os inícios de frase em listas e tabelas — nenhum início deve se repetir 3 ou mais vezes

  10. Retorne APENAS o documento markdown em português do Brasil, sem explicações

    Faturamento por tempo (Provisioned Throughput)

    Custo = Duração do uso × (Preço unitário de TPM de entrada × TPM de entrada + Preço unitário de TPM de saída × TPM de saída)

    No método de pagamento conforme o uso, a cobrança é feita por hora e o preço unitário segue as tarifas horárias da tabela abaixo. Já na modalidade de assinatura, o faturamento ocorre diariamente, com base nas tarifas diárias apresentadas na mesma tabela.

    • Os pedidos de assinatura entram em vigor imediatamente após o pagamento. Uma assinatura de N dias permanece válida até as 23:59 do N-ésimo dia. Caso o pedido seja realizado após as 22:00, a data de expiração é prorrogada automaticamente por um dia.

    • Após a expiração de um pedido de assinatura, o serviço é interrompido depois de um período de carência de 2 horas. Com a interrupção do serviço, os recursos são mantidos por 14 horas e, em seguida, liberados.

    • Não é possível encerrar pedidos de assinatura antecipadamente.

    • No pagamento conforme o uso, se houver pagamentos em atraso na sua conta, os recursos implantados permanecem ativos e continuam sendo cobrados por 24 horas, período em que o serviço segue disponível. Passadas essas 24 horas, o sistema interrompe o faturamento e a implantação do modelo entra em estado de inadimplência. Os recursos subjacentes são excluídos, mas a tarefa de implantação do modelo é preservada. Após quitar o valor pendente, o sistema realoca os recursos, restaura o serviço e retoma a cobrança. Para parar de gerar encargos, exclua a tarefa de implantação do modelo. O faturamento cessa assim que a exclusão for concluída com sucesso.

    Se a entrada do modelo exceder o máximo de tokens de entrada ou o TPM adquirido, a chamada muda automaticamente para o modo de pagamento conforme o uso para o modelo atual. Nesse cenário, o desempenho da inferência pode diminuir e ficará sujeito ao controle de tráfego público do snapshot model atual no workspace. Os Custos são cobrados com base no padrão de invocação de modelo (pagamento conforme o uso).

    • Nessa situação, a chamada de API retorna um cabeçalho contendo x-dashscope-ptu-overflow:true.

    • Para visualizar estatísticas de TPM, acesse Model Monitoring.

    Para consultar as regras específicas de reembolso em cenários de scale-in (downgrades), consulte Regras de reembolso para downgrades.

    Qwen

    DeepSeek

    Qwen-VL

    Mais modelos

    Singapura

    Qwen

    Nome do modelo

    Código do modelo

    Máximo de tokens de entrada

    Entrada (pagamento conforme o uso)

    Por 10k TPM/hora

    Saída (pagamento conforme o uso)

    Por 1k TPM/hora

    Entrada (assinatura)

    Por 10k TPM/dia

    Saída (assinatura)

    Por 1k TPM/dia

    Qwen3.7-Max-2026-05-20

    qwen3.7-max-2026-05-20

    256K

    $6

    $1,8

    $72

    $21,6

    Qwen3.7-Plus-2026-05-26

    qwen3.7-plus-2026-05-26

    256K

    $0,96

    $0,384

    $11,52

    $4,608

    Qwen3.6-Plus-2026-04-02

    qwen3.6-plus-2026-04-02

    128K

    $1,2

    $0,72

    $14,4

    $8,64

    Qwen3.5-Plus-2026-04-20

    qwen3.5-plus-2026-04-20

    128K

    $0,96

    $0,576

    $11,52

    $6,912

    DeepSeek

    Nome do modelo

    Código do modelo

    Máximo de tokens de entrada

    Entrada (pagamento conforme o uso)

    Por 10k TPM/hora

    Saída (pagamento conforme o uso)

    Por 1k TPM/hora

    Entrada (assinatura)

    Por 10k TPM/dia

    Saída (assinatura)

    Por 1k TPM/dia

    DeepSeek-v4-Flash

    deepseek-v4-flash

    256K

    $0,72

    $0,144

    $8,64

    $1,728

    DeepSeek-v4-Pro

    deepseek-v4-pro

    256K

    $8,64

    $1,728

    $103,68

    $20,736

    DeepSeek-v3.2

    deepseek-v3.2

    64K

    $2,05

    $0,616

    $24,62

    $7,387

    Qwen-VL

    Nome do modelo

    Código do modelo

    Máximo de tokens de entrada

    Entrada (pagamento conforme o uso)

    Por 10k TPM/hora

    Saída (pagamento conforme o uso)

    Por 1k TPM/hora

    Entrada (assinatura)

    Por 10k TPM/dia

    Saída (assinatura)

    Por 1k TPM/dia

    Qwen3-VL-Plus-2025-09-23

    qwen3-vl-plus-2025-09-23

    128K

    $0,48

    $0,384

    $5,76

    $4,608

    Mais modelos

    Nome do modelo

    Código do modelo

    Máximo de tokens de entrada

    Entrada (pagamento conforme o uso)

    Por 10k TPM/hora

    Saída (pagamento conforme o uso)

    Por 1k TPM/hora

    Entrada (assinatura)

    Por 10k TPM/dia

    Saída (assinatura)

    Por 1k TPM/dia

    GLM-5.1

    glm-5.1

    64K

    $5,04

    $1,584

    $64,8

    $19,008

    China (Pequim)

    Qwen

    Nome do modelo

    Código do modelo

    Máximo de tokens de entrada

    Entrada (pagamento conforme o uso)

    Por 10k TPM/hora

    Saída (pagamento conforme o uso)

    Por 1k TPM/hora

    Entrada (assinatura)

    Por 10k TPM/dia

    Saída (assinatura)

    Por 1k TPM/dia

    Qwen3.7-Max-2026-05-20

    qwen3.7-max-2026-05-20

    256K

    $3,96

    $1,188

    $47,53

    $14,258

    Qwen3.7-Plus-2026-05-26

    qwen3.7-plus-2026-05-26

    256K

    $0,66

    $0,264

    $7,92

    $3,168

    Qwen3.6-Plus-2026-04-02

    qwen3.6-plus-2026-04-02

    128K

    $0,67

    $0,397

    $7,93

    $4,753

    Qwen3.5-Plus-2026-04-20

    qwen3.5-plus-2026-04-20

    128K

    $0,26

    $0,16

    $3,17

    $1,9

    Qwen3-Max-2025-09-23

    qwen3-max-2025-09-23

    128K

    $1,11

    $0,45

    $13,32

    $5,4

    Qwen-Flash-2025-07-28

    qwen-flash-2025-07-28

    128K

    $0,06

    $0,06

    $0,72

    $0,72

    Qwen-Plus-2025-12-01

    qwen-plus-2025-12-01

    128K

    $0,28

    Modo sem raciocínio: $0,07

    Modo de raciocínio: $0,28

    $3,36

    Modo sem raciocínio: $0,84

    Modo de raciocínio: $3,36

    DeepSeek

    Nome do modelo

    Código do modelo

    Máximo de tokens de entrada

    Entrada (pagamento conforme o uso)

    Por 10k TPM/hora

    Saída (pagamento conforme o uso)

    Por 1k TPM/hora

    Entrada (assinatura)

    Por 10k TPM/dia

    Saída (assinatura)

    Por 1k TPM/dia

    DeepSeek-v4-Flash

    deepseek-v4-flash

    256K

    $0,5

    $0,099

    $5,94

    $1,188

    DeepSeek-v4-Pro

    deepseek-v4-pro

    256K

    $5,94

    $1,188

    $71,3

    $14,26

    DeepSeek-v3.2

    deepseek-v3.2

    64K

    $1,04

    $0,16

    $12,48

    $1,92

    DeepSeek-v3

    deepseek-v3

    64K

    $0,99

    $0,396

    $11,9

    $4,75

    Qwen-VL

    Nome do modelo

    Código do modelo

    Máximo de tokens de entrada

    Entrada (pagamento conforme o uso)

    Por 10k TPM/hora

    Saída (pagamento conforme o uso)

    Por 1k TPM/hora

    Entrada (assinatura)

    Por 10k TPM/dia

    Saída (assinatura)

    Por 1k TPM/dia

    Qwen3-VL-Plus-2025-09-23

    qwen3-vl-plus-2025-09-23

    128K

    $0,35

    $0,35

    $4,2

    $4,2

    Mais modelos

    Nome do modelo

    Código do modelo

    Máximo de tokens de entrada

    Entrada (pagamento conforme o uso)

    Por 10k TPM/hora

    Saída (pagamento conforme o uso)

    Por 1k TPM/hora

    Entrada (assinatura)

    Por 10k TPM/dia

    Saída (assinatura)

    Por 1k TPM/dia

    GLM-5.1

    glm-5.1

    64K

    $2,97

    $1,19

    $35,65

    $14,26

    Faturamento por tempo (Model Unit)

    Custo = Duração de uso (horas) × Quantidade de Model Units × Preço da Model Unit

    No método de pagamento conforme o uso, o "Preço da Model Unit" corresponde ao "Preço por hora" indicado na tabela abaixo. Para assinaturas mensais, a fórmula é: Quantidade de meses × Quantidade de Model Units × Preço mensal.

    • Em assinaturas, caso você cancele durante o primeiro mês, o preço unitário diário (≈ preço unitário mensal / 30) será cobrado com um multiplicador de 1,2 sobre a tarifa padrão. Períodos de uso inferiores a um dia são faturados como um dia inteiro.

    Nota

    No método de pagamento conforme o uso por Model Unit, os recursos de poder computacional são alocados por ordem de chegada. Se a compra não for concluída com sucesso, o reembolso integral será emitido automaticamente.

    Geração de texto

    Qwen

    Nome do modelo

    Código do modelo

    Especificação da unidade de modelo

    Preço por hora (CNY)

    Unidade mínima de faturamento: minuto

    Preço mensal (CNY)

    Unidade mínima de faturamento: dia

    Qwen3.7-Plus-2026-05-26

    qwen3.7-plus-2026-05-26

    MU3 x 8

    CNY 1,096

    CNY 527,752

    Qwen3.6-35B-A3B

    qwen3.6-35b-a3b

    MU8 x 1

    CNY 47

    CNY 22,400

    MU9 x 1

    CNY 51

    CNY 24,600

    Qwen3.6-27B

    qwen3.6-27b

    MU9 x 1

    CNY 51

    CNY 24,600

    Qwen3.6-Flash-2026-04-16

    qwen3.6-flash-2026-04-16

    MU1 x 2

    CNY 108

    CNY 52,236

    Qwen3.6-Plus-2026-04-02

    qwen3.6-plus-2026-04-02

    MU1 x 8

    MU1 x 16 (modo de separação PD)

    CNY 432

    Modo de separação PD: CNY 864

    CNY 208,944

    Modo de separação PD: CNY 417,888

    Qwen3.5-397B-A17B

    qwen3.5-397b-a17b

    MU2 x 8

    CNY 504

    CNY 240,288

    MU3 x 8

    MU3 x 16 (modo de separação PD)

    CNY 1,096

    Modo de separação PD: CNY 2,192

    CNY 527,752

    Modo de separação PD: CNY 1,055,504

    MU6 x 16

    CNY 400

    CNY 193,424

    Qwen3.5-122B-A10B

    qwen3.5-122b-a10b

    MU1 x 4

    CNY 216

    CNY 104,472

    MU2 x 8

    CNY 504

    CNY 240,288

    MU6 x 16

    CNY 400

    CNY 193,424

    MU9 x 2

    CNY 102

    CNY 49,200

    Qwen3.5-35B-A3B

    qwen3.5-35b-a3b

    MU1 x 2

    CNY 108

    CNY 52,236

    MU2 x 8

    CNY 504

    CNY 240,288

    MU8 x 1

    CNY 47

    CNY 22,400

    MU9 x 1

    CNY 51

    CNY 24,600

    Qwen3.5-27B

    qwen3.5-27b

    MU9 x 1

    CNY 51

    CNY 24,600

    Qwen3.5-9B

    qwen3.5-9b

    MU8 x 1

    CNY 47

    CNY 22,400

    MU9 x 1

    CNY 51

    CNY 24,600

    Qwen3.5-Flash-2026-02-23

    qwen3.5-flash-2026-02-23

    MU1 x 2

    CNY 108

    CNY 52,236

    Qwen3.5-Plus-2026-02-15

    qwen3.5-plus-2026-02-15

    MU1 x 16 (modo de separação PD)

    Modo de separação PD: CNY 864

    Modo de separação PD: CNY 417,888

    MU3 x 8

    MU3 x 16 (modo de separação PD)

    CNY 1,096

    Modo de separação PD: CNY 2,192

    CNY 527,752

    Modo de separação PD: CNY 1,055,504

    Qwen3-235B-A22B-Instruct-2507

    qwen3-235b-a22b-instruct-2507

    MU1 x 4

    CNY 216

    CNY 104,472

    MU2 x 8

    CNY 504

    CNY 240,288

    Qwen3-Next-80B-A3B-Instruct

    qwen3-next-80b-a3b-instruct

    MU1 x 2

    CNY 108

    CNY 52,236

    Qwen3-32B

    qwen3-32b

    MU1 x 4

    CNY 216

    CNY 104,472

    MU6 x 4

    CNY 100

    CNY 48,356

    Qwen3-30B-A3B

    qwen3-30b-a3b

    MU9 x 2

    CNY 102

    CNY 49,200

    Qwen3-30B-A3B-Instruct-2507

    qwen3-30b-a3b-instruct-2507

    MU1 x 4

    CNY 216

    CNY 104,472

    MU2 x 8

    CNY 504

    CNY 240,288

    Qwen3-8B

    qwen3-8b

    MU1 x 2

    CNY 108

    CNY 52,236

    MU2 x 2

    CNY 126

    CNY 60,072

    MU5 x 1

    CNY 21

    CNY 10,139

    Qwen3-4B

    qwen3-4b

    MU1 x 2

    CNY 108

    CNY 52,236

    MU5 x 1

    CNY 21

    CNY 10,139

    Qwen3-1.7B

    qwen3-1.7b

    MU1 x 2

    CNY 108

    CNY 52,236

    MU5 x 1

    CNY 21

    CNY 10,139

    Qwen3-Embedding-0.6B

    qwen3-embedding-0.6b

    MU5 x 1

    CNY 21

    CNY 10,139

    MU6 x 1

    CNY 25

    CNY 12,089

    Qwen3-MoE-Rerank-0.6B

    qwen3-moe-rerank-0.6b

    MU5 x 1

    CNY 21

    CNY 10,139

    Qwen3-Rerank-0.6B

    qwen3-rerank-0.6b

    MU5 x 1

    CNY 21

    CNY 10,139

    MU6 x 1

    CNY 25

    CNY 12,089

    Qwen3-Max-2025-09-23

    qwen3-max-2025-09-23

    MU2 x 8

    CNY 504

    CNY 240,288

    MU3 x 8

    CNY 1,096

    CNY 527,752

    Qwen3-Rerank

    qwen3-rerank

    MU5 x 1

    CNY 21

    CNY 10,139

    Qwen2.5-72B

    qwen2.5-72b-instruct

    MU1 x 4

    CNY 216

    CNY 104,472

    Qwen2.5-Open-Source-32B

    qwen2.5-32b-instruct

    MU1 x 4

    CNY 216

    CNY 104,472

    Qwen2.5-open-source-14B

    qwen2.5-14b-instruct

    MU1 x 2

    CNY 108

    CNY 52,236

    Qwen2.5-7B

    qwen2.5-7b-instruct

    MU1 x 2

    CNY 108

    CNY 52,236

    MU5 x 1

    CNY 21

    CNY 10,139

    Qwen2.5-3B

    qwen2.5-3b-instruct

    MU5 x 1

    CNY 21

    CNY 10,139

    Qwen-Flash-2025-07-28

    qwen-flash-2025-07-28

    MU1 x 4

    CNY 216

    CNY 104,472

    Qwen-Plus-2025-07-28

    qwen-plus-2025-07-28

    MU1 x 4

    MU1 x 16 (modo de separação PD)

    CNY 216

    Modo de separação PD: CNY 864

    CNY 104,472

    Modo de separação PD: CNY 417,888

    Qwen-Plus-2025-12-01

    qwen-plus-2025-12-01

    MU1 x 4

    CNY 216

    CNY 104,472

    GLM

    Nome do modelo

    Código do modelo

    Especificação da unidade de modelo

    Preço por hora (CNY)

    Unidade mínima de faturamento: minuto

    Preço mensal (CNY)

    Unidade mínima de faturamento: dia

    GLM-5.1

    glm-5.1

    MU2 x 8

    MU2 x 16 (modo de separação PD)

    CNY 504

    Modo de separação PD: CNY 1,008

    CNY 240,288

    Modo de separação PD: CNY 480,576

    MU3 x 16 (modo de separação PD)

    Modo de separação PD: CNY 2,192

    Modo de separação PD: CNY 1,055,504

    MU6 x 16

    CNY 400

    CNY 193,424

    GLM-5

    glm-5

    MU3 x 16 (modo de separação PD)

    Modo de separação PD: CNY 2,192

    Modo de separação PD: CNY 1,055,504

    GLM-4.7

    glm-4.7

    MU6 x 32 (modo de separação PD)

    Modo de separação PD: CNY 800

    Modo de separação PD: CNY 386,848

    DeepSeek

    Nome do modelo

    Código do modelo

    Especificação da unidade de modelo

    Preço por hora (CNY)

    Unidade mínima de faturamento: minuto

    Preço mensal (CNY)

    Unidade mínima de faturamento: dia

    DeepSeek-v4-Flash

    deepseek-v4-flash

    MU1 x 8

    CNY 432

    CNY 208,944

    DeepSeek-v3.2

    deepseek-v3.2

    MU2 x 16 (modo de separação PD)

    Modo de separação PD: CNY 1,008

    Modo de separação PD: CNY 480,576

    Mais modelos

    Nome do modelo

    Código do modelo

    Especificação da unidade de modelo

    Preço por hora (CNY)

    Unidade mínima de faturamento: minuto

    Preço mensal (CNY)

    Unidade mínima de faturamento: dia

    MiniMax-M2.5

    MiniMax-M2.5

    MU1 x 16 (modo de separação PD)

    Modo de separação PD: CNY 864

    Modo de separação PD: CNY 417,888

    Kimi-K2.5

    kimi-k2.5

    MU2 x 8

    CNY 504

    CNY 240,288

    Tipos de modelo:

    • Instruct - O modelo implantado executa inferência no modo sem raciocínio.

    • Thinking - O modelo implantado executa inferência no modo de raciocínio.

    Tipos de implantação de modelo:

    • Modo de separação PD - Reduz a latência do primeiro token e melhora o throughput.

      Neste modo de implantação, o processo de inferência do modelo divide as etapas de cálculo do primeiro token (Prefill) e dos tokens subsequentes (Decode) para execução em nós de computação diferentes.

    Multimodal

    Qwen-VL

    Nome do modelo

    Código do modelo

    Especificação da unidade de modelo

    Preço por hora (CNY)

    Unidade mínima de faturamento: minuto

    Preço mensal (CNY)

    Unidade mínima de faturamento: dia

    Qwen3-VL-235B-A22B-Instruct

    qwen3-vl-235b-a22b-instruct

    MU1 x 4

    CNY 216

    CNY 104,472

    Qwen3-VL-235B-A22B-Thinking

    qwen3-vl-235b-a22b-thinking

    MU1 x 4

    CNY 216

    CNY 104,472

    Qwen3-VL-32B-Instruct

    qwen3-vl-32b-instruct

    MU2 x 8

    CNY 504

    CNY 240,288

    Qwen3-VL-8B-Instruct

    qwen3-vl-8b-instruct

    MU1 x 2

    CNY 108

    CNY 52,236

    Qwen3-VL-4B-Instruct

    qwen3-vl-4b-instruct

    MU1 x 2

    CNY 108

    CNY 52,236

    Qwen3-VL-2B-Instruct

    qwen3-vl-2b-instruct

    MU5 x 1

    CNY 21

    CNY 10,139

    Qwen3-VL-Embedding-2B

    qwen3-vl-embedding-2b

    MU5 x 1

    CNY 21

    CNY 10,139

    Qwen3-VL-Flash-2025-10-15

    qwen3-vl-flash-2025-10-15

    MU1 x 4

    CNY 216

    CNY 104,472

    Qwen3-VL-Plus-2025-09-23

    qwen3-vl-plus-2025-09-23

    MU1 x 4

    CNY 216

    CNY 104,472

    Qwen-VL-Max-2025-08-13

    qwen-vl-max-2025-08-13

    MU6 x 4

    CNY 100

    CNY 48,356

    Qwen-VL-OCR-2025-11-20

    qwen-vl-ocr-2025-11-20

    MU6 x 4

    CNY 100

    CNY 48,356

    Qwen Omni

    Nome do modelo

    Código do modelo

    Especificação da unidade de modelo

    Preço por hora (CNY)

    Unidade mínima de faturamento: minuto

    Preço mensal (CNY)

    Unidade mínima de faturamento: dia

    Qwen3.5-Omni-Flash

    qwen3.5-omni-flash

    MU8 x 1

    CNY 47

    CNY 22,400

    MU9 x 1

    CNY 51

    CNY 24,600

    Qwen3.5-Omni-Plus

    qwen3.5-omni-plus

    MU9 x 8

    CNY 408

    CNY 196,800

    Tipos de modelo:

    • Instruct - O modelo implantado executa inferência no modo sem raciocínio.

    • Thinking - O modelo implantado executa inferência no modo de raciocínio.

    • Instruct/Thinking - Você pode escolher se deseja ativar o modo de raciocínio ao implantar o modelo.

    Síntese de fala

    CosyVoice

    Nome do modelo

    Código do modelo

    Especificação da unidade de modelo

    Preço por hora (CNY)

    Preço mensal (CNY)

    cosyvoice-v3-flash

    cosyvoice-v3-flash

    MU5

    CNY 21

    CNY 10,139

    Singapura

    Geração de texto

    Nome do modelo

    Código do modelo

    Especificação da unidade de modelo

    Preço por hora ($)

    Unidade mínima de faturamento: minuto

    Preço mensal ($)

    Unidade mínima de faturamento: dia

    Qwen3.6-Plus-2026-04-02

    qwen3.6-plus-2026-04-02

    MU1 x 8

    $88

    $41,832

    Qwen3.5-39B-A17B

    qwen3.5-397b-a17b

    MU2 x 8

    $112

    $52,392

    Qwen3.5-35B-A3B

    qwen3.5-35b-a3b

    MU2 x 8

    $112

    $52,392

    Qwen3-32B

    qwen3-32b

    MU1 x 4

    $44

    $20,916

    MU2 x 8

    $112

    $52,392

    Qwen3-14B

    qwen3-14b

    MU1 x 4

    $44

    $20,916

    GLM-5.1

    glm-5.1

    MU2 x 8

    $112

    $52,392

    DeepSeek-V4-Flash

    deepseek-v4-flash

    MU1 x 8

    $88

    $41,832

    Multimodal

    Nome do modelo

    Código do modelo

    Especificação da unidade de modelo

    Preço por hora ($)

    Unidade mínima de faturamento: minuto

    Preço mensal ($)

    Unidade mínima de faturamento: dia

    Qwen3-VL-32B-Instruct

    qwen3-vl-32b-instruct

    MU2 x 8

    $112

    $52,392

    Qwen3-VL-8B-Instruct

    qwen3-vl-8b-instruct

    MU1 x 2

    $22

    $10,458

    Tipos de modelo:

    • Instruct - O modelo implantado executa inferência no modo sem raciocínio.

    China (Pequim)

    Geração de texto

    Qwen

    Nome do modelo

    Código do modelo

    Especificação da unidade de modelo

    Preço por hora ($)

    Unidade mínima de faturamento: minuto

    Preço mensal ($)

    Unidade mínima de faturamento: dia

    Qwen3.7-Plus-2026-05-26

    qwen3.7-plus-2026-05-26

    MU3 x 8

    $150.72

    $72,577.152

    Qwen3.6-35B-A3B

    qwen3.6-35b-a3b

    MU8 x 1

    $6.464

    $3,080.477

    MU9 x 1

    $7.014

    $3,383.024

    Qwen3.6-27B

    qwen3.6-27b

    MU9 x 1

    $7.014

    $3,383.024

    Qwen3.6-Flash-2026-04-16

    qwen3.6-flash-2026-04-16

    MU1 x 2

    $14.852

    $7,183.564

    Qwen3.6-Plus-2026-04-02

    qwen3.6-plus-2026-04-02

    MU1 x 8

    $59.408

    $28,734.256

    Qwen3.5-397B-A17B

    qwen3.5-397b-a17b

    MU2 x 8

    $69.312

    $33,044.72

    MU3 x 8

    $150.72

    $72,577.152

    MU6 x 16

    $55.008

    $26,599.92

    Qwen3.5-122B-A10B

    qwen3.5-122b-a10b

    MU1 x 4

    $29.704

    $14,367.128

    MU2 x 8

    $69.312

    $33,044.72

    MU6 x 16

    $55.008

    $26,599.92

    MU9 x 2

    $14.028

    $6,766.048

    Qwen3.5-35B-A3B

    qwen3.5-35b-a3b

    MU1 x 2

    $14.852

    $7,183.564

    MU2 x 8

    $69.312

    $33,044.72

    MU8 x 1

    $6.464

    $3,080.477

    MU9 x 1

    $7.014

    $3,383.024

    Qwen3.5-27B

    qwen3.5-27b

    MU9 x 1

    $7.014

    $3,383.024

    Qwen3.5-9B

    qwen3.5-9b

    MU8 x 1

    $6.464

    $3,080.477

    MU9 x 1

    $7.014

    $3,383.024

    Qwen3.5-Flash-2026-02-23

    qwen3.5-flash-2026-02-23

    MU1 x 2

    $14.852

    $7,183.564

    Qwen3.5-Plus-2026-02-15

    qwen3.5-plus-2026-02-15

    MU1 x 8

    $59.408

    $28,734.256

    MU3 x 8

    $150.72

    $72,577.152

    Qwen3-235B-A22B-Instruct

    qwen3-235b-a22b-instruct-2507

    MU1 x 4

    $29.704

    $14,367.128

    MU2 x 8

    $69.312

    $33,044.72

    Qwen3-Next-80B-A3B-Instruct

    qwen3-next-80b-a3b-instruct

    MU1 x 2

    $14.852

    $7,183.564

    Qwen3-32B

    qwen3-32b

    MU1 x 4

    $29.704

    $14,367.128

    MU6 x 4

    $13.752

    $6,649.98

    Qwen3-30B-A3B

    qwen3-30b-a3b

    MU9 x 2

    $14.028

    $6,766.048

    Qwen3-30B-A3B-Instruct-2507

    qwen3-30b-a3b-instruct-2507

    MU1 x 4

    $29.704

    $14,367.128

    MU2 x 8

    $69.312

    $33,044.72

    Qwen3-8B

    qwen3-8b

    MU1 x 2

    $14.852

    $7,183.564

    MU2 x 2

    $17.328

    $8,261.18

    MU5 x 1

    $2.888

    $1,394.329

    Qwen3-4B

    qwen3-4b

    MU1 x 2

    $14.852

    $7,183.564

    MU5 x 1

    $2.888

    $1,394.329

    Qwen3-1.7B

    qwen3-1.7b

    MU1 x 2

    $14.852

    $7,183.564

    MU5 x 1

    $2.888

    $1,394.329

    Qwen3-Max-2025-09-23

    qwen3-max-2025-09-23

    MU2 x 8

    $69.312

    $33,044.72

    MU3 x 8

    $150.72

    $72,577.152

    Qwen2.5-72B

    qwen2.5-72b-instruct

    MU1 x 4

    $29.704

    $14,367.128

    Qwen2.5-32B

    qwen2.5-32b-instruct

    MU1 x 4

    $29.704

    $14,367.128

    Qwen2.5-14B

    qwen2.5-14b-instruct

    MU1 x 2

    $14.852

    $7,183.564

    Qwen2.5-7B

    qwen2.5-7b-instruct

    MU1 x 2

    $14.852

    $7,183.564

    MU5 x 1

    $2.888

    $1,394.329

    Qwen2.5-3B-Instruct

    qwen2.5-3b-instruct

    MU5 x 1

    $2.888

    $1,394.329

    Qwen-Flash-2025-07-28

    qwen-flash-2025-07-28

    MU1 x 4

    $29.704

    $14,367.128

    Qwen-Plus-2025-07-28

    qwen-plus-2025-07-28

    MU1 x 4

    $29.704

    $14,367.128

    Qwen-Plus-2025-12-01

    qwen-plus-2025-12-01

    MU1 x 4

    $29.704

    $14,367.128

    GLM

    Nome do modelo

    Código do modelo

    Especificação da unidade de modelo

    Preço por hora ($)

    Unidade mínima de faturamento: minuto

    Preço mensal ($)

    Unidade mínima de faturamento: dia

    GLM-5.1

    glm-5.1

    MU2 x 8

    $69.312

    $33,044.72

    MU3 x 8

    $150.72

    $72,577.152

    MU6 x 16

    $55.008

    $26,599.92

    GLM-5

    glm-5

    MU3 x 8

    $150.72

    $72,577.152

    GLM-4.7

    glm-4.7

    MU6 x 16

    $55.008

    $26,599.92

    DeepSeek

    Nome do modelo

    Código do modelo

    Especificação da unidade de modelo

    Preço por hora ($)

    Unidade mínima de faturamento: minuto

    Preço mensal ($)

    Unidade mínima de faturamento: dia

    DeepSeek-V4-Flash

    deepseek-v4-flash

    MU1 x 8

    $59.408

    $28,734.256

    DeepSeek-V3.2

    deepseek-v3.2

    MU2 x 8

    $69.312

    $33,044.72

    Outros modelos

    Nome do modelo

    Código do modelo

    Especificação da unidade de modelo

    Preço por hora ($)

    Unidade mínima de faturamento: minuto

    Preço mensal ($)

    Unidade mínima de faturamento: dia

    MiniMax-M2.5

    MiniMax-M2.5

    MU1 x 8

    $59.408

    $28,734.256

    Kimi-K2.5

    kimi-k2.5

    MU2 x 8

    $69.312

    $33,044.72

    Multimodal

    Qwen-VL

    Nome do modelo

    Código do modelo

    Especificação da unidade de modelo

    Preço por hora ($)

    Unidade mínima de faturamento: minuto

    Preço mensal ($)

    Unidade mínima de faturamento: dia

    Qwen3-VL-235B-A22B-Instruct

    qwen3-vl-235b-a22b-instruct

    MU1 x 4

    $29.704

    $14,367.128

    Qwen3-VL-235B-A22B-Thinking

    qwen3-vl-235b-a22b-thinking

    MU1 x 4

    $29.704

    $14,367.128

    Qwen3-VL-32B-Instruct

    qwen3-vl-32b-instruct

    MU2 x 8

    $69.312

    $33,044.72

    Qwen3-VL-8B-Instruct

    qwen3-vl-8b-instruct

    MU1 x 2

    $14.852

    $7,183.564

    Qwen3-VL-Flash-2025-10-15

    qwen3-vl-flash-2025-10-15

    MU1 x 4

    $29.704

    $14,367.128

    Qwen3-VL-Plus-2025-09-23

    qwen3-vl-plus-2025-09-23

    MU1 x 4

    $29.704

    $14,367.128

    Qwen-VL-Max-2025-08-13

    qwen-vl-max-2025-08-13

    MU6 x 4

    $13.752

    $6,649.98

    Qwen-VL-OCR-2025-11-20

    qwen-vl-ocr-2025-11-20

    MU6 x 4

    $13.752

    $6,649.98

    Qwen Omni

    Nome do modelo

    Código do modelo

    Especificação da unidade de modelo

    Preço por hora ($)

    Unidade mínima de faturamento: minuto

    Preço mensal ($)

    Unidade mínima de faturamento: dia

    Qwen3.5-Omni-Flash

    qwen3.5-omni-flash

    MU8 x 1

    $6.464

    $3,080.477

    MU9 x 1

    $7.014

    $3,383.024

    Qwen3.5-Omni-Plus

    qwen3.5-omni-plus

    MU9 x 8

    $56.112

    $27,064.192

    Tipos de modelo:

    • Instruct - O modelo implantado executa inferência no modo sem raciocínio.

    • Thinking - O modelo implantado executa inferência no modo de raciocínio.

    Por uso de tokens do modelo

    Custo = Número de Tokens de Entrada × Preço Unitário de Entrada + Número de Tokens de Saída × Preço Unitário de Saída (Unidade mínima de faturamento: 1 token)

    • O faturamento por uso de tokens do modelo só está disponível após a conclusão do Supervised Fine-Tuning (SFT) para os seguintes foundation models e a obtenção de um modelo personalizado.

    Qwen

    Qwen-VL

    Singapore

    Foundation model

    Código do modelo

    Entrada

    $/1k tokens

    Saída

    $/1k tokens

    Qwen3-14B

    qwen3-14b

    $0,00035

    Modo sem raciocínio: $0,0014

    Modo de raciocínio: $0,0042

Para implantar mais modelos, consulte esta solução e escolha o plano de implantação mais adequado às necessidades do seu negócio.

Método de implantação

Para implantar modelos no console, siga estas etapas:

Se você receber um erro de permissão, consulte O que fazer se eu receber um erro de permissão durante a implantação?
  1. Acesse o Model Deployment console.

image

image

  1. Insira um nome de serviço, selecione um modelo e o método de faturamento, mantenha as demais configurações com os valores padrão e clique em Confirm.

  1. Quando o status da implantação for Running, o modelo foi implantado com sucesso.

Importante

As cobranças são geradas após a implantação bem-sucedida do modelo.

Configuração de implantação

Model unit

Configuração

Detalhes

Service Name

Nome personalizado do serviço de implantação.

Select Model

Selecione o modelo a ser implantado, incluindo modelos pré-treinados da plataforma e modelos ajustados (fine-tuned).

Model Unit Type

Selecione a especificação de implantação. Especificações diferentes correspondem a diferentes capacidades de computação e desempenho.

Number of Replicas

Defina o número inicial de réplicas de implantação, o que afeta a capacidade de processamento simultâneo do serviço.

Deployment Template

Selecione um modelo de implantação, como "Single-Machine Deployment". Modelos diferentes correspondem a planos distintos de configuração de recursos. Esta opção está disponível apenas no modo de faturamento por model unit.

Configure Model Inference Mode

Ao implantar alguns modelos usando o método Model Unit, é possível configurar o modo de inferência, o comprimento máximo de contexto e outras definições.

  • Instruct - O modelo implantado executa inferência em modo sem raciocínio.

  • Thinking - O modelo implantado executa inferência em modo de raciocínio.

Maximum Context

Esta configuração é compatível com o modo de implantação Model Unit para alguns modelos. O comprimento máximo de contexto depende do tipo de modelo.

Service Throttling

Esta definição é suportada no modo de implantação Model Unit de determinados modelos. Permite limitar o RPM e o TPM das chamadas ao modelo.

Página da lista de implantações

Após uma implantação bem-sucedida, visualize e gerencie todos os serviços implantados na página da lista de implantações. A página contém as seguintes informações:

  • Service Name: Nome do serviço de implantação. Clique no nome para visualizar os detalhes da implantação.

  • Model Name: Modelo utilizado na implantação.

  • Model Code: Identificador exclusivo gerado após a implantação bem-sucedida do modelo. Utilizado para especificar o modelo nas chamadas de API.

  • Deployment Status/Event Status: Inclui estados como Pending Deployment, Deploying, Running, Deployment Failed, Unpublishing, Service Paused, Stopped, Deleting, Unsubscribed/Overdue, Resuming, Running (Upgrading/Downgrading) e Running (Upgrade/Downgrade Failed).

  • Billing Method: Método de faturamento atual do serviço de implantação.

  • Deployment Details: Informações de configuração, como tipo de model unit e número de réplicas.

  • Rate Limiting Details: Exibe a configuração de limitação de taxa do serviço de implantação atual, como requisições por minuto (RPM) e tokens por minuto (TPM).

  • Service Time: Mostra os horários de criação e expiração do serviço de implantação.

  • Operation: Dependendo do status da implantação e do método de faturamento, execute operações como Update, Monitoring, Scaling, Renewal, Unpublish, Delete e Experience.

Chamadas pós-implantação

Após a implantação bem-sucedida de um modelo, chame-o usando Compatível com OpenAI, Dashscope e Assistant SDK.

Ao chamar um modelo implantado com sucesso, o valor de model deve ser o code do modelo gerado após a implantação. Acesse o Model Deployment console para obter o Model Code.

image

DashScope

import os
import dashscope

messages = [
    {"role": "system", "content": "You are a helpful assistant."},
    {"role": "user", "content": "Who are you?"},
]
dashscope.base_http_api_url = 'https://dashscope-intl.aliyuncs.com/api/v1'
response = dashscope.Generation.call(
    # If the environment variable is not configured, replace the next line with: api_key="sk-xxx",
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    model="qwen3-max-xxx-xxx",  # Replace with the code generated after the model is successfully deployed
    messages=messages,
    result_format="message",
    enable_thinking=False,
)
print(response)

Interface compatível com OpenAI

import os
from openai import OpenAI

client = OpenAI(
    # If the environment variable is not configured, replace the next line with: api_key="sk-xxx",
    api_key=os.getenv('DASHSCOPE_API_KEY'),
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)

completion = client.chat.completions.create(
    model="qwen3-max-xxx-xxx",  # Replace with the code generated after the model is successfully deployed
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Who are you?"},
    ],
    extra_body={"enable_thinking": False},
)
print(completion)

Dimensionar serviços de implantação

  • Provisioned Throughput (Baseado em tempo): Clique no botão Scaling para ajustar manualmente o número de instâncias. Para regras específicas de reembolso em downgrades, consulte Regras de reembolso para downgrades.

  • Model Unit (Baseado em tempo): Clique no botão Scaling para ajustar manualmente o número de instâncias.

Também é possível clicar no botão Scaling Configuration na coluna Operation para configurar políticas de dimensionamento automático, incluindo limiares de dimensionamento, número mínimo/máximo de réplicas e dimensionamento agendado.

Despublicar um serviço

Acesse o Model Deployment console, localize o serviço de implantação a ser interrompido e clique na operação correspondente com base no método de faturamento:

  • Model Unit (Assinatura): Clique em Deactivate e confirme.

  • Pagamento conforme o uso: Clique em Delete e confirme.

O faturamento é interrompido após a conclusão da operação.

image

Outras operações

Além de despublicar, a coluna Operation na página da lista de implantações suporta as seguintes operações:

  • Update: Atualize a versão do modelo de um serviço implantado. A atualização pode ser feita de uma só vez ou em lotes (canary release).

  • Delete: Serviços de pagamento conforme o uso podem ser excluídos diretamente para interromper o faturamento.

  • Renewal: Serviços de assinatura podem ser renovados para estender o tempo de serviço. A renovação automática é suportada.

  • Purchase Capacity Package: Adquira um pacote de capacidade para uma implantação de provisioned throughput.

Perguntas frequentes

Posso carregar e implantar meus próprios modelos?

Atualmente, não há suporte para carregar e implantar seus próprios modelos. Recomendamos acompanhar as últimas atualizações do Alibaba Cloud Model Studio.

Além disso, o Alibaba Cloud Platform for AI (PAI) oferece funcionalidade para implantar seus próprios modelos. Para mais informações, consulte Implantação de modelos de linguagem grande PAI-LLM.

O que fazer se eu receber um erro de permissão durante a implantação?

  1. Se você vir a mensagem "You do not have the required permissions for this module", verifique se sua conta possui a permissão Model Deployment - Operation na página de gerenciamento de permissões do workspace.

    PixPin_2025-11-27_15-09-44

    Caso não consiga realizar a operação, entre em contato com sua organização ou administrador de TI para adicionar as permissões necessárias ou verificar problemas de permissão.

  2. Se a implantação falhar com o erro "Workspace xxx does not have deployment privilege for model xxxx", acesse a página Workspace Management no Model Studio e adicione a permissão de implantação do modelo correspondente ao workspace.

    Erro de chamada de API: Workspace xxx does not have deployment privilege for model xxxx .

    PixPin_2025-11-27_15-03-57

    PixPin_2025-11-27_15-06-41

    Se receber um erro de permissão, contate sua organização ou administrador de TI para adicionar as permissões necessárias ou executar a operação em seu nome.