Todos os produtos
Search
Central de documentação

Alibaba Cloud Model Studio:Faturamento e gestão de custos

Última atualização: Sep 17, 2026

Consulte e analise faturas, aloque custos, trate pagamentos em atraso e interrompa o faturamento dos serviços do Alibaba Cloud Model Studio.

Consultar faturas

As faturas são geradas somente após a conclusão de uma chamada. As faturas de inferência de modelo são geradas com granularidade de minutos, geralmente entre 2 e 10 minutos. As faturas de service como inferência em lote, treinamento de modelo e base de conhecimento são geradas por hora. Durante os horários de pico de negócios, o horário exibido no sistema é considerado o horário final de faturamento.

Billing Overview

Faça login no console do Model Studio. Clique na aba Dashboard na parte superior. No painel de navegação à esquerda, escolha Usage & Billing > Billing Overview e selecione um mês de faturamento.

Esta página exibe apenas os custos de inferência de modelo . Para visualizar custos de service como treinamento de modelo e base de conhecimento , consulte Detalhes de Faturamento .

  • Visualizar consumo total e detalhamento: A parte superior da página mostra o Total amount do mês, dividido em Subscription (como Token Plan e Coding Plan) e Bill (para chamadas de modelo e treinamento no modelo pagamento conforme o uso). Clique em View details no cartão Subscription ou Bill para visualizar os custos itemizados. O gráfico Bill trend abaixo exibe apenas valores de pagamento conforme o uso e exclui taxas pré-pagas de assinatura. Ao visualizar dados do mês atual, o valor de Bill geralmente é atualizado primeiro, enquanto o gráfico Bill trend pode apresentar um leve atraso.

  • Consultar custos por modelo ou API Key: Na seção Bill trend, selecione um modelo alvo na lista suspensa Model ou filtre por API Key ID e mude para a visualização List. A coluna Payable amount na visualização List mostra o custo mensal acumulado para o item selecionado.

  • Comparar tendências de gastos: Defina Grouping como Category e compare as tendências de gastos para inferência e treinamento de modelo com base Daily ou Monthly.

  • Definir alertas de faturamento: No cartão Bill, clique em Edit ao lado de Bill alert. No painel Usage limit & alerts, ative um limite mensal, defina um limiar e configure notificação por e-mail. Você recebe uma notificação quando seus gastos atingem o limiar. Isso ajuda a evitar interrupções de service causadas por pagamentos em atraso.

  • Visualizar custos acumulados históricos: A página Billing Overview exibe apenas o consumo total do mês atual. A Análise de Custos suporta até 12 meses de dados com granularidade mensal e até 92 dias com granularidade diária. Para visualizar custos além de 12 meses ou calcular seu gasto histórico total, exporte as faturas mês a mês nos Detalhes de Faturamento e agregue-as manualmente:

    1. Acesse Expenses and Costs > Billing Details.
    2. Defina Product Name como Alibaba Cloud Model Studio.
    3. Altere o mês de faturamento um por vez e exporte a fatura de cada mês como um arquivo CSV. Para as etapas de exportação, consulte Billing Details.
    4. Some os dados exportados de todos os meses para obter seu gasto histórico total.

    Todas as opções de período estatístico na página de Detalhes de Faturamento estão restritas a um único mês, portanto, a agregação entre meses não é suportada e deve ser feita manualmente após a exportação de cada mês. Na caixa de diálogo de exportação, você pode selecionar conteúdo dos últimos 18 meses para exportação em lote.

Detalhes de faturamento

As faturas de inferência e treinamento de grandes modelos podem ser detalhadas para revisão por API Key ID, workspace ID, nome do modelo, tipo de entrada/saída, canal de invocação.

1. Baixar a fatura

  1. Na página Billing Details, selecione um período de faturamento.
  2. Selecione Billing Overview como Alibaba Cloud Model Studio e clique em Billing Overview.
  3. No canto superior direito da lista de faturas, clique no Export Bill CSV para baixar a fatura.
  4. Abra o arquivo, localize a coluna Product e interprete-a usando as regras descritas na próxima seção.

2. Interpretar campos principais

O campo "Instance ID" contém várias informações separadas por ponto e vírgula (;).

  • Exemplo: text_token;llm-xxx;qwen-max;output_token;app
  • Isso representa as seguintes informações em ordem: billing type;workspace ID;model name;input/output type;invocation channel

3. Rastreabilidade de dados e termos

  • Consultar API Key: Copie o ApiKeyID da sua fatura e acesse a página Gerenciamento de API Key do Model Studio para encontrar o nome da chave correspondente.

  • Consultar workspace: Copie o workspace ID da sua fatura. Acesse a página Workspaces para identificar o workspace específico.

  • Descrições dos canais de invocação:

    • app: Uma chamada feita de um aplicativo (via código).
    • bmp: Uma chamada feita do Playground no console.
    • assistant-api: Uma chamada feita via Assistant API.

Interromper o faturamento

Se você não utilizar mais o Model Studio, siga as instruções abaixo para interromper os service relacionados e evitar cobranças adicionais.

  • Interromper inferência de modelo: Pare de fazer chamadas de API pelo seu código e pare de usar o Playground no console para evitar cobranças futuras. Para evitar chamadas acidentais, exclua suas chaves na página API-KEY.
  • Interromper treinamento de modelo: Não há cobrança quando nenhuma tarefa de treinamento de modelo está em execução.
  • Cancelar uma assinatura do Coding Plan: O Coding Plan é um product de assinatura mensal que para automaticamente no final do período de assinatura. Cancelamentos antecipados e reembolsos não são suportados. Se a renovação automática estiver ativada, desative-a na página Coding Plan.
  • Cancelar assinatura do Token Plan Team Edition: Na página My Subscriptions do console do Token Plan, cancele a assinatura de assentos que não foram utilizados; o reembolso será emitido para a conta de pagamento original. Se não desejar renovar sua assinatura, desative a renovação automática.

FAQ

Por que não consigo encontrar uma fatura após chamar um modelo?

Causa:
  • Latência de faturamento: As faturas de inferência de modelo são agregadas por minuto e geralmente aparecem de 2 a 10 minutos após uma chamada. As faturas de inferência em lote, treinamento de modelo e base de conhecimento são agregadas por hora. A geração de faturas pode sofrer atrasos adicionais durante horários de pico.
  • Uso de um modelo não comercial: Modelos em preview público ou testes apenas por convite não geram registros de faturamento.

Solução: Aguarde o intervalo de faturamento passar e verifique novamente.

Por que o mesmo modelo tem várias entradas na minha fatura?

Causa: O mesmo modelo é faturado separadamente com base no tipo de faturamento (como tokens de entrada, tokens de saída ou acertos de cache) e no canal de invocação (como uma chamada de API ou experiência no console). Por exemplo, uma única chamada de API para qwen3,6-plus gera duas entradas: uma para "tokens de entrada" e outra para "tokens de saída".

Solução: Use o campo Instance ID em Billing Details para entender os detalhes de cada item de linha.

Muitas entradas da fatura são nomeadas "Large Model Text Consumption". Como identifico o modelo de cada entrada?

Causa: A coluna "Billable Item" na fatura é rotulada uniformemente como "Large Model Text Consumption" e não mostra o nome específico do modelo.

Solução: Verifique a coluna Instance ID (Billing Granularity) na página Billing Details. Este campo é uma string separada por ponto e vírgula. A parte da string que segue imediatamente o workspace ID (como llm-xxx) é o nome do modelo. Por exemplo, em 12xxx;llm-xxx;qwen3,6-plus;context_0-128k_input_token;bmp;0, o modelo é qwen3,6-plus.

Onde posso visualizar contagens e estatísticas de chamadas de modelo?

Acesse o console do Alibaba Cloud Model Studio e selecione a região alvo no canto superior direito. Clique na aba Dashboard na parte superior. No painel de navegação à esquerda, escolha Usage & Billing > Model usage.

O pagamento conforme o uso é faturado em tempo real?

Não. A Alibaba Cloud usa um modelo de "reserva e liquidação mensal" para faturamento de pagamento conforme o uso. O sistema reserva um valor do seu saldo disponível para cobrir o uso e, em seguida, gera uma fatura final e deduz o custo real no final do ciclo de faturamento (no início do mês seguinte).

Por que tenho um pagamento em atraso mesmo tendo usado pouco o service?

Motivo: Recursos adicionais do Model Studio, como web search, são faturados separadamente (pós-pago) com base no número de chamadas e são faturados separadamente das taxas de inferência de modelo. Mesmo que você não tenha usado ativamente o console recentemente, se o parâmetro enable_search estiver ativado em aplicativos ou códigos criados por você no passado, taxas de pesquisa na web ainda serão incorridas para cada chamada. Além disso, o saldo da sua conta Alibaba Cloud é gerenciado no nível da conta. Se qualquer product Alibaba Cloud sob a mesma conta, como ECS ou OSS de pagamento conforme o uso, tiver cobranças não liquidadas, seu saldo disponível ficará negativo e o Model Studio também exibirá um pagamento em atraso, mesmo que você não tenha usado o próprio Model Studio. Liquidar as cobranças pendentes do product afetado restaura o uso normal do Model Studio.

Solução:
  1. Em Billing Details, filtre por Alibaba Cloud Model Studio e verifique a coluna Instance ID (Billing Granularity) para identificar o nome do modelo e o canal de invocação que incorreram no custo.
  2. Verifique se enable_search está ativado no código do seu aplicativo ou na configuração do aplicativo do Model Studio. Se não precisar mais de pesquisa na web, defina este parâmetro como false ou remova-o.
  3. Se você interrompeu todas as chamadas, mas ainda está sendo cobrado, verifique se outras API keys ou aplicativos ainda estão em execução. Encontre e exclua chaves não utilizadas na página API Key Management.

Por que meu saldo se esgota tão rapidamente?

Causa:
  • Tokens de entrada acumulam em conversas de contexto longo: Quando o mesmo documento é incluído repetidamente em uma conversa de contexto longo, os tokens de entrada de cada solicitação crescem à medida que o contexto se acumula, então uma única chamada consome muito mais tokens do que uma conversa curta. Por exemplo, em uma investigação, 43 de 47 chamadas consumiram cada uma de 580.000 a 600.000 tokens de entrada, e o total de tokens de entrada excedeu 25 milhões, o que esgotou um saldo de CNY 120 em cerca de 20 minutos e resultou em um pagamento em atraso.
  • Notificações de alerta são enviadas com frequência limitada: Quando o crédito disponível da sua conta cai abaixo do limiar de alerta, você recebe uma notificação.A notificação é enviada por e-mail. Se você não verificar a notificação a tempo, seu saldo pode se esgotar antes do próximo alerta.
  • Latência de faturamento: As faturas de inferência de modelo são agregadas por minuto. Portanto, você ainda pode receber faturas geradas por latência de faturamento após a suspensão do service, e o valor em atraso pode continuar aumentando após a suspensão.
Solução:
  • Verifique o consumo de tokens de chamadas individuais na página Model Usage para identificar solicitações com alto uso de tokens.
  • Configure o alerta de crédito disponível na página Billing Overview e verifique as notificações de alerta prontamente.
  • Para interromper o faturamento imediatamente, exclua as API keys que você não usa mais na página API Key Management.

Por que sou cobrado mesmo sem fazer chamadas de API ativamente?

Causa: A implantação de modelo no Model Studio é faturada por duração. O faturamento começa assim que o status da implantação do modelo muda para Running, independentemente de chamadas de API. Mesmo que você não tenha chamado o modelo via API, as cobranças continuam a acumular enquanto o status da implantação for Running. Além disso, a inferência de modelo é faturada pelo uso de tokens — as taxas são incorridas apenas quando chamadas de API são feitas.

Solução:
  1. Acesse a página Model Deployment para verificar se algum modelo implantado tem o status Running. Se não precisar mais deles, coloque-os offline para interromper o faturamento.
  2. Exclua API keys não utilizadas para evitar que chamadas acidentais de API gerem taxas de inferência (nota: a exclusão é irreversível, proceda com cautela). Gerencie suas chaves na página API Key Management.

Como determino se minha conta foi comprometida?

Se suspeitar que sua conta foi acessada por terceiros e cobranças inesperadas foram incorridas, siga estas etapas para investigar:

  • Em Detailed Bill, filtre por Model Studio e verifique o ApiKeyID na coluna Instance ID (Billing Granularity) para identificar a API Key que está gerando as cobranças.
  • Acesse a página API Key Management, revise o horário de criação de cada chave e confirme se foi criada por você. A página API Key Management mostra apenas o horário de criação, não o horário de invocação.
  • Revise a distribuição de horários de chamada para identificar quaisquer padrões anormais de invocação que possam não ser seus: Acesse Model Usage, filtre por Model ou API Key ID e mude para a visualização List para ver a distribuição de horários de invocação.
  • Se forem encontradas invocações não autorizadas, acesse imediatamente a página API Key Management para excluir a API Key correspondente e regenerá-la. Atualize todos os chamadores legítimos para usar a nova chave.

Por que sou cobrado sem adquirir um plano do Model Studio?

Causa: As chamadas de API do Model Studio usam o método de faturamento pagamento conforme o uso por padrão. Após ativar o Model Studio, você pode chamar a API imediatamente e pagar com base no uso real, sem adquirir um plano de recursos ou plano de economia. O sistema cobra automaticamente com base no uso de tokens e no preço correspondente do modelo que você chama. Para informações detalhadas sobre preços, consulte @xref node="6187093" root="85177" Model inference pricing @/xref .

Como escolho entre pagamento conforme o uso, cota gratuita, Coding Plan, planos de recursos e planos de economia?

O Model Studio aplica cotas com desconto em uma ordem fixa de compensação: cota gratuita > plano de economia específico do modelo > plano de economia de uso geral de IA > pagamento conforme o uso. Cada camada é totalmente consumida antes que a próxima seja usada. As chamadas são faturadas com base no pagamento conforme o uso contra o saldo da sua conta apenas depois que todas as cotas com desconto forem esgotadas.

A tabela a seguir compara as opções e as regras que se aplicam a cada uma.

Opção

Modelo de faturamento

Cenários

Nível de preço

Limites

Regras principais

Pagamento conforme o uso (padrão)

Pós-pago, reserva e liquidação mensal

Uso flutuante ou avaliação antes do compromisso

Faturado pelo uso de tokens de entrada e saída, sem descontos. O preço unitário por token é o mais alto entre todas as opções.

Nenhuma compra antecipada é necessária, portanto, esta opção está disponível a qualquer momento. Modelos não podem ser chamados enquanto houver pagamento em atraso.

Nenhuma compra antecipada é necessária. A fatura final é gerada e cobrada no início do mês seguinte. Modelos não podem ser chamados enquanto houver pagamento em atraso.

Cota gratuita

Cota concedida, compensada primeiro

Validação de recursos e testes em pequena escala

Gratuito. Concedido automaticamente ao ativar o Model Studio. A cota não pode ser acumulada ou adquirida separadamente.

O valor da cota e o período de validade são fixos. Após o esgotamento da cota, o faturamento retorna automaticamente ao pagamento conforme o uso. Enquanto Stop when free quota is used up (worry-free mode) estiver ativado, os planos de economia não podem compensar o uso.

Ative Stop when free quota is used up (worry-free mode) nas configurações do modelo para suspender as chamadas assim que a cota acabar, evitando que cobranças de pagamento conforme o uso sejam acumuladas. Enquanto esta opção estiver ativada, nenhum plano de economia é aplicado. Desative a opção para retomar as chamadas e permitir que o plano de economia tenha efeito.

Coding Plan

Assinatura mensal

Um orçamento mensal fixo para cenários de codificação

Um custo mensal fixo que não varia com o uso de tokens.

Pode ser usado apenas para cenários de ferramentas de programação. Não pode compensar chamadas regulares de API ou taxas de inferência de modelo incorridas no console. A assinatura para automaticamente no vencimento, e cancelamentos antecipados e reembolsos não são suportados.

A assinatura para automaticamente ao expirar. Cancelamentos antecipados e reembolsos não são suportados. Se a renovação automática estiver ativada, desative-a na página Coding Plan.

Token Plan

Compra única de créditos

Compartilhar uma cota entre uma equipe

Os créditos são adquiridos por assento como pagamento único.

Apenas alguns modelos são suportados. A cota é independente do saldo da sua conta. Assentos que não consumiram nenhum uso podem ter a assinatura cancelada na página My Subscriptions.

Apenas alguns modelos são suportados. Você pode cancelar individualmente a assinatura de assentos que não consumiram nenhum uso na página My Subscriptions do console do Token Plan.

Plano de economia de uso geral de IA (recomendado)

Compromisso com um gasto mensal em troca de descontos escalonados

Uso estável de longo prazo de service de grandes modelos

Descontos escalonados com base no gasto mensal com o qual você se compromete: quanto maior o compromisso, maior o desconto. Para o desconto de cada nível, consulte Savings plans and resource plans.

Períodos de compromisso de 3, 6, 12 ou 24 meses estão disponíveis. A cota é emitida mensalmente e não é transferida para o próximo período. Depois que o plano entra em vigor e começa a compensar o uso, geralmente não pode ser cancelado e deve ser executado até expirar.

Abrange todos os modelos. Depois que o plano entra em vigor e começa a compensar o uso, geralmente não pode ser cancelado e deve ser executado até expirar.

Planos de recursos não são oferecidos no site internacional, que fornece apenas planos de economia.

Para cenários regulares de chamada de API, escolha primeiro o plano de economia de uso geral de IA. Para cenários de ferramentas de programação, escolha primeiro o Coding Plan. Escolha uma opção com base nestas regras: um plano de economia para uso estável de longo prazo , um Token Plan quando uma equipe compartilha uma cota e um Coding Plan quando você deseja um gasto mensal fixo para cenários de codificação. Se estiver apenas validando recursos, use primeiro a cota gratuita.

O Model Studio é pagamento conforme o uso por padrão e não concede cotas de tokens antecipadamente. Adquira um plano de economia se precisar garantir uma cota ou reduzir custos.

Para níveis de desconto, etapas de compra e regras de vigência, consulte @xref node="6263837" root="85181" Savings plans and resource plans @/xref . Para interromper o faturamento de qualquer uma dessas opções, consulte Interromper o faturamento.