Chamadas de inferência a modelos integrados geram taxas de invocação cobradas pelo uso — como tokens, duração de áudio e vídeo, e quantidade de imagens —, independentemente das taxas de recursos de computação CU do workspace.
Visão Geral do Faturamento
Recursos de Computação (CU): Recursos de computação necessários para a execução de jobs, faturados da mesma forma que o faturamento CU existente.
Taxa de Invocação de AI Service: Taxas geradas pela chamada de modelos integrados, cobradas de forma independente pelo uso — como tokens, duração de áudio e vídeo, e quantidade de imagens.
Para informações sobre o faturamento de cloud products relacionados, consulte Itens Faturáveis.
Regras de Faturamento
-
Unidade de Faturamento:
Faturamento por token: abrange modelos de geração de texto, síntese de voz, embedding e rerank. Os preços são expressos em CNY por 1.000 tokens no site China e em USD por 1.000 tokens no site internacional. Tokens de entrada e de saída são faturados separadamente.
Faturamento por duração: abrange modelos de geração de vídeo e reconhecimento de voz. Os preços são expressos em CNY por segundo no site China e em USD por segundo no site internacional.
Faturamento por quantidade de imagens: abrange modelos de geração de imagens. Os preços são expressos em CNY por imagem no site China e em USD por imagem no site internacional.
Ciclo de Faturamento: Liquidado uma vez por minuto (com base no horário UTC+8), gerando faturas e deduzindo taxas, com uma latência de faturamento de aproximadamente 1 a 10 minutos.
Dimensões de Faturamento: Cobrado pela combinação de
Region × Model × Input Range or Output Specification × Usage Type. Custo por minuto = Σ(uso real por tipo × preço unitário).-
Camada Gratuita: O primeiro 1 milhão de tokens por conta principal, por região, por mês calendário (com base no horário UTC+8) é gratuito (entrada e saída combinadas). O uso excedente é faturado pelos preços listados. Para modelos que não são faturados por token, o uso é convertido em tokens pelas seguintes regras e contabilizado na camada gratuita:
Modelos de geração de imagens (como qwen-image-3.0-pro e qwen-image-3.0): cada imagem consome 10.000 tokens da camada gratuita.
Modelos de geração de vídeo (como happyhorse-1.1-t2v, happyhorse-1.1-i2v e happyhorse-1.1-r2v): cada segundo consome 30.000 tokens da camada gratuita.
Modelos de reconhecimento de voz (como qwen-audio-3.0-asr-flash-filetrans, qwen-audio-3.0-asr-flash e fun-asr): cada segundo consome 10 tokens.
Faturamento por token
Nos modelos faturados por token, a taxa de cada requisição é medida pelos seguintes tipos:
Token de Entrada Padrão: Faturado pelo preço unitário base de entrada.
Token de Saída Padrão: Faturado pelo preço unitário base de saída.
Token de Entrada com Cache Implícito: Exceto para modelos com especificação diferente, faturado a 20% do preço base de entrada.
Token de Entrada de Criação de Cache Explícito: Exceto para modelos com especificação diferente, faturado a 125% do preço base de entrada.
Token de Entrada com Hit de Cache Explícito: Exceto para modelos com especificação diferente, faturado a 10% do preço base de entrada.
Custo por minuto = Σ(uso de tokens por tipo × preço unitário). O preço unitário dos tokens de cache = preço unitário base de entrada × coeficiente de faturamento.
Faturamento por duração
Nos modelos faturados por duração, a taxa de cada requisição é medida pelos seguintes tipos:
Duração de entrada: faturada pelo preço unitário de entrada.
Duração de saída: faturada pelo preço unitário de saída.
Custo por minuto = Σ(duração faturada por tipo × preço unitário). A duração faturada varia conforme o modelo: alguns são cobrados apenas pela duração de entrada, outros apenas pela de saída, e alguns por ambas. Consulte as tabelas de preços para mais detalhes.
Faturamento por quantidade de imagens
Nos modelos faturados por quantidade de imagens, a taxa de cada requisição é medida pelos seguintes tipos:
Quantidade de imagens de entrada: faturada pelo preço unitário de entrada.
Quantidade de imagens de saída: faturada pelo preço unitário de saída.
Custo por minuto = Σ(quantidade de imagens por tipo × preço unitário). A quantidade de imagens faturada varia conforme o modelo: alguns são cobrados apenas pelas imagens de entrada, outros apenas pelas de saída, e alguns por ambas. Consulte as tabelas de preços para mais detalhes.
Preços
Os preços reais estão sujeitos aos extratos de faturamento.
Preços Base
As tabelas a seguir apresentam os preços unitários base de tokens de entrada/saída padrão, duração e número de imagens. Os tokens do tipo cache são cobrados com base nos preços base multiplicados pelos coeficientes correspondentes. Para mais detalhes, consulte Coeficientes de Faturamento de Token de Cache.
Mainland da China: inclui regiões como China (Hangzhou) e China (Beijing).
Fora da mainland da China: abrange todas as regiões fora da mainland da China, como China (Hong Kong), Singapore e US.
Para a lista de regiões, consulte Regiões suportadas.
Qwen
Chinese mainland
Model | Input range (1K tokens) | Input (USD/1K tokens) | Output (USD/1K tokens) |
qwen3.8-max | 0~1,000 | 0.00198 | 0.005941 |
qwen3.7-max | 0~1,000 | 0.00198 | 0.005941 |
qwen3.7-plus | 0~256 | 0.00033 | 0.00132 |
256~1,000 | 0.00099 | 0.003961 | |
qwen3.6-plus | 0~256 | 0.00033 | 0.00198 |
256~1,000 | 0.00132 | 0.007921 | |
qwen3.5-plus | 0~128 | 0.000132 | 0.000792 |
128~256 | 0.00033 | 0.00198 | |
256~1,000 | 0.00066 | 0.003961 | |
qwen3.7-flash | 0~32 | 0.000033 | 0.000132 |
32~256 | 0.000099 | 0.000396 | |
256~1,000 | 0.000198 | 0.000792 | |
qwen3.6-flash | 0~256 | 0.000198 | 0.001188 |
### **DeepSeek** #### Chinese mainland | **Model** | **Input range (1K tokens)** | **Input (CNY/1K tokens)** | **Output (CNY/1K tokens)** | | --- | --- | --- | --- | | deepseek-v4-pro | 0~1,000 | 0.0144 | 0.0288 | | deepseek-v4-flash-0731 | 0~1,000 | 0.0012 | 0.0024 | |
Outside the Chinese mainland
|
Model |
Input range (1K tokens) |
Input (CNY/1K tokens) |
Output (CNY/1K tokens) |
|
deepseek-v4-pro |
0~1,000 |
0.021583 |
0.043166 |
|
deepseek-v4-flash-0731 |
0~1,000 |
0.001799 |
0.003598 |
Chinese mainland
|
Model |
Input range (1K tokens) |
Input (USD/1K tokens) |
Output (USD/1K tokens) |
|
deepseek-v4-pro |
0~1,000 |
0.00198 |
0.003961 |
|
deepseek-v4-flash-0731 |
0~1,000 |
0.000165 |
0.00033 |
Outside the Chinese mainland
|
Model |
Input range (1K tokens) |
Input (USD/1K tokens) |
Output (USD/1K tokens) |
|
deepseek-v4-pro |
0~1,000 |
0.002968 |
0.005936 |
|
deepseek-v4-flash-0731 |
0~1,000 |
0.000247 |
0.000495 |
GLM
Chinese mainland
|
Model |
Input range (1K tokens) |
Input (CNY/1K tokens) |
Output (CNY/1K tokens) |
|
glm-5.2 |
0~1,000 |
0.0096 |
0.0336 |
Outside the Chinese mainland
|
Model |
Input range (1K tokens) |
Input (CNY/1K tokens) |
Output (CNY/1K tokens) |
|
glm-5.2 |
0~1,000 |
0.01259 |
0.039569 |
Chinese mainland
|
Model |
Input range (1K tokens) |
Input (USD/1K tokens) |
Output (USD/1K tokens) |
|
glm-5.2 |
0~1,000 |
0.00132 |
0.004621 |
Outside the Chinese mainland
|
Model |
Input range (1K tokens) |
Input (USD/1K tokens) |
Output (USD/1K tokens) |
|
glm-5.2 |
0~1,000 |
0.001731 |
0.005442 |
Embedding
Chinese mainland
Model | Input type | Input (CNY/1K tokens) |
qwen3.7-text-embedding | Text | 0.0006 |
text-embedding-v4 | Text | 0.0006 |
qwen3-vl-embedding | Text | 0.00084 |
Image | 0.00216 |
Outside the Chinese mainland
|
Model |
Input type |
Input (CNY/1K tokens) |
|
text-embedding-v4 |
Text |
0.000617 |
Chinese mainland
Model | Input type | Input (USD/1K tokens) |
qwen3.7-text-embedding | Text | 0.000083 |
text-embedding-v4 | Text | 0.000083 |
qwen3-vl-embedding | Text | 0.000116 |
Image | 0.000297 |
Outside the Chinese mainland
|
Model |
Input type |
Input (USD/1K tokens) |
|
text-embedding-v4 |
Text |
0.000085 |
Rerank
Chinese mainland
Model | Input type | Input (CNY/1K tokens) |
qwen3-rerank | Text | 0.0006 |
qwen3-vl-rerank | Text | 0.00084 |
Image | 0.00216 |
Outside the Chinese mainland
|
Model |
Input type |
Input (CNY/1K tokens) |
|
qwen3-rerank |
Text |
0.000899 |
Chinese mainland
Model | Input type | Input (USD/1K tokens) |
qwen3-rerank | Text | 0.000083 |
qwen3-vl-rerank | Text | 0.000116 |
Image | 0.000297 |
Outside the Chinese mainland
|
Model |
Input type |
Input (USD/1K tokens) |
|
qwen3-rerank |
Text |
0.000124 |
Qwen-Audio-TTS
Os modelos de síntese de voz são cobrados pelo uso de tokens de entrada. 1 caractere = 1,5 tokens.
Chinese mainland
|
Model |
Input (CNY/1K tokens) |
|
qwen-audio-3.0-tts-plus |
0.112 |
|
qwen-audio-3.0-tts-flash |
0.08 |
Outside the Chinese mainland
|
Model |
Input (CNY/1K tokens) |
|
qwen-audio-3.0-tts-plus |
0.119908 |
|
qwen-audio-3.0-tts-flash |
0.08993 |
Chinese mainland
|
Model |
Input (USD/1K tokens) |
|
qwen-audio-3.0-tts-plus |
0.015402 |
|
qwen-audio-3.0-tts-flash |
0.011002 |
Outside the Chinese mainland
|
Model |
Input (USD/1K tokens) |
|
qwen-audio-3.0-tts-plus |
0.01649 |
|
qwen-audio-3.0-tts-flash |
0.012367 |
CosyVoice
Os modelos de síntese de voz são cobrados pelo uso de tokens de entrada. 1 caractere = 1,5 tokens.
Chinese mainland
|
Model |
Input (CNY/1K tokens) |
|
cosyvoice-v3.5-plus |
0.12 |
|
cosyvoice-v3.5-flash |
0.064 |
Chinese mainland
|
Model |
Input (USD/1K tokens) |
|
cosyvoice-v3.5-plus |
0.016503 |
|
cosyvoice-v3.5-flash |
0.008801 |
Qwen-Audio-ASR
Os modelos de reconhecimento de voz são cobrados pela duração do áudio de entrada.
Chinese mainland
|
Model |
Input (CNY/second) |
|
qwen-audio-3.0-asr-flash-filetrans |
0.000264 |
|
qwen-audio-3.0-asr-flash |
0.000264 |
Outside the Chinese mainland
|
Model |
Input (CNY/second) |
|
qwen-audio-3.0-asr-flash-filetrans |
0.000312 |
|
qwen-audio-3.0-asr-flash |
0.000312 |
Chinese mainland
|
Model |
Input (USD/second) |
|
qwen-audio-3.0-asr-flash-filetrans |
0.000036 |
|
qwen-audio-3.0-asr-flash |
0.000036 |
Outside the Chinese mainland
|
Model |
Input (USD/second) |
|
qwen-audio-3.0-asr-flash-filetrans |
0.000043 |
|
qwen-audio-3.0-asr-flash |
0.000043 |
Fun-ASR
Os modelos de reconhecimento de voz são cobrados pela duração do áudio de entrada.
Chinese mainland
|
Model |
Input (CNY/second) |
|
fun-asr |
0.000264 |
Outside the Chinese mainland
|
Model |
Input (CNY/second) |
|
fun-asr |
0.000312 |
Chinese mainland
|
Model |
Input (USD/second) |
|
fun-asr |
0.000036 |
Outside the Chinese mainland
|
Model |
Input (USD/second) |
|
fun-asr |
0.000043 |
Qwen-Image
Os modelos de geração de imagens são cobrados pelo número de imagens de entrada e de saída.
Chinese mainland
Model | Output specification | Input (CNY/image) | Output (CNY/image) |
qwen-image-3.0 | 1k | 0.024 | 0.216 |
2k | 0.024 | 0.216 | |
qwen-image-3.0-pro | 1k | 0.024 | 0.3 |
2k | 0.024 | 0.6 |
Outside the Chinese mainland
Model | Output specification | Input (CNY/image) | Output (CNY/image) |
qwen-image-3.0 | 1k | 0.02698 | 0.269791 |
2k | 0.02698 | 0.269791 | |
qwen-image-3.0-pro | 1k | 0.02698 | 0.359722 |
2k | 0.02698 | 0.674478 |
Chinese mainland
Model | Output specification | Input (USD/image) | Output (USD/image) |
qwen-image-3.0 | 1k | 0.003301 | 0.029705 |
2k | 0.003301 | 0.029705 | |
qwen-image-3.0-pro | 1k | 0.003301 | 0.041256 |
2k | 0.003301 | 0.082513 |
Outside the Chinese mainland
Model | Output specification | Input (USD/image) | Output (USD/image) |
qwen-image-3.0 | 1k | 0.00371 | 0.037102 |
2k | 0.00371 | 0.037102 | |
qwen-image-3.0-pro | 1k | 0.00371 | 0.049469 |
2k | 0.00371 | 0.092755 |
HappyHorse
Os modelos de geração de vídeo são cobrados pela duração da saída.
Chinese mainland
China continental
Modelo | Especificação de saída | Saída (USD/segundo) |
happyhorse-1.1-t2v | 480P | 0.074262 |
720P | 0.148523 | |
1080P | 0.198031 | |
happyhorse-1.1-i2v | 480P | 0.074262 |
720P | 0.148523 | |
1080P | 0.198031 | |
happyhorse-1.1-r2v | 480P | 0.074262 |
720P | 0.148523 | |
1080P | 0.198031 |
Fora da China continental
Modelo | Especificação de saída | Saída (USD/segundo) |
happyhorse-1.1-t2v | 480P | 0.086571 |
720P | 0.173143 | |
1080P | 0.222612 | |
happyhorse-1.1-i2v | 480P | 0.086571 |
720P | 0.173143 | |
1080P | 0.222612 | |
happyhorse-1.1-r2v | 480P | 0.086571 |
720P | 0.173143 | |
1080P | 0.222612 |
Model
Output specification
Output (CNY/second)
happyhorse-1.1-t2v
480P
0.54
720P
1.08
1080P
1.44
happyhorse-1.1-i2v
480P
0.54
720P
1.08
1080P
1.44
happyhorse-1.1-r2v
480P
0.54
720P
1.08
Exemplo de Faturamento
Cenário: Usando qwen3.6-plus na região China North 2 (Beijing) (intervalo de entrada de 0 a 256K tokens), com consumo acumulado de 5.000K tokens de entrada e 1.200K tokens de saída.
Cálculo de Taxas:
Taxa de entrada: 5.000 × 0,00033 = 1,65 USD
Taxa de saída: 1.200 × 0,00198 = 2,376 USD
Total: 4,026 USD
Cenário (faturado por número de imagens): Usando qwen-image-3.0 na região China North 2 (Beijing) (especificação de saída 1k), com 20 imagens de referência enviadas e 100 imagens geradas.
Cálculo de Taxas:
Taxa de imagem de entrada: 20 × 0,003301 = 0,06602 USD
Taxa de imagem de saída: 100 × 0,029705 = 2,9705 USD
Total: 3,03652 USD
Cenário (faturado por duração - geração de vídeo): Usando happyhorse-1.1-t2v na região China North 2 (Beijing) (especificação de saída 720P) para gerar dez vídeos de 5 segundos, com duração total de saída de 50 segundos.
Cálculo de Taxas:
Taxa de geração de vídeo: 50 × 0,148523 = 7,42615 USD
Total: 7,42615 USD
Cenário (faturado por duração - reconhecimento de fala): Usando qwen-audio-3.0-asr-flash na região China North 2 (Beijing) para reconhecer áudio, com duração total de reconhecimento de 3.600 segundos.
Cálculo de Taxas:
Taxa de reconhecimento de fala: 3.600 × 0,000036 = 0,1296 USD
Total: 0,1296 USD
Detalhes da Fatura
As faturas são detalhadas por região, ID do workspace, tipo de uso do Flink, modelo, tipo de token ou tipo de uso, e intervalo de entrada ou especificação de saída.
Download Bills
Acesse a página Bill Details e selecione o período de faturamento.
Defina Product como Realtime Compute for Apache Flink, defina Product Name como Realtime Compute for Apache Flink_AI_PAYG_International e clique em Search.
Clique no ícone de exportação no canto superior direito da lista de faturas para baixar a fatura.
-
Abra o arquivo da fatura e localize a coluna Instance ID (billing granularity). Este campo é separado por ponto e vírgula (;) no seguinte formato:
-
Modelos faturados por token:
Region;Workspace ID;Project Name;Flink Usage;Model;Token Type;Input RangeSegment
Description
Region
Região do workspace
Workspace ID
Identificador único do workspace do Flink
Project Name
Atualmente vazio; campo reservado
Flink Usage
Cenário de uso do modelo; valores válidos:
ai_functionouflink_agentsModel
Nome do LLM invocado
Token Type
Input Token ou Output Token
Input Range
Marcador do limite superior do intervalo de tokens de entrada, como 128, 256, 1000, etc.
-
Modelos faturados por duração ou número de imagens:
Region;Workspace ID;Project Name;Flink Usage;Model;Output Specification;Usage TypeSegment
Description
Region
Região do workspace
Workspace ID
Identificador único do workspace do Flink
Project Name
Atualmente vazio; campo reservado
Flink Usage
Cenário de uso do modelo; valores válidos:
ai_functionouflink_agentsModel
Nome do LLM invocado
Output Specification
Para modelos faturados por número de imagens: a resolução da imagem, como 1k, 2k ou 4k.
Para modelos faturados por duração: a resolução de vídeo para modelos de geração de vídeo, como 480P, 720P ou 1080P. Modelos de reconhecimento de fala (ASR) não distinguem especificações de saída e são marcados como all.
Usage Type
Para modelos faturados por número de imagens: imagens de entrada e imagens de saída.
Para modelos faturados por duração: duração de entrada e duração de saída.
-
Pagamento em Atraso
Após a ocorrência de um pagamento em atraso, o service é suspenso e todos os jobs que utilizam modelos integrados ficam impossibilitados de invocá-los.
O service é restaurado automaticamente após o recarregamento do saldo da conta.
As requisições de invocação de modelos durante o período de inadimplência não são processadas, e os jobs correspondentes podem falhar.
Interromper o Faturamento
Para interromper o faturamento do AI service, clique em Disable Service na página AI Service no console. Após desabilitar o service:
Todos os jobs ficarão impossibilitados de chamar o service de modelo integrado.
Nenhuma taxa adicional de invocação do AI service será gerada.
As taxas de recursos de computação CU do workspace não são afetadas.
Antes de desabilitar o AI service, verifique se nenhum job depende de modelos integrados. Caso contrário, os jobs poderão falhar em tempo de execução.