Todos os produtos
Search
Central de documentação

Realtime Compute for Apache Flink:Faturamento de AI service (pagamento conforme o uso)

Última atualização: Sep 19, 2026

Chamadas de inferência a modelos integrados geram taxas de invocação cobradas pelo uso — como tokens, duração de áudio e vídeo, e quantidade de imagens —, independentemente das taxas de recursos de computação CU do workspace.

Visão Geral do Faturamento

image
  • Recursos de Computação (CU): Recursos de computação necessários para a execução de jobs, faturados da mesma forma que o faturamento CU existente.

  • Taxa de Invocação de AI Service: Taxas geradas pela chamada de modelos integrados, cobradas de forma independente pelo uso — como tokens, duração de áudio e vídeo, e quantidade de imagens.

Para informações sobre o faturamento de cloud products relacionados, consulte Itens Faturáveis.

Regras de Faturamento

  • Unidade de Faturamento:

    • Faturamento por token: abrange modelos de geração de texto, síntese de voz, embedding e rerank. Os preços são expressos em CNY por 1.000 tokens no site China e em USD por 1.000 tokens no site internacional. Tokens de entrada e de saída são faturados separadamente.

    • Faturamento por duração: abrange modelos de geração de vídeo e reconhecimento de voz. Os preços são expressos em CNY por segundo no site China e em USD por segundo no site internacional.

    • Faturamento por quantidade de imagens: abrange modelos de geração de imagens. Os preços são expressos em CNY por imagem no site China e em USD por imagem no site internacional.

  • Ciclo de Faturamento: Liquidado uma vez por minuto (com base no horário UTC+8), gerando faturas e deduzindo taxas, com uma latência de faturamento de aproximadamente 1 a 10 minutos.

  • Dimensões de Faturamento: Cobrado pela combinação de Region × Model × Input Range or Output Specification × Usage Type. Custo por minuto = Σ(uso real por tipo × preço unitário).

  • Camada Gratuita: O primeiro 1 milhão de tokens por conta principal, por região, por mês calendário (com base no horário UTC+8) é gratuito (entrada e saída combinadas). O uso excedente é faturado pelos preços listados. Para modelos que não são faturados por token, o uso é convertido em tokens pelas seguintes regras e contabilizado na camada gratuita:

    • Modelos de geração de imagens (como qwen-image-3.0-pro e qwen-image-3.0): cada imagem consome 10.000 tokens da camada gratuita.

    • Modelos de geração de vídeo (como happyhorse-1.1-t2v, happyhorse-1.1-i2v e happyhorse-1.1-r2v): cada segundo consome 30.000 tokens da camada gratuita.

    • Modelos de reconhecimento de voz (como qwen-audio-3.0-asr-flash-filetrans, qwen-audio-3.0-asr-flash e fun-asr): cada segundo consome 10 tokens.

Faturamento por token

Nos modelos faturados por token, a taxa de cada requisição é medida pelos seguintes tipos:

  • Token de Entrada Padrão: Faturado pelo preço unitário base de entrada.

  • Token de Saída Padrão: Faturado pelo preço unitário base de saída.

  • Token de Entrada com Cache Implícito: Exceto para modelos com especificação diferente, faturado a 20% do preço base de entrada.

  • Token de Entrada de Criação de Cache Explícito: Exceto para modelos com especificação diferente, faturado a 125% do preço base de entrada.

  • Token de Entrada com Hit de Cache Explícito: Exceto para modelos com especificação diferente, faturado a 10% do preço base de entrada.

Custo por minuto = Σ(uso de tokens por tipo × preço unitário). O preço unitário dos tokens de cache = preço unitário base de entrada × coeficiente de faturamento.

Faturamento por duração

Nos modelos faturados por duração, a taxa de cada requisição é medida pelos seguintes tipos:

  • Duração de entrada: faturada pelo preço unitário de entrada.

  • Duração de saída: faturada pelo preço unitário de saída.

Custo por minuto = Σ(duração faturada por tipo × preço unitário). A duração faturada varia conforme o modelo: alguns são cobrados apenas pela duração de entrada, outros apenas pela de saída, e alguns por ambas. Consulte as tabelas de preços para mais detalhes.

Faturamento por quantidade de imagens

Nos modelos faturados por quantidade de imagens, a taxa de cada requisição é medida pelos seguintes tipos:

  • Quantidade de imagens de entrada: faturada pelo preço unitário de entrada.

  • Quantidade de imagens de saída: faturada pelo preço unitário de saída.

Custo por minuto = Σ(quantidade de imagens por tipo × preço unitário). A quantidade de imagens faturada varia conforme o modelo: alguns são cobrados apenas pelas imagens de entrada, outros apenas pelas de saída, e alguns por ambas. Consulte as tabelas de preços para mais detalhes.

Preços

Importante

Os preços reais estão sujeitos aos extratos de faturamento.

Preços Base

As tabelas a seguir apresentam os preços unitários base de tokens de entrada/saída padrão, duração e número de imagens. Os tokens do tipo cache são cobrados com base nos preços base multiplicados pelos coeficientes correspondentes. Para mais detalhes, consulte Coeficientes de Faturamento de Token de Cache.

  • Mainland da China: inclui regiões como China (Hangzhou) e China (Beijing).

  • Fora da mainland da China: abrange todas as regiões fora da mainland da China, como China (Hong Kong), Singapore e US.

Para a lista de regiões, consulte Regiões suportadas.

Qwen

Chinese mainland

Model

Input range (1K tokens)

Input (USD/1K tokens)

Output (USD/1K tokens)

qwen3.8-max

0~1,000

0.00198

0.005941

qwen3.7-max

0~1,000

0.00198

0.005941

qwen3.7-plus

0~256

0.00033

0.00132

256~1,000

0.00099

0.003961

qwen3.6-plus

0~256

0.00033

0.00198

256~1,000

0.00132

0.007921

qwen3.5-plus

0~128

0.000132

0.000792

128~256

0.00033

0.00198

256~1,000

0.00066

0.003961

qwen3.7-flash

0~32

0.000033

0.000132

32~256

0.000099

0.000396

256~1,000

0.000198

0.000792

qwen3.6-flash

0~256

0.000198

0.001188

### **DeepSeek** #### Chinese mainland | **Model** | **Input range (1K tokens)** | **Input (CNY/1K tokens)** | **Output (CNY/1K tokens)** | | --- | --- | --- | --- | | deepseek-v4-pro | 0~1,000 | 0.0144 | 0.0288 | | deepseek-v4-flash-0731 | 0~1,000 | 0.0012 | 0.0024 |

Outside the Chinese mainland

Model

Input range (1K tokens)

Input (CNY/1K tokens)

Output (CNY/1K tokens)

deepseek-v4-pro

0~1,000

0.021583

0.043166

deepseek-v4-flash-0731

0~1,000

0.001799

0.003598

Chinese mainland

Model

Input range (1K tokens)

Input (USD/1K tokens)

Output (USD/1K tokens)

deepseek-v4-pro

0~1,000

0.00198

0.003961

deepseek-v4-flash-0731

0~1,000

0.000165

0.00033

Outside the Chinese mainland

Model

Input range (1K tokens)

Input (USD/1K tokens)

Output (USD/1K tokens)

deepseek-v4-pro

0~1,000

0.002968

0.005936

deepseek-v4-flash-0731

0~1,000

0.000247

0.000495

GLM

Chinese mainland

Model

Input range (1K tokens)

Input (CNY/1K tokens)

Output (CNY/1K tokens)

glm-5.2

0~1,000

0.0096

0.0336

Outside the Chinese mainland

Model

Input range (1K tokens)

Input (CNY/1K tokens)

Output (CNY/1K tokens)

glm-5.2

0~1,000

0.01259

0.039569

Chinese mainland

Model

Input range (1K tokens)

Input (USD/1K tokens)

Output (USD/1K tokens)

glm-5.2

0~1,000

0.00132

0.004621

Outside the Chinese mainland

Model

Input range (1K tokens)

Input (USD/1K tokens)

Output (USD/1K tokens)

glm-5.2

0~1,000

0.001731

0.005442

Embedding

Chinese mainland

Model

Input type

Input (CNY/1K tokens)

qwen3.7-text-embedding

Text

0.0006

text-embedding-v4

Text

0.0006

qwen3-vl-embedding

Text

0.00084

Image

0.00216

Outside the Chinese mainland

Model

Input type

Input (CNY/1K tokens)

text-embedding-v4

Text

0.000617

Chinese mainland

Model

Input type

Input (USD/1K tokens)

qwen3.7-text-embedding

Text

0.000083

text-embedding-v4

Text

0.000083

qwen3-vl-embedding

Text

0.000116

Image

0.000297

Outside the Chinese mainland

Model

Input type

Input (USD/1K tokens)

text-embedding-v4

Text

0.000085

Rerank

Chinese mainland

Model

Input type

Input (CNY/1K tokens)

qwen3-rerank

Text

0.0006

qwen3-vl-rerank

Text

0.00084

Image

0.00216

Outside the Chinese mainland

Model

Input type

Input (CNY/1K tokens)

qwen3-rerank

Text

0.000899

Chinese mainland

Model

Input type

Input (USD/1K tokens)

qwen3-rerank

Text

0.000083

qwen3-vl-rerank

Text

0.000116

Image

0.000297

Outside the Chinese mainland

Model

Input type

Input (USD/1K tokens)

qwen3-rerank

Text

0.000124

Qwen-Audio-TTS

Os modelos de síntese de voz são cobrados pelo uso de tokens de entrada. 1 caractere = 1,5 tokens.

Chinese mainland

Model

Input (CNY/1K tokens)

qwen-audio-3.0-tts-plus

0.112

qwen-audio-3.0-tts-flash

0.08

Outside the Chinese mainland

Model

Input (CNY/1K tokens)

qwen-audio-3.0-tts-plus

0.119908

qwen-audio-3.0-tts-flash

0.08993

Chinese mainland

Model

Input (USD/1K tokens)

qwen-audio-3.0-tts-plus

0.015402

qwen-audio-3.0-tts-flash

0.011002

Outside the Chinese mainland

Model

Input (USD/1K tokens)

qwen-audio-3.0-tts-plus

0.01649

qwen-audio-3.0-tts-flash

0.012367

CosyVoice

Os modelos de síntese de voz são cobrados pelo uso de tokens de entrada. 1 caractere = 1,5 tokens.

Chinese mainland

Model

Input (CNY/1K tokens)

cosyvoice-v3.5-plus

0.12

cosyvoice-v3.5-flash

0.064

Chinese mainland

Model

Input (USD/1K tokens)

cosyvoice-v3.5-plus

0.016503

cosyvoice-v3.5-flash

0.008801

Qwen-Audio-ASR

Os modelos de reconhecimento de voz são cobrados pela duração do áudio de entrada.

Chinese mainland

Model

Input (CNY/second)

qwen-audio-3.0-asr-flash-filetrans

0.000264

qwen-audio-3.0-asr-flash

0.000264

Outside the Chinese mainland

Model

Input (CNY/second)

qwen-audio-3.0-asr-flash-filetrans

0.000312

qwen-audio-3.0-asr-flash

0.000312

Chinese mainland

Model

Input (USD/second)

qwen-audio-3.0-asr-flash-filetrans

0.000036

qwen-audio-3.0-asr-flash

0.000036

Outside the Chinese mainland

Model

Input (USD/second)

qwen-audio-3.0-asr-flash-filetrans

0.000043

qwen-audio-3.0-asr-flash

0.000043

Fun-ASR

Os modelos de reconhecimento de voz são cobrados pela duração do áudio de entrada.

Chinese mainland

Model

Input (CNY/second)

fun-asr

0.000264

Outside the Chinese mainland

Model

Input (CNY/second)

fun-asr

0.000312

Chinese mainland

Model

Input (USD/second)

fun-asr

0.000036

Outside the Chinese mainland

Model

Input (USD/second)

fun-asr

0.000043

Qwen-Image

Os modelos de geração de imagens são cobrados pelo número de imagens de entrada e de saída.

Chinese mainland

Model

Output specification

Input (CNY/image)

Output (CNY/image)

qwen-image-3.0

1k

0.024

0.216

2k

0.024

0.216

qwen-image-3.0-pro

1k

0.024

0.3

2k

0.024

0.6

Outside the Chinese mainland

Model

Output specification

Input (CNY/image)

Output (CNY/image)

qwen-image-3.0

1k

0.02698

0.269791

2k

0.02698

0.269791

qwen-image-3.0-pro

1k

0.02698

0.359722

2k

0.02698

0.674478

Chinese mainland

Model

Output specification

Input (USD/image)

Output (USD/image)

qwen-image-3.0

1k

0.003301

0.029705

2k

0.003301

0.029705

qwen-image-3.0-pro

1k

0.003301

0.041256

2k

0.003301

0.082513

Outside the Chinese mainland

Model

Output specification

Input (USD/image)

Output (USD/image)

qwen-image-3.0

1k

0.00371

0.037102

2k

0.00371

0.037102

qwen-image-3.0-pro

1k

0.00371

0.049469

2k

0.00371

0.092755

HappyHorse

Os modelos de geração de vídeo são cobrados pela duração da saída.

Chinese mainland

China continental

Modelo

Especificação de saída

Saída (USD/segundo)

happyhorse-1.1-t2v

480P

0.074262

720P

0.148523

1080P

0.198031

happyhorse-1.1-i2v

480P

0.074262

720P

0.148523

1080P

0.198031

happyhorse-1.1-r2v

480P

0.074262

720P

0.148523

1080P

0.198031

Fora da China continental

Modelo

Especificação de saída

Saída (USD/segundo)

happyhorse-1.1-t2v

480P

0.086571

720P

0.173143

1080P

0.222612

happyhorse-1.1-i2v

480P

0.086571

720P

0.173143

1080P

0.222612

happyhorse-1.1-r2v

480P

0.086571

720P

0.173143

1080P

0.222612

Model

Output specification

Output (CNY/second)

happyhorse-1.1-t2v

480P

0.54

720P

1.08

1080P

1.44

happyhorse-1.1-i2v

480P

0.54

720P

1.08

1080P

1.44

happyhorse-1.1-r2v

480P

0.54

720P

1.08

Exemplo de Faturamento

Cenário: Usando qwen3.6-plus na região China North 2 (Beijing) (intervalo de entrada de 0 a 256K tokens), com consumo acumulado de 5.000K tokens de entrada e 1.200K tokens de saída.

Cálculo de Taxas:

  • Taxa de entrada: 5.000 × 0,00033 = 1,65 USD

  • Taxa de saída: 1.200 × 0,00198 = 2,376 USD

  • Total: 4,026 USD

Cenário (faturado por número de imagens): Usando qwen-image-3.0 na região China North 2 (Beijing) (especificação de saída 1k), com 20 imagens de referência enviadas e 100 imagens geradas.

Cálculo de Taxas:

  • Taxa de imagem de entrada: 20 × 0,003301 = 0,06602 USD

  • Taxa de imagem de saída: 100 × 0,029705 = 2,9705 USD

  • Total: 3,03652 USD

Cenário (faturado por duração - geração de vídeo): Usando happyhorse-1.1-t2v na região China North 2 (Beijing) (especificação de saída 720P) para gerar dez vídeos de 5 segundos, com duração total de saída de 50 segundos.

Cálculo de Taxas:

  • Taxa de geração de vídeo: 50 × 0,148523 = 7,42615 USD

  • Total: 7,42615 USD

Cenário (faturado por duração - reconhecimento de fala): Usando qwen-audio-3.0-asr-flash na região China North 2 (Beijing) para reconhecer áudio, com duração total de reconhecimento de 3.600 segundos.

Cálculo de Taxas:

  • Taxa de reconhecimento de fala: 3.600 × 0,000036 = 0,1296 USD

  • Total: 0,1296 USD

Detalhes da Fatura

As faturas são detalhadas por região, ID do workspace, tipo de uso do Flink, modelo, tipo de token ou tipo de uso, e intervalo de entrada ou especificação de saída.

Download Bills

  1. Acesse a página Bill Details e selecione o período de faturamento.

  2. Defina Product como Realtime Compute for Apache Flink, defina Product Name como Realtime Compute for Apache Flink_AI_PAYG_International e clique em Search.

  3. Clique no ícone de exportação no canto superior direito da lista de faturas para baixar a fatura.

  4. Abra o arquivo da fatura e localize a coluna Instance ID (billing granularity). Este campo é separado por ponto e vírgula (;) no seguinte formato:

    1. Modelos faturados por token:

      Region;Workspace ID;Project Name;Flink Usage;Model;Token Type;Input Range

      Segment

      Description

      Region

      Região do workspace

      Workspace ID

      Identificador único do workspace do Flink

      Project Name

      Atualmente vazio; campo reservado

      Flink Usage

      Cenário de uso do modelo; valores válidos: ai_function ou flink_agents

      Model

      Nome do LLM invocado

      Token Type

      Input Token ou Output Token

      Input Range

      Marcador do limite superior do intervalo de tokens de entrada, como 128, 256, 1000, etc.

    2. Modelos faturados por duração ou número de imagens:

      Region;Workspace ID;Project Name;Flink Usage;Model;Output Specification;Usage Type

      Segment

      Description

      Region

      Região do workspace

      Workspace ID

      Identificador único do workspace do Flink

      Project Name

      Atualmente vazio; campo reservado

      Flink Usage

      Cenário de uso do modelo; valores válidos: ai_function ou flink_agents

      Model

      Nome do LLM invocado

      Output Specification

      Para modelos faturados por número de imagens: a resolução da imagem, como 1k, 2k ou 4k.

      Para modelos faturados por duração: a resolução de vídeo para modelos de geração de vídeo, como 480P, 720P ou 1080P. Modelos de reconhecimento de fala (ASR) não distinguem especificações de saída e são marcados como all.

      Usage Type

      Para modelos faturados por número de imagens: imagens de entrada e imagens de saída.

      Para modelos faturados por duração: duração de entrada e duração de saída.

Pagamento em Atraso

  • Após a ocorrência de um pagamento em atraso, o service é suspenso e todos os jobs que utilizam modelos integrados ficam impossibilitados de invocá-los.

  • O service é restaurado automaticamente após o recarregamento do saldo da conta.

  • As requisições de invocação de modelos durante o período de inadimplência não são processadas, e os jobs correspondentes podem falhar.

Interromper o Faturamento

Para interromper o faturamento do AI service, clique em Disable Service na página AI Service no console. Após desabilitar o service:

  • Todos os jobs ficarão impossibilitados de chamar o service de modelo integrado.

  • Nenhuma taxa adicional de invocação do AI service será gerada.

  • As taxas de recursos de computação CU do workspace não são afetadas.

Importante

Antes de desabilitar o AI service, verifique se nenhum job depende de modelos integrados. Caso contrário, os jobs poderão falhar em tempo de execução.