Todos os produtos
Search
Central de documentação

E-MapReduce:Itens e métodos de faturamento

Última atualização: Jun 27, 2026

Os custos do EMR Serverless Spark dividem-se entre workspace e cluster de cache e abrangem três itens: recursos de computação, chamadas de modelo e recursos de cache. Estão disponíveis diversos métodos de faturamento, incluindo pagamento conforme o uso e assinatura. Este tópico detalha cada item e explica como estimar o uso.

Composição do faturamento

O diagrama a seguir ilustra o detalhamento dos custos.

image

Métodos de faturamento

O EMR Serverless Spark oferece os seguintes métodos de faturamento:

Método de faturamento

Descrição

Recursos de computação (pagamento conforme o uso)

Pagamento pós-uso. Cobrança horária (no início de cada hora, UTC+8) baseada no consumo real de recursos. Ideal para cargas de trabalho variáveis.

Recursos de computação (assinatura)

Pagamento antecipado por um período fixo. O preço é calculado por ciclo de faturamento conforme a duração da assinatura. Recomendado para cargas de trabalho estáveis e de longo prazo com orçamentos previsíveis.

Recursos de computação (faturamento híbrido)

Adicione recursos de computação elásticos à sua assinatura. Combina a flexibilidade do pagamento conforme o uso com a eficiência de custos da assinatura.

Recursos de computação (plano de recursos)

Adquira antecipadamente um plano de recursos com desconto. O sistema deduz o uso primeiramente do plano; o excedente segue as tarifas de pagamento conforme o uso. Indicado para cargas de trabalho relativamente estáveis.

Chamadas de modelo (pagamento conforme o uso)

Cobrança baseada no uso real de tokens dos modelos integrados do AI Center no workspace.

Cache de dados (pagamento conforme o uso)

Pagamento pós-uso. Cobrança horária (no início de cada hora, UTC+8) baseada na cota de cache alocada e na duração do uso. Projetado para jobs do Serverless Spark que exigem carregamento de dados mais rápido.

Detalhes dos itens de faturamento

Recursos de computação

A cobrança dos recursos de computação baseia-se no plano de assinatura ou no uso real (pagamento conforme o uso). A unidade de medida é CU.

1 CU = 1 vCPU + 4 GiB de memória. Essa é a unidade básica de computação do EMR Serverless Spark. O consumo de CU varia conforme o volume de dados, a complexidade computacional, a distribuição dos dados e a ativação do Fusion engine. O Fusion engine não aumenta os custos e geralmente reduz o tempo de execução dos jobs em mais de 30%.

Se a proporção entre vCPU e memória for inferior a 1:4, consulte a página Promoções de CU do EMR Serverless Spark para entender a conversão de CU.

Capacidade de processamento de 1 CU:

Cenário de processamento

Capacidade de processamento (Java Runtime)

Capacidade de processamento (Fusion engine)

Processamento simples de dados, como filtragem e limpeza.

1 CU processa cerca de 2.000.000 registros por segundo.

1 CU processa cerca de 5.000.000 registros por segundo.

Processamento complexo de dados, como agregações, junções e operações de string.

1 CU processa cerca de 700.000 registros por segundo.

1 CU processa cerca de 2.000.000 registros por segundo.

Chamadas de modelo

As chamadas de modelo são faturadas conforme o uso real dos serviços de modelo integrados do AI Center. A unidade de cobrança é milhar de Tokens.

Estimativa de tokens: • 1 caractere chinês ≈ 1,5–2 Tokens • 1 letra do alfabeto latino ≈ 0,25 Tokens • 1 palavra em inglês ≈ 1,3 Tokens

  • Alibaba Cloud Model Studio: ≈ 4–5 Tokens

  • Hello World: ≈ 2 Tokens

Por exemplo, para mascarar 1.000 registros de texto em lote, use o seguinte SQL:

select
  ai_query (
    concat(
      'Mask the following text according to these rules:
      1. Chinese names: Detect all Chinese names (2–4 characters). Keep the first and last characters. Replace middle characters with `*`.
      2. Mobile phone numbers: Detect Chinese mainland mobile numbers (11 digits, starting with 1). Keep the first 3 and last 4 digits. Replace the middle 4 digits with `****`.
      3. Physical addresses: Detect specific physical address information, such as province, city, district, street, and building number. Keep only the province, city, and district (county) levels. Replace all detailed street, building number, and community names after the district/county level with `***`.
      Output requirements:
      Return only the following three lines. Do not include explanations, original text, or other content:
      Name: [result]
      Mobile: [result]
      Address: [result]',
      user_info
    )
  )AS masked_text
from
  user_tbl
;

Como exemplo, um valor de user_info pode ser: "O Sr. Li Si reside no nº xxx, Rua Moumou, Parque de Alta Tecnologia de Zhangjiang, Nova Área de Pudong, Xangai. Seu número de celular é 159****."

A estimativa de uso de tokens para um único registro é:

Uso estimado de Tokens

Dados de entrada user_info

≈ 60

prompt

≈ 200

Dados de saída

≈ 50

Estimativa de uso de tokens para 10.000 registros:

Uso estimado

Fórmula de cálculo

Tokens de entrada (estimado)

≈ 2.600 mil Tokens

(60 + 200) Tokens/registro × 10.000 registros

Tokens de saída (estimado)

≈ 500 mil Tokens

50 Tokens/registro × 10.000 registros

Cluster de cache

A cobrança dos clusters de cache considera a cota de cache alocada e a duração do uso. A unidade é GB. Para regras de faturamento, ciclos de cobrança e preços regionais, consulte Cache de dados (pagamento conforme o uso).