Todos os produtos
Search
Central de documentação

MaxCompute:AI inference fees

Última atualização: Aug 13, 2026

A inferência de IA do MaxCompute é um novo recurso pronto para uso, com pagamento conforme o uso, que permite utilizar grandes modelos para processamento de dados ou inferência offline. Este tópico descreve as regras de faturamento da inferência de IA.

Visão geral

O service de inferência de IA do MaxCompute oferece inferência de grandes modelos, permitindo chamar modelos prontos para uso diretamente em jobs SQL e MaxFrame por meio de uma função de IA integrada. O faturamento ocorre no modelo de pagamento conforme o uso, com base no número total de tokens de entrada e saída.

  • Regiões suportadas: O service de inferência de modelos está disponível apenas nas regiões a seguir.

    • China continental: China (Beijing), China (Shanghai), China (Hangzhou), China (Shenzhen) e China (Ulanqab)

    • Internacional: Singapore

  • Modelos suportados: Para utilizar os modelos abaixo, ative primeiro o service de inferência de modelos na região de destino, como China (Beijing).

    Modelo

    Tipo

    Descrição

    qwen3.8-max

    Suporta entrada de dados multimodais

    Modelo principal Mixture of Experts (MoE) da série Qwen 3.8, com 2,4 trilhões de parâmetros. Oferece capacidades significativamente aprimoradas de programação e produtividade em escritório, podendo programar de forma autônoma por mais de dez dias para entregar projetos completos. Ideal para cenários altamente complexos, como programação autônoma, automação avançada de escritório, pesquisa científica e tarefas de longa duração.

    qwen3.7-max

    Apenas entrada de texto

    Modelo principal da série Qwen 3.7, com atualizações abrangentes em inferência, geração de código e compreensão multilíngue. Adequado para tarefas de alta complexidade.

    qwen3.7-plus

    Suporta entrada de dados multimodais

    Modelo equilibrado da série Qwen 3.7, com boa relação entre desempenho e custo. Recomendado para cenários empresariais, como análise de textos longos e conversas com múltiplas rodadas.

    qwen3.7-flash

    Suporta entrada de dados multimodais

    Modelo leve e de alta velocidade, nativo de visão e linguagem da série Qwen 3.7. Apresenta compreensão multimodal aprimorada e capacidades de execução de agentes, sendo ideal para services online de alta concorrência e baixa latência, além de tarefas multimodais leves.

    qwen3.7-text-embedding

    Apenas entrada de texto

    Este modelo unificado de vetores de texto multilíngue, treinado no Qwen 3.7, oferece melhorias significativas de desempenho em recuperação de texto, clustering e classificação em comparação à versão text-embedding-v4.

    qwen3-vl-embedding

    Suporta entrada de dados multimodais

    Modelo de embedding vetorial multimodal do Qwen que suporta representações vetoriais para entradas mistas de imagem e texto. Indicado para cenários de recuperação cross-modal e correspondência entre imagem e texto.

    text-embedding-v4

    Apenas entrada de texto

    Modelo de embedding vetorial de texto de alta precisão, adequado para busca semântica, clustering e cálculo de similaridade.

    qwen3.6-plus

    Suporta entrada de dados multimodais

    Modelo equilibrado da série Qwen 3.6, com boa relação entre desempenho e custo. Projetado para cenários de negócios gerais, como diálogo, resumo e análise.

    qwen3.6-flash

    Suporta entrada de dados multimodais

    Modelo leve e de alta velocidade da série Qwen 3.6. Fornece respostas rápidas a baixo custo, sendo ideal para services online de alta concorrência e baixa latência.

    deepseek-v4-pro

    Apenas entrada de texto

    Modelo de inferência principal de quarta geração da DeepSeek. Destaca-se em tarefas de alta dificuldade, como matemática, codificação e raciocínio lógico complexo.

    deepseek-v4-flash

    Apenas entrada de texto

    Modelo leve de quarta geração da DeepSeek. Oferece inferência rápida e excelente custo-benefício, adequado para conversas cotidianas e tarefas de inferência leves.

    qwen3.5-397b-a17b

    Suporta entrada de dados multimodais

    Modelo Mixture of Experts (MoE) da série Qwen 3.5. Apresenta ativação eficiente de parâmetros, vasta base de conhecimento e capacidades de raciocínio em múltiplas etapas. Desenvolvido para dedução lógica de alta dificuldade, geração de código full-stack e perguntas e respostas com conhecimento aprofundado.

    qwen3.5-omni-plus

    Suporta entrada de dados multimodais

    O Qwen3.5-Omni é o mais recente grande modelo omni-modal do Qwen. Adequado para cenários como criação de texto, assistentes de voz e análise multimídia, proporcionando uma experiência natural e fluida de compreensão e interação multimodal.

    qwen3-asr-flash

    Suporta entrada de dados multimodais

    Modelo leve de reconhecimento de fala da série Qwen 3. Realiza transcrição em tempo real com baixa latência e alta concorrência, indicado para cenários de processamento de áudio em tempo real, como geração de atas de reunião, legendas de transmissão ao vivo e reconhecimento de comandos de voz.

    tongyi-embedding-vision-plus

    Suporta entrada de dados multimodais

    O Tongyi-Embedding-Vision é um modelo de representação multimodal visual construído sobre um grande modelo de linguagem (LLM). Suporta diversas tarefas downstream, incluindo busca imagem-imagem, busca texto-imagem, busca texto-vídeo, busca vídeo-vídeo, busca texto-texto e busca texto-imagem-e-texto.

    qwen3-max (Descontinuação em breve)

    Apenas entrada de texto

    Grande modelo de linguagem de alto desempenho da série Qwen, adequado para inferência complexa e geração de conteúdo.

    Importante

    O modelo qwen3-max será descontinuado em breve. Para garantir a continuidade do service, migre seus services relacionados para um novo modelo o quanto antes. Para mais informações, consulte Model Decommissioning Policy.

Nota

As taxas do service de inferência de modelos são geradas apenas quando você utiliza os modelos públicos listados acima em jobs MaxFrame Overview e SQL por meio de uma função de IA. A cobrança ocorre somente para jobs bem-sucedidos; jobs com falha não geram custos.

Regras de faturamento

O service de inferência de modelo é faturado com base no uso de tokens. As dimensões de faturamento incluem:

  • Região

  • Tipo de modelo

  • Tipo de token: diferencia entre tokens de entrada e saída, indicando a faixa de preço baseada no uso.