A inferência de IA do MaxCompute é um novo recurso pronto para uso, com pagamento conforme o uso, que permite utilizar grandes modelos para processamento de dados ou inferência offline. Este tópico descreve as regras de faturamento da inferência de IA.
Visão geral
O service de inferência de IA do MaxCompute oferece inferência de grandes modelos, permitindo chamar modelos prontos para uso diretamente em jobs SQL e MaxFrame por meio de uma função de IA integrada. O faturamento ocorre no modelo de pagamento conforme o uso, com base no número total de tokens de entrada e saída.
-
Regiões suportadas: O service de inferência de modelos está disponível apenas nas regiões a seguir.
China continental: China (Beijing), China (Shanghai), China (Hangzhou), China (Shenzhen) e China (Ulanqab)
Internacional: Singapore
-
Modelos suportados: Para utilizar os modelos abaixo, ative primeiro o service de inferência de modelos na região de destino, como China (Beijing).
Modelo
Tipo
Descrição
qwen3.8-maxSuporta entrada de dados multimodais
Modelo principal Mixture of Experts (MoE) da série Qwen 3.8, com 2,4 trilhões de parâmetros. Oferece capacidades significativamente aprimoradas de programação e produtividade em escritório, podendo programar de forma autônoma por mais de dez dias para entregar projetos completos. Ideal para cenários altamente complexos, como programação autônoma, automação avançada de escritório, pesquisa científica e tarefas de longa duração.
qwen3.7-maxApenas entrada de texto
Modelo principal da série Qwen 3.7, com atualizações abrangentes em inferência, geração de código e compreensão multilíngue. Adequado para tarefas de alta complexidade.
qwen3.7-plusSuporta entrada de dados multimodais
Modelo equilibrado da série Qwen 3.7, com boa relação entre desempenho e custo. Recomendado para cenários empresariais, como análise de textos longos e conversas com múltiplas rodadas.
qwen3.7-flashSuporta entrada de dados multimodais
Modelo leve e de alta velocidade, nativo de visão e linguagem da série Qwen 3.7. Apresenta compreensão multimodal aprimorada e capacidades de execução de agentes, sendo ideal para services online de alta concorrência e baixa latência, além de tarefas multimodais leves.
qwen3.7-text-embeddingApenas entrada de texto
Este modelo unificado de vetores de texto multilíngue, treinado no Qwen 3.7, oferece melhorias significativas de desempenho em recuperação de texto, clustering e classificação em comparação à versão text-embedding-v4.
qwen3-vl-embeddingSuporta entrada de dados multimodais
Modelo de embedding vetorial multimodal do Qwen que suporta representações vetoriais para entradas mistas de imagem e texto. Indicado para cenários de recuperação cross-modal e correspondência entre imagem e texto.
text-embedding-v4Apenas entrada de texto
Modelo de embedding vetorial de texto de alta precisão, adequado para busca semântica, clustering e cálculo de similaridade.
qwen3.6-plusSuporta entrada de dados multimodais
Modelo equilibrado da série Qwen 3.6, com boa relação entre desempenho e custo. Projetado para cenários de negócios gerais, como diálogo, resumo e análise.
qwen3.6-flashSuporta entrada de dados multimodais
Modelo leve e de alta velocidade da série Qwen 3.6. Fornece respostas rápidas a baixo custo, sendo ideal para services online de alta concorrência e baixa latência.
deepseek-v4-proApenas entrada de texto
Modelo de inferência principal de quarta geração da DeepSeek. Destaca-se em tarefas de alta dificuldade, como matemática, codificação e raciocínio lógico complexo.
deepseek-v4-flashApenas entrada de texto
Modelo leve de quarta geração da DeepSeek. Oferece inferência rápida e excelente custo-benefício, adequado para conversas cotidianas e tarefas de inferência leves.
qwen3.5-397b-a17bSuporta entrada de dados multimodais
Modelo Mixture of Experts (MoE) da série Qwen 3.5. Apresenta ativação eficiente de parâmetros, vasta base de conhecimento e capacidades de raciocínio em múltiplas etapas. Desenvolvido para dedução lógica de alta dificuldade, geração de código full-stack e perguntas e respostas com conhecimento aprofundado.
qwen3.5-omni-plusSuporta entrada de dados multimodais
O Qwen3.5-Omni é o mais recente grande modelo omni-modal do Qwen. Adequado para cenários como criação de texto, assistentes de voz e análise multimídia, proporcionando uma experiência natural e fluida de compreensão e interação multimodal.
qwen3-asr-flashSuporta entrada de dados multimodais
Modelo leve de reconhecimento de fala da série Qwen 3. Realiza transcrição em tempo real com baixa latência e alta concorrência, indicado para cenários de processamento de áudio em tempo real, como geração de atas de reunião, legendas de transmissão ao vivo e reconhecimento de comandos de voz.
tongyi-embedding-vision-plusSuporta entrada de dados multimodais
O Tongyi-Embedding-Vision é um modelo de representação multimodal visual construído sobre um grande modelo de linguagem (LLM). Suporta diversas tarefas downstream, incluindo busca imagem-imagem, busca texto-imagem, busca texto-vídeo, busca vídeo-vídeo, busca texto-texto e busca texto-imagem-e-texto.
qwen3-max(Descontinuação em breve)Apenas entrada de texto
Grande modelo de linguagem de alto desempenho da série Qwen, adequado para inferência complexa e geração de conteúdo.
ImportanteO modelo
qwen3-maxserá descontinuado em breve. Para garantir a continuidade do service, migre seus services relacionados para um novo modelo o quanto antes. Para mais informações, consulte Model Decommissioning Policy.
As taxas do service de inferência de modelos são geradas apenas quando você utiliza os modelos públicos listados acima em jobs MaxFrame Overview e SQL por meio de uma função de IA. A cobrança ocorre somente para jobs bem-sucedidos; jobs com falha não geram custos.
Regras de faturamento
O service de inferência de modelo é faturado com base no uso de tokens. As dimensões de faturamento incluem:
Região
Tipo de modelo
Tipo de token: diferencia entre tokens de entrada e saída, indicando a faixa de preço baseada no uso.