Todos os produtos
Search
Central de documentação

MaxCompute:Best practices

Última atualização: Aug 21, 2026

Este tópico descreve as principais capacidades e melhores práticas do framework MaxFrame para desenvolvimento em cenários reais. Fornece exemplos de código executáveis e instruções baseadas em cenários para ajudar você a compreender e dominar rapidamente os recursos essenciais do MaxFrame, reduzindo a barreira de entrada e aumentando a eficiência do desenvolvimento.

Recursos comuns e capacidades principais

Módulo de recurso

Capacidade principal

Cenário de aplicação típico

Vantagens e recursos

Operadores apply / apply_chunk

Executa funções definidas pelo usuário (UDFs) em paralelo em DataFrames ou chunks de dados.

Lógica de computação personalizada complexa que exige a criação de uma UDF. Processamento de dados em grande escala que requer o tratamento paralelo de múltiplas linhas de entrada.

Permite chamadas nativas a funções Python, agendamento distribuído automático e processamento em lote concorrente, melhorando significativamente a eficiência.

Uso de recursos GU

Agenda CPUs e GPUs de forma híbrida para computação heterogênea.

Inferência de deep learning e processamento de dados multimodais.

O gerenciamento unificado de recursos heterogêneos (CUs e GUs) permite construir um fluxo completo de processamento em um único pipeline de job.

AI Function em GU

Oferece suporte a modelos de linguagem grandes (LLMs) integrados e personalizados. Permite chamar a API AI Function, que utiliza recursos GU para inferência de LLM.

Cenários de inferência de modelos em lote, como extração de dados estruturados, tradução de texto, rotulagem de dados, classificação de imagens, reconhecimento de fala e vetorização.

Inclui LLMs convencionais integrados, como Qwen3 e DeepSeek. Disponibiliza chamadas de API como generate e task. Carrega modelos automaticamente nas GUs para execução com baixa latência e alta concorrência.

Montagem e acesso ao OSS

Permite montar diretamente o Object Storage Service (OSS) para leitura, gravação e operação sobre grandes volumes de dados.

Carregamento de conjuntos de dados multimodais.

Permite montar o OSS sem necessidade de download, oferece leitura em stream e é compatível com APIs de arquivo padrão.

Casos de uso específicos

Melhores práticas para uso dos operadores apply e apply_chunk

Defina o parâmetro batch_rows com base no volume de dados e nos recursos disponíveis para evitar erros de falta de memória (OOM).

Descrição do recurso

  • O operador apply aplica uma função personalizada às linhas ou colunas de um DataFrame do MaxFrame e aceita operações vetorizadas em linhas ou colunas inteiras.

  • O apply_chunk é uma API de baixo nível fornecida pelo MaxFrame. Aplica uma função personalizada em paralelo a cada chunk de dados de um DataFrame do MaxFrame. Indicado para cenários avançados que exigem operações diretas nos shards físicos de um DataFrame distribuído, sendo frequentemente usado para otimização de desempenho ou lógica de computação personalizada.

Exemplos de casos de uso

  • Use apply para padronizar campos, como mascarar números de telefone.

  • Use apply_chunk para processar milhões de caminhos de imagens em paralelo e extrair metadados.

Tutoriais

Best practices for using the MaxFrame apply_chunk operator

Uso de recursos GU do MaxFrame

Descrição do recurso

Pipelines de jobs e processamento complexo de dados frequentemente demandam recursos de CPU ou GPU em diferentes nós de computação. O MaxFrame oferece agendamento híbrido e computação de recursos CU e GU. Em uma UDF do MaxFrame, solicite recursos de GU Quota usando tags de recurso para tarefas de computação de alto desempenho (HPC).

Exemplos de casos de uso

  • Extração e codificação de frames de imagem ou vídeo

  • Processamento complexo de dados

Tutoriais

Melhores práticas para desenvolvimento com AI Function em GU

Selecione e adquira uma placa GPU com memória suficiente para o número de parâmetros do LLM utilizado.

Descrição do recurso

O MaxFrame AI Function é uma solução ponta a ponta na plataforma Alibaba Cloud maxcompute para cenários de inferência offline de LLM. Seus principais recursos incluem:

  • Integração perfeita entre processamento de dados e capacidades de IA

    • Permite interação direta com LLMs, como o Qwen3-4B, por meio de DataFrames do MaxFrame.

    • Oferece as APIs generate e task para equilibrar flexibilidade e facilidade de uso.

  • Agendamento de recursos GPU (GU)

    • Solicite recursos GPU usando gu_quota_name para acomodar modelos de diferentes tamanhos. Por exemplo, um modelo 4B requer 2 GUs.

  • Chamadas gerenciadas de LLM

    • Biblioteca de modelos integrada, como Qwen3-4B-Instruct-2507-FP8, com suporte para ajuste de parâmetros como temperature e max_tokens.

    • Oferece agendamento concorrente em larga escala para otimizar o desempenho da inferência em lote.

Exemplos de casos de uso

  • Perguntas e respostas de conhecimento

    • Descrição do cenário: Responde a perguntas em áreas como ciências naturais, história e tecnologia. Aceita vários idiomas e raciocínio complexo.

    • Aplicações típicas:

      • Computação científica: "What is the average distance between the Earth and the Sun?"

      • Eventos históricos: "In what year did the American Revolutionary War begin?"

      • Princípios técnicos: "What is the core mechanism of the Transformer model?"

  • Tradução de texto

    • Descrição do cenário: Traduz texto entre idiomas. Oferece tradução chinês-inglês e lida com terminologia de áreas profissionais.

    • Aplicações típicas:

      • Chinês para inglês: "How to relieve a headache?""How to relieve a headache?"

      • Tradução de textos jurídicos/médicos: "The patient needs to take one aspirin tablet daily."

  • Extração de dados estruturados

    • Descrição do cenário: Extrai entidades-chave, propriedades ou relacionamentos de texto não estruturado.

    • Aplicações típicas:

      • Extração de entidades:

        • Entrada: "The iPhone 15 Pro is the latest flagship phone released by Apple."

        • Saída: {"product": "iPhone 15 Pro", "brand": "Apple", "type": "flagship phone"}

      • Análise de currículos:

        • Entrada: "Zhang San, 5 years of Java development experience, skilled in the Spring Boot framework."

        • Saída: {"name": "Zhang San", "skills": ["Java", "Spring Boot"], "experience": 5}

    Tutoriais

    Melhores práticas para montagem e uso do OSS

    Para melhorar o desempenho, combine este recurso com apply_chunk para implementar leitura paralela.

    Descrição do recurso

    Em cenários de análise de dados, é comum precisar usar jobs do MaxFrame com armazenamento de objetos persistente, como o OSS. Por exemplo:

    • Carregar dados brutos do OSS para limpeza ou processamento.

    • Gravar resultados intermediários no OSS para consumo por tarefas downstream.

    • Compartilhar recursos estáticos, como arquivos de modelos treinados e arquivos de configuração.

    Métodos tradicionais de leitura e gravação, como pd.read_csv("oss://..."), são ineficientes em ambientes distribuídos devido aos limites de desempenho do sdk e à sobrecarga de rede. A montagem no nível do sistema de arquivos (FS Mount) permite acessar arquivos do OSS no maxcompute como se fossem arquivos de disco local, o que aumenta consideravelmente a eficiência do desenvolvimento.

    Exemplos de casos de uso

    • Monte o diretório do bucket OSS oss://maxframe-datasets/images/ no caminho local do maxcompute /data/imgs para processamento subsequente.

    Tutoriais