Este tópico descreve as principais capacidades e melhores práticas do framework MaxFrame para desenvolvimento em cenários reais. Fornece exemplos de código executáveis e instruções baseadas em cenários para ajudar você a compreender e dominar rapidamente os recursos essenciais do MaxFrame, reduzindo a barreira de entrada e aumentando a eficiência do desenvolvimento.
Recursos comuns e capacidades principais
|
Módulo de recurso |
Capacidade principal |
Cenário de aplicação típico |
Vantagens e recursos |
|
Operadores apply / apply_chunk |
Executa funções definidas pelo usuário (UDFs) em paralelo em DataFrames ou chunks de dados. |
Lógica de computação personalizada complexa que exige a criação de uma UDF. Processamento de dados em grande escala que requer o tratamento paralelo de múltiplas linhas de entrada. |
Permite chamadas nativas a funções Python, agendamento distribuído automático e processamento em lote concorrente, melhorando significativamente a eficiência. |
|
Uso de recursos GU |
Agenda CPUs e GPUs de forma híbrida para computação heterogênea. |
Inferência de deep learning e processamento de dados multimodais. |
O gerenciamento unificado de recursos heterogêneos (CUs e GUs) permite construir um fluxo completo de processamento em um único pipeline de job. |
|
AI Function em GU |
Oferece suporte a modelos de linguagem grandes (LLMs) integrados e personalizados. Permite chamar a API AI Function, que utiliza recursos GU para inferência de LLM. |
Cenários de inferência de modelos em lote, como extração de dados estruturados, tradução de texto, rotulagem de dados, classificação de imagens, reconhecimento de fala e vetorização. |
Inclui LLMs convencionais integrados, como Qwen3 e DeepSeek. Disponibiliza chamadas de API como |
|
Montagem e acesso ao OSS |
Permite montar diretamente o Object Storage Service (OSS) para leitura, gravação e operação sobre grandes volumes de dados. |
Carregamento de conjuntos de dados multimodais. |
Permite montar o OSS sem necessidade de download, oferece leitura em stream e é compatível com APIs de arquivo padrão. |
Casos de uso específicos
Melhores práticas para uso dos operadores apply e apply_chunk
Defina o parâmetro batch_rows com base no volume de dados e nos recursos disponíveis para evitar erros de falta de memória (OOM).
Descrição do recurso
O operador
applyaplica uma função personalizada às linhas ou colunas de um DataFrame do MaxFrame e aceita operações vetorizadas em linhas ou colunas inteiras.O
apply_chunké uma API de baixo nível fornecida pelo MaxFrame. Aplica uma função personalizada em paralelo a cada chunk de dados de um DataFrame do MaxFrame. Indicado para cenários avançados que exigem operações diretas nos shards físicos de um DataFrame distribuído, sendo frequentemente usado para otimização de desempenho ou lógica de computação personalizada.
Exemplos de casos de uso
Use
applypara padronizar campos, como mascarar números de telefone.Use
apply_chunkpara processar milhões de caminhos de imagens em paralelo e extrair metadados.
Tutoriais
Uso de recursos GU do MaxFrame
Descrição do recurso
Pipelines de jobs e processamento complexo de dados frequentemente demandam recursos de CPU ou GPU em diferentes nós de computação. O MaxFrame oferece agendamento híbrido e computação de recursos CU e GU. Em uma UDF do MaxFrame, solicite recursos de GU Quota usando tags de recurso para tarefas de computação de alto desempenho (HPC).
Exemplos de casos de uso
Extração e codificação de frames de imagem ou vídeo
Processamento complexo de dados
Tutoriais
Antes de usar recursos de computação de IA do maxcompute, adquira uma GU Quota do maxcompute. Para mais informações, consulte Purchase and use MaxCompute AI compute resources.
Melhores práticas para desenvolvimento com AI Function em GU
Selecione e adquira uma placa GPU com memória suficiente para o número de parâmetros do LLM utilizado.
Descrição do recurso
O MaxFrame AI Function é uma solução ponta a ponta na plataforma Alibaba Cloud maxcompute para cenários de inferência offline de LLM. Seus principais recursos incluem:
-
Integração perfeita entre processamento de dados e capacidades de IA
Permite interação direta com LLMs, como o Qwen3-4B, por meio de DataFrames do MaxFrame.
Oferece as APIs generate e task para equilibrar flexibilidade e facilidade de uso.
-
Agendamento de recursos GPU (GU)
Solicite recursos GPU usando
gu_quota_namepara acomodar modelos de diferentes tamanhos. Por exemplo, um modelo 4B requer 2 GUs.
-
Chamadas gerenciadas de LLM
Biblioteca de modelos integrada, como Qwen3-4B-Instruct-2507-FP8, com suporte para ajuste de parâmetros como temperature e max_tokens.
Oferece agendamento concorrente em larga escala para otimizar o desempenho da inferência em lote.
Exemplos de casos de uso
-
Perguntas e respostas de conhecimento
Descrição do cenário: Responde a perguntas em áreas como ciências naturais, história e tecnologia. Aceita vários idiomas e raciocínio complexo.
-
Aplicações típicas:
Computação científica:
"What is the average distance between the Earth and the Sun?"Eventos históricos:
"In what year did the American Revolutionary War begin?"Princípios técnicos:
"What is the core mechanism of the Transformer model?"
-
Tradução de texto
Descrição do cenário: Traduz texto entre idiomas. Oferece tradução chinês-inglês e lida com terminologia de áreas profissionais.
-
Aplicações típicas:
Chinês para inglês:
"How to relieve a headache?"→"How to relieve a headache?"Tradução de textos jurídicos/médicos:
"The patient needs to take one aspirin tablet daily."
-
Extração de dados estruturados
Descrição do cenário: Extrai entidades-chave, propriedades ou relacionamentos de texto não estruturado.
-
Aplicações típicas:
-
Extração de entidades:
Entrada:
"The iPhone 15 Pro is the latest flagship phone released by Apple."Saída:
{"product": "iPhone 15 Pro", "brand": "Apple", "type": "flagship phone"}
-
Análise de currículos:
Entrada:
"Zhang San, 5 years of Java development experience, skilled in the Spring Boot framework."Saída:
{"name": "Zhang San", "skills": ["Java", "Spring Boot"], "experience": 5}
-
Tutoriais
Melhores práticas para montagem e uso do OSS
Para melhorar o desempenho, combine este recurso com
apply_chunkpara implementar leitura paralela.Descrição do recurso
Em cenários de análise de dados, é comum precisar usar jobs do MaxFrame com armazenamento de objetos persistente, como o OSS. Por exemplo:
Carregar dados brutos do OSS para limpeza ou processamento.
Gravar resultados intermediários no OSS para consumo por tarefas downstream.
Compartilhar recursos estáticos, como arquivos de modelos treinados e arquivos de configuração.
Métodos tradicionais de leitura e gravação, como
pd.read_csv("oss://..."), são ineficientes em ambientes distribuídos devido aos limites de desempenho do sdk e à sobrecarga de rede. A montagem no nível do sistema de arquivos (FS Mount) permite acessar arquivos do OSS no maxcompute como se fossem arquivos de disco local, o que aumenta consideravelmente a eficiência do desenvolvimento.Exemplos de casos de uso
Monte o diretório do bucket OSS
oss://maxframe-datasets/images/no caminho local do maxcompute/data/imgspara processamento subsequente.
Tutoriais