Todos os produtos
Search
Central de documentação

DataWorks:Nós do PAI Flow

Última atualização: Jul 09, 2026

O PAI Flow oferece recursos completos para desenvolver processos de machine learning de ponta a ponta. Ele fornece a mesma funcionalidade de fluxo de trabalho do Designer de modelagem visual no Platform for AI (PAI) e permite agendar fluxos de trabalho recorrentes.

Limites

  • Limites do produto:

    • O PAI Flow é compatível apenas com DataWorks Workspaces (new version).

    • Atualmente, o PAI Flow aceita somente os nós Source/Target e RAG Data Processing.

    • O PAI Flow funciona exclusivamente com grupos de recursos Serverless.

  • Limites de região: As regiões disponíveis incluem China (Hangzhou), China (Shanghai), China (Beijing), China (Ulanqab), China (Shenzhen), China (Hong Kong), Singapura, Indonésia (Jakarta), Japão (Tokyo), Alemanha (Frankfurt), EUA (Silicon Valley) e EUA (Virginia).

Pré-requisitos

Crie um workspace do DataWorks Data Studio (new version) e um workspace do Platform for AI (PAI).

  • Ao criar um workspace, selecione Create AI Workspace with Same Name. O sistema cria e vincula automaticamente um workspace do Platform for AI (PAI) com o mesmo nome do workspace do DataWorks.

  • Para workspaces existentes, ative Schedule PAI Nodes no Management Center. Essa ação também cria um workspace do Platform for AI (PAI) com o mesmo nome do workspace do DataWorks.

Criar um PAI Flow

  1. Faça login no console do DataWorks. Na região desejada, clique em Data Development and O&M > Data Development no painel de navegação à esquerda. Selecione um workspace na lista suspensa e clique em Go to Data Development.

  2. No diretório do projeto do Data Studio, clique no ícone image e escolha New Node > Algorithm > PAI Flow. O sistema cria um nó PAI Flow e direciona você para a página de orquestração.

Desenvolver um PAI Flow

O PAI Flow oferece diversos nós de modelagem visual. Use esses nós para projetar seu fluxo de trabalho.

  1. Na página de orquestração do PAI Flow, arraste os nós do painel esquerdo para a tela e conecte-os para desenhar o fluxo de trabalho.

  2. Após concluir o design do fluxo de trabalho, clique em um nó para configurá-lo no painel direito.

    Tipo de nó

    Descrição do nó

    Source/Target

    Ler tabela

    O componente Read Table lê dados de tabelas do MaxCompute. Por padrão, ele lê os dados da tabela do projeto atual.

    Ler dados do OSS

    Este componente lê arquivos ou pastas do caminho do OSS Bucket no Object Storage Service.

    Ler arquivo CSV

    Este componente lê arquivos CSV de OSS, HTTP e HDFS.

    Gravar tabela

    Este componente grava dados de entrada no MaxCompute.

    RAG data processing

    Análise e fragmentação de texto RAG

    Lê e analisa arquivos de texto (HTML, PDF, Markdown, Text, etc.) do diretório de entrada. Gera blocos de texto contínuos que não excedam o tamanho especificado e os salva no formato JSONline no caminho de saída definido.

    Geração de vetores RAG

    Carrega todos os documentos analisados e fragmentados (formato JSONline) do diretório especificado e usa um modelo de Embedding para gerar vetores de texto.

    Sincronização de índice da base de conhecimento RAG

    Sincroniza os dados de entrada com o índice da base de conhecimento de destino.

    Nota

    Ao configurar caminhos de arquivo, inclua variáveis no caminho, por exemplo: https://examplebucket.oss-cn-hangzhou.aliyuncs.com/${variable}/example.csv. Use parâmetros de agendamento como variáveis para ler ou gravar em diferentes caminhos de armazenamento durante o agendamento recorrente.

  3. Após concluir o desenvolvimento dos nós, configure as scheduling settings do PAI Flow na barra de ferramentas direita da página de orquestração. Isso garante o agendamento periódico do PAI Flow após a implantação no ambiente de produção.

    Nota

    Nas configurações de agendamento, o grupo de recursos de agendamento aceita apenas grupos de recursos Serverless.

Publicar um PAI Flow

Depois de depurar o PAI Flow e definir suas configurações de agendamento, publique o fluxo de trabalho do PAI Flow. Assim, o fluxo de trabalho será executado periodicamente conforme as definições estabelecidas.

  1. Clique em Save na barra de ferramentas superior para salvar o PAI Flow.

  2. Após salvar as alterações, clique no botão image na barra de ferramentas superior para abrir o painel de implantação (Implantar uma tarefa). Em seguida, clique em Start Release Production. A tarefa será implantada seguindo o processo de verificação de implantação.

Mais operações

Após publicar o PAI Flow, clique em Go to operation and maintenance no painel de publicação. Essa ação leva você à página de Tarefas recorrentes, onde é possível visualizar o status de agendamento e execução do PAI Flow.

Nota

No gráfico DAG, as tarefas internas ficam visíveis somente após a abertura do PAI Flow.