O PAI Flow oferece recursos completos para desenvolver processos de machine learning de ponta a ponta. Ele fornece a mesma funcionalidade de fluxo de trabalho do Designer de modelagem visual no Platform for AI (PAI) e permite agendar fluxos de trabalho recorrentes.
Limites
-
Limites do produto:
O PAI Flow é compatível apenas com DataWorks Workspaces (new version).
Atualmente, o PAI Flow aceita somente os nós Source/Target e RAG Data Processing.
O PAI Flow funciona exclusivamente com grupos de recursos Serverless.
Limites de região: As regiões disponíveis incluem China (Hangzhou), China (Shanghai), China (Beijing), China (Ulanqab), China (Shenzhen), China (Hong Kong), Singapura, Indonésia (Jakarta), Japão (Tokyo), Alemanha (Frankfurt), EUA (Silicon Valley) e EUA (Virginia).
Pré-requisitos
Crie um workspace do DataWorks Data Studio (new version) e um workspace do Platform for AI (PAI).
Ao criar um workspace, selecione Create AI Workspace with Same Name. O sistema cria e vincula automaticamente um workspace do Platform for AI (PAI) com o mesmo nome do workspace do DataWorks.
Para workspaces existentes, ative Schedule PAI Nodes no Management Center. Essa ação também cria um workspace do Platform for AI (PAI) com o mesmo nome do workspace do DataWorks.
Criar um PAI Flow
-
Faça login no console do DataWorks. Na região desejada, clique em no painel de navegação à esquerda. Selecione um workspace na lista suspensa e clique em Go to Data Development.
No diretório do projeto do Data Studio, clique no ícone
e escolha . O sistema cria um nó PAI Flow e direciona você para a página de orquestração.
Desenvolver um PAI Flow
O PAI Flow oferece diversos nós de modelagem visual. Use esses nós para projetar seu fluxo de trabalho.
Na página de orquestração do PAI Flow, arraste os nós do painel esquerdo para a tela e conecte-os para desenhar o fluxo de trabalho.
-
Após concluir o design do fluxo de trabalho, clique em um nó para configurá-lo no painel direito.
Tipo de nó
Nó
Descrição do nó
Source/Target
O componente Read Table lê dados de tabelas do MaxCompute. Por padrão, ele lê os dados da tabela do projeto atual.
Este componente lê arquivos ou pastas do caminho do
OSS Bucketno Object Storage Service.Este componente lê arquivos
CSVdeOSS,HTTPeHDFS.Este componente grava dados de entrada no
MaxCompute.RAG data processing
Análise e fragmentação de texto RAG
Lê e analisa arquivos de texto (
HTML,PDF,Markdown,Text, etc.) do diretório de entrada. Gera blocos de texto contínuos que não excedam o tamanho especificado e os salva no formatoJSONlineno caminho de saída definido.Geração de vetores RAG
Carrega todos os documentos analisados e fragmentados (formato
JSONline) do diretório especificado e usa um modelo deEmbeddingpara gerar vetores de texto.Sincronização de índice da base de conhecimento RAG
Sincroniza os dados de entrada com o índice da base de conhecimento de destino.
NotaAo configurar caminhos de arquivo, inclua variáveis no caminho, por exemplo:
https://examplebucket.oss-cn-hangzhou.aliyuncs.com/${variable}/example.csv. Use parâmetros de agendamento como variáveis para ler ou gravar em diferentes caminhos de armazenamento durante o agendamento recorrente. -
Após concluir o desenvolvimento dos nós, configure as scheduling settings do PAI Flow na barra de ferramentas direita da página de orquestração. Isso garante o agendamento periódico do PAI Flow após a implantação no ambiente de produção.
NotaNas configurações de agendamento, o grupo de recursos de agendamento aceita apenas grupos de recursos Serverless.
Publicar um PAI Flow
Depois de depurar o PAI Flow e definir suas configurações de agendamento, publique o fluxo de trabalho do PAI Flow. Assim, o fluxo de trabalho será executado periodicamente conforme as definições estabelecidas.
Clique em Save na barra de ferramentas superior para salvar o PAI Flow.
Após salvar as alterações, clique no botão
na barra de ferramentas superior para abrir o painel de implantação (Implantar uma tarefa). Em seguida, clique em Start Release Production. A tarefa será implantada seguindo o processo de verificação de implantação.
Mais operações
Após publicar o PAI Flow, clique em Go to operation and maintenance no painel de publicação. Essa ação leva você à página de Tarefas recorrentes, onde é possível visualizar o status de agendamento e execução do PAI Flow.
No gráfico DAG, as tarefas internas ficam visíveis somente após a abertura do PAI Flow.