O recurso de processamento de dados nas tarefas de sincronização em lote do DataWorks limpa, processa com IA e vetoriza dados diretamente no pipeline de sincronização, simplificando sua arquitetura ETL.
Limitações
Disponível apenas em workspaces com a nova versão do Data Studio ativada.
Compatível somente com grupos de recursos serverless.
Habilitado atualmente apenas para alguns canais de sincronização em lote de tabela única.
A ativação do processamento de dados consome recursos computacionais adicionais (CUs). Monitore sua cota de recursos.
Acesso à configuração
Na página de configuração da tarefa de sincronização em lote, role até a seção de processamento de dados.
Esse recurso vem desativado por padrão. Ative a chave para ative o módulo de processamento de dados.

Recursos
Após ativar o processamento de dados, adicione uma ou mais das seguintes regras.
1. Substituição de string
Defina regras de substituição para diferentes colunas a fim de padronizar ou limpar valores.
Configuração no modo assistente
Na Data Processing List, clique em +Add Node e selecione Replace String para adicionar uma regra de substituição. A tabela a seguir descreve os parâmetros.
|
Parâmetro |
Descrição |
|
Name |
Nome personalizado para a regra de substituição. |
|
Description |
(Opcional) Descrição da finalidade da regra. |
|
Column Name |
Clique em +Add Rule para adicionar uma regra de coluna. Selecione uma coluna na lista suspensa de colunas da tabela de source para aplicar esta regra. |
|
String to Replace |
Insira a string original a ser localizada e substituída. |
|
Replace With |
Nova string a ser usada como substituta. |
|
|
Habilita expressões regulares para o padrão da string a ser substituída. |
|
|
Controla se a substituição diferencia maiúsculas de minúsculas. Por padrão, a busca não faz essa distinção. |
Adicione várias regras para diferentes colunas. Por exemplo, crie uma regra para substituir 'Male' por '1' na coluna gender e outra para substituir 'active' por 'valid' na coluna status.
Visualização dos dados de saída
Após configure as regras, clique em Output Data Preview no canto superior direito da seção de processamento de dados.
-
Na caixa de diálogo exibida, configure os Input Data. Há dois métodos compatíveis:
Auto-fetch: O sistema busca automaticamente os dados da saída do nó upstream. Clique em Re-fetch Upstream Output para atualizar os dados.
Manual construction: Clique em +Manually Construct Data para insira valores personalizados para cada coluna nas linhas de dados ou testar condições de limite específicas (como
NULLou strings vazias).
Clique em Preview na seção Preview Results.
O sistema executa todas as regras de processamento configuradas e exibe os resultados. Compare-os com suas expectativas para verifique as regras.
Os resultados da visualização servem apenas para depuração e referência. Os resultados finais dependem da execução real da tarefa.
Configuração no modo script
Para ativar o processamento de dados no modo script, adicione um JSONObject com "category": "map", "stepType": "stringreplace" ao módulo steps no script json. Para obter o processo geral de configuração do modo script, consulte Configuração do modo script.
{ "category": "map", "stepType": "stringreplace", "parameter": { "condition": [ { "name": "<Column name to process>", "replaceString": "<String to replace>", "replaceByString": "<New replacement string>", "useRegex": false, "caseSensitive": false } ] }, "displayName": "<Rule name>", "description": "<Rule description>" }
2. Processamento assistido por IA
Use um modelo de linguagem grande (LLM) integrado para processar e enriquecer o conteúdo das colunas.
Principais casos de uso:
Resumo de conteúdo: Extraia resumos essenciais de grandes blocos de texto, como avaliações de product ou artigos de notícias.
Extração de informações: Identifique dados-chave em textos não estruturados, incluindo nomes, endereços e detalhes de contato.
Tradução de texto: Traduza o conteúdo da coluna para um idioma especificado.
Análise de sentimento: Determine o sentimento do texto (como positivo, negativo ou neutro).
Configuração e uso: Ao clique em Add Node, selecione o processamento assistido por IA. Para instruções detalhadas de configuração e casos de uso típicos, consulte Processamento assistido por IA.
3. Vetorização de dados
Converta texto ou outros dados em vetores de alta dimensão usando um modelo de embedding. Esses vetores capturam informações semânticas para aplicações de IA, como Geração Aumentada por Recuperação (RAG), busca semântica e sistemas de recomendação.
Principais casos de uso:
Construção de bases de conhecimento: Vetorize dados textuais, como documentos, chamados e manuais de product, e armazene-os em um banco de dados vetorial para servir como base de conhecimento externa para LLMs.
Recomendações personalizadas: Calcule a similaridade com base nas representações vetoriais de usuários e itens para permitir recomendações precisas.
Configuração e uso: Ao clique em Add Node, selecione Data Vectorization e escolha as colunas a serem processadas e o modelo de embedding a ser utilizado. Para instruções detalhadas de configuração e exemplos práticos, consulte Vetorização.