Todos os produtos
Search
Central de documentação

DataWorks:Recursos de sincronização em lote

Última atualização: Jul 16, 2026

A sincronização em lote transfere dados completos ou incrementais entre bancos de dados de origem e destino usando plugins Reader e Writer. Configure as fontes de dados e os parâmetros de agendamento para automatizar o processo. Este tópico descreve os recursos da sincronização em lote.

Principais recursos

A sincronização offline oferece os seguintes recursos:

image

Recurso

Descrição

Sincronização de dados entre fontes heterogêneas

O Data Integration suporta mais de 50 tipos de fontes de dados, incluindo bancos de dados relacionais, armazenamento não estruturado, armazenamento de big data e filas de mensagens. Defina as fontes de dados de origem e destino e use os plugins Reader e Writer do Data Integration para transferir dados entre quaisquer fontes estruturadas ou semiestruturadas. Para obter mais informações, consulte Fontes de dados e soluções de sincronização suportadas.

Sincronização de dados em ambientes de rede complexos

A sincronização em lote é compatível com ApsaraDB, data centers locais, bancos de dados autogerenciados no ECS e bancos de dados fora da Alibaba Cloud. Antes de configurar, garanta a conectividade de rede entre o grupo de recursos e os endpoints de origem e destino. Para mais detalhes sobre a configuração, consulte Soluções de conectividade de rede.

Cenários de sincronização

1. Modos de sincronização

  • Sincronização completa periódica: Sobrescreve periodicamente a tabela de destino com todos os dados da origem. Ideal para cenários de atualização completa.

  • Sincronização incremental periódica: Sincroniza apenas dados novos ou alterados diariamente ou horariamente. Usa parâmetros de agendamento integrados, como ${bizdate}, combinados com uma condição WHERE de filtro de dados para garantir que apenas os dados especificados sejam extraídos e gravados na partição de tempo correspondente. Para obter mais informações, consulte Configurar parâmetros de agendamento para sincronização incremental.

  • Backfill de dados históricos: Quando for necessário recarregar um grande volume de dados históricos de uma só vez, use o recurso Backfill Data no Operation Center para executar tarefas de sincronização em lote e arquivar dados históricos com eficiência.

Nota

Para mais informações sobre parâmetros de agendamento, consulte Cenários típicos de parâmetros de agendamento no Data Integration e Parâmetros de agendamento.

2. Estruturas de origem suportadas

  • Tabela única para tabela única: Modo de sincronização mais básico. Transfere dados de uma tabela de origem para uma tabela de destino.

  • Tabelas fragmentadas para tabela única:

    • Agrega automaticamente dados de várias tabelas físicas (como tabelas de pedidos order_01, order_02...) e grava os dados em uma única tabela de destino.

    • As fontes de dados suportadas incluem MySQL, SQL Server, Oracle, PostgreSQL, PolarDB e AnalyticDB. Para obter mais informações, consulte Sincronizar tabelas fragmentadas para uma tabela única.

Métodos de configuração

Configure tarefas de sincronização em lote no Data Integration usando os seguintes métodos:

  • Interface visual sem código: Configure tarefas passo a passo por meio de uma interface guiada visual. Este modo é fácil de aprender e usar, mas não suporta alguns recursos avançados.

  • Editor de código: Defina a lógica de sincronização diretamente usando scripts JSON. Este modo suporta configurações mais complexas e permite controle refinado.

  • OpenAPI: Gerencie todo o ciclo de vida das tarefas via OpenAPI, permitindo operações programáticas.

  • DI Agent: Para criar e gerenciar rapidamente tarefas de sincronização em lote de tabela única por meio de conversas impulsionadas por IA, use o Data Agent em vez da configuração manual de formulários. Descreva seus requisitos de sincronização em uma frase, e o Agent identificará automaticamente as fontes de dados, mapeará campos, atribuirá grupos de recursos e configurará políticas de agendamento, reduzindo o tempo de criação de uma única tarefa de 15–30 minutos para menos de 5 minutos.

Nota

Para obter mais informações sobre os recursos de configuração de tarefas, consulte Visão geral dos recursos.

O&M para tarefas de sincronização em lote

  • Alertas: Monitora o status de execução das tarefas de sincronização em lote, cobrindo cenários como tarefas incompletas, com falha e concluídas. Suporta múltiplos métodos de alerta, incluindo e-mail, SMS, chamadas telefônicas, bots de grupo do DingTalk e webhooks para notificar os destinatários.

  • Qualidade de dados: Após confirmar e implantar uma tarefa, configure regras de monitoramento de qualidade de dados para a tabela de destino no Operation Center. Atualmente, apenas alguns tipos de banco de dados suportam regras de monitoramento de qualidade de dados.

  • Isolamento de ambiente de fonte de dados: Um único nome de fonte de dados está vinculado a duas configurações independentes para os ambientes de desenvolvimento e produção. Durante a execução da tarefa, a fonte de dados é alternada automaticamente com base no ambiente — a depuração em desenvolvimento usa o ambiente de desenvolvimento, e o agendamento em produção usa o ambiente de produção, evitando o risco de operações de teste afetarem acidentalmente os dados de produção.

Visão geral dos recursos

image

Recurso

Descrição

Sincronização de dados completa ou incremental

As tarefas de sincronização em lote suportam sincronização de dados completa ou incremental mediante a configuração de Data Filtering combinada com parâmetros de agendamento. Diferentes plugins possuem configurações distintas para sincronização incremental. Para obter mais informações sobre sincronização incremental de dados, consulte Configurar sincronização incremental de dados.

Mapeamento de campos

Ao definir regras de mapeamento de campos, os dados de origem são gravados nos campos de destino correspondentes com base nas relações especificadas. Garanta que os tipos de campo em ambos os lados sejam compatíveis.

  • Estão disponíveis vários métodos de mapeamento de campos:

    • O Modo assistente suporta mapeamento por mesmo nome, mapeamento por mesma linha e relações de campos personalizadas. Dados em campos não mapeados são ignorados automaticamente. Certifique-se de que os campos de destino correspondentes tenham valores padrão configurados ou permitam valores nulos para evitar falhas de gravação.

    • O Modo script mapeia campos estritamente com base na ordem de configuração das colunas. O número de campos no lado do reader deve corresponder exatamente ao número no lado do writer. Caso contrário, a tarefa falhará durante a execução.

  • As tarefas de sincronização também suportam atribuição dinâmica de valores para campos de destino, incluindo constantes, parâmetros de agendamento e variáveis integradas como ${bizdate}. Os parâmetros relevantes recebem seus valores finais durante a fase de agendamento.

Limite de taxa da tarefa

  • O recurso de controle de concorrência de tarefas limita o número máximo de threads simultâneas para leitura e gravação em bancos de dados.

  • O recurso de velocidade de sincronização controla o tráfego para evitar pressão excessiva na origem ou no destino causada por altas velocidades de sincronização. Se o limitador não estiver ativado, será fornecido o desempenho máximo de transferência disponível no ambiente de hardware atual.

Execução distribuída de tarefas

Fontes de dados que suportam execução distribuída podem usar fragmentação de tarefas para distribuir a sincronização entre vários nós para execução simultânea. Isso permite que a velocidade de sincronização escale linearmente com o tamanho do cluster, superando gargalos de desempenho de nó único. Este modo é especialmente adequado para cenários de sincronização de alto throughput e baixa latência, utilizando eficientemente recursos ociosos do cluster para melhorar significativamente a utilização do hardware.

Política de dados sujos

Dados sujos referem-se a registros de dados que falham ao serem gravados no destino devido a exceções como conflitos de tipo ou violações de restrições. A sincronização em lote suporta políticas de dados sujos que definem a quantidade aceitável de registros de dados sujos e seu impacto nas tarefas.

  • Ignorar dados sujos: Dados sujos são filtrados automaticamente. Apenas dados válidos são gravados e a tarefa continua em execução.

  • Tolerar quantidade limitada de dados sujos: Defina um limiar N. Se o número de registros de dados sujos for ≤ N, os dados anômalos são descartados e a tarefa continua. Se o número exceder N, a tarefa falha e encerra.

  • Sem tolerância para dados sujos: A tarefa falha e encerra imediatamente ao encontrar dados sujos.

Fuso horário

Caso seja necessária sincronização entre fusos horários diferentes na origem e no destino, configure o fuso horário de origem para realizar a conversão.

Processamento inteligente de dados

O DataWorks suporta a integração de recursos de processamento de dados durante a sincronização para transformar e processar dados de origem antes de gravá-los no destino:

Substituição de strings: O recurso integrado de substituição de strings nas tarefas de sincronização em lote permite realizar transformações leves de dados diretamente durante a transferência, sem necessidade de armazenar dados intermediariamente ou etapas adicionais de ETL.

Processamento assistido por IA: Suporta a integração de modelos de linguagem grande de IA durante a sincronização de dados para realizar análise semântica, análise de sentimento e outros processamentos em dados de linguagem natural da origem, gravando os resultados processados diretamente na tabela de destino.

Vetorização de dados: Suporta a extração e vetorização (embedding) de dados de origem antes de gravá-los em um banco de dados vetorial.

Próximos passos

Para instruções detalhadas sobre a criação de tarefas, consulte: