Todos os produtos
Search
Central de documentação

DataWorks:Batch synchronization features

Última atualização: Aug 17, 2026

A sincronização em lote transfere dados completos ou incrementais entre bancos de dados de origem e destino usando plugins Reader e Writer. Configure as fontes de dados e os parâmetros de agendamento para automatizar o processo. Este tópico descreve as capacidades da sincronização em lote.

Capacidades principais

A sincronização offline oferece os seguintes recursos:

image

Capacidade

Descrição

Sincronização de dados entre fontes heterogêneas

O Data Integration suporta mais de 50 tipos de fontes de dados, incluindo bancos relacionais, armazenamento não estruturado, big data e filas de mensagens. Defina as fontes de origem e destino e use os plugins Reader e Writer do Data Integration para transferir dados entre quaisquer estruturas estruturadas ou semiestruturadas. Para mais informações, consulte Supported data sources and sync solutions.

Sincronização em ambientes de rede complexos

A sincronização em lote abrange ApsaraDB, data centers on-premises, bancos autogerenciados no ECS e bases externas à Alibaba Cloud. Antes de configurar, garanta a conectividade de rede entre o grupo de recursos e os endpoints de origem e destino. Para detalhes sobre a configuração, consulte Network connectivity solutions.

Cenários de sincronização

1. Modos de sincronização

  • Sincronização completa periódica: Sobrescreve periodicamente a tabela de destino com todos os dados de origem. Ideal para cenários de atualização total.

  • Sincronização incremental periódica: Transfere apenas dados novos ou alterados diariamente ou horariamente. Usa parâmetros de agendamento nativos, como ${bizdate}, combinados a uma condição filtro de dados WHERE para garantir que somente os registros especificados sejam extraídos e gravados na partição temporal correspondente. Para mais informações, consulte Configure scheduling parameters for incremental synchronization.

  • Backfill de dados históricos: Quando for necessário recarregar um grande volume de dados históricos de uma só vez, use o recurso Backfill Data no Operation Center para executar tarefas de sincronização em lote e arquivar dados históricos com eficiência.

Nota

Para mais detalhes sobre parâmetros de agendamento, consulte Typical scenarios of scheduling parameters in Data Integration e Scheduling parameters.

2. Estruturas de origem suportadas

  • Tabela única para tabela única: Modo mais básico de sincronização. Transfere dados de uma tabela de origem para uma tabela de destino.

  • Tabelas fragmentadas para tabela única:

    • Agrega automaticamente dados de múltiplas tabelas físicas (como tabelas de pedidos order_01, order_02...) e grava o resultado em uma única tabela de destino.

    • As fontes de dados compatíveis incluem MySQL, SQL Server, Oracle, PostgreSQL, PolarDB e AnalyticDB. Para mais informações, consulte Sync sharded tables to a single table.

Métodos de configuração

Configure tarefas de sincronização em lote no Data Integration usando os métodos abaixo.

  • Codeless UI: Configure tarefas passo a passo por uma interface visual guiada. Este modo é fácil de aprender e usar, mas não suporta alguns recursos avançados.

  • Code editor: Defina a lógica de sincronização diretamente via scripts JSON. Este modo permite configurações mais complexas e controle refinado.

  • OpenAPI: Gerencie todo o ciclo de vida das tarefas via OpenAPI, habilitando operações programáticas.

  • DI Agent: Para criar e gerenciar rapidamente tarefas de sincronização em lote de tabela única por meio de conversas com IA, use o Data Agent em vez da configuração manual de formulários. Descreva seus requisitos de sincronização em uma frase e o Agent identifica automaticamente as fontes de dados, mapeia campos, atribui grupos de recursos e configura políticas de agendamento, reduzindo o tempo de criação de uma única tarefa de 15–30 minutos para menos de 5 minutos.

Nota

Para mais informações sobre as capacidades de configuração de tarefas, consulte Feature overview.

O&M para tarefas de sincronização em lote

  • Alerting: Monitora o status de execução das tarefas de sincronização em lote, cobrindo cenários como tarefas incompletas, com falha e concluídas. Suporta diversos métodos de alerta, incluindo e-mail, SMS, chamadas telefônicas, bots de grupo do DingTalk e webhooks para notificar os destinatários.

  • Data Quality Overview: Após submeter e implantar uma tarefa, configure regras de monitoramento de qualidade de dados para a tabela de destino no Operation Center. Atualmente, apenas alguns tipos de banco de dados suportam regras de monitoramento de qualidade de dados.

  • Data source environment isolation: Um único nome de fonte de dados está vinculado a duas configurações independentes para os ambientes de desenvolvimento e produção. Durante a execução da tarefa, a fonte de dados é alternada automaticamente conforme o ambiente — a depuração usa o ambiente de desenvolvimento e o agendamento de produção usa o ambiente de produção, evitando o risco de operações de teste afetarem acidentalmente os dados de produção.

Visão geral dos recursos

image

Recurso

Descrição

Sincronização completa ou incremental

Tarefas de sincronização em lote suportam transferência completa ou incremental mediante a configuração de Data Filtering combinada com parâmetros de agendamento. Cada plugin possui configurações específicas para sincronização incremental. Para mais detalhes sobre sincronização incremental, consulte Configure incremental data synchronization.

Mapeamento de campos

Ao definir regras de mapeamento, os dados de origem são gravados nos campos de destino correspondentes conforme as relações especificadas. Garanta a compatibilidade dos tipos de campo em ambos os lados.

  • Diversos métodos de mapeamento estão disponíveis:

    • O modo assistente suporta mapeamento por nome, por linha e relações personalizadas. Campos não mapeados são ignorados automaticamente. Assegure que os campos de destino correspondentes tenham valores padrão configurados ou aceitem valores nulos para evitar falhas de gravação.

    • O modo script realiza mapeamento estrito baseado na ordem da configuração de colunas. A quantidade de campos no leitor deve corresponder exatamente à do gravador; caso contrário, a tarefa falhará durante a execução.

  • As tarefas também permitem atribuição dinâmica de valores aos campos de destino, incluindo constantes, parâmetros de agendamento e variáveis nativas como ${bizdate}. Os parâmetros recebem seus valores finais durante a fase de agendamento.

Limitação de taxa da tarefa

  • O recurso de controle de concorrência da tarefa limita o número máximo de threads simultâneas para leitura e gravação nos bancos de dados.

  • O recurso de velocidade de sincronização controla o tráfego para evitar pressão excessiva na origem ou no destino causada por altas velocidades de transferência. Se o throttling não estiver ativado, o sistema usará o desempenho máximo de transferência disponível no ambiente de hardware atual.

Execução distribuída de tarefas

Fontes de dados compatíveis com execução distribuída podem usar fragmentação de tarefas para distribuir a sincronização entre vários nós para execução concorrente. Isso permite que a velocidade de sincronização escale linearmente com o tamanho do cluster, superando gargalos de desempenho de nó único. Este modo é especialmente adequado para cenários de alto throughput e baixa latência, aproveitando recursos ociosos do cluster para melhorar significativamente a utilização do hardware.

Política de dados sujos

Dados sujos referem-se a registros que falham ao serem gravados no destino devido a exceções como conflitos de tipo ou violações de restrições. A sincronização em lote suporta políticas que definem a quantidade aceitável de registros inválidos e seu impacto nas tarefas.

  • Ignorar dados sujos: Registros inválidos são filtrados automaticamente. Apenas dados válidos são gravados e a tarefa continua em execução.

  • Tolerância limitada: Defina um limiar N. Se a quantidade de dados sujos for ≤ N, os registros anômalos são descartados e a tarefa prossegue. Se exceder N, a tarefa falha e encerra.

  • Sem tolerância: A tarefa falha e encerra imediatamente ao encontrar qualquer dado sujo.

Fuso horário

Caso seja necessária sincronização entre fusos horários diferentes na origem e no destino, configure o fuso horário de origem para realizar a conversão adequada.

Processamento inteligente de dados

O DataWorks permite integrar capacidades de processamento durante a sincronização para transformar e tratar os dados de origem antes da gravação no destino:

Substituição de strings: O recurso nativo de substituição de strings nas tarefas de sincronização em lote permite realizar transformações leves diretamente durante a transferência, sem necessidade de armazenar dados intermediários ou etapas adicionais de ETL.

Processamento assistido por IA: Suporta a integração de modelos de linguagem de IA durante a sincronização para executar análise semântica, análise de sentimento e outros processamentos em dados de linguagem natural da origem, gravando os resultados processados diretamente na tabela de destino.

Vetorização de dados: Permite extrair e vetorizar (embedding) os dados de origem antes de gravá-los em um banco de dados vetorial.

Próximos passos

Para instruções detalhadas sobre a criação de tarefas, consulte: