A sincronização em lote transfere dados completos ou incrementais entre bancos de dados de origem e destino usando plugins Reader e Writer. Configure as fontes de dados e os parâmetros de agendamento para automatizar o processo. Este tópico descreve as capacidades da sincronização em lote.
Capacidades principais
A sincronização offline oferece os seguintes recursos:
Capacidade | Descrição |
Sincronização de dados entre fontes heterogêneas | O Data Integration suporta mais de 50 tipos de fontes de dados, incluindo bancos relacionais, armazenamento não estruturado, big data e filas de mensagens. Defina as fontes de origem e destino e use os plugins Reader e Writer do Data Integration para transferir dados entre quaisquer estruturas estruturadas ou semiestruturadas. Para mais informações, consulte Supported data sources and sync solutions. |
Sincronização em ambientes de rede complexos | A sincronização em lote abrange ApsaraDB, data centers on-premises, bancos autogerenciados no ECS e bases externas à Alibaba Cloud. Antes de configurar, garanta a conectividade de rede entre o grupo de recursos e os endpoints de origem e destino. Para detalhes sobre a configuração, consulte Network connectivity solutions. |
Cenários de sincronização | 1. Modos de sincronização
Nota Para mais detalhes sobre parâmetros de agendamento, consulte Typical scenarios of scheduling parameters in Data Integration e Scheduling parameters. 2. Estruturas de origem suportadas
|
Métodos de configuração | Configure tarefas de sincronização em lote no Data Integration usando os métodos abaixo.
Nota Para mais informações sobre as capacidades de configuração de tarefas, consulte Feature overview. |
O&M para tarefas de sincronização em lote |
|
Visão geral dos recursos
Recurso | Descrição |
Sincronização completa ou incremental | Tarefas de sincronização em lote suportam transferência completa ou incremental mediante a configuração de Data Filtering combinada com parâmetros de agendamento. Cada plugin possui configurações específicas para sincronização incremental. Para mais detalhes sobre sincronização incremental, consulte Configure incremental data synchronization. |
Mapeamento de campos | Ao definir regras de mapeamento, os dados de origem são gravados nos campos de destino correspondentes conforme as relações especificadas. Garanta a compatibilidade dos tipos de campo em ambos os lados.
|
Limitação de taxa da tarefa |
|
Execução distribuída de tarefas | Fontes de dados compatíveis com execução distribuída podem usar fragmentação de tarefas para distribuir a sincronização entre vários nós para execução concorrente. Isso permite que a velocidade de sincronização escale linearmente com o tamanho do cluster, superando gargalos de desempenho de nó único. Este modo é especialmente adequado para cenários de alto throughput e baixa latência, aproveitando recursos ociosos do cluster para melhorar significativamente a utilização do hardware. |
Política de dados sujos | Dados sujos referem-se a registros que falham ao serem gravados no destino devido a exceções como conflitos de tipo ou violações de restrições. A sincronização em lote suporta políticas que definem a quantidade aceitável de registros inválidos e seu impacto nas tarefas.
|
Fuso horário | Caso seja necessária sincronização entre fusos horários diferentes na origem e no destino, configure o fuso horário de origem para realizar a conversão adequada. |
Processamento inteligente de dados | O DataWorks permite integrar capacidades de processamento durante a sincronização para transformar e tratar os dados de origem antes da gravação no destino: Substituição de strings: O recurso nativo de substituição de strings nas tarefas de sincronização em lote permite realizar transformações leves diretamente durante a transferência, sem necessidade de armazenar dados intermediários ou etapas adicionais de ETL. Processamento assistido por IA: Suporta a integração de modelos de linguagem de IA durante a sincronização para executar análise semântica, análise de sentimento e outros processamentos em dados de linguagem natural da origem, gravando os resultados processados diretamente na tabela de destino. Vetorização de dados: Permite extrair e vetorizar (embedding) os dados de origem antes de gravá-los em um banco de dados vetorial. |
Próximos passos
Para instruções detalhadas sobre a criação de tarefas, consulte: