A sincronização em lote transfere dados completos ou incrementais entre bancos de dados de origem e destino usando plugins Reader e Writer. Configure as fontes de dados e os parâmetros de agendamento para automatizar o processo. Este tópico descreve os recursos da sincronização em lote.
Principais recursos
A sincronização offline oferece os seguintes recursos:
Recurso | Descrição |
Sincronização de dados entre fontes heterogêneas | O Data Integration suporta mais de 50 tipos de fontes de dados, incluindo bancos de dados relacionais, armazenamento não estruturado, armazenamento de big data e filas de mensagens. Defina as fontes de dados de origem e destino e use os plugins Reader e Writer do Data Integration para transferir dados entre quaisquer fontes estruturadas ou semiestruturadas. Para obter mais informações, consulte Fontes de dados e soluções de sincronização suportadas. |
Sincronização de dados em ambientes de rede complexos | A sincronização em lote é compatível com ApsaraDB, data centers locais, bancos de dados autogerenciados no ECS e bancos de dados fora da Alibaba Cloud. Antes de configurar, garanta a conectividade de rede entre o grupo de recursos e os endpoints de origem e destino. Para mais detalhes sobre a configuração, consulte Soluções de conectividade de rede. |
Cenários de sincronização | 1. Modos de sincronização
Nota Para mais informações sobre parâmetros de agendamento, consulte Cenários típicos de parâmetros de agendamento no Data Integration e Parâmetros de agendamento. 2. Estruturas de origem suportadas
|
Métodos de configuração | Configure tarefas de sincronização em lote no Data Integration usando os seguintes métodos:
Nota Para obter mais informações sobre os recursos de configuração de tarefas, consulte Visão geral dos recursos. |
O&M para tarefas de sincronização em lote |
|
Visão geral dos recursos
Recurso | Descrição |
Sincronização de dados completa ou incremental | As tarefas de sincronização em lote suportam sincronização de dados completa ou incremental mediante a configuração de Data Filtering combinada com parâmetros de agendamento. Diferentes plugins possuem configurações distintas para sincronização incremental. Para obter mais informações sobre sincronização incremental de dados, consulte Configurar sincronização incremental de dados. |
Mapeamento de campos | Ao definir regras de mapeamento de campos, os dados de origem são gravados nos campos de destino correspondentes com base nas relações especificadas. Garanta que os tipos de campo em ambos os lados sejam compatíveis.
|
Limite de taxa da tarefa |
|
Execução distribuída de tarefas | Fontes de dados que suportam execução distribuída podem usar fragmentação de tarefas para distribuir a sincronização entre vários nós para execução simultânea. Isso permite que a velocidade de sincronização escale linearmente com o tamanho do cluster, superando gargalos de desempenho de nó único. Este modo é especialmente adequado para cenários de sincronização de alto throughput e baixa latência, utilizando eficientemente recursos ociosos do cluster para melhorar significativamente a utilização do hardware. |
Política de dados sujos | Dados sujos referem-se a registros de dados que falham ao serem gravados no destino devido a exceções como conflitos de tipo ou violações de restrições. A sincronização em lote suporta políticas de dados sujos que definem a quantidade aceitável de registros de dados sujos e seu impacto nas tarefas.
|
Fuso horário | Caso seja necessária sincronização entre fusos horários diferentes na origem e no destino, configure o fuso horário de origem para realizar a conversão. |
Processamento inteligente de dados | O DataWorks suporta a integração de recursos de processamento de dados durante a sincronização para transformar e processar dados de origem antes de gravá-los no destino: Substituição de strings: O recurso integrado de substituição de strings nas tarefas de sincronização em lote permite realizar transformações leves de dados diretamente durante a transferência, sem necessidade de armazenar dados intermediariamente ou etapas adicionais de ETL. Processamento assistido por IA: Suporta a integração de modelos de linguagem grande de IA durante a sincronização de dados para realizar análise semântica, análise de sentimento e outros processamentos em dados de linguagem natural da origem, gravando os resultados processados diretamente na tabela de destino. Vetorização de dados: Suporta a extração e vetorização (embedding) de dados de origem antes de gravá-los em um banco de dados vetorial. |
Próximos passos
Para instruções detalhadas sobre a criação de tarefas, consulte: