O DataWorks Data Integration oferece uma solução robusta de sincronização de banco de dados em tempo real que replica todas as tabelas ou um subconjunto selecionado de um banco de dados source para um armazenamento de dados de destino, com baixa latência e de forma automatizada, integrando cargas completas e incrementais. Baseada em um mecanismo de computação em tempo real, essa funcionalidade executa automaticamente a carga inicial completa dos dados e alterna sem interrupções para a captura contínua de dados de alteração incremental (CDC). Trata-se de uma solução completa para casos de uso como migração para cloud em tempo real e construção da camada ODS de data warehouse em tempo real.
Casos de uso
-
Construção de uma camada ODS em tempo real para seu data warehouse
Sincronize dados de bancos de dados operacionais, como MySQL e Oracle, para um data warehouse em tempo real, como Hologres ou StarRocks, fornecendo dados atualizados para painéis e consultas ad hoc.
-
Replicação de banco de dados em tempo real para recuperação de desastres
Estabeleça um link de replicação em tempo real entre duas instâncias de banco de dados para separação de leitura e escrita, réplicas somente leitura ou recuperação de desastres em bancos de dados homogêneos ou heterogêneos.
-
Migração de dados para cloud em tempo real
Migre bancos de dados de um data center on-premises para um service de banco de dados em cloud de maneira transparente.
-
Criação de um data lake ou plataforma intermediária de dados em tempo real
Colete dados de alterações em tempo real de vários bancos de dados operacionais em um data lake central (OSS ou DLF) ou data warehouse (MaxCompute ou Hologres) para construir uma plataforma intermediária de dados unificada em tempo real.
Capacidades principais
A sincronização de banco de dados em tempo real oferece as seguintes capacidades:
Capacidade principal | Recurso | Descrição |
Sincronização de bancos de dados inteiros entre sources de dados heterogêneas | - | A sincronização de banco de dados em tempo real suporta a migração de dados de data centers on-premises ou de outras plataformas cloud para um data warehouse ou data lake, como MaxCompute, Hologres ou Kafka. Para mais informações, consulte Supported data sources and synchronization solutions. |
Sincronização de dados em ambientes de rede complexos | - | A sincronização em tempo real suporta dados de services de banco de dados da Alibaba Cloud, data centers on-premises, bancos de dados autogerenciados em ECS e bancos de dados em outras plataformas cloud. Antes de configurar, garanta a conectividade de rede entre o grupo de recursos e os ambientes source e de destino. Para mais informações, consulte Network connectivity solutions. |
Cenários de sincronização | Sincronização completa | Executa uma sincronização única e completa dos dados das tabelas source para as tabelas de destino. |
Sincronização incremental | Captura continuamente dados de streaming de filas de mensagens ou logs CDC e os grava nas tabelas de destino ou em partições específicas em tempo real. | |
Sincronização integrada completa e incremental |
| |
Configuração de tarefa | Sincronização de tabelas em lote | Sincronize todas as tabelas de um banco de dados ou use regras de seleção e filtro para especificar um subconjunto de tabelas a serem sincronizadas. |
Criação automática de tabelas | Configure uma única vez para processar centenas de tabelas do banco de dados source. O sistema cria automaticamente os esquemas das tabelas no destino, sem necessidade de intervenção manual. | |
Mapeamento flexível | Suporta regras de nomenclatura personalizadas para bancos de dados e tabelas de destino, além de mapeamentos personalizados de tipos de campos entre source e destino, adaptando-se com flexibilidade ao modelo de estrutura de dados do destino. | |
Detecção de alterações DDL (suportada para determinados links de sincronização) | Quando o esquema da tabela source sofre alterações (como criação ou exclusão de tabelas ou colunas), você pode configurar a tarefa de sincronização para adotar uma das seguintes estratégias de resposta:
| |
Configuração de regras DML | O processamento de mensagens DML permite aplicar filtragem e controle granulares nos dados de alteração capturados do source ( | |
Particionamento dinâmico | Se a tabela de destino for particionada, há suporte para particionamento dinâmico com base em campos source ou no horário da alteração do evento no lado source. Importante Um número excessivo de partições degrada o desempenho da sincronização. Se mais de 1.000 partições forem adicionadas em um único dia, a criação de partições falhará e a tarefa será encerrada. | |
O&M de tarefas | Intervenção online | Suporta retomada baseada em checkpoints, que continua a execução a partir de um ponto de verificação de horário específico após uma interrupção da tarefa, garantindo que não haja perda de dados durante a sincronização. Também suporta a reexecução de tarefas para backfill de dados, correção de anomalias ou verificação de alterações de lógica, assegurando consistência dos dados e continuidade dos negócios. |
Monitoramento e alertas | Suporta regras de monitoramento para latência de negócios, status de tarefa, failover e notificações DDL, além de permitir a emissão de alertas quando essas regras são acionadas. | |
Ajuste de recursos | O DataWorks Data Integration é baseado em serverless resource groups e fornece dimensionamento elástico no nível da tarefa. Além disso, você pode configurar políticas de dimensionamento elástico baseadas em tempo para atribuir diferentes especificações de recursos à tarefa em horários distintos, como durante picos de negócios e fora de pico. | |
DI Agent | AI Native | O DI Agent é um conjunto de capacidades verticais do Data Agent para o cenário de integração de dados. Ele abrange seis capacidades principais: configuração de tarefas por conversa, processamento multimodal de dados, perguntas e respostas sobre dados via ChatDB, diagnósticos inteligentes, inspeções periódicas e integração com canais de IM. |
Primeiros passos
Para criar uma tarefa de sincronização de banco de dados em tempo real, consulte Create a real-time database synchronization task.
Para criar e gerenciar tarefas de sincronização de banco de dados em tempo real por meio de conversas em linguagem natural, utilize a capacidade AI Native do Data Agent. O Data Agent suporta todos os tipos de tarefas, incluindo tarefas offline de tabela única, tempo real de tabela única, offline de banco de dados completo e tempo real de banco de dados completo. Não é necessário preencher formulários de configuração manualmente. Uma única frase basta para concluir todo o processo, desde a compreensão da intenção até a implantação da tarefa. Para mais informações, consulte Use Data Agent to create data integration tasks.
Sources de dados suportadas
Sources de dados source | Sources de dados de destino |
MaxCompute | |
AnalyticDB for MySQL (V3.0) | |
ApsaraDB for OceanBase | |
Data Lake Formation (DLF) | |
DataHub | |
Doris | |
Elasticsearch | |
Hologres | |
Kafka | |
| LogHub |
OSS | |
OSS-HDFS | |
SelectDB | |
StarRocks | |
Lindorm |