O DataWorks Data Integration oferece uma solução robusta de sincronização de banco de dados em tempo real que replica todas as tabelas ou um subconjunto selecionado de um banco de dados source para um armazenamento de dados de destino, com baixa latência e de forma automatizada, integrando cargas completas e incrementais. Baseada em um mecanismo de computação em tempo real, essa funcionalidade executa automaticamente a carga inicial completa dos dados e alterna sem interrupções para a captura contínua de dados de alteração incremental (CDC). Trata-se de uma solução completa para casos de uso como migração para cloud em tempo real e construção da camada ODS de data warehouse em tempo real.
Casos de uso
-
Construção de uma camada ODS em tempo real para seu data warehouse
Sincronize dados de bancos de dados operacionais, como MySQL e Oracle, para um data warehouse em tempo real, como Hologres ou StarRocks, fornecendo dados atualizados para painéis e consultas ad hoc.
-
Replicação de banco de dados em tempo real para recuperação de desastres
Estabeleça um link de replicação em tempo real entre duas instâncias de banco de dados para separação de leitura/escrita, réplicas somente leitura ou recuperação de desastres em bancos de dados homogêneos ou heterogêneos.
-
Migração de dados para cloud em tempo real
Migre bancos de dados de um data center on-premises para um service de banco de dados em cloud de forma transparente.
-
Criação de um data lake ou plataforma intermediária de dados em tempo real
Colete dados de alterações em tempo real de vários bancos de dados operacionais em um data lake central (OSS ou DLF) ou data warehouse (MaxCompute ou Hologres) para construir uma plataforma intermediária de dados unificada em tempo real.
Capacidades principais
A sincronização de banco de dados em tempo real oferece as seguintes capacidades:
Capacidade principal | Recurso | Descrição |
Sincronização de bancos de dados inteiros entre sources de dados heterogêneas | - | A sincronização de banco de dados em tempo real permite migrar dados de data centers on-premises ou de outras plataformas cloud para um data warehouse ou data lake, como MaxCompute, Hologres ou Kafka. Para mais informações, consulte Sources de dados e soluções de sincronização suportadas. |
Sincronização de dados em ambientes de rede complexos | - | A sincronização em tempo real abrange dados de services de banco de dados da Alibaba Cloud, data centers on-premises, bancos de dados autogerenciados em ECS e bancos de dados em outras plataformas cloud. Antes de configurar, garanta a conectividade de rede entre o grupo de recursos e os ambientes source e de destino. Para mais informações, consulte Soluções de conectividade de rede. |
Cenários de sincronização | Sincronização completa | Executa uma sincronização única e completa dos dados das tabelas source para as tabelas de destino. |
Sincronização incremental | Captura continuamente dados de streaming de filas de mensagens ou logs CDC e os grava nas tabelas de destino ou em partições específicas em tempo real. | |
Sincronização integrada completa e incremental |
| |
Configuração de tarefas | Sincronização de tabelas em lote | Sincronize todas as tabelas de um banco de dados ou utilize regras de seleção e filtro para especificar um subconjunto de tabelas a serem sincronizadas. |
Criação automática de tabelas | Configure uma única vez para processar centenas de tabelas do banco de dados source. O sistema cria automaticamente os esquemas das tabelas no destino, sem necessidade de intervenção manual. | |
Mapeamento flexível | Permite regras personalizadas de nomenclatura para bancos de dados e tabelas de destino, além de mapeamentos personalizados de tipos de campos entre source e destino, adaptando-se flexivelmente ao modelo de estrutura de dados do destino. | |
Detecção de alterações DDL (suportada para determinados links de sincronização) | Quando o esquema da tabela source sofre alterações (como criação ou exclusão de tabelas ou colunas), configure a tarefa de sincronização para adotar uma das seguintes estratégias de resposta:
| |
Configuração de regras DML | O processamento de mensagens DML permite aplicar filtragem e controle granulares nos dados de alteração capturados do source ( | |
Particionamento dinâmico | Se a tabela de destino for particionada, há suporte para particionamento dinâmico com base em campos do source ou no horário da alteração do evento no lado source. Importante Um número excessivo de partições degrada o desempenho da sincronização. Se mais de 1.000 partições forem adicionadas em um único dia, a criação de partições falhará e a tarefa será encerrada. | |
O&M de tarefas | Intervenção online | Oferece suporte à retomada baseada em checkpoints, que retoma a execução a partir de um ponto de verificação de tempo específico após uma interrupção da tarefa, garantindo que não haja perda de dados durante a sincronização. Também permite reexecutar tarefas para backfill de dados, correção de anomalias ou verificação de alterações de lógica, assegurando a consistência dos dados e a continuidade dos negócios. |
Monitoramento e alertas | Suporta regras de monitoramento para latência de negócios, status de tarefas, failover e notificações DDL, além de permitir o envio de alertas quando as regras são acionadas. | |
Ajuste de recursos | O DataWorks Data Integration baseia-se em grupos de recursos serverless e fornece dimensionamento elástico no nível da tarefa. Além disso, configure políticas de dimensionamento elástico baseadas em tempo para atribuir diferentes especificações de recursos à tarefa em horários distintos, como durante picos de negócios e horários de menor movimento. | |
DI Agent | AI Native | O DI Agent é um conjunto de capacidades verticais do Data Agent voltado para o cenário de integração de dados. Ele abrange seis capacidades principais: configuração de tarefas por conversação, processamento multimodal de dados, perguntas e respostas sobre dados via ChatDB, diagnósticos inteligentes, inspeções periódicas e integração com canais de IM. |
Primeiros passos
Para criar uma tarefa de sincronização de banco de dados em tempo real, consulte Criar uma tarefa de sincronização de banco de dados em tempo real.
Para criar e gerenciar tarefas de sincronização de banco de dados em tempo real por meio de conversas em linguagem natural, utilize a capacidade AI Native do Data Agent. O Data Agent suporta todos os tipos de tarefas, incluindo tarefas offline de tabela única, tarefas em tempo real de tabela única, tarefas offline de banco de dados completo e tarefas em tempo real de banco de dados completo. Não é necessário preencher formulários de configuração manualmente. Uma única frase basta para concluir todo o processo, desde a compreensão da intenção até a implantação da tarefa. Para mais informações, consulte Usar o Data Agent para criar tarefas de integração de dados.
Sources de dados suportadas
Sources de dados source | Sources de dados de destino |
MaxCompute | |
AnalyticDB for MySQL (V3.0) | |
ApsaraDB for OceanBase | |
Data Lake Formation (DLF) | |
DataHub | |
Doris | |
Elasticsearch | |
Hologres | |
Kafka | |
| LogHub |
OSS | |
OSS-HDFS | |
SelectDB | |
StarRocks | |
Lindorm |