O DataWorks Data Integration permite migrar todas as tabelas ou apenas um subconjunto delas de um banco de dados source para um armazenamento de destino. Esse processo ocorre por meio de sincronização completa ou incremental, em execuções únicas ou recorrentes. O sistema cria automaticamente os schemas das tabelas de destino e elimina a necessidade de configurar tarefas individuais para cada tabela.
Casos de uso
-
Migração de dados e adoção de cloud
Migre bancos de dados, como MySQL e Oracle, de um data center on-premises para um data warehouse ou data lake na cloud.
Transfira dados entre diferentes plataformas de cloud ou sistemas de banco de dados.
-
Construção de data warehouse ou data lake
Sincronize periodicamente dados completos ou incrementais de bancos de dados OLTP para a camada ODS de um data warehouse ou data lake para viabilizar análises downstream.
-
Backup de dados e recuperação de desastres
Faça backup regular de conjuntos de dados completos de bancos de produção para mídias de armazenamento econômicas, como HDFS ou OSS.
Implemente soluções de recuperação de desastres entre regiões ou zonas de disponibilidade.
Capacidades principais
A tabela a seguir descreve as capacidades principais.
Capacidade principal | Recurso | Descrição |
Sincronização entre sources de dados heterogêneas | - | A sincronização em lote de bancos de dados permite migrar dados de data centers on-premises ou de outras plataformas de cloud para data warehouses ou data lakes, como MaxCompute, Hologres e OSS. Para mais informações, consulte Sources e destinos de dados suportados. |
Sincronização de dados em ambientes de rede complexos | - | A sincronização offline abrange bancos de dados da Alibaba Cloud, bancos de dados em IDCs on-premises, bancos autogerenciados em instâncias ECS e bancos fora da Alibaba Cloud. Antes de configurar, verifique se o grupo de recursos tem conectividade de rede com o source e o destino. Para mais informações, consulte Configurar conectividade de rede. |
Cenários de sincronização | Sincronização completa | Permite sincronizar todos os dados de uma só vez ou de forma recorrente para tabelas de destino ou partições específicas. |
Sincronização incremental | Oferece sincronização incremental única ou recorrente com base em tempo, partições ou chaves primárias. | |
Sincronização combinada (completa e incremental) | Primeira execução: realiza automaticamente uma sincronização completa dos dados. Execuções subsequentes: alterna automaticamente para sincronização incremental recorrente nas partições especificadas. | |
Mapeamento de banco de dados e tabelas | Sincronização em lote de tabelas | Sincronize todas as tabelas de um banco de dados ou selecione tabelas específicas manualmente ou por meio de regras de filtro. |
Criação automática de tabelas | Com uma única configuração, processe centenas de tabelas do banco de dados source. O sistema cria os schemas das tabelas no destino automaticamente, sem intervenção manual. | |
Mapeamento flexível | Suporta regras personalizadas de nomenclatura para bancos e tabelas de destino, além de mapeamentos personalizados de tipos de campos entre source e destino. Isso adapta a estrutura com flexibilidade ao modelo de dados do destino. | |
Agendamento e gerenciamento de dependências | Agendamento | Compatível com diversos intervalos de agendamento, incluindo minutos, horas, dias, semanas, meses e anos. Para sincronizar um grande volume de tabelas simultaneamente, configure agendamentos que executem as tarefas em lotes. Essa prática evita acúmulo de tarefas e contenção de recursos. |
Dependências de tarefas | Tanto a tarefa de banco de dados em lote quanto cada subtarefa no nível de tabela podem funcionar como dependências upstream no DataWorks. Assim, outras tarefas de desenvolvimento podem depender delas. Ao concluir a sincronização de uma tabela específica, o sistema aciona automaticamente as tarefas de desenvolvimento downstream. | |
Suporte a parâmetros | Aceita parâmetros de agendamento para sincronização incremental. Por exemplo, use ${bizdate} para representar a data comercial. | |
Parâmetros avançados | Configurações de dados incorretos | Dados incorretos são registros que não puderam ser gravados no destino devido a exceções como conflitos de tipo ou violações de restrições. O valor padrão é false, indicando que dados incorretos não são permitidos; nesse caso, a tarefa falha se algum dado incorreto for encontrado. Se definido como true, o sistema ignora todos os dados incorretos. |
Configurações de leitor e gravador | Permite configurar separadamente o número máximo de conexões para as sources de dados do leitor e do gravador, além de definir políticas de limpeza no destino antes da gravação dos dados. | |
Simultaneidade e limitação de taxa |
| |
OM | Intervenção online | Suporta operações de intervenção online, como reexecução, backfill, marcação como bem-sucedida e congelamento/descongelamento. |
Monitoramento e alertas | Permite configurar regras de monitoramento com base em baselines, status de tarefas e durações de execução, além de emitir alertas quando as regras forem acionadas. | |
Qualidade de dados | Após confirmar e implantar uma tarefa, configure regras de monitoramento de qualidade de dados para as tabelas de destino no Operation Center. Há suporte tanto para geração automática baseada em IA quanto para configuração manual. Atualmente, apenas alguns tipos de banco de dados oferecem monitoramento por regras de qualidade. Para mais informações, consulte Qualidade de dados. | |
DI Agent | AI Native | O DI Agent é um conjunto de capacidades verticais do Data Agent voltado para cenários de integração de dados. Ele engloba seis capacidades: configuração de tarefas por conversa, processamento multimodal de dados, perguntas e respostas sobre dados via ChatDB, diagnósticos inteligentes, inspeção periódica e integração com canais de IM. |
Primeiros passos
Para crie uma tarefa de sincronização em lote de bancos de dados, consulte Criar uma tarefa de sincronização em lote de bancos de dados.
Para crie e gerencie tarefas de sincronização em lote de bancos de dados por meio de conversas em linguagem natural, utilize a capacidade AI Native do Data Integration (DI Agent). Para mais informações, consulte Usar o DI Agent.
Sources de dados suportadas
O DataWorks suporta a migração em lote de dados de diversas sources para destinos como MaxCompute, OSS e Elasticsearch. Os seguintes tipos de source de dados são compatíveis.
Source de dados | Destino de dados |
MaxCompute | |
Data Lake Formation | |
Hive | |
Hologres | |
OSS | |
OSS-HDFS | |
Elasticsearch | |
StarRocks | |
MySQL |