O DataWorks Data Integration permite migrar todas as tabelas ou apenas uma seleção delas de um banco de dados source para um armazenamento de destino. Esse processo ocorre por meio de sincronização completa ou incremental, em execuções únicas ou recorrentes. O sistema cria automaticamente os schemas das tabelas de destino e elimina a necessidade de configurar tarefas individuais para cada tabela.
Casos de uso
-
Migração de dados e adoção de cloud
Migre bancos de dados, como MySQL e Oracle, de um data center on-premises para um data warehouse ou data lake na cloud.
Transfira dados entre diferentes plataformas cloud ou sistemas de banco de dados.
-
Construção de data warehouse ou data lake
Sincronize periodicamente dados completos ou incrementais de bancos de dados OLTP para a camada ODS de um data warehouse ou data lake para viabilizar análises downstream.
-
Backup de dados e recuperação de desastres
Faça backup regular de conjuntos de dados completos de bancos de produção para mídias de armazenamento econômicas, como HDFS ou OSS.
Implemente soluções de recuperação de desastres entre regiões ou zonas de disponibilidade.
Capacidades principais
A tabela a seguir descreve as capacidades principais.
Capacidade principal | Recurso | Descrição |
Sincronização entre sources de dados heterogêneas | - | A sincronização em lote de banco de dados suporta a migração de dados de data centers on-premises ou de outras plataformas cloud para data warehouses ou data lakes, como MaxCompute, Hologres e OSS. Para mais informações, consulte Supported data sources and destinations. |
Sincronização de dados em ambientes de rede complexos | - | A sincronização offline suporta a transferência de dados entre bancos de dados da Alibaba Cloud, bancos de dados em IDCs on-premises, bancos autogerenciados em instâncias ECS e bancos fora da Alibaba Cloud. Antes de configurar, verifique se o grupo de recursos tem conectividade de rede com o source e o destino. Para mais informações, consulte Configure network connectivity. |
Cenários de sincronização | Sincronização completa | Suporta sincronização completa de dados, única ou recorrente, para tabelas de destino ou partições específicas. |
Sincronização incremental | Permite sincronização incremental de dados, única ou recorrente, com base em tempo, partições ou chaves primárias. | |
Sincronização combinada completa e incremental | Primeira execução: realiza automaticamente uma sincronização completa dos dados. Execuções subsequentes: alterna automaticamente para sincronização incremental recorrente nas partições especificadas. | |
Mapeamento de banco de dados e tabelas | Sincronização em lote de tabelas | Sincronize todas as tabelas de um banco de dados ou selecione tabelas específicas manualmente ou por meio de regras de filtro. |
Criação automática de tabelas | Com uma única configuração, processe centenas de tabelas do banco de dados source. O sistema cria automaticamente os schemas das tabelas no destino, sem intervenção manual. | |
Mapeamento flexível | Suporta regras personalizadas de nomenclatura para bancos de dados e tabelas de destino, além de mapeamentos personalizados de tipos de campos entre source e destino para adaptação flexível ao modelo de estrutura de dados do destino. | |
Agendamento e gerenciamento de dependências | Agendamento | Suporta múltiplos intervalos de agendamento, como minuto, hora, dia, semana, mês e ano. Para sincronizar um grande número de tabelas simultaneamente, recomendamos configurar agendamentos para executar as tarefas em lotes e evitar acúmulo de tarefas e contenção de recursos. |
Dependências de tarefas | Tanto a tarefa de banco de dados em lote quanto cada subtarefa no nível de tabela podem servir como dependências upstream no DataWorks e permitir que outras tarefas de desenvolvimento dependam delas. Quando a sincronização de uma tabela específica é concluída, as tarefas de desenvolvimento downstream são acionadas automaticamente. | |
Suporte a parâmetros | Suporta parâmetros de agendamento para sincronização incremental. Por exemplo, use ${bizdate} para representar a data de negócios. | |
Parâmetros avançados | Configurações de dados sujos | Dados sujos são registros cuja gravação no destino falha devido a exceções como conflitos de tipo ou violações de restrição. O valor padrão é false, o que significa que dados sujos não são permitidos; nesse caso, a tarefa falha se eles ocorrerem. Se você definir esse parâmetro como true, todos os dados sujos serão ignorados. |
Configurações de reader e writer | Permite configurar separadamente o número máximo de conexões para as sources de dados do reader e do writer, além de definir políticas de limpeza no destino antes da gravação dos dados. | |
Concorrência e limitação de taxa |
| |
OM | Intervenção online | Suporta operações de intervenção online, como nova execução, backfill, marcação como bem-sucedida e congelamento/descongelamento. |
Monitoramento e alertas | Permite configurar regras de monitoramento com base em baselines, status de tarefas e durações de execução, além de suportar alertas para regras acionadas. | |
Qualidade de dados | Após submeter e implantar uma tarefa, configure regras de monitoramento de qualidade de dados para as tabelas de destino no Operation Center. Há suporte tanto para geração automática baseada em IA quanto para configuração manual. Atualmente, apenas alguns tipos de banco de dados suportam monitoramento por regras de qualidade. Para mais informações, consulte Data Quality Overview. | |
DI Agent | AI Native | O DI Agent é um conjunto de capacidades verticais do Data Agent para cenários de integração de dados. Ele abrange seis capacidades: configuração de tarefas por conversa, processamento multimodal de dados, perguntas e respostas de dados via ChatDB, diagnósticos inteligentes, inspeção periódica e integração com canais de IM. |
Primeiros passos
Para crie uma tarefa de sincronização em lote de banco de dados, consulte Create a batch database synchronization task.
Para crie e gerencie tarefas de sincronização em lote de banco de dados por meio de conversas em linguagem natural, utilize a capacidade AI Native do Data Integration (DI Agent). Para mais informações, consulte Use DI Agent.
Sources de dados suportadas
O DataWorks suporta a migração em lote de dados de diversas sources para destinos como MaxCompute, OSS e Elasticsearch. Os seguintes tipos de source de dados são suportados.
Source de dados de origem | Source de dados de destino |
MaxCompute | |
Data Lake Formation | |
Hive | |
Hologres | |
OSS | |
OSS-HDFS | |
Elasticsearch | |
StarRocks | |
MySQL |