O Data Integration é uma plataforma de sincronização de dados estável, eficiente e com dimensionamento elástico. Ela move e sincroniza dados de forma confiável e em alta velocidade entre fontes de dados heterogêneas, mesmo em ambientes de rede complexos.
Processo
Acesse o Data Integration em um computador desktop usando o Google Chrome versão 69 ou posterior.
O fluxo geral de desenvolvimento no Data Integration segue estas etapas:
Configure uma fonte de dados, prepare um grupo de recursos e estabeleça a conectividade de rede entre a fonte de dados e o grupo de recursos.
Selecione o tipo de sincronização em lote ou em tempo real conforme seu caso de uso e siga o guia da interface para concluir a configuração dos recursos e da tarefa.
Use a visualização de dados e execuções de teste para depurar a tarefa. Após depurar com sucesso, envie e implante a tarefa.
Essa etapa inicia a fase de operações contínuas, na qual você monitora o status da sincronização, configura alertas e otimiza recursos, completando o ciclo de gerenciamento.
Para usar conversas com IA em vez da configuração tradicional baseada em formulários na criação de tarefas do Data Integration e executar O&M inteligente em todo o fluxo de trabalho, o DataWorks também oferece os recursos AI Native do Data Integration (DI Agent). Esses recursos permitem criar tarefas por conversa em linguagem natural, além de diagnósticos inteligentes e inspeções periódicas. Para mais informações, consulte Data Integration DI Agent.
Métodos de sincronização
O Data Integration do DataWorks oferece métodos de sincronização que combinam três dimensões: latência, escopo e política de dados. Para explicações detalhadas e recomendações, consulte Fontes de dados e soluções de sincronização suportadas.
Latência: Em lote ou em tempo real. A sincronização em lote usa agendamento periódico para migrar dados por hora ou diariamente. Já a sincronização em tempo real captura alterações nos dados de origem via change data capture (CDC), atingindo latência no nível de segundos.
Escopo: Tabela única, banco de dados completo ou sharding. Suporta transferência granular de uma única tabela, além de migração em lote e mesclagem de um banco de dados inteiro ou de bancos fragmentados.
Política de dados: Completa, incremental ou completa e incremental. A migração completa transfere todos os dados históricos. A sincronização incremental processa apenas dados novos ou alterados. O modo completo e incremental combina ambas as abordagens e oferece implementações em lote, em tempo real e quase em tempo real, conforme as características da fonte de dados e os requisitos de latência.
Método | Descrição |
Em lote | Usa um mecanismo de agendamento periódico em lote, com tarefas horárias ou diárias, para executar a migração completa ou incremental dos dados de origem para o destino. |
Em tempo real | Emprega um motor de processamento de streaming para capturar alterações nos dados de origem em tempo real (logs CDC), alcançando sincronização de dados com latência no nível de segundos. |
Tabela única | Transfere dados de uma única tabela, com suporte a mapeamento granular de campos, regras de transformação e configurações de controle. |
Banco de dados completo | Migra esquemas de tabelas e dados de várias tabelas dentro de uma instância de banco de dados de origem para o destino em uma única operação, com suporte à criação automática de tabelas. Uma única tarefa pode sincronizar múltiplas tabelas, reduzindo a quantidade de tarefas e o consumo de recursos. |
Sharding | Grava dados de várias tabelas de origem que compartilham o mesmo esquema em uma única tabela de destino, identifica automaticamente as regras de roteamento de sharding e mescla os dados. |
Completa | Migra todos os dados históricos da tabela de origem de uma só vez. Geralmente usada para inicialização de data warehouse ou arquivamento de dados. |
Incremental | Sincroniza apenas dados novos ou alterados da origem (como |
Completa e incremental | Executa uma sincronização completa única dos dados históricos e depois transiciona automaticamente para gravações incrementais. O Data Integration suporta sincronização completa e incremental para diversos cenários. Selecione a opção adequada com base nas características da fonte de dados e nos requisitos de latência da origem e do destino.
|
Conceitos básicos
Conceito | Descrição |
Sincronização de dados | A sincronização de dados consiste em ler dados de uma source, extrair e filtrar, e gravar os dados em um destino. O Data Integration foca na transferência de dados abstraíveis em estruturas lógicas de tabelas bidimensionais. Ele não fornece consumo de fluxo de dados nem capacidades de transformação ETL. O Data Integration suporta apenas a garantia de entrega pelo menos uma vez (at-least-once). A entrega exatamente uma vez (exactly-once) não é suportada. Isso significa que podem ocorrer dados duplicados após a sincronização. A desduplicação depende exclusivamente das chaves primárias e das capacidades do destino. |
Mapeamento de campos | O mapeamento de campos define a correspondência de leitura/gravação entre os dados de origem e de destino em uma tarefa de sincronização. Ao configurar o mapeamento, verifique cuidadosamente a compatibilidade de tipos entre os campos de origem e destino para evitar erros de conversão que possam gerar dirty data ou causar falhas na tarefa. Os riscos comuns incluem:
|
Concorrência | Concorrência é o número máximo de threads que podem ler ou gravar no armazenamento de dados em paralelo durante uma tarefa de sincronização. |
Limitação de taxa | A limitação de taxa refere-se ao limite de velocidade de transferência que uma tarefa de sincronização do Data Integration pode atingir. |
Dirty data | Dirty data refere-se a dados inválidos, formatados incorretamente ou que apresentam exceções durante a sincronização. Quando um registro individual falha ao ser gravado no destino, ele é classificado como dirty data (por exemplo, um tipo Se uma tarefa falhar devido a dirty data, **os dados já gravados com sucesso não serão revertidos**. O Data Integration utiliza um mecanismo de gravação em lote. A capacidade de reverter um lote com falha depende do suporte a transações no destino. **O próprio Data Integration não oferece suporte a transações**. |
Fonte de dados | Uma fonte de dados é uma unidade de configuração padronizada no DataWorks para conexão com sistemas externos. Ela fornece definições unificadas de endpoints de leitura/gravação para tarefas do Data Integration por meio de modelos de conexão predefinidos para diversas fontes heterogêneas, como MaxCompute, MySQL e OSS. |
Consistência de dados | O Data Integration suporta apenas a garantia de entrega pelo menos uma vez (at-least-once). A entrega exatamente uma vez (exactly-once) não é suportada. Isso significa que podem ocorrer dados duplicados após a sincronização. A desduplicação depende exclusivamente das chaves primárias e das capacidades do destino. |
Recursos e valor principal
As capacidades do Data Integration do DataWorks refletem-se em sua ampla conectividade, métodos flexíveis de sincronização, alto desempenho, desenvolvimento e O&M simplificados, além de gerenciamento abrangente de segurança.
Ampla conectividade com o ecossistema de dados
Elimine silos de dados e viabilize a agregação e migração de informações.
Suporte diversificado a fontes de dados: Abrange uma ampla variedade de tipos de fontes de dados, incluindo bancos de dados relacionais, sistemas de armazenamento de big data, bancos NoSQL, filas de mensagens, serviços de armazenamento de arquivos e aplicações SaaS.
Compatibilidade com redes complexas: Ao configure a Configuração de conectividade de rede, é possível utilizar Internet, VPCs, Express Connect ou Cloud Enterprise Network (CEN) para habilitar a transferência de dados em arquiteturas de cloud híbrida e multicloud.
Métodos de sincronização flexíveis e versáteis
Atenda a requisitos de sincronização que variam de lote a tempo real, de tabela única a banco completo, e de migração completa a incremental.
Sincronização em lote: Suporta diversos cenários, incluindo tabela única, banco completo e sharding. Oferece filtragem de dados, seleção de colunas e lógica de transformação para carregamento periódico ETL em larga escala (T+1).
Sincronização em tempo real: Captura alterações de dados de fontes como MySQL, Oracle e Hologres quase em tempo real e as grava em data warehouses em tempo real ou filas de mensagens, apoiando decisões de negócios imediatas.
Integração completa e incremental: Disponibiliza soluções de sincronização em lote e em tempo real para bancos completos, além de modos combinados. A primeira execução realiza a inicialização completa dos dados, e as execuções subsequentes mudam automaticamente para sincronização incremental. Isso simplifica o carregamento inicial e os processos de atualização, entregando capacidades de migração completa, captura incremental e transição automática de completo para incremental.
Dimensionamento elástico e desempenho
Agendamento adaptativo de recursos que garante transferência de dados altamente confiável para operações críticas do negócio.
Recursos elásticos: Os grupos de recursos Serverless suportam dimensionamento elástico sob demanda e faturamento conforme o uso (pay-as-you-go), lidando eficazmente com flutuações de tráfego.
Gerenciamento de desempenho: Inclui controle de concorrência, limitação de taxa, tratamento de dirty data e processamento distribuído para assegurar sincronização estável sob cargas de trabalho variáveis.
Desenvolvimento low-code e O&M inteligente
Reduza a complexidade de desenvolvimento e os custos de O&M da sincronização de dados por meio de configuração visual e fluxos de trabalho simplificados.
Desenvolvimento low-code: A interface sem código oferece um painel de configuração visual que permite configure a maioria das tarefas de sincronização com operações simples de clique em, sem necessidade de programação. Já o editor de código suporta configurações avançadas via scripts JSON para atender a requisitos complexos, como parametrização e mapeamento dinâmico de colunas.
O&M full-stack: Tarefas de sincronização em lote podem ser integradas a fluxos de trabalho DAG, com suporte a orquestração de agendamento, monitoramento e alertas.
Gerenciamento abrangente de segurança
Integra mecanismos de segurança em várias camadas para garantir controlabilidade e conformidade dos dados durante todo o ciclo de vida do fluxo.
Gerenciamento centralizado: Um centro unificado de gerenciamento de fontes de dados que suporta controle de permissões e isolamento entre ambientes de desenvolvimento e produção.
Proteção de segurança: Está em conformidade com o controle de acesso RAM e suporta autenticação baseada em funções e mascaramento de dados.
Faturamento
Os custos das tarefas do Data Integration incluem principalmente taxas de grupos de recursos, taxas de agendamento e taxas de tráfego de rede pública. As tarefas dependem de grupos de recursos, cujos custos são cobrados pelo próprio grupo. Algumas tarefas de sincronização em lote e em lote de banco completo envolvem execuções agendadas e incorrem em taxas de agendamento. Se as fontes de dados transferirem informações pela Internet, taxas de tráfego de rede pública também se aplicam. Para detalhes sobre faturamento, consulte Principais cenários de faturamento.
Conectividade de rede
A conectividade de rede entre fontes de dados e grupos de recursos é pré-requisito para a execução bem-sucedida das tarefas do Data Integration. É indispensável garantir essa conectividade; caso contrário, as tarefas falharão inevitavelmente.

O Data Integration suporta sincronização de dados entre fontes heterogêneas em ambientes de rede complexos, abrangendo os seguintes cenários:
Sincronização de dados entre contas ou regiões da Alibaba Cloud.
Conectividade entre cloud híbrida e IDC local.
Múltiplas configurações de canais de rede, como Internet, VPC e CEN.
Para soluções detalhadas de configuração de rede, consulte Visão geral das soluções de conectividade de rede.
Referências
Após configure as fontes de dados, crie tarefas de sincronização em Data Integration ou Data Development para transferir e migrar dados. Para mais informações, consulte: