Tutoriais passo a passo para combinações específicas de source e destino no DataWorks Data Integration, abrangendo sincronização em lote, CDC em tempo real, migração de JSON e ingestão de dados de IoT.
Cada tutorial aborda uma combinação específica de source e destino, guiando você pela configuração, execução e verificação. Para orientações de arquitetura e planejamento de alto nível, consulte [Cenários de negócios comuns]().
Escolha um método de sincronização
Antes de escolher um tutorial, identifique seus requisitos de sincronização:
|
Requisito |
Método recomendado |
Caso de uso típico |
|
Cópia completa única ou agendada |
Nó de sincronização em lote |
Migração de dados históricos, snapshots periódicos |
|
Rastreamento de alterações com baixa latência em bancos relacionais |
Sincronização CDC em tempo real |
MySQL ou Oracle para MaxCompute com atualizações quase em tempo real |
|
Serverless, sem grupo de recursos para gerenciar |
Tarefa de sincronização serverless |
Pipelines ad hoc ou leves sem recursos dedicados |
|
Source semiestruturado (arquivos JSON no OSS) |
Sincronização em lote com leitor JSON |
Arquivos de log, dados de eventos armazenados como JSON no OSS |
|
Telemetria de dispositivos em escala |
Pipeline de ingestão de dados de IoT |
Dados de sensores em série temporal do IoT Platform |
Se você não tiver certeza sobre qual método se adequa à sua carga de trabalho, considere estes fatores:
Latência: A sincronização CDC entrega alterações em segundos. A sincronização em lote executa conforme um agendamento (de minutos a horas).
Tipo de source: O CDC exige um banco de dados relacional com binary logging ou rastreamento de alterações ativado. A sincronização em lote oferece suporte a uma variedade maior de sources.
Infraestrutura: A sincronização em lote e a sincronização em tempo real requerem um grupo de recursos dedicado. As tarefas de sincronização serverless não possuem essa exigência.
Tutoriais disponíveis
Sincronização a partir de bancos de dados relacionais
MySQL para MaxCompute (CDC em tempo real) — Sincronize alterações incrementais do MySQL usando captura de dados de alteração. Abrange a ativação de binlog, a configuração do leitor CDC e a verificação de alterações no nível de linha no MaxCompute.
MySQL para MaxCompute (lote) — Agende uma sincronização em lote completa ou incremental do MySQL. Cobre a extração incremental baseada em watermark e a gravação de partições no MaxCompute.
Oracle para MaxCompute — Migre tabelas do Oracle para o MaxCompute com mapeamento de tipos e configuração de partição.
Sincronização a partir de armazenamento de documentos e objetos
Arquivos JSON do OSS para MaxCompute — Analise e carregue arquivos JSON semiestruturados do OSS em tabelas do MaxCompute. Inclui mapeamento de schema, achatamento de campos aninhados e tratamento de registros malformados.
MongoDB para MaxCompute (leitura em lote) — Extraia documentos de coleções do MongoDB e grave no MaxCompute. Aborda filtragem de coleção, projeção de campos e configuração do modo de gravação.
Ingestão de IoT e streaming
IoT Platform para MaxCompute — Ingira telemetria de dispositivos em série temporal do Alibaba Cloud IoT Platform no MaxCompute. Cobre assinatura de tópicos, análise de timestamp e configuração de particionamento por tempo.
Tópicos relacionados
[Cenários de negócios comuns]() — Padrões de arquitetura e visões gerais de cenários para planejar sua estratégia de integração.
[Visão geral do Data Integration]() — Conectores suportados, requisitos de grupo de recursos e tipos de nós de sincronização.
[Configure um nó de sincronização em lote]() — Referência para todos os parâmetros de plugins de leitura e gravação.
[Configure um nó de sincronização em tempo real]() — Referência para configuração de source CDC e definições de entrega exactly-once.