O Data Integration oferece suporte à sincronização em tempo real de fontes de tabela única, como Kafka e LogHub, para o OSS. Este exemplo utiliza o Kafka como source e o OSS como destino.
Limitações
A versão do Kafka deve estar entre 0.10.2 e 2.2.0 (inclusive).
Pré-requisitos
Adquira um serverless resource group ou um exclusive resource group for Data Integration.
Crie uma fonte de dados do Kafka e uma fonte de dados do OSS. Para mais informações, consulte Data source configure.
Estabeleça conectividade de rede entre o grupo de recursos e as fontes de dados. Para mais informações, consulte Overview of network connectivity solutions.
Procedimento
Etapa 1: Selecione um tipo de tarefa de sincronização
-
Faça login no console do DataWorks. Na região de destino, clique em no painel de navegação à esquerda. Selecione um workspace na lista suspensa e clique em Go to Data Integration.
-
No painel de navegação à esquerda, clique em Synchronization Task. Em seguida, clique em Create Synchronization Task na parte superior da página. Na página de criação de tarefas, defina os seguintes parâmetros:
Source and destination:
Kafka→OSSNew Node Name: insira um nome personalizado para a tarefa de sincronização.
Synchronization Method:
single-table real-time.
Etapa 2: configure rede e recursos
Na seção Network and Resource Configuration, selecione o Resource Group para a tarefa de sincronização. Aloque o Task Resource Usage em CUs para a tarefa.
Em Source Information, selecione sua fonte de dados
kafka. Para o Destination, selecione sua fonte de dadosOSS. Depois, clique em Test Connectivity.Após as fontes de dados de source e destino passarem no teste de conectividade, clique em Next.
Etapa 3: configure o link de sincronização
1. configure a source Kafka
Na parte superior da página, clique no nó de source Kafka para configure as Source Information.

-
Na seção Source Information, selecione o tópico a ser sincronizado no cluster do Kafka.
Use os valores padrão para outros parâmetros ou modifique-os conforme necessário.
-
No canto superior direito, clique em Data Sampling.
Na caixa de diálogo exibida, especifique o Start Time e o Number of Sample Records e, em seguida, clique em Start Sampling. Isso permite amostrar e visualize dados do tópico especificado do Kafka. Os dados amostrados servem de entrada para visualizações de dados e configurações visuais nos nós subsequentes de processamento de dados.
Na seção Output Field Configuration, selecione os campos a serem sincronizados.
2. edite nós de processamento de dados
clique em no ícone
para adicionar um método de processamento de dados. Existem cinco métodos disponíveis: data masking, string replacement, data filtering, JSON parsing e field editing and assignment. Organize esses métodos em qualquer ordem. A tarefa processa os dados sequencialmente na ordem configurada durante a execução.
Após configure cada nó de processamento, clique em Output Preview no canto superior direito. Na caixa de diálogo, clique em Retrieve Upstream Output para simular como o nó atual processa os dados amostrados e visualize a saída.
A caixa de diálogo Preview Data Output possui duas seções: Input Data e Preview Result. A seção Input Data exibe os dados do Kafka amostrados obtidos ao clique em Re-obtain Output Of Ancestor Node. Clique também em + Manually Add Data para adicionar dados de teste. A tabela inclui campos como _key_, _value_, _partition_, _offset_ e timestamp. Em Preview Result, clique em Preview para visualize a saída processada e a contagem de dados incorretos. O resultado da pré-visualização serve apenas como referência e pode diferir da execução real da tarefa.
O recurso de pré-visualização de saída de dados depende do Data Sampling da source Kafka. Realize a amostragem de dados na configuração da source Kafka antes de visualize a saída.
3. configure o destino OSS
Na parte superior da página, clique no nó de destino OSS para configure as OSS Destination Information.
-
Na seção OSS Destination Information, configure as informações básicas do destino OSS.
Write Format: Os formatos suportados incluem Hudi, Paimon e Iceberg.
-
Location for Creating Metadatabase: Se o Data Lake Formation (DLF) estiver ativado para sua conta, o sistema cria automaticamente o metadatabase e as metatabelas correspondentes no DLF quando os dados são sincronizados com o data lake.
NotaNão há suporte para criação de metadados entre regiões.
Select Storage Path: Selecione o caminho do OSS para armazenar os dados no data lake.
Target Database: Selecione o banco de dados de destino para os dados. Selecione também Create Database para crie um metadatabase do DLF e especifique um Database Name.
Destination Table: escolha entre Create tables automatically ou Use Existing Table para gravar dados em uma tabela do OSS.
Table Name: insira ou selecione o nome da tabela do OSS onde os dados serão gravados.
-
(Opcional) edite o esquema da tabela.
Ao selecione Create tables automatically, clique em no botão Edit Table Schema para edite a estrutura da tabela de destino na caixa de diálogo. Clique também em Regenerate Schema from Upstream Node para gerar automaticamente a estrutura da tabela a partir das colunas de saída do nó upstream. Na estrutura gerada, selecione uma coluna para defina como chave primária.
-
configure o mapeamento de campos.
O sistema gera automaticamente mapeamentos entre colunas upstream e colunas de destino com base no princípio de The same name mapping. Ajuste esses mapeamentos conforme necessário. Uma única coluna upstream pode ser mapeada para várias colunas de destino, mas várias colunas upstream não podem ser mapeadas para uma única coluna de destino. Se uma coluna upstream não for mapeada para uma coluna de destino, seus dados não serão gravados na tabela de destino.
4. Alertas
Para evitar que erros na tarefa causem atrasos na sincronização de dados comerciais, defina uma política de alertas para a tarefa de sincronização.
clique em Alert Settings no canto superior direito da página para abrir a página de configurações Alert Rule Configurations for Real-time Synchronization Subnode.
-
clique em Add Alert Rule para configure uma regra de alerta.
NotaAs regras de alerta definidas aqui se aplicam às subtarefas de sincronização em tempo real geradas por esta tarefa. Após configure a tarefa, visualize e modifique as regras de alerta para essas subtarefas na página execute e gerencie real-time synchronization tasks.
-
gerencie as regras de alerta.
Para regras de alerta existentes, use o interruptor para ative-las ou desativá-las. Envie alertas para diferentes destinatários com base no nível do alerta.
5. Configurações avançadas
A tarefa de sincronização fornece vários parâmetros modificáveis conforme necessário.
Antes de fazer alterações, certifique-se de compreender totalmente a função de cada parâmetro para evitar erros inesperados ou problemas de qualidade de dados.
clique em advanced settings no canto superior direito da página para abrir a página de configurações avançadas.
Na página advanced settings, modifique os valores dos parâmetros conforme necessário.
Etapa 6: configure capacidade DDL
A fonte de dados de source pode conter várias operações DDL. Com base nos seus requisitos de negócios, clique em DDL Capability Configuration no canto superior direito da página para acesse a página de configuração de capacidade DDL e defina políticas de processamento para diferentes mensagens DDL a serem sincronizadas com o destino.
Para mais informações sobre diferentes políticas de processamento de mensagens DDL, consulte DDL message processing rules.
Etapa 7: configure um grupo de recursos
clique em Configure Resource Group no canto superior direito para visualize e alternar o grupo de recursos atual da tarefa.
Etapa 8: execute uma simulação
Após configure a tarefa, clique em Dry Run no canto superior direito. Esse recurso simula toda a tarefa em uma pequena amostra de dados e permite visualize os resultados na tabela de destino. Se houver erros de configuração, exceções de tempo de execução ou dados incorretos, você receberá mensagens de erro em tempo real. Isso ajuda a verifique rapidamente se a tarefa está configurada corretamente e produz os resultados esperados.
Na caixa de diálogo, defina os parâmetros de amostragem: Start Time e Number of Sample Records.
clique em Start Sampling para coletar os dados de amostra.
clique em Preview para simular todo o processamento da tarefa usando os dados amostrados.
Etapa 9: execute a tarefa de sincronização
Após concluir todas as configurações, clique em Complete na parte inferior da página.
Na página , localize a tarefa criada e clique em Start na coluna Operations.
clique em no Name/ID da tarefa correspondente na Task List para visualize seu processo detalhado de execução.
gerencie a tarefa de sincronização
visualize o status da tarefa
Após crie uma tarefa de sincronização, visualize o status e os detalhes da tarefa na página de tarefas de sincronização.
Na coluna Start, é possível Stop ou Stop uma tarefa. Operações adicionais, como Edit e View, estão disponíveis na opção "More".
Para uma tarefa em execução, verifique seu status geral na coluna Execution Overview ou clique em na área de visão geral para visualize informações detalhadas da execução.
Uma tarefa de sincronização em tempo real de tabela única do Kafka para o OSS inclui dois estágios:
Schema Migration: Mostra como a tabela de destino foi criada (a partir de uma tabela existente ou por criação automática). Se você optar por crie a tabela automaticamente, o sistema exibirá a instrução DDL utilizada.
Real-time Data Synchronization: Exibe estatísticas sobre a sincronização em tempo real, incluindo informações de tempo de execução, registros DDL e alertas.
Reexecute uma tarefa
Em casos especiais, como quando é necessário modifique campos sincronizados ou ajustar informações da tabela de destino, clique em Rerun na coluna Operations da tarefa de sincronização. Essa ação sincroniza os campos ajustados e outras alterações com o destino. O processo ignora tabelas inalteradas e previamente sincronizadas.
Para execute a tarefa novamente sem alterações, clique em Rerun.
Se você edite a tarefa, clique em Complete após fazer as alterações. A ação da tarefa muda para Apply Updates. clique em em Apply Updates reexecuta a tarefa com a nova configuração.