Todos os produtos
Search
Central de documentação

DataWorks:Sincronizar uma única tabela do Kafka para um data lake do OSS

Última atualização: Jul 20, 2026

O Data Integration oferece suporte à sincronização em tempo real de fontes de tabela única, como Kafka e LogHub, para o OSS. Este exemplo utiliza o Kafka como source e o OSS como destino.

Limitações

A versão do Kafka deve estar entre 0.10.2 e 2.2.0 (inclusive).

Pré-requisitos

Procedimento

Etapa 1: Selecione um tipo de tarefa de sincronização

  1. Faça login no console do DataWorks. Na região de destino, clique em Data Integration > Data Integration no painel de navegação à esquerda. Selecione um workspace na lista suspensa e clique em Go to Data Integration.

  2. No painel de navegação à esquerda, clique em Synchronization Task. Em seguida, clique em Create Synchronization Task na parte superior da página. Na página de criação de tarefas, defina os seguintes parâmetros:

    • Source and destination: KafkaOSS

    • New Node Name: insira um nome personalizado para a tarefa de sincronização.

    • Synchronization Method: single-table real-time.

Etapa 2: configure rede e recursos

  1. Na seção Network and Resource Configuration, selecione o Resource Group para a tarefa de sincronização. Aloque o Task Resource Usage em CUs para a tarefa.

  2. Em Source Information, selecione sua fonte de dados kafka. Para o Destination, selecione sua fonte de dados OSS. Depois, clique em Test Connectivity.

  3. Após as fontes de dados de source e destino passarem no teste de conectividade, clique em Next.

Etapa 3: configure o link de sincronização

1. configure a source Kafka

Na parte superior da página, clique no nó de source Kafka para configure as Source Information.

image

  1. Na seção Source Information, selecione o tópico a ser sincronizado no cluster do Kafka.

    Use os valores padrão para outros parâmetros ou modifique-os conforme necessário.

  2. No canto superior direito, clique em Data Sampling.

    Na caixa de diálogo exibida, especifique o Start Time e o Number of Sample Records e, em seguida, clique em Start Sampling. Isso permite amostrar e visualize dados do tópico especificado do Kafka. Os dados amostrados servem de entrada para visualizações de dados e configurações visuais nos nós subsequentes de processamento de dados.

  3. Na seção Output Field Configuration, selecione os campos a serem sincronizados.

2. edite nós de processamento de dados

clique em no ícone image para adicionar um método de processamento de dados. Existem cinco métodos disponíveis: data masking, string replacement, data filtering, JSON parsing e field editing and assignment. Organize esses métodos em qualquer ordem. A tarefa processa os dados sequencialmente na ordem configurada durante a execução.

Após configure cada nó de processamento, clique em Output Preview no canto superior direito. Na caixa de diálogo, clique em Retrieve Upstream Output para simular como o nó atual processa os dados amostrados e visualize a saída.

A caixa de diálogo Preview Data Output possui duas seções: Input Data e Preview Result. A seção Input Data exibe os dados do Kafka amostrados obtidos ao clique em Re-obtain Output Of Ancestor Node. Clique também em + Manually Add Data para adicionar dados de teste. A tabela inclui campos como _key_, _value_, _partition_, _offset_ e timestamp. Em Preview Result, clique em Preview para visualize a saída processada e a contagem de dados incorretos. O resultado da pré-visualização serve apenas como referência e pode diferir da execução real da tarefa.

Nota

O recurso de pré-visualização de saída de dados depende do Data Sampling da source Kafka. Realize a amostragem de dados na configuração da source Kafka antes de visualize a saída.

3. configure o destino OSS

Na parte superior da página, clique no nó de destino OSS para configure as OSS Destination Information.

  1. Na seção OSS Destination Information, configure as informações básicas do destino OSS.

    • Write Format: Os formatos suportados incluem Hudi, Paimon e Iceberg.

    • Location for Creating Metadatabase: Se o Data Lake Formation (DLF) estiver ativado para sua conta, o sistema cria automaticamente o metadatabase e as metatabelas correspondentes no DLF quando os dados são sincronizados com o data lake.

      Nota

      Não há suporte para criação de metadados entre regiões.

    • Select Storage Path: Selecione o caminho do OSS para armazenar os dados no data lake.

    • Target Database: Selecione o banco de dados de destino para os dados. Selecione também Create Database para crie um metadatabase do DLF e especifique um Database Name.

    • Destination Table: escolha entre Create tables automatically ou Use Existing Table para gravar dados em uma tabela do OSS.

    • Table Name: insira ou selecione o nome da tabela do OSS onde os dados serão gravados.

  2. (Opcional) edite o esquema da tabela.

    Ao selecione Create tables automatically, clique em no botão Edit Table Schema para edite a estrutura da tabela de destino na caixa de diálogo. Clique também em Regenerate Schema from Upstream Node para gerar automaticamente a estrutura da tabela a partir das colunas de saída do nó upstream. Na estrutura gerada, selecione uma coluna para defina como chave primária.

  3. configure o mapeamento de campos.

    O sistema gera automaticamente mapeamentos entre colunas upstream e colunas de destino com base no princípio de The same name mapping. Ajuste esses mapeamentos conforme necessário. Uma única coluna upstream pode ser mapeada para várias colunas de destino, mas várias colunas upstream não podem ser mapeadas para uma única coluna de destino. Se uma coluna upstream não for mapeada para uma coluna de destino, seus dados não serão gravados na tabela de destino.

4. Alertas

Para evitar que erros na tarefa causem atrasos na sincronização de dados comerciais, defina uma política de alertas para a tarefa de sincronização.

  1. clique em Alert Settings no canto superior direito da página para abrir a página de configurações Alert Rule Configurations for Real-time Synchronization Subnode.

  2. clique em Add Alert Rule para configure uma regra de alerta.

    Nota

    As regras de alerta definidas aqui se aplicam às subtarefas de sincronização em tempo real geradas por esta tarefa. Após configure a tarefa, visualize e modifique as regras de alerta para essas subtarefas na página execute e gerencie real-time synchronization tasks.

  3. gerencie as regras de alerta.

    Para regras de alerta existentes, use o interruptor para ative-las ou desativá-las. Envie alertas para diferentes destinatários com base no nível do alerta.

5. Configurações avançadas

A tarefa de sincronização fornece vários parâmetros modificáveis conforme necessário.

Nota

Antes de fazer alterações, certifique-se de compreender totalmente a função de cada parâmetro para evitar erros inesperados ou problemas de qualidade de dados.

  1. clique em advanced settings no canto superior direito da página para abrir a página de configurações avançadas.

  2. Na página advanced settings, modifique os valores dos parâmetros conforme necessário.

Etapa 6: configure capacidade DDL

A fonte de dados de source pode conter várias operações DDL. Com base nos seus requisitos de negócios, clique em DDL Capability Configuration no canto superior direito da página para acesse a página de configuração de capacidade DDL e defina políticas de processamento para diferentes mensagens DDL a serem sincronizadas com o destino.

Nota

Para mais informações sobre diferentes políticas de processamento de mensagens DDL, consulte DDL message processing rules.

Etapa 7: configure um grupo de recursos

clique em Configure Resource Group no canto superior direito para visualize e alternar o grupo de recursos atual da tarefa.

Etapa 8: execute uma simulação

Após configure a tarefa, clique em Dry Run no canto superior direito. Esse recurso simula toda a tarefa em uma pequena amostra de dados e permite visualize os resultados na tabela de destino. Se houver erros de configuração, exceções de tempo de execução ou dados incorretos, você receberá mensagens de erro em tempo real. Isso ajuda a verifique rapidamente se a tarefa está configurada corretamente e produz os resultados esperados.

  1. Na caixa de diálogo, defina os parâmetros de amostragem: Start Time e Number of Sample Records.

  2. clique em Start Sampling para coletar os dados de amostra.

  3. clique em Preview para simular todo o processamento da tarefa usando os dados amostrados.

Etapa 9: execute a tarefa de sincronização

  1. Após concluir todas as configurações, clique em Complete na parte inferior da página.

  2. Na página Data Integration > Synchronization Task, localize a tarefa criada e clique em Start na coluna Operations.

  3. clique em no Name/ID da tarefa correspondente na Task List para visualize seu processo detalhado de execução.

gerencie a tarefa de sincronização

visualize o status da tarefa

Após crie uma tarefa de sincronização, visualize o status e os detalhes da tarefa na página de tarefas de sincronização.

  • Na coluna Start, é possível Stop ou Stop uma tarefa. Operações adicionais, como Edit e View, estão disponíveis na opção "More".

  • Para uma tarefa em execução, verifique seu status geral na coluna Execution Overview ou clique em na área de visão geral para visualize informações detalhadas da execução.

Uma tarefa de sincronização em tempo real de tabela única do Kafka para o OSS inclui dois estágios:

  • Schema Migration: Mostra como a tabela de destino foi criada (a partir de uma tabela existente ou por criação automática). Se você optar por crie a tabela automaticamente, o sistema exibirá a instrução DDL utilizada.

  • Real-time Data Synchronization: Exibe estatísticas sobre a sincronização em tempo real, incluindo informações de tempo de execução, registros DDL e alertas.

Reexecute uma tarefa

Em casos especiais, como quando é necessário modifique campos sincronizados ou ajustar informações da tabela de destino, clique em Rerun na coluna Operations da tarefa de sincronização. Essa ação sincroniza os campos ajustados e outras alterações com o destino. O processo ignora tabelas inalteradas e previamente sincronizadas.

  • Para execute a tarefa novamente sem alterações, clique em Rerun.

  • Se você edite a tarefa, clique em Complete após fazer as alterações. A ação da tarefa muda para Apply Updates. clique em em Apply Updates reexecuta a tarefa com a nova configuração.