Todos os produtos
Search
Central de documentação

DataHub:Início rápido (exemplo de sincronização)

Última atualização: Jun 28, 2026

Etapa 1: Ativar o serviço DataHub

  1. Faça login no console do DataHub.

  2. Siga as instruções na tela para ativar o serviço.

Etapa 2: Criar um Project e um Topic

  1. Faça login no console do DataHub.

  2. Clique em Create Project. Na caixa de diálogo, defina o Name (deve começar com uma letra, ter de 3 a 32 caracteres e conter apenas letras, dígitos e sublinhados) e a Description (até 1.024 caracteres). Em seguida, clique em Create.

Parâmetro

Descrição

Project

Unidade organizacional básica no DataHub que contém um ou mais Topics. Os Projects do DataHub são independentes dos projetos do MaxCompute; portanto, crie um Project separado no DataHub.

Description

Descrição do Project.

3 . Na página Project Details, clique em Create Topic. Na caixa de diálogo New Topic, em Creation Method, selecione Create Directly ou Import MaxCompute table schema.

Parâmetro

Descrição

Creation Method

Crie um Topic do zero ou importe o esquema de uma tabela existente do MaxCompute.

Name

Nome do Topic.

Type

Tipo do Topic. TUPLE representa dados estruturados; BLOB representa dados não estruturados.

Schema Details

Exibido ao selecionar TUPLE. Defina os campos conforme necessário. Se um campo permitir NULL, valores ausentes na origem assumirão NULL como padrão. Se NULL não for permitido, o DataHub aplicará validação rigorosa e reportará erro em caso de incompatibilidade de tipo.

Number of Shards

Canal simultâneo para transmissão de dados dentro de um Topic. Cada Shard possui um ID e um estado, como Opening ou Active. Como cada Shard ativo consome recursos do servidor, aloque apenas a quantidade necessária.

Lifecycle

Período de retenção de dados do Topic, em dias (1–7). Para alterar esse valor, use o SDK para Java.

Description

Descrição do Topic.

Etapa 3: Gravar dados

O DataHub oferece suporte a vários métodos de ingestão de dados: Flume para logs, DTS ou Canal para bancos de dados e SDKs. Este exemplo usa a ferramenta de console para carregar um arquivo.

  1. Baixe e descompacte o pacote da ferramenta de console. Configure o par de AccessKey e o endpoint. Consulte a documentação da ferramenta de linha de comando do console.

  2. Use o comando uf para carregar o arquivo.

    uf -f /temp/test.csv -p test_topic -t test_topic -m "," -n 1000
  3. Verifique se os dados foram gravados. Confira o horário da última gravação e o volume total de dados na aba Shard List da página Topic Details.

  4. Use Sample data para verificar a qualidade dos dados.

    1. Selecione o Shard e o horário inicial para amostragem.

    2. Clique em Sample para visualizar os dados.

Na caixa de diálogo de amostragem, defina o Sample Count (padrão: 20) e use Select Filter Fields para filtrar por campos específicos.

Etapa 4: Sincronizar dados

Este exemplo demonstra como sincronizar dados com o MaxCompute.

  1. Acesse a página Project List/Project Details/Topic Details.

  2. No canto superior direito, clique em + Sync para criar uma tarefa de sincronização.

  3. Selecione o tipo de job do MaxCompute:

    1) Para sincronização do tipo TUPLE, configure os seguintes parâmetros na caixa de diálogo New Connector: Project Name, Table Name, AccessKey ID, AccessKey Secret, Fields to Import, Partitioning Mode, Partition Configuration, Partition Interval, Time Zone, Start Time e TimestampUnit. Ao terminar, clique em Create.

Notas sobre configurações selecionadas:

Os principais parâmetros de configuração para tarefas de sincronização via console estão descritos abaixo. Para opções avançadas, use o SDK.

  1. Fields to Import

    Sincronize apenas colunas específicas com uma tabela do MaxCompute.

  2. Partitioning Mode

    Define qual partição do MaxCompute receberá os dados. Modos compatíveis:

Modo de particionamento

Base da partição

Tipos compatíveis

Descrição

USER_DEFINE

Valor da coluna de partição no registro. O nome da coluna deve corresponder ao campo de partição do MaxCompute.

TUPLE

(1) O esquema do DataHub deve incluir os campos de partição do MaxCompute. (2) O valor desta coluna deve ser uma string UTF-8 não vazia.

SYSTEM_TIME

Momento em que o registro é gravado no DataHub.

TUPLE / BLOB

(1) Em Partition Configuration, defina o formato para converter o timestamp em uma partição do MaxCompute. (2) Defina o fuso horário.

EVENT_TIME

Valor da coluna event_time (TIMESTAMP) no registro.

TUPLE

(1) Em Partition Configuration, defina o formato para converter o timestamp em uma partição do MaxCompute. (2) Defina o fuso horário.

META_TIME

Valor do campo de atributo __dh_meta_time__ no registro.

TUPLE / BLOB

(1) Em Partition Configuration, defina o formato para converter o timestamp em uma partição do MaxCompute. (2) Defina o fuso horário.

Os modos SYSTEM_TIME, EVENT_TIME e META_TIME usam um timestamp e um fuso horário para determinar a partição do MaxCompute. A unidade de timestamp padrão é microssegundos.

  1. A configuração de partição converte um timestamp em uma partição do MaxCompute. Por padrão, o console usa um formato de partição fixo:

Partição

Formato de hora

Descrição

ds

%Y%m%d

Dia

hh

%H

Hora

mm

%M

Minuto

  1. Intervalo de tempo para conversão de timestamps em partições do MaxCompute. Faixa: 15 minutos a 1.440 minutos (1 dia), em incrementos de 15 minutos.

  2. Fuso horário usado para converter timestamps em partições do MaxCompute.

  3. Para dados BLOB, especifique um delimitador hexadecimal para dividir os registros antes de sincronizar com o MaxCompute. Por exemplo, 0A representa o caractere de nova linha (\n).

  4. O DataHub armazena dados BLOB como binário, mas a coluna do MaxCompute usa o tipo STRING. Por padrão, o console codifica os dados BLOB em Base64 antes da sincronização. Para opções avançadas, use o SDK.

Etapa 5: Visualizar a tarefa de sincronização

A página de detalhes do Connector exibe o status da tarefa, informações de checkpoint e métricas de monitoramento, como Sync Latency, DoneTime e Dirty Data Count. Você pode reiniciar ou parar a tarefa e gerencie os Sync Task Fields. As atualizações entram em vigor imediatamente.

Consulte Criar uma tarefa para sincronizar dados com o MaxCompute.