Etapa 1: Ativar o serviço DataHub
Faça login no console do DataHub.
Siga as instruções na tela para ativar o serviço.
Etapa 2: Criar um Project e um Topic
Faça login no console do DataHub.
Clique em Create Project. Na caixa de diálogo, defina o Name (deve começar com uma letra, ter de 3 a 32 caracteres e conter apenas letras, dígitos e sublinhados) e a Description (até 1.024 caracteres). Em seguida, clique em Create.
|
Parâmetro |
Descrição |
|
Project |
Unidade organizacional básica no DataHub que contém um ou mais Topics. Os Projects do DataHub são independentes dos projetos do MaxCompute; portanto, crie um Project separado no DataHub. |
|
Description |
Descrição do Project. |
3 . Na página Project Details, clique em Create Topic. Na caixa de diálogo New Topic, em Creation Method, selecione Create Directly ou Import MaxCompute table schema.
|
Parâmetro |
Descrição |
|
Creation Method |
Crie um Topic do zero ou importe o esquema de uma tabela existente do MaxCompute. |
|
Name |
Nome do Topic. |
|
Type |
Tipo do Topic. |
|
Schema Details |
Exibido ao selecionar |
|
Number of Shards |
Canal simultâneo para transmissão de dados dentro de um Topic. Cada Shard possui um ID e um estado, como |
|
Lifecycle |
Período de retenção de dados do Topic, em dias (1–7). Para alterar esse valor, use o SDK para Java. |
|
Description |
Descrição do Topic. |
Etapa 3: Gravar dados
O DataHub oferece suporte a vários métodos de ingestão de dados: Flume para logs, DTS ou Canal para bancos de dados e SDKs. Este exemplo usa a ferramenta de console para carregar um arquivo.
Baixe e descompacte o pacote da ferramenta de console. Configure o par de AccessKey e o endpoint. Consulte a documentação da ferramenta de linha de comando do console.
-
Use o comando
ufpara carregar o arquivo.uf -f /temp/test.csv -p test_topic -t test_topic -m "," -n 1000 Verifique se os dados foram gravados. Confira o horário da última gravação e o volume total de dados na aba Shard List da página Topic Details.
-
Use Sample data para verificar a qualidade dos dados.
Selecione o Shard e o horário inicial para amostragem.
Clique em Sample para visualizar os dados.
Na caixa de diálogo de amostragem, defina o Sample Count (padrão: 20) e use Select Filter Fields para filtrar por campos específicos.
Etapa 4: Sincronizar dados
Este exemplo demonstra como sincronizar dados com o MaxCompute.
Acesse a página
Project List/Project Details/Topic Details.No canto superior direito, clique em
+ Syncpara criar uma tarefa de sincronização.-
Selecione o tipo de job do MaxCompute:
1) Para sincronização do tipo
TUPLE, configure os seguintes parâmetros na caixa de diálogo New Connector: Project Name, Table Name, AccessKey ID, AccessKey Secret, Fields to Import, Partitioning Mode, Partition Configuration, Partition Interval, Time Zone, Start Time e TimestampUnit. Ao terminar, clique em Create.
Notas sobre configurações selecionadas:
Os principais parâmetros de configuração para tarefas de sincronização via console estão descritos abaixo. Para opções avançadas, use o SDK.
-
Fields to Import
Sincronize apenas colunas específicas com uma tabela do MaxCompute.
-
Partitioning Mode
Define qual partição do MaxCompute receberá os dados. Modos compatíveis:
|
Modo de particionamento |
Base da partição |
Tipos compatíveis |
Descrição |
|
USER_DEFINE |
Valor da coluna de partição no registro. O nome da coluna deve corresponder ao campo de partição do MaxCompute. |
TUPLE |
(1) O esquema do DataHub deve incluir os campos de partição do MaxCompute. (2) O valor desta coluna deve ser uma |
|
SYSTEM_TIME |
Momento em que o registro é gravado no DataHub. |
TUPLE / BLOB |
(1) Em Partition Configuration, defina o formato para converter o timestamp em uma partição do MaxCompute. (2) Defina o fuso horário. |
|
EVENT_TIME |
Valor da coluna |
TUPLE |
(1) Em Partition Configuration, defina o formato para converter o timestamp em uma partição do MaxCompute. (2) Defina o fuso horário. |
|
META_TIME |
Valor do campo de atributo |
TUPLE / BLOB |
(1) Em Partition Configuration, defina o formato para converter o timestamp em uma partição do MaxCompute. (2) Defina o fuso horário. |
Os modos SYSTEM_TIME, EVENT_TIME e META_TIME usam um timestamp e um fuso horário para determinar a partição do MaxCompute. A unidade de timestamp padrão é microssegundos.
A configuração de partição converte um timestamp em uma partição do MaxCompute. Por padrão, o console usa um formato de partição fixo:
|
Partição |
Formato de hora |
Descrição |
|
ds |
%Y%m%d |
Dia |
|
hh |
%H |
Hora |
|
mm |
%M |
Minuto |
Intervalo de tempo para conversão de timestamps em partições do MaxCompute. Faixa:
15 minutos a 1.440 minutos (1 dia), em incrementos de15 minutos.Fuso horário usado para converter timestamps em partições do MaxCompute.
Para dados BLOB, especifique um delimitador hexadecimal para dividir os registros antes de sincronizar com o MaxCompute. Por exemplo,
0Arepresenta o caractere de nova linha (\n).O DataHub armazena dados BLOB como binário, mas a coluna do MaxCompute usa o tipo STRING. Por padrão, o console codifica os dados BLOB em Base64 antes da sincronização. Para opções avançadas, use o SDK.
Etapa 5: Visualizar a tarefa de sincronização
A página de detalhes do Connector exibe o status da tarefa, informações de checkpoint e métricas de monitoramento, como Sync Latency, DoneTime e Dirty Data Count. Você pode reiniciar ou parar a tarefa e gerencie os Sync Task Fields. As atualizações entram em vigor imediatamente.
Consulte Criar uma tarefa para sincronizar dados com o MaxCompute.