Este tópico descreve a configuração da fonte de dados, a conectividade de rede e a criação da tarefa de sincronização em lote para carregar dados de uma única tabela do OSS no MaxCompute.
Visão geral do OSS
O Alibaba Cloud OSS oferece durabilidade de dados de 99,9999999999% (doze noves) e disponibilidade de 99,995%, com várias classes de armazenamento para otimização de custos. O Data Integration permite sincronizar dados entre o OSS e outras fontes ou destinos.
Obter informações do bucket do OSS
No console do OSS, localize o bucket de destino e anote os endpoints público e interno na página de visão geral do bucket.
O endpoint público permite acesso pela internet. O tráfego de entrada (gravações) é gratuito; o tráfego de saída (leituras) gera cobranças conforme descrito em Preços do OSS e Itens de faturamento.
O endpoint interno conecta produtos da Alibaba Cloud na mesma região sem cobrança de tráfego. Use o endpoint interno quando o bucket do OSS e o grupo de recursos do Data Integration estiverem na mesma região; caso contrário, use o endpoint público.
Consulte também Regiões e endpoints.
Pré-requisitos
Você adquiriu um grupo de recursos serverless.
As fontes de dados OSS e MaxCompute estão configuradas. Consulte Configure uma fonte de dados.
A conectividade de rede entre o grupo de recursos e as fontes de dados está estabelecida. Consulte Configuração de conectividade de rede.
Limitações
Não há suporte para sincronização de dados de source para tabelas externas do MaxCompute.
Procedimento
Este tutorial utiliza a interface do Data Studio (nova versão).
Etapa 1: Crie um nó e uma tarefa
Crie um nó de sincronização em lote seguindo as instruções em Configuração de UI sem código.
Etapa 2: Configure a origem e o destino
Configure a origem (OSS)
Configure os seguintes parâmetros de origem do OSS.
|
Parâmetro |
Descrição |
|
File Type |
Selecione o tipo de arquivo a ser sincronizado. A UI sem código suporta leitura de arquivos nos formatos |
|
File Path |
Insira o caminho do arquivo de origem.
|
|
Field Delimiter |
Delimitador de colunas usado no arquivo. |
|
Encoding |
Codificação de caracteres para leitura do arquivo de origem. |
|
Null String |
|
|
Compression Format |
Formato de compressão. Opções suportadas: |
|
Skip Header |
Define se a linha de cabeçalho em arquivos semelhantes a CSV deve ser ignorada. Padrão: cabeçalho incluído. Nota
Não há suporte para ignorar o cabeçalho em arquivos compactados. |
|
Table Data Structure |
Após configurar os parâmetros da fonte de dados, clique em Confirm Data Structure para verifique o formato dos dados. |
Configure o destino (MaxCompute)
Configure os seguintes parâmetros de destino do MaxCompute.
Os parâmetros não listados abaixo podem manter os valores padrão.
|
Parâmetro |
Descrição |
|
Tunnel Resource Group |
Recurso de transferência de dados do MaxCompute (Tunnel Quota). O padrão é a cota pública gratuita. Se uma Tunnel Quota exclusiva ficar indisponível devido a pagamentos atrasados ou expiração, a tarefa retornará automaticamente à cota pública. |
|
Table |
Selecione a tabela de destino no MaxCompute. Em um workspace padrão, garanta que exista uma tabela com o mesmo nome e esquema tanto nos ambientes de desenvolvimento quanto de produção. Alternativamente, clique em Generate Destination Table Schema para criar automaticamente uma tabela de destino e ajustar o DDL conforme necessário. Nota
Considere os seguintes pontos:
|
|
Partition Information |
Valores das colunas de partição para tabelas de destino particionadas.
|
|
Write Method |
Limpa os dados existentes ou anexa novos dados à tabela de destino. |
Etapa 3: Configure o mapeamento de campos
Mapeie as colunas entre origem e destino usando Map Fields with the Same Name, Map Fields in the Same Line, Delete All Mappings ou Edit Field Mappings.
Etapa 4: Configure definições avançadas
Configure opções avançadas, como Expected Maximum Concurrency e Policy for Dirty Data Records. Para este tutorial, defina a Policy for Dirty Data Records como Disallow Dirty Data Records e mantenha os padrões para as demais configurações. Consulte Configuração de UI sem código.
Etapa 5: Configure e execute a tarefa de depuração
Clique em Run Configuration, defina o Resource Group e os Script Parameters para a execução de depuração e clique em Run para testar a tarefa.
-
No painel de navegação à esquerda, clique em
e clique no novo ícone ao lado de Personal Directory para criar um arquivo SQL. Execute a consulta abaixo para verifique os dados na tabela de destino.NotaAntes de executar esta consulta, vincule o projeto do MaxCompute de destino como mecanismo de computação para o DataWorks.
No editor de arquivos
.sql, clique em Run Configuration no lado direito. Especifique o Type da fonte de dados, os Computing Resources e o Resource Group e clique em Run na barra de ferramentas superior.
SELECT * FROM <your_maxcompute_table_name> WHERE pt=<your_partition> LIMIT 20;
Etapa 6: Configure o agendamento e publicar a tarefa
No painel direito, clique em Scheduling Settings para definir os parâmetros de agendamento. Em seguida, clique em Publish para publicar a tarefa.