Todos os produtos
Search
Central de documentação

DataWorks:Sincronizar uma única tabela do OSS para o MaxCompute

Última atualização: Jun 27, 2026

Este tópico descreve a configuração da fonte de dados, a conectividade de rede e a criação da tarefa de sincronização em lote para carregar dados de uma única tabela do OSS no MaxCompute.

Visão geral do OSS

O Alibaba Cloud OSS oferece durabilidade de dados de 99,9999999999% (doze noves) e disponibilidade de 99,995%, com várias classes de armazenamento para otimização de custos. O Data Integration permite sincronizar dados entre o OSS e outras fontes ou destinos.

Obter informações do bucket do OSS

No console do OSS, localize o bucket de destino e anote os endpoints público e interno na página de visão geral do bucket.

  • O endpoint público permite acesso pela internet. O tráfego de entrada (gravações) é gratuito; o tráfego de saída (leituras) gera cobranças conforme descrito em Preços do OSS e Itens de faturamento.

  • O endpoint interno conecta produtos da Alibaba Cloud na mesma região sem cobrança de tráfego. Use o endpoint interno quando o bucket do OSS e o grupo de recursos do Data Integration estiverem na mesma região; caso contrário, use o endpoint público.

  • Consulte também Regiões e endpoints.

Pré-requisitos

Limitações

Não há suporte para sincronização de dados de source para tabelas externas do MaxCompute.

Procedimento

Nota

Este tutorial utiliza a interface do Data Studio (nova versão).

Etapa 1: Crie um nó e uma tarefa

Crie um nó de sincronização em lote seguindo as instruções em Configuração de UI sem código.

Etapa 2: Configure a origem e o destino

Configure a origem (OSS)

Configure os seguintes parâmetros de origem do OSS.

Parâmetro

Descrição

File Type

Selecione o tipo de arquivo a ser sincronizado. A UI sem código suporta leitura de arquivos nos formatos csv, text, orc e parquet.

File Path

Insira o caminho do arquivo de origem.

  • Um único caminho de objeto usa uma thread para extração.

  • Vários caminhos de objetos usam múltiplas threads. Ajuste a concorrência conforme necessário.

  • Caracteres curinga correspondem a vários objetos. Por exemplo, abc*[0-9] corresponde a abc0, abc1, abc2 e abc3. Já abc?.txt corresponde a arquivos que começam com abc, terminam com .txt e têm exatamente um caractere entre eles.

Field Delimiter

Delimitador de colunas usado no arquivo.

Encoding

Codificação de caracteres para leitura do arquivo de origem.

Null String

  • Não processar: os valores de origem permanecem inalterados.

  • Caracteres visíveis: insira uma string que represente nulo. Um campo vazio é tratado como string vazia.

  • Caracteres invisíveis: insira um código Unicode (\u001b, \u007c) ou caractere de escape (\t). Campo obrigatório.

Compression Format

Formato de compressão. Opções suportadas: Gzip, Bzip2, Zip ou sem compressão.

Skip Header

Define se a linha de cabeçalho em arquivos semelhantes a CSV deve ser ignorada. Padrão: cabeçalho incluído.

Nota

Não há suporte para ignorar o cabeçalho em arquivos compactados.

Table Data Structure

Após configurar os parâmetros da fonte de dados, clique em Confirm Data Structure para verifique o formato dos dados.

Configure o destino (MaxCompute)

Configure os seguintes parâmetros de destino do MaxCompute.

Nota

Os parâmetros não listados abaixo podem manter os valores padrão.

Parâmetro

Descrição

Tunnel Resource Group

Recurso de transferência de dados do MaxCompute (Tunnel Quota). O padrão é a cota pública gratuita. Se uma Tunnel Quota exclusiva ficar indisponível devido a pagamentos atrasados ou expiração, a tarefa retornará automaticamente à cota pública.

Table

Selecione a tabela de destino no MaxCompute. Em um workspace padrão, garanta que exista uma tabela com o mesmo nome e esquema tanto nos ambientes de desenvolvimento quanto de produção.

Alternativamente, clique em Generate Destination Table Schema para criar automaticamente uma tabela de destino e ajustar o DDL conforme necessário.

Nota

Considere os seguintes pontos:

  • Se a tabela não existir no ambiente de desenvolvimento, ela não aparecerá na lista de tabelas de destino.

  • Caso a tabela não exista no ambiente de produção, a tarefa publicada falhará.

  • Esquemas inconsistentes entre desenvolvimento e produção podem causar incompatibilidades no mapeamento de colunas e gravações incorretas de dados durante a execução.

Partition Information

Valores das colunas de partição para tabelas de destino particionadas.

  • Valor fixo, como ds=20220101.

  • Parâmetro de agendamento, como ds=${bizdate}, substituído pelos valores reais durante a execução.

Write Method

Limpa os dados existentes ou anexa novos dados à tabela de destino.

Etapa 3: Configure o mapeamento de campos

Mapeie as colunas entre origem e destino usando Map Fields with the Same Name, Map Fields in the Same Line, Delete All Mappings ou Edit Field Mappings.

Etapa 4: Configure definições avançadas

Configure opções avançadas, como Expected Maximum Concurrency e Policy for Dirty Data Records. Para este tutorial, defina a Policy for Dirty Data Records como Disallow Dirty Data Records e mantenha os padrões para as demais configurações. Consulte Configuração de UI sem código.

Etapa 5: Configure e execute a tarefa de depuração

  1. Clique em Run Configuration, defina o Resource Group e os Script Parameters para a execução de depuração e clique em Run para testar a tarefa.

  2. No painel de navegação à esquerda, clique em image e clique no novo ícone ao lado de Personal Directory para criar um arquivo SQL. Execute a consulta abaixo para verifique os dados na tabela de destino.

    Nota
    SELECT * FROM <your_maxcompute_table_name> WHERE pt=<your_partition> LIMIT 20;

Etapa 6: Configure o agendamento e publicar a tarefa

No painel direito, clique em Scheduling Settings para definir os parâmetros de agendamento. Em seguida, clique em Publish para publicar a tarefa.