O recurso Data Upload no DataWorks permite carregar dados de diversas origens, como arquivos locais, planilhas do Data Analysis, arquivos do OSS e arquivos HTTP, para engines como MaxCompute, EMR Hive, Hologres e StarRocks, possibilitando análise e gerenciamento. Esse serviço prático de transferência de dados ajuda a impulsionar rapidamente seus negócios com dados. Este tópico descreve como utilizar o recurso Data Upload para carregar dados.
Observações
Se suas operações envolverem transferências internacionais de dados (por exemplo, da China continental para um local fora da China continental ou entre diferentes países ou regiões), leia e compreenda primeiro a declaração de conformidade relacionada. Caso contrário, o upload pode falhar e você poderá enfrentar responsabilidade legal.
Antes de carregar dados, recomendamos usar cabeçalhos em inglês no arquivo de source. Cabeçalhos em chinês podem causar falhas de análise e resultar na falha do upload.
Limitações
-
Limitações de grupo de recursos: O recurso Data Upload exige a especificação de um grupo de recursos para agendamento e um grupo de recursos para Data Integration.
Este recurso suporta apenas um grupo de recursos serverless (recomendado), um grupo de recursos exclusivo para agendamento e um grupo de recursos exclusivo para Data Integration. Configure um grupo de recursos para agendamento e um grupo de recursos para Data Integration para a respectiva engine em .
-
O grupo de recursos selecionado deve estar associado ao workspace do DataWorks que contém a tabela de destino. Garanta também a conectividade de rede entre o grupo de recursos selecionado e a fonte de dados usada na tarefa de upload.
NotaPara configure o grupo de recursos para uma engine no Data Analysis, consulte System management.
Para estabelecer conectividade de rede entre uma fonte de dados e um grupo de recursos, consulte Network connectivity solutions.
Para associar um grupo de recursos exclusivo ao workspace designado, consulte Use exclusive resource groups for scheduling e Use an exclusive resource group for Data Integration.
-
Permissões necessárias para upload de dados:
Tabelas do MaxCompute (tabelas ODPS): Basta ser o proprietário da tabela. Não é necessária a função de desenvolvedor, analista ou operador no workspace do DataWorks.
-
Tabelas não pertencentes ao MaxCompute (como Hologres, EMR Hive e StarRocks): Além de ser o proprietário da tabela, você deve ter uma função atribuída no workspace do DataWorks.
Tabelas no ambiente de desenvolvimento: A função de desenvolvedor é obrigatória.
Tabelas no ambiente de produção: A função de operador é obrigatória.
Limitações de tipo de tabela: O upload de dados é permitido apenas para tabelas internas ou tabelas sob o catálogo padrão (aplicável ao StarRocks).
Taxas de transferência de dados.
Caso novas tabelas sejam criadas, serão cobradas taxas de computação e armazenamento.
-
Faça login no console do DataWorks. Na região de destino, clique em no painel de navegação à esquerda. Clique em Go to Data Upload and Download.
Clique no ícone
no painel de navegação à esquerda para acessar a página Upload Data.Clique em Upload Data e siga as instruções na tela para carregar os dados.
Yes: Se o sistema detectar dados incorretos, ele os ignorará automaticamente e continuará o upload.
No: Se o sistema detectar dados incorretos, ele não os ignorará e o upload será interrompido.
Defina Data Source como Local File.
-
Specify Data to Be Uploaded: Siga as instruções na tela para arrastar o arquivo local até a área Select File.
NotaOs seguintes formatos são suportados:
CSV,XLS,XLSXeJSON. O tamanho máximo de dados para um arquivoCSVé de5GB. Para outros tipos de arquivo, o limite é de100MB.Por padrão, apenas a primeira planilha de um arquivo é carregada. Para carregar dados de várias planilhas em um único arquivo, crie um arquivo separado para cada planilha e posicione-a como a primeira.
Não há suporte para upload de arquivos no formato
SQL.
Defina Data Source como Workbook.
-
Specify Data to Be Uploaded:
Selecione a planilha para upload na lista suspensa ao lado de Select File.
Caso a planilha não exista, clique no botão Create para criar uma. Também é possível criar uma pasta de trabalho por meio do módulo Data Analysis e importar dados.
Tenha criado um bucket do OSS e armazenado os dados para upload nesse bucket. Em seguida, carregue os dados do OSS para a fonte de dados correspondente.
Para evitar problemas de permissão, conceda à conta da Alibaba Cloud que realiza a operação de upload a permissão de acesso ao bucket de destino através da Visão geral de permissões e controle de acesso antes de carregar os dados.
Defina Data Source como OSS.
-
Specify Data to Be Uploaded:
-
Na lista suspensa Select Bucket, selecione o bucket do OSS de destino que armazena os dados a serem carregados.
NotaSomente é possível carregar dados de buckets na mesma região do workspace atual do DataWorks.
-
Na área Select File, selecione o arquivo para upload.
NotaApenas arquivos nos formatos
CSV,XLS,XLSXeJSONsão suportados.
-
Defina Data Source como HTTP File.
-
Specify Data to Be Uploaded:
Parâmetro
Descrição
File URL
Selecione a URL do arquivo.
NotaURLs de arquivos HTTP e HTTPS são suportadas.
File Type
O tipo de arquivo é detectado automaticamente com base no arquivo carregado.
Os seguintes formatos de arquivo são suportados:
CSV,XLSeXLSX. O tamanho máximo de dados para um arquivoCSVé de 5 GB. Para outros tipos de arquivo, o limite é de 50 MB.Request Method
Três métodos são suportados: GET, POST e PUT. Recomendamos o uso de GET para recuperar dados, mas selecione o método conforme os métodos de solicitação permitidos definidos por você.
Advanced Parameters
Configure também o Request Header e o Request Body em Advanced Parameters de acordo com suas necessidades de negócio.
-
Clear Table Data First: Limpa todos os dados existentes na tabela de destino e depois importa dados para as colunas mapeadas correspondentes.
-
Append: Anexa os dados carregados às colunas mapeadas correspondentes na tabela de destino.
-
Se a tabela de destino não existir, siga as instruções na tela para acessar a página de Gerenciamento de tabelas no Data Studio e criar uma tabela.
-
O upload de dados só é permitido para uma tabela de sua propriedade (você é o proprietário da tabela). Para mais informações, consulte Limitações de uso.
-
Clear Table Data First: Limpa todos os dados existentes na tabela de destino e depois importa dados para as colunas mapeadas correspondentes.
-
Append: Anexa os dados carregados às colunas mapeadas correspondentes na tabela de destino.
-
Se a tabela de destino não existir, siga as instruções na tela para acessar o console do Hologres e criar uma tabela.
-
O upload de dados só é permitido para uma tabela de sua propriedade (você é o proprietário da tabela). Para mais informações, consulte Limitações de uso.
-
Clear Table Data First: Limpa todos os dados existentes na tabela de destino e depois importa dados para as colunas mapeadas correspondentes.
-
Append: Anexa os dados carregados às colunas mapeadas correspondentes na tabela de destino.
-
Ignore: Ignora os dados carregados. Os dados na tabela de destino não são atualizados.
-
Update (replace): Os dados carregados substituem totalmente os dados existentes na tabela de destino. Colunas sem mapeamento de coluna são forçadas para NULL.
-
update: Os dados carregados substituem os dados existentes na tabela de destino, mas apenas as colunas com mapeamento de coluna são atualizadas.
-
Se a tabela de destino não existir, siga as instruções na tela para acessar a página da instância do EMR Serverless StarRocks e criar uma tabela.
-
O upload de dados só é permitido para uma tabela de sua propriedade (você é o proprietário da tabela). Para mais informações, consulte Limitações de uso.
-
Clear Table Data First: Limpa todos os dados existentes na tabela de destino e depois importa dados para as colunas mapeadas correspondentes.
-
Append: Anexa os dados carregados às colunas mapeadas correspondentes na tabela de destino.
File Encoding Format: Se os dados contiverem caracteres ilegíveis, alterne o formato de codificação. Os seguintes formatos são suportados:
UTF-8,GB18030,Big5,UTF-16LEeUTF-16BE.-
Visualize dados e configure colunas da tabela de destino:
-
Upload de dados para uma tabela existente: Configure o mapeamento entre as colunas do arquivo de source e as colunas da tabela de destino. O upload só ocorre após a configuração do mapeamento. Os métodos incluem Mapping by Column Name e Mapping by Order. Após configurar o mapeamento, personalize os nomes das colunas na tabela de destino.
NotaCaso os dados a serem carregados não tenham mapeamento para uma coluna da tabela de destino, eles aparecerão esmaecidos e não serão carregados.
Mapeamentos duplicados entre os dados a serem carregados e as colunas da tabela de destino não são permitidos.
Nomes e tipos de coluna não podem estar vazios. Caso contrário, o upload falhará.
-
Upload de dados para uma nova tabela: Utilize a Intelligent Field Generation para preencher automaticamente as informações das colunas ou modifique-as manualmente.
NotaNomes e tipos de coluna não podem estar vazios. Caso contrário, o upload falhará.
As engines EMR Hive, Hologres e StarRocks não suportam a criação de novas tabelas durante o upload de dados.
-
-
Ignore First Row: Especifica se a primeira linha dos dados do arquivo (geralmente nomes de colunas) deve ser carregada na tabela de destino.
Selecionado: Se a primeira linha contiver nomes de colunas, ela não será carregada na tabela de destino.
Desmarcado: Se a primeira linha contiver dados, ela será carregada na tabela de destino.
Continuar upload: Clique em Resume na coluna Operation para carregar os dados novamente.
Consultar dados: Clique em Query Data na coluna Operation para consultar e analisar os dados.
Ver detalhes do upload: Clique no Table Name de destino para acessar o Data Map e visualizar informações detalhadas sobre a tabela de destino. Para mais informações, consulte Recuperação de metadados.
Você possui permissão para processar os dados de negócios em nuvem relevantes.
Adotou tecnologias e políticas suficientes de proteção de segurança de dados.
A transferência de dados cumpre os requisitos das leis e regulamentos aplicáveis. Por exemplo, os dados transferidos não contêm conteúdo restrito, proibido de ser transferido ou proibido de ser divulgado sob as leis aplicáveis.
O Data Studio também suporta o upload de arquivos CSV ou de texto locais para tabelas do MaxCompute. Para mais informações, consulte Upload de dados.
Para mais operações em tabelas do MaxCompute, consulte Criar e usar tabelas do MaxCompute.
Para mais operações em tabelas do Hologres, consulte Criar uma tabela do Hologres.
Para mais operações em tabelas do EMR, consulte Criar uma tabela do EMR.
-
Problema de configuração de grupo de recursos.
Mensagem de erro: A fonte de arquivo atual ou a engine de destino requer um grupo de recursos para upload de dados. Contate o administrador do workspace para configure um grupo de recursos.
Solução: Para configure o grupo de recursos para uma engine no Data Analysis, consulte System management.
-
Problema de associação de grupo de recursos.
Mensagem de erro: O grupo de recursos configurado para upload global de dados no seu workspace não está associado ao workspace ao qual a tabela de destino pertence. Contate o administrador do workspace para associá-los.
Solução: Associe o grupo de recursos como um grupo de recursos do workspace configurado no gerenciamento do sistema.
Faturamento
O upload de dados gera as seguintes taxas:
Todas as taxas são cobradas pela engine. Para mais informações, consulte MaxCompute billing, Hologres billing, E-MapReduce billing e EMR Serverless StarRocks billing.
Acesse a página Data Upload
Selecione os dados para upload
É possível carregar dados de arquivos locais, planilhas, OSS e arquivos HTTP. Selecione uma fonte de dados conforme suas necessidades de negócio.
Ao carregar um arquivo, especifique se deseja ignorar dados incorretos conforme necessário.
Arquivo local
Utilize este método caso os dados a serem carregados estejam armazenados em um arquivo local.
Planilha
Escolha esta opção se os dados a serem carregados estiverem em uma planilha do Data Analysis do DataWorks.
OSS
Selecione este método quando os dados a serem carregados estiverem armazenados no OSS.
Pré-requisitos:
Procedimento de upload:
Arquivo HTTP
Opte por este método se os dados a serem carregados residirem em um arquivo HTTP.
Configure a tabela de destino
Na seção Configure Destination Table, selecione uma Compute Engine para o upload de dados e configure os parâmetros relevantes com base na engine escolhida.
Ao configurar a tabela de destino, certifique-se de distinguir entre PROD (ambiente de produção) e DEV (ambiente de desenvolvimento) ao selecionar uma fonte de dados. Selecionar o ambiente errado resultará no upload dos dados para um ambiente não intencional.
MaxCompute
Para carregar dados em uma tabela interna no MaxCompute, configure os parâmetros conforme descrito na tabela a seguir.
|
Parâmetro |
Descrição |
|
|
Nome do projeto MaxCompute |
Selecione uma fonte de dados do MaxCompute associada à região atual. Se a fonte de dados não for encontrada, associe um recurso de computação do MaxCompute ao workspace atual para gerar uma fonte de dados com o mesmo nome. |
|
|
Tabela de destino |
Selecione Existing Table ou Create Table. |
|
|
|
Selecionar tabela de destino |
A tabela para a qual deseja carregar dados. Pesquise uma tabela por palavra-chave. Nota
O upload de dados só é permitido para uma tabela de sua propriedade (você é o proprietário da tabela). Para mais informações, consulte Limitações de uso. |
|
Método de upload |
Selecione um método para adicionar dados à tabela de destino. |
|
|
|
Nome da tabela |
Especifique um nome personalizado para a nova tabela. Nota
Ao criar uma tabela no MaxCompute, o sistema utiliza as informações da conta do MaxCompute configuradas no recurso de computação do DataWorks para criar a tabela no projeto correspondente do MaxCompute. |
|
Tipo de tabela |
Selecione Non-partitioned Table ou Partitioned Table conforme necessário. Se escolher uma tabela particionada, especifique a coluna de partição e seus valores. |
|
|
Ciclo de vida |
Especifique o ciclo de vida da tabela. Após a expiração do ciclo de vida, a tabela pode ficar indisponível. Para mais informações sobre o ciclo de vida da tabela, consulte Ciclo de vida e Gerenciar ciclo de vida da tabela. |
|
EMR Hive
Para carregar dados em uma tabela interna no EMR Hive, configure os parâmetros conforme descrito na tabela a seguir.
|
Parâmetro |
Descrição |
|
Fonte de dados |
Selecione uma fonte de dados do EMR Hive (modo de instância da Alibaba Cloud) associada ao workspace atual na região atual. |
|
Tabela de destino |
O upload de dados só é permitido para uma Existing Table. |
|
Selecionar tabela de destino |
A tabela para a qual deseja carregar dados. Pesquise uma tabela por palavra-chave. Nota
|
|
Método de upload |
Selecione um método para adicionar dados à tabela de destino. |
Hologres
Para carregar dados em uma tabela interna no Hologres, configure os parâmetros conforme descrito na tabela a seguir.
|
Parâmetro |
Descrição |
|
Fonte de dados |
Selecione uma fonte de dados do Hologres associada ao workspace atual na região atual. Se a fonte de dados não for encontrada, associe um recurso de computação do Hologres ao workspace atual para gerar uma fonte de dados com o mesmo nome. |
|
Tabela de destino |
O upload de dados só é permitido para uma Existing Table. |
|
Selecionar tabela de destino |
A tabela para a qual deseja carregar dados. Pesquise uma tabela por palavra-chave. Nota
|
|
Método de upload |
Selecione um método para adicionar dados à tabela de destino. |
|
Política de conflito de chave primária |
Se o upload de dados causar um conflito de chave primária na tabela de destino, utilize as seguintes políticas. |
StarRocks
Para carregar dados em uma tabela sob o catálogo padrão do StarRocks, configure os parâmetros conforme descrito na tabela a seguir.
|
Parâmetro |
Descrição |
|
Fonte de dados |
Selecione uma fonte de dados do StarRocks associada ao workspace atual na região atual. |
|
Tabela de destino |
O upload de dados só é permitido para uma Existing Table. |
|
Selecionar tabela de destino |
A tabela para a qual deseja carregar dados. Pesquise uma tabela por palavra-chave. Nota
|
|
Método de upload |
Selecione um método para adicionar dados à tabela de destino. |
|
Parâmetros avançados |
Configure os parâmetros de solicitação do Stream Load. |
Visualize os dados para upload
Após configurar a tabela de destino, ajuste a codificação do arquivo e o mapeamento de colunas com base na visualização dos dados.
Atualmente, apenas as primeiras 20 linhas de dados podem ser visualizadas.
Carregar dados
Após visualizar os dados, clique no botão Upload Data no canto inferior esquerdo para iniciar o upload.
Próximas etapas
Depois que os dados forem carregados, clique no ícone
no painel de navegação à esquerda para acessar a página Upload Data. Localize a tarefa de upload criada e execute as seguintes operações conforme necessário:
Apêndice: Declaração de conformidade para upload internacional de dados
Se suas operações envolverem transferências internacionais de dados (por exemplo, da China continental para um local fora da China continental ou entre diferentes países ou regiões), leia e compreenda primeiro a declaração de conformidade relacionada. Caso contrário, o upload pode falhar e você poderá enfrentar responsabilidade legal.
Operações internacionais de dados transferirão seus dados de negócios em nuvem para a região selecionada ou para a região onde o produto está implantado. Garanta que as operações cumpram os seguintes requisitos:
A Alibaba Cloud lembra que, se suas operações de upload de dados puderem resultar em transferências internacionais de dados, consulte profissionais jurídicos ou de conformidade antes de realizar tais operações para garantir que as transferências cumpram leis, regulamentos e políticas regulatórias aplicáveis (por exemplo, obtenção de autorização válida dos titulares dos dados, assinatura e arquivamento de cláusulas contratuais relevantes e conclusão de avaliações de segurança e outras obrigações legais).
Se realizar operações internacionais de dados sem cumprir esta declaração de conformidade, você arcará com as consequências legais correspondentes. Também será responsável por quaisquer perdas incorridas pela Alibaba Cloud e suas afiliadas.