Todos os produtos
Search
Central de documentação

AnalyticDB:Import data from a Hive data source

Última atualização: Jun 27, 2026

Se suas tabelas Hive estiverem armazenadas em um cluster EMR ou CDH, use o recurso de migração de dados do AnalyticDB for MySQL para copiá-las para um bucket do Object Storage Service (OSS). Em seguida, consulte os dados migrados com Spark SQL no Data Lakehouse Edition.

Limitações

Analise as restrições a seguir antes de iniciar:

  • DLF Unified Metadata não suportado: Clusters EMR com Metadata definido como DLF Unified Metadata não podem ser usados como source de dados Hive para migração.

  • Modo Data Lake Storage não suportado: Se o seu cluster EMR tiver Hive Storage Mode configurado como Data Lake Storage, os dados do Hive já residem no OSS. Use a descoberta de metadadosData Lakehouse Edition para importá-los diretamente para o Data Lakehouse Edition.

  • Prevalência da lista de bloqueios: Se um nome de banco de dados ou tabela constar tanto na lista de permissões quanto na lista de bloqueios, a lista de bloqueios prevalece e o item não é migrado.

  • Caminho do OSS permanente: Após definir o caminho do OSS para um job de migração, não é possível alterá-lo.

  • Intervalo de ACUs: A quantidade de ACUs para um job de migração deve variar entre 4 e o máximo de recursos de computação disponíveis no grupo de recursos do job.

  • Tarefas paralelas: Cada tarefa paralela migra uma tabela e exige no mínimo 4 ACUs. Se houver insuficiência de ACUs, as tarefas serão executadas sequencialmente. Valor padrão: 1. Valor máximo: 8.

Pré-requisitos

Antes de começar, certifique-se de ter:

  • Um cluster AnalyticDB for MySQL Data Lakehouse Edition

  • Um grupo de recursos de job para o cluster. Para mais informações, consulte Criar um grupo de recursos

  • Uma conta de banco de dados para o cluster:

  • Um dos seguintes clusters na mesma região do cluster AnalyticDB for MySQL:

    • Um cluster E-MapReduce (EMR) com Business Scenario definido como Data Lake, Metadata configurado como Self-managed RDS ou Built-in MySQL, serviço Hive configurado e Hive Storage Mode definido como HDFS (caixa de seleção Data Lake Storage desmarcada). Consulte Criar um cluster

    • Um cluster CDH (Cloudera's Distribution Including Apache Hadoop) implantado em uma instância Elastic Compute Service (ECS)

  • Uma tabela particionada na source de dados Hive. Consulte Usar o Hive para realizar operações básicas

Faturamento

A migração de dados do Hive para o OSS gera as seguintes taxas:

Fluxo de trabalho de migração

O processo de migração consiste em cinco etapas:

  1. Crie uma source de dados Hive — Conecte o AnalyticDB for MySQL ao seu cluster EMR ou CDH especificando o Uniform Resource Identifier (URI) do Hive Metastore. Ignore esta etapa se a source de dados já existir.

  2. Crie um job de migração de dados — Defina a source de dados de origem, o caminho de destino no OSS, filtros de banco de dados e tabelas, além dos recursos de computação para o job.

  3. Start the data migration job — Acione o job para copiar as tabelas Hive para o bucket do OSS.

  4. Analisar dados — Use a descoberta de metadados para importar dados do OSS para o Data Lakehouse Edition e execute Spark SQL para consultá-los.

  5. (Opcional) Gerencie o job de migração de dados — Inicie, pause, edite ou exclua o job conforme necessário.

Crie uma source de dados Hive

Se você já tiver uma source de dados Hive, ignore esta etapa e acesse Criar um job de migração de dados .
  1. Faça login no console do AnalyticDB for MySQL. No canto superior esquerdo, selecione uma região. No painel de navegação à esquerda, clique em Clusters. Na aba Data Lakehouse Edition, clique no ID do cluster que deseja gerenciar.

  2. No painel de navegação à esquerda, escolha Data Ingestion > Data Sources.

  3. No canto superior direito, clique em Create Data Source.

  4. Na página Create Data Source, configure os parâmetros correspondentes ao tipo do seu cluster:

Cluster EMR

Parâmetro

Descrição

Data Source Type

Selecione Hive.

Data Source Name

O sistema gera um nome padrão com base no tipo da source de dados e na hora atual. Modifique-o para seguir sua convenção de nomenclatura.

Data Source Description

Insira uma descrição, como caso de uso e escopo de negócios.

Deployment Mode

Selecione Alibaba Cloud Instance.

Instance

Escolha o cluster EMR que hospeda a source de dados Hive.

Hive Metastore URI

URI do Hive Metastore, no formato thrift://<master-node-IP>:<port>. A porta padrão é 9083. Para obter o endereço IP privado do nó mestre, faça login no console do EMR, clique em EMR on ECS no painel de navegação à esquerda, clique no ID do cluster EMR desejado, abra a aba Nodes e expanda o nó emr-master.

Cluster CDH baseado em ECS

Parâmetro

Descrição

Data Source Type

Selecione Hive.

Data Source Name

O sistema gera um nome padrão com base no tipo da source de dados e na hora atual. Modifique-o para seguir sua convenção de nomenclatura.

Data Source Description

Insira uma descrição, como caso de uso e escopo de negócios.

Deployment Mode

Selecione ECS-based CDH.

Instance

Escolha a instância ECS onde o cluster CDH está implantado.

Hive Metastore URI

URI do Hive Metastore usando o endereço IP público da instância ECS onde o cluster CDH está implantado. Formato: thrift://<ECS-instance-IP>:<port>. A porta padrão é 9083.

Host Configuration Information

Mapeamentos de hostname para IP, um por linha. Exemplo:

192.168.2.153 master.cdh

192.168.2.154 node1.cdh

192.168.2.155 node2.cdh

  1. Clique em Create.

Crie um job de migração de dados

  1. No painel de navegação à esquerda, clique em Data Migration.

  2. No canto superior direito, clique em Create Migration Job.

  3. Na aba Hive Data Source da página Create Migration Job, configure as seções a seguir:

    Configurações de origem e destino

    Parâmetro

    Descrição

    Job Name

    O sistema gera um nome padrão com base no tipo da source de dados e na hora atual. Modifique-o conforme necessário.

    Data Source

    Selecione uma source de dados Hive existente ou crie uma nova.

    Destination Type

    Apenas Data Lake - OSS Storage é suportado.

    OSS Path

    Caminho do OSS onde os dados migrados serão armazenados. Todos os buckets na mesma região do cluster são listados. Selecione um diretório vazio sem relação de aninhamento com caminhos usados por outros jobs de migração — caminhos aninhados podem causar sobrescrita de dados. Esta configuração não pode ser alterada após a criação do job.

    Configurações de migração de banco de dados/tabela

    Importante

    Se um nome de banco de dados ou tabela aparecer em ambas as listas, a lista de bloqueios tem precedência e o item não será migrado.

    Parâmetro

    Descrição

    Database/Table Migration Whitelist

    Nomes dos bancos de dados e tabelas a serem migrados, especificados como expressões regulares. Separe múltiplas expressões por vírgulas.

    Database/Table Migration Blacklist

    Nomes dos bancos de dados e tabelas a serem excluídos da migração, especificados como expressões regulares. Separe múltiplas expressões por vírgulas.

    Configurações de migração

    Parâmetro

    Descrição

    Handling Same Named Destination Table

    Define como lidar com tabelas cujos nomes conflitam com tabelas existentes no destino. Opções: Skip Migration (ignora a tabela conflitante e continua a migração das demais) ou Report Error and Abort Migration (interrompe todo o job).

    Job Resource Group

    Grupo de recursos de job que executa a migração.

    Required ACUs

    Quantidade de ACUs alocadas para o job. Valores válidos: de 4 até o máximo disponível no grupo de recursos do job. Para maior estabilidade e throughput, aloque mais ACUs.

    Parallel Tasks

    Número de tabelas a serem migradas simultaneamente. Padrão: 1. Valores válidos: 18. Cada tarefa requer pelo menos 4 ACUs. Se as ACUs forem insuficientes para o número configurado de tarefas, elas serão executadas sequencialmente.

    Advanced Settings

    Configurações personalizadas para o job de migração. Entre em contato com o suporte técnico caso precise configurar este item.

  4. Clique em Submit.

Iniciar o job de migração de dados

  1. Na página Data Migration, localize o job e clique em Start na coluna Actions.

  2. Clique em Search no canto superior direito. Quando o status do job mudar para Starting, a migração estará em andamento.

Analisar dados

Após a conclusão do job de migração, use a descoberta de metadados para importar dados do OSS para o Data Lakehouse Edition e use o Spark JAR Development para analisar os dados importados.

  1. No painel de navegação à esquerda, escolha Job Development > Spark JAR Development.

  2. Insira suas instruções Spark SQL no modelo padrão e clique em Run Now. O exemplo abaixo mostra a estrutura de configuração usada para consultar tabelas no Data Lakehouse Edition:

    -- Configure Spark resources and connectors
    conf spark.driver.resourceSpec=medium;
    conf spark.executor.instances=2;
    conf spark.executor.resourceSpec=medium;
    conf spark.app.name=Spark SQL Test;
    conf spark.adb.connectors=oss;
    
    -- Query migrated tables
    show tables from lakehouse20220413156_adbTest;
  3. (Opcional) Na aba Applications, localize sua aplicação e clique em Log na coluna Actions para visualizar o log de execução do Spark SQL.

Para mais informações sobre desenvolvimento Spark, consulte Editor Spark e Visão geral do desenvolvimento de aplicações em lote Spark.

Gerencie o job de migração de dados

Na página Data Migration, use as operações abaixo na coluna Actions:

Operação

Descrição

Start

Inicia o job de migração.

View Details

Visualize as configurações do job de migração e a quantidade de tabelas migradas.

Edit

Edite a configuração do job de migração.

Pause

Pausa o job de migração.

Delete

Exclua o job de migração.