Se suas tabelas Hive estiverem armazenadas em um cluster EMR ou CDH, use o recurso de migração de dados do AnalyticDB for MySQL para copiá-las para um bucket do Object Storage Service (OSS). Em seguida, consulte os dados migrados com Spark SQL no Data Lakehouse Edition.
Limitações
Analise as restrições a seguir antes de iniciar:
DLF Unified Metadata não suportado: Clusters EMR com Metadata definido como DLF Unified Metadata não podem ser usados como source de dados Hive para migração.
Modo Data Lake Storage não suportado: Se o seu cluster EMR tiver Hive Storage Mode configurado como Data Lake Storage, os dados do Hive já residem no OSS. Use a descoberta de metadadosData Lakehouse Edition para importá-los diretamente para o Data Lakehouse Edition.
Prevalência da lista de bloqueios: Se um nome de banco de dados ou tabela constar tanto na lista de permissões quanto na lista de bloqueios, a lista de bloqueios prevalece e o item não é migrado.
Caminho do OSS permanente: Após definir o caminho do OSS para um job de migração, não é possível alterá-lo.
Intervalo de ACUs: A quantidade de ACUs para um job de migração deve variar entre 4 e o máximo de recursos de computação disponíveis no grupo de recursos do job.
Tarefas paralelas: Cada tarefa paralela migra uma tabela e exige no mínimo 4 ACUs. Se houver insuficiência de ACUs, as tarefas serão executadas sequencialmente. Valor padrão: 1. Valor máximo: 8.
Pré-requisitos
Antes de começar, certifique-se de ter:
Um cluster AnalyticDB for MySQL Data Lakehouse Edition
Um grupo de recursos de job para o cluster. Para mais informações, consulte Criar um grupo de recursos
-
Uma conta de banco de dados para o cluster:
Se você usar uma conta Alibaba Cloud, crie uma conta privilegiada. Consulte a seção Criar uma conta privilegiada no tópico Criar uma conta de banco de dados
Se você usar um usuário do Resource Access Management (RAM), crie uma conta privilegiada e uma conta padrão, e associe a conta padrão ao usuário RAM. Consulte Criar uma conta de banco de dados e Associar ou desassociar uma conta de banco de dados a/de um usuário RAM
-
Um dos seguintes clusters na mesma região do cluster AnalyticDB for MySQL:
Um cluster E-MapReduce (EMR) com Business Scenario definido como Data Lake, Metadata configurado como Self-managed RDS ou Built-in MySQL, serviço Hive configurado e Hive Storage Mode definido como HDFS (caixa de seleção Data Lake Storage desmarcada). Consulte Criar um cluster
Um cluster CDH (Cloudera's Distribution Including Apache Hadoop) implantado em uma instância Elastic Compute Service (ECS)
Uma tabela particionada na source de dados Hive. Consulte Usar o Hive para realizar operações básicas
Faturamento
A migração de dados do Hive para o OSS gera as seguintes taxas:
AnalyticDB for MySQL: Taxas de recursos elásticos ACU. Consulte Itens faturáveis do Data Lakehouse Edition
OSS: Taxas de armazenamento e requisições para operações como GET e PUT. Consulte Visão geral do faturamento
Fluxo de trabalho de migração
O processo de migração consiste em cinco etapas:
Crie uma source de dados Hive — Conecte o AnalyticDB for MySQL ao seu cluster EMR ou CDH especificando o Uniform Resource Identifier (URI) do Hive Metastore. Ignore esta etapa se a source de dados já existir.
Crie um job de migração de dados — Defina a source de dados de origem, o caminho de destino no OSS, filtros de banco de dados e tabelas, além dos recursos de computação para o job.
Start the data migration job — Acione o job para copiar as tabelas Hive para o bucket do OSS.
Analisar dados — Use a descoberta de metadados para importar dados do OSS para o Data Lakehouse Edition e execute Spark SQL para consultá-los.
(Opcional) Gerencie o job de migração de dados — Inicie, pause, edite ou exclua o job conforme necessário.
Crie uma source de dados Hive
Se você já tiver uma source de dados Hive, ignore esta etapa e acesse Criar um job de migração de dados .
Faça login no console do AnalyticDB for MySQL. No canto superior esquerdo, selecione uma região. No painel de navegação à esquerda, clique em Clusters. Na aba Data Lakehouse Edition, clique no ID do cluster que deseja gerenciar.
No painel de navegação à esquerda, escolha Data Ingestion > Data Sources.
No canto superior direito, clique em Create Data Source.
Na página Create Data Source, configure os parâmetros correspondentes ao tipo do seu cluster:
Cluster EMR
|
Parâmetro |
Descrição |
|
Data Source Type |
Selecione Hive. |
|
Data Source Name |
O sistema gera um nome padrão com base no tipo da source de dados e na hora atual. Modifique-o para seguir sua convenção de nomenclatura. |
|
Data Source Description |
Insira uma descrição, como caso de uso e escopo de negócios. |
|
Deployment Mode |
Selecione Alibaba Cloud Instance. |
|
Instance |
Escolha o cluster EMR que hospeda a source de dados Hive. |
|
Hive Metastore URI |
URI do Hive Metastore, no formato |
Cluster CDH baseado em ECS
|
Parâmetro |
Descrição |
|
Data Source Type |
Selecione Hive. |
|
Data Source Name |
O sistema gera um nome padrão com base no tipo da source de dados e na hora atual. Modifique-o para seguir sua convenção de nomenclatura. |
|
Data Source Description |
Insira uma descrição, como caso de uso e escopo de negócios. |
|
Deployment Mode |
Selecione ECS-based CDH. |
|
Instance |
Escolha a instância ECS onde o cluster CDH está implantado. |
|
Hive Metastore URI |
URI do Hive Metastore usando o endereço IP público da instância ECS onde o cluster CDH está implantado. Formato: |
|
Host Configuration Information |
Mapeamentos de hostname para IP, um por linha. Exemplo:
|
Clique em Create.
Crie um job de migração de dados
No painel de navegação à esquerda, clique em Data Migration.
No canto superior direito, clique em Create Migration Job.
-
Na aba Hive Data Source da página Create Migration Job, configure as seções a seguir:
Configurações de origem e destino
Parâmetro
Descrição
Job Name
O sistema gera um nome padrão com base no tipo da source de dados e na hora atual. Modifique-o conforme necessário.
Data Source
Selecione uma source de dados Hive existente ou crie uma nova.
Destination Type
Apenas Data Lake - OSS Storage é suportado.
OSS Path
Caminho do OSS onde os dados migrados serão armazenados. Todos os buckets na mesma região do cluster são listados. Selecione um diretório vazio sem relação de aninhamento com caminhos usados por outros jobs de migração — caminhos aninhados podem causar sobrescrita de dados. Esta configuração não pode ser alterada após a criação do job.
Configurações de migração de banco de dados/tabela
ImportanteSe um nome de banco de dados ou tabela aparecer em ambas as listas, a lista de bloqueios tem precedência e o item não será migrado.
Parâmetro
Descrição
Database/Table Migration Whitelist
Nomes dos bancos de dados e tabelas a serem migrados, especificados como expressões regulares. Separe múltiplas expressões por vírgulas.
Database/Table Migration Blacklist
Nomes dos bancos de dados e tabelas a serem excluídos da migração, especificados como expressões regulares. Separe múltiplas expressões por vírgulas.
Configurações de migração
Parâmetro
Descrição
Handling Same Named Destination Table
Define como lidar com tabelas cujos nomes conflitam com tabelas existentes no destino. Opções: Skip Migration (ignora a tabela conflitante e continua a migração das demais) ou Report Error and Abort Migration (interrompe todo o job).
Job Resource Group
Grupo de recursos de job que executa a migração.
Required ACUs
Quantidade de ACUs alocadas para o job. Valores válidos: de 4 até o máximo disponível no grupo de recursos do job. Para maior estabilidade e throughput, aloque mais ACUs.
Parallel Tasks
Número de tabelas a serem migradas simultaneamente. Padrão: 1. Valores válidos: 1–8. Cada tarefa requer pelo menos 4 ACUs. Se as ACUs forem insuficientes para o número configurado de tarefas, elas serão executadas sequencialmente.
Advanced Settings
Configurações personalizadas para o job de migração. Entre em contato com o suporte técnico caso precise configurar este item.
Clique em Submit.
Iniciar o job de migração de dados
Na página Data Migration, localize o job e clique em Start na coluna Actions.
Clique em Search no canto superior direito. Quando o status do job mudar para Starting, a migração estará em andamento.
Analisar dados
Após a conclusão do job de migração, use a descoberta de metadados para importar dados do OSS para o Data Lakehouse Edition e use o Spark JAR Development para analisar os dados importados.
No painel de navegação à esquerda, escolha Job Development > Spark JAR Development.
-
Insira suas instruções Spark SQL no modelo padrão e clique em Run Now. O exemplo abaixo mostra a estrutura de configuração usada para consultar tabelas no Data Lakehouse Edition:
-- Configure Spark resources and connectors conf spark.driver.resourceSpec=medium; conf spark.executor.instances=2; conf spark.executor.resourceSpec=medium; conf spark.app.name=Spark SQL Test; conf spark.adb.connectors=oss; -- Query migrated tables show tables from lakehouse20220413156_adbTest; (Opcional) Na aba Applications, localize sua aplicação e clique em Log na coluna Actions para visualizar o log de execução do Spark SQL.
Para mais informações sobre desenvolvimento Spark, consulte Editor Spark e Visão geral do desenvolvimento de aplicações em lote Spark.
Gerencie o job de migração de dados
Na página Data Migration, use as operações abaixo na coluna Actions:
|
Operação |
Descrição |
|
Start |
Inicia o job de migração. |
|
View Details |
Visualize as configurações do job de migração e a quantidade de tabelas migradas. |
|
Edit |
Edite a configuração do job de migração. |
|
Pause |
Pausa o job de migração. |
|
Delete |
Exclua o job de migração. |