A solução de data lake baseada na combinação do E-MapReduce (EMR) com o Data Lake Formation (DLF), conhecida como solução de data lake EMR+DLF, permite que as empresas gerenciem metadados e permissões de data lakes de forma centralizada. Essa solução também oferece recursos de gerenciamento de data lake, incluindo gestão do ciclo de vida dos dados, otimização automática de formatos de lake e análise de armazenamento. Com a solução de data lake EMR+DLF, você pode gravar dados de diversas fontes em data lakes e realizar exploração de dados unificada. Este tópico descreve como utilizar a solução de data lake EMR+DLF.
Informações básicas
A solução de data lake EMR+DLF apresenta as seguintes vantagens em relação à solução tradicional de data lake do EMR:
-
O DLF fornece um serviço de metadados unificado, totalmente gerenciado e livre de operações e manutenção para data lakes em diferentes engines.
Gerenciamento visual de metadados, com suporte a múltiplas versões, rollback e controle simplificado.
Migração visual de metadados simples e intuitiva.
Busca textual completa em metadados.
Perfilamento de dados para metadados. Por exemplo, o perfilamento pode examinar tamanhos de arquivos, quantidade de linhas por arquivo, frequência de acesso, número de arquivos pequenos, popularidade de arquivos e quantidade de arquivos válidos.
Suporte a engines de computação adicionais além das open source disponíveis no EMR, como MaxCompute, Flink e Hologres.
-
O DLF oferece gerenciamento granular de permissões de dados.
Controle de permissões visual e refinado sobre recursos como catálogos de dados, bancos de dados, colunas e funções.
Integração com diversas engines de computação do EMR, incluindo Spark, Hive, Presto e Impala.
-
Conjunto abrangente de capacidades de gerenciamento de data lake.
Gestão do ciclo de vida dos dados em múltiplas dimensões. O sistema arquiva dados automaticamente com base na popularidade dos arquivos e no horário de atualização, reduzindo custos de armazenamento.
Políticas automáticas de otimização de armazenamento para o formato Delta Lake, visando redução de custos.
Informações adicionais
Para consultar as regiões onde o DLF está disponível, consulte Data Lake Formation: Regiões e endpoints suportados.
Para detalhes sobre o faturamento do DLF, consulte Modos de faturamento.
Procedimento
Etapa 1: Crie um cluster EMR DataLake
Ao criar um cluster EMR DataLake, selecione DLF Unified Metadata no campo Metadata.
Faça login no console do EMR. No painel de navegação à esquerda, clique em EMR on ECS.
-
Na página EMR on ECS, clique em Create Cluster. Na página E-MapReduce on ECS, configure os parâmetros abaixo.
Business Scenario: Selecione Data Lake.
Optional Services (Select One At Least): O serviço Hive é obrigatório. Escolha outros serviços conforme suas necessidades de negócio.
Metadata: Selecione DLF Unified Metadata.
DLF Catalog: Utilize o catálogo padrão do DLF ou crie um novo. Caso ainda não tenha ativado o DLF, o sistema solicitará a ativação prévia.
Siga as instruções exibidas para concluir as etapas restantes. Para mais detalhes, consulte Criar um cluster.
Etapa 2: Inicializar metadados
Diferentes cenários exigem métodos distintos para inicialização de metadados.
Caso os metadados de um cluster EMR estejam armazenados em um banco MySQL integrado ou em uma instância ApsaraDB RDS autogerenciada, migre-os para o DLF. Consulte Melhores práticas para migração de metadados do EMR para o DLF.
-
Se um cluster EMR recém-criado não possuir metadados históricos, utilize o DLF para criá-los visualmente ou empregue Hive ou Spark SQL para definir bancos de dados e tabelas.
Acesse o console do DLF. Na barra de navegação superior, selecione a região onde o Object Storage Service (OSS) foi ativado, como China (Hangzhou).
No painel de navegação à esquerda, escolha .
Clique em aba Database e, em seguida, clique em Create Database.
Na página Create Database, preencha os parâmetros necessários e clique em OK.
Quando os dados de um novo cluster EMR residirem no OSS sem metadados associados, aproveite o recurso de descoberta de metadados do DLF para extrair metadados do OSS diretamente para o DLF. Veja mais em Início rápido: Análise de comportamento de usuários do Taobao.
Etapa 3: Inicializar dados
Utilize os métodos adequados para cada cenário de inicialização de dados:
Para migrar dados de um cluster EMR existente, utilize o Jindo DistCp e transfira os dados do cluster para o OSS.
Para importar dados de sistemas operacionais como RDS, MySQL e Kafka, utilize o Realtime Compute for Apache Flink e direcione os dados para o DLF. Consulte Gerencie catálogos DLF-Legacy.
Etapa 4: Consultar dados em uma tabela específica do DLF usando Spark ou Presto
Conecte-se ao nó mestre -1-1 do cluster EMR via SSH. Para mais informações, consulte Fazer login em um cluster.
-
Consulte dados de uma tabela específica com Spark SQL.
-
Execute o comando abaixo para iniciar o Spark SQL:
spark-sql -
Execute a instrução a seguir para consultar os dados da tabela:
SELECT * FROM <database>.<table>;
-
-
Consulte dados em uma tabela específica com Presto.
-
Inicie a CLI do Presto com o comando:
presto --server master-1-1:8889 -
Execute a instrução abaixo para consultar os dados da tabela:
SELECT * FROM <catalog>.<database>.<table>;Parâmetros da instrução acima
Parâmetro
Descrição
<catalog>
Nome da fonte de dados desejada.
Execute o comando show catalogs; para listar todos os catálogos disponíveis. Alternativamente, visualize-os na aba Configure da página do serviço Presto no console do EMR.
<database>
Nome do banco de dados alvo da consulta.
<table>
Nome da tabela a ser consultada.
Por exemplo, para consultar dados da tabela test no banco default do Hive, execute a instrução SELECT * FROM hive.default.test;.
-
(Opcional) Etapa 5: Ative o gerenciamento de permissões de dados
Certos cenários de negócio demandam alta segurança e controle rigoroso de permissões em data lakes. Para habilitar o gerenciamento de permissões de dados, siga estas etapas:
Ative o gerenciamento de permissões do DLF no seu cluster EMR. Consulte DLF-Auth.
Habilite o gerenciamento de permissões para seus catálogos de dados no DLF. Veja mais em Configure permissões.
As permissões configuradas aplicam-se a todos os dados do cluster EMR. Para acessar qualquer dado no cluster, os usuários precisam receber as permissões apropriadas.
Para conceder permissões aos usuários, consulte Autorização de dados. Para informações complementares, veja Controle de acesso unificado com DLF e EMR.
(Opcional) Etapa 6: Implementar o gerenciamento de ciclo de vida
O recurso de gerenciamento de ciclo de vida permite definir regras de gestão para bancos de dados e tabelas dentro de um data lake. Você pode alterar periodicamente a classe de armazenamento dos dados no OSS com base em três tipos de regras: data de criação de partições e tabelas, última modificação de partições e tabelas, e valor da partição. Essa abordagem reduz significativamente os custos de armazenamento. Para mais detalhes, consulte Gerenciamento de ciclo de vida.