O catálogo de dados é a entidade de metadados de nível superior no Data Lake Formation (DLF) e pode conter vários bancos de dados. É possível criar, visualizar, editar e excluir catálogos de dados, além de vinculá-los a mecanismos de computação para garantir o isolamento de metadados.
Casos de uso
Os catálogos de dados servem principalmente para o isolamento de metadados. Por exemplo, é possível vincular diferentes clusters do E-MapReduce (EMR) a catálogos de dados distintos, tornando os metadados invisíveis entre os clusters.
Operações básicas
Criar um catálogo de dados
Faça login no console do Data Lake Formation.
No painel de navegação à esquerda, escolha .
Clique em na aba Catalogs e, em seguida, clique em New Catalog.
-
Configure os parâmetros a seguir e clique em OK.
Catalog ID: Obrigatório. Identificador exclusivo do catálogo de dados.
Description: Opcional. Descrição do catálogo de dados.
Location: Opcional. Caminho de armazenamento padrão. Somente caminhos do OSS são compatíveis.
Visualizar catálogos de dados
No painel de navegação à esquerda, escolha .
Clique em na aba Catalogs para visualizar a lista de catálogos de dados.
Editar um catálogo de dados
No painel de navegação à esquerda, escolha .
Clique em na aba Catalogs.
Na lista de catálogos de dados, localize o catálogo desejado e clique em Modify na coluna Actions.
-
Modifique os parâmetros conforme necessário e clique em OK.
Description: Opcional. Descrição do catálogo de dados.
Location: Opcional. Caminho de armazenamento padrão. Somente caminhos do OSS são compatíveis.
Excluir um catálogo de dados
Esta ação é irreversível. Não é possível recuperar um catálogo de dados excluído nem seus respectivos dados. Proceda com cautela.
No painel de navegação à esquerda, escolha .
Clique em na aba Catalogs.
Na lista de catálogos de dados, localize o catálogo a ser excluído e clique em Delete na coluna Actions.
Na caixa de diálogo, clique em Delete.
Integração com mecanismo de computação
Alterar o catálogo de dados de um cluster do E-MapReduce
Ao alterar o Catalog ID do Data Lake Formation (DLF) vinculado a um cluster do E-MapReduce (EMR), o cluster passa a apontar para o novo Catalog ID. Essa alteração invalida operações em bancos de dados e tabelas no catálogo de dados original e causa falha em jobs em execução. Certifique-se de compreender totalmente o impacto antes de prosseguir.
Integração com o mecanismo Hive
-
No arquivo core-site.xml do service Hive, adicione o item de configuração a seguir. Para mais informações, consulte Adicionar itens de configuração.
Parâmetro
Valor
dlf.catalog.id
O ID do catálogo de dados do DLF.
-
Aplique a configuração.
Clique em Save. Após salvar a configuração, clique em Deploy Client Configuration.
Na caixa de diálogo, insira um Execution Reason e clique em OK.
-
Reinicie o service Hive.
Na página de configuração do service Hive, escolha .
-
Na caixa de diálogo, insira um Execution Reason e clique em OK.
Após a reinicialização, o status do service Hive muda para Healthy, o que confirma a alteração bem-sucedida do Catalog ID.
Integração com o mecanismo Spark
Modifique o arquivo hive-site.xml do service Spark. Para obter etapas detalhadas, consulte a seção Integração com o mecanismo Hive.
Nas versões 5.6.0, 3.40.0 e anteriores do EMR, basta modificar a configuração do Hive, pois o Spark a utiliza automaticamente.
Integração com o mecanismo Presto
Modifique o arquivo hive.properties do service Presto. Para obter etapas detalhadas, consulte a seção Integração com o mecanismo Hive.
Este recurso é compatível apenas com as versões 5.8.0, 3.42.0 e posteriores do EMR.
Integração com o mecanismo Impala
Basta modificar a configuração do Hive, pois o Impala a utiliza automaticamente.