Um catálogo de dados é a entidade de nível superior para serviços de metadados externos, como Data Lake Formation (DLF) ou Hive Metastore, e pode conter vários bancos de dados. No EMR Serverless Spark, visualize os bancos de dados e as tabelas em um catálogo de dados conectado. Adicione também catálogos de dados existentes, recurso útil para cenários que exigem isolamento de metadados.
Visão geral do catálogo
O EMR Serverless Spark oferece um sistema flexível de gerenciamento de catálogos compatível com diversos tipos, como Paimon, Iceberg e StarRocks. Além do tipo padrão de catálogo de dados, o sistema suporta um catálogo interno e catálogos personalizados. Esta seção descreve os tipos de catálogo no EMR Serverless Spark, além de como configurá-los e utilizá-los.
Tipo de catálogo | Fontes de dados compatíveis | Como adicionar | Descrição | Uso |
Catálogo de dados |
| Adicione manualmente um catálogo na página Catalog. | Após adicionar um catálogo, reinicie todas as sessões em execução para aplicar as alterações. |
|
Catálogo personalizado | Paimon, Iceberg, entre outros | Edite uma sessão e adicione os parâmetros necessários na aba Spark Configuration. | Este tipo exige configuração manual de parâmetros e permite estender a compatibilidade com várias fontes de dados. Para mais informações, consulte Usar Iceberg e Usar Paimon. | |
Adicionar catálogo de dados
-
Acesse a página Catálogos de Dados.
Faça login no console EMR.
No painel de navegação à esquerda, escolha EMR Serverless > Spark.
Na página Spark, clique em nome do workspace desejado.
-
Na página EMR Serverless Spark, clique em Catalog no painel de navegação à esquerda.
NotaA página Catálogos de Dados exibe os bancos de dados e as tabelas do catálogo de dados do Data Lake Formation selecionado durante a criação do workspace.
Clique em Add Catalog.
Na caixa de diálogo Add Catalog, selecione um tipo de catálogo, configure os parâmetros necessários e clique em Add. Os seguintes tipos de catálogo são compatíveis.
Catálogo de dados DLF
O DLF Catalog é um serviço para gerenciar e consultar metadados em um data lake. Selecione um catálogo de dados DLF existente ou crie um novo para acessar rapidamente os metadados do seu data lake.
Para criar um novo catálogo de dados DLF, clique em Create Catalog para acessar o console do Data Lake Formation. Para mais informações, consulte Gerenciar metadados.
Ao utilizar um catálogo de dados DLF, apenas as seguintes versões de mecanismo são compatíveis: esr-4.3.0 ou posterior, esr-3.3.0 ou posterior e esr-2.7.0 ou posterior.
Catálogo de dados Hive Metastore (HMS)
O External Hive Metastore é um serviço de metadados independente, geralmente usado para gerenciar metadados de tabelas Hive. Configure este serviço para integrar metadados de um Hive Metastore externo ao seu ambiente atual.
Garanta que exista uma conexão de rede entre o EMR Serverless Spark e a VPC onde o Hive Metastore externo está localizado.
Parâmetro | Descrição |
Network Connection | Conexão de rede com a VPC onde o Hive Metastore externo está localizado. Selecione uma conexão de rede existente na lista suspensa. Para mais informações, consulte Etapa 1: Adicionar uma conexão de rede. Nota
|
Metastore service address | Endereço de serviço do Hive Metastore externo, no formato Onde:
|
Autenticação Kerberos | Se a autenticação Kerberos estiver ativada para o Hive Metastore externo, especifique o caminho do arquivo keytab e o nome do principal.
|
Para adicionar um Hive Metastore externo, consulte Conectar a um Hive Metastore externo.
Catálogo de dados StarRocks
O StarRocks é um banco de dados analítico de alto desempenho. Adicionar um catálogo de dados StarRocks registra os metadados de uma instância StarRocks no EMR Serverless Spark. Após adicionar o catálogo, leia e grave dados do StarRocks diretamente de seus jobs e sessões sem configurar parâmetros de conexão para cada tarefa. Garanta que exista uma conexão de rede entre o EMR Serverless Spark e a VPC onde a instância StarRocks está localizada.
Depois de adicionar o catálogo, use um identificador de três partes em SQL para ler e gravar dados no StarRocks. Exemplo: SELECT * FROM <catalogName>.<dbName>.<tableName>;
Os catálogos de dados StarRocks são compatíveis apenas com as seguintes versões de mecanismo: esr-4.8.0 ou posterior e esr-5.2.0 ou posterior.
Parâmetro | Descrição |
Catalog Name | Nome do catálogo de dados StarRocks. Este nome deve ser único no workspace e serve para referenciar o catálogo em SQL. |
Normal Network Connection | Conexão de rede com a VPC onde a instância StarRocks está localizada. Selecione uma conexão de rede existente na lista suspensa. Para mais informações, consulte Etapa 1: Adicionar uma conexão de rede. Nota
|
Endpoint | Endereço de acesso frontend (FE) para o StarRocks, como |
Query Port | Porta de consulta FE para o StarRocks. Geralmente, é 9030. |
Username | Nome de usuário para acessar o StarRocks. Os jobs do Spark usam este nome de usuário para autenticação ao ler ou gravar dados no StarRocks. |
Password | Senha do nome de usuário especificado. |
Para saber como ler e gravar dados do StarRocks em suas tarefas, consulte Ler e gravar no StarRocks.
Catálogo de dados Hologres
O Hologres é um data warehouse em tempo real compatível com gravações em tempo real de alto throughput e análises em tempo real em dados de grande escala. Adicionar um catálogo de dados Hologres registra os metadados de uma instância Hologres no EMR Serverless Spark. Após adicionar o catálogo, leia e grave dados do Hologres diretamente de seus jobs e sessões sem configurar parâmetros de conexão para cada tarefa. Garanta que exista uma conexão de rede entre o EMR Serverless Spark e a VPC onde a instância Hologres está localizada.
Depois de adicionar o catálogo, use um identificador de três partes em SQL para ler e gravar dados no Hologres. Cada catálogo vincula-se estritamente a um banco de dados Hologres, e o sistema não oferece suporte a acesso entre bancos de dados. Ou seja, não é possível usar um único catálogo para acessar vários bancos de dados Hologres. A estrutura lógica do catálogo é consistente com o Hologres:
|
Conceito Spark |
Conceito Hologres |
Descrição |
|
Catálogo |
Banco de dados |
Por exemplo, |
|
Namespace |
Schema |
Por exemplo, |
|
Tabela |
Tabela |
Especifique explicitamente a tabela como |
Os catálogos de dados Hologres são compatíveis apenas com a seguinte versão de mecanismo: esr-4.9.0 ou posterior.
Parâmetro | Descrição |
Catalog Name | Nome do catálogo de dados Hologres. Este nome deve ser único no workspace e serve para referenciar o catálogo em SQL. |
Normal Network Connection | Conexão de rede com a VPC onde a instância Hologres está localizada. Selecione uma conexão de rede existente na lista suspensa. Para mais informações, consulte Etapa 1: Adicionar uma conexão de rede. Nota
|
Endpoint | Endereço de acesso da instância Hologres. Encontre-o na página de detalhes da instância no console Hologres. |
Query Port | Porta da instância Hologres. Geralmente, é 80. |
Username | Nome de usuário para acessar o Hologres. Os jobs do Spark usam este nome de usuário para autenticação ao ler ou gravar dados no Hologres.
|
Password | Senha do nome de usuário especificado.
|
Para saber como ler e gravar dados do Hologres em suas tarefas, consulte Ler e gravar no Hologres.
Visualize bancos de dados e tabelas
-
Na página Catalog, clique em um ID de catálogo de dados.
O sistema exibe todos os bancos de dados no catálogo de dados.
-
Na coluna Actions, clique em Table.
O sistema exibe todas as tabelas no banco de dados selecionado.
-
Na coluna Actions, clique em Field.
O sistema exibe o schema e os detalhes das colunas da tabela selecionada.