Todos os produtos
Search
Central de documentação

E-MapReduce:Gerencie catálogos de dados

Última atualização: Jun 27, 2026

Um catálogo de dados é a entidade de nível superior para serviços de metadados externos, como Data Lake Formation (DLF) ou Hive Metastore, e pode conter vários bancos de dados. No EMR Serverless Spark, visualize os bancos de dados e as tabelas em um catálogo de dados conectado. Adicione também catálogos de dados existentes, recurso útil para cenários que exigem isolamento de metadados.

Visão geral do catálogo

O EMR Serverless Spark oferece um sistema flexível de gerenciamento de catálogos compatível com diversos tipos, como Paimon, Iceberg e StarRocks. Além do tipo padrão de catálogo de dados, o sistema suporta um catálogo interno e catálogos personalizados. Esta seção descreve os tipos de catálogo no EMR Serverless Spark, além de como configurá-los e utilizá-los.

Tipo de catálogo

Fontes de dados compatíveis

Como adicionar

Descrição

Uso

Catálogo de dados

Adicione manualmente um catálogo na página Catalog.

Após adicionar um catálogo, reinicie todas as sessões em execução para aplicar as alterações.

  • Na página Development, selecione o catálogo desejado no editor SQL.

  • Execute diretamente USE <catalogName>; no editor SQL.

  • Execute diretamente SELECT * FROM <catalogName>.db.tbl; no editor SQL.

Catálogo personalizado

Paimon, Iceberg, entre outros

Edite uma sessão e adicione os parâmetros necessários na aba Spark Configuration.

Este tipo exige configuração manual de parâmetros e permite estender a compatibilidade com várias fontes de dados. Para mais informações, consulte Usar Iceberg e Usar Paimon.

-- Switch to the custom catalog
USE <catalogName>;

-- Or reference the table directly
SELECT * FROM <catalogName>.db.tbl;

Adicionar catálogo de dados

  1. Acesse a página Catálogos de Dados.

    1. Faça login no console EMR.

    2. No painel de navegação à esquerda, escolha EMR Serverless > Spark.

    3. Na página Spark, clique em nome do workspace desejado.

    4. Na página EMR Serverless Spark, clique em Catalog no painel de navegação à esquerda.

      Nota

      A página Catálogos de Dados exibe os bancos de dados e as tabelas do catálogo de dados do Data Lake Formation selecionado durante a criação do workspace.

  2. Clique em Add Catalog.

  3. Na caixa de diálogo Add Catalog, selecione um tipo de catálogo, configure os parâmetros necessários e clique em Add. Os seguintes tipos de catálogo são compatíveis.

Catálogo de dados DLF

O DLF Catalog é um serviço para gerenciar e consultar metadados em um data lake. Selecione um catálogo de dados DLF existente ou crie um novo para acessar rapidamente os metadados do seu data lake.

Para criar um novo catálogo de dados DLF, clique em Create Catalog para acessar o console do Data Lake Formation. Para mais informações, consulte Gerenciar metadados.

Nota

Ao utilizar um catálogo de dados DLF, apenas as seguintes versões de mecanismo são compatíveis: esr-4.3.0 ou posterior, esr-3.3.0 ou posterior e esr-2.7.0 ou posterior.

Catálogo de dados Hive Metastore (HMS)

O External Hive Metastore é um serviço de metadados independente, geralmente usado para gerenciar metadados de tabelas Hive. Configure este serviço para integrar metadados de um Hive Metastore externo ao seu ambiente atual.

Garanta que exista uma conexão de rede entre o EMR Serverless Spark e a VPC onde o Hive Metastore externo está localizado.

Parâmetro

Descrição

Network Connection

Conexão de rede com a VPC onde o Hive Metastore externo está localizado.

Selecione uma conexão de rede existente na lista suspensa. Para mais informações, consulte Etapa 1: Adicionar uma conexão de rede.

Nota
  • Todos os catálogos de dados adicionados devem compartilhar a mesma conexão de rede. O sistema usa automaticamente a conexão selecionada para o primeiro catálogo em todos os subsequentes.

  • Esta conexão de rede torna-se o padrão para todos os recursos de computação iniciados no workspace e serve para testar a conectividade com o catálogo de dados.

  • Para usar uma conexão de rede diferente para um catálogo de dados específico, especifique-a ao enviar um job ou criar uma sessão. A conexão especificada manualmente tem precedência.

Metastore service address

Endereço de serviço do Hive Metastore externo, no formato thrift://<metastore-host>:<port>.

Onde:

  • <metastore-host>: nome do host ou endereço IP do serviço Hive Metastore.

  • <port>: número da porta do serviço Hive Metastore. O padrão é 9083.

Autenticação Kerberos

Se a autenticação Kerberos estiver ativada para o Hive Metastore externo, especifique o caminho do arquivo keytab e o nome do principal.

  • Kerberos keytab file: caminho para o arquivo keytab do Kerberos.

  • Kerberos principal: nome do principal no arquivo keytab, usado para autenticação com o serviço Kerberos.

    Nota

    Use o comando klist -kt <keytab_file> para visualizar o nome do principal no arquivo keytab desejado.

Para adicionar um Hive Metastore externo, consulte Conectar a um Hive Metastore externo.

Catálogo de dados StarRocks

O StarRocks é um banco de dados analítico de alto desempenho. Adicionar um catálogo de dados StarRocks registra os metadados de uma instância StarRocks no EMR Serverless Spark. Após adicionar o catálogo, leia e grave dados do StarRocks diretamente de seus jobs e sessões sem configurar parâmetros de conexão para cada tarefa. Garanta que exista uma conexão de rede entre o EMR Serverless Spark e a VPC onde a instância StarRocks está localizada.

Depois de adicionar o catálogo, use um identificador de três partes em SQL para ler e gravar dados no StarRocks. Exemplo: SELECT * FROM <catalogName>.<dbName>.<tableName>;

Nota

Os catálogos de dados StarRocks são compatíveis apenas com as seguintes versões de mecanismo: esr-4.8.0 ou posterior e esr-5.2.0 ou posterior.

Parâmetro

Descrição

Catalog Name

Nome do catálogo de dados StarRocks. Este nome deve ser único no workspace e serve para referenciar o catálogo em SQL.

Normal Network Connection

Conexão de rede com a VPC onde a instância StarRocks está localizada. Selecione uma conexão de rede existente na lista suspensa. Para mais informações, consulte Etapa 1: Adicionar uma conexão de rede.

Nota
  • Todos os catálogos de dados adicionados devem compartilhar a mesma conexão de rede. O sistema usa automaticamente a conexão selecionada para o primeiro catálogo em todos os subsequentes.

  • Esta conexão de rede torna-se o padrão para todos os recursos de computação iniciados no workspace e serve para testar a conectividade com o catálogo de dados.

  • Para usar uma conexão de rede diferente para um catálogo de dados específico, especifique-a ao enviar um job ou criar uma sessão. A conexão especificada manualmente tem precedência.

Endpoint

Endereço de acesso frontend (FE) para o StarRocks, como fe--internal.starrocks.aliyuncs.com.

Query Port

Porta de consulta FE para o StarRocks. Geralmente, é 9030.

Username

Nome de usuário para acessar o StarRocks. Os jobs do Spark usam este nome de usuário para autenticação ao ler ou gravar dados no StarRocks.

Password

Senha do nome de usuário especificado.

Para saber como ler e gravar dados do StarRocks em suas tarefas, consulte Ler e gravar no StarRocks.

Catálogo de dados Hologres

O Hologres é um data warehouse em tempo real compatível com gravações em tempo real de alto throughput e análises em tempo real em dados de grande escala. Adicionar um catálogo de dados Hologres registra os metadados de uma instância Hologres no EMR Serverless Spark. Após adicionar o catálogo, leia e grave dados do Hologres diretamente de seus jobs e sessões sem configurar parâmetros de conexão para cada tarefa. Garanta que exista uma conexão de rede entre o EMR Serverless Spark e a VPC onde a instância Hologres está localizada.

Depois de adicionar o catálogo, use um identificador de três partes em SQL para ler e gravar dados no Hologres. Cada catálogo vincula-se estritamente a um banco de dados Hologres, e o sistema não oferece suporte a acesso entre bancos de dados. Ou seja, não é possível usar um único catálogo para acessar vários bancos de dados Hologres. A estrutura lógica do catálogo é consistente com o Hologres:

Conceito Spark

Conceito Hologres

Descrição

Catálogo

Banco de dados

Por exemplo, hologres_external_test_db mapeia para o banco de dados test_db no Hologres.

Namespace

Schema

Por exemplo, public ou test_schema. O namespace padrão é public. Execute USE para alternar para um namespace diferente.

Tabela

Tabela

Especifique explicitamente a tabela como namespace.table_name (por exemplo, public.test), ou execute USE namespace primeiro e depois referencie o nome da tabela diretamente.

Nota

Os catálogos de dados Hologres são compatíveis apenas com a seguinte versão de mecanismo: esr-4.9.0 ou posterior.

Parâmetro

Descrição

Catalog Name

Nome do catálogo de dados Hologres. Este nome deve ser único no workspace e serve para referenciar o catálogo em SQL.

Normal Network Connection

Conexão de rede com a VPC onde a instância Hologres está localizada. Selecione uma conexão de rede existente na lista suspensa. Para mais informações, consulte Etapa 1: Adicionar uma conexão de rede.

Nota
  • Todos os catálogos de dados adicionados devem compartilhar a mesma conexão de rede. O sistema usa automaticamente a conexão selecionada para o primeiro catálogo em todos os subsequentes.

  • Esta conexão de rede torna-se o padrão para todos os recursos de computação iniciados no workspace e serve para testar a conectividade com o catálogo de dados.

  • Para usar uma conexão de rede diferente para um catálogo de dados específico, especifique-a ao enviar um job ou criar uma sessão. A conexão especificada manualmente tem precedência.

Endpoint

Endereço de acesso da instância Hologres. Encontre-o na página de detalhes da instância no console Hologres.

Query Port

Porta da instância Hologres. Geralmente, é 80.

Username

Nome de usuário para acessar o Hologres. Os jobs do Spark usam este nome de usuário para autenticação ao ler ou gravar dados no Hologres.

  • Para uma conta personalizada, use o nome de usuário no formato BASIC$<user_name>.

  • Para uma conta Alibaba Cloud ou usuário RAM, use o AccessKey ID.

Password

Senha do nome de usuário especificado.

  • Para uma conta personalizada, use a senha da conta.

  • Para uma conta Alibaba Cloud ou usuário RAM, use o AccessKey Secret.

Para saber como ler e gravar dados do Hologres em suas tarefas, consulte Ler e gravar no Hologres.

Visualize bancos de dados e tabelas

  1. Na página Catalog, clique em um ID de catálogo de dados.

    O sistema exibe todos os bancos de dados no catálogo de dados.

  2. Na coluna Actions, clique em Table.

    O sistema exibe todas as tabelas no banco de dados selecionado.

  3. Na coluna Actions, clique em Field.

    O sistema exibe o schema e os detalhes das colunas da tabela selecionada.