全部產品
Search
文件中心

E-MapReduce:管理資料目錄

更新時間:Jun 16, 2026

資料目錄是資料湖構建(Data Lake Formation)或 Hive Metastore(HMS)等外部中繼資料服務的最上層實體,可以包含若干個資料庫。在EMR Serverless Spark中,您可以通過該功能查看繫結資料目錄中的資料庫和表,還可以添加已有的資料目錄。該功能適用於需要實現中繼資料隔離的情境。

Catalog介紹

EMR Serverless Spark提供了靈活的Catalog管理機制,支援多種類型的Catalog(例如Paimon、Iceberg、StarRocks等),以滿足不同情境的需求。除了資料目錄方式外,還支援內建的Catalog以及自訂Catalog。本部分將詳細介紹Serverless Spark中Catalog的分類、配置方法及其使用方式。

Catalog類型

支援資料來源

添加方式

特性說明

使用方式

資料目錄Catalog

需在数据目录頁面手動添加Catalog。

新增Catalog後,需要重啟一次正在啟動並執行會話,以使其生效。

  • 数据开发頁面的SQL編輯器中,選擇目標Catalog。

  • 直接在SQL編輯器中USE <catalogName>;

  • 直接在SQL編輯器中SELECT * FROM <catalogName>.db.tbl;

自訂Catalog

Paimon、Iceberg等

通過編輯會話,在Spark 配置中添加相應類型的參數。

需自行配置參數,支援擴充多種資料來源。詳情請參見使用Iceberg使用Paimon

-- 切換到自訂Catalog
USE <catalogName>;

-- 或者直接參考資料表
SELECT * FROM <catalogName>.db.tbl;

添加資料目錄

  1. 進入資料目錄頁面。

    1. 登入E-MapReduce控制台

    2. 在左側導覽列,選擇EMR Serverless > Spark

    3. Spark頁面,單擊目標工作空間名稱。

    4. EMR Serverless Spark頁面,單擊左側導覽列中的数据目录

      說明

      資料目錄頁面為您展示了建立叢集時您選擇的DLF資料目錄下的資料庫和表。

  2. 單擊添加数据目录

  3. 添加数据目录對話方塊中,選擇Catalog類型並配置相應參數,單擊添加。支援以下Catalog類型。

DLF資料目錄

DLF 数据目录是一種中繼資料管理服務,用於管理和查詢儲存在資料湖中的中繼資料。通過選擇已有的DLF資料目錄或建立新的資料目錄,您可以快速接入資料湖中的中繼資料。

如果您想建立新的DLF資料目錄,可以單擊创建数据目录,跳轉至資料湖構建控制台建立,詳情請參見中繼資料管理

說明

使用DLF資料目錄時,僅支援使用以下引擎版本:esr-4.3.0及以上版本、esr-3.3.0及以上版本、esr-2.7.0及以上版本。

Hive Metastore(HMS)資料目錄

外部 Hive Metastore是一種獨立的中繼資料服務,通常用於管理Hive表的中繼資料。通過配置該服務,您可以將外部Hive Metastore中的中繼資料整合到當前環境中。

使用該方式,需確保Serverless Spark與該服務所在VPC已經連通。

參數

說明

网络连接

當前環境與外部Hive Metastore所在VPC的網路連接配置。

在下拉式清單中選擇已建立的網路連接名稱,具體請參見步驟一:新增網路連接

說明
  • 在添加資料目錄時,所有資料目錄必須統一使用同一網路連接(以第一個添加的資料目錄為準)。

  • 該網路連接會作為預設網路,自動載入到當前工作空間後續拉起的所有計算資源,並用於該資料目錄的連通性測試。

  • 如需使用其他網路連接訪問某個資料目錄,請在提交任務/建立會話時手動指定對應的網路連接(手動指定的網路連接優先順序更高)。

Metastore 服务地址

外部Hive Metastore的服務地址,格式為thrift://<metastore-host>:<port>

其中:

  • <metastore-host>:Hive Metastore服務的主機名稱或IP地址。

  • <port>:Hive Metastore服務的連接埠號碼,預設為 9083

Kerberos認證

如果您的外部Hive Metastore開啟Kerberos認證,您需要指定keytab檔案地址,以及Principal名稱。

  • Kerberos keytab 文件地址:Kerberos keytab檔案路徑。

  • Kerberos principal:keytab檔案中包含的Principal的名稱,用於與Kerberos服務進行身分識別驗證。

    說明

    您可以使用klist -kt <keytab檔案>命令查看目標keytab檔案中Principal的名稱。

添加外部Metastore服務,請參見串連外部Hive Metastore Service

StarRocks資料目錄

StarRocks是一款高效能的AnalyticDB。通過添加StarRocks資料目錄,您可以在EMR Serverless Spark中註冊StarRocks執行個體的中繼資料資訊,添加成功後即可在任務和會話中直接讀寫StarRocks中的資料,無需在每個任務中單獨配置串連參數。使用該方式,需確保Serverless Spark與StarRocks執行個體所在VPC已連通。

添加成功後,您可以在SQL中通過三段式文法直接讀寫StarRocks中的資料,例如:SELECT * FROM <catalogName>.<dbName>.<tableName>;

說明

使用StarRocks資料目錄,僅支援使用以下引擎版本:esr-4.8.0及以上版本、esr-5.2.0及以上版本。

參數

說明

数据目录名称

StarRocks資料目錄的名稱,用於在SQL中引用該Catalog。同一工作空間內,資料目錄名稱不允許重複。

网络连接

當前環境與StarRocks執行個體所在VPC的網路連接配置。在下拉式清單中選擇已建立的網路連接名稱。具體操作,請參見步驟一:新增網路連接

說明
  • 在添加資料目錄時,所有資料目錄必須統一使用同一網路連接(以第一個添加的資料目錄為準)。

  • 該網路連接會作為預設網路,自動載入到當前工作空間後續拉起的所有計算資源,並用於該資料目錄的連通性測試。

  • 如需使用其他網路連接訪問某個資料目錄,請在提交任務/建立會話時手動指定對應的網路連接(手動指定的網路連接優先順序更高)。

Endpoint

StarRocks的FE訪問地址,fe--internal.starrocks.aliyuncs.com

查询端口

StarRocks的FE查詢連接埠,通常是9030。

用户名

訪問StarRocks的使用者名稱。該使用者名稱將用於Spark任務讀寫StarRocks資料時的身份認證。

密码

上述使用者對應的密碼。

讀寫StarRocks資料的詳細操作,請參見讀寫StarRocks

Hologres資料目錄

Hologres是一款即時數倉產品,支援海量資料的即時寫入和即時分析。通過添加Hologres資料目錄,您可以在EMR Serverless Spark中註冊Hologres執行個體的中繼資料資訊,添加成功後即可在任務和會話中直接讀寫Hologres中的資料,無需在每個任務中單獨配置串連參數。使用該方式,需確保Serverless Spark與Hologres執行個體所在VPC已連通。

添加成功後,您可以在SQL中通過三段式文法直接讀寫Hologres中的資料,每個 Catalog 嚴格綁定一個 Hologres Database,且不可跨庫訪問(即無法通過同一 Catalog 訪問多個 Hologres DB)。Catalog 內部的邏輯組織與 Hologres 保持一致:

Spark 概念

對應 Hologres 概念

說明

Catalog

Database

hologres_external_test_db → 映射 Hologres 中的 test_db 資料庫。

Namespace

Schema

publictest_schema;預設為 public,可通過 USE 切換當前預設 Namespace。

Table

Table

必須顯式指定 namespace.table_name(如 public.test),或先 USE namespace 後直接參考資料表名。

說明

使用Hologres資料目錄,僅支援使用以下引擎版本:esr-4.9.0及以上版本。

參數

說明

数据目录名称

Hologres資料目錄的名稱,用於在SQL中引用該Catalog。同一工作空間內,資料目錄名稱不允許重複。

网络连接

當前環境與Hologres執行個體所在VPC的網路連接配置。在下拉式清單中選擇已建立的網路連接名稱。具體操作,請參見步驟一:新增網路連接

說明
  • 在添加資料目錄時,所有資料目錄必須統一使用同一網路連接(以第一個添加的資料目錄為準)。

  • 該網路連接會作為預設網路,自動載入到當前工作空間後續拉起的所有計算資源,並用於該資料目錄的連通性測試。

  • 如需使用其他網路連接訪問某個資料目錄,請在提交任務/建立會話時手動指定對應的網路連接(手動指定的網路連接優先順序更高)。

Endpoint

Hologres執行個體訪問地址,可在Hologres控制台的執行個體詳情頁擷取。

查询端口

Hologres執行個體的連接埠號碼,通常是80。

用户名

訪問Hologres的使用者名稱。該使用者名稱將用於Spark任務讀寫Hologres資料時的身份認證。

  • 自訂帳號的使用者名稱,格式為BASIC$<user_name>

  • 阿里雲帳號或RAM使用者的AccessKey ID。

密码

上述使用者對應的密碼。

  • 自訂帳號的密碼。

  • 阿里雲帳號或RAM使用者的AccessKey Secret。

讀寫Hologres資料的詳細操作,請參見讀寫Hologres

查看資料庫和表

  1. 数据目录頁面,單擊資料目錄ID。

    展示當前資料目錄下的所有資料庫資訊。

  2. 單擊操作列的

    展示當前資料庫下的所有資料表資訊。

  3. 單擊操作列的字段

    展示當前資料表的表資訊和列資訊。