全部產品
Search
文件中心

Data Lake Formation:Serverless Spark訪問DLF

更新時間:Jun 08, 2026

如何在Serverless Spark訪問Paimon虛擬檔案系統(PVFS)。

使用限制

僅支援使用esr-3.5.0、esr-2.9.0、esr-4.6.0及以上版本。

建立DLF Catalog

詳情請參見 DLF 快速入門

在Serverless Spark中綁定DLF Catalog

您可以建立Serverless Spark工作空間並綁定使用DLF Catalog,也可以在已有的Serverless Spark工作空間中綁定使用DLF Catalog。

說明

在Serverless Spark 工作空間的綁定DLF Catalog後,Livy Gateway 和 Kyuubi Gateway 原生支援其預設資料目錄。

在建立Serverless Spark工作空間時綁定

建立Serverless Spark工作空間,詳情請參見建立工作空間

重要

建立時,開啟DLF作為中繼資料服務,並選擇上述步驟中建立的DLF Catalog。

在已有Serverless Spark工作空間中綁定

進入Serverless Spark工作空間資料目錄頁面,並添加上述步驟中建立的DLF Catalog,詳情請參見管理資料目錄

通過Serverless Spark訪問DLF檔案

  1. 登入 資料湖構建控制台

  2. 在綁定的DLF Catalog的default資料庫下,建立一個名為object_tableObject表。

  3. 單擊建立的表,進入表詳情頁,在上方選擇檔案清單頁簽。

  4. 單擊上傳檔案:employee.csv

  5. 返回EMR控制台,在左側導覽列,選擇EMR Serverless > Spark,進入EMR Serverless Spark的工作空間。

  6. 在左側導覽列選擇資料開發

  7. 開發目錄頁簽下,單擊image表徵圖,在彈出的對話方塊中,輸入名稱,類型使用Notebook,然後單擊確定

  8. 運行下列代碼,訪問測試檔案。

    # 路徑需要替換為步驟二中的對應的Catalog Name
    df = spark.read.option("delimiter", ",").option("header", True).csv("pvfs://catalog_name/default/object_table/employee.csv")
    # 顯示DataFrame的前幾行
    df.show(5)
    # 執行一個簡單的彙總操作:計算每個部門的總薪資
    sum_salary_per_department = df.groupBy("department").agg({"salary": "sum"}).show()
    +-------------+----------+------+
    |employee_name|department|salary|
    +-------------+----------+------+
    |        James|     Sales|  3000|
    |      Michael|     Sales|  4600|
    |       Robert| Marketing|  4100|
    |        Maria|   Finance|  3000|
    |        James|     Sales|  3000|
    +-------------+----------+------+
    only showing top 5 rows
    +----------+-----------+
    |department|sum(salary)|
    +----------+-----------+
    |     Sales|    12600.0|
    |   Finance|     6900.0|
    | Marketing|    10400.0|
    +----------+-----------+