如何在Serverless Spark訪問Paimon虛擬檔案系統(PVFS)。
使用限制
僅支援使用esr-3.5.0、esr-2.9.0、esr-4.6.0及以上版本。
建立DLF Catalog
詳情請參見 DLF 快速入門 。
在Serverless Spark中綁定DLF Catalog
您可以建立Serverless Spark工作空間並綁定使用DLF Catalog,也可以在已有的Serverless Spark工作空間中綁定使用DLF Catalog。
在Serverless Spark 工作空間的綁定DLF Catalog後,Livy Gateway 和 Kyuubi Gateway 原生支援其預設資料目錄。
在建立Serverless Spark工作空間時綁定
建立Serverless Spark工作空間,詳情請參見建立工作空間。
建立時,開啟DLF作為中繼資料服務,並選擇上述步驟中建立的DLF Catalog。
在已有Serverless Spark工作空間中綁定
進入Serverless Spark工作空間資料目錄頁面,並添加上述步驟中建立的DLF Catalog,詳情請參見管理資料目錄。
通過Serverless Spark訪問DLF檔案
-
登入 資料湖構建控制台 。
-
在綁定的DLF Catalog的default資料庫下,建立一個名為
object_table的Object表。 -
單擊建立的表,進入表詳情頁,在上方選擇檔案清單頁簽。
-
單擊上傳檔案:employee.csv。
-
返回EMR控制台,在左側導覽列,選擇,進入EMR Serverless Spark的工作空間。
-
在左側導覽列選擇資料開發,
-
在開發目錄頁簽下,單擊
表徵圖,在彈出的對話方塊中,輸入名稱,類型使用Notebook,然後單擊確定。 -
運行下列代碼,訪問測試檔案。
# 路徑需要替換為步驟二中的對應的Catalog Name df = spark.read.option("delimiter", ",").option("header", True).csv("pvfs://catalog_name/default/object_table/employee.csv") # 顯示DataFrame的前幾行 df.show(5) # 執行一個簡單的彙總操作:計算每個部門的總薪資 sum_salary_per_department = df.groupBy("department").agg({"salary": "sum"}).show()+-------------+----------+------+ |employee_name|department|salary| +-------------+----------+------+ | James| Sales| 3000| | Michael| Sales| 4600| | Robert| Marketing| 4100| | Maria| Finance| 3000| | James| Sales| 3000| +-------------+----------+------+ only showing top 5 rows +----------+-----------+ |department|sum(salary)| +----------+-----------+ | Sales| 12600.0| | Finance| 6900.0| | Marketing| 10400.0| +----------+-----------+