Topik ini menjelaskan cara mengakses sistem file virtual Paimon (PVFS) dari Serverless Spark.
Batasan
Fitur ini hanya tersedia pada versi EMR esr-3.5.0, esr-2.9.0, esr-4.6.0, dan yang lebih baru.
Buat katalog DLF
Lihat Memulai dengan DLF.
Sambungkan Katalog DLF di Serverless Spark
Anda dapat menyambungkan Katalog DLF saat membuat ruang kerja Serverless Spark baru atau menambahkannya ke ruang kerja yang sudah ada.
Sambungkan katalog saat membuat ruang kerja Serverless Spark baru
Untuk membuat ruang kerja Serverless Spark, lihat Buat ruang kerja.
Saat membuat ruang kerja, aktifkan Use DLF As Metadata Service dan pilih Katalog DLF yang telah Anda buat.

Sambungkan katalog ke ruang kerja Serverless Spark yang sudah ada
Buka halaman Katalog Data ruang kerja Serverless Spark Anda dan tambahkan Katalog DLF yang telah Anda buat. Untuk informasi selengkapnya, lihat Kelola katalog data.
Satu ruang kerja hanya mendukung satu versi katalog data DLF dalam satu waktu. Jika ruang kerja Anda sudah memiliki katalog data DLF-Legacy, Anda harus membuat ruang kerja baru untuk menggunakan katalog data DLF standar. Alternatifnya, Anda dapat menghapus katalog DLF-Legacy sebelum menambahkan yang baru. Pastikan katalog tersebut tidak digunakan oleh pekerjaan yang sedang berjalan di ruang kerja sebelum menghapusnya.
Akses file DLF dari Serverless Spark
Masuk ke Konsol Data Lake Formation.
Di database default katalog DLF yang terikat, buat Object table bernama
object_table.Klik tabel tersebut untuk membuka halaman detailnya, lalu klik tab File List di bagian atas halaman.
Klik Upload File dan unggah file employee.csv.
Buka Konsol EMR. Di panel navigasi sebelah kiri, pilih .
Di panel navigasi sebelah kiri, pilih Data Development.
Di tab Development Folder, klik ikon
. Di kotak dialog yang muncul, masukkan nama, atur Jenis menjadi Notebook, lalu klik OK.Jalankan kode berikut untuk mengakses file uji.
# Ganti catalog_name dengan nama katalog DLF Anda. df = spark.read.option("delimiter", ",").option("header", True).csv("pvfs://catalog_name/default/object_table/employee.csv") # Tampilkan beberapa baris pertama dari DataFrame. df.show(5) # Lakukan operasi agregasi sederhana: hitung total gaji untuk setiap departemen. sum_salary_per_department = df.groupBy("department").agg({"salary": "sum"}).show()