All Products
Search
Document Center

Data Lake Formation:Akses DLF dari Serverless Spark

Last Updated:Nov 11, 2025

Topik ini menjelaskan cara mengakses sistem file virtual Paimon (PVFS) dari Serverless Spark.

Batasan

Fitur ini hanya tersedia pada versi EMR esr-3.5.0, esr-2.9.0, esr-4.6.0, dan yang lebih baru.

Buat katalog DLF

Lihat Memulai dengan DLF.

Sambungkan Katalog DLF di Serverless Spark

Anda dapat menyambungkan Katalog DLF saat membuat ruang kerja Serverless Spark baru atau menambahkannya ke ruang kerja yang sudah ada.

Sambungkan katalog saat membuat ruang kerja Serverless Spark baru

Untuk membuat ruang kerja Serverless Spark, lihat Buat ruang kerja.

Penting

Saat membuat ruang kerja, aktifkan Use DLF As Metadata Service dan pilih Katalog DLF yang telah Anda buat.

image

Sambungkan katalog ke ruang kerja Serverless Spark yang sudah ada

Buka halaman Katalog Data ruang kerja Serverless Spark Anda dan tambahkan Katalog DLF yang telah Anda buat. Untuk informasi selengkapnya, lihat Kelola katalog data.

Catatan

Satu ruang kerja hanya mendukung satu versi katalog data DLF dalam satu waktu. Jika ruang kerja Anda sudah memiliki katalog data DLF-Legacy, Anda harus membuat ruang kerja baru untuk menggunakan katalog data DLF standar. Alternatifnya, Anda dapat menghapus katalog DLF-Legacy sebelum menambahkan yang baru. Pastikan katalog tersebut tidak digunakan oleh pekerjaan yang sedang berjalan di ruang kerja sebelum menghapusnya.

Akses file DLF dari Serverless Spark

  1. Masuk ke Konsol Data Lake Formation.

  2. Di database default katalog DLF yang terikat, buat Object table bernama object_table.

  3. Klik tabel tersebut untuk membuka halaman detailnya, lalu klik tab File List di bagian atas halaman.

  4. Klik Upload File dan unggah file employee.csv.

  5. Buka Konsol EMR. Di panel navigasi sebelah kiri, pilih EMR Serverless > Spark.

  6. Di panel navigasi sebelah kiri, pilih Data Development.

  7. Di tab Development Folder, klik ikon image. Di kotak dialog yang muncul, masukkan nama, atur Jenis menjadi Notebook, lalu klik OK.

  8. Jalankan kode berikut untuk mengakses file uji.

    # Ganti catalog_name dengan nama katalog DLF Anda.
    df = spark.read.option("delimiter", ",").option("header", True).csv("pvfs://catalog_name/default/object_table/employee.csv")
    # Tampilkan beberapa baris pertama dari DataFrame.
    df.show(5)
    # Lakukan operasi agregasi sederhana: hitung total gaji untuk setiap departemen.
    sum_salary_per_department = df.groupBy("department").agg({"salary": "sum"}).show()

    image