All Products
Search
Document Center

Data Lake Formation:Integrasi

Last Updated:Jun 25, 2026

Data Lake Formation (DLF) terintegrasi dengan mesin komputasi data besar utama untuk beban kerja lakehouse real-time dan offline serta Pemrosesan Analitik Online (OLAP), dengan dukungan native untuk Flink (VVP), EMR Serverless Spark, EMR Serverless StarRocks, dan EMR on ECS.

Mesin yang didukung dan metode koneksi

Tabel berikut mencantumkan mesin dan alat yang didukung untuk setiap metode integrasi:

Metode integrasi

Mesin/alat yang didukung

Paimon REST

Iceberg REST

File access

Lance

Catatan

Kluster Spark yang dikelola sendiri tidak didukung. Untuk menggunakan Spark dengan DLF, pilih EMR Serverless Spark atau EMR on ECS dari Alibaba Cloud.

Metode integrasi

DLF menyediakan empat metode integrasi, masing-masing dirancang untuk tipe mesin dan pola akses yang berbeda:

  1. Paimon REST: Antarmuka layanan metadata RESTful yang mengikuti standar komunitas Apache Paimon. Pilih metode ini jika mesin komputasi Anda dibangun di atas Apache Paimon. Metode ini menangani manajemen skema tabel dan kueri Snapshot.

  2. Iceberg REST: Antarmuka layanan metadata RESTful yang mengikuti standar komunitas Apache Iceberg. Pilih metode ini jika mesin komputasi Anda dibangun di atas Apache Iceberg. Metode ini menangani manajemen skema tabel dan kueri Snapshot.

  3. File access: Menyajikan data tabel sebagai path file standar melalui Paimon Virtual File System (PVFS), memberikan akses langsung ke file data dan metadata yang mendasarinya tanpa memerlukan mesin komputasi lengkap. Metode ini cocok untuk eksplorasi berbasis skrip, debugging, dan pemrosesan data ringan.

  4. Lance: Terhubung ke DLF Catalog melalui SDK Python (lance-dlf) untuk membaca dan menulis tabel Lance. Metode ini mendukung penyaringan kueri dan pemrosesan batch dengan mesin DataFrame Daft.