All Products
Search
Document Center

Data Lake Formation:Manajemen data

Last Updated:Jun 05, 2026

Data Lake Formation (DLF) menyediakan API manajemen tabel yang kompatibel dengan Apache Paimon REST Catalog. Struktur penyimpanan file-nya sepenuhnya kompatibel dengan Paimon, sehingga mesin atau aplikasi apa pun yang mendukung Paimon dapat membuat, memperbarui, mengkueri, dan menghapus tabel yang dikelola oleh DLF.

Hierarki data utama dalam sebuah catalog adalah sebagai berikut:

  1. Catalog: Kontainer tingkat teratas untuk metadata. Sebuah catalog mengorganisasi sumber daya dalam hierarki yang menerapkan isolasi dan batas izin lintas layanan dan pengguna, serta mengatur operasi penyimpanan data lake dan tabel.

  2. Database: Pengelompokan logis di dalam catalog yang menyediakan organisasi dan kontrol akses yang lebih terperinci.

  3. Table: DLF mendukung berbagai tipe tabel untuk manajemen terpadu dan kompatibilitas mulus dengan berbagai mesin komputasi dan format. Untuk mengaktifkan enkripsi saat data tidak aktif (encryption at rest), kirimkan Tiket.

  4. View: View dipertahankan di DLF dan mendukung berbagai dialek SQL, memungkinkan konfigurasi lintas berbagai mesin komputasi.

  5. Function: Function dipertahankan di DLF dan saat ini mendukung Flink JAR (Java dan Python) serta fungsi Java Lambda yang dieksekusi pada mesin Spark.

Layanan metadata terpadu

DLF menyediakan layanan manajemen metadata terpadu. Satu catalog mengelola metadata untuk tabel, view, dan function secara terpusat, menghilangkan silo antar mesin komputasi sehingga mesin data besar dan AI Alibaba Cloud dapat mengakses data omni-modal tanpa perlu konfigurasi per mesin.

Dukungan data multi-modal

DLF mengelola data terstruktur maupun data tidak terstruktur melalui satu catalog, dengan dukungan native untuk format tabel terbuka utama dan tipe data AI:

  • Format data lake: Dukungan penuh untuk Apache Paimon, Apache Iceberg, dan komponen ekosistemnya.

  • Data AI dan vektor: Dukungan untuk format Lance guna pengambilan dan pelatihan AI berkinerja tinggi.

  • Data tidak terstruktur: Kelola set data non-tabular seperti gambar dan video menggunakan Object Tables, menyediakan interoperabilitas antara penyimpanan dan komputasi.

  • Format file standar: Dukungan untuk tabel format kompatibel Hive, termasuk Parquet, CSV, dan ORC.

Kontrol akses terpadu

DLF memusatkan manajemen keamanan sehingga izin yang diberikan sekali berlaku secara otomatis di semua mesin komputasi yang terhubung tanpa perlu konfigurasi per mesin.

  • Otorisasi granular: Kontrol akses pada empat level—catalog, database, tabel, dan kolom.

  • Sinkronisasi multi-mesin: Otorisasi suatu operasi cukup dilakukan sekali, dan kebijakan tersebut langsung berlaku di semua mesin komputasi yang terhubung.

Hal ini menjamin akses data yang konsisten, keamanan yang lebih kuat, serta menyederhanakan proses operasi dan maintenance (O&M) lintas mesin secara signifikan.