All Products
Search
Document Center

MaxCompute:Analitik Data Lake (Data Lakehouse)

Last Updated:Aug 21, 2026
MaxCompute menyediakan berbagai solusi analitik data lake yang menjembatani data lake dan gudang data, menggabungkan fleksibilitas data lake serta ekosistem multi-engine dengan kemampuan enterprise-grade gudang data untuk membangun platform manajemen data terintegrasi.

Analitik data lake dan arsitektur terbuka lakehouse

  • Gudang data menekankan tata kelola data terstruktur dan semi-terstruktur. Tata kelola yang kuat memungkinkan performa komputasi lebih baik dan standarisasi pengelolaan data.

  • Data lake menekankan keterbukaan penyimpanan dan universalitas format. Data lake mendukung berbagai engine yang memproduksi atau mengonsumsi data sesuai kebutuhan, menawarkan tata kelola ringan untuk mempertahankan fleksibilitas, mengakomodasi data tidak terstruktur, serta mendukung schema-on-read.

MaxCompute memperkenalkan solusi lakehouse yang menggabungkan keunggulan keduanya.

Analitik data lake

MaxCompute terhubung ke data lake melalui kemampuan berikut:

  • Komputasi batch berperforma tinggi dan hemat biaya yang memproses data secara kolaboratif dengan engine data lake lainnya;

  • Perluasan tata kelola gudang data ke data lake untuk meningkatkan keamanan dan kontrol;

  • Konsolidasi data bernilai tinggi ke dalam gudang data;

  • Komputasi terfederasi lintas gudang data, data lake, dan database.

Arsitektur terbuka lakehouse

MaxCompute menggunakan arsitektur pemisahan penyimpanan dan komputasi. Desain penyimpanan terbuka, metadata terbuka, dan dukungan multi-engine membentuk arsitektur terbuka lakehouse dengan kemampuan berikut:

  • Penemuan dan tata kelola metadata di data lake;

  • Tampilan metadata terpadu yang mengekspos metadata tabel data lake yang dikelola MaxCompute maupun gudang data kepada konsumen eksternal;

  • Penyimpanan terbuka yang mendukung engine MaxCompute maupun pihak ketiga;

  • Layanan metadata dan data yang mengatur operasi baca/tulis multi-engine. Layanan ini mengontrol izin lintas engine, mengoordinasikan penulisan, menyebarkan pembaruan metadata secara instan ke seluruh engine, menerapkan aturan pembacaan data (seperti penyembunyian), serta mendukung pemeliharaan data otomatis (seperti auto-compaction).

Untuk informasi lebih lanjut, lihat Ikhtisar Arsitektur Terbuka Lakehouse.

Fitur analitik data lake MaxCompute

MaxCompute menawarkan kemampuan analitik data lake yang disusun berdasarkan tingkat tata kelola atas data eksternal, dari yang paling lemah hingga paling kuat: Schemaless Query, tabel eksternal, dan tabel lake terkelola. Karena layanan metadata juga tersedia dalam spesifikasi DLF dan filesystem catalog, MaxCompute menyediakan External Schema dan External Project untuk memetakan sumber metadata eksternal guna analisis.

Schemaless Query

Fitur: Schemaless Query memungkinkan SQL MaxCompute mengakses langsung data di direktori OSS — Parquet, CSV, JSON — tanpa perlu menentukan skema atau partisi terlebih dahulu. Fitur ini mengurai data sampel untuk memperoleh metadata secara otomatis (skema Parquet, header CSV, struktur JSON). Hasilnya dapat diekspor ke OSS, ditulis ke tabel internal, atau digunakan sebagai subkueri.

Tabel eksternal

Ikhtisar tabel eksternal menggunakan DDL untuk menentukan nama, skema, properti, izin, lokasi, dan protokol akses data di luar MaxCompute. Metadata ini memungkinkan engine SQL terhubung ke sumber eksternal, mengambil dan memperbarui metadata, serta membaca, menghitung, dan menulis data.

Tabel lake

MaxCompute menyediakan tabel lake untuk membawa kemampuan tata kelola penuh ke data lake. Tabel lake dibangun di atas OSS, Iceberg, layanan metadata MaxCompute, Storage API, dan konektor engine open-source.

  • Iceberg menyediakan informasi skema dan partisi, memungkinkan evolusi skema yang fleksibel;

  • Metadata disimpan di layanan metadata MaxCompute. Semua engine mengikuti aturan baca terpadu, dan pembaruan metadata yang dipicu oleh penulisan langsung terlihat oleh engine lain;

  • Tata kelola mencakup izin terpadu dan pemeliharaan file. Untuk keterbukaan native, tabel lake juga akan menyediakan layanan metadata Iceberg REST Catalog native dan akses read-only ke file snapshot Iceberg yang disimpan langsung di OSS.

Untuk informasi lebih lanjut, lihat Tabel Iceberg yang dikelola MaxCompute (beta). Fitur ini dirilis untuk pratinjau berbasis undangan di wilayah Shanghai dan Jerman pada 7 Mei 2026 (UTC+8).

External Schema dan External Project

Berbeda dengan tabel eksternal, External Schema dan External Project tidak menyimpan metadata di MaxCompute—melainkan mengambilnya secara real-time dari sumbernya. Pengguna membuat objek tata kelola yang menentukan cara MaxCompute terhubung ke layanan metadata, layanan data, atau instans database sumber. MaxCompute kemudian mengambil metadata melalui objek ini dan memetakan semua tabel dalam Catalog, Database, atau Schema sumber.

Fitur dan konsep utama

  • Konektivitas jaringan

    Untuk informasi lebih lanjut, lihat Proses koneksi jaringan. MaxCompute mengakses sumber data VPC melalui koneksi jaringan, seperti instans EMR dan RDS (segera hadir). DLF, OSS, dan Hologres berada di jaringan terinterkoneksi Alibaba Cloud dan tidak memerlukan konfigurasi Networklink.

    Konektivitas jaringan mendukung tabel eksternal, External Schema, dan External Project dalam mengakses sumber data VPC.

  • Foreign Server

    Foreign Server menyimpan kredensial autentikasi, lokasi, dan detail protokol koneksi untuk suatu sumber data. MaxCompute menggunakannya untuk terhubung dan mengakses metadata serta data sumber. Foreign Server merupakan objek tingkat penyewa yang ditentukan oleh administrator penyewa.

    Foreign Server mendukung External Schema dan External Project. Objek ini secara bertahap akan beralih ke objek Connection—berpindah dari cakupan tingkat penyewa ke cakupan tingkat data untuk mendukung tabel lake dan External Schema. External Project yang sebelumnya bergantung pada Foreign Server akan menyimpan informasi koneksi secara langsung. Transisi ini transparan bagi pengguna.

  • External Schema

    External Schema adalah skema dalam proyek MaxCompute yang dipetakan ke tingkat Database sumber (DLF_legacy atau Hive) atau tingkat Schema (Hologres), memberikan akses langsung ke tabel dalam cakupan tersebut. Tabel yang dipetakan melalui External Schema (bukan dibuat di MaxCompute) disebut federated foreign tables (Mounted Tables).

    Federated foreign tables mengambil metadata secara real-time melalui layanan metadata Foreign Server—tidak memerlukan pembuatan DDL. Pengguna mereferensikan tabel sumber menggunakan proyek dan External Schema sebagai namespace. Perubahan pada tabel sumber langsung tercermin. Hierarki pemetaan mencakup dari tingkat Foreign Server hingga tingkat tabel, ditentukan oleh cakupan yang dapat diakses oleh identitas terotentikasi.

  • External Project

    Pada Data Lakehouse 1.0, External Project menggunakan model dua lapis yang dipetakan ke Database sumber (DLF_legacy/Hive) atau Schema (Hologres), memerlukan proyek gudang data sebagai lingkungan eksekusi. Hal ini menyebabkan terlalu banyak External Project. Karena MaxCompute kini menggunakan model tiga lapis yang sesuai dengan hierarki Catalog eksternal, External Project dua lapis sedang dihentikan. Pengguna yang ada dapat melakukan migrasi ke External Schema. Untuk detail migrasi, lihat: Migrasi external project ke external schemas.

    External Project baru dipetakan ke Catalog sumber (DLF) atau Database (Hologres), secara langsung mengekspos Database di bawah Catalog DLF atau Schema di bawah Database Hologres. Lapisan yang dipetakan ini disebut Mounted Schema. Tabel dalam Mounted Schema diakses sebagai federated foreign tables.

Jenis sumber data

Hierarki Foreign Server

Pemetaan External Schema

Pemetaan External Project

Pemetaan External Project Data Lakehouse 1.0 lama

Metode autentikasi

DLF_legacy+OSS

Layanan DLF dan OSS tingkat Wilayah

DLF Catalog.Database

Tidak didukung

DLF Catalog.Database

RAMRole

Hive+HDFS

Instans E-MapReduce

Database Hive

Tidak didukung

Database Hive

Tanpa autentikasi

Hologres

Database instans Hologres

Schema

—

Tidak didukung

RAMRole

Hologres

Database instans Hologres

Tidak didukung

Database

Tidak didukung

Otentikasi identitas SLR dan pengguna saat ini

DLF

Layanan DLF tingkat Wilayah

Tidak didukung

DLF Catalog

Tidak didukung

Otentikasi identitas SLR dan pengguna saat ini

Filesystem Catalog

Direktori tingkat Catalog Paimon di OSS

Tidak didukung

Catalog yang diurai dari direktori tingkat Catalog Paimon

Tidak didukung

RAMRole

Catatan

Sumber data yang berbeda mendukung berbagai metode autentikasi. MaxCompute akan menambahkan lebih banyak metode autentikasi pada rilis mendatang, seperti identitas pengguna saat ini untuk Hologres dan Kerberos untuk Hive.