All Products
Search
Document Center

Realtime Compute for Apache Flink:Pemilihan Solusi Arsitektur Lakehouse Streaming Paimon

Last Updated:Sep 19, 2026

Apache Paimon adalah format penyimpanan lakehouse yang menyatukan pemrosesan data streaming dan batch. Dibangun di atas teknologi log-structured merge-tree (LSM), Paimon menyediakan semantik pembaruan real-time pada lapisan lake dengan pembacaan konsisten dan throughput tinggi. Anda dapat menggunakan tabel Paimon dalam Realtime Compute for Apache Flink untuk membangun lakehouse streaming di penyimpanan cloud seperti Object Storage Service (OSS).

Paimon terintegrasi dengan Apache Flink untuk pemrosesan aliran dan Apache Spark untuk pemrosesan batch melalui satu format penyimpanan. Kemampuan utamanya meliputi:

  • Ingesti data real-time: Ingest puluhan juta catatan dari aliran perubahan database seperti MySQL CDC, dengan sinkronisasi perubahan skema otomatis dan latensi rendah.

  • Pemrosesan aliran dan batch terpadu: Baca tabel Paimon yang sama sebagai sumber batch berbatas di Spark atau sebagai aliran changelog tak berbatas di Flink, tanpa perlu konversi format.

  • Integrasi ekosistem luas: Hubungkan tabel Paimon ke Realtime Compute for Apache Flink, E-MapReduce (Spark, StarRocks, Hive, dan Trino), serta MaxCompute tanpa duplikasi data.

  • Kueri OLAP latensi rendah: Vektor penghapusan dan indeks kunci primer menjaga latensi kueri pada tingkat menit untuk beban kerja streaming, batch, dan pemrosesan analitik online (OLAP).

Untuk spesifikasi lengkap, lihat Apache Paimon.

Penggunaan

Mulai menggunakan Paimon

Buat katalog Paimon

Katalog Paimon adalah registri terpusat untuk tabel Paimon yang disimpan di sistem eksternal seperti OSS. Layanan Alibaba Cloud lainnya mengakses tabel tersebut melalui katalog yang sama. Anda dapat menyiapkan katalog dengan salah satu cara berikut:

Buat tabel Paimon

Tulis data ke tabel Paimon

Konsumsi data dari tabel Paimon

  • Kueri atau konsumsi data dari tabel Paimon dalam mode batch atau streaming. Untuk informasi selengkapnya, lihat Konsumsi data dari tabel Paimon. Untuk mengonsumsi data dari tabel kunci primer dalam mode streaming, konfigurasikan produsen changelog terlebih dahulu.

  • Konfigurasikan offset konsumen tabel Paimon. Untuk informasi selengkapnya, lihat Konsumsi data dari offset tertentu.

  • Simpan offset konsumen tabel Paimon atau pertahankan file snapshot kedaluwarsa yang masih dirujuk oleh konsumen aktif. Untuk informasi selengkapnya, lihat Tentukan ID konsumen.

  • Jalankan pekerjaan batch untuk membaca status historis tabel Paimon dari snapshot tertentu. Untuk informasi selengkapnya, lihat Perjalanan waktu batch.

Rawat tabel Paimon