Apache Paimon adalah format penyimpanan lakehouse yang menyatukan pemrosesan data streaming dan batch. Dibangun di atas teknologi log-structured merge-tree (LSM), Paimon menyediakan semantik pembaruan real-time pada lapisan lake dengan pembacaan konsisten dan throughput tinggi. Anda dapat menggunakan tabel Paimon dalam Realtime Compute for Apache Flink untuk membangun lakehouse streaming di penyimpanan cloud seperti Object Storage Service (OSS).
Paimon terintegrasi dengan Apache Flink untuk pemrosesan aliran dan Apache Spark untuk pemrosesan batch melalui satu format penyimpanan. Kemampuan utamanya meliputi:
-
Ingesti data real-time: Ingest puluhan juta catatan dari aliran perubahan database seperti MySQL CDC, dengan sinkronisasi perubahan skema otomatis dan latensi rendah.
-
Pemrosesan aliran dan batch terpadu: Baca tabel Paimon yang sama sebagai sumber batch berbatas di Spark atau sebagai aliran changelog tak berbatas di Flink, tanpa perlu konversi format.
-
Integrasi ekosistem luas: Hubungkan tabel Paimon ke Realtime Compute for Apache Flink, E-MapReduce (Spark, StarRocks, Hive, dan Trino), serta MaxCompute tanpa duplikasi data.
-
Kueri OLAP latensi rendah: Vektor penghapusan dan indeks kunci primer menjaga latensi kueri pada tingkat menit untuk beban kerja streaming, batch, dan pemrosesan analitik online (OLAP).
Untuk spesifikasi lengkap, lihat Apache Paimon.
Penggunaan
Mulai menggunakan Paimon
-
Pahami konsep inti dan operasi dasar sebelum membangun pipeline produksi. Untuk informasi selengkapnya, lihat Panduan cepat Paimon: fitur dasar.
-
Pilih jenis tabel yang sesuai dengan workload Anda: gunakan tabel kunci primer ketika data memerlukan operasi insert, update, atau delete streaming, dan tabel append-only (tanpa kunci primer) untuk workload insert-only seperti sinkronisasi log.
-
Untuk memahami cara Paimon menjaga kesegaran dan konsistensi data di seluruh snapshot, lihat Latensi dan konsistensi data.
-
Untuk panduan langkah demi langkah membangun lakehouse streaming secara end-to-end, lihat Lakehouse streaming Paimon dan StarRocks.
Buat katalog Paimon
Katalog Paimon adalah registri terpusat untuk tabel Paimon yang disimpan di sistem eksternal seperti OSS. Layanan Alibaba Cloud lainnya mengakses tabel tersebut melalui katalog yang sama. Anda dapat menyiapkan katalog dengan salah satu cara berikut:
-
Buat dan gunakan katalog Paimon. Untuk informasi selengkapnya, lihat Kelola katalog Paimon.
-
Sinkronkan metadata tabel Paimon ke Data Lake Formation (DLF). Untuk informasi selengkapnya, lihat Buat katalog DLF.
-
Buat tabel eksternal Paimon di MaxCompute untuk mengkueri data Paimon dari MaxCompute. Untuk informasi selengkapnya, lihat Buat katalog MaxCompute.
-
Sinkronkan metadata ke DLF dan buat tabel eksternal Paimon di MaxCompute secara bersamaan. Untuk informasi selengkapnya, lihat Buat katalog sinkronisasi Paimon.
Buat tabel Paimon
-
Buat tabel langsung di dalam katalog Paimon. Untuk informasi selengkapnya, lihat Kelola tabel.
-
Buat tabel Paimon dengan menyinkronkan tabel dari sumber seperti MySQL dan Kafka menggunakan pekerjaan ingesti data Flink CDC. Untuk informasi selengkapnya, lihat Ingesti log real-time ke data lake dan Ingesti data database ke data lake secara real-time.
Tulis data ke tabel Paimon
-
Insert atau update catatan di tabel Paimon. Untuk informasi selengkapnya, lihat Tulis data ke tabel Paimon.
-
Join tabel Paimon dengan tabel lain dan terapkan fungsi agregat. Untuk informasi selengkapnya, lihat Mesin merge.
-
Timpa sebagian atau seluruh isi tabel Paimon. Untuk informasi selengkapnya, lihat Timpa data dengan INSERT OVERWRITE.
-
Hapus baris dari tabel Paimon. Untuk informasi selengkapnya, lihat Hapus data menggunakan DELETE.
-
Hapus partisi dari tabel Paimon. Untuk informasi selengkapnya, lihat Modifikasi skema tabel.
Konsumsi data dari tabel Paimon
-
Kueri atau konsumsi data dari tabel Paimon dalam mode batch atau streaming. Untuk informasi selengkapnya, lihat Konsumsi data dari tabel Paimon. Untuk mengonsumsi data dari tabel kunci primer dalam mode streaming, konfigurasikan produsen changelog terlebih dahulu.
-
Konfigurasikan offset konsumen tabel Paimon. Untuk informasi selengkapnya, lihat Konsumsi data dari offset tertentu.
-
Simpan offset konsumen tabel Paimon atau pertahankan file snapshot kedaluwarsa yang masih dirujuk oleh konsumen aktif. Untuk informasi selengkapnya, lihat Tentukan ID konsumen.
-
Jalankan pekerjaan batch untuk membaca status historis tabel Paimon dari snapshot tertentu. Untuk informasi selengkapnya, lihat Perjalanan waktu batch.
Rawat tabel Paimon
-
Atasi masalah umum dengan Paimon. Untuk informasi selengkapnya, lihat Konektor.
-
Tingkatkan performa baca dan tulis untuk tabel Paimon. Untuk informasi selengkapnya, lihat Optimasi performa tabel Paimon.
-
Periksa metadata tabel seperti daftar partisi dan ukuran file per partisi. Untuk informasi selengkapnya, lihat Tabel sistem Paimon.
-
Modifikasi skema tabel dalam katalog Paimon. Untuk informasi selengkapnya, lihat Modifikasi skema tabel.
-
Hapus tabel dari katalog Paimon. Untuk informasi selengkapnya, lihat Hapus tabel.
-
Ubah jumlah bucket untuk tabel Paimon dalam mode fixed bucket. Untuk informasi selengkapnya, lihat Ubah jumlah bucket dalam mode fixed bucket.
-
Bersihkan file usang dari direktori tabel Paimon. Untuk informasi selengkapnya, lihat Bersihkan data kedaluwarsa.