Topik ini menjelaskan perubahan fitur utama dan peningkatan pengalaman pada VVR 11.8.0 Realtime Compute for Apache Flink.
Rilis ini sedang diterapkan secara bertahap di seluruh jaringan. Untuk memantau progres peningkatan, periksa pengumuman terbaru di panel kanan Konsol Realtime Compute. Jika kemampuan yang dijelaskan belum tersedia di akun Anda, kemungkinan akun Anda belum menyelesaikan peningkatan grayscale. Untuk mempercepat proses peningkatan, ajukan Tiket dengan menyertakan kebutuhan bisnis Anda, dan kami akan menjadwalkannya sesuai kebutuhan.
Ikhtisar
VVR 11.8.0 Realtime Compute for Apache Flink dibangun di atas Apache Flink 1.20.4. Peningkatan ini berfokus pada penguatan inferensi AI real-time dan pemrosesan data multimodal, ingesti data dan CDC, keamanan konektor serta manajemen kredensial cloud, sekaligus mengintegrasikan berbagai peningkatan dari Apache Flink 1.20.4.
Untuk skenario AI, VVR memperluas SQL, API DataFrame, dan Flink Agents untuk mendukung data multimodal (gambar, audio, video) serta pemanggilan model besar, dan memperkenalkan kemampuan tata kelola seperti pengecualian registrasi model, batasan token usage, dan cache eksternal. Di sisi ingesti data, pipeline Kafka, MySQL CDC, SQL Server CDC, Paimon, dan StarRocks terus ditingkatkan dalam hal kompatibilitas format, evolusi skema, penyetelan konkurensi, dan penanganan tipe data. Di sisi konektor, rilis ini lebih lanjut meningkatkan kemampuan keamanan seperti integrasi KMS, akses tanpa kredensial, AssumeRole, dan sertifikat SSL/TLS, serta peningkatan kegunaan dan stabilitas untuk konektor MySQL, Hologres, Redis, Iceberg, dan Fluss.
Engine
Inferensi AI real-time, komputasi multimodal, pencarian vektor, async lookup, dan kemampuan komunitas Apache Flink terus ditingkatkan guna menyediakan fondasi yang lebih lengkap untuk skenario pemrosesan data real-time cerdas.
Fungsi AI, API DataFrame, dan komputasi multimodal
-
Dukungan Fungsi AI multimodal: Fungsi AI SQL kini mendukung skenario pemrosesan data multimodal seperti audio dan video, dengan peningkatan kemampuan dan cakupan pengujian end-to-end untuk operator gambar, video, dan audio.
-
Pengecualian registrasi model bawaan: Saat menggunakan model bawaan yang disediakan oleh akun master platform, registrasi model tidak lagi diperlukan, sehingga menurunkan hambatan pemanggilan model.
-
Tata kelola token usage: Fungsi AI SQL dan PyFlink mendukung parameter
max-total-tokensuntuk membatasi total token yang dikonsumsi dalam satu kali eksekusi pekerjaan, membantu mengendalikan biaya pemanggilan model. -
Dukungan cache eksternal: Fungsi AI mendukung penyimpanan eksternal sebagai cache, meningkatkan efisiensi pemrosesan untuk permintaan inferensi yang berulang.
-
Peningkatan API DataFrame: API DataFrame (Tahap 3) ditingkatkan untuk mendukung sumber data multimodal, pemanggilan model besar, dan operator multimodal. Kemampuan baru mencakup aksesor bergaya namespace dan fungsi
read_video_frames, yang meningkatkan pengalaman pemrosesan data video. -
Integrasi Flink Agents: Flink Agents kini dapat dipanggil sebagai fungsi bernilai tabel (TVF) dalam pekerjaan SQL, disesuaikan dengan Flink Agents 0.3.
Pencarian vektor dan async lookup
-
Pencarian vektor DLF Paimon: Fungsi
vector_searchdanvector_search_aggmendukung pencarian pada tabel vektor DLF Paimon, memperkuat integrasi antara data lakehouse dan skenario pencarian vektor. -
Penanganan timeout Lookup Join: Lookup Join berbasis
AsyncLookupFunctiondanAsyncTableFunctionmendukung logika penanganan timeout yang ditentukan pengguna, memberikan kontrol lebih baik dalam skenario kueri asinkron.
Sinkronisasi kemampuan komunitas Apache Flink 1.20.4
-
Peningkatan dan perbaikan bug dari Apache Flink 1.20.4 telah diintegrasikan untuk terus meningkatkan kebenaran pekerjaan, stabilitas, dan pengalaman pengembangan.
Ingesti Data (Flink CDC)
Rilis ini terus meningkatkan pipeline ingesti data untuk Kafka, MySQL CDC, SQL Server CDC, Paimon, dan StarRocks, dengan peningkatan kompatibilitas format, penanganan tipe data, dan efisiensi operasional.
Kafka dan Canal JSON
-
Metadata dan DDL Canal JSON: Metadata seperti
mysqlTypedansqlTypedipertahankan, dan sinkronisasi perubahan DDL didukung, meningkatkan kompatibilitas dengan protokol Canal. -
Hanya mengeluarkan bidang yang berubah: Output Kafka Canal JSON mendukung opsi untuk hanya menyertakan bidang yang berubah, mengurangi beban pemrosesan downstream.
-
Format kustom dan optimisasi inferensi tipe: Konektor Kafka mendukung format kustom. Untuk data Canal JSON, Debezium JSON, dan JSON, inferensi tipe tidak lagi secara otomatis mencoba mengonversi string menjadi tipe waktu.
-
Validasi konfigurasi idempotensi Kafka: Untuk skenario Kafka cloud tertentu, pekerjaan mendeteksi pengaturan idempotensi yang tidak kompatibel dan memberikan petunjuk yang jelas, mengurangi kesalahan konfigurasi.
MySQL, SQL Server, dan StarRocks
-
Validasi parameter MySQL CDC: Validasi parameter Debezium distandarkan untuk meningkatkan visibilitas terhadap masalah konfigurasi.
-
Kontrol propagasi Binlog downstream: Propagasi Binlog MySQL ke operator downstream kini dapat dikontrol sesuai kebutuhan melalui konfigurasi.
-
Pembatasan laju sumber: Sumber MySQL mendukung pembatasan laju berdasarkan metrik seperti
numRecordsInOfSourcePerSecond, membantu mengendalikan tekanan pemrosesan downstream. -
SQL Server CDC: Ingesti data kini mendukung Sumber SQL Server dengan kolom metadata
op_typeuntuk mengidentifikasi jenis operasi perubahan. -
Peningkatan Sink StarRocks: Mendukung parameter
sink.ignore-update-before. Pipeline YAML dari MySQL ke StarRocks kini memiliki dukungan tipe JSON yang lebih baik.
Paimon, YAML, dan operasi ingesti
-
Paimon melewatkan commit pada tabel kosong: Ketika tabel tidak memiliki data yang ditulis, commit-nya dapat dilewati untuk mengurangi overhead commit yang tidak perlu.
-
Katalog DLS Paimon: Katalog Filesystem kini mendukung DLS, memperluas skenario penerapan dan akses lakehouse.
-
Strategi distribusi Source-to-Sink: Distribusi data dari Source ke Sink dapat dikonfigurasi dalam mode strategi, meningkatkan kemampuan konfigurasi untuk topologi kompleks.
-
Autopilot pekerjaan YAML: Pekerjaan YAML mendukung pembaruan paralelisme melalui Autopilot, meningkatkan penyetelan elastis.
-
Kompatibilitas perubahan skema: Kompatibilitas berbagai Sink terhadap perubahan skema telah ditinjau dan ditingkatkan, mempermudah desain pekerjaan dan evaluasi perubahan.
Konektor
Keamanan, kredensial, dan autentikasi
-
Kerangka kerja integrasi KMS: Kemampuan integrasi KMS ditambahkan atau ditingkatkan di sisi konektor, mempermudah manajemen terpusat kredensial untuk database dan sistem eksternal lainnya. Konektor PostgreSQL CDC mendukung integrasi KMS.
-
Konektor tanpa kredensial: Akses tanpa kredensial di tingkat kerangka kerja ditingkatkan, dengan dukungan untuk skenario seperti akses tanpa kredensial melalui konektor Fluss.
-
AssumeRole OSS: OSS mendukung penggunaan role kustom melalui AssumeRole alih-alih AccessKey/SecretKey, meningkatkan keamanan dan fleksibilitas akses cloud.
-
Dukungan sertifikat SSL/TLS: Konektor mendukung konfigurasi path file sertifikat SSL/TLS kustom melalui parameter. Untuk skenario yang tidak mendukung parameter sertifikat terpisah, sertifikat gabungan dapat digunakan.
MySQL, Hologres, Redis, dan Iceberg
-
Penulisan batch Sink MySQL: Konektor MySQL mendukung insert batch saat menulis ke tabel tanpa primary key, meningkatkan throughput penulisan.
-
Penanganan penghapusan MySQL: Sink MySQL mendukung mode yang mengabaikan event DELETE, memenuhi strategi sinkronisasi tertentu.
-
Optimisasi Sink Hologres: Saat
ignore-nulldigunakan melalui ekspresi, deduplikasi di sisi client didukung, meningkatkan performa pipeline penulisan dan konsistensi hasil. -
Optimisasi kolam koneksi Redis: Implementasi kolam koneksi konektor Redis dioptimalkan, meningkatkan stabilitas dalam skenario koneksi berkonkurensi tinggi.
-
Parameter klien OSS Iceberg: Konektor Iceberg mendukung penyetelan parameter Klien OSS, memberikan lebih banyak opsi konfigurasi untuk akses penyimpanan objek.
Peningkatan kompatibilitas dan stabilitas
-
Validasi konfigurasi, penanganan format, inferensi tipe, dan prompt waktu proses untuk ingesti data dan konektor telah dioptimalkan, mengurangi biaya konfigurasi dan operasional pekerjaan.
-
Masalah kebenaran dan stabilitas pada Apache Flink, Flink CDC, dan konektor inti terus diperbaiki, meningkatkan keandalan pekerjaan produksi.