Anda dapat menggunakan tugas sinkronisasi ETL real-time untuk menyinkronkan data dari sumber seperti DataHub dan Hologres ke Kafka. Tugas ini menginisialisasi topik Kafka berdasarkan skema tabel sumber dan terus-menerus menyinkronkan data untuk konsumsi downstream.
Batasan
Versi sumber data Kafka harus berkisar antara 0.10.2 hingga 3.6.0.
Versi sumber data Hologres harus V2.1 atau lebih baru.
Sinkronisasi inkremental data dari tabel partisi Hologres tidak didukung.
Pesan untuk perubahan DDL pada tabel Hologres tidak dapat disinkronkan.
Data inkremental dari tipe data berikut dapat disinkronkan dari Hologres: INTEGER, BIGINT, TEXT, CHAR(n), VARCHAR(n), REAL, JSON, SERIAL, OID, INT4[], INT8[], FLOAT8[], BOOLEAN[], TEXT[], dan JSONB.
Anda harus mengaktifkan binary logging untuk tabel Hologres di database Hologres sumber. Untuk informasi selengkapnya, lihat Berlangganan log biner Hologres.
Prasyarat
Kelompok sumber daya Serverless telah dibeli.
Sumber data Hologres dan Kafka telah dibuat. Untuk informasi selengkapnya, lihat Membuat sumber data untuk Data Integration.
Konektivitas jaringan antara kelompok sumber daya dan sumber data telah ditetapkan. Untuk informasi selengkapnya, lihat Solusi konektivitas jaringan.
Prosedur
1. Pilih jenis tugas sinkronisasi
Masuk ke Konsol DataWorks. Di wilayah target, klik di panel navigasi sebelah kiri. Pilih ruang kerja dari daftar drop-down dan klik Go to Data Integration.
Di panel navigasi sebelah kiri, klik Sync Tasks. Di bagian atas halaman, klik Create synchronization task dan konfigurasikan parameter berikut.
Data Source And Destination:
Hologres→KafkaNew Task Name: Sesuaikan nama untuk tugas sinkronisasi.
Synchronization Mode:
single-table real-time.Synchronization Mode Step: Pilih
full synchronization.
2. Konfigurasi jaringan dan sumber daya
Di bagian Configure Network Connections and Resource Groups, pilih Resource Group untuk tugas sinkronisasi. Anda juga dapat mengatur Task Resource Usage dalam CUs.
Untuk Source Data Source, pilih sumber data
Hologres. Untuk Destination data source, pilih sumber dataKafka. Lalu, klik Test Connection.Setelah pengujian konektivitas untuk sumber dan tujuan berhasil, klik Next step.
3. Konfigurasi tautan sinkronisasi
a. Konfigurasi sumber Hologres
Di bagian atas halaman, klik sumber data Hologres dan edit Holo source information.

Di bagian Holo source information, pilih skema dan tabel sumber.
Di pojok kanan atas, klik Data Sampling.
Di kotak dialog Preview Data Output, tentukan Sampled Data Records dan klik Start Collection. Ini akan mengambil sampel dan menampilkan pratinjau data dari tabel Hologres.
b. Konfigurasi tujuan Kafka
Di bagian atas halaman, klik tujuan Kafka dan edit Kafka Destination Information.

Di bagian Kafka Destination Information, pilih topik Kafka tempat Anda ingin menulis data.
Atur Merge Source Binlog Update Messages sesuai kebutuhan. Jika Anda mengaktifkan opsi ini, dua pesan pembaruan yang sesuai dengan operasi pembaruan di log biner sumber akan digabung menjadi satu pesan sebelum ditulis ke Kafka.
Konfigurasi Output Format, Key Column, dan Kafka Producer Parameters.
Output Format: Menentukan format nilai untuk catatan yang ditulis ke Kafka. Format yang valid adalah Canal CDC dan JSON. Untuk informasi selengkapnya, lihat Lampiran: Format output.
Key Column: Menentukan kolom sumber yang nilainya diserialisasi menjadi string dan digabung dengan koma untuk membentuk kunci catatan yang ditulis ke topik Kafka.
CatatanAturan serialisasi untuk nilai kolom sama dengan aturan serialisasi JSON untuk tipe data kolom di Hologres.
Nilai kunci di topik Kafka menentukan partisi tempat data ditulis. Data dengan nilai kunci yang sama ditulis ke partisi yang sama. Untuk memastikan bahwa konsumen dapat mengonsumsi data di topik Kafka secara berurutan, kami menyarankan Anda menggunakan kolom kunci primer tabel Hologres sebagai kolom kunci.
Jika tidak ada kolom sumber yang digunakan sebagai kolom kunci, nilai kunci di topik Kafka bernilai null. Dalam kasus ini, data ditulis ke partisi acak di topik Kafka.
Kafka Producer Parameters: Parameter ini mengontrol konsistensi, stabilitas, dan penanganan pengecualian untuk operasi tulis. Konfigurasi default sudah cukup untuk sebagian besar kasus penggunaan. Untuk informasi tentang parameter produsen yang didukung oleh berbagai versi Kafka, lihat dokumentasi resmi Kafka.
4. Peringatan
Untuk mencegah kesalahan tugas menyebabkan keterlambatan dalam sinkronisasi data bisnis, Anda dapat menetapkan kebijakan peringatan untuk tugas sinkronisasi.
-
Klik Alert Settings di pojok kanan atas halaman untuk membuka halaman pengaturan Alert Rule Configurations for Real-time Synchronization Subnode.
-
Klik Add Alert Rule untuk mengonfigurasi aturan peringatan.
CatatanAturan peringatan yang Anda definisikan di sini berlaku untuk subtugas sinkronisasi real-time yang dihasilkan oleh tugas ini. Setelah Anda mengonfigurasi tugas, Anda dapat melihat dan mengubah aturan peringatan untuk subtugas tersebut di halaman Jalankan dan kelola tugas sinkronisasi real-time.
-
Kelola aturan peringatan.
Untuk aturan peringatan yang sudah ada, Anda dapat menggunakan sakel toggle untuk mengaktifkan atau menonaktifkannya. Anda juga dapat mengirim peringatan ke penerima berbeda berdasarkan tingkat peringatan.
5. Pengaturan lanjutan
Tugas sinkronisasi menyediakan beberapa parameter yang dapat Anda ubah sesuai kebutuhan.
Sebelum melakukan perubahan, pastikan Anda memahami sepenuhnya fungsi setiap parameter untuk mencegah kesalahan tak terduga atau masalah kualitas data.
-
Klik advanced settings di pojok kanan atas halaman untuk membuka halaman pengaturan lanjutan.
-
Di halaman advanced settings, ubah nilai parameter sesuai kebutuhan.
6. Kelompok sumber daya
Anda dapat mengklik Configure Resource Group di pojok kanan atas untuk melihat dan mengganti kelompok sumber daya saat ini untuk tugas.
7. Jalankan tugas sinkronisasi
-
Setelah menyelesaikan semua pengaturan, klik Complete di bagian bawah halaman.
-
Di halaman , temukan tugas yang Anda buat dan klik Start di kolom Operations.
-
Klik Name/ID tugas yang sesuai di Task List untuk melihat proses eksekusi terperincinya.
Lakukan operasi O&M pada tugas sinkronisasi
Lihat status tugas sinkronisasi
Setelah tugas sinkronisasi dibuat, buka halaman Tasks untuk melihat semua tugas sinkronisasi di ruang kerja dan informasi dasarnya.
Daftar tugas menampilkan kolom berikut: Name/ID, Data Source Synchronization Solution (jenis sinkronisasi, sumber, dan tujuan), Status, Execution Overview, resource group, dan Actions.
Anda dapat Start atau Stop tugas sinkronisasi di kolom Actions. Di bawah More, Anda dapat melakukan operasi lain, seperti Edit dan View.
Untuk tugas yang sedang berjalan, Anda dapat melihat status dasar di Execution Overview dan klik area ikhtisar yang sesuai untuk melihat detail eksekusi.
Tugas sinkronisasi real-time dari tabel Hologres ke Kafka terdiri dari tiga langkah berikut:
Structure Migration: mencakup metode pembuatan tabel tujuan (tabel yang sudah ada atau pembuatan tabel otomatis). Jika Anda memilih pembuatan tabel otomatis, pernyataan bahasa definisi data (DDL) untuk membuat tabel akan ditampilkan.
Full initialization: Jika Anda memilih Full Sync untuk langkah sinkronisasi tugas Anda, kemajuan inisialisasi penuh akan ditampilkan di sini.
Real-time Data Synchronization: Berisi statistik tentang sinkronisasi real-time, termasuk trafik baca/tulis real-time, data rusak, failover, dan log operasi.
Jalankan ulang tugas
Dalam kasus khusus, seperti ketika Anda perlu mengubah bidang yang disinkronkan atau menyesuaikan informasi tabel target, Anda dapat mengklik Rerun di kolom Operations tugas sinkronisasi. Tindakan ini menyinkronkan bidang yang telah disesuaikan dan perubahan lainnya ke target. Proses ini melewati tabel yang tidak berubah dan sebelumnya telah disinkronkan.
-
Untuk menjalankan ulang tugas tanpa perubahan apa pun, klik Rerun.
-
Jika Anda mengedit tugas, klik Complete setelah melakukan perubahan. Aksi tugas berubah menjadi Apply Updates. Mengklik Apply Updates akan menjalankan ulang tugas dengan konfigurasi baru.
Lampiran: Deskripsi format output
Canal CDC
Canal CDC adalah format data CDC yang didefinisikan oleh Alibaba Canal.
Json
Format JSON menggunakan nama bidang log biner Hologres sebagai kunci dan menserialisasi nilai bidang menjadi string. Pasangan kunci-nilai yang dihasilkan ditulis ke topik Kafka sebagai string berformat JSON.