DataWorks Data Integration menyediakan tugas sinkronisasi real-time berbasis satu tabel yang menangkap perubahan data—berupa penyisipan, penghapusan, dan pembaruan—di sumber, lalu menerapkannya ke tujuan dengan latensi rendah dan throughput tinggi. Topik ini menjelaskan cara mengonfigurasi tugas sinkronisasi real-time dari LogHub (SLS) ke MaxCompute.
Prasyarat
-
Persiapan sumber data
-
Sumber data dan tujuan telah dibuat. Untuk informasi selengkapnya, lihat Manajemen Sumber Data.
-
Pastikan bahwa sumber data mendukung sinkronisasi real-time. Untuk informasi selengkapnya, lihat Sumber data dan solusi sinkronisasi yang didukung.
-
-
Kelompok sumber daya: Kelompok sumber daya Serverless telah dibeli dan dikonfigurasi.
-
Konektivitas jaringan: Konektivitas jaringan antara kelompok sumber daya dan sumber data telah dikonfigurasi.
Langkah 1: Buat tugas sinkronisasi
-
Masuk ke Konsol DataWorks. Di wilayah target, klik di panel navigasi kiri. Pilih ruang kerja dari daftar drop-down dan klik Go to Data Integration.
-
Di panel navigasi kiri, klik Synchronization Task. Di bagian atas halaman, klik Create Synchronization Task dan konfigurasikan parameter tugas. Contoh ini menulis data real-time dari LogHub (SLS) ke MaxCompute.
-
Source Type:
LogHub. -
Destination Type:
MaxCompute. -
Specific Type:
Single-table real-time. -
Synchronization Mode:
-
Schema Migration: Secara otomatis membuat objek database seperti tabel, bidang, dan tipe data di tujuan agar sesuai dengan skema sumber. Langkah ini tidak mencakup data.
-
Incremental Sync: Secara terus-menerus menangkap perubahan data seperti data baru, dimodifikasi, dan dihapus di sumber serta menyinkronkannya ke tujuan.
-
-
Untuk informasi selengkapnya tentang sumber data dan solusi sinkronisasi yang didukung, lihat Sumber data dan solusi sinkronisasi yang didukung.
Langkah 2: Konfigurasi sumber data dan sumber daya waktu proses
-
Untuk Source Information, pilih sumber data
LogHubyang telah Anda tambahkan. Untuk Destination, pilih sumber dataMaxComputeyang telah Anda tambahkan. -
Di bagian Running Resources, pilih Resource Group untuk tugas sinkronisasi dan alokasikan Resource Group CUs ke tugas tersebut. Untuk mengontrol penggunaan sumber daya secara tepat dan mencegah pemborosan, Anda dapat mengatur CU secara terpisah untuk sinkronisasi penuh dan inkremental. Jika tugas sinkronisasi Anda gagal karena error kehabisan memori (OOM), tingkatkan alokasi CU untuk kelompok sumber daya.
CatatanCU adalah unit penagihan untuk kelompok sumber daya, di mana satu CU setara dengan sekitar 1 vCPU dan 4 GB memori. Kami menyarankan Anda memperkirakan throughput yang diperlukan untuk konfigurasi awal dan menyesuaikan nilainya berdasarkan data pemantauan.
-
Pastikan bahwa kedua sumber data (sumber dan tujuan) lulus Connectivity Check.
Langkah 3: Konfigurasi solusi sinkronisasi
1. Konfigurasi sumber data
Di bagian Source, konfigurasikan sumber data LogHub (SLS).
-
Di bagian Source Information, pilih logstore yang ingin Anda sinkronkan.
-
Logstore: Pilih logstore yang sudah ada dari daftar drop-down.
-
-
Klik Data Sampling untuk mengambil sampel dan melihat pratinjau data LogHub.
Di kotak dialog yang muncul, atur Start From dan Sampled Data Records, lalu klik Start Collection. Hasil sampling dapat digunakan sebagai input pratinjau untuk node pemrosesan data selanjutnya.
-
Di bagian Configure Output Field, sistem secara otomatis memuat daftar bidang dari logstore. Anda dapat mengubah Data Type, Delete bidang, atau Add Output Field.
Jika bidang yang dikonfigurasi tidak ada di SLS, nilainya akan ditulis sebagai NULL ke tujuan.
2. Pemrosesan data
Aktifkan sakelar Data Processing. Tersedia lima metode pemrosesan data: Data Masking, String Replace, Data Filtering, JSON Parsing, dan Field Editing and Assignment. Anda dapat mengatur urutan metode ini sesuai kebutuhan. Tugas akan memproses data sesuai urutan yang ditentukan.
Setelah Anda mengonfigurasi node pemrosesan data, Anda dapat mengklik tombol Preview Data Output di pojok kanan atas.
-
Di tabel di bawah data masukan, Anda dapat melihat hasil Data Sampling dari langkah sebelumnya. Anda dapat mengklik Re-obtain Output of Ancestor Node untuk memperbarui hasilnya.
-
Jika tidak ada output yang dihasilkan dari node hulu, Anda juga dapat Manually Construct Data untuk mensimulasikan output hulu.
-
Klik Preview untuk melihat output yang telah diproses dari node hulu.
-
Pratinjau ini menampilkan output akhir.
Di halaman pratinjau pemrosesan data, bagian Input Data menampilkan log mentah, yang mencakup bidang seperti
_source_,_time_,_topic_, dancheck_rows. Bagian Preview Result menampilkan data yang telah diproses dengan bidang baru yang telah diurai seperticlient_ipdandb. Halaman ini menunjukkan bahwa 0 catatan data kotor ditemukan.
Fitur pratinjau output data bergantung pada fitur Data Sampling dari sumber LogHub (SLS). Sebelum Anda melihat pratinjau output data, Anda harus terlebih dahulu mengambil sampel data dari sumber LogHub (SLS).
3. Konfigurasi tujuan data
-
Di bagian Destination, pilih kelompok sumber daya Tunnel. Secara default,
Public transport resources(kuota gratis untuk MaxCompute) dipilih. -
Pilih apakah akan menulis data ke New table atau Existing table.
-
Jika Anda ingin menulis data ke tabel baru, pilih Create dari daftar drop-down. Secara default, ini membuat tabel dengan skema yang sama seperti sumber. Anda dapat mengubah nama dan skema tabel tujuan secara manual.
-
Jika Anda ingin menggunakan tabel yang sudah ada, pilih tabel tujuan dari daftar drop-down.
-
-
(Opsional) Edit skema tabel.
Klik ikon edit di sebelah nama tabel untuk mengedit skema tabel. Untuk menghasilkan skema secara otomatis berdasarkan output node hulu, klik Re-generate Table Schema Based on Output Column of Ancestor Node. Anda dapat memilih kolom dalam skema yang dihasilkan secara otomatis sebagai kunci utama.
4. Konfigurasi pemetaan bidang
-
Sistem secara otomatis memetakan kolom sumber ke kolom tabel tujuan berdasarkan aturan Map Fields with the Same Name. Anda dapat menyesuaikan pemetaan sesuai kebutuhan. Anda dapat memetakan satu kolom sumber ke beberapa kolom tabel tujuan, tetapi tidak dapat memetakan beberapa kolom sumber ke satu kolom tabel tujuan. Jika kolom sumber tidak dipetakan, datanya tidak akan ditulis ke tabel tujuan.
-
(Opsional) Konfigurasi partisi.
-
Automatic Time-based Partitioning: mempartisi data berdasarkan bidang waktu bisnis, yaitu
_timestampdalam contoh ini. Partisi tingkat pertama adalah tahun, tingkat kedua adalah bulan, dan seterusnya. -
Dynamic Partitioning By Field Value: Memetakan bidang sumber ke bidang partisi di tabel MaxCompute tujuan. Ini memastikan baris ditulis ke partisi yang benar di tabel MaxCompute berdasarkan nilai bidang sumber.
-
Langkah 4: Pengaturan lanjutan
Tugas sinkronisasi menyediakan parameter lanjutan untuk kontrol detail halus. Nilai default berfungsi untuk sebagian besar kasus penggunaan. Untuk menyesuaikannya:
-
Di pojok kanan atas tab konfigurasi, klik Advanced Settings untuk membuka halaman konfigurasi Advanced Parameters.
CatatanDi Data Development, pengaturan lanjutan berada di tab di sisi kanan halaman konfigurasi tugas.
-
Anda dapat mengatur parameter secara terpisah untuk sisi baca dan tulis tugas sinkronisasi. Atur Auto-configure runtime settings ke false untuk menyesuaikan Runtime configuration.
-
Ubah nilai parameter sesuai petunjuk. Untuk informasi selengkapnya tentang parameter, lihat deskripsi yang mengikuti setiap nama parameter. Untuk informasi tentang pengaturan yang direkomendasikan untuk beberapa parameter, lihat Parameter lanjutan untuk sinkronisasi real-time.
Ubah parameter ini hanya jika Anda benar-benar memahami tujuan dan konsekuensi potensialnya untuk menghindari error tak terduga atau masalah kualitas data.
Langkah 5: Jalankan simulasi
Untuk tugas sinkronisasi real-time satu tabel di Data Development, fitur simulasi tersedia di bilah alat.
Setelah Anda mengonfigurasi tugas, klik Perform Simulated Running di pojok kiri bawah untuk melakukan debug. Simulasi menjalankan tugas pada sampel data kecil dan menampilkan output tanpa menulis ke tujuan, sehingga memberikan umpan balik langsung mengenai kesalahan konfigurasi, exception waktu proses, atau data kotor.
-
Di kotak dialog yang muncul, atur parameter sampling, yaitu Start time dan Sampled Data Records.
-
Klik Start Collection untuk mendapatkan data sampel.
-
Klik tombol Preview Result untuk mensimulasikan jalannya tugas dan melihat outputnya.
Output dari simulasi hanya untuk pratinjau dan tidak ditulis ke tujuan.
Langkah 6: Terbitkan dan jalankan tugas
-
Setelah menyelesaikan konfigurasi, klik Save di bagian bawah halaman.
-
Tugas Data Integration harus diterbitkan ke lingkungan produksi agar dapat dijalankan. Oleh karena itu, Anda harus Deploy tugas baru atau yang telah diedit agar berlaku. Saat menerbitkan tugas, jika Anda memilih opsi Start immediately after deployment, tugas akan dimulai secara otomatis. Jika tidak, setelah tugas diterbitkan, buka halaman dan mulai tugas secara manual di kolom Actions pada tugas target.
-
Di Tasks, klik Name/ID tugas untuk melihat informasi eksekusi detail.
Langkah 7: Konfigurasi aturan notifikasi
Setelah tugas diterbitkan dan berjalan, konfigurasikan aturan notifikasi untuk menerima pemberitahuan segera saat terjadi masalah. Di daftar tugas Data Integration, temukan tugas target dan pilih di kolom Actions.
1. Tambahkan aturan notifikasi
Di kotak dialog Add Alert, pilih Use Custom Rule atau Use Public Alert Rule. Tentukan Alert Name dan Description. Metode notifikasi yang didukung meliputi Mail, SMS, Phone, DingTalk, webhook, dan Lark. Anda dapat memilih penerima dari On-call Schedule atau menentukan Others.
(1) Klik Create Rule untuk mengonfigurasi aturan notifikasi.
Dengan mengatur Alert Reason, Anda dapat memantau metrik seperti Business delay, Failover, Task status, DDL Notification, dan Task Resource Utilization. Anda dapat mengatur notifikasi CRITICAL atau WARNING berdasarkan ambang batas tertentu.
-
Setelah mengatur metode notifikasi, Anda dapat menggunakan Configure Advanced Parameters untuk mengontrol interval notifikasi dan mencegah notifikasi berlebihan.
-
Jika Anda memilih Business delay, Task status, atau Task Resource Utilization sebagai alasan notifikasi, Anda juga dapat mengaktifkan notifikasi pemulihan untuk memberi tahu penerima saat tugas kembali ke kondisi normal.
(2) Kelola aturan notifikasi.
Untuk aturan notifikasi yang telah dibuat, Anda dapat menggunakan sakelar untuk mengaktifkan atau menonaktifkannya. Anda juga dapat mengirim notifikasi ke personel berbeda berdasarkan tingkat keparahan notifikasi.
2. Lihat notifikasi
Temukan tugas yang diinginkan di daftar tugas dan pilih . Kemudian, buka halaman Alert Events untuk melihat informasi notifikasi historis.
Langkah selanjutnya
Setelah tugas dimulai, Anda dapat:
-
Di daftar tugas sinkronisasi, lihat status berjalan dan ringkasan eksekusi tugas.
-
Klik nama tugas untuk membuka halaman detail tugas dan melihat detail Schema Migration dan Real-time Data Synchronization.
-
Di kolom Actions, klik Start atau Stop. Anda juga dapat memilih More untuk melakukan operasi lain seperti Edit dan View.
FAQ
-
Untuk informasi tentang masalah umum pada tugas sinkronisasi real-time, lihat FAQ tentang sinkronisasi real-time.