Sinkronisasi batch mentransfer data penuh atau inkremental antara database sumber dan tujuan menggunakan plugin Reader dan Writer. Konfigurasikan sumber data dan parameter penjadwalan untuk mengotomatiskan proses tersebut. Topik ini menjelaskan kemampuan sinkronisasi batch.
Kemampuan inti
Sinkronisasi offline menyediakan kemampuan berikut:
Capability | Description |
Data synchronization between disparate data sources | Data Integration mendukung lebih dari 50 jenis sumber data, termasuk database relasional, penyimpanan tidak terstruktur, penyimpanan big data, dan antrian pesan. Anda dapat menentukan sumber dan tujuan data serta menggunakan plugin Reader dan Writer yang disediakan oleh Data Integration untuk mentransfer data antara sumber terstruktur atau semi-terstruktur apa pun. Untuk informasi selengkapnya, lihat Sumber data dan solusi sinkronisasi yang didukung. |
Data synchronization in complex network environments | Sinkronisasi batch mendukung ApsaraDB, pusat data on-premises, database yang dikelola sendiri di ECS, dan database di luar Alibaba Cloud. Sebelum konfigurasi, pastikan network connectivity antara kelompok sumber daya dan titik akhir sumber maupun tujuan. Untuk informasi selengkapnya tentang konfigurasi, lihat Solusi konektivitas jaringan. |
Sync scenarios | 1. Mode sinkronisasi
Catatan Untuk informasi selengkapnya tentang parameter penjadwalan, lihat Skema penggunaan parameter penjadwalan dalam Data Integration dan Parameter penjadwalan. 2. Struktur sumber yang didukung
|
Configuration methods | Anda dapat mengonfigurasi tugas sinkronisasi batch di Data Integration dengan metode berikut.
Catatan Untuk informasi selengkapnya tentang kemampuan konfigurasi tugas, lihat Ikhtisar fitur. |
O&M for batch synchronization tasks |
|
Ikhtisar fitur
Feature | Description |
Full or incremental data synchronization | Tugas sinkronisasi batch mendukung sinkronisasi data penuh atau inkremental dengan mengonfigurasi Data Filtering dikombinasikan dengan scheduling parameters. Plugin yang berbeda memiliki konfigurasi berbeda untuk sinkronisasi inkremental. Untuk informasi selengkapnya tentang sinkronisasi data inkremental, lihat Konfigurasi sinkronisasi data inkremental. |
Field mapping | Dengan menentukan aturan pemetaan bidang, data sumber ditulis ke bidang tujuan yang sesuai berdasarkan hubungan yang ditentukan. Pastikan tipe bidang di kedua sisi kompatibel.
|
Job rate limit |
|
Distributed task execution | Sumber data yang mendukung eksekusi terdistribusi dapat menggunakan sharding tugas untuk mendistribusikan tugas sinkronisasi ke beberapa node guna eksekusi konkuren. Hal ini memungkinkan kecepatan sinkronisasi meningkat secara linear seiring ukuran kluster, sehingga mengatasi hambatan performa single-node. Mode ini sangat cocok untuk skenario sinkronisasi throughput tinggi dan latensi rendah serta memanfaatkan sumber daya kluster idle secara efisien untuk meningkatkan pemanfaatan perangkat keras secara signifikan. |
Dirty data policy | Dirty data mengacu pada catatan data yang gagal ditulis ke tujuan karena pengecualian seperti konflik tipe atau pelanggaran batasan. Sinkronisasi batch mendukung kebijakan dirty data yang menentukan jumlah catatan dirty data yang dapat diterima dan dampaknya terhadap tugas.
|
Time zone | Jika diperlukan sinkronisasi lintas zona waktu antara sumber dan tujuan, Anda dapat mengonfigurasi zona waktu sumber untuk melakukan konversi zona waktu. |
Intelligent data processing | DataWorks mendukung integrasi kemampuan pemrosesan data selama sinkronisasi data untuk mentransformasi dan memproses data sumber sebelum menulisnya ke tujuan: String replacement: Fitur penggantian string bawaan dalam tugas sinkronisasi batch memungkinkan Anda melakukan transformasi data ringan secara langsung selama transfer data tanpa perlu menyimpan data terlebih dahulu atau langkah ETL tambahan. AI-assisted processing: Mendukung integrasi model bahasa besar AI selama sinkronisasi data untuk melakukan analisis semantik, analisis sentimen, dan pemrosesan lainnya pada data bahasa alami sumber, serta menulis hasil yang telah diproses langsung ke tabel tujuan. Data vectorization: Mendukung ekstraksi dan vektorisasi (penyematan) data sumber sebelum menulisnya ke database vektor. |
Langkah selanjutnya
Untuk petunjuk detail tentang pembuatan tugas, lihat: