All Products
Search
Document Center

OpenSearch:Menyinkronkan data vektor dari OpenLake-DLF ke OpenSearch

Last Updated:Jan 07, 2026

Topik ini menjelaskan cara menyinkronkan data vektor multimodal dari sumber data Data Lake Formation (DLF) ke Alibaba Cloud OpenSearch. OpenSearch dapat secara otomatis mengekstraksi data teks, citra, dan video dari DLF, melakukan vektorisasi menggunakan model bawaan atau AI Search Open Platform, serta mengurai kontennya. Proses ini mengubah data tidak terstruktur menjadi vektor terstruktur dan menyinkronkannya dengan OpenSearch. Solusi ini mendukung format data seperti Paimon, Lance, dan Object Table serta menyediakan konfigurasi indeks vektor yang komprehensif, termasuk pengaturan dimensi vektor, tipe jarak, dan algoritma pencarian. Hal ini membantu Anda membangun aplikasi pencarian multimodal yang efisien untuk skenario seperti Pencarian Gambar, pencarian semantik teks, dan pencarian video.

Prasyarat

  • Pelajari tentang Data Lake Formation.

  • Anda telah mengonfigurasi ID katalog data, sebuah database, dan sebuah tabel data di DLF. Ini diperlukan untuk sinkronisasi data.

Tambahkan sumber data DLF

  1. Di halaman Rincian Instans > Manajemen Tabel, klik Tambah Tabel.

  2. Di langkah Informasi Dasar, konfigurasikan parameter dan klik Berikutnya.

    imageDetail Konfigurasi:

  • Table Name: Nama kustom untuk tabel tersebut.

  • Shard Data: Jika Anda membuat beberapa tabel indeks, pastikan semuanya memiliki jumlah shard yang sama. Atau, satu tabel indeks dapat memiliki satu shard sementara semua tabel indeks lainnya memiliki jumlah shard yang identik.

  • Jumlah Sumber Daya untuk Pembaruan Data: Tentukan jumlah sumber daya untuk pembaruan data. Secara default, setiap indeks mencakup kuota gratis dua sumber daya. Setiap sumber daya menyediakan 4 inti CPU dan 8 GB memori. Anda akan dikenakan biaya untuk sumber daya apa pun yang melebihi kuota gratis. Untuk informasi lebih lanjut, lihat Penagihan Edisi Pencarian Vektor.

  • Templat Skenario: Edisi Pencarian Vektor menyediakan empat templat bawaan: Templat Umum, Vektor: Pencarian Gambar, Vektor: Pencarian Semantik Teks, dan Vektor: Pencarian Video. Templat Pencarian Video tidak mendukung DLF sebagai sumber data penuh.

  1. Pada langkah Sinkronisasi Data, konfigurasikan sumber data. Setelah verifikasi sumber data berhasil, klik Next.

  • Sumber Data Penuh: Pilih Pembentukan Danau Data (DLF).

  • Format Tabel: Paimon, Lance, dan Object Table didukung.

    Paimon adalah format tabel lakehouse yang mendukung pembaruan data waktu nyata, serta pemrosesan aliran dan batch.

    Lance adalah format tabel vektor yang dirancang untuk AI yang memungkinkan pencarian kesamaan ultra-cepat pada vektor.

    Object Table adalah format tabel metadata yang memungkinkan Anda langsung menanyakan dan menemukan berbagai file yang disimpan di cloud menggunakan SQL.

  • Katalog Data: ID katalog data DLF target yang ingin Anda akses.

  • Database: Database dalam katalog data target.

  • Tabel Data: Tabel data dalam database target.

    Catatan
    • Untuk menggunakan sumber data DLF untuk instans yang ada, Anda harus terlebih dahulu meningkatkan versi mesin instans tersebut.

    • Templat Umum dan Vektor: Pencarian Gambar mendukung format Paimon, Lance, dan Object Table. Templat Vektor: Pencarian Semantik Teks mendukung format Paimon.

    • Untuk tabel kunci utama Paimon, Anda dapat menambah, menghapus, memodifikasi, dan menanyakan data. Untuk tabel append-only Paimon, Anda hanya dapat menulis data. Anda tidak dapat memodifikasi atau menghapus data.

  • Jalur Relatif: Jalur relatif untuk mengakses file dalam tabel objek ketika format tabel adalah Object Table.

  • Format Data: Ketika format tabel adalah Object Table, pilih ha3 atau json sebagai format data.

  • Tag: Tag versi data. Jika Anda menentukan tag, OpenSearch menggunakan data bertanda untuk impor penuh. Jika Anda tidak menentukan tag, OpenSearch menggunakan data terbaru dalam tabel untuk impor penuh.

    Paimon menyediakan fitur tag untuk mempertahankan metadata dan file data dari snapshot tertentu. Ini mencegah hilangnya data historis karena kedaluwarsa snapshot. Tag dapat dibuat secara otomatis berdasarkan pekerjaan penulisan, dihasilkan secara berkala oleh waktu pemrosesan atau watermark, atau dibuat, dihapus, atau dikembalikan secara manual. Dengan mengonfigurasi kebijakan retensi data, Anda dapat mengontrol jumlah maksimum tag atau periode retensinya untuk memastikan bahwa data historis tetap dapat ditanyakan. Untuk informasi lebih lanjut, lihat Tag Paimon.

    Lance menggunakan tag untuk menandai versi tertentu dalam sejarah dataset. Ini memudahkan pelacakan evolusi dataset, terutama dalam alur kerja pembelajaran mesin yang sering diperbarui. Anda dapat membuat, memperbarui, menghapus, dan mencantumkan tag. Tag tidak membuat versi baru. Sebaliknya, mereka ada sebagai metadata di folder terpisah. Versi dengan tag tidak dihapus oleh operasi `cleanup_old_versions`. Anda harus terlebih dahulu menghapus tag untuk menghapus versi yang sesuai. Untuk informasi lebih lanjut, lihat Tag Lance.

  • Pemeriksaan Sumber Data: Setelah sumber data berhasil diverifikasi, Anda dapat melanjutkan ke langkah berikutnya.

  1. Di langkah Konfigurasi Bidang, konfigurasikan bidang dan klik Berikutnya.cn3字段配置.png

    • Bidang kunci utama dan bidang vektor diperlukan. Untuk bidang kunci utama, atur tipe ke int atau string dan pilih opsi Kunci Utama. Untuk bidang vektor, atur tipe ke float dan pilih opsi Bidang Vektor.

    • Secara default, bidang vektor adalah bidang multi-nilai dari tipe float.

    • Pra-pemrosesan data diperlukan: Untuk bidang tipe String, Anda dapat memilih opsi ini dan klik Configure untuk memanggil model guna pra-memproses data dalam bidang tersebut.

      image

      Tipe data teks

      • Tipe Data: Teks.

      • Templat Pra-pemrosesan: Vektorisasi padat, atau Vektorisasi padat + jarang.

      • Daftar Layanan:

        Setelah Anda memilih templat pra-pemrosesan, daftar layanan di bawah templat tersebut muncul secara otomatis. Daftar ini menunjukkan jenis model yang digunakan dalam templat.

        Sumber Model yang Tersedia:

        • Model Bawaan: Sejumlah terbatas jenis model tersedia dan dapat dipanggil secara gratis.

        • Platform Terbuka AI Search: Platform Terbuka AI Search menyediakan berbagai model. Anda dikenakan biaya berdasarkan jumlah panggilan. Untuk informasi lebih lanjut, lihat Metode Penagihan dan Item yang Dapat Ditagih. Sebelum menggunakan model-model ini, Anda harus terlebih dahulu mengaktifkan ruang kerja dan kunci API di Platform Terbuka AI Search.

        • Model Kustom: Untuk membuat model kustom, buka Models > Custom Models di halaman Edisi Pencarian Vektor dan klik Create Model. Untuk informasi lebih lanjut, lihat Model Kustom.

      Tipe data gambar

      • Tipe Data: Gambar.

      • Sumber Data: Object Storage Service (OSS), Pengkodean Base64, atau DLF-Object Table.

        • Object Storage Service (OSS): Simpan gambar di folder OSS dan tentukan jalur OSS untuk mengimpornya secara langsung.

        • Pengkodean Base64: Anda harus terlebih dahulu mengkodekan gambar dan kemudian menyimpannya di database atau mentransfernya langsung menggunakan API.

        • DLF-Object Table: Tabel dalam format Tabel Objek Danau Data. Anda harus menentukan katalog data, database, dan tabel data yang sesuai.

      • Templat Pra-pemrosesan: Vektorisasi gambar, Penguraian konten gambar, atau Penguraian konten gambar + vektorisasi gambar.

      • Daftar Layanan:

        Setelah Anda memilih templat pra-pemrosesan, daftar layanan di bawah templat tersebut muncul secara otomatis. Daftar ini menunjukkan jenis model yang digunakan dalam templat.

        Sumber Model yang Tersedia:

        • Model Bawaan: Sejumlah terbatas jenis model tersedia dan dapat dipanggil secara gratis.

        • Platform Terbuka AI Search: Platform Terbuka AI Search menyediakan berbagai model. Anda dikenakan biaya berdasarkan jumlah panggilan. Untuk informasi lebih lanjut, lihat Metode Penagihan dan Item yang Dapat Ditagih. Sebelum menggunakan model-model ini, Anda harus terlebih dahulu mengaktifkan ruang kerja dan kunci API di Platform Terbuka AI Search.

        • Model Kustom: Anda dapat menyesuaikan model sesuai kebutuhan. Di halaman Edisi Pencarian Vektor, buka Models > Custom Models dan klik Create Model. Untuk informasi lebih lanjut, lihat Model Kustom.

      Tipe data video

      • Tipe Data: Video.

      • Sumber Data: Object Storage Service (OSS).

      • Templat Pra-pemrosesan: Pemrosesan video.

      • Daftar Layanan:

        Setelah Anda memilih templat pra-pemrosesan, daftar layanan di bawah templat tersebut muncul secara otomatis. Daftar ini menunjukkan jenis model yang digunakan dalam templat.

        Sumber Model yang Tersedia:

        • Model Bawaan: Sejumlah terbatas jenis model tersedia dan dapat dipanggil secara gratis.

        • Platform Terbuka AI Search: Platform Terbuka AI Search menyediakan berbagai model. Anda dikenakan biaya berdasarkan jumlah panggilan. Untuk informasi lebih lanjut, lihat Metode Penagihan dan Item yang Dapat Ditagih. Sebelum menggunakan model-model ini, Anda harus terlebih dahulu mengaktifkan ruang kerja dan kunci API di Platform Terbuka AI Search.

        • Model Kustom: Anda dapat menyesuaikan model sesuai kebutuhan. Di halaman Edisi Pencarian Vektor, buka Models > Custom Models dan klik Create Model. Untuk informasi lebih lanjut, lihat Model Kustom.

    • Jika suatu bidang hilang atau kosong dalam data sumber, sistem secara otomatis memberikan nilai default. Secara default, bidang numerik diatur ke 0 dan bidang string diatur ke string kosong. Anda juga dapat menentukan nilai default kustom.

  2. Di langkah Skema Indeks, konfigurasikan indeks dan klik Berikutnya.

    image

    1. Indeks Vektor:

      • Dimensi Vektor: Pilih dimensi vektor berdasarkan vektor yang dihasilkan oleh model Anda.

      • Tipe Jarak: Pilih tipe jarak berdasarkan vektor yang dihasilkan oleh model Anda. Sistem mendukung tiga tipe jarak: Euclidean Kuadrat, Produk Dalam, dan Kosinus.

      • Algoritma Pencarian Vektor: Pilih algoritma pencarian vektor berdasarkan vektor yang dihasilkan oleh model Anda. Sistem mendukung algoritma indeks vektor berikut: Linear, HNSW, QGraph, QC, DiskANN, dan CagraHnsw.

      • Indeks Waktu Nyata: Menentukan apakah akan membangun indeks waktu nyata untuk data inkremental yang didorong menggunakan panggilan API. Nilai defaultnya adalah true.

        Anda juga dapat mengklik untuk memperluas dan mengonfigurasi pengaturan lanjutan. Untuk informasi lebih lanjut tentang parameter, lihat Konfigurasi Umum untuk Indeks Vektor.cn4高级配置.png

    2. Tipe Indeks Lainnya: Sistem menghasilkan bidang `pk` dan indeks kunci utama. Untuk bidang non-vektor lainnya, indeks dengan nama yang sama dibuat secara default.

    3. Konfigurasi Indeks Global: Anda dapat mengonfigurasi pembersihan otomatis untuk dokumen yang kedaluwarsa. Jika fitur ini diaktifkan, dokumen secara otomatis dihapus ketika selisih antara waktu saat ini dan timestamp dokumen melebihi waktu kedaluwarsa yang ditentukan.

  3. Di langkah Konfirmasi, klik Konfirmasi. Sistem secara otomatis membuat tabel yang dikonfigurasi. Anda dapat melihat kemajuan pembuatan tabel di halaman Riwayat Perubahan.

  4. Setelah status tabel berubah menjadi Digunakan, Anda dapat melakukan uji kueri di halaman Uji Kueri.

Perhatian

Ketika data baru ditulis ke tabel Paimon di DLF, OpenSearch secara otomatis memicu pengindeksan waktu nyata untuk data baru tersebut. Jika Anda menulis data secara manual menggunakan panggilan API, masalah konsistensi data mungkin terjadi. Lanjutkan dengan hati-hati.