Alibaba Cloud Elasticsearch AI Engine Edition adalah mesin pencari cloud-native untuk retrieval-augmented generation (RAG), AI Coding, memori Agent, dan pencarian multi-tenant. Layanan ini mengekspos Collection sebagai titik akses terpadu serta mengorganisasi ruang bisnis—seperti basis pengetahuan, repositori kode, Agent, dan penyewa—sebagai Slices dalam Collection tersebut.
AI Engine Edition hanya tersedia untuk pengguna yang masuk daftar allowlist hingga 30 Agustus. Wilayah, zona, spesifikasi instans, metode penagihan, dan prosedur aktivasi yang didukung mengikuti opsi yang tersedia saat ini di situs resmi Alibaba Cloud, Konsol, dan pengumuman rilis resmi.
Mengapa Anda membutuhkannya
Aplikasi RAG, AI Coding, memori Agent, dan pencarian multi-tenant biasanya meng-host banyak basis pengetahuan independen, repositori kode, ruang memori, atau ruang data penyewa dalam satu sistem pencarian. Workload ini memiliki tiga tantangan bersama:
Koeksistensi banyak ruang bisnis — Pola akses sangat bervariasi antar ruang. Beberapa ruang tetap aktif terus-menerus, sementara yang lain tidak aktif dalam periode panjang. Mempertahankan indeks terpisah per ruang membuat manajemen dan perencanaan kapasitas semakin kompleks seiring bertambahnya jumlah ruang.
Distribusi hot/cold yang tidak merata — Banyak ruang yang jarang diakses tetap menggunakan komputasi dan penyimpanan dalam jangka panjang, sedangkan ruang aktif memerlukan respons stabil dengan latensi rendah. Arsitektur tradisional kesulitan menyeimbangkan biaya dan performa di seluruh distribusi ini.
Puncak baca/tulis yang berbeda — Ingesti dan kueri masing-masing memiliki puncak dan lembahnya sendiri. Ketika operasi tulis, pembuatan indeks, dan kueri berbagi node yang sama, lonjakan tulis secara langsung memengaruhi latensi kueri.
Untuk mengatasi karakteristik ini, AI Engine Edition memisahkan penyimpanan persisten, komputasi tulis, dan komputasi kueri. Data indeks dan state persisten disimpan secara seragam di object storage. Node indeks menangani operasi tulis dan pembuatan indeks. Node pencarian menangani kueri. Anda mengonfigurasi sumber daya secara independen berdasarkan volume tulis dan volume kueri. Data aktif dipercepat melalui caching lokal, sedangkan data tidak aktif dimuat sesuai kebutuhan.
Di halaman pembelian Konsol dan dalam daftar instans, dua jenis node tersebut ditampilkan sebagai Index Nodes dan Query Nodes, yang masing-masing berkorespondensi dengan Index nodes dan Search nodes dalam dokumen ini.
Kemampuan inti dan skenario
Pemisahan baca/tulis dengan penskalaan independen
Operasi tulis dan kueri menggunakan peran node yang berbeda. Konfigurasikan Index nodes berdasarkan volume ingesti, dan konfigurasikan Search nodes berdasarkan konkurensi kueri. Saat salah satu jenis workload meningkat, cukup sesuaikan sumber daya yang sesuai — operasi tulis, penggabungan indeks, dan kueri tidak lagi berebut komputasi yang sama. Lonjakan tulis tidak memengaruhi latensi kueri, dan beban kueri tidak memperlambat ingesti.
Caching sesuai permintaan dengan tiering hot/cold otomatis
Data indeks lengkap disimpan di object storage. Disk lokal pada Search nodes berfungsi sebagai cache kueri. Data yang sering diakses terus dilayani dari cache dan mengembalikan kueri hot dalam hitungan milidetik, sedangkan data yang jarang diakses hanya dimuat dari object storage saat dibutuhkan. Ukuran cache lokal disesuaikan dengan working set aktif dan tidak perlu menyamai total volume data. Ruang bisnis yang tidak aktif tidak mengonsumsi sumber daya komputasi atau cache — biayanya hanya mencakup biaya pay-as-you-go object storage.
Manfaat cache bergantung pada distribusi hot/cold workload, kapasitas cache, spesifikasi node, dan konkurensi kueri. Untuk workload dengan pola akses yang sangat tersebar atau sering berubah, lakukan penilaian kapasitas dan uji performa menggunakan data aktual.
Ruang bisnis skala besar dengan manajemen terpadu
Aplikasi dapat memperlakukan basis pengetahuan, repositori kode, Agent, atau penyewa sebagai Slice dan membaca/menulis melalui Collection yang sama. Platform mengelola indeks dan shard dasar berdasarkan kapasitas. Aplikasi tidak perlu membuat indeks terpisah per ruang bisnis atau melacak nama indeks dasar dan struktur tabel dalam kode aplikasi.
Saat melakukan kueri, Anda dapat memilih satu Slice, beberapa Slice, atau secara eksplisit memilih semua Slice. Secara default, aplikasi harus menentukan cakupan kueri, yang mengurangi risiko pemindaian seluruh Collection secara tidak disengaja ketika informasi routing tidak tersedia.
Pemulihan kegagalan tanpa migrasi data
Data indeks, write-ahead log, dan state kluster disimpan di object storage. Node komputasi tidak menyimpan state persisten lokal. Setelah terjadi kegagalan node, platform menjadwalkan node pengganti yang melanjutkan operasi dari object storage dan membangun kembali cache lokal sesuai kebutuhan — migrasi data penuh tidak diperlukan. Dibandingkan dengan pemulihan shard yang memakan waktu puluhan menit hingga jam pada arsitektur stateful tradisional, dampak kegagalan (blast radius) berkurang secara signifikan.
Jika lapisan tulis sementara tidak dapat meng-host primary shard, operasi tulis baru dijeda. Selama Search shard yang sesuai tetap tersedia, sistem tetap dapat melayani kueri terhadap data yang telah dipersist dan dipublikasikan.
Kompatibilitas ekosistem Elasticsearch
Dalam cakupan API yang didukung, aplikasi dapat terus menggunakan Elasticsearch REST API dan Query DSL, menggabungkan pencarian teks lengkap, vektor KNN, filtering, dan agregasi. Klien resmi Python, Java, Go, dan JavaScript, Kibana, serta komponen ekosistem lainnya dapat menggunakan kembali struktur permintaan dan sintaks kueri dari antarmuka yang kompatibel, sehingga mengurangi perubahan pada lapisan antarmuka. Sebelum migrasi, verifikasi antarmuka dan komponen ekosistem yang Anda gunakan terhadap dokumentasi kompatibilitas API untuk versi instans target.
Skenario
| Skenario | Organisasi data yang direkomendasikan | Nilai inti |
| Basis pengetahuan perusahaan dan RAG | Perlakukan setiap basis pengetahuan sebagai Slice | Satu Collection mengelola sejumlah besar basis pengetahuan. Basis aktif merespons dalam hitungan milidetik. Basis tidak aktif hanya dikenai biaya object storage. |
| AI Coding dan pencarian kode | Perlakukan setiap repositori kode atau proyek sebagai Slice | Kode menjadi dapat dicari dalam hitungan detik setelah commit. Pencarian real-time pengembang tidak terganggu oleh operasi tulis batch. |
| Memori Agent | Partisi berdasarkan penyewa, Agent, atau ruang memori independen sebagai Slices | Operasi tulis langsung dapat dikueri. Memori tidak aktif dari sejumlah besar Agent tidak mengonsumsi sumber daya komputasi atau cache. |
| Layanan pencarian multi-tenant | Perlakukan setiap penyewa atau ruang bisnis sebagai Slice | Platform mengelola indeks dasar. Data penyewa dikelompokkan secara fisik. Biaya kueri per penyewa hanya bergantung pada volume data penyewa tersebut. |
Konsep inti dan arsitektur
Arsitektur inti berlandaskan tiga gagasan: state persisten disimpan di object storage, sumber daya tulis dan kueri diskalakan secara independen, serta banyak ruang bisnis diorganisasi melalui Collections dan Slices.
Konsep inti
Untuk memahami AI Engine Edition, bedakan Collection dari Slice:
| Konsep | Deskripsi |
| Collection | Titik masuk terpadu bagi aplikasi untuk mengakses data. Penggunaannya mirip dengan nama indeks Elasticsearch. Collection dapat berisi beberapa ruang bisnis. |
| Slice | Ruang data logis dalam Collection. Misalnya, basis pengetahuan, repositori kode, Agent, atau penyewa masing-masing dapat menjadi Slice. |
Saat membaca dan menulis data, aplikasi menggunakan nama Collection untuk mengakses data dan menentukan ruang bisnis target melalui Slice. Platform mengarahkan permintaan ke data yang sesuai dengan Slice tersebut dan mengelola indeks serta shard dasar. Aplikasi tidak mengelola atau mengoperasikan langsung nama indeks dasar.
Slices mengorganisasi data dan menentukan cakupan kueri. Slice tidak setara dengan batas izin akun. Jika Anda memerlukan otentikasi identitas dan isolasi izin antar penyewa, rancang solusi Anda dengan menggabungkan otentikasi lapisan aplikasi dan mekanisme keamanan yang didukung produk.
Arsitektur inti

Data kueri dimasukkan ke cache lokal sesuai kebutuhan. Tanggung jawab masing-masing komponen adalah sebagai berikut:
| Komponen | Tanggung jawab utama |
| Koleksi dan Irisan | Collection berfungsi sebagai titik masuk akses data. Slice mengidentifikasi ruang bisnis dalam Collection, dan platform menggunakannya untuk mengarahkan permintaan ke data yang sesuai. |
| Index nodes | Menangani operasi tulis dokumen, persistensi write-ahead log, pembuatan indeks, dan penggabungan latar belakang. |
| Search nodes | Menjalankan kueri pencarian teks lengkap, vektor, filtering, dan agregasi, serta menyimpan data yang dibutuhkan kueri secara lokal di cache. |
| Object storage | Menyimpan data indeks, write-ahead log, dan state persisten yang diperlukan untuk operasi kluster. Ketahanan data mencapai 11 nines atau lebih tinggi. Penagihan berdasarkan penyimpanan aktual yang digunakan, tanpa kapasitas praprovinsi. Di halaman detail instans Konsol, kapasitas ini ditampilkan sebagai OpenStore Storage dan OpenStore Storage Usage. |
Cara data ditulis
Aplikasi menggunakan nama Collection dalam path permintaan dan mengidentifikasi ruang bisnis target melalui Slice.
Index nodes memproses permintaan. Sistem hanya mengonfirmasi penyelesaian tulis ke client setelah write-ahead log (Translog) dipersist secara sinkron ke object storage.
Index nodes menghasilkan file indeks di latar belakang dan mempublikasikan versi indeks baru (Commit). Setelah Search nodes melakukan refresh, data baru masuk ke hasil kueri mengikuti semantik near-real-time Elasticsearch.
Cara data dikueri
Aplikasi menggunakan nama Collection dalam path permintaan dan menentukan satu atau beberapa ruang bisnis melalui Slice. Kueri tanpa Slice yang ditentukan ditolak secara default untuk mencegah kueri cakupan penuh yang tidak disengaja. Untuk mengkueri seluruh Collection, pilih secara eksplisit semua Slice saat kueri.
Search nodes pertama-tama membaca data yang dibutuhkan kueri dari cache bersama lokal.
Saat terjadi cache miss, Search nodes memuat rentang data yang dibutuhkan dari object storage. Kueri berikutnya terus menggunakan kembali data hot yang telah masuk cache.
Untuk menjaga ketersediaan kueri selama kegagalan node, konfigurasikan jumlah replika dan Search nodes seperti yang dijelaskan dalam Panduan Penggunaan AI Engine Edition.
Indeks vektor native-disk (DiskBBQ)
AI Engine Edition menggunakan DiskBBQ, indeks vektor native-disk yang mencapai kueri KNN dengan IO-predictable melalui pengelompokan K-means hierarkis yang dikombinasikan dengan kuantisasi BBQ. Saat kueri, sistem memeriksa maksimal dua level centroid dan membaca cluster yang terkena (hit clusters) secara berurutan per blok, sehingga secara alami cocok untuk caching SSD dan object storage tanpa memerlukan vektor berada di memori. Dibandingkan dengan HNSW, DiskBBQ meningkatkan kecepatan pembuatan indeks sekitar satu orde besaran dan mengalami degradasi performa yang bertahap di bawah kendala memori, bukan cliff performa mendadak.
Referensi performa
Hasil berikut berasal dari pengujian yang dilakukan pada Juli 2026 dalam skenario aplikasi tipikal. Hasil ini menunjukkan performa kueri cold dan hot dalam kondisi pengujian spesifik tersebut. Hasil ini bukan merupakan SLA produk, komitmen spesifikasi instans, atau kesimpulan performa umum untuk lingkungan lain.
| Item pengujian | Konfigurasi |
| Lingkungan pengujian | Alibaba Cloud Elasticsearch AI Engine Edition, 2 Index nodes dan 2 Search nodes, masing-masing dengan 16 vCPU dan memori 64 GiB |
| Skala data | 10.000 ruang bisnis, total 93,68 juta dokumen, data 2,8 TB |
| Konfigurasi vektor | 512 dimensi, kemiripan dot_product, indeks bbq_disk (DiskBBQ) |
| Metode kueri | Kueri KNN, mengembalikan 10 hasil dengan candidate set sebanyak 100 |
| Metrik latensi | Waktu pemrosesan sisi server took; tidak termasuk pemrosesan sisi client atau latensi jaringan |
| Status akses | Jumlah sampel | P50 (median) | P90 | P99 |
| Cold query | 180 | 225 ms | 377 ms | 605 ms |
| Kueri hot | 1.800 | 1 ms | 32 ms | 65 ms |
Data di atas diperoleh dengan Index nodes dan Search nodes berukuran 16 vCPU dan 64 GiB. Spesifikasi node, jumlah node minimum, dan konfigurasi dedicated master node mengikuti opsi yang tersedia saat ini di halaman pembelian. Performa dalam tabel di atas tidak dapat direproduksi dengan spesifikasi di bawah konfigurasi pengujian — jangan mengharapkan performa setara pada spesifikasi minimum. Performa kueri aktual juga dipengaruhi oleh volume data satu Slice, dimensi vektor, parameter recall, spesifikasi node, kapasitas cache, beban konkuren, dan kondisi jaringan. Sebelum membuat keputusan formal, lakukan penilaian kapasitas dan uji stres menggunakan data dan kueri bisnis aktual Anda.
Versi dan kompatibilitas
AI Engine Edition menggunakan nomor versi dalam format 9.99.x. 9.99 menunjukkan bahwa produk ini termasuk dalam seri kompatibel Elasticsearch 9.x. Segmen versi terakhir membedakan iterasi fitur AI Engine Edition itu sendiri. Nomor versi ini tidak berkorespondensi satu-satu dengan versi minor Elasticsearch 9.x tertentu, juga tidak menyiratkan dukungan terhadap setiap fitur dan API Elasticsearch 9.x.
Fitur dan API yang didukung dapat berbeda antar versi 9.99.x. Sebelum membuat instans atau memigrasi workload, konsultasikan dokumentasi kompatibilitas API untuk versi instans yang ditampilkan di Konsol guna memastikan dukungan terhadap akses data, cakupan kueri, pencarian vektor, replikasi data, kemampuan keamanan, dan fitur lainnya.
AI Engine Edition saat ini 9.99.0 berkorespondensi dengan versi kernel Elasticsearch 9.5.0, sehingga nomor versi yang dikembalikan oleh cluster API berbeda dari versi yang ditampilkan di Konsol. Ke depan, versi Elasticsearch aktual didasarkan pada respons cluster API. Saat menginstal plugin kustom, gunakan nomor versi 9.99.0 yang sesuai dengan AI Engine Edition.
Wilayah dan zona
Wilayah dan zona yang didukung mengikuti opsi yang tersedia saat ini di halaman pembelian. Spesifikasi instans, metode penagihan, dan prosedur aktivasi mengikuti situs resmi Alibaba Cloud, Konsol, dan pengumuman rilis resmi. Sebelum migrasi formal, selesaikan evaluasi solusi dan verifikasi performa berdasarkan kompatibilitas API, skala data, distribusi hot/cold, dan beban kueri target.
Langkah selanjutnya
Ikuti langkah-langkah berikut untuk mulai menggunakan instans AI Engine Edition:
Konfirmasi wilayah dan versi — Di situs resmi Alibaba Cloud atau Konsol, pastikan wilayah target tersedia untuk pembelian. Konsultasikan dokumentasi kompatibilitas API untuk versi instans guna memastikan antarmuka dan komponen ekosistem yang Anda andalkan didukung.
Rencanakan organisasi data — Berdasarkan bagian Skenario, tentukan cara mempartisi Slices — berdasarkan basis pengetahuan, repositori kode, Agent, atau penyewa — dan rencanakan jumlah serta penamaan Collections.
Buat instans dan konfigurasikan sumber daya — Konfigurasikan Index nodes berdasarkan volume tulis yang diharapkan. Konfigurasikan Search nodes berdasarkan konkurensi kueri dan working set aktif. Untuk menjaga ketersediaan kueri selama kegagalan node, konfigurasikan jumlah replika dan Search nodes seperti yang dijelaskan dalam Panduan Penggunaan AI Engine Edition.
Integrasi dan verifikasi — Gunakan Elasticsearch REST API atau klien resmi untuk melakukan integrasi tulis dan kueri. Tentukan cakupan kueri melalui Slices, dan verifikasi pencarian teks lengkap, vektor KNN, filtering, dan agregasi.
Penilaian kapasitas dan uji stres — Lakukan penilaian kapasitas dan uji stres menggunakan data dan kueri bisnis aktual Anda. Fokus pada latensi kueri cold dan hot serta performa cache hit sebelum melanjutkan migrasi formal.
Arah pengembangan ke depan
Berdasarkan arsitektur native object storage, roadmap mencakup branching zero-copy sub-detik (membuat cabang data independen untuk Slice apa pun berdasarkan copy-on-write, cocok untuk evaluasi, rilis canary, dan rollback), Scale to Zero lapisan komputasi (secara otomatis menskala ruang bisnis idle ke hampir nol untuk lebih menyelaraskan biaya dengan beban aktif), dan integrasi lebih dalam dengan kemampuan ekosistem Alibaba Cloud Elasticsearch. Jadwal rilis fitur spesifik mengikuti pengumuman produk.