Elastic Algorithm Service (EAS), bagian dari Platform for AI (PAI), menawarkan penerapan berbasis skenario. Dengan mengonfigurasi hanya beberapa parameter, Anda dapat menyebarkan sistem dialog yang mengintegrasikan large language model (LLM) dan teknologi Retrieval-Augmented Generation (RAG) dalam satu klik, sehingga secara signifikan mengurangi waktu penerapan. Selama inferensi, layanan ini mengambil informasi relevan dari basis pengetahuan dan menggabungkannya dengan respons LLM untuk menghasilkan jawaban yang akurat dan kaya informasi, meningkatkan kualitas serta performa sistem tanya-jawab Anda. Layanan ini ideal untuk tanya-jawab, pembuatan ringkasan, dan tugas Pemrosesan bahasa alami lainnya yang bergantung pada pengetahuan eksternal. Topik ini menjelaskan cara membangun database vektor menggunakan ApsaraDB RDS for PostgreSQL, menyebarkan layanan dialog RAG, dan memvalidasi hasil inferensi model.
Latar Belakang
Large language model (LLM) memiliki keterbatasan dalam akurasi dan kesegaran respons, sehingga tidak cocok untuk skenario yang memerlukan informasi tepat, seperti layanan pelanggan atau tanya-jawab. Untuk mengatasi hal ini, industri secara luas mengadopsi teknologi Retrieval-Augmented Generation (RAG) guna meningkatkan performa LLM. Teknik ini secara signifikan dapat meningkatkan kualitas tanya-jawab, pembuatan ringkasan, dan tugas Pemrosesan bahasa alami (NLP) lainnya yang bergantung pada pengetahuan eksternal.
RAG meningkatkan akurasi dan kelengkapan jawaban yang dihasilkan dengan menggabungkan LLM, seperti Qwen, dengan komponen pengambilan informasi. Saat memproses kueri pengguna, komponen pengambilan sistem RAG mencari dokumen atau cuplikan informasi relevan dalam basis pengetahuan. Konten yang diambil tersebut, bersama dengan kueri asli, kemudian diberikan ke LLM. Model tersebut lalu menggunakan kemampuan generasi induktifnya untuk menghasilkan respons berbasis fakta dan mutakhir tanpa perlu dilatih ulang.
Layanan sistem dialog yang diterapkan menggunakan EAS mengintegrasikan LLM dan teknologi RAG untuk mengatasi keterbatasan akurasi dan kesegaran LLM mandiri. Layanan ini memberikan respons yang akurat dan kaya informasi untuk berbagai skenario tanya-jawab, sehingga meningkatkan efektivitas keseluruhan dan pengalaman pengguna dalam tugas NLP.
Prasyarat
Anda telah membuat Virtual Private Cloud (VPC), vSwitch, dan security group. Untuk informasi selengkapnya, lihat Buat dan kelola VPC dan Buat security group.
Jika Anda menerapkan layanan menggunakan model fine-tuned kustom, siapkan bucket Object Storage Service (OSS) atau sistem file Apsara File Storage NAS (NAS) untuk menyimpan file model. Untuk informasi selengkapnya, lihat Memulai dengan konsol atau Buat sistem file.
Catatan Penggunaan
Prosedur ini tunduk pada batas token maksimum layanan LLM dan membantu Anda menjelajahi fungsi pengambilan dasar sistem dialog berbasis RAG:
Sumber daya server layanan LLM dan batas token default menentukan panjang percakapan maksimum.
Jika Anda tidak memerlukan percakapan multi-putaran, kami menyarankan agar Anda menonaktifkan fitur
with chat historypada layanan RAG. Hal ini membantu Anda menghindari melebihi batas token. Untuk informasi selengkapnya, lihat Bagaimana cara menonaktifkan fitur "with chat history" pada layanan RAG?.
Langkah 1: Siapkan database vektor ApsaraDB RDS for PostgreSQL
Anda dapat membangun database vektor untuk RAG dengan ApsaraDB RDS for PostgreSQL. Anda akan memerlukan parameter konfigurasi untuk menghubungkan ke database tersebut.
Buat instans ApsaraDB RDS for PostgreSQL secara cepat.
Kami menyarankan agar Anda menerapkan instans ApsaraDB RDS for PostgreSQL dan layanan RAG di wilayah yang sama agar keduanya dapat berkomunikasi melalui jaringan internal VPC.
Buat akun dan database untuk instans RDS. Untuk informasi selengkapnya, lihat Buat akun dan database.
Catatan:
Saat membuat akun, atur Account Type ke Privileged Account.
Saat membuat database, pilih akun istimewa yang telah dibuat untuk Authorized By.
Konfigurasikan koneksi database.
Buka halaman Instances. Di bilah navigasi atas, pilih wilayah tempat instans RDS berada. Lalu, temukan instans RDS tersebut dan klik ID instans.
Pada halaman Database Connection, lihat titik akhir database dan nomor port.
Tambahkan pg_jieba ke Running Parameter Value dari shared_preload_libraries. Misalnya, ubah Running Parameter Value menjadi
'pg_stat_statements,auto_explain,pg_cron'. Untuk informasi selengkapnya, lihat Atur parameter instans.CatatanApsaraDB RDS for PostgreSQL menggunakan ekstensi pg_jieba untuk melakukan segmentasi teks Tionghoa guna pengambilan dan recall berbasis kata kunci.
Langkah 2: Sebarkan layanan RAG
Buka halaman layanan model online.
Login ke Konsol PAI.
Di panel navigasi kiri, klik Workspaces. Pada halaman Workspaces, klik nama ruang kerja yang ingin Anda kelola.
Jika Anda belum memiliki ruang kerja, lihat Buat dan kelola ruang kerja.
Di panel navigasi kiri ruang kerja, pilih Model Deployment > Elastic Algorithm Service (EAS) untuk membuka halaman Elastic Algorithm Service (EAS).

Pada halaman Elastic Algorithm Service (EAS), klik Deploy Service. Di bagian Scenario-based Model Deployment, klik RAG-based Smart Dialogue Deployment.

Pada halaman RAG-based LLM Chatbot Deployment, konfigurasikan parameter utama berikut.
Informasi dasar
Parameter
Deskripsi
Service Name
Nama layanan kustom.
Model Source
Nilai yang valid: Open Source Model dan Custom Fine-tuned Model.
Model Type
Pilih tipe model sesuai skenario Anda.
Jika Anda menggunakan model fine-tuned kustom, Anda harus mengonfigurasi ukuran dan presisi model.
Model Configuration
Jika Anda menggunakan model fine-tuned kustom, Anda harus mengonfigurasi jalur file model fine-tuned tersebut. Dua metode didukung:
CatatanPastikan format file model kompatibel dengan HuggingFace Transformers.
By Object Storage Service (OSS): Pilih jalur OSS tempat file model fine-tuned disimpan.
By Apsara File Storage NAS: Pilih sistem file NAS dan jalur sumber NAS tempat file model fine-tuned disimpan.
Konfigurasi resource
Parameter
Deskripsi
Resource Configuration
Jika Anda menggunakan open source model, sistem secara otomatis merekomendasikan dan memilih tipe instans yang sesuai berdasarkan kategori model yang dipilih.
Jika Anda menggunakan custom fine-tuned model, pilih tipe instans yang sesuai dengan model Anda. Untuk informasi selengkapnya, lihat Bagaimana cara beralih ke model besar open source lainnya?.
Inference Acceleration
Akselerasi inferensi didukung untuk model seri Qwen, Llama2, ChatGLM, atau Baichuan2 yang diterapkan pada instans seri A10 atau GU30. Dua jenis akselerasi didukung:
BladeLLM Inference Acceleration: BladeLLM menyediakan akselerasi inferensi LLM yang sangat hemat biaya, membantu Anda memanfaatkan konkurensi tinggi dan latensi rendah dalam satu klik.
Open-source vLLM Inference Acceleration
Pengaturan database vektor
Parameter
Deskripsi
Version Type
Pilih ApsaraDB RDS for PostgreSQL.
Host Address
Atur ke titik akhir internal atau publik instans ApsaraDB RDS for PostgreSQL.
Gunakan titik akhir internal: Jika aplikasi RAG dan database berada di wilayah yang sama, Anda dapat menggunakan titik akhir internal untuk menghubungkan ke instans.
Gunakan titik akhir publik: Jika aplikasi RAG dan database berada di wilayah berbeda, Anda harus meminta titik akhir publik untuk instans ApsaraDB RDS for PostgreSQL. Untuk informasi selengkapnya, lihat Ajukan atau lepas titik akhir publik.
Port
Nilai default adalah 5432. Masukkan nilai berbeda jika diperlukan.
Database
Nama database ApsaraDB RDS for PostgreSQL.
Table Name
Masukkan nama tabel baru atau yang sudah ada. Struktur tabel yang sudah ada harus memenuhi persyaratan PAI-RAG. Misalnya, Anda dapat memasukkan nama tabel yang secara otomatis dibuat saat Anda sebelumnya menerapkan layanan RAG menggunakan EAS.
Account
Akun istimewa instans ApsaraDB RDS for PostgreSQL.
Password
Password akun istimewa untuk instans ApsaraDB RDS for PostgreSQL.
Konfigurasi VPC
Parameter
Deskripsi
VPC
Jika Anda menggunakan titik akhir internal untuk alamat host, Anda harus mengonfigurasi layanan RAG agar menggunakan VPC yang sama dengan instans ApsaraDB RDS for PostgreSQL.
Jika Anda menggunakan titik akhir publik untuk alamat host, Anda harus mengonfigurasi VPC dan vSwitch untuk layanan RAG, serta mengonfigurasi gerbang NAT dan alamat IP elastis (EIP) untuk VPC guna menyediakan akses internet publik bagi aplikasi RAG. Untuk informasi selengkapnya, lihat Gunakan fitur SNAT gerbang NAT publik untuk mengakses internet. Anda juga harus menambahkan EIP yang ditautkan ke daftar putih alamat IP publik instans ApsaraDB RDS for PostgreSQL. Untuk informasi selengkapnya, lihat Konfigurasikan daftar putih alamat IP.
vSwitch
Security Group Name
Konfigurasikan security group.
PentingJangan gunakan security group bernama created_by_rds. Security group ini dicadangkan untuk penggunaan sistem internal.
Klik Deploy.
Saat Service Status berubah menjadi Running, layanan berhasil diterapkan.
Langkah 3: Validasi inferensi dengan UI web
Anda dapat terlebih dahulu men-debug layanan pada UI web dengan mengikuti langkah-langkah di bagian ini. Setelah mencapai performa tanya-jawab yang diinginkan di UI web, Anda dapat menggunakan API yang disediakan oleh PAI untuk mengintegrasikan layanan ke dalam sistem bisnis Anda sendiri. Untuk informasi selengkapnya, lihat Langkah 4: Validasi inferensi model menggunakan API.
1. Konfigurasikan layanan RAG
Setelah layanan RAG diterapkan, klik Service Type di kolom View Web App untuk membuka UI web.
Konfigurasikan model pembelajaran mesin.
Embedding Model Name: Empat model bawaan tersedia. Sistem secara otomatis memilih dan mengonfigurasi model yang paling sesuai.
Embedding Dimension: Setelah Anda memilih Embedding Model Name, sistem mengonfigurasi parameter ini secara otomatis. Tidak diperlukan tindakan tambahan.
Uji koneksi database vektor.
Sistem secara otomatis mendeteksi dan menerapkan pengaturan database vektor yang Anda konfigurasi saat penerapan layanan, dan pengaturan ini tidak dapat diubah. Klik Connect PostgreSQL untuk memverifikasi konektivitas ke ApsaraDB RDS for PostgreSQL.
2. Unggah file data bisnis
Pada tab Upload, unggah file data bisnis Anda. Format yang didukung adalah .txt, .pdf, Excel (.xlsx atau .xls), .csv, Word (.docx atau .doc), Markdown, dan .html.

Atur parameter chunking semantik.
Gunakan parameter berikut untuk mengontrol granularitas chunk dokumen dan melakukan ekstraksi informasi QA:
Parameter
Deskripsi
Chunk size
Ukuran setiap chunk dalam byte. Nilai default adalah 500.
Chunk overlap
Jumlah tumpang tindih antara chunk yang berdekatan. Nilai default adalah 10.
Process with QA extraction model
Pilih kotak centang Yes untuk mengaktifkan ekstraksi informasi QA. Sistem secara otomatis mengekstraksi pasangan tanya-jawab dari file data bisnis yang Anda unggah guna meningkatkan kualitas pengambilan dan respons.
Pada tab Files atau Directory, unggah file data bisnis Anda (beberapa file didukung) atau direktori yang sesuai. Misalnya, unggah rag_chatbot_test_doc.txt.
Setelah memilih file, sistem melakukan pembersihan data (ekstraksi teks, penggantian hyperlink, dan lainnya) serta chunking semantik pada file yang dipilih sebelum mengunggahnya.

3. Konfigurasikan parameter inferensi model
Pada tab Chat, konfigurasikan strategi tanya-jawab.
Retrieval Q&A

Parameter | Deskripsi |
Streaming output | Jika Anda memilih Streaming Output, sistem mengembalikan hasil dalam mode streaming. |
Retrieval model | Tiga metode pengambilan berikut didukung:
Catatan Pada sebagian besar skenario kompleks, pengambilan database vektor berkinerja baik. Namun, pada beberapa domain vertikal dengan korpus jarang atau skenario yang memerlukan pencocokan eksak, metode pengambilan vektor mungkin kurang efektif dibandingkan metode pengambilan sparse tradisional. Metode pengambilan sparse lebih sederhana dan efisien karena mengambil dengan menghitung tumpang tindih kata kunci antara kueri pengguna dan dokumen pengetahuan. ApsaraDB RDS for PostgreSQL menggunakan ekstensi pg_jieba untuk melakukan segmentasi teks Tionghoa guna recall berbasis kata kunci. Untuk informasi selengkapnya tentang cara menggunakan ekstensi pg_jieba, lihat Segmentasi kata Tionghoa (pg_jieba). |
Reranker type | Sebagian besar database vektor mengorbankan sebagian akurasi demi efisiensi komputasi, sehingga memperkenalkan sejumlah keacakan pada hasil pengambilannya. Akibatnya, hasil top K awal yang dikembalikan mungkin bukan yang paling relevan. Anda dapat memilih model simple-weighted-reranker atau model-based-reranker untuk melakukan operasi penyusunan ulang dengan presisi lebih tinggi pada hasil top K yang awalnya diambil oleh database vektor. Hal ini membantu Anda memperoleh dokumen pengetahuan yang lebih relevan dan akurat. Catatan Saat pertama kali menggunakan model, proses pemuatan mungkin memakan waktu lama. Pilih model sesuai kebutuhan Anda. |
Top K | Jumlah hasil serupa yang dikembalikan dari database vektor. Sistem mengambil kembali K hasil paling serupa. |
Similarity score threshold | Ambang batas kemiripan. Nilai yang lebih besar menunjukkan kemiripan yang lebih tinggi. |
RAG (Retrieval + LLM) Q&A

PAI menyediakan beberapa strategi prompt. Anda dapat memilih templat prompt pradidefinisi yang sesuai atau memasukkan templat prompt kustom untuk meningkatkan hasil inferensi.
Metode RAG (Retrieval + LLM) Q&A juga mendukung konfigurasi parameter seperti Streaming Output, Retrieval Mode, dan Reranker Type. Untuk informasi selengkapnya, lihat Retrieval Q&A.
4. Validasi inferensi model
Retrieval
Langsung mengambil dan mengembalikan K hasil paling serupa dari database vektor.
LLM
Langsung berinteraksi dengan layanan EAS-LLM dan mengembalikan respons LLM.

RAG (Retrieval + LLM)
Memasukkan hasil yang diambil dan pertanyaan pengguna ke dalam templat prompt yang dipilih, mengirim input gabungan tersebut ke layanan EAS-LLM, dan memperoleh hasil tanya-jawab.

Langkah 4: Validasi inferensi dengan API
Lihat basis pengetahuan di RDS for PostgreSQL
Setelah Anda terhubung ke database ApsaraDB RDS for PostgreSQL yang berfungsi sebagai database vektor, Anda dapat melihat konten basis pengetahuan yang diimpor. Untuk petunjuk cara menghubungkan ke database, lihat Hubungkan ke instans PostgreSQL.

Langkah Berikutnya
Anda juga dapat menggunakan EAS untuk penerapan berbasis skenario berikut:
Terapkan aplikasi LLM yang mendukung UI web dan panggilan API. Setelah menerapkan aplikasi, gunakan framework LangChain untuk mengintegrasikan basis pengetahuan perusahaan Anda guna mengaktifkan tanya-jawab cerdas dan otomatisasi. Untuk informasi selengkapnya, lihat Gunakan EAS untuk menerapkan aplikasi LLM secara cepat.
Terapkan layanan Pembuatan video AI berbasis model ComfyUI dan Stable Video Diffusion untuk membantu Anda menghasilkan konten video pendek untuk platform media sosial dan membuat animasi. Untuk informasi selengkapnya, lihat Pembuatan video AI - Penerapan ComfyUI.
FAQ
Bagaimana cara menonaktifkan riwayat chat di layanan RAG?
Di UI web layanan RAG, kosongkan kotak centang Chat history.
