All Products
Search
Document Center

ApsaraDB RDS:Menyebarkan layanan RAG dengan PAI-EAS dan RDS for PostgreSQL

Last Updated:Apr 28, 2026

Elastic Algorithm Service (EAS), bagian dari Platform for AI (PAI), menawarkan penerapan berbasis skenario. Dengan mengonfigurasi hanya beberapa parameter, Anda dapat menyebarkan sistem dialog yang mengintegrasikan large language model (LLM) dan teknologi Retrieval-Augmented Generation (RAG) dalam satu klik, sehingga secara signifikan mengurangi waktu penerapan. Selama inferensi, layanan ini mengambil informasi relevan dari basis pengetahuan dan menggabungkannya dengan respons LLM untuk menghasilkan jawaban yang akurat dan kaya informasi, meningkatkan kualitas serta performa sistem tanya-jawab Anda. Layanan ini ideal untuk tanya-jawab, pembuatan ringkasan, dan tugas Pemrosesan bahasa alami lainnya yang bergantung pada pengetahuan eksternal. Topik ini menjelaskan cara membangun database vektor menggunakan ApsaraDB RDS for PostgreSQL, menyebarkan layanan dialog RAG, dan memvalidasi hasil inferensi model.

Latar Belakang

Large language model (LLM) memiliki keterbatasan dalam akurasi dan kesegaran respons, sehingga tidak cocok untuk skenario yang memerlukan informasi tepat, seperti layanan pelanggan atau tanya-jawab. Untuk mengatasi hal ini, industri secara luas mengadopsi teknologi Retrieval-Augmented Generation (RAG) guna meningkatkan performa LLM. Teknik ini secara signifikan dapat meningkatkan kualitas tanya-jawab, pembuatan ringkasan, dan tugas Pemrosesan bahasa alami (NLP) lainnya yang bergantung pada pengetahuan eksternal.

RAG meningkatkan akurasi dan kelengkapan jawaban yang dihasilkan dengan menggabungkan LLM, seperti Qwen, dengan komponen pengambilan informasi. Saat memproses kueri pengguna, komponen pengambilan sistem RAG mencari dokumen atau cuplikan informasi relevan dalam basis pengetahuan. Konten yang diambil tersebut, bersama dengan kueri asli, kemudian diberikan ke LLM. Model tersebut lalu menggunakan kemampuan generasi induktifnya untuk menghasilkan respons berbasis fakta dan mutakhir tanpa perlu dilatih ulang.

Layanan sistem dialog yang diterapkan menggunakan EAS mengintegrasikan LLM dan teknologi RAG untuk mengatasi keterbatasan akurasi dan kesegaran LLM mandiri. Layanan ini memberikan respons yang akurat dan kaya informasi untuk berbagai skenario tanya-jawab, sehingga meningkatkan efektivitas keseluruhan dan pengalaman pengguna dalam tugas NLP.

Prasyarat

  • Anda telah membuat Virtual Private Cloud (VPC), vSwitch, dan security group. Untuk informasi selengkapnya, lihat Buat dan kelola VPC dan Buat security group.

  • Jika Anda menerapkan layanan menggunakan model fine-tuned kustom, siapkan bucket Object Storage Service (OSS) atau sistem file Apsara File Storage NAS (NAS) untuk menyimpan file model. Untuk informasi selengkapnya, lihat Memulai dengan konsol atau Buat sistem file.

Catatan Penggunaan

Prosedur ini tunduk pada batas token maksimum layanan LLM dan membantu Anda menjelajahi fungsi pengambilan dasar sistem dialog berbasis RAG:

  • Sumber daya server layanan LLM dan batas token default menentukan panjang percakapan maksimum.

  • Jika Anda tidak memerlukan percakapan multi-putaran, kami menyarankan agar Anda menonaktifkan fitur with chat history pada layanan RAG. Hal ini membantu Anda menghindari melebihi batas token. Untuk informasi selengkapnya, lihat Bagaimana cara menonaktifkan fitur "with chat history" pada layanan RAG?.

Langkah 1: Siapkan database vektor ApsaraDB RDS for PostgreSQL

Anda dapat membangun database vektor untuk RAG dengan ApsaraDB RDS for PostgreSQL. Anda akan memerlukan parameter konfigurasi untuk menghubungkan ke database tersebut.

  1. Buat instans ApsaraDB RDS for PostgreSQL secara cepat.

    Kami menyarankan agar Anda menerapkan instans ApsaraDB RDS for PostgreSQL dan layanan RAG di wilayah yang sama agar keduanya dapat berkomunikasi melalui jaringan internal VPC.

  2. Buat akun dan database untuk instans RDS. Untuk informasi selengkapnya, lihat Buat akun dan database.

    Catatan:

    • Saat membuat akun, atur Account Type ke Privileged Account.

    • Saat membuat database, pilih akun istimewa yang telah dibuat untuk Authorized By.

  3. Konfigurasikan koneksi database.

    1. Buka halaman Instances. Di bilah navigasi atas, pilih wilayah tempat instans RDS berada. Lalu, temukan instans RDS tersebut dan klik ID instans.

    2. Pada halaman Database Connection, lihat titik akhir database dan nomor port.

  4. Tambahkan pg_jieba ke Running Parameter Value dari shared_preload_libraries. Misalnya, ubah Running Parameter Value menjadi 'pg_stat_statements,auto_explain,pg_cron'. Untuk informasi selengkapnya, lihat Atur parameter instans.

    Catatan

    ApsaraDB RDS for PostgreSQL menggunakan ekstensi pg_jieba untuk melakukan segmentasi teks Tionghoa guna pengambilan dan recall berbasis kata kunci.

Langkah 2: Sebarkan layanan RAG

  1. Buka halaman layanan model online.

    1. Login ke Konsol PAI.

    2. Di panel navigasi kiri, klik Workspaces. Pada halaman Workspaces, klik nama ruang kerja yang ingin Anda kelola.

      Jika Anda belum memiliki ruang kerja, lihat Buat dan kelola ruang kerja.

    3. Di panel navigasi kiri ruang kerja, pilih Model Deployment > Elastic Algorithm Service (EAS) untuk membuka halaman Elastic Algorithm Service (EAS).image

  2. Pada halaman Elastic Algorithm Service (EAS), klik Deploy Service. Di bagian Scenario-based Model Deployment, klik RAG-based Smart Dialogue Deployment.6eea7736f88e6ec8b3b900e4d028bb48

  3. Pada halaman RAG-based LLM Chatbot Deployment, konfigurasikan parameter utama berikut.

    • Informasi dasar

      Parameter

      Deskripsi

      Service Name

      Nama layanan kustom.

      Model Source

      Nilai yang valid: Open Source Model dan Custom Fine-tuned Model.

      Model Type

      Pilih tipe model sesuai skenario Anda.

      Jika Anda menggunakan model fine-tuned kustom, Anda harus mengonfigurasi ukuran dan presisi model.

      Model Configuration

      Jika Anda menggunakan model fine-tuned kustom, Anda harus mengonfigurasi jalur file model fine-tuned tersebut. Dua metode didukung:

      Catatan

      Pastikan format file model kompatibel dengan HuggingFace Transformers.

      • By Object Storage Service (OSS): Pilih jalur OSS tempat file model fine-tuned disimpan.

      • By Apsara File Storage NAS: Pilih sistem file NAS dan jalur sumber NAS tempat file model fine-tuned disimpan.

    • Konfigurasi resource

      Parameter

      Deskripsi

      Resource Configuration

      • Jika Anda menggunakan open source model, sistem secara otomatis merekomendasikan dan memilih tipe instans yang sesuai berdasarkan kategori model yang dipilih.

      • Jika Anda menggunakan custom fine-tuned model, pilih tipe instans yang sesuai dengan model Anda. Untuk informasi selengkapnya, lihat Bagaimana cara beralih ke model besar open source lainnya?.

      Inference Acceleration

      Akselerasi inferensi didukung untuk model seri Qwen, Llama2, ChatGLM, atau Baichuan2 yang diterapkan pada instans seri A10 atau GU30. Dua jenis akselerasi didukung:

      • BladeLLM Inference Acceleration: BladeLLM menyediakan akselerasi inferensi LLM yang sangat hemat biaya, membantu Anda memanfaatkan konkurensi tinggi dan latensi rendah dalam satu klik.

      • Open-source vLLM Inference Acceleration

    • Pengaturan database vektor

      Parameter

      Deskripsi

      Version Type

      Pilih ApsaraDB RDS for PostgreSQL.

      Host Address

      Atur ke titik akhir internal atau publik instans ApsaraDB RDS for PostgreSQL.

      • Gunakan titik akhir internal: Jika aplikasi RAG dan database berada di wilayah yang sama, Anda dapat menggunakan titik akhir internal untuk menghubungkan ke instans.

      • Gunakan titik akhir publik: Jika aplikasi RAG dan database berada di wilayah berbeda, Anda harus meminta titik akhir publik untuk instans ApsaraDB RDS for PostgreSQL. Untuk informasi selengkapnya, lihat Ajukan atau lepas titik akhir publik.

      Port

      Nilai default adalah 5432. Masukkan nilai berbeda jika diperlukan.

      Database

      Nama database ApsaraDB RDS for PostgreSQL.

      Table Name

      Masukkan nama tabel baru atau yang sudah ada. Struktur tabel yang sudah ada harus memenuhi persyaratan PAI-RAG. Misalnya, Anda dapat memasukkan nama tabel yang secara otomatis dibuat saat Anda sebelumnya menerapkan layanan RAG menggunakan EAS.

      Account

      Akun istimewa instans ApsaraDB RDS for PostgreSQL.

      Password

      Password akun istimewa untuk instans ApsaraDB RDS for PostgreSQL.

    • Konfigurasi VPC

      Parameter

      Deskripsi

      VPC

      • Jika Anda menggunakan titik akhir internal untuk alamat host, Anda harus mengonfigurasi layanan RAG agar menggunakan VPC yang sama dengan instans ApsaraDB RDS for PostgreSQL.

      • Jika Anda menggunakan titik akhir publik untuk alamat host, Anda harus mengonfigurasi VPC dan vSwitch untuk layanan RAG, serta mengonfigurasi gerbang NAT dan alamat IP elastis (EIP) untuk VPC guna menyediakan akses internet publik bagi aplikasi RAG. Untuk informasi selengkapnya, lihat Gunakan fitur SNAT gerbang NAT publik untuk mengakses internet. Anda juga harus menambahkan EIP yang ditautkan ke daftar putih alamat IP publik instans ApsaraDB RDS for PostgreSQL. Untuk informasi selengkapnya, lihat Konfigurasikan daftar putih alamat IP.

      vSwitch

      Security Group Name

      Konfigurasikan security group.

      Penting

      Jangan gunakan security group bernama created_by_rds. Security group ini dicadangkan untuk penggunaan sistem internal.

  4. Klik Deploy.

    Saat Service Status berubah menjadi Running, layanan berhasil diterapkan.

Langkah 3: Validasi inferensi dengan UI web

Anda dapat terlebih dahulu men-debug layanan pada UI web dengan mengikuti langkah-langkah di bagian ini. Setelah mencapai performa tanya-jawab yang diinginkan di UI web, Anda dapat menggunakan API yang disediakan oleh PAI untuk mengintegrasikan layanan ke dalam sistem bisnis Anda sendiri. Untuk informasi selengkapnya, lihat Langkah 4: Validasi inferensi model menggunakan API.

1. Konfigurasikan layanan RAG

  1. Setelah layanan RAG diterapkan, klik Service Type di kolom View Web App untuk membuka UI web.

  2. Konfigurasikan model pembelajaran mesin.

    • Embedding Model Name: Empat model bawaan tersedia. Sistem secara otomatis memilih dan mengonfigurasi model yang paling sesuai.

    • Embedding Dimension: Setelah Anda memilih Embedding Model Name, sistem mengonfigurasi parameter ini secara otomatis. Tidak diperlukan tindakan tambahan.

  3. Uji koneksi database vektor.

    Sistem secara otomatis mendeteksi dan menerapkan pengaturan database vektor yang Anda konfigurasi saat penerapan layanan, dan pengaturan ini tidak dapat diubah. Klik Connect PostgreSQL untuk memverifikasi konektivitas ke ApsaraDB RDS for PostgreSQL.

2. Unggah file data bisnis

Pada tab Upload, unggah file data bisnis Anda. Format yang didukung adalah .txt, .pdf, Excel (.xlsx atau .xls), .csv, Word (.docx atau .doc), Markdown, dan .html.

image

  1. Atur parameter chunking semantik.

    Gunakan parameter berikut untuk mengontrol granularitas chunk dokumen dan melakukan ekstraksi informasi QA:

    Parameter

    Deskripsi

    Chunk size

    Ukuran setiap chunk dalam byte. Nilai default adalah 500.

    Chunk overlap

    Jumlah tumpang tindih antara chunk yang berdekatan. Nilai default adalah 10.

    Process with QA extraction model

    Pilih kotak centang Yes untuk mengaktifkan ekstraksi informasi QA. Sistem secara otomatis mengekstraksi pasangan tanya-jawab dari file data bisnis yang Anda unggah guna meningkatkan kualitas pengambilan dan respons.

  2. Pada tab Files atau Directory, unggah file data bisnis Anda (beberapa file didukung) atau direktori yang sesuai. Misalnya, unggah rag_chatbot_test_doc.txt.

  3. Setelah memilih file, sistem melakukan pembersihan data (ekstraksi teks, penggantian hyperlink, dan lainnya) serta chunking semantik pada file yang dipilih sebelum mengunggahnya.

    image

3. Konfigurasikan parameter inferensi model

Pada tab Chat, konfigurasikan strategi tanya-jawab.

Retrieval Q&A

image

Parameter

Deskripsi

Streaming output

Jika Anda memilih Streaming Output, sistem mengembalikan hasil dalam mode streaming.

Retrieval model

Tiga metode pengambilan berikut didukung:

  • Embedding only: mengambil hasil dari database vektor.

  • Keyword only: melakukan pengambilan berbasis kata kunci.

  • Hybrid: menggabungkan pengambilan database vektor dan pengambilan berbasis kata kunci.

Catatan

Pada sebagian besar skenario kompleks, pengambilan database vektor berkinerja baik. Namun, pada beberapa domain vertikal dengan korpus jarang atau skenario yang memerlukan pencocokan eksak, metode pengambilan vektor mungkin kurang efektif dibandingkan metode pengambilan sparse tradisional. Metode pengambilan sparse lebih sederhana dan efisien karena mengambil dengan menghitung tumpang tindih kata kunci antara kueri pengguna dan dokumen pengetahuan.

ApsaraDB RDS for PostgreSQL menggunakan ekstensi pg_jieba untuk melakukan segmentasi teks Tionghoa guna recall berbasis kata kunci. Untuk informasi selengkapnya tentang cara menggunakan ekstensi pg_jieba, lihat Segmentasi kata Tionghoa (pg_jieba).

Reranker type

Sebagian besar database vektor mengorbankan sebagian akurasi demi efisiensi komputasi, sehingga memperkenalkan sejumlah keacakan pada hasil pengambilannya. Akibatnya, hasil top K awal yang dikembalikan mungkin bukan yang paling relevan. Anda dapat memilih model simple-weighted-reranker atau model-based-reranker untuk melakukan operasi penyusunan ulang dengan presisi lebih tinggi pada hasil top K yang awalnya diambil oleh database vektor. Hal ini membantu Anda memperoleh dokumen pengetahuan yang lebih relevan dan akurat.

Catatan

Saat pertama kali menggunakan model, proses pemuatan mungkin memakan waktu lama. Pilih model sesuai kebutuhan Anda.

Top K

Jumlah hasil serupa yang dikembalikan dari database vektor. Sistem mengambil kembali K hasil paling serupa.

Similarity score threshold

Ambang batas kemiripan. Nilai yang lebih besar menunjukkan kemiripan yang lebih tinggi.

RAG (Retrieval + LLM) Q&A

image

  • PAI menyediakan beberapa strategi prompt. Anda dapat memilih templat prompt pradidefinisi yang sesuai atau memasukkan templat prompt kustom untuk meningkatkan hasil inferensi.

  • Metode RAG (Retrieval + LLM) Q&A juga mendukung konfigurasi parameter seperti Streaming Output, Retrieval Mode, dan Reranker Type. Untuk informasi selengkapnya, lihat Retrieval Q&A.

4. Validasi inferensi model

Retrieval

Langsung mengambil dan mengembalikan K hasil paling serupa dari database vektor.

image

LLM

Langsung berinteraksi dengan layanan EAS-LLM dan mengembalikan respons LLM.

image

RAG (Retrieval + LLM)

Memasukkan hasil yang diambil dan pertanyaan pengguna ke dalam templat prompt yang dipilih, mengirim input gabungan tersebut ke layanan EAS-LLM, dan memperoleh hasil tanya-jawab.

image

Langkah 4: Validasi inferensi dengan API

Lihat basis pengetahuan di RDS for PostgreSQL

Setelah Anda terhubung ke database ApsaraDB RDS for PostgreSQL yang berfungsi sebagai database vektor, Anda dapat melihat konten basis pengetahuan yang diimpor. Untuk petunjuk cara menghubungkan ke database, lihat Hubungkan ke instans PostgreSQL.

image

Langkah Berikutnya

Anda juga dapat menggunakan EAS untuk penerapan berbasis skenario berikut:

  • Terapkan aplikasi LLM yang mendukung UI web dan panggilan API. Setelah menerapkan aplikasi, gunakan framework LangChain untuk mengintegrasikan basis pengetahuan perusahaan Anda guna mengaktifkan tanya-jawab cerdas dan otomatisasi. Untuk informasi selengkapnya, lihat Gunakan EAS untuk menerapkan aplikasi LLM secara cepat.

  • Terapkan layanan Pembuatan video AI berbasis model ComfyUI dan Stable Video Diffusion untuk membantu Anda menghasilkan konten video pendek untuk platform media sosial dan membuat animasi. Untuk informasi selengkapnya, lihat Pembuatan video AI - Penerapan ComfyUI.

FAQ

Bagaimana cara menonaktifkan riwayat chat di layanan RAG?

Di UI web layanan RAG, kosongkan kotak centang Chat history.image