全部產品
Search
文件中心

:大模型RAG對話系統(v0.3.x)

更新時間:Jun 17, 2026

RAG(Retrieval-Augmented Generation,檢索增強產生)技術通過從外部知識庫檢索相關資訊,並將其與使用者輸入合并後傳入大語言模型(LLM),從而增強模型在私人領域知識問答方面的能力。EAS提供情境化部署方式,能快速構建與部署RAG對話系統,並支援靈活選擇大語言模型和向量檢索庫。本文為您介紹如何部署RAG對話系統服務以及如何進行模型推理驗證。

重要

本文適用於RAG版本0.3.4和0.3.5,推薦使用最新版本

步驟一:部署RAG服務

  1. 登入PAI控制台,在頁面上方選擇目標地區,並在右側選擇目標工作空間,然後單擊進入EAS

  2. 推理服务頁簽,單擊部署服务,然後在场景化模型部署地區,單擊大模型RAG对话系统部署

  3. 部署大模型RAG对话系统頁面,配置如下關鍵參數:

    • 版本选择RAG服務支援兩種部署模式,根據應用情境和資源規划進行選擇。

      • LLM一体化部署:將RAG服務與大語言模型(如Qwen)部署在同一個EAS服務執行個體中。此模式配置簡單,適合快速驗證和原型開發。

      • LLM分离式部署:僅部署RAG服務,大語言模型作為獨立的服務存在。此模式允許RAG服務串連到不同的LLM服務(如其他EAS部署的LLM或阿里雲百鍊模型服務),便於資源複用和獨立擴充。適合生產環境或已有LLM服務的情境。

    • 部署资源:為服務分配合適的計算資源。

      • LLM一体化部署:系統會根據所選的模型類別自動推薦資源規格。更改為更低的規格可能導致服務啟動失敗。

      • LLM分离式部署:RAG服務本身資源消耗較低。建議選擇至少8核CPU和16 GB記憶體的規格,例如 ecs.g6.2xlargeecs.g6.4xlarge

    • 向量檢索庫設定:

      • 版本类型:選擇FAISS(構建本地向量庫以便快速實踐)。生產環境建議使用其他成熟的向量檢索庫,配置方式請參見使用阿里雲向量資料庫

      • OSS地址:選擇當前地區下已建立的OSS儲存目錄,用來儲存上傳的知識庫檔案。如果沒有可選的儲存路徑,您可以參考控制台快速入門進行建立。

        說明

        如果您選擇使用自持微調模型部署服務,請確保所選的OSS儲存路徑不與自持微調模型所在的路徑重複,以避免造成衝突。

    • 專用網路:如下進行EAS訪問公網或內網資源,確保RAG服務能與LLM服務、向量檢索庫及其他雲端服務正常通訊。

      • 訪問公網服務:通過公網訪問向量資料庫、LLM服務(如阿里雲百鍊模型服務)以及使用連網搜尋,必須為EAS服務配置公網訪問能力。

      • 訪問私網服務

        • 通過內網地址訪問向量資料庫,需RAG服務與向量資料庫處於同一VPC內。

        • 通過內網地址訪問LLM服務,需RAG服務與LLM服務處於同一VPC內。

      說明
      • Hologres、Elasticsearch、RDS PostgreSQL支援通過內網或公網訪問,推薦使用內網訪問。

      • Faiss向量檢索庫,無需通過網路訪問。OpenSearch只支援通過公網訪問。

  1. 參數配置完成後,單擊部署。當服务状态變為运行中時,表示服務部署成功(服務部署時間長度通常約為5分鐘,具體時間長度可能因模型參數量或其他因素略有差異,請耐心等待)。

步驟:API調用

RAG服務提供API介面(如知識庫管理員、對話等),便於整合到應用程式中。詳情請參見RAG API介面說明

成本與風險說明

成本構成

部署和使用本方案涉及的費用主要包括:

  • EAS資源的費用: RAG服務運行所佔用的計算資源(vCPU、記憶體、GPU等)按時收費。服務停止後,此部分費用即停止。

  • 向量檢索庫費用: 若使用Elasticsearch、、HologresOpenSearchRDS PostgreSQL,需支付相應產品的執行個體費用。

  • Object Storage Service費用: 用於儲存原始知識庫檔案。

  • 大語言模型調用費用: 若使用阿里雲百鍊等商業模型服務,會產生API調用費用。

  • 公網NAT Gateway費用: 若EAS服務需要訪問公網,會產生NAT Gateway的費用。

  • 網路搜尋服務費用: 若啟用連網搜尋功能(如Bing),會產生相應搜尋服務的費用。

重要

停止EAS服務後,僅能停止EAS資源的收費。若需停止其他產品的收費,請參考對應產品的文檔指引,按照說明停止或刪除相關執行個體。

關鍵風險與限制

  • 對話長度限制: 受限於所選LLM服務的上下文視窗大小(Token限制),單次對話能處理的文本長度有限。

  • 檔案覆蓋: 在使用除FAISS外的向量檢索庫時,上傳同名檔案將直接覆蓋已有資料,操作前需謹慎。

  • API參數限制: 僅部分功能參數可通過API進行配置,其餘進階配置(如多數檢索調優參數)仍需通過WebUI完成。

注意事項

本實踐受制於LLM服務的伺服器資源大小以及預設Token數量限制,能支援的對話長度有限,旨在協助您體驗RAG對話系統的基本檢索功能。

常見問題

通過API設定的參數為什麼沒有生效?

目前,PAI-RAG服務僅支援通過API設定介面說明文檔中列出的參數,其餘參數需通過WebUI介面進行配置。