將阿里雲 Elasticsearch 或 OpenSearch 向量檢索版中的資料接入 AI 搜尋開放平台,構建企業專屬知識庫。知識庫支援文檔自動解析、檔案匯入和資料查詢,並可在 Agentic Search 中基於知識庫構建智能問答與檢索應用。
建立知識庫
登入AI搜尋開放平台控制台。
在左側導覽列單擊知识库,進入知識庫列表頁,單擊创建知识库。
配置以下參數:
基礎資訊
參數
說明
知识库名称
知識庫的唯一名稱,長度為 1~30 個字元,以字母開頭,可包含小寫字母、數字和底線,不能與同一工作空間內的其他知識庫名稱重複。
描述
知識庫的用途說明,最多 1024 個字元。
知識庫引擎配置
參數
說明
引擎
知識庫所使用的底層搜尋引擎,可選:
阿里云 Elasticsearch
阿里云 OpenSearch向量检索版
网络类型
訪問引擎的網路方式,預設為公網。
域名
引擎執行個體的訪問地址。選擇 Elasticsearch 時,填寫執行個體的公網或 VPC 網域名稱;選擇 OpenSearch 向量檢索版時,填寫執行個體的公網訪問地址。需要將 AI 搜尋開放平台的 IP 加入引擎執行個體的白名單,具體 IP 以控制台提示為準。
鉴权信息
訪問引擎的認證憑證。Elasticsearch 填寫格式為
使用者名稱:密碼;OpenSearch 向量檢索版填寫 AccessKey。資料授權
勾選同意授權平台讀取所選引擎中的資料,用於知識庫的構建與檢索。
文檔處理配置
參數
說明
文件解析模型
文檔內容解析所使用的服務,固定為 ops-document-analyze-002。該服務對錶格、公式、圖表等複雜元素的識別能力出色。處理 PDF 檔案時,頁數不超過 400 頁。
文档切片
預設開啟。開啟後將文檔按單句進行切片,適合需要精細粒度檢索的情境。
图片内容解析
預設開啟。開啟後將對文檔中的圖片進行識別與理解,提升含圖文檔的檢索品質。
理解增强
預設開啟。啟用文本增強、文檔摘要與章節摘要功能,對文檔內容進行語義理解增強,並自動產生文檔摘要與各章節摘要,提升檢索相關性與全域理解能力。
向量化模型
將文檔內容嵌入為向量的模型。可選 text-embedding-v4 或 ops-qwen3-embedding-0.6b,需與引擎中的向量索引保持一致。
多模态向量化模型
用於處理文檔中圖片等多模態內容的向量化模型。可選 qwen3-vl-embedding 或 qwen3-vl-plus。
模型服務配置
參數
說明
API Key 配置
配置模型服務所需的 API Key、工作空間和串連網域名稱。單擊未配置按鈕開啟配置面板,選擇工作空間、API-KEY 和串連網域名稱(支援 VPC 和公網兩種方式),確認後按鈕變為已配置。
风险提示
勾選確認已閱讀風險提示。
计费提示
此配置將產生 AI 搜尋開放平台相關費用,需確認已瞭解計費方式和計費項目。
參數配置完成後,單擊确定完成知識庫建立。建立成功後,知識庫將出現在列表頁中。
匯入檔案
知識庫建立完成後,可通過檔案匯入功能將文檔資料匯入知識庫。在知識庫列表頁,單擊目標知識庫操作列中的文件导入。
本地檔案上傳
支援以下兩類檔案的上傳:
非结构化数据:支援 doc、docx、pdf、html、txt、ppt、pptx、xls、xlsx、mp4、avi、mkv、mov 格式,單個檔案不超過 1 GB。
结构化数据:支援 JSON、EXCEL(UTF-8 編碼)格式,單個檔案不超過 1 GB。
從資料來源上傳(OSS)
支援從Object Storage Service 匯入檔案。選擇从数据源上传頁簽,配置 OSS 訪問網域名稱、OSS 路徑和 OSS 儲存空間(Bucket)。
資料查詢
在知識庫列表頁,單擊目標知識庫操作列中的数据查询,查看已匯入檔案的處理詳情。面板中展示以下資訊:
概覽統計:總檔案數、解析成功數、總切片數、總向量數。
檔案清單:每個檔案的處理狀態(成功/失敗)、切片數、向量數、耗時,以及處理結果詳情(支援展開查看切片內容)。支援按檔案名稱搜尋和分頁瀏覽。
編輯知識庫
在知識庫列表頁,單擊目標知識庫操作列中的编辑,可修改知識庫的引擎配置、文檔處理配置和模型服務配置。修改後可選擇是否將變更應用於已處理的文檔(勾選後將重新解析並建立索引,耗時較長)。
刪除知識庫
在知識庫列表頁,單擊目標知識庫操作列中的 ⋮ 表徵圖,選擇删除。在確認對話方塊中單擊確定刪除。刪除後資料無法恢複。