全部產品
Search
文件中心

Web Application Firewall:使用Bot管理管控AI爬蟲

更新時間:Jul 21, 2026

針對AI爬蟲、AI智能體及AI搜尋請求,可通過WAF Bot管理的“AI爬蟲管控”功能查看請求概覽與詳細資料,並一鍵執行流量處置。此類自動化程式主要用於高頻抓取網頁內容,以支援模型訓練、知識庫構建及AI應用運行。該功能可協助網站精準識別並管控此類流量,在保護智慧財產權與核心商業資料的同時,避免伺服器頻寬資源被過度消耗。

基本概念

  • AI 爬蟲(AI-Crawler)

    • 核心目的:批量抓取網站內容,用於大語言模型訓練或構建檢索增強產生(RAG)語料。

    • 行為特徵:執行批量、遍曆式的資料抓取。此類程式通常會在要求標頭中聲明專屬的 User-Agent,並聲明遵循 robots.txt 協議。

    • 與傳統爬蟲的區別:抓取的內容主要用於模型訓練或語料庫建設,通常不會為網站帶來直接的流量回報。

    • 典型代表:GPTBot(OpenAI)、ClaudeBot(Anthropic)、Google-Extended、CCBot(Common Crawl)、Bytespider 等。

  • AI 搜尋(AI-Search)

    • 核心目的:響應使用者的即時提問,從網站擷取特定內容作為產生答案的引用來源。

    • 行為特徵:由使用者的單次提問驅動,執行即時、按需的單次訪問,而非背景批量遍曆。此類訪問通常會在產生的回答中附帶來源連結,能夠為網站提供曝光度與引用價值。

    • 典型代表:OAI-SearchBot(OpenAI)、PerplexityBot(Perplexity)、Gemini-Deep-Research(Google)等。

  • AI 智能體(AI-Agent)

    • 核心目的:代替真實使用者在網站上執行特定業務操作,例如資訊查詢、價格比對、表單填寫、帳號登入或訂單提交。

    • 行為特徵:具有明確意圖的互動行為。除讀取內容外,還會執行點擊、表單提交等完整的商務程序。此類程式通常驅動真實的瀏覽器環境,其訪問指紋高度接近真人使用者。這是最難識別且最易引發業務安全風險的一類訪問。

    • 典型代表:ChatGPT-User(OpenAI)、Claude-User(Anthropic),以及各類基於 Computer-Use 或瀏覽器自動化技術的 AI Agent。

操作步驟

說明

執行操作前,請確保已滿足如下條件:

  1. 已存在防護對象:Web業務須已接入WAF,若尚未將業務接入,請參見接入概述

  2. 已開通Bot管理:訂用帳戶使用者須開通Bot管理(訂用帳戶基礎版不支援)。具體操作請參見開通Bot管理

登入Web Application Firewall3.0控制台。在頂部功能表列,選擇WAF執行個體的資源群組和地區(中國內地非中國內地),在左側導覽列,選擇防護配置 > BOT管理 > AI爬虫管控

查看 AI 爬蟲請求概覽

AI爬虫管控頁面,系統展示 AI 爬虫总请求数已识别 AI 爬虫已拦截 AI 爬虫请求数。頁面下方提供詳細資料列表,支援通過頂部搜尋欄按時間防護對象路徑AI 類別等條件進行篩選查詢。

欄位說明

  • 名称:AI 爬蟲或智能體的具體名稱。

  • 类别:AI 的類型,包括 AI-Crawler(AI 爬蟲)、AI-Agent(AI 智能體)和 AI-Search(AI 搜尋)。

  • 请求数拦截请求数:當前統計周期內,該 AI 發起的總請求次數及被 WAF 成功攔截的次數。

  • 趋势图:請求量的變化趨勢可視化圖表。

  • TOP 接口:請求量最高的訪問路徑(例如 /index.php)。

  • 防护对象:接入WAF的防護對象。

處置AI爬蟲請求

預設情況下,WAF不存在針對AI爬蟲請求的規則,若此行為無法滿足業務需求,可針對特定 AI 請求進行手動幹預。操作步驟如下:

  1. AI爬虫管控頁面下方地區,定位至目標AI名稱。

  2. 單擊其操作列的观察拦截執行處置。

    1. 观察:僅記錄請求日誌,不阻斷流量。

    2. 拦截:記錄請求日誌並阻斷流量。

系統將根據所選操作自動產生對應的高级自定义规则模板與規則,可以在高级自定义规则頁面進行查看。具體內容,請參見配置Bot管理進階自訂規則

配置建議

針對不同類型的 AI 流量,建議採取差異化的管控策略,避免採取統一的攔截或允許存取機制。具體策略如下:

一、AI 爬蟲管控策略

  1. 明確授權與基礎管控:首先需評估是否允許網站內容被用於大模型訓練。若拒絕授權,建議對訓練類爬蟲實施攔截或限速;若允許授權,亦應實施頻率控制,以防止高頻抓取影響來源站點效能。

  2. 實施分級管控:可根據內容價值進行差異化管理。對核心頁面(如本文、商品詳情頁)實施嚴格管控,對公開介紹頁等常規內容可適當放寬限制。

二、AI 搜尋管控策略

  1. 預設允許存取與監控:多數網站期望通過 AI 搜尋擷取曝光與引用價值,建議對此類流量預設允許存取,並同步配置頻率與流量監控機制。

  2. 精微調權限控制:若對內容著作權或引用範圍存在顧慮,可對特定目錄或頁面單獨設定訪問限制,確保公開內容可被正常引用,同時防止敏感內容泄露。

三、AI 智能體管控策略

  1. 接入業務安全風控:此類流量風險最高,不建議僅採取簡單的攔截措施,而應將其接入Bot管理Web防護/App防護帳號安全防護

  2. 強化關鍵業務防護:針對登入、下單、領券、表單提交等關鍵業務動作,建議疊加帳號安全防護、訪問頻率限制與人機校正機制。此舉旨在防範自動化作弊行為(如大量註冊、搶佔庫存、惡意套利等),同時確保正常真人使用者的業務體驗不受影響。

四、策略實施與動態調整

上述策略可根據實際業務需求組合使用。建議先利用 AI 爬蟲管控系統的流量分析與統計報表,持續觀察各類 AI 流量的構成與演變趨勢。在此基礎上,逐步調整允許存取、限速與攔截規則,以在內容保護、業務安全與流量價值之間實現最佳平衡。