全部產品
Search
文件中心

Agent Security Center:AI Red Teaming

更新時間:Jul 14, 2026

AI 應用部署到生產環境之前,需要驗證模型和智能體是否存在提示詞注入、資料泄露等安全風險。AI Red Teaming 是Security Center Agent 資訊安全中心下的安全評估功能,對AI 模型和 AI 智能體執行安全評估,識別潛在攻擊面和漏洞。支援以下兩種檢測物件類型:

功能概述

AI Red Teaming可用於檢測接入的 AI 模型和 AI 智能體(Agent)是否存在安全風險。通過添加檢測對象,可以對 AI 服務進行安全評估,識別潛在的攻擊面和安全性漏洞。

  • 支援的檢測對象:

    • AI 模型:檢測 OpenAI 相容或 Anthropic 相容的 AI 模型服務,檢測通過 API 接入的大語言模型是否存在提示詞注入、資料泄露等安全風險。

    • AI 智能體:檢測部署在阿里雲百鍊、Dify、PAI 等平台上的智能體應用的安全性。

  • 檢測結果說明:當前僅支援報告下載,不支援自動處理,不會同步至Agent 風險列表中。

AI模型檢測

Agent 安全中心提供 AI Red Teaming 模型檢測服務,對 AI Agent 相關的 AI 模型進行提示詞注入、越獄攻擊、混淆與走私攻擊、指令與隱私泄露等安全風險檢測。當前處於公測階段,無需聯絡商務經理,即可享受服務。

  1. 進入檢測配置頁

    1. 訪問Security Center控制台-Agent資訊安全中心-Agent概覽,在頁面左側頂部,選擇需防護資產所在的地區:中國內地非中國內地

    2. 單擊中心地區的 AGENTS 表徵圖,進入 Agent 列表頁。

    3. 單擊目標 Agent,在中央畫布地區單擊 AI Red Teaming 表徵圖。

  2. 配置模型

    說明

    如需配置多個模型,對每個模型重複以下步驟。

    1. 在 AI Red Teaming 頁面,單擊添加模型

    2. 添加模型配置彈窗,配置以下資訊。

      • 模型名稱:系統將自動同步當前 Agent 關聯的模型。

        重要
        • 模型檢測範圍,以下拉框顯示列表資料為準。

        • 當前 Agent 無關聯模型(MODEL 為 0),則可選模型列表為空白,即無法進行 AI Red Teaming模型檢測。

      • API Key:調用模型的 API Key。部分 Agent 擷取方法如下:

      • Endpoint:僅 Dify 需配置,為模型供應商的 API 訪問地址。聯絡對應模型供應商擷取。

  3. 測試連接

    1. 配置完成後,單擊測試連接

    2. 測試通過後,單擊確定

      說明

      若測試失敗,參考Agent 風險檢測與防護

  4. 掃描模型

    1. 選擇掃描方式

      操作

      使用情境

      操作步驟

      立即掃描

      驗證單個模型,適用於新增模型或單個模型配置變更後的快速驗證。

      已配置模型列表中,單擊目標模型地區的立即掃描

      全部檢測

      批量檢測全部模型,適用於定期全面安全檢查或重大配置變更後的驗證。

      單擊已配置模型列表上方地區的全部檢測

    2. 等待檢測結果:模型檢測需要一定時間,可在模型列表地區查看檢測進度。

    3. 下載報告:檢測完成後,單擊目標模型地區的下載報告,可查看檢測結果。

AI 模型和智能體全面檢測

服務開通

AI Red Teaming 控制台當前處於邀測階段,如需開通服務,請聯絡商務經理。

添加檢測對象

  1. 登入Security Center控制台

  2. 在左側導覽列選擇Agent 安全中心>AI Red Teaming.

  3. 在 AI Red Teaming 列表上方,單擊添加檢測對象

  4. 目標資訊頁面,配置以下參數。配置完成後,單擊下一步進入串連參數配置。

    參數

    說明

    目標名稱

    自訂名稱,用於標識和管理檢測對象。

    描述

    可選。輸入檢測對象的描述資訊。

    目標類型

    AI 模型:用於相容 OpenAI 或 Anthropic 介面的模型服務。

    AI 智能體:適用於部署在阿里雲百鍊、Dify 等平台上的智能體應用。

    說明

    選擇不同類型後,後續步驟的參數配置會相應變化。

    接入方式

    僅當目標類型為AI 模型時顯示。

    • OpenAI 相容:適用於相容 OpenAI Chat Completions API 格式的模型服務,如阿里雲百鍊、Azure OpenAI 及各種開源模型部署。

    • Anthropic 相容:適用於相容 Anthropic Messages API 格式的模型服務。

    快捷接入

    僅當目標類型為AI 智能體時顯示。支援的平台有:阿里雲百鍊DifyAgent RunPAIAgentKit 等。

  5. 串連參數頁簽,根據目標類型,填寫串連參數。配置完成後,單擊下一步進入串連驗證。

    AI 模型參數

    參數

    說明

    流式輸出

    是否啟用流式輸出。預設啟用。

    API地址

    AI 模型的 API 地址。

    如阿里雲百鍊的 OpenAI 相容 API 地址為 https://dashscope.aliyuncs.com/compatible-mode/v1

    API Key

    用於認證的存取金鑰。

    如阿里雲百鍊使用者可在百鍊控制台的 API Key 管理頁面建立 API Key。

    模型名稱

    待測試的模型名稱。阿里雲百鍊樣本:qwen-plusqwen-max

    平台

    從下拉式清單中選擇 AI 模型所屬平台,如阿里雲百鍊。

    AI 智能體參數

    基礎參數

    參數

    說明

    流式輸出

    是否啟用流式輸出。

    重要

    PAI 預設開啟流式輸出,不支援關閉。

    API地址

    智能體的 API 地址。

    • PAI:格式為http://{uid}.{region}.pai-eas.aliyuncs.com/api/predict/{serviceName}/v1/chat/completions,將 {uid}/{region}/{serviceName} 替換為實際的PAI-EAS服務配置。

    • 阿里雲百鍊https://dashscope.aliyuncs.com/api/v1/apps/{appId}/completion,其中 {appId} 為百鍊應用ID。

    • Dify:格式為http://{host}/v1/chat-messages,將 {host} 替換為實際的Dify服務地址。

    • Agent Run:格式為https://{workspaceId}.agentrun-data.{region}.aliyuncs.com/agent-runtimes/{agentName}/endpoints/Default/invocations/openai/v1/chat/completions,將 {workspaceId}/{region}/{agentName} 替換為實際的Agent Run配置。

    • AgentKit:格式https://{id}.apigateway-{region}.volceapi.com/invoke,將 {id} 和 {region} 替換為實際的 Agent Kit 網關配置。

    API Key

    用於認證的存取金鑰。

    如阿里雲百鍊使用者可在百鍊控制台的 API Key 管理頁面建立 API Key。

    模型名稱

    僅 PAI 平台時顯示,填寫模型名稱。

    進階設定(可選)

    參數

    說明

    HTTP方法

    要求方法:GET、POST 或 PUT。預設 POST。

    認證方式

    選擇認證方式:無、Bearer Token 或自訂 Header。

    認證頭名稱

    僅認證方式為自訂 Header 時顯示。填寫自訂認證頭名稱。

    超時時間

    請求逾時時間,單位毫秒。預設 30000。

    請求模版

    請求體模版,按平台預設。

    JSONPath

    響應解析路徑,按平台預設。

    要求標頭

    自訂要求標頭,JSON 格式。

  6. 驗證串連頁簽,確認已配置的目標詳情後,單擊連通性測試,驗證配置的參數能否串連到 AI 服務。

    重要
    • 僅在連通性測試通過後才能單擊保存,如測試失敗,檢查 API 地址、API Key 和模型名稱是否正確。

    • 連通性測試並不真正執行檢測任務,僅進行網路連接、API Key、API地址校正。

    • 測試中:按鈕顯示載入動畫。

    • 測試通過:按鈕變為成功狀態,保存按鈕變為可用。

    • 測試失敗:在串連測試失敗提示地區可查看失敗原因。若因網路等原因導致失敗,可單擊重試按鈕,重新測試。

配置檢測強度(可選)

  1. 單擊目標檢測對象操作列的image下的配置檢測任務

  2. 配置檢測任務面板選擇檢測強度:

    重要

    系統預設使用快速檢測

    檢測強度

    說明

    適用情境

    快速檢測

    使用常見基礎攻擊手法進行檢測,預計耗時 10~20 分鐘。

    適用於日常快速驗證。

    標準檢測

    在基礎攻擊手法之上額外覆蓋進階攻擊手法,預計耗時 30~40 分鐘。

    適用於上線前全面安全評估。

  3. 單擊确定儲存配置。

執行檢測

重要
  • 當檢測狀態為準備中排隊中檢測中時,檢測按鈕不可用,需等待上一次檢測完成。

  • 預設檢測強度為快速檢測

  1. 選擇檢測對象:

    • 單個檢測:單擊目標檢測對象操作列的檢測

    • 批量檢測:勾選多個檢測對象後,單擊 AI Red Teaming 列表下方的檢測

  2. 確認對話方塊中,單擊确定

  3. 檢測任務建立成功後,列表自動重新整理,檢測狀態將更新。

查看檢測任務及報告

  1. 單擊目標檢測對象操作列的image下的查看檢測記錄或單擊檢測次數列的數字。

  2. 檢測記錄面板可查看檢測資訊,支援按檢測強度掃描進度查詢。

    名稱

    說明

    掃描任務編號

    檢測任務的唯一編號。

    檢測強度

    快速檢測或標準檢測。

    掃描發起時間

    檢測任務的開始時間。

    掃描完成時間

    檢測任務的完成時間。

    掃描任務進度

    任務執行進度,運行中時顯示完成百分比。

    風險等級

    該次檢測發現的風險等級。

  3. 查看報告:檢測完成,單擊任務操作列的查看報告,可查看智能體或模型的安全評估報告。包含概覽、安全評分、攻擊分布、風險矩陣、攻擊手法分析、攻擊意圖分析、攻擊案例詳情、安全建議。

  4. 下載報告:檢測完成,單擊任務操作列的下載報告,可將安全報告下載到本地儲存。

停止或刪除檢測任務

  1. 單擊目標檢測對象操作列的image下的查看檢測記錄或單擊檢測次數列的數字。

  2. 檢測記錄面板,單擊目標任務操作列的停止刪除

    操作

    適用範圍

    執行效果

    停止

    僅未完成的任務

    終止掃描,保留檢測記錄。

    刪除

    所有狀態的任務

    終止掃描,並刪除檢測記錄。

管理檢測對象

修改檢測對象

  1. 在 AI Red Teaming 列表頁,單擊目標檢測對象操作列的image下的設定物件

  2. 設定物件面板中,支援修改流式輸出開關、API地址API Key以及進階設定。參數說明,參見串連參數

  3. 修改完成後,單擊連通性測試驗證新配置。

    重要

    如測試失敗,檢查修改後的 API 地址、API Key 和模型名稱是否正確,確認無誤後重試。

  4. 測試通過後,單擊确定儲存修改。

刪除檢測對象

  1. 選擇檢測對象:

    • 單個檢測:單擊目標檢測對象操作列的image刪除

    • 批量檢測:勾選多個檢測對象後,單擊 AI Red Teaming 列表下方的刪除

  2. 確認對話方塊中,單擊确定

  3. 刪除成功後,該檢測對象從列表中移除。

計費說明

公測期間免費使用。

常見問題

連通性測試失敗怎麼辦?

如果 AI 模型類型的檢測對象連通性測試失敗,排查以下原因:

  • 網路不通:確認當前地區的Security Center能夠訪問 AI 模型的 API 地址。如果 AI 模型部署於私人網路,需要配置網路連通策略。

  • API Key 無效或到期:確認 API Key 有效且未到期,可以嘗試使用 curl 命令手動調用 API 確認。

  • 模型名稱錯誤:確認模型名稱與 AI 模型服務提供者提供的名稱一致。

  • API 地址格式錯誤:確認 API 地址 URL 正確且可訪問。