AI 應用部署到生產環境之前,需要驗證模型和智能體是否存在提示詞注入、資料泄露等安全風險。AI Red Teaming 是Security Center Agent 資訊安全中心下的安全評估功能,對AI 模型和 AI 智能體執行安全評估,識別潛在攻擊面和漏洞。支援以下兩種檢測物件類型:
功能概述
AI Red Teaming可用於檢測接入的 AI 模型和 AI 智能體(Agent)是否存在安全風險。通過添加檢測對象,可以對 AI 服務進行安全評估,識別潛在的攻擊面和安全性漏洞。
支援的檢測對象:
AI 模型:檢測 OpenAI 相容或 Anthropic 相容的 AI 模型服務,檢測通過 API 接入的大語言模型是否存在提示詞注入、資料泄露等安全風險。
AI 智能體:檢測部署在阿里雲百鍊、Dify、PAI 等平台上的智能體應用的安全性。
檢測結果說明:當前僅支援報告下載,不支援自動處理,不會同步至Agent 風險列表中。
AI模型檢測
Agent 安全中心提供 AI Red Teaming 模型檢測服務,對 AI Agent 相關的 AI 模型進行提示詞注入、越獄攻擊、混淆與走私攻擊、指令與隱私泄露等安全風險檢測。當前處於公測階段,無需聯絡商務經理,即可享受服務。
進入檢測配置頁
訪問Security Center控制台-Agent資訊安全中心-Agent概覽,在頁面左側頂部,選擇需防護資產所在的地區:中國內地或非中國內地。
單擊中心地區的 AGENTS 表徵圖,進入 Agent 列表頁。
單擊目標 Agent,在中央畫布地區單擊 AI Red Teaming 表徵圖。
配置模型
說明如需配置多個模型,對每個模型重複以下步驟。
在 AI Red Teaming 頁面,單擊添加模型。
在添加模型配置彈窗,配置以下資訊。
模型名稱:系統將自動同步當前 Agent 關聯的模型。
重要模型檢測範圍,以下拉框顯示列表資料為準。
當前 Agent 無關聯模型(MODEL 為 0),則可選模型列表為空白,即無法進行 AI Red Teaming模型檢測。
API Key:調用模型的 API Key。部分 Agent 擷取方法如下:
百鍊:參考擷取API Key。
PAI:參考擷取訪問地址和 Token。
Dify:聯絡對應模型供應商擷取 API Key。
Endpoint:僅 Dify 需配置,為模型供應商的 API 訪問地址。聯絡對應模型供應商擷取。
測試連接
配置完成後,單擊測試連接。
測試通過後,單擊確定。
說明若測試失敗,參考Agent 風險檢測與防護。
掃描模型
選擇掃描方式
操作
使用情境
操作步驟
立即掃描
驗證單個模型,適用於新增模型或單個模型配置變更後的快速驗證。
在已配置模型列表中,單擊目標模型地區的立即掃描。
全部檢測
批量檢測全部模型,適用於定期全面安全檢查或重大配置變更後的驗證。
單擊已配置模型列表上方地區的全部檢測。
等待檢測結果:模型檢測需要一定時間,可在模型列表地區查看檢測進度。
下載報告:檢測完成後,單擊目標模型地區的下載報告,可查看檢測結果。
AI 模型和智能體全面檢測
服務開通
AI Red Teaming 控制台當前處於邀測階段,如需開通服務,請聯絡商務經理。
添加檢測對象
在左側導覽列選擇Agent 安全中心>AI Red Teaming.
在 AI Red Teaming 列表上方,單擊添加檢測對象。
在目標資訊頁面,配置以下參數。配置完成後,單擊下一步進入串連參數配置。
參數
說明
目標名稱
自訂名稱,用於標識和管理檢測對象。
描述
可選。輸入檢測對象的描述資訊。
目標類型
AI 模型:用於相容 OpenAI 或 Anthropic 介面的模型服務。
AI 智能體:適用於部署在阿里雲百鍊、Dify 等平台上的智能體應用。
說明選擇不同類型後,後續步驟的參數配置會相應變化。
接入方式
僅當目標類型為AI 模型時顯示。
OpenAI 相容:適用於相容 OpenAI Chat Completions API 格式的模型服務,如阿里雲百鍊、Azure OpenAI 及各種開源模型部署。
Anthropic 相容:適用於相容 Anthropic Messages API 格式的模型服務。
快捷接入
僅當目標類型為AI 智能體時顯示。支援的平台有:阿里雲百鍊、Dify、Agent Run、PAI、AgentKit 等。
在串連參數頁簽,根據目標類型,填寫串連參數。配置完成後,單擊下一步進入串連驗證。
AI 模型參數
參數
說明
流式輸出
是否啟用流式輸出。預設啟用。
API地址
AI 模型的 API 地址。
如阿里雲百鍊的 OpenAI 相容 API 地址為
https://dashscope.aliyuncs.com/compatible-mode/v1。API Key
用於認證的存取金鑰。
如阿里雲百鍊使用者可在百鍊控制台的 API Key 管理頁面建立 API Key。
模型名稱
待測試的模型名稱。阿里雲百鍊樣本:
qwen-plus、qwen-max。平台
從下拉式清單中選擇 AI 模型所屬平台,如阿里雲百鍊。
AI 智能體參數
基礎參數
參數
說明
流式輸出
是否啟用流式輸出。
重要PAI 預設開啟流式輸出,不支援關閉。
API地址
智能體的 API 地址。
PAI:格式為
http://{uid}.{region}.pai-eas.aliyuncs.com/api/predict/{serviceName}/v1/chat/completions,將 {uid}/{region}/{serviceName} 替換為實際的PAI-EAS服務配置。阿里雲百鍊:
https://dashscope.aliyuncs.com/api/v1/apps/{appId}/completion,其中{appId}為百鍊應用ID。Dify:格式為http://{host}/v1/chat-messages,將 {host} 替換為實際的Dify服務地址。
Agent Run:格式為
https://{workspaceId}.agentrun-data.{region}.aliyuncs.com/agent-runtimes/{agentName}/endpoints/Default/invocations/openai/v1/chat/completions,將 {workspaceId}/{region}/{agentName} 替換為實際的Agent Run配置。AgentKit:格式
https://{id}.apigateway-{region}.volceapi.com/invoke,將 {id} 和 {region} 替換為實際的 Agent Kit 網關配置。
API Key
用於認證的存取金鑰。
如阿里雲百鍊使用者可在百鍊控制台的 API Key 管理頁面建立 API Key。
模型名稱
僅 PAI 平台時顯示,填寫模型名稱。
進階設定(可選)
參數
說明
HTTP方法
要求方法:GET、POST 或 PUT。預設 POST。
認證方式
選擇認證方式:無、Bearer Token 或自訂 Header。
認證頭名稱
僅認證方式為自訂 Header 時顯示。填寫自訂認證頭名稱。
超時時間
請求逾時時間,單位毫秒。預設 30000。
請求模版
請求體模版,按平台預設。
JSONPath
響應解析路徑,按平台預設。
要求標頭
自訂要求標頭,JSON 格式。
在驗證串連頁簽,確認已配置的目標詳情後,單擊連通性測試,驗證配置的參數能否串連到 AI 服務。
重要僅在連通性測試通過後才能單擊保存,如測試失敗,檢查 API 地址、API Key 和模型名稱是否正確。
連通性測試並不真正執行檢測任務,僅進行網路連接、API Key、API地址校正。
測試中:按鈕顯示載入動畫。
測試通過:按鈕變為成功狀態,保存按鈕變為可用。
測試失敗:在串連測試失敗提示地區可查看失敗原因。若因網路等原因導致失敗,可單擊重試按鈕,重新測試。
配置檢測強度(可選)
單擊目標檢測對象操作列的
下的配置檢測任務。在配置檢測任務面板選擇檢測強度:
重要系統預設使用快速檢測。
檢測強度
說明
適用情境
快速檢測
使用常見基礎攻擊手法進行檢測,預計耗時 10~20 分鐘。
適用於日常快速驗證。
標準檢測
在基礎攻擊手法之上額外覆蓋進階攻擊手法,預計耗時 30~40 分鐘。
適用於上線前全面安全評估。
單擊确定儲存配置。
執行檢測
當檢測狀態為準備中、排隊中或檢測中時,檢測按鈕不可用,需等待上一次檢測完成。
預設檢測強度為快速檢測。
選擇檢測對象:
單個檢測:單擊目標檢測對象操作列的檢測。
批量檢測:勾選多個檢測對象後,單擊 AI Red Teaming 列表下方的檢測。
確認對話方塊中,單擊确定。
檢測任務建立成功後,列表自動重新整理,檢測狀態將更新。
查看檢測任務及報告
單擊目標檢測對象操作列的
下的查看檢測記錄或單擊檢測次數列的數字。在檢測記錄面板可查看檢測資訊,支援按檢測強度和掃描進度查詢。
名稱
說明
掃描任務編號
檢測任務的唯一編號。
檢測強度
快速檢測或標準檢測。
掃描發起時間
檢測任務的開始時間。
掃描完成時間
檢測任務的完成時間。
掃描任務進度
任務執行進度,運行中時顯示完成百分比。
風險等級
該次檢測發現的風險等級。
查看報告:檢測完成,單擊任務操作列的查看報告,可查看智能體或模型的安全評估報告。包含概覽、安全評分、攻擊分布、風險矩陣、攻擊手法分析、攻擊意圖分析、攻擊案例詳情、安全建議。
下載報告:檢測完成,單擊任務操作列的下載報告,可將安全報告下載到本地儲存。
停止或刪除檢測任務
單擊目標檢測對象操作列的
下的查看檢測記錄或單擊檢測次數列的數字。在檢測記錄面板,單擊目標任務操作列的停止或刪除。
操作
適用範圍
執行效果
停止
僅未完成的任務
終止掃描,保留檢測記錄。
刪除
所有狀態的任務
終止掃描,並刪除檢測記錄。
管理檢測對象
修改檢測對象
在 AI Red Teaming 列表頁,單擊目標檢測對象操作列的
下的設定物件。在設定物件面板中,支援修改流式輸出開關、API地址、API Key以及進階設定。參數說明,參見串連參數。
修改完成後,單擊連通性測試驗證新配置。
重要如測試失敗,檢查修改後的 API 地址、API Key 和模型名稱是否正確,確認無誤後重試。
測試通過後,單擊确定儲存修改。
刪除檢測對象
選擇檢測對象:
單個檢測:單擊目標檢測對象操作列的
下刪除。批量檢測:勾選多個檢測對象後,單擊 AI Red Teaming 列表下方的刪除。
確認對話方塊中,單擊确定。
刪除成功後,該檢測對象從列表中移除。
計費說明
公測期間免費使用。
常見問題
連通性測試失敗怎麼辦?
如果 AI 模型類型的檢測對象連通性測試失敗,排查以下原因:
網路不通:確認當前地區的Security Center能夠訪問 AI 模型的 API 地址。如果 AI 模型部署於私人網路,需要配置網路連通策略。
API Key 無效或到期:確認 API Key 有效且未到期,可以嘗試使用 curl 命令手動調用 API 確認。
模型名稱錯誤:確認模型名稱與 AI 模型服務提供者提供的名稱一致。
API 地址格式錯誤:確認 API 地址 URL 正確且可訪問。