檢測項配置用於管理 AI 安全護欄的檢測服務和防護維度。本文介紹如何在控制台查看 Service 列表、啟用防護維度、配置檢測規則和詞庫。
操作步驟
登入AI 安全護欄產品控制台。
在左側導覽列,選擇。
檢測項配置列表展示當前可用的 Service,包括:
AI输入内容安全检测(query_security_check_intl):檢測使用者輸入給大模型的常值內容。
AI生成内容安全检测(response_security_check_intl):檢測大模型產生的常值內容。
Agent日志内容检测(agent_log_guard_ec):檢測 Agent 作業記錄中的常值內容。
AIGC输入图片安全检测(img_query_guard_ec):檢測使用者輸入的圖片內容。
AIGC输出图片安全检测(img_response_guard_ec):檢測大模型產生的圖片內容。
在目標 Service 的操作列,單擊管理,進入 Service 管理頁面。
在防护维度地區,查看當前 Service 支援的檢測能力。每個防護維度以卡片形式展示,通過卡片上的開關啟用或關閉對應功能。
文本類 Service 支援以下防護維度:
内容合规:檢測色情、暴力、政治等不良內容,預設啟用。
敏感内容检测:檢測可能泄露的個人資訊或企業敏感性資料。
提示词攻击检测:檢測旨在繞過大模型安全限制的惡意提示詞。
恶意URL(公測中):掃描大模型內容中的惡意連結。
模型幻觉(公測中):檢測大模型產生的虛假或不準確資訊。
說明啟用敏感内容检测或提示词攻击检测時,請關注彈框提示,該功能將單獨計費。更多資訊請參見開通與計費概述。
詞庫設定:在檢測項配置列表中,對文本類 Service 設定詞庫進行加黑或加白操作。具體方案請參考詞庫管理。
規則管理
在 Service 管理頁面,單擊防護維度卡片上的配置管理,可配置該維度下每個風險標籤的檢測開關和細分規則。
以AI输入内容安全检测(query_security_check_intl)為例,在檢測項配置列表中單擊操作列的管理。
在防護維度地區,單擊目標維度卡片(如內容合規)上的配置管理。
選擇需要調整的檢測類型,單擊编辑進入編輯模式,修改對應檢測狀態。
單擊保存。新配置的檢測範圍約 2~5 分鐘生效並應用於生產環境。