全部產品
Search
文件中心

AI Guardrails:檢測項配置

更新時間:May 10, 2026

檢測項配置用於管理 AI 安全護欄的檢測服務和防護維度。本文介紹如何在控制台查看 Service 列表、啟用防護維度、配置檢測規則和詞庫。

操作步驟

  1. 登入AI 安全護欄產品控制台

  2. 在左側導覽列,選擇防护配置 > 检测项配置

    檢測項配置列表展示當前可用的 Service,包括:

    • AI输入内容安全检测(query_security_check_intl):檢測使用者輸入給大模型的常值內容。

    • AI生成内容安全检测(response_security_check_intl):檢測大模型產生的常值內容。

    • Agent日志内容检测(agent_log_guard_ec):檢測 Agent 作業記錄中的常值內容。

    • AIGC输入图片安全检测(img_query_guard_ec):檢測使用者輸入的圖片內容。

    • AIGC输出图片安全检测(img_response_guard_ec):檢測大模型產生的圖片內容。

  3. 在目標 Service 的操作列,單擊管理,進入 Service 管理頁面。

  4. 防护维度地區,查看當前 Service 支援的檢測能力。每個防護維度以卡片形式展示,通過卡片上的開關啟用或關閉對應功能。

    文本類 Service 支援以下防護維度:

    • 内容合规:檢測色情、暴力、政治等不良內容,預設啟用。

    • 敏感内容检测:檢測可能泄露的個人資訊或企業敏感性資料。

    • 提示词攻击检测:檢測旨在繞過大模型安全限制的惡意提示詞。

    • 恶意URL(公測中):掃描大模型內容中的惡意連結。

    • 模型幻觉(公測中):檢測大模型產生的虛假或不準確資訊。

    說明

    啟用敏感内容检测提示词攻击检测時,請關注彈框提示,該功能將單獨計費。更多資訊請參見開通與計費概述

  5. 詞庫設定:在檢測項配置列表中,對文本類 Service 設定詞庫進行加黑或加白操作。具體方案請參考詞庫管理

規則管理

在 Service 管理頁面,單擊防護維度卡片上的配置管理,可配置該維度下每個風險標籤的檢測開關和細分規則。

AI输入内容安全检测(query_security_check_intl)為例,在檢測項配置列表中單擊操作列的管理

  1. 在防護維度地區,單擊目標維度卡片(如內容合規)上的配置管理

  2. 選擇需要調整的檢測類型,單擊编辑進入編輯模式,修改對應檢測狀態。

  3. 單擊保存。新配置的檢測範圍約 2~5 分鐘生效並應用於生產環境。