AI 治理成熟度等級檢測面向 AI Agent 平台、Agent 運行時、AI 網關等 AI 工作負載,按安全、穩定、成本、效率、效能五大支柱設計獨立的檢測指標體系。本文介紹 AI 治理成熟度等級檢測當前支援的檢測項,方便您查詢和使用。
AI 治理成熟度等級檢測項持續接入中,當前共上線 37 個檢測項,覆蓋安全、穩定、成本、效能四大支柱。效率支柱的檢測項將在後續版本逐步開放。
檢測項總覽
支柱 | 檢測項數量 | 高風險項 | 中風險項 | 建議項 |
安全 | 13 | 5 | 4 | 4 |
穩定 | 21 | 6 | 14 | 1 |
成本 | 2 | 0 | 2 | 0 |
效能 | 1 | 0 | 0 | 1 |
效率 | 0 | 0 | 0 | 0 |
合計 | 37 | 11 | 20 | 6 |
安全
Agent 身份認證
檢測項 | 檢測項說明 | 手動修複說明 |
AgentIdentity 工作負載身份未配置使用者身份OIDC穿透 | Agent Identity 是阿里雲為 AI Agent 提供的身份與許可權管理服務,工作負載身份(Workload Identity)用於代表 Agent 這類工作負載向阿里雲服務發起調用。當 Agent 處理使用者請求時,需要將終端使用者的身份資訊(OIDC ID Token)穿透到 Agent,並由 Agent 攜帶使用者身份去訪問下遊資源,否則所有請求都會以 Agent 自身的服務帳號執行,無法區分終端使用者、無法做最小許可權控制和審計追溯。 | 在 Agent Identity 控制台為工作負載身份關聯身份供應商(IdP),將終端使用者身份(OIDC ID Token)穿透到 Agent 後再調用下遊資源。 操作路徑:Agent Identity 控制台 → 工作負載身份 → 關聯身份供應商,將工作負載身份與該身份供應商關聯。詳細步驟參考:阿里雲 Agent Identity 工作負載身份管理 【費用說明】Agent Identity 當前免費使用。 【影響範圍】啟用後 Agent 調用下遊資源時會以終端使用者身份執行許可權校正。需要確認下遊資源已為對應使用者/角色授予要求的權限,否則原本以 Agent 服務帳號能成功的調用可能失敗。 |
AI 網關未配置全域認證鑒權 | AI 網關提供全域認證鑒權(執行個體粒度)與消費者認證鑒權(API 粒度)兩層認證。兩者必須至少啟用其一,否則任何知道端點地址的調用方都可無鑒權訪問 Model API / Agent API / MCP Server。此條檢測項僅檢測網關執行個體是否配置全域認證鑒權,如果已經開啟API粒度的鑒權,請忽略。 | 二選一開啟認證:①開啟全域認證鑒權:AI 網關控制台 → 執行個體 → 安全管理 → 全域認證鑒權(JWT/OIDC/自建);或②為每個 API 開啟消費者鑒權:AI 網關控制台 → Model API / Agent API / MCP Server → 消費者鑒權。 【費用說明】認證鑒權能力包含在 AI 網關執行個體費用中,無額外費用。 【影響範圍】啟用後未攜帶合法憑證的請求將被拒絕。請提前為所有調用方分配並下發消費者憑證或 JWT/OIDC Token,避免業務中斷。 |
AgentRuntime 未配置訪問憑證(開啟了匿名訪問) | AgentRuntime 是 AgentRun 中部署 Agent 的運行執行個體。AgentRuntime 支援入站憑證用於控制外部使用者或系統如何訪問 Agent,未配置 CredentialName 即等同於開啟匿名訪問,任何掌握端點地址的調用方都可以無鑒權訪問 Agent,存在嚴重的越權調用、資源濫用與資料泄露風險。 | 為 AgentRuntime 配置入站訪問憑證(CredentialName),關閉匿名訪問。 操作路徑:Function Compute控制台 → AgentRun → Agent 運行時 → 配置 → 憑證 / 存取控制,綁定已建立的 Agent Identity 工作負載身份或 API Key 憑證。詳細步驟參考 【費用說明】Agent Identity本身免費 【影響範圍】啟用入站憑證後,原先未攜帶憑證的調用方將被拒絕訪問。請提前同步所有調用方更新調用憑證,避免業務中斷。 |
ModelService 直接使用 API Key 未啟用憑證管理 | AgentRun 模型代理層(ModelService)支援通過憑證管理(Credentials)集中託管模型 API Key,避免在配置或代碼中寫入程式碼密鑰。providerSettings.apiKey 直接填寫明文 API Key 視為不合規,應改為引用憑證管理中的憑證。 | 在 AgentRun 控制台先建立憑證(用於託管模型 API Key),再將 ModelService 的 API Key 配置項改為引用該憑證。 操作路徑:Function Compute控制台 → AgentRun → 憑證管理 → 建立憑證 → 錄入模型 API Key;然後編輯 ModelService,apiKey 欄位改為引用憑證而非明文。詳細步驟參考 【費用說明】AgentRun 憑證管理免費,KMS計費規則請見計費規則說明。 【影響範圍】切換為憑證引用後無業務影響。建議切換完成並驗證調用正常後,再到模型平台輪換原明文 API Key 以徹底降低泄露風險。 |
Agent 許可權管理
檢測項 | 檢測項說明 | 快速修複說明 |
AgentIdentity 策略集未配置 Cedar 策略限制工具調用 | Agent Identity 通過 Cedar 策略語言對 Agent 的 MCP 工具調用進行細粒度授權(「誰在什麼條件下可以對什麼資源做什麼操作」)。策略集是策略的邏輯集合,與 AI 網關綁定後可攔截並評估所有請求。未配置 Cedar 策略或策略為 permit all 時,Agent 工具調用無任何許可權約束。 | 在 Agent Identity 控制台為策略集編寫並啟用 Cedar 策略,並將策略集綁定到對應 AI 網關。 操作路徑:Agent Identity 控制台 → 策略集 → 建立策略集 → 編寫 Cedar 策略 → 綁定到 AI 網關執行個體。詳細步驟參考:Agent Identity 權限原則、策略集管理、細粒度控制 Agent 許可權 【費用說明】Agent Identity 當前免費使用。 【影響範圍】啟用後 Agent 工具調用會被策略評估,未授權的工具調用將被拒絕。請先使用觀察模式,確認策略集符合業務鑒權預期再設定為攔截模式使其生效,避免影響線上 Agent 業務。 |
PAI 工作空間管理員角色超額(違背最小許可權) | PAI 工作空間通過角色(資源管理員、工作空間管理員、演算法開發、營運等)對成員授權。當 PAI.WorkspaceAdmin 管理員角色成員數大於 3 個且佔比大於 30% 時,違背最小許可權原則,存在許可權濫用與誤操作風險。 | 回收冗餘的工作空間管理員角色,將日常使用者改為演算法開發 / 營運等業務角色。 操作路徑:PAI 控制台 → 工作空間 → 成員及角色配置 → 編輯成員角色 → 移除多餘的 WorkspaceAdmin 授權。詳細步驟參考:建立及管理工作空間 【費用說明】無額外費用。 【影響範圍】被回收管理員角色的成員將無法增刪工作空間成員、修改工作空間配置等管理操作,但不影響其常規演算法開發工作。請提前與相關成員溝通。 |
安全事件檢測
檢測項 | 檢測項說明 | 快速修複說明 |
PAI EAS 推理服務未開啟 SLS 訪問日誌投遞 | PAI EAS 服務支援將推理訪問日誌投遞到Log Service SLS,logstore 為 pai-eas-service-log,project 為 aliyun-product-data-{uid}-{regionId}。未開啟日誌投遞時,無法對推理請求做安全審計、攻擊溯源與流量分析。 | 在 PAI 控制台為公用資源群組或專屬資源群組開啟日誌採集。 操作路徑:PAI 控制台 → EAS → 資源群組管理 → 編輯 → 開啟日誌採集 → SLS 自動建立 project 與 logstore。詳細步驟參考:為資源群組配置日誌採集。 【費用說明】SLS計費規則說明 【影響範圍】無業務影響,僅會增加Log Service成本。建議為日誌開啟 TTL 自動清理控制儲存費用。 |
AI 網關未啟用 AI 請求日誌策略 | AI 網關日誌投遞分兩層:網關執行個體層日誌投遞(基礎)、API 層 AI 請求日誌策略(AiStatistics/AccessLog)。後者用於完整記錄模型調用審計鏈。未啟用時無法追溯異常調用、Prompt 與響應。 | ①先在執行個體層開啟日誌投遞到 SLS;②再為每個 API 啟用 AiStatistics 策略。 操作路徑:①AI 網關控制台 → 執行個體 → 觀測分析 → 日誌中心 → 選擇 立即開啟日誌投遞功能;②Model API / Agent API / MCP Server → 策略與外掛程式 → AI 請求日誌 → 啟用。詳細步驟參考 【費用說明】SLS計費規則說明 【影響範圍】無業務影響。日誌包含 Prompt 與響應本文,存在敏感資訊留存風險,請配置存取控制並設定合適的 TTL。 |
網路安全防護
檢測項 | 檢測項說明 | 快速修複說明 |
AI 網關未配置網路防護(IP 黑白名單 / WAF) | AI 網關支援在網關層統一配置 IP 黑白名單與 WAF 防護。未啟用 IP ACL 與 WAF,惡意 IP 與 OWASP Top 10 類攻擊(注入、爬蟲、CC 攻擊等)將直接觸達後端模型與 Agent 服務。 | ①AI 網關控制台 → 執行個體 → 安全管理 → 黑/白名單,配置可信 IP 段;②同執行個體下開啟 WAF 整合或為網域名稱接入 WAF 3.0。詳細步驟參考:設定網關IP黑白名單 與 開啟WAF防護 【費用說明】IP 黑白名單包含在 AI 網關費用中。WAF 3.0 計費規則說明。 【影響範圍】誤配置 IP 白名單可能導致合法調用方被攔截。建議先在觀察模式或僅設黑名單方式上線,確認無誤後再切換為嚴格白名單。 |
AgentRuntime 配置了公網訪問(未啟用 VPC 私人網路隔離) | AgentRuntime 通過 VPC 網路與 vSwitch 實現網路隔離。disablePublicNetworkAccess 為 false 時,AgentRuntime 暴露在公網,存在被未授權掃描與攻擊的風險。建議生產環境通過 VPC 私網訪問,結合 PrivateLink 或 VPN 由可信網路訪問。 | 在 AgentRun 控制台關閉公網訪問,僅通過 VPC 內網訪問 AgentRuntime。 操作路徑:Function Compute控制台 → AgentRun → 選擇 AgentRuntime → 網路設定 → 關閉「公網訪問」開關,並配置 VPC 與 vSwitch。 【費用說明】僅 VPC 內網訪問無額外費用。如需通過公網受控訪問,可改用 AI 網關 + WAF 方案,會產生網關與 WAF 執行個體費。 【影響範圍】關閉公網後所有公網調用方無法繼續訪問,請確保所有調用方都已部署在同一 VPC 或可通過內網/PrivateLink 抵達。 |
Agent 應用防護
檢測項 | 檢測項說明 | 快速修複說明 |
AI 網關未啟用Alibaba Content Security Service檢查策略(AiSecurityGuard) | AI 網關 AiSecurityGuard 策略整合阿里雲 AI 安全護欄,可在網關入口對 Prompt 與模型響應統一做敏感詞、合規審核。未啟用時,Alibaba Content Security Service分散到各後端服務,難以統一管控且存在審核遺漏。 | 在 AI 網關控制台為 HttpApi 開啟 AiSecurityGuard 策略並選擇Alibaba Content Security Service配置。 操作路徑:AI 網關控制台 → 執行個體 → Model API / Agent API / MCP Server → 策略與外掛程式 → AI 安全防護 → 啟用 AI 安全防護 → 選擇 AI 安全護欄 / Alibaba Content Security Service。 【費用說明】Alibaba Content Security Service收費說明 與 AI 安全護欄收費說明 【影響範圍】開啟後命中風險詞或違規內容的請求或響應會被攔截。請評估詞典與策略閾值,避免誤攔正常業務請求。 |
AgentRun 模型代理層未統一配置Alibaba Content Security Service策略 | AgentRun 模型代理層(ModelProxy)支援統一配置 aiGuardrailConfig,對所有路由到該代理的模型調用做請求/響應Alibaba Content Security Service檢查。未配置時,各 AgentRuntime 各自管理安全性原則,標準不一致且管理成本高。 | 在 AgentRun 控制台為模型代理層啟用 aiGuardrailConfig。 操作路徑:Function Compute控制台 → AgentRun → 模型代理 → 編輯 → 進階策略 → 啟用 AI 安全護欄。 【費用說明】基於阿里雲安全護欄實現,為AI應用提供全方位安全防護,詳見開通與計費概述。 【影響範圍】開啟後命中違規內容的請求或響應將被攔截。請先在測試環境校正詞典與閾值,避免對線上 Agent 業務造成誤攔。 |
傳輸資料保護
檢測項 | 檢測項說明 | 快速修複說明 |
AgentRun 自訂網域名未開啟 HTTPS | AgentRuntime 預設提供 HTTPS 端點,但使用者綁定的自訂網域名(CustomDomain)需要自行管理憑證。CustomDomain protocol 不為 HTTPS 時,外部存取 Agent 時資料明文傳輸,存在請求/響應被監聽與篡改的風險。 | 在 AgentRun 控制台為自訂網域名上傳 SSL 憑證並將通訊協定設定為 HTTPS。 操作路徑:Function Compute控制台 → AgentRun → 自訂網域名 → 編輯 → 協議選擇 HTTPS → 上傳認證或引用 CAS 認證。 【費用說明】HTTPS 本身免費,認證需通過數位憑證管理服務購買或申請免費認證。 【影響範圍】切換 HTTPS 後調用方需更新訪問協議為 https://。請提前通知所有 Agent 調用方。 |
穩定
基礎設施容災
檢測項 | 檢測項說明 | 快速修複說明 |
PAI EAS 服務部署在公用資源群組 | PAI EAS 提供公用資源、EAS 資源群組、資源配額三類資源類型。公用資源採用隨用隨付、與其他使用者共用算力,存在資源爭搶、SLA 較弱的問題,不適合生產容災架構。建議生產服務部署在專屬 EAS 資源群組。 | 購買專屬 EAS 資源群組並將服務遷移過去。 操作路徑:①PAI 控制台 → EAS → 資源群組管理 → 建立專屬資源群組(訂用帳戶或按量);②編輯服務 → 部署資源 → 選擇剛建立的專屬資源群組 → 重新部署。詳細步驟參考:EAS 部署資源概述 【費用說明】EAS計費規則說明 【影響範圍】遷移過程涉及服務重新部署,存在短暫中斷。建議先在新資源群組建立新版本服務並通過流量分配灰階切換。 |
PAI EAS 服務使用共用網關(未配置專屬網關) | PAI EAS 預設使用共用推理網關,多租戶共用入口存在頻寬爭搶與流量隔離問題。生產服務建議使用專屬網關(ServiceConfig.networking.gateway 不為空白),享受獨立頻寬與穩定 SLA。 | 在 PAI 控制台為 EAS 服務綁定專屬網關。 操作路徑:PAI 控制台 → EAS → 推理網關 → 建立專屬網關;編輯服務 → 部署配置 → 網路 → 選擇專屬網關。 【費用說明】專屬網關按規格與時間長度計費,會額外產生網關執行個體費 【影響範圍】綁定專屬網關後服務訪問端點會變化,請同步更新調用方使用的端點地址。 |
AgentRuntime 未跨多可用性區域部署 | AgentRuntime networkConfiguration.vswitchIds 關聯的 vSwitch 都在同一可用性區域時,單 AZ 故障會導致 Agent 服務整體不可用。建議關聯多個不同可用性區域的 vSwitch 實現跨 AZ 容災。 | 在 AgentRun 控制台編輯 AgentRuntime 網路設定,關聯至少 2 個不同可用性區域的 vSwitch。 操作路徑:Function Compute控制台 → AgentRun → AgentRuntime → 網路設定 → vSwitch → 添加來自不同可用性區域的 vSwitch。 【費用說明】不同可用性區域 vSwitch 不收取額外網路費用,但跨 AZ 流量按 VPC 跨可用性區域流量計費。 【影響範圍】配置變更可能涉及執行個體重新調度,建議在低峰期操作並先在測試環境驗證。 |
模型推理容災
檢測項 | 檢測項說明 | 快速修複說明 |
PAI EAS 推理服務僅配置單副本 | EAS 服務 TotalInstance 欄位表示總副本數。僅 1 個副本時單點故障會導致服務中斷,違背容災原則。生產服務建議至少 2 個副本並打散到多個可用性區域。 | 在 PAI 控制台編輯服務,將執行個體數(TotalInstance / replicas)設為 ≥ 2。 操作路徑:PAI 控制台 → EAS → 服務 → 更新 → 副本數 → 點擊 擴縮容,調整為 2 及以上。 【費用說明】副本數翻倍會成比例增加 EAS 費用 【影響範圍】擴容是變換,無業務中斷。請確保資源群組配額足夠。 |
Agent應用容量規劃
檢測項 | 檢測項說明 | 快速修複說明 |
PAI EAS 服務未啟用Auto Scaling | PAI EAS 服務 ServiceConfig.autoscaler 用於配置自動擴縮容(基於 QPS、GPU 利用率等指標)。未啟用時無法自動應對負載波動。 | 在 PAI 控制台為 EAS 服務開啟 autoscaler 並設定最小/最大執行個體數與擴縮容指標閾值。 操作路徑:PAI 控制台 → EAS → 服務 → 更新 → 自動調整 → Auto Scaling → 啟用 → 配置指標與閾值。詳細步驟參考:彈性資源集區配置 【費用說明】彈性擴容產生的執行個體按 EAS 標準計費 【影響範圍】擴縮容可能產生抖動,請合理設定冷卻時間避免頻繁伸縮。 |
AgentRuntime 未配置Auto Scaling策略 | AgentRuntime 通過 scalingConfig.minInstances 配置最小執行個體數。時延敏感業務不建議縮容到零(最小執行個體數 ≥ 1),可為您帶來以下保障: | 在 AgentRun 控制台為 AgentRuntime 配置Auto Scaling策略(最小 / 最大執行個體數、擴縮容指標)。 操作路徑:Function Compute控制台 → AgentRun → AgentRuntime → 彈性與執行個體 → 彈性配置 → 建立彈性策略 → 設定最小執行個體數 ≥ 1。詳細步驟參考 【費用說明】擴容產生的執行個體按 AgentRun 標準計費,計費規則說明 【影響範圍】minInstances 設定過高會增加常駐費用;過低則冷啟動延遲更明顯。請按業務流量分布合理評估。 |
Agent發行管理
檢測項 | 檢測項說明 | 快速修複說明 |
PAI EAS 服務未使用灰階發布 | PAI EAS 通過服務群組(DescribeGroup)按權重做流量分配,實現新老版本灰階發布。直接全量更新不存在群組時,更新即對全部流量生效,故障範圍大。 | 通過服務群組將多個版本的服務劃入同一群組並配置流量權重。 操作路徑:PAI 控制台 → EAS → 服務群組 → 建立群組 → 將新老版本服務加入群組 → 設定權重(如先 5%/95%)→ 灰階驗證後逐步切換。詳細步驟參考 【費用說明】灰階發布服務本身不收費,如需購買專屬資源群組會增加相關的費用。 【影響範圍】灰階期間會同時有多個版本運行,需保證版本相容性。 |
智能監控警示
檢測項 | 檢測項說明 | 快速修複說明 |
PAI EAS 服務未關聯 CMS 警示規則 | CloudMonitor(CMS)通過 DescribeMetricRuleList 查詢 PAI EAS 服務的警示規則。未關聯任何警示規則時,服務異常(如不可用、5xx 上升、延遲激增)無法自動通知營運。 | 在CloudMonitor控制台為 PAI EAS 建立警示規則(如 5xx 佔比、平均延遲、執行個體不健康數等)。 操作路徑:CloudMonitor控制台 → 警示服務 → 警示規則 → 建立警示規則 → 選擇 PAI-EAS 命名空間 → 配置指標與閾值 → 關聯通知群組。詳細步驟參考 【費用說明】基礎警示免費,簡訊/電話通知計費,計費規則說明 【影響範圍】無業務影響。請合理設定靜默與通知頻次避免警示風暴。 |
PAI EAS 服務未啟用 ARMS 鏈路追蹤 | PAI EAS 服務 ServiceConfig.monitoring.enable_tracing=true 啟用後會接入 ARMS 鏈路追蹤。未啟用時推理請求的內部執行(前後處理、模型調用、外部依賴)不可觀測。 | 在 PAI 控制台為 EAS 服務開啟鏈路追蹤。 操作路徑:PAI 控制台 → EAS → 服務 → 更新 → 監控 → 啟用鏈路追蹤 → 選擇/建立 ARMS 應用。詳細步驟參考 EAS 鏈路追蹤方案 【費用說明】ARMS計費規則說明 【影響範圍】啟用 ARMS 探針會帶來輕微效能開銷(通常 <5%)。 |
AI 網關未配置 CMS 警示規則 | CloudMonitor通過 DescribeMetricRuleList 在 acs_cnapigateway 命名空間下查詢 AI 網關警示規則。未配置時網關 5xx、延遲、串連數等關鍵計量異常無法自動通知。 | 在CloudMonitor控制台為 AI 網關建立警示規則。 操作路徑:CloudMonitor控制台 → 警示服務 → 警示規則 → 建立警示規則 → 配置指標(如 5xx 佔比、Token 速率、Latency)與閾值 → 關聯警示連絡人群組。 【費用說明】基礎警示免費,簡訊/電話通知計費,計費規則說明 【影響範圍】無業務影響。請合理設定閾值與靜默期。 |
AgentRuntime 未啟用 ARMS 全鏈路監控 | AgentRuntime armsConfiguration.enableArms 啟用後,請求會接入 ARMS 應用監控,提供調用鏈、SQL 分析、記憶體/線程剖析等。未啟用時請求全鏈路不可觀測,故障定位困難。 | 在 AgentRun 控制台為 AgentRuntime 啟用 ARMS 監控。 操作路徑:Function Compute控制台 → AgentRun → AgentRuntime → 可觀測 → 應用監控 → 一鍵開通。詳細步驟參考 【費用說明】開通應用監控資源可能會產生費用,詳情請參見應用監控計費方式 【影響範圍】啟用 ARMS 探針會帶來輕微效能開銷(通常 <5%)。 |
AgentRuntime 未配置健全狀態檢查 | AgentRuntime healthCheckConfiguration.httpGetUrl 用於配置 HTTP GET 健全狀態檢查。未配置時服務異常無法被自動檢測與替換執行個體。健全狀態檢查僅在 artifactType=Code 模式下可配置,容器模式可能不支援。 | 在 AgentRun 控制台為 AgentRuntime 配置健全狀態檢查 URL(如 /health)。 操作路徑:Function Compute控制台 → AgentRun → AgentRuntime → 進階配置 → 健全狀態檢查 → 設定 httpGetUrl 與逾時間隔。 【費用說明】無額外費用。 【影響範圍】健全狀態檢查實現錯誤(如返回非 2xx)會導致執行個體被反覆重啟。請先在測試環境驗證健全狀態檢查端點。 |
AgentRuntime 未配置日誌監控 | AgentRuntime logConfiguration.logstore 用於配置應用日誌投遞到 SLS。未配置時無法收集 Agent 作業記錄,故障排查與審計困難。 | 在 AgentRun 控制台為 AgentRuntime 配置日誌投遞。 操作路徑:Function Compute控制台 → AgentRun → AgentRuntime → 可觀測 → 日誌 → 一鍵開啟/手動設定。 【費用說明】SLS計費規則說明 【影響範圍】無業務影響。建議為日誌設定合理 TTL 與壓縮儲存控製成本。 |
Agent應用容錯
檢測項 | 檢測項說明 | 快速修複說明 |
AI 網關 Agent API / Model API 入站方向未配置防護外掛程式 | AI 網關 Agent API 與 Model API 入站方向(direction=InBound)應配置流控、逾時、熔斷、安全防護等外掛程式。未安裝相關外掛程式時,惡意流量與異常請求會直接打到後端 Agent / 模型服務。 | 在 AI 網關控制台為 Agent API 與 Model API 啟用入站方向的限流、熔斷、Alibaba Content Security Service等外掛程式組合。 操作路徑:AI 網關控制台 → Agent API / Model API → 策略與外掛程式 → 入站處理 → 啟用策略/外掛程式(限流 / 熔斷 / 安全 / 日誌等)。 【費用說明】策略包含在 AI 網關執行個體費用中,部分進階安全防護可能依賴Alibaba Content Security Service/WAF 等附加產品,按對應產品計費。 【影響範圍】策略生效後不符合規則的請求會被拒絕。請評估業務流量特徵再設閾值。 |
模型推理容錯
檢測項 | 檢測項說明 | 快速修複說明 |
AgentRun 模型代理層未配置逾時設定 | AgentRun 模型代理層(ModelProxy)通過 proxyConfig.policies.requestTimeout 配置請求逾時。未配置逾時時,模型無響應將阻塞整個請求鏈,長尾請求拖垮 AgentRuntime 資源。 | 在 AgentRun 控制台為模型代理層配置 請求逾時時間(建議 30~60s)。 操作路徑:Function Compute控制台 → AgentRun → 模型代理 → 編輯 → 進階策略 → 請求逾時時間。 【費用說明】無額外費用。 【影響範圍】逾時閾值過小會導致大模型產生長答時被截斷,請根據業務最大可接受回應時間合理設定。 |
AgentRun 模型代理層未配置 Fallback 降級策略 | AgentRun 模型代理層支援配置多級 Fallback(fallbacks 數組),主模型限流/逾時/故障時自動切換到備用模型,避免 AgentRuntime 完全不可用。 | 在 AgentRun 控制台為模型代理層配置 fallbacks 列表,按優先順序順序加入備用模型。 操作路徑:Function Compute控制台 → AgentRun → 模型代理 → 編輯 → 進階策略 → 添加 Fallback 模型。 【費用說明】Fallback 觸發時調用備用模型按對應模型 Token 計費。 【影響範圍】Fallback 觸發時輸出風格可能與主模型差異較大,建議為關鍵業務路徑配置相容的備用模型。 |
AI 網關 Model API 未配置多模型負載平衡 | AI 網關 Model API 的 serviceConfigs 支援配置多個後端模型服務並按權重做負載平衡。僅配置單一模型服務時,流量全部路由到同一後端,存在單點過載與雪崩風險。 | 在 AI 網關控制台為 Model API 配置多個後端模型服務並設定權重,實現負載平衡。 操作路徑:AI 網關控制台 → Model API → 後端服務 → 添加多個模型服務並配置權重。詳細步驟參考 【費用說明】負載平衡策略包含在 AI 網關執行個體費中,無額外費用。後端模型按各自的 Token / 調用次數計費。 【影響範圍】權重配置不當可能導致流量傾斜,建議先按等權重灰階驗證再調整業務實際比例。 |
AI 網關未啟用 AI Fallback 多模型降級 | AI Fallback 是 AI 網關的多模型降級能力,主模型服務不可用時自動切換到備用模型,提高 AI 應用整體可用性。policyConfigs 中未啟用 aiFallbackConfig 時,主模型異常將直接返回錯誤。 | 在 AI 網關控制台為 Model API 啟用 AI Fallback 策略,按優先順序配置主備模型。 操作路徑:AI 網關控制台 → Model API → 策略與外掛程式 → AI Fallback → 啟用 → 添加備用模型服務。詳細步驟參考 【費用說明】策略本身無額外費用;Fallback 觸發時調用備用模型按其 Token 計費。 【影響範圍】Fallback 觸發時輸出風格與主模型可能存在差異,請為關鍵業務路徑配置相容備用模型並充分測試。 |
AI 網關 Model API 未配置響應緩衝策略 | AI 網關 AI Cache 通過 Redis 精確緩衝或 DashVector 語義快取命中重複 Prompt,由網關直接返回緩衝內容,可顯著降低後端模型調用量、提升響應速度,並在模型異常時提供降級。 | 在 AI 網關控制台為 Model API 啟用 AI Cache 策略,可選 Redis 精確緩衝或 DashVector 語義緩衝。 操作路徑:AI 網關控制台 → Model API → 策略與外掛程式 → AI Cache → 啟用 → 選擇緩衝類型並配置 Redis / DashVector 執行個體。詳細步驟參考 【費用說明】策略本身無額外費用;Redis / DashVector 執行個體按所選規格計費。命中緩衝可顯著降低後端模型 Token 消耗。 【影響範圍】語義緩衝在相似性閾值設定過低時可能命中錯誤回答,建議先以高閾值上線再根據效果調整。 |
AI 網關未配置多維度限流和熔斷策略 | AI 網關 AI Token 限流策略支援基於 Token 消耗量、請求數、並發數的多維流量管控。未配置流量管控外掛程式時,突發流量可能直接打垮後端模型服務,造成雪崩。 | 在 AI 網關控制台為 Model API 啟用 AI Token 限流與熔斷策略,配置 Token、QPS、並發等多維閾值。 操作路徑:AI 網關控制台 → Model API → 策略與外掛程式 → AI Token 限流 / 熔斷 → 啟用 → 設定 tpm/tps/並發等維度閾值。詳細步驟參考 【費用說明】策略包含在 AI 網關執行個體費中,無額外費用。 【影響範圍】超過閾值的請求會被拒絕,請按業務峰值合理設定並通知調用方處理重試。 |
推理容量規劃
檢測項 | 檢測項說明 | 快速修複說明 |
AgentRun 模型代理層未配置並發控制和 Token 限流 | AgentRun 模型代理層 proxyConfig.policies 中 concurrencyLimit 與 tokenRateLimiter(tpm/tps/tph/tpd)用於約束並發與 Token 速率。兩者均未配置時,突發流量會直接傳到下遊模型,觸發模型限流甚至產生不可控費用。 | 在 AgentRun 控制台為模型代理層配置 並發控制 或 Token 限流。 操作路徑:Function Compute控制台 → AgentRun → 模型代理 → 編輯 → 進階策略 → 並發控制 / Token 限流。 【費用說明】無額外費用。 【影響範圍】超過閾值的請求會被拒絕。請按業務峰值合理設定閾值並通知調用方處理重試。 |
成本
Agent應用成本最佳化
檢測項 | 檢測項說明 | 快速修複說明 |
PAI EAS 服務 GPU 利用率長期低於 10%(資源浪費) | 通過CloudMonitor DescribeMetricData 查詢 PAI EAS 服務的 GPU 利用率。若長期低於 10%,說明執行個體數過多或規格過大,存在 GPU 資源浪費。 | 縮減副本數、降配執行個體規格,或啟用Auto Scaling按需擴縮容。 操作路徑:PAI 控制台 → EAS → 服務 → 更新 → 減少副本數或換用更小規格 → 同時啟用 autoscaler 設定較低 minInstances。詳細步驟參考 【費用說明】縮減副本數、降配執行個體規格、縮容會減少 EAS 費用 【影響範圍】縮容可能影響業務峰值承載能力。請結合峰值流量評估並配合Auto Scaling兜底。 |
推理成本最佳化
檢測項 | 檢測項說明 | 快速修複說明 |
AI 網關未啟用工具精選外掛程式 | AI 網關工具精選外掛程式(AiToolSelection)會根據 Prompt 智能篩選相關工具描述傳遞給模型,避免將所有註冊工具的完整描述都打包注入,從而降低每次推理的 Token 消耗。 | 在 AI 網關控制台為 Model API 啟用工具精選策略。 操作路徑:AI 網關控制台 → Model API → 策略與外掛程式 → 工具精選 → 啟用 → 配置篩選規則。 【費用說明】工具精選策略包含在 AI 網關執行個體費中,本身無額外費用。 【影響範圍】篩選規則不當可能導致模型無法選到正確工具。請充分測試常見情境再灰階上線。 |
效能
Agent架構最佳化
檢測項 | 檢測項說明 | 快速修複說明 |
PAI EAS 服務 GPU 利用率過高 | 通過CloudMonitor DescribeMetricData 查詢 PAI EAS 服務的 GPU 利用率。若長期高於閾值(如 90%),說明執行個體數不足,存在響應延遲激增、請求排隊甚至服務不可用風險。 | 擴容副本數、升配執行個體規格,或啟用Auto Scaling自動應對峰值。 操作路徑:PAI 控制台 → EAS → 服務 → 更新 → 增加副本數或換用更大規格 → 同時啟用 autoscaler 設定合適 maxInstances。詳細步驟參考 【費用說明】擴容副本數、升配執行個體規格、擴容會增加 EAS 費用 【影響範圍】擴容是變換,無業務中斷,但需要確保資源群組配額充足。 |