AI 治理成熟度检测面向 AI Agent 平台、Agent 运行时、AI 网关等 AI 工作负载,按安全、稳定、成本、效率、性能五大支柱设计独立的检测指标体系。本文介绍 AI 治理成熟度检测当前支持的检测项,方便您查询和使用。
AI 治理成熟度检测项持续接入中,当前共上线 37 个检测项,覆盖安全、稳定、成本、性能四大支柱。效率支柱的检测项将在后续版本逐步开放。
检测项总览
支柱 | 检测项数量 | 高风险项 | 中风险项 | 建议项 |
安全 | 13 | 5 | 4 | 4 |
稳定 | 21 | 6 | 14 | 1 |
成本 | 2 | 0 | 2 | 0 |
性能 | 1 | 0 | 0 | 1 |
效率 | 0 | 0 | 0 | 0 |
合计 | 37 | 11 | 20 | 6 |
安全
Agent 身份认证
检测项 | 检测项说明 | 手动修复说明 |
AgentIdentity 工作负载身份未配置用户身份OIDC穿透 | Agent Identity 是阿里云为 AI Agent 提供的身份与权限管理服务,工作负载身份(Workload Identity)用于代表 Agent 这类工作负载向阿里云服务发起调用。当 Agent 处理用户请求时,需要将最终用户的身份信息(OIDC ID Token)穿透到 Agent,并由 Agent 携带用户身份去访问下游资源,否则所有请求都会以 Agent 自身的服务账号执行,无法区分最终用户、无法做最小权限控制和审计追溯。 | 在 Agent Identity 控制台为工作负载身份关联身份提供商(IdP),将最终用户身份(OIDC ID Token)穿透到 Agent 后再调用下游资源。 操作路径:Agent Identity 控制台 → 工作负载身份 → 关联身份提供商,将工作负载身份与该身份提供商关联。详细步骤参考:阿里云 Agent Identity 工作负载身份管理 【费用说明】Agent Identity 当前免费使用。 【影响范围】启用后 Agent 调用下游资源时会以最终用户身份执行权限校验。需要确认下游资源已为对应用户/角色授予所需权限,否则原本以 Agent 服务账号能成功的调用可能失败。 |
AI 网关未配置全局认证鉴权 | AI 网关提供全局认证鉴权(实例粒度)与消费者认证鉴权(API 粒度)两层认证。两者必须至少启用其一,否则任何知道端点地址的调用方都可无鉴权访问 Model API / Agent API / MCP Server。此条检测项仅检测网关实例是否配置全局认证鉴权,如果已经开启API粒度的鉴权,请忽略。 | 二选一开启认证:①开启全局认证鉴权:AI 网关控制台 → 实例 → 安全管理 → 全局认证鉴权(JWT/OIDC/自建);或②为每个 API 开启消费者鉴权:AI 网关控制台 → Model API / Agent API / MCP Server → 消费者鉴权。 【费用说明】认证鉴权能力包含在 AI 网关实例费用中,无额外费用。 【影响范围】启用后未携带合法凭证的请求将被拒绝。请提前为所有调用方分配并下发消费者凭证或 JWT/OIDC Token,避免业务中断。 |
AgentRuntime 未配置访问凭证(开启了匿名访问) | AgentRuntime 是 AgentRun 中部署 Agent 的运行实例。AgentRuntime 支持入站凭证用于控制外部用户或系统如何访问 Agent,未配置 CredentialName 即等同于开启匿名访问,任何掌握端点地址的调用方都可以无鉴权访问 Agent,存在严重的越权调用、资源滥用与数据泄露风险。 | 为 AgentRuntime 配置入站访问凭证(CredentialName),关闭匿名访问。 操作路径:函数计算控制台 → AgentRun → Agent 运行时 → 配置 → 凭证 / 访问控制,绑定已创建的 Agent Identity 工作负载身份或 API Key 凭证。详细步骤参考 【费用说明】Agent Identity本身免费 【影响范围】启用入站凭证后,原先未携带凭证的调用方将被拒绝访问。请提前同步所有调用方更新调用凭证,避免业务中断。 |
ModelService 直接使用 API Key 未启用凭证管理 | AgentRun 模型代理层(ModelService)支持通过凭证管理(Credentials)集中托管模型 API Key,避免在配置或代码中硬编码密钥。providerSettings.apiKey 直接填写明文 API Key 视为不合规,应改为引用凭证管理中的凭证。 | 在 AgentRun 控制台先创建凭证(用于托管模型 API Key),再将 ModelService 的 API Key 配置项改为引用该凭证。 操作路径:函数计算控制台 → AgentRun → 凭证管理 → 创建凭证 → 录入模型 API Key;然后编辑 ModelService,apiKey 字段改为引用凭证而非明文。详细步骤参考 【费用说明】AgentRun 凭证管理免费,KMS计费规则请见计费规则说明。 【影响范围】切换为凭证引用后无业务影响。建议切换完成并验证调用正常后,再到模型平台轮换原明文 API Key 以彻底降低泄露风险。 |
Agent 权限管理
检测项 | 检测项说明 | 快速修复说明 |
AgentIdentity 策略集未配置 Cedar 策略限制工具调用 | Agent Identity 通过 Cedar 策略语言对 Agent 的 MCP 工具调用进行细粒度授权(「谁在什么条件下可以对什么资源做什么操作」)。策略集是策略的逻辑集合,与 AI 网关绑定后可拦截并评估所有请求。未配置 Cedar 策略或策略为 permit all 时,Agent 工具调用无任何权限约束。 | 在 Agent Identity 控制台为策略集编写并启用 Cedar 策略,并将策略集绑定到对应 AI 网关。 操作路径:Agent Identity 控制台 → 策略集 → 创建策略集 → 编写 Cedar 策略 → 绑定到 AI 网关实例。详细步骤参考:Agent Identity 权限策略、策略集管理、细粒度控制 Agent 权限 【费用说明】Agent Identity 当前免费使用。 【影响范围】启用后 Agent 工具调用会被策略评估,未授权的工具调用将被拒绝。请先使用观察模式,确认策略集符合业务鉴权预期再设置为拦截模式使其生效,避免影响线上 Agent 业务。 |
PAI 工作空间管理员角色超额(违背最小权限) | PAI 工作空间通过角色(资源管理员、工作空间管理员、算法开发、运维等)对成员授权。当 PAI.WorkspaceAdmin 管理员角色成员数大于 3 个且占比大于 30% 时,违背最小权限原则,存在权限滥用与误操作风险。 | 回收冗余的工作空间管理员角色,将日常使用者改为算法开发 / 运维等业务角色。 操作路径:PAI 控制台 → 工作空间 → 成员及角色配置 → 编辑成员角色 → 移除多余的 WorkspaceAdmin 授权。详细步骤参考:创建及管理工作空间 【费用说明】无额外费用。 【影响范围】被回收管理员角色的成员将无法增删工作空间成员、修改工作空间配置等管理操作,但不影响其常规算法开发工作。请提前与相关成员沟通。 |
安全事件检测
检测项 | 检测项说明 | 快速修复说明 |
PAI EAS 推理服务未开启 SLS 访问日志投递 | PAI EAS 服务支持将推理访问日志投递到日志服务 SLS,logstore 为 pai-eas-service-log,project 为 aliyun-product-data-{uid}-{regionId}。未开启日志投递时,无法对推理请求做安全审计、攻击溯源与流量分析。 | 在 PAI 控制台为公共资源组或专属资源组开启日志采集。 操作路径:PAI 控制台 → EAS → 资源组管理 → 编辑 → 开启日志采集 → SLS 自动创建 project 与 logstore。详细步骤参考:为资源组配置日志采集。 【费用说明】SLS计费规则说明 【影响范围】无业务影响,仅会增加日志服务成本。建议为日志开启 TTL 自动清理控制存储费用。 |
AI 网关未启用 AI 请求日志策略 | AI 网关日志投递分两层:网关实例层日志投递(基础)、API 层 AI 请求日志策略(AiStatistics/AccessLog)。后者用于完整记录模型调用审计链。未启用时无法追溯异常调用、Prompt 与响应。 | ①先在实例层开启日志投递到 SLS;②再为每个 API 启用 AiStatistics 策略。 操作路径:①AI 网关控制台 → 实例 → 观测分析 → 日志中心 → 选择 立即开启日志投递功能;②Model API / Agent API / MCP Server → 策略与插件 → AI 请求日志 → 启用。详细步骤参考 【费用说明】SLS计费规则说明 【影响范围】无业务影响。日志包含 Prompt 与响应正文,存在敏感信息留存风险,请配置访问控制并设置合适的 TTL。 |
网络安全防护
检测项 | 检测项说明 | 快速修复说明 |
AI 网关未配置网络防护(IP 黑白名单 / WAF) | AI 网关支持在网关层统一配置 IP 黑白名单与 WAF 防护。未启用 IP ACL 与 WAF,恶意 IP 与 OWASP Top 10 类攻击(注入、爬虫、CC 攻击等)将直接触达后端模型与 Agent 服务。 | ①AI 网关控制台 → 实例 → 安全管理 → 黑/白名单,配置可信 IP 段;②同实例下开启 WAF 集成或为域名接入 WAF 3.0。详细步骤参考:设置网关IP黑白名单 与 开启WAF防护 【费用说明】IP 黑白名单包含在 AI 网关费用中。WAF 3.0 计费规则说明。 【影响范围】误配置 IP 白名单可能导致合法调用方被拦截。建议先在观察模式或仅设黑名单方式上线,确认无误后再切换为严格白名单。 |
AgentRuntime 配置了公网访问(未启用 VPC 私有网络隔离) | AgentRuntime 通过 VPC 网络与 vSwitch 实现网络隔离。disablePublicNetworkAccess 为 false 时,AgentRuntime 暴露在公网,存在被未授权扫描与攻击的风险。建议生产环境通过 VPC 私网访问,结合 PrivateLink 或 VPN 由可信网络访问。 | 在 AgentRun 控制台关闭公网访问,仅通过 VPC 内网访问 AgentRuntime。 操作路径:函数计算控制台 → AgentRun → 选择 AgentRuntime → 网络配置 → 关闭「公网访问」开关,并配置 VPC 与 vSwitch。 【费用说明】仅 VPC 内网访问无额外费用。如需通过公网受控访问,可改用 AI 网关 + WAF 方案,会产生网关与 WAF 实例费。 【影响范围】关闭公网后所有公网调用方无法继续访问,请确保所有调用方都已部署在同一 VPC 或可通过内网/PrivateLink 抵达。 |
Agent 应用防护
检测项 | 检测项说明 | 快速修复说明 |
AI 网关未启用内容安全检查策略(AiSecurityGuard) | AI 网关 AiSecurityGuard 策略集成阿里云 AI 安全护栏,可在网关入口对 Prompt 与模型响应统一做敏感词、合规审核。未启用时,内容安全分散到各后端服务,难以统一管控且存在审核遗漏。 | 在 AI 网关控制台为 HttpApi 开启 AiSecurityGuard 策略并选择内容安全配置。 操作路径:AI 网关控制台 → 实例 → Model API / Agent API / MCP Server → 策略与插件 → AI 安全防护 → 启用 AI 安全防护 → 选择 AI 安全护栏 / 内容安全。 【费用说明】内容安全收费说明 与 AI 安全护栏收费说明 【影响范围】开启后命中风险词或违规内容的请求或响应会被拦截。请评估词典与策略阈值,避免误拦正常业务请求。 |
AgentRun 模型代理层未统一配置内容安全策略 | AgentRun 模型代理层(ModelProxy)支持统一配置 aiGuardrailConfig,对所有路由到该代理的模型调用做请求/响应内容安全检查。未配置时,各 AgentRuntime 各自管理安全策略,标准不一致且管理成本高。 | 在 AgentRun 控制台为模型代理层启用 aiGuardrailConfig。 操作路径:函数计算控制台 → AgentRun → 模型代理 → 编辑 → 高级策略 → 启用 AI 安全护栏。 【费用说明】基于阿里云安全护栏实现,为AI应用提供全方位安全防护,详见开通与计费概述。 【影响范围】开启后命中违规内容的请求或响应将被拦截。请先在测试环境校验词典与阈值,避免对线上 Agent 业务造成误拦。 |
传输数据保护
检测项 | 检测项说明 | 快速修复说明 |
AgentRun 自定义域名未开启 HTTPS | AgentRuntime 默认提供 HTTPS 端点,但用户绑定的自定义域名(CustomDomain)需要自行管理证书。CustomDomain protocol 不为 HTTPS 时,外部访问 Agent 时数据明文传输,存在请求/响应被监听与篡改的风险。 | 在 AgentRun 控制台为自定义域名上传 SSL 证书并将协议设置为 HTTPS。 操作路径:函数计算控制台 → AgentRun → 自定义域名 → 编辑 → 协议选择 HTTPS → 上传证书或引用 CAS 证书。 【费用说明】HTTPS 本身免费,证书需通过数字证书管理服务购买或申请免费证书。 【影响范围】切换 HTTPS 后调用方需更新访问协议为 https://。请提前通知所有 Agent 调用方。 |
稳定
基础设施容灾
检测项 | 检测项说明 | 快速修复说明 |
PAI EAS 服务部署在公共资源组 | PAI EAS 提供公共资源、EAS 资源组、资源配额三类资源类型。公共资源采用按量付费、与其他用户共享算力,存在资源争抢、SLA 较弱的问题,不适合生产容灾架构。建议生产服务部署在专属 EAS 资源组。 | 购买专属 EAS 资源组并将服务迁移过去。 操作路径:①PAI 控制台 → EAS → 资源组管理 → 创建专属资源组(包年包月或按量);②编辑服务 → 部署资源 → 选择刚创建的专属资源组 → 重新部署。详细步骤参考:EAS 部署资源概述 【费用说明】EAS计费规则说明 【影响范围】迁移过程涉及服务重新部署,存在短暂中断。建议先在新资源组创建新版本服务并通过流量分配灰度切换。 |
PAI EAS 服务使用共享网关(未配置专属网关) | PAI EAS 默认使用共享推理网关,多租户共用入口存在带宽争抢与流量隔离问题。生产服务建议使用专属网关(ServiceConfig.networking.gateway 不为空),享受独立带宽与稳定 SLA。 | 在 PAI 控制台为 EAS 服务绑定专属网关。 操作路径:PAI 控制台 → EAS → 推理网关 → 创建专属网关;编辑服务 → 部署配置 → 网络 → 选择专属网关。 【费用说明】专属网关按规格与时长计费,会额外产生网关实例费 【影响范围】绑定专属网关后服务访问端点会变化,请同步更新调用方使用的端点地址。 |
AgentRuntime 未跨多可用区部署 | AgentRuntime networkConfiguration.vswitchIds 关联的 vSwitch 都在同一可用区时,单 AZ 故障会导致 Agent 服务整体不可用。建议关联多个不同可用区的 vSwitch 实现跨 AZ 容灾。 | 在 AgentRun 控制台编辑 AgentRuntime 网络配置,关联至少 2 个不同可用区的 vSwitch。 操作路径:函数计算控制台 → AgentRun → AgentRuntime → 网络配置 → vSwitch → 添加来自不同可用区的 vSwitch。 【费用说明】不同可用区 vSwitch 不收取额外网络费用,但跨 AZ 流量按 VPC 跨可用区流量计费。 【影响范围】配置变更可能涉及实例重新调度,建议在低峰期操作并先在测试环境验证。 |
模型推理容灾
检测项 | 检测项说明 | 快速修复说明 |
PAI EAS 推理服务仅配置单副本 | EAS 服务 TotalInstance 字段表示总副本数。仅 1 个副本时单点故障会导致服务中断,违背容灾原则。生产服务建议至少 2 个副本并打散到多个可用区。 | 在 PAI 控制台编辑服务,将实例数(TotalInstance / replicas)设为 ≥ 2。 操作路径:PAI 控制台 → EAS → 服务 → 更新 → 副本数 → 点击 扩缩容,调整为 2 及以上。 【费用说明】副本数翻倍会成比例增加 EAS 费用 【影响范围】扩容是滚动更新,无业务中断。请确保资源组配额足够。 |
Agent应用容量规划
检测项 | 检测项说明 | 快速修复说明 |
PAI EAS 服务未启用弹性伸缩 | PAI EAS 服务 ServiceConfig.autoscaler 用于配置自动扩缩容(基于 QPS、GPU 利用率等指标)。未启用时无法自动应对负载波动。 | 在 PAI 控制台为 EAS 服务开启 autoscaler 并设置最小/最大实例数与扩缩容指标阈值。 操作路径:PAI 控制台 → EAS → 服务 → 更新 → 自动伸缩 → 弹性伸缩 → 启用 → 配置指标与阈值。详细步骤参考:弹性资源池配置 【费用说明】弹性扩容产生的实例按 EAS 标准计费 【影响范围】扩缩容可能产生抖动,请合理设置冷却时间避免频繁伸缩。 |
AgentRuntime 未配置弹性伸缩策略 | AgentRuntime 通过 scalingConfig.minInstances 配置最小实例数。时延敏感业务不建议缩容到零(最小实例数 ≥ 1),可为您带来以下保障: | 在 AgentRun 控制台为 AgentRuntime 配置弹性伸缩策略(最小 / 最大实例数、扩缩容指标)。 操作路径:函数计算控制台 → AgentRun → AgentRuntime → 弹性与实例 → 弹性配置 → 创建弹性策略 → 设置最小实例数 ≥ 1。详细步骤参考 【费用说明】扩容产生的实例按 AgentRun 标准计费,计费规则说明 【影响范围】minInstances 设置过高会增加常驻费用;过低则冷启动延迟更明显。请按业务流量分布合理评估。 |
Agent发布管理
检测项 | 检测项说明 | 快速修复说明 |
PAI EAS 服务未使用灰度发布 | PAI EAS 通过服务群组(DescribeGroup)按权重做流量分配,实现新老版本灰度发布。直接全量更新不存在群组时,更新即对全部流量生效,故障范围大。 | 通过服务群组将多个版本的服务划入同一群组并配置流量权重。 操作路径:PAI 控制台 → EAS → 服务群组 → 创建群组 → 将新老版本服务加入群组 → 设置权重(如先 5%/95%)→ 灰度验证后逐步切换。详细步骤参考 【费用说明】灰度发布服务本身不收费,如需购买专属资源组会增加相关的费用。 【影响范围】灰度期间会同时有多个版本运行,需保证版本兼容性。 |
智能监控告警
检测项 | 检测项说明 | 快速修复说明 |
PAI EAS 服务未关联 CMS 告警规则 | 云监控(CMS)通过 DescribeMetricRuleList 查询 PAI EAS 服务的告警规则。未关联任何告警规则时,服务异常(如不可用、5xx 上升、延迟激增)无法自动通知运维。 | 在云监控控制台为 PAI EAS 创建告警规则(如 5xx 占比、平均延迟、实例不健康数等)。 操作路径:云监控控制台 → 报警服务 → 报警规则 → 创建报警规则 → 选择 PAI-EAS 命名空间 → 配置指标与阈值 → 关联通知组。详细步骤参考 【费用说明】基础告警免费,短信/电话通知计费,计费规则说明 【影响范围】无业务影响。请合理设置静默与通知频次避免告警风暴。 |
PAI EAS 服务未启用 ARMS 链路追踪 | PAI EAS 服务 ServiceConfig.monitoring.enable_tracing=true 启用后会接入 ARMS 链路追踪。未启用时推理请求的内部执行(前后处理、模型调用、外部依赖)不可观测。 | 在 PAI 控制台为 EAS 服务开启链路追踪。 操作路径:PAI 控制台 → EAS → 服务 → 更新 → 监控 → 启用链路追踪 → 选择/创建 ARMS 应用。详细步骤参考 EAS 链路追踪方案 【费用说明】ARMS计费规则说明 【影响范围】启用 ARMS 探针会带来轻微性能开销(通常 <5%)。 |
AI 网关未配置 CMS 告警规则 | 云监控通过 DescribeMetricRuleList 在 acs_cnapigateway 命名空间下查询 AI 网关告警规则。未配置时网关 5xx、延迟、连接数等关键指标异常无法自动通知。 | 在云监控控制台为 AI 网关创建告警规则。 操作路径:云监控控制台 → 报警服务 → 报警规则 → 创建报警规则 → 配置指标(如 5xx 占比、Token 速率、Latency)与阈值 → 关联报警联系人组。 【费用说明】基础告警免费,短信/电话通知计费,计费规则说明 【影响范围】无业务影响。请合理设置阈值与静默期。 |
AgentRuntime 未启用 ARMS 全链路监控 | AgentRuntime armsConfiguration.enableArms 启用后,请求会接入 ARMS 应用监控,提供调用链、SQL 分析、内存/线程剖析等。未启用时请求全链路不可观测,故障定位困难。 | 在 AgentRun 控制台为 AgentRuntime 启用 ARMS 监控。 操作路径:函数计算控制台 → AgentRun → AgentRuntime → 可观测 → 应用监控 → 一键开通。详细步骤参考 【费用说明】开通应用监控资源可能会产生费用,详情请参见应用监控计费方式 【影响范围】启用 ARMS 探针会带来轻微性能开销(通常 <5%)。 |
AgentRuntime 未配置健康检查 | AgentRuntime healthCheckConfiguration.httpGetUrl 用于配置 HTTP GET 健康检查。未配置时服务异常无法被自动检测与替换实例。健康检查仅在 artifactType=Code 模式下可配置,容器模式可能不支持。 | 在 AgentRun 控制台为 AgentRuntime 配置健康检查 URL(如 /health)。 操作路径:函数计算控制台 → AgentRun → AgentRuntime → 高级配置 → 健康检查 → 设置 httpGetUrl 与超时间隔。 【费用说明】无额外费用。 【影响范围】健康检查实现错误(如返回非 2xx)会导致实例被反复重启。请先在测试环境验证健康检查端点。 |
AgentRuntime 未配置日志监控 | AgentRuntime logConfiguration.logstore 用于配置应用日志投递到 SLS。未配置时无法收集 Agent 运行日志,故障排查与审计困难。 | 在 AgentRun 控制台为 AgentRuntime 配置日志投递。 操作路径:函数计算控制台 → AgentRun → AgentRuntime → 可观测 → 日志 → 一键开启/手动配置。 【费用说明】SLS计费规则说明 【影响范围】无业务影响。建议为日志设置合理 TTL 与压缩存储控制成本。 |
Agent应用容错
检测项 | 检测项说明 | 快速修复说明 |
AI 网关 Agent API / Model API 入站方向未配置防护插件 | AI 网关 Agent API 与 Model API 入站方向(direction=InBound)应配置流控、超时、熔断、安全防护等插件。未安装相关插件时,恶意流量与异常请求会直接打到后端 Agent / 模型服务。 | 在 AI 网关控制台为 Agent API 与 Model API 启用入站方向的限流、熔断、内容安全等插件组合。 操作路径:AI 网关控制台 → Agent API / Model API → 策略与插件 → 入站处理 → 启用策略/插件(限流 / 熔断 / 安全 / 日志等)。 【费用说明】策略包含在 AI 网关实例费用中,部分高级安全防护可能依赖内容安全/WAF 等附加产品,按对应产品计费。 【影响范围】策略生效后不符合规则的请求会被拒绝。请评估业务流量特征再设阈值。 |
模型推理容错
检测项 | 检测项说明 | 快速修复说明 |
AgentRun 模型代理层未配置超时设置 | AgentRun 模型代理层(ModelProxy)通过 proxyConfig.policies.requestTimeout 配置请求超时。未配置超时时,模型无响应将阻塞整个请求链,长尾请求拖垮 AgentRuntime 资源。 | 在 AgentRun 控制台为模型代理层配置 请求超时时间(建议 30~60s)。 操作路径:函数计算控制台 → AgentRun → 模型代理 → 编辑 → 高级策略 → 请求超时时间。 【费用说明】无额外费用。 【影响范围】超时阈值过小会导致大模型生成长答时被截断,请根据业务最大可接受响应时间合理设置。 |
AgentRun 模型代理层未配置 Fallback 降级策略 | AgentRun 模型代理层支持配置多级 Fallback(fallbacks 数组),主模型限流/超时/故障时自动切换到备用模型,避免 AgentRuntime 完全不可用。 | 在 AgentRun 控制台为模型代理层配置 fallbacks 列表,按优先级顺序加入备用模型。 操作路径:函数计算控制台 → AgentRun → 模型代理 → 编辑 → 高级策略 → 添加 Fallback 模型。 【费用说明】Fallback 触发时调用备用模型按对应模型 Token 计费。 【影响范围】Fallback 触发时输出风格可能与主模型差异较大,建议为关键业务路径配置兼容的备用模型。 |
AI 网关 Model API 未配置多模型负载均衡 | AI 网关 Model API 的 serviceConfigs 支持配置多个后端模型服务并按权重做负载均衡。仅配置单一模型服务时,流量全部路由到同一后端,存在单点过载与雪崩风险。 | 在 AI 网关控制台为 Model API 配置多个后端模型服务并设置权重,实现负载均衡。 操作路径:AI 网关控制台 → Model API → 后端服务 → 添加多个模型服务并配置权重。详细步骤参考 【费用说明】负载均衡策略包含在 AI 网关实例费中,无额外费用。后端模型按各自的 Token / 调用次数计费。 【影响范围】权重配置不当可能导致流量倾斜,建议先按等权重灰度验证再调整业务实际比例。 |
AI 网关未启用 AI Fallback 多模型降级 | AI Fallback 是 AI 网关的多模型降级能力,主模型服务不可用时自动切换到备用模型,提高 AI 应用整体可用性。policyConfigs 中未启用 aiFallbackConfig 时,主模型异常将直接返回错误。 | 在 AI 网关控制台为 Model API 启用 AI Fallback 策略,按优先级配置主备模型。 操作路径:AI 网关控制台 → Model API → 策略与插件 → AI Fallback → 启用 → 添加备用模型服务。详细步骤参考 【费用说明】策略本身无额外费用;Fallback 触发时调用备用模型按其 Token 计费。 【影响范围】Fallback 触发时输出风格与主模型可能存在差异,请为关键业务路径配置兼容备用模型并充分测试。 |
AI 网关 Model API 未配置响应缓存策略 | AI 网关 AI Cache 通过 Redis 精确缓存或 DashVector 语义缓存命中重复 Prompt,由网关直接返回缓存内容,可显著降低后端模型调用量、提升响应速度,并在模型异常时提供降级。 | 在 AI 网关控制台为 Model API 启用 AI Cache 策略,可选 Redis 精确缓存或 DashVector 语义缓存。 操作路径:AI 网关控制台 → Model API → 策略与插件 → AI Cache → 启用 → 选择缓存类型并配置 Redis / DashVector 实例。详细步骤参考 【费用说明】策略本身无额外费用;Redis / DashVector 实例按所选规格计费。命中缓存可显著降低后端模型 Token 消耗。 【影响范围】语义缓存在相似度阈值设置过低时可能命中错误回答,建议先以高阈值上线再根据效果调整。 |
AI 网关未配置多维度限流和熔断策略 | AI 网关 AI Token 限流策略支持基于 Token 消耗量、请求数、并发数的多维流量管控。未配置流量管控插件时,突发流量可能直接打垮后端模型服务,造成雪崩。 | 在 AI 网关控制台为 Model API 启用 AI Token 限流与熔断策略,配置 Token、QPS、并发等多维阈值。 操作路径:AI 网关控制台 → Model API → 策略与插件 → AI Token 限流 / 熔断 → 启用 → 设置 tpm/tps/并发等维度阈值。详细步骤参考 【费用说明】策略包含在 AI 网关实例费中,无额外费用。 【影响范围】超过阈值的请求会被拒绝,请按业务峰值合理设置并通知调用方处理重试。 |
推理容量规划
检测项 | 检测项说明 | 快速修复说明 |
AgentRun 模型代理层未配置并发控制和 Token 限流 | AgentRun 模型代理层 proxyConfig.policies 中 concurrencyLimit 与 tokenRateLimiter(tpm/tps/tph/tpd)用于约束并发与 Token 速率。两者均未配置时,突发流量会直接传到下游模型,触发模型限流甚至产生不可控费用。 | 在 AgentRun 控制台为模型代理层配置 并发控制 或 Token 限流。 操作路径:函数计算控制台 → AgentRun → 模型代理 → 编辑 → 高级策略 → 并发控制 / Token 限流。 【费用说明】无额外费用。 【影响范围】超过阈值的请求会被拒绝。请按业务峰值合理设置阈值并通知调用方处理重试。 |
成本
Agent应用成本优化
检测项 | 检测项说明 | 快速修复说明 |
PAI EAS 服务 GPU 利用率长期低于 10%(资源浪费) | 通过云监控 DescribeMetricData 查询 PAI EAS 服务的 GPU 利用率。若长期低于 10%,说明实例数过多或规格过大,存在 GPU 资源浪费。 | 缩减副本数、降配实例规格,或启用弹性伸缩按需扩缩容。 操作路径:PAI 控制台 → EAS → 服务 → 更新 → 减少副本数或换用更小规格 → 同时启用 autoscaler 设置较低 minInstances。详细步骤参考 【费用说明】缩减副本数、降配实例规格、缩容会减少 EAS 费用 【影响范围】缩容可能影响业务峰值承载能力。请结合峰值流量评估并配合弹性伸缩兜底。 |
推理成本优化
检测项 | 检测项说明 | 快速修复说明 |
AI 网关未启用工具精选插件 | AI 网关工具精选插件(AiToolSelection)会根据 Prompt 智能筛选相关工具描述传递给模型,避免将所有注册工具的完整描述都打包注入,从而降低每次推理的 Token 消耗。 | 在 AI 网关控制台为 Model API 启用工具精选策略。 操作路径:AI 网关控制台 → Model API → 策略与插件 → 工具精选 → 启用 → 配置筛选规则。 【费用说明】工具精选策略包含在 AI 网关实例费中,本身无额外费用。 【影响范围】筛选规则不当可能导致模型无法选到正确工具。请充分测试常见场景再灰度上线。 |
性能
Agent架构优化
检测项 | 检测项说明 | 快速修复说明 |
PAI EAS 服务 GPU 利用率过高 | 通过云监控 DescribeMetricData 查询 PAI EAS 服务的 GPU 利用率。若长期高于阈值(如 90%),说明实例数不足,存在响应延迟激增、请求排队甚至服务不可用风险。 | 扩容副本数、升配实例规格,或启用弹性伸缩自动应对峰值。 操作路径:PAI 控制台 → EAS → 服务 → 更新 → 增加副本数或换用更大规格 → 同时启用 autoscaler 设置合适 maxInstances。详细步骤参考 【费用说明】扩容副本数、升配实例规格、扩容会增加 EAS 费用 【影响范围】扩容是滚动更新,无业务中断,但需要确保资源组配额充足。 |