其他

Model Studio PTU(预置吞吐)能力升级公告

影响时间

2026-06-18 23:00:00 (UTC+08) 【以实际变更时间为准】

一、升级概述

为帮助企业客户更好地承载长上下文与多轮对话类业务,阿里云Model Studio PTU 本次完成 5 项能力升级,覆盖长输入支持、隐式缓存、容量计算、API 可观测性等关键场景。升级完成后,PTU 在保持单价与购买方式不变的前提下,可承载的业务范围更广,单位容量的实际产出更高。

存量 PTU 客户无需任何操作,升级完成后将自动沿用新规则,原有 PTU 容量可覆盖的工作负载范围进一步扩展。

二、本次升级内容

1. PTU 支持更长输入,与 API 上限对齐

此前 PTU 对输入长度存在硬性限制,超出限制的请求会自动 fallback 至公池按量计费。本次升级后,以下模型在 PTU 内的输入长度上限均显著提升:

图一

后续将根据模型迭代节奏继续扩大支持范围。

2. PTU 支持隐式缓存(Implicit Cache)

PTU 现已支持对请求输入前缀的 KV Cache 自动复用。命中缓存的 token 按更低的缓存系数折算容量消耗,无需任何代码改动。

本期支持隐式缓存的模型及缓存系数:

图二

典型受益场景:RAG 知识库问答、多轮对话、Agent / 工具调用、批量处理等存在固定前缀(System Prompt、检索片段、工具定义)的业务,单位 PTU 容量可承载的请求量将显著增加。

3. 部分模型长输入引入容量系数

为更精确地反映长短输入的推理成本差异,PTU 引入容量系数机制:实际容量消耗 = 原始 Token 数 × 容量系数。长输入请求在同一 PTU 内处理,无需单独购买长输入容量。

本期仅 GLM-5.1 适用:

图三

PTU 单价、购买流程保持不变。

4. 控制台新增容量计算器

PTU 创建流程新增「容量计算器」。客户可输入业务侧的 RPM、平均输入长度、平均输出长度、缓存命中率,系统将基于容量系数自动换算推荐 TPM,降低购买前的容量评估成本。

5. API 返回值新增 PTU 标识与容量字段

为便于客户监控 PTU 命中率与实际容量消耗结构,API 返回值新增以下字段:

图四

返回值参考官方文档

三、对存量客户的影响

升级完成后:

存量 PTU 自动沿用新规则,无需重新创建或迁移;

原本因输入长度超限会 fallback 至公池的请求,在系数折算后若仍在容量范围内,将继续在 PTU 内处理并享受 SLA 保障;

隐式缓存能力对存量 PTU 同步生效,相同前缀的请求容量消耗自动降低;

客户原 PTU 可覆盖的工作负载范围进一步扩展。

计费与容量规则详情:请参考Model Studio官方文档「PTU 计费说明」。如需技术支持,请提交工单。