本文介绍 Smart Studio(小程序集群对接平台)如何进行平台模型部署与资源配置。
从模型库中选择模型,在您自己的集群上创建部署。
第一步:选择模型
选择模型并配置基本部署设置。
选择模型:从下拉列表中选择模型,或浏览模型库。支持基础模型和微调模型。
显示名称:用于在仪表盘上标识部署的描述性名称(64 字符以内)。
服务类型:选择部署的服务拓扑。
标准:一体化推理服务,适用于大多数使用场景。
P/D 分离:将预填充和解码阶段分离为独立的服务,以优化资源分配。
后端:选择推理后端引擎。
SGLang:高性能推理引擎,具有高效的内存管理。
vLLM:开源推理引擎,支持 PagedAttention 以实现高吞吐量。
何时使用 P/D 分离?推荐用于高并发、长上下文的工作负载。对于低流量或短上下文的使用场景,标准模式更简单且更具成本效益。
点击下一步进入资源配置。

第二步:配置资源
资源配置取决于在第一步选择的服务类型。
标准服务
在单个集群上配置统一的推理服务。
集群:选择一个已激活的集群进行部署。
GPU 类型:选择您的集群中可用的 GPU 类型(例如 L20)。要求请参见不同模型部署的最低配置。
副本数:用于负载均衡的服务副本数量。默认为 1。
分布式 KV 缓存:(可选)启用以在实例间共享 KV 缓存。
KV 缓存量化:(可选)启用 KV 缓存量化以减少内存使用。

P/D 分离服务
配置独立的预填充和解码服务,以优化资源分配。
集群:选择一个已激活的集群进行部署。
P/D 形态:定义预填充和解码实例的比例(例如
1p1d= 1 个预填充 + 1 个解码)。预填充副本数 / 解码副本数:每个服务的副本数量。默认为 1。
预填充 TP / 解码 TP:每个服务的张量并行度。仅在模型配置文件要求时调整。默认为 1。
分布式 KV 缓存:(可选)启用以在实例间共享 KV 缓存。
KV 缓存容量(GB):(可选)以 GB 为单位指定容量,或留空使用配置文件默认值。
点击创建部署提交您的配置。
何时启用分布式 KV 缓存优化?在实例间共享缓存的键值状态以减少冗余计算。当多个副本服务于重叠的上下文(例如共享系统提示词)时启用。如果请求很少共享上下文或 GPU 内存紧张,则保持禁用。
管理您的部署
部署完成后,您的模型将出现在部署列表中。您可以在部署列表中查看部署状态、停止或重启服务,删除不再需要的部署。
