全部产品
Search
文档中心

SuperApp:快速部署平台模型

更新时间:Jul 16, 2026

本文介绍 Smart Studio(小程序集群对接平台)如何进行平台模型部署与资源配置。

从模型库中选择模型,在您自己的集群上创建部署。

第一步:选择模型

选择模型并配置基本部署设置。

  • 选择模型:从下拉列表中选择模型,或浏览模型库。支持基础模型和微调模型。

  • 显示名称:用于在仪表盘上标识部署的描述性名称(64 字符以内)。

  • 服务类型:选择部署的服务拓扑。

    • 标准:一体化推理服务,适用于大多数使用场景。

    • P/D 分离:将预填充和解码阶段分离为独立的服务,以优化资源分配。

  • 后端:选择推理后端引擎。

    • SGLang:高性能推理引擎,具有高效的内存管理。

    • vLLM:开源推理引擎,支持 PagedAttention 以实现高吞吐量。

说明

何时使用 P/D 分离?推荐用于高并发、长上下文的工作负载。对于低流量或短上下文的使用场景,标准模式更简单且更具成本效益。

点击下一步进入资源配置。

选择模型

第二步:配置资源

资源配置取决于在第一步选择的服务类型

标准服务

在单个集群上配置统一的推理服务。

  • 集群:选择一个已激活的集群进行部署。

  • GPU 类型:选择您的集群中可用的 GPU 类型(例如 L20)。要求请参见不同模型部署的最低配置

  • 副本数:用于负载均衡的服务副本数量。默认为 1。

  • 分布式 KV 缓存:(可选)启用以在实例间共享 KV 缓存。

  • KV 缓存量化:(可选)启用 KV 缓存量化以减少内存使用。

标准服务

P/D 分离服务

配置独立的预填充和解码服务,以优化资源分配。

  • 集群:选择一个已激活的集群进行部署。

  • P/D 形态:定义预填充和解码实例的比例(例如 1p1d = 1 个预填充 + 1 个解码)。

  • 预填充副本数 / 解码副本数:每个服务的副本数量。默认为 1。

  • 预填充 TP / 解码 TP:每个服务的张量并行度。仅在模型配置文件要求时调整。默认为 1。

  • 分布式 KV 缓存:(可选)启用以在实例间共享 KV 缓存。

  • KV 缓存容量(GB):(可选)以 GB 为单位指定容量,或留空使用配置文件默认值。

P/D 分离点击创建部署提交您的配置。

说明

何时启用分布式 KV 缓存优化?在实例间共享缓存的键值状态以减少冗余计算。当多个副本服务于重叠的上下文(例如共享系统提示词)时启用。如果请求很少共享上下文或 GPU 内存紧张,则保持禁用。

管理您的部署

部署完成后,您的模型将出现在部署列表中。您可以在部署列表中查看部署状态、停止或重启服务,删除不再需要的部署。

部署列表