科技
美国
中小企业/初创公司
"阿里云帮助我们实现了稳定、高性价比的开源模型访问,满足生产级规模需求。当客户工作负载达到吞吐量上限时,阿里云工程师与我们并肩协作,专属容量方案让我们在数天内即可在五个全球地域的基础设施上配置保障性吞吐量。"
Andrew Zheng
联合创始人兼 CTO,Infron
关于 Infron
Infron 是一家美国 AI 基础设施公司。其旗舰产品是企业级 AI 网关和推理平台,为工程团队提供统一接入 100 多家提供商的 400 多个主流模型的 OpenAI 兼容 API,并提供统一计费和自动故障切换。在模型访问之上,Infron 融合了弹性智能路由和智能体层,以及大规模生产所需的能力,包括 99.9% 可用性 SLA、智能缓存和专属吞吐量。该平台帮助客户提升模型可用性、降低推理成本,并在不同提供商之间实现稳定的性能表现。
挑战
Infron 所处的 AI 基础设施市场正在快速演变,模型能力和客户需求都在不断变化。技术层面,团队需要根据真实客户场景、模型表现、可用性、延迟和成本持续迭代路由算法。随着新模型和提供商的涌现,Infron 必须不断调整编排逻辑,帮助客户为每个工作负载选择最优的模型访问路径。
商业层面,市场竞争激烈。行业快速增长,众多公司从不同角度切入,包括 AI 模型访问平台、聚合层和推理提供商。Infron 需要通过更优的编排能力、可靠性、成本优化和面向客户的智能路由来建立差异化优势。
随着客户进入生产环境,单个工作负载开始突破共享 API 配额和吞吐量限制。同时,更多客户因延迟和数据驻留需求而要求特定地域的模型访问。Infron 需要一个能够在不牺牲成本效率的前提下提供保障性容量和多地域覆盖的基础设施合作伙伴。
为什么选择阿里云
Infron 选择与阿里云合作,主要基于两个原因。● 高性价比的开源模型访问:阿里云为开源模型提供极具竞争力的定价,帮助 Infron 为特定开源模型工作负载实现更优的成本优化。
● 成熟的容量解决方案:阿里云提供 TPM 预留、预配置吞吐量单元(PTU)和模型单元(MU)等容量选项,帮助 Infron 在模型编排中面临容量或资源约束时提升可扩展性、可用性和稳定性。
架构


阿里云在三个主要方面支持 Infron 的模型编排架构:
● 全球开源模型访问
阿里云使 Infron 能够连接部署在阿里云全球地域的开源模型,为 Infron 提供更广泛的模型访问和更多客户工作负载路由选项。
● 动态容量协调
阿里云提供 TPM 预留、PTU 和 MU 等容量方案,使 Infron 能够根据客户需求和工作负载特征动态协调资源。
● 部署配置支持
阿里云与 Infron 协作,确保平台配置与已审批的企业客户用例对齐,维持负责任的部署实践。
关键成果
全球覆盖与路由灵活性:● Infron 通过阿里云的定价优势和容量支持,为客户提供更具成本效益的开源模型访问。
● 客户可将工作负载固定在特定阿里云地域以满足延迟或数据驻留需求,每次请求均可验证地域分配。
● 模型访问覆盖范围扩展至五个阿里云国际地域:新加坡、中国(香港)、日本(东京)、德国(法兰克福)和美国(弗吉尼亚)。
可扩展基础设施:
● 随着客户群的增长,Infron 在阿里云上的部署从最初的共享配额扩展至多地域专属容量。
● 阿里云的 TPM 预留、PTU 和 MU 容量选项帮助 Infron 应对流量峰值并按需分配资源,专用吞吐量在数天内即可完成配置。
平台稳定性与创新:
● 合作增强了 Infron 模型编排层的可靠性和可扩展性,尤其面向需要高并发的生产级 AI 工作负载。
● 阿里云技术团队帮助 Infron 加速客户场景下模型访问解决方案的测试、部署和优化。
展望未来
Infron 计划深化与阿里云的合作,将模型访问扩展到更多地域,提升生产级 AI 工作负载的动态容量协调能力。Infron 还将持续扩展其模型编排和基准测试能力。通过公开基准测试工作,Infron 致力于为模型路由、成本、延迟、吞吐量和跨提供商可靠性提供更透明、数据驱动的评估。
Infron 与阿里云携手,致力于打造更强大的全球模型访问层——让工程团队在任何地方都能可靠、低延迟地访问所需的开源模型。
