技術
美國
中小企業/初創企業
「阿里雲協助我們在生產規模下,提供穩定且具成本效益的開源模型存取服務。 當客戶的工作負載達到吞吐量上限時,阿里雲的工程師與我們並肩合作,其專用容量方案讓我們能在短短數天內,於橫跨全球五個區域的基礎設施上配置出有保障的吞吐量。」
Andrew Zheng
Infron 聯合創始人兼首席技術官
關於 Infron
Infron 是一家總部位於美國的 AI 基礎設施公司。 其旗艦產品是一款企業級 AI 網關與推論平台,讓工程團隊能夠透過與 OpenAI 兼容的單一 API,存取來自 100 多家供應商的 400 多個頂尖模型,並具備統一計費與自動故障轉移功能。 除了模型存取功能外,Infron 還將彈性智能路由與代理層結合,提供團隊在大規模運作下所需的生產能力,包括 99.9% 正常運作時間 SLA、智能緩存以及專用吞吐量。 該平台可幫助客戶提升模型可用性、降低推論成本,並確保在各服務供應商之間提供一致的效能。
挑戰
Infron 活躍於瞬息萬變的 AI 基礎設施市場,在此市場中,模型能力與客戶需求皆正迅速變化。從技術角度來看,團隊必須根據真實的客戶場景、模型性能、可用性、延遲和成本不斷迭代其路由算法。 隨著新模型與供應商的湧現,Infron 必須持續調整其編排邏輯,以協助客戶針對每項工作負載選擇合適的模型存取路徑。
從商業角度來看,市場競爭激烈。 該行業發展迅猛,許多公司正從不同角度切入,包括 AI 模型存取平台、聚合層以及推論服務供應商。 Infron 必須透過更完善的編排能力、可靠性、成本優化以及針對客戶需求的路由智能,展現其差異化優勢。
隨著 Infron 的客戶進入生產環境,個別工作負載開始超出共享 API 配額與吞吐量限制。 與此同時,越來越多的客戶基於延遲和數據駐留等考量,要求能在特定區域存取模型。 Infron 需要一位能夠提供有保障的容量與跨區域覆蓋,同時兼顧成本效益的基礎設施合作夥伴。
為何選擇阿里雲
Infron 主要基於兩大理由與阿里雲合作。● 高性價比的開源模型存取:阿里雲為開源模型提供極具競爭力的定價,使 Infron 能針對特定開源模型工作負載實現更強大的成本優化。
● 成熟的容量解決方案:阿里雲提供多種容量選項,包括 TPM 預留、預配置吞吐量單位(PTU)以及模型單位(MU)。 當面臨模型編排方面的容量或資源限制時,這些選項有助於 Infron 提升可擴展性、可用性及穩定性。
架構


阿里雲主要在三個方面支援 Infron 的模型編排架構:
● 全球開源模型存取
阿里雲使 Infron 能夠連接到全球阿里雲區域部署的開源模型。 這為 Infron 提供了更廣泛的模型存取權限和更多的客戶工作負載路由選項。
● 動態容量協調阿里雲提供多個容量選項,包括 TPM 預留、PTU 和 MU。 這使 Infron 能夠根據客戶需求和工作負載模式動態協調資源。
● 部署配置支持阿里雲與 Infron 合作,將平台配置與經核准的企業客戶用例相配合,並維持負責任的部署慣例。
關鍵成果
全球覆蓋範圍與路由靈活性:● 透過阿里雲的定價與容量支持,Infron 能讓客戶以更具成本效益的方式使用其精選的開源模型。
● 客戶可將工作負載固定部署於特定的阿里雲區域,以滿足延遲或數據駐留要求,且每次請求皆可驗證其區域配置。
● 已將模型存取範圍擴展至阿里雲的五個國際區域:新加坡、中國(香港)、日本(東京)、德國(法蘭克福)及美國(維吉尼亞)。
可擴展的基礎設施:
● 隨著 Infron 的客戶群不斷擴大,其在阿里雲上的部署亦已由最初的共享配額模式,擴展至橫跨多個區域的專用資源。
● 阿里雲的 TPM 預留、PTU 及 MU 容量選項,可協助 Infron 應對流量高峰並按需分配資源,且能在數日內完成專用吞吐量配置。
平台穩定性與創新:
● 此次合作強化了 Infron 模型編排層的可靠性與可擴展性,尤其是針對需要高並發性的生產環境 AI 工作負載。
● 阿里雲的技術團隊協助 Infron 加快針對客戶場景的模型存取解決方案的測試、部署與優化進度。
未來展望
Infron 計畫在全球各區域擴大開放更多開源模型的存取權限,並改善生產環境中 AI 工作負載的動態容量協調機制,藉此深化與阿里雲的合作。Infron 還將繼續擴展其模型編排和基準測試功能。 透過其公開基準測試工作,該公司旨在針對各服務供應商的模型路由、成本、延遲、吞吐量及可靠性,提供更透明且以數據為依據的評估。
Infron 與阿里雲將攜手打造更穩健的全球模型存取層,讓工程團隊無論身處何地,都能可靠且低延遲地存取所需的開源模型。
