EAS(Elastic Algorithm Service)將訓練好的模型部署為線上推理服務或AI-Web應用。EAS支援異構資源,結合自動擴縮容、一鍵壓測、灰階發布、即時監控等能力,以更低成本保障高並發情境下的服務穩定性。
產品架構

核心能力
EAS覆蓋資源管理、模型部署和服務營運全流程。
靈活的資源與成本管理
異構硬體支援:EAS 是全託管的模型部署與推理服務,並非傳統 ECS 伺服器,底層基於阿里雲彈性計算資源(如 ECS、GPU 執行個體等)構建。支援CPU、GPU及AI專屬GU/PPU等多種異構硬體規格,滿足不同模型的效能需求;您在部署服務時可根據模型需求選擇具體資源配置。
成本最佳化:支援搶佔型執行個體,顯著降低計算成本。通過定時擴縮容,可根據業務周期提前設定策略,精準控制資源投入。
彈性資源集區:當專屬資源組用滿後,可自動將新增執行個體調度至公用資源群組,兼顧成本控制與服務穩定性。
全面的穩定性與高可用保障
彈性擴縮容:根據即時負載自動調整服務副本數量,應對不可預測的流量高峰,避免資源閑置或服務過載。
高可用機制:自動故障恢複,確保服務連續性。專屬資源為物理隔離,無資源搶佔風險。
安全發布:支援灰階發布,按比例分配流量至新版本驗證。支援流量鏡像,將線上流量複製到測試服務驗證可靠性,不影響真實使用者請求。
高效的部署與營運
一鍵壓測:支援動態加壓並自動探測服務效能極限,即時查看秒級監控資料與壓測報告,協助您快速評估服務能力。
即時監控:提供QPS、響應時間長度、CPU利用率等關鍵計量的即時監控,支援開通服務監控警示,全面掌握服務運行狀態。
多種部署方式:支援通過鏡像(推薦)或Processor部署方式部署服務,滿足不同技術棧的需求。
多樣的推理模式
即時同步推理:高吞吐、低延遲,適用於搜尋推薦、對話機器人等對響應延遲敏感的情境。針對大語言模型等產生式模型響應延遲高的問題,非流式輸出需等待全部 Token 產生完畢才返回結果,容易造成高延遲感知;建議開啟流式輸出(Streaming)模式,實現 Token 級即時返回,顯著改善使用者體驗。若開啟流式輸出後效能仍不滿足預期,可嘗試切換至更高配置的公用資源群組機型進行對比測試。
近即時非同步推理:內建訊息佇列,適用於文圖產生、視頻處理等長耗時任務。根據隊列積壓程度自動擴縮容,避免請求堆積。
離線批量推理:適用於對響應時間長度不敏感的批量處理情境,如語音資料批量轉換。支援搶佔型資源執行個體以降低成本。
使用流程
步驟1:準備工作
準備推理資源:根據模型大小、並發需求和預算,選擇合適的EAS資源類型。資源選型及購買指導請參見EAS部署資源概述。
說明僅公用資源無需提前購買,可直接使用;其他資源類型(EAS資源群組、資源配額)需先購買再使用。
準備檔案:將訓練好的模型、代碼處理檔案及依賴項上傳至OSS等雲端儲存,以便後續通過儲存掛載在服務中使用。OSS 中的模型檔案本身與作業系統無關,Windows 和 Linux 均可下載;但模型部署運行依賴推理架構(如 vLLM、Triton Server 等)的系統支援情況,主流架構優先支援 Linux 環境,Windows 系統需提前確認所用架構的相容性。建議您在部署前查閱對應推理架構的官方文檔,確認系統要求。
步驟2:部署服務
步驟3:調用與壓測服務
步驟4:監控與管理服務
監控與警示:在推理服務列表中查看服務運行狀態、資源群組資訊及服務ID、執行個體標識等資訊,可按資源群組篩選服務。建議開通服務監控警示以即時掌握服務健康情況。
Auto Scaling:根據業務需求配置彈性擴縮容或定時擴縮容策略,動態管理計算資源。您可在 PAI 控制台的 EAS 服務詳情頁面查看當前服務的部署模式配置,區分是常駐執行個體還是Auto Scaling模式:常駐執行個體保持固定副本數運行,Auto Scaling則根據策略動態調整副本數量。
服務更新:在操作列下單擊更新以部署新版本。更新完成後,可查看版本資訊或切換版本。
警告服務更新過程中將暫時中斷運行,可能導致依賴此服務的請求失敗,請謹慎操作。
服務遷移:如需跨地區遷移EAS服務配置,可使用EASCMD命令列工具匯出源地區的服務配置,然後在目標地區使用該配置建立新服務。
重要提示
若EAS服務持續180天處於非運行中狀態,系統將自動刪除該服務。
EAS支援的地區參見地區和可用性區域。
計費說明
詳情參見模型線上服務(EAS)計費說明。
快速開始
情境案例
常見問題
Q:專屬資源 vs 公用資源?
公用資源:適合對成本敏感、可容忍效能波動的開發測試或小規模業務。成本較低,但高峰期可能存在資源爭用。
專屬資源:適合對穩定性和效能有高要求的生產環境。物理隔離無搶佔風險,彈性資源集區特性允許在專屬資源用滿後自動溢出到公用資源,兼顧成本與高峰期穩定性。庫存緊張的機型需通過專屬資源鎖定購買。
Q:EAS相比自建服務有什麼優勢?
EAS提供託管營運:自動處理資源調度、故障恢複和監控,內建Auto Scaling、灰階發布功能。開發人員可專註模型開發,省去營運成本,加速上線。
Q:如何查看EAS服務的執行個體ID或叢集ID?
EAS(模型線上服務(EAS))是模型線上推理服務,並非 ACK 容器叢集,因此不存在傳統意義上的“叢集ID”。如需標識某個服務,請使用服務名稱或服務ID。
查看路徑:登入 PAI 控制台 > 模型線上服務(EAS) > 推理服務列表,在服務列表中可查看服務名稱和ID。
Q:PAI-EAS對部署的模型大小是否有限制?
EAS 本身不設固定的模型大小限制,實際可部署的模型大小取決於所選資源規格的記憶體/顯存容量及儲存掛載空間。建議您根據模型參數量和精度選擇匹配的 GPU/CPU 機型,並通過 OSS 儲存掛載載入大模型檔案。
若模型過大導致載入失敗,可嘗試升級資源規格,或採用模型量化、分區載入等最佳化手段。