全部產品
Search
文件中心

智能計算靈駿:智能計算靈駿簡介

更新時間:Jun 13, 2026

智能計算靈駿專為人工智慧情境而設計,提供穩定高效、高擴充性的AI計算公用雲端服務。靈駿支援十萬卡級的高效能網路擴充能力,單任務可支援萬卡規模擴充性,產品提供營運管控、叢集任務管理等功能,實現開箱即用。為大模型/AIGC、自動駕駛、搜尋推薦、科學智能、金融量化等行業、領域提供大規模高密度的算力支撐,搭配全面覆蓋的監控和故障自愈處置能力,為您的業務提供集高效能、高擴充性與高穩定性於一體的創新底座,在AI時代贏得先發優勢。

核心優勢

  • 訓練推理融合的超大規模叢集

    專為當下與未來AI大模型設計,支援十萬卡級大規模叢集快速部署與管理,相容主流深度學習架構。靈駿採用高效能網路架構(HPN, High Performance Network)解決擴充性難題,單層網路可以實現千卡級擴充,兩層網路可以實現萬卡級擴充,具備高可擴充性與強穩定性,為AGI時代的大模型研發提供強大算力支撐。

  • 穩定可靠

    基於任務並行策略,通過硬體架構與平台層軟體對穩定性進行雲產品聯動自愈設計與系統性的最佳化,提供精細化的故障事件發現能力,支援對節點、GPU卡、調度服務等各層面健康狀態即時監控與異常處理,降低故障發生機率和故障影響面,提升任務的魯棒性。整體具備分鐘級的故障親和恢複能力,故障發現率超98%,有效支撐萬億參數MoE大模型訓練擷取超過 99%訓練有效時間長度。

  • 多種形態靈活的儲存搭配

    通過 RDMA 高吞吐、低延遲的資料訪問通路,利用分布式並行檔案系統CPFS,確保萬卡叢集在訓練過程中能持續高效地擷取訓練樣本。利用高效能低時延的緩衝能力,滿足資料預先載入、Checkpoint儲存等情境的儲存效能要求,同時可以結合EBS、OSS等產品,滿足塊、對象等多規格、多類型的資料存放區需求。可通過快速規格切換實現不同的儲存訪問模式,無需退租。儲存流量和計算流量分離,支援非同步checkpoint叢集級通訊最佳化,避免儲存流量幹擾計算流量造成並行通訊抖動。

  • 算力基石

    提供裸金屬執行個體(叢集)與容器執行個體等算力形態,實現AI計算資源的標準化與規模化。其中裸金屬執行個體規格,具備等效的通訊互聯能力,搭配最新一代CPU,可提供支援GPU Direct Storage的充沛本地碟資源;支援標準化的 K8s 介面和容器網路方案,同時可結合安全容器對計算儲存網路進行資源虛擬化,為上層平台應用提供池化的智能算力,部分情境資源使用率可提升3倍。

產品功能

以萬卡並行算力支撐AI應用持續創新

  • 應用情境

    智能計算靈駿主要用於支援基本模型大規模訓練、MoE多模態模型訓練及微調、上至萬億參數規模模型並行推理等面向未來的AI並行計算情境應用,以每秒數百億億次浮點計算效能(EFLOPS),軟硬一體設計使得在相同空間下提供更強效能與更高穩定性,支援基本模型、自動駕駛、科學智能、金融科技、搜尋推薦等行業持續創新。

  • 超大規模無收斂架構

    以AI應用效能和任務穩定性為核心設計,以物理頻寬和拓撲為基礎實現網路擁塞控制,結合通訊庫實現流量負載最佳化,端到端時延低至2us。 基於端網協同的思想,對網路叢集進行架構設計、網路拓撲、直接選取、流量控制等系統性最佳化,實現超大規模線性擴充,可實現 96%以上的萬卡規模顯性擴充度以及網路穩態運行,同時支援叢集十萬卡層級超大規模Scale-up&Scale-out融合擴充。同時,對叢集內資料交換和互聯資源統籌,通過系統性的調優逼近系統的吞吐效能極限,提升系統的魯棒性。

  • 開服地區

    智能計算靈駿支援的地區有:華東1(杭州)、華北2(北京)、華東2(上海)、華南1(深圳)、華南3(廣州)、西北2(中衛)、華北5(呼和浩特)、華北3(張家口)、華北6(烏蘭察布)、華南2(河源)、中國香港、新加坡、日本(東京)、美國(亞特蘭大)、德國(法蘭克福)、馬來西亞(柔佛州)、馬來西亞(吉隆坡)、阿聯酋(杜拜)、泰國(曼穀)。當前智能計算靈駿可提供訂用帳戶(固定周期)和按量的計費模式,您需要向阿里雲銷售團隊申請資源使用。

高效能的智能計算執行個體

  • 多元GPU卡型的靈駿加速計算執行個體支援

    智能計算靈駿作為面向加速計算情境的裸金屬叢集服務,基於靈駿的異構計算執行個體,擁有GPU(Graphic Processing Unit)及高速片間互聯,高速網路互聯等特性,整體架構基於 Scale-up domain 維度進行設計,即靈駿加速計算執行個體內的所有 GPU 全部享受高速片間互聯,同時每張 GPU 卡都支援在叢集維度內 RDMA 等效互聯通訊,此外,執行個體支援 balanced 部署 GPU, 本地 NVMe,以及高效能 RDMA 網卡,實現 numa 親和等特性。

  • 標準化K8s、Serverless的容器執行個體支援與AI情境最佳化

    叢集部署就緒,您可以按需通過ACS Serverless化的容器執行個體,K8s叢集服務來使用容器化的GPU算力,此外,K8s已經完成對於CPU、GPU等異構資源的抽象與編排,並且針對AI情境,產品也提供了包括運算元最佳化、PD分離、EP並行部署與負載平衡、Cache-aware的調度等能力上的增強,同時也支援了按需掛載儲存與使用網路能力。

  • 高效能的資料存放區訪問能力

    為了滿足訓練情境高速Checkpoint儲存和智算業務的極致資料載入需求,智能計算靈駿可支援基於RDMA的高效能分布式檔案儲存體CPFS的靈活掛載,同時支援 VPC/EBS 端側可卸載能力,實現標準的雲產品互訪互連。

自動化的叢集管理

  • 多維聯動的叢集管理能力,自動化的叢集管理能力

    智能計算靈駿產品支援靈駿裸金屬節點的分配與資源集區化的調度能力,叢集可支援使用阿里雲原生 K8s 產品如ACK作為Lark服務,使用CPFS作為高效能並行檔案儲存體,支援使用EBS作為系統硬碟/資料盤,支援使用PAI作為人工智慧平台服務,支援對接ARMS Prometheus監控能力,整個叢集的部署過程一鍵完成,高效能智算叢集分鐘級就緒。

  • 故障自愈系統保障並行計算任務穩定性

    靈駿故障自愈系統是基於豐富的監控體系構建的對客保障能力和自動化自愈處理,覆蓋靈駿的 OS/GPU/高效能網路/DPU 等多維故障。並實現故障精細化消費策略與自動化故障冷遷移能力,最大限度減少使用者的不可用時間長度。同時靈駿構建了用於檢測智算叢集整體健康情況的自動化巡檢平台,實現了覆蓋GPU異構算力及節點間集合通訊的多維度叢集健康狀態周期檢測能力,可對機器進行單機檢測/兩機檢測/多節點叢集等多種模式的持續檢測。真正做到事前預防(降低發生機率),事後容錯(提升問題處理效率,降低訓練算力損失),逐步推進故障左移策略。

全面的叢集監控能力

  • 可觀測能力與營運能力

    靈駿在管控台提供了監控資料大盤展示,包括GPU異構計算資源、秒級的 RDMA 高效能網路監控警示、故障定位能力等,同時也支援動作記錄、營運任務展示,此外還支援了資源與環境的資訊展示,方便使用者瞭解整個叢集的資源使用與運行情況。基於監控資料基礎,靈駿還支援白屏化的基礎營運能力,例如系統重啟、叢集與節點營運診斷、web終端能力。

購買與計費

  • 產品購買:請先向銷售經理提交資源需求,然後再通過靈駿控制台購買節點資源。詳細流程請參見購買靈駿節點

  • 產品計費:智能計算靈駿包含訂用帳戶(固定周期)和隨用隨付模式。計費詳情請參見計費說明

使用方法

在購買靈駿計算節點後需要以叢集方式使用資源,詳情請參見建立靈駿基礎叢集