概覽
阿里雲容器GPU(cGPU)將GPU的顯存和算力進行分段管理,以多個隔離容器的形式透明管理這些資源。您可以在阿里雲、Amazon Web Services(AWS)、Google Compute Engine(GCE)或資料中心上部署的容器叢集中開啟cGPU,並根據AI推理或訓練任務的需求,在阿里雲Container ServiceKubernetes版(ACK)中靈活定製GPU共用和調度策略,最佳化資源使用率,降低成本。
方案亮點
藉助阿里雲cGPU提升GPU利用率
開始一對一諮詢工作原理
您的挑戰
當AI推理等多個任務需要在同一個GPU上運行時,GPU始終被單個任務獨佔,顯存被完全佔用但大部分計算資源處於空閑狀態,導致GPU利用率低下。
我們的方案
-
阿里雲cGPU支援在單個GPU上運行多個GPU容器,各容器中的應用相互隔離。虛擬GPU由宿主機核心驅動,為各容器提供隔離的顯存和算力。分配給每個容器的GPU資源相互隔離,避免運行衝突和安全風險。cGPU相容開源Kubernetes和NVIDIA Docker,可部署在不同類型的阿里雲GPU加速執行個體上,也可部署在阿里雲Container ServiceKubernetes版(ACK)中以支援GPU共用。
您的挑戰
當前市場上的GPU共用方案要麼依賴API修改,需要重新編譯應用,要麼無法隔離已指派的GPU資源,導致GPU報錯和應用崩潰。Kubernetes預設調度功能也無法為AI作業分配合適的運行節點。
我們的方案
-
ACK支援多個容器共用單個GPU的資源。您可以在應用即時監控服務(ARMS)控制台中監控GPU使用方式,並根據容器工作負載的需求為每個容器組配置GPU顯存,最大化資源使用率並降低成本。針對AI推理和訓練等不同業務情境的作業,可配置相應的AI作業調度策略以提高任務效率和GPU利用率。例如,選擇binpack調度策略將作業分配到同一節點直至資源不足,避免跨伺服器資料轉送和資源片段。或者選擇gang調度策略,僅在作業的所有子任務都能擷取所需資源時才分配資源,避免因資源死結導致任務失敗和資源浪費。
-
CSA STAR -
ISO 27001 -
SOC2 Type II報告 -
C5 -
等保2.0 -
MTCS
