高GPU利用率cGPU方案

以容器方式管理和調度GPU顯存與算力,最大化GPU利用率,節省算力成本。

概覽

阿里雲容器GPU(cGPU)將GPU的顯存和算力進行分段管理,以多個隔離容器的形式透明管理這些資源。您可以在阿里雲、Amazon Web Services(AWS)、Google Compute Engine(GCE)或資料中心上部署的容器叢集中開啟cGPU,並根據AI推理或訓練任務的需求,在阿里雲Container ServiceKubernetes版(ACK)中靈活定製GPU共用和調度策略,最佳化資源使用率,降低成本。

方案亮點

  • 高效的GPU顯存隔離

    藉助阿里雲宿主機核心的虛擬GPU隔離技術,將GPU顯存和計算資源分段管理為多個容器,最大化GPU利用率並防止記憶體衝突。

  • 靈活的GPU資源共用與調度

    根據不同業務情境的調度策略,將GPU顯存和計算資源分派給AI作業,最大化GPU利用率,同時為容器保持高效能。

  • 可定製的GPU自動擴縮容

    將GPU利用率、顯存使用率等關鍵計量設為觸發條件,實現GPU執行個體自動擴縮容,提高GPU資源可用性,保障AI任務穩定運行。

  • 即時可視化GPU監控

    藉助Prometheus叢集和節點儀表板,即時可視化查看顯存分配、使用率、GPU溫度等關鍵計量,維護GPU執行個體健康狀態,均衡資源配置。

藉助阿里雲cGPU提升GPU利用率

開始一對一諮詢

工作原理

您的挑戰

當AI推理等多個任務需要在同一個GPU上運行時,GPU始終被單個任務獨佔,顯存被完全佔用但大部分計算資源處於空閑狀態,導致GPU利用率低下。

我們的方案

  • 阿里雲cGPU支援在單個GPU上運行多個GPU容器,各容器中的應用相互隔離。虛擬GPU由宿主機核心驅動,為各容器提供隔離的顯存和算力。分配給每個容器的GPU資源相互隔離,避免運行衝突和安全風險。cGPU相容開源Kubernetes和NVIDIA Docker,可部署在不同類型的阿里雲GPU加速執行個體上,也可部署在阿里雲Container ServiceKubernetes版(ACK)中以支援GPU共用。

彈性GPU服務

基於GPU技術的強大並行計算能力

瞭解更多

ECS第七代

標配TPM晶片,執行個體算力提升高達40%

瞭解更多

ECS裸金屬執行個體

兼具虛擬伺服器的彈性與物理伺服器的高效能和全面特性

瞭解更多

您的挑戰

當前市場上的GPU共用方案要麼依賴API修改,需要重新編譯應用,要麼無法隔離已指派的GPU資源,導致GPU報錯和應用崩潰。Kubernetes預設調度功能也無法為AI作業分配合適的運行節點。

我們的方案

  • ACK支援多個容器共用單個GPU的資源。您可以在應用即時監控服務(ARMS)控制台中監控GPU使用方式,並根據容器工作負載的需求為每個容器組配置GPU顯存,最大化資源使用率並降低成本。針對AI推理和訓練等不同業務情境的作業,可配置相應的AI作業調度策略以提高任務效率和GPU利用率。例如,選擇binpack調度策略將作業分配到同一節點直至資源不足,避免跨伺服器資料轉送和資源片段。或者選擇gang調度策略,僅在作業的所有子任務都能擷取所需資源時才分配資源,避免因資源死結導致任務失敗和資源浪費。

阿里雲Container ServiceKubernetes版

在雲端運行容器化應用,助力企業提升效率

瞭解更多

應用即時監控服務

以全面監控為基礎,構建即時響應的業務監控能力

瞭解更多

安全與合規

致力於在全球主要地區提供穩定、可靠、安全、合規的雲端運算基礎設施服務。
瞭解更多
  • CSA STAR
  • ISO 27001
  • SOC2 Type II報告
  • C5
  • 等保2.0
  • MTCS

藉助阿里雲cGPU提升GPU利用率

開始一對一諮詢

相關資源

白皮書

AI加速白皮書

本白皮書全面介紹AI基礎設施層的運行機制,以及如何藉助該基礎設施實現AI加速。

部落格

cGPU技術提升GPU利用率,助力AI提效降本

阿里雲推出cGPU容器共用技術,讓使用者使用容器對底層GPU資源進行細粒度調度。

部落格

Kubernetes下的GPU管理與裝置外掛程式實現

本文介紹Kubernetes中常用的GPU外掛程式,以及在Docker和Kubernetes環境下使用GPU的方法。

開啟阿里雲解決方案

瞭解並體驗阿里雲的強大能力。

聯絡我們