高GPU利用率cGPU方案

以容器方式管理和调度GPU显存与算力,最大化GPU利用率,节省算力成本。

概览

阿里云容器GPU(cGPU)将GPU的显存和算力进行分段管理,以多个隔离容器的形式透明管理这些资源。您可以在阿里云、Amazon Web Services(AWS)、Google Compute Engine(GCE)或数据中心上部署的容器集群中开启cGPU,并根据AI推理或训练任务的需求,在阿里云容器服务Kubernetes版(ACK)中灵活定制GPU共享和调度策略,优化资源利用率,降低成本。

方案亮点

  • 高效的GPU显存隔离

    借助阿里云宿主机内核的虚拟GPU隔离技术,将GPU显存和计算资源分段管理为多个容器,最大化GPU利用率并防止内存冲突。

  • 灵活的GPU资源共享与调度

    根据不同业务场景的调度策略,将GPU显存和计算资源分配给AI作业,最大化GPU利用率,同时为容器保持高性能。

  • 可定制的GPU自动扩缩容

    将GPU利用率、显存使用率等关键指标设为触发条件,实现GPU实例自动扩缩容,提高GPU资源可用性,保障AI任务稳定运行。

  • 实时可视化GPU监控

    借助Prometheus集群和节点仪表板,实时可视化查看显存分配、使用率、GPU温度等关键指标,维护GPU实例健康状态,均衡资源配置。

借助阿里云cGPU提升GPU利用率

开始一对一咨询

工作原理

您的挑战

当AI推理等多个任务需要在同一个GPU上运行时,GPU始终被单个任务独占,显存被完全占用但大部分计算资源处于空闲状态,导致GPU利用率低下。

我们的方案

  • 阿里云cGPU支持在单个GPU上运行多个GPU容器,各容器中的应用相互隔离。虚拟GPU由宿主机内核驱动,为各容器提供隔离的显存和算力。分配给每个容器的GPU资源相互隔离,避免运行冲突和安全风险。cGPU兼容开源Kubernetes和NVIDIA Docker,可部署在不同类型的阿里云GPU加速实例上,也可部署在阿里云容器服务Kubernetes版(ACK)中以支持GPU共享。

弹性GPU服务

基于GPU技术的强大并行计算能力

了解更多

ECS第七代

标配TPM芯片,实例算力提升高达40%

了解更多

ECS裸金属实例

兼具虚拟服务器的弹性与物理服务器的高性能和全面特性

了解更多

您的挑战

当前市场上的GPU共享方案要么依赖API修改,需要重新编译应用,要么无法隔离已分配的GPU资源,导致GPU报错和应用崩溃。Kubernetes默认调度功能也无法为AI作业分配合适的运行节点。

我们的方案

  • ACK支持多个容器共享单个GPU的资源。您可以在应用实时监控服务(ARMS)控制台中监控GPU使用情况,并根据容器工作负载的需求为每个容器组配置GPU显存,最大化资源利用率并降低成本。针对AI推理和训练等不同业务场景的作业,可配置相应的AI作业调度策略以提高任务效率和GPU利用率。例如,选择binpack调度策略将作业分配到同一节点直至资源不足,避免跨服务器数据传输和资源碎片。或者选择gang调度策略,仅在作业的所有子任务都能获取所需资源时才分配资源,避免因资源死锁导致任务失败和资源浪费。

阿里云容器服务Kubernetes版

在云端运行容器化应用,助力企业提升效率

了解更多

应用实时监控服务

以全面监控为基础,构建实时响应的业务监控能力

了解更多

安全与合规

致力于在全球主要地域提供稳定、可靠、安全、合规的云计算基础设施服务。
了解更多
  • CSA STAR
  • ISO 27001
  • SOC2 Type II报告
  • C5
  • 等保2.0
  • MTCS

借助阿里云cGPU提升GPU利用率

开始一对一咨询

相关资源

白皮书

AI加速白皮书

本白皮书全面介绍AI基础设施层的运行机制,以及如何借助该基础设施实现AI加速。

博客

cGPU技术提升GPU利用率,助力AI提效降本

阿里云推出cGPU容器共享技术,让用户使用容器对底层GPU资源进行细粒度调度。

博客

Kubernetes下的GPU管理与设备插件实现

本文介绍Kubernetes中常用的GPU插件,以及在Docker和Kubernetes环境下使用GPU的方法。

开启阿里云解决方案

了解并体验阿里云的强大能力。

联系销售