概览
阿里云容器GPU(cGPU)将GPU的显存和算力进行分段管理,以多个隔离容器的形式透明管理这些资源。您可以在阿里云、Amazon Web Services(AWS)、Google Compute Engine(GCE)或数据中心上部署的容器集群中开启cGPU,并根据AI推理或训练任务的需求,在阿里云容器服务Kubernetes版(ACK)中灵活定制GPU共享和调度策略,优化资源利用率,降低成本。
借助阿里云cGPU提升GPU利用率
开始一对一咨询工作原理
您的挑战
当AI推理等多个任务需要在同一个GPU上运行时,GPU始终被单个任务独占,显存被完全占用但大部分计算资源处于空闲状态,导致GPU利用率低下。
我们的方案
-
阿里云cGPU支持在单个GPU上运行多个GPU容器,各容器中的应用相互隔离。虚拟GPU由宿主机内核驱动,为各容器提供隔离的显存和算力。分配给每个容器的GPU资源相互隔离,避免运行冲突和安全风险。cGPU兼容开源Kubernetes和NVIDIA Docker,可部署在不同类型的阿里云GPU加速实例上,也可部署在阿里云容器服务Kubernetes版(ACK)中以支持GPU共享。
您的挑战
当前市场上的GPU共享方案要么依赖API修改,需要重新编译应用,要么无法隔离已分配的GPU资源,导致GPU报错和应用崩溃。Kubernetes默认调度功能也无法为AI作业分配合适的运行节点。
我们的方案
-
ACK支持多个容器共享单个GPU的资源。您可以在应用实时监控服务(ARMS)控制台中监控GPU使用情况,并根据容器工作负载的需求为每个容器组配置GPU显存,最大化资源利用率并降低成本。针对AI推理和训练等不同业务场景的作业,可配置相应的AI作业调度策略以提高任务效率和GPU利用率。例如,选择binpack调度策略将作业分配到同一节点直至资源不足,避免跨服务器数据传输和资源碎片。或者选择gang调度策略,仅在作业的所有子任务都能获取所需资源时才分配资源,避免因资源死锁导致任务失败和资源浪费。
-
CSA STAR -
ISO 27001 -
SOC2 Type II报告 -
C5 -
等保2.0 -
MTCS
