概述
AI服务所依赖的机器学习技术发展离不开数据、算法和算力三大要素。阿里云AI加速解决方案凭借领先的数据集和GPU加速器,协调数据密集型应用,优化GPU实例利用率,加速AI模型训练和推理任务。您还可以使用阿里云可定制的云原生AI训练平台,根据业务需求进行定制,提升AI基础设施效率和日常运维水平。
下载白皮书方案亮点
-
高性价比原子加速
借助极速GPU加速器 AIACC 加速AI模型训练与推理,据 Stanford DAWN深度学习基准测试,AI训练模型加速70%,推理加速2-3倍,同时降低成本。
-
高效GPU利用
借助GPU集群调度共享同一 GPU 的资源,提升集群内所有GPU的利用率,并通过GPU隔离机制彻底消除应用间的相互干扰
-
CNCF认证的数据集加速器
借助面向数据密集型应用的分布式数据集编排与加速器 Fluid,解决AI训练中的高访问延迟、多数据源并行访问复杂及数据隔离薄弱等问题。
-
可定制AI训练平台
利用 阿里云-Native AI Suite 构建和定制云原生AI训练平台,提供开发与运维控制台,提升深度学习全流程的AI工程效率。
工作原理
阿里云AI加速解决方案包含云原生AI套件层、AI作业调度层、AI数据加速层、AI计算加速引擎层、资源调度层和计算资源层。各层针对不同场景的AI应用特点,提供相应的加速方案。
云原生AI套件:简化底层服务和组件的运维,监控GPU资源利用率,采集并分析AI作业日志。支持通过命令行提交AI作业和查看模型训练调度计划。
AI作业调度:调度AI作业以加速模型训练,提高GPU利用率,降低成本。
AIACC:利用TensorFlow、PyTorch、MXNet、Caffe等深度学习框架进行图像分类,实现图像识别、点击率预测、自然语言处理、语音识别、人脸识别等。
数据加速:采用存算分离架构,数据存储在不同设备的本地环境中,模型训练在阿里云上执行。小文件数据在训练前预热,提升传输和训练效率。
资源调度:通过多个AI作业共享GPU资源,以及单个AI作业跨多GPU分布式训练,提高GPU利用率并降低成本。
计算资源-GPU:使用cGPU以容器方式管理和调度GPU显存和算力,加速AI训练和推理。
应用场景

图像识别
MXNet + SyncBN分布式训练,性能提升50%

NLP
自然语言处理分布式训练,性能提升6倍

语音识别
语音实时转文字,文本同步发送至学生端并在屏幕上显示。

CTR(点击通过率)
分布式训练,性能提升6.6倍
特惠
-
CSA STAR -
ISO 27001 -
SOC2 Type II Report -
C5 -
等保2.0 -
MTCS
相关资源
最佳实践
AI加速演示 - AIACC + ACK(TensorFlow)
本演示借助运行在ACK(K8s)上的AI加速引擎AIACC,使用TensorFlow 2.4训练ImageNet数据,加速AI训练。
了解更多 >最佳实践
AI加速演示 - AIACC + ACK(PyTorch)
本解决方案借助运行在ACK(K8s)上的AI加速引擎AIACC,使用PyTorch 1.9训练ImageNet数据,加速AI训练。
了解更多 >在线课程
借助AIACC加速深度学习任务
本演示展示如何在不修改现有TensorFlow代码的情况下实现18%-74%的性能提升,并通过标准MNIST手写数字数据集和COVID-19胸部X光样本展示AIACC的加速能力。
了解更多 >