AI加速

借助阿里云GPU技术,加速AI业务与AI模型训练和推理,按需定制,提升AI基础设施与运维效率。

概述

AI服务所依赖的机器学习技术发展离不开数据、算法和算力三大要素。阿里云AI加速解决方案凭借领先的数据集和GPU加速器,协调数据密集型应用,优化GPU实例利用率,加速AI模型训练和推理任务。您还可以使用阿里云可定制的云原生AI训练平台,根据业务需求进行定制,提升AI基础设施效率和日常运维水平。

下载白皮书  

方案亮点

  • 高性价比原子加速

    借助极速GPU加速器 AIACC 加速AI模型训练与推理,据 Stanford DAWN深度学习基准测试,AI训练模型加速70%,推理加速2-3倍,同时降低成本。

  • 高效GPU利用

    借助GPU集群调度共享同一 GPU 的资源,提升集群内所有GPU的利用率,并通过GPU隔离机制彻底消除应用间的相互干扰

  • CNCF认证的数据集加速器

    借助面向数据密集型应用的分布式数据集编排与加速器 Fluid,解决AI训练中的高访问延迟、多数据源并行访问复杂及数据隔离薄弱等问题。

  • 可定制AI训练平台

    利用 阿里云-Native AI Suite 构建和定制云原生AI训练平台,提供开发与运维控制台,提升深度学习全流程的AI工程效率。

工作原理

阿里云AI加速解决方案包含云原生AI套件层、AI作业调度层、AI数据加速层、AI计算加速引擎层、资源调度层和计算资源层。各层针对不同场景的AI应用特点,提供相应的加速方案。
云原生AI套件:简化底层服务和组件的运维,监控GPU资源利用率,采集并分析AI作业日志。支持通过命令行提交AI作业和查看模型训练调度计划。
AI作业调度:调度AI作业以加速模型训练,提高GPU利用率,降低成本。
AIACC:利用TensorFlow、PyTorch、MXNet、Caffe等深度学习框架进行图像分类,实现图像识别、点击率预测、自然语言处理、语音识别、人脸识别等。
数据加速:采用存算分离架构,数据存储在不同设备的本地环境中,模型训练在阿里云上执行。小文件数据在训练前预热,提升传输和训练效率。
资源调度:通过多个AI作业共享GPU资源,以及单个AI作业跨多GPU分布式训练,提高GPU利用率并降低成本。
计算资源-GPU:使用cGPU以容器方式管理和调度GPU显存和算力,加速AI训练和推理。

借助cGPU实现高GPU利用率

借助cGPU以容器化方式管理和调度GPU显存与算力,最大化GPU利用率并降低成本。

了解更多

应用场景

图像识别

MXNet + SyncBN分布式训练,性能提升50%

NLP

自然语言处理分布式训练,性能提升6倍

语音识别

语音实时转文字,文本同步发送至学生端并在屏幕上显示。

CTR(点击通过率)

分布式训练,性能提升6.6倍

特惠

GPU 云服务器

基于GPU技术的强大并行计算能力。

15% OFF

• 深度学习

• 视频处理

• 科学计算

9164.190美元/年

文件存储NAS

面向ECS实例、HPC及容器服务的弹性可扩展网络存储。

25% OFF

• 按量付费

• 容量型NAS文件系统

• 性能型NAS文件系统

4.14美元 起/年

容器镜像服务

提供安全管理与高效分发的企业级容器镜像平台。

• ACR EE Advanced Edition

• 企业级安全

全球加速

1,356.00美元 起/年

Platform for AI

端到端数据挖掘与分析平台

• 可视化界面

• 100+ 算法组件

• 强大算力

0.00美元 起/任务/小时

安全合规

致力于在全球主要辖区提供稳定、可靠、安全且合规的云计算基础设施服务。
了解更多
  • CSA STAR
  • ISO 27001
  • SOC2 Type II Report
  • C5
  • 等保2.0
  • MTCS

客户成功案例

“新浪微博通过使用函数计算处理图像文件,持续节省成本。我们不再需要预留大量闲置机器资源来应对高峰时段的流量突增。我们的工程师无需在监控服务器状态等基础设施管理上浪费时间,而是能够专注于与产品团队合作,提升业务价值。”

新浪微博是一个社交媒体平台,致力于帮助用户建立更紧密的连接。它为用户提供了一种简单而全新的方式,实时发布内容,通过广泛传播且富有信息量的内容与彼此互动,连接全球用户。

相关资源

白皮书

AI加速白皮书

本白皮书全面介绍AI基础设施层的机制及其如何支持AI加速。

了解更多 >

最佳实践

cGPU(GPU共享)助力AI推理

本文介绍在ACK环境中部署cGPU组件的流程。

了解更多 >

最佳实践

AI加速演示 - AIACC + ACK(TensorFlow)

本演示借助运行在ACK(K8s)上的AI加速引擎AIACC,使用TensorFlow 2.4训练ImageNet数据,加速AI训练。

了解更多 >

最佳实践

AI加速演示 - AIACC(TensorFlow)

本解决方案借助AI加速引擎AIACC,使用TensorFlow 2.4训练ImageNet数据,加速AI训练。

了解更多 >

最佳实践

AI加速演示 - AIACC + ACK(PyTorch)

本解决方案借助运行在ACK(K8s)上的AI加速引擎AIACC,使用PyTorch 1.9训练ImageNet数据,加速AI训练。

了解更多 >

在线课程

借助AIACC加速深度学习任务

本演示展示如何在不修改现有TensorFlow代码的情况下实现18%-74%的性能提升,并通过标准MNIST手写数字数据集和COVID-19胸部X光样本展示AIACC的加速能力。

了解更多 >

开启阿里云解决方案

学习和体验阿里云的强大能力。

联系销售