EPL(Easy Parallel Library)是分布式模型训练框架,集成多种训练优化技术,通过简单API即可实现各种并行化策略。您可以使用EPL实现低成本、高性能分布式模型训练。在DLC中使用EPL可以加速分布式TensorFlow训练。
前提条件
开始操作前,请确认已完成以下准备工作:
-
已为DLC服务关联角色授权,详情请参见云产品依赖与授权:DLC。
-
已安装镜像环境:官方镜像或社区镜像(NVIDIA TensorFlow 1.15或TensorFlow-GPU 1.15)。
-
使用官方镜像(官方镜像(由PAI团队提供优化的镜像)时,EPL已预装,无需单独安装。
-
使用社区镜像(社区镜像(由社区提供的标准镜像))时,需先安装EPL。安装方法请参见安装EPL。
说明在DLC平台中,建议选择社区镜像:
tensorflow-training:1.15-gpu-py36-cu100-ubuntu18.04。可在DLC中提交命令安装EPL,无需单独安装。 -
步骤一:代码配置
您可以使用EPL编写TensorFlow分布式训练代码,详情请参见快速开始。
也可使用EPL代码示例快速开始分布式TensorFlow训练。本方案使用ResNet-50训练数据配置代码集,提交TensorFlow训练任务时自动克隆最新版本。配置代码集步骤如下。
步骤二:启动训练任务
-
进入新建任务页面。
-
登录PAI控制台,在页面上方选择目标地域,并在右侧选择目标工作空间,然后单击进入DLC。
-
在分布式训练(DLC)页面,单击新建任务。
-
-
在新建任务页面,配置以下关键参数,其他参数请参见创建训练任务。然后单击确定。
-
在基本信息区域,自定义任务名称。
-
在环境信息区域,配置以下参数。
参数
使用示例值
节点镜像
选择官方镜像>tensorflow-training:1.15-gpu-py36-cu100-ubuntu18.04。
启动命令
apt update apt install libnccl2 libnccl-dev cd /root/code/EasyParallelLibrary/ pip install . cd examples/resnet bash scripts/train_dp.sh代码配置
在在线配置下拉选项中选择在步骤一中配置的代码集,并配置分支为main。
-
在资源信息区域,配置以下参数。
参数
使用示例值
资源来源
选择公共资源。
框架
选择TensorFlow。
任务资源
在Worker节点配置以下参数:
-
节点数量:配置为2(2个Worker节点可满足基础分布式训练需求,可根据训练规模调整)。
-
资源规格:选择GPU规格ecs.gn6v-c8g1.2xlarge。
最长运行时长
配置为2小时。
-
-
任务资源配置参数配置如下所示。
参数
使用示例值
节点数量
配置为2(可根据训练规模调整)。
节点配置
在GPU实例页签选择ecs.gn6v-c8g1.2xlarge。
最长运行时长
2小时。
-
-
在分布式训练任务列表中,单击目标任务名称进入详情页面,查看任务执行情况。操作详情请参见查看训练详情。
相关文档
-
了解EPL更多内容,请参见EPL。
-
了解DLC更多内容,请参见分布式训练(DLC)。