全部产品
Search
文档中心

人工智能平台 PAI:分布式深度学习训练加速(EPL)

更新时间:Aug 12, 2026

EPL(Easy Parallel Library)是分布式模型训练框架,集成多种训练优化技术,通过简单API即可实现各种并行化策略。您可以使用EPL实现低成本、高性能分布式模型训练。在DLC中使用EPL可以加速分布式TensorFlow训练。

前提条件

开始操作前,请确认已完成以下准备工作:

步骤一:代码配置

您可以使用EPL编写TensorFlow分布式训练代码,详情请参见快速开始。

也可使用EPL代码示例快速开始分布式TensorFlow训练。本方案使用ResNet-50训练数据配置代码集,提交TensorFlow训练任务时自动克隆最新版本。配置代码集步骤如下。

  1. 进入代码配置页面。

    1. 登录PAI 控制台。

    2. 在左侧导航栏单击工作空间列表,在工作空间列表页面,单击待操作的工作空间名称,进入工作空间。

    3. 在工作空间页面的左侧导航栏选择AI资产管理 > 代码配置,进入代码配置页面。

  2. 在代码配置页面,单击新建代码配置。

  3. 在新建代码配置页面配置参数,并单击提交。

    其中Git地址填写https://github.com/alibaba/EasyParallelLibrary.git,代码分支填写main。其他参数请参见代码配置。

步骤二:启动训练任务

  1. 进入新建任务页面。

    1. 登录PAI控制台,在页面上方选择目标地域,并在右侧选择目标工作空间,然后单击进入DLC。

    2. 在分布式训练(DLC)页面,单击新建任务。

  2. 在新建任务页面,配置以下关键参数,其他参数请参见创建训练任务。然后单击确定。

    • 在基本信息区域,自定义任务名称。

    • 在环境信息区域,配置以下参数。

      参数

      使用示例值

      节点镜像

      选择官方镜像>tensorflow-training:1.15-gpu-py36-cu100-ubuntu18.04。

      启动命令

      apt update
      apt install libnccl2 libnccl-dev
      cd /root/code/EasyParallelLibrary/
      pip install .
      cd examples/resnet
      bash scripts/train_dp.sh

      代码配置

      在在线配置下拉选项中选择在步骤一中配置的代码集,并配置分支为main。

    • 在资源信息区域,配置以下参数。

      参数

      使用示例值

      资源来源

      选择公共资源。

      框架

      选择TensorFlow。

      任务资源

      在Worker节点配置以下参数:

      • 节点数量:配置为2(2个Worker节点可满足基础分布式训练需求,可根据训练规模调整)。

      • 资源规格:选择GPU规格ecs.gn6v-c8g1.2xlarge。

      最长运行时长

      配置为2小时。

    • 任务资源配置参数配置如下所示。

      参数

      使用示例值

      节点数量

      配置为2(可根据训练规模调整)。

      节点配置

      在GPU实例页签选择ecs.gn6v-c8g1.2xlarge。

      最长运行时长

      2小时。

  3. 在分布式训练任务列表中,单击目标任务名称进入详情页面,查看任务执行情况。操作详情请参见查看训练详情。

相关文档