全部產品
Search
文件中心

Platform For AI:分布式深度學習訓練加速(EPL)

更新時間:Aug 13, 2026

EPL(Easy Parallel Library)是分布式模型訓練架構,整合多種訓練最佳化技術,通過簡單API即可實現各種並行化策略。您可以使用EPL實現低成本、高效能分布式模型訓練。在DLC中使用EPL可以加速分布式TensorFlow訓練。

前提條件

開始操作前,請確認已完成以下準備工作:

步驟一:代碼配置

您可以使用EPL編寫TensorFlow分布式訓練代碼,詳情請參見快速開始

也可使用EPL程式碼範例快速開始分布式TensorFlow訓練。本方案使用ResNet-50訓練資料配置代碼集,提交TensorFlow訓練任務時自動複製最新版本。配置代碼集步驟如下。

  1. 進入代碼配置頁面。

    1. 登入PAI 控制台

    2. 在左側導覽列單擊工作空间列表,在工作空間列表頁面,單擊待操作的工作空間名稱,進入工作空間。

    3. 在工作空間頁面的左側導覽列選擇AI资产管理 > 代码配置,進入代碼配置頁面。

  2. 代码配置頁面,單擊新建代码配置

  3. 新建代码配置頁面配置參數,並單擊提交

    其中Git地址填寫https://github.com/alibaba/EasyParallelLibrary.git代码分支填寫main。其他參數請參見代碼配置

步驟二:啟動訓練任務

  1. 進入建立任務頁面。

    1. 登入PAI控制台,在頁面上方選擇目標地區,並在右側選擇目標工作空間,然後單擊进入DLC

    2. 在分布式訓練(DLC)頁面,單擊新建任务

  2. 新建任务頁面,配置以下關鍵參數,其他參數請參見建立訓練任務。然後單擊确定

    • 基本信息地區,自訂任務名稱。

    • 环境信息地區,配置以下參數。

      參數

      使用樣本值

      节点镜像

      選擇官方镜像>tensorflow-training:1.15-gpu-py36-cu100-ubuntu18.04

      启动命令

      apt update
      apt install libnccl2 libnccl-dev
      cd /root/code/EasyParallelLibrary/
      pip install .
      cd examples/resnet
      bash scripts/train_dp.sh

      代码配置

      線上配置下拉選項中選擇在步驟一中配置的代碼集,並配置分支main

    • 资源信息地區,配置以下參數。

      參數

      使用樣本值

      资源来源

      選擇公共资源

      框架

      選擇TensorFlow

      任务资源

      在Worker節點配置以下參數:

      • 节点数量:配置為2(2個Worker節點可滿足基礎分布式訓練需求,可根據訓練規模調整)。

      • 资源规格:選擇GPU規格ecs.gn6v-c8g1.2xlarge

      最長運行時間長度

      配置為2小時。

    • 任务资源配置參數配置如下所示。

      參數

      使用樣本值

      节点数量

      配置為2(可根據訓練規模調整)。

      节点配置

      GPU執行個體頁簽選擇ecs.gn6v-c8g1.2xlarge

      最長運行時間長度

      2小時。

  3. 在分布式訓練工作清單中,單擊目標任務名稱進入詳情頁面,查看任務執行情況。操作詳情請參見查看訓練詳情

相關文檔