EPL(Easy Parallel Library)是分布式模型訓練架構,整合多種訓練最佳化技術,通過簡單API即可實現各種並行化策略。您可以使用EPL實現低成本、高效能分布式模型訓練。在DLC中使用EPL可以加速分布式TensorFlow訓練。
前提條件
開始操作前,請確認已完成以下準備工作:
-
已為DLC服務關聯角色授權,詳情請參見雲產品依賴與授權:DLC。
-
已安裝鏡像環境:官方鏡像或社區鏡像(NVIDIA TensorFlow 1.15或TensorFlow-GPU 1.15)。
-
使用官方鏡像(官方鏡像(由PAI團隊提供最佳化的鏡像)時,EPL已預裝,無需單獨安裝。
-
使用社區鏡像(社區鏡像(由社區提供的標準鏡像))時,需先安裝EPL。安裝方法請參見安裝EPL。
說明在DLC平台中,建議選擇社區鏡像:
tensorflow-training:1.15-gpu-py36-cu100-ubuntu18.04。可在DLC中提交命令安裝EPL,無需單獨安裝。 -
步驟一:代碼配置
您可以使用EPL編寫TensorFlow分布式訓練代碼,詳情請參見快速開始。
也可使用EPL程式碼範例快速開始分布式TensorFlow訓練。本方案使用ResNet-50訓練資料配置代碼集,提交TensorFlow訓練任務時自動複製最新版本。配置代碼集步驟如下。
步驟二:啟動訓練任務
-
進入建立任務頁面。
-
登入PAI控制台,在頁面上方選擇目標地區,並在右側選擇目標工作空間,然後單擊进入DLC。
-
在分布式訓練(DLC)頁面,單擊新建任务。
-
-
在新建任务頁面,配置以下關鍵參數,其他參數請參見建立訓練任務。然後單擊确定。
-
在基本信息地區,自訂任務名稱。
-
在环境信息地區,配置以下參數。
參數
使用樣本值
节点镜像
選擇官方镜像>tensorflow-training:1.15-gpu-py36-cu100-ubuntu18.04。
启动命令
apt update apt install libnccl2 libnccl-dev cd /root/code/EasyParallelLibrary/ pip install . cd examples/resnet bash scripts/train_dp.sh代码配置
在線上配置下拉選項中選擇在步驟一中配置的代碼集,並配置分支為main。
-
在资源信息地區,配置以下參數。
參數
使用樣本值
资源来源
選擇公共资源。
框架
選擇TensorFlow。
任务资源
在Worker節點配置以下參數:
-
节点数量:配置為2(2個Worker節點可滿足基礎分布式訓練需求,可根據訓練規模調整)。
-
资源规格:選擇GPU規格ecs.gn6v-c8g1.2xlarge。
最長運行時間長度
配置為2小時。
-
-
任务资源配置參數配置如下所示。
參數
使用樣本值
节点数量
配置為2(可根據訓練規模調整)。
节点配置
在GPU執行個體頁簽選擇ecs.gn6v-c8g1.2xlarge。
最長運行時間長度
2小時。
-
-
在分布式訓練工作清單中,單擊目標任務名稱進入詳情頁面,查看任務執行情況。操作詳情請參見查看訓練詳情。
相關文檔
-
瞭解EPL更多內容,請參見EPL。
-
瞭解DLC更多內容,請參見分布式訓練(DLC)。