手動設定深度學習訓練叢集耗時間長度、易出錯。分布式訓練DLC(Deep Learning Containers)基於Kubernetes提供開箱即用的訓練環境,無需配置即可快速啟動訓練任務。支援多種深度學習架構和靈駿智算、GPU等算力資源。
產品優勢
支援多樣算力資源
基於靈駿智算和通用計算資源,支援雲上ECS、ECI、神龍裸金屬和靈駿裸金屬等多種算力形態,實現異構算力的混合調度。
多樣的分布式任務類型
無需搭建叢集,直接提交Megatron、Deepspeed、Pytorch、Tensorflow、MPI及XGBoost等十多種訓練架構的任務。DLC預置多種官方鏡像,也支援自訂運行環境,可通過控制台、SDK或命令列提交任務。
高穩定
在大模型訓練情境中,DLC通過自研的容錯引擎AIMaster、高效能Checkpoint架構EasyCKPT、健康檢測SanityCheck和節點自愈功能,自動檢測和恢複故障,降低算力損失,提升訓練穩定性。
高效能
自研AI訓練加速架構支援資料並行、流水並行、運算元拆分等多種並行策略,並提供並行策略自動探索和顯存最佳化能力。結合拓撲感知調度、梯度分組融合、混合精度通訊等通訊最佳化手段,提升分布式訓練效率。適用於大模型預訓練、持續訓練和Alignment等情境。
應用情境
資料預先處理:支援自訂運行環境,對資料進行離線並行預先處理,降低資料預先處理難度。
大規模分布式訓練:支援多種開源深度學習架構,可使用上千個節點同時訓練,顯著縮短訓練時間。
離線推理:支援使用DLC進行離線推理,提升閑時GPU資源使用率。
資源形態
PAI提供以下兩種資源形態,您可根據算力需求選擇:
靈駿智算:專為大模型訓練設計的高效能算力資源,支援超大規模深度學習任務。適用於大模型訓練、自動駕駛、基礎科研等需要大量計算資源的情境。
通用計算:適用於常規訓練需求,能夠靈活地支援多種規模和類型的機器學習任務。
靈駿智算和通用計算資源支援以下幾種使用方式:
資源配額:通過訂用帳戶提前購買靈駿智算或通用計算資源,適合長期穩定的訓練需求。
公用資源:無需提前購買資源,提交任務時按需使用靈駿智算或通用計算資源,隨用隨付結算。
競價資源:靈駿智算提供競價資源,協助您以較低成本擷取AI算力。
核心功能
任務建立與管理
任務監控與通知
查看訓練任務分析報告:使用TensorBoard可視化訓練指標和分析報告。
使用CloudMonitor或ARMS監控訓練任務:查看DLC任務的資源狀況或配置警示規則。
配置訊息通知:在PAI工作空間的事件中心建立訊息通知規則,即時跟蹤任務狀態變化。
網路與通訊加速
RDMA配置:使用靈駿智算資源時,配置高效能RDMA網路加速節點間通訊。
ACCL:阿里雲高效能集合通訊庫:結合阿里雲網路特點和大模型通訊調優經驗,提供高效能集合通訊,並具備故障診斷和自愈能力。
通過專有網關提升公網訪問速率:為執行個體所在VPC建立公網NAT Gateway並配置SNAT,讓執行個體通過專有公網網關高速訪問互連網。
成本最佳化
彈性與容錯
自動容錯:通過AIMaster監控任務運行狀態,自動檢測並恢複故障。
健康檢測:訓練前檢測資源健康情況,自動隔離故障節點。
EasyCkpt:為PyTorch大模型訓練提供無損的模型儲存和恢複能力,支援斷點續訓。
PerfTracker:線上效能分析診斷工具:線上採集各Worker的CUDA核函數、Python函數執行記錄及硬體監控資料,自動產生分析報告,定位慢節點、瓶頸函數和Hang問題。
計費說明
DLC主要對計算資源計費:
計算資源類型 | 計費方式 | 計費主體 | 計費規則 | 停止計費 |
公用資源 | 隨用隨付 | DLC任務運行時間長度(佔用公用資源的時間長度)。 |
|
|
AI計算資源(通用計算資源和靈駿智算資源) | 訂用帳戶 | 詳情請參見AI計算資源計費說明。 | 詳情請參見AI計算資源計費說明。 | 不涉及 |
更多詳情請參見分布式訓練(DLC)計費說明。
快速入門
以 MNIST 手寫體識別為案例,為您介紹使用DLC進行單機單卡訓練,或多機多卡的分布式訓練,詳情請參見分布式訓練 DLC 快速入門。
擷取協助
查閱DLC常見問題:如果您遇到任務啟動/停止失敗、計費疑問、訓練報錯等問題,請查閱DLC常見問題。
詢問PAI智能助手(小PAI):PAI智能助手(小PAI)針對PAI全鏈路產品功能使用提供詳細說明及使用指引,提供DSW執行個體、DLC任務、EAS服務營運診斷能力,自動診斷失敗原因,提供下一步操作工具/建議。
