全部產品
Search
文件中心

Platform For AI:SanityCheck:算力健康檢測

更新時間:Jul 24, 2026

算力健康檢測(SanityCheck)在DLC訓練任務啟動前或容錯重啟後,自動檢測GPU算力和通訊效能,隔離故障節點,減少訓練初期因資源問題導致的失敗和算力浪費。

功能介紹

在AI訓練情境,可能會遇到以下問題:

  • 資源故障導致任務中斷與GPU浪費:任務完成初始化後,若資源存在故障,無法開始訓練,需排查問題並重新提交,浪費GPU資源。

  • 效能問題難以定位:訓練效能下降可能由慢節點引起,但缺少快捷的定位手段。資源群組內也缺少便捷可靠的GPU算力和通訊效能基準測試。

DLC提供了算力健康檢測(SanityCheck)功能,用於檢查分布式訓練任務的算力資源健康度與效能。開啟後,系統會全面檢測參與訓練的資源,自動隔離故障節點並觸發營運流程,減少訓練初期的失敗風險。檢測完成後,系統會產生GPU算力和通訊效能報告,協助定位導致效能下降的問題。

使用限制

目前,該功能僅支援使用靈駿智算資源建立的PyTorch訓練任務,且要求任務資源的GPU(卡數)為整機配置。靈駿智算資源目前僅對白名單使用者開放,若有需要,請聯絡您的商務經理。

開啟健康檢測

通過控制台

PAI控制台建立DLC訓練任務時,配置以下參數開啟健康檢測。任務建立後,系統會先檢測資源健康度,再執行訓練。

關鍵參數說明如下:

  • 資源資訊配置:

    參數

    描述

    资源类型

    選擇灵骏智算资源

    资源来源

    選擇资源配额

    资源配额

    選擇已建立的靈駿智算資源配額。如何建立資源配額,請參見建立資源配額

    框架

    選擇PyTorch。

    任务资源

    GPU(卡數)需要是整機配置。

  • 容錯與診斷配置:開啟健康檢測開關,並配置以下參數:

    參數

    描述

    检测时机

    • 任务运行前(預設):任務擷取資源後,先檢測算力節點健康狀態,再執行使用者代碼。

    • 任务重启后:任務運行異常並由AIMaster自動容錯重啟後,進行算力健康檢測。

      說明

      選擇該配置項時,必須開啟自動容錯功能。更多內容介紹,請參見AIMaster:彈性自動容錯引擎

    • 任務運行前+任務重啟後:任務運行前和任務重啟後均進行算力健康檢測。

      說明

      選擇該配置項時,必須開啟自動容錯功能。更多內容介紹,請參見AIMaster:彈性自動容錯引擎

    检测项

    檢測項包括計算效能檢測、節點通訊檢測、計算通訊交叉檢測和模型類比驗證四類。詳細說明請參見附錄:檢測項說明

    • 預設開啟GPU GEMM(用於檢測GPU GEMM效能情況)、All-Reduce(用於檢測節點通訊效能,識別通訊慢節點/故障節點)檢測。

    • 支援搜尋或勾選檢測項,也可通過快捷配置一鍵選定檢測項目範本。

    最长检测时间

    健康檢測最長已耗用時間,預設為60分鐘。若檢測逾時,會觸發檢測異常處理策略。

    检测异常处理策略

    健康檢測未通過時的處理方式:

    • 結束任務:當識別到故障或可疑節點,任務將終止並標記為檢測未通過。

    • 拉黑重跑:當識別到故障或可疑節點,系統將自動拉黑該節點,重啟任務並重跑檢測,直到檢測全部通過。

    检测最大重启次数

    檢測處理策略為”拉黑重跑”時可用。預設為10次,超過後任務自動失敗。

    其他检测配置

    預設為空白,支援進階參數配置。

查看檢測結果

健康檢測狀態說明

DLC任務健康檢測的狀態說明:

  • 檢測中:進行中算力健康檢測環節。

  • 檢測未通過:檢測發現異常節點或檢測逾時。

  • 檢測通過:所有檢測項通過,任務進入運行狀態。

查看健康檢測結果

通過控制台

DLC任務詳情頁,事件頁簽,單擊健康檢測,可以查看檢測進度及檢測結果。

健康檢測包含檢測環境準備GPU GEMMGPU Kernel LaunchAll-Reduce-單節點MatMul/All-Reduce OverlapMini GPT-單節點等檢測項,各項完成後以綠色對勾標記通過狀態。

單擊重啟記錄頁簽,可以查看重啟次數、重啟原因、重啟結果等資訊。

配置訊息通知

在PAI工作空間的事件通知配置中建立訊息通知規則,其中事件类型選擇DLC任务>任务自动容错,其他參數配置詳情,請參見訊息通知。當算力健康檢測未通過時,會發送訊息通知。

說明

工作空間建立訊息通知使用說明: 事件通知配置

附錄:檢測項說明

說明

預估檢測時間長度以2台機器為單位,數值僅供參考,請以實際情況為準。

檢測項

含義說明(推薦情境)

預估檢測時間長度

計算效能檢測

GPU GEMM

用於檢測GPU GEMM效能情況,可識別:

  • 故障GPU:計算報錯、計算 Hang 住。

  • 效能慢節點:計算 TFLOPS 比較低。

1 分鐘

GPU Kernel Launch

用於檢測 GPU Kernel 啟動延遲情況,可識別:

  • 故障節點:Kernel 啟動報錯、Kernel 啟動 Hang 住。

  • 效能慢節點:Kernel 啟動耗時較長。

1 分鐘

節點通訊檢測

All-Reduce

用於檢測節點通訊效能,識別通訊慢節點/故障節點。在不同的通訊模式下,可識別:

  • 通訊故障節點:通訊報錯、Hang住。

  • 通訊慢節點:通訊頻寬較低。

單個集合通訊檢測

5 分鐘

All-to-All

All-Gather

Multi-All-Reduce

Network Connectivity

用於檢測機頭或機尾網路連通性,識別通訊連通異常節點。

2 分鐘

計算通訊交叉檢測

MatMul/All-Reduce Overlap

用於檢測通訊kernel和計算kernel重疊時單節點的效能情況,可識別:

  • 故障節點:重疊計算報錯、Hang住。

  • 效能慢節點:重疊計算耗時較長。

1 分鐘

模型類比驗證

Mini GPT

使用模型類比驗證AI系統可靠性,可識別:

  • 故障節點:訓練loss異常、訓練Hang住、訓練報錯。

  • 效能慢節點:單步訓練耗時較長。

1 分鐘

Megatron GPT

5 分鐘

ResNet

2 分鐘