DSW支援NVIDIA Nsight效能分析工具,可對GPU應用進行可視化分析,定位並最佳化效能瓶頸。
使用限制
-
DSW執行個體規格:執行個體需配備至少一張NVIDIA GPU,且為靈駿智算平台機型。
-
非Hopper架構:非Hopper架構機型,使用Nsight前必須暫停AMPerf服務。NVIDIA硬體限制GPU效能指標同一時間只能由一個進程採集。
操作步驟
1. 建立DSW執行個體
使用符合要求的GPU規格建立DSW執行個體。
2. 暫停AMPerf採集
Hopper架構(如H20)機型可跳過此步;非Hopper架構機型需先暫停AMPerf指標採集。暫停後可正常使用nsys/ncu等工具。
# 暫停AMPerf採集
/run/amperf/bin/amperfd profmetric --pause -t 600
# 恢複AMPerf採集
/run/amperf/bin/amperfd profmetric --resume
重要
-
監控影響:AMPerf暫停期間,監控效能指標會缺失,執行個體詳情頁的CloudMonitor看板指標精確性會受影響。
-
暫停時間長度:為避免監控資料長時間缺失,AMPerf暫停最長為10分鐘(600秒),到期後自動回復採集(也可手動恢複)。恢複後需等待1分鐘才能再次暫停。
3. Nsight安裝和使用
參考NVIDIA官方文檔下載、安裝和使用Nsight。
-
Nsight Compute (ncu):面向CUDA核心級效能剖析的專用工具,支援指令級執行時間、記憶體頻寬利用率等細粒度指標分析。參考文檔:Nsight Compute命令列介面指南。
-
Nsight Systems (nsys):系統級效能分析套件,可捕捉完整調用棧的GPU-CPU協同執行軌跡與資源佔用狀態。參考文檔:Nsight Systems手冊。
操作建議:
-
長時任務分段:長周期任務建議分段執行分析,以規避AMPerf暫停時間長度限制。
-
及時恢複:分析完成後及時恢複AMPerf服務,確保監控資料完整。