使用DSW時遇到問題,可在此尋找原因和解決方案,涵蓋執行個體啟停、計費、鏡像製作、掛載配置、網路訪問、第三方庫安裝及模型部署等常見情境。
有問題先問小PAI
PAI智能助手(小PAI)提供PAI全鏈路產品的使用說明和操作指引,支援對DSW執行個體、DLC任務、EAS服務進行營運診斷,自動識別失敗原因並給出處理建議。

執行個體啟動
Q:DSW執行個體啟動失敗
排查方法:單擊DSW執行個體名稱,在事件頁簽下查看報錯資訊。
常見報錯及解決方案如下:
其他啟動失敗原因:
欠費導致建立失敗
如果您的帳號欠費,將導致建立DSW執行個體建立失敗,並且代金券不能抵扣欠費,您可登入費用與成本控制台,查看賬戶是否欠費。
Q:提示資源規格庫存不足或計算資源配額不足怎麼辦?
常見報錯:
"Your requested resource type [ecs.******] is not enough currently"(資產庫存不足)。
"Your resource usage has exceeded the default limitation"(超出每個Region有2卡GPU)。
"The cluster resources are fully utilized"(計算資源已完全被佔用)。
原因分析:
公用資產庫存不足
公用資源由多個使用者共用,在高峰期可能出現庫存緊張。
特定GPU規格(如高端GPU)更容易售罄。
每個帳號在每個Region有2卡GPU的限制。
專有資源配額不足
購買了專有資源配額,但配額已用盡。
配額分配不合理,某個工作空間配額不足。
解決方案:
Q:DSW 執行個體處於掛起狀態且提示 GPU 資源緩衝是什麼意思?
GPU 資源緩衝是指當 GPU 資源被其他任務佔用時,當前執行個體需排隊等待資源釋放;在此期間系統會暫存執行個體狀態(顯示為掛起),待資源空閑後自動回復運行。這屬於平台正常的資源調度機制,並非使用者操作問題或故障。
Q:如何查詢 DSW 特定規格的庫存或恢復?
PAI-DSW 控制台暫不支援直接查詢各地區特定規格(如 ecs.gn7i、A100 等)的即時庫存或具體恢復。
公用資源由多使用者共用,庫存動態變化,無法給出確切到貨時間。
當建立執行個體提示“out of stock”或資源不足時,建議嘗試切換地區、更換其他可用規格或在非高峰時段重試。
如需穩定資源保障,建議購買專有資源配額。
Q:DSW 執行個體啟動失敗還有哪些常見情境?
報錯“found multiple security groups with the same name”:通常為後端異常,若重啟執行個體無效,需記錄請求ID(Request ID)並提交工單處理。
節點 CPU 資源片段化導致啟動失敗:建議調整任務啟動順序,先停止部分佔用資源的 DSW 執行個體,優先啟動目標執行個體,待成功後再重啟其他任務。
自訂鏡像未安裝 IDE 能否使用網頁版:可以正常使用,DSW 網頁內的VS Code等 IDE 為平台內建環境,不依賴自訂鏡像中的 IDE 包。
Q:DSW啟動時可以開機執行Python檔案嗎?
建立執行個體或變更執行個體配置時,可找到自定义启动脚本參數進行設定。
該功能可用於在執行個體啟動過程中定製環境或執行初始化任務。自訂指令碼的執行時間在鏡像和資源準備完成後,JupyterLab、Code Server等開發應用啟動前。
逾時時間為3分鐘:自訂指令碼會增加執行個體的啟動時間,指令碼逾時時間為3分鐘,請勿在自訂指令碼中執行鏡像下載等長耗時任務。
可查看指令碼作業記錄:執行個體啟動後可在/var/log/user-command/路徑下找到自訂指令碼運行產生的日誌。
Q:DSW 頁面異常或無法操作怎麼辦?
如果遇到頁面白屏、Notebook 一直轉圈載入、Terminal 無法輸入命令或無法載入、瀏覽器提示"504 Gateway Timeout"或"504 Timeout"等問題,通常與本地環境或執行個體狀態有關。請嘗試以下步驟:
清理瀏覽器緩衝後重試。
使用瀏覽器的 無痕/隱私模式 訪問。
更換網路環境,例如從公司內網切換至手機熱點,以排查防火牆限制。
嘗試使用 其他瀏覽器(如 Chrome、Firefox)。
如果提示 504 Timeout 錯誤,請在 PAI 控制台停止並重啟 DSW 執行個體,等待狀態變為"運行中"後再訪問。
Q:包含雲端硬碟系統硬碟的DSW執行個體停止、重啟、變更規格、更換鏡像是否會丟失系統硬碟中資料?
包含雲端硬碟系統硬碟的DSW執行個體類型有:公用資源群組建立的執行個體,以及選擇云盘作為系統硬碟的通用資源執行個體,其系統硬碟中的資料丟失情況如下:
停止執行個體:可能會丟失。如果雲端硬碟未擴容且執行個體停止超過15天,資料會被清空且無法恢複。如果雲端硬碟擴容過或者執行個體停止未超過15天,則資料不會丟失。
重啟執行個體:不會丟失。在執行個體停止或重啟後,所有通過
pip安裝的包、代碼檔案以及其他儲存在執行個體系統硬碟中的資料都會被保留,不會丟失。變更執行個體規格:不會丟失。調整執行個體規格(如CPU、記憶體、GPU等資源配置)不會影響執行個體的系統硬碟中資料。
更換執行個體鏡像:可能會丟失部分資料。變更鏡像不會影響掛載的資料集或OSS儲存中的資料,但系統硬碟內的內容可能會被重設。因此,您在變更執行個體鏡像時,注意儲存執行個體資料。比如可以將資料複製或移動到資料集或OSS中。詳情請參見掛載資料集/OSS/NAS/CPFS。
對於選擇临时存储作為系統硬碟的通用資源執行個體,不論其所在AI資源群組是否配有預付費雲端硬碟,其停止、重啟、變更規格或鏡像都會丟失系統硬碟中的資料。
Q:使用公用資源建立的 DSW 執行個體,超過15 天未登入被釋放,可以找回嗎?
使用公用資源建立的DSW執行個體,如果雲端硬碟系統硬碟未付費擴容,且關機後連續15天以上未啟動,其系統硬碟將被自動清空且無法恢複。
Q:為什麼 DSW 執行個體初次開機比後續啟動慢?
初次開機 DSW 執行個體時,系統需要完整拉取所選鏡像,這一過程可能耗時 10 分鐘以上(取決於鏡像大小和網路狀況)。後續啟動由於鏡像已緩衝,速度會顯著加快。
如果發現啟動時間逐漸層長,可能是由於儲存的自訂鏡像體積過大導致。建議清理不必要的檔案後重新儲存鏡像,或更換為官方提供的輕量鏡像。
Q:DSW 執行個體建立後能否修改資源類型?
不支援修改資源類型(如從專屬資源改為公用資源,或反之)。若需使用 SSH 配置等功能但當前為專屬資源,可改用 proxyclient 方式訪問,或重新建立符合要求的公用資源執行個體。
執行個體停止/刪除/釋放
Q:如何釋放DSW執行個體?
在DSW執行個體列表頁操作列,單擊停止或刪除執行個體。
注意:擴容過系統硬碟的執行個體,無論是否運行,系統硬碟持續計費。徹底停止計費需刪除執行個體。
Q:怎麼找不到DSW執行個體?
如果找不到執行個體,您可以嘗試切換不同地區和工作空間。
Q:如何釋放免費試用抵扣包?
免費試用抵扣包無需釋放或停止。
Q:如何完全停止DSW執行個體的計費?“停止”和“刪除”操作有什麼不同?
停止執行個體:釋放執行個體的計算資源(CPU/GPU),暫停計算費用。注意:擴容的系統硬碟會繼續計費。
刪除執行個體:永久刪除執行個體及其所有資源(包括系統硬碟),所有相關計費完全停止。
如何選擇:
停止:臨時不用,但想保留資料和環境供未來重啟。
刪除:不再需要,希望停止所有計費。操作前請備份資料。
Q:為什麼我的DSW執行個體長時間處於“停止中”或“刪除中”狀態,無法完成操作?
停止DSW執行個體時,系統會自動構建鏡像緩衝,儲存容器讀寫層資料以加速下次啟動。容器讀寫層資料量越大,構建時間越長,可能持續數十分鐘甚至數小時。
公用資源群組建立的DSW執行個體,處於“停止中”、“儲存中”、“刪除中”狀態時不會產生計算費用。
如果執行個體長時間無法完成停止,常見原因如下:
容器讀寫層資料量過大:這是最常見的原因。如果您在執行個體中安裝了大量軟體包、下載了模型檔案或資料集到系統硬碟,都會增大讀寫層體積,延長停止時間。
執行個體中有未正常結束的進程。
記憶體佔用過高,導致執行個體無法響應關機指令。
加速停止的建議:
在停止執行個體之前,通過"製作鏡像"功能設定排除路徑,將不需要儲存的大檔案或目錄排除在外(如模型檔案、資料集等),可以顯著減少停止耗時。詳情請參見《製作DSW執行個體鏡像》。
將大體積資料存放在掛載的OSS或NAS路徑下,而非系統硬碟中,從根本上減小容器讀寫層的體積。
如果執行個體確實不再需要且不關心資料保留,可以選擇"刪除"執行個體來立即釋放資源。
遇到停止時間過長的情況,建議先耐心等待。如果等待超過2小時仍未完成,請提交工單聯絡支援人員協助處理。
Q:停止或刪除DSW執行個體後,我的資料和代碼會丟失嗎?
資料是否保留取決於您的操作以及執行個體的資源群組類型。
停止執行個體:
資料保留原則因資源群組類型而異。
包含雲端硬碟系統硬碟的執行個體(大多數隨用隨付規格,選擇了云盘作為系統硬碟的通用資源執行個體):如果雲端硬碟未擴容且執行個體停止超過15天,資料會被清空且無法恢複。如果雲端硬碟擴容過或者執行個體停止未超過15天,則資料不會丟失。
使用临时存储作系統硬碟的執行個體:資料存放區在臨時儲存中。停止執行個體會刪除資料,且無法恢複。
刪除執行個體:
其系統硬碟中的所有資料都將被永久擦除,且無法恢複。因此,在刪除前務必備份所有重要資料。
Q:為什麼我正在啟動並執行DSW執行個體會自動停止?
執行個體配置了閑置自動關機策略,預設對免費試用執行個體啟用。
觸發條件:執行個體的 CPU 和 GPU 使用率連續 3 小時低於設定閾值。
操作建議:
手動停止:為確保節省資源,請在不使用時手動停止執行個體。自動關機策略不保證每次都觸發。
修改策略:如需運行長時任務,請修改或禁用此策略。具體操作步驟如下:
進入工作空間詳情頁,單擊工作空间配置 > 调度配置。
找到DSW的配置地區,在此處即可修改DSW的關機策略以及排除策略。如:如果不想自動關機可在排除策略中通過執行個體名稱排除。
Q:我已經將所有DSW執行個體停止或刪除了,為什麼還顯示“運行中”或收到計費通知?
檢查以下常見原因:
混淆了資源套件與執行個體。您看到的“運行中”狀態可能指資源套件(如“每月250計算時”),而非執行個體。資源套件在有效期間內始終有效,其狀態與執行個體無關。
擴容的系統硬碟仍在計費。停止執行個體僅暫停計算費用。擴容後的系統硬碟會繼續產生儲存費用。
賬單存在延遲。計費並非即時,賬單可能在您使用資源幾小時後才產生。例如,上午產生的費用,可能在下午才顯示在賬單中。
Q:是否支援通過 API、Python 代碼或任務完成後自動停止 DSW 執行個體?
目前不支援以下方式自動控制 DSW 執行個體的啟停:
不支援從 ECS 等外部環境通過 API 呼叫 DSW 啟動訓練進程或控制執行個體啟停。
不支援在執行個體內通過 Python 代碼(如
os.system)執行停機命令。不支援設定"任務完成後自動停機"。
DSW 僅支援配置"閑置自動關機策略"(最低閑置時間長度為 1 小時),該策略基於 CPU/GPU 使用率判斷執行個體是否閑置,但無法保證 100% 觸發。建議在任務完成後手動停止執行個體,以避免額外計費。
計費和賬單
Q:為什麼停止 DSW 執行個體後仍然產生費用?
停止 DSW 執行個體後仍產生費用,通常由以下原因引起:
系統硬碟擴容費用:若建立執行個體時擴容了系統硬碟,即使執行個體停止,超出免費額度的儲存容量仍會持續計費。如需徹底停止該部分費用,請備份資料後刪除執行個體。
OSS 儲存費用:若執行個體掛載了 OSS 標準儲存(同城冗餘)等資源,即使 DSW 執行個體停止,未釋放或清空的 OSS 儲存仍會產生費用。請檢查並清理關聯儲存資源。
賬單延遲:DSW 隨用隨付賬單存在 2~3 小時延遲,停止執行個體後短時間內出賬屬於正常現象,並非持續計費。
排查建議:切換不同工作空間和地區,確認所有運行中執行個體及關聯儲存資源均已停止或釋放。
Q:DSW 公網訪問產生的 NAT Gateway和 EIP 如何計費?
DSW 公網訪問所需的 NAT Gateway和 EIP 為獨立計費產品,不包含在 DSW 執行個體費用中。NAT Gateway費用因地區不同存在差異,建議參考所在地區的 NAT Gateway計費說明文檔,選擇合適的低價套餐。更多公網訪問配置請參見通過公網訪問執行個體中的服務。
Q:直接購買 GPU ECS 替代 PAI-DSW 是否可行?
直接購買 GPU ECS 替代 PAI-DSW 進行 AI 業務部署是可行的。
核心差異:ECS 需自行搭建 AI 開發環境(安裝驅動、架構等);PAI-DSW 提供預置鏡像和開箱即用的開發環境,降低環境配置成本。
計費構成提醒:選擇 ECS 方案時,需關注執行個體規格、公網頻寬、雲端硬碟儲存及 NAT Gateway等附加服務的獨立計費,與 DSW 的一體化計費模式不同,總體費用需綜合評估。
Q:PAI節省計划到期後需要手動釋放嗎?
不需要。PAI節省計劃屬於預付費消費金額產品,到期後自動失效,無需手動釋放或刪除操作,也不會產生額外費用。收到到期提醒簡訊後,如不需要繼續使用,無需進行任何操作。如果您在PAI控制台有仍在啟動並執行DSW執行個體,且不再使用,建議停止或刪除該服務執行個體以避免隨用隨付。
Q:如何確認節省計劃或免費試用額度是否已用完?
登入費用與成本控制台,進入"我的訂閱"頁面,可查看節省計劃的剩餘額度和有效期間。如果額度已用完或已到期,後續使用DSW公用資源群組資源將按正常隨用隨付價格計算。
Q:DSW如何收費?為什麼我的執行個體開著但沒有運行代碼,也會產生費用?
DSW支援預付費和後付費,您可以根據自己的實際需要選擇付費方式,計費詳情請參見DSW計費說明。
隨用隨付基於執行個體的實際運行時間長度收費。由於運行中的執行個體會持續佔用計算資源,DSW 隨用隨付執行個體自建立成功並進入“運行中”狀態起開始計費,與您是否開啟瀏覽器、是否登入控制台或是否執行代碼無關。請注意,關閉瀏覽器或退出登入並不會停止執行個體運行,因此計費也不會中止。若需停止計費,您必須前往 PAI 控制台,手動停止或刪除執行個體。
Q:如何查看DSW賬單?
對於後付費使用者,可以進入費用與成本頁面查看賬單明細,詳情請參見查看賬單明細。
Q:如何才能徹底停止DSW執行個體的所有相關計費?
要想完全停止DSW執行個體的一切計費,最徹底的方法是刪除執行個體。請務必在刪除前備份好所有需要的資料,執行個體刪除後資料將無法恢複。
您可以切換不同的工作空間和地區,確保所有執行個體都被刪除。
Q:隨用隨付的DSW執行個體使用未滿一小時怎麼計算費用?
隨用隨付執行個體費用根據實際使用的分鐘數進行計費,具體公式為:賬單金額 = (單價 / 60)× 實際服務時間長度(分鐘)。
模型拉取
Q:拉模數型時報錯:Failed to pull image "crpi-****-vpc.cn-hangzhou.personal.cr.aliyuncs.com/apo/cat:full"
建立DSW執行個體時,如果配置的是鏡像地址,且鏡像倉庫為私人,則在輸入鏡像地址時需輸入鏡像倉庫使用者名稱和密碼。
鏡像使用
Q:製作鏡像時報錯:insufficient capacity of ephemeral storage
出錯原因:製作鏡像的大小校正邏輯是檢查系統硬碟的剩餘可用空間是否大於寫入層的大小,如果可用空間不足,就會報這個錯。
解決方案:在DSW Terminal中通過df -h查看檔案系統的磁碟空間佔用情況,並確保overlay已使用的空間不超過/dev/vda4的可用空間,如果超過,您可以通過在製作鏡像時設定自定义排除路径解決。
/mnt/workspace> df -h
Filesystem Size Used Avail Use% Mounted on
overlay 98G 82G 17G 84% /
tmpfs 64M 0 64M 0% /dev
tmpfs 16G 0 16G 0% /sys/fs/cgroup
/dev/vda4 99G 31G 68G 32% /tmp
/dev/vdb 98G 82G 17G 84% /mnt/workspace
overlay 99G 31G 68G 32% /etc/dsw
tmpfs 16G 0 16G 0% /dev/shm
/dev/vda3 8.8G 4.4G 4.0G 53% /usr/bin/nvidia-smi
tmpfs 16G 12K 16G 1% /proc/driver/nvidia
overlay 98G 82G 17G 84% /usr/lib/x86_64-linux-gnu/libcuda.so.465.19.01
devtmpfs 16G 0 16G 0% /dev/nvidia0
tmpfs 16G 0 16G 0% /proc/acpi
tmpfs 16G 0 16G 0% /sys/firmware在此樣本中,overlay 已使用 82G,而 /dev/vda4 可用空間為 68G,overlay 已使用空間超過了 /dev/vda4 的可用空間,因此需要通過設定自訂排除路徑來減小寫入層大小。
Q:DSW如何使用Docker鏡像?
使用Docker鏡像啟動DSW執行個體:您可以將Docker鏡像推送至阿里雲Container RegistryACR中,然後再將其添加至PAI工作空間的自訂鏡像中,即可在建立DSW執行個體時選擇對應鏡像啟動執行個體。
將Docker鏡像推送至Container RegistryACR中,請參見使用個人版執行個體推送拉取鏡像。
添加PAI自訂鏡像,請參見自訂鏡像。
想打包當前的DSW的鏡像環境,用於啟動其他執行個體或部署模型,請參見製作DSW執行個體鏡像。
在DSW的雲端IDE中安裝和使用Docker:目前二級容器功能僅支援由“靈駿資源群組”或“1.0版本的通用資源群組”建立的DSW執行個體。詳情請參見子容器管理DockerBoard及在DSW中使用Docker。
Q:為什麼製作DSW鏡像時會失敗或逾時?
鏡像大小超限:DSW製作鏡像時,單層鏡像儲存的資料量不應超過10 GiB,否則構建會失敗。建議您嘗試縮小鏡像大小。
地區不匹配:DSW執行個體與Container RegistryACR執行個體必須位於同一地區,否則在製作鏡像時將無法找到對應的鏡像倉庫。
系統硬碟空間不足:製作鏡像時,如果系統硬碟的剩餘可用空間小於需要寫入鏡像層的資料大小,會報“insufficient capacity of ephemeral storage”錯誤。
網路問題:使用個人版ACR時,鏡像是通過公網推送的,較大的鏡像可能會因為網路波動或傳輸時間過長而導致逾時失敗。企業版ACR執行個體若與DSW執行個體綁定在同一個VPC內,則可以通過內網推送,速度更快更穩定。
Q:為什麼“製作鏡像”按鈕是灰色的,或者在製作時找不到我的鏡像倉庫?
執行個體狀態不正確:“製作鏡像”功能僅對處於“運行中”狀態的DSW執行個體開放。如果執行個體處於“已停止”或其他狀態,該按鈕將為灰色不可用。
前置條件未滿足或配置錯誤:
您必須先在與DSW執行個體相同的地區建立好Container RegistryACR執行個體,並在其中建立了命名空間和鏡像倉庫。
請務必確認DSW執行個體和ACR執行個體的地區完全一致。
Q:製作鏡像報錯:Push image registry-vpc.cn-****.aliyuncs.com/****/lm-mirrors:**** Failed: Push container failed, Container Name: dsw-notebook
在製作鏡像時,請確保單層鏡像中的資料量不超過10 GiB,否則構建會失敗。對於公用資源群組的DSW執行個體,您可以設定自訂排除路徑,以排除某些檔案或目錄,使其不被包含在最終產生的鏡像中。或者,您可以通過掛載儲存路徑(如掛載OSS路徑)來將資料存放區到已掛載的路徑,並通過該路徑進行訪問。
Q:製作鏡像推送至企業版 ACR 時報錯 Failed to login 怎麼辦?
該錯誤通常由 ACR 倉庫許可權配置不當或認證資訊無效導致。請按以下步驟排查:
先將鏡像倉庫類型臨時修改為"公有"進行測試。
若改為公有後能成功推送,則確認為許可權問題,需檢查並修正私人倉庫的存取控制策略及帳號授權資訊。
若改為公有後仍失敗,需檢查當前登入帳號是否具備該 ACR 執行個體的寫入許可權。
Q:通過鏡像重建執行個體期間,原執行個體如何處理及是否繼續計費?
PAI-DSW 執行個體磁碟不支援縮容,若需調整配置(如縮容),需先將原執行個體製作成自訂鏡像。
鏡像製作完成後,建議先停止原執行個體,以避免產生計算資源費用。
使用新鏡像建立執行個體並驗證環境無誤後,再釋放(刪除)原執行個體,以徹底停止計費。
Q:自訂鏡像中是否必須包含 VS Code 或 Jupyter 等 IDE 包?
自訂鏡像中不強制要求包含VS Code、Jupyter等 IDE 包,即使鏡像未安裝,DSW 網頁端內建的 IDE 環境仍可正常使用。
如果希望鏡像內預設預裝特定 IDE 或依賴,需在製作鏡像前將相關軟體打入鏡像,或在執行個體啟動後手動安裝。
系統硬碟擴容
Q:DSW執行個體系統硬碟空間有多大,滿了怎麼辦?
DSW執行個體中的檔案和資料預設儲存在系統硬碟中。
查看免費額度
公用資源群組建立的執行個體免費額度為100 GiB,通用計算資源需滿足規格要求後,才會提供免費額度的系統硬碟。靈駿智算資源不提供免費雲端硬碟。具體免費系統硬碟空間大小可以查看執行個體配置頁面的系統硬碟選項。操作步驟:
單擊執行個體列表頁的執行個體名稱。
在右上方單擊变更配置,然後下拉找到系统盘。
查看系統硬碟使用量
單擊DSW執行個體名稱,在環境資訊地區可以查看系統硬碟的用量。
系統硬碟滿了如何擴容
如果系統硬碟空間使用量超過了免費額度,您可以選擇擴容系統硬碟或掛載資料集。
Q:系統硬碟支援縮容嗎?
DSW系統硬碟擴容後無法縮容。若系統硬碟空間過大,可通過掛載資料集/OSS/NAS/CPFS將資料備份至OSS,然後刪除該執行個體、重新建立並設定合適的系統硬碟容量。
掛載配置
Q:DSW執行個體如何掛載和使用自己的檔案系統?
您可以在建立執行個體時掛載OSS/NAS/CPFS/智算CPFS,可以通過DSW Terminal進入掛載目錄查看並使用檔案。
目前DSW僅支援在建立執行個體時,掛載同地區下的檔案系統,詳情請參見建立DSW執行個體。
Q:PAI-DSW掛載資料集NAS,啟動執行個體報錯:The specified MountTarget 3b79d4a2ac-xmk97.cn-shanghai.nas.aliyuncs.com is not in VPC vpc(VPC執行個體)
產生原因:建立NAS資料集時添加了掛載點配置。
解決方案:建立資料集時將掛載點置空。
Q:使用ECS搭建FTP上傳下載檔案到NAS,執行掛載(mount)命令報錯mount:wrong fs type,bad option,bad superblock
現象描述
[root@iZufxxx file]# sudo mount -t nfs -o vers=4.0 3f8axxx-lfc99.cn-shanghai.nas.aliyuncs.com:/ /usr/sftp/file mount: wrong fs type, bad option, bad superblock on 3f8axxx-lfc99.cn-shanghai.nas.aliyuncs.com:/, missing codepage or helper program, or other error (for several filesystems (e.g. nfs, cifs) you might need a /sbin/mount.<type> helper program) In some cases useful info is found in syslog - try dmesg | tail or so. [root@iZufxxx file]#解決方案
執行
mount命令之前,先安裝nfs-utils安裝包。yum install nfs-utils
Q:如果掛載OSS資料集後,訪問掛載目錄報錯Input/output error,應如何解決?
root@dsw-xxx:/mnt/workspace# cd /mnt
root@dsw-xxx:/mnt# ls -ll
total 9
drw-rw-r-- 0 99 99 512 Jan 1 1970 data
drwxr-xr-x 5 root root 4096 Dec 13 02:42 systemDisk
drwxr-xr-x 5 root root 4096 Dec 13 02:42 workspace
root@dsw-xxx:/mnt# cd data
root@dsw-xxx:/mnt/data# ls -ll
ls: reading directory '.': Input/output error
total 0
root@dsw-xxx:/mnt/data#原因是RAM角色未獲授OSS存取權限(AliyunPAIDLCAccessingOSSRole)。授權操作請參見PAI服務帳號授權。
Q:如何在使用jindo掛載OSS資料集時降低OOM(Out of Memory)風險?
在掛載OSS資料集後,可通過設定進階參數解決,方式如下:
方式一:使用jindo6.8.1版本,該版本最佳化了記憶體。
{ "fs.jindo.fuse.pod.image.tag":"6.8.1" }方式二:使用ossfs。
在提交任務時,指定:
{ "mountType": "ossfs" }通過以下配置關閉readdirplus最佳化,可以減少列舉檔案夾內容時的中繼資料快取佔用,從而最大程度的緩解OOM問題:
{ "mountType": "ossfs", "fs.ossfs.args": "-oreaddirplus=false" }
Q:成功掛載了OSS,為什麼在JupyterLab介面的左側檔案瀏覽器中看不到?
這是因為DSW的檔案瀏覽器預設顯示的是執行個體的工作目錄,其路徑通常是/mnt/workspace。而您掛載OSS時指定的掛載路徑(例如 /mnt/data)並不在預設工作目錄下,因此不會直接顯示在左側檔案清單中。
解決方案:
通過代碼訪問:您的檔案實際上已經成功掛載。在代碼中,您需要使用完整的掛載路徑來訪問它們,例如
open('/mnt/data/my_file.csv')。更改掛載點:為了在UI中方便地看到檔案,您可以在配置掛載時,將掛載路徑設定為工作目錄下的一個子目錄,例如
/mnt/workspace/my_oss_data。這樣,掛載完成後,您就可以在檔案瀏覽器的my_oss_data檔案夾中看到您的OSS檔案了。通過終端訪問:您可以在DSW的Terminal中使用
cd /mnt/data命令進入掛載目錄,然後通過ls等命令查看和操作檔案。
Q:使用掛載的OSS時,程式報錯“Transport endpoint is not connected”或“輸入/輸出錯誤”?
這個錯誤表明DSW執行個體與OSS的掛載串連已斷開。可能的原因及排查方法如下:
RAM角色許可權問題:請檢查您為DSW執行個體配置的RAM角色是否被授予了訪問OSS的許可權(例如
AliyunPAIDLCAccessingOSSRole)。許可權不足是導致無法讀取OSS的常見原因。掛載服務資源不足:當進行高強度的隨機讀寫或大量小檔案操作時,負責掛載的
ossfs或JindoFuse進程可能會因記憶體不足(OOM)而崩潰 。您可以在掛載配置的“進階配置”中,可以關閉中繼資料Cache,或增加記憶體配置。詳情請參見JindoFuse。恢複串連:
對於啟動時掛載,最簡單的恢複方法是重啟DSW執行個體,系統會自動重新執行掛載。
您也可以使用PAI SDK執行動態掛載命令,在不重啟執行個體的情況下重新掛載路徑。
Q:DSW支援掛載哪些類型的資料?可以直接掛載阿里雲盤或MaxCompute表嗎?
DSW支援通過建立資料集或直接掛載路徑的方式使用OSS、NAS和CPFS這幾種雲端儲存體服務
不支援阿里雲盤:目前DSW不直接支援掛載個人阿里雲盤。需要處理的資料建議存放在OSS中。
不支援掛載MaxCompute表:MaxCompute(原ODPS)的表資料,不能像檔案系統一樣直接“掛載”到DSW的目錄中。您可以通過PAI提供的SDK或API在DSW代碼中進行讀寫,詳情請參見使用PyODPS讀寫MaxCompute表。
Q:DSW執行個體關機或刪除後,代碼和資料會丟失嗎?如何?資料持久化和遷移?
DSW執行個體的系統硬碟是臨時儲存。對於公用資源群組,執行個體停機超過15天資料會被清空;對於專有資源群組,執行個體停止或刪除後,系統硬碟資料也會被清空。
為了實現資料和代碼的持久化儲存,以及在不同執行個體間遷移,必須使用外部掛載儲存 。
持久化方案:將您的重要資料、代碼、模型等全部儲存在通過掛載的OSS或NAS路徑下。這樣,即使DSW執行個體被刪除,您的所有資產依然安全地存放在您自己的OSS或NAS中。
遷移方案:當您需要將資料從一個DSW執行個體遷移到另一個時,只需在新執行個體中掛載包含這些資料的同一個OSS或NAS路徑即可,這是最便捷的資料移轉方式。
Q:成功掛載了OSS,在工作目錄中的檔案為什麼在OSS中看不到?
掛載OSS時指定的掛載路徑預設為 /mnt/data,而DSW預設的工作目錄為/mnt/workspace,因此無法在OSS中看到工作目錄下的檔案。您可以使用如下複製命令將工作目錄下的檔案拷貝至/mnt/data下,即可在OSS中看到相應檔案。
cp -r /mnt/workspace/. /mnt/data/Q:如何將 /mnt/workspace 目錄下的資料完整複製到掛載的資料集目錄?
在 DSW 執行個體終端中執行以下命令:
cp -r /mnt/workspace/ /mnt/data/其中 /mnt/data 為預設資料集掛載路徑,該操作可保留原有檔案結構和內容。複製完成後,可以通過以下命令驗證掛載狀態及檢查 OSS 中的資料:
mount | grep oss資料讀取、上傳和下載
Q:如何使用DSW讀取OSS資料?
您可以使用Python SDK或API讀取OSS資料,詳情請參見讀寫Object Storage Service資料。
Q:如何上傳下載檔案夾?
DSW不支援直接上傳和下載檔案夾,需先打包為壓縮檔。Terminal支援tar、gzip、unzip等標準命令,以tar為例如下。
使用
tar --version查看tar是否安裝,如果沒有,則可參考如下命令進行安裝。# 對於基於Debian的系統(例如 Ubuntu)的安裝命令 sudo apt install tar # 基於Red Hat的系統(例如CentOS、Fedora)的安裝命令 sudo yum install tar解壓縮檔案夾。
# 壓縮檔夾, /path/to/diretory為要壓縮的檔案夾 tar -cvf archive_name.tar /path/to/directory # 解壓檔案夾 tar -xvf archive_name.tar
Q:兩個DSW執行個體之間怎麼互傳、分享資料?
您可以採用如下兩種方式:
掛載資料集/OSS/NAS/CPFS:兩個DSW執行個體都掛載相同的資料集或OSS路徑,然後將資料存放區在該資料集或儲存路徑下,從而實現資料分享。
上傳與下載檔案:從源DSW執行個體中下載需要分享的資料,然後再上傳至另一個DSW執行個體中。
Q:點擊“Download”後沒有反應或下載失敗怎麼辦?
這通常由網路擁堵或瀏覽器問題引起。請嘗試以下步驟:
耐心等待片刻,大檔案下載需要更長的回應時間。
更換瀏覽器或使用瀏覽器的無痕模式重試。
對於較大的檔案(如超過200 MB)或網路不穩定的情況,建議通過掛載OSS的方式下載。
Q:提示“檔案中轉站”空間不足怎麼辦?
檔案中轉站的總容量為10 GB。您需要進入中轉站管理頁面,清理中轉站檔案釋放空間。如果頁面沒有及時重新整理,請嘗試重新整理瀏覽器。
Q:為什麼上傳時總是跳轉到“檔案中轉站”?
這是正常現象。為保證上傳穩定性和速度,所有大於10 MB的檔案都會自動通過檔案中轉站進行傳輸,並在完成後儲存到您的執行個體中。
Q:通過檔案中轉站上傳大檔案時進度條卡住或無響應怎麼辦?
問題原因:通常由本網環境不穩定導致。
解決方案:建議將檔案先上傳至Object Storage Service,再在 DSW 執行個體中掛載或讀取 OSS 資料。操作指引請參見掛載資料集。
Q:如何將本地的大檔案(例如超過5 GB的模型)或大量資料上傳到DSW並使用?
DSW執行個體的系統硬碟空間有限且為臨時儲存,不建議直接上傳大檔案或大量資料。建議先將資料上傳到OSS,再掛載到DSW執行個體中使用。詳情請參見掛載資料集/OSS/NAS/CPFS。
Q:DSW 執行個體建立失敗,報 FAIL_TO_INIT_DATASET 錯誤?
當 OSS 掛載路徑指向檔案而非目錄時,DSW 在執行個體建立階段檢測到路徑無法識別為目錄,拒絕初始化資料集並返回 FAIL_TO_INIT_DATASET 錯誤。請檢查 OSS 中掛載路徑同級是否存在同名檔案,刪除該檔案或修改掛載目錄路徑使其指向有效目錄,然後重新建立執行個體。
遠端連線執行個體
Q:ProxyClient串連DSW執行個體時斷連報錯:client_loop: send disconnect: Broken pipe
通過SSH方式串連DSW執行個體時,長時間不操作會觸發斷連,系統可能提示:
Welcome to PAI DSW!
(base) [root@dsw-367946-867cc4957c-phxnp ~]$FATA[0245] proxy-read:websocket: close 1006 (abnormal closure): unexpected EOF
client_loop: send disconnect: Broken pipe如果要從根本上解決此問題,推薦您使用穩定性更高的遠端連線:SSH直連方式串連DSW執行個體。
Q:使用VSCode遠端連線了執行個體,開啟本地檔案夾失敗
通常由VS Code用戶端問題引起。建議將本地檔案上傳至DSW雲端,操作可參考上傳與下載檔案。
Q:SSH直連配置失敗,報錯資訊如下: Failed to update private zone items: Failed to add zone?
報錯原因是沒有開啟內網DNS解析服務,您可以參考開通內網DNS解析開通該服務。
Q:VS Code 串連 DSW 時報錯"the input device is not a TTY"怎麼辦?
該報錯通常由 SSH 服務端 TTY 配置缺失導致。解決方案:
在 DSW 執行個體的 Terminal 中編輯
/etc/ssh/sshd_config檔案,添加或確認存在PermitTTY yes配置項。儲存後執行
sudo service ssh restart重啟 SSH 服務。重新使用 VS Code 串連。
Q:是否支援通過外部 IDE 直接遠程調用 PAI GPU 算力執行代碼?
不支援。無論是 DSW 還是 DLC,代碼均需在雲端環境中運行,不支援在本地外部 IDE 中通過 API 直接遠程調用 PAI GPU 算力。
建議通過 SSH 直連方式將本地 IDE(如 VSCode、PyCharm)串連到 DSW 執行個體進行開發,或將代碼上傳至 DSW/DLC 中運行。具體 SSH 串連方式請參見本文「遠端連線執行個體」章節。
更多遠端連線問題請參見常見問題。
網路問題
Q:網路下載速度過慢如何解決?
由於DSW、DLC執行個體預設使用共用網關,受頻寬節流設定,下載大型檔案時網速可能無法滿足需求。因此,當您想要提升網路下載速度時,可參考如下內容:
如果下載的是國內資源:可以為執行個體所在Virtual Private Cloud建立公網NAT Gateway、綁定彈性IP(EIP)並配置SNAT,詳細操作請參見通過專有網關提升公網訪問速率。
注意當使用該方法時請確認工作空間是否開啟了访问公网限速開關,查看步驟:在工作空間詳情頁面 > 配置工作空間 > 通用配置,查看访问公网限速開關。
如果下載的是海外資源:您可以使用Global AccelerationGA拉取海外模型或容器鏡像。
此外,您還可以先本地下載資源檔,然後直接上傳至DSW執行個體。或者先將其上傳至Object Storage Service,然後再掛載到DSW執行個體中。
Q:DSW執行個體是否有公網IP?
DSW執行個體預設情況下不分配公網IP。如果您需要訪問外網或讓外部存取您的DSW執行個體,建議您配置NAT Gateway或使用Elastic IP Address(EIP),詳情請參見網路設定。
Q:DSW執行個體同NAT Gateway暴露公網訪問時,公網連接埠可以重複嗎?
當使用DSW自訂服務對外提供介面時,若多個服務配置了相同的NAT Gateway,則所有通過該NAT Gateway進行公網訪問的自訂服務連接埠不得重複,包括不同DSW執行個體中的自訂服務。
Q:DSW執行個體為什麼無法訪問公網?
DSW執行個體預設可以使用公有网关訪問公網。如果您無法訪問公網請確認,在執行個體的配置頁面,公网访问网关是否選擇了专有网关。如果選擇了專有網關,請必須配置Elastic IP Address和SNAT條目,詳情見通過專有網關提升公網訪問速率。否則,請選用公有網關。
Q:訪問Hugging Face時遇到"Network is unreachable"錯誤?
拉取海外模型(如huggingface.co)時可能因網路跨域而無法訪問。可建立Global AccelerationGA執行個體,使DSW具備跨域擷取模型和鏡像的能力。詳情請參見跨域拉取海外模型或容器鏡像。
第三方庫安裝
Q:DSW執行個體關機(停止)後,我用pip安裝的包和寫的代碼會丟失嗎?
如果使用了雲端硬碟作為系統硬碟則不會丟失。 執行個體的磁碟資料(包括/mnt/workspace和/root下的環境)都會被保留。下次啟動執行個體時,所有環境和檔案都還在。只有刪除執行個體才會徹底清空所有資料。
Q:為什麼安裝的第三方包沒有生效?
通過pip命令安裝第三方包後,使用import命令匯入時,如果找不到該包,先嘗試重啟服務或Kernel。如果依然報錯,請確認當前使用的環境。安裝第三方包時,DSW預設安裝到Python 3環境。如需安裝到其他環境,必須先切換環境再安裝,樣本如下。
安裝到Python 2環境。
source activate python2
pip install --user xxx
安裝到TensorFlow 2.0環境。
source activate tf2
pip install --user xxx其中xxx需要替換為待安裝的第三方包名稱。
Q:在DSW裡用 pip install 安裝一個包失敗了,報依賴衝突或版本錯誤,該怎麼辦?
通常由環境不相容導致。按以下順序排查:
首選方案:更換鏡像。 停止當前執行個體,建立一個DSW執行個體,選擇一個不同的官方鏡像。例如,如果當前PyTorch 2.1鏡像不行,可以嘗試PyTorch 2.3的鏡像,或者嘗試
modelscope系列鏡像,該系列鏡像通常有更好的相容性。指定版本安裝。 查閱該包的官方文檔,找到一個支援您當前DSW環境(Python/CUDA版本)的包版本,然後執行
pip install package_name==x.y.z。更換下載源。 嘗試使用清華源等國內鏡像:
pip install -i https://pypi.tuna.tsinghua.edu.cn/simple <yourLibraryName>。
Q:在DSW的Terminal裡已裝好了庫,為什麼在Jupyter Notebook裡import 還是找不到?
可能是因為Terminal和Jupyter使用了不同的Python環境。可通過which python命令確認當前Python環境,或在Notebook中安裝所需的庫,例如:
!which python
/usr/local/bin/python
!pip install bottle
Looking in indexes: https://mirrors.aliyun.com/pypi/simple/
Collecting bottle
Downloading https://mirrors.aliyun.com/pypi/packages/83/f6/b55...
103.8/103.8 kB 6.7 ...
Installing collected packages: bottle
Successfully installed bottle-0.13.4
WARNING: Running pip as the 'root' user can result in broken per...
[notice] A new release of pip is available: 23.3.2 -> 25.1.1
[notice] To updateQ:代碼報錯說CUDA驅動版本太低,需要手動在DSW裡升級NVIDIA驅動嗎?
不要升級驅動版本。 DSW執行個體的驅動和CUDA是預裝並鎖定的,不能也不應該手動修改,否則極易導致執行個體損壞且無法恢複。正確做法:更換DSW鏡像。停止當前執行個體,建立一個執行個體,選擇官方提供的、帶有更高版本CUDA和驅動的鏡像。
例如官方鏡像:modelscope:1.9.4-pytorch2.0.1tensorflow2.13.0-gpu-py38-cu118-ubuntu20.04。其中cu118,代表CUDA版本為11.8。
Q:在DSW的VSCode中安裝外掛程式時報ETIMEDOUT錯誤,怎麼解決?
VSCode外掛程式安裝需要訪問VS Code Marketplace(marketplace.visualstudio.com),該網域名稱為海外地址。如果DSW執行個體使用的是公有網關(共用頻寬),訪問海外資源時速度可能極慢或逾時。
解決方案:
確認執行個體網路是否正常:在Terminal中執行
curl -I https://marketplace.visualstudio.com,檢查能否正常返回。如果訪問海外資源逾時,請參見提升DSW公網下載速度,為執行個體所在VPC配置公網NAT Gateway和EIP,並使用專有網關。
配置專有網關後,如仍無法訪問海外資源,可參見DSW加速訪問海外資源開啟Global Acceleration(GA)。
Q:想在DSW裡使用Docker來部署我的應用程式,可以嗎?
目前二級容器(子容器)功能僅支援由”靈駿資源群組”或”1.0版本的通用資源群組”建立的DSW執行個體。詳情參見子容器管理DockerBoard及在DSW中使用Docker。
Q:DSW執行個體裡沒有unzip或7z命令,怎麼解壓檔案?
您可以通過apt-get命令來安裝。
安裝
unzip:在Terminal中運行apt-get update && apt-get install -y unzip,然後使用unzip your_file.zip。安裝
p7zip(用於7z):在Terminal中運行apt-get update && apt-get install -y p7zip-full,然後使用7z x your_file.7z。
Q:安裝三方包時一直卡住或逾時,是怎麼回事?
安裝第三方庫時出現卡住、逾時或速度極慢的情況,通常是網路問題。按以下步驟排查:
第一步:確認網路連通性
在終端執行ping www.aliyun.com命令,測試能否訪問外網。如果網路不通,繼續第二步檢查網關配置。
第二步:檢查網關配置
在執行個體配置頁查看公网访问网关的類型:
公有網關:DSW預設使用公有网关訪問外網。您可以在DSW執行個體配置頁面確認網關類型。使用公有網關時頻寬受限,下載大型檔案時網速可能不夠,此時可選擇專有網關。
專有網關:專有網關提供更高的網路訪問速度,選擇專有網關後必須在Virtual Private Cloud中建立公網NAT Gateway、綁定彈性IP(EIP)並配置SNAT,否則無法訪問公網,詳情參見通過專有網關提升公網訪問速率。
第三步:嘗試更換pip下載源
DSW預設使用阿里雲鏡像源,但在高峰期或網路波動時可能出現問題。建議嘗試切換到其他國內鏡像源:
# 使用清華源安裝(推薦)
pip install -i https://pypi.tuna.tsinghua.edu.cn/simple --trusted-host pypi.tuna.tsinghua.edu.cn <yourLibraryName>
# 使用中科大源安裝
pip install -i https://pypi.mirrors.ustc.edu.cn/simple --trusted-host pypi.mirrors.ustc.edu.cn <yourLibraryName>
# 使用豆瓣源安裝
pip install -i https://pypi.doubanio.com/simple --trusted-host pypi.doubanio.com <yourLibraryName>
也可以永久更改預設pip源,參見查看或更改pip源。
第四步:使用離線安裝
如果網路實在不通或非常不穩定,可以採用離線安裝方式:
在本地電腦(網路良好)下載
.whl格式的安裝包:# 在本地電腦執行 pip download <yourLibraryName> -d ./packages將下載的
.whl檔案上傳到DSW執行個體,檔案上傳參見上傳與下載檔案。在DSW中離線安裝:
pip install /path/to/your-package.whl
Q:訪問aiext-pypi鏡像源失敗(如aiext-pypi.mirrors.aliyuncs.com),怎麼處理?
aiext-pypi.mirrors.aliyuncs.com 是PAI為PAI-PPU鏡像專屬配置的內部pip加速源,僅在使用PAI-PPU系列鏡像時才能訪問。如果您的DSW執行個體使用的是其他鏡像(如PyTorch、TensorFlow官方鏡像),將無法訪問該源,這是正常現象,並非網路故障。
處理方式:
如需使用該加速源,請更換為PAI-PPU系列鏡像建立執行個體。
如無需PAI-PPU鏡像,可改用其他國內公用pip源(如阿里雲源、清華源),參見查看或更改pip源。
Q:在DSW的WebIDE裡如何擷取root許可權?
DSW的大部分官方鏡像預設以root使用者身份運行,開啟Terminal時看到命令提示字元是root@...就說明已經是root。pip安裝時出現的”不建議以root使用者運行”的警告可以忽略。如果您的鏡像不是root登入,這是鏡像本身的設定,需要更換支援root的鏡像。
Q:在DSW中如何啟動xserver?
DSW不支援啟動xserver。
模型部署
Q:如何部署DSW產生的模型?
使用EAS模型部署服務
在完成模型建模後,您可以使用PAI-EAS將模型部署為線上服務,詳情請參見將模型部署為線上服務。
下載模型到本地部署
您可以通過按右鍵DSW產生的模型將其下載至本地。
執行個體運行
Q:運行機器學習代碼時,為什麼頁面放置一段時間後提示重新登入?
DSW登入 Session 有效期間為 3 小時,到期後需重新登入,不影響任務執行。目前不支援調整 Session 的逾時斷開時間,預設有效期間為 3 小時。長時間運行任務建議在 Terminal 使用 nohup 命令後台執行。
Q:關閉瀏覽器或電腦關機後,DSW 中啟動並執行訓練任務還會繼續嗎?
會繼續。DSW執行個體運行在雲端,關閉本地裝置不影響其運行。但部分執行個體(尤其是免費試用執行個體)配置了閑置自動關機策略——CPU、GPU等資源持續低於閾值時,系統會判定為閑置並自動停止,導致任務中斷。
Q:DSW是否支援模型蒸餾?
DSW 僅為您提供雲端開發環境,不提供一鍵模型蒸餾功能。如果您想要一鍵蒸餾模型可使用PAI Model Gallery,詳情請參見模型蒸餾。
Q:為什麼在Terminal中沒有tab鍵自動補全等bash功能?
因為部分鏡像有使用限制,您需要手動在Terminal中輸入bash並按斷行符號鍵,才可以啟動bash相關功能。
# bash
root@dsw-xxx-rxdxg:/mnt/workspace# ls
demos lingxitest.tar
root@dsw-xxx-rxdxg:/mnt/workspace#Q:如果您在DSW中進行AI開發時發現DSW執行個體規格不滿足要求如何解決?
您可以按照以下操作步驟更新DSW執行個體規格:
在DSW執行個體列表中,單擊執行個體名稱,進入執行個體詳情頁面。
在实例配置頁簽中,單擊变更配置。
在变更实例配置面板中,更新執行個體規格。
說明在更新DSW執行個體規格時,如果執行個體正在運行中,更新操作會立即重啟執行個體。請確保您已經儲存了執行個體中的內容。
Q:我的記憶體使用量率較高,怎麼樣進行釋放?
記憶體使用量率過高時,可通過以下兩種方式釋放。
如果因記憶體佔用過高,您已無法通過命令列進行互動,請單擊右上方的停止实例;或返回到DSW控制台,單擊執行個體所在行右側的停止按鍵。等到執行個體停止後再開啟執行個體。
如果在執行個體中可以通過命令列進行互動,您可以在執行個體的Terminal中輸入
top命令,查看當前所有進程的記憶體佔用資訊。%MEM表示佔用記憶體百分比,PID表示進程ID。top – 10:40:20 up 22 min, 0 users, load average: 0.95, 0.40, 0.15 Tasks: 21 total, 2 running, 19 sleeping, 0 stopped, 0 zombie %Cpu(s): 12.9 us, 0.6 sy, 0.0 ni, 86.4 id, 0.0 wa, 0.0 hi, 0.0 si, 0.0 st MiB Mem : 16000.0 total, 5889.6 free, 8838.5 used, 1271.9 buff/cache MiB Swap: 0.0 total, 0.0 free, 0.0 used. 5889.6 avail Mem PID USER PR NI VIRT RES SHR S %CPU %MEM TIME+ COMMAND 360 root 20 0 8992776 8.0g 17096 R 100.0 51.1 2:12.54 python 207 root 20 0 11.2g 304160 50372 S 4.0 1.9 0:44.11 node 106 root 20 0 288712 104764 18316 S 1.0 0.6 0:03.11 jupyter-lab 122 root 20 0 638252 104652 32672 S 1.0 0.6 0:17.24 app 244 root 20 0 648536 54848 37924 S 0.3 0.3 0:01.22 node 1 root 20 0 10416 3828 3464 S 0.0 0.0 0:00.04 bash 90 root 20 0 15420 3856 2240 S 0.0 0.0 0:00.00 sshd 99 root 20 0 34500 25712 10688 S 0.0 0.2 0:00.48 supervisord 100 root 20 0 16280 8612 5140 S 0.0 0.1 0:00.01 supervisor_stdo 101 root 20 0 10420 3632 3300 S 0.0 0.0 0:00.00 launch_dswagent 102 root 20 0 10420 3724 3384 S 0.0 0.0 0:00.00 launch_jupyterl 103 root 20 0 10420 3628 3280 S 0.0 0.0 0:00.00 launch_code_ser 105 root 20 0 29632 28416 1668 S 0.0 0.2 0:01.51 app 154 root 20 0 721936 63232 37132 S 0.0 0.4 0:00.59 node 172 root 20 0 995584 131364 41032 S 0.0 0.8 0:05.36 node 218 root 20 0 848572 50384 37464 S 0.0 0.3 0:00.24 node 256 root 20 0 10684 4468 3768 S 0.0 0.0 0:00.00 bash 311 root 20 0 134328 50316 10432 S 0.0 0.3 0:00.93 python 312 root 20 0 138020 54140 11004 S 0.0 0.3 0:01.06 python 3670 root 20 0 10656 4368 3704 S 0.0 0.0 0:00.09 bash 3694 root 20 0 13224 3980 3400 R 0.0 0.0 0:00.08 top如果您想要結束佔用記憶體較高的進程,請在命令列中輸入:
kill PID您需要將PID替換成您想要結束進程的PID。運行後可看到記憶體使用量率降低。
C 0.9% M 4.3%
Q:運行時報錯:RuntimeError: CUDA error: too many resources requested for launch
出錯原因:CUDA核心請求的資源超過GPU可用資源上限。
解決方案:嘗試重啟執行個體後重新運行。若仍報錯,需選擇更高規格的GPU執行個體。
Q:DSW記憶體不足時能否建立swap空間使用虛擬記憶體?
DSW本身是容器,不支援建立或管理swap空間。
原因如下:
許可權限制:容器的核心許可權受限,無法掛載 Swap 檔案。即使在容器內Root,也無法繞過宿主機的資源策略。
平台策略:平台統一調度和限制資源,以確保多租戶環境的穩定和安全。
建議:若記憶體不足,請最佳化代碼或升級執行個體規格。
Q:VS Code 編輯 Python 代碼時出現紅色波浪線格式錯誤提示怎麼辦?
在 DSW 的 WebIDE(VS Code)中編輯 Python 代碼時,即使文法正確也可能持續顯示紅色波浪線報錯。這通常是雲端 IDE 環境的解析問題,可按以下步驟排查:
將代碼剪下並粘貼到本地 VS Code 編輯器中檢查,確認是否為雲端 IDE 環境特有的解析問題。
如果本地檢查正常,將代碼重新上傳/粘貼回 DSW 開發機。
若問題依舊存在且影響開發,需提交工單由 PAI 支援人員進一步排查。
Q:DSW 執行個體是否支援更改地區?更換地區後資料會自動遷移嗎?
不支援直接更改 DSW 執行個體的地區或可用性區域,資料不會自動遷移。
若需跨地區使用,需先在原地區對當前 DSW 執行個體製作自訂鏡像備份資料,再在新地區基於該鏡像建立新執行個體。
若僅因資源緊缺報錯無法建立執行個體,可嘗試更換執行個體規格或等待資源釋放。此操作不涉及地區變更,資料不會丟失。
Q:更換 DSW 執行個體地區時如何保留原有資料?
需根據儲存方式區分:
未掛載外部儲存(僅使用系統硬碟):直接更換地區建立新執行個體會導致資料丟失。正確做法是在原地區先對當前運行中的 DSW 執行個體製作自訂鏡像進行備份,然後在新地區基於該鏡像建立新執行個體以恢複環境和資料。
已掛載 NAS/OSS 儲存:資料獨立於執行個體存在,無需通過製作鏡像備份。直接將 NAS/OSS 中的資料移轉至新地區即可。
Q:PAI-DSW 是否支援跨地區工作空間資料一鍵遷移?
DSW 暫不支援跨地區工作空間一鍵匯入功能。替代方案為:先將源工作空間的檔案上傳至檔案中轉站或Object Storage Service,再在目標地區的 DSW 執行個體中進行下載或掛載使用。
Q:DSW怎麼測試使用NVIDIA Nsight Compute(NCU)工具?
需滿足兩個條件:
執行個體類型:公用資源群組因安全隔離不支援NCU,需使用靈駿智算平台的GPU執行個體 。
暫停AMPerf服務:A10等非Hopper架構執行個體需先執行
/run/amperf/bin/amperfd profmetric -pause -t 600後再運行NCU 。
更多說明請參考效能分析工具Nsight。
Q:怎麼通過nvidia-smi命令查看特定GPU上啟動並執行進程ID?
在PAI-DSW容器環境中,由於PID命名空間隔離,因此nvidia-smi無法顯示進程資訊。
Q:DSW 是否支援 GPU 直通、載入 nvidia-drm 模組或開啟 P2P 通訊?
DSW 在此方面存在以下限制:
DSW 容器執行個體不支援載入 nvidia-drm 核心模組或 GPU 直通,僅通過
--gpus=all掛載 GPU 資源。GPU 卡間 P2P 通訊由底層硬體決定,平台不提供使用者級開關。若
nvidia-smi顯示 NS,則說明當前硬體不支援 P2P 通訊,無法通過軟體開啟。PAI 為託管服務,不支援使用者自行安裝驅動或打補丁以啟用 P2P 通訊,GPU 驅動及底層通訊能力由平台統一管理。
Q:多卡 GPU 顯存是否可以疊加使用?單卡顯存有什麼限制?
多卡 GPU(如 A10*2)的顯存不能簡單相加,因為 GPU 顯存是物理隔離的,程式看到的是多個獨立的顯存空間,而非一個巨大的顯存池。在常規訓練模式下,每張顯卡需獨立裝載完整的模型參數、梯度及最佳化器狀態,因此單卡顯存上限決定了能否運行;若模型所需顯存超過單卡容量(例如 A10 單卡 24 GB),即使有多張卡也會導致 OOM(CUDA out of memory)。