在建立RDS Custom AI節點時,系統會預設安裝NVIDIA Tesla驅動、CUDA和cuDNN。如果當前情境下預設的NVIDIA Tesla驅動、CUDA和cuDNN版本已不再適用,您可以選擇卸載現有版本,並安裝所需的版本。
前提條件
卸載Tesla驅動、CUDA和cuDNN
本文以在Alibaba Cloud Linux 3作業系統下安裝Tesla驅動575.57.08、CUDA 12.9.0和cuDNN 9.10.2版本為例,具體操作如下所示。
請執行以下命令,並根據介面提示進行操作,以卸載Tesla驅動。
/usr/bin/nvidia-uninstall卸載CUDA。
方式一:手動刪除CUDA軟體包及相關設定檔
手動刪除CUDA軟體包和相關配置。
# 卸載CUDA軟體包 sudo dnf remove 'cuda*' # 刪除倉庫配置 sudo rm /etc/yum.repos.d/cuda*.repo # 清理緩衝 sudo dnf clean all執行
nvcc --version命令,確認CUDA是否已卸載。當提示
command not found,說明CUDA已成功卸載。
方式二:通過uninstall_cuda檔案卸載
說明不同CUDA版本,卸載命令可能存在差別,如果未找到
cuda-uninstaller檔案,請到/usr/local/cuda/bin/目錄下查看是否存在uninstall_cuda開頭的檔案。如果有,則將命令中的
cuda-uninstaller替換為該檔案名稱。如果沒有,請通過方式一卸載。
/usr/local/cuda/bin/cuda-uninstaller rm -rf /usr/local/cuda-12.9當回顯出現
Successfully時,表示卸載成功。卸載cuDNN。
執行以下命令,查看已安裝的cuDNN相關安裝包的名稱。
rpm -qa | grep cudnn返回結果樣本:
cudnn9-cuda-12-9.10.2.21-1.x86_64 libcudnn9-cuda-12-9.10.2.21-1.x86_64 libcudnn9-static-cuda-12-9.10.2.21-1.x86_64 ...執行
dnf remove命令依次卸載目標安裝包。sudo dnf remove cudnn9-cuda-12-9.10.2.21-1.x86_64 sudo dnf remove libcudnn9-cuda-12-9.10.2.21-1.x86_64 sudo dnf remove libcudnn9-static-cuda-12-9.10.2.21-1.x86_64執行以下命令,清理殘留依賴。
sudo dnf autoremove驗證卸載結果。
rpm -qa | grep cudnn如果輸出為空白,則表示卸載成功。否則請繼續執行
dnf remove卸載未完成的安裝包。
安裝Tesla驅動
步驟一:下載NVIDIA Tesla驅動
訪問NVIDIA驅動下載頁面。
說明關於安裝和配置NVIDIA驅動程式的更多資訊,請參見NVIDIA Driver Installation Quickstart Guide。
根據RDS Custom執行個體規格,設定相應的搜尋條件,尋找並選擇適合的驅動程式。
找到待下載的驅動,單擊對應驅動後的查看。
在待下載驅動的詳情頁面,按右鍵下載並複製連結地址。
執行以下命令,下載驅動安裝包。
命令樣本中的驅動下載地址為您在步驟4中擷取的驅動下載連結。
wget https://us.download.nvidia.com/tesla/575.57.08/NVIDIA-Linux-x86_64-575.57.08.run
步驟二:安裝NVIDIA Tesla驅動
Alibaba Cloud Linux/CentOS
執行以下命令,查詢GPU執行個體中是否已安裝kernel-devel和kernel-headers包。
sudo rpm -qa | grep $(uname -r)如果回顯類似如下資訊,即包含了kernel-devel和kernel-headers包的版本資訊,表示已安裝。
kernel-3.10.0-1062.18.1.el7.x86_64 kernel-devel-3.10.0-1062.18.1.el7.x86_64 kernel-headers-3.10.0-1062.18.1.el7.x86_64如果在回顯資訊中,您沒有找到kernel-devel-*和kernel-headers-*內容,您需要自行下載並安裝kernel對應版本的kernel-devel和kernel-headers包。
重要kernel-devel和kernel版本不一致會導致在安裝driver rpm過程中driver編譯出錯。因此,請您確認回顯資訊中kernel-*的版本號碼後,再下載對應版本的kernel-devel。在樣本回顯資訊中,kernel的版本號碼為3.10.0-1062.18.1.el7.x86_64。
授權並安裝Tesla驅動。
以作業系統是Linux 64-bit的驅動為例,推薦您使用.run形式的Tesla驅動,例如:NVIDIA-Linux-x86_64-xxxx.run。分別執行以下命令,授權並安裝Tesla驅動。
說明如果您使用的是.deb或.rpm等其他形式的Tesla驅動,具體安裝方法,請參見NVIDIA CUDA Installation Guide for Linux。
# 授權 sudo chmod +x NVIDIA-Linux-x86_64-xxxx.run # 安裝 sudo sh NVIDIA-Linux-x86_64-xxxx.run執行以下命令,查看Tesla驅動是否安裝成功。
nvidia-smi回顯出現Tesla驅動的詳細資料時,表示安裝成功。

(可選)通過NVIDIA Persistence Daemon方式開啟Persistence-M屬性。
Tesla驅動安裝完成後,Persistence-M預設為關閉(
off)狀態,Tesla驅動在開啟Persistence-M屬性狀態下效能更穩定。為了業務更穩定地進行,建議您通過NVIDIA Persistence Daemon方式開啟Persistence-M屬性。更多資訊,請參見Persistence Daemon。說明Persistence-M(即Persistence Mode)是使用者可設定的驅動程式屬性術語,該屬性可以使目標GPU保持初始化狀態。
通過
nvidia-smi -pm 1開啟Persistence-M屬性,會導致執行個體重啟後失效等問題,更多資訊,請參見重啟GPU執行個體後導致Persistence Mode屬性開啟失效,同時ECC狀態或MIG功能設定也失敗。推薦您通過NVIDIA Persistence Daemon方式開啟Persistence-M屬性。
執行以下命令,運行NVIDIA Persistence Daemon。
sudo nvidia-persistenced --user username # username為您的使用者名稱。執行以下命令,查看Persistence-M屬性狀態。
nvidia-smi回顯資訊類似如下所示,表示Persistence-M為開啟(
on)狀態。
(可選)重啟系統後開啟Persistence-M屬性。
如果系統重啟,則會導致Persistence-M開啟(
on)狀態失效,您可以按照以下操作重新開啟Persistence-M屬性。通過安裝Tesla驅動安裝包,將NVIDIA提供的安裝指令碼(例如樣本指令碼和安裝程式指令碼)安裝到
/usr/share/doc/NVIDIA_GLX-1.0/samples/nvidia-persistenced-init.tar.bz2路徑下。執行以下命令,解壓並安裝NVIDIA提供的安裝指令碼。
cd /usr/share/doc/NVIDIA_GLX-1.0/samples/ sudo tar xf nvidia-persistenced-init.tar.bz2 cd nvidia-persistenced-init sudo sh install.sh執行以下命令,查看NVIDIA Persistence Daemon是否正常運行。
sudo systemctl status nvidia-persistenced回顯資訊類似如下所示,表示NVIDIA Persistence Daemon正常運行。
說明您可以根據您的作業系統適配NVIDIA Persistence Daemon安裝指令碼以保證其正常工作。
執行以下命令,再次確認Persistence-M屬性為開啟(
on)狀態。nvidia-smi(可選)執行以下命令,關閉NVIDIA Persistence Daemon。
如果目前無需運行NVIDIA Persistence Daemon,您可以選擇關閉NVIDIA Persistence Daemon。
sudo systemctl stop nvidia-persistenced sudo systemctl disable nvidia-persistenced
Ubuntu及其他
授權並安裝Tesla驅動。
以作業系統是Linux 64-bit的驅動為例,推薦您使用.run形式的Tesla驅動,例如:NVIDIA-Linux-x86_64-xxxx.run。分別執行以下命令,授權並安裝Tesla驅動。
說明如果您使用的是.deb或.rpm等其他形式的Tesla驅動,具體安裝方法,請參見NVIDIA CUDA Installation Guide for Linux。
# 授權 sudo chmod +x NVIDIA-Linux-x86_64-xxxx.run # 安裝 sudo sh NVIDIA-Linux-x86_64-xxxx.run執行以下命令,查看Tesla驅動是否安裝成功。
nvidia-smi回顯出現Tesla驅動的詳細資料時,表示安裝成功。

(可選)通過NVIDIA Persistence Daemon方式開啟Persistence-M屬性。
Tesla驅動安裝完成後,Persistence-M預設為關閉(
off)狀態,Tesla驅動在開啟Persistence-M屬性狀態下效能更穩定。為了業務更穩定地進行,建議您通過NVIDIA Persistence Daemon方式開啟Persistence-M屬性。更多資訊,請參見Persistence Daemon。說明Persistence-M(即Persistence Mode)是使用者可設定的驅動程式屬性術語,該屬性可以使目標GPU保持初始化狀態。
通過
nvidia-smi -pm 1開啟Persistence-M屬性,會導致執行個體重啟後失效等問題,更多資訊,請參見重啟GPU執行個體後導致Persistence Mode屬性開啟失效,同時ECC狀態或MIG功能設定也失敗。推薦您通過NVIDIA Persistence Daemon方式開啟Persistence-M屬性。
執行以下命令,運行NVIDIA Persistence Daemon。
sudo nvidia-persistenced --user username # username為您的使用者名稱。執行以下命令,查看Persistence-M屬性狀態。
nvidia-smi回顯資訊類似如下所示,表示Persistence-M為開啟(
on)狀態。
(可選)重啟系統後開啟Persistence-M屬性。
如果系統重啟,則會導致Persistence-M開啟(
on)狀態失效,您可以按照以下操作重新開啟Persistence-M屬性。通過安裝Tesla驅動安裝包,將NVIDIA提供的安裝指令碼(例如樣本指令碼和安裝程式指令碼)安裝到
/usr/share/doc/NVIDIA_GLX-1.0/samples/nvidia-persistenced-init.tar.bz2路徑下。執行以下命令,解壓並安裝NVIDIA提供的安裝指令碼。
cd /usr/share/doc/NVIDIA_GLX-1.0/samples/ sudo tar xf nvidia-persistenced-init.tar.bz2 cd nvidia-persistenced-init sudo sh install.sh執行以下命令,查看NVIDIA Persistence Daemon是否正常運行。
sudo systemctl status nvidia-persistenced回顯資訊類似如下所示,表示NVIDIA Persistence Daemon正常運行。
說明您可以根據您的作業系統適配NVIDIA Persistence Daemon安裝指令碼以保證其正常工作。
執行以下命令,再次確認Persistence-M屬性為開啟(
on)狀態。nvidia-smi(可選)執行以下命令,關閉NVIDIA Persistence Daemon。
如果目前無需運行NVIDIA Persistence Daemon,您可以選擇關閉NVIDIA Persistence Daemon。
sudo systemctl stop nvidia-persistenced sudo systemctl disable nvidia-persistenced
安裝CUDA
擷取CUDA安裝包。
進入CUDA Toolkit Archive頁面。
單擊驅動對應的CUDA版本。
在Operating System中按照需要選擇作業系統、架構或版本等參數項,擷取對應CUDA安裝包的下載地址和安裝命令。
說明本文以CUDA 12.9.0版本和Linux作業系統RHEL 8(Alibaba Cloud Linux 3相容RHEL 8)為例。
安裝CUDA。
依次執行如下命令,安裝CUDA。
wget https://developer.download.nvidia.com/compute/cuda/12.9.0/local_installers/cuda-repo-rhel8-12-9-local-12.9.0_575.51.03-1.x86_64.rpm sudo rpm -i cuda-repo-rhel8-12-9-local-12.9.0_575.51.03-1.x86_64.rpm sudo dnf clean all sudo dnf -y install cuda-toolkit-12-9依次執行以下命令,配置CUDA環境變數。
echo 'export PATH=/usr/local/cuda/bin:$PATH' | sudo tee /etc/profile.d/cuda.sh source /etc/profile
檢查CUDA是否成功安裝。
執行
nvcc -V命令,檢查CUDA安裝版本是否正確。返回結果樣本:
nvcc: NVIDIA (R) Cuda compiler driver Copyright (c) 2005-2025 NVIDIA Corporation Built on Wed_Apr__9_19:24:57_PDT_2025 Cuda compilation tools, release 12.9, V12.9.41 Build cuda_12.9.r12.9/compiler.35813241_0
安裝cuDNN
擷取cuDNN安裝包。
單擊Download cuDNN Library。
在Operating System中按照需要選擇作業系統、架構或版本等參數項,擷取對應cuDNN安裝包的下載地址和安裝命令。
預設下載最新版本的cuDNN,您也可以單擊Archive of Previous Releases,選擇需要的版本進行下載。
說明本文以cuDNN 9.10.2版本和Linux作業系統RHEL 8(Alibaba Cloud Linux 3相容RHEL 8)為例。
安裝cuDNN。
依次執行如下命令,安裝cuDNN。
wget https://developer.download.nvidia.com/compute/cudnn/9.10.2/local_installers/cudnn-local-repo-rhel8-9.10.2-1.0-1.x86_64.rpm sudo rpm -i cudnn-local-repo-rhel8-9.10.2-1.0-1.x86_64.rpm sudo dnf clean all sudo dnf -y install cudnn-cuda-12
(可選)如果系統預設將
cudnn.h、libcudnn.so*和cudnn_version.h安裝在/usr/include/目錄下,需要執行以下命令,將這些檔案連結到/usr/local/cuda/對應的目錄下。執行以下命令,將libcudnn.so*等cuDNN庫檔案連結到
/usr/local/cuda/lib64/。sudo ln -s /usr/lib64/libcudnn.so.9.10.2 /usr/local/cuda/lib64/libcudnn.so.9.10.2 sudo ln -s /usr/local/cuda/lib64/libcudnn.so.9.10.2 /usr/local/cuda/lib64/libcudnn.so.9 sudo ln -s /usr/local/cuda/lib64/libcudnn.so.9 /usr/local/cuda/lib64/libcudnn.so執行
ls -l /usr/local/cuda/lib64/libcudnn.so*驗證鏈結接結果。執行以下命令,將
cudnn.h和cudnn_version.h連結到/usr/local/cuda/include下。sudo ln -s /usr/include/cudnn.h /usr/local/cuda/include/cudnn.h sudo ln -s /usr/include/cudnn_version.h /usr/local/cuda/include/cudnn_version.h執行
ls -l /usr/local/cuda/include/cudnn*驗證鏈結接結果。
檢查cuDNN是否成功安裝。
cat /usr/local/cuda/include/cudnn_version.h | grep CUDNN_MAJOR -A 2返回結果樣本:
#define CUDNN_MAJOR 9 #define CUDNN_MINOR 10 #define CUDNN_PATCHLEVEL 2 --