全部產品
Search
文件中心

:在RDS Custom AI節點中安裝Tesla驅動、CUDA和cuDNN

更新時間:Jul 19, 2025

在建立RDS Custom AI節點時,系統會預設安裝NVIDIA Tesla驅動、CUDA和cuDNN。如果當前情境下預設的NVIDIA Tesla驅動、CUDA和cuDNN版本已不再適用,您可以選擇卸載現有版本,並安裝所需的版本。

前提條件

已建立RDS Custom AI節點執行個體

卸載Tesla驅動、CUDA和cuDNN

本文以在Alibaba Cloud Linux 3作業系統下安裝Tesla驅動575.57.08、CUDA 12.9.0和cuDNN 9.10.2版本為例,具體操作如下所示。

  1. 串連RDS Custom執行個體

  2. 請執行以下命令,並根據介面提示進行操作,以卸載Tesla驅動。

    /usr/bin/nvidia-uninstall
  3. 卸載CUDA。

    方式一:手動刪除CUDA軟體包及相關設定檔

    1. 手動刪除CUDA軟體包和相關配置。

      # 卸載CUDA軟體包
      sudo dnf remove 'cuda*'
      
      # 刪除倉庫配置
      sudo rm /etc/yum.repos.d/cuda*.repo
      
      # 清理緩衝
      sudo dnf clean all
    2. 執行nvcc --version命令,確認CUDA是否已卸載。

      當提示 command not found,說明CUDA已成功卸載。

    方式二:通過uninstall_cuda檔案卸載

    說明

    不同CUDA版本,卸載命令可能存在差別,如果未找到cuda-uninstaller檔案,請到/usr/local/cuda/bin/目錄下查看是否存在uninstall_cuda開頭的檔案。

    • 如果有,則將命令中的cuda-uninstaller替換為該檔案名稱。

    • 如果沒有,請通過方式一卸載。

    /usr/local/cuda/bin/cuda-uninstaller
    rm -rf /usr/local/cuda-12.9

    當回顯出現Successfully時,表示卸載成功。

  4. 卸載cuDNN。

    1. 執行以下命令,查看已安裝的cuDNN相關安裝包的名稱。

      rpm -qa | grep cudnn

      返回結果樣本:

      cudnn9-cuda-12-9.10.2.21-1.x86_64
      libcudnn9-cuda-12-9.10.2.21-1.x86_64
      libcudnn9-static-cuda-12-9.10.2.21-1.x86_64
      ...
    2. 執行dnf remove 命令依次卸載目標安裝包。

      sudo dnf remove cudnn9-cuda-12-9.10.2.21-1.x86_64
      sudo dnf remove libcudnn9-cuda-12-9.10.2.21-1.x86_64
      sudo dnf remove libcudnn9-static-cuda-12-9.10.2.21-1.x86_64
    3. 執行以下命令,清理殘留依賴。

      sudo dnf autoremove
    4. 驗證卸載結果。

      rpm -qa | grep cudnn

      如果輸出為空白,則表示卸載成功。否則請繼續執行dnf remove卸載未完成的安裝包。

安裝Tesla驅動

步驟一:下載NVIDIA Tesla驅動

  1. 訪問NVIDIA驅動下載頁面

    說明

    關於安裝和配置NVIDIA驅動程式的更多資訊,請參見NVIDIA Driver Installation Quickstart Guide

  2. 根據RDS Custom執行個體規格,設定相應的搜尋條件,尋找並選擇適合的驅動程式。

  3. 找到待下載的驅動,單擊對應驅動後的查看

  4. 在待下載驅動的詳情頁面,按右鍵下載並複製連結地址。

  5. 串連RDS Custom執行個體

  6. 執行以下命令,下載驅動安裝包。

    命令樣本中的驅動下載地址為您在步驟4中擷取的驅動下載連結。

    wget https://us.download.nvidia.com/tesla/575.57.08/NVIDIA-Linux-x86_64-575.57.08.run

步驟二:安裝NVIDIA Tesla驅動

Alibaba Cloud Linux/CentOS

  1. 執行以下命令,查詢GPU執行個體中是否已安裝kernel-devel和kernel-headers包。

    sudo rpm  -qa | grep $(uname -r)
    • 如果回顯類似如下資訊,即包含了kernel-devel和kernel-headers包的版本資訊,表示已安裝。

      kernel-3.10.0-1062.18.1.el7.x86_64
      kernel-devel-3.10.0-1062.18.1.el7.x86_64
      kernel-headers-3.10.0-1062.18.1.el7.x86_64
    • 如果在回顯資訊中,您沒有找到kernel-devel-*kernel-headers-*內容,您需要自行下載並安裝kernel對應版本的kernel-develkernel-headers包。

      重要

      kernel-devel和kernel版本不一致會導致在安裝driver rpm過程中driver編譯出錯。因此,請您確認回顯資訊中kernel-*的版本號碼後,再下載對應版本的kernel-devel。在樣本回顯資訊中,kernel的版本號碼為3.10.0-1062.18.1.el7.x86_64。

  2. 授權並安裝Tesla驅動。

    以作業系統是Linux 64-bit的驅動為例,推薦您使用.run形式的Tesla驅動,例如:NVIDIA-Linux-x86_64-xxxx.run。分別執行以下命令,授權並安裝Tesla驅動。

    說明

    如果您使用的是.deb或.rpm等其他形式的Tesla驅動,具體安裝方法,請參見NVIDIA CUDA Installation Guide for Linux

    # 授權
    sudo chmod +x NVIDIA-Linux-x86_64-xxxx.run
    # 安裝
    sudo sh NVIDIA-Linux-x86_64-xxxx.run
  3. 執行以下命令,查看Tesla驅動是否安裝成功。

    nvidia-smi

    回顯出現Tesla驅動的詳細資料時,表示安裝成功。

    image

  4. (可選)通過NVIDIA Persistence Daemon方式開啟Persistence-M屬性。

    Tesla驅動安裝完成後,Persistence-M預設為關閉(off)狀態,Tesla驅動在開啟Persistence-M屬性狀態下效能更穩定。為了業務更穩定地進行,建議您通過NVIDIA Persistence Daemon方式開啟Persistence-M屬性。更多資訊,請參見Persistence Daemon

    說明
    1. 執行以下命令,運行NVIDIA Persistence Daemon。

      sudo nvidia-persistenced --user username 
      # username為您的使用者名稱。
    2. 執行以下命令,查看Persistence-M屬性狀態。

      nvidia-smi

      回顯資訊類似如下所示,表示Persistence-M為開啟(on)狀態。

      image

  5. (可選)重啟系統後開啟Persistence-M屬性。

    如果系統重啟,則會導致Persistence-M開啟(on)狀態失效,您可以按照以下操作重新開啟Persistence-M屬性。

    通過安裝Tesla驅動安裝包,將NVIDIA提供的安裝指令碼(例如樣本指令碼和安裝程式指令碼)安裝到/usr/share/doc/NVIDIA_GLX-1.0/samples/nvidia-persistenced-init.tar.bz2路徑下。

    1. 執行以下命令,解壓並安裝NVIDIA提供的安裝指令碼。

      cd /usr/share/doc/NVIDIA_GLX-1.0/samples/
      sudo tar xf nvidia-persistenced-init.tar.bz2
      cd nvidia-persistenced-init
      sudo sh install.sh
    2. 執行以下命令,查看NVIDIA Persistence Daemon是否正常運行。

      sudo systemctl status nvidia-persistenced

      回顯資訊類似如下所示,表示NVIDIA Persistence Daemon正常運行。

      image

      說明

      您可以根據您的作業系統適配NVIDIA Persistence Daemon安裝指令碼以保證其正常工作。

    3. 執行以下命令,再次確認Persistence-M屬性為開啟(on)狀態。

      nvidia-smi
    4. (可選)執行以下命令,關閉NVIDIA Persistence Daemon。

      如果目前無需運行NVIDIA Persistence Daemon,您可以選擇關閉NVIDIA Persistence Daemon。

      sudo systemctl stop nvidia-persistenced
      sudo systemctl disable nvidia-persistenced

Ubuntu及其他

  1. 授權並安裝Tesla驅動。

    以作業系統是Linux 64-bit的驅動為例,推薦您使用.run形式的Tesla驅動,例如:NVIDIA-Linux-x86_64-xxxx.run。分別執行以下命令,授權並安裝Tesla驅動。

    說明

    如果您使用的是.deb或.rpm等其他形式的Tesla驅動,具體安裝方法,請參見NVIDIA CUDA Installation Guide for Linux

    # 授權
    sudo chmod +x NVIDIA-Linux-x86_64-xxxx.run
    # 安裝
    sudo sh NVIDIA-Linux-x86_64-xxxx.run
  2. 執行以下命令,查看Tesla驅動是否安裝成功。

    nvidia-smi

    回顯出現Tesla驅動的詳細資料時,表示安裝成功。

    image

  3. (可選)通過NVIDIA Persistence Daemon方式開啟Persistence-M屬性。

    Tesla驅動安裝完成後,Persistence-M預設為關閉(off)狀態,Tesla驅動在開啟Persistence-M屬性狀態下效能更穩定。為了業務更穩定地進行,建議您通過NVIDIA Persistence Daemon方式開啟Persistence-M屬性。更多資訊,請參見Persistence Daemon

    說明
    1. 執行以下命令,運行NVIDIA Persistence Daemon。

      sudo nvidia-persistenced --user username 
      # username為您的使用者名稱。
    2. 執行以下命令,查看Persistence-M屬性狀態。

      nvidia-smi

      回顯資訊類似如下所示,表示Persistence-M為開啟(on)狀態。

      image

  4. (可選)重啟系統後開啟Persistence-M屬性。

    如果系統重啟,則會導致Persistence-M開啟(on)狀態失效,您可以按照以下操作重新開啟Persistence-M屬性。

    通過安裝Tesla驅動安裝包,將NVIDIA提供的安裝指令碼(例如樣本指令碼和安裝程式指令碼)安裝到/usr/share/doc/NVIDIA_GLX-1.0/samples/nvidia-persistenced-init.tar.bz2路徑下。

    1. 執行以下命令,解壓並安裝NVIDIA提供的安裝指令碼。

      cd /usr/share/doc/NVIDIA_GLX-1.0/samples/
      sudo tar xf nvidia-persistenced-init.tar.bz2
      cd nvidia-persistenced-init
      sudo sh install.sh
    2. 執行以下命令,查看NVIDIA Persistence Daemon是否正常運行。

      sudo systemctl status nvidia-persistenced

      回顯資訊類似如下所示,表示NVIDIA Persistence Daemon正常運行。

      image

      說明

      您可以根據您的作業系統適配NVIDIA Persistence Daemon安裝指令碼以保證其正常工作。

    3. 執行以下命令,再次確認Persistence-M屬性為開啟(on)狀態。

      nvidia-smi
    4. (可選)執行以下命令,關閉NVIDIA Persistence Daemon。

      如果目前無需運行NVIDIA Persistence Daemon,您可以選擇關閉NVIDIA Persistence Daemon。

      sudo systemctl stop nvidia-persistenced
      sudo systemctl disable nvidia-persistenced

安裝CUDA

  1. 擷取CUDA安裝包。

    1. 進入CUDA Toolkit Archive頁面。

    2. 單擊驅動對應的CUDA版本。

    3. Operating System中按照需要選擇作業系統、架構或版本等參數項,擷取對應CUDA安裝包的下載地址和安裝命令。

      說明

      本文以CUDA 12.9.0版本和Linux作業系統RHEL 8(Alibaba Cloud Linux 3相容RHEL 8)為例。

  2. 安裝CUDA。

    1. 串連RDS Custom執行個體

    2. 依次執行如下命令,安裝CUDA。

      wget https://developer.download.nvidia.com/compute/cuda/12.9.0/local_installers/cuda-repo-rhel8-12-9-local-12.9.0_575.51.03-1.x86_64.rpm
      sudo rpm -i cuda-repo-rhel8-12-9-local-12.9.0_575.51.03-1.x86_64.rpm
      sudo dnf clean all
      sudo dnf -y install cuda-toolkit-12-9
    3. 依次執行以下命令,配置CUDA環境變數。

      echo 'export PATH=/usr/local/cuda/bin:$PATH' | sudo tee /etc/profile.d/cuda.sh
      source /etc/profile
  3. 檢查CUDA是否成功安裝。

    執行nvcc -V命令,檢查CUDA安裝版本是否正確。

    返回結果樣本:

    nvcc: NVIDIA (R) Cuda compiler driver
    Copyright (c) 2005-2025 NVIDIA Corporation
    Built on Wed_Apr__9_19:24:57_PDT_2025
    Cuda compilation tools, release 12.9, V12.9.41
    Build cuda_12.9.r12.9/compiler.35813241_0

安裝cuDNN

  1. 擷取cuDNN安裝包。

    1. 進入CUDA Deep Neural Network (cuDNN) | NVIDIA Developer頁面。

    2. 單擊Download cuDNN Library

    3. Operating System中按照需要選擇作業系統、架構或版本等參數項,擷取對應cuDNN安裝包的下載地址和安裝命令。

      預設下載最新版本的cuDNN,您也可以單擊Archive of Previous Releases,選擇需要的版本進行下載。

      說明

      本文以cuDNN 9.10.2版本和Linux作業系統RHEL 8(Alibaba Cloud Linux 3相容RHEL 8)為例。

  2. 安裝cuDNN。

    1. 串連RDS Custom執行個體

    2. 依次執行如下命令,安裝cuDNN。

      wget https://developer.download.nvidia.com/compute/cudnn/9.10.2/local_installers/cudnn-local-repo-rhel8-9.10.2-1.0-1.x86_64.rpm
      sudo rpm -i cudnn-local-repo-rhel8-9.10.2-1.0-1.x86_64.rpm
      sudo dnf clean all
      sudo dnf -y install cudnn-cuda-12
  3. (可選)如果系統預設將cudnn.hlibcudnn.so*cudnn_version.h安裝在/usr/include/目錄下,需要執行以下命令,將這些檔案連結到/usr/local/cuda/對應的目錄下。

    1. 執行以下命令,將libcudnn.so*等cuDNN庫檔案連結到 /usr/local/cuda/lib64/

      sudo ln -s /usr/lib64/libcudnn.so.9.10.2 /usr/local/cuda/lib64/libcudnn.so.9.10.2
      sudo ln -s /usr/local/cuda/lib64/libcudnn.so.9.10.2 /usr/local/cuda/lib64/libcudnn.so.9
      sudo ln -s /usr/local/cuda/lib64/libcudnn.so.9 /usr/local/cuda/lib64/libcudnn.so

      執行ls -l /usr/local/cuda/lib64/libcudnn.so*驗證鏈結接結果。

    2. 執行以下命令,將cudnn.hcudnn_version.h連結到/usr/local/cuda/include下。

      sudo ln -s /usr/include/cudnn.h /usr/local/cuda/include/cudnn.h
      sudo ln -s /usr/include/cudnn_version.h /usr/local/cuda/include/cudnn_version.h

      執行ls -l /usr/local/cuda/include/cudnn*驗證鏈結接結果。

  4. 檢查cuDNN是否成功安裝。

    cat /usr/local/cuda/include/cudnn_version.h | grep CUDNN_MAJOR -A 2

    返回結果樣本:

    #define CUDNN_MAJOR 9
    #define CUDNN_MINOR 10
    #define CUDNN_PATCHLEVEL 2
    --

相關文檔

RDS Custom簡介