Ao criar um nó RDS Custom AI, o sistema instala por padrão o driver NVIDIA Tesla, CUDA e cuDNN. Caso as versões padrão desses componentes não atendam mais aos seus requisitos, desinstale as versões existentes e instale as desejadas.
Pré-requisitos
Desinstalar o driver Tesla, CUDA e cuDNN
Este tópico usa como exemplo a instalação do driver Tesla 575.57.08, CUDA 12.9.0 e cuDNN 9.10.2 no Alibaba Cloud Linux 3. O procedimento é o seguinte:
-
Execute o comando abaixo e siga as instruções na tela para desinstalar o driver Tesla.
/usr/bin/nvidia-uninstall -
Desinstale o CUDA.
Método 1: Excluir manualmente o pacote CUDA e os arquivos de configuração relacionados
-
Exclua manualmente o pacote CUDA e as configurações associadas.
# Uninstall CUDA packages sudo dnf remove 'cuda*' # Delete repository configurations sudo rm /etc/yum.repos.d/cuda*.repo # Clean cache sudo dnf clean all -
Execute o comando
nvcc --versionpara confirmar se o CUDA foi desinstalado.Se a mensagem
command not foundfor exibida, o CUDA foi desinstalado com sucesso.
Método 2: Desinstalar usando o arquivo uninstall_cuda
NotaDiferentes versões do CUDA podem ter comandos de desinstalação distintos. Se o arquivo
cuda-uninstallernão for encontrado, verifique se existe algum arquivo que comece comuninstall_cudano diretório/usr/local/cuda/bin/.Caso exista, substitua
cuda-uninstallerno comando pelo nome desse arquivo.Se não existir, desinstale pelo Método 1.
/usr/local/cuda/bin/cuda-uninstaller rm -rf /usr/local/cuda-12.9Quando
Successfullyaparecer na saída, a desinstalação foi concluída com êxito. -
-
Desinstale o cuDNN.
-
Execute o comando a seguir para verificar os nomes dos pacotes relacionados ao cuDNN instalados.
rpm -qa | grep cudnnO resultado retornado será semelhante a:
cudnn9-cuda-12-9.10.2.21-1.x86_64 libcudnn9-cuda-12-9.10.2.21-1.x86_64 libcudnn9-static-cuda-12-9.10.2.21-1.x86_64 ... -
Use o comando
dnf removepara desinstalar cada pacote alvo.sudo dnf remove cudnn9-cuda-12-9.10.2.21-1.x86_64 sudo dnf remove libcudnn9-cuda-12-9.10.2.21-1.x86_64 sudo dnf remove libcudnn9-static-cuda-12-9.10.2.21-1.x86_64 -
Limpe as dependências remanescentes executando o comando abaixo.
sudo dnf autoremove -
Verifique o resultado da desinstalação.
rpm -qa | grep cudnnSe a saída estiver vazia, a desinstalação foi bem-sucedida. Caso contrário, continue executando
dnf removepara remover os pacotes restantes.
-
Instalar o driver Tesla
Etapa 1: Baixar o driver NVIDIA Tesla
-
Acesse a página de download de drivers da NVIDIA.
NotaPara mais informações sobre instalação e configuração de drivers NVIDIA, consulte o Guia rápido de instalação de drivers NVIDIA.
Defina os critérios de busca adequados com base no tipo de instância RDS Custom para localizar e selecionar o driver apropriado.
Localize o driver desejado e clique em View ao lado do driver correspondente.
Na página do produto do driver que você deseja baixar, clique com o botão direito em Download e copie o endereço do link.
-
Execute o comando a seguir para baixar o pacote de instalação do driver.
A URL de download do driver no comando de exemplo corresponde ao link obtido na Etapa 4.
wget https://us.download.nvidia.com/tesla/575.57.08/NVIDIA-Linux-x86_64-575.57.08.run
Etapa 2: Instalar o driver NVIDIA Tesla
Alibaba Cloud Linux/CentOS
-
Verifique se os pacotes kernel-devel e kernel-headers estão instalados na instância acelerada por GPU executando o comando abaixo.
sudo rpm -qa | grep $(uname -r)-
Se a saída do comando incluir informações de versão dos pacotes kernel-devel e kernel-headers, eles já estão instalados. Exemplo de saída:
kernel-3.10.0-1062.18.1.el7.x86_64 kernel-devel-3.10.0-1062.18.1.el7.x86_64 kernel-headers-3.10.0-1062.18.1.el7.x86_64 -
Caso kernel-devel- e kernel-headers- não apareçam na saída, baixe e instale os pacotes kernel-devel e kernel-headers compatíveis com a versão do seu kernel.
ImportanteSe a versão do kernel-devel divergir da versão do kernel, ocorrerá um erro de compilação durante a instalação do RPM Package Manager (RPM) do driver. Por isso, confirme o número da versão de *kernel-** na saída do comando antes de baixar o kernel-devel correspondente. No exemplo acima, a versão do kernel é 3.10.0-1062.18.1.el7.x86_64.
-
-
Conceda permissões ao pacote de instalação do driver Tesla e proceda com a instalação.
Neste exemplo, utiliza-se um driver Tesla Linux de 64 bits. Recomendamos o uso de um pacote de instalação .run para o driver Tesla, como o pacote NVIDIA-Linux-x86_64-xxxx.run. Execute os comandos a seguir para conceder permissões de execução ao pacote e instalar o driver.
NotaPara drivers Tesla em outros formatos, como .deb ou .rpm, consulte o Guia de instalação do NVIDIA CUDA para Linux para obter o método específico de instalação.
# Grant permissions sudo chmod +x NVIDIA-Linux-x86_64-xxxx.run # Install sudo sh NVIDIA-Linux-x86_64-xxxx.run -
Confirme a instalação do driver Tesla com o seguinte comando:
nvidia-smiA instalação foi bem-sucedida se as informações detalhadas do driver Tesla forem exibidas na saída.

-
(Opcional) Ative o Persistence-M por meio do NVIDIA Persistence Daemon.
Após a instalação do driver Tesla, o Persistence-M vem desativado (
off) por padrão. O driver Tesla apresenta maior estabilidade com o Persistence-M ativado. Para garantir a continuidade dos negócios, recomendamos ativar o Persistence-M usando o NVIDIA Persistence Daemon. Para mais detalhes, consulte Persistence Daemon.NotaPersistence-M é uma propriedade configurável pelo usuário que mantém a GPU no estado inicializado.
Ativar o Persistence-M via
nvidia-smi -pm 1pode causar problemas, como a perda da configuração após reiniciar a instância. Para mais informações, veja O Persistence Mode torna-se inválido após reiniciar uma instância acelerada por GPU, e as configurações de status ECC ou recurso MIG também falham. Recomendamos ativar o Persistence-M utilizando o NVIDIA Persistence Daemon.
-
Inicie o NVIDIA Persistence Daemon executando o comando:
sudo nvidia-persistenced --user username # username is your username. -
Visualize o status do Persistence-M com o comando:
nvidia-smiSe a saída do comando corresponder à imagem abaixo, o Persistence-M está ativado (
on).
-
(Opcional) Reative o Persistence-M após reinicialização do sistema.
Se o sistema for reiniciado, o Persistence-M será desativado (
on). Siga os passos abaixo para reativá-lo.A instalação do pacote do driver Tesla inclui scripts fornecidos pela NVIDIA (como scripts de exemplo e instaladores) no caminho
/usr/share/doc/NVIDIA_GLX-1.0/samples/nvidia-persistenced-init.tar.bz2.-
Descompacte e instale o script fornecido pela NVIDIA executando os comandos:
cd /usr/share/doc/NVIDIA_GLX-1.0/samples/ sudo tar xf nvidia-persistenced-init.tar.bz2 cd nvidia-persistenced-init sudo sh install.sh -
Verifique se o NVIDIA Persistence Daemon está funcionando corretamente:
sudo systemctl status nvidia-persistencedO NVIDIA Persistence Daemon estará operando normalmente se a saída for semelhante à imagem a seguir.
NotaAdapte o script de instalação do NVIDIA Persistence Daemon conforme seu sistema operacional para assegurar seu funcionamento adequado.
-
Confirme novamente se o Persistence-M está ativado (
on) executando:nvidia-smi -
(Opcional) Desative o NVIDIA Persistence Daemon se necessário.
Desative o NVIDIA Persistence Daemon conforme sua necessidade.
sudo systemctl stop nvidia-persistenced sudo systemctl disable nvidia-persistenced
-
Ubuntu e outros
-
Conceda permissões ao pacote de instalação do driver Tesla e proceda com a instalação.
Neste exemplo, utiliza-se um driver Tesla Linux de 64 bits. Recomendamos o uso de um pacote de instalação .run para o driver Tesla, como o pacote NVIDIA-Linux-x86_64-xxxx.run. Execute os comandos a seguir para conceder permissões de execução ao pacote e instalar o driver.
NotaPara drivers Tesla em outros formatos, como .deb ou .rpm, consulte o Guia de instalação do NVIDIA CUDA para Linux para obter o método específico de instalação.
# Grant permissions sudo chmod +x NVIDIA-Linux-x86_64-xxxx.run # Install sudo sh NVIDIA-Linux-x86_64-xxxx.run -
Confirme a instalação do driver Tesla com o seguinte comando:
nvidia-smiA instalação foi bem-sucedida se as informações detalhadas do driver Tesla forem exibidas na saída.

-
(Opcional) Ative o Persistence-M por meio do NVIDIA Persistence Daemon.
Após a instalação do driver Tesla, o Persistence-M vem desativado (
off) por padrão. O driver Tesla apresenta maior estabilidade com o Persistence-M ativado. Para garantir a continuidade dos negócios, recomendamos ativar o Persistence-M usando o NVIDIA Persistence Daemon. Para mais detalhes, consulte Persistence Daemon.NotaPersistence-M é uma propriedade configurável pelo usuário que mantém a GPU no estado inicializado.
Ativar o Persistence-M via
nvidia-smi -pm 1pode causar problemas, como a perda da configuração após reiniciar a instância. Para mais informações, veja O Persistence Mode torna-se inválido após reiniciar uma instância acelerada por GPU, e as configurações de status ECC ou recurso MIG também falham. Recomendamos ativar o Persistence-M utilizando o NVIDIA Persistence Daemon.
-
Inicie o NVIDIA Persistence Daemon executando o comando:
sudo nvidia-persistenced --user username # username is your username. -
Visualize o status do Persistence-M com o comando:
nvidia-smiSe a saída do comando corresponder à imagem abaixo, o Persistence-M está ativado (
on).
-
(Opcional) Reative o Persistence-M após reinicialização do sistema.
Se o sistema for reiniciado, o Persistence-M será desativado (
on). Siga os passos abaixo para reativá-lo.A instalação do pacote do driver Tesla inclui scripts fornecidos pela NVIDIA (como scripts de exemplo e instaladores) no caminho
/usr/share/doc/NVIDIA_GLX-1.0/samples/nvidia-persistenced-init.tar.bz2.-
Descompacte e instale o script fornecido pela NVIDIA executando os comandos:
cd /usr/share/doc/NVIDIA_GLX-1.0/samples/ sudo tar xf nvidia-persistenced-init.tar.bz2 cd nvidia-persistenced-init sudo sh install.sh -
Verifique se o NVIDIA Persistence Daemon está funcionando corretamente:
sudo systemctl status nvidia-persistencedO NVIDIA Persistence Daemon estará operando normalmente se a saída for semelhante à imagem a seguir.
NotaAdapte o script de instalação do NVIDIA Persistence Daemon conforme seu sistema operacional para assegurar seu funcionamento adequado.
-
Confirme novamente se o Persistence-M está ativado (
on) executando:nvidia-smi -
(Opcional) Desative o NVIDIA Persistence Daemon se necessário.
Desative o NVIDIA Persistence Daemon conforme sua necessidade.
sudo systemctl stop nvidia-persistenced sudo systemctl disable nvidia-persistenced
-
Instalar o CUDA
-
Obtenha o pacote de instalação do CUDA.
Acesse a página do CUDA Toolkit Archive.
Clique na versão do CUDA correspondente ao seu driver.
-
Em Operating System, selecione os parâmetros de sistema operacional, arquitetura ou versão conforme necessário para obter a URL de download e os comandos de instalação do pacote CUDA correspondente.
NotaEste tópico usa como exemplo o CUDA 12.9.0 e o sistema operacional Linux RHEL 8 (o Alibaba Cloud Linux 3 é compatível com o RHEL 8).
-
Instale o CUDA.
-
Execute os comandos abaixo em sequência para instalar o CUDA.
wget https://developer.download.nvidia.com/compute/cuda/12.9.0/local_installers/cuda-repo-rhel8-12-9-local-12.9.0_575.51.03-1.x86_64.rpm sudo rpm -i cuda-repo-rhel8-12-9-local-12.9.0_575.51.03-1.x86_64.rpm sudo dnf clean all sudo dnf -y install cuda-toolkit-12-9 -
Configure as variáveis de ambiente do CUDA executando os seguintes comandos em ordem:
echo 'export PATH=/usr/local/cuda/bin:$PATH' | sudo tee /etc/profile.d/cuda.sh source /etc/profile
-
Verifique se o CUDA está instalado na instância.
Use o comando
nvcc -Vpara checar se a versão instalada do CUDA está correta.O resultado retornado será semelhante a:
nvcc: NVIDIA (R) Cuda compiler driver Copyright (c) 2005-2025 NVIDIA Corporation Built on Wed_Apr__9_19:24:57_PDT_2025 Cuda compilation tools, release 12.9, V12.9.41 Build cuda_12.9.r12.9/compiler.35813241_0
Instalar o cuDNN
-
Obtenha o pacote de instalação do cuDNN.
Acesse a página do CUDA Deep Neural Network (cuDNN) | NVIDIA Developer.
Clique em Download cuDNN Library.
-
Em Operating System, selecione os parâmetros de sistema operacional, arquitetura ou versão conforme necessário para obter a URL de download e os comandos de instalação do pacote cuDNN correspondente.
A versão mais recente do cuDNN é baixada por padrão. Também é possível clicar em Archive of Previous Releases para escolher e baixar a versão desejada.
NotaEste tópico usa como exemplo o cuDNN 9.10.2 e o sistema operacional Linux RHEL 8 (o Alibaba Cloud Linux 3 é compatível com o RHEL 8).
-
Instale o cuDNN.
-
Execute os comandos abaixo em sequência para instalar o cuDNN.
wget https://developer.download.nvidia.com/compute/cudnn/9.10.2/local_installers/cudnn-local-repo-rhel8-9.10.2-1.0-1.x86_64.rpm sudo rpm -i cudnn-local-repo-rhel8-9.10.2-1.0-1.x86_64.rpm sudo dnf clean all sudo dnf -y install cudnn-cuda-12
-
(Opcional) Se o sistema instalar
cudnn.h,libcudnn.so*ecudnn_version.hno diretório /usr/include/ por padrão, execute os comandos a seguir para vincular esses arquivos aos diretórios correspondentes em /usr/local/cuda/.-
Vincule o libcudnn.so* e outros arquivos de biblioteca do cuDNN a
/usr/local/cuda/lib64/executando:sudo ln -s /usr/lib64/libcudnn.so.9.10.2 /usr/local/cuda/lib64/libcudnn.so.9.10.2 sudo ln -s /usr/local/cuda/lib64/libcudnn.so.9.10.2 /usr/local/cuda/lib64/libcudnn.so.9 sudo ln -s /usr/local/cuda/lib64/libcudnn.so.9 /usr/local/cuda/lib64/libcudnn.soValide o resultado do vínculo com
ls -l /usr/local/cuda/lib64/libcudnn.so*. -
Vincule os arquivos
cudnn.hecudnn_version.ha/usr/local/cuda/includeusando os comandos:sudo ln -s /usr/include/cudnn.h /usr/local/cuda/include/cudnn.h sudo ln -s /usr/include/cudnn_version.h /usr/local/cuda/include/cudnn_version.hValide o resultado do vínculo com
ls -l /usr/local/cuda/include/cudnn*.
-
-
Verifique se o cuDNN foi instalado corretamente.
cat /usr/local/cuda/include/cudnn_version.h | grep CUDNN_MAJOR -A 2O resultado retornado será semelhante a:
#define CUDNN_MAJOR 9 #define CUDNN_MINOR 10 #define CUDNN_PATCHLEVEL 2 --