Para computação de alto desempenho ou aceleração gráfica em cargas de trabalho como deep learning, IA, OpenGL, Direct3D e cloud gaming, a GPU precisa do driver Tesla instalado para oferecer desempenho máximo e renderização gráfica fluida. Caso não tenha instalado o driver Tesla ao criar sua instância otimizada para computação acelerada por GPU com Linux, instale-o manualmente depois. Este tópico descreve como instalar manualmente o driver Tesla em uma instância otimizada para computação acelerada por GPU que executa Linux.
Procedimento
Este tópico aplica-se a todas as instâncias otimizadas para computação acelerada por GPU que executam Linux. Para mais informações, consulte Instâncias otimizadas para computação acelerada por GPU (séries gn/ebm/scc). Instale apenas um driver Tesla compatível com o sistema operacional da instância. Por exemplo, uma instância GPU com Linux suporta somente o driver Tesla para Linux.
Etapa 1: Baixar o driver NVIDIA Tesla
-
Acesse a página de download de drivers da NVIDIA.
NotaPara mais informações sobre como instalar e configurar drivers NVIDIA, consulte o Guia de início rápido de instalação de drivers NVIDIA.
-
Defina os critérios de busca e clique em Search.
A tabela a seguir descreve os critérios de busca.
Critério
Descrição
Exemplo
Tipo de produto
Série do produto
Família do produto
Selecione o tipo, a série e a família do produto com base na GPU da sua instância.
NotaPara visualizar os detalhes de uma instância GPU, como ID da instância, tipo de instância e sistema operacional, consulte Visualizar informações da instância.
Data Center / Tesla
A-Series
NVIDIA A10
Sistema operacional
Selecione a versão do sistema operacional Linux com base na imagem usada pela sua instância.
Linux 64-bit
CUDA Toolkit
Selecione uma versão do CUDA Toolkit.
11,4
Idioma
Selecione um idioma para o driver.
Chinese (Simplified)
Na página de resultados da busca, clique em Beta, Older Drivers, and More.
-
Localize o driver desejado e clique em View.
Por exemplo, selecione Data Center Driver for Linux x64 com a versão do driver 470.161.03 e versão do CUDA Toolkit 11,4.
Na página de detalhes do driver, clique com o botão direito em Download e selecione Copy Link Address.
-
Conecte-se à instância GPU Linux.
Para mais informações, consulte Conectar-se a uma instância Linux usando senha ou chave.
-
Execute o comando a seguir para baixar o pacote de instalação do driver.
A URL de download do driver no comando de exemplo é o link copiado na Etapa 5.
wget https://us.download.nvidia.com/tesla/470.161.03/NVIDIA-Linux-x86_64-470.161.03.run
Etapa 2: Instalar o driver NVIDIA Tesla
O método de instalação do driver Tesla depende do sistema operacional.
CentOS
-
Execute o comando a seguir para verificar se os pacotes kernel-devel e kernel-headers estão instalados.
sudo rpm -qa | grep $(uname -r)-
Se a saída incluir informações de versão para os pacotes kernel-devel e kernel-headers, eles já estão instalados.
kernel-3.10.0-1062.18.1.el7.x86_64 kernel-devel-3.10.0-1062.18.1.el7.x86_64 kernel-headers-3.10.0-1062.18.1.el7.x86_64 -
Caso não encontre kernel-devel- e kernel-headers- na saída, baixe e instale os pacotes kernel-devel e kernel-headers correspondentes à versão do seu kernel.
ImportanteSe a versão do kernel-devel não corresponder à versão do kernel, a compilação do driver falhará durante a instalação do RPM do driver. Por isso, confirme o número da versão de *kernel-** na saída e baixe a versão correspondente do kernel-devel. Na saída de exemplo, a versão do kernel é 3.10.0-1062.18.1.el7.x86_64.
-
-
Conceda permissões e instale o driver Tesla.
Para sistemas operacionais Linux de 64 bits, recomendamos usar o driver Tesla no formato .run, como NVIDIA-Linux-x86_64-xxxx.run. Execute os comandos a seguir para conceder permissões e instalar o driver Tesla.
NotaSe estiver usando um driver Tesla em outro formato, como .deb ou .rpm, consulte o Guia de instalação do NVIDIA CUDA para Linux para obter instruções de instalação.
sudo chmod +x NVIDIA-Linux-x86_64-xxxx.runsudo sh NVIDIA-Linux-x86_64-xxxx.run -
Execute o comando a seguir para verificar a instalação.
nvidia-smiSe a saída for semelhante à seguinte, o driver Tesla está instalado.
[ecs-use xxx 9sgg1tZ ~]$ nvidia-smi Tue Sep 10 13:58:31 2024 +-----------------------------------------------------------------------------+ | NVIDIA-SMI 470.161.03 Driver Version: 470.161.03 CUDA Version: 11.4 | |-------------------------------+----------------------+----------------------+ | GPU Name Persistence-M| Bus-Id Disp.A | Volatile Uncorr. ECC | | Fan Temp Perf Pwr:Usage/Cap| Memory-Usage | GPU-Util Compute M. | | | | MIG M. | |===============================+======================+======================| | 0 NVIDIA A10 Off | 00000000:00:07.0 Off | 0 | | 0% 34C P0 62W / 150W | 0MiB / 22731MiB | 0% Default | | | | N/A | +-------------------------------+----------------------+----------------------+ +-----------------------------------------------------------------------------+ | Processes: | | GPU GI CI PID Type Process name GPU Memory | | ID ID Usage | |=============================================================================| | No running processes found | +-----------------------------------------------------------------------------+ -
(Opcional) Ative o Persistence Mode usando o NVIDIA Persistence Daemon.
Após a instalação do driver Tesla, o Persistence Mode vem desativado (
off) por padrão. O driver Tesla apresenta maior estabilidade quando o Persistence Mode está ativado. Para garantir a estabilidade do serviço, recomendamos ativar o Persistence Mode por meio do NVIDIA Persistence Daemon. Para mais informações, consulte Persistence Daemon.NotaO Persistence Mode é uma propriedade configurável pelo usuário que mantém a GPU inicializada mesmo sem clientes conectados.
Ativar o Persistence Mode usando
nvidia-smi -pm 1causa problemas, como a perda da configuração após reinicializar a instância. Para mais informações, consulte O Persistence Mode não persiste, e o status ECC ou as configurações do recurso MIG também falham após a reinicialização de uma instância GPU. Recomendamos ativar o Persistence Mode usando o NVIDIA Persistence Daemon.
-
Execute o comando a seguir para iniciar o NVIDIA Persistence Daemon.
sudo nvidia-persistenced --user username # Replace username with your username. -
Execute o comando a seguir para verificar o status do Persistence Mode.
nvidia-smiA mensagem retornada indica que o Persistence-M está no estado ativado (
on).[ecs-usexxx2q9sgg1tZ ~]$ sudo nvidia-persistenced --user ecs-user [ecs-usexxx2q9sgg1tZ ~]$ nvidia-smi Tue Sep 10 14:02:16 2024 +-------------------------------+----------------------+----------------------+ | NVIDIA-SMI 470.161.03 Driver Version: 470.161.03 CUDA Version: 11.4 | |-------------------------------+----------------------+----------------------+ | GPU Name Persistence-M| Bus-Id Disp.A | Volatile Uncorr. ECC | | Fan Temp Perf Pwr:Usage/Cap| Memory-Usage | GPU-Util Compute M. | | | | MIG M. | |===============================+======================+======================| | 0 NVIDIA A10 On | 00000000:00:07.0 Off | 0 | | 0% 33C P8 8W / 150W | 0MiB / 22731MiB | 0% Default | | | | N/A | +-------------------------------+----------------------+----------------------+ +-----------------------------------------------------------------------------+ | Processes: | | GPU GI CI PID Type Process name GPU Memory | | ID ID Usage | |=============================================================================| | No running processes found | +-----------------------------------------------------------------------------+
-
(Opcional) Configure o Persistence Mode para ativar na reinicialização do sistema.
Se o sistema for reiniciado, o estado ativado (
on) do Persistence Mode será perdido. Execute as operações a seguir para reativar o Persistence Mode.O pacote de instalação do driver Tesla instala scripts da NVIDIA, como scripts de exemplo e de instalação, em
/usr/share/doc/NVIDIA_GLX-1.0/samples/nvidia-persistenced-init.tar.bz2.-
Execute os comandos a seguir para descompactar e instalar os scripts da NVIDIA.
cd /usr/share/doc/NVIDIA_GLX-1.0/samples/ sudo tar xf nvidia-persistenced-init.tar.bz2 cd nvidia-persistenced-init sudo sh install.sh -
Execute o comando a seguir para verificar se o NVIDIA Persistence Daemon está em execução.
sudo systemctl status nvidia-persistencedSe a saída for semelhante à seguinte, o NVIDIA Persistence Daemon está em execução.
[ecs-user@xxx nvidia-persistenced-init]$ sudo systemctl status nvidia-persistenced ● nvidia-persistenced.service - NVIDIA Persistence Daemon Loaded: loaded (/usr/lib/systemd/system/nvidia-persistenced.service; enabled; vendor preset: disabled) Active: active (running) since Tue 2024-09-10 14:13:20 CST; 40s ago Process: 13882 ExecStart=/usr/bin/nvidia-persistenced --user nvidia-persistenced (code=exited, status=0/SUCCESS) Main PID: 13883 (nvidia-persiste) Tasks: 1 (limit: 383833) Memory: 196.0K CGroup: /system.slice/nvidia-persistenced.service └─13883 /usr/bin/nvidia-persistenced --user nvidia-persistenced Sep 10 14:13:19 iZbp13orbqqx6m2q9sgg1tZ systemd[1]: Starting NVIDIA Persistence Daemon... Sep 10 14:13:19 iZbp13orbqqx6m2q9sgg1tZ nvidia-persistenced[13883]: Started (13883) Sep 10 14:13:20 iZbp13orbqqx6m2q9sgg1tZ systemd[1]: Started NVIDIA Persistence Daemon.NotaAdapte o script de instalação do NVIDIA Persistence Daemon ao seu sistema operacional para garantir o funcionamento correto.
-
Execute o comando a seguir para verificar se o Persistence Mode está definido como
on.nvidia-smi -
(Opcional) Execute os comandos a seguir para parar o NVIDIA Persistence Daemon.
Desative o NVIDIA Persistence Daemon caso não seja mais necessário.
sudo systemctl stop nvidia-persistenced sudo systemctl disable nvidia-persistenced
-
-
(Condicionalmente obrigatório) Se sua instância pertencer à família ebmgn8v, ebmgn7 ou ebmgn7e , instale o serviço nvidia-fabricmanager correspondente à versão do seu driver.
ImportanteSe a instância pertencer à família ebmgn8v, ebmgn7 ou ebmgn7e , não será possível usar a instância GPU sem instalar o serviço nvidia-fabricmanager compatível com a versão do driver.
Caso sua instância GPU não pertença à família ebmgn8v, ebmgn7 ou ebmgn7e , ignore esta etapa.
-
Instale o serviço nvidia-fabricmanager.
Instale o serviço nvidia-fabricmanager a partir do código-fonte ou de um pacote de instalação. Os comandos de exemplo a seguir usam CentOS 7.x e CentOS 8.x como sistemas operacionais e a versão do driver 460.91.03 como exemplo. Nos comandos, substitua
driver_versionpelo número da versão do driver baixado na Etapa 1: Baixar o driver NVIDIA Tesla.-
Source code
-
-
Installation package
-
-
Execute os comandos a seguir para iniciar o serviço nvidia-fabricmanager.
sudo systemctl enable nvidia-fabricmanager sudo systemctl start nvidia-fabricmanager -
Execute o comando a seguir para verificar o status do serviço nvidia-fabricmanager.
systemctl status nvidia-fabricmanagerSe a saída a seguir for retornada, o serviço nvidia-fabricmanager está em execução.
nvidia-fabricmanager.service - NVIDIA fabric manager service Loaded: loaded (/lib/systemd/system/nvidia-fabricmanager.service; enabled; vendor preset: enabled) Active: active (running) since Mon 2021-09-13 19:14:45 CST; 1 weeks 1 days ago Process: 1928 ExecStart=/usr/bin/nv-fabricmanager -c /usr/share/nvidia/nvswitch/fabricmanager.cfg (code=exited, status=0/SUCCESS) Main PID: 2140 (nv-fabricmanage) Tasks: 18 (limit: 19660) CGroup: /system.slice/nvidia-fabricmanager.service └─2140 /usr/bin/nv-fabricmanager -c /usr/share/nvidia/nvswitch/fabricmanager.cfg Sep 13 19:14:26 xxx systemd[1]: Starting NVIDIA fabric manager service... Sep 13 19:14:45 xxx nv-fabricmanager[2140]: Successfully configured all the available GPUs and NVSwitches. Sep 13 19:14:45 xxx systemd[1]: Started NVIDIA fabric manager service. -
Conceda permissões e instale o driver Tesla.
Para sistemas operacionais Linux de 64 bits, recomendamos usar o driver Tesla no formato .run, como NVIDIA-Linux-x86_64-xxxx.run. Execute os comandos a seguir para conceder permissões e instalar o driver Tesla.
NotaSe estiver usando um driver Tesla em outro formato, como .deb ou .rpm, consulte o Guia de instalação do NVIDIA CUDA para Linux para obter instruções de instalação.
sudo chmod +x NVIDIA-Linux-x86_64-xxxx.runsudo sh NVIDIA-Linux-x86_64-xxxx.run -
Execute o comando a seguir para verificar a instalação.
nvidia-smiSe a saída for semelhante à seguinte, o driver Tesla está instalado.
[ecs-use xxx 9sgg1tZ ~]$ nvidia-smi Tue Sep 10 13:58:31 2024 +-----------------------------------------------------------------------------+ | NVIDIA-SMI 470.161.03 Driver Version: 470.161.03 CUDA Version: 11.4 | |-------------------------------+----------------------+----------------------+ | GPU Name Persistence-M| Bus-Id Disp.A | Volatile Uncorr. ECC | | Fan Temp Perf Pwr:Usage/Cap| Memory-Usage | GPU-Util Compute M. | | | | MIG M. | |===============================+======================+======================| | 0 NVIDIA A10 Off | 00000000:00:07.0 Off | 0 | | 0% 34C P0 62W / 150W | 0MiB / 22731MiB | 0% Default | | | | N/A | +-------------------------------+----------------------+----------------------+ +-----------------------------------------------------------------------------+ | Processes: | | GPU GI CI PID Type Process name GPU Memory | | ID ID Usage | |=============================================================================| | No running processes found | +-----------------------------------------------------------------------------+ -
(Opcional) Ative o Persistence Mode usando o NVIDIA Persistence Daemon.
Após a instalação do driver Tesla, o Persistence Mode vem desativado (
off) por padrão. O driver Tesla apresenta maior estabilidade quando o Persistence Mode está ativado. Para garantir a estabilidade do serviço, recomendamos ativar o Persistence Mode por meio do NVIDIA Persistence Daemon. Para mais informações, consulte Persistence Daemon.NotaO Persistence Mode é uma propriedade configurável pelo usuário que mantém a GPU inicializada mesmo sem clientes conectados.
Ativar o Persistence Mode usando
nvidia-smi -pm 1causa problemas, como a perda da configuração após reinicializar a instância. Para mais informações, consulte O Persistence Mode não persiste, e o status ECC ou as configurações do recurso MIG também falham após a reinicialização de uma instância GPU. Recomendamos ativar o Persistence Mode usando o NVIDIA Persistence Daemon.
-
Execute o comando a seguir para iniciar o NVIDIA Persistence Daemon.
sudo nvidia-persistenced --user username # Replace username with your username. -
Execute o comando a seguir para verificar o status do Persistence Mode.
nvidia-smiA mensagem retornada indica que o Persistence-M está no estado ativado (
on).[ecs-usexxx2q9sgg1tZ ~]$ sudo nvidia-persistenced --user ecs-user [ecs-usexxx2q9sgg1tZ ~]$ nvidia-smi Tue Sep 10 14:02:16 2024 +-------------------------------+----------------------+----------------------+ | NVIDIA-SMI 470.161.03 Driver Version: 470.161.03 CUDA Version: 11.4 | |-------------------------------+----------------------+----------------------+ | GPU Name Persistence-M| Bus-Id Disp.A | Volatile Uncorr. ECC | | Fan Temp Perf Pwr:Usage/Cap| Memory-Usage | GPU-Util Compute M. | | | | MIG M. | |===============================+======================+======================| | 0 NVIDIA A10 On | 00000000:00:07.0 Off | 0 | | 0% 33C P8 8W / 150W | 0MiB / 22731MiB | 0% Default | | | | N/A | +-------------------------------+----------------------+----------------------+ +-----------------------------------------------------------------------------+ | Processes: | | GPU GI CI PID Type Process name GPU Memory | | ID ID Usage | |=============================================================================| | No running processes found | +-----------------------------------------------------------------------------+
-
(Opcional) Configure o Persistence Mode para ativar na reinicialização do sistema.
Se o sistema for reiniciado, o estado ativado (
on) do Persistence Mode será perdido. Execute as operações a seguir para reativar o Persistence Mode.O pacote de instalação do driver Tesla instala scripts da NVIDIA, como scripts de exemplo e de instalação, em
/usr/share/doc/NVIDIA_GLX-1.0/samples/nvidia-persistenced-init.tar.bz2.-
Execute os comandos a seguir para descompactar e instalar os scripts da NVIDIA.
cd /usr/share/doc/NVIDIA_GLX-1.0/samples/ sudo tar xf nvidia-persistenced-init.tar.bz2 cd nvidia-persistenced-init sudo sh install.sh -
Execute o comando a seguir para verificar se o NVIDIA Persistence Daemon está em execução.
sudo systemctl status nvidia-persistencedSe a saída for semelhante à seguinte, o NVIDIA Persistence Daemon está em execução.
[ecs-user@xxx nvidia-persistenced-init]$ sudo systemctl status nvidia-persistenced ● nvidia-persistenced.service - NVIDIA Persistence Daemon Loaded: loaded (/usr/lib/systemd/system/nvidia-persistenced.service; enabled; vendor preset: disabled) Active: active (running) since Tue 2024-09-10 14:13:20 CST; 40s ago Process: 13882 ExecStart=/usr/bin/nvidia-persistenced --user nvidia-persistenced (code=exited, status=0/SUCCESS) Main PID: 13883 (nvidia-persiste) Tasks: 1 (limit: 383833) Memory: 196.0K CGroup: /system.slice/nvidia-persistenced.service └─13883 /usr/bin/nvidia-persistenced --user nvidia-persistenced Sep 10 14:13:19 iZbp13orbqqx6m2q9sgg1tZ systemd[1]: Starting NVIDIA Persistence Daemon... Sep 10 14:13:19 iZbp13orbqqx6m2q9sgg1tZ nvidia-persistenced[13883]: Started (13883) Sep 10 14:13:20 iZbp13orbqqx6m2q9sgg1tZ systemd[1]: Started NVIDIA Persistence Daemon.NotaAdapte o script de instalação do NVIDIA Persistence Daemon ao seu sistema operacional para garantir o funcionamento correto.
-
Execute o comando a seguir para verificar se o Persistence Mode está definido como
on.nvidia-smi -
(Opcional) Execute os comandos a seguir para parar o NVIDIA Persistence Daemon.
Desative o NVIDIA Persistence Daemon caso não seja mais necessário.
sudo systemctl stop nvidia-persistenced sudo systemctl disable nvidia-persistenced
-
-
(Condicionalmente obrigatório) Se sua instância pertencer à família ebmgn8v, ebmgn7 ou ebmgn7e , instale o serviço nvidia-fabricmanager correspondente à versão do seu driver.
ImportanteSe a instância pertencer à família ebmgn8v, ebmgn7 ou ebmgn7e , não será possível usar a instância GPU sem instalar o serviço nvidia-fabricmanager compatível com a versão do driver.
Caso sua instância GPU não pertença à família ebmgn8v, ebmgn7 ou ebmgn7e , ignore esta etapa.
-
Instale o serviço nvidia-fabricmanager.
Instale o serviço nvidia-fabricmanager a partir do código-fonte ou de um pacote de instalação. Os exemplos de comando a seguir destinam-se aos sistemas operacionais Ubuntu 16.04, Ubuntu 18.04, Ubuntu 20.04, Ubuntu 22.04 ou Ubuntu 24.04. Nos comandos, substitua
driver_versionpela versão do driver baixada na Etapa 1: Baixar o driver NVIDIA Tesla.ImportanteNo Ubuntu 22.04, o serviço nvidia-fabricmanager requer uma versão do driver Tesla posterior a 515.48.07. O exemplo a seguir para Ubuntu 22.04 usa a versão do driver 535.154.05.
No Ubuntu 24.04, o serviço nvidia-fabricmanager requer uma versão do driver Tesla posterior a 550.90.07. O exemplo a seguir para Ubuntu 24.04 usa a versão do driver 570.133.20.
-
Source code
-
Installation package
-
-
Execute os comandos a seguir para iniciar o serviço nvidia-fabricmanager.
sudo systemctl enable nvidia-fabricmanager sudo systemctl start nvidia-fabricmanager -
Execute o comando a seguir para verificar o status do serviço nvidia-fabricmanager.
systemctl status nvidia-fabricmanagerSe a saída a seguir for retornada, o serviço nvidia-fabricmanager está em execução.
nvidia-fabricmanager.service - NVIDIA fabric manager service Loaded: loaded (/lib/systemd/system/nvidia-fabricmanager.service; enabled; vendor preset: enabled) Active: active (running) since Mon 2021-09-13 19:14:45 CST; 1 weeks 1 days ago Process: 1928 ExecStart=/usr/bin/nv-fabricmanager -c /usr/share/nvidia/nvswitch/fabricmanager.cfg (code=exited, status=0/SUCCESS) Main PID: 2140 (nv-fabricmanage) Tasks: 18 (limit: 19660) CGroup: /system.slice/nvidia-fabricmanager.service └─2140 /usr/bin/nv-fabricmanager -c /usr/share/nvidia/nvswitch/fabricmanager.cfg Sep 13 19:14:26 xxx systemd[1]: Starting NVIDIA fabric manager service... Sep 13 19:14:45 xxx nv-fabricmanager[2140]: Successfully configured all the available GPUs and NVSwitches. Sep 13 19:14:45 xxx systemd[1]: Started NVIDIA fabric manager service.NotaA versão do pacote nvidia-fabricmanager deve corresponder à versão do driver Tesla para garantir o funcionamento correto da GPU. No Ubuntu, se você instalar o serviço nvidia-fabricmanager usando um pacote de instalação, o serviço
apt-dailypode atualizar automaticamente o pacote nvidia-fabricmanager. Isso pode causar incompatibilidade de versão com o driver Tesla, impedindo a inicialização do serviço nvidia-fabricmanager e tornando a GPU inutilizável. Para resolver esse problema, consulte A GPU não funciona conforme esperado porque a versão do nvidia-fabricmanager difere da versão do driver Tesla.
Se você adquiriu uma instância otimizada para computação acelerada por GPU com Windows, instale o driver Tesla para usar a instância em cargas de trabalho de computação de uso geral, como deep learning e IA. Para mais informações, consulte Instalar manualmente o driver Tesla em uma instância otimizada para computação acelerada por GPU (Windows).
Para instalar o driver Tesla durante a criação de uma instância GPU, consulte Instalar ou carregar automaticamente o driver Tesla ao criar uma instância GPU.
Caso precise desinstalar o driver Tesla atual por qualquer motivo, consulte Desinstalar o driver Tesla.
Se a versão do driver instalado não for adequada à sua carga de trabalho, ou se você instalou um tipo ou versão incorreta do driver e a instância GPU tornou-se inutilizável, desinstale o driver atual e instale um novo, ou atualize o driver diretamente. Para obter informações sobre como atualizar o driver, consulte Atualizar o driver NVIDIA.
Ubuntu e outros
Referências
-