Este tópico ajuda a solucionar problemas do Elastic GPU Service com um resumo das questões mais comuns durante o uso de GPUs.
|
Categoria |
Perguntas relacionadas |
|
Instância acelerada por GPU |
|
|
Placa GPU |
|
|
Memória da GPU |
|
|
Driver da GPU |
|
|
Monitoramento de GPU |
|
|
Outros |
O comando nvidia-smi -r trava após a instalação do serviço cGPU |
Instâncias aceleradas por GPU
As instâncias aceleradas por GPU suportam emuladores Android?
Emuladores Android podem ser instalados apenas em algumas instâncias aceleradas por GPU.
Esses emuladores são suportados somente nas seguintes famílias de ECS Bare Metal Instance otimizadas para computação acelerada por GPU: ebmgn7e , ebmgn7i, ebmgn7, ebmgn6ia, ebmgn6e, ebmgn6v, ebmgn6i .
É possível alterar a configuração de uma instância acelerada por GPU?
Algumas instâncias aceleradas por GPU permitem alterações de configuração.
Os tipos de instância suportados estão listados em Restrições e verificações para alteração de tipo de instância.
Uma família de instâncias ECS padrão pode ser atualizada ou alterada para uma família de instâncias aceleradas por GPU?
Não. Famílias de instâncias ECS padrão não podem ser convertidas em famílias de instâncias aceleradas por GPU.
Consulte os tipos de instância suportados em Restrições e verificações para alteração de tipo de instância.
Como transferir dados entre uma instância acelerada por GPU e uma instância ECS padrão?
Nenhuma configuração especial é necessária para transferir dados.
Instâncias aceleradas por GPU funcionam como instâncias ECS padrão. Instâncias no mesmo grupo de segurança se comunicam pela rede interna por padrão, sem necessidade de configurações adicionais.
Qual é a diferença entre GPU e CPU?
A tabela a seguir compara GPUs e CPUs.
|
Comparação |
GPU |
CPU |
|
Unidade Lógica Aritmética (ALU) |
Muitas ALUs otimizadas para computação paralela em grande escala. |
Poucas ALUs, porém poderosas. |
|
Unidade de controle |
Unidade de controle relativamente simples. |
Unidade de controle complexa. |
|
Cache |
Cache pequeno que atende threads em vez de armazenar dados acessados. |
Estruturas de cache grandes para armazenar dados, aumentar a velocidade de acesso e reduzir a latência. |
|
Método de resposta |
Integra todas as tarefas antes do processamento em lote. |
Responde a tarefas individuais em tempo real. |
|
Cenários |
Indicado para cenários de computação paralela multithread com alta similaridade, uso intensivo de computação e alto throughput. |
Adequado para cenários de computação serial logicamente complexa que exigem tempos de resposta rápidos. |
Placas GPU
Por que o comando nvidia-smi não encontra a placa GPU após a compra de uma instância acelerada por GPU?
Causa: O comando nvidia-smi não localiza a placa GPU porque o driver Tesla ou GRID não foi instalado ou a instalação falhou.
Solução: Para utilizar os recursos de alto desempenho da instância acelerada por GPU, instale o driver correto para o tipo de instância:
-
Instâncias aceleradas por vGPU exigem um driver GRID:
-
Instâncias otimizadas para computação acelerada por GPU suportam drivers Tesla ou GRID:
Como visualizar os detalhes de uma placa GPU?
O método varia conforme o sistema operacional:
No Linux, execute o comando
nvidia-smipara ver os detalhes da placa GPU.No Windows, visualize os detalhes da placa GPU em .
Para visualizar informações como taxa de ociosidade da GPU, uso, temperatura e energia, acesse o console do CloudMonitor. Para mais informações, consulte Monitoramento de GPU.
Falha na inicialização da GPU (como RmInitAdapter failed!) ao usar GPU no Linux
-
Sintomas: O dispositivo GPU fica offline e o sistema não reconhece a placa GPU. Por exemplo, em um sistema Linux, ocorre um erro de falha na inicialização da GPU. Ao executar o comando
sh nvidia-bug-report.sh, a mensagem de erroRmInitAdapter failedaparece no log gerado, conforme o exemplo a seguir:NVRM: _kgspBootGspRm: unexpected WPR2 already up, cannot proceed with booting GSP NVRM: _kgspBootGspRm: (the GPU is likely in a bad state and may need to be reset) NVRM: crashcatWayfinderGetReportQueue_V1: insufficiently-sized L1 wayfinder scratch location 0 NVRM: RmInitAdapter: Cannot initialize GSP firmware RM NVRM: GPU 0000:00:09.0: RmInitAdapter failed! (0x62:0x40:2015) NVRM: GPU 0000:00:09.0: rm_init_adapter failed, device minor number 0 Causa: O componente GPU System Processor (GSP) pode estar em um estado anormal. Isso faz com que o dispositivo fique offline e impede que o sistema detecte a placa GPU.
Solução: Reinicie a instância pelo console. Essa ação redefine completamente a GPU e geralmente resolve o problema. Se o problema persistir, consulte Perda de dispositivo GPU devido a erros XID 119/XID 120 ao usar uma GPU para solução de problemas adicional. Recomendamos desativar o recurso GSP.
Memória da GPU
Por que uma instância com 48 GB de memória da GPU mostra cerca de 3 GB a menos no nvidia-smi?
O ECC (Error-Correcting Code) está ativado e utiliza aproximadamente 2-3 GB de memória da GPU em uma instância de 48 GB. Execute nvidia-smi para verificar o status do ECC (OFF = desativado, ON = ativado).
Como desativar o recurso ECC para liberar memória da GPU?
Linha de comando: Interrompa todos os processos que utilizam a GPU. Execute
nvidia-smi -e 0para desativar o ECC. Em seguida, executenvidia-smi -rpara redefinir a GPU.Script de inicialização: Adicione
nvidia-smi -e 0envidia-smi -rna primeira linha do script de inicialização/etc/rc.local. Em alguns sistemas, o caminho é/etc/rc.d/rc.local. Depois, reinicie a instância.
O que fazer se ocorrer um erro indicando que a GPU está em uso por outro cliente ao desativar o ECC?
Esse erro indica que algum componente ou processo ainda utiliza a GPU. Certifique-se de que nenhum processo da GPU esteja em execução na máquina. Caso não consiga interrompê-los manualmente, crie um backup via snapshot. Em seguida, adicione os comandos nvidia-smi -e 0 e nvidia-smi -r ao script de inicialização /etc/rc.local. Em alguns sistemas, o caminho é /etc/rc.d/rc.local. Reinicie a instância para aplicar as alterações.
Drivers de GPU
Qual driver instalar para uma instância acelerada por vGPU?
Instâncias aceleradas por vGPU requerem um driver GRID.
Para cenários de computação de uso geral ou aceleração gráfica, carregue o driver GRID durante a criação da instância ou instale-o posteriormente com o Cloud Assistant:
Carregue o driver GRID durante a criação da instância. Carregar um driver GRID a partir de uma imagem com driver pré-instalado.
-
Instale o driver GRID com o Cloud Assistant após a criação:
Posso atualizar o CUDA para 12,4 ou o driver NVIDIA para 550 ou superior em uma instância acelerada por vGPU?
Não.
Instâncias aceleradas por vGPU utilizam o driver GRID fornecido pela plataforma, com versão fixa. Não é possível instalar drivers do site da NVIDIA. Para atualizar o CUDA ou o driver, utilize uma instância das séries gn ou ebm.
Qual driver instalar para usar ferramentas como OpenGL e Direct3D para aceleração gráfica em uma instância otimizada para computação acelerada por GPU?
Instale o driver de acordo com o sistema operacional:
-
Instâncias Linux otimizadas para computação acelerada por GPU requerem um driver Tesla:
-
Instâncias Windows otimizadas para computação acelerada por GPU requerem um driver GRID:
Por que a versão do CUDA exibida após a instalação difere daquela selecionada durante a criação da instância acelerada por GPU?
O comando nvidia-smi exibe a versão mais alta do CUDA suportada pela instância acelerada por GPU, e não a versão selecionada durante a criação da instância.
Após instalar um driver GRID em uma instância acelerada por GPU Windows, o que fazer se uma tela preta aparecer ao usar uma conexão VNC pelo console?
Causa: O driver GRID assume a saída de vídeo. O VNC não consegue mais renderizar a partir dos gráficos integrados, resultando em uma tela preta. Esse comportamento é esperado.
Solução: Conecte-se à instância acelerada por GPU usando o Workbench. Para mais informações, consulte Conectar-se a uma instância Windows usando o Workbench.
Como obter uma licença GRID?
O método depende do sistema operacional:
-
No Windows, use uma imagem com driver pré-instalado ou instale o driver manualmente.
-
No Linux, use uma imagem com driver pré-instalado ou o Cloud Assistant.
Como atualizar um driver de GPU (Tesla ou GRID)?
Não é possível atualizar diretamente um driver de GPU. Desinstale a versão antiga, reinicie e, em seguida, instale a nova versão. Atualizar um driver Tesla ou GRID.
Realize a atualização fora dos horários de pico. Faça backup dos dados do disco criando um snapshot antes. Criar um snapshot.
Falha do sistema e erro kernel NULL pointer dereference após instalar o driver NVIDIA versão 570.124.xx (Linux) ou 572,61 (Windows)
-
Sintomas: Em alguns tipos de instância, o sistema reporta um erro
kernel NULL pointer dereferencedurante a instalação do driver NVIDIA versão 570.124.xx (Linux) ou 572,61 (Windows), ou ao executar o comandonvidia-smiapós a instalação. O log a seguir mostra o erro: Solução: Evite usar a versão 570.124.xx (Linux) ou 572,61 (Windows) do driver. Recomendamos o uso da versão 570.133.20 (Linux) ou 572,83 (Windows) ou superior.
O comando nvidia-smi retorna o erro "No devices were found" ao selecionar NVIDIA Proprietary como tipo de módulo do kernel durante a instalação do driver
-
Sintomas: Em alguns tipos de instância, se você selecionar NVIDIA Proprietary como tipo de módulo do kernel durante a instalação do driver, o comando nvidia-smi retorna um erro
No devices were foundapós a instalação.O outro tipo de módulo do kernel disponível nesta tela é MIT/GPL.
Causa: Nem todos os modelos de GPU são compatíveis com o driver NVIDIA Proprietary.
-
Configuração recomendada para o tipo de módulo do kernel:
Para GPUs de arquitetura Blackwell: Use obrigatoriamente o driver open-source (selecione
MIT/GPL).Para GPUs de arquitetura Turing, Ampere, Ada Lovelace e Hopper: Recomendamos o uso do driver open-source (selecione
MIT/GPL).Para GPUs de arquitetura Maxwell, Pascal e Volta: Selecione apenas
NVIDIA Proprietary.
Monitoramento de GPU
Como visualizar o uso de recursos (vCPU, tráfego de rede, largura de banda e disco) de uma instância acelerada por GPU?
Utilize um dos métodos a seguir para visualizar dados de monitoramento, como uso de vCPU, memória, carga média do sistema, largura de banda interna, largura de banda pública, conexões de rede, uso e leituras de disco, uso da GPU, uso de memória da GPU e energia da GPU.
-
Console do produto
Console do ECS: Fornece uso de vCPU, tráfego de rede, E/S de disco e métricas de GPU. Visualizar informações de monitoramento no console do ECS.
Console do CloudMonitor: Oferece monitoramento detalhado de infraestrutura, SO, GPU, rede, processos e disco. Para mais informações, consulte Monitoramento de host.
-
Centro de Despesas e Custos
Na página View Usage Details, filtre por Time Period, Commodity Name, Billable Item, Billable Item e Time Unit. Clique em Export CSV para exportar os dados de uso. Detalhes de faturamento.
Por exemplo, para visualizar o uso de tráfego de uma instância ECS, selecione ECS - Pay-As-You-Go em Product name, Outbound traffic em Billable item, Public traffic em Metering specification (o nome da especificação é
ECS_FLOW) e Hour em Metering granularity.NotaOs detalhes de uso mostram o consumo bruto de recursos, que difere do uso faturável nos detalhes de faturamento. Esses resultados servem apenas como referência e não podem ser usados para conciliação.
Outros
Como instalar o serviço cGPU?
Instale o serviço cGPU por meio do runtime Docker no ACK. Este é o método recomendado tanto para usuários empresariais quanto para usuários individuais que concluíram a verificação de identidade. Gerenciar o componente de agendamento de GPU compartilhada.
O comando nvidia-smi -r trava após a instalação do serviço cGPU
-
Sintomas: Quando o serviço cGPU está carregado (verifique com
lsmod | grep cgpu), o comandonvidia-smi -rtrava ao redefinir a GPU. Um erro também aparece no logdmesg.[527717.881425] NVRM: Attempting to remove device 0000:08:00.0 with non-zero usage count! Causa: O componente cGPU ainda utiliza o dispositivo GPU. Isso bloqueia a operação de redefinição de hardware.
-
Solução:
Desinstalar o cGPU: Desinstale o componente cGPU. Após a desinstalação, o comando
nvidia-smi -rvolta a funcionar e retorna um resultado.Reiniciar a instância: Se o problema persistir após a desinstalação, reinicie a instância pelo console. Executar o comando reboot dentro da instância não é eficaz.
ImportanteNão redefina a GPU executando comandos como
nvidia-smi -r, desanexando o dispositivo ou reinstalando o driver enquanto o serviço cGPU estiver carregado. Sempre desinstale o serviço cGPU primeiro para evitar falhas.