Diagnostique problemas em nós GPU em clusters ACK Pro usando códigos de status do nvidia-smi e referências de erros XID.
Pré-requisitos
Um cluster ACK Pro criado.
O cluster está no estado Running. Acesse o ACK console para verificar o status do cluster na página Clusters.
Executar um diagnóstico de nó
Selecione um nó acelerado por GPU, execute o Diagnóstico de nó e use o relatório para identificar e resolver problemas.
Acesse o ACK console. No painel de navegação à esquerda, clique em Clusters.
Na página Clusters, clique no nome do cluster desejado. No painel de navegação à esquerda, escolha .
Na página Diagnostics, clique em Node diagnosis. Na página Node diagnosis, clique em Diagnosis no canto superior esquerdo.
-
No painel Select Node, selecione um Node Name, leia as observações, marque I know and agree e clique em Create diagnosis.
Acompanhe o progresso do diagnóstico na página. Após a conclusão, a página exibe os resultados e uma lista de itens diagnosticados. Revise os resultados para identificar e resolver quaisquer problemas.
Se o nó diagnosticado for acelerado por GPU, o relatório exibirá métricas relacionadas à GPU após a conclusão do diagnóstico. Use este relatório juntamente com as seções Solução de problemas com códigos de status do nvidia-smi e Solução de problemas com erros XID para resolver as falhas.
Solução de problemas com códigos de status do nvidia-smi****
O nvidia-smi monitora o desempenho e a integridade das GPUs NVIDIA. Localize o resultado NVIDIASMIStatusCode no relatório de diagnóstico. A tabela abaixo lista cada código de status e a ação recomendada.
|
Código de status do Nvidia-smi |
Descrição |
Ações |
|
0 |
Comando executado com sucesso. O nvidia-smi funciona conforme o esperado. |
Não aplicável. |
|
3 |
Operação indisponível no dispositivo de destino. O nó pode não oferecer suporte ao nvidia-smi ou há um problema de driver. |
Verifique os logs do driver em |
|
6 |
Falha ao consultar dispositivos GPU. Indica um problema de driver. |
Verifique os logs do driver em |
|
8 |
Cabo de alimentação do dispositivo GPU não conectado corretamente. Indica um problema de hardware. |
Submit a ticket para entrar em contato com o suporte técnico do ECS. |
|
9 |
Driver NVIDIA não carregado. Indica um problema de driver. |
Verifique os logs do driver em |
|
10 |
O kernel NVIDIA detectou um problema de interrupção. |
Verifique os logs do driver em |
|
12 |
Biblioteca compartilhada NVML não encontrada ou não carregada. |
Verifique os logs do driver em |
|
13 |
A versão local da NVML não corresponde à versão do driver. |
Verifique os logs do driver em |
|
14 |
infoROM corrompida. Indica um problema de hardware. |
Submit a ticket para entrar em contato com o suporte técnico do ECS. |
|
15 |
GPU desconectada do barramento. Indica um problema de hardware. |
Submit a ticket para entrar em contato com o suporte técnico do ECS. |
|
255 |
Erro desconhecido de driver. Indica um problema de driver. |
Verifique os logs do driver em |
|
-1 |
Tempo limite do comando nvidia-smi esgotado. |
Verifique os logs do driver em |
Solução de problemas com erros XID
As mensagens XID são relatórios de erros da GPU registrados pelo driver NVIDIA no log do kernel do sistema operacional. Elas identificam o tipo, a localização e o código do erro relacionado ao hardware da GPU, ao software NVIDIA ou à sua aplicação.
No relatório de diagnóstico, verifique o item XID exceptions on GPU-accelerated node. Se estiver vazio, não há erros XID. Caso contrário, use as tabelas abaixo para solucionar o problema ou envie um ticket.
Solução de problemas por conta própria
Ao encontrar qualquer um dos erros XID a seguir, tente estas etapas para resolvê-los:
Reenvie a carga de trabalho e verifique se o erro XID desaparece.
Se o erro persistir, revise seu código e os logs para determinar se o código causou a falha.
Caso seu código não seja a causa,envie um ticket para suporte técnico.
|
XID |
Descrição |
|
13 |
Exceção do mecanismo gráfico. Geralmente causada por acesso a array fora dos limites ou instrução ilegal. Raramente é um problema de hardware. |
|
31 |
Falha de página de memória da GPU. Normalmente causada por acesso ilegal à memória pela aplicação. Raramente é um problema de driver ou hardware. |
|
43 |
A GPU parou de processar. Geralmente é um erro da aplicação, não de hardware. |
|
45 |
Limpeza preventiva devido a erros anteriores. Provavelmente ocorre ao executar várias aplicações CUDA com um Erro ECC de Bit Duplo (DBE). Indica que uma aplicação GPU encerrou devido a parada manual, problema de hardware ou limite de recursos. A causa específica requer análise adicional dos logs. |
|
68 |
Exceção NVDEC0. Geralmente é um problema de hardware ou driver. |
Solução de problemas via ticket
Para os erros XID a seguir,envie um ticket para o suporte técnico com a saída completa do diagnóstico do nó GPU.
|
XID |
Descrição |
|
32 |
Fluxo de buffer de push inválido ou corrompido. Reportado pelo controlador DMA no barramento PCIe. Geralmente causado por um problema de qualidade do PCI, não pela aplicação. |
|
38 |
Erro de firmware do driver. Não é um problema de hardware. |
|
48 |
Erro ECC de Bit Duplo (DBE). Reportado quando a GPU encontra um erro incorrigível, também notificado à sua aplicação. Geralmente requer redefinição da GPU ou reinicialização do nó para correção. |
|
61 |
Ponto de interrupção ou aviso interno do microcontrolador. O mecanismo interno da GPU parou, afetando suas cargas de trabalho. |
|
62 |
Parada interna do microcontrolador. Semelhante ao XID 61. |
|
63 |
Evento de registro de aposentadoria de página ECC ou remapeamento de linha. Quando ocorre um erro de hardware na memória da GPU, o mecanismo de autocorreção da NVIDIA aposenta ou remapeia a área de memória defeituosa e a registra na infoROM.
|
|
64 |
Falha no registro de aposentadoria de página ECC ou remapeador de linha. Semelhante ao XID 63, mas o registro na infoROM falhou. |
|
74 |
Erro NVLINK. Indica uma falha crítica de hardware NVLink. Coloque a GPU offline para manutenção. |
|
79 |
GPU desconectada do barramento e indetectável. Falha crítica de hardware. Coloque a GPU offline para manutenção. |
|
92 |
Alta taxa de erros ECC de bit único. Indica uma falha de hardware ou driver. |
|
94 |
Erro ECC contido. O mecanismo de contenção de erros da NVIDIA isolou um erro ECC incorrigível na aplicação afetada, evitando impacto em outras aplicações no nó. |
|
95 |
Erro ECC não contido. Semelhante ao XID 94, mas a contenção falhou. Todas as aplicações na GPU são afetadas. |