Todos os produtos
Search
Central de documentação

Container Service for Kubernetes:Solucionar problemas de nós acelerados por GPU com Diagnóstico de nó

Última atualização: Jun 27, 2026

Diagnostique problemas em nós GPU em clusters ACK Pro usando códigos de status do nvidia-smi e referências de erros XID.

Pré-requisitos

  • Um cluster ACK Pro criado.

  • O cluster está no estado Running. Acesse o ACK console para verificar o status do cluster na página Clusters.

Executar um diagnóstico de nó

Selecione um nó acelerado por GPU, execute o Diagnóstico de nó e use o relatório para identificar e resolver problemas.

  1. Acesse o ACK console. No painel de navegação à esquerda, clique em Clusters.

  2. Na página Clusters, clique no nome do cluster desejado. No painel de navegação à esquerda, escolha Inspections and Diagnostics > Diagnostics.

  3. Na página Diagnostics, clique em Node diagnosis. Na página Node diagnosis, clique em Diagnosis no canto superior esquerdo.

  4. No painel Select Node, selecione um Node Name, leia as observações, marque I know and agree e clique em Create diagnosis.

    Acompanhe o progresso do diagnóstico na página. Após a conclusão, a página exibe os resultados e uma lista de itens diagnosticados. Revise os resultados para identificar e resolver quaisquer problemas.

Se o nó diagnosticado for acelerado por GPU, o relatório exibirá métricas relacionadas à GPU após a conclusão do diagnóstico. Use este relatório juntamente com as seções Solução de problemas com códigos de status do nvidia-smi e Solução de problemas com erros XID para resolver as falhas.

Solução de problemas com códigos de status do nvidia-smi****

O nvidia-smi monitora o desempenho e a integridade das GPUs NVIDIA. Localize o resultado NVIDIASMIStatusCode no relatório de diagnóstico. A tabela abaixo lista cada código de status e a ação recomendada.

Código de status do Nvidia-smi

Descrição

Ações

0

Comando executado com sucesso. O nvidia-smi funciona conforme o esperado.

Não aplicável.

3

Operação indisponível no dispositivo de destino. O nó pode não oferecer suporte ao nvidia-smi ou há um problema de driver.

Verifique os logs do driver em /var/log/nvidia-installer.log e execute dmesg | grep -i nv para buscar erros de kernel.

6

Falha ao consultar dispositivos GPU. Indica um problema de driver.

Verifique os logs do driver em /var/log/nvidia-installer.log e execute dmesg | grep -i nv para buscar erros de kernel.

8

Cabo de alimentação do dispositivo GPU não conectado corretamente. Indica um problema de hardware.

Submit a ticket para entrar em contato com o suporte técnico do ECS.

9

Driver NVIDIA não carregado. Indica um problema de driver.

Verifique os logs do driver em /var/log/nvidia-installer.log e execute dmesg | grep -i nv para buscar erros de kernel.

10

O kernel NVIDIA detectou um problema de interrupção.

Verifique os logs do driver em /var/log/nvidia-installer.log, execute dmesg | grep -i nv para buscar erros de kernel ou revise os resultados de diagnóstico XID.

12

Biblioteca compartilhada NVML não encontrada ou não carregada.

Verifique os logs do driver em /var/log/nvidia-installer.log, execute dmesg | grep -i nv para buscar erros de kernel ou revise os resultados de diagnóstico XID.

13

A versão local da NVML não corresponde à versão do driver.

Verifique os logs do driver em /var/log/nvidia-installer.log, execute dmesg | grep -i nv para buscar erros de kernel ou revise os resultados de diagnóstico XID.

14

infoROM corrompida. Indica um problema de hardware.

Submit a ticket para entrar em contato com o suporte técnico do ECS.

15

GPU desconectada do barramento. Indica um problema de hardware.

Submit a ticket para entrar em contato com o suporte técnico do ECS.

255

Erro desconhecido de driver. Indica um problema de driver.

Verifique os logs do driver em /var/log/nvidia-installer.log, execute dmesg | grep -i nv para buscar erros de kernel ou revise os resultados de diagnóstico XID.

-1

Tempo limite do comando nvidia-smi esgotado.

Verifique os logs do driver em /var/log/nvidia-installer.log, execute dmesg | grep -i nv para buscar erros de kernel ou revise os resultados de diagnóstico XID.

Solução de problemas com erros XID

As mensagens XID são relatórios de erros da GPU registrados pelo driver NVIDIA no log do kernel do sistema operacional. Elas identificam o tipo, a localização e o código do erro relacionado ao hardware da GPU, ao software NVIDIA ou à sua aplicação.

No relatório de diagnóstico, verifique o item XID exceptions on GPU-accelerated node. Se estiver vazio, não há erros XID. Caso contrário, use as tabelas abaixo para solucionar o problema ou envie um ticket.

Solução de problemas por conta própria

Ao encontrar qualquer um dos erros XID a seguir, tente estas etapas para resolvê-los:

  1. Reenvie a carga de trabalho e verifique se o erro XID desaparece.

  2. Se o erro persistir, revise seu código e os logs para determinar se o código causou a falha.

  3. Caso seu código não seja a causa,envie um ticket para suporte técnico.

XID

Descrição

13

Exceção do mecanismo gráfico. Geralmente causada por acesso a array fora dos limites ou instrução ilegal. Raramente é um problema de hardware.

31

Falha de página de memória da GPU. Normalmente causada por acesso ilegal à memória pela aplicação. Raramente é um problema de driver ou hardware.

43

A GPU parou de processar. Geralmente é um erro da aplicação, não de hardware.

45

Limpeza preventiva devido a erros anteriores. Provavelmente ocorre ao executar várias aplicações CUDA com um Erro ECC de Bit Duplo (DBE). Indica que uma aplicação GPU encerrou devido a parada manual, problema de hardware ou limite de recursos. A causa específica requer análise adicional dos logs.

68

Exceção NVDEC0. Geralmente é um problema de hardware ou driver.

Solução de problemas via ticket

Para os erros XID a seguir,envie um ticket para o suporte técnico com a saída completa do diagnóstico do nó GPU.

XID

Descrição

32

Fluxo de buffer de push inválido ou corrompido. Reportado pelo controlador DMA no barramento PCIe. Geralmente causado por um problema de qualidade do PCI, não pela aplicação.

38

Erro de firmware do driver. Não é um problema de hardware.

48

Erro ECC de Bit Duplo (DBE). Reportado quando a GPU encontra um erro incorrigível, também notificado à sua aplicação. Geralmente requer redefinição da GPU ou reinicialização do nó para correção.

61

Ponto de interrupção ou aviso interno do microcontrolador. O mecanismo interno da GPU parou, afetando suas cargas de trabalho.

62

Parada interna do microcontrolador. Semelhante ao XID 61.

63

Evento de registro de aposentadoria de página ECC ou remapeamento de linha. Quando ocorre um erro de hardware na memória da GPU, o mecanismo de autocorreção da NVIDIA aposenta ou remapeia a área de memória defeituosa e a registra na infoROM.

  • Volta: Evento de aposentadoria de página ECC registrado com sucesso na infoROM.

  • Ampere: Evento de remapeamento de linha registrado com sucesso na infoROM.

64

Falha no registro de aposentadoria de página ECC ou remapeador de linha. Semelhante ao XID 63, mas o registro na infoROM falhou.

74

Erro NVLINK. Indica uma falha crítica de hardware NVLink. Coloque a GPU offline para manutenção.

79

GPU desconectada do barramento e indetectável. Falha crítica de hardware. Coloque a GPU offline para manutenção.

92

Alta taxa de erros ECC de bit único. Indica uma falha de hardware ou driver.

94

Erro ECC contido. O mecanismo de contenção de erros da NVIDIA isolou um erro ECC incorrigível na aplicação afetada, evitando impacto em outras aplicações no nó.

95

Erro ECC não contido. Semelhante ao XID 94, mas a contenção falhou. Todas as aplicações na GPU são afetadas.

Tópicos relacionados