Diagnostiquez les problèmes des nœuds GPU dans les clusters ACK Pro à l'aide des codes d'état nvidia-smi et des références d'erreur XID.
Prérequis
Un cluster ACK Pro est créé.
Le cluster est à l'état Running. Connectez-vous à la console ACK pour vérifier l'état du cluster sur la page Clusters.
Exécuter un diagnostic de nœud
Sélectionnez un nœud accéléré par GPU, lancez le diagnostic de nœud et utilisez le rapport pour identifier et résoudre les problèmes.
Connectez-vous à la console ACK. Dans le volet de navigation de gauche, cliquez sur Clusters.
Sur la page Clusters, cliquez sur le nom du cluster cible. Dans le volet de navigation de gauche, choisissez .
Sur la page Diagnostics, cliquez sur Node diagnosis. Sur la page Node diagnosis, cliquez sur Diagnosis dans le coin supérieur gauche.
-
Dans le panneau Select Node, sélectionnez un Node Name, lisez les notes, cochez la case I know and agree, puis cliquez sur Create diagnosis.
Suivez la progression du diagnostic sur la page. Une fois le diagnostic terminé, la page affiche les résultats et une liste des éléments diagnostiqués. Examinez les résultats pour identifier et résoudre les problèmes éventuels.
Si le nœud diagnostiqué est un nœud accéléré par GPU, le rapport de diagnostic affiche les métriques liées au GPU une fois le diagnostic terminé. Utilisez ce rapport conjointement avec les rubriques Dépannage à l'aide des codes d'état nvidia-smi et Dépannage à l'aide des erreurs XID pour résoudre les problèmes.
Dépannage à l'aide des codes d'état nvidia-smi****
nvidia-smi surveille les performances et l'état des GPU NVIDIA. Recherchez le résultat NVIDIASMIStatusCode dans le rapport de diagnostic. Le tableau ci-dessous répertorie chaque code d'état et l'action recommandée.
Code d'état Nvidia-smi | Description | Actions |
0 | La commande a réussi. nvidia-smi fonctionne comme prévu. | Sans objet. |
3 | Opération indisponible sur l'appareil cible. Le nœud peut ne pas prendre en charge nvidia-smi ou présenter un problème de pilote. | Vérifiez |
6 | Échec de l'interrogation des appareils GPU. Indique un problème de pilote. | Vérifiez |
8 | Le câble d'alimentation de l'appareil GPU n'est pas correctement connecté. Indique un problème matériel. | Soumettre un ticket pour contacter le support technique ECS. |
9 | Le pilote NVIDIA n'est pas chargé. Indique un problème de pilote. | Vérifiez |
10 | Le noyau NVIDIA a détecté un problème d'interruption. | Vérifiez |
12 | La bibliothèque partagée NVML est introuvable ou n'a pas pu être chargée. | Vérifiez |
13 | La version locale de NVML ne correspond pas à la version du pilote. | Vérifiez |
14 | infoROM corrompu. Indique un problème matériel. | Soumettre un ticket pour contacter le support technique ECS. |
15 | Le GPU s'est déconnecté du bus. Indique un problème matériel. | Soumettre un ticket pour contacter le support technique ECS. |
255 | Erreur de pilote inconnue. Indique un problème de pilote. | Vérifiez |
-1 | La commande nvidia-smi a expiré. | Vérifiez |
Dépannage à l'aide des erreurs XID
Les messages XID sont des rapports d'erreur GPU enregistrés par le pilote NVIDIA dans le journal du noyau du système d'exploitation. Ils identifient le type d'erreur, son emplacement et le code associé au matériel GPU, au logiciel NVIDIA ou à votre application.
Dans le rapport de diagnostic, vérifiez l'élément XID exceptions on GPU-accelerated node. S'il est vide, aucune erreur XID n'est présente. Sinon, utilisez les tableaux ci-dessous pour effectuer le dépannage ou soumettre un ticket.
Dépannage autonome
Si vous rencontrez l'une des erreurs XID suivantes, essayez ces étapes pour les résoudre :
Resoumettez la charge de travail et vérifiez si l'erreur XID disparaît.
Si l'erreur persiste, examinez votre code et vos journaux pour déterminer si votre code en est la cause.
Si votre code n'est pas la cause,soumettez un ticket pour obtenir une assistance technique.
|
XID |
Description |
|
13 |
Exception du moteur graphique. Généralement causée par un accès hors limites à un tableau ou une instruction illégale. Rarement un problème matériel. |
|
31 |
Défaut de page de la mémoire GPU. Généralement causé par un accès mémoire illégal de l'application. Rarement un problème de pilote ou matériel. |
|
43 |
Le GPU a arrêté le traitement. Il s'agit généralement d'une erreur d'application, pas d'un problème matériel. |
|
45 |
Nettoyage préemptif dû à des erreurs précédentes. Se produit le plus souvent lors de l'exécution de plusieurs applications CUDA avec une erreur ECC à double bit (DBE). Indique qu'une application GPU s'est arrêtée en raison d'un arrêt manuel, d'un problème matériel ou d'une limite de ressources. La cause spécifique nécessite une analyse approfondie des journaux. |
|
68 |
Exception NVDEC0. Généralement un problème matériel ou de pilote. |
Dépannage via ticket
Pour les erreurs XID suivantes,soumettez un ticket au support technique avec la sortie complète du diagnostic du nœud GPU.
XID | Description |
32 | Flux de tampon push non valide ou corrompu. Signalé par le contrôleur DMA sur le bus PCIe. Généralement causé par un problème de qualité PCI, pas par l'application. |
38 | Erreur du micrologiciel du pilote, pas un problème matériel. |
48 | Erreur ECC à double bit (DBE). Signalée lorsque le GPU rencontre une erreur irrécupérable, également signalée à votre application. Nécessite généralement une réinitialisation du GPU ou un redémarrage du nœud pour être effacée. |
61 | Point d'arrêt/avertissement interne du microcontrôleur. Le moteur interne du GPU s'est arrêté, affectant vos charges de travail. |
62 | Arrêt interne du microcontrôleur. Similaire à XID 61. |
63 | Événement d'enregistrement de la mise à la retraite de page ECC ou du remapping de ligne. Lorsqu'une erreur matérielle de la mémoire GPU se produit, le mécanisme d'autocorrection de NVIDIA met à la retraite ou remappe la zone de mémoire défectueuse et l'enregistre dans l'infoROM.
|
64 | Échec de l'enregistrement de la mise à la retraite de page ECC ou du remappeur de lignes. Similaire à XID 63, mais l'enregistrement dans l'infoROM a échoué. |
74 | Erreur NVLINK. Indique une défaillance matérielle critique de NVLink. Le GPU doit être mis hors ligne pour maintenance. |
79 | Le GPU s'est déconnecté du bus et ne peut plus être détecté. Défaillance matérielle critique. Le GPU doit être mis hors ligne pour maintenance. |
92 | Taux élevé d'erreurs ECC à bit unique. Indique une défaillance matérielle ou du pilote. |
94 | Erreur ECC contenue. Le mécanisme de confinement d'erreur de NVIDIA a isolé une erreur ECC irrécupérable à l'application concernée, empêchant tout impact sur les autres applications du nœud. |
95 | Erreur ECC non contenue. Similaire à XID 94, mais le confinement a échoué. Toutes les applications sur le GPU sont affectées. |