Artificial Intelligence for IT Operations (AIOps) propose un diagnostic en un clic pour les nœuds, les pods, les services, les Ingresses, la mémoire, le réseau et l'analyse des performances IA (AI Profiling). Cette fonctionnalité vous aide à localiser les problèmes au sein de votre cluster. Cette rubrique explique comment utiliser la fonction de diagnostic de cluster dans un cluster ACK.
Prérequis
Un cluster managé ACK a été créé. Pour plus d'informations, consultez la rubrique Créer un cluster managé ACK.
-
Le statut du cluster Kubernetes est Running.
RemarqueConnectez-vous à la console Container Service Management. Sur la page Clusters, vérifiez la colonne Cluster Status pour confirmer que le statut du cluster est Running.
Fonctionnalités de diagnostic
AIOps fournit les fonctionnalités de diagnostic décrites dans le tableau suivant.
|**Élément de diagnostic**
|
**Description**
| | --- | --- | |
[Diagnostic des nœuds](t2303418.dita#task_2303418)
|
Détecte les problèmes liés aux nœuds, tels que les nœuds Kubernetes à l'état NotReady.
| |
[Diagnostic des pods](t2303417.dita#task_2303417)
|
Détecte les problèmes liés à un statut de pod anormal, tels que les échecs de démarrage ou les redémarrages fréquents de pods.
| |
[Diagnostic des services](t2303419.dita#task_2303419)
|
Détecte les problèmes liés aux services, tels que les configurations de service, les quotas de ressources et les activités anormales.
| |
[Diagnostic Ingress](t2303420.dita#task_2303420)
|
Détecte les problèmes liés aux Ingresses, tels que les configurations de trafic.
| |
[Diagnostic de la mémoire](t2303421.dita#task_2303421)
|
Détecte les problèmes de mémoire des nœuds, tels que les fuites de mémoire, les fuites cgroup et les erreurs d'épuisement de la mémoire (OOM). Les résultats du diagnostic affichent l'utilisation globale de la mémoire sous forme de graphique.
| |
[Diagnostic réseau](t2454146.xdita#)
|
Détecte les problèmes réseau courants, tels que les problèmes de connectivité entre les pods, entre le cluster et Internet, ou entre Internet et un LoadBalancer.
| |
[AI Profiling](t2981803.xdita#)
|
Collecte des données en temps réel à partir des conteneurs GPU en ligne, y compris les appels CPU, les processus Python, les appels système et les fonctions noyau CUDA. Vous pouvez analyser les données via une interface graphique.
|
Configurer le diagnostic
Lorsque vous utilisez la fonction de diagnostic de cluster, un programme de collecte de données s'exécute sur les nœuds de votre cluster pour collecter les résultats des vérifications. Les informations collectées incluent la version du système, la charge, l'état d'exécution de Docker et de kubelet, ainsi que les messages d'erreur critiques issus des journaux système. Le programme de collecte de données ne recueille ni vos informations métier ni vos données sensibles.
Les procédures de configuration du diagnostic pour les nœuds, les pods, les services et les Ingresses sont similaires. La section suivante utilise le diagnostic des nœuds comme exemple pour montrer comment configurer cette fonctionnalité.
Connectez-vous à la console ACK. Dans le volet de navigation de gauche, cliquez sur Clusters.
Sur la page Clusters, cliquez sur le nom du cluster cible. Dans le volet de navigation de gauche, choisissez .
Sur la page Diagnostics, cliquez sur Node diagnosis. Sur la page Node diagnosis qui s'affiche, cliquez sur Diagnosis dans le coin supérieur gauche.
-
Dans le panneau Select Node, sélectionnez un Node Name, lisez les remarques, cochez la case I know and agree, puis cliquez sur Create diagnosis.
Suivez la progression du diagnostic sur la page. Une fois le diagnostic terminé, la page affiche les résultats ainsi qu'une liste des éléments diagnostiqués. Consultez ensuite les résultats pour identifier la cause des problèmes et les résoudre.
Afficher les résultats du diagnostic
Sur la page de diagnostic, repérez le rapport de diagnostic dans la liste et cliquez sur Diagnosis details dans la colonne Operation pour afficher les résultats détaillés du diagnostic.
Élément de diagnostic | Statut de l'élément de vérification | Description |
Node diagnosis |
| Le diagnostic des nœuds comprend les éléments de vérification Node, NodeComponent, ClusterComponent, ECSControllerManager et GPUNode. La cause d'une anomalie de nœud est déterminée en fonction du statut du nœud, du statut des composants du nœud, du statut des composants du cluster et du statut ECS. Sur la page des détails du diagnostic, vous pouvez consulter les résultats du diagnostic des nœuds, les suggestions de réparation et la liste des éléments de vérification spécifiques. Placez le pointeur de la souris sur l'icône S'il existe des éléments de vérification dont le statut est anormal ou comporte un avertissement, ils sont affichés dans l'onglet Troubleshoot. Si un élément de vérification présente un statut anormal, vous pouvez visualiser l'anomalie dans l'infobulle qui s'affiche lorsque vous placez le pointeur de la souris sur Details dans la colonne Status correspondant à cet élément. |
Pod diagnosis | Le diagnostic des pods comprend les éléments de vérification Pod, ClusterComponent, Node, NodeComponent et ECSControllerManager. La cause d'une anomalie de pod est déterminée en fonction du statut du pod, du statut des composants du cluster, du statut du nœud, du statut des composants du nœud et du statut ECS. Sur la page des détails du diagnostic, vous pouvez consulter les résultats du diagnostic des pods, les suggestions de réparation et la liste des éléments de vérification spécifiques. Placez le pointeur de la souris sur l'icône S'il existe des éléments de vérification dont le statut est anormal ou comporte un avertissement, ils sont affichés dans l'onglet Troubleshoot. Si un élément de vérification présente un statut anormal, vous pouvez visualiser l'anomalie dans l'infobulle qui s'affiche lorsque vous placez le pointeur de la souris sur Details dans la colonne Status correspondant à cet élément. | |
Service diagnosis | Le diagnostic des services comprend les éléments de vérification Service et ResourceQuotas. La cause d'une anomalie de service est déterminée en vérifiant des éléments tels que le type de facturation CLB, les certificats, les quotas et les événements anormaux. Placez le pointeur de la souris sur l'icône S'il existe des éléments de vérification dont le statut est anormal ou comporte un avertissement, ils sont affichés dans l'onglet Troubleshoot. Si un élément de vérification présente un statut anormal, vous pouvez visualiser l'anomalie dans l'infobulle qui s'affiche lorsque vous placez le pointeur de la souris sur Details dans la colonne Status correspondant à cet élément. | |
Ingress diagnosis | Le diagnostic Ingress comprend les éléments de vérification Ingress, Addon et SLB. La cause d'une anomalie Ingress est déterminée en fonction du statut Ingress, du statut du plug-in Ingress et du statut SLB. Placez le pointeur de la souris sur l'icône S'il existe des éléments de vérification dont le statut est anormal ou comporte un avertissement, ils sont affichés dans l'onglet Troubleshoot. Si un élément de vérification présente un statut anormal, vous pouvez visualiser l'anomalie dans l'infobulle qui s'affiche lorsque vous placez le pointeur de la souris sur Details dans la colonne Status correspondant à cet élément. | |
Memory Diagnosis | Aucun. | Sur la page des détails du diagnostic, vous pouvez consulter l'Memory Overview, l'Memory Analysis et l'OOM Analysis, qui incluent des informations telles que l'état des fuites de mémoire, l'utilisation de la mémoire et la mémoire occupée par chaque processus. |
Network diagnostics |
| Sur la page Diagnosis result, vous pouvez consulter les résultats du diagnostic réseau. La zone Packet paths affiche une carte complète du chemin d'accès pour le diagnostic. Les nœuds anormaux sont mis en évidence avec une couleur différente de celle des nœuds normaux. |