System Observer Monitoring (SysOM) offre une observabilité des conteneurs au niveau du noyau, prenant en charge le déploiement conteneurisé, la migration et la surveillance. Cette rubrique explique comment activer et utiliser ack-sysom-monitor, et décrit les métriques associées.
Prérequis
Avant de commencer, assurez-vous de disposer des éléments suivants :
Un cluster ACK géré ou un cluster ACK Serverless créé après octobre 2021, exécutant Kubernetes 1.18.8 ou version ultérieure. Consultez Créer un cluster ACK géré ou Créer un cluster ACK Serverless. Pour mettre à jour, reportez-vous à Mettre à jour manuellement les clusters ACK
Managed Service for Prometheus activé. Consultez Activer Managed Service for Prometheus
Données collectées par ack-sysom-monitor
ack-sysom-monitor est un composant de System Observer Monitoring (SysOM). Il utilise l'extension Berkeley Packet Filter (eBPF) pour collecter et enrichir les métriques au niveau du noyau des nœuds et des conteneurs. En complément des métriques système standard, il fournit des données avancées pour la surveillance du noyau des pods et des nœuds. Cela facilite l'identification de problèmes tels que les instabilités système, les latences, les fuites de ressources et les anomalies de mémoire des pods.
Facturation
Une fois ack-sysom-monitor activé, les composants associés envoient automatiquement les métriques de surveillance à Managed Service for Prometheus. Ces métriques sont facturées en tant que métriques personnalisées.
Avant d'activer cette fonctionnalité, lisez la Vue d'ensemble de la facturation afin de comprendre le mode de facturation des métriques personnalisées. Les frais varient selon la taille du cluster et le nombre d'applications en cours d'exécution. Pour surveiller et maîtriser l'utilisation des ressources, consultez Afficher l'utilisation des ressources.
Activer ack-sysom-monitor
Connectez-vous à la console ARMS.
Dans le volet de navigation de gauche, cliquez sur Integration Center.
Dans la section Infrastructure de la page Integration Center, cliquez sur SysOM System Observation.
À l'étape Start Integration du panneau SysOM System Observation, sélectionnez le cluster ACK puis cliquez sur OK.
Consulter les données de surveillance
Connectez-vous à la console ACK. Dans le volet de navigation de gauche, cliquez sur Clusters.
Sur la page Clusters, cliquez sur le nom de votre cluster. Dans le volet de gauche, choisissez Operations > Prometheus Monitoring.
-
Sur la page Prometheus Monitoring, cliquez sur l'onglet SysOM.
ack-sysom-monitorpropose deux vues de surveillance :Surveillance du noyau des nœuds — Sous l'onglet SysOM - Nodes, consultez les métriques CPU, mémoire, ordonnancement, stockage et réseau pour chaque nœud.

Surveillance du noyau des pods — Sous l'onglet SysOM - Pods, visualisez en temps réel les métriques de mémoire, CPU, réseau et E/S pour chaque pod.

Étapes suivantes
Pour arrêter la facturation, désinstallez le composant ack-sysom-monitor. Consultez Gérer les composants.
Métriques
Toutes les métriques fournies par ack-sysom-monitor suivent le modèle de données Prometheus.
Tous les types de métriques listés ci-dessous sont de type gauge .
Scénarios de diagnostic
Utilisez le tableau ci-dessous pour associer un symptôme à une métrique.
| Symptôme | Métriques pertinentes |
|---|---|
| Limitation du CPU ou retards d'ordonnancement | sysom_proc_schedstat, sysom_cpu_dist, sysom_container_cpu_stat, sysom_container_cpu_cfsquota |
| Charge élevée ou trop de processus en état D | sysom_proc_stat_counters, sysom_proc_loadavg |
| Pression mémoire ou événements OOM | sysom_proc_vmstat, sysom_container_memory_gdrcm_latency, sysom_container_memory_cdrcm_latency, sysom_container_memory_cpt_latency |
| Instabilité mémoire due au cache de pages | sysom_container_memory_filecache |
| Fuites de cgroups | sysom_cgroups |
| Problèmes de latence ou de débit des E/S disque | sysom_proc_disks, sysom_container_blkio_stat |
| Perte de paquets réseau ou retransmissions | sysom_proc_pkt_status, sysom_net_retrans_count |
| RTT TCP élevé ou anomalies de connexion | sysom_net_health_hist, sysom_net_health_count, sysom_net_tcp_count |
| Épuisement des sockets ou des tampons | sysom_sock_stat |
Métriques des nœuds
Les métriques des nœuds couvrent le CPU et l'ordonnancement, la mémoire, le stockage, le réseau ainsi que d'autres indicateurs système.
CPU et ordonnancement
|
Métrique |
Type |
Unité |
Description |
|
sysom_proc_cpu_total |
gauge |
% |
Répartition du temps CPU pour l'ensemble du nœud par état : mode utilisateur, mode noyau, softirq, hardirq, inactivité et iowait. Identifie l'état consommateur de temps CPU. |
|
sysom_proc_cpus |
gauge |
% |
Répartition du temps CPU par cœur et par état : mode utilisateur, mode noyau, softirq, hardirq, inactivité et iowait. Détecte les déséquilibres entre les cœurs. |
|
sysom_proc_sirq |
gauge |
% |
Occurrences par type de softirq : HI, TIMER, NET_TX, NET_RX, BLOCK, IRQ_POLL, TASKLET, SCHED, HRTIMER et RCU. Un pic sur NET_RX ou NET_TX peut indiquer une saturation du réseau. |
|
sysom_proc_stat_counters |
gauge |
- |
Nombre de processus en état Running ou D, temps de fonctionnement du système et nombre de changements de contexte. Un nombre élevé de processus en état D signale une contention d'E/S ou de verrous. |
|
sysom_proc_loadavg |
gauge |
- |
Moyennes de charge sur 1, 5 et 15 minutes, longueur de la file d'attente d'exécution et nombre total de processus. Évalue les tendances de charge soutenue. |
|
sysom_proc_schedstat |
gauge |
ns (nanosecondes) |
Latence d'ordonnancement CPU : temps passé en attente dans la file d'exécution et durée de la tranche de temps CPU. Un temps d'attente élevé indique une pression sur l'ordonnancement. |
|
sysom_cpu_dist |
gauge |
- |
Distribution des intervalles d'ordonnancement CPU : temps écoulé entre la libération du CPU et le réordonnancement. Réparti en tranches de 1 µs, 10 µs, 100 µs, 1 ms, 10 ms, 100 ms et 1 s. Les latences de longue traîne indiquent une instabilité de l'ordonnancement. |
Mémoire
|
Métrique |
Type |
Unité |
Description |
|
sysom_proc_meminfo |
gauge |
KiB |
Utilisation de la mémoire au niveau du nœud : Total, Free, Available, Cache, Buffers, SReclaimable et SUnreclaim. Évalue la pression mémoire globale. |
|
sysom_proc_vmstat |
gauge |
- |
Statistiques des pages mémoire : pages libres, pages modifiées (dirty), pages lues/écrites, pages récupérées de la liste inactive et invocations du tueur OOM. L'activité du tueur OOM signale un épuisement critique de la mémoire. |
|
sysom_proc_buddyinfo |
gauge |
- |
État de l'allocateur buddy system : blocs disponibles par taille dans chaque zone mémoire et nœud. Détecte la fragmentation de la mémoire susceptible de provoquer des échecs d'allocation. |
Stockage
|
Métrique |
Type |
Unité |
Description |
|
sysom_proc_disks |
gauge |
- |
Statistiques d'E/S par disque et par partition : nombre de requêtes de lecture/écriture et octets, nombres de fusions, requêtes en cours et temps total d'exécution des requêtes. Diagnostique les problèmes de débit et de latence des disques. |
|
sysom_fs_stat |
gauge |
- |
Utilisation du système de fichiers par point de montage : taille des blocs, blocs utilisés et disponibles, inodes utilisés et disponibles. Détecte l'épuisement des disques ou des inodes avant qu'il ne provoque des pannes. |
Réseau
|
Métrique |
Type |
Unité |
Description |
|
sysom_proc_networks |
gauge |
- |
Statistiques de transfert de données par carte réseau : paquets et octets reçus et envoyés, abandons au niveau du pilote et erreurs d'envoi/réception. Détecte les pertes de paquets au niveau de la carte réseau. |
|
sysom_proc_pkt_status |
gauge |
- |
Événements de la pile de protocoles réseau : abandons de paquets, débordements de tampon et échecs d'assertion. Identifie l'emplacement des pertes de paquets dans la pile. |
|
sysom_sock_stat |
gauge |
- |
Utilisation des sockets et des tampons : nombre total de sockets raw, TCP et UDP, sockets TCP en état TIME_WAIT ou orphelin, et utilisation mémoire des sockets TCP/UDP. Un nombre élevé de connexions TIME_WAIT ou orphelines peut indiquer des problèmes de gestion des connexions liés à la logique applicative ou aux paramètres système. |
|
sysom_softnets |
gauge |
- |
Statistiques softirq par CPU pour les cartes réseau : paquets reçus et envoyés par softirq, et nombre d'invocations de |
|
sysom_net_health_hist |
gauge |
- |
Distribution du temps d'aller-retour (RTT) sur toutes les connexions TCP du nœud, répartie en tranches de 10 ms, 100 ms et 1 s. Détecte la dégradation de la latence TCP. |
|
sysom_net_health_count |
gauge |
- |
RTT moyen des connexions TCP sur le nœud. Similaire à |
|
sysom_net_retrans_count |
gauge |
- |
Statistiques de retransmission TCP : nombre de paquets retransmis par type (SYN, SYN-ACK, RESET), y compris les retransmissions dues à l'expiration du délai. Une augmentation de ces compteurs indique une instabilité ou une congestion du réseau. |
|
sysom_net_tcp_count |
gauge |
- |
Statistiques des connexions TCP : nombre de connexions actives, segments reçus et envoyés, segments retransmis et échecs de réception. |
|
sysom_net_udp_count |
gauge |
- |
Statistiques UDP : paquets reçus et envoyés, erreurs de tampon d'envoi/réception et paquets abandonnés faute de ports disponibles. |
|
sysom_net_ip_count |
gauge |
- |
Statistiques de la couche IP : paquets transférés, reçus et envoyés. |
|
sysom_net_icmp_count |
gauge |
- |
Statistiques ICMP : paquets reçus et envoyés, et échecs d'envoi/réception. |
Autres métriques système
|
Métrique |
Type |
Unité |
Description |
|
sysom_cgroups |
gauge |
- |
Nombre de cgroups utilisés par sous-système : CPU, Cpuacct, Memory, Pids, Blkio et Devices. Une augmentation continue sans diminution peut indiquer des fuites de cgroups. |
|
sysom_uptime |
gauge |
s (secondes) |
Temps de fonctionnement du système depuis le dernier démarrage et temps d'inactivité. |
Métriques des conteneurs
Les métriques des conteneurs incluent le CPU et l'ordonnancement, la mémoire, les E/S et le réseau.
CPU et ordonnancement
|
Métrique |
Type |
Unité |
Description |
|
sysom_container_cpu_stat |
gauge |
- |
Statistiques de limitation du CPU par cgroup : nombre d'applications des limites CPU, nombre total d'applications et durée totale de limitation. Détermine si les quotas de ressources nécessitent un ajustement. |
|
sysom_container_cpu_acctstat |
gauge |
% |
Utilisation du CPU pour les tâches du conteneur, ventilée par mode : utilisateur, noyau et total. Montre comment les conteneurs consomment le CPU entre l'espace noyau et l'espace utilisateur. |
|
sysom_container_cpu_cfsquota |
gauge |
- |
Configuration du Completely Fair Scheduler (CFS) pour le cgroup du conteneur : |
Mémoire
|
Métrique |
Type |
Unité |
Description |
|
sysom_container_memory_stat |
gauge |
KiB |
Utilisation de la mémoire du conteneur par catégorie : Total, Free, Available, Cache, Buffers, SReclaimable et SUnreclaim. Évalue la consommation mémoire par conteneur. |
|
sysom_container_memory_filecache |
gauge |
KiB |
Utilisation du cache de pages par conteneur : les 10 fichiers consommant le plus de cache de pages, leurs tailles et le total occupé. Identifie les conteneurs où la surutilisation du cache de pages provoque une pression mémoire, de la latence ou des instabilités. |
|
sysom_container_memory_gdrcm_latency |
gauge |
Occurrences |
Retards causés par la récupération de mémoire suite à des ressources mémoire insuffisantes. Compte les retards dans six plages : 1–5 ms, 5–10 ms, 10–100 ms, 100–500 ms, 500–1 000 ms et plus de 1 000 ms. Détecte la pression mémoire au niveau du nœud affectant les performances du conteneur. |
|
sysom_container_memory_cdrcm_latency |
gauge |
Occurrences |
Retards causés par la récupération de mémoire dus à des cgroups mémoire insuffisants. Compte les retards dans les mêmes six plages que ** Note Cette métrique n'est valide que si les cgroups mémoire actuels ne sont pas des cgroups racine ou si des limites de mémoire sont configurées pour les cgroups mémoire actuels. |
|
sysom_container_memory_cpt_latency |
gauge |
Occurrences |
Retards causés par l'ajustement de la mémoire noyau, déclenchés lorsqu'un processus du conteneur demande de la mémoire alors que le nœud manque de mémoire ou présente un nombre excessif de fragments mémoire. Compte les retards dans les mêmes six plages. Détecte la fragmentation de la mémoire impactant l'allocation du conteneur. |
E/S
|
Métrique |
Type |
Unité |
Description |
|
sysom_container_blkio_stat |
gauge |
- |
Statistiques d'E/S bloc pour le disque du conteneur : nombre de requêtes de lecture/écriture et octets, nombre de requêtes en attente et octets, et temps d'attente des requêtes. Diagnostique les goulots d'étranglement d'E/S au niveau du conteneur. |
Réseau
|
Métrique |
Type |
Unité |
Description |
|
sysom_container_network_stat |
gauge |
- |
Statistiques de transfert de données de la carte réseau virtuelle par conteneur : paquets et octets reçus et envoyés, et abandons au niveau du périphérique. Les paquets abandonnés par la pile de protocoles réseau ne sont pas inclus. |