Tous les produits
Search
Centre de documentation

Container Service for Kubernetes:Enable and use ack-sysom-monitor

Dernière mise à jour :Aug 12, 2026

System Observer Monitoring (SysOM) offre une observabilité des conteneurs au niveau du noyau, prenant en charge le déploiement conteneurisé, la migration et la surveillance. Cette rubrique explique comment activer et utiliser ack-sysom-monitor, et décrit les métriques associées.

Prérequis

Avant de commencer, assurez-vous de disposer des éléments suivants :

Données collectées par ack-sysom-monitor

ack-sysom-monitor est un composant de System Observer Monitoring (SysOM). Il utilise l'extension Berkeley Packet Filter (eBPF) pour collecter et enrichir les métriques au niveau du noyau des nœuds et des conteneurs. En complément des métriques système standard, il fournit des données avancées pour la surveillance du noyau des pods et des nœuds. Cela facilite l'identification de problèmes tels que les instabilités système, les latences, les fuites de ressources et les anomalies de mémoire des pods.

Facturation

Une fois ack-sysom-monitor activé, les composants associés envoient automatiquement les métriques de surveillance à Managed Service for Prometheus. Ces métriques sont facturées en tant que métriques personnalisées.

Avant d'activer cette fonctionnalité, lisez la Vue d'ensemble de la facturation afin de comprendre le mode de facturation des métriques personnalisées. Les frais varient selon la taille du cluster et le nombre d'applications en cours d'exécution. Pour surveiller et maîtriser l'utilisation des ressources, consultez Afficher l'utilisation des ressources.

Activer ack-sysom-monitor

  1. Connectez-vous à la console ARMS.

  2. Dans le volet de navigation de gauche, cliquez sur Integration Center.

  3. Dans la section Infrastructure de la page Integration Center, cliquez sur SysOM System Observation.

  4. À l'étape Start Integration du panneau SysOM System Observation, sélectionnez le cluster ACK puis cliquez sur OK.

Consulter les données de surveillance

  1. Connectez-vous à la console ACK. Dans le volet de navigation de gauche, cliquez sur Clusters.

  2. Sur la page Clusters, cliquez sur le nom de votre cluster. Dans le volet de gauche, choisissez Operations > Prometheus Monitoring.

  3. Sur la page Prometheus Monitoring, cliquez sur l'onglet SysOM. ack-sysom-monitor propose deux vues de surveillance :

    • Surveillance du noyau des nœuds — Sous l'onglet SysOM - Nodes, consultez les métriques CPU, mémoire, ordonnancement, stockage et réseau pour chaque nœud. image.png

    • Surveillance du noyau des pods — Sous l'onglet SysOM - Pods, visualisez en temps réel les métriques de mémoire, CPU, réseau et E/S pour chaque pod. image.png

Étapes suivantes

Pour arrêter la facturation, désinstallez le composant ack-sysom-monitor. Consultez Gérer les composants.

Métriques

Toutes les métriques fournies par ack-sysom-monitor suivent le modèle de données Prometheus.

Tous les types de métriques listés ci-dessous sont de type gauge .

Scénarios de diagnostic

Utilisez le tableau ci-dessous pour associer un symptôme à une métrique.

Symptôme Métriques pertinentes
Limitation du CPU ou retards d'ordonnancement sysom_proc_schedstat, sysom_cpu_dist, sysom_container_cpu_stat, sysom_container_cpu_cfsquota
Charge élevée ou trop de processus en état D sysom_proc_stat_counters, sysom_proc_loadavg
Pression mémoire ou événements OOM sysom_proc_vmstat, sysom_container_memory_gdrcm_latency, sysom_container_memory_cdrcm_latency, sysom_container_memory_cpt_latency
Instabilité mémoire due au cache de pages sysom_container_memory_filecache
Fuites de cgroups sysom_cgroups
Problèmes de latence ou de débit des E/S disque sysom_proc_disks, sysom_container_blkio_stat
Perte de paquets réseau ou retransmissions sysom_proc_pkt_status, sysom_net_retrans_count
RTT TCP élevé ou anomalies de connexion sysom_net_health_hist, sysom_net_health_count, sysom_net_tcp_count
Épuisement des sockets ou des tampons sysom_sock_stat

Métriques des nœuds

Les métriques des nœuds couvrent le CPU et l'ordonnancement, la mémoire, le stockage, le réseau ainsi que d'autres indicateurs système.

CPU et ordonnancement

Métrique

Type

Unité

Description

sysom_proc_cpu_total

gauge

%

Répartition du temps CPU pour l'ensemble du nœud par état : mode utilisateur, mode noyau, softirq, hardirq, inactivité et iowait. Identifie l'état consommateur de temps CPU.

sysom_proc_cpus

gauge

%

Répartition du temps CPU par cœur et par état : mode utilisateur, mode noyau, softirq, hardirq, inactivité et iowait. Détecte les déséquilibres entre les cœurs.

sysom_proc_sirq

gauge

%

Occurrences par type de softirq : HI, TIMER, NET_TX, NET_RX, BLOCK, IRQ_POLL, TASKLET, SCHED, HRTIMER et RCU. Un pic sur NET_RX ou NET_TX peut indiquer une saturation du réseau.

sysom_proc_stat_counters

gauge

-

Nombre de processus en état Running ou D, temps de fonctionnement du système et nombre de changements de contexte. Un nombre élevé de processus en état D signale une contention d'E/S ou de verrous.

sysom_proc_loadavg

gauge

-

Moyennes de charge sur 1, 5 et 15 minutes, longueur de la file d'attente d'exécution et nombre total de processus. Évalue les tendances de charge soutenue.

sysom_proc_schedstat

gauge

ns (nanosecondes)

Latence d'ordonnancement CPU : temps passé en attente dans la file d'exécution et durée de la tranche de temps CPU. Un temps d'attente élevé indique une pression sur l'ordonnancement.

sysom_cpu_dist

gauge

-

Distribution des intervalles d'ordonnancement CPU : temps écoulé entre la libération du CPU et le réordonnancement. Réparti en tranches de 1 µs, 10 µs, 100 µs, 1 ms, 10 ms, 100 ms et 1 s. Les latences de longue traîne indiquent une instabilité de l'ordonnancement.

Mémoire

Métrique

Type

Unité

Description

sysom_proc_meminfo

gauge

KiB

Utilisation de la mémoire au niveau du nœud : Total, Free, Available, Cache, Buffers, SReclaimable et SUnreclaim. Évalue la pression mémoire globale.

sysom_proc_vmstat

gauge

-

Statistiques des pages mémoire : pages libres, pages modifiées (dirty), pages lues/écrites, pages récupérées de la liste inactive et invocations du tueur OOM. L'activité du tueur OOM signale un épuisement critique de la mémoire.

sysom_proc_buddyinfo

gauge

-

État de l'allocateur buddy system : blocs disponibles par taille dans chaque zone mémoire et nœud. Détecte la fragmentation de la mémoire susceptible de provoquer des échecs d'allocation.

Stockage

Métrique

Type

Unité

Description

sysom_proc_disks

gauge

-

Statistiques d'E/S par disque et par partition : nombre de requêtes de lecture/écriture et octets, nombres de fusions, requêtes en cours et temps total d'exécution des requêtes. Diagnostique les problèmes de débit et de latence des disques.

sysom_fs_stat

gauge

-

Utilisation du système de fichiers par point de montage : taille des blocs, blocs utilisés et disponibles, inodes utilisés et disponibles. Détecte l'épuisement des disques ou des inodes avant qu'il ne provoque des pannes.

Réseau

Métrique

Type

Unité

Description

sysom_proc_networks

gauge

-

Statistiques de transfert de données par carte réseau : paquets et octets reçus et envoyés, abandons au niveau du pilote et erreurs d'envoi/réception. Détecte les pertes de paquets au niveau de la carte réseau.

sysom_proc_pkt_status

gauge

-

Événements de la pile de protocoles réseau : abandons de paquets, débordements de tampon et échecs d'assertion. Identifie l'emplacement des pertes de paquets dans la pile.

sysom_sock_stat

gauge

-

Utilisation des sockets et des tampons : nombre total de sockets raw, TCP et UDP, sockets TCP en état TIME_WAIT ou orphelin, et utilisation mémoire des sockets TCP/UDP. Un nombre élevé de connexions TIME_WAIT ou orphelines peut indiquer des problèmes de gestion des connexions liés à la logique applicative ou aux paramètres système.

sysom_softnets

gauge

-

Statistiques softirq par CPU pour les cartes réseau : paquets reçus et envoyés par softirq, et nombre d'invocations de net_rx_action pour les softirqs de réception.

sysom_net_health_hist

gauge

-

Distribution du temps d'aller-retour (RTT) sur toutes les connexions TCP du nœud, répartie en tranches de 10 ms, 100 ms et 1 s. Détecte la dégradation de la latence TCP.

sysom_net_health_count

gauge

-

RTT moyen des connexions TCP sur le nœud. Similaire à sysom_net_health_hist.

sysom_net_retrans_count

gauge

-

Statistiques de retransmission TCP : nombre de paquets retransmis par type (SYN, SYN-ACK, RESET), y compris les retransmissions dues à l'expiration du délai. Une augmentation de ces compteurs indique une instabilité ou une congestion du réseau.

sysom_net_tcp_count

gauge

-

Statistiques des connexions TCP : nombre de connexions actives, segments reçus et envoyés, segments retransmis et échecs de réception.

sysom_net_udp_count

gauge

-

Statistiques UDP : paquets reçus et envoyés, erreurs de tampon d'envoi/réception et paquets abandonnés faute de ports disponibles.

sysom_net_ip_count

gauge

-

Statistiques de la couche IP : paquets transférés, reçus et envoyés.

sysom_net_icmp_count

gauge

-

Statistiques ICMP : paquets reçus et envoyés, et échecs d'envoi/réception.

Autres métriques système

Métrique

Type

Unité

Description

sysom_cgroups

gauge

-

Nombre de cgroups utilisés par sous-système : CPU, Cpuacct, Memory, Pids, Blkio et Devices. Une augmentation continue sans diminution peut indiquer des fuites de cgroups.

sysom_uptime

gauge

s (secondes)

Temps de fonctionnement du système depuis le dernier démarrage et temps d'inactivité.

Métriques des conteneurs

Les métriques des conteneurs incluent le CPU et l'ordonnancement, la mémoire, les E/S et le réseau.

CPU et ordonnancement

Métrique

Type

Unité

Description

sysom_container_cpu_stat

gauge

-

Statistiques de limitation du CPU par cgroup : nombre d'applications des limites CPU, nombre total d'applications et durée totale de limitation. Détermine si les quotas de ressources nécessitent un ajustement.

sysom_container_cpu_acctstat

gauge

%

Utilisation du CPU pour les tâches du conteneur, ventilée par mode : utilisateur, noyau et total. Montre comment les conteneurs consomment le CPU entre l'espace noyau et l'espace utilisateur.

sysom_container_cpu_cfsquota

gauge

-

Configuration du Completely Fair Scheduler (CFS) pour le cgroup du conteneur : cfs_period_us (durée de chaque fenêtre temporelle CFS) et cfs_quota_us (temps CPU maximal disponible pour le cgroup dans chaque fenêtre). Vérifie que les limites CPU sont correctement définies.

Mémoire

Métrique

Type

Unité

Description

sysom_container_memory_stat

gauge

KiB

Utilisation de la mémoire du conteneur par catégorie : Total, Free, Available, Cache, Buffers, SReclaimable et SUnreclaim. Évalue la consommation mémoire par conteneur.

sysom_container_memory_filecache

gauge

KiB

Utilisation du cache de pages par conteneur : les 10 fichiers consommant le plus de cache de pages, leurs tailles et le total occupé. Identifie les conteneurs où la surutilisation du cache de pages provoque une pression mémoire, de la latence ou des instabilités.

sysom_container_memory_gdrcm_latency

gauge

Occurrences

Retards causés par la récupération de mémoire suite à des ressources mémoire insuffisantes. Compte les retards dans six plages : 1–5 ms, 5–10 ms, 10–100 ms, 100–500 ms, 500–1 000 ms et plus de 1 000 ms. Détecte la pression mémoire au niveau du nœud affectant les performances du conteneur.

sysom_container_memory_cdrcm_latency

gauge

Occurrences

Retards causés par la récupération de mémoire dus à des cgroups mémoire insuffisants. Compte les retards dans les mêmes six plages que sysom_container_memory_gdrcm_latency.

**

Note

Cette métrique n'est valide que si les cgroups mémoire actuels ne sont pas des cgroups racine ou si des limites de mémoire sont configurées pour les cgroups mémoire actuels.

sysom_container_memory_cpt_latency

gauge

Occurrences

Retards causés par l'ajustement de la mémoire noyau, déclenchés lorsqu'un processus du conteneur demande de la mémoire alors que le nœud manque de mémoire ou présente un nombre excessif de fragments mémoire. Compte les retards dans les mêmes six plages. Détecte la fragmentation de la mémoire impactant l'allocation du conteneur.

E/S

Métrique

Type

Unité

Description

sysom_container_blkio_stat

gauge

-

Statistiques d'E/S bloc pour le disque du conteneur : nombre de requêtes de lecture/écriture et octets, nombre de requêtes en attente et octets, et temps d'attente des requêtes. Diagnostique les goulots d'étranglement d'E/S au niveau du conteneur.

Réseau

Métrique

Type

Unité

Description

sysom_container_network_stat

gauge

-

Statistiques de transfert de données de la carte réseau virtuelle par conteneur : paquets et octets reçus et envoyés, et abandons au niveau du périphérique. Les paquets abandonnés par la pile de protocoles réseau ne sont pas inclus.