Tous les produits
Search
Centre de documentation

Alibaba Cloud Linux:Unified Kernel Fault Event Framework (UKFEF)

Dernière mise à jour :Aug 24, 2026

Alibaba Cloud Linux 3 (à partir de la version du noyau 5.10.60-9.al8.x86_64) introduit le Unified Kernel Fault Event Framework (UKFEF). UKFEF collecte les anomalies système susceptibles de présenter des risques et génère des rapports d'événements dans un format unifié. Cette rubrique décrit les événements collectés par UKFEF, le format des rapports d'événements ainsi que les interfaces permettant de contrôler UKFEF.

Contexte

Un système d'exploitation peut afficher certains signes ou messages avant l'apparition de problèmes graves. Lors des opérations et de la maintenance (O&M), vous pouvez exploiter ces informations pour anticiper les pannes et effectuer des actions préventives. Toutefois, ces données sont dispersées entre différents modules système et disponibles dans divers formats. Par conséquent, la collecte des anomalies système peut poser les problèmes suivants :

  • L'analyse des anomalies et de leurs impacts potentiels requiert des connaissances spécialisées.

  • La diversité des formats d'anomalies complexifie l'automatisation des opérations O&M. Cela nécessite une mise en correspondance des formats lors de la collecte des informations, suivie d'un nettoyage des données.

Pour résoudre ces problèmes, Alibaba Cloud Linux 3 intègre UKFEF au niveau du noyau. UKFEF collecte diverses anomalies système susceptibles de présenter des risques, détermine automatiquement la gravité de l'événement et génère des rapports d'événements dans un format unifié. Les rapports incluent les scénarios dans lesquels les problèmes sont survenus ainsi que les niveaux de risque recommandés. Cette approche simplifie l'identification des anomalies système lors des opérations O&M. UKFEF classe également les anomalies connues et fournit des rapports sur les risques système qui n'étaient pas disponibles dans les versions précédentes du noyau.

UKFEF génère des rapports selon plusieurs dimensions, telles que le type, l'impact et les statistiques des anomalies. Cela vous aide à diagnostiquer efficacement les anomalies système lors des opérations O&M. De plus, les rapports d'événements sont générés via plusieurs méthodes afin d'éviter toute perte de données.UKFEF

description des événements

Le tableau suivant décrit les types d'événements, les niveaux d'événements et les formats de rapport utilisés par UKFEF.

Informations sur l'événement

description

Type d'événement

UKFEF collecte les événements courants suivants du noyau du système d'exploitation :

  • soft lockup

  • Read-Copy Update (RCU) stall

  • hung task

  • global out-of-memory (OOM)

  • cgroup OOM

  • page allocation failure

  • list corruption

  • bad mm_struct

  • I/O error

  • EXT4-fs error

  • Machine Check Exception (MCE)

  • fatal signal

  • warning

  • panic

Niveau d'événement

UKFEF classe les événements anormaux en trois niveaux :

  • Slight : N'affecte pas le fonctionnement du système, mais les services déployés sur celui-ci peuvent subir des fluctuations. Vous pouvez continuer à surveiller l'événement.

  • Normal : Le processus d'application actuel peut devenir anormal. Intervenez sur l'application concernée, par exemple en utilisant kill, en la redémarrant ou en la migrant.

  • Fatal : Peut avoir un impact fatal sur le système. Migrez vos services immédiatement.

Rapport d'événement

UKFEF produit des rapports d'événements de la manière suivante :

  • Affiche les détails d'un événement unique via les journaux du noyau. Le message d'exemple suivant illustre le format des informations :

    class Fault event[module:type]:messages. At cpu cpuid, task pid(cmdline). Total fault: cnt

    Voici les détails :

    • class : Le niveau de l'événement anormal.

    • module : Le module auquel appartient l'événement anormal. Les modules incluent sched, mem, io, fs, net et hardware. Si une anomalie est causée par plusieurs modules, general est affiché.

    • type : Le type de l'événement anormal.

    • messages : Le message personnalisé de l'événement.

    • cpuid : L'ID du CPU où l'événement anormal s'est produit.

    • pid(cmdline) : L'ID de processus (PID) et la ligne de commande du processus correspondant à l'événement anormal.

      Remarque

      Si le PID est -1, aucun processus correspondant n'existe.

    • cnt : Le nombre total de fois où ce type d'événement anormal s'est produit depuis le démarrage du système.

  • Affiche le nombre total de chaque type d'événement anormal dans le fichier /proc/fault_events. La sortie d'exemple suivante montre le contenu du fichier :

    Total fault events: 0
        Slight: 0
        Normal: 0
        Fatal: 0
        soft lockup: 0
        rcu stall: 0
        hung task: 0
        global oom: 0
        cgroup oom: 0
        page allocation failure: 0
        list corruption: 0
        bad mm_struct: 0
        io error: 0
        ext4 fs error: 0
        mce: 0
        fatal signal: 0
        warning: 0
        panic: 0

Interfaces de contrôle

Interface

description

/proc/sys/kernel/fault_event_enable

Contrôle l'activation ou la désactivation de UKFEF. Valeurs valides :

  • 1 : Active UKFEF.

  • 0 : Désactive UKFEF.

/proc/sys/kernel/fault_event_print

Contrôle si UKFEF produit des rapports d'événements. Valeurs valides :

  • 1. Produit une sortie.

  • 0 : Aucune sortie n'est générée.

/proc/sys/kernel/panic_on_fatal_event

Contrôle si le mécanisme Panic du système d'exploitation doit être déclenché lorsqu'un événement Fatal se produit. Valeurs valides :

  • 1. Déclencher.

  • 0 : Non déclenché.