Todos os produtos
Search
Central de documentação

Alibaba Cloud Linux:Unified Kernel Fault Event Framework (UKFEF)

Última atualização: Aug 24, 2026

O Alibaba Cloud Linux 3 (a partir da versão do kernel 5.10.60-9.al8.x86_64) introduz o Unified Kernel Fault Event Framework (UKFEF). O UKFEF coleta anomalias de sistema que podem representar riscos e gera relatórios de eventos em formato unificado. Este tópico descreve os eventos coletados pelo UKFEF, o formato dos relatórios de eventos e as interfaces usadas para controlar o UKFEF.

Informações de contexto

Um sistema operacional pode apresentar certos sinais ou mensagens antes que problemas graves ocorram. Durante operações e manutenção (O&M), use essas informações para prever falhas e executar ações preventivas. No entanto, como esses dados estão dispersos em diferentes módulos do sistema e disponíveis em vários formatos, a coleta de anomalias do sistema pode enfrentar os seguintes desafios:

  • Analisar anomalias e seus possíveis impactos exige conhecimento especializado.

  • A diversidade de formatos das anomalias dificulta a automação de O&M, pois exige correspondência de formatos durante a coleta de informações, seguida de limpeza de dados.

Para resolver esses problemas, o Alibaba Cloud Linux 3 inclui o UKFEF na camada do kernel. O UKFEF coleta diversas anomalias do sistema que podem representar riscos, determina automaticamente a gravidade do evento e gera relatórios em formato unificado. Os relatórios incluem os cenários em que os problemas ocorreram e os níveis de risco recomendados, o que simplifica a identificação de anomalias do sistema durante O&M. Além disso, o UKFEF classifica anomalias conhecidas e fornece relatórios de riscos do sistema indisponíveis em versões anteriores do kernel.

O UKFEF gera relatórios com base em múltiplas dimensões, como tipo, impacto e estatísticas das anomalias, para ajudar no diagnóstico eficiente de anomalias do sistema durante O&M. Adicionalmente, o UKFEF gera relatórios de eventos por vários métodos para evitar perda de dados.UKFEF

Descrição dos eventos

A tabela a seguir descreve os tipos de eventos, níveis de eventos e formatos de relatório utilizados pelo UKFEF.

Informações do evento

Descrição

Tipo de evento

O UKFEF coleta os seguintes eventos comuns do kernel do sistema operacional:

  • soft lockup

  • Read-Copy atualize (RCU) stall

  • hung task

  • global out-of-memory (OOM)

  • cgroup OOM

  • page allocation failure

  • list corruption

  • bad mm_struct

  • I/O error

  • EXT4-fs error

  • Machine Check Exception (MCE)

  • fatal signal

  • warning

  • panic

Nível do evento

O UKFEF classifica os eventos de anomalia em três níveis:

  • Slight: Não afeta a operação do sistema, mas os services implantados podem sofrer instabilidade. Continue monitorando o evento.

  • Normal: O processo da aplicação atual pode apresentar comportamento anormal. Tome medidas sobre a aplicação atual, como usar kill, reiniciá-la ou migrá-la.

  • Fatal: Pode causar impacto crítico no sistema. Migre seus services imediatamente.

Relatório de evento

O UKFEF emite relatórios de eventos das seguintes formas:

  • Emite os detalhes de um único evento por meio de logs do kernel. A mensagem de exemplo a seguir mostra o formato das informações:

    class Fault event[module:type]:messages. At cpu cpuid, task pid(cmdline). Total fault: cnt

    Os detalhes são os seguintes:

    • class: O nível do evento de anomalia.

    • module: O módulo ao qual o evento de anomalia pertence. Os módulos incluem sched, mem, io, fs, net e hardware. Se uma anomalia for causada por vários módulos, general será emitido.

    • type: O tipo do evento de anomalia.

    • messages: A mensagem personalizada do evento.

    • cpuid: O ID da CPU onde o evento de anomalia ocorreu.

    • pid(cmdline): O ID do processo (PID) e a linha de comando do processo correspondente ao evento de anomalia.

      Nota

      Se o PID for -1, não existe nenhum processo correspondente.

    • cnt: O número total de vezes que esse tipo de evento de anomalia ocorreu desde a inicialização do sistema.

  • Emite a contagem total de cada tipo de evento de anomalia no arquivo /proc/fault_events. A saída de exemplo a seguir mostra o conteúdo do arquivo:

    Total fault events: 0
        Slight: 0
        Normal: 0
        Fatal: 0
        soft lockup: 0
        rcu stall: 0
        hung task: 0
        global oom: 0
        cgroup oom: 0
        page allocation failure: 0
        list corruption: 0
        bad mm_struct: 0
        io error: 0
        ext4 fs error: 0
        mce: 0
        fatal signal: 0
        warning: 0
        panic: 0

Interfaces de controle

Interface

Descrição

/proc/sys/kernel/fault_event_enable

Controla a ativação ou desativação do UKFEF. Valores válidos:

  • 1: Ative o UKFEF.

  • 0: Desativa o UKFEF.

/proc/sys/kernel/fault_event_print

Define se o UKFEF deve emitir relatórios de eventos. Valores válidos:

  • 1: Emite relatórios.

  • 0: Nenhuma saída é gerada.

/proc/sys/kernel/panic_on_fatal_event

Determina se o mecanismo Panic do sistema operacional deve ser acionado quando ocorrer um evento Fatal. Valores válidos:

  • 1: Aciona o mecanismo.

  • 0: Não aciona o mecanismo.