Todos os produtos
Search
Central de documentação

Container Service for Kubernetes:Ative e use ack-sysom-monitor

Última atualização: Jun 27, 2026

O System Observer Monitoring (SysOM) oferece observabilidade de contêineres no nível do kernel, com suporte a implantação containerizada, migração e monitoramento. Este tópico explica como ativar e usar o ack-sysom-monitor e descreve as métricas relacionadas.

Pré-requisitos

Antes de começar, verifique se você possui:

O que o ack-sysom-monitor coleta

O ack-sysom-monitor é um componente do System Observer Monitoring (SysOM) que usa o extended Berkeley Packet Filter (eBPF) para coletar e aprimorar métricas no nível do kernel de nós e contêineres. Além das métricas padrão do sistema, ele fornece métricas avançadas para monitoramento de pods e nós no nível do kernel. Isso ajuda a identificar problemas como instabilidades do sistema, atrasos, vazamentos de recursos e exceções de memória em pods.

Faturamento

Após a ativação do ack-sysom-monitor, os componentes relacionados enviam automaticamente métricas de monitoramento para o Managed Service for Prometheus. Essas métricas são cobradas como métricas personalizadas.

Antes de ativar esse recurso, leia a Visão geral do faturamento para entender a cobrança de métricas personalizadas. As taxas variam conforme o tamanho do cluster e a quantidade de aplicações em execução. Para monitorar e controlar o uso de recursos, consulte Visualize o uso de recursos.

Ative o ack-sysom-monitor

  1. Faça login no console do ARMS.

  2. No painel de navegação à esquerda, clique em Integration Center.

  3. Na seção Infrastructure da página Integration Center, clique em SysOM System Observation.

  4. Na etapa Start Integration do painel SysOM System Observation, selecione o cluster ACK e clique em OK.

Visualize dados de monitoramento

  1. Acesse o console do ACK. No painel de navegação à esquerda, clique em Clusters.

  2. Na página Clusters, clique no nome do cluster. No painel à esquerda, escolha Operations > Prometheus Monitoring.

  3. Na página Prometheus Monitoring, clique na aba SysOM. O ack-sysom-monitor oferece duas visualizações de monitoramento:

    • Monitoramento de nós no nível do kernel: Na aba SysOM - Nodes, visualize métricas de CPU, memória, agendamento, armazenamento e rede de cada nó. image.png

    • Monitoramento de pods no nível do kernel: Na aba SysOM - Pods, acompanhe em tempo real as métricas de memória, CPU, rede e I/O de cada pod. image.png

Próximos passos

Para interromper a cobrança, desinstale o componente ack-sysom-monitor. Consulte Gerencie componentes.

Métricas

Todas as métricas fornecidas pelo ack-sysom-monitor seguem o modelo de dados do Prometheus.

Todos os tipos de métricas listados abaixo são gauge .

Cenários de diagnóstico

Use a tabela abaixo para correlacionar sintomas às métricas correspondentes.

Sintoma

Métricas relevantes

Limitação de CPU ou atrasos de agendamento

sysom_proc_schedstat, sysom_cpu_dist, sysom_container_cpu_stat, sysom_container_cpu_cfsquota

Carga elevada ou excesso de processos em estado D

sysom_proc_stat_counters, sysom_proc_loadavg

Pressão de memória ou eventos OOM

sysom_proc_vmstat, sysom_container_memory_gdrcm_latency, sysom_container_memory_cdrcm_latency, sysom_container_memory_cpt_latency

Page cache causando instabilidade de memória

sysom_container_memory_filecache

Vazamentos de cgroup

sysom_cgroups

Problemas de latência ou throughput de I/O de disco

sysom_proc_disks, sysom_container_blkio_stat

Perda ou retransmissão de pacotes de rede

sysom_proc_pkt_status, sysom_net_retrans_count

RTT TCP elevado ou anomalias de conexão

sysom_net_health_hist, sysom_net_health_count, sysom_net_tcp_count

Esgotamento de sockets ou buffers

sysom_sock_stat

Métricas de nó

As métricas de nó abrangem CPU e agendamento, memória, armazenamento, rede e outros indicadores do sistema.

CPU e agendamento

Métrica

Tipo

Unidade

Descrição

sysom_proc_cpu_total

gauge

%

Detalhamento do tempo de atividade da CPU para todo o nó, por estado: modo usuário, modo kernel, softirq, hardirq, ocioso e iowait. Identifica qual estado consome tempo de CPU.

sysom_proc_cpus

gauge

%

Distribuição do tempo de atividade da CPU por núcleo, dividida por estado: modo usuário, modo kernel, softirq, hardirq, ocioso e iowait. Detecta desequilíbrios entre núcleos.

sysom_proc_sirq

gauge

%

Ocorrências por tipo de softirq: HI, TIMER, NET_TX, NET_RX, BLOCK, IRQ_POLL, TASKLET, SCHED, HRTIMER e RCU. Um pico em NET_RX ou NET_TX pode indicar saturação de rede.

sysom_proc_stat_counters

gauge

-

Quantidade de processos em estado Running ou D, tempo de inicialização do sistema e contagem de trocas de contexto. Uma contagem elevada de processos em estado D sinaliza contenção de I/O ou locks.

sysom_proc_loadavg

gauge

-

Médias de carga em intervalos de 1, 5 e 15 minutos, além do tamanho da fila de execução e contagem total de processos. Avalia tendências de carga sustentada.

sysom_proc_schedstat

gauge

ns (nanossegundos)

Latência de agendamento da CPU: tempo de espera na fila de execução e duração da fatia de tempo da CPU. Tempos de espera elevados indicam pressão de agendamento.

sysom_cpu_dist

gauge

-

Distribuição dos intervalos de agendamento da CPU: tempo entre a liberação da CPU e o novo agendamento. Agrupado em 1 µs, 10 µs, 100 µs, 1 ms, 10 ms, 100 ms e 1 s. Latências de cauda longa apontam para instabilidade no agendamento.

Memória

Métrica

Tipo

Unidade

Descrição

sysom_proc_meminfo

gauge

KiB

Uso de memória no nível do nó: Total, Free, Available, Cache, Buffers, SReclaimable e SUnreclaim. Avalia a pressão geral sobre a memória.

sysom_proc_vmstat

gauge

-

Estatísticas de páginas de memória: páginas livres, páginas sujas, páginas lidas/escritas, páginas recuperadas da lista inativa e invocações do OOM killer. A atividade do OOM killer indica esgotamento crítico de memória.

sysom_proc_buddyinfo

gauge

-

Estado do alocador buddy system: blocos disponíveis em diferentes tamanhos, por zona de memória e nó. Detecta fragmentação de memória que pode causar falhas de alocação.

Armazenamento

Métrica

Tipo

Unidade

Descrição

sysom_proc_disks

gauge

-

Estatísticas de I/O por disco e partição: contagem e bytes de requisições de leitura/escrita, contagem de mesclagens, requisições em andamento e tempo total para conclusão. Diagnostica problemas de throughput e latência de disco.

sysom_fs_stat

gauge

-

Uso do sistema de arquivos por ponto de montagem: tamanho do bloco, blocos usados e disponíveis, além de inodes utilizados e livres. Detecta esgotamento de disco ou inodes antes que causem falhas.

Rede

Métrica

Tipo

Unidade

Descrição

sysom_proc_networks

gauge

-

Estatísticas de transferência de dados por NIC: pacotes e bytes recebidos e enviados, descartes no nível do driver e erros de envio/recebimento. Detecta perda de pacotes no nível da NIC.

sysom_proc_pkt_status

gauge

-

Eventos da pilha de protocolos de rede: descarte de pacotes, estouro de buffer e falhas de asserção. Identifica onde os pacotes são perdidos na pilha.

sysom_sock_stat

gauge

-

Uso de sockets e buffers: contagem total de sockets raw, TCP e UDP, sockets TCP em estado TIME_WAIT ou órfãos, e uso de memória por sockets TCP/UDP. Contagens altas de TIME_WAIT ou órfãos podem indicar problemas no tratamento de conexões causados pela lógica da aplicação ou parâmetros do sistema.

sysom_softnets

gauge

-

Estatísticas de softirq de NIC por CPU: pacotes recebidos e enviados por softirq e contagem de invocações de net_rx_action para softirqs de recebimento.

sysom_net_health_hist

gauge

-

Distribuição do tempo de ida e volta (RTT) em todas as conexões TCP do nó, agrupada em 10 ms, 100 ms e 1 s. Detecta degradação da latência TCP.

sysom_net_health_count

gauge

-

RTT médio das conexões TCP no nó. Semelhante a sysom_net_health_hist.

sysom_net_retrans_count

gauge

-

Estatísticas de retransmissão TCP: contagem de pacotes retransmitidos por tipo (SYN, SYN-ACK, RESET), incluindo retransmissões por timeout. Contagens crescentes indicam instabilidade ou congestionamento de rede.

sysom_net_tcp_count

gauge

-

Estatísticas de conexão TCP: contagem de conexões ativas, segmentos recebidos e enviados, segmentos retransmitidos e falhas de recebimento.

sysom_net_udp_count

gauge

-

Estatísticas UDP: pacotes recebidos e enviados, erros de buffer de envio/recebimento e pacotes descartados por falta de portas disponíveis.

sysom_net_ip_count

gauge

-

Estatísticas da camada IP: pacotes encaminhados, recebidos e enviados.

sysom_net_icmp_count

gauge

-

Estatísticas ICMP: pacotes recebidos e enviados, além de falhas de envio/recebimento.

Outras métricas do sistema

Métrica

Tipo

Unidade

Descrição

sysom_cgroups

gauge

-

Número de cgroups em uso nos subsistemas: CPU, Cpuacct, Memory, Pids, Blkio e Devices. Uma contagem que aumenta continuamente sem diminuir pode indicar vazamentos de cgroup.

sysom_uptime

gauge

s (segundos)

Tempo de atividade do sistema desde a última inicialização e tempo ocioso.

Métricas de contêiner

As métricas de contêiner incluem CPU e agendamento, memória, I/O e rede.

CPU e agendamento

Métrica

Tipo

Unidade

Descrição

sysom_container_cpu_stat

gauge

-

Estatísticas de limitação de CPU por cgroup: número de vezes que os limites de CPU foram aplicados, contagem total de aplicações e duração total da limitação. Determina se as cotas de recursos precisam de ajuste.

sysom_container_cpu_acctstat

gauge

%

Utilização de CPU para tarefas do contêiner, dividida por modo: usuário, kernel e total. Mostra como os contêineres consomem CPU nos espaços de kernel e usuário.

sysom_container_cpu_cfsquota

gauge

-

Configuração do Completely Fair Scheduler (CFS) para o cgroup do contêiner: cfs_period_us (duração de cada janela de tempo do CFS) e cfs_quota_us (tempo máximo de CPU disponível para o cgroup em cada janela). Verifica se os limites de CPU estão configurados corretamente.

Memória

Métrica

Tipo

Unidade

Descrição

sysom_container_memory_stat

gauge

KiB

Uso de memória do contêiner por categoria: Total, Free, Available, Cache, Buffers, SReclaimable e SUnreclaim. Avalia o consumo de memória por contêiner.

sysom_container_memory_filecache

gauge

KiB

Uso de page cache por contêiner: os 10 arquivos que mais consomem page cache, tamanhos dos arquivos e total de page cache ocupado. Identifica contêineres onde o uso excessivo de page cache causa pressão de memória, latência ou instabilidade.

sysom_container_memory_gdrcm_latency

gauge

Vezes

Atrasos causados pela recuperação de memória devido a recursos insuficientes. Conta atrasos em seis faixas: 1–5 ms, 5–10 ms, 10–100 ms, 100–500 ms, 500–1.000 ms e acima de 1.000 ms. Detecta pressão de memória no nível do nó que afeta o desempenho do contêiner.

sysom_container_memory_cdrcm_latency

gauge

Vezes

Atrasos provocados pela recuperação de memória devido a cgroups de memória insuficientes. Conta atrasos nas mesmas seis faixas de sysom_container_memory_gdrcm_latency.

**

Nota

Esta métrica é válida apenas se os cgroups de memória atuais não forem raiz ou se houver limites de memória configurados para eles.

sysom_container_memory_cpt_latency

gauge

Vezes

Atrasos gerados pelo ajuste de memória do kernel, acionados quando um processo no contêiner solicita memória, mas o nó tem memória insuficiente ou fragmentação excessiva. Conta atrasos nas mesmas seis faixas. Detecta fragmentação de memória que impacta a alocação do contêiner.

I/O

Métrica

Tipo

Unidade

Descrição

sysom_container_blkio_stat

gauge

-

Estatísticas de Block I/O para o disco do contêiner: contagem e bytes de requisições de leitura/escrita, contagem e bytes de requisições na fila e tempo de espera das requisições. Diagnostica gargalos de I/O no nível do contêiner.

Rede

Métrica

Tipo

Unidade

Descrição

sysom_container_network_stat

gauge

-

Estatísticas de transferência de dados da NIC virtual por contêiner: pacotes e bytes recebidos e enviados, além de descartes no nível do dispositivo. Pacotes descartados pela pilha de protocolos de rede não estão incluídos.