O System Observer Monitoring (SysOM) oferece observabilidade de contêineres no nível do kernel, com suporte a implantação containerizada, migração e monitoramento. Este tópico explica como ativar e usar o ack-sysom-monitor e descreve as métricas relacionadas.
Pré-requisitos
Antes de começar, verifique se você possui:
Um cluster gerenciado ACK ou um cluster ACK Serverless criado após outubro de 2021, com Kubernetes 1.18.8 ou posterior. Consulte Crie um cluster gerenciado ACK ou Crie um cluster ACK Serverless. Para atualizar, consulte Atualize clusters ACK manualmente
O Managed Service for Prometheus ativado. Consulte Ative o Managed Service for Prometheus
O que o ack-sysom-monitor coleta
O ack-sysom-monitor é um componente do System Observer Monitoring (SysOM) que usa o extended Berkeley Packet Filter (eBPF) para coletar e aprimorar métricas no nível do kernel de nós e contêineres. Além das métricas padrão do sistema, ele fornece métricas avançadas para monitoramento de pods e nós no nível do kernel. Isso ajuda a identificar problemas como instabilidades do sistema, atrasos, vazamentos de recursos e exceções de memória em pods.
Faturamento
Após a ativação do ack-sysom-monitor, os componentes relacionados enviam automaticamente métricas de monitoramento para o Managed Service for Prometheus. Essas métricas são cobradas como métricas personalizadas.
Antes de ativar esse recurso, leia a Visão geral do faturamento para entender a cobrança de métricas personalizadas. As taxas variam conforme o tamanho do cluster e a quantidade de aplicações em execução. Para monitorar e controlar o uso de recursos, consulte Visualize o uso de recursos.
Ative o ack-sysom-monitor
Faça login no console do ARMS.
No painel de navegação à esquerda, clique em Integration Center.
Na seção Infrastructure da página Integration Center, clique em SysOM System Observation.
Na etapa Start Integration do painel SysOM System Observation, selecione o cluster ACK e clique em OK.
Visualize dados de monitoramento
Acesse o console do ACK. No painel de navegação à esquerda, clique em Clusters.
Na página Clusters, clique no nome do cluster. No painel à esquerda, escolha Operations > Prometheus Monitoring.
-
Na página Prometheus Monitoring, clique na aba SysOM. O
ack-sysom-monitoroferece duas visualizações de monitoramento:Monitoramento de nós no nível do kernel: Na aba SysOM - Nodes, visualize métricas de CPU, memória, agendamento, armazenamento e rede de cada nó.

Monitoramento de pods no nível do kernel: Na aba SysOM - Pods, acompanhe em tempo real as métricas de memória, CPU, rede e I/O de cada pod.

Próximos passos
Para interromper a cobrança, desinstale o componente ack-sysom-monitor. Consulte Gerencie componentes.
Métricas
Todas as métricas fornecidas pelo ack-sysom-monitor seguem o modelo de dados do Prometheus.
Todos os tipos de métricas listados abaixo são gauge .
Cenários de diagnóstico
Use a tabela abaixo para correlacionar sintomas às métricas correspondentes.
|
Sintoma |
Métricas relevantes |
|
Limitação de CPU ou atrasos de agendamento |
|
|
Carga elevada ou excesso de processos em estado D |
|
|
Pressão de memória ou eventos OOM |
|
|
Page cache causando instabilidade de memória |
|
|
Vazamentos de cgroup |
|
|
Problemas de latência ou throughput de I/O de disco |
|
|
Perda ou retransmissão de pacotes de rede |
|
|
RTT TCP elevado ou anomalias de conexão |
|
|
Esgotamento de sockets ou buffers |
|
Métricas de nó
As métricas de nó abrangem CPU e agendamento, memória, armazenamento, rede e outros indicadores do sistema.
CPU e agendamento
|
Métrica |
Tipo |
Unidade |
Descrição |
|
sysom_proc_cpu_total |
gauge |
% |
Detalhamento do tempo de atividade da CPU para todo o nó, por estado: modo usuário, modo kernel, softirq, hardirq, ocioso e iowait. Identifica qual estado consome tempo de CPU. |
|
sysom_proc_cpus |
gauge |
% |
Distribuição do tempo de atividade da CPU por núcleo, dividida por estado: modo usuário, modo kernel, softirq, hardirq, ocioso e iowait. Detecta desequilíbrios entre núcleos. |
|
sysom_proc_sirq |
gauge |
% |
Ocorrências por tipo de softirq: HI, TIMER, NET_TX, NET_RX, BLOCK, IRQ_POLL, TASKLET, SCHED, HRTIMER e RCU. Um pico em NET_RX ou NET_TX pode indicar saturação de rede. |
|
sysom_proc_stat_counters |
gauge |
- |
Quantidade de processos em estado Running ou D, tempo de inicialização do sistema e contagem de trocas de contexto. Uma contagem elevada de processos em estado D sinaliza contenção de I/O ou locks. |
|
sysom_proc_loadavg |
gauge |
- |
Médias de carga em intervalos de 1, 5 e 15 minutos, além do tamanho da fila de execução e contagem total de processos. Avalia tendências de carga sustentada. |
|
sysom_proc_schedstat |
gauge |
ns (nanossegundos) |
Latência de agendamento da CPU: tempo de espera na fila de execução e duração da fatia de tempo da CPU. Tempos de espera elevados indicam pressão de agendamento. |
|
sysom_cpu_dist |
gauge |
- |
Distribuição dos intervalos de agendamento da CPU: tempo entre a liberação da CPU e o novo agendamento. Agrupado em 1 µs, 10 µs, 100 µs, 1 ms, 10 ms, 100 ms e 1 s. Latências de cauda longa apontam para instabilidade no agendamento. |
Memória
|
Métrica |
Tipo |
Unidade |
Descrição |
|
sysom_proc_meminfo |
gauge |
KiB |
Uso de memória no nível do nó: Total, Free, Available, Cache, Buffers, SReclaimable e SUnreclaim. Avalia a pressão geral sobre a memória. |
|
sysom_proc_vmstat |
gauge |
- |
Estatísticas de páginas de memória: páginas livres, páginas sujas, páginas lidas/escritas, páginas recuperadas da lista inativa e invocações do OOM killer. A atividade do OOM killer indica esgotamento crítico de memória. |
|
sysom_proc_buddyinfo |
gauge |
- |
Estado do alocador buddy system: blocos disponíveis em diferentes tamanhos, por zona de memória e nó. Detecta fragmentação de memória que pode causar falhas de alocação. |
Armazenamento
|
Métrica |
Tipo |
Unidade |
Descrição |
|
sysom_proc_disks |
gauge |
- |
Estatísticas de I/O por disco e partição: contagem e bytes de requisições de leitura/escrita, contagem de mesclagens, requisições em andamento e tempo total para conclusão. Diagnostica problemas de throughput e latência de disco. |
|
sysom_fs_stat |
gauge |
- |
Uso do sistema de arquivos por ponto de montagem: tamanho do bloco, blocos usados e disponíveis, além de inodes utilizados e livres. Detecta esgotamento de disco ou inodes antes que causem falhas. |
Rede
|
Métrica |
Tipo |
Unidade |
Descrição |
|
sysom_proc_networks |
gauge |
- |
Estatísticas de transferência de dados por NIC: pacotes e bytes recebidos e enviados, descartes no nível do driver e erros de envio/recebimento. Detecta perda de pacotes no nível da NIC. |
|
sysom_proc_pkt_status |
gauge |
- |
Eventos da pilha de protocolos de rede: descarte de pacotes, estouro de buffer e falhas de asserção. Identifica onde os pacotes são perdidos na pilha. |
|
sysom_sock_stat |
gauge |
- |
Uso de sockets e buffers: contagem total de sockets raw, TCP e UDP, sockets TCP em estado TIME_WAIT ou órfãos, e uso de memória por sockets TCP/UDP. Contagens altas de TIME_WAIT ou órfãos podem indicar problemas no tratamento de conexões causados pela lógica da aplicação ou parâmetros do sistema. |
|
sysom_softnets |
gauge |
- |
Estatísticas de softirq de NIC por CPU: pacotes recebidos e enviados por softirq e contagem de invocações de |
|
sysom_net_health_hist |
gauge |
- |
Distribuição do tempo de ida e volta (RTT) em todas as conexões TCP do nó, agrupada em 10 ms, 100 ms e 1 s. Detecta degradação da latência TCP. |
|
sysom_net_health_count |
gauge |
- |
RTT médio das conexões TCP no nó. Semelhante a |
|
sysom_net_retrans_count |
gauge |
- |
Estatísticas de retransmissão TCP: contagem de pacotes retransmitidos por tipo (SYN, SYN-ACK, RESET), incluindo retransmissões por timeout. Contagens crescentes indicam instabilidade ou congestionamento de rede. |
|
sysom_net_tcp_count |
gauge |
- |
Estatísticas de conexão TCP: contagem de conexões ativas, segmentos recebidos e enviados, segmentos retransmitidos e falhas de recebimento. |
|
sysom_net_udp_count |
gauge |
- |
Estatísticas UDP: pacotes recebidos e enviados, erros de buffer de envio/recebimento e pacotes descartados por falta de portas disponíveis. |
|
sysom_net_ip_count |
gauge |
- |
Estatísticas da camada IP: pacotes encaminhados, recebidos e enviados. |
|
sysom_net_icmp_count |
gauge |
- |
Estatísticas ICMP: pacotes recebidos e enviados, além de falhas de envio/recebimento. |
Outras métricas do sistema
|
Métrica |
Tipo |
Unidade |
Descrição |
|
sysom_cgroups |
gauge |
- |
Número de cgroups em uso nos subsistemas: CPU, Cpuacct, Memory, Pids, Blkio e Devices. Uma contagem que aumenta continuamente sem diminuir pode indicar vazamentos de cgroup. |
|
sysom_uptime |
gauge |
s (segundos) |
Tempo de atividade do sistema desde a última inicialização e tempo ocioso. |
Métricas de contêiner
As métricas de contêiner incluem CPU e agendamento, memória, I/O e rede.
CPU e agendamento
|
Métrica |
Tipo |
Unidade |
Descrição |
|
sysom_container_cpu_stat |
gauge |
- |
Estatísticas de limitação de CPU por cgroup: número de vezes que os limites de CPU foram aplicados, contagem total de aplicações e duração total da limitação. Determina se as cotas de recursos precisam de ajuste. |
|
sysom_container_cpu_acctstat |
gauge |
% |
Utilização de CPU para tarefas do contêiner, dividida por modo: usuário, kernel e total. Mostra como os contêineres consomem CPU nos espaços de kernel e usuário. |
|
sysom_container_cpu_cfsquota |
gauge |
- |
Configuração do Completely Fair Scheduler (CFS) para o cgroup do contêiner: |
Memória
|
Métrica |
Tipo |
Unidade |
Descrição |
|
sysom_container_memory_stat |
gauge |
KiB |
Uso de memória do contêiner por categoria: Total, Free, Available, Cache, Buffers, SReclaimable e SUnreclaim. Avalia o consumo de memória por contêiner. |
|
sysom_container_memory_filecache |
gauge |
KiB |
Uso de page cache por contêiner: os 10 arquivos que mais consomem page cache, tamanhos dos arquivos e total de page cache ocupado. Identifica contêineres onde o uso excessivo de page cache causa pressão de memória, latência ou instabilidade. |
|
sysom_container_memory_gdrcm_latency |
gauge |
Vezes |
Atrasos causados pela recuperação de memória devido a recursos insuficientes. Conta atrasos em seis faixas: 1–5 ms, 5–10 ms, 10–100 ms, 100–500 ms, 500–1.000 ms e acima de 1.000 ms. Detecta pressão de memória no nível do nó que afeta o desempenho do contêiner. |
|
sysom_container_memory_cdrcm_latency |
gauge |
Vezes |
Atrasos provocados pela recuperação de memória devido a cgroups de memória insuficientes. Conta atrasos nas mesmas seis faixas de ** Nota Esta métrica é válida apenas se os cgroups de memória atuais não forem raiz ou se houver limites de memória configurados para eles. |
|
sysom_container_memory_cpt_latency |
gauge |
Vezes |
Atrasos gerados pelo ajuste de memória do kernel, acionados quando um processo no contêiner solicita memória, mas o nó tem memória insuficiente ou fragmentação excessiva. Conta atrasos nas mesmas seis faixas. Detecta fragmentação de memória que impacta a alocação do contêiner. |
I/O
|
Métrica |
Tipo |
Unidade |
Descrição |
|
sysom_container_blkio_stat |
gauge |
- |
Estatísticas de Block I/O para o disco do contêiner: contagem e bytes de requisições de leitura/escrita, contagem e bytes de requisições na fila e tempo de espera das requisições. Diagnostica gargalos de I/O no nível do contêiner. |
Rede
|
Métrica |
Tipo |
Unidade |
Descrição |
|
sysom_container_network_stat |
gauge |
- |
Estatísticas de transferência de dados da NIC virtual por contêiner: pacotes e bytes recebidos e enviados, além de descartes no nível do dispositivo. Pacotes descartados pela pilha de protocolos de rede não estão incluídos. |