All Products
Search
Document Center

Container Service for Kubernetes:Aktifkan dan gunakan ack-sysom-monitor

Last Updated:Aug 21, 2026

System Observer Monitoring (SysOM) menyediakan observabilitas kontainer tingkat kernel serta mendukung penerapan, migrasi, dan pemantauan berbasis kontainer. Topik ini menjelaskan cara mengaktifkan dan menggunakan ack-sysom-monitor serta menguraikan metrik terkait.

Prasyarat

Sebelum memulai, pastikan Anda telah:

Apa yang dikumpulkan oleh ack-sysom-monitor

ack-sysom-monitor adalah komponen System Observer Monitoring (SysOM) yang menggunakan extended Berkeley Packet Filter (eBPF) untuk mengumpulkan dan memperkaya metrik tingkat kernel untuk node dan kontainer. Selain metrik sistem standar, komponen ini menyediakan metrik tambahan untuk pemantauan tingkat kernel pod dan node, membantu mengidentifikasi masalah seperti jitter sistem, keterlambatan, kebocoran resource, dan anomali memori pod.

Penagihan

Setelah ack-sysom-monitor diaktifkan, komponen terkait secara otomatis mengirim metrik pemantauan ke Managed Service for Prometheus. Metrik ini ditagih sebagai custom metrics.

Sebelum mengaktifkan fitur ini, baca Billing overview untuk memahami cara penagihan custom metrics. Biaya bervariasi tergantung pada ukuran kluster dan jumlah aplikasi yang berjalan. Untuk memantau dan mengontrol penggunaan resource, lihat View resource usage.

Aktifkan ack-sysom-monitor

  1. Login ke ARMS console.

  2. Di panel navigasi sebelah kiri, klik Integration Center.

  3. Di bagian Infrastructure pada halaman Integration Center, klik SysOM System Observation.

  4. Pada langkah Start Integration di panel SysOM System Observation, pilih kluster ACK lalu klik OK.

Lihat data pemantauan

  1. Login ke ACK console. Di panel navigasi sebelah kiri, klik Clusters.

  2. Pada halaman Clusters, klik nama kluster Anda. Di panel sebelah kiri, pilih Operations > Prometheus Monitoring.

  3. Pada halaman Prometheus Monitoring, klik tab SysOM. ack-sysom-monitor mendukung dua tampilan pemantauan:

    • Node kernel-level monitoring — Pada tab SysOM - Nodes, lihat metrik CPU, memori, penjadwalan, penyimpanan, dan jaringan untuk setiap node. image.png

    • Pod kernel-level monitoring — Pada tab SysOM - Pods, lihat metrik memori, CPU, jaringan, dan I/O untuk setiap pod secara real time. image.png

Langkah selanjutnya

Untuk menghentikan biaya yang terus berjalan, uninstall komponen ack-sysom-monitor. Lihat Manage components.

Metrik

Semua metrik yang disediakan oleh ack-sysom-monitor mengikuti Prometheus data model.

Semua jenis metrik yang tercantum di bawah ini bertipe gauge.

Skenario diagnosis

Gunakan tabel berikut untuk menelusuri dari gejala ke metrik terkait.

Gejala Metrik terkait
Throttling CPU atau keterlambatan penjadwalan sysom_proc_schedstat, sysom_cpu_dist, sysom_container_cpu_stat, sysom_container_cpu_cfsquota
Beban tinggi atau terlalu banyak proses dalam status D sysom_proc_stat_counters, sysom_proc_loadavg
Tekanan memori atau event OOM sysom_proc_vmstat, sysom_container_memory_gdrcm_latency, sysom_container_memory_cdrcm_latency, sysom_container_memory_cpt_latency
Page cache menyebabkan jitter memori sysom_container_memory_filecache
Kebocoran cgroup sysom_cgroups
Latensi atau masalah throughput I/O disk sysom_proc_disks, sysom_container_blkio_stat
Kehilangan paket jaringan atau pengiriman ulang sysom_proc_pkt_status, sysom_net_retrans_count
RTT TCP tinggi atau anomali koneksi sysom_net_health_hist, sysom_net_health_count, sysom_net_tcp_count
Kehabisan socket atau buffer sysom_sock_stat

Metrik node

Metrik node mencakup CPU dan penjadwalan, memori, penyimpanan, jaringan, serta metrik sistem lainnya.

CPU dan penjadwalan

Metric

Type

Unit

Description

sysom_proc_cpu_total

gauge

%

Rincian uptime CPU untuk seluruh node berdasarkan status: mode user, mode kernel, softirq, hardirq, idle, dan iowait. Mengidentifikasi status mana yang mengonsumsi waktu CPU.

sysom_proc_cpus

gauge

%

Rincian uptime CPU per core berdasarkan status: mode user, mode kernel, softirq, hardirq, idle, dan iowait. Mendeteksi ketidakseimbangan per core.

sysom_proc_sirq

gauge

%

Jumlah kejadian per jenis softirq: HI, TIMER, NET_TX, NET_RX, BLOCK, IRQ_POLL, TASKLET, SCHED, HRTIMER, dan RCU. Lonjakan pada NET_RX atau NET_TX dapat mengindikasikan saturasi jaringan.

sysom_proc_stat_counters

gauge

-

Jumlah proses dalam status Running atau D, waktu startup sistem, dan jumlah context switch. Jumlah status D yang tinggi mengindikasikan contention I/O atau lock.

sysom_proc_loadavg

gauge

-

Rata-rata beban pada interval 1 menit, 5 menit, dan 15 menit, serta panjang run-queue dan jumlah total proses. Menilai tren beban berkelanjutan.

sysom_proc_schedstat

gauge

ns (nanodetik)

Latensi penjadwalan CPU: waktu tunggu dalam run queue dan durasi time slice CPU. Waktu tunggu yang tinggi mengindikasikan tekanan penjadwalan.

sysom_cpu_dist

gauge

-

Distribusi interval penjadwalan CPU: waktu dari melepas CPU hingga dijadwalkan ulang. Dibagi menjadi bucket 1 µs, 10 µs, 100 µs, 1 ms, 10 ms, 100 ms, dan 1 s. Latensi ekor panjang mengindikasikan jitter penjadwalan.

Memori

Metric

Type

Unit

Description

sysom_proc_meminfo

gauge

KiB

Penggunaan memori tingkat node: Total, Free, Available, Cache, Buffers, SReclaimable, dan SUnreclaim. Menilai tekanan memori secara keseluruhan.

sysom_proc_vmstat

gauge

-

Statistik halaman memori: jumlah halaman bebas, halaman kotor, halaman yang dibaca/ditulis, halaman yang direklaim dari daftar inactive, dan jumlah pemanggilan OOM killer. Aktivitas OOM killer menandakan kehabisan memori kritis.

sysom_proc_buddyinfo

gauge

-

Status alokator buddy system: jumlah blok tersedia berdasarkan ukuran di setiap zona memori dan node. Mendeteksi fragmentasi memori yang dapat menyebabkan kegagalan alokasi.

Penyimpanan

Metric

Type

Unit

Description

sysom_proc_disks

gauge

-

Statistik I/O per disk dan partisi: jumlah permintaan baca/tulis dan byte, jumlah penggabungan, jumlah permintaan sedang berjalan (inflight), dan total waktu penyelesaian permintaan. Mendiagnosis masalah throughput dan latensi disk.

sysom_fs_stat

gauge

-

Penggunaan file system per titik mount: ukuran blok, blok yang digunakan dan tersedia, serta inode yang digunakan dan tersedia. Mendeteksi kehabisan disk atau inode sebelum menyebabkan kegagalan.

Jaringan

Metric

Type

Unit

Description

sysom_proc_networks

gauge

-

Statistik transfer data per NIC: jumlah paket dan byte yang diterima dan dikirim, jumlah discard tingkat driver, serta error pengiriman/penerimaan. Mendeteksi kehilangan paket tingkat NIC.

sysom_proc_pkt_status

gauge

-

Event tumpukan protokol jaringan: kehilangan paket, luapan buffer, dan kegagalan assertion. Mengidentifikasi lokasi kehilangan paket dalam stack.

sysom_sock_stat

gauge

-

Penggunaan socket dan buffer: jumlah total socket raw, TCP, dan UDP, jumlah socket TCP dalam status TIME_WAIT atau orphan, serta penggunaan memori socket TCP/UDP. Jumlah TIME_WAIT atau orphan yang tinggi dapat mengindikasikan masalah penanganan koneksi akibat logika aplikasi atau parameter sistem.

sysom_softnets

gauge

-

Statistik softirq NIC per CPU: jumlah paket yang diterima dan dikirim per softirq, serta jumlah pemanggilan net_rx_action untuk softirq penerimaan.

sysom_net_health_hist

gauge

-

Distribusi round-trip time (RTT) di seluruh koneksi TCP pada node, dibagi menjadi bucket 10 ms, 100 ms, dan 1 s. Mendeteksi degradasi latensi TCP.

sysom_net_health_count

gauge

-

RTT rata-rata koneksi TCP pada node. Mirip dengan sysom_net_health_hist.

sysom_net_retrans_count

gauge

-

Statistik retransmisi TCP: jumlah paket yang diretransmisi berdasarkan jenis (SYN, SYN-ACK, RESET), termasuk retransmisi akibat timeout. Jumlah yang meningkat mengindikasikan ketidakstabilan atau kemacetan jaringan.

sysom_net_tcp_count

gauge

-

Statistik koneksi TCP: jumlah koneksi aktif, segmen yang diterima dan dikirim, segmen yang diretransmisi, dan kegagalan penerimaan.

sysom_net_udp_count

gauge

-

Statistik UDP: paket yang diterima dan dikirim, error buffer kirim/terima, serta paket yang dibuang karena tidak tersedia port.

sysom_net_ip_count

gauge

-

Statistik lapisan IP: paket yang diteruskan, diterima, dan dikirim.

sysom_net_icmp_count

gauge

-

Statistik ICMP: paket yang diterima dan dikirim, serta kegagalan kirim/terima.

Metrik sistem lainnya

Metric

Type

Unit

Description

sysom_cgroups

gauge

-

Jumlah cgroup yang digunakan di berbagai subsistem: CPU, Cpuacct, Memory, Pids, Blkio, dan Devices. Jumlah yang terus meningkat tanpa penurunan dapat mengindikasikan kebocoran cgroup.

sysom_uptime

gauge

s (detik)

Waktu uptime sistem sejak boot terakhir, dan waktu idle.

Metrik kontainer

Metrik kontainer mencakup CPU dan penjadwalan, memori, I/O, serta metrik jaringan.

CPU dan penjadwalan

Metric

Type

Unit

Description

sysom_container_cpu_stat

gauge

-

Statistik throttling CPU per cgroup: jumlah kali batas CPU diberlakukan, total jumlah pemberlakuan, dan total durasi pemberlakuan. Menentukan apakah kuota resource perlu disesuaikan.

sysom_container_cpu_acctstat

gauge

%

Pemanfaatan CPU untuk tugas kontainer, dirinci berdasarkan mode: user, kernel, dan total. Menunjukkan cara kontainer mengonsumsi CPU di ruang kernel dan user.

sysom_container_cpu_cfsquota

gauge

-

Konfigurasi Completely Fair Scheduler (CFS) untuk cgroup kontainer: cfs_period_us (panjang setiap jendela waktu CFS) dan cfs_quota_us (waktu CPU maksimum yang tersedia untuk cgroup dalam setiap jendela). Memverifikasi bahwa batas CPU telah diatur dengan benar.

Memori

Metric

Type

Unit

Description

sysom_container_memory_stat

gauge

KiB

Penggunaan memori kontainer berdasarkan kategori: Total, Free, Available, Cache, Buffers, SReclaimable, dan SUnreclaim. Menilai konsumsi memori per kontainer.

sysom_container_memory_filecache

gauge

KiB

Penggunaan page cache per kontainer: 10 file teratas yang paling banyak mengonsumsi page cache, ukuran file, dan total page cache yang digunakan. Mengidentifikasi kontainer tempat penggunaan berlebihan page cache menyebabkan tekanan memori, latensi, atau jitter.

sysom_container_memory_gdrcm_latency

gauge

Times

Keterlambatan akibat reklamasi memori karena sumber daya memori tidak mencukupi. Menghitung keterlambatan dalam enam rentang: 1–5 ms, 5–10 ms, 10–100 ms, 100–500 ms, 500–1.000 ms, dan lebih dari 1.000 ms. Mendeteksi tekanan memori tingkat node yang memengaruhi kinerja kontainer.

sysom_container_memory_cdrcm_latency

gauge

Times

Keterlambatan akibat reklamasi memori karena cgroup memori tidak mencukupi. Menghitung keterlambatan dalam rentang yang sama seperti sysom_container_memory_gdrcm_latency.

Note

Metrik ini hanya berlaku jika cgroup memori saat ini bukan root cgroup atau batas memori telah dikonfigurasi untuk cgroup memori saat ini.

sysom_container_memory_cpt_latency

gauge

Times

Keterlambatan akibat penyesuaian memori kernel, dipicu ketika suatu proses dalam kontainer meminta memori tetapi node tidak memiliki memori yang cukup atau terdapat jumlah fragmen memori yang berlebihan. Menghitung keterlambatan dalam rentang yang sama. Mendeteksi fragmentasi memori yang memengaruhi alokasi kontainer.

I/O

Metric

Type

Unit

Description

sysom_container_blkio_stat

gauge

-

Statistik Block I/O untuk disk kontainer: jumlah permintaan baca/tulis dan byte, jumlah permintaan dan byte dalam antrian, serta waktu tunggu permintaan. Mendiagnosis bottleneck I/O tingkat kontainer.

Jaringan

Metric

Type

Unit

Description

sysom_container_network_stat

gauge

-

Statistik transfer data NIC virtual per kontainer: jumlah paket dan byte yang diterima dan dikirim, serta jumlah discard tingkat perangkat. Paket yang dibuang oleh tumpukan protokol jaringan tidak termasuk.