Rilis terbaru ARMS Prometheus adalah Helm v1.1.17, yang sesuai dengan agent v4.0.0. Versi ini mencakup berbagai peningkatan untuk meningkatkan stabilitas pengumpulan data, memperbaiki bug yang diketahui, serta mengoptimalkan konsumsi resource.
Jika kluster Anda menjalankan agent ARMS Prometheus dari seri v3.x.x, kami sangat menyarankan untuk melakukan peningkatan ke versi terbaru. Versi lama mungkin mengandung komponen yang belum dioptimalkan dan berisiko menyebabkan pemutusan data.
Fitur baru di v4.0.0
|
Jenis perubahan |
Deskripsi |
|
New |
Menambahkan job pengumpulan untuk event kluster guna mendukung dasbor Kubernetes Deployment. |
|
New |
Menambahkan metrik self-monitoring berbasis Service Level Agreements (SLAs) untuk menyediakan data bagi dasbor stabilitas SLA. |
|
New |
Menambahkan dukungan otentikasi BasicAuth dalam ServiceMonitor. Secret harus berada di namespace yang sama dengan ServiceMonitor. |
|
New |
Menambahkan fitur metadata metrik untuk menampilkan makna metrik tertentu. |
|
New |
Agent kini dapat mengirimkan versi chart-nya ke server, yang menggunakan nomor versi tersebut untuk menginisialisasi atau meningkatkan dasbor. |
|
New |
Menambahkan metrik self-monitoring RemoteWrite untuk melacak durasi pengiriman setiap batch data. |
|
New |
Menambahkan metrik self-monitoring untuk error dan latensi pengumpulan metrik dasar. |
|
New |
Menambahkan metrik self-monitoring untuk error dan latensi pengumpulan metrik bisnis. |
|
Improved |
Meningkatkan |
|
Improved |
Meningkatkan metode penemuan layanan untuk job pengumpulan CSI, terutama untuk pengumpulan PersistentVolume (PV). |
|
Improved |
Mengoptimalkan frekuensi |
|
Improved |
Menyederhanakan beberapa entri log dan meningkatkan entri lainnya untuk memberikan informasi waktu yang lebih detail pada pipeline scraping. |
|
Improved |
Meningkatkan job pengumpulan metrik dasar agar menggunakan interval scrape dan timeout tetap, sehingga terurai keterkaitannya dari konfigurasi global guna mengurangi interferensi. |
|
Improved |
Mengoptimalkan logika interaksi dalam mode multi-replika master-slave. Replika master dan worker kini tidak saling mengganggu, sehingga meningkatkan stabilitas keseluruhan. |
|
Improved |
Meningkatkan strategi distribusi target dari replika master, mengurangi konsumsi CPU sekitar 30% dan konsumsi memori 40% untuk meningkatkan performa pengumpulan data. |
|
Improved |
Mengoptimalkan pemrosesan |
|
Improved |
Mengoptimalkan logika listener Informer untuk skenario multi-tenant, mengurangi konsumsi CPU sekitar 20%. |
|
Improved |
Meningkatkan penanganan kegagalan resolusi CoreDNS yang bersifat sementara. Agent kini akan kembali menggunakan alamat IP yang tersimpan dalam cache, sehingga mengurangi ketergantungan pada resolusi DNS real-time dan meningkatkan stabilitas transmisi data. |
|
Improved |
Mengoptimalkan logika distribusi konfigurasi scrape melalui |
|
Improved |
Mengoptimalkan strategi pra-scraping pada replika master untuk mengurangi konsumsi resource serta meningkatkan kemampuan penemuan layanan dan penjadwalan target-nya. |
|
Improved |
Menambahkan penanganan adaptif untuk batch data tunggal yang melebihi 1 MB guna mengurangi kehilangan data akibat batasan backend. |
|
Fixed |
Memperbaiki masalah pada |
|
Fixed |
Memperbaiki masalah dalam skenario multi-tenant di mana pembaruan cache label Pod yang tertunda menyebabkan satu deret waktu terpecah menjadi dua. |
|
Fixed |
Memperbaiki masalah di mana replika master kadang gagal mendistribusikan target ke replika yang telah direstart atau mengalami error Out-Of-Memory (OOM), sehingga menyebabkan target scrape terlewat. |
|
Fixed |
Memperbaiki masalah parsing tipe Secret dan transmisi header dalam RemoteWrite. |
|
Fixed |
Memperbaiki masalah di mana aksi disable |
|
Fixed |
Memperbaiki masalah di mana parameter default global dan |
Risiko peningkatan
-
Risiko peningkatan: Peningkatan ke Helm v1.1.17/agent v4.0.0 merupakan peningkatan yang bersifat disruptif. Bergantung pada beban pengumpulan metrik kluster Anda (jumlah target dan deret waktu), Anda mungkin mengalami gangguan data singkat. Gangguan diperkirakan berlangsung 0 hingga 5 menit, meskipun durasi ini dapat bervariasi antar kluster.
-
Sebelum peningkatan: Anda harus melakukan pemeriksaan pra-peningkatan yang dijelaskan dalam Langkah 1: Pemeriksaan pra-peningkatan (Wajib) untuk meminimalkan dampak terhadap data pemantauan kluster Anda.
-
Setelah peningkatan: Jika Anda menemukan masalah data, ikuti langkah-langkah dalam Langkah 3: Pemeriksaan pasca-peningkatan (Opsional). Jika masalah berlanjut, lihat FAQ Pasca-Peningkatan. Untuk bantuan lebih lanjut, hubungi pakar teknis kami di DingTalk (ID: aliprometheus).
Prosedur peningkatan
Langkah 1: Pemeriksaan pra-peningkatan (wajib)
Saat Anda melakukan peningkatan dari versi Helm sebelum 1.1.16 ke versi 1.1.17, pengaturan parameter kustom Anda tidak akan dipertahankan. Oleh karena itu, Anda harus memeriksa adanya pengaturan kustom sebelum peningkatan. Jika ingin mempertahankannya, Anda perlu menerapkannya kembali secara manual setelah peningkatan selesai.
Peningkatan dari Helm versi 1.1.16 atau yang lebih baru secara otomatis mewarisi parameter kustom, sehingga Anda tidak perlu menerapkannya kembali pada peningkatan berikutnya. Ikuti langkah-langkah berikut untuk memeriksa parameter Anda sebelum peningkatan:
-
Klik nama kluster target Anda. Di panel navigasi kiri, pilih Workload > Stateless. Pilih namespace
arms-prom. Temukan workloadarms-prometheus-ack-arms-prometheus, lalu di kolom Operation, pilih More > View YAML untuk melihat konfigurasi YAML lengkap. -
Periksa parameter berikut dan catat nilai kustom yang ingin Anda pertahankan:
-
spec.replicas: Nilai default setelah peningkatan adalah 1. Jika nilai saat ini berbeda, catatlah. -
spec.containers.args: Ini adalah parameter startup agent untuk mode multi-tenant. Jika mode multi-tenant tidak diaktifkan, bidang ini mungkin tidak ada. Jika Anda telah menyesuaikan parameter ini, catat nilainya:-
tenant_userid -
tenant_clusterid -
tenant_token
-
-
spec.containers.resources: Batas default adalah 3 Core dan 4 GiB memori. Permintaan default adalah 1 Core dan 1 GiB memori.Jika pengaturan Anda berbeda, catat nilainya agar dapat diterapkan kembali setelah peningkatan.

Setelah peningkatan, gunakan metode yang sama untuk melihat konfigurasi YAML, edit file tersebut untuk menerapkan kembali nilai kustom Anda, lalu klik Update untuk menyimpan perubahan.

-
Langkah 2: Prosedur peningkatan
Kami menyarankan untuk melakukan peningkatan versi Helm komponen ARMS Prometheus melalui ACK console. Ikuti langkah-langkah berikut:
-
Klik nama kluster target Anda. Di panel navigasi kiri, pilih Operations > Component Management. Klik tab Logs and Monitoring, temukan kartu ack-arms-prometheus, lalu klik Upgrade.
-
Setelah peningkatan selesai, di panel navigasi kiri, pilih Operations > Managed Service for Prometheus. Di pojok kanan atas, klik Go to ARMS Prometheus. Anda akan diarahkan ke halaman daftar instans Prometheus di Managed Service for Prometheus console, tempat Anda dapat melihat status agent dan detail pengumpulan metrik.
Untuk memverifikasi peningkatan, Anda juga dapat mengklik Settings di panel navigasi kiri dan memeriksa versi komponen pada tab Settings.

Langkah 3: Pemeriksaan pasca-peningkatan (opsional)
-
Login ke ARMS console.
-
Di panel navigasi kiri, pilih .
-
Klik nama instans Prometheus target Anda. Di panel navigasi kiri, klik Service Discovery. Klik tab Targets untuk meninjau status job pengumpulan Anda.
-
Di panel navigasi kiri, klik Settings. Pada tab Self-Monitoring, klik View Grafana Dashboard di pojok kanan atas. Setelah peningkatan, pantau status operasional agent. Pastikan jumlah replika sesuai dan tidak ada anomali pada laju pengiriman data, konsumsi resource, atau jumlah error.
-
Pada halaman Self-Monitoring, klik tab Agent Self-monitoring untuk melihat dasbor self-monitoring agent Prometheus.
Setelah peningkatan, periksa empat job pengumpulan metrik dasar:
_arms/kubelet/cadvisor,_arms/kubelet/metric,_kube-state-metrics, dannode-exporter. Gunakan pemilih rentang waktu di pojok kanan atas untuk membandingkan data sebelum dan sesudah peningkatan guna memeriksa adanya masalah pengumpulan.
FAQ Pasca-Peningkatan
Ketidaksesuaian jumlah replika setelah peningkatan
Periksa apakah ada replika agent dalam status Pending. Agent ARMS Prometheus memerlukan semua replika berada dalam status Running agar berfungsi dengan benar. Anda dapat melihat status semua replika pada halaman Workload > Stateless kluster target Anda di ACK console, di bawah namespace arms-prom.
Konsumsi resource tinggi setelah peningkatan
Periksa adanya error transmisi data. Error semacam ini dapat menyebabkan penumpukan data di memori agent, sehingga meningkatkan konsumsi resource. Anda dapat melihat penggunaan memori dan CPU agent Prometheus di ACK console. Navigasi ke halaman Operations > Managed Service for Prometheus kluster target Anda, klik tab Others, lalu temukan bagian Prometheus Agent untuk melihat penggunaan resource.
Metrik dasar hilang atau tidak kontinu
Jika Anda menemukan masalah pada metrik dasar seperti node_*** (ikon ①), container_*** (ikon ②), kubelet_*** (ikon ③), atau kube_*** (ikon ④), periksa apakah job pengumpulan terkait melaporkan error. Anda dapat memeriksa status job tersebut pada tab Service Discovery > Targets di Managed Service for Prometheus console. Jika Anda menemukan error, hubungi pakar teknis kami di DingTalk (ID: aliprometheus) untuk bantuan.
Penurunan traffic RemoteWrite atau kehilangan data
-
Jika Anda belum mengonfigurasi RemoteWrite, Anda dapat mengabaikan masalah ini.
-
Jika Anda telah mengonfigurasi RemoteWrite, perlu diketahui bahwa pada agent v4.0.0, pengaturan
write_relabel_configskini diaktifkan secara default, berbeda dengan versi sebelumnya. Jika konfigurasi Anda mencakup aksi sepertidropataukeep, Anda mungkin mengamati penurunan traffic. Anda dapat menyesuaikan pengaturan ini sesuai kebutuhan. Untuk melakukannya, navigasi ke halaman Settings di Managed Service for Prometheus console. Pada tab Settings, klik Edit Prometheus.yaml dan modifikasi konfigurasinya.