All Products
Search
Document Center

Application Real-Time Monitoring Service:Peningkatan ke Helm v1.1.17 dan agent v4.0.0

Last Updated:Aug 27, 2026

Rilis terbaru ARMS Prometheus adalah Helm v1.1.17, yang sesuai dengan agent v4.0.0. Versi ini mencakup berbagai peningkatan untuk meningkatkan stabilitas pengumpulan data, memperbaiki bug yang diketahui, serta mengoptimalkan konsumsi resource.

Penting

Jika kluster Anda menjalankan agent ARMS Prometheus dari seri v3.x.x, kami sangat menyarankan untuk melakukan peningkatan ke versi terbaru. Versi lama mungkin mengandung komponen yang belum dioptimalkan dan berisiko menyebabkan pemutusan data.

Fitur baru di v4.0.0

Jenis perubahan

Deskripsi

New

Menambahkan job pengumpulan untuk event kluster guna mendukung dasbor Kubernetes Deployment.

New

Menambahkan metrik self-monitoring berbasis Service Level Agreements (SLAs) untuk menyediakan data bagi dasbor stabilitas SLA.

New

Menambahkan dukungan otentikasi BasicAuth dalam ServiceMonitor. Secret harus berada di namespace yang sama dengan ServiceMonitor.

New

Menambahkan fitur metadata metrik untuk menampilkan makna metrik tertentu.

New

Agent kini dapat mengirimkan versi chart-nya ke server, yang menggunakan nomor versi tersebut untuk menginisialisasi atau meningkatkan dasbor.

New

Menambahkan metrik self-monitoring RemoteWrite untuk melacak durasi pengiriman setiap batch data.

New

Menambahkan metrik self-monitoring untuk error dan latensi pengumpulan metrik dasar.

New

Menambahkan metrik self-monitoring untuk error dan latensi pengumpulan metrik bisnis.

Improved

Meningkatkan queue_config RemoteWrite default dengan mengatur parameter menjadi min_shards=10, max_samples_per_send=5000, dan capacity=10000 untuk meningkatkan skalabilitas pada kluster berskala besar.

Improved

Meningkatkan metode penemuan layanan untuk job pengumpulan CSI, terutama untuk pengumpulan PersistentVolume (PV).

Improved

Mengoptimalkan frekuensi senderLoop dan syncWorkersSeries untuk mengurangi operasi yang tidak perlu.

Improved

Menyederhanakan beberapa entri log dan meningkatkan entri lainnya untuk memberikan informasi waktu yang lebih detail pada pipeline scraping.

Improved

Meningkatkan job pengumpulan metrik dasar agar menggunakan interval scrape dan timeout tetap, sehingga terurai keterkaitannya dari konfigurasi global guna mengurangi interferensi.

Improved

Mengoptimalkan logika interaksi dalam mode multi-replika master-slave. Replika master dan worker kini tidak saling mengganggu, sehingga meningkatkan stabilitas keseluruhan.

Improved

Meningkatkan strategi distribusi target dari replika master, mengurangi konsumsi CPU sekitar 30% dan konsumsi memori 40% untuk meningkatkan performa pengumpulan data.

Improved

Mengoptimalkan pemrosesan metrics_relabel, mengurangi penggunaan CPU hingga 70%.

Improved

Mengoptimalkan logika listener Informer untuk skenario multi-tenant, mengurangi konsumsi CPU sekitar 20%.

Improved

Meningkatkan penanganan kegagalan resolusi CoreDNS yang bersifat sementara. Agent kini akan kembali menggunakan alamat IP yang tersimpan dalam cache, sehingga mengurangi ketergantungan pada resolusi DNS real-time dan meningkatkan stabilitas transmisi data.

Improved

Mengoptimalkan logika distribusi konfigurasi scrape melalui SendConfig untuk meningkatkan stabilitas.

Improved

Mengoptimalkan strategi pra-scraping pada replika master untuk mengurangi konsumsi resource serta meningkatkan kemampuan penemuan layanan dan penjadwalan target-nya.

Improved

Menambahkan penanganan adaptif untuk batch data tunggal yang melebihi 1 MB guna mengurangi kehilangan data akibat batasan backend.

Fixed

Memperbaiki masalah pada ScrapeLoop di mana beberapa target tidak dapat dihentikan, sehingga menyebabkan scraping ganda.

Fixed

Memperbaiki masalah dalam skenario multi-tenant di mana pembaruan cache label Pod yang tertunda menyebabkan satu deret waktu terpecah menjadi dua.

Fixed

Memperbaiki masalah di mana replika master kadang gagal mendistribusikan target ke replika yang telah direstart atau mengalami error Out-Of-Memory (OOM), sehingga menyebabkan target scrape terlewat.

Fixed

Memperbaiki masalah parsing tipe Secret dan transmisi header dalam RemoteWrite.

Fixed

Memperbaiki masalah di mana aksi disable kubernetes-pods kadang gagal diterapkan.

Fixed

Memperbaiki masalah di mana parameter default global dan external_labels tidak diterapkan dengan benar. Modifikasi kustom kini juga didukung.

Risiko peningkatan

  • Risiko peningkatan: Peningkatan ke Helm v1.1.17/agent v4.0.0 merupakan peningkatan yang bersifat disruptif. Bergantung pada beban pengumpulan metrik kluster Anda (jumlah target dan deret waktu), Anda mungkin mengalami gangguan data singkat. Gangguan diperkirakan berlangsung 0 hingga 5 menit, meskipun durasi ini dapat bervariasi antar kluster.

  • Sebelum peningkatan: Anda harus melakukan pemeriksaan pra-peningkatan yang dijelaskan dalam Langkah 1: Pemeriksaan pra-peningkatan (Wajib) untuk meminimalkan dampak terhadap data pemantauan kluster Anda.

  • Setelah peningkatan: Jika Anda menemukan masalah data, ikuti langkah-langkah dalam Langkah 3: Pemeriksaan pasca-peningkatan (Opsional). Jika masalah berlanjut, lihat FAQ Pasca-Peningkatan. Untuk bantuan lebih lanjut, hubungi pakar teknis kami di DingTalk (ID: aliprometheus).

Prosedur peningkatan

Langkah 1: Pemeriksaan pra-peningkatan (wajib)

Saat Anda melakukan peningkatan dari versi Helm sebelum 1.1.16 ke versi 1.1.17, pengaturan parameter kustom Anda tidak akan dipertahankan. Oleh karena itu, Anda harus memeriksa adanya pengaturan kustom sebelum peningkatan. Jika ingin mempertahankannya, Anda perlu menerapkannya kembali secara manual setelah peningkatan selesai.

Peningkatan dari Helm versi 1.1.16 atau yang lebih baru secara otomatis mewarisi parameter kustom, sehingga Anda tidak perlu menerapkannya kembali pada peningkatan berikutnya. Ikuti langkah-langkah berikut untuk memeriksa parameter Anda sebelum peningkatan:

  1. Login ke Container Service for Kubernetes (ACK) console.

  2. Klik nama kluster target Anda. Di panel navigasi kiri, pilih Workload > Stateless. Pilih namespace arms-prom. Temukan workload arms-prometheus-ack-arms-prometheus, lalu di kolom Operation, pilih More > View YAML untuk melihat konfigurasi YAML lengkap.

  3. Periksa parameter berikut dan catat nilai kustom yang ingin Anda pertahankan:

    • spec.replicas: Nilai default setelah peningkatan adalah 1. Jika nilai saat ini berbeda, catatlah.

    • spec.containers.args: Ini adalah parameter startup agent untuk mode multi-tenant. Jika mode multi-tenant tidak diaktifkan, bidang ini mungkin tidak ada. Jika Anda telah menyesuaikan parameter ini, catat nilainya:

      • tenant_userid

      • tenant_clusterid

      • tenant_token

    • spec.containers.resources: Batas default adalah 3 Core dan 4 GiB memori. Permintaan default adalah 1 Core dan 1 GiB memori.

      Jika pengaturan Anda berbeda, catat nilainya agar dapat diterapkan kembali setelah peningkatan.image.png

    Setelah peningkatan, gunakan metode yang sama untuk melihat konfigurasi YAML, edit file tersebut untuk menerapkan kembali nilai kustom Anda, lalu klik Update untuk menyimpan perubahan.image.png

Langkah 2: Prosedur peningkatan

Kami menyarankan untuk melakukan peningkatan versi Helm komponen ARMS Prometheus melalui ACK console. Ikuti langkah-langkah berikut:

  1. Login ke Container Service for Kubernetes (ACK) console.

  2. Klik nama kluster target Anda. Di panel navigasi kiri, pilih Operations > Component Management. Klik tab Logs and Monitoring, temukan kartu ack-arms-prometheus, lalu klik Upgrade.

  3. Setelah peningkatan selesai, di panel navigasi kiri, pilih Operations > Managed Service for Prometheus. Di pojok kanan atas, klik Go to ARMS Prometheus. Anda akan diarahkan ke halaman daftar instans Prometheus di Managed Service for Prometheus console, tempat Anda dapat melihat status agent dan detail pengumpulan metrik.

    Untuk memverifikasi peningkatan, Anda juga dapat mengklik Settings di panel navigasi kiri dan memeriksa versi komponen pada tab Settings.image.png

Langkah 3: Pemeriksaan pasca-peningkatan (opsional)

  1. Login ke ARMS console.

  2. Di panel navigasi kiri, pilih Managed Service for Prometheus > Instances.

  3. Klik nama instans Prometheus target Anda. Di panel navigasi kiri, klik Service Discovery. Klik tab Targets untuk meninjau status job pengumpulan Anda.

  4. Di panel navigasi kiri, klik Settings. Pada tab Self-Monitoring, klik View Grafana Dashboard di pojok kanan atas. Setelah peningkatan, pantau status operasional agent. Pastikan jumlah replika sesuai dan tidak ada anomali pada laju pengiriman data, konsumsi resource, atau jumlah error.

  5. Pada halaman Self-Monitoring, klik tab Agent Self-monitoring untuk melihat dasbor self-monitoring agent Prometheus.

    Setelah peningkatan, periksa empat job pengumpulan metrik dasar: _arms/kubelet/cadvisor, _arms/kubelet/metric, _kube-state-metrics, dan node-exporter. Gunakan pemilih rentang waktu di pojok kanan atas untuk membandingkan data sebelum dan sesudah peningkatan guna memeriksa adanya masalah pengumpulan.

FAQ Pasca-Peningkatan

Ketidaksesuaian jumlah replika setelah peningkatan

Periksa apakah ada replika agent dalam status Pending. Agent ARMS Prometheus memerlukan semua replika berada dalam status Running agar berfungsi dengan benar. Anda dapat melihat status semua replika pada halaman Workload > Stateless kluster target Anda di ACK console, di bawah namespace arms-prom.

Konsumsi resource tinggi setelah peningkatan

Periksa adanya error transmisi data. Error semacam ini dapat menyebabkan penumpukan data di memori agent, sehingga meningkatkan konsumsi resource. Anda dapat melihat penggunaan memori dan CPU agent Prometheus di ACK console. Navigasi ke halaman Operations > Managed Service for Prometheus kluster target Anda, klik tab Others, lalu temukan bagian Prometheus Agent untuk melihat penggunaan resource.image.png

Metrik dasar hilang atau tidak kontinu

Jika Anda menemukan masalah pada metrik dasar seperti node_*** (ikon ①), container_*** (ikon ②), kubelet_*** (ikon ③), atau kube_*** (ikon ④), periksa apakah job pengumpulan terkait melaporkan error. Anda dapat memeriksa status job tersebut pada tab Service Discovery > Targets di Managed Service for Prometheus console. Jika Anda menemukan error, hubungi pakar teknis kami di DingTalk (ID: aliprometheus) untuk bantuan.image.png

Penurunan traffic RemoteWrite atau kehilangan data

  • Jika Anda belum mengonfigurasi RemoteWrite, Anda dapat mengabaikan masalah ini.

  • Jika Anda telah mengonfigurasi RemoteWrite, perlu diketahui bahwa pada agent v4.0.0, pengaturan write_relabel_configs kini diaktifkan secara default, berbeda dengan versi sebelumnya. Jika konfigurasi Anda mencakup aksi seperti drop atau keep, Anda mungkin mengamati penurunan traffic. Anda dapat menyesuaikan pengaturan ini sesuai kebutuhan. Untuk melakukannya, navigasi ke halaman Settings di Managed Service for Prometheus console. Pada tab Settings, klik Edit Prometheus.yaml dan modifikasi konfigurasinya.image.png