All Products
Search
Document Center

Managed Service for Prometheus:Observabilitas ECS

Last Updated:Jul 19, 2026

Managed Service for Prometheus mendukung pengumpulan metrik tingkat OS dari host Elastic Compute Service (ECS) Linux atau Windows menggunakan node_exporter, pengumpulan data pemantauan terkait proses melalui process_exporter, serta pengambilan metrik pemantauan kustom yang Anda tulis ke file melalui textfile collector.

Prasyarat

Manfaat pemantauan host

Pemantauan host menyediakan solusi observabilitas otomatis untuk instance Alibaba Cloud ECS, mencakup penemuan host, instalasi agen, pengambilan metrik (scraping), dan peringatan (alerting).

Layanan ini mendukung instance Alibaba Cloud ECS, server pusat data yang dikelola sendiri, serta server cloud pihak ketiga. Untuk instance ECS, layanan secara otomatis menginstal exporter dan menghasilkan konfigurasi scraping. Agen Prometheus yang dikelola menangani scraping metrik, penyimpanan, visualisasi, dan peringatan. Untuk host non-Alibaba Cloud yang tidak didukung oleh fitur penemuan otomatis, Anda harus menginstal agen Alibaba Cloud secara manual untuk mendorong data.

Manfaat

Deskripsi

Penemuan host hampir real-time

  • Adaptabilitas: Penemuan otomatis mendeteksi perubahan dinamis pada resource cloud, memastikan semua instance yang berjalan segera dipantau.

  • Fleksibilitas: Mendukung berbagai jenis penemuan, termasuk service discovery Kubernetes dan integrasi dengan layanan cloud lainnya.

Instalasi agen hampir real-time

  • Plug-and-play: Instalasi exporter otomatis memungkinkan sistem mengenali node baru dan mengumpulkan metrik tanpa intervensi manual.

  • Pemantauan komprehensif: Termasuk node-exporter, process-exporter, GPU-exporter, dan exporter middleware untuk pelacakan kinerja full-stack.

Scraping metrik hampir real-time

  • Konfigurasi disederhanakan: Pembuatan konfigurasi otomatis mengurangi pekerjaan manual dan memastikan scraping metrik akurat di seluruh node dan layanan.

  • Fleksibilitas: Konfigurasi yang dapat disesuaikan mampu menangani lingkungan pemantauan yang kompleks.

Sebuah host terintegrasi dalam waktu 30–60 detik setelah dibuat. Interval scraping dapat disesuaikan dari 1 hingga 60 detik.

Agen serverless

  • Manajemen terpusat: Agen Prometheus yang dikelola menyatukan pengumpulan data dan menyederhanakan arsitektur pemantauan. Pipeline pengumpulan transparan bagi pengguna.

  • Efisiensi tinggi: Kompleksitas pemantauan yang diabstraksi mengurangi risiko salah konfigurasi dan meningkatkan akurasi data.

Label metrik cerdas

  • Secara otomatis mengekstrak tag, kelompok sumber daya, dan wilayah dari instance ECS serta menyuntikkannya sebagai label metrik.

  • Label kustom dapat ditambahkan untuk identifikasi bisnis, lingkungan, dan sumber data.

Pengumpulan dan penyimpanan data skala besar

  • Mendukung integrasi skala besar dengan model hibrida resource dedicated dan shared. Resource diskalakan secara dinamis berdasarkan jumlah host yang terintegrasi.

  • Sistem penyimpanan menangani volume metrik yang sangat besar dengan kueri berkinerja tinggi.

Data pemantauan hulu dan hilir yang komprehensif

  • Observabilitas end-to-end memerlukan integrasi data pemantauan lintas dimensi untuk mencerminkan kesehatan seluruh ekosistem aplikasi dan layanan.

  • Mencakup seluruh stack mulai dari perangkat keras hingga lapisan aplikasi, termasuk host, jaringan, layanan dependensi, dan layanan eksternal seperti jaringan RDMA, OSS, dan Redis.

Pemantauan tingkat proses

  • Memantau kinerja proses dan pemanfaatan resource di OS, menunjukkan kesehatan aplikasi yang berjalan di server.

  • Menangkap penggunaan CPU, memori, I/O disk, waktu mulai, handle file terbuka, dan jumlah thread per proses. Umpan balik hampir real-time memungkinkan identifikasi masalah secara cepat.

  • Membantu mengidentifikasi proses yang menyebabkan degradasi kinerja, seperti kebocoran memori, penggunaan CPU tinggi, atau konflik sumber daya.

Dasbor Grafana tingkat ahli disertakan secara default

  • Termasuk dasbor Grafana hasil kurasi ahli: Ikhtisar ECS, Detail ECS, Ikhtisar GPU, Detail GPU, dan Proses Node.

  • Pengalaman pemantauan host siap pakai hanya dengan satu klik.

Langkah 1: Integrasikan data pemantauan host

  1. Login ke Konsol ARMS. Di panel navigasi kiri, klik Integration Center.

  2. Pada halaman Integration Center, klik Infrastructure di panel navigasi kiri, lalu klik Host Monitoring.

    Catatan
    • Managed Service for Prometheus menggunakan Resource Center untuk menemukan VPC dan instance ECS. Jika Resource Center belum diaktifkan, proses integrasi akan memandu Anda untuk mengaktifkannya. Aktifkan Resource Center.

    • Aktivasi Resource Center merupakan operasi asinkron. Jika status tidak diperbarui, tunggu 10 hingga 20 detik lalu klik Redetect.

  3. Pada panel yang muncul, pilih VPC target dan konfigurasikan Configuration Information sesuai tabel berikut.

    Parameter

    Deskripsi

    Policy name

    Opsi opsional. Nama untuk integrasi ini.

    Notes

    • Fitur ini mengumpulkan metrik tanpa agen untuk ECS dari Cloud Monitor. Anda juga dapat menginstal exporter seperti Node-Exporter, Process-Exporter, atau Windows-Exporter untuk mengumpulkan metrik host berbasis agen.

    • Menginstal agen pada host di lingkungan produksi dianggap sebagai perubahan produksi. Ajukan permintaan perubahan sesuai standar organisasi Anda.

    • Jika akses cross-region diaktifkan, Anda tidak dapat menggunakan agen untuk mengumpulkan metrik node, proses, atau Windows.

    • Instalasi exporter saat ini tidak didukung pada LifseaOS. Instance yang menjalankan LifseaOS dilewati secara otomatis.

    • Penggunaan resource: Agen berjalan sebagai layanan systemd dengan GOMAXPROCS=1, batas CPU 30%, dan batas memori 256 MB. Penggunaan resource rendah dalam kondisi normal. Overhead pengumpulan meningkat seiring jumlah proses di host.

    • Peringatan risiko: Mengaktifkan fitur Collect Process PSS Memory Metrics membaca file smaps untuk setiap proses dan sementara menahan mmap_lock. Hal ini dapat menyebabkan gangguan latensi pada proses yang menggunakan memori besar atau melakukan operasi mmap secara sering. Jika Anda tidak memerlukan metrik Proportional Set Size (PSS), nonaktifkan fitur ini.

    Node-exporter installation mode

    • Automatic Installation (Recommended): Menginstal node-exporter pada instance ECS yang dipilih secara otomatis. Tidak diperlukan langkah manual.

    • Self-installation: Instal node-exporter sendiri.

    Host discovery mode

    • Stain label selection: Mekanisme daftar hitam. Instance dengan label yang cocok dikecualikan. Secara default, node layanan pemantauan kontainer tidak di-scrape.

    • Unconditional: Instal exporter dan kumpulkan metrik pemantauan dari semua host ECS di VPC saat ini.

    • Tag selection: Mekanisme daftar putih. Hanya instance dengan tag yang cocok yang diintegrasikan.

    • IP CIDR selection: Mengintegrasikan instance yang IP-nya berada dalam blok CIDR yang ditentukan. Masukkan blok CIDR VPC untuk memilih semua instance di VPC tersebut.

    • Instance ID: Tentukan ID instance, dipisahkan dengan koma (,).

    ECS stain label

    Setiap stain label adalah pasangan kunci-nilai. Anda dapat mengatur beberapa label.

    Collect TextFile

    Apakah akan mengambil metrik Prometheus dari file tertentu.

    Collect process status metrics

    Mengumpulkan data pemantauan proses secara default.

    Collect Process PSS Memory Metrics

    Jika diaktifkan, membaca file smaps untuk setiap proses guna mengumpulkan PSS (proportional set size resident memory) dan metrik terkait.

    Node-Exporter Service Port

    Port default adalah 9100. Jika arm-prometheus dan ack-prometheus-operator keduanya diinstal di kluster ACK yang sama, kedua set node-exporter secara default menggunakan port 9100, yang dapat menyebabkan konflik port dan mengakibatkan error layanan.

    Metric scrape interval (seconds)

    Interval scraping. Default: 15 detik.

    Automatically configure security groups

    Diaktifkan secara default.

    Custom ECS tag injection

    Tentukan kunci tag ECS. Sistem menyuntikkan pasangan kunci-nilai tag tersebut ke metrik Prometheus sebagai label.

  4. Klik OK. Tunggu 1 hingga 2 menit hingga integrasi selesai.

Catatan

Jika tidak ada data yang muncul di dasbor setelah integrasi, pastikan aturan inbound grup keamanan ECS mengizinkan blok CIDR 100.64.0.0/10 dan 192.168.0.0/18 untuk mengakses port 9100 dan 9256 (port default untuk node-exporter dan process-exporter). Lihat aturan grup keamanan. Jika Anda menggunakan port berbeda, sesuaikan aturan tersebut.

Atasi dan selesaikan konflik port node-exporter

Ketika arms-prometheus dan ack-prometheus-operator keduanya dideploy di kluster ACK yang sama, DaemonSet node-exporter masing-masing bersaing untuk hostPort 9100. Hal ini mencegah salah satu set pod node-exporter untuk memulai. Untuk mengatasinya, ubah port salah satu DaemonSet node-exporter menjadi 9101.

  1. Jalankan perintah berikut untuk memastikan DaemonSet mana yang pod node-exporternya gagal dijadwalkan:

    kubectl get pods -A | grep node-exporter
    kubectl describe pod <pod-name> -n <namespace>
  2. Edit DaemonSet yang bermasalah:

    kubectl edit daemonset <daemonset-name> -n <namespace>
  3. Pada YAML DaemonSet, temukan argumen --secure-listen-address dan ubah port dari 9100 menjadi 9101. Perbarui juga nilai containerPort dan hostPort menjadi 9101:

    args:
    - --secure-listen-address=0.0.0.0:9101
    ...
    ports:
    - containerPort: 9101
      hostPort: 9101
      name: https
  4. Simpan dan keluar. Verifikasi bahwa pod node-exporter restart dan berjalan pada port baru.

    Catatan

    Jika komponen awalnya diinstal menggunakan Helm, helm upgrade berikutnya dapat menimpa perubahan Anda. Sebelum melakukan upgrade, backup konfigurasi yang telah dimodifikasi atau kunci versi chart.

Konfigurasi ServiceMonitor untuk pemantauan kustom

Setelah mengatasi konflik port, konfigurasikan ServiceMonitor di Konsol ARMS untuk mengambil metrik dari instance node-exporter pada port baru.

  1. Login ke Konsol ARMS.

  2. Di panel navigasi kiri, pilih Prometheus Monitoring > Service Discovery.

  3. Klik Create ServiceMonitor. Di panel pembuatan, pilih YAML Mode.

  4. Masukkan konfigurasi ServiceMonitor yang menargetkan layanan node-exporter Anda pada port 9101. Berikut contohnya:

    apiVersion: monitoring.coreos.com/v1
    kind: ServiceMonitor
    metadata:
      name: node-exporter-custom
      namespace: <namespace>
    spec:
      endpoints:
      - port: https
        interval: 15s
        scheme: https
        tlsConfig:
          insecureSkipVerify: true
      namespaceSelector:
        matchNames:
        - <namespace>
      selector:
        matchLabels:
          app.kubernetes.io/name: node-exporter

    Ganti <namespace> dengan namespace tempat node-exporter Anda dideploy.

  5. Klik OK. ServiceMonitor akan berlaku dalam beberapa menit.

Langkah 2: Lihat dasbor pemantauan

  1. Di panel navigasi kiri, klik Integration Management.

  2. Pada halaman Integration Management, klik tab Integrated Environments, lalu pilih ECS Environment.

  3. Pada daftar ECS Environment, klik nama lingkungan target untuk membuka halaman detailnya.

  4. Pada tab Component Management, di bagian Addon Type, klik Dashboard untuk melihat dasbor Grafana bawaan.

Langkah 3: Konfigurasi peringatan

  1. Login ke Konsol Managed Service for Prometheus. Di panel navigasi kiri, klik Integration Management.

  2. Pada halaman Integration Management, klik tab Integrated Environments, lalu pilih ECS Environment.

  3. Pada daftar ECS Environment, klik nama lingkungan target untuk membuka halaman detailnya.

  4. Pada tab Component Management, di bagian Addon Type, klik Alarm Rules untuk melihat aturan peringatan bawaan.

Catatan
  • Aturan peringatan bawaan menghasilkan event tetapi tidak mengirim notifikasi. Untuk mengirim notifikasi, klik Edit untuk mengonfigurasi metode notifikasi. Anda juga dapat menyesuaikan ambang batas, durasi, dan konten. Buat aturan peringatan Prometheus.

  • Dalam Simple Mode, Anda dapat mengatur penerima notifikasi, periode notifikasi, dan kebijakan pengulangan.

Contoh dasbor Grafana

Dasbor Ikhtisar ECS

image.png

Dasbor Detail ECS

image.png