All Products
Search
Document Center

Application Real-Time Monitoring Service:Observabilitas ECS

Last Updated:Sep 17, 2026

Managed Service for Prometheus mendukung pengumpulan metrik tingkat sistem operasi dari host Elastic Compute Service (ECS) Linux atau Windows menggunakan node_exporter, mengumpulkan data pemantauan terkait proses melalui process_exporter, serta mengambil metrik pemantauan kustom yang Anda tulis ke file melalui textfile collector.

Prasyarat

Manfaat pemantauan host

Pemantauan host menyediakan solusi observabilitas otomatis untuk instance Alibaba Cloud ECS, mencakup penemuan host, instalasi agen, pengambilan metrik (scraping), dan peringatan (alerting).

Layanan ini mendukung instance Alibaba Cloud ECS, server pusat data yang dikelola sendiri, dan server cloud pihak ketiga. Untuk instance ECS, layanan secara otomatis menginstal exporter dan menghasilkan konfigurasi scraping. Agen Prometheus terkelola menangani scraping metrik, penyimpanan, visualisasi, dan peringatan. Untuk host non-Alibaba Cloud yang tidak didukung oleh fitur penemuan otomatis, instal agen Alibaba Cloud secara manual untuk mendorong data.

Manfaat

Deskripsi

Penemuan host hampir real-time

  • Adaptabilitas: Penemuan otomatis mendeteksi perubahan dinamis pada resource cloud, memastikan semua instance yang berjalan segera dipantau.

  • Fleksibilitas: Mendukung berbagai jenis penemuan, termasuk service discovery Kubernetes dan integrasi dengan layanan cloud lainnya.

Instalasi agen hampir real-time

  • Plug-and-play: Instalasi exporter otomatis memungkinkan sistem mengenali node baru dan mengumpulkan metrik tanpa intervensi manual.

  • Pemantauan komprehensif: Termasuk node-exporter, process-exporter, GPU-exporter, dan exporter middleware untuk pelacakan performa full-stack.

Scraping metrik hampir real-time

  • Konfigurasi disederhanakan: Pembuatan konfigurasi otomatis mengurangi pekerjaan manual dan memastikan scraping metrik akurat di seluruh node dan layanan.

  • Fleksibilitas: Konfigurasi yang dapat disesuaikan mampu menangani lingkungan pemantauan yang kompleks.

Sebuah host terintegrasi dalam waktu 30–60 detik setelah dibuat. Interval scraping dapat disesuaikan antara 1 hingga 60 detik.

Agen serverless

  • Manajemen terpusat: Agen Prometheus terkelola menyatukan pengumpulan data dan menyederhanakan arsitektur pemantauan. Pipeline pengumpulan transparan bagi pengguna.

  • Efisiensi tinggi: Kompleksitas pemantauan yang diabstraksi mengurangi risiko salah konfigurasi dan meningkatkan akurasi data.

Label metrik cerdas

  • Secara otomatis mengekstraksi tag, kelompok sumber daya, dan wilayah dari instance ECS serta menyuntikkannya sebagai label metrik.

  • Label kustom dapat ditambahkan untuk identifikasi bisnis, lingkungan, dan sumber data.

Pengumpulan dan penyimpanan data skala besar

  • Mendukung integrasi skala besar dengan model hibrida resource dedicated dan shared. Resource diskalakan secara dinamis berdasarkan jumlah host yang terintegrasi.

  • Sistem penyimpanan menangani volume metrik besar dengan kueri berkinerja tinggi.

Data pemantauan upstream dan downstream yang komprehensif

  • Observabilitas end-to-end memerlukan integrasi data pemantauan lintas dimensi untuk mencerminkan kesehatan seluruh ekosistem aplikasi dan layanan.

  • Mencakup seluruh stack mulai dari perangkat keras hingga lapisan aplikasi, termasuk host, jaringan, layanan dependensi, dan layanan eksternal seperti jaringan RDMA, OSS, dan Redis.

Pemantauan tingkat proses

  • Memantau performa proses dan pemanfaatan resource di OS, menunjukkan kesehatan aplikasi yang berjalan di server.

  • Menangkap penggunaan CPU, memori, I/O disk, waktu mulai, handle file terbuka, dan jumlah thread per proses. Umpan balik hampir real-time memungkinkan identifikasi masalah secara cepat.

  • Membantu mengidentifikasi proses yang menyebabkan degradasi performa, seperti kebocoran memori, penggunaan CPU tinggi, atau konflik sumber daya.

Dasbor Grafana tingkat ahli disertakan secara default

  • Termasuk dasbor Grafana hasil kurasi ahli: ECS Overview, ECS Detail, GPU Overview, GPU Detail, dan Node Process.

  • Pengalaman pemantauan host siap pakai hanya dengan satu klik.

Langkah 1: Integrasi data pemantauan host

  1. Masuk ke Konsol ARMS. Di panel navigasi kiri, klik Integration Center.

  2. Di halaman Integration Center, klik Infrastructure di panel navigasi kiri, lalu klik Host Monitoring.

    Catatan
    • Managed Service for Prometheus menggunakan Resource Center untuk menemukan VPC dan instance ECS. Jika Resource Center belum diaktifkan, proses integrasi akan memandu Anda untuk mengaktifkannya. Aktifkan Resource Center.

    • Aktivasi Resource Center merupakan operasi asinkron. Jika status tidak diperbarui, tunggu 10 hingga 20 detik lalu klik Redetect.

  3. Di panel yang muncul, pilih VPC target dan konfigurasikan Configuration Information sesuai tabel berikut.

    Parameter

    Deskripsi

    Policy name

    Opsional. Nama untuk integrasi ini.

    Notes

    • Fitur ini mengumpulkan metrik tanpa agen untuk ECS dari Cloud Monitor. Anda juga dapat menginstal exporter, seperti Node-Exporter, Process-Exporter, atau Windows-Exporter, untuk mengumpulkan metrik host berbasis agen.

    • Menginstal agen pada host di lingkungan produksi dianggap sebagai perubahan produksi. Ajukan permintaan perubahan sesuai standar organisasi Anda.

    • Jika akses cross-region diaktifkan, Anda tidak dapat menggunakan agen untuk mengumpulkan metrik node, proses, atau Windows.

    • Instalasi exporter saat ini tidak didukung pada LifseaOS. Instance yang menjalankan LifseaOS dilewati secara otomatis.

    • Penggunaan resource: Agen berjalan sebagai layanan systemd dengan GOMAXPROCS=1, batas CPU 30%, dan batas memori 256 MB. Penggunaan resource rendah dalam kondisi normal. Overhead pengumpulan meningkat seiring jumlah proses di host.

    • Peringatan risiko: Mengaktifkan fitur Collect Process PSS Memory Metrics membaca file smaps untuk setiap proses dan sesaat menahan mmap_lock. Hal ini dapat menyebabkan gangguan latensi pada proses yang menggunakan memori besar atau melakukan operasi mmap secara sering. Jika Anda tidak memerlukan metrik Proportional Set Size (PSS), nonaktifkan fitur ini.

    Node-exporter installation mode

    • Automatic Installation (Recommended): Menginstal node-exporter pada instance ECS yang dipilih secara otomatis. Tidak diperlukan langkah manual.

    • Self-installation: Instal node-exporter sendiri.

    Host discovery mode

    • Stain label selection: Mekanisme daftar hitam. Instance dengan label yang cocok dikecualikan. Secara default, node layanan pemantauan kontainer tidak di-scrape.

    • Unconditional: Menginstal exporter dan mengumpulkan metrik pemantauan dari semua host ECS di VPC saat ini.

    • Tag selection: Mekanisme daftar putih. Hanya instance dengan tag yang cocok yang diintegrasikan.

    • IP CIDR selection: Mengintegrasikan instance yang IP-nya berada dalam blok CIDR yang ditentukan. Masukkan blok CIDR VPC untuk memilih semua instance di VPC tersebut.

    • Instance ID: Tentukan ID instans, dipisahkan dengan koma (,).

    ECS stain label

    Setiap stain label adalah pasangan kunci-nilai. Anda dapat menetapkan beberapa label.

    Collect TextFile

    Apakah akan mengambil metrik Prometheus dari file tertentu.

    Collect process status metrics

    Mengumpulkan data pemantauan proses secara default.

    Collect Process PSS Memory Metrics

    Jika diaktifkan, membaca file smaps untuk setiap proses guna mengumpulkan PSS (proportional set size resident memory) dan metrik terkait.

    Node-Exporter Service Port

    Port default adalah 9100. Jika arm-prometheus dan ack-prometheus-operator keduanya diinstal di kluster ACK yang sama, kedua set node-exporter menggunakan port 9100 secara default, yang dapat menyebabkan konflik port dan mengakibatkan error layanan.

    Metric scrape interval (seconds)

    Interval scraping. Default: 15 detik.

    Automatically configure security groups

    Diaktifkan secara default.

    Custom ECS tag injection

    Tentukan kunci tag ECS. Sistem menyuntikkan pasangan kunci-nilai tag tersebut ke metrik Prometheus sebagai label.

  4. Klik OK. Tunggu 1 hingga 2 menit hingga integrasi selesai.

Catatan

Jika tidak ada data yang muncul di dasbor setelah integrasi, pastikan aturan inbound grup keamanan ECS mengizinkan blok CIDR 100.64.0.0/10 dan 192.168.0.0/18 untuk mengakses port 9100 dan 9256 (port default untuk node-exporter dan process-exporter). Lihat aturan grup keamanan. Jika Anda menggunakan port berbeda, sesuaikan aturan tersebut.

Atasi dan selesaikan konflik port node-exporter

Ketika arms-prometheus dan ack-prometheus-operator keduanya dideploy di kluster ACK yang sama, DaemonSet node-exporter masing-masing bersaing untuk hostPort 9100. Hal ini mencegah salah satu set pod node-exporter untuk mulai berjalan. Untuk mengatasinya, ubah port salah satu DaemonSet node-exporter menjadi 9101.

  1. Jalankan perintah berikut untuk memastikan DaemonSet mana yang pod node-exporter-nya gagal dijadwalkan:

    kubectl get pods -A | grep node-exporter
    kubectl describe pod <pod-name> -n <namespace>
  2. Edit DaemonSet yang bermasalah:

    kubectl edit daemonset <daemonset-name> -n <namespace>
  3. Di YAML DaemonSet, temukan argumen --secure-listen-address dan ubah port dari 9100 menjadi 9101. Perbarui juga nilai containerPort dan hostPort menjadi 9101:

    args:
    - --secure-listen-address=0.0.0.0:9101
    ...
    ports:
    - containerPort: 9101
      hostPort: 9101
      name: https
  4. Simpan dan keluar. Verifikasi bahwa pod node-exporter restart dan berjalan pada port baru.

    Catatan

    Jika komponen awalnya diinstal menggunakan Helm, helm upgrade berikutnya dapat menimpa perubahan Anda. Sebelum melakukan upgrade, backup konfigurasi yang telah dimodifikasi atau kunci versi chart.

Konfigurasi ServiceMonitor untuk pemantauan kustom

Setelah mengatasi konflik port, konfigurasikan ServiceMonitor di Konsol ARMS untuk mengambil metrik dari instance node-exporter pada port baru.

  1. Masuk ke Konsol ARMS.

  2. Di panel navigasi kiri, pilih Prometheus Monitoring > Service Discovery.

  3. Klik Create ServiceMonitor. Di panel pembuatan, pilih YAML Mode.

  4. Masukkan konfigurasi ServiceMonitor yang menargetkan layanan node-exporter Anda pada port 9101. Berikut contohnya:

    apiVersion: monitoring.coreos.com/v1
    kind: ServiceMonitor
    metadata:
      name: node-exporter-custom
      namespace: <namespace>
    spec:
      endpoints:
      - port: https
        interval: 15s
        scheme: https
        tlsConfig:
          insecureSkipVerify: true
      namespaceSelector:
        matchNames:
        - <namespace>
      selector:
        matchLabels:
          app.kubernetes.io/name: node-exporter

    Ganti <namespace> dengan namespace tempat node-exporter Anda dideploy.

  5. Klik OK. ServiceMonitor berlaku dalam beberapa menit.

Langkah 2: Lihat dasbor pemantauan

  1. Masuk ke Konsol ARMS.

  2. Di panel navigasi kiri, klik Integration Management.

  3. Di halaman Integration Management, klik tab Integrated Environments, lalu pilih ECS Environment.

  4. Di daftar ECS Environment, klik nama lingkungan target untuk membuka halaman detailnya.

  5. Di tab Component Management, pada bagian Addon Type, klik Dashboard untuk melihat dasbor Grafana bawaan.

Langkah 3: Konfigurasi peringatan

  1. Masuk ke Konsol ARMS. Di panel navigasi kiri, klik Integration Management.

  2. Di halaman Integration Management, klik tab Integrated Environments, lalu pilih ECS Environment.

  3. Di daftar ECS Environment, klik nama lingkungan target untuk membuka halaman detailnya.

  4. Di tab Component Management, pada bagian Addon Type, klik Alarm Rules untuk melihat aturan peringatan bawaan.

Catatan
  • Aturan peringatan bawaan menghasilkan event tetapi tidak mengirim notifikasi. Untuk mengirim notifikasi, klik Edit untuk mengonfigurasi metode notifikasi. Anda juga dapat menyesuaikan ambang batas, durasi, dan konten. Buat aturan peringatan untuk instance Prometheus.

  • Dalam Simple Mode, Anda dapat mengatur penerima notifikasi, periode notifikasi, dan kebijakan pengulangan.

Contoh dasbor Grafana

Dasbor ECS Overview

image.png

Dasbor Detail ECS

image.png