All Products
Search
Document Center

Application Real-Time Monitoring Service:Gunakan Container Monitoring Edisi Pro

Last Updated:Aug 18, 2026

Managed Service for Prometheus menyediakan pemantauan kontainer dalam Edisi Dasar dan Edisi Pro. Topik ini menjelaskan cara mengaktifkan Edisi Pro, model penagihannya, perbandingan fitur dengan Edisi Dasar, dasbor yang didukung, serta aturan alert bawaan.

Jenis kluster yang didukung

  • ACK Pro cluster

  • ACK Lingjun cluster

  • ACK Dedicated cluster

Prasyarat

Sebelum menggunakan Container Monitoring Edisi Pro, aktifkan Managed Service for Prometheus (ditagih berdasarkan volume data yang diingest tautan aktivasi atau berdasarkan jumlah sampel yang diingest tautan aktivasi), lalu aktifkan Container Monitoring Edisi Pro.

Penagihan Container Monitoring Edisi Pro

Item penagihan

Deskripsi

Metode penagihan

Siklus penagihan

Biaya pemantauan skala kluster

Penggunaan OCU dihitung berdasarkan jumlah node dalam kluster Kubernetes Anda. Satu OCU setara dengan 10 node kluster.

Catatan

OCU: Observability Capacity Unit (OCU) adalah unit penagihan untuk Alibaba Cloud Native Observability. Penggunaan OCU dihitung secara otomatis berdasarkan konsumsi sumber daya per jam. Harganya adalah USD 0,023 per OCU.

Pay-as-you-go: Biaya pemantauan skala kluster harian = Jumlah total OCU per jam × harga satuan OCU

Catatan

Jumlah OCU per jam = ceil(Jumlah maksimum node dalam siklus penagihan saat ini / 10)

Siklus penagihan bersifat per jam. Setelah pukul 00.00 setiap hari, Managed Service for Prometheus menghitung biaya harian dengan menentukan jumlah node maksimum per jam pada hari sebelumnya, mengonversi masing-masing jumlah tersebut ke OCU, menjumlahkan semua OCU per jam, lalu mengalikannya dengan harga satuan OCU.

Prometheus instance fee

Untuk informasi selengkapnya, lihat Prometheus instance billing.

Aktifkan Container Monitoring Edisi Pro

Metode 1: Pilih Edisi Pro saat integrasi

  1. Pada halaman Integration Center, pilih Kubernetes Cluster Monitoring.

  2. Pada panel Kubernetes Cluster Monitoring, pilih kluster Container Service for Kubernetes (ACK) target Anda, pilih Container Monitoring Pro Edition, lalu klik OK.

Metode 2: Upgrade ke Edisi Pro

Penting

Setelah Anda melakukan upgrade ke Container Monitoring Edisi Pro, Anda tidak dapat menurunkan spesifikasi kembali ke Edisi Dasar.

  1. Pada halaman Integration Management, pilih Integrated Environments > Container Service.

  2. Temukan integrasi pemantauan kontainer yang ingin Anda upgrade, lalu pada kolom Actions-nya, klik Upgrade. Pada kotak dialog konfirmasi yang muncul, klik OK.

Periksa keberadaan agen collector tak terkelola yang tersisa setelah upgrade

Container Monitoring Edisi Dasar men-deploy agen collector tak terkelola, yaitu Deployment arms-prometheus-ack-arms-prometheus, di kluster Anda. Setelah Anda melakukan upgrade ke Edisi Pro, Deployment ini dapat tetap berada di kluster. Jika demikian, Deployment tersebut mengumpulkan metrik seperti metrik GPU secara paralel dengan agen collector terkelola. Akibatnya, satu metrik akan muncul sebagai dua deret waktu yang hanya berbeda pada label job, sehingga data pemantauan Anda menjadi dua kali lipat.

Untuk mendeteksi dan menghapus agen collector tak terkelola yang tersisa, lakukan langkah-langkah berikut:

  1. Periksa apakah agen collector tak terkelola masih ada di namespace arms-prom:

    kubectl -n arms-prom get deployments.apps

    Jika output mencantumkan arms-prometheus-ack-arms-prometheus, berarti agen collector tak terkelola tersebut masih berjalan.

  2. Verifikasi pengumpulan ganda menggunakan PromQL. Pada halaman kueri metrik instans Prometheus Anda atau di Grafana, jalankan kueri berikut. Metrik total framebuffer GPU digunakan sebagai contoh:

    count(DCGM_CUSTOM_DEV_FB_TOTAL)

    Hasil lebih besar dari 1 berarti metrik tersebut memiliki beberapa deret waktu, yang mengindikasikan adanya pengumpulan ganda. Untuk memastikan, periksa bahwa deret tersebut melaporkan nilai yang sama tetapi memiliki label job yang berbeda. Misalnya, job=gpu-exporter adalah agen collector terkelola, sedangkan job=node-gpu-exporter adalah jalur pengumpulan agen collector tak terkelola. Anda dapat memverifikasi metrik GPU lainnya, seperti DCGM_FI_DEV_GPU_UTIL, dengan cara yang sama.

  3. Ubah skala agen collector tak terkelola yang tersisa menjadi nol replika:

    kubectl -n arms-prom scale deployment arms-prometheus-ack-arms-prometheus --replicas=0
  4. Tunggu sekitar 5 menit hingga jendela kedaluwarsa metrik berlalu, lalu jalankan kembali kueri count. Pastikan kueri mengembalikan hasil 1 dan hanya deret waktu dari agen collector terkelola yang tersisa. Setelah data pemantauan kembali normal, hapus Deployment tersebut:

    kubectl -n arms-prom delete deployment arms-prometheus-ack-arms-prometheus

Perbandingan Edisi Dasar vs. Edisi Pro

Kategori

Edisi Dasar

Edisi Pro

Retensi metrik untuk metrik dasar kluster kontainer

7 hari

90 hari

Prometheus collector

Men-deploy agen dalam kluster yang Anda kelola. Agen ini mengonsumsi sumber daya kluster (3 core CPU dan 4 GB memori per replika secara default).

Menggunakan agen collector terkelola penuh yang menghilangkan biaya sumber daya pada kluster Anda dan menyediakan SLA tingkat produksi 99,95%.

Dashboards

Dashboards bawaan dasar.

Set lengkap dashboards bawaan yang komprehensif.

Sinkronisasi otomatis PrometheusRule

Didukung. Anda dapat mendefinisikan resource PrometheusRule menggunakan CRDs untuk mengaktifkan pemindaian dan sinkronisasi otomatis.

Tidak didukung. Edisi Pro adalah layanan terkelola penuh yang agen collectornya dikelola oleh Alibaba Cloud, sehingga Anda tidak dapat memodifikasi parameter komponen dasarnya. Anda dapat mengelola aturan alert pada halaman aturan alert Prometheus di Konsol, yang mendukung dua jenis deteksi: ambang batas statis dan PromQL kustom.

Dashboards yang didukung di Container Monitoring Edisi Pro

Tipe

Dashboard

Ikhtisar pemantauan

Ikhtisar pemantauan kluster

Dashboard Namespace kluster

Komponen inti kluster

ACK Pro API server

ACK Pro ETCD

ACK Pro Scheduler

ACK Pro Cloud Controller Manager

ACK Pro Kube Controller Manager

Pemantauan node

Ikhtisar pool node

Detail pemantauan node kluster

Pemantauan aplikasi

Pemantauan Deployment

Pemantauan StatefulSet

Pemantauan DaemonSet

Pemantauan Pod kluster

Pemantauan jaringan

Pemantauan komponen CoreDNS

Pemantauan traffic Ingress kluster

Pemantauan penyimpanan

Pemantauan komponen penyimpanan CSI (tingkat kluster)

Pemantauan komponen penyimpanan CSI (tingkat node)

Pemantauan IO Pod (tingkat Pod)

Pemantauan IO penyimpanan frontend (tingkat kluster)

Pemantauan GPU

Pemantauan GPU kluster (tingkat kluster)

Pemantauan GPU kluster (tingkat node)

Pemantauan GPU kluster (berdasarkan Pod aplikasi)

Analisis biaya/Optimasi sumber daya

Profil sumber daya

Lainnya

Pemantauan IO penyimpanan backend (tingkat kluster)

k8s-reclaimed-resource

Pemantauan mandiri Prometheus kluster

Ikhtisar virtual node (ECI)

Aturan alert bawaan

Nama aturan alert

Kelompok alert

Template

Node CPU usage greater than 75%

node

Penggunaan CPU Node {{ $labels.instance }} lebih besar dari 75%. Penggunaan saat ini: {{ printf "%.2f" $value }}%

Node CPU usage greater than 85%

node

Penggunaan CPU Node {{ $labels.instance }} lebih besar dari 85%. Penggunaan saat ini: {{ printf "%.2f" $value }}%

Node memory usage greater than 75%

node

Penggunaan memori Node {{ $labels.instance }} lebih besar dari 75%. Penggunaan saat ini: {{ printf "%.2f" $value }}%

Node memory usage greater than 85%

node

Penggunaan memori Node {{ $labels.instance }} lebih besar dari 85%. Penggunaan saat ini: {{ printf "%.2f" $value }}%

Node anomalies

node

Node {{$labels.node}} telah tidak tersedia selama lebih dari 10 menit.

Disk usage greater than 95%

node

Penggunaan disk {{ $labels.device }} pada Node {{ $labels.instance }} telah melebihi 95%. Penggunaan saat ini: {{ printf "%.2f" $value }}%

Deployment Pod availability less than 50%

workload

Namespace: {{$labels.namespace}} / Deployment: {{$labels.deployment}} ketersediaan Pod kurang dari 50%. Jumlah Pod yang tidak tersedia saat ini: {{ $value }}

Job execution failed

workload

Namespace: {{$labels.namespace}}/Job: {{$labels.job_name}} gagal dieksekusi.

Pod startup timeout

workload

Namespace: {{$labels.namespace}}/Pod: {{$labels.pod_name}} gagal memulai selama lebih dari 15 menit. Alasan menunggu: {{$labels.reason}}

Pod status abnormal

workload

Namespace: {{$labels.namespace}}/Pod: {{$labels.pod_name}} telah berada dalam status {{$labels.phase}} selama lebih dari 10 menit.

Frequent Pod restarts

workload

Namespace: {{$labels.namespace}}/Pod: {{$labels.pod_name}} telah melakukan restart lebih dari {{ $labels.metrics_params_value}} kali dalam {{$labels.metrics_params_time}} menit terakhir. Jumlah restart saat ini: {{ $value }}

Container CPU usage exceeds 85%

workload

Di Namespace {{$labels.namespace}}, penggunaan CPU kontainer {{$labels.container}} pada Pod {{$labels.pod_name}} melebihi 85%. Penggunaan saat ini: {{ printf "%.2f" $value }}%

Container CPU usage exceeds 75%

workload

Di Namespace {{$labels.namespace}}, penggunaan CPU kontainer {{$labels.container}} pada Pod {{$labels.pod_name}} melebihi 75%. Penggunaan saat ini: {{ printf "%.2f" $value }}%

Container memory usage exceeds 75%

workload

Di Namespace {{$labels.namespace}}, penggunaan memori kontainer {{$labels.container}} pada Pod {{$labels.pod_name}} melebihi 75%. Penggunaan saat ini: {{ printf "%.2f" $value }}%

Container memory usage exceeds 85%

workload

Di Namespace {{$labels.namespace}}, penggunaan memori kontainer {{$labels.container}} pada Pod {{$labels.pod_name}} melebihi 85%. Penggunaan saat ini: {{ printf "%.2f" $value }}%