Managed Service for Prometheus menyediakan pemantauan kontainer dalam Edisi Dasar dan Edisi Pro. Topik ini menjelaskan cara mengaktifkan Edisi Pro, model penagihannya, perbandingan fitur dengan Edisi Dasar, dasbor yang didukung, serta aturan alert bawaan.
Jenis kluster yang didukung
-
ACK Pro cluster
-
ACK Lingjun cluster
-
ACK Dedicated cluster
Prasyarat
Sebelum menggunakan Container Monitoring Edisi Pro, aktifkan Managed Service for Prometheus (ditagih berdasarkan volume data yang diingest tautan aktivasi atau berdasarkan jumlah sampel yang diingest tautan aktivasi), lalu aktifkan Container Monitoring Edisi Pro.
Penagihan Container Monitoring Edisi Pro
|
Item penagihan |
Deskripsi |
Metode penagihan |
Siklus penagihan |
|
Biaya pemantauan skala kluster |
Penggunaan OCU dihitung berdasarkan jumlah node dalam kluster Kubernetes Anda. Satu OCU setara dengan 10 node kluster. Catatan
OCU: Observability Capacity Unit (OCU) adalah unit penagihan untuk Alibaba Cloud Native Observability. Penggunaan OCU dihitung secara otomatis berdasarkan konsumsi sumber daya per jam. Harganya adalah USD 0,023 per OCU. |
Pay-as-you-go: Biaya pemantauan skala kluster harian = Jumlah total OCU per jam × harga satuan OCU Catatan
Jumlah OCU per jam = ceil(Jumlah maksimum node dalam siklus penagihan saat ini / 10) |
Siklus penagihan bersifat per jam. Setelah pukul 00.00 setiap hari, Managed Service for Prometheus menghitung biaya harian dengan menentukan jumlah node maksimum per jam pada hari sebelumnya, mengonversi masing-masing jumlah tersebut ke OCU, menjumlahkan semua OCU per jam, lalu mengalikannya dengan harga satuan OCU. |
|
Prometheus instance fee |
Untuk informasi selengkapnya, lihat Prometheus instance billing. |
||
Aktifkan Container Monitoring Edisi Pro
Metode 1: Pilih Edisi Pro saat integrasi
-
Pada halaman Integration Center, pilih Kubernetes Cluster Monitoring.
-
Pada panel Kubernetes Cluster Monitoring, pilih kluster Container Service for Kubernetes (ACK) target Anda, pilih Container Monitoring Pro Edition, lalu klik OK.
Metode 2: Upgrade ke Edisi Pro
Setelah Anda melakukan upgrade ke Container Monitoring Edisi Pro, Anda tidak dapat menurunkan spesifikasi kembali ke Edisi Dasar.
-
Pada halaman Integration Management, pilih Integrated Environments > Container Service.
-
Temukan integrasi pemantauan kontainer yang ingin Anda upgrade, lalu pada kolom Actions-nya, klik Upgrade. Pada kotak dialog konfirmasi yang muncul, klik OK.
Periksa keberadaan agen collector tak terkelola yang tersisa setelah upgrade
Container Monitoring Edisi Dasar men-deploy agen collector tak terkelola, yaitu Deployment arms-prometheus-ack-arms-prometheus, di kluster Anda. Setelah Anda melakukan upgrade ke Edisi Pro, Deployment ini dapat tetap berada di kluster. Jika demikian, Deployment tersebut mengumpulkan metrik seperti metrik GPU secara paralel dengan agen collector terkelola. Akibatnya, satu metrik akan muncul sebagai dua deret waktu yang hanya berbeda pada label job, sehingga data pemantauan Anda menjadi dua kali lipat.
Untuk mendeteksi dan menghapus agen collector tak terkelola yang tersisa, lakukan langkah-langkah berikut:
-
Periksa apakah agen collector tak terkelola masih ada di namespace
arms-prom:kubectl -n arms-prom get deployments.appsJika output mencantumkan
arms-prometheus-ack-arms-prometheus, berarti agen collector tak terkelola tersebut masih berjalan. -
Verifikasi pengumpulan ganda menggunakan PromQL. Pada halaman kueri metrik instans Prometheus Anda atau di Grafana, jalankan kueri berikut. Metrik total framebuffer GPU digunakan sebagai contoh:
count(DCGM_CUSTOM_DEV_FB_TOTAL)Hasil lebih besar dari 1 berarti metrik tersebut memiliki beberapa deret waktu, yang mengindikasikan adanya pengumpulan ganda. Untuk memastikan, periksa bahwa deret tersebut melaporkan nilai yang sama tetapi memiliki label
jobyang berbeda. Misalnya,job=gpu-exporteradalah agen collector terkelola, sedangkanjob=node-gpu-exporteradalah jalur pengumpulan agen collector tak terkelola. Anda dapat memverifikasi metrik GPU lainnya, sepertiDCGM_FI_DEV_GPU_UTIL, dengan cara yang sama. -
Ubah skala agen collector tak terkelola yang tersisa menjadi nol replika:
kubectl -n arms-prom scale deployment arms-prometheus-ack-arms-prometheus --replicas=0 -
Tunggu sekitar 5 menit hingga jendela kedaluwarsa metrik berlalu, lalu jalankan kembali kueri
count. Pastikan kueri mengembalikan hasil 1 dan hanya deret waktu dari agen collector terkelola yang tersisa. Setelah data pemantauan kembali normal, hapus Deployment tersebut:kubectl -n arms-prom delete deployment arms-prometheus-ack-arms-prometheus
Perbandingan Edisi Dasar vs. Edisi Pro
|
Kategori |
Edisi Dasar |
Edisi Pro |
|
Retensi metrik untuk metrik dasar kluster kontainer |
7 hari |
90 hari |
|
Prometheus collector |
Men-deploy agen dalam kluster yang Anda kelola. Agen ini mengonsumsi sumber daya kluster (3 core CPU dan 4 GB memori per replika secara default). |
Menggunakan agen collector terkelola penuh yang menghilangkan biaya sumber daya pada kluster Anda dan menyediakan SLA tingkat produksi 99,95%. |
|
Dashboards |
Dashboards bawaan dasar. |
Set lengkap dashboards bawaan yang komprehensif. |
|
Sinkronisasi otomatis |
Didukung. Anda dapat mendefinisikan resource |
Tidak didukung. Edisi Pro adalah layanan terkelola penuh yang agen collectornya dikelola oleh Alibaba Cloud, sehingga Anda tidak dapat memodifikasi parameter komponen dasarnya. Anda dapat mengelola aturan alert pada halaman aturan alert Prometheus di Konsol, yang mendukung dua jenis deteksi: ambang batas statis dan PromQL kustom. |
Dashboards yang didukung di Container Monitoring Edisi Pro
|
Tipe |
Dashboard |
|
Ikhtisar pemantauan |
Ikhtisar pemantauan kluster |
|
Dashboard Namespace kluster |
|
|
Komponen inti kluster |
ACK Pro API server |
|
ACK Pro ETCD |
|
|
ACK Pro Scheduler |
|
|
ACK Pro Cloud Controller Manager |
|
|
ACK Pro Kube Controller Manager |
|
|
Pemantauan node |
Ikhtisar pool node |
|
Detail pemantauan node kluster |
|
|
Pemantauan aplikasi |
Pemantauan Deployment |
|
Pemantauan StatefulSet |
|
|
Pemantauan DaemonSet |
|
|
Pemantauan Pod kluster |
|
|
Pemantauan jaringan |
Pemantauan komponen CoreDNS |
|
Pemantauan traffic Ingress kluster |
|
|
Pemantauan penyimpanan |
Pemantauan komponen penyimpanan CSI (tingkat kluster) |
|
Pemantauan komponen penyimpanan CSI (tingkat node) |
|
|
Pemantauan IO Pod (tingkat Pod) |
|
|
Pemantauan IO penyimpanan frontend (tingkat kluster) |
|
|
Pemantauan GPU |
Pemantauan GPU kluster (tingkat kluster) |
|
Pemantauan GPU kluster (tingkat node) |
|
|
Pemantauan GPU kluster (berdasarkan Pod aplikasi) |
|
|
Analisis biaya/Optimasi sumber daya |
Profil sumber daya |
|
Lainnya |
Pemantauan IO penyimpanan backend (tingkat kluster) |
|
k8s-reclaimed-resource |
|
|
Pemantauan mandiri Prometheus kluster |
|
|
Ikhtisar virtual node (ECI) |
Aturan alert bawaan
|
Nama aturan alert |
Kelompok alert |
Template |
|
Node CPU usage greater than 75% |
node |
Penggunaan CPU Node {{ $labels.instance }} lebih besar dari 75%. Penggunaan saat ini: {{ printf "%.2f" $value }}% |
|
Node CPU usage greater than 85% |
node |
Penggunaan CPU Node {{ $labels.instance }} lebih besar dari 85%. Penggunaan saat ini: {{ printf "%.2f" $value }}% |
|
Node memory usage greater than 75% |
node |
Penggunaan memori Node {{ $labels.instance }} lebih besar dari 75%. Penggunaan saat ini: {{ printf "%.2f" $value }}% |
|
Node memory usage greater than 85% |
node |
Penggunaan memori Node {{ $labels.instance }} lebih besar dari 85%. Penggunaan saat ini: {{ printf "%.2f" $value }}% |
|
Node anomalies |
node |
Node {{$labels.node}} telah tidak tersedia selama lebih dari 10 menit. |
|
Disk usage greater than 95% |
node |
Penggunaan disk {{ $labels.device }} pada Node {{ $labels.instance }} telah melebihi 95%. Penggunaan saat ini: {{ printf "%.2f" $value }}% |
|
Deployment Pod availability less than 50% |
workload |
Namespace: {{$labels.namespace}} / Deployment: {{$labels.deployment}} ketersediaan Pod kurang dari 50%. Jumlah Pod yang tidak tersedia saat ini: {{ $value }} |
|
Job execution failed |
workload |
Namespace: {{$labels.namespace}}/Job: {{$labels.job_name}} gagal dieksekusi. |
|
Pod startup timeout |
workload |
Namespace: {{$labels.namespace}}/Pod: {{$labels.pod_name}} gagal memulai selama lebih dari 15 menit. Alasan menunggu: {{$labels.reason}} |
|
Pod status abnormal |
workload |
Namespace: {{$labels.namespace}}/Pod: {{$labels.pod_name}} telah berada dalam status {{$labels.phase}} selama lebih dari 10 menit. |
|
Frequent Pod restarts |
workload |
Namespace: {{$labels.namespace}}/Pod: {{$labels.pod_name}} telah melakukan restart lebih dari {{ $labels.metrics_params_value}} kali dalam {{$labels.metrics_params_time}} menit terakhir. Jumlah restart saat ini: {{ $value }} |
|
Container CPU usage exceeds 85% |
workload |
Di Namespace {{$labels.namespace}}, penggunaan CPU kontainer {{$labels.container}} pada Pod {{$labels.pod_name}} melebihi 85%. Penggunaan saat ini: {{ printf "%.2f" $value }}% |
|
Container CPU usage exceeds 75% |
workload |
Di Namespace {{$labels.namespace}}, penggunaan CPU kontainer {{$labels.container}} pada Pod {{$labels.pod_name}} melebihi 75%. Penggunaan saat ini: {{ printf "%.2f" $value }}% |
|
Container memory usage exceeds 75% |
workload |
Di Namespace {{$labels.namespace}}, penggunaan memori kontainer {{$labels.container}} pada Pod {{$labels.pod_name}} melebihi 75%. Penggunaan saat ini: {{ printf "%.2f" $value }}% |
|
Container memory usage exceeds 85% |
workload |
Di Namespace {{$labels.namespace}}, penggunaan memori kontainer {{$labels.container}} pada Pod {{$labels.pod_name}} melebihi 85%. Penggunaan saat ini: {{ printf "%.2f" $value }}% |