Gunakan CloudMonitor untuk memantau resource ApsaraMQ for Kafka — instans, topik, dan kelompok konsumen — secara real time serta menerima peringatan ketika metrik melebihi ambang batas.
Metrik
-
Data metrik diagregasi dalam periode 1 menit. Nilai yang dilaporkan per detik, seperti byte per detik (B/s), merepresentasikan nilai rata-rata selama menit sebelumnya.
-
Data metrik memiliki latensi 1 menit.
-
Metrik ini termasuk dalam namespace CloudMonitor
acs_kafka(ProductCategory:kafka). Anda memerlukan identifier ini untuk mengkueri metrik menggunakan API atau SDK CloudMonitor. -
Metrik dengan akhiran V2 pada ID metrik, seperti
InstanceCpuUsageV2, khusus untuk instans terjadwal V2. -
Metrik terkait konsumsi bergantung pada commit offset. Metrik seperti jumlah pesan yang belum dikonsumsi dihitung berdasarkan offset konsumen yang dikomit oleh klien. Jika klien tidak melakukan commit offset dengan benar (misalnya, autocommit tidak diaktifkan atau commit manual tidak dikonfigurasi), data pemantauan tidak dapat mencerminkan status konsumsi aktual secara akurat, yang dapat menyebabkan peringatan palsu. Pastikan klien Anda dikonfigurasi dengan mekanisme commit offset yang tepat.
-
Untuk menentukan apakah throttling sisi server telah terjadi, pantau metrik Instance Produce Throttle Queue Size (
InstanceProduceThrottleQueueSizeV2) atau Instance Consume Throttle Queue Size (InstanceFetchThrottleQueueSizeV2). Throttling dianggap terjadi hanya ketika metrik ini melaporkan nilai bukan nol. Kelebihan trafik kecil biasanya memiliki buffer elastis dan tidak langsung memicu throttling. -
Production Traffic Ratio (
InstanceMessageInputRatioV2) dan Consumption Traffic Ratio (InstanceMessageOutputRatioV2) mencerminkan pemanfaatan trafik tingkat node. Karena Kafka secara default menggunakan 3 replika dengan kapasitas throughput yang merata, ketimpangan trafik — seperti pengiriman batch periodik yang menyebabkan trafik burst — dapat menyebabkan trafik tingkat detik pada satu node melebihi batas sesaat, meskipun laju rata-rata instans belum mencapai ambang batas yang dikonfigurasi. Grafik pemantauan menampilkan data yang telah dirata-ratakan per menit, sedangkan throttling aktual dipicu berdasarkan pemantauan tingkat detik. Kedua nilai ini dapat berbeda signifikan selama lonjakan trafik.
ApsaraMQ for Kafka mendukung metrik berikut:
Untuk skenario pemantauan umum, mulailah dengan metrik berikut:
-
Peringatan penyimpanan: Pantau
instance_disk_capacity(persentase penggunaan disk) dan atur ambang batas peringatan pada 85%. -
Deteksi keterlambatan konsumen: Pantau
message_accumulation(akumulasi pesan kelompok konsumen) untuk mendeteksi konsumen yang lambat atau terhenti. -
Perencanaan kapasitas: Pantau
InstanceMessageInputRatioV2(trafik inbound sebagai persentase spesifikasi instans) danPartitionInstanceRatioV2(jumlah partisi sebagai persentase spesifikasi instans) untuk merencanakan peningkatan instans.
Metrik tingkat instans
|
Nama metrik |
ID metrik |
Dimensi |
Unit |
|
Penggunaan disk instans |
instance_disk_capacity |
instanceId |
% |
|
Bandwidth inbound publik instans |
instance_internet_rx.rate |
instanceId |
bit/s |
|
Bandwidth outbound publik instans |
instance_internet_tx.rate |
instanceId |
bit/s |
|
Lalu Lintas Masuk Instance |
instance_message_input |
instanceId |
B/s |
|
Pesan yang dikirim ke Instans |
instance_message_num_input |
instanceId |
count/s |
|
Lalu Lintas Keluar Instance |
instance_message_output |
instanceId |
B/s |
|
Permintaan pengiriman pesan ke instans |
instance_reqs_input |
instanceId |
count/s |
|
Permintaan konsumsi pesan dari instans |
instance_reqs_output |
instanceId |
count/s |
|
Ukuran batch instans TP50 (persentil ke-50) |
InstanceBatchSizeTP50V2 |
instanceId |
Bytes |
|
Ukuran batch instans TP999 (persentil ke-99,9) |
InstanceBatchSizeTP999V2 |
instanceId |
Bytes |
|
Penggunaan CPU instans |
InstanceCpuUsageV2 |
instanceId |
% |
|
Ukuran antrian pengendalian aliran untuk pengambilan instance |
InstanceFetchThrottleQueueSizeV2 |
instanceId |
count |
|
Event High Availability (HA) Instance |
InstanceHAEventV2 |
instanceId |
count |
|
Bandwidth inbound publik instans (per-node) |
InstanceInternetRxRateByNode |
instanceId, nodeIp |
bit/s |
|
Pemanfaatan bandwidth inbound publik instans (per-node) |
InstanceInternetRxUtilizationByNode |
instanceId, nodeIp |
% |
|
Bandwidth outbound publik instans (per-node) |
InstanceInternetTxRateByNode |
instanceId, nodeIp |
bit/s |
|
Pemanfaatan bandwidth outbound publik instans (per-node) |
InstanceInternetTxUtilizationByNode |
instanceId, nodeIp |
% |
|
Jumlah koneksi maksimum instans |
InstanceMaxConnection |
instanceId |
count |
|
Jumlah koneksi Internet maksimum instans |
InstanceMaxInternetConnection |
instanceId |
count |
|
Jumlah operasi input/output per detik (IOPS) baca maksimum instans |
InstanceMaxReadIOPSV2 |
instanceId |
count/s |
|
IOPS tulis maksimum instans |
InstanceMaxWriteIOPSV2 |
instanceId |
count/s |
|
Trafik inbound sebagai persentase spesifikasi instans |
InstanceMessageInputRatioV2 |
instanceId |
% |
|
Trafik outbound sebagai persentase spesifikasi instans |
InstanceMessageOutputRatioV2 |
instanceId |
% |
|
Ukuran antrian throttle produce instans |
InstanceProduceThrottleQueueSizeV2 |
instanceId |
count |
|
Waktu rebalance instans |
InstanceRebalanceTimeV2 |
instanceId |
ms |
|
Total koneksi instans |
InstanceTotalConnection |
instanceId |
count |
|
Total koneksi Internet instans |
InstanceTotalInternetConnection |
instanceId |
count |
|
Jumlah partisi sebagai persentase spesifikasi instans |
PartitionInstanceRatioV2 |
instanceId |
% |
Metrik tingkat kelompok konsumen
|
Nama metrik |
ID metrik |
Dimensi |
Unit |
|
Output pesan kelompok konsumen |
group_message_num_output |
instanceId, consumerGroup |
count/s |
|
Output pesan kelompok konsumen untuk suatu topik |
group_message_num_output_onetopic |
instanceId, consumerGroup, topic |
count/s |
|
Latensi konsumsi kelompok konsumen |
group_topic_accumulation_consume_cost_time |
instanceId, consumerGroup |
ms |
|
Akumulasi pesan kelompok konsumen |
message_accumulation |
instanceId, consumerGroup |
count |
|
Akumulasi pesan kelompok konsumen untuk suatu topik |
message_accumulation_onetopic |
instanceId, consumerGroup, topic |
count |
Metrik tingkat topik
|
Nama metrik |
ID metrik |
Dimensi |
Unit |
|
Trafik inbound topik |
topic_message_input |
instanceId, topic |
B/s |
|
Pesan yang diproduksi ke suatu topik |
topic_message_num_input |
instanceId, topic |
count/s |
|
Trafik outbound topik |
topic_message_output |
instanceId, topic |
B/s |
|
Rasio trafik konsumsi terhadap produksi topik |
topic_message_output_input_ratio |
instanceId, topic |
% |
|
Permintaan pengiriman pesan topik |
topic_reqs_input |
instanceId, topic |
count/s |
|
Permintaan konsumsi pesan topik |
topic_reqs_output |
instanceId, topic |
count/s |
Penagihan
Fitur CloudMonitor untuk ApsaraMQ for Kafka tidak dikenai biaya.
Prasyarat
Diperlukan peran terkait layanan.
-
Nama peran: AliyunServiceRoleForAlikafka
-
Nama kebijakan: AliyunServiceRolePolicyForAlikafka
-
Izin: Memberikan izin kepada ApsaraMQ for Kafka untuk mengakses layanan lain milik Anda, seperti CloudMonitor dan Application Real-Time Monitoring Service (ARMS), guna fitur pemantauan.
-
Untuk informasi lebih lanjut, lihat Peran terkait layanan.
Lihat data pemantauan
-
Login ke Konsol ApsaraMQ for Kafka.
Pada halaman Overview, pilih wilayah di bagian Resource Distribution.
Pada halaman Instances, klik nama instans target.
-
Di panel navigasi kiri, pilih .
-
Pada halaman CloudMonitor, klik tab Alert Rule. Pilih tab untuk resource yang ingin dipantau, temukan resource tersebut, lalu klik View CloudMonitor Metrics di kolom Actions. Atur rentang waktu untuk melihat data pemantauan.
Grafik untuk semua metrik resource saat ini akan muncul secara otomatis.
Atur aturan peringatan
-
Pada halaman CloudMonitor, klik tab Alert Rule, lalu pilih tab Instance, Topic, atau Group.
Tindakan ini akan mengarahkan Anda ke panel Create Alert Rule di Konsol CloudMonitor.
-
Di panel Create Alert Rule, konfigurasikan aturan dan informasi notifikasi, lalu klik OK. Untuk informasi lebih lanjut tentang parameter, lihat Buat aturan peringatan.
-
Setelah Anda mengklik OK, aturan peringatan akan muncul di tab Alert Rule. Pastikan status aturan adalah Enabled.
Contoh: Konfigurasikan peringatan akumulasi pesan Group dengan notifikasi robot DingTalk
Sebelum mengonfigurasi peringatan, login ke Konsol Cloud Monitor dan tambahkan robot DingTalk sebagai kontak peringatan atau grup kontak. URL webhook robot DingTalk harus didaftarkan terlebih dahulu.
-
Login ke Konsol ApsaraMQ for Kafka.
-
Klik tab Alert Rule.
-
Klik tab resource Group.
-
Temukan Group yang ingin dikonfigurasi peringatannya, lalu klik Create Alert Rule di kolom Actions. Halaman akan dialihkan ke panel Create Alert Rule di Konsol Cloud Monitor.
-
Di panel Create Alert Rule, konfigurasikan pengaturan berikut:
-
Metrik: Pilih metrik akumulasi pesan
MessageAccumulationV3(Total Backlog Pesan Group). -
Kondisi peringatan: Atur nilai ambang batas dan jumlah periode berturut-turut yang harus memicu kondisi sebelum peringatan dikirim.
-
Metode notifikasi: Di bawah kontak notifikasi, pilih grup kontak robot DingTalk yang telah Anda konfigurasi sebagai prasyarat.
-
-
Klik OK untuk menyimpan aturan peringatan.
Setelah aturan dibuat, tab Alert Rule menampilkan aturan baru dengan status Enabled. Ketika akumulasi pesan Group melebihi ambang batas yang dikonfigurasi, Cloud Monitor mengirimkan notifikasi ke robot DingTalk yang ditentukan.
Lihat informasi peringatan
-
Pada halaman CloudMonitor, klik tab Alert Rule. Kemudian, pilih tab untuk resource yang ingin dilihat informasi peringatannya, seperti Instance, Topic, atau Group.
-
Temukan resource tersebut dan klik Alert Rule di kolom Actions.
-
Di panel Associated Alert Rules, temukan aturan peringatan target dan klik Details di kolom Actions untuk melihat konfigurasi aturan dan riwayat peringatan. Anda juga dapat mengaktifkan, menonaktifkan, atau menghapus aturan dari halaman ini.
FAQ
Apakah Cloud Monitor mendukung statistik CPU, memori, dan volume tulis harian?
-
Pemantauan CPU dan memori: ApsaraMQ for Kafka tidak secara langsung mengekspos metrik pemantauan CPU dan memori melalui Cloud Monitor. Untuk memantau pemanfaatan resource sistem, rujuk solusi pemantauan Prometheus yang dijelaskan dalam topik Prometheus monitoring.
-
Volume tulis harian: Cloud Monitor tidak menyediakan tampilan khusus untuk volume tulis harian. Anda dapat memperkirakan volume tulis harian dengan metode berikut:
-
Konsol: Di halaman detail instans, buka Topic Management dan lihat throughput tulis (B/s) di informasi pemantauan untuk topik target. Atau, di halaman Cloud Monitor, lihat metrik Instance Actual Inbound Traffic (
instance_message_input, unit: B/s) atau Instance Message Production Count (instance_message_num_input, unit: count/s), lalu kalikan dengan jumlah detik dalam sehari untuk memperkirakan volume harian. -
Pemantauan Prometheus: Kueri metrik tingkat instans
instance_message_input(byte/s) daninstance_message_num_input(pesan/s) untuk mendapatkan data trafik inbound berkelanjutan. -
Kueri API: Gunakan API QueryMessage untuk mengkueri selisih offset berdasarkan timestamp, yang memungkinkan Anda menghitung jumlah pesan yang diproduksi secara tepat dalam rentang waktu tertentu.
-
Referensi
-
Untuk pemantauan Prometheus, lihat Prometheus monitoring.
-
Untuk FAQ pemantauan dan peringatan, lihat Monitoring and alerting FAQ.
Jika metrik tidak ditampilkan, pastikan peran terkait layanan AliyunServiceRoleForAlikafka telah dibuat dan instans sedang berjalan.