Hologres terintegrasi dengan fitur Pemantauan Layanan Cloud dari CloudMonitor, memberikan visibilitas lengkap terhadap pemanfaatan sumber daya, status operasional, dan kesehatan instans Anda. Integrasi ini memungkinkan Anda menerima peringatan tepat waktu atas anomali dan merespons dengan cepat untuk memastikan aplikasi berjalan lancar. Topik ini menjelaskan cara menggunakan CloudMonitor untuk memantau metrik instans Hologres dan mengonfigurasi aturan peringatan.
Prasyarat
Anda telah membeli instans Hologres.
Rekomendasi
CloudMonitor kini mendukung penampilan metrik berdasarkan tipe instans Hologres, termasuk Hologres follower instance, Hologres acceleration instance, Hologres standard instance, dan Hologres warehouse instance. Tipe instans yang berbeda memiliki metrik khusus untuk membantu Anda memantau dan menangani eksepsi bisnis secara lebih baik. Kami merekomendasikan Anda beralih ke pemantauan berdasarkan tipe instans tertentu guna pengalaman pemantauan yang lebih optimal. Di halaman Hologres pada Konsol CloudMonitor, tersedia pemilih wilayah di bagian atas. Bilah tab memungkinkan Anda beralih antar tampilan pemantauan untuk tipe instans yang berbeda, termasuk Hologres follower instance, Hologres acceleration instance, Hologres standard instance, dan Hologres warehouse instance. Anda dapat mengklik Create Alert Rule atau View Alert Rules untuk mengelola peringatan.
Metrik CloudMonitor
Untuk informasi lebih lanjut mengenai metrik instans Hologres yang didukung oleh CloudMonitor, lihat Metrik di Konsol Hologres.
Lihat metrik
Anda dapat melihat metrik di Konsol CloudMonitor.
-
Login ke Konsol CloudMonitor.
-
Di panel navigasi sebelah kiri, klik Cloud Service Monitoring.
-
Di bagian Big Data, klik jenis instans target—seperti Hologres follower instance, Hologres acceleration instance, Hologres standard instance, atau Hologres warehouse instance—untuk membuka dasbor pemantauan Hologres.
-
Klik ikon
di samping wilayah dan pilih wilayah Anda. -
Klik Instance ID atau klik Monitoring Chart di kolom Actions untuk melihat metrik instans.
CatatanAnda dapat menentukan rentang waktu untuk melihat metrik instans. Data pemantauan disimpan hingga 30 hari.
Praktik pemantauan dan peringatan
Initiative alert
Anda dapat mengaktifkan fitur initiative alert di CloudMonitor untuk menetapkan aturan peringatan default untuk semua instans Anda. Setelah fitur ini diaktifkan, aturan peringatan dibuat untuk metrik seperti penggunaan CPU, penggunaan disk, penggunaan memori, dan jumlah koneksi. Aturan ini berlaku untuk semua instans Hologres di bawah Akun Alibaba Cloud Anda (akun utama) dan membantu Anda mengidentifikasi masalah dengan cepat berdasarkan metrik penting. Aturan peringatan default dijelaskan sebagai berikut:
-
Jika rata-rata penggunaan koneksi (Info) lebih besar dari atau sama dengan 95% selama tiga siklus berturut-turut, CloudMonitor mengirim notifikasi ke alert contact group.
-
Jika rata-rata penggunaan penyimpanan (Warn) lebih besar dari 90% selama tiga siklus berturut-turut, CloudMonitor mengirim notifikasi ke alert contact group.
-
Jika rata-rata penggunaan memori (Warn) lebih besar dari atau sama dengan 90% selama tiga siklus berturut-turut, CloudMonitor mengirim notifikasi ke alert contact group.
-
Jika rata-rata penggunaan CPU (Info) lebih besar dari atau sama dengan 99% selama tiga siklus berturut-turut, CloudMonitor mengirim notifikasi ke alert contact group.
Secara default, siklus peringatan adalah 5 menit. Anda dapat menyesuaikan pengaturan ini.
Buat aturan peringatan
Selain aturan peringatan initiative alert default, Anda dapat membuat aturan peringatan untuk metrik lain sesuai kebutuhan bisnis Anda. Ikuti langkah-langkah berikut untuk membuat aturan peringatan:
-
Login ke Konsol CloudMonitor.
-
Di panel navigasi sebelah kiri, pilih .
-
Di halaman Alert Rule, klik Create Alert Rules dan konfigurasikan informasi peringatan sesuai petunjuk. Untuk informasi lebih lanjut, lihat Buat aturan peringatan.
Praktik terbaik pengaturan peringatan
Instance CPU usage (%)
Metrik ini membantu menentukan apakah sumber daya Hologres Anda mengalami bottleneck atau telah dimanfaatkan sepenuhnya. Aturan peringatan yang direkomendasikan:
-
Aturan peringatan:
-
Critical: Picu peringatan jika penggunaan CPU instans mencapai 99% atau lebih selama 60 periode 1 menit berturut-turut. Hal ini membantu Anda memantau tingkat sumber daya kluster. Jika penggunaan tetap tinggi secara konsisten, Anda perlu melakukan scale out.
-
Warn: Picu peringatan jika penggunaan CPU instans mencapai 99% atau lebih selama 10 periode 1 menit berturut-turut. Praktik ini membantu Anda segera memeriksa apakah penggunaan CPU tinggi disebabkan oleh perubahan bisnis.
-
-
Jangan mengonfigurasi peringatan yang dipicu oleh satu kali kejadian penggunaan CPU 100%. Lonjakan singkat ke 100% tidak selalu menandakan overload sistem atau anomali, melainkan bisa jadi merupakan pemanfaatan sumber daya yang efisien.
-
Jangan menetapkan ambang batas peringatan CPU pada nilai rendah. Bahkan saat tidak ada tugas yang berjalan, komponen sistem mungkin aktif dan mengonsumsi sejumlah sumber daya tertentu.
Worker CPU usage (%)
Metrik ini menunjukkan apakah terdapat bottleneck sumber daya pada node pekerja mana pun di instans Hologres Anda dan mencerminkan seberapa penuh sumber daya digunakan. Aturan peringatan yang direkomendasikan:
-
Aturan peringatan:
-
Critical: Picu peringatan jika penggunaan CPU node pekerja mencapai 99% atau lebih selama 60 periode 1 menit berturut-turut. Hal ini membantu Anda memantau tingkat sumber daya setiap node pekerja. Jika penggunaan tetap tinggi secara konsisten, Anda perlu melakukan scale out.
-
Warn: Picu peringatan jika penggunaan CPU node pekerja mencapai 99% atau lebih selama 10 periode 1 menit berturut-turut. Praktik ini membantu Anda segera memeriksa apakah penggunaan CPU tinggi disebabkan oleh perubahan bisnis.
-
-
Jangan mengonfigurasi peringatan yang dipicu oleh satu kali kejadian penggunaan CPU 100% pada node pekerja. Lonjakan singkat ke 100% tidak selalu menandakan overload sistem atau anomali, melainkan bisa jadi merupakan pemanfaatan sumber daya yang efisien.
-
Jangan menetapkan ambang batas peringatan CPU pada nilai rendah. Bahkan saat tidak ada tugas yang berjalan, komponen sistem mungkin aktif dan mengonsumsi sejumlah sumber daya tertentu.
Instance memory usage (%)
Metrik ini mencerminkan penggunaan memori instans. Aturan peringatan yang direkomendasikan:
-
Aturan peringatan:
-
Critical: Picu peringatan jika penggunaan memori instans mencapai 99% atau lebih selama 60 periode 1 menit berturut-turut. Hal ini membantu Anda memantau tingkat memori kluster. Jika penggunaan tetap tinggi secara konsisten, Anda perlu melakukan scale out.
-
Warn: Picu peringatan jika penggunaan memori instans mencapai 99% atau lebih selama 10 periode 1 menit berturut-turut. Praktik ini membantu Anda segera memeriksa apakah penggunaan memori tinggi disebabkan oleh perubahan bisnis.
-
-
Jangan menetapkan ambang batas peringatan memori pada nilai rendah. Memori digunakan tidak hanya untuk menjalankan kueri, tetapi juga untuk metadata dan cache. Sejumlah memori tertentu dikonsumsi bahkan saat instans dalam keadaan idle.
Worker memory usage (%)
Metrik ini mencerminkan penggunaan memori node pekerja. Aturan peringatan yang direkomendasikan:
-
Aturan peringatan:
-
Critical: Picu peringatan jika penggunaan memori node pekerja mencapai 99% atau lebih selama 60 periode 1 menit berturut-turut. Hal ini membantu Anda memantau tingkat memori kluster. Jika penggunaan tetap tinggi secara konsisten, Anda perlu melakukan scale out.
-
Warn: Picu peringatan jika penggunaan memori node pekerja mencapai 99% atau lebih selama 10 periode 1 menit berturut-turut. Praktik ini membantu Anda segera memeriksa apakah penggunaan memori tinggi disebabkan oleh perubahan bisnis.
-
-
Jangan menetapkan ambang batas peringatan memori pada nilai rendah. Memori digunakan tidak hanya untuk menjalankan kueri, tetapi juga untuk metadata dan cache. Sejumlah memori tertentu dikonsumsi bahkan saat instans dalam keadaan idle.
Max FE connection usage (%)
Warn: Picu peringatan jika penggunaan koneksi FE maksimum mencapai 95% atau lebih selama 5 periode 1 menit berturut-turut. Hal ini membantu Anda memantau penggunaan koneksi kluster dan segera membersihkan koneksi idle.
Max FE binlog WAL sender usage (%)
Metrik ini mencerminkan penggunaan wal sender maksimum di seluruh FE. Aturan peringatan yang direkomendasikan:
Warn: Picu peringatan jika penggunaan wal sender FE maksimum mencapai 95% atau lebih selama 5 periode 1 menit berturut-turut. Hal ini membantu Anda memantau penggunaan wal sender kluster.
Longest active query time (milliseconds)
Metrik ini membantu Anda memantau kueri berdurasi panjang pada instans Anda. Aturan peringatan yang direkomendasikan:
Warn: Picu peringatan jika waktu kueri aktif terpanjang mencapai 3.600.000 milidetik atau lebih selama 10 periode 1 menit berturut-turut.
Longest active serverless computing query time (milliseconds)
Metrik ini membantu Anda memantau tugas yang menggunakan komputasi tanpa server. Jika suatu tugas berjalan terlalu lama, Anda dapat segera menghentikannya. Aturan peringatan yang direkomendasikan:
Warn: Picu peringatan jika waktu kueri aktif terpanjang dalam komputasi tanpa server mencapai 3.600.000 milidetik atau lebih selama 10 periode 1 menit berturut-turut.
Failed query QPS (count/s)
Metrik ini menunjukkan jumlah kueri gagal pada instans. Konfigurasikan aturan peringatan untuk kueri gagal guna memantau status eksekusi kueri. Aturan peringatan yang direkomendasikan:
Warn: Picu peringatan jika Failed Query QPS mencapai 10 count/s atau lebih selama 10 periode 1 menit berturut-turut. Jika sejumlah besar kueri gagal pada instans, kami merekomendasikan Anda melihat detail kegagalan di log kueri lambat dan melakukan optimasi yang ditargetkan.
FE replay time (milliseconds)
Metrik ini menunjukkan waktu replay untuk setiap FE. Waktu replay yang berlebihan menandakan replay lambat. Hal ini dapat disebabkan oleh FE yang hang, yang pada gilirannya menyebabkan kueri macet. Masalah ini memerlukan perhatian segera. Kami merekomendasikan Anda mengonfigurasi aturan peringatan berikut:
-
Aturan peringatan:
Warn: Picu peringatan jika FE Replay Running Time mencapai 300.000 milidetik atau lebih selama 10 periode 1 menit berturut-turut. Jika peringatan dipicu, buka halaman Active Queries di Konsol HoloWeb untuk memeriksa kueri berdurasi panjang dan coba menghentikannya.
-
Jangan menetapkan ambang batas peringatan untuk waktu replay FE pada nilai rendah. Replay FE terjadi setiap kali metadata dalam instans dimodifikasi. Waktu replay FE beberapa detik merupakan hal yang normal.
Instance sync lag (milliseconds)
Metrik ini hanya ditampilkan untuk instans follower dan menunjukkan latensi sinkronisasi data antara instans primary dan follower. Aturan peringatan yang direkomendasikan:
Warn: Picu peringatan jika instance sync lag mencapai 600.000 milidetik atau lebih selama 10 periode 1 menit berturut-turut.
Tables with missing stats by DB (count/s)
Metrik ini mencerminkan kualitas fitur auto-analyze. Jika suatu tabel tidak memiliki statistik dalam periode waktu yang lama, Anda dapat menjalankan perintah ANALYZE secara manual pada tabel tersebut. Untuk informasi lebih lanjut, lihat ANALYZE dan AUTO ANALYZE. Kami merekomendasikan Anda mengonfigurasi aturan peringatan berikut:
-
Aturan peringatan:
Warn: Picu peringatan jika jumlah tabel yang tidak memiliki statistik di setiap database mencapai 10 atau lebih selama 60 periode 1 menit berturut-turut.
-
Jangan menetapkan ambang batas peringatan pada nilai rendah. Jika suatu instans berisi banyak tabel, proses auto-analyze mungkin berjalan lambat.
Pemecahan masalah umum pemantauan
Jika suatu metrik berfluktuasi secara tidak terduga atau peringatan dipicu, Anda dapat melakukan pemecahan masalah. Untuk informasi lebih lanjut, lihat FAQ tentang metrik pemantauan.
Akses metrik menggunakan API
Selain melalui Konsol CloudMonitor, CloudMonitor menyediakan dasbor kustom dan API untuk membantu Anda mengakses metrik secara lebih fleksibel.
-
Untuk mengakses CloudMonitor menggunakan API, lihat Pemantauan Layanan Cloud.
-
Untuk menggunakan dasbor pemantauan kustom, lihat Kelola dasbor kustom.
-
Untuk mengakses pemantauan Hologres menggunakan Application Real-Time Monitoring Service (ARMS), lihat Panduan integrasi.
Berikan izin kepada Pengguna RAM
Secara default, Pengguna RAM tidak dapat melihat metrik di CloudMonitor. Anda harus memberikan izin yang diperlukan kepada Pengguna RAM tersebut.
Anda dapat menggunakan Akun Alibaba Cloud (akun utama) untuk login ke Konsol Resource Access Management (RAM) dan memberikan kebijakan berikut kepada Pengguna RAM. Untuk informasi lebih lanjut tentang cara memberikan izin kepada Pengguna RAM, lihat Berikan izin kepada Pengguna RAM.
Anda juga dapat memilih kebijakan berdasarkan kebutuhan bisnis Anda.
|
Nama kebijakan |
Deskripsi |
|
AliyunCloudMonitorFullAccess |
Izin untuk mengelola CloudMonitor secara penuh. |
|
AliyunCloudMonitorReadOnlyAccess |
Izin hanya-baca pada CloudMonitor. |
|
AliyunCloudMonitorMetricDataReadOnlyAccess |
Izin untuk membaca data metrik deret waktu di CloudMonitor. |