Anda dapat mengintegrasikan pusat cadangan dengan Managed Service for Prometheus untuk memantau status penyimpanan cadangan dan tugas cadangan secara real time. Pelajari cara memantau pusat cadangan dan mengonfigurasi peringatan.
Prasyarat
-
Komponen migrate-controller versi v1.7.10 atau yang lebih baru telah diinstal. Untuk informasi selengkapnya, lihat Instal komponen migrate-controller dan konfigurasikan izin dan Upgrade komponen.
-
Kluster yang menjalankan versi Kubernetes sebelum 1.20 tidak dapat di-upgrade ke versi terbaru komponen migrate-controller. Untuk menggunakan fitur pemantauan pusat cadangan, Anda harus terlebih dahulu meng-upgrade kluster Anda. Untuk informasi selengkapnya, lihat Upgrade kluster secara manual.
-
Managed Service for Prometheus telah diaktifkan untuk kluster tersebut.
Penagihan
Komponen migrate-controller mengirim metrik pemantauan ke Managed Service for Prometheus. Metrik ini dianggap sebagai custom metrics. Penggunaan custom metrics dikenai biaya tambahan.
Sebelum melanjutkan, baca Ikhtisar penagihan untuk memahami kebijakan penagihan custom metrics dan mencegah biaya tak terduga. Biaya dapat bervariasi berdasarkan faktor seperti ukuran kluster dan jumlah aplikasi. Gunakan statistik penggunaan sumber daya untuk memantau dan mengelola konsumsi sumber daya Anda.
Integrasikan pusat cadangan dengan Prometheus
Anda dapat menggunakan Managed Service for Prometheus untuk memantau status penyimpanan cadangan dan tugas cadangan di kluster saat ini.
-
Masuk ke ARMS console.
-
Di panel navigasi kiri, klik Integration Center. Di tab Infrastructure, cari ACK BackupCenter lalu klik ACK BackupCenter untuk membuka halaman integrasi.
-
Di tab Start Access, pilih kluster Container Service for Kubernetes (ACK) target tempat pusat cadangan diinstal, lalu klik OK.
Setelah pemeriksaan status integrasi selesai, Anda dapat melihat data dasbor di Konsol ACK atau Konsol ARMS.
Lihat dasbor pemantauan pusat cadangan
Akses dasbor
-
Masuk ke ACK console. Di panel navigasi kiri, klik Clusters.
-
Di halaman Clusters, klik nama kluster Anda. Di panel navigasi kiri, klik .
-
Di halaman Prometheus Monitoring, klik tab Others dan lihat dasbor pusat cadangan di bawah ACK BackupCenter.
Untuk informasi selengkapnya tentang cara melihat dasbor pemantauan di Konsol ARMS, lihat Dasbor siap pakai.
Ikhtisar dasbor
Dasbor pemantauan pusat cadangan terdiri dari tiga bagian: Lokasi Cadangan (status penyimpanan cadangan), Status Operasi Cadangan (status tugas cadangan), dan Status Addon (status komponen kerja).
Lokasi Cadangan
Dasbor ini memantau informasi dasar penyimpanan cadangan dan menampilkan detail penyimpanan cadangan yang terkait dengan kluster saat ini (Detail Backuplocation).
Penyimpanan cadangan menyimpan backup dan menghubungkan pusat cadangan kluster ke bucket OSS. Anda hanya dapat membuat cadangan, snapshot, dan restorasi ketika penyimpanan cadangan berada dalam status Available.
|
Metric |
Description |
|
Backuplocation |
Nama penyimpanan cadangan. |
|
OSS bucket |
Nama bucket OSS yang terkait dengan penyimpanan cadangan. |
|
Region |
Wilayah tempat bucket OSS berada. Contoh: cn-hangzhou. |
|
NetworkPolicy |
Jaringan yang digunakan untuk menghubungkan penyimpanan cadangan ke bucket OSS. Nilai yang valid:
|
|
Phase |
Status penyimpanan cadangan. Nilai yang valid:
|
Status Operasi Cadangan
Dasbor ini memantau status tugas cadangan dan mencakup dua bagian: ikhtisar tugas cadangan (Backup Overview) dan detail tugas cadangan yang gagal (Failed Backup Detail).

-
Backup Overview: Grafik batang yang menunjukkan jumlah tugas cadangan yang dibuat di setiap penyimpanan cadangan kluster. Cadangan ad-hoc atau rencana cadangan terjadwal akan membuat tugas cadangan. Sumbu-x merepresentasikan nama penyimpanan cadangan dan sumbu-y merepresentasikan jumlah tugas cadangan. Tabel berikut menjelaskan metrik pemantauan untuk Backup Overview.
Metric
Description
Backup (Failed)
Jumlah tugas cadangan yang gagal, ditampilkan sebagai batang merah.
Backup (Completed)
Jumlah tugas cadangan yang berhasil, ditampilkan sebagai batang hijau.
-
Failed Backup Detail: Tabel yang menunjukkan informasi dasar tentang tugas cadangan yang berada dalam status Failed di kluster. Tabel berikut menjelaskan metrik pemantauan untuk Failed Backup Detail.
Metric
Description
Backup
Nama tugas cadangan.
Backuplocation
Nama penyimpanan cadangan tempat tugas cadangan berada.
BackupType
Jenis cadangan dari tugas cadangan. Nilai yang valid:
-
AppBackup: Hanya aplikasi yang dicadangkan (cadangan YAML).
-
AppAndPvBackup: Aplikasi dan datanya dicadangkan (cadangan YAML dan data PV).
DataType
Jenis cadangan data. Nilai yang valid:
-
snapshot: PV yang dicadangkan hanya menggunakan penyimpanan disk.
-
hbr: PV yang dicadangkan menggunakan penyimpanan file, seperti penyimpanan lokal HostPath, NAS, atau OSS.
-
all: PV yang dicadangkan mencakup penyimpanan disk dan sistem file.
-
none: Pencadangan data diaktifkan, tetapi tidak ada penyimpanan PV yang digunakan di namespace yang dipilih.
FromSchedule
Sumber tugas cadangan.
-
Kosong: Tugas dibuat oleh cadangan ad-hoc.
-
Tidak kosong: Tugas dibuat oleh rencana cadangan terjadwal. Nilainya adalah nama rencana cadangan yang sesuai.
-
Status Add-on
Dasbor ini memantau status komponen csdr-controller dan csdr-velero. Komponen-komponen ini harus berjalan dengan benar agar operasi seperti pencadangan, snapshot, dan restorasi di pusat cadangan dapat dilakukan.
Setelah komponen migrate-controller pusat cadangan diinstal, komponen tersebut melakukan pemeriksaan awal pada kluster. Setelah pemeriksaan selesai, komponen migrate-controller men-deploy komponen kerja csdr-controller dan csdr-velero di namespace csdr tempat pusat cadangan berjalan.

Komponen kerja pusat cadangan ditampilkan sebagai Deployment (Pod) dan mencakup komponen csdr-controller dan csdr-velero. Tabel berikut menjelaskan metrik pemantauan untuk Status Addon.
|
Metric |
Description |
|
Age |
Waktu aktif komponen kerja. |
|
Status |
Status komponen kerja. Nilai yang valid:
|
|
Pods |
Detail Pod komponen kerja. |
|
Memory request |
Jumlah sumber daya memori yang diminta oleh komponen kerja. |
|
CPU request |
Jumlah sumber daya CPU yang diminta oleh komponen kerja. |
|
Memory limit |
Batas atas sumber daya memori yang dapat digunakan oleh komponen kerja. |
|
CPU limit |
Batas atas sumber daya CPU yang dapat digunakan oleh komponen kerja. |
Konfigurasikan peringatan untuk kegagalan tugas cadangan
Peringatan untuk kegagalan tugas cadangan berbasis event. CustomResourceDefinition (CRD) untuk tugas cadangan adalah applicationbackups di kelompok sumber daya csdr.alibabacloud.com. Ketika tugas cadangan gagal, sumber daya dengan nama yang sama menghasilkan event Warn.
Kueri event Warn untuk tugas yang gagal
Jalankan perintah berikut untuk mengkueri event Warn untuk tugas cadangan yang gagal.
kubectl -n csdr get events --field-selector='type!=Normal'
Contoh output:
VaultError: backup vault is unavailable: oss: service returned error: StatusCode=403, ErrorCode=AccessDenied, ErrorMessage="The bucket you access does not belong to you.", RequestId=668516BC35F915******
Dalam output tersebut, VaultError menunjukkan penyebab kegagalan tugas cadangan.
Konfigurasikan aturan peringatan untuk kegagalan tugas
Konfigurasikan peringatan ini menggunakan fitur konfigurasi peringatan kluster. Untuk informasi selengkapnya, lihat Manajemen peringatan untuk ACK.
Troubleshooting masalah pemantauan
Troubleshooting komponen tidak sehat atau hilang
-
Setelah Anda menginstal pusat cadangan, komponen kerja hilang atau terus-menerus di-deploy ulang.
Jalankan perintah berikut untuk mengkueri status berjalan komponen migrate-controller.
kubectl -n kube-system get pod -l app=migrate-controllerJika komponen berada dalam status
CrashLoopBackOffatau terus-menerus restart, kluster tidak lolos pemeriksaan awal. Hal ini biasanya karena kluster menggunakan plug-in penyimpanan FlexVolume atau kluster terdaftar tidak dikonfigurasi dengan izin yang diperlukan. Untuk informasi troubleshooting, lihat FAQ tentang pusat cadangan dan kluster terdaftar. -
Komponen kerja tetap dalam status UnHealth dalam waktu lama, dan dasbor Pods tidak menampilkan data atau menunjukkan status abnormal.
Pod komponen kerja gagal dimulai. Untuk informasi troubleshooting lebih lanjut, lihat Troubleshoot pod exceptions.
-
Komponen kerja berada dalam status Health, tetapi jumlah Restarts pada dasbor Pods tidak 0.
Penggunaan memori
csdr-velerodapat mencapai puncaknya selama pencadangan, yang dapat menyebabkan masalah kehabisan memori (OOM) dan menyebabkan restart komponen. Tingkatkan batas sumber daya memori untuk mengatasi hal ini.CatatanSelama proses pencadangan, jika Pod komponen kerja keluar secara tidak terduga, tugas akan gagal atau tetap dalam status
InProgressdalam waktu lama.
Atasi Brankas Tak Tersedia
Jalankan perintah berikut untuk mengkueri pesan error.
Ganti <unavailable-backuplocation-name> dengan nama penyimpanan cadangan yang tidak tersedia.
kubectl -n csdr describe backuplocation <unavailabe-backuplocation-name>
Untuk informasi selengkapnya tentang cara menangani exception penyimpanan cadangan, lihat FAQ tentang pusat cadangan.
Troubleshoot tugas cadangan yang gagal
CLI
Jalankan perintah berikut untuk mengkueri pesan error.
Ganti <failed-applicationbackup-name> dengan nama tugas cadangan yang gagal.
kubectl -n csdr describe applicationbackup <failed-applicationbackup-name>
Untuk informasi selengkapnya tentang cara menangani kegagalan tugas cadangan, lihat FAQ tentang pusat cadangan.
Console
-
Masuk ke ACK console. Di panel navigasi kiri, klik Clusters.
-
Di halaman Clusters, klik nama kluster Anda. Di panel navigasi kiri, klik .
-
Di halaman Application Backup, klik tab Backup Records, temukan tugas cadangan yang sesuai, lalu klik Failed di kolom Status untuk melihat pesan error.
Lampiran: Metrik
Secara default, komponen csdr-controller, yang berjalan di namespace kerja csdr, mendengarkan port 8190 di path /csdr-metrics untuk mengekspos data metrik Prometheus.
Metrik yang diekspos dikategorikan menjadi dua kelompok utama: status penyimpanan cadangan (BackupLocation) dan status cadangan aplikasi (ApplicationBackup). Jika Anda menggunakan instance Prometheus yang dikelola sendiri, gunakan informasi berikut untuk mengonfigurasi pengambilan metrik.
Metrik penyimpanan cadangan
|
Metric |
Type |
Description |
|
csdr_cluster_location_total |
Gauge |
Jumlah total penyimpanan cadangan (BackupLocation). Nilai 1 menunjukkan bahwa penyimpanan cadangan tersebut milik kluster saat ini. Metrik ini mencakup label berikut:
|
Metrik cadangan aplikasi
|
Metric |
Type |
Description |
|
csdr_cluster_backup_total |
Gauge |
Jumlah total catatan cadangan aplikasi (ApplicationBackup). Nilai 1 menunjukkan bahwa cadangan telah dibuat atau disinkronkan ke kluster. Metrik ini mencakup label berikut:
|
Metrik status waktu proses Collector
|
Metric |
Type |
Description |
|
csdr_scrape_collector_duration_seconds |
Gauge |
Durasi pengambilan data metrik tunggal untuk collector, seperti |
|
csdr_scrape_collector_success |
Gauge |
Menunjukkan apakah pengambilan data metrik tunggal oleh collector berhasil. Nilai 1 menunjukkan berhasil, dan 0 menunjukkan gagal. |