All Products
Search
Document Center

Container Service for Kubernetes:Pantau pusat cadangan dan konfigurasikan peringatan dengan Prometheus

Last Updated:Aug 21, 2026

Anda dapat mengintegrasikan pusat cadangan dengan Managed Service for Prometheus untuk memantau status penyimpanan cadangan dan tugas cadangan secara real time. Pelajari cara memantau pusat cadangan dan mengonfigurasi peringatan.

Prasyarat

Penagihan

Komponen migrate-controller mengirim metrik pemantauan ke Managed Service for Prometheus. Metrik ini dianggap sebagai custom metrics. Penggunaan custom metrics dikenai biaya tambahan.

Sebelum melanjutkan, baca Ikhtisar penagihan untuk memahami kebijakan penagihan custom metrics dan mencegah biaya tak terduga. Biaya dapat bervariasi berdasarkan faktor seperti ukuran kluster dan jumlah aplikasi. Gunakan statistik penggunaan sumber daya untuk memantau dan mengelola konsumsi sumber daya Anda.

Integrasikan pusat cadangan dengan Prometheus

Anda dapat menggunakan Managed Service for Prometheus untuk memantau status penyimpanan cadangan dan tugas cadangan di kluster saat ini.

  1. Masuk ke ARMS console.

  2. Di panel navigasi kiri, klik Integration Center. Di tab Infrastructure, cari ACK BackupCenter lalu klik ACK BackupCenter untuk membuka halaman integrasi.

  3. Di tab Start Access, pilih kluster Container Service for Kubernetes (ACK) target tempat pusat cadangan diinstal, lalu klik OK.

    Setelah pemeriksaan status integrasi selesai, Anda dapat melihat data dasbor di Konsol ACK atau Konsol ARMS.

Lihat dasbor pemantauan pusat cadangan

Akses dasbor

  1. Masuk ke ACK console. Di panel navigasi kiri, klik Clusters.

  2. Di halaman Clusters, klik nama kluster Anda. Di panel navigasi kiri, klik Operations > Prometheus Monitoring.

  3. Di halaman Prometheus Monitoring, klik tab Others dan lihat dasbor pusat cadangan di bawah ACK BackupCenter.

Catatan

Untuk informasi selengkapnya tentang cara melihat dasbor pemantauan di Konsol ARMS, lihat Dasbor siap pakai.

Ikhtisar dasbor

Dasbor pemantauan pusat cadangan terdiri dari tiga bagian: Lokasi Cadangan (status penyimpanan cadangan), Status Operasi Cadangan (status tugas cadangan), dan Status Addon (status komponen kerja).

Lokasi Cadangan

Dasbor ini memantau informasi dasar penyimpanan cadangan dan menampilkan detail penyimpanan cadangan yang terkait dengan kluster saat ini (Detail Backuplocation).

Penyimpanan cadangan menyimpan backup dan menghubungkan pusat cadangan kluster ke bucket OSS. Anda hanya dapat membuat cadangan, snapshot, dan restorasi ketika penyimpanan cadangan berada dalam status Available.

Metric

Description

Backuplocation

Nama penyimpanan cadangan.

OSS bucket

Nama bucket OSS yang terkait dengan penyimpanan cadangan.

Region

Wilayah tempat bucket OSS berada. Contoh: cn-hangzhou.

NetworkPolicy

Jaringan yang digunakan untuk menghubungkan penyimpanan cadangan ke bucket OSS. Nilai yang valid:

  • internal: jaringan internal

  • public: jaringan publik

Phase

Status penyimpanan cadangan. Nilai yang valid:

  • InProgress: Penyimpanan cadangan sedang diinisialisasi dan konektivitasnya dengan bucket OSS sedang diperiksa. Status ini bersifat sementara.

  • Available: Penyimpanan cadangan terhubung ke bucket OSS dan dapat digunakan untuk pencadangan.

  • Unavailable: Penyimpanan cadangan tidak dapat terhubung ke bucket OSS dan tidak dapat digunakan untuk pencadangan.

Status Operasi Cadangan

Dasbor ini memantau status tugas cadangan dan mencakup dua bagian: ikhtisar tugas cadangan (Backup Overview) dan detail tugas cadangan yang gagal (Failed Backup Detail).

image

  • Backup Overview: Grafik batang yang menunjukkan jumlah tugas cadangan yang dibuat di setiap penyimpanan cadangan kluster. Cadangan ad-hoc atau rencana cadangan terjadwal akan membuat tugas cadangan. Sumbu-x merepresentasikan nama penyimpanan cadangan dan sumbu-y merepresentasikan jumlah tugas cadangan. Tabel berikut menjelaskan metrik pemantauan untuk Backup Overview.

    Metric

    Description

    Backup (Failed)

    Jumlah tugas cadangan yang gagal, ditampilkan sebagai batang merah.

    Backup (Completed)

    Jumlah tugas cadangan yang berhasil, ditampilkan sebagai batang hijau.

  • Failed Backup Detail: Tabel yang menunjukkan informasi dasar tentang tugas cadangan yang berada dalam status Failed di kluster. Tabel berikut menjelaskan metrik pemantauan untuk Failed Backup Detail.

    Metric

    Description

    Backup

    Nama tugas cadangan.

    Backuplocation

    Nama penyimpanan cadangan tempat tugas cadangan berada.

    BackupType

    Jenis cadangan dari tugas cadangan. Nilai yang valid:

    • AppBackup: Hanya aplikasi yang dicadangkan (cadangan YAML).

    • AppAndPvBackup: Aplikasi dan datanya dicadangkan (cadangan YAML dan data PV).

    DataType

    Jenis cadangan data. Nilai yang valid:

    • snapshot: PV yang dicadangkan hanya menggunakan penyimpanan disk.

    • hbr: PV yang dicadangkan menggunakan penyimpanan file, seperti penyimpanan lokal HostPath, NAS, atau OSS.

    • all: PV yang dicadangkan mencakup penyimpanan disk dan sistem file.

    • none: Pencadangan data diaktifkan, tetapi tidak ada penyimpanan PV yang digunakan di namespace yang dipilih.

    FromSchedule

    Sumber tugas cadangan.

    • Kosong: Tugas dibuat oleh cadangan ad-hoc.

    • Tidak kosong: Tugas dibuat oleh rencana cadangan terjadwal. Nilainya adalah nama rencana cadangan yang sesuai.

Status Add-on

Dasbor ini memantau status komponen csdr-controller dan csdr-velero. Komponen-komponen ini harus berjalan dengan benar agar operasi seperti pencadangan, snapshot, dan restorasi di pusat cadangan dapat dilakukan.

Setelah komponen migrate-controller pusat cadangan diinstal, komponen tersebut melakukan pemeriksaan awal pada kluster. Setelah pemeriksaan selesai, komponen migrate-controller men-deploy komponen kerja csdr-controller dan csdr-velero di namespace csdr tempat pusat cadangan berjalan.

image

Komponen kerja pusat cadangan ditampilkan sebagai Deployment (Pod) dan mencakup komponen csdr-controller dan csdr-velero. Tabel berikut menjelaskan metrik pemantauan untuk Status Addon.

Metric

Description

Age

Waktu aktif komponen kerja.

Status

Status komponen kerja. Nilai yang valid:

  • Health: Pod berjalan sesuai harapan.

  • UnHealth: Pod gagal dimulai atau probe-nya gagal.

Pods

Detail Pod komponen kerja.

Memory request

Jumlah sumber daya memori yang diminta oleh komponen kerja.

CPU request

Jumlah sumber daya CPU yang diminta oleh komponen kerja.

Memory limit

Batas atas sumber daya memori yang dapat digunakan oleh komponen kerja.

CPU limit

Batas atas sumber daya CPU yang dapat digunakan oleh komponen kerja.

Konfigurasikan peringatan untuk kegagalan tugas cadangan

Peringatan untuk kegagalan tugas cadangan berbasis event. CustomResourceDefinition (CRD) untuk tugas cadangan adalah applicationbackups di kelompok sumber daya csdr.alibabacloud.com. Ketika tugas cadangan gagal, sumber daya dengan nama yang sama menghasilkan event Warn.

Kueri event Warn untuk tugas yang gagal

Jalankan perintah berikut untuk mengkueri event Warn untuk tugas cadangan yang gagal.

kubectl -n csdr get events --field-selector='type!=Normal' 

Contoh output:

VaultError: backup vault is unavailable: oss: service returned error: StatusCode=403, ErrorCode=AccessDenied, ErrorMessage="The bucket you access does not belong to you.", RequestId=668516BC35F915******

Dalam output tersebut, VaultError menunjukkan penyebab kegagalan tugas cadangan.

Konfigurasikan aturan peringatan untuk kegagalan tugas

Konfigurasikan peringatan ini menggunakan fitur konfigurasi peringatan kluster. Untuk informasi selengkapnya, lihat Manajemen peringatan untuk ACK.

Troubleshooting masalah pemantauan

Troubleshooting komponen tidak sehat atau hilang

  • Setelah Anda menginstal pusat cadangan, komponen kerja hilang atau terus-menerus di-deploy ulang.

    Jalankan perintah berikut untuk mengkueri status berjalan komponen migrate-controller.

    kubectl -n kube-system get pod -l app=migrate-controller

    Jika komponen berada dalam status CrashLoopBackOff atau terus-menerus restart, kluster tidak lolos pemeriksaan awal. Hal ini biasanya karena kluster menggunakan plug-in penyimpanan FlexVolume atau kluster terdaftar tidak dikonfigurasi dengan izin yang diperlukan. Untuk informasi troubleshooting, lihat FAQ tentang pusat cadangan dan kluster terdaftar.

  • Komponen kerja tetap dalam status UnHealth dalam waktu lama, dan dasbor Pods tidak menampilkan data atau menunjukkan status abnormal.

    Pod komponen kerja gagal dimulai. Untuk informasi troubleshooting lebih lanjut, lihat Troubleshoot pod exceptions.

  • Komponen kerja berada dalam status Health, tetapi jumlah Restarts pada dasbor Pods tidak 0.

    Penggunaan memori csdr-velero dapat mencapai puncaknya selama pencadangan, yang dapat menyebabkan masalah kehabisan memori (OOM) dan menyebabkan restart komponen. Tingkatkan batas sumber daya memori untuk mengatasi hal ini.

    Catatan

    Selama proses pencadangan, jika Pod komponen kerja keluar secara tidak terduga, tugas akan gagal atau tetap dalam status InProgress dalam waktu lama.

Atasi Brankas Tak Tersedia

Jalankan perintah berikut untuk mengkueri pesan error.

Ganti <unavailable-backuplocation-name> dengan nama penyimpanan cadangan yang tidak tersedia.

kubectl -n csdr describe backuplocation <unavailabe-backuplocation-name> 

Untuk informasi selengkapnya tentang cara menangani exception penyimpanan cadangan, lihat FAQ tentang pusat cadangan.

Troubleshoot tugas cadangan yang gagal

CLI

Jalankan perintah berikut untuk mengkueri pesan error.

Ganti <failed-applicationbackup-name> dengan nama tugas cadangan yang gagal.

kubectl -n csdr describe applicationbackup <failed-applicationbackup-name> 

Untuk informasi selengkapnya tentang cara menangani kegagalan tugas cadangan, lihat FAQ tentang pusat cadangan.

Console

  1. Masuk ke ACK console. Di panel navigasi kiri, klik Clusters.

  2. Di halaman Clusters, klik nama kluster Anda. Di panel navigasi kiri, klik Operations > Application Backup.

  3. Di halaman Application Backup, klik tab Backup Records, temukan tugas cadangan yang sesuai, lalu klik Failed di kolom Status untuk melihat pesan error.

Lampiran: Metrik

Secara default, komponen csdr-controller, yang berjalan di namespace kerja csdr, mendengarkan port 8190 di path /csdr-metrics untuk mengekspos data metrik Prometheus.

Metrik yang diekspos dikategorikan menjadi dua kelompok utama: status penyimpanan cadangan (BackupLocation) dan status cadangan aplikasi (ApplicationBackup). Jika Anda menggunakan instance Prometheus yang dikelola sendiri, gunakan informasi berikut untuk mengonfigurasi pengambilan metrik.

Metrik penyimpanan cadangan

Metric

Type

Description

csdr_cluster_location_total

Gauge

Jumlah total penyimpanan cadangan (BackupLocation). Nilai 1 menunjukkan bahwa penyimpanan cadangan tersebut milik kluster saat ini. Metrik ini mencakup label berikut:

  • location: Nama repositori cadangan.

  • bucket: Nama bucket OSS.

  • region: Wilayah tempat penyimpanan cadangan berada.

  • network: Kebijakan akses jaringan, seperti internal atau public.

  • phase: Status saat ini dari repositori cadangan, seperti Available atau Unavailable.

Metrik cadangan aplikasi

Metric

Type

Description

csdr_cluster_backup_total

Gauge

Jumlah total catatan cadangan aplikasi (ApplicationBackup). Nilai 1 menunjukkan bahwa cadangan telah dibuat atau disinkronkan ke kluster. Metrik ini mencakup label berikut:

  • backup: Nama tugas cadangan aplikasi.

  • location: Nama repositori cadangan tempat data cadangan berada.

  • backupType: Jenis cadangan, seperti AppAndPvBackup (aplikasi dan volume persisten), PvBackup (hanya volume persisten), atau OnlyApp (hanya aplikasi).

  • dataType: Jenis kemampuan dasar untuk pencadangan data.

  • fromSchedule: Nama jadwal yang memicu cadangan ini.

  • phase: Fase eksekusi saat ini dari Application Backup, seperti Completed, Failed, dan TaskCreated.

Metrik status waktu proses Collector

Metric

Type

Description

csdr_scrape_collector_duration_seconds

Gauge

Durasi pengambilan data metrik tunggal untuk collector, seperti backup_stat atau location_stat. Satuan dalam detik.

csdr_scrape_collector_success

Gauge

Menunjukkan apakah pengambilan data metrik tunggal oleh collector berhasil. Nilai 1 menunjukkan berhasil, dan 0 menunjukkan gagal.