Tous les produits
Search
Centre de documentation

Container Service for Kubernetes:Monitor backup center and configure alerts with Prometheus

Dernière mise à jour :Aug 11, 2026

Vous pouvez intégrer le Backup Center à Managed Service for Prometheus pour surveiller en temps réel l'état des sauvegardes (backup vaults) et des tâches de sauvegarde. Découvrez comment surveiller le Backup Center et configurer les alertes.

Prérequis

Facturation

Le composant migrate-controller envoie des métriques de surveillance à Managed Service for Prometheus. Ces métriques sont considérées comme des métriques personnalisées. L'utilisation de métriques personnalisées engendre des frais supplémentaires.

Avant de poursuivre, consultez la rubrique Présentation de la facturation afin de comprendre la politique de facturation des métriques personnalisées et d'éviter les frais inattendus. Les frais peuvent varier en fonction de facteurs tels que la taille de votre cluster et le nombre d'applications. Utilisez les statistiques d'utilisation des ressources pour surveiller et gérer votre consommation de ressources.

Intégrer le Backup Center à Prometheus

Vous pouvez utiliser Managed Service for Prometheus pour surveiller l'état des sauvegardes (backup vaults) et des tâches de sauvegarde dans le cluster actuel.

  1. Connectez-vous à la console ARMS.

  2. Dans le volet de navigation de gauche, cliquez sur Integration Center. Dans l'onglet Infrastructure, recherchez ACK BackupCenter et cliquez sur ACK BackupCenter pour accéder à la page d'intégration.

  3. Dans l'onglet Start Access, sélectionnez le cluster Container Service for Kubernetes (ACK) cible où le Backup Center est installé, puis cliquez sur OK.

    Une fois la vérification de l'état d'intégration terminée, vous pouvez consulter les données du tableau de bord dans la console ACK ou la console ARMS.

Consulter les tableaux de bord de surveillance du Backup Center

Accéder aux tableaux de bord

  1. Connectez-vous à la console ACK. Dans le volet de navigation de gauche, cliquez sur Clusters.

  2. Sur la page Clusters, cliquez sur le nom de votre cluster. Dans le volet de navigation de gauche, cliquez sur Operations > Prometheus Monitoring.

  3. Sur la page Prometheus Monitoring, cliquez sur l'onglet Others et affichez les tableaux de bord du Backup Center sous ACK BackupCenter.

Remarque

Pour plus d'informations sur la consultation des tableaux de bord de surveillance dans la console ARMS, consultez la rubrique Tableaux de bord prêts à l'emploi.

Présentation des tableaux de bord

Le tableau de bord de surveillance du Backup Center comporte trois sections : Backup Locations (état des sauvegardes), Backup Operation Status (état des tâches de sauvegarde) et Addon Status (état des composants opérationnels).

Backup Locations

Ce tableau de bord surveille les informations de base des sauvegardes et affiche les détails des sauvegardes associées au cluster actuel (Backuplocation Detail).

Une sauvegarde stocke les copies de sauvegarde et relie le Backup Center du cluster à un compartiment OSS. Vous ne pouvez créer des sauvegardes, des snapshots et des restaurations que lorsque la sauvegarde est à l'état Available.

Metric

Description

Backuplocation

Le nom de la sauvegarde.

OSS bucket

Le nom du compartiment OSS associé à la sauvegarde.

Region

La région où se trouve le compartiment OSS. Exemple : cn-hangzhou.

NetworkPolicy

Le réseau utilisé pour connecter la sauvegarde au compartiment OSS. Valeurs possibles :

  • internal : réseau interne

  • public : réseau public

Phase

L'état de la sauvegarde. Valeurs possibles :

  • InProgress : la sauvegarde est en cours d'initialisation et sa connectivité avec le compartiment OSS est en cours de vérification. Cet état est transitoire.

  • Available : la sauvegarde est connectée au compartiment OSS et peut être utilisée pour les sauvegardes.

  • Unavailable : la sauvegarde ne peut pas se connecter au compartiment OSS et ne peut pas être utilisée pour les sauvegardes.

Backup Operation Status

Ce tableau de bord surveille l'état des tâches de sauvegarde et comprend deux sections : un aperçu des tâches de sauvegarde (Backup Overview) et les détails des tâches de sauvegarde ayant échoué (Failed Backup Detail).

image

  • Backup Overview : un diagramme en barres qui affiche le nombre de tâches de sauvegarde créées dans chaque sauvegarde du cluster. Les sauvegardes ponctuelles ou les plans de sauvegarde planifiés créent des tâches de sauvegarde. L'axe des x représente les noms des sauvegardes et l'axe des y représente le nombre de tâches de sauvegarde. Le tableau suivant décrit les métriques de surveillance pour Backup Overview.

    |
    **Metric**
    |
    **Description**
    | | --- | --- | |
    Backup (Failed)
    |
    Le nombre de tâches de sauvegarde ayant échoué, affiché sous forme de barre rouge.
    | |
    Backup (Completed)
    |
    Le nombre de tâches de sauvegarde réussies, affiché sous forme de barre verte.
    |











  • Failed Backup Detail : un tableau qui affiche les informations de base sur les tâches de sauvegarde à l'état Failed dans le cluster. Le tableau suivant décrit les métriques de surveillance pour Failed Backup Detail.

    Metric

    Description

    Backup

    Le nom de la tâche de sauvegarde.

    Backuplocation

    Le nom de la sauvegarde où réside la tâche de sauvegarde.

    BackupType

    Le type de sauvegarde de la tâche. Valeurs possibles :

    • AppBackup : seule l'application est sauvegardée (sauvegarde YAML).

    • AppAndPvBackup : l'application et ses données sont sauvegardées (sauvegarde YAML et données PV).

    DataType

    Le type de sauvegarde des données. Valeurs possibles :

    • snapshot : les PV sauvegardés utilisent uniquement le stockage par disque.

    • hbr : les PV sauvegardés utilisent le stockage de fichiers, tel que le stockage local HostPath, NAS ou OSS.

    • all : les PV sauvegardés incluent à la fois le stockage par disque et le stockage par système de fichiers.

    • none : la sauvegarde des données est activée, mais aucun stockage PV n'est utilisé dans le namespace sélectionné.

    FromSchedule

    La source de la tâche de sauvegarde.

    • Empty : la tâche a été créée par une sauvegarde ponctuelle.

    • Not empty : la tâche a été créée par un plan de sauvegarde planifié. La valeur correspond au nom du plan de sauvegarde associé.

Addon Status

Ce tableau de bord surveille l'état des composants csdr-controller et csdr-velero. Ces composants doivent fonctionner correctement pour effectuer des opérations telles que les sauvegardes, les snapshots et les restaurations dans le Backup Center.

Après l'installation du composant migrate-controller du Backup Center, celui-ci effectue une pré-vérification sur le cluster. Une fois la vérification terminée, le composant migrate-controller déploie les composants opérationnels csdr-controller et csdr-velero dans le namespace csdr où s'exécute le Backup Center.

image

Les composants opérationnels du Backup Center sont affichés sous forme de Deployments (Pods) et incluent les composants csdr-controller et csdr-velero. Le tableau suivant décrit les métriques de surveillance pour Addon Status.

Metric

Description

Age

Le temps de fonctionnement du composant opérationnel.

Status

L'état du composant opérationnel. Valeurs possibles :

  • Health : le Pod fonctionne comme prévu.

  • UnHealth : le Pod n'a pas pu démarrer ou sa sonde a échoué.

Pods

Détails des Pods des composants opérationnels.

Memory request

La quantité de ressources mémoire demandée par le composant opérationnel.

CPU request

La quantité de ressources CPU demandée par le composant opérationnel.

Memory limit

La limite supérieure des ressources mémoire que le composant opérationnel peut utiliser.

CPU limit

La limite supérieure des ressources CPU que le composant opérationnel peut utiliser.

Configurer les alertes pour les échecs de tâches de sauvegarde

Les alertes pour les échecs de tâches de sauvegarde sont basées sur des événements. La CustomResourceDefinition (CRD) pour les tâches de sauvegarde est applicationbackups dans le groupe de ressources csdr.alibabacloud.com. Lorsqu'une tâche de sauvegarde échoue, la ressource du même nom génère un événement Warn.

Interroger les événements Warn pour les tâches ayant échoué

Exécutez la commande suivante pour interroger l'événement Warn pour une tâche de sauvegarde ayant échoué.

kubectl -n csdr get events --field-selector='type!=Normal' 

Exemple de sortie :

VaultError: backup vault is unavailable: oss: service returned error: StatusCode=403, ErrorCode=AccessDenied, ErrorMessage="The bucket you access does not belong to you.", RequestId=668516BC35F915******

Dans la sortie, VaultError indique la cause de l'échec de la tâche de sauvegarde.

Configurer les règles d'alerte pour les échecs de tâches

Configurez ces alertes à l'aide de la fonctionnalité de configuration des alertes du cluster. Pour plus d'informations, consultez la rubrique Gestion des alertes pour ACK.

Résoudre les problèmes de surveillance

Résoudre les problèmes liés aux composants manquants ou non sains

  • Après avoir installé le Backup Center, des composants opérationnels sont manquants ou sont déployés de manière répétée.

    Exécutez la commande suivante pour interroger l'état d'exécution du composant migrate-controller.

    kubectl -n kube-system get pod -l app=migrate-controller

    Si le composant est à l'état CrashLoopBackOff ou redémarre continuellement, cela signifie que le cluster n'a pas passé la pré-vérification. Cela est généralement dû au fait que le cluster utilise le plug-in de stockage FlexVolume ou que le cluster enregistré n'est pas configuré avec les autorisations requises. Pour obtenir des informations de dépannage, consultez les rubriques FAQ sur le Backup Center et clusters enregistrés.

  • Le composant opérationnel reste à l'état UnHealth pendant une longue période, et le tableau de bord Pods n'affiche aucune donnée ou un état anormal.

    Le Pod du composant opérationnel ne parvient pas à démarrer. Pour plus d'informations sur le dépannage, consultez la rubrique Dépanner les exceptions de Pod.

  • Le composant opérationnel est à l'état Health, mais le compteur Restarts sur le tableau de bord Pods n'est pas égal à 0.

    L'utilisation de la mémoire par csdr-velero peut atteindre un pic lors d'une sauvegarde, ce qui peut provoquer des problèmes de dépassement de mémoire (OOM) et entraîner des redémarrages de composants. Augmentez la limite de ressources mémoire pour résoudre ce problème.

    Remarque

    Pendant le processus de sauvegarde, si le Pod d'un composant opérationnel se termine de manière inattendue, la tâche échouera ou restera à l'état InProgress pendant une période prolongée.

Résoudre les problèmes liés aux sauvegardes Unavailable

Exécutez la commande suivante pour interroger le message d'erreur.

Remplacez <unavailable-backuplocation-name> par le nom de la sauvegarde indisponible.

kubectl -n csdr describe backuplocation <unavailabe-backuplocation-name> 

Pour plus d'informations sur la gestion des exceptions de sauvegarde, consultez la rubrique FAQ sur le Backup Center.

Résoudre les problèmes liés aux tâches de sauvegarde ayant échoué

CLI

Exécutez la commande suivante pour interroger le message d'erreur.

Remplacez <failed-applicationbackup-name> par le nom de la tâche de sauvegarde ayant échoué.

kubectl -n csdr describe applicationbackup <failed-applicationbackup-name> 

Pour plus d'informations sur la gestion des échecs de tâches de sauvegarde, consultez la rubrique FAQ sur le Backup Center.

Console

  1. Connectez-vous à la console ACK. Dans le volet de navigation de gauche, cliquez sur Clusters.

  2. Sur la page Clusters, cliquez sur le nom de votre cluster. Dans le volet de navigation de gauche, cliquez sur Operations > Application Backup.

  3. Sur la page Application Backup, cliquez sur l'onglet Backup Records, localisez la tâche de sauvegarde correspondante et cliquez sur Failed dans la colonne Status pour afficher le message d'erreur.

Annexe : Métriques

Par défaut, le composant csdr-controller, qui s'exécute dans le namespace opérationnel csdr, écoute sur le port 8190 au chemin /csdr-metrics pour exposer les données de métriques Prometheus.

Les métriques exposées sont classées en deux groupes principaux : l'état de la sauvegarde (BackupLocation) et l'état de la sauvegarde d'application (ApplicationBackup). Si vous utilisez une instance Prometheus autonome, utilisez les informations suivantes pour configurer la collecte des métriques.

Métriques de sauvegarde

Metric

Type

Description

csdr_cluster_location_total

Gauge

Le nombre total de sauvegardes (BackupLocation). Une valeur de 1 indique que la sauvegarde appartient au cluster actuel. Cette métrique inclut les étiquettes suivantes :

  • location : le nom du référentiel de sauvegarde.

  • bucket : le nom du compartiment OSS.

  • region : la région où se trouve la sauvegarde.

  • network : la politique d'accès au réseau, telle que internal ou public.

  • phase : l'état actuel du référentiel de sauvegarde, tel que Available ou Unavailable.

Métriques de sauvegarde d'application

Metric

Type

Description

csdr_cluster_backup_total

Gauge

Le nombre total d'enregistrements de sauvegarde d'application (ApplicationBackup). Une valeur de 1 indique que la sauvegarde a été créée ou synchronisée avec le cluster. Cette métrique inclut les étiquettes suivantes :

  • backup : le nom de la tâche de sauvegarde d'application.

  • location : le nom du référentiel de sauvegarde où se trouvent les données de sauvegarde.

  • backupType : le type de sauvegarde, tel que AppAndPvBackup (application et volumes persistants), PvBackup (volumes persistants uniquement) ou OnlyApp (application uniquement).

  • dataType : le type de capacité sous-jacente pour la sauvegarde des données.

  • fromSchedule : le nom de la planification qui a déclenché cette sauvegarde.

  • phase : la phase d'exécution actuelle de la sauvegarde d'application, telle que Completed, Failed et TaskCreated.

Métriques d'état d'exécution du collecteur

|
**Metric**
|
**Type**
|
**Description**
| | --- | --- | --- | |
csdr_scrape_collector_duration_seconds
|
Gauge
|
La durée d'une seule collecte de données de métriques par un collecteur, tel que `backup_stat` ou `location_stat`. L'unité est la seconde.
| |
csdr_scrape_collector_success
|
Gauge
|
Indique si une seule collecte par un collecteur a réussi. Une valeur de 1 indique un succès et 0 indique un échec.
|