Managed Service for Prometheus propose deux éditions pour la surveillance des conteneurs : Basic et Pro. Cette rubrique explique comment activer l'édition Pro, présente son modèle de facturation, compare ses fonctionnalités avec celles de l'édition Basic, et répertorie les tableaux de bord pris en charge ainsi que les règles d'alerte par défaut.
Types de clusters pris en charge
ACK Pro cluster
ACK Lingjun cluster
ACK Dedicated cluster
Prérequis
Avant d'utiliser l'édition Pro de la surveillance des conteneurs, activez Managed Service for Prometheus (facturé selon le volume de données ingérées lien d'activation ou selon le nombre d'échantillons ingérés lien d'activation), puis activez l'édition Pro de la surveillance des conteneurs.
Facturation de l'édition Pro de la surveillance des conteneurs
|
Élément de facturation |
Description |
Méthode de facturation |
Cycle de facturation |
|
Frais de surveillance à l'échelle du cluster |
L'utilisation des OCU est calculée en fonction du nombre de nœuds dans votre cluster Kubernetes. Une OCU correspond à 10 nœuds de cluster. Remarque
OCU : L'Observability Capacity Unit (OCU) est une unité de facturation pour Alibaba Cloud Native Observability. L'utilisation des OCU est calculée automatiquement en fonction de la consommation horaire des ressources. Le prix est de USD 0.023 par OCU. |
Paiement à l'utilisation : Frais quotidiens de surveillance à l'échelle du cluster = Somme du nombre d'OCU horaires × Prix unitaire de l'OCU Remarque
Nombre d'OCU horaires = ceil(Nombre maximal de nœuds pendant le cycle de facturation actuel / 10) |
Le cycle de facturation est horaire. Chaque jour après 00 h 00, Managed Service for Prometheus calcule les frais quotidiens en déterminant le nombre maximal de nœuds par heure pour la veille, en convertissant chaque valeur en OCU, en additionnant toutes les OCU horaires et en multipliant le résultat par le prix unitaire de l'OCU. |
|
Frais d'instance Prometheus |
Pour plus d'informations, consultez Facturation des instances Prometheus. |
||
Activer l'édition Pro de la surveillance des conteneurs
Méthode 1 : Sélectionner l'édition Pro lors de l'intégration
Sur la page Integration Center, sélectionnez Kubernetes Cluster Monitoring.
Dans le panneau Kubernetes Cluster Monitoring, sélectionnez votre cluster Container Service for Kubernetes (ACK) cible, choisissez Container Monitoring Pro Edition, puis cliquez sur OK.
Méthode 2 : Mettre à niveau vers l'édition Pro
Une fois la mise à niveau vers l'édition Pro de la surveillance des conteneurs effectuée, il est impossible de revenir à l'édition Basic.
Sur la page Integration Management, accédez à Integrated Environments > Container Service.
Repérez l'intégration de surveillance des conteneurs à mettre à niveau, puis dans la colonne Actions, cliquez sur Upgrade. Dans la boîte de dialogue de confirmation qui s'affiche, cliquez sur OK.
Édition Basic vs Édition Pro
|
Catégorie |
Édition Basic |
Édition Pro |
|
Rétention des métriques pour les métriques de base du cluster de conteneurs |
7 jours |
90 jours |
|
Collecteur Prometheus |
Déploie un agent intra-cluster que vous gérez. Cet agent consomme des ressources du cluster (3 cœurs CPU et 4 Go de mémoire par réplica par défaut). |
Utilise un agent collecteur entièrement géré qui élimine les coûts de ressources sur votre cluster et offre un SLA de niveau production de 99,95 %. |
|
Tableaux de bord |
Tableaux de bord intégrés de base. |
Ensemble complet de tableaux de bord intégrés. |
Tableaux de bord pris en charge dans l'édition Pro de la surveillance des conteneurs
|
Type |
Tableau de bord |
|
Vue d'ensemble de la surveillance |
Vue d'ensemble de la surveillance du cluster |
|
Tableau de bord Cluster Namespace |
|
|
Composants principaux du cluster |
Serveur API ACK Pro |
|
ETCD ACK Pro |
|
|
Planificateur ACK Pro |
|
|
Gestionnaire de contrôleur cloud ACK Pro |
|
|
Gestionnaire de contrôleurs Kube ACK Pro |
|
|
Surveillance des nœuds |
Vue d'ensemble du pool de nœuds |
|
Détails de la surveillance des nœuds du cluster |
|
|
Surveillance des applications |
Surveillance des déploiements |
|
Surveillance des StatefulSets |
|
|
Surveillance des DaemonSets |
|
|
Surveillance des pods du cluster |
|
|
Surveillance du réseau |
Surveillance du composant CoreDNS |
|
Surveillance du trafic Ingress du cluster |
|
|
Surveillance du stockage |
Surveillance du composant de stockage CSI (niveau cluster) |
|
Surveillance du composant de stockage CSI (niveau nœud) |
|
|
Surveillance des E/S des pods (niveau pod) |
|
|
Surveillance des E/S du stockage frontal (niveau cluster) |
|
|
Surveillance GPU |
Surveillance GPU du cluster (niveau cluster) |
|
Surveillance GPU du cluster (niveau nœud) |
|
|
Surveillance GPU du cluster (par pod d'application) |
|
|
Analyse des coûts/Optimisation des ressources |
Profil des ressources |
|
Autres |
Surveillance des E/S du stockage backend (niveau cluster) |
|
k8s-reclaimed-resource |
|
|
Auto-surveillance Prometheus du cluster |
|
|
Vue d'ensemble des nœuds virtuels (ECI) |
Règles d'alerte par défaut
|
Nom de la règle d'alerte |
Groupe d'alertes |
Modèle |
|
Utilisation du CPU du nœud supérieure à 75 % |
nœud |
L'utilisation du CPU du nœud {{ $labels.instance }} est supérieure à 75 %. Utilisation actuelle : {{ printf "%.2f" $value }} % |
|
Utilisation du CPU du nœud supérieure à 85 % |
nœud |
L'utilisation du CPU du nœud {{ $labels.instance }} est supérieure à 85 %. Utilisation actuelle : {{ printf "%.2f" $value }} % |
|
Utilisation de la mémoire du nœud supérieure à 75 % |
nœud |
L'utilisation de la mémoire du nœud {{ $labels.instance }} est supérieure à 75 %. Utilisation actuelle : {{ printf "%.2f" $value }} % |
|
Utilisation de la mémoire du nœud supérieure à 85 % |
nœud |
L'utilisation de la mémoire du nœud {{ $labels.instance }} est supérieure à 85 %. Utilisation actuelle : {{ printf "%.2f" $value }} % |
|
Anomalies de nœud |
nœud |
Le nœud {{$labels.node}} est indisponible depuis plus de 10 minutes. |
|
Utilisation du disque supérieure à 95 % |
nœud |
L'utilisation du disque {{ $labels.device }} du nœud {{ $labels.instance }} a dépassé 95 %. Utilisation actuelle : {{ printf "%.2f" $value }} % |
|
Disponibilité des pods de déploiement inférieure à 50 % |
charge de travail |
Espace de noms : {{$labels.namespace}} / Déploiement : {{$labels.deployment}} La disponibilité des pods est inférieure à 50 %. Nombre actuel de pods indisponibles : {{ $value }} |
|
Échec de l'exécution du job |
charge de travail |
Espace de noms : {{$labels.namespace}}/Job : {{$labels.job_name}} échec de l'exécution. |
|
Délai d'expiration du démarrage du pod |
charge de travail |
Espace de noms : {{$labels.namespace}}/Pod : {{$labels.pod_name}} n'a pas pu démarrer depuis plus de 15 minutes. Raison de l'attente : {{$labels.reason}} |
|
État du pod anormal |
charge de travail |
Espace de noms : {{$labels.namespace}}/Pod : {{$labels.pod_name}} est resté dans l'état {{$labels.phase}} pendant plus de 10 minutes. |
|
Redémarrages fréquents des pods |
charge de travail |
Espace de noms : {{$labels.namespace}}/Pod : {{$labels.pod_name}} a redémarré plus de {{ $labels.metrics_params_value}} fois au cours des {{ $labels.metrics_params_time}} dernières minutes. Nombre actuel de redémarrages : {{ $value }} |
|
L'utilisation du CPU du conteneur dépasse 85 % |
charge de travail |
Dans l'espace de noms {{$labels.namespace}}, l'utilisation du CPU du conteneur {{$labels.container}} dans le pod {{$labels.pod_name}} dépasse 85 %. Utilisation actuelle : {{ printf "%.2f" $value }} % |
|
L'utilisation du CPU du conteneur dépasse 75 % |
charge de travail |
Dans l'espace de noms {{$labels.namespace}}, l'utilisation du CPU du conteneur {{$labels.container}} dans le pod {{$labels.pod_name}} dépasse 75 %. Utilisation actuelle : {{ printf "%.2f" $value }} % |
|
L'utilisation de la mémoire du conteneur dépasse 75 % |
charge de travail |
Dans l'espace de noms {{$labels.namespace}}, l'utilisation de la mémoire du conteneur {{$labels.container}} dans le pod {{$labels.pod_name}} dépasse 75 %. Utilisation actuelle : {{ printf "%.2f" $value }} % |
|
L'utilisation de la mémoire du conteneur dépasse 85 % |
charge de travail |
Dans l'espace de noms {{$labels.namespace}}, l'utilisation de la mémoire du conteneur {{$labels.container}} dans le pod {{$labels.pod_name}} dépasse 85 %. Utilisation actuelle : {{ printf "%.2f" $value }} % |