ACK est compatible avec les produits d'observabilité d'Alibaba Cloud, tels que CloudMonitor et Managed Service for Prometheus. Il fournit également des add-ons de supervision pour observer l'état de santé du cluster ainsi qu'identifier et résoudre les problèmes de manière proactive. Cette rubrique décrit les solutions de supervision full-stack pour les clusters ACK, couvrant les ressources de base, les applications, les clusters, les événements, les composants du plan de contrôle, le réseau et les conteneurs au niveau du noyau.
Observabilité du cluster
ACK propose les modules de supervision suivants.
|
Module |
Description |
Références |
Add-on |
|
Supervision des ressources de base |
Surveillez l'utilisation et l'état de santé des ressources de base du cluster (CPU, mémoire, réseau) via CloudMonitor ou Prometheus. Activez les notifications d'alerte sur les métriques clés pour améliorer la stabilité. |
||
|
Connexion et configuration de Managed Service for Prometheus |
|||
|
ack-prometheus-operator |
|||
|
Supervision des applications |
Utilisez Application Real-Time Monitoring Service (ARMS) et ack-onepilot pour analyser la topologie, superviser les API et les événements, tracer les requêtes et détecter les goulots d'étranglement des applications conteneurisées. |
||
|
Supervision du cluster |
Application Monitoring eBPF Edition collecte les données de performance des conteneurs sans intrusion dans le code. Identifiez les problèmes de pods et localisez les Services et charges de travail associés pour réduire le temps de détection. |
||
|
Supervision des événements |
Node Problem Detector (NPD) et le Centre d'événements Kubernetes de Log Service (SLS) assurent une surveillance et des notifications en temps réel de l'état du système. Diagnostiquez les exceptions de nœud, convertissez-les en événements et gérez les alertes grâce à des notifications en boucle fermée et hors ligne. |
||
|
Supervision des composants du plan de contrôle |
Supervisez en temps réel les composants du plan de contrôle avec Prometheus et Grafana, notamment le API server, etcd, kube-scheduler et kube-controller-manager. Optimisez l'accès aux composants et configurez votre propre instance Prometheus autogérée. |
Consultation des tableaux de bord des composants du plan de contrôle |
|
|
etcd |
|||
|
Supervision réseau |
Intégrez le service de journalisation Ingress et utilisez Ingress Dashboard avec ARMS pour un dépannage conjoint des Ingress. Surveillez et dépannez CoreDNS. Visualisez le trafic réseau et la topologie des services dans les clusters basés sur Terway pour garantir l'observabilité du réseau de conteneurs et des services. |
||
|
Atteindre l'observabilité réseau avec ACK Terway et Cilium Hubble |
|||
|
Supervision des conteneurs au niveau du noyau |
System Observer Monitoring (SysOM) supervise les conteneurs au niveau du noyau du système d'exploitation afin de faciliter le déploiement et la migration des applications conteneurisées. |