ARMS Alert Management offre des fonctionnalités robustes d'agrégation des alertes, de notification et d'escalade automatique. Il vous aide à détecter et résoudre rapidement les problèmes dans vos applications et services. Cette rubrique présente l'architecture, les concepts clés et les avantages d'ARMS Alert Management.
Architecture
ARMS Alert Management se compose de cinq modules principaux : gestion des intégrations, gestion des événements d'alerte, gestion des politiques de notification, gestion collaborative des alertes et analyse du traitement des alertes.
Gestion des intégrations
ARMS Alert Management prend en charge deux types d'intégrations : l'intégration d'alertes par défaut et l'intégration de services tiers.
Intégration d'alertes par défaut
Des intégrations par défaut sont disponibles pour les alertes provenant de divers services ARMS, tels qu'Application Monitoring, le monitoring de navigateur, Managed Service for Prometheus et le monitoring synthétique. Ces intégrations utilisent des tâches planifiées pour vérifier la présence d'anomalies dans vos données de monitoring. Lorsqu'une anomalie est détectée, ces intégrations envoient un événement d'alerte au centre de gestion des événements via un canal par défaut.
Pour savoir comment créer des règles d'alerte pour chaque service ARMS, consultez les rubriques suivantes :
Intégration de services tiers
Configurez des intégrations pour recevoir des alertes depuis n'importe quelle source tierce. Cela vous permet de centraliser la gestion des alertes dans ARMS et de traiter les alertes de tous vos systèmes, qu'ils soient hébergés sur site ou dans le cloud, depuis un point unique. ARMS Alert Management traite toute alerte reçue comme un événement d'alerte. Un événement d'alerte possède la structure et les contraintes suivantes :
Structure des données d'un événement d'alerte
La structure des données d'un événement d'alerte ARMS est basée sur le format open source d'AlertManager et comprend les champs suivants :
Labels : ensemble de paires clé-valeur représentant les métadonnées de l'alerte. Un ensemble unique de labels identifie un seul événement d'alerte. Les événements partageant le même ensemble de labels sont fusionnés. Par exemple :
"alertname: High CPU Utilization".Annotations : ensemble de paires clé-valeur fournissant des informations supplémentaires non identifiantes sur l'alerte. Par exemple :
"message: Alert content".StartsAt : heure de début de l'événement d'alerte.
EndsAt : heure de fin de l'événement d'alerte.
GeneratorUrl : URL renvoyant vers la source de l'événement d'alerte.
Différence entre labels et annotations
-
L'ensemble des labels définit de manière unique un événement d'alerte. Si la valeur d'un label change, un nouvel événement d'alerte est généré.
Exemple :
L'ensemble de labels
{"hostname":"prod-host-01", "alertname":"High CPU Utilization", "ip":"192.168.0.3"}représente une alerte spécifique (utilisation élevée du processeur sur l'hôte 192.168.0.3). Si le label ip change, comme dans{"hostname":"prod-host-01", "alertname":"High CPU Utilization", "ip":"192.168.0.4"}, cela crée une nouvelle alerte distincte (utilisation élevée du processeur sur l'hôte 192.168.0.4). -
Les modifications apportées aux annotations ne créent pas de nouvel événement d'alerte. Plusieurs événements ayant les mêmes labels mais des annotations différentes sont considérés comme des mises à jour de la même alerte.
Exemple :
Si une alerte avec l'annotation
{"value":"85", "message":"Host 192.168.0.3 CPU utilization is 85%, which exceeds the 80% threshold."}est envoyée à nouveau avec une nouvelle annotation, telle que{"value":"86", "message":"Host 192.168.0.3 CPU utilization is 86%, which exceeds the 80% threshold."}, elle ne génère pas de nouvelle alerte. Les deux événements sont traités comme des mises à jour de la même alerte en cours.
Vous pouvez configurer des deduplication fields pour une intégration. Lorsqu'ils sont spécifiés, seuls ces champs sont utilisés comme labels pour identifier de manière unique un événement d'alerte provenant de cette intégration. Si vous ne configurez pas de champs de déduplication, tous les labels sont utilisés pour identifier un événement d'alerte unique.
Gestion des événements d'alerte
Le module de gestion des événements d'alerte propose deux méthodes pour traiter les événements provenant des sources d'alerte :
Utilisez un flux de traitement des événements pour créer des pipelines de traitement simples. Vous pouvez ainsi retraiter les événements d'alerte de n'importe quelle source afin de répondre à différentes exigences de traitement des données.
Utilisez les fonctionnalités de gestion des événements pour dédupliquer, compresser, réduire le bruit et mettre en silence les événements d'alerte. Cela permet de consolider les alertes et de réduire les tempêtes d'alertes.
Compression des événements
Par défaut, le module de gestion des événements d'alerte compresse les événements de deux manières : par label et par temps. Les sections suivantes décrivent le fonctionnement de chaque méthode.
Compression basée sur les labels
Lorsqu'un événement d'alerte déclenche une notification, le système le compresse en fonction de la politique de regroupement définie dans la politique de notification. Si plusieurs événements correspondant à la politique partagent les mêmes valeurs pour les labels de regroupement spécifiés, le système les compresse automatiquement en une seule notification. La figure suivante montre comment trois événements différents sont compressés à l'aide de deux labels de regroupement différents :
Compression basée sur le temps
Chaque événement d'alerte possède une heure de début et une heure de fin. Si des événements d'alerte ayant les mêmes labels ont des plages horaires qui se chevauchent, le système les fusionne en un seul événement. Les heures de début et de fin de l'événement fusionné correspondent à l'union des plages horaires des événements d'origine.
Gestion des politiques de notification
Une politique de notification est essentiellement une règle d'abonnement. Vous configurez des règles de correspondance et, lorsqu'un événement d'alerte remplit les conditions, ARMS envoie des notifications conformément à la politique.
La figure suivante illustre la relation entre les flux de traitement des événements, la gestion des événements et les politiques de notification.
Gestion collaborative des alertes
Le module de gestion collaborative des alertes vous permet de configurer plusieurs politiques de collaboration. Traitez les alertes directement dans la console Alibaba Cloud ou dans des outils tels que DingTalk, WeCom et Lark. Le module prend également en charge des fonctionnalités telles que la synchronisation des messages de groupe, la planification des astreintes et les politiques d'escalade pour les environnements d'équipe collaboratifs. La figure suivante montre le processus de traitement des alertes. Pour plus d'informations, consultez Traiter les alertes dans les conversations de groupe.
Avantages
Lorsque vous déployez vos services sur Alibaba Cloud et utilisez ARMS pour le monitoring, ARMS Alert Management vous aide à améliorer votre efficacité opérationnelle de plusieurs façons.
-
Opérations globalisées
Les modèles globaux vous permettent de gérer les règles d'alerte pour toutes les régions depuis un emplacement unique.
Configurez les contacts et les politiques de notification une seule fois et appliquez-les globalement.
-
Gestion centralisée et efficace
ARMS Alert Management propose des intégrations en un clic pour les outils de monitoring courants d'Alibaba Cloud et prend en charge l'intégration manuelle pour d'autres outils, facilitant ainsi la maintenance centralisée.
Le module d'ingestion d'événements est stable et assure un traitement ininterrompu des événements 24 h/24 et 7 j/7.
Le système garantit une faible latence lors du traitement de volumes importants de données d'événements.
-
Notifications rapides et précises
Configurez des règles de notification pour fusionner les événements avant l'envoi des notifications, ce qui permet de réduire la fatigue liée aux alertes pour votre personnel opérationnel.
Choisissez différentes méthodes de notification, telles que l'e-mail, les SMS, les appels téléphoniques ou DingTalk, en fonction de l'urgence de l'alerte pour notifier les contacts appropriés.
Utilisez une politique d'escalade pour envoyer des rappels répétés pour les alertes non traitées après une période spécifiée, garantissant ainsi une résolution rapide.
-
Gestion des alertes rapide et pratique
Les contacts peuvent traiter les alertes à tout moment via DingTalk.
Un format d'alerte commun permet aux contacts d'analyser les alertes plus efficacement.
Plusieurs contacts peuvent collaborer pour résoudre les alertes via DingTalk.
Les statistiques en temps réel et l'analyse de l'état vous aident à améliorer continuellement l'efficacité de la résolution des alertes.