Alert Management regroupe et fusionne les alertes selon les politiques de routage et de fusion avant d'envoyer les notifications.
Règles de routage et de fusion
Le système regroupe et achemine les alertes en fonction d'une base de regroupement, d'une politique d'action, d'un délai d'attente initial, d'un délai d'attente de modification et d'un délai d'attente de répétition. Seules les alertes partageant les mêmes paramètres pour ces cinq critères appartiennent au même ensemble de regroupement.
Par exemple, deux hôtes d'un service déclenchent une alerte de CPU élevé chaque minute, respectivement à partir de 20:00 et de 20:01. Regroupez les alertes par nom de service : l'alerte initiale est envoyée immédiatement, tandis que les doublons suivants sont retardés.

Base de regroupement
La base de regroupement définit le critère de groupement des alertes selon leurs attributs et leurs tags. Alert Management prend en charge des bases prédéfinies et personnalisées.
|
Type de base |
Description |
|
Base de regroupement prédéfinie |
SLS propose les bases de regroupement prédéfinies suivantes :
|
|
Base de regroupement personnalisée |
Définissez une base de regroupement personnalisée en combinant les attributs d'alerte et les tags.
|
Politique d'action
Une politique d'action détermine le mode d'envoi des notifications d'alerte. Associez une politique d'action lors de la configuration d'une politique de routage et de fusion ou lors de la création d'une règle de surveillance des alertes. Si vous sélectionnez dynamic action policy dans la politique de fusion, la politique d'action spécifiée dans la règle de surveillance des alertes est prioritaire. Sinon, le système utilise la politique d'action définie dans la politique de fusion.
Délais d'attente
-
Scénario 1 : Seule l'alerte A est déclenchée pendant le délai d'attente initial.
Supposons un délai d'attente initial de 5 secondes, un délai d'attente de modification de 1 minute et un délai d'attente de répétition de 4 heures. L'orange représente l'alerte A ; le bleu représente l'alerte B.
À 00:00:00, le système déclenche l'alerte A et crée un ensemble de regroupement. Comme un délai d'attente initial est configuré, aucune notification n'est envoyée immédiatement.
À 00:00:05, le délai d'attente initial expire et le système envoie la première notification.
Le système vérifie ensuite les modifications à chaque intervalle de délai d'attente de modification. Au cours du premier intervalle (1 minute), il déclenche l'alerte B et l'ajoute à l'ensemble de regroupement. À 00:01:05, il envoie une deuxième notification.
L'ensemble de regroupement (contenant désormais les alertes A et B) reste inchangé. Le système envoie une troisième notification à 04:01:05, après l'écoulement du délai d'attente de répétition de 4 heures.
-
Scénario 2 : Les alertes A et B sont déclenchées pendant le délai d'attente initial.
Supposons un délai d'attente initial de 5 secondes, un délai d'attente de modification de 1 minute et un délai d'attente de répétition de 4 heures. L'orange représente l'alerte A ; le bleu représente l'alerte B.
Entre 00:00:00 et 00:00:05, le système déclenche les alertes A et B et crée un ensemble de regroupement. Comme un délai d'attente initial est configuré, aucune notification n'est envoyée immédiatement.
À 00:00:05, le délai d'attente initial expire et le système envoie la première notification.
L'ensemble de regroupement reste inchangé. Le système envoie une deuxième notification à 04:01:05, après l'écoulement du délai d'attente de répétition de 4 heures.
|
Paramètre |
Description |
|
initial wait time |
Délai d'attente avant l'envoi de la première notification après la création d'un nouvel ensemble de regroupement. Généralement réglé sur quelques secondes. |
|
change wait time |
Délai d'attente avant l'envoi d'une notification après une modification des alertes dans un ensemble de regroupement (par exemple, ajout d'une nouvelle alerte ou changement de statut). Généralement réglé sur quelques minutes, mais peut être défini en secondes pour des notifications plus rapides. |
|
repeat wait time |
Délai d'attente avant le renvoi d'une notification lorsque les données d'alerte de l'ensemble de regroupement se répètent (aucune nouvelle alerte ajoutée et aucun changement de statut, mais d'autres attributs tels que le titre ou le contenu changent). Généralement réglé sur plusieurs heures. Remarque
Si vous configurez une politique d'action dynamique dans la règle de surveillance des alertes, il n'est pas nécessaire de configurer le délai d'attente de répétition dans la politique d'alerte. Le délai d'attente de répétition de la règle remplace la valeur spécifiée dans la politique de regroupement des alertes. |
Exemples
Lors de la création d'une règle de surveillance des alertes, configurez différentes politiques d'alerte pour regrouper et fusionner les alertes déclenchées ou pour désactiver le regroupement.
Scénario 1 : Regroupement et fusion
Regroupez les alertes par Project de la règle, par le tag env et par le tag service.
-
Événements d'alerte
// Alert A { "alert_name": "Alert1", "project": "Project1", "labels": { "env": "test", "service": "service1" } } // Alert B { "alert_name": "Alert2", "project": "Project1", "labels": { "env": "prod", "service": "service2" } } // Alert C { "alert_name": "Alert3", "project": "Project1", "labels": { "env": "test", "service": "service1" } } // Alert D { "alert_name": "Alert4", "project": "Project1", "labels": { "env": "prod", "service": "service2" } } -
Configuration
Dans le panneau de configuration Group and Merge, définissez grouping baseline sur Custom. Pour alert attributes, sélectionnez Project of the rule. Pour alert tags, sélectionnez Custom et saisissez
env,servicedans le champ Custom Tags. Pour Action Policy, sélectionnez SLS built-in action policy et définissez initial wait time sur30secondes. -
Résultat du regroupement
Les alertes A et C forment un ensemble, tandis que les alertes B et D en constituent un autre.
Scénario 2 : Pas de fusion
Dans les paramètres de routage et de fusion, définissez grouping baseline sur alert monitoring rule + all tags afin de répartir les alertes dans différents ensembles. Prenons l'exemple des deux règles de surveillance des alertes suivantes :
Pour la règle de surveillance des alertes 1, l'évaluation de groupe est activée. Dans sa Alert Policy, le mode Advanced Mode est désactivé et grouping baseline est défini sur alert monitoring rule + all tags. Alert Management envoie des notifications distinctes pour l'hôte 1, l'hôte 2 et l'hôte 3.
Pour la règle de surveillance des alertes 2, l'évaluation de groupe est désactivée. Sa Alert Policy a également le mode Advanced Mode désactivé et grouping baseline est défini sur alert monitoring rule + all tags. Alert Management envoie une seule notification incluant tous les hôtes.
