Un état anormal du cluster ou une utilisation élevée du disque des nœuds peut affecter directement la disponibilité des services. Configurez des alertes de surveillance pour détecter et traiter les anomalies du cluster en temps réel.
Alibaba Cloud Kibana ne prend pas en charge la fonctionnalité d'alerte Kibana. Si vous devez déclencher des alertes basées sur des conditions spécifiques, utilisez plutôt X-Pack Watcher.
Activer l'alerte en un clic
Lorsqu'elle est activée, cette fonction crée automatiquement les règles d'alerte suivantes pour toutes les instances Elasticsearch de votre compte :
État anormal du cluster
Utilisation anormale du disque des nœuds (>75 %)
Utilisation anormale du tas JVM des nœuds (>85 %)
Connectez-vous à la console Alibaba Cloud Elasticsearch.
Dans le volet de navigation de gauche, cliquez sur Elasticsearch Clusters.
Sur la page Elasticsearch Clusters, cliquez sur Initiative Alert.
-
Dans la boîte de dialogue Initiative Alert, cliquez sur Enable Now.
RemarqueSi le bouton affiche Disable Now, cela signifie que la fonction d'alerte en un clic est déjà activée. Vous pouvez ignorer les étapes restantes.
Dans la console Cloud Monitor, activez l'interrupteur Initiative Alert pour le service Elasticsearch.
-
(Facultatif) Revenez à la console Alibaba Cloud Elasticsearch et vérifiez que l'alerte en un clic est activée.
Sur la page Elasticsearch Clusters, cliquez sur l'ID de l'instance cible.
Dans le volet de navigation de gauche, choisissez Monitoring and Logs > Cluster Monitoring.
-
Cliquez sur l'onglet Basic Monitoring et vérifiez l'état de Initiative Alert dans le coin supérieur droit de la page.
Si l'état de Initiative Alert est Enabled, la fonction est active.
Configurer les alertes Cloud Monitor
La fonction d'alerte en un clic utilise un modèle fixe. Pour personnaliser les métriques, les seuils ou les méthodes de notification, créez des règles d'alerte personnalisées dans Cloud Monitor.
Accédez à la console Cloud Monitor.
Dans le volet de navigation de gauche, choisissez Alerts > Alarm Rules.
Cliquez sur Create Alert Rule.
-
Sur la page Create Alert Rule, configurez la règle d'alerte.
Cet exemple configure une règle d'alerte combinée pour trois métriques : État du cluster, utilisation du disque des nœuds et utilisation de la mémoire heap des nœuds. Conservez les valeurs par défaut pour les paramètres non listés. Pour une description détaillée des paramètres, consultez Créer une règle d'alerte.
Paramètre
Description
Product
Sélectionnez Elasticsearch.
Resource Range
Sélectionnez Cluster.
Associated Resources
Ajoutez les instances que vous souhaitez surveiller.
Rule Description
Cliquez sur Add Rule > Combined Metrics. Dans le panneau Configure Rule Description, configurez les paramètres suivants :
-
Metric Type : Sélectionnez Combined Metrics.
-
Alert Level : Sélectionnez Warning (Warn).
-
Multi-metric Alert Condition :
Remarque
Cet exemple utilise trois métriques. Cliquez sur Add Metric pour ajouter d'autres conditions.
-
Métrique 1 : Sélectionnez et définissez la condition sur >=2.
-
Métrique 2 : Sélectionnez et définissez la moyenne sur >=75 %.
-
Métrique 3 : Sélectionnez et définissez la moyenne sur >=85 %.
-
-
Relationship Between Metrics : Sélectionnez Generate alerts if one of the conditions is met (||).
-
Alert Threshold Triggers : Sélectionnez 3 Consecutive Cycles (1 Cycle = 1 Minute).
Vous pouvez également créer des alertes d'utilisation du disque avec une règle d'alerte à métrique unique. Pour plus d'informations, consultez Exemple de configuration d'alerte de disque.
Alarm Contact Group
Sélectionnez un groupe de contacts d'alerte existant. Si vous n'en avez pas créé, consultez Créer un contact d'alerte ou un groupe de contacts d'alerte.
Les paramètres de description de la règle sont les suivants :
Paramètre
Description
Metric Type
Sélectionnez Combined Metrics.
Alert Level
Sélectionnez Warning (Warn).
Multi-metric Alert Condition
Cliquez sur Add Metric pour ajouter d'autres conditions de métrique, et configurez les trois métriques de surveillance suivantes :
-
Métrique 1 : Sélectionnez Cluster ID > Cluster Status, et définissez la condition sur >=2.
-
Métrique 2 : Sélectionnez nodeName > Node Disk Usage, et définissez la moyenne sur >=75 %.
-
Métrique 3 : Sélectionnez nodeName > Node Heap Memory Usage_ES Business, et définissez la moyenne sur >=85 %.
Relationship Between Metrics
Sélectionnez Generate alerts if one of the conditions is met (||).
Alert Threshold Triggers
Sélectionnez 3 Consecutive Cycles (1 Cycle = 1 Minute).
Pour un exemple de règle à métrique unique pour l'utilisation du disque, consultez Exemple : Configurer une alerte de disque.
Développez Advanced Settings et saisissez une URL accessible publiquement dans le champ Alert Callback. Cloud Monitor envoie les notifications d'alerte à cette URL sous forme de requêtes POST. Seul le protocole HTTP est pris en charge. Pour plus d'informations, consultez Utiliser les rappels d'alerte.
Le tableau suivant répertorie les métriques disponibles pour les règles d'alerte. Pour plus d'informations, consultez Descriptions des métriques et suggestions de dépannage.
Métrique
Nécessité
Seuil recommandé
Description
État du cluster
Obligatoire
>=2
Les états du cluster Vert, Jaune et Rouge correspondent respectivement aux valeurs numériques 0,00, 1,00 et 2,00. Utilisez ces valeurs lors de la configuration de l'alerte.
NodeDiskUtilization(%)
Obligatoire
Moyenne >=75 %
Ne doit pas dépasser 80 %.
NodeHeapMemoryUtilization(%)
Obligatoire
Moyenne >=85 %
Ne doit pas dépasser 90 %. Dans la description de la règle, cette métrique s'affiche sous le nom Node heap memory usage_ES Business.
NodeCPUUtilization(%)
Facultatif
Moyenne >=95 %
-
Charge du nœud_1m
Facultatif
80 % du nombre total de cœurs CPU.
-
ClusterQueryQPS(Nombre/seconde)
Facultatif
Baser le seuil sur vos résultats de test.
-
ClusterIndexQPS(Nombre/seconde)
Facultatif
Baser le seuil sur vos résultats de test.
-
Nombre de Full GC (nombre)
Facultatif
Une valeur différente de 0 indique un état anormal.
-
Nombre d'exceptions (nombre)
Facultatif
Une valeur différente de 0 indique un état anormal.
-
État du snapshot
Facultatif
Une valeur de 2 indique un état anormal.
Une valeur de -1 ou 0 indique un état normal.
-
-
Cliquez sur OK.
Une fois la règle d'alerte créée, le groupe de contacts d'alerte spécifié est notifié lorsqu'une métrique déclenche une alerte.
Exemple d'alerte de disque
Les alertes de filigrane de disque constituent un cas d'utilisation courant à métrique unique. Lorsque l'utilisation du disque des nœuds dépasse un seuil, augmentez la capacité du disque ou supprimez des données pour éviter les pannes.
Suivez les étapes décrites dans Configurer les alertes Cloud Monitor pour créer une règle d'alerte. Dans la section Rule Description, cliquez sur Add Rule > Simple Metric. Voici un exemple de configuration.
|
Paramètre |
Exemple |
|
Alert Rule Name |
Alerte de filigrane de disque |
|
Metric Type |
Sélectionnez Simple Metric. |
|
Metrics |
Sélectionnez nodeName > Node Disk Usage. |
|
Threshold and Alert Level |
|
|
Chart Preview |
Prévisualise le graphique de surveillance pour la métrique sélectionnée. |