Simple Log Service propose des outils de diagnostic pour identifier les erreurs de collecte, telles que les échecs d'analyse par expression régulière, les chemins de fichiers incorrects ou un trafic dépassant la capacité des shards. Vous pouvez également utiliser des règles d'alerte intégrées pour surveiller le collecteur en temps réel et recevoir des notifications via DingTalk ou d'autres canaux.
Prérequis
Un collecteur est configuré pour la collecte de journaux. Collecter des journaux textuels depuis un hôte.
-
Diagnostiquer les problèmes d'exécution
Deux modes de diagnostic sont disponibles :
Diagnostic avancé (recommandé) : affiche un tableau de bord des exceptions avec les anomalies liées au collecteur et permet d'interroger une plage temporelle plus étendue.
Diagnostic de base : affiche les exceptions de collecte survenues au cours de la dernière heure.
Cas d'utilisation
État anormal du collecteur : échecs de heartbeat, processus inactifs ou erreurs de certificat SSL.
Échecs de collecte de journaux : journaux non collectés, latence élevée ou erreurs d'analyse telles que des incompatibilités d'expressions régulières.
Erreurs de configuration : chemins de fichiers incorrects, adresses IP de groupe de machines non correspondantes ou problèmes d'autorisation inter-comptes.
Goulots d'étranglement de performance : taux de collecte proche ou supérieur à la limite par défaut (20 Mo/s), entraînant la perte de journaux.
Problèmes de collecte de journaux de conteneurs : redémarrages fréquents de pods ou rotation rapide des journaux provoquant une collecte incomplète.
Problèmes liés aux plugins et à la collecte personnalisée : échecs de plugins personnalisés (par exemple, analyse Grok) ou erreurs de collecte de sources de données HTTP.
Problèmes de fiabilité des données : perte de journaux due à un LoongCollector inactif ou à une rotation de journaux excessivement rapide.
Modification des paramètres de configuration de collecte : les paramètres d'analyse, tels que les conditions de correspondance multiligne, ne peuvent pas être modifiés directement dans la liste de configuration de collecte. Ouvrez le flux de modification pour cette configuration et modifiez-les à l'étape d'analyse des journaux.
Collecte de plusieurs chemins dans une seule configuration : une configuration de collecte unique ne prend en charge qu'un seul chemin de journal et un seul modèle de nom de fichier. Plusieurs chemins différents dans une même configuration ne sont pas pris en charge. Créez une configuration de collecte distincte pour chaque chemin et appliquez ces configurations au même groupe de machines.
Échec de la validation du corps de la requête lors de la création d'une configuration de collecte via l'API ou Terraform : si la requête de création renvoie une erreur de validation du corps de la requête telle que
PostBodyInvalid, vérifiez que tous les champs dansinputDetailsont présents et correctement typés. En particulier,localStoragedoit être une valeur booléenne (trueoufalse).Coexistence avec d'autres logiciels de collecte de journaux : dépannage de l'utilisation des ports, des conflits de processus ou de la collecte en double lorsque LoongCollector s'exécute aux côtés d'autres logiciels de collecte tels que Filebeat sur le même serveur.
Méthode de collecte à l'origine des journaux incertaine : lorsque l'origine des journaux dans un LogStore est inconnue, déterminez s'ils ont été collectés par LoongCollector/Logtail ou écrits directement par une application via un SDK. Vérifiez s'il existe une configuration de collecte correspondante sur le serveur et si le code de l'application contient une logique d'écriture via SDK.
Type de données cible hors du périmètre de collecte pris en charge : confirmez si l'objet cible, tel que les métriques de performance des applications ou les métriques des applications .NET, est un type de collecte pris en charge par LoongCollector, afin de ne pas confondre une cible non prise en charge avec un échec de collecte.
Les journaux stdin ou stdout des conteneurs ne sont pas collectés : cas de dépannage où les journaux stdin et stdout des conteneurs dans un cluster ACK ne sont pas collectés.
Accumulation en mémoire ou limitation du débit d'écriture lors de l'écriture directe via un SDK : lorsqu'une application écrit des journaux directement via le Java SDK ou Producer et que la mémoire continue d'augmenter, que les données s'accumulent ou que les écritures sont limitées, effectuez le dépannage conjointement avec le quota d'écriture du LogStore et le taux de génération de journaux côté application.
Procédure
Connectez-vous à la console Simple Log Service. Dans la liste des projets, cliquez sur le projet de destination.
Cliquez sur
Log Storage. Dans la liste LogStore, survolez le LogStore cible et cliquez sur l'icône
.Cliquez sur Advanced Diagnostics ou Basic Diagnostics pour afficher les informations de diagnostic.
-
Consultez les résultats du diagnostic.
Diagnostic de base
Le panneau Log Collection Error répertorie toutes les erreurs de collecte LoongCollector pour le LogStore. Cliquez sur un code d'erreur pour afficher les détails. Erreurs courantes de collecte de données.
Diagnostic avancé
La page LoongCollector/Logtail Exception Monitoring affiche des métriques telles que Active Collection Agent Count et Complete Error Information. Pour plus de détails sur le tableau de bord, consultez la section Afficher les rapports de données. Pour les codes d'erreur, consultez la section Erreurs courantes de collecte de données.
-
Après avoir résolu un problème, vérifiez l'apparition de nouvelles erreurs. Les erreurs historiques restent visibles jusqu'à leur expiration ; ignorez-les et confirmez qu'aucune nouvelle erreur n'apparaît. LoongCollector signale les erreurs toutes les 10 minutes.
Pour afficher les journaux complets perdus en raison d'échecs d'analyse, consultez les journaux d'exécution de LoongCollector :
Pour les hôtes : le fichier
/usr/local/ilogtail/loongcollector.LOGsur le serveur.Pour les conteneurs : le fichier
/usr/local/ilogtail/loongcollector.LOGdans le conteneur.
Surveiller l'état d'exécution
SLS fournit des politiques d'alerte intégrées pour surveiller le collecteur en temps réel :
-
Surveiller les heartbeats du collecteur
Interrogez le LogStore
internal-diagnostic_logpour les journaux avec__topic__:logtail_statusafin de compter les machines dont les heartbeats sont normaux. Configurez une règle d'alerte pour qu'elle se déclenche lorsque le nombre de heartbeats tombe en dessous de la valeur attendue, identifiant ainsi les machines hors ligne ou présentant des problèmes réseau. -
Configurer des alertes pour les exceptions de collecte
Exécutez la requête
__topic__: logtail_alarmpour analyser les exceptions survenues au cours des 15 dernières minutes, telles que les fichiers illisibles, les autorisations insuffisantes et les échecs d'analyse. Cela vous aide à identifier et à corriger les problèmes de configuration pour éviter la perte de journaux. -
Recevoir des avertissements concernant les goulots d'étranglement de performance
Utilisez le tableau de bord de surveillance des exceptions Logtail pour afficher le nombre de LoongCollector actifs, l'historique des redémarrages et les messages d'erreur. Surveillez l'état d'exécution et l'utilisation des ressources (CPU, mémoire) pour identifier les goulots d'étranglement de performance ou les redémarrages anormaux.
-
Surveiller la collecte centralisée de journaux
Utilisez le tableau de bord de surveillance de la collecte de fichiers LoongCollector pour suivre le nombre de fichiers collectés, la latence moyenne et les taux d'échec d'analyse. Gérez de manière centralisée l'état de la collecte de journaux dans des scénarios multi-comptes ou multi-régions.
Procédure
-
Configurez une politique d'action pour définir la manière dont les notifications sont envoyées lorsqu'un statut d'alerte change.
Connectez-vous à la console Simple Log Service.
Dans la liste des projets, cliquez sur le projet pour lequel vous avez activé les journaux importants.
Dans le volet de navigation de gauche, cliquez sur
Alerts. Sur la page Alert Center, choisissez .Dans la liste des politiques d'action, recherchez la politique d'action
sls.app.logtail.builtinet cliquez sur Modify dans la colonne Actions.Dans la boîte de dialogue Edit Action Policy, sélectionnez et configurez un canal de notification en fonction de vos besoins. Canaux de notification. Ensuite, cliquez sur Confirm.
-
Créez une règle d'alerte qui se déclenche lorsque l'état d'exécution de LoongCollector atteint un seuil spécifié.
Sur la page Alert Center, cliquez sur l'onglet Alert Rules, puis cliquez sur l'icône
à côté de Create Alert.Cliquez sur Create from Template. Dans le panneau Create from Template, cliquez sur Logtail Fault Monitor sous All Templates, puis cliquez sur la carte cible.
Dans le panneau Create Alert, examinez la configuration. La règle d'alerte intégrée inclut des paramètres prédéfinis. Cliquez sur OK. Créer une règle d'alerte.