Tous les produits
Search
Centre de documentation

Simple Log Service:Diagnostiquer et surveiller l'état d'exécution de LoongCollector

Dernière mise à jour :Aug 26, 2026

Simple Log Service propose des outils de diagnostic pour identifier les erreurs de collecte, telles que les échecs d'analyse par expression régulière, les chemins de fichiers incorrects ou un trafic dépassant la capacité des shards. Vous pouvez également utiliser des règles d'alerte intégrées pour surveiller le collecteur en temps réel et recevoir des notifications via DingTalk ou d'autres canaux.

Prérequis

  • Un collecteur est configuré pour la collecte de journaux. Collecter des journaux textuels depuis un hôte.

  • Activer les journaux importants pour le projet de destination

    Activez les journaux de service requis. Activer les journaux de service.

    1. Connectez-vous à la console Simple Log Service. Dans la liste des projets, cliquez sur le projet de destination. Sur la page des détails du projet, cliquez sur l'onglet Service Log, puis cliquez sur Enable Service Logs.

    2. Dans le panneau Enable Detailed Logs, sélectionnez Important Logs et Job Operational Logs, puis cliquez sur OK.

      • Un projet nommé log-service-{user-id}-{region} est automatiquement créé dans la région de destination.

      • L'ingestion, le stockage, la requête et l'analyse des journaux importants et des journaux opérationnels des tâches sont gratuits. La transformation des données et l'expédition des données sont facturées selon le modèle paiement à l'utilisation.

Diagnostiquer les problèmes d'exécution

Deux modes de diagnostic sont disponibles :

  • Diagnostic avancé (recommandé) : affiche un tableau de bord des exceptions avec les anomalies liées au collecteur et permet d'interroger une plage temporelle plus étendue.

  • Diagnostic de base : affiche les exceptions de collecte survenues au cours de la dernière heure.

Cas d'utilisation

  • État anormal du collecteur : échecs de heartbeat, processus inactifs ou erreurs de certificat SSL.

  • Échecs de collecte de journaux : journaux non collectés, latence élevée ou erreurs d'analyse telles que des incompatibilités d'expressions régulières.

  • Erreurs de configuration : chemins de fichiers incorrects, adresses IP de groupe de machines non correspondantes ou problèmes d'autorisation inter-comptes.

  • Goulots d'étranglement de performance : taux de collecte proche ou supérieur à la limite par défaut (20 Mo/s), entraînant la perte de journaux.

  • Problèmes de collecte de journaux de conteneurs : redémarrages fréquents de pods ou rotation rapide des journaux provoquant une collecte incomplète.

  • Problèmes liés aux plugins et à la collecte personnalisée : échecs de plugins personnalisés (par exemple, analyse Grok) ou erreurs de collecte de sources de données HTTP.

  • Problèmes de fiabilité des données : perte de journaux due à un LoongCollector inactif ou à une rotation de journaux excessivement rapide.

  • Modification des paramètres de configuration de collecte : les paramètres d'analyse, tels que les conditions de correspondance multiligne, ne peuvent pas être modifiés directement dans la liste de configuration de collecte. Ouvrez le flux de modification pour cette configuration et modifiez-les à l'étape d'analyse des journaux.

  • Collecte de plusieurs chemins dans une seule configuration : une configuration de collecte unique ne prend en charge qu'un seul chemin de journal et un seul modèle de nom de fichier. Plusieurs chemins différents dans une même configuration ne sont pas pris en charge. Créez une configuration de collecte distincte pour chaque chemin et appliquez ces configurations au même groupe de machines.

  • Échec de la validation du corps de la requête lors de la création d'une configuration de collecte via l'API ou Terraform : si la requête de création renvoie une erreur de validation du corps de la requête telle que PostBodyInvalid, vérifiez que tous les champs dans inputDetail sont présents et correctement typés. En particulier, localStorage doit être une valeur booléenne (true ou false).

  • Coexistence avec d'autres logiciels de collecte de journaux : dépannage de l'utilisation des ports, des conflits de processus ou de la collecte en double lorsque LoongCollector s'exécute aux côtés d'autres logiciels de collecte tels que Filebeat sur le même serveur.

  • Méthode de collecte à l'origine des journaux incertaine : lorsque l'origine des journaux dans un LogStore est inconnue, déterminez s'ils ont été collectés par LoongCollector/Logtail ou écrits directement par une application via un SDK. Vérifiez s'il existe une configuration de collecte correspondante sur le serveur et si le code de l'application contient une logique d'écriture via SDK.

  • Type de données cible hors du périmètre de collecte pris en charge : confirmez si l'objet cible, tel que les métriques de performance des applications ou les métriques des applications .NET, est un type de collecte pris en charge par LoongCollector, afin de ne pas confondre une cible non prise en charge avec un échec de collecte.

  • Les journaux stdin ou stdout des conteneurs ne sont pas collectés : cas de dépannage où les journaux stdin et stdout des conteneurs dans un cluster ACK ne sont pas collectés.

  • Accumulation en mémoire ou limitation du débit d'écriture lors de l'écriture directe via un SDK : lorsqu'une application écrit des journaux directement via le Java SDK ou Producer et que la mémoire continue d'augmenter, que les données s'accumulent ou que les écritures sont limitées, effectuez le dépannage conjointement avec le quota d'écriture du LogStore et le taux de génération de journaux côté application.

Procédure

  1. Connectez-vous à la console Simple Log Service. Dans la liste des projets, cliquez sur le projet de destination.

  2. Cliquez sur image Log Storage. Dans la liste LogStore, survolez le LogStore cible et cliquez sur l'icône Logtail configuration management.

  3. Cliquez sur Advanced Diagnostics ou Basic Diagnostics pour afficher les informations de diagnostic.

  4. Consultez les résultats du diagnostic.

    Diagnostic de base

    Le panneau Log Collection Error répertorie toutes les erreurs de collecte LoongCollector pour le LogStore. Cliquez sur un code d'erreur pour afficher les détails. Erreurs courantes de collecte de données.

    Diagnostic avancé

    La page LoongCollector/Logtail Exception Monitoring affiche des métriques telles que Active Collection Agent Count et Complete Error Information. Pour plus de détails sur le tableau de bord, consultez la section Afficher les rapports de données. Pour les codes d'erreur, consultez la section Erreurs courantes de collecte de données.

  5. Après avoir résolu un problème, vérifiez l'apparition de nouvelles erreurs. Les erreurs historiques restent visibles jusqu'à leur expiration ; ignorez-les et confirmez qu'aucune nouvelle erreur n'apparaît. LoongCollector signale les erreurs toutes les 10 minutes.

    Pour afficher les journaux complets perdus en raison d'échecs d'analyse, consultez les journaux d'exécution de LoongCollector :
    Pour les hôtes : le fichier /usr/local/ilogtail/loongcollector.LOG sur le serveur.
    Pour les conteneurs : le fichier /usr/local/ilogtail/loongcollector.LOG dans le conteneur.

Surveiller l'état d'exécution

SLS fournit des politiques d'alerte intégrées pour surveiller le collecteur en temps réel :

  • Surveiller les heartbeats du collecteur

    Interrogez le LogStore internal-diagnostic_log pour les journaux avec __topic__:logtail_status afin de compter les machines dont les heartbeats sont normaux. Configurez une règle d'alerte pour qu'elle se déclenche lorsque le nombre de heartbeats tombe en dessous de la valeur attendue, identifiant ainsi les machines hors ligne ou présentant des problèmes réseau.

  • Configurer des alertes pour les exceptions de collecte

    Exécutez la requête __topic__: logtail_alarm pour analyser les exceptions survenues au cours des 15 dernières minutes, telles que les fichiers illisibles, les autorisations insuffisantes et les échecs d'analyse. Cela vous aide à identifier et à corriger les problèmes de configuration pour éviter la perte de journaux.

  • Recevoir des avertissements concernant les goulots d'étranglement de performance

    Utilisez le tableau de bord de surveillance des exceptions Logtail pour afficher le nombre de LoongCollector actifs, l'historique des redémarrages et les messages d'erreur. Surveillez l'état d'exécution et l'utilisation des ressources (CPU, mémoire) pour identifier les goulots d'étranglement de performance ou les redémarrages anormaux.

  • Surveiller la collecte centralisée de journaux

    Utilisez le tableau de bord de surveillance de la collecte de fichiers LoongCollector pour suivre le nombre de fichiers collectés, la latence moyenne et les taux d'échec d'analyse. Gérez de manière centralisée l'état de la collecte de journaux dans des scénarios multi-comptes ou multi-régions.

Procédure

  1. Configurez une politique d'action pour définir la manière dont les notifications sont envoyées lorsqu'un statut d'alerte change.

    1. Connectez-vous à la console Simple Log Service.

    2. Dans la liste des projets, cliquez sur le projet pour lequel vous avez activé les journaux importants.

    3. Dans le volet de navigation de gauche, cliquez sur image Alerts. Sur la page Alert Center, choisissez Notification Management > Action Policy.

    4. Dans la liste des politiques d'action, recherchez la politique d'action sls.app.logtail.builtin et cliquez sur Modify dans la colonne Actions.

    5. Dans la boîte de dialogue Edit Action Policy, sélectionnez et configurez un canal de notification en fonction de vos besoins. Canaux de notification. Ensuite, cliquez sur Confirm.

  2. Créez une règle d'alerte qui se déclenche lorsque l'état d'exécution de LoongCollector atteint un seuil spécifié.

    1. Sur la page Alert Center, cliquez sur l'onglet Alert Rules, puis cliquez sur l'icône image à côté de Create Alert.

    2. Cliquez sur Create from Template. Dans le panneau Create from Template, cliquez sur Logtail Fault Monitor sous All Templates, puis cliquez sur la carte cible.

    3. Dans le panneau Create Alert, examinez la configuration. La règle d'alerte intégrée inclut des paramètres prédéfinis. Cliquez sur OK. Créer une règle d'alerte.