Simple Log Service (SLS) は、正規表現解析の失敗、不正なファイルパス、シャード容量を超えるトラフィックなどの収集エラーを特定するための診断機能を提供します。また、組み込みのアラートルールを使用してコレクターをリアルタイムでモニタリングし、DingTalk または他のチャネルを通じて通知を受信することもできます。
前提条件
-
コレクターがログを収集するように設定されていること。 詳細については、「ホストからのテキストログの収集」をご参照ください。
-
ランタイム問題の診断
2 つの診断モードが利用可能です:
-
高度な診断 (推奨):コレクター関連の例外を含む例外ダッシュボードを表示し、より長い時間範囲でのクエリをサポートします。
-
基本的な診断:過去 1 時間の収集例外を表示します。
ユースケース
-
コレクターの異常なステータス:ハートビートの失敗、非アクティブなプロセス、または SSL 証明書のエラー。
-
ログ収集の失敗:ログが収集されない、高レイテンシー、または正規表現の不一致などの解析エラー。
-
設定エラー:不正なファイルパス、マシン グループ IP の不一致、またはアカウント間の権限の問題。
-
パフォーマンスボトルネック:収集レートがデフォルトの制限 (20 MB/s) に近いかそれを超え、ログがドロップされる。
-
コンテナログ収集の問題:頻繁な Pod の再起動や急なログローテーションによる不完全な収集。
-
プラグインとカスタム収集の問題:カスタムプラグイン (Grok 解析など) の失敗、または HTTP データソースの収集エラー。
-
データの信頼性の問題:非アクティブな LoongCollector または過度に速いログローテーションによるログ損失。
-
収集設定パラメーターの変更が必要:複数行のマッチング条件などの解析パラメーターは、収集設定リストで直接編集できません。 その設定の変更フローを開き、ログ解析ステップで変更します。
-
1 つの設定で複数のパスを収集:1 つの収集設定は、1 つのログパスとファイル名パターンのみをサポートします。 1 つの設定で複数の異なるパスをサポートすることはできません。 パスごとに個別の収集設定を作成し、それらの設定を同じマシン グループに適用します。
-
API または Terraform を介して収集設定を作成する際にリクエスト本文の検証が失敗:作成リクエストが
"PostBodyInvalid"などのリクエスト本文検証エラーを返す場合、inputDetail内のすべてのフィールドが存在し、型が正しいことを確認してください。 特に、localStorageはブール値 (trueまたはfalse) である必要があります。 -
他のログ収集ソフトウェアとの共存:LoongCollector が同じサーバー上で Filebeat などの他の収集ソフトウェアと並行して実行される場合の、ポート使用、プロセスの競合、または重複収集のトラブルシューティング。
-
どの収集方法でログが生成されたかが不明確:Logstore 内のログの出所が不明な場合、それらが LoongCollector/Logtail によって収集されたものか、SDK を介してアプリケーションによって直接書き込まれたものかを判断します。 サーバー上に一致する収集設定が存在するかどうか、およびアプリケーションコードに SDK の書き込みロジックが含まれているかどうかを確認します。
-
ターゲットデータタイプがサポートされている収集範囲外:ターゲットオブジェクト (.NET アプリケーションメトリクスやアプリケーションパフォーマンスメトリクスなど) が LoongCollector がサポートする収集タイプであるかを確認し、サポートされていないターゲットが収集の失敗と誤認されないようにします。
-
コンテナの標準入力 (stdin) または標準出力 (stdout) ログが収集されない:ACK クラスター内のコンテナの標準入力および標準出力ログが収集されない場合のトラブルシューティング。
-
SDK を介して直接書き込む際のメモリバックログまたは書き込みスロットリング:アプリケーションが Java SDK または Producer を介して直接ログを書き込む際に、メモリが増え続け、データがバックアップされたり、書き込みがスロットリングされたりする場合、Logstore の書き込みクォータとアプリケーション側のログ生成レートと合わせてトラブルシューティングを行います。
-
__tag__:__hostname__フィールドがnull:これは、ログ収集中にホスト名が取得できなかったことを意味します。 一般的な原因には、Logtail 設定にホスト名ラベルがない、API 書き込みや一部のコンテナ環境などホスト名のメタデータを持たないログソース、または特定のマシンでデータコレクターがホスト名を解決できないことなどが含まれます。 収集設定のホスト名ラベル設定とログソースのメタデータを確認してください。 -
ファイアウォールが SLS 通信 IP アドレスへのアクセスをブロックするため収集が失敗:SLS 通信 IP アドレスへのアクセスをブロックすると、ログの書き込みが妨げられ、クエリ、消費、アラートが失敗し、ログ収集が遅延または中断される可能性があります。 これらの機能が期待どおりに動作するように、SLS 通信 IP アドレスをファイアウォールのホワイトリストに追加してください。
-
SLS Agent 評価タスクのステータスが [失敗] の場合、[失敗] は評価プロセスで明示的なエラーが発生したことを示します。考えられる原因として、内部ロジックエラー、無効なデータ形式、または権限やリソースの不足などが挙げられます。評価タスクの特定のエラーメッセージを使用して、データ形式、権限設定、および SLS Agent のランタイムロジックのトラブルシューティングを行ってください。
操作手順
-
Simple Log Service コンソールにログインします。 プロジェクトリストで、送信先プロジェクトをクリックします。
-
ログストレージをクリックします。 Logstore リストで、ターゲット Logstore にカーソルを合わせ、
アイコンをクリックします。 -
診断 (Advanced Edition) または 診断 (Basic Edition) をクリックして、診断情報を表示します。
-
診断結果を表示します。
基本的な診断
(ログ収集エラー) パネルには、LogStore のすべての LoongCollector 収集エラーが一覧表示されます。エラーコードをクリックすると、詳細を表示できます。詳細については、「一般的なデータ収集エラー」をご参照ください。
高度な診断
[LoongCollector/Logtail 例外モニタリング] ページには、[アクティブな収集エージェント数] や [完全なエラー情報] などのメトリックが表示されます。ダッシュボードの詳細については、「データレポートの表示」をご参照ください。エラーコードについては、「一般的なデータ収集エラー」をご参照ください。
-
問題が解決したら、新しいエラーがないか確認してください。 過去のエラーは期限切れになるまで表示されたままになります。これらは無視して、新しいエラーが表示されないことを確認してください。 LoongCollector は 10 分ごとにエラーを報告します。
解析の失敗によりドロップされた完全なログを表示するには、LoongCollector のランタイムログを確認してください:
ホストの場合:サーバー上の
/usr/local/ilogtail/loongcollector.LOGファイル。コンテナの場合:コンテナ内の
/usr/local/ilogtail/loongcollector.LOGファイル。
LoongCollector Docker コンテナによる過剰なディスク使用量をクリーンアップする方法
-
docker system dfを実行して、LoongCollector Docker コンテナのディスク使用量を確認してください。 -
コンテナに入り、
/usr/local/ilogtail/内のログファイルが過剰なディスク領域を使用していないか確認してください。 必要に応じて、ファイルをクリーンアップするか、ログローテーションポリシーを調整してください。
ランタイムステータスのモニタリング
SLS は、コレクターをリアルタイムでモニタリングするための組み込みのアラートポリシーを提供します:
-
コレクターのハートビートのモニタリング
internal-diagnostic_logLogstore で__topic__:logtail_statusを含むログをクエリして、正常なハートビートを持つマシンをカウントします。 ハートビート数が期待値を下回ったときにトリガーされるアラートルールを設定し、ダウンしているマシンやネットワークに問題があるマシンを特定します。 -
収集例外のアラート設定
__topic__: logtail_alarmクエリを実行して、読み取り不能なファイル、不十分な権限、解析の失敗など、15 分以内の例外を分析します。 これにより、設定の問題を特定して修正し、ログの損失を防ぐことができます。 -
パフォーマンスボトルネックの警告受信
Logtail 例外モニタリングダッシュボードを使用して、アクティブな LoongCollector の数、再起動履歴、およびエラーメッセージを表示します。 ランタイムステータスとリソース使用量 (CPU、メモリ) をモニタリングして、パフォーマンスボトルネックや異常な再起動を特定します。
-
集中ログ収集のモニタリング
LoongCollector ファイル収集モニタリングダッシュボードを使用して、収集されたファイル数、平均レイテンシー、および解析失敗率を追跡します。 マルチアカウントまたはマルチリージョンのシナリオで、ログ収集ステータスを一元管理します。
操作手順
-
アラートステータスが変更されたときに通知を送信する方法を定義するために、アクションポリシーを設定します。
-
Simple Log Service コンソールにログインします。
-
プロジェクトリストで、重要ログを有効にしたプロジェクトをクリックします。
-
左側のナビゲーションペインで、
[アラート] をクリックします。アラートセンター ページで、 を選択します。 -
アクションポリシーリストで、
sls.app.logtail.builtinアクションポリシーを見つけ、アクション 列の 変更 をクリックします。 -
[アクションポリシーの編集] ダイアログボックスで、必要に応じて通知チャネルを選択して設定します (通知チャネルをご参照ください)。その後、確認 をクリックします。
-
-
LoongCollector のランタイムステータスが指定されたしきい値を満たしたときにトリガーされるアラートルールを作成します。
-
アラートセンター ページで、アラートルール タブをクリックし、アラートの作成 の横にある
アイコンをクリックします。 -
[テンプレートから作成] をクリックします。[テンプレートから作成] パネルで、「すべてのテンプレート」配下の [Logtail 障害監視] をクリックし、次に目的のカードをクリックします。
-
アラートの作成 パネルで、設定を確認します。 組み込みのアラートルールには、事前設定されたパラメーターが含まれています。 OK をクリックします。 アラートルールを作成する。
-