クラウドネイティブゲートウェイの可観測性システム実践

まとめ

「可観測性」という用語は制御理論に由来し、システムの外部出力から内部状態をどの程度推論できるかを表す概念です。IT 業界の数十年にわたる発展に伴い、IT システムのモニタリング、アラーム、トラブルシューティングなどの領域は徐々に成熟し、IT 業界はこれを観測可能なエンジニアリングシステムとして体系化しました。現在、可観測性は単なるツールや技術ではなく、一つの考え方でもあります。複雑な分散システムの運用管理において重要な要素となり、システム実行中に理解、探索、スケジューリングする能力を提供します。

クラウドネイティブゲートウェイは、Alibaba Cloud の Microservices Engine (MSE) が提供するマネージドゲートウェイプロダクトです。トラフィックゲートウェイとマイクロサービスゲートウェイを統合しています。本記事では、クラウドネイティブゲートウェイに基づくゲートウェイシナリオの可観測性システムの構築方法について説明します。

ゲートウェイシナリオにおける可観測性構築の課題

ゲートウェイはビジネスフローの入口として、その可観測性構築は全体のビジネス安定性と密接に関わっています。同時に、ゲートウェイはユースケースや機能が多く、ネットワーク環境も複雑であるため、可観測性構築に多くの課題をもたらしています。主な課題を以下に説明します。

ゲートウェイの可観測性に注目する多様な役割

可観測性の核心は、異なる役割の人々がデータを観測することでシステム状態を理解できるようにすることです。ゲートウェイはトラフィックの入口として、ゲートウェイ、ビジネス、開発、SRE などの役割がその状態に注目しており、ゲートウェイの可観測性システムは各役割のニーズを深く理解した上で構築される必要があります。以下の図は、観測可能なデータのライフサイクルを簡潔に示しています。観測データは App から生成され、中間処理を経て保存され、クエリサービスとして提供されます。観測データは、プロダクトユーザー、ビジネス、開発、SRE など異なるタイプの人々にサービスを提供し、それぞれが異なる形でデータを活用します。

可観測性の基本的なライフサイクル

計装ポイントの精度不足と統計収集の大きな負荷

計装ポイントの精度が十分ではありません。計装自体は難しくありませんが、どのデータがユースケースに合致しているかを判断することが課題です。これには設計者に豊富な実務経験が求められるか、オンライン環境での継続的な改善が必要です。

統計収集のコストが高くなります。観測性の実現は、時間、空間、粒度の間のトレードオフです。統計の時間粒度が細かすぎるとストレージ容量の膨張を招き、粗すぎると問題の特定が困難になります。これが可観測性の実現に課題をもたらしています。

複雑なネットワーク環境によるトラブルシューティングの難しさ

トラフィックゲートウェイのシナリオでは、パブリックネットワーク環境が複雑で、ゲートウェイのトラフィック量が膨大であり、偶発的な問題のトラブルシューティングが非常に困難です。

クラウドネイティブゲートウェイの可観測性実践

現在、業界では可観測性能力の構築において 3 つの一般的な柱があります。ロギング、分散リンク追跡、メトリクスです。

・メトリクスは、一定期間にわたって記録される各ディメンションの定量情報であり、システムの状態や傾向を観測するために使用されます

・ログは、プログラム実行中に生成される離散イベントの記録です

・トレースは、リクエストの受信から処理までのライフサイクル全体における呼び出しチェーンの記録です

これら 3 つの柱に基づいて、クラウドネイティブゲートウェイは可観測性の基盤を構築しています。

ゲートウェイのコア指標を特定し、可観測性の基盤を構築する

コア指標は、システムの内部動作を正確に表現できる指標です。クラウドネイティブゲートウェイのシナリオでは、QPS、RT、成功率など、ゲートウェイの動作状態を正確に表現する指標がコア指標です。クラウドネイティブゲートウェイは Prometheus と SLS を同時に統合しています。ユーザーはゲートウェイのアクセスログの ETL 処理を通じて、より詳細で正確なデータを取得でき、Prometheus によるゲートウェイのリアルタイムモニタリングも取得できます。

アクセスログに基づく ETL 処理後のダッシュボード

統計収集の大きな負荷を解決するため、クラウドネイティブゲートウェイは収集負荷が大きい指標に対してアクセスログの ETL 処理を使用して収集負荷を低減し、より高いリアルタイム性が必要な統計指標にはプログラム内での直接的な計装を採用して統計指標のリアルタイム性を確保しています。

クラウドネイティブゲートウェイの Grafana マーケットプレイス

異なる役割のゲートウェイ可観測性に対する異なる要件に応じて、クラウドネイティブゲートウェイは多次元のデータ可視化を提供します。さらに詳細な分析が必要なエンタープライズユーザーは、SLS を通じてデータをさらに処理できます。

システム境界を明確にし、問題を迅速に特定する

ゲートウェイは通常大量のリクエストを処理します。同時に、マイクロサービスシナリオでは呼び出しチェーンが複雑です。このような条件下でリクエストの失敗原因を確認することは困難です。このシナリオに対して、クラウドネイティブゲートウェイはすぐに使える ARMS 分散リンク追跡サービスと連携し、トレースデータをユーザーが構築した SkyWalking への転送もサポートすることで、クラウドプロダクトのロックインを回避しています。

リンク追跡を導入していないユーザー向けに、クラウドネイティブゲートウェイはログ詳細の詳細な分析を提供し、リクエスト失敗の原因を具体的なチャートに視覚化して、問題境界の確認を支援し、トラブルシューティングの時間を短縮します。

失敗リクエストのエラー原因の詳細

リスク管理とリスクの定期点検

クラウドネイティブゲートウェイは、ユーザーのインスタンス、仕様、パフォーマンスなどのデータを統合し、現在のインスタンスの既存リスクを特定して改善提案を行います。これにより、クラウドネイティブゲートウェイインスタンスのメンテナンス自動化が大幅に向上し、顧客の運用コストを削減します。

リスク管理のための自動リスクスクリーニング

クラウドネイティブゲートウェイの可観測性に関する将来計画

現在、クラウドネイティブゲートウェイは基本的な可観測性システムを構築しており、データ可視化やモニタリングなどの機能は比較的充実しています。

ユーザーは現在の可観測性システムに基づいて、迅速に問題を発見し特定できます。

業界の発展方向に沿って、クラウドネイティブゲートウェイは可観測性分野で以下の計画を持っています。

・可観測性の 3 つのデータ柱に関して、クロスプラットフォームソリューションの複雑さとデータ相互運用性の問題を解決するため、Metrics、Logs、Traces の観測性取得フレームワークの開発が時代の趨勢であり、OpenTelemetry のような統一観測性フレームワークへの対応が次の優先事項です

・根本原因分析について、業界の最先端アルゴリズムの動向にも注目し、インテリジェントな根本原因分析の実践を継続的に探求しています

Related Articles

特別オファーをもっと見る

  1. Short Message Service (SMS) & メールサービス

    50,000 通のメールパッケージが USD 1.99 から、120 通の SMS が USD 1.00 から

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.