Hologres は、CloudMonitor のクラウドサービスモニタリング機能と統合されており、インスタンスのリソース使用率、動作ステータス、および正常性を完全に可視化できます。この統合により、異常発生時にアラートをタイムリーに受け取り、迅速に対応してアプリケーションの円滑な稼働を確保できます。このトピックでは、CloudMonitor を使用して Hologres インスタンスの監視メトリクスを監視し、アラートルールを設定する方法について説明します。
前提条件
Hologres インスタンスを購入済みであること。
推奨事項
CloudMonitor は、[Hologres フォロワーインスタンス]、[Hologres アクセラレーションインスタンス]、[Hologres スタンダードインスタンス]、および[Hologres ウェアハウスインスタンス]を含む Hologres インスタンスタイプに基づいてメトリクスを表示できるようになりました。インスタンスタイプごとに専用のメトリクスが用意されており、ビジネス上の例外の監視と対処に役立ちます。監視エクスペリエンスを向上させるために、特定のインスタンスタイプによる監視への切り替えを推奨します。CloudMonitor コンソールの Hologresページの上部にリージョンセレクターがあります。タブバーでは、[Hologres フォロワーインスタンス]、[Hologres アクセラレーションインスタンス]、[Hologres スタンダードインスタンス]、[Hologres ウェアハウスインスタンス]など、異なるインスタンスタイプの監視ビューを切り替えることができます。[Create Alert Rule] または [View Alert Rules] をクリックして、アラートを管理できます。
CloudMonitorのメトリクス
CloudMonitor でサポートされている Hologres インスタンスのメトリクスの詳細については、「Hologresコンソールのメトリクス」をご参照ください。
メトリクスの表示
CloudMonitor コンソールでメトリクスを表示できます。
-
CloudMonitor コンソールにログインします。
-
左側のナビゲーションペインで、[Cloud Service Monitoring] をクリックします。
-
[Big Data] セクションで、Hologres フォロワーインスタンス、Hologres アクセラレーションインスタンス、Hologres スタンダードインスタンス、または Hologres ウェアハウスインスタンスなど、対象のインスタンスタイプをクリックして、Hologres の監視ダッシュボードを開きます。
-
リージョンの横にある
アイコンをクリックし、リージョンを選択します。 -
インスタンス ID をクリックするか、Actions 列のMonitoring Chart をクリックして、インスタンスのメトリクスを表示します。
説明時間範囲を指定して、インスタンスのメトリクスを表示できます。監視データは最大 30 日間保持されます。
監視とアラートに関するベストプラクティス
ワンクリックアラート
CloudMonitor でワンクリックアラート機能を有効にすると、すべてのインスタンスにデフォルトのアラートルールを設定できます。この機能を有効にすると、CPU 使用率、ディスク使用率、メモリ使用率、接続数などのメトリクスに対してアラートルールが作成されます。これらのルールは、Alibaba Cloud アカウント (プライマリアカウント) 配下のすべての Hologres インスタンスに適用され、重要なメトリクスに基づいて問題を迅速に特定するのに役立ちます。デフォルトのアラートルールは次のとおりです。
-
平均接続使用率 (Info) が 3 サイクル連続で 95% 以上の場合、CloudMonitor は [アラート連絡先グループ] に通知を送信します。
-
平均ストレージ使用率 (Warn) が 3 サイクル連続で 90% を超える場合、CloudMonitor は [アラート連絡先グループ] に通知を送信します。
-
平均メモリ使用率 (Warn) が 3 サイクル連続で 90% 以上の場合、CloudMonitor は [アラート連絡先グループ] に通知を送信します。
-
平均 CPU 使用率 (Info) が 3 サイクル連続で 99% 以上の場合、CloudMonitor は [アラート連絡先グループ] に通知を送信します。
デフォルトでは、アラートサイクルは 5 分です。この設定はカスタマイズできます。
アラートルールの作成
デフォルトのワンクリックアラートルールに加えて、ビジネス要件に基づいて追加のメトリクスに対するアラートルールを作成できます。アラートルールを作成するには、次の手順を実行します。
-
CloudMonitor コンソールにログインします。
-
左側のナビゲーションペインで、の順に選択します。
-
アラームルール ページで、アラートルールの作成 をクリックし、画面の指示に従ってアラート情報を設定します。詳細については、「アラートルールの作成」をご参照ください。
アラート設定のベストプラクティス
インスタンスCPU使用率 (%)
このメトリクスは、Hologres リソースがボトルネックになっているか、リソースを使い切っているかを判断するのに役立ちます。推奨されるアラートルールは次のとおりです。
-
アラートルール:
-
Critical:インスタンスCPU使用率が 60 分間連続して 99% 以上の場合にアラートをトリガーします。これにより、クラスターのリソースレベルを監視できます。使用率が継続的に高い場合は、スケールアウトする必要があります。
-
Warn:インスタンスCPU使用率が 10 分間連続して 99% 以上の場合にアラートをトリガーします。この方法により、高い CPU 使用率がビジネス上の変更によるものかどうかを迅速に確認できます。
-
-
CPU 使用率が一度 100% になっただけでトリガーされるアラートは設定しないでください。100% への一時的なスパイクは、必ずしもシステムの過負荷や異常を示すものではなく、効率的なリソース使用率を表す場合があります。
-
CPU アラートのしきい値を低い値に設定しないでください。タスクが実行されていない場合でも、システムコンポーネントがアクティブになり、一定量のリソースを消費する可能性があります。
ワーカーCPU使用率 (%)
このメトリクスは、Hologres インスタンス内のいずれかのワーカーノードにリソースボトルネックが存在するかどうかを示し、リソースがどの程度使用されているかを反映します。推奨されるアラートルールは次のとおりです。
-
アラートルール:
-
Critical:ワーカーノードの CPU 使用率が 60 分間連続して 99% 以上の場合にアラートをトリガーします。これにより、各ワーカーノードのリソースレベルを監視できます。使用率が継続的に高い場合は、スケールアウトする必要があります。
-
Warn:ワーカーノードの CPU 使用率が 10 分間連続して 99% 以上の場合にアラートをトリガーします。この方法により、高い CPU 使用率がビジネス上の変更によるものかどうかを迅速に確認できます。
-
-
ワーカーノードの CPU 使用率が一度 100% になっただけでトリガーされるアラートは設定しないでください。100% への一時的なスパイクは、必ずしもシステムの過負荷や異常を示すものではなく、効率的なリソース使用率を表す場合があります。
-
CPU アラートのしきい値を低い値に設定しないでください。タスクが実行されていない場合でも、システムコンポーネントがアクティブになり、一定量のリソースを消費する可能性があります。
インスタンスメモリ使用率 (%)
このメトリクスは、インスタンスのメモリ使用率を反映します。推奨されるアラートルールは次のとおりです。
-
アラートルール:
-
Critical:インスタンスメモリ使用率が 60 分間連続して 99% 以上の場合にアラートをトリガーします。これにより、クラスターのメモリレベルを監視できます。使用率が継続的に高い場合は、スケールアウトする必要があります。
-
Warn:インスタンスメモリ使用率が 10 分間連続して 99% 以上の場合にアラートをトリガーします。この方法により、高いメモリ使用率がビジネス上の変更によるものかどうかを迅速に確認できます。
-
-
メモリアラートのしきい値を低い値に設定しないでください。メモリは、クエリの実行だけでなく、メタデータやキャッシュにも使用されます。インスタンスがアイドル状態の場合でも、一定量のメモリが消費されます。
ワーカーメモリ使用率 (%)
このメトリクスは、ワーカーノードのメモリ使用率を反映します。推奨されるアラートルールは次のとおりです。
-
アラートルール:
-
Critical:ワーカーノードのメモリ使用率が 60 分間連続して 99% 以上の場合にアラートをトリガーします。これにより、クラスターのメモリレベルを監視できます。使用率が継続的に高い場合は、スケールアウトする必要があります。
-
Warn:ワーカーノードのメモリ使用率が 10 分間連続して 99% 以上の場合にアラートをトリガーします。この方法により、高いメモリ使用率がビジネス上の変更によるものかどうかを迅速に確認できます。
-
-
メモリアラートのしきい値を低い値に設定しないでください。メモリは、クエリの実行だけでなく、メタデータやキャッシュにも使用されます。インスタンスがアイドル状態の場合でも、一定量のメモリが消費されます。
最大FE接続使用率 (%)
Warn:最大FE接続使用率が 5 分間連続して 95% 以上の場合にアラートをトリガーします。これにより、クラスターの接続使用率を監視し、アイドル状態の接続を迅速に切断できます。
最大FE binlog WAL センダー使用率 (%)
このメトリクスは、すべての FE における最大 WAL センダー使用率を反映します。推奨されるアラートルールは次のとおりです。
Warn:最大FE binlog WAL センダー使用率が 5 分間連続して 95% 以上の場合にアラートをトリガーします。これにより、クラスターの WAL センダー使用率を監視できます。
最長アクティブクエリ時間 (ミリ秒)
このメトリクスは、インスタンス上の長時間実行クエリを監視するのに役立ちます。推奨されるアラートルールは次のとおりです。
Warn:最長アクティブクエリ時間が 10 分間連続して 3,600,000 ミリ秒以上の場合にアラートをトリガーします。
最長アクティブサーバーレスコンピューティングクエリ時間 (ミリ秒)
このメトリクスは、サーバーレスコンピューティングを使用するタスクを監視するのに役立ちます。タスクの実行時間が長すぎる場合は、迅速に終了させることができます。推奨されるアラートルールは次のとおりです。
Warn:サーバーレスコンピューティングにおける最長アクティブクエリ時間が 10 分間連続して 3,600,000 ミリ秒以上の場合にアラートをトリガーします。
失敗クエリQPS (回/秒)
このメトリクスは、インスタンス上の失敗したクエリの数を示します。失敗したクエリのアラートルールを設定して、クエリの実行ステータスを監視できます。推奨されるアラートルールは次のとおりです。
Warn:失敗クエリ QPS が 10 分間連続して 10 回/秒以上の場合にアラートをトリガーします。インスタンス上で多数のクエリが失敗する場合は、スロークエリログで失敗の詳細を確認し、的を絞った最適化を実行することを推奨します。
FEリプレイ時間 (ミリ秒)
このメトリクスは、各 FE のリプレイ時間を示します。リプレイ時間が過度に長い場合は、リプレイが遅いことを示します。これは、FE がスタックすることによって引き起こされる可能性があり、その結果、クエリが停止します。この問題には即座の対応が必要です。次のアラートルールを設定することを推奨します。
-
アラートルール:
Warn:FE リプレイ時間が 10 分間連続して 300,000 ミリ秒以上の場合にアラートをトリガーします。アラートがトリガーされた場合は、HoloWeb コンソールの [Active Queries] ページにアクセスして、長時間実行クエリを確認し、終了を試みてください。
-
FE リプレイ時間のアラートのしきい値を低い値に設定しないでください。FE リプレイは、インスタンス内のメタデータが変更されるたびに発生します。数秒の FE リプレイ時間は正常です。
インスタンス同期ラグ (ミリ秒)
このメトリクスはフォロワーインスタンスにのみ表示され、プライマリインスタンスとフォロワーインスタンス間のデータ同期のレイテンシーを示します。推奨されるアラートルールは次のとおりです。
Warn:インスタンス同期ラグが 10 分間連続して 600,000 ミリ秒以上の場合にアラートをトリガーします。
DBごとの統計情報が欠落しているテーブル数
このメトリクスは、自動分析機能の品質を反映します。テーブルの統計情報が長期間欠落している場合は、そのテーブルに対して手動で ANALYZE コマンドを実行できます。詳細については、「ANALYZE と AUTO ANALYZE」をご参照ください。次のアラートルールを設定することを推奨します。
-
アラートルール:
Warn:各データベースで統計情報が欠落しているテーブルの数が 60 分間連続して 10 以上の場合にアラートをトリガーします。
-
アラートしきい値を低い値に設定しないでください。インスタンスに多数のテーブルが含まれている場合、自動分析プロセスが遅くなる可能性があります。
一般的な監視問題のトラブルシューティング
メトリクスが予期せず変動したり、アラートがトリガーされたりした場合は、問題をトラブルシューティングできます。詳細については、「監視メトリクスに関するFAQ」をご参照ください。
APIを使用したメトリクスへのアクセス
CloudMonitor コンソールに加えて、CloudMonitor はカスタムダッシュボードと API を提供し、より柔軟な方法でメトリクスにアクセスできます。
-
API を使用して CloudMonitor にアクセスするには、「クラウドサービスモニタリング」をご参照ください。
-
カスタム監視ダッシュボードを使用するには、「カスタムダッシュボードの管理」をご参照ください。
-
Application Real-Time Monitoring Service (ARMS) を使用して Hologres 監視にアクセスするには、「統合ガイド」をご参照ください。
RAM ユーザーへの権限付与
デフォルトでは、RAM ユーザーは CloudMonitor でメトリクスを表示できません。RAM ユーザーに必要な権限を付与する必要があります。
Alibaba Cloud アカウント (プライマリアカウント) を使用してResource Access Management (RAM) コンソールにログインし、RAM ユーザーに次のポリシーを付与できます。RAM ユーザーに権限を付与する方法の詳細については、「RAM ユーザーへの権限付与」をご参照ください。
ビジネス要件に応じてポリシーを選択することもできます。
|
ポリシー名 |
説明 |
|
AliyunCloudMonitorFullAccess |
CloudMonitor を完全に管理するための権限。 |
|
AliyunCloudMonitorReadOnlyAccess |
CloudMonitor に対する読み取り専用権限。 |
|
AliyunCloudMonitorMetricDataReadOnlyAccess |
CloudMonitor で時系列メトリクスデータを読み取るための権限。 |