Hologres は CloudMonitor と統合されており、インスタンスのリソース使用率、運用ステータス、および健全性を可視化します。主要なメトリックを監視し、アラートルールを設定することで、異常を検知し、迅速に対応できます。
前提条件
Hologres インスタンスを購入済み であること。
推奨事項
CloudMonitor は、[Hologres フォロワーインスタンス]、[Hologres アクセラレーションインスタンス]、[Hologres スタンダードインスタンス]、[Hologres ウェアハウスインスタンス]など、Hologres のインスタンスタイプごとのメトリックをサポートしています。各タイプには、監視とトラブルシューティングのための専用メトリックがあります。特定のインスタンスタイプごとに監視することを推奨します。CloudMonitor コンソールの Hologres ページで、上部のリージョンセレクターを使用し、タブバーでインスタンスタイプを切り替えます。[Create Alert Rule] または [View Alert Rules] をクリックしてアラートを管理できます。
CloudMonitor メトリック
CloudMonitor がサポートする Hologres インスタンスのメトリックの詳細については、「Hologres コンソールのメトリック」をご参照ください。
メトリックとシステムイベントの定義
CloudMonitor は、各クラウドサービスのモニタリングメタデータを専用の [メトリックリスト] ページで公開しています。Hologres のメトリックリストページには、Hologres が CloudMonitor に報告するすべての 時系列メトリックと システムイベントが一覧表示されます。時系列メトリックの各エントリには、メトリック ID、説明、単位、ディメンション、および最小統計期間 (Min Periods) が表示されます。システムイベントの各エントリには、名前、説明、ステータス、および深刻度が表示されます。
CloudMonitor における Hologres の名前空間は acs_hologres です。各インスタンスタイプはそれぞれ独自のメトリックを報告するため、インスタンスタイプ別にメトリックを参照できます。
|
インスタンスタイプ |
メトリックリストページ |
|
すべてのインスタンスタイプ ( |
|
|
スタンダードインスタンス |
|
|
仮想ウェアハウスインスタンス |
|
|
共有クラスター (レイクハウスアクセラレーション版) インスタンス |
|
|
フォロワーインスタンス |
-
メトリックリストページを開くには、Alibaba Cloud アカウントでログインしてください。RAM ユーザーには、CloudMonitor に対する読み取り権限も必要です。詳細については、「RAM ユーザーへの権限付与」をご参照ください。
-
メトリックリストページには、CloudMonitor が現在受信しているメトリックとイベントが反映されます。ページがこのトピックまたは「Hologres コンソールのメトリック」と異なる場合は、メトリックリストページに従ってください。
-
CloudMonitor API を介して監視データをクエリする場合、名前空間、メトリック名、ディメンション、および期間はすべてこのページから取得します。詳細については、「API を使用したメトリックへのアクセス」をご参照ください。
メトリックの表示
CloudMonitor コンソールでメトリックを表示します。
-
CloudMonitor コンソールにログインします。
-
左側のメニューで、[Cloud Service Monitoring] をクリックします。
-
[Big Data] セクションで、Hologres フォロワーインスタンス、Hologres アクセラレーションインスタンス、Hologres スタンダードインスタンス、Hologres ウェアハウスインスタンスなど、対象のインスタンスタイプをクリックして Hologres のモニタリングダッシュボードを開きます。
-
リージョンの横にある
アイコンをクリックし、ご自身のリージョンを選択します。 -
インスタンス ID をクリックするか、操作 列の モニタリングチャート をクリックすると、インスタンスのメトリックを表示できます。
説明期間を指定してインスタンスのメトリックを表示できます。監視データは最大 30 日間保持されます。
監視とアラートのベストプラクティス
イニシアチブアラート
CloudMonitor で イニシアチブアラート を有効にすると、すべてのインスタンスにデフォルトのアラートルールを適用できます。この機能を有効にすると、CPU 使用率、ディスク使用率、メモリ使用率、接続数などのメトリックに対してアラートルールが作成されます。これらのルールは、Alibaba Cloud アカウント (プライマリアカウント) 配下のすべての Hologres インスタンスに適用されます。デフォルトのアラートルールは次のとおりです。
-
平均接続使用率 (Info) が 3 サイクル連続で 95% 以上である場合、CloudMonitor は [アラート連絡先グループ] に通知を送信します。
-
平均ストレージ使用率 (Warn) が 3 サイクル連続で 90% を超えた場合、 CloudMonitor は[アラート連絡先グループ]に通知を送信します。
-
平均メモリ使用率 (警告) が 3 サイクル連続で 90% 以上の場合、CloudMonitor は [アラート連絡先グループ] に通知を送信します。
-
平均 CPU 使用率 (Info) が 3 サイクル連続で 99% 以上の場合、CloudMonitor は [アラート連絡先グループ] に通知を送信します。
デフォルトでは、アラートサイクルは 5 分です。この設定はカスタマイズできます。
アラートルールの作成
デフォルトのイニシアチブアラートルールに加えて、他のメトリックに対してカスタムのアラートルールを作成できます。アラートルールを作成するには、次の手順を実行します。
-
CloudMonitor コンソールにログインします。
-
左側のナビゲーションペインで、 を選択します。
-
アラームルール ページで、アラートルールの作成 をクリックし、プロンプトに従ってアラート情報を設定します。 詳細については、「アラートルールの作成」をご参照ください。
アラート設定のベストプラクティス
インスタンスの CPU 使用率 (%)
Hologres リソースがボトルネックになっているか、または完全に利用されているかを示します。推奨されるアラートルール:
-
アラートルール:
-
クリティカル:1 分周期で、インスタンスの CPU 使用率が 60 回連続して 99% 以上の場合にアラートをトリガーします。使用率が一貫して高い場合は、スケールアウトします。
-
警告:1 分周期で、インスタンスの CPU 使用率が 10 回連続して 99% 以上の場合にアラートをトリガーします。高い CPU 使用率がビジネス上の変更によって引き起こされたものかを確認します。
-
-
CPU 使用率が一度 100% になっただけでアラートをトリガーしないでください。一時的なスパイクは必ずしも過負荷を示すものではなく、効率的なリソース使用率を表すことがあります。
-
CPU アラートのしきい値を低く設定しすぎないでください。タスクが実行されていない場合でも、システムコンポーネントがリソースを消費することがあります。
ワーカーの CPU 使用率 (%)
いずれかのワーカーノードにリソースのボトルネックが存在するか、またリソースがどの程度完全に使用されているかを示します。推奨されるアラートルール:
-
アラートルール:
-
クリティカル:1 分周期で、ワーカーノードの CPU 使用率が 60 回連続して 99% 以上の場合にアラートをトリガーします。使用率が一貫して高い場合は、スケールアウトします。
-
警告:1 分周期で、ワーカーノードの CPU 使用率が 10 回連続して 99% 以上の場合にアラートをトリガーします。高い CPU 使用率がビジネス上の変更によって引き起こされたものかを確認します。
-
-
ワーカーノードで CPU 使用率が一度 100% になっただけでアラートをトリガーしないでください。一時的なスパイクは必ずしも過負荷を示すものではなく、効率的なリソース使用率を表すことがあります。
-
CPU アラートのしきい値を低く設定しすぎないでください。タスクが実行されていない場合でも、システムコンポーネントがリソースを消費することがあります。
インスタンスのメモリ使用率 (%)
インスタンスの全体的なメモリ使用率を反映します。推奨されるアラートルール:
-
アラートルール:
-
クリティカル:1 分周期で、インスタンスのメモリ使用率が 60 回連続して 99% 以上の場合にアラートをトリガーします。使用率が一貫して高い場合は、スケールアウトします。
-
警告:1 分周期で、インスタンスのメモリ使用率が 10 回連続して 99% 以上の場合にアラートをトリガーします。高いメモリ使用率がビジネス上の変更によって引き起こされたものかを確認します。
-
-
メモリアラートのしきい値を低く設定しすぎないでください。メモリはクエリ、メタデータ、キャッシュに使用されるため、インスタンスがアイドル状態でも一部のメモリは消費されます。
ワーカーのメモリ使用率 (%)
個々のワーカーノードのメモリ使用率を反映します。推奨されるアラートルール:
-
アラートルール:
-
クリティカル:1 分周期で、ワーカーノードのメモリ使用率が 60 回連続して 99% 以上の場合にアラートをトリガーします。使用率が一貫して高い場合は、スケールアウトします。
-
警告:1 分周期で、ワーカーノードのメモリ使用率が 10 回連続して 99% 以上の場合にアラートをトリガーします。高いメモリ使用率がビジネス上の変更によって引き起こされたものかを確認します。
-
-
メモリアラートのしきい値を低く設定しすぎないでください。メモリはクエリ、メタデータ、キャッシュに使用されるため、インスタンスがアイドル状態でも一部のメモリは消費されます。
最大 FE 接続使用率 (%)
警告:1 分周期で、最大 FE 接続使用率が 5 回連続して 95% 以上の場合にアラートをトリガーします。これにより、接続使用率を監視し、アイドル状態の接続を迅速にクリアできます。
最大 FE binlog WAL sender 使用率 (%)
すべての FE にわたる最大 WAL sender 使用率を反映します。推奨されるアラートルール:
警告:1 分周期で、最大 FE WAL sender 使用率が 5 回連続して 95% 以上の場合にアラートをトリガーします。
最長アクティブクエリ時間 (ミリ秒)
インスタンス上で長時間実行されているクエリを監視します。推奨されるアラートルール:
警告:1 分周期で、最長アクティブクエリ時間が 10 回連続して 3,600,000 ミリ秒以上の場合にアラートをトリガーします。
最長アクティブサーバーレスコンピューティングクエリ時間 (ミリ秒)
サーバーレスコンピューティングタスクを監視します。タスクが長時間実行されすぎた場合、それを終了できます。推奨されるアラートルール:
警告:1 分周期で、サーバーレスコンピューティングにおける最長アクティブクエリ時間が 10 回連続して 3,600,000 ミリ秒以上の場合にアラートをトリガーします。
失敗したクエリ QPS (count/s)
インスタンス上で失敗したクエリの数を示します。推奨されるアラートルール:
警告:1 分周期で、失敗したクエリ QPS が 10 回連続して 10 count/s 以上の場合にアラートをトリガーします。多数のクエリが失敗した場合、スロークエリログで失敗の詳細を確認し、それに応じて最適化してください。
FE 再生時間 (ミリ秒)
各 FE の再生時間を示します。過度な再生時間は、FE が遅いかスタックしていることを示唆し、クエリが停止する原因となる可能性があります。推奨されるアラートルール:
-
アラートルール:
警告:1 分周期で、FE 再生実行時間が 10 回連続して 300,000 ミリ秒以上の場合にアラートをトリガーします。HoloWeb コンソールの [Active Queries] ページで長時間実行されているクエリを確認し、それらを終了させてみてください。
-
FE 再生時間のしきい値を低く設定しすぎないでください。FE の再生はインスタンスのメタデータが変更されるたびに発生し、数秒の再生時間は正常です。
インスタンスの同期ラグ (ミリ秒)
フォロワーインスタンスのみに表示されます。プライマリインスタンスとフォロワーインスタンス間のデータ同期の遅延を示します。推奨されるアラートルール:
警告:1 分周期で、インスタンスの同期ラグが 10 回連続して 600,000 ミリ秒以上の場合にアラートをトリガーします。
DB 別統計情報欠落テーブル数 (count)
自動 ANALYZE 機能の品質を反映します。テーブルの統計情報が長期間欠落している場合は、そのテーブルに対して手動で ANALYZE コマンドを実行してください。詳細については、「ANALYZE と AUTO ANALYZE」をご参照ください。推奨されるアラートルール:
-
アラートルール:
警告:1 分周期で、各データベースで統計情報が欠落しているテーブルの数が 60 回連続して 10 以上の場合にアラートをトリガーします。
-
アラートのしきい値を低く設定しすぎないでください。インスタンスに多数のテーブルがある場合、自動 ANALYZE プロセスが遅くなることがあります。
システムイベントのサブスクライブ
時系列メトリックに加えて、Hologres は特定の O&M 操作を CloudMonitor に [システムイベント] として報告します。これらのイベントをサブスクライブすると、SMS または E メールで通知を受信し、インスタンスで実行される O&M 操作を把握できます。利用可能なシステムイベントは次のとおりです。
|
機能 |
システムイベント |
|
コンピュートグループの時間ベースの弾力性 |
Time-based elasticity configuration started for compute group, Time-based elasticity configuration completed for compute group, Scheduled elastic scaling for the compute group failed |
|
O&M イベント |
Scheduled event created, Scheduled event execution started, Scheduled event execution succeeded, Scheduled event execution failed, Scheduled event canceled, Scheduled event execution time changed |
-
イベントの表示: CloudMonitor コンソールにログインします。 左側のナビゲーションウィンドウで、を選択します。 [イベントモニタリング] タブで、製品、重要度、イベント名、時間範囲でイベントをフィルターし、[製品] を [Hologres] に設定します。 詳細については、「システムイベントの表示」をご参照ください。
-
イベントのサブスクライブ: [システムイベント] ページで、[今すぐ作成]をクリックします。[サブスクリプションタイプ]を[システムイベント]に、[製品]を [Hologres] に設定します。詳細については、「イベントアラートの設定」をご参照ください。
-
各システムイベントの完全な定義 (名前、説明、ステータス、重要度など) については、Hologres の メトリックリストページをご参照ください。
-
レガシーのシステムイベントアラートルール機能は更新されなくなり、段階的に廃止されます。代わりにイベントサブスクリプションを使用してください。
一般的な監視問題のトラブルシューティング
メトリックが予期せず変動したり、アラートがトリガーされたりした場合は、「監視メトリクスに関する FAQ」でトラブルシューティングのガイダンスをご参照ください。
API を使用したメトリックへのアクセス
CloudMonitor は、より柔軟なメトリックへのアクセスのために、カスタムダッシュボードと API も提供しています。
-
API を使用して CloudMonitor にアクセスするには、「クラウドサービス監視」をご参照ください。
-
カスタムモニタリングダッシュボードを使用するには、「カスタムダッシュボードの管理」をご参照ください。
-
Application Real-Time Monitoring Service (ARMS) を使用して Hologres の監視にアクセスするには、「統合ガイド」をご参照ください。
API を呼び出す前に、Hologres の メトリックリストページを開き、必要な値を調べます。名前空間を acs_hologres に設定し、[メトリック ID] 列からメトリック名、[最小期間] 列から期間、[ディメンション] 列からディメンションを取得します。userId を指定する必要はありません。CloudMonitor が現在のアカウントの ID を自動的に入力します。これらの値がどのように構成されるかの詳細については、「付録 1: Alibaba Cloud プロダクトのメトリック」をご参照ください。
RAM ユーザーへの権限付与
デフォルトでは、RAM ユーザーは CloudMonitor のメトリックを表示できません。必要な権限を付与する必要があります。
Alibaba Cloud アカウント (プライマリアカウント) で Resource Access Management (RAM) コンソールにログインし、RAM ユーザーに以下のいずれかのポリシーを付与します。詳細については、「RAM ユーザーへの権限付与」をご参照ください。
ビジネス要件に基づいてポリシーを選択することもできます。
|
ポリシー名 |
説明 |
|
AliyunCloudMonitorFullAccess |
CloudMonitor を完全に管理するための権限。 |
|
AliyunCloudMonitorReadOnlyAccess |
CloudMonitor に対する読み取り専用権限。 |
|
AliyunCloudMonitorMetricDataReadOnlyAccess |
CloudMonitor の時系列メトリックデータを読み取るための権限。 |