ApsaraDB for SelectDB は、Alibaba Cloud Application Real-Time Monitoring Service (ARMS) のアラート機能を統合しています。 SelectDB コンソールでは、アラートルールと監視項目を設定できます。監視項目のアラートルールがトリガーされると、アラート連絡先グループ内のすべての連絡先に通知されます。また、アラートがトリガーされたときに関連する連絡先に迅速に通知されるように、監視項目のアラート連絡先グループを管理することもできます。重要な監視メトリックにアラートルールを設定することで、迅速に通知を受け、SelectDB インスタンスのメトリックデータに異常が発生したときに、障害をすばやく特定してトラブルシューティングを行うことができます。このトピックでは、SelectDB コンソールでアラートルールを設定する方法について説明します。
アラートルールは、 ApsaraDB for SelectDB インスタンスについて、CloudMonitor コンソールで設定することもできます。 詳細については、クラウドサービスのモニタリングをご参照ください。
前提条件
ApsaraDB for SelectDB サービスリンクロールである AliyunServiceRoleForSelectDB を作成する必要があります。デフォルトでは、このロールは ARMS サービスにアクセスする権限を持ちます。詳細については、「サービスリンクロール」をご参照ください。
お使いの ApsaraDB for SelectDB インスタンスからモニタリングデータを、お客様自身の ARMS にレポートして一元的なモニタリングとアラートを行うには、まず ARMS サービスを有効化する必要があります。詳細については、「ARMS を有効化する」をご参照ください。
操作手順
ApsaraDB for SelectDB コンソールにログインします。
ページの左上隅で、インスタンスが配置されているリージョンを選択します。
インスタンスリスト ページで、目的の インスタンス ID をクリックして インスタンスの詳細 ページに移動します。
左側のナビゲーションペインで、モニタリングとアラート をクリックします。
モニタリングとアラート ページで、アラート管理 タブをクリックし、次に[SelectDB 監視アラートの作成]をクリックします。
説明アラート管理 タブをクリックすると、[SelectDB モニタリングアラートリスト] ページが読み込まれるまでに 3~5 秒かかる場合があります。
[SelectDB モニタリングアラートの作成] ページで、パラメーターを設定します。
アラートルールは、静的しきい値またはカスタム PromQL クエリのいずれかを使用して作成できます。
静的しきい値:事前設定されたアラートメトリクスが用意されています。メトリクスを選択して、条件を定義することで、アラートルールを迅速に作成できます。
カスタム PromQL:カスタム PromQL クエリを記述してアラートルールを作成します。これは、事前設定されたリストにないメトリクスに役立ちます。
静的しきい値
パラメーター
説明
例
[アラート名]
アラートルールの名前。
CPU 使用率アラート
[検出タイプ]
Static threshold を選択します。
静的しきい値
[インスタンス]
アラートルールのインスタンスを選択します。
デフォルト値は [走査] で、アラートルールがすべてのインスタンスに適用されることを意味します。
selectdb-cn-7213n****
[クラスター]
アラートルールのクラスターを選択します。
デフォルト値は [走査] で、アラートルールがすべてのクラスターに適用されることを意味します。
selectdb-cn-7213n****-be
アラート連絡先グループ
連絡先グループを選択します。
サポートされている連絡先グループは、Prometheus インスタンスのタイプによって異なります。使用可能なオプションは、選択した Prometheus インスタンスのタイプに基づいて変わります。
SelectDB 監視アラート
[アラートメトリクス]
アラートのメトリクスを選択します。各連絡先グループには、異なるメトリクスのセットが用意されています。
CPU 使用率
[アラート条件]
選択したメトリクスに基づいてアラートをトリガーする条件を定義します。
CPU 使用率が 80% を超えるとアラートが送信されます。
[フィルタリング条件]
フィルターなし
なし
[データプレビュー]
データプレビュー セクションには、アラート条件に対応する PromQL クエリが表示され、メトリックの値が時系列のチャートで表示されます。
デフォルトでは、グラフには単一リソースのリアルタイム値が表示されます。このセクションのフィルターを使用して、異なるリソースや時間範囲のデータを表示します。
説明アラートのしきい値は、グラフ内に赤い破線で表示されます。曲線は、しきい値に達すると赤に変わり、それ以外は青色のままです。
時系列曲線にカーソルを合わせると、特定の時点でのリソース詳細を表示できます。
時系列グラフで時間範囲を選択すると、その期間の曲線を表示できます。
なし
[実行時刻]
条件が満たされた場合にアラートイベントを生成:いずれかのデータポイントがしきい値に達した場合にアラートをトリガーします。
条件が N 分間持続した場合にアラートイベントを生成:条件が少なくとも N 分間持続した場合にのみアラートをトリガーします。
1
[アラートレベル]
アラートの重要度レベル。デフォルトレベルは Default です。重要度は Default、P4、P3、P2、P1 の順に高くなります。
P2
[アラートの内容]
ユーザーが受信するアラート通知の内容。Go テンプレート構文を使用して、アラートメッセージ内のパラメーター変数をカスタマイズできます。
ノード: {{$labels.pod_name}} CPU 使用率 {{$labels.metrics_params_opt_label_value}} {{$labels.metrics_params_value}}%、現在の値 {{ printf "%.2f" $value }}%
[アラート通知]
[最小モード]では、アラーム送信先、通知時間帯、および 繰り返しポリシー をすばやく設定できます。
[通常モード]: 通知ポリシーを選択できます。ポリシーが存在しない場合は、[通知ポリシーの作成] をクリックして作成します。詳細については、「通知ポリシー」をご参照ください。
重要通知ポリシーを指定することで、現在のアラートルールからのアラートイベントが、選択された通知ポリシーによって確実に照合されます。ただし、これらのイベントは、あいまい一致を使用する他の通知ポリシーによっても照合される可能性があります。アラートイベントと通知ポリシーの関係は多対多です。
なし
[詳細設定]
[アラートチェックサイクル]:アラートルールが評価される間隔。デフォルトおよび最小値は 1 分です。
[データが完全になった後にチェック]:評価前にデータの完全性を保証します。これはデフォルトで有効になっており、この設定を有効にしておくことを推奨します。
[ラベル (labels)]:アラートにタグを割り当てます。通知ポリシーは、これらのタグを照合に使用できます。
[注釈]:アラートのアノテーションを設定します。
アラートチェックサイクル:1 分
データが完全になった後にチェック:はい
タグ:なし
アノテーション:なし
カスタム PromQL
パラメーター
説明
例
[アラート名]
アラートルールの名前。
Pod の CPU 使用率が 80% を超える
[検出タイプ]
カスタム PromQL に設定します。
カスタム PromQL
[インスタンス]
アラートルールのインスタンスを選択します。
selectdb-cn-7213n****
[クラスター]
アラートルールのクラスターを選択します。
selectdb-cn-7213n****-be
[アラートグループを参照]
連絡先グループを選択します。
サポートされている連絡先グループは、Prometheus インスタンスのタイプによって異なります。使用可能なオプションは、選択した Prometheus インスタンスのタイプに基づいて変わります。
SelectDB 監視アラート
[アラートメトリックを参照]
(オプション) 参照メトリクスを選択して、その PromQL テンプレートを開始点として使用します。その後、事前に入力されたクエリを修正できます。
使用可能な参照メトリクスは、選択した Prometheus インスタンスのタイプに基づいて自動的にフィルターされます。
説明アラートメトリックを参照 で提供されるテンプレートは不完全なため、修正して有効な カスタム PromQL ステートメント を作成する必要があります。
99 パーセンタイルのクエリレイテンシー
[カスタム PromQL ステートメント]
PromQL クエリを使用してアラート式を定義します。
avg(doris_fe_query_latency_ms{quantile="0.99",pod=~,cluster_id=~}) by (cluster_id) > 300
[データプレビュー]
データプレビュー セクションには、アラート条件に対応する PromQL クエリが表示され、メトリックの値が時系列でグラフ化されます。
デフォルトでは、グラフには単一リソースのリアルタイム値が表示されます。このセクションのフィルターを使用して、異なるリソースや時間範囲のデータを表示します。
説明アラートのしきい値は、グラフ内に赤い破線で表示されます。曲線は、しきい値に達すると赤に変わり、それ以外は青色のままです。
時系列曲線にカーソルを合わせると、特定の時点でのリソース詳細を表示できます。
グラフで時間範囲を選択すると、その期間の時系列曲線にズームインできます。
なし
[実行時刻]
[アラート条件が満たされると、アラートイベントが直接生成されます]:いずれかのデータポイントがしきい値に達した場合にアラートをトリガーします。
[条件が N 分間持続した場合にアラートイベントを生成]:条件が少なくとも N 分間持続した場合にのみアラートをトリガーします。
1
[アラートレベル]
アラートの重要度レベル。デフォルトは Default です。重要度は、Default、P4、P3、P2、P1 の順に高くなります。
デフォルト
[アラートの内容]
ユーザーが受信するアラート通知の内容。Go テンプレート構文を使用して、アラートメッセージ内のパラメーター変数をカスタマイズできます。
名前空間: {{$labels.namespace}}/Pod: {{$labels.pod_name}}/ディスクデバイス: {{$labels.device}} の使用率が 90% を超えました、現在の値 {{ printf "%.2f" $value }}%
[アラート通知]
[最小モード]:アラーム送信先、通知時間帯、および繰り返しポリシーをすばやく設定できます。
[通常モード]: 通知ポリシーを選択できます。ポリシーが存在しない場合は、[通知ポリシーの作成] をクリックして作成します。詳細については、「通知ポリシー」をご参照ください。
重要通知ポリシーを指定することで、現在のアラートルールからのアラートイベントが、選択された通知ポリシーによって確実に照合されます。ただし、これらのイベントは、あいまい一致を使用する他の通知ポリシーによっても照合される可能性があります。アラートイベントと通知ポリシーの関係は多対多です。
なし
[詳細設定]
[アラートチェックサイクル]:アラートルールが評価される間隔。デフォルトおよび最小値は 1 分です。
[データが完全になった後にチェック]:評価前にデータの完全性を保証します。これはデフォルトで有効になっており、この設定を有効にしておくことを推奨します。
[ラベル (labels)]:アラートにタグを割り当てます。通知ポリシーは、これらのタグを照合に使用できます。
[注釈]:アラートのアノテーションを設定します。
アラートチェックサイクル:1 分
データが完全になった後にチェック:はい
タグ:なし
アノテーション:なし
パラメーターを設定した後、保存 をクリックすると、アラートルールは直ちに有効になります。
推奨アラート設定
要件に基づいてアラートを設定できます。次の表に、一般的なメトリクスと推奨設定を示します。
メトリクス | しきい値 | 期間 (分) | 注 |
[クエリレート] | >5000 | 5 | ミリ秒 (ms) 単位の平均クエリレイテンシー。ビジネス要件に基づいてしきい値を調整します。このアラートを設定することを推奨します。 |
[99 パーセンタイルのクエリレイテンシー] | >60000 | 5 | ミリ秒 (ms) 単位のロングテールクエリレイテンシー。ビジネス要件に基づいてしきい値を調整します。このアラートを設定することを推奨します。 |
[クエリ成功率] | <90 | 5 | SQL クエリの成功率。このアラートを設定することを推奨します。 |
[CPU 使用率] | >80 | 15 | BE クラスターの CPU 使用率。これは一般的な運用メトリクスです。このアラートを設定することを推奨します。 |
[メモリ使用率] | >80 | 15 | BE クラスターのメモリ使用率。これは一般的な運用メトリクスです。このアラートを設定することを推奨します。 |
[FE CPU 使用率] | >60 | 15 | FE クラスターの CPU 使用率。このアラートを設定することを推奨します。リソースが不足している場合は、チケットを起票して無料のスケールアウトをリクエストしてください。 |
[FE JVM メモリ使用率] | >80 | 15 | FE クラスターの JVM メモリ使用率。このアラートを設定することを推奨します。リソースが不足している場合は、チケットを起票して無料のスケールアウトをリクエストしてください。 |
[失敗したノード数] | >0 | 1 | コンピューティングクラスター内の基盤となるノードの再起動回数。必要に応じて設定します。 |
[ベースコンパクションスコア] | >1500 | 15 | 値が高いほど、コンピューティングノードのデータコンパクションの負荷が大きくなります。このアラートを設定することを推奨します。 |
[累積コンパクションスコア] | >1500 | 15 | 値が高いほど、コンピューティングノードのデータコンパクションの負荷が大きくなります。このアラートを設定することを推奨します。 |
[キャッシュヒット率] | <90 | 15 | キャッシュヒット率はクエリレイテンシーに影響します。このアラートを設定することを推奨します。このメトリクスが低下した場合は、クラスターのスケールアウトを検討してください。詳細については、「クラスターのスケール」をご参照ください。 |
[User Connection Count] | >150 | 15 | データベースユーザーからデータベースへの総接続数。ユーザーあたりの最大接続数はデフォルトで 200 です。このメトリクスはビジネスのワークロードに固有であるため、通常の使用状況に基づいてこのアラートを設定することを推奨します。 |
[1 秒あたりのクエリ数 (QPS)] | なし | なし | このメトリクスはワークロードに依存します。必要に応じて設定します。 |
[ディスク書き込み IOPS] | なし | なし | 基盤となるシステムメトリクスであり、通常は主要なビジネス上の懸念事項ではありません。高度なトラブルシューティングのために必要に応じて設定します。 |
[ディスク読み込み IOPS] | なし | なし | 基盤となるシステムメトリクスであり、通常は主要なビジネス上の懸念事項ではありません。高度なトラブルシューティングのために必要に応じて設定します。 |
[Object Storage Service 容量] | なし | なし | ストレージ使用量を監視する必要がある場合は、このアラートを設定します。 |
[インポートデータ速度] | なし | なし | データインポート速度を監視する必要がある場合は、このアラートを設定します。 |
[キャッシュ書き込みスループット] | なし | なし | 基盤となるシステムメトリクスであり、通常は主要なビジネス上の懸念事項ではありません。高度なトラブルシューティングのために必要に応じて設定します。 |
[キャッシュ読み取りスループット] | なし | なし | 基盤となるシステムメトリクスであり、通常は主要なビジネス上の懸念事項ではありません。高度なトラブルシューティングのために必要に応じて設定します。 |
[ネットワーク流入スループット] | なし | なし | 基盤となるシステムメトリクスであり、通常は主要なビジネス上の懸念事項ではありません。高度なトラブルシューティングのために必要に応じて設定します。 |
[ネットワーク流出スループット] | なし | なし | 基盤となるシステムメトリクスであり、通常は主要なビジネス上の懸念事項ではありません。高度なトラブルシューティングのために必要に応じて設定します。 |
[リモートストレージ読み取りスループット] | なし | なし | 基盤となるシステムメトリクスであり、通常は主要なビジネス上の懸念事項ではありません。高度なトラブルシューティングのために必要に応じて設定します。 |