このトピックでは、コンテナイベント監視を Managed Service for Prometheus と統合する方法、およびダッシュボードの表示とアラートルールの設定方法について説明します。 イベント監視は、Kubernetes における監視方法であり、適時性、正確性、シナリオカバレッジにおけるリソース監視の制限を補完します。 SLS の Kubernetes イベントセンターで NPD (node-problem-detector) を使用し、NPD クラスターチェックと異常イベントオフライン機能を設定し、DingTalk、SLS オフライン Kubernetes イベント、EventBridge オフライン Kubernetes イベントを使用することで、クラスターの異常や問題をリアルタイムで監視できます。
前提条件
-
Managed Service for Prometheus が有効になっていること。詳細については、「Prometheus インスタンスの課金」をご参照ください。
-
Kubernetes クラスターが作成済みであること。詳細については、「ACK マネージドクラスターの作成」をご参照ください。
-
リソースセンターが有効になっていること。詳細については、「リソースセンターのアクティブ化」をご参照ください。
手順1:コンテナイベントモニタリングのインテグレーション
-
またはPrometheus コンソールにログインします。左側のナビゲーションペインで、 アクセスセンター をクリックします。
-
[Kubernetes イベント] カードをクリックし、統合する Container Service for Kubernetes (ACK) クラスターを選択し、画面の指示に従ってコンポーネントのインテグレーションを完了します。
説明インテグレーション後、完全なデータインジェストには約 1~2 分かかります。インジェストが完了するまで、ダッシュボードにデータは表示されません。
手順2:ダッシュボードの表示
Managed Service for Prometheus は、コンテナモニタリング用に、クラスターの概要、コアコンポーネント、ノード、ポッドなど、さまざまな組み込みダッシュボードを提供します。これらのダッシュボードには、Container Service for Kubernetes (ACK) コンソール、ARMS コンソール、Prometheus コンソールからアクセスできます。
-
またはPrometheus コンソールにログインします。左側のナビゲーションペインで、 アクセス管理 をクリックします。
-
アクセス管理 ページで、 ダッシュボード検索 タブをクリックします。[Select Environment] ドロップダウンリストから、ターゲットコンテナ環境 (例:
mengtu-test-api) を選択します。[Scenario] と [Source Component] のドロップダウンリスト、およびapi-server、etcd、kubernetes、node、storageなどのラベルフィルターを使用してダッシュボードをフィルタリングできます。リストが更新されて、基準に一致する利用可能なダッシュボードが表示されます。
手順3:アラートの設定
-
またはPrometheus コンソールにログインします。左側のナビゲーションペインで、 アクセス管理 をクリックします。
-
アクセス管理 ページで、 アクセス済みの環境 タブをクリックします。コンテナ環境 を選択し、ターゲット環境の名前をクリックして詳細ページを開きます。
-
コンポーネントの管理 タブをクリックします。左側のコンポーネントタイプリストで [Kubernetes イベント] を選択します。次に、右側で [アラートルール] タブをクリックして、組み込みのアラートルールを表示します。
-
組み込みのアラートルールは警告イベントを生成しますが、アラート通知は送信しません。アラート通知をメールアドレスや他のプラットフォームに送信したい場合は、 編集 をクリックして通知ポリシーを設定します。
アラート設定ページでは、アラートのしきい値、期間、内容をカスタマイズできます。アラート設定の詳細については、「Prometheus アラートルールの作成」をご参照ください。
[Alert Notification] セクションで [通常モード] を選択します。[Quickly specify notification policy] ドロップダウンリストから通知ポリシーを選択するか、 [Create notification policy] をクリックします。[詳細設定] を展開し、 [アラートチェック周期] を
1分に設定します。
収集メトリック
|
メトリック |
タイプ |
説明 |
|
eventer_events_error_total |
カウンター |
エラーイベントの総数。 |
|
eventer_events_normal_total |
カウンター |
正常イベントの総数。 |
|
eventer_events_warning_total |
カウンター |
警告イベントの総数。 |
|
eventer_exporter_duration_milliseconds |
サマリー |
イベントのエクスポートにかかった時間 (ミリ秒)。 |
|
eventer_manager_last_time_seconds |
ゲージ |
最後の eventer ハウスキーピングタスクの UNIX タイムスタンプ (秒)。 |
|
eventer_scraper_duration_milliseconds |
サマリー |
イベントのスクレイピングにかかった時間 (ミリ秒)。 |
|
eventer_scraper_events_total_number |
カウンター |
スクレイピングしたイベントの総数。 |
|
eventer_scraper_last_time_seconds |
ゲージ |
最後にスクレイピングしたイベントの UNIX タイムスタンプ (秒)。 |