すべてのプロダクト
Search
ドキュメントセンター

Container Service for Kubernetes:Fluid コンポーネントモニタリングの有効化

最終更新日:Apr 02, 2026

Fluid は、ビッグデータや AI といったクラウドネイティブ環境のデータ集約型アプリケーション向けに設計された、オープンソースの Kubernetes ネイティブな分散データセットオーケストレーションおよびアクセラレーションエンジンです。Fluid は、統一されたデータセット抽象化、拡張可能なデータエンジン・プラグイン、自動化されたデータ操作、汎用的なデータアクセラレーション、およびランタイムの独立性を提供します。Managed Service for Prometheus は、Fluid コンポーネントのワンクリックインストールをサポートし、すぐに使えるモニタリングダッシュボードも含まれています。このトピックでは、Managed Service for Prometheus を使用して Fluid をモニタリングする方法について説明します。

前提条件

  • ご利用の ACK クラスターまたは ACK Serverless クラスターで Managed Service for Prometheus が有効化されていること。詳細については、「Managed Service for Prometheus」をご参照ください。

  • クラウドネイティブ AI スイートがデプロイされ、Fluid データアクセラレーションが有効化されていること。詳細については、「クラウドネイティブ AI スイートのデプロイ」をご参照ください。

    • Fluid コントロールプレーンダッシュボードのすべての機能を使用するには、クラスターで ack-fluid バージョン 0.9.7 以降が実行されていることを確認してください。

    • Fluid JindoRuntime キャッシュシステムダッシュボードのすべての機能を使用するには、クラスターで ack-fluid バージョン 1.0.11 以降が実行されていることを確認してください。

制限事項

キャッシュシステムダッシュボードは、JindoRuntime キャッシュランタイムコンポーネント (キャッシュエンジンとして JindoCache を使用) のみをモニタリングできます。

ステップ 1:Fluid の統合

  1. ARMS コンソールにログインします。

  2. 左側のナビゲーションウィンドウで インテグレーションセンター をクリックします。人工知能 セクションで、Fluid カードをクリックします。

  3. Fluid ページで、コンテナサービスクラスターの選択 セクションでターゲットクラスターを選択します。Fluid コンポーネントがすでにインストールされている場合は、再インストールする必要はありません。

  4. 設定情報 セクションでパラメーターを設定し、OK をクリックします。

    パラメーター

    説明

    統合名 (任意)

    Fluid モニタリングインスタンスの一意の名前。このフィールドは空白のままでもかまいません。

    メトリック収集間隔 (秒)

    メトリックを収集する間隔。

  5. ARMS コンソールの 統合管理 ページで、統合されたコンポーネントを表示できます。

    1. ARMS コンソールにログインします。

    2. 左側のナビゲーションウィンドウで 統合管理 をクリックします。統合コンポーネント タブで、Fluid カードをクリックします。

    3. 環境リスト タブで、ターゲットクラスターの Actions 列にある 詳細を見る をクリックして、Fluid コンポーネントやダッシュボードのアラートルールなどの詳細を表示します。

ステップ 2:Fluid ダッシュボードの表示

ACK コンソール

  1. ACK コンソールにログインします。左側のナビゲーションウィンドウで クラスターリスト をクリックします。

  2. クラスターリスト ページで、Fluid コンポーネントが含まれる ACK クラスターまたは ACK Serverless クラスター をクリックします。左側のナビゲーションウィンドウで、操作 > Prometheus 監視 を選択します。

  3. Prometheus 監視 ページで、その他 を選択して、Fluid コントロールプレーンダッシュボードを表示します。

    ダッシュボードには、Prometheus モニタリングからのメトリックが表示されます。これには、Fluid コンポーネントの実行ステータス、Fluid コントローラーの処理レイテンシ、Fluid Webhook リクエストの QPS とレイテンシ、各コンポーネントのリソース使用量などが含まれます。詳細については、「Fluid モニタリングダッシュボードのパラメーター」をご参照ください。

    • コンポーネント実行ステータス セクションには、Fluid コントロールプレーンコンポーネントの準備完了 Pod 数、履歴再起動回数、再起動時間が表示されます。组件运行状态

    • Fluid コントローラー詳細メトリック セクションには、Fluid コントローラーコンポーネントのワークロードレベル、処理失敗、Kubernetes API リクエストが表示されます。控制器详细指标

    • Fluid Webhook 詳細メトリック セクションには、Fluid Webhook コンポーネントのリソース使用量、処理済みリクエスト数、リクエスト処理レイテンシが表示されます。webhook详细指标

    • リソース使用量 セクションには、Fluid コントロールプレーンのすべてのコンポーネントのリソース使用量とネットワークトラフィックレートが表示されます。资源使用

  4. Prometheus 監視 ページで、その他 を選択して、Fluid JindoRuntime キャッシュシステムダッシュボードを表示します。

    Fluid JindoRuntime キャッシュシステムダッシュボードには、Fluid JindoRuntime キャッシュシステムの詳細が表示されます。これには、データセット概要、キャッシュシステムメトリック、FUSE クライアントメトリックが含まれます。詳細については、「Fluid モニタリングダッシュボードのパラメーター」をご参照ください。

    • データセット概要 セクションでは、選択した Fluid データセットの概要が提供されます。これには、キャッシュシステムで実行中の Master、Worker、FUSE コンポーネント Pod の数、および各 Pod のリソース構成が含まれます。

      image

    • キャッシュシステムメトリック セクションには、選択したキャッシュシステムのサーバー側メトリックが表示されます。これには、使用済みキャッシュ容量、キャッシュヒット率、集約帯域幅、メタデータ操作の QPS が含まれます。

      image

    • FUSE メトリック (CSI 経由) セクションには、FUSE Pod 内の Fluid CSI プラグインでマウントされた FUSE ファイルシステムのクライアント側メトリックが表示されます。メトリックには、ネットワーク I/O、メタデータ操作のレイテンシと QPS、各 FUSE Pod の読み書き操作のレイテンシと QPS が含まれます。

      image

    • FUSE メトリック (サイドカー経由) セクションには、Fluid FUSE サイドカーコンテナにマウントされた FUSE ファイルシステムのクライアント側メトリックが表示されます。これらには、メタデータ操作のレイテンシと QPS、および読み書き操作のレイテンシと QPS が含まれます。

      image

ARMS コンソール

  1. ARMS コンソールにログインします。

  2. 左側のナビゲーションウィンドウで インテグレーションセンター をクリックします。コンポーネントタイプ セクションで Fluid を選択し、ダッシュボード タブをクリックしてから、ページ下部の Fluid Control Plane をクリックして Fluid コントロールプレーンダッシュボードを表示します。

    ダッシュボードには、Prometheus モニタリングからのメトリックが表示されます。これには、Fluid コンポーネントの実行ステータス、Fluid コントローラーの処理レイテンシ、Fluid Webhook リクエストの QPS とレイテンシ、各コンポーネントのリソース使用量などが含まれます。詳細については、「Fluid モニタリングダッシュボードのパラメーター」をご参照ください。

    • コンポーネント実行ステータス セクションには、Fluid コントロールプレーンコンポーネントの準備完了 Pod 数、履歴再起動回数、再起動時間が表示されます。

    • Fluid コントローラー詳細メトリック セクションには、Fluid コントローラーコンポーネントのワークロードレベル、処理失敗、Kubernetes API リクエストが表示されます。

    • Fluid Webhook 詳細メトリック セクションには、Fluid Webhook コンポーネントのリソース使用量、処理済みリクエスト数、リクエスト処理レイテンシが表示されます。

    • リソース使用量 セクションには、Fluid コントロールプレーンのすべてのコンポーネントのリソース使用量とネットワークトラフィックレートが表示されます。

  3. 左側のナビゲーションウィンドウで インテグレーションセンター をクリックします。コンポーネントタイプ セクションで Fluid を選択し、ダッシュボード タブをクリックしてから、ページ下部の Fluid JindoRuntime Dashboard をクリックして Fluid JindoRuntime キャッシュシステムダッシュボードを表示します。

    • データセット概要 セクションでは、選択した Fluid データセットの概要が提供されます。これには、キャッシュシステムで実行中の Master、Worker、FUSE コンポーネント Pod の数、および各 Pod のリソース構成が含まれます。

    • キャッシュシステムメトリック セクションには、選択したキャッシュシステムのサーバー側メトリックが表示されます。これには、使用済みキャッシュ容量、キャッシュヒット率、集約帯域幅、メタデータ操作の QPS が含まれます。

    • FUSE メトリック (CSI 経由) セクションには、FUSE Pod 内の Fluid CSI プラグインでマウントされた FUSE ファイルシステムのクライアント側メトリックが表示されます。メトリックには、ネットワーク I/O、メタデータ操作のレイテンシと QPS、各 FUSE Pod の読み書き操作のレイテンシと QPS が含まれます。

    • FUSE メトリック (サイドカー経由) セクションには、Fluid FUSE サイドカーコンテナにマウントされた FUSE ファイルシステムのクライアント側メトリックが表示されます。これらには、メタデータ操作のレイテンシと QPS、および読み書き操作のレイテンシと QPS が含まれます。

メトリック

次の表に、Fluid コントロールプレーンコンポーネントで使用されるメトリックを示します。

メトリック

タイプ

説明

dataset_ufs_total_size

ゲージ

クラスター内のアクティブな Dataset リソースによってマウントされたデータセットの合計サイズ。

dataset_ufs_file_num

ゲージ

クラスター内のアクティブな Dataset リソースによってマウントされたデータセット内のファイル数。

runtime_setup_error_total

カウンター

コントローラーの調整中に失敗したランタイムセットアップ操作の総数。

runtime_sync_healthcheck_error_total

カウンター

コントローラーの調整中に失敗したランタイムヘルスチェック操作の総数。

controller_runtime_reconcile_time_seconds_bucket

ヒストグラム

コントローラーの調整ループの持続時間。

controller_runtime_reconcile_errors_total

カウンター

コントローラーの調整失敗の総数。

controller_runtime_reconcile_total

カウンター

完了したコントローラー調整ループの総数。

controller_runtime_max_concurrent_reconciles

ゲージ

コントローラーで利用可能な調整コルーチンの最大数。

controller_runtime_active_workers

ゲージ

コントローラーで現在アクティブな調整コルーチンの数。

workqueue_adds_total

カウンター

コントローラーのワークキューによって処理された追加イベントの総数。

workqueue_depth

ゲージ

コントローラーのワークキューの現在の深さ。

workqueue_queue_duration_seconds_bucket

ヒストグラム

アイテムが処理される前にコントローラーのワークキューで待機する時間。

workqueue_work_duration_seconds_bucket

ヒストグラム

ワークキューからアイテムを処理するのにかかった時間のディストリビューション。

workqueue_unfinished_work_seconds

ゲージ

ワークキューによって現在処理されている未完了タスクの合計持続時間。

workqueue_longest_running_processor_seconds

ゲージ

単一タスクの最長記録処理時間。

rest_client_requests_total

カウンター

状態コード、メソッド、ホスト別に分類された HTTP リクエストの数。

rest_client_request_duration_seconds_bucket

ヒストグラム

動詞と URL で分類された HTTP リクエストのレイテンシ。

controller_runtime_webhook_requests_in_flight

ゲージ

現在処理中の Webhook リクエストの数。

controller_runtime_webhook_requests_total

カウンター

Webhook によって処理されたリクエストの総数。

controller_runtime_webhook_latency_seconds_bucket

ヒストグラム

Webhook によって処理されたリクエストのレイテンシ。

process_cpu_seconds_total

カウンター

プロセスによって消費された合計 CPU 時間 (秒単位)。

process_resident_memory_bytes

ゲージ

プロセスの常駐メモリサイズ (バイト単位)。

次の表に、Fluid JindoRuntime キャッシュダッシュボード用に JindoCache サーバーが公開するメトリックを示します。

メトリック

タイプ

説明

jindocache_server_total_stsnodes_num

ゲージ

分散キャッシュ内のアクティブなワーカーコンポーネントレプリカの数。

jindocache_server_total_disk_cap

ゲージ

分散キャッシュ内のディスクベースのメディア (tmpfs などの RAM ディスクを含む) の最大キャッシュ容量。

jindocache_server_total_used_disk_cap

ゲージ

分散キャッシュ内のディスクベースのメディア (tmpfs などの RAM ディスクを含む) で使用されている合計キャッシュスペース。

jindocache_server_total_mem_cap

ゲージ

分散キャッシュ内のプロセスメモリに保存されている最大キャッシュ容量。

jindocache_server_total_used_mem_cap

ゲージ

分散キャッシュ内のプロセスメモリで使用されている合計キャッシュスペース。

jindocache_server_total_used_rocksdb_cap

ゲージ

分散キャッシュで使用されている RocksDB の容量。

jindocache_server_backend_read_bytes_total

ゲージ

オリジンフェッチ中にバックエンドストレージから読み取られたデータの合計量 (バイト単位)。

オリジンフェッチは、要求されたデータが JindoCache 分散キャッシュに見つからず、バックエンドストレージシステムから取得する必要がある場合に発生します。

jindocache_server_backend_read_time_total

ゲージ

オリジンフェッチ中にバックエンドストレージからデータを読み取るのに費やされた合計時間 (マイクロ秒単位)。

jindocache_server_backend_readop_num_total

ゲージ

オリジンフェッチ中のバックエンドストレージからの読み取り操作の総数。このカウントは JindoCache のブロック数に対応します。

jindocache_server_backend_read_bytes_time_total_window

ゲージ

1 分間のウィンドウ内でオリジンフェッチ中にバックエンドストレージからデータを読み取るのに費やされた時間 (マイクロ秒単位)。

jindocache_server_backend_read_bytes_total_window

ゲージ

1 分間のウィンドウ内でオリジンフェッチ中にバックエンドストレージから読み取られたデータの合計量 (バイト単位)。

jindocache_server_remote_read_bytes_total

ゲージ

同じクラスター内のリモートキャッシュヒットから読み取られたデータの合計量 (バイト単位)。

リモートキャッシュヒットは、要求されたデータが JindoCache 分散キャッシュ内にありますが、アプリケーションとは異なるノードにある場合に発生します。

jindocache_server_remote_read_time_total

ゲージ

同じクラスター内のリモートキャッシュヒット読み取り操作に費やされた合計時間 (マイクロ秒単位)。

jindocache_server_remote_readop_num_total

ゲージ

同じクラスター内のリモートキャッシュヒット読み取り操作の総数。

jindocache_server_remote_read_bytes_time_total_window

ゲージ

1 分間のウィンドウ内でリモートキャッシュヒット読み取り操作に費やされた時間 (マイクロ秒単位)。

jindocache_server_remote_read_bytes_total_window

ゲージ

1 分間のウィンドウ内でリモートキャッシュヒットから読み取られたデータの合計量 (バイト単位)。

jindocache_server_local_read_bytes_total

ゲージ

同じクラスター内のローカルキャッシュヒットから読み取られたデータの合計量 (バイト単位)。

ローカルキャッシュヒットは、要求されたデータがアプリケーションと同じノード上の JindoCache 分散キャッシュにある場合に発生します。

jindocache_server_local_read_time_total

ゲージ

同じクラスター内のローカルキャッシュヒット読み取り操作に費やされた合計時間 (マイクロ秒単位)。

jindocache_server_local_readop_num_total

ゲージ

同じクラスター内のローカルキャッシュヒット読み取り操作の総数。

jindocache_server_local_read_bytes_time_total_window

ゲージ

1 分間のウィンドウ内でローカルキャッシュヒット読み取り操作に費やされた時間 (マイクロ秒単位)。

jindocache_server_local_read_bytes_total_window

ゲージ

1 分間のウィンドウ内でローカルキャッシュヒットから読み取られたデータの合計量 (バイト単位)。

jindocache_server_ns_filelet_op_count_total

ゲージ

JindoCache マスターコンポーネントによって追跡されるファイルメタデータ操作 (getAttr および listStatus を含む) の総数。

jindocache_server_ns_filelet_op_time_total

ゲージ

JindoCache マスターコンポーネントによるファイルメタデータ操作 (getAttr および listStatus を含む) の処理に費やされた合計時間。

jindocache_server_ns_get_attr_op_total

ゲージ

JindoCache マスターコンポーネントによって追跡される getAttr 操作の総数。

jindocache_server_ns_get_attr_time_total

ゲージ

JindoCache マスターコンポーネントによる getAttr 操作の処理に費やされた合計時間。

jindocache_server_ns_get_attr_fallback_op_total

ゲージ

JindoCache マスターコンポーネントがファイルメタデータを取得するためにバックエンドストレージからオリジンフェッチを実行した合計回数。

jindocache_server_ns_list_status_op_total

ゲージ

JindoCache マスターコンポーネントによって追跡される listStatus 操作の総数。

jindocache_server_ns_list_status_time_total

ゲージ

JindoCache マスターコンポーネントによる listStatus 操作の処理に費やされた合計時間。

jindocache_server_ns_list_status_fallback_op_total

ゲージ

JindoCache マスターコンポーネントがファイルリストを取得するためにバックエンドストレージシステムにオリジンフェッチを実行した合計回数。

jindocache_server_dist_get_attr_op_num_total

ゲージ

JindoCache クライアントによって追跡される getAttr 操作の総数。

jindocache_server_dist_get_attr_time_total

ゲージ

JindoCache クライアントによる getAttr 操作の処理に費やされた合計時間。

jindocache_server_dist_list_dir_op_num_total

ゲージ

JindoCache クライアントによって追跡されるディレクトリ一覧表示操作の総数。

jindocache_server_dist_list_dir_time_total

ゲージ

JindoCache クライアントによるディレクトリ一覧表示操作の処理に費やされた合計時間。

次の表に、Fluid JindoRuntime キャッシュダッシュボード用に JindoCache FUSE クライアントが公開するメトリックを示します。

メトリック

タイプ

説明

jindo_fuse_open_count

ゲージ

Jindo FUSE クライアントによって実行された open 操作の数。

jindo_fuse_open_latency

ゲージ

Jindo FUSE クライアントの open 操作の P50 (50 パーセンタイル) レイテンシ。

jindo_fuse_open_latency_80

ゲージ

Jindo FUSE クライアントの open 操作の P80 (80 パーセンタイル) レイテンシ。

jindo_fuse_open_latency_90

ゲージ

Jindo FUSE クライアントの open 操作の P90 (90 パーセンタイル) レイテンシ。

jindo_fuse_open_latency_99

ゲージ

Jindo FUSE クライアントの open 操作の P99 (99 パーセンタイル) レイテンシ。

jindo_fuse_open_latency_999

ゲージ

Jindo FUSE クライアントの open 操作の P99.9 (99.9 パーセンタイル) レイテンシ。

jindo_fuse_open_latency_9999

ゲージ

Jindo FUSE クライアントの open 操作の P99.99 (99.99 パーセンタイル) レイテンシ。

jindo_fuse_getattr_count

ゲージ

Jindo FUSE クライアントによって実行された getAttr 操作の数。

jindo_fuse_getattr_latency

ゲージ

Jindo FUSE クライアントの getAttr 操作の P50 (50 パーセンタイル) レイテンシ。

jindo_fuse_getattr_latency_80

ゲージ

Jindo FUSE クライアントの getAttr 操作の P80 (80 パーセンタイル) レイテンシ。

jindo_fuse_getattr_latency_90

ゲージ

Jindo FUSE クライアントの getAttr 操作の P90 (90 パーセンタイル) レイテンシ。

jindo_fuse_getattr_latency_99

ゲージ

Jindo FUSE クライアントの getAttr 操作の P99 (99 パーセンタイル) レイテンシ。

jindo_fuse_getattr_latency_999

ゲージ

Jindo FUSE クライアントの getAttr 操作の P99.9 (99.9 パーセンタイル) レイテンシ。

jindo_fuse_getattr_latency_9999

ゲージ

Jindo FUSE クライアントの getAttr 操作の P99.99 (99.99 パーセンタイル) レイテンシ。

jindo_fuse_readdir_count

ゲージ

Jindo FUSE クライアントによって実行された readdir 操作の数。

jindo_fuse_readdir_latency

ゲージ

Jindo FUSE クライアントの readdir 操作の P50 (50 パーセンタイル) レイテンシ。

jindo_fuse_readdir_latency_80

ゲージ

Jindo FUSE クライアントの readdir 操作の P80 (80 パーセンタイル) レイテンシ。

jindo_fuse_readdir_latency_90

ゲージ

Jindo FUSE クライアントの readdir 操作の P90 (90 パーセンタイル) レイテンシ。

jindo_fuse_readdir_latency_99

ゲージ

Jindo FUSE クライアントの readdir 操作の P99 (99 パーセンタイル) レイテンシ。

jindo_fuse_readdir_latency_999

ゲージ

Jindo FUSE クライアントの readdir 操作の P99.9 (99.9 パーセンタイル) レイテンシ。

jindo_fuse_readdir_latency_9999

ゲージ

Jindo FUSE クライアントの readdir 操作の P99.99 (99.99 パーセンタイル) レイテンシ。

jindo_fuse_read_count

ゲージ

Jindo FUSE クライアントによって実行された read 操作の数。

jindo_fuse_read_latency

ゲージ

Jindo FUSE クライアントの read 操作の P50 (50 パーセンタイル) レイテンシ。

jindo_fuse_read_latency_80

ゲージ

Jindo FUSE クライアントの read 操作の P80 (80 パーセンタイル) レイテンシ。

jindo_fuse_read_latency_90

ゲージ

Jindo FUSE クライアントの read 操作の P90 (90 パーセンタイル) レイテンシ。

jindo_fuse_read_latency_99

ゲージ

Jindo FUSE クライアントの read 操作の P99 (99 パーセンタイル) レイテンシ。

jindo_fuse_read_latency_999

ゲージ

Jindo FUSE クライアントの read 操作の P99.9 (99.9 パーセンタイル) レイテンシ。

jindo_fuse_read_latency_9999

ゲージ

Jindo FUSE クライアントの read 操作の P99.99 (99.99 パーセンタイル) レイテンシ。

jindo_fuse_write_count

ゲージ

Jindo FUSE クライアントによって実行された write 操作の数。

jindo_fuse_write_latency

ゲージ

Jindo FUSE クライアントの write 操作の P50 (50 パーセンタイル) レイテンシ。

jindo_fuse_write_latency_80

ゲージ

Jindo FUSE クライアントの write 操作の P80 (80 パーセンタイル) レイテンシ。

jindo_fuse_write_latency_90

ゲージ

Jindo FUSE クライアントの write 操作の P90 (90 パーセンタイル) レイテンシ。

jindo_fuse_write_latency_99

ゲージ

Jindo FUSE クライアントの write 操作の P99 (99 パーセンタイル) レイテンシ。

jindo_fuse_write_latency_999

ゲージ

Jindo FUSE クライアントの write 操作の P99.9 (99.9 パーセンタイル) レイテンシ。

jindo_fuse_write_latency_9999

ゲージ

Jindo FUSE クライアントの write 操作の P99.99 (99.99 パーセンタイル) レイテンシ。

参照