Managed Service for Prometheus は、Alibaba Cloud Realtime Compute for Apache Flink から収集される一連の Flink メトリックをサポートしています。各メトリックは基本メトリックまたはカスタムメトリックのいずれかであり、その分類によってメトリックのレポートに料金が発生するかどうかが決まります。
メトリックのタイプと課金
Managed Service for Prometheus は、書き込まれたデータ量またはレポートされたデータポイントの数に基づいて課金されます。メトリックは 2 つのカテゴリに分類されます。
基本メトリック — Alibaba Cloud Realtime Compute for Apache Flink から収集された基本メトリックは、Managed Service for Prometheus にレポートまたは書き込まれる際に無料です。この特典は、セルフマネージド Flink などの他の Flink サービスには適用されません。
カスタムメトリック — 基本メトリック以外のメトリックはカスタムメトリックです。カスタムメトリックは 2020 年 1 月 6 日から課金対象となっています。
本トピックの各テーブルのType列には、メトリックが属するカテゴリが記載されています。基本メトリックは、JobManager と TaskManager の JVM およびシステムリソースのセクションに集中しています。残りのセクションのメトリックはカスタムメトリックであるため、ジョブのヘルス状態、レイテンシー、スループット、チェックポイント、ステート、ウィンドウ、および CDC コネクタのデータはレポート時に課金されます。2 つの JVM セクション内では、隣接するメトリックが基本メトリックであっても、8 つの G1 ガベージコレクターメトリックはカスタムメトリックです。
メトリックテーブルの読み方
本トピックのすべてのメトリックテーブルでは、同じ 5 つの列が使用されています。
メトリック — Managed Service for Prometheus にレポートされるメトリック名。
説明 — メトリックが測定する内容。
詳細 — 値の解釈方法、または値が異常に見える場合に確認すべきこと。
単位 — メトリック値の単位。本トピックで使用される値は、
Count、Count/s、Bytes、Bytes/s、ms、およびnsです。タイプ — メトリックのカテゴリ:
BasicまたはCustom。N/Aは、本トピックがそのセルに対して値を提供しないことを意味します。Unit列のN/Aは、そのメトリックに単位が文書化されていないことを意味します。
一部のメトリック名には、メトリックがレポートされるときに置き換えられる可変セグメントが含まれているため、テーブル内の名前は時系列の実際の名ではありません。state_name はメトリックが適用されるステートの名前を表し、cdcns_schema_table は監視対象テーブルの CDC 名前空間、スキーマ名、およびテーブル名を表します。クエリやアラートルールでメトリック名を使用する前に、これらのセグメントを実際の値に置き換えてください。
ジョブのヘルス状態
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_jobmanager_job_numRestarts | エラーによるジョブの再起動回数 | ジョブエラーによる再起動回数。JobManager のフェールオーバーはカウントされません。 | Count | Custom |
flink_jobmanager_job_uptime | ジョブの実行時間 | N/A | ms | Custom |
flink_jobmanager_numRunningJobs | 実行中のジョブの数 | N/A | N/A | Custom |
flink_jobmanager_taskSlotsAvailable | 利用可能なタスクスロットの数 | N/A | N/A | Custom |
flink_jobmanager_taskSlotsTotal | タスクスロットの総数 | N/A | N/A | Custom |
flink_jobmanager_numRegisteredTaskManagers | 登録されている TaskManager の数 | N/A | N/A | Custom |
レイテンシー
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_job_task_operator_currentEmitEventTimeLag | オペレーターが発行するレコードのイベントタイムラグ | 値が大きい場合、ジョブのデータプルまたは処理で遅延が発生している可能性があります。 | ms | Custom |
flink_taskmanager_job_task_operator_currentFetchEventTimeLag | オペレーターがプルするレコードのイベントタイムラグ | 値が大きい場合、ジョブのデータプルで遅延が発生している可能性があります。 | ms | Custom |
flink_taskmanager_job_task_currentInputWatermark | 各タスクが受信した最新のウォーターマークの時刻 | タスクが受信するデータのレイテンシーを示します。 | N/A | Custom |
flink_taskmanager_job_task_operator_watermarkLag | オペレーターのウォーターマークラグ | サブタスクレベルでのジョブのレイテンシーを示します。 | ms | Custom |
スループット
レコードスループット
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_job_task_numRecordsIn | タスクが受信したレコードの総数 | タスクの numRecordsIn の値が長時間増加しない場合、上流でデータがドロップされ、渡されなかった可能性があります。この場合は、上流のデータを確認してください。 | Count | Custom |
flink_taskmanager_job_task_numRecordsOut | タスクが出力したレコードの総数 | タスクの numRecordsOut の値が長時間増加しない場合、ジョブコードの論理エラーによってデータがドロップされ、渡されなかった可能性があります。この場合は、ジョブコードのロジックを確認してください。 | Count | Custom |
flink_taskmanager_job_task_operator_numRecordsIn | オペレーターが受信したレコードの総数 | オペレーターの numRecordsIn の値が長時間増加しない場合、上流でデータがドロップされ、渡されなかった可能性があります。この場合は、上流のデータを確認してください。 | Count | Custom |
flink_taskmanager_job_task_operator_numRecordsOut | オペレーターが出力したレコードの総数 | オペレーターの numRecordsOut の値が長時間増加しない場合、ジョブコードの論理エラーによってデータがドロップされ、渡されなかった可能性があります。この場合は、ジョブコードのロジックを確認してください。 | Count | Custom |
flink_taskmanager_job_task_operator_source_numRecordsIn | ソースオペレーターのみの入力レコード | 上流のデータ入力を確認してください。 | Count | Custom |
flink_taskmanager_job_task_operator_sink_numRecordsOut | シンクによって出力されたレコードの総数 | 下流のデータ出力を確認してください。 | Count | Custom |
flink_taskmanager_job_task_numRecordsInPerSecond | タスクが 1 秒あたりに受信するレコード数 | タスクの処理速度を監視する必要があるシナリオで使用します。例えば、タスクの処理速度が期待レベルに達しているか、異なる入力負荷の下でパフォーマンスがどのように変化するかを確認できます。 | Count/s | Custom |
flink_taskmanager_job_task_numRecordsOutPerSecond | タスクが 1 秒あたりに出力するレコード数 | タスクの出力速度を監視する必要があるシナリオで使用します。例えば、タスクの出力速度が期待レベルに達しているか、異なる出力負荷の下でパフォーマンスがどのように変化するかを確認できます。 | Count/s | Custom |
flink_taskmanager_job_task_operator_numRecordsInPerSecond | オペレーターが 1 秒あたりに受信するレコード数 | オペレーターの処理速度を監視する必要があるシナリオで使用します。例えば、オペレーターの処理速度が期待レベルに達しているか、異なる入力負荷の下でパフォーマンスがどのように変化するかを確認できます。 | Count/s | Custom |
flink_taskmanager_job_task_operator_numRecordsOutPerSecond | オペレーターが 1 秒あたりに出力するレコード数 | オペレーターの出力速度を監視する必要があるシナリオで使用します。例えば、オペレーターの出力速度が期待レベルに達しているか、異なる出力負荷の下でパフォーマンスがどのように変化するかを確認できます。 | Count/s | Custom |
flink_taskmanager_job_task_operator_source_numRecordsInPerSecond | ソースが 1 秒あたりに入力するレコード数 | 各データソースの生成レートを把握し、各データソースが 1 秒あたりに生成するレコード数を測定する必要があるシナリオで使用します。データストリーム内の異なるデータソースは異なる数のレコードを生成する可能性があるため、このメトリックはデータストリームのパフォーマンス向上のためのチューニングに役立ちます。このメトリックはモニタリングとアラートにも使用されます。値が 0 の場合は、上流でデータがドロップされた可能性があります。上流のデータが消費されていないために出力がブロックされているかどうかを確認してください。 | Count/s | Custom |
flink_taskmanager_job_task_operator_sink_numRecordsOutPerSecond | シンクが 1 秒あたりに出力するレコード数 | 各シンクの出力速度を把握し、各シンクが 1 秒あたりに出力するレコード数を測定する必要があるシナリオで使用します。データストリーム内の異なるシンクは異なる数のレコードを出力する可能性があるため、このメトリックはデータストリームのパフォーマンス向上のためのチューニングに役立ちます。このメトリックはモニタリングとアラートにも使用されます。値が 0 の場合は、すべてのデータをフィルタリングしてしまうジョブコードの論理エラーを示している可能性があります。この場合は、ジョブコードのロジックを確認してください。 | Count/s | Custom |
バイトスループット
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_job_task_operator_numBytesIn | オペレーターが受信したバイトの総数 | ジョブのトラフィックを監視するために、上流のスループット入力を確認します。 | Bytes | Custom |
flink_taskmanager_job_task_operator_numBytesOut | オペレーターが出力したバイトの総数 | ジョブのトラフィックを監視するために、下流のスループット出力を確認します。 | Bytes | Custom |
flink_taskmanager_job_task_operator_numBytesInPerSecond | オペレーターが 1 秒あたりに受信するバイト数 | N/A | Bytes/s | Custom |
flink_taskmanager_job_task_operator_numBytesOutPerSecond | オペレーターが 1 秒あたりに出力するバイト数 | ジョブのトラフィックを監視するために、下流のスループット出力を確認します。 | Bytes/s | Custom |
flink_taskmanager_job_task_numBytesInLocalPerSecond | タスクがローカルソースから 1 秒あたりに読み取るバイト数 | ジョブのトラフィックを監視するために、上流の入力レートを確認します。 | Bytes/s | Custom |
flink_taskmanager_job_task_numBytesInRemotePerSecond | タスクがリモートソースから 1 秒あたりに読み取るバイト数 | N/A | Bytes/s | Custom |
flink_taskmanager_job_task_numBytesOutPerSecond | タスクが 1 秒あたりに出力するバイト数 | N/A | Bytes/s | Custom |
ネットワークバッファー
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_job_task_numBuffersInLocalPerSecond | 1 秒あたりに消費されるローカルデータバッファーの数 | 値が高い場合は、タスク間のローカル通信、つまり同じノード上での通信が頻繁に行われていることを示します。 | Count/s | Custom |
flink_taskmanager_job_task_numBuffersInRemotePerSecond | リモートの TaskManager から 1 秒あたりに受信するバッファーの数 | TaskManager 間の通信の頻度を反映します。 | Count/s | Custom |
flink_taskmanager_job_task_numBuffersOutPerSecond | 他のタスクに 1 秒あたりに送信されるバッファーの数 | タスクの出力負荷とネットワーク帯域幅の使用状況を示します。 | Count/s | Custom |
ソースとシンク
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_job_task_operator_pendingRecords | ソースでまだ読み取られていないレコードの数 | 外部システム内で、ソースによってまだプルされていないレコードの数。 | Count | Custom |
flink_taskmanager_job_task_operator_sourceIdleTime | ソースがデータを処理していない時間 | ソースがアイドル状態かどうかを示します。値が大きい場合は、外部システムでのデータ生成レートが低いことを示します。 | ms | Custom |
flink_taskmanager_job_task_operator_currentSendTime | 最新のレコードを送信するのにかかった時間 | N/A | ms | Custom |
チェックポイント
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_jobmanager_job_totalNumberOfCheckpoints | チェックポイントの総数 | N/A | Count | Custom |
flink_jobmanager_job_numberOfFailedCheckpoints | 失敗したチェックポイントの数 | N/A | Count | Custom |
flink_jobmanager_job_numberOfCompletedCheckpoints | 完了したチェックポイントの数 | N/A | Count | Custom |
flink_jobmanager_job_numberOfInProgressCheckpoints | 進行中のチェックポイントの数 | N/A | Count | Custom |
flink_jobmanager_job_lastCheckpointDuration | 最新のチェックポイントの所要時間 | チェックポイントに時間がかかりすぎる、またはタイムアウトする場合、原因はステートが大きすぎる、一時的なネットワークの問題、barrier の不整合、またはデータのバックプレッシャーである可能性があります。 | ms | Custom |
flink_jobmanager_job_lastCheckpointSize | 最新のチェックポイントのサイズ | 実際に最後にアップロードされたチェックポイントのサイズ。チェックポイントがボトルネックになっている場合に、チェックポイントのパフォーマンスを分析するためにこのメトリックを使用します。 | Bytes | Custom |
ステート
ステートメトリックは、ステートタイプごとにグループ化された単一のステート操作の最大レイテンシーと、GeminiDB が保存するステートデータのサイズをレポートします。ステートのレイテンシーメトリック名では、state_name を監視したいステートの名前に置き換えてください。各レイテンシーメトリックは、その名前が示すステート操作のパフォーマンスを示すため、これらのメトリックの Details 列は N/A です。
全般
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_job_task_operator_state_name_stateClearLatency | 単一のステートクリア操作の最大レイテンシー | N/A | ns | Custom |
値ステート
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_job_task_operator_state_name_valueStateGetLatency | 単一の値ステートアクセスの最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_valueStateUpdateLatency | 単一の値ステート更新の最大レイテンシー | N/A | ns | Custom |
集約ステート
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_job_task_operator_state_name_aggregatingStateGetLatency | 単一の集約ステートアクセスの最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_aggregatingStateAddLatency | 単一の集約ステート追加操作の最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_aggregatingStateMergeNamespacesLatency | 単一の集約ステート名前空間マージ操作の最大レイテンシー | N/A | ns | Custom |
削減ステート
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_job_task_operator_state_name_reducingStateGetLatency | 単一の削減ステートアクセスの最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_reducingStateAddLatency | 単一の削減ステート追加操作の最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_reducingStateMergeNamespacesLatency | 単一の削減ステート名前空間マージ操作の最大レイテンシー | N/A | ns | Custom |
マップステート
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_job_task_operator_state_name_mapStateGetLatency | 単一のマップステートアクセスの最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStatePutLatency | 単一のマップステート put 操作の最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStatePutAllLatency | 単一のマップステート put all 操作の最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateRemoveLatency | 単一のマップステート remove 操作の最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateContainsLatency | 単一マップ状態の contains 操作の最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateEntriesInitLatency | 単一のマップステート entries init 操作の最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateKeysInitLatency | 単一のマップステート keys init 操作の最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateValuesInitLatency | 単一のマップステート values init 操作の最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateIteratorInitLatency | 単一のマップステート iterator init 操作の最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateIsEmptyLatency | 単一のマップステート空チェックの最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateIteratorHasNextLatency | 単一のマップステートイテレータ hasNext 操作の最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateIteratorNextLatency | 単一のマップステートイテレータ next 操作の最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateIteratorRemoveLatency | 単一のマップステートイテレータ remove 操作の最大レイテンシー | N/A | ns | Custom |
リストステート
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_job_task_operator_state_name_listStateGetLatency | 単一のリストステートアクセスの最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_listStateAddLatency | 単一のリストステート追加操作の最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_listStateAddAllLatency | 単一のリストステート add all 操作の最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_listStateUpdateLatency | 単一のリストステート更新の最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_listStateMergeNamespacesLatency | 単一のリストステート名前空間マージ操作の最大レイテンシー | N/A | ns | Custom |
ソート済みマップステート
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_job_task_operator_state_name_sortedMapStateFirstEntryLatency | ソート済みマップステートの最初のエントリへの単一アクセスの最大レイテンシー | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_sortedMapStateLastEntryLatency | ソート済みマップステートの最後のエントリへの単一アクセスの最大レイテンシー | N/A | ns | Custom |
GeminiDB ステートストレージ
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_job_task_operator_geminiDB_total_size | ステートデータのサイズ | このメトリックを監視することで、ステートのボトルネックが発生する可能性のあるノードを直接または事前に特定し、TTL が有効かどうかを判断できます。 | Bytes | Custom |
flink_taskmanager_job_task_operator_geminiDB_total_filesize | ステートデータファイルのサイズ | このメトリックを監視することで、ステートが占有するローカルディスク領域を確認し、使用量が高い場合に事前に対策を講じたり、ローカルディスク領域の不足が過大なステートデータによって引き起こされているかどうかを判断したりできます。 | Bytes | Custom |
ウィンドウメトリック
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_job_task_operator_numLateRecordsDropped | ウィンドウのレイテンシーのためにドロップされたレコードの総数 | N/A | Count | Custom |
flink_taskmanager_job_task_operator_lateRecordsDroppedRate | ウィンドウのレイテンシーのためにレコードがドロップされるレート | N/A | N/A | Custom |
CDC コネクタメトリック
変更データキャプチャ (CDC) コネクタメトリックは、完全データが処理されるスナップショットフェーズと、増分データが処理されるバイナリロギング (binlog) フェーズを追跡します。以下のテーブルは、ジョブが現在どのフェーズにあるか、スナップショットフェーズの進捗、読み取られたデータ量、および増分フェーズで処理される DML および DDL 文によってこれらのメトリックをグループ化しています。
メトリック名では、cdcns_schema_table を監視したいテーブルの CDC 名前空間、スキーマ名、およびテーブル名に置き換えてください。このセグメントを含むメトリック名は単一テーブルの値をレポートします。このセグメントを省略したメトリック名はジョブ全体に対する値をレポートします。
フェーズインジケーター
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_jobmanager_job_operator_coordinator_enumerator_isSnapshotting | ジョブが完全データを処理するフェーズにあるかどうか | ジョブがまだスナップショットフェーズにあるかどうかを判断します。 | N/A | Custom |
flink_jobmanager_job_operator_coordinator_enumerator_isBinlogReading | ジョブが増分データを処理するフェーズにあるかどうか | ジョブが binlog フェーズに入ったかどうかを判断します。 | N/A | Custom |
スナップショットの進捗
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_jobmanager_job_operator_coordinator_enumerator_numTablesRemaining | スナップショットフェーズでまだ処理されていないテーブルの数 | まだ処理を待っているテーブルの数を表示します。 | Count | Custom |
flink_jobmanager_job_operator_coordinator_enumerator_numTablesSnapshotted | スナップショットが完了したテーブルの数 | 処理済みのテーブルの数を表示します。 | Count | Custom |
flink_jobmanager_job_operator_coordinator_enumerator_numSnapshotSplitsProcessed | ジョブ全体のスナップショットフェーズで処理されたシャードの数 | すべてのテーブルにわたる処理済みシャードの数を表示します。 | Count | Custom |
flink_jobmanager_job_operator_coordinator_enumerator_cdcns_schema_table_numSnapshotSplitsProcessed | 単一テーブルのスナップショットフェーズで処理されたシャードの数 | 指定されたテーブルの処理済みシャードの数を表示します。 | Count | Custom |
flink_jobmanager_job_operator_coordinator_enumerator_numSnapshotSplitsRemaining | ジョブ全体のスナップショットフェーズで処理を待っているシャードの数 | すべてのテーブルにわたる未処理シャードの数を表示します。 | Count | Custom |
flink_jobmanager_job_operator_coordinator_enumerator_cdcns_schema_table_numSnapshotSplitsRemaining | 単一テーブルのスナップショットフェーズで処理を待っているシャードの数 | 指定されたテーブルの未処理シャードの数を表示します。 | Count | Custom |
データ量
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_job_task_operator_currentReadTimestampMs | 読み取られた最新のデータレコードのタイムスタンプ | 最新の binlog データのタイムスタンプを表示します。 | ms | Custom |
flink_taskmanager_job_task_operator_numSnapshotRecords | スナップショットフェーズで処理されたレコードの数 | スナップショットフェーズで処理されたデータ量を表示します。 | Count | Custom |
flink_taskmanager_job_task_operator_cdcns_schema_table_numRecordsIn | 各テーブルで読み取られたレコードの数 | 各テーブルで処理された総データ量を表示します。 | Count | Custom |
flink_taskmanager_job_task_operator_cdcns_schema_table_numSnapshotRecords | スナップショットフェーズで各テーブルについて処理されたレコードの数 | スナップショットフェーズで各テーブルについて処理されたデータ量を表示します。 | Count | Custom |
増分フェーズの DML と DDL
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_job_task_operator_cdcns_schema_table_numInsertDMLRecords | 増分フェーズで各テーブルについて処理された INSERT DML 文の数 | 各テーブルの INSERT 文のデータ量を表示します。 | Count | Custom |
flink_taskmanager_job_task_operator_cdcns_schema_table_numUpdateDMLRecords | 増分フェーズで各テーブルについて処理された UPDATE DML 文の数 | 各テーブルの UPDATE 文のデータ量を表示します。 | Count | Custom |
flink_taskmanager_job_task_operator_cdcns_schema_table_numDeleteDMLRecords | 増分フェーズで各テーブルについて処理された DELETE DML 文の数 | 各テーブルの DELETE 文のデータ量を表示します。 | Count | Custom |
flink_taskmanager_job_task_operator_cdcns_schema_table_numDDLRecords | 増分フェーズで各テーブルについて処理された DDL 文の数 | 各テーブルの DDL 文のデータ量を表示します。 | Count | Custom |
flink_taskmanager_job_task_operator_numInsertDMLRecords | 増分フェーズで処理された INSERT DML 文の数 | INSERT 文のデータ量を表示します。 | Count | Custom |
flink_taskmanager_job_task_operator_numUpdateDMLRecords | 増分フェーズで処理された UPDATE DML 文の数 | UPDATE 文のデータ量を表示します。 | Count | Custom |
flink_taskmanager_job_task_operator_numDeleteDMLRecords | 増分フェーズで処理された DELETE DML 文の数 | DELETE 文のデータ量を表示します。 | Count | Custom |
flink_taskmanager_job_task_operator_numDDLRecords | 増分フェーズで処理された DDL 文の数 | DDL 文のデータ量を表示します。 | Count | Custom |
JobManager の JVM とシステムリソース
CPU
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_jobmanager_Status_JVM_CPU_Load | 単一の JobManager CPU の負荷 | この値が長時間 100% を超え続ける場合、CPU はビジー状態で負荷が高いことを示します。これはシステムのパフォーマンスに影響を与え、システムの遅延や応答時間の大幅な増加を引き起こす可能性があります。 | N/A | Basic |
flink_jobmanager_Status_ProcessTree_CPU_Usage | 単一の JobManager CPU の CPU 使用率 | この値は Flink がどれだけの CPU 時間を占有しているかを反映します。1 つの CPU コアが完全に利用されると値は 100% になり、4 つの CPU コアが完全に利用されると 400% になります。この値が長時間 100% を超え続ける場合、CPU は非常にビジーです。負荷が高いにもかかわらず CPU 使用率が低い場合、頻繁な読み書き操作により、割り込み不可能なスリープ状態のプロセスが多すぎる可能性があります。 | N/A | Basic |
メモリ
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_jobmanager_Status_JVM_Memory_Heap_Used | JobManager のヒープメモリ | N/A | Bytes | Basic |
flink_jobmanager_Status_JVM_Memory_Heap_Committed | JobManager によってコミットされたヒープメモリ | N/A | Bytes | Basic |
flink_jobmanager_Status_JVM_Memory_Heap_Max | JobManager の最大ヒープメモリ | N/A | Bytes | Basic |
flink_jobmanager_Status_JVM_Memory_NonHeap_Used | JobManager の非ヒープメモリ | N/A | Bytes | Basic |
flink_jobmanager_Status_JVM_Memory_NonHeap_Committed | JobManager によってコミットされた非ヒープメモリ | N/A | Bytes | Basic |
flink_jobmanager_Status_JVM_Memory_NonHeap_Max | JobManager の最大非ヒープメモリ | N/A | Bytes | Basic |
スレッド
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_jobmanager_Status_JVM_Threads_Count | JobManager のスレッド数 | JobManager のスレッドが多すぎると、過剰なメモリ領域を占有し、ジョブの安定性が低下します。 | Count | Basic |
ガベージコレクション
次のテーブルの G1 ガベージコレクターメトリックはカスタムメトリックです。その他の JobManager ガベージコレクションメトリックは基本メトリックです。
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_jobmanager_Status_JVM_GarbageCollector_ParNew_Count | JobManager の GC 回数 | GC が多すぎると、過剰なメモリ領域を占有し、ジョブのパフォーマンスに影響します。このメトリックは、ジョブの診断とジョブレベルの障害のトラブルシューティングに役立ちます。 | Count | Basic |
flink_jobmanager_Status_JVM_GarbageCollector_G1_Young_Generation_Count | JobManager の Young 領域 GC 回数 (G1 ガベージコレクター) | N/A | Count | Custom |
flink_jobmanager_Status_JVM_GarbageCollector_G1_Old_Generation_Count | JobManager の Old 領域 GC 回数 (G1 ガベージコレクター) | N/A | Count | Custom |
flink_jobmanager_Status_JVM_GarbageCollector_G1_Young_Generation_Time | JobManager の Young 領域 GC 時間 (G1 ガベージコレクター) | N/A | ms | Custom |
flink_jobmanager_Status_JVM_GarbageCollector_G1_Old_Generation_Time | JobManager の Old 領域 GC 時間 (G1 ガベージコレクター) | N/A | ms | Custom |
flink_jobmanager_Status_JVM_GarbageCollector_ConcurrentMarkSweep_Count | JobManager の CMS ガベージコレクターによって実行されたコレクションの回数 | N/A | Count | Basic |
flink_jobmanager_Status_JVM_GarbageCollector_ParNew_Time | 各 JobManager GC の所要時間 | GC が長いと、過剰なメモリ領域を占有し、ジョブのパフォーマンスに影響します。このメトリックは、ジョブの診断とジョブレベルの障害のトラブルシューティングに役立ちます。 | ms | Basic |
flink_jobmanager_Status_JVM_GarbageCollector_ConcurrentMarkSweep_Time | JobManager の CMS ガベージコレクターによって実行されたコレクションに費やされた時間 | N/A | ms | Basic |
クラスローディング
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_jobmanager_Status_JVM_ClassLoader_ClassesLoaded | JobManager をホストする JVM が作成された後にロードされたクラスの総数 | JobManager をホストする JVM が作成された後にロードされたクラスの総数が多すぎると、過剰なメモリ領域が占有され、ジョブのパフォーマンスに影響します。 | N/A | Basic |
flink_jobmanager_Status_JVM_ClassLoader_ClassesUnloaded | JobManager をホストする JVM が作成された後にアンロードされたクラスの総数 | JobManager をホストする JVM が作成された後にアンロードされたクラスの総数が多すぎると、過剰なメモリ領域が占有され、ジョブのパフォーマンスに影響します。 | N/A | Basic |
TaskManager の JVM とシステムリソース
CPU
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_Status_JVM_CPU_Load | 単一の TaskManager CPU の負荷 | 一定期間に CPU が処理しているプロセスと CPU を待っているプロセスの合計で、一般的には CPU がどれだけビジーであるかを意味します。CPU のビジー度は CPU コア数に依存します。Flink では、CPU 負荷の値は CPU 使用率 / CPU コア数 です。flink_taskmanager_Status_JVM_CPU_Load が CPU 負荷の値より大きい場合、CPU 処理がブロックされている可能性があります。 | N/A | Basic |
flink_taskmanager_Status_ProcessTree_CPU_Usage | 単一の TaskManager CPU の CPU 使用率 | この値は Flink がどれだけの CPU 時間を占有しているかを反映します。1 つの CPU コアが完全に利用されると値は 100% になり、4 つの CPU コアが完全に利用されると 400% になります。この値が長時間 100% を超え続ける場合、CPU は非常にビジーです。負荷が高いにもかかわらず CPU 使用率が低い場合、頻繁な読み書き操作により、割り込み不可能なスリープ状態のプロセスが多すぎる可能性があります。 | N/A | Basic |
メモリ
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_Status_JVM_Memory_Heap_Used | TaskManager のヒープメモリ | N/A | Bytes | Basic |
flink_taskmanager_Status_JVM_Memory_Heap_Committed | TaskManager のコミット済みヒープメモリ | N/A | Bytes | Basic |
flink_taskmanager_Status_JVM_Memory_Heap_Max | TaskManager の最大ヒープメモリ | N/A | Bytes | Basic |
flink_taskmanager_Status_JVM_Memory_NonHeap_Used | TaskManager の非ヒープメモリ | N/A | Bytes | Basic |
flink_taskmanager_Status_JVM_Memory_NonHeap_Committed | TaskManager のコミット済み非ヒープメモリ | N/A | Bytes | Basic |
flink_taskmanager_Status_JVM_Memory_NonHeap_Max | TaskManager の最大非ヒープメモリ | N/A | Bytes | Basic |
flink_taskmanager_Status_ProcessTree_Memory_RSS | Linux を通じて取得されたプロセス全体のメモリ | プロセスメモリの変更を表示します。 | Bytes | Basic |
スレッド
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_Status_JVM_Threads_Count | TaskManager のスレッド数 | TaskManager のスレッドが多すぎると、過剰なメモリを占有し、ジョブの安定性が低下します。 | Count | Basic |
ガベージコレクション
次のテーブルの G1 ガベージコレクターメトリックはカスタムメトリックです。その他の TaskManager ガベージコレクションメトリックは基本メトリックです。
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_Status_JVM_GarbageCollector_ParNew_Count | TaskManager の GC 回数 | GC が多すぎると、過剰なメモリ領域を占有し、ジョブのパフォーマンスに影響します。このメトリックは、ジョブの診断とタスクレベルの障害のトラブルシューティングに役立ちます。 | Count | Basic |
flink_taskmanager_Status_JVM_GarbageCollector_G1_Young_Generation_Count | TaskManager の Young 領域 GC 回数 (G1 ガベージコレクター) | N/A | Count | Custom |
flink_taskmanager_Status_JVM_GarbageCollector_G1_Old_Generation_Count | TaskManager の Old 領域 GC 回数 (G1 ガベージコレクター) | N/A | Count | Custom |
flink_taskmanager_Status_JVM_GarbageCollector_G1_Young_Generation_Time | TaskManager の Young 領域 GC 時間 (G1 ガベージコレクター) | N/A | ms | Custom |
flink_taskmanager_Status_JVM_GarbageCollector_G1_Old_Generation_Time | TaskManager の Old 領域 GC 時間 (G1 ガベージコレクター) | N/A | ms | Custom |
flink_taskmanager_Status_JVM_GarbageCollector_ConcurrentMarkSweep_Count | TaskManager の CMS ガベージコレクターによって実行されたコレクションの回数 | N/A | Count | Basic |
flink_taskmanager_Status_JVM_GarbageCollector_ParNew_Time | 各 TaskManager GC の所要時間 | GC が長いと、過剰なメモリ領域を占有し、ジョブのパフォーマンスに影響します。このメトリックは、ジョブの診断とタスクレベルの障害のトラブルシューティングに役立ちます。 | ms | Basic |
flink_taskmanager_Status_JVM_GarbageCollector_ConcurrentMarkSweep_Time | TaskManager の CMS ガベージコレクターによって実行されたコレクションに費やされた時間 | N/A | ms | Basic |
クラスローディング
| メトリック | 説明 | 詳細 | 単位 | タイプ |
flink_taskmanager_Status_JVM_ClassLoader_ClassesLoaded | TaskManager をホストする JVM が作成された後にロードされたクラスの総数 | TaskManager をホストする JVM が作成された後にロードされたクラスの総数が多すぎると、過剰なメモリ領域が占有され、ジョブのパフォーマンスに影響します。 | N/A | Basic |
flink_taskmanager_Status_JVM_ClassLoader_ClassesUnloaded | TaskManager をホストする JVM が作成された後にアンロードされたクラスの総数 | TaskManager をホストする JVM が作成された後にアンロードされたクラスの総数が多すぎると、過剰なメモリ領域が占有され、ジョブのパフォーマンスに影響します。 | N/A | Basic |
共通のメトリックラベル
Flink メトリックには、一般的に以下のラベルが付与されます。これらを使用して、プロジェクト、デプロイメント、またはジョブごとにメトリックデータをフィルタリングおよび集約します。
| ラベル | 説明 |
vvpNamespace | プロジェクトの名前空間。 |
deploymentName | デプロイメントの名前。 |
deploymentId | デプロイメントの ID。 |
jobId | ジョブの ID。 |
リファレンス
以下のトピックでは、関連するメトリックセットとメトリック管理オプションについて説明します。
ARMS のアプリケーションモニタリングのメトリックを表示するには、「アプリケーションモニタリングのメトリック」をご参照ください。