Managed Service for Prometheus prend en charge un ensemble de métriques Flink collectées depuis Alibaba Cloud Realtime Compute for Apache Flink. Chaque métrique est classée comme métrique de base ou métrique personnalisée ; cette classification détermine si la transmission de la métrique entraîne des frais.
Types de métriques et facturation
La facturation de Managed Service for Prometheus repose sur le volume de données écrites ou le nombre de points de données transmis. Les métriques se répartissent en deux catégories :
Métriques de base — Les métriques de base collectées depuis Alibaba Cloud Realtime Compute for Apache Flink sont gratuites lorsqu'elles sont transmises ou écrites dans Managed Service for Prometheus. Cet avantage ne s'applique pas aux autres services Flink, tels que les instances Flink autogérées.
Métriques personnalisées — Toute métrique autre qu'une métrique de base est considérée comme une métrique personnalisée. La facturation des métriques personnalisées est effective depuis le 6 janvier 2020. La colonne
Typede chaque table de cette rubrique indique la catégorie de la métrique. Les métriques de base sont principalement regroupées dans les sections relatives à la JVM et aux ressources système du JobManager et du TaskManager. Les métriques des autres sections sont des métriques personnalisées ; par conséquent, les données relatives à l'état de santé des jobs, à la latence, au débit, aux checkpoints, à l'état, aux fenêtres et aux connecteurs CDC sont facturées lors de leur transmission. Au sein des deux sections JVM, les huit métriques du garbage collector G1 sont des métriques personnalisées, bien que les métriques adjacentes soient des métriques de base.
Lecture des tables de métriques
Chaque table de métriques de cette rubrique utilise les cinq colonnes suivantes :
Metric — Nom de la métrique tel qu'il est transmis à Managed Service for Prometheus.
Description — Ce que la métrique mesure.
Details — Interprétation de la valeur ou éléments à vérifier en cas d'anomalie.
Unit — Unité de la valeur de la métrique. Les unités utilisées dans cette rubrique sont
Count,Count/s,Bytes,Bytes/s,msetns.Type — Catégorie de la métrique :
BasicouCustom. La mentionN/Adans une cellule signifie qu'aucune valeur n'est fournie pour cette cellule dans cette rubrique. Dans la colonneUnit,N/Aindique qu'aucune unité n'est documentée pour la métrique.
Certains noms de métriques contiennent un segment variable substitué lors de la transmission ; le nom figurant dans la table n'est donc pas le nom littéral d'une série temporelle. state_name représente le nom de l'état auquel s'applique la métrique, et cdcns_schema_table représente le namespace CDC, le nom du schéma et le nom de la table surveillée. Remplacez ces segments par les valeurs réelles avant d'utiliser un nom de métrique dans une requête ou une règle d'alerte.
État de santé des jobs
| Metric | Description | Details | Unit | Type |
flink_jobmanager_job_numRestarts |
Nombre de redémarrages de job causés par des erreurs | Nombre de redémarrages provoqués par des erreurs de job. Les basculements du JobManager ne sont pas comptabilisés. | Count | Custom |
flink_jobmanager_job_uptime |
Temps d'exécution du job | N/A | ms | Custom |
flink_jobmanager_numRunningJobs |
Nombre de jobs en cours d'exécution | N/A | N/A | Custom |
flink_jobmanager_taskSlotsAvailable |
Nombre de slots de tâche disponibles | N/A | N/A | Custom |
flink_jobmanager_taskSlotsTotal |
Nombre total de slots de tâche | N/A | N/A | Custom |
flink_jobmanager_numRegisteredTaskManagers |
Nombre de TaskManagers enregistrés | N/A | N/A | Custom |
Latence
| Metric | Description | Details | Unit | Type |
flink_taskmanager_job_task_operator_currentEmitEventTimeLag |
Décalage temporel (event-time) des enregistrements émis par l'opérateur | Une valeur élevée indique que le job peut rencontrer de la latence lors de l'extraction ou du traitement des données. | ms | Custom |
flink_taskmanager_job_task_operator_currentFetchEventTimeLag |
Décalage temporel (event-time) des enregistrements extraits par l'opérateur | Une valeur élevée indique que le job peut rencontrer de la latence lors de l'extraction des données. | ms | Custom |
flink_taskmanager_job_task_currentInputWatermark |
Horodatage du watermark le plus récent reçu par chaque tâche | Indique la latence des données reçues par la tâche. | N/A | Custom |
flink_taskmanager_job_task_operator_watermarkLag |
Décalage du watermark de l'opérateur | Indique la latence du job au niveau des sous-tâches. | ms | Custom |
Débit
Débit d'enregistrements
| Metric | Description | Details | Unit | Type |
flink_taskmanager_job_task_numRecordsIn |
Nombre total d'enregistrements reçus par la tâche | Si la valeur numRecordsIn d'une tâche n'augmente pas pendant une période prolongée, il est possible que les données en amont aient été abandonnées et non transmises. Vérifiez dans ce cas les données en amont. | Count | Custom |
flink_taskmanager_job_task_numRecordsOut |
Nombre total d'enregistrements produits par la tâche | Si la valeur numRecordsOut d'une tâche n'augmente pas pendant une période prolongée, une erreur logique dans le code du job a pu entraîner l'abandon des données sans transmission. Vérifiez dans ce cas la logique du code du job. | Count | Custom |
flink_taskmanager_job_task_operator_numRecordsIn |
Nombre total d'enregistrements reçus par l'opérateur | Si la valeur numRecordsIn d'un opérateur n'augmente pas pendant une période prolongée, il est possible que les données en amont aient été abandonnées et non transmises. Vérifiez dans ce cas les données en amont. | Count | Custom |
flink_taskmanager_job_task_operator_numRecordsOut |
Nombre total d'enregistrements produits par l'opérateur | Si la valeur numRecordsOut d'un opérateur n'augmente pas pendant une période prolongée, une erreur logique dans le code du job a pu entraîner l'abandon des données sans transmission. Vérifiez dans ce cas la logique du code du job. | Count | Custom |
flink_taskmanager_job_task_operator_source_numRecordsIn |
Enregistrements d'entrée de l'opérateur source uniquement | Vérifiez l'entrée des données en amont. | Count | Custom |
flink_taskmanager_job_task_operator_sink_numRecordsOut |
Nombre total d'enregistrements produits par le sink | Vérifiez la sortie des données en aval. | Count | Custom |
flink_taskmanager_job_task_numRecordsInPerSecond |
Nombre d'enregistrements reçus par la tâche par seconde | S'applique aux scénarios nécessitant la surveillance de la vitesse de traitement d'une tâche. Par exemple, vous pouvez vérifier si la vitesse de traitement de la tâche atteint le niveau attendu et comment les performances évoluent sous différentes charges d'entrée. | Count/s | Custom |
flink_taskmanager_job_task_numRecordsOutPerSecond |
Nombre d'enregistrements produits par la tâche par seconde | S'applique aux scénarios nécessitant la surveillance de la vitesse de sortie d'une tâche. Par exemple, vous pouvez vérifier si la vitesse de sortie de la tâche atteint le niveau attendu et comment les performances évoluent sous différentes charges de sortie. | Count/s | Custom |
flink_taskmanager_job_task_operator_numRecordsInPerSecond |
Nombre d'enregistrements reçus par l'opérateur par seconde | S'applique aux scénarios nécessitant la surveillance de la vitesse de traitement d'un opérateur. Par exemple, vous pouvez vérifier si la vitesse de traitement de l'opérateur atteint le niveau attendu et comment les performances évoluent sous différentes charges d'entrée. | Count/s | Custom |
flink_taskmanager_job_task_operator_numRecordsOutPerSecond |
Nombre d'enregistrements produits par l'opérateur par seconde | S'applique aux scénarios nécessitant la surveillance de la vitesse de sortie d'un opérateur. Par exemple, vous pouvez vérifier si la vitesse de sortie de l'opérateur atteint le niveau attendu et comment les performances évoluent sous différentes charges de sortie. | Count/s | Custom |
flink_taskmanager_job_task_operator_source_numRecordsInPerSecond |
Nombre d'enregistrements d'entrée par seconde pour la source | S'applique aux scénarios nécessitant la compréhension du taux de génération de chaque source de données et la mesure du nombre d'enregistrements générés par seconde par chaque source. Différentes sources de données dans un flux de données peuvent générer des nombres d'enregistrements différents ; cette métrique vous aide donc à optimiser le flux de données pour de meilleures performances. Cette métrique est également utilisée pour la surveillance et les alertes. Une valeur de 0 peut indiquer que les données en amont ont été abandonnées. Vérifiez si la sortie est bloquée car les données en amont n'ont pas été consommées. | Count/s | Custom |
flink_taskmanager_job_task_operator_sink_numRecordsOutPerSecond |
Nombre d'enregistrements de sortie par seconde pour le sink | S'applique aux scénarios nécessitant la compréhension de la vitesse de sortie de chaque sink et la mesure du nombre d'enregistrements produits par seconde par chaque sink. Différents sinks dans un flux de données peuvent produire des nombres d'enregistrements différents ; cette métrique vous aide donc à optimiser le flux de données pour de meilleures performances. Cette métrique est également utilisée pour la surveillance et les alertes. Une valeur de 0 peut indiquer une erreur logique dans le code du job ayant filtré toutes les données. Vérifiez dans ce cas la logique du code du job. | Count/s | Custom |
Débit en octets
| Metric | Description | Details | Unit | Type |
flink_taskmanager_job_task_operator_numBytesIn |
Nombre total d'octets reçus par l'opérateur | Vérifiez l'entrée du débit en amont pour observer le trafic du job. | Bytes | Custom |
flink_taskmanager_job_task_operator_numBytesOut |
Nombre total d'octets produits par l'opérateur | Vérifiez la sortie du débit en aval pour observer le trafic du job. | Bytes | Custom |
flink_taskmanager_job_task_operator_numBytesInPerSecond |
Nombre d'octets reçus par l'opérateur par seconde | N/A | Bytes/s | Custom |
flink_taskmanager_job_task_operator_numBytesOutPerSecond |
Nombre d'octets produits par l'opérateur par seconde | Vérifiez la sortie du débit en aval pour observer le trafic du job. | Bytes/s | Custom |
flink_taskmanager_job_task_numBytesInLocalPerSecond |
Nombre d'octets lus par la tâche par seconde depuis des sources locales | Vérifiez le taux d'entrée en amont pour observer le trafic du job. | Bytes/s | Custom |
flink_taskmanager_job_task_numBytesInRemotePerSecond |
Nombre d'octets lus par la tâche par seconde depuis des sources distantes | N/A | Bytes/s | Custom |
flink_taskmanager_job_task_numBytesOutPerSecond |
Nombre d'octets produits par la tâche par seconde | N/A | Bytes/s | Custom |
Tampons réseau
| Metric | Description | Details | Unit | Type |
flink_taskmanager_job_task_numBuffersInLocalPerSecond |
Nombre de tampons de données locaux consommés par seconde | Une valeur élevée indique une communication locale fréquente entre les tâches, c'est-à-dire une communication sur le même nœud. | Count/s | Custom |
flink_taskmanager_job_task_numBuffersInRemotePerSecond |
Nombre de tampons reçus par seconde depuis des TaskManagers distants | Reflète la fréquence de la communication entre TaskManagers. | Count/s | Custom |
flink_taskmanager_job_task_numBuffersOutPerSecond |
Nombre de tampons envoyés par seconde à d'autres tâches | Indique la pression de sortie des tâches et l'utilisation de la bande passante réseau. | Count/s | Custom |
Source et sink
| Metric | Description | Details | Unit | Type |
flink_taskmanager_job_task_operator_pendingRecords |
Nombre d'enregistrements non lus au niveau de la source | Nombre d'enregistrements dans le système externe qui n'ont pas encore été extraits par la source. | Count | Custom |
flink_taskmanager_job_task_operator_sourceIdleTime |
Durée pendant laquelle la source n'a pas traité de données | Indique si la source est inactive. Une valeur élevée signifie que le taux de génération de données dans le système externe est faible. | ms | Custom |
flink_taskmanager_job_task_operator_currentSendTime |
Temps nécessaire à l'envoi de l'enregistrement le plus récent | N/A | ms | Custom |
Checkpoints
| Metric | Description | Details | Unit | Type |
flink_jobmanager_job_totalNumberOfCheckpoints |
Nombre total de checkpoints | N/A | Count | Custom |
flink_jobmanager_job_numberOfFailedCheckpoints |
Nombre de checkpoints échoués | N/A | Count | Custom |
flink_jobmanager_job_numberOfCompletedCheckpoints |
Nombre de checkpoints terminés | N/A | Count | Custom |
flink_jobmanager_job_numberOfInProgressCheckpoints |
Nombre de checkpoints en cours | N/A | Count | Custom |
flink_jobmanager_job_lastCheckpointDuration |
Durée du checkpoint le plus récent | Si un checkpoint prend trop de temps ou expire, la cause peut être un état excessivement volumineux, un problème réseau transitoire, des barrières non alignées ou une contre-pression des données. | ms | Custom |
flink_jobmanager_job_lastCheckpointSize |
Taille du checkpoint le plus récent | Taille du checkpoint effectivement téléchargé le plus récemment. Utilisez cette métrique pour analyser les performances des checkpoints lorsque ceux-ci constituent un goulot d'étranglement. | Bytes | Custom |
État
Les métriques d'état rapportent la latence maximale d'une seule opération d'état, groupée par type d'état, ainsi que la taille des données d'état stockées par GeminiDB. Dans le nom d'une métrique de latence d'état, remplacez state_name par le nom de l'état que vous souhaitez surveiller. Chaque métrique de latence indique les performances de l'opération d'état identifiée par son nom ; la colonne Details contient donc N/A pour ces métriques.
Général
| Metric | Description | Details | Unit | Type |
flink_taskmanager_job_task_operator_state_name_stateClearLatency |
Latence maximale d'une seule opération de suppression d'état | N/A | ns | Custom |
Value state
| Metric | Description | Details | Unit | Type |
flink_taskmanager_job_task_operator_state_name_valueStateGetLatency |
Latence maximale d'un seul accès à un value state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_valueStateUpdateLatency |
Latence maximale d'une seule mise à jour de value state | N/A | ns | Custom |
Aggregating state
| Metric | Description | Details | Unit | Type |
flink_taskmanager_job_task_operator_state_name_aggregatingStateGetLatency |
Latence maximale d'un seul accès à un aggregating state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_aggregatingStateAddLatency |
Latence maximale d'une seule opération d'ajout à un aggregating state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_aggregatingStateMergeNamespacesLatency |
Latence maximale d'une seule opération de fusion de namespaces pour un aggregating state | N/A | ns | Custom |
Reducing state
| Metric | Description | Details | Unit | Type |
flink_taskmanager_job_task_operator_state_name_reducingStateGetLatency |
Latence maximale d'un seul accès à un reducing state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_reducingStateAddLatency |
Latence maximale d'une seule opération d'ajout à un reducing state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_reducingStateMergeNamespacesLatency |
Latence maximale d'une seule opération de fusion de namespaces pour un reducing state | N/A | ns | Custom |
Map state
| Metric | Description | Details | Unit | Type |
flink_taskmanager_job_task_operator_state_name_mapStateGetLatency |
Latence maximale d'un seul accès à un map state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStatePutLatency |
Latence maximale d'une seule opération put sur un map state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStatePutAllLatency |
Latence maximale d'une seule opération put all sur un map state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateRemoveLatency |
Latence maximale d'une seule opération remove sur un map state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateContainsLatency |
Latence maximale d'une seule opération contains sur un map state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateEntriesInitLatency |
Latence maximale d'une seule opération d'initialisation des entrées d'un map state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateKeysInitLatency |
Latence maximale d'une seule opération d'initialisation des clés d'un map state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateValuesInitLatency |
Latence maximale d'une seule opération d'initialisation des valeurs d'un map state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateIteratorInitLatency |
Latence maximale d'une seule opération d'initialisation de l'itérateur d'un map state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateIsEmptyLatency |
Latence maximale d'une seule vérification de vacuité d'un map state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateIteratorHasNextLatency |
Latence maximale d'une seule opération hasNext de l'itérateur d'un map state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateIteratorNextLatency |
Latence maximale d'une seule opération next de l'itérateur d'un map state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_mapStateIteratorRemoveLatency |
Latence maximale d'une seule opération remove de l'itérateur d'un map state | N/A | ns | Custom |
List state
| Metric | Description | Details | Unit | Type |
flink_taskmanager_job_task_operator_state_name_listStateGetLatency |
Latence maximale d'un seul accès à un list state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_listStateAddLatency |
Latence maximale d'une seule opération d'ajout à un list state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_listStateAddAllLatency |
Latence maximale d'une seule opération add all sur un list state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_listStateUpdateLatency |
Latence maximale d'une seule mise à jour de list state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_listStateMergeNamespacesLatency |
Latence maximale d'une seule opération de fusion de namespaces pour un list state | N/A | ns | Custom |
Sorted map state
| Metric | Description | Details | Unit | Type |
flink_taskmanager_job_task_operator_state_name_sortedMapStateFirstEntryLatency |
Latence maximale d'un seul accès à la première entrée d'un sorted map state | N/A | ns | Custom |
flink_taskmanager_job_task_operator_state_name_sortedMapStateLastEntryLatency |
Latence maximale d'un seul accès à la dernière entrée d'un sorted map state | N/A | ns | Custom |
Stockage d'état GeminiDB
| Metric | Description | Details | Unit | Type |
flink_taskmanager_job_task_operator_geminiDB_total_size |
Taille des données d'état | La surveillance de cette métrique permet d'identifier, directement ou préventivement, les nœuds susceptibles de présenter des goulots d'étranglement liés à l'état, et de déterminer si le TTL (Time To Live) est effectif. | Bytes | Custom |
flink_taskmanager_job_task_operator_geminiDB_total_filesize |
Taille des fichiers de données d'état | La surveillance de cette métrique permet de vérifier l'espace disque local occupé par l'état, afin de prendre des mesures préventives en cas d'utilisation élevée, et de déterminer si un espace disque local insuffisant est causé par des données d'état excessivement volumineuses. | Bytes | Custom |
Métriques de fenêtre
| Metric | Description | Details | Unit | Type |
flink_taskmanager_job_task_operator_numLateRecordsDropped |
Nombre total d'enregistrements abandonnés en raison de la latence de fenêtre | N/A | Count | Custom |
flink_taskmanager_job_task_operator_lateRecordsDroppedRate |
Taux d'abandon d'enregistrements en raison de la latence de fenêtre | N/A | N/A | Custom |
Métriques des connecteurs CDC
Les métriques des connecteurs Change Data Capture (CDC) suivent la phase de snapshot, durant laquelle les données complètes sont traitées, et la phase de journalisation binaire (binlog), durant laquelle les données incrémentielles sont traitées. Les tableaux suivants regroupent ces métriques selon la phase actuelle du job, la progression de la phase de snapshot, le volume de données lu, ainsi que les instructions DML et DDL traitées durant la phase incrémentielle.
Dans un nom de métrique, remplacez cdcns_schema_table par le namespace CDC, le nom du schéma et le nom de la table que vous souhaitez surveiller. Les métriques dont le nom contient ce segment rapportent des valeurs pour une seule table. Les métriques dont le nom omet ce segment rapportent des valeurs pour l'ensemble du job.
Indicateurs de phase
| Metric | Description | Details | Unit | Type |
flink_jobmanager_job_operator_coordinator_enumerator_isSnapshotting |
Indique si le job se trouve dans la phase de traitement des données complètes | Déterminez si le job est toujours en phase de snapshot. | N/A | Custom |
flink_jobmanager_job_operator_coordinator_enumerator_isBinlogReading |
Indique si le job se trouve dans la phase de traitement des données incrémentielles | Déterminez si le job est entré en phase binlog. | N/A | Custom |
Progression du snapshot
| Metric | Description | Details | Unit | Type |
flink_jobmanager_job_operator_coordinator_enumerator_numTablesRemaining |
Nombre de tables non traitées durant la phase de snapshot | Affichez le nombre de tables encore en attente de traitement. | Count | Custom |
flink_jobmanager_job_operator_coordinator_enumerator_numTablesSnapshotted |
Nombre de tables dont le snapshot est terminé | Affichez le nombre de tables déjà traitées. | Count | Custom |
flink_jobmanager_job_operator_coordinator_enumerator_numSnapshotSplitsProcessed |
Nombre de shards traités durant la phase de snapshot, pour l'ensemble du job | Affichez le nombre de shards traités pour toutes les tables. | Count | Custom |
flink_jobmanager_job_operator_coordinator_enumerator_cdcns_schema_table_numSnapshotSplitsProcessed |
Nombre de shards traités durant la phase de snapshot, pour une seule table | Affichez le nombre de shards traités pour la table spécifiée. | Count | Custom |
flink_jobmanager_job_operator_coordinator_enumerator_numSnapshotSplitsRemaining |
Nombre de shards en attente de traitement durant la phase de snapshot, pour l'ensemble du job | Affichez le nombre de shards non traités pour toutes les tables. | Count | Custom |
flink_jobmanager_job_operator_coordinator_enumerator_cdcns_schema_table_numSnapshotSplitsRemaining |
Nombre de shards en attente de traitement durant la phase de snapshot, pour une seule table | Affichez le nombre de shards non traités pour la table spécifiée. | Count | Custom |
Volume de données
| Metric | Description | Details | Unit | Type |
flink_taskmanager_job_task_operator_currentReadTimestampMs |
Horodatage du dernier enregistrement de données lu | Affichez l'horodatage des dernières données binlog. | ms | Custom |
flink_taskmanager_job_task_operator_numSnapshotRecords |
Nombre d'enregistrements traités durant la phase de snapshot | Affichez le volume de données traité durant la phase de snapshot. | Count | Custom |
flink_taskmanager_job_task_operator_cdcns_schema_table_numRecordsIn |
Nombre d'enregistrements lus pour chaque table | Affichez le volume total de données traité pour chaque table. | Count | Custom |
flink_taskmanager_job_task_operator_cdcns_schema_table_numSnapshotRecords |
Nombre d'enregistrements traités pour chaque table durant la phase de snapshot | Affichez le volume de données traité pour chaque table durant la phase de snapshot. | Count | Custom |
Instructions DML et DDL de la phase incrémentielle
| Metric | Description | Details | Unit | Type |
flink_taskmanager_job_task_operator_cdcns_schema_table_numInsertDMLRecords |
Nombre d'instructions INSERT DML traitées pour chaque table durant la phase incrémentielle | Affichez le volume de données des instructions INSERT pour chaque table. | Count | Custom |
flink_taskmanager_job_task_operator_cdcns_schema_table_numUpdateDMLRecords |
Nombre d'instructions UPDATE DML traitées pour chaque table durant la phase incrémentielle | Affichez le volume de données des instructions UPDATE pour chaque table. | Count | Custom |
flink_taskmanager_job_task_operator_cdcns_schema_table_numDeleteDMLRecords |
Nombre d'instructions DELETE DML traitées pour chaque table durant la phase incrémentielle | Affichez le volume de données des instructions DELETE pour chaque table. | Count | Custom |
flink_taskmanager_job_task_operator_cdcns_schema_table_numDDLRecords |
Nombre d'instructions DDL traitées pour chaque table durant la phase incrémentielle | Affichez le volume de données des instructions DDL pour chaque table. | Count | Custom |
flink_taskmanager_job_task_operator_numInsertDMLRecords |
Nombre d'instructions INSERT DML traitées durant la phase incrémentielle | Affichez le volume de données des instructions INSERT. | Count | Custom |
flink_taskmanager_job_task_operator_numUpdateDMLRecords |
Nombre d'instructions UPDATE DML traitées durant la phase incrémentielle | Affichez le volume de données des instructions UPDATE. | Count | Custom |
flink_taskmanager_job_task_operator_numDeleteDMLRecords |
Nombre d'instructions DELETE DML traitées durant la phase incrémentielle | Affichez le volume de données des instructions DELETE. | Count | Custom |
flink_taskmanager_job_task_operator_numDDLRecords |
Nombre d'instructions DDL traitées durant la phase incrémentielle | Affichez le volume de données des instructions DDL. | Count | Custom |
Ressources JVM et système du JobManager
CPU
| Metric | Description | Details | Unit | Type |
flink_jobmanager_Status_JVM_CPU_Load |
Charge d'un seul CPU du JobManager | Si cette valeur reste supérieure à 100 % pendant une période prolongée, le CPU est saturé et la charge est élevée. Cela peut affecter les performances du système et provoquer des ralentissements ou des temps de réponse excessivement longs. | N/A | Basic |
flink_jobmanager_Status_ProcessTree_CPU_Usage |
Utilisation du CPU par un seul CPU du JobManager | Cette valeur reflète le temps CPU occupé par Flink. La valeur est de 100 % lorsqu'un cœur de CPU est entièrement utilisé et de 400 % lorsque quatre cœurs de CPU sont entièrement utilisés. Si cette valeur reste supérieure à 100 % pendant une période prolongée, le CPU est très sollicité. Si la charge est élevée mais l'utilisation du CPU faible, des opérations de lecture et d'écriture fréquentes ont pu laisser trop de processus dans un état de sommeil ininterruptible. | N/A | Basic |
Mémoire
| Metric | Description | Details | Unit | Type |
flink_jobmanager_Status_JVM_Memory_Heap_Used |
Mémoire heap du JobManager | N/A | Bytes | Basic |
flink_jobmanager_Status_JVM_Memory_Heap_Committed |
Mémoire heap allouée par le JobManager | N/A | Bytes | Basic |
flink_jobmanager_Status_JVM_Memory_Heap_Max |
Mémoire heap maximale du JobManager | N/A | Bytes | Basic |
flink_jobmanager_Status_JVM_Memory_NonHeap_Used |
Mémoire non-heap du JobManager | N/A | Bytes | Basic |
flink_jobmanager_Status_JVM_Memory_NonHeap_Committed |
Mémoire non-heap allouée par le JobManager | N/A | Bytes | Basic |
flink_jobmanager_Status_JVM_Memory_NonHeap_Max |
Mémoire non-heap maximale du JobManager | N/A | Bytes | Basic |
Threads
| Metric | Description | Details | Unit | Type |
flink_jobmanager_Status_JVM_Threads_Count |
Nombre de threads du JobManager | Un nombre excessif de threads du JobManager occupe trop d'espace mémoire et réduit la stabilité du job. | Count | Basic |
Garbage collection
Les métriques du garbage collector G1 du tableau suivant sont des métriques personnalisées. Les autres métriques de garbage collection du JobManager sont des métriques de base.
| Metric | Description | Details | Unit | Type |
flink_jobmanager_Status_JVM_GarbageCollector_ParNew_Count |
Nombre de GC du JobManager | Un nombre excessif de GC occupe trop d'espace mémoire et affecte les performances du job. Cette métrique vous aide à diagnostiquer les jobs et à résoudre les pannes au niveau du job. | Count | Basic |
flink_jobmanager_Status_JVM_GarbageCollector_G1_Young_Generation_Count |
Nombre de GC de la jeune génération du JobManager (garbage collector G1) | N/A | Count | Custom |
flink_jobmanager_Status_JVM_GarbageCollector_G1_Old_Generation_Count |
Nombre de GC de l'ancienne génération du JobManager (garbage collector G1) | N/A | Count | Custom |
flink_jobmanager_Status_JVM_GarbageCollector_G1_Young_Generation_Time |
Temps de GC de la jeune génération du JobManager (garbage collector G1) | N/A | ms | Custom |
flink_jobmanager_Status_JVM_GarbageCollector_G1_Old_Generation_Time |
Temps de GC de l'ancienne génération du JobManager (garbage collector G1) | N/A | ms | Custom |
flink_jobmanager_Status_JVM_GarbageCollector_ConcurrentMarkSweep_Count |
Nombre de collections effectuées par le garbage collector CMS du JobManager | N/A | Count | Basic |
flink_jobmanager_Status_JVM_GarbageCollector_ParNew_Time |
Durée de chaque GC du JobManager | Des GC longs occupent trop d'espace mémoire et affectent les performances du job. Cette métrique vous aide à diagnostiquer les jobs et à résoudre les pannes au niveau du job. | ms | Basic |
flink_jobmanager_Status_JVM_GarbageCollector_ConcurrentMarkSweep_Time |
Temps consommé par les collections effectuées par le garbage collector CMS du JobManager | N/A | ms | Basic |
Chargement de classes
| Metric | Description | Details | Unit | Type |
flink_jobmanager_Status_JVM_ClassLoader_ClassesLoaded |
Nombre total de classes chargées après la création de la JVM hébergeant le JobManager | Si le nombre total de classes chargées après la création de la JVM hébergeant le JobManager est trop élevé, cela occupe un espace mémoire excessif et affecte les performances du job. | N/A | Basic |
flink_jobmanager_Status_JVM_ClassLoader_ClassesUnloaded |
Nombre total de classes déchargées après la création de la JVM hébergeant le JobManager | Si le nombre total de classes déchargées après la création de la JVM hébergeant le JobManager est trop élevé, cela occupe un espace mémoire excessif et affecte les performances du job. | N/A | Basic |
Ressources JVM et système du TaskManager
CPU
| Metric | Description | Details | Unit | Type |
flink_taskmanager_Status_JVM_CPU_Load |
Charge d'un seul CPU du TaskManager | Somme des processus gérés par le CPU et des processus en attente du CPU sur une période donnée, généralement comprise comme le niveau d'occupation du CPU. Le niveau d'occupation du CPU dépend du nombre de cœurs CPU. Dans Flink, la valeur de charge CPU correspond à CPU Usage / Number of CPU cores. Si flink_taskmanager_Status_JVM_CPU_Load est supérieure à la valeur de charge CPU, le traitement CPU peut être bloqué. |
N/A | Basic |
flink_taskmanager_Status_ProcessTree_CPU_Usage |
Utilisation du CPU par un seul CPU du TaskManager | Cette valeur reflète le temps CPU occupé par Flink. La valeur est de 100 % lorsqu'un cœur de CPU est entièrement utilisé et de 400 % lorsque quatre cœurs de CPU sont entièrement utilisés. Si cette valeur reste supérieure à 100 % pendant une période prolongée, le CPU est très sollicité. Si la charge est élevée mais l'utilisation du CPU faible, des opérations de lecture et d'écriture fréquentes ont pu laisser trop de processus dans un état de sommeil ininterruptible. | N/A | Basic |
Mémoire
| Metric | Description | Details | Unit | Type |
flink_taskmanager_Status_JVM_Memory_Heap_Used |
Mémoire heap du TaskManager | N/A | Bytes | Basic |
flink_taskmanager_Status_JVM_Memory_Heap_Committed |
Mémoire heap allouée par le TaskManager | N/A | Bytes | Basic |
flink_taskmanager_Status_JVM_Memory_Heap_Max |
Mémoire heap maximale du TaskManager | N/A | Bytes | Basic |
flink_taskmanager_Status_JVM_Memory_NonHeap_Used |
Mémoire non-heap du TaskManager | N/A | Bytes | Basic |
flink_taskmanager_Status_JVM_Memory_NonHeap_Committed |
Mémoire non-heap allouée par le TaskManager | N/A | Bytes | Basic |
flink_taskmanager_Status_JVM_Memory_NonHeap_Max |
Mémoire non-heap maximale du TaskManager | N/A | Bytes | Basic |
flink_taskmanager_Status_ProcessTree_Memory_RSS |
Mémoire de l'ensemble du processus obtenue via Linux | Observez les variations de la mémoire du processus. | Bytes | Basic |
Threads
| Metric | Description | Details | Unit | Type |
flink_taskmanager_Status_JVM_Threads_Count |
Nombre de threads du TaskManager | Un nombre excessif de threads du TaskManager occupe trop de mémoire et réduit la stabilité du job. | Count | Basic |
Garbage collection
Les métriques du garbage collector G1 du tableau suivant sont des métriques personnalisées. Les autres métriques de garbage collection du TaskManager sont des métriques de base.
| Metric | Description | Details | Unit | Type |
flink_taskmanager_Status_JVM_GarbageCollector_ParNew_Count |
Nombre de GC du TaskManager | Un nombre excessif de GC occupe trop d'espace mémoire et affecte les performances du job. Cette métrique vous aide à diagnostiquer les jobs et à résoudre les pannes au niveau des tâches. | Count | Basic |
flink_taskmanager_Status_JVM_GarbageCollector_G1_Young_Generation_Count |
Nombre de GC de la jeune génération du TaskManager (garbage collector G1) | N/A | Count | Custom |
flink_taskmanager_Status_JVM_GarbageCollector_G1_Old_Generation_Count |
Nombre de GC de l'ancienne génération du TaskManager (garbage collector G1) | N/A | Count | Custom |
flink_taskmanager_Status_JVM_GarbageCollector_G1_Young_Generation_Time |
Temps de GC de la jeune génération du TaskManager (garbage collector G1) | N/A | ms | Custom |
flink_taskmanager_Status_JVM_GarbageCollector_G1_Old_Generation_Time |
Temps de GC de l'ancienne génération du TaskManager (garbage collector G1) | N/A | ms | Custom |
flink_taskmanager_Status_JVM_GarbageCollector_ConcurrentMarkSweep_Count |
Nombre de collections effectuées par le garbage collector CMS du TaskManager | N/A | Count | Basic |
flink_taskmanager_Status_JVM_GarbageCollector_ParNew_Time |
Durée de chaque GC du TaskManager | Des GC longs occupent trop d'espace mémoire et affectent les performances du job. Cette métrique vous aide à diagnostiquer les jobs et à résoudre les pannes au niveau des tâches. | ms | Basic |
flink_taskmanager_Status_JVM_GarbageCollector_ConcurrentMarkSweep_Time |
Temps consommé par les collections effectuées par le garbage collector CMS du TaskManager | N/A | ms | Basic |
Chargement de classes
| Metric | Description | Details | Unit | Type |
flink_taskmanager_Status_JVM_ClassLoader_ClassesLoaded |
Nombre total de classes chargées après la création de la JVM hébergeant le TaskManager | Si le nombre total de classes chargées après la création de la JVM hébergeant le TaskManager est trop élevé, cela occupe un espace mémoire excessif et affecte les performances du job. | N/A | Basic |
flink_taskmanager_Status_JVM_ClassLoader_ClassesUnloaded |
Nombre total de classes déchargées après la création de la JVM hébergeant le TaskManager | Si le nombre total de classes déchargées après la création de la JVM hébergeant le TaskManager est trop élevé, cela occupe un espace mémoire excessif et affecte les performances du job. | N/A | Basic |
Libellés courants des métriques
Les métriques Flink portent couramment les libellés suivants. Utilisez-les pour filtrer et agréger les données de métriques par projet, déploiement ou job.
| Label | Description |
vvpNamespace |
Namespace du projet. |
deploymentName |
Nom du déploiement. |
deploymentId |
ID du déploiement. |
jobId |
ID du job. |
Références
Les rubriques suivantes couvrent les ensembles de métriques connexes et les options de gestion des métriques.
Pour afficher les métriques de Application Monitoring dans ARMS, consultez Métriques de Application Monitoring.