Tous les produits
Search
Centre de documentation

Managed Service for Prometheus:Métriques Flink

Dernière mise à jour :Aug 24, 2026

Managed Service for Prometheus prend en charge un ensemble de métriques Flink collectées depuis Alibaba Cloud Realtime Compute for Apache Flink. Chaque métrique est classée comme métrique de base ou métrique personnalisée ; cette classification détermine si la transmission de la métrique entraîne des frais.

Types de métriques et facturation

La facturation de Managed Service for Prometheus repose sur le volume de données écrites ou le nombre de points de données transmis. Les métriques se répartissent en deux catégories :

  • Métriques de base — Les métriques de base collectées depuis Alibaba Cloud Realtime Compute for Apache Flink sont gratuites lorsqu'elles sont transmises ou écrites dans Managed Service for Prometheus. Cet avantage ne s'applique pas aux autres services Flink, tels que les instances Flink autogérées.

  • Métriques personnalisées — Toute métrique autre qu'une métrique de base est considérée comme une métrique personnalisée. La facturation des métriques personnalisées est effective depuis le 6 janvier 2020. La colonne Type de chaque table de cette rubrique indique la catégorie de la métrique. Les métriques de base sont principalement regroupées dans les sections relatives à la JVM et aux ressources système du JobManager et du TaskManager. Les métriques des autres sections sont des métriques personnalisées ; par conséquent, les données relatives à l'état de santé des jobs, à la latence, au débit, aux checkpoints, à l'état, aux fenêtres et aux connecteurs CDC sont facturées lors de leur transmission. Au sein des deux sections JVM, les huit métriques du garbage collector G1 sont des métriques personnalisées, bien que les métriques adjacentes soient des métriques de base.

Lecture des tables de métriques

Chaque table de métriques de cette rubrique utilise les cinq colonnes suivantes :

  • Metric — Nom de la métrique tel qu'il est transmis à Managed Service for Prometheus.

  • Description — Ce que la métrique mesure.

  • Details — Interprétation de la valeur ou éléments à vérifier en cas d'anomalie.

  • Unit — Unité de la valeur de la métrique. Les unités utilisées dans cette rubrique sont Count, Count/s, Bytes, Bytes/s, ms et ns.

  • Type — Catégorie de la métrique : Basic ou Custom. La mention N/A dans une cellule signifie qu'aucune valeur n'est fournie pour cette cellule dans cette rubrique. Dans la colonne Unit, N/A indique qu'aucune unité n'est documentée pour la métrique.

Certains noms de métriques contiennent un segment variable substitué lors de la transmission ; le nom figurant dans la table n'est donc pas le nom littéral d'une série temporelle. state_name représente le nom de l'état auquel s'applique la métrique, et cdcns_schema_table représente le namespace CDC, le nom du schéma et le nom de la table surveillée. Remplacez ces segments par les valeurs réelles avant d'utiliser un nom de métrique dans une requête ou une règle d'alerte.

État de santé des jobs

Metric Description Details Unit Type
flink_jobmanager_job_numRestarts Nombre de redémarrages de job causés par des erreurs Nombre de redémarrages provoqués par des erreurs de job. Les basculements du JobManager ne sont pas comptabilisés. Count Custom
flink_jobmanager_job_uptime Temps d'exécution du job N/A ms Custom
flink_jobmanager_numRunningJobs Nombre de jobs en cours d'exécution N/A N/A Custom
flink_jobmanager_taskSlotsAvailable Nombre de slots de tâche disponibles N/A N/A Custom
flink_jobmanager_taskSlotsTotal Nombre total de slots de tâche N/A N/A Custom
flink_jobmanager_numRegisteredTaskManagers Nombre de TaskManagers enregistrés N/A N/A Custom

Latence

Metric Description Details Unit Type
flink_taskmanager_job_task_operator_currentEmitEventTimeLag Décalage temporel (event-time) des enregistrements émis par l'opérateur Une valeur élevée indique que le job peut rencontrer de la latence lors de l'extraction ou du traitement des données. ms Custom
flink_taskmanager_job_task_operator_currentFetchEventTimeLag Décalage temporel (event-time) des enregistrements extraits par l'opérateur Une valeur élevée indique que le job peut rencontrer de la latence lors de l'extraction des données. ms Custom
flink_taskmanager_job_task_currentInputWatermark Horodatage du watermark le plus récent reçu par chaque tâche Indique la latence des données reçues par la tâche. N/A Custom
flink_taskmanager_job_task_operator_watermarkLag Décalage du watermark de l'opérateur Indique la latence du job au niveau des sous-tâches. ms Custom

Débit

Débit d'enregistrements

Metric Description Details Unit Type
flink_taskmanager_job_task_numRecordsIn Nombre total d'enregistrements reçus par la tâche Si la valeur numRecordsIn d'une tâche n'augmente pas pendant une période prolongée, il est possible que les données en amont aient été abandonnées et non transmises. Vérifiez dans ce cas les données en amont. Count Custom
flink_taskmanager_job_task_numRecordsOut Nombre total d'enregistrements produits par la tâche Si la valeur numRecordsOut d'une tâche n'augmente pas pendant une période prolongée, une erreur logique dans le code du job a pu entraîner l'abandon des données sans transmission. Vérifiez dans ce cas la logique du code du job. Count Custom
flink_taskmanager_job_task_operator_numRecordsIn Nombre total d'enregistrements reçus par l'opérateur Si la valeur numRecordsIn d'un opérateur n'augmente pas pendant une période prolongée, il est possible que les données en amont aient été abandonnées et non transmises. Vérifiez dans ce cas les données en amont. Count Custom
flink_taskmanager_job_task_operator_numRecordsOut Nombre total d'enregistrements produits par l'opérateur Si la valeur numRecordsOut d'un opérateur n'augmente pas pendant une période prolongée, une erreur logique dans le code du job a pu entraîner l'abandon des données sans transmission. Vérifiez dans ce cas la logique du code du job. Count Custom
flink_taskmanager_job_task_operator_source_numRecordsIn Enregistrements d'entrée de l'opérateur source uniquement Vérifiez l'entrée des données en amont. Count Custom
flink_taskmanager_job_task_operator_sink_numRecordsOut Nombre total d'enregistrements produits par le sink Vérifiez la sortie des données en aval. Count Custom
flink_taskmanager_job_task_numRecordsInPerSecond Nombre d'enregistrements reçus par la tâche par seconde S'applique aux scénarios nécessitant la surveillance de la vitesse de traitement d'une tâche. Par exemple, vous pouvez vérifier si la vitesse de traitement de la tâche atteint le niveau attendu et comment les performances évoluent sous différentes charges d'entrée. Count/s Custom
flink_taskmanager_job_task_numRecordsOutPerSecond Nombre d'enregistrements produits par la tâche par seconde S'applique aux scénarios nécessitant la surveillance de la vitesse de sortie d'une tâche. Par exemple, vous pouvez vérifier si la vitesse de sortie de la tâche atteint le niveau attendu et comment les performances évoluent sous différentes charges de sortie. Count/s Custom
flink_taskmanager_job_task_operator_numRecordsInPerSecond Nombre d'enregistrements reçus par l'opérateur par seconde S'applique aux scénarios nécessitant la surveillance de la vitesse de traitement d'un opérateur. Par exemple, vous pouvez vérifier si la vitesse de traitement de l'opérateur atteint le niveau attendu et comment les performances évoluent sous différentes charges d'entrée. Count/s Custom
flink_taskmanager_job_task_operator_numRecordsOutPerSecond Nombre d'enregistrements produits par l'opérateur par seconde S'applique aux scénarios nécessitant la surveillance de la vitesse de sortie d'un opérateur. Par exemple, vous pouvez vérifier si la vitesse de sortie de l'opérateur atteint le niveau attendu et comment les performances évoluent sous différentes charges de sortie. Count/s Custom
flink_taskmanager_job_task_operator_source_numRecordsInPerSecond Nombre d'enregistrements d'entrée par seconde pour la source S'applique aux scénarios nécessitant la compréhension du taux de génération de chaque source de données et la mesure du nombre d'enregistrements générés par seconde par chaque source. Différentes sources de données dans un flux de données peuvent générer des nombres d'enregistrements différents ; cette métrique vous aide donc à optimiser le flux de données pour de meilleures performances. Cette métrique est également utilisée pour la surveillance et les alertes. Une valeur de 0 peut indiquer que les données en amont ont été abandonnées. Vérifiez si la sortie est bloquée car les données en amont n'ont pas été consommées. Count/s Custom
flink_taskmanager_job_task_operator_sink_numRecordsOutPerSecond Nombre d'enregistrements de sortie par seconde pour le sink S'applique aux scénarios nécessitant la compréhension de la vitesse de sortie de chaque sink et la mesure du nombre d'enregistrements produits par seconde par chaque sink. Différents sinks dans un flux de données peuvent produire des nombres d'enregistrements différents ; cette métrique vous aide donc à optimiser le flux de données pour de meilleures performances. Cette métrique est également utilisée pour la surveillance et les alertes. Une valeur de 0 peut indiquer une erreur logique dans le code du job ayant filtré toutes les données. Vérifiez dans ce cas la logique du code du job. Count/s Custom

Débit en octets

Metric Description Details Unit Type
flink_taskmanager_job_task_operator_numBytesIn Nombre total d'octets reçus par l'opérateur Vérifiez l'entrée du débit en amont pour observer le trafic du job. Bytes Custom
flink_taskmanager_job_task_operator_numBytesOut Nombre total d'octets produits par l'opérateur Vérifiez la sortie du débit en aval pour observer le trafic du job. Bytes Custom
flink_taskmanager_job_task_operator_numBytesInPerSecond Nombre d'octets reçus par l'opérateur par seconde N/A Bytes/s Custom
flink_taskmanager_job_task_operator_numBytesOutPerSecond Nombre d'octets produits par l'opérateur par seconde Vérifiez la sortie du débit en aval pour observer le trafic du job. Bytes/s Custom
flink_taskmanager_job_task_numBytesInLocalPerSecond Nombre d'octets lus par la tâche par seconde depuis des sources locales Vérifiez le taux d'entrée en amont pour observer le trafic du job. Bytes/s Custom
flink_taskmanager_job_task_numBytesInRemotePerSecond Nombre d'octets lus par la tâche par seconde depuis des sources distantes N/A Bytes/s Custom
flink_taskmanager_job_task_numBytesOutPerSecond Nombre d'octets produits par la tâche par seconde N/A Bytes/s Custom

Tampons réseau

Metric Description Details Unit Type
flink_taskmanager_job_task_numBuffersInLocalPerSecond Nombre de tampons de données locaux consommés par seconde Une valeur élevée indique une communication locale fréquente entre les tâches, c'est-à-dire une communication sur le même nœud. Count/s Custom
flink_taskmanager_job_task_numBuffersInRemotePerSecond Nombre de tampons reçus par seconde depuis des TaskManagers distants Reflète la fréquence de la communication entre TaskManagers. Count/s Custom
flink_taskmanager_job_task_numBuffersOutPerSecond Nombre de tampons envoyés par seconde à d'autres tâches Indique la pression de sortie des tâches et l'utilisation de la bande passante réseau. Count/s Custom

Source et sink

Metric Description Details Unit Type
flink_taskmanager_job_task_operator_pendingRecords Nombre d'enregistrements non lus au niveau de la source Nombre d'enregistrements dans le système externe qui n'ont pas encore été extraits par la source. Count Custom
flink_taskmanager_job_task_operator_sourceIdleTime Durée pendant laquelle la source n'a pas traité de données Indique si la source est inactive. Une valeur élevée signifie que le taux de génération de données dans le système externe est faible. ms Custom
flink_taskmanager_job_task_operator_currentSendTime Temps nécessaire à l'envoi de l'enregistrement le plus récent N/A ms Custom

Checkpoints

Metric Description Details Unit Type
flink_jobmanager_job_totalNumberOfCheckpoints Nombre total de checkpoints N/A Count Custom
flink_jobmanager_job_numberOfFailedCheckpoints Nombre de checkpoints échoués N/A Count Custom
flink_jobmanager_job_numberOfCompletedCheckpoints Nombre de checkpoints terminés N/A Count Custom
flink_jobmanager_job_numberOfInProgressCheckpoints Nombre de checkpoints en cours N/A Count Custom
flink_jobmanager_job_lastCheckpointDuration Durée du checkpoint le plus récent Si un checkpoint prend trop de temps ou expire, la cause peut être un état excessivement volumineux, un problème réseau transitoire, des barrières non alignées ou une contre-pression des données. ms Custom
flink_jobmanager_job_lastCheckpointSize Taille du checkpoint le plus récent Taille du checkpoint effectivement téléchargé le plus récemment. Utilisez cette métrique pour analyser les performances des checkpoints lorsque ceux-ci constituent un goulot d'étranglement. Bytes Custom

État

Les métriques d'état rapportent la latence maximale d'une seule opération d'état, groupée par type d'état, ainsi que la taille des données d'état stockées par GeminiDB. Dans le nom d'une métrique de latence d'état, remplacez state_name par le nom de l'état que vous souhaitez surveiller. Chaque métrique de latence indique les performances de l'opération d'état identifiée par son nom ; la colonne Details contient donc N/A pour ces métriques.

Général

Metric Description Details Unit Type
flink_taskmanager_job_task_operator_state_name_stateClearLatency Latence maximale d'une seule opération de suppression d'état N/A ns Custom

Value state

Metric Description Details Unit Type
flink_taskmanager_job_task_operator_state_name_valueStateGetLatency Latence maximale d'un seul accès à un value state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_valueStateUpdateLatency Latence maximale d'une seule mise à jour de value state N/A ns Custom

Aggregating state

Metric Description Details Unit Type
flink_taskmanager_job_task_operator_state_name_aggregatingStateGetLatency Latence maximale d'un seul accès à un aggregating state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_aggregatingStateAddLatency Latence maximale d'une seule opération d'ajout à un aggregating state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_aggregatingStateMergeNamespacesLatency Latence maximale d'une seule opération de fusion de namespaces pour un aggregating state N/A ns Custom

Reducing state

Metric Description Details Unit Type
flink_taskmanager_job_task_operator_state_name_reducingStateGetLatency Latence maximale d'un seul accès à un reducing state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_reducingStateAddLatency Latence maximale d'une seule opération d'ajout à un reducing state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_reducingStateMergeNamespacesLatency Latence maximale d'une seule opération de fusion de namespaces pour un reducing state N/A ns Custom

Map state

Metric Description Details Unit Type
flink_taskmanager_job_task_operator_state_name_mapStateGetLatency Latence maximale d'un seul accès à un map state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_mapStatePutLatency Latence maximale d'une seule opération put sur un map state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_mapStatePutAllLatency Latence maximale d'une seule opération put all sur un map state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_mapStateRemoveLatency Latence maximale d'une seule opération remove sur un map state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_mapStateContainsLatency Latence maximale d'une seule opération contains sur un map state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_mapStateEntriesInitLatency Latence maximale d'une seule opération d'initialisation des entrées d'un map state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_mapStateKeysInitLatency Latence maximale d'une seule opération d'initialisation des clés d'un map state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_mapStateValuesInitLatency Latence maximale d'une seule opération d'initialisation des valeurs d'un map state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_mapStateIteratorInitLatency Latence maximale d'une seule opération d'initialisation de l'itérateur d'un map state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_mapStateIsEmptyLatency Latence maximale d'une seule vérification de vacuité d'un map state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_mapStateIteratorHasNextLatency Latence maximale d'une seule opération hasNext de l'itérateur d'un map state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_mapStateIteratorNextLatency Latence maximale d'une seule opération next de l'itérateur d'un map state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_mapStateIteratorRemoveLatency Latence maximale d'une seule opération remove de l'itérateur d'un map state N/A ns Custom

List state

Metric Description Details Unit Type
flink_taskmanager_job_task_operator_state_name_listStateGetLatency Latence maximale d'un seul accès à un list state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_listStateAddLatency Latence maximale d'une seule opération d'ajout à un list state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_listStateAddAllLatency Latence maximale d'une seule opération add all sur un list state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_listStateUpdateLatency Latence maximale d'une seule mise à jour de list state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_listStateMergeNamespacesLatency Latence maximale d'une seule opération de fusion de namespaces pour un list state N/A ns Custom

Sorted map state

Metric Description Details Unit Type
flink_taskmanager_job_task_operator_state_name_sortedMapStateFirstEntryLatency Latence maximale d'un seul accès à la première entrée d'un sorted map state N/A ns Custom
flink_taskmanager_job_task_operator_state_name_sortedMapStateLastEntryLatency Latence maximale d'un seul accès à la dernière entrée d'un sorted map state N/A ns Custom

Stockage d'état GeminiDB

Metric Description Details Unit Type
flink_taskmanager_job_task_operator_geminiDB_total_size Taille des données d'état La surveillance de cette métrique permet d'identifier, directement ou préventivement, les nœuds susceptibles de présenter des goulots d'étranglement liés à l'état, et de déterminer si le TTL (Time To Live) est effectif. Bytes Custom
flink_taskmanager_job_task_operator_geminiDB_total_filesize Taille des fichiers de données d'état La surveillance de cette métrique permet de vérifier l'espace disque local occupé par l'état, afin de prendre des mesures préventives en cas d'utilisation élevée, et de déterminer si un espace disque local insuffisant est causé par des données d'état excessivement volumineuses. Bytes Custom

Métriques de fenêtre

Metric Description Details Unit Type
flink_taskmanager_job_task_operator_numLateRecordsDropped Nombre total d'enregistrements abandonnés en raison de la latence de fenêtre N/A Count Custom
flink_taskmanager_job_task_operator_lateRecordsDroppedRate Taux d'abandon d'enregistrements en raison de la latence de fenêtre N/A N/A Custom

Métriques des connecteurs CDC

Les métriques des connecteurs Change Data Capture (CDC) suivent la phase de snapshot, durant laquelle les données complètes sont traitées, et la phase de journalisation binaire (binlog), durant laquelle les données incrémentielles sont traitées. Les tableaux suivants regroupent ces métriques selon la phase actuelle du job, la progression de la phase de snapshot, le volume de données lu, ainsi que les instructions DML et DDL traitées durant la phase incrémentielle.

Dans un nom de métrique, remplacez cdcns_schema_table par le namespace CDC, le nom du schéma et le nom de la table que vous souhaitez surveiller. Les métriques dont le nom contient ce segment rapportent des valeurs pour une seule table. Les métriques dont le nom omet ce segment rapportent des valeurs pour l'ensemble du job.

Indicateurs de phase

Metric Description Details Unit Type
flink_jobmanager_job_operator_coordinator_enumerator_isSnapshotting Indique si le job se trouve dans la phase de traitement des données complètes Déterminez si le job est toujours en phase de snapshot. N/A Custom
flink_jobmanager_job_operator_coordinator_enumerator_isBinlogReading Indique si le job se trouve dans la phase de traitement des données incrémentielles Déterminez si le job est entré en phase binlog. N/A Custom

Progression du snapshot

Metric Description Details Unit Type
flink_jobmanager_job_operator_coordinator_enumerator_numTablesRemaining Nombre de tables non traitées durant la phase de snapshot Affichez le nombre de tables encore en attente de traitement. Count Custom
flink_jobmanager_job_operator_coordinator_enumerator_numTablesSnapshotted Nombre de tables dont le snapshot est terminé Affichez le nombre de tables déjà traitées. Count Custom
flink_jobmanager_job_operator_coordinator_enumerator_numSnapshotSplitsProcessed Nombre de shards traités durant la phase de snapshot, pour l'ensemble du job Affichez le nombre de shards traités pour toutes les tables. Count Custom
flink_jobmanager_job_operator_coordinator_enumerator_cdcns_schema_table_numSnapshotSplitsProcessed Nombre de shards traités durant la phase de snapshot, pour une seule table Affichez le nombre de shards traités pour la table spécifiée. Count Custom
flink_jobmanager_job_operator_coordinator_enumerator_numSnapshotSplitsRemaining Nombre de shards en attente de traitement durant la phase de snapshot, pour l'ensemble du job Affichez le nombre de shards non traités pour toutes les tables. Count Custom
flink_jobmanager_job_operator_coordinator_enumerator_cdcns_schema_table_numSnapshotSplitsRemaining Nombre de shards en attente de traitement durant la phase de snapshot, pour une seule table Affichez le nombre de shards non traités pour la table spécifiée. Count Custom

Volume de données

Metric Description Details Unit Type
flink_taskmanager_job_task_operator_currentReadTimestampMs Horodatage du dernier enregistrement de données lu Affichez l'horodatage des dernières données binlog. ms Custom
flink_taskmanager_job_task_operator_numSnapshotRecords Nombre d'enregistrements traités durant la phase de snapshot Affichez le volume de données traité durant la phase de snapshot. Count Custom
flink_taskmanager_job_task_operator_cdcns_schema_table_numRecordsIn Nombre d'enregistrements lus pour chaque table Affichez le volume total de données traité pour chaque table. Count Custom
flink_taskmanager_job_task_operator_cdcns_schema_table_numSnapshotRecords Nombre d'enregistrements traités pour chaque table durant la phase de snapshot Affichez le volume de données traité pour chaque table durant la phase de snapshot. Count Custom

Instructions DML et DDL de la phase incrémentielle

Metric Description Details Unit Type
flink_taskmanager_job_task_operator_cdcns_schema_table_numInsertDMLRecords Nombre d'instructions INSERT DML traitées pour chaque table durant la phase incrémentielle Affichez le volume de données des instructions INSERT pour chaque table. Count Custom
flink_taskmanager_job_task_operator_cdcns_schema_table_numUpdateDMLRecords Nombre d'instructions UPDATE DML traitées pour chaque table durant la phase incrémentielle Affichez le volume de données des instructions UPDATE pour chaque table. Count Custom
flink_taskmanager_job_task_operator_cdcns_schema_table_numDeleteDMLRecords Nombre d'instructions DELETE DML traitées pour chaque table durant la phase incrémentielle Affichez le volume de données des instructions DELETE pour chaque table. Count Custom
flink_taskmanager_job_task_operator_cdcns_schema_table_numDDLRecords Nombre d'instructions DDL traitées pour chaque table durant la phase incrémentielle Affichez le volume de données des instructions DDL pour chaque table. Count Custom
flink_taskmanager_job_task_operator_numInsertDMLRecords Nombre d'instructions INSERT DML traitées durant la phase incrémentielle Affichez le volume de données des instructions INSERT. Count Custom
flink_taskmanager_job_task_operator_numUpdateDMLRecords Nombre d'instructions UPDATE DML traitées durant la phase incrémentielle Affichez le volume de données des instructions UPDATE. Count Custom
flink_taskmanager_job_task_operator_numDeleteDMLRecords Nombre d'instructions DELETE DML traitées durant la phase incrémentielle Affichez le volume de données des instructions DELETE. Count Custom
flink_taskmanager_job_task_operator_numDDLRecords Nombre d'instructions DDL traitées durant la phase incrémentielle Affichez le volume de données des instructions DDL. Count Custom

Ressources JVM et système du JobManager

CPU

Metric Description Details Unit Type
flink_jobmanager_Status_JVM_CPU_Load Charge d'un seul CPU du JobManager Si cette valeur reste supérieure à 100 % pendant une période prolongée, le CPU est saturé et la charge est élevée. Cela peut affecter les performances du système et provoquer des ralentissements ou des temps de réponse excessivement longs. N/A Basic
flink_jobmanager_Status_ProcessTree_CPU_Usage Utilisation du CPU par un seul CPU du JobManager Cette valeur reflète le temps CPU occupé par Flink. La valeur est de 100 % lorsqu'un cœur de CPU est entièrement utilisé et de 400 % lorsque quatre cœurs de CPU sont entièrement utilisés. Si cette valeur reste supérieure à 100 % pendant une période prolongée, le CPU est très sollicité. Si la charge est élevée mais l'utilisation du CPU faible, des opérations de lecture et d'écriture fréquentes ont pu laisser trop de processus dans un état de sommeil ininterruptible. N/A Basic

Mémoire

Metric Description Details Unit Type
flink_jobmanager_Status_JVM_Memory_Heap_Used Mémoire heap du JobManager N/A Bytes Basic
flink_jobmanager_Status_JVM_Memory_Heap_Committed Mémoire heap allouée par le JobManager N/A Bytes Basic
flink_jobmanager_Status_JVM_Memory_Heap_Max Mémoire heap maximale du JobManager N/A Bytes Basic
flink_jobmanager_Status_JVM_Memory_NonHeap_Used Mémoire non-heap du JobManager N/A Bytes Basic
flink_jobmanager_Status_JVM_Memory_NonHeap_Committed Mémoire non-heap allouée par le JobManager N/A Bytes Basic
flink_jobmanager_Status_JVM_Memory_NonHeap_Max Mémoire non-heap maximale du JobManager N/A Bytes Basic

Threads

Metric Description Details Unit Type
flink_jobmanager_Status_JVM_Threads_Count Nombre de threads du JobManager Un nombre excessif de threads du JobManager occupe trop d'espace mémoire et réduit la stabilité du job. Count Basic

Garbage collection

Les métriques du garbage collector G1 du tableau suivant sont des métriques personnalisées. Les autres métriques de garbage collection du JobManager sont des métriques de base.

Metric Description Details Unit Type
flink_jobmanager_Status_JVM_GarbageCollector_ParNew_Count Nombre de GC du JobManager Un nombre excessif de GC occupe trop d'espace mémoire et affecte les performances du job. Cette métrique vous aide à diagnostiquer les jobs et à résoudre les pannes au niveau du job. Count Basic
flink_jobmanager_Status_JVM_GarbageCollector_G1_Young_Generation_Count Nombre de GC de la jeune génération du JobManager (garbage collector G1) N/A Count Custom
flink_jobmanager_Status_JVM_GarbageCollector_G1_Old_Generation_Count Nombre de GC de l'ancienne génération du JobManager (garbage collector G1) N/A Count Custom
flink_jobmanager_Status_JVM_GarbageCollector_G1_Young_Generation_Time Temps de GC de la jeune génération du JobManager (garbage collector G1) N/A ms Custom
flink_jobmanager_Status_JVM_GarbageCollector_G1_Old_Generation_Time Temps de GC de l'ancienne génération du JobManager (garbage collector G1) N/A ms Custom
flink_jobmanager_Status_JVM_GarbageCollector_ConcurrentMarkSweep_Count Nombre de collections effectuées par le garbage collector CMS du JobManager N/A Count Basic
flink_jobmanager_Status_JVM_GarbageCollector_ParNew_Time Durée de chaque GC du JobManager Des GC longs occupent trop d'espace mémoire et affectent les performances du job. Cette métrique vous aide à diagnostiquer les jobs et à résoudre les pannes au niveau du job. ms Basic
flink_jobmanager_Status_JVM_GarbageCollector_ConcurrentMarkSweep_Time Temps consommé par les collections effectuées par le garbage collector CMS du JobManager N/A ms Basic

Chargement de classes

Metric Description Details Unit Type
flink_jobmanager_Status_JVM_ClassLoader_ClassesLoaded Nombre total de classes chargées après la création de la JVM hébergeant le JobManager Si le nombre total de classes chargées après la création de la JVM hébergeant le JobManager est trop élevé, cela occupe un espace mémoire excessif et affecte les performances du job. N/A Basic
flink_jobmanager_Status_JVM_ClassLoader_ClassesUnloaded Nombre total de classes déchargées après la création de la JVM hébergeant le JobManager Si le nombre total de classes déchargées après la création de la JVM hébergeant le JobManager est trop élevé, cela occupe un espace mémoire excessif et affecte les performances du job. N/A Basic

Ressources JVM et système du TaskManager

CPU

Metric Description Details Unit Type
flink_taskmanager_Status_JVM_CPU_Load Charge d'un seul CPU du TaskManager Somme des processus gérés par le CPU et des processus en attente du CPU sur une période donnée, généralement comprise comme le niveau d'occupation du CPU. Le niveau d'occupation du CPU dépend du nombre de cœurs CPU. Dans Flink, la valeur de charge CPU correspond à CPU Usage / Number of CPU cores. Si flink_taskmanager_Status_JVM_CPU_Load est supérieure à la valeur de charge CPU, le traitement CPU peut être bloqué. N/A Basic
flink_taskmanager_Status_ProcessTree_CPU_Usage Utilisation du CPU par un seul CPU du TaskManager Cette valeur reflète le temps CPU occupé par Flink. La valeur est de 100 % lorsqu'un cœur de CPU est entièrement utilisé et de 400 % lorsque quatre cœurs de CPU sont entièrement utilisés. Si cette valeur reste supérieure à 100 % pendant une période prolongée, le CPU est très sollicité. Si la charge est élevée mais l'utilisation du CPU faible, des opérations de lecture et d'écriture fréquentes ont pu laisser trop de processus dans un état de sommeil ininterruptible. N/A Basic

Mémoire

Metric Description Details Unit Type
flink_taskmanager_Status_JVM_Memory_Heap_Used Mémoire heap du TaskManager N/A Bytes Basic
flink_taskmanager_Status_JVM_Memory_Heap_Committed Mémoire heap allouée par le TaskManager N/A Bytes Basic
flink_taskmanager_Status_JVM_Memory_Heap_Max Mémoire heap maximale du TaskManager N/A Bytes Basic
flink_taskmanager_Status_JVM_Memory_NonHeap_Used Mémoire non-heap du TaskManager N/A Bytes Basic
flink_taskmanager_Status_JVM_Memory_NonHeap_Committed Mémoire non-heap allouée par le TaskManager N/A Bytes Basic
flink_taskmanager_Status_JVM_Memory_NonHeap_Max Mémoire non-heap maximale du TaskManager N/A Bytes Basic
flink_taskmanager_Status_ProcessTree_Memory_RSS Mémoire de l'ensemble du processus obtenue via Linux Observez les variations de la mémoire du processus. Bytes Basic

Threads

Metric Description Details Unit Type
flink_taskmanager_Status_JVM_Threads_Count Nombre de threads du TaskManager Un nombre excessif de threads du TaskManager occupe trop de mémoire et réduit la stabilité du job. Count Basic

Garbage collection

Les métriques du garbage collector G1 du tableau suivant sont des métriques personnalisées. Les autres métriques de garbage collection du TaskManager sont des métriques de base.

Metric Description Details Unit Type
flink_taskmanager_Status_JVM_GarbageCollector_ParNew_Count Nombre de GC du TaskManager Un nombre excessif de GC occupe trop d'espace mémoire et affecte les performances du job. Cette métrique vous aide à diagnostiquer les jobs et à résoudre les pannes au niveau des tâches. Count Basic
flink_taskmanager_Status_JVM_GarbageCollector_G1_Young_Generation_Count Nombre de GC de la jeune génération du TaskManager (garbage collector G1) N/A Count Custom
flink_taskmanager_Status_JVM_GarbageCollector_G1_Old_Generation_Count Nombre de GC de l'ancienne génération du TaskManager (garbage collector G1) N/A Count Custom
flink_taskmanager_Status_JVM_GarbageCollector_G1_Young_Generation_Time Temps de GC de la jeune génération du TaskManager (garbage collector G1) N/A ms Custom
flink_taskmanager_Status_JVM_GarbageCollector_G1_Old_Generation_Time Temps de GC de l'ancienne génération du TaskManager (garbage collector G1) N/A ms Custom
flink_taskmanager_Status_JVM_GarbageCollector_ConcurrentMarkSweep_Count Nombre de collections effectuées par le garbage collector CMS du TaskManager N/A Count Basic
flink_taskmanager_Status_JVM_GarbageCollector_ParNew_Time Durée de chaque GC du TaskManager Des GC longs occupent trop d'espace mémoire et affectent les performances du job. Cette métrique vous aide à diagnostiquer les jobs et à résoudre les pannes au niveau des tâches. ms Basic
flink_taskmanager_Status_JVM_GarbageCollector_ConcurrentMarkSweep_Time Temps consommé par les collections effectuées par le garbage collector CMS du TaskManager N/A ms Basic

Chargement de classes

Metric Description Details Unit Type
flink_taskmanager_Status_JVM_ClassLoader_ClassesLoaded Nombre total de classes chargées après la création de la JVM hébergeant le TaskManager Si le nombre total de classes chargées après la création de la JVM hébergeant le TaskManager est trop élevé, cela occupe un espace mémoire excessif et affecte les performances du job. N/A Basic
flink_taskmanager_Status_JVM_ClassLoader_ClassesUnloaded Nombre total de classes déchargées après la création de la JVM hébergeant le TaskManager Si le nombre total de classes déchargées après la création de la JVM hébergeant le TaskManager est trop élevé, cela occupe un espace mémoire excessif et affecte les performances du job. N/A Basic

Libellés courants des métriques

Les métriques Flink portent couramment les libellés suivants. Utilisez-les pour filtrer et agréger les données de métriques par projet, déploiement ou job.

Label Description
vvpNamespace Namespace du projet.
deploymentName Nom du déploiement.
deploymentId ID du déploiement.
jobId ID du job.

Références

Les rubriques suivantes couvrent les ensembles de métriques connexes et les options de gestion des métriques.