Todos os produtos
Search
Central de documentação

Realtime Compute for Apache Flink:Métricas

Última atualização: Jun 30, 2026

Este tópico descreve as métricas do Flink totalmente gerenciado.

Observações

Discrepâncias de dados entre o CloudMonitor e o console do Flink

  1. Diferenças nas dimensões exibidasO console do Flink utiliza consultas PromQL para exibir apenas a latência máxima. Em cenários de computação em tempo real, a latência média pode mascarar problemas graves, como desbalanceamento de dados ou bloqueios em partições únicas. Portanto, somente a latência máxima oferece insights operacionais valiosos.

  2. Discrepâncias de valoresO CloudMonitor emprega um mecanismo de pré-agregação para calcular métricas. O valor "máximo" no CloudMonitor pode divergir ligeiramente do valor em tempo real no console do Flink devido a diferenças nas janelas de agregação, timestamps de amostragem ou lógica de cálculo. Para solução de problemas, utilize os dados do console do Flink como source da verdade.

Latência de dados e configuração de watermark

  1. Lógica de cálculo de latênciaA métrica de monitoramento atual Emit Delay é calculada com base no tempo de evento, utilizando a seguinte fórmula:

    Delay = Tempo Atual do Sistema - Campo de tempo lógico no registro de dados (ex.: PriceData.time)

    Isso significa que a métrica reflete a atualização dos dados, e não a velocidade de processamento do sistema. Essa métrica apresenta valores elevados quando os dados de origem são antigos ou quando o sistema pausa a saída para alinhar watermarks.

  2. Recomendações

    Cenário 1: Sua lógica de negócio depende de watermarks para garantir correção, mas os dados de origem são antigos

    • Situações típicas:

      • A entrega de dados upstream possui atraso inerente (ex.: relatórios lentos de eventos).

      • Você está executando um backfill para processar dados de um dia anterior.

      • A lógica de negócio exige watermarks para lidar com eventos fora de ordem, portanto eles não podem ser desativados.

    • Fenômeno: Alertas de monitoramento indicam alta latência, mas o grupo de consumidores Kafka não apresenta lag (lag ≈ 0) e a carga de CPU é baixa.

    • Recomendações:

      1. Ignore esta métrica de latência: Neste caso, um atraso elevado é esperado, pois reflete a idade dos dados. Isso não indica uma falha no sistema.

      2. Adote uma métrica diferente: Monitore o Kafka consumer lag. Se o lag do consumidor não aumentar continuamente, o sistema possui capacidade de processamento suficiente e não requer intervenção.

    Cenário 2: Você necessita de baixa latência e tolera pequenos eventos fora de ordem ou perda de dados

    • Situações típicas:

      • Em aplicações como painéis de tela grande ou controle de risco em tempo real, a espera induzida por watermark retarda a saída.

      • A lógica de negócio prioriza o momento de recebimento dos dados (tempo de processamento) em vez do timestamp dentro do registro de dados (tempo de evento).

    • Fenômeno: O fluxo de dados é em tempo real, mas como o watermark está configurado com uma janela de tolerância ampla (ex.: permissão de atraso de 10 segundos), a saída sofre um atraso de 10 segundos.

    • Recomendações:

      1. Remova ou desative watermarks: Passe a utilizar o tempo de processamento para cálculos ou defina o limiar de espera do watermark como 0.

      2. Resultado esperado: A métrica de latência cairá significativamente, aproximando-se do tempo real de processamento. Os dados serão processados assim que chegarem, sem espera por alinhamento.

Características das métricas

As métricas refletem apenas o estado atual de um componente e são insuficientes para determinar a causa raiz de um problema. Para um diagnóstico abrangente, utilize sempre o monitor de backpressure da UI do Flink e outras ferramentas.

1. Backpressure de operador

Sintoma: Operadores downstream não conseguem processar dados com rapidez suficiente, fazendo com que a source reduza sua taxa de emissão.

  • Como identificar: Utilize o monitor de backpressure da UI do Flink para detectar esse problema.

  • Características da métrica:

    • sourceIdleTime aumenta periodicamente.

    • currentFetchEventTimeLag e currentEmitEventTimeLag aumentam continuamente.

    • Caso extremo: Se um operador estiver completamente travado, sourceIdleTime aumentará continuamente.

2. Gargalo de desempenho na source

Sintoma: A source lê na velocidade máxima, mas não atende às demandas de processamento de dados.

  • Como identificar: Nenhum backpressure é detectado no job.

  • Características da métrica:

    • sourceIdleTime permanece em um valor muito baixo (indicando que a source opera com capacidade total).

    • currentFetchEventTimeLag e currentEmitEventTimeLag são semelhantes e permanecem elevados.

3. Desbalanceamento de dados ou partições vazias

Sintoma: A distribuição de dados é desigual entre as partições Kafka upstream ou algumas partições estão vazias.

  • Como identificar: Compare métricas entre diferentes subtasks da source.

  • Características da métrica:

    • O sourceIdleTime de uma subtask específica da source é significativamente maior que o das demais, indicando que essa instância paralela está ociosa.

4. Latência de dados

Sintoma: A latência geral do job é alta. É necessário determinar se o gargalo está na source ou em um sistema externo.

  • Como identificar: Analise combinadamente o tempo ocioso, a diferença entre métricas de lag e o tamanho do backlog.

  • Características da métrica:

    • **Alto sourceIdleTime:Indica que a source está ociosa, o que geralmente significa que a taxa de produção de dados do sistema externo** é baixa, e não que o Flink está processando lentamente.

    • Análise da diferença de lag:Compare a diferença entre currentEmitEventTimeLag e currentFetchEventTimeLag. Essa diferença representa o tempo que os dados passam dentro do operador source:

      • Pequena diferença (valores próximos): Indica capacidade insuficiente de busca. O gargalo normalmente é largura de banda de I/O de rede ou paralelismo insuficiente da source.

      • Grande diferença: Indica capacidade insuficiente de processamento. O gargalo geralmente é parsing ineficiente de dados ou backpressure de operadores downstream.

    • **pendingRecords (se suportado pelo conector):Esta métrica reflete diretamente o backlog externo**. Um valor mais alto indica um backlog de dados mais severo no sistema externo.

Visão geral

Métrica

Descrição

Detalhes

Unidade

Conectores suportados

Número de reinicializações

Quantidade de vezes que o deployment foi reiniciado após um erro.

Total de reinicializações do deployment causadas por erro. Esta métrica exclui reinicializações provocadas por failover do JobManager (JM). Utilize-a para monitorar a disponibilidade e o status do deployment.

Contagem

N/A

Current emit event time lag

Latência de processamento de dados.

Um valor alto indica latência na busca ou no processamento de dados.

milissegundos (ms)

  • Kafka

  • ApsaraMQ for RocketMQ

  • Simple Log Service

  • DataHub

  • Postgres Change Data Capture (CDC)

  • Hologres (Binlog Source)

Current fetch event time lag

Latência de busca de dados do sistema upstream.

Um valor elevado sinaliza latência na busca de dados. Verifique seu I/O de rede e sistemas upstream. Comparar esta métrica com currentEmitEventTimeLag ajuda a analisar a capacidade de processamento da source. A diferença entre ambas representa o tempo que os dados permanecem no operador source.

  • Se os dois lags forem muito próximos, isso sugere que a source tem capacidade insuficiente para puxar dados do sistema externo, provavelmente devido a limitações de I/O de rede ou paralelismo.

  • Uma grande diferença entre os dois lags sugere que a capacidade de processamento do deployment é insuficiente, causando acúmulo de dados no operador source. Na página de detalhes do deployment, acesse a aba Status Overview e use a página BackPressure para localizar o vértice problemático. Em seguida, acesse a página Thread Dump para analisar a pilha e identificar o gargalo.

milissegundos (ms)

  • Kafka

  • ApsaraMQ for RocketMQ

  • Simple Log Service

  • DataHub

  • Postgres Change Data Capture (CDC)

  • Hologres (Binlog Source)

numRecordsIn

Total de registros recebidos por todos os operadores.

Se o valor de numRecordsIn de um operador específico não aumentar por um longo período, isso pode indicar um problema no fluxo de dados upstream. Verifique a source e os operadores upstream.

Contagem

Todos os conectores integrados.

numRecordsOut

Total de registros emitidos.

Caso o valor de numRecordsOut de um operador específico não aumente por um longo período, pode haver um erro na lógica de código do deployment que esteja causando descarte de registros. Revise a lógica do código.

Contagem

Todos os conectores integrados.

numRecordsInOfSource

Quantidade de registros ingeridos pelo operador source.

Utilize esta métrica para monitorar a entrada de dados da source upstream.

Contagem

  • Kafka

  • MaxCompute

  • Incremental MaxCompute

  • ApsaraMQ for RocketMQ

  • Simple Log Service

  • DataHub

  • Elasticsearch

  • Hologres

numRecordsOutOfSink

Total de registros emitidos pelo operador sink.

Utilize esta métrica para monitorar a saída de dados para o sink downstream.

Contagem

  • Kafka

  • Simple Log Service

  • DataHub

  • Hologres

  • ApsaraDB for HBase

  • Tablestore

  • ApsaraDB for Redis

numRecordsInPerSecond

Quantidade de registros ingeridos por segundo em todo o fluxo de dados.

Utilize esta métrica para monitorar a velocidade de processamento de todo o fluxo de dados. Por exemplo, use numRecordsInPerSecond para observar se a velocidade geral de processamento atende aos níveis esperados e como o desempenho varia com diferentes cargas de entrada.

registros/segundo

Todos os conectores integrados.

numRecordsOutPerSecond

Quantidade de registros emitidos por segundo em todo o fluxo de dados.

Utilize esta métrica para medir a velocidade de saída de todo o fluxo de dados.

Por exemplo, use numRecordsOutPerSecond para observar se a velocidade geral de saída atende às suas expectativas e como o desempenho muda sob diferentes cargas de saída.

registros/segundo

Todos os conectores.

numRecordsInOfSourcePerSecond (IN RPS)

Quantidade de registros ingeridos por segundo por cada source.

Utilize esta métrica para medir a taxa de geração de registros de cada source. Por exemplo, em um fluxo de dados com múltiplas sources, use esta métrica para entender a taxa de ingestão de cada source e ajustar o fluxo para melhor desempenho. Esta métrica também é útil para monitoramento e alertas.

Um valor igual a 0 indica que o sistema upstream parou de produzir dados ou que o consumo está bloqueado, impedindo a saída. Verifique se a source upstream ainda está produzindo dados.

registros/segundo

  • Kafka

  • MaxCompute

  • Incremental MaxCompute

  • ApsaraMQ for RocketMQ

  • Simple Log Service

  • DataHub

  • Elasticsearch

  • Hologres

numRecordsOutOfSinkPerSecond (OUT RPS)

Quantidade de registros emitidos por segundo por cada sink.

Utilize esta métrica para medir a taxa de saída de cada sink. Por exemplo, em um fluxo de dados com múltiplos sinks, use esta métrica para entender a velocidade de saída de cada sink e ajustar o fluxo para melhor desempenho.

Esta métrica é útil para monitoramento e alertas. Um valor igual a 0 sugere um possível erro na lógica de código do deployment que está filtrando todos os dados. Revise a lógica do código.

registros/segundo

  • Kafka

  • MaxCompute

  • Incremental MaxCompute

  • Simple Log Service

  • DataHub

  • Hologres

  • ApsaraDB for HBase

  • Tablestore

  • ApsaraDB for Redis

pendingRecords

Quantidade de registros no sistema externo que o operador source ainda não buscou.

Esta métrica mostra o número de registros no sistema externo que o operador source ainda não puxou.

Contagem

  • Kafka

  • Elasticsearch

sourceIdleTime

Duração durante a qual o operador source permanece ocioso.

Esta métrica indica se a source está ociosa. Um valor alto sugere que a taxa de produção de dados no sistema externo é baixa.

milissegundos (ms)

  • Kafka

  • ApsaraMQ for RocketMQ

  • Postgres Change Data Capture (CDC)

  • Hologres (Binlog Source)

busyTimePerSecond

Tempo em que uma Task fica ocupada a cada segundo.

Número de milissegundos por segundo em que um thread da Task está ocupado processando dados. O valor varia de 0 a 1.000. Um valor mais alto indica que a Task está sob carga mais pesada. Utilize esta métrica para identificar gargalos de desempenho, avaliar a utilização de recursos e orientar o ajuste automático.

milissegundos (ms)

N/A

Checkpoints

Métrica

Descrição

Detalhes

Unidade

Número de checkpoints

Total de checkpoints.

Fornece uma visão geral do status dos checkpoints para ajudar na configuração de alertas.

Contagem

lastCheckpointDuration

Duração do checkpoint mais recente.

Uma duração longa ou timeout pode ser causado por tamanho de estado grande, problemas temporários de rede, barreiras desalinhadas ou backpressure.

milissegundos (ms)

lastCheckpointSize

Tamanho do checkpoint mais recente.

Indica o tamanho do último checkpoint enviado. Utilize esta métrica para analisar o desempenho quando ocorrer um gargalo.

Bytes

Estado

Nota

As métricas de latência de estado são desativadas por padrão. Para usar essas métricas, defina state.backend.latency-track.keyed-state-enabled: true nas configurações adicionais do Flink. Ativar essas métricas pode impactar o desempenho de execução do seu deployment.

Métrica

Descrição

Descrição

Unidade

Versão suportada

State Clear Latency

Latência máxima de uma única operação de limpeza de estado.

Utilize esta métrica para monitorar o desempenho das operações de limpeza de estado.

nanossegundos (ns)

Realtime Compute for Apache Flink que usa Ververica Runtime (VVR) 4.0.0 ou posterior.

ValueState Latency

Latência máxima de uma única operação de acesso ao ValueState.

Utilize esta métrica para monitorar o desempenho de acesso ao ValueState.

nanossegundos (ns)

AggregatingState Latency

Latência máxima de uma única operação de acesso ao AggregatingState.

Utilize esta métrica para monitorar o desempenho de acesso ao AggregatingState.

nanossegundos (ns)

ReducingState Latency

Latência máxima de uma única operação de acesso ao ReducingState.

Utilize esta métrica para monitorar o desempenho de acesso ao ReducingState.

nanossegundos (ns)

MapState Latency

Latência máxima de uma única operação de acesso ao MapState.

Utilize esta métrica para monitorar o desempenho de acesso ao MapState.

nanossegundos (ns)

ListState Latency

Latência máxima de uma única operação de acesso ao ListState.

Utilize esta métrica para monitorar o desempenho de acesso ao ListState.

nanossegundos (ns)

SortedMapState Latency

Latência máxima de uma única operação de acesso ao SortedMapState.

Utilize esta métrica para monitorar o desempenho de acesso ao SortedMapState.

nanossegundos (ns)

State Size

Tamanho dos dados de estado.

Utilize esta métrica para:

  • Identificar gargalos atuais ou potenciais de estado nos nós.

  • Verifique se a configuração de time to live (TTL) está funcionando conforme o esperado.

Bytes

Realtime Compute for Apache Flink que usa Ververica Runtime (VVR) 4.0.12 ou posterior.

State File Size

Tamanho do arquivo de dados de estado.

Utilize esta métrica para:

  • Monitorar o espaço em disco local consumido pelos dados de estado e tomar medidas se o uso estiver alto.

  • Determinar se dados de estado excessivamente grandes estão causando falta de espaço em disco local.

Bytes

Realtime Compute for Apache Flink que usa Ververica Runtime (VVR) 4.0.13 ou posterior.

I/O

Métrica

Descrição

Detalhes

Unidade

Conectores suportados

numBytesIn

Total de bytes de entrada.

Utilize esta métrica para monitorar o throughput de entrada da source e rastrear o tráfego do deployment.

Bytes

  • Kafka

  • MaxCompute

  • Incremental MaxCompute

  • ApsaraMQ for RocketMQ

numBytesInPerSecond

Total de bytes de entrada por segundo.

Utilize esta métrica para monitorar a taxa de entrada da source e rastrear o tráfego do deployment.

Bytes/s

  • Kafka

  • MaxCompute

  • Incremental MaxCompute

  • ApsaraMQ for RocketMQ

numBytesOut

Total de bytes de saída.

Utilize esta métrica para monitorar o throughput de saída para o sink e rastrear o tráfego do deployment.

Bytes

  • Kafka

  • ApsaraMQ for RocketMQ

  • DataHub

  • ApsaraDB for HBase

numBytesOutPerSecond

Total de bytes de saída por segundo.

Utilize esta métrica para monitorar a taxa de saída para o sink e rastrear o tráfego do deployment.

Bytes/s

  • Kafka

  • ApsaraMQ for RocketMQ

  • DataHub

  • ApsaraDB for HBase

Task numRecords I/O

Total de registros recebidos e emitidos por cada subtask.

Utilize esta métrica para identificar possíveis gargalos de I/O.

Registros

  • Kafka

  • MaxCompute

  • Incremental MaxCompute

  • Simple Log Service

  • DataHub

  • Elasticsearch

  • Hologres

  • ApsaraDB for HBase

  • Tablestore

  • ApsaraDB for Redis

Task numRecords I/O PerSecond

Total de registros recebidos e emitidos por cada subtask por segundo.

Utilize esta métrica para identificar gargalos de I/O e avaliar sua gravidade com base na taxa de processamento.

Registros/s

  • Kafka

  • MaxCompute

  • Incremental MaxCompute

  • Simple Log Service

  • DataHub

  • Elasticsearch

  • Hologres

  • ApsaraDB for HBase

  • Tablestore

  • ApsaraDB for Redis

currentSendTime

Tempo que cada subtask leva para enviar o registro mais recente ao sink.

Um valor alto para esta métrica indica que a saída da subtask está muito lenta.

Milissegundos (ms)

  • Kafka

  • MaxCompute

  • Incremental MaxCompute

  • ApsaraMQ for RocketMQ

  • Simple Log Service

  • DataHub

  • Hologres

    Nota

    Suportado nos modos JDBC e RPC. Não suportado no modo BHClient.

  • ApsaraDB for HBase

  • Tablestore

  • ApsaraDB for Redis

Watermark

Métrica

Descrição

Uso

Unidade

Conector suportado

Task InputWatermark

Momento em que cada task recebe o watermark mais recente.

Utilize esta métrica para monitorar o progresso dos dados chegando a um TaskManager.

N/A

Não específico de conector.

watermarkLag

Diferença entre o tempo real (wall-clock) e o tempo de evento do watermark.

Utilize esta métrica para determinar a latência de processamento no nível da subtask.

ms

  • Kafka

  • ApsaraMQ for RocketMQ

  • Simple Log Service

  • DataHub

  • Hologres (binlog source)

CPU

Métrica

Descrição

Descrição

Unidade

JobManager CPU usage

Utilização de CPU de um JobManager.

Esta métrica mostra a porcentagem de fatias de tempo de CPU usadas pelo Flink. Um valor de 100% significa que um núcleo de CPU está totalmente utilizado, e 400% significa que quatro núcleos estão totalmente utilizados. Se este valor exceder consistentemente 100%, o JobManager está limitado pela CPU. Carga alta com baixa utilização de CPU pode indicar um número excessivo de processos em estado de sono ininterruptível devido a operações frequentes de leitura e escrita.

Nota

Esta métrica está disponível apenas para Realtime Compute for Apache Flink VVR 6.0.6 e posterior.

N/A

TaskManager CPU usage

Utilização de CPU de um TaskManager.

Esta métrica mostra a porcentagem de fatias de tempo de CPU usadas pelo Flink. Um valor de 100% significa que um núcleo de CPU está totalmente utilizado, e 400% significa que quatro núcleos estão totalmente utilizados. Se este valor exceder consistentemente 100%, o TaskManager está limitado pela CPU. Carga alta com baixa utilização de CPU pode indicar um número excessivo de processos em estado de sono ininterruptível devido a operações frequentes de leitura e escrita.

N/A

Memória

Métrica

Descrição

Descrição

Unidade

JM heap memory

Memória heap do JobManager.

Rastreia alterações na memória heap do JobManager.

Bytes

JM non-heap memory

Memória non-heap do JobManager.

Rastreia alterações na memória non-heap do JobManager.

Bytes

TM heap memory

Memória heap do TaskManager.

Rastreia alterações na memória heap do TaskManager.

Bytes

TM non-heap memory

Memória non-heap do TaskManager.

Rastreia alterações na memória non-heap do TaskManager.

Bytes

TM Mem (RSS)

Resident Set Size (RSS) do processo TaskManager, conforme relatado pelo sistema operacional.

Monitora o uso total de memória física do processo TaskManager.

Bytes

JVM

Métrica

Descrição

Detalhes

Unidade

JM Threads

Número de threads do JobManager.

Threads demais no JobManager podem consumir memória excessiva, reduzindo a estabilidade do job.

Contagem

TM Threads

Número de threads do TaskManager.

Threads demais no TaskManager podem consumir memória excessiva, reduzindo a estabilidade do job.

Contagem

JM GC Count

Número de eventos de garbage collection (GC) para o JobManager.

Eventos frequentes de garbage collection podem consumir memória excessiva e degradar o desempenho do job. Utilize esta métrica para diagnosticar falhas no nível do job.

Contagem

JM GC Time

Duração de cada evento de garbage collection para o JobManager.

Pausas longas de garbage collection podem consumir memória excessiva e degradar o desempenho do job. Utilize esta métrica para diagnosticar falhas no nível do job.

Milissegundos (ms)

TM GC Count

Número de eventos de garbage collection para o TaskManager.

Eventos frequentes de garbage collection podem consumir memória excessiva e degradar o desempenho do job. Utilize esta métrica para diagnosticar falhas no nível da task.

Contagem

TM GC Time

Duração de cada evento de garbage collection para o TaskManager.

Pausas longas de garbage collection podem consumir memória excessiva e degradar o desempenho do job. Utilize esta métrica para diagnosticar falhas no nível da task.

Milissegundos (ms)

JM ClassLoader

Total de classes carregadas ou descarregadas pela JVM do JobManager desde a inicialização.

Um volume alto de carregamento e descarregamento de classes na JVM do JobManager pode consumir memória excessiva e degradar o desempenho do job.

N/A

TM ClassLoader

Total de classes carregadas ou descarregadas pela JVM do TaskManager desde a inicialização.

Um volume alto de carregamento e descarregamento de classes na JVM do TaskManager pode consumir memória excessiva e degradar o desempenho do job.

N/A

Conector MySQL

Métrica

Descrição

Unidade

Cenário

Versão suportada

isSnapshotting

Indica se o job está na fase de snapshot (valor = 1).

N/A

Verifica se o job está na fase de snapshot.

Realtime Compute for Apache Flink versões 8.0.9 e posteriores.

isBinlogReading

Indica se o job está na fase incremental (valor = 1).

N/A

Verifica se o job está na fase incremental.

Number of remaining tables

Quantidade de tabelas aguardando processamento na fase de snapshot.

Contagem

Verifica o número de tabelas não processadas.

Number of snapshotted tables

Quantidade de tabelas processadas na fase de snapshot.

Contagem

Verifica o número de tabelas processadas.

Number of remaining SnapshotSplits

Quantidade de splits aguardando processamento na fase de snapshot.

Contagem

Verifica o número de splits não processados.

Number of processed SnapshotSplits

Quantidade de splits processados na fase de snapshot.

Contagem

Verifica o número de splits processados.

currentFetchEventTimeLag

Latência entre o momento em que um evento é criado no banco de dados e o momento em que é lido pelo conector.

ms

Verifica a latência de leitura de binlogs do banco de dados.

currentReadTimestampMs

Timestamp do registro de dados lido mais recentemente.

ms

Verifica o timestamp do registro de dados lido mais recentemente.

numRecordsIn

Total de registros de dados lidos.

Contagem

Verifica o total de registros de dados lidos.

numSnapshotRecords

Quantidade de registros de dados processados na fase de snapshot.

Contagem

Verifica o número de registros de dados processados na fase de snapshot.

numRecordsInPerTable

Quantidade de registros de dados lidos de cada tabela.

Contagem

Verifica o número de registros de dados lidos de cada tabela.

numSnapshotRecordsPerTable

Quantidade de registros de dados processados para cada tabela durante a fase de snapshot.

Contagem

Verifica o número de registros de dados processados para cada tabela na fase de snapshot.

Conector - Kafka

Métrica

Descrição

Unidade

Cenário

Versão suportada

commitsSucceeded

Total de commits de offset bem-sucedidos.

Contagem

Verifica se os commits de offset foram bem-sucedidos.

Realtime Compute for Apache Flink VVR 8.0.9 ou posterior.

commitsFailed

Total de commits de offset com falha.

Contagem

Identifica problemas com commits de offset.

Fetch Rate

Número médio de requisições de busca por segundo.

Contagem/s

Use para monitorar a taxa de busca de dados e identificar possíveis problemas de latência.

Fetch Latency Avg

Latência média das operações de busca.

Milissegundos

Um valor alto pode indicar um gargalo de rede ou um broker Kafka lento.

Fetch Size Avg

Número médio de bytes por requisição de busca.

Bytes

Use para analisar o throughput e a eficiência da busca de dados.

Avg Records In Per-Request

Número médio de registros por requisição de busca.

Contagem

Use para analisar a eficiência do agrupamento de registros nas requisições de busca.

currentSendTime

Timestamp de tempo de evento do último registro processado pelo conector.

N/A

Use para monitorar o progresso do consumo.

batchSizeAvg

Número médio de bytes por lote.

Bytes

Use para analisar a latência e o throughput de escrita de dados.

requestLatencyAvg

Latência média das requisições de escrita de dados.

Milissegundos

Use para avaliar o desempenho de escrita de dados.

requestsInFlight

Número de requisições de escrita de dados atualmente em andamento.

N/A

Um valor alto pode indicar um gargalo no sistema sink.

recordsPerRequestAvg

Número médio de registros em cada requisição de escrita de dados.

Contagem

Use para avaliar a eficiência de agrupamento e o throughput de escrita de dados.

recordSizeAvg

Tamanho médio do registro em bytes.

Bytes

Use para analisar o throughput e a eficiência da escrita de dados.

Conector Paimon

Métrica

Descrição

Unidade

Cenário

Versão suportada

Number of Writers

Número de writer instances ativas.

Contagem

Um número alto de writers pode degradar o desempenho de escrita e aumentar o consumo de memória. Se este valor for alto, verifique se suas configurações de contagem de bucket e partition key são adequadas.

Realtime Compute for Apache Flink VVR 8.0.9 ou posterior.

Max Compaction Thread Busy

Taxa máxima de ocupação dos threads de compaction.

Proporção

Esta métrica reflete a pressão de compaction. Um valor próximo de 100% indica que a compactação é um gargalo, o que pode retardar a escrita de dados.

Average Compaction Thread Busy

Taxa média de ocupação dos threads de compaction.

Proporção

Esta métrica reflete a pressão média de compaction em todos os buckets. Um valor alto sugere que o desempenho geral da compactação está lento.

Max Number of Level 0 Files

Número máximo de arquivos de nível 0.

Contagem

Para uma primary key table, um número alto de arquivos de nível 0 (arquivos pequenos) indica que a compaction não está acompanhando a velocidade de escrita.

Average Number of Level 0 Files

Número médio de arquivos de nível 0.

Contagem

Para uma primary key table, um número médio alto de arquivos de nível 0 (arquivos pequenos) indica que a compaction geral não está acompanhando a velocidade de escrita.

Last Commit Duration

Duração do último commit.

Milissegundos

Se a duração for excessivamente longa, verifique se os dados estão sendo gravados em muitos buckets simultaneamente.

Number of Partitions Last Committed

Número de partitions gravadas no último commit.

Contagem

Um número alto de partições em um único commit pode degradar o desempenho de escrita e aumentar o consumo de memória. Verifique se suas configurações de contagem de bucket ou partition key são adequadas.

Number of Buckets Last Committed

Número de buckets gravados no último commit.

Contagem

Um número alto de buckets em um único commit pode degradar o desempenho de escrita e aumentar o consumo de memória. Verifique se suas configurações de contagem de bucket ou partition key são adequadas.

Used Write Buffer

Quantidade de memória de buffer de escrita em uso.

Bytes

Este buffer consome Java heap memory em todos os TaskManagers. Um valor persistentemente alto pode levar a um erro de Out of Memory (OOM).

Total Write Buffer

Memória total alocada para buffer de escrita.

Bytes

Este buffer consome Java heap memory em todos os TaskManagers. Definir este valor muito alto pode esgotar a memória disponível e levar a um erro de Out of Memory (OOM).

Ingestão de dados

Métrica

Descrição

Unidade

Cenário

Versão suportada

isSnapshotting

Indica se o job está na fase de snapshot. Um valor igual a 1 significa que o job está nesta fase.

N/A

Determina a fase atual de processamento do job.

Realtime Compute for Apache Flink VVR 8.0.9 ou posterior.

isBinlogReading

Indica se o job está na fase incremental. Um valor igual a 1 significa que o job está nesta fase.

N/A

Determina a fase atual de processamento do job.

Number of remaining tables

Quantidade de tabelas aguardando processamento na fase de snapshot.

Tabelas

Monitora a fila de tabelas para processamento de snapshot.

Number of snapshotted tables

Quantidade de tabelas processadas na fase de snapshot.

Tabelas

Monitora a contagem de snapshots de tabelas concluídos.

Number of remaining SnapshotSplits

Quantidade de splits aguardando processamento na fase de snapshot.

Splits

Monitora a fila de splits de dados para processamento de snapshot.

Number of processed SnapshotSplits

Quantidade de splits processados na fase de snapshot.

Splits

Monitora a contagem de splits de dados concluídos da fase de snapshot.

currentFetchEventTimeLag

Latência entre o momento em que um evento é criado no banco de dados e o momento em que é lido pelo conector.

ms

Mede a latência de ingestão de dados do log binário do banco de dados.

currentReadTimestampMs

Timestamp do registro de dados lido mais recentemente.

ms

Identifica o ponto no tempo do registro ingerido mais recente.

numRecordsIn

Total de registros de dados lidos.

Registros

Rastreia o total de registros de dados lidos pela source.

numRecordsInPerTable

Quantidade de registros de dados lidos de cada tabela.

Registros

Rastreia o total de registros de dados lidos de cada tabela.

numSnapshotRecords

Quantidade de registros de dados processados durante a fase de snapshot.

Registros

Monitora o total de registros processados durante a fase de snapshot.

numSnapshotRecordsPerTable

Quantidade de registros de dados processados para cada tabela durante a fase de snapshot.

Registros

Monitora a contagem de registros por tabela processados durante a fase de snapshot.