Quais métricas devo monitorar?
Monitore as métricas a seguir conforme o tipo da sua instância.
Instâncias reservadas
|
Métrica |
O que rastreia |
Importância |
|
|
Uso de disco em toda a instância |
O uso elevado de disco pode causar falhas na produção de mensagens. Monitore esta métrica para evitar falta de armazenamento. |
|
|
Utilização da largura de banda de entrada da internet por nó |
Valores altos sustentados indicam que um nó está se aproximando do limite de largura de banda, o que pode causar atrasos nas mensagens. |
|
|
Utilização da largura de banda de saída da internet por nó |
Valores altos sustentados indicam que um nó está se aproximando do limite de largura de banda, o que pode reduzir o throughput do consumidor. |
|
|
Throughput do produtor em relação ao limite da especificação da instância |
Valores próximos de 100% significam que você está perto do teto de throughput de produção para a especificação da sua instância. |
|
|
Throughput do consumidor em relação ao limite da especificação da instância |
Valores próximos de 100% significam que você está perto do teto de throughput de consumo para a especificação da sua instância. |
|
|
Contagem de partições em relação ao limite da especificação da instância |
Valores próximos de 100% indicam a necessidade de atualizar a especificação da instância ou reduzir o número de partições. |
Instâncias serverless
|
Métrica |
O que rastreia |
Importância |
|
|
Taxa de entrada de mensagens como porcentagem da capacidade |
Indica a proximidade da produção de mensagens em toda a instância em relação ao limite de capacidade. |
|
|
Taxa de saída de mensagens como porcentagem da capacidade |
Indica a proximidade do consumo de mensagens em toda a instância em relação ao limite de capacidade. |
|
|
Pico de taxa de entrada no nó mais ocupado |
Identifica nós sobrecarregados. Monitore esta métrica para detectar distribuição desigual de carga entre os nós. |
|
|
Pico de taxa de saída no nó mais ocupado |
Identifica nós sobrecarregados. Monitore esta métrica para detectar distribuição desigual de carga entre os nós. |
Por que alguns valores de métricas são imprecisos?
Três causas comuns:
Baixo volume de tráfego. O sistema calcula cada valor de métrica com base em uma fórmula específica. Quando o tráfego é baixo, pequenas flutuações geram desvios desproporcionalmente grandes no resultado calculado.
Versão desatualizada do cliente. Bibliotecas de cliente Kafka mais antigas omitem parâmetros essenciais para o sistema de monitoramento, o que distorce os valores relatados. Atualize para a versão mais recente do cliente para corrigir esse problema.
Compressão de dados. Produtores comprimem dados para atender a requisitos específicos de transmissão ou armazenamento. Isso pode resultar em desvios nos dados de monitoramento.
Por que InstanceMessageOutput ou TopicMessageOutput é zero quando InstanceReqsOutput ou TopicReqsOutput é maior que zero?
Esse comportamento é normal e não representa um erro. Ele ocorre quando os consumidores estão ativos, mas nenhuma nova mensagem foi publicada no broker.
Os consumidores do Kafka consultam continuamente o broker em busca de novas mensagens, mesmo quando não há nenhuma disponível. Cada consulta conta como uma solicitação de consumo; portanto, InstanceReqsOutput e TopicReqsOutput aumentam a cada tentativa. Como nenhuma mensagem é entregue de fato, InstanceMessageOutput e TopicMessageOutput permanecem em zero.
Exemplo: Suponha que nenhum produtor esteja publicando mensagens enquanto um grupo de consumidores consulta o broker 50 vezes. TopicReqsOutput mostra 50, mas TopicMessageOutput mostra 0. Assim que um produtor volta a publicar, ambas as métricas começam a aumentar juntas.
