Todos os produtos
Search
Central de documentação

Container Service for Kubernetes:etcd metrics, dashboard, and anomaly analysis

Última atualização: Jun 27, 2026

Use as métricas e os painéis do etcd para detectar e diagnosticar problemas no plano de controle em clusters ACK.

Antes de começar

Acesso

Consulte Visualizar painéis de monitoramento dos componentes do plano de controle.

Lista de métricas

A tabela a seguir lista as métricas do componente etcd.

Métrica

Tipo

Descrição

cpu_utilization_core

Gauge

Uso de CPU, em núcleos.

etcd_server_has_leader

Gauge

No algoritmo de consenso Raft, um membro do etcd é eleito líder. Esse líder envia heartbeats periódicos para manter a estabilidade do cluster.

Indica se há um líder entre os membros do etcd.

  • 1: Líder presente.

  • 0: Nenhum líder.

etcd_server_is_leader

Gauge

Indica se este membro do etcd é o líder.

  • 1: Sim.

  • 0: Não.

etcd_server_leader_changes_seen_total

Counter

Total de mudanças de liderança observadas por este membro do etcd.

etcd_mvcc_db_total_size_in_bytes

Gauge

Tamanho total do banco de dados do membro etcd.

etcd_mvcc_db_total_size_in_use_in_bytes

Gauge

Espaço utilizado no banco de dados do membro etcd.

etcd_disk_backend_commit_duration_seconds_bucket

Histogram

Tempo necessário para gravar e confirmar (commit) uma alteração de dados no armazenamento de backend.

Os limites dos buckets são [0,001, 0,002, 0,004, 0,008, 0,016, 0,032, 0,064, 0,128, 0,256, 0,512, 1,024, 2,048, 4,096, 8,192].

etcd_debugging_mvcc_keys_total

Gauge

Número total de chaves armazenadas no etcd.

etcd_server_proposals_committed_total

Gauge

No Raft, as alterações de estado são enviadas como propostas.

Total de propostas confirmadas (committed) no log do Raft.

etcd_server_proposals_applied_total

Gauge

Total de propostas aplicadas.

etcd_server_proposals_pending

Gauge

Número de propostas pendentes.

etcd_server_proposals_failed_total

Counter

Número de propostas com falha.

memory_utilization_byte

Gauge

Uso de memória, em bytes.

resource_utilization_level

Gauge

Nível de utilização de recursos.

  • resource: Tipo de recurso. Valores válidos: cpu e memory.

  • utilization_level: Nível de utilização. Valores válidos: high (utilização ≥ 80%) e normal (utilização < 80%).

  • container: Container de destino. Valores válidos: kube-apiserver, kube-scheduler, kube-controller-manager, cloud-controller-manager e etcd.

Nota

As seguintes métricas de utilização de recursos foram descontinuadas. Remova quaisquer alertas ou regras de monitoramento que dependam delas:

  • cpu_utilization_ratio: Utilização de CPU.

  • memory_utilization_ratio: Utilização de memória.

Guia do painel

O painel usa consultas PromQL para visualizar as métricas do etcd.

Visão geral do painel

image

Descrições dos painéis

Parâmetro

PromQL

Descrição

Status de atividade do etcd

  • etcd_server_has_leader

  • etcd_server_is_leader == 1

  • Indica se os membros do etcd estão ativos. O valor 3 é normal.

  • Identifica o membro líder. Um cluster saudável deve ter exatamente um líder.

Mudanças de liderança no último dia

changes(etcd_server_leader_changes_seen_total{job="etcd"}[1d])

Quantidade de mudanças de liderança do etcd nas últimas 24 horas.

Uso de memória

memory_utilization_byte{container="etcd"}

Consumo de memória, em bytes.

Uso de CPU

cpu_utilization_core{container="etcd"}*1000

Consumo de CPU, em milicores.

Nível de uso de memória

  • resource_utilization_level{resource="memory",container="etcd",utilization_level="high"}

  • resource_utilization_level{resource="memory",container="etcd",utilization_level="normal"}

  • Se resource_utilization_level{utilization_level="high",...} for 1, a utilização de recursos do container é ≥ 80%.

  • Se resource_utilization_level{utilization_level="normal",...} for 1, a utilização de recursos do container é < 80%.

Nível de uso de CPU

  • resource_utilization_level{resource="cpu",container="etcd",utilization_level="high"}

  • resource_utilization_level{resource="cpu",container="etcd",utilization_level="normal"}

Tamanho do disco

etcd_mvcc_db_total_size_in_bytes

Tamanho total do banco de dados de backend do etcd.

etcd_mvcc_db_total_size_in_use_in_bytes

Espaço utilizado no banco de dados de backend do etcd.

Total de pares chave-valor

etcd_debugging_mvcc_keys_total

Quantidade total de pares chave-valor no cluster etcd.

Latência de commit do backend

histogram_quantile(0,99, sum(rate(etcd_disk_backend_commit_duration_seconds_bucket{job="etcd"}[5m])) by (instance, le))

Tempo necessário para persistir uma proposta no banco de dados do etcd.

Status das propostas Raft

rate(etcd_server_proposals_failed_total{job="etcd"}[1m])

Taxa de propostas Raft com falha por minuto.

etcd_server_proposals_pending{job="etcd"}

Número total de propostas Raft pendentes.

etcd_server_proposals_committed_total{job="etcd"} - etcd_server_proposals_applied_total{job="etcd"}

Quantidade de propostas confirmadas, mas não aplicadas.

Anomalias comuns de métricas

Status de atividade do etcd

Cenário normal

Cenário anormal

Descrição

Todos os três membros do etcd têm um líder, e um deles atua como líder:sum(etcd_server_has_leader)=3, e apenas um membro satisfaz member etcd_server_is_leader == 1.

Um único membro apresenta anomalia.

O member etcd_server_has_leader!=1 correspondente não afeta o serviço geral do etcd.

Mais de um membro apresenta anomalia.

Vários membros relatam member etcd_server_has_leader!=1, impedindo o cluster etcd de fornecer serviços.

Verifique também se algum membro possui etcd_server_is_leader == 1. Caso contrário, o etcd fica sem líder e não consegue fornecer serviços.

Latência de commit do backend

Cenário normal

Cenário anormal

Descrição

A latência geralmente varia entre alguns milissegundos e dezenas de milissegundos.

Latência sustentada de centenas de milissegundos ou mais.

Indica problemas de I/O de disco.

Anomalias nas propostas Raft

Cenário normal

Cenário anormal

Descrição

A taxa de propostas Raft com falha é 0.

A taxa de propostas Raft com falha é maior que 0.

Algumas propostas não foram confirmadas. Investigue taxas de falha elevadas.

O número total de propostas Raft pendentes é 0.

Persiste um número diferente de zero de propostas Raft pendentes.

Acúmulo de propostas Raft, frequentemente causado por aplicação lenta. Correlacione com a latência de commit do backend.

A diferença entre propostas Raft confirmadas e aplicadas é 0.

A diferença entre propostas confirmadas e aplicadas é maior que 0.

Pode indicar volume excessivo de requisições de clientes no etcd.

Se esse valor ultrapassar 5.000, o etcd rejeita requisições com too many requests até processar as propostas acumuladas.

Referências

Consulte Métricas de monitoramento do kube-apiserver, Métricas de monitoramento do kube-scheduler, Métricas de monitoramento do kube-controller-manager e Métricas de monitoramento do cloud-controller-manager.