Use as métricas e os painéis do etcd para detectar e diagnosticar problemas no plano de controle em clusters ACK.
Antes de começar
Acesso
Consulte Visualizar painéis de monitoramento dos componentes do plano de controle.
Lista de métricas
A tabela a seguir lista as métricas do componente etcd.
|
Métrica |
Tipo |
Descrição |
|
cpu_utilization_core |
Gauge |
Uso de CPU, em núcleos. |
|
etcd_server_has_leader |
Gauge |
No algoritmo de consenso Raft, um membro do etcd é eleito líder. Esse líder envia heartbeats periódicos para manter a estabilidade do cluster. Indica se há um líder entre os membros do etcd.
|
|
etcd_server_is_leader |
Gauge |
Indica se este membro do etcd é o líder.
|
|
etcd_server_leader_changes_seen_total |
Counter |
Total de mudanças de liderança observadas por este membro do etcd. |
|
etcd_mvcc_db_total_size_in_bytes |
Gauge |
Tamanho total do banco de dados do membro etcd. |
|
etcd_mvcc_db_total_size_in_use_in_bytes |
Gauge |
Espaço utilizado no banco de dados do membro etcd. |
|
etcd_disk_backend_commit_duration_seconds_bucket |
Histogram |
Tempo necessário para gravar e confirmar (commit) uma alteração de dados no armazenamento de backend. Os limites dos buckets são |
|
etcd_debugging_mvcc_keys_total |
Gauge |
Número total de chaves armazenadas no etcd. |
|
etcd_server_proposals_committed_total |
Gauge |
No Raft, as alterações de estado são enviadas como propostas. Total de propostas confirmadas (committed) no log do Raft. |
|
etcd_server_proposals_applied_total |
Gauge |
Total de propostas aplicadas. |
|
etcd_server_proposals_pending |
Gauge |
Número de propostas pendentes. |
|
etcd_server_proposals_failed_total |
Counter |
Número de propostas com falha. |
|
memory_utilization_byte |
Gauge |
Uso de memória, em bytes. |
|
resource_utilization_level |
Gauge |
Nível de utilização de recursos.
|
As seguintes métricas de utilização de recursos foram descontinuadas. Remova quaisquer alertas ou regras de monitoramento que dependam delas:
cpu_utilization_ratio: Utilização de CPU.
memory_utilization_ratio: Utilização de memória.
Guia do painel
O painel usa consultas PromQL para visualizar as métricas do etcd.
Visão geral do painel

Descrições dos painéis
|
Parâmetro |
PromQL |
Descrição |
|
Status de atividade do etcd |
|
|
|
Mudanças de liderança no último dia |
|
Quantidade de mudanças de liderança do etcd nas últimas 24 horas. |
|
Uso de memória |
|
Consumo de memória, em bytes. |
|
Uso de CPU |
|
Consumo de CPU, em milicores. |
|
Nível de uso de memória |
|
|
|
Nível de uso de CPU |
|
|
|
Tamanho do disco |
etcd_mvcc_db_total_size_in_bytes |
Tamanho total do banco de dados de backend do etcd. |
|
etcd_mvcc_db_total_size_in_use_in_bytes |
Espaço utilizado no banco de dados de backend do etcd. |
|
|
Total de pares chave-valor |
etcd_debugging_mvcc_keys_total |
Quantidade total de pares chave-valor no cluster etcd. |
|
Latência de commit do backend |
|
Tempo necessário para persistir uma proposta no banco de dados do etcd. |
|
Status das propostas Raft |
|
Taxa de propostas Raft com falha por minuto. |
|
|
Número total de propostas Raft pendentes. |
|
|
|
Quantidade de propostas confirmadas, mas não aplicadas. |
Anomalias comuns de métricas
Status de atividade do etcd
|
Cenário normal |
Cenário anormal |
Descrição |
|
Todos os três membros do etcd têm um líder, e um deles atua como líder: |
Um único membro apresenta anomalia. |
O |
|
Mais de um membro apresenta anomalia. |
Vários membros relatam Verifique também se algum membro possui |
Latência de commit do backend
|
Cenário normal |
Cenário anormal |
Descrição |
|
A latência geralmente varia entre alguns milissegundos e dezenas de milissegundos. |
Latência sustentada de centenas de milissegundos ou mais. |
Indica problemas de I/O de disco. |
Anomalias nas propostas Raft
|
Cenário normal |
Cenário anormal |
Descrição |
|
A taxa de propostas Raft com falha é 0. |
A taxa de propostas Raft com falha é maior que 0. |
Algumas propostas não foram confirmadas. Investigue taxas de falha elevadas. |
|
O número total de propostas Raft pendentes é 0. |
Persiste um número diferente de zero de propostas Raft pendentes. |
Acúmulo de propostas Raft, frequentemente causado por aplicação lenta. Correlacione com a latência de commit do backend. |
|
A diferença entre propostas Raft confirmadas e aplicadas é 0. |
A diferença entre propostas confirmadas e aplicadas é maior que 0. |
Pode indicar volume excessivo de requisições de clientes no etcd. Se esse valor ultrapassar 5.000, o etcd rejeita requisições com |
Referências
Consulte Métricas de monitoramento do kube-apiserver, Métricas de monitoramento do kube-scheduler, Métricas de monitoramento do kube-controller-manager e Métricas de monitoramento do cloud-controller-manager.