O Hologres disponibiliza métricas de monitoramento no console e no Cloud Monitor para acompanhamento do uso de recursos, execução de consultas e integridade do sistema em tempo real.
Visão geral das métricas
Categoria | Métrica | Descrição | Tipos de instância compatíveis | Observações |
CPU | Uso de CPU da instância (%) | Uso de CPU da instância. | Uso geral, follower, grupo de computação | -- |
Uso de CPU do nó Worker (%) | Uso de CPU de cada nó Worker. | Uso geral, follower, grupo de computação | V1.1+ | |
Uso de CPU do cluster (%) | Uso de CPU de cada cluster no grupo de computação. | Grupo de computação | V4.0+ | |
Memória | Uso de memória da instância (%) | Uso total de memória da instância. | Uso geral, follower, grupo de computação | -- |
Uso de memória do nó Worker (%) | Uso de memória de cada nó Worker. | Uso geral, follower, grupo de computação | V1.1+ | |
Uso detalhado de memória da instância (%) | Uso de memória dividido por Sistema, Meta, Cache, Consulta e Background. | Uso geral, follower, grupo de computação | V2.0+ | |
Uso de memória de consulta QE (bytes) | Memória usada pelas consultas do mecanismo QE. | Uso geral, follower, grupo de computação | V2.0.44+ / V2.1.22+ | |
Uso de memória de consulta QE (%) | Porcentagem de memória usada pelas consultas do mecanismo QE. | Uso geral, follower, grupo de computação | V2.0.44+ / V2.1.22+ | |
Uso de memória do cluster (%) | Uso de memória de cada cluster no grupo de computação. | Grupo de computação | V4.0+ | |
QPS e RPS de consulta | QPS de consulta (contagem/s) | Total de consultas por segundo. | Uso geral, follower, grupo de computação, cluster compartilhado | -- |
QPS de consulta QE (contagem/s) | Consultas por segundo executadas pelo mecanismo QE. | Uso geral, follower, grupo de computação | V2.2+ | |
QPS de consulta FixedQE (contagem/s) | Consultas por segundo executadas pelo mecanismo FixedQE. | Uso geral, follower, grupo de computação | V2.2+ | |
RPS de DML (contagem/s) | Total de linhas por segundo para operações DML. | Uso geral, grupo de computação | -- | |
RPS de DML do QE (contagem/s) | Linhas de DML por segundo processadas pelo mecanismo QE. | Uso geral, grupo de computação | V2.2+ | |
RPS de DML do FixedQE (contagem/s) | Linhas de DML por segundo processadas pelo mecanismo FixedQE. | Uso geral, grupo de computação | V2.2+ | |
Latência de consulta | Latência de consulta (milissegundos) | Latência média de todas as consultas. | Uso geral, follower, grupo de computação, cluster compartilhado | -- |
Latência de consulta QE (milissegundos) | Latência média das consultas do mecanismo QE. | Uso geral, follower, grupo de computação | V2.2+ | |
Latência de consulta FixedQE (milissegundos) | Latência média das consultas do mecanismo FixedQE. | Uso geral, follower, grupo de computação | V2.2+ | |
Duração da fase de otimização (milissegundos) | Tempo gasto na fase de otimização da consulta. | Uso geral, follower, grupo de computação, cluster compartilhado | V2.0.44+ / V2.1.22+ | |
Duração da fase de início da consulta (milissegundos) | Tempo gasto na inicialização da consulta (bloqueios, alinhamento de schema). | Uso geral, follower, grupo de computação, cluster compartilhado | V2.0.44+ / V2.1.22+ | |
Duração da fase Get Next (milissegundos) | Tempo da inicialização até a entrega dos resultados. | Uso geral, follower, grupo de computação, cluster compartilhado | V2.0.44+ / V2.1.22+ | |
Latência P99 de consulta (milissegundos) | Latência do percentil 99 de todas as consultas. | Uso geral, follower, grupo de computação, cluster compartilhado | -- | |
Duração da consulta mais longa nesta instância (milissegundos) | Duração da consulta ativa em execução há mais tempo. | Uso geral, follower, grupo de computação, cluster compartilhado | V1.1+ | |
QPS de consultas com falha | QPS de consultas com falha (milissegundos) | Total de consultas com falha por segundo. | Uso geral, follower, grupo de computação, cluster compartilhado | -- |
QPS de consultas com falha do QE (contagem/s) | Consultas com falha por segundo no mecanismo QE. | Uso geral, follower, grupo de computação | V2.2+ | |
QPS de consultas com falha do FixedQE (contagem/s) | Consultas com falha por segundo no mecanismo FixedQE. | Uso geral, grupo de computação | V2.2+ | |
Bloqueios | Tempo máximo de espera de bloqueio FE (milissegundos) | Tempo de espera de bloqueio DDL em nós FE. | Uso geral, follower, grupo de computação | V2.0.44+ / V2.1.22+ |
Tempo de espera de bloqueio de backend do FixedQE (milissegundos) | Tempo de espera de bloqueio para o FixedQE (geralmente bloqueios HQE). | Uso geral, follower, grupo de computação | V2.0.44+ / V2.1.22+ | |
Tempo total de espera de bloqueio de backend da instância (milissegundos) | Tempo total de espera de bloqueio HQE, incluindo esperas de bloqueio do FixedQE. | Uso geral, follower, grupo de computação | V2.0.44+ / V2.1.22+ | |
Conexão | Conexões do Gateway (contagem) | Total de conexões na camada de Gateway. | Uso geral, follower, grupo de computação | Conexões do Gateway = FE + FE WAL sender + Fixed FE non-Binlog + Fixed FE Binlog |
Uso máximo de conexão do Gateway (%) | Taxa máxima de uso de conexões do Gateway. | Uso geral, follower, grupo de computação | -- | |
Conexões FE (contagem) | Conexões em nós FE (Frontend). | Uso geral, follower, grupo de computação, cluster compartilhado | -- | |
Conexões FE por banco de dados (contagem) | Conexões FE divididas por banco de dados. | Uso geral, follower, grupo de computação, cluster compartilhado | -- | |
Conexões FE por nó FE (contagem) | Conexões FE divididas por nó FE. | Uso geral, follower, grupo de computação, cluster compartilhado | -- | |
Uso máximo de conexão FE (%) | Taxa máxima de uso de conexões FE. | Uso geral, follower, grupo de computação, cluster compartilhado | -- | |
Contagem de WAL Sender do FE por nó FE (contagem) | WAL senders por nó FE para consumo de Binlog. | Uso geral, follower, grupo de computação | -- | |
Uso máximo de WAL Sender (%) | Taxa máxima de uso de WAL sender. | Uso geral, follower, grupo de computação | -- | |
Conexões Fixed FE (não Binlog) (contagem) | Conexões não Binlog em nós Fixed FE. | Uso geral, follower, grupo de computação | -- | |
Conexões Binlog do Fixed FE (contagem) | Conexões Binlog em nós Fixed FE. | Uso geral, follower, grupo de computação | -- | |
Fila de consultas | Contagem de consultas na fila | Consultas aguardando execução. | Uso geral, follower, grupo de computação | V3.0+ |
QPS de entrada na fila de consultas (contagem/s) | Consultas enviadas para a fila por segundo. | Uso geral, follower, grupo de computação | V3.0+ | |
QPS de consultas transicionadas de enfileiradas para em execução (contagem/s) | Consultas passando do estado de espera para execução por segundo. | Uso geral, follower, grupo de computação | V3.0+ | |
QPS por estado para consultas que iniciaram execução (contagem/s) | Contagem por segundo de consultas agrupadas por estado de execução. | Uso geral, follower, grupo de computação | V3.0+ | |
Tempo médio de espera na fila de consultas (milissegundos) | Tempo médio da entrada na fila até o início do processamento. | Uso geral, follower, grupo de computação | V3.0+ | |
Concorrência máxima de limite automático de taxa da fila de consultas (contagem) | Concorrência máxima para filas com limite automático de taxa. | Grupo de computação | V3.1+ | |
I/O | Throughput de leitura de I/O padrão (bytes/s) | Throughput de leitura para armazenamento Standard. | Uso geral, follower, grupo de computação | -- |
Throughput de gravação de I/O padrão (bytes/s) | Throughput de gravação para armazenamento Standard. | Uso geral, grupo de computação | -- | |
Throughput de leitura de I/O de baixa frequência (bytes/s) | Throughput de leitura para armazenamento IA. | Uso geral, follower, grupo de computação | -- | |
Throughput de gravação para I/O de baixa frequência (bytes/s) | Throughput de gravação para armazenamento IA. | Uso geral, grupo de computação | -- | |
Armazenamento | Capacidade usada do armazenamento Standard (bytes) | Capacidade usada no armazenamento Standard. | Uso geral, grupo de computação | -- |
Uso do armazenamento Standard (%) | Porcentagem de uso do armazenamento Standard. | Uso geral, grupo de computação | -- | |
Capacidade usada do armazenamento IA (bytes) | Capacidade usada no armazenamento IA. | Uso geral, grupo de computação | -- | |
Uso do armazenamento IA (%) | Porcentagem de uso do armazenamento IA. | Uso geral, grupo de computação | -- | |
Uso de armazenamento da Lixeira (bytes) | Armazenamento consumido pela lixeira. | Uso geral, grupo de computação | V3.1+ | |
Framework | Atraso de replay do FE (milissegundos) | Atraso de replay para cada nó FE. | Uso geral, follower, grupo de computação | V2.2+ |
Atraso de sincronização de múltiplas réplicas de shard (milissegundos) | Atraso de sincronização entre réplicas de shard. | Uso geral, follower, grupo de computação | -- | |
Atraso de sincronização primário-follower (milissegundos) | Atraso de sincronização de dados da instância primária para a follower. | Uso geral, follower, grupo de computação | -- | |
Atraso de sincronização de arquivos entre instâncias (milissegundos) | Atraso de sincronização de arquivos entre instâncias de recuperação de desastres. | Uso geral | -- | |
Auto Analyze | Tabelas sem estatísticas por banco de dados (contagem) | Tabelas sem estatísticas em cada banco de dados. | Uso geral, grupo de computação | V2.2+ |
Serverless Computing | Duração da consulta mais longa do Serverless Computing (milissegundos) | Consulta do Serverless Computing em execução há mais tempo. | Uso geral, grupo de computação | V2.1+ |
Contagem de consultas na fila do Serverless Computing | Consultas enfileiradas no pool do Serverless Computing. | Uso geral, grupo de computação | V2.2+ | |
Uso da cota de recursos do Serverless Computing (%) | Proporção entre recursos usados e o máximo alocável do Serverless Computing. | Uso geral, grupo de computação | V2.2+ | |
Binary Logging | Taxa de consumo de Binlog (contagem/s) | Entradas de Binlog consumidas por segundo. | Uso geral, follower, grupo de computação | V2.2+ |
Taxa de consumo de Binlog (bytes/s) | Bytes consumidos do Binlog por segundo. | Uso geral, follower, grupo de computação | V2.2+ | |
Contagem de WAL Sender por FE (contagem) | WAL senders usados por nó FE. | Uso geral, follower, grupo de computação | V2.2+ | |
Taxa de uso de WAL Sender do FE com maior uso (%) | Pico de uso de WAL sender entre os nós FE. | Uso geral, follower, grupo de computação | V2.2+ | |
Recurso de computação | Contagem de núcleos elásticos para grupos de computação | Núcleos adicionados por dimensionamento baseado em tempo. | Grupo de computação | V2.2.21+ |
Contagem de núcleos autoelásticos do grupo de computação (contagem) | Núcleos adicionados por Auto Scaling. | Grupo de computação | V4.0+ | |
Gateway | Uso de CPU do Gateway (%) | Uso de CPU de cada Gateway. | Grupo de computação | V2.0+ |
Uso de memória do Gateway (%) | Uso de memória de cada Gateway. | Grupo de computação | V2.0+ | |
Novas solicitações de conexão do Gateway por segundo (contagem/s) | Novas conexões estabelecidas por segundo. | Grupo de computação | V2.1.12+ | |
Taxa de tráfego de entrada do Gateway (B/s) | Dados entrando pelo Gateway por segundo. | Grupo de computação | V2.1+ | |
Taxa de tráfego de saída do Gateway (B/s) | Dados enviados pelo Gateway por segundo. | Grupo de computação | V2.1+ | |
Dynamic Table | QPS de falha de atualização de Dynamic Table no nível da instância (contagem/s) | Taxa de falha de atualização em todas as Dynamic Tables. | Uso geral, grupo de computação | V4.0.8+ |
Latência em relação aos dados upstream mais recentes. | Uso geral, grupo de computação | V4.0.8+ | ||
Duração atual da atualização da Dynamic Table (milissegundos) | Duração da tarefa de atualização em andamento. | Uso geral, grupo de computação | V4.0.8+ | |
QPM de falha de atualização da Dynamic Table (contagem/minuto) | Falhas de atualização por minuto por Dynamic Table. | Uso geral, grupo de computação | V4.0.8+ |
IDs de métricas do Cloud Monitor
Cada métrica possui um ID exclusivo no Cloud Monitor. O prefixo do ID varia conforme o tipo de instância:
|
Tipo de instância |
Prefixo |
Referência da métrica |
|
Instância de uso geral |
|
|
|
Instância follower |
|
|
|
Instância de grupo de computação |
|
|
|
Lakehouse Acceleration (Cluster Compartilhado) |
|
Categorias de mecanismo e tipos de comando
Categorias de mecanismo nas métricas de monitoramento:
QE é um termo coletivo para os mecanismos de computação vetorial proprietários do Hologres (HQE, SQE) da família de mecanismos XQE. Nos logs de consultas lentas, consultas com
Engine Type={XQE}correspondem à categoria QE.FixedQE refere-se a consultas que usam o caminho Fixed Plan. Nos logs de consultas lentas, consultas com
Engine Type={FixedQE}(ouSDKem versões anteriores à V2.2) correspondem à categoria FixedQE.
Classificação de Command Type:
O Command Type corresponde ao tipo de instrução SQL. Por exemplo, tanto
INSERT xxxquantoINSERT xxx ON CONFLICT DO UPDATE/NOTHINGsão classificados como INSERT.UNKNOWN: Instruções SQL que o mecanismo DPI não reconhece devido a erros de sintaxe.
-
UTILITY: Comandos administrativos, de definição e de controle diferentes de INSERT, UPDATE, DELETE e SELECT, incluindo:
DDL: CREATE, ALTER, DROP, TRUNCATE, COMMENT
TCL: BEGIN, COMMIT, ROLLBACK, SAVEPOINT
Administração e manutenção: ANALYZE, VACUUM, EXPLAIN, SET, SHOW, COPY, REFRESH
Execução e controle procedural: PREPARE, EXECUTE, DEALLOCATE, CALL, DECLARE CURSOR
Outros: LOCK TABLE, LISTEN, NOTIFY
Controle de acesso
A página de monitoramento do console do Hologres obtém dados do Cloud Monitor. Usuários RAM precisam de uma das seguintes permissões para visualizar os dados de monitoramento:
|
Política de permissão |
Nível de acesso |
|
|
Permissões totais de gerenciamento para o Cloud Monitor |
|
|
Acesso somente leitura ao Cloud Monitor |
Observações gerais
Se uma métrica não apresentar dados, a versão da instância pode não ser compatível com ela ou não houve atividade por um longo período.
Os dados de monitoramento são retidos por até 30 dias.
As métricas são reportadas a cada minuto.
CPU
Uso de CPU da instância (%)
A carga geral de CPU da instância.
Processos em segundo plano e tarefas de compactação consomem CPU mesmo sem consultas ativas; portanto, o uso em ociosidade é normal. O Hologres usa paralelismo multinúcleo, então uma única consulta pode elevar a CPU a 100% — isso indica utilização total dos recursos, não necessariamente um problema.
Quando investigar: Se o uso de CPU permanecer próximo de 100% por 3 horas ou acima de 90% por 12 horas, a instância estará sob carga pesada e a CPU provavelmente será o gargalo. Considere se:
Importações grandes de dados offline (INSERT) estão em execução com volumes de dados crescentes.
Consultas ou gravações de alto QPS estão consumindo todos os recursos de CPU.
Cargas de trabalho híbridas combinam os cenários acima.
Se o uso elevado e sustentado de CPU for esperado, aumente a escala da instância.
Uso de CPU do nó Worker (%)
A carga de CPU em cada nó Worker. O número de nós Worker varia conforme o tipo de instância. Para mais informações, consulte Gerenciamento de instâncias.
Versão: V1.1+
Se todos os nós Worker apresentarem uso sustentado de CPU próximo de 100%, a instância estará sob carga pesada. Otimize as consultas ou aumente a escala da instância.
Se apenas alguns nós Worker apresentarem alto uso de CPU, haverá assimetria de recursos. Para causas comuns e solução de problemas, consulte FAQ sobre métricas de monitoramento.
Uso de CPU do cluster (%)
O uso de CPU de cada cluster no grupo de computação.
Versão: V4.0+. Apenas instâncias de grupo de computação.
Memória
Uso de memória da instância (%)
O consumo geral de memória da instância.
O Hologres reserva memória para metadados, índices e caches para acelerar consultas. Um uso em ociosidade de 30%–40% é típico. Se o uso subir em direção a 80%, a memória poderá se tornar um gargalo.
Use as métricas de distribuição de memória juntamente com o QPS e outros indicadores para identificar os maiores consumidores de memória. Guia de solução de problemas para falta de memória.
Uso de memória do nó Worker (%)
A carga de memória em cada nó Worker. O número de nós Worker varia conforme o tipo de instância. Para mais informações, consulte Gerenciamento de instâncias.
Versão: V1.1+
Se todos os nós Worker apresentarem uso sustentado de memória próximo de 80%, a instância estará sob carga pesada. Otimize as consultas ou aumente a escala da instância.
Se apenas alguns nós Worker apresentarem alto uso de memória, haverá assimetria de recursos. Para causas comuns e solução de problemas, consulte FAQ sobre métricas de monitoramento.
Uso detalhado de memória da instância (%)
Versão: V2.0+ (métricas de distribuição de memória disponíveis a partir da V2.0.15)
O Hologres divide a memória em seis categorias:
|
Categoria |
O que rastreia |
Comportamento típico |
|
System |
Holohub, Gateway e FE (FE Master + FE Query) |
Flutua conforme a atividade de consultas |
|
Cache |
Caches SQL (cache de resultados, cache de blocos) e cache Meta (metadados de schema/arquivo) |
Tamanho fixo, tipicamente ~30% da memória total da instância. Algum uso persiste quando ocioso (principalmente cache Meta). Taxas de acerto de cache mais altas melhoram o desempenho da consulta — valores menores de |
|
Meta |
Metadados e arquivos. Usa modo de abertura lazy — metadados acessados frequentemente permanecem na memória; os pouco acessados, não. |
Mantenha abaixo de 30% da memória total. Alto uso de Meta sugere muitos arquivos ou tabelas particionadas. Use Visão geral e análise de estatísticas de tabela para investigar. |
|
Query |
Memória consumida durante a execução SQL, incluindo Fixed Plan, HQE e SQE. |
Alocação elástica: mínimo de 20 GB por Worker; o máximo depende da memória livre disponível. Alto uso em outras categorias reduz a memória de Query. |
|
Background |
Tarefas de compactação e flush. |
Tipicamente abaixo de 5%. Aumenta temporariamente durante alterações de índice, gravações em massa ou atualizações. |
|
Memtable |
Tabelas em memória para gravações, atualizações e exclusões em tempo real. |
Tipicamente abaixo de 5%. |
Solução de problemas: Alto uso de memória de Query ou eventos de falta de memória (OOM) geralmente indicam consultas complexas ou alta concorrência. Para orientações de otimização, consulte Otimizar desempenho de consultas.
Uso de memória de consulta QE (bytes)
A memória (em bytes) usada por consultas executadas pelos mecanismos HQE, SQE ou outros mecanismos XQE.
Versão: V2.0.44+ / V2.1.22+
Nos detalhamentos de memória, o uso de memória de Query excede o uso de memória de consulta QE porque Query inclui todos os tipos de mecanismo. Maior uso de memória de consulta QE indica consultas mais complexas que exigem mais memória.
Uso de memória de consulta QE (%)
A porcentagem de memória usada pelas consultas do mecanismo QE.
Versão: V2.0.44+ / V2.1.22+
O uso elevado pode levar a erros OOM. Otimize as consultas ou aumente a escala da instância.
Uso de memória do cluster (%)
O uso de memória de cada cluster no grupo de computação.
Versão: V4.0+. Apenas instâncias de grupo de computação.
QPS e RPS de consulta
QPS de consulta (contagem/s)
Média de instruções SQL executadas por segundo, incluindo SELECT, INSERT, UPDATE, DELETE, UTILITY e UNKNOWN.
Relação: Query QPS >= QE Query QPS + FixedQE Query QPS
O QPS total inclui todas as consultas (UNKNOWN, UTILITY, Engine Type={PG}); portanto, é igual ou superior à soma dos QPS do QE e FixedQE.
QPS de consulta QE (contagem/s)
Consultas por segundo executadas pelo mecanismo QE, incluindo SELECT, INSERT, UPDATE e DELETE.
Versão: V2.2+
QPS de consulta FixedQE (contagem/s)
Consultas por segundo executadas pelo mecanismo FixedQE (caminho Fixed Plan, anteriormente SDK), incluindo SELECT, INSERT, UPDATE e DELETE.
Versão: V2.2+
RPS de DML (contagem/s)
Média de registros de dados importados ou atualizados por segundo, incluindo INSERT, UPDATE e DELETE.
Relação: DML RPS = QE DML RPS + FixedQE DML RPS
RPS de DML do QE (contagem/s)
Registros de dados importados ou atualizados por segundo pelo mecanismo QE, incluindo INSERT, UPDATE e DELETE.
Versão: V2.2+
Cenários comuns de QE:
Importação ou atualização em lote de tabelas externas do MaxCompute ou OSS
Gravação ou atualização em lote usando COPY
Importação em lote entre tabelas do Hologres
RPS de DML do FixedQE (contagem/s)
Registros de dados importados ou atualizados por segundo pelo mecanismo FixedQE (caminho Fixed Plan, anteriormente SDK), incluindo INSERT, UPDATE e DELETE.
Versão: V2.2+
Cenários comuns de FixedQE:
Sincronização em tempo real de Binlog do MySQL para o Hologres
Gravações offline usando Data Integration (DataX)
Gravações usando SQL ou JDBC com
INSERT INTO VALUES()
Latência de consulta
Latência de consulta (milissegundos)
Latência média de todas as consultas, incluindo SELECT, INSERT, UPDATE, DELETE, UTILITY e UNKNOWN.
Relação: Query Latency >= MAX(QE Query Latency, FixedQE Query Latency)
Latência de consulta QE (milissegundos)
Latência média das consultas executadas pelo mecanismo QE, incluindo SELECT, INSERT, UPDATE e DELETE.
Versão: V2.2+
Para solucionar latência elevada de consulta QE, verifique as métricas de Duração da Fase de Otimização, Duração da Fase de Início da Consulta, Duração da Fase Get Next e QPS do QE.
Latência de consulta FixedQE (milissegundos)
Latência média das consultas executadas pelo mecanismo FixedQE, incluindo SELECT, INSERT, UPDATE e DELETE.
Versão: V2.2+
Solução de problemas:
Picos ocasionais: Podem indicar bloqueios HQE. Verifique se o Tempo de Espera de Bloqueio de Backend do FixedQE aumentou. Em caso afirmativo, use Obter insights de consulta para identificar as consultas causadoras do bloqueio.
Latência persistentemente alta: Pode resultar de design de tabela subótimo ou interferência de consultas complexas. Consulte Problemas comuns e diagnósticos para Blink e Flink.
Duração da fase de otimização (milissegundos)
Tempo gasto na fase de Otimização, em que o otimizador analisa o SQL e gera um plano físico.
Versão: V2.0.44+ / V2.1.22+
Durações longas de Otimização sugerem consultas complexas. Se as consultas diferirem apenas nos parâmetros, use Prepared Statements para reduzir a sobrecarga de otimização. Para mais informações, consulte JDBC.
Duração da fase de início da consulta (milissegundos)
Tempo gasto na fase Start Query — inicialização antes da execução da consulta, incluindo bloqueios e alinhamento de versão de schema.
Versão: V2.0.44+ / V2.1.22+
Durações longas de Start Query frequentemente resultam de esperas de bloqueio ou alto uso de CPU. Use planos de execução para análise mais profunda.
Duração da fase Get Next (milissegundos)
Tempo do fim da fase Start Query até o retorno de todos os resultados, incluindo computação e entrega de resultados.
Versão: V2.0.44+ / V2.1.22+
Durações longas de Get Next frequentemente refletem computações complexas. Correlacione com o uso de memória do QE e o QPS do QE. Se não houver anomalias nessas métricas, o cliente pode estar simplesmente lento para consumir os resultados.
Latência P99 de consulta (milissegundos)
Latência do percentil 99 de todas as consultas, incluindo SELECT, INSERT, UPDATE, UTILITY e consultas de sistema.
Duração da consulta mais longa nesta instância (milissegundos)
Duração da consulta ativa em execução há mais tempo, abrangendo SELECT, INSERT, UPDATE, DELETE, UTILITY e UNKNOWN.
Versão: V1.1+
As consultas distribuem-se entre os nós Worker. Esta métrica reporta a consulta em execução há mais tempo em todos os Workers. Por exemplo, se os Workers executarem consultas de 10 minutos, 5 minutos e 30 segundos, o valor reportado será 10 minutos.
Combine esta métrica com consultas ativas ou logs de consultas lentas para diagnosticar consultas longas e resolver deadlocks.
As métricas são reportadas a cada minuto; portanto, a "duração atual de execução" começa ligeiramente após o início da consulta. Esta métrica é útil para detecção de anomalias, mas não fornece cronometragem precisa.
QPS de consultas com falha
QPS de consultas com falha (milissegundos)
Média de instruções SQL com falha por segundo, incluindo SELECT, INSERT, UPDATE, DELETE, UTILITY e UNKNOWN.
Relação: Failed Query QPS >= QE Failed Query QPS + FixedQE Failed Query QPS
O QPS total de falhas inclui todas as consultas com falha (UNKNOWN, UTILITY, Engine Type={PG}); portanto, é igual ou superior à soma dos QPS de falhas do QE e FixedQE.
Use o tipo e a frequência de consultas com falha para encontrar as consultas problemáticas nos logs de consultas lentas e analise as causas raiz para melhorar a disponibilidade.
QPS de consultas com falha do QE (contagem/s)
Consultas com falha por segundo no mecanismo QE, incluindo SELECT, INSERT, UPDATE e DELETE.
Versão: V2.2+
QPS de consultas com falha do FixedQE (contagem/s)
Consultas com falha por segundo no mecanismo FixedQE, incluindo SELECT, INSERT, UPDATE e DELETE.
Versão: V2.2+
Bloqueios
Tempo máximo de espera de bloqueio FE (milissegundos)
O Hologres possui múltiplos nós FE que analisam, despacham e roteiam instruções SQL. Quando múltiplas conexões no mesmo FE realizam operações DDL na mesma tabela (como CREATE ou DROP), ocorrem bloqueios FE. Esta métrica mostra o tempo de espera de bloqueio DDL por FE.
Versão: V2.2+
Se o tempo de espera de bloqueio FE exceder 5 minutos e o Atraso de Replay do FE também tiver picos, uma operação DDL poderá estar travada. Use Gerenciar consultas para encontrar e encerrar consultas longas.
Tempo de espera de bloqueio de backend do FixedQE (milissegundos)
Consultas INSERT, DELETE ou UPDATE usando HQE adquirem bloqueios de tabela, enquanto consultas FixedPlan adquirem bloqueios de linha. Esta métrica aumenta quando consultas FixedPlan aguardam bloqueios de linha enquanto consultas HQE mantêm bloqueios de tabela na mesma tabela.
Versão: V2.2+
Se este valor for alto, verifique os logs de consultas lentas para consultas FixedQE lentas e use Obter insights de consulta para identificar as consultas HQE causadoras do bloqueio.
Tempo total de espera de bloqueio de backend da instância (milissegundos)
O tempo total de espera de bloqueio para consultas INSERT, DELETE ou UPDATE na instância, incluindo tanto as esperas de bloqueio do FixedQE quanto do HQE.
Versão: V2.2+
Se este valor for alto, verifique os logs de consultas lentas para consultas INSERT, DELETE ou UPDATE lentas e use Obter insights de consulta para identificar as consultas HQE causadoras do bloqueio.
Conexão
Conexões do Gateway (contagem)
Total de conexões na camada de Gateway da instância, refletindo a carga geral de conexões na camada de acesso.
Conexões do Gateway = conexões FE + WAL senders FE + Fixed FE não Binlog + Fixed FE Binlog.
Se as conexões do Gateway permanecerem próximas do limite da instância por um período prolongado, os recursos de conexão estarão se aproximando da saturação. Limpe conexões ociosas ou aumente a escala para obter mais capacidade de conexão.
Uso máximo de conexão do Gateway (%)
A taxa máxima de uso de conexões do Gateway, refletindo a pressão de pico no pool de conexões da camada de acesso. Quando o uso se aproxima consistentemente de 100%, novas conexões podem falhar. Investigue em conjunto com a métrica de Conexões do Gateway e considere aumentar a escala.
Conexões FE (contagem)
Conexões em nós FE (Frontend), refletindo a carga de conexão na camada de análise e roteamento de SQL. O Hologres define limites padrão de conexão FE com base nas especificações da instância. Para mais informações, consulte Gerenciamento de instâncias. Inclui conexões ativas, ociosas e ociosas em transação. Use Gerenciar consultas para visualizar o uso atual de conexões e encerrar conexões ociosas quando os recursos estiverem baixos.
Conexões FE por banco de dados (contagem)
Conexões FE divididas por banco de dados, para identificar quais bancos de dados consomem mais conexões.
Conexões FE por nó FE (contagem)
Conexões FE divididas por nó FE, para avaliar se a carga de conexão está balanceada entre os nós.
Limite padrão de conexão por nó FE: 128. Para limites totais, consulte Gerenciamento de instâncias.
Se as conexões em qualquer nó se aproximarem do limite, revise as conexões ociosas versus ativas. Use Gerenciar conexões para limpar conexões ociosas ou aumentar a escala.
Se a carga de conexão estiver desigual entre os nós, use Gerenciar conexões para identificar e limpar conexões ociosas.
Uso máximo de conexão FE (%)
A taxa máxima de uso de conexão FE: Max(frontend_connection_used_rate). Use isto para detectar quando qualquer nó FE estiver se aproximando de seu limite de conexão. Os nós FE usam balanceamento de carga round-robin. Use Gerenciar consultas para visualizar detalhes de uso e encerrar conexões ociosas quando necessário.
Contagem de WAL Sender do FE por nó FE (contagem)
WAL senders por nó FE. Ao consumir Binlog via JDBC, cada shard de cada tabela usa uma conexão WAL sender. As conexões WAL sender são independentes das conexões regulares e possuem seu próprio limite. Use esta métrica para monitorar a utilização de WAL sender por nó FE.
Uso máximo de WAL Sender (%)
A taxa máxima de uso de WAL sender, refletindo a pressão máxima nas conexões relacionadas ao Binlog. Quando o uso se aproxima do limite, o consumo de Binlog pode ser afetado. Investigue e aumente a escala conforme necessário.
Conexões Fixed FE (não Binlog) (contagem)
Conexões não Binlog em nós Fixed FE, refletindo a carga de conexão no caminho de execução do Fixed Plan.
Conexões Binlog do Fixed FE (contagem)
Conexões Binlog em nós Fixed FE, refletindo a carga de conexão relacionada ao Binlog no caminho de execução do Fixed Plan.
Fila de consultas
Contagem de consultas na fila (contagem)
O número de solicitações de consulta aguardando execução.
Versão: V3.0+
QPS de entrada na fila de consultas (contagem/s)
Consultas enviadas para a fila do sistema por segundo. Use isto para medir a carga do sistema e a frequência de consultas.
Versão: V3.0+
QPS de consultas transicionadas de enfileiradas para em execução (contagem/s)
Consultas passando do estado de espera para o estado de execução por segundo.
Versão: V3.0+
QPS por estado para consultas que iniciaram execução (contagem/s)
Contagem por segundo de consultas na fila de consultas, agrupadas por estado:
kReadyToRun — qualificada para execução
kQueueTimeout — falhou devido a timeout na fila
kCanceled — falhou devido a cancelamento
kExceedConcurrencyLimit — falhou devido ao limite de concorrência
Versão: V3.0+
Tempo médio de espera na fila de consultas (milissegundos)
O tempo médio da entrada na fila até o início do processamento. Isso não inclui o tempo real de execução da consulta.
Versão: V3.0+
Concorrência máxima de limite automático de taxa da fila de consultas (contagem)
A concorrência máxima para filas de consultas com limite automático de taxa.
Versão: V3.1+. Apenas instâncias de grupo de computação.
I/O
O throughput de I/O reflete a atividade de I/O do disco. Nota: 1 GiB = 1024 MiB = 1024 x 1024 KiB.
Limites de throughput de I/O:
Armazenamento Standard (quente): O throughput de I/O não é fixo. Depende principalmente da carga de CPU.
Armazenamento IA (frio): O throughput máximo de I/O é
80 MB/s x (número de núcleos / 16).
Throughput de leitura de I/O padrão (bytes/s)
Throughput de leitura para dados do armazenamento Standard.
Throughput de gravação de I/O padrão (bytes/s)
Throughput de gravação para dados do armazenamento Standard.
Throughput de leitura de I/O de baixa frequência (bytes/s)
Throughput de leitura para dados do armazenamento IA.
Throughput de gravação para I/O de baixa frequência (bytes/s)
Throughput de gravação para dados do armazenamento IA.
Armazenamento
Espaço lógico em disco usado pelos dados da instância — a soma de todo o armazenamento do banco de dados, incluindo a lixeira. Nota: 1 GiB = 1024 MiB = 1024 x 1024 KiB. O armazenamento do Hologres cresce sem limite rígido.
Para instâncias por assinatura, o armazenamento que excede o valor comprado é faturado conforme o uso. Isso não afeta a estabilidade ou usabilidade do sistema. Atualize o armazenamento prontamente ou exclua dados não utilizados para evitar custos desnecessários.
Use pg_relation_size para visualizar os tamanhos de armazenamento de tabelas e bancos de dados. Use Table Info para gerenciamento granular de tabelas.
Capacidade usada do armazenamento Standard (bytes)
A capacidade usada no armazenamento Standard. Aumente a escala do armazenamento se o uso exceder a capacidade comprada.
Uso do armazenamento Standard (%)
A porcentagem de uso da capacidade do armazenamento Standard. Aumente a escala do armazenamento se o uso exceder a capacidade comprada.
Capacidade usada do armazenamento IA (bytes)
A capacidade usada no armazenamento IA. Aumente a escala do armazenamento se o uso exceder a capacidade comprada.
Uso do armazenamento IA (%)
A porcentagem de uso da capacidade do armazenamento IA. Aumente a escala do armazenamento se o uso exceder a capacidade comprada.
Uso de armazenamento da Lixeira (bytes)
Versão: V3.1+
O Hologres oferece suporte a uma lixeira de tabelas a partir da V3.1. Tabelas excluídas com DROP permanecem na lixeira por um período de retenção, permitindo a recuperação de tabelas excluídas acidentalmente. Essas tabelas ainda consomem armazenamento da instância.
Monitore o uso da lixeira por banco de dados. Se exclusões frequentes de tabelas causarem alto uso da lixeira, configure as tabelas para ignorar a lixeira upon deletion.
Framework
Atraso de replay do FE (milissegundos)
Versão: V2.2+
O Hologres possui múltiplos nós FE. Para operações DDL, o Hologres executa a operação em um FE e a replica nos outros. Atrasos de replay de milissegundos ou segundos são normais.
Se o atraso de replay de um FE exceder vários minutos, muitas operações DDL poderão estar sobrecarregando o processo de replay. Se o atraso continuar aumentando, uma consulta poderá estar travada. Use hg_stat_activity para encontrar e encerrar consultas longas.
Atraso de sincronização de múltiplas réplicas de shard (milissegundos)
O atraso de sincronização entre réplicas de shard após a ativação da Replicação.
O atraso típico de réplica de shard é em milissegundos. Gravações pesadas de dados, atualizações ou operações DDL frequentes podem aumentar o atraso de sincronização.
Atraso de sincronização primário-follower (milissegundos)
O atraso quando uma instância follower lê dados da instância primária. Esta métrica aparece apenas para instâncias follower, não para instâncias primárias.
Os dados aparecem apenas depois que uma instância follower é vinculada a uma instância primária (0 ms inicialmente). O atraso de sincronização flutua quando a instância primária recebe gravações.
O atraso normal de sincronização é em milissegundos. Jitter ocasional de operações DDL primárias pode ser ignorado com segurança. Atraso persistentemente alto de mais de alguns segundos pode indicar alta carga da instância ou falta de recursos — verifique o uso de CPU e memória e aumente a escala se necessário.
O atraso de sincronização pode ter picos de vários minutos durante reinicializações ou atualizações e depois se recupera automaticamente.
Atraso de sincronização de arquivos entre instâncias (milissegundos)
O atraso de sincronização de arquivos entre instâncias de recuperação de desastres. Esta métrica aparece apenas em instâncias follower (followers somente leitura).
Auto Analyze
Tabelas sem estatísticas por banco de dados (contagem)
O número de tabelas sem estatísticas em cada banco de dados.
Versão: V2.2+
Para Hologres V2.0 e posterior, o Auto Analyze é executado por padrão. Após a criação de tabelas ou gravações/atualizações em massa, as estatísticas podem ficar temporariamente atrasadas — observe por um curto período primeiro.
Se um banco de dados consistentemente carecer de estatísticas por horas ou dias, o Auto Analyze pode não ter sido acionado. Use a view HG_STATS_MISSING para listar as tabelas afetadas e execute manualmente o ANALYZE. Para mais informações, consulte ANALYZE e AUTO ANALYZE.
Serverless Computing
Duração da consulta mais longa do Serverless Computing (milissegundos)
A duração da consulta em execução há mais tempo no Serverless Computing. O Serverless Computing executa consultas específicas em um pool de recursos dedicado, isolado da instância principal.
Versão: V2.1+
Use hg_stat_activity para inspecionar o status das consultas do Serverless Computing.
Contagem de consultas na fila do Serverless Computing (contagem)
O número de consultas enfileiradas no pool de recursos do Serverless Computing.
Versão: V2.2+
Uso da cota de recursos do Serverless Computing (%)
A proporção entre os recursos reais do Serverless Computing usados e o máximo de recursos alocáveis.
Versão: V2.2+
Binary Logging
Taxa de consumo de Binlog (contagem/s)
O número de entradas de Binlog consumidas por segundo. O Hologres oferece suporte à assinatura de Binlog do Hologres para camadas de dados em tempo real e encaminhamento acelerado de dados.
Versão: V2.2+
Taxa de consumo de Binlog (bytes/s)
Os bytes consumidos do Binlog por segundo. Campos maiores ou volumes de dados mais altos aumentam a contagem de bytes.
Versão: V2.2+
Contagem de WAL Sender por FE (contagem)
O número de WAL senders usados por nó FE. Cada shard de cada tabela consome uma conexão WAL sender ao consumir Binlog usando JDBC. As conexões WAL sender são independentes das conexões regulares e possuem um limite padrão.
Versão: V2.2+
Taxa de uso de WAL Sender do FE com maior uso (%)
A utilização máxima de WAL sender em todos os nós FE.
Versão: V2.2+
Se o uso de WAL sender atingir o limite, consulte Consumir Binlog do Hologres via JDBC para solução de problemas.
Recurso de computação
Contagem de núcleos elásticos para grupos de computação
Núcleos adicionados por dimensionamento baseado em tempo no grupo de computação. Elasticidade baseada em tempo (Beta).
Versão: V2.2.21+. Apenas instâncias de grupo de computação.
Contagem de núcleos autoelásticos do grupo de computação (contagem)
Núcleos adicionados por Auto Scaling no grupo de computação. Multicluster e autoelasticidade (Beta).
Versão: V4.0+. Apenas instâncias de grupo de computação.
Gateway
Uso de CPU do Gateway (%)
O uso de CPU de cada Gateway na instância.
Versão: V2.0+. Apenas instâncias de grupo de computação.
Os Gateways usam encaminhamento de tráfego round-robin, então o uso de CPU ocorre mesmo sem novas conexões. A partir da V2.2.22, os Gateways lançam mais threads de worker por padrão para melhorar o manuseio de conexões, o que aumenta o uso básico de CPU.
Uso de memória do Gateway (%)
O uso de memória de cada Gateway na instância.
Versão: V2.0+. Apenas instâncias de grupo de computação.
Novas solicitações de conexão do Gateway por segundo (contagem/s)
O número máximo de novas conexões que o sistema pode aceitar e estabelecer com sucesso por segundo.
Versão: V2.1.12+. Apenas instâncias de grupo de computação.
Um único Gateway lida com aproximadamente 100 novas conexões por segundo. Se as solicitações de nova conexão se aproximarem de 100 x Gateway count, os Gateways serão o gargalo. Configure um pool de conexões ou aumente o número de Gateways.
Taxa de tráfego de entrada do Gateway (B/s)
O volume de dados entrando pelo Gateway por segundo.
Versão: V2.1+. Apenas instâncias de grupo de computação.
Se o tráfego de entrada se aproximar de 200 MiB/s x Gateway count, a capacidade de rede do Gateway será o gargalo. Aumente o número de Gateways.
Taxa de tráfego de saída do Gateway (B/s)
O volume de dados enviados pelo Gateway por segundo.
Versão: V2.1+. Apenas instâncias de grupo de computação.
Se o tráfego de saída se aproximar de 200 MiB/s x Gateway count, a capacidade de rede do Gateway será o gargalo. Aumente o número de Gateways.
Monitoramento e alertas de Dynamic Table
A partir do Hologres V4.0.8, as Dynamic Tables oferecem métricas de monitoramento para gerenciar tarefas de atualização. Para mais informações, consulte Gerenciar tarefas de atualização.
Problemas comuns de métricas de monitoramento
O tópico FAQ sobre métricas de monitoramento aborda problemas comuns, causas raiz e correções.
Alertas de métricas de monitoramento
Configure alertas no Cloud Monitor para detectar anomalias precocemente.