Esta página lista as métricas do CloudMonitor disponíveis para instâncias de conjunto de réplicas do ApsaraDB for MongoDB. Use essas métricas para configurar regras de alerta e monitorar a integridade da instância.
Antes de começar
Ao chamar operações da API do CloudMonitor, defina os seguintes parâmetros:
Namespace:
acs_mongodbPeriod: múltiplo inteiro de 60. Padrão:
60. Unidade: segundos.
Todas as métricas compartilham as mesmas Dimensions (userId, instanceId, role) e Statistics (Maximum, Minimum, Average).
Dimensions
Cada métrica aceita as seguintes dimensions para filtrar dados no CloudMonitor:
|
Dimension |
Descrição |
|
|
Filtra dados de uma conta específica da Alibaba Cloud. |
|
|
Filtra dados de uma instância de conjunto de réplicas específica. |
|
|
Filtra dados pela função do nó. Use esta dimension para monitorar nós primários e secundários separadamente. |
Métricas de utilização de recursos
|
Métrica em regras de alerta |
Indicador |
Unidade |
MetricName |
Descrição |
|
Utilização de CPU |
cpu_usage |
% |
CPUUtilization |
Detecte carga elevada e persistente de CPU que possa degradar o desempenho das consultas. |
|
Uso de memória |
mem_usage |
% |
MemoryUtilization |
Identifique pressão de memória capaz de causar aumento de E/S de disco ou condições OOM. |
|
Uso de disco |
disk_usage |
% |
DiskUtilization |
Evite que a instância fique sem espaço em disco e se torne indisponível. |
|
Utilização de IOPS |
iops_usage |
% |
IOPSUtilization |
Verifique quando o throughput do disco se aproxima do limite provisionado. |
|
Tamanho de disco ocupado por dados |
data_size |
Byte |
DataDiskAmount |
Rastreie o crescimento dos dados e planeje o dimensionamento da capacidade. |
|
Tamanho de disco ocupado por instâncias |
ins_size |
Byte |
InstanceDiskAmount |
Compreenda o consumo total de disco da instância, incluindo dados, logs e índices. |
|
Tamanho de disco ocupado por logs |
log_size |
Byte |
LogDiskAmount |
Inspecione o crescimento anormal de logs causado por erros de replicação ou altas cargas de escrita. |
Métricas de conexão
|
Métrica em regras de alerta |
Indicador |
Unidade |
MetricName |
Descrição |
|
Número de conexões utilizadas |
current_conn |
Count |
ConnectionAmount |
Determine se o limite atual de conexões é suficiente para sua carga de trabalho. |
|
Utilização de conexões |
conn_usage |
% |
ConnectionUtilization |
Detecte quando a instância estiver se aproximando da contagem máxima de conexões. |
Métricas de tráfego
|
Métrica em regras de alerta |
Indicador |
Unidade |
MetricName |
Descrição |
|
Tráfego de entrada interno |
bytes_in |
Byte |
IntranetIn |
Rastreie as taxas de ingestão de dados e detecte picos inesperados de tráfego. |
|
Tráfego de saída interno |
bytes_out |
Byte |
IntranetOut |
Acompanhe a saída de dados para identificar cargas de trabalho com muitas leituras ou padrões de acesso a dados frequentes. |
Métricas de operações
O QPS corresponde à soma de todos os seis tipos de operação: insert, delete, update, query, getmore e command.
|
Métrica em regras de alerta |
Indicador |
Unidade |
MetricName |
Descrição |
|
Consultas por segundo (QPS) |
insert+delete+update+query+getmore+command |
Count/s |
QPS |
Monitore o throughput geral. Um pico ou queda repentina pode indicar alteração na carga de trabalho ou um incidente. |
|
Número de solicitações |
num_requests |
Count |
NumberRequests |
Acompanhe o volume total de solicitações para entender a carga cumulativa sobre a instância. |
|
Número de operações de inserção |
insert |
Count/s |
OpInsert |
Rastreie a carga de escrita. Combine com métricas de atualização e exclusão para analisar a proporção entre leitura e escrita. |
|
Número de operações de consulta |
query |
Count/s |
OpQuery |
Identifique cargas de trabalho intensivas em consultas que possam se beneficiar da otimização de índices. |
|
Número de operações de atualização |
update |
Count/s |
OpUpdate |
Observe juntamente com inserções e exclusões para compreender os padrões de mutação. |
|
Número de operações de exclusão |
delete |
Count/s |
OpDelete |
Detecte picos inesperados de exclusão que possam indicar bugs na aplicação ou problemas no pipeline de dados. |
|
Número de operações getMore |
getmore |
Count/s |
OpGetmore |
Identifique cargas de trabalho com uso intenso de cursores que podem exaurir a memória em grandes conjuntos de resultados. |
|
Número de operações de comando |
command |
Count/s |
OpCommand |
Acompanhe comandos administrativos e de agregação que possam afetar o desempenho geral. |
Métricas de replicação
|
Métrica em regras de alerta |
Indicador |
Unidade |
MetricName |
Descrição |
|
Atraso de replicação |
repl_lag |
Seconds |
ReplicationLag |
Detecte quando os nós secundários ficarem atrasados em relação ao primário. Um atraso elevado pode indicar problemas de replicação que exigem investigação. |