Sistemas de mensagens distribuídos geram métricas em produtores, consumidores e instâncias de broker difíceis de correlacionar manualmente. O ApsaraMQ for RocketMQ oferece um dashboard integrado, baseado no Alibaba Cloud Managed Service for Prometheus e no Grafana, que consolida essas métricas em uma única visualização. Use-o para detectar atrasos no consumo, acompanhar tendências de acúmulo de mensagens, verifique a entrega de mensagens e estimar custos de faturamento sem alternar entre ferramentas.
Casos de uso
Detecção de anomalias de consumo: Receba alertas quando consumidores apresentarem atrasos ou falhas e identifique os grupos e tópicos afetados.
Verificação de entrega de mensagens: Confirme o envio correto das mensagens caso o status de pedidos online específicos esteja anormal.
Análise de tendências de tráfego: Acompanhe as taxas de produção e consumo ao longo do tempo para prever capacidade e planejar picos de tráfego.
Revisão da topologia de dependências: Mapeie dependências de aplicações upstream e downstream para orientar atualizações de arquitetura.
Pré-requisitos
Antes de começar, verifique se você tem:
A função vinculada ao serviço AliyunServiceRoleForOns criada (nome da política: AliyunServiceRolePolicyForOns). Essa função concede ao ApsaraMQ for RocketMQ acesso ao Cloud Monitor e ao Application Real-Time Monitoring Service (ARMS) para recursos de monitoramento, alertas e dashboards. Para mais detalhes, consulte Funções vinculadas ao serviço
Faturamento
As métricas do dashboard são métricas básicas no ARMS Managed Service for Prometheus. Como as métricas básicas são gratuitas, o dashboard não gera custos adicionais.
Para mais informações, consulte Métricas e Pagamento conforme o uso.
Como funciona o acúmulo de mensagens
Compreender como o ApsaraMQ for RocketMQ rastreia o estado de processamento das mensagens é essencial para interpretar as métricas do dashboard, especialmente o atraso do consumidor (consumer lag), principal indicador da integridade do consumo.

O diagrama a seguir ilustra o estado de cada mensagem em uma fila. O broker calcula a contagem de mensagens e a duração do processamento em cada etapa. Essas métricas indicam a velocidade com que os consumidores buscam e confirmam as mensagens, além de mostrar se há acúmulo crescente.
Métricas de contagem de mensagens
|
Métrica |
Descrição |
Fórmula |
|
Mensagens em trânsito (Inflight) |
Mensagens que o consumidor já buscou, mas ainda não confirmou. |
Último offset buscado - Último offset confirmado |
|
Mensagens prontas |
Mensagens armazenadas no broker visíveis aos consumidores e disponíveis para consumo. |
Offset máximo - Último offset buscado |
|
Atraso do consumidor |
Total de mensagens não processadas, incluindo mensagens em trânsito e prontas. Um aumento no atraso indica que os consumidores estão ficando para trás em relação aos produtores. |
Mensagens em trânsito + Mensagens prontas |
Métricas de tempo
|
Métrica |
Descrição |
Fórmula |
|
Tempo de disponibilidade |
Momento em que a mensagem fica disponível para consumo. Varia conforme o tipo de mensagem (veja abaixo). |
N/A |
|
Tempo de fila da mensagem pronta |
Tempo de espera da mensagem pronta mais antiga. Indica a velocidade com que os consumidores buscam mensagens. |
Hora atual - Tempo de disponibilidade da mensagem pronta mais antiga |
|
Tempo de atraso do consumidor |
Tempo de espera da mensagem não confirmada mais antiga. Indica a velocidade geral de processamento. |
Hora atual - Tempo de disponibilidade da mensagem não confirmada mais antiga |
Tempo de disponibilidade por tipo de mensagem:
Mensagem normal ou ordenada: Momento em que o broker armazena a mensagem.
Mensagem agendada: Horário de entrega programado. Para mensagens com atraso, corresponde ao momento em que o período de atraso termina.
Mensagem transacional: Momento em que a transação é confirmada (committed).
Visualize o dashboard
Faça login no console do ApsaraMQ for RocketMQ. No painel de navegação à esquerda, clique em Instances.
Na barra de navegação superior, selecione uma região, como China (Hangzhou). Na página Instances, clique em nome da instância que deseja gerencie.
-
Abra o dashboard usando um dos métodos a seguir:
Na página Instance Details, clique em aba Dashboard.
No painel de navegação à esquerda, clique em Dashboard.
No painel de navegação à esquerda, clique em Topics. Clique em nome de um tópico para abrir a página Topic Details e clique em aba Dashboard.
No painel de navegação à esquerda, clique em Groups. Clique em nome de um grupo para abrir a página Group Details e clique em aba Dashboard.
Métricas do dashboard
As métricas estão organizadas em quatro categorias: produtor, consumidor, top 20 da instância e faturamento.
Todas as métricas são coletadas em intervalos de 1 minuto. Os dados ficam disponíveis pelos últimos 15 dias, com um intervalo máximo de consulta de 24 horas.
Métricas do produtor
|
Métrica |
Descrição |
Unidade |
|
Taxa de produção de mensagens |
Taxa de produção e taxa de chamadas de API para um tópico. |
mensagens/s, chamadas/s |
|
Pico da taxa de produção de mensagens |
Taxa máxima de produção. |
mensagens/s |
|
Total de mensagens produzidas |
Quantidade total de mensagens produzidas na instância. |
mensagens |
|
Taxa de sucesso das chamadas de produção |
Percentual de chamadas de envio bem-sucedidas para um tópico. |
% |
|
Latência das chamadas de produção |
Latência de envio para um tópico. |
ms |
Métricas do consumidor
|
Métrica |
Descrição |
Unidade |
|
Taxa média de sucesso no consumo |
Taxa de sucesso no consumo considerando todas as mensagens da instância. |
% |
|
Mensagens acumuladas (Prontas + Em trânsito) |
Total de mensagens acumuladas na instância, somando mensagens prontas e em trânsito. |
mensagens |
|
Mensagens em trânsito |
Mensagens em processamento pelo consumidor que ainda não foram confirmadas. |
mensagens |
|
Mensagens prontas |
Mensagens disponíveis no broker para consumo. Reflete o volume de mensagens não processadas. |
mensagens |
|
Tempo de fila da mensagem pronta |
Tempo decorrido desde que a mensagem pronta mais antiga ficou disponível. A visão geral mostra a média da instância; gráficos específicos exibem valores por grupo e tópico. Monitore atentamente em cargas de trabalho sensíveis à latência. |
ms |
|
Taxa de consumo de mensagens |
Velocidade com que um grupo consome mensagens. |
mensagens/s |
|
Pico da taxa de consumo de mensagens |
Taxa máxima de consumo. |
mensagens/s |
|
Total de mensagens consumidas |
Quantidade total de mensagens consumidas na instância. |
mensagens |
|
Acúmulo de consumo |
Mensagens acumuladas para um grupo, incluindo mensagens prontas e em trânsito. |
mensagens |
|
Latência de processamento de mensagens |
Tempo decorrido do início do consumo de uma mensagem pelo grupo até a conclusão. |
ms |
|
Tempo de espera local do consumidor |
Tempo que a mensagem aguarda no cliente consumidor antes do início do processamento. |
ms |
|
Taxa de sucesso no consumo |
Taxa de sucesso do consumo de mensagens. |
% |
|
Proporção de protocolos de acesso do cliente consumidor |
Distribuição das mensagens consumidas por tipo de protocolo (TCP vs. HTTP). |
-- |
Visão geral do top 20 da instância
|
Métrica |
Unidade |
|
Top 20 tópicos por taxa de produção de mensagens |
mensagens/s |
|
Top 20 grupos por taxa de consumo de mensagens |
mensagens/s |
|
Top 20 grupos por mensagens prontas |
mensagens |
|
Top 20 grupos por tempo de fila de mensagens prontas |
ms |
|
Top 20 grupos por mensagens acumuladas (Prontas + Em trânsito) |
mensagens |
|
Top 20 grupos por mensagens em trânsito |
mensagens |
|
Top 20 grupos por latência de processamento de consumo |
ms |
|
Top 20 grupos por tempo de espera local do consumidor |
ms |
|
Top 20 tópicos por taxa de falha nas chamadas de produção |
% |
|
Top 20 grupos por taxa de falha no consumo de mensagens |
% |
Métricas de faturamento
Use as métricas de faturamento para estimar itens relacionados a custos da sua instância, como pico de TPS e volume de chamadas de API.
Os valores das métricas de faturamento incluem multiplicadores para mensagens grandes e recursos avançados:
Multiplicador de mensagem grande: A unidade de faturamento é 4 KB. Uma mensagem de 16 KB conta como 16 / 4 = 4 chamadas de API.
Multiplicador de recurso avançado: Mensagens ordenadas, agendadas, com atraso e transacionais contam como 5 vezes o número de chamadas de API de mensagens normais.
|
Métrica |
Descrição |
Unidade |
|
Pico de TPS de produção |
TPS máximo de produção. Use para estimar a especificação de pico de TPS para faturamento. |
chamadas/s |
|
Pico de TPS de consumo |
TPS máximo de consumo. Use para estimar a especificação de pico de TPS para faturamento. |
chamadas/s |
|
Pico de TPS |
TPS máximo combinado de produção e consumo. Use para estimar a especificação de pico de TPS para faturamento. |
chamadas/s |
|
Total de chamadas de API |
Quantidade total de chamadas de API. Use para estimar o volume de chamadas de API para faturamento. |
chamadas |
|
Tamanho médio da mensagem |
Tamanho médio de todas as mensagens produzidas. |
bytes |
|
TPS de produção e consumo |
TPS combinado de produção e consumo. |
chamadas/s |
|
Chamadas diárias de API |
Total diário de chamadas de API de produção e consumo. |
chamadas |
Referência de métricas do Prometheus
Os cálculos de TPS, contagem de mensagens e total de mensagens usam uma mensagem normal de 4 KB como unidade base. Multiplicadores de tamanho e de recursos avançados são aplicados sobre essa base.
Todas as métricas usam o tipo Gauge — uma medição instantânea que pode aumentar ou diminuir.
Rótulos comuns
|
Rótulo |
Descrição |
|
|
ID da instância do ApsaraMQ for RocketMQ |
|
|
Nome do tópico |
|
|
Tipo de mensagem: |
|
|
ID da conta Alibaba Cloud |
|
|
Protocolo: |
|
|
Identificador do grupo de consumidores |
Métricas do lado do servidor
|
Nome da métrica |
Unidade |
Descrição |
Rótulos |
|
|
contagem/s |
Limiar de limitação da instância. |
|
|
|
contagem/s |
TPS máximo por minuto, excluindo requisições limitadas. Calculado como o maior valor entre 60 amostras por segundo dentro de um minuto. |
|
Métricas do produtor
|
Nome da métrica |
Unidade |
Descrição |
Rótulos |
|
|
contagem |
Chamadas de API faturáveis para envio de mensagens. |
|
|
|
mensagens |
Número de mensagens enviadas. |
|
|
|
bytes |
Tamanho total das mensagens enviadas. |
|
|
|
% |
Taxa de sucesso no envio. |
|
|
|
contagem |
Chamadas de API de envio com falha. |
|
|
|
ms |
Latência média de envio. |
|
|
|
ms |
Latência mínima de envio. |
|
|
|
ms |
Latência máxima de envio. |
|
|
|
ms |
Latência de envio P95. |
|
|
|
ms |
Latência de envio P99. |
|
Métricas do consumidor
|
Nome da métrica |
Unidade |
Descrição |
Rótulos |
|
|
contagem |
Chamadas de API para consumo de mensagens. |
|
|
|
contagem |
Chamadas de API para devolver mensagens com falha no consumo. |
|
|
|
mensagens |
Mensagens devolvidas pelos consumidores após falha no consumo. |
|
|
|
mensagens |
Número de mensagens consumidas. |
|
|
|
bytes |
Tamanho das mensagens consumidas, acumulado durante um minuto. |
|
|
|
mensagens |
Atraso do consumidor: mensagens prontas mais mensagens em trânsito. |
|
|
|
mensagens |
Mensagens prontas. Calculado como |
|
|
|
mensagens |
Mensagens em trânsito. Calculado como |
|
|
|
ms |
Tempo de fila da mensagem. |
|
|
|
ms |
Tempo médio de espera local do consumidor. |
|
|
|
ms |
Tempo mínimo de espera local do consumidor. |
|
|
|
ms |
Tempo máximo de espera local do consumidor. |
|
|
|
ms |
Tempo de espera local do consumidor P95. |
|
|
|
ms |
Tempo de espera local do consumidor P99. |
|
|
|
ms |
Latência média de processamento de mensagens. |
|
|
|
ms |
Latência mínima de processamento de mensagens. |
|
|
|
ms |
Latência máxima de processamento de mensagens. |
|
|
|
ms |
Latência de processamento de mensagens P95. |
|
|
|
ms |
Latência de processamento de mensagens P99. |
|
|
|
% |
Taxa de sucesso no consumo. |
|
|
|
contagem |
Chamadas de API de consumo com falha. |
|
|
|
mensagens |
Mensagens enviadas para a fila de mensagens mortas (DLQ). |
|
Perguntas frequentes
Como obtenho dados brutos de métricas do dashboard?
As métricas do dashboard são armazenadas no ARMS Managed Service for Prometheus. Para acessar os dados brutos:
Faça login no console do ARMS com sua conta Alibaba Cloud.
No painel de navegação à esquerda, clique em Integration Center.
Pesquise por
RocketMQe selecione Alibaba Cloud RocketMQ (4.0) Service. Para detalhes de configuração, consulte Integrar dados de monitoramento de um serviço Alibaba Cloud.Após a conclusão da integração, clique em Provisioning no painel de navegação à esquerda.
Na lista Cloud Service Area Environment, clique em nome do ambiente desejado.
Na aba Component Management, na seção Basic Information, clique em link da região correspondente à Prometheus Instance.
Na aba Settings, localize os métodos de acesso a dados disponíveis.
Como integro as métricas do dashboard a um sistema Grafana autogerenciado?
Conclua as etapas de integração descritas em Como obtenho métricas no dashboard? para conectar os dados de monitoramento do ApsaraMQ for RocketMQ ao Managed Service for Prometheus. Em seguida, obtenha a URL da API HTTP nas configurações do ambiente e use-a para conectar sua instância do Grafana autogerenciada. Para mais detalhes, consulte Usar uma URL de API HTTP para conectar uma instância do Prometheus a um sistema Grafana autogerenciado.
Como são calculados o TPS médio e o TPS máximo?
TPS médio = Total de requisições em um minuto / 60 segundos
TPS máximo = Maior valor entre 60 amostras de TPS por segundo coletadas dentro de um minuto
Exemplo: Uma instância produz 60 mensagens normais de 4 KB em um minuto.
TPS médio = 60 chamadas / 60 s = 1 chamada/s
Se todas as 60 mensagens forem enviadas no primeiro segundo, os valores de TPS por segundo serão 60, 0, 0, ..., 0. TPS máximo = 60 chamadas/s.
Se 40 mensagens forem enviadas no primeiro segundo e 20 no segundo seguinte, os valores serão 40, 20, 0, ..., 0. TPS máximo = 40 chamadas/s.