Todos os produtos
Search
Central de documentação

ApsaraMQ for RocketMQ:Melhores práticas para tratamento de falhas com base no recurso de observabilidade

Última atualização: Jun 27, 2026

O ApsaraMQ for RocketMQ oferece os recursos de painel e de monitoramento e alerta. Use esses recursos para monitorar o status do broker e métricas importantes em cada etapa da troca de mensagens. Configure também regras de alerta para métricas críticas e receba relatórios de exceção o mais rápido possível. Este tópico descreve como usar os recursos de painel e de monitoramento e alerta do ApsaraMQ for RocketMQ para gerenciar falhas no ApsaraMQ for RocketMQ. Essas funcionalidades fornecem soluções para suas rotinas de O&M e solução de problemas.

Implementação

Problemas principais

Os itens a seguir descrevem os problemas principais na solução de problemas:

  • Como enviar alertas e relatar exceções de serviço.

  • Como localizar exceções rapidamente.

Soluções

Indicadores como métricas e rastreamentos fornecidos pelo ApsaraMQ for RocketMQ incluem informações de status em cada etapa da troca de mensagens e o throughput dos brokers e recursos do ApsaraMQ for RocketMQ. As métricas dividem-se amplamente nas seguintes categorias:

  • Métricas de nível 1: Recomendamos usar métricas que medem a operação do seu negócio como métricas de nível 1. Exceções nessas métricas indicam problemas no sistema de negócios. Na maioria dos casos, use-as como métricas de monitoramento e alerta.

    Por exemplo, se o throttling da instância for acionado porque as transações de mensagens por segundo (TPS) excederem o limite da especificação, use o TPS como métrica de monitoramento e crie uma regra de alerta para evitar eficazmente que a instância sofra throttling.

  • Métricas de nível 2: Recomendamos usar métricas adequadas para localizar falhas como métricas de nível 2.

    Por exemplo, mensagens acumuladas indicam falhas durante o consumo. As taxas de sucesso no envio de mensagens indicam se ocorreram exceções durante o envio.

  • Métricas de nível 3: Use essas métricas para analisar detalhadamente as métricas de nível 2. Elas ajudam a identificar as causas das alterações nas métricas de nível 2.

Solução para exceções de consumo

消费异常

  1. Use a métrica ConsumerLagLatencyPerGidTopic, que indica o tempo de atraso no processamento de mensagens, como métrica de monitoramento e crie uma regra de alerta. Para obter mais informações, consulte Monitoramento e alerta.

    Essa métrica indica o status de integridade do sistema de consumo e pode afetar o nível de impacto nos negócios. Ela fornece mais informações do que apenas o número de mensagens acumuladas.

    • Se o volume de mensagens for baixo, o número de mensagens acumuladas pode não acionar alertas mesmo que ocorram problemas.

    • Se o volume de mensagens for alto, o número de mensagens acumuladas pode gerar falsos alertas.

    • Se o volume de mensagens oscilar muito, não será possível configurar com precisão o limiar de alerta para acúmulo de mensagens.

  2. Verifique se a métrica rocketmq_process_time, que indica o tempo consumido no processamento de mensagens, e a métrica rocketmq_process_time_count{invocation_status="success"/invocation_status="success | failure"}, que indica a taxa de sucesso no processamento de mensagens, estão normais. Isso ajuda a verificar se a exceção ocorreu no cliente consumidor.

    A taxa de sucesso no processamento de mensagens é calculada pela seguinte fórmula: Taxa de sucesso no processamento de mensagens = Número de vezes que as mensagens foram processadas com sucesso / (Número de vezes que as mensagens falharam no processamento + Número de vezes que as mensagens foram processadas com sucesso).

    Acesse a página Dashboard no console do ApsaraMQ for RocketMQ para visualizar as estatísticas das métricas anteriores. Para obter informações sobre o painel, consulte Dashboard.

  3. Identifique a causa específica com base na lógica de negócios ou na tendência de alteração das métricas. Por exemplo, se a duração do processamento de mensagens aumentar, verifique se a memória e a CPU do serviço consumidor estão sobrecarregadas. Alternativamente, verifique o status de execução da lógica de negócios downstream da qual a lógica de consumo depende para uma análise mais aprofundada.

Solução para exceções de produção

生产异常

  1. Verifique se a métrica rocketmq_send_cost_time_count{invocation_status="success"/invocation_status="success | failure"}, que indica a taxa de sucesso no envio de mensagens, está normal. A taxa é calculada pela seguinte fórmula: Taxa de sucesso no envio de mensagens = Número de vezes que as mensagens foram enviadas com sucesso / (Número de vezes que as mensagens falharam no envio + Número de vezes que as mensagens foram enviadas com sucesso).

    Acesse a página Dashboard no console do ApsaraMQ for RocketMQ para visualizar as estatísticas da métrica anterior. Para obter informações sobre o painel, consulte Dashboard.

  2. Verifique se a rede está normal ou se uma falha de transmissão de curto prazo foi causada pela reinicialização do broker.