Todos os produtos
Search
Central de documentação

ApsaraMQ for RocketMQ:Configure o monitoramento e os alertas de mensagens

Última atualização: Jun 27, 2026

ApsaraMQ for RocketMQ permite configurar regras de alerta por meio do CloudMonitor para monitorar o status de execução e as principais métricas de negócios das suas instâncias em tempo real. Assim, você recebe notificações oportunas sobre exceções e habilita avisos antecipados de riscos para seu ambiente de produção.

Informações básicas

ApsaraMQ for RocketMQ é um serviço de mensagens totalmente gerenciado. Cada especificação de instância inclui um Acordo de Nível de Serviço (SLA) claro. Após adquirir uma instância, o desempenho dela em métricas como TPS de mensagens, armazenamento de mensagens e throughput de rede é garantido conforme as especificações contratadas.

Não é necessário se preocupar com o desempenho da instância. No entanto, em ambientes de produção, monitore se o consumo real e a escala do seu negócio estão se aproximando dos limites de especificação da instância. O ApsaraMQ for RocketMQ, em conjunto com o CloudMonitor, oferece um serviço gratuito e pronto para uso de monitoramento e alertas que resolve os seguintes problemas:

  • Aviso antecipado para marcas d'água de especificação da instância

    Se o uso de recursos exceder os limites de especificação da instância, o ApsaraMQ for RocketMQ aplica limitação de taxa (throttling). Ao configurar alertas para marcas d'água de especificação com antecedência, você detecta precocemente o risco de ultrapassar os limites e atualiza rapidamente as configurações da instância, evitando falhas nos negócios causadas pela limitação de taxa.

  • Aviso antecipado para erros de lógica de negócios

    Erros podem ocorrer durante o envio e o recebimento de mensagens. Configurar alertas para erros de invocação permite detectar exceções antes que sua aplicação as reporte. Isso ajuda a identificar a origem do erro e corrigi-lo prontamente.

  • Aviso antecipado para métricas de desempenho de negócios

    Caso seu pipeline de mensagens tenha requisitos específicos de desempenho, como tempo de resposta (RT) ou latência de mensagens, configurar alertas para essas métricas ajuda a gerenciar proativamente os riscos operacionais.

Princípios de configuração de alertas

O ApsaraMQ for RocketMQ fornece um conjunto abrangente de métricas e itens de alerta. Esses itens dividem-se em três categorias: marcas d'água de operação, desempenho de mensagens e eventos de exceção.

Com base na vasta experiência com ambientes de produção, recomendamos configurar os seguintes alertas:

Nota

Os itens essenciais de monitoramento listados abaixo são recomendações básicas. O ApsaraMQ for RocketMQ disponibiliza um conjunto completo de métricas de monitoramento. Configure alertas mais granulares e abrangentes conforme as necessidades do seu negócio. Para obter mais informações, consulte Monitoramento e Alertas.

Categoria de alerta

Principais itens de alerta

Quando configurar

Função alvo

Marcas d'água de recursos da instância e métricas de consumo

  • Taxa de chamadas de API de envio da instância

  • Taxa de chamadas de API de recebimento da instância

  • Consumo de largura de banda de saída para a Internet

  • Momento ideal: Imediatamente após a criação da instância.

  • Motivo: O consumo no nível da instância independe de tópicos ou grupos de consumidores específicos. Monitore o uso geral para garantir que permaneça dentro dos limites.

Engenheiros de O&M de recursos

Métricas de desempenho de mensagens

  • TPS de envio do tópico

  • TPS de consumo do grupo de consumidores

  • Acúmulo de mensagens por grupo de consumidores

  • Tempo de atraso de consumo por grupo de consumidores

  • Momento ideal: Logo após a entrada em produção do seu negócio.

  • Motivo: É necessário estabelecer avisos antecipados para a tolerância de desempenho de mensagens de cada novo serviço.

  • Engenheiros de O&M de recursos

  • Desenvolvedores de negócios

Eventos de exceção de mensagens

  • Contagem de mensagens dead-letter

  • Contagem de eventos de limitação de taxa

  • Momento ideal: Logo após a entrada em produção do seu negócio.

  • Motivo: Avisos antecipados para cenários de falha facilitam a análise de problemas em produção.

  • Engenheiros de O&M de recursos

  • Desenvolvedores de negócios

Ponto de entrada para configuração de alertas

  1. Faça login no console do ApsaraMQ for RocketMQ e, no painel de navegação à esquerda, clique em Instances.

  2. Na barra de menu superior, selecione uma região, como China (Hangzhou) e, na lista de instâncias, clique no nome da instância desejada.

  3. No painel de navegação à esquerda, clique em Monitoring and Alerts e, em seguida, clique em Create Alert Rule.

Melhores práticas

Configure alertas de pico de TPS para chamadas de API da instância

  • Contexto: A especificação de uma instância do ApsaraMQ for RocketMQ 5.0 define um limite base de TPS para envio e recebimento de mensagens, correspondente à taxa de chamadas de API. Se o pico de TPS de chamadas de API da instância ultrapassar esse limite, ocorre limitação de taxa. Para mais detalhes sobre os limites base de TPS, consulte Cotas e limites.

  • Risco sem configuração: Sem este alerta, não há aviso prévio antes que a taxa de chamadas de API exceda o limite, o que causa falhas em algumas solicitações de envio e recebimento de mensagens assim que a limitação de taxa começa.

  • Momento recomendado: Configure este alerta após criar a instância e definir a proporção entre solicitações de envio e recebimento. Para ajustar essa proporção, siga estas etapas:

    1. Na página Instance Details, clique na aba Basic Information.

    2. Clique em Edit para abrir o painel Modify Configurations, onde é possível ajustar a proporção entre solicitações de envio e recebimento.

Chamadas de API de envio da instância

  • Limiar recomendado: Defina o limiar como 70% do limite de pico de TPS de envio da instância. Por exemplo, se o limite de pico de TPS de envio for 5.000, defina o limiar como 3.500.

    • Instâncias das edições Professional e Enterprise Platinum suportam TPS elástico para picos de tráfego. Caso ative esse recurso, defina o limiar como 70% do limite da especificação elástica (Pico de TPS de Envio + TPS Elástico de Envio).

    • Uma instância serverless possui elasticidade adaptativa. Defina o limiar como 70% do pico elástico de TPS de envio da instância.

    • Visualize o limite de pico de TPS de envio e o TPS elástico de envio de uma instância na página Instance Details no console.

  • Resposta: Ao receber um alerta sobre a taxa de chamadas de API de envio da instância, proceda da seguinte forma:

    1. Na página Instance Details, clique na aba Dashboard.

    2. Na seção Throttling-related Metrics, verifique a curva Production TPS MAX Value no gráfico Production TPS Watermark para identificar quando o limiar foi atingido.

    3. Na seção Instance Overview, examine o gráfico Rate of Messages Sent by Producer to Server (messages/min). Correlacione o momento em que o limiar foi atingido com a atividade dos tópicos para localizar a origem do tráfego anormal e analise a curva correspondente para determinar se a alteração no tráfego era esperada.

    4. Caso a variação de tráfego seja inesperada, entre em contato com a equipe de negócios para uma análise mais detalhada.

    5. Se a variação de tráfego for esperada, a especificação atual da instância é insuficiente. Atualize imediatamente as configurações da instância para ajustar a especificação de computação de mensagens.

Chamadas de API de recebimento da instância

  • Limiar recomendado: Defina o limiar como 70% do limite de pico de TPS de recebimento da instância. Por exemplo, se o limite de pico de TPS de recebimento for 5.000, defina o limiar como 3.500.

    • Instâncias das edições Professional e Enterprise Platinum suportam TPS elástico para picos de tráfego. Caso ative esse recurso, defina o limiar como 70% do limite da especificação elástica (Pico de TPS de Recebimento + TPS Elástico de Recebimento).

    • Uma instância serverless possui elasticidade adaptativa. Defina o limiar como 70% do pico elástico de TPS de recebimento da instância.

    • Visualize o limite de pico de TPS de recebimento e o TPS elástico de recebimento de uma instância na página Instance Details no console.

  • Resposta: Ao receber um alerta sobre a taxa de chamadas de API de recebimento da instância, proceda da seguinte forma:

    1. Na página Instance Details, clique na aba Dashboard.

    2. Na seção Throttling-related Metrics, verifique a curva Consumption TPS MAX Value no gráfico Consumption TPS Watermark para identificar quando o limiar foi atingido.

    3. Na seção Instance Overview, examine o gráfico Rate of Messages Delivered from Server to Consumer (messages/min). Correlacione o momento em que o limiar foi atingido com a atividade dos grupos de consumidores para localizar a origem do consumo anormal e analise a curva correspondente para determinar se a alteração no tráfego era esperada.

    4. Caso a variação de tráfego seja inesperada, entre em contato com a equipe de negócios para uma análise mais detalhada.

    5. Se a variação de tráfego for esperada, a especificação atual da instância é insuficiente. Atualize imediatamente as configurações da instância para ajustar a especificação de computação de mensagens.

Configure alertas para mensagens por minuto

  • Contexto: O ApsaraMQ for RocketMQ permite monitorar o TPS de envio e recebimento de mensagens nos níveis de tópico e grupo de consumidores. Ao configurar alertas para essas métricas, monitore proativamente o volume de tráfego de serviços específicos.

  • Risco sem configuração: O TPS de envio e recebimento de mensagens de um tópico reflete a frequência de chamadas do negócio. Sem este alerta, uma queda repentina para zero ou um pico inesperado de tráfego pode passar despercebido, gerando riscos potenciais aos negócios.

  • Momento recomendado: Configure este alerta após a entrada em produção do seu negócio e a estabilização do tráfego.

Mensagens enviadas pelos produtores

  • Limiar recomendado: Estime o limiar de alerta com base no tráfego real observado durante o período estável após a entrada em produção do seu negócio.

  • Resposta: Ao receber um alerta de TPS de envio de mensagens, siga estas etapas:

    1. Na página Topics, clique no nome do tópico especificado na regra de alerta.

    2. Na página Topic Details, clique na aba Dashboard.

    3. Verifique a curva Production no gráfico Message Volume (messages/min). Com base no seu modelo de negócios, determine se a flutuação da curva é razoável e analise quaisquer anomalias.

Mensagens recebidas pelos consumidores

  • Limiar recomendado: Estime o limiar de alerta com base no tráfego real observado durante o período estável após a entrada em produção do seu negócio.

  • Resposta: Ao receber um alerta de TPS de recebimento de mensagens, siga estas etapas:

    1. Na página Groups, clique no ID do grupo de consumidores especificado na regra de alerta.

    2. Na página Group Details, clique na aba Dashboard.

    3. Verifique a curva Consumption Rate (messages/min) no gráfico Message Production and Consumption Rate Trend (messages/min). Com base no seu modelo de negócios, determine se a flutuação da curva é razoável e analise quaisquer anomalias.

Configure alertas para largura de banda de saída para a Internet

  • Contexto: As instâncias da série 5.0 do ApsaraMQ for RocketMQ suportam acesso à Internet, mas esse acesso é limitado pela largura de banda de saída para a Internet. Exceder o limite de largura de banda da sua especificação prejudica o acesso à Internet.

  • Risco sem configuração: Sem este alerta, você não será avisado se o tráfego de Internet da instância exceder o limite de largura de banda, o que pode resultar em perda de pacotes, timeouts nas chamadas do cliente ou falhas.

  • Momento recomendado: Configure este alerta após criar uma instância não serverless e ativar o acesso à Internet.

    Nota

    Uma instância serverless suporta largura de banda elástica, portanto, não é necessário configurar este alerta.

  • Limiar recomendado: Defina o limiar como 35% do limite da sua especificação. Recomendamos esse valor porque o objetivo é alertar a 70% do limite, e a ferramenta de monitoramento coleta dados que representam cerca de 50% do tráfego real (70% × 50% = 35%). Por exemplo, se você adquiriu uma instância com largura de banda de 1 Mbit/s, o limiar de alerta recomendado é 43.750 B/s. Encontre as informações de largura de banda de Internet da sua instância na seção Running Information da aba Basic Information na página Instance Details.

    Nota

    Ao estimar o limiar, converta Mbit/s para B/s antes de calcular. Por exemplo: 1 Mbit/s = 1×10^6 bits/s = (1×10^6)/8 B/s = 125.000 B/s. O limiar recomendado é 125,000 B/s × 0.7 × 0.5 = 43,750 B/s.

  • Resposta: Ao receber um alerta sobre largura de banda de saída para a Internet, siga estas etapas:

    1. Na página Instance Details, clique na aba Dashboard.

    2. Na seção Billing Metrics Overview, verifique a curva Outbound Bandwidth no gráfico Internet Outbound Traffic Bandwidth para identificar quando o limiar foi atingido. Certifique-se de que as unidades no gráfico correspondam às unidades do seu limiar de alerta.

    3. Na seção Instance Overview, examine os gráficos Rate of Messages Sent by Producer to Server (messages/min) e Rate of Messages Delivered from Server to Consumer (messages/min). Correlacione o momento em que o limiar foi atingido para encontrar o tópico ou grupo de consumidores com dados anormais e analise a curva para determinar se a alteração no tráfego era esperada.

    4. Caso a variação de tráfego seja inesperada, entre em contato com a equipe de negócios para uma análise mais detalhada.

    5. Se a variação de tráfego for esperada, a especificação atual da instância é insuficiente. Atualize imediatamente as configurações da instância para ajustar a especificação de largura de banda de saída para a Internet.

Configure alertas para acúmulo de mensagens

Nota

As estatísticas de acúmulo de mensagens podem apresentar flutuações e imprecisões. Não recomendamos definir um limiar de alerta para um acúmulo de poucas dezenas de mensagens. Se o seu negócio for altamente sensível até mesmo a pequenos atrasos, monitore o tempo de atraso de consumo.

  • Contexto: O ApsaraMQ for RocketMQ permite monitorar o acúmulo de mensagens no nível do grupo de consumidores, o que pode alertá-lo sobre cenários de atraso no consumo downstream.

  • Risco sem configuração: Embora o acúmulo de mensagens seja um recurso padrão do ApsaraMQ for RocketMQ, para processamento em tempo real, é essencial monitorar e controlar o volume de mensagens não processadas para evitar impactos nos negócios decorrentes de atrasos no consumo.

  • Momento recomendado: Configure este alerta após a entrada em produção do seu negócio e a estabilização do tráfego.

  • Limiar recomendado: Estime o limiar de alerta com base na tolerância do seu negócio após a entrada em produção.

  • Resposta: Ao receber um alerta de acúmulo de mensagens, siga estas etapas:

    1. Na página Groups, clique no ID do grupo de consumidores especificado na regra de alerta.

    2. Na página Group Details, clique na aba Dashboard.

    3. Verifique a curva Accumulated Messages no gráfico Accumulation-related Metrics. Analise a tendência do acúmulo para identificar quando ele começou.

    4. Com base nas alterações de negócios e nos logs da aplicação, analise os fatores no momento inicial do acúmulo para encontrar a causa. Para obter mais informações sobre os princípios de consumo de mensagens, consulte Tipos de consumidor.

    5. Dependendo da causa, decida se deve escalar horizontalmente a aplicação consumidora ou corrigir defeitos na lógica de consumo.

Configure alertas para tempo de atraso de consumo

Nota

O tempo de atraso de consumo é calculado com base na mensagem mais antiga entre todas as mensagens não consumidas no grupo de consumidores atual, tornando-o uma métrica cumulativa e sensível. Ao receber um alerta de tempo de atraso de consumo, determine primeiro se o atraso é causado por algumas mensagens travadas ou por um atraso global no consumo.

  • Contexto: O ApsaraMQ for RocketMQ permite monitorar o tempo de atraso de consumo no nível do grupo de consumidores, fornecendo uma métrica mais específica para analisar cenários de atraso no consumo.

  • Risco sem configuração: Embora o acúmulo de mensagens seja um recurso padrão do ApsaraMQ for RocketMQ, para processamento em tempo real, é essencial monitorar e controlar o atraso das mensagens acumuladas para evitar impactos nos negócios decorrentes de atrasos no consumo.

  • Momento recomendado: Configure este alerta após a entrada em produção do seu negócio e a estabilização do tráfego.

  • Limiar recomendado: Estime o limiar de alerta com base na tolerância do seu negócio após a entrada em produção.

  • Resposta: Ao receber um alerta de tempo de atraso de consumo, siga estas etapas:

    1. Na página Groups, clique no ID do grupo de consumidores especificado na regra de alerta.

    2. Na página Group Details, clique na aba Dashboard.

    3. Verifique a curva Accumulated Messages no gráfico Accumulation-related Metrics. Analise a tendência do acúmulo para identificar quando ele começou.

    4. Com base nas alterações de negócios e nos logs da aplicação, analise os fatores no momento inicial do acúmulo para encontrar a causa. Para obter mais informações sobre os princípios de consumo de mensagens, consulte Tipos de consumidor.

    5. Dependendo da causa, decida se deve escalar horizontalmente a aplicação consumidora ou corrigir defeitos na lógica de consumo.

Configure alertas para eventos de limitação de taxa

  • Contexto: O ApsaraMQ for RocketMQ monitora eventos de limitação de taxa para uma instância específica. Ao monitorar o número de eventos de limitação de taxa, você compreende o impacto no seu negócio atual.

  • Risco sem configuração: Um alto número de eventos de limitação de taxa indica que as especificações da instância foram significativamente excedidas. Atualize prontamente as configurações da instância.

  • Momento recomendado: Após a entrada em produção do seu negócio e a estabilização do tráfego.

    • Contagem de limitação de taxa no nível da instância: Configure alertas após a criação da instância.

    • Contagem de limitação de taxa nos níveis de tópico e grupo: Configure alertas após a entrada em produção do seu negócio e a estabilização do tráfego.

  • Limiar recomendado: Estime o limiar de alerta com base na tolerância do seu negócio após a entrada em produção.

  • Resposta: Ao receber um alerta de eventos de limitação de taxa, siga estas etapas:

    1. Na página Instance Details, clique na aba Dashboard.

    2. Na seção Throttling-related Metrics, verifique o gráfico Throttled Request Distribution (Production) para analisar o momento e os padrões dos eventos de limitação de taxa.

    3. Na seção Instance Overview, revise a métrica Rate of Messages Sent by Producer to Server (messages/min). Com base no momento dos eventos de limitação de taxa, identifique o tópico com dados anormais e verifique sua curva para determinar se o aumento de tráfego era esperado.

    4. Com base nessa análise, se o aumento de tráfego for esperado, atualize as configurações da instância. Se não for esperado, investigue a origem do tráfego anormal.