O Microservices Engine (MSE) oferece regras de alerta integradas que monitoram a utilização de CPU, o uso de memória, o desempenho da coleta de lixo (GC) e os limites de capacidade nas instâncias do MSE. Ative essas regras para notificar um grupo de contatos sempre que uma métrica ultrapassar o limiar definido. Assim, você detecta e resolve problemas antes que afetem o tráfego de produção.
Pré-requisitos
Antes de começar, verifique se você tem:
Uma instância do MSE (Microservices Registry, Nacos, ZooKeeper ou Ingress gateway)
Pelo menos um grupo de contatos de alerta
Ativar regras de alerta padrão
Faça login no console do MSE e selecione uma região na barra de navegação superior.
No painel de navegação à esquerda, escolha Microservices Registry > Instances.
Na página Instances, localize a instância desejada e escolha More > Configure Default Alert na coluna Actions.
Na caixa de diálogo Configure Default Alert, selecione um grupo em Alert Contact Group e clique em OK.
Após clicar em OK, o MSE adiciona as regras de alerta padrão ao grupo de contatos selecionado. As regras variam conforme o tipo e a edição da instância. Consulte as seções a seguir para obter detalhes.
Regras de alerta padrão
Microservices Registry
Aplica-se a instâncias das edições Basic, Developer e Professional.
|
Regra de alerta |
Limiar |
Período |
Descrição |
Solução |
|
Carga de CPU excessivamente alta nas instâncias |
Utilização de CPU > 80% por nó |
Contínuo |
O alto uso de CPU pode indicar defeitos na versão ou capacidade insuficiente. |
1. Verifique a página Risk Management e siga as correções sugeridas. 2. Se o alerta persistir, escale horizontalmente a instância. |
|
Uso de memória excessivamente alto nas instâncias |
Uso de memória > 90% por nó |
Contínuo |
O uso elevado de memória pode causar erros de Out-of-Memory (OOM) e interrupção do serviço. |
1. Acesse a página Risk Management e aplique as correções recomendadas. 2. Caso o alerta continue, escale horizontalmente a instância. |
ZooKeeper
Basic Edition, Developer Edition e Professional Edition
|
Regra de alerta |
Limiar |
Período |
Descrição |
Solução |
|
Ocorrências excessivas de CMS GC em instâncias ZooKeeper |
Contagem de Concurrent Mark Sweep (CMS) GC > 5 |
1 minuto |
Ciclos frequentes de CMS GC indicam pressão de memória ou capacidade insuficiente da instância. |
1. Escale horizontalmente a instância. 2. Se o alerta persistir, verifique se a versão da instância tem defeitos conhecidos e atualize-a se necessário. |
|
Duração excessivamente longa do CMS GC em instâncias ZooKeeper |
Duração do CMS GC > 6 s |
1 minuto |
Pausas longas de GC podem causar timeouts de requisição e desconexões de sessão. |
1. Escale horizontalmente a instância. 2. Caso o problema continue, confirme se há defeitos conhecidos na versão da instância e atualize-a quando aplicável. |
Serverless Edition
| Regra de alerta | Limiar | Período | Descrição | Solução |
|---|---|---|---|---|
| Limitação de snapshot | Tamanho do snapshot > 20 MB (limite: 25 MB) | Contínuo | O tamanho máximo do snapshot é 25 MB. Ultrapassar 20 MB significa que a instância está se aproximando do limite. | Reduza os dados armazenados no ZooKeeper. Se precisar de um limite maior, abra um ticket. |
Nacos
Basic Edition, Developer Edition e Professional Edition
Estas regras detectam problemas de desempenho de GC que indicam memória heap insuficiente.
|
Regra de alerta |
Limiar |
Período |
Descrição |
Solução |
|
Ocorrências excessivas de Full GC em instâncias Nacos |
Contagem de Full GC > 2 |
1 minuto |
Execuções frequentes de Full GC indicam memória heap insuficiente ou configurações incorretas no lado do cliente. |
1. Verifique se há vazamentos de conexão, registros duplicados ou assinaturas duplicadas causados por configuração incorreta do cliente. 2. Na ausência desses problemas, escale horizontalmente ou atualize a instância. |
|
Duração excessivamente longa do Full GC em instâncias Nacos |
Duração do Full GC > 5 s |
1 minuto |
Pausas longas de Full GC bloqueiam todas as threads da aplicação e causam falhas nas requisições. |
1. Analise possíveis vazamentos de conexão, registros duplicados ou assinaturas redundantes devido a erros de configuração do cliente. 2. Se não houver tais problemas, escale horizontalmente ou atualize a instância. |
Basic Edition, Developer Edition, Professional Edition e Serverless Edition
Esses alertas de capacidade são acionados quando o uso de recursos se aproxima do limite da instância.
|
Regra de alerta |
Limiar |
Período |
Descrição |
Solução |
|
Uso de serviços do Nacos excessivamente alto |
Uso de serviços > 90% |
Contínuo |
O número de serviços registrados está se aproximando da cota da instância. |
Escale horizontalmente ou atualize a instância para aumentar a cota de serviços. |
|
Uso de provedores de serviço do Nacos excessivamente alto |
Uso de provedores de serviço > 90% |
Contínuo |
A quantidade de provedores de serviço está próxima da cota da instância. |
Escale horizontalmente ou atualize a instância para ampliar a cota de provedores. |
|
Uso de conexões do Nacos excessivamente alto |
Uso de conexões > 90% |
Contínuo |
O total de conexões está atingindo o limite da cota da instância. |
Escale horizontalmente ou atualize a instância para elevar a cota de conexões. |
|
Uso de configurações do Nacos excessivamente alto |
Uso de configurações > 90% |
Contínuo |
O volume de configurações está se aproximando da cota da instância. |
Escale horizontalmente ou atualize a instância para expandir a cota de configurações. |
|
Uso de long polling do Nacos excessivamente alto |
Uso de long polling > 90% |
Contínuo |
O número de conexões de long polling está próximo do limite da instância. |
Escale horizontalmente ou atualize a instância para aumentar a cota de long polling. |
|
Redução excessiva na proporção de provedores de serviço do Nacos |
Queda na contagem de provedores > 50% em relação a 3 min atrás |
3 minutos |
Uma queda abrupta na contagem de provedores pode fazer com que serviços upstream percam a conectividade com provedores downstream. |
1. Verifique se aplicações estão sendo liberadas ou reiniciadas. 2. Se nenhuma implantação estiver em andamento, confirme se os recursos de CPU, memória, GC e rede das suas aplicações estão saudáveis. |
Serverless Edition
| Regra de alerta | Limiar | Período | Descrição | Solução |
|---|---|---|---|---|
| Limitação de TPS | Limitação de TPS acionada | Contínuo | A limitação de transações por segundo (TPS) foi ativada na instância. | Abra um ticket para solicitar um limite de TPS mais alto. |
| Limite de capacidade de serviço | Capacidade de serviço excedida | Contínuo | O número de serviços ultrapassa o limite da instância. | Abra um ticket para solicitar uma capacidade de serviço maior. |
| Limite de conexões | Contagem de conexões excedida | Contínuo | O número de conexões ultrapassa o limite da instância. | Abra um ticket para solicitar um limite de conexões maior. |
| Limite de capacidade de configuração | Capacidade de configuração excedida | Contínuo | O número de configurações ultrapassa o limite da instância. | Abra um ticket para solicitar uma capacidade de configuração maior. |
Ingress gateway
Professional Edition
|
Regra de alerta |
Limiar |
Período |
Descrição |
Solução |
|
Carga de CPU excessivamente alta nas instâncias |
Utilização de CPU > 80% |
Contínuo |
O alto uso de CPU pode indicar problemas em plug-ins ou capacidade insuficiente. |
1. Verifique se há vazamentos de memória ou erros de lógica nos plug-ins. 2. Na ausência desses problemas, escale horizontalmente a instância. |
|
Uso de memória excessivamente alto nas instâncias |
Uso de memória > 80% |
Contínuo |
O consumo elevado de memória pode apontar falhas em plug-ins ou capacidade inadequada. |
1. Analise os plug-ins em busca de vazamentos de memória ou erros lógicos. 2. Se não houver problemas, escale horizontalmente a instância. |
Professional Edition e Serverless Edition
|
Regra de alerta |
Limiar |
Período |
Descrição |
Solução |
|
Taxa de precisão do gateway baixa |
Taxa de precisão < 80% |
Contínuo |
Uma taxa de precisão baixa indica que uma parcela significativa das requisições está falhando. |
Verifique se há erros de configuração no gateway ou exceções no nível da aplicação. |
|
Exceção em plug-in personalizado do gateway (Recuperado) |
Exceção de plug-in detectada |
Contínuo |
Um plug-in personalizado do gateway encontrou um erro e foi recuperado automaticamente. |
Revise a lógica do plug-in e corrija a causa raiz para evitar reincidência. |