Todos os produtos
Search
Central de documentação

Microservices Engine:Configurar proteção do sistema

Última atualização: Aug 25, 2026

A proteção do sistema oferece defesa de tráfego no nível do nó para diversas situações inesperadas. Por exemplo, quando uma interface sem regra de proteção de tráfego configurada enfrenta um pico repentino, a proteção do sistema atua como uma rede de segurança para garantir a estabilidade da sua aplicação.

Para entender a relação entre proteção do sistema e proteção de tráfego, consulte Proteção do sistema vs. proteção de tráfego.

Recursos de proteção

O Microservices Governance disponibiliza os seguintes recursos de proteção do sistema para tráfego no lado do servidor e no lado do cliente. Utilize a métrica de gatilho e as características de carga da sua aplicação para decidir quais recursos configurar.

Recurso

Métrica de gatilho

Aplica-se a

Versão mínima do agente

Proteção adaptativa contra sobrecarga

Utilização de CPU

Todas as interfaces do lado do servidor

3.1.4 ou posterior

Limitação de QPS total

QPS total de um nó

Todas as interfaces do lado do servidor

4.2.0 ou posterior

Limitação de concorrência total

Concorrência total de um nó

Todas as interfaces do lado do servidor

4.2.0 ou posterior

Circuit breaking de chamadas anormais

Taxa de erro de uma interface

Todas as interfaces do lado do cliente, exceto interfaces com regras de circuit breaking no nível da interface configuradas

4.2.0 ou posterior

Circuit breaking de chamadas lentas

Taxa de chamadas lentas de uma interface

Todas as interfaces do lado do cliente, exceto interfaces com regras de circuit breaking no nível da interface configuradas

4.2.0 ou posterior

Limites

Antes de configurar a proteção do sistema, observe os seguintes limites:

  • Precedência — A proteção adaptativa contra sobrecarga, a limitação de QPS total e a limitação de concorrência total têm prioridade menor que as regras de proteção de tráfego.

  • Código de status de resposta — Quando a limitação é acionada, a proteção do sistema retorna o código de status 429. Não há suporte para códigos de status personalizados.

Pré-requisitos

Procedimento

  1. Faça login no MSE console e selecione uma região na barra de navegação superior.

  2. No painel de navegação à esquerda, escolha Microservices Governance > Application Governance.

  3. Na página Application list, clique em cartão de recurso da aplicação desejada. No painel de navegação à esquerda, clique em Traffic management.

  4. Clique em aba System protection. Para cada recurso que desejar utilizar, defina o Mode e configure os limiares descritos na seção correspondente deste tópico.

Para confirmar se um recurso protege o tráfego conforme esperado, verifique a lista de eventos no lado esquerdo da aba System protection e o gráfico de tendências no lado direito. Para impedir que um recurso limite o tráfego, defina seu Mode para a opção desativada.

Proteção adaptativa contra sobrecarga

Como funciona

A proteção adaptativa contra sobrecarga utiliza a utilização de CPU para medir a carga do sistema e ajusta adaptativamente a taxa de limitação do tráfego no lado do servidor. Mesmo durante picos de tráfego inesperados, ela mantém a utilização de CPU relativamente estável dentro do limiar configurado.

Cenários

Este recurso fornece proteção de fallback baseada em CPU para interfaces do lado do servidor. É indicado para aplicações com uso intensivo de CPU, nas quais um pico em uma interface inesperada eleva a utilização de CPU do sistema e afeta o tempo de resposta (RT) das interfaces principais.

Console

A aba System protection lista os eventos de proteção adaptativa contra sobrecarga no lado esquerdo. O lado direito exibe a tendência média de utilização de CPU dos nós da aplicação nos últimos 5 minutos.

O topo da página contém a configuração de Mode para a proteção adaptativa contra sobrecarga. No gráfico de linhas de utilização de CPU à direita, uma linha tracejada azul marca o protection threshold, que representa o limiar de proteção.

Os eventos são reportados no nível do nó com base nas mudanças de estado do algoritmo. Eles incluem eventos de início de limitação, limitação em andamento e fim de limitação.

Clique em link View na coluna Actions de um evento para consultar os dados de utilização de CPU do endereço IP do nó correspondente. A linha do tempo retrocede para o momento em que o evento foi reportado, permitindo observar a utilização de CPU e a probabilidade de limitação do nó quando o evento foi acionado.

ParâmetroDescrição
Mode
  • Close: A proteção adaptativa contra sobrecarga está desativada.

  • Simulated Execution: Quando a proteção adaptativa contra sobrecarga é acionada, o sistema gera os eventos correspondentes, mas não ajusta efetivamente a política de proteção de tráfego.

  • Enabled: Ao ser acionada a proteção adaptativa contra sobrecarga, o sistema ajusta a política de proteção de tráfego e limita uma porcentagem de todo o tráfego de entrada.

CPU utilizationO limiar esperado de utilização de CPU. A proteção adaptativa contra sobrecarga combina a utilização real de CPU do sistema com o limiar configurado e usa um algoritmo para ajustar adaptativamente a probabilidade de limitação das interfaces. Sob carga pesada, o sistema rejeita uma parte das requisições para manter a utilização de CPU oscilando dentro de uma pequena faixa em torno do limiar configurado. A utilização de CPU em estado estacionário varia conforme o negócio de cada aplicação. Determine a utilização máxima de CPU em estado estacionário por meio de testes de estresse ou dados históricos e adicione uma margem a esse valor.
ExceptionsPara mais informações, consulte Configurar exceções.

Limitação de QPS total

Como funciona

A limitação de QPS total monitora o QPS total no nível do nó, que corresponde à soma do QPS de todas as interfaces do lado do servidor em um único nó, e limita as requisições que excedem o limiar.

Cenários

Nem todos os sistemas dependem fortemente de CPU. Algumas aplicações sofrem degradação de desempenho mesmo com baixa carga de CPU devido a restrições de memória, rede ou outros fatores. A limitação de QPS total restringe o tráfego com base no QPS total de um nó, oferecendo um método de proteção baseado em tráfego.

Utilize este recurso quando um pico em uma interface inesperada causar contenção por recursos escassos, afetando as interfaces principais.

Console

A aba System protection lista os eventos de limitação de QPS total no lado esquerdo. O lado direito mostra a tendência dos dados médios de requisição de QPS total dos nós da aplicação nos últimos 5 minutos.

O gráfico de linhas à direita exibe as curvas de tendência de Total QPS, Passed QPS e Blocked QPS, juntamente com a linha de referência do limiar, facilitando a observação do efeito de limitação.

Os eventos são reportados nos níveis de nó e interface com base nos nós e interfaces onde a limitação de QPS total realmente ocorreu. Os relatórios são gerados a cada 5 minutos e cobrem a limitação ocorrida nos 5 minutos anteriores.

Clique em link View na coluna Actions de um evento para consultar o QPS total do endereço IP do nó correspondente. A linha do tempo retrocede para um ponto próximo ao momento em que o evento foi reportado, permitindo verificar se o QPS total do nó e o comportamento de limitação atendem às suas expectativas. As páginas de detalhes da interface e do nó fornecem informações mais granulares, como dados nos níveis de interface e nó.

ParâmetroDescrição
Mode
  • Disabled: A limitação de QPS total está desativada.

  • Enabled: Requisições que excedem o limiar são limitadas.

Total QPS thresholdO limiar de QPS total no nível do nó. Determine o QPS total em estado estacionário de um nó por meio de testes de estresse ou dados históricos e adicione uma margem a esse valor.
ExceptionsPara mais informações, consulte Configurar exceções.

Limitação de concorrência total

Como funciona

A limitação de concorrência total rastreia a concorrência total no nível do nó, ou seja, a soma das requisições simultâneas de todas as interfaces do lado do servidor em um único nó, e limita as requisições que ultrapassam o limiar.

Cenários

Em cenários com RT de chamada elevado, geralmente superior a 1 segundo, a limitação por QPS apresenta uma limitação evidente. Quando recursos disputados do sistema, como pools de threads, memória e pools de conexões, estão ocupados, as requisições entram em fila e o RT da interface aumenta ainda mais. Se você depender apenas da limitação baseada em QPS, um pequeno número de requisições continuará entrando no sistema a cada segundo, mas as requisições enfileiradas não serão processadas em poucos segundos. A fila cresce, o RT sobe ainda mais e o tempo de resposta tanto de novas requisições quanto das existentes aumenta significativamente.

Com a limitação por concorrência, novas requisições são rejeitadas imediatamente enquanto um determinado número de requisições permanece inacabado. As requisições são limitadas, mas assim que o sistema conclui as requisições atuais, as novas passam com um tempo de espera menor. No geral, tanto a taxa de sucesso quanto o RT médio das requisições melhoram significativamente.

Recomenda-se usar a limitação de concorrência total quando um pico em uma interface inesperada levar à contenção de recursos escassos, acúmulo de filas e aumento do RT para todas as requisições.

Console

A aba System protection lista os eventos de limitação de concorrência total no lado esquerdo. O lado direito exibe a tendência dos dados médios de requisições concorrentes totais dos nós da aplicação nos últimos 5 minutos.

Os eventos são reportados nos níveis de nó e interface com base nos nós e interfaces onde a limitação de concorrência total realmente ocorreu. Os relatórios são gerados a cada 5 minutos e abrangem a limitação ocorrida nos 5 minutos anteriores.

Clique em link View na coluna Actions de um evento para consultar a concorrência total do endereço IP do nó correspondente. A linha do tempo retrocede para um ponto próximo ao momento em que o evento foi reportado, permitindo verificar se a concorrência total do nó e o comportamento de limitação atendem às suas expectativas. As páginas de detalhes da interface e do nó oferecem informações mais detalhadas, incluindo dados nos níveis de interface e nó.

ParâmetroDescrição
Mode
  • Disabled: A limitação de concorrência total está desativada.

  • Enabled: Requisições que excedem o limiar são limitadas.

Total concurrency thresholdO limiar de concorrência total no nível do nó. Determine a concorrência total em estado estacionário de um nó por meio de testes de estresse ou dados históricos e adicione uma margem a esse valor.
ExceptionsPara mais informações, consulte Configurar exceções.

Circuit breaking de chamadas anormais

Como funciona

O circuit breaking de chamadas anormais monitora a taxa de erro de cada interface do lado do cliente. Quando a taxa de erro excede o limiar configurado, o circuit breaker é acionado para essa interface. Durante o circuit breaking, as requisições para a interface falham rapidamente. Em intervalos regulares, o sistema permite a passagem de uma requisição de sondagem. Quando uma requisição de sondagem tem sucesso, o circuit breaking é encerrado.

Cenários

O circuit breaking de chamadas anormais cobre principalmente dois cenários:

  • Erros de timeout — Uma alta taxa de erros de timeout em uma interface do lado do cliente geralmente indica problemas no provedor de service. Isso faz com que as requisições se acumulem no chamador (sua aplicação), afetando outras interfaces da sua aplicação. O circuit breaking faz essas requisições falharem rapidamente enquanto o provedor está anormal, evitando o acúmulo.

  • Erros sem timeout — Quando a taxa de erros sem timeout de uma interface do lado do cliente é muito alta, o circuit breaking de chamadas anormais lança uma exceção de limitação que pode ser tratada. Isso proporciona um efeito de degradação e melhora a experiência do usuário em situações anormais.

Console

A aba System protection lista os eventos de circuit breaking de chamadas anormais no lado esquerdo. O lado direito mostra as 10 principais interfaces por taxa de erro da aplicação nos últimos 5 minutos.

Os eventos são reportados nos níveis de nó e interface com base nos nós e interfaces onde o circuit breaking de chamadas anormais realmente ocorreu. Os relatórios são gerados a cada 5 minutos e cobrem a limitação ocorrida nos 5 minutos anteriores.

ParâmetroDescrição
Mode
  • Disabled: O circuit breaking de chamadas anormais está desativado.

  • Enabled: O circuit breaking é acionado para requisições que excedem o limiar.

Circuit breaking ratio threshold (%)O limiar da taxa de circuit breaking no nível da interface.
ExceptionsPara mais informações, consulte Configurar exceções.

Configurações avançadas

ParâmetroDescrição
Statistical window duration (seconds)A duração da janela estatística. Valores válidos: de 1 segundo a 120 minutos.
Circuit breaking duration (s)O período durante o qual o circuit breaking permanece ativo após ser acionado. Depois que um recurso entra no estado de circuit breaking, todas as requisições falham rapidamente dentro da duração configurada.
Minimum number of requestsO número mínimo de requisições necessário para acionar o circuit breaking. Se o número de requisições na janela estatística atual for inferior a este valor, a regra não será acionada mesmo que a condição de circuit breaking seja atendida.
Circuit breaking recovery strategy

A estratégia de recuperação usada pelo circuit breaker ao entrar na fase de recuperação, que corresponde ao estado semiaberto.

  • Single-probe recovery: Após o término da duração do circuit breaking, o circuit breaker sonda a próxima requisição. Se a requisição atender às expectativas, ou seja, não for uma chamada lenta nem um erro, o circuit breaking termina. Caso contrário, o circuit breaker retorna à fase de circuit breaking.

  • Progressive recovery: É necessário definir Number of recovery phases e Minimum pass count per step.

  • Após o término da duração do circuit breaking, o circuit breaker recupera progressivamente com base no número de fases de recuperação configurado. Quando as requisições em uma fase atingem um determinado volume, definido pela contagem mínima de aprovação por etapa, uma verificação é acionada. Se nenhuma das requisições verificadas exceder o limiar, a porcentagem de requisições permitidas aumenta gradualmente até que o tráfego seja totalmente recuperado. Se alguma métrica exceder o limiar em qualquer etapa, o circuit breaker retorna à fase de circuit breaking.

  • A porcentagem de requisições T = 100/N, onde N é o número de fases de recuperação. A primeira fase permite T% das requisições, a segunda fase permite 2T%, e assim sucessivamente até atingir 100%.

  • Por exemplo, se o número de fases de recuperação for 3 e a contagem mínima de aprovação por etapa for 5, as requisições serão permitidas nas porcentagens de 33%, 67% e 100% nas três fases. Quando o número de requisições em uma fase atinge 5 ou mais, uma verificação é realizada. Se as métricas das requisições não excederem o limiar, o circuit breaker avança para a próxima fase de recuperação, até que o tráfego seja totalmente restaurado.

Circuit breaking de chamadas lentas

Como funciona

O circuit breaking de chamadas lentas monitora a taxa de chamadas lentas de cada interface do lado do cliente. Quando a taxa de chamadas lentas excede o limiar configurado, o circuit breaker é acionado para essa interface. Durante o circuit breaking, as requisições para a interface falham rapidamente. Em intervalos regulares, o sistema permite a passagem de uma requisição de sondagem. Quando uma requisição de sondagem tem sucesso, o circuit breaking é encerrado.

Cenários

O circuit breaking de chamadas lentas cobre basicamente o mesmo cenário do caso de timeout do circuit breaking de chamadas anormais. A diferença é que você pode ajustar dinamicamente o critério de RT que define uma chamada lenta, sem depender da configuração de timeout.

Console

A aba System protection lista os eventos de circuit breaking de chamadas lentas no lado esquerdo. O lado direito exibe as 10 principais interfaces por RT médio da aplicação nos últimos 5 minutos.

Os eventos são reportados nos níveis de nó e interface com base nos nós e interfaces onde o circuit breaking de chamadas lentas realmente ocorreu. Os relatórios são gerados a cada 5 minutos e abrangem a limitação ocorrida nos 5 minutos anteriores.

ParâmetroDescrição
Mode
  • Disabled: O circuit breaking de chamadas lentas está desativado.

  • Enabled: O circuit breaking é acionado para requisições que excedem o limiar.

Slow call RT (ms)Requisições com tempo de resposta superior a este valor são consideradas chamadas lentas.
Degradation threshold (%)Quando a porcentagem de requisições com RT superior ao RT de chamada lenta configurado excede este limiar, o circuit breaking é acionado.
ExceptionsPara mais informações, consulte Configurar exceções.

Configurações avançadas

ParâmetroDescrição
Statistical window duration (seconds)A duração da janela estatística. Valores válidos: de 1 segundo a 120 minutos.
Circuit breaking duration (s)O período durante o qual o circuit breaking permanece ativo após ser acionado. Depois que um recurso entra no estado de circuit breaking, todas as requisições falham rapidamente dentro da duração configurada.
Minimum number of requestsO número mínimo de requisições necessário para acionar o circuit breaking. Se o número de requisições na janela estatística atual for inferior a este valor, a regra não será acionada mesmo que a condição de circuit breaking seja atendida.
Circuit breaking recovery strategy

A estratégia de recuperação usada pelo circuit breaker ao entrar na fase de recuperação, que corresponde ao estado semiaberto.

  • Single-probe recovery: Após o término da duração do circuit breaking, o circuit breaker sonda a próxima requisição. Se a requisição atender às expectativas, ou seja, não for uma chamada lenta nem um erro, o circuit breaking termina. Caso contrário, o circuit breaker retorna à fase de circuit breaking.

  • Progressive recovery: É necessário definir Number of recovery phases e Minimum pass count per step.

  • Após o término da duração do circuit breaking, o circuit breaker recupera progressivamente com base no número de fases de recuperação configurado. Quando as requisições em uma fase atingem um determinado volume, definido pela contagem mínima de aprovação por etapa, uma verificação é acionada. Se nenhuma das requisições verificadas exceder o limiar, a porcentagem de requisições permitidas aumenta gradualmente até que o tráfego seja totalmente recuperado. Se alguma métrica exceder o limiar em qualquer etapa, o circuit breaker retorna à fase de circuit breaking.

  • A porcentagem de requisições T = 100/N, onde N é o número de fases de recuperação. A primeira fase permite T% das requisições, a segunda fase permite 2T%, e assim sucessivamente até atingir 100%.

  • Por exemplo, se o número de fases de recuperação for 3 e a contagem mínima de aprovação por etapa for 5, as requisições serão permitidas nas porcentagens de 33%, 67% e 100% nas três fases. Quando o número de requisições em uma fase atinge 5 ou mais, uma verificação é realizada. Se as métricas das requisições não excederem o limiar, o circuit breaker avança para a próxima fase de recuperação, até que o tráfego seja totalmente restaurado.

Exceções

Como funciona

É possível configurar exceções para todos os recursos de proteção do sistema. A proteção do sistema sempre permite a passagem das interfaces na lista de exceções sem verificar as regras.

As exceções exigem a versão 4.2.0 ou posterior do agente.

Cenários

Na maioria dos casos, basta configurar exceções para endpoints de verificação de integridade e interfaces críticas do sistema. Exceções para endpoints de verificação de integridade evitam que o status de integridade do nó seja afetado. Interfaces críticas do sistema possuem seus próprios limites de limitação no nível da interface e devem permanecer inalteradas pela limitação no nível do sistema.

Console

A aba System protection lista as interfaces que podem ser selecionadas diretamente no lado esquerdo. Estas são as interfaces chamadas recentemente. Para uma interface que não esteja listada à esquerda, insira seu nome na caixa de entrada e pressione Enter para adicioná-la às interfaces selecionadas.

Você pode remover as interfaces selecionadas individualmente clicando em × ou limpar todas clicando em Remove all. A proteção do sistema não aplica as regras configuradas às interfaces selecionadas.

Proteção do sistema vs. proteção de tráfego

  • Tanto a proteção do sistema quanto a proteção de tráfego mantêm a aplicação em um estado estável, mas cobrem cenários diferentes e causam níveis distintos de perda de tráfego.

  • A proteção do sistema oferece defesa de tráfego baseada em métricas no nível do nó. Ela mantém a própria aplicação em um estado estável e abrange a maioria dos cenários. No entanto, a proteção do sistema atua sob a perspectiva da aplicação e trata todas as interfaces igualmente, enquanto interfaces na mesma aplicação diferem em importância e impacto na carga do sistema. A proteção de tráfego permite configurar um limiar diferente para cada interface, cobrindo mais cenários e limitando o mínimo possível de tráfego, mantendo a mesma proteção.

  • Em resumo, tanto a proteção do sistema quanto a proteção de tráfego são eficazes. A proteção de tráfego apresenta melhor desempenho na cobertura de cenários e na redução de perda de tráfego, enquanto a proteção do sistema é mais fácil de configurar. Portanto, a melhor prática é combinar ambas: utilize a proteção do sistema para garantir a estabilidade da aplicação e a proteção de tráfego para reduzir perdas (tráfego limitado) por meio de configurações refinadas, sem comprometer o efeito protetor.

Referências

Para mais informações sobre políticas de proteção de tráfego, consulte Proteção de tráfego.