O Cloud Monitor oferece regras de alerta acionadas por limiar dinâmico para monitorar métricas de recursos da Alibaba Cloud. Essas regras ajustam-se automaticamente aos dados históricos e exibem os limites do limiar. O recurso identifica anomalias, como aumentos e quedas repentinas nos valores das métricas, e garante a estabilidade dos negócios.
O que são limiares dinâmicos?
Limiares dinâmicos aplicam algoritmos de machine learning para identificar dinamicamente características de padrões de dados históricos, como periodicidade, tendência e flutuação das métricas. Eles integram métricas de serviços de nuvem específicos e calculam automaticamente os limites superior e inferior do limiar de cada instância.
Limites
O recurso de alerta acionado por limiar dinâmico está em visualização apenas por convite. Para utilizar esse recurso, envie um ticket.
Cenários
As características estatísticas das métricas de recursos de nuvem, como uso de recursos, alterações periódicas e flutuações de variância, variam conforme o cenário de negócio. Por exemplo, se o tráfego for intenso durante o dia e reduzido à noite, métricas como tráfego de gateway e acúmulo de mensagens do ApsaraMQ em uma instância Elastic Compute Service (ECS) ou em um nome de domínio do Alibaba Cloud CDN apresentarão valores de pico e de vale correspondentes. Serviços intensivos em I/O e tarefas computacionalmente intensivas causam diferentes utilizações de CPU ou limiares de carga (load.1m, load.5m e load.15m) em diferentes instâncias ECS.
Os limiares de alerta são fixos nas regras de alerta de métrica única, inadequadas para os cenários complexos mencionados anteriormente. Como resultado, ocorrem alertas constantes em algumas instâncias com alta carga. No entanto, algumas exceções de negócio em instâncias com baixa carga podem não atingir os limiares de alerta relacionados, ou certas exceções podem persistir por mais de meia hora antes que os limiares sejam alcançados. Para melhorar sua experiência com alertas e reduzir o tempo de detecção de exceções, o Cloud Monitor fornece o recurso de alerta acionado por limiar dinâmico, baseado em algoritmos de machine learning e na experiência de especialistas em regras de alerta. O algoritmo central desse recurso identifica dinamicamente as características históricas dos padrões de dados, como padrões periódicos, flutuações e uso das métricas. O algoritmo integra métricas de serviços de nuvem específicos e gera automaticamente limites superior e inferior de limiar para cada instância. Esse recurso permite visualizar o efeito do limiar e oferece ajuste de parâmetros de sensibilidade, implementando transparência total (white boxing).
Benefícios
Em comparação com regras de alerta de métrica única ou múltiplas métricas, as regras de alerta acionadas por limiar dinâmico apresentam as seguintes vantagens:
Redução de ruído em alertas
O recurso de alerta acionado por limiar dinâmico coleta dados de métricas de cada instância e utiliza modelos como decomposição robusta de séries temporais e previsão para ajustar-se ao uso de dados e às mudanças de negócio das diferentes métricas da instância. Ele também filtra ruídos anômalos com base no agrupamento histórico de alertas e na correspondência de similaridade para melhorar a precisão dos alertas. Este recurso é adequado para os seguintes cenários:
-
Níveis variados de uso nas métricas da instância
Por exemplo, uma empresa de jogos usa diferentes instâncias ECS para computação offline e serviços online. Na maioria dos casos, utiliza-se o mesmo modelo de alerta. Nessa situação, os alertas são acionados quando métricas como utilização de CPU, uso de carga e uso de memória ultrapassam 80%. Consequentemente, alertas inesperados são disparados constantemente em instâncias de alta carga.
-
Picos de carga causados por tarefas agendadas
Por exemplo, um usuário utiliza o ApsaraDB RDS para armazenamento e configure uma tarefa agendada para limpar dados históricos gerados há 30 dias, diariamente às 00:00:00. Contudo, durante a execução dessa tarefa, o uso de IOPS do ApsaraDB RDS atinge instantaneamente cerca de 100% e gera um alerta. Em seguida, o uso de IOPS normaliza-se rapidamente. O falso positivo ocorre pontualmente todos os dias.
Nos cenários acima, o recurso de alerta acionado por limiar dinâmico pode reduzir efetivamente a taxa de falsos positivos em 80% a 90%. Isso permite focar nas exceções de negócio e melhorar a experiência de monitoramento e O&M.
Detecção automática de exceções
Exceções nas métricas de instâncias de serviços de nuvem geralmente resultam de alterações nos serviços e no tráfego upstream e downstream, ou de mudanças nas aplicações e nos dados implantados nessas instâncias. O recurso de alerta acionado por limiar dinâmico detecta rapidamente exceções de serviço, como conexões de Server Load Balancer (SLB) voltadas para a Internet e um grande volume de mensagens acumuladas no ApsaraMQ. Utilize esse recurso para detectar exceções nas métricas ECS de recursos básicos e localizar as causas raiz das falhas de negócio.
Ao configure uma regra de alerta de métrica única ou múltiplas métricas, definem-se limiares altos para evitar excesso de falsos positivos. Além disso, tal regra aplica-se a um grupo de aplicações ou a todos os recursos. Consequentemente, não é possível ajustar parâmetros para serviços ou instâncias específicas. As regras de alerta acionadas por limiar dinâmico detectam com rapidez e precisão aumentos ou diminuições repentinas nos valores das métricas. Tais regras são adequadas para os seguintes cenários:
-
Detecção de exceções de métricas após alterações de código
Por exemplo, após um desenvolvedor alterar o código da aplicação, ocorre um vazamento de memória no programa, resultando em uma coleta completa de lixo (full garbage collection) e em um aumento significativo na utilização da CPU. No entanto, um alerta de métrica única para alta utilização de CPU não seria acionado nesse caso.
-
Aviso prévio antes da indisponibilidade dos serviços
Por exemplo, se o tráfego do serviço upstream aumentar repentinamente, uma regra de alerta acionada por limiar dinâmico ajudará a detectar rapidamente a exceção e a disparar um alerta antes que o limiar de uso especificado em uma regra de alerta de métrica única seja atingido. Isso evita que os serviços downstream fiquem indisponíveis devido ao tráfego alto contínuo.
Nos cenários de negócio mencionados, as regras de alerta acionadas por limiar dinâmico monitoram as métricas principais dos serviços de nuvem. Dessa forma, o Cloud Monitor consegue recuperar 85% ou mais dos problemas e falhas dentro de 3 minutos após a ocorrência de uma exceção de métrica.
Redução de custos de configuração e manutenção de limiares
Não é necessário especifique valores para limiares dinâmicos. Basta crie uma regra de alerta acionada por limiar dinâmico e selecione a condição de alerta correspondente (além do limite, acima do limite superior ou abaixo do limite inferior) para concluir as definições de limiar. O recurso de alerta acionado por limiar dinâmico reduz significativamente os custos de configuração e manutenção, sendo adequado para os seguintes cenários:
-
Definições específicas de limiar
Ao configure regras de alerta para métricas sem limites físicos superiores, como tráfego, largura de banda e consultas por segundo (QPS) de uma instância ECS, os valores dessas métricas podem variar em ordens de magnitude, tornando difícil especifique valores comuns e apropriados. Se os valores reais dessas métricas mudarem devido a alterações de O&M ou de negócio e os limiares relacionados precisarem ser modificados consequentemente, será necessário ajustar os limiares para evitar falsos positivos ou falsos negativos.
-
Configuração de múltiplas regras para acionar alertas com diferentes limiares e em diferentes períodos
Se os valores de algumas métricas apresentarem picos e vales significativos em diferentes períodos, será necessário configure múltiplas regras e especifique diferentes horários de vigência.
Melhores práticas
Redução de ruído em alertas para recursos básicos do ECS
Um usuário utiliza uma instância ECS para renderização offline e outras instâncias ECS para suporte a negócios online. O uso de memória da instância ECS usada para renderização offline é significativamente maior do que o das outras instâncias ECS usadas para tarefas online. Ao configure uma regra de alerta de métrica única, o usuário define o limiar de uso de memória como superior a 80%. Como resultado, alertas constantes são acionados na instância ECS de renderização offline durante uma semana, gerando um total de 200 alertas. Após configure uma regra de alerta acionada por limiar dinâmico, menos de cinco alertas são gerados em uma semana, e a taxa de convergência de falsos positivos atinge 95%.
As melhores práticas de redução de ruído em alertas aplicam-se a outras métricas além do uso de memória de instâncias ECS. Recomendamos configure regras de alerta acionadas por limiar dinâmico para as métricas descritas na tabela a seguir.
Exceção comum | Possível causa | Métrica | Condição de alerta |
A carga está excessivamente alta, a carga flutua significativamente ou a carga de pico dura por um longo período. | Recursos do sistema insuficientes, processos com exceções (como loops infinitos e vazamentos de memória), aumento repentino no número de processos ou geração súbita de um grande volume de solicitações ou operações de processamento de dados por algumas aplicações ou serviços do sistema. |
| Acima do limite superior |
O número de solicitações aumenta repentinamente, o número de solicitações flutua significativamente ou o número de pico de solicitações dura por um longo período. | Ocorre uma exceção em uma aplicação ou serviço do sistema. O desempenho de I/O dos discos é insuficiente ou a capacidade do disco é insuficiente. Um grande número de operações de leitura ou gravação em disco é executado em algumas aplicações ou serviços. |
| Além do limite |
O número de conexões está excessivamente alto, o número de conexões flutua significativamente ou o número de pico de conexões dura por um longo período. | A carga do sistema está excessivamente alta, os pools de conexão TCP são insuficientes, ocorrem exceções em aplicações ou serviços, ou um grande número de operações de conexão TCP é executado em determinado momento por algumas aplicações ou serviços. | (Agent)network.tcp.connection_state | Além do limite |
Convergência de falsos positivos causados por tarefas agendadas do ApsaraDB RDS
Quando uma tarefa agendada especificada pelo usuário é executada para limpar dados históricos nas primeiras horas da manhã todos os dias, o QPS de um banco de dados ApsaraDB RDS for MySQL apresenta um pico imediato. Uma regra de alerta de métrica única dispara um falso positivo quando a tarefa agendada é executada. Após alterar a regra de alerta para uma regra acionada por limiar dinâmico, os falsos positivos agendados deixam de ocorrer.
As melhores práticas de convergência de falsos positivos causados por tarefas agendadas aplicam-se a outras métricas além do QPS de bancos de dados ApsaraDB RDS for MySQL. Recomendamos configure regras de alerta acionadas por limiar dinâmico para as métricas descritas na tabela a seguir.
Exceção comum | Possível causa | Métrica | Condição de alerta |
O desempenho de uma instância ApsaraDB RDS flutua significativamente. | A carga do sistema está excessivamente alta ou os pools de conexão do banco de dados são insuficientes. Um grande número de consultas é executado em determinado momento por uma aplicação ou serviço. |
| Acima do limite superior |
Detecção de exceções no OSS ou CDN
O Object Storage Service (OSS) e o Alibaba Cloud CDN (CDN) atuam, respectivamente, como componentes de otimização de entrega de conteúdo dependentes de armazenamento e de aceleração para serviços. Exceções no OSS e no CDN afetam diretamente a disponibilidade dos recursos do serviço. No entanto, geralmente, o monitoramento de disponibilidade da aplicação não cobre a disponibilidade do OSS e do CDN. Consequentemente, os alertas podem não ser acionados quando ocorrem exceções no OSS ou no CDN.
Por exemplo, se o BPS do CDN cair para zero, o recurso de alerta acionado por limiar dinâmico poderá detectar e recuperar a exceção a tempo, enviando uma notificação de alerta.
As regras de alerta acionadas por limiar dinâmico cobrem rapidamente os alertas de monitoramento para OSS e CDN, detectando exceções antecipadamente antes que os serviços fiquem indisponíveis. Recomendamos configure regras de alerta acionadas por limiar dinâmico para as métricas descritas na tabela a seguir.
Serviço da Alibaba Cloud | Exceção comum | Possível causa | Métrica | Condição de alerta |
OSS | O número de solicitações bem-sucedidas diminui repentinamente ou o número de erros de solicitação aumenta repentinamente. | A conexão de rede está instável ou sofre uma exceção. Você não tem permissões sobre objetos do OSS ou os objetos do OSS não existem. Ocorre um erro ao chamar uma operação de API. |
| Abaixo do limite inferior |
| Acima do limite superior | |||
O tráfego aumenta repentinamente, o tráfego diminui repentinamente, o tráfego flutua significativamente ou o tráfego de pico dura por um longo período. | A conexão de rede está instável ou sofre uma exceção. Um grande número de solicitações é enviado por algumas aplicações ou serviços em determinado momento. |
| Além do limite | |
CDN | O QPS aumenta repentinamente, o QPS diminui repentinamente, o QPS flutua significativamente, o QPS de pico dura por um longo período ou o tempo de resposta aumenta. | A carga do sistema está excessivamente alta, o cache é insuficiente e os nós do CDN são insuficientes. O número de visitas de usuários aumenta repentinamente. Um grande número de solicitações é tentado novamente após uma falha na solicitação. | BPS_isp QPS_isp InternetOut | Além do limite |
rt | Acima do limite superior | |||
A taxa de acerto diminui. | As solicitações são redirecionadas para o servidor de origem e a aceleração falha. | hitRate | Abaixo do limite inferior |
Configuração simplificada de O&M do ApsaraMQ for Kafka
As quantidades de algumas métricas do ApsaraMQ for Kafka estão relacionadas aos serviços, como o número de vezes que as mensagens são enviadas em uma instância e o número de mensagens consumidas em uma instância. Além disso, o consumo de mensagens varia significativamente entre grupos e tópicos. Consequentemente, é difícil definir um limiar comum para monitorar filas de mensagens para diferentes serviços. Isso pode levar a erros como falsos negativos e detecção atrasada.
Com capacidades de alerta automatizado, o recurso de alerta acionado por limiar dinâmico simplifica as configurações de regras de alerta e reduz os custos de manutenção. Esse recurso detecta rapidamente exceções dentro de 2 a 3 minutos, reduzindo efetivamente o tempo médio para reparo (MTTR) dos serviços.
Por exemplo, se o número de mensagens acumuladas para o ApsaraMQ for Kafka aumentar repentinamente, esse recurso recupera a exceção e envia uma notificação de alerta.
Recomendamos configure regras de alerta acionadas por limiar dinâmico para as métricas do ApsaraMQ for Kafka listadas na tabela a seguir.
Exceção comum | Possível causa | Métrica | Condição de alerta |
O tráfego aumenta ou diminui repentinamente. | Muitos usuários acessam uma aplicação ou realizam um grande número de operações de transmissão de dados. Ocorrem exceções nas aplicações ou a largura de banda da rede é consumida por programas maliciosos. |
| Além do limite |
As mensagens estão acumuladas. | Recursos do sistema insuficientes, processos com exceções (como loops infinitos e vazamentos de memória), aumento repentino no número de processos ou geração súbita de um grande volume de solicitações ou operações de processamento de dados por algumas aplicações ou serviços do sistema. |
| Acima do limite superior |
O número de conexões está excessivamente alto, o número de conexões flutua significativamente ou o número de pico de conexões dura por um longo período. | A carga do sistema está excessivamente alta, os pools de conexão TCP são insuficientes, ocorrem exceções em aplicações ou serviços, ou um grande número de operações de conexão TCP é executado em determinado momento por algumas aplicações ou serviços. |
| Além do limite |