ApsaraDB for SelectDB integra a funcionalidade de alertas do Alibaba Cloud Application Real-Time Monitoring Service (ARMS). No console do SelectDB, configure regras de alerta e itens de monitoramento. Quando uma regra de alerta para um item de monitoramento é acionada, todos os contatos no grupo de contatos de alerta recebem uma notificação. Mantenha grupos de contatos de alerta para itens de monitoramento e garanta que os contatos relevantes sejam notificados prontamente ao disparar um alerta. Ao configurar regras de alerta para métricas de monitoramento importantes, você recebe notificações imediatas sempre que os dados de métrica de uma instância do SelectDB apresentarem anomalias, o que permite identificar e solucionar falhas rapidamente. Este tópico descreve como configurar regras de alerta no console do SelectDB.
Também é possível configurar regras de alerta para instâncias do ApsaraDB for SelectDB no console do CloudMonitor. Para mais informações, consulte Cloud service monitoring.
Pré-requisitos
Crie uma função vinculada ao service do ApsaraDB for SelectDB, chamada AliyunServiceRoleForSelectDB. Por padrão, essa função tem permissão para acessar o service ARMS. Para mais informações, consulte Service-linked role.
Para enviar dados de monitoramento da sua instância do ApsaraDB for SelectDB ao seu próprio ARMS visando monitoramento e alertas centralizados, ative primeiro o service ARMS. Para mais informações, consulte Activate ARMS.
Procedimento
Faça login no console do ApsaraDB for SelectDB.
No canto superior esquerdo da página, selecione a região onde a instância está localizada.
Na página Instances, clique em Instance ID desejado para acessar a página Instance Details.
No painel de navegação à esquerda, clique em Monitoring and Alerts.
-
Na página Monitoring and Alerts, clique na aba Alert Management e, em seguida, clique em Create SelectDB Monitoring Alert.
NotaApós clicar na aba Alert Management, a página SelectDB Monitoring Alert List pode levar de 3 a 5 segundos para carregar.
-
Na página Create SelectDB Monitoring Alert, configure os parâmetros.
Crie uma regra de alerta usando um limiar estático ou uma consulta PromQL personalizada.
Limiar estático: Oferece métricas de alerta predefinidas. Selecione uma métrica para criar rapidamente uma regra de alerta definindo uma condição.
PromQL personalizado: Crie uma regra de alerta escrevendo uma consulta PromQL personalizada. Essa opção é útil para métricas ausentes na lista predefinida.
Limiar estático
Parâmetro
Descrição
Exemplo
Alert Rule Name
Nome da regra de alerta.
Alerta de utilização de CPU
Check Type
Selecione Static threshold.
static threshold
Instance
Selecione a instância para a regra de alerta.
O valor padrão é Traverse, o que significa que a regra de alerta se aplica a todas as instâncias.
selectdb-cn-7213n****
Cluster
Selecione o cluster para a regra de alerta.
O valor padrão é Traverse, o que significa que a regra de alerta se aplica a todos os clusters.
selectdb-cn-7213n****-be
Grupo de contatos de alerta
Selecione um grupo de contatos de alerta.
Os grupos de contatos de alerta suportados variam conforme o tipo de instância do Prometheus. As opções disponíveis mudam de acordo com o tipo de instância do Prometheus selecionado.
Alerta de monitoramento do SelectDB
Alert metric
Selecione a métrica para o alerta. Cada grupo de contatos de alerta oferece um conjunto diferente de métricas.
Utilização de CPU
Alert condition
Defina a condição que dispara um alerta com base na métrica selecionada.
Um alerta é enviado quando a utilização de CPU ultrapassa 80%.
Traverse
Sem filtro
Nenhum
Equal To
A seção Not Equal To exibe a consulta PromQL correspondente à condição de alerta e apresenta um gráfico dos valores da métrica ao longo do tempo.
Por padrão, o gráfico mostra o valor em tempo real para um único recurso. Use os filtros nesta seção para visualizar dados de diferentes recursos e intervalos de tempo.
NotaO limiar de alerta aparece como uma linha tracejada vermelha no gráfico. A curva fica vermelha quando o limiar é atingido e permanece azul caso contrário.
Passe o mouse sobre a curva de série temporal para ver detalhes do recurso em um ponto específico no tempo.
Selecione um intervalo de tempo no gráfico de série temporal para visualizar a curva desse período.
Nenhum
Match Regular Expression
Generate alert event when condition is met: Dispara um alerta se qualquer ponto de dados atingir o limiar.
Generate alert event when condition persists for N minutes: Dispara um alerta apenas se a condição persistir por pelo menos N minutos.
1
Do Not Match Regular Expression
Nível de severidade do alerta. O nível padrão é Data Preview. A severidade aumenta na seguinte ordem: Default, P4, P3, P2 e P1.
P2
Filter Conditions
Conteúdo da notificação de alerta recebida pelos usuários. Use a sintaxe de modelo do Go para personalizar variáveis de parâmetro na mensagem de alerta.
Node: {{$labels.pod_name}} CPU utilization {{$labels.metrics_params_opt_label_value}} {{$labels.metrics_params_value}}%, current value {{ printf "%.2f" $value }}%
Data Preview
Data Preview: Permite configurar rapidamente os Duration, o Alert Level e Default.
Alert Content: Permite selecionar uma política de notificação. Se não existir nenhuma política, clique em Create Notification Policy para criar uma. Para mais informações, consulte Notification policy.
ImportanteEspecificar rapidamente uma política de notificação garante que os eventos de alerta da regra atual sejam correspondidos pela política selecionada. No entanto, esses eventos também podem ser correspondidos por outras políticas de notificação que usam correspondência difusa. A relação entre eventos de alerta e políticas de notificação é de muitos para muitos.
Nenhum
Notification Contacts
Notification Period: Intervalo em que a regra de alerta é avaliada. O valor padrão e mínimo é 1 minuto.
Whether to Resend Notifications: Garante que os dados estejam completos antes da avaliação. Esta opção vem ativada por padrão e recomendamos mantê-la assim.
Standard Mode: Atribua tags ao alerta. As políticas de notificação podem usar essas tags para correspondência.
Notification Contacts: Defina anotações para o alerta.
Ciclo de verificação de alerta: 1 minuto
Verificar após conclusão dos dados: Sim
Tags (rótulos): Nenhuma
Anotações: Nenhuma
PromQL personalizado
Parâmetro
Descrição
Exemplo
Policy
Nome da regra de alerta.
Utilização de CPU do Pod maior que 80%
Notification Policies
Defina como Advanced Settings.
Custom PromQL
Alert Check Cycle
Selecione a instância para a regra de alerta.
selectdb-cn-7213n****
Check After Data Is Complete
Selecione o cluster para a regra de alerta.
selectdb-cn-7213n****-be
Tags
Selecione um grupo de contatos de alerta.
Os grupos de contatos de alerta suportados variam conforme o tipo de instância do Prometheus. As opções disponíveis mudam de acordo com o tipo de instância do Prometheus selecionado.
Alerta de monitoramento do SelectDB
Annotations
(Opcional) Selecione uma métrica de referência para usar seu modelo PromQL como ponto de partida. Em seguida, modifique a consulta pré-preenchida.
As métricas de referência disponíveis são filtradas automaticamente com base no tipo de instância do Prometheus selecionado.
NotaO modelo fornecido pelas Alert Rule Name está incompleto. Modifique-o para criar Check Type válidos.
Latência de consulta no percentil 99
Custom PromQL
Use uma consulta PromQL para definir a expressão de alerta.
avg(doris_fe_query_latency_ms{quantile="0.99",pod=~,cluster_id=~}) by (cluster_id) > 300
Instance
A seção Cluster exibe a consulta PromQL correspondente à condição de alerta e apresenta um gráfico dos valores da métrica ao longo do tempo.
Por padrão, o gráfico mostra o valor em tempo real para um único recurso. Use os filtros nesta seção para visualizar dados de diferentes recursos e intervalos de tempo.
NotaO limiar de alerta aparece como uma linha tracejada vermelha no gráfico. A curva fica vermelha quando o limiar é atingido e permanece azul caso contrário.
Passe o mouse sobre a curva de série temporal para ver detalhes do recurso em um ponto específico no tempo.
Selecione um intervalo de tempo no gráfico para ampliar a curva de série temporal desse período.
Nenhum
Reference Alert Contact Group
Reference Metrics: Dispara um alerta se qualquer ponto de dados atingir o limiar.
Reference Metrics: Dispara um alerta apenas se a condição persistir por pelo menos N minutos.
1
Custom PromQL Statements
Nível de severidade do alerta. O nível padrão é Custom PromQL Statements. A severidade aumenta na seguinte ordem: Default, P4, P3, P2 e P1.
Default
Data Preview
Conteúdo da notificação de alerta recebida pelos usuários. Use a sintaxe de modelo do Go para personalizar variáveis de parâmetro na mensagem de alerta.
Namespace: {{$labels.namespace}}/Pod: {{$labels.pod_name}}/Disk device: {{$labels.device}} utilization exceeds 90%, current value {{ printf "%.2f" $value }}%
Data Preview
Duration: Permite configurar rapidamente os If the alert condition is met, an alert event is generated., o Generate alert event when condition persists for N minutes e Alert Level.
Default: Permite selecionar uma política de notificação. Se não existir nenhuma política, clique em Create Notification Policy para criar uma. Para mais informações, consulte Notification policy.
ImportanteEspecificar rapidamente uma política de notificação garante que os eventos de alerta da regra atual sejam correspondidos pela política selecionada. No entanto, esses eventos também podem ser correspondidos por outras políticas de notificação que usam correspondência difusa. A relação entre eventos de alerta e políticas de notificação é de muitos para muitos.
Nenhum
Simple Mode
Notification Contacts: Intervalo em que a regra de alerta é avaliada. O valor padrão e mínimo é 1 minuto.
Notification Period: Garante que os dados estejam completos antes da avaliação. Esta opção vem ativada por padrão e recomendamos mantê-la assim.
Whether to Resend Notifications: Atribua tags ao alerta. As políticas de notificação podem usar essas tags para correspondência.
Standard Mode: Defina anotações para o alerta.
Ciclo de verificação de alerta: 1 minuto
Verificar após conclusão dos dados: Sim
Tags (rótulos): Nenhuma
Anotações: Nenhuma
Após configurar os parâmetros, clique em Notification Contacts. A regra de alerta entra em vigor imediatamente.
Configurações de alerta recomendadas
Configure os alertas de acordo com suas necessidades. A tabela a seguir lista métricas comuns e fornece configurações recomendadas.
|
Métrica |
Limiar |
Duração (min) |
Observações |
|
Policy |
>5000 |
5 |
Latência média de consulta em milissegundos (ms). Ajuste o limiar conforme seus requisitos de negócio. Recomendamos configurar este alerta. |
|
Advanced Settings |
>60000 |
5 |
Latência de consulta de cauda longa em milissegundos (ms). Ajuste o limiar conforme seus requisitos de negócio. Recomendamos configurar este alerta. |
|
Alert Check Cycle |
<90 |
5 |
Taxa de sucesso de consultas SQL. Recomendamos configurar este alerta. |
|
Check After Data Is Complete |
>80 |
15 |
Utilização de CPU do cluster BE. Métrica operacional comum. Recomendamos configurar este alerta. |
|
Tags |
>80 |
15 |
Utilização de memória do cluster BE. Métrica operacional comum. Recomendamos configurar este alerta. |
|
Annotations |
>60 |
15 |
Utilização de CPU do cluster FE. Recomendamos configurar este alerta. Se o recurso for insuficiente, envie um ticket para solicitar um scale-out gratuito. |
|
Save |
>80 |
15 |
Utilização de memória JVM do cluster FE. Recomendamos configurar este alerta. Se o recurso for insuficiente, envie um ticket para solicitar um scale-out gratuito. |
|
Query rate |
>0 |
1 |
Número de reinicializações de nós subjacentes no cluster de computação. Configure conforme necessário. |
|
99th percentile query latency |
<1500 |
15 |
Um valor mais alto indica maior pressão de compactação de dados nos nós de computação. Recomendamos configurar este alerta. |
|
ClusterQuerySuccessRate |
<1500 |
15 |
Um valor mais alto indica maior pressão de compactação de dados nos nós de computação. Recomendamos configurar este alerta. |
|
CPU Utilization |
<90 |
15 |
A taxa de acerto de cache afeta a latência de consulta. Recomendamos configurar este alerta. Se essa métrica cair, avalie a necessidade de fazer scale-out do cluster. Para mais informações, consulte Scale clusters. |
|
Memory Usage |
>150 |
15 |
Número total de conexões de usuários ao banco de dados. O limite máximo de conexões por usuário é 200 por padrão. Como essa métrica depende da carga de trabalho do seu negócio, recomendamos configurar este alerta com base no seu uso típico. |
|
FE CPU usage |
Nenhum |
Nenhum |
Métrica dependente da carga de trabalho. Configure conforme necessário. |
|
FE JVM memory utilization |
Nenhum |
Nenhum |
Métrica de sistema subjacente, geralmente não é uma preocupação primária de negócio. Configure conforme necessário para troubleshooting avançado. |
|
ClusterFailNodeCount |
Nenhum |
Nenhum |
Métrica de sistema subjacente, geralmente não é uma preocupação primária de negócio. Configure conforme necessário para troubleshooting avançado. |
|
Base compaction score |
Nenhum |
Nenhum |
Configure este alerta se precisar monitorar o uso de armazenamento. |
|
Cumulative compaction score |
Nenhum |
Nenhum |
Configure este alerta se precisar monitorar a velocidade de importação de dados. |
|
Cache hit rate |
Nenhum |
Nenhum |
Métrica de sistema subjacente, geralmente não é uma preocupação primária de negócio. Configure conforme necessário para troubleshooting avançado. |
|
User Connection Count |
Nenhum |
Nenhum |
Métrica de sistema subjacente, geralmente não é uma preocupação primária de negócio. Configure conforme necessário para troubleshooting avançado. |
|
Queries per second (QPS) |
Nenhum |
Nenhum |
Métrica de sistema subjacente, geralmente não é uma preocupação primária de negócio. Configure conforme necessário para troubleshooting avançado. |
|
Disk write IOPS |
Nenhum |
Nenhum |
Métrica de sistema subjacente, geralmente não é uma preocupação primária de negócio. Configure conforme necessário para troubleshooting avançado. |
|
Disk read IOPS |
Nenhum |
Nenhum |
Métrica de sistema subjacente, geralmente não é uma preocupação primária de negócio. Configure conforme necessário para troubleshooting avançado. |