O Realtime Compute for Apache Flink oferece dois serviços de monitoramento: Cloud Monitor (gratuito) e Managed Service for Prometheus (ARMS). Ambos disponibilizam alertas baseados em métricas e em eventos. Este guia orienta você na configuração de regras de alerta para ambos os serviços.
Limitações
Regras de alerta não são suportadas em jobs do Flink executados em clusters de sessão.
Jobs em lote não suportam regras de alerta.
Alertas de workflow estão disponíveis apenas no Cloud Monitor.
Os alertas baseados em eventos do ARMS aceitam somente eventos
Job Failed. Para outros tipos de evento, use o Cloud Monitor.
Escolha o serviço de monitoramento
Seu workspace utiliza o Cloud Monitor ou o ARMS, dependendo da seleção feita durante a criação. Para verifique qual serviço seu workspace usa, consulte Como verifico o tipo de serviço de monitoramento do meu workspace?.
|
Tipo de alerta |
Cloud Monitor |
ARMS |
|
Baseado em métricas |
Métricas principais; aplica-se a jobs individuais ou em lote |
Seis métricas principais; apenas job individual |
|
Baseado em eventos |
|
Apenas |
Para alterar o serviço de monitoramento do seu workspace, clique em
na coluna Actions do seu workspace no Management Console.
Leia atentamente a mensagem antes de confirmar a alteração.
Alertas recomendados
Antes de iniciar a configuração, a tabela a seguir resume os alertas recomendados para a maioria das implantações do Flink. Configure-os primeiro para estabelecer uma base de monitoramento.
|
Métrica |
Tipo de alerta |
Serviço |
Limiar recomendado |
Importância |
|
|
Baseado em métricas |
Cloud Monitor ou ARMS |
Qualquer falha (>= 1) |
Dispara imediatamente quando um job falha. Recomendado para todas as aplicações. |
|
|
Baseado em métricas |
ARMS |
Observe sua aplicação em condições normais e defina o limiar acima da taxa normal de reinicializações |
Reinicializações repetidas podem indicar instabilidade antes que ocorra uma falha completa. |
|
|
Baseado em métricas |
ARMS |
Observe a frequência normal de checkpoints e defina o limiar abaixo da contagem mínima aceitável |
Contagens consistentemente baixas de checkpoints podem sinalizar progresso insuficiente do job. |
|
|
Baseado em métricas |
ARMS |
Observe a latência normal e defina o limiar acima do máximo aceitável |
Use alertas de métricas combinadas para monitorar a latência com mais confiabilidade. Consulte Configurações de monitoramento recomendadas. |
|
Eventos de falha de job ( |
Baseado em eventos |
Cloud Monitor |
N/A |
Alertas de falha de job baseados em eventos complementam os alertas baseados em métricas e podem incluir eventos de sistema do ECS. |
Para determinar os limiares de alertas baseados em métricas, monitore sua aplicação em condições operacionais normais primeiro. Use essas observações como linha de base antes de definir os limiares de alerta.
Configure regras de alerta com o Cloud Monitor
Pré-requisitos
Para configure regras de alerta com o Cloud Monitor, faça login com sua conta Alibaba Cloud ou como uma identidade RAM com as permissões necessárias no namespace de destino.
Alertas baseados em métricas
Use alertas baseados em métricas para monitorar indicadores-chave de desempenho, como uso de CPU, latência ou throughput, em jobs individuais ou em lote.
Faça login no console do Cloud Monitor.
No painel de navegação à esquerda, escolha Alerts > Alert Rules.
-
Clique em Create Alert Rule e configure os parâmetros a seguir. Para outros parâmetros, consulte Criar uma regra de alerta.
Alertas de métrica única podem causar falsos positivos ou negativos em produção. Alertas de métricas combinadas oferecem uma visão mais precisa das anomalias reais de negócio. Para detalhes, consulte Configurações de monitoramento recomendadas .
Parâmetro
Descrição
Product
Selecione Flink.
Resource Range
Selecione Instances. A regra de alerta se aplica a um workspace específico do Flink.
Associated Resources
Clique em Add Instance. Na caixa de diálogo, selecione sua região e workspace (como visualize o ID do seu workspace) e clique em OK.
Rule Description
Clique em +Add Rule > Simple Metric ou Combined Metrics para abrir o painel Configure Rule Description. Após selecione uma métrica, a seção Dimension será exibida. Configure namespace e deploymentId para monitorar uma implantação de job específica ou deixe-os em branco para monitorar todas as implantações de jobs em todos os namespaces. Se as listas suspensas estiverem vazias, insira os valores manualmente.
Clique em OK.
Alertas baseados em eventos
Use alertas baseados em eventos para receber notificações quando ocorrerem eventos específicos de sistema ou de workflow, como uma falha de job.
Alertas de eventos de sistema
Inscreva-se em eventos de sistema para jobs individuais ou múltiplos.
Faça login no console do Cloud Monitor.
No painel de navegação à esquerda, escolha Event Center > Event Subscription.
Na aba Subscription Policy, clique em Create Subscription Policy.
-
Na página Create Subscription Policy, configure os parâmetros a seguir. Para outros parâmetros, consulte Gerencie inscrições de eventos (Recomendado).
Deixar Application group , Event Content ou Event Resources em branco aplica a inscrição a todos os workspaces da sua conta.
Parâmetro
Descrição
Subscription Type
Selecione System Events.
Products
Selecione Flink.
Event name
Eventos suportados:
JOB_FAILED,ECS.SystemFailureeECS.SystemMaintenance.Event Content
Opcionalmente, restrinja o alerta a recursos específicos: <br>- Workspace ID: aplica a regra a todos os jobs nesse workspace. Para obter o ID do seu workspace, consulte Visualize informações do workspace <br>- Namespace name: aplica a regra a todos os jobs nesse namespace. <br>- Deployment name: aplica a regra a implantações de jobs específicas. Separe vários nomes por vírgulas (
,). Use o ID da implantação quando existirem nomes duplicados. <br>- Deployment ID: aplica a regra a implantações de jobs específicas. Separe vários IDs por vírgulas (,). Obtenha o ID da implantação na página de detalhes da implantação.
Alertas de eventos de workflow
Inscreva-se em eventos de mudança de estado de workflow. Para detalhes sobre workflows, consulte Gerencie workflows.
Etapa 1: Obter o ID do recurso da tarefa de workflow
Faça login no console do Cloud Monitor.
No painel de navegação à esquerda, escolha Event Center > System Event.
Na aba Event Monitoring, defina SelectProduct como Flink, defina SelectEvent Name como
flink:Workflow:TaskStateChangee clique em Search.-
Nos resultados, localize o ID do recurso da sua tarefa de workflow. O ID do recurso segue este formato:
As mudanças de estado de tarefas de workflow geralmente aparecem no Cloud Monitor com alguns minutos de atraso.
Espaço reservado
Descrição
<AlibabaCloudAccountID>O ID da conta Alibaba Cloud proprietária do workspace do Flink.
<workspaceId-namespaceId>O ID do workspace e o nome do namespace unidos por um hífen (
-). Para o ID do workspace, consulte Visualize informações do workspace.<workflowDefinitionName>O nome do workflow.
<taskDefinitionName>O nome da tarefa do workflow.
acs:flink:cn-hangzhou:<AlibabaCloudAccountID>:resourceId/workspaceId/<workspaceId-namespaceId>#workflowDefinitionName/<workflowDefinitionName>#taskDefinitionName/<taskDefinitionName>Você também pode construir o ID do recurso diretamente usando este formato, em vez de pesquisá-lo.

Etapa 2: Crie uma inscrição de evento
No painel de navegação à esquerda, escolha Event Center > Event Subscription.
Na aba Subscription Policy, clique em Create Subscription Policy.
-
Configure os parâmetros a seguir. Para outros parâmetros, consulte Gerencie inscrições de eventos (Recomendado).
Parâmetro
Valor
Subscription Type
System Events
Products
Flink
Event name
flink:Workflow:TaskStateChangeEvent Content
Filtre pelo estado de transição alvo. Exemplos:
toState: FAILED,toState: SUCCESS,fromState: SCHEDULED, toState: RUNNING.Event Resources
Insira o ID do recurso da Etapa 1. Separe vários IDs por vírgulas (
,).Event Type, Event Level, Application group
Deixe em branco.
Configure regras de alerta com o ARMS
O ARMS suporta regras de alerta para seis métricas principais em implantações de jobs individuais. Para monitorar várias métricas em uma única regra, use uma instrução PromQL personalizada para crie uma regra de alerta. Para uma cobertura mais ampla em vários jobs, configure regras de alerta com o Cloud Monitor.
O Development Console exibe eventos de alerta apenas das últimas 48 horas. Para histórico de alertas mais antigo, acesse Alert Management no console do ARMS.
Alertas baseados em métricas
Configuração de job único (Development Console)
Configure regras de alerta para um job específico no Development Console, seja do zero ou a partir de um modelo.
Faça login no Management Console do Realtime Compute for Apache Flink e clique em Console na coluna Actions do seu workspace.
No painel de navegação à esquerda, escolha O&M > Deployments e clique na sua implantação de job.
Selecione a aba Alarm e, em seguida, a subaba Alarm Rules.
Clique em Add Rule > Custom Rule (ou Create Rule by Template).
-
Insira as informações da regra de alerta. Seção Content Configure as condições que disparam o alerta. O Flink compara periodicamente os valores reais das métricas com o limiar e dispara um alerta quando uma condição é atendida. Exemplo: Monitorar
Checkpoint Count in 5 Minutescom intervalo de tempo de 10 minutos, limiar de 2 e comparador<=— o Flink verifica a cada minuto durante uma janela de 10 minutos e dispara um alerta se a contagem mínima de checkpoints bem-sucedidos em qualquer período de 5 minutos cair para 2 ou menos. Effective Time A janela de tempo em que a regra de alerta está ativa. O padrão é o dia todo. Restrinja a horários específicos, se necessário, como horário comercial (9h–18h). Alarm Rate O intervalo entre notificações de alerta repetidas, em minutos. Intervalo: 1–1440 minutos (24 horas).Seção Rule
Parâmetro
Descrição
Name
O nome da regra de alerta. Deve começar com uma letra e pode conter letras minúsculas, dígitos e sublinhados (
_). Comprimento: 3–64 caracteres.Description
Notas opcionais sobre a regra.
Parâmetro
Descrição
Metric
A métrica a ser monitorada. Consulte Referência de métricas para opções disponíveis e suas lógicas de alerta.
Time Interval
A duração da janela de dados históricos consultada em cada verificação, em minutos.
Comparator
>=compara o valor máximo da métrica com o limiar; alerta quandomax_value >= threshold.<=compara o valor mínimo da métrica; alerta quandomin_value <= threshold.Thresholds
O valor a ser comparado com a métrica. Monitore sua aplicação em condições normais para determinar uma linha de base apropriada antes de definir este valor.
Notification section
Parâmetro
Descrição
Notification
Selecione um ou mais métodos de notificação: DingTalk, Email, SMS, Webhook ou Phone. Cada método selecionado deve ter um objeto de notificação correspondente configurado. Para notificações por Phone, certifique-se de que o número do destinatário esteja verificado — se a tag Unverified aparecer na aba Contacts, clique nela para concluir a verificação.
ImportanteGaranta que o método de notificação escolhido tenha um objeto de notificação correspondente configurado. Para DingTalk, isso significa adicionar um objeto de notificação de robô DingTalk após selecione DingTalk como método.
Notification object
Selecione um ou mais objetos de notificação. Clique em Notification object management para crie objetos. Para detalhes, consulte Perguntas frequentes sobre workspace e namespace.
Advanced Settings
Opção
Descrição
Alarm Noise Reduction
Quando ativado, os alertas disparam apenas quando o limiar é atingido continuamente. Isso evita ruídos causados por problemas temporários, como failovers breves durante o agendamento de cluster ou ajuste automático.
No Data Alarms
Dispara um alerta se nenhum dado de monitoramento for relatado dentro da duração especificada. Causas comuns: exceções no JobManager, paradas de job ou falhas no pipeline de relatórios.
Clique em OK. A regra de alerta é ativada automaticamente e aparece na lista de regras de alerta. Você pode parar, edite ou exclua regras na lista.
Configuração de job único/múltiplos jobs (consoles Prometheus)
Alterar o nome de uma implantação de job no Development Console invalida as regras de alerta do ARMS. Para que as regras entrem em vigor, escolha a implantação alvo e configure o alerta novamente.
Faça login no Management Portal do Realtime Compute for Apache Flink.
-
Na coluna Actions do seu workspace, escolha para acesse o console do ARMS.
O nome do workspace, o ID do workspace e o nome da instância Prometheus correspondente são exibidos na parte superior.

-
No painel de navegação à esquerda, clique em Alert rules e clique em Create Prometheus Alert Rule.

Check Type: Suporta alertas baseados em limiares estáticos e PromQL personalizado (excluindo métricas integradas do Flink).
Filter Conditions: Suporta a configuração de alertas para múltiplos jobs. Para Namespace, insira o nome do namespace. Se você selecione All, a regra se aplica a todos os namespaces no workspace. Para Deployment, insira o Deployment Job ID do job desejado no namespace. Você pode encontrar esse ID na aba Deployment Details do job Flink. Se você selecione All, a regra se aplica a todos os jobs no namespace.
Para mais informações sobre outros parâmetros de configuração, consulte Crie uma regra de alerta Prometheus. Você também pode crie um modelo de regra de alerta Prometheus. Para mais informações, consulte Crie um modelo de regra de alerta Prometheus.
Referência de métricas
|
Métrica |
Descrição |
Unidade |
Quando alertar |
Ação sugerida ao disparar |
|
|
Número de reinicializações do job no último minuto. |
Contagem |
Quando as reinicializações excederem a linha de base normal |
Verifique os logs do job para identificar as causas raiz. Reinicializações repetidas podem indicar contenção de recursos ou exceções no código. |
|
|
Número de checkpoints bem-sucedidos em qualquer janela de 5 minutos. |
Contagem |
Quando a contagem cair abaixo do nível mínimo aceitável |
Investigue falhas de checkpoint. Causas comuns: memória insuficiente, backpressure ou armazenamento de estado lento. |
|
|
Latência de negócio desde a geração de dados até a saída da source. A precisão depende dos timestamps dos sistemas upstream — configure alertas de métricas combinadas para um monitoramento de latência mais confiável. Consulte Configurações de monitoramento recomendadas. |
Segundos |
Quando a latência exceder a tolerância da sua aplicação |
Verifique backpressure na source, gargalos no sink downstream ou saturação de recursos. |
|
|
Registros de entrada por segundo. |
Registros/s |
Quando o throughput cair inesperadamente abaixo da linha de base normal |
Verifique a conectividade da source e a disponibilidade de dados upstream. |
|
|
Registros de saída por segundo. |
Registros/s |
Quando o throughput cair inesperadamente abaixo da linha de base normal |
Verifique a conectividade do sink e a integridade do sistema downstream. |
|
|
Duração em que o operador de source não processou dados. |
Milissegundos |
Quando o tempo ocioso exceder sua tolerância para lacunas de dados |
Verifique se a source de dados upstream parou de produzir dados ou se o conector de source travou. |
|
|
Dispara quando o job falha. Use esta métrica para configure um alerta de falha de job. |
— |
Qualquer falha |
Revise os logs do job e reinicie-o. Se o problema persistir, verifique limites de recursos e exceções de código. |
Alertas baseados em eventos
O ARMS suporta alertas baseados em eventos apenas para eventos de falha de job. Para configure um alerta de falha de job, siga as etapas de alerta baseado em métricas e selecione Job Failed como métrica.
Para outros tipos de evento, use alertas baseados em eventos do Cloud Monitor.
Perguntas frequentes
Como verifico o tipo de serviço de monitoramento do meu workspace?
Como adiciono um robô DingTalk para alertas no Development Console?
-
Adicionar um robô DingTalk personalizado e obter sua URL de webhook.
ImportanteEm Security Settings, selecione Custom Keywords e defina pelo menos uma palavra-chave como Alert para receber mensagens de alerta.
-
Adicione um objeto de notificação.
Acesse O&M > Deployments, clique no nome da sua implantação de job e selecione a aba Alarm.
Clique em Add Rule > Custom Rule ou Create Rule by Template.
No painel, clique em Notification object management.

Na caixa de diálogo, selecione a aba DingTalk e clique em Add DingTalk. Insira o nome do robô e a URL do webhook e clique em Submit.
No painel Create Rule ou Create Rule Template, defina Notification como DingTalk e Notification object como seu robô DingTalk.
Clique em OK.
Como crie um webhook no Development Console?
No painel Create Rule ou Create Rule Template, clique em Notification object management.
Selecione a aba Webhook e clique em Add Webhook.
-
Preencha os detalhes do webhook.
Parâmetro
Obrigatório
Descrição
Name
Sim
O nome do webhook.
URL
Sim
A URL do endpoint do webhook.
Headers
Não
Cabeçalhos de solicitação para cookies ou tokens. Formato:
key: value(espaço após os dois pontos).Params
Não
Parâmetros de solicitação. Formato:
key: value(espaço após os dois pontos).Body
Sim
O corpo da solicitação POST. Use o espaço reservado
$contentpara incluir o conteúdo do alerta no corpo. Clique em OK.
