Todos os produtos
Search
Central de documentação

Realtime Compute for Apache Flink:Configurar regras de alerta

Última atualização: Jun 27, 2026

O Realtime Compute for Apache Flink oferece dois serviços de monitoramento: Cloud Monitor (gratuito) e Managed Service for Prometheus (ARMS). Ambos disponibilizam alertas baseados em métricas e em eventos. Este guia orienta você na configuração de regras de alerta para ambos os serviços.

Limitações

  • Regras de alerta não são suportadas em jobs do Flink executados em clusters de sessão.

  • Jobs em lote não suportam regras de alerta.

  • Alertas de workflow estão disponíveis apenas no Cloud Monitor.

  • Os alertas baseados em eventos do ARMS aceitam somente eventos Job Failed. Para outros tipos de evento, use o Cloud Monitor.

Escolha o serviço de monitoramento

Seu workspace utiliza o Cloud Monitor ou o ARMS, dependendo da seleção feita durante a criação. Para verifique qual serviço seu workspace usa, consulte Como verifico o tipo de serviço de monitoramento do meu workspace?.

Tipo de alerta

Cloud Monitor

ARMS

Baseado em métricas

Métricas principais; aplica-se a jobs individuais ou em lote

Seis métricas principais; apenas job individual

Baseado em eventos

JOB_FAILED, ECS.SystemFailure, ECS.SystemMaintenance e eventos de workflow

Apenas Job Failed

Para alterar o serviço de monitoramento do seu workspace, clique em image na coluna Actions do seu workspace no Management Console.

Leia atentamente a mensagem antes de confirmar a alteração.

Alertas recomendados

Antes de iniciar a configuração, a tabela a seguir resume os alertas recomendados para a maioria das implantações do Flink. Configure-os primeiro para estabelecer uma base de monitoramento.

Métrica

Tipo de alerta

Serviço

Limiar recomendado

Importância

Job Failed

Baseado em métricas

Cloud Monitor ou ARMS

Qualquer falha (>= 1)

Dispara imediatamente quando um job falha. Recomendado para todas as aplicações.

Restart Count in 1 Minute

Baseado em métricas

ARMS

Observe sua aplicação em condições normais e defina o limiar acima da taxa normal de reinicializações

Reinicializações repetidas podem indicar instabilidade antes que ocorra uma falha completa.

Checkpoint Count in 5 Minutes

Baseado em métricas

ARMS

Observe a frequência normal de checkpoints e defina o limiar abaixo da contagem mínima aceitável

Contagens consistentemente baixas de checkpoints podem sinalizar progresso insuficiente do job.

Emit Delay

Baseado em métricas

ARMS

Observe a latência normal e defina o limiar acima do máximo aceitável

Use alertas de métricas combinadas para monitorar a latência com mais confiabilidade. Consulte Configurações de monitoramento recomendadas.

Eventos de falha de job (JOB_FAILED)

Baseado em eventos

Cloud Monitor

N/A

Alertas de falha de job baseados em eventos complementam os alertas baseados em métricas e podem incluir eventos de sistema do ECS.

Para determinar os limiares de alertas baseados em métricas, monitore sua aplicação em condições operacionais normais primeiro. Use essas observações como linha de base antes de definir os limiares de alerta.

Configure regras de alerta com o Cloud Monitor

Pré-requisitos

Para configure regras de alerta com o Cloud Monitor, faça login com sua conta Alibaba Cloud ou como uma identidade RAM com as permissões necessárias no namespace de destino.

Alertas baseados em métricas

Use alertas baseados em métricas para monitorar indicadores-chave de desempenho, como uso de CPU, latência ou throughput, em jobs individuais ou em lote.

  1. Faça login no console do Cloud Monitor.

  2. No painel de navegação à esquerda, escolha Alerts > Alert Rules.

  3. Clique em Create Alert Rule e configure os parâmetros a seguir. Para outros parâmetros, consulte Criar uma regra de alerta.

    Alertas de métrica única podem causar falsos positivos ou negativos em produção. Alertas de métricas combinadas oferecem uma visão mais precisa das anomalias reais de negócio. Para detalhes, consulte Configurações de monitoramento recomendadas .

    Parâmetro

    Descrição

    Product

    Selecione Flink.

    Resource Range

    Selecione Instances. A regra de alerta se aplica a um workspace específico do Flink.

    Associated Resources

    Clique em Add Instance. Na caixa de diálogo, selecione sua região e workspace (como visualize o ID do seu workspace) e clique em OK.

    Rule Description

    Clique em +Add Rule > Simple Metric ou Combined Metrics para abrir o painel Configure Rule Description. Após selecione uma métrica, a seção Dimension será exibida. Configure namespace e deploymentId para monitorar uma implantação de job específica ou deixe-os em branco para monitorar todas as implantações de jobs em todos os namespaces. Se as listas suspensas estiverem vazias, insira os valores manualmente.

  4. Clique em OK.

Alertas baseados em eventos

Use alertas baseados em eventos para receber notificações quando ocorrerem eventos específicos de sistema ou de workflow, como uma falha de job.

Alertas de eventos de sistema

Inscreva-se em eventos de sistema para jobs individuais ou múltiplos.

  1. Faça login no console do Cloud Monitor.

  2. No painel de navegação à esquerda, escolha Event Center > Event Subscription.

  3. Na aba Subscription Policy, clique em Create Subscription Policy.

  4. Na página Create Subscription Policy, configure os parâmetros a seguir. Para outros parâmetros, consulte Gerencie inscrições de eventos (Recomendado).

    Deixar Application group , Event Content ou Event Resources em branco aplica a inscrição a todos os workspaces da sua conta.

    Parâmetro

    Descrição

    Subscription Type

    Selecione System Events.

    Products

    Selecione Flink.

    Event name

    Eventos suportados: JOB_FAILED, ECS.SystemFailure e ECS.SystemMaintenance.

    Event Content

    Opcionalmente, restrinja o alerta a recursos específicos: <br>- Workspace ID: aplica a regra a todos os jobs nesse workspace. Para obter o ID do seu workspace, consulte Visualize informações do workspace <br>- Namespace name: aplica a regra a todos os jobs nesse namespace. <br>- Deployment name: aplica a regra a implantações de jobs específicas. Separe vários nomes por vírgulas (,). Use o ID da implantação quando existirem nomes duplicados. <br>- Deployment ID: aplica a regra a implantações de jobs específicas. Separe vários IDs por vírgulas (,). Obtenha o ID da implantação na página de detalhes da implantação.

    image

Alertas de eventos de workflow

Inscreva-se em eventos de mudança de estado de workflow. Para detalhes sobre workflows, consulte Gerencie workflows.

Etapa 1: Obter o ID do recurso da tarefa de workflow

  1. Faça login no console do Cloud Monitor.

  2. No painel de navegação à esquerda, escolha Event Center > System Event.

  3. Na aba Event Monitoring, defina SelectProduct como Flink, defina SelectEvent Name como flink:Workflow:TaskStateChange e clique em Search.

  4. Nos resultados, localize o ID do recurso da sua tarefa de workflow. O ID do recurso segue este formato:

    As mudanças de estado de tarefas de workflow geralmente aparecem no Cloud Monitor com alguns minutos de atraso.

    Espaço reservado

    Descrição

    <AlibabaCloudAccountID>

    O ID da conta Alibaba Cloud proprietária do workspace do Flink.

    <workspaceId-namespaceId>

    O ID do workspace e o nome do namespace unidos por um hífen (-). Para o ID do workspace, consulte Visualize informações do workspace.

    <workflowDefinitionName>

    O nome do workflow.

    <taskDefinitionName>

    O nome da tarefa do workflow.

    acs:flink:cn-hangzhou:<AlibabaCloudAccountID>:resourceId/workspaceId/<workspaceId-namespaceId>#workflowDefinitionName/<workflowDefinitionName>#taskDefinitionName/<taskDefinitionName>

    Você também pode construir o ID do recurso diretamente usando este formato, em vez de pesquisá-lo.

    workflow alert

Etapa 2: Crie uma inscrição de evento

  1. No painel de navegação à esquerda, escolha Event Center > Event Subscription.

  2. Na aba Subscription Policy, clique em Create Subscription Policy.

  3. Configure os parâmetros a seguir. Para outros parâmetros, consulte Gerencie inscrições de eventos (Recomendado).

    Parâmetro

    Valor

    Subscription Type

    System Events

    Products

    Flink

    Event name

    flink:Workflow:TaskStateChange

    Event Content

    Filtre pelo estado de transição alvo. Exemplos: toState: FAILED, toState: SUCCESS, fromState: SCHEDULED, toState: RUNNING.

    Event Resources

    Insira o ID do recurso da Etapa 1. Separe vários IDs por vírgulas (,).

    Event Type, Event Level, Application group

    Deixe em branco.

Configure regras de alerta com o ARMS

O ARMS suporta regras de alerta para seis métricas principais em implantações de jobs individuais. Para monitorar várias métricas em uma única regra, use uma instrução PromQL personalizada para crie uma regra de alerta. Para uma cobertura mais ampla em vários jobs, configure regras de alerta com o Cloud Monitor.

O Development Console exibe eventos de alerta apenas das últimas 48 horas. Para histórico de alertas mais antigo, acesse Alert Management no console do ARMS.

Alertas baseados em métricas

Configuração de job único (Development Console)

Configure regras de alerta para um job específico no Development Console, seja do zero ou a partir de um modelo.

  1. Faça login no Management Console do Realtime Compute for Apache Flink e clique em Console na coluna Actions do seu workspace.

  2. No painel de navegação à esquerda, escolha O&M > Deployments e clique na sua implantação de job.

  3. Selecione a aba Alarm e, em seguida, a subaba Alarm Rules.

  4. Clique em Add Rule > Custom Rule (ou Create Rule by Template).

  5. Insira as informações da regra de alerta. Seção Content Configure as condições que disparam o alerta. O Flink compara periodicamente os valores reais das métricas com o limiar e dispara um alerta quando uma condição é atendida. Exemplo: Monitorar Checkpoint Count in 5 Minutes com intervalo de tempo de 10 minutos, limiar de 2 e comparador <= — o Flink verifica a cada minuto durante uma janela de 10 minutos e dispara um alerta se a contagem mínima de checkpoints bem-sucedidos em qualquer período de 5 minutos cair para 2 ou menos. Effective Time A janela de tempo em que a regra de alerta está ativa. O padrão é o dia todo. Restrinja a horários específicos, se necessário, como horário comercial (9h–18h). Alarm Rate O intervalo entre notificações de alerta repetidas, em minutos. Intervalo: 1–1440 minutos (24 horas).

    Seção Rule

    Parâmetro

    Descrição

    Name

    O nome da regra de alerta. Deve começar com uma letra e pode conter letras minúsculas, dígitos e sublinhados (_). Comprimento: 3–64 caracteres.

    Description

    Notas opcionais sobre a regra.

    Parâmetro

    Descrição

    Metric

    A métrica a ser monitorada. Consulte Referência de métricas para opções disponíveis e suas lógicas de alerta.

    Time Interval

    A duração da janela de dados históricos consultada em cada verificação, em minutos.

    Comparator

    >= compara o valor máximo da métrica com o limiar; alerta quando max_value >= threshold. <= compara o valor mínimo da métrica; alerta quando min_value <= threshold.

    Thresholds

    O valor a ser comparado com a métrica. Monitore sua aplicação em condições normais para determinar uma linha de base apropriada antes de definir este valor.

    Notification section

    Parâmetro

    Descrição

    Notification

    Selecione um ou mais métodos de notificação: DingTalk, Email, SMS, Webhook ou Phone. Cada método selecionado deve ter um objeto de notificação correspondente configurado. Para notificações por Phone, certifique-se de que o número do destinatário esteja verificado — se a tag Unverified aparecer na aba Contacts, clique nela para concluir a verificação.

    Importante

    Garanta que o método de notificação escolhido tenha um objeto de notificação correspondente configurado. Para DingTalk, isso significa adicionar um objeto de notificação de robô DingTalk após selecione DingTalk como método.

    Notification object

    Selecione um ou mais objetos de notificação. Clique em Notification object management para crie objetos. Para detalhes, consulte Perguntas frequentes sobre workspace e namespace.

    Advanced Settings

    Opção

    Descrição

    Alarm Noise Reduction

    Quando ativado, os alertas disparam apenas quando o limiar é atingido continuamente. Isso evita ruídos causados por problemas temporários, como failovers breves durante o agendamento de cluster ou ajuste automático.

    No Data Alarms

    Dispara um alerta se nenhum dado de monitoramento for relatado dentro da duração especificada. Causas comuns: exceções no JobManager, paradas de job ou falhas no pipeline de relatórios.

  6. Clique em OK. A regra de alerta é ativada automaticamente e aparece na lista de regras de alerta. Você pode parar, edite ou exclua regras na lista.

Configuração de job único/múltiplos jobs (consoles Prometheus)

Importante

Alterar o nome de uma implantação de job no Development Console invalida as regras de alerta do ARMS. Para que as regras entrem em vigor, escolha a implantação alvo e configure o alerta novamente.

  1. Faça login no Management Portal do Realtime Compute for Apache Flink.

  2. Na coluna Actions do seu workspace, escolha More > Monitoring Indicator Configuration para acesse o console do ARMS.

    O nome do workspace, o ID do workspace e o nome da instância Prometheus correspondente são exibidos na parte superior.

    image.png

  3. No painel de navegação à esquerda, clique em Alert rules e clique em Create Prometheus Alert Rule.

    image

    • Check Type: Suporta alertas baseados em limiares estáticos e PromQL personalizado (excluindo métricas integradas do Flink).

    • Filter Conditions: Suporta a configuração de alertas para múltiplos jobs. Para Namespace, insira o nome do namespace. Se você selecione All, a regra se aplica a todos os namespaces no workspace. Para Deployment, insira o Deployment Job ID do job desejado no namespace. Você pode encontrar esse ID na aba Deployment Details do job Flink. Se você selecione All, a regra se aplica a todos os jobs no namespace.

    Para mais informações sobre outros parâmetros de configuração, consulte Crie uma regra de alerta Prometheus. Você também pode crie um modelo de regra de alerta Prometheus. Para mais informações, consulte Crie um modelo de regra de alerta Prometheus.

Referência de métricas

Métrica

Descrição

Unidade

Quando alertar

Ação sugerida ao disparar

Restart Count in 1 Minute

Número de reinicializações do job no último minuto.

Contagem

Quando as reinicializações excederem a linha de base normal

Verifique os logs do job para identificar as causas raiz. Reinicializações repetidas podem indicar contenção de recursos ou exceções no código.

Checkpoint Count in 5 Minutes

Número de checkpoints bem-sucedidos em qualquer janela de 5 minutos.

Contagem

Quando a contagem cair abaixo do nível mínimo aceitável

Investigue falhas de checkpoint. Causas comuns: memória insuficiente, backpressure ou armazenamento de estado lento.

Emit Delay

Latência de negócio desde a geração de dados até a saída da source. A precisão depende dos timestamps dos sistemas upstream — configure alertas de métricas combinadas para um monitoramento de latência mais confiável. Consulte Configurações de monitoramento recomendadas.

Segundos

Quando a latência exceder a tolerância da sua aplicação

Verifique backpressure na source, gargalos no sink downstream ou saturação de recursos.

IN RPS

Registros de entrada por segundo.

Registros/s

Quando o throughput cair inesperadamente abaixo da linha de base normal

Verifique a conectividade da source e a disponibilidade de dados upstream.

OUT RPS

Registros de saída por segundo.

Registros/s

Quando o throughput cair inesperadamente abaixo da linha de base normal

Verifique a conectividade do sink e a integridade do sistema downstream.

Source Idle Time

Duração em que o operador de source não processou dados.

Milissegundos

Quando o tempo ocioso exceder sua tolerância para lacunas de dados

Verifique se a source de dados upstream parou de produzir dados ou se o conector de source travou.

Job Failed

Dispara quando o job falha. Use esta métrica para configure um alerta de falha de job.

Qualquer falha

Revise os logs do job e reinicie-o. Se o problema persistir, verifique limites de recursos e exceções de código.

Alertas baseados em eventos

O ARMS suporta alertas baseados em eventos apenas para eventos de falha de job. Para configure um alerta de falha de job, siga as etapas de alerta baseado em métricas e selecione Job Failed como métrica.

Para outros tipos de evento, use alertas baseados em eventos do Cloud Monitor.

Perguntas frequentes

Como verifico o tipo de serviço de monitoramento do meu workspace?

Você selecione o tipo de serviço de monitoramento ao crie um workspace. Para verifique após a criação, acesse O&M > Deployments e clique no nome da sua implantação de job. Se a aba Alarm aparecer, o workspace usa o ARMS. Se não aparecer, o workspace usa o Cloud Monitor.

image

Como adiciono um robô DingTalk para alertas no Development Console?

  1. Adicionar um robô DingTalk personalizado e obter sua URL de webhook.

    Importante

    Em Security Settings, selecione Custom Keywords e defina pelo menos uma palavra-chave como Alert para receber mensagens de alerta.

  2. Adicione um objeto de notificação.

    1. Acesse O&M > Deployments, clique no nome da sua implantação de job e selecione a aba Alarm.

    2. Clique em Add Rule > Custom Rule ou Create Rule by Template.

    3. No painel, clique em Notification object management. image.png

  3. Na caixa de diálogo, selecione a aba DingTalk e clique em Add DingTalk. Insira o nome do robô e a URL do webhook e clique em Submit.

  4. No painel Create Rule ou Create Rule Template, defina Notification como DingTalk e Notification object como seu robô DingTalk.

  5. Clique em OK.

Como crie um webhook no Development Console?

  1. No painel Create Rule ou Create Rule Template, clique em Notification object management.

  2. Selecione a aba Webhook e clique em Add Webhook.

  3. Preencha os detalhes do webhook.

    Parâmetro

    Obrigatório

    Descrição

    Name

    Sim

    O nome do webhook.

    URL

    Sim

    A URL do endpoint do webhook.

    Headers

    Não

    Cabeçalhos de solicitação para cookies ou tokens. Formato: key: value (espaço após os dois pontos).

    Params

    Não

    Parâmetros de solicitação. Formato: key: value (espaço após os dois pontos).

    Body

    Sim

    O corpo da solicitação POST. Use o espaço reservado $content para incluir o conteúdo do alerta no corpo.

  4. Clique em OK.

Como adiciono um robô Lark para alertas no Development Console do Realtime Compute?

  1. Na página Alert Template ou Rule Information, clique em Notification Object Management.

  2. Na aba Webhook, clique em Create Webhook.

  3. Na página Create Webhook, insira as informações do webhook.

    Parâmetro

    Descrição

    Name

    Obrigatório. O nome do webhook.

    URL

    Obrigatório. O endpoint do serviço web. Para mais informações sobre o parâmetro, consulte o Guia de Bot Personalizado do Lark para obter o endereço do webhook do robô Lark.

    Headers

    Opcional. O cabeçalho da solicitação, usado para armazenar informações de cookie e token. O formato é key: value.

    Por exemplo: Arms-Content-Type: json

    Content-Type: application/json

    Nota

    Certifique-se de que haja um espaço após os dois pontos entre a chave e o valor.

    Params

    Opcional. Os parâmetros da solicitação. O formato é key: value.

    Nota

    Certifique-se de que haja um espaço após os dois pontos entre a chave e o valor.

    Body

    Obrigatório. O corpo da solicitação, usado para armazenar parâmetros e dados POST.

    Você pode usar o espaço reservado $content na string Body para gerar o conteúdo do alerta.

    Por exemplo: {"msg_type":"text","content": {"text":"$content"}}

  4. Clique em OK.

Próximos passos