Todos os produtos
Search
Central de documentação

Realtime Compute for Apache Flink:Executar diagnósticos inteligentes de jobs

Última atualização: Jul 07, 2026

O Flink Advisor diagnostica seus deployments do Realtime Compute for Apache Flink analisando logs, eventos, métricas e configurações em tempo real. Ele monitora a integridade do deployment durante todo o ciclo de vida, detecta exceções e riscos e fornece sugestões práticas de otimização para reduzir o tempo de solução de problemas e o tempo médio de reparo (MTTR).

image..png

Limitações

Somente deployments de streaming oferecem suporte a diagnósticos inteligentes. Não há suporte para deployments em lote.

Como funciona

O Flink Advisor avalia continuamente o status de integridade do seu deployment. A pontuação de integridade começa em 100 e diminui conforme a quantidade e a gravidade dos riscos detectados nos últimos 30 minutos.

Essa pontuação aparece como um selo colorido na lista de deployments:

Cor

Faixa de pontuação

Significado

Verde

Acima de 80

Sem riscos potenciais. O sistema pode fornecer sugestões de configuração.

Amarelo

60–80

Problemas ou riscos potenciais detectados. Revise o deployment.

Vermelho

Abaixo de 60

Problemas graves detectados. Aja imediatamente para evitar o cancelamento do deployment.

Diagnosticar logs de exceção de um rascunho

Use este fluxo de trabalho para diagnosticar erros de SQL antes de publicar um deployment.

  1. Faça login no console do Realtime Compute for Apache Flink. Localize o workspace que deseja gerenciar e clique em Console na coluna Actions.

  2. No painel de navegação à esquerda, escolha Development > ETL. Crie um rascunho, escreva suas instruções SQL e clique em Validate.

  3. Na parte inferior da página do SQL Editor, revise os detalhes do erro, as possíveis causas e as sugestões de otimização.

    Por exemplo, a seção Deep Check exibe um ícone de erro vermelho com um status de verificação (como "SQL syntax and network connectivity check failed") e mensagens de erro detalhadas. A seção Analysis Result lista possíveis causas (como "The table or view referenced in the SQL statement does not exist") e soluções sugeridas (como "Verify that the table or view name has been created"). Uma seção recolhível de SQL Optimization aparece na parte inferior da página.

    Caso não consiga identificar a causa pelos resultados da verificação de sintaxe, selecione os logs relacionados e clique em Search in Documentation para encontrar informações relevantes.

Diagnosticar logs de exceção de um deployment

Siga este fluxo de trabalho para investigar exceções no nível de log em um deployment em execução ou com falha.

  1. Faça login no console do Realtime Compute for Apache Flink. Encontre o workspace que deseja gerenciar e clique em Console na coluna Actions.

  2. No painel de navegação à esquerda, escolha O&M > Deployments. Clique no nome do deployment que deseja investigar.

  3. Clique na aba Logs. No painel à esquerda, clique em Logs, Startup Logs ou JM Exceptions para visualizar os logs relevantes.

    A área principal exibe o rastreamento de pilha da exceção. Abaixo dela, a seção Analysis based on current logs lista possíveis causas e soluções sugeridas. Na parte inferior, uma tabela Exception History mostra exceções históricas com horário da primeira ocorrência, nome, tipo de exceção e contagem de ocorrências.

Para obter mais informações sobre tipos de log, consulte Visualizar os logs de inicialização e logs operacionais de um deployment. Para investigar logs de exceção, consulte Visualizar os logs de exceção de um deployment. Para acessar registros históricos, consulte Visualizar os logs de um deployment histórico.

Executar diagnósticos inteligentes em um deployment anormal

Use este fluxo de trabalho quando um deployment estiver em estado anormal e você precisar identificar a causa raiz.

  1. Acesse a aba Diagnosis usando um destes métodos:

    • Na lista de deployments, localize o deployment e clique em sua pontuação na coluna Health.

    • Clique no nome do deployment e, em seguida, clique na aba Diagnosis.

    Na página Diagnosis, visualize o Health Score (por exemplo, 99) e o horário do diagnóstico. Clique em Diagnose para executar uma verificação. Os resultados mostram o número total de itens verificados (por exemplo, 5). Categorias como Resource Analysis podem exigir atenção, enquanto Startup Analysis, Deployment Analysis, State Analysis e Exception Analysis passam na verificação.

  2. Clique em Diagnose. O Flink Advisor fornece diversos repositórios de logs para exceções do Flink. Para obter a lista completa de itens de diagnóstico e etapas de correção, consulte Itens de diagnóstico do Flink Advisor.

  3. Revise os resultados do diagnóstico e as sugestões de otimização. Para aplicar uma sugestão, clique em Apply ao lado dela.

Itens de diagnóstico do Flink Advisor

Os itens de diagnóstico dividem-se em duas categorias:

  • Exception: A execução do deployment é afetada. Ação imediata necessária.

  • Risk: O deployment está em execução, mas um problema potencial foi detectado. Resolva-o proativamente para evitar falhas futuras.

Tipo

Fase

Item de diagnóstico

Descrição

Exception (execução do deployment afetada)

Inicialização

Análise de arquivo de inicialização

O pacote JAR necessário está ausente no diretório do Object Storage Service (OSS). Carregue novamente o pacote JAR antes de iniciar o deployment.

Inicialização

Análise de recursos

Recursos disponíveis insuficientes. Reduza os valores de configuração de recursos do deployment ou escale horizontalmente o cluster.

Inicialização

Análise de recursos

Falha na vinculação da Container Network Interface (CNI) ao deployment. Verifique se o número de endereços IP do vSwitch relacionado atingiu o limite superior.

Inicialização

Análise de recursos

O número de endereços IP da Elastic Network Interface (ENI) excede o limite superior. Aumente o número de ENIs e tente novamente.

Inicialização

Análise de rede de topologia

Nenhuma conexão de rede estabelecida entre o TaskManager e o JobManager. O deployment está anormal.

Inicialização

Análise de rede de topologia

A vinculação da ENI às instâncias do Elastic Compute Service (ECS) expirou nos últimos 10 minutos. O deployment está iniciando lentamente. Aguarde a conclusão da operação.

Inicialização

Análise de rede de serviços upstream e downstream

Detecção de porta TCP normal, mas o conector upstream ou downstream não está conectado. Verifique as configurações de rede dos serviços upstream e downstream.

Inicialização

Detecção de permissões de serviços upstream e downstream

Fonte de dados upstream desconectada. Verifique a configuração de permissões do serviço upstream.

Inicialização

Detecção de permissões de serviços upstream e downstream

Fonte de dados downstream desconectada. Verifique a configuração de permissões do serviço downstream.

Inicialização

Análise de velocidade de inicialização

Pacote JAR excessivamente grande, causando inicialização lenta. Compacte o pacote JAR e carregue-o novamente ou aguarde a conclusão da inicialização.

Inicialização

Verificação do JobGraph

Possível ausência do arquivo de configuração de uma versão anterior do Realtime Compute for Apache Flink. O deployment pode não se recuperar após um failover. Cancele e reinicie manualmente o deployment.

Inicialização

Verificação de cluster de sessão

Um cluster de sessão de uma versão anterior do Realtime Compute for Apache Flink pode estar anormal, causando anomalias no deployment.

Ícone de execução

Verificação de status de alta disponibilidade (HA)

HA desativado. O deployment não consegue se recuperar após uma falha. Publique o rascunho novamente e, em seguida, cancele e reinicie manualmente o deployment.

Ícone de execução

Verificação de checkpoint

O recurso de checkpoint de uma versão anterior do Realtime Compute for Apache Flink pode estar anormal, causando falha na criação de checkpoints.

Ícone de execução

Detecção de permissões de serviços upstream e downstream

Detecção de porta TCP normal, mas o conector upstream ou downstream não está conectado. Verifique as configurações de permissões dos serviços upstream e downstream.

Ícone de execução

Verificação de status de execução

Erro de falta de memória (OOM) em um TaskManager. Verifique a configuração do deployment e aumente a memória do TaskManager.

Cancelamento

Análise de velocidade de cancelamento

Cancelamento lento em uma versão anterior do Realtime Compute for Apache Flink. Cancele e reinicie manualmente o deployment.

Risk (execução do deployment não afetada)

Configurações

Verificação do JobGraph

Deployment em execução normal. Contudo, o arquivo de configuração de uma versão anterior pode estar ausente. O deployment pode não se recuperar após uma falha. Cancele e reinicie manualmente o deployment.

Configurações

Verificação de status de HA

Deployment em execução normal. Contudo, o HA está desativado. O deployment pode não se recuperar após uma falha. Publique o rascunho novamente e, em seguida, cancele e reinicie manualmente o deployment.

Configurações

Verificação de versão

Deployment em execução normal. Contudo, um defeito grave foi detectado na versão atual do Realtime Compute for Apache Flink.

Ícone de execução

Verificação de checkpoint

Deployment em execução normal. Contudo, uma exceção de checkpoint em uma versão anterior do Realtime Compute for Apache Flink pode causar instabilidade potencial.

Ícone de execução

Verificação de checkpoint

Deployment em execução normal. Contudo, nenhum checkpoint foi criado por um longo período.

Ícone de execução

Análise de velocidade de cancelamento

Deployment em execução normal. Contudo, risco detectado de cancelamento lento em uma versão anterior do Realtime Compute for Apache Flink. Cancele e reinicie manualmente o deployment.

Ícone de execução

Análise de ambiente de execução

Failover do deployment devido a exceção na máquina host. Restauração automática após o failover. Nenhuma ação necessária.

Ícone de execução

Análise de ambiente de execução

Atualização de máquina pode causar failover do deployment em alguns minutos. Restauração automática após o failover. Para evitar isso, cancele e reinicie manualmente o deployment antes da atualização da máquina.

Ícone de execução

Análise de ambiente de execução

Falha de hardware na máquina host. O deployment sofreu failover. Cancele e reinicie manualmente o deployment.

Ícone de execução

Verificação de versão

Versão em fim de suporte (EOS). Podem ocorrer problemas de estabilidade ou indisponibilidade de suporte ao produto. Para obter mais informações, consulte Operações do console.

Próximos passos

  • Monitore as métricas de desempenho do JobManager e do TaskManager para deployments em execução. Para obter mais informações, consulte Monitorar o desempenho do deployment.

  • Configure o ajuste automático para permitir que o sistema reconfigure os recursos automaticamente ou conforme programação. Para obter mais informações, consulte Ativar ajuste automático de desempenho.

  • Otimize deployments de Flink SQL ajustando as configurações do deployment e a lógica SQL. Para obter mais informações, consulte Otimizar Flink SQL.