O Flink Advisor diagnostica seus deployments do Realtime Compute for Apache Flink analisando logs, eventos, métricas e configurações em tempo real. Ele monitora a integridade do deployment durante todo o ciclo de vida, detecta exceções e riscos e fornece sugestões práticas de otimização para reduzir o tempo de solução de problemas e o tempo médio de reparo (MTTR).

Limitações
Somente deployments de streaming oferecem suporte a diagnósticos inteligentes. Não há suporte para deployments em lote.
Como funciona
O Flink Advisor avalia continuamente o status de integridade do seu deployment. A pontuação de integridade começa em 100 e diminui conforme a quantidade e a gravidade dos riscos detectados nos últimos 30 minutos.
Essa pontuação aparece como um selo colorido na lista de deployments:
|
Cor |
Faixa de pontuação |
Significado |
|
Verde |
Acima de 80 |
Sem riscos potenciais. O sistema pode fornecer sugestões de configuração. |
|
Amarelo |
60–80 |
Problemas ou riscos potenciais detectados. Revise o deployment. |
|
Vermelho |
Abaixo de 60 |
Problemas graves detectados. Aja imediatamente para evitar o cancelamento do deployment. |
Diagnosticar logs de exceção de um rascunho
Use este fluxo de trabalho para diagnosticar erros de SQL antes de publicar um deployment.
Faça login no console do Realtime Compute for Apache Flink. Localize o workspace que deseja gerenciar e clique em Console na coluna Actions.
No painel de navegação à esquerda, escolha Development > ETL. Crie um rascunho, escreva suas instruções SQL e clique em Validate.
-
Na parte inferior da página do SQL Editor, revise os detalhes do erro, as possíveis causas e as sugestões de otimização.
Por exemplo, a seção Deep Check exibe um ícone de erro vermelho com um status de verificação (como "SQL syntax and network connectivity check failed") e mensagens de erro detalhadas. A seção Analysis Result lista possíveis causas (como "The table or view referenced in the SQL statement does not exist") e soluções sugeridas (como "Verify that the table or view name has been created"). Uma seção recolhível de SQL Optimization aparece na parte inferior da página.
Caso não consiga identificar a causa pelos resultados da verificação de sintaxe, selecione os logs relacionados e clique em Search in Documentation para encontrar informações relevantes.
Diagnosticar logs de exceção de um deployment
Siga este fluxo de trabalho para investigar exceções no nível de log em um deployment em execução ou com falha.
Faça login no console do Realtime Compute for Apache Flink. Encontre o workspace que deseja gerenciar e clique em Console na coluna Actions.
No painel de navegação à esquerda, escolha O&M > Deployments. Clique no nome do deployment que deseja investigar.
-
Clique na aba Logs. No painel à esquerda, clique em Logs, Startup Logs ou JM Exceptions para visualizar os logs relevantes.
A área principal exibe o rastreamento de pilha da exceção. Abaixo dela, a seção Analysis based on current logs lista possíveis causas e soluções sugeridas. Na parte inferior, uma tabela Exception History mostra exceções históricas com horário da primeira ocorrência, nome, tipo de exceção e contagem de ocorrências.
Para obter mais informações sobre tipos de log, consulte Visualizar os logs de inicialização e logs operacionais de um deployment. Para investigar logs de exceção, consulte Visualizar os logs de exceção de um deployment. Para acessar registros históricos, consulte Visualizar os logs de um deployment histórico.
Executar diagnósticos inteligentes em um deployment anormal
Use este fluxo de trabalho quando um deployment estiver em estado anormal e você precisar identificar a causa raiz.
-
Acesse a aba Diagnosis usando um destes métodos:
Na lista de deployments, localize o deployment e clique em sua pontuação na coluna Health.
Clique no nome do deployment e, em seguida, clique na aba Diagnosis.
Na página Diagnosis, visualize o Health Score (por exemplo, 99) e o horário do diagnóstico. Clique em Diagnose para executar uma verificação. Os resultados mostram o número total de itens verificados (por exemplo, 5). Categorias como Resource Analysis podem exigir atenção, enquanto Startup Analysis, Deployment Analysis, State Analysis e Exception Analysis passam na verificação.
Clique em Diagnose. O Flink Advisor fornece diversos repositórios de logs para exceções do Flink. Para obter a lista completa de itens de diagnóstico e etapas de correção, consulte Itens de diagnóstico do Flink Advisor.
Revise os resultados do diagnóstico e as sugestões de otimização. Para aplicar uma sugestão, clique em Apply ao lado dela.
Itens de diagnóstico do Flink Advisor
Os itens de diagnóstico dividem-se em duas categorias:
Exception: A execução do deployment é afetada. Ação imediata necessária.
Risk: O deployment está em execução, mas um problema potencial foi detectado. Resolva-o proativamente para evitar falhas futuras.
|
Tipo |
Fase |
Item de diagnóstico |
Descrição |
|
Exception (execução do deployment afetada) |
Inicialização |
Análise de arquivo de inicialização |
O pacote JAR necessário está ausente no diretório do Object Storage Service (OSS). Carregue novamente o pacote JAR antes de iniciar o deployment. |
|
Inicialização |
Análise de recursos |
Recursos disponíveis insuficientes. Reduza os valores de configuração de recursos do deployment ou escale horizontalmente o cluster. |
|
|
Inicialização |
Análise de recursos |
Falha na vinculação da Container Network Interface (CNI) ao deployment. Verifique se o número de endereços IP do vSwitch relacionado atingiu o limite superior. |
|
|
Inicialização |
Análise de recursos |
O número de endereços IP da Elastic Network Interface (ENI) excede o limite superior. Aumente o número de ENIs e tente novamente. |
|
|
Inicialização |
Análise de rede de topologia |
Nenhuma conexão de rede estabelecida entre o TaskManager e o JobManager. O deployment está anormal. |
|
|
Inicialização |
Análise de rede de topologia |
A vinculação da ENI às instâncias do Elastic Compute Service (ECS) expirou nos últimos 10 minutos. O deployment está iniciando lentamente. Aguarde a conclusão da operação. |
|
|
Inicialização |
Análise de rede de serviços upstream e downstream |
Detecção de porta TCP normal, mas o conector upstream ou downstream não está conectado. Verifique as configurações de rede dos serviços upstream e downstream. |
|
|
Inicialização |
Detecção de permissões de serviços upstream e downstream |
Fonte de dados upstream desconectada. Verifique a configuração de permissões do serviço upstream. |
|
|
Inicialização |
Detecção de permissões de serviços upstream e downstream |
Fonte de dados downstream desconectada. Verifique a configuração de permissões do serviço downstream. |
|
|
Inicialização |
Análise de velocidade de inicialização |
Pacote JAR excessivamente grande, causando inicialização lenta. Compacte o pacote JAR e carregue-o novamente ou aguarde a conclusão da inicialização. |
|
|
Inicialização |
Verificação do JobGraph |
Possível ausência do arquivo de configuração de uma versão anterior do Realtime Compute for Apache Flink. O deployment pode não se recuperar após um failover. Cancele e reinicie manualmente o deployment. |
|
|
Inicialização |
Verificação de cluster de sessão |
Um cluster de sessão de uma versão anterior do Realtime Compute for Apache Flink pode estar anormal, causando anomalias no deployment. |
|
|
Ícone de execução |
Verificação de status de alta disponibilidade (HA) |
HA desativado. O deployment não consegue se recuperar após uma falha. Publique o rascunho novamente e, em seguida, cancele e reinicie manualmente o deployment. |
|
|
Ícone de execução |
Verificação de checkpoint |
O recurso de checkpoint de uma versão anterior do Realtime Compute for Apache Flink pode estar anormal, causando falha na criação de checkpoints. |
|
|
Ícone de execução |
Detecção de permissões de serviços upstream e downstream |
Detecção de porta TCP normal, mas o conector upstream ou downstream não está conectado. Verifique as configurações de permissões dos serviços upstream e downstream. |
|
|
Ícone de execução |
Verificação de status de execução |
Erro de falta de memória (OOM) em um TaskManager. Verifique a configuração do deployment e aumente a memória do TaskManager. |
|
|
Cancelamento |
Análise de velocidade de cancelamento |
Cancelamento lento em uma versão anterior do Realtime Compute for Apache Flink. Cancele e reinicie manualmente o deployment. |
|
|
Risk (execução do deployment não afetada) |
Configurações |
Verificação do JobGraph |
Deployment em execução normal. Contudo, o arquivo de configuração de uma versão anterior pode estar ausente. O deployment pode não se recuperar após uma falha. Cancele e reinicie manualmente o deployment. |
|
Configurações |
Verificação de status de HA |
Deployment em execução normal. Contudo, o HA está desativado. O deployment pode não se recuperar após uma falha. Publique o rascunho novamente e, em seguida, cancele e reinicie manualmente o deployment. |
|
|
Configurações |
Verificação de versão |
Deployment em execução normal. Contudo, um defeito grave foi detectado na versão atual do Realtime Compute for Apache Flink. |
|
|
Ícone de execução |
Verificação de checkpoint |
Deployment em execução normal. Contudo, uma exceção de checkpoint em uma versão anterior do Realtime Compute for Apache Flink pode causar instabilidade potencial. |
|
|
Ícone de execução |
Verificação de checkpoint |
Deployment em execução normal. Contudo, nenhum checkpoint foi criado por um longo período. |
|
|
Ícone de execução |
Análise de velocidade de cancelamento |
Deployment em execução normal. Contudo, risco detectado de cancelamento lento em uma versão anterior do Realtime Compute for Apache Flink. Cancele e reinicie manualmente o deployment. |
|
|
Ícone de execução |
Análise de ambiente de execução |
Failover do deployment devido a exceção na máquina host. Restauração automática após o failover. Nenhuma ação necessária. |
|
|
Ícone de execução |
Análise de ambiente de execução |
Atualização de máquina pode causar failover do deployment em alguns minutos. Restauração automática após o failover. Para evitar isso, cancele e reinicie manualmente o deployment antes da atualização da máquina. |
|
|
Ícone de execução |
Análise de ambiente de execução |
Falha de hardware na máquina host. O deployment sofreu failover. Cancele e reinicie manualmente o deployment. |
|
|
Ícone de execução |
Verificação de versão |
Versão em fim de suporte (EOS). Podem ocorrer problemas de estabilidade ou indisponibilidade de suporte ao produto. Para obter mais informações, consulte Operações do console. |
Próximos passos
Monitore as métricas de desempenho do JobManager e do TaskManager para deployments em execução. Para obter mais informações, consulte Monitorar o desempenho do deployment.
Configure o ajuste automático para permitir que o sistema reconfigure os recursos automaticamente ou conforme programação. Para obter mais informações, consulte Ativar ajuste automático de desempenho.
Otimize deployments de Flink SQL ajustando as configurações do deployment e a lógica SQL. Para obter mais informações, consulte Otimizar Flink SQL.