O recurso Artificial Intelligence for IT Operations (AIOps) oferece diagnósticos com um clique para nós, pods, serviços, Ingresses, memória, redes e AI Profiling. Essa funcionalidade ajuda você a localizar problemas no seu cluster. Este tópico descreve como usar o recurso de diagnósticos de cluster em um cluster ACK.
Pré-requisitos
Um cluster gerenciado ACK foi criado. Para mais informações, consulte Criar um cluster gerenciado ACK.
-
O status do cluster Kubernetes é Running.
NotaFaça login no Container Service Management Console. Na página Clusters, verifique a coluna Cluster Status para confirmar se o status do cluster é Running.
Recursos de diagnóstico
O AIOps fornece os recursos de diagnóstico descritos na tabela a seguir.
|
Item de diagnóstico |
Descrição |
|
Diagnostica problemas relacionados a nós, como nós Kubernetes no estado NotReady. |
|
|
Identifica falhas associadas a status anormais de pods, incluindo erros na inicialização ou reinicializações frequentes. |
|
|
Analisa questões ligadas a serviços, abrangendo configurações, cotas de recursos e atividades anômalas. |
|
|
Verifica problemas relacionados a Ingress, como configurações de tráfego. |
|
|
Detecta falhas de memória nos nós, tais como vazamentos de memória, vazamentos de cgroup e erros de out-of-memory (OOM). Os resultados aparecem em um gráfico visualizado que mostra o uso geral da memória. |
|
|
Soluciona problemas comuns de rede, como falhas de conectividade entre pods, entre o cluster e a Internet, ou entre a Internet e um LoadBalancer. |
|
|
Coleta dados em tempo real de containers GPU online, incluindo chamadas de CPU, processos Python, chamadas de sistema e funções de kernel CUDA. A análise desses dados ocorre por meio de uma interface gráfica visualizada. |
Configurar diagnósticos
Ao utilizar o recurso de diagnósticos de cluster, um programa de coleta de dados é executado nos nós do cluster para obter os resultados das verificações. As informações coletadas incluem versão do sistema, carga, status de execução do docker e kubelet, além de mensagens críticas de erro nos logs do sistema. O programa de coleta não captura dados comerciais ou informações sensíveis.
Os procedimentos para configurar diagnósticos de nós, pods, serviços e Ingresses são semelhantes. A seção abaixo utiliza o diagnóstico de nó como exemplo para demonstrar a configuração desse recurso.
Faça login no ACK console. No painel de navegação à esquerda, clique em Clusters.
Na página Clusters, clique no nome do cluster desejado. No painel de navegação à esquerda, escolha .
Na página Diagnostics, clique em Node diagnosis. Na página Node diagnosis exibida, clique em Diagnosis no canto superior esquerdo.
-
No painel Select Node, selecione um Node Name, leia as observações, marque I know and agree e clique em Create diagnosis.
É possível acompanhar o progresso do diagnóstico na página. Após a conclusão, a página exibe os resultados e uma lista de itens verificados. Revise essas informações para identificar a causa raiz dos problemas e resolvê-los.
Visualizar resultados do diagnóstico
Na página de diagnósticos, localize o relatório na lista e clique em Diagnosis details na coluna Operation para visualizar os resultados detalhados.
Item de diagnóstico | Status do item de verificação | Descrição |
Node diagnosis |
| O diagnóstico de nó abrange os itens de verificação Node, NodeComponent, ClusterComponent, ECSControllerManager e GPUNode. A causa de uma anomalia no nó é determinada com base no status do nó, status dos componentes do nó, status dos componentes do cluster e status do ECS. Na página de detalhes do diagnóstico, visualize os resultados, sugestões de reparo e a lista específica de itens verificados. Passe o ponteiro do mouse sobre o ícone Itens com status anormal ou de alerta aparecem na aba Troubleshoot. Caso um item apresente status anormal, passe o mouse sobre Details na coluna Status desse item para visualizar a anomalia na dica exibida. |
Pod diagnosis | O diagnóstico de pod inclui os itens Pod, ClusterComponent, Node, NodeComponent e ECSControllerManager. A identificação da causa de anomalias em pods considera o status do pod, componentes do cluster, nó, componentes do nó e ECS. A página de detalhes apresenta os resultados, recomendações de correção e a lista de verificações específicas. Passe o ponteiro do mouse sobre o ícone Verificações com status de alerta ou anormais ficam disponíveis na aba Troubleshoot. Para itens com status anormal, a anomalia aparece na dica ao passar o cursor sobre Details na coluna Status. | |
Service diagnosis | As verificações de serviço cobrem Service e ResourceQuotas. A análise de anomalias em serviços examina fatores como tipo de faturamento do CLB, certificados, cotas e eventos inesperados. Passe o mouse sobre o ícone A aba Troubleshoot lista os itens que apresentam status anormal ou de aviso. Se houver status anormal em algum item, a anomalia será visível na dica exibida ao passar o mouse sobre Details na coluna Status. | |
Ingress diagnosis | O diagnóstico de Ingress avalia os itens Ingress, Addon e SLB. A determinação da causa de falhas no Ingress baseia-se no status do Ingress, plug-ins associados e SLB. Passe o cursor sobre o ícone Itens classificados como anormais ou com aviso são listados na aba Troubleshoot. Quando um item tem status anormal, passe o mouse sobre Details na coluna Status para ver a anomalia na dica. | |
Memory Diagnosis | Nenhum. | A página de detalhes do diagnóstico exibe as seções Memory Overview, Memory Analysis e OOM Analysis. Essas seções fornecem dados sobre vazamentos de memória, taxa de utilização e consumo de memória por processo. |
Network diagnostics |
| Na página Diagnosis result, visualize os resultados do diagnóstico de rede. A área Packet paths renderiza um mapa completo do caminho de acesso analisado. Nós anormais são destacados com cores diferentes dos nós normais. |