Todos os produtos
Search
Central de documentação

Container Service for Kubernetes:Use cluster diagnostics

Última atualização: Jun 27, 2026

O recurso Artificial Intelligence for IT Operations (AIOps) oferece diagnósticos com um clique para nós, pods, serviços, Ingresses, memória, redes e AI Profiling. Essa funcionalidade ajuda você a localizar problemas no seu cluster. Este tópico descreve como usar o recurso de diagnósticos de cluster em um cluster ACK.

Pré-requisitos

Recursos de diagnóstico

O AIOps fornece os recursos de diagnóstico descritos na tabela a seguir.

Item de diagnóstico

Descrição

Diagnóstico de nó

Diagnostica problemas relacionados a nós, como nós Kubernetes no estado NotReady.

Diagnóstico de pod

Identifica falhas associadas a status anormais de pods, incluindo erros na inicialização ou reinicializações frequentes.

Diagnóstico de serviço

Analisa questões ligadas a serviços, abrangendo configurações, cotas de recursos e atividades anômalas.

Diagnóstico de Ingress

Verifica problemas relacionados a Ingress, como configurações de tráfego.

Diagnóstico de memória

Detecta falhas de memória nos nós, tais como vazamentos de memória, vazamentos de cgroup e erros de out-of-memory (OOM). Os resultados aparecem em um gráfico visualizado que mostra o uso geral da memória.

Network Diagnosis

Soluciona problemas comuns de rede, como falhas de conectividade entre pods, entre o cluster e a Internet, ou entre a Internet e um LoadBalancer.

AI Profiling

Coleta dados em tempo real de containers GPU online, incluindo chamadas de CPU, processos Python, chamadas de sistema e funções de kernel CUDA. A análise desses dados ocorre por meio de uma interface gráfica visualizada.

Configurar diagnósticos

Importante

Ao utilizar o recurso de diagnósticos de cluster, um programa de coleta de dados é executado nos nós do cluster para obter os resultados das verificações. As informações coletadas incluem versão do sistema, carga, status de execução do docker e kubelet, além de mensagens críticas de erro nos logs do sistema. O programa de coleta não captura dados comerciais ou informações sensíveis.

Os procedimentos para configurar diagnósticos de nós, pods, serviços e Ingresses são semelhantes. A seção abaixo utiliza o diagnóstico de nó como exemplo para demonstrar a configuração desse recurso.

  1. Faça login no ACK console. No painel de navegação à esquerda, clique em Clusters.

  2. Na página Clusters, clique no nome do cluster desejado. No painel de navegação à esquerda, escolha Inspections and Diagnostics > Diagnostics.

  3. Na página Diagnostics, clique em Node diagnosis. Na página Node diagnosis exibida, clique em Diagnosis no canto superior esquerdo.

  4. No painel Select Node, selecione um Node Name, leia as observações, marque I know and agree e clique em Create diagnosis.

    É possível acompanhar o progresso do diagnóstico na página. Após a conclusão, a página exibe os resultados e uma lista de itens verificados. Revise essas informações para identificar a causa raiz dos problemas e resolvê-los.

Visualizar resultados do diagnóstico

Na página de diagnósticos, localize o relatório na lista e clique em Diagnosis details na coluna Operation para visualizar os resultados detalhados.

Nota

Item de diagnóstico

Status do item de verificação

Descrição

Node diagnosis

  • Normal正常: Nenhuma ação necessária.

  • Warning警告: Confirmação necessária. Trate qualquer situação que cause anomalias no cluster.

  • Abnormal异常: Resolva o quanto antes para evitar falhas no funcionamento do cluster.

  • Unknown未知: A verificação não foi concluída ou o resultado é desconhecido.

O diagnóstico de nó abrange os itens de verificação Node, NodeComponent, ClusterComponent, ECSControllerManager e GPUNode. A causa de uma anomalia no nó é determinada com base no status do nó, status dos componentes do nó, status dos componentes do cluster e status do ECS. Na página de detalhes do diagnóstico, visualize os resultados, sugestões de reparo e a lista específica de itens verificados.

Passe o ponteiro do mouse sobre o ícone 详情图标.png à direita de um item de verificação para ler sua descrição.

Itens com status anormal ou de alerta aparecem na aba Troubleshoot.

Caso um item apresente status anormal, passe o mouse sobre Details na coluna Status desse item para visualizar a anomalia na dica exibida.

Pod diagnosis

O diagnóstico de pod inclui os itens Pod, ClusterComponent, Node, NodeComponent e ECSControllerManager. A identificação da causa de anomalias em pods considera o status do pod, componentes do cluster, nó, componentes do nó e ECS. A página de detalhes apresenta os resultados, recomendações de correção e a lista de verificações específicas.

Passe o ponteiro do mouse sobre o ícone 详情图标.png ao lado direito de um item para ver a descrição correspondente.

Verificações com status de alerta ou anormais ficam disponíveis na aba Troubleshoot.

Para itens com status anormal, a anomalia aparece na dica ao passar o cursor sobre Details na coluna Status.

Service diagnosis

As verificações de serviço cobrem Service e ResourceQuotas. A análise de anomalias em serviços examina fatores como tipo de faturamento do CLB, certificados, cotas e eventos inesperados.

Passe o mouse sobre o ícone 详情图标.png situado à direita do item para consultar a descrição.

A aba Troubleshoot lista os itens que apresentam status anormal ou de aviso.

Se houver status anormal em algum item, a anomalia será visível na dica exibida ao passar o mouse sobre Details na coluna Status.

Ingress diagnosis

O diagnóstico de Ingress avalia os itens Ingress, Addon e SLB. A determinação da causa de falhas no Ingress baseia-se no status do Ingress, plug-ins associados e SLB.

Passe o cursor sobre o ícone 详情图标.png à direita de cada item para acessar a descrição detalhada.

Itens classificados como anormais ou com aviso são listados na aba Troubleshoot.

Quando um item tem status anormal, passe o mouse sobre Details na coluna Status para ver a anomalia na dica.

Memory Diagnosis

Nenhum.

A página de detalhes do diagnóstico exibe as seções Memory Overview, Memory Analysis e OOM Analysis. Essas seções fornecem dados sobre vazamentos de memória, taxa de utilização e consumo de memória por processo.

Network diagnostics

  • Normalimage.png: Nenhuma ação necessária.

  • Abnormalimage.png: Resolva imediatamente.

Na página Diagnosis result, visualize os resultados do diagnóstico de rede. A área Packet paths renderiza um mapa completo do caminho de acesso analisado. Nós anormais são destacados com cores diferentes dos nós normais.