O Alibaba Cloud Container Service (ACS) oferece o recurso de diagnóstico de pods por meio do Container Intelligence Service (CIS) para solucionar problemas em pods anômalos. Este tópico descreve os itens de verificação do diagnóstico de pods e as respectivas sugestões de correção.
O Container Intelligence Service (CIS) é um sistema de diagnóstico de falhas que utiliza conhecimento especializado e um modelo de IA treinado com dados em grande escala. O diagnóstico de pods combina modos orientados por especialistas e por IA para analisar detalhadamente a causa raiz.
Itens de diagnóstico: abrange verificações nas categorias Pod e ClusterComponent.
Causas raiz: apresenta a causa raiz identificada e sugestões de correção.
Ao executar um diagnóstico, o sistema roda um programa de coleta de dados no seu cluster para reunir informações diagnósticas. Os dados coletados incluem a versão do sistema, o status de execução de workloads e componentes de contêiner, além de mensagens de erro essenciais dos logs do sistema. O programa não coleta informações de negócios nem dados sensíveis.
Cenários cobertos
A tabela a seguir descreve os cenários típicos atendidos pelo diagnóstico de pods e pelo modo de IA.
|
Categoria |
Cenários suportados |
|
Diagnóstico de pods |
O scheduler não processou o pod. |
|
Restrições não atendidas impediram o agendamento do pod. |
|
|
O pod foi agendado, mas o kubelet não o processou. |
|
|
O pod aguarda um volume ficar pronto. |
|
|
O pod foi removido (evicted). |
|
|
Falha na criação do contêiner sandbox do pod. |
|
|
O pod está travado no estado Terminating. |
|
|
Um contêiner no pod apresentou erro de falta de memória (OOM). |
|
|
Encerramento inesperado de um contêiner no pod. |
|
|
Um contêiner no pod encontra-se no estado CrashLoopBackOff. |
|
|
Um contêiner no pod está com status NotReady. |
|
|
Falha ao baixar a imagem do pod. |
|
|
Tempo limite excedido durante o download da imagem do pod. |
|
|
Modo de IA |
Status anômalo do pod. |
|
Erro de OOM no pod. |
|
|
Saída inesperada de um contêiner no pod. |
|
|
Configuração inválida de ConfigMap ou Secret no pod. |
|
|
Falha na verificação de integridade do pod. |
|
|
Configuração inválida de persistent volume claim (PVC) no pod. |
|
|
Erro ao puxar a imagem do pod. |
Funcionamento
O diagnóstico de pods coleta informações do cluster, identifica anomalias e realiza uma análise detalhada. O processo consiste em quatro etapas: identificação de anomalias, coleta de dados, avaliação de itens de diagnóstico e análise de causa raiz. Os resultados ficam disponíveis após a conclusão.

Identificação de anomalias: analisa dados básicos, como status do pod e fluxos de eventos do cluster, para detectar rapidamente a anomalia atual.
Coleta de dados: reúne dados contextuais com base na anomalia identificada.
Avaliação de itens de diagnóstico: verifica se as métricas principais estão dentro das faixas normais com base nos dados coletados.
Análise de causa raiz: examina os dados coletados e os resultados das verificações para determinar a origem do problema.
Resultados do diagnóstico
Os resultados dividem-se em dois tipos:
Root cause analysis results: incluem anomalias detectadas, causa raiz identificada e sugestões de correção.
Diagnostic item check results: apresentam os resultados individuais de cada item. Essas verificações podem revelar causas que a análise de causa raiz não detectou.
Os itens de diagnóstico variam conforme a configuração do cluster e refletem sua configuração real.
Itens de diagnóstico
|
Categoria |
Descrição |
|
Verifica problemas comuns em pods, como status e download de imagens. |
|
|
Avalia questões frequentes no cluster, incluindo disponibilidade de APIService e DNS. |
Pod
|
Item de diagnóstico |
Descrição |
Sugestão de correção |
|
Contagem de reinicializações de contêiner |
Verifica quantas vezes os contêineres do pod foram reiniciados. |
Analise o status e os logs do pod. Para mais detalhes, consulte Pod troubleshooting. |
|
Bloqueio no download de imagens de contêiner |
Detecta se o download de imagens para outros pods no mesmo nó está bloqueado. |
Revise o status e os logs do pod. Consulte Pod troubleshooting para mais informações. |
|
Status de agendamento do pod |
Confirma se o pod foi agendado com sucesso. |
Inspecione o status e os logs do pod. Veja Pod troubleshooting para orientações adicionais. |
ClusterComponent
|
Item de diagnóstico |
Descrição |
Sugestão de correção |
|
Disponibilidade do APIService |
Verifica se o APIService do cluster está disponível. |
Execute o comando |
|
Endpoints do service de DNS |
Avalia a quantidade de endpoints do service de DNS do cluster. |
Verifique o status de execução e os logs dos pods do CoreDNS. |
|
ClusterIP do service de DNS |
Confirma se um ClusterIP foi atribuído corretamente ao service de DNS do cluster. Problemas de DNS podem causar falhas nas funções do cluster e afetar seus workloads. |
Consulte o status de execução e os logs dos pods do CoreDNS. |