Todos os produtos
Search
Central de documentação

Container Service for Kubernetes:Enable auto-repair for Lingjun node pools

Última atualização: Jun 27, 2026

Ao ativar o reparo automático de nós, o ACK monitora falhas nos nós Lingjun e invoca a API Approve O&M operations para repará-los.

Como ativar o reparo automático de nós

Ative o reparo automático de nós e defina regras ao criar ou configurar um pool de nós gerenciados. Gerencie todas as regras de reparo automático na página Self-Healing Rule. Consulte Configuração de regras de reparo automático.

Importante
  • Disponível apenas para usuários incluídos na lista de permissões. Entre em contato com o suporte técnico para ativar.

  • Não há suporte nas regiões do Apsara Stack.

Método 1: Novo pool de nós

  1. Na página ACK Clusters, clique no nome do cluster. No painel de navegação à esquerda, clique em Nodes > Node Pools.

  2. Clique em Create Lingjun Node Pool. Na seção Configure Managed Node Pool, ative o recurso gerenciado, crie e ative uma regra de reparo automático.

    Consulte Criar um pool de nós Lingjun .

Método 2: Pool de nós existente

  1. Na página ACK Clusters, clique no nome do cluster. No painel de navegação à esquerda, clique em Nodes > Node Pools.

  2. Na coluna Actions do pool de nós Lingjun desejado, clique em image e selecione Enable Managed Node Pool (se ainda não estiver ativado) ou Configure Managed Node Pool (se já estiver ativado). Crie uma regra de reparo automático e ative o recurso.

    Consulte Criar um pool de nós Lingjun .

Após ativar o recurso, crie e gerencie regras de reparo automático na página Inspections and Diagnostics > Self-Healing Rule.

  1. Na página ACK Clusters, clique no nome do cluster. No painel de navegação à esquerda, acesse Inspections and Diagnostics > Self-Healing Rule.

  2. Clique em Create Self-Healing Rule ou gerencie as regras existentes na lista.

Configuração de regras de reparo automático

Importante
  • O sistema processa falhas por prioridade. Falhas de alta prioridade que exigem manutenção são reparadas primeiro. Falhas de baixa prioridade resolvidas com reinicialização ficam pendentes até a resolução de todas as falhas de alta prioridade.

  • No Custom Remediation Flow, se alguma etapa tiver Manual Intervention Required ativado, conceda autorização prontamente. Caso contrário, o ACK pausa a etapa atual e as subsequentes, e o nó pode permanecer comprometido.

  • Com o reparo automático de nós ativado, o ACK monitora eventos anormais e utiliza a capacidade Approve O&M operations para corrigir falhas subjacentes em nós Lingjun. Monitore atentamente a integridade dos nós Lingjun e o status do cluster para evitar interrupções prolongadas do serviço.

1. Acessar a página de configuração de regras

  1. Na página de criação ou configuração do pool de nós, ou na página Self-Healing Rule, clique em Create Self-Healing Rule.

  2. Especifique um nome para a regra e configure-a:

2. Configurar sub-regras

a. Select Fault Type

O reparo automático de nós monitora eventos do CloudMonitor provenientes de nós Lingjun e repara falhas por meio da API Approve O&M operations do Lingjun.

Tipos de falha e ações de correção:

Nome da falha

Nome do evento Lingjun

Condição do Kubernetes

Descrição da falha

Ação de correção

Falha de hardware em nó Lingjun (Reparo necessário)

Node.HardwareFault.HOST:Inquiring

resourceType: Node
  • Type: Node.HardwareFault.HOST

  • Status: True

  • Reason:Node.HardwareFault.HOST:Inquiring

  • Message: <Fault details>

O nó requer manutenção devido a uma falha de hardware. Dados locais podem ser perdidos após a manutenção. Se os diretórios do runtime de contêiner e do kubelet estiverem em discos locais, remova e readicione o nó após a manutenção.

Reparar o nó.

Importante

Dados em disco local podem ser perdidos durante o reparo. Faça backup dos dados antecipadamente.

Prioridade: Alta

Erro subjacente em nó Lingjun (Reinicialização necessária)

Node.FaultNeedReboot.HOST:Inquiring

resourceType: Node
  • Type: Node.FaultNeedReboot.HOST

  • Status: True

  • Reason:Node.FaultNeedReboot.HOST:Inquiring

  • Message: <Fault details>

Ocorreu uma falha no nó. Reinicie-o prontamente para tentar a correção.

Reiniciar o nó.

Prioridade: Média

b. Custom Remediation Flow

Todas as etapas suportam intervenção manual via Manual Intervention Required (opções: Disable ou Authorize by Node Label ). Quando definido como Authorize by Node Label , o ACK aguarda autorização antes de executar a etapa.

Etapa

Descrição

Isolate Node

Marca o nó com falha como não agendável (spec.unschedulable = true) para impedir o agendamento de novas cargas de trabalho nele.

Node draining

Requer que Isolate Node esteja ativado primeiro.

O ACK remove as cargas de trabalho do nó com falha uma por vez. Tempo limite padrão de drenagem: 300 segundos (ajustável).

  • A drenagem de nós segue o protocolo PDB. Estes pods não são removidos:

    • Pods gerenciados por um DaemonSet.

    • Pods gerenciados por um OpenKruise Advanced DaemonSet.

    • Pods com o rótulo alibabacloud.com/evict-pod=true.

  • Se as cargas de trabalho não puderem ser removidas dentro do tempo limite, o ACK ignora a remoção e continua.

Auto repair

Quando ativado, o ACK executa a ação de reparo correspondente ao tipo de falha. Consulte Tipos de falha e comportamentos de reparo.

Uncordon Node

Requer que Isolate Node esteja ativado primeiro.

Restaura o nó para agendável (spec.unschedulable = false).

Se o nó já estava não agendável antes do processo de reparo, esta etapa não o restaura.

Eventos de reparo automático de nós

Quando o reparo automático está ativado, o ACK converte eventos de falha de nós Lingjun em Eventos e Condições do Kubernetes, além de gerar Eventos para acompanhar o progresso do reparo.

Eventos comuns de reparo automático

Evento (motivo)

Nível

Descrição

DetectedLingJungCMSEvent

Warning

Uma falha em nó Lingjun foi detectada ou o status de uma falha existente foi atualizado.

RepairPlanCreated

Warning

Um plano de reparo automático foi criado.

WaitingApproveProcedure

Warning

A etapa atual está pausada, aguardando autorização manual. Os detalhes do evento descrevem a ação necessária e como conceder a autorização.

RepairPlanProcedureWaitingForApproval

Warning

O rótulo de autorização foi adicionado ao nó.

RepairPlanStatusUpdated

Normal

O status do plano de reparo automático foi atualizado. Registra a etapa atual e seu resultado.

ApproveLingjunOperation

Normal

O plano de controle do Lingjun foi autorizado a realizar o reparo.

NodeNotRecovery

Warning

Acionado se um nó não se recuperar após o reparo. O ACK verifica o status do nó a cada 30 minutos após o reparo.

RepairPlanCompleted

Warning

O plano de reparo automático foi concluído. O evento indica se o plano teve êxito ou falhou.

Eventos para cenários especiais

Estes eventos ocorrem em cenários específicos.

Evento (motivo)

Nível

Descrição

NodeRecoveryNeedSilence

Normal

O último plano de reparo automático neste nó teve êxito, mas o tipo de falha atual difere do anterior. O sistema aguarda 10 minutos antes de criar um novo plano.

NodeRecoveryHasProcessed

Warning

O último plano de reparo automático processou esta falha com êxito, mas o nó não se recuperou. Investigue manualmente.

RepairPlanFailed

Warning

O plano de reparo automático para a falha atual falhou e o nó não se recuperou. Investigue manualmente.

RepairPlanStatusUpdateFailed

Warning

Falha ao atualizar o status do plano de reparo automático.

AddInquiringLabelFailed

Normal

Falha ao definir o rótulo de autorização. O processo de reparo automático foi abortado.

Configurar alertas

Após ativar o reparo automático de nós, ative as Alert Rules for Node Pool O&M Events e o Cluster Node Auto Repair Alert Rule Set para receber alertas quando ocorrerem anomalias.

Consulte Gerenciamento de alarmes para Container Service .