Ao ativar o reparo automático de nós, o ACK monitora falhas nos nós Lingjun e invoca a API Approve O&M operations para repará-los.
Como ativar o reparo automático de nós
Ative o reparo automático de nós e defina regras ao criar ou configurar um pool de nós gerenciados. Gerencie todas as regras de reparo automático na página Self-Healing Rule. Consulte Configuração de regras de reparo automático.
Disponível apenas para usuários incluídos na lista de permissões. Entre em contato com o suporte técnico para ativar.
Não há suporte nas regiões do Apsara Stack.
Método 1: Novo pool de nós
Na página ACK Clusters, clique no nome do cluster. No painel de navegação à esquerda, clique em .
-
Clique em Create Lingjun Node Pool. Na seção Configure Managed Node Pool, ative o recurso gerenciado, crie e ative uma regra de reparo automático.
Consulte Criar um pool de nós Lingjun .
Método 2: Pool de nós existente
Na página ACK Clusters, clique no nome do cluster. No painel de navegação à esquerda, clique em .
-
Na coluna Actions do pool de nós Lingjun desejado, clique em
e selecione Enable Managed Node Pool (se ainda não estiver ativado) ou Configure Managed Node Pool (se já estiver ativado). Crie uma regra de reparo automático e ative o recurso.Consulte Criar um pool de nós Lingjun .
Após ativar o recurso, crie e gerencie regras de reparo automático na página .
Na página ACK Clusters, clique no nome do cluster. No painel de navegação à esquerda, acesse .
Clique em Create Self-Healing Rule ou gerencie as regras existentes na lista.
Configuração de regras de reparo automático
O sistema processa falhas por prioridade. Falhas de alta prioridade que exigem manutenção são reparadas primeiro. Falhas de baixa prioridade resolvidas com reinicialização ficam pendentes até a resolução de todas as falhas de alta prioridade.
No Custom Remediation Flow, se alguma etapa tiver Manual Intervention Required ativado, conceda autorização prontamente. Caso contrário, o ACK pausa a etapa atual e as subsequentes, e o nó pode permanecer comprometido.
Com o reparo automático de nós ativado, o ACK monitora eventos anormais e utiliza a capacidade Approve O&M operations para corrigir falhas subjacentes em nós Lingjun. Monitore atentamente a integridade dos nós Lingjun e o status do cluster para evitar interrupções prolongadas do serviço.
1. Acessar a página de configuração de regras
Na página de criação ou configuração do pool de nós, ou na página Self-Healing Rule, clique em Create Self-Healing Rule.
-
Especifique um nome para a regra e configure-a:
Node Pool Type: Selecione Lingjun Node Pool.
Sub-Rule Configuration: Clique em Add Sub-Rule para concluir a. Selecionar falhas e b. Personalizar o processo de reparo de falhas.
Notice:: Leia os avisos na página.
2. Configurar sub-regras
a. Select Fault Type
O reparo automático de nós monitora eventos do CloudMonitor provenientes de nós Lingjun e repara falhas por meio da API Approve O&M operations do Lingjun.
Tipos de falha e ações de correção:
|
Nome da falha |
Nome do evento Lingjun |
Condição do Kubernetes |
Descrição da falha |
Ação de correção |
|
Falha de hardware em nó Lingjun (Reparo necessário) |
Node.HardwareFault.HOST:Inquiring resourceType: Node |
|
O nó requer manutenção devido a uma falha de hardware. Dados locais podem ser perdidos após a manutenção. Se os diretórios do runtime de contêiner e do kubelet estiverem em discos locais, remova e readicione o nó após a manutenção. |
Reparar o nó. Importante
Dados em disco local podem ser perdidos durante o reparo. Faça backup dos dados antecipadamente. Prioridade: Alta |
|
Erro subjacente em nó Lingjun (Reinicialização necessária) |
Node.FaultNeedReboot.HOST:Inquiring resourceType: Node |
|
Ocorreu uma falha no nó. Reinicie-o prontamente para tentar a correção. |
Reiniciar o nó. Prioridade: Média |
b. Custom Remediation Flow
Todas as etapas suportam intervenção manual via Manual Intervention Required (opções: Disable ou Authorize by Node Label ). Quando definido como Authorize by Node Label , o ACK aguarda autorização antes de executar a etapa.
|
Etapa |
Descrição |
|
Isolate Node |
Marca o nó com falha como não agendável ( |
|
Node draining |
Requer que Isolate Node esteja ativado primeiro. O ACK remove as cargas de trabalho do nó com falha uma por vez. Tempo limite padrão de drenagem: 300 segundos (ajustável).
|
|
Auto repair |
Quando ativado, o ACK executa a ação de reparo correspondente ao tipo de falha. Consulte Tipos de falha e comportamentos de reparo. |
|
Uncordon Node |
Requer que Isolate Node esteja ativado primeiro. Restaura o nó para agendável ( Se o nó já estava não agendável antes do processo de reparo, esta etapa não o restaura. |
Eventos de reparo automático de nós
Quando o reparo automático está ativado, o ACK converte eventos de falha de nós Lingjun em Eventos e Condições do Kubernetes, além de gerar Eventos para acompanhar o progresso do reparo.
Eventos comuns de reparo automático
|
Evento (motivo) |
Nível |
Descrição |
|
DetectedLingJungCMSEvent |
Warning |
Uma falha em nó Lingjun foi detectada ou o status de uma falha existente foi atualizado. |
|
RepairPlanCreated |
Warning |
Um plano de reparo automático foi criado. |
|
WaitingApproveProcedure |
Warning |
A etapa atual está pausada, aguardando autorização manual. Os detalhes do evento descrevem a ação necessária e como conceder a autorização. |
|
RepairPlanProcedureWaitingForApproval |
Warning |
O rótulo de autorização foi adicionado ao nó. |
|
RepairPlanStatusUpdated |
Normal |
O status do plano de reparo automático foi atualizado. Registra a etapa atual e seu resultado. |
|
ApproveLingjunOperation |
Normal |
O plano de controle do Lingjun foi autorizado a realizar o reparo. |
|
NodeNotRecovery |
Warning |
Acionado se um nó não se recuperar após o reparo. O ACK verifica o status do nó a cada 30 minutos após o reparo. |
|
RepairPlanCompleted |
Warning |
O plano de reparo automático foi concluído. O evento indica se o plano teve êxito ou falhou. |
Eventos para cenários especiais
Estes eventos ocorrem em cenários específicos.
|
Evento (motivo) |
Nível |
Descrição |
|
NodeRecoveryNeedSilence |
Normal |
O último plano de reparo automático neste nó teve êxito, mas o tipo de falha atual difere do anterior. O sistema aguarda 10 minutos antes de criar um novo plano. |
|
NodeRecoveryHasProcessed |
Warning |
O último plano de reparo automático processou esta falha com êxito, mas o nó não se recuperou. Investigue manualmente. |
|
RepairPlanFailed |
Warning |
O plano de reparo automático para a falha atual falhou e o nó não se recuperou. Investigue manualmente. |
|
RepairPlanStatusUpdateFailed |
Warning |
Falha ao atualizar o status do plano de reparo automático. |
|
AddInquiringLabelFailed |
Normal |
Falha ao definir o rótulo de autorização. O processo de reparo automático foi abortado. |
Configurar alertas
Após ativar o reparo automático de nós, ative as Alert Rules for Node Pool O&M Events e o Cluster Node Auto Repair Alert Rule Set para receber alertas quando ocorrerem anomalias.
Consulte Gerenciamento de alarmes para Container Service .