Os pools de nós gerenciados inteligentes oferecem um modo de gerenciamento totalmente automatizado e livre de manutenção para o ACK Managed Cluster Pro Edition. Quando ativado, esse recurso gerencia automaticamente o dimensionamento dinâmico dos nós com base na demanda da carga de trabalho. Além disso, fornece capacidades de O&M, como atualizações do sistema operacional, aplicação de patches de segurança e autorrecuperação, eliminando a necessidade de criar e manter nós manualmente.
Recursos
O&M automatizado em todo o ciclo de vida: Gerencia automaticamente todo o ciclo de vida dos nós, desde a criação até a reciclagem. Inclui recursos como rotação de imagens de nós, substituição automática de nós anômalos e correção automática de vulnerabilidades CVE do sistema operacional.
Elasticidade instantânea de nós: A elasticidade instantânea integrada aciona o scale-out ou scale-in de nós em milissegundos, conforme as solicitações de recursos das cargas de trabalho do Kubernetes.
ContainerOS: Os nós utilizam o ContainerOS, que possui uma pilha de software subjacente otimizada e um sistema de arquivos raiz imutável para maior segurança.
O&M automatizado de nós
Gerencia automaticamente todo o ciclo de vida dos nós, abrangendo criação, operação e encerramento. O sistema cuida continuamente das responsabilidades de O&M, como atualizações do sistema operacional, manutenção de componentes e correção de vulnerabilidades de segurança, eliminando a necessidade de planejar configurações manuais de nós.
Recuperação de falhas: Detecta anomalias nos nós e inicia a recuperação automaticamente. Configure se as reinicializações de nós são permitidas para essa finalidade.
Correção de CVEs do SO: Aplica patches automaticamente para vulnerabilidades do sistema operacional de severidade alta, média e baixa.
Atualizações de versão do sistema operacional: Atualiza a imagem do sistema operacional do pool de nós e conclui o processo por meio da rotação de nós.
Resposta automática a eventos de sistema do ECS: Identifica e responde automaticamente aos eventos de sistema do ECS para melhorar a estabilidade e a disponibilidade dos nós.
Elasticidade instantânea de nós
Inclui elasticidade instantânea de nós integrada para dimensionar os nós automaticamente conforme as mudanças na carga de trabalho, eliminando a necessidade de planejamento antecipado de capacidade. O faturamento baseia-se no uso real de recursos, o que ajuda a reduzir desperdícios com recursos ociosos e otimizar custos.
-
Resposta elástica mais rápida: Com um modelo orientado a eventos, o sistema responde às necessidades de dimensionamento em 1 a 3 segundos.
Essas ações de dimensionamento, aceleradas pelos recursos do ContainerOS, são concluídas em aproximadamente 45±10 segundos.
Entrega de recursos mais confiável: O serviço seleciona automaticamente tipos de instância adequados para o dimensionamento. Caso o estoque alvo seja insuficiente, ele recorre automaticamente a outros tipos de instância elegíveis, alcançando uma taxa de sucesso de entrega de recursos de até 99%. Também fornece avisos de estoque para identificar riscos potenciais nas combinações de tipos de instância com antecedência.
Eficiência de agendamento aprimorada: Utiliza estratégias ideais de bin packing e PreBind (um recurso personalizado) com base nos requisitos dos pods, reduzindo a fragmentação de agendamento em 30%.
ContainerOS
Os nós usam o ContainerOS como sistema operacional. O ContainerOS foi projetado especificamente para ambientes conteinerizados. Ele é totalmente compatível com o ecossistema Kubernetes e oferece benefícios como inicialização rápida, reforço de segurança e atualizações consistentes.
-
Scale-out rápido de nós
Imagem simplificada: A imagem inclui apenas os pacotes de software e serviços de sistema necessários para executar pods do Kubernetes. Otimizações no nível do sistema reduzem significativamente o tempo de inicialização do nó.
Otimizado para cenários de GPU: Ao usar instâncias com GPU, o sistema utiliza uma versão do ContainerOS otimizada para GPU, com drivers NVIDIA e ambientes de execução necessários pré-instalados. Isso reduz as etapas de instalação e configuração pós-inicialização. Por exemplo, ao implantar um serviço de inferência para o modelo grande Qwen, o tempo para o nó ficar Ready é reduzido de 200 segundos para 94 segundos em comparação ao Alibaba Cloud Linux 3, que usa uma imagem de SO sem drivers de GPU integrados.
-
Reforço de segurança
Sistema de arquivos raiz somente leitura: O sistema de arquivos raiz é somente leitura por padrão. Apenas os diretórios
/etce/varpermitem gravação. Isso atende às necessidades básicas de configuração do sistema e respeita o princípio de infraestrutura imutável em ambientes cloud-native, impedindo que escapes de contêineres modifiquem o sistema de arquivos do host.Exposição mínima do sistema: Por padrão, não há ambiente de execução Python disponível e o login direto via SSH é desativado para evitar operações irrastreáveis no sistema. Para cenários especiais de O&M, um contêiner de O&M dedicado está disponível como complemento.
-
Atualizações atômicas
Atualizações e rollbacks no nível da imagem: Seguindo o conceito de infraestrutura imutável, o ContainerOS não fornece gerenciadores de pacotes tradicionais como
yum. Ele suporta atualizações granulares e rollbacks no nível da imagem do sistema operacional (atualizações por substituição de disco) e hot-fixes limitados em camadas. Isso garante que as versões de software e as configurações do sistema de todos os nós no cluster permaneçam consistentes.
Comparação com outros modos de pool de nós
A tabela a seguir compara as capacidades de configuração dos pools de nós gerenciados inteligentes com os pools de nós gerenciados padrão e os pools de nós com gerenciamento desativado.
Configuração gerenciada | Desativada | Pool de nós gerenciado | Gerenciamento inteligente | |
Configuração do pool de nós | Tipo de instância | Configuração manual | Configuração manual | Configurável, com recomendações inteligentes de tipos de instância. |
Método de faturamento | Configuração manual | Configuração manual | Apenas pagamento conforme o uso. | |
Sistema operacional | Configuração manual | Configuração manual | Suporta apenas o sistema operacional otimizado para contêineres ContainerOS. | |
Disco do sistema | Configuração manual | Configuração manual | Padrão recomendado: 20 GiB. | |
Disco de dados | Configuração manual | Configuração manual | O ContainerOS usa um disco de dados para armazenamento temporário. O tamanho é configurável. | |
Auto scaling | Ativação e configuração manuais. | Ativação e configuração manuais. | Instant node elasticity ativado por padrão. Configuração manual suportada. | |
Resposta automática a eventos de sistema do ECS | Não suportado | Ativado por padrão | Ativado por padrão | |
Autorrecuperação de nós | Não suportado | Ativação e configuração manuais. | Ativado por padrão | |
Atualizações automáticas de kubelet e containerd | Configurado manualmente pelo recurso de atualização automática de cluster. | Ativado por padrão | ||
Correções automáticas de vulnerabilidades CVE do SO | Não suportado | Ativação e configuração manuais. | Ativado por padrão | |
Observações de uso
-
Limites de capacidade
Ao usar um pool de nós gerenciado inteligente, o ACK dimensiona os nós dinamicamente com base na demanda da carga de trabalho. Por padrão, suporta scale-out para até 50 nós. Altere o número máximo de instâncias pelas configurações de dimensionamento do pool de nós.
Pools de nós gerenciados inteligentes não suportam certos tipos de instância, como instâncias baseadas em arm ou instâncias com discos locais, e suportam apenas ContainerOS 3.6 e versões posteriores. O ACK recomenda famílias de tipos de instância padrão que atendem à maioria dos casos de uso. Ajuste as configurações no console conforme suas necessidades específicas de negócios. Configure um número suficiente de tipos de instância para aumentar a elasticidade do pool de nós e evitar falhas de dimensionamento.
-
Limites operacionais
Em um pool de nós gerenciado inteligente, o ACK é responsável por tarefas de O&M, como atualizações de versão do sistema operacional, atualizações de software e aplicação de patches de segurança. Essas tarefas podem envolver atualizações de software, alterações de configuração, reinicializações, drenagem e evicção de nós. Para evitar conflitos de políticas, não execute O&M manual nos nós ECS do pool, como reinicializações, montagem de discos de dados ou login nos nós para modificar configurações.
Defina contagens de réplicas adequadas para suas cargas de trabalho, bem como hooks PreStop para desligamentos graceful e políticas de PodDisruptionBudget (PDB). Isso garante que os nós possam ser drenados com segurança sem interrupções de serviço.
Embora os pools de nós gerenciados inteligentes automatizem o O&M de nós do Kubernetes, você ainda é responsável por certas obrigações sob o modelo de responsabilidade compartilhada.
-
Diretrizes de armazenamento
Os pools de nós gerenciados inteligentes usam o ContainerOS, que aumenta a segurança dos nós com um sistema de arquivos raiz imutável. Evite usar caminhos do sistema do nó para armazenamento, como HostPath. Use PersistentVolumeClaims (PVCs) para armazenamento persistente.
Início rápido
Crie um pool de nós gerenciado inteligente em um ACK Managed Cluster Pro Edition.
Na página ACK Clusters, clique em nome do seu cluster. No painel de navegação à esquerda, clique em .
-
Na página Node Pools, clique em Create Node Pool. Defina Configure Managed Node Pool como Auto Mode e configure definições como o número de instâncias e a configuração de rede. Para descrições detalhadas dos itens de configuração, consulte Criar um pool de nós.
Clique em Confirm para criar o pool de nós gerenciado inteligente.
Documentos relacionados
Recomendamos o uso de pools de nós gerenciados inteligentes em um cluster Auto Mode.
Utilize recursos de computação GPU para implantar rapidamente serviços de inferência de modelos grandes. Para mais informações, consulte Implantar um serviço de inferência para o modelo grande Qwen.