O Container Service for Kubernetes (ACK) gerencia nós Lingjun por meio de pools de nós Lingjun. Esses pools oferecem gerenciamento do ciclo de vida, adição e remoção em lote de nós, configuração, agendamento, orquestração, monitoramento, diagnóstico e operações e manutenção automatizadas. Também proporcionam melhorias para cenários de IA e computação de alto desempenho (HPC), como rede Remote Direct Memory Access (RDMA) e agendamento de GPU.
-
Relação de vinculação
Um pool de nós Lingjun no ACK tem vínculo um a um com um node group do Intelligent Computing Lingjun (um cluster bare metal Lingjun). O grupo de nós de um cluster Lingjun corresponde a um único pool de nós Lingjun em um cluster ACK, e cada nó Lingjun pode pertencer a apenas um pool de nós Lingjun. Divida os nós Lingjun de um cluster ACK em diferentes pools de nós para aplicar um gerenciamento diferenciado.
-
Recursos aprimorados para IA e HPC
Após você Deploy the cloud-native AI suite, os pools de nós Lingjun oferecem os seguintes recursos aprimorados para cenários de IA e computação de alto desempenho (HPC):
Agendamento de GPU: oferece suporte a agendamento com reconhecimento de topologia para múltiplas GPUs e, em conjunto com a virtualização de contêineres de GPU, fornece agendamento compartilhado e isolamento de GPU.
Políticas de agendamento de jobs: suporta políticas como Gang, Capacity e Binpack.
Aceleração de dados: permite orquestração de conjuntos de dados e aceleração de acesso.
Visão geral dos recursos
Gerenciamento do ciclo de vida do nó
Recurso | Descrição |
Gerencie pools de nós Lingjun no console do ACK. | |
Adicione nós de um grupo de nós Lingjun a um pool de nós em lote para que o ACK possa gerenciá-los centralmente. O sistema operacional, o disco do sistema e os discos de dados dos nós não são substituídos. | |
Remova um nó de um pool de nós Lingjun para interromper o gerenciamento desse nó pelo ACK. Após a remoção, o nó não é reduzido do grupo de nós Lingjun, nem é liberado ou cancelado automaticamente. |
Configuração e O&M de nós
Recurso | Descrição |
Configure parâmetros de inicialização do kubelet, como reserva de recursos e número máximo de Pods por nó, para todos os nós de um pool e atenda aos requisitos de cargas de trabalho específicas. | |
Defina parâmetros do kernel do sistema operacional, como configurações da pilha de rede e limites de descritores de arquivos, para otimizar o ambiente de execução subjacente de todos os nós em um pool. | |
Atualize o kubelet dos nós em um pool para a mesma versão do plano de controle do cluster e mantenha a compatibilidade de versões. Somente atualizações in-place são suportadas. Atualizações com substituição de disco não são permitidas. | |
O ACK monitora eventos anormais automaticamente e, quando ocorre uma falha causada por um evento subjacente em um nó Lingjun, aciona o recurso Lingjun ApproveOperation para concluir os reparos. |
Recursos aprimorados para IA e HPC
Recurso | Descrição |
Fornece comunicação de rede RDMA para Pods em nós Lingjun e atende aos requisitos de treinamento de IA e cenários HPC que demandam alta largura de banda e baixa latência. | |
Permite compartilhamento e isolamento de recursos de GPU em nós Lingjun. Vários Pods compartilham a mesma GPU com base em cotas, o que aumenta a utilização da GPU. | |
Em cenários de treinamento de modelos, ative a política Binpack ao agendar Pods. Isso prioriza o posicionamento consolidado dos Pods para reduzir a latência de comunicação entre nós. | |
Otimiza o posicionamento de Pods com base na topologia de rede dos nós Lingjun. Pods com comunicação intensa são agendados preferencialmente em nós próximos na distância de rede, reduzindo a latência de comunicação entre nós. |
Faturamento
Ao utilizar pools de nós Lingjun em um cluster ACK managed Pro, as taxas compõem-se das três partes seguintes:
Taxa de gerenciamento do cluster: o cluster ACK managed Pro gera as taxas descritas em Cluster management fees.
Taxa de gerenciamento de nós Lingjun: quando um pool de nós Lingjun contém nós Lingjun, você é cobrado conforme descrito em Lingjun node management fees.
Taxas de recursos de product cloud: incidem as Cloud resource costs referentes aos recursos utilizados pelo cluster e pelos nós, como computação, armazenamento e rede.
O preview gratuito por convite para o recurso de gerenciamento de nós Lingjun termina em August 05, 2025, quando terá início o faturamento comercial. Para mais informações, consulte [[Billing Announcement] Lingjun Node Management Billing Announcement](t2996346.xdita#). Durante o período de preview por convite, o uso do recurso de pool de nós Lingjun é gratuito. No entanto, outras taxas relativas a clusters ACK managed Pro, como taxas de gerenciamento do cluster e de recursos de product cloud, são cobradas normalmente. Para mais detalhes, veja Billing overview.