Antes de usar o agendamento com reconhecimento de topologia de GPU, instale e configure os componentes obrigatórios. Este tópico descreve como instalar esses componentes e ativar o recurso no cluster.
Pré-requisitos
Você tem um cluster gerenciado ACK. O cluster deve usar um tipo de instância GPU.
Você já obteve o KubeConfig do cluster e se conectou a ele usando kubectl.
-
Os componentes do cluster atendem aos seguintes requisitos de versão:
Componente
Requisitos de versão
Kubernetes
1.18.8 ou posterior
Driver NVIDIA
418.87.01 ou posterior
Versão do NCCL
2.7 ou posterior
Sistema operacional
-
CentOS 7.6
-
CentOS 7.7
-
Ubuntu 16.04
-
Ubuntu 18.04
-
Alibaba Cloud Linux 2
-
Alibaba Cloud Linux 3
GPU
V100
-
Procedimento
Faça login no console ACK. No painel de navegação à esquerda, clique em Clusters.
Na página Clusters, clique no nome do cluster. No painel de navegação à esquerda, clique em .
Na página Cloud-native AI Suite, clique em Deploy.
-
Na página Deploy Cloud-native AI Suite, na seção Scheduling, selecione Scheduling Policy Extension (Batch Task Scheduling, GPU Sharing, Topology-aware GPU Scheduling) e clique em Deploy Cloud-native AI Suite abaixo. Para mais informações sobre os itens de configuração para implantar o Cloud-native AI Suite, consulte Instalar o Cloud-native AI Suite.
Após a conclusão da implantação, o componente de agendamento com reconhecimento de topologia de GPU instalado, ack-ai-installer, aparecerá em Components.
NotaSe você já implantou o Cloud-native AI Suite anteriormente, clique diretamente em Deploy na coluna Actions, à direita do componente de agendamento ack-ai-installer na lista de componentes, para instalá-lo.