GPUs são recursos de computação escassos, e a aquisição sob demanda envolve incertezas que podem interromper ou atrasar workloads críticos. O Alibaba Cloud Container Service (ACS) oferece dois modos de reserva de recursos para garantir capacidade determinística de GPU às suas aplicações.
Reserva de capacidade de Pod com GPU (reserva no nível de Pod)
Funcionamento: A reserva de capacidade de Pod é uma reserva de capacidade padronizada e orientada a workload. Especifique as especificações do Pod (como 2×A10 GPU, 16 vCPU, 32 GiB de memória) e a quantidade de Pods a reservar (por exemplo, 12). A plataforma reserva capacidade de computação suficiente para acomodar exatamente esses 12 Pods com a configuração definida.
Determinismo oferecido: Este modo proporciona "determinismo de capacidade de workload". Sempre que você iniciar uma solicitação de criação, o sistema garantirá capacidade para os 12 Pods especificados. Isso simplifica o planejamento de capacidade, pois elimina a preocupação com especificações de nós subjacentes ou fragmentação de recursos — basta considerar os requisitos dos Pods da sua aplicação.
-
Cenários de uso:
Workloads homogêneos: Ideal quando sua aplicação (como treinamento distribuído em larga escala ou inferência online) utiliza muitos Pods com especificações idênticas.
Operações simplificadas: Recomendado para delegar o planejamento de recursos subjacentes à plataforma e focar apenas nas necessidades de capacidade no nível da aplicação.
Reserva de capacidade GPU-HPN (reserva no nível de nó)
Funcionamento: Este modo reserva e bloqueia capacidade dedicada de nós de computação com GPU no pool de recursos subjacente do ACS. Esses recursos são alocados exclusivamente à sua conta, garantindo que hardware ativo esteja sempre disponível para hospedar novos Pods com GPU. Essa abordagem evita falhas de agendamento de Pods (status Pending) causadas por restrições no pool de recursos.
Determinismo oferecido: Este modo proporciona "determinismo de recurso físico". Ao escalar horizontalmente, a infraestrutura subjacente (nós de GPU) tem disponibilidade garantida. Você decide como agendar e combinar Pods de diferentes especificações nesses nós (prática conhecida como "bin packing").
-
Cenários de uso:
Workloads heterogêneos: Oferece flexibilidade máxima para executar Pods com GPU de diversas especificações no mesmo pool de recursos.
Controle refinado de recursos: Adequado para aplicar políticas personalizadas de agendamento (como Taints/Tolerations, Node Affinity) e controlar com precisão o posicionamento dos Pods, visando otimização de desempenho ou isolamento de recursos.
Resumo e comparação
|
Atributo |
Reserva de capacidade de Pod com GPU (nível de Pod) |
Reserva de capacidade GPU-HPN (nível de nó) |
|
Objeto da reserva |
Quantidade de Pods com especificações definidas. |
Capacidade de nós de computação com GPU subjacentes. |
|
Granularidade da reserva |
Workload lógico (como 12 Pods com 1A10GPU8C16G). |
Recursos físicos de nó (como 2 nós P16EN). |
|
Nível de garantia |
Determinismo de capacidade de workload. |
Determinismo de recurso físico de nó. |
|
Flexibilidade |
Menor (vinculada a especificações específicas de Pod). |
Muito alta (permite executar Pods com especificações flexíveis). |
|
Complexidade de gerenciamento |
Baixa (a plataforma cuida da correspondência de recursos). |
Maior (exige resposta a eventos de gerenciamento de nós). |
|
Recomendação de escolha |
|
Aplicações de médio a grande porte com especificações complexas e variáveis. |
Escolha o modo de reserva adequado ao perfil do seu workload e aos seus requisitos de determinismo para mitigar riscos na aquisição de recursos de GPU e manter suas aplicações de IA funcionando com confiabilidade.