Todos os produtos
Search
Central de documentação

Container Service for Kubernetes:Visão geral do agendamento com reconhecimento de topologia de GPU

Última atualização: Jun 27, 2026

Este tópico descreve a topologia de GPU e os benefícios do agendamento de GPU com reconhecimento de topologia.

Topologia de GPU

A figura a seguir ilustra a topologia de malha cúbica híbrida de oito GPUs Tesla V100 que se comunicam entre si por meio de NVLinks. Cada GPU Tesla V100 possui seis NVLinks atribuídos, o que impede a interconexão completa entre as oito unidades. É possível estabelecer no máximo duas conexões NVLink entre duas GPUs Tesla V100.

Neste exemplo, a GPU0 conecta-se à GPU3 e à GPU4 por meio de dois NVLinks, e à GPU1 e à GPU2 por meio de um único NVLink. Já entre a GPU0 e a GPU6 não há conexão NVLink; portanto, a comunicação depende do Peripheral Component Interconnect Express (PCIe).

image

Benefícios do agendamento de GPU com reconhecimento de topologia

Cada NVLink oferece largura de banda unidirecional de 25 GB/s e bidirecional de 50 GB/s, enquanto o link PCIe atinge 16 GB/s. Durante o treinamento, diferentes combinações de GPUs resultam em velocidades distintas. Assim, combine modelos variados de GPU para obter o melhor desempenho de treinamento.

O Kubernetes não reconhece a topologia dos recursos de GPU nos nós e agenda esses recursos aleatoriamente. Essa abordagem gera variações na velocidade de treinamento conforme a combinação utilizada. Para solucionar esse problema, o Container Service for Kubernetes (ACK) oferece suporte ao agendamento de GPU com reconhecimento de topologia baseado no framework de agendamento. Esse recurso permite que o ACK selecione a configuração com maior velocidade de treinamento entre as combinações de GPU disponíveis nos nós.