Visão geral
O Container GPU (cGPU) da Alibaba Cloud segmenta a memória e o poder de computação de uma GPU e os gerencia de forma transparente como múltiplos contêineres isolados. Você pode ativar o cGPU para clusters de contêineres implantados na Alibaba Cloud, Amazon Web Services (AWS), Google Compute Engine (GCE) ou data centers, e personalizar facilmente as políticas de compartilhamento e agendamento de GPU no Alibaba Cloud Container Service for Kubernetes (ACK) com base nos requisitos de tarefas de inferência ou treinamento de IA, otimizando a utilização de recursos e reduzindo custos.
Destaques da solução
-
Isolamento eficiente de memória da GPU
Maximize a utilização da GPU e evite conflitos de memória segmentando os recursos de memória e computação de uma GPU e gerenciando-os como múltiplos contêineres, com base na tecnologia de isolamento de GPU virtual do kernel do host da Alibaba Cloud
-
Compartilhamento e agendamento flexível de recursos de GPU
Aloque os recursos de memória e computação das GPUs para tarefas de IA com estratégias de agendamento para diferentes cenários de negócios, maximizando a utilização da GPU e mantendo alto desempenho para contêineres
-
Escalonamento automático de GPU personalizável
Aumente a disponibilidade de recursos de GPU e garanta a estabilidade das tarefas de IA com escalonamento automático de GPU, definindo métricas essenciais como taxa de utilização e uso de memória para acionar o escalonamento vertical ascendente e descendente de instâncias de GPU
-
Monitoramento de GPU visualizado em tempo real
Mantenha a integridade das instâncias de GPU e equilibre a distribuição de cargas com base em informações visualizadas em tempo real de métricas essenciais da GPU, como alocação e uso de memória e temperatura da GPU, por meio dos painéis de clusters e nós no Prometheus
Melhore a utilização de GPU com o cGPU da Alibaba Cloud
Iniciar consultoria individualComo funciona
Seu desafio
Para múltiplas tarefas, como cargas de trabalho de inferência de IA executando em uma única GPU, a GPU é sempre ocupada por apenas uma tarefa com uso total de memória, mas a maior parte do recurso de computação fica ociosa, resultando em baixa utilização da GPU
Nossa solução
-
O cGPU da Alibaba Cloud permite que múltiplos contêineres de GPU executem em uma única GPU, com aplicativos isolados em seus respectivos contêineres. É impulsionado por um kernel do host que fornece GPUs virtuais para os contêineres, isolando memória e poder de computação. Os recursos de GPU atribuídos a cada contêiner são isolados para evitar conflitos operacionais e riscos de segurança. O cGPU é compatível com Kubernetes open source e NVIDIA Docker, e pode ser implantado em diferentes tipos de instâncias aceleradas por GPU da Alibaba Cloud ou no Alibaba Cloud Container Service for Kubernetes (ACK) para suportar o compartilhamento de GPU
Elastic GPU Service
Capacidades avançadas de computação paralela baseadas em tecnologia GPU
Saiba maisECS 7ª geração
Totalmente equipado com chips TPM e aumento do poder de computação das instâncias em até 40%
Saiba maisInstância bare metal ECS
Combina a elasticidade de um servidor virtual com o alto desempenho e os recursos abrangentes de um servidor físico
Saiba maisSeu desafio
As soluções atuais de compartilhamento de GPU no mercado dependem de modificação de API, o que exige recompilação do aplicativo, ou não conseguem isolar os recursos de GPU alocados, causando erros de GPU e falhas nos aplicativos. O recurso de agendamento padrão do Kubernetes não consegue atribuir nós para executar tarefas de IA
Nossa solução
-
O ACK permite que múltiplos contêineres compartilhem os recursos de uma única GPU. Você pode monitorar o uso da GPU no console do Application Real-Time Monitoring Service (ARMS) e configurar a memória da GPU para cada pod com base nos requisitos das cargas de trabalho dos contêineres, maximizando a utilização de recursos e reduzindo custos. Para tarefas de inferência e treinamento de IA em diferentes cenários de negócios, você pode configurar políticas de agendamento de tarefas de IA adequadamente para melhorar a eficiência das tarefas e a utilização da GPU. Por exemplo, você pode escolher a política de agendamento binpack para alocar tarefas em um único nó até que ele tenha recursos insuficientes, evitando transferência de dados entre servidores e prevenindo fragmentação de recursos. Ou escolher a política de agendamento gang para alocar recursos somente quando todas as subtarefas de uma tarefa puderem obter os recursos necessários, evitando falhas de tarefas e desperdício de recursos devido a deadlocks de recursos
Alibaba Cloud Container Service for Kubernetes
Garantia de alta eficiência para empresas executando aplicativos em contêineres na nuvem
Saiba maisApplication Real-Time Monitoring Service
Desenvolvimento de capacidades de monitoramento de negócios com respostas em tempo real, com base em capacidades abrangentes de monitoramento
Saiba maisSegurança e conformidade
-
CSA STAR -
ISO 27001 -
SOC2 Type II Report -
C5 -
MLPS 2.0 -
MTCS
Melhore a utilização de GPU com o cGPU da Alibaba Cloud
Iniciar consultoria individualRecursos relacionados
Whitepaper
Whitepaper de aceleração de IA
Este whitepaper é um guia completo sobre o mecanismo da camada de infraestrutura de IA e como ela suporta a aceleração de IA
Blog
A tecnologia cGPU melhora o uso da GPU, impulsiona a eficiência da IA e reduz custos
A Alibaba Cloud lançou a tecnologia de compartilhamento de contêineres cGPU, permitindo que os usuários utilizem contêineres para agendar recursos subjacentes de GPU de forma granular
Blog
Gerenciamento de GPU e implementação de plugin de dispositivo com Kubernetes
Este artigo apresenta os plugins de GPU comuns para Kubernetes e como usar GPUs no Docker e no Kubernetes
Comece com as soluções da Alibaba Cloud
Conheça e experimente o poder da Alibaba Cloud
Falar com vendas