EAS oferece três tipos de recursos: recursos públicos, grupos de recursos do EAS e cotas de recursos. Eles atendem a diversos cenários, desde testes até produção. Este tópico descreve como selecionar um tipo de recurso, configurar recursos de computação e definir políticas de agendamento.
Escolha um tipo de recurso
Tipo de recurso | Casos de uso | Faturamento | Comparação de recursos | |
Ideal para testes ou serviços com tráfego flutuante (quando combinados com um pool de recursos elásticos). |
|
| ||
Grupo de recursos dedicado | Recomendado para cenários que exigem alta segurança ou recursos exclusivos. Adquira um grupo de recursos dedicado para reservar recursos escassos. |
|
| |
Grupo de recursos virtual | Grupo de recursos lógico que combina múltiplos tipos, como recursos públicos, cotas de recursos e grupos dedicados. | O faturamento baseia-se nos recursos agendados e utilizados. |
| |
Cota de recursos | Computação de uso geral 2.0 | Indicado para cenários de produção que exigem recursos dedicados e isolamento. |
|
|
Projetado para modelos grandes ou cenários que demandam hardware de alto desempenho, como interconexões de alta velocidade RDMA e armazenamento CPFS para computação inteligente. |
| |||
Recomendações:
Testes e desenvolvimento: Utilize recursos públicos para faturamento no modelo pagamento conforme o uso, sem investimento inicial. A disponibilidade pode ser limitada em horários de pico. Para mais informações, consulte O que fazer se os recursos públicos forem insuficientes?
Ambientes de produção (tráfego estável): Opte por um grupo de recursos dedicado do EAS ou uma cota de recursos (Computação de uso geral 2.0). Essas opções fornecem recursos dedicados, desempenho estável e suporte a faturamento por assinatura para reduzir custos.
Ambientes de produção (tráfego flutuante): Use um grupo de recursos virtual. Um grupo dedicado ou cota de recursos estabelece uma linha de base, enquanto os recursos públicos absorvem picos de tráfego.
Modelos grandes ou hardware especializado: Escolha uma cota de recursos (Computação inteligente Lingjun) para acessar hardware de alto desempenho.
Escolha um tipo de instância
Selecione uma instância de cpu ou gpu com base no tamanho do modelo e na carga de trabalho de inferência.
Instância spot: Ao usar recursos públicos, ative o modo spot e defina um limite de lance para utilizar recursos ociosos por um preço inferior ao das instâncias regulares. Como o sistema pode recuperar uma instância spot, ela é mais adequada para tarefas de inferência que toleram interrupções.
GPU driver version: Ao escolher uma instância gpu, especifique a versão do driver na seção Features > Resource Configuration para atender aos requisitos de runtime de um modelo ou framework específico.
Configure o disco do sistema
O disco do sistema armazena dados temporários gerados durante a execução. As configurações padrão variam conforme o tipo de recurso:
Recursos públicos: Inclui um disco do sistema gratuito de 30 GiB. O uso acima de 30 GiB gera cobrança no modelo pagamento conforme o uso.
Grupo de recursos do EAS ou cota de recursos: O tamanho padrão do disco do sistema é 60 GiB. Se você alterar a capacidade, o disco será alocado da máquina host.
Defina a contagem de réplicas
A contagem de réplicas corresponde ao número de instâncias executando seu serviço. Recomendamos configurar múltiplas réplicas para evitar um ponto único de falha.
Configure políticas de agendamento
Ao utilizar um grupo de recursos do EAS ou uma cota de recursos, aplique as seguintes políticas para otimizar o agendamento:
Elastic Resource Pool: Quando seus próprios recursos são insuficientes, o sistema escala horizontalmente de forma automática usando recursos públicos no modelo pagamento conforme o uso para lidar com picos de tráfego. Durante a redução de escala, as instâncias que usam recursos públicos são liberadas primeiro para reduzir custos. Para mais informações, consulte Pool de recursos elásticos.
Specify Node Scheduling: Esta política restringe a execução do serviço a nós especificados. Caso nenhum nó seja definido, todos os nós não excluídos estarão elegíveis para agendamento.
High-priority Resource Rescheduling: Ao ativar este recurso, o sistema migra periodicamente instâncias de recursos de menor prioridade (como recursos públicos) para recursos de maior prioridade (como um grupo dedicado), visando a otimização de custos. Isso é útil quando atualizações contínuas agendam temporariamente instâncias em recursos públicos, ou quando você deseja migrar instâncias regulares para instâncias spot para reduzir despesas.
Resource Affinity Scheduling: Ao usar recursos de computação inteligente Lingjun de um grupo de recursos públicos para inferência distribuída multinó, ative o agendamento por afinidade de recursos na seção Features. Isso agenda instâncias para o domínio de rede de hiper-nó especificado na HPN Zone, garantindo a interconexão de alta velocidade RDMA.
Compartilhamento de gpu e inferência distribuída
Compartilhamento de gpu: Divide o poder de computação e a memória de uma única placa gpu entre várias instâncias de serviço para melhorar a utilização da gpu e reduzir custos de implantação. Este recurso é ideal para modelos menores ou cargas de trabalho com baixos volumes de inferência. O compartilhamento de gpu só pode ser ativado ao usar um grupo de recursos do EAS ou uma cota de recursos.
Inferência distribuída multinó: Implanta uma única instância de serviço em várias máquinas. Isso supera os limites de hardware de um único nó e suporta a implantação e operação de modelos extremamente grandes.
Perguntas frequentes
Uso e limitações de recursos
P: Por que a instância de 1 vCPU e 2 GB está indisponível?
O tipo de instância com 1 vCPU e 2 GB de memória está indisponível para garantir a estabilidade do serviço. Os componentes do sistema consomem parte dos recursos de cada nó. Em instâncias menores, isso deixa recursos insuficientes para o seu serviço.
P: Como estimar a quantidade de modelos por instância do pai-EAS?
A quantidade de modelos implantáveis em uma única instância do pai-EAS depende dos requisitos de recursos de cada modelo, como núcleos de cpu, memória da gpu e memória do sistema. Não há um limite predefinido. Recomendamos escolher um tipo de instância com base nas necessidades reais do modelo ou implantar modelos diferentes em instâncias separadas.
P: Qual é o número máximo de serviços que podem ser implantados no EAS?
O número máximo de instâncias de serviço implantáveis depende dos recursos disponíveis restantes. Visualize a capacidade restante de cada máquina na lista de máquinas do seu grupo de recursos no console. Para mais informações, consulte Usar um grupo de recursos do EAS.
Se você aloca tarefas com base em núcleos de cpu, o número máximo de instâncias implantáveis é (Total de Núcleos de cpu - 1) / Núcleos usados por instância.
P: Qual instância do EAS é comparável a uma RTX 4090?
ecs.gn8ia-2x.8xlarge oferece desempenho próximo ao de uma RTX 4090.
P: Qual é a concorrência máxima para um modelo implantado?
A concorrência máxima de um serviço de modelo depende de múltiplos fatores, incluindo o modelo, o caso de uso e a configuração de recursos. Recomendamos executar testes de estresse para medir o desempenho do serviço.
Gerenciamento de grupos de recursos dedicados
P: Por que meu grupo de recursos dedicado permanece no estado "Scaling Out" por muito tempo?
Isso geralmente ocorre devido à capacidade insuficiente na região atual. Para instâncias por assinatura, se a criação falhar por falta de capacidade, o sistema gera automaticamente um pedido de reembolso e devolve o valor ao método de pagamento original.
P: Como excluir uma instância por assinatura?
Acesse a página Alibaba Cloud Unsubscribe Resources para cancelar a assinatura de máquinas dedicadas do EAS que você não precisa mais. Configure os seguintes parâmetros:
Type: Selecione Partial refund.
Product name: Selecione EAS Dedicated Machine Subscription.
Clique em Search para localizar o recurso desejado. Em seguida, clique em Unsubscribe resource na coluna Actions e siga as instruções na tela para concluir o processo.
P: Os dados da instância são mantidos após o cancelamento da assinatura?
Não, os dados da instância de serviço não são retidos.
Gerenciamento do disco do sistema
P: Como aumento o tamanho do disco do sistema?
Configure ou expanda o disco do sistema de um serviço de uma das seguintes maneiras:
Configuração via console: Ao criar ou atualizar um serviço, na seção , defina o tamanho do System Disk em Configure a system disk.
-
Configuração JSON: No arquivo de configuração JSON do serviço, modifique o valor
diskno campometadata."metadata": {"disk": "40Gi"}
Se você estiver usando um grupo de recursos dedicado, o tamanho configurado do disco do sistema não pode exceder o tamanho do disco do sistema do nó. Caso precise de um disco maior, libere o nó atual e adquira um novo nó com um disco do sistema de maior capacidade.