Implante modelos MoE no EAS com paralelismo de especialistas (EP) e separação Prefill-Decode (PD) para aumentar o throughput e reduzir custos.
Arquitetura
O PAI EAS combina separação PD, EP em larga escala, co-otimização de computação e comunicação e MTP para viabilizar implantações de EP nível de produção.

Principais benefícios:
Implantação com um clique: Os modelos de EP do EAS incluem imagens integradas, recursos opcionais e comandos de execução para implantação distribuída guiada por assistente.
Gerenciamento unificado de serviços: Monitore, dimensione e gerencie os subserviços de Prefill, Decode e roteador inteligente de LLM de forma independente em uma única visualização.
Implantar serviço de EP
O exemplo a seguir implanta o modelo DeepSeek-R1-0528-PAI-optimized, que oferece maior throughput e menor latência.
Acesse o PAI console. Selecione uma região na parte superior da página. Em seguida, selecione o workspace desejado e clique em Elastic Algorithm Service (EAS).
Na aba Inference Service, clique em Deploy Service. Na seção Scenario-based Model Deployment, clique em LLM Deployment.
-
Em Model Settings, selecione o modelo público DeepSeek-R1-0528-PAI-optimized.

-
Defina Inference Engine como vLLM e Deployment Template como EP+PD Separation-PAI Optimized.

-
Configure os recursos de implantação para os serviços de Prefill e Decode. Escolha entre recursos públicos ou cota de recursos.
Recursos públicos: Indicados para testes e desenvolvimento. Especificações disponíveis:
ml.gu8tea.8.48xlargeouml.gu8tef.8.46xlarge.
-
Cota de recursos: Recomendada para ambientes de produção, pois garante estabilidade e isolamento dos recursos.

-
(Opcional) Ajuste os parâmetros de implantação para otimizar o desempenho.
Número de instâncias: Altere a quantidade de instâncias de Prefill e Decode para modificar a proporção PD. Padrão: 1 por serviço.
-
Parâmetros de paralelismo: Ajuste
EP_SIZE,DP_SIZEeTP_SIZEnas variáveis de ambiente dos serviços de Prefill e Decode. Valores padrão:TP_SIZE=8 para Prefill;EP_SIZE=8 eDP_SIZE=8 para Decode.NotaPara proteger os pesos do modelo DeepSeek-R1-0528-PAI-optimized, o comando de execução não fica exposto. Utilize variáveis de ambiente para alterar os parâmetros principais.

Clique em Deploy e aguarde a inicialização do serviço. A implantação leva aproximadamente 40 minutos.
-
Após a implantação, acesse a aba Online Debugging na página de detalhes do serviço para verificá-lo.
NotaO acesso via API e a integração com terceiros estão descritos em Chamar um serviço de LLM.
Monte uma requisição no formato OpenAI. Adicione
/v1/chat/completionsao caminho da URL. Exemplo de corpo da requisição:{ "model": "", "messages": [ { "role": "user", "content": "Hello!" } ], "max_tokens": 1024 }Clique em Send Request. Um código de status 200 acompanhado de uma resposta válida do modelo confirma que o serviço está em execução.

Gerenciar serviço de EP
-
Na página de lista de serviços, clique em nome de um serviço para abrir sua página de detalhes. Essa página oferece visualizações do serviço agregado e dos subserviços individuais (Prefill, Decode e roteador inteligente de LLM).

-
Visualize dados de monitoramento e logs e configure políticas de Auto Scaling.
