Todos os produtos
Search
Central de documentação

Platform For AI:Deploy MoE models with expert parallelism

Última atualização: Jun 27, 2026

Implante modelos MoE no EAS com paralelismo de especialistas (EP) e separação Prefill-Decode (PD) para aumentar o throughput e reduzir custos.

Arquitetura

O PAI EAS combina separação PD, EP em larga escala, co-otimização de computação e comunicação e MTP para viabilizar implantações de EP nível de produção.

image.png

Principais benefícios:

  • Implantação com um clique: Os modelos de EP do EAS incluem imagens integradas, recursos opcionais e comandos de execução para implantação distribuída guiada por assistente.

  • Gerenciamento unificado de serviços: Monitore, dimensione e gerencie os subserviços de Prefill, Decode e roteador inteligente de LLM de forma independente em uma única visualização.

Implantar serviço de EP

O exemplo a seguir implanta o modelo DeepSeek-R1-0528-PAI-optimized, que oferece maior throughput e menor latência.

  1. Acesse o PAI console. Selecione uma região na parte superior da página. Em seguida, selecione o workspace desejado e clique em Elastic Algorithm Service (EAS).

  2. Na aba Inference Service, clique em Deploy Service. Na seção Scenario-based Model Deployment, clique em LLM Deployment.

  3. Em Model Settings, selecione o modelo público DeepSeek-R1-0528-PAI-optimized.

    image.png

  1. Defina Inference Engine como vLLM e Deployment Template como EP+PD Separation-PAI Optimized.

    image.png

  2. Configure os recursos de implantação para os serviços de Prefill e Decode. Escolha entre recursos públicos ou cota de recursos.

    • Recursos públicos: Indicados para testes e desenvolvimento. Especificações disponíveis: ml.gu8tea.8.48xlarge ou ml.gu8tef.8.46xlarge.image.png

    • Cota de recursos: Recomendada para ambientes de produção, pois garante estabilidade e isolamento dos recursos.

      image.png

  3. (Opcional) Ajuste os parâmetros de implantação para otimizar o desempenho.

    • Número de instâncias: Altere a quantidade de instâncias de Prefill e Decode para modificar a proporção PD. Padrão: 1 por serviço.

    • Parâmetros de paralelismo: Ajuste EP_SIZE, DP_SIZE e TP_SIZE nas variáveis de ambiente dos serviços de Prefill e Decode. Valores padrão: TP_SIZE=8 para Prefill; EP_SIZE=8 e DP_SIZE=8 para Decode.

      Nota

      Para proteger os pesos do modelo DeepSeek-R1-0528-PAI-optimized, o comando de execução não fica exposto. Utilize variáveis de ambiente para alterar os parâmetros principais.

      image.png

  4. Clique em Deploy e aguarde a inicialização do serviço. A implantação leva aproximadamente 40 minutos.

  5. Após a implantação, acesse a aba Online Debugging na página de detalhes do serviço para verificá-lo.

    Nota

    O acesso via API e a integração com terceiros estão descritos em Chamar um serviço de LLM.

    Monte uma requisição no formato OpenAI. Adicione /v1/chat/completions ao caminho da URL. Exemplo de corpo da requisição:

    {
        "model": "",
        "messages": [
            {
                "role": "user",
                "content": "Hello!"
            }
        ],
        "max_tokens": 1024
    }

    Clique em Send Request. Um código de status 200 acompanhado de uma resposta válida do modelo confirma que o serviço está em execução.

    image.png

Gerenciar serviço de EP

  1. Na página de lista de serviços, clique em nome de um serviço para abrir sua página de detalhes. Essa página oferece visualizações do serviço agregado e dos subserviços individuais (Prefill, Decode e roteador inteligente de LLM).

    image.png

  2. Visualize dados de monitoramento e logs e configure políticas de Auto Scaling.

    image.png