Os serviços de inferência leem arquivos de modelo em caminhos montados do OSS ou NAS, o que pode causar latência devido a limitações de largura de banda da rede.EAS oferece aceleração de cache de modelos para armazenar esses arquivos em memória, aumentar a velocidade de leitura e reduzir a latência.
Como funciona
A aceleração de cache de modelos oferece suporte a dois métodos:
Cache local: Armazena os arquivos de modelo na memória ociosa do serviço de inferência e os expõe como um diretório do sistema de arquivos. Esse método é ideal para cenários de scale-out. Várias instâncias do mesmo serviço formam uma rede peer-to-peer (P2P), permitindo que novas instâncias obtenham dados diretamente das instâncias existentes com cache preenchido, em vez de buscar no OSS ou NAS de origem.
Cache local + pré-carregamento de cache: Baseia-se no cache local ao implantar um serviço separado e dedicado de pré-carregamento, que carrega previamente os arquivos de modelo na memória. É mais indicado para novas implantações e resolve o problema de cold start inerente ao cache local.
Após a configuração, o sistema monta um caminho acelerado em cada instância do serviço de inferência. Sua aplicação lê os arquivos de modelo desse diretório sem necessidade de alterações no código. A prioridade de carregamento do modelo segue a ordem abaixo:
Cold start: O sistema tenta primeiro obter dados do serviço de pré-carregamento de cache, se configurado. Caso contrário, busca os dados no OSS ou NAS e os armazena em cache localmente.
Scale-out: O sistema prioriza um acerto no cache local (com suporte a evicção LRU). Em caso de falha no cache, tenta buscar no serviço de pré-carregamento. Se os dados ainda não forem encontrados, recorre ao OSS ou NAS de origem.
Observações
Para manter a consistência dos dados, o caminho acelerado montado é somente leitura.
Para adicionar arquivos de modelo, adicione-os ao caminho de origem. O caminho acelerado lê automaticamente os novos arquivos da origem.
Não atualize nem exclua arquivos de modelo diretamente no caminho de origem. Atualizar ou excluir arquivos dessa forma pode fazer com que o cache forneça dados inconsistentes ou desatualizados.
Procedimento
Implantação personalizada
Faça login no PAI console. Selecione uma região na parte superior da página. Em seguida, selecione o workspace desejado e clique em Elastic Algorithm Service (EAS).
Clique em Deploy Service. Na seção Custom Model Deployment, clique em Custom Deployment.
-
Os principais parâmetros são descritos a seguir. Para detalhes sobre outros parâmetros, consulte implantação personalizada.
-
Na seção Environment Information, configure Mount storage para montar seus arquivos de modelo em um diretório do contêiner. Por exemplo, para montar arquivos do OSS:
Uri: O caminho do OSS onde os arquivos de modelo estão localizados, como
oss://path/to/models/Qwen3-8B/.Mount Path: O caminho dentro do contêiner onde os arquivos são montados, como
/mnt/models/Qwen3-8B/.
-
Na seção Features, ative a chave Distributed cache acceleration e configure os seguintes parâmetros:
Parâmetro
Descrição
Maximum Memory Usage
Memória máxima que o cache pode utilizar, em GB. Quando esse limite é excedido, o sistema remove dados com base em uma política LRU. O valor mínimo é 3G, pois alguns parâmetros avançados de configuração padrão exigem capacidade superior a 3G para entrar em vigor. Exemplo:
20GB.Source Path
Diretório de origem a ser acelerado. Insira o caminho do contêiner onde o armazenamento OSS ou NAS está montado.
Accelerated Path
Caminho do cache local. Sua aplicação lê os modelos deste diretório. Este caminho deve ser diferente do caminho de origem. Exemplo:
/mnt/models/Qwen3-8B-fast/.Model Cache Prefetch Service
(Opcional) Selecione um serviço de pré-carregamento de cache implantado. Esta opção é recomendada para novas implantações ou cenários que exigem cold starts rápidos, como aqueles envolvendo arquivos de modelo grandes ou scale-outs frequentes. Para usar esta opção, implante primeiro um serviço de pré-carregamento de cache.
-
Na seção Environment Information, modifique o Command to Run. Altere o caminho do arquivo de modelo no comando do caminho de origem para o caminho acelerado. Por exemplo, ao implantar um serviço LLM:
vllm serve /mnt/models/Qwen3-8B-fast/
-
Após configurar os parâmetros, clique em Deploy.
Implantação via JSON
Faça login no PAI console. Selecione uma região na parte superior da página. Em seguida, selecione o workspace desejado e clique em Elastic Algorithm Service (EAS).
Na página Elastic Algorithm Service (EAS), clique em Deploy Service. Na seção Custom Model Deployment, clique em JSON Deployment.
-
Insira a configuração JSON. Exemplo:
{ "cloud": { "computing": { "instances": [ { "type": "ecs.gn6e-c12g1.3xlarge" } ] }, "networking": { "security_group_id": "your-security-group-id", "vpc_id": "your-vpc-id", "vswitch_id": "your-vswitch-id" } }, "containers": [ { "image": "eas-registry-vpc.cn-hangzhou.cr.aliyuncs.com/pai-eas/vllm:0.11.2-py312-mows0.5.1", "port": 8000, "script": "vllm serve /mnt/models/Qwen3-8B-fast/" } ], "metadata": { "cpu": 12, "disk": "30Gi", "gpu": 1, "instance": 1, "memory": 92000, "name": "vllm_test", "workspace_id": "your-workspace-id" }, "storage": [ { "mount_path": "/mnt/models/Qwen3-8B/", "oss": { "path": "oss://path/to/models/Qwen3-8B/", "readOnly": false } }, { "cache": { "capacity": "10G", "path": "/mnt/models/Qwen3-8B/", "cacheroot_service": "your-cacheroot-service" }, "mount_path": "/mnt/models/Qwen3-8B-fast/" } ] }A tabela a seguir descreve os parâmetros relacionados à aceleração de cache de modelos. Para informações sobre outros parâmetros, consulte implantação via JSON.
Parâmetro
Descrição
containers.script
Altere o caminho do arquivo de modelo no comando de execução do caminho de origem (caminho de montagem OSS/NAS) para o caminho acelerado.
storage[].cache
capacity
Memória máxima ocupada pelos arquivos acelerados, em GB. Quando esse limite é excedido, o sistema remove dados com base em uma política LRU. O valor mínimo é 3G, pois alguns parâmetros avançados de configuração padrão exigem capacidade superior a 3G para entrar em vigor.
path
Diretório de origem a ser acelerado. Insira o caminho do contêiner onde o armazenamento OSS ou NAS está montado.
preload
Armazena arquivos em memória quando o serviço inicia. Defina como
"/".cacheroot_service
Nome do serviço de pré-carregamento de cache.
storage[].mount_path
Caminho no contêiner onde o armazenamento é montado.
Clique em Deploy.
Implantar um serviço de pré-carregamento de cache
Um serviço de pré-carregamento de cache carrega previamente arquivos de modelo na memória e atua como uma fonte de dados de alta velocidade para serviços de inferência com aceleração de cache ativada. É projetado para cenários com arquivos de modelo grandes no OSS ou NAS, como os usados em LLMs, geração de imagens por IA e geração de vídeos por IA.
O caminho do OSS correspondente ao caminho de origem na configuração de aceleração de cache do serviço de inferência deve corresponder exatamente ao caminho do OSS montado pelo serviço de pré-carregamento de cache. Se os caminhos não coincidirem, o pré-carregamento do cache falhará.
Por exemplo, se o caminho de origem para aceleração de cache no serviço de inferência for /mnt/models/Qwen3-8B/, que corresponde ao caminho do OSS oss://path/to/models/Qwen3-8B/, o serviço de pré-carregamento de cache também deve montar oss://path/to/models/Qwen3-8B/.
Na aba Inference Service, clique em Deploy Service. Na seção Scenario-based Model Deployment, clique em Model Warm-up Cache Service Deployment.
-
Configure os seguintes parâmetros principais e clique em Deploy.
Parâmetro
Descrição
Basic Information
Deployment
Selecione recursos com base no tamanho de memória necessário.
Cache Configuration
Cache Path
Diretórios de modelo a serem armazenados em cache. É possível montar vários caminhos.
Maximum Memory Usage
Obrigatório. Memória máxima que o serviço de pré-carregamento de cache pode utilizar.
Network Information
VPC
Obrigatório. Deve ser a mesma VPC do serviço de inferência. Caso contrário, o serviço de inferência não conseguirá acessar o serviço de pré-carregamento de cache.
Associate NLB
Deve estar ativado. Por padrão, o sistema cria automaticamente um NLB.
Benchmarks de desempenho
Os benchmarks a seguir mostram o desempenho da aceleração de cache de modelos. Os resultados reais podem variar.
Qwen3-32B
Modelo: Qwen3-32B (62 GB)
Máquina: ml.gu8is.c64m512,4-gu60 | 64 núcleos, 512 GB + 4× GU60(48G) | L20
|
Modo de implantação |
Tempo de carregamento do modelo |
Velocidade de carregamento do modelo |
Tempo até a disponibilidade do serviço |
|
Padrão (sem aceleração de cache) |
01:05 |
7,63 Gbit/s |
01:43 |
|
Aceleração de cold start (com pré-carregamento de cache) |
00:21 |
23,62 Gbit/s |
01:01 |
|
Aceleração de scale-out (com cache local) |
00:18 |
27,55 Gbit/s |
00:58 |
MiniMax-M2
Modelo: MiniMax-M2 (215 GB)
Máquina: ml.gu8tf.8.40xlarge | 160 vCPU + 1800 GB + 8×GU8T | H20 (96 GB)
|
Modo de implantação |
Tempo de carregamento do modelo |
Velocidade de carregamento do modelo |
Tempo até a disponibilidade do serviço |
|
Padrão (sem aceleração de cache) |
06:42 |
4,28 Gbit/s |
09:16 |
|
Aceleração de cold start (com pré-carregamento de cache) |
01:49 |
15,78 Gbit/s |
04:49 |
|
Aceleração de scale-out (com cache local) |
01:42 |
16,86 Gbit/s |
04:34 |
DeepSeek-V3.2
Modelo: DeepSeek-V3.2 (643 GB)
Máquina: ml.gu8tef.8.46xlarge | 184 vCPU + 1800 GB + 8×GU8TE | H20-3e (141 GB)
|
Modo de implantação |
Tempo de carregamento do modelo |
Velocidade de carregamento do modelo |
Tempo até a disponibilidade do serviço |
|
Padrão (sem aceleração de cache) |
12:33 |
6,83 Gbit/s |
27:41 |
|
Aceleração de cold start (com pré-carregamento de cache) |
02:43 |
31,56 Gbit/s |
13:01 |
|
Aceleração de scale-out (com cache local) |
01:58 |
43,60 Gbit/s |
12:49 |