Les services d'inférence lisent les fichiers de modèles à partir de chemins OSS ou NAS montés, ce qui peut entraîner une latence due aux limitations de la bande passante réseau.EAS propose l'accélération du cache de modèles pour mettre en cache les fichiers en mémoire ou sur disque, améliorant ainsi les vitesses de lecture et réduisant la latence.
Fonctionnement
L'accélération du cache de modèles prend en charge les deux méthodes suivantes :
Cache local : met en cache les fichiers de modèles dans la mémoire ou le disque inutilisé du service d'inférence, en les exposant sous forme de répertoire système de fichiers. Cette méthode est idéale pour les scénarios de mise à l'échelle horizontale. Plusieurs instances du même service forment un réseau pair à pair (P2P), permettant aux nouvelles instances de récupérer les données directement depuis les instances existantes dont le cache est déjà rempli, au lieu de les télécharger depuis la source OSS ou NAS.
-
Cache local + préchauffage du cache : s'appuie sur le cache local en déployant un service de préchauffage distinct et dédié qui précharge les fichiers de modèles en mémoire. Cette approche est idéale pour les nouveaux déploiements et résout le problème de démarrage à froid inhérent à la mise en cache locale.
ImportantSeul OSS prend en charge les services de préchauffage du cache.
Après configuration, le système monte un chemin accéléré sur chaque instance de service d'inférence. Votre application lit les fichiers de modèles depuis ce répertoire sans modification du code. La priorité de chargement des modèles est la suivante :
Démarrage à froid : le système tente d'abord de récupérer les données depuis le service de préchauffage du cache, si celui-ci est configuré. Sinon, il télécharge les données depuis OSS ou NAS et les met en cache localement.
Mise à l'échelle horizontale : le système privilégie un accès direct au cache local (l'éviction LRU est prise en charge). En cas d'absence dans le cache, il tente de récupérer les données depuis le service de préchauffage du cache. Si les données sont toujours introuvables, il revient à la source OSS ou NAS.
Remarques
Pour garantir la cohérence des données, le chemin accéléré monté est en lecture seule.
Pour ajouter des fichiers de modèles, ajoutez-les au chemin source. Le chemin accéléré lit automatiquement les nouveaux fichiers depuis la source.
Ne mettez pas à jour et ne supprimez pas directement les fichiers de modèles dans le chemin source. Ces opérations pourraient entraîner la diffusion de données incohérentes ou obsolètes par le cache.
Procédure
Déploiement personnalisé
Connectez-vous à la PAI console. Sélectionnez une région en haut de la page. Ensuite, sélectionnez l'espace de travail souhaité et cliquez sur Elastic Algorithm Service (EAS).
Cliquez sur Deploy Service. Dans la section Custom Model Deployment, cliquez sur Custom Deployment.
-
Les paramètres clés sont les suivants. Pour plus de détails sur les autres paramètres, consultez la rubrique déploiement personnalisé.
-
Dans la section Environment Information, configurez Mount storage pour monter vos fichiers de modèles dans un répertoire de conteneur. Par exemple, pour monter des fichiers depuis OSS :
Uri : le chemin OSS où se trouvent les fichiers de modèles, par exemple
oss://path/to/models/.Mount Path : le chemin à l'intérieur du conteneur où les fichiers sont montés, par exemple
/mnt/data/.-
Cache acceleration : activez cette option pour accélérer la lecture des modèles et la planification de la mise à l'échelle horizontale.
-
Cache Medium : sélectionnez le support en fonction du type de ressource utilisé.
Memory : utilise la mémoire comme support de cache. Disponible pour tous les types de ressources.
Disk : utilise le disque comme support de cache. Pris en charge uniquement sur les ressources de calcul intelligent Lingjun.
Maximum Capacity : la capacité maximale occupée par les fichiers accélérés, en Go. Lorsque cette limite est dépassée, le système évince les données selon une politique LRU. La valeur minimale est de 3 Go, car certains paramètres de configuration avancée par défaut nécessitent une capacité supérieure à 3 Go pour prendre effet. Assurez-vous de réserver suffisamment de mémoire ou d'espace disque.
Accelerated Path : le chemin local accéléré pour la mise en cache des fichiers. Exemple :
/mnt/data-fast/.Model Cache Prefetch Service (pris en charge uniquement pour OSS) : sélectionnez un service de préchauffage du cache déployé. Cette option est recommandée pour les nouveaux déploiements ou les scénarios nécessitant des démarrages à froid rapides, tels que ceux impliquant des fichiers de modèles volumineux ou des mises à l'échelle horizontales fréquentes. Pour utiliser cette option, vous devez d'abord déployer un service de préchauffage du cache.
-
-
Dans la section Environment Information, modifiez la Command to Run. Remplacez le chemin du fichier de modèle dans la commande par le chemin accéléré. Par exemple, lors du déploiement d'un service LLM :
vllm serve /mnt/data-fast/
-
Après avoir configuré les paramètres, cliquez sur Deploy.
Déploiement JSON
Connectez-vous à la PAI console. Sélectionnez une région en haut de la page. Ensuite, sélectionnez l'espace de travail souhaité et cliquez sur Elastic Algorithm Service (EAS).
Sur la page Elastic Algorithm Service (EAS), cliquez sur Deploy Service. Dans la section Custom Model Deployment, cliquez sur JSON Deployment.
-
Saisissez la configuration JSON. Le tableau suivant décrit les paramètres liés à l'accélération du cache de modèles. Pour plus d'informations sur les autres paramètres, consultez la rubrique déploiement JSON.
Paramètre
Description
storage[0]
oss.path
Le chemin OSS où se trouvent les fichiers de modèles. Exemple :
oss://path/to/models/.mount_path
Le chemin à l'intérieur du conteneur où OSS est monté. Exemple :
/mnt/data/.storage[1]
cache.capacity
La capacité maximale occupée par les fichiers accélérés, en Go. Lorsque cette limite est dépassée, le système évince les données selon une politique LRU. La valeur minimale est de 3 Go, car certains paramètres de configuration avancée par défaut nécessitent une capacité supérieure à 3 Go pour prendre effet. Assurez-vous de réserver suffisamment de mémoire ou d'espace disque.
cache.path
Le répertoire source des fichiers à accélérer (le chemin du conteneur où OSS ou NAS est monté). Exemple :
/mnt/data/.cache_backend
Le support de cache. Définissez cette valeur sur
diskpour utiliser le cache disque. Si ce paramètre n'est pas spécifié, la mémoire est utilisée comme support de cache.cache.cacheroot_service
Le nom du service de préchauffage du cache.
mount_path
Le chemin accéléré. Exemple :
/mnt/data-fast/.containers.script
Remplacez le chemin du fichier de modèle dans la commande d'exécution par le chemin accéléré (au lieu du chemin source, c'est-à-dire le répertoire de montage OSS/NAS), afin que l'application lise les modèles depuis le répertoire accéléré.
Exemple JSON :
{ "cloud": { "computing": { "instances": [ { "type": "ecs.gn6e-c12g1.3xlarge" } ] }, "networking": { "security_group_id": "your-security-group-id", "vpc_id": "your-vpc-id", "vswitch_id": "your-vswitch-id" } }, "containers": [ { "image": "eas-registry-vpc.cn-hangzhou.cr.aliyuncs.com/pai-eas/vllm:0.11.2-py312-mows0.5.1", "port": 8000, "script": "vllm serve /mnt/data-fast/" } ], "metadata": { "cpu": 12, "disk": "30Gi", "gpu": 1, "instance": 1, "memory": 92000, "name": "vllm_test", "workspace_id": "your-workspace-id" }, "storage": [ { "oss": { "path": "oss://path/to/models/", "readOnly": false }, "mount_path": "/mnt/data/" }, { "cache": { "capacity": "10G", "path": "/mnt/data/", "cacheroot_service": "your-cacheroot-service" }, "mount_path": "/mnt/data-fast/" } ] } Cliquez sur Deploy.
Déployer un service de préchauffage du cache
Un service de préchauffage du cache précharge les fichiers de modèles en mémoire et sert de source de données haute vitesse pour les services d'inférence dont l'accélération du cache est activée. Cette approche est idéale pour les fichiers de modèles volumineux sur OSS ou NAS, tels que ceux destinés aux LLM, à la génération d'images IA et à la génération de vidéos IA.
Le chemin OSS pour l'accélération du cache dans le service d'inférence doit correspondre exactement au chemin OSS monté par le service de préchauffage du cache. Sinon, le préchauffage du cache échouera.
Par exemple, si le chemin OSS pour l'accélération du cache dans le service d'inférence est oss://path/to/models/, le service de préchauffage du cache doit également monter oss://path/to/models/.
Sur l'onglet Inference Service, cliquez sur Deploy Service. Dans la section Scenario-based Model Deployment, cliquez sur Model Warm-up Cache Service Deployment.
-
Configurez les paramètres clés suivants, puis cliquez sur Deploy.
Paramètre
Description
Basic Information
Deployment
Sélectionnez les ressources en fonction de la taille de mémoire requise.
Cache Configuration
Cache Path
Les répertoires de modèles à mettre en cache. Vous pouvez monter plusieurs chemins.
Maximum Memory Usage
Obligatoire. La mémoire maximale que le service de préchauffage du cache peut utiliser.
Network Information
VPC
Obligatoire. Ce VPC doit être identique à celui du service d'inférence. Sinon, le service d'inférence ne pourra pas accéder au service de préchauffage du cache.
Associate NLB
Doit être activé. Par défaut, le système crée automatiquement un NLB.
Benchmarks de performances
Les benchmarks suivants illustrent les performances de l'accélération du cache de modèles. Les résultats réels peuvent varier.
Qwen3-32B
Modèle : Qwen3-32B (62 Go)
Machine : ml.gu8is.c64m512,4-gu60 | 64 cœurs 512 Go + 4× GU60(48G) | L20
|
Mode de déploiement |
Temps de chargement du modèle |
Vitesse de chargement du modèle |
Temps de disponibilité du service |
|
Standard (sans accélération du cache) |
01:05 |
7,63 Gbit/s |
01:43 |
|
Accélération du démarrage à froid (avec préchauffage du cache) |
00:21 |
23,62 Gbit/s |
01:01 |
|
Accélération de la mise à l'échelle horizontale (avec cache local) |
00:18 |
27,55 Gbit/s |
00:58 |
MiniMax-M2
Modèle : MiniMax-M2 (215 Go)
Machine : ml.gu8tf.8.40xlarge | 160 vCPU + 1800 Go + 8×GU8T | H20 (96 Go)
|
Mode de déploiement |
Temps de chargement du modèle |
Vitesse de chargement du modèle |
Temps de disponibilité du service |
|
Standard (sans accélération du cache) |
06:42 |
4,28 Gbit/s |
09:16 |
|
Accélération du démarrage à froid (avec préchauffage du cache) |
01:49 |
15,78 Gbit/s |
04:49 |
|
Accélération de la mise à l'échelle horizontale (avec cache local) |
01:42 |
16,86 Gbit/s |
04:34 |
DeepSeek-V3.2
Modèle : DeepSeek-V3.2 (643 Go)
Machine : ml.gu8tef.8.46xlarge | 184 vCPU + 1800 Go + 8×GU8TE | H20-3e (141 Go)
|
Mode de déploiement |
Temps de chargement du modèle |
Vitesse de chargement du modèle |
Temps de disponibilité du service |
|
Standard (sans accélération du cache) |
12:33 |
6,83 Gbit/s |
27:41 |
|
Accélération du démarrage à froid (avec préchauffage du cache) |
02:43 |
31,56 Gbit/s |
13:01 |
|
Accélération de la mise à l'échelle horizontale (avec cache local) |
01:58 |
43,60 Gbit/s |
12:49 |