Tous les produits
Search
Centre de documentation

Platform For AI:Accélération du cache de modèles

Dernière mise à jour :Aug 09, 2026

Les services d'inférence lisent les fichiers de modèles à partir de chemins OSS ou NAS montés, ce qui peut entraîner une latence due aux limitations de la bande passante réseau.EAS propose l'accélération du cache de modèles pour mettre en cache les fichiers en mémoire ou sur disque, améliorant ainsi les vitesses de lecture et réduisant la latence.

Fonctionnement

L'accélération du cache de modèles prend en charge les deux méthodes suivantes :

  • Cache local : met en cache les fichiers de modèles dans la mémoire ou le disque inutilisé du service d'inférence, en les exposant sous forme de répertoire système de fichiers. Cette méthode est idéale pour les scénarios de mise à l'échelle horizontale. Plusieurs instances du même service forment un réseau pair à pair (P2P), permettant aux nouvelles instances de récupérer les données directement depuis les instances existantes dont le cache est déjà rempli, au lieu de les télécharger depuis la source OSS ou NAS.

  • Cache local + préchauffage du cache : s'appuie sur le cache local en déployant un service de préchauffage distinct et dédié qui précharge les fichiers de modèles en mémoire. Cette approche est idéale pour les nouveaux déploiements et résout le problème de démarrage à froid inhérent à la mise en cache locale.

    Important

    Seul OSS prend en charge les services de préchauffage du cache.

Après configuration, le système monte un chemin accéléré sur chaque instance de service d'inférence. Votre application lit les fichiers de modèles depuis ce répertoire sans modification du code. La priorité de chargement des modèles est la suivante :

  • Démarrage à froid : le système tente d'abord de récupérer les données depuis le service de préchauffage du cache, si celui-ci est configuré. Sinon, il télécharge les données depuis OSS ou NAS et les met en cache localement.

  • Mise à l'échelle horizontale : le système privilégie un accès direct au cache local (l'éviction LRU est prise en charge). En cas d'absence dans le cache, il tente de récupérer les données depuis le service de préchauffage du cache. Si les données sont toujours introuvables, il revient à la source OSS ou NAS.

Remarques

  • Pour garantir la cohérence des données, le chemin accéléré monté est en lecture seule.

  • Pour ajouter des fichiers de modèles, ajoutez-les au chemin source. Le chemin accéléré lit automatiquement les nouveaux fichiers depuis la source.

  • Ne mettez pas à jour et ne supprimez pas directement les fichiers de modèles dans le chemin source. Ces opérations pourraient entraîner la diffusion de données incohérentes ou obsolètes par le cache.

Procédure

Déploiement personnalisé

  1. Connectez-vous à la PAI console. Sélectionnez une région en haut de la page. Ensuite, sélectionnez l'espace de travail souhaité et cliquez sur Elastic Algorithm Service (EAS).

  2. Cliquez sur Deploy Service. Dans la section Custom Model Deployment, cliquez sur Custom Deployment.

  3. Les paramètres clés sont les suivants. Pour plus de détails sur les autres paramètres, consultez la rubrique déploiement personnalisé.

    1. Dans la section Environment Information, configurez Mount storage pour monter vos fichiers de modèles dans un répertoire de conteneur. Par exemple, pour monter des fichiers depuis OSS :

      • Uri : le chemin OSS où se trouvent les fichiers de modèles, par exemple oss://path/to/models/.

      • Mount Path : le chemin à l'intérieur du conteneur où les fichiers sont montés, par exemple /mnt/data/.

      • Cache acceleration : activez cette option pour accélérer la lecture des modèles et la planification de la mise à l'échelle horizontale.

        • Cache Medium : sélectionnez le support en fonction du type de ressource utilisé.

          • Memory : utilise la mémoire comme support de cache. Disponible pour tous les types de ressources.

          • Disk : utilise le disque comme support de cache. Pris en charge uniquement sur les ressources de calcul intelligent Lingjun.

        • Maximum Capacity : la capacité maximale occupée par les fichiers accélérés, en Go. Lorsque cette limite est dépassée, le système évince les données selon une politique LRU. La valeur minimale est de 3 Go, car certains paramètres de configuration avancée par défaut nécessitent une capacité supérieure à 3 Go pour prendre effet. Assurez-vous de réserver suffisamment de mémoire ou d'espace disque.

        • Accelerated Path : le chemin local accéléré pour la mise en cache des fichiers. Exemple : /mnt/data-fast/.

        • Model Cache Prefetch Service (pris en charge uniquement pour OSS) : sélectionnez un service de préchauffage du cache déployé. Cette option est recommandée pour les nouveaux déploiements ou les scénarios nécessitant des démarrages à froid rapides, tels que ceux impliquant des fichiers de modèles volumineux ou des mises à l'échelle horizontales fréquentes. Pour utiliser cette option, vous devez d'abord déployer un service de préchauffage du cache.

    2. Dans la section Environment Information, modifiez la Command to Run. Remplacez le chemin du fichier de modèle dans la commande par le chemin accéléré. Par exemple, lors du déploiement d'un service LLM :

      vllm serve /mnt/data-fast/
  4. Après avoir configuré les paramètres, cliquez sur Deploy.

Déploiement JSON

  1. Connectez-vous à la PAI console. Sélectionnez une région en haut de la page. Ensuite, sélectionnez l'espace de travail souhaité et cliquez sur Elastic Algorithm Service (EAS).

  2. Sur la page Elastic Algorithm Service (EAS), cliquez sur Deploy Service. Dans la section Custom Model Deployment, cliquez sur JSON Deployment.

  3. Saisissez la configuration JSON. Le tableau suivant décrit les paramètres liés à l'accélération du cache de modèles. Pour plus d'informations sur les autres paramètres, consultez la rubrique déploiement JSON.

    Paramètre

    Description

    storage[0]

    oss.path

    Le chemin OSS où se trouvent les fichiers de modèles. Exemple : oss://path/to/models/.

    mount_path

    Le chemin à l'intérieur du conteneur où OSS est monté. Exemple : /mnt/data/.

    storage[1]

    cache.capacity

    La capacité maximale occupée par les fichiers accélérés, en Go. Lorsque cette limite est dépassée, le système évince les données selon une politique LRU. La valeur minimale est de 3 Go, car certains paramètres de configuration avancée par défaut nécessitent une capacité supérieure à 3 Go pour prendre effet. Assurez-vous de réserver suffisamment de mémoire ou d'espace disque.

    cache.path

    Le répertoire source des fichiers à accélérer (le chemin du conteneur où OSS ou NAS est monté). Exemple : /mnt/data/.

    cache_backend

    Le support de cache. Définissez cette valeur sur disk pour utiliser le cache disque. Si ce paramètre n'est pas spécifié, la mémoire est utilisée comme support de cache.

    cache.cacheroot_service

    Le nom du service de préchauffage du cache.

    mount_path

    Le chemin accéléré. Exemple : /mnt/data-fast/.

    containers.script

    Remplacez le chemin du fichier de modèle dans la commande d'exécution par le chemin accéléré (au lieu du chemin source, c'est-à-dire le répertoire de montage OSS/NAS), afin que l'application lise les modèles depuis le répertoire accéléré.

    Exemple JSON :

    {
        "cloud": {
            "computing": {
                "instances": [
                    {
                        "type": "ecs.gn6e-c12g1.3xlarge"
                    }
                ]
            },
            "networking": {
                "security_group_id": "your-security-group-id",
                "vpc_id": "your-vpc-id",
                "vswitch_id": "your-vswitch-id"
            }
        },
        "containers": [
            {
                "image": "eas-registry-vpc.cn-hangzhou.cr.aliyuncs.com/pai-eas/vllm:0.11.2-py312-mows0.5.1",
                "port": 8000,
                "script": "vllm serve /mnt/data-fast/"
            }
        ],
        "metadata": {
            "cpu": 12,
            "disk": "30Gi",
            "gpu": 1,
            "instance": 1,
            "memory": 92000,
            "name": "vllm_test",
            "workspace_id": "your-workspace-id"
        },
        "storage": [
            {
                "oss": {
                    "path": "oss://path/to/models/",
                    "readOnly": false
                },
                "mount_path": "/mnt/data/"
            },
            {
                "cache": {
                    "capacity": "10G",
                    "path": "/mnt/data/",
                    "cacheroot_service": "your-cacheroot-service"
                },
                "mount_path": "/mnt/data-fast/"
            }
        ]
    }
  4. Cliquez sur Deploy.

Déployer un service de préchauffage du cache

Un service de préchauffage du cache précharge les fichiers de modèles en mémoire et sert de source de données haute vitesse pour les services d'inférence dont l'accélération du cache est activée. Cette approche est idéale pour les fichiers de modèles volumineux sur OSS ou NAS, tels que ceux destinés aux LLM, à la génération d'images IA et à la génération de vidéos IA.

Important

Le chemin OSS pour l'accélération du cache dans le service d'inférence doit correspondre exactement au chemin OSS monté par le service de préchauffage du cache. Sinon, le préchauffage du cache échouera.

Par exemple, si le chemin OSS pour l'accélération du cache dans le service d'inférence est oss://path/to/models/, le service de préchauffage du cache doit également monter oss://path/to/models/.

  1. Sur l'onglet Inference Service, cliquez sur Deploy Service. Dans la section Scenario-based Model Deployment, cliquez sur Model Warm-up Cache Service Deployment.

  2. Configurez les paramètres clés suivants, puis cliquez sur Deploy.

    Paramètre

    Description

    Basic Information

    Deployment

    Sélectionnez les ressources en fonction de la taille de mémoire requise.

    Cache Configuration

    Cache Path

    Les répertoires de modèles à mettre en cache. Vous pouvez monter plusieurs chemins.

    Maximum Memory Usage

    Obligatoire. La mémoire maximale que le service de préchauffage du cache peut utiliser.

    Network Information

    VPC

    Obligatoire. Ce VPC doit être identique à celui du service d'inférence. Sinon, le service d'inférence ne pourra pas accéder au service de préchauffage du cache.

    Associate NLB

    Doit être activé. Par défaut, le système crée automatiquement un NLB.

Benchmarks de performances

Les benchmarks suivants illustrent les performances de l'accélération du cache de modèles. Les résultats réels peuvent varier.

Qwen3-32B

Modèle : Qwen3-32B (62 Go)

Machine : ml.gu8is.c64m512,4-gu60 | 64 cœurs 512 Go + 4× GU60(48G) | L20

Mode de déploiement

Temps de chargement du modèle

Vitesse de chargement du modèle

Temps de disponibilité du service

Standard (sans accélération du cache)

01:05

7,63 Gbit/s

01:43

Accélération du démarrage à froid (avec préchauffage du cache)

00:21

23,62 Gbit/s

01:01

Accélération de la mise à l'échelle horizontale (avec cache local)

00:18

27,55 Gbit/s

00:58

MiniMax-M2

Modèle : MiniMax-M2 (215 Go)

Machine : ml.gu8tf.8.40xlarge | 160 vCPU + 1800 Go + 8×GU8T | H20 (96 Go)

Mode de déploiement

Temps de chargement du modèle

Vitesse de chargement du modèle

Temps de disponibilité du service

Standard (sans accélération du cache)

06:42

4,28 Gbit/s

09:16

Accélération du démarrage à froid (avec préchauffage du cache)

01:49

15,78 Gbit/s

04:49

Accélération de la mise à l'échelle horizontale (avec cache local)

01:42

16,86 Gbit/s

04:34

DeepSeek-V3.2

Modèle : DeepSeek-V3.2 (643 Go)

Machine : ml.gu8tef.8.46xlarge | 184 vCPU + 1800 Go + 8×GU8TE | H20-3e (141 Go)

Mode de déploiement

Temps de chargement du modèle

Vitesse de chargement du modèle

Temps de disponibilité du service

Standard (sans accélération du cache)

12:33

6,83 Gbit/s

27:41

Accélération du démarrage à froid (avec préchauffage du cache)

02:43

31,56 Gbit/s

13:01

Accélération de la mise à l'échelle horizontale (avec cache local)

01:58

43,60 Gbit/s

12:49