Tous les produits
Search
Centre de documentation

Alibaba Cloud Service Mesh:Gestion du trafic LLM

Dernière mise à jour :Aug 11, 2026

La plupart des principaux fournisseurs de grands modèles de langage (LLM) proposent leurs services via HTTP. Service Mesh (ASM) optimise la gestion des requêtes LLM sur HTTP et prend nativement en charge les protocoles des principaux fournisseurs. Utilisez ASM pour acheminer le trafic LLM entre différents fournisseurs et surveiller les métriques au niveau des requêtes, telles que l'utilisation des jetons.

Présentation des fonctionnalités

Routage du trafic

Pour enregistrer un service HTTP externe dans un cluster de maillage de services, configurez une entrée de service (ServiceEntry), puis définissez des règles de routage à l'aide d'un objet VirtualService. Vous pourrez ensuite appeler ce service via une passerelle ou un pod d'application. Sans cet enregistrement, les fonctionnalités de gestion du trafic et d'observabilité du maillage de services ne sont pas disponibles.

image

Toutefois, un objet ServiceEntry natif gère uniquement le trafic TCP et HTTP standard. Les requêtes LLM incluent des paramètres avancés qui étendent le protocole HTTP, ce qu'une entrée de service classique ne peut pas prendre en charge. Pour résoudre ce problème, ASM introduit deux nouvelles ressources :

  • LLMProvider : Comparable à une entrée de service (ServiceEntry) pour HTTP. Utilisez un objet LLMProvider pour enregistrer un fournisseur de service LLM externe auprès du cluster et configurer son hôte, sa clé API ainsi que ses paramètres de modèle.

  • LLMRoute : Comparable à un objet VirtualService pour HTTP. Utilisez un objet LLMRoute pour définir des règles de trafic qui distribuent les requêtes vers des objets LLMProvider spécifiques en fonction de pondérations ou de conditions de correspondance.

Sur la base des configurations LLMRoute et LLMProvider, ASM sélectionne dynamiquement une destination de routage, applique les paramètres de requête préconfigurés et transmet la requête au fournisseur cible. Cette approche vous permet de modifier les configurations des fournisseurs, de sélectionner des modèles selon les caractéristiques des requêtes et d'effectuer des déploiements canaris entre fournisseurs, réduisant ainsi considérablement la complexité de l'intégration des LLM dans le cluster. Les deux scénarios suivants illustrent la gestion du trafic LLM avec les objets LLMRoute et LLMProvider.

Configurer un objet LLMRoute pour utiliser différents modèles selon le type d'utilisateur

Alibaba Cloud Model Studio propose deux modèles : qwen-1,8b-chat et qwen-turbo. Configurez un objet LLMRoute pour diriger les utilisateurs standards vers le modèle par défaut qwen-1,8b-chat et les utilisateurs abonnés vers le modèle plus puissant qwen-turbo. Les requêtes des utilisateurs abonnés contiennent un en-tête spécial identifiant leur statut.

image

Configurer un objet LLMProvider et un objet LLMRoute pour distribuer le trafic par pondération

Ce scénario combine les services de modèle linguistique d'Alibaba Cloud Model Studio et de Moonshot. Configurez un objet LLMRoute et un objet LLMProvider afin de répartir le trafic entre les fournisseurs selon une pondération définie.

image
Remarque

demo-llm-server est un service standard au sein du cluster et ne correspond à aucun endpoint.

Observabilité du trafic

Au-delà du routage des requêtes LLM, ASM offre une observabilité améliorée pour les scénarios impliquant des LLM. Des données d'observabilité précises et claires permettent aux équipes d'exploitation et de maintenance ainsi qu'aux développeurs de surveiller l'état de santé des services et de réagir rapidement aux incidents.

L'observabilité du maillage de services repose sur trois composants principaux :

  • Journaux d'accès

  • Métriques de surveillance

  • Tracing Analysis

Les requêtes LLM utilisant le protocole HTTP, elles sont directement compatibles avec la fonctionnalité Tracing Analysis existante. En revanche, les fonctionnalités natives de journaux d'accès et de métriques de surveillance ne fournissent pas les détails spécifiques aux LLM. Par exemple, les journaux d'accès n'incluent pas le modèle utilisé dans une requête et les métriques de surveillance ne reflètent que les informations HTTP standard. ASM améliore ces fonctionnalités de deux manières :

  • Journaux d'accès : Utilisez la fonctionnalité de format de journal d'accès personnalisé pour inclure des informations spécifiques aux LLM dans les journaux d'accès.

  • Métriques de surveillance :

    • ASM ajoute deux métriques de surveillance indiquant le nombre de jetons d'entrée (jetons d'invite) et de jetons de sortie (jetons de complétion) par requête.

    • Les informations spécifiques aux LLM sont ajoutées en tant que dimension de métrique, que vous pouvez référencer dans les métriques Istio standard.

Présentation des scénarios

L'intégration des LLM avec ASM permet de bénéficier des déploiements canaris, du routage pondéré et des fonctionnalités d'observabilité. Cela découple les applications des fournisseurs de LLM et améliore la robustesse ainsi que la maintenabilité de la chaîne d'appels. Les scénarios suivants couvrent la configuration du routage et de l'observabilité du trafic LLM.