Tous les produits
Search
Centre de documentation

Container Service for Kubernetes:Gateway with Inference Extension

Dernière mise à jour :Aug 12, 2026

Gateway with Inference Extension est un composant ACK basé sur Envoy Gateway et la spécification Kubernetes Gateway API Inference Extension. Il assure le routage de couche 4 et de couche 7 pour Kubernetes, ainsi qu'un équilibrage de charge intelligent pour les charges de travail d'inférence des grands modèles de langage (LLM).

Prérequis

Avant d'installer Gateway with Inference Extension, installez le composant Gateway API dans votre cluster. Gateway with Inference Extension nécessite les CustomResourceDefinitions (CRD) fournies par le composant Gateway API. Pour connaître les étapes d'installation, consultez Installer des composants.

Étapes suivantes

Pour obtenir des instructions d'utilisation et des exemples de configuration, consultez Présentation de Gateway with Inference Extension.

Journal des modifications

Décembre 2025

Version Date Modifications Impact
v1.4.0-apsara.4 16 décembre 2025
  • Prise en charge du CRD InferencePool v1.
  • Prise en charge du moteur d'inférence vLLM v1.
  • Amélioration de l'ordonnancement du routage intelligent en cas de forte concurrence.
La mise à niveau depuis une version antérieure redémarre le Pod de la passerelle. Effectuez cette opération pendant les heures creuses.

Septembre 2025

Version Date Modifications Impact
v1.4.0-apsara.3 4 septembre 2025
  • Prise en charge des routes d'inférence pour les services SGLang à séparation PD.
  • Prise en charge du routage tenant compte du cache de préfixes en mode précis.
  • Prise en charge du routage vers des services externes Model as a Service (MaaS).
  • Intégration avec Alibaba Cloud Content Moderation pour la révision de contenu IA.
  • Configuration des politiques de routage d'inférence via l'API InferenceTrafficPolicy.
La mise à niveau depuis une version antérieure redémarre le Pod de la passerelle. Effectuez cette opération pendant les heures creuses.

Mai 2025

Version Date Modifications Impact
v1.4.0-aliyun.1 27 mai 2025
  • Prise en charge de Gateway API 1.3.0.
  • Extension d'inférence :
    • Prise en charge des frameworks d'inférence vLLM, SGLang et TensorRT-LLM.
    • Équilibrage de charge tenant compte des préfixes.
    • Routage basé sur les noms de modèles.
    • Mise en file d'attente des requêtes et ordonnancement par priorité.
  • Observabilité des requêtes d'IA générative.
  • Limitation de débit globale.
  • Limitation de débit globale basée sur les tokens des requêtes d'IA générative.
  • Injection du contenu d'un Secret dans des en-têtes de requête spécifiés.
La mise à niveau depuis une version antérieure redémarre le Pod de la passerelle. Effectuez cette opération pendant les heures creuses.

Avril 2025

Version Date Modifications Impact
v1.3.0-aliyun.2 7 mai 2025
  • Prise en charge des clusters ACS.
  • Améliorations de l'extension d'inférence :
    • Référencement des ressources InferencePool dans HTTPRoute.
    • Routage pondéré, mise en miroir du trafic et disjoncteur au niveau InferencePool.
  • Équilibrage de charge tenant compte des préfixes.
La mise à niveau depuis une version antérieure redémarre le Pod de la passerelle. Effectuez cette opération pendant les heures creuses.

Mars 2025

Version Date Modifications Impact
v1.3.0-aliyun.1 12 mars 2025
  • Prise en charge de Gateway API v1.2.
  • Introduction d'Inference Extension pour l'équilibrage de charge intelligent dans les scénarios d'inférence LLM.
Cette mise à niveau n'a aucun impact sur vos services.