Tous les produits
Search
Centre de documentation

Container Service for Kubernetes:Heterogeneous computing overview

Dernière mise à jour :Aug 11, 2026

Alibaba Cloud Container Service for Kubernetes (ACK) gère et planifie les ressources hétérogènes telles que les GPU, les ASIC et l'eRDMA afin d'améliorer l'utilisation du cluster.

Ressources hétérogènes prises en charge

ACK assure la planification et la gestion unifiées des ressources hétérogènes, notamment les GPU, les circuits intégrés spécifiques à une application (ASIC) et l'accès direct à la mémoire élastique (eRDMA).

Ressource hétérogène

Description

GPU

Créez des clusters avec des cartes GPU courantes, telles que T4, P100 et V100.

  • Prise en charge des demandes de ressources pour chaque GPU individuel.

  • Prise en charge de la mise à l'échelle automatique basée sur les métriques GPU.

  • Prise en charge du partage de GPU et de l'isolation des capacités de calcul. Le partage de GPU Alibaba Cloud permet d'exécuter plusieurs charges de travail d'inférence sur un seul GPU, réduisant ainsi les coûts. cGPU isole la mémoire GPU et la puissance de calcul sans modifier les conteneurs, améliorant la stabilité des applications. Stratégies d'allocation prises en charge :

    • Partage mono-pod-mono-GPU : couramment utilisé pour l'inférence de modèles.

    • Partage mono-pod-multi-GPU : couramment utilisé pour le développement d'entraînement distribué.

    • Binpack : planifie préférentiellement plusieurs pods sur la même carte GPU pour améliorer l'utilisation.

    • Spread : répartit les pods sur différentes cartes GPU dans la mesure du possible pour assurer une haute disponibilité (HA).

  • Prise en charge de la planification GPU consciente de la topologie. Le planificateur récupère la topologie des ressources depuis les nœuds pour optimiser le placement pour NVLink, PCIe Switch, QPI et les cartes réseau RDMA.

  • Prise en charge de la surveillance des ressources GPU aux niveaux des nœuds et des applications, avec détection automatique des exceptions et alertes pour les GPU dédiés et partagés.

ASIC

ACK prend en charge les clusters équipés de périphériques ASIC NETINT et les demandes de ressources pour chaque carte ASIC individuelle.

eRDMA

Créez des clusters avec des périphériques eRDMA.

  • Soumettez des tâches d'entraînement en apprentissage profond distribué avec des périphériques eRDMA via Arena.

  • Prend en charge les tâches nécessitant une bande passante élevée, telles que l'entraînement en apprentissage profond distribué.

Types d'instances GPU pris en charge par ACK

Sélectionnez l'une des familles d'instances ECS ci-dessous pour ajouter des nœuds GPU à un cluster ACK.

Les instances de calcul confidentiel ne sont pas prises en charge. Ces types d'instance contiennent le champ -tee , par exemple ecs.gn8v-tee.4xlarge .
Remarque

Vous ne pouvez pas sélectionner d'instances accélérées par vGPU en tant que nœuds de cluster dans la console ACK. Consultez la rubrique ACK prend-il en charge les instances accélérées par vGPU ?.

Types d'instances ASIC pris en charge par ACK

Pour ajouter des nœuds ASIC à un cluster ACK, sélectionnez le type d'instance ecs.video-trans.26xhevc.

Types d'instances eRDMA pris en charge par ACK

Sélectionnez l'une des familles d'instances ECS ci-dessous pour ajouter des nœuds eRDMA. Consultez les rubriques Activer eRDMA sur une instance de niveau entreprise et Activer eRDMA sur une instance accélérée par GPU.