Tous les produits
Search
Centre de documentation

Container Service for Kubernetes:AI workload scheduling

Dernière mise à jour :Aug 11, 2026

Présentation de la planification élastique des ressources, de la planification des tâches IA, de la planification des ressources hétérogènes et de la planification par file d'attente afin d'améliorer l'utilisation des ressources du cluster et l'efficacité des jobs.

Planification élastique

Combinez des instances ECS, ECI et préemptibles au sein d'une même application. Des politiques basées sur les priorités déterminent le type de ressource à mettre à l'échelle vers le haut ou à libérer en premier.

Fonctionnalité Scénario Références
Planification élastique Réduisez les coûts en privilégiant les ressources moins onéreuses lors de la mise à l'échelle vers le haut (par exemple, ECS avant ECI) et en les libérant en priorité lors de la mise à l'échelle vers le bas. Prend en charge les instances avec abonnement, paiement à l'utilisation et préemptibles. Utiliser la planification basée sur Elastic Container Instance et Configurer la planification des ressources basée sur les priorités

Planification des tâches

La planification Gang, Capacity Scheduling et Kube Queue gèrent les charges de travail par lots et les charges de travail IA.

Fonctionnalité Scénario Références
Planification Gang Entraînement distribué ou jobs par lots nécessitant un démarrage simultané des tâches. Sans planification Gang, les démarrages partiels bloquent les ressources et provoquent des interblocages. La planification Gang démarre tous les processus corrélés ensemble pour éviter tout blocage. Utiliser la planification Gang
Capacity Scheduling Clusters multi-équipes où les équipes utilisent les ressources à différents moments. Les quotas de ressources Kubernetes standard allouent des montants fixes par namespace, laissant les ressources inactives lorsque les quotas ne sont pas utilisés. Capacity Scheduling permet aux équipes de partager les ressources inactives au-delà des limites des quotas. Utiliser Capacity Scheduling
Kube Queue (ack-kube-queue) Grands clusters avec des charges de travail IA et par lots provenant de plusieurs utilisateurs. La planification au niveau des pods se dégrade lorsque le nombre de jobs est élevé, et les jobs de différents utilisateurs s'interfèrent. ack-kube-queue gère les files d'attente avec des politiques personnalisables et des quotas intégrés pour maximiser l'utilisation. Utiliser ack-kube-queue pour gérer les files d'attente de jobs

Planification des ressources hétérogènes

Planifiez les GPU avec le partage cGPU et le placement conscient de la topologie pour les CPU et les GPU. Pour connaître les labels de nœud utilisés dans la planification des GPU, consultez Labels utilisés par ACK pour contrôler les GPU.

Partage de GPU avec cGPU

cGPU permet à plusieurs pods de partager un GPU avec isolation de la mémoire, réduisant ainsi les coûts liés aux GPU et améliorant la stabilité des charges de travail. Les clusters ACK Pro prennent en charge les politiques suivantes :

Politique À utiliser lorsque Description
Partage d'un GPU par pod et isolation de la mémoire Inférence de modèle Un pod par GPU avec isolation de la mémoire entre les pods partageant le même GPU.
Partage multi-GPU par pod et isolation de la mémoire Entraînement de modèle distribué Un pod s'étend sur plusieurs GPU avec isolation de la mémoire pour l'entraînement de modèle distribué.
Allocation binpack ou spread Améliorer l'utilisation des GPU et la haute disponibilité Alloue les GPU à l'aide d'algorithmes binpack ou spread pour améliorer l'utilisation et garantir la haute disponibilité.

Consultez cGPU Professional Edition pour obtenir les instructions de configuration.

Planification CPU et GPU consciente de la topologie

Le planificateur place les charges de travail sensibles aux performances en fonction de la topologie matérielle des nœuds : chemins GPU-vers-GPU (NVLink, commutateurs PCIe) et topologie NUMA du CPU.

Fonctionnalité Références
Planification CPU consciente de la topologie Planification CPU consciente de la topologie
Planification GPU consciente de la topologie Présentation

Planification FPGA

Utilisez des labels pour planifier les charges de travail FPGA vers des nœuds accélérés et gérez les ressources FPGA à l'échelle du cluster.

Fonctionnalité Références
Planification FPGA Utiliser des labels pour planifier les pods vers des nœuds accélérés par FPGA

Planification par file d'attente des tâches

Personnalisez la planification par file d'attente pour les charges de travail IA et par lots.