Tous les produits
Search
Centre de documentation

Container Service for Kubernetes:Job distribution overview

Dernière mise à jour :Aug 11, 2026

Les instances Fleet de Distributed Cloud Container Platform for Kubernetes (ACK One) proposent la fonctionnalité de distribution des jobs pour les scénarios multi-clusters et cloud hybride, permettant une planification et une distribution centralisées des charges de travail IA. Lorsqu'un seul cluster Container Service for Kubernetes (ACK) ne peut pas répondre aux besoins en ressources pour des tâches d'entraînement ou d'inférence IA à grande échelle, ou lorsque des ressources inutilisées sont disponibles sur plusieurs clusters ACK, cette fonctionnalité vous permet de distribuer les jobs sur ces clusters afin d'optimiser l'utilisation des ressources.

Fonctionnalités

La distribution des jobs multi-clusters ACK One offre les capacités suivantes :

  • Prise en charge de plusieurs types de jobs : Compatible avec les frameworks PyTorchJob, SparkApplication et TFJob.

  • Planification groupée (gang scheduling) multi-clusters : Distribuez les jobs entre les clusters grâce à la pré-allocation des ressources ou aux vérifications dynamiques des ressources, garantissant le déploiement réussi des tâches dans les sous-clusters et améliorant l'efficacité globale de la planification.

  • Gestion des quotas multi-locataires : Appliquez des limites de ressources par locataire en utilisant des quotas d'espace de noms basés sur ElasticQuotaTree dans les environnements multi-locataires.

  • Planification basée sur les priorités : Priorisez les tâches importantes pour l'allocation des ressources en fonction de PriorityClass défini dans PodTemplate pour les jobs IA.

  • Configuration de plusieurs politiques de mise en file d'attente des tâches : Permettez des politiques de file d'attente flexibles pour prendre en charge l'optimisation de l'utilisation du cluster et les modes de garantie de priorité des tâches, en prenant en charge les modèles de planification bloquants et non bloquants.

  • Replanification des jobs en cas d'échec : Le planificateur global (Global Scheduler) récupère automatiquement les jobs ayant échoué et les replanifie vers des clusters éligibles disposant de ressources suffisantes.

Fonctionnement

image
  1. Soumission du job : Soumettez des jobs de type PyTorchJob, SparkApplications ou TFJob avec la politique de distribution PropagationPolicy à l'instance Fleet.

  2. Validation des priorités et des quotas : L'instance Fleet effectue une planification de capacité basée sur les priorités des jobs et les quotas des locataires.

  3. Planification globale : Le planificateur global (Global Scheduler) dans l'instance Fleet applique la planification dynamique des ressources multi-clusters et la planification groupée (gang scheduling) pour les jobs sortis de la file d'attente, en réservant des ressources ou en vérifiant dynamiquement les clusters éligibles. En cas d'échec de la planification, le job est remis en file d'attente.

  4. Distribution des jobs : Les jobs planifiés avec succès sont propagés vers les clusters ACK désignés.

  5. Nouvelle tentative en cas d'échec : Si un job échoue dans un sous-cluster, le planificateur global (Global Scheduler) le récupère et le replanifie vers d'autres clusters éligibles.