Les GPU sont des ressources de calcul rares. Leur acquisition à la demande comporte une part d'incertitude susceptible d'interrompre ou de retarder vos charges de travail critiques. Alibaba Cloud Container Service (ACS) propose deux modes de réservation pour garantir une capacité GPU déterministe à vos applications.
Réservation de capacité de Pods GPU (réservation au niveau Pod)
Fonctionnement : Ce mode correspond à une réservation de capacité standardisée et orientée charge de travail. Vous spécifiez les caractéristiques des Pods (par exemple 2×A10 GPU, 16 vCPU, 32 GiB de mémoire) ainsi que le nombre de Pods à réserver (par exemple 12). La plateforme réserve alors la capacité de calcul nécessaire pour héberger exactement ces 12 Pods selon la configuration définie.
Déterminisme garanti : Ce mode assure un « déterminisme de la capacité de charge de travail ». Lors de chaque demande de création, le système garantit la disponibilité des ressources pour vos 12 Pods spécifiés. Cette approche simplifie la planification capacitaire en vous dispensant de gérer les spécifications des nœuds sous-jacents ou la fragmentation des ressources ; seuls les besoins de vos Pods applicatifs importent.
-
Cas d'usage :
Charges de travail homogènes : Solution idéale lorsque votre application (comme l'entraînement distribué à grande échelle ou l'inférence en ligne) repose sur de nombreux Pods aux spécifications identiques.
Simplification opérationnelle : Adapté si vous souhaitez déléguer la planification des ressources sous-jacentes à la plateforme afin de vous concentrer uniquement sur les besoins capacitaires au niveau applicatif.
Réservation de capacité GPU-HPN (réservation au niveau nœud)
Fonctionnement : Ce mode réserve et verrouille la capacité dédiée de nœuds de calcul GPU dans le pool de ressources ACS sous-jacent. Ces ressources étant allouées exclusivement à votre compte, du matériel actif reste disponible en permanence pour héberger de nouveaux Pods GPU. Vous évitez ainsi les échecs de planification de Pods (statut Pending) liés aux contraintes du pool de ressources.
Déterminisme garanti : Ce mode offre un « déterminisme des ressources physiques ». En cas de mise à l'échelle horizontale, la disponibilité de l'infrastructure sous-jacente (nœuds GPU) est assurée. Il vous appartient ensuite de décider comment planifier et combiner des Pods de différentes spécifications sur ces nœuds (stratégie dite de « bin packing »).
-
Cas d'usage :
Charges de travail hétérogènes : Offre une flexibilité maximale pour exécuter des Pods GPU aux spécifications variées au sein d'un même pool de ressources.
Contrôle granulaire des ressources : Recommandé lorsque vous devez appliquer des politiques de planification personnalisées (telles que Taints/Tolerations, Node Affinity) pour maîtriser précisément le placement des Pods, dans un objectif d'optimisation des performances ou d'isolation des ressources.
Synthèse et comparaison
|
Attribut |
Réservation de capacité de Pods GPU (niveau Pod) |
Réservation de capacité GPU-HPN (niveau nœud) |
|
Objet de la réservation |
Nombre de Pods avec des spécifications précises. |
Capacité des nœuds de calcul GPU sous-jacents. |
|
Granularité de réservation |
Charge de travail logique (par exemple 12 Pods de type 1A10GPU8C16G). |
Ressources physiques des nœuds (par exemple 2 nœuds P16EN). |
|
Niveau de garantie |
Déterminisme de la capacité de charge de travail. |
Déterminisme des ressources physiques des nœuds. |
|
Flexibilité |
Plus faible (liée à des spécifications de Pods spécifiques). |
Très élevée (prise en charge de Pods aux spécifications flexibles). |
|
Complexité de gestion |
Faible (la plateforme gère l'allocation des ressources). |
Plus élevée (nécessite la gestion des événements liés aux nœuds). |
|
Recommandation de choix |
|
Applications de moyenne à grande échelle aux spécifications complexes et variables. |
Choisissez le mode de réservation correspondant au profil de votre charge de travail et à vos exigences de déterminisme afin d'atténuer les risques liés à l'acquisition de ressources GPU et d'assurer le fonctionnement fiable de vos applications d'IA.