Les GPU NVIDIA sont souvent utilisés pour accélérer les applications gourmandes en calcul, telles que le calcul scientifique et le rendu graphique. Container Service for Kubernetes vous permet de planifier et de gérer de manière centralisée divers types de ressources GPU, améliorant ainsi l'utilisation du cluster GPU. Cette rubrique explique comment ajouter des nœuds GPU à un cluster.
Prérequis
Vous devez disposer d'un cluster ACK Pro ou d'un cluster ACK dédié (plus disponible à la création).
Créer un pool de nœuds GPU
Connectez-vous à la console ACK. Dans le volet de navigation de gauche, cliquez sur Clusters.
Sur la page Clusters, cliquez sur le nom de votre cluster. Dans le volet de navigation de gauche, cliquez sur .
-
Cliquez sur Create Node Pool. Définissez le paramètre Instance Type sur Elastic GPU Service et le paramètre Expected Nodes sur le nombre de nœuds souhaité. Pour plus d'informations sur les autres paramètres, consultez la rubrique Créer et gérer un pool de nœuds.
Pour obtenir la liste des types d'instances ECS compatibles avec les GPU, consultez la rubrique Types d'instances GPU pris en charge par ACK.
RemarqueSi aucun type d'instance disponible n'apparaît dans la liste, essayez de sélectionner un autre vSwitch.
Si le système d'exploitation de vos nœuds est Ubuntu 22.04 ou Red Hat Enterprise Linux (RHEL) 9,3 64 bits, le composant NVIDIA Device Plugin définit par défaut la variable d'environnement
NVIDIA_VISIBLE_DEVICES=allpour les pods. Après avoir exécuté la commandesystemctl daemon-reloadousystemctl daemon-reexecsur le nœud, celui-ci risque de perdre l'accès à ses GPU, ce qui entraînera l'arrêt du fonctionnement du NVIDIA Device Plugin. Pour plus d'informations, consultez la rubrique Que faire si l'erreur « Failed to initialize NVML: Unknown Error » se produit lors de l'exécution d'un conteneur GPU ?.
Afficher les GPU attachés
Une fois le pool de nœuds créé, vous pouvez afficher les GPU attachés aux nœuds.
Connectez-vous à la console ACK. Dans le volet de navigation de gauche, cliquez sur Clusters.
Sur la page Clusters, cliquez sur le nom de votre cluster. Dans le volet de navigation de gauche, cliquez sur .
Pour le nœud cible, cliquez sur Details dans la colonne Actions pour afficher les GPU qui lui sont attachés. Pour identifier le modèle de GPU spécifique, cliquez sur l'ID de l'instance ECS du nœud afin d'accéder à la page des détails de l'instance dans la console ECS. Sous l'onglet Instance Details, consultez le champ GPU dans la section Configuration Information. Par exemple, le champ peut afficher
GPU: NVIDIA T4pour un type d'instanceecs.gn6i-c4g1.xlarge.