Avant d'utiliser la planification GPU tenant compte de la topologie, installez et configurez les composants requis. Cette rubrique explique comment installer ces composants et activer cette fonctionnalité dans votre cluster.
Prérequis
Vous disposez d'un cluster ACK managé. Le cluster doit utiliser un type d'instance GPU.
Vous avez obtenu le fichier KubeConfig du cluster et établi une connexion au cluster à l'aide de kubectl.
-
Les composants de votre cluster satisfont aux exigences de version suivantes.
Composant
Exigences de version
Kubernetes
1.18.8 ou ultérieure
Pilote NVIDIA
418.87.01 ou ultérieure
Version NCCL
2.7 ou ultérieure
Système d'exploitation
-
CentOS 7.6
-
CentOS 7.7
-
Ubuntu 16.04
-
Ubuntu 18.04
-
Alibaba Cloud Linux 2
-
Alibaba Cloud Linux 3
GPU
V100
-
Procédure
Connectez-vous à la console ACK. Dans le volet de navigation de gauche, cliquez sur Clusters.
Sur la page Clusters, cliquez sur le nom de votre cluster. Dans le volet de navigation de gauche, cliquez sur .
Sur la page Cloud-native AI Suite, cliquez sur Deploy.
-
Sur la page de déploiement de Cloud-native AI Suite, dans la section Scheduling, sélectionnez Scheduling Policy Extension (Batch Task Scheduling, GPU Sharing, Topology-aware GPU Scheduling), puis cliquez sur Deploy Cloud-native AI Suite ci-dessous. Pour plus d'informations sur les éléments de configuration du déploiement de Cloud-native AI Suite, consultez la rubrique Installation de Cloud-native AI Suite.
Une fois le déploiement terminé, le composant de planification GPU tenant compte de la topologie installé, ack-ai-installer, apparaît dans la section Components.
RemarqueSi vous avez déjà déployé Cloud-native AI Suite, cliquez directement sur Deploy dans la colonne Actions à droite du composant de planification ack-ai-installer dans la liste des composants pour l'installer.