Les clusters ACK Pro prennent en charge le partage de GPU. Configurez le paramètre de politique cGPU pour choisir parmi six stratégies d'allocation des ressources de calcul. Cette rubrique explique comment définir la politique de planification du GPU partagé.
Prérequis
Un cluster ACK Pro est créé et exécute Kubernetes 1.18.8 ou une version ultérieure. Mettre à niveau manuellement un cluster si nécessaire.
La version 1.0.6 ou ultérieure de cGPU est installée. Mettre à niveau la version cGPU d'un nœud si nécessaire.
Remarques importantes
-
Si le module d'isolation cGPU est déjà installé sur un nœud, vous devez redémarrer le nœud après l'installation du composant cGPU pour appliquer la politique. Consultez la rubrique Redémarrer une instance.
RemarqueConnectez-vous au nœud et exécutez la commande
cat /proc/cgpu_km/version. Si un numéro de version s'affiche, le module d'isolation cGPU est installé. Si le module d'isolation cGPU n'est pas installé ou a été désinstallé, la politique prend effet immédiatement après l'installation du composant cGPU.
Tous les nœuds de partage de GPU au sein d'un cluster doivent utiliser la même politique.
Vérifier si cGPU est installé
La procédure de configuration dépend de la présence ou non de cGPU.
Connectez-vous à la console ACK. Dans le volet de navigation de gauche, cliquez sur Clusters.
Sur la page Clusters, cliquez sur le nom de votre cluster. Dans le volet de navigation de gauche, cliquez sur .
-
Sur la page Helm, vérifiez si ack-ai-installer figure dans la liste.
Si ack-ai-installer figure dans la liste, cGPU est installé.
Configurer la politique de planification
cGPU non installé
Connectez-vous à la console ACK. Dans le volet de navigation de gauche, cliquez sur Clusters.
Sur la page Clusters, cliquez sur le nom de votre cluster. Dans le volet de navigation de gauche, cliquez sur .
Sur la page Cloud-native AI Suite, cliquez sur Deploy.
Dans la section Scheduling, sélectionnez Scheduling Policy Extension (Batch Task Scheduling, GPU Sharing, Topology-aware GPU Scheduling), puis cliquez sur Advanced.
-
Sur la page Parameters, modifiez le champ
policy, puis cliquez sur OK.cgpu: enabled: true image: acs/cgpu-installer tag: v1.5.3-8d3fc1b-aliyun financeCloudImageTag: v1.0.7-fin imagePullPolicy: IfNotPresent policy: 1 nodeSelector: {} checkRegions: trueLes valeurs valides sont listées ci-dessous. Consultez la rubrique Exemples d'utilisation de cGPU.
Valeur
Description
0
Planification équitable (fair-share). Chaque conteneur reçoit un quota de temps fixe proportionnel à
1/max_inst.1
Planification préemptive. Chaque conteneur utilise autant de quotas de temps que possible. Quota par conteneur :
1/Number of current containers.2
Planification préemptive basée sur les poids. Activée automatiquement lorsque ALIYUN_COM_GPU_SCHD_WEIGHT dépasse 1.
3
Planification par pourcentage fixe. Attribue un pourcentage fixe de puissance de calcul.
4
Planification souple (soft scheduling). Offre une isolation moins stricte que la planification préemptive.
5
Planification intégrée. Utilise la méthode de planification native du pilote GPU.
Cliquez sur Deploy Cloud-native AI Suite.
cGPU déjà installé
-
Modifiez le DaemonSet qui installe le module d'isolation cGPU.
kubectl edit daemonset cgpu-installer -nkube-system -
Modifiez et enregistrez le DaemonSet.
-
Vérifiez la version de l'
imagedu DaemonSet.La version de l'image doit être la v1.0.6 ou une version ultérieure. Exemple :
image: registry-vpc.cn-hongkong.aliyuncs.com/acs/cgpu-installer:<image_version> -
Modifiez la
value.Dans
containers.env, définissez lavaluedePOLICYsur le numéro de politique souhaité.# Other fields are omitted for brevity. spec: containers: - env: - name: POLICY value: "1" # Other fields are omitted for brevity.Valeurs
valuevalides :Valeur
Description
0
Planification équitable (fair-share). Chaque conteneur reçoit un quota de temps fixe proportionnel à
1/max_inst.1
Planification préemptive. Chaque conteneur utilise autant de quotas de temps que possible. Quota par conteneur :
1/Number of current containers.2
Planification préemptive basée sur les poids. Activée automatiquement lorsque ALIYUN_COM_GPU_SCHD_WEIGHT dépasse 1.
3
Planification par pourcentage fixe. Attribue un pourcentage fixe de puissance de calcul.
4
Planification souple (soft scheduling). Offre une isolation moins stricte que la planification préemptive.
5
Planification intégrée. Utilise la méthode de planification native du pilote GPU.
-
Redémarrez les nœuds de partage de GPU. Consultez la rubrique Redémarrer une instance.