Tous les produits
Search
Centre de documentation

Container Service for Kubernetes:Specify a custom GPU driver version for a node

Dernière mise à jour :Aug 11, 2026

ACK installe une version par défaut du pilote NVIDIA pour chaque type de cluster. Si cette version est incompatible avec votre bibliothèque CUDA, définissez un libellé sur le pool de nœuds pour épingler une version spécifique du pilote sur les nouveaux nœuds GPU.

Prérequis

Assurez-vous d'avoir :

Limites

Compatibilité du pilote

ACK ne garantit pas la compatibilité entre les versions du pilote et celles de la bibliothèque CUDA. Pour connaître les exigences détaillées en matière de version du pilote pour chaque type de carte GPU NVIDIA, consultez la documentation officielle de NVIDIA.

S'applique uniquement aux nouveaux nœuds

Le libellé déclenche l'installation du pilote lorsqu'un nœud rejoint le cluster, lors de sa création ou d'une mise à l'échelle horizontale. Les nœuds existants ne sont pas concernés. Pour mettre à jour un nœud existant, supprimez le nœud puis ajoutez-le à nouveau.

Images de système d'exploitation personnalisées

Pour les images de système d'exploitation personnalisées contenant des composants GPU tels que le pilote et NVIDIA Container Runtime, ACK ne peut pas garantir la compatibilité entre le pilote personnalisé et les autres composants GPU d'ACK, comme les composants de surveillance.

Retour à la version par défaut pour les versions de pilotes non prises en charge

Si la version spécifiée ne figure pas dans la liste des versions prises en charge par ACK, ce dernier installe la version par défaut. Une version incompatible avec la dernière version du système d'exploitation peut également entraîner l'échec de l'ajout du nœud. Utilisez toujours la dernière version prise en charge.

Compatibilité des types d'instance

Type d'instance

Versions de pilotes compatibles

gn7, ebmgn7

Antérieure à 510.xxx (par exemple, 470.xxx.xxxx avec GSP désactivé), ou 525.125.06 et ultérieure. Les versions 510.xxx et 515.xxx ne sont pas compatibles.

ebmgn7, ebmgn7e

460.32.03 et ultérieure

Étape 1 : Sélectionner une version du pilote

Ouvrez la page des versions de pilotes NVIDIA prises en charge par ACK et choisissez une version compatible avec votre bibliothèque CUDA. Ces étapes utilisent la version 550.144.03 à titre d'exemple.

Étape 2 : Créer un pool de nœuds avec le libellé de version du pilote

  1. Connectez-vous à la console Container Service. Dans le volet de navigation de gauche, cliquez sur Clusters.

  2. Cliquez sur le nom de votre cluster. Dans le volet de navigation de gauche, choisissez Nodes > Node Pools.

  3. Dans le coin supérieur gauche, cliquez sur Create Node Pool. Consultez la rubrique Créer et gérer un pool de nœuds.

  4. Dans la section Node Labels, cliquez sur l'icône 1 pour ajouter un libellé :

    • Key : ack.aliyun.com/nvidia-driver-version

    • Value : 550.144.03

  5. Terminez la configuration restante et envoyez le pool de nœuds.

Étape 3 : Vérifier l'installation du pilote

Une fois qu'un nœud a rejoint le pool, confirmez qu'il dispose de la version du pilote attendue.

  1. Listez les pods avec le libellé component: nvidia-device-plugin pour trouver celui qui se trouve sur votre nouveau nœud :

    kubectl get po -n kube-system -l component=nvidia-device-plugin -o wide

    Résultat attendu :

    NAME                             READY   STATUS    RESTARTS   AGE     IP              NODE                       NOMINATED NODE   READINESS GATES
    ack-nvidia-device-plugin-fnctc   1/1     Running   0          2m33s   10.117.227.43   cn-qingdao.10.117.XXX.XX   <none>           <none>

    Notez le nom du pod pour votre nouveau nœud (par exemple, ack-nvidia-device-plugin-fnctc).

  2. Exécutez nvidia-smi dans le pod pour vérifier la version du pilote :

    kubectl exec -ti ack-nvidia-device-plugin-fnctc -n kube-system -- nvidia-smi

    Résultat attendu :

    Mon Mar 24 08:51:55 2025
    +-----------------------------------------------------------------------------------------+
    | NVIDIA-SMI 550.144.03             Driver Version: 550.144.03     CUDA Version: 12.6     |
    |-----------------------------------------+------------------------+----------------------+
    | GPU  Name                 Persistence-M | Bus-Id          Disp.A | Volatile Uncorr. ECC |
    | Fan  Temp   Perf          Pwr:Usage/Cap |           Memory-Usage | GPU-Util  Compute M. |
    |                                         |                        |               MIG M. |
    |=========================================+========================+======================|
    |   0  Tesla P4                       On  |   00000000:00:07.0 Off |                    0 |
    | N/A   33C    P8              7W /   75W |       0MiB /   7680MiB |      0%      Default |
    |                                         |                        |                  N/A |
    +-----------------------------------------+------------------------+----------------------+
    
    +-----------------------------------------------------------------------------------------+
    | Processes:                                                                              |
    |  GPU   GI   CI        PID   Type   Process name                              GPU Memory |
    |        ID   ID                                                               Usage      |
    |=========================================================================================|
    |  No running processes found                                                             |
    +-----------------------------------------------------------------------------------------+

    La mention Driver Version: 550.144.03 confirme que le pilote personnalisé est installé.

Définir la version du pilote avec l'API

Lors de la création d'un pool de nœuds avec l'API CreateClusterNodePool, incluez le libellé de version du pilote dans le champ tags :

{
  "tags": [
    {
      "key": "ack.aliyun.com/nvidia-driver-version",
      "value": "550.144.03"
    }
  ]
}