Container Service for Kubernetes (ACK) は、クラスタータイプごとにデフォルトの NVIDIA ドライバーバージョンをインストールします。そのバージョンがお使いの CUDA ライブラリと互換性がない場合は、ノードプールのラベルを設定して、新規 GPU ノードに特定のドライバーバージョンを固定します。
前提条件
以下を確認してください。
-
GPU 対応のインスタンスタイプを持つ ACK クラスター
-
必要なドライバーバージョン (ACK がサポートする NVIDIA ドライバーバージョンから選択)
制限事項
ドライバーの互換性
ACK は、ドライバーバージョンと CUDA ライブラリバージョン間の互換性を保証しません。各 NVIDIA GPU カードタイプの詳細なドライバーバージョン要件については、「NVIDIA ドライバーのダウンロードページ」をご参照ください。
新規ノードへの適用
このラベルは、ノードが参加するとき (作成時またはスケールアウト時) にドライバーのインストールをトリガーします。既存のノードは影響を受けません。既存のノードを更新するには、ノードを削除して再度追加する必要があります。
カスタム OS イメージ
ドライバーや NVIDIA Container Runtime などの GPU コンポーネントを含むカスタム OS イメージの場合、ACK はカスタムドライバーとモニタリングコンポーネントなどの他の ACK GPU コンポーネントとの互換性を保証できません。
サポートされていないドライバーバージョンのフォールバック
指定されたバージョンが ACK のサポートリストにない場合、ACK は代わりにデフォルトのバージョンをインストールします。最新の OS と互換性のないバージョンもノード追加の失敗の原因となる可能性があるため、常に最新のサポートされているバージョンを使用してください。
インスタンスタイプの互換性
| インスタンスタイプ | 互換性のあるドライバーバージョン |
|---|---|
| gn7、ebmgn7 | 510.xxx より前のバージョン (例:GSP が無効な 470.xxx.xxxx)、または 525.125.06 以降。バージョン 510.xxx および 515.xxx には互換性がありません。 |
| ebmgn7ebmgn7e | 460.32.03 以降 |
手順 1: ドライバーバージョンの選択
ACK でサポートされている NVIDIA ドライバーバージョンを開き、お使いの CUDA ライブラリに一致するバージョンを選択します。この手順では、550.144.03 を例として使用します。
手順 2: ドライバーバージョンのラベルが付いたノードプールの作成
-
コンテナサービス管理コンソールにログインします。 左側のナビゲーションペインで、コンテナサービス管理コンソール[クラスター] をクリックします。
-
クラスター名をクリックします。左側のナビゲーションペインで、[ノード] > [ノードプール] を選択します。
-
左上隅で、[ノードプールの作成] をクリックします。「ノードプールの作成と管理」をご参照ください。
-
[ノードラベル] セクションで、
アイコンをクリックしてラベルを追加します:-
キー:
ack.aliyun.com/nvidia-driver-version -
値:
550.144.03
-
-
残りの設定を完了し、ノードプールを送信します。
手順 3: ドライバーインストールの確認
ノードがプールに参加したら、指定したドライバーバージョンがインストールされていることを確認します。
-
新しいノード上のポッドを見つけるには、
component: nvidia-device-pluginラベルでポッドを一覧表示します:kubectl get po -n kube-system -l component=nvidia-device-plugin -o wide期待される出力:
NAME READY STATUS RESTARTS AGE IP NODE NOMINATED NODE READINESS GATES ack-nvidia-device-plugin-fnctc 1/1 Running 0 2m33s 10.117.227.43 cn-qingdao.10.117.XXX.XX <none> <none>新しいノードのポッド名 (例:
ack-nvidia-device-plugin-fnctc) をメモしてください。 -
ポッドで
nvidia-smiを実行して、ドライバーのバージョンを確認します:kubectl exec -ti ack-nvidia-device-plugin-fnctc -n kube-system -- nvidia-smi期待される出力:
Mon Mar 24 08:51:55 2025 +-----------------------------------------------------------------------------------------+ | NVIDIA-SMI 550.144.03 Driver Version: 550.144.03 CUDA Version: 12.6 | |-----------------------------------------+------------------------+----------------------+ | GPU Name Persistence-M | Bus-Id Disp.A | Volatile Uncorr. ECC | | Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. | | | | MIG M. | |=========================================+========================+======================| | 0 Tesla P4 On | 00000000:00:07.0 Off | 0 | | N/A 33C P8 7W / 75W | 0MiB / 7680MiB | 0% Default | | | | N/A | +-----------------------------------------+------------------------+----------------------+ +-----------------------------------------------------------------------------------------+ | Processes: | | GPU GI CI PID Type Process name GPU Memory | | ID ID Usage | |=========================================================================================| | No running processes found | +-----------------------------------------------------------------------------------------+Driver Version: 550.144.03は、カスタムドライバーがインストールされていることを示します。
API を使用したドライバーバージョンの設定
CreateClusterNodePool API を使用してノードプールを作成する際に、tags フィールドにドライバーバージョンのラベルを含めます:
{
"tags": [
{
"key": "ack.aliyun.com/nvidia-driver-version",
"value": "550.144.03"
}
]
}