ディープラーニング、AI、OpenGL、Direct3D、クラウドゲーミングなどのワークロードでハイパフォーマンスコンピューティングやグラフィックス アクセラレーションを行う場合、GPU が本来のパフォーマンスを発揮し、スムーズなグラフィックス レンダリングを実現するには、Tesla ドライバーをインストールする必要があります。Linux を実行する GPU 高速化コンピューティング最適化インスタンスの作成時に Tesla ドライバーをインストールしていない場合は、後から手動でインストールする必要があります。このトピックでは、Linux を実行する GPU 高速化コンピューティング最適化インスタンスに Tesla ドライバーを手動でインストールする方法について説明します。
手順
このトピックは、Linux を使用するすべての GPU アクセラレーションコンピューティング最適化インスタンスに適用されます。詳細については、「GPU アクセラレーションコンピューティング最適化インスタンス (gn/ebm/scc シリーズ)」をご参照ください。インスタンスのオペレーティングシステムと互換性のある Tesla ドライバーのみをインストールできます。たとえば、Linux を使用する GPU インスタンスは、Linux 用の Tesla ドライバーのみをサポートします。
ステップ 1:NVIDIA Tesla ドライバーのダウンロード
NVIDIA ドライバーダウンロードページに移動します。
説明NVIDIA ドライバーのインストールと設定方法の詳細については、「NVIDIA ドライバーインストールクイックスタートガイド」をご参照ください。
検索条件を設定し、[Search] をクリックします。
検索条件を次の表に示します。
基準
説明
例
製品タイプ
製品シリーズ
製品ファミリー
インスタンス内の GPU に基づいて、製品タイプ、製品シリーズ、製品ファミリーを選択します。
説明インスタンス ID、インスタンスタイプ、オペレーティングシステムなどの GPU インスタンスの詳細を表示するには、「インスタンス情報の表示」をご参照ください。
[Data Center / Tesla]
[A-Series]
[NVIDIA A10]
オペレーティングシステム
インスタンスが使用しているイメージに基づいて、Linux オペレーティングシステムのバージョンを選択します。
[Linux 64-bit]
CUDA ツールキット
CUDA ツールキットのバージョンを選択します。
[11.4]
言語
ドライバーの言語を選択します。
[日本語 (Japanese)]
検索結果ページで、[Beta, Older Drivers, and More] をクリックします。
ダウンロードするドライバーを見つけて、表示 をクリックします。
たとえば、ドライバーバージョンが 470.161.03 で CUDA ツールキットバージョンが 11.4 の [Data Center Driver for Linux x64] を選択します。
ドライバー詳細ページで、ダウンロード を右クリックし、[リンクのアドレスをコピー] を選択します。
Linux GPU インスタンスに接続します。
詳細については、「パスワードまたはキーを使用して Linux インスタンスに接続」をご参照ください。
次のコマンドを実行して、ドライバーインストールパッケージをダウンロードします。
コマンド例のドライバーダウンロード URL は、ステップ 5 でコピーしたリンクです。
wget https://us.download.nvidia.com/tesla/470.161.03/NVIDIA-Linux-x86_64-470.161.03.run
ステップ 2:NVIDIA Tesla ドライバーのインストール
Tesla ドライバーのインストール方法は、オペレーティングシステムによって異なります。
CentOS
次のコマンドを実行して、kernel-devel および kernel-headers パッケージがインストールされているかどうかを確認します。
sudo rpm -qa | grep $(uname -r)出力に kernel-devel および kernel-headers パッケージのバージョン情報が含まれている場合、それらはすでにインストールされています。
kernel-3.10.0-1062.18.1.el7.x86_64 kernel-devel-3.10.0-1062.18.1.el7.x86_64 kernel-headers-3.10.0-1062.18.1.el7.x86_64出力に kernel-devel-* および kernel-headers-* が見つからない場合は、カーネルバージョンに一致する kernel-devel および kernel-headers パッケージをダウンロードしてインストールします。
重要kernel-devel のバージョンがカーネルのバージョンと一致しない場合、ドライバーの RPM インストール中にドライバーのコンパイルが失敗します。したがって、出力内の kernel-* のバージョン番号を確認し、一致する kernel-devel バージョンをダウンロードする必要があります。出力例では、カーネルバージョンは 3.10.0-1062.18.1.el7.x86_64 です。
権限を付与し、Tesla ドライバーをインストールします。
Linux 64 ビット オペレーティングシステムでは、NVIDIA-Linux-x86_64-xxxx.run などの .run 形式の Tesla ドライバーを使用することを推奨します。次のコマンドを実行して権限を付与し、Tesla ドライバーをインストールします。
説明.deb や .rpm など、形式の異なる Tesla ドライバーを使用している場合は、インストール手順について「NVIDIA CUDA Installation Guide for Linux」をご参照ください。
sudo chmod +x NVIDIA-Linux-x86_64-xxxx.runsudo sh NVIDIA-Linux-x86_64-xxxx.run次のコマンドを実行してインストールを検証します。
nvidia-smi次のような出力が表示された場合、Tesla ドライバーはインストールされています。
[ecs-use xxx 9sgg1tZ ~]$ nvidia-smi Tue Sep 10 13:58:31 2024 +-----------------------------------------------------------------------------+ | NVIDIA-SMI 470.161.03 Driver Version: 470.161.03 CUDA Version: 11.4 | |-------------------------------+----------------------+----------------------+ | GPU Name Persistence-M| Bus-Id Disp.A | Volatile Uncorr. ECC | | Fan Temp Perf Pwr:Usage/Cap| Memory-Usage | GPU-Util Compute M. | | | | MIG M. | |===============================+======================+======================| | 0 NVIDIA A10 Off | 00000000:00:07.0 Off | 0 | | 0% 34C P0 62W / 150W | 0MiB / 22731MiB | 0% Default | | | | N/A | +-------------------------------+----------------------+----------------------+ +-----------------------------------------------------------------------------+ | Processes: | | GPU GI CI PID Type Process name GPU Memory | | ID ID Usage | |=============================================================================| | No running processes found | +-----------------------------------------------------------------------------+(オプション) NVIDIA Persistence Daemon を使用して永続モードを有効にします。
Tesla ドライバーをインストールした後、デフォルトで永続モードは無効 (
off) になっています。永続モードが有効になっていると、Tesla ドライバーの動作がより安定します。サービスの安定性を確保するために、NVIDIA Persistence Daemon を使用して永続モードを有効にすることを推奨します。詳細については、「Persistence Daemon」をご参照ください。説明永続モードとは、クライアントが接続されていない場合でもターゲット GPU を初期化し続ける、ユーザー設定が可能なドライバープロパティです。
nvidia-smi -pm 1を使用して永続モードを有効にすると、インスタンスの再起動後に設定が失われるなどの問題が発生します。詳細については、「永続モードが維持されず、ECC ステータスや MIG 機能の設定も GPU インスタンスの再起動後に失敗する」をご参照ください。NVIDIA Persistence Daemon を使用して永続モードを有効にすることを推奨します。
次のコマンドを実行して、NVIDIA Persistence Daemon を開始します。
sudo nvidia-persistenced --user username # username をお使いのユーザー名に置き換えます。次のコマンドを実行して、永続モードのステータスを確認します。
nvidia-smi返されたメッセージには、Persistence-M が有効 (
on) 状態であることが示されています。[ecs-usexxx2q9sgg1tZ ~]$ sudo nvidia-persistenced --user ecs-user [ecs-usexxx2q9sgg1tZ ~]$ nvidia-smi Tue Sep 10 14:02:16 2024 +-------------------------------+----------------------+----------------------+ | NVIDIA-SMI 470.161.03 Driver Version: 470.161.03 CUDA Version: 11.4 | |-------------------------------+----------------------+----------------------+ | GPU Name Persistence-M| Bus-Id Disp.A | Volatile Uncorr. ECC | | Fan Temp Perf Pwr:Usage/Cap| Memory-Usage | GPU-Util Compute M. | | | | MIG M. | |===============================+======================+======================| | 0 NVIDIA A10 On | 00000000:00:07.0 Off | 0 | | 0% 33C P8 8W / 150W | 0MiB / 22731MiB | 0% Default | | | | N/A | +-------------------------------+----------------------+----------------------+ +-----------------------------------------------------------------------------+ | Processes: | | GPU GI CI PID Type Process name GPU Memory | | ID ID Usage | |=============================================================================| | No running processes found | +-----------------------------------------------------------------------------+
(オプション) システムの再起動時に永続モードが有効になるように設定します。
システムが再起動すると、永続モードの有効 (
on) 状態は失われます。次の操作を実行して、永続モードを再度有効にできます。Tesla ドライバーをインストールすると、サンプルスクリプトやインストーラースクリプトなどの NVIDIA のインストールスクリプトが
/usr/share/doc/NVIDIA_GLX-1.0/samples/nvidia-persistenced-init.tar.bz2にインストールされます。次のコマンドを実行して、NVIDIA スクリプトを解凍してインストールします。
cd /usr/share/doc/NVIDIA_GLX-1.0/samples/ sudo tar xf nvidia-persistenced-init.tar.bz2 cd nvidia-persistenced-init sudo sh install.sh次のコマンドを実行して、NVIDIA Persistence Daemon が実行されているかどうかを確認します。
sudo systemctl status nvidia-persistenced次のような出力が表示された場合、NVIDIA Persistence Daemon は実行中です。
[ecs-user@xxx nvidia-persistenced-init]$ sudo systemctl status nvidia-persistenced ● nvidia-persistenced.service - NVIDIA Persistence Daemon Loaded: loaded (/usr/lib/systemd/system/nvidia-persistenced.service; enabled; vendor preset: disabled) Active: active (running) since Tue 2024-09-10 14:13:20 CST; 40s ago Process: 13882 ExecStart=/usr/bin/nvidia-persistenced --user nvidia-persistenced (code=exited, status=0/SUCCESS) Main PID: 13883 (nvidia-persiste) Tasks: 1 (limit: 383833) Memory: 196.0K CGroup: /system.slice/nvidia-persistenced.service └─13883 /usr/bin/nvidia-persistenced --user nvidia-persistenced Sep 10 14:13:19 iZbp13orbqqx6m2q9sgg1tZ systemd[1]: Starting NVIDIA Persistence Daemon... Sep 10 14:13:19 iZbp13orbqqx6m2q9sgg1tZ nvidia-persistenced[13883]: Started (13883) Sep 10 14:13:20 iZbp13orbqqx6m2q9sgg1tZ systemd[1]: Started NVIDIA Persistence Daemon.説明オペレーティングシステムに合わせて NVIDIA Persistence Daemon インストールスクリプトを調整し、正常な動作を確保してください。
次のコマンドを実行して、永続モードが
onに設定されていることを確認します。nvidia-smi(オプション) 次のコマンドを実行して、NVIDIA Persistence Daemon を停止します。
NVIDIA Persistence Daemon が不要になった場合は、無効にできます。
sudo systemctl stop nvidia-persistenced sudo systemctl disable nvidia-persistenced
(条件付き必須) インスタンスが ebmgn8v、ebmgn7、または ebmgn7e インスタンスファミリーに属している場合は、ドライバーバージョンに一致する nvidia-fabricmanager サービスをインストールします。
重要ebmgn8v、ebmgn7、または ebmgn7e インスタンスファミリーに属しているインスタンスでは、ドライバーバージョンに一致する nvidia-fabricmanager サービスがインストールされていないと GPU インスタンスを使用できません。
GPU インスタンスが ebmgn8v、ebmgn7、または ebmgn7e インスタンスファミリーに属していない場合は、このステップをスキップします。
nvidia-fabricmanager サービスをインストールします。
nvidia-fabricmanager サービスは、ソースコードまたはインストールパッケージからインストールできます。次のコマンド例は、オペレーティングシステムが CentOS 7.x および CentOS 8.x、ドライバーバージョンが 460.91.03 の場合のものです。コマンド内の
driver_versionは、「ステップ 1: NVIDIA Tesla ドライバーのダウンロード」でダウンロードしたドライバーのバージョン番号に置き換えてください。[ソースコード]
[インストールパッケージ]
次のコマンドを実行して、nvidia-fabricmanager サービスを開始します。
sudo systemctl enable nvidia-fabricmanager sudo systemctl start nvidia-fabricmanager次のコマンドを実行して、nvidia-fabricmanager サービスのステータスを確認します。
systemctl status nvidia-fabricmanager次のような出力が表示された場合、nvidia-fabricmanager サービスは実行中です。
nvidia-fabricmanager.service - NVIDIA fabric manager service Loaded: loaded (/lib/systemd/system/nvidia-fabricmanager.service; enabled; vendor preset: enabled) Active: active (running) since Mon 2021-09-13 19:14:45 CST; 1 weeks 1 days ago Process: 1928 ExecStart=/usr/bin/nv-fabricmanager -c /usr/share/nvidia/nvswitch/fabricmanager.cfg (code=exited, status=0/SUCCESS) Main PID: 2140 (nv-fabricmanage) Tasks: 18 (limit: 19660) CGroup: /system.slice/nvidia-fabricmanager.service └─2140 /usr/bin/nv-fabricmanager -c /usr/share/nvidia/nvswitch/fabricmanager.cfg Sep 13 19:14:26 xxx systemd[1]: Starting NVIDIA fabric manager service... Sep 13 19:14:45 xxx nv-fabricmanager[2140]: Successfully configured all the available GPUs and NVSwitches. Sep 13 19:14:45 xxx systemd[1]: Started NVIDIA fabric manager service.
Ubuntu およびその他
権限を付与し、Tesla ドライバーをインストールします。
Linux 64 ビット オペレーティングシステムでは、NVIDIA-Linux-x86_64-xxxx.run などの .run 形式の Tesla ドライバーを使用することを推奨します。次のコマンドを実行して権限を付与し、Tesla ドライバーをインストールします。
説明.deb や .rpm など、形式の異なる Tesla ドライバーを使用している場合は、インストール手順について「NVIDIA CUDA Installation Guide for Linux」をご参照ください。
sudo chmod +x NVIDIA-Linux-x86_64-xxxx.runsudo sh NVIDIA-Linux-x86_64-xxxx.run次のコマンドを実行してインストールを検証します。
nvidia-smi次のような出力が表示された場合、Tesla ドライバーはインストールされています。
[ecs-use xxx 9sgg1tZ ~]$ nvidia-smi Tue Sep 10 13:58:31 2024 +-----------------------------------------------------------------------------+ | NVIDIA-SMI 470.161.03 Driver Version: 470.161.03 CUDA Version: 11.4 | |-------------------------------+----------------------+----------------------+ | GPU Name Persistence-M| Bus-Id Disp.A | Volatile Uncorr. ECC | | Fan Temp Perf Pwr:Usage/Cap| Memory-Usage | GPU-Util Compute M. | | | | MIG M. | |===============================+======================+======================| | 0 NVIDIA A10 Off | 00000000:00:07.0 Off | 0 | | 0% 34C P0 62W / 150W | 0MiB / 22731MiB | 0% Default | | | | N/A | +-------------------------------+----------------------+----------------------+ +-----------------------------------------------------------------------------+ | Processes: | | GPU GI CI PID Type Process name GPU Memory | | ID ID Usage | |=============================================================================| | No running processes found | +-----------------------------------------------------------------------------+(オプション) NVIDIA Persistence Daemon を使用して永続モードを有効にします。
Tesla ドライバーをインストールした後、デフォルトで永続モードは無効 (
off) になっています。永続モードが有効になっていると、Tesla ドライバーの動作がより安定します。サービスの安定性を確保するために、NVIDIA Persistence Daemon を使用して永続モードを有効にすることを推奨します。詳細については、「Persistence Daemon」をご参照ください。説明永続モードとは、クライアントが接続されていない場合でもターゲット GPU を初期化し続ける、ユーザー設定が可能なドライバープロパティです。
nvidia-smi -pm 1を使用して永続モードを有効にすると、インスタンスの再起動後に設定が失われるなどの問題が発生します。詳細については、「永続モードが維持されず、ECC ステータスや MIG 機能の設定も GPU インスタンスの再起動後に失敗する」をご参照ください。NVIDIA Persistence Daemon を使用して永続モードを有効にすることを推奨します。
次のコマンドを実行して、NVIDIA Persistence Daemon を開始します。
sudo nvidia-persistenced --user username # username をお使いのユーザー名に置き換えます。次のコマンドを実行して、永続モードのステータスを確認します。
nvidia-smi返されたメッセージには、Persistence-M が有効 (
on) 状態であることが示されています。[ecs-usexxx2q9sgg1tZ ~]$ sudo nvidia-persistenced --user ecs-user [ecs-usexxx2q9sgg1tZ ~]$ nvidia-smi Tue Sep 10 14:02:16 2024 +-------------------------------+----------------------+----------------------+ | NVIDIA-SMI 470.161.03 Driver Version: 470.161.03 CUDA Version: 11.4 | |-------------------------------+----------------------+----------------------+ | GPU Name Persistence-M| Bus-Id Disp.A | Volatile Uncorr. ECC | | Fan Temp Perf Pwr:Usage/Cap| Memory-Usage | GPU-Util Compute M. | | | | MIG M. | |===============================+======================+======================| | 0 NVIDIA A10 On | 00000000:00:07.0 Off | 0 | | 0% 33C P8 8W / 150W | 0MiB / 22731MiB | 0% Default | | | | N/A | +-------------------------------+----------------------+----------------------+ +-----------------------------------------------------------------------------+ | Processes: | | GPU GI CI PID Type Process name GPU Memory | | ID ID Usage | |=============================================================================| | No running processes found | +-----------------------------------------------------------------------------+
(オプション) システムの再起動時に永続モードが有効になるように設定します。
システムが再起動すると、永続モードの有効 (
on) 状態は失われます。次の操作を実行して、永続モードを再度有効にできます。Tesla ドライバーをインストールすると、サンプルスクリプトやインストーラースクリプトなどの NVIDIA のインストールスクリプトが
/usr/share/doc/NVIDIA_GLX-1.0/samples/nvidia-persistenced-init.tar.bz2にインストールされます。次のコマンドを実行して、NVIDIA スクリプトを解凍してインストールします。
cd /usr/share/doc/NVIDIA_GLX-1.0/samples/ sudo tar xf nvidia-persistenced-init.tar.bz2 cd nvidia-persistenced-init sudo sh install.sh次のコマンドを実行して、NVIDIA Persistence Daemon が実行されているかどうかを確認します。
sudo systemctl status nvidia-persistenced次のような出力が表示された場合、NVIDIA Persistence Daemon は実行中です。
[ecs-user@xxx nvidia-persistenced-init]$ sudo systemctl status nvidia-persistenced ● nvidia-persistenced.service - NVIDIA Persistence Daemon Loaded: loaded (/usr/lib/systemd/system/nvidia-persistenced.service; enabled; vendor preset: disabled) Active: active (running) since Tue 2024-09-10 14:13:20 CST; 40s ago Process: 13882 ExecStart=/usr/bin/nvidia-persistenced --user nvidia-persistenced (code=exited, status=0/SUCCESS) Main PID: 13883 (nvidia-persiste) Tasks: 1 (limit: 383833) Memory: 196.0K CGroup: /system.slice/nvidia-persistenced.service └─13883 /usr/bin/nvidia-persistenced --user nvidia-persistenced Sep 10 14:13:19 iZbp13orbqqx6m2q9sgg1tZ systemd[1]: Starting NVIDIA Persistence Daemon... Sep 10 14:13:19 iZbp13orbqqx6m2q9sgg1tZ nvidia-persistenced[13883]: Started (13883) Sep 10 14:13:20 iZbp13orbqqx6m2q9sgg1tZ systemd[1]: Started NVIDIA Persistence Daemon.説明オペレーティングシステムに合わせて NVIDIA Persistence Daemon インストールスクリプトを調整し、正常な動作を確保してください。
次のコマンドを実行して、永続モードが
onに設定されていることを確認します。nvidia-smi(オプション) 次のコマンドを実行して、NVIDIA Persistence Daemon を停止します。
NVIDIA Persistence Daemon が不要になった場合は、無効にできます。
sudo systemctl stop nvidia-persistenced sudo systemctl disable nvidia-persistenced
(条件付き必須) インスタンスが ebmgn8v、ebmgn7、または ebmgn7e インスタンスファミリーに属している場合は、ドライバーバージョンに一致する nvidia-fabricmanager サービスをインストールします。
重要ebmgn8v、ebmgn7、または ebmgn7e インスタンスファミリーに属しているインスタンスでは、ドライバーバージョンに一致する nvidia-fabricmanager サービスがインストールされていないと GPU インスタンスを使用できません。
GPU インスタンスが ebmgn8v、ebmgn7、または ebmgn7e インスタンスファミリーに属していない場合は、このステップをスキップします。
nvidia-fabricmanager サービスをインストールします。
nvidia-fabricmanager サービスは、ソースコードまたはインストールパッケージからインストールできます。次のコマンド例は、Ubuntu 16.04、Ubuntu 18.04、Ubuntu 20.04、Ubuntu 22.04、または Ubuntu 24.04 オペレーティングシステムの場合のものです。コマンド内の
driver_versionは、「ステップ 1: NVIDIA Tesla ドライバーのダウンロード」でダウンロードしたドライバーのバージョン番号に置き換えてください。重要Ubuntu 22.04 では、nvidia-fabricmanager サービスには 515.48.07 より後のバージョンの Tesla ドライバーが必要です。Ubuntu 22.04 の次の例では、ドライバーバージョン 535.154.05 を使用します。
Ubuntu 24.04 では、nvidia-fabricmanager サービスには 550.90.07 より後のバージョンの Tesla ドライバーが必要です。Ubuntu 24.04 の次の例では、ドライバーバージョン 570.133.20 を使用します。
[ソースコード]
[インストールパッケージ]
次のコマンドを実行して、nvidia-fabricmanager サービスを開始します。
sudo systemctl enable nvidia-fabricmanager sudo systemctl start nvidia-fabricmanager次のコマンドを実行して、nvidia-fabricmanager サービスのステータスを確認します。
systemctl status nvidia-fabricmanager次のような出力が表示された場合、nvidia-fabricmanager サービスは実行中です。
nvidia-fabricmanager.service - NVIDIA fabric manager service Loaded: loaded (/lib/systemd/system/nvidia-fabricmanager.service; enabled; vendor preset: enabled) Active: active (running) since Mon 2021-09-13 19:14:45 CST; 1 weeks 1 days ago Process: 1928 ExecStart=/usr/bin/nv-fabricmanager -c /usr/share/nvidia/nvswitch/fabricmanager.cfg (code=exited, status=0/SUCCESS) Main PID: 2140 (nv-fabricmanage) Tasks: 18 (limit: 19660) CGroup: /system.slice/nvidia-fabricmanager.service └─2140 /usr/bin/nv-fabricmanager -c /usr/share/nvidia/nvswitch/fabricmanager.cfg Sep 13 19:14:26 xxx systemd[1]: Starting NVIDIA fabric manager service... Sep 13 19:14:45 xxx nv-fabricmanager[2140]: Successfully configured all the available GPUs and NVSwitches. Sep 13 19:14:45 xxx systemd[1]: Started NVIDIA fabric manager service.説明GPU が正しく動作するには、nvidia-fabricmanager パッケージのバージョンが Tesla ドライバーのバージョンと一致している必要があります。Ubuntu では、インストールパッケージを使用して nvidia-fabricmanager サービスをインストールすると、
apt-dailyサービスが nvidia-fabricmanager パッケージを自動的に更新する場合があります。これにより、Tesla ドライバーとのバージョン不一致が発生し、nvidia-fabricmanager サービスが開始できなくなり、GPU が使用できなくなることがあります。この問題を解決するには、「nvidia-fabricmanager のバージョンが Tesla ドライバーのバージョンと異なるために GPU が期待どおりに動作しない」をご参照ください。
関連ドキュメント
Windows を使用する GPU アクセラレーションコンピューティング最適化インスタンスを購入した場合、ディープラーニングや AI などの汎用コンピューティングワークロードにインスタンスを使用するには、Tesla ドライバーをインストールする必要があります。詳細については、「GPU アクセラレーションコンピューティング最適化インスタンス (Windows) に Tesla ドライバーを手動でインストールする」をご参照ください。
GPU インスタンスの作成時に Tesla ドライバーをインストールする場合は、「GPU インスタンスの作成時に Tesla ドライバーを自動的にインストールまたはロードする」をご参照ください。
何らかの理由で現在の Tesla ドライバーをアンインストールする必要がある場合は、「Tesla ドライバーのアンインストール」をご参照ください。
インストールされているドライバーのバージョンがワークロードに適していない場合、または間違ったドライバーの種類やバージョンをインストールして GPU インスタンスが使用できなくなった場合は、現在のドライバーをアンインストールして新しいドライバーをインストールするか、ドライバーを直接アップグレードできます。ドライバーのアップグレード方法については、「NVIDIA ドライバーのアップグレード」をご参照ください。