GPU トポロジー対応スケジューリングを使用する前に、必要なコンポーネントをインストールして設定する必要があります。このトピックでは、これらのコンポーネントをインストールし、ご利用のクラスターでこの機能を有効にする方法について説明します。
前提条件
-
GPU インスタンスタイプを使用するACK マネージドクラスターが必要です。
-
ご利用のクラスターのコンポーネントが、以下のバージョン要件を満たしていること。
コンポーネント
バージョン要件
Kubernetes
1.18.8 以降
NVIDIA ドライバー
418.87.01 以降
NCCL バージョン
2.7 以降
オペレーティングシステム
-
CentOS 7.6
-
CentOS 7.7
-
Ubuntu 16.04
-
Ubuntu 18.04
-
Alibaba Cloud Linux 2
-
Alibaba Cloud Linux 3
GPU
V100
-
操作手順
ACK コンソールにログインします。左側のナビゲーションウィンドウで、クラスターリスト をクリックします。
クラスターリスト ページで、クラスターの名前をクリックします。左側のナビゲーションウィンドウで、 をクリックします。
-
クラウドネイティブ AI コンポーネントセット ページで、デプロイ をクリックします。
-
Cloud-native AI Suite デプロイページで、スケジューリング セクションで スケジューリングポリシーの拡張 (一括タスクスケジューリング、GPU 共有、GPU トポロジ認識) を選択し、下の クラウドネイティブ AI コンポーネントセットのデプロイ をクリックします。Cloud-native AI Suite のデプロイに関する設定項目の詳細については、「Cloud-native AI Suite のインストール」をご参照ください。
デプロイメントが完了すると、インストール済みの GPU トポロジー対応スケジューリング コンポーネント ack-ai-installer を、コンポーネント で確認できます。
説明以前にクラウドネイティブ AI スイートをデプロイしている場合は、コンポーネントリスト内のスケジューリングコンポーネント ack-ai-installer の右側にある アクション 列の デプロイ を直接クリックして、コンポーネントをインストールできます。