Sebelum menggunakan penjadwalan GPU topology-aware, Anda harus menginstal dan mengonfigurasi komponen yang diperlukan. Topik ini menjelaskan cara menginstal komponen tersebut dan mengaktifkan fitur ini di kluster Anda.
Prasyarat
-
Anda memiliki kluster ACK yang dikelola. Kluster tersebut harus menggunakan tipe GPU instance.
-
Anda telah memperoleh KubeConfig kluster dan terhubung ke kluster menggunakan kubectl.
-
Komponen dalam kluster Anda memenuhi persyaratan versi berikut.
Component
Version requirements
Kubernetes
1.18.8 atau yang lebih baru
NVIDIA driver
418.87.01 atau yang lebih baru
NCCL version
2.7 atau yang lebih baru
Operating system
-
CentOS 7.6
-
CentOS 7.7
-
Ubuntu 16.04
-
Ubuntu 18.04
-
Alibaba Cloud Linux 2
-
Alibaba Cloud Linux 3
GPU
V100
-
Prosedur
Masuk ke ACK console. Di panel navigasi kiri, klik Clusters.
Pada halaman Clusters, klik nama kluster Anda. Di panel navigasi kiri, klik .
-
Pada halaman Cloud-native AI Suite, klik Deploy.
-
Pada halaman Deploy Cloud-native AI Suite, di bagian Scheduling, pilih Scheduling Policy Extension (Batch Task Scheduling, GPU Sharing, Topology-aware GPU Scheduling), lalu klik Deploy Cloud-native AI Suite di bawahnya. Untuk informasi selengkapnya mengenai item konfigurasi untuk men-deploy Cloud-native AI Suite, lihat Install Cloud-native AI Suite.
Setelah penerapan selesai, Anda dapat melihat komponen penjadwalan GPU topology-aware yang telah diinstal, yaitu ack-ai-installer, di Components.
CatatanJika Anda sebelumnya telah menerapkan Cloud-native AI Suite, Anda dapat langsung mengklik Deploy pada kolom Actions di sebelah kanan komponen penjadwalan ack-ai-installer dalam daftar komponen untuk menginstal komponen tersebut.