GPU-HPN Capacity Reservation untuk kluster ACS memungkinkan Anda memesan sumber daya komputasi GPU yang mendukung High-Performance Network (HPN). Dengan mengaitkan GPU-HPN Capacity Reservation ke Virtual Node di kluster ACS, Anda dapat menggunakan penjadwalan berbasis afinitas untuk beban kerja kontainer GPU guna memastikan pemanfaatan sumber daya yang efisien. Topik ini menjelaskan cara membuat GPU-HPN Capacity Reservation dan mengaitkannya dengan kluster.
Informasi latar belakang
ACS menghasilkan Virtual Node default berdasarkan vSwitchIds dalam ConfigMap acs-profile dan tidak mengonsumsi sumber daya komputasi apa pun secara langsung.
Pemesanan kapasitas GPU-HPN
Saat ini, GPU-HPN Capacity Reservation hanya tersedia melalui langganan. Setelah pemesanan Anda aktif, sumber daya tersebut dijamin selama seluruh periode langganan. Jika Anda memesan beberapa instans, Anda dapat mengaitkannya dengan beberapa kluster sekaligus. Anda dapat menggunakan node yang dipesan untuk instans Pod dengan jumlah dan spesifikasi yang berbeda. Misalnya, dalam skenario yang memerlukan High-Performance Network (HPN) untuk komunikasi terdistribusi antar-GPU—seperti pelatihan model besar atau fine-tuning—Pod mengonsumsi GPU-HPN Capacity Reservation berdasarkan jumlah GPU utuh yang ditentukan dalam Pod, tanpa batasan pada ukuran CPU atau memori.
Penagihan dan batasan
Pemesanan kapasitas ditagih sesuai dengan paket langganan Anda.
Penagihan dimulai ketika pemesanan berhasil dibuat dan statusnya menjadi aktif.
Penagihan berakhir setelah pemesanan kedaluwarsa dan sumber daya dilepas secara otomatis.
-
Untuk mengaktifkan GPU-HPN Capacity Reservation, submit a ticket.
-
Kluster ACS hanya mendukung penerapan pemesanan untuk mengimbangi biaya tipe sumber daya GPU yang sama. Jika Anda membeli pemesanan untuk satu model GPU, Anda tidak dapat menerapkannya ke model GPU yang berbeda. Dalam kasus ini, ACS akan menagih Anda dengan tarif standar untuk tipe GPU aktual yang digunakan.
-
Hanya Pod dengan tipe komputasi yang diatur ke high-performance network GPU (
gpu-hpn) yang dapat menggunakan node dari GPU-HPN Capacity Reservation.
Buat pemesanan kapasitas GPU-HPN
-
Masuk ke ACS console. Di panel navigasi kiri, pilih Capacity Reservation.
-
Pada halaman Capacity Reservations, klik Create GPU-HPN resource reservation dan konfigurasikan parameter berikut.
Parameter
Deskripsi
Region
Pilih wilayah untuk pemesanan kapasitas.
Zone
Pilih zona untuk pemesanan kapasitas.
Type
Saat ini, hanya instance yang didukung.
Category
Saat ini, hanya GPU yang didukung.
HPN zone
Pilih zona HPN untuk pemesanan kapasitas.
Instance type
Opsi yang tersedia bervariasi tergantung tampilan Konsol.
Subscription duration
1 bulan, 1 tahun, atau 3 tahun.
Down payment ratio (%)
Diperlukan uang muka 0%. Anda dapat langsung menggunakan sumber daya setelah pembelian.
Discount
Diskon bervariasi tergantung durasi langganan. Langganan 1 bulan tidak mendapatkan diskon. Langganan 1 tahun mendapatkan diskon prabayar 12 bulan. Langganan 3 tahun mendapatkan diskon prabayar 36 bulan.
Billing cycle
Monthly.
Number of installments
Jumlah cicilan tergantung pada durasi langganan. Misalnya, langganan 1 bulan dibayar dalam 1 cicilan, sedangkan langganan 1 tahun dibayar dalam 12 cicilan.
Quantity
Jumlah instans yang akan dipesan.
Setelah mengonfigurasi parameter, klik Buy Now. Pada halaman konfirmasi pesanan, klik Proceed to Payment. Pada halaman pembayaran, klik Subscribe untuk menyelesaikan pembelian.
Kaitkan kluster
-
Masuk ke ACS console. Di panel navigasi kiri, pilih Capacity Reservation.
-
Pada halaman Capacity Reservations, temukan pemesanan yang akan dikaitkan dan klik Associate Cluster di bawah statusnya.
PentingAnda hanya dapat mengaitkan pemesanan dengan ACS Cluster, ACK Managed Cluster, ACK One Registered Cluster, atau ACK One Distributed Workflow Argo Cluster. Tipe kluster lain tidak didukung.
-
Pada kotak dialog Resource Association, pilih atau masukkan ID kluster dan tentukan jumlah instans. Lalu, klik OK.
PentingPada kotak dialog Resource Association, daftar drop-down kluster hanya menampilkan ID ACS Cluster dan ACK Managed Cluster. Untuk ACK One Registered Cluster atau ACK One Distributed Workflow Argo Cluster, Anda harus memasukkan ID kluster secara manual.
Kueri sumber daya teralokasi
GPU-HPN Capacity Reservation direpresentasikan sebagai Node Kubernetes di kluster. Anda dapat menggunakan kubectl untuk melihat sumber daya yang dialokasikan pada Node tersebut.
-
Jalankan perintah berikut untuk melihat node GPU-HPN berdasarkan label:
kubectl get node -l alibabacloud.com/node-type=reservedOutput yang diharapkan:
NAME STATUS ROLES AGE VERSION cn-wulanchabu-c.cr-rkccqmu0xz8rea1***** Ready agent 20m v1.28.3-aliyun -
Jalankan perintah berikut untuk mengkueri sumber daya yang dialokasikan dari GPU-HPN Capacity Reservation. Ganti nama node dalam perintah dengan nama aktual node GPU-HPN dari langkah sebelumnya.
kubectl describe node cn-wulanchabu-c.cr-rkccqmu0xz8rea1***** | grep Allocated -A 10Output yang diharapkan:
Allocated resources: (Total limits may be over 100 percent, i.e., overcommitted.) Resource Requests Limits -------- -------- ------ cpu 16 (8%) 16 (8%) memory 128Gi (7%) 128Gi (7%) ephemeral-storage 30Gi (0%) 30Gi (0%) nvidia.com/gpu 1 1 Events: <none>Baris 5 hingga 8 menunjukkan jumlah dan tingkat pemanfaatan sumber daya yang dialokasikan untuk CPU, memori, ephemeral-storage, dan GPU, secara berurutan.