Container Service for Kubernetes (ACK) mengelola node Lingjun melalui kelompok node Lingjun, yang mendukung manajemen siklus hidup kelompok node, penambahan dan penghapusan node secara batch, konfigurasi node, penjadwalan dan orkestrasi, pemantauan dan diagnosis, serta O&M otomatis. Kelompok node Lingjun juga menyediakan kemampuan peningkatan untuk skenario AI dan komputasi kinerja tinggi (HPC), seperti jaringan Remote Direct Memory Access (RDMA) dan penjadwalan GPU.
Hubungan pengikatan
Kelompok node Lingjun di ACK terikat satu-ke-satu dengan kelompok node dari Intelligent Computing Lingjun (kluster bare metal Lingjun). Setiap kelompok node dalam kluster Lingjun berkorespondensi dengan satu kelompok node Lingjun di kluster ACK, dan setiap node Lingjun hanya dapat menjadi bagian dari satu kelompok node Lingjun. Pisahkan node Lingjun dalam kluster ACK ke dalam kelompok node berbeda untuk manajemen terdiferensiasi.
Kemampuan peningkatan untuk AI dan HPC
Setelah Anda men-deploy cloud-native AI suite, kelompok node Lingjun menyediakan kemampuan peningkatan berikut untuk skenario AI dan komputasi kinerja tinggi (HPC):
Penjadwalan GPU: mendukung penjadwalan berbasis topologi untuk beberapa GPU dan, bersama dengan virtualisasi kontainer GPU, menyediakan penjadwalan serta isolasi GPU bersama.
Kebijakan penjadwalan job: mendukung kebijakan penjadwalan seperti Gang, Capacity, dan Binpack.
Akselerasi data: mendukung orkestrasi set data dan akselerasi akses.
Ikhtisar fitur
Manajemen siklus hidup node
Fitur | Deskripsi |
Kelola kelompok node Lingjun di Konsol ACK. | |
Tambahkan node dari kelompok node Lingjun ke kelompok node secara batch agar ACK dapat mengelolanya secara terpusat. Sistem operasi, disk sistem, dan disk data node tidak diganti. | |
Hapus node dari kelompok node Lingjun untuk menghentikan pengelolaan node oleh ACK. Setelah dihapus, node tersebut tidak akan di-scale in dari kelompok node Lingjun dan tidak akan dilepas atau dibatalkan langganan secara otomatis. |
Konfigurasi node dan O&M
Fitur | Deskripsi |
Konfigurasikan parameter startup kubelet, seperti pemesanan sumber daya dan jumlah maksimum Pod per node, untuk semua node dalam kelompok node guna memenuhi kebutuhan beban kerja tertentu. | |
Konfigurasikan parameter kernel sistem operasi, seperti parameter stack jaringan dan batas deskriptor file, untuk semua node dalam kelompok node guna mengoptimalkan lingkungan runtime dasar node. | |
Tingkatkan kubelet node dalam kelompok node ke versi yang sama dengan lapisan kontrol kluster untuk menjaga kompatibilitas versi kluster. Hanya upgrade in-place yang didukung. Upgrade dengan penggantian disk tidak didukung. | |
ACK secara otomatis memantau event abnormal dan, ketika terjadi gangguan akibat event dasar pada node Lingjun, memanggil kemampuan Lingjun ApproveOperation untuk menyelesaikan perbaikan. |
Kemampuan peningkatan untuk AI dan HPC
Fitur | Deskripsi |
Menyediakan komunikasi jaringan RDMA untuk Pod di node Lingjun guna memenuhi kebutuhan skenario pelatihan AI dan HPC akan jaringan ber-bandwidth tinggi dan latensi rendah. | |
Mengaktifkan pembagian dan isolasi sumber daya GPU pada node Lingjun. Beberapa Pod berbagi GPU yang sama berdasarkan kuota, sehingga meningkatkan pemanfaatan GPU. | |
Pada skenario pelatihan model, aktifkan kebijakan Binpack saat menjadwalkan Pod. Hal ini memprioritaskan penempatan Pod secara terkonsolidasi untuk mengurangi latensi komunikasi antar-node. | |
Mengoptimalkan penempatan Pod berdasarkan topologi jaringan node Lingjun. Pod dengan komunikasi intensif diprioritaskan dijadwalkan ke node yang berdekatan secara jarak jaringan, sehingga mengurangi latensi komunikasi antar-node. |
Penagihan
Saat Anda menggunakan kelompok node Lingjun di ACK managed Pro cluster, biaya terdiri dari tiga komponen berikut:
Biaya manajemen kluster: ACK managed Pro cluster dikenai biaya sebagaimana dijelaskan dalam Biaya manajemen kluster.
Biaya manajemen node Lingjun: Saat kelompok node Lingjun berisi node Lingjun, Anda dikenai biaya sebagaimana dijelaskan dalam Biaya manajemen node Lingjun.
Biaya sumber daya produk cloud: Anda dikenai biaya sumber daya cloud yang timbul dari sumber daya yang digunakan oleh kluster dan node, seperti sumber daya komputasi, penyimpanan, dan jaringan.
Pratinjau undangan gratis untuk fitur manajemen node Lingjun berakhir pada 05 Agustus 2025, dan penagihan komersial akan dimulai. Untuk informasi selengkapnya, lihat [Pengumuman Penagihan] Pengumuman Penagihan Manajemen Node Lingjun. Selama periode pratinjau undangan, fitur kelompok node Lingjun dapat digunakan secara gratis. Namun, biaya lain untuk kluster ACK managed Pro, seperti biaya manajemen kluster dan biaya sumber daya produk cloud, tetap dikenakan seperti biasa. Untuk informasi selengkapnya, lihat Ikhtisar penagihan.