Setelah membuat kuota sumber daya, Anda dapat mengubah skalanya, menambahkan kuota anak, serta melihat daftar dan detailnya.
Untuk sumber daya Lingjun Intelligent Computing, pastikan semua node menggunakan pengidentifikasi hz yang sama agar memungkinkan konektivitas jaringan berkecepatan tinggi di antara mereka.
Buat kuota induk-anak
Pada halaman Resource Quota, Anda dapat membuat kuota sumber daya induk dan anak. Kuota-kuota ini membentuk struktur pohon, dikenal sebagai QuotaTree, yang memungkinkan manajemen dan alokasi sumber daya secara lebih detail. Untuk diagram hubungan induk-anak, lihat Fitur.
Buat kuota sumber daya induk: Klik Add Resource Quota untuk membuat kuota sumber daya akar. Untuk informasi selengkapnya, lihat Kuota sumber daya cloud-native.
Buat kuota sumber daya tingkat anak: Tambahkan kuota sumber daya baru, atau klik New Child-level Resource Quota pada kolom Actions dari kuota sumber daya yang sudah ada.
Klik tab Lingjun AI Computing Resources untuk melihat status, tipe GPU, jumlah node, dan penggunaan sumber daya (kartu GPU, core CPU, memori) dari setiap kuota sumber daya.
Penskalaan Kuota
Setelah membuat kuota sumber daya, Anda dapat menyesuaikan ukurannya berdasarkan kebutuhan pekerjaan guna mengelola biaya.
Pada halaman Resource Quota, temukan kuota sumber daya target dan klik Scale pada kolom Actions. Ubah skala kuota sumber daya dengan menyesuaikan Source atau Nodes/Instance Type.
Tingkatkan skala: Tambahkan sumber atau spesifikasi baru, atau sesuaikan yang sudah ada, untuk meningkatkan sumber daya yang tersedia.
Kurangi skala: Kurangi jumlah node untuk spesifikasi terkait atau hapus spesifikasi tertentu untuk melepas sumber daya yang tidak digunakan.
Pada halaman edit pengubahan skala, Source Type mendukung Dedicated Resource Group, Existing Resource Quota, atau Self-managed Resource Group. Setelah memilih sumber, klik + Add pada area Node/Specification untuk mengonfigurasi spesifikasi yang diperlukan, lalu klik OK.
Lihat daftar kuota
Pada halaman Resource Quota, alihkan ke tab Lingjun Intelligent Computing resources atau General Computing Resources untuk melihat daftar kuota sumber daya yang telah dibuat.
Halaman ini juga menyediakan fitur-fitur berikut:
Klik Tree atau List untuk mengganti mode tampilan.
Aktifkan Show only quotas with resources untuk memfilter kuota kosong.
Pada kolom Actions, lakukan operasi Scale, Add Sub-level Resource Quota, atau Delete.
Daftar ini menampilkan informasi dasar tentang setiap kuota sumber daya, termasuk nama, tipe, ruang kerja terkait, status, tipe GPU, jumlah node, dan jumlah sumber daya (seperti GPU, core CPU, dan memori). Anda dapat melakukan operasi berikut:
Filter kuota sumber daya: Filter kuota berdasarkan Name/ID atau Status.
Urutkan berdasarkan jumlah sumber daya: Urutkan berdasarkan total atau alokasi sumber daya CPU, memori, atau GPU untuk melihat distribusi dan penggunaan sumber daya.
Lihat detail kuota
Pada halaman Resource Quota, alihkan ke tab Lingjun Intelligent Computing resources atau General Computing Resources dan klik nama kuota sumber daya untuk melihat detailnya. Anda dapat melihat jumlah yang dijadwalkan, dikeluarkan dari antrian, dan dikirimkan, serta status idle sumber daya seperti GPU, CPU, dan memori untuk memahami ikhtisar penggunaan sumber daya dan status antrian pekerjaan.
Ikhtisar
Pada halaman detail kuota sumber daya, buka tab Overview untuk melihat dan memperbarui konfigurasi:
Basic Information: Meliputi nama kuota sumber daya, ID, dan ruang kerja terkait.
Klik ikon edit
untuk memperbarui Resource Quota Name, ruang kerja terkait, dan Tag.Setelah mengaitkan ruang kerja, klik nama ruang kerja tersebut untuk membuka halaman detailnya. Kemudian gunakan kuota sumber daya tersebut untuk pengembangan AI di ruang kerja tersebut.
Resource Information:
Informasi kelompok sumber daya: Meliputi kelompok sumber daya tempat kuota sumber daya tersebut berada, serta kuota sumber daya induk dan anaknya. Untuk diagram hubungan induk-anak, lihat bagian Buat kuota induk-anak. Klik nama sumber daya untuk membuka halaman detailnya.
GPU Default Driver: Memungkinkan Anda mengonfigurasi driver default untuk memenuhi kebutuhan kustom terkait tipe GPU, driver, SDK, dan gambar kontainer.
Network Information: Menampilkan batasan pada sumber daya jaringan, termasuk VPC, grup keamanan, dan NAT Gateways. Informasi ini menentukan cakupan kuota sumber daya pada lapisan jaringan.
Scheduling Information: Menampilkan informasi penjadwalan untuk kuota sumber daya dan memungkinkan Anda memperbarui konfigurasinya.
Scheduling Policy: Pilih kebijakan penjadwalan yang sesuai berdasarkan prinsip dasarnya untuk meningkatkan efisiensi pengeluaran dari antrian dan pemanfaatan sumber daya komputasi. Untuk detail konfigurasi, lihat Kebijakan penjadwalan.
Child-level Preemption dan Self-level Preemption: Saat sumber daya terbatas, pekerjaan dalam antrian pada kuota sumber daya saat ini dapat mengambil alih pekerjaan yang sedang berjalan pada kuota tingkat anak atau tingkat sendiri. Untuk detail konfigurasi, lihat Kebijakan preemption.
Idle Sharing: Diaktifkan secara default. Fitur ini memungkinkan pekerjaan idle menggunakan sumber daya dari kuota saat ini dan kuota anaknya.
Resource Change History: Lihat riwayat operasi pembuatan, pengubahan skala, dan penghapusan. Catatan ini menunjukkan jenis perubahan, inisiator, status, dan tipe instans target.
Event History: Lihat event terkait kuota, seperti penskalaan node, pengaktifan/pengnonaktifan penjadwalan, serta penyambungan/pemutusan node. Riwayat ini mencakup waktu pemicu event, inisiator, dan isinya.
Advanced Information:
Enable Local Cache: Untuk kuota sumber daya Intelligent Computing Lingjun, Anda dapat mengaktifkan fitur ini untuk menyimpan cache data dekat dengan node komputasi, sehingga meningkatkan performa baca. Mengaktifkan fitur ini mengonsumsi sebagian sumber daya pada node, jadi pastikan Anda memiliki sumber daya yang cukup. Untuk informasi selengkapnya, lihat Akselerasi cache Intelligent Computing Lingjun.
Storage service: Mendukung cache lokal untuk
OSS,General-purpose NAS, danBMCPFS.Supports RDMA: Pembacaan dengan akselerasi cache mendukung RDMA (tail), memberikan bandwidth komunikasi yang lebih tinggi untuk memenuhi kebutuhan performa baca data.
ENI warm-up: Menyediakan elastic network interfaces (ENIs) secara awal untuk node dalam kuota sumber daya guna mempercepat startup pekerjaan. Perhatikan bahwa mengaktifkan fitur ini mengonsumsi sumber daya ENI, jadi pastikan subnet VPC Anda memiliki jumlah alamat IP yang tersedia secara mencukupi. Untuk node yang dialokasikan ke kuota sumber daya anak, konfigurasi kuota tingkat terendah yang berlaku.
Node
Pada halaman detail kuota sumber daya, buka tab Nodes untuk melihat dan mengelola informasi node untuk kuota tersebut:
Detail node: Meliputi Node Specification, Dedicated Resource Group Name/ID, jumlah sumber daya In Use dan Total (GPU Type, Number of GPUs, dan CPU Cores), zona (AZ), zona interkoneksi jaringan berkecepatan tinggi (HZ), serta Tasks dan Instances yang dibuat pada node tersebut.
Detail pekerjaan dan instans: Pada kolom Tasks dan Instances untuk node target, klik angka yang sesuai untuk melihat detail pekerjaan dan instans.
Filter node: Filter node berdasarkan status node atau status pesanan, atau urutkan berdasarkan jumlah sumber daya.
hz (zona interkoneksi jaringan berkecepatan tinggi): Dalam skenario Intelligent Computing Lingjun,
hzmenunjukkan zona jaringan berkecepatan tinggi tempat sumber daya komputasi dasar berada. Sumber daya dengan pengidentifikasihzyang sama dapat berkomunikasi melalui jaringan berkecepatan tinggi.
Node Status: Status yang didukung:
Ready: Node komputasi tersedia.
Not Ready: Node komputasi sedang diinisialisasi.
Scheduling Disabled: Node tidak dapat dijadwalkan. Penyebab yang mungkin:
Stopped by User: Pengguna secara manual menonaktifkan penjadwalan pada node tersebut.
Expired: Langganan node telah kedaluwarsa.
Recovering: Node sedang dalam proses pemulihan. Jika ada pekerjaan yang berjalan pada node ini, hentikan segera untuk menghindari gangguan pada proses pemulihan.
Unknown: Penyebab tidak diketahui. Hubungi manajer akun Anda untuk bantuan.
Kelola node:
Hentikan/Mulai penjadwalan pada node: Pada kolom Actions untuk node target, klik Stop Scheduling atau Start Scheduling untuk menjeda atau melanjutkan penjadwalan sumber daya pada node tersebut.
Bersihkan node: Pada kolom Actions untuk node target, klik Clear Node untuk menghentikan semua pekerjaan (termasuk pekerjaan DSW, DLC, atau EAS) pada node tersebut.
Unduh daftar node: Klik ikon
untuk mengekspor daftar node dari halaman saat ini dan mengunduhnya ke mesin lokal Anda.
Pekerjaan
Pada halaman detail kuota sumber daya, buka tab Job untuk melihat informasi pekerjaan. Halaman ini menampilkan penggunaan sumber daya untuk pekerjaan Queuing dan Dequeued, termasuk metrik utama seperti status pekerjaan, kuota sumber daya, informasi instans, jumlah kartu GPU, core CPU, dan ukuran memori.
Filter pekerjaan: Filter berdasarkan Type atau Job Status.
Lihat detail: Klik nama pekerjaan, nama kuota sumber daya, atau nama ruang kerja untuk membuka halaman detail yang sesuai.
Filter pekerjaan dalam kuota saat ini: Aktifkan sakelar View Current Resource Quota untuk hanya menampilkan pekerjaan yang dibuat dalam kuota ini.
Pengguna
Pada halaman detail kuota sumber daya, buka tab User untuk melihat penggunaan sumber daya per pengguna dalam kuota tersebut, termasuk metrik utama seperti jumlah kartu GPU, core CPU, ukuran memori, dan jumlah pekerjaan.
Filter pengguna kuota saat ini: Aktifkan sakelar View Current Resource Quota Users untuk hanya menampilkan pengguna yang mengirimkan pekerjaan langsung ke kuota ini, bukan kuota anaknya.
Lihat detail pekerjaan: Pada kolom Number of Tasks untuk pengguna, klik Details untuk melihat pekerjaan yang dikirimkan oleh pengguna tersebut. Pada halaman daftar pekerjaan, klik nama pekerjaan untuk melihat detailnya.
Pemantauan
Pada halaman detail kuota sumber daya, buka tab Monitoring untuk melihat informasi pemantauan.
Menampilkan peta panas daya komputasi GPU (utilisasi real-time), tingkat sumber daya, dan distribusi status pekerjaan.
Tab Monitoring berisi dua area berikut:
GPU Computing Power Heatmap: menampilkan utilisasi real-time setiap kartu GPU menggunakan warna panas.
Resource and Task Overview: mencakup grafik garis Resource Watermark dan grafik donat Task Status Distribution, yang dapat difilter berdasarkan rentang waktu.
Lihat informasi pemantauan dari dua perspektif: kuota dan node. Ini mencakup metrik untuk CPU, memori, disk, jaringan, dan GPU. Untuk detail metrik dan cara menggunakan CloudMonitor dan ARMS untuk melihat data, mengonfigurasi peringatan, dan berlangganan metrik, lihat Pemantauan dan peringatan kuota sumber daya.
Klik tab Monitoring, pilih subtab Quota Dimension untuk melihat grafik garis pemantauan CPU berikut:
CPU Scheduled (cores): menunjukkan tren core CPU yang dijadwalkan.
CPU Total (cores): menunjukkan total core CPU.
CPU Scheduling Rate (%): menunjukkan rasio CPU yang dijadwalkan terhadap total kapasitas CPU.
Mendukung pemilihan rentang waktu (1 jam, 6 jam, 1 hari, 7 hari, 14 hari, atau kustom).
Topologi
Pada halaman detail kuota sumber daya, buka tab Topology untuk melihat topologi kuota tersebut. Tersedia dua tampilan:
Resource View: menampilkan penggunaan dan total kuota GPU (kartu), CPU (core), dan memori (TiB) untuk setiap kuota sumber daya tingkat anak dalam format kartu topologi.
Job View: menampilkan status pekerjaan yang berjalan untuk setiap antrian dalam format topologi, termasuk total pekerjaan, pekerjaan dalam antrian, dan pekerjaan yang berjalan. Mendukung filter berdasarkan All, Total Jobs, Queuing, Running.
Hapus kuota
Pada halaman Resource Quota, klik Delete pada kolom Actions untuk menghapus kuota sumber daya yang tidak lagi Anda gunakan. Anda harus memutuskan asosiasi kuota sumber daya dari ruang kerjanya sebelum menghapusnya. Untuk informasi selengkapnya, lihat Ikhtisar.
Pada tab Lingjun AI Computing Resources atau General Computing Resources, temukan baris kuota sumber daya target.