Sumber daya komputasi AI PAI menyediakan kapasitas GPU berkinerja tinggi dan berkelanjutan untuk beban kerja pelatihan dan inferensi, serta mendukung DSW, DLC, dan EAS. Anda dapat membeli sumber daya komputasi dalam kolam sumber daya, mengalokasikan kapasitas ke tim melalui kuota sumber daya (Quota), lalu mengikat kuota tersebut ke ruang kerja sebelum digunakan.
Jenis sumber daya
Cloud-native resources
Cloud-native resources berlaku untuk PAI-DSW, PAI-DLC, dan PAI-EAS. Terdapat dua jenis:
|
Type |
Description |
Use cases |
|
General-purpose computing resources |
Dibangun di atas produk cloud seperti ECS, ECI, dan EGS, sumber daya ini menyediakan kapasitas yang fleksibel dan stabil. Setelah Anda mengaktifkan PAI, sistem secara otomatis membuat kuota sumber daya publik untuk penggunaan langsung. |
Pelatihan dan inferensi model rutin, serta pengembangan dan eksperimen skala kecil hingga menengah. |
|
Lingjun AI computing resources |
Kapasitas berkinerja tinggi yang dirancang untuk pembelajaran mendalam skala besar. Optimasi perangkat keras-perangkat lunak secara bersamaan menghadirkan interkoneksi jaringan berkinerja tinggi dan akselerasi penyimpanan. |
Pelatihan model besar, pelatihan terdistribusi skala ribuan GPU, serta beban kerja yang membutuhkan bandwidth jaringan dan penyimpanan tinggi. |
Big data engine resources
Big data engine resources berlaku untuk PAI-Designer. Terdapat dua jenis:
|
Type |
Description |
References |
|
MaxCompute |
Gudang data cloud tingkat enterprise yang mendukung analisis dan pemrosesan efisien terhadap set data dalam jumlah sangat besar. |
|
|
Realtime Compute for Apache Flink |
Platform analitik data besar real-time berbasis Apache Flink dengan latensi di bawah satu detik. |
Konsep utama
|
Concept |
Description |
|
Resource pool |
Titik masuk untuk membeli dan mengelola sumber daya komputasi. Di dalam kolam sumber daya, Anda membuat kelompok sumber daya, membeli node GPU, serta mengelola perpanjangan dan pembatalan langganan. |
|
Resource quota (Quota) |
Unit yang mengalokasikan kapasitas dari kolam sumber daya. Anda dapat membuat hierarki kuota induk-anak (Quota Tree) untuk mendistribusikan sumber daya berdasarkan tim atau proyek. Setelah mengikat kuota ke ruang kerja, DSW, DLC, dan EAS di ruang kerja tersebut dapat menggunakan kapasitas yang dialokasikan. |
|
Resource group |
Pengelompokan logis di dalam kolam sumber daya. Setiap kelompok sumber daya berkorespondensi dengan sekumpulan node komputasi dengan tipe yang sama. Satu kuota sumber daya dapat menarik kapasitas dari beberapa kelompok sumber daya. |
Alur kerja
Ikuti alur kerja berikut untuk menyiapkan sumber daya komputasi AI cloud-native:
-
Purchase resources: Buat kelompok sumber daya dan beli sumber daya komputasi di AI Computing Resources > Resource Pool.
General-purpose computing resources: Untuk detailnya, lihat Buat kelompok sumber daya dan beli sumber daya komputasi umum.
Lingjun AI computing resources: Untuk detailnya, lihat Buat kelompok sumber daya dan beli Sumber daya komputasi cerdas Lingjun.
Create resource quotas: Alokasikan kapasitas ke tim yang berbeda di AI Computing Resources > Resource Quota (Quota). Untuk detailnya, lihat Buat kuota sumber daya.
Bind to a workspace: Ikat kuota sumber daya ke ruang kerja agar anggota ruang kerja dapat menggunakan kapasitas yang dialokasikan untuk pengembangan dan pelatihan AI.
Use the resource quota: Saat membuat instans DSW, tugas DLC, atau layanan EAS, pilih kuota sumber daya yang telah Anda buat sebagai sumber komputasi.
Big data engine resources menggunakan pendekatan manajemen kuota yang berbeda. Untuk MaxCompute, lihat Kuota sumber daya MaxCompute. Untuk Realtime Compute for Apache Flink, lihat Kelola sumber daya Flink yang sepenuhnya dikelola.
Konfigurasi lanjutan
Scheduling policies: Konfigurasikan kebijakan penjadwalan antrian untuk meningkatkan efisiensi dequeue dan pemanfaatan sumber daya. Untuk detailnya, lihat Kebijakan penjadwalan.
Preemption policies: Aktifkan preemption kapasitas agar tugas dapat menggunakan kapasitas idle dari kuota saudara atau anak. Untuk detailnya, lihat Kebijakan preemption.
Monitoring and alerting: Pantau penggunaan sumber daya melalui CloudMonitor dan ARMS, serta konfigurasikan pemberitahuan peringatan. Untuk detailnya, lihat Pemantauan dan peringatan.
Integrated training and inference resource management: Jalankan layanan inferensi dan tugas pelatihan pada kluster GPU yang sama untuk meningkatkan pemanfaatan keseluruhan. Untuk detailnya, lihat Manajemen sumber daya inferensi dan pelatihan terpadu.
Penagihan
Sumber daya komputasi AI ditagih berdasarkan langganan (bulanan atau tahunan). Biaya bergantung pada spesifikasi node, jumlah, dan durasi langganan. Untuk detailnya, lihat Penagihan sumber daya komputasi AI.