EAS menyediakan tiga jenis sumber daya—public resources, EAS resource groups, dan resource quotas—untuk mendukung berbagai skenario mulai dari pengujian hingga produksi. Topik ini menjelaskan cara memilih jenis sumber daya serta mengonfigurasi sumber daya komputasi dan kebijakan penjadwalan.
Pilih jenis sumber daya
Jenis sumber daya | Kasus penggunaan | Penagihan | Perbandingan fitur | |
Ideal untuk pengujian atau layanan dengan lalu lintas fluktuatif (ketika sumber daya khusus dikombinasikan dengan kolam sumber daya elastis). |
|
| ||
Dedicated resource group | Cocok untuk skenario yang memerlukan keamanan tinggi atau sumber daya eksklusif. Beli dedicated resource group untuk memesan sumber daya langka. |
|
| |
Virtual resource group | Kelompok sumber daya logis yang menggabungkan beberapa jenis sumber daya, seperti public resources, resource quotas, dan dedicated resource groups. | Penagihan didasarkan pada sumber daya yang dijadwalkan dan digunakan. |
| |
Resource quota | General-purpose computing 2.0 | Cocok untuk skenario produksi yang memerlukan sumber daya khusus dan isolasi sumber daya. |
|
|
Ideal untuk model besar atau skenario yang memerlukan perangkat keras berkinerja tinggi, seperti interkoneksi RDMA berkecepatan tinggi dan penyimpanan CPFS untuk komputasi cerdas. |
| |||
Rekomendasi:
Pengujian dan pengembangan: Gunakan public resources untuk penagihan pay-as-you-go tanpa investasi awal. Ketersediaan sumber daya mungkin terbatas selama jam sibuk. Untuk informasi selengkapnya, lihat Apa yang harus saya lakukan jika public resources tidak mencukupi?
Lingkungan produksi (lalu lintas stabil): Gunakan EAS dedicated resource group atau resource quota (General-purpose computing 2.0). Opsi ini menyediakan sumber daya khusus, performa stabil, dan mendukung penagihan subscription untuk menekan biaya.
Lingkungan produksi (lalu lintas fluktuatif): Gunakan virtual resource group. Dedicated resource group atau resource quota menyediakan garis dasar, sedangkan public resources menangani lonjakan lalu lintas.
Model besar atau perangkat keras khusus: Gunakan resource quota (Lingjun intelligent computing) untuk mengakses perangkat keras berkinerja tinggi.
Pilih tipe instans
Pilih tipe instans CPU atau GPU berdasarkan ukuran model dan beban kerja inferensi Anda.
Spot instance: Saat menggunakan public resources, Anda dapat mengaktifkan mode spot dan menetapkan batas penawaran untuk menggunakan sumber daya idle dengan harga lebih rendah daripada instans reguler. Spot instance dapat ditarik kembali, sehingga paling cocok untuk tugas inferensi yang dapat mentoleransi gangguan.
GPU driver version: Saat memilih instans GPU, Anda dapat menentukan versi GPU driver di bagian Features > Resource Configuration untuk memenuhi persyaratan waktu proses model atau framework tertentu.
Konfigurasikan disk sistem
Disk sistem menyimpan data sementara yang dihasilkan saat runtime. Konfigurasi default bervariasi tergantung jenis sumber daya:
Public resources: Disk sistem gratis 30 GiB disediakan. Penggunaan melebihi 30 GiB ditagih berdasarkan sistem pay-as-you-go.
EAS resource group atau resource quota: Ukuran disk sistem default adalah 60 GiB. Jika Anda mengubah kapasitas, disk dialokasikan dari mesin host.
Tentukan jumlah replika
Jumlah replika adalah jumlah instans yang menjalankan layanan Anda. Kami merekomendasikan mengonfigurasi beberapa replika untuk menghindari single point of failure.
Konfigurasikan kebijakan penjadwalan
Saat menggunakan EAS resource group atau resource quota, Anda dapat menggunakan kebijakan berikut untuk mengoptimalkan penjadwalan sumber daya:
Elastic Resource Pool: Saat sumber daya Anda sendiri tidak mencukupi, sistem secara otomatis melakukan scale-out dengan menggunakan public resources berbasis pay-as-you-go untuk menangani lonjakan lalu lintas. Selama scale-in, instans yang menggunakan public resources akan dilepas terlebih dahulu untuk mengurangi biaya. Untuk informasi selengkapnya, lihat Kolam sumber daya elastis.
Specify Node Scheduling: Kebijakan ini membatasi layanan agar hanya berjalan pada node tertentu. Jika tidak ada node yang ditentukan, semua node yang tidak dikecualikan memenuhi syarat untuk penjadwalan.
High-priority Resource Rescheduling: Jika Anda mengaktifkan fitur ini, sistem secara berkala memigrasikan instans dari sumber daya prioritas rendah, seperti public resources, ke sumber daya prioritas tinggi, seperti dedicated resource group, untuk mengoptimalkan biaya. Fitur ini berguna ketika pembaruan bergulir sementara menjadwalkan instans ke public resources, atau ketika Anda ingin memigrasikan instans reguler ke spot instances untuk mengurangi biaya.
Resource Affinity Scheduling: Saat menggunakan sumber daya Lingjun intelligent computing dari public resource group untuk inferensi terdistribusi multi-node, kami merekomendasikan mengaktifkan resource affinity scheduling di bagian Features. Hal ini menjadwalkan instans ke domain jaringan hyper-node yang Anda tentukan di HPN Zone untuk memastikan interkoneksi RDMA berkecepatan tinggi.
GPU sharing dan inferensi terdistribusi
GPU sharing: Membagi daya komputasi dan memori satu kartu GPU di antara beberapa instans layanan untuk meningkatkan pemanfaatan GPU dan mengurangi biaya penerapan. Fitur ini ideal untuk model yang lebih kecil atau workload dengan beban inferensi rendah. GPU sharing hanya dapat diaktifkan saat menggunakan EAS resource group atau resource quota.
Multi-node distributed inference: Men-deploy satu instans layanan di beberapa mesin. Hal ini mengatasi batasan perangkat keras node tunggal dan mendukung penerapan serta pengoperasian model ultra-besar.
FAQ
Penggunaan dan batasan sumber daya
T: Mengapa instans 1-vCPU, 2-GB tidak tersedia?
Tipe instans 1 vCPU, 2 GB memori tidak tersedia untuk memastikan stabilitas layanan. Komponen sistem mengonsumsi sebagian sumber daya setiap node. Pada instans yang lebih kecil, hal ini menyisakan sumber daya yang tidak mencukupi untuk layanan Anda.
T: Bagaimana cara memperkirakan jumlah model per instans PAI-EAS?
Jumlah model yang dapat Anda deploy pada satu instans PAI-EAS bergantung pada kebutuhan sumber daya setiap model, seperti core CPU, memori GPU, dan memori sistem. Tidak ada batas yang telah ditentukan. Kami merekomendasikan memilih tipe instans berdasarkan kebutuhan aktual model Anda, atau men-deploy model berbeda pada instans terpisah.
T: Berapa jumlah maksimum layanan yang dapat di-deploy di EAS?
Jumlah maksimum instans layanan yang dapat Anda deploy bergantung pada sisa sumber daya yang tersedia. Anda dapat melihat kapasitas tersisa untuk setiap mesin di daftar mesin kelompok sumber daya Anda di Konsol. Untuk informasi selengkapnya, lihat Gunakan EAS resource group.
Jika Anda mengalokasikan tugas berdasarkan core CPU, jumlah maksimum instans yang dapat Anda deploy adalah (Total Core CPU - 1) / Core yang digunakan per instans.
T: Instans EAS mana yang setara dengan RTX 4090?
ecs.gn8ia-2x.8xlarge memberikan performa yang mendekati RTX 4090.
T: Berapa konkurensi maksimum untuk model yang di-deploy?
Konkurensi maksimum untuk layanan model bergantung pada berbagai faktor, termasuk model, kasus penggunaan, dan konfigurasi sumber daya. Kami merekomendasikan melakukan uji stres untuk mengukur performa layanan Anda.
Manajemen dedicated resource group
T: Mengapa dedicated resource group saya berada dalam status "Scaling Out" dalam waktu lama?
Hal ini biasanya terjadi karena kapasitas tidak mencukupi di wilayah saat ini. Untuk instans subscription, jika pembuatan gagal karena kapasitas tidak mencukupi, sistem secara otomatis membuat pesanan pengembalian dana dan mengembalikan pembayaran ke metode pembayaran asal.
T: Bagaimana cara menghapus instans subscription?
Buka halaman Alibaba Cloud Unsubscribe Resources untuk berhenti berlangganan mesin dedicated EAS berbasis subscription yang tidak lagi Anda perlukan. Konfigurasikan parameter berikut:
Type: Pilih Partial refund.
Product name: Pilih EAS Dedicated Machine Subscription.
Klik Search untuk menemukan sumber daya yang ingin Anda batalkan langgannya. Lalu, klik Unsubscribe resource di kolom Actions dan ikuti petunjuk di layar untuk menyelesaikan proses.
T: Apakah data instans tetap disimpan setelah berhenti berlangganan?
Tidak, data instans layanan tidak disimpan.
Manajemen disk sistem
T: Bagaimana cara menambah ukuran disk sistem?
Anda dapat mengonfigurasi atau memperluas disk sistem untuk layanan dengan salah satu cara berikut:
Konfigurasi Konsol: Saat membuat atau memperbarui layanan, di bagian , atur ukuran System Disk di bawah Configure a system disk.
Konfigurasi JSON: Di file konfigurasi JSON layanan, ubah nilai
metadatafielddisk."metadata": {"disk": "40Gi"}
Jika Anda menggunakan dedicated resource group, ukuran disk sistem yang dikonfigurasi tidak boleh melebihi ukuran disk sistem node tersebut. Jika Anda memerlukan disk sistem yang lebih besar, Anda harus melepas node saat ini dan membeli ulang node dengan disk sistem yang lebih besar.