All Products
Search
Document Center

Platform For AI:Konfigurasikan sumber daya penerapan

Last Updated:Jun 18, 2026

EAS menyediakan tiga jenis sumber daya—public resources, EAS resource groups, dan resource quotas—untuk mendukung berbagai skenario mulai dari pengujian hingga produksi. Topik ini menjelaskan cara memilih jenis sumber daya serta mengonfigurasi sumber daya komputasi dan kebijakan penjadwalan.

Pilih jenis sumber daya

Jenis sumber daya

Kasus penggunaan

Penagihan

Perbandingan fitur

Public resources

Ideal untuk pengujian atau layanan dengan traffic yang fluktuatif (ketika sumber daya dedicated dikombinasikan dengan elastic resource pool).

  • Aktivasi sesuai permintaan.

  • Ditagih berdasarkan skema pay-as-you-go. Untuk informasi selengkapnya, lihat Penagihan EAS.

  • Menggunakan sumber daya komputasi bersama tanpa perlu pembelian terpisah. Ketersediaan sumber daya tidak dijamin selama jam sibuk.

  • Mendukung instans CPU dan GPU (A10, P4, P100, T4, dan V100).

EAS resource group

Dedicated resource group

Cocok untuk skenario yang memerlukan keamanan tinggi atau sumber daya eksklusif. Beli dedicated resource group untuk memesan sumber daya langka.

  • Harus dibeli sebelum digunakan.

  • Mendukung penagihan subscription dan pay-as-you-go. Untuk informasi selengkapnya, lihat Penagihan EAS.

  • Menyediakan sumber daya komputasi eksklusif dengan isolasi sumber daya untuk meningkatkan keamanan.

  • Mendukung instans CPU dan GPU (A10, P4, P100, T4, dan V100).

  • Mendukung GPU sharing.

Virtual resource group

Kelompok sumber daya logis yang menggabungkan beberapa jenis sumber daya, seperti public resources, resource quotas, dan dedicated resource groups.

Penagihan didasarkan pada sumber daya yang dijadwalkan dan digunakan.

  • Men-deploy satu layanan di berbagai jenis sumber daya.

  • Mendukung prioritas penjadwalan.

Resource quota

General-purpose computing 2.0

Cocok untuk skenario produksi yang memerlukan sumber daya dedicated dan isolasi sumber daya.

Lingjun intelligent computing

Ideal untuk model besar atau skenario yang memerlukan perangkat keras berkinerja tinggi, seperti interkoneksi RDMA berkecepatan tinggi dan penyimpanan CPFS untuk komputasi cerdas.

Rekomendasi:

  • Pengujian dan pengembangan: Gunakan public resources untuk penagihan pay-as-you-go tanpa investasi awal. Ketersediaan sumber daya mungkin terbatas selama jam sibuk. Untuk informasi selengkapnya, lihat Apa yang harus saya lakukan jika public resources tidak mencukupi?

  • Lingkungan produksi (traffic stabil): Gunakan EAS dedicated resource group atau resource quota (General-purpose computing 2.0). Opsi ini menyediakan sumber daya dedicated, kinerja stabil, dan mendukung penagihan subscription untuk menekan biaya.

  • Lingkungan produksi (traffic fluktuatif): Gunakan virtual resource group. Dedicated resource group atau resource quota menyediakan garis dasar, sedangkan public resources menangani lonjakan traffic.

  • Model besar atau perangkat keras khusus: Gunakan resource quota (Lingjun intelligent computing) untuk mengakses perangkat keras berkinerja tinggi.

Pilih tipe instans

Pilih tipe instans CPU atau GPU berdasarkan ukuran model dan beban kerja inferensi Anda.

  • Spot instance: Saat menggunakan public resources, Anda dapat mengaktifkan mode spot dan menetapkan batas penawaran untuk menggunakan sumber daya idle dengan harga lebih rendah daripada instans reguler. Spot instance dapat ditarik kembali, sehingga paling cocok untuk tugas inferensi yang dapat mentolerir gangguan.

  • GPU driver version: Saat memilih instans GPU, Anda dapat menentukan versi GPU driver di bagian Features > Resource Configuration untuk memenuhi persyaratan waktu proses model atau framework tertentu.

Konfigurasikan sistem disk

Sistem disk menyimpan data temporary yang dihasilkan saat runtime. Konfigurasi default bervariasi tergantung jenis sumber daya:

  • Public resources: Sistem disk gratis sebesar 30 GiB disediakan. Penggunaan melebihi 30 GiB ditagih berdasarkan skema pay-as-you-go.

  • EAS resource group atau resource quota: Ukuran default sistem disk adalah 60 GiB. Jika Anda mengubah kapasitasnya, disk dialokasikan dari mesin host.

Konfigurasikan memori bersama

Memori bersama memungkinkan beberapa proses dalam satu kontainer membaca dan menulis ke area memori yang sama. Hal ini menghindari overhead penyalinan data dan cocok untuk skenario yang memerlukan komunikasi antar-proses yang efisien.

Jika Anda menggunakan framework inferensi multi-proses, seperti vLLM tensor parallel atau inferensi konkuren multi-worker, kami merekomendasikan mengonfigurasi memori bersama yang cukup berdasarkan ukuran model Anda.

Tentukan jumlah replika

Jumlah replika adalah jumlah instans yang menjalankan layanan Anda. Kami merekomendasikan mengonfigurasi beberapa replika untuk menghindari single point of failure.

Konfigurasikan kebijakan penjadwalan

Saat menggunakan EAS resource group atau resource quota, Anda dapat menggunakan kebijakan berikut untuk mengoptimalkan penjadwalan sumber daya:

  • Elastic Resource Pool: Saat sumber daya Anda sendiri tidak mencukupi, sistem secara otomatis melakukan scale-out dengan menggunakan public resources berbasis pay-as-you-go untuk menangani lonjakan traffic. Selama scale-in, instans yang menggunakan public resources akan dilepas terlebih dahulu untuk mengurangi biaya. Untuk informasi selengkapnya, lihat Elastic resource pool.

  • Specify Node Scheduling: Kebijakan ini membatasi layanan agar hanya berjalan di node tertentu. Jika tidak ada node yang ditentukan, semua node yang tidak dikecualikan memenuhi syarat untuk penjadwalan.

  • High-priority Resource Rescheduling: Jika Anda mengaktifkan fitur ini, sistem secara berkala memigrasikan instans dari sumber daya berprioritas rendah, seperti public resources, ke sumber daya berprioritas tinggi, seperti dedicated resource group, untuk mengoptimalkan biaya. Fitur ini berguna ketika pembaruan bergulir (rolling updates) sementara menjadwalkan instans ke public resources, atau ketika Anda ingin memigrasikan instans reguler ke spot instances untuk mengurangi biaya.

  • Resource Affinity Scheduling: Saat menggunakan sumber daya Lingjun intelligent computing dari public resource group untuk inferensi terdistribusi multi-node, kami merekomendasikan mengaktifkan resource affinity scheduling di bagian Features. Ini menjadwalkan instans ke domain jaringan hyper-node yang Anda tentukan di HPN Zone untuk memastikan interkoneksi RDMA berkecepatan tinggi.

GPU sharing dan inferensi terdistribusi

  • GPU sharing: Membagi daya komputasi dan memori dari satu kartu GPU tunggal di antara beberapa instans layanan untuk meningkatkan pemanfaatan GPU dan mengurangi biaya penerapan. Fitur ini ideal untuk model yang lebih kecil atau workload dengan beban inferensi rendah. GPU sharing hanya dapat diaktifkan saat menggunakan EAS resource group atau resource quota.

  • Multi-node distributed inference: Men-deploy satu instans layanan di beberapa mesin. Hal ini mengatasi batasan perangkat keras node tunggal dan mendukung penerapan serta pengoperasian model ultra-besar.

FAQ

Penggunaan dan batasan sumber daya

T: Mengapa instans 1-vCPU, 2-GB tidak tersedia?

Tipe instans 1 vCPU, 2 GB memori tidak tersedia untuk menjamin stabilitas layanan. Komponen sistem mengonsumsi sebagian sumber daya setiap node. Pada instans yang lebih kecil, hal ini menyisakan sumber daya yang tidak mencukupi untuk layanan Anda.

T: Bagaimana cara memperkirakan jumlah model per instans PAI-EAS?

Jumlah model yang dapat Anda deploy pada satu instans PAI-EAS bergantung pada kebutuhan sumber daya tiap model, seperti core CPU, memori GPU, dan memori sistem. Tidak ada batas yang telah ditentukan. Kami merekomendasikan memilih tipe instans berdasarkan kebutuhan aktual model Anda, atau men-deploy model berbeda pada instans terpisah.

T: Berapa jumlah maksimum layanan yang dapat di-deploy di EAS?

Jumlah maksimum instans layanan yang dapat Anda deploy bergantung pada sisa sumber daya yang tersedia. Anda dapat melihat kapasitas tersisa untuk setiap mesin di daftar mesin kelompok sumber daya Anda di Konsol. Untuk informasi selengkapnya, lihat Gunakan EAS resource group.

Jika Anda mengalokasikan tugas berdasarkan core CPU, jumlah maksimum instans yang dapat Anda deploy adalah (Total Core CPU - 1) / Core yang digunakan per instans.

T: Instans EAS mana yang sebanding dengan RTX 4090?

ecs.gn8ia-2x.8xlarge memberikan kinerja yang mendekati RTX 4090.

T: Berapa konkurensi maksimum untuk model yang di-deploy?

Konkurensi maksimum untuk layanan model bergantung pada berbagai faktor, termasuk model, kasus penggunaan, dan konfigurasi sumber daya. Kami merekomendasikan melakukan uji stres untuk mengukur kinerja layanan Anda.

Manajemen dedicated resource group

T: Mengapa dedicated resource group saya berada dalam status "Scaling Out" dalam waktu lama?

Hal ini biasanya terjadi karena kapasitas tidak mencukupi di wilayah saat ini. Untuk instans subscription, jika pembuatan gagal karena kapasitas tidak mencukupi, sistem secara otomatis membuat pesanan pengembalian dana dan mengembalikan pembayaran ke metode pembayaran asal.

T: Bagaimana cara menghapus instans subscription?

Buka halaman Alibaba Cloud Unsubscribe Resources untuk berhenti berlangganan mesin dedicated EAS berbasis subscription yang tidak lagi Anda perlukan. Konfigurasikan parameter berikut:

  • Type: Pilih Partial refund.

  • Product name: Pilih EAS Dedicated Machine Subscription.

Klik Search untuk menemukan sumber daya yang ingin Anda batalkan langgannya. Lalu, klik Unsubscribe resource di kolom Actions dan ikuti petunjuk di layar untuk menyelesaikan proses.

T: Apakah data instans tetap disimpan setelah berhenti berlangganan?

Tidak, data instans layanan tidak disimpan.

Manajemen sistem disk

T: Bagaimana cara menambah ukuran sistem disk?

Anda dapat mengonfigurasi atau memperluas sistem disk untuk layanan dengan salah satu cara berikut:

  1. Konfigurasi Konsol: Saat membuat atau memperbarui layanan, di bagian Resource Information, atur ukuran Sistem Disk di bawah Configure a system disk.

  2. Konfigurasi JSON: Di file konfigurasi JSON layanan, ubah nilai metadata field disk.

    "metadata": {"disk": "40Gi"}
Catatan

Jika Anda menggunakan dedicated resource group, ukuran sistem disk yang dikonfigurasi tidak boleh melebihi ukuran sistem disk node tersebut. Jika Anda memerlukan sistem disk yang lebih besar, Anda harus melepas node saat ini dan membeli ulang node dengan sistem disk yang lebih besar.