All Products
Search
Document Center

Platform For AI:Praktik terbaik untuk PAI-EAS Spot

Last Updated:Apr 04, 2026

PAI-EAS Spot adalah solusi hemat biaya untuk inferensi online yang memanfaatkan spot instans. Solusi ini ideal untuk aplikasi yang sensitif terhadap biaya dan dapat mentoleransi latensi respons tertentu. Panduan ini menyajikan praktik terbaik untuk mengoptimalkan penggunaan sumber daya, menekan biaya, serta menjaga stabilitas layanan.

Kasus penggunaan

  • Beban kerja non-kritis: Aplikasi di mana gangguan layanan sesekali memiliki dampak minimal.

  • Aplikasi toleransi kesalahan: Aplikasi yang mampu menangani ketidaktersediaan sementara melalui mekanisme retry atau toleransi kesalahan lainnya.

  • Proyek yang sensitif terhadap biaya: Proyek di mana pengurangan biaya operasional menjadi prioritas utama.

Konfigurasi layanan spot

  1. Masuk ke Konsol PAI. Pilih Wilayah di bagian atas halaman, lalu pilih ruang kerja yang diinginkan dan klik Elastic Algorithm Service (EAS).

  2. Pada bagian Resource Deployment, pilih Public Resources sebagai tipe sumber daya dan pilih tipe instans. Kami merekomendasikan penggunaan tipe instans seri L atau H. Aktifkan mode bidding dan masukkan harga bid. Anda dapat mengklik kurva harga historis untuk melihat tren harga pasar tipe instans tersebut selama 48 jam terakhir guna membantu menentukan harga bid Anda.

    Spot_部署

    Penting
    • Harga bid Anda adalah harga maksimum yang bersedia Anda bayar, bukan harga akhir yang dikenakan. Anda akan ditagih berdasarkan harga pasar saat ini selama harganya berada di bawah harga bid Anda. Hal ini memastikan instans Anda tidak ditarik kembali akibat fluktuasi harga, sementara Anda hanya membayar harga pasar.

    • Kami sangat menyarankan menetapkan harga bid sebesar 20% dari harga daftar. Misalnya, jika harga daftar pay-as-you-go untuk instans L20 dengan 8 core dan satu kartu adalah 14,4 CNY/jam, harga pasar untuk spot instans kemungkinan besar tidak akan melebihi 20% dari harga daftar tersebut (2,88 CNY/jam). Strategi ini memungkinkan Anda mendapatkan penghematan biaya signifikan sekaligus menjaga ketersediaan sumber daya yang stabil. Untuk informasi lebih lanjut, lihat Pilih spot instans.

    • Kami juga merekomendasikan Anda mengonfigurasi instans sesuai permintaan sebagai cadangan untuk mencegah kegagalan penerapan jika alokasi spot instans gagal.

  3. Setelah layanan diterapkan, Anda dapat memantau fluktuasi harga tipe instans selama 48 jam terakhir pada halaman detail layanan EAS. Hal ini membantu Anda memahami dan mengelola variasi biaya.Spot价格曲线

Penarikan kembali spot instans dan toleransi kesalahan

Penarikan kembali oleh EAS

EAS menerima notifikasi peringatan sekitar lima menit sebelum spot instans ditarik kembali. Setelah menerima notifikasi tersebut, EAS memulai shutdown yang mulus untuk memigrasikan traffic dari instans tersebut dan mencegah gangguan layanan. Secara bersamaan, EAS secara otomatis meluncurkan instans baru dan mencoba menerapkannya berdasarkan urutan tipe instans dalam konfigurasi Anda. Proses ini meminimalkan gangguan akibat penarikan kembali dan memastikan kelangsungan layanan.

Penting

Untuk memastikan kelangsungan dan stabilitas layanan, kami merekomendasikan Anda mengonfigurasi instans sesuai permintaan pay-as-you-go sebagai cadangan jika semua spot instans tidak tersedia.

Kembali ke spot instans

Jika spot instans ditarik kembali dan digantikan oleh instans sesuai permintaan, Anda dapat menggunakan fitur "Rebuild Instance" untuk mengalihkan kembali instans tersebut ke spot instans setelah stok spot instans pulih.

Gunakan fitur Rebuild Instance untuk melepaskan sumber daya instans dan membuat ulang instans dengan konfigurasi yang sama:

Spot_实例重建

Strategi konfigurasi yang direkomendasikan

Saat spot instans akan ditarik kembali, EAS memulai shutdown yang mulus sekaligus meluncurkan instans pengganti. Untuk meningkatkan stabilitas dan keandalan layanan serta mempercepat startup instans baru, kami merekomendasikan strategi konfigurasi berikut.

Konfigurasi beberapa tipe instans

Untuk meningkatkan stabilitas dan keandalan, kami merekomendasikan memilih beberapa tipe instans. Yang terpenting, sertakan setidaknya satu instans sesuai permintaan (dengan mode bidding dimatikan) dalam daftar konfigurasi Anda sebagai cadangan. EAS mencoba menerapkan instans secara berurutan berdasarkan urutan yang Anda tentukan, sehingga meningkatkan kemungkinan penerapan dan operasi yang stabil. Untuk informasi lebih lanjut, lihat Pilih beberapa tipe instans.

spot_多规格

Konfigurasi cache memori direktori lokal

Untuk mempercepat pemuatan file model pada instans baru setelah spot instans ditarik kembali, konfigurasikan cache memori direktori lokal. Fitur ini menggunakan memori node cadangan untuk menyimpan cache file model. Instans baru kemudian dapat memuat model dari cache tersebut alih-alih dari sumber data yang dimount, sehingga mengurangi waktu startup dan meminimalkan downtime akibat penarikan kembali spot instans.

Kami merekomendasikan Anda mengaktifkan Memory Caching saat pembuatan layanan untuk meningkatkan efisiensi skala keluar instans. Untuk informasi lebih lanjut, lihat Akselerasi caching model.

Spot_内存缓存加速

Tabel berikut menunjukkan efek akselerasi setelah mengaktifkan memory caching (cachefs). Mengambil contoh model Stable Diffusion, ketika memory caching diaktifkan, instans baru dapat memuat model langsung dari memori instans lain dalam layanan tersebut (remote hit cachefs) selama skala keluar. Hal ini secara signifikan mengurangi waktu pemuatan model dibandingkan dengan membaca langsung dari direktori OSS yang dimount.

Model

Ukuran model

Waktu pemuatan model (detik)

OSS mount

cachefs remote hit

anything-v4.5.safetensors

7,2 GB

89,88

15,18

Anything-v5.0-PRT-RE.safetensors

2,0 GB

16,73

5,46

cetusMix_Coda2.safetensors

3,6 GB

24,76

7,13

chilloutmix_NiPrunedFp32Fix.safetensors

4,0 GB

48,79

8,47

CounterfeitV30_v30.safetensors

4,0 GB

64,99

7,94

deliberate_v2.safetensors

2,0 GB

16,33

5,55

DreamShaper_6_NoVae.safetensors

5,6 GB

71,78

10,17

pastelmix-fp32.ckpt

4,0 GB

43,88

9,23

revAnimated_v122.safetensors

4,0 GB

69,38

3,20

Gunakan ACR Enterprise Edition

Untuk mempercepat proses pulling image pada instans baru setelah penarikan kembali, gunakan ACR Enterprise Edition dengan akselerasi image yang diaktifkan. Terapkan layanan EAS Anda menggunakan image yang dipercepat. Buat URL image yang dipercepat dengan menambahkan akhiran _accelerated pada URL image standar. Saat menerapkan layanan, pastikan Anda memilih VPC yang digunakan oleh instans ACR Enterprise Edition Anda.

Pada instans ACR Enterprise Edition Anda, pilih Standard untuk Instance Type. Saat membuat repository image, aktifkan akselerasi image untuk meningkatkan efisiensi skala keluar instans baru. Untuk informasi lebih lanjut, lihat Akselerasi image.

Gambar berikut menunjukkan konfigurasi image untuk penerapan kustom di EAS:EAS_加速镜像

Beli tipe instans ACR Edisi Standar:

ACR_购买

Aktifkan akselerasi image saat membuat repository image:

ACR_创建仓库

Kombinasikan dengan Auto Scaling

Untuk beban kerja dengan fluktuasi signifikan, kami merekomendasikan Anda mengaktifkan horizontal auto scaling. Anda dapat menerapkan strategi hibrida berupa kelompok sumber daya khusus untuk kapasitas garis dasar, spot instans untuk skalabilitas elastis, dan instans sesuai permintaan sebagai cadangan. Pendekatan ini memastikan operasi layanan yang lancar dan efisiensi biaya. Strategi yang direkomendasikan adalah sebagai berikut:

  1. Beli kelompok sumber daya khusus berlangganan atau pay-as-you-go untuk menetapkan kapasitas garis dasar bagi layanan Anda. Di Konsol, konfigurasikan kebutuhan GPU, CPU, dan memori untuk kelompok sumber daya khusus guna memastikan layanan dapat dimulai.

  2. Aktifkan Elastic Resource Pool dan konfigurasikan beberapa tipe instans. Beri prioritas pada spot instans dalam daftar, dengan instans sesuai permintaan sebagai cadangan terakhir. Strategi ini memungkinkan layanan melakukan skala keluar menggunakan spot instans hemat biaya saat puncak traffic. Jika spot instans tidak tersedia, layanan secara mulus beralih ke instans sesuai permintaan, sehingga menjamin efisiensi biaya dan stabilitas layanan.

    eas弹性资源池

  3. Setelah layanan diterapkan, buka halaman detail layanan dan aktifkan Auto Scaling horizontal berdasarkan metrik bisnis Anda. Anda dapat mengonfigurasi kebijakan scaling berdasarkan metrik seperti QPS, CPU utilization, GPU utilization, dan queue length. Anda juga dapat menggunakan metrik kustom untuk auto scaling.

    image.png

    Anda juga dapat mengaktifkan Scheduled Scaling untuk menangani pola lalu lintas yang dapat diprediksi.

    image.png

Instans pertama kali dibuat menggunakan sumber daya dari kelompok sumber daya khusus. Jika diperlukan sumber daya tambahan, sistem kemudian menggunakan sumber daya dari Elastic Resource Pool, dengan memproses tipe instans sesuai urutan yang Anda tentukan.

  • Misalnya, jika kelompok sumber daya khusus telah sepenuhnya digunakan dan Anda perlu membuat beberapa instans di Elastic Resource Pool, sistem pertama-tama memeriksa stok untuk ecs.gn8v-8x.48xlarge. Jika stok tidak mencukupi, sistem memeriksa ecs.gn8is-8x.32large. Jika keduanya tidak mencukupi, sistem menggunakan ml.gu7i.c8m30.1-gu30 untuk membuat instans yang tersisa.

  • Misalnya, asumsikan layanan Anda berjalan pada 2 instans di kelompok sumber daya khusus dan perlu melakukan skala keluar sebanyak 8 instans tambahan. Alokasi untuk 8 instans baru tersebut mungkin berupa: 3 spot instans ecs.gn8v-8x.48xlarge, 2 spot instans ecs.gn8is-8x.32large, dan 3 instans sesuai permintaan ml.gu7i.c8m30.1-gu30, berdasarkan ketersediaan dan konfigurasi Anda.

Untuk informasi lebih lanjut tentang cara mengonfigurasi skalabilitas elastis di EAS, lihat topik-topik berikut: