EAS (Elastic Algorithm Service) memungkinkan Anda menerapkan model yang telah dilatih sebagai layanan inferensi online atau aplikasi web AI. EAS mendukung sumber daya heterogen dan menggabungkan fitur-fitur seperti auto scaling, uji stres satu klik, rilis canary, dan pemantauan waktu nyata untuk memastikan stabilitas layanan dalam skenario konkurensi tinggi dengan biaya lebih rendah.
Arsitektur produk

Kemampuan inti
EAS mencakup seluruh alur kerja, mulai dari manajemen sumber daya dan penerapan model hingga O&M layanan.
Manajemen sumber daya dan biaya yang fleksibel
-
Dukungan perangkat keras heterogen: Mendukung instans CPU, GPU, dan akselerator AI khusus untuk memenuhi kebutuhan performa berbagai model.
-
Optimasi biaya: Mendukung preemptible instances untuk mengurangi biaya komputasi secara signifikan. Dengan scheduled scaling, Anda dapat menentukan kebijakan berdasarkan siklus bisnis guna mengontrol alokasi sumber daya secara tepat.
-
Kolam sumber daya elastis: Saat kelompok sumber daya dedicated telah sepenuhnya dimanfaatkan, EAS secara otomatis menjadwalkan instans baru ke kelompok sumber daya publik, sehingga menyeimbangkan antara pengendalian biaya dan stabilitas layanan.
Stabilitas dan ketersediaan tinggi
-
Skalabilitas elastis: Menyesuaikan jumlah replica layanan secara otomatis berdasarkan beban kerja waktu nyata untuk mengatasi lonjakan trafik tak terduga, mencegah pemanfaatan sumber daya yang tidak optimal atau kelebihan beban layanan.
-
Mekanisme ketersediaan tinggi: Pemulihan kesalahan otomatis memastikan kelangsungan layanan. Sumber daya dedicated diisolasi secara fisik, sehingga menghilangkan risiko preemption sumber daya.
-
Rilis aman: Mendukung canary release, memungkinkan Anda mengarahkan sebagian persentase trafik ke versi baru untuk validasi. Fitur ini juga mendukung traffic mirroring, yang menyalin trafik produksi ke layanan pengujian guna memverifikasi keandalan tanpa memengaruhi permintaan pengguna sesungguhnya.
Penerapan dan O&M yang efisien
-
Uji stres satu klik: Meningkatkan beban secara dinamis untuk menguji batas performa layanan. Anda dapat melihat data pemantauan per detik dan laporan uji stres secara waktu nyata guna mengevaluasi kemampuan layanan dengan cepat.
-
Pemantauan waktu nyata: Menyediakan real-time monitoring metrik utama seperti QPS, waktu respons, dan utilisasi CPU. Anda juga dapat aktifkan service monitoring alerts untuk tetap memantau kondisi kesehatan layanan Anda.
-
Beberapa metode penerapan: Mendukung penerapan layanan menggunakan runtime image (disarankan) atau processor deployment untuk menyesuaikan dengan berbagai tumpukan teknologi.
Mode inferensi beragam
-
Inferensi sinkron waktu nyata: Menawarkan throughput tinggi dan latensi rendah, cocok untuk skenario sensitif terhadap latensi seperti rekomendasi pencarian dan chatbot percakapan.
-
Inferensi asinkron hampir waktu nyata: Dilengkapi message queue bawaan, ideal untuk tugas berdurasi panjang seperti pembuatan gambar dari teks dan pemrosesan video. Fitur ini mendukung auto scaling berdasarkan antrian backlog guna mencegah penumpukan permintaan.
-
Inferensi batch offline: Cocok untuk skenario pemrosesan batch yang tidak sensitif terhadap waktu respons, seperti konversi batch data suara. Fitur ini juga mendukung preemptible instances untuk mengurangi biaya.
Prosedur
Langkah 1: Siapkan sumber daya dan file
-
Siapkan sumber daya inferensi: Pilih tipe sumber daya EAS yang sesuai berdasarkan ukuran model, kebutuhan konkurensi, dan anggaran Anda. Untuk panduan pemilihan dan pembelian sumber daya, lihat Ikhtisar sumber daya penerapan EAS.
CatatanAnda dapat langsung menggunakan sumber daya publik tanpa perlu membelinya terlebih dahulu. Jenis sumber daya lain, seperti kelompok sumber daya EAS dan kuota sumber daya, harus dibeli sebelum digunakan.
-
Siapkan file: Unggah model yang telah dilatih, kode pemrosesan, dan dependensinya ke layanan penyimpanan cloud seperti Object Storage Service (OSS). Anda kemudian dapat mengakses file-file tersebut dari layanan Anda melalui storage mounting.
Langkah 2: Terapkan layanan
Anda dapat menerapkan dan mengelola layanan menggunakan Konsol, tool baris perintah EASCMD, atau SDK. Untuk informasi lebih lanjut, lihat Penerapan layanan.
-
Konsol: Menyediakan opsi Custom Deployment dan penerapan berbasis skenario yang mudah digunakan, ideal untuk pemula. Untuk model yang tidak memiliki solusi penerapan baku di EAS, seperti model pihak ketiga MinerU, Anda dapat membuat layanan menggunakan fitur Custom Deployment. Untuk melakukannya, Anda harus menyiapkan model dan file konfigurasi serta mengunggahnya ke layanan penyimpanan cloud seperti OSS.
-
Tool baris perintah EASCMD: Mendukung operasi seperti membuat, memperbarui, dan melihat layanan. Cocok untuk pengembang algoritma yang sudah familiar dengan EAS.
-
SDK: Ideal untuk penjadwalan dan O&M terpadu dalam skala besar.
Langkah 3: Panggil dan uji stres layanan
-
Aplikasi web: Jika Anda menerapkan layanan sebagai aplikasi web AI, Anda dapat langsung membuka halaman interaktif di browser untuk mengujinya.
-
Layanan API: Anda dapat menggunakan fitur online debugging untuk memverifikasi fungsionalitas layanan, atau memanggil API secara sinkron maupun asinkron. Untuk informasi lebih lanjut, lihat Pemanggilan layanan.
-
Uji stres layanan: Anda dapat menggunakan tool bawaan one-click stress testing untuk menguji performa layanan di bawah tekanan. Untuk informasi lebih lanjut, lihat Uji stres layanan.
Langkah 4: Pantau dan kelola layanan
-
Pemantauan dan alert: Di daftar Inference Services, Anda dapat melihat status berjalan dan informasi kelompok sumber daya layanan Anda serta menyaringnya berdasarkan kelompok sumber daya. Kami menyarankan agar Anda aktifkan service monitoring alerts untuk memantau kondisi kesehatan layanan secara waktu nyata.
-
Skalabilitas elastis: Konfigurasikan kebijakan elastic scaling atau scheduled scaling sesuai kebutuhan bisnis Anda untuk mengelola sumber daya komputasi secara dinamis.
-
Pembaruan layanan: Di kolom Actions, klik Update untuk menerapkan versi baru. Setelah pembaruan selesai, Anda dapat melihat informasi versi atau beralih antar versi.
PeringatanPembaruan layanan menyebabkan gangguan sementara, yang dapat menyebabkan permintaan yang bergantung padanya gagal. Lakukan dengan hati-hati.
-
Migrasi layanan: Untuk memindahkan konfigurasi layanan EAS antar wilayah, gunakan tool baris perintah EASCMD untuk mengekspor konfigurasi layanan dari wilayah sumber. Anda kemudian dapat menggunakan konfigurasi yang diekspor tersebut untuk membuat layanan baru di wilayah tujuan.
Catatan penting
-
Jika layanan EAS tetap berada dalam status non-Running selama 180 hari berturut-turut, sistem akan menghapusnya secara otomatis.
-
EAS mendukung wilayah yang tercantum dalam Wilayah dan zona ketersediaan.
Penagihan
Untuk informasi lebih lanjut, lihat Penagihan Elastic Algorithm Service (EAS).
Mulai cepat
Kasus penggunaan
-
LLM: Terapkan large language model (LLM) | Terapkan model Mixture-of-Experts (MoE) menggunakan expert parallelism dan pipeline-data parallelism separation
-
AIGC: Pembuatan video AI - Terapkan ComfyUI | Pembuatan seni AI - Terapkan SD-WebUI
-
Lainnya: Akses gateway khusus yang dikelola sepenuhnya lintas VPC | Praktik terbaik untuk PAI-EAS Spot
FAQ
T: Sumber daya dedicated vs. sumber daya publik?
-
Sumber daya publik: Cocok untuk pengembangan, pengujian, atau aplikasi skala kecil yang sensitif terhadap biaya dan dapat mentoleransi fluktuasi performa. Biayanya rendah, tetapi mungkin mengalami konflik sumber daya selama jam sibuk.
-
Sumber daya dedicated: Ideal untuk lingkungan produksi yang memerlukan stabilitas dan performa tinggi. Sumber daya ini diisolasi secara fisik, sehingga menghilangkan risiko preemption sumber daya. Fitur kolam sumber daya elastis memungkinkan beban kerja meluap ke sumber daya publik saat kapasitas dedicated habis, sehingga menyeimbangkan biaya dan stabilitas selama jam sibuk. Untuk memesan tipe instans dengan stok terbatas, Anda harus membelinya sebagai sumber daya dedicated.
T: EAS vs. layanan yang dikelola sendiri
EAS menyediakan managed O&M. Layanan ini secara otomatis menangani penjadwalan sumber daya, pemulihan kesalahan, dan pemantauan, serta menyertakan fitur bawaan seperti skalabilitas elastis dan rilis canary. Hal ini membebaskan pengembang untuk fokus pada pengembangan model, mengurangi beban operasional, dan mempercepat waktu peluncuran ke pasar.
Referensi
-
Dokumentasi API: Ikhtisar API
-
FAQ: FAQ tentang EAS