EAS (Elastic Algorithm Service) memungkinkan Anda menerapkan model yang telah dilatih sebagai layanan inferensi online atau aplikasi web AI. EAS mendukung sumber daya heterogen dan menggabungkan fitur-fitur seperti auto scaling, uji stres satu klik, rilis canary, dan pemantauan waktu nyata untuk memastikan stabilitas layanan dalam skenario konkurensi tinggi dengan biaya lebih rendah.  

## **Arsitektur produk**
![d117f374f4066e24babc9d25c306fbbc.png](https://help-static-aliyun-doc.aliyuncs.com/assets/img/id-ID/8753430571/p706185.png)

## Kemampuan inti
EAS mencakup seluruh alur kerja, mulai dari manajemen sumber daya dan penerapan model hingga O\&M layanan.

### Manajemen sumber daya dan biaya yang fleksibel

EAS adalah layanan penerapan dan inferensi model yang sepenuhnya dikelola, bukan server tradisional yang harus Anda sediakan dan kelola sendiri. Layanan ini berjalan di atas sumber daya komputasi elastis Alibaba Cloud, seperti instans **ECS** dan instans **GPU**, sehingga Anda tidak perlu membeli atau mengelola server dasar.

* **Dukungan perangkat keras heterogen** : Mendukung CPU, GPU, dan instans akselerator AI khusus seperti **GU** dan **PPU** untuk memenuhi kebutuhan performa berbagai model. Saat menerapkan layanan, Anda dapat memilih spesifikasi sumber daya tertentu sesuai kebutuhan model Anda.

* **Optimasi biaya** : Mendukung **preemptible instances** untuk mengurangi biaya komputasi secara signifikan. Dengan **scheduled scaling**, Anda dapat menetapkan kebijakan berdasarkan siklus bisnis guna mengontrol alokasi sumber daya secara tepat.

* **Kolam sumber daya elastis** : Ketika kelompok sumber daya **dedicated** telah terpakai penuh, EAS secara otomatis menjadwalkan instans baru ke kelompok sumber daya publik, menyeimbangkan antara pengendalian biaya dan stabilitas layanan.

### Stabilitas dan ketersediaan tinggi

* **Elastic scaling** : Menyesuaikan jumlah **replica** layanan secara otomatis berdasarkan beban kerja waktu nyata untuk mengatasi lonjakan trafik tak terduga, mencegah pemanfaatan sumber daya yang kurang optimal atau overload layanan.

* **Mekanisme ketersediaan tinggi** : Pemulihan kesalahan otomatis memastikan kelangsungan layanan. Sumber daya **dedicated** diisolasi secara fisik, menghilangkan risiko preemption sumber daya.

* **Rilis aman** : Mendukung **canary release** , memungkinkan Anda mengarahkan sebagian persen trafik ke versi baru untuk validasi. Layanan ini juga mendukung **traffic mirroring**, yang menyalin trafik produksi ke layanan pengujian guna memverifikasi keandalan tanpa memengaruhi permintaan pengguna sesungguhnya.

### Penerapan dan O\&M yang efisien

* **Uji stres satu klik**: Meningkatkan beban secara dinamis untuk menguji batas performa layanan. Anda dapat melihat data pemantauan per detik dan laporan uji stres secara waktu nyata untuk mengevaluasi kemampuan layanan dengan cepat.

* **Pemantauan waktu nyata** : Menyediakan **real-time monitoring** metrik utama seperti QPS, waktu respons, dan utilisasi CPU. Anda juga dapat **enable service monitoring alerts** untuk tetap memantau kondisi kesehatan layanan Anda.

* **Metode penerapan beragam** : Mendukung penerapan layanan menggunakan **runtime image** (disarankan) atau **processor deployment** agar sesuai dengan berbagai tumpukan teknologi.

### Mode inferensi beragam

* **Inferensi sinkron waktu nyata** : Menawarkan throughput tinggi dan latensi rendah, cocok untuk skenario sensitif terhadap latensi seperti rekomendasi pencarian dan chatbot percakapan. Untuk model bahasa besar (LLM) dan model generatif lainnya, menunggu seluruh respons selesai dihasilkan sebelum dikembalikan dapat menimbulkan kesan latensi yang kuat. Kami menyarankan Anda mengaktifkan **streaming output**, yang mengembalikan token ke klien secara waktu nyata saat dihasilkan dan secara signifikan meningkatkan responsivitas yang dirasakan. Jika performa masih belum memenuhi ekspektasi setelah Anda mengaktifkan streaming output, Anda dapat menguji instans kelompok sumber daya publik dengan spesifikasi lebih tinggi untuk perbandingan.

* **Inferensi asinkron hampir waktu nyata** : Dilengkapi **message queue** bawaan, ideal untuk tugas berdurasi panjang seperti pembuatan teks-ke-gambar dan pemrosesan video. Mendukung **auto scaling** berdasarkan antrian backlog untuk mencegah penumpukan permintaan.

* **Inferensi batch offline**: Cocok untuk skenario pemrosesan batch yang tidak sensitif terhadap waktu respons, seperti konversi batch data suara. Juga mendukung preemptible instances untuk mengurangi biaya.

## Prosedur
### Langkah 1: Siapkan sumber daya dan file

1. **Siapkan sumber daya inferensi** : Pilih tipe sumber daya EAS yang sesuai berdasarkan ukuran model, kebutuhan konkurensi, dan anggaran Anda. Untuk panduan pemilihan dan pembelian sumber daya, lihat [Ikhtisar sumber daya penerapan EAS](https://www.alibabacloud.com/help/id/document_detail/162900.html).

   **Catatan**

   Anda dapat langsung menggunakan sumber daya publik tanpa perlu membelinya terlebih dahulu. Jenis sumber daya lain, seperti kelompok sumber daya EAS dan kuota sumber daya, harus dibeli sebelum digunakan.
2. **Siapkan file** : Unggah model yang telah dilatih, kode pemrosesan, dan dependensinya ke layanan penyimpanan cloud seperti Object Storage Service (OSS). Anda kemudian dapat mengakses file-file tersebut dari layanan Anda melalui [storage mounting](https://www.alibabacloud.com/help/id/document_detail/413364.html#task-2192589). File model yang disimpan di OSS tidak terikat pada sistem operasi tertentu---Anda dapat mengunduhnya baik di **Windows** maupun **Linux** . Namun, apakah layanan Anda dapat memuat dan menjalankan model tersebut juga bergantung pada dukungan sistem operasi dari framework inferensi yang Anda gunakan, seperti **vLLM** atau **Triton Server**. Sebagian besar framework inferensi utama memberikan prioritas dukungan Linux, sehingga jika Anda berencana menggunakan Windows, periksa dokumentasi resmi framework inferensi Anda terlebih dahulu untuk memastikan persyaratan sistem operasinya.

### Langkah 2: Terapkan layanan

Anda dapat menerapkan dan mengelola layanan menggunakan Konsol, [tool baris perintah EASCMD](https://www.alibabacloud.com/help/id/document_detail/195363.html), atau SDK. Untuk informasi lebih lanjut, lihat [Penerapan layanan](https://www.alibabacloud.com/help/id/document_detail/110981.html).

* Konsol: Menyediakan opsi [Custom Deployment](https://www.alibabacloud.com/help/id/document_detail/110985.html) dan [penerapan berbasis skenario](https://www.alibabacloud.com/help/id/document_detail/2747102.html) yang mudah digunakan, ideal bagi pemula. Untuk model yang tidak memiliki solusi penerapan bawaan di EAS, seperti model pihak ketiga MinerU, Anda dapat membuat layanan menggunakan fitur **Custom Deployment**. Untuk melakukannya, Anda harus menyiapkan model dan file konfigurasi serta mengunggahnya ke layanan penyimpanan cloud seperti OSS.

* Tool baris perintah EASCMD: Mendukung operasi seperti membuat, memperbarui, dan melihat layanan. Cocok untuk pengembang algoritma yang sudah familiar dengan EAS.

* SDK: Ideal untuk penjadwalan dan O\&M terpadu berskala besar.

### Langkah 3: Panggil dan uji stres layanan

* **Aplikasi web**: Jika Anda menerapkan layanan sebagai aplikasi web AI, Anda dapat membuka halaman interaktif langsung di browser untuk mengujinya.

* **Layanan API** : Anda dapat menggunakan fitur [online debugging](https://www.alibabacloud.com/help/id/document_detail/465150.html) untuk memverifikasi fungsionalitas layanan, atau memanggil API secara sinkron atau asinkron. Untuk informasi lebih lanjut, lihat [Pemanggilan layanan](https://www.alibabacloud.com/help/id/document_detail/111032.html).

* **Uji stres layanan** : Anda dapat menggunakan tool bawaan **one-click stress testing** untuk menguji performa layanan dalam kondisi beban tinggi. Untuk informasi lebih lanjut, lihat [Uji stres layanan](https://www.alibabacloud.com/help/id/document_detail/439715.html).

### Langkah 4: Pantau dan kelola layanan

1. **Pemantauan dan alert** : Di **daftar Inference Services** , Anda dapat melihat status berjalan, **service ID** , dan informasi kelompok sumber daya layanan Anda, serta menyaringnya berdasarkan kelompok sumber daya. Daftar ini juga merupakan tempat utama untuk mencari informasi **instance identity** layanan. Kami menyarankan Anda [enable service monitoring alerts](https://www.alibabacloud.com/help/id/document_detail/153919.html) untuk tetap memantau kondisi kesehatan layanan secara waktu nyata.

2. **Elastic scaling** : Konfigurasikan kebijakan **elastic scaling** atau **scheduled scaling** sesuai kebutuhan bisnis Anda untuk mengelola sumber daya komputasi secara dinamis. Anda dapat memeriksa mode penyebaran layanan saat ini di halaman detail layanan di Konsol PAI untuk melihat apakah layanan tersebut menggunakan **always-on instances** atau **elastic scaling** . Layanan yang menggunakan always-on instances berjalan dengan jumlah **replica** tetap, sedangkan layanan yang menggunakan elastic scaling menyesuaikan jumlah replica secara dinamis berdasarkan kebijakan yang dikonfigurasi.

3. **Pembaruan layanan** : Di kolom **Actions** , klik **Update** untuk menerapkan versi baru. Setelah pembaruan selesai, Anda dapat melihat **informasi versi** atau beralih antarversi.

   **Peringatan**

   Pembaruan layanan menyebabkan gangguan sementara, yang dapat menyebabkan permintaan dependen gagal. Lakukan dengan hati-hati.
4. **Migrasi layanan** : Untuk memigrasikan konfigurasi layanan EAS antarwilayah, gunakan [tool baris perintah EASCMD](https://www.alibabacloud.com/help/id/document_detail/195363.html) untuk mengekspor konfigurasi layanan dari wilayah sumber. Anda kemudian dapat menggunakan konfigurasi yang diekspor tersebut untuk membuat layanan baru di wilayah tujuan.

## Catatan penting
* Jika layanan EAS tetap berada dalam status non-**Running** selama 180 hari berturut-turut, sistem akan menghapusnya secara otomatis.

* EAS mendukung wilayah yang tercantum dalam [Wilayah dan zona ketersediaan](https://www.alibabacloud.com/help/id/document_detail/143986.html).

## Penagihan
Untuk informasi lebih lanjut, lihat [Penagihan Elastic Algorithm Service (EAS)](https://www.alibabacloud.com/help/id/document_detail/144261.html#concept-1822927).

## Mulai cepat
Lihat [Panduan mulai cepat Elastic Algorithm Service (EAS)](https://www.alibabacloud.com/help/id/document_detail/2881460.html).

## Kasus penggunaan
* LLM: [Terapkan model bahasa besar (LLM)](https://www.alibabacloud.com/help/id/document_detail/2841373.html) \| [Terapkan model Mixture-of-Experts (MoE) menggunakan expert parallelism dan pemisahan pipeline-data parallelism](https://www.alibabacloud.com/help/id/document_detail/2871964.html)

* AIGC: [Pembuatan video AI - Terapkan ComfyUI](https://www.alibabacloud.com/help/id/document_detail/2747103.html) \| [Pembuatan seni AI - Terapkan SD-WebUI](https://www.alibabacloud.com/help/id/document_detail/2807792.html)

* Lainnya: [Akses gateway khusus yang dikelola penuh lintas VPC](https://www.alibabacloud.com/help/id/document_detail/2848374.html) \| [Praktik terbaik untuk PAI-EAS Spot](https://www.alibabacloud.com/help/id/document_detail/2860126.html)

## FAQ
### T: Sumber daya dedicated vs. sumber daya publik?

* **Sumber daya publik**: Cocok untuk pengembangan, pengujian, atau aplikasi skala kecil yang sensitif terhadap biaya dan dapat mentolerir fluktuasi performa. Biayanya rendah tetapi mungkin mengalami konflik sumber daya selama jam sibuk.

* **Sumber daya dedicated** : Ideal untuk lingkungan produksi yang membutuhkan stabilitas dan performa tinggi. Sumber daya ini diisolasi secara fisik, menghilangkan risiko preemption sumber daya. Fitur kolam sumber daya elastis memungkinkan beban kerja meluap ke sumber daya publik saat kapasitas dedicated habis, menyeimbangkan biaya dan stabilitas selama jam sibuk. **Untuk memesan tipe instans dengan stok terbatas, Anda harus membelinya sebagai sumber daya dedicated.**

### P: EAS vs. layanan yang dikelola sendiri

EAS menyediakan **managed O\&M**. Layanan ini secara otomatis menangani penjadwalan sumber daya, pemulihan kesalahan, dan pemantauan, serta menyertakan fitur bawaan seperti elastic scaling dan canary release. Hal ini membebaskan pengembang untuk fokus pada pengembangan model, mengurangi beban operasional, dan mempercepat waktu peluncuran ke pasar.

### T: Bagaimana cara memeriksa ID instans atau ID kluster layanan EAS?

EAS (Elastic Algorithm Service) adalah layanan inferensi model online, bukan kluster kontainer ACK, sehingga tidak memiliki "ID kluster" tradisional. Untuk mengidentifikasi layanan, gunakan **nama layanan** atau **service ID** -nya. Untuk melihat nilai-nilai ini, login ke Konsol PAI, buka **Model Deployment (EAS)** , lalu buka daftar **Inference Services** , tempat Anda dapat melihat **nama layanan** dan **service ID** setiap layanan.

### T: Apakah ada batasan ukuran model yang dapat saya terapkan di PAI-EAS?

EAS tidak memberlakukan batasan tetap pada ukuran file model. Ukuran maksimum model yang dapat Anda terapkan bergantung pada kapasitas memori atau Memori GPU (VARM) dari spesifikasi sumber daya yang Anda pilih, serta kapasitas mount penyimpanan yang tersedia. Kami menyarankan Anda memilih tipe instans GPU atau CPU yang sesuai dengan jumlah parameter dan presisi model Anda, serta menggunakan storage mounting OSS untuk memuat file model besar. Jika model gagal dimuat karena terlalu besar, Anda dapat meningkatkan ke spesifikasi sumber daya yang lebih tinggi, atau menggunakan teknik optimasi seperti kuantisasi model atau pemuatan terbagi (sharded loading).

## Referensi
* **Dokumentasi API** : [Ikhtisar API](https://www.alibabacloud.com/help/id/document_detail/412076.html)

* **FAQ** : [FAQ tentang EAS](https://www.alibabacloud.com/help/id/document_detail/61703.html)