All Products
Search
Document Center

Platform For AI:FAQ EAS

Last Updated:Jun 24, 2026

Temukan jawaban atas pertanyaan umum mengenai layanan inferensi online EAS, termasuk masalah penerapan, kebijakan penskalaan, dan langkah troubleshooting.

Masalah penerapan dan status layanan

Setelah menerapkan layanan, periksa status instans, log, dan event pada daftar Overview di halaman Service instances untuk melakukan troubleshooting.

T: Layanan terjebak dalam status Waiting dalam waktu lama. Bagaimana cara memperbaikinya?

Setelah Anda menerapkan layanan, layanan tersebut memasuki status Waiting selama sumber daya dijadwalkan dan instans dimulai. Ketika semua instans berhasil dimulai, layanan beralih ke status Running. Skenario berikut dapat menyebabkan status Waiting yang berkepanjangan:

Skenario 1: Sumber daya tidak mencukupi — semua atau sebagian instans menunjukkan status Pending.

Artinya, kelompok sumber daya khusus tidak memiliki cukup sumber daya bebas untuk menjadwalkan instans.

Periksa apakah node dalam kelompok sumber daya khusus memiliki CPU, memori, dan GPU bebas yang mencukupi. Jika sebuah instans memerlukan 3 core dan 4 GB memori, setidaknya satu node dalam kelompok sumber daya harus memiliki 3 core dan 4 GB memori yang tersedia.

Penting

Untuk mencegah kegagalan sistem saat beban tinggi, setiap node mesin menyisihkan 1 core untuk komponen sistem. Kurangi 1 core dari total saat menghitung sumber daya yang dapat dijadwalkan.

Daftar node kelompok sumber daya khusus ditampilkan di bawah ini. Untuk melihat detail kelompok sumber daya, lihat Kelompok sumber daya EAS. Di halaman kelompok sumber daya, klik tab Machine list dan periksa kolom CPU (used/total), GPU (used/total), dan Memory (used/total) untuk melihat pemanfaatan sumber daya setiap node.

Skenario 2: Pemeriksaan kesehatan belum selesai — instans menunjukkan status Running, tetapi jumlah kontainer biasanya [0/1] atau [1/2].

Angka sebelum garis miring (/) menunjukkan jumlah kontainer yang berhasil dimulai. Angka setelahnya menunjukkan total kontainer. Saat Anda menerapkan layanan menggunakan custom image, EAS secara otomatis menyuntikkan kontainer sidecar untuk manajemen trafik dan pemantauan. Anda tidak perlu mengelola kontainer ini. Di konsol, jumlah total kontainer adalah 2: kontainer kustom Anda dan kontainer sidecar engine. Kedua kontainer harus mencapai status Ready sebelum instans dianggap telah dimulai dan mulai menerima trafik.

Skenario 3: Pemeriksaan kesehatan gagal — port yang dikonfigurasi di layanan EAS tidak sesuai dengan port di kode Anda.

Deskripsi masalah: Untuk layanan EAS yang menggunakan Flask (atau framework web lain seperti FastAPI, Sanic, atau Django) untuk menyajikan API, log menunjukkan Running on http://127.0.0.1:7000 setelah penerapan:

[2025-07-18 18:50:46] WARNING: Running pip as the 'root' user can result in broken permissions and conflicting behaviour with the system package manager, possibly rendering your system unusable. It is recommended to use a virtual environment instead: https://pip.pypa.io/warnings/venv. Use the --root-user-action option if you know what you are doing and want to suppress this warning.
[2025-07-18 18:50:50]  * Serving Flask app 'service'
[2025-07-18 18:50:50]  * Debug mode: off
[2025-07-18 18:50:50] WARNING: This is a development server. Do not use it in a production deployment. Use a production WSGI server instead.
[2025-07-18 18:50:50]  * Running on all addresses (0.0.0.0)
[2025-07-18 18:50:50]  * Running on http://127.0.0.1:7000
[2025-07-18 18:50:50]  * Running on http://xxx:7000
[2025-07-18 18:50:50] Press CTRL+C to quit

Namun konsol PAI tetap menunjukkan layanan EAS dalam status Waiting.

Akar penyebab: Worker layanan EAS gagal dalam pemeriksaan kesehatan. Worker mengekspos port 8089, tetapi Flask mendengarkan pada port 7000.

Solusi: Perbarui port dalam konfigurasi layanan EAS agar sesuai dengan port di kode Anda, lalu restart layanan.

T: Layanan berada dalam status Failed. Bagaimana cara memperbaikinya?

Layanan memasuki status Failed dalam dua situasi:

  • Saat penerapan: Jika sumber daya yang ditentukan saat penerapan (seperti path model) tidak ada, status layanan akan menampilkan alasan error. Pesan error biasanya menjelaskan penyebab kegagalan penerapan.

  • Saat startup: Jika layanan gagal setelah penerapan berhasil dan penjadwalan dimulai, status menunjukkan: Instance <network-test-5ff76448fd-h9dsn> not healthy: Instance crashed, please inspect instance log.

    Pesan ini berarti satu atau beberapa instans gagal dimulai. Periksa daftar Instans layanan di halaman Ikhtisar layanan untuk mengidentifikasi penyebab spesifiknya. Penyebab kegagalan umum meliputi:

    • Instans kehabisan memori saat startup dan sistem menghentikannya (OOMKilled). Terapkan ulang layanan dengan alokasi memori yang lebih tinggi. Di daftar instans, kolom Last status menunjukkan OOMKilled(247), yang mengindikasikan kontainer dihentikan karena melebihi batas memori. Periksa kolom Restart count dan Last exit reason untuk konfirmasi lebih lanjut.

    • Kesalahan kode menyebabkan crash saat startup. Dalam kasus ini, Last status menunjukkan Error(kode kesalahan). Klik Log di kolom Actions instans untuk meninjau log layanan dan mengidentifikasi kegagalan startup.

    • Gagal menarik gambar layanan. Lihat Apa yang harus dilakukan jika gagal menarik gambar (ImagePullBackOff)?

T: Apa yang harus dilakukan jika gagal menarik gambar (ImagePullBackOff)?

Jika kolom Last exit reason di daftar instans layanan menunjukkan ImagePullBackOff, penarikan gambar telah gagal. Jika ikon muncul di kolom Status, klik ikon tersebut untuk melihat alasan spesifiknya.

Penyebab umum kegagalan penarikan gambar tercantum di bawah ini:

Penyebab

Pesan error

Solusi

Disk space sistem tidak mencukupi

no space left on device

Perluas disk sistem.

Kontrol akses ACR tidak dikonfigurasi

no such host

Untuk menggunakan alamat gambar publik, aktifkan akses publik untuk ACR.

Untuk menggunakan alamat gambar privat:

  1. Tambahkan VPC seperti eas_vpc ke EAS.

  2. Tambahkan eas_vpc ke pengaturan kontrol akses instance Edisi Perusahaan ACR Anda. Lihat Konfigurasi kontrol akses VPC untuk ACR.

Kesalahan konfigurasi jaringan EAS

dial tcp * timeout

Untuk menggunakan alamat gambar publik, konfigurasi akses internet untuk EAS.

Kredensial tidak tersedia atau tidak valid

  • 401 Unauthorized

  • authorization failed

Jika instance Edisi Perusahaan ACR Anda tidak mengizinkan pull anonim dan Anda melakukan pull cross-region melalui internet, konfigurasikan username dan password registri gambar dalam konfigurasi layanan EAS. Lihat Konfigurasi kredensial akses.

Berdasarkan wilayah tempat registri gambar dan layanan EAS berada, gunakan panduan berikut:

  • Wilayah sama: Tarik gambar menggunakan alamat gambar privat.

  • Cross-region: ACR Edisi Personal hanya mendukung alamat gambar publik. Untuk ACR Edisi Perusahaan, pilih berdasarkan kebutuhan Anda:

    • Untuk keamanan dan keandalan yang lebih tinggi, gunakan alamat gambar privat. Ini memerlukan koneksi antar-VPC melalui CEN. Lihat Akses instance ACR Edisi Perusahaan secara cross-region atau dari IDC.

    • Untuk skenario yang lebih sederhana atau ketika konektivitas jaringan privat belum tersedia, gunakan alamat gambar publik sebagai opsi sementara. Unduhan melalui jaringan publik lebih lambat.

Catatan tambahan untuk ACR Edisi Perusahaan:

  • Konfigurasikan kontrol akses untuk akses VPC dan jaringan publik sesuai kebutuhan.

  • Jika repositori tidak mengizinkan pull anonim, pull cross-region melalui alamat publik memerlukan konfigurasi username dan password registri gambar dalam layanan EAS.

T: Layanan EAS restart otomatis setelah dihentikan. Apa yang terjadi?

Deskripsi masalah: Layanan EAS restart sendiri setelah dihentikan untuk periode tertentu.

Akar penyebab:

Layanan memiliki konfigurasi auto-scaling dengan jumlah instans minimum 0. Saat trafik berhenti untuk periode tertentu, jumlah instans secara otomatis melakukan scale-down ke 0. Jika permintaan tiba saat tidak ada instans yang tersedia akibat scale-down, EAS memicu scale-up secara otomatis — hal ini tidak memerlukan ambang batas scale-up yang dikonfigurasi tercapai.

Periksa event penerapan untuk pesan auto scaling guna mengonfirmasi apakah auto scale-up terjadi. Entri Service is now auto scaling di kolom informasi menunjukkan layanan dipicu untuk melakukan scale-up secara otomatis, setelah itu status event berubah dari Waiting melalui Scaling ke Running, dan jumlah instans yang tersedia berubah dari 0 menjadi 1.

Solusi:

  • Jika layanan tidak lagi diperlukan, hapuslah.

  • Untuk menyimpan layanan tetapi mencegah restart otomatis, hentikan melalui konsol atau dengan memanggil API StopService. Layanan yang dihentikan secara manual tidak akan melakukan scale-up saat trafik tiba.

  • Untuk mencegah auto-scaling menghentikan layanan, jangan atur jumlah instans minimum ke 0.

  • Nonaktifkan auto-scaling sepenuhnya jika kekhawatiran utama adalah trafik tak terduga yang memicu scale-up.

T: Startup PAI-EAS gagal dengan IoError(Os { code: 28, kind: StorageFull, message: "No space left on device" })

Deskripsi masalah:

[2024-10-21 20:59:33] serialize_file(_flatten(tensors), filename, metadata=metadata)

[2024-10-21 20:59:33] safetensors_rust.SafetensorError: Error while serializing: IoError(Os { code: 28, kind: StorageFull, message: "No space left on device" })

[2024-10-21 20:59:35] time="2024-10-21T12:59:35Z" level=info msg="program stopped with status:exit status 1" program=/bin/sh

Akar penyebab: Disk sistem instans EAS penuh karena file model yang besar. Hal ini mencegah layanan dimulai.

Solusi:

Opsi 1: Perluas disk sistem untuk instans EAS.

Opsi 2: Jika file model terlalu besar, simpan di penyimpanan eksternal (OSS, NAS, atau sejenisnya) dan baca menggunakan Mount penyimpanan.

T: Penerapan gagal dengan fail to start program with error:fork/exec /bin/sh:exec format error

exec format error berarti sistem operasi tidak dapat menjalankan binari target. Penyebab paling umum adalah ketidaksesuaian arsitektur CPU antara binari atau gambar kontainer dengan mesin host.

Coba spesifikasi resource yang berbeda.

T: Kesalahan: Jumlah GPU 6 tidak valid, hanya didukung: [0 1 2 4 8 16]

Jumlah GPU per layanan harus merupakan pangkat 2 untuk memaksimalkan efisiensi komunikasi antar-GPU.

Jumlah GPU yang didukung per layanan: 0, 1, 2, 4, 8, atau 16.

Masalah sumber daya

Untuk pertanyaan mengenai sumber daya komputasi dan penggunaan disk sistem, lihat FAQ konfigurasi sumber daya.

Pembaruan dan penskalaan layanan

T: Kebijakan penskalaan apa saja yang didukung EAS?

Pilih kebijakan penskalaan berdasarkan kebutuhan workload Anda. EAS mendukung auto-scaling horizontal dan penjadwalan penskalaan.

Untuk auto-scaling horizontal, konfigurasikan berdasarkan metrik kustom seperti QPS atau utilisasi CPU. Untuk metode perhitungan metrik dan detail konfigurasi, lihat Auto scaling horizontal.

Untuk mencegah thrashing akibat fluktuasi metrik, EAS menerapkan toleransi 10% terhadap ambang batas. Misalnya, dengan ambang batas QPS 10, scale-out dipicu ketika QPS secara konsisten di atas 11 (10 × 1,1). Artinya:

  • Peningkatan QPS singkat antara 10 dan 11 tidak langsung memicu scale-out.

  • Scale-out hanya dipicu ketika QPS bertahan pada 11–12 atau lebih tinggi dalam periode yang berkelanjutan.

Toleransi ini mengurangi perubahan sumber daya yang tidak perlu serta meningkatkan stabilitas dan efisiensi biaya.

T: Di mana instans yang di-scale-out berjalan?

Jika Anda menggunakan kelompok sumber daya khusus dengan kolam sumber daya elastis yang dikonfigurasi, instans akan di-scale-out ke kelompok sumber daya publik saat kelompok sumber daya khusus tidak memiliki node yang tersedia.

T: Bagaimana cara memperbarui layanan tanpa downtime?

  • Skenario: Perbarui layanan tanpa gangguan. Saat kelompok sumber daya khusus tidak memiliki kapasitas yang cukup, jalankan sementara instans baru di sumber daya publik, lalu jadwalkan ulang kembali ke kelompok sumber daya khusus setelah pembaruan.

  • Solusi: Gabungkan pembaruan bergulir (rolling updates), penjadwalan ulang sumber daya prioritas tinggi, dan kolam sumber daya elastis.

    1. Konfigurasi rolling updates: Mencegah gangguan layanan. Di bawah Service features > Stability assurance, konfigurasikan kebijakan pembaruan bergulir. Untuk detailnya, lihat Pembaruan bergulir dan shutdown yang mulus. Di halaman penerapan kustom, di bagian Jaminan stabilitas, aktifkan Rolling update, lalu atur parameter Max surge dan Max unavailable di dialog konfigurasi dan klik OK.

    2. Aktifkan kolam sumber daya elastis: Memungkinkan instans yang melebihi kapasitas sumber daya khusus berjalan di sumber daya publik bayar sesuai penggunaan. Untuk detailnya, lihat Kolam sumber daya elastis.

    3. Aktifkan high-priority resource descheduling: Saat kelompok sumber daya khusus memiliki kapasitas yang tersedia (misalnya, setelah instans lama dihapus), EAS secara otomatis menjadwalkan ulang instans sumber daya publik kembali ke kelompok sumber daya khusus untuk mengurangi biaya.

Masalah pemanggilan layanan

Error pemanggilan

Lakukan troubleshooting berdasarkan kode status HTTP yang dikembalikan. Untuk detailnya, lihat Kode status dan error layanan.

HTTPS dan domain kustom

T: Apakah EAS mendukung pemanggilan HTTPS?

Ya. Ganti http:// dengan https:// di URL titik akhir layanan untuk mengaktifkan transport terenkripsi. Jika client (seperti library Python requests) melaporkan error verifikasi sertifikat SSL, ini merupakan masalah konfigurasi sisi client, bukan masalah EAS.

T: Bagaimana cara memaksa akses HTTPS-only?

  • Gateway bersama: Pengalihan HTTPS tidak didukung.

  • Gateway khusus: Didukung. Aktifkan HTTPS redirect dalam konfigurasi gateway khusus. Setelah diaktifkan, semua permintaan HTTP secara otomatis dialihkan ke HTTPS.

T: Dapatkah saya memanggil layanan menggunakan domain kustom?

Ya. Buat dan gunakan gateway khusus yang dikelola sepenuhnya, lalu konfigurasikan domain kustom Anda di pengaturan gateway. Untuk detailnya, lihat Gunakan gateway khusus.

Manajemen token

T: Apakah token layanan kedaluwarsa atau berubah?

Tidak. Token yang dihasilkan saat layanan diterapkan bersifat jangka panjang. Merestart, memperbarui (kecuali Anda mengubah metode autentikasi secara manual), atau menskala layanan tidak mengubah Token tersebut. Token hanya dibatalkan saat Anda meresetnya secara manual atau menghapus layanan.

T: Dapatkah saya membuat beberapa token untuk satu layanan?

Tidak. Setiap instans layanan EAS hanya mendukung satu Token autentikasi. Untuk manajemen izin multi-pengguna atau pelacakan penggunaan terpisah, gunakan autentikasi berbasis RAM Alibaba Cloud atau solusi kontrol akses serupa.

Masalah pemanggilan lainnya

T: Bagaimana cara mengaktifkan respons streaming untuk layanan LLM?

EAS tidak memiliki toggle streaming global. Tentukan streaming dalam badan permintaan API masing-masing secara individual. Misalnya, saat memanggil layanan LLM yang kompatibel dengan OpenAI, sertakan "stream": true dalam badan permintaan JSON.

T: Apa perbedaan antara pemanggilan alamat VPC dan koneksi langsung VPC?

  • Pemanggilan alamat VPC: Permintaan melewati SLB internal ditambah gateway (pemanggilan alamat publik melewati SLB publik ditambah gateway). Ini adalah jalur permintaan standar. Setiap permintaan melewati forwarding layer-4 di SLB dan forwarding layer-7 di gateway sebelum mencapai instans layanan. Di bawah konkurensi tinggi dan trafik berat, forwarding ini menambah overhead latensi. Gateway juga memiliki batas bandwidth (1 Gbps secara default).

  • Koneksi langsung VPC: EAS menyediakan mode koneksi langsung berkecepatan tinggi yang mengatasi kinerja dan skalabilitas tanpa biaya tambahan. Mengaktifkan koneksi langsung VPC membuat jalur jaringan antara VPC Anda dan VPC layanan EAS. Permintaan Anda menggunakan penemuan layanan EAS untuk menemukan layanan, lalu melakukan load balancing perangkat lunak sisi client. Ini memerlukan SDK EAS dan pengaturan endpoint_type ke DIRECT.

    Misalnya, dalam skenario SDK Python, tambahkan baris berikut ke kode Anda untuk beralih dari pemanggilan gateway ke koneksi langsung:

    • client = PredictClient('http://pai-eas-vpc.cn-hangzhou.aliyuncs.com', 'mnist_saved_model_example')
      client.set_token('M2FhNjJlZDBmMzBmMzE4NjFiNzZhMmUxY2IxZjkyMDczNzAzYjFi****')
      client.set_endpoint_type(ENDPOINT_TYPE_DIRECT) # Direct link
      client.init()

Izin dan jaringan

T: Mengapa pengguna RAM tidak dapat secara otomatis membuat atau menghapus peran terkait layanan EAS?

Hanya pengguna dengan izin tertentu yang dapat membuat atau menghapus AliyunServiceRoleForPaiEas secara otomatis. Jika pengguna RAM tidak dapat melakukan tindakan ini, berikan kebijakan yang diperlukan sebagai berikut:

  1. Buat kebijakan berikut sebagai kebijakan kustom menggunakan metode konfigurasi berbasis skrip. Untuk detailnya, lihat Buat kebijakan kustom.

    Kebijakan untuk membuat atau menghapus peran terkait layanan

    {
      "Statement": [
        {
          "Action": "ram:CreateServiceLinkedRole",
          "Resource": "*",
          "Effect": "Allow",
          "Condition": {
            "StringEquals": {
              "ram:ServiceName": "eas.pai.aliyuncs.com"
            }
          }
        }
      ],
      "Version": "1"
    }
  2. Lampirkan kebijakan kustom yang dibuat pada langkah sebelumnya ke pengguna RAM target. Untuk detailnya, lihat Kelola izin pengguna RAM.

T: Bagaimana layanan EAS mengakses internet?

Layanan EAS tidak memiliki akses internet secara default. Untuk mengaktifkan akses internet, konfigurasikan VPC dengan konektivitas internet untuk layanan EAS. Lihat Akses EAS ke sumber daya publik dan privat.

Manajemen layanan

T: Apakah EAS mendukung akses SSH ke instans?

Tidak. EAS adalah layanan terkelola dan tidak menyediakan akses SSH ke dalam kontainer. Untuk menjalankan perintah tertentu saat kontainer dimulai, tentukan perintah tersebut di bidang Run Command dalam konfigurasi layanan.

T: Status layanan apa saja yang dimiliki EAS?

Layanan EAS memiliki status berikut. Anda juga dapat melihat status di kolom status pada halaman Model Serving (EAS).

  • Creating

  • Waiting — menunggu instans dimulai

  • Stopped

  • Failed

  • Updating — instans sedang diperbarui

  • Stopping

  • HotUpdate — memperbarui tanpa mengganti instans

  • Starting

  • DeleteFailed

  • Running

  • Scaling — instans sedang diskala

  • Pending — menunggu pemrosesan

  • Deleting

  • Completed

  • Preparing

T: Bagaimana cara mengetahui pengguna RAM mana yang membuat layanan?

Kueri event di Konsol ActionTrail. Atur filter nama event ke CreateService. Untuk detailnya, lihat Kueri event di Konsol ActionTrail.

T: Dapatkah saya mengunduh gambar resmi PAI dari internet?

Tidak. Gambar resmi PAI adalah gambar internal platform dan hanya dapat digunakan di dalam platform PAI. Gambar tersebut tidak dapat diunduh di luar kontainer platform.

T: Apa aturan keunikan untuk nama layanan dan ID layanan PAI-EAS?

  • Keunikan nama layanan: Nama layanan EAS bersifat unik secara global dalam satu wilayah. Jika Anda melihat error "nama layanan sudah ada" saat membuat layanan tetapi nama tersebut tidak muncul di daftar Model Serving (EAS), artinya pengguna lain di wilayah yang sama telah menggunakan nama tersebut. Pilih nama berbeda dan coba lagi.

  • Keunikan ID layanan: ID layanan PAI-EAS bersifat unik secara global dan ditetapkan secara otomatis oleh sistem. Anda tidak dapat menentukannya secara manual.

T: Apakah saya perlu membeli ulang EAS setelah menonaktifkan modul? Bagaimana jika saya tidak dapat menemukan instans layanan saya?

  • Tidak perlu pembelian ulang: Setelah diaktifkan, PAI-EAS tetap tersedia tanpa batas waktu. Untuk menggunakannya kembali, buka Konsol PAI, pilih atau buat ruang kerja, lalu buat instans EAS di ruang kerja tersebut. Tidak diperlukan pembelian atau reaktivasi tambahan.

  • Jika Anda tidak dapat menemukan instans Anda:

    1. Login ke Konsol PAI dan pastikan Ruang Kerja yang ditampilkan di bagian atas halaman adalah ruang kerja yang Anda cari.

    2. Jika ruang kerja dihapus atau diganti, cari daftar Model Serving (EAS) dari halaman Ikhtisar atau di dalam ruang kerja target.

    3. Jika daftar tidak menampilkan data dan tidak ada instans, artinya tidak ada instans EAS yang dapat ditagih yang dibuat di ruang kerja tersebut. Mengaktifkan modul saja tidak menimbulkan biaya dan tidak memerlukan pembersihan tambahan.

Lainnya

T: Mengapa saya tidak dapat memilih Bucket OSS saat menerapkan layanan EAS?

Saat menerapkan layanan EAS, Anda dapat memasang model dan kode dengan menentukan lokasi penyimpanan. Pastikan Bucket OSS dan sistem file NAS berada di wilayah yang sama dengan layanan EAS. Penyimpanan cross-region tidak dapat dipilih.

T: Masalah TensorFlow

Untuk detailnya, lihat FAQ TensorFlow.