Setelah Anda menginstal Agen Python untuk aplikasi model bahasa besar (LLM), ARMS akan mulai memantau aplikasi tersebut. Halaman Performance Analysis menampilkan metrik utama, seperti jumlah pemanggilan model, waktu rata-rata pemanggilan model, dan jumlah kesalahan pemanggilan model.
Prasyarat
Anda telah menginstal agen untuk aplikasi LLM Anda. Untuk informasi selengkapnya, lihat Hubungkan aplikasi LLM atau layanan inferensi ke ARMS.
Lihat analisis kinerja
Masuk ke ARMS console. Di panel navigasi sebelah kiri, pilih .
Pada halaman Application List, pilih wilayah, lalu klik nama aplikasi Anda.
Di bilah navigasi atas, klik Performance Analysis.
Panel
Deskripsi
Model invocations
Total pemanggilan model dalam periode waktu yang dipilih.
Average model invocation time
Waktu rata-rata per pemanggilan model selama periode waktu yang dipilih.
Model invocation errors
Total pemanggilan model yang gagal dalam periode waktu yang dipilih.
Model invocations/1m
Jumlah pemanggilan model per menit.
Average model invocation time/1m
Waktu rata-rata pemanggilan model per menit.
Model invocation errors/1m
Jumlah pemanggilan model yang gagal per menit.
Model invocation time quantile (P99)/1m
Kuantil P99 untuk waktu pemanggilan model per menit, artinya 99% pemanggilan lebih cepat daripada nilai ini.
Average time to first packet/1m
Waktu rata-rata untuk menerima paket data pertama dari pemanggilan model, per menit.
Time to first packet quantile (P99)/1m
Kuantil P99 untuk waktu hingga paket data pertama (TTFP) dari pemanggilan model per menit.
Top 5 models by invocation count
Lima model teratas dengan jumlah pemanggilan terbanyak, diurutkan secara menurun.
Top 5 models by average invocation time
Lima model teratas dengan waktu rata-rata pemanggilan terlama, diurutkan secara menurun.
Top 5 models by invocation errors
Lima model teratas dengan jumlah kesalahan pemanggilan terbanyak, diurutkan secara menurun.