ModelEval adalah alat evaluasi model dari PAI yang digunakan untuk melakukan benchmark large language model terhadap dataset publik yang otoritatif atau dataset bisnis Anda sendiri, sehingga menghasilkan skor kuantitatif untuk membimbing pemilihan model, fine-tuning, dan pengendalian versi model.
Mulai cepat
Jalankan evaluasi pertama Anda dalam 5 menit: gunakan dataset CMMLU untuk mengukur kemampuan pemahaman dan penalaran bahasa Tiongkok dari Qwen3-4B.
Di Konsol PAI, pilih Model Application > Model Evaluation (ModelEval) di panel navigasi kiri.
Pada halaman Model Evaluation, klik Create Task.
-
Konfigurasikan parameter berikut:
-
Basic Configuration: Task name dan Result Output Path dibuat secara otomatis. Terima nilai default atau ubah sesuai kebutuhan.
CatatanJika ruang kerja tidak memiliki path penyimpanan OSS default, pilih secara manual path output-nya.
Evaluation Mode Configuration: pilih Single Model Online Evaluation.
Evaluation Object Configurations: Untuk Evaluation Object, pilih Public Model. Di daftar drop-down Public Model, cari dan pilih Qwen3-4B.
Evaluation Method Configuration: Pilih Public Dataset Evaluation. Di daftar dataset, pilih CMMLU.
-
Resource Configuration: Pilih Single node - Standard.
Resource Type: Pilih General Computing.
Source: Pilih Public Resources.
Job Resource: Pilih tipe instans GPU, misalnya,
ecs.gn7i-c8g1.2xlarge(24 GB).-
Jika tipe instans yang dipilih habis stoknya, pilih instans GPU lainnya.
-
-
Klik OK di bagian bawah halaman. Halaman detail tugas akan terbuka.
Saat status tugas berubah menjadi Succeeded, buka tab Evaluation Report untuk melihat skor
Qwen3-4Bpada dataset CMMLU.
Konfigurasi evaluasi
Konfigurasi mode evaluasi
ModelEval mendukung tiga mode evaluasi. Pilih mode yang sesuai dengan kasus penggunaan Anda.
|
Evaluation Mode |
Description |
|
Single Model Online Evaluation |
Memberikan skor pada output inferensi dari satu model. |
|
Dual-Model Arena |
Menjalankan inferensi online pada kedua model menggunakan pertanyaan yang sama dan membandingkan tanggapan mereka untuk mengidentifikasi model yang berkinerja lebih baik. |
|
Dual-Model Offline Competition |
Membandingkan dua model menggunakan dataset pertanyaan dan jawaban yang telah disiapkan sebelumnya untuk mengidentifikasi model yang berkinerja lebih baik. |
Konfigurasi target evaluasi
ModelEval mendukung empat target evaluasi. Pilih berdasarkan lokasi deployment model atau layanan Anda.
|
Evaluation Target |
Description |
Use case |
|
Public Model |
Model dari PAI Model Gallery |
Benchmark LLM open-source utama |
|
Custom Model |
Model kustom yang terdaftar di Penting
Pastikan model kompatibel dengan framework vLLM. |
Evaluasi model yang telah mengalami fine-tuning atau dikustomisasi |
|
PAI-EAS Service |
Layanan inferensi online PAI-EAS (Elastic Algorithm Service) yang telah dideploy |
Evaluasi layanan model yang berjalan di lingkungan produksi |
|
Custom Services |
Setiap layanan model dengan API yang kompatibel dengan OpenAI |
Evaluasi layanan model pihak ketiga atau self-hosted |
Konfigurasi metode evaluasi
Gunakan dataset kustom, dataset publik, atau kombinasi keduanya.
Evaluasi dataset kustom
Gunakan dataset Anda sendiri untuk mendapatkan hasil evaluasi yang mencerminkan skenario bisnis aktual.
Format dataset: JSONL (terenkode UTF-8, satu objek JSON per baris).
Upload: Unggah file dataset ke OSS (Object Storage Service) dan masukkan path OSS-nya pada halaman konfigurasi.
|
Evaluation Method |
General NLP Metric Evaluation |
Multi-Metric Evaluation with LLM-as-a-Judge |
|
Purpose |
Untuk pertanyaan dengan jawaban ground-truth, metrik ini mengukur kemiripan teks antara output model dan jawaban referensi. Gunakan untuk tugas terjemahan, ringkasan, dan Q&A berbasis basis pengetahuan. |
Ketika pertanyaan tidak memiliki satu jawaban benar—seperti dialog terbuka atau pembuatan konten—model juri yang kuat memberikan skor kualitas tanggapan model. |
|
Dataset format |
Setiap objek JSON harus menyertakan field
|
Setiap objek JSON harus menyertakan field
|
|
Metrics |
|
Sistem mengirimkan |
Evaluasi dataset publik
Gunakan dataset standar industri untuk melakukan benchmark model Anda terhadap titik referensi yang telah ditetapkan.
Purpose: Perbandingan seleksi model, pengujian benchmark pra-rilis, dan penilaian kemampuan umum.
Configuration: Pilih Public Dataset Evaluation, lalu pilih satu atau beberapa dataset dari daftar.
-
Supported datasets:
LiveCodeBench: Kemampuan pemrosesan kode.
Math500: Penalaran matematika (500 soal kompetisi matematika tingkat tinggi).
AIME25: Penalaran matematika berdasarkan soal AIME 2025.
AIME24: Penalaran matematika berdasarkan soal AIME 2024.
CMMLU: Pemahaman bahasa multi-subjek Tiongkok.
MMLU: Pemahaman bahasa multi-subjek Inggris.
C-Eval: Evaluasi komprehensif kemampuan bahasa Tiongkok.
GSM8K: Penalaran matematika.
HellaSwag: Penalaran akal sehat.
TruthfulQA: Evaluasi kebenaran.
Manage tasks
Di halaman Model Evaluation, kelola tugas evaluasi.
View Report: Untuk tugas dengan status Succeeded, klik tombol ini untuk melihat laporan evaluasi lengkap.
Compare: Pilih 2 hingga 5 tugas yang telah selesai dan klik Compare untuk membandingkan skor mereka secara berdampingan.
Stop: Hentikan tugas yang berstatus In operation. Aksi ini tidak dapat dikembalikan: tugas tidak dapat dilanjutkan dan sumber daya komputasi yang telah digunakan tidak dikembalikan.
Delete: Menghapus catatan tugas. Aksi ini tidak dapat dibatalkan.
Billing
ModelEval dikenai biaya untuk hal-hal berikut:
Computing resources
|
Resource Type |
Billing method |
Billed item |
Billing rule |
|
Public resources |
Pay-as-you-go |
Durasi running aktual |
Untuk harga instance, lihat informasi harga di konsol. |
|
Resource quota |
Subscription (prepaid) |
Jumlah dan durasi instans node yang dibeli |
Beli sumber daya khusus di muka. Biaya didasarkan pada jumlah instans node dan durasi langganan. Untuk detailnya, lihat Billing of AI computing resources. |
Judge model
Biaya tambahan berlaku jika Anda menggunakan evaluasi model juri. Untuk detail harga, lihat PAI Token Service pricing.