All Products
Search
Document Center

Platform For AI:Evaluasi model (ModelEval)

Last Updated:Jul 10, 2026

ModelEval adalah alat evaluasi model dari PAI yang digunakan untuk melakukan benchmark large language model terhadap dataset publik yang otoritatif atau dataset bisnis Anda sendiri, sehingga menghasilkan skor kuantitatif untuk membimbing pemilihan model, fine-tuning, dan pengendalian versi model.

Mulai cepat

Jalankan evaluasi pertama Anda dalam 5 menit: gunakan dataset CMMLU untuk mengukur kemampuan pemahaman dan penalaran bahasa Tiongkok dari Qwen3-4B.

  1. Di Konsol PAI, pilih Model Application > Model Evaluation (ModelEval) di panel navigasi kiri.

  2. Pada halaman Model Evaluation, klik Create Task.

  3. Konfigurasikan parameter berikut:

    • Basic Configuration: Task name dan Result Output Path dibuat secara otomatis. Terima nilai default atau ubah sesuai kebutuhan.

      Catatan

      Jika ruang kerja tidak memiliki path penyimpanan OSS default, pilih secara manual path output-nya.

    • Evaluation Mode Configuration: pilih Single Model Online Evaluation.

    • Evaluation Object Configurations: Untuk Evaluation Object, pilih Public Model. Di daftar drop-down Public Model, cari dan pilih Qwen3-4B.

    • Evaluation Method Configuration: Pilih Public Dataset Evaluation. Di daftar dataset, pilih CMMLU.

    • Resource Configuration: Pilih Single node - Standard.

      • Resource Type: Pilih General Computing.

      • Source: Pilih Public Resources.

      • Job Resource: Pilih tipe instans GPU, misalnya, ecs.gn7i-c8g1.2xlarge (24 GB).

      • Jika tipe instans yang dipilih habis stoknya, pilih instans GPU lainnya.
  4. Klik OK di bagian bawah halaman. Halaman detail tugas akan terbuka.

    Saat status tugas berubah menjadi Succeeded, buka tab Evaluation Report untuk melihat skor Qwen3-4B pada dataset CMMLU.

Konfigurasi evaluasi

Konfigurasi mode evaluasi

ModelEval mendukung tiga mode evaluasi. Pilih mode yang sesuai dengan kasus penggunaan Anda.

Evaluation Mode

Description

Single Model Online Evaluation

Memberikan skor pada output inferensi dari satu model.

Dual-Model Arena

Menjalankan inferensi online pada kedua model menggunakan pertanyaan yang sama dan membandingkan tanggapan mereka untuk mengidentifikasi model yang berkinerja lebih baik.

Dual-Model Offline Competition

Membandingkan dua model menggunakan dataset pertanyaan dan jawaban yang telah disiapkan sebelumnya untuk mengidentifikasi model yang berkinerja lebih baik.

Konfigurasi target evaluasi

ModelEval mendukung empat target evaluasi. Pilih berdasarkan lokasi deployment model atau layanan Anda.

Evaluation Target

Description

Use case

Public Model

Model dari PAI Model Gallery

Benchmark LLM open-source utama

Custom Model

Model kustom yang terdaftar di AI Asset Management > Model

Penting

Pastikan model kompatibel dengan framework vLLM.

Evaluasi model yang telah mengalami fine-tuning atau dikustomisasi

PAI-EAS Service

Layanan inferensi online PAI-EAS (Elastic Algorithm Service) yang telah dideploy

Evaluasi layanan model yang berjalan di lingkungan produksi

Custom Services

Setiap layanan model dengan API yang kompatibel dengan OpenAI

Evaluasi layanan model pihak ketiga atau self-hosted

Konfigurasi metode evaluasi

Gunakan dataset kustom, dataset publik, atau kombinasi keduanya.

Evaluasi dataset kustom

Gunakan dataset Anda sendiri untuk mendapatkan hasil evaluasi yang mencerminkan skenario bisnis aktual.

  • Format dataset: JSONL (terenkode UTF-8, satu objek JSON per baris).

  • Upload: Unggah file dataset ke OSS (Object Storage Service) dan masukkan path OSS-nya pada halaman konfigurasi.

Evaluation Method

General NLP Metric Evaluation

Multi-Metric Evaluation with LLM-as-a-Judge

Purpose

Untuk pertanyaan dengan jawaban ground-truth, metrik ini mengukur kemiripan teks antara output model dan jawaban referensi. Gunakan untuk tugas terjemahan, ringkasan, dan Q&A berbasis basis pengetahuan.

Ketika pertanyaan tidak memiliki satu jawaban benar—seperti dialog terbuka atau pembuatan konten—model juri yang kuat memberikan skor kualitas tanggapan model.

Dataset format

Setiap objek JSON harus menyertakan field question dan field answer (ground truth).

{"question": "What is the capital of France?", "answer": "Paris"}

Setiap objek JSON harus menyertakan field question. Field answer bersifat opsional.

{"question": "Describe the history of artificial intelligence."}

Metrics

  • ROUGE (ROUGE-1, ROUGE-2, ROUGE-L): Metrik berbasis recall yang mengukur seberapa besar bagian dari ground truth yang dicakup oleh output model.

  • BLEU (BLEU-1, BLEU-2, BLEU-3, BLEU-4): Metrik berbasis presisi yang mengukur seberapa dekat output model dengan ground truth.

Sistem mengirimkan question dan output model ke model juri, yang memberikan skor tanggapan berdasarkan dimensi seperti relevansi, akurasi, dan kelancaran.

Evaluasi dataset publik

Gunakan dataset standar industri untuk melakukan benchmark model Anda terhadap titik referensi yang telah ditetapkan.

  • Purpose: Perbandingan seleksi model, pengujian benchmark pra-rilis, dan penilaian kemampuan umum.

  • Configuration: Pilih Public Dataset Evaluation, lalu pilih satu atau beberapa dataset dari daftar.

  • Supported datasets:

    • LiveCodeBench: Kemampuan pemrosesan kode.

    • Math500: Penalaran matematika (500 soal kompetisi matematika tingkat tinggi).

    • AIME25: Penalaran matematika berdasarkan soal AIME 2025.

    • AIME24: Penalaran matematika berdasarkan soal AIME 2024.

    • CMMLU: Pemahaman bahasa multi-subjek Tiongkok.

    • MMLU: Pemahaman bahasa multi-subjek Inggris.

    • C-Eval: Evaluasi komprehensif kemampuan bahasa Tiongkok.

    • GSM8K: Penalaran matematika.

    • HellaSwag: Penalaran akal sehat.

    • TruthfulQA: Evaluasi kebenaran.

Manage tasks

Di halaman Model Evaluation, kelola tugas evaluasi.

  • View Report: Untuk tugas dengan status Succeeded, klik tombol ini untuk melihat laporan evaluasi lengkap.

  • Compare: Pilih 2 hingga 5 tugas yang telah selesai dan klik Compare untuk membandingkan skor mereka secara berdampingan.

  • Stop: Hentikan tugas yang berstatus In operation. Aksi ini tidak dapat dikembalikan: tugas tidak dapat dilanjutkan dan sumber daya komputasi yang telah digunakan tidak dikembalikan.

  • Delete: Menghapus catatan tugas. Aksi ini tidak dapat dibatalkan.

Billing

ModelEval dikenai biaya untuk hal-hal berikut:

Computing resources

Resource Type

Billing method

Billed item

Billing rule

Public resources

Pay-as-you-go

Durasi running aktual

Jumlah tagihan = (harga satuan / 60) × durasi layanan (menit)

Untuk harga instance, lihat informasi harga di konsol.

Resource quota

Subscription (prepaid)

Jumlah dan durasi instans node yang dibeli

Beli sumber daya khusus di muka. Biaya didasarkan pada jumlah instans node dan durasi langganan. Untuk detailnya, lihat Billing of AI computing resources.

Judge model

Biaya tambahan berlaku jika Anda menggunakan evaluasi model juri. Untuk detail harga, lihat PAI Token Service pricing.