Evaluasi model bahasa besar (LLM) menggunakan dataset kustom atau tolok ukur publik seperti MMLU dan C-Eval untuk mengukur dan membandingkan kinerja model.
Ikhtisar
Evaluasi model mendukung dua pendekatan evaluasi:
-
Evaluasi dataset kustom
Evaluasi berbasis aturan: Mengukur kesamaan antara prediksi model dan jawaban referensi menggunakan metrik ROUGE dan BLEU.
Evaluasi model juri: Menggunakan model juri dari Token Service untuk memberi skor output model satu per satu. Pendekatan ini paling cocok untuk skenario tanya-jawab terbuka dan kompleks.
-
Evaluasi dataset publik
Mengevaluasi model terhadap dataset publik standar industri, termasuk MMLU, TriviaQA, HellaSwag, GSM8K, C-Eval, dan TruthfulQA.
Menghasilkan skor tolok ukur yang selaras dengan standar evaluasi industri.
Model yang didukung: Semua jenis model HuggingFace AutoModelForCausalLM didukung.
Kasus penggunaan
Gunakan evaluasi model untuk:
Tolok ukur model: Evaluasi kemampuan umum model terhadap dataset publik dan bandingkan hasilnya dengan model industri atau garis dasar.
Evaluasi spesifik domain: Uji model dalam domain tertentu dan bandingkan kinerja model pra-latih versus model fine-tuned untuk menilai seberapa baik model menerapkan pengetahuan domain tersebut.
Pengujian regresi: Buat set data pengujian regresi untuk mengevaluasi kinerja model dalam skenario bisnis dunia nyata dan tentukan apakah model memenuhi standar produksi.
Penagihan
Biaya penyimpanan OSS: Berlaku untuk penyimpanan dataset dan hasil evaluasi. Lihat penagihan OSS.
Biaya pekerjaan evaluasi DLC: Berlaku untuk menjalankan pekerjaan evaluasi. Lihat penagihan DLC.
Evaluasi model juri: Lihat harga PAI Token Service.
Persiapan data
Evaluasi model mendukung dataset kustom maupun publik, termasuk C-Eval.
-
Dataset publik:
PAI menyediakan dataset publik berikut: MMLU, TriviaQA, HellaSwag, GSM8K, C-Eval, dan TruthfulQA. Periksa Konsol untuk daftar terkini. Pilih dataset mana pun untuk langsung menggunakannya.
-
Dataset kustom:
Siapkan file evaluasi kustom dalam format JSONL dan unggah ke OSS. Kemudian buat dataset kustom. Untuk detailnya, lihat Unggah file OSS dan Buat dan kelola dataset. Format file adalah sebagai berikut:
Gunakan
questionuntuk kolom pertanyaan danansweruntuk kolom jawaban referensi. Anda juga dapat mengubah pemetaan kolom ini di halaman evaluasi. Jika hanya memerlukan evaluasi model juri, kolomanswerbersifat opsional.{"question": "Apakah Tiongkok kuno menemukan pembuatan kertas?", "answer": "Ya"} {"question": "Apakah Tiongkok kuno menemukan mesiu?", "answer": "Ya"}File contoh: eval.jsonl
Evaluasi model
Langkah 1: Pilih model
-
Buka halaman Model Gallery.
Login ke Konsol PAI.
Di panel navigasi kiri, klik Workspaces, lalu pilih ruang kerja target Anda.
Di panel navigasi kiri, pilih QuickStart>Model Gallery.
-
Temukan model yang mendukung evaluasi.
Filter model yang dapat dievaluasi dari Models. Di area filter Supported Operations, pilih Evaluate untuk menampilkan hanya model yang dapat dievaluasi.
Evaluasi model fine-tuned. Model fine-tuned mempertahankan kemampuan evaluasi. Di halaman Model Gallery, klik Job Management>Training Jobs, lalu klik nama pekerjaan untuk membuka halaman detail pekerjaan. Tombol Evaluate muncul di pojok kanan atas.
Langkah 2: Konfigurasikan tugas evaluasi
Konfigurasikan tugas evaluasi dengan memilih dataset, mengatur hiperparameter, dan secara opsional mengaktifkan evaluasi model juri.
-
Konfigurasikan parameter dasar:
Job Name: Nama unik yang dibuat secara otomatis.
Result Output Path: Jalur OSS tempat hasil evaluasi disimpan.
Tag: Digunakan untuk pencarian resource multi-dimensi, operasi batch, dan alokasi biaya.
-
Konfigurasikan metode evaluasi:
-
Evaluation Method: Pilih Custom Dataset Evaluation atau Public Dataset Evaluation.
-
Public Dataset Evaluation:
Menggunakan dataset open-source yang mencakup berbagai domain (seperti matematika dan coding) untuk memberikan evaluasi kemampuan komprehensif bagi LLM. Skor yang lebih tinggi menunjukkan kinerja model yang lebih baik.
Beberapa dataset dapat dipilih sekaligus. GSM8K, TriviaQA, dan HellaSwag merupakan dataset besar dan mungkin memerlukan waktu evaluasi lebih lama.
-
Custom Dataset Evaluation: Tentukan kolom pertanyaan dan jawaban referensi untuk dataset kustom Anda. Jika hanya memerlukan evaluasi model juri, kolom jawaban referensi dapat dibiarkan kosong.
Dataset Source: Pilih Select OSS File atau Select an existing dataset..
-
Evaluation Method: Pilih satu atau kedua metode evaluasi berikut:
General NLP Metric Evaluation: Menghitung kesamaan teks antara prediksi model dan jawaban referensi menggunakan metrik ROUGE dan BLEU. Cocok untuk skenario dengan jawaban pasti. Dataset harus berisi pasangan pertanyaan-jawaban.
Multi-Metric Evaluation with LLM-as-a-Judge: Memberi skor jawaban model secara otomatis menggunakan model juri, dengan dukungan metrik kustom. Cocok untuk jawaban kompleks atau terbuka. Dataset dapat hanya berisi pertanyaan, atau pasangan pertanyaan-jawaban.
-
-
-
Konfigurasikan sumber daya komputasi:
Resource Type: Jenis sumber daya yang didukung bervariasi tergantung model. Lihat Konsol untuk opsi yang tersedia.
Source: Pilih dari Sumber daya publik, Kuota sumber daya, atau sumber daya spot.
Setelah mengonfigurasi semua parameter, klik OK untuk mengirimkan tugas. Anda akan diarahkan ke halaman detail tugas. Setelah tugas selesai, klik Evaluation Report untuk melihat laporan evaluasi.
Langkah 3: Lihat hasil evaluasi
Setelah tugas selesai, lihat instruksi di bagian Lihat hasil evaluasi untuk melihat hasil tugas tunggal, membandingkan beberapa tugas evaluasi, dan menginterpretasikan skor.
Lihat hasil evaluasi
Daftar tugas evaluasi
Di halaman Model Gallery, klik Job Management, lalu beralih ke tab Evaluation Jobs.
Halaman tugas evaluasi menampilkan daftar tugas yang berisi nama tugas, mode evaluasi, objek evaluasi, jenis objek evaluasi, status, waktu pembuatan, dan waktu pembaruan. Klik Create Task untuk membuat tugas evaluasi. Setiap tugas mendukung operasi View Report, Stop, dan Delete. Anda juga dapat memilih beberapa tugas evaluasi model tunggal untuk melakukan Comparison hasil.
Hasil tugas tunggal
Di halaman daftar tugas evaluasi, klik View Report di kolom Actions untuk tugas tersebut. Halaman detail tugas terbuka dan menampilkan skor evaluasi model pada dataset kustom dan publik di bagian Evaluation report.
Hasil evaluasi dataset kustom
-
Evaluasi berbasis aturan:
Menghitung kesamaan antara output model dan jawaban referensi menggunakan metode pencocokan teks NLP standar. Nilai yang lebih tinggi menunjukkan kinerja model yang lebih baik.
Cocok untuk mengevaluasi seberapa baik model beradaptasi dengan domain tertentu menggunakan data spesifik domain.
Grafik radar menampilkan skor model pada 13 metrik ROUGE dan BLEU. Untuk definisi metrik, lihat Apendiks: Referensi metrik.
-
Judge model evaluation:
Menggunakan LLM untuk mengevaluasi kualitas output pada tingkat semantik. Nilai rata-rata (mean) dan median yang lebih tinggi dengan deviasi standar yang lebih rendah menunjukkan kinerja model yang lebih baik. Pendekatan ini lebih akurat daripada pencocokan teks berbasis aturan.
-
Tabel menampilkan metrik statistik berikut dari skor model juri:
Mean: Skor rata-rata yang diberikan oleh model juri (tidak termasuk skor tidak valid), pada skala 1–5. Nilai yang lebih tinggi menunjukkan jawaban yang lebih baik.
Median: Skor median yang diberikan oleh model juri (tidak termasuk skor tidak valid), pada skala 1–5. Nilai yang lebih tinggi menunjukkan jawaban yang lebih baik.
Standard deviation: Deviasi standar dari skor model juri (tidak termasuk skor tidak valid). Ketika mean dan median sama, deviasi standar yang lebih rendah menunjukkan konsistensi model yang lebih baik.
Skewness: Kemencengan distribusi skor model juri (tidak termasuk skor tidak valid). Kemencengan positif menunjukkan ekor yang lebih panjang di sisi kanan (ujung skor tinggi); kemencengan negatif menunjukkan ekor yang lebih panjang di sisi kiri (ujung skor rendah).
Detail evaluasi per pertanyaan dari file evaluasi juga ditampilkan di bagian bawah halaman.
Tabel Judge Evaluation Details di bagian bawah halaman berisi kolom Question, Reference Answer, Model Answer, JudgeScore, dan JudgeReason. Anda dapat mengklik tombol Export di pojok kanan atas untuk mengunduh data evaluasi.
Hasil evaluasi dataset publik
Jika tugas evaluasi menggunakan dataset publik, grafik radar menampilkan skor model pada dataset tersebut.
Grafik kiri menunjukkan skor model berdasarkan domain. Setiap domain mungkin mencakup beberapa dataset. Untuk dataset dalam domain yang sama, skor dirata-ratakan untuk menghasilkan skor domain.
Grafik kanan menunjukkan skor model pada setiap dataset publik secara individual. Rujuk dokumentasi resmi masing-masing dataset untuk cakupan evaluasinya.
Di bawah grafik radar terdapat tabel hasil evaluasi yang berisi kolom berikut: Domain, Domain Score, Subdivision, Dataset Name, Language, dan Subdivision Score. Tombol Export di pojok kanan atas tabel memungkinkan Anda mengekspor data evaluasi.
Bandingkan beberapa tugas evaluasi
Untuk membandingkan hasil dari beberapa model, pilih tugas evaluasi di sisi kiri halaman daftar tugas evaluasi, lalu klik Compare di pojok kanan atas.
Perbandingan dataset kustom
Halaman perbandingan hasil evaluasi berisi tab Custom Dataset Evaluation Results dan Public Dataset Evaluation Results. Dalam hasil evaluasi dataset kustom, konten berikut ditampilkan:
Judge Evaluation Results: Tabel yang membandingkan metrik Mean, Median, StandardDeviation, dan Skewness antar model.
General Metric Evaluation Results: Grafik radar yang membandingkan kinerja model pada dimensi bleu-1 hingga bleu-4, rouge-1/2/l f, p, dan r.
Tabel data metrik terperinci yang mencantumkan nilai spesifik untuk setiap metrik ROUGE dan BLEU per model, dengan tombol Export di pojok kanan bawah.
Perbandingan dataset publik
Di bawah tab Public Dataset Evaluation Results, grafik radar dan tabel data membandingkan hasil evaluasi qwen1.5-7b-chat dan qwen1.5-1.8b-chat. Grafik radar menunjukkan distribusi skor pada domain (Multilingual, Reasoning, Safety) dan dataset (C-Eval, HellaSwag, TruthfulQA). qwen1.5-7b-chat mengungguli qwen1.5-1.8b-chat di semua dimensi. Skor dataset:
qwen1.5-7b-chat: C-Eval 0.680, TruthfulQA 0.576, HellaSwag 0.772
qwen1.5-1.8b-chat: C-Eval 0.557, TruthfulQA 0.406, HellaSwag 0.601
Referensi
Anda juga dapat mengevaluasi model menggunakan PAI Python SDK. Lihat notebook berikut:
Apendiks: Referensi metrik
Apendiks ini memberikan definisi terperinci untuk setiap metrik yang digunakan dalam evaluasi berbasis aturan dataset kustom.
Metrik ROUGE
Metrik ROUGE mengukur kesamaan antara prediksi model dan jawaban referensi.
Metrik ROUGE-N menghitung tumpang tindih N-gram (tumpang tindih urutan berurutan N kata). ROUGE-1 dan ROUGE-2 paling banyak digunakan, masing-masing mengukur tumpang tindih unigram (1-gram) dan bigram (2-gram).
ROUGE-L didasarkan pada Longest Common Subsequence (LCS).
Akhiran metrik: -p (Presisi), -r (Recall), -f (F-score).
|
Metric |
Description |
|
rouge-1-p |
Proporsi unigram dalam ringkasan sistem yang sesuai dengan unigram dalam ringkasan referensi. |
|
rouge-1-r |
Proporsi unigram dalam ringkasan referensi yang muncul dalam ringkasan sistem. |
|
rouge-1-f |
Rata-rata harmonik dari rouge-1-p dan rouge-1-r. |
|
rouge-2-p |
Proporsi bigram dalam ringkasan sistem yang sesuai dengan bigram dalam ringkasan referensi. |
|
rouge-2-r |
Proporsi bigram dalam ringkasan referensi yang muncul dalam ringkasan sistem. |
|
rouge-2-f |
Rata-rata harmonik dari rouge-2-p dan rouge-2-r. |
|
rouge-l-p |
Rasio panjang LCS terhadap panjang output sistem (Presisi). |
|
rouge-l-r |
Rasio panjang LCS terhadap panjang jawaban referensi (Recall). |
|
rouge-l-f |
Rata-rata harmonik dari rouge-l-p dan rouge-l-r. |
Metrik BLEU
Bilingual Evaluation Understudy (BLEU) adalah metrik yang banyak digunakan untuk mengevaluasi kualitas penerjemahan mesin. Metrik ini memberi skor dengan mengukur tumpang tindih N-gram antara output model dan jawaban referensi.
|
Metric |
Description |
|
bleu-1 |
Mengukur tumpang tindih unigram. |
|
bleu-2 |
Mengukur tumpang tindih bigram. |
|
bleu-3 |
Mengukur tumpang tindih trigram (3-gram). |
|
bleu-4 |
Mengukur tumpang tindih 4-gram. |