Menilai model di berbagai dimensi menggunakan set data membantu Anda memahami kinerjanya secara menyeluruh dan memastikan model memberikan hasil yang efektif dalam aplikasi dunia nyata.
Mulai
Apa itu evaluasi model
Evaluasi model adalah alat validasi kualitas model yang disediakan oleh platform Model Studio. Alat ini membantu Anda menilai kinerja model bahasa besar secara objektif dan kuantitatif.
Rangkuman satu kalimat: Berikan tes kepada model, skor respons secara otomatis atau manual, lalu hasilkan laporan evaluasi.
Mengapa melakukan evaluasi model
Skenario 1: Pengambilan keputusan pemilihan model
Masalah: Menghadapi puluhan model besar (Qwen, GPT, Claude, ERNIE Bot, dll.), Anda tidak tahu mana yang paling sesuai dengan kebutuhan bisnis Anda.
Solusi:
-
Siapkan 100 kasus uji dari skenario bisnis Anda.
-
Evaluasi semua model kandidat menggunakan set data yang sama.
-
Bandingkan laporan evaluasi (skor, tingkat kelulusan, kinerja sampel).
-
Pilih model yang paling memenuhi persyaratan bisnis Anda.
Nilai:
-
Hindari penilaian subjektif—biarkan data yang mengarahkan keputusan.
-
Hemat waktu dibandingkan pengujian manual tiap model.
-
Kurangi risiko pemilihan model yang buruk.
Skenario 2: Validasi efektivitas fine-tuning
Masalah: Anda telah melakukan fine-tuning Qwen dengan 1.000 sampel pelatihan tetapi tidak yakin apakah kinerjanya benar-benar meningkat.
Solusi:
-
Siapkan set data evaluasi (tidak tumpang tindih dengan set pelatihan).
-
Evaluasi model sebelum dan sesudah fine-tuning.
-
Bandingkan hasil kedua evaluasi:
-
Skor sebelum fine-tuning: 75
-
Skor setelah fine-tuning: 85
-
Kesimpulan: Fine-tuning berhasil—meningkat 10 poin.
-
Nilai:
-
Kuantifikasi dampak fine-tuning untuk memvalidasi ROI.
-
Verifikasi apakah arah fine-tuning sudah tepat.
-
Sediakan dukungan data untuk optimasi berkelanjutan.
Skenario 3: Kuantifikasi kemampuan model
Masalah: Anda perlu melaporkan kinerja model pada tugas tertentu kepada tim atau manajemen tetapi tidak memiliki data objektif.
Solusi:
-
Gunakan fitur evaluasi untuk menghasilkan laporan.
-
Laporan mencakup:
-
Skor keseluruhan: 85/100
-
Tingkat kelulusan: 90% (sampel dengan skor ≥3 poin)
-
Distribusi skor: 30 sampel mendapat 5 poin, 40 mendapat 4 poin, 20 mendapat 3 poin, 10 mendapat 2 poin
-
Kasus khas: sampel dengan skor tinggi dan rendah
-
-
Gunakan data laporan untuk mendukung keputusan dan presentasi.
Nilai:
-
Ganti deskripsi subjektif ("cukup bagus") dengan data ("85 poin, tingkat kelulusan 90%").
-
Memungkinkan komunikasi lintas tim yang jelas dan selaras.
-
Buat referensi garis dasar untuk optimasi di masa depan.
Skenario 4: Memantau kinerja model secara berkelanjutan
Masalah: Setelah deployment, kinerja model dapat menurun seiring waktu atau perubahan bisnis, tetapi sulit dideteksi secara cepat.
Solusi:
-
Buat siklus evaluasi rutin (misalnya bulanan).
-
Gunakan set data evaluasi dan dimensi yang identik.
-
Lacak tren kinerja:
-
Januari 2024: Skor 85
-
Februari 2024: Skor 87 (membaik)
-
Maret 2024: Skor 78 (menurun—perlu investigasi)
-
Nilai:
-
Deteksi dini degradasi kinerja.
-
Sediakan fondasi data untuk iterasi model.
-
Bangun profil kemampuan model.
Rangkuman nilai inti
|
Nilai |
Deskripsi |
|
Kuantifikasi objektif |
Ganti penilaian subjektif dengan data—hindari deskripsi samar seperti "sepertinya oke" |
|
Perbandingan efisien |
Bandingkan beberapa model dengan cepat—hemat waktu pengujian manual |
|
Tata kelola risiko |
Validasi menyeluruh sebelum deployment—kurangi risiko pemilihan model |
|
Optimasi berkelanjutan |
Sediakan umpan balik kuantitatif untuk fine-tuning dan iterasi model |
|
Dukungan keputusan |
Sediakan dukungan data untuk kolaborasi tim dan pelaporan manajemen |
Alur kerja evaluasi
|
Fase |
Deskripsi sub-langkah |
|
1. Persiapan |
Dimensi evaluasi (definisikan kriteria penilaian) → Data uji (siapkan pertanyaan dan jawaban) |
|
2. Buat tugas evaluasi |
Pilih model → Pilih data → Pilih dimensi → Pilih apakah akan bergabung dengan leaderboard |
|
3. Jalankan evaluasi |
Evaluasi otomatis (sistem menyelesaikan secara otomatis) atau evaluasi manual (memerlukan anotasi manual) |
|
4. Lihat hasil |
Laporan skor → Statistik tingkat kelulusan → Rincian terperinci |
Pengalaman cepat
Skenario evaluasi: Evaluasi akurasi Qwen-Max pada menjawab pertanyaan berbasis akal sehat.
Contoh lengkap: Gunakan 10 pertanyaan uji untuk menilai kesamaan semantik respons model.
Langkah pengalaman:
1. Buat dimensi evaluasi
Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Dimension, lalu klik tombol Create Evaluation Dimension di pojok kanan atas.
Isi formulir dan klik tombol Save.
|
Item |
Konten |
|
Dimension Name |
Akurasi QA akal sehat |
|
Description |
Evaluasi akurasi model dalam menjawab pertanyaan berbasis akal sehat |
|
Type |
Pilih Model Evaluation - Numeric |
|
Judge Model |
Pilih Qwen-Max |
|
Scorer Template |
Pilih Semantic Similarity |
|
Scoring Range |
Pertahankan default 0~5 |
|
Pass Threshold |
3.0 |
Catatan terkait:
Untuk pemilihan Scorer Template, antarmuka menampilkan tiga tombol radio—pilih salah satu. Untuk informasi lebih lanjut, lihat dokumentasi variabel Prompt dan perbedaan System Prompt.
|
Templat |
Deskripsi |
Skenario penerapan |
Perlu Prompt kustom? |
|
Comprehensive Evaluation (default) |
Templat preset sistem yang memberi skor di lima dimensi: relevansi, sensitivitas budaya, kelengkapan informasi, kejelasan, dan keterlibatan pengguna. |
Skenario percakapan umum dan layanan pelanggan |
Tidak—gunakan langsung atau modifikasi sesuai kebutuhan |
|
Semantic Similarity |
Templat preset sistem yang mengevaluasi kedekatan semantik antara output dan jawaban referensi. |
Sistem QA dan pengambilan pengetahuan |
Tidak—gunakan langsung atau modifikasi sesuai kebutuhan |
|
Custom Evaluation |
Tulis prompt Anda sendiri. |
Skenario bisnis spesifik |
Ya—tulis sesuai kebutuhan Anda |
2. Siapkan data uji
Lokasi antarmuka: Buka halaman Data Management, lalu klik tombol Add Dataset di pojok kanan atas.
Isi formulir dan klik tombol Confirm.
|
Item |
Konten |
|
Dimension Name |
Data uji QA |
|
Description |
Pilih tipe Evaluation Set. ❗ Evaluasi model hanya mendukung dataset bertipe Evaluation Set—bukan set pelatihan. |
|
Type |
Unggah Sample Data_QA Test Data.xlsx (lampiran CMS, file_id=151014, unduh online). |
3. Buat tugas evaluasi
Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Task, lalu klik tombol Create Evaluation Task di pojok kanan atas.
Isi formulir dan klik tombol Evaluate.
|
Item |
Konten |
|
Dimension Name |
Tes akurasi QA |
|
Evaluation Object |
Pilih Qwen-Plus. |
|
Judge Model |
Pilih Qwen-Max. |
|
System Prompt |
Biarkan kosong—tes ini tidak memerlukannya. Untuk informasi lebih lanjut, lihat Perbedaan System Prompt vs. Scorer Prompt. |
|
Scorer Template |
Pilih Semantic Similarity, dan pilih dataset “QA test data” yang telah dibuat sebelumnya. |
|
Scoring Range |
Pilih “Common-sense QA accuracy” yang telah dibuat sebelumnya. |
|
Pass Threshold |
Tes ini tidak berpartisipasi. |
4. Periksa status tugas
Temukan tugas "QA accuracy test" dan periksa kolom Evaluation Status-nya:
-
Pending: Selama periode permintaan puncak, tugas evaluasi masuk antrian untuk dieksekusi.
-
In Progress: Sistem sedang mengevaluasi—mohon tunggu dengan sabar.
-
Completed: Evaluasi selesai—Anda dapat melihat hasilnya.
-
Evaluation Failed: Eksekusi tugas evaluasi gagal.
-
Stop Evaluation: Tugas evaluasi dihentikan secara manual oleh pengguna.
Klik tombol refresh (
) di pojok kanan atas. Saat status tugas berubah menjadi Completed, klik kolom Task Name untuk masuk ke halaman detail.
-
Pilih tab Data Details untuk melihat penilaian terperinci tiap titik data.
Nama kolom
Deskripsi
Status
Status evaluasi: Pending, In Progress, Evaluation Complete, Evaluation Failed, Evaluation Terminated
No.
ID sampel
Prompt
Pertanyaan asli
Completion
Jawaban referensi
Output
Respons yang dihasilkan model
[Nama dimensi evaluasi]
Sesuai dengan nama dimensi evaluasi—misalnya, “Common-sense QA accuracy”—dan menampilkan hasil penilaian.
Actions
Aksi pengguna yang tersedia—misalnya, klik Details untuk melihat pertanyaan, jawaban, dan hasil evaluasi lengkap.
-
Pilih tab Metric Statistics untuk melihat statistik evaluasi.
Nama metrik
Deskripsi
Nilai contoh
Overall Score
Rata-rata skor di seluruh dimensi evaluasi
100
Pass Rate
Persentase sampel yang memenuhi ambang batas (≥3 poin)
90%
Total Evaluation Sets
Total jumlah item data uji
10 item
Completed
Jumlah evaluasi yang selesai
10 item
Remaining
Jumlah evaluasi yang belum selesai
0 item
Konsep inti
Ikhtisar evaluasi kustom
Model Studio menyediakan fitur evaluasi kustom yang memungkinkan Anda menilai kualitas model di berbagai dimensi menggunakan standar evaluasi dan data uji Anda sendiri. Evaluasi kustom mendukung lima jenis dimensi evaluasi—lihat bagian Evaluasi kustom di bawah untuk detailnya.
Custom evaluation
Model yang didukung
Mendukung model preset berikut (termasuk versi fine-tuned):
-
Qwen-QwQ/Max/Plus/Turbo/Coder/Math
-
Versi open-source Qwen (Qwen3, Qwen2.5, Qwen2, Qwen1.5)
-
Tongyi Farui
-
Model generasi teks pihak ketiga (abab6.5g, abab6.5t, dll.)
Daftar di atas tidak lengkap dan dapat berubah. Selalu merujuk ke halaman Create Evaluation Task untuk daftar terkini Evaluate Model. Model yang ditampilkan dalam warna abu-abu tanpa tombol Apply saat ini tidak didukung untuk evaluasi.
Dimensi evaluasi
Dimensi evaluasi mendefinisikan kriteria penilaian—cara Anda memberi skor pada model. Anda harus membuat dimensi evaluasi sebelum melakukan evaluasi kustom.
-
Jenis dimensi evaluasi (lima jenis)
Jenis
Metode Penilaian
Skenario Penerapan
Biaya
Rekomendasi
Model Evaluation - Numeric
Juri AI memberikan skor (1–5 poin)
Kualitas QA dan pembuatan konten
Sedang
⭐⭐⭐⭐⭐
Rule Evaluation - Text Similarity
Algoritma penghitung kemiripan
Terjemahan, ringkasan, dan penulisan ulang
Rendah
⭐⭐⭐⭐
Model Evaluation - Classification
Juri AI melakukan klasifikasi (Lulus/Gagal)
Moderasi konten dan verifikasi kebenaran
Sedang
⭐⭐⭐
Rule Evaluation - String Matching
Pencocokan string eksak
Function Calling dan NL2SQL
Sangat rendah
⭐⭐⭐
Manual Evaluation - Classification
Pelabelan manual
Kreativitas dan penilaian profesional
Tinggi
⭐⭐
-
Cara memilih jenis dimensi evaluasi dengan cepat?
Satu tugas evaluasi dapat menggabungkan beberapa dimensi evaluasi.
Data evaluasi
-
Jenis sumber data
Jenis data
Deskripsi
Alur kerja
Skenario penerapan
Evaluation dataset
Berisi pertanyaan (prompt) dan jawaban referensi (completion)
Sistem memanggil model untuk inferensi real-time, menghasilkan output, lalu penilai memberikan skor.
-
Evaluasi awal
-
Perbandingan beberapa model
-
Model belum menghasilkan output
Inference result set
Sudah berisi output model
Sistem langsung membaca output dan penilai memberikan skor (tanpa perlu inferensi).
-
Model telah menghasilkan output
-
Pengurangan biaya inferensi
-
Model garis dasar untuk kelompok kontrol
-
-
Persyaratan format data: Excel
-
Contoh evaluation dataset:
Prompt
Completion
Apa itu komputasi awan?
Komputasi awan adalah kumpulan sumber daya komputasi bersama yang tersedia sesuai permintaan.
Bagaimana Python mendefinisikan fungsi?
Anda dapat menggunakan kata kunci def untuk mendefinisikan fungsi.
-
Contoh set hasil inferensi:
Tambahkan satu kolom Output lagi.
Prompt
Completion
Output
What is cloud computing?
Cloud computing is an on-demand pool of shared computing resources.
Cloud computing is a service model that delivers computing resources over the internet...
-
Rekomendasi volume data:
Fase
Kuantitas yang Direkomendasikan
Deskripsi
Validasi skala kecil
50–100 item
Memverifikasi kebenaran konfigurasi.
Evaluasi formal
200–500 item
Mendapatkan hasil statistik yang andal.
Penilaian komprehensif
500+ item
Mencakup berbagai kasus tepi.
Leaderboard
Apa itu leaderboard:
-
Bandingkan kinerja beberapa model pada dimensi evaluasi yang sama.
-
Tampilkan peringkat model secara visual.
-
Dukung perbandingan horizontal di beberapa tugas evaluasi.
Kapan Anda memerlukan leaderboard:
-
Bandingkan kinerja beberapa model (misalnya GPT-4 vs Claude vs Qwen).
-
Tunjukkan secara visual kekuatan/kelemahan model dalam skenario bisnis.
-
Bagikan hasil perbandingan model dalam tim Anda.
Variabel inti
Ruang lingkup penerapan: Bagian ini hanya berlaku untuk dimensi evaluasi Model Evaluation - Numeric dan Model Evaluation - Classification.
Saat evaluasi model besar, model juri menerima tiga variabel ini:
|
Nama variabel |
Deskripsi |
Contoh |
Skenario penerapan |
|
|
Input asli: pertanyaan atau instruksi dari pengguna |
What is cloud computing? |
Diperlukan di semua skenario |
|
|
Output model: respons yang dihasilkan oleh model |
Cloud computing is a service delivered over... |
Diperlukan di semua skenario |
|
|
Jawaban referensi: jawaban standar atau output yang diharapkan |
Cloud computing is an on-demand... |
Gunakan saat jawaban standar tersedia |
Cara menggunakan dalam Prompt:
Please evaluate the quality of the following response:
**User question**: ${prompt}
**Model response**: ${output}
**Reference answer**: ${completion}
Scoring criteria:
- 5 points: Response is completely correct and semantically matches reference answer
- 4 points: Response is mostly correct with minor deviations
- 3 points: Response is partially correct
- 2 points: Response is mostly incorrect
- 1 point: Response is completely wrong or irrelevant
Perbedaan System Prompt vs. Scorer Prompt
Dalam evaluasi model, dua konfigurasi Prompt yang mudah dikacaukan memiliki tujuan berbeda:
|
Jenis Prompt |
Lokasi Konfigurasi |
Target |
Fase Aksi |
Wajib? |
Atribusi Biaya |
|
System Prompt |
Saat membuat Evaluation Task |
Model yang dievaluasi |
Saat model menghasilkan jawaban |
Tidak |
|
|
Scorer Prompt |
Saat membuat dimensi evaluasi Model Evaluation - Numeric dan Model Evaluation - Classification |
Model juri |
Saat model juri memberi skor jawaban |
Ya |
Penjelasan terperinci
-
System Prompt
-
Tujuan: Menentukan peran atau panduan perilaku untuk model yang dievaluasi.
-
Contoh skenario:
-
Mengevaluasi layanan pelanggan: "Anda adalah perwakilan layanan pelanggan profesional. Jawab pertanyaan pelanggan dengan sopan dan akurat."
-
Mengevaluasi asisten kode: "Anda adalah ahli pemrograman. Berikan contoh kode yang akurat dan ringkas."
-
-
Kapan digunakan: Isi hanya saat Anda perlu memberikan identitas atau batasan spesifik kepada model yang dievaluasi—biarkan kosong dalam kebanyakan kasus.
-
-
Scorer Prompt
-
Tujuan: Memberi tahu model juri cara mengevaluasi kualitas jawaban dan kriteria penilaian apa yang digunakan.
-
Ruang lingkup penerapan: Diperlukan hanya untuk dimensi evaluasi Model Evaluation - Numeric dan Model Evaluation - Classification.
-
Metode konfigurasi:
-
Pilih templat preset sistem (Comprehensive Evaluation, Semantic Similarity, Sentiment Analysis, dll.).
-
Tulis prompt kustom (untuk skenario bisnis spesifik).
-
-
Scorer Prompt dapat menggunakan variabel ${prompt}, ${output}, ${completion}.
-
Analogi yang hidup
-
System Prompt: Memberi tahu "siswa" (model yang dievaluasi) peran apa yang harus diasumsikan saat mengikuti ujian.
-
Scorer Prompt: Memberi tahu "penguji" (model juri) cara menilai ujian dan standar penilaian apa yang diterapkan.
Kasus praktik berbasis skenario
Custom Evaluation:Model Evaluation - Numeric
Skenario penerapan: Situasi yang memerlukan penilaian granular, seperti kualitas QA, kualitas pembuatan konten, atau kualitas dialog layanan pelanggan.
Rekomendasi:
-
Buat kriteria penilaian spesifik—berikan deskripsi jelas untuk tiap level skor.
-
Periksa secara berkala sampel dengan skor tinggi dan rendah untuk memverifikasi akurasi.
-
Hindari pengelompokan semua sampel dalam satu rentang skor.
Prosedur:
1. Buat dimensi evaluasi
Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Dimension, lalu klik tombol Create Evaluation Dimension di pojok kanan atas.
Isi formulir dan klik tombol Save.
|
Item |
Konten |
|
Dimension Name |
Akurasi QA akal sehat |
|
Description |
Evaluasi akurasi model dalam menjawab pertanyaan berbasis akal sehat |
|
Type |
Pilih Model Evaluation - Numeric |
|
Judge Model |
Pilih Qwen-Max |
|
Scorer Template |
Pilih Semantic Similarity |
|
Scoring Range |
Pertahankan default 0~5 |
|
Pass Threshold |
3.0 |
Catatan terkait:
Untuk memilih Scorer Template, antarmuka menyediakan tiga tombol radio—pilih salah satu. Untuk informasi selengkapnya, lihat dokumentasi mengenai variabel Prompt dan perbedaan System Prompt.
|
Templat |
Deskripsi |
Skenario Penerapan |
Perlu Prompt Kustom? |
|
Comprehensive Evaluation (default) |
Templat preset sistem yang memberikan skor berdasarkan lima dimensi: relevansi, sensitivitas budaya, kelengkapan informasi, kejelasan, dan keterlibatan pengguna. |
Percakapan umum dan layanan pelanggan |
Tidak—dapat digunakan langsung atau dimodifikasi sesuai kebutuhan |
|
Semantic Similarity |
Templat preset sistem yang mengevaluasi kedekatan semantik antara output dan jawaban referensi. |
Sistem QA dan pengambilan pengetahuan |
Tidak—dapat digunakan langsung atau dimodifikasi sesuai kebutuhan |
|
Custom Evaluation |
Buat prompt Anda sendiri. |
Skenario bisnis spesifik |
Ya—buat sesuai kebutuhan Anda |
2. Siapkan data uji
Lokasi antarmuka: Buka halaman Data Management, lalu klik tombol Add Dataset di pojok kanan atas.
Isi formulir dan klik tombol Confirm.
|
Item |
Konten |
|
Dimension Name |
Data uji QA |
|
Description |
Pilih tipe Evaluation Set. ❗ Evaluasi model hanya mendukung dataset bertipe Evaluation Set—bukan set pelatihan. |
|
Type |
Unggah Sample Data_QA Test Data.xlsx (lampiran CMS, file_id=151014, unduh online). |
3. Buat tugas evaluasi
Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Task, lalu klik tombol Create Evaluation Task di pojok kanan atas.
Isi formulir dan klik tombol Evaluate.
|
Item |
Konten |
|
Dimension Name |
Tes akurasi QA |
|
Evaluation Object |
Pilih Qwen-Plus. |
|
Judge Model |
Pilih Qwen-Max. |
|
System Prompt |
Biarkan kosong—tes ini tidak memerlukannya. Untuk informasi lebih lanjut, lihat Perbedaan System Prompt vs. Scorer Prompt. |
|
Scorer Template |
Pilih Semantic Similarity, lalu pilih dataset “QA test data” yang telah dibuat sebelumnya. |
|
Scoring Range |
Pilih “Common-sense QA accuracy” yang telah dibuat sebelumnya. |
|
Pass Threshold |
Tes ini tidak berpartisipasi. |
4. Periksa status tugas
Temukan tugas "QA accuracy test" dan periksa kolom Evaluation Status-nya:
-
Pending: Selama periode permintaan puncak, tugas evaluasi masuk antrian untuk dieksekusi.
-
In Progress: Sistem sedang mengevaluasi—mohon tunggu dengan sabar.
-
Completed: Evaluasi selesai—Anda dapat melihat hasilnya.
-
Evaluation Failed: Eksekusi tugas evaluasi gagal.
-
Stop Evaluation: Tugas evaluasi dihentikan secara manual oleh pengguna.
Klik tombol refresh (
) di pojok kanan atas. Saat status tugas berubah menjadi Completed, klik kolom Task Name untuk masuk ke halaman detail.
-
Pilih tab Data Details untuk melihat penilaian terperinci tiap titik data.
Nama kolom
Deskripsi
Status
Status evaluasi: Pending, In Progress, Evaluation Complete, Evaluation Failed, Evaluation Terminated
No.
ID sampel
Prompt
Pertanyaan asli
Completion
Jawaban referensi
Output
Respons yang dihasilkan model
[Nama dimensi evaluasi]
Sesuai dengan nama dimensi evaluasi—misalnya, “Common-sense QA accuracy”—dan menampilkan hasil penilaian.
Actions
Aksi pengguna yang tersedia—misalnya, klik Details untuk melihat pertanyaan, jawaban, dan hasil evaluasi lengkap.
-
Pilih tab Metric Statistics untuk melihat statistik evaluasi.
Nama metrik
Deskripsi
Nilai contoh
Overall Score
Rata-rata skor dari seluruh dimensi evaluasi
100
Pass Rate
Persentase sampel yang memenuhi ambang batas (≥3 poin)
90%
Total Evaluation Sets
Total jumlah item data uji
10 item
Completed
Jumlah evaluasi yang telah selesai
10 item
Remaining
Jumlah evaluasi yang belum selesai
0 item
Evaluasi kustom: Dimensi evaluasi Large Model Evaluation - Classification
Skenario penerapan: Situasi yang memerlukan penilaian biner seperti "ya/tidak" atau "lulus/gagal", seperti moderasi konten atau verifikasi kebenaran jawaban.
Rekomendasi:
-
Tentukan kondisi penilaian dengan jelas untuk tiap label dalam Prompt Anda.
-
Secara eksplisit minta model juri hanya mengeluarkan nama label.
-
Periksa secara berkala sampel untuk memastikan akurasi.
Prosedur:
1. Buat dimensi evaluasi
Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Dimension, lalu klik tombol Create Evaluation Dimension di pojok kanan atas.
Isi formulir dan klik tombol Save.
|
Item |
Konten |
|
Dimension Name |
Analisis sentimen |
|
Description |
Deteksi sentimen pelanggan |
|
Type |
Pilih Auto |
|
Judge Model |
Pilih Qwen-Max |
|
Scorer Template |
Pilih Sentiment Analysis |
|
Scoring Range |
Tidak perlu dimodifikasi—gunakan konten default |
Catatan terkait:
Untuk memilih Scorer Template, antarmuka menyediakan tiga tombol radio—pilih salah satu. Untuk informasi selengkapnya, lihat dokumentasi mengenai variabel Prompt dan perbedaan System Prompt.
|
Templat |
Deskripsi |
Skenario penerapan |
Perlu prompt kustom? |
|
Standard Match (default) |
Templat preset sistem yang memeriksa kecocokan antara output model dan jawaban referensi. |
Label klasifikasi, nama fungsi, dan jawaban tetap |
Tidak—gunakan langsung atau modifikasi sesuai kebutuhan. |
|
Sentiment Analysis |
Templat preset sistem yang menganalisis sentimen teks (positif, netral, atau negatif). |
Ulasan pengguna, dialog layanan pelanggan, dan pemantauan opini publik |
Tidak—gunakan langsung atau modifikasi sesuai kebutuhan. |
|
Custom Scorer |
Buat prompt Anda sendiri. |
Skenario kustom seperti penilaian gaya, pemeriksaan kepatuhan, dan verifikasi logika |
Diperlukan. Buat sesuai kebutuhan. |
2. Siapkan data uji
Lokasi antarmuka: Buka halaman Data Management, lalu klik tombol Add Dataset di pojok kanan atas.
Isi formulir dan klik tombol Confirm.
|
Item |
Konten |
|
Dimension Name |
Data uji analisis sentimen |
|
Description |
Pilih tipe Evaluation Set. ❗ Evaluasi model hanya mendukung dataset bertipe Evaluation Set—bukan set pelatihan. |
|
Type |
Unggah Sample Data_Sentiment Analysis.xlsx (lampiran ICMS, file_id=151061, unduh online). |
3. Buat tugas evaluasi
Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Task, lalu klik tombol Create Evaluation Task di pojok kanan atas.
Isi formulir dan klik tombol Evaluate.
|
Item |
Konten |
|
Dimension Name |
Tes analisis sentimen |
|
Evaluation Dimension |
Pilih Sentiment Analysis. |
|
Judge Model |
Pilih Qwen-Max. |
|
System Prompt |
Biarkan kosong—tes ini tidak memerlukannya. Untuk informasi selengkapnya, lihat Perbedaan System Prompt vs. Scorer Prompt. |
|
Scorer Template |
Pilih Semantic Similarity, lalu pilih dataset "Sentiment analysis test data" yang telah dibuat sebelumnya. |
|
Scoring Range |
Pilih "Sentiment Analysis" yang telah dibuat sebelumnya. |
|
Pass Threshold |
Anda tidak berpartisipasi dalam tes ini. |
4. Periksa status tugas
Temukan tugas "Sentiment analysis test" dan periksa kolom Evaluation Status-nya:
-
Pending: Selama periode permintaan puncak, tugas evaluasi masuk antrian untuk dieksekusi.
-
In Progress: Sistem sedang mengevaluasi—mohon tunggu dengan sabar.
-
Completed: Evaluasi selesai—Anda dapat melihat hasilnya.
-
Evaluation Failed: Eksekusi tugas evaluasi gagal.
-
Stop Evaluation: Tugas evaluasi dihentikan secara manual oleh pengguna.
Klik tombol refresh (
) di pojok kanan atas. Saat status tugas berubah menjadi Completed, klik kolom Task Name untuk masuk ke halaman detail.
-
Pilih tab Data Details untuk melihat penilaian terperinci tiap titik data.
Nama Kolom
Deskripsi
Status
Status evaluasi: Pending, In Progress, Evaluation Complete, Evaluation Failed, Evaluation Terminated
No.
ID sampel
Prompt
Pertanyaan asli
Completion
Jawaban referensi
Output
Respons yang dihasilkan model
[Nama dimensi evaluasi]
Sesuai dengan nama dimensi evaluasi—misalnya, "Sentiment Analysis"—dan menampilkan hasil analisis.
Actions
Aksi pengguna yang tersedia—misalnya, klik Details untuk melihat pertanyaan, jawaban, dan hasil evaluasi lengkap.
-
Pilih tab Metric Statistics untuk melihat statistik evaluasi.
Nama metrik
Deskripsi
Nilai contoh
Overall Score
Rata-rata skor dari seluruh dimensi evaluasi
40
Pass Rate
Persentase sampel yang lulus
40%
Score Details - Data Item Distribution
Distribusi hasil evaluasi klasifikasi
Total Evaluation Sets
Total jumlah item data uji
10 item
Completed
Jumlah evaluasi yang telah selesai
10 item
Remaining
Jumlah evaluasi yang belum selesai
0 item
Evaluasi kustom: Dimensi evaluasi Large Model Evaluation - Numerical
Skenario penerapan: Situasi yang memerlukan penilaian komprehensif multi-dimensi, seperti penilaian kualitas jawaban, penilaian keamanan konten, atau penilaian kualitas terjemahan.
Rekomendasi:
-
Tetapkan rentang skor dan ambang batas kelulusan yang sesuai—uji skala kecil terlebih dahulu sebelum evaluasi batch.
-
Pilih templat penilai yang sesuai: Comprehensive Evaluation untuk skenario umum, Semantic Similarity untuk skenario dengan jawaban referensi.
-
Saat menulis Prompt penilai kustom, definisikan dengan jelas kriteria penilaian dan rentang nilai.
Prosedur:
1. Buat dimensi evaluasi
Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Dimension, lalu klik tombol Create Evaluation Dimension di pojok kanan atas.
Isi formulir dan klik tombol Save.
|
Item |
Konten |
|
Dimension Name |
Penilaian kualitas komprehensif |
|
Description |
Evaluasi kualitas komprehensif respons model |
|
Type |
Pilih Model Evaluation - Numeric |
|
Judge Model |
Pilih Qwen-Max |
|
Scorer Template |
Pilih Comprehensive Evaluation (default) |
|
Prompt |
Tidak perlu dimodifikasi—gunakan konten default |
|
Scoring Range |
Gunakan nilai default 0-5 |
|
Pass Threshold |
Gunakan nilai default 3.0—sampel dengan skor ≥3.0 ditandai Lulus |
Catatan terkait:
Untuk memilih Scorer Template, antarmuka menampilkan tiga tombol radio—pilih salah satu. Untuk informasi selengkapnya, lihat dokumentasi mengenai variabel Prompt dan perbedaan System Prompt.
|
Templat |
Deskripsi |
Skenario penerapan |
Perlu Prompt kustom? |
|
Comprehensive Evaluation (default) |
Templat preset sistem yang memberikan skor respons berdasarkan lima dimensi: relevansi, sensitivitas budaya, kelengkapan informasi, kejelasan, dan keterlibatan pengguna. |
Penilaian kualitas jawaban umum |
Tidak—dapat digunakan langsung atau dimodifikasi sesuai kebutuhan. |
|
Semantic Similarity |
Templat preset sistem yang mengevaluasi kesamaan semantik antara output model dan jawaban referensi. |
Skenario dengan jawaban referensi yang jelas, seperti QA berbasis pengetahuan atau terjemahan. |
Tidak—dapat digunakan langsung atau dimodifikasi sesuai kebutuhan. |
|
Custom Evaluation |
Buat prompt Anda sendiri—tentukan kriteria penilaian dan rentang nilai dalam prompt tersebut. |
Skenario kustom, seperti penilaian di domain profesional atau berdasarkan metrik spesifik. |
Diperlukan. Buat sesuai kebutuhan. |
Tentang score range dan pass threshold:
-
Score range: Tetapkan nilai minimum dan maksimum integer untuk penilaian model juri (default 0–5). Model juri akan memberi skor tiap item evaluasi dalam rentang ini.
-
Pass threshold: Skor ≥ ambang batas ditandai Lulus, skor di bawah ditandai Gagal. Rentang ambang batas dibatasi oleh rentang skor dan mendukung desimal (ukuran langkah 0.1), default adalah 3.0.
2. Siapkan data uji
Lokasi antarmuka: Buka halaman Data Management, lalu klik tombol Add Dataset di pojok kanan atas.
Isi formulir dan klik tombol Confirm.
|
Item |
Konten |
|
Dimension Name |
Data uji untuk penilaian kualitas komprehensif |
|
Description |
Pilih tipe Evaluation Set. ❗ Evaluasi model hanya mendukung dataset bertipe Evaluation Set—bukan set pelatihan. |
|
Type |
Unggah file data uji dalam format JSONL, dengan setiap baris berisi bidang prompt dan completion. |
3. Buat tugas evaluasi
Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Task, lalu klik tombol Create Evaluation Task di pojok kanan atas.
Isi formulir dan klik tombol Evaluate.
|
Item |
Konten |
|
Dimension Name |
Tes penilaian kualitas komprehensif |
|
Evaluate Model |
Pilih Qwen-Max. |
|
Judge Model |
Pilih Qwen-Max. |
|
System Prompt |
Biarkan kosong—tes ini tidak memerlukannya. Untuk informasi lebih lanjut, lihat Perbedaan System Prompt vs. Scorer Prompt. |
|
Scorer Template |
Pilih Comprehensive Evaluation dan pilih dataset “Comprehensive quality assessment test data” yang telah dibuat sebelumnya. |
|
Scoring Range |
Pilih “Comprehensive quality assessment” yang telah dibuat sebelumnya. |
|
Pass Threshold |
Anda tidak berpartisipasi dalam tes ini. |
4. Periksa status tugas
Temukan tugas "Comprehensive quality assessment test" dan periksa kolom Evaluation Status-nya:
-
Pending: Selama periode permintaan puncak, tugas evaluasi masuk antrian untuk dieksekusi.
-
In Progress: Sistem sedang mengevaluasi—mohon tunggu dengan sabar.
-
Completed: Evaluasi selesai—Anda dapat melihat hasilnya.
-
Evaluation Failed: Eksekusi tugas evaluasi gagal.
-
Stop Evaluation: Tugas evaluasi dihentikan secara manual oleh pengguna.
Klik tombol refresh (
) di pojok kanan atas. Saat status tugas berubah menjadi Completed, klik kolom Task Name untuk masuk ke halaman detail.
-
Pilih tab Data Details untuk melihat penilaian terperinci tiap titik data.
Nama Kolom
Deskripsi
Status
Status evaluasi: Pending, In Progress, Evaluation Complete, Evaluation Failed, Evaluation Terminated
No.
ID sampel
Prompt
Pertanyaan asli
Completion
Jawaban referensi
Output
Respons yang dihasilkan model
[Nama dimensi evaluasi]
Sesuai dengan nama dimensi evaluasi—misalnya, “Comprehensive Quality Assessment”—dan menampilkan skor numerik dari model juri.
Actions
Aksi pengguna yang tersedia—misalnya, klik Details untuk melihat pertanyaan, jawaban, dan hasil evaluasi lengkap.
-
Pilih tab Metric Statistics untuk melihat statistik evaluasi.
Nama metrik
Deskripsi
Nilai contoh
Overall Score
Rata-rata skor dari seluruh dimensi evaluasi (untuk dimensi numerik, nilai ini merupakan rata-rata aritmetika dari semua skor sampel)
3,8
Pass Rate
Persentase sampel yang memiliki skor lebih besar atau sama dengan ambang batas kelulusan
70%
Total Evaluation Sets
Total jumlah item data uji
10 item
Completed
Jumlah evaluasi yang telah selesai
10 item
Remaining
Jumlah evaluasi yang belum selesai
0 item
Evaluasi kustom: Dimensi evaluasi Rule-based Evaluation - String Match
Skenario penerapan: Format jawaban tetap yang memerlukan pencocokan eksak, seperti Function Calling atau NL2SQL.
Rekomendasi:
-
Pra-pemrosesan normalisasi: standarisasi huruf besar/kecil, hapus spasi ekstra.
-
Untuk sinonim, pertimbangkan menggunakan penilai kesamaan teks sebagai gantinya.
-
Uji aturan pencocokan dengan sampel kecil terlebih dahulu untuk memverifikasi ekspektasi.
Prosedur:
1. Buat dimensi evaluasi
Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Dimension, lalu klik tombol Create Evaluation Dimension di pojok kanan atas.
Isi formulir dan klik tombol Save.
|
Item |
Konten |
|
Dimension Name |
Validasi Function Calling |
|
Description |
Periksa apakah model memanggil fungsi yang ditentukan dengan benar |
|
Type |
Pilih Rule Evaluation - String Matching |
|
Compare Text |
Kolom tiga: kotak teks kiri masukkan Masukkan variabel output model di kotak teks kiri, variabel jawaban referensi di kotak teks kanan |
Cara memilih aturan pencocokan:
|
Aturan |
Deskripsi Perilaku |
Aplikasi Khas |
|
Equal |
Identik persis (tidak peka huruf besar/kecil) |
Validasi nama kota, jawaban tetap |
|
Not Equal |
Sepenuhnya berbeda (tidak peka huruf besar/kecil) |
Penyaringan kata terlarang |
|
Contains |
Berisi string yang ditentukan |
Pemeriksaan kata kunci, validasi informasi penting |
|
Starts With |
Diawali dengan string yang ditentukan |
Validasi awalan, pemeriksaan format |
|
Ends With |
Diakhiri dengan string yang ditentukan |
Validasi akhiran, pemeriksaan terminator |
Contoh data evaluasi:
{"prompt": "What's the weather like in Beijing today?","completion": "query_weather"}
Jika aturan pencocokan adalah "Contains", ketika output model berisi query_weather, maka ditandai Lulus.
2. Siapkan data uji
Lokasi antarmuka: Buka halaman Data Management, lalu klik tombol Add Dataset di pojok kanan atas.
Isi formulir dan klik tombol Confirm.
|
Item |
Konten |
|
Dimension Name |
Data uji Function Calling |
|
Description |
Pilih tipe Evaluation Set. ❗ Evaluasi model hanya mendukung dataset bertipe Evaluation Set—bukan set pelatihan. |
|
Type |
Unggah Sample Data_Function_Calling.xlsx (lampiran ICMS, file_id=151064, unduh online). |
3. Buat tugas evaluasi
Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Task, lalu klik tombol Create Evaluation Task di pojok kanan atas.
Isi formulir dan klik tombol Evaluate.
|
Item |
Konten |
|
Dimension Name |
Tes Function Calling |
|
Evaluation Set |
Pilih Function Calling test data. |
|
Judge Model |
Pilih Qwen-Max. |
|
System Prompt |
Biarkan kosong—tes ini tidak memerlukannya. Untuk informasi lebih lanjut, lihat Perbedaan System Prompt vs. Scorer Prompt. |
|
Scorer Template |
Pilih Comprehensive Evaluation dan pilih dataset "Function Calling test data" yang telah dibuat sebelumnya. |
|
Scoring Range |
Pilih "Function Calling validation" yang telah dibuat sebelumnya. |
|
Pass Threshold |
Anda tidak berpartisipasi dalam tes ini. |
4. Periksa status tugas
Temukan tugas "Function Calling test" dan periksa kolom Evaluation Status-nya:
-
Pending: Selama periode permintaan puncak, tugas evaluasi masuk antrian untuk dieksekusi.
-
In Progress: Sistem sedang mengevaluasi—mohon tunggu dengan sabar.
-
Completed: Evaluasi selesai—Anda dapat melihat hasilnya.
-
Evaluation Failed: Eksekusi tugas evaluasi gagal.
-
Stop Evaluation: Tugas evaluasi dihentikan secara manual oleh pengguna.
Klik tombol refresh (
) di pojok kanan atas. Saat status tugas berubah menjadi Completed, klik kolom Task Name untuk masuk ke halaman detail.
-
Pilih tab Data Details untuk melihat penilaian terperinci tiap titik data.
Nama Kolom
Deskripsi
Status
Status evaluasi: Pending, In Progress, Evaluation Complete, Evaluation Failed, Evaluation Terminated
No.
ID sampel
Prompt
Pertanyaan asli
Completion
Jawaban referensi
Output
Respons yang dihasilkan model
[Nama dimensi evaluasi]
Sesuai dengan nama dimensi evaluasi—misalnya, “Function Calling validation”—dan menampilkan hasil analisis.
Actions
Aksi pengguna yang tersedia—misalnya, klik Details untuk melihat pertanyaan, jawaban, dan hasil evaluasi lengkap.
-
Pilih tab Metric Statistics untuk melihat statistik evaluasi.
Nama metrik
Deskripsi
Nilai contoh
Overall Score
Rata-rata skor dari seluruh dimensi evaluasi
100
Pass Rate
Persentase sampel yang lulus
100%
Total Evaluation Sets
Total jumlah item data uji
2 item
Completed
Jumlah evaluasi yang telah selesai
2 item
Remaining
Jumlah evaluasi yang belum selesai
0 item
Evaluasi kustom: Dimensi evaluasi Rule-based Evaluation - Text Similarity
Skenario penerapan: Situasi di mana jawaban bervariasi dalam redaksi tetapi memiliki makna yang sama, seperti terjemahan, ringkasan, atau penulisan ulang.
Rekomendasi:
-
Uji dengan sampel kecil terlebih dahulu—amati distribusi tingkat kelulusan sebelum menyesuaikan ambang batas.
-
Fokus pada urutan kata dan pencocokan eksak → pilih BLEU.
-
Fokus pada pemahaman semantik → pilih Cosine.
-
Perlu toleransi kesalahan → pilih Fuzzy Match.
-
Fokus pada cakupan informasi kunci → pilih ROUGE-L.
Prosedur:
1. Buat dimensi evaluasi
Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Dimension, lalu klik tombol Create Evaluation Dimension di pojok kanan atas.
Isi formulir dan klik tombol Save.
|
Item |
Konten |
|
Dimension Name |
Kualitas terjemahan |
|
Description |
Evaluasi kualitas terjemahan Tiongkok-Inggris |
|
Type |
Pilih Rule Evaluation - Text Similarity |
|
Algoritma kesamaan |
Pilih |
|
Scorer Template |
Kiri: Masukkan variabel output model di kotak teks kiri, variabel jawaban referensi di kotak teks kanan |
|
Pass Threshold |
Tetapkan ke 0.4—sampel dengan kesamaan ≥0.4 ditandai Lulus (rentang 0~1) |
Cara memilih algoritma kesamaan:
|
Algoritma |
Karakteristik |
Skenario Terbaik |
Rekomendasi Ambang Batas |
|
ROUGE-L |
Berdasarkan subsekuens umum terpanjang |
Ringkasan |
0,4–0,6 |
|
BLEU |
Berdasarkan pencocokan presisi n-gram dan sensitif terhadap urutan kata |
Terjemahan mesin |
0,3–0,5 |
|
Cosine |
Mengukur kesamaan dalam ruang vektor dan menangkap makna semantik |
QA terbuka dan pemahaman semantik |
0,6–0,8 |
|
Fuzzy Match |
Berdasarkan jarak edit dan memberikan toleransi kesalahan tinggi |
OCR dan pengenalan suara |
0,7–0,9 |
|
Accuracy |
Memerlukan pencocokan eksak |
Verifikasi jawaban presisi |
1,0 |
2. Siapkan data uji
Lokasi antarmuka: Buka halaman Data Management, lalu klik tombol Add Dataset di pojok kanan atas.
Isi formulir dan klik tombol Confirm.
|
Item |
Konten |
|
Dimension Name |
Data uji Tiongkok–Inggris |
|
Description |
Pilih tipe Evaluation Set. ❗ Evaluasi model hanya mendukung dataset bertipe Evaluation Set—bukan set pelatihan. |
|
Type |
Unggah Sample Data_Chinese-to-English.xlsx (lampiran ICMS, file_id=151065, unduh online). |
3. Buat tugas evaluasi
Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Task, lalu klik tombol Create Evaluation Task di pojok kanan atas.
Isi formulir dan klik tombol Evaluate.
|
Item |
Konten |
|
Dimension Name |
Evaluasi kualitas terjemahan |
|
Evaluate Model |
Pilih Qwen-Max. |
|
Judge Model |
Pilih Qwen-Max. |
|
System Prompt |
Biarkan kosong—tes ini tidak memerlukannya. Untuk informasi lebih lanjut, lihat Perbedaan System Prompt vs. Scorer Prompt. |
|
Scorer Template |
Pilih Comprehensive Evaluation dan pilih dataset "Chinese-to-English test data" yang telah dibuat sebelumnya. |
|
Scoring Range |
Pilih "Translation quality" yang telah dibuat sebelumnya. |
|
Pass Threshold |
Tidak termasuk dalam tes ini. |
4. Periksa status tugas
Temukan tugas "Translation quality evaluation" dan periksa kolom Evaluation Status-nya:
-
Pending: Selama periode permintaan puncak, tugas evaluasi masuk antrian untuk dieksekusi.
-
In Progress: Sistem sedang mengevaluasi—mohon tunggu dengan sabar.
-
Completed: Evaluasi selesai—Anda dapat melihat hasilnya.
-
Evaluation Failed: Eksekusi tugas evaluasi gagal.
-
Stop Evaluation: Tugas evaluasi dihentikan secara manual oleh pengguna.
Klik tombol refresh (
) di pojok kanan atas. Saat status tugas berubah menjadi Completed, klik kolom Task Name untuk masuk ke halaman detail.
-
Pilih tab Data Details untuk melihat penilaian terperinci tiap titik data.
Nama kolom
Deskripsi
Status
Status evaluasi: Pending, In Progress, Evaluation Complete, Evaluation Failed, Evaluation Terminated
No.
ID sampel
Prompt
Pertanyaan asli
Completion
Jawaban referensi
Output
Respons yang dihasilkan model
[Nama dimensi evaluasi]
Kolom ini menampilkan hasil analisis untuk dimensi evaluasi "Translation Quality".
Actions
Aksi pengguna yang tersedia—misalnya, klik Details untuk melihat pertanyaan, jawaban, dan hasil evaluasi lengkap.
-
Pilih tab Metric Statistics untuk melihat statistik evaluasi.
Nama metrik
Deskripsi
Nilai contoh
Overall Score
Rata-rata skor dari seluruh dimensi evaluasi
100
Pass Rate
Persentase sampel yang lulus
100%
Total Evaluation Sets
Total jumlah item data uji
3 item
Completed
Jumlah evaluasi yang telah selesai
3 item
Remaining
Jumlah evaluasi yang belum selesai
0 item
Evaluasi kustom: Dimensi evaluasi Manual Evaluation - Classification
Skenario penerapan: Situasi yang memerlukan penilaian subjektif manusia, seperti penilaian kreativitas atau tinjauan kualitas profesional.
Rekomendasi:
-
Gunakan evaluasi manual saat kualitas output model tidak dapat dinilai secara tepat hanya oleh algoritma atau model juri.
-
Dokumentasikan kriteria penilaian yang jelas untuk tiap label dalam Panduan Evaluasi eksternal dan latih anotator untuk pemahaman konsisten.
-
Rancang label untuk mencakup semua skenario output yang mungkin menggunakan istilah klasifikasi yang ringkas dan jelas.
-
Minta beberapa evaluator melakukan anotasi silang pada beberapa sampel untuk memverifikasi konsistensi.
-
Hindari menganotasi terlalu banyak data sekaligus—proses secara batch untuk mengurangi efek kelelahan.
Prosedur:
1. Buat dimensi evaluasi
Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Dimension, lalu klik tombol Create Evaluation Dimension di pojok kanan atas.
Isi formulir dan klik tombol Save.
|
Item |
Konten |
|
Dimension Name |
Kreativitas konten |
|
Description |
Menilai kreativitas konten. |
|
Type |
Pilih Manual Evaluation - Classification. |
|
Pass |
Buat dua label: "Excellent" dan "Good." |
|
Fail |
Buat dua label: "Average" dan "Poor." |
2. Siapkan data uji
Lokasi antarmuka: Buka halaman Data Management, lalu klik tombol Add Dataset di pojok kanan atas.
Isi formulir dan klik tombol Confirm.
|
Item |
Konten |
|
Dimension Name |
Data uji kreativitas konten |
|
Description |
Pilih tipe Evaluation Set. ❗ Evaluasi model hanya mendukung dataset bertipe Evaluation Set—bukan set pelatihan. |
|
Type |
Unggah Sample Data_Content Creativity.xlsx (lampiran ICMS, file_id=151066, unduh online). Biarkan Completion kosong agar model dapat menghasilkan respons. |
3. Buat tugas evaluasi
Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Task, lalu klik tombol Create Evaluation Task di pojok kanan atas.
Isi formulir dan klik tombol Evaluate.
|
Item |
Konten |
|
Dimension Name |
Evaluasi kreativitas konten |
|
Evaluate Model |
Pilih Qwen-Plus. |
|
Judge Model |
Pilih Qwen-Max. |
|
System Prompt |
Biarkan kosong—tes ini tidak memerlukannya. Untuk informasi selengkapnya, lihat Perbedaan System Prompt vs. Scorer Prompt. |
|
Scorer Template |
Pilih Custom Evaluation dan pilih dataset "Content creativity test data" yang telah dibuat sebelumnya. |
|
Scoring Range |
Pilih "Content creativity" yang telah dibuat sebelumnya. |
|
Pass Threshold |
Ini tidak termasuk dalam tes. |
4. Periksa status tugas
Temukan tugas "Content creativity evaluation" dan periksa kolom Evaluation Status-nya—menunjukkan status In Progress. Evaluasi manual memerlukan anotasi manual—sistem tidak akan memberi skor secara otomatis. Klik kolom Task Name untuk masuk ke halaman detail.
-
Pilih tab Data Details, lalu klik tombol Actions kolom Annotate untuk melakukan anotasi manual. Setelah melabeli semua data, status Evaluation Status tugas akan berubah menjadi Completed.
Nama kolom
Deskripsi
Status
Status evaluasi: In progress
No.
ID sampel
Prompt
Pertanyaan asli
Completion
Jawaban referensi
Output
Respons yang dihasilkan model
[Nama dimensi evaluasi]
Sesuai dengan nama dimensi evaluasi—misalnya, "Content creativity evaluation"—dan menampilkan hasil analisis.
Actions
Aksi pengguna yang tersedia—misalnya, klik Details untuk melihat pertanyaan, jawaban, dan hasil evaluasi lengkap.
-
Pilih tab Metric Statistics untuk melihat statistik evaluasi.
Nama metrik
Deskripsi
Nilai contoh
Overall Score
Rata-rata skor dari seluruh dimensi evaluasi
100
Score Details - Data Item Distribution
Distribusi hasil evaluasi klasifikasi
Pass Rate
Persentase sampel yang lulus
100%
Total Evaluation Sets
Total jumlah item data uji
3 item
Completed
Jumlah evaluasi yang telah selesai
3 item
Remaining
Jumlah evaluasi yang belum selesai
0 item
Bandingkan beberapa model menggunakan leaderboard
Skenario penerapan: Bandingkan kinerja beberapa model pada dimensi evaluasi yang sama dan lihat peringkat model secara visual melalui leaderboard.
Rekomendasi:
-
Bandingkan spesifikasi berbeda dalam seri model yang sama (misalnya, qwen-max, qwen-plus, qwen-turbo).
-
Bandingkan model dari vendor berbeda (misalnya, Qwen vs DeepSeek).
-
Bandingkan versi atau konfigurasi berbeda dari model yang sama.
Prasyarat: Anda telah membuat dimensi evaluasi kustom.
Prosedur:
1. Buat leaderboard
Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Leaderboard, lalu klik tombol Create Leaderboard di pojok kanan atas.
Isi formulir dan klik tombol OK.
|
Item |
Konten |
|
Leaderboard Name |
Leaderboard akurasi Common-sense QA |
|
Evaluation Dimension |
Pilih dimensi evaluasi yang tersedia, seperti Common-sense QA accuracy. |
|
Associate Optional Tasks |
Anda dapat memilih tugas evaluasi yang tersedia sekarang atau menambahkannya nanti. |
Catatan:
-
Setiap leaderboard mendukung hingga 50 tugas evaluasi.
-
Setelah membuat leaderboard, Anda tidak dapat mengubah dimensi evaluasinya.
-
Semua tugas dalam leaderboard yang sama menggunakan dimensi evaluasi yang sama untuk memastikan perbandingan yang adil.
2. Tambahkan tugas evaluasi ke leaderboard
Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Leaderboard, lalu klik nama leaderboard untuk masuk ke halaman detailnya.
Leaderboard mendukung dua cara untuk Add Evaluation Task:
Metode 1: Create New Task
-
Di halaman detail leaderboard, klik tombol Add Evaluation Task.
-
Klik Create New Task.
-
Sistem secara otomatis mengarahkan ke halaman pembuatan tugas dengan leaderboard yang telah ditautkan:
-
Include in Leaderboard: Secara otomatis dicentang dan dikunci—tidak dapat dibatalkan centangnya.
-
Leaderboard: Secara otomatis diisi dengan nama leaderboard saat ini dan dikunci.
-
Evaluation Dimension: Secara otomatis diisi dengan dimensi yang ditautkan leaderboard dan dikunci.
-
-
Isi bidang lain yang diperlukan:
-
Task Name: Masukkan nama tugas—sertakan informasi model untuk identifikasi mudah.
-
Evaluate Model: Pilih model yang akan dievaluasi.
-
Data Source: Pilih dataset evaluasi.
-
-
Klik tombol Evaluate.
Metode 2: Select Existing Task
-
Di halaman detail leaderboard, klik tombol Add Evaluation Task.
-
Klik Select Existing Task.
-
Pilih tugas evaluasi yang telah selesai untuk ditambahkan ke leaderboard.
-
Klik tombol OK.
Catatan:
-
Hanya tugas yang telah selesai menggunakan dimensi evaluasi yang sama yang dapat bergabung dengan leaderboard.
-
Gunakan dataset evaluasi yang sama untuk hasil perbandingan yang akurat.
3. Lihat hasil leaderboard
Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Leaderboard, lalu klik nama leaderboard untuk masuk ke halaman detailnya.
Halaman detail leaderboard menampilkan:
|
Nama Kolom |
Deskripsi |
|
Rank |
Peringkat yang dihitung secara otomatis berdasarkan skor leaderboard—semakin tinggi skornya, semakin tinggi peringkatnya. |
|
Task Name |
Nama tugas evaluasi. |
|
Evaluate Model |
Nama model yang digunakan dalam tugas tersebut. |
|
Leaderboard Score |
Skor komprehensif untuk tugas ini pada dimensi evaluasi saat ini (rentang: 0–100). |
|
[Nama dimensi evaluasi] |
Menampilkan skor spesifik untuk dimensi ini—misalnya, dimensi "Semantic Similarity" menunjukkan skor rata-rata kesamaan semantik. |
|
Actions |
Hapus tugas (menghapus tugas dari leaderboard tanpa memengaruhi tugas itu sendiri). |
Catatan:
-
Leaderboard Score diperbarui secara real-time saat evaluasi tugas berlangsung.
-
Tugas yang sedang berlangsung menampilkan "-" di kolom skor.
-
Klik Task Name untuk melihat data evaluasi terperinci.
Teknik lanjutan
Praktik terbaik untuk desain dimensi evaluasi
Tanggung jawab tunggal:
-
Setiap dimensi evaluasi harus fokus pada satu tujuan evaluasi.
-
Hindari mencampur beberapa standar.
-
Contoh: Jangan menilai "akurasi" dan "kelancaran" dalam dimensi yang sama.
Standar yang dapat dikuantifikasi:
-
Gunakan standar objektif dan dapat dikuantifikasi kapan pun memungkinkan.
-
Kurangi subjektivitas.
-
Berikan kriteria jelas untuk tiap level skor.
Optimasi iteratif:
-
Optimalkan Prompt secara berkelanjutan berdasarkan umpan balik evaluasi.
-
Periksa secara berkala untuk memverifikasi akurasi evaluasi.
-
Bandingkan penilaian manusia dan AI untuk menyesuaikan standar evaluasi.
Teknik penulisan Prompt
Lihat Prompt Best Practices dan Plugins untuk Alibaba Cloud Model Studio untuk mempelajari cara memaksimalkan kinerja model tanpa model fine-tuning.
Rekomendasi optimasi biaya
Pilih metode evaluasi dengan bijak:
-
Evaluasi berbasis aturan memiliki biaya terendah—ideal untuk validasi output terformat.
-
Evaluasi model besar lebih mahal—gunakan untuk skenario yang memerlukan pemahaman semantik.
-
Evaluasi manual paling mahal—cadangkan untuk kasus yang memerlukan penilaian manusia.
Gunakan inference result sets:
-
Untuk model garis dasar yang sering dievaluasi, simpan output sebagai inference result sets.
-
Hindari panggilan model berulang untuk mengurangi biaya inferensi.
Evaluasi bertahap:
-
Pertama validasi konfigurasi dengan dataset kecil (50–100 item).
-
Setelah konfirmasi pengaturan benar, tingkatkan ke 200–500 item.
Evaluasi batch:
-
Evaluasi beberapa model secara simultan untuk meningkatkan efisiensi.
-
Pilih beberapa model dalam tugas evaluasi yang sama.
Metode analisis hasil evaluasi
Pantau distribusi skor:
-
Periksa jumlah sampel di tiap level skor.
-
Identifikasi pengelompokan bermasalah (misalnya, semua skor di 3 poin).
-
Sesuaikan standar penilaian atau ambang batas.
Analisis sampel khas:
-
Tinjau sampel dengan skor tinggi: pahami kekuatan model.
-
Tinjau sampel dengan skor rendah: identifikasi kelemahan model.
-
Tinjau sampel ambang batas: sempurnakan standar evaluasi.
Bandingkan model berbeda:
-
Jangan hanya melihat skor total—periksa kinerja di berbagai skenario.
-
Identifikasi kekuatan dan kelemahan tiap model.
-
Pilih model yang sesuai berdasarkan prioritas bisnis.
Lacak iterasi model:
-
Buat siklus evaluasi rutin.
-
Catat hasil evaluasi setelah tiap fine-tuning.
-
Analisis apakah arah fine-tuning sudah benar.
Pemecahan masalah isu umum
Hasil evaluasi tidak memenuhi ekspektasi:
-
Verifikasi apakah data uji mewakili skenario bisnis Anda.
-
Tinjau apakah Prompt dimensi evaluasi jelas.
-
Coba sesuaikan rentang skor dan ambang batas.
-
Pertimbangkan mengganti model juri atau templat penilai.
Skor terlalu mengelompok:
-
Kriteria penilaian terlalu luas → sempurnakan deskripsi untuk tiap level skor.
-
Data uji kurang beragam → tambahkan sampel tepi dan abnormal.
-
Model juri terlalu konservatif → ganti ke model inferensi yang lebih mumpuni.
Hasil bertentangan di berbagai dimensi evaluasi:
-
Ini normal—model berkinerja berbeda di berbagai dimensi.
-
Bobot dimensi sesuai prioritas bisnis.
-
Jangan mengandalkan dimensi tunggal—ambil keputusan secara holistik.
Jika output model sering menunjukkan cacat berikut, pertimbangkan menambahkan basis pengetahuan:
-
Output model sama sekali tidak terkait dengan jawaban referensi (model jelas kekurangan pengetahuan latar belakang yang relevan).
-
Output model sebagian terkait dengan jawaban referensi (model memiliki pengetahuan latar belakang tetapi sudah usang).
Informasi Penagihan
Biaya evaluasi model berasal dari dua bagian: biaya inferensi model yang dievaluasi dan biaya penilaian model juri.
Biaya inferensi model yang dievaluasi
|
Jenis Model |
Ditagih? |
Detail Penagihan |
|
Model Preset (seperti qwen-max, qwen-plus) |
Ya |
Ditagih berdasarkan konsumsi token |
|
Model yang Dideploy Secara Independen (fine-tuned dan dideploy) |
Tidak |
Tidak ada biaya tambahan |
Rumus penagihan model yang dievaluasi:
Token masukan meliputi:
-
System Prompt (jika dikonfigurasi)
-
Prompt dari data evaluasi (pertanyaan pengguna)
Token output mencakup:
-
Respons yang dihasilkan model (Output)
Biaya penilaian model juri (gratis untuk waktu terbatas)
Hanya evaluasi model besar (numerik, klasifikasi) yang melibatkan penggunaan model juri.
Contoh perhitungan biaya lengkap
Skenario: Evaluasi 100 item data menggunakan qwen-plus dengan Model Evaluation - Numeric, menggunakan qwen-max sebagai model juri.
Asumsi: Rata-rata 50 token/Prompt, 200 token/Output, 500 token/scorer Prompt, 5 token/judge model output.
Perhitungan biaya (qwen-plus input $0,26/1M token, output $0,78/1M token; model juri ditagih sesuai harga konsol Model Studio):
-
Model yang dievaluasi: 5.000/1.000.000 × 0,26 + 20.000/1.000.000 × 0,78 = $0,0013 + $0,0156 = $0,017
-
Model juri: Ditagih sesuai harga konsol Model Studio saat ini.
-
Total biaya ≈ $0,017 (tidak termasuk biaya model juri).
Referensi harga
Harga terbaru: Lihat Konsol Model Studio.
Catatan:
-
Harga dapat berubah—selalu merujuk ke tampilan konsol.
-
Beberapa model mungkin memiliki penawaran promosi waktu terbatas.
Langkah selanjutnya
-
Jika Anda puas dengan kinerja model yang dievaluasi, mulai panggilan model dan integrasikan ke alur kerja bisnis Anda.
-
Jika Anda tidak puas dengan kinerja model yang dievaluasi, pilih model lain untuk dievaluasi ulang. Anda juga dapat mempertimbangkan belajar dan mendapatkan Sertifikasi Insinyur ACA Generative AI. Kursus gratis yang menyertainya membantu Anda memahami secara sistematis kemampuan model besar, skenario aplikasi, dan teknik optimasi.