All Products
Search
Document Center

Alibaba Cloud Model Studio:Evaluasi model

Last Updated:Jun 14, 2026

Menilai model di berbagai dimensi menggunakan set data membantu Anda memahami kinerjanya secara menyeluruh dan memastikan model memberikan hasil yang efektif dalam aplikasi dunia nyata.

Catatan

Mulai

Apa itu evaluasi model

Evaluasi model adalah alat validasi kualitas model yang disediakan oleh platform Model Studio. Alat ini membantu Anda menilai kinerja model bahasa besar secara objektif dan kuantitatif.

Rangkuman satu kalimat: Berikan tes kepada model, skor respons secara otomatis atau manual, lalu hasilkan laporan evaluasi.

Mengapa melakukan evaluasi model

Skenario 1: Pengambilan keputusan pemilihan model

Masalah: Menghadapi puluhan model besar (Qwen, GPT, Claude, ERNIE Bot, dll.), Anda tidak tahu mana yang paling sesuai dengan kebutuhan bisnis Anda.

Solusi:

  1. Siapkan 100 kasus uji dari skenario bisnis Anda.

  2. Evaluasi semua model kandidat menggunakan set data yang sama.

  3. Bandingkan laporan evaluasi (skor, tingkat kelulusan, kinerja sampel).

  4. Pilih model yang paling memenuhi persyaratan bisnis Anda.

Nilai:

  • Hindari penilaian subjektif—biarkan data yang mengarahkan keputusan.

  • Hemat waktu dibandingkan pengujian manual tiap model.

  • Kurangi risiko pemilihan model yang buruk.

Skenario 2: Validasi efektivitas fine-tuning

Masalah: Anda telah melakukan fine-tuning Qwen dengan 1.000 sampel pelatihan tetapi tidak yakin apakah kinerjanya benar-benar meningkat.

Solusi:

  1. Siapkan set data evaluasi (tidak tumpang tindih dengan set pelatihan).

  2. Evaluasi model sebelum dan sesudah fine-tuning.

  3. Bandingkan hasil kedua evaluasi:

    • Skor sebelum fine-tuning: 75

    • Skor setelah fine-tuning: 85

    • Kesimpulan: Fine-tuning berhasil—meningkat 10 poin.

Nilai:

  • Kuantifikasi dampak fine-tuning untuk memvalidasi ROI.

  • Verifikasi apakah arah fine-tuning sudah tepat.

  • Sediakan dukungan data untuk optimasi berkelanjutan.

Skenario 3: Kuantifikasi kemampuan model

Masalah: Anda perlu melaporkan kinerja model pada tugas tertentu kepada tim atau manajemen tetapi tidak memiliki data objektif.

Solusi:

  1. Gunakan fitur evaluasi untuk menghasilkan laporan.

  2. Laporan mencakup:

    • Skor keseluruhan: 85/100

    • Tingkat kelulusan: 90% (sampel dengan skor ≥3 poin)

    • Distribusi skor: 30 sampel mendapat 5 poin, 40 mendapat 4 poin, 20 mendapat 3 poin, 10 mendapat 2 poin

    • Kasus khas: sampel dengan skor tinggi dan rendah

  3. Gunakan data laporan untuk mendukung keputusan dan presentasi.

Nilai:

  • Ganti deskripsi subjektif ("cukup bagus") dengan data ("85 poin, tingkat kelulusan 90%").

  • Memungkinkan komunikasi lintas tim yang jelas dan selaras.

  • Buat referensi garis dasar untuk optimasi di masa depan.

Skenario 4: Memantau kinerja model secara berkelanjutan

Masalah: Setelah deployment, kinerja model dapat menurun seiring waktu atau perubahan bisnis, tetapi sulit dideteksi secara cepat.

Solusi:

  1. Buat siklus evaluasi rutin (misalnya bulanan).

  2. Gunakan set data evaluasi dan dimensi yang identik.

  3. Lacak tren kinerja:

    • Januari 2024: Skor 85

    • Februari 2024: Skor 87 (membaik)

    • Maret 2024: Skor 78 (menurun—perlu investigasi)

Nilai:

  • Deteksi dini degradasi kinerja.

  • Sediakan fondasi data untuk iterasi model.

  • Bangun profil kemampuan model.

Rangkuman nilai inti

Nilai

Deskripsi

Kuantifikasi objektif

Ganti penilaian subjektif dengan data—hindari deskripsi samar seperti "sepertinya oke"

Perbandingan efisien

Bandingkan beberapa model dengan cepat—hemat waktu pengujian manual

Tata kelola risiko

Validasi menyeluruh sebelum deployment—kurangi risiko pemilihan model

Optimasi berkelanjutan

Sediakan umpan balik kuantitatif untuk fine-tuning dan iterasi model

Dukungan keputusan

Sediakan dukungan data untuk kolaborasi tim dan pelaporan manajemen

Alur kerja evaluasi

Fase

Deskripsi sub-langkah

1. Persiapan

Dimensi evaluasi (definisikan kriteria penilaian) → Data uji (siapkan pertanyaan dan jawaban)

2. Buat tugas evaluasi

Pilih model → Pilih data → Pilih dimensi → Pilih apakah akan bergabung dengan leaderboard

3. Jalankan evaluasi

Evaluasi otomatis (sistem menyelesaikan secara otomatis) atau evaluasi manual (memerlukan anotasi manual)

4. Lihat hasil

Laporan skor → Statistik tingkat kelulusan → Rincian terperinci

Pengalaman cepat

Skenario evaluasi: Evaluasi akurasi Qwen-Max pada menjawab pertanyaan berbasis akal sehat.

Contoh lengkap: Gunakan 10 pertanyaan uji untuk menilai kesamaan semantik respons model.

Langkah pengalaman:

1. Buat dimensi evaluasi

Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Dimension, lalu klik tombol Create Evaluation Dimension di pojok kanan atas.

Isi formulir dan klik tombol Save.

Item

Konten

Dimension Name

Akurasi QA akal sehat

Description

Evaluasi akurasi model dalam menjawab pertanyaan berbasis akal sehat

Type

Pilih Model Evaluation - Numeric

Judge Model

Pilih Qwen-Max

Scorer Template

Pilih Semantic Similarity

Scoring Range

Pertahankan default 0~5

Pass Threshold

3.0

Catatan terkait:

Untuk pemilihan Scorer Template, antarmuka menampilkan tiga tombol radio—pilih salah satu. Untuk informasi lebih lanjut, lihat dokumentasi variabel Prompt dan perbedaan System Prompt.

Templat

Deskripsi

Skenario penerapan

Perlu Prompt kustom?

Comprehensive Evaluation (default)

Templat preset sistem yang memberi skor di lima dimensi: relevansi, sensitivitas budaya, kelengkapan informasi, kejelasan, dan keterlibatan pengguna.

Skenario percakapan umum dan layanan pelanggan

Tidak—gunakan langsung atau modifikasi sesuai kebutuhan

Semantic Similarity

Templat preset sistem yang mengevaluasi kedekatan semantik antara output dan jawaban referensi.

Sistem QA dan pengambilan pengetahuan

Tidak—gunakan langsung atau modifikasi sesuai kebutuhan

Custom Evaluation

Tulis prompt Anda sendiri.

Skenario bisnis spesifik

Ya—tulis sesuai kebutuhan Anda

2. Siapkan data uji

Lokasi antarmuka: Buka halaman Data Management, lalu klik tombol Add Dataset di pojok kanan atas.

Isi formulir dan klik tombol Confirm.

Item

Konten

Dimension Name

Data uji QA

Description

Pilih tipe Evaluation Set.

❗ Evaluasi model hanya mendukung dataset bertipe Evaluation Set—bukan set pelatihan.

Type

Unggah Sample Data_QA Test Data.xlsx (lampiran CMS, file_id=151014, unduh online).

3. Buat tugas evaluasi

Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Task, lalu klik tombol Create Evaluation Task di pojok kanan atas.

Isi formulir dan klik tombol Evaluate.

Item

Konten

Dimension Name

Tes akurasi QA

Evaluation Object

Pilih Qwen-Plus.

Judge Model

Pilih Qwen-Max.

System Prompt

Biarkan kosong—tes ini tidak memerlukannya. Untuk informasi lebih lanjut, lihat Perbedaan System Prompt vs. Scorer Prompt.

Scorer Template

Pilih Semantic Similarity, dan pilih dataset “QA test data” yang telah dibuat sebelumnya.

Scoring Range

Pilih “Common-sense QA accuracy” yang telah dibuat sebelumnya.

Pass Threshold

Tes ini tidak berpartisipasi.

4. Periksa status tugas

Temukan tugas "QA accuracy test" dan periksa kolom Evaluation Status-nya:

  • Pending: Selama periode permintaan puncak, tugas evaluasi masuk antrian untuk dieksekusi.

  • In Progress: Sistem sedang mengevaluasi—mohon tunggu dengan sabar.

  • Completed: Evaluasi selesai—Anda dapat melihat hasilnya.

  • Evaluation Failed: Eksekusi tugas evaluasi gagal.

  • Stop Evaluation: Tugas evaluasi dihentikan secara manual oleh pengguna.

Klik tombol refresh (image) di pojok kanan atas. Saat status tugas berubah menjadi Completed, klik kolom Task Name untuk masuk ke halaman detail.

  • Pilih tab Data Details untuk melihat penilaian terperinci tiap titik data.

    Nama kolom

    Deskripsi

    Status

    Status evaluasi: Pending, In Progress, Evaluation Complete, Evaluation Failed, Evaluation Terminated

    No.

    ID sampel

    Prompt

    Pertanyaan asli

    Completion

    Jawaban referensi

    Output

    Respons yang dihasilkan model

    [Nama dimensi evaluasi]

    Sesuai dengan nama dimensi evaluasi—misalnya, “Common-sense QA accuracy”—dan menampilkan hasil penilaian.

    Actions

    Aksi pengguna yang tersedia—misalnya, klik Details untuk melihat pertanyaan, jawaban, dan hasil evaluasi lengkap.

  • Pilih tab Metric Statistics untuk melihat statistik evaluasi.

    Nama metrik

    Deskripsi

    Nilai contoh

    Overall Score

    Rata-rata skor di seluruh dimensi evaluasi

    100

    Pass Rate

    Persentase sampel yang memenuhi ambang batas (≥3 poin)

    90%

    Total Evaluation Sets

    Total jumlah item data uji

    10 item

    Completed

    Jumlah evaluasi yang selesai

    10 item

    Remaining

    Jumlah evaluasi yang belum selesai

    0 item

Konsep inti

Ikhtisar evaluasi kustom

Model Studio menyediakan fitur evaluasi kustom yang memungkinkan Anda menilai kualitas model di berbagai dimensi menggunakan standar evaluasi dan data uji Anda sendiri. Evaluasi kustom mendukung lima jenis dimensi evaluasi—lihat bagian Evaluasi kustom di bawah untuk detailnya.

Custom evaluation

Model yang didukung

Mendukung model preset berikut (termasuk versi fine-tuned):

  • Qwen-QwQ/Max/Plus/Turbo/Coder/Math

  • Versi open-source Qwen (Qwen3, Qwen2.5, Qwen2, Qwen1.5)

  • Tongyi Farui

  • Model generasi teks pihak ketiga (abab6.5g, abab6.5t, dll.)

Daftar di atas tidak lengkap dan dapat berubah. Selalu merujuk ke halaman Create Evaluation Task untuk daftar terkini Evaluate Model. Model yang ditampilkan dalam warna abu-abu tanpa tombol Apply saat ini tidak didukung untuk evaluasi.

Dimensi evaluasi

Dimensi evaluasi mendefinisikan kriteria penilaian—cara Anda memberi skor pada model. Anda harus membuat dimensi evaluasi sebelum melakukan evaluasi kustom.

  • Jenis dimensi evaluasi (lima jenis)

    Jenis

    Metode Penilaian

    Skenario Penerapan

    Biaya

    Rekomendasi

    Model Evaluation - Numeric

    Juri AI memberikan skor (1–5 poin)

    Kualitas QA dan pembuatan konten

    Sedang

    ⭐⭐⭐⭐⭐

    Rule Evaluation - Text Similarity

    Algoritma penghitung kemiripan

    Terjemahan, ringkasan, dan penulisan ulang

    Rendah

    ⭐⭐⭐⭐

    Model Evaluation - Classification

    Juri AI melakukan klasifikasi (Lulus/Gagal)

    Moderasi konten dan verifikasi kebenaran

    Sedang

    ⭐⭐⭐

    Rule Evaluation - String Matching

    Pencocokan string eksak

    Function Calling dan NL2SQL

    Sangat rendah

    ⭐⭐⭐

    Manual Evaluation - Classification

    Pelabelan manual

    Kreativitas dan penilaian profesional

    Tinggi

    ⭐⭐

  • Cara memilih jenis dimensi evaluasi dengan cepat?

    Satu tugas evaluasi dapat menggabungkan beberapa dimensi evaluasi.

Data evaluasi

  • Jenis sumber data

    Jenis data

    Deskripsi

    Alur kerja

    Skenario penerapan

    Evaluation dataset

    Berisi pertanyaan (prompt) dan jawaban referensi (completion)

    Sistem memanggil model untuk inferensi real-time, menghasilkan output, lalu penilai memberikan skor.

    • Evaluasi awal

    • Perbandingan beberapa model

    • Model belum menghasilkan output

    Inference result set

    Sudah berisi output model

    Sistem langsung membaca output dan penilai memberikan skor (tanpa perlu inferensi).

    • Model telah menghasilkan output

    • Pengurangan biaya inferensi

    • Model garis dasar untuk kelompok kontrol

  • Persyaratan format data: Excel

  • Contoh evaluation dataset:

    Prompt

    Completion

    Apa itu komputasi awan?

    Komputasi awan adalah kumpulan sumber daya komputasi bersama yang tersedia sesuai permintaan.

    Bagaimana Python mendefinisikan fungsi?

    Anda dapat menggunakan kata kunci def untuk mendefinisikan fungsi.

  • Contoh set hasil inferensi:

    Tambahkan satu kolom Output lagi.

    Prompt

    Completion

    Output

    What is cloud computing?

    Cloud computing is an on-demand pool of shared computing resources.

    Cloud computing is a service model that delivers computing resources over the internet...

  • Rekomendasi volume data:

    Fase

    Kuantitas yang Direkomendasikan

    Deskripsi

    Validasi skala kecil

    50–100 item

    Memverifikasi kebenaran konfigurasi.

    Evaluasi formal

    200–500 item

    Mendapatkan hasil statistik yang andal.

    Penilaian komprehensif

    500+ item

    Mencakup berbagai kasus tepi.

Leaderboard

Apa itu leaderboard:

  • Bandingkan kinerja beberapa model pada dimensi evaluasi yang sama.

  • Tampilkan peringkat model secara visual.

  • Dukung perbandingan horizontal di beberapa tugas evaluasi.

Kapan Anda memerlukan leaderboard:

  • Bandingkan kinerja beberapa model (misalnya GPT-4 vs Claude vs Qwen).

  • Tunjukkan secara visual kekuatan/kelemahan model dalam skenario bisnis.

  • Bagikan hasil perbandingan model dalam tim Anda.

Variabel inti

Ruang lingkup penerapan: Bagian ini hanya berlaku untuk dimensi evaluasi Model Evaluation - Numeric dan Model Evaluation - Classification.

Saat evaluasi model besar, model juri menerima tiga variabel ini:

Nama variabel

Deskripsi

Contoh

Skenario penerapan

${prompt}

Input asli: pertanyaan atau instruksi dari pengguna

What is cloud computing?

Diperlukan di semua skenario

${output}

Output model: respons yang dihasilkan oleh model

Cloud computing is a service delivered over...

Diperlukan di semua skenario

${completion}

Jawaban referensi: jawaban standar atau output yang diharapkan

Cloud computing is an on-demand...

Gunakan saat jawaban standar tersedia

Cara menggunakan dalam Prompt:

Please evaluate the quality of the following response:

**User question**: ${prompt}
**Model response**: ${output}
**Reference answer**: ${completion}

Scoring criteria:
- 5 points: Response is completely correct and semantically matches reference answer
- 4 points: Response is mostly correct with minor deviations
- 3 points: Response is partially correct
- 2 points: Response is mostly incorrect
- 1 point: Response is completely wrong or irrelevant

Perbedaan System Prompt vs. Scorer Prompt

Dalam evaluasi model, dua konfigurasi Prompt yang mudah dikacaukan memiliki tujuan berbeda:

Jenis Prompt

Lokasi Konfigurasi

Target

Fase Aksi

Wajib?

Atribusi Biaya

System Prompt

Saat membuat Evaluation Task

Model yang dievaluasi

Saat model menghasilkan jawaban

Tidak

Biaya inferensi model yang dievaluasi

Scorer Prompt

Saat membuat dimensi evaluasi Model Evaluation - Numeric dan Model Evaluation - Classification

Model juri

Saat model juri memberi skor jawaban

Ya

Menilai biaya penyekoran model

Penjelasan terperinci

  • System Prompt

    • Tujuan: Menentukan peran atau panduan perilaku untuk model yang dievaluasi.

    • Contoh skenario:

      • Mengevaluasi layanan pelanggan: "Anda adalah perwakilan layanan pelanggan profesional. Jawab pertanyaan pelanggan dengan sopan dan akurat."

      • Mengevaluasi asisten kode: "Anda adalah ahli pemrograman. Berikan contoh kode yang akurat dan ringkas."

    • Kapan digunakan: Isi hanya saat Anda perlu memberikan identitas atau batasan spesifik kepada model yang dievaluasi—biarkan kosong dalam kebanyakan kasus.

  • Scorer Prompt

    • Tujuan: Memberi tahu model juri cara mengevaluasi kualitas jawaban dan kriteria penilaian apa yang digunakan.

    • Ruang lingkup penerapan: Diperlukan hanya untuk dimensi evaluasi Model Evaluation - Numeric dan Model Evaluation - Classification.

    • Metode konfigurasi:

      • Pilih templat preset sistem (Comprehensive Evaluation, Semantic Similarity, Sentiment Analysis, dll.).

      • Tulis prompt kustom (untuk skenario bisnis spesifik).

    • Scorer Prompt dapat menggunakan variabel ${prompt}, ${output}, ${completion}.

Analogi yang hidup

  • System Prompt: Memberi tahu "siswa" (model yang dievaluasi) peran apa yang harus diasumsikan saat mengikuti ujian.

  • Scorer Prompt: Memberi tahu "penguji" (model juri) cara menilai ujian dan standar penilaian apa yang diterapkan.

Kasus praktik berbasis skenario

Custom Evaluation:Model Evaluation - Numeric

Skenario penerapan: Situasi yang memerlukan penilaian granular, seperti kualitas QA, kualitas pembuatan konten, atau kualitas dialog layanan pelanggan.

Rekomendasi:

  • Buat kriteria penilaian spesifik—berikan deskripsi jelas untuk tiap level skor.

  • Periksa secara berkala sampel dengan skor tinggi dan rendah untuk memverifikasi akurasi.

  • Hindari pengelompokan semua sampel dalam satu rentang skor.

Prosedur:

1. Buat dimensi evaluasi

Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Dimension, lalu klik tombol Create Evaluation Dimension di pojok kanan atas.

Isi formulir dan klik tombol Save.

Item

Konten

Dimension Name

Akurasi QA akal sehat

Description

Evaluasi akurasi model dalam menjawab pertanyaan berbasis akal sehat

Type

Pilih Model Evaluation - Numeric

Judge Model

Pilih Qwen-Max

Scorer Template

Pilih Semantic Similarity

Scoring Range

Pertahankan default 0~5

Pass Threshold

3.0

Catatan terkait:

Untuk memilih Scorer Template, antarmuka menyediakan tiga tombol radio—pilih salah satu. Untuk informasi selengkapnya, lihat dokumentasi mengenai variabel Prompt dan perbedaan System Prompt.

Templat

Deskripsi

Skenario Penerapan

Perlu Prompt Kustom?

Comprehensive Evaluation (default)

Templat preset sistem yang memberikan skor berdasarkan lima dimensi: relevansi, sensitivitas budaya, kelengkapan informasi, kejelasan, dan keterlibatan pengguna.

Percakapan umum dan layanan pelanggan

Tidak—dapat digunakan langsung atau dimodifikasi sesuai kebutuhan

Semantic Similarity

Templat preset sistem yang mengevaluasi kedekatan semantik antara output dan jawaban referensi.

Sistem QA dan pengambilan pengetahuan

Tidak—dapat digunakan langsung atau dimodifikasi sesuai kebutuhan

Custom Evaluation

Buat prompt Anda sendiri.

Skenario bisnis spesifik

Ya—buat sesuai kebutuhan Anda

2. Siapkan data uji

Lokasi antarmuka: Buka halaman Data Management, lalu klik tombol Add Dataset di pojok kanan atas.

Isi formulir dan klik tombol Confirm.

Item

Konten

Dimension Name

Data uji QA

Description

Pilih tipe Evaluation Set.

❗ Evaluasi model hanya mendukung dataset bertipe Evaluation Set—bukan set pelatihan.

Type

Unggah Sample Data_QA Test Data.xlsx (lampiran CMS, file_id=151014, unduh online).

3. Buat tugas evaluasi

Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Task, lalu klik tombol Create Evaluation Task di pojok kanan atas.

Isi formulir dan klik tombol Evaluate.

Item

Konten

Dimension Name

Tes akurasi QA

Evaluation Object

Pilih Qwen-Plus.

Judge Model

Pilih Qwen-Max.

System Prompt

Biarkan kosong—tes ini tidak memerlukannya. Untuk informasi lebih lanjut, lihat Perbedaan System Prompt vs. Scorer Prompt.

Scorer Template

Pilih Semantic Similarity, lalu pilih dataset “QA test data” yang telah dibuat sebelumnya.

Scoring Range

Pilih “Common-sense QA accuracy” yang telah dibuat sebelumnya.

Pass Threshold

Tes ini tidak berpartisipasi.

4. Periksa status tugas

Temukan tugas "QA accuracy test" dan periksa kolom Evaluation Status-nya:

  • Pending: Selama periode permintaan puncak, tugas evaluasi masuk antrian untuk dieksekusi.

  • In Progress: Sistem sedang mengevaluasi—mohon tunggu dengan sabar.

  • Completed: Evaluasi selesai—Anda dapat melihat hasilnya.

  • Evaluation Failed: Eksekusi tugas evaluasi gagal.

  • Stop Evaluation: Tugas evaluasi dihentikan secara manual oleh pengguna.

Klik tombol refresh (image) di pojok kanan atas. Saat status tugas berubah menjadi Completed, klik kolom Task Name untuk masuk ke halaman detail.

  • Pilih tab Data Details untuk melihat penilaian terperinci tiap titik data.

    Nama kolom

    Deskripsi

    Status

    Status evaluasi: Pending, In Progress, Evaluation Complete, Evaluation Failed, Evaluation Terminated

    No.

    ID sampel

    Prompt

    Pertanyaan asli

    Completion

    Jawaban referensi

    Output

    Respons yang dihasilkan model

    [Nama dimensi evaluasi]

    Sesuai dengan nama dimensi evaluasi—misalnya, “Common-sense QA accuracy”—dan menampilkan hasil penilaian.

    Actions

    Aksi pengguna yang tersedia—misalnya, klik Details untuk melihat pertanyaan, jawaban, dan hasil evaluasi lengkap.

  • Pilih tab Metric Statistics untuk melihat statistik evaluasi.

    Nama metrik

    Deskripsi

    Nilai contoh

    Overall Score

    Rata-rata skor dari seluruh dimensi evaluasi

    100

    Pass Rate

    Persentase sampel yang memenuhi ambang batas (≥3 poin)

    90%

    Total Evaluation Sets

    Total jumlah item data uji

    10 item

    Completed

    Jumlah evaluasi yang telah selesai

    10 item

    Remaining

    Jumlah evaluasi yang belum selesai

    0 item

Evaluasi kustom: Dimensi evaluasi Large Model Evaluation - Classification

Skenario penerapan: Situasi yang memerlukan penilaian biner seperti "ya/tidak" atau "lulus/gagal", seperti moderasi konten atau verifikasi kebenaran jawaban.

Rekomendasi:

  • Tentukan kondisi penilaian dengan jelas untuk tiap label dalam Prompt Anda.

  • Secara eksplisit minta model juri hanya mengeluarkan nama label.

  • Periksa secara berkala sampel untuk memastikan akurasi.

Prosedur:

1. Buat dimensi evaluasi

Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Dimension, lalu klik tombol Create Evaluation Dimension di pojok kanan atas.

Isi formulir dan klik tombol Save.

Item

Konten

Dimension Name

Analisis sentimen

Description

Deteksi sentimen pelanggan

Type

Pilih Auto

Judge Model

Pilih Qwen-Max

Scorer Template

Pilih Sentiment Analysis

Scoring Range

Tidak perlu dimodifikasi—gunakan konten default

Catatan terkait:

Untuk memilih Scorer Template, antarmuka menyediakan tiga tombol radio—pilih salah satu. Untuk informasi selengkapnya, lihat dokumentasi mengenai variabel Prompt dan perbedaan System Prompt.

Templat

Deskripsi

Skenario penerapan

Perlu prompt kustom?

Standard Match (default)

Templat preset sistem yang memeriksa kecocokan antara output model dan jawaban referensi.

Label klasifikasi, nama fungsi, dan jawaban tetap

Tidak—gunakan langsung atau modifikasi sesuai kebutuhan.

Sentiment Analysis

Templat preset sistem yang menganalisis sentimen teks (positif, netral, atau negatif).

Ulasan pengguna, dialog layanan pelanggan, dan pemantauan opini publik

Tidak—gunakan langsung atau modifikasi sesuai kebutuhan.

Custom Scorer

Buat prompt Anda sendiri.

Skenario kustom seperti penilaian gaya, pemeriksaan kepatuhan, dan verifikasi logika

Diperlukan. Buat sesuai kebutuhan.

2. Siapkan data uji

Lokasi antarmuka: Buka halaman Data Management, lalu klik tombol Add Dataset di pojok kanan atas.

Isi formulir dan klik tombol Confirm.

Item

Konten

Dimension Name

Data uji analisis sentimen

Description

Pilih tipe Evaluation Set.

❗ Evaluasi model hanya mendukung dataset bertipe Evaluation Set—bukan set pelatihan.

Type

Unggah Sample Data_Sentiment Analysis.xlsx (lampiran ICMS, file_id=151061, unduh online).

3. Buat tugas evaluasi

Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Task, lalu klik tombol Create Evaluation Task di pojok kanan atas.

Isi formulir dan klik tombol Evaluate.

Item

Konten

Dimension Name

Tes analisis sentimen

Evaluation Dimension

Pilih Sentiment Analysis.

Judge Model

Pilih Qwen-Max.

System Prompt

Biarkan kosong—tes ini tidak memerlukannya. Untuk informasi selengkapnya, lihat Perbedaan System Prompt vs. Scorer Prompt.

Scorer Template

Pilih Semantic Similarity, lalu pilih dataset "Sentiment analysis test data" yang telah dibuat sebelumnya.

Scoring Range

Pilih "Sentiment Analysis" yang telah dibuat sebelumnya.

Pass Threshold

Anda tidak berpartisipasi dalam tes ini.

4. Periksa status tugas

Temukan tugas "Sentiment analysis test" dan periksa kolom Evaluation Status-nya:

  • Pending: Selama periode permintaan puncak, tugas evaluasi masuk antrian untuk dieksekusi.

  • In Progress: Sistem sedang mengevaluasi—mohon tunggu dengan sabar.

  • Completed: Evaluasi selesai—Anda dapat melihat hasilnya.

  • Evaluation Failed: Eksekusi tugas evaluasi gagal.

  • Stop Evaluation: Tugas evaluasi dihentikan secara manual oleh pengguna.

Klik tombol refresh (image) di pojok kanan atas. Saat status tugas berubah menjadi Completed, klik kolom Task Name untuk masuk ke halaman detail.

  • Pilih tab Data Details untuk melihat penilaian terperinci tiap titik data.

    Nama Kolom

    Deskripsi

    Status

    Status evaluasi: Pending, In Progress, Evaluation Complete, Evaluation Failed, Evaluation Terminated

    No.

    ID sampel

    Prompt

    Pertanyaan asli

    Completion

    Jawaban referensi

    Output

    Respons yang dihasilkan model

    [Nama dimensi evaluasi]

    Sesuai dengan nama dimensi evaluasi—misalnya, "Sentiment Analysis"—dan menampilkan hasil analisis.

    Actions

    Aksi pengguna yang tersedia—misalnya, klik Details untuk melihat pertanyaan, jawaban, dan hasil evaluasi lengkap.

  • Pilih tab Metric Statistics untuk melihat statistik evaluasi.

    Nama metrik

    Deskripsi

    Nilai contoh

    Overall Score

    Rata-rata skor dari seluruh dimensi evaluasi

    40

    Pass Rate

    Persentase sampel yang lulus

    40%

    Score Details - Data Item Distribution

    Distribusi hasil evaluasi klasifikasi

    Total Evaluation Sets

    Total jumlah item data uji

    10 item

    Completed

    Jumlah evaluasi yang telah selesai

    10 item

    Remaining

    Jumlah evaluasi yang belum selesai

    0 item

Evaluasi kustom: Dimensi evaluasi Large Model Evaluation - Numerical

Skenario penerapan: Situasi yang memerlukan penilaian komprehensif multi-dimensi, seperti penilaian kualitas jawaban, penilaian keamanan konten, atau penilaian kualitas terjemahan.

Rekomendasi:

  • Tetapkan rentang skor dan ambang batas kelulusan yang sesuai—uji skala kecil terlebih dahulu sebelum evaluasi batch.

  • Pilih templat penilai yang sesuai: Comprehensive Evaluation untuk skenario umum, Semantic Similarity untuk skenario dengan jawaban referensi.

  • Saat menulis Prompt penilai kustom, definisikan dengan jelas kriteria penilaian dan rentang nilai.

Prosedur:

1. Buat dimensi evaluasi

Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Dimension, lalu klik tombol Create Evaluation Dimension di pojok kanan atas.

Isi formulir dan klik tombol Save.

Item

Konten

Dimension Name

Penilaian kualitas komprehensif

Description

Evaluasi kualitas komprehensif respons model

Type

Pilih Model Evaluation - Numeric

Judge Model

Pilih Qwen-Max

Scorer Template

Pilih Comprehensive Evaluation (default)

Prompt

Tidak perlu dimodifikasi—gunakan konten default

Scoring Range

Gunakan nilai default 0-5

Pass Threshold

Gunakan nilai default 3.0—sampel dengan skor ≥3.0 ditandai Lulus

Catatan terkait:

Untuk memilih Scorer Template, antarmuka menampilkan tiga tombol radio—pilih salah satu. Untuk informasi selengkapnya, lihat dokumentasi mengenai variabel Prompt dan perbedaan System Prompt.

Templat

Deskripsi

Skenario penerapan

Perlu Prompt kustom?

Comprehensive Evaluation (default)

Templat preset sistem yang memberikan skor respons berdasarkan lima dimensi: relevansi, sensitivitas budaya, kelengkapan informasi, kejelasan, dan keterlibatan pengguna.

Penilaian kualitas jawaban umum

Tidak—dapat digunakan langsung atau dimodifikasi sesuai kebutuhan.

Semantic Similarity

Templat preset sistem yang mengevaluasi kesamaan semantik antara output model dan jawaban referensi.

Skenario dengan jawaban referensi yang jelas, seperti QA berbasis pengetahuan atau terjemahan.

Tidak—dapat digunakan langsung atau dimodifikasi sesuai kebutuhan.

Custom Evaluation

Buat prompt Anda sendiri—tentukan kriteria penilaian dan rentang nilai dalam prompt tersebut.

Skenario kustom, seperti penilaian di domain profesional atau berdasarkan metrik spesifik.

Diperlukan. Buat sesuai kebutuhan.

Tentang score range dan pass threshold:

  • Score range: Tetapkan nilai minimum dan maksimum integer untuk penilaian model juri (default 0–5). Model juri akan memberi skor tiap item evaluasi dalam rentang ini.

  • Pass threshold: Skor ≥ ambang batas ditandai Lulus, skor di bawah ditandai Gagal. Rentang ambang batas dibatasi oleh rentang skor dan mendukung desimal (ukuran langkah 0.1), default adalah 3.0.

2. Siapkan data uji

Lokasi antarmuka: Buka halaman Data Management, lalu klik tombol Add Dataset di pojok kanan atas.

Isi formulir dan klik tombol Confirm.

Item

Konten

Dimension Name

Data uji untuk penilaian kualitas komprehensif

Description

Pilih tipe Evaluation Set.

❗ Evaluasi model hanya mendukung dataset bertipe Evaluation Set—bukan set pelatihan.

Type

Unggah file data uji dalam format JSONL, dengan setiap baris berisi bidang prompt dan completion.

3. Buat tugas evaluasi

Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Task, lalu klik tombol Create Evaluation Task di pojok kanan atas.

Isi formulir dan klik tombol Evaluate.

Item

Konten

Dimension Name

Tes penilaian kualitas komprehensif

Evaluate Model

Pilih Qwen-Max.

Judge Model

Pilih Qwen-Max.

System Prompt

Biarkan kosong—tes ini tidak memerlukannya. Untuk informasi lebih lanjut, lihat Perbedaan System Prompt vs. Scorer Prompt.

Scorer Template

Pilih Comprehensive Evaluation dan pilih dataset “Comprehensive quality assessment test data” yang telah dibuat sebelumnya.

Scoring Range

Pilih “Comprehensive quality assessment” yang telah dibuat sebelumnya.

Pass Threshold

Anda tidak berpartisipasi dalam tes ini.

4. Periksa status tugas

Temukan tugas "Comprehensive quality assessment test" dan periksa kolom Evaluation Status-nya:

  • Pending: Selama periode permintaan puncak, tugas evaluasi masuk antrian untuk dieksekusi.

  • In Progress: Sistem sedang mengevaluasi—mohon tunggu dengan sabar.

  • Completed: Evaluasi selesai—Anda dapat melihat hasilnya.

  • Evaluation Failed: Eksekusi tugas evaluasi gagal.

  • Stop Evaluation: Tugas evaluasi dihentikan secara manual oleh pengguna.

Klik tombol refresh (image) di pojok kanan atas. Saat status tugas berubah menjadi Completed, klik kolom Task Name untuk masuk ke halaman detail.

  • Pilih tab Data Details untuk melihat penilaian terperinci tiap titik data.

    Nama Kolom

    Deskripsi

    Status

    Status evaluasi: Pending, In Progress, Evaluation Complete, Evaluation Failed, Evaluation Terminated

    No.

    ID sampel

    Prompt

    Pertanyaan asli

    Completion

    Jawaban referensi

    Output

    Respons yang dihasilkan model

    [Nama dimensi evaluasi]

    Sesuai dengan nama dimensi evaluasi—misalnya, “Comprehensive Quality Assessment”—dan menampilkan skor numerik dari model juri.

    Actions

    Aksi pengguna yang tersedia—misalnya, klik Details untuk melihat pertanyaan, jawaban, dan hasil evaluasi lengkap.

  • Pilih tab Metric Statistics untuk melihat statistik evaluasi.

    Nama metrik

    Deskripsi

    Nilai contoh

    Overall Score

    Rata-rata skor dari seluruh dimensi evaluasi (untuk dimensi numerik, nilai ini merupakan rata-rata aritmetika dari semua skor sampel)

    3,8

    Pass Rate

    Persentase sampel yang memiliki skor lebih besar atau sama dengan ambang batas kelulusan

    70%

    Total Evaluation Sets

    Total jumlah item data uji

    10 item

    Completed

    Jumlah evaluasi yang telah selesai

    10 item

    Remaining

    Jumlah evaluasi yang belum selesai

    0 item

Evaluasi kustom: Dimensi evaluasi Rule-based Evaluation - String Match

Skenario penerapan: Format jawaban tetap yang memerlukan pencocokan eksak, seperti Function Calling atau NL2SQL.

Rekomendasi:

  • Pra-pemrosesan normalisasi: standarisasi huruf besar/kecil, hapus spasi ekstra.

  • Untuk sinonim, pertimbangkan menggunakan penilai kesamaan teks sebagai gantinya.

  • Uji aturan pencocokan dengan sampel kecil terlebih dahulu untuk memverifikasi ekspektasi.

Prosedur:

1. Buat dimensi evaluasi

Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Dimension, lalu klik tombol Create Evaluation Dimension di pojok kanan atas.

Isi formulir dan klik tombol Save.

Item

Konten

Dimension Name

Validasi Function Calling

Description

Periksa apakah model memanggil fungsi yang ditentukan dengan benar

Type

Pilih Rule Evaluation - String Matching

Compare Text

Kolom tiga: kotak teks kiri masukkan ${output} (output model), dropdown operator tengah pilih Include, kotak teks kanan masukkan ${completion} (jawaban referensi). Ketik / + Enter di kotak teks untuk memasukkan variabel ${prompt} / ${output} / ${completion} dengan cepat.


















Masukkan variabel output model di kotak teks kiri, variabel jawaban referensi di kotak teks kanan


















Cara memilih aturan pencocokan:

Aturan

Deskripsi Perilaku

Aplikasi Khas

Equal

Identik persis (tidak peka huruf besar/kecil)

Validasi nama kota, jawaban tetap

Not Equal

Sepenuhnya berbeda (tidak peka huruf besar/kecil)

Penyaringan kata terlarang

Contains

Berisi string yang ditentukan

Pemeriksaan kata kunci, validasi informasi penting

Starts With

Diawali dengan string yang ditentukan

Validasi awalan, pemeriksaan format

Ends With

Diakhiri dengan string yang ditentukan

Validasi akhiran, pemeriksaan terminator

Contoh data evaluasi:

{"prompt": "What's the weather like in Beijing today?","completion": "query_weather"}

Jika aturan pencocokan adalah "Contains", ketika output model berisi query_weather, maka ditandai Lulus.

2. Siapkan data uji

Lokasi antarmuka: Buka halaman Data Management, lalu klik tombol Add Dataset di pojok kanan atas.

Isi formulir dan klik tombol Confirm.

Item

Konten

Dimension Name

Data uji Function Calling

Description

Pilih tipe Evaluation Set.

❗ Evaluasi model hanya mendukung dataset bertipe Evaluation Set—bukan set pelatihan.

Type

Unggah Sample Data_Function_Calling.xlsx (lampiran ICMS, file_id=151064, unduh online).

3. Buat tugas evaluasi

Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Task, lalu klik tombol Create Evaluation Task di pojok kanan atas.

Isi formulir dan klik tombol Evaluate.

Item

Konten

Dimension Name

Tes Function Calling

Evaluation Set

Pilih Function Calling test data.

Judge Model

Pilih Qwen-Max.

System Prompt

Biarkan kosong—tes ini tidak memerlukannya. Untuk informasi lebih lanjut, lihat Perbedaan System Prompt vs. Scorer Prompt.

Scorer Template

Pilih Comprehensive Evaluation dan pilih dataset "Function Calling test data" yang telah dibuat sebelumnya.

Scoring Range

Pilih "Function Calling validation" yang telah dibuat sebelumnya.

Pass Threshold

Anda tidak berpartisipasi dalam tes ini.

4. Periksa status tugas

Temukan tugas "Function Calling test" dan periksa kolom Evaluation Status-nya:

  • Pending: Selama periode permintaan puncak, tugas evaluasi masuk antrian untuk dieksekusi.

  • In Progress: Sistem sedang mengevaluasi—mohon tunggu dengan sabar.

  • Completed: Evaluasi selesai—Anda dapat melihat hasilnya.

  • Evaluation Failed: Eksekusi tugas evaluasi gagal.

  • Stop Evaluation: Tugas evaluasi dihentikan secara manual oleh pengguna.

Klik tombol refresh (image) di pojok kanan atas. Saat status tugas berubah menjadi Completed, klik kolom Task Name untuk masuk ke halaman detail.

  • Pilih tab Data Details untuk melihat penilaian terperinci tiap titik data.

    Nama Kolom

    Deskripsi

    Status

    Status evaluasi: Pending, In Progress, Evaluation Complete, Evaluation Failed, Evaluation Terminated

    No.

    ID sampel

    Prompt

    Pertanyaan asli

    Completion

    Jawaban referensi

    Output

    Respons yang dihasilkan model

    [Nama dimensi evaluasi]

    Sesuai dengan nama dimensi evaluasi—misalnya, “Function Calling validation”—dan menampilkan hasil analisis.

    Actions

    Aksi pengguna yang tersedia—misalnya, klik Details untuk melihat pertanyaan, jawaban, dan hasil evaluasi lengkap.

  • Pilih tab Metric Statistics untuk melihat statistik evaluasi.

    Nama metrik

    Deskripsi

    Nilai contoh

    Overall Score

    Rata-rata skor dari seluruh dimensi evaluasi

    100

    Pass Rate

    Persentase sampel yang lulus

    100%

    Total Evaluation Sets

    Total jumlah item data uji

    2 item

    Completed

    Jumlah evaluasi yang telah selesai

    2 item

    Remaining

    Jumlah evaluasi yang belum selesai

    0 item

Evaluasi kustom: Dimensi evaluasi Rule-based Evaluation - Text Similarity

Skenario penerapan: Situasi di mana jawaban bervariasi dalam redaksi tetapi memiliki makna yang sama, seperti terjemahan, ringkasan, atau penulisan ulang.

Rekomendasi:

  • Uji dengan sampel kecil terlebih dahulu—amati distribusi tingkat kelulusan sebelum menyesuaikan ambang batas.

  • Fokus pada urutan kata dan pencocokan eksak → pilih BLEU.

  • Fokus pada pemahaman semantik → pilih Cosine.

  • Perlu toleransi kesalahan → pilih Fuzzy Match.

  • Fokus pada cakupan informasi kunci → pilih ROUGE-L.

Prosedur:

1. Buat dimensi evaluasi

Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Dimension, lalu klik tombol Create Evaluation Dimension di pojok kanan atas.

Isi formulir dan klik tombol Save.

Item

Konten

Dimension Name

Kualitas terjemahan

Description

Evaluasi kualitas terjemahan Tiongkok-Inggris

Type

Pilih Rule Evaluation - Text Similarity

Algoritma kesamaan

Pilih BLEU_4

Scorer Template

Kiri: ${output}
Kanan: ${completion}































Masukkan variabel output model di kotak teks kiri, variabel jawaban referensi di kotak teks kanan

Pass Threshold

Tetapkan ke 0.4—sampel dengan kesamaan ≥0.4 ditandai Lulus (rentang 0~1)

Cara memilih algoritma kesamaan:

Algoritma

Karakteristik

Skenario Terbaik

Rekomendasi Ambang Batas

ROUGE-L

Berdasarkan subsekuens umum terpanjang

Ringkasan

0,4–0,6

BLEU

Berdasarkan pencocokan presisi n-gram dan sensitif terhadap urutan kata

Terjemahan mesin

0,3–0,5

Cosine

Mengukur kesamaan dalam ruang vektor dan menangkap makna semantik

QA terbuka dan pemahaman semantik

0,6–0,8

Fuzzy Match

Berdasarkan jarak edit dan memberikan toleransi kesalahan tinggi

OCR dan pengenalan suara

0,7–0,9

Accuracy

Memerlukan pencocokan eksak

Verifikasi jawaban presisi

1,0

2. Siapkan data uji

Lokasi antarmuka: Buka halaman Data Management, lalu klik tombol Add Dataset di pojok kanan atas.

Isi formulir dan klik tombol Confirm.

Item

Konten

Dimension Name

Data uji Tiongkok–Inggris

Description

Pilih tipe Evaluation Set.

❗ Evaluasi model hanya mendukung dataset bertipe Evaluation Set—bukan set pelatihan.

Type

Unggah Sample Data_Chinese-to-English.xlsx (lampiran ICMS, file_id=151065, unduh online).

3. Buat tugas evaluasi

Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Task, lalu klik tombol Create Evaluation Task di pojok kanan atas.

Isi formulir dan klik tombol Evaluate.

Item

Konten

Dimension Name

Evaluasi kualitas terjemahan

Evaluate Model

Pilih Qwen-Max.

Judge Model

Pilih Qwen-Max.

System Prompt

Biarkan kosong—tes ini tidak memerlukannya. Untuk informasi lebih lanjut, lihat Perbedaan System Prompt vs. Scorer Prompt.

Scorer Template

Pilih Comprehensive Evaluation dan pilih dataset "Chinese-to-English test data" yang telah dibuat sebelumnya.

Scoring Range

Pilih "Translation quality" yang telah dibuat sebelumnya.

Pass Threshold

Tidak termasuk dalam tes ini.

4. Periksa status tugas

Temukan tugas "Translation quality evaluation" dan periksa kolom Evaluation Status-nya:

  • Pending: Selama periode permintaan puncak, tugas evaluasi masuk antrian untuk dieksekusi.

  • In Progress: Sistem sedang mengevaluasi—mohon tunggu dengan sabar.

  • Completed: Evaluasi selesai—Anda dapat melihat hasilnya.

  • Evaluation Failed: Eksekusi tugas evaluasi gagal.

  • Stop Evaluation: Tugas evaluasi dihentikan secara manual oleh pengguna.

Klik tombol refresh (image) di pojok kanan atas. Saat status tugas berubah menjadi Completed, klik kolom Task Name untuk masuk ke halaman detail.

  • Pilih tab Data Details untuk melihat penilaian terperinci tiap titik data.

    Nama kolom

    Deskripsi

    Status

    Status evaluasi: Pending, In Progress, Evaluation Complete, Evaluation Failed, Evaluation Terminated

    No.

    ID sampel

    Prompt

    Pertanyaan asli

    Completion

    Jawaban referensi

    Output

    Respons yang dihasilkan model

    [Nama dimensi evaluasi]

    Kolom ini menampilkan hasil analisis untuk dimensi evaluasi "Translation Quality".

    Actions

    Aksi pengguna yang tersedia—misalnya, klik Details untuk melihat pertanyaan, jawaban, dan hasil evaluasi lengkap.

  • Pilih tab Metric Statistics untuk melihat statistik evaluasi.

    Nama metrik

    Deskripsi

    Nilai contoh

    Overall Score

    Rata-rata skor dari seluruh dimensi evaluasi

    100

    Pass Rate

    Persentase sampel yang lulus

    100%

    Total Evaluation Sets

    Total jumlah item data uji

    3 item

    Completed

    Jumlah evaluasi yang telah selesai

    3 item

    Remaining

    Jumlah evaluasi yang belum selesai

    0 item

Evaluasi kustom: Dimensi evaluasi Manual Evaluation - Classification

Skenario penerapan: Situasi yang memerlukan penilaian subjektif manusia, seperti penilaian kreativitas atau tinjauan kualitas profesional.

Rekomendasi:

  • Gunakan evaluasi manual saat kualitas output model tidak dapat dinilai secara tepat hanya oleh algoritma atau model juri.

  • Dokumentasikan kriteria penilaian yang jelas untuk tiap label dalam Panduan Evaluasi eksternal dan latih anotator untuk pemahaman konsisten.

  • Rancang label untuk mencakup semua skenario output yang mungkin menggunakan istilah klasifikasi yang ringkas dan jelas.

  • Minta beberapa evaluator melakukan anotasi silang pada beberapa sampel untuk memverifikasi konsistensi.

  • Hindari menganotasi terlalu banyak data sekaligus—proses secara batch untuk mengurangi efek kelelahan.

Prosedur:

1. Buat dimensi evaluasi

Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Dimension, lalu klik tombol Create Evaluation Dimension di pojok kanan atas.

Isi formulir dan klik tombol Save.

Item

Konten

Dimension Name

Kreativitas konten

Description

Menilai kreativitas konten.

Type

Pilih Manual Evaluation - Classification.

Pass

Buat dua label: "Excellent" dan "Good."

Fail

Buat dua label: "Average" dan "Poor."

2. Siapkan data uji

Lokasi antarmuka: Buka halaman Data Management, lalu klik tombol Add Dataset di pojok kanan atas.

Isi formulir dan klik tombol Confirm.

Item

Konten

Dimension Name

Data uji kreativitas konten

Description

Pilih tipe Evaluation Set.

❗ Evaluasi model hanya mendukung dataset bertipe Evaluation Set—bukan set pelatihan.

Type

Unggah Sample Data_Content Creativity.xlsx (lampiran ICMS, file_id=151066, unduh online).

Biarkan Completion kosong agar model dapat menghasilkan respons.

3. Buat tugas evaluasi

Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Evaluation Task, lalu klik tombol Create Evaluation Task di pojok kanan atas.

Isi formulir dan klik tombol Evaluate.

Item

Konten

Dimension Name

Evaluasi kreativitas konten

Evaluate Model

Pilih Qwen-Plus.

Judge Model

Pilih Qwen-Max.

System Prompt

Biarkan kosong—tes ini tidak memerlukannya. Untuk informasi selengkapnya, lihat Perbedaan System Prompt vs. Scorer Prompt.

Scorer Template

Pilih Custom Evaluation dan pilih dataset "Content creativity test data" yang telah dibuat sebelumnya.

Scoring Range

Pilih "Content creativity" yang telah dibuat sebelumnya.

Pass Threshold

Ini tidak termasuk dalam tes.

4. Periksa status tugas

Temukan tugas "Content creativity evaluation" dan periksa kolom Evaluation Status-nya—menunjukkan status In Progress. Evaluasi manual memerlukan anotasi manual—sistem tidak akan memberi skor secara otomatis. Klik kolom Task Name untuk masuk ke halaman detail.

  • Pilih tab Data Details, lalu klik tombol Actions kolom Annotate untuk melakukan anotasi manual. Setelah melabeli semua data, status Evaluation Status tugas akan berubah menjadi Completed.

    Nama kolom

    Deskripsi

    Status

    Status evaluasi: In progress

    No.

    ID sampel

    Prompt

    Pertanyaan asli

    Completion

    Jawaban referensi

    Output

    Respons yang dihasilkan model

    [Nama dimensi evaluasi]

    Sesuai dengan nama dimensi evaluasi—misalnya, "Content creativity evaluation"—dan menampilkan hasil analisis.

    Actions

    Aksi pengguna yang tersedia—misalnya, klik Details untuk melihat pertanyaan, jawaban, dan hasil evaluasi lengkap.

  • Pilih tab Metric Statistics untuk melihat statistik evaluasi.

    Nama metrik

    Deskripsi

    Nilai contoh

    Overall Score

    Rata-rata skor dari seluruh dimensi evaluasi

    100

    Score Details - Data Item Distribution

    Distribusi hasil evaluasi klasifikasi

    Pass Rate

    Persentase sampel yang lulus

    100%

    Total Evaluation Sets

    Total jumlah item data uji

    3 item

    Completed

    Jumlah evaluasi yang telah selesai

    3 item

    Remaining

    Jumlah evaluasi yang belum selesai

    0 item

Bandingkan beberapa model menggunakan leaderboard

Skenario penerapan: Bandingkan kinerja beberapa model pada dimensi evaluasi yang sama dan lihat peringkat model secara visual melalui leaderboard.

Rekomendasi:

  • Bandingkan spesifikasi berbeda dalam seri model yang sama (misalnya, qwen-max, qwen-plus, qwen-turbo).

  • Bandingkan model dari vendor berbeda (misalnya, Qwen vs DeepSeek).

  • Bandingkan versi atau konfigurasi berbeda dari model yang sama.

Prasyarat: Anda telah membuat dimensi evaluasi kustom.

Prosedur:

1. Buat leaderboard

Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Leaderboard, lalu klik tombol Create Leaderboard di pojok kanan atas.

Isi formulir dan klik tombol OK.

Item

Konten

Leaderboard Name

Leaderboard akurasi Common-sense QA

Evaluation Dimension

Pilih dimensi evaluasi yang tersedia, seperti Common-sense QA accuracy.

Associate Optional Tasks

Anda dapat memilih tugas evaluasi yang tersedia sekarang atau menambahkannya nanti.

Catatan:

  • Setiap leaderboard mendukung hingga 50 tugas evaluasi.

  • Setelah membuat leaderboard, Anda tidak dapat mengubah dimensi evaluasinya.

  • Semua tugas dalam leaderboard yang sama menggunakan dimensi evaluasi yang sama untuk memastikan perbandingan yang adil.

2. Tambahkan tugas evaluasi ke leaderboard

Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Leaderboard, lalu klik nama leaderboard untuk masuk ke halaman detailnya.

Leaderboard mendukung dua cara untuk Add Evaluation Task:

Metode 1: Create New Task

  1. Di halaman detail leaderboard, klik tombol Add Evaluation Task.

  2. Klik Create New Task.

  3. Sistem secara otomatis mengarahkan ke halaman pembuatan tugas dengan leaderboard yang telah ditautkan:

    • Include in Leaderboard: Secara otomatis dicentang dan dikunci—tidak dapat dibatalkan centangnya.

    • Leaderboard: Secara otomatis diisi dengan nama leaderboard saat ini dan dikunci.

    • Evaluation Dimension: Secara otomatis diisi dengan dimensi yang ditautkan leaderboard dan dikunci.

  4. Isi bidang lain yang diperlukan:

    • Task Name: Masukkan nama tugas—sertakan informasi model untuk identifikasi mudah.

    • Evaluate Model: Pilih model yang akan dievaluasi.

    • Data Source: Pilih dataset evaluasi.

  5. Klik tombol Evaluate.

Metode 2: Select Existing Task

  1. Di halaman detail leaderboard, klik tombol Add Evaluation Task.

  2. Klik Select Existing Task.

  3. Pilih tugas evaluasi yang telah selesai untuk ditambahkan ke leaderboard.

  4. Klik tombol OK.

Catatan:

  • Hanya tugas yang telah selesai menggunakan dimensi evaluasi yang sama yang dapat bergabung dengan leaderboard.

  • Gunakan dataset evaluasi yang sama untuk hasil perbandingan yang akurat.

3. Lihat hasil leaderboard

Lokasi antarmuka: Buka halaman Model Evaluation, pilih tab Leaderboard, lalu klik nama leaderboard untuk masuk ke halaman detailnya.

Halaman detail leaderboard menampilkan:

Nama Kolom

Deskripsi

Rank

Peringkat yang dihitung secara otomatis berdasarkan skor leaderboard—semakin tinggi skornya, semakin tinggi peringkatnya.

Task Name

Nama tugas evaluasi.

Evaluate Model

Nama model yang digunakan dalam tugas tersebut.

Leaderboard Score

Skor komprehensif untuk tugas ini pada dimensi evaluasi saat ini (rentang: 0–100).

[Nama dimensi evaluasi]

Menampilkan skor spesifik untuk dimensi ini—misalnya, dimensi "Semantic Similarity" menunjukkan skor rata-rata kesamaan semantik.

Actions

Hapus tugas (menghapus tugas dari leaderboard tanpa memengaruhi tugas itu sendiri).

Catatan:

  • Leaderboard Score diperbarui secara real-time saat evaluasi tugas berlangsung.

  • Tugas yang sedang berlangsung menampilkan "-" di kolom skor.

  • Klik Task Name untuk melihat data evaluasi terperinci.

Teknik lanjutan

Praktik terbaik untuk desain dimensi evaluasi

Tanggung jawab tunggal:

  • Setiap dimensi evaluasi harus fokus pada satu tujuan evaluasi.

  • Hindari mencampur beberapa standar.

  • Contoh: Jangan menilai "akurasi" dan "kelancaran" dalam dimensi yang sama.

Standar yang dapat dikuantifikasi:

  • Gunakan standar objektif dan dapat dikuantifikasi kapan pun memungkinkan.

  • Kurangi subjektivitas.

  • Berikan kriteria jelas untuk tiap level skor.

Optimasi iteratif:

  • Optimalkan Prompt secara berkelanjutan berdasarkan umpan balik evaluasi.

  • Periksa secara berkala untuk memverifikasi akurasi evaluasi.

  • Bandingkan penilaian manusia dan AI untuk menyesuaikan standar evaluasi.

Teknik penulisan Prompt

Lihat Prompt Best Practices dan Plugins untuk Alibaba Cloud Model Studio untuk mempelajari cara memaksimalkan kinerja model tanpa model fine-tuning.

Rekomendasi optimasi biaya

Pilih metode evaluasi dengan bijak:

  • Evaluasi berbasis aturan memiliki biaya terendah—ideal untuk validasi output terformat.

  • Evaluasi model besar lebih mahal—gunakan untuk skenario yang memerlukan pemahaman semantik.

  • Evaluasi manual paling mahal—cadangkan untuk kasus yang memerlukan penilaian manusia.

Gunakan inference result sets:

  • Untuk model garis dasar yang sering dievaluasi, simpan output sebagai inference result sets.

  • Hindari panggilan model berulang untuk mengurangi biaya inferensi.

Evaluasi bertahap:

  • Pertama validasi konfigurasi dengan dataset kecil (50–100 item).

  • Setelah konfirmasi pengaturan benar, tingkatkan ke 200–500 item.

Evaluasi batch:

  • Evaluasi beberapa model secara simultan untuk meningkatkan efisiensi.

  • Pilih beberapa model dalam tugas evaluasi yang sama.

Metode analisis hasil evaluasi

Pantau distribusi skor:

  • Periksa jumlah sampel di tiap level skor.

  • Identifikasi pengelompokan bermasalah (misalnya, semua skor di 3 poin).

  • Sesuaikan standar penilaian atau ambang batas.

Analisis sampel khas:

  • Tinjau sampel dengan skor tinggi: pahami kekuatan model.

  • Tinjau sampel dengan skor rendah: identifikasi kelemahan model.

  • Tinjau sampel ambang batas: sempurnakan standar evaluasi.

Bandingkan model berbeda:

  • Jangan hanya melihat skor total—periksa kinerja di berbagai skenario.

  • Identifikasi kekuatan dan kelemahan tiap model.

  • Pilih model yang sesuai berdasarkan prioritas bisnis.

Lacak iterasi model:

  • Buat siklus evaluasi rutin.

  • Catat hasil evaluasi setelah tiap fine-tuning.

  • Analisis apakah arah fine-tuning sudah benar.

Pemecahan masalah isu umum

Hasil evaluasi tidak memenuhi ekspektasi:

  1. Verifikasi apakah data uji mewakili skenario bisnis Anda.

  2. Tinjau apakah Prompt dimensi evaluasi jelas.

  3. Coba sesuaikan rentang skor dan ambang batas.

  4. Pertimbangkan mengganti model juri atau templat penilai.

Skor terlalu mengelompok:

  1. Kriteria penilaian terlalu luas → sempurnakan deskripsi untuk tiap level skor.

  2. Data uji kurang beragam → tambahkan sampel tepi dan abnormal.

  3. Model juri terlalu konservatif → ganti ke model inferensi yang lebih mumpuni.

Hasil bertentangan di berbagai dimensi evaluasi:

  1. Ini normal—model berkinerja berbeda di berbagai dimensi.

  2. Bobot dimensi sesuai prioritas bisnis.

  3. Jangan mengandalkan dimensi tunggal—ambil keputusan secara holistik.

Jika output model sering menunjukkan cacat berikut, pertimbangkan menambahkan basis pengetahuan:

  • Output model sama sekali tidak terkait dengan jawaban referensi (model jelas kekurangan pengetahuan latar belakang yang relevan).

  • Output model sebagian terkait dengan jawaban referensi (model memiliki pengetahuan latar belakang tetapi sudah usang).

Informasi Penagihan

Biaya evaluasi model berasal dari dua bagian: biaya inferensi model yang dievaluasi dan biaya penilaian model juri.

Biaya inferensi model yang dievaluasi

Jenis Model

Ditagih?

Detail Penagihan

Model Preset (seperti qwen-max, qwen-plus)

Ya

Ditagih berdasarkan konsumsi token

Model yang Dideploy Secara Independen (fine-tuned dan dideploy)

Tidak

Tidak ada biaya tambahan

Rumus penagihan model yang dievaluasi:

Token masukan meliputi:

  • System Prompt (jika dikonfigurasi)

  • Prompt dari data evaluasi (pertanyaan pengguna)

Token output mencakup:

  • Respons yang dihasilkan model (Output)

Biaya penilaian model juri (gratis untuk waktu terbatas)

Hanya evaluasi model besar (numerik, klasifikasi) yang melibatkan penggunaan model juri.

Contoh perhitungan biaya lengkap

Skenario: Evaluasi 100 item data menggunakan qwen-plus dengan Model Evaluation - Numeric, menggunakan qwen-max sebagai model juri.

Asumsi: Rata-rata 50 token/Prompt, 200 token/Output, 500 token/scorer Prompt, 5 token/judge model output.

Perhitungan biaya (qwen-plus input $0,26/1M token, output $0,78/1M token; model juri ditagih sesuai harga konsol Model Studio):

  • Model yang dievaluasi: 5.000/1.000.000 × 0,26 + 20.000/1.000.000 × 0,78 = $0,0013 + $0,0156 = $0,017

  • Model juri: Ditagih sesuai harga konsol Model Studio saat ini.

  • Total biaya ≈ $0,017 (tidak termasuk biaya model juri).

Referensi harga

Harga terbaru: Lihat Konsol Model Studio.

Catatan:

  • Harga dapat berubah—selalu merujuk ke tampilan konsol.

  • Beberapa model mungkin memiliki penawaran promosi waktu terbatas.

Langkah selanjutnya

  • Jika Anda puas dengan kinerja model yang dievaluasi, mulai panggilan model dan integrasikan ke alur kerja bisnis Anda.

  • Jika Anda tidak puas dengan kinerja model yang dievaluasi, pilih model lain untuk dievaluasi ulang. Anda juga dapat mempertimbangkan belajar dan mendapatkan Sertifikasi Insinyur ACA Generative AI. Kursus gratis yang menyertainya membantu Anda memahami secara sistematis kemampuan model besar, skenario aplikasi, dan teknik optimasi.