All Products
Search
Document Center

:Set pelatihan dan set evaluasi

Last Updated:Sep 09, 2026

Set data merupakan fondasi pelatihan dan evaluasi model. Fitur Data Management Alibaba Cloud Model Studio membantu Anda membuat dan mengelola set data secara efisien.

Ikhtisar set data

Data Management Alibaba Cloud Model Studio mengelola secara terpusat semua set data terkait model besar dalam ruang kerja bisnis Anda. Set data dibagi menjadi Training Set (digunakan untuk model fine-tuning, mendukung SFT/DPO/CPT) dan Evaluation Set (digunakan untuk Evaluasi model).

Set pelatihan mendukung empat skenario pelatihan: generasi teks, pemahaman multimodal, gambar-ke-video (frame pertama), dan gambar-ke-video (frame pertama dan terakhir). Set evaluasi hanya mendukung skenario generasi teks. Jenis set data tidak dapat diubah setelah dibuat; pilih dengan cermat berdasarkan penggunaan downstream Anda.

Nama set data dapat memiliki panjang hingga 50 karakter (mendukung karakter Tionghoa, Inggris, angka, garis bawah, tanda hubung, dan titik), serta deskripsi hingga 200 karakter. Pembuatan atau penerbitan set data kosong tidak didukung. Tidak ada batasan jumlah set data yang dapat Anda buat, dan tidak ada batas atas volume data yang dapat diimpor.

Metode pelatihan DPO/CPT dan pemasangan cloud storage hanya didukung di Wilayah Beijing.

Metode dan skenario pelatihan

Set pelatihan mendukung tiga metode pelatihan dengan skenario penerapan dan kebutuhan data minimum yang berbeda:

  • SFT (supervised fine-tuning): fine-tuning instruksi yang memungkinkan model menyelesaikan tugas tertentu. Disarankan minimal seribu entri. Tersedia di semua situs.
  • DPO (direct preference optimization): pelatihan penyelarasan preferensi. Disarankan minimal seratus entri.
  • CPT (continual pre-training): injeksi pengetahuan domain. Disarankan minimal 50 juta token data. Status draft dan pewarisan data tidak didukung.

Set pelatihan CPT dan gambar-ke-video tidak mendukung status draft; mereka hanya dapat diterbitkan langsung saat pembuatan. Set pelatihan generasi teks SFT dan DPO dapat disimpan sebagai draft sebelum diterbitkan.

Metode pelatihan

Tujuan

Volume data yang disarankan

Ketersediaan situs

Dukungan draft

SFT

Supervised fine-tuning (fine-tuning instruksi)

1.000+ entri

Semua situs

Didukung

DPO

Direct preference optimization (penyelarasan preferensi)

100+ entri

Wilayah Beijing

Didukung

CPT

Continual pre-training (pengetahuan domain)

50 juta token

Wilayah Beijing

Tidak didukung

Metode impor

Set data mendukung tiga metode impor dengan skenario penerapan dan prasyarat yang berbeda:

  • Upload Local File: tanpa prasyarat; unggah langsung file lokal, cocok untuk batch data kecil.
  • OSS Import: tambahkan tag bailian-datahub-access=read ke bucket target; cocok untuk batch data besar. Tidak didukung untuk set evaluasi.
  • Log Backflow: ekstrak otomatis data pelatihan dari log inferensi SLS; memerlukan otorisasi peran terkait layanan, membentuk loop peningkatan inferensi → data → fine-tuning.

Log backflow hanya mendukung log dari 30 hari terakhir, dengan batas impor satu kali sebanyak 100.000 entri, dan memerlukan penentuan API Key serta kondisi filter model.

Data yang diimpor secara otomatis dienkripsi dengan enkripsi sisi server OSS (SSE-OSS, AES256). Log backflow tersedia. Untuk daftar lengkap pembatasan, lihat Ikhtisar set data.

Metode impor

Prasyarat

Skenario penerapan

Didukung untuk set evaluasi

Local upload

Tidak ada

Batch data kecil

Didukung

OSS import

Tag bucket bailian-datahub-access=read

Batch data besar

Tidak didukung

Log backflow

Otorisasi + API Key/filter model

Buat data pelatihan dari log inferensi

Didukung

WarningLog backflow memerlukan otorisasi peran terkait layanan terlebih dahulu, hanya mendukung log dari 30 hari terakhir, dan memiliki batas impor satu kali sebanyak 100.000 entri.

Data Preparation

Menyiapkan data berkualitas tinggi adalah kunci hasil fine-tuning model. Untuk volume data yang disarankan masing-masing metode pelatihan (generasi teks SFT/DPO/CPT), lihat Aturan unggah data tuning.

Tidak ada rekomendasi resmi mengenai volume data untuk set pelatihan pemahaman multimodal dan gambar-ke-video; siapkan sampel yang cukup berdasarkan skenario aktual Anda.

Format data dan templat

Untuk spesifikasi format file data setiap skenario pelatihan (teks SFT/pemahaman multimodal (gambar/video → teks), DPO, CPT, set evaluasi), lihat Aturan unggah data tuning.

Pada halaman pembuatan set data Data Management, unduh templat data untuk skenario yang sesuai; menyiapkan data sesuai struktur templat dapat mencegah kegagalan impor.

Untuk strategi diversifikasi dan augmentasi data, lihat dokumentasi model fine-tuning. Untuk set evaluasi, siapkan set data independen yang tidak tumpang tindih untuk menilai generalisasi model secara objektif.

Create a dataset

Sebelum membuat set data, prasyarat berikut harus dipenuhi: layanan Model Studio telah diaktifkan; untuk impor OSS, tambahkan tag bailian-datahub-access=read ke bucket target; untuk log backflow, otorisasi peran terkait layanan.

Pada halaman daftar Data Management > Dataset, klik Add Dataset, lalu ikuti langkah-langkah berikut:

  1. Masukkan nama set data (maksimal 50 karakter) dan deskripsi (maksimal 200 karakter, opsional).
  2. Pilih jenis set data: Training Set atau Evaluation Set (tidak dapat diubah setelah dibuat).
  3. Pilih skenario pelatihan: generasi teks, pemahaman multimodal, gambar-ke-video (frame pertama), atau gambar-ke-video (frame pertama dan terakhir). Set evaluasi hanya mendukung generasi teks.
  4. Pilih metode pelatihan: SFT, DPO, atau CPT.
  5. Pilih lokasi penyimpanan: Platform OSS storage (gratis, tanpa batas volume data) atau Mount Cloud Storage (tidak tersedia untuk set evaluasi).
  6. Pilih metode impor dan unggah data: local upload, OSS import, atau log backflow (lihat deskripsi tab di bawah).
  7. Konfigurasikan opsi penerbitan: Draft atau Publish. Set pelatihan CPT dan gambar-ke-video tidak mendukung draft dan hanya dapat diterbitkan langsung.
  8. Klik Submit untuk menyelesaikan pembuatan set data.

Ketiga metode impor dioperasikan di tab berbeda, dengan bidang dan operasi berbeda di setiap tab. Set pelatihan generasi teks SFT dan DPO mendukung pengunggahan beberapa file sekaligus.

Parameter

Deskripsi

Wajib

Deskripsi nilai

Dataset name

Identifier set data

true

Maksimal 50 karakter; Tionghoa/Inggris/angka/garis bawah/tanda hubung/titik

Dataset description

Deskripsi set data

Maksimal 200 karakter

Dataset type

Set pelatihan atau set evaluasi; tidak dapat diubah setelah dibuat

true

Training set/Evaluation set

Training scenario

Skenario pelatihan yang berlaku untuk data

true

Text generation/Multimodal understanding/Image-to-video (first frame)/Image-to-video (first and last frame)

Training method

Jenis algoritma pelatihan

true

SFT/DPO/CPT

Storage location

Metode penyimpanan set data

true

Platform OSS storage/Cloud storage mounting

Import method

Sumber impor data

true

Local upload/OSS import/Log backflow

Publishing configuration

Draft atau terbitkan langsung

true

Draft/Publish immediately (CPT dan image-to-video tidak mendukung draft)

ImportantSet pelatihan CPT dan gambar-ke-video tidak mendukung status draft; mereka hanya dapat diterbitkan langsung saat pembuatan.

image

Local upload

Klik Upload File untuk memilih file data lokal. Generasi teks SFT dan DPO mendukung unggah multi-file. Format file harus memenuhi persyaratan skenario (lihat bagian Data preparation), dan data yang diimpor secara otomatis dienkripsi dengan SSE-OSS.

OSS import

Setelah menambahkan tag bailian-datahub-access=read ke bucket target, pilih bucket tersebut dan tentukan path file data. Cocok untuk impor data skala besar; tidak didukung untuk set evaluasi.

Log backflow

Otorisasi peran terkait layanan terlebih dahulu. Pilih API Key dan model, lalu filter log inferensi dari 30 hari terakhir (batas satu kali sebanyak 100.000 entri); sistem secara otomatis mengekstraksi data pelatihan dari log, membentuk loop peningkatan inferensi → data → fine-tuning. Untuk detail operasional lengkap, lihat topik log backflow khusus.

Version management

Satu set data dapat memiliki beberapa versi independen, dengan nomor versi yang bertambah otomatis. Pada halaman detail set data, klik Add Version untuk membuat versi baru.

Saat menambahkan versi, pilih strategi pewarisan data:

  • Inheritance Mode: modifikasi data secara inkremental berdasarkan versi sebelumnya; cocok untuk iterasi minor.
  • Create Mode: impor ulang seluruh data; cocok untuk pembaruan skala besar.

Set pelatihan CPT tidak mendukung pewarisan data; setiap versi baru memerlukan data baru.

Versi draft set data dapat digunakan untuk Data Processing (pembersihan data dan augmentasi data) untuk meningkatkan kualitas data sebelum diterbitkan.

NoteSet pelatihan CPT tidak mendukung pewarisan data; setiap versi baru memerlukan data baru.

Dataset management

Pada halaman daftar Data Management > Dataset, Anda dapat melihat semua set data, memfilter berdasarkan jenis (set pelatihan/set evaluasi), dan mencari berdasarkan nama. Set data yang sedang diimpor memperbarui statusnya secara otomatis setiap 5 detik; tidak perlu refresh manual.

Publish and delete

Publish bersifat ireversibel; versi yang telah diterbitkan tidak dapat diedit. Delete pada versi yang telah diterbitkan juga ireversibel; hanya versi draft yang dapat dihapus. Menghapus seluruh set data akan menghapus semua versinya. Semua operasi ini ireversibel; lakukan dengan hati-hati.

Edit and export

Hanya versi draft yang dapat diedit secara online (konten Prompt/Completion dapat diedit); pengeditan tidak tersedia untuk versi yang telah diterbitkan. Saat mengekspor set data, setiap jenis memiliki format berbeda: set pelatihan SFT diekspor sebagai .jsonl, set pelatihan multimodal sebagai .zip, dan set evaluasi sebagai .xlsx. Ekspor set data kosong tidak didukung.

image

ImportantOperasi penerbitan dan penghapusan bersifat ireversibel. Versi yang telah diterbitkan tidak dapat diedit; hanya versi draft yang dapat dihapus. Lakukan dengan hati-hati.

Billing

Fitur Data Management gratis, tetapi penyimpanan set data dan sumber daya downstream dikenai biaya; lihat halaman penagihan Model Studio untuk detailnya.

  • Platform OSS storage: biaya berdasarkan halaman penagihan Model Studio.
  • Mount Cloud Storage: biaya ditagihkan ke akun OSS pengguna sendiri.
  • Log Backflow: biaya SLS yang timbul ditagihkan ke akun produk SLS.

Tinjau dokumentasi penagihan Model Studio untuk harga terbaru sebelum menggunakan.

Next steps

Setelah set data dibuat dan diterbitkan, set data tersebut dapat digunakan dalam skenario downstream berikut:

  • Setelah set pelatihan diterbitkan, set tersebut digunakan untuk model fine-tuning (SFT/DPO/CPT).
  • Setelah set evaluasi diterbitkan, set tersebut digunakan untuk Evaluasi model.

Untuk mempelajari detail operasional lengkap Log backflow (alur otorisasi, logika filter), lihat topik log backflow khusus.

Operasi CRUD set data saat ini hanya didukung di Konsol; API model fine-tuning dapat mereferensikan ID set pelatihan yang telah diterbitkan melalui parameter training_file_ids.