Anda dapat menggunakan fine-tuning model di Alibaba Cloud Model Studio jika performa model tidak memenuhi ekspektasi Anda setelah mencoba metode optimasi seperti rekayasa prompt dan pemanggilan plugin. Sebagai strategi inti untuk meningkatkan performa model, fine-tuning dapat secara signifikan meningkatkan kemampuan model dalam industri atau skenario bisnis tertentu, menyelaraskan outputnya dengan preferensi manusia, serta mengurangi latensi output. Fine-tuning mencakup tiga metode pelatihan: supervised fine-tuning (SFT), continual pre-training (CPT), dan direct preference optimization (DPO).
Pengenalan fine-tuning model
Fine-tuning model merupakan metode penting untuk mengoptimalkan performa model. Metode ini dapat:
- Meningkatkan performa model dalam industri tertentu atau untuk kebutuhan bisnis spesifik
- Mengurangi latensi output model
- Menekan halusinasi model
- Menyelaraskan model dengan nilai atau preferensi manusia
- Menggantikan model yang lebih besar dengan model ringan hasil fine-tuning
Selama proses fine-tuning, model mempelajari fitur-fitur spesifik bisnis atau skenario dari data pelatihan, seperti pengetahuan, nada, gaya ekspresi, dan kesadaran diri. Karena model telah mempelajari banyak contoh untuk industri atau skenario tertentu selama pelatihan, performa prompt one-shot atau zero-shot setelah pelatihan lebih baik daripada performa few-shot sebelum pelatihan. Hal ini menghemat token input dan mengurangi latensi output model.
Proses fine-tuning model
Untuk informasi lebih lanjut, lihat:
Model yang didukung
Model yang didukung
Singapura
Generasi teks
Nama model | Kode model | Pelatihan parameter penuh SFT (sft) | Pelatihan efisien SFT (efficient_sft) |
|---|---|---|---|
Qwen3-14B | qwen3-14b | × | Supported |
Pemahaman visual (Qwen-VL)
Nama model | Kode model | Pelatihan parameter penuh SFT (sft) | Pelatihan efisien SFT (efficient_sft) |
|---|---|---|---|
- | - | - | - |
North China 2 (Beijing)
Generasi teks
Layanan model | Kode model | Pelatihan parameter penuh CPT (cpt) | Pelatihan parameter penuh SFT (sft) | Pelatihan efisien SFT (efficient_sft) | Pelatihan parameter penuh DPO (dpo_full) | Pelatihan efisien DPO (dpo_lora) |
|---|---|---|---|---|---|---|
Qwen3.6-Flash-2026-04-16 | qwen3.6-flash-2026-04-16 | × | Supported | × | × | × |
Qwen3.5-27B | qwen3.5-27b | × | Supported | Supported | × | × |
Qwen3.5-9B | qwen3.5-9b | × | Supported | Supported | × | × |
Qwen3.5-Flash-2026-02-23 | qwen3.5-flash-2026-02-23 | × | Supported | × | × | × |
Qwen3-32B | qwen3-32b | Supported | Supported | Supported | Supported | Supported |
Qwen3-30B-A3B-Instruct-2507 | qwen3-30b-a3b-instruct-2507 | Supported | Supported | Supported | × | × |
Qwen3-14B | qwen3-14b | × | Supported | Supported | Supported | Supported |
Qwen3-8B | qwen3-8b | × | Supported | Supported | Supported | Supported |
Qwen3-4B-Instruct-2507 | qwen3-4b-instruct-2507 | Supported | Supported | Supported | Supported | Supported |
Qwen3-1.7B | qwen3-1.7b | Supported | Supported | Supported | Supported | Supported |
Qwen3-0.6B | qwen3-0.6b | Supported | Supported | Supported | Supported | Supported |
Qwen2.5-72B-Instruct | qwen2.5-72b-instruct | Supported | Supported | Supported | Supported | Supported |
Qwen2.5-32B-Instruct | qwen2.5-32b-instruct | Supported | Supported | Supported | Supported | Supported |
Qwen2.5-14B-Instruct | qwen2.5-14b-instruct | Supported | Supported | Supported | Supported | Supported |
Qwen2.5-7B-Instruct | qwen2.5-7b-instruct | Supported | Supported | Supported | Supported | Supported |
Qwen-Plus-Character-2025-11-06 | qwen-plus-character-2025-11-06 | × | Supported | Supported | Supported | Supported |
Pemahaman visual (Qwen-VL)
Layanan model | Kode model | Pelatihan parameter penuh CPT (cpt) | Pelatihan parameter penuh SFT (sft) | Pelatihan efisien SFT (efficient_sft) | Pelatihan parameter penuh DPO (dpo_full) | Pelatihan efisien DPO (dpo_lora) |
|---|---|---|---|---|---|---|
Qwen3-VL-8B-Instruct | qwen3-vl-8b-instruct | × | Supported | Supported | × | × |
Qwen3-VL-8B-Thinking | qwen3-vl-8b-thinking | × | Supported | Supported | × | × |
Qwen3-VL-4B-Instruct | qwen3-vl-4b-instruct | × | Supported | Supported | × | × |
Qwen2.5-VL-72B-Instruct | qwen2.5-vl-72b-instruct | × | Supported | Supported | × | × |
Qwen2.5-VL-32B-Instruct | qwen2.5-vl-32b-instruct | × | Supported | Supported | × | × |
Qwen2.5-VL-7B-Instruct | qwen2.5-vl-7b-instruct | × | Supported | Supported | × | × |
Perbandingan metode fine-tuning
Fitur | CPT (Continual Pre-training) | SFT (Supervised Fine-tuning) | DPO (Direct Preference Optimization) |
|---|---|---|---|
Rangkuman | Menambahkan pengetahuan (Menyuntikkan pengetahuan domain) | Belajar melakukan tugas (Mengikuti instruksi) | Menjalankan tugas lebih baik (Menyelaraskan dengan preferensi manusia) |
Data input | Lebih dari 10 juta token Teks domain tanpa label | Lebih dari 1.000 entri Pasangan "pertanyaan-jawaban" berkualitas tinggi | Lebih dari 100 set Pasangan respons "lebih baik-lebih buruk" untuk instruksi yang sama |
Tujuan utama | Adaptasi domain. Mempelajari kosakata dan fakta khusus. | Mengajarkan format percakapan dan kemampuan menjalankan tugas kepada model. | Menyelaraskan output model lebih baik dengan nilai dan preferensi manusia. |
Metode pembelajaran | Pembelajaran self-supervised (Memprediksi kata berikutnya) | Supervised learning (Meniru ground truth) | Pembelajaran preferensi langsung (Meningkatkan probabilitas respons baik dan menurunkan probabilitas respons buruk) |
Tahap model | Umumnya sebelum SFT | Setelah CPT dan sebelum DPO | Umumnya setelah SFT, sebagai langkah terakhir untuk penyelarasan. |
Perbandingan pola pelatihan
Pelatihan parameter penuh | Pelatihan efisien (LoRA, direkomendasikan) | |
|---|---|---|
Skenario | • Model perlu mendapatkan kemampuan baru • Mencapai performa global optimal. | • Mengoptimalkan performa model untuk skenario tertentu. • Untuk skenario yang sensitif terhadap biaya dan waktu. |
Waktu pelatihan | Lebih lama, dengan konvergensi lebih lambat. | Lebih singkat, dengan konvergensi lebih cepat. |
Penagihan
| Metode penagihan | Pay-as-you-go berdasarkan jumlah data pelatihan |
| Rumus penagihan | Biaya pelatihan model = (Total token dalam data pelatihan + Total token dalam data pelatihan campuran) × Jumlah epoch × Harga satuan pelatihan (Unit penagihan minimum: 1 token)
|
Sebelum Anda melakukan fine-tuning model
-
Meskipun fine-tuning model generasi teks dapat menghasilkan kinerja luar biasa dalam skenario bisnis tertentu, pendekatan ini memiliki keterbatasan berikut:
- Memakan waktu: Ini mencakup pembuatan set data CPT berskala besar (minimal 50 juta token), penyusunan set data SFT yang efektif (lebih dari 1.000 entri), pengumpulan cukup banyak kasus buruk (lebih dari 100) untuk membangun set data DPO yang efektif, serta kecepatan iterasi optimasi model yang lambat.
- Biaya tinggi: Model yang telah melalui fine-tuning hanya dapat digunakan setelah diterapkan, dan penagihan penerapan model cukup tinggi.
-
Alibaba Cloud Model Studio merekomendasikan agar Anda terlebih dahulu mencoba menggunakan Prompt Engineering atau Function Calling untuk menyesuaikan aplikasi Anda. Fine-tuning model biasanya merupakan "pilihan terakhir" untuk meningkatkan kinerja model. Hal ini disebabkan oleh:
- Pada banyak tugas, model mungkin awalnya memberikan kinerja yang buruk, tetapi penerapan teknik prompt yang tepat dapat meningkatkan hasil tanpa perlu melakukan fine-tuning model.
- Optimasi prompt dan plugin secara iteratif lebih lincah dan hemat biaya dibandingkan iterasi fine-tuning model, karena fine-tuning mungkin memerlukan pengumpulan ulang, pembersihan, dan optimasi data, pengumpulan kasus buruk, serta survei pelanggan.
- Bahkan jika Anda akhirnya memutuskan untuk melakukan fine-tuning model, pekerjaan awal pada rekayasa prompt dan optimasi plugin tidak akan sia-sia. Pekerjaan awal ini dapat sepenuhnya digunakan kembali saat membangun set data fine-tuning.
Mulai
Fine-tune model menggunakan Konsol
Langkah-langkah fine-tuning | Tangkapan layar Konsol |
|---|---|
Langkah 1: Di halaman Model Fine-tuning, klik Create Training Task. | Di halaman Create Training Task, lengkapi konfigurasi berikut:
|
Langkah 2: Konfigurasi pelatihan
Kombinasi ini memiliki waktu pelatihan singkat dan kebutuhan data rendah. | |
Langkah 3: Konfigurasi data
| |
Langkah 4: Konfigurasi parameter penyimpanan snapshot parameter model (checkpoint)
Setelah fine-tuning model selesai, Anda dapat mengekspor snapshot parameter di platform Model Studio. Anda kemudian dapat menerapkan model di Model Studio berdasarkan snapshot parameter tersebut. Snapshot parameter yang diekspor disimpan di Cloud Storage dan tidak dapat diakses atau diunduh. | |
Langkah 5: Klik "Start Training" dan tunggu hingga pelatihan model selesai. | |
Langkah 6: Gunakan fitur Deployments Alibaba Cloud Model Studio untuk menerapkan model kustom yang telah dilatih. Setelah penerapan, Anda dapat mengevaluasi model hasil fine-tuning. Untuk informasi lebih lanjut, lihat Model deployment. | |
Proses fine-tuning khas
Ketiga metode fine-tuning yang disediakan oleh Model Studio tidak saling eksklusif, melainkan progresif dan saling melengkapi.
CPT (opsional) → SFT → DPO (opsional)
-
CPT (continual pre-training) – Melengkapi pengetahuan (Model umum memiliki pengetahuan luas tetapi dangkal, yang mungkin tidak memenuhi persyaratan kedalaman dan presisi di bidang profesional)
- Model keuangan:
Mempelajari Istilah Keuangan - Model medis:
Mengingat patologi obat - Model hukum:
Memahami artikel hukum dan yurisprudensi
- Model keuangan:
-
SFT (supervised fine-tuning) – Mempelajari cara melakukan task
- Bot layanan pelanggan:
Mempelajari prosedur layanan pelanggan - Asisten Kode:
Mempelajari paradigma pemrograman - Pemanggilan alat (Agent):
Learns to use MCP
- Bot layanan pelanggan:
-
DPO (direct preference optimization) – Melakukan task dengan lebih baik
- Keamanan dan tanggung jawab:
Menolak saran berbahaya - Keringkasan dan efektivitas:
Memberikan jawaban yang ringkas - Objektivitas dan netralitas:
Mengevaluasi secara adil dan objektif
- Keamanan dan tanggung jawab:
Format data fine-tuning
Set pelatihan SFT
Data pelatihan dalam format SFT ChatML (Chat Markup Language) mendukung percakapan multi-putaran dan berbagai pengaturan role.
Parameter
namedanweightdari OpenAI tidak didukung. Semua output assistant akan dilatih.
# Satu baris data pelatihan (dalam format JSON) memiliki struktur khas berikut saat diperluas:
{"messages": [
{"role": "system", "content": "System input 1"},
{"role": "user", "content": "User input 1"},
{"role": "assistant", "content": "Expected model output 1"},
{"role": "user", "content": "User input 2"},
{"role": "assistant", "content": "Expected model output 2"}
...
]}
Untuk informasi mengenai perbedaan antara system, user, dan assistant, lihat Ikhtisar. Contoh set data pelatihan: SFT-ChatML_format_example.jsonl, SFT-ChatML_format_example.xlsx. Format XLS dan XLSX hanya mendukung percakapan satu putaran.
Semua baris assistant dalam satu entri data pelatihan mendukung parameter "loss_weight", yang mengatur tingkat kepentingan relatif baris tersebut selama pelatihan. (Rentang: 0.0 hingga 1.0. Nilai yang lebih besar menunjukkan kepentingan yang lebih tinggi.)
Parameter ini tersedia untuk pratinjau undangan. Untuk menggunakannya, hubungi account manager Anda.
{"role": "assistant", "content": "Expected model output 1", "loss_weight": 1.0},
{"role": "assistant", "content": "Expected model output 2", "loss_weight": 0.5}
Tips pembuatan dataset
Persyaratan ukuran dataset
Untuk CPT, dataset memerlukan setidaknya 50 juta token data pre-training berkualitas tinggi. Untuk SFT, dataset memerlukan setidaknya 1.000 entri data fine-tuning berkualitas tinggi. Untuk DPO, dataset umumnya memerlukan ratusan entri data preferensi manusia. Jika hasil evaluasi model setelah fine-tuning data tidak memuaskan, cara paling sederhana untuk meningkatkannya adalah mengumpulkan lebih banyak data untuk pelatihan.
Jika Anda kekurangan data, kami menyarankan untuk membuat aplikasi agen dan menggunakan indeks basis pengetahuan untuk meningkatkan kemampuan model. Dalam banyak skenario bisnis kompleks, Anda juga dapat menggabungkan fine-tuning model dan pengambilan dari basis pengetahuan.
Misalnya, dalam skenario layanan pelanggan, Anda dapat menggunakan fine-tuning model untuk mengatasi masalah terkait nada bicara, gaya ekspresi, dan kesadaran diri agen layanan pelanggan. Pengetahuan profesional yang terkait dengan skenario tersebut dapat dimasukkan secara dinamis ke dalam konteks model melalui basis pengetahuan.
Alibaba Cloud Model Studio merekomendasikan agar Anda terlebih dahulu membangun dan menguji aplikasi Generasi yang Diperkaya dengan Pengambilan Data (RAG). Setelah mengumpulkan cukup data aplikasi, Anda kemudian dapat menggunakan fine-tuning model untuk lebih meningkatkan kinerja model.
Anda juga dapat menggunakan strategi berikut untuk memperluas dataset Anda:
- Gunakan model bahasa besar (LLM) untuk mensimulasikan pembuatan konten untuk skenario bisnis tertentu guna membantu Anda menghasilkan lebih banyak data untuk fine-tuning. (Kami menyarankan memilih model yang lebih besar dan berkinerja tinggi untuk proses generasi.)
- Dapatkan lebih banyak data melalui berbagai metode, seperti pengumpulan dari skenario aplikasi, web scraping, media sosial dan forum daring, dataset publik, mitra serta sumber daya industri, dan kontribusi pengguna.
Keragaman dan keseimbangan data
Persyaratan untuk fine-tuning model bervariasi tergantung skenario. Misalnya, profesionalisme sangat penting untuk skenario bisnis tertentu, sedangkan fleksibilitas lebih penting untuk skenario tanya jawab. Anda perlu merancang kasus penggunaan data berdasarkan modul bisnis atau skenario penggunaan yang menjadi tanggung jawab model. Oleh karena itu, efektivitas pelatihan bergantung bukan hanya pada volume data, tetapi juga pada profesionalisme dan keragaman data untuk skenario spesifik tersebut.
Misalnya, dalam skenario percakapan AI cerdas, dataset profesional dan beragam sebaiknya mencakup skenario bisnis berikut:
Bisnis spesifik | Skenario/bisnis beragam |
|---|---|
E-dagang layanan pelanggan | Dorongan promosi, konsultasi pra-penjualan, panduan saat penjualan, layanan purna jual, tindak lanjut purna jual, penanganan keluhan, dll. |
Layanan keuangan | Konsultasi pinjaman, saran investasi dan manajemen kekayaan, layanan kartu kredit, manajemen rekening bank, dll. |
Layanan kesehatan daring | Konsultasi gejala, pendaftaran janji temu, petunjuk kunjungan, pertanyaan informasi obat, tips kesehatan, dll. |
Sekretaris AI | Informasi IT, informasi administratif, informasi SDM, pertanyaan tunjangan karyawan, kueri kalender perusahaan, dll. |
Asisten perjalanan | Perencanaan perjalanan, panduan masuk dan keluar, konsultasi asuransi perjalanan, pengenalan adat dan budaya destinasi, dll. |
Penasihat hukum perusahaan | Tinjauan kontrak, perlindungan kekayaan intelektual, pemeriksaan kepatuhan, tanya jawab hukum ketenagakerjaan, konsultasi transaksi lintas batas, analisis hukum kasus individual, dll. |
Perlu juga diperhatikan bahwa jumlah data untuk setiap skenario/bisnis harus relatif seimbang, dan proporsi datanya harus sesuai dengan proporsi skenario aktual. Hal ini mencegah terlalu banyak data dari satu jenis, yang dapat menyebabkan model cenderung mempelajari fitur-fitur tersebut dan mengganggu kemampuan generalisasinya.
Pemisahan set pelatihan dan set validasi
Anda dapat melakukan fine-tuning model di Konsol.
- Secara otomatis membagi dataset pelatihan lengkap dan mengambil sampel acak sejumlah kecil data untuk membentuk set validasi.
- Memilih untuk mengunggah dataset terpisah.
Konsol menampilkan loss set validasi dan akurasi token secara real time selama pelatihan.
Halaman Data Configuration juga mencakup toggle Mixed Training (nonaktif secara default). Saat Auto Split dipilih, 10% dari set pelatihan secara default dibagi secara acak sebagai set validasi.
FAQ
Apakah saya dapat melakukan fine-tuning model saya sendiri?
Model Studio tidak mendukung fine-tuning, mengunggah model Anda sendiri, atau mengekspor model yang telah diunduh.