Saat menggunakan image-to-video, jika optimasi prompt atau pemanggilan efek video resmi tidak memenuhi kebutuhan kustom Anda untuk aksi, efek, atau gaya tertentu, gunakan model fine-tuning.
Lingkup penerapan
Wilayah yang didukung: Fitur yang dijelaskan dalam dokumen ini hanya tersedia di wilayah Singapura. Anda harus menggunakan API key yang dibuat di wilayah ini.
Metode fine-tuning yang didukung: Fine-tuning SFT-LoRA efisien.
Model yang didukung untuk fine-tuning:
Image-to-video (berbasis frame pertama): wan2.7-i2v, wan2.6-i2v, wan2.5-i2v-preview, wan2.2-i2v-flash.
Image-to-video (berbasis frame pertama dan terakhir): wan2.2-kf2v-flash.
Cara melakukan fine-tuning model
Image-to-video (berbasis frame pertama)
Tujuan fine-tuning: Latih model LoRA untuk efek hujan uang.
Hasil yang diharapkan: Masukkan gambar frame pertama. Tidak diperlukan prompt. Model menghasilkan video dengan efek hujan uang.
Gambar frame pertama input
| Video output (sebelum fine-tuning) Anda tidak dapat menghasilkan efek hujan uang yang konsisten setiap kali menggunakan prompt. Gerakan tidak dapat dikontrol. | Video output (setelah fine-tuning) Model yang telah difine-tune mereproduksi efek hujan uang spesifik dari set data pelatihan tanpa prompt. |
Image-to-video (berbasis frame pertama dan terakhir)
Tujuan fine-tuning: Latih model LoRA untuk efek majalah mode.
Hasil yang diharapkan: Masukkan gambar frame pertama dan gambar frame terakhir. Tidak diperlukan prompt. Model menghasilkan video dengan efek majalah mode.
Masukkan gambar frame pertama
| Masukkan gambar frame terakhir
| Video output (sebelum fine-tuning) Anda tidak dapat menghasilkan efek majalah mode yang konsisten setiap kali menggunakan prompt. Gerakan tidak dapat dikontrol. | Video output (setelah fine-tuning) Model yang telah difine-tune mereproduksi efek majalah mode spesifik dari set data pelatihan tanpa prompt. |
Sebelum menjalankan kode di bawah, ambil API key dan API host Anda, serta konfigurasikan API key Anda.
Langkah 1: Unggah dataset Anda
Unggah dataset lokal Anda (dalam format .zip) ke Alibaba Cloud Model Studio. Ambil ID file (id).
Dataset pelatihan contoh: Lihat set pelatihan untuk detail format.
Image-to-video (berbasis frame pertama): wan-i2v-training-dataset.zip.
Image-to-video (berbasis frame pertama dan terakhir): wan-kf2v-training-dataset.zip.
Contoh permintaan
Contoh ini menggunakan model image-to-video berbasis frame pertama. Hanya unggah set pelatihan. Sistem secara otomatis membagi sebagian sebagai set validasi.Mengunggah dataset memerlukan beberapa menit. Waktu pasti tergantung pada ukuran file.
curl --location --request POST 'https://dashscope-intl.aliyuncs.com/compatible-mode/v1/files' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--form 'file=@"./wan-i2v-training-dataset.zip"' \
--form 'purpose="fine-tune"'Contoh respons
Simpan id. Ini adalah pengenal unik untuk dataset yang Anda unggah.
{
"id": "file-ft-b2416bacc4d742xxxx",
"object": "file",
"bytes": 73310369,
"filename": "wan-i2v-training-dataset.zip",
"purpose": "fine-tune",
"status": "processed",
"created_at": 1766127125
}Langkah 2: Fine-tune model
Langkah 2.1 Buat pekerjaan fine-tuning
Mulai pelatihan menggunakan ID file dari Langkah 1.
Nilai hiperparameter bervariasi tergantung model. Untuk pengaturan hiperparameter, lihat hiperparameter. Untuk lebih banyak contoh permintaan, lihat contoh permintaan.
Contoh permintaan
Ganti <replace with training dataset file ID> sepenuhnya dengan id dari langkah sebelumnya.
Image-to-video (berbasis frame pertama)
curl --location 'https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"model": "wan2.7-i2v",
"training_file_ids": [
"<your-training-dataset-file-id>"
],
"training_type": "efficient_sft",
"hyper_parameters": {
"n_epochs": 400,
"batch_size": 1,
"learning_rate": 2e-5,
"split": 0.9,
"max_split_val_dataset_sample": 5,
"eval_epochs": 50,
"max_pixels": 102400,
"save_total_limit": 10,
"lora_rank": 32,
"lora_alpha": 32
}
}'Image-to-video (berbasis frame pertama dan terakhir)
curl --location 'https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"model": "wan2.2-kf2v-flash",
"training_file_ids": [
"<your-training-dataset-file-id>"
],
"training_type": "efficient_sft",
"hyper_parameters": {
"n_epochs": 400,
"batch_size": 4,
"learning_rate": 2e-5,
"split": 0.9,
"max_split_val_dataset_sample": 5,
"eval_epochs": 50,
"max_pixels": 262144,
"save_total_limit": 10,
"lora_rank": 32,
"lora_alpha": 32
}
}'Contoh respons
Periksa tiga parameter utama berikut di output:
job_id: ID pekerjaan. Gunakan untuk memeriksa progres.finetuned_output: Nama model baru hasil fine-tuning. Gunakan nama ini untuk deployment.status: Status pelatihan. Setelah membuat pekerjaan, status awalnya adalah PENDING. Pelatihan belum dimulai.
{
...
"output": {
"job_id": "ft-202511111122-xxxx",
"status": "PENDING",
"finetuned_output": "xxxx-ft-202511111122-xxxx",
...
}
}Langkah 2.2 Periksa status pekerjaan fine-tuning
Gunakan job_id dari Langkah 2.1 untuk memeriksa progres. Poll endpoint ini hingga status menjadi SUCCEEDED.
Pekerjaan fine-tuning ini memerlukan beberapa jam. Waktu pasti tergantung pada model. Harap bersabar.
Contoh permintaan
Ganti <replace with fine-tuning job job_id> di URL sepenuhnya dengan nilai job_id.
curl --location 'https://dashscope-intl.aliyuncs.com/api/v1/fine-tunes/<your-job-id>' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json'Contoh respons
Periksa dua parameter berikut di field output:
status: Saat nilai ini menjadi SUCCEEDED, pelatihan selesai. Anda dapat menerapkan model.usage: Total token yang digunakan untuk pelatihan. Digunakan untuk penagihan.
{
...
"output": {
"job_id": "ft-202511111122-xxxx",
"status": "SUCCEEDED",
"usage": 432000,
...
}
}Langkah 3: Terapkan model hasil fine-tuning
Langkah 3.1 Terapkan model sebagai layanan online
Setelah status pekerjaan fine-tuning menjadi SUCCEEDED, terapkan model sebagai layanan online.
Contoh permintaan
Ganti <replace with model name model_name> sepenuhnya dengan nilai finetuned_output dari membuat pekerjaan fine-tuning.
Image-to-video (berbasis frame pertama)
curl --location 'https://dashscope-intl.aliyuncs.com/api/v1/deployments' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"model_name": "<your-model-name>",
"aigc_config": {
"use_input_prompt": false,
"prompt": "Provide a video description based on the image content. The description must include the phrase “Then the s86b5p money rain effect begins, countless huge-sized US dollar bills (beige background/dark green patterns) pour down like a torrential rain, densely hitting and surrounding them. The bills continue to fall, while the camera slowly zooms in, they stretch their arms upward, neck slightly tilted back, expression surprised, completely immersed in this wild money rain.”\nOutput Template:\nThe video begins with a shot of [subject description]. [Environment description]. Then the s86b5p money rain effect begins, countless huge-sized US dollar bills (beige background/dark green patterns) pour down like a torrential rain, densely hitting and surrounding them. The bills continue to fall, while the camera slowly zooms in, they stretch their arms upward, neck slightly tilted back, expression surprised, completely immersed in this wild money rain.\nExample:\nThe video begins showing a young woman standing in front of a brick wall covered with ivy. She has long, smooth reddish-brown hair, wearing a white sleeveless dress, a shiny silver necklace, and a smile on her face. The brick wall in the background is covered with green vines, appearing rustic and natural. Then the s86b5p money rain effect begins, countless huge-sized US dollar bills (beige background/dark green patterns) pour down like a torrential rain, densely hitting and surrounding her. The bills continue to fall, while the camera slowly zooms in, she stretches her arms upward, neck slightly tilted back, expression surprised, completely immersed in this wild money rain.",
"lora_prompt_default": "Then the s86b5p money rain effect begins, countless huge-sized US dollar bills (beige background/dark green patterns) pour down like a torrential rain, densely hitting and surrounding the main character. The bills continue to fall, while the camera slowly zooms in, the main character stretches their arms upward, neck slightly tilted back, with a surprised expression, completely immersed in this wild money rain."
},
"capacity": 1,
"plan": "lora"
}'Image-to-video (berbasis frame pertama dan terakhir)
curl --location 'https://dashscope-intl.aliyuncs.com/api/v1/deployments' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--header 'Content-Type: application/json' \
--data '{
"model_name": "<your-model-name>",
"aigc_config": {
"use_input_prompt": false,
"prompt": "Provide a video description based on the image content. The description must include the phrase “Then they begin the s86b5p transformation.”\nOutput Template:\nThe video begins with a shot of [subject description]. [Environment description]. Then they begin the s86b5p transformation.\nExample:\nThe video begins with a young woman in an outdoor setting. She has short, curly dark brown hair and a friendly smile. She is wearing a black Polo shirt with colorful floral embroidery. The background features green vegetation and distant mountains. Then she begins the s86b5p transformation.",
"lora_prompt_default": "Then they begin the s86b5p transformation."
},
"capacity": 1,
"plan": "lora"
}'Contoh respons
Periksa dua parameter berikut di output:
deployed_model: Nama model yang diterapkan. Gunakan untuk memeriksa status deployment dan memanggil model.status: Status deployment. Setelah menerapkan model hasil fine-tuning, status awalnya adalah PENDING. Deployment belum dimulai.
{
...
"output": {
"deployed_model": "xxxx-ft-202511111122-xxxx",
"status": "PENDING",
...
}
}Langkah 3.2 Periksa status deployment
Poll endpoint ini hingga status menjadi RUNNING.
Deployment model hasil fine-tuning ini memerlukan sekitar 5–10 menit.
Contoh permintaan
Ganti <replace with deployed_model> sepenuhnya dengan nilai deployed_model dari Langkah 3.1.
Contoh respons
Periksa dua parameter berikut di field output:
status: Saat status menjadi RUNNING, model berhasil diterapkan. Anda dapat mulai memanggilnya.deployed_model: Nama model yang diterapkan.
{
...
"output": {
"status": "RUNNING",
"deployed_model": "xxxx-ft-202511111122-xxxx",
...
}
}Langkah 4: Panggil model untuk menghasilkan video
Setelah model berhasil diterapkan (ketika status deployment adalah RUNNING ), Anda dapat mulai memanggil model.
Buat dataset kustom
Selain menggunakan dataset contoh dalam panduan ini, Anda dapat membuat dataset sendiri untuk fine-tuning.
Dataset Anda harus mencakup set pelatihan (wajib) dan boleh mencakup set validasi (opsional, mendukung pemisahan otomatis dari set pelatihan). Kemas semua file ke dalam file .zip. Gunakan hanya huruf Inggris, angka, garis bawah, atau tanda hubung dalam nama file.
Format dataset
Set pelatihan: Wajib
Image-to-video (berbasis frame pertama)
Set pelatihan mencakup gambar frame pertama, video pelatihan, dan file anotasi (data.jsonl).
Set pelatihan contoh: wan-i2v-training-dataset.zip.
Struktur direktori ZIP:
wan-i2v-training-dataset.zip ├── data.jsonl # Harus bernama data.jsonl. Ukuran maks: 20 MB. ├── image_1.jpeg # Resolusi maks: 4096×4096. Format: BMP, JPEG, PNG, WEBP. ├── video_1.mp4 # Resolusi maks: 4096×4096. Format: MP4, MOV. ├── image_2.jpeg └── video_2.mp4File anotasi (data.jsonl): Setiap baris adalah satu sampel pelatihan. Harus berupa objek JSON. Struktur:
{ "prompt": "The video begins showing a young woman standing in front of a brick wall covered with ivy. She has long, smooth reddish-brown hair, wearing a white sleeveless dress, a shiny silver necklace, and a smile on her face. The brick wall in the background is covered with green vines, appearing rustic and natural. Then the s86b5p money rain effect begins, countless huge-sized US dollar bills (beige background/dark green patterns) pour down like a torrential rain, densely hitting and surrounding her. The bills continue to fall, she stretches her arms upward, neck slightly tilted back, expression surprised, completely immersed in this wild money rain.", "first_frame_path": "image_1.jpg", "video_path": "video_1.mp4" }
Image-to-video (berbasis frame pertama dan terakhir)
Set pelatihan mencakup gambar frame pertama, gambar frame terakhir, video pelatihan, dan file anotasi (data.jsonl).
Set pelatihan contoh: wan-kf2v-training-dataset.zip.
Struktur direktori ZIP:
wan-kf2v-training-dataset.zip ├── data.jsonl # Harus bernama data.jsonl. Ukuran maks: 20 MB. ├── image/ # Gambar frame pertama dan terakhir. │ ├── image_1_first.jpg # Resolusi maks: 4096×4096. Format: BMP, JPEG, PNG, WEBP. │ └── image_1_last.png └── video/ # Video pelatihan. ├── video_1.mp4 # Resolusi maks: 4096×4096. Format: MP4, MOV. └── video_2.movFile anotasi (data.jsonl): Setiap baris adalah satu sampel pelatihan. Harus berupa objek JSON. Struktur:
{ "prompt": "The video begins by showing a young woman in an outdoor setting. She has short, curly dark brown hair, a smile on her face, and looks very friendly. She is wearing a black polo shirt with colorful floral embroidery, with a background of green vegetation and distant mountains. Then she begins the s86b5p transformation.", "first_frame_path": "image/image_1_first.jpg", "last_frame_path": "image/image_1_last.jpg", "video_path": "video/video_1.mp4" }
Set validasi: Opsional
Image-to-video (berbasis frame pertama)
Set validasi mencakup gambar frame pertama dan file anotasi (data.jsonl). Video tidak diperlukan. Di setiap titik evaluasi, pekerjaan pelatihan secara otomatis memanggil layanan model untuk menghasilkan video pratinjau menggunakan gambar dan prompt validasi.
Set validasi contoh: wan-i2v-valid-dataset.zip.
Struktur direktori ZIP:
wan-i2v-valid-dataset.zip ├── data.jsonl # Harus bernama data.jsonl. Ukuran maks: 20 MB. ├── image_1.jpeg # Resolusi maks: 4096×4096. Format: BMP, JPEG, PNG, WEBP. └── image_2.jpegFile anotasi (data.jsonl): Setiap baris adalah satu sampel validasi. Harus berupa objek JSON. Struktur:
{ "prompt": "The video begins showing a scene of a young man standing in front of a cityscape. He is wearing a black and white checkered jacket over a black hoodie, with a smile on his face and a confident expression. The background is a city skyline at sunset, with a famous domed building and layered roofs visible in the distance, the sky filled with clouds showing warm orange-yellow hues. Then the s86b5p money rain effect begins, countless huge-sized US dollar bills (beige background/dark green patterns) pour down like a torrential rain, densely hitting and surrounding him. The bills continue to fall while the camera slowly zooms in, he stretches his arms upward, neck slightly tilted back, expression surprised, completely immersed in this wild money rain.", "first_frame_path": "image_1.jpg" }
Image-to-video (berbasis frame pertama dan terakhir)
Set validasi mencakup gambar frame pertama, gambar frame terakhir, dan file anotasi (data.jsonl). Video tidak diperlukan. Di setiap titik evaluasi, pekerjaan pelatihan secara otomatis memanggil layanan model untuk menghasilkan video pratinjau menggunakan gambar dan prompt validasi.
Set validasi contoh: wan-kf2v-valid-dataset.zip.
Struktur direktori ZIP:
wan-kf2v-valid-dataset.zip ├── data.jsonl # Harus bernama data.jsonl. Ukuran maks: 20 MB. └── image/ # Gambar frame pertama dan terakhir. ├── image_1_first.jpg # Resolusi maks: 4096×4096. Format: BMP, JPEG, PNG, WEBP. └── image_1_last.jpgFile anotasi (data.jsonl): Setiap baris adalah satu sampel validasi. Harus berupa objek JSON. Struktur:
{ "prompt": "The video begins showing a scene of a young man standing in front of a cityscape. He is wearing a black and white checkered jacket over a black hoodie, with a smile on his face and a confident expression. The background is a city skyline at sunset, with a famous domed building and layered roofs visible in the distance, the sky filled with clouds showing warm orange-yellow hues. Then the s86b5p money rain effect begins, countless huge-sized US dollar bills (beige background/dark green patterns) pour down like a torrential rain, densely hitting and surrounding him. The bills continue to fall while the camera slowly zooms in, he stretches his arms upward, neck slightly tilted back, expression surprised, completely immersed in this wild money rain.", "first_frame_path": "image/image_1_first.jpg", "last_frame_path": "image/image_1_last.jpg", }
Skala data dan batasan
Volume data: Sediakan minimal 10 sampel. Semakin banyak data pelatihan, hasilnya semakin baik. Kami merekomendasikan 20–100 sampel untuk performa stabil.
Arsip ZIP: Saat mengunggah melalui API, ukuran total ≤ 1 GB.
Persyaratan gambar pelatihan:
Format: BMP, JPEG, PNG, WEBP.
Resolusi ≤ 4096×4096.
Tidak ada batas keras untuk ukuran file individual (sistem memproses secara otomatis).
Persyaratan video pelatihan:
Format: MP4, MOV.
Resolusi ≤ 4096×4096.
Tidak ada batas keras untuk ukuran file individual (sistem memproses secara otomatis).
Durasi per video: model wan2.2 direkomendasikan 2–5 detik; model wan2.5 direkomendasikan 2–10 detik; model wan2.6 dan wan2.7 direkomendasikan 2–10 detik.
Pengumpulan dan pembersihan data
1. Tentukan skenario fine-tuning
Wanxiang mendukung fine-tuning untuk image-to-video dalam skenario berikut:
Efek video tetap: Ajarkan model perubahan visual spesifik, seperti carousel atau pergantian kostum ajaib.
Aksi karakter tetap: Tingkatkan kemampuan model untuk mereproduksi gerakan tubuh spesifik, seperti gerakan tari atau teknik bela diri.
Gerakan kamera tetap: Replikasi sinematografi kompleks, seperti dorong, tarik, geser, miring, atau bidikan orbit.
2. Kumpulkan aset mentah
Generasi dan penyaringan AI: Gunakan model dasar Wanxiang untuk menghasilkan video secara batch. Pilih manual sampel berkualitas tinggi yang paling sesuai dengan efek target Anda. Ini adalah metode paling umum.
Perekaman dunia nyata: Jika Anda membutuhkan realisme tinggi untuk adegan interaktif (misalnya, berpelukan, berjabat tangan), gunakan rekaman nyata.
Rendering perangkat lunak 3D: Untuk efek atau animasi abstrak yang memerlukan kontrol presisi, gunakan perangkat lunak 3D (misalnya, Blender, Cinema 4D).
3. Bersihkan data
Dimensi | Persyaratan Positif | Contoh negatif |
Konsistensi | Fitur inti harus sangat seragam. Contoh: Untuk melatih “rotasi 360 derajat”, semua video harus berputar searah jarum jam dengan kecepatan kira-kira sama. | Arah campuran. Dataset berisi rotasi searah dan berlawanan jarum jam. Model tidak tahu arah mana yang harus dipelajari. |
Keragaman | Lebih banyak variasi subjek dan adegan lebih baik. Cakup berbagai subjek (pria, wanita, anak-anak, hewan, bangunan) dan komposisi (close-up, wide shot, high angle, low angle). Juga variasikan resolusi dan rasio aspek. | Adegan atau subjek tunggal. Semua video menunjukkan “seseorang berpakaian merah berputar di depan dinding putih”. Model mungkin salah menganggap “pakaian merah” dan “dinding putih” sebagai bagian dari efek. Gagal saat pakaian berubah. |
Keseimbangan | Jenis data harus seimbang. Jika ada beberapa gaya, jumlahnya harus kira-kira sama. | Ketidakseimbangan parah. 90% adalah video potret, 10% adalah video lanskap. Model mungkin berkinerja buruk pada video lanskap. |
Kemurnian | Visual bersih dan jelas. Gunakan aset asli tanpa gangguan. | Elemen gangguan. Video berisi teks, logo, watermark, bilah hitam jelas, atau noise. Model mungkin mempelajari watermark sebagai bagian dari efek. |
Durasi | Durasi aset ≤ durasi target. Jika Anda ingin video 5 detik, potong aset menjadi 4–5 detik. | Aset terlalu panjang. Anda ingin video 5 detik tetapi memberi model aset 8 detik. Ini menyebabkan pembelajaran aksi tidak lengkap dan kesan terputus-putus. |
Anotasi video: Tulis prompt untuk video
Dalam file anotasi dataset (data.jsonl), setiap video memiliki prompt yang sesuai. Prompt menggambarkan konten video. Kualitas prompt secara langsung menentukan apa yang dipelajari model.
Contoh prompt Video dimulai dengan seorang wanita muda berdiri di depan dinding bata yang ditutupi tanaman ivy. Ia memiliki rambut panjang berwarna cokelat kemerahan yang halus, mengenakan gaun tanpa lengan berwarna putih, kalung perak mengilap, dan senyum di wajahnya. Latar belakangnya adalah dinding bata yang ditutupi sulur-sulur hijau, terlihat rustic dan alami. Kemudian efek hujan uang s86b5p dimulai, lembaran uang kertas dolar AS berukuran sangat besar (latar belakang krem/pola hijau tua) turun deras seperti hujan lebat, memenuhi dan mengelilinginya secara rapat. Uang terus berjatuhan, ia mengangkat kedua lengannya ke atas, leher sedikit mendongak, ekspresi terkejut, benar-benar tenggelam dalam hujan uang liar ini. |
Rumus penulisan prompt
Prompt = [Deskripsi subjek] + [Deskripsi latar belakang] + [Kata pemicu] + [Deskripsi gerakan]
Elemen prompt | Deskripsi | Panduan | Contoh |
Deskripsi subjek | Jelaskan orang atau objek yang ada dalam frame | Wajib | The video begins with a young woman... |
Deskripsi latar belakang | Jelaskan lingkungan tempat subjek berada | Wajib | The background is a brick wall covered with green vines... |
Kata pemicu | Kata langka yang tidak bermakna | Disarankan | s86b5p atau m01aa |
Deskripsi gerakan | Jelaskan perubahan dinamis selama efek secara detail | Disarankan | Countless huge-sized US dollar bills (beige background/dark green patterns) pour down like a torrential rain... |
Cara menulis prompt yang baik
Ikuti aturan konsistensi untuk deskripsi efek
Untuk semua sampel yang mengandung efek sama, pertahankan bagian deskripsi gerakan semaksimal mungkin konsisten. Terapkan aturan ini untuk set pelatihan dan validasi.
Tujuan: Saat model melihat
s86b5pdiikuti deskripsi tetap yang sama dan selalu melihat hujan uang, ia belajar bahwa s86b5p = efek visual hujan uang.Contoh: Baik subjeknya “wanita muda” atau “pria berjas”, prompt diakhiri dengan cara yang sama untuk efek hujan uang: “...then the s86b5p money rain effect begins, countless US dollar bills pour down like a torrential rain...”
Jenis sampel
Konten prompt (Perhatikan konsistensi bagian yang digarisbawahi)
Sampel pelatihan 1
Video diawali dengan seorang wanita muda yang berdiri di depan dinding bata... (deskripsi lingkungan ditiadakan)... Kemudian, efek hujan uang s86b5p dimulai: lembaran-lembaran uang dolar AS berukuran sangat besar dan tak terhitung jumlahnya (latar belakang krem/pola hijau tua) mengguyur turun seperti hujan deras, menghujani dan mengelilinginya. Ia merentangkan tangan ke atas, lehernya sedikit mendongak ke belakang, dengan ekspresi terkejut, larut sepenuhnya dalam hujan uang yang liar ini.
Sampel pelatihan 2
Video dimulai dengan seorang pria berjas di sebuah restoran mewah... (deskripsi lingkungan dihilangkan)... Kemudian, efek hujan uang s86b5p dimulai: lembaran uang dolar AS berukuran sangat besar yang tak terhitung jumlahnya (latar belakang krem/pola hijau tua) turun deras seperti hujan lebat, menghantam dan mengelilinginya secara padat. Lembaran-lembaran uang tersebut terus berjatuhan, sementara ia merentangkan tangan ke atas, mendongakkan leher sedikit ke belakang, dengan ekspresi terkejut, sepenuhnya tenggelam dalam hujan uang yang dahsyat ini.
Sampel validasi 1
Video dimulai dengan seorang anak kecil yang berdiri di depan pemandangan kota... (deskripsi lingkungan dihilangkan)... Lalu, efek hujan uang s86b5p dimulai. Lembaran dolar AS raksasa yang tak terhitung jumlahnya (latar belakang krem/pola hijau tua) mengguyur deras seperti hujan lebat, menghujani dan mengelilinginya secara rapat. Uang kertas tersebut terus berjatuhan sementara Kamera perlahan melakukan zoom in. Anak itu merentangkan kedua tangannya ke atas dengan leher sedikit mendongak ke belakang, wajahnya tampak terkejut dan benar-benar larut dalam hujan uang yang dahsyat ini.
Gunakan AI untuk menghasilkan prompt
Untuk mendapatkan prompt berkualitas tinggi, gunakan model bahasa besar multimodal seperti Qwen-VL untuk membantu.
Gunakan AI untuk menghasilkan deskripsi awal
Brainstorming bebas (cari inspirasi): Jika Anda tidak yakin cara menggambarkan efek, biarkan AI menjelajah secara bebas.
Kirim “
Describe the video content in detail” dan amati output model.Fokus pada istilah yang digunakan model untuk lintasan gerakan (misalnya, “pour down like a torrential rain”, “camera slowly zooms in”). Istilah ini dapat digunakan untuk optimasi selanjutnya.
Prompt format tetap (standarkan output): Setelah Anda memiliki gambaran kasar, rancang format tetap untuk memandu AI menghasilkan prompt yang sesuai templat Anda.
Ekstrak templat efek
Jalankan proses beberapa kali pada sampel dengan efek yang sama. Identifikasi frasa frekuensi tinggi dan akurat yang digunakan untuk menggambarkan efek. Ekstrak “deskripsi efek” generik.
Salin dan tempel deskripsi efek standar ini ke semua sampel untuk efek tersebut.
Pertahankan deskripsi “subjek” dan “latar belakang” unik untuk setiap sampel. Ganti hanya bagian “deskripsi efek” dengan templat terpadu.
Tinjauan manual
AI mungkin halusinasi atau membuat kesalahan deteksi. Sebagai langkah terakhir, lakukan pemeriksaan manual. Misalnya, konfirmasi bahwa deskripsi entitas dan latar belakang sesuai dengan adegan aktual.
Evaluasi model menggunakan set validasi
Tentukan set validasi
Pekerjaan fine-tuning memerlukan set pelatihan. Set validasi opsional. Anda dapat memilih agar sistem memisahkan secara otomatis atau mengunggah manual. Tentukan sebagai berikut:
Metode 1: Tidak mengunggah set validasi (sistem memisahkan secara otomatis)
Saat Anda membuat pekerjaan fine-tuning, jika Anda tidak mengunggah set validasi terpisah, artinya parameter validation_file_ids tidak dikirim, sistem secara otomatis memisahkan sebagian set pelatihan untuk digunakan sebagai set validasi berdasarkan dua hiperparameter berikut:
split: Proporsi data pelatihan yang dipisahkan. Misalnya, 0,9 berarti 90% untuk pelatihan dan 10% untuk validasi.max_split_val_dataset_sample: Jumlah maksimum sampel untuk set validasi hasil pemisahan otomatis.
Aturan pemisahan set validasi: Sistem memilih nilai lebih kecil antara ukuran dataset × (1 - split) dan max_split_val_dataset_sample.
Contoh: Misalkan Anda hanya mengunggah set pelatihan dengan 100 sampel, split=0,9 (10% untuk validasi), dan max_split_val_dataset_sample=5.
Pemisahan teoretis: 100 × 10% = 10 sampel.
Pemisahan aktual: min(10, 5)=5. Jadi sistem hanya menggunakan 5 sampel untuk set validasi.
Metode 2: Unggah set validasi manual (menggunakan validation_file_ids)
Jika Anda lebih suka mengevaluasi checkpoint menggunakan data yang Anda siapkan sendiri daripada mengandalkan pemisahan acak sistem, unggah set validasi kustom.
Catatan: Setelah Anda memilih unggah manual, sistem mengabaikan aturan pemisahan otomatis di atas dan hanya memvalidasi dengan data yang Anda unggah.
Pilih checkpoint terbaik untuk deployment
Selama pelatihan, sistem menyimpan “snapshot” berkala (checkpoint). Secara default, sistem mengeluarkan checkpoint terakhir sebagai model hasil fine-tuning. Namun checkpoint antara mungkin mengungguli versi akhir. Anda dapat memilih yang terbaik untuk deployment.
Sistem menjalankan checkpoint pada set validasi dan menghasilkan video pratinjau pada interval yang ditentukan oleh hiperparameter eval_epochs.
Evaluasi: Nilai dengan menonton video pratinjau secara langsung.
Kriteria pemilihan: Pilih checkpoint dengan kualitas visual terbaik dan tanpa distorsi gerakan.
Prosedur
Langkah 1: Lihat hasil pratinjau untuk checkpoint
Langkah 2: Ekspor checkpoint dan dapatkan nama model untuk deployment
Langkah 3: Terapkan dan panggil model
Go live
Dalam produksi, jika model terlatih awal berkinerja buruk (misalnya, visual terdistorsi, efek lemah, gerakan tidak akurat), sesuaikan sepanjang dimensi berikut:
1. Periksa data dan prompt
Konsistensi data: Konsistensi sangat penting. Periksa “sampel buruk” dengan arah berlawanan atau gaya sangat berbeda.
Jumlah sampel: Tingkatkan data berkualitas tinggi menjadi 20+ sampel.
Prompt: Pastikan kata pemicu adalah istilah langka yang tidak bermakna (misalnya, s86b5p). Hindari kata umum (misalnya, running) yang menyebabkan interferensi.
2. Sesuaikan hiperparameter: Lihat hiperparameter untuk detail.
n_epochs (epoch pelatihan)
Default: 400. Gunakan default kecuali diperlukan. Jika menyesuaikan, ikuti aturan: “Total langkah pelatihan ≥ 800”.
Rumus total langkah:
langkah = n_epochs × ceiling (ukuran set pelatihan / batch_size).Rumus minimum n_epochs:
n_epochs = 800 / ceiling (ukuran dataset / batch_size).Contoh: Asumsikan set pelatihan 5 sampel, menggunakan model Wan2.5 (batch_size=2).
Langkah per epoch: 5 / 2 = 2,5, dibulatkan ke atas menjadi 3. Total epoch: n_epochs = 800 / 3 ≈ 267. Ini adalah minimum yang direkomendasikan. Anda dapat meningkatkannya sesuai kebutuhan.
Anda dapat menggunakan nilai default untuk learning_rate (tingkat pembelajaran) dan batch_size (ukuran batch). Nilai ini biasanya tidak perlu dimodifikasi.
Penagihan
Pelatihan model: Dikenai biaya.
Biaya = Total token pelatihan × Harga satuan. Lihat penagihan pelatihan model.
Setelah pelatihan, periksa total token yang dikonsumsi di field
usagedari API tanyakan status pekerjaan fine-tuning.
Deployment model: Gratis.
Pemanggilan model: Dikenai biaya.
Ditagih sesuai harga pemanggilan standar model dasar hasil fine-tuning. Lihat harga model.
Referensi API
FAQ
T: Bagaimana volume data set pelatihan dan validasi dihitung?
J: Set pelatihan wajib, set validasi opsional. Metode perhitungan sebagai berikut:
Saat tidak disediakan set validasi: Set pelatihan yang diunggah adalah "ukuran total dataset". Sistem secara otomatis memisahkan sebagian data untuk validasi.
Ukuran set validasi =
min(ukuran total dataset × (1 − split), max_split_val_dataset_sample). Untuk contoh, lihat tentukan set validasi.Ukuran set pelatihan =
ukuran total dataset − ukuran set validasi.
Saat set validasi diunggah manual: Sistem tidak lagi memisahkan set validasi dari data pelatihan.
Ukuran set pelatihan = Volume data set pelatihan yang diunggah.
Ukuran set validasi = Volume data set validasi yang diunggah.
T: Bagaimana merancang kata pemicu yang baik?
J: Ikuti aturan berikut:
Gunakan kombinasi huruf yang tidak bermakna, seperti sksstyle, a8z2_bbb.
Hindari kata bahasa Inggris umum (misalnya, beautiful, fire, dance). Ini mencegah mencemari pemahaman asli model tentang kata-kata tersebut.
T: Apakah fine-tuning dapat mengubah resolusi atau durasi video?
J: Tidak. Fine-tuning mempelajari "konten" dan "dinamika", bukan "spesifikasi". Format video output (resolusi, laju frame, durasi maksimum) masih ditentukan oleh model dasar.


