All Products
Search
Document Center

:Pembuatan video

Last Updated:Sep 09, 2026

Alibaba Cloud Model Studio menyediakan model pembuatan video untuk pembuatan umum (text-to-video, image-to-video, reference-to-video, pengeditan video) dan skenario vertikal (sinkronisasi bibir manusia digital, image-to-action, penukaran karakter video, pembuatan emoji).

Video yang dihasilkan pada halaman Pengalaman Online di konsol Model Studio selalu dilengkapi watermark berupa teks "AI generated" di pojok kanan bawah. Karena persyaratan kepatuhan hukum, watermark ini tidak dapat dinonaktifkan melalui antarmuka konsol. Untuk mendapatkan video tanpa watermark, panggil model pembuatan video Wan melalui API DashScope dengan parameter watermark yang secara default bernilai false (tanpa watermark). Untuk informasi lebih lanjut, lihat Referensi API text-to-video Wan 2.7 dan Referensi API image-to-video Wan 2.7.

Ikhtisar model

Cakupan penerapan layanan

Bandingkan cakupan

Global

Sumber daya komputasi untuk inferensi model dijadwalkan secara global.

Internasional

Sumber daya komputasi untuk inferensi model dijadwalkan secara global, kecuali Tiongkok daratan.

AS

Sumber daya komputasi untuk inferensi model dibatasi hanya untuk AS.

Tiongkok daratan

Sumber daya komputasi untuk inferensi model dibatasi hanya untuk Tiongkok daratan.

Wilayah

Virginia

Singapura

Virginia

Beijing

Model yang didukung

Wan - text-to-video

Wan - image-to-video - frame pertama

Wan - reference-to-video

Wan - text-to-video

Wan - image-to-video

Wan - image-to-video - frame pertama

Wan - image-to-video - frame pertama dan terakhir

Wan - reference-to-video

Wan - pengeditan video umum

Wan - image-to-action

Wan - penukaran karakter video

Wan - text-to-video

Wan - image-to-video - frame pertama

Wan - text-to-video

Wan - image-to-video

Wan - image-to-video - frame pertama

Wan - image-to-video - frame pertama dan terakhir

Wan - reference-to-video

Wan - pengeditan video umum

Wan - manusia digital

Wan - image-to-action

Wan - penukaran karakter video

AnimateAnyone

EMO

LivePortrait

Emoji

VideoRetalk

Transformasi gaya video

Pemilihan model

  • Pembuatan video umum
  • Sinkronisasi bibir manusia digital: Menganimasikan foto statis agar berbicara, bernyanyi, atau bercerita — latar belakang tetap diam sementara wajah, kepala, dan tubuh bergerak.

    • Untuk hasil paling alami, termasuk ekspresi wajah, gerakan kepala, dan tubuh, gunakan Wan - manusia digital. Model ini menggantikan EMO.
    • Untuk video lebih dari 20 detik dengan gerakan kepala sederhana, seperti laporan berita, gunakan LivePortrait.
  • Transfer gerakan video: Fitur ini menjaga latar belakang foto tetap statis dan menganimasikan orang tersebut menggunakan gerakan dari video referensi. Gunakan Wan - image-to-action.

  • Penukaran karakter video: Fitur ini mengganti orang dalam video dengan orang dari gambar sambil mempertahankan latar belakang aslinya. Gunakan Wan - penukaran karakter video.

  • Penggantian tarian: Mengganti penari dalam video dengan orang dari gambar. Untuk kualitas terbaik, gunakan Wan - image-to-action dan Wan - penukaran karakter video. Jika anggaran terbatas, gunakan AnimateAnyone.

  • Penggantian gerakan bibir video: Fitur ini mengganti gerakan bibir dalam video yang ada agar sesuai dengan audio baru. Gunakan VideoRetalk.

  • Pembuatan emoji: Fitur ini membuat emoji menggunakan templat bergaya tetap. Gunakan Emoji.

  • Penggambaran ulang video: Untuk menggunakan templat bergaya tetap, gunakan Transformasi gaya video. Untuk menggambarkan gaya secara bebas menggunakan prompt, gunakan Wan - pengeditan video.

  • Pengeditan video: Untuk semua tugas berikut, gunakan Wan - pengeditan video umum.

    • Pengeditan video lokal: Ganti elemen seperti subjek atau pakaian, atau hapus orang yang tidak terlibat.
    • Ekstensi video: Perpanjang video pendek, misalnya dari 1 detik menjadi 5 detik.
    • Ekspansi bingkai video: Ubah video landscape menjadi mode portrait atau isi batas yang hilang.
    • Pembuatan referensi multi-gambar: Gabungkan gambar latar belakang dan subjek untuk membuat video.

Model yang didukung

Wan - text-to-video

Menghasilkan video dari prompt teks. Mendukung input teks dan audio untuk membuat video multi-shot sinematik.

Referensi API | Harga model | Coba online: Singapura, Virginia, Beijing

Global

Jika Anda memilih cakupan penerapan Global, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: AS (Virginia), Jerman (Frankfurt), Tiongkok (Hong Kong).

Model

Fitur

Modalitas input

Spesifikasi video output

wan2.6-t2v Direkomendasikan

Video dengan audio

Narasi multi-shot, sinkronisasi audio-video

Teks, audio

Opsi resolusi: 720P, 1080P

Durasi video: 5 s, 10 s, 15 s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

Internasional

Jika Anda memilih cakupan penerapan Internasional, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia, kecuali Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Singapura.

ModelFiturModalitas inputSpesifikasi video output

wan2.7-t2v-2026-04-25 Direkomendasikan

Video dengan audio

Narasi multi-shot, sinkronisasi audio-video

Teks, audio

Opsi resolusi: 720P, 1080P

Durasi video: [2 s, 15 s] (bilangan bulat)

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.7-t2v

Video dengan audio

Narasi multi-shot, sinkronisasi audio-video

Teks, audio

Opsi resolusi: 720P, 1080P

Durasi video: [2 s, 15 s] (bilangan bulat)

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.6-t2v

Video dengan audio

Narasi multi-shot, sinkronisasi audio-video

Teks, audio

Opsi resolusi: 720P, 1080P

Durasi video: [2 s, 15 s] (bilangan bulat)

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.5-t2v-preview

Video dengan audio

Sinkronisasi audio-video

Teks, audio

Opsi resolusi: 480P, 720P, 1080P

Durasi video: 5 s, 10 s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.2-t2v-plus

Video tanpa suara

Stabilitas dan tingkat keberhasilan lebih baik dibandingkan model 2.1.

Teks

Opsi resolusi: 480P, 1080P

Durasi video: 5 detik

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.1-t2v-turbo

Video tanpa suara

Teks

Opsi resolusi: 480P, 720P

Durasi video: 5 s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.1-t2v-plus

Video tanpa suara

Teks

Opsi resolusi: 720P

Durasi video: 5 detik

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

AS

Jika Anda memilih cakupan penerapan AS, sumber daya komputasi inferensi model dibatasi hanya untuk Amerika Serikat. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: AS (Virginia).

Model

Fitur

Modalitas input

Spesifikasi video output

wan2.6-t2v-us Direkomendasikan

Video dengan audio

Narasi multi-shot, sinkronisasi audio-video

Teks, audio

Opsi resolusi: 720P, 1080P

Durasi video: 5 s, 10 s, 15 s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

Tiongkok daratan

Jika Anda memilih cakupan penerapan Tiongkok daratan, sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Tiongkok (Beijing).

ModelFeaturesInput modalityOutput video specifications

wan2.7-t2v-2026-04-25 Recommended

Video with audio

Multi-shot narrative, audio-video synchronization

Text, audio

Pilihan resolusi: 720P, 1080P

Durasi video: [2s, 15s] (bilangan bulat)

Spesifikasi tetap: 30 fps, MP4 (H.264 encoding)

wan2.7-t2v

Video with audio

Multi-shot narrative, audio-video synchronization

Text, audio

Pilihan resolusi: 720P, 1080P

Durasi video: [2s, 15s] (bilangan bulat)

Spesifikasi tetap: 30 fps, MP4 (H.264 encoding)

wan2.6-t2v

Video with audio

Multi-shot narrative, audio-video synchronization

Text, audio

Pilihan resolusi: 720P, 1080P

Durasi video: [2s, 15s] (bilangan bulat)

Spesifikasi tetap: 30 fps, MP4 (H.264 encoding)

wan2.5-t2v-preview

Video with audio

Audio-video synchronization

Text, audio

Pilihan resolusi: 480P, 720P, 1080P

Durasi video: 5s, 10s

Spesifikasi tetap: 30 fps, MP4 (H.264 encoding)

wan2.2-t2v-plus

Silent video

Stabilitas dan tingkat keberhasilan lebih baik dibandingkan model 2.1.

Text

Pilihan resolusi: 480P, 1080P

Durasi video: 5s

Spesifikasi tetap: 30 fps, MP4 (H.264 encoding)

wanx2.1-t2v-turbo

Silent video

Text

Pilihan resolusi: 480P, 720P

Durasi video: 5s

Spesifikasi tetap: 30 fps, MP4 (H.264 encoding)

wanx2.1-t2v-plus

Silent video

Text

Pilihan resolusi: 720P

Durasi video: 5s

Spesifikasi tetap: 30 fps, MP4 (H.264 encoding)

Input promptVideo output (wan2.6, video multi-shot)

Direkam dari sudut rendah, dalam close-up medium, dengan nada hangat, pencahayaan campuran (cahaya praktis dari lampu meja menyatu dengan cahaya mendung dari jendela), pencahayaan samping, dan komposisi sentral. Di kantor detektif klasik, rak buku kayu dipenuhi berkas kasus lama dan asbak. Lampu meja hijau menerangi berkas kasus yang tersebar di tengah meja. Seekor rubah, mengenakan mantel trench coklat tua dan fedora abu-abu muda, duduk di kursi kulit, bulunya merah, ekornya bertumpu ringan di tepi, jarinya perlahan membalik halaman kuning. Di luar, hujan rintik-rintik turun di bawah langit biru, menggores kaca dengan alur berkelok-kelok. Perlahan ia mengangkat kepalanya, telinganya bergerak sedikit, matanya yang kuning menatap langsung ke kamera, mulutnya bergerak jelas saat berbicara dengan suara halus dan sinis: 'Kasus itu dingin, lebih dingin dari ikan di musim dingin. Tapi setiap ayam punya rahasia, dan aku, untuk satu hal, berniat menemukannya.'

Wan - image-to-video

Model image-to-video Wan ditingkatkan dengan input multimodal (teks/gambar/audio/video) dan mendukung tiga tugas: frame-pertama-ke-video, frame-pertama-dan-terakhir-ke-video, dan kelanjutan video.

Referensi API | Harga model | Panduan prompt

Internasional

Jika Anda memilih cakupan penerapan Internasional, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia, kecuali Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Singapura.

Model

Features

Input modality

Output video specifications

wan2.7-i2v-2026-04-25 Recommended

Video with audio

First-frame-to-video, first-and-last-frame-to-video, video continuation, video continuation with last frame control

Multi-shot narrative, audio-video synchronization

Text, image, audio, video

Pilihan resolusi: 720P, 1080P

Durasi video: [2s, 15s] (bilangan bulat)

Spesifikasi tetap: 30 fps, MP4 (H.264 encoding)

wan2.7-i2v

Video with audio

First-frame-to-video, first-and-last-frame-to-video, video continuation, video continuation with last frame control

Multi-shot narrative, audio-video synchronization

Text, image, audio, video

Pilihan resolusi: 720P, 1080P

Durasi video: [2s, 15s] (bilangan bulat)

Spesifikasi tetap: 30 fps, MP4 (H.264 encoding)

Tiongkok Daratan

Jika Anda memilih cakupan penerapan Tiongkok daratan, sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Tiongkok (Beijing).

Model

Fitur

Modalitas input

Spesifikasi video output

wan2.7-i2v-2026-04-25 Direkomendasikan

Video dengan audio

Frame-pertama-ke-video, frame-pertama-dan-terakhir-ke-video, kelanjutan video, kelanjutan video dengan kontrol frame terakhir

Narasi multi-shot, sinkronisasi audio-video

Teks, gambar, audio, video

Opsi resolusi: 720P, 1080P

Durasi video: [2 s, 15 s] (bilangan bulat)

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.7-i2v

Video dengan audio

Frame-pertama-ke-video, frame-pertama-dan-terakhir-ke-video, kelanjutan video, kelanjutan video dengan kontrol frame terakhir

Narasi multi-shot, sinkronisasi audio-video

Teks, gambar, audio, video

Opsi resolusi: 720P, 1080P

Durasi video: [2 s, 15 s] (integer)

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

Wan - image-to-video - frame pertama

Menghasilkan video dari gambar frame pertama yang ditentukan. Model ini menerima teks, gambar frame pertama, dan audio sebagai input untuk menghasilkan video multi-shot sinematik.

Referensi API | Harga model | Coba online: Singapura, Virginia, Beijing

Global

Jika Anda memilih cakupan penerapan Global, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: AS (Virginia), Jerman (Frankfurt), Tiongkok (Hong Kong).

Model

Fitur

Modalitas input

Spesifikasi video output

wan2.6-i2v Direkomendasikan

Video dengan audio

Narasi multi-shot, sinkronisasi audio-video

Teks, gambar, audio

Opsi resolusi: 720P, 1080P

Durasi video: 5 s, 10 s, 15 s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

Internasional

Jika Anda memilih cakupan penerapan Internasional, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia, kecuali Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Singapura.

ModelFeaturesInput modalityOutput video specifications

wan2.6-i2v-flash Recommended

Video with audio, silent video

Multi-shot narrative, audio-video synchronization

Text, image, audio

Pilihan resolusi: 720P, 1080P

Durasi video: [2s, 15s] (bilangan bulat)

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.6-i2v Recommended

Video with audio

Multi-shot narrative, audio-video synchronization

Text, image, audio

Pilihan resolusi: 720P, 1080P

Durasi video: [2s, 15s] (bilangan bulat)

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.5-i2v-preview

Video with audio

Audio-video synchronization

Text, image, audio

Pilihan resolusi: 480P, 720P, 1080P

Durasi video: 5s, 10s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.2-i2v-flash

Silent video

50% lebih cepat dibandingkan model 2.1.

Text, image

Pilihan resolusi: 480P, 720P, 1080P

Durasi video: 5s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.2-i2v-plus

Silent video

Stabilitas dan tingkat keberhasilan lebih baik dibandingkan model 2.1.

Text, image

Pilihan resolusi: 480P, 1080P

Durasi video: 5s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.1-i2v-plus

Silent video

Text, image

Pilihan resolusi: 720P

Durasi video: 5s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.1-i2v-turbo

Silent video

Text, image

Pilihan resolusi: 480P, 720P

Durasi video: 3s, 4s, 5s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

AS

Jika Anda memilih cakupan penerapan AS, sumber daya komputasi inferensi model dibatasi hanya untuk Amerika Serikat. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: AS (Virginia).

Model

Fitur

Modalitas input

Spesifikasi video output

wan2.6-i2v-us Recommended

Video dengan audio

Narasi multi-shot, sinkronisasi audio-video

Teks, gambar, audio

Opsi resolusi: 720P, 1080P

Durasi video: 5 detik, 10 detik, 15 detik

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

Tiongkok Daratan

Jika Anda memilih cakupan penerapan Tiongkok daratan, sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Tiongkok (Beijing).

ModelFeaturesInput modalityOutput video specifications

wan2.6-i2v-flash Recommended

Video with audio, silent video

Multi-shot narrative, audio-video synchronization

Text, image, audio

Pilihan resolusi: 720P, 1080P

Durasi video: [2s, 15s] (bilangan bulat)

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.6-i2v Recommended

Video with audio

Multi-shot narrative, audio-video synchronization

Text, image, audio

Pilihan resolusi: 720P, 1080P

Durasi video: [2s, 15s] (bilangan bulat)

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.5-i2v-preview

Video with audio

Audio-video synchronization

Text, image, audio

Pilihan resolusi: 480P, 720P, 1080P

Durasi video: 5s, 10s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.2-i2v-flash

Silent video

50% lebih cepat dibandingkan model 2.1.

Text, image

Pilihan resolusi: 480P, 720P, 1080P

Durasi video: 5s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.2-i2v-plus

Silent video

Stabilitas dan tingkat keberhasilan lebih baik dibandingkan model 2.1.

Text, image

Pilihan resolusi: 480P, 1080P

Durasi video: 5s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wanx2.1-i2v-plus

Silent video

Text, image

Pilihan resolusi: 720P

Durasi video: 5s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wanx2.1-i2v-turbo

Silent video

Text, image

Pilihan resolusi: 480P, 720P

Durasi video: 3s, 4s, 5s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

Prompt inputGambar frame pertama input dan audioVideo hasil (WAN2.6, video multi-bidikan)

Sebuah adegan seni fantasi urban. Karakter seni grafiti yang dinamis. Seorang remaja yang terbuat dari cat semprot hidup dari dinding beton. Ia melakukan rap bahasa Inggris dengan kecepatan tinggi sambil mengambil pose rapper klasik yang energetik. Adegan ini berlatar di bawah jembatan kereta api perkotaan pada malam hari. Pencahayaan berasal dari satu lampu jalan, menciptakan suasana sinematik dengan energi tinggi dan detail luar biasa. Audio video sepenuhnya terdiri dari rap-nya, tanpa dialog atau kebisingan lainnya.

rap-转换自-png

Audio input:

Wan - image-to-video - frame pertama dan terakhir

Menghasilkan video yang secara mulus bertransisi antara gambar frame pertama dan frame terakhir yang ditentukan. Model ini menerima teks, gambar frame pertama dan terakhir, serta audio sebagai input untuk menghasilkan video multi-shot sinematik.

Referensi API | Harga model | Coba online

Internasional

Jika Anda memilih cakupan penerapan Internasional, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia, kecuali Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Singapura.

ModelFiturModalitas inputSpesifikasi video output

wan2.2-kf2v-flash Direkomendasikan

Video tanpa suara

Stabilitas dan tingkat keberhasilan lebih baik dibandingkan model 2.1.

Teks, gambar

Opsi resolusi: 480P, 720P, 1080P

Durasi video: 5 detik

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.1-kf2v-plus

Video tanpa suara

Teks, gambar

Opsi resolusi: 720P

Durasi video: 5 detik

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

Tiongkok Daratan

Jika Anda memilih cakupan penerapan Tiongkok daratan, sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Tiongkok (Beijing).

ModelFiturModalitas inputSpesifikasi Video Keluaran

wan2.2-kf2v-flash Direkomendasikan

Video tanpa suara

Stabilitas dan tingkat keberhasilan lebih baik dibandingkan model 2.1.

Teks, gambar

Opsi resolusi: 480P, 720P, 1080P

Durasi video: 5 detik

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wanx2.1-kf2v-plus

Video tanpa suara

Teks, gambar

Opsi resolusi: 720P

Durasi video: 5 detik

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

Gambar frame pertama inputInput gambar bingkai terakhirInput promptVideo output
first_framelast_frame

Gaya realistis. Seekor kucing hitam kecil menatap langit dengan rasa ingin tahu. Kamera mulai dari ketinggian mata, secara bertahap naik, dan berakhir dengan bidikan dari atas ke bawah terhadap tatapan ingin tahu kucing tersebut.

Wan - reference-to-video

Memainkan aksi karakter dari video yang ditentukan. Input video dan prompt teks untuk menghasilkan video output yang mempertahankan konsistensi karakter.

Referensi API | Harga model

Global

Jika Anda memilih cakupan penerapan Global, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: AS (Virginia), Jerman (Frankfurt), Tiongkok (Hong Kong).

Model

Fitur

Modalitas input

Spesifikasi video output

wan2.6-r2v Direkomendasikan

Video dengan audio

Generasi video peran tunggal/multi-peran

Narasi multi-shot, sinkronisasi audio-video

Teks, video

Opsi resolusi: 720P, 1080P

Durasi video: 5 s, 10 s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

Internasional

Jika Anda memilih cakupan penerapan Internasional, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia, kecuali Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Singapura.

ModelFiturModalitas inputSpesifikasi video output

wan2.7-r2v Direkomendasikan

Video dengan audio

Reference-to-video multi-entitas; mendukung konfigurasi timbre suara untuk setiap entitas.

Teks, gambar, video, audio

Opsi resolusi: 720P, 1080P

Durasi video: [2 s, 10 s] (integer)

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.6-r2v-flash

Video dengan audio, video tanpa suara

Generasi video peran tunggal/multi-peran

Narasi multi-shot, sinkronisasi audio-video

Generasi lebih cepat, hemat biaya.

Teks, gambar, video

Opsi resolusi: 720P, 1080P

Durasi video: [2 s, 10 s] (bilangan bulat)

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.6-r2v

Video dengan audio

Generasi video peran tunggal/multi-peran

Narasi multi-shot, sinkronisasi audio-video

Teks, gambar, video

Opsi resolusi: 720P, 1080P

Durasi video: [2 s, 10 s] (integer)

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

Tiongkok daratan

Jika Anda memilih cakupan penerapan Tiongkok daratan, sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Tiongkok (Beijing).

ModelFiturModalitas inputSpesifikasi Video Keluaran

wan2.7-r2v Direkomendasikan

Video dengan audio

Reference-to-video multi-entitas memungkinkan Anda mengonfigurasi timbre suara untuk setiap entitas.

Teks, gambar, video, audio

Opsi resolusi: 720P, 1080P

Durasi video: [2 s, 10 s] (bilangan bulat)

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.6-r2v-flash

Video dengan audio, video tanpa suara

Generasi video peran tunggal/multi-peran

Narasi multi-shot, sinkronisasi audio-video

Generasi lebih cepat, hemat biaya.

Teks, gambar, video

Opsi resolusi: 720P, 1080P

Durasi video: [2 s, 10 s] (integer)

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.6-r2v

Video dengan audio

Generasi video peran tunggal/multi-peran

Narasi multi-shot, sinkronisasi audio-video

Teks, gambar, video

Opsi resolusi: 720P, 1080P

Durasi video: [2–10 detik] (integer)

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

Video referensi input 1 (peran: gadis kecil)Video referensi input 2 (peran: jam alarm)Prompt inputVideo keluaran (dialog multi-peran)

character1 berkata kepada character2: “Aku akan mengandalkanmu besok pagi!” character2 menjawab: “Kamu bisa mengandalkanku!”

Wan - pengeditan video

Model pengeditan video. Menerima input multimodal teks, gambar, dan video untuk melakukan berbagai tugas pembuatan dan pengeditan video.

Referensi API pengeditan video 2.7 | Referensi API pengeditan video 2.1 | Harga model

Internasional

Jika Anda memilih cakupan penerapan Internasional, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia, kecuali Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Singapura.

Model

Fitur

Modalitas input

Spesifikasi video output

wan2.7-videoedit Direkomendasikan

Video dengan audio, video tanpa suara (tergantung video input)

Pengeditan berbasis instruksi, migrasi video

Teks, gambar, video

Opsi resolusi: 720P, 1080P

Durasi video: [2 s, 10 s] (integer)

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wan2.1-vace-plus

Video tanpa suara

Referensi multi-gambar, penggambaran ulang video, pengeditan lokal, ekstensi video, ekspansi bingkai video

Teks, gambar, video

Opsi resolusi: 720P

Durasi video: Hingga 5 detik

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

Tiongkok Daratan

Jika Anda memilih cakupan penerapan Tiongkok daratan, sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Tiongkok (Beijing).

Model

Fitur

Modalitas input

Spesifikasi video output

wan2.7-videoedit Recommended

Video dengan audio, video tanpa suara (tergantung pada video input)

Pengeditan berbasis instruksi, migrasi video

Teks, gambar, video

Opsi resolusi: 720P, 1080P

Durasi video: [2s, 10s] (bilangan bulat)

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

wanx2.1-vace-plus

Video tanpa suara

Referensi multi-gambar, penggambaran ulang video, pengeditan lokal, perpanjangan video, perpanjangan bingkai video

Teks, gambar, video

Opsi resolusi: 720P

Durasi video: Maksimal 5s

Spesifikasi tetap: 30 fps, MP4 (encoding H.264)

Pengeditan video 2.1

  • Fitur 1: Referensi multi-gambar
    Gambar referensi input 1 (entitas referensi)Gambar referensi input 2 (latar belakang referensi)Input promptVideo output
    imageimage

    Video menunjukkan seorang gadis berjalan anggun keluar dari kedalaman hutan berkabut kuno. Langkahnya ringan, dan kamera menangkap setiap momen lincahnya. Saat ia berhenti dan melihat sekeliling hutan yang rimbun, senyum kejutan dan sukacita mekar di wajahnya. Momen ini, membeku dalam interaksi cahaya dan bayangan, merekam pertemuannya yang indah dengan alam.

  • Fitur 2: Penggambaran ulang video
    Video inputMasukkan promptVideo output

    Video menunjukkan sebuah mobil hitam bergaya steampunk, dikendarai seorang pria, dihiasi roda gigi dan pipa tembaga. Latar belakangnya adalah pabrik permen berbasis uap dengan elemen retro, menciptakan adegan vintage dan menyenangkan.

  • Fitur 3: Pengeditan video lokal
    Video inputGambar mask input (area putih menunjukkan area pengeditan)Input promptVideo output
    mask

    Video menunjukkan kafe Prancis bergaya Paris di mana seekor singa berjas dengan elegan menyesap kopi. Ia memegang cangkir kopi di satu tangan, menyesap dengan lembut dengan ekspresi puas. Kafenya didekorasi dengan selera tinggi, dengan warna lembut dan pencahayaan hangat menerangi area tempat singa tersebut berada.

  • Fitur 4: Ekstensi video
    Input first video segment (1s)Input promptOutput video (extended video is 5s)

    Seekor dog wearing sunglasses skateboards on a street, 3D cartoon.

  • Fitur 5: Ekspansi bingkai video
    Video inputPrompt inputVideo output

    Seorang wanita elegan bermain biola dengan penuh semangat, dengan orkestra simfoni lengkap di belakangnya.

Wan - manusia digital

NoteHanya cakupan penerapan layanan Tiongkok daratan yang didukung. Penyimpanan data berada di wilayah akses Beijing. Sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan.

Sinkronisasi bibir manusia digital menganimasikan seseorang atau karakter kartun dalam gambar agar berbicara, bernyanyi, bercerita, atau tampil. Anda memberikan gambar dan file audio, dan model secara otomatis menghasilkan video dengan gerakan bibir, ekspresi wajah, serta gerakan kepala dan tubuh yang tersinkronisasi.

Referensi API deteksi gambar | Referensi API generasi video | Harga model

Model

Features

Input modality

Output description

wan2.2-s2v-detect

Image detection

Image

Status deteksi output: Pass atau Fail

wan2.2-s2v

Video generation

Video with audio

Image, audio

Opsi resolusi: 480P, 720P

Durasi video: Hingga 20 detik (mengikuti durasi audio)

Spesifikasi yang ditentukan:

  • 480P: 16 fps, MP4 (H.264 encoding)

  • 720P: 30 fps, MP4 (H.264 encoding)

Contoh input (gambar karakter + audio)Video output (sinkronisasi bibir)
mix_input_image

Audio input:

Wan - image to action

Menganimasikan seseorang dari gambar menggunakan gerakan dari video referensi. Anda memberikan gambar dan video, dan model menghasilkan video yang menerapkan gerakan dari video referensi ke orang tersebut, sementara latar belakang gambar asli tetap statis.

Referensi API | Harga model

Internasional

Jika Anda memilih cakupan penerapan Internasional, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia, kecuali Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Singapura.

Model

Fitur

Modalitas input

Spesifikasi video output

wan2.2-animate-move

Video dengan audio, video tanpa suara (tergantung pada video input)

  • Mode Standard wan-std: Generasi cepat, hemat biaya.

  • Mode Professional wan-pro: Hasil lebih realistis.

Image, video

Opsi resolusi: 720P

Durasi video: 2s < duration < 30s

Spesifikasi yang ditetapkan:

  • Mode Standard wan-std: 15 fps, MP4 (H.264 encoding)

  • Mode Professional wan-pro: 25 fps, MP4 (H.264 encoding)

Tiongkok daratan

Jika Anda memilih cakupan penerapan Tiongkok daratan, sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Tiongkok (Beijing).

Model

Fitur

Modalitas input

Spesifikasi video output

wan2.2-animate-move

Video dengan audio, video tanpa suara (tergantung video input)

  • Mode standar wan-std: Generasi cepat, hemat biaya.

  • Mode profesional wan-pro: Hasil lebih realistis.

Gambar, video

Opsi resolusi: 720P

Durasi video: 2 s < Durasi < 30 s

Spesifikasi yang telah ditentukan:

  • Mode standar wan-std: 15 fps, MP4 (encoding H.264)

  • Mode profesional wan-pro: 25 fps, MP4 (encoding H.264)

Gambar karakter inputVideo referensi input

Video output (mode standarwan-std)

Video output (mode profesionalwan-pro)

move_input_image

Wan - penukaran karakter video

Mengganti karakter dalam video dengan karakter dari gambar referensi. Anda memberikan video sumber dan gambar referensi, dan model menghasilkan video output yang mempertahankan latar belakang asli. Fitur ini ideal untuk kasus penggunaan seperti penukaran wajah dan penggantian karakter penuh.

Referensi API | Harga model

Internasional

Jika Anda memilih cakupan penerapan Internasional, sumber daya komputasi inferensi model dijadwalkan secara dinamis di seluruh dunia, kecuali Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Singapura.

Model

Fitur

Modalitas input

Spesifikasi video output

wan2.2-animate-mix

Video dengan audio, video tanpa suara (tergantung video input)

  • Mode standar wan-std: Generasi cepat, hemat biaya.

  • Mode profesional wan-pro: Hasil lebih realistis.

Gambar, video

Opsi resolusi: 720P

Durasi video: 2 s < Durasi < 30 s

Spesifikasi yang ditentukan:

  • Mode standar wan-std: 15 fps, MP4 (encoding H.264)

  • Mode profesional wan-pro: 25 fps, MP4 (encoding H.264)

Tiongkok daratan

Jika Anda memilih cakupan penerapan Tiongkok daratan, sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan. Data statis disimpan di wilayah yang Anda pilih. Wilayah yang didukung: Tiongkok (Beijing).

Model

Fitur

Modalitas input

Spesifikasi video output

wan2.2-animate-mix

Video dengan audio, video tanpa suara (tergantung video input)

  • Mode standar wan-std: Generasi cepat, hemat biaya.

  • Mode profesional wan-pro: Hasil lebih realistis.

Gambar, video

Opsi resolusi: 720P

Durasi video: 2 detik < Durasi < 30 detik

Spesifikasi tetap:

  • Mode standar wan-std: 15 fps, MP4 (encoding H.264)

  • Mode profesional wan-pro: 25 fps, MP4 (encoding H.264)

Video inputGambar karakter input untuk penggantian

Video output (mode standarwan-std)

Video output (mode profesionalwan-pro)

mix_input_image

AnimateAnyone

Note

  • Hanya cakupan penerapan layanan Tiongkok daratan yang didukung. Penyimpanan data berada di wilayah akses Beijing. Sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan.
  • Kami merekomendasikan menggunakan Wan - image-to-action dan Wan - penukaran karakter video sebagai ganti AnimateAnyone. Model-model ini menawarkan kualitas lebih baik, sedangkan AnimateAnyone adalah opsi yang lebih hemat biaya.

Dirancang khusus untuk menari, model ini mengganti penari dalam video dengan seseorang dari gambar. Anda memberikan gambar dan video untuk menghasilkan video output dengan dua cara: 1. Mempertahankan latar belakang gambar. 2. Mempertahankan latar belakang video.

Referensi API deteksi gambar | Referensi API generasi templat aksi | Referensi API generasi video | Harga model

ModelFiturModalitas inputDeskripsi output

animate-anyone-detect-gen2

Deteksi gambar

Gambar

Status deteksi output: Lulus atau Gagal

animate-anyone-template-gen2

Generasi templat video tari

Menyaring templat aksi dari video tari.

Video

Menghasilkan ID templat aksi tari.

animate-anyone-gen2

Generasi video

Video tanpa suara

Gambar, video, ID templat aksi tari

Opsi resolusi video: 720P

Durasi video: 2 s ≤ durasi ≤ 60 s

Spesifikasi tetap: 15 fps, MP4 (encoding H.264)

Gambar karakter inputMasukkan Video TarianVideo output (dihasilkan dengan latar belakang gambar)Video output (dihasilkan dengan latar belakang video)
05-9_16

EMO

Note

  • Hanya cakupan penerapan layanan Tiongkok daratan yang didukung. Penyimpanan data berada di wilayah akses Beijing. Sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan.
  • Pertimbangkan untuk menggunakan Wan - manusia digital sebagai alternatif untuk EMO. Wan - manusia digital memberikan hasil yang lebih baik, sedangkan EMO adalah opsi yang lebih hemat biaya.

Menghasilkan video bernyanyi dan pertunjukan dari gambar. Anda memberikan gambar dan file audio, dan model secara otomatis menghasilkan video dengan gerakan bibir, ekspresi wajah, dan gerakan kepala yang tersinkronisasi.

Referensi API deteksi gambar | Referensi API generasi video | Harga model

Model

Fitur

Modalitas input

Deskripsi output

emo-detect-v1

Deteksi gambar

Gambar

Status deteksi output: Lulus atau Gagal

emo-v1

Generasi video

Video dengan audio

Gambar, audio

Resolusi video:

  • Rasio aspek 1:1: Tetap pada 512 × 512

  • Rasio aspek 3:4: Tetap pada 512 × 704

Durasi video: hingga 60 detik

Spesifikasi tetap: 15 fps, MP4 (encoding H.264)

Contoh input (gambar potret + audio)Video Output (Lip-Sync Bernyanyi)
15_原图

Audio input:

LivePortrait

Note

  • Hanya cakupan penerapan layanan Tiongkok daratan yang didukung. Penyimpanan data berada di wilayah akses Beijing. Sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan.
  • Pertimbangkan untuk menggunakan Wan - manusia digital sebagai alternatif untuk LivePortrait. Wan - manusia digital memberikan hasil kualitas lebih tinggi, sedangkan LivePortrait adalah opsi yang lebih hemat biaya. Perhatikan bahwa LivePortrait cocok untuk menghasilkan video panjang (lebih dari 20 detik).

Menghasilkan video narasi dari gambar dengan menganimasikan orang dalam gambar untuk menyampaikan berita atau bercerita. Anda memberikan Gambar dan file Audio, dan model secara otomatis menghasilkan video dengan gerakan bibir, ekspresi wajah, dan gerakan kepala ringan yang tersinkronisasi.

Referensi API deteksi gambarReferensi API generasi video | Harga model

Model

Features

Input modality

Output description

liveportrait-detect

Image detection

Image

Status deteksi output: Pass atau Fail

liveportrait

Video generation

Video with audio

Image, audio

Resolusi video: Mengikuti gambar input, hingga hampir 4K (4096 × 4096).

Durasi video: 1s < durasi < 180s

Laju frame video: 15 fps laju frame 30 fps

Format video: MP4 (H.264 encoding)

Contoh input (gambar potret + audio)Video output (pengisi suara sinkronisasi bibir)
Emoji男孩

Audio input:

Emoji

NoteHanya cakupan penerapan layanan Tiongkok daratan yang didukung. Penyimpanan data berada di wilayah akses Beijing. Sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan.

Membuat emoji menggunakan templat emoji tetap. Anda memberikan gambar dan ID templat emoji untuk menghasilkan video emoji.

Referensi API deteksi gambarReferensi API generasi videoHarga model

Model

Fitur

Modalitas input

Deskripsi output

emoji-detect-v1

Deteksi gambar

Gambar

Status deteksi output: Lulus atau Gagal

emoji-v1

Generasi video

Video tanpa suara

Gambar, ID templat emoji

Resolusi video: Tetap pada 512 × 512

Durasi video: Hingga 5 detik (mengikuti durasi templat)

Spesifikasi tetap: 15 fps, MP4 (encoding H.264)

Masukkan gambar potretVideo output (emoji "jijik")
image.png

VideoRetalk

NoteHanya cakupan penerapan layanan Tiongkok daratan yang didukung. Penyimpanan data berada di wilayah akses Beijing. Sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan.

Sinkronisasi bibir: Mengganti gerakan bibir dalam video agar sesuai dengan trek audio baru. Anda memberikan video dan file audio, dan model menghasilkan video output dengan gerakan bibir yang tersinkronisasi.

Referensi APIHarga model

Model

Fitur

Modalitas input

Spesifikasi video output

videoretalk

Video dengan audio

Video, audio

Resolusi video: Mengikuti video input, hingga hampir 2K (2048 × 2048).

Durasi video: 2 s < Durasi < 120 s

Laju frame video: 15 fps ≤ laju frame ≤ 60 fps

Format video: MP4 (encoding H.264)

Contoh input (video siaran karakter + audio)Video output (penggantian sinkronisasi bibir)

Audio input:

Transformasi gaya video

NoteHanya cakupan penerapan layanan Tiongkok daratan yang didukung. Penyimpanan data berada di wilayah akses Beijing. Sumber daya komputasi inferensi model dibatasi hanya untuk Tiongkok daratan.

Memberikan gaya artistik baru pada video berdasarkan templat gaya yang telah ditentukan. Anda memberikan video dan ID transfer gaya untuk menghasilkan video bergaya ulang.

Referensi APIHarga model

ModelFiturModalitas inputSpesifikasi video output

video-style-transform

Video dengan audio, video tanpa suara

Tergantung pada video input.

ID gaya penggambaran ulang video

Resolusi video: Mengikuti video input, hingga hampir 4K (4096 × 4096).

Durasi video: Hingga 30 detik

Laju frame video: 15 fps ≤ laju frame ≤ 25 fps

Format video: MP4 (encoding H.264)

Video inputVideo output (transfer gaya: "manga Jepang")