Alibaba Memperkenalkan Model Open-Source untuk Pembuatan Video Manusia Digital
Alibaba Cloud 27 Agustus 2025
Model Speech-to-Video, Wan2.2-S2V, menghidupkan potret
Hangzhou, Tiongkok, 27 Agustus 2025 – Alibaba telah meluncurkan Wan2.2-S2V (Speech-to-Video), model open-source terbarunya yang dirancang untuk pembuatan video manusia digital. Alat inovatif ini mengubah foto potret menjadi avatar berkualitas film yang mampu berbicara, bernyanyi, dan berakting.
Sebagai bagian dari seri pembuatan video Wan2.2 Alibaba, model baru ini dapat menghasilkan video animasi berkualitas tinggi dari satu gambar dan klip audio.
Wan2.2-S2V menawarkan kemampuan animasi karakter yang serbaguna, memungkinkan pembuatan video di berbagai opsi pembingkaian termasuk perspektif potret, dada, dan seluruh tubuh. Model ini dapat menghasilkan aksi karakter dan faktor lingkungan secara dinamis berdasarkan instruksi prompt, memungkinkan pembuat konten profesional untuk menangkap representasi visual yang tepat sesuai dengan kebutuhan penceritaan dan desain tertentu.
Didukung oleh teknologi animasi canggih yang digerakkan audio, model ini menghadirkan performa karakter yang hidup, mulai dari dialog natural hingga pertunjukan musik, dan menangani beberapa karakter dalam satu adegan dengan mulus. Kreator kini dapat mengubah rekaman suara menjadi gerakan animasi yang hidup, mendukung berbagai avatar, dari kartun dan hewan hingga karakter bergaya.
Untuk memenuhi beragam kebutuhan pembuat konten profesional, teknologi ini menyediakan resolusi output fleksibel 480P dan 720P. Hal ini memastikan output visual berkualitas tinggi yang memenuhi berbagai standar profesional dan kreatif, sehingga cocok untuk konten media sosial maupun presentasi profesional.
Prompt: "Dalam video tersebut, seorang pria berjalan di sepanjang rel kereta api, bernyanyi untuk mengekspresikan emosinya saat ia berjalan. Sebuah kereta api perlahan melewatinya."
Teknologi Inovatif
Wan2.2-S2V melampaui animasi talking-head tradisional dengan menggabungkan kontrol gerakan global yang dipandu teks dengan gerakan lokal halus yang digerakkan audio. Hal ini memungkinkan performa karakter yang natural dan ekspresif dalam skenario yang kompleks dan menantang.
Terobosan kunci lainnya terletak pada teknik pemrosesan frame yang inovatif dari model ini. Dengan mengompresi frame historis dengan panjang arbitrer menjadi satu representasi laten yang ringkas, teknologi ini secara signifikan mengurangi beban komputasi. Pendekatan ini memungkinkan pembuatan video panjang yang sangat stabil, mengatasi tantangan kritis dalam produksi konten animasi yang diperpanjang.
Kemampuan canggih model ini semakin ditingkatkan oleh metodologi pelatihan yang lengkap. Tim riset Alibaba menyusun dataset audio-visual berskala besar yang khusus disesuaikan untuk skenario produksi film dan televisi. Dengan menggunakan pendekatan pelatihan multi-resolusi, Wan2.2-S2V mendukung pembuatan video yang fleksibel di berbagai format—dari konten vertikal bentuk pendek hingga produksi film dan televisi horizontal tradisional.
Model Wan2.2-S2V tersedia untuk diunduh di Hugging Face dan GitHub, serta di komunitas open-source Alibaba Cloud, ModelScope. Sebagai kontributor utama bagi komunitas open-source global, Alibaba merilis model Wan2.1 secara open source pada Februari 2025 dan model Wan 2.2 pada Juli. Hingga saat ini, seri Wan telah menghasilkan lebih dari 6,9 juta unduhan di Hugging Face dan ModelScope.
Tentang Alibaba Group
Alibaba Group adalah perusahaan teknologi global yang berfokus pada e-commerce dan komputasi cloud. Kami membantu pedagang, merek, dan pengecer untuk memasarkan, menjual, dan berinteraksi dengan konsumen dengan menyediakan infrastruktur digital dan logistik, alat efisiensi, serta jangkauan pemasaran yang luas. Kami mendukung perusahaan dengan infrastruktur cloud terdepan, layanan, dan kemampuan kolaborasi kerja untuk memfasilitasi transformasi digital mereka dan mengembangkan bisnis mereka.
