Alibaba, dijital insan video üretimi için açık kaynaklı model tanıttı

Alibaba Cloud 27 Ağustos 2025

Speech-to-Video modeli Wan2.2-S2V, portreleri canlandırıyor



Hangzhou, Çin, 27 Ağustos 2025 – Alibaba, dijital insan video oluşturma için tasarlanan en son açık kaynaklı modeli Wan2.2-S2V'yi (Speech-to-Video) tanıttı. Bu yenilikçi araç, portre fotoğraflarını konuşabilen, şarkı söyleyebilen ve performans sergileyebilen film kalitesinde avatarlara dönüştürüyor.

Alibaba'nın Wan2.2 video üretim serisinin bir parçası olan yeni model, tek bir görsel ve ses klibinden yüksek kaliteli animasyonlu videolar üretebiliyor.

Wan2.2-S2V, portre, büst ve tam vücut dahil olmak üzere çoklu çerçeveleme seçenekleriyle çok yönlü karakter animasyon yetenekleri sunuyor. Karakter eylemlerini ve çevresel faktörleri prompt talimatlarına göre dinamik olarak oluşturabiliyor ve profesyonel içerik üreticilerin belirli hikaye anlatımı ve tasarım gereksinimlerine yönelik hassas görsel temsiller yakalamalarını sağlıyor.

Gelişmiş ses destekli animasyon teknolojisiyle desteklenen model, doğal diyaloglardan müzik performanslarına kadar gerçekçi karakter performansları sunuyor ve bir sahnedeki birden fazla karakteri sorunsuz şekilde işleyebiliyor. İçerik üreticiler artık ses kayıtlarını gerçekçi animasyonlu hareketlere dönüştürebiliyor ve çizgi film karakterlerinden hayvanlara kadar çeşitli avatarları destekliyor.

Profesyonel içerik üreticilerin farklı ihtiyaçlarını karşılamak için teknoloji, 480P ve 720P esnek çıktı çözünürlükleri sunuyor. Bu, çeşitli profesyonel ve yaratıcı standartları karşılayan yüksek kaliteli görsel çıktısı sağlıyor ve hem sosyal medya içeriği hem de profesyonel sunumlar için uygun hale getiriyor.




Prompt : "Videoda bir adam demiryolu raylarının yanında yürüyor ve yürürken duygularını ifade etmek için şarkı söylüyor. Bir tren yavaşça yanından geçiyor."

Yenilikçi Teknolojiler

Wan2.2-S2V, metin tabanlı küresel hareket kontrolünü ses destekli hassas lokal hareketlerle birleştirerek geleneksel konuşan kafa animasyonlarının ötesine geçiyor. Bu sayede karmaşık ve zorlu senaryolarda doğal ve etkileyici karakter performansları sunuyor.

Modelin bir diğer önemli atılımı, yenilikçi kare işleme tekniğinde yatıyor. Herhangi bir uzunluktaki geçmiş kareleri tek ve kompakt bir örtük temsile sıkıştırarak bu teknoloji, hesaplama yükünü önemli ölçüde azaltıyor. Bu yaklaşım, uzun videolarda son derece istikrarlı üretim sağlayarak uzatılmış animasyonlu içerik üretimindeki kritik bir zorluğun üstesinden geliyor.

Modelin gelişmiş yetenekleri, kapsamlı eğitim metodolojisiyle daha da güçleniyor. Alibaba'nın araştırma ekibi, özellikle film ve televizyon yapımcılığı senaryolarına yönelik geniş ölçekli bir ses-görsel veri kümesi oluşturdu. Çoklu çözünürlük eğitim yaklaşımıyla Wan2.2-S2V, dikey kısa biçimli içerikten geleneksel yatay film ve televizyon yapımlarına kadar farklı formatlarda esnek video üretimi destekliyor.

Wan2.2-S2V modeli Hugging Face ve GitHub'ın yanı sıra Alibaba Cloud'un açık kaynak topluluğu ModelScope üzerinden indirilebilir. Küresel açık kaynak topluluğuna önemli katkıda bulunan Alibaba, Şubat 2025'te Wan2.1 modellerini ve Temmuz'da Wan 2.2 modellerini açık kaynak olarak yayınladı. Bugüne kadar Wan serisi, Hugging Face ve ModelScope üzerinde 6,9 milyondan fazla indirme sayısına ulaştı.

Alibaba Group Hakkında

Alibaba Group, e-ticaret ve bulut bilişim odaklı küresel bir teknoloji şirketidir. Dijital ve lojistik altyapı, verimlilik araçları ve geniş pazarlama erişimi sunarak satıcıların, markaların ve perakendecilerin pazarlama yapmalarını, satış gerçekleştirmelerini ve tüketicilerle etkileşim kurmalarını sağlıyoruz. Lider bulut altyapımız, hizmetlerimiz ve iş birliği yeteneklerimizle işletmelerin dijital dönüşümünü kolaylaştırıyor ve işlerini büyütüyoruz.

phone Bize Ulaşın
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.