阿里巴巴推出数字人视频生成开源模型
阿里云 2025年8月27日
语音到视频模型,Wan2.2-S2V,让肖像活灵活现
中国杭州,2025年8月27日 — 阿里巴巴推出其最新的开源模型Wan2.2-S2V(语音到视频模型),该模型专为数字人视频创作而设计。 该创新工具可将肖像照片转换成电影质量的虚拟形象,可以说话、唱歌和表演。
作为阿里巴巴Wan2.2视频生成系列的一员,这个新模型可以根据一张图像和一段音频剪辑生成高质量的动画视频。
Wan2.2-S2V具备灵活实用的角色动画功能,提供多个取景选项用以创建视频,包括肖像、半身和全身视角。 它可以根据提示指令动态生成角色动作和环境要素,以便专业内容创作者捕获针对特定故事和设计要求量身定制的精确视觉表现。
该模型采用先进的音频驱动动画技术,可提供从自然对话到音乐表演的逼真角色表演,还可无缝处理场景中的多个角色。 创作者现在可以将语音转换为栩栩如生的动画动作,同时支持各种各样的虚拟形象,包括卡通、动物、风格化角色。
为了满足专业内容创作者的各种需求,该技术提供480P和720P的输出分辨率,供创作者灵活选择。 这能确保高质量的视觉输出,符合各种专业和创意标准,使其适用于社交媒体内容和专业演示。
提示词:“在视频中,一名男子正走在铁轨旁,边走边唱歌,表达自己的情绪。 一列火车从他身边慢慢驶过。”
创新技术
Wan2.2-S2V将文本引导的全局运动控制与音频驱动的精细化局部运动相结合,由此超越了传统的说话头动画。 因此在复杂和具有挑战性的场景中,也能实现自然而富有表现力的角色表演。
另一项关键突破在于该模型的帧处理技术。 该技术通过将任意长度的历史帧压缩成单个紧凑的潜在表征,显著降低了计算开销。 这种方法可以实现非常稳定的长视频生成,解决了长篇动画内容制作中的关键挑战。
模型的综合训练方法进一步强化了模型的高级能力。 阿里巴巴研究团队构建了专门针对影视制作场景的大规模视听数据集。 Wan2.2-S2V通过多分辨率训练方法,支持灵活生成多种格式的视频,从竖屏短视频内容到传统的横屏影视制作,都能应对。
Wan2.2-S2V模型可在Hugging Face、GitHub以及阿里云的开源社区ModelScope魔搭社区上下载。 阿里巴巴作为全球开源社区的主要贡献者,于2025年2月开源了Wan2.1模型,7月开源了Wan2.2模型。 迄今为止,Wan系列已在Hugging Face和ModelScope魔搭社区上产生了逾690万次下载。
关于阿里巴巴集团
阿里巴巴集团是一家全球化科技企业,聚焦于电子商务和云计算。 我们通过提供数字与物流基础设施、提效工具以及广阔的营销触达能力,助力商家、品牌和零售商进行营销、销售以及与消费者互动。 我们依托领先的云基础设施、服务以及协同办公能力为企业赋能,促进其数字化转型并实现业务增长。
