阿里巴巴发布Wan2.2,提升电影级视频创作能力

阿里云 2025年7月29日

业界首款开源MoE大语言视频生成模型,为全球创作者和开发者提供卓越控制力



中国杭州,2025年7月29日——阿里巴巴发布了Wan2.2,这是业界首款引入MoE(混合专家)架构的开源大语言视频生成模型,将显著提升创作者和开发人员一键生成电影级视频的能力。

Wan2.2系列包括文生视频模型Wan2.2-T2V-A14B、图生视频模型Wan2.2-I2V-A14B,以及混合模型Wan2.2-TI2V-5B——该模型可在单个统一框架内同时支持文生视频与图生视频任务。

Wan2.2-T2V-A14B和Wan2.2-I2V-A14B基于MoE架构打造,并经过精心挑选的美学数据训练,可生成具有电影级品质与美感的视频,赋予创作者对光照、时间、色调、镜头角度、画幅、构图、焦距等关键维度的精确控制能力。这两款MoE模型在生成复杂动作(包括生动的面部表情、动态的手势和复杂的体育动作)方面也表现出显著增强。 此外,这些模型展现出更出色的指令遵循能力并遵循物理规律,从而提供更逼真的视觉呈现。

为了解决视频生成过程中因长Token导致的计算消耗高的问题,Wan2.2-T2V-A14B和Wan2.2-I2V-A14B在扩散模型的去噪过程中采用了双专家设计,包括专注于整体场景布局的高噪声专家和专注于精细化细节与纹理的低噪声专家。 尽管这两款模型的总参数量均为270亿个,但每步仅激活140亿个参数,从而节约了高达50%的计算消耗。

Wan2.2通过借鉴电影灵感的提示词系统整合了精细的美学调优,该系统对光照、照明、构图和色调等关键维度进行了分类。 这种方法使Wan2.2能够在生成过程中精准理解并传达用户的美学意图。

为了增强泛化能力和创作多样性,Wan2.2在大幅增加的数据集上进行了训练,与Wan2.1相比,图像数据增加了65.6%,视频数据增加了83.2%。 Wan2.2在生成复杂场景和动作方面展现出更强性能,并具备更出色的艺术表达力。

轻量高效且可扩展的紧凑型模型

Wan2.2还推出了混合模型Wan2.2-TI2V-5B,这是一款密集型模型,采用高压缩率3D VAE架构,实现了4x16x16的时空压缩比,将整体信息压缩率提升至64。 TI2V-5B可依靠单个消费级GPU,在数分钟内生成一段时长5秒的720P视频,为开发人员和内容创作者带来极高效率与可扩展性。

Wan2.2系列模型现已开放下载,可通过Hugging Face、GitHub以及阿里云的开源模搭社区获取。 作为全球开源社区的重要贡献者,阿里巴巴于2025年2月开源了四款Wan2.1模型,并于2025年5月开源了Wan2.1-VACE(全能视频创作与编辑模型)。 截至目前,这些模型在Hugging Face和模搭社区的下载量已超过540万次。

关于阿里云

阿里云(www.alibabacloud.com)成立于2009年,是阿里巴巴集团的数字技术与智能骨干业务。 阿里云为全球客户提供全套云服务,包括弹性计算、数据库、存储、网络虚拟化服务、大规模计算、安全、大数据分析、机器学习和人工智能(AI)服务。 根据Gartner的数据,以美元营收计,阿里巴巴自2018年以来 一直是亚太地区领先的IaaS提供商。 此外根据IDC的数据,阿里巴巴自2018年以来也一直保持着全球领先的公有云IaaS服务商之一的地位。

phone 联系我们
你好,我是AI助理。
可以解答问题、推荐解决方案等。