阿里巴巴发布Wan2.6系列模型,人人皆可成为视频主角
阿里云 2025年12月16日
全新视觉生成模型助力全球创作者提升电影级、专业级视频制作水平
中国杭州,2025年12月16日 — 阿里巴巴今日发布了其视觉生成模型的最新进化版本——Wan2.6系列。 该系列使创作者能够以自身形象和声音出现在AI生成的视频中,并支持灵活的多场景叙事——这些新功能旨在为专业级内容制作解锁更多创作可能,同时增强多人物对话能力,延长视频时长,以实现更丰富的叙事表达。
Wan2.6系列包含一款全新的参考生视频生成模型,以及对现有四款模型的全面升级。 Wan2.6-R2V使用户能够上传包含外貌和声音的角色参考视频,通过文本提示词生成同一角色出镜的生动新场景。 用户可以创建包含人物、动物或物体,甚至多个主体共同出镜的视频,同时保留原始参考对象的独特外观和声音。
凭借多模态参考生成能力,Wan2.6-R2V是中国首款参考生视频生成模型,用户能够利用该模型将自身或其他主体插入AI生成场景中,并保持视觉和音频的一致性。 这改变了短剧创作者的叙事方式,并简化了制作流程。
Wan2.6系列还包括对文生视频模型(Wan2.6-T2V)、图生视频模型(Wan2.6-I2V)以及两款生图模型(Wan2.6-image和Wan2.6-T2I)的改进。
新模型引入了智能多场景叙事能力,使叙事更丰富、更具表现力,同时保持视觉一致性。 其在音画同步和音频生视频方面的能力改进能够呈现更逼真的场景和更丰富的音效。
该系列模型支持最长15秒的视频输出,为创作者提供了更大的故事发展空间。 结合经增强的指令遵循精度和经改进的视觉质量,该系列模型能让创作者制作出专业级效果的电影风格内容。
在图像生成方面,Wan2.6系列能让用户创建图文交错的输出,并且模型具备先进的逻辑推理能力,可进一步支持连贯的视觉叙事。 该系列模型还在精确的艺术风格把控方面表现出色,能够生成具有卓越保真度的逼真肖像,并支持图像处理。 创作者还能受益于其对中英文长文本提示词的深度理解,从而生成高质量、富有表现力的视觉内容,精准捕捉细节和艺术意图。
用户可通过阿里云AI开发平台百炼及通义万相官方网站访问和部署这些模型。 这些模型还将集成到阿里巴巴旗舰AI应用千问App中。
通义万相系列于今年早些时候首次亮相,并且经过持续升级,这体现了阿里巴巴在AI驱动型多媒体技术领域的领导力和创新能力。
关于阿里巴巴集团
阿里巴巴集团是一家全球化科技企业,聚焦于电子商务和云计算。 我们通过提供数字与物流基础设施、提效工具以及广阔的营销触达能力,助力商家、品牌和零售商进行营销、销售以及与消费者互动。 我们依托领先的云基础设施、服务以及协同办公能力为企业赋能,促进其数字化转型并实现业务增长。
通义千问(Qwen)是阿里巴巴自研打造的一系列大语言模型与多模态AI模型。 千问大模型于2023年首次亮相,其开放权重版本已通过HuggingFace和ModelScope魔搭社区面向全球开发者开放。
