阿里巴巴發布Wan2.2,提升電影級視頻創作能力

阿里雲 2025年7月29日

業界首款開源MoE大語言視頻產生模型,為全球創作者和開發人員提供卓越控制力



中國杭州,2025年7月29日——阿里巴巴發布了Wan2.2,這是業界首款引入MoE(混合專家)架構的開源大語言視頻產生模型,將顯著提升創作者和開發人員一鍵產生電影級視頻的能力。

Wan2.2系列包括文生視頻模型Wan2.2-T2V-A14B、圖生視頻模型Wan2.2-I2V-A14B,以及混合模型Wan2.2-TI2V-5B——該模型可在單個統一架構內同時支援文生視頻與圖生視頻任務。

Wan2.2-T2V-A14B和Wan2.2-I2V-A14B基於MoE架構打造,並經過精心挑選的美學資料訓練,可產生具有電影級品質與美感的視頻,賦予創作者對光照、時間、色調、鏡頭角度、畫幅、構圖、焦距等關鍵維度精確控制能力。這兩款MoE模型在產生複雜動作(包括生動的面部表情、動態手勢和複雜的體育動作)方面也表現出顯著增強。 此外,這些模型展現出更出色的指令遵循能力並遵循物理規律,從而提供更逼真的視覺呈現。

為瞭解決視頻產生過程中因長Token導致的計算消耗高的問題,Wan2.2-T2V-A14B和Wan2.2-I2V-A14B在擴散模型的去噪過程中採用了雙專家設計,包括專註於整體情境布局的高雜訊專家和專註於精細化細節與紋理的低雜訊專家。 儘管這兩款模型的總參數量均為270億個,但每步僅啟用140億個參數,從而節約了高達50%的計算消耗。

Wan2.2通過借鑒電影靈感的提示詞系統整合了精細的美學調優,該系統對光照、照明、構圖和色調等關鍵維度進行了分類。 這種方法使Wan2.2能夠在產生過程中精準理解並傳達使用者的美學意圖。

為了增強泛化能力和創作多樣性,Wan2.2在大幅增加的資料集上進行了訓練,與Wan2.1相比,映像資料增加了65.6%,視頻資料增加了83.2%。 Wan2.2在產生複雜情境和動作方面展現出更強效能,並具備更出色的藝術表達力。

輕量高效且可擴充的緊湊型模型

Wan2.2還推出了混合模型Wan2.2-TI2V-5B,這是一款密集型模型,採用高壓縮率3D VAE架構,實現了4x16x16的時空壓縮比,將整體資訊壓縮率提升至64。 TI2V-5B可依靠單個消費級GPU,在數分鐘內產生一段時間長度5秒的720P視頻,為開發人員和內容創作者帶來極高效率與可擴充性。

Wan2.2系列模型現已開放下載,可通過Hugging Face、GitHub以及阿里雲的開源模搭社區擷取。 作為全球開源社區的重要貢獻者,阿里巴巴於2025年2月開源了四款Wan2.1模型,並於2025年5月開源了Wan2.1-VACE(全能視頻創作與編輯模型)。 截至目前,這些模型在Hugging Face和模搭社區的下載量已超過540萬次。

關於阿里雲

阿里雲(www.alibabacloud.com)成立於2009年,是阿里巴巴集團的數字技術與智能骨幹業務。 阿里雲為全球客戶提供全套雲端服務,包括彈性計算、資料庫、儲存、網路虛擬化服務、大規模計算、安全、巨量資料分析、機器學習和人工智慧(AI)服務。 根據Gartner的資料,以美元營收計,阿里巴巴自2018年以來 一直是亞太地區領先的IaaS供應商。 此外根據IDC的資料,阿里巴巴自2018年以來也一直保持著全球領先的公用雲端IaaS服務商之一的地位。

phone 聯絡我們
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.