Alibaba がビデオ制作・編集用オープンソースモデルを発表
Alibaba Cloud 2025 年 5 月 15 日
動画制作業界を変革するオールインワン AI モデル、Wan2.1-VACE
杭州(中国)、2025 年 5 月 15 日 ― Alibaba は、動画制作・編集のための最新オープンソースモデル Wan 2.1-VACE (Video All-in-one Creation and Editing) を発表しました。この革新的なツールは、複数のビデオ処理機能を 1 つのモデルに統合し、動画制作プロセスを効率化して生産性を向上させます。
Alibaba のビデオ生成大規模モデル Wan2.1 シリーズの一環である VACE は、さまざまなビデオ生成・編集タスクに対応する業界初のオープンソース統合ソリューションです。
Wan2.1-VACE は、テキスト、画像、動画にまたがるマルチモーダル入力によるビデオ生成に対応し、クリエイターに包括的なビデオ編集機能を提供します。これらの編集機能には、画像やフレームの参照、ビデオリペイント、動画の選択領域の修正、時空間拡張が含まれ、柔軟なタスクの組み合わせにより創造性を高めます。
この高度なツールにより、ユーザーは画像サンプルに基づいて特定の被写体が対話する動画を生成したり、静止画に自然な動きを加えて生き生きとさせることができます。また、ポーズ転写、モーションコントロール、深度制御、再カラー化といった高度なビデオリペイント機能も利用できます。
さらに、動画の特定領域に対する追加、修正、削除を周囲に影響を与えずに行えます。動画の境界を拡張しながら、コンテンツを知的に補填して視覚体験を豊かにすることも可能です。
オールインワン AI モデルとして、Wan2.1-VACE は比類なき汎用性を実現し、ユーザーは複数の機能をシームレスに組み合わせて革新的な可能性を引き出せます。静止画を動画に変換しながら、動作軌跡を指定してオブジェクトの動きを制御したり、指定した参照で人物やオブジェクトをシームレスに置換し、参照したキャラクターをアニメーション化してポーズを制御できます。さらに、縦画像を横方向に拡張し、参照を通じて新しい要素を追加しながら横動画を作成することも可能です。
革新的なテクノロジー

Wan2.1-VACE は複数の革新的技術を活用し、構築・設計時にさまざまなビデオ編集タスクのニーズを考慮しています。Video Condition Unit (VCU) と呼ばれる統一インターフェイスは、テキスト、画像、動画、マスクなどのマルチモーダル入力の一元的な処理に対応します。
モデルは Context Adapter 構造を採用し、時間次元と空間次元の形式化された表現を通じてさまざまなタスク概念を注入します。この革新的な設計により、幅広い動画合成タスクを柔軟に管理できます。
モデルアーキテクチャの進歩により、Wan2.1-VACE はソーシャルメディア向けショート動画の迅速な制作、広告マーケティング用のコンテンツ制作、映画・テレビのポストプロダクションと特殊効果処理、教育トレーニング用動画の生成など、幅広い分野で応用できます。
動画ファウンデーションモデルのトレーニングには膨大な計算リソースと大量の高品質トレーニングデータが必要です。オープンアクセスにより参入障壁が下がり、より多くの企業が AI を活用して、それぞれのニーズに合わせた高品質なビジュアルコンテンツを迅速かつコスト効率よく作成できます。
Alibaba は Wan2.1-VACE モデルを 140 億パラメーター版と 13 億パラメーター版の 2 種類でオープンソース化しています。モデルは Hugging Face と GitHub、および Alibaba Cloud のオープンソースコミュニティ ModelScope で無償ダウンロードできます。
自社開発の大規模 AI モデルをオープンソース化した世界でも先駆的な大手テック企業の一つである Alibaba は、2025 年 2 月に 4 つの Wan2.1 モデルを公開し、先月には開始フレームと終了フレームを指定した動画制作に対応するビデオ生成モデルをリリースしました。これまでに、これらのモデルは Hugging Face と ModelScope で累計 330 万回以上のダウンロードを記録しています。
Alibaba Group について
Alibaba Group のミッションは、あらゆる場所でビジネスを容易にすることです。同社は商業の未来のインフラを構築することを目指しています。顧客が Alibaba の上で出会い、働き、生活し、102 年続く良い企業であり続けることをビジョンとして掲げています。www.alibabagroup.com
