Alibaba がデジタルヒューマン動画生成向けオープンソースモデルを発表
Alibaba Cloud 2025 年 8 月 27 日
Speech-to-Video モデル Wan2.2-S2V、人物画に命を吹き込む
中国、杭州、2025 年 8 月 27 日 – Alibaba は、デジタルヒューマン動画制作向けの最新オープンソースモデル Wan2.2-S2V(Speech-to-Video)を発表しました。この革新的なツールは、ポートレート写真から、話し、歌い、パフォームできる映画品質のアバターを生成します。
Alibaba の Wan2.2 動画生成シリーズの一翼を担うこの新モデルは、1 枚の画像と音声クリップから高品質なアニメーション動画を生成できます。
Wan2.2-S2V は多彩なキャラクターアニメーション機能を備え、ポートレート、バストショット、フルボディといった複数のフレーミングオプションで動画を作成できます。プロンプト指示に基づき、キャラクターの動作や環境要素を動的に生成できるため、コンテンツ制作者は特定のストーリーテリングやデザイン要件に合わせた正確なビジュアル表現を実現できます。
音声駆動のアニメーション技術により、自然な会話からミュージカルパフォーマンスまで、さまざまなキャラクターパフォーマンスを実現し、シーン内の複数キャラクターの処理もシームレスに対応します。音声録音からリアルなアニメーション動作に変換でき、カートゥーン、動物、スタイライズされたキャラクターまで多彩なアバターに対応しています。
コンテンツ制作者の多彩なニーズに応え、480P と 720P の柔軟な出力解像度を提供します。SNS コンテンツからプロフェッショナルなプレゼンテーションまで、さまざまな用途に適した高品質なビジュアルを確保できます。
Prompt : 動画の中で、男性が線路沿いを歩きながら歌で感情を表現しています。列車がゆっくりとそばを通り過ぎていきます。
革新的なテクノロジー
Wan2.2-S2V は、テキスト誘導のグローバルモーションコントロールと音声駆動の詳細なローカルモーションを組み合わせることで、従来のトーキングヘッドアニメーションを超越し、複雑なシナリオでも自然で表現豊かなキャラクターパフォーマンスを実現します。
もう一つの重要なブレークスルーは、このモデルの革新的なフレーム処理技術です。任意の長さの過去のフレームを単一のコンパクトな潜在表現に圧縮することで、計算オーバーヘッドを大幅に削減し、長時間の動画生成の安定性を実現します。これにより、長尺のアニメーション制作における重大な課題を解決しています。
さらに、Alibaba の研究チームが構築した映画・テレビ制作シナリオに特化した大規模な視聴覚データセットと、マルチレゾリューションのトレーニングアプローチにより、モデルの能力はさらに強化されています。縦型ショートフォームコンテンツから正規の横型の映画・テレビ制作まで、多彩なフォーマットに対応した柔軟な動画生成が可能です。
Wan2.2-S2V モデルは Hugging Face、GitHub、および Alibaba Cloud のオープンソースコミュニティ ModelScope でダウンロードできます。Alibaba はグローバルオープンソースコミュニティへの主要な貢献者として、2025 年 2 月に Wan2.1、7 月に Wan2.2 モデルをオープンソース化しています。現在までに Wan シリーズは Hugging Face と ModelScope で累計 690 万回以上のダウンロードを記録しています。
Alibaba Group について
Alibaba Group は、E コマースとクラウドコンピューティングを中核とするグローバルテクノロジー企業です。デジタルインフラと物流インフラ、効率化ツール、広範なマーケティングリーチを提供し、ビジネスやブランド、小売業者たちのマーケティング、販売、消費者とのエンゲージメントをサポートしています。また、業界をリードするクラウドインフラとサービス、コラボレーション機能を備え、企業のデジタルトランスフォーメーションとビジネス成長を支援しています。
