Alibaba présente un modèle open source pour la création et l'édition vidéo
Alibaba Cloud 15 mai 2025
Wan2.1-VACE, le modèle d'IA tout-en-un conçu pour transformer le secteur de la création vidéo
Hangzhou, Chine, 15 mai 2025 – Alibaba a dévoilé Wan 2.1-VACE (création et édition vidéo tout-en-un), son dernier modèle open source de création et d'édition vidéo. Cet outil innovant regroupe de multiples fonctions de traitement vidéo dans un modèle unique, afin de rationaliser le processus de création vidéo et de renforcer l'efficacité et la productivité.
Dans la famille des grands modèles de génération vidéo d'Alibaba – la série Wan2.1 –, VACE est le premier modèle open source du secteur à proposer une solution unifiée pour diverses tâches de génération et d'édition vidéo.
Wan2.1-VACE prend en charge la génération vidéo à partir d'entrées multimodales couvrant le texte, l'image et la vidéo, tout en offrant aux créateurs des capacités complètes d'édition vidéo. Ces fonctions d'édition incluent la référence à des images ou des frames, la repeinture vidéo, la modification de zones sélectionnées de la vidéo et l'extension spatio-temporelle, autant de possibilités qui permettent de combiner librement diverses tâches pour stimuler la créativité.
Grâce à cet outil avancé, les utilisateurs peuvent générer des vidéos mettant en scène des sujets spécifiques en interaction à partir d'échantillons d'images, et donner vie à des images fixes en leur ajoutant des effets de mouvement naturels. Ils bénéficient également de fonctions avancées de repeinture vidéo telles que le transfert de pose, le contrôle du mouvement, le contrôle de la profondeur et la recolorisation.
Le modèle permet en outre d'ajouter, de modifier ou de supprimer des éléments dans des zones spécifiques d'une vidéo, sans affecter l'environnement. Il permet également d'étendre les limites de la vidéo tout en complétant intelligemment le contenu pour enrichir l'expérience visuelle.
En tant que modèle d'IA tout-en-un, Wan2.1-VACE offre une polyvalence inégalée, permettant aux utilisateurs de combiner harmonieusement plusieurs fonctions et de libérer le potentiel d'innovation. Les utilisateurs peuvent transformer une image fixe en vidéo tout en maîtrisant le mouvement des objets par la spécification de leur trajectoire. Ils peuvent remplacer aisément des personnages ou des objets par des références spécifiées, animer des personnages référencés, maîtriser les poses et élargir horizontalement une image verticale pour créer une vidéo horizontale, tout en ajoutant de nouveaux éléments par référence.
Technologies innovantes

Wan2.1-VACE s'appuie sur plusieurs technologies innovantes afin de prendre en compte les besoins des différentes tâches d'édition vidéo dès la conception et la construction du modèle. Son interface unifiée, appelée Video Condition Unit (VCU), prend en charge le traitement unifié d'entrées multimodales telles que le texte, les images, la vidéo et les masques.
Le modèle emploie une structure Context Adapter qui injecte divers concepts de tâches au moyen de représentations formalisées des dimensions temporelle et spatiale. Cette conception innovante lui permet de gérer avec flexibilité un large éventail de tâches de synthèse vidéo.
Grâce aux avancées de l'architecture du modèle, Wan2.1-VACE peut être largement appliqué à la production rapide de vidéos courtes pour les réseaux sociaux, à la création de contenus pour la publicité et le marketing, à la post-production et au traitement des effets spéciaux dans le cinéma et la télévision, ainsi qu'à la génération de vidéos de formation pédagogique.
L'entraînement de modèles de fondation vidéo exige d'immenses ressources de calcul et de vastes volumes de données d'entraînement de haute qualité. L'accès ouvert abaisse les barrières et permet à davantage d'entreprises de tirer parti de l'IA pour créer rapidement et à moindre coût des contenus visuels de haute qualité, adaptés à leurs besoins.
Alibaba ouvre en open source le modèle Wan2.1-VACE en deux versions : l'une de 14 milliards de paramètres, l'autre de 1,3 milliard de paramètres. Les modèles sont téléchargeables gratuitement sur Hugging Face et GitHub, ainsi que sur la communauté open source d'Alibaba Cloud, ModelScope.
Alibaba est l'une des premières grandes entreprises technologiques mondiales à avoir ouvert en open source ses grands modèles d'IA développés en interne. En février 2025, elle a publié en open source quatre modèles Wan2.1, puis, le mois dernier, un modèle de génération vidéo prenant en charge la création de vidéos à partir d'images de début et de fin. À ce jour, ces modèles ont enregistré plus de 3,3 millions de téléchargements sur Hugging Face et ModelScope.
À propos d'Alibaba Group
La mission d'Alibaba Group est de faciliter les affaires où que ce soit. L'entreprise ambitionne de bâtir la future infrastructure du commerce. Elle envisage un avenir où ses clients se rencontreront, travailleront et vivront chez Alibaba, et où elle sera une entreprise solide qui durera 102 ans. www.alibabagroup.com
