La production intelligente propose des fonctionnalités dédiées à la création et au traitement de contenus multimédias, notamment le montage vidéo, le montage en direct, l'usine de modèles, les tâches intelligentes, le traitement intelligent des médias, les humains numériques, le clonage vocal, la génération de vidéos en un clic et la traduction vidéo.
Vue d'ensemble
La production intelligente est un ensemble de fonctionnalités intégrées à Intelligent Media Services (IMS) pour la création et le traitement de contenus vidéo, audio et image. La liste suivante décrit les fonctionnalités abordées dans cette rubrique :
Montage vidéo — Créez des vidéos à partir de supports vidéo, audio, image et texte, avec un montage au niveau de l'image, des diffusions par humain numérique et des effets tels que des transitions, des filtres et des autocollants.
Montage en direct — Enregistrez, découpez et montez les flux en direct d'Alibaba Cloud, puis importez les résultats du découpage dans l'éditeur vidéo.
Usine de modèles — Enregistrez vos styles de montage fréquemment utilisés sous forme de modèles standard ou avancés, et générez de nouvelles vidéos en remplaçant simplement les supports du modèle.
Tâche intelligente — Générez automatiquement des sous-titres, des doublages, des incrustations sur fond transparent et des graphiques animés à partir de vos supports.
Production intelligente (traitement des médias) — Traitez les contenus audio, vidéo et image grâce à des fonctionnalités telles que la vignette intelligente, la conversion paysage-portrait, l'incrustation d'image, le floutage de logo, la suppression de sous-titres, l'extraction de sous-titres, la détection de refrains et la détection du rythme musical.
Humain numérique — Générez un humain numérique formé sur l'apparence d'une personne réelle, piloté par du texte ou de la voix, pour simuler une diffusion par une personne réelle.
Clonage vocal — Entraînez un modèle vocal à partir d'une voix humaine réelle et synthétisez de la parole avec cette voix clonée.
Génération de vidéos en un clic — Sélectionnez automatiquement les supports et générez des vidéos sur la base de scripts prédéfinis ou de textes de voix off.
Traduction vidéo — Traduisez les sous-titres d'une vidéo dans la langue de votre choix pour une diffusion multilingue.
Montage vidéo
Le montage vidéo offre des capacités professionnelles de production vidéo en ligne. Utilisez divers supports vidéo, audio et textuels pour créer des vidéos captivantes. Le montage vidéo prend en charge le traitement d'images (découpage, assemblage, recadrage, rotation), la diffusion par humain numérique pilotée par texte ou par voix, ainsi que l'enrichissement du contenu via des transitions, des filtres, des effets, des autocollants et du texte animé. Vous pouvez également traiter plusieurs tâches simultanément en arrière-plan grâce à des scripts.

Source des fichiers
Les services Alibaba Cloud Object Storage Service (OSS), ApsaraVideo VOD et les ressources multimédias locales sont pris en charge. Les ressources multimédias locales doivent être téléchargées vers OSS ou ApsaraVideo VOD.
Essai
Testez cette fonctionnalité dans la console IMS. Pour plus d'informations, consultez Montage vidéo.
Manifeste des capacités
Le tableau suivant décrit les capacités du montage vidéo :
|
Type |
Capacité |
Description |
|
|
Traitement des supports |
Général |
Nombre de pistes de supports prises en charge |
Par défaut, 100 pistes de supports sont prises en charge. Si vous avez des besoins spécifiques, rejoignez le groupe DingTalk 84650000851 pour obtenir une assistance technique. |
|
Type de support |
Les supports vidéo, audio, image et texte sont pris en charge. |
||
|
Segmentation, suppression et assemblage des supports |
Pris en charge. |
||
|
Précision du montage |
Le montage au niveau de l'image est pris en charge. |
||
|
Vidéo, audio et image |
Aperçu de l'image |
Pris en charge. |
|
|
Réglage de la vitesse de lecture |
Pris en charge. |
||
|
Étalonnage |
Pris en charge. |
||
|
Types de supports permettant le redimensionnement et l'ajustement de la position |
Les supports vidéo et image permettent le redimensionnement et l'ajustement de la position. |
||
|
Types de supports permettant le recadrage |
Les supports vidéo et image permettent le recadrage. |
||
|
Types de supports permettant les fondus enchaînés (entrée/sortie) |
Les supports vidéo et audio permettent les fondus enchaînés. |
||
|
Types de supports permettant l'ajustement du volume |
Les supports vidéo et audio permettent l'ajustement du volume. |
||
|
Humain numérique |
Mode de pilotage |
La diffusion par humain numérique pilotée par texte ou par voix est prise en charge. |
|
|
Sous-titre |
Format de sous-titre |
Les formats Text, Automatic Speech Recognition (ASR) et Advanced SubStation Alpha (ASS) sont pris en charge. |
|
|
Paramètres de style |
Vous pouvez configurer la police, la taille de police, la couleur et les effets de texte artistique. L'utilisation d'un fichier de police personnalisé est prise en charge. |
||
|
Mode d'alignement |
L'alignement à gauche, au centre et à droite est pris en charge. |
||
|
Effet d'animation |
Les effets d'animation suivants sont pris en charge : effet d'entrée, effet de sortie et effet en boucle. |
||
|
Embellissement |
Effet visuel |
Plusieurs effets visuels sont pris en charge. Pour plus d'informations, consultez Exemples d'effets visuels. |
|
|
Effet de filtre |
Plusieurs effets de filtre sont pris en charge. Pour plus d'informations, consultez Exemples d'effets de filtre. |
||
|
Effet de transition |
Plusieurs effets de transition sont pris en charge. Pour plus d'informations, consultez Exemples d'effets de transition. |
||
|
Effet d'autocollant |
Plusieurs effets d'autocollant sont pris en charge. |
||
|
Montage et production |
Définition |
Résolution |
Une résolution personnalisée est prise en charge. La résolution maximale est de 4K. La résolution par défaut peut être calculée dynamiquement en fonction des supports d'entrée. |
|
Débit binaire |
Un débit binaire personnalisé est pris en charge. Le débit binaire par défaut peut être calculé dynamiquement en fonction des supports d'entrée. |
||
|
Rappel |
S/O |
Les méthodes de rappel via les files d'attente Simple Message Queue (SMQ, anciennement MNS) et les requêtes HTTP sont prises en charge. Vous pouvez configurer des rappels pour les vidéos de sortie. Pour plus d'informations, consultez Configurer les rappels. |
Montage en direct
Le montage en direct prend en charge les fonctionnalités Live to VOD et le découpage de flux en direct. Les éditeurs de flux en direct sont intégrés aux éditeurs standards. Importez directement les résultats du découpage de flux en direct dans un éditeur standard pour un montage précis.

Source des fichiers
Flux actifs provenant d'Alibaba Cloud ApsaraVideo Live.
Essai
Testez cette fonctionnalité dans la console IMS. Pour plus d'informations, consultez Montage en direct.
Manifeste des capacités
Le tableau suivant décrit les capacités du montage en direct :
|
Capacité |
Description |
|
Type de flux en direct |
Vous pouvez monter les flux en direct d'Alibaba Cloud. |
|
Montage planifié |
Vous pouvez planifier l'heure de début de l'enregistrement ou du montage. |
|
Découpage |
Vous pouvez configurer l'heure de début et l'heure de fin du découpage. Une fois confirmé, le découpage est terminé. |
|
Rappel |
La méthode de rappel via les files d'attente SMQ est prise en charge. |
|
Montage précis |
Le montage précis des résultats de découpage est pris en charge. Utilisez les capacités de montage vidéo pour effectuer ce montage précis. |
Usine de modèles
L'usine de modèles vous permet d'enregistrer vos styles de montage fréquemment utilisés sous forme de modèles. Il vous suffit de remplacer les supports dans le modèle pour générer rapidement une nouvelle vidéo avec des effets similaires.
Modèle standard : modèle créé à partir de la chronologie d'un projet de montage vidéo. Plusieurs supports de la chronologie sont superposés et fusionnés. Un modèle standard permet de réaliser des effets tels que la conversion d'images en vidéos, la création d'albums, l'ajout de segments d'introduction et de conclusion, ainsi que l'application de filigranes par défaut.
-
Modèle avancé : modèle créé à partir d'Adobe After Effects (AE). Vous pouvez configurer des effets d'animation complexes pour obtenir des effets multimédias avancés.
Choisissez le type de modèle en fonction des effets souhaités : utilisez un modèle standard pour les effets basés sur la chronologie, comme la conversion d'images en vidéos, et un modèle avancé pour les animations complexes basées sur AE.
Source des fichiers
Les services Alibaba Cloud OSS, ApsaraVideo VOD et les ressources multimédias locales sont pris en charge. Les ressources multimédias locales doivent être téléchargées vers OSS ou ApsaraVideo VOD.
Essai
Testez cette fonctionnalité dans la console IMS. Pour plus d'informations, consultez Usine de modèles.
Modèles officiels et personnalisés
IMS met à disposition des modèles officiels et permet aux utilisateurs de créer leurs propres modèles. Pour plus d'informations, consultez Modèles officiels et personnalisés.
Manifeste des capacités
Le tableau suivant décrit les capacités de l'usine de modèles :
Type de modèle | Opération | Capacité | Description |
Modèle standard | Créer un modèle | Spécifier les supports dynamiques | Pris en charge. Les supports non spécifiés comme supports dynamiques sont considérés comme des supports fixes. |
Spécifier les conditions d'adaptation temporelle des supports dynamiques | Pris en charge. Si la durée du support de remplacement est supérieure à la durée de l'emplacement du support dynamique, les options de découpage automatique et de report des supports suivants pour une connexion fluide sont prises en charge. Si la durée du support de remplacement est inférieure à la durée de l'emplacement du support dynamique, les options d'insertion d'images noires, d'avancement des supports suivants pour une connexion fluide et d'insertion d'images muettes à la fin sont prises en charge. | ||
Spécifier les conditions d'adaptation spatiale des supports dynamiques | Pris en charge. Si la taille du support de remplacement ne correspond pas à la taille de l'emplacement du support dynamique, les options d'ajout automatique de bandes noires, de couleurs d'arrière-plan personnalisées et de floutage de l'arrière-plan sont prises en charge. | ||
Paramètres de production prédéfinis | Pris en charge. Vous pouvez spécifier la résolution et le débit binaire par défaut d'une vidéo produite. | ||
Utiliser un modèle | Remplacer les supports dynamiques | Pris en charge. | |
Soumettre une tâche de montage basée sur un modèle | Pris en charge. Vous pouvez soumettre des supports pour remplacer les supports dynamiques ainsi qu'un ID de modèle. Ainsi, vous pouvez utiliser la solution de montage basée sur un modèle pour produire une nouvelle vidéo. | ||
Modèle avancé | Créer un modèle | Créer des effets de modèle | Pris en charge. Plusieurs plug-ins AE sont pris en charge. Vous pouvez utiliser les plug-ins AE pour enrichir les effets d'image, tels que les transitions vidéo et les effets. Pour plus d'informations, consultezPour plus d'informations, consultez. |
Spécifier les supports dynamiques | Pris en charge. Les supports non spécifiés comme supports dynamiques sont considérés comme des supports fixes. | ||
Spécifier les supports dynamiques pour remplacer les styles d'interface | Pris en charge. Vous pouvez configurer des groupes de montage et des images décoratives. Si un modèle est utilisé pour une page créée par l'utilisateur, la production intelligente distribue les groupes de montage et les images décoratives de manière centralisée. | ||
Utiliser un modèle | Remplacer les supports dynamiques | Pris en charge. | |
Soumettre une tâche de montage basée sur un modèle | Pris en charge. Vous pouvez soumettre des supports pour remplacer les supports dynamiques ainsi qu'un ID de modèle. Ainsi, vous pouvez utiliser la solution de montage basée sur un modèle pour produire une nouvelle vidéo. |
Tâche intelligente
La tâche intelligente propose des tâches qui aident à produire automatiquement des vidéos à partir de divers supports auditifs et visuels, tels que des vidéos, de l'audio et du texte.
Source des fichiers
Les services Alibaba Cloud OSS, ApsaraVideo VOD et les ressources multimédias locales sont pris en charge. Les ressources multimédias locales doivent être téléchargées vers OSS ou ApsaraVideo VOD.
Manifeste des capacités
-
Sous-titrage intelligent
Les voix présentes dans l'audio ou la vidéo peuvent être converties en informations de sous-titres, incluant le contenu textuel et les informations temporelles.

Le sous-titrage intelligent comprend deux fonctionnalités : Génération intelligente de sous-titres et Édition et correction rapides des sous-titres. Pour générer des sous-titres, cliquez sur Speech Recognition Subtitles pour lancer la reconnaissance. Vous pouvez définir des paramètres de style tels que la taille de police, le contour, la couleur d'arrière-plan et la position. L'édition et la correction rapides des sous-titres vous permettent de modifier et de corriger le texte des sous-titres reconnus ligne par ligne.
-
Doublage intelligent
Le texte peut être converti en discours. Vous pouvez configurer les voix de doublage et les vitesses de doublage.
-
Incrustation d'image
Un objet peut être extrait d'une image sur fond vert pour générer une vidéo ou une image avec un arrière-plan transparent.
-
Graphique intelligent
Des tableaux Excel ou des données structurées peuvent être utilisés pour générer une vidéo de graphique animé consultable. Les diagrammes circulaires, les courbes, les histogrammes et les graphiques personnalisés sont pris en charge.
Production intelligente
La production intelligente offre des capacités de traitement et de génération de contenus multimédias sous diverses formes. Les fonctionnalités de traitement et de génération de médias prises en charge incluent la vignette intelligente, la conversion paysage-portrait, l'incrustation d'image, l'incrustation de portrait, le floutage de logo, la suppression de sous-titres, l'extraction de sous-titres, la détection de refrains et la détection du rythme musical. Ces fonctionnalités améliorent l'efficacité et la qualité de la production de contenus multimédias.
Le tableau suivant décrit les capacités de la production intelligente :
|
Type |
Capacité |
Description |
|
Traitement audio |
Détection de refrain |
Les informations temporelles des segments de refrain peuvent être extraites. |
|
Détection du rythme |
Les points de rythme à plusieurs niveaux dans la musique peuvent être analysés et identifiés. |
|
|
Mixage audio intelligent |
Plusieurs types d'audio, tels que les voix et la musique, peuvent être traités. |
|
|
Détection de la qualité audio |
Les problèmes présents dans l'audio d'entrée, tels que les silences et les bégaiements, peuvent être identifiés. |
|
|
Réduction intelligente du bruit |
Le bruit peut être filtré tout en maintenant une haute fidélité vocale. |
|
|
Séparation des voix et de l'accompagnement |
Les voix et l'accompagnement peuvent être rapidement séparés en deux fichiers audio indépendants. |
|
|
Traitement vidéo |
Vignette intelligente |
Les images de couverture et les couvertures animées sont prises en charge. |
|
Résumé vidéo |
Des extraits marquants peuvent être extraits d'une vidéo et fusionnés pour former un résumé vidéo représentatif de 5 secondes. |
|
|
Extraction de sous-titres |
Les sous-titres en chinois et en anglais peuvent être reconnus et extraits. |
|
|
Suppression de sous-titres |
Les sous-titres textuels dans les vidéos ou les images peuvent être détectés et supprimés intelligemment. |
|
|
Floutage de logo |
Les logos peuvent être floutés pour restaurer la vidéo à son état d'origine avant l'ajout du logo. |
|
|
Conversion paysage-portrait |
Les vidéos filmées en mode paysage peuvent être converties en vidéos adaptées à la lecture en mode portrait sur les appareils mobiles. |
|
|
Incrustation d'image |
Le premier plan et l'arrière-plan des images vidéo peuvent être analysés et extraits. |
|
|
Retouche vidéo |
Les visages peuvent être automatiquement détectés et retouchés avec des effets tels que le lissage de la peau, l'éclaircissement du teint et l'amélioration de l'éclat. |
|
|
Traitement d'image |
Floutage de logo |
Les logos peuvent être floutés pour restaurer l'image à son état d'origine avant l'ajout du logo. |
|
Conversion paysage-portrait |
Les images en mode paysage peuvent être converties en images adaptées à la consultation en mode portrait sur les appareils mobiles. |
|
|
Stylisation de visage |
Les styles anime, comics américains et autres sont pris en charge. |
Humain numérique
L'humain numérique apprend et s'entraîne sur l'apparence de personnes réelles afin qu'un humain numérique, piloté par du texte ou de la voix, puisse simuler une diffusion par une personne réelle. Cela crée un humain virtuel intelligent offrant des expériences interactives.
Les capacités suivantes sont proposées :
-
Entraînement personnalisé
Grâce à l'entraînement algorithmique, l'apparence d'une personne réelle est convertie en un modèle numérique. Ainsi, aucun enregistrement par une personne réelle n'est requis pour une utilisation ultérieure, et les vidéos d'apparence peuvent être synthétisées par des algorithmes. Pour plus d'informations, consultez Entraînement personnalisé.
-
Synthèse
Synthétisez des vidéos en utilisant l'apparence d'un humain numérique entraîné. Pour plus d'informations, consultez Synthèse.
Clonage vocal
Le clonage vocal apprend et s'entraîne sur des voix humaines réelles pour mettre en œuvre un clonage vocal personnalisé. Cela offre une expérience de synthèse vocale efficace et pratique.
Les capacités suivantes sont proposées :
-
Entraînement vocal personnalisé
Grâce à l'entraînement algorithmique, une voix humaine réelle est convertie en un modèle numérique. Ainsi, aucun enregistrement par une personne réelle n'est requis pour une utilisation ultérieure, et les voix humaines peuvent être synthétisées par des algorithmes. Pour plus d'informations, consultez Entraînement vocal personnalisé.
-
Synthèse vocale
Synthétisez de l'audio en utilisant un modèle vocal entraîné. Pour plus d'informations, consultez Synthèse vocale.
Exemples
Pour plus d'informations, consultez Exemples vocaux.
Génération de vidéos en un clic
La génération de vidéos en un clic est une fonctionnalité automatisée de production vidéo. Sur la base de vos scripts prédéfinis ou de vos textes de voix off, elle sélectionne intelligemment les supports et génère automatiquement des vidéos.
Les modes de génération suivants sont proposés :
-
Génération automatique basée sur un script
La génération automatique basée sur un script convient aux scénarios où vous avez une attente définie concernant la structure de la vidéo et les réserves de supports correspondantes. Vous prédéfinissez la structure de la vidéo et associez les supports correspondants. Le système organise ensuite les supports selon l'ordre de la structure dans son ensemble, sélectionne aléatoirement un support à chaque nœud, combine le script de voix off et adapte la durée. Jusqu'à 100 vidéos différentes peuvent être générées en une seule opération groupée. Pour plus d'informations, consultez Génération automatique basée sur un script.
-
Mise en correspondance intelligente texte-média
La mise en correspondance intelligente texte-média convient aux scénarios où vous souhaitez découper intelligemment des segments depuis la bibliothèque de supports en fonction du texte de la voix off et assembler ces clips pour former une vidéo. Pour chaque phrase du texte de la voix off, le système découpe intelligemment un segment depuis la bibliothèque de supports afin de finaliser la production vidéo. Pour plus d'informations, consultez Mise en correspondance intelligente texte-média.
-
Génération basée sur une recherche intelligente
Si vous disposez d'une grande quantité de supports et souhaitez créer des vidéos en fonction de votre propre inspiration et de vos idées, la génération basée sur une recherche intelligente est adaptée. Pour plus d'informations, consultez Génération basée sur une recherche intelligente.
Exemples
De nombreux exemples sont fournis à titre de référence. Pour plus d'informations, consultez Exemples.
Traduction vidéo
La traduction au niveau des sous-titres est prise en charge. Les sous-titres apparaissant dans une vidéo peuvent être traduits dans la langue de votre choix. Cela facilite la conversion des sous-titres entre différentes langues et répond aux besoins des audiences de diverses régions et origines culturelles.
Les capacités suivantes sont proposées :
-
Traduction des sous-titres vidéo
Le contenu des sous-titres d'une vidéo peut être traduit dans la langue de votre choix.
La technologie OCR est fournie pour reconnaître les positions des sous-titres, ainsi que pour détecter et traduire intelligemment les sous-titres d'une vidéo.
Vous pouvez télécharger un fichier de sous-titres, tel qu'un fichier SRT, pour traduction.
-
Suppression des sous-titres et positionnement personnalisé
La suppression des sous-titres est proposée. Les sous-titres de la vidéo originale peuvent être détectés et supprimés intelligemment.
Vous pouvez spécifier la zone de suppression des sous-titres afin de vous assurer que les sous-titres traduits ne chevauchent pas d'autres contenus.
Vous pouvez personnaliser la position et le style des sous-titres traduits pour améliorer l'expérience de visionnage.
-
Prise en charge de l'édition secondaire
Lors de la traduction, vous pouvez choisir d'activer ou non la fonctionnalité d'édition secondaire.
Une fois la fonctionnalité activée, le système conserve tous les fichiers intermédiaires générés pendant le traitement et génère un projet de montage pour vos éditions et créations ultérieures.
Pour plus d'informations sur l'utilisation de la traduction vidéo, consultez Traduction vidéo.