Tous les produits
Search
Centre de documentation

Intelligent Media Services:Présentation de la production intelligente

Dernière mise à jour :Aug 27, 2026

La production intelligente propose des fonctionnalités dédiées à la création et au traitement de contenus multimédias, notamment le montage vidéo, le montage en direct, l'usine de modèles, les tâches intelligentes, le traitement intelligent des médias, les humains numériques, le clonage vocal, la génération de vidéos en un clic et la traduction vidéo.

Vue d'ensemble

La production intelligente est un ensemble de fonctionnalités intégrées à Intelligent Media Services (IMS) pour la création et le traitement de contenus vidéo, audio et image. La liste suivante décrit les fonctionnalités abordées dans cette rubrique :

  • Montage vidéo — Créez des vidéos à partir de supports vidéo, audio, image et texte, avec un montage au niveau de l'image, des diffusions par humain numérique et des effets tels que des transitions, des filtres et des autocollants.

  • Montage en direct — Enregistrez, découpez et montez les flux en direct d'Alibaba Cloud, puis importez les résultats du découpage dans l'éditeur vidéo.

  • Usine de modèles — Enregistrez vos styles de montage fréquemment utilisés sous forme de modèles standard ou avancés, et générez de nouvelles vidéos en remplaçant simplement les supports du modèle.

  • Tâche intelligente — Générez automatiquement des sous-titres, des doublages, des incrustations sur fond transparent et des graphiques animés à partir de vos supports.

  • Production intelligente (traitement des médias) — Traitez les contenus audio, vidéo et image grâce à des fonctionnalités telles que la vignette intelligente, la conversion paysage-portrait, l'incrustation d'image, le floutage de logo, la suppression de sous-titres, l'extraction de sous-titres, la détection de refrains et la détection du rythme musical.

  • Humain numérique — Générez un humain numérique formé sur l'apparence d'une personne réelle, piloté par du texte ou de la voix, pour simuler une diffusion par une personne réelle.

  • Clonage vocal — Entraînez un modèle vocal à partir d'une voix humaine réelle et synthétisez de la parole avec cette voix clonée.

  • Génération de vidéos en un clic — Sélectionnez automatiquement les supports et générez des vidéos sur la base de scripts prédéfinis ou de textes de voix off.

  • Traduction vidéo — Traduisez les sous-titres d'une vidéo dans la langue de votre choix pour une diffusion multilingue.

Montage vidéo

Le montage vidéo offre des capacités professionnelles de production vidéo en ligne. Utilisez divers supports vidéo, audio et textuels pour créer des vidéos captivantes. Le montage vidéo prend en charge le traitement d'images (découpage, assemblage, recadrage, rotation), la diffusion par humain numérique pilotée par texte ou par voix, ainsi que l'enrichissement du contenu via des transitions, des filtres, des effets, des autocollants et du texte animé. Vous pouvez également traiter plusieurs tâches simultanément en arrière-plan grâce à des scripts.

p520618

Source des fichiers

Les services Alibaba Cloud Object Storage Service (OSS), ApsaraVideo VOD et les ressources multimédias locales sont pris en charge. Les ressources multimédias locales doivent être téléchargées vers OSS ou ApsaraVideo VOD.

Essai

Testez cette fonctionnalité dans la console IMS. Pour plus d'informations, consultez Montage vidéo.

Manifeste des capacités

Le tableau suivant décrit les capacités du montage vidéo :

Type

Capacité

Description

Traitement des supports

Général

Nombre de pistes de supports prises en charge

Par défaut, 100 pistes de supports sont prises en charge. Si vous avez des besoins spécifiques, rejoignez le groupe DingTalk 84650000851 pour obtenir une assistance technique.

Type de support

Les supports vidéo, audio, image et texte sont pris en charge.

Segmentation, suppression et assemblage des supports

Pris en charge.

Précision du montage

Le montage au niveau de l'image est pris en charge.

Vidéo, audio et image

Aperçu de l'image

Pris en charge.

Réglage de la vitesse de lecture

Pris en charge.

Étalonnage

Pris en charge.

Types de supports permettant le redimensionnement et l'ajustement de la position

Les supports vidéo et image permettent le redimensionnement et l'ajustement de la position.

Types de supports permettant le recadrage

Les supports vidéo et image permettent le recadrage.

Types de supports permettant les fondus enchaînés (entrée/sortie)

Les supports vidéo et audio permettent les fondus enchaînés.

Types de supports permettant l'ajustement du volume

Les supports vidéo et audio permettent l'ajustement du volume.

Humain numérique

Mode de pilotage

La diffusion par humain numérique pilotée par texte ou par voix est prise en charge.

Sous-titre

Format de sous-titre

Les formats Text, Automatic Speech Recognition (ASR) et Advanced SubStation Alpha (ASS) sont pris en charge.

Paramètres de style

Vous pouvez configurer la police, la taille de police, la couleur et les effets de texte artistique. L'utilisation d'un fichier de police personnalisé est prise en charge.

Mode d'alignement

L'alignement à gauche, au centre et à droite est pris en charge.

Effet d'animation

Les effets d'animation suivants sont pris en charge : effet d'entrée, effet de sortie et effet en boucle.

Embellissement

Effet visuel

Plusieurs effets visuels sont pris en charge. Pour plus d'informations, consultez Exemples d'effets visuels.

Effet de filtre

Plusieurs effets de filtre sont pris en charge. Pour plus d'informations, consultez Exemples d'effets de filtre.

Effet de transition

Plusieurs effets de transition sont pris en charge. Pour plus d'informations, consultez Exemples d'effets de transition.

Effet d'autocollant

Plusieurs effets d'autocollant sont pris en charge.

Montage et production

Définition

Résolution

Une résolution personnalisée est prise en charge. La résolution maximale est de 4K. La résolution par défaut peut être calculée dynamiquement en fonction des supports d'entrée.

Débit binaire

Un débit binaire personnalisé est pris en charge. Le débit binaire par défaut peut être calculé dynamiquement en fonction des supports d'entrée.

Rappel

S/O

Les méthodes de rappel via les files d'attente Simple Message Queue (SMQ, anciennement MNS) et les requêtes HTTP sont prises en charge. Vous pouvez configurer des rappels pour les vidéos de sortie. Pour plus d'informations, consultez Configurer les rappels.

Montage en direct

Le montage en direct prend en charge les fonctionnalités Live to VOD et le découpage de flux en direct. Les éditeurs de flux en direct sont intégrés aux éditeurs standards. Importez directement les résultats du découpage de flux en direct dans un éditeur standard pour un montage précis.

p520755

Source des fichiers

Flux actifs provenant d'Alibaba Cloud ApsaraVideo Live.

Essai

Testez cette fonctionnalité dans la console IMS. Pour plus d'informations, consultez Montage en direct.

Manifeste des capacités

Le tableau suivant décrit les capacités du montage en direct :

Capacité

Description

Type de flux en direct

Vous pouvez monter les flux en direct d'Alibaba Cloud.

Montage planifié

Vous pouvez planifier l'heure de début de l'enregistrement ou du montage.

Découpage

Vous pouvez configurer l'heure de début et l'heure de fin du découpage. Une fois confirmé, le découpage est terminé.

Rappel

La méthode de rappel via les files d'attente SMQ est prise en charge.

Montage précis

Le montage précis des résultats de découpage est pris en charge. Utilisez les capacités de montage vidéo pour effectuer ce montage précis.

Usine de modèles

L'usine de modèles vous permet d'enregistrer vos styles de montage fréquemment utilisés sous forme de modèles. Il vous suffit de remplacer les supports dans le modèle pour générer rapidement une nouvelle vidéo avec des effets similaires.

  • Modèle standard : modèle créé à partir de la chronologie d'un projet de montage vidéo. Plusieurs supports de la chronologie sont superposés et fusionnés. Un modèle standard permet de réaliser des effets tels que la conversion d'images en vidéos, la création d'albums, l'ajout de segments d'introduction et de conclusion, ainsi que l'application de filigranes par défaut.

  • Modèle avancé : modèle créé à partir d'Adobe After Effects (AE). Vous pouvez configurer des effets d'animation complexes pour obtenir des effets multimédias avancés.

    Choisissez le type de modèle en fonction des effets souhaités : utilisez un modèle standard pour les effets basés sur la chronologie, comme la conversion d'images en vidéos, et un modèle avancé pour les animations complexes basées sur AE.

Source des fichiers

Les services Alibaba Cloud OSS, ApsaraVideo VOD et les ressources multimédias locales sont pris en charge. Les ressources multimédias locales doivent être téléchargées vers OSS ou ApsaraVideo VOD.

Essai

Testez cette fonctionnalité dans la console IMS. Pour plus d'informations, consultez Usine de modèles.

Modèles officiels et personnalisés

IMS met à disposition des modèles officiels et permet aux utilisateurs de créer leurs propres modèles. Pour plus d'informations, consultez Modèles officiels et personnalisés.

Manifeste des capacités

Le tableau suivant décrit les capacités de l'usine de modèles :

Type de modèle

Opération

Capacité

Description

Modèle standard

Créer un modèle

Spécifier les supports dynamiques

Pris en charge. Les supports non spécifiés comme supports dynamiques sont considérés comme des supports fixes.

Spécifier les conditions d'adaptation temporelle des supports dynamiques

Pris en charge. Si la durée du support de remplacement est supérieure à la durée de l'emplacement du support dynamique, les options de découpage automatique et de report des supports suivants pour une connexion fluide sont prises en charge. Si la durée du support de remplacement est inférieure à la durée de l'emplacement du support dynamique, les options d'insertion d'images noires, d'avancement des supports suivants pour une connexion fluide et d'insertion d'images muettes à la fin sont prises en charge.

Spécifier les conditions d'adaptation spatiale des supports dynamiques

Pris en charge. Si la taille du support de remplacement ne correspond pas à la taille de l'emplacement du support dynamique, les options d'ajout automatique de bandes noires, de couleurs d'arrière-plan personnalisées et de floutage de l'arrière-plan sont prises en charge.

Paramètres de production prédéfinis

Pris en charge. Vous pouvez spécifier la résolution et le débit binaire par défaut d'une vidéo produite.

Utiliser un modèle

Remplacer les supports dynamiques

Pris en charge.

Soumettre une tâche de montage basée sur un modèle

Pris en charge. Vous pouvez soumettre des supports pour remplacer les supports dynamiques ainsi qu'un ID de modèle. Ainsi, vous pouvez utiliser la solution de montage basée sur un modèle pour produire une nouvelle vidéo.

Modèle avancé

Créer un modèle

Créer des effets de modèle

Pris en charge. Plusieurs plug-ins AE sont pris en charge. Vous pouvez utiliser les plug-ins AE pour enrichir les effets d'image, tels que les transitions vidéo et les effets. Pour plus d'informations, consultezPour plus d'informations, consultez.

Spécifier les supports dynamiques

Pris en charge. Les supports non spécifiés comme supports dynamiques sont considérés comme des supports fixes.

Spécifier les supports dynamiques pour remplacer les styles d'interface

Pris en charge. Vous pouvez configurer des groupes de montage et des images décoratives. Si un modèle est utilisé pour une page créée par l'utilisateur, la production intelligente distribue les groupes de montage et les images décoratives de manière centralisée.

Utiliser un modèle

Remplacer les supports dynamiques

Pris en charge.

Soumettre une tâche de montage basée sur un modèle

Pris en charge. Vous pouvez soumettre des supports pour remplacer les supports dynamiques ainsi qu'un ID de modèle. Ainsi, vous pouvez utiliser la solution de montage basée sur un modèle pour produire une nouvelle vidéo.

Tâche intelligente

La tâche intelligente propose des tâches qui aident à produire automatiquement des vidéos à partir de divers supports auditifs et visuels, tels que des vidéos, de l'audio et du texte.

Source des fichiers

Les services Alibaba Cloud OSS, ApsaraVideo VOD et les ressources multimédias locales sont pris en charge. Les ressources multimédias locales doivent être téléchargées vers OSS ou ApsaraVideo VOD.

Manifeste des capacités

  • Sous-titrage intelligent

    Les voix présentes dans l'audio ou la vidéo peuvent être converties en informations de sous-titres, incluant le contenu textuel et les informations temporelles.

    Le sous-titrage intelligent comprend deux fonctionnalités : Génération intelligente de sous-titres et Édition et correction rapides des sous-titres. Pour générer des sous-titres, cliquez sur Speech Recognition Subtitles pour lancer la reconnaissance. Vous pouvez définir des paramètres de style tels que la taille de police, le contour, la couleur d'arrière-plan et la position. L'édition et la correction rapides des sous-titres vous permettent de modifier et de corriger le texte des sous-titres reconnus ligne par ligne.

  • Doublage intelligent

    Le texte peut être converti en discours. Vous pouvez configurer les voix de doublage et les vitesses de doublage.

  • Incrustation d'image

    Un objet peut être extrait d'une image sur fond vert pour générer une vidéo ou une image avec un arrière-plan transparent.

  • Graphique intelligent

    Des tableaux Excel ou des données structurées peuvent être utilisés pour générer une vidéo de graphique animé consultable. Les diagrammes circulaires, les courbes, les histogrammes et les graphiques personnalisés sont pris en charge.

Production intelligente

La production intelligente offre des capacités de traitement et de génération de contenus multimédias sous diverses formes. Les fonctionnalités de traitement et de génération de médias prises en charge incluent la vignette intelligente, la conversion paysage-portrait, l'incrustation d'image, l'incrustation de portrait, le floutage de logo, la suppression de sous-titres, l'extraction de sous-titres, la détection de refrains et la détection du rythme musical. Ces fonctionnalités améliorent l'efficacité et la qualité de la production de contenus multimédias.

Le tableau suivant décrit les capacités de la production intelligente :

Type

Capacité

Description

Traitement audio

Détection de refrain

Les informations temporelles des segments de refrain peuvent être extraites.

Détection du rythme

Les points de rythme à plusieurs niveaux dans la musique peuvent être analysés et identifiés.

Mixage audio intelligent

Plusieurs types d'audio, tels que les voix et la musique, peuvent être traités.

Détection de la qualité audio

Les problèmes présents dans l'audio d'entrée, tels que les silences et les bégaiements, peuvent être identifiés.

Réduction intelligente du bruit

Le bruit peut être filtré tout en maintenant une haute fidélité vocale.

Séparation des voix et de l'accompagnement

Les voix et l'accompagnement peuvent être rapidement séparés en deux fichiers audio indépendants.

Traitement vidéo

Vignette intelligente

Les images de couverture et les couvertures animées sont prises en charge.

Résumé vidéo

Des extraits marquants peuvent être extraits d'une vidéo et fusionnés pour former un résumé vidéo représentatif de 5 secondes.

Extraction de sous-titres

Les sous-titres en chinois et en anglais peuvent être reconnus et extraits.

Suppression de sous-titres

Les sous-titres textuels dans les vidéos ou les images peuvent être détectés et supprimés intelligemment.

Floutage de logo

Les logos peuvent être floutés pour restaurer la vidéo à son état d'origine avant l'ajout du logo.

Conversion paysage-portrait

Les vidéos filmées en mode paysage peuvent être converties en vidéos adaptées à la lecture en mode portrait sur les appareils mobiles.

Incrustation d'image

Le premier plan et l'arrière-plan des images vidéo peuvent être analysés et extraits.

Retouche vidéo

Les visages peuvent être automatiquement détectés et retouchés avec des effets tels que le lissage de la peau, l'éclaircissement du teint et l'amélioration de l'éclat.

Traitement d'image

Floutage de logo

Les logos peuvent être floutés pour restaurer l'image à son état d'origine avant l'ajout du logo.

Conversion paysage-portrait

Les images en mode paysage peuvent être converties en images adaptées à la consultation en mode portrait sur les appareils mobiles.

Stylisation de visage

Les styles anime, comics américains et autres sont pris en charge.

Humain numérique

L'humain numérique apprend et s'entraîne sur l'apparence de personnes réelles afin qu'un humain numérique, piloté par du texte ou de la voix, puisse simuler une diffusion par une personne réelle. Cela crée un humain virtuel intelligent offrant des expériences interactives.

Les capacités suivantes sont proposées :

  • Entraînement personnalisé

    Grâce à l'entraînement algorithmique, l'apparence d'une personne réelle est convertie en un modèle numérique. Ainsi, aucun enregistrement par une personne réelle n'est requis pour une utilisation ultérieure, et les vidéos d'apparence peuvent être synthétisées par des algorithmes. Pour plus d'informations, consultez Entraînement personnalisé.

  • Synthèse

    Synthétisez des vidéos en utilisant l'apparence d'un humain numérique entraîné. Pour plus d'informations, consultez Synthèse.

Clonage vocal

Le clonage vocal apprend et s'entraîne sur des voix humaines réelles pour mettre en œuvre un clonage vocal personnalisé. Cela offre une expérience de synthèse vocale efficace et pratique.

Les capacités suivantes sont proposées :

  • Entraînement vocal personnalisé

    Grâce à l'entraînement algorithmique, une voix humaine réelle est convertie en un modèle numérique. Ainsi, aucun enregistrement par une personne réelle n'est requis pour une utilisation ultérieure, et les voix humaines peuvent être synthétisées par des algorithmes. Pour plus d'informations, consultez Entraînement vocal personnalisé.

  • Synthèse vocale

    Synthétisez de l'audio en utilisant un modèle vocal entraîné. Pour plus d'informations, consultez Synthèse vocale.

    Exemples

Pour plus d'informations, consultez Exemples vocaux.

Génération de vidéos en un clic

La génération de vidéos en un clic est une fonctionnalité automatisée de production vidéo. Sur la base de vos scripts prédéfinis ou de vos textes de voix off, elle sélectionne intelligemment les supports et génère automatiquement des vidéos.

Les modes de génération suivants sont proposés :

  • Génération automatique basée sur un script

    La génération automatique basée sur un script convient aux scénarios où vous avez une attente définie concernant la structure de la vidéo et les réserves de supports correspondantes. Vous prédéfinissez la structure de la vidéo et associez les supports correspondants. Le système organise ensuite les supports selon l'ordre de la structure dans son ensemble, sélectionne aléatoirement un support à chaque nœud, combine le script de voix off et adapte la durée. Jusqu'à 100 vidéos différentes peuvent être générées en une seule opération groupée. Pour plus d'informations, consultez Génération automatique basée sur un script.

  • Mise en correspondance intelligente texte-média

    La mise en correspondance intelligente texte-média convient aux scénarios où vous souhaitez découper intelligemment des segments depuis la bibliothèque de supports en fonction du texte de la voix off et assembler ces clips pour former une vidéo. Pour chaque phrase du texte de la voix off, le système découpe intelligemment un segment depuis la bibliothèque de supports afin de finaliser la production vidéo. Pour plus d'informations, consultez Mise en correspondance intelligente texte-média.

  • Génération basée sur une recherche intelligente

    Si vous disposez d'une grande quantité de supports et souhaitez créer des vidéos en fonction de votre propre inspiration et de vos idées, la génération basée sur une recherche intelligente est adaptée. Pour plus d'informations, consultez Génération basée sur une recherche intelligente.

    Exemples

De nombreux exemples sont fournis à titre de référence. Pour plus d'informations, consultez Exemples.

Traduction vidéo

La traduction au niveau des sous-titres est prise en charge. Les sous-titres apparaissant dans une vidéo peuvent être traduits dans la langue de votre choix. Cela facilite la conversion des sous-titres entre différentes langues et répond aux besoins des audiences de diverses régions et origines culturelles.

Les capacités suivantes sont proposées :

  • Traduction des sous-titres vidéo

    • Le contenu des sous-titres d'une vidéo peut être traduit dans la langue de votre choix.

    • La technologie OCR est fournie pour reconnaître les positions des sous-titres, ainsi que pour détecter et traduire intelligemment les sous-titres d'une vidéo.

    • Vous pouvez télécharger un fichier de sous-titres, tel qu'un fichier SRT, pour traduction.

  • Suppression des sous-titres et positionnement personnalisé

    • La suppression des sous-titres est proposée. Les sous-titres de la vidéo originale peuvent être détectés et supprimés intelligemment.

    • Vous pouvez spécifier la zone de suppression des sous-titres afin de vous assurer que les sous-titres traduits ne chevauchent pas d'autres contenus.

    • Vous pouvez personnaliser la position et le style des sous-titres traduits pour améliorer l'expérience de visionnage.

  • Prise en charge de l'édition secondaire

    • Lors de la traduction, vous pouvez choisir d'activer ou non la fonctionnalité d'édition secondaire.

    • Une fois la fonctionnalité activée, le système conserve tous les fichiers intermédiaires générés pendant le traitement et génère un projet de montage pour vos éditions et créations ultérieures.

    Pour plus d'informations sur l'utilisation de la traduction vidéo, consultez Traduction vidéo.