Tous les produits
Search
Centre de documentation

Intelligent Media Services:Créer un agent d'appel audio/vidéo

Dernière mise à jour :Aug 27, 2026

Configurez un agent d'IA conversationnelle en temps réel en créant un workflow, en le liant à un agent et en testant le résultat.

Prérequis

Avant de commencer, assurez-vous de remplir les conditions suivantes :

  • La fonctionnalité Real-time Conversational AI doit être activée. Pour l'activer, accédez à la page d'achat.

Étape 1 : Créer un workflow audio/vidéo

  1. Connectez-vous à la console Intelligent Media Service (IMS) et cliquez sur Create Workflow Template.

  2. Sélectionnez un type de workflow, tel que Audio Call, Avatar Call, Vision Call ou Video Call, puis configurez les nœuds du workflow.

    Speech-to-text

    Convertit la parole en texte avec prise en charge multilingue.

    Options de Model Version : Preset ASR (recommandé pour le mélange chinois-anglais, précision supérieure), NLS-ASR (latence ultra-faible), Qwen3-ASR-Realtime et Fun-ASR-Realtime. Valeur par défaut de Silent Time : 400 ms.

    • Preset : Avec les modèles prédéfinis, sélectionnez un modèle linguistique, définissez un temps de silence et configurez des mots-clés personnalisés.

      • Model : Sélectionnez un modèle linguistique adapté à votre scénario.

      • Silent Time : Durée pendant laquelle l'agent attend que l'utilisateur parle.

      • Custom Hotword : Améliore la précision de reconnaissance pour le vocabulaire spécifique à un domaine. Mots-clés de reconnaissance vocale.

      • Sensitive Words : Les mots configurés sont automatiquement masqués par des astérisques (*) dans les sous-titres côté client. Mots sensibles personnalisés.

    • Third-party Plug-in : Actuellement, vous pouvez sélectionner iFLYTEK. Pour obtenir les paramètres requis, accédez à Dictée vocale en temps réel iFLYTEK.

    LLM

    Le LLM traite la sortie STT pour comprendre et générer des réponses en langage naturel.

    Configurez la System Persona (rôle, objectifs, capacités, exigences de réponse et contraintes ; jusqu'à 3 072 caractères) et les Conversation Memory Rounds (0–30). Un nombre plus élevé de tours conserve plus de contexte, mais peut augmenter le temps de traitement.

    Fournisseurs LLM pris en charge : Qwen (prédéfini par le système), Alibaba Cloud Model Studio, Tongyi Xingchen et modèles auto-développés conformes à OpenAI.

    Alibaba Cloud Model Studio

    Plateforme de développement de grands modèles et de création d'applications. Connectez-vous via le centre Model ou le centre Application.

    • Centre Model : Dans le Model Marketplace, sélectionnez un modèle et copiez son code en tant que ModelId.

    • Centre Application : Créez une application agent dans Alibaba Cloud Model Studio, puis obtenez l'AppId.

    • Accédez à la page [Key Management]() pour créer et copier une clé API.

    Tongyi Xingchen

    Tongyi Xingchen permet de créer des agents hautement personnalisés avec des personnas uniques, combinables à une interaction vocale en temps réel basée sur un avatar.

    • ModelId : Tongyi Xingchen propose cinq modèles : xingchen-lite, xingchen-base, xingchen-plus, xingchen-plus-v2 et xingchen-max.

    • Clé API : Accédez à la console Tongyi Xingchen pour créer et obtenir une clé API.

    Self-developed model

    Connectez votre grand modèle auto-développé en utilisant la spécification OpenAI.

    Saisissez les paramètres suivants :

    Parameter

    Description

    Example

    ModelId

    Nom du modèle. Correspond au champ model de la spécification OpenAI.

    abc

    API key

    Identifiant d'authentification API. Correspond au champ api_key de la spécification OpenAI.

    AUJH-pfnTNMPBm6iWXcJAcWsrscb5KYaLitQhHBLKrI

    Model URL (HTTPS)

    URL du point de terminaison du service. Correspond au champ base_url de la spécification OpenAI.

    http://www.abc.com

    Interface standard LLM.

    Text-to-speech

    Convertit le texte traité en audio afin que l'utilisateur entende la réponse de l'agent.

    Dans le nœud TTS, sélectionnez la Version (Text-to-Speech 2.0 ou Text-to-Speech 1.0 (Legacy)), définissez le Timbre (par exemple, Yunfeng), ajustez le Volume (0–100) et prévisualisez l'audio en saisissant du texte et en cliquant sur Preview.

    • Choisissez un modèle de synthèse vocale adapté à votre scénario d'application, notamment Preset Template, Self-developed Template et Third-party Plug-in.

      • Modèle prédéfini par le système : Inclut System Default TTS, CosyVoice et Qwen3-TTS.

      • Modèle auto-développé : Intégrez votre propre modèle via un protocole standard. Interface standard TTS.

      • Plug-in tiers : Seul le MiniMax Speech Model est pris en charge. Utilisez la dernière version. MiniMax Speech Model.

    • Le nœud TTS peut également filtrer le contenu reçu du LLM.

      Dans Filter Settings, sélectionnez les types de parenthèses à filtrer : parenthèses chinoises (), parenthèses anglaises (), crochets chinois 【】, crochets anglais [] et accolades anglaises {}.

    • Normalisation du texte : Convertit les nombres, symboles et autres éléments du texte dans un format standardisé pour améliorer la qualité de la synthèse vocale. Par exemple, « 120 » est converti en « un deux zéro ».

    Virtual Avatars

    Génère un flux vidéo de l'avatar, en synchronisant les mouvements, les expressions et les mouvements des lèvres avec le texte et l'audio.

    Configurez le Node Name (généré automatiquement). Types d'entrée : Text Stream et Audio Stream. Type de sortie : Video Stream.

    Le nœud avatar prend actuellement en charge la connexion à un Avatar Plug-in ou à la Lingjing Digital Avatar Platform :

    • Avatar Plug-in :

      • Faceunity : Contactez le service client de Faceunity pour activer leur service d'avatars 3D et obtenir l'AppID, l'AppKey et l'AvatarId.

    • Lingjing Digital Avatar Platform : Pour intégrer la Lingjing Digital Avatar Platform, soumettez un ticket pour activer le service.

    Video Frame Extraction

    Extrait des images d'un flux vidéo.

    Configurez le Node Name (généré automatiquement) et la Frame Extraction Frequency (1–30 images/seconde). Entrée : Video Stream. Sortie : Image (format Base64).

    Video Content Recognition

    Détecte des comportements spécifiques dans le contenu vidéo.

    Dans la configuration du Video Content Recognition Node, définissez le Node Name et sélectionnez les options de Recognition Content : Still Frame Detection, Invalid Frame Recognition, Person Count, Head Movement Recognition, Electronic Device Recognition, Gaze Deviation Recognition et Custom Model Detection. Pour Custom Model Detection, saisissez un Detection Task ID (jusqu'à 100 caractères : chiffres, lettres, traits d'union et underscores ; les traits d'union et underscores ne peuvent pas se trouver au début ou à la fin).

    Multi-modal LLM

    Le MLLM traite les images et le texte provenant des nœuds en amont pour générer des réponses en langage naturel. Sélectionnez Multimodal Model ou Text-to-Text Model comme mode d'entrée.

    Configurez la System Persona (rôle, objectifs, capacités, contraintes ; jusqu'à 3 072 caractères) et les Conversation Memory Rounds (1–30). Un nombre plus élevé de tours conserve plus de contexte, mais peut augmenter le temps de traitement.

    Alibaba Cloud Model Studio

    Plateforme de développement de grands modèles et de création d'applications. Connectez-vous via le centre Model ou le centre Application.

    • Centre Model : Dans le Model Marketplace, sélectionnez un modèle et copiez son code en tant que ModelId.

    • Centre Application : Créez une application agent dans Alibaba Cloud Model Studio, puis obtenez l'AppId.

    • Accédez à la page [Key Management]() pour créer et copier une clé API.

    Tongyi Xingchen

    Tongyi Xingchen permet de créer des agents hautement personnalisés avec des personnas uniques, combinables à une interaction vocale en temps réel basée sur un avatar.

    • ModelId : Tongyi Xingchen propose cinq modèles : xingchen-lite, xingchen-base, xingchen-plus, xingchen-plus-v2 et xingchen-max.

    • Clé API : Accédez à la console Tongyi Xingchen pour créer et obtenir une clé API.

    Self-developed model

    Connectez votre grand modèle auto-développé en utilisant la spécification OpenAI.

    Spécification OpenAI : Saisissez les paramètres suivants :

    Parameter

    Type

    Required

    Description

    Example

    ModelId

    String

    Yes

    Nom du modèle. Correspond au champ model de la spécification OpenAI.

    abc

    API-KEY

    String

    Yes

    Informations d'authentification. Correspond au champ api_key de la spécification OpenAPI.

    AUJH-pfnTNMPBm6iWXcJAcWsrscb5KYaLitQhHBLKrI

    Model URL (HTTPS)

    String

    Yes

    URL de requête du service. Correspond au champ base_url de la spécification OpenAPI.

    http://www.abc.com

    Maximum Number of Images per Call

    Integer

    Yes

    Certains MLLM limitent le nombre d'images par requête. Définissez ce paramètre pour correspondre à la limite du modèle. Les images vidéo sont échantillonnées automatiquement en fonction de cette valeur.

    15

    Interface standard MLLM.

  3. Cliquez sur Save pour créer le workflow audio/vidéo.

Étape 2 : Créer un agent audio/vidéo

  1. Connectez-vous à la console Intelligent Media Service (IMS) et cliquez sur Create AI Agent.

  2. Configurez les informations de base et liez un workflow audio/vidéo en temps réel.

    1. Lie un workflow audio/vidéo que l'agent suivra.

      Définissez le Workflow Type (Audio Call, Avatar Call, Vision Call, Message-based Conversation ou Video Call) et sélectionnez le workflow dans la liste déroulante Workflow ID.

    2. Sélectionnez une application ApsaraVideo Real-time Communication (ARTC) existante sous votre compte. Si aucune n'existe, le système peut en créer une automatiquement. Présentation d'ApsaraVideo Real-time Communication.

      Remarque

      Real-time Conversational AI s'appuie sur une application ARTC comme pont de communication pour les conversations.

    3. Pour les workflows Audio Call, vous pouvez télécharger une image personnalisée affichée pendant les appels.

      Activez Custom Agent Image, définissez Image Source sur Specify Image URI ou Upload Image, et fournissez l'image. Formats pris en charge : GIF, PNG, JPG (max 3 Mo).

  3. Cliquez sur Submit pour créer l'agent audio/vidéo.

Étape 3 : Tester l'agent

Après avoir créé l'agent, testez-le en scannant le code QR de démonstration.

  1. Générez un code QR de démonstration dans la console.

    Dans le volet de navigation de gauche, cliquez sur AI Agents. Recherchez l'agent cible et cliquez sur Demo QR Code dans la colonne Actions. Sélectionnez une durée d'expiration (1 hour, 7 hours, 24 hours ou 3 days) et cliquez sur Generate.

  2. Scannez le code QR avec DingTalk, WeChat ou un navigateur, ou copiez l'URL de démonstration dans votre navigateur pour utiliser la démo H5.

    Dans la boîte de dialogue Demo QR Code, le code QR de l'application se trouve à gauche et le code QR H5 à droite. L'H5 Demo URL, l'Experience Token et l'Expiration Time s'affichent en bas.

Intégrer l'agent

Rassemblez les paramètres suivants pour intégrer l'agent à votre projet. Intégrer un agent audio/vidéo.

  • Region ID : La région de votre workflow et de votre agent. Trouvez votre Region ID dans le sélecteur de région en haut à gauche de la console.

    Region name

    Region ID

    China (Hangzhou)

    cn-hangzhou

    China (Shanghai)

    cn-shanghai

    China (Beijing)

    cn-beijing

    China (Shenzhen)

    cn-shenzhen

    Singapore

    ap-southeast-1

  • L'AppId et l'AppKey de l'application ARTC.

    Sur la page AI Agents, cliquez sur Basic Information. Dans Workflow Configuration, recherchez le RTC AppID dans le champ ApsaraVideo Real-time Communication (ARTC) Application.

    Dans la console ApsaraVideo Live, accédez à Live+ > ApsaraVideo Real-time Communication > Application Management. Cliquez sur l'application cible et copiez les valeurs depuis Basic Information.

  • AccessKey ID et AccessKey secret : Pour les obtenir, consultez Créer une paire de clés AccessKey.