Tous les produits
Search
Centre de documentation

Intelligent Media Services:Solution d'intégration avec interface utilisateur

Dernière mise à jour :Aug 11, 2026

La solution d'IA conversationnelle en temps réel fournit des composants d'interface utilisateur prêts à l'emploi pour créer rapidement des applications IA interactives.

Présentation

Basée sur le SDK AICallKit, cette solution offre des composants d'interface utilisateur pour les applications audio et vidéo. Réutilisez les modules fonctionnels des AUI Kits pour développer rapidement des applications IA interactives en temps réel. Vous réduisez ainsi les délais et les coûts de développement tout en garantissant la qualité et la stabilité de l'application. Pour intégrer les AUI Kits pour l'IA conversationnelle en temps réel, reportez-vous aux rubriques suivantes :

Pour le développement côté serveur, consultez Intégration côté serveur et les Références API.

Fonctionnalités

Fonctionnalité

Description

Workflow en temps réel

Créez des workflows d'agents IA via une interface visuelle par glisser-déposer.

  • Reconnaissance vocale (Speech-to-text) :

    • Capacité Tongyi Qwen intégrée.

  • Synthèse vocale (Text-to-speech) :

    • Capacité Tongyi Qwen intégrée.

    • Connectez votre module de synthèse vocale personnalisé via des protocoles standard.

    • Intégration des capacités vocales MiniMax comme plugin tiers.

  • Grand modèle de langage (texte-à-texte) :

    • Capacité Tongyi Qwen intégrée.

    • Sélectionnez des modèles IA depuis le Model Hub ou l'Application Center dans Alibaba Cloud Model Studio.

    • Intégrez votre grand modèle de langage personnalisé selon les standards OpenAI.

  • Humain numérique

    • Intégration des capacités d'humain numérique Xiangxin comme plugin tiers.

  • Extraction de trames vidéo

  • Grand modèle de langage multimodal :

    • Capacité Tongyi Qwen intégrée.

    • Intégrez votre grand modèle de langage multimodal personnalisé conformément aux normes OpenAI.

Personnalisation de l'apparence de l'agent IA

Importez une image pour représenter votre agent IA lors des appels vocaux.

Reconnaissance des émotions par l'agent IA

L'agent IA détecte l'émotion actuelle de l'utilisateur et y répond avec un contexte émotionnel adapté.

Message d'accueil

Définissez un message d'accueil dans la console. L'agent IA le prononce au début de chaque conversation.

Annonces proactives

Votre serveur métier utilise l'OpenAPI pour déclencher une sortie audio-vidéo de l'agent IA.

Sous-titres en temps réel

Affichez le texte de la conversation en temps réel sur l'interface de l'utilisateur final.

Réduction intelligente du bruit

L'agent IA filtre les bruits de fond côté utilisateur. Si plusieurs personnes parlent simultanément, il capture en priorité la voix la plus forte.

Détection intelligente des interruptions

L'agent IA identifie les tentatives d'interruption de l'utilisateur pendant une conversation.

Segmentation intelligente des phrases

L'agent IA découpe automatiquement les phrases longues ou complexes pour améliorer la lisibilité.

Callbacks audio par phrase

Configurez des callbacks audio dans la console pour stocker les données audio en temps réel dans OSS.

Mode talkie-walkie

Activez le mode talkie-walkie au démarrage ou pendant un appel. Appuyez sur un bouton pour parler à l'agent IA.

Mots-clés ASR

Définissez des mots-clés métiers pour améliorer la précision de la reconnaissance vocale.

Réduction du bruit par empreinte vocale

Dans les conversations de groupe, l'agent IA identifie et préserve l'empreinte vocale du locuteur principal tout en réduisant les bruits parasites.

Prise en main par un agent humain

Transférez la conversation vers un agent humain si l'agent IA ne peut pas traiter une demande ou si une décision clé s'impose.

Arrêt progressif

Si votre serveur métier arrête un agent IA, laissez-le terminer sa réponse en cours avant l'extinction pour éviter toute interruption brutale.

Archivage des données

Convertissez les conversations de l'agent IA en texte et récupérez-les via des API. Stockez les enregistrements audio-vidéo dans OSS ou ApsaraVideo VOD.