A IA Conversacional em Tempo Real permite interações eficientes de áudio e vídeo entre agentes de IA e usuários.
Introdução ao produto
A IA Conversacional em Tempo Real ajuda você a criar aplicativos de chamadas de áudio e vídeo entre agentes de IA e usuários. Configure um agente de IA personalizado por meio de uma interface visual e implante-o em menos de 10 minutos. O agente de IA se conecta aos usuários pela rede ApsaraVideo Real-time Communication (ARTC) e oferece suporte a cenários como atendimento ao cliente online, assistentes de IA, companheiros de IA, assistentes de relacionamento e professores virtuais.
Capacidades
Um agente de IA interage com os usuários por meio de chamadas de áudio e vídeo, conversas por mensagem e . Configure fluxos de trabalho para ative as seguintes capacidades:
Chamadas de áudio e vídeo
|
Chamadas de Voz Converse com o assistente de IA por voz.
|
Chamadas com Humano Digital Interaja com humanos digitais por vídeo para uma experiência mais realista.
|
Chamadas com Compreensão Visual O agente combina entradas de voz e vídeo para fornecer feedback contextual.
|
Chamadas de Vídeo Humanos digitais utilizam compreensão visual para realizar chamadas de vídeo bidirecionais com os usuários. |
|
Início rápido de chamadas de áudio e vídeo. Um fluxo de trabalho de chamada de voz requer apenas três nós.
|
|||
Mensagens de chat
Converse com o agente de IA por voz ou texto em uma caixa de diálogo.
|
|
|
|
Início rápido de mensagens de chat. Um fluxo de trabalho de mensagens de chat utiliza a seguinte configuração.
|
|
Termos
|
SessionId |
Identificador exclusivo definido pelo desenvolvedor para registros de chat. Exemplos:
|
|
Mensagens de chat |
Os usuários interagem com o agente de IA por voz ou texto em uma caixa de diálogo de chat para fazer perguntas ou obter informações. |
|
Chamadas de voz |
Os usuários conversam com o assistente de IA para obter informações oportunas e suporte. |
|
Chamadas com humano digital 3D |
Humanos digitais 3D simulam personagens virtuais com interação por voz, linguagem corporal e expressões faciais para maior realismo e engajamento. |
|
Chamadas com compreensão visual |
Combina feeds de câmera ao vivo e comandos de voz por meio de interação multimodal para fornecer feedback preciso, intuitivo e personalizado, indo além da comunicação apenas por voz ou texto. |
|
Chamadas de vídeo |
As chamadas de vídeo combinam humanos digitais e compreensão visual. Ambas as partes aparecem na tela, e o humano digital compreende e responde ao feed de vídeo do usuário. |
|
Mensagens interativas |
Mensagens interativas melhoram a comunicação entre usuários e aumentam o engajamento durante transmissões ao vivo. |
|
Real-Time Communication (ARTC) |
O ARTC da Alibaba Cloud utiliza WebRTC e mais de 3.200 nós globais para oferecer chamadas de áudio e vídeo de alta disponibilidade, alta qualidade e latência ultrabaixa entre usuários e agentes de IA. Visão geral da Real-Time Communication. |
|
Fluxo de trabalho em tempo real |
Parte central de um agente de IA, construída arrastando e soltando componentes de IA, como conversão de fala em texto, modelos de linguagem grandes, conversão de texto em fala e banco de dados vetorial da Alibaba Cloud. O agente de IA executa cada etapa do fluxo de trabalho em ordem. |
|
Agente de IA |
Usuário baseado em nuvem altamente realista, pré-construído ou criado sob medida, que interage com usuários finais por meio de áudio e vídeo. |
Benefícios
Alta disponibilidade global e baixa latência: A rede de áudio e vídeo em tempo real da Alibaba Cloud abrange mais de 3.200 nós globais com otimização de QoS, garantindo chamadas fluidas de agentes de IA em todo o mundo.
Integração e depuração simplificadas: Conecte componentes de IA — conversão de fala em texto, modelos de linguagem grandes, conversão de texto em fala e bancos de dados vetoriais — ao seu fluxo de trabalho para lançamentos rápidos e depuração fácil.
Comportamento semelhante ao humano: Redução inteligente de ruído, detecção de interrupções e segmentação de fala fazem com que os agentes de IA se comportem de maneira mais humana.
Integração facilitada: Quatro métodos de integração permitem que você escolha a melhor opção para o seu cenário.
Como funciona

Um usuário inicia uma chamada de áudio e vídeo em tempo real com um agente de IA baseado em nuvem usando um SDK.
O agente de IA recebe a entrada de áudio e vídeo do usuário, executa o fluxo de trabalho e gera uma resposta.
O agente de IA envia o fluxo de resposta para a rede ARTC. O usuário assina e reproduz o fluxo, concluindo a conversa.
Recursos
|
Recurso |
Descrição |
|
Fluxo de trabalho em tempo real |
Crie fluxos de trabalho de agentes de IA usando uma interface visual de arrastar e soltar.
|
|
Aparência personalizada do agente de IA |
Faça upload de uma imagem para representar seu agente de IA durante chamadas de voz. |
|
Reconhecimento de emoções pelo agente de IA |
O agente de IA detecta a emoção atual do usuário e responde com contexto emocional. |
|
Mensagem de boas-vindas |
Defina uma mensagem de boas-vindas no console. O agente de IA a pronuncia quando uma conversa começa. |
|
Anúncios proativos |
Seu servidor de negócios usa a OpenAPI para acionar a saída de áudio e vídeo do agente de IA. |
|
Legendas em tempo real |
Exiba o texto da conversa em tempo real na interface do usuário final. |
|
Redução inteligente de ruído |
O agente de IA filtra o ruído de fundo do lado do usuário. Quando várias pessoas falam ao mesmo tempo, ele captura primeiro a voz mais alta. |
|
Detecção inteligente de interrupções |
O agente de IA detecta quando um usuário tenta interromper durante uma conversa. |
|
Segmentação Inteligente de Sentenças |
O agente de IA divide sentenças longas ou complexas automaticamente para melhorar a legibilidade. |
|
Callbacks de áudio por sentença |
Configure callbacks de áudio no console para armazenar dados de áudio em tempo real no OSS. |
|
Modo walkie-talkie |
Ative o modo walkie-talkie na inicialização ou durante uma chamada. Pressione um botão para falar com o agente de IA. |
|
Palavras-chave ASR |
Defina palavras-chave específicas do negócio para melhorar a precisão do reconhecimento de fala. |
|
Redução de ruído por impressão de voz |
Em conversas em grupo, o agente de IA identifica e preserva a impressão de voz do falante principal enquanto reduz ruídos irrelevantes. |
|
Transferência para atendente humano |
Quando o agente de IA não consegue lidar com uma solicitação ou uma decisão importante é necessária, transfira a conversa para um atendente humano. |
|
Desligamento graceful |
Quando seu servidor de negócios parar um agente de IA, permita que ele termine sua resposta atual antes de desligar para evitar interrupções abruptas. |
|
Arquivamento de dados |
Converta conversas do agente de IA em texto e recupere-as por meio de APIs. Armazene gravações de áudio e vídeo no OSS ou ApsaraVideo VOD. |
Faturamento
A IA Conversacional em Tempo Real está em preview público e é gratuita durante este período.
Perguntas frequentes
Meu cliente retorna “AgentNotFound” ao iniciar mensagens de chat.
Meu cliente retorna “UnsupportedWorkflowType” ao iniciar mensagens de chat.
Fale conosco
Para dúvidas sobre o produto ou suporte, procure pelo número do grupo DingTalk 106730016696 e entre no grupo.







