Configure um agente de IA conversacional em tempo real ao criar um workflow, vinculá-lo a um agente e testar o resultado.
Pré-requisitos
Antes de começar, verifique se os seguintes requisitos foram atendidos:
O recurso Real-time Conversational AI deve estar ativado. Para ativá-lo, acesse a página de compra.
Etapa 1: Criar um workflow de áudio/vídeo
Faça login no console do Intelligent Media Service (IMS) e clique em Create Workflow Template.
-
Selecione um tipo de workflow, como Audio Call, Avatar Call, Vision Call ou Video Call, e configure os nós do workflow.
Speech-to-text
Converte fala em texto com suporte a vários idiomas.
Opções de Model Version: Preset ASR (recomendado para chinês-inglês misto, maior precisão), NLS-ASR (latência ultrabaixa), Qwen3-ASR-Realtime e Fun-ASR-Realtime. O Silent Time padrão é de 400 ms.
-
Preset: Com modelos predefinidos, selecione um modelo de idioma, defina um tempo de silêncio e configure hotwords personalizadas.
Model: Escolha um modelo de idioma adequado ao seu cenário.
Silent Time: Define quanto tempo o agente aguarda até que o usuário comece a falar.
Custom Hotword: Aumenta a precisão do reconhecimento para vocabulários específicos do domínio. Consulte Hotwords de reconhecimento de fala.
Sensitive Words: As palavras configuradas são automaticamente ocultadas com asteriscos (*) nas legendas do lado do cliente. Consulte Palavras sensíveis personalizadas.
Third-party Plug-in: Atualmente, é possível selecionar iFLYTEK. Para obter os parâmetros necessários, acesse o Ditado de Fala em Tempo Real da iFLYTEK.
LLM
O LLM processa a saída do STT para compreender e gerar respostas em linguagem natural.
Configure a System Persona (função, objetivos, capacidades, requisitos de resposta e restrições; até 3.072 caracteres) e as Conversation Memory Rounds (0–30). Mais rodadas retêm mais contexto, mas podem aumentar o tempo de processamento.
Provedores de LLM suportados: Qwen (predefinição do sistema), Alibaba Cloud Model Studio, Tongyi Xingchen e modelos desenvolvidos internamente compatíveis com OpenAI.
Alibaba Cloud Model Studio
Plataforma para desenvolvimento de grandes modelos e criação de aplicações. Conecte-se por meio do centro de Model ou do centro de Application.
Model center: No Marketplace de Modelos, selecione um modelo e copie seu código para usar como ModelId.
Application Center: Crie uma aplicação de agente no Alibaba Cloud Model Studio e obtenha o AppId.
Acesse a página de Gerenciamento de Chaves para criar e copiar uma chave de API.
Tongyi Xingchen
O Tongyi Xingchen permite criar agentes altamente personalizados com personas exclusivas, combináveis com interação de voz em tempo real baseada em avatar.
ModelId: O Tongyi Xingchen oferece cinco modelos:
xingchen-lite,xingchen-base,xingchen-plus,xingchen-plus-v2exingchen-max.API key: Acesse o console do Tongyi Xingchen para criar e obter uma chave de API.
Modelo desenvolvido internamente
Conecte seu grande modelo desenvolvido internamente usando a especificação OpenAI.
Insira os seguintes parâmetros:
Parâmetro
Descrição
Exemplo
ModelId
Nome do modelo. Corresponde ao campo
modelna especificação OpenAI.abc
API key
Credencial de autenticação da API. Corresponde ao campo
api_keyna especificação OpenAI.AUJH-pfnTNMPBm6iWXcJAcWsrscb5KYaLitQhHBLKrI
Model URL (HTTPS)
URL do endpoint de serviço. Corresponde ao campo
base_urlna especificação OpenAI.http://www.abc.com
Consulte a Interface Padrão de LLM.
Text-to-speech
Converte o texto processado em áudio para que o usuário ouça a resposta do agente.
No nó TTS, selecione a Version (Text-to-Speech 2.0 ou Text-to-Speech 1.0 (Legacy)), defina o Timbre (por exemplo, Yunfeng), ajuste o Volume (0–100) e visualize o áudio inserindo texto e clicando em Preview.
-
Escolha um modelo de text-to-speech adequado ao cenário da sua aplicação, incluindo Preset Template, Self-developed Template e Third-party Plug-in.
Modelo Predefinido do Sistema: Inclui System Default TTS, CosyVoice e Qwen3-TTS.
Modelo Desenvolvido Internamente: Integre seu próprio modelo via protocolo padrão. Consulte a Interface Padrão de TTS.
Plug-in de Terceiros: Apenas o MiniMax Speech Model é suportado. Utilize a versão mais recente. Consulte o MiniMax Speech Model.
-
O nó TTS também filtra o conteúdo recebido do LLM.
Em Filter Settings, selecione os tipos de colchetes a serem filtrados: parênteses chineses(), parênteses ingleses (), colchetes chineses【】, colchetes ingleses [] e chaves inglesas {}.
Normalização de Texto: Converte números, símbolos e outros elementos do texto em um formato padronizado para melhorar a qualidade da fala sintetizada. Por exemplo, "120" é convertido em "um dois zero".
Virtual Avatars
Gera um fluxo de vídeo do avatar, sincronizando movimentos, expressões e lábios com o texto e o áudio.
Configure o Node Name (gerado automaticamente). Tipos de entrada: Text Stream e Audio Stream. Tipo de saída: Video Stream.
Atualmente, o nó de avatar suporta conexão a um Avatar Plug-in ou à Lingjing Digital Avatar Platform:
Video Frame Extraction
Extrai quadros de imagem de um fluxo de vídeo.
Configure o Node Name (gerado automaticamente) e a Frame Extraction Frequency (1–30 quadros/segundo). Entrada: Video Stream. Saída: Image (Base64 format).
Video Content Recognition
Detecta comportamentos específicos no conteúdo de vídeo.
Na configuração do Video Content Recognition Node, defina o Node Name e selecione as opções de Recognition Content: Still Frame Detection, Invalid Frame Recognition, Person Count, Head Movement Recognition, Electronic Device Recognition, Gaze Deviation Recognition e Custom Model Detection. Para Custom Model Detection, insira um Detection Task ID (até 100 caracteres: números, letras, hifens e sublinhados; hifens e sublinhados não podem estar no início ou no fim).
Multi-modal LLM
O MLLM processa imagens e texto de nós anteriores para gerar respostas em linguagem natural. Selecione Multimodal Model ou Text-to-Text Model como modo de entrada.
Configure a System Persona (função, objetivos, capacidades, restrições; até 3.072 caracteres) e as Conversation Memory Rounds (1–30). Mais rodadas retêm mais contexto, mas podem aumentar o tempo de processamento.
Alibaba Cloud Model Studio
Plataforma para desenvolvimento de grandes modelos e criação de aplicações. Conecte-se por meio do centro de Model ou do centro de Application.
Model center: No Marketplace de Modelos, selecione um modelo e copie seu código para usar como ModelId.
Application Center: Crie uma aplicação de agente no Alibaba Cloud Model Studio e obtenha o AppId.
Acesse a página de Gerenciamento de Chaves para criar e copiar uma chave de API.
Tongyi Xingchen
O Tongyi Xingchen permite criar agentes altamente personalizados com personas exclusivas, combináveis com interação de voz em tempo real baseada em avatar.
ModelId: O Tongyi Xingchen oferece cinco modelos:
xingchen-lite,xingchen-base,xingchen-plus,xingchen-plus-v2exingchen-max.API key: Acesse o console do Tongyi Xingchen para criar e obter uma chave de API.
Modelo desenvolvido internamente
Conecte seu grande modelo desenvolvido internamente usando a especificação OpenAI.
Especificação OpenAI: Insira os seguintes parâmetros:
Parâmetro
Tipo
Obrigatório
Descrição
Exemplo
ModelId
String
Sim
Nome do modelo. Corresponde ao campo model na especificação OpenAI.
abc
API-KEY
String
Sim
Informações de autenticação. Corresponde ao campo api_key na especificação OpenAPI.
AUJH-pfnTNMPBm6iWXcJAcWsrscb5KYaLitQhHBLKrI
Model URL (HTTPS)
String
Sim
URL de solicitação do serviço. Corresponde ao campo base_url na especificação OpenAPI.
http://www.abc.com
Maximum Number of Images per Call
Integer
Sim
Alguns MLLMs limitam o número de quadros de imagem por solicitação. Defina este parâmetro para corresponder ao limite do modelo. Os quadros de vídeo são amostrados automaticamente com base neste valor.
15
Consulte a Interface Padrão de MLLM.
-
Clique em Save para criar o workflow de áudio/vídeo.
Etapa 2: Criar um agente de áudio/vídeo
Faça login no console do Intelligent Media Service (IMS) e clique em Create AI Agent.
-
Configure as informações básicas e vincule um workflow de áudio/vídeo em tempo real.
-
Vincule um workflow de áudio/vídeo que o agente seguirá.
Defina o Workflow Type (Audio Call, Avatar Call, Vision Call, Message-based Conversation ou Video Call) e selecione o workflow na lista suspensa Workflow ID.
-
Selecione uma aplicação existente do ApsaraVideo Real-time Communication (ARTC) em sua conta. Caso não exista nenhuma, o sistema poderá criar uma automaticamente. Consulte a Introdução ao ApsaraVideo Real-time Communication.
NotaO Real-time Conversational AI depende de uma aplicação ARTC como ponte de comunicação para as conversas.
-
Para workflows de Audio Call, faça upload de uma imagem personalizada exibida durante as chamadas.
Ative Custom Agent Image, defina Image Source como Specify Image URI ou Upload Image e forneça a imagem. Formatos suportados: GIF, PNG, JPG (máximo de 3 MB).
-
Clique em Submit para criar o agente de áudio/vídeo.
Etapa 3: Testar o agente
Após criar o agente, teste-o escaneando o QR code de demonstração.
-
Gere um QR code de demonstração no console.
No painel de navegação à esquerda, clique em AI Agents. Localize o agente desejado e clique em Demo QR Code na coluna Actions. Selecione um tempo de expiração (1 hour, 7 hours, 24 hours ou 3 days) e clique em Generate.
-
Escaneie o QR code com DingTalk, WeChat ou um navegador, ou copie a URL de demonstração no navegador para usar a demo H5.
Na caixa de diálogo Demo QR Code, o QR code do APP fica à esquerda e o QR code H5 à direita. A H5 Demo URL, o Experience Token e o Expiration Time aparecem na parte inferior.
Integrar o agente
Reúna os seguintes parâmetros para integrar o agente ao seu projeto. Consulte Integrar um agente de áudio/vídeo.
-
Region ID: Região do seu workflow e agente. Encontre seu Region ID no seletor de região no canto superior esquerdo do console.
Nome da região
Region ID
China (Hangzhou)
cn-hangzhou
China (Shanghai)
cn-shanghai
China (Beijing)
cn-beijing
China (Shenzhen)
cn-shenzhen
Singapura
ap-southeast-1
-
O AppId e a AppKey da aplicação ARTC.
Na página AI Agents, clique em Basic Information. Em Workflow Configuration, localize o RTC AppID no campo ApsaraVideo Real-time Communication (ARTC) Application.
No console do ApsaraVideo Live, acesse Live+ > ApsaraVideo Real-time Communication > Application Management. Clique na aplicação desejada e copie os valores em Basic Information.
AccessKey ID e AccessKey secret: Para obtê-los, consulte Criar um par de AccessKey.