Crie um agente de mensagens interativas para habilitar conversas com IA, incluindo recursos de reconhecimento de fala e conversão de texto em fala.
Antes de começar, verifique se os seguintes requisitos foram atendidos:
O recurso Real-time Conversational AI está ativado. Para ativá-lo, acesse a página de compra.
Etapa 1: Criar um fluxo de trabalho de mensagens interativas
Faça login no console do Intelligent Media Service (IMS) e clique em Create Workflow Template.
-
Selecione o tipo de fluxo de trabalho Messaging e configure os nós conforme necessário.
NotaPara habilitar os recursos de reconhecimento de fala ou conversão de texto em fala, configure os seguintes nós:
Configure o nó Speech-to-text para ativar o reconhecimento de fala por pressão de botão.
Configure o nó Text-to-speech para permitir respostas faladas.
Speech-to-text
Converte entrada de voz em texto e oferece suporte a vários idiomas.
As versões de modelo disponíveis incluem System Preset ASR (recomendado para cenários mistos de chinês e inglês devido à maior precisão), Qwen3-ASR-Realtime, Fun-ASR-Realtime e NLS-ASR (indicado para cenários de latência ultrabaixa). O tempo de silêncio padrão é de 400 ms. Requisitos para arquivos carregados de palavras-chave e palavras sensíveis: formato TXT, até 500 palavras, até 10 caracteres por palavra, até 100 KB e codificação UTF-8 sem BOM.
-
Preset : O modelo predefinido permite selecionar um modelo de idioma, definir o tempo de silêncio e configurar palavras-chave personalizadas.
Model: Selecione um modelo de idioma adequado ao seu cenário.
Silent Time: Defina quanto tempo o agente aguarda a entrada do usuário antes de atingir o tempo limite.
Custom Hotword: Palavras-chave melhoram a precisão do reconhecimento para vocabulário específico do domínio. Para mais informações, consulte Palavras-chave de reconhecimento de fala.
Sensitive Words: Após a configuração de palavras sensíveis, o sistema oculta automaticamente qualquer termo detectado com asteriscos (*) nas legendas do lado do cliente. Para mais informações, consulte Palavras sensíveis personalizadas.
Third-party Plug-in: Atualmente, você pode selecionar iFLYTEK Speech Recognition. Para obter os parâmetros necessários, acesse o Ditado de Fala em Tempo Real da iFLYTEK.
Text-to-speech
Transforma texto em fala para que os usuários possam ouvir a resposta do agente.
A caixa de diálogo de configuração também inclui: seleção de Version (Text-to-Speech 2.0 e Text-to-Speech 1.0 (Legacy)), seleção de Voice (como Yunfeng), definição de Volume (intervalo de 0 a 100) e uma área de entrada para Preview Content (até 200 caracteres). Clique em Play para ouvir uma prévia da fala.
Escolha um modelo de conversão de texto em fala adequado ao cenário da sua aplicação, incluindo Preset Template, Self-developed Template e Third-party Plug-in.
Modelo Predefinido do Sistema: Inclui System Default TTS, CosyVoice e Qwen3-TTS.
Modelo Autodesenvolvido: Integre seu próprio modelo por meio de um protocolo padrão. Consulte a Interface Padrão TTS.
Plug-in de Terceiros: Apenas o MiniMax Speech Model tem suporte. Utilize a versão mais recente. Consulte o MiniMax Speech Model.
LLM
O LLM processa a saída do STT para compreender e gerar respostas em linguagem natural.
Configure a System Persona (função, objetivos, capacidades, requisitos de resposta e restrições; até 3.072 caracteres) e as Conversation Memory Rounds (0–30). Um número maior de rodadas retém mais contexto, mas pode aumentar o tempo de processamento.
Provedores de LLM com suporte: Qwen (predefinição do sistema), Alibaba Cloud Model Studio, Tongyi Xingchen e modelos autodesenvolvidos compatíveis com OpenAI.
Alibaba Cloud Model Studio
Plataforma para desenvolvimento de grandes modelos e criação de aplicações. Conecte-se por meio do centro de Model ou do centro de Application.
Centro de Modelos: No Marketplace de Modelos, selecione um modelo e copie seu código para usar como ModelId.
Centro de Aplicações: Crie uma aplicação de agente no Alibaba Cloud Model Studio e obtenha o AppId.
Acesse a página de Gerenciamento de Chaves para criar e copiar uma chave de API.
Tongyi Xingchen
O Tongyi Xingchen permite criar agentes altamente personalizados com personas únicas, combináveis com interação de voz em tempo real baseada em avatar.
ModelId: O Tongyi Xingchen oferece cinco modelos:
xingchen-lite,xingchen-base,xingchen-plus,xingchen-plus-v2exingchen-max.Chave de API: Acesse o console do Tongyi Xingchen para criar e obter uma chave de API.
Modelo autodesenvolvido
Conecte seu grande modelo autodesenvolvido usando a especificação OpenAI.
Insira os seguintes parâmetros :
Parâmetro
Descrição
Exemplo
ModelId
Nome do modelo. Corresponde ao campo
modelna especificação OpenAI.abc
Chave de API
Credencial de autenticação da API. Corresponde ao campo
api_keyna especificação OpenAI.AUJH-pfnTNMPBm6iWXcJAcWsrscb5KYaLitQhHBLKrI
URL do Modelo (HTTPS)
Endpoint do serviço. Corresponde ao campo
base_urlna especificação OpenAI.http://www.abc.com
Consulte a Interface Padrão LLM.
Clique em Save para criar o fluxo de trabalho de mensagens interativas.
Etapa 2: Criar um agente de mensagens interativas
Faça login no console do Intelligent Media Service (IMS) e clique em Create AI Agent.
-
Configure as informações básicas e vincule um fluxo de trabalho de mensagens interativas.
Defina o Workflow Type como Interactive Messaging, selecione o fluxo de trabalho desejado na lista suspensa Workflow ID e configure a Interactive Messaging Application.
-
Crie uma Interactive Messaging Application.
NotaUma aplicação de mensagens interativas atua como uma ponte de comunicação que viabiliza os recursos de conversa.
Na caixa de diálogo Create Application, selecione uma Region (por exemplo, China (Shanghai)), insira um Application Name (2 a 16 caracteres), defina a Message Storage Duration (o padrão é 30 days), ative as opções Callback Settings e Security Audit conforme necessário e clique em Create.
Configure a Interactive Messaging Application e clique em Submit para criar o agente de mensagens interativas.
Etapa 3: Testar o agente
Após criar o agente, teste-o escaneando o QR code de demonstração.
-
Gere um QR code de demonstração no console.
No painel de navegação à esquerda, clique em AI Agents. Localize o agente desejado e clique em Demo QR Code na coluna Actions. Selecione um tempo de expiração (1 hour, 7 hours, 24 hours ou 3 days) e clique em Generate.
-
Escaneie o QR code com DingTalk, WeChat ou um navegador, ou copie a URL de demonstração no seu navegador para usar a demo H5.
Na caixa de diálogo Demo QR Code, o QR code do APP fica à esquerda e o QR code H5 à direita. A H5 Demo URL, o Experience Token e o Expiration Time aparecem na parte inferior.
Integração do agente
Reúna os seguintes parâmetros para integração. Para instruções detalhadas, consulte Integrar um agente de mensagens interativas.
-
Region ID: Região do seu fluxo de trabalho e agente. Encontre seu Region ID no seletor de regiões no canto superior esquerdo do console.
Nome da região
Region ID
China (Hangzhou)
cn-hangzhou
China (Shanghai)
cn-shanghai
China (Beijing)
cn-beijing
China (Shenzhen)
cn-shenzhen
Singapore
ap-southeast-1
-
AppId e AppKey da aplicação de mensagens interativas:
Na página de detalhes de Agent Management, localize o AppId associado no campo Interactive Messaging Application, dentro da seção Workflow Configuration.
Na página Application Management do console do ApsaraVideo Live, clique na aplicação desejada para abrir seu painel de detalhes. Localize os campos AppId e AppKey e clique no ícone de cópia ao lado deles para copiar seus valores.
AccessKey ID e AccessKey secret: Para obtê-los, consulte Criar um par de AccessKey.