Todos os produtos
Search
Central de documentação

Intelligent Media Services:Create an audio/video call agent

Última atualização: Jun 28, 2026

Configure um agente de IA conversacional em tempo real ao criar um workflow, vinculá-lo a um agente e testar o resultado.

Pré-requisitos

Antes de começar, verifique se os seguintes requisitos foram atendidos:

  • O recurso Real-time Conversational AI deve estar ativado. Para ativá-lo, acesse a página de compra.

Etapa 1: Criar um workflow de áudio/vídeo

  1. Faça login no console do Intelligent Media Service (IMS) e clique em Create Workflow Template.

  2. Selecione um tipo de workflow, como Audio Call, Avatar Call, Vision Call ou Video Call, e configure os nós do workflow.

    Speech-to-text

    Converte fala em texto com suporte a vários idiomas.

    Opções de Model Version: Preset ASR (recomendado para chinês-inglês misto, maior precisão), NLS-ASR (latência ultrabaixa), Qwen3-ASR-Realtime e Fun-ASR-Realtime. O Silent Time padrão é de 400 ms.

    • Preset: Com modelos predefinidos, selecione um modelo de idioma, defina um tempo de silêncio e configure hotwords personalizadas.

      • Model: Escolha um modelo de idioma adequado ao seu cenário.

      • Silent Time: Define quanto tempo o agente aguarda até que o usuário comece a falar.

      • Custom Hotword: Aumenta a precisão do reconhecimento para vocabulários específicos do domínio. Consulte Hotwords de reconhecimento de fala.

      • Sensitive Words: As palavras configuradas são automaticamente ocultadas com asteriscos (*) nas legendas do lado do cliente. Consulte Palavras sensíveis personalizadas.

    • Third-party Plug-in: Atualmente, é possível selecionar iFLYTEK. Para obter os parâmetros necessários, acesse o Ditado de Fala em Tempo Real da iFLYTEK.

    LLM

    O LLM processa a saída do STT para compreender e gerar respostas em linguagem natural.

    Configure a System Persona (função, objetivos, capacidades, requisitos de resposta e restrições; até 3.072 caracteres) e as Conversation Memory Rounds (0–30). Mais rodadas retêm mais contexto, mas podem aumentar o tempo de processamento.

    Provedores de LLM suportados: Qwen (predefinição do sistema), Alibaba Cloud Model Studio, Tongyi Xingchen e modelos desenvolvidos internamente compatíveis com OpenAI.

    Alibaba Cloud Model Studio

    Plataforma para desenvolvimento de grandes modelos e criação de aplicações. Conecte-se por meio do centro de Model ou do centro de Application.

    Tongyi Xingchen

    O Tongyi Xingchen permite criar agentes altamente personalizados com personas exclusivas, combináveis com interação de voz em tempo real baseada em avatar.

    • ModelId: O Tongyi Xingchen oferece cinco modelos: xingchen-lite, xingchen-base, xingchen-plus, xingchen-plus-v2 e xingchen-max.

    • API key: Acesse o console do Tongyi Xingchen para criar e obter uma chave de API.

    Modelo desenvolvido internamente

    Conecte seu grande modelo desenvolvido internamente usando a especificação OpenAI.

    Insira os seguintes parâmetros:

    Parâmetro

    Descrição

    Exemplo

    ModelId

    Nome do modelo. Corresponde ao campo model na especificação OpenAI.

    abc

    API key

    Credencial de autenticação da API. Corresponde ao campo api_key na especificação OpenAI.

    AUJH-pfnTNMPBm6iWXcJAcWsrscb5KYaLitQhHBLKrI

    Model URL (HTTPS)

    URL do endpoint de serviço. Corresponde ao campo base_url na especificação OpenAI.

    http://www.abc.com

    Consulte a Interface Padrão de LLM.

    Text-to-speech

    Converte o texto processado em áudio para que o usuário ouça a resposta do agente.

    No nó TTS, selecione a Version (Text-to-Speech 2.0 ou Text-to-Speech 1.0 (Legacy)), defina o Timbre (por exemplo, Yunfeng), ajuste o Volume (0–100) e visualize o áudio inserindo texto e clicando em Preview.

    • Escolha um modelo de text-to-speech adequado ao cenário da sua aplicação, incluindo Preset Template, Self-developed Template e Third-party Plug-in.

      • Modelo Predefinido do Sistema: Inclui System Default TTS, CosyVoice e Qwen3-TTS.

      • Modelo Desenvolvido Internamente: Integre seu próprio modelo via protocolo padrão. Consulte a Interface Padrão de TTS.

      • Plug-in de Terceiros: Apenas o MiniMax Speech Model é suportado. Utilize a versão mais recente. Consulte o MiniMax Speech Model.

    • O nó TTS também filtra o conteúdo recebido do LLM.

      Em Filter Settings, selecione os tipos de colchetes a serem filtrados: parênteses chineses(), parênteses ingleses (), colchetes chineses【】, colchetes ingleses [] e chaves inglesas {}.

    • Normalização de Texto: Converte números, símbolos e outros elementos do texto em um formato padronizado para melhorar a qualidade da fala sintetizada. Por exemplo, "120" é convertido em "um dois zero".

    Virtual Avatars

    Gera um fluxo de vídeo do avatar, sincronizando movimentos, expressões e lábios com o texto e o áudio.

    Configure o Node Name (gerado automaticamente). Tipos de entrada: Text Stream e Audio Stream. Tipo de saída: Video Stream.

    Atualmente, o nó de avatar suporta conexão a um Avatar Plug-in ou à Lingjing Digital Avatar Platform:

    • Avatar Plug-in:

      • Faceunity: Entre em contato com o atendimento ao cliente da Faceunity para ativar o serviço de avatar 3D e obter o AppID, AppKey e AvatarId.

    • Lingjing Digital Avatar Platform: Para integrar com a Lingjing Digital Avatar Platform, envie um ticket para ativar o serviço.

    Video Frame Extraction

    Extrai quadros de imagem de um fluxo de vídeo.

    Configure o Node Name (gerado automaticamente) e a Frame Extraction Frequency (1–30 quadros/segundo). Entrada: Video Stream. Saída: Image (Base64 format).

    Video Content Recognition

    Detecta comportamentos específicos no conteúdo de vídeo.

    Na configuração do Video Content Recognition Node, defina o Node Name e selecione as opções de Recognition Content: Still Frame Detection, Invalid Frame Recognition, Person Count, Head Movement Recognition, Electronic Device Recognition, Gaze Deviation Recognition e Custom Model Detection. Para Custom Model Detection, insira um Detection Task ID (até 100 caracteres: números, letras, hifens e sublinhados; hifens e sublinhados não podem estar no início ou no fim).

    Multi-modal LLM

    O MLLM processa imagens e texto de nós anteriores para gerar respostas em linguagem natural. Selecione Multimodal Model ou Text-to-Text Model como modo de entrada.

    Configure a System Persona (função, objetivos, capacidades, restrições; até 3.072 caracteres) e as Conversation Memory Rounds (1–30). Mais rodadas retêm mais contexto, mas podem aumentar o tempo de processamento.

    Alibaba Cloud Model Studio

    Plataforma para desenvolvimento de grandes modelos e criação de aplicações. Conecte-se por meio do centro de Model ou do centro de Application.

    Tongyi Xingchen

    O Tongyi Xingchen permite criar agentes altamente personalizados com personas exclusivas, combináveis com interação de voz em tempo real baseada em avatar.

    • ModelId: O Tongyi Xingchen oferece cinco modelos: xingchen-lite, xingchen-base, xingchen-plus, xingchen-plus-v2 e xingchen-max.

    • API key: Acesse o console do Tongyi Xingchen para criar e obter uma chave de API.

    Modelo desenvolvido internamente

    Conecte seu grande modelo desenvolvido internamente usando a especificação OpenAI.

    Especificação OpenAI: Insira os seguintes parâmetros:

    Parâmetro

    Tipo

    Obrigatório

    Descrição

    Exemplo

    ModelId

    String

    Sim

    Nome do modelo. Corresponde ao campo model na especificação OpenAI.

    abc

    API-KEY

    String

    Sim

    Informações de autenticação. Corresponde ao campo api_key na especificação OpenAPI.

    AUJH-pfnTNMPBm6iWXcJAcWsrscb5KYaLitQhHBLKrI

    Model URL (HTTPS)

    String

    Sim

    URL de solicitação do serviço. Corresponde ao campo base_url na especificação OpenAPI.

    http://www.abc.com

    Maximum Number of Images per Call

    Integer

    Sim

    Alguns MLLMs limitam o número de quadros de imagem por solicitação. Defina este parâmetro para corresponder ao limite do modelo. Os quadros de vídeo são amostrados automaticamente com base neste valor.

    15

    Consulte a Interface Padrão de MLLM.

  3. Clique em Save para criar o workflow de áudio/vídeo.

Etapa 2: Criar um agente de áudio/vídeo

  1. Faça login no console do Intelligent Media Service (IMS) e clique em Create AI Agent.

  2. Configure as informações básicas e vincule um workflow de áudio/vídeo em tempo real.

    1. Vincule um workflow de áudio/vídeo que o agente seguirá.

      Defina o Workflow Type (Audio Call, Avatar Call, Vision Call, Message-based Conversation ou Video Call) e selecione o workflow na lista suspensa Workflow ID.

    2. Selecione uma aplicação existente do ApsaraVideo Real-time Communication (ARTC) em sua conta. Caso não exista nenhuma, o sistema poderá criar uma automaticamente. Consulte a Introdução ao ApsaraVideo Real-time Communication.

      Nota

      O Real-time Conversational AI depende de uma aplicação ARTC como ponte de comunicação para as conversas.

    3. Para workflows de Audio Call, faça upload de uma imagem personalizada exibida durante as chamadas.

      Ative Custom Agent Image, defina Image Source como Specify Image URI ou Upload Image e forneça a imagem. Formatos suportados: GIF, PNG, JPG (máximo de 3 MB).

  3. Clique em Submit para criar o agente de áudio/vídeo.

Etapa 3: Testar o agente

Após criar o agente, teste-o escaneando o QR code de demonstração.

  1. Gere um QR code de demonstração no console.

    No painel de navegação à esquerda, clique em AI Agents. Localize o agente desejado e clique em Demo QR Code na coluna Actions. Selecione um tempo de expiração (1 hour, 7 hours, 24 hours ou 3 days) e clique em Generate.

  2. Escaneie o QR code com DingTalk, WeChat ou um navegador, ou copie a URL de demonstração no navegador para usar a demo H5.

    Na caixa de diálogo Demo QR Code, o QR code do APP fica à esquerda e o QR code H5 à direita. A H5 Demo URL, o Experience Token e o Expiration Time aparecem na parte inferior.

Integrar o agente

Reúna os seguintes parâmetros para integrar o agente ao seu projeto. Consulte Integrar um agente de áudio/vídeo.

  • Region ID: Região do seu workflow e agente. Encontre seu Region ID no seletor de região no canto superior esquerdo do console.

    Nome da região

    Region ID

    China (Hangzhou)

    cn-hangzhou

    China (Shanghai)

    cn-shanghai

    China (Beijing)

    cn-beijing

    China (Shenzhen)

    cn-shenzhen

    Singapura

    ap-southeast-1

  • O AppId e a AppKey da aplicação ARTC.

    Na página AI Agents, clique em Basic Information. Em Workflow Configuration, localize o RTC AppID no campo ApsaraVideo Real-time Communication (ARTC) Application.

    No console do ApsaraVideo Live, acesse Live+ > ApsaraVideo Real-time Communication > Application Management. Clique na aplicação desejada e copie os valores em Basic Information.

  • AccessKey ID e AccessKey secret: Para obtê-los, consulte Criar um par de AccessKey.