Todos os produtos
Search
Central de documentação

Intelligent Media Services:AIAgentConfig

Última atualização: Jun 29, 2026

Parâmetro

Tipo

Descrição

Exemplo

object

Os parâmetros para o modelo de agente de IA.

Greeting

string

A mensagem de boas-vindas que o agente de IA reproduz ao ingressar na sessão. As alterações se aplicam às sessões subsequentes. Se omitido, nenhuma mensagem de boas-vindas é reproduzida.

你好

WakeUpQuery

string

Um comando fornecido pelo usuário ao qual o agente de IA responde imediatamente após o início da chamada.

今天天气怎么样?

MaxIdleTime

integer

A duração máxima de inatividade em segundos antes que o agente de IA se desconecte. Se o agente não receber nenhuma interação do usuário dentro desse período, ele encerra a tarefa. Valor padrão: 600.

600

UserOnlineTimeout

integer

A duração em segundos que o agente de IA aguarda um usuário ingressar. Se o usuário não ingressar dentro desse tempo, o agente encerra a tarefa. Valor padrão: 60.

60

UserOfflineTimeout

integer

A duração em segundos que o agente de IA aguarda antes de encerrar a tarefa após um usuário sair da sessão. Valor padrão: 5.

5

EnablePushToTalk

boolean

Especifica se o modo push-to-talk deve ser ativado. Valor padrão: false.

false

GracefulShutdown

boolean

Especifica se o desligamento gracioso deve ser ativado. Valor padrão: false.

Se ativado, o agente de IA conclui sua fala atual antes de se desconectar quando a tarefa é interrompida. O agente não falará por mais de 10 segundos.

false

Volume

integer

O volume de fala do agente de IA.

  • Se não definido, o modo de volume adaptativo recomendado pela Alibaba Cloud é usado por padrão.

  • Se definido, o valor deve estar no intervalo de 0 a 400. O volume de saída final é calculado como: (Volume do workflow) * (volume / 100). Por exemplo:

  1. Se volume for 0, o volume de saída é 0.

  2. Se volume for 100, o volume de saída é o mesmo que o volume original.

  3. Se volume for 200, o volume de saída é o dobro do volume original.

100

WorkflowOverrideParams

string

Uma string JSON contendo parâmetros para substituir a configuração padrão do workflow.

{}

AvatarUrl

string

A URL do avatar a ser exibido durante chamadas de voz. Se omitido, nenhum avatar é exibido.

http://example.com/a.jpg

AvatarUrlType

string

O tipo da URL do avatar. Por padrão, este parâmetro não é definido.

USER

EnableIntelligentSegment

boolean

Especifica se a segmentação inteligente deve ser ativada. Quando ativada, falas curtas do usuário são mescladas em uma única sentença. Valor padrão: true.

true

AsrConfig

object

Configuração para reconhecimento automático de fala (ASR).

AsrLanguageId

string

O idioma para ASR. Valores válidos:

  • zh_mandarin: Chinês (Mandarim)

  • en: Inglês

  • zh_en: Chinês-Inglês misto

  • es: Espanhol

  • jp: Japonês

zh_mandarin

AsrMaxSilence

integer

A duração máxima de silêncio em milissegundos antes que o mecanismo ASR finalize uma enunciação. Uma pausa maior que esse valor sinaliza uma quebra de sentença. Intervalo: 200–1200. Valor padrão: 400.

400

AsrHotWords

array

Uma lista de hotwords para melhorar a precisão do ASR. Você pode especificar no máximo 128 hotwords.

string

Uma string de hotword. Comprimento: 1 a 10 caracteres.

检查

VadLevel

integer

O limiar de Detecção de Atividade de Voz (VAD) para interrupções. Intervalo: 0–11. Valor padrão: 11.

  • 0: Desativa o VAD.

  • 110: Define a sensibilidade de interrupção. Um valor mais alto torna o agente mais difícil de interromper.

  • 11: Um modo aprimorado com menor distorção de áudio e maior resistência a ruídos.

11

CustomParams

string

Parâmetros de passagem para integrações ASR proprietárias.

mode=fast&sample=16000&format=wav

VadDuration

integer

A duração mínima em milissegundos de fala contínua do usuário necessária para acionar uma interrupção. Isso controla a sensibilidade de interrupção. Um valor de 0 desativa esse recurso. Intervalo: 200–2000. Um intervalo comum é de 200–500 ms, que normalmente corresponde a 1 a 4 caracteres chineses. Se omitido, esse recurso é desativado.

300

TtsConfig

object

Configuração para conversão de texto em fala (TTS).

VoiceId

string

O ID da voz TTS predefinida. As alterações se aplicam à próxima enunciação. Se omitido, a voz do modelo de agente de IA é usada. O ID pode ter no máximo 64 caracteres. Para vozes disponíveis, consulte Amostras de Voz Inteligente.

longcheng_v2

VoiceIdList

array

Uma lista de vozes disponíveis.

string

Uma voz.

zhixiaoxia

PronunciationRules

array

Uma lista de regras de pronúncia TTS, executadas em ordem. Você pode especificar no máximo 20 regras.

object

Uma regra de pronúncia TTS.

Word

string

The word to be replaced. It must be 1 to 9 Chinese characters long and cannot contain spaces.

一一零

Pronunciation

string

The replacement pronunciation. It must be 1 to 9 Chinese characters long and cannot contain spaces.

幺幺零

Type

string

The type of pronunciation rule. Valid value:

  • replacement: Replaces the specified Word with the Pronunciation.

replacement

ModelId

string

Este parâmetro se aplica apenas ao provedor Minimax. Valores válidos: speech-01-turbo, speech-02-turbo

speech-01-turbo

LanguageId

string

Este parâmetro é apenas para o provedor Minimax. Ele melhora o reconhecimento para idiomas e dialetos específicos de baixo recurso. Se o idioma for desconhecido, defina como auto para detecção automática. Por padrão, este parâmetro não é definido. Os valores suportados incluem:

Idiomas suportados

  • Chinese

  • Chinese,Yue: Cantonese

  • English

  • Arabic

  • Russian

  • Spanish

  • French

  • Portuguese

  • German

  • Turkish

  • Dutch

  • Ukrainian

  • Vietnamese

  • Indonesian

  • Japanese

  • Italian

  • Korean

  • Thai

  • Polish

  • Romanian

  • Greek

  • Czech

  • Finnish

  • Hindi

  • auto

Chinese

Emotion

string

Este parâmetro se aplica apenas ao provedor Minimax. As emoções suportadas incluem:

  • happy

  • sad

  • angry

  • fearful

  • disgusted

  • surprised

  • calm

happy

SpeechRate

number

A velocidade da fala, onde o valor 1.0 é a velocidade normal. O intervalo suportado pode variar por provedor. Para CosyVoice, o intervalo é de 0.5 a 2.0 (padrão: 1.0). Para Minimax, o intervalo é de 0.5 a 2.0 (padrão: 1.0).

1.0

LlmConfig

object

Configuração para o modelo de linguagem grande (LLM).

LlmHistory

array

O contexto do histórico de conversação para o LLM/MLLM.

object

Um único turno de conversação.

Role

string

The role of the participant in the conversation. Valid values:

  • user

  • assistant

  • system

  • function

  • plugin

  • tool

user

Content

string

The text content of the message from this role.

你好

LlmHistoryLimit

integer

O número máximo de turnos de conversação recentes a incluir no contexto do LLM/MLLM. Valor padrão: 10.

10

LlmSystemPrompt

string

O prompt de sistema para o LLM após o início da chamada.

你是一位友好且乐于助人的助手,专注于为用户提供准确的信息和建议。

BailianAppParams

string

Parâmetros para o Alibaba Cloud Model Studio, fornecidos como uma string JSON. Para o formato dos parâmetros, consulte Parâmetros do Alibaba Cloud Model Studio

"{\"biz_params\":{\"user_defined_params\":{\"your_plugin_id\":{\"article_index\":2}}},\"memory_id\":\"your_memory_id\",\"image_list\":[\"https://your_image_url\"],\"rag_options\":{\"pipeline_ids\":[\"your_id\"],\"file_ids\":[\"文档ID1\",\"文档ID2\"],\"metadata_filter\":{\"name\":\"张三\"},\"structured_filter\":{\"key1\":\"value1\",\"key2\":\"value2\"},\"tags\":[\"标签1\",\"标签2\"]}}"

OpenAIExtraQuery

string

Parâmetros de consulta adicionais para um LLM compatível com OpenAI. Os parâmetros devem ser fornecidos como uma string de consulta de URL (por exemplo, key1=value1&key2=value2). Todos os valores devem ser strings.

api-version=2024-02-01&api-key=sk-xxx

LlmCompleteReply

boolean

Quando definido como true, o agente envia a resposta completa do LLM em uma única mensagem após ser totalmente gerada, em vez de transmiti-la em streaming. Essa configuração não afeta o streaming de legendas.

true

FunctionMap

array

Mapeia funções integradas do agente para funções LLM personalizadas. Atualmente, isso suporta apenas chamadas de função para LLMs personalizados compatíveis com OpenAI.

object

Uma única regra de mapeamento.

Function

string

The name of a built-in function provided by the AI agent system. Currently, only hangup is supported.

hangup

MatchFunction

string

The name of the custom LLM function that maps to the agent's built-in function. For details on the custom LLM protocol, see LLM Standard Interface.

hangup

OutputMinLength

integer

O número mínimo de caracteres em um bloco de texto antes de ser enviado ao mecanismo TTS. Blocos menores são armazenados em buffer. Intervalo: 0–100. Um valor de 0 ou a omissão deste parâmetro desativa o buffer. Valor padrão: não definido.

5

OutputMaxDelay

integer

O atraso máximo em milissegundos antes que o texto armazenado em buffer seja enviado ao mecanismo TTS, mesmo que OutputMinLength não seja atingido. Intervalo: 1000–10000. Um valor de 0 ou a omissão deste parâmetro desativa o limite de atraso. Valor padrão: não definido.

2000

HistorySyncWithTTS

boolean

Especifica se o histórico de mensagens do LLM é sincronizado com o conteúdo reproduzido pelo TTS. Valor padrão: false. Quando ativado, as mensagens salvas do LLM correspondem ao conteúdo realmente reproduzido pelo TTS.

Nota

Quando um usuário interrompe o agente, a tag <ims_agent_interrupted> é inserida no histórico de mensagens no ponto de interrupção. Isso afeta a próxima mensagem enviada ao LLM. Por exemplo:

[
  {"role": "user", "content": "Tell me a story."},
  {"role": "assistant", "content": "Okay, I can tell you a story about the Three Kingdoms. Would you<ims_agent_interrupted> like that?"},
  {"role": "user", "content": "Tell me a different one."}
]

false

AvatarConfig

object

Configuração para o avatar. Isso só entra em vigor se o workflow incluir um nó de avatar.

AvatarId

string

O ID do modelo do avatar.

5257

InterruptConfig

object

Configuração para a política de interrupção de fala.

EnableVoiceInterrupt

boolean

Especifica se a interrupção por fala deve ser ativada. Valor padrão: true.

true

InterruptWords

array

Uma lista de palavras ou frases específicas que acionam uma interrupção.

string

Uma palavra ou frase específica que aciona uma interrupção.

打断一下

NoInterruptMode

string

Especifica como lidar com a fala do usuário que ocorre durante uma seção não interrompível da enunciação do agente.

  • cache: Armazena em cache a fala do usuário e a processa no próximo turno de conversação.

  • discard: Descarta a fala do usuário.

Valor padrão: cache.

cache

KeepInterruptWordsForLLM

boolean

Especifica se as palavras de interrupção devem ser incluídas no texto enviado ao LLM. Valor padrão: false (as palavras são descartadas).

Nota

Por exemplo, se "espere" é uma palavra de interrupção e o usuário diz "espere, como está o tempo hoje?", definir como false resulta em apenas "como está o tempo hoje?" sendo enviado ao LLM.

true

VoiceprintConfig

object

Configuração para reconhecimento de impressão vocal.

UseVoiceprint

boolean

Especifica se o reconhecimento de impressão vocal deve ser ativado. Valor padrão: false. Se definido como true, você também deve fornecer um VoiceprintId válido.

false

VoiceprintId

string

O identificador exclusivo da impressão vocal. Não é definido por padrão. O ID deve corresponder a uma impressão vocal registrada usando a API de registro de impressão vocal. Para mais informações, consulte Registrar uma impressão vocal.

zhixiaoxia

RegistrationMode

string

O modo de registro de impressão vocal. Valor padrão: Explicit.

ValorDescrição
ExplicitNo modo Explicit, o usuário deve registrar sua impressão vocal antecipadamente usando a API de registro de impressão vocal.
ImplicitNo modo Implicit, o sistema coleta automaticamente a fala do usuário durante a conversação para registrar uma impressão vocal.

Explicit

TurnDetectionConfig

object

Configuração para detecção de turnos de conversação.

TurnEndWords

array

Uma lista de palavras-chave usadas para determinar o fim do turno de conversação de um usuário.

string

Uma palavra-chave usada para determinar o fim do turno de conversação de um usuário.

我说完了

Mode

string

O modo de detecção de turno de conversação.

  • Normal (Padrão): O agente depende de pausas para detectar o fim do turno do usuário.

  • Semantic: O agente usa IA para analisar o contexto da conversação e determinar se o usuário terminou de falar.

Semantic

SemanticWaitDuration

integer

O tempo de detecção de pausa no modo IA, em milissegundos. Valor padrão: -1.

  • -1: A IA determina automaticamente um tempo de espera adequado.

  • 0–10000: Um tempo de espera personalizado. Um intervalo de 0–1500 ms é recomendado.

Nota

Este parâmetro não tem efeito no modo Normal.

-1

Eagerness

string

Controla a velocidade de resposta do agente após detectar uma pausa do usuário. Este parâmetro se aplica apenas no modo Semantic. Uma configuração mais alta resulta em uma resposta mais rápida, mas aumenta o risco de interromper o usuário:

  • Low: Aguarda pacientemente com um tempo máximo de espera de 6 segundos, reduzindo o risco de interrupção.

  • Medium: Um tempo de espera equilibrado (até 4 segundos), adequado para a maioria dos cenários.

  • High: Responde rapidamente (até 2 segundos), o que melhora a velocidade, mas pode aumentar o risco de tomada de turno incorreta.

Este campo é vazio por padrão.

High

ExperimentalConfig

string

Parâmetros para recursos experimentais. Entre em contato com o suporte para assistência.

""

VcrConfig

object

Configuração para reconhecimento de conteúdo de vídeo. Isso permite que o sistema envie callbacks ao cliente sobre eventos detectados no fluxo de vídeo.

StillFrameMotion

object

Configuração para detecção de quadro estático.

Enabled

boolean

Specifies whether to enable still frame detection. Default: false.

false

CallbackDelay

integer

The duration in milliseconds that a frame must remain still before a notification is sent. If not specified, the setting from the console is used. Range: 200–5000.

3000

InvalidFrameMotion

object

Configuração para detecção de quadro inválido.

Enabled

boolean

Specifies whether to enable invalid frame detection.

false

CallbackDelay

integer

The duration in milliseconds that an invalid frame must persist before a notification is sent. If not specified, the setting from the console is used. Range: 200–5000.

3000

PeopleCount

object

Configuração para o recurso de contagem de pessoas.

Enabled

boolean

Specifies whether to enable people counting. Default: false.

false

Equipment

object

Configuração para identificação de dispositivos.

Enabled

boolean

Specifies whether to enable device identification. Default: false.

false

HeadMotion

object

Configuração para detecção de movimento da cabeça.

Enabled

boolean

Specifies whether to enable head motion detection. Default: false.

false

LookAway

object

Configuração para detecção de desvio de olhar.

Enabled

boolean

Specifies whether to enable look-away detection. Default: false.

true

AmbientSoundConfig

object

Configuração para som ambiente durante a chamada.

ResourceId

string

O ID do recurso de som ambiente. Você pode obter esse ID nas configurações avançadas da configuração do agente no console.

f67901c595834************

Volume

integer

O volume do som ambiente. Intervalo: 0–100. Um valor de 0 desativa o som.

50

AutoSpeechConfig

object

Configuração para a fala automática do agente, incluindo prompts para latência do LLM e longos períodos de silêncio do usuário.

UserIdle

object

Configuração para prompts a serem reproduzidos quando o usuário permanece em silêncio por um período prolongado.

WaitTime

integer

The silence duration threshold in milliseconds. If the user is silent for longer than this period, a prompt is triggered. Range: 5000–600000. This is a required field.

5000

MaxRepeats

integer

The maximum number of times the prompt can be repeated. Range: 0–10. This is a required field. If the limit is exceeded, the call is terminated.

5

Messages

array

A collection of prompt messages. A maximum of 10 messages are supported, each up to 100 characters. The sum of all probabilities must be 100%.

object

The structure of a prompt message.

Text

string

The text of the prompt message, up to 100 characters.

您还在吗?

Probability

number

The probability of this message being selected. Range: 0–1, corresponding to 0%–100%.

0.5

HangupEndWord

string

A farewell message played before hanging up due to user inactivity.

我挂了,再见

LlmPending

object

Configuração para prompts a serem reproduzidos durante a latência de resposta do LLM.

WaitTime

integer

The wait time threshold for LLM responses. If the threshold is exceeded, a prompt is played. This is a required field. Unit: ms. Range: 500–10000. Set this value based on the actual performance of your LLM.

3000

Mode

string

The mode for handling LLM latency prompts. random: Plays a random message from the list. sequence: Plays messages in order. This is a required field.

Messages

array

A collection of prompt messages. A maximum of 10 messages are supported, each up to 100 characters. The sum of all probabilities must be 100%.

object

The structure of a prompt message.

Text

string

The text of the prompt message, up to 100 characters.

稍等一下

Probability

number

The probability of this message being selected. Range: 0–1, corresponding to 0%–100%.

0.5

BackChannelingConfigs

array

Configuração para back-channeling. Quando ativado, o sistema reproduz frases curtas e responsivas em pontos de gatilho específicos.

object

Uma única configuração de back-channeling.

Enabled

boolean

Especifica se esta regra de back-channeling deve ser ativada. Este é um campo obrigatório.

true

TriggerStage

string

O gatilho para o back-channeling. Valor válido:

  • pause_detected: Acionado quando uma pausa curta na fala é detectada.

pause_detected

Probability

number

A probabilidade de acionamento. Intervalo: 0.0–1.0. Este é um campo obrigatório.

0.5

Words

array

Uma coleção de frases de confirmação. Você pode especificar no máximo 10 frases. Cada frase deve ter 20 caracteres ou menos, e a soma de suas probabilidades deve ser 1.0.

object

Configuração para uma frase responsiva.

Text

string

短语文本,长度 ≤ 20 字符,支持多语言。必填。

嗯嗯

Probability

number

本短语的触发概率,范围 0.0–1.0,必填。

0.3

BackChannelingConfig

array

Importante

Obsoleto. Use BackChannelingConfigs.

object

Uma única configuração de back-channeling.

Enabled

boolean

Especifica se o recurso de back-channeling deve ser ativado. Campo obrigatório, valores: true/false.

true

TriggerStage

string

O momento de acionamento do back-channeling. Valores válidos:

  • pause_detected (detectada uma pausa curta na fala)

pause_detected

Probability

number

A probabilidade de acionamento do recurso. Intervalo: 0.0–1.0. Campo obrigatório.

0.5

Words

array

Coleção de frases de back-channeling. No máximo 10, cada frase com comprimento ≤ 20 caracteres, soma das probabilidades igual a 1.0.

object

Configuração de frase de back-channeling.

Text

string

短语文本,长度 ≤ 20 字符,支持多语言。必填。

嗯嗯

Probability

number

本短语的触发概率,范围 0.0–1.0,必填。

0.3