|
Parâmetro |
Tipo |
Descrição |
Exemplo |
||||||
|---|---|---|---|---|---|---|---|---|---|
|
object |
Os parâmetros para o modelo de agente de IA. |
||||||||
| Greeting |
string |
A mensagem de boas-vindas que o agente de IA reproduz ao ingressar na sessão. As alterações se aplicam às sessões subsequentes. Se omitido, nenhuma mensagem de boas-vindas é reproduzida. |
你好 |
||||||
| WakeUpQuery |
string |
Um comando fornecido pelo usuário ao qual o agente de IA responde imediatamente após o início da chamada. |
今天天气怎么样? |
||||||
| MaxIdleTime |
integer |
A duração máxima de inatividade em segundos antes que o agente de IA se desconecte. Se o agente não receber nenhuma interação do usuário dentro desse período, ele encerra a tarefa. Valor padrão: 600. |
600 |
||||||
| UserOnlineTimeout |
integer |
A duração em segundos que o agente de IA aguarda um usuário ingressar. Se o usuário não ingressar dentro desse tempo, o agente encerra a tarefa. Valor padrão: 60. |
60 |
||||||
| UserOfflineTimeout |
integer |
A duração em segundos que o agente de IA aguarda antes de encerrar a tarefa após um usuário sair da sessão. Valor padrão: 5. |
5 |
||||||
| EnablePushToTalk |
boolean |
Especifica se o modo push-to-talk deve ser ativado. Valor padrão: |
false |
||||||
| GracefulShutdown |
boolean |
Especifica se o desligamento gracioso deve ser ativado. Valor padrão: Se ativado, o agente de IA conclui sua fala atual antes de se desconectar quando a tarefa é interrompida. O agente não falará por mais de 10 segundos. |
false |
||||||
| Volume |
integer |
O volume de fala do agente de IA.
|
100 |
||||||
| WorkflowOverrideParams |
string |
Uma string JSON contendo parâmetros para substituir a configuração padrão do workflow. |
{} |
||||||
| AvatarUrl |
string |
A URL do avatar a ser exibido durante chamadas de voz. Se omitido, nenhum avatar é exibido. |
http://example.com/a.jpg |
||||||
| AvatarUrlType |
string |
O tipo da URL do avatar. Por padrão, este parâmetro não é definido. |
USER |
||||||
| EnableIntelligentSegment |
boolean |
Especifica se a segmentação inteligente deve ser ativada. Quando ativada, falas curtas do usuário são mescladas em uma única sentença. Valor padrão: |
true |
||||||
| AsrConfig |
object |
Configuração para reconhecimento automático de fala (ASR). |
|||||||
| AsrLanguageId |
string |
O idioma para ASR. Valores válidos:
|
zh_mandarin |
||||||
| AsrMaxSilence |
integer |
A duração máxima de silêncio em milissegundos antes que o mecanismo ASR finalize uma enunciação. Uma pausa maior que esse valor sinaliza uma quebra de sentença. Intervalo: 200–1200. Valor padrão: 400. |
400 |
||||||
| AsrHotWords |
array |
Uma lista de hotwords para melhorar a precisão do ASR. Você pode especificar no máximo 128 hotwords. |
|||||||
|
string |
Uma string de hotword. Comprimento: 1 a 10 caracteres. |
检查 |
|||||||
| VadLevel |
integer |
O limiar de Detecção de Atividade de Voz (VAD) para interrupções. Intervalo: 0–11. Valor padrão: 11.
|
11 |
||||||
| CustomParams |
string |
Parâmetros de passagem para integrações ASR proprietárias. |
mode=fast&sample=16000&format=wav |
||||||
| VadDuration |
integer |
A duração mínima em milissegundos de fala contínua do usuário necessária para acionar uma interrupção. Isso controla a sensibilidade de interrupção. Um valor de 0 desativa esse recurso. Intervalo: 200–2000. Um intervalo comum é de 200–500 ms, que normalmente corresponde a 1 a 4 caracteres chineses. Se omitido, esse recurso é desativado. |
300 |
||||||
| TtsConfig |
object |
Configuração para conversão de texto em fala (TTS). |
|||||||
| VoiceId |
string |
O ID da voz TTS predefinida. As alterações se aplicam à próxima enunciação. Se omitido, a voz do modelo de agente de IA é usada. O ID pode ter no máximo 64 caracteres. Para vozes disponíveis, consulte Amostras de Voz Inteligente. |
longcheng_v2 |
||||||
| VoiceIdList |
array |
Uma lista de vozes disponíveis. |
|||||||
|
string |
Uma voz. |
zhixiaoxia |
|||||||
| PronunciationRules |
array |
Uma lista de regras de pronúncia TTS, executadas em ordem. Você pode especificar no máximo 20 regras. |
|||||||
|
object |
Uma regra de pronúncia TTS. |
||||||||
| Word |
string |
The word to be replaced. It must be 1 to 9 Chinese characters long and cannot contain spaces. |
一一零 |
||||||
| Pronunciation |
string |
The replacement pronunciation. It must be 1 to 9 Chinese characters long and cannot contain spaces. |
幺幺零 |
||||||
| Type |
string |
The type of pronunciation rule. Valid value:
|
replacement |
||||||
| ModelId |
string |
Este parâmetro se aplica apenas ao provedor Minimax. Valores válidos:
|
speech-01-turbo |
||||||
| LanguageId |
string |
Este parâmetro é apenas para o provedor Minimax. Ele melhora o reconhecimento para idiomas e dialetos específicos de baixo recurso. Se o idioma for desconhecido, defina como |
Chinese |
||||||
| Emotion |
string |
Este parâmetro se aplica apenas ao provedor Minimax. As emoções suportadas incluem:
|
happy |
||||||
| SpeechRate |
number |
A velocidade da fala, onde o valor 1.0 é a velocidade normal. O intervalo suportado pode variar por provedor. Para CosyVoice, o intervalo é de 0.5 a 2.0 (padrão: 1.0). Para Minimax, o intervalo é de 0.5 a 2.0 (padrão: 1.0). |
1.0 |
||||||
| LlmConfig |
object |
Configuração para o modelo de linguagem grande (LLM). |
|||||||
| LlmHistory |
array |
O contexto do histórico de conversação para o LLM/MLLM. |
|||||||
|
object |
Um único turno de conversação. |
||||||||
| Role |
string |
The role of the participant in the conversation. Valid values:
|
user |
||||||
| Content |
string |
The text content of the message from this role. |
你好 |
||||||
| LlmHistoryLimit |
integer |
O número máximo de turnos de conversação recentes a incluir no contexto do LLM/MLLM. Valor padrão: 10. |
10 |
||||||
| LlmSystemPrompt |
string |
O prompt de sistema para o LLM após o início da chamada. |
你是一位友好且乐于助人的助手,专注于为用户提供准确的信息和建议。 |
||||||
| BailianAppParams |
string |
Parâmetros para o Alibaba Cloud Model Studio, fornecidos como uma string JSON. Para o formato dos parâmetros, consulte Parâmetros do Alibaba Cloud Model Studio |
"{\"biz_params\":{\"user_defined_params\":{\"your_plugin_id\":{\"article_index\":2}}},\"memory_id\":\"your_memory_id\",\"image_list\":[\"https://your_image_url\"],\"rag_options\":{\"pipeline_ids\":[\"your_id\"],\"file_ids\":[\"文档ID1\",\"文档ID2\"],\"metadata_filter\":{\"name\":\"张三\"},\"structured_filter\":{\"key1\":\"value1\",\"key2\":\"value2\"},\"tags\":[\"标签1\",\"标签2\"]}}" |
||||||
| OpenAIExtraQuery |
string |
Parâmetros de consulta adicionais para um LLM compatível com OpenAI. Os parâmetros devem ser fornecidos como uma string de consulta de URL (por exemplo, |
api-version=2024-02-01&api-key=sk-xxx |
||||||
| LlmCompleteReply |
boolean |
Quando definido como |
true |
||||||
| FunctionMap |
array |
Mapeia funções integradas do agente para funções LLM personalizadas. Atualmente, isso suporta apenas chamadas de função para LLMs personalizados compatíveis com OpenAI. |
|||||||
|
object |
Uma única regra de mapeamento. |
||||||||
| Function |
string |
The name of a built-in function provided by the AI agent system. Currently, only |
hangup |
||||||
| MatchFunction |
string |
The name of the custom LLM function that maps to the agent's built-in function. For details on the custom LLM protocol, see LLM Standard Interface. |
hangup |
||||||
| OutputMinLength |
integer |
O número mínimo de caracteres em um bloco de texto antes de ser enviado ao mecanismo TTS. Blocos menores são armazenados em buffer. Intervalo: 0–100. Um valor de |
5 |
||||||
| OutputMaxDelay |
integer |
O atraso máximo em milissegundos antes que o texto armazenado em buffer seja enviado ao mecanismo TTS, mesmo que OutputMinLength não seja atingido. Intervalo: 1000–10000. Um valor de |
2000 |
||||||
| HistorySyncWithTTS |
boolean |
Especifica se o histórico de mensagens do LLM é sincronizado com o conteúdo reproduzido pelo TTS. Valor padrão: Nota
Quando um usuário interrompe o agente, a tag |
false |
||||||
| AvatarConfig |
object |
Configuração para o avatar. Isso só entra em vigor se o workflow incluir um nó de avatar. |
|||||||
| AvatarId |
string |
O ID do modelo do avatar. |
5257 |
||||||
| InterruptConfig |
object |
Configuração para a política de interrupção de fala. |
|||||||
| EnableVoiceInterrupt |
boolean |
Especifica se a interrupção por fala deve ser ativada. Valor padrão: |
true |
||||||
| InterruptWords |
array |
Uma lista de palavras ou frases específicas que acionam uma interrupção. |
|||||||
|
string |
Uma palavra ou frase específica que aciona uma interrupção. |
打断一下 |
|||||||
| NoInterruptMode |
string |
Especifica como lidar com a fala do usuário que ocorre durante uma seção não interrompível da enunciação do agente.
Valor padrão: |
cache |
||||||
| KeepInterruptWordsForLLM |
boolean |
Especifica se as palavras de interrupção devem ser incluídas no texto enviado ao LLM. Valor padrão: Nota
Por exemplo, se "espere" é uma palavra de interrupção e o usuário diz "espere, como está o tempo hoje?", definir como |
true |
||||||
| VoiceprintConfig |
object |
Configuração para reconhecimento de impressão vocal. |
|||||||
| UseVoiceprint |
boolean |
Especifica se o reconhecimento de impressão vocal deve ser ativado. Valor padrão: |
false |
||||||
| VoiceprintId |
string |
O identificador exclusivo da impressão vocal. Não é definido por padrão. O ID deve corresponder a uma impressão vocal registrada usando a API de registro de impressão vocal. Para mais informações, consulte Registrar uma impressão vocal. |
zhixiaoxia |
||||||
| RegistrationMode |
string |
O modo de registro de impressão vocal. Valor padrão:
|
Explicit |
||||||
| TurnDetectionConfig |
object |
Configuração para detecção de turnos de conversação. |
|||||||
| TurnEndWords |
array |
Uma lista de palavras-chave usadas para determinar o fim do turno de conversação de um usuário. |
|||||||
|
string |
Uma palavra-chave usada para determinar o fim do turno de conversação de um usuário. |
我说完了 |
|||||||
| Mode |
string |
O modo de detecção de turno de conversação.
|
Semantic |
||||||
| SemanticWaitDuration |
integer |
O tempo de detecção de pausa no modo IA, em milissegundos. Valor padrão: -1.
Nota
Este parâmetro não tem efeito no modo |
-1 |
||||||
| Eagerness |
string |
Controla a velocidade de resposta do agente após detectar uma pausa do usuário. Este parâmetro se aplica apenas no modo
Este campo é vazio por padrão. |
High |
||||||
| ExperimentalConfig |
string |
Parâmetros para recursos experimentais. Entre em contato com o suporte para assistência. |
"" |
||||||
| VcrConfig |
object |
Configuração para reconhecimento de conteúdo de vídeo. Isso permite que o sistema envie callbacks ao cliente sobre eventos detectados no fluxo de vídeo. |
|||||||
| StillFrameMotion |
object |
Configuração para detecção de quadro estático. |
|||||||
| Enabled |
boolean |
Specifies whether to enable still frame detection. Default: |
false |
||||||
| CallbackDelay |
integer |
The duration in milliseconds that a frame must remain still before a notification is sent. If not specified, the setting from the console is used. Range: 200–5000. |
3000 |
||||||
| InvalidFrameMotion |
object |
Configuração para detecção de quadro inválido. |
|||||||
| Enabled |
boolean |
Specifies whether to enable invalid frame detection. |
false |
||||||
| CallbackDelay |
integer |
The duration in milliseconds that an invalid frame must persist before a notification is sent. If not specified, the setting from the console is used. Range: 200–5000. |
3000 |
||||||
| PeopleCount |
object |
Configuração para o recurso de contagem de pessoas. |
|||||||
| Enabled |
boolean |
Specifies whether to enable people counting. Default: |
false |
||||||
| Equipment |
object |
Configuração para identificação de dispositivos. |
|||||||
| Enabled |
boolean |
Specifies whether to enable device identification. Default: |
false |
||||||
| HeadMotion |
object |
Configuração para detecção de movimento da cabeça. |
|||||||
| Enabled |
boolean |
Specifies whether to enable head motion detection. Default: |
false |
||||||
| LookAway |
object |
Configuração para detecção de desvio de olhar. |
|||||||
| Enabled |
boolean |
Specifies whether to enable look-away detection. Default: |
true |
||||||
| AmbientSoundConfig |
object |
Configuração para som ambiente durante a chamada. |
|||||||
| ResourceId |
string |
O ID do recurso de som ambiente. Você pode obter esse ID nas configurações avançadas da configuração do agente no console. |
f67901c595834************ |
||||||
| Volume |
integer |
O volume do som ambiente. Intervalo: 0–100. Um valor de 0 desativa o som. |
50 |
||||||
| AutoSpeechConfig |
object |
Configuração para a fala automática do agente, incluindo prompts para latência do LLM e longos períodos de silêncio do usuário. |
|||||||
| UserIdle |
object |
Configuração para prompts a serem reproduzidos quando o usuário permanece em silêncio por um período prolongado. |
|||||||
| WaitTime |
integer |
The silence duration threshold in milliseconds. If the user is silent for longer than this period, a prompt is triggered. Range: 5000–600000. This is a required field. |
5000 |
||||||
| MaxRepeats |
integer |
The maximum number of times the prompt can be repeated. Range: 0–10. This is a required field. If the limit is exceeded, the call is terminated. |
5 |
||||||
| Messages |
array |
A collection of prompt messages. A maximum of 10 messages are supported, each up to 100 characters. The sum of all probabilities must be 100%. |
|||||||
|
object |
The structure of a prompt message. |
||||||||
| Text |
string |
The text of the prompt message, up to 100 characters. |
您还在吗? |
||||||
| Probability |
number |
The probability of this message being selected. Range: 0–1, corresponding to 0%–100%. |
0.5 |
||||||
| HangupEndWord |
string |
A farewell message played before hanging up due to user inactivity. |
我挂了,再见 |
||||||
| LlmPending |
object |
Configuração para prompts a serem reproduzidos durante a latência de resposta do LLM. |
|||||||
| WaitTime |
integer |
The wait time threshold for LLM responses. If the threshold is exceeded, a prompt is played. This is a required field. Unit: ms. Range: 500–10000. Set this value based on the actual performance of your LLM. |
3000 |
||||||
| Mode |
string |
The mode for handling LLM latency prompts. |
|||||||
| Messages |
array |
A collection of prompt messages. A maximum of 10 messages are supported, each up to 100 characters. The sum of all probabilities must be 100%. |
|||||||
|
object |
The structure of a prompt message. |
||||||||
| Text |
string |
The text of the prompt message, up to 100 characters. |
稍等一下 |
||||||
| Probability |
number |
The probability of this message being selected. Range: 0–1, corresponding to 0%–100%. |
0.5 |
||||||
| BackChannelingConfigs |
array |
Configuração para back-channeling. Quando ativado, o sistema reproduz frases curtas e responsivas em pontos de gatilho específicos. |
|||||||
|
object |
Uma única configuração de back-channeling. |
||||||||
| Enabled |
boolean |
Especifica se esta regra de back-channeling deve ser ativada. Este é um campo obrigatório. |
true |
||||||
| TriggerStage |
string |
O gatilho para o back-channeling. Valor válido:
|
pause_detected |
||||||
| Probability |
number |
A probabilidade de acionamento. Intervalo: 0.0–1.0. Este é um campo obrigatório. |
0.5 |
||||||
| Words |
array |
Uma coleção de frases de confirmação. Você pode especificar no máximo 10 frases. Cada frase deve ter 20 caracteres ou menos, e a soma de suas probabilidades deve ser 1.0. |
|||||||
|
object |
Configuração para uma frase responsiva. |
||||||||
| Text |
string |
短语文本,长度 ≤ 20 字符,支持多语言。必填。 |
嗯嗯 |
||||||
| Probability |
number |
本短语的触发概率,范围 0.0–1.0,必填。 |
0.3 |
||||||
| BackChannelingConfig |
array |
Importante
Obsoleto. Use BackChannelingConfigs. |
|||||||
|
object |
Uma única configuração de back-channeling. |
||||||||
| Enabled |
boolean |
Especifica se o recurso de back-channeling deve ser ativado. Campo obrigatório, valores: true/false. |
true |
||||||
| TriggerStage |
string |
O momento de acionamento do back-channeling. Valores válidos:
|
pause_detected |
||||||
| Probability |
number |
A probabilidade de acionamento do recurso. Intervalo: 0.0–1.0. Campo obrigatório. |
0.5 |
||||||
| Words |
array |
Coleção de frases de back-channeling. No máximo 10, cada frase com comprimento ≤ 20 caracteres, soma das probabilidades igual a 1.0. |
|||||||
|
object |
Configuração de frase de back-channeling. |
||||||||
| Text |
string |
短语文本,长度 ≤ 20 字符,支持多语言。必填。 |
嗯嗯 |
||||||
| Probability |
number |
本短语的触发概率,范围 0.0–1.0,必填。 |
0.3 |