|
Parameter |
Type |
Description |
Example |
||||||
|---|---|---|---|---|---|---|---|---|---|
|
object |
Les paramètres du modèle d'agent IA. |
||||||||
| Greeting |
string |
Le message de bienvenue que l'agent IA diffuse lorsqu'il rejoint la session. Les modifications s'appliquent aux sessions suivantes. En cas d'omission, aucun message de bienvenue n'est diffusé. |
你好 |
||||||
| WakeUpQuery |
string |
Une commande fournie par l'utilisateur à laquelle l'agent IA répond immédiatement après le début de l'appel. |
今天天气怎么样? |
||||||
| MaxIdleTime |
integer |
La durée d'inactivité maximale en secondes avant que l'agent IA ne se déconnecte. Si l'agent ne reçoit aucune interaction de l'utilisateur pendant cette période, il met fin à la tâche. Valeur par défaut : 600. |
600 |
||||||
| UserOnlineTimeout |
integer |
La durée en secondes pendant laquelle l'agent IA attend qu'un utilisateur rejoigne la session. Si l'utilisateur ne rejoint pas la session dans ce délai, l'agent met fin à la tâche. Valeur par défaut : 60. |
60 |
||||||
| UserOfflineTimeout |
integer |
La durée en secondes pendant laquelle l'agent IA attend avant de mettre fin à la tâche après qu'un utilisateur a quitté la session. Valeur par défaut : 5. |
5 |
||||||
| EnablePushToTalk |
boolean |
Indique si le mode push-to-talk doit être activé. Valeur par défaut : false. |
false |
||||||
| GracefulShutdown |
boolean |
Indique si l'arrêt progressif doit être activé. Valeur par défaut : false. Si cette option est activée, l'agent IA termine son énoncé en cours avant de se déconnecter lorsque la tâche est arrêtée. L'agent ne parlera pas pendant plus de 10 secondes. |
false |
||||||
| Volume |
integer |
Le volume de parole de l'agent IA.
|
100 |
||||||
| WorkflowOverrideParams |
string |
Une chaîne JSON contenant des paramètres pour remplacer la configuration de workflow par défaut. |
{} |
||||||
| AvatarUrl |
string |
L'URL de l'avatar à afficher pendant les appels vocaux. En cas d'omission, aucun avatar n'est affiché. |
http://example.com/a.jpg |
||||||
| AvatarUrlType |
string |
Le type de l'URL de l'avatar. Par défaut, ce paramètre n'est pas défini. |
USER |
||||||
| EnableIntelligentSegment |
boolean |
Indique si la segmentation intelligente doit être activée. Lorsqu'elle est activée, les énoncés courts de l'utilisateur sont fusionnés en une seule phrase. Valeur par défaut : |
true |
||||||
| AsrConfig |
object |
Configuration de la reconnaissance automatique de la parole (ASR). |
|||||||
| AsrLanguageId |
string |
La langue pour l'ASR. Valeurs valides :
|
zh_mandarin |
||||||
| AsrMaxSilence |
integer |
La durée maximale de silence en millisecondes avant que le moteur ASR ne finalise un énoncé. Une pause supérieure à cette valeur signale une fin de phrase. Plage : 200–1200. Valeur par défaut : 400. |
400 |
||||||
| AsrHotWords |
array |
Une liste de mots-clés pour améliorer la précision de l'ASR. Vous pouvez spécifier jusqu'à 128 mots-clés. |
|||||||
|
string |
Une chaîne de mot-clé. Longueur : 1 à 10 caractères. |
检查 |
|||||||
| VadLevel |
integer |
Le seuil de détection d'activité vocale (VAD) pour les interruptions. Plage : 0–11. Valeur par défaut : 11.
|
11 |
||||||
| CustomParams |
string |
Paramètres de transmission pour les intégrations ASR propriétaires. |
mode=fast&sample=16000&format=wav |
||||||
| VadDuration |
integer |
La durée minimale en millisecondes de parole continue de l'utilisateur requise pour déclencher une interruption. Ceci contrôle la sensibilité aux interruptions. Une valeur de 0 désactive cette fonctionnalité. Plage : 200–2000. Une plage courante est de 200 à 500 ms, ce qui correspond généralement à 1 à 4 caractères chinois. En cas d'omission, cette fonctionnalité est désactivée. |
300 |
||||||
| TtsConfig |
object |
Configuration de la synthèse vocale (TTS). |
|||||||
| VoiceId |
string |
L'identifiant de la voix TTS prédéfinie. Les modifications s'appliquent à l'énoncé suivant. En cas d'omission, la voix du modèle d'agent IA est utilisée. L'identifiant peut comporter jusqu'à 64 caractères. Pour les voix disponibles, consultez Exemples de voix intelligentes. |
longcheng_v2 |
||||||
| VoiceIdList |
array |
Une liste des voix disponibles. |
|||||||
|
string |
Une voix. |
zhixiaoxia |
|||||||
| PronunciationRules |
array |
Une liste de règles de prononciation TTS, exécutées dans l'ordre. Vous pouvez spécifier jusqu'à 20 règles. |
|||||||
|
object |
Une règle de prononciation TTS. |
||||||||
| Word |
string |
The word to be replaced. It must be 1 to 9 Chinese characters long and cannot contain spaces. |
一一零 |
||||||
| Pronunciation |
string |
The replacement pronunciation. It must be 1 to 9 Chinese characters long and cannot contain spaces. |
幺幺零 |
||||||
| Type |
string |
The type of pronunciation rule. Valid value:
|
replacement |
||||||
| ModelId |
string |
Ce paramètre s'applique uniquement au fournisseur Minimax. Valeurs valides :
|
speech-01-turbo |
||||||
| LanguageId |
string |
Ce paramètre est réservé au fournisseur minimax. Il améliore la reconnaissance pour certaines langues et certains dialectes à faibles ressources. Si la langue est inconnue, définissez ce paramètre sur |
Chinese |
||||||
| Emotion |
string |
Ce paramètre s'applique uniquement au fournisseur Minimax. Les émotions prises en charge incluent :
|
happy |
||||||
| SpeechRate |
number |
La vitesse de parole, où une valeur de 1,0 correspond à la vitesse normale. La plage prise en charge peut varier selon le fournisseur. Pour CosyVoice, la plage est de 0,5 à 2,0 (valeur par défaut : 1,0). Pour Minimax, la plage est de 0,5 à 2,0 (valeur par défaut : 1,0). |
1.0 |
||||||
| LlmConfig |
object |
Configuration du grand modèle de langage (LLM). |
|||||||
| LlmHistory |
array |
Le contexte de l'historique de conversation pour le LLM/MLLM. |
|||||||
|
object |
Un tour de conversation. |
||||||||
| Role |
string |
The role of the participant in the conversation. Valid values:
|
user |
||||||
| Content |
string |
The text content of the message from this role. |
你好 |
||||||
| LlmHistoryLimit |
integer |
Le nombre maximal de tours de conversation récents à inclure dans le contexte du LLM/MLLM. Valeur par défaut : 10. |
10 |
||||||
| LlmSystemPrompt |
string |
L'invite système pour le LLM après le début de l'appel. |
你是一位友好且乐于助人的助手,专注于为用户提供准确的信息和建议 |
||||||
| BailianAppParams |
string |
Paramètres d'Alibaba Cloud Model Studio, fournis sous forme de chaîne JSON. Pour le format des paramètres, consultez Paramètres d'Alibaba Cloud Model Studio. |
"{\"biz_params\":{\"user_defined_params\":{\"your_plugin_id\":{\"article_index\":2}}},\"memory_id\":\"your_memory_id\",\"image_list\":[\"https://your_image_url\"],\"rag_options\":{\"pipeline_ids\":[\"your_id\"],\"file_ids\":[\"文档ID1\",\"文档ID2\"],\"metadata_filter\":{\"name\":\"张三\"},\"structured_filter\":{\"key1\":\"value1\",\"key2\":\"value2\"},\"tags\":[\"标签1\",\"标签2\"]}}" |
||||||
| OpenAIExtraQuery |
string |
Paramètres de requête supplémentaires pour un LLM compatible avec OpenAI. Les paramètres doivent être fournis sous forme de chaîne de requête URL (par exemple, |
api-version=2024-02-01&api-key=sk-xxx |
||||||
| LlmCompleteReply |
boolean |
Lorsqu'il est défini sur |
true |
||||||
| FunctionMap |
array |
Mappe les fonctions intégrées de l'agent aux fonctions LLM personnalisées. Actuellement, cela ne prend en charge que l'appel de fonctions pour les LLM personnalisés compatibles avec OpenAI. |
|||||||
|
object |
Une règle de mappage. |
||||||||
| Function |
string |
The name of a built-in function provided by the AI agent system. Currently, only |
hangup |
||||||
| MatchFunction |
string |
The name of the custom LLM function that maps to the agent's built-in function. For details on the custom LLM protocol, see LLM Standard Interface. |
hangup |
||||||
| OutputMinLength |
integer |
Le nombre minimum de caractères dans un bloc de texte avant qu'il ne soit envoyé au moteur TTS. Les blocs plus courts sont mis en mémoire tampon. Plage : 0–100. Une valeur de |
5 |
||||||
| OutputMaxDelay |
integer |
Le délai maximal en millisecondes avant que le texte mis en mémoire tampon ne soit envoyé au moteur TTS, même si |
2000 |
||||||
| HistorySyncWithTTS |
boolean |
Indique si l'historique des messages du LLM est synchronisé avec le contenu diffusé par le TTS. Valeur par défaut : Remarque
Lorsqu'un utilisateur interrompt l'agent, la balise |
false |
||||||
| AvatarConfig |
object |
Configuration de l'avatar. Ceci ne prend effet que si le workflow inclut un nœud d'avatar. |
|||||||
| AvatarId |
string |
L'identifiant du modèle de l'avatar. |
5257 |
||||||
| InterruptConfig |
object |
Configuration de la stratégie d'interruption de la parole. |
|||||||
| EnableVoiceInterrupt |
boolean |
Indique si l'interruption de la parole doit être activée. Valeur par défaut : |
true |
||||||
| InterruptWords |
array |
Une liste de mots ou de phrases spécifiques qui déclenchent une interruption. |
|||||||
|
string |
Un mot ou une phrase spécifique qui déclenche une interruption. |
Interrompre |
|||||||
| NoInterruptMode |
string |
Indique comment gérer la parole de l'utilisateur qui se produit pendant une section non interruptible de l'énoncé de l'agent.
Valeur par défaut : |
cache |
||||||
| KeepInterruptWordsForLLM |
boolean |
Indique si les mots d'interruption doivent être inclus dans le texte envoyé au LLM. Valeur par défaut : Remarque
Par exemple, si « un instant » est un mot d'interruption et que l'utilisateur dit « un instant, quel temps fait-il aujourd'hui ? », définir ce paramètre sur |
true |
||||||
| VoiceprintConfig |
object |
Configuration de la reconnaissance d'empreinte vocale. |
|||||||
| UseVoiceprint |
boolean |
Indique si la reconnaissance d'empreinte vocale doit être activée. Valeur par défaut : |
false |
||||||
| VoiceprintId |
string |
L'identifiant unique de l'empreinte vocale. Ceci n'est pas défini par défaut. L'identifiant doit correspondre à une empreinte vocale enregistrée à l'aide de l'API d'enregistrement d'empreinte vocale. Pour plus d'informations, consultez Enregistrer une empreinte vocale. |
zhixiaoxia |
||||||
| RegistrationMode |
string |
Le mode d'enregistrement de l'empreinte vocale. Valeur par défaut :
|
Explicit |
||||||
| TurnDetectionConfig |
object |
Configuration de la détection des tours de conversation. |
|||||||
| TurnEndWords |
array |
Une liste de mots-clés utilisés pour déterminer la fin du tour de conversation d'un utilisateur. |
|||||||
|
string |
Un mot-clé utilisé pour déterminer la fin du tour de conversation d'un utilisateur. |
J'ai terminé |
|||||||
| Mode |
string |
Le mode de détection des tours de parole.
|
Semantic |
||||||
| SemanticWaitDuration |
integer |
Le temps de détection des pauses en mode IA, en millisecondes. Valeur par défaut : -1.
Remarque
Ce paramètre n'a aucun effet en mode |
-1 |
||||||
| Eagerness |
string |
Contrôle la vitesse de réponse de l'agent après la détection d'une pause de l'utilisateur. Ce paramètre s'applique uniquement en mode
Ce champ est vide par défaut. |
High |
||||||
| ExperimentalConfig |
string |
Paramètres pour les fonctionnalités expérimentales. Contactez le support pour obtenir de l'aide. |
"" |
||||||
| VcrConfig |
object |
Configuration de la reconnaissance de contenu vidéo. Ceci permet au système d'envoyer des rappels au client concernant les événements détectés dans le flux vidéo. |
|||||||
| StillFrameMotion |
object |
Configuration de la détection d'images fixes. |
|||||||
| Enabled |
boolean |
Specifies whether to enable still frame detection. Default: |
false |
||||||
| CallbackDelay |
integer |
The duration in milliseconds that a frame must remain still before a notification is sent. If not specified, the setting from the console is used. Range: 200–5000. |
3000 |
||||||
| InvalidFrameMotion |
object |
Configuration de la détection d'images invalides. |
|||||||
| Enabled |
boolean |
Specifies whether to enable invalid frame detection. |
false |
||||||
| CallbackDelay |
integer |
The duration in milliseconds that an invalid frame must persist before a notification is sent. If not specified, the setting from the console is used. Range: 200–5000. |
3000 |
||||||
| PeopleCount |
object |
Configuration de la fonctionnalité de comptage de personnes. |
|||||||
| Enabled |
boolean |
Specifies whether to enable people counting. Default: |
false |
||||||
| Equipment |
object |
Configuration de l'identification des appareils. |
|||||||
| Enabled |
boolean |
Specifies whether to enable device identification. Default: |
false |
||||||
| HeadMotion |
object |
Configuration pour la détection des mouvements de la tête. |
|||||||
| Enabled |
boolean |
Specifies whether to enable head motion detection. Default: |
false |
||||||
| LookAway |
object |
Configuration pour la détection du détournement du regard. |
|||||||
| Enabled |
boolean |
Specifies whether to enable look-away detection. Default: |
true |
||||||
| AmbientSoundConfig |
object |
Configuration du son d'ambiance pendant l'appel. |
|||||||
| ResourceId |
string |
L'identifiant de la ressource de son d'ambiance. Vous pouvez obtenir cet identifiant dans les paramètres avancés de la configuration de l'agent dans la console. |
f67901c595834************ |
||||||
| Volume |
integer |
Le volume du son d'ambiance. Plage : 0–100. Une valeur de 0 désactive le son. |
50 |
||||||
| AutoSpeechConfig |
object |
Configuration de la parole automatique de l'agent, y compris les invites pour la latence du LLM et les longues périodes de silence de l'utilisateur. |
|||||||
| UserIdle |
object |
Configuration des invites à lire lorsque l'utilisateur reste silencieux pendant une période prolongée. |
|||||||
| WaitTime |
integer |
The silence duration threshold in milliseconds. If the user is silent for longer than this period, a prompt is triggered. Range: 5000–600000. This is a required field. |
5000 |
||||||
| MaxRepeats |
integer |
The maximum number of times the prompt can be repeated. Range: 0–10. This is a required field. If the limit is exceeded, the call is terminated. |
5 |
||||||
| Messages |
array |
A collection of prompt messages. A maximum of 10 messages are supported, each up to 100 characters. The sum of all probabilities must be 100%. |
|||||||
|
object |
The structure of a prompt message. |
||||||||
| Text |
string |
The text of the prompt message, up to 100 characters. |
您还在吗? |
||||||
| Probability |
number |
The probability of this message being selected. Range: 0–1, corresponding to 0%–100%. |
0.5 |
||||||
| HangupEndWord |
string |
A farewell message played before hanging up due to user inactivity. |
我挂了,再见 |
||||||
| LlmPending |
object |
Configuration des invites à lire pendant la latence de réponse du LLM. |
|||||||
| WaitTime |
integer |
The wait time threshold for LLM responses. If the threshold is exceeded, a prompt is played. This is a required field. Unit: ms. Range: 500–10000. Set this value based on the actual performance of your LLM. |
3000 |
||||||
| Mode |
string |
The mode for handling LLM latency prompts. |
|||||||
| Messages |
array |
A collection of prompt messages. A maximum of 10 messages are supported, each up to 100 characters. The sum of all probabilities must be 100%. |
|||||||
|
object |
The structure of a prompt message. |
||||||||
| Text |
string |
The text of the prompt message, up to 100 characters. |
稍等一下 |
||||||
| Probability |
number |
The probability of this message being selected. Range: 0–1, corresponding to 0%–100%. |
0.5 |
||||||
| BackChannelingConfigs |
array |
Configuration du back-channeling. Lorsqu'il est activé, le système lit des phrases courtes et réactives à des points de déclenchement spécifiques. |
|||||||
|
object |
Une configuration de back-channeling unique. |
||||||||
| Enabled |
boolean |
Indique si cette règle de back-channeling doit être activée. Ce champ est obligatoire. |
true |
||||||
| TriggerStage |
string |
Le déclencheur du back-channeling. Valeur valide :\n\n- |
pause_detected |
||||||
| Probability |
number |
La probabilité de déclenchement. Plage : 0,0–1,0. Ce champ est obligatoire. |
0.5 |
||||||
| Words |
array |
Une collection de phrases d'accusé de réception. Vous pouvez spécifier un maximum de 10 phrases. Chaque phrase doit comporter 20 caractères ou moins, et la somme de leurs probabilités doit être égale à 1,0. |
|||||||
|
object |
Configuration d'une phrase réactive. |
||||||||
| Text |
string |
短语文本,长度 ≤ 20 字符,支持多语言。必填。 |
嗯嗯 |
||||||
| Probability |
number |
本短语的触发概率,范围 0.0–1.0,必填。 |
0.3 |
||||||
| BackChannelingConfig |
array |
Important |
|||||||
|
object |
Une configuration de phrase de back-channeling unique. |
||||||||
| Enabled |
boolean |
Indique si la fonction de back-channeling doit être activée. Ce champ est obligatoire. Valeurs : true/false. |
true |
||||||
| TriggerStage |
string |
Le moment du déclenchement du back-channeling. Valeurs facultatives : |
pause_detected |
||||||
| Probability |
number |
La probabilité de déclenchement de la fonction. Plage : 0,0–1,0. Ce champ est obligatoire. |
0.5 |
||||||
| Words |
array |
Collection de phrases de back-channeling. Vous pouvez spécifier un maximum de 10 phrases. Chaque phrase doit comporter 20 caractères maximum, et la somme de leurs probabilités doit être égale à 1,0. |
|||||||
|
object |
Configuration de la phrase de back-channeling. |
||||||||
| Text |
string |
短语文本,长度 ≤ 20 字符,支持多语言。必填。 |
嗯嗯 |
||||||
| Probability |
number |
本短语的触发概率,范围 0.0–1.0,必填。 |
0.3 |