Tous les produits
Search
Centre de documentation

Intelligent Media Services:AIAgentConfig

Dernière mise à jour :Aug 07, 2026

Parameter

Type

Description

Example

object

Les paramètres du modèle d'agent IA.

Greeting

string

Le message de bienvenue que l'agent IA diffuse lorsqu'il rejoint la session. Les modifications s'appliquent aux sessions suivantes. En cas d'omission, aucun message de bienvenue n'est diffusé.

你好

WakeUpQuery

string

Une commande fournie par l'utilisateur à laquelle l'agent IA répond immédiatement après le début de l'appel.

今天天气怎么样?

MaxIdleTime

integer

La durée d'inactivité maximale en secondes avant que l'agent IA ne se déconnecte. Si l'agent ne reçoit aucune interaction de l'utilisateur pendant cette période, il met fin à la tâche. Valeur par défaut : 600.

600

UserOnlineTimeout

integer

La durée en secondes pendant laquelle l'agent IA attend qu'un utilisateur rejoigne la session. Si l'utilisateur ne rejoint pas la session dans ce délai, l'agent met fin à la tâche. Valeur par défaut : 60.

60

UserOfflineTimeout

integer

La durée en secondes pendant laquelle l'agent IA attend avant de mettre fin à la tâche après qu'un utilisateur a quitté la session. Valeur par défaut : 5.

5

EnablePushToTalk

boolean

Indique si le mode push-to-talk doit être activé. Valeur par défaut : false.

false

GracefulShutdown

boolean

Indique si l'arrêt progressif doit être activé. Valeur par défaut : false.

Si cette option est activée, l'agent IA termine son énoncé en cours avant de se déconnecter lorsque la tâche est arrêtée. L'agent ne parlera pas pendant plus de 10 secondes.

false

Volume

integer

Le volume de parole de l'agent IA.

  • S'il n'est pas défini, le mode de volume adaptatif recommandé par Alibaba Cloud est utilisé par défaut.

  • S'il est défini, la valeur doit être comprise entre 0 et 400. Le volume de sortie final est calculé comme suit : (Volume du workflow) × (volume / 100). Par exemple :

  1. Si volume est 0, le volume de sortie est 0.

  2. Si volume est 100, le volume de sortie est identique au volume d'origine.

  3. Si volume est 200, le volume de sortie est le double du volume d'origine.

100

WorkflowOverrideParams

string

Une chaîne JSON contenant des paramètres pour remplacer la configuration de workflow par défaut.

{}

AvatarUrl

string

L'URL de l'avatar à afficher pendant les appels vocaux. En cas d'omission, aucun avatar n'est affiché.

http://example.com/a.jpg

AvatarUrlType

string

Le type de l'URL de l'avatar. Par défaut, ce paramètre n'est pas défini.

USER

EnableIntelligentSegment

boolean

Indique si la segmentation intelligente doit être activée. Lorsqu'elle est activée, les énoncés courts de l'utilisateur sont fusionnés en une seule phrase. Valeur par défaut : true.

true

AsrConfig

object

Configuration de la reconnaissance automatique de la parole (ASR).

AsrLanguageId

string

La langue pour l'ASR. Valeurs valides :

  • zh_mandarin : chinois (mandarin)

  • en : anglais

  • zh_en : mélange de chinois et d'anglais

  • es : espagnol

  • jp : japonais

zh_mandarin

AsrMaxSilence

integer

La durée maximale de silence en millisecondes avant que le moteur ASR ne finalise un énoncé. Une pause supérieure à cette valeur signale une fin de phrase. Plage : 200–1200. Valeur par défaut : 400.

400

AsrHotWords

array

Une liste de mots-clés pour améliorer la précision de l'ASR. Vous pouvez spécifier jusqu'à 128 mots-clés.

string

Une chaîne de mot-clé. Longueur : 1 à 10 caractères.

检查

VadLevel

integer

Le seuil de détection d'activité vocale (VAD) pour les interruptions. Plage : 0–11. Valeur par défaut : 11.

  • 0 : Désactive le VAD.

  • 110 : Définit la sensibilité aux interruptions. Une valeur plus élevée rend l'agent plus difficile à interrompre.

  • 11 : Un mode amélioré avec une distorsion audio plus faible et une meilleure résistance au bruit.

11

CustomParams

string

Paramètres de transmission pour les intégrations ASR propriétaires.

mode=fast&sample=16000&format=wav

VadDuration

integer

La durée minimale en millisecondes de parole continue de l'utilisateur requise pour déclencher une interruption. Ceci contrôle la sensibilité aux interruptions. Une valeur de 0 désactive cette fonctionnalité. Plage : 200–2000. Une plage courante est de 200 à 500 ms, ce qui correspond généralement à 1 à 4 caractères chinois. En cas d'omission, cette fonctionnalité est désactivée.

300

TtsConfig

object

Configuration de la synthèse vocale (TTS).

VoiceId

string

L'identifiant de la voix TTS prédéfinie. Les modifications s'appliquent à l'énoncé suivant. En cas d'omission, la voix du modèle d'agent IA est utilisée. L'identifiant peut comporter jusqu'à 64 caractères. Pour les voix disponibles, consultez Exemples de voix intelligentes.

longcheng_v2

VoiceIdList

array

Une liste des voix disponibles.

string

Une voix.

zhixiaoxia

PronunciationRules

array

Une liste de règles de prononciation TTS, exécutées dans l'ordre. Vous pouvez spécifier jusqu'à 20 règles.

object

Une règle de prononciation TTS.

Word

string

The word to be replaced. It must be 1 to 9 Chinese characters long and cannot contain spaces.

一一零

Pronunciation

string

The replacement pronunciation. It must be 1 to 9 Chinese characters long and cannot contain spaces.

幺幺零

Type

string

The type of pronunciation rule. Valid value:

  • replacement: Replaces the specified Word with the Pronunciation.

replacement

ModelId

string

Ce paramètre s'applique uniquement au fournisseur Minimax. Valeurs valides : speech-01-turbo, speech-02-turbo

speech-01-turbo

LanguageId

string

Ce paramètre est réservé au fournisseur minimax. Il améliore la reconnaissance pour certaines langues et certains dialectes à faibles ressources. Si la langue est inconnue, définissez ce paramètre sur auto pour une détection automatique. Par défaut, ce paramètre n'est pas défini. Les valeurs prises en charge incluent :

Langues prises en charge

  • Chinois

  • Chinese,Yue : cantonais

  • Anglais

  • Arabe

  • Russe

  • Espagnol

  • Français

  • Portugais

  • Allemand

  • Turc

  • Néerlandais

  • Ukrainien

  • Vietnamien

  • Indonésien

  • Japonais

  • Italien

  • Coréen

  • Thaï

  • Polonais

  • Roumain

  • Grec

  • Tchèque

  • Finnois

  • Hindi

  • auto

Chinese

Emotion

string

Ce paramètre s'applique uniquement au fournisseur Minimax. Les émotions prises en charge incluent :

  • happy

  • sad

  • angry

  • fearful

  • disgusted

  • surprised

  • calm

happy

SpeechRate

number

La vitesse de parole, où une valeur de 1,0 correspond à la vitesse normale. La plage prise en charge peut varier selon le fournisseur. Pour CosyVoice, la plage est de 0,5 à 2,0 (valeur par défaut : 1,0). Pour Minimax, la plage est de 0,5 à 2,0 (valeur par défaut : 1,0).

1.0

LlmConfig

object

Configuration du grand modèle de langage (LLM).

LlmHistory

array

Le contexte de l'historique de conversation pour le LLM/MLLM.

object

Un tour de conversation.

Role

string

The role of the participant in the conversation. Valid values:

  • user

  • assistant

  • system

  • function

  • plugin

  • tool

user

Content

string

The text content of the message from this role.

你好

LlmHistoryLimit

integer

Le nombre maximal de tours de conversation récents à inclure dans le contexte du LLM/MLLM. Valeur par défaut : 10.

10

LlmSystemPrompt

string

L'invite système pour le LLM après le début de l'appel.

你是一位友好且乐于助人的助手,专注于为用户提供准确的信息和建议

BailianAppParams

string

Paramètres d'Alibaba Cloud Model Studio, fournis sous forme de chaîne JSON. Pour le format des paramètres, consultez Paramètres d'Alibaba Cloud Model Studio.

"{\"biz_params\":{\"user_defined_params\":{\"your_plugin_id\":{\"article_index\":2}}},\"memory_id\":\"your_memory_id\",\"image_list\":[\"https://your_image_url\"],\"rag_options\":{\"pipeline_ids\":[\"your_id\"],\"file_ids\":[\"文档ID1\",\"文档ID2\"],\"metadata_filter\":{\"name\":\"张三\"},\"structured_filter\":{\"key1\":\"value1\",\"key2\":\"value2\"},\"tags\":[\"标签1\",\"标签2\"]}}"

OpenAIExtraQuery

string

Paramètres de requête supplémentaires pour un LLM compatible avec OpenAI. Les paramètres doivent être fournis sous forme de chaîne de requête URL (par exemple, key1=value1&key2=value2). Toutes les valeurs doivent être des chaînes.

api-version=2024-02-01&api-key=sk-xxx

LlmCompleteReply

boolean

Lorsqu'il est défini sur true, l'agent envoie la réponse complète du LLM dans un seul message une fois qu'elle est entièrement générée, au lieu de la diffuser en continu. Ce paramètre n'affecte pas la diffusion en continu des sous-titres.

true

FunctionMap

array

Mappe les fonctions intégrées de l'agent aux fonctions LLM personnalisées. Actuellement, cela ne prend en charge que l'appel de fonctions pour les LLM personnalisés compatibles avec OpenAI.

object

Une règle de mappage.

Function

string

The name of a built-in function provided by the AI agent system. Currently, only hangup is supported.

hangup

MatchFunction

string

The name of the custom LLM function that maps to the agent's built-in function. For details on the custom LLM protocol, see LLM Standard Interface.

hangup

OutputMinLength

integer

Le nombre minimum de caractères dans un bloc de texte avant qu'il ne soit envoyé au moteur TTS. Les blocs plus courts sont mis en mémoire tampon. Plage : 0–100. Une valeur de 0 ou l'omission de ce paramètre désactive la mise en mémoire tampon. Valeur par défaut : Non définie.

5

OutputMaxDelay

integer

Le délai maximal en millisecondes avant que le texte mis en mémoire tampon ne soit envoyé au moteur TTS, même si OutputMinLength n'est pas atteint. Plage : 1000–10000. Une valeur de 0 ou l'omission de ce paramètre désactive la limite de délai. Valeur par défaut : Non définie.

2000

HistorySyncWithTTS

boolean

Indique si l'historique des messages du LLM est synchronisé avec le contenu diffusé par le TTS. Valeur par défaut : false. Lorsque cette option est activée, les messages du LLM enregistrés correspondent au contenu réellement diffusé par le TTS.

Remarque

Lorsqu'un utilisateur interrompt l'agent, la balise <ims_agent_interrupted> est insérée dans l'historique des messages au point d'interruption. Cela affecte le message suivant envoyé au LLM. Par exemple :

[
  {"role": "user", "content": "Raconte-moi une histoire."},
  {"role": "assistant", "content": "D'accord, je peux te raconter une histoire sur les Trois Royaumes. Est-ce que cela te<ims_agent_interrupted> plairait ?"},
  {"role": "user", "content": "Raconte-m'en une autre."}
]

false

AvatarConfig

object

Configuration de l'avatar. Ceci ne prend effet que si le workflow inclut un nœud d'avatar.

AvatarId

string

L'identifiant du modèle de l'avatar.

5257

InterruptConfig

object

Configuration de la stratégie d'interruption de la parole.

EnableVoiceInterrupt

boolean

Indique si l'interruption de la parole doit être activée. Valeur par défaut : true.

true

InterruptWords

array

Une liste de mots ou de phrases spécifiques qui déclenchent une interruption.

string

Un mot ou une phrase spécifique qui déclenche une interruption.

Interrompre

NoInterruptMode

string

Indique comment gérer la parole de l'utilisateur qui se produit pendant une section non interruptible de l'énoncé de l'agent.

  • cache : Met en cache la parole de l'utilisateur et la traite lors du prochain tour de conversation.

  • discard : Écarte la parole de l'utilisateur.

Valeur par défaut : cache.

cache

KeepInterruptWordsForLLM

boolean

Indique si les mots d'interruption doivent être inclus dans le texte envoyé au LLM. Valeur par défaut : false (les mots sont ignorés).

Remarque

Par exemple, si « un instant » est un mot d'interruption et que l'utilisateur dit « un instant, quel temps fait-il aujourd'hui ? », définir ce paramètre sur false entraîne l'envoi uniquement de « quel temps fait-il aujourd'hui ? » au LLM.

true

VoiceprintConfig

object

Configuration de la reconnaissance d'empreinte vocale.

UseVoiceprint

boolean

Indique si la reconnaissance d'empreinte vocale doit être activée. Valeur par défaut : false. Si défini sur true, vous devez également fournir un VoiceprintId valide.

false

VoiceprintId

string

L'identifiant unique de l'empreinte vocale. Ceci n'est pas défini par défaut. L'identifiant doit correspondre à une empreinte vocale enregistrée à l'aide de l'API d'enregistrement d'empreinte vocale. Pour plus d'informations, consultez Enregistrer une empreinte vocale.

zhixiaoxia

RegistrationMode

string

Le mode d'enregistrement de l'empreinte vocale. Valeur par défaut : Explicit.

ValeurDescription
ExplicitEn mode Explicit, l'utilisateur doit enregistrer son empreinte vocale au préalable en utilisant l'API d'enregistrement d'empreinte vocale.
ImplicitEn mode Implicit, le système collecte automatiquement la parole de l'utilisateur pendant la conversation pour enregistrer une empreinte vocale.

Explicit

TurnDetectionConfig

object

Configuration de la détection des tours de conversation.

TurnEndWords

array

Une liste de mots-clés utilisés pour déterminer la fin du tour de conversation d'un utilisateur.

string

Un mot-clé utilisé pour déterminer la fin du tour de conversation d'un utilisateur.

J'ai terminé

Mode

string

Le mode de détection des tours de parole.

  • Normal (par défaut) : l'agent s'appuie sur les pauses pour détecter la fin du tour de parole de l'utilisateur.

  • Semantic : l'agent utilise l'IA pour analyser le contexte de la conversation afin de déterminer si l'utilisateur a terminé de parler.

Semantic

SemanticWaitDuration

integer

Le temps de détection des pauses en mode IA, en millisecondes. Valeur par défaut : -1.

  • -1 : L'IA détermine automatiquement un temps d'attente approprié.

  • 0–10000 : Un temps d'attente personnalisé. Une plage de 0 à 1500 ms est recommandée.

Remarque

Ce paramètre n'a aucun effet en mode Normal.

-1

Eagerness

string

Contrôle la vitesse de réponse de l'agent après la détection d'une pause de l'utilisateur. Ce paramètre s'applique uniquement en mode Semantic. Un réglage plus élevé entraîne une réponse plus rapide, mais augmente le risque d'interrompre l'utilisateur :

  • Low : attend patiemment avec un temps d'attente maximal de 6 secondes, réduisant ainsi le risque d'interruption.

  • Medium : un temps d'attente équilibré (jusqu'à 4 secondes), adapté à la plupart des scénarios.

  • High : répond rapidement (jusqu'à 2 secondes), ce qui améliore la rapidité mais peut augmenter le risque d'erreur dans les tours de parole.

Ce champ est vide par défaut.

High

ExperimentalConfig

string

Paramètres pour les fonctionnalités expérimentales. Contactez le support pour obtenir de l'aide.

""

VcrConfig

object

Configuration de la reconnaissance de contenu vidéo. Ceci permet au système d'envoyer des rappels au client concernant les événements détectés dans le flux vidéo.

StillFrameMotion

object

Configuration de la détection d'images fixes.

Enabled

boolean

Specifies whether to enable still frame detection. Default: false.

false

CallbackDelay

integer

The duration in milliseconds that a frame must remain still before a notification is sent. If not specified, the setting from the console is used. Range: 200–5000.

3000

InvalidFrameMotion

object

Configuration de la détection d'images invalides.

Enabled

boolean

Specifies whether to enable invalid frame detection.

false

CallbackDelay

integer

The duration in milliseconds that an invalid frame must persist before a notification is sent. If not specified, the setting from the console is used. Range: 200–5000.

3000

PeopleCount

object

Configuration de la fonctionnalité de comptage de personnes.

Enabled

boolean

Specifies whether to enable people counting. Default: false.

false

Equipment

object

Configuration de l'identification des appareils.

Enabled

boolean

Specifies whether to enable device identification. Default: false.

false

HeadMotion

object

Configuration pour la détection des mouvements de la tête.

Enabled

boolean

Specifies whether to enable head motion detection. Default: false.

false

LookAway

object

Configuration pour la détection du détournement du regard.

Enabled

boolean

Specifies whether to enable look-away detection. Default: false.

true

AmbientSoundConfig

object

Configuration du son d'ambiance pendant l'appel.

ResourceId

string

L'identifiant de la ressource de son d'ambiance. Vous pouvez obtenir cet identifiant dans les paramètres avancés de la configuration de l'agent dans la console.

f67901c595834************

Volume

integer

Le volume du son d'ambiance. Plage : 0–100. Une valeur de 0 désactive le son.

50

AutoSpeechConfig

object

Configuration de la parole automatique de l'agent, y compris les invites pour la latence du LLM et les longues périodes de silence de l'utilisateur.

UserIdle

object

Configuration des invites à lire lorsque l'utilisateur reste silencieux pendant une période prolongée.

WaitTime

integer

The silence duration threshold in milliseconds. If the user is silent for longer than this period, a prompt is triggered. Range: 5000–600000. This is a required field.

5000

MaxRepeats

integer

The maximum number of times the prompt can be repeated. Range: 0–10. This is a required field. If the limit is exceeded, the call is terminated.

5

Messages

array

A collection of prompt messages. A maximum of 10 messages are supported, each up to 100 characters. The sum of all probabilities must be 100%.

object

The structure of a prompt message.

Text

string

The text of the prompt message, up to 100 characters.

您还在吗?

Probability

number

The probability of this message being selected. Range: 0–1, corresponding to 0%–100%.

0.5

HangupEndWord

string

A farewell message played before hanging up due to user inactivity.

我挂了,再见

LlmPending

object

Configuration des invites à lire pendant la latence de réponse du LLM.

WaitTime

integer

The wait time threshold for LLM responses. If the threshold is exceeded, a prompt is played. This is a required field. Unit: ms. Range: 500–10000. Set this value based on the actual performance of your LLM.

3000

Mode

string

The mode for handling LLM latency prompts. random: Plays a random message from the list. sequence: Plays messages in order. This is a required field.

Messages

array

A collection of prompt messages. A maximum of 10 messages are supported, each up to 100 characters. The sum of all probabilities must be 100%.

object

The structure of a prompt message.

Text

string

The text of the prompt message, up to 100 characters.

稍等一下

Probability

number

The probability of this message being selected. Range: 0–1, corresponding to 0%–100%.

0.5

BackChannelingConfigs

array

Configuration du back-channeling. Lorsqu'il est activé, le système lit des phrases courtes et réactives à des points de déclenchement spécifiques.

object

Une configuration de back-channeling unique.

Enabled

boolean

Indique si cette règle de back-channeling doit être activée. Ce champ est obligatoire.

true

TriggerStage

string

Le déclencheur du back-channeling. Valeur valide :\n\n- pause_detected : déclenché lorsqu'une courte pause dans la parole est détectée.

pause_detected

Probability

number

La probabilité de déclenchement. Plage : 0,0–1,0. Ce champ est obligatoire.

0.5

Words

array

Une collection de phrases d'accusé de réception. Vous pouvez spécifier un maximum de 10 phrases. Chaque phrase doit comporter 20 caractères ou moins, et la somme de leurs probabilités doit être égale à 1,0.

object

Configuration d'une phrase réactive.

Text

string

短语文本,长度 ≤ 20 字符,支持多语言。必填。

嗯嗯

Probability

number

本短语的触发概率,范围 0.0–1.0,必填。

0.3

BackChannelingConfig

array

Important

object

Une configuration de phrase de back-channeling unique.

Enabled

boolean

Indique si la fonction de back-channeling doit être activée. Ce champ est obligatoire. Valeurs : true/false.

true

TriggerStage

string

Le moment du déclenchement du back-channeling. Valeurs facultatives :

pause_detected

Probability

number

La probabilité de déclenchement de la fonction. Plage : 0,0–1,0. Ce champ est obligatoire.

0.5

Words

array

Collection de phrases de back-channeling. Vous pouvez spécifier un maximum de 10 phrases. Chaque phrase doit comporter 20 caractères maximum, et la somme de leurs probabilités doit être égale à 1,0.

object

Configuration de la phrase de back-channeling.

Text

string

短语文本,长度 ≤ 20 字符,支持多语言。必填。

嗯嗯

Probability

number

本短语的触发概率,范围 0.0–1.0,必填。

0.3