text_typestring(必選)
固定為 PlainText。
voicestring(必選)
語音合成所使用的音色。
formatstring(可選)
音頻編碼格式。
取值範圍:
sample_rateinteger(可選)
音頻採樣率(Hz)。
取值範圍:8000, 16000, 22050(預設), 24000, 44100, 48000。
volumeinteger(可選)
音量。
預設值:50。
取值範圍:[0, 100]。
ratefloat(可選)
語速。
預設值:1.0。
取值範圍:[0.5, 2.0]。
pitchfloat(可選)
音調。
預設值:1.0。
取值範圍:[0.5, 2.0]。
bit_rateinteger(可選)
音頻碼率(kbps)。音頻格式為mp3或opus時,支援通過bit_rate參數調整碼率。
預設值:32。
取值範圍:[6, 510]。
enable_ssmlboolean(可選)
是否開啟 SSML 功能。
預設值:false。
設為 true 後,僅允許發送一次 continue-task 指令。
SSML 的使用限制(支援的模型、音色和介面),請參見使用限制。
word_timestamp_enabledboolean(可選)
是否開啟字層級時間戳記。
預設值:false。
僅在流式輸出模式下可用。支援的音色範圍:cosyvoice-v3.5-plus、cosyvoice-v3.5-flash、cosyvoice-v3-flash、cosyvoice-v3-plus和cosyvoice-v2模型的複刻音色,以及Qwen-Audio-TTS音色列表、CosyVoice音色列表中標記為支援的系統音色。其他模型的複刻音色不支援此功能。
seedinteger(可選)
產生時使用的隨機數種子,使合成的效果產生變化。在模型版本、文本、音色及其他參數均相同的前提下,使用相同的seed可複現相同的合成結果。
預設值0。
取值範圍:[0, 65535]。
language_hintsarray[string](可選)
重要
- 此參數為數組,但目前的版本僅處理第一個元素,因此建議只傳入一個值。
- 此參數用於指定語音合成的目標語言,該設定與聲音複刻時的樣本音訊語種無關。如需設定複刻任務的源語言,請參見聲音複刻API參考。
指定語音合成的目標語言,提升合成效果。
當數字、縮寫、符號等朗讀方式或者小語種合成效果不符合預期時使用,例如:
- 數字朗讀方式不符合預期,“hello, this is 110”讀成“hello, this is one one zero”而非“hello, this is 么么零”
- 符號朗讀不準確,“@”讀成“艾特”而非“at”
- 小語種合成效果差,合成不自然
取值範圍:
- zh:中文
- en:英語
- fr:法語
- de:德語
- ja:日語
- ko:韓語
- ru:俄語
- pt:葡萄牙語
- th:泰語
- id:印尼語
- vi:越南語
- es:西班牙語
- it:意大利語
- ms:馬來西亞語
- fil:菲律賓語
- ar:阿拉伯語
instructionstring(可選)
設定指令,用於控制方言、情感或角色等合成效果。具體使用說明請參見指令控制。
enable_aigc_tagboolean(可選)
是否在產生的音頻中添加AIGC隱性標識。設定為true時,會將隱性標識嵌入到支援格式(wav/mp3/opus)的音頻中。
預設值:false。
僅qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash、cosyvoice-v3-flash、cosyvoice-v3-plus、cosyvoice-v2支援該功能。
aigc_propagatorstring(可選)
設定AIGC隱性標識中的 ContentPropagator 欄位,用於標識內容的傳播者。僅在 enable_aigc_tag 為 true 時生效。
預設值:阿里雲UID。
僅qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash、cosyvoice-v3-flash、cosyvoice-v3-plus、cosyvoice-v2支援該功能。
aigc_propagate_idstring(可選)
設定AIGC隱性標識中的 PropagateID 欄位,用於唯一標識一次具體的傳播行為。僅在 enable_aigc_tag 為 true 時生效。
預設值:本次語音合成請求Request ID。
僅qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash、cosyvoice-v3-flash、cosyvoice-v3-plus、cosyvoice-v2支援該功能。
hot_fixobject(可選)
文本熱修複配置,用於自訂指定詞語的發音或對待合成文本進行替換。
qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash、cosyvoice-v2不支援該功能。
參數介紹:
- pronunciation:自訂發音。指定詞語的拼音標註,用於糾正預設發音不準確的情況。
- replace:文本替換。在語音合成前將指定詞語替換為目標文本,替換後的文本將作為實際合成內容。
樣本:
"hot_fix": {
"pronunciation": [
{"天氣": "tian1 qi4"}
],
"replace": [
{"今天": "金天"}
]
}
enable_markdown_filterboolean(可選)
重要僅cosyvoice-v3-flash複刻音色支援該功能。
是否啟用 Markdown 過濾。啟用該功能後,系統在合成語音前自動過濾輸入文本中的 Markdown 標記符號,避免將其朗讀為文字內容。
預設值:false。
取值範圍:
- true:啟用Markdown過濾
- false:禁用Markdown過濾