keep_dialect boolean (可選)
預設為 false,將方言轉寫為普通話文本。設為 true 時保留方言表達。
vad_model string (可選)
VAD 模型。取值為 near_meeting_16k(近場)或 far_field_meeting_16k(遠場,預設值)。
disfluency_removal_enabled boolean (可選)
是否過濾語氣詞並潤飾輸出。預設為 false,設為 true 時啟用。
intermediate_result_enabled boolean (可選)
是否傳回串流中間結果。預設為 false,設為 true 時傳回中間結果。
formatstring(必選)
音頻格式。
取值範圍:
pcm
wav
mp3
opus
speex
aac
amr
重要opus/speex:必須使用Ogg封裝;
wav:必須為PCM編碼;
amr:僅支援AMR-NB類型。
sample_rateinteger(必選)
採樣率(Hz),僅支援 16000。
vocabulary_idstring(可選)
先行編譯熱詞列表 ID。
需預先調用建立熱詞列表介面產生,識別時傳入該 ID 即可使用列表中的熱詞。
適用於詞彙已知且相對穩定、需要跨請求複用同一詞表的情境。
使用方法請參見先行編譯熱詞。
vocabularyobject(可選)
即時熱詞。
以索引值對形式傳入,鍵為熱詞文本(string),值為熱詞權重(integer),無需預先建立熱詞列表。權重取值範圍為 [1, 5] 或 50:取 [1, 5] 時值越大模型越傾向輸出該詞;取 50 時為超級熱詞,召回率大幅提升,但超級熱詞數量最多不超過 50 個。
適用於臨時性、會話層級的熱詞最佳化。
與先行編譯熱詞同時配置時,僅即時熱詞生效。使用方法請參見即時熱詞。
重要僅qwen-audio-3.1-asr-flash-message支援即時熱詞。
max_sentence_silenceinteger(可選)
VAD 斷句靜音閾值(毫秒)。語音後的靜音時長超過此值時判定句子結束。預設值為 1300,取值範圍為 [200, 6000]。
heartbeatboolean(可選)
是否啟用心跳包。
預設值:false。
- true:在持續發送靜音音訊情況下,可保持與服務端的串連不中斷。
- false(預設):即使持續發送靜音音頻,串連也將在一定時間後因逾時而斷開。
靜音音頻指的是在音頻檔案或資料流中沒有聲音訊號的內容。靜音音頻可以通過多種方法產生,例如使用音頻編輯軟體如Audacity或Adobe Audition,或者通過命令列工具如FFmpeg。
speech_noise_thresholdfloat(可選)
語音與噪音的判定閾值,用於調整語音活動檢測(VAD)的靈敏度。
取值範圍:[-1.0, 1.0]。
取值說明:
- 取值越接近 -1:降低噪音判定閾值,噪音被識別為語音的機率增大,可能導致更多噪音被轉寫
- 取值越接近 +1:提高噪音判定閾值,語音被誤判為噪音的機率增大,可能導致部分語音被過濾
此參數為進階配置參數,調整可能顯著影響識別效果,建議:
- 調整前充分測實驗證效果
- 根據實際音頻環境小幅度調整(建議步長 0.1)