formatstring(必选)
音频格式。
取值范围:
pcm
wav
mp3
opus
speex
aac
amr
重要opus/speex:必须使用Ogg封装;
wav:必须为PCM编码;
amr:仅支持AMR-NB类型。
sample_rateinteger(必选)
采样率(Hz)。
取值范围:8k模型仅支持 8000 Hz,其他模型支持任意采样率。
vocabulary_idstring(可选)
预编译热词列表 ID。
需预先调用创建热词列表接口生成,识别时传入该 ID 即可使用列表中的热词。
适用于词汇已知且相对稳定、需要跨请求复用同一词表的场景。
使用方法请参见预编译热词。
vocabularyobject(可选)
即时热词。
以键值对形式传入,键为热词文本(string),值为热词权重(integer),无需预先创建热词列表。权重取值范围为 [1, 5] 或 50:取 [1, 5] 时值越大模型越倾向输出该词;取 50 时为超级热词,召回率大幅提升,但超级热词数量最多不超过 50 个。
适用于临时性、会话级别的热词优化。
与预编译热词同时配置时,系统会合并两类热词;合并后超过 2000 个时,随机选择 2000 个使用。使用方法请参见即时热词。
重要仅qwen-audio-3.0-asr-flash-streaming支持即时热词。
language_hintsarray[string](可选)
待识别音频语种。无默认值,不设置时模型自动识别。
对于 Qwen-Audio-3.0-ASR-Flash-Streaming 系列模型,最多支持设置 4 个值,即便设置超出 4 个,也仅前 4 个生效;对于 Fun-ASR-Realtime 系列模型,仅支持设置 1 个值,即便设置多个,也仅第一个生效。
点击查看支持的语言代码
-
qwen-audio-3.0-asr-flash-streaming、fun-asr-realtime、fun-asr-realtime-2025-11-07:
- zh: 中文
- en: 英文
- ja: 日语
- ko:韩语
- vi:越南语
- th:泰语
- id:印尼语
- ms:马来语
- tl:菲律宾语
- hi:印地语
- ar:阿拉伯语
- fr:法语
- de:德语
- es:西班牙语
- pt:葡萄牙语
- ru:俄语
- it:意大利语
- nl:荷兰语
- sv:瑞典语
- da:丹麦语
- fi:芬兰语
- no:挪威语
- el:希腊语
- pl:波兰语
- cs:捷克语
- hu:匈牙利语
- ro:罗马尼亚语
- bg:保加利亚语
- hr:克罗地亚语
- sk:斯洛伐克语
-
fun-asr-realtime-2026-02-28:
-
fun-asr-realtime-2025-09-15:
-
fun-asr-flash-8k-realtime、fun-asr-flash-8k-realtime-2026-01-28:
semantic_punctuation_enabledboolean(可选)
是否启用语义断句。
默认值:false。
- true:开启语义断句,关闭 VAD 断句。
- false(默认):开启 VAD 断句,关闭语义断句。
语义断句准确性更高,适合会议转写场景;VAD(Voice Activity Detection,语音活动检测)断句延迟较低,适合交互场景。
max_sentence_silenceinteger(可选)
VAD 断句静音阈值(ms)。当一段语音后的静音时长超过该阈值时,系统会判定该句子已结束。当semantic_punctuation_enabled为true时,不作为sentence_end返回依据,但设置过小可能会影响识别效果。
默认值:1300。
取值范围:[200, 6000]。
multi_threshold_mode_enabledboolean(可选)
重要仅在semantic_punctuation_enabled参数为false时生效。
是否启用多阈值模式。启用后可防止 VAD 断句切割过长。
默认值:false。
heartbeatboolean(可选)
是否启用心跳包。
默认值:false。
- true:在持续发送静音音频的情况下,可保持与服务端的连接不中断。
- false(默认):即使持续发送静音音频,连接也将在一定时间后因超时而断开。
静音音频指的是在音频文件或数据流中没有声音信号的内容。静音音频可以通过多种方法生成,例如使用音频编辑软件如Audacity或Adobe Audition,或者通过命令行工具如FFmpeg。
speech_noise_thresholdfloat(可选)
语音与噪音的判定阈值,用于调整语音活动检测(VAD)的灵敏度。
取值范围:[-1.0, 1.0]。
取值说明:
- 取值越接近 -1:降低噪音判定阈值,噪音被识别为语音的概率增大,可能导致更多噪音被转写
- 取值越接近 +1:提高噪音判定阈值,语音被误判为噪音的概率增大,可能导致部分语音被过滤
此参数为高级配置参数,调整可能显著影响识别效果,建议:
- 调整前充分测试验证效果
- 根据实际音频环境小幅度调整(建议步长 0.1)
special_word_filter string(可选)
指定在语音识别过程中需要处理的敏感词,并支持对不同敏感词设置不同的处理方式。详情请参见敏感词过滤。