本文介绍Qwen-Audio-3.x-ASR-Flash/Fun-ASR-Flash非实时语音识别HTTP API的参数和接口细节。
用户指南:非实时语音识别。关于支持的音频格式、文件大小限制、时长限制等输入要求,请参见音频规格。
接口地址
新加坡
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation
调用时请将{WorkspaceId}替换为真实的Workspace ID。
华北2(北京)
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation
调用时请将{WorkspaceId}替换为真实的Workspace ID。
重要阿里云百炼为华北2(北京)、新加坡地域推出了业务空间专属域名,能够为推理请求提供卓越的性能和更高的稳定性,建议迁移至新域名:
- 华北2(北京)地域:从
dashscope.aliyuncs.com迁移至{WorkspaceId}.cn-beijing.maas.aliyuncs.com - 新加坡地域:从
dashscope-intl.aliyuncs.com迁移至{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com
{WorkspaceId}需要替换为真实的Workspace ID。现有域名仍可正常使用。
请求头
参数 | 类型 | 是否必选 | 说明 |
|---|---|---|---|
Authorization | string | 是 | 鉴权令牌,格式为 |
Content-Type | string | 是 | 请求参数的媒体类型,固定为 |
X-DashScope-SSE | string | 是 | 用于控制是否以SSE流式方式返回结果。设置为 |
请求参数model 指定模型名。支持Qwen-Audio-3.x-ASR-Flash和Fun-ASR-Flash系列模型,详情请参见支持的模型与地域。 input 输入信息。 parameters 模型参数。 说明Qwen-Audio-3.0-ASR-Flash 和 Fun-ASR-Flash 的润色顺滑功能默认关闭,暂未开放。Qwen-Audio-3.1-ASR-Flash 支持原生文本润色。 润色顺滑:模型在识别语音的同时,自动清理无意义语气词和口吃重复,处理说话过程中的自我纠正,理顺口语表达,并规范标点与文本格式。输出结果更加简洁、流畅、易读,同时尽可能保留用户的最终意图和关键信息。 | 以下为新加坡地域的配置,调用时请将"{WorkspaceId}"替换为真实的业务空间ID,各地域的配置不同。新加坡地域和北京地域的API Key不同。 非流式流式携带上下文-非流式携带上下文-流式Base64可输入Base64编码数据(Data URL),格式为:
即时热词 |
响应参数request_id 本次请求的唯一标识。 output 输出结果。 usage 用量信息。仅在 属性 duration 已处理的音频时长,单位秒。 input_tokens 本次调用消耗的输入 Token 数。仅适用于 output_tokens 本次调用消耗的输出 Token 数。仅适用于 total_tokens 本次调用消耗的总 Token 数,等于 | 非流式流式仅当音频时长不少于1分钟且设置 返回示例: |
SSE 流式结果处理逻辑
在流式模式下,客户端需关注以下处理要点:
- 每收到一个SSE事件,解析
data字段中的JSON。 - 对于 Qwen-Audio-3.0-ASR-Flash 和 Fun-ASR-Flash,通过
output.sentence.sentence_end判断当前句子是否结束:当该值为true时,该句识别完成,词级时间戳已稳定,可作为最终结果使用;当该值为false时,识别仍在进行中,文本和时间戳可能在后续事件中更新。 usage信息仅在句子结束事件中返回,包含音频处理时长。对于qwen-audio-3.1-asr-flash,还包含本次调用的输入、输出和总 Token 数,该模型按 Token 计费。
对于 qwen-audio-3.1-asr-flash,未开启说话人分离时,词级时间戳在 output.sentence.words[i].fixed 为 true 后才固定;在此之前,时间戳仍可能调整。开启说话人分离时,应读取 output.sentences 中当前及历史句子的结果。