本文介紹Qwen-Audio-3.0-ASR-Flash/Fun-ASR-Flash非即時語音辨識HTTP API的參數和介面細節。
使用者指南:非即時語音辨識。關於支援的音頻格式、檔案大小限制、時間長度限制等輸入要求,請參見音頻規格。
重要該功能不支援SDK調用。
介面地址
新加坡
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation
調用時請將{WorkspaceId}替換為真實的Workspace ID。
華北2(北京)
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation
調用時請將{WorkspaceId}替換為真實的Workspace ID。
重要阿里雲百鍊為華北2(北京)、新加坡地區推出了業務空間專屬網域名稱,能夠為推理請求提供卓越的效能和更高的穩定性,建議遷移至新網域名稱:
- 華北2(北京)地區:從
dashscope.aliyuncs.com遷移至{WorkspaceId}.cn-beijing.maas.aliyuncs.com - 新加坡地區:從
dashscope-intl.aliyuncs.com遷移至{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com
{WorkspaceId}需要替換為真實的Workspace ID。現有網域名稱仍可正常使用。
要求標頭
參數 | 類型 | 是否必選 | 說明 |
|---|---|---|---|
Authorization | string | 是 | 鑒權令牌,格式為 |
Content-Type | string | 是 | 請求參數的媒體類型,固定為 |
X-DashScope-SSE | string | 是 | 用於控制是否以SSE流式方式返回結果。設定為 |
請求參數model 指定模型名。支援Qwen-Audio-3.0-ASR-Flash和Fun-ASR-Flash系列模型,詳情請參見支援的模型與地區。 input 輸入資訊。 parameters 模型參數。 說明潤色順滑功能預設關閉,暫未開放。 潤色順滑:模型在識別語音的同時,自動清理無意義語氣詞和口吃重複,處理說話過程中的自我糾正,理順口語表達,並規範標點與文字格式設定。輸出結果更加簡潔、流暢、易讀,同時儘可能保留使用者的最終意圖和關鍵資訊。 | 以下為新加坡地區的配置,調用時請將"{WorkspaceId}"替換為真實的業務空間ID,各地區的配置不同。新加坡地區和北京地區的API Key不同。 非流式流式攜帶上下文-非流式攜帶上下文-流式Base64可輸入Base64編碼資料(Data URL),格式為:
即時熱詞 |
響應參數request_id 本次請求的唯一標識。 output 輸出結果。 usage 用量資訊。僅在 屬性 duration 已處理的音頻時間長度,單位秒。 | 非流式流式僅當音頻時間長度不少於1分鐘且設定 返回樣本: |
SSE 流式結果處理邏輯
在流式模式下,用戶端需關注以下處理要點:
- 每收到一個SSE事件,解析
data欄位中的JSON。 - 通過
output.sentence.sentence_end判斷當前句子是否結束:當該值為true時,該句識別完成,詞級時間戳記已穩定,可作為最終結果使用;當該值為false時,識別仍在進行中,文本和時間戳記可能在後續事件中更新。 usage資訊僅在句子結束事件中返回,可用於計量音頻處理時間長度。