全部產品
Search
文件中心

Alibaba Cloud Model Studio:qwen-audio-3.1-tts-next

更新時間:Sep 23, 2026

qwen-audio-3.1-tts-next 是一款面向統一音訊產生的 Audiogen 模型,不再侷限於傳統 TTS 的單一語音合成,而是能夠圍繞文字、時間戳記和參考音訊等輸入,一次產生完整的音訊內容,包括人聲、音效、環境音等。模型支援多語種 TTS、單人說話、多人對話、Podcast 播客、影視劇聲景、環境音與音效等任務。其核心亮點在於更自然的人聲表達、穩定的音色保持、靈活的時間控制,以及高品質綜合聲景產生能力,適用於內容創作、短影片、播客、影視和遊戲音訊製作等場景。

推理服務供應商

本模型的推論服務由阿里雲百煉提供。

模型能力

能力項目支援情況能力項目支援情況
輸入模態文字、參考音訊輸出模態音訊
語言中文、英文輸出方式非串流
輸出格式WAV、MP3、PCM參考音訊URL 或 Base64

上下文限制

參數值
最大輸入長度3000 字元
單次產生音訊時長上限Podcast:240 秒(4 分鐘);其他場景:120 秒
參考音訊數量最多 3 筆
單筆參考音訊時長最長 30 秒
單筆參考音訊大小不超過 10 MB
參考音訊格式WAV、MP3、OGG Opus;不支援裸 PCM

模型價格

本文僅展示模型調用原價,不包含限時優惠。活動資訊請參見百炼控制台。

华北2(北京)

計費項目單價(美元/百萬 Token)
輸入0.848
輸出1.696

按輸入和輸出 Token 數分別計費。詳情請參見模型調用計費。

限流

华北2(北京)

指標數值
每秒鐘調用次數(RPS)3

呼叫方式

透過 HTTPS API 調用,返回完整音訊檔案。效果與提示詞寫法請參見音訊產生,請求參數及範例請參見音訊產生 API 參考。