qwen-audio-3.1-tts-next 是一款面向統一音訊產生的 Audiogen 模型,不再侷限於傳統 TTS 的單一語音合成,而是能夠圍繞文字、時間戳記和參考音訊等輸入,一次產生完整的音訊內容,包括人聲、音效、環境音等。模型支援多語種 TTS、單人說話、多人對話、Podcast 播客、影視劇聲景、環境音與音效等任務。其核心亮點在於更自然的人聲表達、穩定的音色保持、靈活的時間控制,以及高品質綜合聲景產生能力,適用於內容創作、短影片、播客、影視和遊戲音訊製作等場景。
推理服務供應商
本模型的推論服務由阿里雲百煉提供。
模型能力
| 能力項目 | 支援情況 | 能力項目 | 支援情況 |
|---|---|---|---|
| 輸入模態 | 文字、參考音訊 | 輸出模態 | 音訊 |
| 語言 | 中文、英文 | 輸出方式 | 非串流 |
| 輸出格式 | WAV、MP3、PCM | 參考音訊 | URL 或 Base64 |
上下文限制
| 參數 | 值 |
|---|---|
| 最大輸入長度 | 3000 字元 |
| 單次產生音訊時長上限 | Podcast:240 秒(4 分鐘);其他場景:120 秒 |
| 參考音訊數量 | 最多 3 筆 |
| 單筆參考音訊時長 | 最長 30 秒 |
| 單筆參考音訊大小 | 不超過 10 MB |
| 參考音訊格式 | WAV、MP3、OGG Opus;不支援裸 PCM |
模型價格
本文僅展示模型調用原價,不包含限時優惠。活動資訊請參見百炼控制台。
华北2(北京)
| 計費項目 | 單價(美元/百萬 Token) |
|---|---|
| 輸入 | 0.848 |
| 輸出 | 1.696 |
按輸入和輸出 Token 數分別計費。詳情請參見模型調用計費。
限流
华北2(北京)
| 指標 | 數值 |
|---|---|
| 每秒鐘調用次數(RPS) | 3 |
呼叫方式
透過 HTTPS API 調用,返回完整音訊檔案。效果與提示詞寫法請參見音訊產生,請求參數及範例請參見音訊產生 API 參考。