すべてのプロダクト
Search
ドキュメントセンター

Alibaba Cloud Model Studio:qwen-audio-3.1-tts-next

最終更新日:Sep 23, 2026

Qwen-Audio-3.1-TTS-Nextは、統合的な音声生成のために設計されたAudioGenモデルです。音声合成のみに焦点を当てる従来のTTSシステムを超え、テキスト、タイムスタンプ、参照音声などの入力から一度の処理で完全な音声コンテンツを生成でき、音声、効果音、環境音などをシームレスに組み合わせることができます。このモデルは、多言語TTS、単一話者音声、複数話者ダイアログ、ポッドキャスト、映画のようなサウンドスケープ、環境オーディオ、効果音など、幅広いタスクをサポートしています。主な強みとして、より自然で表現力豊かな音声、一貫した声のアイデンティティ、柔軟なタイミング制御、高品質なサウンドスケープ生成が挙げられます。これらの機能により、コンテンツ制作、ショート動画、ポッドキャスト、映画・テレビ制作、ゲームオーディオ、その他の専門的な音声制作シナリオに非常に適しています。

推論サービスプロバイダー

Alibaba Cloud Model Studioがこのモデルの推論サービスを提供します。

モデル機能

機能サポート機能サポート
入力モダリティテキストおよび参照音声出力モダリティ音声
言語中国語および英語出力モード非ストリーミング
出力形式WAV、MP3、およびPCM参照音声URLまたはBase64

コンテキストの制限

パラメータ値
最大入力長3,000文字
リクエストあたりの最大出力時間ポッドキャスト:240秒(4分)、その他のシナリオ:120秒
参照音声数最大3クリップ
参照クリップあたりの長さ最大30秒
参照クリップあたりのサイズ最大10 MB
参照音声フォーマットWAV、MP3、およびOGG Opus。Raw PCMはサポートされていません。

モデル料金

以下の定価にはプロモーションは含まれていません。プロモーション情報については、Model Studioコンソールを参照してください。

中国(北京)

課金項目単価(USD/百万トークン)
入力0.848
出力1.696

入力トークンと出力トークンは別々に課金されます。詳細については、モデル料金を参照してください。

レート制限

中国(北京)

メトリック値
1秒あたりのリクエスト数(RPS)3

APIアクセス

HTTPS APIを使用して完全な音声ファイルを受信します。例やプロンプトのガイダンスについては、音声生成を参照してください。パラメータやサンプルコードについては、音声生成APIリファレンスを参照してください。