Qwen-Audio-3.1-TTS-Nextは、統合的な音声生成のために設計されたAudioGenモデルです。音声合成のみに焦点を当てる従来のTTSシステムを超え、テキスト、タイムスタンプ、参照音声などの入力から一度の処理で完全な音声コンテンツを生成でき、音声、効果音、環境音などをシームレスに組み合わせることができます。このモデルは、多言語TTS、単一話者音声、複数話者ダイアログ、ポッドキャスト、映画のようなサウンドスケープ、環境オーディオ、効果音など、幅広いタスクをサポートしています。主な強みとして、より自然で表現力豊かな音声、一貫した声のアイデンティティ、柔軟なタイミング制御、高品質なサウンドスケープ生成が挙げられます。これらの機能により、コンテンツ制作、ショート動画、ポッドキャスト、映画・テレビ制作、ゲームオーディオ、その他の専門的な音声制作シナリオに非常に適しています。
推論サービスプロバイダー
Alibaba Cloud Model Studioがこのモデルの推論サービスを提供します。
モデル機能
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
| 入力モダリティ | テキストおよび参照音声 | 出力モダリティ | 音声 |
| 言語 | 中国語および英語 | 出力モード | 非ストリーミング |
| 出力形式 | WAV、MP3、およびPCM | 参照音声 | URLまたはBase64 |
コンテキストの制限
| パラメータ | 値 |
|---|---|
| 最大入力長 | 3,000文字 |
| リクエストあたりの最大出力時間 | ポッドキャスト:240秒(4分)、その他のシナリオ:120秒 |
| 参照音声数 | 最大3クリップ |
| 参照クリップあたりの長さ | 最大30秒 |
| 参照クリップあたりのサイズ | 最大10 MB |
| 参照音声フォーマット | WAV、MP3、およびOGG Opus。Raw PCMはサポートされていません。 |
モデル料金
以下の定価にはプロモーションは含まれていません。プロモーション情報については、Model Studioコンソールを参照してください。
中国(北京)
| 課金項目 | 単価(USD/百万トークン) |
|---|---|
| 入力 | 0.848 |
| 出力 | 1.696 |
入力トークンと出力トークンは別々に課金されます。詳細については、モデル料金を参照してください。
レート制限
中国(北京)
| メトリック | 値 |
|---|---|
| 1秒あたりのリクエスト数(RPS) | 3 |
APIアクセス
HTTPS APIを使用して完全な音声ファイルを受信します。例やプロンプトのガイダンスについては、音声生成を参照してください。パラメータやサンプルコードについては、音声生成APIリファレンスを参照してください。