qwen-audio-3.0-tts-flash は、リアルタイムのインタラクティブなシナリオに最適化された、高性能な音声合成モデルです。以前のバージョンと比較して、より多くの低リソース言語と中国語の方言をサポートし、方言の忠実性を向上させ、自由形式の命令フォローと詳細なタグコントロールを強化して、感情、トーン、キャラクター、話速、音量、表現スタイルをより柔軟に制御できます。また、ノイズや残響のある音響条件下でも堅牢性が向上し、音質、明瞭さ、全体的な表現力が改善されています。Flash バージョンはリアルタイム合成に重点を置いており、初回パケットレイテンシーは 200 ms 以内に制御されているため、音声アシスタント、リアルタイム対話、インテリジェントカスタマーサービス、その他の低レイテンシーのインタラクティブなアプリケーションに適しています。
推論サービスプロバイダー
qwen-audio-3.0-tts-flash の推論サービスプロバイダーは Alibaba Cloud Model Studio です。
モデルの機能
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト | 出力モダリティ | オーディオ |
モデル体験 | 非対応 | Function Calling | 非対応 |
構造化出力 | 非対応 | Web 検索 | 非対応 |
プレフィックス補完 | 非対応 | コンテキストキャッシュ | 非対応 |
バッチ推論 | 非対応 | ファインチューニング | 非対応 |
コンテキスト制限
| パラメーター | 値 | パラメーター | 値 |
|---|---|---|---|
最大入力長 | — | 最大出力長 | — |
コンテキストウィンドウ | — |
料金
このページには、期間限定プロモーションを除いた、モデル API 呼び出しの基本料金のみが表示されています。プロモーション情報については、Model Studio コンソールをご参照ください。
中国 (北京)
| 課金項目 | 価格 (米ドル) | 単位 |
|---|---|---|
TTS | 0.137521 | 10,000 文字あたり |
シンガポール
範囲:国際
| 課金項目 | 価格 (米ドル) | 単位 |
|---|---|---|
TTS | 0.15 | 10,000 文字あたり |
レート制限
中国 (北京)
| パラメーター | 値 |
|---|---|
RPM (1分あたりのリクエスト数) | 180 |
シンガポール
範囲:国際
| パラメーター | 値 |
|---|---|
RPM (1分あたりのリクエスト数) | 180 |