Qwen3-TTS-VD モデルは、Tongyi の最新のリアルタイム音声合成モデルです。qwen3-voice-design サービスで設計された音声に対して、忠実度の高いリアルタイム音声合成を実行でき、同じ音声を使用して 11 言語での音声出力をサポートします。このモデルは膨大なデータでトレーニングされており、合成された音声はテキストに応じてトーンを自動的に調整できるため、複雑なテキスト合成に対しても優れた処理能力を発揮します。このモデルは、2026 年 1 月 26 日時点のスナップショットバージョンです。
モデルの機能
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト | 出力モダリティ | オーディオ |
モデル体験 | 非対応 | Function Calling | 非対応 |
構造化出力 | 非対応 | Web 検索 | 非対応 |
プレフィックス補完 | 非対応 | コンテキストキャッシュ | 非対応 |
バッチ推論 | 非対応 | ファインチューニング | 非対応 |
コンテキスト制限
| パラメーター | 値 | パラメーター | 値 |
|---|---|---|---|
最大入力長 | — | 最大出力長 | — |
コンテキストウィンドウ | — |
料金
このページには、期間限定のプロモーションを除いた、モデルの API 呼び出しの基本料金のみが記載されています。プロモーションオファーについては、Model Studio コンソールをご参照ください。
中国 (北京)
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
TTS | 0.115 | 10,000 文字あたり |
レート制限
中国 (北京)
| パラメーター | 値 |
|---|---|
RPM (1 分あたりのリクエスト数) | 180 |
スナップショットバージョン
qwen3-tts-vd-2026-01-26
Qwen3-TTS-VD モデルは、Tongyi の最新のリアルタイム音声合成モデルです。qwen3-voice-design サービスで設計された音声に対して、忠実度の高いリアルタイム音声合成を実行でき、同じ音声を使用して 11 言語での音声出力をサポートします。このモデルは膨大なデータでトレーニングされており、合成された音声はテキストに応じてトーンを自動的に調整できるため、複雑なテキスト合成に対しても優れた処理能力を発揮します。このモデルは、2026 年 1 月 26 日時点のスナップショットバージョンです。
モデルの機能
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト | 出力モダリティ | オーディオ |
モデル体験 | 非対応 | Function Calling | 非対応 |
構造化出力 | 非対応 | Web 検索 | 非対応 |
プレフィックス補完 | 非対応 | コンテキストキャッシュ | 非対応 |
バッチ推論 | 非対応 | ファインチューニング | 非対応 |
コンテキスト制限
| パラメーター | 値 | パラメーター | 値 |
|---|---|---|---|
最大入力長 | — | 最大出力長 | — |
コンテキストウィンドウ | — |
料金
このページには、期間限定のプロモーションを除いた、モデルの API 呼び出しの基本料金のみが記載されています。プロモーションオファーについては、Model Studio コンソールをご参照ください。
中国 (北京)
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
TTS | 0.115 | 10,000 文字あたり |
レート制限
中国 (北京)
| パラメーター | 値 |
|---|---|
RPM (1 分あたりのリクエスト数) | 180 |