音声合成、音声クローニング、音声デザインに適したモデルを選択します。
プロプライエタリモデルからの移行
現在、ElevenLabs、OpenAI、または Google を音声合成に使用している場合、次の表を参照して、対応する Model Studio モデルを見つけてください。
ユースケース | プロプライエタリモデル | Model Studio の対応モデル |
|---|---|---|
ビルトイン音声 / 標準合成 | OpenAI gpt-4o-tts、Google Chirp 3 |
|
カスタム音声 / 音声クローニング | ElevenLabs Multilingual v3 |
|
標準 TTS とカスタム音声の選択
音声合成モデルはテキストを自然な音声に変換します。まず、ビルトイン音声ライブラリとカスタム音声のどちらが要件に合うかを判断してください。
標準 TTS | カスタム音声 | |
|---|---|---|
音声ソース | プリセット音声ライブラリ — 即時選択・利用可能 | 音声サンプルからクローン作成、またはテキスト記述で新規作成 |
設定の手間 | 追加構成不要 — モデルと音声を選択してすぐに開始 | 音声を作成するために音声サンプルまたはテキスト記述が必要 |
ユースケース | カスタマーサービスボット、オーディオブック、ニュース放送、EC ライブ配信 | ブランド固有の音声、バーチャルアンカー、ゲームキャラクターの吹き替え |
推奨モデル |
|
|
- 標準 TTS を使用する場合:プリセット音声ライブラリが要件を満たし、追加構成なしで迅速にセットアップしたい場合です。
- カスタム音声を使用する場合:ブランド固有の音声が必要な場合、特定の人物の音声を再現したい場合、またはまったく新しいキャラクター音声を作成したい場合です。
音声クローニングと音声デザインの選択
カスタム音声を選択する場合、次の 2 種類の作成方法があります。
音声クローニング | 音声デザイン | |
|---|---|---|
入力 | 対象話者の音声サンプル | 希望する音声のテキスト記述(例:「温かみのある低音の女性の声」) |
結果 | 合成音声が元の話者に非常に近いものになる | 記述に基づいてゼロから新しい音声が生成される |
ユースケース | ブランドスポークスパーソン/アンカー音声の再利用、バーチャルアンカー、パーソナライズされた音声アシスタント | ブランド音声デザイン(録音が存在しない場合)、ゲーム/アニメーションキャラクターの吹き替え、クリエイティブコンテンツ制作 |
推奨モデル |
|
|
音声管理サービス |
|
|
- 音声クローニングを使用する場合:対象話者の録音があり、その音声を合成音声で再現したい場合です。
- 音声デザインを使用する場合:録音がなく、テキスト記述から新しい音声を作成したい場合です。
WebSocket と HTTP の選択
- WebSocket:双方向ストリーミング — ストリーミング入力および出力をサポートし、合成された音声をリアルタイムで配信することで遅延を最小限に抑えます。カスタマーサービスボット、音声アシスタント、コールセンターに最適です。
- HTTP:完全なテキストを送信し、ストリーミング応答(チャンク出力)で音声を受信します。オーディオブック、音声コンテンツ制作、その他の大量バッチ処理シナリオに最適です。
Qwen-Audio-TTS / CosyVoice モデルは、WebSocket および HTTP の両方のアクセスで同じモデル名を使用します。Qwen モデルの場合、モデル名に -realtime サフィックスが付いているものは WebSocket を、それ以外は HTTP を使用します。
Qwen-Audio-TTS / CosyVoice および Qwen WebSocket モデルには、DashScope SDK(Java、Python)を通じてアクセスします。 その他のモデルは、直接 WebSocket または HTTP 呼び出しを行う必要があります。
WebSocket アクセスについては、「リアルタイム音声合成」をご参照ください。HTTP アクセスについては、「非リアルタイム音声合成」をご参照ください。
CosyVoice シリーズのモデルは AOQ プロトコルもサポートしています。安定した遅延、弱いネットワーク環境での耐障害性、内蔵の全二重ノイズ抑制およびエコーキャンセルを重視するクライアント側統合には、AOQ を推奨します。プロトコルの比較については、「リアルタイム API の概要」をご参照ください。
命令による制御
リクエストごとに速度、感情、スタイルを自然言語で記述して、表現スタイルを制御できます。例:「ゆっくりとしたペースで優しく話す」や「興奮したアナウンス風」などです。感情豊かなコンテンツ制作、プロフェッショナルな放送、オーディオブックなど、豊かな表現力が求められるシナリオで命令による制御をご利用ください。
命令による制御をサポートするモデル:Qwen-Audio-TTS シリーズ(qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash)、 CosyVoice シリーズ(cosyvoice-v3.5-plus、cosyvoice-v3.5-flash、cosyvoice-v3-flash)、および Qwen-TTS シリーズ(qwen3-tts-instruct-flash-realtime、qwen3-tts-instruct-flash)。詳細については、「リアルタイム音声合成 > 命令による制御」をご参照ください。
推奨モデル
次の表は、各シナリオに最適なモデルを示しています。詳細については、モデルギャラリーをご覧ください。
モデル ID | シリーズ | API | 音声クローニング | 音声デザイン | 命令による制御 |
|---|---|---|---|---|---|
| Qwen-Audio-TTS | WebSocket | 対応 | 未対応 | 対応 |
| CosyVoice | WebSocket | 対応 | 対応 | 対応 |
| CosyVoice | WebSocket | 対応 | 対応 | 未対応 |
すべてのモデル
Qwen-Audio-TTS
モデル ID | API | 音声クローニング | 音声デザイン | 命令による制御 |
|---|---|---|---|---|
| WebSocket | 対応 | 未対応 | 対応 |
| WebSocket | 対応 | 未対応 | 対応 |
サポート言語:
- システム音声(音声により異なる):中国語(標準語)、英語
- クローン音声(方言は命令による制御で設定):中国語(標準語、広東語、重慶、東北、甘粛、貴州、浙江、河北、河南、湖北、湖南、江西、寧波、寧夏、青島、陝西、山西、山東、上海語、四川、雲南)、英語、日本語、韓国語、ロシア語、フランス語、ドイツ語、ポルトガル語、タイ語、インドネシア語、ベトナム語、スペイン語、イタリア語、マレーシア語、フィリピン語、アラビア語
CosyVoice
CosyVoice モデルの一部は、SSML(音声合成マークアップ言語)および LaTeX 数式読み上げをサポートしています。
モデル ID | API | 音声クローニング | 音声デザイン | 命令による制御 |
|---|---|---|---|---|
| WebSocket | 対応 | 対応 | 対応 |
| WebSocket | 対応 | 対応 | 対応 |
| WebSocket | 対応 | 対応 | 未対応 |
| WebSocket | 対応 | 対応 | 対応 |
| WebSocket | 対応 | 未対応 | 未対応 |
サポート言語(バージョン別):
-
cosyvoice-v3.5-plus および cosyvoice-v3.5-flash(システム音声なし):
- クローン音声(方言は命令による制御で設定):中国語(標準語、広東語、東北、甘粛、貴州、河南、湖北、江西、福建語、寧夏、山西、陝西、山東、上海語、四川、天津、雲南)、英語、フランス語、ドイツ語、日本語、韓国語、ロシア語、ポルトガル語、タイ語、インドネシア語、ベトナム語
- デザイン音声:中国語(標準語)、英語
-
cosyvoice-v3-plus:
- システム音声(音声により異なる):中国語(標準語)、英語
- クローン音声(方言は命令による制御で設定):中国語(標準語、広東語、東北、甘粛、貴州、河南、湖北、江西、福建語、寧夏、山西、陝西、山東、上海語、四川、天津、雲南)、英語、フランス語、ドイツ語、日本語、韓国語、ロシア語
- デザイン音声:中国語(標準語)、英語
-
cosyvoice-v3-flash:
- システム音声(音声により異なる。一部の方言はシステム音声で直接サポートされ、その他は命令による制御でサポート):中国語(標準語、広東語、東北、河南、湖南、陝西、山東、四川、安徽、福建語)、英語
- クローン音声(方言は命令による制御で設定):中国語(標準語、広東語、東北、甘粛、貴州、河南、湖北、江西、福建語、寧夏、山西、陝西、山東、上海語、四川、天津、雲南)、英語、フランス語、ドイツ語、日本語、韓国語、ロシア語、ポルトガル語、タイ語、インドネシア語、ベトナム語
- デザイン音声:中国語(標準語)、英語
-
cosyvoice-v2(音声デザイン未対応):
- システム音声(音声により異なる):中国語(標準語、広東語、東北、福建語、陝西)、英語、日本語、韓国語
- クローン音声:中国語(標準語)、英語
Qwen3-TTS
モデル ID | API | 音声クローニング | 音声デザイン | 命令による制御 |
|---|---|---|---|---|
| HTTP | 未対応 | 未対応 | 未対応 |
| HTTP | 未対応 | 未対応 | 未対応 |
| HTTP | 未対応 | 未対応 | 未対応 |
| WebSocket | 未対応 | 未対応 | 未対応 |
| WebSocket | 未対応 | 未対応 | 未対応 |
| WebSocket | 未対応 | 未対応 | 未対応 |
| HTTP | 未対応 | 未対応 | 対応 |
| HTTP | 未対応 | 未対応 | 対応 |
| WebSocket | 未対応 | 未対応 | 対応 |
| WebSocket | 未対応 | 未対応 | 対応 |
| HTTP | 対応 | 未対応 | 未対応 |
| WebSocket | 対応 | 未対応 | 未対応 |
| WebSocket | 対応 | 未対応 | 未対応 |
| HTTP | 未対応 | 対応 | 未対応 |
| WebSocket | 未対応 | 対応 | 未対応 |
| WebSocket | 未対応 | 対応 | 未対応 |
サポート言語(バージョン別):
- Qwen3-TTS-Flash シリーズ(システム音声)(
qwen3-tts-flash、qwen3-tts-flash-2025-11-27、qwen3-tts-flash-2025-09-18、qwen3-tts-flash-realtime、qwen3-tts-flash-realtime-2025-11-27、qwen3-tts-flash-realtime-2025-09-18):中国語(標準語、北京、上海語、四川、南京、陝西、福建語、天津、広東語 — 音声により異なる)、英語、ドイツ語、イタリア語、ポルトガル語、スペイン語、日本語、韓国語、フランス語、ロシア語 - Qwen3-TTS-Instruct-Flash シリーズ(システム音声)(
qwen3-tts-instruct-flash、qwen3-tts-instruct-flash-2026-01-26、qwen3-tts-instruct-flash-realtime、qwen3-tts-instruct-flash-realtime-2026-01-22):中国語(標準語)、英語、ドイツ語、イタリア語、ポルトガル語、スペイン語、日本語、韓国語、フランス語、ロシア語 - Qwen3-TTS-VC シリーズ(音声クローニング)(
qwen3-tts-vc-2026-01-22、qwen3-tts-vc-realtime-2026-01-15、qwen3-tts-vc-realtime-2025-11-27):中国語(標準語)、英語、ドイツ語、イタリア語、ポルトガル語、スペイン語、日本語、韓国語、フランス語、ロシア語 - Qwen3-TTS-VD シリーズ(音声デザイン)(
qwen3-tts-vd-2026-01-26、qwen3-tts-vd-realtime-2026-01-15、qwen3-tts-vd-realtime-2025-12-16):中国語(標準語)、英語、ドイツ語、イタリア語、ポルトガル語、スペイン語、日本語、韓国語、フランス語、ロシア語
Qwen-TTS(レガシ、トークンベース課金)
以下のレガシ Qwen-TTS モデルはトークンベース課金を使用します。Qwen3-TTS に移行済みの場合は、本トピックの前半で推奨されているモデルをご利用ください。
モデル ID | API | 説明 |
|---|---|---|
| HTTP | 非ストリーミング合成、トークンベース課金 |
| HTTP | 非ストリーミング合成、トークンベース課金 |
| HTTP | スナップショットバージョン、トークンベース課金 |
| HTTP | スナップショットバージョン、トークンベース課金 |
| WebSocket | ストリーミング合成、トークンベース課金 |
| WebSocket | ストリーミング合成、トークンベース課金 |
| WebSocket | スナップショットバージョン、ストリーミング合成、トークンベース課金 |
サポート言語(バージョン別):
- Qwen-TTS シリーズ(システム音声)(
qwen-tts、qwen-tts-latest、qwen-tts-2025-05-22、qwen-tts-2025-04-10):中国語(標準語、北京、上海語、四川 — 音声により異なる)、英語、ドイツ語、イタリア語、ポルトガル語、スペイン語、日本語、韓国語、フランス語、ロシア語 - Qwen-TTS-Realtime シリーズ(システム音声)(
qwen-tts-realtime、qwen-tts-realtime-latest、qwen-tts-realtime-2025-07-15):中国語(標準語)、英語、ドイツ語、イタリア語、ポルトガル語、スペイン語、日本語、韓国語、フランス語、ロシア語