すべてのプロダクト
Search
ドキュメントセンター

Alibaba Cloud Model Studio:音声合成の概要

最終更新日:Sep 03, 2026

音声合成、音声クローニング、音声デザインに適したモデルを選択します。

プロプライエタリモデルからの移行

現在、ElevenLabs、OpenAI、または Google を音声合成に使用している場合、次の表を参照して、対応する Model Studio モデルを見つけてください。

ユースケース

プロプライエタリモデル

Model Studio の対応モデル

ビルトイン音声 / 標準合成

OpenAI gpt-4o-tts、Google Chirp 3

qwen-audio-3.0-tts-plus

カスタム音声 / 音声クローニング

ElevenLabs Multilingual v3

qwen-audio-3.0-tts-flash(音声クローニング)、cosyvoice-v3.5-plus(音声デザイン)

標準 TTS とカスタム音声の選択

音声合成モデルはテキストを自然な音声に変換します。まず、ビルトイン音声ライブラリとカスタム音声のどちらが要件に合うかを判断してください。

標準 TTS

カスタム音声

音声ソース

プリセット音声ライブラリ — 即時選択・利用可能

音声サンプルからクローン作成、またはテキスト記述で新規作成

設定の手間

追加構成不要 — モデルと音声を選択してすぐに開始

音声を作成するために音声サンプルまたはテキスト記述が必要

ユースケース

カスタマーサービスボット、オーディオブック、ニュース放送、EC ライブ配信

ブランド固有の音声、バーチャルアンカー、ゲームキャラクターの吹き替え

推奨モデル

qwen-audio-3.0-tts-plus

qwen-audio-3.0-tts-plus(音声クローニング)、cosyvoice-v3.5-plus(音声デザイン)

  • 標準 TTS を使用する場合:プリセット音声ライブラリが要件を満たし、追加構成なしで迅速にセットアップしたい場合です。
  • カスタム音声を使用する場合:ブランド固有の音声が必要な場合、特定の人物の音声を再現したい場合、またはまったく新しいキャラクター音声を作成したい場合です。

音声クローニングと音声デザインの選択

カスタム音声を選択する場合、次の 2 種類の作成方法があります。

音声クローニング

音声デザイン

入力

対象話者の音声サンプル

希望する音声のテキスト記述(例:「温かみのある低音の女性の声」)

結果

合成音声が元の話者に非常に近いものになる

記述に基づいてゼロから新しい音声が生成される

ユースケース

ブランドスポークスパーソン/アンカー音声の再利用、バーチャルアンカー、パーソナライズされた音声アシスタント

ブランド音声デザイン(録音が存在しない場合)、ゲーム/アニメーションキャラクターの吹き替え、クリエイティブコンテンツ制作

推奨モデル

qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash

cosyvoice-v3.5-plus、cosyvoice-v3.5-flash

音声管理サービス

voice-enrollment(音声の登録および管理)

voice-enrollment(音声の登録および管理)

  • 音声クローニングを使用する場合:対象話者の録音があり、その音声を合成音声で再現したい場合です。
  • 音声デザインを使用する場合:録音がなく、テキスト記述から新しい音声を作成したい場合です。

WebSocket と HTTP の選択

  • WebSocket:双方向ストリーミング — ストリーミング入力および出力をサポートし、合成された音声をリアルタイムで配信することで遅延を最小限に抑えます。カスタマーサービスボット、音声アシスタント、コールセンターに最適です。
  • HTTP:完全なテキストを送信し、ストリーミング応答(チャンク出力)で音声を受信します。オーディオブック、音声コンテンツ制作、その他の大量バッチ処理シナリオに最適です。

Qwen-Audio-TTS / CosyVoice モデルは、WebSocket および HTTP の両方のアクセスで同じモデル名を使用します。Qwen モデルの場合、モデル名に -realtime サフィックスが付いているものは WebSocket を、それ以外は HTTP を使用します。

Qwen-Audio-TTS / CosyVoice および Qwen WebSocket モデルには、DashScope SDK(Java、Python)を通じてアクセスします。 その他のモデルは、直接 WebSocket または HTTP 呼び出しを行う必要があります。

WebSocket アクセスについては、「リアルタイム音声合成」をご参照ください。HTTP アクセスについては、「非リアルタイム音声合成」をご参照ください。

CosyVoice シリーズのモデルは AOQ プロトコルもサポートしています。安定した遅延、弱いネットワーク環境での耐障害性、内蔵の全二重ノイズ抑制およびエコーキャンセルを重視するクライアント側統合には、AOQ を推奨します。プロトコルの比較については、「リアルタイム API の概要」をご参照ください。

命令による制御

リクエストごとに速度、感情、スタイルを自然言語で記述して、表現スタイルを制御できます。例:「ゆっくりとしたペースで優しく話す」や「興奮したアナウンス風」などです。感情豊かなコンテンツ制作、プロフェッショナルな放送、オーディオブックなど、豊かな表現力が求められるシナリオで命令による制御をご利用ください。

命令による制御をサポートするモデル:Qwen-Audio-TTS シリーズ(qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash)、 CosyVoice シリーズ(cosyvoice-v3.5-plus、cosyvoice-v3.5-flash、cosyvoice-v3-flash)、および Qwen-TTS シリーズ(qwen3-tts-instruct-flash-realtime、qwen3-tts-instruct-flash)。詳細については、「リアルタイム音声合成 > 命令による制御」をご参照ください。

推奨モデル

次の表は、各シナリオに最適なモデルを示しています。詳細については、モデルギャラリーをご覧ください。

モデル ID

シリーズ

API

音声クローニング

音声デザイン

命令による制御

qwen-audio-3.0-tts-plus

Qwen-Audio-TTS

WebSocket

対応

未対応

対応

cosyvoice-v3.5-plus

CosyVoice

WebSocket

対応

対応

対応

cosyvoice-v3-plus

CosyVoice

WebSocket

対応

対応

未対応

すべてのモデル

Qwen-Audio-TTS

モデル ID

API

音声クローニング

音声デザイン

命令による制御

qwen-audio-3.0-tts-plus

WebSocket

対応

未対応

対応

qwen-audio-3.0-tts-flash

WebSocket

対応

未対応

対応

サポート言語:

  • システム音声(音声により異なる):中国語(標準語)、英語
  • クローン音声(方言は命令による制御で設定):中国語(標準語、広東語、重慶、東北、甘粛、貴州、浙江、河北、河南、湖北、湖南、江西、寧波、寧夏、青島、陝西、山西、山東、上海語、四川、雲南)、英語、日本語、韓国語、ロシア語、フランス語、ドイツ語、ポルトガル語、タイ語、インドネシア語、ベトナム語、スペイン語、イタリア語、マレーシア語、フィリピン語、アラビア語

CosyVoice

CosyVoice モデルの一部は、SSML(音声合成マークアップ言語)および LaTeX 数式読み上げをサポートしています。

モデル ID

API

音声クローニング

音声デザイン

命令による制御

cosyvoice-v3.5-plus

WebSocket

対応

対応

対応

cosyvoice-v3.5-flash

WebSocket

対応

対応

対応

cosyvoice-v3-plus

WebSocket

対応

対応

未対応

cosyvoice-v3-flash

WebSocket

対応

対応

対応

cosyvoice-v2

WebSocket

対応

未対応

未対応

サポート言語(バージョン別):

  • cosyvoice-v3.5-plus および cosyvoice-v3.5-flash(システム音声なし):

    • クローン音声(方言は命令による制御で設定):中国語(標準語、広東語、東北、甘粛、貴州、河南、湖北、江西、福建語、寧夏、山西、陝西、山東、上海語、四川、天津、雲南)、英語、フランス語、ドイツ語、日本語、韓国語、ロシア語、ポルトガル語、タイ語、インドネシア語、ベトナム語
    • デザイン音声:中国語(標準語)、英語
  • cosyvoice-v3-plus:

    • システム音声(音声により異なる):中国語(標準語)、英語
    • クローン音声(方言は命令による制御で設定):中国語(標準語、広東語、東北、甘粛、貴州、河南、湖北、江西、福建語、寧夏、山西、陝西、山東、上海語、四川、天津、雲南)、英語、フランス語、ドイツ語、日本語、韓国語、ロシア語
    • デザイン音声:中国語(標準語)、英語
  • cosyvoice-v3-flash:

    • システム音声(音声により異なる。一部の方言はシステム音声で直接サポートされ、その他は命令による制御でサポート):中国語(標準語、広東語、東北、河南、湖南、陝西、山東、四川、安徽、福建語)、英語
    • クローン音声(方言は命令による制御で設定):中国語(標準語、広東語、東北、甘粛、貴州、河南、湖北、江西、福建語、寧夏、山西、陝西、山東、上海語、四川、天津、雲南)、英語、フランス語、ドイツ語、日本語、韓国語、ロシア語、ポルトガル語、タイ語、インドネシア語、ベトナム語
    • デザイン音声:中国語(標準語)、英語
  • cosyvoice-v2(音声デザイン未対応):

    • システム音声(音声により異なる):中国語(標準語、広東語、東北、福建語、陝西)、英語、日本語、韓国語
    • クローン音声:中国語(標準語)、英語

Qwen3-TTS

モデル ID

API

音声クローニング

音声デザイン

命令による制御

qwen3-tts-flash

HTTP

未対応

未対応

未対応

qwen3-tts-flash-2025-11-27

HTTP

未対応

未対応

未対応

qwen3-tts-flash-2025-09-18

HTTP

未対応

未対応

未対応

qwen3-tts-flash-realtime

WebSocket

未対応

未対応

未対応

qwen3-tts-flash-realtime-2025-11-27

WebSocket

未対応

未対応

未対応

qwen3-tts-flash-realtime-2025-09-18

WebSocket

未対応

未対応

未対応

qwen3-tts-instruct-flash

HTTP

未対応

未対応

対応

qwen3-tts-instruct-flash-2026-01-26

HTTP

未対応

未対応

対応

qwen3-tts-instruct-flash-realtime

WebSocket

未対応

未対応

対応

qwen3-tts-instruct-flash-realtime-2026-01-22

WebSocket

未対応

未対応

対応

qwen3-tts-vc-2026-01-22

HTTP

対応

未対応

未対応

qwen3-tts-vc-realtime-2026-01-15

WebSocket

対応

未対応

未対応

qwen3-tts-vc-realtime-2025-11-27

WebSocket

対応

未対応

未対応

qwen3-tts-vd-2026-01-26

HTTP

未対応

対応

未対応

qwen3-tts-vd-realtime-2026-01-15

WebSocket

未対応

対応

未対応

qwen3-tts-vd-realtime-2025-12-16

WebSocket

未対応

対応

未対応

サポート言語(バージョン別):

  • Qwen3-TTS-Flash シリーズ(システム音声)(qwen3-tts-flash、qwen3-tts-flash-2025-11-27、qwen3-tts-flash-2025-09-18、qwen3-tts-flash-realtime、qwen3-tts-flash-realtime-2025-11-27、qwen3-tts-flash-realtime-2025-09-18):中国語(標準語、北京、上海語、四川、南京、陝西、福建語、天津、広東語 — 音声により異なる)、英語、ドイツ語、イタリア語、ポルトガル語、スペイン語、日本語、韓国語、フランス語、ロシア語
  • Qwen3-TTS-Instruct-Flash シリーズ(システム音声)(qwen3-tts-instruct-flash、qwen3-tts-instruct-flash-2026-01-26、qwen3-tts-instruct-flash-realtime、qwen3-tts-instruct-flash-realtime-2026-01-22):中国語(標準語)、英語、ドイツ語、イタリア語、ポルトガル語、スペイン語、日本語、韓国語、フランス語、ロシア語
  • Qwen3-TTS-VC シリーズ(音声クローニング)(qwen3-tts-vc-2026-01-22、qwen3-tts-vc-realtime-2026-01-15、qwen3-tts-vc-realtime-2025-11-27):中国語(標準語)、英語、ドイツ語、イタリア語、ポルトガル語、スペイン語、日本語、韓国語、フランス語、ロシア語
  • Qwen3-TTS-VD シリーズ(音声デザイン)(qwen3-tts-vd-2026-01-26、qwen3-tts-vd-realtime-2026-01-15、qwen3-tts-vd-realtime-2025-12-16):中国語(標準語)、英語、ドイツ語、イタリア語、ポルトガル語、スペイン語、日本語、韓国語、フランス語、ロシア語

Qwen-TTS(レガシ、トークンベース課金)

以下のレガシ Qwen-TTS モデルはトークンベース課金を使用します。Qwen3-TTS に移行済みの場合は、本トピックの前半で推奨されているモデルをご利用ください。

モデル ID

API

説明

qwen-tts

HTTP

非ストリーミング合成、トークンベース課金

qwen-tts-latest

HTTP

非ストリーミング合成、トークンベース課金

qwen-tts-2025-05-22

HTTP

スナップショットバージョン、トークンベース課金

qwen-tts-2025-04-10

HTTP

スナップショットバージョン、トークンベース課金

qwen-tts-realtime

WebSocket

ストリーミング合成、トークンベース課金

qwen-tts-realtime-latest

WebSocket

ストリーミング合成、トークンベース課金

qwen-tts-realtime-2025-07-15

WebSocket

スナップショットバージョン、ストリーミング合成、トークンベース課金

サポート言語(バージョン別):

  • Qwen-TTS シリーズ(システム音声)(qwen-tts、qwen-tts-latest、qwen-tts-2025-05-22、qwen-tts-2025-04-10):中国語(標準語、北京、上海語、四川 — 音声により異なる)、英語、ドイツ語、イタリア語、ポルトガル語、スペイン語、日本語、韓国語、フランス語、ロシア語
  • Qwen-TTS-Realtime シリーズ(システム音声)(qwen-tts-realtime、qwen-tts-realtime-latest、qwen-tts-realtime-2025-07-15):中国語(標準語)、英語、ドイツ語、イタリア語、ポルトガル語、スペイン語、日本語、韓国語、フランス語、ロシア語