すべてのプロダクト
Search
ドキュメントセンター

Alibaba Cloud Model Studio:音声生成

最終更新日:Sep 23, 2026

テキストの説明と参照音声から、音声、効果音、環境音を同時に生成して、完全なオーディオシーンを作成します。ダイアログやポッドキャスト向けの例やプロンプト作成テクニックをご覧ください。

ユースケース

音声生成は、テキストを音声に変換するだけではありません。音声、効果音、環境音を組み合わせて生成し、完全なオーディオシーンを作成できます。

  • 音声とダイアログ:ナレーション、複数話者のダイアログ、ポッドキャスト、オーディオブック、オーディオドラマ。
  • オーディオシーン:雨、波の音、またはゲームの効果音を伴うダイアログ。

固定のスクリプトを音声に変換する場合は、音声合成も使用できます。シーン内の話者やその他の音の両方を記述する必要がある場合は、音声生成を使用してください。

例

さまざまなシナリオのプロンプトと生成された音声をご覧ください。同じプロンプトでも、リクエストごとに結果が異なる場合があります。

シナリオプロンプト音声
ゲームボイスオーバー
NPC dialogue for a battle scene in a game. At a temporary aid station on the edge of a battlefield, a medic treats wounded soldiers and calls out over the chaos. Background sounds include distant battle cries, wounded soldiers groaning, and fabric tearing. The medic is a thirty-five-year-old woman with an urgent, resolute voice, full of anxiety and concern, speaking quickly. She shouts in English: "Quick! Get the wounded down here! There's another one! Stay with me. Don't close your eyes! A stretcher! Where's the stretcher? Keep pressure on the wound! A medic is on the way! All of you, hang in there!"
映画のセリフ
An English-language film scene on an almost empty railway platform at night. Rain ticks against a metal roof, and an idling train rumbles in the distance. Owen, a man around thirty with a tired, low voice, speaks to his older sister Ruth, whose voice is firm but trembling underneath. Owen says quietly, "You didn't have to come." Ruth replies, "You left your scarf." A brief rustle of fabric. Owen gives a faint, breathy laugh. "It's summer." Ruth says, "It gets cold where you're going." A departure whistle sounds far away. Owen's voice softens: "I'll call when I get there." Ruth takes a breath and answers, "Call before that." Footsteps move toward the train; keep the rain audible as the dialogue ends. No narrator and no background score.

プロンプトの作成

必要なサウンドを1つのプロンプトで記述し、セリフと場面指示を区別してください。

要素例
タスク「2人のポッドキャストホストによるオープニングトーク」または「雨の中のセリフを含むオーディオドラマのシーン」
キャラクターと声「キャラクターAは低い男性の声、キャラクターBは明るい女性の声」
ダイアログ発話内容を引用符で囲み、話者を特定します
話し方「ささやく」「驚いた様子」「続ける前に少し間を置く」
背景音と効果音「窓の外は雨で、室内では静かにページをめくる音」
音の遷移「キャラクターが話し始める前に足音が近づく」

まず核心的なダイアログと音を記述し、その後必要なスタイルの指示を追加します。一貫したキャラクター名を使用し、矛盾する声や感情の指示は避けてください。音の遷移を記述するには、順序立てた指示を使用します。

参照音声の使用

公開アクセス可能な音声URLまたはBase64エンコードされた音声を指定してください。プロンプト内で@voice1、@voice2、@voice3を使用して、提供された順序でクリップを参照します。

例えば、2つの参照クリップを使用する場合:

@voice1 cheerfully says: "What a lovely day." @voice2 laughs nearby.

qwen-audio-3.1-tts-nextは最大3つのクリップを受け付けます。各クリップの長さは30秒以下、サイズは10 MB以下である必要があります。サポートされている参照フォーマットはWAV、MP3、およびOGG Opusです。生のPCMはサポートされていません。各クリップについて、URLまたはBase64データのいずれかを指定してください。指定するURLは、サービスからアクセス可能である必要があります。

サポートされているモデル

モデル言語最大入力長リクエストあたりの最大出力時間
qwen-audio-3.1-tts-next中国語および英語3,000文字ポッドキャスト:240秒(4分)、その他のシナリオ:120秒

料金と制限については、モデルの詳細を参照してください。

連携と課金

  • 認証、パラメータ、および参照音声のリクエストについては、音声生成APIリファレンスを参照してください。
  • 課金は生成された元の音声の長さに基づきます。話速を変更しても課金対象の時間は変わりません。モデルの料金を参照してください。