テキストの説明と参照音声から、音声、効果音、環境音を同時に生成して、完全なオーディオシーンを作成します。ダイアログやポッドキャスト向けの例やプロンプト作成テクニックをご覧ください。
ユースケース
音声生成は、テキストを音声に変換するだけではありません。音声、効果音、環境音を組み合わせて生成し、完全なオーディオシーンを作成できます。
- 音声とダイアログ:ナレーション、複数話者のダイアログ、ポッドキャスト、オーディオブック、オーディオドラマ。
- オーディオシーン:雨、波の音、またはゲームの効果音を伴うダイアログ。
固定のスクリプトを音声に変換する場合は、音声合成も使用できます。シーン内の話者やその他の音の両方を記述する必要がある場合は、音声生成を使用してください。
例
さまざまなシナリオのプロンプトと生成された音声をご覧ください。同じプロンプトでも、リクエストごとに結果が異なる場合があります。
| シナリオ | プロンプト | 音声 |
|---|---|---|
| ゲームボイスオーバー | | |
| 映画のセリフ | |
プロンプトの作成
必要なサウンドを1つのプロンプトで記述し、セリフと場面指示を区別してください。
| 要素 | 例 |
|---|---|
| タスク | 「2人のポッドキャストホストによるオープニングトーク」または「雨の中のセリフを含むオーディオドラマのシーン」 |
| キャラクターと声 | 「キャラクターAは低い男性の声、キャラクターBは明るい女性の声」 |
| ダイアログ | 発話内容を引用符で囲み、話者を特定します |
| 話し方 | 「ささやく」「驚いた様子」「続ける前に少し間を置く」 |
| 背景音と効果音 | 「窓の外は雨で、室内では静かにページをめくる音」 |
| 音の遷移 | 「キャラクターが話し始める前に足音が近づく」 |
まず核心的なダイアログと音を記述し、その後必要なスタイルの指示を追加します。一貫したキャラクター名を使用し、矛盾する声や感情の指示は避けてください。音の遷移を記述するには、順序立てた指示を使用します。
参照音声の使用
公開アクセス可能な音声URLまたはBase64エンコードされた音声を指定してください。プロンプト内で@voice1、@voice2、@voice3を使用して、提供された順序でクリップを参照します。
例えば、2つの参照クリップを使用する場合:
@voice1 cheerfully says: "What a lovely day." @voice2 laughs nearby.
qwen-audio-3.1-tts-nextは最大3つのクリップを受け付けます。各クリップの長さは30秒以下、サイズは10 MB以下である必要があります。サポートされている参照フォーマットはWAV、MP3、およびOGG Opusです。生のPCMはサポートされていません。各クリップについて、URLまたはBase64データのいずれかを指定してください。指定するURLは、サービスからアクセス可能である必要があります。
サポートされているモデル
| モデル | 言語 | 最大入力長 | リクエストあたりの最大出力時間 |
|---|---|---|---|
| qwen-audio-3.1-tts-next | 中国語および英語 | 3,000文字 | ポッドキャスト:240秒(4分)、その他のシナリオ:120秒 |
料金と制限については、モデルの詳細を参照してください。
連携と課金
- 認証、パラメータ、および参照音声のリクエストについては、音声生成APIリファレンスを参照してください。
- 課金は生成された元の音声の長さに基づきます。話速を変更しても課金対象の時間は変わりません。モデルの料金を参照してください。