text_typestring(必須)
PlainText に設定します。
voicestring(必須)
音声合成に使用する音声。
formatstring(任意)
音声エンコーディングフォーマット。
有効な値:
sample_rateinteger(任意)
音声サンプルレート (単位:Hz)。
有効な値:8000、16000、22050 (デフォルト)、24000、44100、48000。
volumeinteger(任意)
音量レベル。
デフォルト値:50。
有効な値の範囲:[0, 100]。
ratefloat(任意)
話速。
デフォルト値:1.0。
有効な値の範囲:[0.5, 2.0]。
pitchfloat(任意)
ピッチ。
デフォルト値:1.0。
有効な値の範囲:[0.5, 2.0]。
bit_rateinteger(任意)
オーディオビットレート (kbps) です。 オーディオ形式が mp3 または opus の場合、bit_rate を使用してビットレートを調整します。
デフォルト値:32。
有効な値の範囲:[6, 510]。
enable_ssmlboolean(任意)
SSML を有効にするかどうかを指定します。
デフォルト値:false。
true に設定した場合、continue-task コマンドは 1 回のみ使用できます。
SSML の使用制限 (サポートされているモデル、音声、API) については、「制限事項」をご参照ください。
word_timestamp_enabledboolean(任意)
単語レベルのタイムスタンプを有効にするかどうかを指定します。
デフォルト値:false。
ストリーミング出力モードでのみ利用可能です。サポートされている音声:cosyvoice-v3.5-plus、cosyvoice-v3.5-flash、cosyvoice-v3-flash、cosyvoice-v3-plus、および cosyvoice-v2 のクローン音声、ならびに「Qwen-Audio-TTS 音声リスト」、「CosyVoice 音声リスト」でサポート対象としてマークされているシステム音声。他のモデルのクローン音声はこの機能をサポートしていません。
seedinteger(任意)
合成出力のバリエーションを制御するためのランダムシード。モデルのバージョン、テキスト、音声、などのパラメーターが変更されない場合、同じシードを使用すると同一の結果が得られます。
デフォルト値:0。
有効な値の範囲:[0, 65535]。
language_hintsarray[string](任意)
重要
- このパラメーターは配列ですが、現在のバージョンでは最初の要素のみが処理されます。値を 1 つだけ渡してください。
- このパラメーターは、音声合成のターゲット言語を指定します。これは、音声クローニングで使用される音声サンプルの言語とは無関係です。クローニングタスクのソース言語を設定するには、音声クローニング API リファレンスをご参照ください。
音声合成のターゲット言語を指定して、出力品質を向上させます。
数字の発音、略語の展開、記号の読み方、またはマイナー言語の合成が期待通りでない場合にこのパラメーターを使用します。例:
- 予期しない数字の発音:「hello, this is 110」が期待される中国語の発音ではなく、「hello, this is one zero」と読み上げられます
- 不正確な記号の発音:「@」が「at」ではなく中国語での読み方で読み上げられます
- マイナー言語の合成品質が低く、不自然な結果になる
有効な値:
- zh:中国語
- en:英語
- fr:フランス語
- de:ドイツ語
- ja:日本語
- ko:韓国語
- ru:ロシア語
- pt:ポルトガル語
- th:タイ語
- id:インドネシア語
- vi:ベトナム語
- es:スペイン語
- it:イタリア語
- ms:マレーシア語
- fil:フィリピン語
- ar:アラビア語
instructionstring(任意)
合成中の方言、感情、または声のキャラクターを制御するための指示を設定します。詳細な使用法については、「指示制御」をご参照ください。
enable_aigc_tagboolean(任意)
生成する音声に AIGC ウォーターマークを埋め込むかどうかを指定します。true に設定すると、サポートされている形式 (wav、mp3、opus) の音声ファイルにウォーターマークが埋め込まれます。
デフォルト値:false。
qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash、cosyvoice-v3-flash、cosyvoice-v3-plus、および cosyvoice-v2 のみがこの機能をサポートしています。
aigc_propagatorstring(任意)
コンテンツ伝播者を識別する、AIGC 透かしの ContentPropagator フィールドを設定します。enable_aigc_tag が true の場合にのみ有効になります。
デフォルト値:Alibaba Cloud UID。
qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash、cosyvoice-v3-flash、cosyvoice-v3-plus、および cosyvoice-v2 のみがこの機能をサポートしています。
aigc_propagate_idstring(任意)
AIGC ウォーターマークに PropagateID フィールドを設定し、特定の伝播アクションを一意に識別します。enable_aigc_tag が true の場合にのみ有効になります。
デフォルト値:現在の音声合成リクエストのリクエスト ID。
qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash、cosyvoice-v3-flash、cosyvoice-v3-plus、および cosyvoice-v2 のみがこの機能をサポートしています。
hot_fixobject(任意)
合成前に適用する発音の修正とテキスト置換を設定します。
この機能は qwen-audio-3.0-tts-plus、qwen-audio-3.0-tts-flash、または cosyvoice-v2 ではサポートされていません。
パラメーター:
- pronunciation:カスタムの発音。不正確なデフォルトの発音を修正するために、単語のピンイン注釈を指定します。
- replace:テキスト置換。合成前に、指定した単語を対象のテキストに置き換えます。置換後のテキストが、実際の合成入力として使用されます。
例:
"hot_fix": {
"pronunciation": [
{"weather": "tian1 qi4"}
],
"replace": [
{"today": "gold day"}
]
}
enable_markdown_filterboolean(任意)
重要cosyvoice-v3-flash のクローン音声のみがこの機能をサポートしています。
Markdown フィルタリングを有効にするかどうかを指定します。有効にすると、システムは合成前に入力テキストから Markdown マークアップ記号を自動的に削除し、読み上げられないようにします。
デフォルト値:false。
有効な値:
- true:Markdown フィルタリングを有効にする
- false:Markdown フィルタリングを無効にする