text_typestring(wajib)
Atur ke PlainText.
voicestring(wajib)
Voice yang digunakan untuk sintesis suara.
formatstring(opsional)
Format encoding audio.
Nilai yang valid:
- pcm
- wav
- mp3 (default)
- opus
sample_rateinteger(opsional)
Laju sampel audio dalam Hz.
Nilai yang valid: 8000, 16000, 22050 (default), 24000, 44100, 48000.
volumeinteger(opsional)
Tingkat volume.
Nilai default: 50.
Nilai yang valid: [0, 100].
ratefloat(opsional)
Laju bicara.
Nilai default: 1.0.
Nilai yang valid: [0.5, 2.0].
pitchfloat(opsional)
Pitch.
Nilai default: 1.0.
Nilai yang valid: [0.5, 2.0].
bit_rateinteger(opsional)
Laju bit audio dalam kbps. Saat format audio adalah mp3 atau opus, gunakan bit_rate untuk menyesuaikan laju bit.
Nilai default: 32.
Nilai yang valid: [6, 510].
enable_ssmlboolean(opsional)
Menentukan apakah SSML diaktifkan.
Nilai default: false.
Saat diatur ke true, hanya satu perintah continue-task yang diperbolehkan.
Untuk batasan penggunaan SSML (model, voice, dan API yang didukung), lihat Batasan.
word_timestamp_enabledboolean(opsional)
Menentukan apakah timestamp tingkat kata diaktifkan.
Nilai default: false.
Hanya tersedia dalam mode keluaran streaming. Voice yang didukung: cloned voices dari cosyvoice-v3.5-plus, cosyvoice-v3.5-flash, cosyvoice-v3-flash, cosyvoice-v3-plus, dan cosyvoice-v2, serta system voices yang ditandai sebagai didukung dalam Daftar voice Qwen-Audio-TTS, Daftar Voice CosyVoice. Cloned voices dari model lain tidak mendukung fitur ini.
seedinteger(opsional)
Seed acak untuk mengontrol variasi dalam output sintesis. Saat versi model, teks, voice, dan parameter lainnya tidak berubah, penggunaan seed yang sama menghasilkan output identik.
Nilai default: 0.
Nilai yang valid: [0, 65535].
language_hintsarray[string](opsional)
Penting
- Parameter ini berupa array, tetapi versi saat ini hanya memproses elemen pertama. Kirim satu nilai saja.
- Parameter ini menentukan bahasa target untuk sintesis suara. Parameter ini tidak terkait dengan bahasa sampel audio yang digunakan dalam voice cloning. Untuk mengatur bahasa sumber pada tugas cloning, lihat referensi API voice cloning.
Menentukan bahasa target untuk sintesis suara guna meningkatkan kualitas output.
Saat pelafalan angka, ekspansi singkatan, pembacaan simbol, atau sintesis bahasa minoritas tidak sesuai harapan, gunakan parameter ini. Contohnya:
- Pelafalan angka tidak sesuai: "hello, this is 110" dibaca sebagai "hello, this is one zero" alih-alih pelafalan Mandarin yang diharapkan
- Pelafalan simbol tidak akurat: "@" dibaca sebagai ekuivalen Mandarin alih-alih "at"
- Kualitas sintesis bahasa minoritas buruk dengan hasil tidak alami
Nilai yang valid:
- zh: Tionghoa
- en: Inggris
- fr: Prancis
- de: Jerman
- ja: Jepang
- ko: Korea
- ru: Rusia
- pt: Portugis
- th: Thai
- id: Bahasa Indonesia
- vi: Vietnam
- es: Spanyol
- it: Italia
- ms: Malaysia
- fil: Filipino
- ar: Arab
instructionstring(opsional)
Mengatur instruksi untuk mengontrol dialek, emosi, atau karakter suara selama sintesis. Untuk penggunaan detail, lihat Kontrol instruksi.
enable_aigc_tagboolean(opsional)
Menentukan apakah watermark AIGC disematkan ke dalam audio yang dihasilkan. Saat diatur ke true, watermark disematkan ke file audio dengan format yang didukung (wav/mp3/opus).
Nilai default: false.
Hanya qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash, cosyvoice-v3-flash, cosyvoice-v3-plus, dan cosyvoice-v2 yang mendukung fitur ini.
aigc_propagatorstring(opsional)
Mengatur bidang ContentPropagator dalam watermark AIGC, yang mengidentifikasi propagator konten. Hanya berlaku saat enable_aigc_tag bernilai true.
Nilai default: UID Alibaba Cloud.
Hanya qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash, cosyvoice-v3-flash, cosyvoice-v3-plus, dan cosyvoice-v2 yang mendukung fitur ini.
aigc_propagate_idstring(opsional)
Mengatur bidang PropagateID dalam watermark AIGC, yang secara unik mengidentifikasi aksi propagasi tertentu. Hanya berlaku saat enable_aigc_tag bernilai true.
Nilai default: ID permintaan dari permintaan sintesis suara saat ini.
Hanya qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash, cosyvoice-v3-flash, cosyvoice-v3-plus, dan cosyvoice-v2 yang mendukung fitur ini.
hot_fixobject(opsional)
Mengonfigurasi koreksi pelafalan dan penggantian teks yang diterapkan sebelum sintesis.
Fitur ini tidak didukung oleh qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash, atau cosyvoice-v2.
Parameter:
- pronunciation: Pelafalan kustom. Menentukan anotasi pinyin untuk kata-kata guna memperbaiki pelafalan default yang tidak akurat.
- replace: Penggantian teks. Mengganti kata-kata tertentu dengan teks target sebelum sintesis. Teks yang diganti digunakan sebagai input sintesis sebenarnya.
Contoh:
"hot_fix": {
"pronunciation": [
{"weather": "tian1 qi4"}
],
"replace": [
{"today": "gold day"}
]
}
enable_markdown_filterboolean(opsional)
PentingHanya cloned voices dari cosyvoice-v3-flash yang mendukung fitur ini.
Menentukan apakah penyaringan Markdown diaktifkan. Saat diaktifkan, sistem secara otomatis menghapus simbol markup Markdown dari teks input sebelum sintesis, sehingga simbol tersebut tidak ikut dibacakan.
Nilai default: false.
Nilai yang valid:
- true: Aktifkan penyaringan Markdown
- false: Nonaktifkan penyaringan Markdown