Kloning suara hanya memerlukan sampel audio berdurasi 10–20 detik untuk menghasilkan suara kustom yang sangat mirip tanpa perlu pelatihan model.
Ikhtisar
Kloning suara dirancang untuk skenario seperti asisten suara personalisasi, siaran eksklusif merek, dan konten audio kustom.
Alibaba Cloud Model Studio menyediakan kemampuan kloning suara melalui rangkaian model berikut:
- Qwen-Audio-TTS / CosyVoice: Buat suara melalui SDK DashScope atau HTTP API. Mendukung sintesis suara . Tersedia di wilayah Beijing dan Singapura.
- Qwen-Audio-Realtime: Qwen-Audio-Realtime adalah model dialog suara real-time (bukan model sintesis suara). Kloning suara digunakan untuk menyesuaikan suara TTS pada respons model dialog. Buat suara melalui SDK DashScope atau HTTP API. Hanya tersedia di wilayah China (Beijing).
- Qwen-TTS: Buat suara melalui HTTP API. Mendukung sintesis suara real-time dan non-real-time. Tersedia di wilayah Beijing dan Singapura.
Untuk perbandingan detail dan rekomendasi pemilihan model, lihat Sintesis suara.
Prasyarat
- Konfigurasikan Kunci API dan tetapkan sebagai variabel lingkungan.
- Jika Anda memanggil API melalui SDK DashScope, instal SDK terbaru.
- Siapkan file audio: Audio harus memenuhi Persyaratan audio.
Memulai dengan cepat
Kloning suara melibatkan tiga langkah:
- Siapkan audio: Siapkan file audio yang memenuhi Persyaratan audio.
- Buat suara: Panggil API kloning suara untuk mengunggah audio dan membuat suara. Gunakan parameter
target_modeluntuk menentukan model sintesis suara yang akan di-bind. - Sintesis suara dengan suara hasil kloning: Panggil API sintesis suara dengan ID suara yang dikembalikan pada langkah sebelumnya.
Kloning suara Qwen-Audio-TTS
PentingKloning suara Qwen-Audio-TTS tersedia di wilayah Beijing dan Singapura.
Panggil API kloning suara untuk mengunggah audio dan membuat suara. Parameter url menentukan URL file audio yang dapat diakses, dan parameter prefix berfungsi sebagai awalan nama suara.
Konfigurasi berikut untuk wilayah Singapura. Untuk menggunakan model di wilayah China (Beijing), ganti domain dengan https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization. Ganti {WorkspaceId} dengan ID Ruang Kerja Anda yang sebenarnya.
curl -X POST 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "voice-enrollment",
"input": {
"action": "create_voice",
"target_model": "qwen-audio-3.0-tts-flash",
"prefix": "myvoice",
"url": "https://your-audio-url.wav"
}
}'
Langkah 2: Sintesis suara dengan suara hasil kloning
Gunakan nilai voice_id yang dikembalikan pada langkah sebelumnya dalam permintaan berikut.
# coding=utf-8
import dashscope
from dashscope.audio.tts_v2 import *
import os
# Kunci API untuk wilayah Singapura dan Beijing berbeda. Dapatkan Kunci API Anda: https://www.alibabacloud.com/help/zh/model-studio/get-api-key
# Jika variabel lingkungan belum dikonfigurasi, ganti baris berikut dengan Kunci API Studio Model Anda: dashscope.api_key = "sk-xxx"
dashscope.api_key = os.environ.get('DASHSCOPE_API_KEY')
# Berikut adalah konfigurasi untuk wilayah Singapura. Ganti "{WorkspaceId}" dengan ID ruang kerja Anda yang sebenarnya saat memanggil. Konfigurasi bervariasi berdasarkan wilayah.
dashscope.base_websocket_api_url='wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference'
# Kloning suara dan sintesis suara harus menggunakan model yang sama
model = "qwen-audio-3.0-tts-flash"
# Ganti parameter voice dengan suara kustom yang dihasilkan oleh kloning suara
voice = "voice_id"
# Instansiasi SpeechSynthesizer, meneruskan model, voice, dan parameter permintaan lainnya dalam konstruktor
synthesizer = SpeechSynthesizer(model=model, voice=voice)
# Kirim teks untuk sintesis dan dapatkan audio biner
audio = synthesizer.call("What's the weather like today?")
# Pengiriman teks pertama memerlukan pembentukan koneksi WebSocket, sehingga latensi paket pertama mencakup waktu penyiapan koneksi
print('[Metric] requestId: {}, first-packet latency: {} ms'.format(
synthesizer.get_last_request_id(),
synthesizer.get_first_package_delay()))
# Simpan audio ke file lokal
with open('output.mp3', 'wb') as f:
f.write(audio)
Kloning suara Qwen-Audio-Realtime
PentingKloning suara Qwen-Audio-Realtime hanya tersedia di wilayah China (Beijing). Persyaratan audio sama dengan Qwen-Audio-TTS.
Gunakan SDK DashScope atau HTTP API untuk memanggil API kloning suara, mengunggah audio, dan membuat suara. Parameter target_model menentukan nama model dialog real-time, dan parameter prefix berfungsi sebagai awalan nama suara.
Python
import os
import requests
# Jika tidak ditetapkan sebagai variabel lingkungan, ganti dengan Kunci API Anda: api_key = "sk-xxx"
api_key = os.environ.get('DASHSCOPE_API_KEY')
# Qwen-Audio-Realtime hanya tersedia di wilayah Beijing.
# Ganti {WorkspaceId} dengan ID Ruang Kerja Anda yang sebenarnya (gunakan Kunci API wilayah Beijing).
url = 'https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization'
response = requests.post(
url,
headers={
'Authorization': f'Bearer {api_key}',
'Content-Type': 'application/json'
},
json={
'model': 'voice-enrollment',
'input': {
'action': 'create_voice',
'target_model': 'qwen-audio-3.0-realtime-plus',
'prefix': 'myvoice',
'url': 'https://your-audio-url.wav'
}
}
)
result = response.json()
print('voice_id:', result['output']['voice_id'])
cURL
Kloning suara Qwen-Audio-Realtime hanya tersedia di wilayah Beijing. Ganti {WorkspaceId} dengan ID Ruang Kerja Anda yang sebenarnya, dan gunakan Kunci API wilayah Beijing.
curl -X POST 'https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "voice-enrollment",
"input": {
"action": "create_voice",
"target_model": "qwen-audio-3.0-realtime-plus",
"prefix": "myvoice",
"url": "https://your-audio-url.wav"
}
}'
Masukkan voice_id yang dikembalikan pada langkah sebelumnya ke parameter voice dalam event session.update. Untuk detailnya, lihat Konfigurasi suara.
{"type":"session.update","session":{"voice":"qwen-audio-3.0-realtime-plus-myvoice-xxxxxx"}}
Kloning suara CosyVoice
PentingKloning suara CosyVoice tersedia di wilayah Beijing (seri v3.5/v3/v2 ) dan wilayah Singapura (cosyvoice-v3-plus).
Di wilayah Singapura, cosyvoice-v3-flash saat ini tidak mendukung sintesis suara dengan suara hasil kloning. Untuk menggunakan suara hasil kloning di wilayah Singapura, gunakan qwen-audio-3.0-tts-flash sebagai gantinya.
Panggil API kloning suara untuk mengunggah audio dan membuat suara. Parameter url menentukan URL file audio yang dapat diakses, dan parameter prefix berfungsi sebagai awalan nama suara.
Konfigurasi berikut untuk wilayah Singapura. Untuk menggunakan model di wilayah China (Beijing), ganti domain dengan https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/audio/tts/customization. Ganti {WorkspaceId} dengan ID Ruang Kerja Anda yang sebenarnya.
curl -X POST 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/audio/tts/customization' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "voice-enrollment",
"input": {
"action": "create_voice",
"target_model": "cosyvoice-v3.5-plus",
"prefix": "myvoice",
"url": "https://your-audio-url.wav"
}
}'
Langkah 2: Sintesis suara dengan suara hasil kloning
Gunakan nilai voice_id yang dikembalikan pada langkah sebelumnya dalam permintaan berikut.
# coding=utf-8
import dashscope
from dashscope.audio.tts_v2 import *
import os
# Kunci API untuk wilayah Singapura dan Beijing berbeda. Dapatkan Kunci API Anda: https://www.alibabacloud.com/help/zh/model-studio/get-api-key
# Jika variabel lingkungan belum dikonfigurasi, ganti baris berikut dengan Kunci API Studio Model Anda: dashscope.api_key = "sk-xxx"
dashscope.api_key = os.environ.get('DASHSCOPE_API_KEY')
# Berikut adalah konfigurasi untuk wilayah Singapura. Ganti "{WorkspaceId}" dengan ID ruang kerja Anda yang sebenarnya saat memanggil. Konfigurasi bervariasi berdasarkan wilayah.
dashscope.base_websocket_api_url='wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference'
# Kloning suara dan sintesis suara harus menggunakan model yang sama
model = "cosyvoice-v3.5-plus"
# Ganti parameter voice dengan suara kustom yang dihasilkan oleh kloning suara
voice = "voice_id"
# Instansiasi SpeechSynthesizer, meneruskan model, voice, dan parameter permintaan lainnya dalam konstruktor
synthesizer = SpeechSynthesizer(model=model, voice=voice)
# Kirim teks untuk sintesis dan dapatkan audio biner
audio = synthesizer.call("What's the weather like today?")
# Pengiriman teks pertama memerlukan pembentukan koneksi WebSocket, sehingga latensi paket pertama mencakup waktu penyiapan koneksi
print('[Metric] requestId: {}, first-packet latency: {} ms'.format(
synthesizer.get_last_request_id(),
synthesizer.get_first_package_delay()))
# Simpan audio ke file lokal
with open('output.mp3', 'wb') as f:
f.write(audio)
Kloning suara Qwen-TTS
Contoh berikut menggunakan file audio lokal voice.mp3. Ganti dengan path file Anda yang sebenarnya saat menjalankan kode.
Pentingtarget_model yang ditentukan saat pembuatan suara harus persis sama dengan model yang digunakan untuk sintesis suara. Jika tidak, sintesis akan gagal.
Python
import os
import requests
import base64
import pathlib
import dashscope
# ======= Constants =======
DEFAULT_TARGET_MODEL = "qwen3-tts-vc-2026-01-22" # Kloning suara dan sintesis suara harus menggunakan model yang sama
DEFAULT_PREFERRED_NAME = "guanyu"
DEFAULT_AUDIO_MIME_TYPE = "audio/mpeg"
VOICE_FILE_PATH = "voice.mp3" # Path relatif ke file audio lokal yang digunakan untuk kloning suara
def create_voice(file_path: str,
target_model: str = DEFAULT_TARGET_MODEL,
preferred_name: str = DEFAULT_PREFERRED_NAME,
audio_mime_type: str = DEFAULT_AUDIO_MIME_TYPE) -> str:
"""
Buat suara dan kembalikan parameter voice
"""
# Kunci API untuk wilayah Singapura dan Beijing berbeda. Dapatkan Kunci API Anda: https://www.alibabacloud.com/help/zh/model-studio/get-api-key
# Jika variabel lingkungan belum dikonfigurasi, ganti baris berikut dengan Kunci API Studio Model Anda: api_key = "sk-xxx"
api_key = os.getenv("DASHSCOPE_API_KEY")
file_path_obj = pathlib.Path(file_path)
if not file_path_obj.exists():
raise FileNotFoundError(f"File audio tidak ditemukan: {file_path}")
base64_str = base64.b64encode(file_path_obj.read_bytes()).decode()
data_uri = f"data:{audio_mime_type};base64,{base64_str}"
# Berikut adalah konfigurasi untuk wilayah Singapura.
url = "https://dashscope-intl.aliyuncs.com/api/v1/services/audio/tts/customization"
payload = {
"model": "qwen-voice-enrollment", # Jangan ubah nilai ini
"input": {
"action": "create",
"target_model": target_model,
"preferred_name": preferred_name,
"audio": {"data": data_uri}
}
}
headers = {
"Authorization": f"Bearer {api_key}",
"Content-Type": "application/json"
}
resp = requests.post(url, json=payload, headers=headers)
if resp.status_code != 200:
raise RuntimeError(f"Gagal membuat suara: {resp.status_code}, {resp.text}")
try:
return resp.json()["output"]["voice"]
except (KeyError, ValueError) as e:
raise RuntimeError(f"Gagal mengurai respons suara: {e}")
if __name__ == '__main__':
# Berikut adalah konfigurasi untuk wilayah Singapura.
dashscope.base_http_api_url = 'https://dashscope-intl.aliyuncs.com/api/v1'
text = "What's the weather like today?"
response = dashscope.MultiModalConversation.call(
model=DEFAULT_TARGET_MODEL,
api_key=os.getenv("DASHSCOPE_API_KEY"),
text=text,
voice=create_voice(VOICE_FILE_PATH), # Ganti parameter voice dengan suara kustom yang dihasilkan oleh kloning suara
stream=False
)
print(response)
cURL
Langkah 1: Buat suaraGanti data dengan path file audio yang sebenarnya.
Konfigurasi berikut untuk wilayah Singapura.
curl -X POST 'https://dashscope-intl.aliyuncs.com/api/v1/services/audio/tts/customization' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "qwen-voice-enrollment",
"input": {
"action": "create",
"target_model": "qwen3-tts-vc-2026-01-22",
"preferred_name": "guanyu",
"audio": {
"data": "https://xxx.wav"
}
}
}'
Langkah 2: Sintesis suara dengan suara hasil kloningGanti YOUR_VOICE_ID dengan nilai voice yang dikembalikan pada langkah sebelumnya.
Konfigurasi berikut untuk wilayah Singapura.
curl -X POST 'https://dashscope-intl.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "qwen3-tts-vc-2026-01-22",
"input": {
"text": "What's the weather like today?",
"voice": "YOUR_VOICE_ID"
}
}'
Persyaratan audio
Kualitas audio input secara langsung menentukan hasil kloning. Rangkaian model yang berbeda memiliki persyaratan audio yang berbeda. Siapkan sampel audio Anda sesuai dengan persyaratan model target Anda.
Qwen-Audio-TTS / Qwen-Audio-Realtime
Item | Persyaratan |
|---|---|
Format yang didukung | WAV (16-bit), MP3, M4A |
Durasi audio | Disarankan 10–20 detik, maksimal 60 detik |
Ukuran file | ≤ 10 MB |
Laju sampel | ≥ 16 kHz |
Saluran | Mono atau stereo. Untuk audio stereo, hanya saluran pertama yang diproses. Pastikan saluran pertama berisi ucapan yang valid. |
Konten | Audio harus berisi minimal 5 detik ucapan jelas dan berkelanjutan (tanpa suara latar). Bagian sisanya hanya boleh berisi jeda singkat (≤ 2 detik). Hindari musik latar, kebisingan ambient, atau suara lain di seluruh rekaman. Gunakan audio yang direkam dengan kecepatan berbicara normal — jangan unggah rekaman lagu atau bernyanyi. |
Bahasa yang didukung | Bahasa Tionghoa (Mandarin, Kanton, Chongqing, Timur Laut, Gansu, Guizhou, Zhejiang, Hebei, Henan, Hubei, Hunan, Jiangxi, Ningbo, Ningxia, Qingdao, Shaanxi, Shanxi, Shandong, Shanghai, Sichuan, dan dialek Yunnan), Inggris, Jepang, Korea, Rusia, Prancis, Jerman, Portugis, Thailand, Indonesia, Vietnam, Spanyol, Italia, Malaysia, Filipina, dan Arab |
CosyVoice
Item | Persyaratan |
|---|---|
Format yang didukung | WAV (16-bit), MP3, M4A |
Durasi audio | Disarankan 10–20 detik, maksimal 60 detik |
Ukuran file | ≤ 10 MB |
Laju sampel | ≥ 16 kHz |
Saluran | Mono atau stereo. Untuk audio stereo, hanya saluran pertama yang diproses. Pastikan saluran pertama berisi ucapan yang valid. |
Konten | Audio harus berisi minimal 5 detik ucapan jelas dan berkelanjutan (tanpa suara latar). Bagian sisanya hanya boleh berisi jeda singkat (≤ 2 detik). Hindari musik latar, kebisingan ambient, atau suara lain di seluruh rekaman. Gunakan audio yang direkam dengan kecepatan berbicara normal — jangan unggah rekaman lagu atau bernyanyi. |
Bahasa yang didukung | Bervariasi berdasarkan model sintesis suara (ditentukan oleh parameter
|
Qwen-TTS
Item | Persyaratan |
|---|---|
Format yang didukung | WAV (16-bit), MP3, M4A |
Durasi audio | Disarankan 10–20 detik, maksimal 60 detik |
Ukuran file | ≤ 10 MB |
Laju sampel | ≥ 24 kHz |
Saluran | Mono |
Konten | Audio harus berisi minimal 3 detik ucapan jelas dan berkelanjutan (tanpa suara latar). Bagian sisanya hanya boleh berisi jeda singkat (≤ 2 detik). Hindari musik latar, kebisingan ambient, atau suara lain di seluruh rekaman. Gunakan audio yang direkam dengan kecepatan berbicara normal — jangan unggah rekaman lagu atau bernyanyi. |
Bahasa yang didukung | Bahasa Tionghoa, Inggris, Jerman, Italia, Portugis, Spanyol, Jepang, Korea, Prancis, dan Rusia |
CatatanUntuk hasil kloning terbaik, siapkan sampel Anda mengikuti Tips perekaman.
Tips perekaman
Audio input berkualitas tinggi merupakan fondasi untuk mencapai hasil kloning optimal.
Perangkat perekaman
Anda dapat menggunakan smartphone, perekam suara digital, atau perangkat perekaman profesional. Kami merekomendasikan perangkat yang mendukung perekaman laju sampel tinggi (≥ 24 kHz) untuk memenuhi persyaratan audio.
Lingkungan perekaman
Lokasi- Rekam di ruang kecil tertutup seluas 10 meter persegi atau kurang.
- Utamakan ruangan dengan material penyerap suara seperti busa akustik, karpet, atau gorden.
- Hindari aula terbuka, ruang konferensi, ruang kelas, dan ruang lain dengan gema tinggi.
- Kebisingan eksternal: Tutup pintu dan jendela untuk menghindari gangguan lalu lintas, konstruksi, dan lainnya.
- Kebisingan internal: Matikan AC, kipas angin, ballast lampu neon, dan peralatan lainnya. Anda dapat merekam suara ambient dengan ponsel dan memutarnya dengan volume tinggi untuk mengidentifikasi sumber kebisingan potensial.
- Gema menyebabkan suara menjadi buram dan mengurangi kejelasan.
- Kurangi pantulan dari permukaan halus: tutup gorden, buka pintu lemari pakaian, dan letakkan pakaian atau selimut di atas meja dan lemari.
- Gunakan benda tidak beraturan (seperti rak buku dan furnitur berlapis kain) untuk menciptakan pantulan difus.
Naskah perekaman
- Tidak ada batasan konten khusus. Kami merekomendasikan agar konten disesuaikan dengan kasus penggunaan target Anda.
- Hindari frasa pendek (seperti "halo" atau "ya"). Gunakan kalimat lengkap.
- Pertahankan koherensi semantik dan hindari jeda berulang saat membaca (disarankan minimal 3 detik berkelanjutan tanpa gangguan).
- Pertahankan kecepatan berbicara yang konsisten sepanjang rekaman. Hindari berbicara terlalu cepat di awal atau akhir, yang dapat menyebabkan tersendat selama sintesis.
- Sertakan ekspresi emosional yang sesuai (seperti kehangatan, keramahan, atau keseriusan). Hindari membaca secara mekanis.
- Jangan sertakan konten sensitif (seperti materi politik, pornografi, atau kekerasan). Hal ini akan menyebabkan kloning gagal.
Praktik terbaik
Menggunakan kamar tidur tipikal sebagai contoh, setelah menyelesaikan kontrol kebisingan dan gema:
- Pahami naskah terlebih dahulu, tetapkan nada karakter, dan sampaikan secara alami.
- Pertahankan jarak sekitar 10 cm dari perangkat perekaman untuk menghindari distorsi plosif atau sinyal lemah.
Manage custom voices
Setelah membuat suara, Anda dapat mengkueri dan mengelola suara yang ada melalui API (didukung oleh Qwen-Audio-TTS, Qwen-Audio-Realtime, Qwen-TTS, dan CosyVoice).
- Daftar suara: Ambil daftar semua suara kustom di bawah akun saat ini.
- Dapatkan detail suara (Qwen-Audio-TTS / Qwen-Audio-Realtime / CosyVoice saja): Lihat informasi detail tentang suara tertentu, seperti waktu pembuatan dan model sintesis suara yang di-bind.
- Hapus suara: Hapus suara kustom yang tidak lagi diperlukan untuk mengosongkan kuota.
PentingAPI kueri dan hapus suara untuk Qwen-Audio-Realtime identik dengan API untuk Qwen-Audio-TTS.
Untuk detail endpoint dan parameter API untuk setiap model, lihat Referensi API.
Kuota dan penagihan
Kuota suara dan pembersihan otomatis
- Batas suara: Setiap akun Alibaba Cloud Model Studio dapat membuat hingga 1.000 suara kustom untuk Qwen-Audio-TTS / Qwen-Audio-Realtime / CosyVoice dan hingga 1.000 untuk Qwen-TTS (kedua kuota dihitung secara independen). Setelah mencapai batas, permintaan pembuatan baru akan gagal dan mengembalikan error. Sistem tidak secara otomatis menghapus suara yang dibuat paling awal. Untuk membuat suara baru, hapus suara yang tidak diperlukan untuk mengosongkan kuota, atau tunggu suara yang tidak digunakan secara otomatis dibersihkan (lihat aturan pembersihan otomatis di bawah).
- Perilaku setelah mencapai batas: Setelah mencapai batas 1.000 suara, panggilan berikutnya ke API pembuatan suara akan mengembalikan error kegagalan. Sistem tidak secara otomatis menghapus suara yang dibuat paling awal untuk memberi ruang. Anda harus secara manual menghapus suara yang tidak diperlukan untuk mengosongkan kuota sebelum dapat terus membuat suara.
- Aturan pembersihan otomatis: Jika suara tidak digunakan untuk permintaan sintesis suara apa pun dalam satu tahun terakhir, sistem akan secara otomatis menghapusnya.
Aturan penagihan
-
Qwen-Audio-TTS / Qwen-Audio-Realtime / CosyVoice: Pembuatan suara gratis.
-
Qwen-TTS: Ditagih sebesar $0,01/suara. Pembuatan yang gagal tidak ditagih.
Kuota gratis (hanya tersedia di wilayah Singapura):
- Dalam 90 hari setelah mengaktifkan Alibaba Cloud Model Studio, Anda dapat membuat hingga 1.000 suara secara gratis.
- Pembuatan yang gagal tidak mengurangi kuota gratis.
- Menghapus suara tidak mengembalikan kuota gratis.
- Setelah kuota gratis habis atau periode 90 hari berakhir, pembuatan suara ditagih sebesar $0,01/suara.
Model dan wilayah yang didukung
Singapura
Untuk memanggil model berikut, gunakan Kunci API untuk wilayah Singapura:
-
Qwen-Audio-TTS: qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash
-
CosyVoice: cosyvoice-v3-plus (
cosyvoice-v3-flashsaat ini tidak mendukung sintesis suara dengan suara hasil kloning di wilayah Singapura. Gunakanqwen-audio-3.0-tts-flashsebagai gantinya.) -
Qwen-TTS:
- Qwen3-TTS-VC-Realtime: qwen3-tts-vc-realtime-2026-01-15 (snapshot terbaru), qwen3-tts-vc-realtime-2025-11-27 (snapshot)
- Qwen3-TTS-VC: qwen3-tts-vc-2026-01-22 (snapshot terbaru)
China (Beijing)
Untuk memanggil model berikut, gunakan Kunci API untuk wilayah Beijing:
-
Qwen-Audio-TTS: qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash
-
Qwen-Audio-Realtime: qwen-audio-3.0-realtime-plus, qwen-audio-3.0-realtime-flash
-
CosyVoice: cosyvoice-v3.5-plus, cosyvoice-v3.5-flash, cosyvoice-v3-plus, cosyvoice-v3-flash, cosyvoice-v2
-
Qwen-TTS:
- Qwen3-TTS-VC-Realtime: qwen3-tts-vc-realtime-2026-01-15 (snapshot terbaru), qwen3-tts-vc-realtime-2025-11-27 (snapshot)
- Qwen3-TTS-VC: qwen3-tts-vc-2026-01-22 (snapshot terbaru)
Referensi API
FAQ
T: Dapatkah saya menggunakan suara yang telah dibuat dengan model sintesis suara yang berbeda?
Tidak. Suara di-bind ke model sintesis suara tertentu melalui parameter target_model saat pembuatan dan tidak dapat digunakan lintas model. Jika Anda perlu menggunakan suara dari audio yang sama dengan beberapa model, buat suara terpisah untuk setiap model.
T: Berapa lama masa berlaku suara hasil kloning?
Suara yang dibuat oleh Qwen-Audio-TTS, Qwen-Audio-Realtime, Qwen-TTS, dan CosyVoice berlaku tanpa batas waktu secara default. Jika suara tidak digunakan untuk permintaan sintesis suara apa pun dalam satu tahun terakhir, sistem akan secara otomatis menghapusnya. Untuk detailnya, lihat Kuota suara dan pembersihan otomatis. Kami merekomendasikan untuk menyimpan ID suara. Anda dapat menggunakan API kueri untuk memeriksa apakah suara masih tersedia.
T: Apakah kualitas audio yang buruk memengaruhi hasil kloning?
Ya. Kualitas audio input secara langsung memengaruhi hasil kloning. Kebisingan latar, gema, dan banyak suara sekaligus mengurangi kemiripan dan kealamian suara hasil kloning. Kami merekomendasikan untuk menyiapkan sampel Anda mengikuti Persyaratan audio dan Tips perekaman.