Pilih model yang tepat untuk sintesis suara, kloning suara, dan desain suara.
Bermigrasi dari model proprietary?
Jika Anda saat ini menggunakan ElevenLabs, OpenAI, atau Google untuk sintesis suara, gunakan tabel berikut untuk menemukan model setara di Model Studio.
Kasus penggunaan | Model proprietary | Setara di Model Studio |
|---|---|---|
Voice bawaan / sintesis standar | OpenAI gpt-4o-tts, Google Chirp 3 |
|
Voice kustom / kloning suara | ElevenLabs Multilingual v3 |
|
TTS standar atau suara kustom?
Model sintesis suara mengonversi teks menjadi ucapan yang terdengar alami. Mulailah dengan menentukan apakah suara bawaan atau suara kustom yang sesuai dengan kebutuhan Anda:
Standard TTS | Custom voice | |
|---|---|---|
Voice source | Preset voice library — pilih dan gunakan langsung | Klon dari sampel audio, atau buat dengan deskripsi teks |
Setup effort | Tidak perlu konfigurasi tambahan — pilih model dan suara untuk memulai | Memerlukan sampel audio atau deskripsi teks untuk membuat suara |
Use cases | Bot layanan pelanggan, buku audio, siaran berita, siaran langsung e-commerce | Suara khas merek, jangkar virtual, pengalihan suara karakter game |
Recommended models |
|
|
- Gunakan TTS standar jika pustaka suara bawaan memenuhi kebutuhan Anda dan Anda menginginkan penyiapan cepat tanpa konfigurasi tambahan.
- Gunakan suara kustom jika Anda memerlukan suara khas merek, ingin mereplikasi suara orang tertentu, atau perlu membuat suara karakter baru sepenuhnya.
Kloning suara atau desain suara?
Jika Anda memilih suara kustom, tersedia dua metode pembuatan:
Voice cloning | Voice design | |
|---|---|---|
Input | Sampel audio dari pembicara target | Deskripsi teks mengenai suara yang diinginkan (misalnya, "suara perempuan hangat bernada rendah") |
Result | Ucapan hasil sintesis sangat mirip dengan pembicara aslinya | Suara baru yang dibuat dari awal berdasarkan deskripsi tersebut |
Use cases | Penggunaan ulang suara juru bicara/anchor merek, jangkar virtual, asisten suara personalisasi | Desain suara merek (tidak tersedia rekaman), pengalihan suara karakter game/animasi, produksi konten kreatif |
Recommended models |
|
|
Voice management service |
|
|
- Gunakan voice cloning jika Anda memiliki rekaman pembicara target dan ingin mereproduksi suara tersebut dalam ucapan hasil sintesis.
- Gunakan voice design jika Anda tidak memiliki rekaman dan ingin membuat suara baru dari deskripsi teks.
WebSocket atau HTTP?
- WebSocket: Streaming dua arah — mendukung input dan output streaming, mengirimkan audio saat sedang disintesis untuk meminimalkan latensi. Ideal untuk bot layanan pelanggan, asisten suara, dan pusat panggilan.
- HTTP: Kirim teks lengkap, terima audio dalam respons streaming (chunked output). Ideal untuk buku audio, produksi konten audio, dan skenario batch volume tinggi lainnya.
Model Qwen-Audio-TTS/CosyVoice menggunakan nama model yang sama untuk akses WebSocket maupun HTTP. Untuk model Qwen, nama model menunjukkan API: model dengan akhiran -realtime menggunakan WebSocket, sedangkan yang tidak memiliki akhiran tersebut menggunakan HTTP.
Akses model Qwen-Audio-TTS/CosyVoice dan model WebSocket Qwen melalui SDK DashScope (Java, Python). Model lain memerlukan pemanggilan WebSocket atau HTTP secara langsung.
Untuk akses WebSocket, lihat Real-time speech synthesis. Untuk akses HTTP, lihat Non-real-time speech synthesis.
Model seri CosyVoice juga mendukung protokol AOQ. Untuk integrasi sisi client yang memprioritaskan latensi stabil, ketahanan pada jaringan lemah, serta penekanan noise full-duplex dan pembatalan gema bawaan, AOQ direkomendasikan. Untuk perbandingan protokol, lihat Realtime API overview.
Kontrol instruksi
Jelaskan gaya ekspresi yang diinginkan dalam bahasa alami untuk mengontrol kecepatan, emosi, dan gaya per permintaan. Contohnya termasuk "berbicara dengan lembut pada kecepatan lebih lambat" atau "gunakan gaya siaran yang bersemangat." Gunakan kontrol instruksi untuk produksi konten emosional, siaran profesional, buku audio, dan skenario lain yang memerlukan ekspresivitas kaya.
Model yang mendukung kontrol instruksi: seri Qwen-Audio-TTS (qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash), seri CosyVoice (cosyvoice-v3.5-plus, cosyvoice-v3.5-flash, cosyvoice-v3-flash), dan seri Qwen-TTS (qwen3-tts-instruct-flash-realtime, qwen3-tts-instruct-flash). Untuk detail selengkapnya, lihat Real-time speech synthesis > Instruction control.
Model yang direkomendasikan
Tabel berikut mencantumkan model terbaik untuk setiap skenario. Untuk informasi lengkap, kunjungi Model Gallery.
Model ID | Series | API | Voice cloning | Voice design | Instruction control |
|---|---|---|---|---|---|
| Qwen-Audio-TTS | WebSocket | Supported | Unsupported | Supported |
| CosyVoice | WebSocket | Supported | Supported | Supported |
| CosyVoice | WebSocket | Supported | Supported | Unsupported |
Semua model
Qwen-Audio-TTS
Model ID | API | Voice cloning | Voice design | Instruction control |
|---|---|---|---|---|
| WebSocket | Supported | Unsupported | Supported |
| WebSocket | Supported | Unsupported | Supported |
Bahasa yang didukung:
- Suara sistem (beragam tergantung suara): Mandarin, Inggris
- Suara hasil kloning (dialek dikonfigurasi melalui kontrol instruksi): Mandarin, Kanton, Chongqing, Timur Laut, Gansu, Guizhou, Zhejiang, Hebei, Henan, Hubei, Hunan, Jiangxi, Ningbo, Ningxia, Qingdao, Shaanxi, Shanxi, Shandong, Shanghainese, Sichuan, Yunnan, Inggris, Jepang, Korea, Rusia, Prancis, Jerman, Portugis, Thailand, Indonesia, Vietnam, Spanyol, Italia, Malaysia, Filipina, dan Arab
CosyVoice
Beberapa model CosyVoice mendukung markup SSML (Speech Synthesis Markup Language) dan pembacaan rumus LaTeX.
Model ID | API | Voice cloning | Voice design | Instruction control |
|---|---|---|---|---|
| WebSocket | Supported | Supported | Supported |
| WebSocket | Supported | Supported | Supported |
| WebSocket | Supported | Supported | Unsupported |
| WebSocket | Supported | Supported | Supported |
| WebSocket | Supported | Unsupported | Unsupported |
Bahasa yang didukung (berdasarkan versi):
-
cosyvoice-v3.5-plus dan cosyvoice-v3.5-flash (tidak ada suara sistem):
- Suara kloning (dialek dikonfigurasi melalui kontrol instruksi): Bahasa Tiongkok (Mandarin, Kanton, Northeastern, Gansu, Guizhou, Henan, Hubei, Jiangxi, Hokkien, Ningxia, Shanxi, Shaanxi, Shandong, Shanghainese, Sichuan, Tianjin, Yunnan), Bahasa Inggris, Bahasa Prancis, Bahasa Jerman, Bahasa Jepang, Bahasa Korea, Bahasa Rusia, Bahasa Portugis, Bahasa Thailand, Bahasa Indonesia, dan Bahasa Vietnam
- Suara hasil desain: Mandarin, Inggris
-
cosyvoice-v3-plus:
- Suara sistem (beragam tergantung suara): Mandarin, Inggris
- Suara kloning (dialek dikonfigurasi melalui kontrol instruksi): Tiongkok (Mandarin, Kanton, Timur Laut, Gansu, Guizhou, Henan, Hubei, Jiangxi, Hokkien, Ningxia, Shanxi, Shaanxi, Shandong, Shanghainese, Sichuan, Tianjin, Yunnan), Inggris, Prancis, Jerman, Jepang, Korea, dan Rusia
- Suara hasil desain: Mandarin, Inggris
-
cosyvoice-v3-flash:
- Suara sistem (beragam tergantung suara; beberapa dialek didukung langsung oleh suara sistem, sisanya melalui kontrol instruksi): Mandarin, Kanton, Timur Laut, Henan, Hunan, Shaanxi, Shandong, Sichuan, Anhui, Hokkien, Inggris
- Suara kloning (dialek dikonfigurasi melalui kontrol instruksi): bahasa Tiongkok (Mandarin, Kanton, Timur Laut, Gansu, Guizhou, Henan, Hubei, Jiangxi, Hokkian, Ningxia, Shanxi, Shaanxi, Shandong, Shanghainese, Sichuan, Tianjin, Yunnan), Inggris, Prancis, Jerman, Jepang, Korea, Rusia, Portugis, Thailand, Indonesia, dan Vietnam.
- Suara hasil desain: Mandarin, Inggris
-
cosyvoice-v2 (desain suara tidak didukung):
- Suara sistem (beragam tergantung suara): Mandarin, Kanton, Timur Laut, Hokkien, Shaanxi, Inggris, Jepang, dan Korea
- Suara hasil kloning: Mandarin, Inggris
Qwen3-TTS
Model ID | API | Voice cloning | Voice design | Instruction control |
|---|---|---|---|---|
| HTTP | Unsupported | Unsupported | Unsupported |
| HTTP | Unsupported | Unsupported | Unsupported |
| HTTP | Unsupported | Unsupported | Unsupported |
| WebSocket | Unsupported | Unsupported | Unsupported |
| WebSocket | Unsupported | Unsupported | Unsupported |
| WebSocket | Unsupported | Unsupported | Unsupported |
| HTTP | Unsupported | Unsupported | Supported |
| HTTP | Unsupported | Unsupported | Supported |
| WebSocket | Unsupported | Unsupported | Supported |
| WebSocket | Unsupported | Unsupported | Supported |
| HTTP | Supported | Unsupported | Unsupported |
| WebSocket | Supported | Unsupported | Unsupported |
| WebSocket | Supported | Unsupported | Unsupported |
| HTTP | Unsupported | Supported | Unsupported |
| WebSocket | Unsupported | Supported | Unsupported |
| WebSocket | Unsupported | Supported | Unsupported |
Bahasa yang didukung (berdasarkan versi):
- Seri Qwen3-TTS-Flash (suara sistem) (
qwen3-tts-flash,qwen3-tts-flash-2025-11-27,qwen3-tts-flash-2025-09-18,qwen3-tts-flash-realtime,qwen3-tts-flash-realtime-2025-11-27,qwen3-tts-flash-realtime-2025-09-18): Mandarin, Beijing, Shanghainese, Sichuan, Nanjing, Shaanxi, Hokkien, Tianjin, Kanton (beragam tergantung suara), Inggris, Jerman, Italia, Portugis, Spanyol, Jepang, Korea, Prancis, dan Rusia - Seri Qwen3-TTS-Instruct-Flash (suara sistem) (
qwen3-tts-instruct-flash,qwen3-tts-instruct-flash-2026-01-26,qwen3-tts-instruct-flash-realtime,qwen3-tts-instruct-flash-realtime-2026-01-22): Mandarin, Inggris, Jerman, Italia, Portugis, Spanyol, Jepang, Korea, Prancis, dan Rusia - Seri Qwen3-TTS-VC (kloning suara) (
qwen3-tts-vc-2026-01-22,qwen3-tts-vc-realtime-2026-01-15,qwen3-tts-vc-realtime-2025-11-27): Mandarin, Inggris, Jerman, Italia, Portugis, Spanyol, Jepang, Korea, Prancis, dan Rusia - Seri Qwen3-TTS-VD (desain suara) (
qwen3-tts-vd-2026-01-26,qwen3-tts-vd-realtime-2026-01-15,qwen3-tts-vd-realtime-2025-12-16): Mandarin, Inggris, Jerman, Italia, Portugis, Spanyol, Jepang, Korea, Prancis, dan Rusia
Qwen-TTS (legacy, penagihan berbasis token)
Model legacy Qwen-TTS berikut menggunakan penagihan berbasis token. Jika Anda telah bermigrasi ke Qwen3-TTS, gunakan model yang direkomendasikan sebelumnya dalam topik ini.
Model ID | API | Description |
|---|---|---|
| HTTP | Non-streaming synthesis, token-based billing |
| HTTP | Non-streaming synthesis, token-based billing |
| HTTP | Snapshot version, token-based billing |
| HTTP | Snapshot version, token-based billing |
| WebSocket | Streaming synthesis, token-based billing |
| WebSocket | Streaming synthesis, token-based billing |
| WebSocket | Snapshot version, streaming synthesis, token-based billing |
Bahasa yang didukung (berdasarkan versi):
- Seri Qwen-TTS (suara sistem) (
qwen-tts,qwen-tts-latest,qwen-tts-2025-05-22,qwen-tts-2025-04-10): Mandarin, Beijing, Shanghainese, Sichuan (beragam tergantung suara), Inggris, Jerman, Italia, Portugis, Spanyol, Jepang, Korea, Prancis, dan Rusia - Seri Qwen-TTS-Realtime (suara sistem) (
qwen-tts-realtime,qwen-tts-realtime-latest,qwen-tts-realtime-2025-07-15): Mandarin, Inggris, Jerman, Italia, Portugis, Spanyol, Jepang, Korea, Prancis, dan Rusia