All Products
Search
Document Center

Alibaba Cloud Model Studio:Ikhtisar sintesis suara

Last Updated:Sep 03, 2026

Pilih model yang tepat untuk sintesis suara, kloning suara, dan desain suara.

Bermigrasi dari model proprietary?

Jika Anda saat ini menggunakan ElevenLabs, OpenAI, atau Google untuk sintesis suara, gunakan tabel berikut untuk menemukan model setara di Model Studio.

Kasus penggunaan

Model proprietary

Setara di Model Studio

Voice bawaan / sintesis standar

OpenAI gpt-4o-tts, Google Chirp 3

qwen-audio-3.0-tts-plus

Voice kustom / kloning suara

ElevenLabs Multilingual v3

qwen-audio-3.0-tts-flash (voice cloning), cosyvoice-v3.5-plus (voice design)

TTS standar atau suara kustom?

Model sintesis suara mengonversi teks menjadi ucapan yang terdengar alami. Mulailah dengan menentukan apakah suara bawaan atau suara kustom yang sesuai dengan kebutuhan Anda:

Standard TTS

Custom voice

Voice source

Preset voice library — pilih dan gunakan langsung

Klon dari sampel audio, atau buat dengan deskripsi teks

Setup effort

Tidak perlu konfigurasi tambahan — pilih model dan suara untuk memulai

Memerlukan sampel audio atau deskripsi teks untuk membuat suara

Use cases

Bot layanan pelanggan, buku audio, siaran berita, siaran langsung e-commerce

Suara khas merek, jangkar virtual, pengalihan suara karakter game

Recommended models

qwen-audio-3.0-tts-plus

qwen-audio-3.0-tts-plus (voice cloning), cosyvoice-v3.5-plus (voice design)

  • Gunakan TTS standar jika pustaka suara bawaan memenuhi kebutuhan Anda dan Anda menginginkan penyiapan cepat tanpa konfigurasi tambahan.
  • Gunakan suara kustom jika Anda memerlukan suara khas merek, ingin mereplikasi suara orang tertentu, atau perlu membuat suara karakter baru sepenuhnya.

Kloning suara atau desain suara?

Jika Anda memilih suara kustom, tersedia dua metode pembuatan:

Voice cloning

Voice design

Input

Sampel audio dari pembicara target

Deskripsi teks mengenai suara yang diinginkan (misalnya, "suara perempuan hangat bernada rendah")

Result

Ucapan hasil sintesis sangat mirip dengan pembicara aslinya

Suara baru yang dibuat dari awal berdasarkan deskripsi tersebut

Use cases

Penggunaan ulang suara juru bicara/anchor merek, jangkar virtual, asisten suara personalisasi

Desain suara merek (tidak tersedia rekaman), pengalihan suara karakter game/animasi, produksi konten kreatif

Recommended models

qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash

cosyvoice-v3.5-plus, cosyvoice-v3.5-flash

Voice management service

voice-enrollment (register and manage voices)

voice-enrollment (register and manage voices)

  • Gunakan voice cloning jika Anda memiliki rekaman pembicara target dan ingin mereproduksi suara tersebut dalam ucapan hasil sintesis.
  • Gunakan voice design jika Anda tidak memiliki rekaman dan ingin membuat suara baru dari deskripsi teks.

WebSocket atau HTTP?

  • WebSocket: Streaming dua arah — mendukung input dan output streaming, mengirimkan audio saat sedang disintesis untuk meminimalkan latensi. Ideal untuk bot layanan pelanggan, asisten suara, dan pusat panggilan.
  • HTTP: Kirim teks lengkap, terima audio dalam respons streaming (chunked output). Ideal untuk buku audio, produksi konten audio, dan skenario batch volume tinggi lainnya.

Model Qwen-Audio-TTS/CosyVoice menggunakan nama model yang sama untuk akses WebSocket maupun HTTP. Untuk model Qwen, nama model menunjukkan API: model dengan akhiran -realtime menggunakan WebSocket, sedangkan yang tidak memiliki akhiran tersebut menggunakan HTTP.

Akses model Qwen-Audio-TTS/CosyVoice dan model WebSocket Qwen melalui SDK DashScope (Java, Python). Model lain memerlukan pemanggilan WebSocket atau HTTP secara langsung.

Untuk akses WebSocket, lihat Real-time speech synthesis. Untuk akses HTTP, lihat Non-real-time speech synthesis.

Model seri CosyVoice juga mendukung protokol AOQ. Untuk integrasi sisi client yang memprioritaskan latensi stabil, ketahanan pada jaringan lemah, serta penekanan noise full-duplex dan pembatalan gema bawaan, AOQ direkomendasikan. Untuk perbandingan protokol, lihat Realtime API overview.

Kontrol instruksi

Jelaskan gaya ekspresi yang diinginkan dalam bahasa alami untuk mengontrol kecepatan, emosi, dan gaya per permintaan. Contohnya termasuk "berbicara dengan lembut pada kecepatan lebih lambat" atau "gunakan gaya siaran yang bersemangat." Gunakan kontrol instruksi untuk produksi konten emosional, siaran profesional, buku audio, dan skenario lain yang memerlukan ekspresivitas kaya.

Model yang mendukung kontrol instruksi: seri Qwen-Audio-TTS (qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash), seri CosyVoice (cosyvoice-v3.5-plus, cosyvoice-v3.5-flash, cosyvoice-v3-flash), dan seri Qwen-TTS (qwen3-tts-instruct-flash-realtime, qwen3-tts-instruct-flash). Untuk detail selengkapnya, lihat Real-time speech synthesis > Instruction control.

Model yang direkomendasikan

Tabel berikut mencantumkan model terbaik untuk setiap skenario. Untuk informasi lengkap, kunjungi Model Gallery.

Model ID

Series

API

Voice cloning

Voice design

Instruction control

qwen-audio-3.0-tts-plus

Qwen-Audio-TTS

WebSocket

Supported

Unsupported

Supported

cosyvoice-v3.5-plus

CosyVoice

WebSocket

Supported

Supported

Supported

cosyvoice-v3-plus

CosyVoice

WebSocket

Supported

Supported

Unsupported

Semua model

Qwen-Audio-TTS

Model ID

API

Voice cloning

Voice design

Instruction control

qwen-audio-3.0-tts-plus

WebSocket

Supported

Unsupported

Supported

qwen-audio-3.0-tts-flash

WebSocket

Supported

Unsupported

Supported

Bahasa yang didukung:

  • Suara sistem (beragam tergantung suara): Mandarin, Inggris
  • Suara hasil kloning (dialek dikonfigurasi melalui kontrol instruksi): Mandarin, Kanton, Chongqing, Timur Laut, Gansu, Guizhou, Zhejiang, Hebei, Henan, Hubei, Hunan, Jiangxi, Ningbo, Ningxia, Qingdao, Shaanxi, Shanxi, Shandong, Shanghainese, Sichuan, Yunnan, Inggris, Jepang, Korea, Rusia, Prancis, Jerman, Portugis, Thailand, Indonesia, Vietnam, Spanyol, Italia, Malaysia, Filipina, dan Arab

CosyVoice

Beberapa model CosyVoice mendukung markup SSML (Speech Synthesis Markup Language) dan pembacaan rumus LaTeX.

Model ID

API

Voice cloning

Voice design

Instruction control

cosyvoice-v3.5-plus

WebSocket

Supported

Supported

Supported

cosyvoice-v3.5-flash

WebSocket

Supported

Supported

Supported

cosyvoice-v3-plus

WebSocket

Supported

Supported

Unsupported

cosyvoice-v3-flash

WebSocket

Supported

Supported

Supported

cosyvoice-v2

WebSocket

Supported

Unsupported

Unsupported

Bahasa yang didukung (berdasarkan versi):

  • cosyvoice-v3.5-plus dan cosyvoice-v3.5-flash (tidak ada suara sistem):

    • Suara kloning (dialek dikonfigurasi melalui kontrol instruksi): Bahasa Tiongkok (Mandarin, Kanton, Northeastern, Gansu, Guizhou, Henan, Hubei, Jiangxi, Hokkien, Ningxia, Shanxi, Shaanxi, Shandong, Shanghainese, Sichuan, Tianjin, Yunnan), Bahasa Inggris, Bahasa Prancis, Bahasa Jerman, Bahasa Jepang, Bahasa Korea, Bahasa Rusia, Bahasa Portugis, Bahasa Thailand, Bahasa Indonesia, dan Bahasa Vietnam
    • Suara hasil desain: Mandarin, Inggris
  • cosyvoice-v3-plus:

    • Suara sistem (beragam tergantung suara): Mandarin, Inggris
    • Suara kloning (dialek dikonfigurasi melalui kontrol instruksi): Tiongkok (Mandarin, Kanton, Timur Laut, Gansu, Guizhou, Henan, Hubei, Jiangxi, Hokkien, Ningxia, Shanxi, Shaanxi, Shandong, Shanghainese, Sichuan, Tianjin, Yunnan), Inggris, Prancis, Jerman, Jepang, Korea, dan Rusia
    • Suara hasil desain: Mandarin, Inggris
  • cosyvoice-v3-flash:

    • Suara sistem (beragam tergantung suara; beberapa dialek didukung langsung oleh suara sistem, sisanya melalui kontrol instruksi): Mandarin, Kanton, Timur Laut, Henan, Hunan, Shaanxi, Shandong, Sichuan, Anhui, Hokkien, Inggris
    • Suara kloning (dialek dikonfigurasi melalui kontrol instruksi): bahasa Tiongkok (Mandarin, Kanton, Timur Laut, Gansu, Guizhou, Henan, Hubei, Jiangxi, Hokkian, Ningxia, Shanxi, Shaanxi, Shandong, Shanghainese, Sichuan, Tianjin, Yunnan), Inggris, Prancis, Jerman, Jepang, Korea, Rusia, Portugis, Thailand, Indonesia, dan Vietnam.
    • Suara hasil desain: Mandarin, Inggris
  • cosyvoice-v2 (desain suara tidak didukung):

    • Suara sistem (beragam tergantung suara): Mandarin, Kanton, Timur Laut, Hokkien, Shaanxi, Inggris, Jepang, dan Korea
    • Suara hasil kloning: Mandarin, Inggris

Qwen3-TTS

Model ID

API

Voice cloning

Voice design

Instruction control

qwen3-tts-flash

HTTP

Unsupported

Unsupported

Unsupported

qwen3-tts-flash-2025-11-27

HTTP

Unsupported

Unsupported

Unsupported

qwen3-tts-flash-2025-09-18

HTTP

Unsupported

Unsupported

Unsupported

qwen3-tts-flash-realtime

WebSocket

Unsupported

Unsupported

Unsupported

qwen3-tts-flash-realtime-2025-11-27

WebSocket

Unsupported

Unsupported

Unsupported

qwen3-tts-flash-realtime-2025-09-18

WebSocket

Unsupported

Unsupported

Unsupported

qwen3-tts-instruct-flash

HTTP

Unsupported

Unsupported

Supported

qwen3-tts-instruct-flash-2026-01-26

HTTP

Unsupported

Unsupported

Supported

qwen3-tts-instruct-flash-realtime

WebSocket

Unsupported

Unsupported

Supported

qwen3-tts-instruct-flash-realtime-2026-01-22

WebSocket

Unsupported

Unsupported

Supported

qwen3-tts-vc-2026-01-22

HTTP

Supported

Unsupported

Unsupported

qwen3-tts-vc-realtime-2026-01-15

WebSocket

Supported

Unsupported

Unsupported

qwen3-tts-vc-realtime-2025-11-27

WebSocket

Supported

Unsupported

Unsupported

qwen3-tts-vd-2026-01-26

HTTP

Unsupported

Supported

Unsupported

qwen3-tts-vd-realtime-2026-01-15

WebSocket

Unsupported

Supported

Unsupported

qwen3-tts-vd-realtime-2025-12-16

WebSocket

Unsupported

Supported

Unsupported

Bahasa yang didukung (berdasarkan versi):

  • Seri Qwen3-TTS-Flash (suara sistem) (qwen3-tts-flash, qwen3-tts-flash-2025-11-27, qwen3-tts-flash-2025-09-18, qwen3-tts-flash-realtime, qwen3-tts-flash-realtime-2025-11-27, qwen3-tts-flash-realtime-2025-09-18): Mandarin, Beijing, Shanghainese, Sichuan, Nanjing, Shaanxi, Hokkien, Tianjin, Kanton (beragam tergantung suara), Inggris, Jerman, Italia, Portugis, Spanyol, Jepang, Korea, Prancis, dan Rusia
  • Seri Qwen3-TTS-Instruct-Flash (suara sistem) (qwen3-tts-instruct-flash, qwen3-tts-instruct-flash-2026-01-26, qwen3-tts-instruct-flash-realtime, qwen3-tts-instruct-flash-realtime-2026-01-22): Mandarin, Inggris, Jerman, Italia, Portugis, Spanyol, Jepang, Korea, Prancis, dan Rusia
  • Seri Qwen3-TTS-VC (kloning suara) (qwen3-tts-vc-2026-01-22, qwen3-tts-vc-realtime-2026-01-15, qwen3-tts-vc-realtime-2025-11-27): Mandarin, Inggris, Jerman, Italia, Portugis, Spanyol, Jepang, Korea, Prancis, dan Rusia
  • Seri Qwen3-TTS-VD (desain suara) (qwen3-tts-vd-2026-01-26, qwen3-tts-vd-realtime-2026-01-15, qwen3-tts-vd-realtime-2025-12-16): Mandarin, Inggris, Jerman, Italia, Portugis, Spanyol, Jepang, Korea, Prancis, dan Rusia

Qwen-TTS (legacy, penagihan berbasis token)

Model legacy Qwen-TTS berikut menggunakan penagihan berbasis token. Jika Anda telah bermigrasi ke Qwen3-TTS, gunakan model yang direkomendasikan sebelumnya dalam topik ini.

Model ID

API

Description

qwen-tts

HTTP

Non-streaming synthesis, token-based billing

qwen-tts-latest

HTTP

Non-streaming synthesis, token-based billing

qwen-tts-2025-05-22

HTTP

Snapshot version, token-based billing

qwen-tts-2025-04-10

HTTP

Snapshot version, token-based billing

qwen-tts-realtime

WebSocket

Streaming synthesis, token-based billing

qwen-tts-realtime-latest

WebSocket

Streaming synthesis, token-based billing

qwen-tts-realtime-2025-07-15

WebSocket

Snapshot version, streaming synthesis, token-based billing

Bahasa yang didukung (berdasarkan versi):

  • Seri Qwen-TTS (suara sistem) (qwen-tts, qwen-tts-latest, qwen-tts-2025-05-22, qwen-tts-2025-04-10): Mandarin, Beijing, Shanghainese, Sichuan (beragam tergantung suara), Inggris, Jerman, Italia, Portugis, Spanyol, Jepang, Korea, Prancis, dan Rusia
  • Seri Qwen-TTS-Realtime (suara sistem) (qwen-tts-realtime, qwen-tts-realtime-latest, qwen-tts-realtime-2025-07-15): Mandarin, Inggris, Jerman, Italia, Portugis, Spanyol, Jepang, Korea, Prancis, dan Rusia