Pilih model untuk percakapan suara, terjemahan ucapan, atau interpretasi simultan.
Migrasi dari model closed-source
Petakan pengaturan OpenAI Realtime atau Gemini Live Anda saat ini ke model Bailian yang setara.
Contoh closed-source | Rekomendasi Bailian | |
|---|---|---|
Percakapan real-time | OpenAI GPT Realtime, Gemini 3.1 Live |
|
Percakapan hemat biaya | OpenAI gpt-4o-mini Realtime |
|
Terjemahan real-time | Gemini 3.1 Live |
|
Halaman ini membahas speech-to-speech. Untuk pemahaman visual, analisis audio/video, atau moderasi konten, lihat dokumentasi Omni-modal.
S2S (speech-to-speech) vs. pipeline
Terdapat dua pendekatan untuk membangun aplikasi suara:
S2S | Pipeline (ASR + LLM + TTS) | |
|---|---|---|
Latensi | Rendah — pemrosesan aliran single-model | Lebih tinggi — pemrosesan serial tiga tahap |
Pemahaman audio | End-to-end — menangkap nada dan emosi serta merespons sesuai | Mengonversi ke teks sebelum diproses, sehingga kehilangan isyarat audio halus |
Kustomisasi suara | Pemilihan suara preset melalui prompt sistem | Cloning suara dan desain suara (CosyVoice) |
- Gunakan S2S untuk latensi rendah, respons yang peka audio, dan percakapan interaktif.
- Gunakan pipeline jika Anda memerlukan kustomisasi suara atau ingin memilih model ASR, LLM, dan TTS secara independen.
Halaman ini mencakup pendekatan single-model S2S (seri Omni dan Livetranslate). Untuk pendekatan pipeline, pilih masing-masing komponen secara terpisah:
- ASR (speech recognition):Speech-to-text
- LLM (large language model):Text generation
- TTS (text-to-speech):Speech synthesis
Mode real-time atau file?
- Real-time (WebSocket): Asisten suara, pusat panggilan, dan interpretasi simultan. Mengalirkan input audio dan output ucapan.
- Mode file (HTTP): Latensi lebih tinggi tetapi kualitas lebih baik. Ideal untuk dubbing video, terjemahan podcast, dan pemrosesan offline. Juga mendukung pemanggilan fungsi, pencarian web, mode berpikir, dan konteks video (lihat kemampuan Pendamping di bawah).
Pilih model berdasarkan kasus penggunaan (pendekatan single-model S2S)
Semua kasus penggunaan di bawah menggunakan pendekatan single-model S2S. Untuk pendekatan pipeline, gunakan panduan ASR, LLM, dan TTS yang ditautkan di atas.
Kasus penggunaan | Model yang direkomendasikan | API |
|---|---|---|
Asisten suara dan percakapan layanan pelanggan |
| WebSocket |
Percakapan hemat biaya |
| WebSocket |
Interpretasi simultan dan terjemahan langsung |
| WebSocket |
Dubbing video dan terjemahan podcast |
| HTTP |
Analisis video dan pelabelan batch (memerlukan mode berpikir) |
| HTTP |
Asisten suara VAD semantik dan layanan pelanggan cerdas (dengan dukungan Function Calling) |
| WebSocket |
Kemampuan pendamping pendekatan single-model S2S
Qwen3.5-Omni dan Qwen3-Omni menyediakan kemampuan ini secara native. Qwen-Audio Realtime hanya mendukung function calling; tidak mendukung pencarian web atau mode berpikir. Dengan pipeline, fungsionalitas setara berasal dari komponen individual (biasanya LLM).
Function calling
Model dapat mengkueri basis pengetahuan, memeriksa jadwal, atau memicu alur kerja berdasarkan apa yang didengar dan dilihatnya. Gunakan Qwen3-Omni (HTTP saja) atau Qwen-Audio Realtime (WebSocket).
Tidak didukung oleh model real-time (WebSocket) Qwen3.5-Omni/Qwen3-Omni atau model Livetranslate. Qwen-Audio Realtime (WebSocket) mendukung function calling.
Web search
Mengambil informasi real-time untuk peristiwa terkini, harga saham, cuaca, dan kueri serupa. Tersedia di Qwen3.5-Omni (WebSocket atau HTTP, versi Plus dan Flash). Model menentukan sendiri apakah perlu melakukan pencarian. Qwen-Audio Realtime tidak mendukung kemampuan ini.
Tidak didukung oleh Qwen3-Omni-Flash atau model Livetranslate.
Thinking mode
Gunakan Qwen3-Omni (HTTP) ketika kualitas jawaban lebih penting daripada latensi. Melakukan penalaran langkah demi langkah sebelum menjawab, ideal untuk analisis video dan pelabelan batch. Qwen-Audio Realtime tidak mendukung kemampuan ini.
Generasi suara tidak didukung dalam mode berpikir.
Terjemahan ucapan
Seri model berikut mendukung terjemahan ucapan:
- Qwen3.5-Livetranslate: 60 bahasa (29 dengan output audio+teks, 31 hanya teks). Mencakup Mandarin, Inggris, Prancis, Jerman, Rusia, Jepang, Korea, Spanyol, Portugis, Arab, dan lainnya.
- Qwen3-Livetranslate: 18 bahasa dan 5 dialek Tionghoa (~3 detik latensi). Mode file menerima input video untuk terjemahan yang mempertimbangkan konteks. 7 bahasa menghasilkan output hanya teks.
- Qwen3.5-Omni: 29 bahasa output dan 8 dialek Tionghoa. Pemahaman audio/video kuat dan pencarian web. Masukkan terminologi dan konteks domain melalui prompt sistem. Mode real-time dan file.
- Qwen3-Omni-Flash: 11 bahasa output dan 8 dialek Tionghoa. Masukkan terminologi dan konteks domain melalui prompt sistem. Mode real-time dan file, dengan biaya lebih rendah.
CatatanMulai cepat: seri Livetranslate. Kualitas dan cakupan bahasa terbaik: Qwen3.5-Omni. Hemat biaya: Qwen3-Omni-Flash.
Bahasa yang didukung
Bahasa | Qwen3.5-Livetranslate | Qwen3-Livetranslate | Qwen3.5-Omni | Qwen3-Omni-Flash |
|---|---|---|---|---|
Inggris | Didukung | Didukung | Didukung | Didukung |
Tionghoa (Mandarin) | Didukung | Didukung | Didukung | Didukung |
Kanton | Hanya teks | Didukung | Didukung | Didukung |
Dialek Sichuan | Didukung | Didukung | Didukung | Didukung |
Shanghainese | Didukung | Didukung | Didukung | Didukung |
Dialek Beijing | Didukung | Didukung | Didukung | Didukung |
Dialek Tianjin | Didukung | Didukung | Didukung | Didukung |
Dialek Nanjing | -- | -- | Didukung | Didukung |
Dialek Shaanxi | -- | -- | Didukung | Didukung |
Dialek Minnan | -- | -- | Didukung | Didukung |
Prancis | Didukung | Didukung | Didukung | Didukung |
Jerman | Didukung | Didukung | Didukung | Didukung |
Rusia | Didukung | Didukung | Didukung | Didukung |
Italia | Didukung | Didukung | Didukung | Didukung |
Spanyol | Didukung | Didukung | Didukung | Didukung |
Portugis | Didukung | Didukung | Didukung | Didukung |
Jepang | Didukung | Didukung | Didukung | Didukung |
Bahasa Korea | Didukung | Didukung | Didukung | Didukung |
Bahasa Thailand | Didukung | Hanya teks | Didukung | Didukung |
Bahasa Indonesia | Didukung | Hanya teks | Didukung | -- |
Bahasa Vietnam | Didukung | Hanya teks | Didukung | -- |
Arab | Didukung | Hanya teks | Didukung | -- |
Hindi | Didukung | Hanya teks | Didukung | -- |
Turki | Didukung | Hanya teks | Didukung | -- |
Finlandia | Didukung | -- | Didukung | -- |
Bahasa Polandia | Didukung | -- | Didukung | -- |
Belanda | Didukung | -- | Didukung | -- |
Ceko | Didukung | -- | Didukung | -- |
Urdu | Didukung | -- | Didukung | -- |
Tagalog | Didukung | -- | Didukung | -- |
Swedia | Didukung | -- | Didukung | -- |
Bahasa Denmark | Didukung | -- | Didukung | -- |
Ibrani | Didukung | -- | Didukung | -- |
Islandia | Didukung | -- | Didukung | -- |
Melayu | Didukung | -- | Didukung | -- |
Norwegia | Didukung | -- | Didukung | -- |
Persia | Didukung | -- | Didukung | -- |
Yunani | Hanya teks | Hanya teks | -- | -- |
Afrikaans | Hanya teks | -- | -- | -- |
Asturia | Hanya teks | -- | -- | -- |
Belarusia | Hanya teks | -- | -- | -- |
Bahasa Bulgaria | Hanya teks | -- | -- | -- |
Bengali | Hanya teks | -- | -- | -- |
Bahasa Bosnia | Hanya teks | -- | -- | -- |
Katalan | Hanya teks | -- | -- | -- |
Cebuano | Hanya teks | -- | -- | -- |
Bahasa Estonia | Hanya teks | -- | -- | -- |
Galisia | Hanya teks | -- | -- | -- |
Gujarati | Hanya teks | -- | -- | -- |
Kroasia | Hanya teks | -- | -- | -- |
Hongaria | Hanya teks | -- | -- | -- |
Jawa | Hanya teks | -- | -- | -- |
Kazakh | Hanya teks | -- | -- | -- |
Kannada | Hanya teks | -- | -- | -- |
Kirgiz | Hanya teks | -- | -- | -- |
Latvia | Hanya teks | -- | -- | -- |
Makedonia | Hanya teks | -- | -- | -- |
Malayalam | Hanya teks | -- | -- | -- |
Marathi | Hanya teks | -- | -- | -- |
Punjabi | Hanya teks | -- | -- | -- |
Rumania | Hanya teks | -- | -- | -- |
Slovakia | Hanya teks | -- | -- | -- |
Bahasa Slovenia | Hanya teks | -- | -- | -- |
Swahili | Hanya teks | -- | -- | -- |
Tajik | Hanya teks | -- | -- | -- |
Bahasa Azerbaijan | Hanya teks | -- | -- | -- |
Ukraina | Hanya teks | -- | -- | -- |
"Didukung" = output ucapan + teks. "Hanya teks" = output teks saja, tanpa ucapan.
Qwen3.5-Omni mendukung 113 bahasa dan dialek input.
Qwen3.5-Livetranslate mendukung 60 bahasa (29 dengan audio dan teks, 31 hanya teks).
Model lama qwen-omni-turbo hanya mendukung Tionghoa dan Inggris.
Model yang direkomendasikan
Tabel ini mencantumkan model titik masuk di setiap seri. Untuk mengunci versi tertentu guna pengujian regresi atau stabilitas, lihat Semua model di bawah.
Model | API | Input | Function calling | Web search | Thinking mode | Terjemahan |
|---|---|---|---|---|---|---|
| WebSocket | audio, text | Didukung | -- | -- | -- |
| WebSocket | audio, text | Didukung | -- | -- | -- |
| WebSocket | text, audio, image | Didukung | Didukung | -- | 29 bahasa |
| HTTP | text, audio, image, video | Tidak Didukung | Didukung | -- | 29 bahasa |
| WebSocket | text, audio, image, video | -- | -- | -- | 11 bahasa |
| HTTP | text, audio, image, video | Didukung | -- | Didukung | 11 bahasa |
| WebSocket | audio, image | -- | -- | -- | 60 bahasa |
| HTTP | audio, video | -- | -- | -- | 18 bahasa |
Semua model
Qwen-Audio
Model | API | Input | Function calling | Web search | Thinking mode | Terjemahan |
|---|---|---|---|---|---|---|
| WebSocket | audio, text | Didukung | -- | -- | -- |
| WebSocket | audio, text | Didukung | -- | -- | -- |
Qwen3.5-Omni
Model | API | Input | Function calling | Web search | Thinking mode |
|---|---|---|---|---|---|
| WebSocket | Text, audio, image, video | Didukung | Didukung | -- |
| WebSocket | Text, audio, image, video | Didukung | Didukung | -- |
| HTTP | Text, audio, image, video | Tidak Didukung | Didukung | -- |
| HTTP | Text, audio, image, video | Tidak Didukung | Didukung | -- |
| WebSocket | Text, audio, image, video | Didukung | Didukung | -- |
| WebSocket | Text, audio, image, video | Didukung | Didukung | -- |
| HTTP | Text, audio, image, video | Tidak Didukung | Didukung | -- |
| HTTP | Text, audio, image, video | Tidak Didukung | Didukung | -- |
Qwen3-Omni
Model | API | Input | Function calling | Web search | Thinking mode |
|---|---|---|---|---|---|
| WebSocket | Text, audio, image, video | -- | -- | -- |
| WebSocket | Text, audio, image, video | -- | -- | -- |
| WebSocket | Text, audio, image, video | -- | -- | -- |
| HTTP | Text, audio, image, video | Didukung | -- | Didukung |
| HTTP | Text, audio, image, video | Didukung | -- | Didukung |
| HTTP | Text, audio, image, video | Didukung | -- | Didukung |
Qwen3.5-Livetranslate
Model | API | Input | Bahasa |
|---|---|---|---|
| WebSocket | Audio | 60 |
| WebSocket | Audio | 60 |
Qwen3-Livetranslate
Model | API | Input | Bahasa |
|---|---|---|---|
| WebSocket | Audio | 18 |
| WebSocket | Audio | 18 |
| HTTP | Audio, video | 18 |
| HTTP | Audio, video | 18 |
Model lama
Model-model ini tidak lagi diperbarui. Untuk proyek baru, gunakan Qwen3.5-Omni.
Model | Input | API |
|---|---|---|
| Text, audio, image, video | HTTP |
| Text, audio, image, video | HTTP |
| Text, audio, image, video | HTTP |
| Text, audio, image, video | HTTP |
| Text, audio | WebSocket |
| Text, audio | WebSocket |
| Text, audio | WebSocket |
Langkah selanjutnya
Dokumentasi API berdasarkan seri model:
- Qwen-Audio Realtime (WebSocket, percakapan suara real-time): Realtime Audio Chat (Qwen-Audio-Realtime)
- Qwen3.5-Omni dan Qwen3-Omni (WebSocket, real-time): Qwen-Omni-Realtime
- Qwen3.5-Omni dan Qwen3-Omni (HTTP, file): Non-real-time (Qwen-Omni)
- Qwen3.5-Livetranslate (WebSocket, real-time): Terjemahan audio dan video real-time - Qwen
- Qwen3-Livetranslate (HTTP, file): Terjemahan file audio dan video (Qwen)