All Products
Search
Document Center

Alibaba Cloud Model Studio:Ikhtisar speech-to-speech

Last Updated:Sep 03, 2026

Pilih model untuk percakapan suara, terjemahan ucapan, atau interpretasi simultan.

Migrasi dari model closed-source

Petakan pengaturan OpenAI Realtime atau Gemini Live Anda saat ini ke model Bailian yang setara.

Contoh closed-source

Rekomendasi Bailian

Percakapan real-time

OpenAI GPT Realtime, Gemini 3.1 Live

qwen-audio-3.0-realtime-plus

Percakapan hemat biaya

OpenAI gpt-4o-mini Realtime

qwen-audio-3.0-realtime-flash

Terjemahan real-time

Gemini 3.1 Live

qwen3.5-livetranslate-flash-realtime

Halaman ini membahas speech-to-speech. Untuk pemahaman visual, analisis audio/video, atau moderasi konten, lihat dokumentasi Omni-modal.

S2S (speech-to-speech) vs. pipeline

Terdapat dua pendekatan untuk membangun aplikasi suara:

S2S

Pipeline (ASR + LLM + TTS)

Latensi

Rendah — pemrosesan aliran single-model

Lebih tinggi — pemrosesan serial tiga tahap

Pemahaman audio

End-to-end — menangkap nada dan emosi serta merespons sesuai

Mengonversi ke teks sebelum diproses, sehingga kehilangan isyarat audio halus

Kustomisasi suara

Pemilihan suara preset melalui prompt sistem

Cloning suara dan desain suara (CosyVoice)

  • Gunakan S2S untuk latensi rendah, respons yang peka audio, dan percakapan interaktif.
  • Gunakan pipeline jika Anda memerlukan kustomisasi suara atau ingin memilih model ASR, LLM, dan TTS secara independen.

Halaman ini mencakup pendekatan single-model S2S (seri Omni dan Livetranslate). Untuk pendekatan pipeline, pilih masing-masing komponen secara terpisah:

Mode real-time atau file?

  • Real-time (WebSocket): Asisten suara, pusat panggilan, dan interpretasi simultan. Mengalirkan input audio dan output ucapan.
  • Mode file (HTTP): Latensi lebih tinggi tetapi kualitas lebih baik. Ideal untuk dubbing video, terjemahan podcast, dan pemrosesan offline. Juga mendukung pemanggilan fungsi, pencarian web, mode berpikir, dan konteks video (lihat kemampuan Pendamping di bawah).

Pilih model berdasarkan kasus penggunaan (pendekatan single-model S2S)

Semua kasus penggunaan di bawah menggunakan pendekatan single-model S2S. Untuk pendekatan pipeline, gunakan panduan ASR, LLM, dan TTS yang ditautkan di atas.

Kasus penggunaan

Model yang direkomendasikan

API

Asisten suara dan percakapan layanan pelanggan

qwen-audio-3.0-realtime-plus

WebSocket

Percakapan hemat biaya

qwen-audio-3.0-realtime-flash

WebSocket

Interpretasi simultan dan terjemahan langsung

qwen3.5-livetranslate-flash-realtime

WebSocket

Dubbing video dan terjemahan podcast

qwen3-livetranslate-flash

HTTP

Analisis video dan pelabelan batch (memerlukan mode berpikir)

qwen3-omni-flash

HTTP

Asisten suara VAD semantik dan layanan pelanggan cerdas (dengan dukungan Function Calling)

qwen-audio-3.0-realtime-plus

WebSocket

Kemampuan pendamping pendekatan single-model S2S

Qwen3.5-Omni dan Qwen3-Omni menyediakan kemampuan ini secara native. Qwen-Audio Realtime hanya mendukung function calling; tidak mendukung pencarian web atau mode berpikir. Dengan pipeline, fungsionalitas setara berasal dari komponen individual (biasanya LLM).

Function calling

Model dapat mengkueri basis pengetahuan, memeriksa jadwal, atau memicu alur kerja berdasarkan apa yang didengar dan dilihatnya. Gunakan Qwen3-Omni (HTTP saja) atau Qwen-Audio Realtime (WebSocket).

Tidak didukung oleh model real-time (WebSocket) Qwen3.5-Omni/Qwen3-Omni atau model Livetranslate. Qwen-Audio Realtime (WebSocket) mendukung function calling.

Mengambil informasi real-time untuk peristiwa terkini, harga saham, cuaca, dan kueri serupa. Tersedia di Qwen3.5-Omni (WebSocket atau HTTP, versi Plus dan Flash). Model menentukan sendiri apakah perlu melakukan pencarian. Qwen-Audio Realtime tidak mendukung kemampuan ini.

Tidak didukung oleh Qwen3-Omni-Flash atau model Livetranslate.

Thinking mode

Gunakan Qwen3-Omni (HTTP) ketika kualitas jawaban lebih penting daripada latensi. Melakukan penalaran langkah demi langkah sebelum menjawab, ideal untuk analisis video dan pelabelan batch. Qwen-Audio Realtime tidak mendukung kemampuan ini.

Generasi suara tidak didukung dalam mode berpikir.

Terjemahan ucapan

Seri model berikut mendukung terjemahan ucapan:

  • Qwen3.5-Livetranslate: 60 bahasa (29 dengan output audio+teks, 31 hanya teks). Mencakup Mandarin, Inggris, Prancis, Jerman, Rusia, Jepang, Korea, Spanyol, Portugis, Arab, dan lainnya.
  • Qwen3-Livetranslate: 18 bahasa dan 5 dialek Tionghoa (~3 detik latensi). Mode file menerima input video untuk terjemahan yang mempertimbangkan konteks. 7 bahasa menghasilkan output hanya teks.
  • Qwen3.5-Omni: 29 bahasa output dan 8 dialek Tionghoa. Pemahaman audio/video kuat dan pencarian web. Masukkan terminologi dan konteks domain melalui prompt sistem. Mode real-time dan file.
  • Qwen3-Omni-Flash: 11 bahasa output dan 8 dialek Tionghoa. Masukkan terminologi dan konteks domain melalui prompt sistem. Mode real-time dan file, dengan biaya lebih rendah.

CatatanMulai cepat: seri Livetranslate. Kualitas dan cakupan bahasa terbaik: Qwen3.5-Omni. Hemat biaya: Qwen3-Omni-Flash.

Bahasa yang didukung

Bahasa

Qwen3.5-Livetranslate

Qwen3-Livetranslate

Qwen3.5-Omni

Qwen3-Omni-Flash

Inggris

Didukung

Didukung

Didukung

Didukung

Tionghoa (Mandarin)

Didukung

Didukung

Didukung

Didukung

Kanton

Hanya teks

Didukung

Didukung

Didukung

Dialek Sichuan

Didukung

Didukung

Didukung

Didukung

Shanghainese

Didukung

Didukung

Didukung

Didukung

Dialek Beijing

Didukung

Didukung

Didukung

Didukung

Dialek Tianjin

Didukung

Didukung

Didukung

Didukung

Dialek Nanjing

--

--

Didukung

Didukung

Dialek Shaanxi

--

--

Didukung

Didukung

Dialek Minnan

--

--

Didukung

Didukung

Prancis

Didukung

Didukung

Didukung

Didukung

Jerman

Didukung

Didukung

Didukung

Didukung

Rusia

Didukung

Didukung

Didukung

Didukung

Italia

Didukung

Didukung

Didukung

Didukung

Spanyol

Didukung

Didukung

Didukung

Didukung

Portugis

Didukung

Didukung

Didukung

Didukung

Jepang

Didukung

Didukung

Didukung

Didukung

Bahasa Korea

Didukung

Didukung

Didukung

Didukung

Bahasa Thailand

Didukung

Hanya teks

Didukung

Didukung

Bahasa Indonesia

Didukung

Hanya teks

Didukung

--

Bahasa Vietnam

Didukung

Hanya teks

Didukung

--

Arab

Didukung

Hanya teks

Didukung

--

Hindi

Didukung

Hanya teks

Didukung

--

Turki

Didukung

Hanya teks

Didukung

--

Finlandia

Didukung

--

Didukung

--

Bahasa Polandia

Didukung

--

Didukung

--

Belanda

Didukung

--

Didukung

--

Ceko

Didukung

--

Didukung

--

Urdu

Didukung

--

Didukung

--

Tagalog

Didukung

--

Didukung

--

Swedia

Didukung

--

Didukung

--

Bahasa Denmark

Didukung

--

Didukung

--

Ibrani

Didukung

--

Didukung

--

Islandia

Didukung

--

Didukung

--

Melayu

Didukung

--

Didukung

--

Norwegia

Didukung

--

Didukung

--

Persia

Didukung

--

Didukung

--

Yunani

Hanya teks

Hanya teks

--

--

Afrikaans

Hanya teks

--

--

--

Asturia

Hanya teks

--

--

--

Belarusia

Hanya teks

--

--

--

Bahasa Bulgaria

Hanya teks

--

--

--

Bengali

Hanya teks

--

--

--

Bahasa Bosnia

Hanya teks

--

--

--

Katalan

Hanya teks

--

--

--

Cebuano

Hanya teks

--

--

--

Bahasa Estonia

Hanya teks

--

--

--

Galisia

Hanya teks

--

--

--

Gujarati

Hanya teks

--

--

--

Kroasia

Hanya teks

--

--

--

Hongaria

Hanya teks

--

--

--

Jawa

Hanya teks

--

--

--

Kazakh

Hanya teks

--

--

--

Kannada

Hanya teks

--

--

--

Kirgiz

Hanya teks

--

--

--

Latvia

Hanya teks

--

--

--

Makedonia

Hanya teks

--

--

--

Malayalam

Hanya teks

--

--

--

Marathi

Hanya teks

--

--

--

Punjabi

Hanya teks

--

--

--

Rumania

Hanya teks

--

--

--

Slovakia

Hanya teks

--

--

--

Bahasa Slovenia

Hanya teks

--

--

--

Swahili

Hanya teks

--

--

--

Tajik

Hanya teks

--

--

--

Bahasa Azerbaijan

Hanya teks

--

--

--

Ukraina

Hanya teks

--

--

--

"Didukung" = output ucapan + teks. "Hanya teks" = output teks saja, tanpa ucapan.

Qwen3.5-Omni mendukung 113 bahasa dan dialek input.

Qwen3.5-Livetranslate mendukung 60 bahasa (29 dengan audio dan teks, 31 hanya teks).

Model lama qwen-omni-turbo hanya mendukung Tionghoa dan Inggris.

Model yang direkomendasikan

Tabel ini mencantumkan model titik masuk di setiap seri. Untuk mengunci versi tertentu guna pengujian regresi atau stabilitas, lihat Semua model di bawah.

Model

API

Input

Function calling

Web search

Thinking mode

Terjemahan

qwen-audio-3.0-realtime-plus

WebSocket

audio, text

Didukung

--

--

--

qwen-audio-3.0-realtime-flash

WebSocket

audio, text

Didukung

--

--

--

qwen3.5-omni-flash-realtime

WebSocket

text, audio, image

Didukung

Didukung

--

29 bahasa

qwen3.5-omni-flash

HTTP

text, audio, image, video

Tidak Didukung

Didukung

--

29 bahasa

qwen3-omni-flash-realtime

WebSocket

text, audio, image, video

--

--

--

11 bahasa

qwen3-omni-flash

HTTP

text, audio, image, video

Didukung

--

Didukung

11 bahasa

qwen3.5-livetranslate-flash-realtime

WebSocket

audio, image

--

--

--

60 bahasa

qwen3-livetranslate-flash

HTTP

audio, video

--

--

--

18 bahasa

Semua model

Qwen-Audio

Model

API

Input

Function calling

Web search

Thinking mode

Terjemahan

qwen-audio-3.0-realtime-plus

WebSocket

audio, text

Didukung

--

--

--

qwen-audio-3.0-realtime-flash

WebSocket

audio, text

Didukung

--

--

--

Qwen3.5-Omni

Model

API

Input

Function calling

Web search

Thinking mode

qwen3.5-omni-plus-realtime

WebSocket

Text, audio, image, video

Didukung

Didukung

--

qwen3.5-omni-plus-realtime-2026-03-15

WebSocket

Text, audio, image, video

Didukung

Didukung

--

qwen3.5-omni-plus

HTTP

Text, audio, image, video

Tidak Didukung

Didukung

--

qwen3.5-omni-plus-2026-03-15

HTTP

Text, audio, image, video

Tidak Didukung

Didukung

--

qwen3.5-omni-flash-realtime

WebSocket

Text, audio, image, video

Didukung

Didukung

--

qwen3.5-omni-flash-realtime-2026-03-15

WebSocket

Text, audio, image, video

Didukung

Didukung

--

qwen3.5-omni-flash

HTTP

Text, audio, image, video

Tidak Didukung

Didukung

--

qwen3.5-omni-flash-2026-03-15

HTTP

Text, audio, image, video

Tidak Didukung

Didukung

--

Qwen3-Omni

Model

API

Input

Function calling

Web search

Thinking mode

qwen3-omni-flash-realtime

WebSocket

Text, audio, image, video

--

--

--

qwen3-omni-flash-realtime-2025-12-01

WebSocket

Text, audio, image, video

--

--

--

qwen3-omni-flash-realtime-2025-09-15

WebSocket

Text, audio, image, video

--

--

--

qwen3-omni-flash

HTTP

Text, audio, image, video

Didukung

--

Didukung

qwen3-omni-flash-2025-12-01

HTTP

Text, audio, image, video

Didukung

--

Didukung

qwen3-omni-flash-2025-09-15

HTTP

Text, audio, image, video

Didukung

--

Didukung

Qwen3.5-Livetranslate

Model

API

Input

Bahasa

qwen3.5-livetranslate-flash-realtime

WebSocket

Audio

60

qwen3.5-livetranslate-flash-realtime-2026-05-19

WebSocket

Audio

60

Qwen3-Livetranslate

Model

API

Input

Bahasa

qwen3-livetranslate-flash-realtime

WebSocket

Audio

18

qwen3-livetranslate-flash-realtime-2025-09-22

WebSocket

Audio

18

qwen3-livetranslate-flash

HTTP

Audio, video

18

qwen3-livetranslate-flash-2025-12-01

HTTP

Audio, video

18

Model lama

Model-model ini tidak lagi diperbarui. Untuk proyek baru, gunakan Qwen3.5-Omni.

Model

Input

API

qwen2.5-omni-7b

Text, audio, image, video

HTTP

qwen-omni-turbo

Text, audio, image, video

HTTP

qwen-omni-turbo-latest

Text, audio, image, video

HTTP

qwen-omni-turbo-2025-03-26

Text, audio, image, video

HTTP

qwen-omni-turbo-realtime

Text, audio

WebSocket

qwen-omni-turbo-realtime-latest

Text, audio

WebSocket

qwen-omni-turbo-realtime-2025-05-08

Text, audio

WebSocket

Langkah selanjutnya

Dokumentasi API berdasarkan seri model: