Pilih model yang tepat untuk pengenalan suara secara real-time atau berbasis file.
Migrasi dari model closed-source
Petakan layanan Whisper, Deepgram, atau Google ASR Anda saat ini ke padanan Bailian.
Kasus penggunaan | Contoh closed-source | Rekomendasi Bailian |
|---|---|---|
Pengenalan real-time | Deepgram Nova-3, Google Chirp 3 |
|
Transkripsi offline / file | OpenAI gpt-4o-transcribe, Whisper |
|
Gunakan empat "Kriteria pemilihan"—real-time vs. offline, terminologi domain, diarization pembicara, dan pengenalan emosi—untuk mengidentifikasi model yang tepat. Selanjutnya, lihat "Model yang direkomendasikan" untuk pilihan terbaik berdasarkan skenario, "Semua model" untuk daftar lengkap versi berdasarkan family model, dan "Spesifikasi audio" untuk batasan input. Bahasa yang didukung (termasuk dialek) tercantum di bawah setiap family model dalam "Semua model".
Kriteria pemilihan
Evaluasi empat dimensi untuk menemukan model yang tepat.
Real-time atau offline?
Pengenalan real-time mengembalikan hasil saat pengguna berbicara. Pengenalan offline mentranskripsikan file yang telah direkam setelah rekaman selesai.
- Real-time (pengenalan streaming): Menggunakan koneksi WebSocket untuk mengalirkan audio masuk dan teks keluar. Ideal untuk takarir langsung, asisten suara, dan transkripsi rapat. Model yang direkomendasikan:
qwen-audio-3.0-asr-flash-streaming(hot words, konteks prompt, multibahasa dengan dialek). - Offline (transkripsi file): Menggunakan API HTTP untuk mengirimkan file audio dan mengambil hasil transkripsi. Cocok untuk rekaman pusat panggilan, podcast, dan wawancara. Model yang direkomendasikan:
qwen-audio-3.0-asr-flash-filetrans(hot words, konteks prompt, diarization pembicara).
Model seri Qwen-Audio-3.0-ASR-Flash-Streaming dan Fun-ASR-Realtime juga mendukung protokol AOQ. Untuk integrasi sisi client yang memprioritaskan latensi stabil, ketahanan pada jaringan lemah, serta penekanan noise full-duplex dan pembatalan gema bawaan, AOQ direkomendasikan. Untuk perbandingan protokol, lihat Ikhtisar API real-time.
Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, serta model real-time Fun-ASR dan Qwen-ASR mendukung SDK DashScope (Java, Python). Semua model lain memerlukan panggilan API WebSocket atau HTTP langsung.
Untuk integrasi real-time, lihat Pengenalan suara real-time. Untuk integrasi offline, lihat Pengenalan suara non-real-time.
Terminologi domain
Dua pendekatan, diurutkan berdasarkan fleksibilitas:
- Injeksi konteks prompt: Jelaskan domain Anda dalam prompt sistem. Tidak perlu penyiapan—model menyesuaikan per permintaan. Direkomendasikan: seri Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, dan Qwen-Audio-3.0-ASR-Flash.
- Hot words: Sediakan daftar kosakata berbobot. Direkomendasikan: seri Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, dan Qwen-Audio-3.0-ASR-Flash.
Diarization pembicara
Seri Qwen-Audio-3.0-ASR-Flash-Filetrans (qwen-audio-3.0-asr-flash-filetrans) dan model offline Fun-ASR (fun-asr dan fun-asr-mtl) mendukung diarization pembicara. Untuk mengidentifikasi siapa yang mengatakan apa, gunakan qwen-audio-3.0-asr-flash-filetrans.
Pengenalan emosi
Model Qwen-ASR mendeteksi emosi bersamaan dengan transkripsi. Model yang direkomendasikan: qwen3-asr-flash-realtime (real-time) atau qwen3-asr-flash-filetrans (offline).
Model yang direkomendasikan
Pilihan terbaik untuk skenario umum.
ID Model | Mode | API | Peningkatan akurasi | Pengenalan emosi | Diarization pembicara | Bahasa | Durasi/ukuran audio maksimum |
|---|---|---|---|---|---|---|---|
| Real-time | WebSocket | Hot words, konteks prompt | Tidak didukung | Tidak didukung | Multibahasa dengan dialek | Tanpa Batas |
| Offline | HTTP | Hot words, konteks prompt | Tidak didukung | Didukung | Multibahasa dengan dialek | 12 jam / 2 GB |
Semua model
Qwen-Audio-3.0-ASR-Flash-Streaming
ID Model | Mode | API | Peningkatan akurasi | Pengenalan emosi | Diarization pembicara | Durasi/ukuran audio maksimum | |
|---|---|---|---|---|---|---|---|
| Real-time | WebSocket | Hot words, konteks prompt | Tidak didukung | Tidak didukung | Multibahasa dengan dialek | Tanpa Batas |
Bahasa yang didukung (berdasarkan versi):
qwen-audio-3.0-asr-flash-streaming: Bahasa Tionghoa (Mandarin, Kanton, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus aksen regional termasuk Dataran Tengah, Barat Daya, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Timur Laut, Beijing, dan Hong Kong/Taiwan—meliputi aksen Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, dan Ningxia), Inggris, Jepang, Korea, Vietnam, Thailand, Indonesia, Melayu, Filipina, Hindi, Arab, Prancis, Jerman, Spanyol, Portugis, Rusia, Italia, Belanda, Swedia, Denmark, Finlandia, Norwegia, Yunani, Polandia, Ceko, Hongaria, Rumania, Bulgaria, Kroasia, Slovakia
Qwen-Audio-3.0-ASR-Flash-Filetrans
ID Model | Mode | API | Peningkatan akurasi | Pengenalan emosi | Diarization pembicara | Durasi/ukuran audio maksimum | |
|---|---|---|---|---|---|---|---|
| Offline | HTTP | Hot words, konteks prompt | Tidak didukung | Didukung | Multibahasa dengan dialek | 12 jam / 2 GB |
Bahasa yang didukung (berdasarkan versi):
qwen-audio-3.0-asr-flash-filetrans: Bahasa Tionghoa (Mandarin, Kanton, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus aksen regional termasuk Dataran Tengah, Barat Daya, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Timur Laut, Beijing, dan Hong Kong/Taiwan—meliputi aksen Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, dan Ningxia), Inggris, Jepang, Korea, Vietnam, Thailand, Indonesia, Melayu, Filipina, Hindi, Arab, Prancis, Jerman, Spanyol, Portugis, Rusia, Italia, Belanda, Swedia, Denmark, Finlandia, Norwegia, Yunani, Polandia, Ceko, Hongaria, Rumania, Bulgaria, Kroasia, Slovakia
Qwen-Audio-3.0-ASR-Flash
ID Model | Mode | API | Peningkatan akurasi | Pengenalan emosi | Diarization pembicara | Durasi/ukuran audio maksimum | |
|---|---|---|---|---|---|---|---|
| Offline | HTTP | Hot words, konteks prompt | Tidak didukung | Tidak didukung | Multibahasa dengan dialek | 5 menit / 2 GB |
Bahasa yang didukung (berdasarkan versi):
qwen-audio-3.0-asr-flash: Bahasa Tionghoa (Mandarin, Kanton, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus aksen regional termasuk Dataran Tengah, Barat Daya, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Timur Laut, Beijing, dan Hong Kong/Taiwan—meliputi aksen Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, dan Ningxia), Inggris, Jepang, Korea, Vietnam, Thailand, Indonesia, Melayu, Filipina, Hindi, Arab, Prancis, Jerman, Spanyol, Portugis, Rusia, Italia, Belanda, Swedia, Denmark, Finlandia, Norwegia, Yunani, Polandia, Ceko, Hongaria, Rumania, Bulgaria, Kroasia, Slovakia
Fun-ASR
ID Model | Mode | API | Peningkatan akurasi | Pengenalan emosi | Diarization pembicara | Durasi/ukuran audio maksimum | |
|---|---|---|---|---|---|---|---|
| Real-time | WebSocket | Hot words | Tidak didukung | Tidak didukung | Bahasa Tionghoa, Inggris, Jepang, dan dialek | Tanpa Batas |
| Real-time | WebSocket | Hot words | Tidak didukung | Tidak didukung | Bahasa Tionghoa, Inggris, Jepang, dan dialek | Tanpa Batas |
| Real-time | WebSocket | Hot words | Tidak didukung | Tidak didukung | Bahasa Tionghoa, Inggris, Jepang, dan dialek | Tanpa Batas |
| Real-time | WebSocket | Hot words | Tidak didukung | Tidak didukung | Bahasa Tionghoa, Inggris | Tanpa Batas |
| Real-time | WebSocket | Hot words | Tidak didukung | Tidak didukung | Bahasa Tionghoa | Tanpa Batas |
| Real-time | WebSocket | Hot words | Tidak didukung | Tidak didukung | Bahasa Tionghoa | Tanpa Batas |
| Offline | HTTP | Hot words | Tidak didukung | Didukung | Multibahasa dengan dialek | 12 jam / 2 GB |
| Offline | HTTP | Konteks prompt | Tidak didukung | Tidak didukung | Multibahasa dengan dialek | 5 menit / 2 GB |
| Offline | HTTP | Hot words | Tidak didukung | Didukung | Multibahasa dengan dialek | 12 jam / 2 GB |
| Offline | HTTP | Hot words | Tidak didukung | Didukung | Bahasa Tionghoa, Inggris | 12 jam / 2 GB |
| Offline | HTTP | Hot words | Tidak didukung | Didukung | Multibahasa dengan dialek | 12 jam / 2 GB |
| Offline | HTTP | Hot words | Tidak didukung | Didukung | Multibahasa dengan dialek | 12 jam / 2 GB |
Bahasa yang didukung (berdasarkan versi):
- Versi utama Fun-ASR-Realtime (
fun-asr-realtime,fun-asr-realtime-2026-02-28,fun-asr-realtime-2025-11-07): Bahasa Tionghoa (Mandarin, Kanton, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus aksen regional termasuk Dataran Tengah, Barat Daya, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Timur Laut, Beijing, dan Hong Kong/Taiwan—meliputi aksen Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, dan Ningxia), Inggris, Jepang fun-asr-realtime-2025-09-15: Bahasa Tionghoa (Mandarin), Inggris- Fun-ASR-Flash-Realtime(8K) (
fun-asr-flash-8k-realtime,fun-asr-flash-8k-realtime-2026-01-28): Bahasa Tionghoa - Versi utama Fun-ASR (
fun-asr,fun-asr-2025-11-07): Bahasa Tionghoa (Mandarin, Kanton, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus aksen regional termasuk Dataran Tengah, Barat Daya, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Timur Laut, Beijing, dan Hong Kong/Taiwan—meliputi aksen Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, dan Ningxia), Inggris, Jepang, Korea, Vietnam, Thailand, Indonesia, Melayu, Filipina, Hindi, Arab, Prancis, Jerman, Spanyol, Portugis, Rusia, Italia, Belanda, Swedia, Denmark, Finlandia, Norwegia, Yunani, Polandia, Ceko, Hongaria, Rumania, Bulgaria, Kroasia, Slovakia - Fun-ASR-Flash (
fun-asr-flash-2026-06-15): Bahasa Tionghoa (Mandarin, Kanton, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus aksen regional termasuk Dataran Tengah, Barat Daya, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Timur Laut, Beijing, dan Hong Kong/Taiwan—meliputi aksen Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, dan Ningxia), Inggris, Jepang, Korea, Vietnam, Thailand, Indonesia, Melayu, Filipina, Hindi, Arab, Prancis, Jerman, Spanyol, Portugis, Rusia, Italia, Belanda, Swedia, Denmark, Finlandia, Norwegia, Yunani, Polandia, Ceko, Hongaria, Rumania, Bulgaria, Kroasia, Slovakia fun-asr-2025-08-25: Bahasa Tionghoa (Mandarin), Inggris- Fun-ASR(MTL) (
fun-asr-mtl,fun-asr-mtl-2025-08-25): Bahasa Tionghoa (Mandarin, Kanton), Inggris, Jepang, Korea, Vietnam, Thailand, Indonesia, Melayu, Filipina, Hindi, Arab, Prancis, Jerman, Spanyol, Portugis, Rusia, Italia, Belanda, Swedia, Denmark, Finlandia, Norwegia, Yunani, Polandia, Ceko, Hongaria, Rumania, Bulgaria, Kroasia, Slovakia
Qwen-ASR
ID Model | Mode | API | Peningkatan akurasi | Pengenalan emosi | Diarization pembicara | Durasi/ukuran audio maksimum | |
|---|---|---|---|---|---|---|---|
| Real-time | WebSocket | Tidak didukung | Didukung | Tidak didukung | Multibahasa dengan dialek | Tanpa Batas |
| Real-time | WebSocket | Tidak didukung | Didukung | Tidak didukung | Multibahasa dengan dialek | Tanpa Batas |
| Real-time | WebSocket | Tidak didukung | Didukung | Tidak didukung | Multibahasa dengan dialek | Tanpa Batas |
| Offline | HTTP | Tidak didukung | Didukung | Tidak didukung | Multibahasa dengan dialek | 12 jam / 2 GB |
| Offline | HTTP | Tidak didukung | Didukung | Tidak didukung | Multibahasa dengan dialek | 12 jam / 2 GB |
| Offline | HTTP (kompatibel OpenAI) | Tidak didukung | Didukung | Tidak didukung | Multibahasa dengan dialek | 5 menit / 10 MB |
| Offline | HTTP (kompatibel OpenAI) | Tidak didukung | Didukung | Tidak didukung | Multibahasa dengan dialek | 5 menit / 10 MB |
| Offline | HTTP (kompatibel OpenAI) | Tidak didukung | Didukung | Tidak didukung | Multibahasa dengan dialek | 5 menit / 10 MB |
Bahasa yang didukung: Semua model Qwen-ASR (qwen3-asr-flash-realtime, qwen3-asr-flash-filetrans, qwen3-asr-flash, dan versi snapshot-nya) memiliki daftar bahasa yang sama: Bahasa Tionghoa (Mandarin, Sichuan, Hokkien, Wu, Kanton), Inggris, Jepang, Jerman, Korea, Rusia, Prancis, Portugis, Arab, Italia, Spanyol, Hindi, Indonesia, Thailand, Turki, Ukraina, Vietnam, Ceko, Denmark, Filipina, Finlandia, Islandia, Melayu, Norwegia, Polandia, Swedia.
Paraformer
Paraformer adalah family model ASR generasi lama. Migrasikan ke Fun-ASR atau Qwen-ASR jika memungkinkan.
ID Model | API | Deskripsi |
|---|---|---|
| WebSocket | Pengenalan real-time; Bahasa Tionghoa, Inggris, Jepang, Korea, Jerman, Prancis, Rusia |
| WebSocket | Pengenalan real-time; Bahasa Tionghoa, Inggris, Jepang, Korea, Jerman, Prancis, Rusia |
| WebSocket | Pengenalan real-time untuk telepon 8 kHz; Bahasa Tionghoa |
| WebSocket | Pengenalan real-time untuk telepon 8 kHz; Bahasa Tionghoa |
| HTTP | Transkripsi file dengan diarization pembicara; Bahasa Tionghoa, Inggris, Jepang, Korea, Jerman, Prancis, Rusia |
| HTTP | Transkripsi file untuk telepon 8 kHz; Bahasa Tionghoa |
Bahasa yang didukung (berdasarkan versi):
paraformer-realtime-v2,paraformer-v2: Bahasa Tionghoa (Mandarin, Kanton, Wu, Hokkien, Timur Laut, Gansu, Guizhou, Henan, Hubei, Hunan, Ningxia, Shanxi, Shaanxi, Shandong, Sichuan, Tianjin, Jiangxi, Yunnan, Shanghai), Inggris, Jepang, Korea, Jerman, Prancis, Rusiaparaformer-realtime-v1,paraformer-realtime-8k-v2,paraformer-realtime-8k-v1,paraformer-8k-v2: Bahasa Tionghoa (Mandarin)
Spesifikasi audio
Spesifikasi audio untuk mode real-time dan offline. Untuk bahasa yang didukung, lihat subbagian family model di "Semua model".
Real-time
ID Model | Metode input | Format audio | Sample rate | Ukuran/durasi |
|---|---|---|---|---|
Qwen-Audio-3.0-ASR-Flash-Streaming ( | Aliran biner |
| Apa saja | Tanpa Batas |
Fun-ASR-Realtime / Fun-ASR-MTL-Realtime ( | Aliran biner |
| Apa saja | Tanpa Batas |
Fun-ASR-Flash-8K-Realtime ( | Aliran biner | Sama seperti Fun-ASR-Realtime | 8 kHz | Tanpa Batas |
Qwen-ASR-Realtime ( | Aliran biner |
| 8 kHz, 16 kHz | Tanpa Batas |
Paraformer-Realtime ( | Aliran biner | Sama seperti Fun-ASR-Realtime |
| Tanpa Batas |
Semua model real-time hanya menerima input mono (satu channel).
Offline
ID Model | Metode input | Format audio | Sample rate | Ukuran file/durasi |
|---|---|---|---|---|
Qwen-Audio-3.0-ASR-Flash-Filetrans ( | URL file yang dapat diakses publik; 1 URL per permintaan |
| Apa saja | ≤2 GB; ≤12 jam (≤2 jam direkomendasikan saat diarization pembicara diaktifkan) |
Qwen-Audio-3.0-ASR-Flash ( | URL / Base64; 1 file per permintaan |
| Apa saja | ≤2 GB; ≤5 menit |
Fun-ASR ( | URL file yang dapat diakses publik; 1 URL per permintaan |
| Apa saja | ≤2 GB; ≤12 jam (≤2 jam direkomendasikan saat diarization pembicara diaktifkan) |
Fun-ASR-Flash ( | URL / Base64; 1 file per permintaan |
| Apa saja | ≤2 GB; ≤5 menit |
Paraformer ( | Sama seperti Fun-ASR | Sama seperti Fun-ASR | paraformer-v2 semua rate; | Sama seperti Fun-ASR |
Qwen3-ASR-Flash-Filetrans ( | URL file yang dapat diakses publik; 1 URL per permintaan |
|
| ≤2 GB; ≤12 jam |
Qwen3-ASR-Flash ( | URL / Base64 / jalur mutlak file lokal; 1 file per permintaan |
|
| ≤10 MB; ≤5 menit |