All Products
Search
Document Center

Alibaba Cloud Model Studio:Ikhtisar speech-to-text

Last Updated:Sep 03, 2026

Pilih model yang tepat untuk pengenalan suara secara real-time atau berbasis file.

Migrasi dari model closed-source

Petakan layanan Whisper, Deepgram, atau Google ASR Anda saat ini ke padanan Bailian.

Kasus penggunaan

Contoh closed-source

Rekomendasi Bailian

Pengenalan real-time

Deepgram Nova-3, Google Chirp 3

qwen-audio-3.0-asr-flash-streaming

Transkripsi offline / file

OpenAI gpt-4o-transcribe, Whisper

qwen-audio-3.0-asr-flash-filetrans, qwen-audio-3.0-asr-flash

Gunakan empat "Kriteria pemilihan"—real-time vs. offline, terminologi domain, diarization pembicara, dan pengenalan emosi—untuk mengidentifikasi model yang tepat. Selanjutnya, lihat "Model yang direkomendasikan" untuk pilihan terbaik berdasarkan skenario, "Semua model" untuk daftar lengkap versi berdasarkan family model, dan "Spesifikasi audio" untuk batasan input. Bahasa yang didukung (termasuk dialek) tercantum di bawah setiap family model dalam "Semua model".

Kriteria pemilihan

Evaluasi empat dimensi untuk menemukan model yang tepat.

Real-time atau offline?

Pengenalan real-time mengembalikan hasil saat pengguna berbicara. Pengenalan offline mentranskripsikan file yang telah direkam setelah rekaman selesai.

  • Real-time (pengenalan streaming): Menggunakan koneksi WebSocket untuk mengalirkan audio masuk dan teks keluar. Ideal untuk takarir langsung, asisten suara, dan transkripsi rapat. Model yang direkomendasikan: qwen-audio-3.0-asr-flash-streaming (hot words, konteks prompt, multibahasa dengan dialek).
  • Offline (transkripsi file): Menggunakan API HTTP untuk mengirimkan file audio dan mengambil hasil transkripsi. Cocok untuk rekaman pusat panggilan, podcast, dan wawancara. Model yang direkomendasikan: qwen-audio-3.0-asr-flash-filetrans (hot words, konteks prompt, diarization pembicara).

Model seri Qwen-Audio-3.0-ASR-Flash-Streaming dan Fun-ASR-Realtime juga mendukung protokol AOQ. Untuk integrasi sisi client yang memprioritaskan latensi stabil, ketahanan pada jaringan lemah, serta penekanan noise full-duplex dan pembatalan gema bawaan, AOQ direkomendasikan. Untuk perbandingan protokol, lihat Ikhtisar API real-time.

Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, serta model real-time Fun-ASR dan Qwen-ASR mendukung SDK DashScope (Java, Python). Semua model lain memerlukan panggilan API WebSocket atau HTTP langsung.

Untuk integrasi real-time, lihat Pengenalan suara real-time. Untuk integrasi offline, lihat Pengenalan suara non-real-time.

Terminologi domain

Dua pendekatan, diurutkan berdasarkan fleksibilitas:

  1. Injeksi konteks prompt: Jelaskan domain Anda dalam prompt sistem. Tidak perlu penyiapan—model menyesuaikan per permintaan. Direkomendasikan: seri Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, dan Qwen-Audio-3.0-ASR-Flash.
  2. Hot words: Sediakan daftar kosakata berbobot. Direkomendasikan: seri Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, dan Qwen-Audio-3.0-ASR-Flash.

Diarization pembicara

Seri Qwen-Audio-3.0-ASR-Flash-Filetrans (qwen-audio-3.0-asr-flash-filetrans) dan model offline Fun-ASR (fun-asr dan fun-asr-mtl) mendukung diarization pembicara. Untuk mengidentifikasi siapa yang mengatakan apa, gunakan qwen-audio-3.0-asr-flash-filetrans.

Pengenalan emosi

Model Qwen-ASR mendeteksi emosi bersamaan dengan transkripsi. Model yang direkomendasikan: qwen3-asr-flash-realtime (real-time) atau qwen3-asr-flash-filetrans (offline).

Model yang direkomendasikan

Pilihan terbaik untuk skenario umum.

ID Model

Mode

API

Peningkatan akurasi

Pengenalan emosi

Diarization pembicara

Bahasa

Durasi/ukuran audio maksimum

qwen-audio-3.0-asr-flash-streaming

Real-time

WebSocket

Hot words, konteks prompt

Tidak didukung

Tidak didukung

Multibahasa dengan dialek

Tanpa Batas

qwen-audio-3.0-asr-flash-filetrans

Offline

HTTP

Hot words, konteks prompt

Tidak didukung

Didukung

Multibahasa dengan dialek

12 jam / 2 GB

Semua model

Qwen-Audio-3.0-ASR-Flash-Streaming

ID Model

Mode

API

Peningkatan akurasi

Pengenalan emosi

Diarization pembicara

Bahasa

Durasi/ukuran audio maksimum

qwen-audio-3.0-asr-flash-streaming

Real-time

WebSocket

Hot words, konteks prompt

Tidak didukung

Tidak didukung

Multibahasa dengan dialek

Tanpa Batas

Bahasa yang didukung (berdasarkan versi):

  • qwen-audio-3.0-asr-flash-streaming: Bahasa Tionghoa (Mandarin, Kanton, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus aksen regional termasuk Dataran Tengah, Barat Daya, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Timur Laut, Beijing, dan Hong Kong/Taiwan—meliputi aksen Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, dan Ningxia), Inggris, Jepang, Korea, Vietnam, Thailand, Indonesia, Melayu, Filipina, Hindi, Arab, Prancis, Jerman, Spanyol, Portugis, Rusia, Italia, Belanda, Swedia, Denmark, Finlandia, Norwegia, Yunani, Polandia, Ceko, Hongaria, Rumania, Bulgaria, Kroasia, Slovakia

Qwen-Audio-3.0-ASR-Flash-Filetrans

ID Model

Mode

API

Peningkatan akurasi

Pengenalan emosi

Diarization pembicara

Bahasa

Durasi/ukuran audio maksimum

qwen-audio-3.0-asr-flash-filetrans

Offline

HTTP

Hot words, konteks prompt

Tidak didukung

Didukung

Multibahasa dengan dialek

12 jam / 2 GB

Bahasa yang didukung (berdasarkan versi):

  • qwen-audio-3.0-asr-flash-filetrans: Bahasa Tionghoa (Mandarin, Kanton, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus aksen regional termasuk Dataran Tengah, Barat Daya, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Timur Laut, Beijing, dan Hong Kong/Taiwan—meliputi aksen Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, dan Ningxia), Inggris, Jepang, Korea, Vietnam, Thailand, Indonesia, Melayu, Filipina, Hindi, Arab, Prancis, Jerman, Spanyol, Portugis, Rusia, Italia, Belanda, Swedia, Denmark, Finlandia, Norwegia, Yunani, Polandia, Ceko, Hongaria, Rumania, Bulgaria, Kroasia, Slovakia

Qwen-Audio-3.0-ASR-Flash

ID Model

Mode

API

Peningkatan akurasi

Pengenalan emosi

Diarization pembicara

Bahasa

Durasi/ukuran audio maksimum

qwen-audio-3.0-asr-flash

Offline

HTTP

Hot words, konteks prompt

Tidak didukung

Tidak didukung

Multibahasa dengan dialek

5 menit / 2 GB

Bahasa yang didukung (berdasarkan versi):

  • qwen-audio-3.0-asr-flash: Bahasa Tionghoa (Mandarin, Kanton, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus aksen regional termasuk Dataran Tengah, Barat Daya, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Timur Laut, Beijing, dan Hong Kong/Taiwan—meliputi aksen Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, dan Ningxia), Inggris, Jepang, Korea, Vietnam, Thailand, Indonesia, Melayu, Filipina, Hindi, Arab, Prancis, Jerman, Spanyol, Portugis, Rusia, Italia, Belanda, Swedia, Denmark, Finlandia, Norwegia, Yunani, Polandia, Ceko, Hongaria, Rumania, Bulgaria, Kroasia, Slovakia

Fun-ASR

ID Model

Mode

API

Peningkatan akurasi

Pengenalan emosi

Diarization pembicara

Bahasa

Durasi/ukuran audio maksimum

fun-asr-realtime

Real-time

WebSocket

Hot words

Tidak didukung

Tidak didukung

Bahasa Tionghoa, Inggris, Jepang, dan dialek

Tanpa Batas

fun-asr-realtime-2026-02-28

Real-time

WebSocket

Hot words

Tidak didukung

Tidak didukung

Bahasa Tionghoa, Inggris, Jepang, dan dialek

Tanpa Batas

fun-asr-realtime-2025-11-07

Real-time

WebSocket

Hot words

Tidak didukung

Tidak didukung

Bahasa Tionghoa, Inggris, Jepang, dan dialek

Tanpa Batas

fun-asr-realtime-2025-09-15

Real-time

WebSocket

Hot words

Tidak didukung

Tidak didukung

Bahasa Tionghoa, Inggris

Tanpa Batas

fun-asr-flash-8k-realtime

Real-time

WebSocket

Hot words

Tidak didukung

Tidak didukung

Bahasa Tionghoa

Tanpa Batas

fun-asr-flash-8k-realtime-2026-01-28

Real-time

WebSocket

Hot words

Tidak didukung

Tidak didukung

Bahasa Tionghoa

Tanpa Batas

fun-asr

Offline

HTTP

Hot words

Tidak didukung

Didukung

Multibahasa dengan dialek

12 jam / 2 GB

fun-asr-flash-2026-06-15

Offline

HTTP

Konteks prompt

Tidak didukung

Tidak didukung

Multibahasa dengan dialek

5 menit / 2 GB

fun-asr-2025-11-07

Offline

HTTP

Hot words

Tidak didukung

Didukung

Multibahasa dengan dialek

12 jam / 2 GB

fun-asr-2025-08-25

Offline

HTTP

Hot words

Tidak didukung

Didukung

Bahasa Tionghoa, Inggris

12 jam / 2 GB

fun-asr-mtl

Offline

HTTP

Hot words

Tidak didukung

Didukung

Multibahasa dengan dialek

12 jam / 2 GB

fun-asr-mtl-2025-08-25

Offline

HTTP

Hot words

Tidak didukung

Didukung

Multibahasa dengan dialek

12 jam / 2 GB

Bahasa yang didukung (berdasarkan versi):

  • Versi utama Fun-ASR-Realtime (fun-asr-realtime, fun-asr-realtime-2026-02-28, fun-asr-realtime-2025-11-07): Bahasa Tionghoa (Mandarin, Kanton, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus aksen regional termasuk Dataran Tengah, Barat Daya, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Timur Laut, Beijing, dan Hong Kong/Taiwan—meliputi aksen Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, dan Ningxia), Inggris, Jepang
  • fun-asr-realtime-2025-09-15: Bahasa Tionghoa (Mandarin), Inggris
  • Fun-ASR-Flash-Realtime(8K) (fun-asr-flash-8k-realtime, fun-asr-flash-8k-realtime-2026-01-28): Bahasa Tionghoa
  • Versi utama Fun-ASR (fun-asr, fun-asr-2025-11-07): Bahasa Tionghoa (Mandarin, Kanton, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus aksen regional termasuk Dataran Tengah, Barat Daya, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Timur Laut, Beijing, dan Hong Kong/Taiwan—meliputi aksen Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, dan Ningxia), Inggris, Jepang, Korea, Vietnam, Thailand, Indonesia, Melayu, Filipina, Hindi, Arab, Prancis, Jerman, Spanyol, Portugis, Rusia, Italia, Belanda, Swedia, Denmark, Finlandia, Norwegia, Yunani, Polandia, Ceko, Hongaria, Rumania, Bulgaria, Kroasia, Slovakia
  • Fun-ASR-Flash (fun-asr-flash-2026-06-15): Bahasa Tionghoa (Mandarin, Kanton, Wu, Hokkien, Hakka, Gan, Xiang, Jin; plus aksen regional termasuk Dataran Tengah, Barat Daya, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Timur Laut, Beijing, dan Hong Kong/Taiwan—meliputi aksen Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu, dan Ningxia), Inggris, Jepang, Korea, Vietnam, Thailand, Indonesia, Melayu, Filipina, Hindi, Arab, Prancis, Jerman, Spanyol, Portugis, Rusia, Italia, Belanda, Swedia, Denmark, Finlandia, Norwegia, Yunani, Polandia, Ceko, Hongaria, Rumania, Bulgaria, Kroasia, Slovakia
  • fun-asr-2025-08-25: Bahasa Tionghoa (Mandarin), Inggris
  • Fun-ASR(MTL) (fun-asr-mtl, fun-asr-mtl-2025-08-25): Bahasa Tionghoa (Mandarin, Kanton), Inggris, Jepang, Korea, Vietnam, Thailand, Indonesia, Melayu, Filipina, Hindi, Arab, Prancis, Jerman, Spanyol, Portugis, Rusia, Italia, Belanda, Swedia, Denmark, Finlandia, Norwegia, Yunani, Polandia, Ceko, Hongaria, Rumania, Bulgaria, Kroasia, Slovakia

Qwen-ASR

ID Model

Mode

API

Peningkatan akurasi

Pengenalan emosi

Diarization pembicara

Bahasa

Durasi/ukuran audio maksimum

qwen3-asr-flash-realtime

Real-time

WebSocket

Tidak didukung

Didukung

Tidak didukung

Multibahasa dengan dialek

Tanpa Batas

qwen3-asr-flash-realtime-2026-02-10

Real-time

WebSocket

Tidak didukung

Didukung

Tidak didukung

Multibahasa dengan dialek

Tanpa Batas

qwen3-asr-flash-realtime-2025-10-27

Real-time

WebSocket

Tidak didukung

Didukung

Tidak didukung

Multibahasa dengan dialek

Tanpa Batas

qwen3-asr-flash-filetrans

Offline

HTTP

Tidak didukung

Didukung

Tidak didukung

Multibahasa dengan dialek

12 jam / 2 GB

qwen3-asr-flash-filetrans-2025-11-17

Offline

HTTP

Tidak didukung

Didukung

Tidak didukung

Multibahasa dengan dialek

12 jam / 2 GB

qwen3-asr-flash

Offline

HTTP (kompatibel OpenAI)

Tidak didukung

Didukung

Tidak didukung

Multibahasa dengan dialek

5 menit / 10 MB

qwen3-asr-flash-2026-02-10

Offline

HTTP (kompatibel OpenAI)

Tidak didukung

Didukung

Tidak didukung

Multibahasa dengan dialek

5 menit / 10 MB

qwen3-asr-flash-2025-09-08

Offline

HTTP (kompatibel OpenAI)

Tidak didukung

Didukung

Tidak didukung

Multibahasa dengan dialek

5 menit / 10 MB

Bahasa yang didukung: Semua model Qwen-ASR (qwen3-asr-flash-realtime, qwen3-asr-flash-filetrans, qwen3-asr-flash, dan versi snapshot-nya) memiliki daftar bahasa yang sama: Bahasa Tionghoa (Mandarin, Sichuan, Hokkien, Wu, Kanton), Inggris, Jepang, Jerman, Korea, Rusia, Prancis, Portugis, Arab, Italia, Spanyol, Hindi, Indonesia, Thailand, Turki, Ukraina, Vietnam, Ceko, Denmark, Filipina, Finlandia, Islandia, Melayu, Norwegia, Polandia, Swedia.

Paraformer

Paraformer adalah family model ASR generasi lama. Migrasikan ke Fun-ASR atau Qwen-ASR jika memungkinkan.

ID Model

API

Deskripsi

paraformer-realtime-v2

WebSocket

Pengenalan real-time; Bahasa Tionghoa, Inggris, Jepang, Korea, Jerman, Prancis, Rusia

paraformer-realtime-v1

WebSocket

Pengenalan real-time; Bahasa Tionghoa, Inggris, Jepang, Korea, Jerman, Prancis, Rusia

paraformer-realtime-8k-v2

WebSocket

Pengenalan real-time untuk telepon 8 kHz; Bahasa Tionghoa

paraformer-realtime-8k-v1

WebSocket

Pengenalan real-time untuk telepon 8 kHz; Bahasa Tionghoa

paraformer-v2

HTTP

Transkripsi file dengan diarization pembicara; Bahasa Tionghoa, Inggris, Jepang, Korea, Jerman, Prancis, Rusia

paraformer-8k-v2

HTTP

Transkripsi file untuk telepon 8 kHz; Bahasa Tionghoa

Bahasa yang didukung (berdasarkan versi):

  • paraformer-realtime-v2, paraformer-v2: Bahasa Tionghoa (Mandarin, Kanton, Wu, Hokkien, Timur Laut, Gansu, Guizhou, Henan, Hubei, Hunan, Ningxia, Shanxi, Shaanxi, Shandong, Sichuan, Tianjin, Jiangxi, Yunnan, Shanghai), Inggris, Jepang, Korea, Jerman, Prancis, Rusia
  • paraformer-realtime-v1, paraformer-realtime-8k-v2, paraformer-realtime-8k-v1, paraformer-8k-v2: Bahasa Tionghoa (Mandarin)

Spesifikasi audio

Spesifikasi audio untuk mode real-time dan offline. Untuk bahasa yang didukung, lihat subbagian family model di "Semua model".

Real-time

ID Model

Metode input

Format audio

Sample rate

Ukuran/durasi

Qwen-Audio-3.0-ASR-Flash-Streaming (qwen-audio-3.0-asr-flash-streaming series)

Aliran biner

pcm, wav, mp3, opus, speex, aac, amr

Apa saja

Tanpa Batas

Fun-ASR-Realtime / Fun-ASR-MTL-Realtime (fun-asr-realtime, fun-asr-mtl-realtime series)

Aliran biner

pcm, wav, mp3, opus, speex, aac, amr

Apa saja

Tanpa Batas

Fun-ASR-Flash-8K-Realtime (fun-asr-flash-8k-realtime series)

Aliran biner

Sama seperti Fun-ASR-Realtime

8 kHz

Tanpa Batas

Qwen-ASR-Realtime (qwen3-asr-flash-realtime series)

Aliran biner

pcm, opus

8 kHz, 16 kHz

Tanpa Batas

Paraformer-Realtime (paraformer-realtime-v2/v1, paraformer-realtime-8k-v2/v1)

Aliran biner

Sama seperti Fun-ASR-Realtime

paraformer-realtime-v2 semua rate; paraformer-realtime-v1 16 kHz; paraformer-realtime-8k-* 8 kHz

Tanpa Batas

Semua model real-time hanya menerima input mono (satu channel).

Offline

ID Model

Metode input

Format audio

Sample rate

Ukuran file/durasi

Qwen-Audio-3.0-ASR-Flash-Filetrans (qwen-audio-3.0-asr-flash-filetrans series)

URL file yang dapat diakses publik; 1 URL per permintaan

aac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmv

Apa saja

≤2 GB; ≤12 jam (≤2 jam direkomendasikan saat diarization pembicara diaktifkan)

Qwen-Audio-3.0-ASR-Flash (qwen-audio-3.0-asr-flash series)

URL / Base64; 1 file per permintaan

aac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmv

Apa saja

≤2 GB; ≤5 menit

Fun-ASR (fun-asr, fun-asr-mtl series)

URL file yang dapat diakses publik; 1 URL per permintaan

aac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmv

Apa saja

≤2 GB; ≤12 jam (≤2 jam direkomendasikan saat diarization pembicara diaktifkan)

Fun-ASR-Flash (fun-asr-flash-2026-06-15)

URL / Base64; 1 file per permintaan

aac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmv

Apa saja

≤2 GB; ≤5 menit

Paraformer (paraformer-v2/v1, paraformer-mtl-v1, paraformer-8k-v2/v1)

Sama seperti Fun-ASR

Sama seperti Fun-ASR

paraformer-v2 semua rate; paraformer-8k-* hanya 8 kHz

Sama seperti Fun-ASR

Qwen3-ASR-Flash-Filetrans (qwen3-asr-flash-filetrans series)

URL file yang dapat diakses publik; 1 URL per permintaan

aac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmv

pcm memerlukan 16 kHz; format lain menerima rate apa saja (server melakukan resampling ke 16 kHz sebelum pengenalan)

≤2 GB; ≤12 jam

Qwen3-ASR-Flash (qwen3-asr-flash series)

URL / Base64 / jalur mutlak file lokal; 1 file per permintaan

aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma, wmv

pcm memerlukan 16 kHz; format lain menerima rate apa saja (server melakukan resampling ke 16 kHz sebelum pengenalan)

≤10 MB; ≤5 menit