Escolha o modelo adequado para reconhecimento de fala em tempo real ou baseado em arquivos.
Migração de modelos de código fechado
Mapeie seu service atual do Whisper, Deepgram ou Google ASR para um equivalente no Bailian.
Caso de uso | Exemplos de código fechado | Recomendação do Bailian |
|---|---|---|
Reconhecimento em tempo real | Deepgram Nova-3, Google Chirp 3 |
|
Transcrição offline / de arquivos | OpenAI gpt-4o-transcribe, Whisper |
|
Use os quatro critérios de "Selection criteria" — tempo real versus offline, terminologia de domínio, diarização de falantes e reconhecimento de emoções — para identificar o modelo correto. Em seguida, consulte "Recommended models" para as principais escolhas por cenário, "All models" para a lista completa de versões por família de modelos e "Audio specifications" para as restrições de entrada. Os idiomas suportados (incluindo dialetos) estão listados em cada família de modelos na seção "All models".
Critérios de seleção
Avalie quatro dimensões para encontrar o modelo ideal.
Tempo real ou offline?
O reconhecimento em tempo real retorna resultados conforme o usuário fala. O reconhecimento offline transcreve um arquivo pré-gravado após o término da gravação.
- Tempo real (reconhecimento via streaming): Usa uma conexão WebSocket para transmitir áudio e receber texto. Ideal para legendas ao vivo, assistentes de voz e transcrição de reuniões. Modelo recomendado:
qwen-audio-3.0-asr-flash-streaming(hot words, contexto de prompt, multilíngue com dialetos). - Offline (transcrição de arquivos): Usa uma API HTTP para enviar arquivos de áudio e recuperar os resultados da transcrição. Adequado para gravações de call center, podcasts e entrevistas. Modelo recomendado:
qwen-audio-3.0-asr-flash-filetrans(hot words, contexto de prompt, diarização de falantes).
Os modelos das séries Qwen-Audio-3.0-ASR-Flash-Streaming e Fun-ASR-Realtime também suportam o protocolo AOQ. Para integrações no lado do cliente que priorizam latência estável, resiliência em redes instáveis e supressão de ruído full-duplex com cancelamento de eco integrados, recomenda-se o uso do AOQ. Para comparar protocolos, consulte Realtime API overview.
As séries Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans e os modelos em tempo real Fun-ASR e Qwen-ASR suportam o DashScope SDK (Java, Python). Todos os demais modelos exigem chamadas diretas à API WebSocket ou HTTP.
Para integração em tempo real, consulte Real-time speech recognition. Para integração offline, consulte Non-real-time speech recognition.
Terminologia de domínio
Duas abordagens, classificadas por flexibilidade:
- Injeção de contexto no prompt: Descreva seu domínio no prompt do sistema. Nenhuma configuração prévia é necessária, pois o modelo se adapta a cada solicitação. Recomendado para as séries Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans e Qwen-Audio-3.0-ASR-Flash.
- Hot words: Forneça uma lista ponderada de vocabulário. Indicada para as séries Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans e Qwen-Audio-3.0-ASR-Flash.
Diarização de falantes
A série Qwen-Audio-3.0-ASR-Flash-Filetrans (qwen-audio-3.0-asr-flash-filetrans) e os modelos offline Fun-ASR (fun-asr e fun-asr-mtl) oferecem suporte à diarização de falantes. Para identificar quem disse o quê, use qwen-audio-3.0-asr-flash-filetrans.
Reconhecimento de emoções
Os modelos Qwen-ASR detectam emoções simultaneamente à transcrição. Modelos recomendados: qwen3-asr-flash-realtime (tempo real) ou qwen3-asr-flash-filetrans (offline).
Modelos recomendados
Principais escolhas para cenários comuns.
ID do modelo | Modo | API | Aumento de precisão | Reconhecimento de emoções | Diarização de falantes | Idiomas | Duração/tamanho máximo de áudio |
|---|---|---|---|---|---|---|---|
| Tempo real | WebSocket | Hot words, contexto de prompt | Não suportado | Não suportado | Multilíngue com dialetos | Ilimitado |
| Offline | HTTP | Hot words, contexto de prompt | Não suportado | Suportado | Multilíngue com dialetos | 12 horas / 2 GB |
Todos os modelos
Qwen-Audio-3.0-ASR-Flash-Streaming
ID do modelo | Modo | API | Aumento de precisão | Reconhecimento de emoções | Diarização de falantes | Duração/tamanho máximo de áudio | |
|---|---|---|---|---|---|---|---|
| Tempo real | WebSocket | Hot words, contexto de prompt | Não suportado | Não suportado | Multilíngue com dialetos | Ilimitado |
Idiomas suportados (por versão):
qwen-audio-3.0-asr-flash-streaming: Chinês (Mandarim, Cantonês, Wu, Hokkien, Hakka, Gan, Xiang, Jin; além de sotaques regionais incluindo Planícies Centrais, Sudoeste, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Nordeste, Pequim e Hong Kong/Taiwan — abrangendo sotaques de Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu e Ningxia), Inglês, Japonês, Coreano, Vietnamita, Tailandês, Indonésio, Malaio, Filipino, Hindi, Árabe, Francês, Alemão, Espanhol, Português, Russo, Italiano, Holandês, Sueco, Dinamarquês, Finlandês, Norueguês, Grego, Polonês, Tcheco, Húngaro, Romeno, Búlgaro, Croata, Eslovaco
Qwen-Audio-3.0-ASR-Flash-Filetrans
ID do modelo | Modo | API | Aumento de precisão | Reconhecimento de emoções | Diarização de falantes | Duração/tamanho máximo de áudio | |
|---|---|---|---|---|---|---|---|
| Offline | HTTP | Hot words, contexto de prompt | Não suportado | Suportado | Multilíngue com dialetos | 12 horas / 2 GB |
Idiomas suportados (por versão):
qwen-audio-3.0-asr-flash-filetrans: Chinês (Mandarim, Cantonês, Wu, Hokkien, Hakka, Gan, Xiang, Jin; além de sotaques regionais incluindo Planícies Centrais, Sudoeste, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Nordeste, Pequim e Hong Kong/Taiwan — abrangendo sotaques de Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu e Ningxia), Inglês, Japonês, Coreano, Vietnamita, Tailandês, Indonésio, Malaio, Filipino, Hindi, Árabe, Francês, Alemão, Espanhol, Português, Russo, Italiano, Holandês, Sueco, Dinamarquês, Finlandês, Norueguês, Grego, Polonês, Tcheco, Húngaro, Romeno, Búlgaro, Croata, Eslovaco
Qwen-Audio-3.0-ASR-Flash
ID do modelo | Modo | API | Aumento de precisão | Reconhecimento de emoções | Diarização de falantes | Duração/tamanho máximo de áudio | |
|---|---|---|---|---|---|---|---|
| Offline | HTTP | Hot words, contexto de prompt | Não suportado | Não suportado | Multilíngue com dialetos | 5 minutos / 2 GB |
Idiomas suportados (por versão):
qwen-audio-3.0-asr-flash: Chinês (Mandarim, Cantonês, Wu, Hokkien, Hakka, Gan, Xiang, Jin; além de sotaques regionais incluindo Planícies Centrais, Sudoeste, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Nordeste, Pequim e Hong Kong/Taiwan — abrangendo sotaques de Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu e Ningxia), Inglês, Japonês, Coreano, Vietnamita, Tailandês, Indonésio, Malaio, Filipino, Hindi, Árabe, Francês, Alemão, Espanhol, Português, Russo, Italiano, Holandês, Sueco, Dinamarquês, Finlandês, Norueguês, Grego, Polonês, Tcheco, Húngaro, Romeno, Búlgaro, Croata, Eslovaco
Fun-ASR
ID do modelo | Modo | API | Aumento de precisão | Reconhecimento de emoções | Diarização de falantes | Duração/tamanho máximo de áudio | |
|---|---|---|---|---|---|---|---|
| Tempo real | WebSocket | Hot words | Não suportado | Não suportado | Chinês, Inglês, Japonês e dialetos | Ilimitado |
| Tempo real | WebSocket | Hot words | Não suportado | Não suportado | Chinês, Inglês, Japonês e dialetos | Ilimitado |
| Tempo real | WebSocket | Hot words | Não suportado | Não suportado | Chinês, Inglês, Japonês e dialetos | Ilimitado |
| Tempo real | WebSocket | Hot words | Não suportado | Não suportado | Chinês, Inglês | Ilimitado |
| Tempo real | WebSocket | Hot words | Não suportado | Não suportado | Chinês | Ilimitado |
| Tempo real | WebSocket | Hot words | Não suportado | Não suportado | Chinês | Ilimitado |
| Offline | HTTP | Hot words | Não suportado | Suportado | Multilíngue com dialetos | 12 horas / 2 GB |
| Offline | HTTP | Contexto de prompt | Não suportado | Não suportado | Multilíngue com dialetos | 5 minutos / 2 GB |
| Offline | HTTP | Hot words | Não suportado | Suportado | Multilíngue com dialetos | 12 horas / 2 GB |
| Offline | HTTP | Hot words | Não suportado | Suportado | Chinês, Inglês | 12 horas / 2 GB |
| Offline | HTTP | Hot words | Não suportado | Suportado | Multilíngue com dialetos | 12 horas / 2 GB |
| Offline | HTTP | Hot words | Não suportado | Suportado | Multilíngue com dialetos | 12 horas / 2 GB |
Idiomas suportados (por versão):
- Versões principais do Fun-ASR-Realtime (
fun-asr-realtime,fun-asr-realtime-2026-02-28,fun-asr-realtime-2025-11-07): Chinês (Mandarim, Cantonês, Wu, Hokkien, Hakka, Gan, Xiang, Jin; além de sotaques regionais incluindo Planícies Centrais, Sudoeste, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Nordeste, Pequim e Hong Kong/Taiwan — abrangendo sotaques de Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu e Ningxia), Inglês, Japonês fun-asr-realtime-2025-09-15: Chinês (Mandarim), Inglês- Fun-ASR-Flash-Realtime(8K) (
fun-asr-flash-8k-realtime,fun-asr-flash-8k-realtime-2026-01-28): Chinês - Versões principais do Fun-ASR (
fun-asr,fun-asr-2025-11-07): Chinês (Mandarim, Cantonês, Wu, Hokkien, Hakka, Gan, Xiang, Jin; além de sotaques regionais incluindo Planícies Centrais, Sudoeste, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Nordeste, Pequim e Hong Kong/Taiwan — abrangendo sotaques de Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu e Ningxia), Inglês, Japonês, Coreano, Vietnamita, Tailandês, Indonésio, Malaio, Filipino, Hindi, Árabe, Francês, Alemão, Espanhol, Português, Russo, Italiano, Holandês, Sueco, Dinamarquês, Finlandês, Norueguês, Grego, Polonês, Tcheco, Húngaro, Romeno, Búlgaro, Croata, Eslovaco - Fun-ASR-Flash (
fun-asr-flash-2026-06-15): Chinês (Mandarim, Cantonês, Wu, Hokkien, Hakka, Gan, Xiang, Jin; além de sotaques regionais incluindo Planícies Centrais, Sudoeste, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Nordeste, Pequim e Hong Kong/Taiwan — abrangendo sotaques de Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu e Ningxia), Inglês, Japonês, Coreano, Vietnamita, Tailandês, Indonésio, Malaio, Filipino, Hindi, Árabe, Francês, Alemão, Espanhol, Português, Russo, Italiano, Holandês, Sueco, Dinamarquês, Finlandês, Norueguês, Grego, Polonês, Tcheco, Húngaro, Romeno, Búlgaro, Croata, Eslovaco fun-asr-2025-08-25: Chinês (Mandarim), Inglês- Fun-ASR(MTL) (
fun-asr-mtl,fun-asr-mtl-2025-08-25): Chinês (Mandarim, Cantonês), Inglês, Japonês, Coreano, Vietnamita, Tailandês, Indonésio, Malaio, Filipino, Hindi, Árabe, Francês, Alemão, Espanhol, Português, Russo, Italiano, Holandês, Sueco, Dinamarquês, Finlandês, Norueguês, Grego, Polonês, Tcheco, Húngaro, Romeno, Búlgaro, Croata, Eslovaco
Qwen-ASR
ID do modelo | Modo | API | Aumento de precisão | Reconhecimento de emoções | Diarização de falantes | Duração/tamanho máximo de áudio | |
|---|---|---|---|---|---|---|---|
| Tempo real | WebSocket | Não suportado | Suportado | Não suportado | Multilíngue com dialetos | Ilimitado |
| Tempo real | WebSocket | Não suportado | Suportado | Não suportado | Multilíngue com dialetos | Ilimitado |
| Tempo real | WebSocket | Não suportado | Suportado | Não suportado | Multilíngue com dialetos | Ilimitado |
| Offline | HTTP | Não suportado | Suportado | Não suportado | Multilíngue com dialetos | 12 horas / 2 GB |
| Offline | HTTP | Não suportado | Suportado | Não suportado | Multilíngue com dialetos | 12 horas / 2 GB |
| Offline | HTTP (compatível com OpenAI) | Não suportado | Suportado | Não suportado | Multilíngue com dialetos | 5 minutos / 10 MB |
| Offline | HTTP (compatível com OpenAI) | Não suportado | Suportado | Não suportado | Multilíngue com dialetos | 5 minutos / 10 MB |
| Offline | HTTP (compatível com OpenAI) | Não suportado | Suportado | Não suportado | Multilíngue com dialetos | 5 minutos / 10 MB |
Idiomas suportados: Todos os modelos Qwen-ASR (qwen3-asr-flash-realtime, qwen3-asr-flash-filetrans, qwen3-asr-flash e suas versões snapshot) compartilham a mesma lista de idiomas: Chinês (Mandarim, Sichuanês, Hokkien, Wu, Cantonês), Inglês, Japonês, Alemão, Coreano, Russo, Francês, Português, Árabe, Italiano, Espanhol, Hindi, Indonésio, Tailandês, Turco, Ucraniano, Vietnamita, Tcheco, Dinamarquês, Filipino, Finlandês, Islandês, Malaio, Norueguês, Polonês, Sueco.
Paraformer
O Paraformer é uma família de modelos ASR de geração anterior. Sempre que possível, migre para Fun-ASR ou Qwen-ASR.
ID do modelo | API | Descrição |
|---|---|---|
| WebSocket | Reconhecimento em tempo real; Chinês, Inglês, Japonês, Coreano, Alemão, Francês, Russo |
| WebSocket | Reconhecimento em tempo real; Chinês, Inglês, Japonês, Coreano, Alemão, Francês, Russo |
| WebSocket | Reconhecimento em tempo real para telefonia de 8 kHz; Chinês |
| WebSocket | Reconhecimento em tempo real para telefonia de 8 kHz; Chinês |
| HTTP | Transcrição de arquivos com diarização de falantes; Chinês, Inglês, Japonês, Coreano, Alemão, Francês, Russo |
| HTTP | Transcrição de arquivos para telefonia de 8 kHz; Chinês |
Idiomas suportados (por versão):
paraformer-realtime-v2,paraformer-v2: Chinês (Mandarim, Cantonês, Wu, Hokkien, Nordeste, Gansu, Guizhou, Henan, Hubei, Hunan, Ningxia, Shanxi, Shaanxi, Shandong, Sichuan, Tianjin, Jiangxi, Yunnan, Xangai), Inglês, Japonês, Coreano, Alemão, Francês, Russoparaformer-realtime-v1,paraformer-realtime-8k-v2,paraformer-realtime-8k-v1,paraformer-8k-v2: Chinês (Mandarim)
Especificações de áudio
Especificações de áudio para os modos tempo real e offline. Para idiomas suportados, consulte a subseção da família de modelos em "All models".
Tempo real
ID do modelo | Método de entrada | Formato de áudio | Taxa de amostragem | Tamanho/duração |
|---|---|---|---|---|
Qwen-Audio-3.0-ASR-Flash-Streaming (série | Stream binário |
| Qualquer | Ilimitado |
Fun-ASR-Realtime / Fun-ASR-MTL-Realtime (séries | Stream binário |
| Qualquer | Ilimitado |
Fun-ASR-Flash-8K-Realtime (série | Stream binário | Mesmos do Fun-ASR-Realtime | 8 kHz | Ilimitado |
Qwen-ASR-Realtime (série | Stream binário |
| 8 kHz, 16 kHz | Ilimitado |
Paraformer-Realtime ( | Stream binário | Mesmos do Fun-ASR-Realtime |
| Ilimitado |
Todos os modelos em tempo real aceitam apenas entrada mono (canal único).
Offline
ID do modelo | Método de entrada | Formato de áudio | Taxa de amostragem | Tamanho/duração do arquivo |
|---|---|---|---|---|
Qwen-Audio-3.0-ASR-Flash-Filetrans (série | URL de arquivo acessível publicamente; 1 URL por solicitação |
| Qualquer | ≤2 GB; ≤12 horas (≤2 horas recomendadas quando a diarização de falantes estiver ativada) |
Qwen-Audio-3.0-ASR-Flash (série | URL / Base64; 1 arquivo por solicitação |
| Qualquer | ≤2 GB; ≤5 minutos |
Fun-ASR (séries | URL de arquivo acessível publicamente; 1 URL por solicitação |
| Qualquer | ≤2 GB; ≤12 horas (≤2 horas recomendadas quando a diarização de falantes estiver ativada) |
Fun-ASR-Flash ( | URL / Base64; 1 arquivo por solicitação |
| Qualquer | ≤2 GB; ≤5 minutos |
Paraformer ( | Mesmos do Fun-ASR | Mesmos do Fun-ASR | paraformer-v2 qualquer taxa; | Mesmos do Fun-ASR |
Qwen3-ASR-Flash-Filetrans (série | URL de arquivo acessível publicamente; 1 URL por solicitação |
|
| ≤2 GB; ≤12 horas |
Qwen3-ASR-Flash (série | URL / Base64 / caminho absoluto de arquivo local; 1 arquivo por solicitação |
|
| ≤10 MB; ≤5 minutos |