Todos os produtos
Search
Central de documentação

Alibaba Cloud Model Studio:Visão geral de speech-to-text

Última atualização: Sep 03, 2026

Escolha o modelo adequado para reconhecimento de fala em tempo real ou baseado em arquivos.

Migração de modelos de código fechado

Mapeie seu service atual do Whisper, Deepgram ou Google ASR para um equivalente no Bailian.

Caso de uso

Exemplos de código fechado

Recomendação do Bailian

Reconhecimento em tempo real

Deepgram Nova-3, Google Chirp 3

qwen-audio-3.0-asr-flash-streaming

Transcrição offline / de arquivos

OpenAI gpt-4o-transcribe, Whisper

qwen-audio-3.0-asr-flash-filetrans, qwen-audio-3.0-asr-flash

Use os quatro critérios de "Selection criteria" — tempo real versus offline, terminologia de domínio, diarização de falantes e reconhecimento de emoções — para identificar o modelo correto. Em seguida, consulte "Recommended models" para as principais escolhas por cenário, "All models" para a lista completa de versões por família de modelos e "Audio specifications" para as restrições de entrada. Os idiomas suportados (incluindo dialetos) estão listados em cada família de modelos na seção "All models".

Critérios de seleção

Avalie quatro dimensões para encontrar o modelo ideal.

Tempo real ou offline?

O reconhecimento em tempo real retorna resultados conforme o usuário fala. O reconhecimento offline transcreve um arquivo pré-gravado após o término da gravação.

  • Tempo real (reconhecimento via streaming): Usa uma conexão WebSocket para transmitir áudio e receber texto. Ideal para legendas ao vivo, assistentes de voz e transcrição de reuniões. Modelo recomendado: qwen-audio-3.0-asr-flash-streaming (hot words, contexto de prompt, multilíngue com dialetos).
  • Offline (transcrição de arquivos): Usa uma API HTTP para enviar arquivos de áudio e recuperar os resultados da transcrição. Adequado para gravações de call center, podcasts e entrevistas. Modelo recomendado: qwen-audio-3.0-asr-flash-filetrans (hot words, contexto de prompt, diarização de falantes).

Os modelos das séries Qwen-Audio-3.0-ASR-Flash-Streaming e Fun-ASR-Realtime também suportam o protocolo AOQ. Para integrações no lado do cliente que priorizam latência estável, resiliência em redes instáveis e supressão de ruído full-duplex com cancelamento de eco integrados, recomenda-se o uso do AOQ. Para comparar protocolos, consulte Realtime API overview.

As séries Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans e os modelos em tempo real Fun-ASR e Qwen-ASR suportam o DashScope SDK (Java, Python). Todos os demais modelos exigem chamadas diretas à API WebSocket ou HTTP.

Para integração em tempo real, consulte Real-time speech recognition. Para integração offline, consulte Non-real-time speech recognition.

Terminologia de domínio

Duas abordagens, classificadas por flexibilidade:

  1. Injeção de contexto no prompt: Descreva seu domínio no prompt do sistema. Nenhuma configuração prévia é necessária, pois o modelo se adapta a cada solicitação. Recomendado para as séries Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans e Qwen-Audio-3.0-ASR-Flash.
  2. Hot words: Forneça uma lista ponderada de vocabulário. Indicada para as séries Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans e Qwen-Audio-3.0-ASR-Flash.

Diarização de falantes

A série Qwen-Audio-3.0-ASR-Flash-Filetrans (qwen-audio-3.0-asr-flash-filetrans) e os modelos offline Fun-ASR (fun-asr e fun-asr-mtl) oferecem suporte à diarização de falantes. Para identificar quem disse o quê, use qwen-audio-3.0-asr-flash-filetrans.

Reconhecimento de emoções

Os modelos Qwen-ASR detectam emoções simultaneamente à transcrição. Modelos recomendados: qwen3-asr-flash-realtime (tempo real) ou qwen3-asr-flash-filetrans (offline).

Modelos recomendados

Principais escolhas para cenários comuns.

ID do modelo

Modo

API

Aumento de precisão

Reconhecimento de emoções

Diarização de falantes

Idiomas

Duração/tamanho máximo de áudio

qwen-audio-3.0-asr-flash-streaming

Tempo real

WebSocket

Hot words, contexto de prompt

Não suportado

Não suportado

Multilíngue com dialetos

Ilimitado

qwen-audio-3.0-asr-flash-filetrans

Offline

HTTP

Hot words, contexto de prompt

Não suportado

Suportado

Multilíngue com dialetos

12 horas / 2 GB

Todos os modelos

Qwen-Audio-3.0-ASR-Flash-Streaming

ID do modelo

Modo

API

Aumento de precisão

Reconhecimento de emoções

Diarização de falantes

Languages

Duração/tamanho máximo de áudio

qwen-audio-3.0-asr-flash-streaming

Tempo real

WebSocket

Hot words, contexto de prompt

Não suportado

Não suportado

Multilíngue com dialetos

Ilimitado

Idiomas suportados (por versão):

  • qwen-audio-3.0-asr-flash-streaming: Chinês (Mandarim, Cantonês, Wu, Hokkien, Hakka, Gan, Xiang, Jin; além de sotaques regionais incluindo Planícies Centrais, Sudoeste, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Nordeste, Pequim e Hong Kong/Taiwan — abrangendo sotaques de Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu e Ningxia), Inglês, Japonês, Coreano, Vietnamita, Tailandês, Indonésio, Malaio, Filipino, Hindi, Árabe, Francês, Alemão, Espanhol, Português, Russo, Italiano, Holandês, Sueco, Dinamarquês, Finlandês, Norueguês, Grego, Polonês, Tcheco, Húngaro, Romeno, Búlgaro, Croata, Eslovaco

Qwen-Audio-3.0-ASR-Flash-Filetrans

ID do modelo

Modo

API

Aumento de precisão

Reconhecimento de emoções

Diarização de falantes

Languages

Duração/tamanho máximo de áudio

qwen-audio-3.0-asr-flash-filetrans

Offline

HTTP

Hot words, contexto de prompt

Não suportado

Suportado

Multilíngue com dialetos

12 horas / 2 GB

Idiomas suportados (por versão):

  • qwen-audio-3.0-asr-flash-filetrans: Chinês (Mandarim, Cantonês, Wu, Hokkien, Hakka, Gan, Xiang, Jin; além de sotaques regionais incluindo Planícies Centrais, Sudoeste, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Nordeste, Pequim e Hong Kong/Taiwan — abrangendo sotaques de Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu e Ningxia), Inglês, Japonês, Coreano, Vietnamita, Tailandês, Indonésio, Malaio, Filipino, Hindi, Árabe, Francês, Alemão, Espanhol, Português, Russo, Italiano, Holandês, Sueco, Dinamarquês, Finlandês, Norueguês, Grego, Polonês, Tcheco, Húngaro, Romeno, Búlgaro, Croata, Eslovaco

Qwen-Audio-3.0-ASR-Flash

ID do modelo

Modo

API

Aumento de precisão

Reconhecimento de emoções

Diarização de falantes

Languages

Duração/tamanho máximo de áudio

qwen-audio-3.0-asr-flash

Offline

HTTP

Hot words, contexto de prompt

Não suportado

Não suportado

Multilíngue com dialetos

5 minutos / 2 GB

Idiomas suportados (por versão):

  • qwen-audio-3.0-asr-flash: Chinês (Mandarim, Cantonês, Wu, Hokkien, Hakka, Gan, Xiang, Jin; além de sotaques regionais incluindo Planícies Centrais, Sudoeste, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Nordeste, Pequim e Hong Kong/Taiwan — abrangendo sotaques de Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu e Ningxia), Inglês, Japonês, Coreano, Vietnamita, Tailandês, Indonésio, Malaio, Filipino, Hindi, Árabe, Francês, Alemão, Espanhol, Português, Russo, Italiano, Holandês, Sueco, Dinamarquês, Finlandês, Norueguês, Grego, Polonês, Tcheco, Húngaro, Romeno, Búlgaro, Croata, Eslovaco

Fun-ASR

ID do modelo

Modo

API

Aumento de precisão

Reconhecimento de emoções

Diarização de falantes

Languages

Duração/tamanho máximo de áudio

fun-asr-realtime

Tempo real

WebSocket

Hot words

Não suportado

Não suportado

Chinês, Inglês, Japonês e dialetos

Ilimitado

fun-asr-realtime-2026-02-28

Tempo real

WebSocket

Hot words

Não suportado

Não suportado

Chinês, Inglês, Japonês e dialetos

Ilimitado

fun-asr-realtime-2025-11-07

Tempo real

WebSocket

Hot words

Não suportado

Não suportado

Chinês, Inglês, Japonês e dialetos

Ilimitado

fun-asr-realtime-2025-09-15

Tempo real

WebSocket

Hot words

Não suportado

Não suportado

Chinês, Inglês

Ilimitado

fun-asr-flash-8k-realtime

Tempo real

WebSocket

Hot words

Não suportado

Não suportado

Chinês

Ilimitado

fun-asr-flash-8k-realtime-2026-01-28

Tempo real

WebSocket

Hot words

Não suportado

Não suportado

Chinês

Ilimitado

fun-asr

Offline

HTTP

Hot words

Não suportado

Suportado

Multilíngue com dialetos

12 horas / 2 GB

fun-asr-flash-2026-06-15

Offline

HTTP

Contexto de prompt

Não suportado

Não suportado

Multilíngue com dialetos

5 minutos / 2 GB

fun-asr-2025-11-07

Offline

HTTP

Hot words

Não suportado

Suportado

Multilíngue com dialetos

12 horas / 2 GB

fun-asr-2025-08-25

Offline

HTTP

Hot words

Não suportado

Suportado

Chinês, Inglês

12 horas / 2 GB

fun-asr-mtl

Offline

HTTP

Hot words

Não suportado

Suportado

Multilíngue com dialetos

12 horas / 2 GB

fun-asr-mtl-2025-08-25

Offline

HTTP

Hot words

Não suportado

Suportado

Multilíngue com dialetos

12 horas / 2 GB

Idiomas suportados (por versão):

  • Versões principais do Fun-ASR-Realtime (fun-asr-realtime, fun-asr-realtime-2026-02-28, fun-asr-realtime-2025-11-07): Chinês (Mandarim, Cantonês, Wu, Hokkien, Hakka, Gan, Xiang, Jin; além de sotaques regionais incluindo Planícies Centrais, Sudoeste, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Nordeste, Pequim e Hong Kong/Taiwan — abrangendo sotaques de Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu e Ningxia), Inglês, Japonês
  • fun-asr-realtime-2025-09-15: Chinês (Mandarim), Inglês
  • Fun-ASR-Flash-Realtime(8K) (fun-asr-flash-8k-realtime, fun-asr-flash-8k-realtime-2026-01-28): Chinês
  • Versões principais do Fun-ASR (fun-asr, fun-asr-2025-11-07): Chinês (Mandarim, Cantonês, Wu, Hokkien, Hakka, Gan, Xiang, Jin; além de sotaques regionais incluindo Planícies Centrais, Sudoeste, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Nordeste, Pequim e Hong Kong/Taiwan — abrangendo sotaques de Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu e Ningxia), Inglês, Japonês, Coreano, Vietnamita, Tailandês, Indonésio, Malaio, Filipino, Hindi, Árabe, Francês, Alemão, Espanhol, Português, Russo, Italiano, Holandês, Sueco, Dinamarquês, Finlandês, Norueguês, Grego, Polonês, Tcheco, Húngaro, Romeno, Búlgaro, Croata, Eslovaco
  • Fun-ASR-Flash (fun-asr-flash-2026-06-15): Chinês (Mandarim, Cantonês, Wu, Hokkien, Hakka, Gan, Xiang, Jin; além de sotaques regionais incluindo Planícies Centrais, Sudoeste, Ji-Lu, Jianghuai, Lan-Yin, Jiao-Liao, Nordeste, Pequim e Hong Kong/Taiwan — abrangendo sotaques de Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu e Ningxia), Inglês, Japonês, Coreano, Vietnamita, Tailandês, Indonésio, Malaio, Filipino, Hindi, Árabe, Francês, Alemão, Espanhol, Português, Russo, Italiano, Holandês, Sueco, Dinamarquês, Finlandês, Norueguês, Grego, Polonês, Tcheco, Húngaro, Romeno, Búlgaro, Croata, Eslovaco
  • fun-asr-2025-08-25: Chinês (Mandarim), Inglês
  • Fun-ASR(MTL) (fun-asr-mtl, fun-asr-mtl-2025-08-25): Chinês (Mandarim, Cantonês), Inglês, Japonês, Coreano, Vietnamita, Tailandês, Indonésio, Malaio, Filipino, Hindi, Árabe, Francês, Alemão, Espanhol, Português, Russo, Italiano, Holandês, Sueco, Dinamarquês, Finlandês, Norueguês, Grego, Polonês, Tcheco, Húngaro, Romeno, Búlgaro, Croata, Eslovaco

Qwen-ASR

ID do modelo

Modo

API

Aumento de precisão

Reconhecimento de emoções

Diarização de falantes

Languages

Duração/tamanho máximo de áudio

qwen3-asr-flash-realtime

Tempo real

WebSocket

Não suportado

Suportado

Não suportado

Multilíngue com dialetos

Ilimitado

qwen3-asr-flash-realtime-2026-02-10

Tempo real

WebSocket

Não suportado

Suportado

Não suportado

Multilíngue com dialetos

Ilimitado

qwen3-asr-flash-realtime-2025-10-27

Tempo real

WebSocket

Não suportado

Suportado

Não suportado

Multilíngue com dialetos

Ilimitado

qwen3-asr-flash-filetrans

Offline

HTTP

Não suportado

Suportado

Não suportado

Multilíngue com dialetos

12 horas / 2 GB

qwen3-asr-flash-filetrans-2025-11-17

Offline

HTTP

Não suportado

Suportado

Não suportado

Multilíngue com dialetos

12 horas / 2 GB

qwen3-asr-flash

Offline

HTTP (compatível com OpenAI)

Não suportado

Suportado

Não suportado

Multilíngue com dialetos

5 minutos / 10 MB

qwen3-asr-flash-2026-02-10

Offline

HTTP (compatível com OpenAI)

Não suportado

Suportado

Não suportado

Multilíngue com dialetos

5 minutos / 10 MB

qwen3-asr-flash-2025-09-08

Offline

HTTP (compatível com OpenAI)

Não suportado

Suportado

Não suportado

Multilíngue com dialetos

5 minutos / 10 MB

Idiomas suportados: Todos os modelos Qwen-ASR (qwen3-asr-flash-realtime, qwen3-asr-flash-filetrans, qwen3-asr-flash e suas versões snapshot) compartilham a mesma lista de idiomas: Chinês (Mandarim, Sichuanês, Hokkien, Wu, Cantonês), Inglês, Japonês, Alemão, Coreano, Russo, Francês, Português, Árabe, Italiano, Espanhol, Hindi, Indonésio, Tailandês, Turco, Ucraniano, Vietnamita, Tcheco, Dinamarquês, Filipino, Finlandês, Islandês, Malaio, Norueguês, Polonês, Sueco.

Paraformer

O Paraformer é uma família de modelos ASR de geração anterior. Sempre que possível, migre para Fun-ASR ou Qwen-ASR.

ID do modelo

API

Descrição

paraformer-realtime-v2

WebSocket

Reconhecimento em tempo real; Chinês, Inglês, Japonês, Coreano, Alemão, Francês, Russo

paraformer-realtime-v1

WebSocket

Reconhecimento em tempo real; Chinês, Inglês, Japonês, Coreano, Alemão, Francês, Russo

paraformer-realtime-8k-v2

WebSocket

Reconhecimento em tempo real para telefonia de 8 kHz; Chinês

paraformer-realtime-8k-v1

WebSocket

Reconhecimento em tempo real para telefonia de 8 kHz; Chinês

paraformer-v2

HTTP

Transcrição de arquivos com diarização de falantes; Chinês, Inglês, Japonês, Coreano, Alemão, Francês, Russo

paraformer-8k-v2

HTTP

Transcrição de arquivos para telefonia de 8 kHz; Chinês

Idiomas suportados (por versão):

  • paraformer-realtime-v2, paraformer-v2: Chinês (Mandarim, Cantonês, Wu, Hokkien, Nordeste, Gansu, Guizhou, Henan, Hubei, Hunan, Ningxia, Shanxi, Shaanxi, Shandong, Sichuan, Tianjin, Jiangxi, Yunnan, Xangai), Inglês, Japonês, Coreano, Alemão, Francês, Russo
  • paraformer-realtime-v1, paraformer-realtime-8k-v2, paraformer-realtime-8k-v1, paraformer-8k-v2: Chinês (Mandarim)

Especificações de áudio

Especificações de áudio para os modos tempo real e offline. Para idiomas suportados, consulte a subseção da família de modelos em "All models".

Tempo real

ID do modelo

Método de entrada

Formato de áudio

Taxa de amostragem

Tamanho/duração

Qwen-Audio-3.0-ASR-Flash-Streaming (série qwen-audio-3.0-asr-flash-streaming)

Stream binário

pcm, wav, mp3, opus, speex, aac, amr

Qualquer

Ilimitado

Fun-ASR-Realtime / Fun-ASR-MTL-Realtime (séries fun-asr-realtime, fun-asr-mtl-realtime)

Stream binário

pcm, wav, mp3, opus, speex, aac, amr

Qualquer

Ilimitado

Fun-ASR-Flash-8K-Realtime (série fun-asr-flash-8k-realtime)

Stream binário

Mesmos do Fun-ASR-Realtime

8 kHz

Ilimitado

Qwen-ASR-Realtime (série qwen3-asr-flash-realtime)

Stream binário

pcm, opus

8 kHz, 16 kHz

Ilimitado

Paraformer-Realtime (paraformer-realtime-v2/v1, paraformer-realtime-8k-v2/v1)

Stream binário

Mesmos do Fun-ASR-Realtime

paraformer-realtime-v2 qualquer taxa; paraformer-realtime-v1 16 kHz; paraformer-realtime-8k-* 8 kHz

Ilimitado

Todos os modelos em tempo real aceitam apenas entrada mono (canal único).

Offline

ID do modelo

Método de entrada

Formato de áudio

Taxa de amostragem

Tamanho/duração do arquivo

Qwen-Audio-3.0-ASR-Flash-Filetrans (série qwen-audio-3.0-asr-flash-filetrans)

URL de arquivo acessível publicamente; 1 URL por solicitação

aac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmv

Qualquer

≤2 GB; ≤12 horas (≤2 horas recomendadas quando a diarização de falantes estiver ativada)

Qwen-Audio-3.0-ASR-Flash (série qwen-audio-3.0-asr-flash)

URL / Base64; 1 arquivo por solicitação

aac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmv

Qualquer

≤2 GB; ≤5 minutos

Fun-ASR (séries fun-asr, fun-asr-mtl)

URL de arquivo acessível publicamente; 1 URL por solicitação

aac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmv

Qualquer

≤2 GB; ≤12 horas (≤2 horas recomendadas quando a diarização de falantes estiver ativada)

Fun-ASR-Flash (fun-asr-flash-2026-06-15)

URL / Base64; 1 arquivo por solicitação

aac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmv

Qualquer

≤2 GB; ≤5 minutos

Paraformer (paraformer-v2/v1, paraformer-mtl-v1, paraformer-8k-v2/v1)

Mesmos do Fun-ASR

Mesmos do Fun-ASR

paraformer-v2 qualquer taxa; paraformer-8k-* apenas 8 kHz

Mesmos do Fun-ASR

Qwen3-ASR-Flash-Filetrans (série qwen3-asr-flash-filetrans)

URL de arquivo acessível publicamente; 1 URL por solicitação

aac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmv

pcm requer 16 kHz; outros formatos aceitam qualquer taxa (o servidor reamostra para 16 kHz antes do reconhecimento)

≤2 GB; ≤12 horas

Qwen3-ASR-Flash (série qwen3-asr-flash)

URL / Base64 / caminho absoluto de arquivo local; 1 arquivo por solicitação

aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma, wmv

pcm requer 16 kHz; outros formatos aceitam qualquer taxa (o servidor reamostra para 16 kHz antes do reconhecimento)

≤10 MB; ≤5 minutos