Escolha um modelo para conversas por voz, tradução de fala ou interpretação simultânea.
Migração de modelos de código fechado
Mapeie sua configuração atual do OpenAI Realtime ou Gemini Live para um modelo equivalente no Bailian.
Exemplos de código fechado | Recomendação do Bailian | |
|---|---|---|
Conversa em tempo real | OpenAI GPT Realtime, Gemini 3.1 Live |
|
Conversa com foco em custo | OpenAI gpt-4o-mini Realtime |
|
Tradução em tempo real | Gemini 3.1 Live |
|
Esta página aborda o recurso speech-to-speech. Para compreensão visual, análise de áudio/vídeo ou moderação de conteúdo, consulte a documentação Omni-modal.
S2S (speech-to-speech) vs. pipeline
Existem duas abordagens para criar aplicações de voz:
S2S | Pipeline (ASR + LLM + TTS) | |
|---|---|---|
Latência | Baixa — processamento de stream com modelo único | Mais alta — processamento serial em três estágios |
Compreensão de áudio | Ponta a ponta — percebe tom e emoção e responde adequadamente | Converte para texto antes do processamento e perde nuances sutis do áudio |
Personalização de voz | Seleção de vozes predefinidas via system prompt | Clonagem e design de voz (CosyVoice) |
- Use S2S para obter baixa latência, respostas com percepção de áudio e conversas interativas.
- Adote uma pipeline quando precisar personalizar a voz ou selecionar os modelos de ASR, LLM e TTS independentemente.
Esta página trata da abordagem de modelo único S2S (séries Omni e Livetranslate). Para a abordagem de pipeline, selecione cada componente separadamente:
- ASR (reconhecimento de fala):Speech-to-text
- LLM (large language model):Text generation
- TTS (text-to-speech):Speech synthesis
Modo em tempo real ou arquivo?
- Tempo real (WebSocket): Assistentes de voz, centrais de atendimento e interpretação simultânea. Transmite entrada de áudio e saída de fala em streaming.
- Modo de arquivo (HTTP): Maior latência, porém com melhor qualidade. Ideal para dublagem de vídeo, tradução de podcasts e processamento offline. Também oferece suporte a function calling, busca na web, modo de raciocínio e contexto de vídeo (consulte Recursos complementares abaixo).
Escolha um modelo por caso de uso (abordagem de modelo único S2S)
Todos os casos de uso abaixo utilizam a abordagem de modelo único S2S. Para a abordagem de pipeline, consulte os guias de ASR, LLM e TTS vinculados acima.
Caso de uso | Modelo recomendado | API |
|---|---|---|
Assistentes de voz e conversas de atendimento ao cliente |
| WebSocket |
Conversas com foco em custo |
| WebSocket |
Interpretação simultânea e tradução ao vivo |
| WebSocket |
Dublagem de vídeo e tradução de podcasts |
| HTTP |
Análise de vídeo e rotulagem em lote (requer modo de raciocínio) |
| HTTP |
Assistentes de voz com VAD semântico e atendimento inteligente (com suporte a Function Calling) |
| WebSocket |
Recursos complementares da abordagem de modelo único S2S
O Qwen3.5-Omni e o Qwen3-Omni fornecem esses recursos nativamente. O Qwen-Audio Realtime oferece suporte apenas a function calling; não suporta busca na web nem modo de raciocínio. Em uma pipeline, a funcionalidade equivalente vem de componentes individuais (geralmente o LLM).
Function calling
O modelo pode consultar bases de conhecimento, verificar agendas ou acionar fluxos de trabalho com base no que ouve e vê. Use o Qwen3-Omni (apenas HTTP) ou Qwen-Audio Realtime (WebSocket).
Não há suporte nos modelos em tempo real (WebSocket) do Qwen3.5-Omni/Qwen3-Omni nem nos modelos Livetranslate. O Qwen-Audio Realtime (WebSocket) oferece suporte a function calling.
Busca na web
Recupera informações em tempo real sobre eventos atuais, cotações de ações, previsão do tempo e consultas semelhantes. Disponível no Qwen3.5-Omni (WebSocket ou HTTP, nas versões Plus e Flash). O modelo decide autonomamente se deve buscar. O Qwen-Audio Realtime não oferece suporte a este recurso.
Não há suporte no Qwen3-Omni-Flash nem no modelo Livetranslate.
Modo de raciocínio
Use o Qwen3-Omni (HTTP) quando a qualidade da resposta for mais importante que a latência. O modelo raciocina passo a passo antes de responder, sendo ideal para análise de vídeo e rotulagem em lote. O Qwen-Audio Realtime não oferece suporte a este recurso.
A geração de voz não é suportada no modo de raciocínio.
Tradução de fala
As seguintes séries de modelos oferecem suporte à tradução de fala:
- Qwen3.5-Livetranslate: 60 idiomas (29 com saída de áudio e texto, 31 apenas texto). Abrange chinês, inglês, francês, alemão, russo, japonês, coreano, espanhol, português, árabe, entre outros.
- Qwen3-Livetranslate: 18 idiomas e 5 dialetos chineses (~3 s de latência). O modo de arquivo aceita entrada de vídeo para traduções com reconhecimento de contexto. Sete idiomas geram saída apenas em texto.
- Qwen3.5-Omni: 29 idiomas de saída e 8 dialetos chineses. Oferece forte compreensão de áudio/vídeo e busca na web. Permite injetar terminologia e contexto de domínio via system prompt. Disponível nos modos em tempo real e arquivo.
- Qwen3-Omni-Flash: 11 idiomas de saída e 8 dialetos chineses. Permite injetar terminologia e contexto de domínio via system prompt. Disponível nos modos em tempo real e arquivo, com custo reduzido.
ObservaçãoInício rápido: série Livetranslate. Melhor qualidade e cobertura de idiomas: Qwen3.5-Omni. Foco em custo: Qwen3-Omni-Flash.
Idiomas suportados
Idioma | Qwen3.5-Livetranslate | Qwen3-Livetranslate | Qwen3.5-Omni | Qwen3-Omni-Flash |
|---|---|---|---|---|
Inglês | Suportado | Suportado | Suportado | Suportado |
Chinês (Mandarim) | Suportado | Suportado | Suportado | Suportado |
Cantonês | Apenas texto | Suportado | Suportado | Suportado |
Dialetos de Sichuan | Suportado | Suportado | Suportado | Suportado |
Xangainês | Suportado | Suportado | Suportado | Suportado |
Dialetos de Pequim | Suportado | Suportado | Suportado | Suportado |
Dialetos de Tianjin | Suportado | Suportado | Suportado | Suportado |
Dialetos de Nanjing | -- | -- | Suportado | Suportado |
Dialetos de Shaanxi | -- | -- | Suportado | Suportado |
Dialetos Minnan | -- | -- | Suportado | Suportado |
Francês | Suportado | Suportado | Suportado | Suportado |
Alemão | Suportado | Suportado | Suportado | Suportado |
Russo | Suportado | Suportado | Suportado | Suportado |
Italiano | Suportado | Suportado | Suportado | Suportado |
Espanhol | Suportado | Suportado | Suportado | Suportado |
Português | Suportado | Suportado | Suportado | Suportado |
Japonês | Suportado | Suportado | Suportado | Suportado |
Coreano | Suportado | Suportado | Suportado | Suportado |
Tailandês | Suportado | Apenas texto | Suportado | Suportado |
Indonésio | Suportado | Apenas texto | Suportado | -- |
Vietnamita | Suportado | Apenas texto | Suportado | -- |
Árabe | Suportado | Apenas texto | Suportado | -- |
Hindi | Suportado | Apenas texto | Suportado | -- |
Turco | Suportado | Apenas texto | Suportado | -- |
Finlandês | Suportado | -- | Suportado | -- |
Polonês | Suportado | -- | Suportado | -- |
Holandês | Suportado | -- | Suportado | -- |
Tcheco | Suportado | -- | Suportado | -- |
Urdu | Suportado | -- | Suportado | -- |
Tagalo | Suportado | -- | Suportado | -- |
Sueco | Suportado | -- | Suportado | -- |
Dinamarquês | Suportado | -- | Suportado | -- |
Hebraico | Suportado | -- | Suportado | -- |
Islandês | Suportado | -- | Suportado | -- |
Malaio | Suportado | -- | Suportado | -- |
Norueguês | Suportado | -- | Suportado | -- |
Persa | Suportado | -- | Suportado | -- |
Grego | Apenas texto | Apenas texto | -- | -- |
Africâner | Apenas texto | -- | -- | -- |
Asturiano | Apenas texto | -- | -- | -- |
Bielorrusso | Apenas texto | -- | -- | -- |
Búlgaro | Apenas texto | -- | -- | -- |
Bengali | Apenas texto | -- | -- | -- |
Bósnio | Apenas texto | -- | -- | -- |
Catalão | Apenas texto | -- | -- | -- |
Cebuano | Apenas texto | -- | -- | -- |
Estoniano | Apenas texto | -- | -- | -- |
Galego | Apenas texto | -- | -- | -- |
Guzerate | Apenas texto | -- | -- | -- |
Croata | Apenas texto | -- | -- | -- |
Húngaro | Apenas texto | -- | -- | -- |
Javanês | Apenas texto | -- | -- | -- |
Cazaque | Apenas texto | -- | -- | -- |
Canarês | Apenas texto | -- | -- | -- |
Quirguiz | Apenas texto | -- | -- | -- |
Letão | Apenas texto | -- | -- | -- |
Macedônio | Apenas texto | -- | -- | -- |
Malaiala | Apenas texto | -- | -- | -- |
Marati | Apenas texto | -- | -- | -- |
Panjabi | Apenas texto | -- | -- | -- |
Romeno | Apenas texto | -- | -- | -- |
Eslovaco | Apenas texto | -- | -- | -- |
Esloveno | Apenas texto | -- | -- | -- |
Suaíli | Apenas texto | -- | -- | -- |
Tadjique | Apenas texto | -- | -- | -- |
Azeri | Apenas texto | -- | -- | -- |
Ucraniano | Apenas texto | -- | -- | -- |
"Suportado" = saída de fala e texto. "Apenas texto" = somente saída de texto, sem fala.
O Qwen3.5-Omni oferece suporte a 113 idiomas e dialetos de entrada.
O Qwen3.5-Livetranslate oferece suporte a 60 idiomas (29 com áudio e texto, 31 apenas texto).
O modelo legado qwen-omni-turbo suporta apenas chinês e inglês.
Modelos recomendados
A tabela lista o modelo inicial de cada série. Para fixar uma versão datada visando testes de regressão ou estabilidade, consulte Todos os modelos abaixo.
Modelo | API | Entrada | Function calling | Busca na web | Modo de raciocínio | Tradução |
|---|---|---|---|---|---|---|
| WebSocket | áudio, texto | Suportado | -- | -- | -- |
| WebSocket | áudio, texto | Suportado | -- | -- | -- |
| WebSocket | texto, áudio, imagem | Suportado | Suportado | -- | 29 idiomas |
| HTTP | texto, áudio, imagem, vídeo | Não suportado | Suportado | -- | 29 idiomas |
| WebSocket | texto, áudio, imagem, vídeo | -- | -- | -- | 11 idiomas |
| HTTP | texto, áudio, imagem, vídeo | Suportado | -- | Suportado | 11 idiomas |
| WebSocket | áudio, imagem | -- | -- | -- | 60 idiomas |
| HTTP | áudio, vídeo | -- | -- | -- | 18 idiomas |
Todos os modelos
Qwen-Audio
Modelo | API | Entrada | Function calling | Busca na web | Modo de raciocínio | Tradução |
|---|---|---|---|---|---|---|
| WebSocket | áudio, texto | Suportado | -- | -- | -- |
| WebSocket | áudio, texto | Suportado | -- | -- | -- |
Qwen3.5-Omni
Modelo | API | Entrada | Function calling | Busca na web | Modo de raciocínio |
|---|---|---|---|---|---|
| WebSocket | Texto, áudio, imagem, vídeo | Suportado | Suportado | -- |
| WebSocket | Texto, áudio, imagem, vídeo | Suportado | Suportado | -- |
| HTTP | Texto, áudio, imagem, vídeo | Não suportado | Suportado | -- |
| HTTP | Texto, áudio, imagem, vídeo | Não suportado | Suportado | -- |
| WebSocket | Texto, áudio, imagem, vídeo | Suportado | Suportado | -- |
| WebSocket | Texto, áudio, imagem, vídeo | Suportado | Suportado | -- |
| HTTP | Texto, áudio, imagem, vídeo | Não suportado | Suportado | -- |
| HTTP | Texto, áudio, imagem, vídeo | Não suportado | Suportado | -- |
Qwen3-Omni
Modelo | API | Entrada | Function calling | Busca na web | Modo de raciocínio |
|---|---|---|---|---|---|
| WebSocket | Texto, áudio, imagem, vídeo | -- | -- | -- |
| WebSocket | Texto, áudio, imagem, vídeo | -- | -- | -- |
| WebSocket | Texto, áudio, imagem, vídeo | -- | -- | -- |
| HTTP | Texto, áudio, imagem, vídeo | Suportado | -- | Suportado |
| HTTP | Texto, áudio, imagem, vídeo | Suportado | -- | Suportado |
| HTTP | Texto, áudio, imagem, vídeo | Suportado | -- | Suportado |
Qwen3.5-Livetranslate
Modelo | API | Entrada | Idiomas |
|---|---|---|---|
| WebSocket | Áudio | 60 |
| WebSocket | Áudio | 60 |
Qwen3-Livetranslate
Modelo | API | Entrada | Idiomas |
|---|---|---|---|
| WebSocket | Áudio | 18 |
| WebSocket | Áudio | 18 |
| HTTP | Áudio, vídeo | 18 |
| HTTP | Áudio, vídeo | 18 |
Modelos legados
Estes modelos não recebem mais atualizações. Para novos projetos, use o Qwen3.5-Omni.
Modelo | Entrada | API |
|---|---|---|
| Texto, áudio, imagem, vídeo | HTTP |
| Texto, áudio, imagem, vídeo | HTTP |
| Texto, áudio, imagem, vídeo | HTTP |
| Texto, áudio, imagem, vídeo | HTTP |
| Texto, áudio | WebSocket |
| Texto, áudio | WebSocket |
| Texto, áudio | WebSocket |
Próximos passos
Documentação da API por série de modelos:
- Qwen-Audio Realtime (WebSocket, conversa de voz em tempo real): Realtime Audio Chat (Qwen-Audio-Realtime)
- Qwen3.5-Omni e Qwen3-Omni (WebSocket, tempo real): Qwen-Omni-Realtime
- Qwen3.5-Omni e Qwen3-Omni (HTTP, arquivo): Non-real-time (Qwen-Omni)
- Qwen3.5-Livetranslate (WebSocket, tempo real): Real-time audio and video translation - Qwen
- Qwen3-Livetranslate (HTTP, arquivo): Audio and video file translation (Qwen)