Todos os produtos
Search
Central de documentação

Alibaba Cloud Model Studio:Visão geral de speech-to-speech

Última atualização: Sep 03, 2026

Escolha um modelo para conversas por voz, tradução de fala ou interpretação simultânea.

Migração de modelos de código fechado

Mapeie sua configuração atual do OpenAI Realtime ou Gemini Live para um modelo equivalente no Bailian.

Exemplos de código fechado

Recomendação do Bailian

Conversa em tempo real

OpenAI GPT Realtime, Gemini 3.1 Live

qwen-audio-3.0-realtime-plus

Conversa com foco em custo

OpenAI gpt-4o-mini Realtime

qwen-audio-3.0-realtime-flash

Tradução em tempo real

Gemini 3.1 Live

qwen3.5-livetranslate-flash-realtime

Esta página aborda o recurso speech-to-speech. Para compreensão visual, análise de áudio/vídeo ou moderação de conteúdo, consulte a documentação Omni-modal.

S2S (speech-to-speech) vs. pipeline

Existem duas abordagens para criar aplicações de voz:

S2S

Pipeline (ASR + LLM + TTS)

Latência

Baixa — processamento de stream com modelo único

Mais alta — processamento serial em três estágios

Compreensão de áudio

Ponta a ponta — percebe tom e emoção e responde adequadamente

Converte para texto antes do processamento e perde nuances sutis do áudio

Personalização de voz

Seleção de vozes predefinidas via system prompt

Clonagem e design de voz (CosyVoice)

  • Use S2S para obter baixa latência, respostas com percepção de áudio e conversas interativas.
  • Adote uma pipeline quando precisar personalizar a voz ou selecionar os modelos de ASR, LLM e TTS independentemente.

Esta página trata da abordagem de modelo único S2S (séries Omni e Livetranslate). Para a abordagem de pipeline, selecione cada componente separadamente:

Modo em tempo real ou arquivo?

  • Tempo real (WebSocket): Assistentes de voz, centrais de atendimento e interpretação simultânea. Transmite entrada de áudio e saída de fala em streaming.
  • Modo de arquivo (HTTP): Maior latência, porém com melhor qualidade. Ideal para dublagem de vídeo, tradução de podcasts e processamento offline. Também oferece suporte a function calling, busca na web, modo de raciocínio e contexto de vídeo (consulte Recursos complementares abaixo).

Escolha um modelo por caso de uso (abordagem de modelo único S2S)

Todos os casos de uso abaixo utilizam a abordagem de modelo único S2S. Para a abordagem de pipeline, consulte os guias de ASR, LLM e TTS vinculados acima.

Caso de uso

Modelo recomendado

API

Assistentes de voz e conversas de atendimento ao cliente

qwen-audio-3.0-realtime-plus

WebSocket

Conversas com foco em custo

qwen-audio-3.0-realtime-flash

WebSocket

Interpretação simultânea e tradução ao vivo

qwen3.5-livetranslate-flash-realtime

WebSocket

Dublagem de vídeo e tradução de podcasts

qwen3-livetranslate-flash

HTTP

Análise de vídeo e rotulagem em lote (requer modo de raciocínio)

qwen3-omni-flash

HTTP

Assistentes de voz com VAD semântico e atendimento inteligente (com suporte a Function Calling)

qwen-audio-3.0-realtime-plus

WebSocket

Recursos complementares da abordagem de modelo único S2S

O Qwen3.5-Omni e o Qwen3-Omni fornecem esses recursos nativamente. O Qwen-Audio Realtime oferece suporte apenas a function calling; não suporta busca na web nem modo de raciocínio. Em uma pipeline, a funcionalidade equivalente vem de componentes individuais (geralmente o LLM).

Function calling

O modelo pode consultar bases de conhecimento, verificar agendas ou acionar fluxos de trabalho com base no que ouve e vê. Use o Qwen3-Omni (apenas HTTP) ou Qwen-Audio Realtime (WebSocket).

Não há suporte nos modelos em tempo real (WebSocket) do Qwen3.5-Omni/Qwen3-Omni nem nos modelos Livetranslate. O Qwen-Audio Realtime (WebSocket) oferece suporte a function calling.

Busca na web

Recupera informações em tempo real sobre eventos atuais, cotações de ações, previsão do tempo e consultas semelhantes. Disponível no Qwen3.5-Omni (WebSocket ou HTTP, nas versões Plus e Flash). O modelo decide autonomamente se deve buscar. O Qwen-Audio Realtime não oferece suporte a este recurso.

Não há suporte no Qwen3-Omni-Flash nem no modelo Livetranslate.

Modo de raciocínio

Use o Qwen3-Omni (HTTP) quando a qualidade da resposta for mais importante que a latência. O modelo raciocina passo a passo antes de responder, sendo ideal para análise de vídeo e rotulagem em lote. O Qwen-Audio Realtime não oferece suporte a este recurso.

A geração de voz não é suportada no modo de raciocínio.

Tradução de fala

As seguintes séries de modelos oferecem suporte à tradução de fala:

  • Qwen3.5-Livetranslate: 60 idiomas (29 com saída de áudio e texto, 31 apenas texto). Abrange chinês, inglês, francês, alemão, russo, japonês, coreano, espanhol, português, árabe, entre outros.
  • Qwen3-Livetranslate: 18 idiomas e 5 dialetos chineses (~3 s de latência). O modo de arquivo aceita entrada de vídeo para traduções com reconhecimento de contexto. Sete idiomas geram saída apenas em texto.
  • Qwen3.5-Omni: 29 idiomas de saída e 8 dialetos chineses. Oferece forte compreensão de áudio/vídeo e busca na web. Permite injetar terminologia e contexto de domínio via system prompt. Disponível nos modos em tempo real e arquivo.
  • Qwen3-Omni-Flash: 11 idiomas de saída e 8 dialetos chineses. Permite injetar terminologia e contexto de domínio via system prompt. Disponível nos modos em tempo real e arquivo, com custo reduzido.

ObservaçãoInício rápido: série Livetranslate. Melhor qualidade e cobertura de idiomas: Qwen3.5-Omni. Foco em custo: Qwen3-Omni-Flash.

Idiomas suportados

Idioma

Qwen3.5-Livetranslate

Qwen3-Livetranslate

Qwen3.5-Omni

Qwen3-Omni-Flash

Inglês

Suportado

Suportado

Suportado

Suportado

Chinês (Mandarim)

Suportado

Suportado

Suportado

Suportado

Cantonês

Apenas texto

Suportado

Suportado

Suportado

Dialetos de Sichuan

Suportado

Suportado

Suportado

Suportado

Xangainês

Suportado

Suportado

Suportado

Suportado

Dialetos de Pequim

Suportado

Suportado

Suportado

Suportado

Dialetos de Tianjin

Suportado

Suportado

Suportado

Suportado

Dialetos de Nanjing

--

--

Suportado

Suportado

Dialetos de Shaanxi

--

--

Suportado

Suportado

Dialetos Minnan

--

--

Suportado

Suportado

Francês

Suportado

Suportado

Suportado

Suportado

Alemão

Suportado

Suportado

Suportado

Suportado

Russo

Suportado

Suportado

Suportado

Suportado

Italiano

Suportado

Suportado

Suportado

Suportado

Espanhol

Suportado

Suportado

Suportado

Suportado

Português

Suportado

Suportado

Suportado

Suportado

Japonês

Suportado

Suportado

Suportado

Suportado

Coreano

Suportado

Suportado

Suportado

Suportado

Tailandês

Suportado

Apenas texto

Suportado

Suportado

Indonésio

Suportado

Apenas texto

Suportado

--

Vietnamita

Suportado

Apenas texto

Suportado

--

Árabe

Suportado

Apenas texto

Suportado

--

Hindi

Suportado

Apenas texto

Suportado

--

Turco

Suportado

Apenas texto

Suportado

--

Finlandês

Suportado

--

Suportado

--

Polonês

Suportado

--

Suportado

--

Holandês

Suportado

--

Suportado

--

Tcheco

Suportado

--

Suportado

--

Urdu

Suportado

--

Suportado

--

Tagalo

Suportado

--

Suportado

--

Sueco

Suportado

--

Suportado

--

Dinamarquês

Suportado

--

Suportado

--

Hebraico

Suportado

--

Suportado

--

Islandês

Suportado

--

Suportado

--

Malaio

Suportado

--

Suportado

--

Norueguês

Suportado

--

Suportado

--

Persa

Suportado

--

Suportado

--

Grego

Apenas texto

Apenas texto

--

--

Africâner

Apenas texto

--

--

--

Asturiano

Apenas texto

--

--

--

Bielorrusso

Apenas texto

--

--

--

Búlgaro

Apenas texto

--

--

--

Bengali

Apenas texto

--

--

--

Bósnio

Apenas texto

--

--

--

Catalão

Apenas texto

--

--

--

Cebuano

Apenas texto

--

--

--

Estoniano

Apenas texto

--

--

--

Galego

Apenas texto

--

--

--

Guzerate

Apenas texto

--

--

--

Croata

Apenas texto

--

--

--

Húngaro

Apenas texto

--

--

--

Javanês

Apenas texto

--

--

--

Cazaque

Apenas texto

--

--

--

Canarês

Apenas texto

--

--

--

Quirguiz

Apenas texto

--

--

--

Letão

Apenas texto

--

--

--

Macedônio

Apenas texto

--

--

--

Malaiala

Apenas texto

--

--

--

Marati

Apenas texto

--

--

--

Panjabi

Apenas texto

--

--

--

Romeno

Apenas texto

--

--

--

Eslovaco

Apenas texto

--

--

--

Esloveno

Apenas texto

--

--

--

Suaíli

Apenas texto

--

--

--

Tadjique

Apenas texto

--

--

--

Azeri

Apenas texto

--

--

--

Ucraniano

Apenas texto

--

--

--

"Suportado" = saída de fala e texto. "Apenas texto" = somente saída de texto, sem fala.

O Qwen3.5-Omni oferece suporte a 113 idiomas e dialetos de entrada.

O Qwen3.5-Livetranslate oferece suporte a 60 idiomas (29 com áudio e texto, 31 apenas texto).

O modelo legado qwen-omni-turbo suporta apenas chinês e inglês.

Modelos recomendados

A tabela lista o modelo inicial de cada série. Para fixar uma versão datada visando testes de regressão ou estabilidade, consulte Todos os modelos abaixo.

Modelo

API

Entrada

Function calling

Busca na web

Modo de raciocínio

Tradução

qwen-audio-3.0-realtime-plus

WebSocket

áudio, texto

Suportado

--

--

--

qwen-audio-3.0-realtime-flash

WebSocket

áudio, texto

Suportado

--

--

--

qwen3.5-omni-flash-realtime

WebSocket

texto, áudio, imagem

Suportado

Suportado

--

29 idiomas

qwen3.5-omni-flash

HTTP

texto, áudio, imagem, vídeo

Não suportado

Suportado

--

29 idiomas

qwen3-omni-flash-realtime

WebSocket

texto, áudio, imagem, vídeo

--

--

--

11 idiomas

qwen3-omni-flash

HTTP

texto, áudio, imagem, vídeo

Suportado

--

Suportado

11 idiomas

qwen3.5-livetranslate-flash-realtime

WebSocket

áudio, imagem

--

--

--

60 idiomas

qwen3-livetranslate-flash

HTTP

áudio, vídeo

--

--

--

18 idiomas

Todos os modelos

Qwen-Audio

Modelo

API

Entrada

Function calling

Busca na web

Modo de raciocínio

Tradução

qwen-audio-3.0-realtime-plus

WebSocket

áudio, texto

Suportado

--

--

--

qwen-audio-3.0-realtime-flash

WebSocket

áudio, texto

Suportado

--

--

--

Qwen3.5-Omni

Modelo

API

Entrada

Function calling

Busca na web

Modo de raciocínio

qwen3.5-omni-plus-realtime

WebSocket

Texto, áudio, imagem, vídeo

Suportado

Suportado

--

qwen3.5-omni-plus-realtime-2026-03-15

WebSocket

Texto, áudio, imagem, vídeo

Suportado

Suportado

--

qwen3.5-omni-plus

HTTP

Texto, áudio, imagem, vídeo

Não suportado

Suportado

--

qwen3.5-omni-plus-2026-03-15

HTTP

Texto, áudio, imagem, vídeo

Não suportado

Suportado

--

qwen3.5-omni-flash-realtime

WebSocket

Texto, áudio, imagem, vídeo

Suportado

Suportado

--

qwen3.5-omni-flash-realtime-2026-03-15

WebSocket

Texto, áudio, imagem, vídeo

Suportado

Suportado

--

qwen3.5-omni-flash

HTTP

Texto, áudio, imagem, vídeo

Não suportado

Suportado

--

qwen3.5-omni-flash-2026-03-15

HTTP

Texto, áudio, imagem, vídeo

Não suportado

Suportado

--

Qwen3-Omni

Modelo

API

Entrada

Function calling

Busca na web

Modo de raciocínio

qwen3-omni-flash-realtime

WebSocket

Texto, áudio, imagem, vídeo

--

--

--

qwen3-omni-flash-realtime-2025-12-01

WebSocket

Texto, áudio, imagem, vídeo

--

--

--

qwen3-omni-flash-realtime-2025-09-15

WebSocket

Texto, áudio, imagem, vídeo

--

--

--

qwen3-omni-flash

HTTP

Texto, áudio, imagem, vídeo

Suportado

--

Suportado

qwen3-omni-flash-2025-12-01

HTTP

Texto, áudio, imagem, vídeo

Suportado

--

Suportado

qwen3-omni-flash-2025-09-15

HTTP

Texto, áudio, imagem, vídeo

Suportado

--

Suportado

Qwen3.5-Livetranslate

Modelo

API

Entrada

Idiomas

qwen3.5-livetranslate-flash-realtime

WebSocket

Áudio

60

qwen3.5-livetranslate-flash-realtime-2026-05-19

WebSocket

Áudio

60

Qwen3-Livetranslate

Modelo

API

Entrada

Idiomas

qwen3-livetranslate-flash-realtime

WebSocket

Áudio

18

qwen3-livetranslate-flash-realtime-2025-09-22

WebSocket

Áudio

18

qwen3-livetranslate-flash

HTTP

Áudio, vídeo

18

qwen3-livetranslate-flash-2025-12-01

HTTP

Áudio, vídeo

18

Modelos legados

Estes modelos não recebem mais atualizações. Para novos projetos, use o Qwen3.5-Omni.

Modelo

Entrada

API

qwen2.5-omni-7b

Texto, áudio, imagem, vídeo

HTTP

qwen-omni-turbo

Texto, áudio, imagem, vídeo

HTTP

qwen-omni-turbo-latest

Texto, áudio, imagem, vídeo

HTTP

qwen-omni-turbo-2025-03-26

Texto, áudio, imagem, vídeo

HTTP

qwen-omni-turbo-realtime

Texto, áudio

WebSocket

qwen-omni-turbo-realtime-latest

Texto, áudio

WebSocket

qwen-omni-turbo-realtime-2025-05-08

Texto, áudio

WebSocket

Próximos passos

Documentação da API por série de modelos: