Escolha o modelo ideal para síntese de fala, clonagem de voz e design de voz.
Migrando de modelos proprietários?
Se você usa atualmente ElevenLabs, OpenAI ou Google para síntese de fala, consulte a tabela abaixo para encontrar o modelo equivalente no Model Studio.
|
Caso de uso |
Modelo proprietário |
Equivalente no Model Studio |
|
Vozes integradas / síntese padrão |
OpenAI gpt-4o-tts, Google Chirp 3 |
|
|
Voz personalizada / clonagem de voz |
ElevenLabs Multilingual v3 |
|
TTS padrão ou voz personalizada?
Os modelos de síntese de fala convertem texto em fala com sonoridade natural. Defina primeiro se as vozes integradas ou personalizadas atendem melhor às suas necessidades:
|
TTS padrão |
Voz personalizada |
|
|
source da voz |
Biblioteca de vozes predefinidas — selecione e use imediatamente |
Clone a partir de uma amostra de áudio ou crie com base em uma descrição textual |
|
Esforço de configuração |
Nenhuma configuração extra necessária — basta escolha um modelo e uma voz para começar |
Requer uma amostra de áudio ou descrição textual para criar a voz |
|
Casos de uso |
Bots de atendimento ao cliente, audiolivros, noticiários, transmissões ao vivo de e-commerce |
Vozes exclusivas de marca, âncoras virtuais, dublagem de personagens de jogos |
|
Modelos recomendados |
|
|
Use o TTS padrão quando a biblioteca de vozes predefinidas atender às suas necessidades e você quiser uma configuração rápida, sem etapas adicionais.
Use uma voz personalizada se precisar de uma voz exclusiva para sua marca, quiser replicar a voz de uma pessoa específica ou necessitar criar uma voz totalmente nova para um personagem.
Clonagem de voz ou design de voz?
Ao optar por uma voz personalizada, dois métodos de criação estão disponíveis:
|
Clonagem de voz |
Design de voz |
|
|
Entrada |
Uma amostra de áudio do falante alvo |
Uma descrição textual da voz desejada (ex.: "voz feminina grave e acolhedora") |
|
Resultado |
A fala sintetizada reproduz fielmente as características do falante original |
Uma voz inédita, gerada do zero com base na descrição fornecida |
|
Casos de uso |
Reutilização da voz de porta-vozes ou âncoras de marca, âncoras virtuais, assistentes de voz personalizados |
Criação de identidade vocal para marcas (sem gravações prévias), dublagem de personagens em jogos e animações, produção de conteúdo criativo |
|
Modelos recomendados |
|
|
|
service de gerenciamento de voz |
|
|
Use a clonagem de voz se já tiver uma gravação do falante alvo e quiser reproduzir essa voz na síntese de fala.
Use o design de voz quando não houver gravações disponíveis e for necessário criar uma nova voz a partir de uma descrição textual.
WebSocket ou HTTP?
WebSocket: Streaming bidirecional — permite entrada e saída contínuas, entregando o áudio à medida que é sintetizado para minimizar a latência. Ideal para bots de atendimento, assistentes de voz e centrais de telemarketing.
HTTP: Envie o texto completo e receba o áudio em uma resposta em streaming (saída fragmentada). Mais indicado para audiolivros, produção de conteúdo sonoro e outros cenários de processamento em lote com alto volume.
Os modelos Qwen-Audio-TTS/CosyVoice usam o mesmo nome tanto para acesso via WebSocket quanto via HTTP. Nos modelos Qwen, o nome indica a API: aqueles com o sufixo -realtime usam WebSocket; os demais usam HTTP.
Acesse os modelos Qwen-Audio-TTS/CosyVoice e Qwen WebSocket pelo DashScope SDK (Java, Python). Outros modelos exigem chamadas diretas via WebSocket ou HTTP.
Para acesso via WebSocket, consulte Síntese de fala em tempo real. Para acesso via HTTP, consulte Síntese de fala não em tempo real.
Controle por instruções
Descreva o estilo de expressão desejado em linguagem natural para ajustar velocidade, emoção e estilo em cada solicitação. Exemplos: "fale suavemente em ritmo mais lento" ou "use tom empolgado, típico de locução". Aplique o controle por instruções na produção de conteúdo emocional, locuções profissionais, audiolivros e demais cenários que demandam alta expressividade.
Modelos compatíveis com controle por instruções: Série Qwen-Audio-TTS (qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash), Série CosyVoice (cosyvoice-v3.5-plus, cosyvoice-v3.5-flash, cosyvoice-v3-flash) e série Qwen-TTS (qwen3-tts-instruct-flash-realtime, qwen3-tts-instruct-flash). Para mais detalhes, consulte Síntese de fala em tempo real > Controle por instruções.
Modelos recomendados
A tabela a seguir apresenta o modelo mais adequado para cada cenário. Para informações completas, visite a Model Gallery.
|
ID do modelo |
Série |
API |
Clonagem de voz |
Design de voz |
Controle por instruções |
|
|
Qwen-Audio-TTS |
WebSocket |
|
|
|
|
|
CosyVoice |
WebSocket |
|
|
|
|
|
CosyVoice |
WebSocket |
|
|
|
Todos os modelos
Qwen-Audio-TTS
|
ID do modelo |
API |
Clonagem de voz |
Design de voz |
Controle por instruções |
|
|
WebSocket |
|
|
|
|
|
WebSocket |
|
|
|
Idiomas suportados:
Vozes do sistema (varia conforme a voz): Chinês (Mandarim), Inglês
Vozes clonadas (dialetos configuráveis via controle por instruções): Chinês (Mandarim, Cantonês, Chongqing, Nordeste, Gansu, Guizhou, Zhejiang, Hebei, Henan, Hubei, Hunan, Jiangxi, Ningbo, Ningxia, Qingdao, Shaanxi, Shanxi, Shandong, Xangai, Sichuan, Yunnan), Inglês, Japonês, Coreano, Alemão, Francês, Italiano, Russo, Português, Tailandês, Indonésio, Malaio e Vietnamita
CosyVoice
Alguns modelos CosyVoice aceitam marcação SSML (Speech Synthesis Markup Language) e leitura de fórmulas LaTeX.
|
ID do modelo |
API |
Clonagem de voz |
Design de voz |
Controle por instruções |
|
|
WebSocket |
|
|
|
|
|
WebSocket |
|
|
|
|
|
WebSocket |
|
|
|
|
|
WebSocket |
|
|
|
|
|
WebSocket |
|
|
|
Idiomas suportados (por versão):
-
cosyvoice-v3.5-plus e cosyvoice-v3.5-flash (sem vozes do sistema):
Vozes clonadas (dialetos configuráveis via controle por instruções): Chinês (Mandarim, Cantonês, Nordeste, Gansu, Guizhou, Henan, Hubei, Jiangxi, Hokkien, Ningxia, Shanxi, Shaanxi, Shandong, Xangai, Sichuan, Tianjin, Yunnan), Inglês, Francês, Alemão, Japonês, Coreano, Russo, Português, Tailandês, Indonésio e Vietnamita
Vozes projetadas: Chinês (Mandarim), Inglês
-
cosyvoice-v3-plus:
Vozes do sistema (varia conforme a voz): Chinês (Mandarim), Inglês
Vozes clonadas (dialetos configuráveis via controle por instruções): Chinês (Mandarim, Cantonês, Nordeste, Gansu, Guizhou, Henan, Hubei, Jiangxi, Hokkien, Ningxia, Shanxi, Shaanxi, Shandong, Xangai, Sichuan, Tianjin, Yunnan), Inglês, Francês, Alemão, Japonês, Coreano e Russo
Vozes projetadas: Chinês (Mandarim), Inglês
-
cosyvoice-v3-flash:
Vozes do sistema (varia conforme a voz; alguns dialetos têm suporte nativo nas vozes do sistema, outros via controle por instruções): Chinês (Mandarim, Cantonês, Nordeste, Henan, Hunan, Shaanxi, Shandong, Sichuan, Anhui, Hokkien), Inglês
Vozes clonadas (dialetos configuráveis via controle por instruções): Chinês (Mandarim, Cantonês, Nordeste, Gansu, Guizhou, Henan, Hubei, Jiangxi, Hokkien, Ningxia, Shanxi, Shaanxi, Shandong, Xangai, Sichuan, Tianjin, Yunnan), Inglês, Francês, Alemão, Japonês, Coreano, Russo, Português, Tailandês, Indonésio e Vietnamita
Vozes projetadas: Chinês (Mandarim), Inglês
-
cosyvoice-v2 (design de voz não suportado):
Vozes do sistema (varia conforme a voz): Chinês (Mandarim, Cantonês, Nordeste, Hokkien, Shaanxi), Inglês, Japonês e Coreano
Vozes clonadas: Chinês (Mandarim), Inglês
Qwen3-TTS
|
ID do modelo |
API |
Clonagem de voz |
Design de voz |
Controle por instruções |
|
|
HTTP |
|
|
|
|
|
HTTP |
|
|
|
|
|
HTTP |
|
|
|
|
|
WebSocket |
|
|
|
|
|
WebSocket |
|
|
|
|
|
WebSocket |
|
|
|
|
|
HTTP |
|
|
|
|
|
HTTP |
|
|
|
|
|
WebSocket |
|
|
|
|
|
WebSocket |
|
|
|
|
|
HTTP |
|
|
|
|
|
WebSocket |
|
|
|
|
|
WebSocket |
|
|
|
|
|
HTTP |
|
|
|
|
|
WebSocket |
|
|
|
|
|
WebSocket |
|
|
|
Idiomas suportados (por versão):
Série Qwen3-TTS-Flash (vozes do sistema) (
qwen3-tts-flash,qwen3-tts-flash-2025-11-27,qwen3-tts-flash-2025-09-18,qwen3-tts-flash-realtime,qwen3-tts-flash-realtime-2025-11-27,qwen3-tts-flash-realtime-2025-09-18): Chinês (Mandarim, Pequim, Xangai, Sichuan, Nanquim, Shaanxi, Hokkien, Tianjin, Cantonês — varia conforme a voz), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e RussoSérie Qwen3-TTS-Instruct-Flash (vozes do sistema) (
qwen3-tts-instruct-flash,qwen3-tts-instruct-flash-2026-01-26,qwen3-tts-instruct-flash-realtime,qwen3-tts-instruct-flash-realtime-2026-01-22): Chinês (Mandarim), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e RussoSérie Qwen3-TTS-VC (clonagem de voz) (
qwen3-tts-vc-2026-01-22,qwen3-tts-vc-realtime-2026-01-15,qwen3-tts-vc-realtime-2025-11-27): Chinês (Mandarim), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e RussoSérie Qwen3-TTS-VD (design de voz) (
qwen3-tts-vd-2026-01-26,qwen3-tts-vd-realtime-2026-01-15,qwen3-tts-vd-realtime-2025-12-16): Chinês (Mandarim), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo
Qwen-TTS (legado, faturamento por token)
Os modelos legados do Qwen-TTS listados abaixo operam com faturamento baseado em tokens. Se você migrou para o Qwen3-TTS, use os modelos recomendados anteriormente neste tópico.
|
ID do modelo |
API |
Descrição |
|
|
HTTP |
Síntese sem streaming, faturamento por token |
|
|
HTTP |
Síntese sem streaming, faturamento por token |
|
|
HTTP |
Versão snapshot, faturamento por token |
|
|
HTTP |
Versão snapshot, faturamento por token |
|
|
WebSocket |
Síntese em streaming, faturamento por token |
|
|
WebSocket |
Síntese em streaming, faturamento por token |
|
|
WebSocket |
Versão snapshot, síntese em streaming, faturamento por token |
Idiomas suportados (por versão):
Série Qwen-TTS (vozes do sistema) (
qwen-tts,qwen-tts-latest,qwen-tts-2025-05-22,qwen-tts-2025-04-10): Chinês (Mandarim, Pequim, Xangai, Sichuan — varia conforme a voz), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e RussoSérie Qwen-TTS-Realtime (vozes do sistema) (
qwen-tts-realtime,qwen-tts-realtime-latest,qwen-tts-realtime-2025-07-15): Chinês (Mandarim), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo