Todos os produtos
Search
Central de documentação

Alibaba Cloud Model Studio:Speech synthesis

Última atualização: Jul 15, 2026

Escolha o modelo ideal para síntese de fala, clonagem de voz e design de voz.

Migrando de modelos proprietários?

Se você usa atualmente ElevenLabs, OpenAI ou Google para síntese de fala, consulte a tabela abaixo para encontrar o modelo equivalente no Model Studio.

Caso de uso

Modelo proprietário

Equivalente no Model Studio

Vozes integradas / síntese padrão

OpenAI gpt-4o-tts, Google Chirp 3

qwen-audio-3.0-tts-plus

Voz personalizada / clonagem de voz

ElevenLabs Multilingual v3

qwen-audio-3.0-tts-flash (clonagem de voz), cosyvoice-v3.5-plus (design de voz)

TTS padrão ou voz personalizada?

Os modelos de síntese de fala convertem texto em fala com sonoridade natural. Defina primeiro se as vozes integradas ou personalizadas atendem melhor às suas necessidades:

TTS padrão

Voz personalizada

source da voz

Biblioteca de vozes predefinidas — selecione e use imediatamente

Clone a partir de uma amostra de áudio ou crie com base em uma descrição textual

Esforço de configuração

Nenhuma configuração extra necessária — basta escolha um modelo e uma voz para começar

Requer uma amostra de áudio ou descrição textual para criar a voz

Casos de uso

Bots de atendimento ao cliente, audiolivros, noticiários, transmissões ao vivo de e-commerce

Vozes exclusivas de marca, âncoras virtuais, dublagem de personagens de jogos

Modelos recomendados

qwen-audio-3.0-tts-plus

qwen-audio-3.0-tts-flash (clonagem de voz), cosyvoice-v3.5-plus (design de voz)

  • Use o TTS padrão quando a biblioteca de vozes predefinidas atender às suas necessidades e você quiser uma configuração rápida, sem etapas adicionais.

  • Use uma voz personalizada se precisar de uma voz exclusiva para sua marca, quiser replicar a voz de uma pessoa específica ou necessitar criar uma voz totalmente nova para um personagem.

Clonagem de voz ou design de voz?

Ao optar por uma voz personalizada, dois métodos de criação estão disponíveis:

Clonagem de voz

Design de voz

Entrada

Uma amostra de áudio do falante alvo

Uma descrição textual da voz desejada (ex.: "voz feminina grave e acolhedora")

Resultado

A fala sintetizada reproduz fielmente as características do falante original

Uma voz inédita, gerada do zero com base na descrição fornecida

Casos de uso

Reutilização da voz de porta-vozes ou âncoras de marca, âncoras virtuais, assistentes de voz personalizados

Criação de identidade vocal para marcas (sem gravações prévias), dublagem de personagens em jogos e animações, produção de conteúdo criativo

Modelos recomendados

qwen-audio-3.0-tts-flash

cosyvoice-v3.5-plus, cosyvoice-v3.5-flash

service de gerenciamento de voz

voice-enrollment (registre e gerencie vozes)

voice-enrollment (registre e gerencie vozes)

  • Use a clonagem de voz se já tiver uma gravação do falante alvo e quiser reproduzir essa voz na síntese de fala.

  • Use o design de voz quando não houver gravações disponíveis e for necessário criar uma nova voz a partir de uma descrição textual.

WebSocket ou HTTP?

  • WebSocket: Streaming bidirecional — permite entrada e saída contínuas, entregando o áudio à medida que é sintetizado para minimizar a latência. Ideal para bots de atendimento, assistentes de voz e centrais de telemarketing.

  • HTTP: Envie o texto completo e receba o áudio em uma resposta em streaming (saída fragmentada). Mais indicado para audiolivros, produção de conteúdo sonoro e outros cenários de processamento em lote com alto volume.

Os modelos Qwen-Audio-TTS/CosyVoice usam o mesmo nome tanto para acesso via WebSocket quanto via HTTP. Nos modelos Qwen, o nome indica a API: aqueles com o sufixo -realtime usam WebSocket; os demais usam HTTP.

Acesse os modelos Qwen-Audio-TTS/CosyVoice e Qwen WebSocket pelo DashScope SDK (Java, Python). Outros modelos exigem chamadas diretas via WebSocket ou HTTP.

Para acesso via WebSocket, consulte Síntese de fala em tempo real. Para acesso via HTTP, consulte Síntese de fala não em tempo real.

Controle por instruções

Descreva o estilo de expressão desejado em linguagem natural para ajustar velocidade, emoção e estilo em cada solicitação. Exemplos: "fale suavemente em ritmo mais lento" ou "use tom empolgado, típico de locução". Aplique o controle por instruções na produção de conteúdo emocional, locuções profissionais, audiolivros e demais cenários que demandam alta expressividade.

Modelos compatíveis com controle por instruções: Série Qwen-Audio-TTS (qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash), Série CosyVoice (cosyvoice-v3.5-plus, cosyvoice-v3.5-flash, cosyvoice-v3-flash) e série Qwen-TTS (qwen3-tts-instruct-flash-realtime, qwen3-tts-instruct-flash). Para mais detalhes, consulte Síntese de fala em tempo real > Controle por instruções.

Modelos recomendados

A tabela a seguir apresenta o modelo mais adequado para cada cenário. Para informações completas, visite a Model Gallery.

ID do modelo

Série

API

Clonagem de voz

Design de voz

Controle por instruções

qwen-audio-3.0-tts-plus

Qwen-Audio-TTS

WebSocket

Unsupported

Unsupported

Supported

cosyvoice-v3.5-plus

CosyVoice

WebSocket

Supported

Supported

Supported

cosyvoice-v3-plus

CosyVoice

WebSocket

Supported

Supported

Unsupported

Todos os modelos

Qwen-Audio-TTS

ID do modelo

API

Clonagem de voz

Design de voz

Controle por instruções

qwen-audio-3.0-tts-plus

WebSocket

Unsupported

Unsupported

Supported

qwen-audio-3.0-tts-flash

WebSocket

Supported

Unsupported

Supported

Idiomas suportados:

  • Vozes do sistema (varia conforme a voz): Chinês (Mandarim), Inglês

  • Vozes clonadas (dialetos configuráveis via controle por instruções): Chinês (Mandarim, Cantonês, Chongqing, Nordeste, Gansu, Guizhou, Zhejiang, Hebei, Henan, Hubei, Hunan, Jiangxi, Ningbo, Ningxia, Qingdao, Shaanxi, Shanxi, Shandong, Xangai, Sichuan, Yunnan), Inglês, Japonês, Coreano, Alemão, Francês, Italiano, Russo, Português, Tailandês, Indonésio, Malaio e Vietnamita

CosyVoice

Alguns modelos CosyVoice aceitam marcação SSML (Speech Synthesis Markup Language) e leitura de fórmulas LaTeX.

ID do modelo

API

Clonagem de voz

Design de voz

Controle por instruções

cosyvoice-v3.5-plus

WebSocket

Supported

Supported

Supported

cosyvoice-v3.5-flash

WebSocket

Supported

Supported

Supported

cosyvoice-v3-plus

WebSocket

Supported

Supported

Unsupported

cosyvoice-v3-flash

WebSocket

Supported

Supported

Supported

cosyvoice-v2

WebSocket

Supported

Unsupported

Unsupported

Idiomas suportados (por versão):

  • cosyvoice-v3.5-plus e cosyvoice-v3.5-flash (sem vozes do sistema):

    • Vozes clonadas (dialetos configuráveis via controle por instruções): Chinês (Mandarim, Cantonês, Nordeste, Gansu, Guizhou, Henan, Hubei, Jiangxi, Hokkien, Ningxia, Shanxi, Shaanxi, Shandong, Xangai, Sichuan, Tianjin, Yunnan), Inglês, Francês, Alemão, Japonês, Coreano, Russo, Português, Tailandês, Indonésio e Vietnamita

    • Vozes projetadas: Chinês (Mandarim), Inglês

  • cosyvoice-v3-plus:

    • Vozes do sistema (varia conforme a voz): Chinês (Mandarim), Inglês

    • Vozes clonadas (dialetos configuráveis via controle por instruções): Chinês (Mandarim, Cantonês, Nordeste, Gansu, Guizhou, Henan, Hubei, Jiangxi, Hokkien, Ningxia, Shanxi, Shaanxi, Shandong, Xangai, Sichuan, Tianjin, Yunnan), Inglês, Francês, Alemão, Japonês, Coreano e Russo

    • Vozes projetadas: Chinês (Mandarim), Inglês

  • cosyvoice-v3-flash:

    • Vozes do sistema (varia conforme a voz; alguns dialetos têm suporte nativo nas vozes do sistema, outros via controle por instruções): Chinês (Mandarim, Cantonês, Nordeste, Henan, Hunan, Shaanxi, Shandong, Sichuan, Anhui, Hokkien), Inglês

    • Vozes clonadas (dialetos configuráveis via controle por instruções): Chinês (Mandarim, Cantonês, Nordeste, Gansu, Guizhou, Henan, Hubei, Jiangxi, Hokkien, Ningxia, Shanxi, Shaanxi, Shandong, Xangai, Sichuan, Tianjin, Yunnan), Inglês, Francês, Alemão, Japonês, Coreano, Russo, Português, Tailandês, Indonésio e Vietnamita

    • Vozes projetadas: Chinês (Mandarim), Inglês

  • cosyvoice-v2 (design de voz não suportado):

    • Vozes do sistema (varia conforme a voz): Chinês (Mandarim, Cantonês, Nordeste, Hokkien, Shaanxi), Inglês, Japonês e Coreano

    • Vozes clonadas: Chinês (Mandarim), Inglês

Qwen3-TTS

ID do modelo

API

Clonagem de voz

Design de voz

Controle por instruções

qwen3-tts-flash

HTTP

Unsupported

Unsupported

Unsupported

qwen3-tts-flash-2025-11-27

HTTP

Unsupported

Unsupported

Unsupported

qwen3-tts-flash-2025-09-18

HTTP

Unsupported

Unsupported

Unsupported

qwen3-tts-flash-realtime

WebSocket

Unsupported

Unsupported

Unsupported

qwen3-tts-flash-realtime-2025-11-27

WebSocket

Unsupported

Unsupported

Unsupported

qwen3-tts-flash-realtime-2025-09-18

WebSocket

Unsupported

Unsupported

Unsupported

qwen3-tts-instruct-flash

HTTP

Unsupported

Unsupported

Supported

qwen3-tts-instruct-flash-2026-01-26

HTTP

Unsupported

Unsupported

Supported

qwen3-tts-instruct-flash-realtime

WebSocket

Unsupported

Unsupported

Supported

qwen3-tts-instruct-flash-realtime-2026-01-22

WebSocket

Unsupported

Unsupported

Supported

qwen3-tts-vc-2026-01-22

HTTP

Supported

Unsupported

Unsupported

qwen3-tts-vc-realtime-2026-01-15

WebSocket

Supported

Unsupported

Unsupported

qwen3-tts-vc-realtime-2025-11-27

WebSocket

Supported

Unsupported

Unsupported

qwen3-tts-vd-2026-01-26

HTTP

Unsupported

Supported

Unsupported

qwen3-tts-vd-realtime-2026-01-15

WebSocket

Unsupported

Supported

Unsupported

qwen3-tts-vd-realtime-2025-12-16

WebSocket

Unsupported

Supported

Unsupported

Idiomas suportados (por versão):

  • Série Qwen3-TTS-Flash (vozes do sistema) (qwen3-tts-flash, qwen3-tts-flash-2025-11-27, qwen3-tts-flash-2025-09-18, qwen3-tts-flash-realtime, qwen3-tts-flash-realtime-2025-11-27, qwen3-tts-flash-realtime-2025-09-18): Chinês (Mandarim, Pequim, Xangai, Sichuan, Nanquim, Shaanxi, Hokkien, Tianjin, Cantonês — varia conforme a voz), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo

  • Série Qwen3-TTS-Instruct-Flash (vozes do sistema) (qwen3-tts-instruct-flash, qwen3-tts-instruct-flash-2026-01-26, qwen3-tts-instruct-flash-realtime, qwen3-tts-instruct-flash-realtime-2026-01-22): Chinês (Mandarim), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo

  • Série Qwen3-TTS-VC (clonagem de voz) (qwen3-tts-vc-2026-01-22, qwen3-tts-vc-realtime-2026-01-15, qwen3-tts-vc-realtime-2025-11-27): Chinês (Mandarim), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo

  • Série Qwen3-TTS-VD (design de voz) (qwen3-tts-vd-2026-01-26, qwen3-tts-vd-realtime-2026-01-15, qwen3-tts-vd-realtime-2025-12-16): Chinês (Mandarim), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo

Qwen-TTS (legado, faturamento por token)

Os modelos legados do Qwen-TTS listados abaixo operam com faturamento baseado em tokens. Se você migrou para o Qwen3-TTS, use os modelos recomendados anteriormente neste tópico.

ID do modelo

API

Descrição

qwen-tts

HTTP

Síntese sem streaming, faturamento por token

qwen-tts-latest

HTTP

Síntese sem streaming, faturamento por token

qwen-tts-2025-05-22

HTTP

Versão snapshot, faturamento por token

qwen-tts-2025-04-10

HTTP

Versão snapshot, faturamento por token

qwen-tts-realtime

WebSocket

Síntese em streaming, faturamento por token

qwen-tts-realtime-latest

WebSocket

Síntese em streaming, faturamento por token

qwen-tts-realtime-2025-07-15

WebSocket

Versão snapshot, síntese em streaming, faturamento por token

Idiomas suportados (por versão):

  • Série Qwen-TTS (vozes do sistema) (qwen-tts, qwen-tts-latest, qwen-tts-2025-05-22, qwen-tts-2025-04-10): Chinês (Mandarim, Pequim, Xangai, Sichuan — varia conforme a voz), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo

  • Série Qwen-TTS-Realtime (vozes do sistema) (qwen-tts-realtime, qwen-tts-realtime-latest, qwen-tts-realtime-2025-07-15): Chinês (Mandarim), Inglês, Alemão, Italiano, Português, Espanhol, Japonês, Coreano, Francês e Russo