Alibaba Cloud Model Studio:Qwen-Audio-TTS/CosyVoice server-side events
Última atualização: Sep 02, 2026
Guia do usuário: Para introdução ao modelo e recomendações de seleção, consulte Síntese de fala.
task-started
Após o cliente enviar o comando run-task, o servidor retorna um evento task-started para indicar o início da tarefa. O cliente só pode enviar comandos subsequentes após receber esse evento.
sentence-begin: Início da frase. Retorna o texto a ser sintetizado.
sentence-synthesis: Marca um quadro de áudio. Um quadro de áudio é transmitido pelo canal binário WebSocket imediatamente após cada evento.
sentence-end: Fim da frase. Retorna o conteúdo textual e a contagem cumulativa de caracteres.
sentence.indexinteger
Índice da frase, começando em 0.
sentence.wordsarray
Array de carimbos de data/hora no nível da palavra.
words element properties
textstring
Conteúdo textual da palavra.
begin_indexinteger
Índice do caractere inicial da palavra na frase. Começa em 0.
end_indexinteger
Índice do caractere final da palavra na frase. Começa em 1.
begin_timeinteger
Tempo inicial do áudio correspondente à palavra, em milissegundos.
end_timeinteger
Tempo final do áudio correspondente à palavra, em milissegundos.
original_textstring
Texto da frase conforme segmentado para síntese.
payload.usageobject
Informações de faturamento, retornadas no evento sentence-end.
Properties
charactersinteger
Número cumulativo de caracteres faturados.
task-finished
O servidor retorna um evento task-finished ao concluir a tarefa. Nesse momento, o cliente pode fechar a conexão WebSocket ou reutilizá-la para iniciar uma nova tarefa.