text_typestring(required)
Defina como PlainText.
voicestring(required)
Voz usada na síntese de fala.
formatstring(optional)
Formato de codificação de áudio.
Valores válidos:
- pcm
- wav
- mp3 (padrão)
- opus
sample_rateinteger(optional)
Taxa de amostragem de áudio em Hz.
Valores válidos: 8000, 16000, 22050 (padrão), 24000, 44100, 48000.
volumeinteger(optional)
Nível de volume.
Valor padrão: 50.
Valores válidos: [0, 100].
ratefloat(optional)
Velocidade da fala.
Valor padrão: 1,0.
Valores válidos: [0,5, 2,0].
pitchfloat(optional)
Tom da voz.
Valor padrão: 1,0.
Valores válidos: [0,5, 2,0].
bit_rateinteger(optional)
Taxa de bits de áudio em kbps. Se o formato de áudio for mp3 ou opus, use bit_rate para ajustar a taxa de bits.
Valor padrão: 32.
Valores válidos: [6, 510].
enable_ssmlboolean(optional)
Define se o SSML deve ser ativado.
Valor padrão: false.
Se definido como true, apenas um comando continue-task é permitido.
Para restrições de uso do SSML (modelos, vozes e APIs compatíveis), consulte Limitations.
word_timestamp_enabledboolean(optional)
Define se os carimbos de data/hora no nível de palavra devem ser ativados.
Valor padrão: false.
Disponível apenas no modo de saída streaming. Vozes compatíveis: vozes clonadas de qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash, cosyvoice-v3.5-plus, cosyvoice-v3.5-flash, cosyvoice-v3-flash, cosyvoice-v3-plus e cosyvoice-v2, além de vozes do sistema marcadas como compatíveis em Qwen-Audio-TTS voice list, CosyVoice Voice list. Vozes clonadas de outros modelos não oferecem suporte a este recurso.
seedinteger(optional)
Semente aleatória para controlar a variação na saída da síntese. Se a versão do modelo, o texto, a voz e outros parâmetros permanecerem inalterados, usar a mesma semente produz resultados idênticos.
Valor padrão: 0.
Valores válidos: [0, 65535].
language_hintsarray[string](optional)
Importante
- Este parâmetro é um array, mas a versão atual processa apenas o primeiro elemento. Passe um único valor.
- Este parâmetro especifica o idioma de destino para a síntese de fala. Ele não está relacionado ao idioma da amostra de áudio usada na clonagem de voz. Para definir o idioma de origem de uma tarefa de clonagem, consulte a referência da API de clonagem de voz.
Especifica o idioma de destino para a síntese de fala a fim de melhorar a qualidade da saída.
Use este parâmetro quando a pronúncia de dígitos, expansão de abreviações, leitura de símbolos ou síntese de idiomas minoritários não atender às expectativas. Por exemplo:
- Pronúncia inesperada de dígitos: "olá, isto é 110" é lido como "olá, isto é um zero" em vez da pronúncia chinesa esperada
- Pronúncia imprecisa de símbolos: "@" é lido como o equivalente chinês em vez de "at"
- Baixa qualidade na síntese de idiomas minoritários com resultados pouco naturais
Valores válidos:
- zh: Chinês
- en: Inglês
- fr: Francês
- de: Alemão
- ja: Japonês
- ko: Coreano
- ru: Russo
- pt: Português
- th: Tailandês
- id: Indonésio
- vi: Vietnamita
- es: Espanhol
- it: Italiano
- ms: Malaio
- fil: Filipino
- ar: Árabe
instructionstring(optional)
Define uma instrução para controlar dialeto, emoção ou características da voz durante a síntese. Para detalhes de uso, consulte Instruction control.
enable_aigc_tagboolean(optional)
Define se uma marca d'água AIGC deve ser incorporada ao áudio gerado. Se definido como true, a marca d'água é incorporada em arquivos de áudio dos formatos compatíveis (wav/mp3/opus).
Valor padrão: false.
Apenas qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash, cosyvoice-v3-flash, cosyvoice-v3-plus e cosyvoice-v2 oferecem suporte a este recurso.
aigc_propagatorstring(optional)
Define o campo ContentPropagator na marca d'água AIGC, identificando o propagador do conteúdo. Tem efeito apenas quando enable_aigc_tag é true.
Valor padrão: UID da Alibaba Cloud.
Apenas qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash, cosyvoice-v3-flash, cosyvoice-v3-plus e cosyvoice-v2 oferecem suporte a este recurso.
aigc_propagate_idstring(optional)
Define o campo PropagateID na marca d'água AIGC, identificando exclusivamente uma ação de propagação específica. Tem efeito apenas quando enable_aigc_tag é true.
Valor padrão: ID da solicitação atual de síntese de fala.
Apenas qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash, cosyvoice-v3-flash, cosyvoice-v3-plus e cosyvoice-v2 oferecem suporte a este recurso.
hot_fixobject(optional)
Configura correções de pronúncia e substituições de texto aplicadas antes da síntese.
This feature isn't supported by qwen-audio-3.0-tts-plus, qwen-audio-3.0-tts-flash, or cosyvoice-v2.
Parâmetros:
- pronunciation: Pronúncia personalizada. Especifica anotações pinyin para palavras a fim de corrigir pronúncias padrão imprecisas.
- replace: Substituição de texto. Substitui palavras especificadas pelo texto de destino antes da síntese. O texto substituído é usado como entrada real da síntese.
Exemplo:
"hot_fix": {
"pronunciation": [
{"weather": "tian1 qi4"}
],
"replace": [
{"today": "gold day"}
]
}
enable_markdown_filterboolean(optional)
ImportanteApenas vozes clonadas de cosyvoice-v3-flash oferecem suporte a este recurso.
Define se a filtragem de Markdown deve ser ativada. Quando ativada, o sistema remove automaticamente os símbolos de marcação Markdown do texto de entrada antes da síntese, evitando que sejam lidos em voz alta.
Valor padrão: false.
Valores válidos:
- true: Ativar filtragem de Markdown
- false: Desativar filtragem de Markdown