formatstring(Required)
O formato de áudio.
Valores válidos:
pcm
wav
mp3
opus
speex
aac
amr
Importanteopus/speex: Devem usar encapsulamento Ogg.
wav: Deve usar codificação PCM.
amr: Apenas o tipo AMR-NB é suportado.
sample_rateinteger(Required)
A taxa de amostragem, em Hz.
Valores válidos: modelos de 8 kHz suportam apenas 8000 Hz; outros modelos suportam qualquer taxa de amostragem.
vocabulary_idstring(Optional)
O ID de uma lista de palavras-chave pré-compilada.
Gere esse ID antecipadamente chamando a API de criação de lista de palavras-chave. Passe o ID durante o reconhecimento para usar as palavras-chave da lista.
Indicado para cenários onde o vocabulário é conhecido e relativamente estável, e onde há necessidade de reutilizar a mesma lista de palavras entre requisições.
Para detalhes de uso, consulte Precompiled hotwords.
vocabularyobject(Optional)
Palavras-chave instantâneas.
Passadas como pares chave-valor, onde a chave é o texto da palavra-chave (string) e o valor é o peso da palavra-chave (integer). Não é necessário criar uma lista de palavras-chave antecipadamente. O peso varia de [1, 5] ou é definido como 50: um valor em [1, 5] aumenta a probabilidade de o modelo gerar a palavra conforme o valor cresce; um valor de 50 designa uma super palavra-chave, o que melhora significativamente o recall, mas o número de super palavras-chave não pode exceder 50.
Recomendado para otimização temporária de palavras-chave no nível da sessão.
Quando configuradas juntamente com palavras-chave pré-compiladas, apenas as palavras-chave instantâneas terão efeito. Para detalhes de uso, consulte Instant hotwords.
ImportanteApenas qwen-audio-3.0-asr-flash-streaming suporta palavras-chave instantâneas.
language_hintsarray[string](Optional)
O idioma do áudio a ser reconhecido. Não há valor padrão; se não for definido, o modelo detecta o idioma automaticamente.
Para a série de modelos Qwen-Audio-3.0-ASR-Flash-Streaming, é possível definir até 4 valores; se você definir mais de 4, apenas os primeiros 4 terão efeito. Para a série de modelos Fun-ASR-Realtime, é possível definir apenas 1 valor; se você definir vários valores, apenas o primeiro terá efeito.
Clique em visualizar os códigos de idioma suportados
-
qwen-audio-3.0-asr-flash-streaming, fun-asr-realtime, fun-asr-realtime-2025-11-07:
- zh: Chinês
- en: Inglês
- ja: Japonês
- ko: Coreano
- vi: Vietnamita
- th: Tailandês
- id: Indonésio
- ms: Malaio
- tl: Filipino
- hi: Hindi
- ar: Árabe
- fr: Francês
- de: Alemão
- es: Espanhol
- pt: Português
- ru: Russo
- it: Italiano
- nl: Holandês
- sv: Sueco
- da: Dinamarquês
- fi: Finlandês
- no: Norueguês
- el: Grego
- pl: Polonês
- cs: Tcheco
- hu: Húngaro
- ro: Romeno
- bg: Búlgaro
- hr: Croata
- sk: Eslovaco
-
fun-asr-realtime-2026-02-28:
- zh: Chinês
- en: Inglês
- ja: Japonês
-
fun-asr-realtime-2025-09-15:
-
fun-asr-flash-8k-realtime, fun-asr-flash-8k-realtime-2026-01-28:
semantic_punctuation_enabledboolean(Optional)
Se deve ativar a segmentação semântica.
Valor padrão: false.
- true: Ativa a segmentação semântica e desativa a segmentação VAD.
- false (padrão): Ativa a segmentação VAD e desativa a segmentação semântica.
A segmentação semântica é mais precisa e adequada para cenários de transcrição de reuniões. A segmentação VAD (Detecção de Atividade de Voz) possui menor latência e é mais indicada para cenários interativos.
max_sentence_silenceinteger(Optional)
ImportanteTem efeito apenas quando semantic_punctuation_enabled é false.
O limiar de silêncio VAD para segmentação, em ms. Quando o silêncio após um segmento de fala excede esse limiar, o sistema determina que a frase terminou.
Valor padrão: 1300.
Valores válidos: [200, 6000].
multi_threshold_mode_enabledboolean(Optional)
ImportanteTem efeito apenas quando semantic_punctuation_enabled é false.
Se deve ativar o modo de múltiplos limiares. Quando ativado, evita que os segmentos VAD fiquem muito longos.
Valor padrão: false.
heartbeatboolean(Optional)
Se deve ativar pacotes de heartbeat.
Valor padrão: false.
- true: Mantém a conexão com o servidor ativa mesmo quando áudio silencioso é enviado continuamente.
- false (padrão): A conexão é encerrada por timeout após 60 segundos, mesmo se áudio silencioso for enviado continuamente.
Áudio silencioso refere-se a conteúdo em um arquivo de áudio ou fluxo de dados que não contém sinal sonoro. É possível gerar áudio silencioso de várias formas, como usando softwares de edição de áudio como Audacity ou Adobe Audition, ou utilizando uma ferramenta de linha de comando como FFmpeg.
speech_noise_thresholdfloat(Optional)
O limiar para distinguir fala de ruído, usado para ajustar a sensibilidade da Detecção de Atividade de Voz (VAD).
Valores válidos: [-1,0, 1,0].
Descrições dos valores:
- Quanto mais próximo o valor estiver de -1: O limiar de ruído diminui, tornando mais provável que ruídos sejam reconhecidos como fala, o que pode resultar na transcrição de mais ruído.
- Quanto mais próximo o valor estiver de +1: O limiar de ruído aumenta, tornando mais provável que a fala seja erroneamente classificada como ruído, o que pode filtrar parte da fala.
Este é um parâmetro de configuração avançado. Ajustá-lo pode afetar significativamente os resultados do reconhecimento. Recomendações:
- Teste e valide minuciosamente os resultados antes de ajustar.
- Faça ajustes em pequenos incrementos com base no ambiente de áudio real (recomenda-se um passo de 0,1).
special_word_filter string(Optional)
Especifica as palavras sensíveis a serem processadas durante o reconhecimento de fala e permite definir diferentes métodos de processamento para cada palavra. Para mais detalhes, consulte Sensitive word filtering.