O service de reconhecimento de fala em tempo real Qwen-Audio-3.0-ASR-Flash-Streaming/Fun-ASR-Realtime envia eventos do lado do servidor ao cliente via WebSocket. Este tópico descreve as estruturas de dados e os campos dos quatro tipos de eventos: task-started, result-generated, task-finished e task-failed.
Guia do usuário: Para descrições dos modelos e orientações de seleção, consulte Speech-to-text.
Fluxo de interação de eventos: Para entender a sequência de interação dos eventos, consulte WebSocket API.
task-started
Descrição: A tarefa foi iniciada com sucesso. O cliente pode começar a enviar dados de áudio.
header | |
payload Sempre |
result-generated
Descrição: Resultado do reconhecimento. Inclui resultados intermediários (sentence_end=false) e finais (sentence_end=true). O primeiro resultado intermediário de uma nova frase contém sentence_begin=true.
header | Sentence-start result:Final result: |
payload |
task-finished
Descrição: A tarefa terminou normalmente. Feche a conexão ou reutilize-a.
header | |
payload Campo ignorável. Normalmente |
task-failed
Descrição: Falha na tarefa. A conexão foi fechada e não pode ser reutilizada.
header | |
payload Sempre |