Le service de reconnaissance vocale en temps réel Qwen-Audio-3.0-ASR-Flash-Streaming/Fun-ASR-Realtime transmet des événements côté serveur au client via WebSocket. Cette rubrique décrit les structures de données et les champs des quatre types d'événements suivants : task-started, result-generated, task-finished et task-failed.
Guide d'utilisation : Pour la description des modèles et les conseils de sélection, consultez Speech-to-text.
Flux d'interaction des événements : Pour comprendre la séquence d'interaction des événements, reportez-vous à WebSocket API.
task-started
Description : La tâche a démarré avec succès. Le client peut commencer à envoyer des données audio.
header | |
payload Toujours |
result-generated
Description : Résultat de la reconnaissance. Comprend les résultats intermédiaires (sentence_end=false) et finaux (sentence_end=true). Le premier résultat intermédiaire d'une nouvelle phrase contient sentence_begin=true.
header | Sentence-start result:Final result: |
payload |
task-finished
Description : La tâche s'est terminée normalement. Vous pouvez fermer la connexion ou la réutiliser.
header | |
payload Champ ignorable. Valeur généralement |
task-failed
Description : Échec de la tâche. La connexion est fermée et ne peut pas être réutilisée.
header | |
payload Toujours |