Cette rubrique détaille les paramètres et le fonctionnement de l'API HTTP de reconnaissance vocale en différé Qwen-Audio-3.0-ASR-Flash/Fun-ASR-Flash.
Guide d'utilisation : Reconnaissance vocale en différé. Pour connaître les prérequis d'entrée (formats audio pris en charge, limites de taille de fichier et de durée), consultez Spécifications audio.
ImportantCette fonctionnalité ne prend pas en charge les appels SDK.
Endpoints du service
Singapore
POST https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation
Remplacez {WorkspaceId} par votre ID d'espace de travail réel.
China (Beijing)
POST https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation
Remplacez {WorkspaceId} par votre ID d'espace de travail réel.
ImportantAlibaba Cloud Model Studio a publié des domaines spécifiques à chaque espace de travail pour les régions China (Beijing) et Singapore. Ces nouveaux domaines dédiés offrent des performances supérieures et une stabilité accrue pour les requêtes d'inférence. Nous vous recommandons de migrer vers ces nouveaux domaines :
- China (Beijing) : passez de
dashscope.aliyuncs.comà{WorkspaceId}.cn-beijing.maas.aliyuncs.com - Singapore : passez de
dashscope-intl.aliyuncs.comà{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com
Remplacez {WorkspaceId} par votre ID d'espace de travail réel. Les domaines existants restent pleinement opérationnels.
En-têtes de requête
Paramètre | Type | Obligatoire | Description |
|---|---|---|---|
Authorization | string | Oui | Jeton d'authentification au format |
Content-Type | string | Oui | Type MIME du corps de la requête. Valeur fixe : |
X-DashScope-SSE | string | Oui | Détermine si les résultats sont renvoyés sous forme de flux SSE. Définissez ce paramètre sur |
Corps de la requête | Les exemples suivants utilisent la configuration de la région Singapore. Remplacez « {WorkspaceId} » par votre ID d'espace de travail réel. La configuration varie selon les régions, et la clé API de la région Singapore diffère de celle de la région Beijing. Sans streamingAvec streamingAvec contexte - sans streamingAvec contexte - avec streamingBase64Vous pouvez transmettre des données encodées en Base64 (Data URL) au format
Mots-clés intégrés |
model Nom du modèle. Les séries Qwen-Audio-3.0-ASR-Flash et Fun-ASR-Flash sont prises en charge. Pour plus de détails, consultez Modèles et régions pris en charge. | |
input Informations d'entrée. | |
parameters Paramètres du modèle. RemarqueLa correction de texte est désactivée par défaut et n'est pas encore disponible. Correction de texte : lors de la transcription vocale, le modèle supprime automatiquement les mots de remplissage inutiles et les répétitions dues au bégaiement, gère les auto-corrections effectuées pendant la parole, fluidifie les expressions familières et normalise la ponctuation ainsi que le formatage du texte. Il en résulte une sortie plus concise, fluide et lisible, tout en préservant autant que possible l'intention originale de l'utilisateur et les informations clés. |
Corps de la réponse | Sans streamingAvec streamingLorsque vous définissez Exemple de réponse : |
request_id Identifiant unique de cette requête. | |
output Résultat de sortie. | |
usage Informations d'utilisation. Renvoyé uniquement lorsque Propriétés duration Durée audio traitée, en secondes. |
Logique de traitement des résultats de streaming SSE
En mode streaming, le client doit gérer les éléments suivants :
- Pour chaque événement SSE reçu, analysez le JSON contenu dans le champ
data. - Utilisez
output.sentence.sentence_endpour déterminer si la phrase en cours est terminée. Lorsque cette valeur esttrue, la reconnaissance de la phrase est achevée, les horodatages au niveau des mots sont stabilisés et le résultat peut être considéré comme définitif. Lorsque cette valeur estfalse, la reconnaissance est toujours en cours, et le texte ainsi que les horodatages peuvent être mis à jour dans les événements suivants. - Les informations
usagene sont renvoyées que dans l'événement de fin de phrase ; elles permettent de mesurer la durée audio traitée.