Tous les produits
Search
Centre de documentation

Intelligent Speech Interaction:Concepts de base

Dernière mise à jour :Aug 27, 2026

Cette rubrique présente les concepts clés d'Intelligent Speech Interaction pour expliquer le fonctionnement du service.

Fréquence d'échantillonnage

La fréquence d'échantillonnage audio correspond au nombre d'échantillons d'un signal sonore qu'un dispositif d'enregistrement capture par seconde. Plus la fréquence est élevée, plus la restitution du son est fidèle et naturelle.

La reconnaissance vocale prend en charge les fréquences d'échantillonnage de 16 000 Hz et de 8 000 Hz. L'audio téléphonique utilise généralement 8 000 Hz, tandis que les autres types d'audio utilisent généralement 16 000 Hz.

Si la fréquence d'échantillonnage audio dépasse 16 000 Hz, convertissez-la à 16 000 Hz avant d'envoyer l'audio au service de reconnaissance vocale. Ne convertissez pas l'audio de 8 000 Hz en 16 000 Hz. Sélectionnez plutôt un modèle prenant en charge une fréquence d'échantillonnage de 8 000 Hz pour le projet.

Taille d'échantillon

La taille d'échantillon, également appelée profondeur de bits, représente le nombre de bits utilisés pour quantifier l'amplitude de chaque échantillon audio. Une taille d'échantillon plus grande offre une résolution supérieure.

La reconnaissance vocale utilise couramment des échantillons little-endian de 16 bits. Chaque échantillon occupe 2 octets et représente 1/16 000e de seconde pour un audio de 16 000 Hz. Une taille d'échantillon de 2 octets répond aux exigences de profondeur de bits pour un audio de qualité CD.

Chaque échantillon enregistre une valeur d'amplitude. La taille d'échantillon détermine la précision :

  • 1 octet (8 bits) représente 256 niveaux d'amplitude.

  • 2 octets (16 bits) représentent 65 536 niveaux d'amplitude.

Codage audio

Le codage audio définit la manière dont les données audio sont stockées et transmises. Un format de codage audio diffère d'un format de fichier audio. Par exemple, l'en-tête d'un fichier WAV spécifie le codage audio, et les données audio peuvent utiliser PCM, AMR ou un autre codage pris en charge.

Important

Avant d'appeler un service Intelligent Speech Interaction, assurez-vous que le service prend en charge le codage audio.

Canaux audio

Un canal audio représente un signal audio indépendant capturé à une position spatiale spécifique. Le nombre de canaux correspond donc au nombre de sources audio enregistrées. L'audio est généralement enregistré en mono ou en stéréo.

Important

À l'exception de la reconnaissance de fichiers d'enregistrement, les services Intelligent Speech Interaction prennent en charge uniquement l'audio mono. Convertissez l'audio stéréo ou multicanaux en mono avant de l'envoyer au service.

Normalisation inverse du texte

La normalisation inverse du texte (ITN) convertit les nombres, les montants monétaires, les dates et les adresses présents dans la sortie de la reconnaissance vocale en formes standardisées et lisibles. Le tableau suivant fournit des exemples.

Texte parlé

Résultat de reconnaissance avec ITN

Vingt pour cent

20 %

Onze mai

11 mai

Veuillez composer le un un zéro

Veuillez composer le 110

Appkey

Chaque projet créé dans la console de gestion d'Intelligent Speech Interaction possède un identifiant unique appelé Appkey. Incluez l'Appkey dans chaque appel de service afin que le service puisse charger la configuration du projet.

Différents cas d'utilisation, tels que les appels de centre de contact et les méthodes de saisie mobile, nécessitent différentes capacités vocales. Configurez chaque projet pour son cas d'utilisation prévu afin d'obtenir les meilleurs résultats.

Paire AccessKey

Une paire AccessKey authentifie les appels programmatiques aux API Alibaba Cloud. Créez et consultez une paire AccessKey sur la page Gestion des AccessKey.

Une paire AccessKey se compose d'un AccessKey ID et d'un AccessKey secret. L'AccessKey ID identifie l'appelant, et l'AccessKey secret sert à signer les paramètres de requête afin d'empêcher toute falsification. Les deux valeurs doivent être utilisées conjointement. Traitez l'AccessKey secret comme un mot de passe et ne le divulguez jamais.

Jeton d'accès

Un jeton d'accès authentifie les appels aux services Intelligent Speech Interaction et reste valide pendant une période limitée. Générez-le à l'aide d'un AccessKey ID et d'un AccessKey secret.

Remarque

Pour les appels depuis des appareils mobiles et d'autres clients, générez le jeton sur un serveur et envoyez-le au client. Cela évite l'exposition de la paire AccessKey.

Résultats intermédiaires

Configurez la renvoi des résultats intermédiaires par la reconnaissance vocale :

  • Lorsque la valeur est définie sur false, le service renvoie un résultat complet après avoir reconnu l'intégralité de l'énoncé.

  • Lorsque la valeur est définie sur true, le service renvoie des résultats intermédiaires pendant que l'utilisateur parle, suivis d'un résultat final complet.

Par exemple, si le résultat final est « Bonjour et bienvenue sur Alibaba Cloud », l'activation des résultats intermédiaires peut renvoyer les cinq résultats suivants pendant que l'utilisateur parle :

Hello
Hello and
Hello and welcome
Hello and welcome to
Hello and welcome to Alibaba Cloud
Remarque
  • Un résultat intermédiaire peut être révisé dans une réponse ultérieure.

  • La quantité de texte ajoutée entre les résultats intermédiaires varie. Chaque réponse n'ajoute pas nécessairement un seul caractère.

task_id

Chaque requête de service vocal possède un task_id unique généré automatiquement par le SDK. Utilisez le task_id pour le dépannage des requêtes.