Tous les produits
Search
Centre de documentation

:Avant de commencer

Dernière mise à jour :Aug 09, 2026

Pour utiliser Intelligent Speech Interaction, consultez le guide de démarrage rapide afin de prendre en main le service. Nous vous recommandons ensuite de lire les rubriques suivantes dans l'ordre pour obtenir des informations actualisées sur Intelligent Speech Interaction.

Rubrique

Description

Concepts

Présente les termes et concepts liés à Intelligent Speech Interaction.

Gérer les projets

Explique comment créer des projets et définir leurs paramètres dans la console Intelligent Speech Interaction.

Obtenir un jeton d'accès

Décrit la procédure d'obtention d'un jeton d'accès. Vous devez disposer d'un jeton d'accès avant d'appeler les services Intelligent Speech Interaction.

Appeler les services Intelligent Speech Interaction

Utiliser les outils de personnalisation pour la reconnaissance vocale

Indique comment utiliser les outils de personnalisation pour améliorer l'efficacité de la reconnaissance vocale.

Différences entre les divers services Intelligent Speech Interaction

Service

Performances en temps réel

Fonctionnalité

Scénario

Format de codage audio

Méthode d'appel

Quota gratuit

Achat

Reconnaissance de phrases courtes

Reconnaissance en temps réel.

Reconnaît les énoncés courts d'une durée inférieure ou égale à 1 minute.

Scénarios tels que la recherche vocale dans les applications, les lignes directes du service client, les conversations de chat et le contrôle par commande vocale

Modulation par impulsions codées (PCM) pour les fichiers PCM ou WAV non compressés et Opus

Java/C++/Android/iOS

Un maximum de deux demandes d'appel simultanées

Forfait de ressources distinct

Reconnaissance vocale en temps réel

Reconnaissance en temps réel.

Reconnaît les flux de données vocales de longue durée.

Scénarios de reconnaissance vocale ininterrompue, tels que les discours en conférence et la diffusion en direct

PCM pour les fichiers PCM ou WAV non compressés

Java/C++/Android/iOS

Un maximum de deux demandes d'appel simultanées

Forfait de ressources distinct

Synthèse vocale

Synthèse en temps réel.

Convertit en parole un texte contenant au maximum 300 caractères encodés en UTF-8.

Scénarios nécessitant une synthèse texte-parole

PCM, WAV et MP3

Java/C++/Android/iOS

Un maximum de deux demandes d'appel simultanées

Forfait de ressources distinct

Reconnaissance de fichiers d'enregistrement

Reconnaissance asynchrone. Après qu'un utilisateur d'essai gratuit a envoyé une demande de reconnaissance pour un fichier d'enregistrement, le serveur de reconnaissance traite le fichier et renvoie le résultat sous 24 heures. Pour un utilisateur payant, le résultat de la reconnaissance est renvoyé sous 6 heures.

Remarque

Cette règle ne s'applique pas si les fichiers d'enregistrement téléchargés en moins de 30 minutes totalisent plus de 500 heures. Si vous devez convertir ce volume de données, contactez le service commercial.

Reconnaît un fichier d'enregistrement dont la taille maximale est de 512 Mo.

Scénarios ne nécessitant pas de reconnaissance en temps réel

WAV et MP3 mono et stéréo

Java/C++/GO/.NET/Node.js/PHP/Python

Demandes d'appel pour la reconnaissance de fichiers d'enregistrement d'une durée maximale de 2 heures par jour calendaire

Forfait de ressources distinct

Synthèse vocale de textes longs

Synthèse asynchrone.

Convertit des données textuelles contenant des milliers ou des dizaines de milliers de caractères en données audio binaires.

Scénarios tels que la lecture de romans et d'articles

PCM, WAV et MP3

JAVA/C++/RESTful API

Aucune version d'essai disponible

Forfait de ressources distinct

Important
  • À l'exception du service de reconnaissance de fichiers d'enregistrement, les autres services d'interaction vocale d'Intelligent Speech Interaction prennent uniquement en charge les données vocales mono.

  • Intelligent Speech Interaction prend uniquement en charge les fichiers audio 16 bits échantillonnés à 8 kHz ou 16 kHz.