Pour utiliser Intelligent Speech Interaction, consultez le guide de démarrage rapide afin de prendre en main le service. Nous vous recommandons ensuite de lire les rubriques suivantes dans l'ordre pour obtenir des informations actualisées sur Intelligent Speech Interaction.
Rubrique | Description |
|---|---|
Présente les termes et concepts liés à Intelligent Speech Interaction. | |
Explique comment créer des projets et définir leurs paramètres dans la console Intelligent Speech Interaction. | |
Décrit la procédure d'obtention d'un jeton d'accès. Vous devez disposer d'un jeton d'accès avant d'appeler les services Intelligent Speech Interaction. | |
Appeler les services Intelligent Speech Interaction | |
Utiliser les outils de personnalisation pour la reconnaissance vocale | Indique comment utiliser les outils de personnalisation pour améliorer l'efficacité de la reconnaissance vocale. |
Différences entre les divers services Intelligent Speech Interaction
Service | Performances en temps réel | Fonctionnalité | Scénario | Format de codage audio | Méthode d'appel | Quota gratuit | Achat |
|---|---|---|---|---|---|---|---|
Reconnaissance de phrases courtes | Reconnaissance en temps réel. | Reconnaît les énoncés courts d'une durée inférieure ou égale à 1 minute. | Scénarios tels que la recherche vocale dans les applications, les lignes directes du service client, les conversations de chat et le contrôle par commande vocale | Modulation par impulsions codées (PCM) pour les fichiers PCM ou WAV non compressés et Opus | Java/C++/Android/iOS | Un maximum de deux demandes d'appel simultanées | Forfait de ressources distinct |
Reconnaissance vocale en temps réel | Reconnaissance en temps réel. | Reconnaît les flux de données vocales de longue durée. | Scénarios de reconnaissance vocale ininterrompue, tels que les discours en conférence et la diffusion en direct | PCM pour les fichiers PCM ou WAV non compressés | Java/C++/Android/iOS | Un maximum de deux demandes d'appel simultanées | Forfait de ressources distinct |
Synthèse vocale | Synthèse en temps réel. | Convertit en parole un texte contenant au maximum 300 caractères encodés en UTF-8. | Scénarios nécessitant une synthèse texte-parole | PCM, WAV et MP3 | Java/C++/Android/iOS | Un maximum de deux demandes d'appel simultanées | Forfait de ressources distinct |
Reconnaissance de fichiers d'enregistrement | Reconnaissance asynchrone. Après qu'un utilisateur d'essai gratuit a envoyé une demande de reconnaissance pour un fichier d'enregistrement, le serveur de reconnaissance traite le fichier et renvoie le résultat sous 24 heures. Pour un utilisateur payant, le résultat de la reconnaissance est renvoyé sous 6 heures. Remarque Cette règle ne s'applique pas si les fichiers d'enregistrement téléchargés en moins de 30 minutes totalisent plus de 500 heures. Si vous devez convertir ce volume de données, contactez le service commercial. | Reconnaît un fichier d'enregistrement dont la taille maximale est de 512 Mo. | Scénarios ne nécessitant pas de reconnaissance en temps réel | WAV et MP3 mono et stéréo | Java/C++/GO/.NET/Node.js/PHP/Python | Demandes d'appel pour la reconnaissance de fichiers d'enregistrement d'une durée maximale de 2 heures par jour calendaire | Forfait de ressources distinct |
Synthèse vocale de textes longs | Synthèse asynchrone. | Convertit des données textuelles contenant des milliers ou des dizaines de milliers de caractères en données audio binaires. | Scénarios tels que la lecture de romans et d'articles | PCM, WAV et MP3 | JAVA/C++/RESTful API | Aucune version d'essai disponible | Forfait de ressources distinct |
À l'exception du service de reconnaissance de fichiers d'enregistrement, les autres services d'interaction vocale d'Intelligent Speech Interaction prennent uniquement en charge les données vocales mono.
Intelligent Speech Interaction prend uniquement en charge les fichiers audio 16 bits échantillonnés à 8 kHz ou 16 kHz.