Tous les produits
Search
Centre de documentation

Intelligent Speech Interaction:Language model customization

Dernière mise à jour :Aug 09, 2026

Alibaba Cloud Intelligent Speech Interaction (ISI) propose des modèles de reconnaissance vocale pré-entraînés pour les scénarios généralistes, l'éducation, la justice et les soins de santé. Si vos besoins en reconnaissance vocale dépassent le cadre de ces modèles ou si vous souhaitez personnaliser un modèle standard existant, utilisez la fonctionnalité de personnalisation du modèle de langage pour entraîner un modèle avec vos propres données textuelles métier.

Quand utiliser la personnalisation du modèle de langage

Les modèles pré-entraînés gèrent efficacement le langage courant, mais reconnaissent souvent mal les termes spécifiques à un domaine. Par exemple, une application qui transcrit des consultations médicales peut fréquemment confondre les noms de médicaments, les procédures ou les termes cliniques lorsqu'elle utilise un modèle généraliste. L'entraînement d'un modèle de langage personnalisé sur vos textes sectoriels permet au modèle d'apprendre le vocabulaire et le contexte propres à votre domaine, ce qui améliore la précision de reconnaissance des termes spécialisés et des mots récurrents.

Recourez à la personnalisation du modèle de langage dans les cas suivants :

  • Votre application traite des discours spécifiques à un domaine (médical ou industriel).

  • Les modèles de scénario pré-entraînés ne reconnaissent pas vos noms de produits, vos marques ou votre terminologie spécialisée.

  • Vous devez améliorer la précision de reconnaissance des mots critiques pour l'activité et récurrents.

Fonctionnement

Importez des données textuelles liées à votre activité sur la plateforme d'auto-apprentissage. Sélectionnez un modèle de base correspondant à votre scénario, puis lancez l'entraînement. La plateforme apprend le vocabulaire et le contexte à partir de vos données. Une fois l'entraînement terminé, publiez le modèle afin qu'il s'applique à vos requêtes de reconnaissance vocale.

Il existe deux méthodes pour créer et appliquer un modèle d'auto-apprentissage :

Entraîner un modèle : exemple de bout en bout

Cet exemple illustre la procédure d'entraînement d'un modèle de langage à l'aide d'une brève présentation d'Alibaba. Télécharger les exemples de données d'entraînement.

Préparer vos données d'entraînement

Les données d'entraînement correspondent au texte utilisé pour enseigner au modèle le vocabulaire et le contexte de votre domaine. La qualité et le format de ces données influencent directement la précision de la reconnaissance.

Exigences de format :

  • Texte brut, une phrase par ligne.

  • Utilisez la ponctuation pour séparer les phrases.

Recommandations relatives au volume de données :

  • Si un mot ou une expression est critique pour votre activité, incluez plusieurs phrases le contenant afin de renforcer sa reconnaissance.

Voici à quoi ressemblent les exemples de données d'entraînement :

In September 1999, the 18 founders led by Jack Ma officially established Alibaba Group in an apartment in Hangzhou. The group's first website was Alibaba, an English-language global wholesale marketplace.
In October 1999, Alibaba Group raised five million USD from several investment institutions.
In October 1999, Alibaba Group raised five million USD from several investment institutions.
In January 2000, Alibaba Group raised twenty million USD from several investment institutions, including SoftBank.
In January 2000, Alibaba Group raised twenty million USD from several investment institutions, including SoftBank.
In September 2000, Alibaba Group held the first West Lake Summit on Swordmanship, gathering business and opinion leaders from the Internet industry to discuss important topics.

Les phrases clés apparaissent plusieurs fois. La répétition des phrases contenant des mots critiques pour l'activité, tels que « financing » et « the Internet », renforce la capacité du modèle à reconnaître ces termes.

Entraîner le modèle

  1. Sélectionnez un modèle de base correspondant à votre scénario. Cet exemple utilise le modèle généraliste.

  2. Formatez vos données d'entraînement en texte brut, avec une phrase par ligne et une ponctuation entre les phrases.

  3. Soumettez vos données textuelles sur la plateforme d'auto-apprentissage et lancez l'entraînement. Une fois l'entraînement terminé, le modèle reconnaît le vocabulaire issu de vos données d'entraînement et offre de meilleurs résultats de reconnaissance pour votre domaine.