Tous les produits
Search
Centre de documentation

Alibaba Cloud Model Studio:Speech-to-text

Dernière mise à jour :Sep 07, 2026

Choisissez le modèle adapté à la reconnaissance vocale en temps réel ou sur fichier.

Migrer depuis des modèles propriétaires

Associez votre service Whisper, Deepgram ou Google ASR actuel à son équivalent Bailian.

Cas d'usage

Exemples de modèles propriétaires

Recommandation Bailian

Reconnaissance en temps réel

Deepgram Nova-3, Google Chirp 3

qwen-audio-3.0-asr-flash-streaming

Transcription hors ligne / sur fichier

OpenAI gpt-4o-transcribe, Whisper

qwen-audio-3.0-asr-flash-filetrans, qwen-audio-3.0-asr-flash

Utilisez les quatre « Critères de sélection » (temps réel ou hors ligne, terminologie métier, diarisation des locuteurs et reconnaissance des émotions) pour identifier le modèle approprié. Consultez ensuite la section « Modèles recommandés » pour les meilleurs choix par scénario, « Tous les modèles » pour la liste complète des versions par famille de modèles, et « Spécifications audio » pour les contraintes d'entrée. Les langues prises en charge (y compris les dialectes) figurent sous chaque famille de modèles dans la section « Tous les modèles ».

Critères de sélection

Évaluez quatre dimensions pour trouver le bon modèle.

Temps réel ou hors ligne ?

La reconnaissance en temps réel renvoie les résultats pendant que l'utilisateur parle. La reconnaissance hors ligne transcrit un fichier préenregistré une fois l'enregistrement terminé.

  • Temps réel (reconnaissance en streaming) : utilise une connexion WebSocket pour diffuser le flux audio entrant et le texte sortant. Ce mode convient au sous-titrage en direct, aux assistants vocaux et à la transcription de réunions. Modèle recommandé : qwen-audio-3.0-asr-flash-streaming (mots-clés, contexte de prompt, multilingue avec dialectes).
  • Hors ligne (transcription de fichiers) : recourt à une API HTTP pour soumettre des fichiers audio et récupérer les résultats de transcription. Cette approche s'applique aux enregistrements de centres d'appels, aux podcasts et aux interviews. Modèle recommandé : qwen-audio-3.0-asr-flash-filetrans (mots-clés, contexte de prompt, diarisation des locuteurs).

Les séries de modèles Qwen-Audio-3.0-ASR-Flash-Streaming et Fun-ASR-Realtime prennent également en charge le protocole AOQ. Pour une intégration côté client privilégiant une latence stable, une résilience sur les réseaux faibles, ainsi qu'une suppression du bruit et une annulation de l'écho intégrées en full-duplex, privilégiez le protocole AOQ. Pour comparer les protocoles, consultez Présentation de l'API Realtime.

Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, ainsi que les modèles temps réel Fun-ASR et Qwen-ASR, sont compatibles avec le SDK DashScope (Java, Python). Tous les autres modèles nécessitent des appels directs via WebSocket ou API HTTP.

Pour une intégration en temps réel, consultez Reconnaissance vocale en temps réel. Pour une intégration hors ligne, reportez-vous à Reconnaissance vocale non temps réel.

Terminologie métier

Deux approches sont disponibles, classées par ordre de flexibilité :

  1. Injection de contexte via prompt : décrivez votre domaine dans le prompt système. Aucune configuration préalable n'est nécessaire, car le modèle s'adapte à chaque requête. Séries recommandées : Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans et Qwen-Audio-3.0-ASR-Flash.
  2. Mots-clés : fournissez une liste de vocabulaire pondérée. Séries recommandées : Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans et Qwen-Audio-3.0-ASR-Flash.

Diarisation des locuteurs

La série Qwen-Audio-3.0-ASR-Flash-Filetrans (qwen-audio-3.0-asr-flash-filetrans) et les modèles hors ligne Fun-ASR (fun-asr et fun-asr-mtl) prennent en charge la diarisation des locuteurs. Pour identifier qui a dit quoi, utilisez qwen-audio-3.0-asr-flash-filetrans.

Reconnaissance des émotions

Les modèles Qwen-ASR détectent les émotions en parallèle de la transcription. Modèles recommandés : qwen3-asr-flash-realtime (temps réel) ou qwen3-asr-flash-filetrans (hors ligne).

Modèles recommandés

Meilleurs choix pour les scénarios courants.

ID du modèle

Mode

API

Amélioration de la précision

Reconnaissance des émotions

Diarisation des locuteurs

Langues

Durée/taille audio maximale

qwen-audio-3.0-asr-flash-streaming

Temps réel

WebSocket

Mots-clés, contexte de prompt

Non pris en charge

Non pris en charge

Multilingue avec dialectes

Illimitée

qwen-audio-3.0-asr-flash-filetrans

Hors ligne

HTTP

Mots-clés, contexte de prompt

Non pris en charge

Pris en charge

Multilingue avec dialectes

12 heures / 2 Go

Tous les modèles

Qwen-Audio-3.0-ASR-Flash-Streaming

ID du modèle

Mode

API

Amélioration de la précision

Reconnaissance des émotions

Diarisation des locuteurs

Langues

Durée/taille audio maximale

qwen-audio-3.0-asr-flash-streaming

Temps réel

WebSocket

Mots-clés, contexte de prompt

Non pris en charge

Non pris en charge

Multilingue avec dialectes

Illimitée

Langues prises en charge (par version) :

  • qwen-audio-3.0-asr-flash-streaming : chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin ; ainsi que les accents régionaux incluant les plaines centrales, le sud-ouest, ji-lu, jianghuai, lan-yin, jiao-liao, nord-est, Pékin et Hong Kong/Taïwan — couvrant les accents du Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu et Ningxia), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque

Qwen-Audio-3.0-ASR-Flash-Filetrans

ID du modèle

Mode

API

Amélioration de la précision

Reconnaissance des émotions

Diarisation des locuteurs

Langues

Durée/taille audio maximale

qwen-audio-3.0-asr-flash-filetrans

Hors ligne

HTTP

Mots-clés, contexte de prompt

Non pris en charge

Pris en charge

Multilingue avec dialectes

12 heures / 2 Go

Langues prises en charge (par version) :

  • qwen-audio-3.0-asr-flash-filetrans : chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin ; ainsi que les accents régionaux incluant les plaines centrales, le sud-ouest, ji-lu, jianghuai, lan-yin, jiao-liao, nord-est, Pékin et Hong Kong/Taïwan — couvrant les accents du Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu et Ningxia), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque

Qwen-Audio-3.0-ASR-Flash

ID du modèle

Mode

API

Amélioration de la précision

Reconnaissance des émotions

Diarisation des locuteurs

Langues

Durée/taille audio maximale

qwen-audio-3.0-asr-flash

Hors ligne

HTTP

Mots-clés, contexte de prompt

Non pris en charge

Non pris en charge

Multilingue avec dialectes

5 minutes / 2 Go

Langues prises en charge (par version) :

  • qwen-audio-3.0-asr-flash : chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin ; ainsi que les accents régionaux incluant les plaines centrales, le sud-ouest, ji-lu, jianghuai, lan-yin, jiao-liao, nord-est, Pékin et Hong Kong/Taïwan — couvrant les accents du Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu et Ningxia), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque

Fun-ASR

ID du modèle

Mode

API

Amélioration de la précision

Reconnaissance des émotions

Diarisation des locuteurs

Langues

Durée/taille audio maximale

fun-asr-realtime

Temps réel

WebSocket

Mots-clés

Non pris en charge

Non pris en charge

Chinois, anglais, japonais et dialectes

Illimitée

fun-asr-realtime-2026-02-28

Temps réel

WebSocket

Mots-clés

Non pris en charge

Non pris en charge

Chinois, anglais, japonais et dialectes

Illimitée

fun-asr-realtime-2025-11-07

Temps réel

WebSocket

Mots-clés

Non pris en charge

Non pris en charge

Chinois, anglais, japonais et dialectes

Illimitée

fun-asr-realtime-2025-09-15

Temps réel

WebSocket

Mots-clés

Non pris en charge

Non pris en charge

Chinois, anglais

Illimitée

fun-asr-flash-8k-realtime

Temps réel

WebSocket

Mots-clés

Non pris en charge

Non pris en charge

Chinois

Illimitée

fun-asr-flash-8k-realtime-2026-01-28

Temps réel

WebSocket

Mots-clés

Non pris en charge

Non pris en charge

Chinois

Illimitée

fun-asr

Hors ligne

HTTP

Mots-clés

Non pris en charge

Pris en charge

Multilingue avec dialectes

12 heures / 2 Go

fun-asr-flash-2026-06-15

Hors ligne

HTTP

Contexte de prompt

Non pris en charge

Non pris en charge

Multilingue avec dialectes

5 minutes / 2 Go

fun-asr-2025-11-07

Hors ligne

HTTP

Mots-clés

Non pris en charge

Pris en charge

Multilingue avec dialectes

12 heures / 2 Go

fun-asr-2025-08-25

Hors ligne

HTTP

Mots-clés

Non pris en charge

Pris en charge

Chinois, anglais

12 heures / 2 Go

fun-asr-mtl

Hors ligne

HTTP

Mots-clés

Non pris en charge

Pris en charge

Multilingue avec dialectes

12 heures / 2 Go

fun-asr-mtl-2025-08-25

Hors ligne

HTTP

Mots-clés

Non pris en charge

Pris en charge

Multilingue avec dialectes

12 heures / 2 Go

Langues prises en charge (par version) :

  • Versions principales de Fun-ASR-Realtime (fun-asr-realtime, fun-asr-realtime-2026-02-28, fun-asr-realtime-2025-11-07) : chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin ; ainsi que les accents régionaux incluant les plaines centrales, le sud-ouest, ji-lu, jianghuai, lan-yin, jiao-liao, nord-est, Pékin et Hong Kong/Taïwan — couvrant les accents du Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu et Ningxia), anglais, japonais
  • fun-asr-realtime-2025-09-15 : chinois (mandarin), anglais
  • Fun-ASR-Flash-Realtime(8K) (fun-asr-flash-8k-realtime, fun-asr-flash-8k-realtime-2026-01-28) : chinois
  • Versions principales de Fun-ASR (fun-asr, fun-asr-2025-11-07) : chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin ; ainsi que les accents régionaux incluant les plaines centrales, le sud-ouest, ji-lu, jianghuai, lan-yin, jiao-liao, nord-est, Pékin et Hong Kong/Taïwan — couvrant les accents du Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu et Ningxia), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque
  • Fun-ASR-Flash (fun-asr-flash-2026-06-15) : chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin ; ainsi que les accents régionaux incluant les plaines centrales, le sud-ouest, ji-lu, jianghuai, lan-yin, jiao-liao, nord-est, Pékin et Hong Kong/Taïwan — couvrant les accents du Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu et Ningxia), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque
  • fun-asr-2025-08-25 : chinois (mandarin), anglais
  • Fun-ASR(MTL) (fun-asr-mtl, fun-asr-mtl-2025-08-25) : chinois (mandarin, cantonais), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque

Qwen-ASR

ID du modèle

Mode

API

Amélioration de la précision

Reconnaissance des émotions

Diarisation des locuteurs

Langues

Durée/taille audio maximale

qwen3-asr-flash-realtime

Temps réel

WebSocket

Non pris en charge

Pris en charge

Non pris en charge

Multilingue avec dialectes

Illimitée

qwen3-asr-flash-realtime-2026-02-10

Temps réel

WebSocket

Non pris en charge

Pris en charge

Non pris en charge

Multilingue avec dialectes

Illimitée

qwen3-asr-flash-realtime-2025-10-27

Temps réel

WebSocket

Non pris en charge

Pris en charge

Non pris en charge

Multilingue avec dialectes

Illimitée

qwen3-asr-flash-filetrans

Hors ligne

HTTP

Non pris en charge

Pris en charge

Non pris en charge

Multilingue avec dialectes

12 heures / 2 Go

qwen3-asr-flash-filetrans-2025-11-17

Hors ligne

HTTP

Non pris en charge

Pris en charge

Non pris en charge

Multilingue avec dialectes

12 heures / 2 Go

qwen3-asr-flash

Hors ligne

HTTP (compatible OpenAI)

Non pris en charge

Pris en charge

Non pris en charge

Multilingue avec dialectes

5 minutes / 10 Mo

qwen3-asr-flash-2026-02-10

Hors ligne

HTTP (compatible OpenAI)

Non pris en charge

Pris en charge

Non pris en charge

Multilingue avec dialectes

5 minutes / 10 Mo

qwen3-asr-flash-2025-09-08

Hors ligne

HTTP (compatible OpenAI)

Non pris en charge

Pris en charge

Non pris en charge

Multilingue avec dialectes

5 minutes / 10 Mo

Langues prises en charge : tous les modèles Qwen-ASR (qwen3-asr-flash-realtime, qwen3-asr-flash-filetrans, qwen3-asr-flash et leurs versions snapshot) partagent la même liste de langues : chinois (mandarin, sichuanais, hokkien, wu, cantonais), anglais, japonais, allemand, coréen, russe, français, portugais, arabe, italien, espagnol, hindi, indonésien, thaï, turc, ukrainien, vietnamien, tchèque, danois, filipino, finnois, islandais, malais, norvégien, polonais, suédois.

Paraformer

Paraformer est une famille de modèles ASR d'ancienne génération. Migrez vers Fun-ASR ou Qwen-ASR dès que possible.

ID du modèle

API

Description

paraformer-realtime-v2

WebSocket

Reconnaissance en temps réel ; chinois, anglais, japonais, coréen, allemand, français, russe

paraformer-realtime-v1

WebSocket

Reconnaissance en temps réel ; chinois, anglais, japonais, coréen, allemand, français, russe

paraformer-realtime-8k-v2

WebSocket

Reconnaissance en temps réel pour la téléphonie 8 kHz ; chinois

paraformer-realtime-8k-v1

WebSocket

Reconnaissance en temps réel pour la téléphonie 8 kHz ; chinois

paraformer-v2

HTTP

Transcription de fichiers avec diarisation des locuteurs ; chinois, anglais, japonais, coréen, allemand, français, russe

paraformer-8k-v2

HTTP

Transcription de fichiers pour la téléphonie 8 kHz ; chinois

Langues prises en charge (par version) :

  • paraformer-realtime-v2, paraformer-v2 : chinois (mandarin, cantonais, wu, hokkien, nord-est, Gansu, Guizhou, Henan, Hubei, Hunan, Ningxia, Shanxi, Shaanxi, Shandong, Sichuan, Tianjin, Jiangxi, Yunnan, Shanghai), anglais, japonais, coréen, allemand, français, russe
  • paraformer-realtime-v1, paraformer-realtime-8k-v2, paraformer-realtime-8k-v1, paraformer-8k-v2 : chinois (mandarin)

Spécifications audio

Spécifications audio pour les modes temps réel et hors ligne. Pour les langues prises en charge, consultez la sous-section relative à la famille de modèles dans « Tous les modèles ».

Temps réel

ID du modèle

Méthode d'entrée

Format audio

Fréquence d'échantillonnage

Taille/durée

Qwen-Audio-3.0-ASR-Flash-Streaming (série qwen-audio-3.0-asr-flash-streaming)

Flux binaire

pcm, wav, mp3, opus, speex, aac, amr

Quelconque

Illimitée

Fun-ASR-Realtime / Fun-ASR-MTL-Realtime (séries fun-asr-realtime, fun-asr-mtl-realtime)

Flux binaire

pcm, wav, mp3, opus, speex, aac, amr

Quelconque

Illimitée

Fun-ASR-Flash-8K-Realtime (série fun-asr-flash-8k-realtime)

Flux binaire

Identique à Fun-ASR-Realtime

8 kHz

Illimitée

Qwen-ASR-Realtime (série qwen3-asr-flash-realtime)

Flux binaire

pcm, opus

8 kHz, 16 kHz

Illimitée

Paraformer-Realtime (paraformer-realtime-v2/v1, paraformer-realtime-8k-v2/v1)

Flux binaire

Identique à Fun-ASR-Realtime

paraformer-realtime-v2 toute fréquence ; paraformer-realtime-v1 16 kHz ; paraformer-realtime-8k-* 8 kHz

Illimitée

Tous les modèles temps réel acceptent uniquement une entrée mono (canal unique).

Hors ligne

ID du modèle

Méthode d'entrée

Format audio

Fréquence d'échantillonnage

Taille/durée du fichier

Qwen-Audio-3.0-ASR-Flash-Filetrans (série qwen-audio-3.0-asr-flash-filetrans)

URL de fichier accessible publiquement ; 1 URL par requête

aac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmv

Quelconque

≤ 2 Go ; ≤ 12 heures (≤ 2 heures recommandées lorsque la diarisation des locuteurs est activée)

Qwen-Audio-3.0-ASR-Flash (série qwen-audio-3.0-asr-flash)

URL / Base64 ; 1 fichier par requête

aac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmv

Quelconque

≤ 2 Go ; ≤ 5 minutes

Fun-ASR (séries fun-asr, fun-asr-mtl)

URL de fichier accessible publiquement ; 1 URL par requête

aac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmv

Quelconque

≤ 2 Go ; ≤ 12 heures (≤ 2 heures recommandées lorsque la diarisation des locuteurs est activée)

Fun-ASR-Flash (fun-asr-flash-2026-06-15)

URL / Base64 ; 1 fichier par requête

aac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmv

Quelconque

≤ 2 Go ; ≤ 5 minutes

Paraformer (paraformer-v2/v1, paraformer-mtl-v1, paraformer-8k-v2/v1)

Identique à Fun-ASR

Identique à Fun-ASR

paraformer-v2 toute fréquence ; paraformer-8k-* 8 kHz uniquement

Identique à Fun-ASR

Qwen3-ASR-Flash-Filetrans (série qwen3-asr-flash-filetrans)

URL de fichier accessible publiquement ; 1 URL par requête

aac, amr, avi, flac, flv, m4a, mkv, mov, mp3, mp4, mpeg, ogg, opus, wav, webm, wma, wmv

pcm nécessite 16 kHz ; les autres formats acceptent toute fréquence (le serveur rééchantillonne à 16 kHz avant la reconnaissance)

≤ 2 Go ; ≤ 12 heures

Qwen3-ASR-Flash (série qwen3-asr-flash)

URL / Base64 / chemin absolu du fichier local ; 1 fichier par requête

aac, amr, avi, aiff, flac, flv, mkv, mp3, mpeg, ogg, opus, wav, webm, wma, wmv

pcm nécessite 16 kHz ; les autres formats acceptent toute fréquence (le serveur rééchantillonne à 16 kHz avant la reconnaissance)

≤ 10 Mo ; ≤ 5 minutes