Choisissez le modèle adapté à la reconnaissance vocale en temps réel ou sur fichier.
Migrer depuis des modèles propriétaires
Associez votre service Whisper, Deepgram ou Google ASR actuel à son équivalent Bailian.
Cas d'usage | Exemples de modèles propriétaires | Recommandation Bailian |
|---|---|---|
Reconnaissance en temps réel | Deepgram Nova-3, Google Chirp 3 |
|
Transcription hors ligne / sur fichier | OpenAI gpt-4o-transcribe, Whisper |
|
Utilisez les quatre « Critères de sélection » (temps réel ou hors ligne, terminologie métier, diarisation des locuteurs et reconnaissance des émotions) pour identifier le modèle approprié. Consultez ensuite la section « Modèles recommandés » pour les meilleurs choix par scénario, « Tous les modèles » pour la liste complète des versions par famille de modèles, et « Spécifications audio » pour les contraintes d'entrée. Les langues prises en charge (y compris les dialectes) figurent sous chaque famille de modèles dans la section « Tous les modèles ».
Critères de sélection
Évaluez quatre dimensions pour trouver le bon modèle.
Temps réel ou hors ligne ?
La reconnaissance en temps réel renvoie les résultats pendant que l'utilisateur parle. La reconnaissance hors ligne transcrit un fichier préenregistré une fois l'enregistrement terminé.
- Temps réel (reconnaissance en streaming) : utilise une connexion WebSocket pour diffuser le flux audio entrant et le texte sortant. Ce mode convient au sous-titrage en direct, aux assistants vocaux et à la transcription de réunions. Modèle recommandé :
qwen-audio-3.0-asr-flash-streaming(mots-clés, contexte de prompt, multilingue avec dialectes). - Hors ligne (transcription de fichiers) : recourt à une API HTTP pour soumettre des fichiers audio et récupérer les résultats de transcription. Cette approche s'applique aux enregistrements de centres d'appels, aux podcasts et aux interviews. Modèle recommandé :
qwen-audio-3.0-asr-flash-filetrans(mots-clés, contexte de prompt, diarisation des locuteurs).
Les séries de modèles Qwen-Audio-3.0-ASR-Flash-Streaming et Fun-ASR-Realtime prennent également en charge le protocole AOQ. Pour une intégration côté client privilégiant une latence stable, une résilience sur les réseaux faibles, ainsi qu'une suppression du bruit et une annulation de l'écho intégrées en full-duplex, privilégiez le protocole AOQ. Pour comparer les protocoles, consultez Présentation de l'API Realtime.
Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans, ainsi que les modèles temps réel Fun-ASR et Qwen-ASR, sont compatibles avec le SDK DashScope (Java, Python). Tous les autres modèles nécessitent des appels directs via WebSocket ou API HTTP.
Pour une intégration en temps réel, consultez Reconnaissance vocale en temps réel. Pour une intégration hors ligne, reportez-vous à Reconnaissance vocale non temps réel.
Terminologie métier
Deux approches sont disponibles, classées par ordre de flexibilité :
- Injection de contexte via prompt : décrivez votre domaine dans le prompt système. Aucune configuration préalable n'est nécessaire, car le modèle s'adapte à chaque requête. Séries recommandées : Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans et Qwen-Audio-3.0-ASR-Flash.
- Mots-clés : fournissez une liste de vocabulaire pondérée. Séries recommandées : Qwen-Audio-3.0-ASR-Flash-Streaming, Qwen-Audio-3.0-ASR-Flash-Filetrans et Qwen-Audio-3.0-ASR-Flash.
Diarisation des locuteurs
La série Qwen-Audio-3.0-ASR-Flash-Filetrans (qwen-audio-3.0-asr-flash-filetrans) et les modèles hors ligne Fun-ASR (fun-asr et fun-asr-mtl) prennent en charge la diarisation des locuteurs. Pour identifier qui a dit quoi, utilisez qwen-audio-3.0-asr-flash-filetrans.
Reconnaissance des émotions
Les modèles Qwen-ASR détectent les émotions en parallèle de la transcription. Modèles recommandés : qwen3-asr-flash-realtime (temps réel) ou qwen3-asr-flash-filetrans (hors ligne).
Modèles recommandés
Meilleurs choix pour les scénarios courants.
ID du modèle | Mode | API | Amélioration de la précision | Reconnaissance des émotions | Diarisation des locuteurs | Langues | Durée/taille audio maximale |
|---|---|---|---|---|---|---|---|
| Temps réel | WebSocket | Mots-clés, contexte de prompt | Non pris en charge | Non pris en charge | Multilingue avec dialectes | Illimitée |
| Hors ligne | HTTP | Mots-clés, contexte de prompt | Non pris en charge | Pris en charge | Multilingue avec dialectes | 12 heures / 2 Go |
Tous les modèles
Qwen-Audio-3.0-ASR-Flash-Streaming
ID du modèle | Mode | API | Amélioration de la précision | Reconnaissance des émotions | Diarisation des locuteurs | Durée/taille audio maximale | |
|---|---|---|---|---|---|---|---|
| Temps réel | WebSocket | Mots-clés, contexte de prompt | Non pris en charge | Non pris en charge | Multilingue avec dialectes | Illimitée |
Langues prises en charge (par version) :
qwen-audio-3.0-asr-flash-streaming: chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin ; ainsi que les accents régionaux incluant les plaines centrales, le sud-ouest, ji-lu, jianghuai, lan-yin, jiao-liao, nord-est, Pékin et Hong Kong/Taïwan — couvrant les accents du Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu et Ningxia), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque
Qwen-Audio-3.0-ASR-Flash-Filetrans
ID du modèle | Mode | API | Amélioration de la précision | Reconnaissance des émotions | Diarisation des locuteurs | Durée/taille audio maximale | |
|---|---|---|---|---|---|---|---|
| Hors ligne | HTTP | Mots-clés, contexte de prompt | Non pris en charge | Pris en charge | Multilingue avec dialectes | 12 heures / 2 Go |
Langues prises en charge (par version) :
qwen-audio-3.0-asr-flash-filetrans: chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin ; ainsi que les accents régionaux incluant les plaines centrales, le sud-ouest, ji-lu, jianghuai, lan-yin, jiao-liao, nord-est, Pékin et Hong Kong/Taïwan — couvrant les accents du Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu et Ningxia), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque
Qwen-Audio-3.0-ASR-Flash
ID du modèle | Mode | API | Amélioration de la précision | Reconnaissance des émotions | Diarisation des locuteurs | Durée/taille audio maximale | |
|---|---|---|---|---|---|---|---|
| Hors ligne | HTTP | Mots-clés, contexte de prompt | Non pris en charge | Non pris en charge | Multilingue avec dialectes | 5 minutes / 2 Go |
Langues prises en charge (par version) :
qwen-audio-3.0-asr-flash: chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin ; ainsi que les accents régionaux incluant les plaines centrales, le sud-ouest, ji-lu, jianghuai, lan-yin, jiao-liao, nord-est, Pékin et Hong Kong/Taïwan — couvrant les accents du Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu et Ningxia), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque
Fun-ASR
ID du modèle | Mode | API | Amélioration de la précision | Reconnaissance des émotions | Diarisation des locuteurs | Durée/taille audio maximale | |
|---|---|---|---|---|---|---|---|
| Temps réel | WebSocket | Mots-clés | Non pris en charge | Non pris en charge | Chinois, anglais, japonais et dialectes | Illimitée |
| Temps réel | WebSocket | Mots-clés | Non pris en charge | Non pris en charge | Chinois, anglais, japonais et dialectes | Illimitée |
| Temps réel | WebSocket | Mots-clés | Non pris en charge | Non pris en charge | Chinois, anglais, japonais et dialectes | Illimitée |
| Temps réel | WebSocket | Mots-clés | Non pris en charge | Non pris en charge | Chinois, anglais | Illimitée |
| Temps réel | WebSocket | Mots-clés | Non pris en charge | Non pris en charge | Chinois | Illimitée |
| Temps réel | WebSocket | Mots-clés | Non pris en charge | Non pris en charge | Chinois | Illimitée |
| Hors ligne | HTTP | Mots-clés | Non pris en charge | Pris en charge | Multilingue avec dialectes | 12 heures / 2 Go |
| Hors ligne | HTTP | Contexte de prompt | Non pris en charge | Non pris en charge | Multilingue avec dialectes | 5 minutes / 2 Go |
| Hors ligne | HTTP | Mots-clés | Non pris en charge | Pris en charge | Multilingue avec dialectes | 12 heures / 2 Go |
| Hors ligne | HTTP | Mots-clés | Non pris en charge | Pris en charge | Chinois, anglais | 12 heures / 2 Go |
| Hors ligne | HTTP | Mots-clés | Non pris en charge | Pris en charge | Multilingue avec dialectes | 12 heures / 2 Go |
| Hors ligne | HTTP | Mots-clés | Non pris en charge | Pris en charge | Multilingue avec dialectes | 12 heures / 2 Go |
Langues prises en charge (par version) :
- Versions principales de Fun-ASR-Realtime (
fun-asr-realtime,fun-asr-realtime-2026-02-28,fun-asr-realtime-2025-11-07) : chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin ; ainsi que les accents régionaux incluant les plaines centrales, le sud-ouest, ji-lu, jianghuai, lan-yin, jiao-liao, nord-est, Pékin et Hong Kong/Taïwan — couvrant les accents du Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu et Ningxia), anglais, japonais fun-asr-realtime-2025-09-15: chinois (mandarin), anglais- Fun-ASR-Flash-Realtime(8K) (
fun-asr-flash-8k-realtime,fun-asr-flash-8k-realtime-2026-01-28) : chinois - Versions principales de Fun-ASR (
fun-asr,fun-asr-2025-11-07) : chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin ; ainsi que les accents régionaux incluant les plaines centrales, le sud-ouest, ji-lu, jianghuai, lan-yin, jiao-liao, nord-est, Pékin et Hong Kong/Taïwan — couvrant les accents du Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu et Ningxia), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque - Fun-ASR-Flash (
fun-asr-flash-2026-06-15) : chinois (mandarin, cantonais, wu, hokkien, hakka, gan, xiang, jin ; ainsi que les accents régionaux incluant les plaines centrales, le sud-ouest, ji-lu, jianghuai, lan-yin, jiao-liao, nord-est, Pékin et Hong Kong/Taïwan — couvrant les accents du Henan, Shaanxi, Hubei, Sichuan, Chongqing, Yunnan, Guizhou, Guangdong, Guangxi, Hebei, Tianjin, Shandong, Anhui, Nanjing, Jiangsu, Hangzhou, Gansu et Ningxia), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque fun-asr-2025-08-25: chinois (mandarin), anglais- Fun-ASR(MTL) (
fun-asr-mtl,fun-asr-mtl-2025-08-25) : chinois (mandarin, cantonais), anglais, japonais, coréen, vietnamien, thaï, indonésien, malais, filipino, hindi, arabe, français, allemand, espagnol, portugais, russe, italien, néerlandais, suédois, danois, finnois, norvégien, grec, polonais, tchèque, hongrois, roumain, bulgare, croate, slovaque
Qwen-ASR
ID du modèle | Mode | API | Amélioration de la précision | Reconnaissance des émotions | Diarisation des locuteurs | Durée/taille audio maximale | |
|---|---|---|---|---|---|---|---|
| Temps réel | WebSocket | Non pris en charge | Pris en charge | Non pris en charge | Multilingue avec dialectes | Illimitée |
| Temps réel | WebSocket | Non pris en charge | Pris en charge | Non pris en charge | Multilingue avec dialectes | Illimitée |
| Temps réel | WebSocket | Non pris en charge | Pris en charge | Non pris en charge | Multilingue avec dialectes | Illimitée |
| Hors ligne | HTTP | Non pris en charge | Pris en charge | Non pris en charge | Multilingue avec dialectes | 12 heures / 2 Go |
| Hors ligne | HTTP | Non pris en charge | Pris en charge | Non pris en charge | Multilingue avec dialectes | 12 heures / 2 Go |
| Hors ligne | HTTP (compatible OpenAI) | Non pris en charge | Pris en charge | Non pris en charge | Multilingue avec dialectes | 5 minutes / 10 Mo |
| Hors ligne | HTTP (compatible OpenAI) | Non pris en charge | Pris en charge | Non pris en charge | Multilingue avec dialectes | 5 minutes / 10 Mo |
| Hors ligne | HTTP (compatible OpenAI) | Non pris en charge | Pris en charge | Non pris en charge | Multilingue avec dialectes | 5 minutes / 10 Mo |
Langues prises en charge : tous les modèles Qwen-ASR (qwen3-asr-flash-realtime, qwen3-asr-flash-filetrans, qwen3-asr-flash et leurs versions snapshot) partagent la même liste de langues : chinois (mandarin, sichuanais, hokkien, wu, cantonais), anglais, japonais, allemand, coréen, russe, français, portugais, arabe, italien, espagnol, hindi, indonésien, thaï, turc, ukrainien, vietnamien, tchèque, danois, filipino, finnois, islandais, malais, norvégien, polonais, suédois.
Paraformer
Paraformer est une famille de modèles ASR d'ancienne génération. Migrez vers Fun-ASR ou Qwen-ASR dès que possible.
ID du modèle | API | Description |
|---|---|---|
| WebSocket | Reconnaissance en temps réel ; chinois, anglais, japonais, coréen, allemand, français, russe |
| WebSocket | Reconnaissance en temps réel ; chinois, anglais, japonais, coréen, allemand, français, russe |
| WebSocket | Reconnaissance en temps réel pour la téléphonie 8 kHz ; chinois |
| WebSocket | Reconnaissance en temps réel pour la téléphonie 8 kHz ; chinois |
| HTTP | Transcription de fichiers avec diarisation des locuteurs ; chinois, anglais, japonais, coréen, allemand, français, russe |
| HTTP | Transcription de fichiers pour la téléphonie 8 kHz ; chinois |
Langues prises en charge (par version) :
paraformer-realtime-v2,paraformer-v2: chinois (mandarin, cantonais, wu, hokkien, nord-est, Gansu, Guizhou, Henan, Hubei, Hunan, Ningxia, Shanxi, Shaanxi, Shandong, Sichuan, Tianjin, Jiangxi, Yunnan, Shanghai), anglais, japonais, coréen, allemand, français, russeparaformer-realtime-v1,paraformer-realtime-8k-v2,paraformer-realtime-8k-v1,paraformer-8k-v2: chinois (mandarin)
Spécifications audio
Spécifications audio pour les modes temps réel et hors ligne. Pour les langues prises en charge, consultez la sous-section relative à la famille de modèles dans « Tous les modèles ».
Temps réel
ID du modèle | Méthode d'entrée | Format audio | Fréquence d'échantillonnage | Taille/durée |
|---|---|---|---|---|
Qwen-Audio-3.0-ASR-Flash-Streaming (série | Flux binaire |
| Quelconque | Illimitée |
Fun-ASR-Realtime / Fun-ASR-MTL-Realtime (séries | Flux binaire |
| Quelconque | Illimitée |
Fun-ASR-Flash-8K-Realtime (série | Flux binaire | Identique à Fun-ASR-Realtime | 8 kHz | Illimitée |
Qwen-ASR-Realtime (série | Flux binaire |
| 8 kHz, 16 kHz | Illimitée |
Paraformer-Realtime ( | Flux binaire | Identique à Fun-ASR-Realtime |
| Illimitée |
Tous les modèles temps réel acceptent uniquement une entrée mono (canal unique).
Hors ligne
ID du modèle | Méthode d'entrée | Format audio | Fréquence d'échantillonnage | Taille/durée du fichier |
|---|---|---|---|---|
Qwen-Audio-3.0-ASR-Flash-Filetrans (série | URL de fichier accessible publiquement ; 1 URL par requête |
| Quelconque | ≤ 2 Go ; ≤ 12 heures (≤ 2 heures recommandées lorsque la diarisation des locuteurs est activée) |
Qwen-Audio-3.0-ASR-Flash (série | URL / Base64 ; 1 fichier par requête |
| Quelconque | ≤ 2 Go ; ≤ 5 minutes |
Fun-ASR (séries | URL de fichier accessible publiquement ; 1 URL par requête |
| Quelconque | ≤ 2 Go ; ≤ 12 heures (≤ 2 heures recommandées lorsque la diarisation des locuteurs est activée) |
Fun-ASR-Flash ( | URL / Base64 ; 1 fichier par requête |
| Quelconque | ≤ 2 Go ; ≤ 5 minutes |
Paraformer ( | Identique à Fun-ASR | Identique à Fun-ASR | paraformer-v2 toute fréquence ; | Identique à Fun-ASR |
Qwen3-ASR-Flash-Filetrans (série | URL de fichier accessible publiquement ; 1 URL par requête |
|
| ≤ 2 Go ; ≤ 12 heures |
Qwen3-ASR-Flash (série | URL / Base64 / chemin absolu du fichier local ; 1 fichier par requête |
|
| ≤ 10 Mo ; ≤ 5 minutes |