Choisissez un modèle pour la conversation vocale, la traduction de la parole ou l'interprétation simultanée.
Migrer depuis des modèles propriétaires
Associez votre configuration actuelle OpenAI Realtime ou Gemini Live à un modèle Bailian équivalent.
Exemples de modèles propriétaires | Recommandation Bailian | |
|---|---|---|
Conversation en temps réel | OpenAI GPT Realtime, Gemini 3.1 Live |
|
Conversation à coût optimisé | OpenAI gpt-4o-mini Realtime |
|
Traduction en temps réel | Gemini 3.1 Live |
|
Cette rubrique traite du speech-to-speech. Pour la compréhension visuelle, l'analyse audio/vidéo ou la modération de contenu, consultez la documentation Omni-modal.
S2S (speech-to-speech) contre pipeline
Deux approches permettent de créer des applications vocales :
S2S | Pipeline (ASR + LLM + TTS) | |
|---|---|---|
Latence | Faible — traitement en flux par un modèle unique | Plus élevée — traitement séquentiel en trois étapes |
Compréhension audio | De bout en bout — perçoit le ton et les émotions, puis répond en conséquence | Conversion en texte avant traitement, avec perte des nuances sonores subtiles |
Personnalisation vocale | Sélection de voix prédéfinies via un prompt système | Clonage et conception de voix (CosyVoice) |
- Privilégiez le S2S pour une latence faible, des réponses sensibles au contexte audio et une conversation interactive.
- Optez pour un pipeline si vous devez personnaliser la voix ou choisir indépendamment les modèles ASR, LLM et TTS.
Cette page couvre l'approche S2S à modèle unique (séries Omni et Livetranslate). Pour l'approche pipeline, sélectionnez chaque composant séparément :
- ASR (reconnaissance vocale) : Speech-to-text
- LLM (grand modèle de langage) : Text generation
- TTS (synthèse vocale) : Speech synthesis
Mode temps réel ou fichier ?
- Temps réel (WebSocket) : assistants vocaux, centres d'appels et interprétation simultanée. Ce mode diffuse le flux audio entrant et la sortie vocale en continu.
- Mode fichier (HTTP) : latence plus élevée mais meilleure qualité. Idéal pour le doublage vidéo, la traduction de podcasts et le traitement hors ligne. Prend également en charge le function calling, la recherche web, le mode réflexion et le contexte vidéo (voir Fonctionnalités complémentaires ci-dessous).
Choisir un modèle selon le cas d'usage (approche S2S à modèle unique)
Tous les cas d'usage ci-dessous reposent sur l'approche S2S à modèle unique. Pour l'approche pipeline, reportez-vous aux guides ASR, LLM et TTS mentionnés plus haut.
Cas d'usage | Modèle recommandé | API |
|---|---|---|
Assistants vocaux et conversations de service client |
| WebSocket |
Conversations à coût optimisé |
| WebSocket |
Interprétation simultanée et traduction en direct |
| WebSocket |
Doublage vidéo et traduction de podcasts |
| HTTP |
Analyse vidéo et étiquetage par lots (nécessite le mode réflexion) |
| HTTP |
Assistants vocaux avec VAD sémantique et service client intelligent (avec prise en charge du Function Calling) |
| WebSocket |
Fonctionnalités complémentaires de l'approche S2S à modèle unique
Qwen3.5-Omni et Qwen3-Omni offrent ces fonctionnalités de manière native. Qwen-Audio Realtime prend uniquement en charge le function calling ; il ne gère ni la recherche web ni le mode réflexion. Dans une architecture pipeline, ces fonctionnalités proviennent des composants individuels (généralement le LLM).
Function calling
Le modèle peut interroger des bases de connaissances, vérifier des agendas ou déclencher des workflows en fonction de ce qu'il entend et voit. Utilisez Qwen3.5-Omni (WebSocket ou HTTP), Qwen3-Omni (HTTP uniquement) ou Qwen-Audio Realtime (WebSocket).
Non pris en charge par les modèles temps réel Qwen3.5-Omni/Qwen3-Omni (WebSocket) ni par les modèles Livetranslate. Qwen-Audio Realtime (WebSocket) prend en charge le function calling.
Recherche web
Récupère des informations en temps réel sur l'actualité, les cours boursiers, la météo et des requêtes similaires. Disponible avec Qwen3.5-Omni (WebSocket ou HTTP, versions Plus et Flash). Le modèle décide lui-même d'effectuer ou non une recherche. Qwen-Audio Realtime ne prend pas en charge cette fonctionnalité.
Non pris en charge par Qwen3-Omni-Flash ni par le modèle Livetranslate.
Mode réflexion
Utilisez Qwen3-Omni (HTTP) lorsque la qualité de la réponse prime sur la latence. Le modèle raisonne étape par étape avant de répondre, ce qui est idéal pour l'analyse vidéo et l'étiquetage par lots. Qwen-Audio Realtime ne prend pas en charge cette fonctionnalité.
La génération vocale n'est pas disponible en mode réflexion.
Traduction de la parole
Les séries de modèles suivantes prennent en charge la traduction de la parole :
- Qwen3.5-Livetranslate : 60 langues (29 avec sortie audio et texte, 31 en texte uniquement). Couvre le chinois, l'anglais, le français, l'allemand, le russe, le japonais, le coréen, l'espagnol, le portugais, l'arabe, entre autres.
- Qwen3-Livetranslate : 18 langues et 5 dialectes chinois (latence d'environ 3 s). Le mode fichier accepte les entrées vidéo pour des traductions contextuelles. Sept langues produisent une sortie texte uniquement.
- Qwen3.5-Omni : 29 langues de sortie et 8 dialectes chinois. Offre une solide compréhension audio/vidéo ainsi que la recherche web. Permet d'injecter de la terminologie et du contexte métier via le prompt système. Disponible en modes temps réel et fichier.
- Qwen3-Omni-Flash : 11 langues de sortie et 8 dialectes chinois. Permet d'injecter de la terminologie et du contexte métier via le prompt système. Disponible en modes temps réel et fichier, à un coût réduit.
RemarquePour démarrer rapidement : série Livetranslate. Meilleure qualité et couverture linguistique : Qwen3.5-Omni. Option économique : Qwen3-Omni-Flash.
Langues prises en charge
Langue | Qwen3.5-Livetranslate | Qwen3-Livetranslate | Qwen3.5-Omni | Qwen3-Omni-Flash |
|---|---|---|---|---|
Anglais | Pris en charge | Pris en charge | Pris en charge | Pris en charge |
Chinois (mandarin) | Pris en charge | Pris en charge | Pris en charge | Pris en charge |
Cantonais | Texte uniquement | Pris en charge | Pris en charge | Pris en charge |
Dialecte du Sichuan | Pris en charge | Pris en charge | Pris en charge | Pris en charge |
Shanghaïen | Pris en charge | Pris en charge | Pris en charge | Pris en charge |
Dialecte de Pékin | Pris en charge | Pris en charge | Pris en charge | Pris en charge |
Dialecte de Tianjin | Pris en charge | Pris en charge | Pris en charge | Pris en charge |
Dialecte de Nankin | -- | -- | Pris en charge | Pris en charge |
Dialecte du Shaanxi | -- | -- | Pris en charge | Pris en charge |
Dialecte minnan | -- | -- | Pris en charge | Pris en charge |
Français | Pris en charge | Pris en charge | Pris en charge | Pris en charge |
Allemand | Pris en charge | Pris en charge | Pris en charge | Pris en charge |
Russe | Pris en charge | Pris en charge | Pris en charge | Pris en charge |
Italien | Pris en charge | Pris en charge | Pris en charge | Pris en charge |
Espagnol | Pris en charge | Pris en charge | Pris en charge | Pris en charge |
Portugais | Pris en charge | Pris en charge | Pris en charge | Pris en charge |
Japonais | Pris en charge | Pris en charge | Pris en charge | Pris en charge |
Coréen | Pris en charge | Pris en charge | Pris en charge | Pris en charge |
Thaï | Pris en charge | Texte uniquement | Pris en charge | Pris en charge |
Indonésien | Pris en charge | Texte uniquement | Pris en charge | -- |
Vietnamien | Pris en charge | Texte uniquement | Pris en charge | -- |
Arabe | Pris en charge | Texte uniquement | Pris en charge | -- |
Hindi | Pris en charge | Texte uniquement | Pris en charge | -- |
Turc | Pris en charge | Texte uniquement | Pris en charge | -- |
Finnois | Pris en charge | -- | Pris en charge | -- |
Polonais | Pris en charge | -- | Pris en charge | -- |
Néerlandais | Pris en charge | -- | Pris en charge | -- |
Tchèque | Pris en charge | -- | Pris en charge | -- |
Ourdou | Pris en charge | -- | Pris en charge | -- |
Tagalog | Pris en charge | -- | Pris en charge | -- |
Suédois | Pris en charge | -- | Pris en charge | -- |
Danois | Pris en charge | -- | Pris en charge | -- |
Hébreu | Pris en charge | -- | Pris en charge | -- |
Islandais | Pris en charge | -- | Pris en charge | -- |
Malais | Pris en charge | -- | Pris en charge | -- |
Norvégien | Pris en charge | -- | Pris en charge | -- |
Persan | Pris en charge | -- | Pris en charge | -- |
Grec | Texte uniquement | Texte uniquement | -- | -- |
Afrikaans | Texte uniquement | -- | -- | -- |
Asturien | Texte uniquement | -- | -- | -- |
Biélorusse | Texte uniquement | -- | -- | -- |
Bulgare | Texte uniquement | -- | -- | -- |
Bengali | Texte uniquement | -- | -- | -- |
Bosniaque | Texte uniquement | -- | -- | -- |
Catalan | Texte uniquement | -- | -- | -- |
Cebuano | Texte uniquement | -- | -- | -- |
Estonien | Texte uniquement | -- | -- | -- |
Galicien | Texte uniquement | -- | -- | -- |
Gujarati | Texte uniquement | -- | -- | -- |
Croate | Texte uniquement | -- | -- | -- |
Hongrois | Texte uniquement | -- | -- | -- |
Javanais | Texte uniquement | -- | -- | -- |
Kazakh | Texte uniquement | -- | -- | -- |
Kannada | Texte uniquement | -- | -- | -- |
Kirghize | Texte uniquement | -- | -- | -- |
Letton | Texte uniquement | -- | -- | -- |
Macédonien | Texte uniquement | -- | -- | -- |
Malayalam | Texte uniquement | -- | -- | -- |
Marathi | Texte uniquement | -- | -- | -- |
Pendjabi | Texte uniquement | -- | -- | -- |
Roumain | Texte uniquement | -- | -- | -- |
Slovaque | Texte uniquement | -- | -- | -- |
Slovène | Texte uniquement | -- | -- | -- |
Swahili | Texte uniquement | -- | -- | -- |
Tadjik | Texte uniquement | -- | -- | -- |
Azerbaïdjanais | Texte uniquement | -- | -- | -- |
Ukrainien | Texte uniquement | -- | -- | -- |
« Pris en charge » = sortie audio et texte. « Texte uniquement » = sortie texte seulement, sans audio.
Qwen3.5-Omni prend en charge 113 langues et dialectes en entrée.
Qwen3.5-Livetranslate couvre 60 langues (29 avec sortie audio et texte, 31 en texte uniquement).
Le modèle legacy qwen-omni-turbo ne prend en charge que le chinois et l'anglais.
Modèles recommandés
Le tableau présente le modèle d'entrée de gamme de chaque série. Pour figer une version datée afin d'assurer la stabilité ou d'effectuer des tests de régression, consultez la section Tous les modèles ci-dessous.
Modèle | API | Entrée | Function calling | Recherche web | Mode réflexion | Traduction |
|---|---|---|---|---|---|---|
| WebSocket | audio, texte | Pris en charge | -- | -- | -- |
| WebSocket | audio, texte | Pris en charge | -- | -- | -- |
| WebSocket | texte, audio, image | Pris en charge | Pris en charge | -- | 29 langues |
| HTTP | texte, audio, image, vidéo | Pris en charge | Pris en charge | -- | 29 langues |
| WebSocket | texte, audio, image, vidéo | -- | -- | -- | 11 langues |
| HTTP | texte, audio, image, vidéo | Pris en charge | -- | Pris en charge | 11 langues |
| WebSocket | audio, image | -- | -- | -- | 60 langues |
| HTTP | audio, vidéo | -- | -- | -- | 18 langues |
Tous les modèles
Qwen-Audio
Modèle | API | Entrée | Function calling | Recherche web | Mode réflexion | Traduction |
|---|---|---|---|---|---|---|
| WebSocket | audio, texte | Pris en charge | -- | -- | -- |
| WebSocket | audio, texte | Pris en charge | -- | -- | -- |
Qwen3.5-Omni
Modèle | API | Entrée | Function calling | Recherche web | Mode réflexion |
|---|---|---|---|---|---|
| WebSocket | Texte, audio, image, vidéo | Pris en charge | Pris en charge | -- |
| WebSocket | Texte, audio, image, vidéo | Pris en charge | Pris en charge | -- |
| HTTP | Texte, audio, image, vidéo | Pris en charge | Pris en charge | -- |
| HTTP | Texte, audio, image, vidéo | Pris en charge | Pris en charge | -- |
| WebSocket | Texte, audio, image, vidéo | Pris en charge | Pris en charge | -- |
| WebSocket | Texte, audio, image, vidéo | Pris en charge | Pris en charge | -- |
| HTTP | Texte, audio, image, vidéo | Pris en charge | Pris en charge | -- |
| HTTP | Texte, audio, image, vidéo | Pris en charge | Pris en charge | -- |
Qwen3-Omni
Modèle | API | Entrée | Function calling | Recherche web | Mode réflexion |
|---|---|---|---|---|---|
| WebSocket | Texte, audio, image, vidéo | -- | -- | -- |
| WebSocket | Texte, audio, image, vidéo | -- | -- | -- |
| WebSocket | Texte, audio, image, vidéo | -- | -- | -- |
| HTTP | Texte, audio, image, vidéo | Pris en charge | -- | Pris en charge |
| HTTP | Texte, audio, image, vidéo | Pris en charge | -- | Pris en charge |
| HTTP | Texte, audio, image, vidéo | Pris en charge | -- | Pris en charge |
Qwen3.5-Livetranslate
Modèle | API | Entrée | Langues |
|---|---|---|---|
| WebSocket | Audio | 60 |
| WebSocket | Audio | 60 |
Qwen3-Livetranslate
Modèle | API | Entrée | Langues |
|---|---|---|---|
| WebSocket | Audio | 18 |
| WebSocket | Audio | 18 |
| HTTP | Audio, vidéo | 18 |
| HTTP | Audio, vidéo | 18 |
Modèles legacy
Ces modèles ne reçoivent plus de mises à jour. Pour tout nouveau projet, utilisez Qwen3.5-Omni.
Modèle | Entrée | API |
|---|---|---|
| Texte, audio, image, vidéo | HTTP |
| Texte, audio, image, vidéo | HTTP |
| Texte, audio, image, vidéo | HTTP |
| Texte, audio, image, vidéo | HTTP |
| Texte, audio | WebSocket |
| Texte, audio | WebSocket |
| Texte, audio | WebSocket |
Étapes suivantes
Documentation API par série de modèles :
- Qwen-Audio Realtime (WebSocket, conversation vocale en temps réel) : Realtime Audio Chat (Qwen-Audio-Realtime)
- Qwen3.5-Omni et Qwen3-Omni (WebSocket, temps réel) : Qwen-Omni-Realtime
- Qwen3.5-Omni et Qwen3-Omni (HTTP, fichier) : Non-real-time (Qwen-Omni)
- Qwen3.5-Livetranslate (WebSocket, temps réel) : Real-time audio and video translation - Qwen
- Qwen3-Livetranslate (HTTP, fichier) : Audio and video file translation (Qwen)