Choisissez un modèle pour la conversation vocale, l'analyse audio et vidéo, la modération de contenu, la traduction vocale et d'autres tâches omni-modales.
Migrer depuis des modèles propriétaires
Associez les capacités omni-modales ou temps réel actuelles de vos solutions GPT ou Gemini à un modèle Bailian équivalent.
Exemples de modèles propriétaires | Recommandation Bailian | |
|---|---|---|
Capacités maximales | GPT-5.5, Gemini 3.1 Pro |
|
Léger et économique | GPT-5.4-mini, Gemini 3.1 Flash |
|
Traduction en temps réel | Gemini 3.1 Live |
|
Cas d'usage
Les modèles omni-modaux traitent simultanément le texte, l'audio, les images et la vidéo, et produisent des sorties textuelles et vocales. Trois familles sont disponibles : Qwen3.5-Omni (modèle phare), Qwen3-Omni-Flash (léger, économique, compatible avec le mode réflexion) et Qwen3.5-Livetranslate (dédié à la traduction). Sélectionnez votre modèle selon le cas d'usage :
Cas d'usage | Modèle recommandé | Guide d'utilisation |
|---|---|---|
Conversation vocale/vidéo en temps réel : interagissez avec l'IA via un microphone et une caméra (assistants vocaux, chatbots de service client, questions-réponses visuelles, analyse de flux en direct) | Qwen3.5-Omni Realtime (WebSocket) | |
Analyse audio et vidéo : téléversez des fichiers audio ou vidéo pour obtenir des réponses textuelles ou vocales générées par l'IA (modération de contenu vidéo, transcription de réunions, génération de sous-titres) | Qwen3.5-Omni (HTTP) | |
Analyse audio et vidéo légère : analysez des fichiers audio ou vidéo téléversés à moindre coût (entrée unique plafonnée à 150 secondes). Ce modèle prend en charge le mode réflexion avec sortie texte uniquement | Qwen3-Omni-Flash (HTTP) | |
Traduction vocale en temps réel : interprétation simultanée avec une latence d'environ 3 secondes, couvrant 60 langues (interprétation en direct, réunions multilingues) | Qwen3.5-Livetranslate (WebSocket) | |
Traduction de fichiers audio et vidéo : téléversez des fichiers audio ou vidéo et traduisez-les dans une langue cible (doublage vidéo, traduction de podcasts) | Qwen3-Livetranslate (HTTP) | |
Clonage vocal : fournissez un extrait audio de référence pour que l'IA génère des réponses vocales en reproduisant cette voix | Qwen3.5-Omni Plus / Flash (HTTP / WebSocket) | |
Conversation vocale en temps réel avec VAD sémantique : interaction vocale de bout en bout, détection sémantique des tours de parole (smart_turn), absence d'interruption par des énoncés non significatifs, prise en charge du Function Calling (assistants vocaux, service client intelligent) | Qwen-Audio (WebSocket) |
- Pour l'analyse de contenu, Qwen3.5-Omni accepte jusqu'à 3 heures d'audio et 1 heure de vidéo par requête.
- Qwen3.5-Omni (WebSocket + HTTP), Qwen3-Omni-Flash (HTTP uniquement) et Qwen-Audio Realtime (WebSocket) prennent en charge le Function Calling.
- Seul Qwen3.5-Omni permet la recherche web (HTTP / WebSocket). La recherche web et le Function Calling ne peuvent pas être activés simultanément.
Traduction
Plusieurs modèles omni-modaux assurent la traduction vocale, chacun étant adapté à des scénarios spécifiques.
RemarqueConfiguration rapide : Qwen3.5-Livetranslate (60 langues, latence d'environ 3 s, prêt à l'emploi). Qualité optimale : Qwen3.5-Omni (29 langues de sortie, recherche web et injection de termes). Optimisation des coûts : Qwen3-Omni-Flash (11 langues de sortie, tarif réduit).
Langues prises en charge
Langue | Qwen3.5-Livetranslate | Qwen3-Livetranslate | Qwen3.5-Omni | Qwen3-Omni-Flash |
|---|---|---|---|---|
Anglais | Supported | Supported | Supported | Supported |
Chinois (mandarin) | Supported | Supported | Supported | Supported |
Cantonais | Supported | Supported | Supported Texte uniquement | Supported |
Sichuanais | Supported | Supported | Supported | Supported |
Shanghaïen | Supported | Supported | Supported | Supported |
Pékinois | Supported | Supported | Supported | Supported |
Tianjinais | Supported | Supported | Supported | Supported |
Nankinois | Unsupported Texte uniquement | Unsupported | Supported | Supported |
Dialecte du Shaanxi | Unsupported Texte uniquement | Unsupported | Supported | Supported |
Hokkien | Unsupported Texte uniquement | Unsupported | Supported | Supported |
Français | Supported | Supported | Supported | Supported |
Allemand | Supported | Supported | Supported | Supported |
Russe | Supported | Supported | Supported | Supported |
Italien | Supported | Supported | Supported | Supported |
Espagnol | Supported | Supported | Supported | Supported |
Portugais | Supported | Supported | Supported | Supported |
Japonais | Supported | Supported | Supported | Supported |
Coréen | Supported | Supported | Supported | Supported |
Thaï | Supported | Supported Texte uniquement | Supported | Supported |
Indonésien | Supported | Supported Texte uniquement | Supported | Unsupported |
Vietnamien | Supported | Supported Texte uniquement | Supported | Unsupported |
Arabe | Supported | Supported Texte uniquement | Supported | Unsupported |
Hindi | Supported | Supported Texte uniquement | Supported | Unsupported |
Turc | Supported | Supported Texte uniquement | Supported | Unsupported |
Finnois | Unsupported Texte uniquement | Unsupported | Supported | Unsupported |
Polonais | Unsupported Texte uniquement | Unsupported | Supported | Unsupported |
Néerlandais | Unsupported Texte uniquement | Unsupported | Supported | Unsupported |
Tchèque | Unsupported Texte uniquement | Unsupported | Supported | Unsupported |
Ourdou | Unsupported Texte uniquement | Unsupported | Supported | Unsupported |
Tagalog | Unsupported Texte uniquement | Unsupported | Supported | Unsupported |
Suédois | Unsupported Texte uniquement | Unsupported | Supported | Unsupported |
Danois | Unsupported Texte uniquement | Unsupported | Supported | Unsupported |
Hébreu | Unsupported Texte uniquement | Unsupported | Supported | Unsupported |
Islandais | Unsupported Texte uniquement | Unsupported | Supported | Unsupported |
Malais | Unsupported Texte uniquement | Unsupported | Supported | Unsupported |
Norvégien | Unsupported Texte uniquement | Unsupported | Supported | Unsupported |
Persan | Unsupported Texte uniquement | Unsupported | Supported | Unsupported |
Grec | Supported Texte uniquement | Supported Texte uniquement | Unsupported | Unsupported |
« Supported » indique une sortie vocale et textuelle. « Text only » signifie une sortie textuelle sans synthèse vocale.
Qwen3.5-Livetranslate couvre 60 langues au total : 29 avec sortie audio et texte, et 31 avec sortie texte uniquement.
Qwen3.5-Omni comprend 113 langues et dialectes en entrée.
L'ancien modèle qwen-omni-turbo ne prend en charge que le chinois et l'anglais.
Modèles recommandés
ID du modèle | API | Entrée | Function calling | Recherche web | Mode réflexion |
|---|---|---|---|---|---|
| WebSocket | Texte, audio, images | Supported | Supported | Unsupported |
| HTTP | Texte, audio, images, vidéo | Supported | Supported | Unsupported |
| WebSocket | Texte, audio, images | Supported | Supported | Unsupported |
| HTTP | Texte, audio, images, vidéo | Supported | Supported | Unsupported |
| WebSocket | Texte, audio, images, vidéo | Unsupported | Unsupported | Unsupported |
| HTTP | Texte, audio, images, vidéo | Supported | Unsupported | Supported |
| WebSocket | Audio, images | Unsupported | Unsupported | Unsupported |
| HTTP | Audio, vidéo | Unsupported | Unsupported | Unsupported |
| WebSocket | Audio, texte | Supported | Unsupported | Unsupported |
| WebSocket | Audio, texte | Supported | Unsupported | Unsupported |
Tous les modèles
Qwen3.5-Omni
ID du modèle | API | Entrée | Function calling | Recherche web | Mode réflexion |
|---|---|---|---|---|---|
| WebSocket | Texte, audio, images, vidéo | Supported | Supported | Unsupported |
| WebSocket | Texte, audio, images, vidéo | Supported | Supported | Unsupported |
| HTTP | Texte, audio, images, vidéo | Supported | Supported | Unsupported |
| HTTP | Texte, audio, images, vidéo | Supported | Supported | Unsupported |
| WebSocket | Texte, audio, images, vidéo | Supported | Supported | Unsupported |
| WebSocket | Texte, audio, images, vidéo | Supported | Supported | Unsupported |
| HTTP | Texte, audio, images, vidéo | Supported | Supported | Unsupported |
| HTTP | Texte, audio, images, vidéo | Supported | Supported | Unsupported |
Qwen3-Omni
ID du modèle | API | Entrée | Function calling | Recherche web | Mode réflexion |
|---|---|---|---|---|---|
| WebSocket | Texte, audio, images, vidéo | Unsupported | Unsupported | Unsupported |
| WebSocket | Texte, audio, images, vidéo | Unsupported | Unsupported | Unsupported |
| WebSocket | Texte, audio, images, vidéo | Unsupported | Unsupported | Unsupported |
| HTTP | Texte, audio, images, vidéo | Supported | Unsupported | Supported |
| HTTP | Texte, audio, images, vidéo | Supported | Unsupported | Supported |
| HTTP | Texte, audio, images, vidéo | Supported | Unsupported | Supported |
Qwen3.5-Livetranslate
ID du modèle | API | Entrée | Langues |
|---|---|---|---|
| WebSocket | Audio | 60 |
| WebSocket | Audio | 60 |
Qwen3-Livetranslate
ID du modèle | API | Entrée | Langues |
|---|---|---|---|
| WebSocket | Audio | 18 |
| WebSocket | Audio | 18 |
| HTTP | Audio, vidéo | 18 |
| HTTP | Audio, vidéo | 18 |
Qwen-Audio
ID du modèle | API | Entrée | Function calling | Recherche web | Mode réflexion |
|---|---|---|---|---|---|
| WebSocket | Audio, texte | Supported | Unsupported | Unsupported |
| WebSocket | Audio, texte | Supported | Unsupported | Unsupported |
Modèles obsolètes
Les modèles suivants ne reçoivent plus de mises à jour. Privilégiez Qwen3.5-Omni pour vos nouveaux projets.
ID du modèle | Entrée | API |
|---|---|---|
| Texte, audio, images, vidéo | HTTP |
| Texte, audio, images, vidéo | HTTP |
| Texte, audio, images, vidéo | HTTP |
| Texte, audio, images, vidéo | HTTP |
| Texte, audio | WebSocket |
| Texte, audio | WebSocket |
| Texte, audio | WebSocket |