Tous les produits
Search
Centre de documentation

Alibaba Cloud Model Studio:Omni-modal

Dernière mise à jour :Sep 07, 2026

Choisissez un modèle pour la conversation vocale, l'analyse audio et vidéo, la modération de contenu, la traduction vocale et d'autres tâches omni-modales.

Migrer depuis des modèles propriétaires

Associez les capacités omni-modales ou temps réel actuelles de vos solutions GPT ou Gemini à un modèle Bailian équivalent.

Exemples de modèles propriétaires

Recommandation Bailian

Capacités maximales

GPT-5.5, Gemini 3.1 Pro

qwen3.5-omni-plus

Léger et économique

GPT-5.4-mini, Gemini 3.1 Flash

qwen3-omni-flash

Traduction en temps réel

Gemini 3.1 Live

qwen3.5-livetranslate-flash

Cas d'usage

Les modèles omni-modaux traitent simultanément le texte, l'audio, les images et la vidéo, et produisent des sorties textuelles et vocales. Trois familles sont disponibles : Qwen3.5-Omni (modèle phare), Qwen3-Omni-Flash (léger, économique, compatible avec le mode réflexion) et Qwen3.5-Livetranslate (dédié à la traduction). Sélectionnez votre modèle selon le cas d'usage :

Cas d'usage

Modèle recommandé

Guide d'utilisation

Conversation vocale/vidéo en temps réel : interagissez avec l'IA via un microphone et une caméra (assistants vocaux, chatbots de service client, questions-réponses visuelles, analyse de flux en direct)

Qwen3.5-Omni Realtime (WebSocket)

Qwen-Omni-Realtime

Analyse audio et vidéo : téléversez des fichiers audio ou vidéo pour obtenir des réponses textuelles ou vocales générées par l'IA (modération de contenu vidéo, transcription de réunions, génération de sous-titres)

Qwen3.5-Omni (HTTP)

Non temps réel (Qwen-Omni)

Analyse audio et vidéo légère : analysez des fichiers audio ou vidéo téléversés à moindre coût (entrée unique plafonnée à 150 secondes). Ce modèle prend en charge le mode réflexion avec sortie texte uniquement

Qwen3-Omni-Flash (HTTP)

Non temps réel (Qwen-Omni)

Traduction vocale en temps réel : interprétation simultanée avec une latence d'environ 3 secondes, couvrant 60 langues (interprétation en direct, réunions multilingues)

Qwen3.5-Livetranslate (WebSocket)

Traduction audio et vidéo en temps réel - Qwen

Traduction de fichiers audio et vidéo : téléversez des fichiers audio ou vidéo et traduisez-les dans une langue cible (doublage vidéo, traduction de podcasts)

Qwen3-Livetranslate (HTTP)

Traduction de fichiers audio et vidéo (Qwen)

Clonage vocal : fournissez un extrait audio de référence pour que l'IA génère des réponses vocales en reproduisant cette voix

Qwen3.5-Omni Plus / Flash (HTTP / WebSocket)

Non temps réel (Qwen-Omni)

Conversation vocale en temps réel avec VAD sémantique : interaction vocale de bout en bout, détection sémantique des tours de parole (smart_turn), absence d'interruption par des énoncés non significatifs, prise en charge du Function Calling (assistants vocaux, service client intelligent)

Qwen-Audio (WebSocket)

Chat audio en temps réel (Qwen-Audio-Realtime)

  • Pour l'analyse de contenu, Qwen3.5-Omni accepte jusqu'à 3 heures d'audio et 1 heure de vidéo par requête.
  • Qwen3.5-Omni (WebSocket + HTTP), Qwen3-Omni-Flash (HTTP uniquement) et Qwen-Audio Realtime (WebSocket) prennent en charge le Function Calling.
  • Seul Qwen3.5-Omni permet la recherche web (HTTP / WebSocket). La recherche web et le Function Calling ne peuvent pas être activés simultanément.

Traduction

Plusieurs modèles omni-modaux assurent la traduction vocale, chacun étant adapté à des scénarios spécifiques.

RemarqueConfiguration rapide : Qwen3.5-Livetranslate (60 langues, latence d'environ 3 s, prêt à l'emploi). Qualité optimale : Qwen3.5-Omni (29 langues de sortie, recherche web et injection de termes). Optimisation des coûts : Qwen3-Omni-Flash (11 langues de sortie, tarif réduit).

Langues prises en charge

Langue

Qwen3.5-Livetranslate

Qwen3-Livetranslate

Qwen3.5-Omni

Qwen3-Omni-Flash

Anglais

Supported

Supported

Supported

Supported

Chinois (mandarin)

Supported

Supported

Supported

Supported

Cantonais

Supported

Supported

Supported Texte uniquement

Supported

Sichuanais

Supported

Supported

Supported

Supported

Shanghaïen

Supported

Supported

Supported

Supported

Pékinois

Supported

Supported

Supported

Supported

Tianjinais

Supported

Supported

Supported

Supported

Nankinois

Unsupported Texte uniquement

Unsupported

Supported

Supported

Dialecte du Shaanxi

Unsupported Texte uniquement

Unsupported

Supported

Supported

Hokkien

Unsupported Texte uniquement

Unsupported

Supported

Supported

Français

Supported

Supported

Supported

Supported

Allemand

Supported

Supported

Supported

Supported

Russe

Supported

Supported

Supported

Supported

Italien

Supported

Supported

Supported

Supported

Espagnol

Supported

Supported

Supported

Supported

Portugais

Supported

Supported

Supported

Supported

Japonais

Supported

Supported

Supported

Supported

Coréen

Supported

Supported

Supported

Supported

Thaï

Supported

Supported Texte uniquement

Supported

Supported

Indonésien

Supported

Supported Texte uniquement

Supported

Unsupported

Vietnamien

Supported

Supported Texte uniquement

Supported

Unsupported

Arabe

Supported

Supported Texte uniquement

Supported

Unsupported

Hindi

Supported

Supported Texte uniquement

Supported

Unsupported

Turc

Supported

Supported Texte uniquement

Supported

Unsupported

Finnois

Unsupported Texte uniquement

Unsupported

Supported

Unsupported

Polonais

Unsupported Texte uniquement

Unsupported

Supported

Unsupported

Néerlandais

Unsupported Texte uniquement

Unsupported

Supported

Unsupported

Tchèque

Unsupported Texte uniquement

Unsupported

Supported

Unsupported

Ourdou

Unsupported Texte uniquement

Unsupported

Supported

Unsupported

Tagalog

Unsupported Texte uniquement

Unsupported

Supported

Unsupported

Suédois

Unsupported Texte uniquement

Unsupported

Supported

Unsupported

Danois

Unsupported Texte uniquement

Unsupported

Supported

Unsupported

Hébreu

Unsupported Texte uniquement

Unsupported

Supported

Unsupported

Islandais

Unsupported Texte uniquement

Unsupported

Supported

Unsupported

Malais

Unsupported Texte uniquement

Unsupported

Supported

Unsupported

Norvégien

Unsupported Texte uniquement

Unsupported

Supported

Unsupported

Persan

Unsupported Texte uniquement

Unsupported

Supported

Unsupported

Grec

Supported Texte uniquement

Supported Texte uniquement

Unsupported

Unsupported

« Supported » indique une sortie vocale et textuelle. « Text only » signifie une sortie textuelle sans synthèse vocale.

Qwen3.5-Livetranslate couvre 60 langues au total : 29 avec sortie audio et texte, et 31 avec sortie texte uniquement.

Qwen3.5-Omni comprend 113 langues et dialectes en entrée.

L'ancien modèle qwen-omni-turbo ne prend en charge que le chinois et l'anglais.

Modèles recommandés

ID du modèle

API

Entrée

Function calling

Recherche web

Mode réflexion

qwen3.5-omni-plus-realtime

WebSocket

Texte, audio, images

Supported

Supported

Unsupported

qwen3.5-omni-plus

HTTP

Texte, audio, images, vidéo

Supported

Supported

Unsupported

qwen3.5-omni-flash-realtime

WebSocket

Texte, audio, images

Supported

Supported

Unsupported

qwen3.5-omni-flash

HTTP

Texte, audio, images, vidéo

Supported

Supported

Unsupported

qwen3-omni-flash-realtime

WebSocket

Texte, audio, images, vidéo

Unsupported

Unsupported

Unsupported

qwen3-omni-flash

HTTP

Texte, audio, images, vidéo

Supported

Unsupported

Supported

qwen3-livetranslate-flash-realtime

WebSocket

Audio, images

Unsupported

Unsupported

Unsupported

qwen3-livetranslate-flash

HTTP

Audio, vidéo

Unsupported

Unsupported

Unsupported

qwen-audio-3.0-realtime-plus

WebSocket

Audio, texte

Supported

Unsupported

Unsupported

qwen-audio-3.0-realtime-flash

WebSocket

Audio, texte

Supported

Unsupported

Unsupported

Tous les modèles

Qwen3.5-Omni

ID du modèle

API

Entrée

Function calling

Recherche web

Mode réflexion

qwen3.5-omni-plus-realtime

WebSocket

Texte, audio, images, vidéo

Supported

Supported

Unsupported

qwen3.5-omni-plus-realtime-2026-03-15

WebSocket

Texte, audio, images, vidéo

Supported

Supported

Unsupported

qwen3.5-omni-plus

HTTP

Texte, audio, images, vidéo

Supported

Supported

Unsupported

qwen3.5-omni-plus-2026-03-15

HTTP

Texte, audio, images, vidéo

Supported

Supported

Unsupported

qwen3.5-omni-flash-realtime

WebSocket

Texte, audio, images, vidéo

Supported

Supported

Unsupported

qwen3.5-omni-flash-realtime-2026-03-15

WebSocket

Texte, audio, images, vidéo

Supported

Supported

Unsupported

qwen3.5-omni-flash

HTTP

Texte, audio, images, vidéo

Supported

Supported

Unsupported

qwen3.5-omni-flash-2026-03-15

HTTP

Texte, audio, images, vidéo

Supported

Supported

Unsupported

Qwen3-Omni

ID du modèle

API

Entrée

Function calling

Recherche web

Mode réflexion

qwen3-omni-flash-realtime

WebSocket

Texte, audio, images, vidéo

Unsupported

Unsupported

Unsupported

qwen3-omni-flash-realtime-2025-12-01

WebSocket

Texte, audio, images, vidéo

Unsupported

Unsupported

Unsupported

qwen3-omni-flash-realtime-2025-09-15

WebSocket

Texte, audio, images, vidéo

Unsupported

Unsupported

Unsupported

qwen3-omni-flash

HTTP

Texte, audio, images, vidéo

Supported

Unsupported

Supported

qwen3-omni-flash-2025-12-01

HTTP

Texte, audio, images, vidéo

Supported

Unsupported

Supported

qwen3-omni-flash-2025-09-15

HTTP

Texte, audio, images, vidéo

Supported

Unsupported

Supported

Qwen3.5-Livetranslate

ID du modèle

API

Entrée

Langues

qwen3.5-livetranslate-flash-realtime

WebSocket

Audio

60

qwen3.5-livetranslate-flash-realtime-2026-05-19

WebSocket

Audio

60

Qwen3-Livetranslate

ID du modèle

API

Entrée

Langues

qwen3-livetranslate-flash-realtime

WebSocket

Audio

18

qwen3-livetranslate-flash-realtime-2025-09-22

WebSocket

Audio

18

qwen3-livetranslate-flash

HTTP

Audio, vidéo

18

qwen3-livetranslate-flash-2025-12-01

HTTP

Audio, vidéo

18

Qwen-Audio

ID du modèle

API

Entrée

Function calling

Recherche web

Mode réflexion

qwen-audio-3.0-realtime-plus

WebSocket

Audio, texte

Supported

Unsupported

Unsupported

qwen-audio-3.0-realtime-flash

WebSocket

Audio, texte

Supported

Unsupported

Unsupported

Modèles obsolètes

Les modèles suivants ne reçoivent plus de mises à jour. Privilégiez Qwen3.5-Omni pour vos nouveaux projets.

ID du modèle

Entrée

API

qwen2.5-omni-7b

Texte, audio, images, vidéo

HTTP

qwen-omni-turbo

Texte, audio, images, vidéo

HTTP

qwen-omni-turbo-latest

Texte, audio, images, vidéo

HTTP

qwen-omni-turbo-2025-03-26

Texte, audio, images, vidéo

HTTP

qwen-omni-turbo-realtime

Texte, audio

WebSocket

qwen-omni-turbo-realtime-latest

Texte, audio

WebSocket

qwen-omni-turbo-realtime-2025-05-08

Texte, audio

WebSocket