Tous les produits
Search
Centre de documentation

Alibaba Cloud Model Studio:Speech-to-speech

Dernière mise à jour :Sep 07, 2026

Choisissez un modèle pour la conversation vocale, la traduction de la parole ou l'interprétation simultanée.

Migrer depuis des modèles propriétaires

Associez votre configuration actuelle OpenAI Realtime ou Gemini Live à un modèle Bailian équivalent.

Exemples de modèles propriétaires

Recommandation Bailian

Conversation en temps réel

OpenAI GPT Realtime, Gemini 3.1 Live

qwen-audio-3.0-realtime-plus

Conversation à coût optimisé

OpenAI gpt-4o-mini Realtime

qwen-audio-3.0-realtime-flash

Traduction en temps réel

Gemini 3.1 Live

qwen3.5-livetranslate-flash-realtime

Cette rubrique traite du speech-to-speech. Pour la compréhension visuelle, l'analyse audio/vidéo ou la modération de contenu, consultez la documentation Omni-modal.

S2S (speech-to-speech) contre pipeline

Deux approches permettent de créer des applications vocales :

S2S

Pipeline (ASR + LLM + TTS)

Latence

Faible — traitement en flux par un modèle unique

Plus élevée — traitement séquentiel en trois étapes

Compréhension audio

De bout en bout — perçoit le ton et les émotions, puis répond en conséquence

Conversion en texte avant traitement, avec perte des nuances sonores subtiles

Personnalisation vocale

Sélection de voix prédéfinies via un prompt système

Clonage et conception de voix (CosyVoice)

  • Privilégiez le S2S pour une latence faible, des réponses sensibles au contexte audio et une conversation interactive.
  • Optez pour un pipeline si vous devez personnaliser la voix ou choisir indépendamment les modèles ASR, LLM et TTS.

Cette page couvre l'approche S2S à modèle unique (séries Omni et Livetranslate). Pour l'approche pipeline, sélectionnez chaque composant séparément :

Mode temps réel ou fichier ?

  • Temps réel (WebSocket) : assistants vocaux, centres d'appels et interprétation simultanée. Ce mode diffuse le flux audio entrant et la sortie vocale en continu.
  • Mode fichier (HTTP) : latence plus élevée mais meilleure qualité. Idéal pour le doublage vidéo, la traduction de podcasts et le traitement hors ligne. Prend également en charge le function calling, la recherche web, le mode réflexion et le contexte vidéo (voir Fonctionnalités complémentaires ci-dessous).

Choisir un modèle selon le cas d'usage (approche S2S à modèle unique)

Tous les cas d'usage ci-dessous reposent sur l'approche S2S à modèle unique. Pour l'approche pipeline, reportez-vous aux guides ASR, LLM et TTS mentionnés plus haut.

Cas d'usage

Modèle recommandé

API

Assistants vocaux et conversations de service client

qwen-audio-3.0-realtime-plus

WebSocket

Conversations à coût optimisé

qwen-audio-3.0-realtime-flash

WebSocket

Interprétation simultanée et traduction en direct

qwen3.5-livetranslate-flash-realtime

WebSocket

Doublage vidéo et traduction de podcasts

qwen3-livetranslate-flash

HTTP

Analyse vidéo et étiquetage par lots (nécessite le mode réflexion)

qwen3-omni-flash

HTTP

Assistants vocaux avec VAD sémantique et service client intelligent (avec prise en charge du Function Calling)

qwen-audio-3.0-realtime-plus

WebSocket

Fonctionnalités complémentaires de l'approche S2S à modèle unique

Qwen3.5-Omni et Qwen3-Omni offrent ces fonctionnalités de manière native. Qwen-Audio Realtime prend uniquement en charge le function calling ; il ne gère ni la recherche web ni le mode réflexion. Dans une architecture pipeline, ces fonctionnalités proviennent des composants individuels (généralement le LLM).

Function calling

Le modèle peut interroger des bases de connaissances, vérifier des agendas ou déclencher des workflows en fonction de ce qu'il entend et voit. Utilisez Qwen3.5-Omni (WebSocket ou HTTP), Qwen3-Omni (HTTP uniquement) ou Qwen-Audio Realtime (WebSocket).

Non pris en charge par les modèles temps réel Qwen3.5-Omni/Qwen3-Omni (WebSocket) ni par les modèles Livetranslate. Qwen-Audio Realtime (WebSocket) prend en charge le function calling.

Recherche web

Récupère des informations en temps réel sur l'actualité, les cours boursiers, la météo et des requêtes similaires. Disponible avec Qwen3.5-Omni (WebSocket ou HTTP, versions Plus et Flash). Le modèle décide lui-même d'effectuer ou non une recherche. Qwen-Audio Realtime ne prend pas en charge cette fonctionnalité.

Non pris en charge par Qwen3-Omni-Flash ni par le modèle Livetranslate.

Mode réflexion

Utilisez Qwen3-Omni (HTTP) lorsque la qualité de la réponse prime sur la latence. Le modèle raisonne étape par étape avant de répondre, ce qui est idéal pour l'analyse vidéo et l'étiquetage par lots. Qwen-Audio Realtime ne prend pas en charge cette fonctionnalité.

La génération vocale n'est pas disponible en mode réflexion.

Traduction de la parole

Les séries de modèles suivantes prennent en charge la traduction de la parole :

  • Qwen3.5-Livetranslate : 60 langues (29 avec sortie audio et texte, 31 en texte uniquement). Couvre le chinois, l'anglais, le français, l'allemand, le russe, le japonais, le coréen, l'espagnol, le portugais, l'arabe, entre autres.
  • Qwen3-Livetranslate : 18 langues et 5 dialectes chinois (latence d'environ 3 s). Le mode fichier accepte les entrées vidéo pour des traductions contextuelles. Sept langues produisent une sortie texte uniquement.
  • Qwen3.5-Omni : 29 langues de sortie et 8 dialectes chinois. Offre une solide compréhension audio/vidéo ainsi que la recherche web. Permet d'injecter de la terminologie et du contexte métier via le prompt système. Disponible en modes temps réel et fichier.
  • Qwen3-Omni-Flash : 11 langues de sortie et 8 dialectes chinois. Permet d'injecter de la terminologie et du contexte métier via le prompt système. Disponible en modes temps réel et fichier, à un coût réduit.

RemarquePour démarrer rapidement : série Livetranslate. Meilleure qualité et couverture linguistique : Qwen3.5-Omni. Option économique : Qwen3-Omni-Flash.

Langues prises en charge

Langue

Qwen3.5-Livetranslate

Qwen3-Livetranslate

Qwen3.5-Omni

Qwen3-Omni-Flash

Anglais

Pris en charge

Pris en charge

Pris en charge

Pris en charge

Chinois (mandarin)

Pris en charge

Pris en charge

Pris en charge

Pris en charge

Cantonais

Texte uniquement

Pris en charge

Pris en charge

Pris en charge

Dialecte du Sichuan

Pris en charge

Pris en charge

Pris en charge

Pris en charge

Shanghaïen

Pris en charge

Pris en charge

Pris en charge

Pris en charge

Dialecte de Pékin

Pris en charge

Pris en charge

Pris en charge

Pris en charge

Dialecte de Tianjin

Pris en charge

Pris en charge

Pris en charge

Pris en charge

Dialecte de Nankin

--

--

Pris en charge

Pris en charge

Dialecte du Shaanxi

--

--

Pris en charge

Pris en charge

Dialecte minnan

--

--

Pris en charge

Pris en charge

Français

Pris en charge

Pris en charge

Pris en charge

Pris en charge

Allemand

Pris en charge

Pris en charge

Pris en charge

Pris en charge

Russe

Pris en charge

Pris en charge

Pris en charge

Pris en charge

Italien

Pris en charge

Pris en charge

Pris en charge

Pris en charge

Espagnol

Pris en charge

Pris en charge

Pris en charge

Pris en charge

Portugais

Pris en charge

Pris en charge

Pris en charge

Pris en charge

Japonais

Pris en charge

Pris en charge

Pris en charge

Pris en charge

Coréen

Pris en charge

Pris en charge

Pris en charge

Pris en charge

Thaï

Pris en charge

Texte uniquement

Pris en charge

Pris en charge

Indonésien

Pris en charge

Texte uniquement

Pris en charge

--

Vietnamien

Pris en charge

Texte uniquement

Pris en charge

--

Arabe

Pris en charge

Texte uniquement

Pris en charge

--

Hindi

Pris en charge

Texte uniquement

Pris en charge

--

Turc

Pris en charge

Texte uniquement

Pris en charge

--

Finnois

Pris en charge

--

Pris en charge

--

Polonais

Pris en charge

--

Pris en charge

--

Néerlandais

Pris en charge

--

Pris en charge

--

Tchèque

Pris en charge

--

Pris en charge

--

Ourdou

Pris en charge

--

Pris en charge

--

Tagalog

Pris en charge

--

Pris en charge

--

Suédois

Pris en charge

--

Pris en charge

--

Danois

Pris en charge

--

Pris en charge

--

Hébreu

Pris en charge

--

Pris en charge

--

Islandais

Pris en charge

--

Pris en charge

--

Malais

Pris en charge

--

Pris en charge

--

Norvégien

Pris en charge

--

Pris en charge

--

Persan

Pris en charge

--

Pris en charge

--

Grec

Texte uniquement

Texte uniquement

--

--

Afrikaans

Texte uniquement

--

--

--

Asturien

Texte uniquement

--

--

--

Biélorusse

Texte uniquement

--

--

--

Bulgare

Texte uniquement

--

--

--

Bengali

Texte uniquement

--

--

--

Bosniaque

Texte uniquement

--

--

--

Catalan

Texte uniquement

--

--

--

Cebuano

Texte uniquement

--

--

--

Estonien

Texte uniquement

--

--

--

Galicien

Texte uniquement

--

--

--

Gujarati

Texte uniquement

--

--

--

Croate

Texte uniquement

--

--

--

Hongrois

Texte uniquement

--

--

--

Javanais

Texte uniquement

--

--

--

Kazakh

Texte uniquement

--

--

--

Kannada

Texte uniquement

--

--

--

Kirghize

Texte uniquement

--

--

--

Letton

Texte uniquement

--

--

--

Macédonien

Texte uniquement

--

--

--

Malayalam

Texte uniquement

--

--

--

Marathi

Texte uniquement

--

--

--

Pendjabi

Texte uniquement

--

--

--

Roumain

Texte uniquement

--

--

--

Slovaque

Texte uniquement

--

--

--

Slovène

Texte uniquement

--

--

--

Swahili

Texte uniquement

--

--

--

Tadjik

Texte uniquement

--

--

--

Azerbaïdjanais

Texte uniquement

--

--

--

Ukrainien

Texte uniquement

--

--

--

« Pris en charge » = sortie audio et texte. « Texte uniquement » = sortie texte seulement, sans audio.

Qwen3.5-Omni prend en charge 113 langues et dialectes en entrée.

Qwen3.5-Livetranslate couvre 60 langues (29 avec sortie audio et texte, 31 en texte uniquement).

Le modèle legacy qwen-omni-turbo ne prend en charge que le chinois et l'anglais.

Modèles recommandés

Le tableau présente le modèle d'entrée de gamme de chaque série. Pour figer une version datée afin d'assurer la stabilité ou d'effectuer des tests de régression, consultez la section Tous les modèles ci-dessous.

Modèle

API

Entrée

Function calling

Recherche web

Mode réflexion

Traduction

qwen-audio-3.0-realtime-plus

WebSocket

audio, texte

Pris en charge

--

--

--

qwen-audio-3.0-realtime-flash

WebSocket

audio, texte

Pris en charge

--

--

--

qwen3.5-omni-flash-realtime

WebSocket

texte, audio, image

Pris en charge

Pris en charge

--

29 langues

qwen3.5-omni-flash

HTTP

texte, audio, image, vidéo

Pris en charge

Pris en charge

--

29 langues

qwen3-omni-flash-realtime

WebSocket

texte, audio, image, vidéo

--

--

--

11 langues

qwen3-omni-flash

HTTP

texte, audio, image, vidéo

Pris en charge

--

Pris en charge

11 langues

qwen3.5-livetranslate-flash-realtime

WebSocket

audio, image

--

--

--

60 langues

qwen3-livetranslate-flash

HTTP

audio, vidéo

--

--

--

18 langues

Tous les modèles

Qwen-Audio

Modèle

API

Entrée

Function calling

Recherche web

Mode réflexion

Traduction

qwen-audio-3.0-realtime-plus

WebSocket

audio, texte

Pris en charge

--

--

--

qwen-audio-3.0-realtime-flash

WebSocket

audio, texte

Pris en charge

--

--

--

Qwen3.5-Omni

Modèle

API

Entrée

Function calling

Recherche web

Mode réflexion

qwen3.5-omni-plus-realtime

WebSocket

Texte, audio, image, vidéo

Pris en charge

Pris en charge

--

qwen3.5-omni-plus-realtime-2026-03-15

WebSocket

Texte, audio, image, vidéo

Pris en charge

Pris en charge

--

qwen3.5-omni-plus

HTTP

Texte, audio, image, vidéo

Pris en charge

Pris en charge

--

qwen3.5-omni-plus-2026-03-15

HTTP

Texte, audio, image, vidéo

Pris en charge

Pris en charge

--

qwen3.5-omni-flash-realtime

WebSocket

Texte, audio, image, vidéo

Pris en charge

Pris en charge

--

qwen3.5-omni-flash-realtime-2026-03-15

WebSocket

Texte, audio, image, vidéo

Pris en charge

Pris en charge

--

qwen3.5-omni-flash

HTTP

Texte, audio, image, vidéo

Pris en charge

Pris en charge

--

qwen3.5-omni-flash-2026-03-15

HTTP

Texte, audio, image, vidéo

Pris en charge

Pris en charge

--

Qwen3-Omni

Modèle

API

Entrée

Function calling

Recherche web

Mode réflexion

qwen3-omni-flash-realtime

WebSocket

Texte, audio, image, vidéo

--

--

--

qwen3-omni-flash-realtime-2025-12-01

WebSocket

Texte, audio, image, vidéo

--

--

--

qwen3-omni-flash-realtime-2025-09-15

WebSocket

Texte, audio, image, vidéo

--

--

--

qwen3-omni-flash

HTTP

Texte, audio, image, vidéo

Pris en charge

--

Pris en charge

qwen3-omni-flash-2025-12-01

HTTP

Texte, audio, image, vidéo

Pris en charge

--

Pris en charge

qwen3-omni-flash-2025-09-15

HTTP

Texte, audio, image, vidéo

Pris en charge

--

Pris en charge

Qwen3.5-Livetranslate

Modèle

API

Entrée

Langues

qwen3.5-livetranslate-flash-realtime

WebSocket

Audio

60

qwen3.5-livetranslate-flash-realtime-2026-05-19

WebSocket

Audio

60

Qwen3-Livetranslate

Modèle

API

Entrée

Langues

qwen3-livetranslate-flash-realtime

WebSocket

Audio

18

qwen3-livetranslate-flash-realtime-2025-09-22

WebSocket

Audio

18

qwen3-livetranslate-flash

HTTP

Audio, vidéo

18

qwen3-livetranslate-flash-2025-12-01

HTTP

Audio, vidéo

18

Modèles legacy

Ces modèles ne reçoivent plus de mises à jour. Pour tout nouveau projet, utilisez Qwen3.5-Omni.

Modèle

Entrée

API

qwen2.5-omni-7b

Texte, audio, image, vidéo

HTTP

qwen-omni-turbo

Texte, audio, image, vidéo

HTTP

qwen-omni-turbo-latest

Texte, audio, image, vidéo

HTTP

qwen-omni-turbo-2025-03-26

Texte, audio, image, vidéo

HTTP

qwen-omni-turbo-realtime

Texte, audio

WebSocket

qwen-omni-turbo-realtime-latest

Texte, audio

WebSocket

qwen-omni-turbo-realtime-2025-05-08

Texte, audio

WebSocket

Étapes suivantes

Documentation API par série de modèles :