Tous les produits
Search
Centre de documentation

Alibaba Cloud Model Studio:Visual understanding

Dernière mise à jour :Sep 07, 2026

Choisissez le modèle adapté à votre cas d'usage : analyse d'images, compréhension vidéo ou OCR.

Compréhension d'images et de vidéos

Commencez avec qwen3.7-plus, le modèle phare de la gamme Qwen. Il prend en charge une fenêtre de contexte de 1M, des vidéos allant jusqu'à 2 heures, l'appel de fonctions et des outils intégrés. Une fois votre application stabilisée, passez à qwen3.7-flash pour réduire les coûts. Ce modèle offre des performances proches du niveau phare, avec la même longueur de contexte et les mêmes fonctionnalités.

Résolution d'image

La plupart des modèles acceptent jusqu'à 16 millions de pixels par image. Des résolutions plus élevées consomment davantage de tokens. Calculez le nombre de tokens par image ainsi : h x w / (32 x 32) + 2.

Prise en charge vidéo

  • Jusqu'à 2 heures / 2 Go : qwen3.7-plus, qwen3.6-plus, qwen3.7-flash, qwen3.6-flash, qwen3.5-plus, qwen3.5-flash
  • Jusqu'à 1 heure / 2 Go : qwen3-vl-plus, qwen3-vl-flash
  • Jusqu'à 1 heure / 2 Go : qwen3.5-omni-plus, qwen3.5-omni-flash (entrée audio également prise en charge)

Appel de fonctions et outils intégrés

Le modèle peut ainsi exécuter des actions en fonction du contenu d'une image ou d'une vidéo.

  • Appel de fonctions : pris en charge par les séries Qwen3.7, Qwen3.6, Qwen3.5 et Qwen3-VL.
  • Outils intégrés (recherche web, exécution de code, sans configuration requise) : disponibles pour qwen3.7-plus, qwen3.6-plus, qwen3.7-flash, qwen3.6-flash, qwen3.5-plus et qwen3.5-flash.

Sortie structurée

Obtenez une sortie JSON valide à partir d'entrées visuelles, par exemple pour extraire les détails d'un produit depuis une photo.

Les séries Qwen3.7, Qwen3.6, Qwen3.5 et Qwen3-VL prennent en charge cette fonctionnalité en mode sans réflexion.

OCR et extraction de documents

Le modèle qwen3.5-ocr est optimisé pour l'extraction de texte à partir de documents, tableaux, copies d'examen et contenus manuscrits. Pour une extraction générale de texte sur images, utilisez plutôt qwen3.7-plus ou qwen3.7-flash.

Modèles recommandés

ID du modèle

Contexte

Pixels max/image

Durée vidéo max

Taille vidéo max

Images max

Vidéos max

Appel de fonctions

Outils intégrés

Sortie structurée

qwen3.7-plus

1M

16M

2 heures

2 Go

2048

64

Supported

Supported

Supported

qwen3.7-flash

1M

16M

2 heures

2 Go

256

64

Supported

Supported

Supported

qwen3.5-omni-plus

64k

--

1 heure

2 Go

2 048

512

Supported

--

Supported

Modèles hérités

Qwen3.7

ID du modèleEntréeSortieContexteSortie maxImages maxVidéos maxAppel de fonctionsOutils intégrésSortie structurée

qwen3.7-plus

View snapshots

qwen3.7-plus-2026-05-26

Texte, images, vidéo

Texte

1M

64k

2048

64

Supported

Supported

Supported

qwen3.7-flash

View snapshots

qwen3.7-flash-2026-07-15

Texte, images, vidéo

Texte

1M

64k

256

64

Supported

Supported

Supported

Qwen3.6

ID du modèleEntréeSortieContexteSortie maxImages maxVidéos maxAppel de fonctionsOutils intégrésSortie structurée

qwen3.6-plus

View snapshots

qwen3.6-plus-2026-04-02

Texte, images, vidéo

Texte

1M

64k

256

64

Supported

Supported

Supported

qwen3.6-flash

View snapshots

qwen3.6-flash-2026-04-16

Texte, images, vidéo

Texte

1M

64k

256

64

Supported

Supported

Supported

qwen3.6-35b-a3b

Texte, images, vidéo

Texte

256k

64k

256

64

Supported

Supported

Supported

Qwen3.5

ID du modèleEntréeSortieContexteSortie maxImages maxVidéos maxAppel de fonctionsOutils intégrésSortie structurée

qwen3.5-plus

View snapshots

qwen3.5-plus-2026-02-15

Texte, images, vidéo

Texte

1M

64k

256

64

Supported

Supported

Supported

qwen3.5-flash

View snapshots

qwen3.5-flash-2026-02-23

Texte, images, vidéo

Texte

1M

64k

256

64

Supported

Supported

Supported

qwen3.5-397b-a17b

Texte, images, vidéo

Texte

32k

8k

256

64

Supported

Supported

Supported

qwen3.5-122b-a10b

Texte, images, vidéo

Texte

32k

8k

256

64

Supported

Supported

Supported

qwen3.5-27b

Texte, images, vidéo

Texte

32k

8k

256

64

Supported

Supported

Supported

qwen3.5-35b-a3b

Texte, images, vidéo

Texte

32k

8k

256

64

Supported

Supported

Supported

Ces modèles ne sont plus recommandés. Pour vos nouveaux projets, privilégiez les séries Qwen3.6 ou Qwen3.5. Pour consulter l'ensemble des spécifications, rendez-vous sur la page Models.

China (Beijing) | Singapore | U.S. | China (Hong Kong) | Germany (Frankfurt)

Afficher la liste des modèles hérités et autres

Qwen3-VL

  • qwen3-vl-plus et ses snapshots
  • qwen3-vl-flash et ses snapshots

Qwen-Omni

  • qwen3-omni-flash et ses snapshots
  • qwen-omni-turbo et son snapshot

Qwen-OCR

  • qwen-vl-ocr et ses snapshots
  • qwen-vl-ocr-latest

QVQ

  • qvq-max
  • qvq-plus

Qwen-VL hérités

  • qwen-vl-max
  • qwen-vl-plus