すべてのプロダクト
Search
ドキュメントセンター

Alibaba Cloud Model Studio:視覚理解

最終更新日:Sep 24, 2026

画像分析、動画理解、OCR などのユースケースに応じて、適切なモデルを選択します。

画像と動画の理解

まずは、Qwen のフラッグシップモデルである qwen3.7-plus から始めることを推奨します。このモデルは、1M のコンテキストウィンドウ、最大 2 時間の動画、関数呼び出し、および組み込みツールをサポートしています。アプリケーションが安定したら、qwen3.7-flash に切り替えることでコストを削減できます。このモデルは、同じコンテキスト長と特徴セットで、フラッグシップに近いパフォーマンスを提供します。

画像解像度

ほとんどのモデルは、画像あたり最大 1,600 万ピクセルをサポートしています。解像度が高いほど、より多くのトークンを使用します。画像あたりのトークン数は h x w / (32 x 32) + 2 で計算されます。

動画サポート

  • 最大 2 時間 / 2 GB: qwen3.7-plus、qwen3.6-plus、qwen3.7-flash、qwen3.6-flash、qwen3.5-plus、qwen3.5-flash
  • 最大 1 時間 / 2 GB: qwen3-vl-plus、qwen3-vl-flash
  • 最大 1 時間 / 2 GB: qwen3.5-omni-plus、qwen3.5-omni-flash (音声入力もサポート)

関数呼び出しと組み込みツール

モデルが画像または動画のコンテンツに基づいてアクションを実行できるようにします。

  • 関数呼び出し: Qwen3.7、Qwen3.6、Qwen3.5、および Qwen3-VL シリーズでサポートされています。
  • 組み込みツール (Web 検索、コード実行、セットアップ不要): qwen3.7-plus、qwen3.6-plus、qwen3.7-flash、qwen3.6-flash、qwen3.5-plus、および qwen3.5-flash で利用可能です。

構造化出力

写真から製品詳細を抽出するなど、視覚的な入力から有効な JSON 出力を取得します。

Qwen3.7、Qwen3.6、Qwen3.5、および Qwen3-VL シリーズのノンシンキングモードでサポートされています。

OCR とドキュメント抽出

qwen3.5-ocr は、ドキュメント、表、試験問題、手書きコンテンツからのテキスト抽出に最適化されています。画像からの一般的なテキスト抽出には、qwen3.7-plus または qwen3.7-flash を使用してください。

推奨モデル

モデル ID

コンテキスト

最大ピクセル数/画像

最大動画持続時間

最大動画サイズ

最大画像数

最大動画数

関数呼び出し

組み込みツール

構造化出力

qwen3.7-plus

1M

16M

2 時間

2 GB

2048

64

対応

対応

対応

qwen3.7-flash

1M

16M

2 時間

2 GB

256

64

対応

対応

対応

qwen3.5-omni-plus

256k

--

1 時間

2 GB

2,048

512

対応

--

JSON Object

レガシーモデル

Qwen3.7

モデル ID入力出力コンテキスト最大出力最大画像数最大動画数関数呼び出し組み込みツール構造化出力

qwen3.7-plus

スナップショットの表示

qwen3.7-plus-2026-05-26

テキスト、画像、動画

テキスト

1M

64k

2048

64

対応

対応

対応

qwen3.7-flash

スナップショットの表示

qwen3.7-flash-2026-07-15

テキスト、画像、動画

テキスト

1M

64k

256

64

対応

対応

対応

Qwen3.6

モデル ID入力出力コンテキスト最大出力最大画像数最大動画数関数呼び出し組み込みツール構造化出力

qwen3.6-plus

スナップショットの表示

qwen3.6-plus-2026-04-02

テキスト、画像、動画

テキスト

1M

64k

256

64

対応

対応

対応

qwen3.6-flash

スナップショットの表示

qwen3.6-flash-2026-04-16

テキスト、画像、動画

テキスト

1M

64k

256

64

対応

対応

対応

qwen3.6-35b-a3b

テキスト、画像、動画

テキスト

256k

64k

256

64

対応

対応

対応

Qwen3.5

モデル ID入力出力コンテキスト最大出力最大画像数最大動画数関数呼び出し組み込みツール構造化出力

qwen3.5-plus

スナップショットの表示

qwen3.5-plus-2026-02-15

テキスト、画像、動画

テキスト

1M

64k

256

64

対応

対応

対応

qwen3.5-flash

スナップショットの表示

qwen3.5-flash-2026-02-23

テキスト、画像、動画

テキスト

1M

64k

256

64

対応

対応

対応

qwen3.5-397b-a17b

テキスト、画像、動画

テキスト

32k

8k

256

64

対応

対応

対応

qwen3.5-122b-a10b

テキスト、画像、動画

テキスト

32k

8k

256

64

対応

対応

対応

qwen3.5-27b

テキスト、画像、動画

テキスト

32k

8k

256

64

対応

対応

対応

qwen3.5-35b-a3b

テキスト、画像、動画

テキスト

32k

8k

256

64

対応

対応

対応

これらのモデルは現在推奨されていません。新規プロジェクトでは、Qwen3.6 または Qwen3.5 シリーズを使用してください。モデルの完全な仕様については、「モデル」ページをご参照ください。

中国 (北京) | シンガポール | 米国 | 中国 (香港) | ドイツ (フランクフルト)

レガシーモデルおよびその他のモデルのリストを表示

Qwen3-VL

  • qwen3-vl-plus とそのスナップショット
  • qwen3-vl-flash とそのスナップショット

Qwen-Omni

  • qwen3-omni-flash とそのスナップショット
  • qwen-omni-turbo とそのスナップショット

Qwen-OCR

  • qwen-vl-ocr とそのスナップショット
  • qwen-vl-ocr-latest

QVQ

  • qvq-max
  • qvq-plus

レガシー Qwen-VL

  • qwen-vl-max
  • qwen-vl-plus