Qwen3 シリーズの小規模視覚理解モデルは、シンキングモードとノンシンキングモードを効果的に統合し、高速な応答速度を維持しながら、オープンソースの Qwen3-VL-30B-A3B と比較して優れたパフォーマンスを提供します。画像/動画理解において包括的なアップグレードが施されており、長時間の動画やドキュメントなどの超ロングコンテキスト、空間認識、さまざまなドメインにわたる物体認識をサポートしています。2D/3D 視覚ローカライズ機能を搭載しており、複雑な現実世界のタスクに取り組むのに適しています。このモデルバージョンは、スナップショットモデル qwen3-vl-flash-2026-01-22 と機能的に同等です。
推論サービスプロバイダー
qwen3-vl-flash の推論サービスプロバイダーは Alibaba Cloud Model Studio です。
モデルの機能
中国 (北京)
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト 画像 ビデオ | 出力モダリティ | テキスト |
モデル体験 | サポート済み | Function Calling | サポート済み |
構造化出力 | サポート済み | Web 検索 | サポート対象外 |
プレフィックス補完 | サポート済み | コンテキストキャッシュ | サポート済み |
バッチ推論 | サポート対象外 | ファインチューニング | サポート対象外 |
シンガポール
スコープ: 国際
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト 画像 ビデオ | 出力モダリティ | テキスト |
モデル体験 | サポート済み | Function Calling | サポート対象外 |
構造化出力 | サポート済み | Web 検索 | サポート対象外 |
プレフィックス補完 | サポート済み | コンテキストキャッシュ | サポート済み |
バッチ推論 | サポート対象外 | ファインチューニング | サポート対象外 |
ドイツ (フランクフルト)
スコープ: EU、グローバル
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト 画像 ビデオ | 出力モダリティ | テキスト |
モデル体験 | サポート済み | Function Calling | サポート対象外 |
構造化出力 | サポート済み | Web 検索 | サポート対象外 |
プレフィックス補完 | サポート済み | コンテキストキャッシュ | サポート済み |
バッチ推論 | サポート対象外 | ファインチューニング | サポート対象外 |
米国 (バージニア)
スコープ: グローバル
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト 画像 動画 | 出力モダリティ | テキスト |
モデル体験 | サポート済み | Function Calling | サポート対象外 |
構造化出力 | サポート済み | Web 検索 | サポート対象外 |
プレフィックス補完 | サポート済み | コンテキストキャッシュ | サポート済み |
バッチ推論 | サポート対象外 | ファインチューニング | サポート対象外 |
コンテキスト制限
| パラメーター | 値 | パラメーター | 値 |
|---|---|---|---|
最大入力長 | 260096 | 最大出力長 | 32768 |
コンテキストウィンドウ | 262144 | 最大入力長 (シンキングモード) | 258048 |
最大出力長 (シンキングモード) | 32768 | 最大思考チェーン長 | 81920 |
料金
このページでは、モデルの API 呼び出しの通常料金のみを表示しており、期間限定のプロモーションは含まれていません。プロモーションオファーについては、Model Studio コンソールをご参照ください。
中国 (北京)
32k < 入力 <= 128k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.043 | 100万トークンあたり |
出力 | 0.43 | 100万トークンあたり |
入力 (暗黙的キャッシュ) | 0.009 | 100万トークンあたり |
入力 (バッチファイル) | 0.022 | 100万トークンあたり |
出力 (バッチファイル) | 0.215 | 100万トークンあたり |
明示的キャッシュ作成 | 0.054 | 100万トークンあたり |
明示的キャッシュ読み取り | 0.004 | 100万トークンあたり |
入力 (バッチチャット) | 0.043 | 100万トークンあたり |
出力 (バッチチャット) | 0.43 | 100万トークンあたり |
128k < 入力 <= 256k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.086 | 100万トークンあたり |
出力 | 0.859 | 100万トークンあたり |
入力 (暗黙的キャッシュ) | 0.018 | 100万トークンあたり |
入力 (バッチファイル) | 0.043 | 100万トークンあたり |
出力 (バッチファイル) | 0.43 | 100万トークンあたり |
明示的キャッシュ作成 | 0.108 | 100万トークンあたり |
明示的キャッシュ読み取り | 0.009 | 100万トークンあたり |
入力 (バッチチャット) | 0.086 | 100万トークンあたり |
出力 (バッチチャット) | 0.859 | 100万トークンあたり |
シンガポール
スコープ: 国際
32k < 入力 <= 128k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.075 | 100万トークンあたり |
出力 | 0.6 | 100万トークンあたり |
入力 (暗黙的キャッシュ) | 0.015 | 100万トークンあたり |
明示的キャッシュ作成 | 0.09375 | 100万トークンあたり |
明示的キャッシュ読み取り | 0.0075 | 100万トークンあたり |
128k < 入力 <= 256k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.12 | 100万トークンあたり |
出力 | 0.96 | 100万トークンあたり |
入力 (暗黙的キャッシュ) | 0.024 | 100万トークンあたり |
明示的キャッシュ作成 | 0.15 | 100万トークンあたり |
明示的キャッシュ読み取り | 0.012 | 100万トークンあたり |
ドイツ (フランクフルト)
スコープ: EU
32k < 入力 <= 128k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.075 | 100万トークンあたり |
出力 | 0.6 | 100万トークンあたり |
入力 (暗黙的キャッシュ) | 0.015 | 100万トークンあたり |
128k < 入力 <= 256k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.12 | 100万トークンあたり |
出力 | 0.96 | 100万トークンあたり |
入力 (暗黙的キャッシュ) | 0.024 | 100万トークンあたり |
スコープ: グローバル
32k < 入力 <= 128k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.043 | 100万トークンあたり |
出力 | 0.43 | 100万トークンあたり |
入力 (暗黙的キャッシュ) | 0.009 | 100万トークンあたり |
明示的キャッシュ作成 | 0.05375 | 100万トークンあたり |
明示的キャッシュ読み取り | 0.0043 | 100万トークンあたり |
128k < 入力 <= 256k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.086 | 100万トークンあたり |
出力 | 0.859 | 100万トークンあたり |
入力 (暗黙的キャッシュ) | 0.018 | 100万トークンあたり |
明示的キャッシュ作成 | 0.1075 | 100万トークンあたり |
明示的キャッシュ読み取り | 0.0086 | 100万トークンあたり |
米国 (バージニア)
スコープ: グローバル
32k < 入力 <= 128k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.043 | 100万トークンあたり |
出力 | 0.43 | 100万トークンあたり |
入力 (暗黙的キャッシュ) | 0.009 | 100万トークンあたり |
明示的キャッシュ作成 | 0.05375 | 100万トークンあたり |
明示的キャッシュ読み取り | 0.0043 | 100万トークンあたり |
128k < 入力 <= 256k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.086 | 100万トークンあたり |
出力 | 0.859 | 100万トークンあたり |
入力 (暗黙的キャッシュ) | 0.018 | 100万トークンあたり |
明示的キャッシュ作成 | 0.1075 | 100万トークンあたり |
明示的キャッシュ読み取り | 0.0086 | 100万トークンあたり |
レート制限
中国 (北京)
| パラメーター | 値 |
|---|---|
RPM (1分あたりのリクエスト数) | 3000 |
TPM (1分あたりのトークン数) | 5,000,000 |
シンガポール
スコープ: 国際
| パラメーター | 値 |
|---|---|
RPM (1分あたりのリクエスト数) | 1200 |
TPM (1分あたりのトークン数) | 1,000,000 |
ドイツ (フランクフルト)
スコープ: EU
| パラメーター | 値 |
|---|---|
RPM (1分あたりのリクエスト数) | 12000 |
TPM (1分あたりのトークン数) | 10,000,000 |
スコープ: グローバル
| パラメーター | 値 |
|---|---|
RPM (1分あたりのリクエスト数) | 12000 |
TPM (1分あたりのトークン数) | 10,000,000 |
米国 (バージニア)
スコープ: グローバル
| パラメーター | 値 |
|---|---|
RPM (1分あたりのリクエスト数) | 6000 |
TPM (1分あたりのトークン数) | 60,000,000 |
スナップショットバージョン
qwen3-vl-flash-2026-01-22
Qwen3 シリーズの小規模視覚理解モデルは、シンキングモードとノンシンキングモードを効果的に統合しています。2025年10月15日のスナップショットと比較して、モデルの全体的なパフォーマンスは大幅に向上しました。一般的な視覚認識と推論の能力が強化され、セキュリティ、店舗内検査、機器モニタリング、写真ベースの問題解決など、さまざまなビジネスシナリオでの認識精度が著しく向上しています。このバージョンは、2026年1月22日時点のスナップショットです。
推論サービスプロバイダー
qwen3-vl-flash-2026-01-22 の推論サービスプロバイダーは Alibaba Cloud Model Studio です。
モデルの機能
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト 画像 ビデオ | 出力モダリティ | テキスト |
モデル体験 | サポート済み | Function Calling | サポート対象外 |
構造化出力 | サポート対象外 | Web 検索 | サポート対象外 |
プレフィックス補完 | サポート対象外 | コンテキストキャッシュ | サポート対象外 |
バッチ推論 | サポート対象外 | ファインチューニング | サポート対象外 |
コンテキスト制限
| パラメーター | 値 | パラメーター | 値 |
|---|---|---|---|
最大入力長 | 258048 | 最大出力長 | 32768 |
コンテキストウィンドウ | 262144 | 最大入力長 (シンキングモード) | 258048 |
最大出力長 (シンキングモード) | 32768 | 最大思考チェーン長 | 81920 |
料金
このページでは、モデルの API 呼び出しの通常料金のみを表示しており、期間限定のプロモーションは含まれていません。プロモーションオファーについては、Model Studio コンソールをご参照ください。
中国 (北京)
32k < 入力 <= 128k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.043 | 100万トークンあたり |
出力 | 0.43 | 100万トークンあたり |
128k < 入力 <= 256k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.086 | 100万トークンあたり |
出力 | 0.859 | 100万トークンあたり |
シンガポール
スコープ: 国際
32k < 入力 <= 128k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.075 | 100万トークンあたり |
出力 | 0.6 | 100万トークンあたり |
128k < 入力 <= 256k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.12 | 100万トークンあたり |
出力 | 0.96 | 100万トークンあたり |
ドイツ (フランクフルト)
スコープ: EU
32k < 入力 <= 128k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.075 | 100万トークンあたり |
出力 | 0.6 | 100万トークンあたり |
128k < 入力 <= 256k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.12 | 100万トークンあたり |
出力 | 0.96 | 100万トークンあたり |
レート制限
中国 (北京)
| パラメーター | 値 |
|---|---|
RPM (1分あたりのリクエスト数) | 60 |
TPM (1分あたりのトークン数) | 100,000 |
シンガポール
スコープ: 国際
| パラメーター | 値 |
|---|---|
RPM (1分あたりのリクエスト数) | 60 |
TPM (1分あたりのトークン数) | 100,000 |
ドイツ (フランクフルト)
スコープ: EU
| パラメーター | 値 |
|---|---|
RPM (1分あたりのリクエスト数) | 60 |
TPM (1分あたりのトークン数) | 100,000 |
qwen3-vl-flash-2025-10-15
Qwen3 シリーズの小規模視覚理解モデルは、シンキングモードとノンシンキングモードを効果的に統合し、高速な応答速度を維持しながら、オープンソースの Qwen3-VL-30B-A3B と比較して優れたパフォーマンスを提供します。画像/動画理解において包括的なアップグレードが施されており、長時間の動画やドキュメントなどの超ロングコンテキスト、空間認識、さまざまなドメインにわたる物体認識をサポートしています。2D/3D 視覚ローカライズ機能を搭載しており、複雑な現実世界のタスクに取り組むのに適しています。このバージョンは、2025年10月15日時点のスナップショットです。
推論サービスプロバイダー
qwen3-vl-flash-2025-10-15 の推論サービスプロバイダーは Alibaba Cloud Model Studio です。
モデルの機能
中国 (北京)
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト 画像 ビデオ | 出力モダリティ | テキスト |
モデル体験 | サポート済み | Function Calling | サポート済み |
構造化出力 | サポート済み | Web 検索 | サポート対象外 |
プレフィックス補完 | サポート済み | コンテキストキャッシュ | サポート対象外 |
バッチ推論 | サポート対象外 | ファインチューニング | サポート対象外 |
シンガポール
スコープ: 国際
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト 画像 ビデオ | 出力モダリティ | テキスト |
モデル体験 | サポート済み | Function Calling | サポート対象外 |
構造化出力 | サポート済み | Web 検索 | サポート対象外 |
プレフィックス補完 | サポート済み | コンテキストキャッシュ | サポート対象外 |
バッチ推論 | サポート対象外 | ファインチューニング | サポート対象外 |
ドイツ (フランクフルト)
スコープ: EU、グローバル
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト 画像 動画 | 出力モダリティ | テキスト |
モデル体験 | サポート済み | Function Calling | サポート対象外 |
構造化出力 | サポート済み | Web 検索 | サポート対象外 |
プレフィックス補完 | サポート済み | コンテキストキャッシュ | サポート対象外 |
バッチ推論 | サポート対象外 | ファインチューニング | サポート対象外 |
米国 (バージニア)
スコープ: グローバル
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト 画像 ビデオ | 出力モダリティ | テキスト |
モデル体験 | サポート済み | Function Calling | サポート対象外 |
構造化出力 | サポート済み | Web 検索 | サポート対象外 |
プレフィックス補完 | サポート済み | コンテキストキャッシュ | サポート対象外 |
バッチ推論 | サポート対象外 | ファインチューニング | サポート対象外 |
コンテキスト制限
| パラメーター | 値 | パラメーター | 値 |
|---|---|---|---|
最大入力長 | 260096 | 最大出力長 | 32768 |
コンテキストウィンドウ | 262144 | 最大入力長 (シンキングモード) | 258048 |
最大出力長 (シンキングモード) | 32768 | 最大思考チェーン長 | 81920 |
料金
このページでは、モデルの API 呼び出しの通常料金のみを表示しており、期間限定のプロモーションは含まれていません。プロモーションオファーについては、Model Studio コンソールをご参照ください。
中国 (北京)
32k < 入力 <= 128k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.043 | 100万トークンあたり |
出力 | 0.43 | 100万トークンあたり |
128k < 入力 <= 256k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.086 | 100万トークンあたり |
出力 | 0.859 | 100万トークンあたり |
シンガポール
スコープ: 国際
32k < 入力 <= 128k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.075 | 100万トークンあたり |
出力 | 0.6 | 100万トークンあたり |
128k < 入力 <= 256k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.12 | 100万トークンあたり |
出力 | 0.96 | 100万トークンあたり |
ドイツ (フランクフルト)
スコープ: EU
32k < 入力 <= 128k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.075 | 100万トークンあたり |
出力 | 0.6 | 100万トークンあたり |
128k < 入力 <= 256k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.12 | 100万トークンあたり |
出力 | 0.96 | 100万トークンあたり |
スコープ: グローバル
32k < 入力 <= 128k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.043 | 100万トークンあたり |
出力 | 0.43 | 100万トークンあたり |
128k < 入力 <= 256k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.086 | 100万トークンあたり |
出力 | 0.859 | 100万トークンあたり |
米国 (バージニア)
スコープ: グローバル
32k < 入力 <= 128k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.043 | 100万トークンあたり |
出力 | 0.43 | 100万トークンあたり |
128k < 入力 <= 256k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.086 | 100万トークンあたり |
出力 | 0.859 | 100万トークンあたり |
レート制限
中国 (北京)
| パラメーター | 値 |
|---|---|
RPM (1分あたりのリクエスト数) | 60 |
TPM (1分あたりのトークン数) | 100,000 |
シンガポール
スコープ: 国際
| パラメーター | 値 |
|---|---|
RPM (1分あたりのリクエスト数) | 120 |
TPM (1分あたりのトークン数) | 1,000,000 |
ドイツ (フランクフルト)
スコープ: EU
| パラメーター | 値 |
|---|---|
RPM (1分あたりのリクエスト数) | 600 |
TPM (1分あたりのトークン数) | 1,000,000 |
スコープ: グローバル
| パラメーター | 値 |
|---|---|
RPM (1分あたりのリクエスト数) | 600 |
TPM (1分あたりのトークン数) | 1,000,000 |
米国 (バージニア)
スコープ: グローバル
| パラメーター | 値 |
|---|---|
RPM (1分あたりのリクエスト数) | 60 |
TPM (1分あたりのトークン数) | 100,000 |