Qwen3 シリーズの小規模視覚理解モデルは、シンキングモードとノンシンキングモードを効果的に統合し、高速な応答速度を維持しながら、オープンソースの Qwen3-VL-30B-A3B と比較して優れたパフォーマンスを提供します。画像/動画理解能力が全面的にアップグレードされ、長尺動画やドキュメントなどの超ロングコンテキスト、空間認識、さまざまなドメインにわたる物体認識をサポートします。2D/3D 視覚的ローカライズ機能を備え、複雑な現実世界のタスクへの対応に適しています。このモデルバージョンは、スナップショットモデル qwen3-vl-flash-2026-01-22-us と機能的に同等です。
推論サービスプロバイダー
qwen3-vl-flash-us の推論サービスプロバイダーは Alibaba Cloud Model Studio です。
モデルの機能
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト 画像 ビデオ | 出力モダリティ | テキスト |
モデル体験 | サポート済み | 関数呼び出し | 非サポート |
構造化出力 | サポート済み | ウェブ検索 | 非サポート |
プレフィックス補完 | サポート済み | コンテキストキャッシュ | サポート済み |
バッチ推論 | 非サポート | ファインチューニング | 非サポート |
コンテキスト制限
| パラメーター | 値 | パラメーター | 値 |
|---|---|---|---|
最大入力長 | 258048 | 最大出力長 | 32768 |
コンテキストウィンドウ | 262144 | 最大入力長 (シンキングモード) | 258048 |
最大出力長 (シンキングモード) | 32768 | 最大思考連鎖長 | 81920 |
料金
このページには、期間限定のプロモーションを除いた、モデル API 呼び出しの基本料金のみが表示されています。プロモーション情報については、Model Studio コンソール をご参照ください。
米国 (バージニア)
範囲:米国
32k<入力<=128k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.075 | 100万トークンあたり |
出力 | 0.6 | 100万トークンあたり |
入力 (暗黙的キャッシュ) | 0.015 | 100万トークンあたり |
明示的キャッシュ作成 | 0.09375 | 100万トークンあたり |
明示的キャッシュ読み取り | 0.0075 | 100万トークンあたり |
128k<入力<=256k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.12 | 100万トークンあたり |
出力 | 0.96 | 100万トークンあたり |
入力 (暗黙的キャッシュ) | 0.024 | 100万トークンあたり |
明示的キャッシュ作成 | 0.15 | 100万トークンあたり |
明示的キャッシュ読み取り | 0.012 | 100万トークンあたり |
レート制限
米国 (バージニア)
範囲:米国
| パラメーター | 値 |
|---|---|
RPM (1分あたりのリクエスト数) | 6000 |
TPM (1分あたりのトークン数) | 1,000,000 |
スナップショットバージョン
qwen3-vl-flash-2026-01-22-us
Qwen3 シリーズの小規模視覚理解モデルは、シンキングモードとノンシンキングモードを効果的に統合します。2025年10月15日のスナップショットと比較して、モデルの全体的なパフォーマンスが大幅に向上しました。一般的な視覚認識と推論の能力が強化され、セキュリティ、店舗内検査、機器モニタリング、写真ベースの問題解決など、さまざまなビジネスシナリオでの認識精度が著しく向上しています。このバージョンは、2026年1月22日時点のスナップショットです。
推論サービスプロバイダー
qwen3-vl-flash-2026-01-22-us の推論サービスプロバイダーは Alibaba Cloud Model Studio です。
モデルの機能
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト イメージ ビデオ | 出力モダリティ | テキスト |
モデル体験 | サポート済み | 関数呼び出し | 非サポート |
構造化出力 | 非サポート | ウェブ検索 | 非サポート |
プレフィックス補完 | 非サポート | コンテキストキャッシュ | 非サポート |
バッチ推論 | 非サポート | ファインチューニング | 非サポート |
コンテキスト制限
| パラメーター | 値 | パラメーター | 値 |
|---|---|---|---|
最大入力長 | 260096 | 最大出力長 | 32768 |
コンテキストウィンドウ | 262144 | 最大入力長 (シンキングモード) | 258048 |
最大出力長 (シンキングモード) | 32768 |
料金
このページには、期間限定のプロモーションを除いた、モデル API 呼び出しの基本料金のみが表示されています。プロモーション情報については、Model Studio コンソール をご参照ください。
米国 (バージニア)
範囲:米国
32k<入力<=128k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.075 | 100万トークンあたり |
出力 | 0.6 | 100万トークンあたり |
128k<入力<=256k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.12 | 100万トークンあたり |
出力 | 0.96 | 100万トークンあたり |
レート制限
米国 (バージニア)
範囲:米国
| パラメーター | 値 |
|---|---|
RPM (1分あたりのリクエスト数) | 60 |
TPM (1分あたりのトークン数) | 1,000,000 |
qwen3-vl-flash-2025-10-15-us
Qwen3 シリーズの小規模視覚理解モデルは、シンキングモードとノンシンキングモードを効果的に統合し、高速な応答速度を維持しながら、オープンソースの Qwen3-VL-30B-A3B と比較して優れたパフォーマンスを提供します。画像/動画理解能力が全面的にアップグレードされ、長尺動画やドキュメントなどの超ロングコンテキスト、空間認識、さまざまなドメインにわたる物体認識をサポートします。2D/3D 視覚的ローカライズ機能を備え、複雑な現実世界のタスクへの対応に適しています。このバージョンは、2025年10月15日時点のスナップショットです。
推論サービスプロバイダー
qwen3-vl-flash-2025-10-15-us の推論サービスプロバイダーは Alibaba Cloud Model Studio です。
モデルの機能
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト 画像 ビデオ | 出力モダリティ | テキスト |
モデル体験 | サポート済み | 関数呼び出し | 非サポート |
構造化出力 | サポート済み | ウェブ検索 | 非サポート |
プレフィックス補完 | サポート済み | コンテキストキャッシュ | 非サポート |
バッチ推論 | 非サポート | ファインチューニング | 非サポート |
コンテキスト制限
| パラメーター | 値 | パラメーター | 値 |
|---|---|---|---|
最大入力長 | 258048 | 最大出力長 | 32768 |
コンテキストウィンドウ | 262144 | 最大入力長 (シンキングモード) | 258048 |
最大出力長 (シンキングモード) | 32768 | 最大思考連鎖長 | 81920 |
料金
このページには、期間限定のプロモーションを除いた、モデル API 呼び出しの基本料金のみが表示されています。プロモーション情報については、Model Studio コンソール をご参照ください。
米国 (バージニア)
範囲:米国
32k<入力<=128k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.075 | 100万トークンあたり |
出力 | 0.6 | 100万トークンあたり |
128k<入力<=256k
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.12 | 100万トークンあたり |
出力 | 0.96 | 100万トークンあたり |
レート制限
米国 (バージニア)
範囲:米国
| パラメーター | 値 |
|---|---|
RPM (1分あたりのリクエスト数) | 6000 |
TPM (1分あたりのトークン数) | 1,000,000 |