Qwen3 Flash モデルは、シンキングモードとノンシンキングモードの強力な融合を提供し、会話中の動的な切り替えが可能です。複雑な推論に優れ、命令フォローとテキスト理解において大幅な向上を示します。100 万のコンテキスト長をサポートし、コンテキスト使用量に応じた段階的モデルで課金されます。このモデルバージョンは、スナップショットモデル qwen-flash-2025-07-28-us と機能的に同等です。
推論サービスプロバイダー
qwen-flash-us の推論サービスプロバイダーは Alibaba Cloud Model Studio です。
モデルの機能
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト | 出力モダリティ | テキスト |
モデル体験 | サポート | 関数呼び出し | 非サポート |
構造化出力 | サポート | ウェブ検索 | 非サポート |
プレフィックス補完 | サポート | コンテキストキャッシュ | サポート |
バッチ推論 | 非サポート | ファインチューニング | 非サポート |
コンテキスト制限
| パラメーター | 値 | パラメーター | 値 |
|---|---|---|---|
最大入力長 | 995904 | 最大出力長 | 32768 |
コンテキストウィンドウ | 1000000 |
料金
このページには、期間限定プロモーションを除いた、モデル API 呼び出しの基本料金のみが表示されています。プロモーション情報については、Model Studio コンソールをご参照ください。
米国 (バージニア)
範囲: 米国
256k < 入力 <= 1m
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.25 | 100 万トークンあたり |
出力 | 2 | 100 万トークンあたり |
入力 (暗黙的キャッシュ) | 0.05 | 100 万トークンあたり |
明示的キャッシュ作成 | 0.313 | 100 万トークンあたり |
明示的キャッシュ読み取り | 0.025 | 100 万トークンあたり |
レート制限
米国 (バージニア)
範囲: 米国
| パラメーター | 値 |
|---|---|
RPM (1 分あたりのリクエスト数) | 30000 |
TPM (1 分あたりのトークン数) | 10,000,000 |
スナップショットバージョン
qwen-flash-2025-07-28-us
Qwen3 Flash モデル (スナップショット 2025-07-28) は、シンキングモードとノンシンキングモードの強力な融合を提供し、会話中の動的な切り替えが可能です。複雑な推論に優れ、命令フォローとテキスト理解において大幅な向上を示します。100 万のコンテキスト長をサポートし、コンテキスト使用量に応じた段階的モデルで課金されます。
推論サービスプロバイダー
qwen-flash-2025-07-28-us の推論サービスプロバイダーは Alibaba Cloud Model Studio です。
モデルの機能
| 機能 | サポート | 機能 | サポート |
|---|---|---|---|
入力モダリティ | テキスト | 出力モダリティ | テキスト |
モデル体験 | サポート | 関数呼び出し | 非サポート |
構造化出力 | サポート | ウェブ検索 | 非サポート |
プレフィックス補完 | サポート | コンテキストキャッシュ | 非サポート |
バッチ推論 | 非サポート | ファインチューニング | 非サポート |
コンテキスト制限
| パラメーター | 値 | パラメーター | 値 |
|---|---|---|---|
最大入力長 | 995904 | 最大出力長 | 32768 |
コンテキストウィンドウ | 1000000 |
料金
このページには、期間限定プロモーションを除いた、モデル API 呼び出しの基本料金のみが表示されています。プロモーション情報については、Model Studio コンソールをご参照ください。
米国 (バージニア)
範囲: 米国
256k < 入力 <= 1m
| 課金項目 | 価格 (USD) | 単位 |
|---|---|---|
入力 | 0.25 | 100 万トークンあたり |
出力 | 2 | 100 万トークンあたり |
レート制限
米国 (バージニア)
範囲: 米国
| パラメーター | 値 |
|---|---|
RPM (1 分あたりのリクエスト数) | 30000 |
TPM (1 分あたりのトークン数) | 10,000,000 |